Nuestro setup de grabación (y cómo la IA lo mejora cada semana)
Del micrófono al MP3: el hardware y software de grabación de En Local, con los trucos de audio que hemos aprendido y lo que la IA aporta al proceso.

Nos preguntáis por el “cómo se hace” del podcast. Aquí va el entre bastidores completo, con lo que la IA aporta a cada paso.
El hardware (modesto y funcional)
- 2 micrófonos dinámicos (los dinámicos perdonan habitaciones sin tratar, los de condensador no)
- 2 auriculares cerrados (para monitorear sin bleeding)
- Interfaz de audio USB de 2 entradas
- Un portátil para grabar (la spark graba copia de seguridad por si acaso)
- La habitación: alfombra, estanterías con libros y pánico a las paredes lisas. Acústica casera que funciona.
El software de grabación
Reaper como DAW: ligero, barato, y perfecto para podcasts (los “tracks” separados por hablante son claves para nuestra pipeline de transcripción).
Nuestro setup de sesión:
- Grabación local a 48kHz/24bit, una pista por micrófono
- Copia de seguridad automática de audio a la spark durante la sesión (por si el disco del portátil decide morir a mitad de episodio)
- Marcadores de errores en directo (una palmada: luego se localizan con el waveform)
La IA en cada paso
Antes de grabar
- Guion y estructura: nuestro LLM local revisa el guion y señala: “esto se entiende solo si has leído el post” / “este chiste necesita contexto”. Editor infatigable.
- Investigación: RAG sobre las noticias de la semana con nuestro pipeline de resúmenes.
Durante
- Nada. La IA no toca la grabación en directo (aún). La naturalidad es el activo.
Después
- Transcripción: Whisper large-v3, 6 minutos por hora de audio
- Limpieza de audio: RX Elements (no es IA generativa, es reparación: quita zumbidos y golpes)
- Show notes, capítulos y títulos: LLM local con nuestro prompt de pipeline
- Clips para redes: detección de “frases potentes” por el LLM + cortes con ffmpeg (automatizado, revisado por humanos)
Lo que NO hacemos (y por qué)
- No usamos clonación de voz: nuestros errores son nuestros. La voz natural, con sus muletillas, es parte del encanto (eso decimos; la verdad es que nos da pereza).
- No reescribimos con IA lo que hablamos: la transcripción es literal. Editamos nosotros.
- No automatizamos la edición de audio (todavía): la diferencia entre “bien” y “cansado de escuchar” está en los cortes, y eso aún lo hace mejor un humano con oído.
El coste total
- Hardware: lo que teníamos (si empiezas de cero: ~300€ para dos personas)
- Software: Reaper (60€ una vez) + RX Elements (~50€ en oferta)
- IA: 0€ (todo corre en las sparks)
- Tiempo por episodio: ~4 horas de producción total, de las cuales la IA se come 2
¿Preguntas sobre el setup? Escríbenos y hacemos post de detalle sobre lo que toque.