Transcribe cualquier audio gratis con Whisper (sin enviar nada a la nube)
Reuniones, clases, podcast... de MP3 a texto perfectamente puntuado en tu propia máquina. Ni una palabra sale de tu disco.

Dificultadfácil
Tiempo15 min
IngredientesWhisper · Python
Whisper de OpenAI es de las mejores cosas que ha regalado la industria: un modelo de transcripción de estado del arte, abierto y que corre en local. Tu privado es tu privado.
Ingredientes
- Python 3.10+
- El audio que quieras transcribir (MP3, M4A, WAV…)
- Opcional: GPU (va 10-20x más rápido, pero sin ella también funciona)
Pasos
-
Instala (recomendamos la versión rápida
faster-whisper):pip install faster-whisper -
Transcribe con este mini-script:
from faster_whisper import WhisperModel model = WhisperModel("medium", device="cpu", compute_type="int8") segments, info = model.transcribe("mi-reunion.mp3", language="es") print(f"Idioma detectado: {info.language}") with open("mi-reunion.txt", "w", encoding="utf-8") as f: for seg in segments: linea = f"[{int(seg.start//60)}:{int(seg.start%60):02d}] {seg.text}" print(linea) f.write(linea + "\n") -
Elige bien el tamaño del modelo:
Modelo VRAM/RAM Calidad en español tiny~1GB Meh base~1GB Aceptable small~2GB Buena medium~5GB Muy buena ✓ large-v3~10GB Excelente -
Con GPU (si tienes): cambia a
device="cuda", compute_type="float16"y vuela.
Resultado esperado
Un .txt con timestamps por frase. Con medium en CPU: ~10 min de audio procesados en
~5 min. Con GPU: segundos.
Trucos
language="es"evita la detección automática (más rápido y menos errores).word_timestamps=Truete da el tiempo por palabra (para subtítulos).- Guiones largos: córtalos con
ffmpegen trozos de 10 min si se atasca. - Nosotros usamos esto para las actas del podcast: audio → Whisper → Claude en local → acta. (Receta completa del pipeline en camino.)