← Todas las recetasReceta · 11 de septiembre de 2025

Transcribe cualquier audio gratis con Whisper (sin enviar nada a la nube)

Reuniones, clases, podcast... de MP3 a texto perfectamente puntuado en tu propia máquina. Ni una palabra sale de tu disco.

Dificultadfácil
Tiempo15 min
IngredientesWhisper · Python

Whisper de OpenAI es de las mejores cosas que ha regalado la industria: un modelo de transcripción de estado del arte, abierto y que corre en local. Tu privado es tu privado.

Ingredientes

  • Python 3.10+
  • El audio que quieras transcribir (MP3, M4A, WAV…)
  • Opcional: GPU (va 10-20x más rápido, pero sin ella también funciona)

Pasos

  1. Instala (recomendamos la versión rápida faster-whisper):

    pip install faster-whisper
  2. Transcribe con este mini-script:

    from faster_whisper import WhisperModel
    
    model = WhisperModel("medium", device="cpu", compute_type="int8")
    segments, info = model.transcribe("mi-reunion.mp3", language="es")
    
    print(f"Idioma detectado: {info.language}")
    with open("mi-reunion.txt", "w", encoding="utf-8") as f:
        for seg in segments:
            linea = f"[{int(seg.start//60)}:{int(seg.start%60):02d}] {seg.text}"
            print(linea)
            f.write(linea + "\n")
  3. Elige bien el tamaño del modelo:

    Modelo VRAM/RAM Calidad en español
    tiny ~1GB Meh
    base ~1GB Aceptable
    small ~2GB Buena
    medium ~5GB Muy buena ✓
    large-v3 ~10GB Excelente
  4. Con GPU (si tienes): cambia a device="cuda", compute_type="float16" y vuela.

Resultado esperado

Un .txt con timestamps por frase. Con medium en CPU: ~10 min de audio procesados en ~5 min. Con GPU: segundos.

Trucos

  • language="es" evita la detección automática (más rápido y menos errores).
  • word_timestamps=True te da el tiempo por palabra (para subtítulos).
  • Guiones largos: córtalos con ffmpeg en trozos de 10 min si se atasca.
  • Nosotros usamos esto para las actas del podcast: audio → Whisper → Claude en local → acta. (Receta completa del pipeline en camino.)