Saltar al contenido principal
Zubnet AIAprenderWiki › Whisper
Modelos

Whisper

También conocido como: OpenAI Whisper
Un modelo de reconocimiento de voz de código abierto publicado por OpenAI en 2022. Whisper convierte audio hablado en texto mediante un transformer encoder-decoder entrenado con 680.000 horas de audio con supervisión débil, y un único modelo maneja transcripción, traducción al inglés e identificación de idiomas para decenas de lenguas. Como los pesos son abiertos y el modelo resiste bien los acentos y el ruido de fondo, rápidamente se convirtió en el baseline predeterminado para el reconocimiento automático de voz.

Por qué importa

Antes de Whisper, un buen reconocimiento de voz implicaba principalmente pagar una API en la nube o aceptar la precisión mediocre de las alternativas de código abierto. Whisper hizo que la transcripción de calidad casi humana fuera gratuita, funcionara sin conexión y estuviera disponible para cualquiera con una GPU o incluso una CPU decente, lo cual habilitó a escala la indexación de podcasts, las notas de reuniones, el análisis de centros de atención telefónica, el subtitulado y las herramientas de accesibilidad. También redefinió las expectativas de todo el campo: ahora cada nuevo modelo de voz se compara en benchmarks con Whisper.

En profundidad

Whisper trata la transcripción como un problema de secuencia a secuencia. El audio entrante se remuestrea a 16 kHz mono, se convierte en un espectrograma log-Mel de 80 canales y se divide en ventanas de 30 segundos. La mitad encoder del Transformer procesa el espectrograma para obtener una representación latente y luego el decoder genera tokens de texto mediante un proceso Autoregresivo, condicionado por esa representación. Tokens de control especiales indican al decoder qué hacer: en qué idioma está el audio, si debe transcribirlo o traducirlo al inglés y si debe emitir marcas de tiempo. Ese diseño Encoder-Decoder permite que un modelo cubra varias tareas que antes requerían sistemas separados, incluida la Detección de Idioma como consecuencia secundaria de predecir el token de idioma.

La apuesta por la supervisión débil

La decisión más importante detrás de Whisper fue la estrategia de datos de entrenamiento. Los modelos anteriores de Reconocimiento de voz se entrenaban con corpus pequeños y cuidadosamente etiquetados como LibriSpeech, lo que producía gran precisión sobre habla leída y limpia, pero un rendimiento frágil en el mundo real. OpenAI tomó el camino opuesto: reunió 680.000 horas de audio emparejado con transcripciones ya presentes en internet y luego aplicó filtrado automatizado para eliminar las transcripciones de baja calidad y generadas por máquinas. Aproximadamente un tercio de los datos estaba en idiomas distintos del inglés, y unas 125.000 horas servían para la Traducción Automática al inglés.

Intercambiar calidad de las etiquetas por escala resultó ser la decisión correcta. Como el modelo conoció una variedad tan amplia de hablantes, micrófonos, salas y temas, maneja los acentos, el ruido de fondo y el vocabulario técnico mucho mejor que los modelos entrenados con audio de estudio curado. También funciona zero-shot: para la mayoría de los idiomas y dominios no hay un paso de ajuste fino, simplemente se le entrega audio. La contrapartida es que la precisión de Whisper en inglés sobre habla limpia es meramente competitiva en vez de intocable — su verdadera ventaja es la robustez a lo largo de la desordenada cola larga.

Tamaños de modelo y ejecución local

Whisper no es un único modelo sino una familia: tiny (39 millones de parámetros), base (74 millones), small (244 millones), medium (769 millones) y large (unos 1.550 millones), y más tarde OpenAI publicó los checkpoints refinados large-v2 y large-v3. La precisión y el costo de cómputo aumentan juntos, por lo que la habilidad práctica consiste en adecuar el tamaño a la carga de trabajo — un modelo large para transcripción de archivos donde importa la calidad, uno tiny o base para subtitulado en vivo donde domina la Latencia. Los pesos se publican bajo una licencia permisiva, lo que convirtió a Whisper en un estándar de Pesos abiertos y no en una API más.

Todo un ecosistema creció alrededor de la ejecución de esos pesos fuera de los centros de datos. Whisper.cpp porta el modelo a C/C++ puro para que se ejecute a una velocidad útil en laptops e incluso teléfonos, mientras que faster-whisper aplica runtimes optimizados para la Inferencia en GPU y la Cuantización reduce los modelos mayores lo suficiente para que quepan en unos pocos gigabytes de memoria. La ejecución local no es solo una jugada de costos: si el audio nunca sale de la máquina, se evitan las preocupaciones de privacidad y los precios por minuto, razón por la que Whisper se convirtió en la capa de transcripción predeterminada de tantas herramientas autoalojadas.

No te dirá quién habló

Una idea equivocada común es que Whisper produce por sí solo transcripciones listas para una reunión. No es así. Whisper transcribe palabras y marcas de tiempo, pero no tiene noción alguna de los hablantes — averiguar quién dijo qué es la Diarización de Hablantes, un problema distinto que exige emparejar Whisper con un modelo de diarización o una herramienta de pipeline que fusione ambos. Esperar etiquetas de hablantes en la salida de Whisper en bruto es un error de categoría que hace tropezar a muchos usuarios primerizos.

La segunda trampa es que Whisper puede incurrir en Alucinación de una forma distintivamente propia del habla: ante silencio, música o audio muy degradado, a veces inventa frases fluidas y plausibles que nadie dijo. Esto es peligroso en la transcripción médica, jurídica o periodística, donde una oración incorrecta pero segura de sí misma es peor que ninguna oración. Entre las mitigaciones prácticas están filtrar los segmentos de baja energía antes de transcribir, bajar la temperatura de decodificación y tratar las líneas repetidas o fuera de contexto en la salida como una señal de alerta, no como la verdad fundamental.

El baseline contra el que se mide todo

El impacto más profundo de Whisper es posicional: se convirtió en el punto de referencia de todo el campo. Tanto las API comerciales como los modelos abiertos informan la tasa de error por palabra frente a los checkpoints de Whisper, y un nuevo modelo de voz que no logra superar claramente a large-v3 en benchmarks estándar tiene dificultades para atraer atención. Irónicamente, ese dominio también hizo de Whisper aquello alrededor de lo que se optimiza — muchos sistemas nuevos lo mantienen como respaldo para idiomas o condiciones que su propio modelo maneja mal.

Su legado más amplio es metodológico. Whisper demostró que el preentrenamiento con supervisión débil a escala se transfiere al audio igual que al texto: dale a un transformer suficientes pares ruidosos del mundo real y emergerá la robustez sin ingeniería específica para cada tarea. Esa lección alimentó directamente la ola moderna de IA de voz, desde agentes de voz a voz en tiempo real hasta modelos Multimodal que tratan el audio como una entrada de primera clase. Incluso a medida que llegan arquitecturas más nuevas, Whisper sigue siendo el modelo al que la mayoría de los desarrolladores recurre primero — y aquel con el que se compara todo lo demás.

← Todos los términos
ESC