跳到主要内容
Zubnet AI学习Wiki › Whisper
模型

Whisper

别名:OpenAI Whisper
OpenAI 于 2022 年发布的开源语音识别模型。Whisper 使用在 68 万小时弱监督音频上训练的编码器-解码器 Transformer 将语音转换为文本,单个模型即可处理数十种语言的转写、翻译成英文以及语言识别。由于权重开放,且模型对口音和背景噪声有很强的鲁棒性,它很快成为自动语音识别的默认基线。

为什么重要

在 Whisper 之前,好用的语音识别基本意味着付费使用云端 API,或者接受开源替代方案平庸的准确率。Whisper 让接近人类质量的转写变得免费、可离线运行,任何有 GPU 甚至一颗不错的 CPU 的人都能用,这大规模解锁了播客索引、会议纪要、呼叫中心分析、字幕制作和无障碍工具。它还重置了整个领域的预期:如今每个新的语音模型都要拿它做基准对比。

深度解析

Whisper 把转写当作一个序列到序列问题来处理。输入音频被重采样为 16 kHz 单声道,转换成 80 通道的对数梅尔频谱图,并切成 30 秒的窗口。Transformer 的编码器半边把频谱图处理成潜在表示,然后解码器以此为条件,以自回归方式生成文本 token。特殊的控制 token 告诉解码器该做什么:音频是哪种语言、是转写还是翻译成英文、是否输出时间戳。这种编码器-解码器设计意味着一个模型就覆盖了以前需要多个独立系统的若干任务,包括作为预测语言 token 副产品的语言检测

弱监督的赌注

Whisper 背后最重要的决策是训练数据策略。早期的语音识别模型在 LibriSpeech 这类规模小、精心标注的语料库上训练,在干净的朗读语音上准确率很高,但在真实世界中表现脆弱。OpenAI 走了相反的方向:收集了 68 万小时音频,配上互联网上已有的转写文本,然后用自动化过滤剔除低质量和机器生成的转写。大约三分之一的数据是非英语的,约 12.5 万小时用于支持到英语的机器翻译

用标注质量换规模被证明是正确的选择。因为模型见过各种各样的说话人、麦克风、房间和话题,它处理口音、背景噪声和专业词汇的能力远好于在精心制作的录音棚音频上训练的模型。它还能零样本工作:对大多数语言和领域不需要微调步骤,直接指向音频即可。代价是,Whisper 在干净语音上的英文准确率只是有竞争力而非无可匹敌——它真正的优势在于覆盖杂乱长尾场景的鲁棒性。

模型尺寸与本地运行

Whisper 不是单个模型,而是一个家族:tiny(3900 万参数)、base(7400 万)、small(2.44 亿)、medium(7.69 亿)和 large(约 15.5 亿),OpenAI 后来又发布了改进的 large-v2 和 large-v3 检查点。准确率和算力成本一起攀升,所以实用技巧是让尺寸匹配负载——质量优先的存档级转写用 large 模型,延迟优先的实时字幕用 tiny 或 base 模型。权重以宽松许可证发布,这正是 Whisper 成为开放权重标准、而不只是又一个 API 的原因。

围绕在数据中心之外运行这些权重,长出了一整个生态。Whisper.cpp 把模型移植到纯 C/C++,使其在笔记本甚至手机上都能以可用速度运行;faster-whisper 则为 GPU 推理应用优化运行时,量化则把较大的模型压缩到几 GB 内存就能装下。本地运行不只是为了省钱:不离开机器的音频绕开了隐私顾虑和按分钟计费,这就是 Whisper 成为众多自托管工具默认转写层的原因。

它不会告诉你是谁在说

一个常见的误解是 Whisper 开箱就能产出可直接用的会议记录。事实并非如此。Whisper 转写文字和时间戳,但它没有说话人概念——分清谁说了什么是说话人分离,那是一个独立问题,需要把 Whisper 与说话人分离模型或融合两者的管道工具配对使用。指望原始 Whisper 输出自带说话人标签是一个范畴错误,许多第一次用的人都栽在这上面。

第二个陷阱是 Whisper 会以一种明显带语音特色的方式产生幻觉:在静音、音乐或严重劣化的音频上,它有时会编造出从未有人说过的、流畅而貌似合理的句子。这在医疗、法律或新闻转写中是危险的,因为一句自信的错误句子比没有句子更糟。实用的缓解方法包括:转写前过滤低能量片段、降低解码温度,以及把输出中重复或脱离语境的行当作危险信号而非事实依据。

万物以它为基准

Whisper 最深远的影响是位置性的:它成了整个领域的参照点。商业 API 和开源模型都针对 Whisper 检查点报告词错误率,一个不能在标准基准上明显击败 large-v3 的新语音模型很难获得关注。颇具讽刺的是,这种主导地位也让 Whisper 成了人们围绕其优化的对象——许多较新的系统把 Whisper 保留为自家模型处理不好的语言或条件下的后备方案。

它更广泛的遗产是方法论层面的。Whisper 证明了大规模弱监督预训练可以迁移到音频,正如它曾迁移到文本一样:给 Transformer 喂足够多的含噪真实世界配对数据,无需针对特定任务的工程设计,鲁棒性就会涌现。这一经验直接汇入了现代语音 AI 浪潮——从实时语音到语音智能体,再到把音频当作一等输入的多模态模型。即使更新的架构不断出现,Whisper 仍是大多数开发者首先伸手去拿的模型——也是其他一切被拿来比较的对象。

← 所有术语
ESC