跳到主要內容
Zubnet AI學習Wiki › Whisper
模型

Whisper

別名:OpenAI Whisper
OpenAI 於 2022 年發佈的開放原始碼語音辨識模型。Whisper 使用以 68 萬小時弱監督音訊訓練的編碼器-解碼器 Transformer,將語音轉換成文字;單一模型即可處理數十種語言的轉錄、翻譯成英文與語言辨識。由於其權重開放,且模型能穩健處理口音與背景雜訊,它很快就成為自動語音辨識的預設基準。

為什麼重要

在 Whisper 之前,好用的語音辨識通常意味著付費使用雲端 API,或是接受開放原始碼替代方案平庸的準確率。Whisper 讓接近人類品質的轉錄變得免費、可離線執行,任何擁有 GPU、甚至只要有一顆效能不錯的 CPU 的人都能使用,因而大規模開啟 Podcast 索引、會議記錄、客服中心分析、字幕製作與無障礙工具等用途。它也重新設定了整個領域的預期:如今每個新的語音模型,都得拿它作為比較基準。

深度解析

Whisper 將轉錄視為序列到序列問題。輸入音訊會被重新取樣為 16 kHz 單聲道,轉換成 80 通道的對數梅爾頻譜圖,再切成 30 秒的視窗。Transformer 的編碼器部分會將頻譜圖處理成潛在表示,接著解碼器以該表示為條件,以Autoregressive(自回歸)方式生成文字 token。特殊控制 token 會告訴解碼器該執行什麼任務:音訊使用哪種語言、要轉錄還是翻譯成英文,以及是否輸出時間戳記。這種Encoder-Decoder(編碼器-解碼器)設計,代表一個模型就能涵蓋過去需要多套獨立系統才能完成的數項任務,包括在預測語言 token 時順帶完成語言偵測

對弱監督的押注

Whisper 背後最重要的決策,是其訓練資料策略。早期的語音辨識模型以 LibriSpeech 這類規模小、標註精細的語料庫訓練,在乾淨的朗讀語音上準確率很高,面對真實世界時卻十分脆弱。OpenAI 反其道而行:它收集 68 萬小時的音訊,搭配網際網路上既有的逐字稿,再以自動化篩選移除低品質與機器生成的逐字稿。約三分之一的資料不是英文,另有約 12.5 萬小時的資料支援翻譯成英文的Machine Translation任務。

事實證明,以標註品質換取規模是正確選擇。由於模型接觸過種類繁多的說話者、麥克風、空間與主題,它處理口音、背景雜訊和專業詞彙的能力,遠優於以精心製作的錄音室音訊訓練而成的模型。它還能進行零樣本作業:對大多數語言與領域而言,無須微調,只要直接提供音訊即可。相對的代價是,Whisper 在乾淨語音上的英文準確率只是具有競爭力,並非無可匹敵——它真正的優勢,在於面對混亂長尾情境時的穩健性。

模型規模與本機執行

Whisper 並非單一模型,而是一個家族:tiny(3,900 萬個參數)、base(7,400 萬個)、small(2.44 億個)、medium(7.69 億個)與 large(約 15.5 億個),OpenAI 後來又發佈改良的 large-v2 和 large-v3 檢查點。準確率與運算成本會同步提高,因此實用技巧是讓模型規模配合工作負載——重視品質的典藏級轉錄使用 large 模型,以延遲為優先的即時字幕則使用 tiny 或 base 模型。權重依寬鬆的授權條款發佈,這正是 Whisper 能成為開放權重標準,而不只是另一個 API 的原因。

一整套生態系,圍繞著如何在資料中心以外執行這些權重而成形。Whisper.cpp 將模型移植至純 C/C++,使其能在筆記型電腦甚至手機上以實用速度執行;faster-whisper 則採用針對 GPU 推論最佳化的執行環境,而量化可將較大的模型壓縮到只需數 GB 記憶體就能容納。本機執行不只是為了節省成本:音訊不離開機器,便能避開隱私疑慮與按分鐘計費,這也是 Whisper 成為許多自行託管工具之預設轉錄層的原因。

它不會告訴你誰在說話

常見誤解之一,是以為 Whisper 開箱即可產出能直接使用的會議記錄。事實並非如此。Whisper 會轉錄文字並提供時間戳記,但它沒有說話者概念——辨別誰說了什麼屬於說話者分離,那是另一項問題,必須將 Whisper 搭配說話者分離模型,或使用融合兩者的管線工具。期待原始 Whisper 輸出自帶說話者標籤,是分類上的錯誤,許多初次使用者都會在這裡踩雷。

第二個陷阱是,Whisper 會以一種明顯帶有語音特色的方式產生幻覺:遇到靜音、音樂或嚴重劣化的音訊時,它有時會捏造出流暢、聽來合理,實際上從未有人說過的句子。這在醫療、法律或新聞轉錄中相當危險,因為一句語氣篤定的錯誤句子,比沒有句子更糟。實用的緩解方式包括:在轉錄前濾除低能量片段、降低解碼溫度,以及將輸出中重複或脫離語境的行列視為警訊,而非事實依據。

一切都以它為基準

Whisper 最深遠的影響,在於它所占據的位置:它已成為整個領域的參照點。商用 API 與開放模型都會以 Whisper 檢查點為比較對象,報告詞錯誤率;若一個新語音模型無法在標準基準測試上明顯擊敗 large-v3,便很難獲得關注。頗具諷刺意味的是,這種主導地位也使 Whisper 成為其他人繞著最佳化的對象——許多較新的系統仍將 Whisper 保留為備援方案,用來處理自家模型不擅長的語言或條件。

它更廣泛的遺產在於方法論。Whisper 證明,大規模弱監督預訓練可以遷移至音訊,就像先前已遷移至文字一樣:只要餵給 Transformer 足夠多含有雜訊的真實世界配對資料,無須為特定任務額外設計工程方案,穩健性便會湧現。這項經驗直接匯入現代語音 AI浪潮——從即時語音對語音代理,到把音訊視為一級輸入的多模態模型。即使新架構持續出現,Whisper 仍是大多數開發者第一個選用的模型——也是其他所有模型的比較對象。

← 所有術語
ESC