मुख्य सामग्री पर जाएँ
Zubnet AIसीखेंWiki › Whisper
मॉडल

Whisper

इसे भी कहा जाता है: OpenAI Whisper
OpenAI द्वारा 2022 में जारी open-source speech recognition model। Whisper, weakly supervised audio के 680,000 घंटों पर train किए encoder-decoder Transformer से बोली गई audio को text में बदलता है, और एक ही मॉडल में दर्जनों भाषाओं के transcription, English में translation तथा language identification को संभालता है। Weights खुले होने और accents व background noise के प्रति model के robust होने के कारण यह जल्द automatic speech recognition का default baseline बन गया।

यह क्यों मायने रखता है

Whisper से पहले अच्छी speech recognition का अर्थ आम तौर पर cloud API के लिए भुगतान करना या open-source alternatives की औसत accuracy स्वीकार करना था। Whisper ने लगभग मानव-स्तरीय transcription को मुफ़्त, offline और GPU या अच्छी CPU वाले हर व्यक्ति के लिए उपलब्ध बनाया, जिससे podcast indexing, meeting notes, call-center analytics, subtitling तथा accessibility tooling बड़े scale पर संभव हुए। इसने पूरे क्षेत्र की अपेक्षाएँ भी बदल दीं: हर नए speech model को अब इसी के विरुद्ध benchmark किया जाता है।

गहन अध्ययन

Whisper transcription को sequence-to-sequence problem मानता है। Incoming audio को 16 kHz mono पर resample करके 80-channel log-Mel spectrogram में बदला जाता है और 30-second windows में बाँटा जाता है। Transformer का encoder आधा spectrogram को latent representation में process करता है, और फिर decoder उस representation की condition पर text tokens ऑटोरिग्रेसिव ढंग से generate करता है। Special control tokens decoder को बताते हैं कि क्या करना है: audio किस भाषा में है, transcribe करना है या English में translate, और timestamps निकालने हैं या नहीं। इस एनकोडर-डिकोडर design का अर्थ है कि एक मॉडल कई ऐसे tasks संभालता है जिनके लिए पहले अलग systems चाहिए थे, जिसमें language token की prediction के byproduct के रूप में Language Detection भी शामिल है।

Weak supervision का दाँव

Whisper के पीछे सबसे महत्वपूर्ण निर्णय training data strategy था। पुराने वाक् पहचान (Speech Recognition) models LibriSpeech जैसे छोटे, सावधानी से labeled corpora पर train होते थे, जिससे साफ़ पढ़ी गई speech पर ऊँची accuracy लेकिन वास्तविक दुनिया में नाज़ुक performance मिलता था। OpenAI उलटी दिशा में गया: उसने internet पर पहले से मौजूद transcripts के साथ 680,000 घंटे का audio जुटाया, फिर low-quality और machine-generated transcripts हटाने के लिए automated filtering लगाई। Data का लगभग एक-तिहाई हिस्सा non-English था, और करीब 125,000 घंटे English में Machine Translation को support करते थे।

Label quality के बदले scale चुनना सही दाँव साबित हुआ। Model ने speakers, microphones, rooms और topics की इतनी व्यापक variety देखी कि वह curated studio audio पर train models की तुलना में accents, background noise और technical vocabulary कहीं बेहतर संभालता है। यह zero-shot भी काम करता है: अधिकतर languages और domains में fine-tuning step नहीं होता, आप बस उसे audio देते हैं। समझौता यह है कि साफ़ speech पर Whisper की English accuracy केवल प्रतिस्पर्धी है, अजेय नहीं — उसकी वास्तविक बढ़त बिखरी हुई लंबी tail में robustness है।

Model sizes और local execution

Whisper एक मॉडल नहीं बल्कि family है: tiny (39 मिलियन पैरामीटर), base (74 मिलियन), small (244 मिलियन), medium (769 मिलियन) और large (लगभग 1.55 अरब), जिसके बाद OpenAI ने सुधारे हुए large-v2 तथा large-v3 checkpoints भी जारी किए। Accuracy और compute cost साथ बढ़ते हैं, इसलिए व्यावहारिक skill size को workload से मिलाना है — quality महत्वपूर्ण हो तो archival transcription के लिए large model, और जहाँ लेटेंसी हावी हो वहाँ live captioning के लिए tiny या base। Weights permissive license के तहत जारी हैं, और इसी ने Whisper को केवल एक और API के बजाय ओपन वेट्स standard बनाया।

इन weights को data centers के बाहर चलाने के लिए पूरा ecosystem विकसित हुआ। Whisper.cpp मॉडल को plain C/C++ में port करता है ताकि वह laptops और phones पर भी उपयोगी गति से चले, faster-whisper GPU इन्फ़ेरेंस के लिए optimized runtimes लगाता है, और क्वांटाइज़ेशन बड़े models को कुछ gigabytes memory में fit होने लायक छोटा करता है। Local execution केवल cost का खेल नहीं है: जो audio machine से बाहर नहीं जाता वह privacy की चिंता और प्रति-minute pricing दोनों से बचता है, इसीलिए Whisper इतने self-hosted tools में default transcription layer बन गया।

यह नहीं बताएगा कि कौन बोला

एक आम गलतफ़हमी है कि Whisper सीधे meeting-ready transcripts देता है। ऐसा नहीं है। Whisper words और timestamps transcribe करता है, लेकिन उसे speakers की अवधारणा नहीं है — किसने क्या कहा यह पता लगाना Speaker Diarization है, एक अलग problem जिसके लिए Whisper को diarization model या दोनों को मिलाने वाले pipeline tool के साथ जोड़ना पड़ता है। Raw Whisper output से speaker labels की उम्मीद करना category error है जिसमें बहुत-से पहली बार इस्तेमाल करने वाले users फँसते हैं।

दूसरा जाल यह है कि Whisper speech से जुड़े एक ख़ास ढंग से हैलूसिनेशन कर सकता है: silence, music या बहुत खराब audio पर वह कभी-कभी ऐसी धाराप्रवाह और विश्वसनीय लगती phrases गढ़ देता है जो कही ही नहीं गई थीं। Medical, legal या journalistic transcription में यह ख़तरनाक है, जहाँ आत्मविश्वास से कही गलत sentence, कोई sentence न होने से बदतर है। व्यावहारिक बचाव में transcription से पहले low-energy segments filter करना, decoding temperature घटाना, और output में दोहराई गई या context से बाहर lines को ground truth के बजाय red flag मानना शामिल है।

वह baseline जिससे सब मापा जाता है

Whisper का सबसे गहरा प्रभाव उसकी position है: वह पूरे क्षेत्र का reference point बन गया। Commercial APIs और open models दोनों Whisper checkpoints के सामने word error rate बताते हैं, और कोई नया speech model जो standard benchmarks पर large-v3 को साफ़ तौर पर नहीं हरा पाता, attention पाने के लिए संघर्ष करता है। विडंबना यह है कि इसी dominance ने Whisper को वह चीज़ भी बनाया जिसके आसपास लोग optimize करते हैं — कई नए systems उन languages या conditions के fallback के रूप में Whisper रखते हैं जिन्हें उनका अपना model खराब संभालता है।

इसकी व्यापक विरासत methodological है। Whisper ने दिखाया कि scale पर weakly supervised pre-training audio में भी उसी तरह transfer होती है जैसे text में: Transformer को पर्याप्त noisy real-world pairs दें और task-specific engineering के बिना robustness उभरती है। यह सीख वॉयस AI की आधुनिक wave में सीधे पहुँची, real-time speech-to-speech agents से लेकर audio को first-class input मानने वाले मल्टीमॉडल models तक। नए architectures आने के बाद भी Whisper वह मॉडल है जिसे अधिकतर developers पहले चुनते हैं — और जिससे बाकी सबकी तुलना होती है।

← सभी शब्द
ESC