मुख्य सामग्री पर जाएँ
Zubnet AIसीखेंWiki › AlphaGo
मॉडल

AlphaGo

इसे भी कहा जाता है: AlphaZero, AlphaGo Zero
Google DeepMind का बनाया Go खेलने वाला AI system, जो मार्च 2016 में Seoul में हुए पाँच-game match में 9-dan champion Lee Sedol को 4–1 से हराकर किसी शीर्ष human professional को Go में पराजित करने वाला पहला computer program बना। AlphaGo ने deep neural networks को Monte Carlo tree search और self-play के ज़रिए reinforcement learning के साथ जोड़ा, और उस game को साध लिया जो दशकों से brute-force AI approaches की पहुँच से बाहर था।

यह क्यों मायने रखता है

Lee Sedol match वह क्षण था जब AI mainstream हुआ: करोड़ों लोगों ने इसे देखा और इसने researchers, governments तथा investors को विश्वास दिलाया कि machine learning केवल pattern matching ही नहीं, बल्कि intuition और long-term planning माँगने वाली problems में भी महारत पा सकती है। AlphaGo ने जिन techniques को प्रमाणित किया — search को दिशा देने वाले neural networks, self-play से self-improvement और future reward का अनुमान — वे आज reasoning models तथा RLHF से लेकर drug discovery तक हर जगह दिखाई देती हैं। यह अब भी इस बात का सबसे जाना-पहचाना प्रमाण है कि learned systems ऐसे domain में human experts से आगे निकल सकते हैं जिसे कभी दशकों दूर माना जाता था।

गहन अध्ययन

Go भ्रामक रूप से सरल है: दो खिलाड़ी 19-by-19 grid पर बारी-बारी से काले और सफ़ेद पत्थर रखते हैं और territory घेरने की कोशिश करते हैं। लेकिन game में लगभग 10^170 संभावित board configurations हैं — observable universe में atoms की संख्या से भी अधिक — इसलिए exhaustive search बेकार है। जब IBM के Deep Blue ने 1997 में Garry Kasparov को chess में हराया, तो उसने मुख्यतः brute-force calculation से ऐसा किया था और प्रति second लगभग 20 करोड़ positions evaluate की थीं। Experts को उम्मीद थी कि Go एक दशक या उससे अधिक समय तक बचा रहेगा, क्योंकि मज़बूत खेल के लिए human intuition जैसी किसी चीज़ की ज़रूरत लगती थी: pattern recognition, कौन-सी positions promising हैं इसका judgment और long-term influence की समझ। AlphaGo की breakthrough यह थी कि उसने deep convolutional networks से data के आधार पर यह intuition सीखी, फिर निर्णायक बनने लायक guided search के साथ इसे जोड़ा।

दो Networks और एक Search Tree

AlphaGo architecture के तीन moving parts हैं। एक policy network, यानी deep CNN, board position लेकर promising अगली moves पर probability distribution देता है; एक value network किसी position की गुणवत्ता score करता है और अनुमान लगाता है कि अंततः कौन-सा पक्ष जीतेगा। हर move पर system Monte Carlo tree search चलाता है: यह हज़ारों partial games simulate करता है, policy network से तय करता है कि कौन-सी moves explore करने लायक हैं और value network से resulting positions को अंत तक खेले बिना evaluate करता है। Training चरणों में हुई — पहले online Go servers के human games से लगभग 3 करोड़ positions पर सुपरवाइज़्ड लर्निंग हुई, जिसमें network ने expert moves को लगभग 57% accuracy से predict करना सीखा, फिर रीइन्फ़ोर्समेंट लर्निंग हुई, जिसमें network ने जीत को एकमात्र reward signal रखकर अपने पुराने versions के विरुद्ध लाखों games खेले। Learned evaluation और guided search का यह मेल मूल विचार है; न्यूरल नेटवर्क उस search space को छाँटते हैं जिसे raw computation छू भी नहीं सकता।

Move 37 और वह Match जिसने सब बदल दिया

AlphaGo पहली बार 2016 की शुरुआत में सुर्ख़ियों में आया, जब DeepMind ने बताया कि उसने पिछले अक्टूबर reigning European champion Fan Hui को 5–0 से हराया था — पहली बार किसी program ने बिना handicap के full-size board पर किसी professional को पराजित किया था। उसी मार्च का Lee Sedol match असली परीक्षा था: Lee 18 international titles वाले legend थे और अधिकतर observers को उनकी आसान जीत की उम्मीद थी। इसके बजाय AlphaGo ने पहले तीन games जीते और match 4–1 से अपने नाम किया। दूसरे game में प्रसिद्ध Move 37 आया, fifth line पर एक shoulder hit जिसे commentators ने पहले भूल समझा; AlphaGo के अपने policy network ने किसी human के वह move खेलने की संभावना लगभग दस हज़ार में एक आँकी थी, फिर भी वह निर्णायक साबित हुआ और अब उस game में सचमुच नए विचार के रूप में पढ़ा जाता है जिसे humans सहस्राब्दियों से निखार रहे हैं। Lee ने चौथे game में अपनी असाधारण wedge move, प्रसिद्ध Move 78, से जवाब दिया और AlphaGo के अंतिम versions के विरुद्ध शीर्ष human द्वारा जीता गया यह एकमात्र game रहा। 2017 में program ने world number one Ke Jie को 3–0 से हराया और फिर competitive play से retire कर दिया गया।

यह Brute Force से नहीं जीता

एक आम गलतफ़हमी है कि AlphaGo ने Lee Sedol से अधिक calculation करके जीत हासिल की, जैसे Deep Blue ने Kasparov को मात दी थी। सच इसके लगभग उलट है: Deep Blue प्रति second लगभग 20 करोड़ positions देखता था, जबकि AlphaGo ने केवल हज़ारों positions evaluate कीं — यानी कई orders of magnitude कम। Go का branching factor, एक सामान्य position में लगभग 250 legal moves जबकि chess में करीब 35, ऐसा है कि raw enumeration कहीं नहीं पहुँचता; AlphaGo ने learned judgment जोड़ा कि किन मुट्ठीभर moves को ध्यान से देखना चाहिए और कौन-सी positions वास्तव में winning हैं। इस अर्थ में system chess calculator से कम और perfect memory वाले बहुत अनुभवी player की तरह अधिक खेलता है। फिर भी इसकी सीमाएँ ध्यान में रखना ज़रूरी है: AlphaGo, Go के बारे में जो कुछ जानता है वह उसके डीप लर्निंग networks के भीतर है, और game के बाहर वह कुछ भी नहीं कर सकता।

AlphaGo Zero से MuZero तक

2017 में DeepMind ने AlphaGo Zero प्रकाशित किया, जिसने human knowledge पूरी तरह हटा दी: random play से शुरू करके और केवल rules जानकर उसने पूरी तरह self-play पर training की, करीब तीन दिनों में Lee Sedol को हराने वाले version को पीछे छोड़ दिया और उसे 100–0 से हराया, तथा चालीस दिनों बाद हर पिछले version से अधिक मज़बूत था। AlphaZero ने फिर इसी algorithm को chess और shogi तक generalize किया, केवल कुछ घंटों के self-play में दोनों में superhuman strength हासिल की और widely discussed match में शीर्ष traditional engine Stockfish को हराया। MuZero ने विचार को सबसे आगे बढ़ाया: उसे rules भी नहीं दिए जाते, बल्कि वह सीखता है कि environment actions पर कैसे प्रतिक्रिया देता है — एक learned विश्व मॉडल (World Model) — और उसने Atari games में महारत पाने के साथ Go, chess तथा shogi पर AlphaZero की बराबरी की। यह lineage इसलिए महत्वपूर्ण है कि हर चरण ने human examples पर एक और निर्भरता हटाई और दिखाया कि search तथा self-improvement शुरुआत से expertise खड़ी कर सकते हैं।

आधुनिक AI में विरासत

AlphaGo का प्रभाव competition से retirement के बहुत बाद तक रहा। Match Google के custom TPU hardware पर चला था और उसके बाद modern AI wave भड़क उठी — South Korea ने कुछ ही हफ़्तों में national AI strategy घोषित की और deep learning में investment दुनिया भर में बढ़ गया। DeepMind ने science में इसी तरह का learning-driven playbook AlphaFold के साथ अपनाया, जिसने protein structure prediction को प्रभावी रूप से हल कर दिया। Language AI के भीतर इसके निशान हर जगह हैं: RLHF और उसके variants reward signal से संचालित reinforcement learning हैं, और modern तर्क models inference time पर reinforcement learning को search जैसी exploration से जोड़ते हैं — यह AlphaGo recipe का सीधा वंशज है, जिसमें system को अभ्यास करने, अपनी कोशिशें evaluate करने और जो काम करे उसे रखने दिया जाता है।

← सभी शब्द
ESC