AlphaGo
यह क्यों मायने रखता है
गहन अध्ययन
Go भ्रामक रूप से सरल है: दो खिलाड़ी 19-by-19 grid पर बारी-बारी से काले और सफ़ेद पत्थर रखते हैं और territory घेरने की कोशिश करते हैं। लेकिन game में लगभग 10^170 संभावित board configurations हैं — observable universe में atoms की संख्या से भी अधिक — इसलिए exhaustive search बेकार है। जब IBM के Deep Blue ने 1997 में Garry Kasparov को chess में हराया, तो उसने मुख्यतः brute-force calculation से ऐसा किया था और प्रति second लगभग 20 करोड़ positions evaluate की थीं। Experts को उम्मीद थी कि Go एक दशक या उससे अधिक समय तक बचा रहेगा, क्योंकि मज़बूत खेल के लिए human intuition जैसी किसी चीज़ की ज़रूरत लगती थी: pattern recognition, कौन-सी positions promising हैं इसका judgment और long-term influence की समझ। AlphaGo की breakthrough यह थी कि उसने deep convolutional networks से data के आधार पर यह intuition सीखी, फिर निर्णायक बनने लायक guided search के साथ इसे जोड़ा।
दो Networks और एक Search Tree
AlphaGo architecture के तीन moving parts हैं। एक policy network, यानी deep CNN, board position लेकर promising अगली moves पर probability distribution देता है; एक value network किसी position की गुणवत्ता score करता है और अनुमान लगाता है कि अंततः कौन-सा पक्ष जीतेगा। हर move पर system Monte Carlo tree search चलाता है: यह हज़ारों partial games simulate करता है, policy network से तय करता है कि कौन-सी moves explore करने लायक हैं और value network से resulting positions को अंत तक खेले बिना evaluate करता है। Training चरणों में हुई — पहले online Go servers के human games से लगभग 3 करोड़ positions पर सुपरवाइज़्ड लर्निंग हुई, जिसमें network ने expert moves को लगभग 57% accuracy से predict करना सीखा, फिर रीइन्फ़ोर्समेंट लर्निंग हुई, जिसमें network ने जीत को एकमात्र reward signal रखकर अपने पुराने versions के विरुद्ध लाखों games खेले। Learned evaluation और guided search का यह मेल मूल विचार है; न्यूरल नेटवर्क उस search space को छाँटते हैं जिसे raw computation छू भी नहीं सकता।
Move 37 और वह Match जिसने सब बदल दिया
AlphaGo पहली बार 2016 की शुरुआत में सुर्ख़ियों में आया, जब DeepMind ने बताया कि उसने पिछले अक्टूबर reigning European champion Fan Hui को 5–0 से हराया था — पहली बार किसी program ने बिना handicap के full-size board पर किसी professional को पराजित किया था। उसी मार्च का Lee Sedol match असली परीक्षा था: Lee 18 international titles वाले legend थे और अधिकतर observers को उनकी आसान जीत की उम्मीद थी। इसके बजाय AlphaGo ने पहले तीन games जीते और match 4–1 से अपने नाम किया। दूसरे game में प्रसिद्ध Move 37 आया, fifth line पर एक shoulder hit जिसे commentators ने पहले भूल समझा; AlphaGo के अपने policy network ने किसी human के वह move खेलने की संभावना लगभग दस हज़ार में एक आँकी थी, फिर भी वह निर्णायक साबित हुआ और अब उस game में सचमुच नए विचार के रूप में पढ़ा जाता है जिसे humans सहस्राब्दियों से निखार रहे हैं। Lee ने चौथे game में अपनी असाधारण wedge move, प्रसिद्ध Move 78, से जवाब दिया और AlphaGo के अंतिम versions के विरुद्ध शीर्ष human द्वारा जीता गया यह एकमात्र game रहा। 2017 में program ने world number one Ke Jie को 3–0 से हराया और फिर competitive play से retire कर दिया गया।
यह Brute Force से नहीं जीता
एक आम गलतफ़हमी है कि AlphaGo ने Lee Sedol से अधिक calculation करके जीत हासिल की, जैसे Deep Blue ने Kasparov को मात दी थी। सच इसके लगभग उलट है: Deep Blue प्रति second लगभग 20 करोड़ positions देखता था, जबकि AlphaGo ने केवल हज़ारों positions evaluate कीं — यानी कई orders of magnitude कम। Go का branching factor, एक सामान्य position में लगभग 250 legal moves जबकि chess में करीब 35, ऐसा है कि raw enumeration कहीं नहीं पहुँचता; AlphaGo ने learned judgment जोड़ा कि किन मुट्ठीभर moves को ध्यान से देखना चाहिए और कौन-सी positions वास्तव में winning हैं। इस अर्थ में system chess calculator से कम और perfect memory वाले बहुत अनुभवी player की तरह अधिक खेलता है। फिर भी इसकी सीमाएँ ध्यान में रखना ज़रूरी है: AlphaGo, Go के बारे में जो कुछ जानता है वह उसके डीप लर्निंग networks के भीतर है, और game के बाहर वह कुछ भी नहीं कर सकता।
AlphaGo Zero से MuZero तक
2017 में DeepMind ने AlphaGo Zero प्रकाशित किया, जिसने human knowledge पूरी तरह हटा दी: random play से शुरू करके और केवल rules जानकर उसने पूरी तरह self-play पर training की, करीब तीन दिनों में Lee Sedol को हराने वाले version को पीछे छोड़ दिया और उसे 100–0 से हराया, तथा चालीस दिनों बाद हर पिछले version से अधिक मज़बूत था। AlphaZero ने फिर इसी algorithm को chess और shogi तक generalize किया, केवल कुछ घंटों के self-play में दोनों में superhuman strength हासिल की और widely discussed match में शीर्ष traditional engine Stockfish को हराया। MuZero ने विचार को सबसे आगे बढ़ाया: उसे rules भी नहीं दिए जाते, बल्कि वह सीखता है कि environment actions पर कैसे प्रतिक्रिया देता है — एक learned विश्व मॉडल (World Model) — और उसने Atari games में महारत पाने के साथ Go, chess तथा shogi पर AlphaZero की बराबरी की। यह lineage इसलिए महत्वपूर्ण है कि हर चरण ने human examples पर एक और निर्भरता हटाई और दिखाया कि search तथा self-improvement शुरुआत से expertise खड़ी कर सकते हैं।
आधुनिक AI में विरासत
AlphaGo का प्रभाव competition से retirement के बहुत बाद तक रहा। Match Google के custom TPU hardware पर चला था और उसके बाद modern AI wave भड़क उठी — South Korea ने कुछ ही हफ़्तों में national AI strategy घोषित की और deep learning में investment दुनिया भर में बढ़ गया। DeepMind ने science में इसी तरह का learning-driven playbook AlphaFold के साथ अपनाया, जिसने protein structure prediction को प्रभावी रूप से हल कर दिया। Language AI के भीतर इसके निशान हर जगह हैं: RLHF और उसके variants reward signal से संचालित reinforcement learning हैं, और modern तर्क models inference time पर reinforcement learning को search जैसी exploration से जोड़ते हैं — यह AlphaGo recipe का सीधा वंशज है, जिसमें system को अभ्यास करने, अपनी कोशिशें evaluate करने और जो काम करे उसे रखने दिया जाता है।