मुख्य सामग्री पर जाएँ
Zubnet AIसीखेंWiki › AlphaFold
मॉडल

AlphaFold

इसे भी कहा जाता है: AlphaFold 2, AlphaFold 3
Google DeepMind का protein structure prediction system, जो protein के amino-acid sequence से सीधे उसका three-dimensional आकार निकालता है। AlphaFold 2 ने 2020 के CASP14 assessment में experimental methods की accuracy की बराबरी की, और AlphaFold 3 ने इस approach को DNA, RNA तथा small molecules वाले protein complexes तक बढ़ाया।

यह क्यों मायने रखता है

Protein का आकार उसका function तय करता है, इसलिए structure जानना अक्सर drug design, enzyme engineering और basic biology का पहला कदम होता है। X-ray crystallography या cryo-electron microscopy से एक structure experimentally तय करने में महीनों या वर्षों का समय लग सकता है, जबकि AlphaFold को minutes से hours तक compute चाहिए। 20 करोड़ से अधिक predicted structures वाला public database कई researchers को मॉडल चलाना पूरी तरह छोड़कर केवल उत्तर download करने देता है।

गहन अध्ययन

AlphaFold एक input — protein का amino-acid sequence — लेता है और हर residue के confidence score के साथ atoms के 3D coordinates लौटाता है। AlphaFold 2 pipeline पहले sequence databases में खोजकर evolution से संबंधित proteins का multiple sequence alignment (MSA) बनाती है और templates के रूप में काम कर सकने वाले ज्ञात structures ढूँढती है। दोनों एक Evoformer नामक block के इर्द-गिर्द बने न्यूरल नेटवर्क में जाते हैं, जो alignment तथा residue relationships की pairwise representation के बीच जानकारी बदलता है, और उसके बाद structure module atomic coordinates निकालता है। Network को Protein Data Bank में मौजूद 200,000 से कम experimentally determined structures पर सुपरवाइज़्ड लर्निंग से train किया जाता है, और result सुधारने के लिए pipeline अपना output कुछ बार network में recycle करती है। Sequence length के अनुसार एक GPU पर prediction चलाने में minutes से hours तक लगते हैं।

MSA ही गुप्त हथियार है

AlphaFold 2 का सबसे महत्वपूर्ण input sequence स्वयं नहीं बल्कि multiple sequence alignment है: public databases से निकाले गए संबंधित protein sequences के सैकड़ों या हज़ारों उदाहरण। Evolution में साथ mutate होने वाले residues folded structure में आम तौर पर एक-दूसरे के पास होते हैं, और यही covariation signal network को 3D contacts का अनुमान लगाने देता है। गहरे alignments सबसे भरोसेमंद predictions देते हैं; shallow alignments किसी prediction के अविश्वसनीय लौटने का मुख्य कारण हैं, जो viral proteins, de novo designed proteins और कम ज्ञात relatives वाली "orphan" sequences में आम है। Meta AI के ESMFold जैसे बाद के systems database search को protein language model से बदलकर कई गुना तेज़ चलते हैं, लेकिन अच्छी तरह aligned families पर accuracy की कुछ कीमत चुकाते हैं। अधिकतम accuracy चाहने वाली teams अभी भी पूरा AlphaFold 2 चलाती हैं और language-model variants को लाखों sequences screen करने के लिए रखती हैं।

Evoformer के भीतर

AlphaFold 2 का core Evoformer है, 48 blocks की stack जो दो representations के बीच जानकारी आगे-पीछे करती है: alignment की rows और columns, तथा हर residue pair के संबंध पर network की मौजूदा धारणा track करने वाली "pair representation"। यह machinery अटेंशन से बनी है, वही मूल operation जो Transformer को चलाता है, लेकिन triangular updates नामक custom operations के साथ ढाली गई है जो pair representation को geometric consistency की ओर धकेलती हैं: residue A, B के पास है और B, C के पास है तो A भी संभवतः C के पास होना चाहिए। फिर structure module invariant point attention से refined representation को coordinates में बदलता है, यह geometry-aware variant 3D rotations और translations में सही व्यवहार करता है। Design की वह सीख जो कई practitioners को चौंकाती है यह है कि raw scale से accuracy बहुत कम आती है: AlphaFold 2 में लगभग 93 मिलियन पैरामीटर हैं, जो modern language-model standards से बहुत छोटा है।

Confidence scores पढ़ना

हर AlphaFold prediction के साथ 0 से 100 scale पर pLDDT नामक प्रति-residue confidence score मिलता है। 90 से ऊपर वाले regions side-chain placement तक आम तौर पर भरोसेमंद होते हैं, 70 से 90 के scores confident backbone बताते हैं, और 50 से कम को "शायद folded नहीं" पढ़ना चाहिए — low pLDDT अक्सर model failure के बजाय intrinsic disorder की सही prediction होती है। Complexes में predicted aligned error (PAE) matrix बताती है कि domains या chains के pairs की relative placement पर कितना confidence है, और यही usable docking hypothesis तथा केवल सुंदर picture का अंतर है। काम की आदत यह होनी चाहिए कि 3D view से पहले pLDDT plot देखें, और publication या drug program का आधार बनाने से पहले हर prediction को ऐसी hypothesis मानें जिसे अभी experimental support चाहिए।

यह structures predict करता है, folding नहीं

एक लगातार बनी गलतफ़हमी है कि AlphaFold ने "protein folding problem हल कर दी"। उसने structure prediction हल की: sequence मिलने पर वह आकार बताना जिसे protein सबसे संभवतः अपनाता है। वह यह नहीं बताता कि protein वहाँ कैसे पहुँचता है — pathway, kinetics और intermediate states, जिनसे classic folding paradox जुड़ा है — और अधिकतर एक static conformation देता है, जबकि वास्तविक proteins flex करते, साँस लेते और states बदलते हैं। यह सीधे यह भी नहीं बताता कि mutation stability या function पर क्या असर डालेगा, और ligands, membranes तथा post-translational modifications को संभालने की reliability बदलती रहती है। यहाँ डीप लर्निंग को physics engine नहीं बल्कि evolutionary और structural data पर असाधारण रूप से अच्छा pattern matcher समझना चाहिए; dynamics के लिए अभी भी molecular simulation तथा wet-lab experiments चाहिए।

AlphaFold 3, database और Nobel Prize

Model के इर्द-गिर्द AlphaFold Protein Structure Database विकसित हुआ, Google DeepMind और EMBL-EBI का collaboration जो मुफ़्त precomputed predictions प्रकाशित करता है: लगभग हर cataloged protein को समेटती 20 करोड़ से अधिक structures। 2024 में जारी AlphaFold 3, single protein chains से आगे DNA, RNA, ligands और ions वाले complexes तक generalize करता है, और structure module को ऐसे डिफ़्यूज़न मॉडल से बदलता है जो atomic coordinates सीधे generate करता है; यही उसे amino acids से आगे की chemistry संभालने देता है। Access मुफ़्त hosted server से मिलता है, और code तथा weights बाद में non-commercial use के लिए जारी किए गए, इस strategic value वाले system के लिए उल्लेखनीय ओपन वेट्स कदम, जो AlphaGo से शुरू हुई research lineage को दोहराता है। 2024 में Demis Hassabis और John Jumper को protein structure prediction के लिए Chemistry का Nobel Prize मिला, जिसे उन्होंने computational protein design के लिए David Baker के साथ साझा किया, और इससे AlphaFold original science करने वाले AI का standard example बन गया।

← सभी शब्द
ESC