跳到主要内容
Zubnet AI学习Wiki › AlphaGo
模型

AlphaGo

别名:AlphaZero、AlphaGo Zero
Google DeepMind 打造的围棋 AI 系统,2016 年 3 月在首尔举行的五番棋中以 4–1 击败九段冠军李世石,成为第一个战胜顶尖人类职业棋手的计算机程序。AlphaGo 将深度神经网络、蒙特卡洛树搜索,以及通过自我对弈进行的强化学习结合起来,攻克了一款几十年来一直抵挡住暴力搜索式 AI 的游戏。

为什么重要

李世石之战是 AI 真正走入大众视野的时刻:数亿人观看了比赛,研究人员、政府和投资者也由此相信,机器学习不只会做模式匹配,还能掌握需要直觉和长期规划的问题。AlphaGo 验证的技术——让神经网络引导搜索、通过自我对弈持续进步、估算未来奖励——如今从推理模型、RLHF 到药物发现,无处不在。它仍是最经典的证明:在一个曾被认为几十年内都够不着的领域,学习系统可以超越人类专家。

深度解析

围棋看似简单:两名棋手轮流把黑白棋子落在 19×19 的棋盘上,争夺围住的地盘。但棋局可能的盘面数量约为 10^170——比可观测宇宙中的原子还多——穷举搜索根本没有希望。1997 年,IBM 的 Deep Blue 击败国际象棋冠军 Garry Kasparov,主要靠的是暴力计算,每秒评估大约 2 亿个局面。专家原以为围棋至少还能守住十年,因为高水平棋艺似乎需要类似人类直觉的东西:识别模式、判断哪些局面有希望,以及感知棋子长期影响力。AlphaGo 的突破,是用深度卷积网络从数据里学出这种直觉,再配上恰到好处的引导式搜索,一锤定音。

两个网络和一棵搜索树

AlphaGo 的架构有三个活动部件。策略网络是一个深层 CNN,接收棋盘局面后,为有希望的下一步输出概率分布;价值网络则给局面打分,估算最终哪一方会获胜。每次落子时,系统都会运行蒙特卡洛树搜索:它模拟数千盘不完整棋局,让策略网络决定哪些招值得探索,再由价值网络评估得到的局面,不必一路下到终局。训练分阶段进行——先在网络围棋平台上约 3000 万个人类棋局局面中进行监督学习,学着预测专家落子,准确率约 57%;再进行强化学习,让网络与自己的早期版本对弈数百万盘,唯一的奖励信号就是赢棋。学习式评估与引导式搜索的组合才是核心;神经网络剪掉了蛮力计算根本碰不动的搜索空间。

第 37 手与改变一切的比赛

AlphaGo 第一次登上头条是在 2016 年初,当时 DeepMind 公布,它已于前一年 10 月以 5–0 击败时任欧洲冠军樊麾——这是计算机程序第一次在无让子的标准棋盘上战胜职业棋手。同年 3 月与李世石的比赛才是真正考验:李世石手握 18 个世界冠军头衔,是一位传奇棋手,绝大多数旁观者都认为他会轻松取胜。结果 AlphaGo 连赢前三局,并以 4–1 拿下整场比赛。第二局出现了著名的第 37 手:在五线肩冲,解说员起初以为是失误;AlphaGo 自己的策略网络估计,人类下出这招的概率约为万分之一,它却成了决定胜负的一手,如今被当作真正的新思想研究——而围棋已经被人类琢磨了几千年。李世石在第四局以同样精彩的挖回应,也就是著名的第 78 手,赢下了顶尖人类对 AlphaGo 最终版本的唯一一局。2017 年,程序又以 3–0 击败世界第一柯洁,随后退出竞技赛场。

它不是靠蛮力赢的

一个常见误解是,AlphaGo 像 Deep Blue 压倒 Kasparov 那样,靠比李世石算得更多取胜。事实反而更接近相反:Deep Blue 每秒检查的局面约有 2 亿个,AlphaGo 却只评估数千个——少了好几个数量级。围棋的分支因子很大,典型局面约有 250 种合法落子,国际象棋则只有大约 35 种,因此原始枚举根本走不远;AlphaGo 真正加入的是学出来的判断力,知道哪寥寥几招值得细看,也知道什么样的局面确实占优。从这个角度看,它不像一台国际象棋计算器,更像一位记忆完美、经验极深的棋手。不过,边界也不能忘:AlphaGo 对围棋的一切理解都封存在深度学习网络里,走出棋盘,它什么也做不了。

从 AlphaGo Zero 到 MuZero

2017 年,DeepMind 发表 AlphaGo Zero,彻底移除了人类知识:它从随机落子起步,只知道游戏规则,完全靠自我对弈训练;大约三天后,它就超越击败李世石的版本,并以 100–0 横扫对方;40 天后,它比此前所有版本都更强。AlphaZero 随后把同一套算法泛化到国际象棋和将棋,只用几个小时自我对弈就在两项游戏中达到超人水平,并在一场广受讨论的对局中击败顶尖传统引擎 Stockfish。MuZero 把这个想法推得最远:连规则都不给它,而是让系统自行学习一个环境如何响应动作的内部模型——一个学出来的世界模型——它不仅在围棋、国际象棋和将棋上追平 AlphaZero,还掌握了 Atari 游戏。这条谱系之所以重要,是因为每一步都移除了一层对人类样例的依赖,证明搜索加自我改进可以从零启动出专业能力。

它留给现代 AI 的遗产

AlphaGo 的影响远远活过了它的退役。那场比赛运行在 Google 自定义的 TPU 硬件上,赛后更点燃了现代 AI 浪潮——韩国在几周内宣布国家 AI 战略,全球深度学习投资随之激增。DeepMind 又把类似的学习驱动打法带进科学,做出了几乎解决蛋白质结构预测的 AlphaFold。在语言 AI 内部,它的指纹到处都是:RLHF 及其变体本质上都是由奖励信号驱动的强化学习,现代推理模型又把强化学习与推理时类似搜索的探索结合起来——这正是 AlphaGo 配方的直系后代:让系统练习、评估自己的尝试,再留下真正奏效的做法。

← 所有术语
ESC