跳到主要内容
Zubnet AI学习Wiki › Turing Test
基础

Turing Test

别名:模仿游戏
图灵测试是 Alan Turing 在 1950 年论文《Computing Machinery and Intelligence》中提出的一项机器智能行为测试。如果一名人类评判者通过文字消息与隐藏的对话对象交流,却无法可靠地区分机器和真人,这台机器就被认为表现出了智能行为。图灵提出它,是为了用一个具体的测试替代“机器能否思考”这个更含糊的问题。

为什么重要

图灵测试塑造了七十多年来关于什么才算机器智能的争论,而且每当有聊天机器人被宣称通过了它,它仍然是公众辩论的锚点。弄清楚这个测试真正测量的东西—在时间压力下令人信服的模仿,而不是理解—就是批判性阅读那些头条新闻与照单全收之间的区别。

深度解析

图灵的做法是彻底绕开哲学。他不去定义“思考”,而是描述了一个客厅游戏:一名询问者向两名隐藏的玩家键入问题,一个是真人,一个是机器,并试图仅凭他们的回答判断谁是谁。如果询问者的判断不比瞎猜好,机器就赢了。这个设置剥掉了会话行为之外的一切—没人问机器内部如何运作、它是否有意识、它由什么构成。这种刻意的狭窄既是它流行起来的原因,也是它此后一直被批评的原因:它测量的是表现,而不是机制。在大型语言模型的时代,模型的全部训练目标就是生成可信的文本,这个测试与恰好极其擅长它所测量之物的系统迎头相撞。

最初的模仿游戏

图灵 1950 年的论文描述了一个三人游戏:一个男人、一个女人,以及一名任意性别的询问者,所有人通过键入的消息交流,这样声音和外貌不会泄露任何信息。询问者的任务是判断哪位玩家是女人,而男人则努力误导对方。图灵接着问:当一台机器取代男人的位置时会发生什么—询问者犯错的频率会不会差不多?这个框架之所以重要,是因为测试从来不是关于背诵事实,而是关于机器能否维持那种看似需要心智的、灵活而开放式的对话。图灵预言,到 2000 年,机器会把这个游戏玩得足够好,以至于普通询问者在五分钟提问后做出正确判断的概率不超过 70%。这句话后来硬化成了常被引用的通过门槛:“五分钟内骗过 30% 的评判者”。

从 ELIZA 到 Loebner 奖

关于这个测试奖励诡计的第一次警告来得很早。1966 年,Joseph Weizenbaum 造出了 ELIZA,一个聊天机器人,它用简单的模式匹配把用户的陈述反射回问题,以此戏仿心理治疗师—而一些用户开始确信它理解自己。Weizenbaum 对这种反应深感不安,以至于在此后的职业生涯里一直在反对把模拟混同于理解。同样的模式在 Loebner 奖中重复了几十年,这是一项 1990 年到 2019 年间每年举办的比赛,为最像真人的程序颁发奖牌;没有任何参赛程序通过过不受限的长对话测试。2014 年,一个名叫 Eugene Goostman 的程序假扮成英语不太好的 13 岁乌克兰男孩,在一场五分钟的活动中骗过了三分之一的评判者,并被宣布通过—这一说法被广泛驳斥,因为那个人设为它的回避提供了借口,而且对话很短。

LLM 击穿了这个测试

现代大型语言模型彻底改变了局面。在海量文本语料上的预训练,让它们天生就是人类对话的流利模仿者,而这恰好是模仿游戏所评分的技能。在 2024 年和 2025 年的对照研究中,三方模仿游戏里的评判者把 GPT-4 级别的系统认作真人的比例大约达到一半甚至更高;在 2025 年的一项研究中,一个设定了人设的模型被评为比真正的人类参与者更像人。关键在于,左右结果的不是深层推理,而是表面风格:打字速度、错别字、emoji 的使用、简短回复,以及一个可信的人设。通过五分钟的文字对话—曾经被视为通往 AGI 路上的遥远里程碑—结果证明是一段调校得当的提示词就能基本实现的事情。

这是欺骗测试,不是智能测试

最深的误解是认为通过图灵测试就证明了智能。这个测试测量的是评判者能否被骗过,而这既取决于机器的能力,也同样取决于评判者的预期、时间限制和测试形式—这就是为什么一位持怀疑态度的 AI 研究者和一位随意的参与者会得出天差地别的结果。John Searle 的中文房间思想实验在 1980 年把这一点说透了:一个系统可以仅凭操纵符号给出完美的对答,而不理解任何东西。现代聊天机器人的批评者提出了同一论点的翻版,称 LLM 是把训练文本重新混合的随机鹦鹉。在实践中,这个领域已经悄悄向前走了:严肃的评估如今依靠能力基准、人工评估协议,以及 Chatbot Arena 这样的偏好平台,而图灵测试主要作为历史地标和头条制造机存活下来。

← 所有术语
ESC