跳到主要内容
Zubnet AI学习Wiki › GPT
模型

GPT

别名:ChatGPT、GPT-4、GPT-5
GPT(Generative Pre-trained Transformer)是 OpenAI 的大型语言模型家族:仅解码器架构的 Transformer,先通过预测下一个 token 进行训练,再针对聊天和推理进行对齐。这一家族从 1.17 亿参数的 GPT-1(2018 年)起步,历经 GPT-4 和多模态的 GPT-4o,直到 GPT-5(2025 年 8 月),同时支撑着 ChatGPT 产品和 OpenAI API。

为什么重要

GPT 是把大型语言模型带入主流的家族:ChatGPT 上线约两个月内就收获约 1 亿用户,其 API 也成为一代产品的默认基础设施。这个家族的演进轨迹—扩展规模、RLHF、多模态、测试时推理—实际上就是一部浓缩的现代 LLM 发展史,所以理解 GPT 是理解整个领域的捷径。

深度解析

GPT 的故事其实是三个故事叠在一起。第一个是关于扩展的故事:从 2018 年 1.17 亿参数的 GPT-1 开始,OpenAI 证明了一个在足够多的原始文本上训练来预测下一个 token 的 Transformer,可以成为能力惊人的通用语言系统,而每一代—GPT-2、GPT-3、GPT-4—的能力大跃升,基本都靠投入更多算力和数据换来。第二个是关于对齐的故事:原始的下一个 token 预测器用起来很别扭,所以 OpenAI 在其上叠加了指令微调和人类反馈,把一个文本续写引擎变成了让这个家族名声大噪的聊天助手。第三个是关于统一的故事:近期的发布把多模态和深思熟虑的逐步推理重新折叠进同一个旗舰模型,所以“GPT”如今指代的是一整条产品线,而不是某一种架构。

早期轨迹:从 GPT-1 到 GPT-3

GPT-1(2018 年)在一篇标题谦逊的论文《Improving Language Understanding by Generative Pre-Training》中提出了这套配方:先在大型无标注语料库上预训练一个仅解码器的 Transformer,再针对具体任务微调。1.17 亿参数的它只是一个概念验证,但这个验证成功了。GPT-2(2019 年,15 亿参数)把配方放大,证明单个模型仅凭一段措辞得当的提示词,就能完成从未被明确训练过的任务—翻译、摘要、问答;OpenAI 最初出于滥用担忧没有公开完整权重,这提前预演了此后每一次发布争论。GPT-3(2020 年,1750 亿参数)又放大了百倍,并让这套把戏可靠到足以产品化:在提示词里给模型几个示例,它就能领会其中的模式,这种行为被称为少样本学习。同样影响深远的是,GPT-3 以商业 API 而非可下载权重的形式发布,确立了大多数前沿实验室至今沿用的准入模式。

ChatGPT 与 RLHF 转向

基础版 GPT 模型并不回答问题—它只是续写文本,所以它既可能回答你的问题,也可能在你的清单后面再续出几个问题。InstructGPT(2022 年)用 RLHF 解决了这个问题:人类标注员对模型输出进行排序,一个奖励模型学习他们的偏好,然后语言模型对着这个奖励信号微调,直到能可靠地遵循指令。2022 年 11 月上线的 ChatGPT,把一个以这种方式调校的 GPT-3.5 级别模型包进免费的聊天界面,约两个月内达到约 1 亿用户—在当时是有测量以来增长最快的消费级应用。行业从中得到的教训让纯扩展派信徒不太舒服:模型本身几乎没变,变的是对齐层和界面,而这已足以把一个研究演示变成大众市场产品。

GPT-4、O 系列与 GPT-5

GPT-4(2023 年)是让这个家族在专业工作中立住脚的一代—推理质量、指令遵循和可靠性都有大幅跃升,并在文本之外支持图像输入。GPT-4o(2024 年)让模型原生多模态:一个网络端到端处理文本、图像和音频,比前代更快、更便宜,实时语音模式正是由此成为可能。与此同时,OpenAI 分出了 o 系列(o1,随后是 o3):用强化学习训练的模型,在回答前花更多 token 思考,用延迟换取数学、代码和科学上的准确率—这是被认真践行的测试时计算理念。GPT-5(2025 年 8 月)把两条分支合并回单一系统,它在快速的对话模型和较慢的推理模型之间路由每个请求,用户不再需要在“聪明但慢”和“快但浅”之间做选择。

ChatGPT 不是 GPT

这两个词经常被混用,但它们指代不同的东西,混淆它们会在推断模型行为时造成真实的 bug。GPT 是模型家族:你通过 API 调用的那组权重,有固定的上下文窗口、由你控制的系统提示词,并且除非你自行构建,否则调用之间没有记忆。ChatGPT 是一个产品:上述某个模型,加上系统提示词、对话记忆、网页浏览、文件工具和审核层,所有这些都会在模型运行之前就塑造你看到的内容。当有人说“GPT 拒绝了”或“GPT 记住了”时,这种行为通常来自产品外壳,而不是基础模型—当你把提示词从 App 搬到 API、发现答案变了,这一点就格外重要。还有一种更轻微的混淆:“GPT”已经漂移成对任何聊天机器人的泛称,就像“Kleenex”可以指任何纸巾,但严格来说它只指 OpenAI 的家族;Llama、Claude 和 Gemini 都不是 GPT。

底层原理

在架构上,每个 GPT 都是仅解码器的 Transformer:输入文本被分词、嵌入,然后穿过一叠自注意力层,训练则通过调整权重来最小化海量文本语料上的下一个 token 预测误差。它没有编码器,也没有掩码 token 目标—这是与 BERT 的关键区别,后者是另一条著名的 Transformer 路线,双向读取文本,为理解类任务而非生成而生。因为模型所知道的一切都在预训练期间被烧进权重,它有一个硬性的知识截止日期,也没有内置的真相概念,这就是它能流利陈述错误内容的原因;在推理时通过 RAG 给它提供新鲜的事实性上下文,是标准的变通办法。生成本身是自回归的:模型采样一个 token,把它接上,然后重复,所以长答案字面上就是数百次顺序预测。

← 所有术语
ESC