GPT
為什麼重要
深度解析
GPT 的故事其實由三個故事疊在一起。第一個是規模擴展:從 2018 年擁有 1.17 億參數的 GPT-1 開始,OpenAI 證明,一個在大量原始文字上訓練、學著預測下一個 token 的 Transformer,可以成為能力驚人的通用語言系統;而每一代——GPT-2、GPT-3、GPT-4——的能力躍升,基本上都靠投入更多算力與資料換來。第二個是對齊:原始的下一個 token 預測器不太好用,所以 OpenAI 在上面疊加指令微調與人類回饋,把文字續寫引擎變成讓這個家族一炮而紅的聊天助手。第三個是整合:後期版本把多模態與深思熟慮的逐步推理重新收進同一個旗艦模型,因此「GPT」如今指的是一整條產品線,而不是某一種架構。
早期軌跡:從 GPT-1 到 GPT-3
GPT-1(2018 年)在一篇標題低調的論文《Improving Language Understanding by Generative Pre-Training》中提出這套配方:先在大型無標註語料庫上預訓練一個僅使用 Decoder 的 Transformer,再針對特定任務微調。擁有 1.17 億參數的它只是一項概念驗證,但驗證成功了。GPT-2(2019 年,15 億參數)放大這套配方,證明單一模型只靠一段措辭得當的提示,就能完成從未明確訓練過的任務——翻譯、摘要、問答;OpenAI 最初因擔心濫用而沒有公開完整權重,提前預演了日後每次模型釋出時的爭論。GPT-3(2020 年,1750 億參數)又放大百倍,並讓這套把戲可靠到足以產品化:在提示中給模型幾個範例,它便能掌握其中模式,這種行為稱為 Few-Shot Learning(少樣本學習)。同樣影響深遠的是,GPT-3 以商業 API 而非可下載權重的形式發佈,確立了多數前沿實驗室沿用至今的存取模式。
ChatGPT 與 RLHF 轉向
基礎版 GPT 模型不會回答問題——它只會續寫文字,因此它可能回答你的問題,也可能只是在問題清單後面再接幾個問題。InstructGPT(2022 年)用 RLHF 解決這個問題:人類標註員替模型輸出排序,獎勵模型學習他們的偏好,語言模型再依照這個獎勵訊號微調,直到能可靠遵循指令。2022 年 11 月上線的 ChatGPT,把以這種方式調校的 GPT-3.5 級模型包進免費聊天介面,約兩個月內便達到約 1 億使用者——在當時是有紀錄以來成長最快的消費者應用程式。業界從中得到的教訓,讓只相信擴大規模的人不太舒服:模型本身幾乎沒變,改變的是對齊層與介面,但這已足以把研究展示變成大眾市場產品。
GPT-4、O 系列與 GPT-5
GPT-4(2023 年)是讓這個家族在專業工作中站穩腳步的一代——推理品質、指令遵循與可靠性都大幅躍升,並在文字之外支援圖像輸入。GPT-4o(2024 年)讓模型具備原生多模態能力:單一網路端到端處理文字、圖像與音訊,比前代更快也更便宜,即時語音模式正是由此成為可能。與此同時,OpenAI 分出 o 系列(先是 o1,接著是 o3):這些模型透過強化學習訓練,在回答前多花 token 思考,以延遲換取數學、程式碼與科學問題的準確率——這是認真實踐測試時計算的成果。GPT-5(2025 年 8 月)把兩條分支合回單一系統,替每個請求在快速對話模型與較慢推理模型之間路由,使用者不再需要在「聰明但慢」與「快但淺」之間做選擇。
ChatGPT 不是 GPT
這兩個詞經常被混用,但它們指的是不同東西;混淆兩者,會在判斷模型行為時造成真正的 bug。GPT 是模型家族:你透過 API 呼叫的那組權重,有固定的上下文視窗、由你控制的系統提示,除非自行建置,否則不同呼叫之間沒有記憶。ChatGPT 是產品:上述某個模型,加上系統提示詞、對話記憶、網頁瀏覽、檔案工具與審核層;所有這些都會在模型執行前,先塑造你看到的內容。當有人說「GPT 拒絕了」或「GPT 記住了」,這種行為通常來自產品外殼,而非基礎模型——把提示從 App 搬到 API 後發現答案變了,這一點便格外重要。還有一種較輕微的混淆:「GPT」已逐漸成為任何聊天機器人的泛稱,就像「Kleenex」可以指任何面紙;但嚴格來說,它只指 OpenAI 的模型家族,Llama、Claude 和 Gemini 都不是 GPT。
底層原理
從架構來看,每個 GPT 都是只使用Decoder的 Transformer:輸入文字先被分詞、嵌入,再穿過一疊自注意力層;訓練則透過調整權重,盡量降低海量文字語料上的下一個 token 預測誤差。它沒有 Encoder,也沒有遮罩 token 目標——這是它與 BERT 的關鍵差異;後者是另一條著名的 Transformer 路線,會雙向讀取文字,為理解型任務而非生成而生。由於模型知道的一切都在預訓練期間寫進權重,它有一道硬性的知識截止日期,也沒有內建的真相概念,因此才會流暢地陳述錯誤內容;在推論時透過 RAG 提供最新的事實上下文,是標準的權宜之計。生成本身是自回歸的:模型取樣一個 token、接到後面,再不斷重複,因此長答案照字面來說,就是數百次依序預測。