Gemini
為什麼重要
深度解析
Gemini 與其說是單一模型,不如說是一條產品線:來自 Google DeepMind 的基礎模型家族,按世代(1.0、1.5、2.0、2.5)和尺寸層級(Nano、Flash、Pro、Ultra)發布,在能力與成本、速度之間取捨。每一代都在 Google 自家的 TPU 硬體上訓練,這讓 Google 能端到端掌控自己的運算堆疊,而不必完全依賴外部晶片供應商。同樣的模型也支撐著 Gemini 消費者應用程式、AI Studio 和 Vertex AI 中的 Gemini API,以及貫穿搜尋、Android 和 Workspace 的 AI 功能。Google 還衍生出 Gemma — 一個源自 Gemini 研究的較小型開放權重家族,供需要能自行運行權重的開發者使用。
從 Bard 到 Gemini
Google 通往 Gemini 的路要經過 Bard — 它在 2023 年倉促推出、用來回應 OpenAI 的 ChatGPT 的聊天機器人,最初建立在 LaMDA 上,後來改用 PaLM 2 模型。Bard 不穩的首次亮相,促使 Google 在 2023 年把旗下兩個互相競爭的研究實驗室 — Google Brain 和 DeepMind — 合併成單一的 Google DeepMind,而 Gemini 就是合併後團隊的第一個旗艦。1.0 版於 2023 年底登場,有三種尺寸(Ultra、Pro 和 Nano);Bard 悄悄切換到 Gemini Pro 上運行,幾個月內 Google 就全面退役了 Bard 這個名字。此後的節奏很快:1.5 帶來了專家混合架構和百萬 token 的上下文視窗,2.0 側重代理功能和原生工具使用,2.5 則把多步驟推理變成產品線的標配,而不是一個獨立模式。
每種工作都有對應的層級
Gemini 的層級對應到經典的成本-延遲-能力三角。Nano 是這個家族的小型語言模型:它在 Pixel 手機和 Chrome 中以裝置端方式運行,處理智慧回覆和摘要這類任務,不需要網路往返,因此資料留在本地、回應即時。Flash 位於這個權衡的雲端一端 — 一個經過蒸餾、為吞吐量最佳化的模型,專為大量工作負載打造,在那裡每百萬 token 的價格比擠出最後幾個基準分數更重要。Pro 是處理困難推理、程式編寫和多模態分析的旗艦主力,而 Ultra — 1.0 世代的最高層級 — 是 Google 當年對最艱鉅任務的押注。選擇層級是工程決策,不是忠誠度測試:許多團隊先用 Pro 做原型,等看清真實的查詢分佈後,再把簡單的流量導給 Flash。
原生多模態
大多數多模態系統是拼裝出來的:拿一個文字模型,接上視覺編碼器,連上語音轉文字的前端,然後在推論時把各部件黏合起來。Gemini 是反過來設計的 — 從一開始就在交錯的文字、圖像、音訊和影片上聯合訓練,所以這些模態共享同一個表示空間,而不是在管線之間互傳紙條。實際的回報體現在那些會讓管線式系統栽跟斗的任務上:看完一小時的影片並回答某個特定時刻的問題、對著一張白板照片做推理,或是不經過獨立的轉錄步驟就跟上一段口語對話。後來的世代還能生成,而不只是感知 — 在聊天中原生輸出和編輯圖像,以及透過 Google 的影片模型 Veo 生成影片,Veo 已在 Gemini 應用程式中開放。這裡的多模態是一種訓練方法論,而不是功能勾選清單,這也是它與 Google 早期 PaLM 這類文字優先模型之間最清晰的架構分野。
百萬 Token 的上下文視窗
Gemini 1.5 Pro 把長上下文當成頭條功能,在大多數模型的上限還只有這個數字的一小部分的時代,就交付了一百萬 token 的上下文視窗,後來的版本更推進到兩百萬。具體來說,一百萬 token 大約是 1,500 頁文字、一個大型程式碼庫,或是塞進單一提示裡的幾小時音訊和影片 — 對許多工作負載來說,足以跳過切片和檢索。這改變了你的建構方式:有時候你可以把整個文件集丟進提示裡直接提問,而不必架起一條 RAG 管線。不過注意事項同樣重要。注意力品質在超長輸入上會退化,所以即使放得下,埋在中間的細節也可能被漏掉;成本和延遲隨輸入長度增長;而且一旦語料超過幾百萬 token,檢索終究還是會回來。長上下文是真正的能力躍升,但它是與檢索工程相互權衡,而不是取而代之。
沒有一個叫 Gemini 的模型
一個常見的混淆來源:人們說「Gemini 告訴我……」,好像 Gemini 是一個模型。它從來都不是。這個名字涵蓋一個跨世代、跨層級的模型家族、一個可能根據負載和訂閱層級把你的提示導給不同尺寸模型的消費者應用程式、一組帶明確版本字串的 API 端點,以及 Workspace 和 Android 內部運行著另一些變體的 AI 功能。同一週裡交流「Gemini」心得的兩個人,可能在跟完全不同的模型對話,而你今天用的應用程式模型,很可能不是幾個月前的那一個。這對可重現性很重要:基準測試結果 — 包括這個家族在 Chatbot Arena 等公開排行榜上的強勁表現 — 適用於 Gemini 2.5 Pro 這樣的特定版本,而不是這個品牌。當精確性重要時,透過 API 鎖定確切的模型版本 — 應用程式的便利層正是設計來隱藏這種區別的。