跳到主要內容
Zubnet AI學習 › Wiki

AI Wiki

AI概念,由建造者解釋,而非教科書。沒有術語牆。沒有學術門檻。清晰、實用的定義。

324 術語 8 分類 2026年7月更新
💡
每日術語
Loading...
🧭 學習路徑
未找到匹配的術語。
A
ASI
人工超級智慧
基礎
一種理論上的AI系統,其認知能力在幾乎所有領域都超越所有人類——科學推理、社會智慧、創造力、戰略規劃等等。ASI超越AGI(與人類智慧相當)達到質的差異:一種能夠遞歸自我改進、解決人類甚至無法明確表述問題的智慧。目前尚無任何ASI存在,科學界尚未就是否能夠或將會建造出ASI達成共識。
為什麼重要: ASI 是 AI 安全成為存在性問題之處。如果你相信超級智慧是可能的,那麼對齊不僅僅是讓聊天機器人變得有禮貌——而是確保一個比全人類都聰明的系統仍然符合我們的利益。這屬於推測性領域,但風險足夠高,使得嚴肅的研究人員對其非常重視。理解 ASI 可幫助你以更細膩的方式評估關於 AI 風險的主張。
AGI
通用人工智慧
基礎
一個假設性的AI系統,能夠理解、學習並執行人類所能進行的任何智慧行動——具備跨領域知識轉移能力,無需針對每個領域進行特定訓練。與目前擅長處理特定任務(生成文字、分類影像)的AI不同,AGI將能處理新情境、進行抽象推理,並適應任何挑戰。AGI是即將到來、數十年後出現,還是根本不可能,是該領域中最富爭議的議題。
為什麼重要: AGI是整個AI產業的北極星(或鬼魅)。它驅動數十億美元的投資,影響安全研究的優先順序,並主導政策辯論。無論你是否認為AGI已經近在咫尺,這個概念都定義了像Anthropic、OpenAI和DeepMind這樣的公司如何定義他們的使命——理解這場辯論能幫助你區分真正的進步與炒作。
AI 程式編寫助手
程式碼 Copilot、AI IDE
工具

協助開發者撰寫、審查、除錯與部署程式碼的人工智慧工具。從自動補全(GitHub Copilot、Codeium)到完全自主開發(Claude Code、Cursor、Devin),程式碼助手代表了大型語言模型(LLMs)最成熟且廣泛採用的應用之一。它們透過根據您程式碼庫、文件和說明的上下文來預測程式碼的下一個 tokens 來運作。

為什麼重要: AI程式輔助工具是AI對知識型工作影響中最尖端的應用。使用它們的開發者報告指出,在例行任務上的生產力提升了30-50%。但同時也會虛構不存在的API—引入細微錯誤—並可能使開發者依賴他們不完全理解的工具。
自動化
AI 自動化、工作流程自動化
工具

利用 AI 來執行以往需要人工介入的任務。這範圍從簡單的自動化(自動分類電子郵件、生成報告)到複雜的自主工作流程(AI 代理程式進行研究、撰寫、測試和部署程式碼)。從傳統自動化(僵硬的規則)轉向 AI 自動化(彈性的智慧)的關鍵在於,AI 能處理模糊且非結構化的任務。

為什麼重要:

自動化是AI採用的經濟引擎。每一家採用AI的企業,其實是在購買自動化—更少的人從事重複性工作、更快的處理速度、全天候運作。問題不是AI是否會自動化任務,而是哪些任務、多快完成,以及從事這些任務的人們會發生什麼事。

AI 網路安全
AI 安全、AI 威脅偵測
安全
AI在網路安全中的雙重應用:使用AI來防禦系統(威脅檢測、異常檢測、自動化事件回應),以及AI所創造的新攻擊向量(AI生成的魚叉式詐騙、自動化漏洞發現、對機器學習系統的對抗性攻擊)。這個領域正處於一場軍備競賽中,攻擊者和防禦者都越來越依賴AI。
為什麼重要: AI 使現有的網絡威脅變得更快、更便宜 — 由大型語言模型(LLM)撰寫的魚叉式詐騙郵件更具說服力,且個性化成本為零。但 AI 也讓一些手動無法實現的防禦措施成為可能,例如每秒分析數百萬個網路事件以偵測異常。不使用 AI 的安全團隊將會敗給那些使用 AI 的攻擊者。
AI 治理
AI 監管、AI 政策
安全

引導人工智慧開發、部署與使用的架構、政策、法律與組織實踐。這包括政府規範(歐盟AI法案、行政命令)、產業自律(負責任擴展政策、model cards)、企業治理(AI倫理委員會、使用政策),以及國際間在AI安全標準上的協調。

為什麼重要: 科技的發展速度遠快於規則的制定。企業正將人工智慧產品推出至醫療保健、刑事司法和金融領域,幾乎沒有監管。治理正是試圖在某件事情壞到足以引發足以讓整個領域倒退的反彈之前,先行設定界線。
AI 隱私
AI 資料隱私、ML 隱私
安全

在不損害個人數據的情況下建立和使用人工智慧系統的挑戰。這涵蓋整個生命周期:可能包含私人資訊的訓練數據、可能記憶並重現個人細節的模型、追蹤用戶行為的推論日誌,以及人工智慧能力(隨數據增加而提升)與隱私權之間的根本矛盾。

為什麼重要:

每一次與AI的對話都是數據。每一次你生成的圖片都會暴露出你的提示詞。每一次你總結的文件都會經過某人的伺服器。隱私不只是法律上的勾選框(GDPR、CCPA)—它是一個信任問題,這決定了個人和企業是否會採用AI來處理敏感工作。

AI 安全
LLM 安全、AI 安全工程
安全

保護AI系統免受對抗性攻擊、數據污染、提示注入、模型竊取與濫用的實踐—同時防禦深度偽造(deepfakes)與自動化網絡攻擊等AI啟用的威脅。AI安全位於傳統網絡安全與機器學習系統所引發的獨特弱點的交界處。

為什麼重要: AI系統同時是強大的工具與全新的攻擊面。一次提示注入可能導致您的客服機器人泄漏內部資料。一個被毒化的訓練資料集可能插入後門。當AI被部署於關鍵基礎設施、醫療保健與金融領域時,安全不再是選項——而是存亡關鍵。
AI 定價
Token 定價、API 定價
基礎設施
AI 供應商如何對其模型的使用收費。主流模式是按 token 定價 — 您需為所傳送(輸入)與接收(輸出)的 token 數量付費,輸出的 token 通常費用是輸入的 3 到 5 倍。其他模式包括按次收費、每月訂閱、承諾使用折扣與免費層級。價格戰異常激烈,兩年內成本已下降 10 到 100 倍。
為什麼重要: 價格決定了你能建立什麼。每天進行10,000次API呼叫的應用程式,其存亡取決於每個token的成本。理解定價模型、比較服務供應商、並優化token使用量,是任何開發AI驅動產品的人的核心技能。
AI 基礎設施
AI 基建、ML 基礎設施
基礎設施

用於大規模訓練和部署AI模型所需的完整堆疊硬體、軟體與服務。這包括GPU與客製化晶片、資料中心、網路、儲存、編排平台(Kubernetes、Slurm)、模型服務框架(vLLM、TensorRT)以及整合所有資源的雲端服務供應商。AI基礎設施正是模型架構的抽象世界與電力系統和冷卻系統等具體世界交會之處。

為什麼重要: 基礎設施決定什麼是可能的。只有少數公司能夠訓練尖端模型的原因不是缺乏想法——而是缺乏基礎設施。而 AI 對終端用戶的費用之所以如此,直接追溯到 GPU 可用性、資料中心容量以及推論服務效率。
AssemblyAI
Universal-2 語音辨識、音訊智能
公司
Speech AI公司正在建立開發者友好的API,用於語音轉文字、說話者檢測與語音理解。他們的Universal-2模型在準確度上與OpenAI Whisper匹敵,同時內建說話者分離、情緒分析與主題檢測等功能。
為什麼重要:

AssemblyAI 讓語音轉文字技術真正對開發者開放,將原本需要專屬機器學習團隊才能完成的任務,簡化為單一 API 呼叫。他們的 Audio Intelligence 架構 — 結合語音轉譯、說話者辨識、情感分析與 LLM 驅動的摘要功能 — 正在將原始音訊轉換為結構化且可操作的資料,其規模之大,甚至是兩年前都難以實現的。在語音逐漸成為 AI 代理程式預設介面的世界裡,AssemblyAI 正在建立所有其他技術所依賴的理解層。

Anthropic
Claude、憲法式 AI、MCP
公司
AI安全公司Anthropic正在開發Claude。該公司由前OpenAI研究人員戴里奧與丹妮拉·阿莫迪共同創立,專注於開發可靠、可解釋且可導向的AI系統。
為什麼重要:

Anthropic 證明了一家 AI 公司可以以安全研究為先導,同時仍能在技術前沿競爭。他們的 Constitutional AI 方法影響了整個產業對對齊問題的思考方式,其 Responsible Scaling Policy 設定了一個模板,其他實驗室以各種形式採用,而 Claude 已成為需要可靠性與謹慎處理敏感內容的企業的首選模型。或許最重要的是,Anthropic 作為一家資金充足的競爭者存在,確保通往 AGI 的競賽不會成為一家公司的獨角戲 — 並確保至少有一家主要參與者將安全編織在其創立基因中,而非事後補上的考量。

阿里雲
通義千問、Qwen 系列模型
公司
阿里巴巴集團旗下的雲端計算部門,以及 Qwen 模型家族的開發者。Qwen 模型採用完全開放權重,支持多語言,並在目前可取得的開放模型中功能最強。
為什麼重要:

阿里巴巴雲已將通義千問打造成亞洲部署最廣的開放權重模型家族,並成為與Meta的Llama真正競爭的全球級模型,證明具備前沿能力的模型可以來自矽谷以外。他們結合開放模型釋出、龐大的雲端基礎設施與ModelScope生態系統,為開發者—尤其是受美國出口管制影響的市場—提供一個可信賴且高品質的西方AI平台替代方案。

智能體
AI Agent、智能代理
工具

一個能夠自主規劃並執行多步驟任務的人工智慧系統,使用工具(網頁搜尋、程式碼執行、API 呼叫)來達成目標。與只能一次回答一個問題的簡單聊天機器人不同,代理會根據迄今所學來決定下一步該做什麼。

為什麼重要:

Agents 是連結「會說話的 AI」與「會做事的 AI」的橋樑。當你的 AI 能夠自行瀏覽文件、撰寫程式碼並進行測試,而無需你在每一步都親自指導 — 這就是 Agent。

安全

讓AI系統以符合人類價值和意圖的方式運作的挑戰。一個對齊的模型會執行你真正想表達的內容,而不仅仅是字面上的字句 — 即使沒有明確被告知不要這樣做,也能避免有害的行為。

為什麼重要: 一個技術上卓越但對齊不良的模型,就像一個天才員工,卻太字面地遵循指示。對齊研究正是模型會拒絕危險請求並努力成為真正有幫助的原因。
API
應用程式介面
基礎設施

軟體之間進行溝通的結構化方式。在 AI 領域中,這通常表示將請求(您的提示)傳送至服務供應商的伺服器,並接收回應(模型的輸出結果)。透過 HTTPS 的 REST API 是標準做法。

為什麼重要:

每一家 AI 提供商 — Anthropic、Google、Mistral — 都透過 API 提供其模型。如果你所構建的 AI 應用超出聊天視窗的範疇,你就正在使用 API。

注意力
注意力機制、自注意力
模型

Transformers 中的核心機制,讓模型能夠權衡輸入中哪些部分彼此之間最相關。與較早期的模型從左到右閱讀文字不同,注意力機制讓每個詞彙可以同時「檢視」其他所有詞彙,以理解上下文。

為什麼重要:

注意力機制正是現代大型語言模型(LLM)之所以能理解「bank」在「river bank」與「bank account」中意義不同的原因。這也是為什麼更長的上下文視窗成本更高—注意力機制的計算量會隨著序列長度呈二次方增長。

Autoregressive(自回歸)
自回歸模型、下一詞元預測
基礎

一種逐一生成輸出詞元的模型,其中每個新詞元都是基於之前所有詞元來預測的。每個現代 LLM — Claude、GPT、Llama、Gemini — 都是自回歸的。模型不會先「規劃」完整回應再寫出來;它實際上是預測下一個字、附加上去,然後再預測下一個,不斷重複直到決定停止。

為什麼重要: 理解自回歸生成能解釋大多數 LLM 的行為:為什麼回應是逐詞元串流的、為什麼模型有時會在段落中途自相矛盾、為什麼更長的輸出更慢且更昂貴,以及為什麼你無法輕易要求模型「回頭修改開頭」。模型永遠是往前走的,一次一個詞元。
Artificial Intelligence
AI、機器智慧
基礎
建造能夠執行通常需要人類智慧的任務的機器的廣泛領域——理解語言、辨識影像、做出決策、解決問題。AI 的範圍從擅長特定任務的狹義系統(垃圾郵件過濾器、西洋棋引擎)到能處理人類所能完成的任何智力任務的通用智慧這一遠大目標。
為什麼重要: AI 是這部維基中所有其他概念的上位概念——機器學習、深度學習、大型語言模型、電腦視覺、機器人技術。理解「AI」是一個從簡單的基於規則系統到前沿語言模型的光譜,有助於你評估各種說法、識別炒作,並了解當今的系統實際上是什麼:能力超群的模式匹配器,而非思考機器。
Activation Function
ReLU、GELU、SiLU、Swish
基礎
應用於神經元輸出的數學函數,為網路引入非線性。沒有啟動函數,神經網路——無論多少層——都只能學習線性關係。ReLU、GELU 和 SiLU/Swish 是現代架構中最常見的啟動函數。
為什麼重要: 啟動函數是深度學習能夠運作的原因。一疊線性變換只是一個大的線性變換。層與層之間的啟動函數讓網路能夠學習複雜的非線性模式——曲線、邊緣和使神經網路強大的微妙關係。
AI Ethics
負責任 AI、倫理 AI
安全
研究 AI 開發和部署所引發的道德問題:AI 系統延續了什麼偏見?AI 出錯時誰受害?AI 的決策應如何解釋?當自主系統造成損害時誰負責?AI 倫理涵蓋公平性、透明度、問責制、隱私和 AI 系統的社會影響。
為什麼重要: AI 系統為數十億人做出影響招聘、貸款、刑事司法、醫療保健和內容審核的決策。這些決策編碼了價值觀——包含了誰的資料、優化了什麼結果、諮詢了誰。AI 倫理不是抽象的哲學練習;它是 AI 系統是讓世界更公平還是更不公平的實際問題。
AI Regulation
EU AI Act、AI 政策
安全
管理 AI 系統開發和部署的法律和政策。歐盟 AI 法案(2024 年)是最全面的,按風險等級分類 AI 系統並據此施加要求。美國採取更具部門特定性的方法,透過行政命令和機構指引。中國則有針對生成式 AI、深偽技術和推薦演算法的監管規定。
為什麼重要: 監管塑造了 AI 公司能建造什麼、必須如何建造,以及必須揭露什麼。歐盟 AI 法案影響任何服務歐洲使用者的公司。理解監管格局對於任何建造或部署 AI 的人來說越來越必要——不合規可能意味著罰款、禁令或責任。
Apple 的裝置端和雲端 AI 系統,整合於 iPhone、iPad 和 Mac。Apple Intelligence 在 Apple 晶片上本地運行較小的模型以處理隱私敏感任務(文字改寫、摘要、影像生成),並將複雜請求路由到 Apple 的 Private Cloud Compute 伺服器。對於超出自身能力的任務,它還整合外部模型(如 ChatGPT),但需使用者同意。
為什麼重要: Apple Intelligence 代表了全球最有價值公司的消費者 AI 策略,觸及超過十億台裝置。其對隱私的強調(裝置端處理、具有可驗證安全性的 Private Cloud Compute)提供了與 OpenAI 和 Google 雲端優先方法不同的模式。如果 Apple 做好了 AI,它將為數十億非技術使用者普及裝置端 AI。
公司
一家以色列 AI 公司,以 Jamba 聞名——第一個結合 Transformer 注意力層與 Mamba SSM 層的生產級混合架構。AI21 由 AI 研究者(包括 Yoav Shoham)創立,自 2017 年以來一直在建造語言模型,早於 ChatGPT。其模型透過 API 和雲端供應商提供。
為什麼重要: AI21 Labs 之所以重要,是因為 Jamba 證明了混合 Transformer-SSM 架構在實踐中可行,而不僅僅存在於研究論文中。透過交錯注意力和 Mamba 層,Jamba 以比同等品質的純 Transformer 模型更低的記憶體使用量實現了 256K 上下文視窗。這種混合方法可能是 LLM 架構的未來。
標註
資料標記、資料標註
訓練

向原始資料添加標籤、標記或後設資料的過程,使其可用於監督學習。標註圖像意味著在物體周圍繪製邊界框。標註文本意味著標記實體、情感或意圖。為 RLHF 標註意味著按品質排列模型回應。標註是將原始資料轉化為訓練資料的人工勞動。

為什麼重要:

標註是監督式 AI 不起眼的基礎。每個標記的資料集、每個微調的模型、每個對齊的助手都依賴於花費數小時正確標記資料的人工標註者。標註的品質直接決定了模型品質 — 不一致或有偏差的標記會產生不一致和有偏差的模型。這是建構 AI 系統中最勞動密集且通常最昂貴的部分。

代理工作流程
智能體架構、AI 工作流程
使用AI

一種設計模式,其中 AI 智能體編排多步驟流程 — 規劃、執行工具、評估結果並迭代 — 以完成複雜任務。與單一的提示-回應交換不同,代理工作流程涉及迴圈:智能體行動、觀察結果、決定下一步做什麼,然後繼續直到任務完成或需要人類輸入。

為什麼重要:

代理工作流程是 AI 從「回答問題」轉變為「完成工作」的方式。聊天機器人一次回答一個問題。代理工作流程則研究一個主題、撰寫草稿、審查其準確性並修改 — 全部自主完成。這種模式正在程式碼生成(Cursor、Claude Code)、研究(Perplexity、Deep Research)和企業自動化中出現。

AI 基準測試
MMLU、HumanEval、ARC、HellaSwag
基礎

用於衡量和比較 AI 模型能力的標準化測試。MMLU 測試 57 個學術科目的知識。HumanEval 測試程式碼生成。ARC 測試科學推理。HellaSwag 測試常識推理。GSM8K 測試數學。基準分數為比較模型提供了通用語言,儘管它們有顯著的局限性。

為什麼重要:

基準測試是產業的計分方式。當 Anthropic 說 Claude 在 MMLU 上得分 X%、在 HumanEval 上得分 Y% 時,這些數字只有在你知道基準測試測試什麼、如何評分以及它們的局限性是什麼時才有意義。理解基準測試有助於你看穿行銷聲稱,並評估哪個模型對你的特定使用案例真正最好。

基礎
在經歷炒作和未實現期望的週期後,AI 研究的資金、興趣和進展減少的時期。歷史上有過兩次主要的 AI 寒冬:第一次從 1970 年代中期到 1980 年代初期(在專家系統未能擴展之後),第二次從 1980 年代末期到 1990 年代中期(在神經網路達到計算極限之後)。每一次都伴隨著瘋狂的樂觀主義,然後是幻滅。
為什麼重要: 理解 AI 寒冬為評估今天的 AI 聲明提供了必要的背景。這個模式——突破、炒作、過度承諾、未達預期、資金崩塌——已經重複了兩次。當前的深度學習熱潮是否會遵循同樣的模式或打破它,是 AI 領域最重要的問題。對另一次寒冬的最佳防禦是對當前系統能做什麼和不能做什麼的誠實評估。
自主代理
AI 代理、代理式 AI
使用AI
一種能夠在最少人類監督下獨立規劃、決策和執行多步驟任務的 AI 系統。給定一個高層級目標(「研究競爭對手並撰寫報告」),自主代理將其分解為步驟,使用工具(網路搜尋、程式碼執行、檔案管理),處理錯誤,並交付結果。自主程度從「每一步都請求許可」到「直接執行並回報結果」不等。
為什麼重要: 自主代理是超越聊天機器人和副駕駛的下一步演進。聊天機器人回答問題。副駕駛協助完成任務。代理獨立完成任務。經濟潛力巨大——能夠以極低的成本和時間處理例行知識工作(研究、資料分析、客服、程式碼審查)的代理。但可靠性和安全性的挑戰仍然重大。
Adam Optimizer
別名:Adam、AdamW
訓練
訓練神經網路最廣泛使用的最佳化演算法。Adam(自適應動差估計)結合了動量(使用過去梯度的移動平均)和自適應學習率(透過過去梯度大小的倒數來縮放更新)。AdamW 加入了解耦權重衰減以獲得更好的正規化。幾乎所有現代 LLM 都使用 AdamW 訓練。
為什麼重要: Adam 在廣泛的任務和超參數範圍內都能良好運作,使其成為預設最佳化器。理解它能解釋為什麼訓練大多數時候「就是能用」(Adam 為每個參數自適應),以及為什麼有時不行(Adam 的記憶體需求是模型參數的 2 倍,這對大型模型很重要)。在 90% 的情況下,它也是「我該用哪個最佳化器?」的答案。
AI Observability
別名:LLM 監控、AI 追蹤、LLMOps
基礎設施
監控和理解 AI 系統在生產環境中的行為——即時追蹤輸入、輸出、延遲、成本、錯誤和品質指標。AI 可觀測性就像應用程式監控(Datadog、New Relic),但專門針對 AI:追蹤提示-回應對、偵測品質下降、監控幻覺,以及對異常行為發出警報。
為什麼重要: 在沒有可觀測性的情況下部署 AI 系統就像盲飛。你不知道模型是否比平時更多地產生幻覺、延遲是否在攀升、特定類型的查詢是否失敗,或者成本是否在飆升。AI 可觀測性將「它似乎能用」變成「我們知道它能用,也知道什麼時候不行。」這是演示和生產系統之間的差別。
AWS Bedrock
別名:Amazon Bedrock
公司
Amazon Web Services 的託管平台,用於透過統一的 API 存取和部署來自多個供應商(Anthropic、Meta、Mistral、Cohere、Stability AI、Amazon 自己的 Titan 模型)的基礎模型。Bedrock 處理模型託管、擴展和微調,讓企業在不管理 GPU 基礎設施的情況下使用 AI。它還提供護欄、知識庫(RAG)和代理功能。
為什麼重要: AWS Bedrock 是大多數財富 500 強企業存取 AI 模型的方式。其多模型方法讓企業透過單一 API 比較和切換供應商(Claude、Llama、Mistral),避免供應商鎖定。對於已經在 AWS 上的企業(大多數大型企業),Bedrock 是 AI 採用阻力最小的路徑——相同的帳戶、相同的帳單、相同的合規框架。
AI 的 A/B 測試
線上評估、分流測試
基礎設施
透過隨機將真實使用者分配到兩個 AI 系統變體(不同的模型、提示或配置),比較哪個在關鍵指標上表現更好。與離線評估(基準測試、測試集)不同,A/B 測試揭示變更如何影響實際使用者行為——參與度、滿意度、任務完成率和營收。
為什麼重要: 離線指標不一定能預測真實世界的表現。在基準測試中得分更高的模型可能產生使用者較不喜歡的回應。提高品質的提示變更可能增加延遲到使用者放棄的程度。A/B 測試是了解變更是否真正改善使用者體驗的唯一方法。這是每個主要 AI 產品做部署決策的方式。
注意力視覺化
注意力圖、注意力熱力圖
基礎
透過將注意力權重顯示為熱力圖來視覺化 Transformer 模型「關注」了什麼。對於每個查詢 token,注意力圖顯示它對其他每個 token 分配了多少權重。高權重(亮點)表示強關注——模型認為那些 token 與當前計算高度相關。
為什麼重要: 注意力視覺化是窺探 Transformer 內部並理解其推理過程最直觀的方式。當模型將「le chat noir」翻譯為「the black cat」時,注意力圖顯示「black」強烈關注「noir」,而「cat」關注「chat」。這有助於除錯模型行為、理解失敗原因,並建立對注意力運作方式的直覺。
AlexNet
AlexNet
模型

在 2012 年 ImageNet 競賽中以巨大優勢獲勝的卷積神經網路,引發了深度學習革命。由 Alex Krizhevsky、Ilya Sutskever 和 Geoffrey Hinton 創建,AlexNet 將圖像分類錯誤率從 26% 降低到 16% — 差距之大使電腦視覺社群確信深度學習從根本上優於手工設計的特徵。

為什麼重要:

AlexNet 是 AI 歷史上的「前後」分水嶺時刻。2012 年之前,大多數 AI 研究者從事特徵工程和非神經方法。AlexNet 之後,深度學習成為主導範式。每個現代 AI 系統 — GPT、Claude、Stable Diffusion — 都可以追溯到 AlexNet 引發的範式轉移。它是現代 AI 的大爆炸。

Bria
授權訓練資料、企業級圖像生成
公司
以色列的人工智慧公司,僅使用獲得授權且標明來源的訓練數據來建立其影像生成模型,定位為企業在需要AI生成視覺內容時的首選方案——無版權風險。
為什麼重要: Bria 是最顯著的測試案例,用以驗證是否能在完全授權的訓練數據上建立 AI 圖像生成技術,同時在商業上具競爭力。在面臨版權訴訟雪崩的產業中,他們的方法為企業提供了一條採用生成式 AI 的途徑,而無需承擔法律風險——這個價值主張隨著針對競爭對手的每一項新訴訟而變得更具說服力。如果 Bria 成功,將驗證整個負責任的人工智慧開發哲學;如果它遇到困難,則暗示市場最終並不在乎數據來源,也不願為此支付高價。
字節跳動
豆包、TikTok、AI 驅動的推薦系統
公司
母公司為TikTok,也是全球最有價值的科技公司之一。其AI實驗室開發了Doubao模型家族,並驅動每日服務超過十億用戶的推薦演算法。
為什麼重要:

字節跳動是全球最有價值的私營科技公司,以規模部署AI技術,少有組織能與之比擬,透過TikTok、抖音以及不斷擴展的AI驅動產品組合,每日服務超過十億用戶。他們的Doubao模型家族與火山引擎雲平台,使他們在基礎模型競賽中成為一股不可小觑的力量,背後擁有大多數AI新創公司只能夢寐以求的資源:龐大且盈利的核心業務,以及內建的十億用戶分發渠道。

Black Forest Labs
FLUX.1 系列模型
公司
由 Stable Diffusion 的原始創作者在離開 Stability AI 後創立。他們的 FLUX 模型迅速成為開源圖像生成的新標準,超越了他們離開時所留下的模型的品質。
為什麼重要:

Black Forest Labs 代表了開源 AI 的最佳案例:Stable Diffusion 的原始開發者以更先進的技術、更聰明的商業策略,以及創意社群的信任重新出發。FLUX.1 不僅僅是在 Stable Diffusion 上進行迭代 — 它直接跳過了舊有技術,而他們率先提出的分層授權模式,正逐漸成為 AI 公司在開放性與營收之間取得平衡的藍圖。

基準測試
Benchmark
訓練

用來評估和比較AI模型的標準化測試。基準測試會衡量特定能力—推理(ARC)、數學(GSM8K)、程式設計(HumanEval)、一般知識(MMLU)—並產生可跨模型比較的分數。

為什麼重要: 基準測試是產業界評分的方式,但它們並不完美。模型可以被訓練來在基準測試中取得高分,但這並不表示它們真的更好。實際應用中的表現往往講述著不同的故事。應將其視為信號,而非真理。
安全
AI輸出中系統性模式—反映或放大訓練數據中存在的社會偏見。偏見可能出現在文本生成、圖像生成、招聘工具,以及模型做出影響人們不同的決定的任何地方。
為什麼重要: 如果訓練資料中提到護士是女性、工程師是男性,模型將會延續這種觀念。偏見並不總是顯而易見——它藏在詞語關聯、預設假設以及哪些人被代表之中。
BERT
Bidirectional Encoder Representations from Transformers
模型
Google 於 2018 年推出的基於 Transformer 的模型,透過引入雙向預訓練徹底改變了自然語言處理——每個 token 都能關注其他所有 token,使模型具有深層的上下文理解能力。BERT 是一個僅編碼器模型:它擅長理解文本(分類、搜索、命名實體辨識),但不能像 GPT 或 Claude 那樣生成文本。
為什麼重要: BERT 是現代時期最具影響力的 NLP 論文。它證明了在未標註文本上預訓練然後在特定任務上微調可以碾壓每一個現有基準。即使大型語言模型搶走了焦點,BERT 類型的模型仍然驅動著大多數生產環境中的搜索引擎、嵌入系統和分類流程,因為對於非生成式任務來說,它們更小、更快、更便宜。
Batch Size & Epoch
小批量、訓練輪次
訓練
批量大小是模型在更新參數之前處理多少個訓練樣本。一個輪次(epoch)是對整個訓練資料集的一次完整遍歷。一個在 100 萬個樣本上以批量大小 1,000 訓練 3 個輪次的模型,每次更新處理 1,000 個樣本,每個輪次需要 1,000 次更新,總共 3,000 次更新。
為什麼重要: 批量大小和輪次是訓練中最基本的控制項。批量大小影響訓練速度、記憶體使用,甚至影響模型學到什麼(小批量增加有助於泛化的雜訊;大批量收斂更快但泛化能力可能更差)。輪次數決定模型看到每個樣本的次數——太少會欠擬合,太多會過擬合。
BLEU 與 ROUGE
BLEU 分數、ROUGE 分數
基礎

通過將模型輸出與參考文本進行比較來評估文本生成品質的經典指標。BLEU(雙語評估替代方法)衡量生成文本中有多少 n-gram 出現在參考文本中 — 最初設計用於機器翻譯。ROUGE(面向召回的摘要評估替代方法)衡量參考文本中有多少 n-gram 出現在生成文本中 — 設計用於摘要。

為什麼重要:

BLEU 和 ROUGE 是自然語言處理超過十年的標準評估指標,至今仍被廣泛使用。理解它們 — 以及它們的局限性 — 有助於你評估 NLP 研究聲稱並理解該領域為何正轉向人工評估和基於模型的評估。高 BLEU 分數不保證品質;低 BLEU 分數不保證失敗。

BPE
位元組對編碼、子詞分詞
基礎

建構分詞器詞彙表最常用的演算法。BPE 從單個位元組或字元開始,反覆合併最頻繁的相鄰對成為新的 token。經過數千次合併後,常見的單詞會變成單一 token(如「the」、「function」),而罕見的單詞會被分割成子詞片段(如「un」+「common」)。GPT、Claude、Llama 及大多數現代 LLM 都使用 BPE。

為什麼重要:

BPE 正是你的分詞器以特定方式運作的原因。它解釋了為什麼常見單詞很「便宜」(一個 token)、為什麼罕見單詞很「昂貴」(多個 token),以及為什麼非英語文本成本更高(分配給非英語字元對的合併較少)。理解 BPE 有助於你預測 token 數量、最佳化提示詞,以及理解為什麼不同的分詞器對相同文本會產生不同的結果。

反向傳播
Backprop、反向傳遞
基礎

計算神經網路中每個參數對誤差的貢獻程度的演算法,使梯度下降能有效地更新參數。反向傳播透過網路反向應用微積分的鏈式法則:從輸出的損失開始,將梯度逆向傳播通過每一層,以確定每個權重應承擔的責任。

為什麼重要:

反向傳播是使神經網路訓練成為可能的演算法。沒有高效計算數十億參數梯度的方法,梯度下降在計算上是不可行的。你使用的每個模型 — 從小型分類器到 400B 的 LLM — 都是使用反向傳播訓練的。它是深度學習中最重要的單一演算法。

電腦視覺
CV、機器視覺
基礎

人工智慧領域專注於讓機器能夠解釋和理解來自世界的視覺資訊——圖片、視頻、3D場景和文件。

電腦視覺推動了從人臉辨識與自動駕駛到醫療影像與AI影像生成等各項應用。

核心任務包括物件偵測、影像分類、分割、OCR與姿勢估計。

為什麼重要: 電腦視覺是深度學習首次明確超越人類表現的領域(ImageNet 2012),至今仍是影響力最大的AI應用之一。每一個你生成的AI圖像或影片、每一份你進行光學字元辨識的文件、每一台具備智慧偵測功能的監視攝影機——全都屬於電腦視覺的應用範疇。
內容審核
AI 審核、信任與安全
安全

運用AI來大規模偵測與過濾有害、非法或違規的內容。這包括文字分類(恨意言論、垃圾訊息、威脅),影像分析(NSFW檢測、CSAM),以及影片審查。現代系統會結合AI分類器與人工審查,但AI本身所產生的內容數量正造成審查危機—如今你必須用AI來審查AI。

為什麼重要:

每個擁有使用者產生內容的平台都需要內容管理,而AI是應對規模的唯一方法。但內容管理比看起來更困難——語境至關重要,文化規範也各不相同,誤判的假陽性會壓制合法言論,而假陰性則讓傷害得以通過。

Cartesia
Sonic、基於 SSM 的語音模型
公司
基於狀態空間模型(SSM)架構,而非 Transformer 架構的語音 AI 起點公司。他們的 Sonic 模型實現了超低延遲的語音生成,讓即時對話式 AI 首次感覺真正自然。
為什麼重要: Cartesia 的重要性在於他們證明了狀態空間模型不僅僅是研究上的奇思妙想,而是用於即時語音 AI 的商業可行架構。他們低於 100 毫秒的延遲首次讓真正自然的對話式 AI 成為可能,縮小了 “與機器人對話” 和 “與真人對話” 之間的差距。當產業逐漸轉向以語音為先的 AI 代理時,Cartesia 在串流速度上的架構優勢,可能讓他們成為其他人都會在其上建立的基礎層。
Cohere
Command、Embed、Rerank 模型
公司
以企業應用為導向的人工智慧公司,由Aidan Gomez共同創立,他是原始《Attention Is All You Need》Transformer論文的共同作者之一。專注於針對企業應用場景優化的模型、RAG技術以及多語言支援。
為什麼重要:

Cohere代表了在由千兆美元規模的超大雲端服務商與面向消費端的前沿實驗室主導的時代,專注於企業優先的AI公司是否能獨立蓬勃發展的最清晰測試案例。他們源自Transformer論文的技術血統賦予了他們真正的技術可信度,其部署彈性解決了受監管產業的真實痛點,而他們的embedding與rerank模型已成為全球生產級RAG系統的首選工具。如果AI的未來不再聚焦於聊天機器人,而是更多地融入每一個商業流程的基礎設施,Cohere將處於極其重要的地位。

使用AI
一種提示技術,要求模型在給出最終答案前逐步展示其推理過程。模型不會直接下結論,而是—公開其思考過程—這大幅提升了在複雜任務中的準確性。
為什麼重要:

要求「解釋你的推理過程」不只是為了透明度—事實上,這會讓模型變得更聰明。早期研究顯示,CoT可將數學錯誤減少高達50%。目前大多數現代模型都會在內部進行此操作。

上下文視窗
上下文長度
使用AI
模型在單次對話中可處理的最大文字量(以 token 為單位)。這包括您的輸入和模型的輸出內容。如果某模型具有 200K 的上下文視窗,這大約相當於 15 萬字 — 約等同於兩本小說的篇幅。
為什麼重要:

上下文視窗大小決定了你可以做什麼。總結整個程式碼庫?需要大規模的上下文。快速提問回答?小規模就夠了。但規模更大不一定更好—模型在非常長的上下文中可能會失去焦點。

語料庫
資料集、訓練資料
訓練
用來訓練模型的文本資料(或其他數據)。語料庫的範圍可以從精選的書籍和論文集合,到對整個互聯網的大規模抓取。語料庫的品質與組成根本影響模型所掌握的知識以及其行為方式。
為什麼重要:

垃圾進來,垃圾出去。在Reddit上訓練的模型與在科學論文上訓練的模型對話方式會有所不同。這就是我們為Sarah精心整理自己的語料庫的原因—通用的網頁爬蟲產生了混亂且不連貫的結果。

使用AI

用於對話式 AI 互動的軟體介面。現代聊天機器人(Claude、ChatGPT、Gemini)由 LLM 驅動,能處理開放式對話、程式碼、圖片和工具。

為什麼重要: 大多數人與 AI 互動的主要方式。聊天機器人是建立在模型之上的產品,而不是模型本身。
公司

AI 原生程式碼編輯器(VS Code 分支)。深度 LLM 整合:行內生成、多檔案編輯、程式碼庫感知的上下文。

為什麼重要: 賭注是 AI 將從根本上改變程式碼的撰寫方式。快速被採用,帶來可衡量的生產力提升。
Classification
分類器、分類法
基礎
將輸入分配到預定義類別之一的任務。「這封電子郵件是垃圾郵件嗎?」(二元分類)。「這張影像是貓、狗還是鳥?」(多類別分類)。「這些標籤中哪些適用於這篇文章?」(多標籤分類)。分類是最常見的監督式學習任務,也是無數實際 AI 應用的基礎。
為什麼重要: 分類是大多數人在實務中首次接觸機器學習的場景——垃圾郵件過濾、內容審核、醫療診斷、詐欺偵測、情感分析。理解分類有助於理解整個監督式學習流程:標註資料輸入、訓練模型、輸出預測。
CNN
卷積神經網路、ConvNet
模型
一種設計用於處理網格狀資料(影像、音訊頻譜圖)的神經網路架構,透過在輸入上滑動小型濾波器(核)來偵測邊緣、紋理和形狀等局部模式。CNN 從 2012 年(AlexNet)到 2020 年左右 Vision Transformer 出現之前一直主導電腦視覺。它們在生產環境中仍被廣泛使用,尤其是在邊緣裝置上。
為什麼重要: CNN 掀起了深度學習革命。AlexNet 在 2012 年 ImageNet 上的勝利證明,深度神經網路可以大幅超越手工設計的特徵,引發了當前的 AI 熱潮。理解 CNN 有助於理解 Transformer 為何有效(許多相同的概念——分層特徵、參數共享——同樣適用),而且 CNN 對於資源受限裝置上的許多視覺任務仍然是最佳選擇。
安全
Anthropic 開發的一種對齊技術,模型被訓練為遵循一套原則(「憲法」),而不是僅依賴人類回饋來做每個決策。模型根據這些原則批評和修改自己的輸出,然後在修改後的輸出上進行訓練。這減少了對人類標註者的需求,並使對齊標準變得明確和可審計。
為什麼重要: 憲法式 AI 解決了 RLHF 的兩個問題:它昂貴(每個訓練範例都需要人類標註者)且不透明(標準隱含在標註者的判斷中)。透過使原則明確化,CAI 使對齊更加透明、可擴展和一致。這是 Claude 訓練方式的核心部分。
訓練
當神經網路在新任務上訓練時,失去了執行先前學習任務的能力。在客服資料上微調模型可能使其在客服方面表現出色,但在編碼方面變得糟糕。新的學習覆蓋了編碼舊能力的權重,「遺忘」了它們。
為什麼重要: 災難性遺忘是微調和持續學習的核心挑戰。這就是為什麼你不能一直在一個任務接一個任務上微調模型並期望它什麼都做得好。這也是為什麼像 LoRA(只修改一小部分參數)和仔細的學習率選擇等技術對保留基礎模型能力至關重要。
Contamination
資料污染、基準洩漏
基礎
當基準測試資料出現在模型的訓練資料中,使其分數被膨脹而不反映真正的能力。如果模型在訓練期間看到了測試題目而「事先複習了答案」,其基準效能就毫無意義。隨著訓練資料集越來越大並抓取更多的網際網路內容(基準資料通常在網上公布),污染正成為日益嚴重的問題。
為什麼重要: 污染破壞了 AI 產業用來比較模型的整個基準系統。一個因為記住答案而在 MMLU 上得 90% 的模型,並不比一個從未見過答案而得 80% 的模型更聰明。隨著更多基準洩漏到訓練資料中,社群被迫不斷建立新基準,而私有的保留評估變得比公開排行榜更重要。
Chatbot Arena
LMSYS Arena、ELO 排名
基礎
一個由 LMSYS 開發的群眾外包平台,使用者與兩個匿名 AI 模型並排聊天,並投票選出哪個回應更好。結果用於計算 ELO 評分——與西洋棋使用的相同排名系統——建立一個基於真實人類偏好而非自動化基準的持續更新模型品質排行榜。
為什麼重要: Chatbot Arena 可以說是目前最受信任的模型比較,因為它抵抗污染(問題是新穎的)、反映真實使用者偏好(而非合成基準),並讓模型直接對決(相對比較比絕對分數更可靠)。當人們說「Claude 在程式設計上比 GPT 好」或反之,Arena 排名通常就是證據。
Cerebras
Cerebras Systems、WSE
公司
一家建造晶圓級 AI 處理器的晶片公司——晶片大小相當於整片矽晶圓,比標準 GPU 大 100 倍以上。Cerebras WSE-3(Wafer Scale Engine)包含 4 兆個電晶體和 900,000 個核心。其 CS-3 系統設計用於訓練和推理,提供數千個獨立 GPU 叢集的替代方案。
為什麼重要: Cerebras 代表了對 AI 硬體最激進的重新思考。不是將數千個小型晶片以有限的頻寬連接,而是將一切放在一個巨大的晶片上,具有巨大的晶片內記憶體頻寬。潛在優勢在於消除限制多 GPU 訓練的通訊瓶頸。晶圓級計算能否與 NVIDIA 龐大的生態系統競爭,是一個十億美元的問題。
持續學習
終身學習、增量學習
訓練

模型持續從新資料中學習而不忘記之前所學的能力。目前的 LLM 訓練一次後就凍結 — 更新它們需要昂貴的重新訓練。持續學習將允許模型從每次互動中學習、保持最新資訊,並隨時間適應個別使用者,就像人類自然學習的方式。

為什麼重要:

持續學習是 AI 尚未解決的重大問題之一。目前的模型有知識截止日期,無法從更正中學習,並將每次對話視為一張白紙。解決持續學習將消除昂貴的重新訓練週期的需要,實現真正適應每個使用者的個人化 AI,並使模型能持續保持最新狀態。

訓練

一種以有意義的順序 — 通常從簡單到困難 — 呈現範例的訓練策略,而非隨機呈現。就像教學生先學算術再學微積分,課程學習先給模型基礎模式,然後逐步增加複雜性。這可以帶來更快的收斂,有時也能帶來更好的最終效能。

為什麼重要:

課程學習是一種被低估的技術,可以在不改變模型或資料的情況下提高訓練效率。LLM 預訓練越來越多地使用資料排程 — 在最後的訓練階段展示更乾淨、更高品質的資料 — 這就是一種課程學習的形式。你呈現資料的順序很重要,不僅僅是資料本身。

聚類
K-Means、DBSCAN、聚類分析
基礎

一種無監督學習任務,在沒有預定義標籤的情況下將相似的資料點分組在一起。給定客戶購買資料,聚類可能會發現不同的客戶群體(特價獵人、奢侈品買家、偶爾購物者)。K-means 是最常見的演算法:選擇 K 個聚類,將每個點分配到最近的聚類中心,並迭代精煉這些中心。

為什麼重要:

聚類是最常見的無監督學習任務,出現在各處:客戶分群、文件分組、異常偵測(不屬於任何聚類的離群值)、圖像壓縮(將相似的像素分組),以及資料探索(我的資料中存在哪些自然群組?)。它通常是理解新資料集的第一步。

交叉注意力
編碼器-解碼器注意力
基礎
一種注意力機制,其中查詢來自一個序列,而鍵/值來自另一個不同的序列。在編碼器-解碼器模型中,解碼器的查詢關注編碼器的鍵和值,讓解碼器在生成輸出時能「看到」輸入。交叉注意力也是文字在擴散模型中調控影像生成的方式——影像生成過程關注文字提示。
為什麼重要: 交叉注意力是不同模態和架構不同部分之間的橋樑。它是翻譯模型連接源語言和目標語言的方式、影像生成器遵循文字提示的方式、多模態模型將影像與文字關聯的方式,以及檢索增強系統整合檢索文件的方式。每當兩個不同的輸入需要互動時,通常都涉及交叉注意力。
上下文長度擴展
YaRN、NTK 縮放、RoPE 縮放
基礎設施
使語言模型能夠處理比訓練中見過的序列更長序列的技術。在 4K token 上訓練的模型可以透過修改其位置編碼(通常是 RoPE)並結合對較長序列的短期微調,擴展到 32K 或 128K。這避免了從頭在長序列上訓練的巨大成本。
為什麼重要: 上下文長度擴展是模型在短短兩年內從 4K 到 128K 再到 1M 以上上下文窗口的原因。從頭在百萬 token 序列上訓練模型的成本將會極其昂貴。擴展技術透過調整在較短序列上訓練的模型,使長上下文模型變得實用,只需要原始訓練計算量的一小部分。
Convolution
別名:Conv、卷積層、核、濾波器
基礎
一種數學運算,將一個小型濾波器(核)滑過輸入以偵測局部模式。在影像中,一個 3×3 核滑過每個位置,計算與底層像素的內積以產生特徵圖。不同的核偵測不同的模式:水平邊緣、垂直邊緣、紋理,以及在更深層中最終偵測像眼睛或車輪等複雜特徵。
為什麼重要: 卷積是使電腦視覺得以運作的運算。它編碼了兩個強大的假設:局部性(相鄰像素是相關的)和平移等變性(一個模式無論出現在哪裡都是一樣的)。這些假設與全連接層相比大幅減少了參數數量,使處理高解析度影像成為可行。即使在 Transformer 時代,卷積仍用於許多混合架構中。
Character.AI
別名:c.ai
公司
一個用於建立和與 AI 角色聊天的平台——虛構人物、歷史人物和自訂角色,在對話中保持一致的個性、知識和說話模式。由前 Google Brain 研究人員創立,Character.AI 是首批實現大規模消費者採用的 AI 產品之一,擁有數百萬日活躍使用者,主要為年輕族群。
為什麼重要: Character.AI 證明了社交/娛樂 AI 可以驅動巨大的參與度——使用者在 Character.AI 上花費的時間比許多社群媒體平台還多。它開創了「AI 伴侶」類別,並展示了個性一致性、情感參與和角色扮演能力在商業上與事實準確性同樣重要。Google 在 2024 年向該公司投資了 27 億美元。
交叉驗證
K-Fold CV、留一法
訓練
一種在沒有足夠資料建立獨立測試集時評估模型效能的技術。K 折交叉驗證將資料分成 K 等份,用 K−1 份進行訓練並在剩餘一份上評估,輪轉 K 次使每個資料點都被用於訓練和評估。所有 K 折的平均分數比單次訓練/測試分割提供更可靠的效能估計。
為什麼重要: 當資料稀少時,交叉驗證至關重要——如果你只有 500 個樣本,留出 100 個用於測試意味著訓練資料減少 20%。交叉驗證讓所有資料同時用於訓練和評估。它還能給你一個信賴區間(各折之間的變異數),而非單一數字,告訴你模型效能的穩定性。
公司
一家完全圍繞 AI 工作負載的 GPU 運算而打造的專業雲端供應商。CoreWeave 營運大規模 NVIDIA GPU 叢集(H100、H200),並已獲得數十億美元的股權和債務融資來建設 GPU 資料中心。包括微軟和數家 AI 實驗室在內的主要 AI 公司使用 CoreWeave 進行大規模訓練和推論。
為什麼重要: CoreWeave 是 AI 基礎設施中成長最快的公司之一,押注專業 GPU 雲端供應商能在 AI 工作負載上勝過通用超大規模雲端供應商。他們的專注使 GPU 利用率更高、專用網路(InfiniBand 用於訓練叢集)更好,定價比 AWS/GCP 低 30–50%。
餘弦相似度
餘弦距離、向量相似度
基礎

一種基於兩個向量之間夾角的相似度度量,忽略它們的大小。餘弦相似度為 1 表示兩個向量指向同一方向(意義相同),0 表示垂直(不相關),-1 表示方向相反。它是在語意搜尋、RAG 和推薦系統中比較文本嵌入的標準相似度指標。

為什麼重要:

每次你進行語意搜尋、使用 RAG 或比較嵌入時,餘弦相似度(很可能)就是決定什麼是「相似」的指標。理解它有助於你除錯檢索品質、在餘弦和替代方案(點積、歐幾里得距離)之間做選擇,以及理解為什麼某些搜尋會遺漏明顯的匹配。

CLIP
對比語言-圖像預訓練
模型

OpenAI(2021 年)的一個模型,透過在 4 億個圖像-文字描述對上訓練來學習連接圖像和文本。CLIP 將圖像和文本編碼到同一個嵌入空間中,其中匹配的圖像-文本對距離近,不匹配的對距離遠。它是大多數現代多模態 AI 系統中連接語言與視覺的橋樑。

為什麼重要:

CLIP 是文本到圖像生成(Stable Diffusion、DALL-E)、圖像搜尋、零樣本圖像分類和多模態理解的骨幹。當你輸入提示詞並獲得圖像時,CLIP(或其後繼者)就是將你的文字連接到視覺概念的東西。它證明了僅透過自然語言監督就能學習強大的視覺表示,不需要標記的圖像資料集。

ControlNet
控制網路
模型

一種為圖像生成模型增加空間控制的架構。ControlNet 不是只用文字描述你想要什麼(「一個人站著」),而是讓你指定怎麼做 — 提供邊緣圖、深度圖、姿態骨架或分割圖來引導構圖。生成的圖像會遵循控制輸入的空間結構,同時根據文字提示填充細節。

為什麼重要:

ControlNet 使 AI 圖像生成能被專業工作流程使用。沒有它,你只能得到隨機構圖並期待最好的結果。有了它,你可以指定所需的確切姿態、佈局或結構。這就是「生成大致像我想要的東西」和「生成具有這些細節的確切構圖」之間的差異 — 這對於設計、廣告和製作工作至關重要。

對比學習
SimCLR、InfoNCE
訓練

一種自監督學習方法,透過對比正對(相似的項目,應在嵌入空間中接近)和負對(不相似的項目,應在嵌入空間中遠離)來訓練模型。CLIP 對比匹配的圖像-文本對和不匹配的對。SimCLR 對比同一圖像的增強視圖和不同圖像的視圖。模型學習到嵌入空間中的相似性反映真實世界的相似性的表示。

為什麼重要:

對比學習是大多數嵌入模型的訓練方式 — 這些模型驅動著語意搜尋、RAG 和推薦系統。它也是 CLIP 背後的訓練方法,連接了語言和視覺。每當你使用嵌入來衡量相似性時,對比學習很可能就是這些嵌入的建立方式。

檢查點
模型檢查點、快照
訓練

在訓練過程中儲存的模型狀態快照 — 權重、最佳化器狀態、學習率排程和訓練步數。檢查點讓你能在中斷後恢復訓練(硬體故障、被搶佔)、評估模型的中間版本,以及在訓練退化時回退到較早的版本。每隔幾千步儲存檢查點是標準做法。

為什麼重要:

訓練大型模型需要數天到數月。沒有檢查點,在 100,000 步訓練的第 90,000 步發生 GPU 故障就意味著從頭開始。檢查點是保險:它們漸進地儲存進度,所以你只會失去自上次檢查點以來的工作。它們也能實現模型選擇 — 有時較早的檢查點在你的評估指標上表現比最終版本更好。

基礎
深度學習是機器學習的一個子領域,它使用具有許多層(因此稱為「深度」)的神經網絡來學習數據的層次化表示。每一層都會將其輸入轉換為稍微更抽象的東西——從像素到邊緣,再到形狀、物件與概念。深度學習正是使現代 AI 革命成為可能的關鍵:它正是大型語言模型(LLMs)、影像生成器、語音辨識,以及自 2012 年以來幾乎所有 AI 突破性進展背後的技術方法。
為什麼重要: 深度學習是當前AI時代的引擎。在2012年之前,AI是由各種專門算法零散組合而成的。深度學習將所有內容統一於同一個架構下:堆疊足夠的層數、輸入足夠的數據、投入足夠的計算資源,模型便會自行處理其餘部分。理解深度學習,就是理解為何AI突然間開始有效運作。
開發者工具
AI SDK、AI 框架
工具
由程式庫、框架和平台組成的生態系統,讓開發 AI 驅動的應用程式變得更加容易。這包括協調框架(LangChain、LlamaIndex)、推論伺服器(vLLM、llama.cpp)、微調工具(Axolotl、Unsloth)、評估框架(LMSYS、Braintrust)以及全功能平台(Vercel AI SDK、Hugging Face)。工具生態每月都有變化—
為什麼重要: 原生模型 API 是必要的,但不夠。開發者工具在「我有 API 金鑰」與「我有生產應用程式」之間架起橋樑。正確的工具可將開發時間從數月縮短至數天,而錯誤的工具則會增加複雜度卻沒有帶來任何價值。
深度偽造
合成媒體、AI 生成的偽造內容
安全
AI生成的圖像、影片或音頻,旨在逼真地描繪真實人物說或做他們從未做過的事情。原本基於GAN技術,現代的深度偽造技術現在使用擴散模型和聲音克隆,產生越來越難與現實區分的輸出。檢測工具雖然存在,但始終落後於生成技術的進步。
為什麼重要: 深度偽造(Deepfakes)是生成式AI創造力的陰暗面——已被用於詐騙、非自願的私密影像、政治操縱與身份盜用。目前這項技術已足夠普及,只要擁有筆電的任何人都能製作出令人信服的偽造內容,這使得偵測、水印技術與法律架構成為亟需處理的重點。
資料中心
AI 資料中心、GPU 叢集
基礎設施

用以容納伺服器、GPU、網路設備與冷卻系統等硬體設施,這些設施用於訓練與運行人工智慧模型。現代人工智慧資料中心專為大規模平行運算而設計,耗電量可達兆瓦級,且需要專業冷卻系統。單一前沿模型的訓練作業可能需要整個設施中數千個GPU運行數個月。

為什麼重要:

數據中心是AI時代的工廠。每次對Claude的查詢、Midjourney產生的圖片、Runway產生的影片,都依賴這些建築物內的硬體設備運行。全球AI就緒數據中心容量的短缺,是AI成長最大的限制之一—也是最大的投資機會之一。

DeepL
神經機器翻譯、DeepL Pro
公司
這家德國AI公司被廣泛視為全球最優秀的機器翻譯服務提供商—由一群計算語言學家打造,他們的表現始終超越Google Translate及其他大型科技公司的產品,尤其是在歐洲語言方面。
為什麼重要:

DeepL 是專注於 AI 的公司能夠在核心能力上持續超越數兆美元競爭對手的最佳證明。在這個通常規模越大越好的領域,DeepL 對 Google 和 Microsoft 的翻譯品質優勢仍然可衡量且具意義,尤其是在歐洲語言和專業應用場景中。他們的成功挑戰了通用型 AI 模型最終會使專業任務商品化的假設 — 對於數以十萬計依賴精準跨語言溝通的企業而言,這種專業化是值得付費的。

Decart AI
即時世界模擬、遊戲生成
公司
以色列AI公司突破即時AI生成的界限。其技術能夠即時生成互動式遊戲般的環境,模糊傳統渲染與AI生成之間的界限。
為什麼重要:

Decart AI 展示了大多數人認為還需數年才能實現的技術:一個神經網絡即時生成可玩、互動的三維世界,而無需傳統遊戲引擎的參與。他們的 Oasis 演示是原生 AI 世界模擬的一個概念驗證,這項技術的影響遠超遊戲領域——從自動駕駛到機器人技術,再到空間計算。如果即時世界模型能達到生產級的實際應用,Decart 最早關於推論優化與互動生成的研究將成為基礎。

DeepSeek
DeepSeek-V3、DeepSeek-R1
公司

中國AI實驗室於2025年初以DeepSeek-R1震撼業界,該推理模型僅需極低的訓練成本即可匹敵前沿實驗室。由量化對沖基金High-Flyer資助。

為什麼重要: DeepSeek打破了尖端AI必須搭配高額預算的假設。他們以效率為先的作法—僅需極少的訓練成本便能達到GPT-4級與o1級的表現—迫使整個產業重新思考「規模即萬能」的敘事,並重新聚焦於架構創新。R1在MIT授權下開放權重的釋出,以一種西方實驗室從未做到的方式民主化了推理模型的存取。從地緣政治角度看,DeepSeek證明了單靠出口管制無法限制AI能力,這個發現對科技政策、投資與全球AI權力平衡具有深遠影響。
Deepgram
Nova 語音轉文字、Aura 文字轉語音
公司
語音 AI 公司,專注於開發快速且準確的語音辨識與文字轉語音 API。他們的 Nova 模型在準確度上與 OpenAI 的 Whisper 競爭,甚至經常超越它,同時在即時應用中運行速度顯著更快。
為什麼重要: Deepgram 證明了一家新創公司可以從頭開始建立語音辨識,使用端到端深度學習技術,並在準確度方面與 Google、Amazon 和 Microsoft 正面競爭,同時在速度上超越他們。他們以開發者為先的 API 方式,將現代基礎設施模式引入語音 AI,讓將語音轉文字功能加入應用程式變得像使用 Stripe 加入付款功能一樣簡單。隨著對話式 AI 代理程式逐漸普及,Deepgram 正定位自己為關鍵的語音基礎設施層——讓以語音為先的 AI 在實際生產環境中真正運作的基礎建設。
模型

一種生成模型,透過從純噪音開始,逐步去除噪音,直到產生連貫的輸出(如圖片、影片或音訊)。該模型學習反轉將噪音添加到真實數據的過程。Stable Diffusion、DALL-E 3 和 Midjourney 都採用此方法的變體。

為什麼重要: 擴散模型在2022年左右取代了GANs,成為主導的圖像生成技術。它們能生成更多樣且可控的輸出,並成為今日幾乎所有圖像和視頻AI工具的主軸。
訓練

訓練一個較小的「學生」模型來模仿一個較大的「教師」模型,方法是從教師的軟機率分布(而非硬標籤)中學習。軟輸出編碼了硬標籤無法傳達的類別間關係。

為什麼重要: 蒸餾讓強大的 AI 變得可及。一次 70B→7B 的蒸餾可以在 10% 的成本下保留 90% 的能力。許多本地運行的模型都是從前沿模型蒸餾而來。
DPO
直接偏好優化
訓練

RLHF 的替代方案,用於模型對齊。DPO 使用偏好/拒絕回應的配對直接優化模型,無需獨立的獎勵模型或強化學習。更簡單、更穩定、更省算力。

為什麼重要: DPO 讓對齊技術民主化了。RLHF 的多階段管線既繁瑣又不穩定;DPO 將其壓縮為一個步驟。許多開放權重模型現在都使用 DPO 的變體。
Dataset
訓練集、資料
基礎
用於訓練、評估或測試機器學習模型的結構化資料集合。資料集可以是標註的(每個範例都有已知的正確答案)或未標註的(沒有註解的原始資料)。資料集的品質、大小、多樣性和代表性從根本上決定了模型能學到什麼。
為什麼重要: 垃圾進,垃圾出。在糟糕的資料集上訓練的最精妙架構也只會產生糟糕的結果。反之,在優質資料上訓練的簡單模型往往能勝過在雜訊上訓練的複雜模型。資料集整理可說是 AI 開發中影響最大但最不受矚目的部分。
Dropout
正則化、權重衰減
訓練
一種正則化技術,在每個訓練步驟中隨機「關閉」一部分神經元,將其輸出設為零。這防止網路過度依賴任何單一神經元,迫使其學習分散的、穩健的表示。在推理時,所有神經元都是活躍的,但會進行相應的縮放。
為什麼重要: Dropout 是對抗過擬合最簡單且最廣泛使用的防禦手段。沒有正則化,大型神經網路會記住訓練資料而不是學習可泛化的模式。Dropout(及其近親權重衰減)是模型能夠遠大於其訓練集卻不會只是記住一切的原因。
一種將擴散模型中傳統使用的 U-Net 骨幹替換為 Transformer 的架構。DiT 將注意力機制應用於影像生成,實現了使 LLM 如此強大的相同擴展行為。Sora、Flux、Stable Diffusion 3 以及大多數最先進的影像和影片生成器都使用 DiT 或其變體。
為什麼重要: DiT 將語言和影像生成的世界統一在單一架構範式之下:Transformer。這意味著為 LLM 開發的擴展定律、訓練技術和優化策略在很大程度上可以轉移到影像和影片生成。這就是為什麼影像品質提升如此迅速——該領域正在乘著與語言相同的擴展曲線。
透過建立現有樣本的修改版本來人工擴展訓練資料集的技術。對於影像:翻轉、旋轉、裁剪、色彩偏移。對於文本:改寫、回譯、同義詞替換。對於音訊:速度變更、雜訊注入。目標是教會模型不變性——無論影像被翻轉、變暗還是裁剪,貓就是貓。
為什麼重要: 當你的資料有限時,資料增強是提升模型效能最便宜的方式。它透過向模型展示每個樣本的多種變體來減少過擬合,教導它專注於本質特徵而非表面細節。在電腦視覺中,增強通常能免費提供 2-5% 的準確率提升。
分散式訓練
資料平行化、模型平行化、FSDP
基礎設施

同時在多個 GPU 或機器上訓練模型。資料平行化給每個 GPU 一份模型副本並分割訓練資料。模型平行化在模型太大而無法放入一個 GPU 時將模型本身分割到多個 GPU 上。FSDP(完全分片資料平行化)和 DeepSpeed 等現代方法結合了兩者,實現了數千億參數模型的訓練。

為什麼重要:

沒有前沿模型能放在單一 GPU 上。訓練 GPT-4 或 Claude 需要數千個 GPU 共同工作數月。分散式訓練是使這成為可能的工程 — 它與架構或資料同等關鍵。你的分散式訓練效率直接決定了在給定預算下你能訓練多大的模型。

雙重用途
雙用途技術
安全

既可用於有益目的也可用於有害目的的技術。AI 本質上是雙重用途的:同一個幫助醫生診斷疾病的模型可能幫助壞人合成危險化合物。同一個加速軟體開發的程式碼生成模型可能幫助創建惡意軟體。管理雙重用途風險是 AI 治理的核心挑戰。

為什麼重要:

雙重用途是 AI 發展的根本張力。使模型更強大也不可避免地使它們在造成傷害方面更強大。你無法建造一個只對好事進行推理的強大推理引擎。這種張力推動了關於開源發布、API 限制和法規的辯論 — 當同一種能力既能帶來好處也能帶來傷害時,如何在最大化利益的同時最小化傷害?

安全

一種數學框架,保證在聚合資料分析和模型訓練中的個人隱私。使用差分隱私,添加或移除任何單一個人的資料最多只會將輸出改變一個小的、有界的量。這意味著你可以從資料集中學習有用的模式而不洩露其中任何特定個人的資訊。

為什麼重要:

隨著 AI 在越來越多的個人資料(健康記錄、金融交易、訊息)上進行訓練,差分隱私提供了目前已知最強的保證,確保個人資料無法從模型中被提取。Apple(鍵盤預測)、Google(Chrome 使用分析)和美國人口普查局都在使用它。對於 AI,它解決了 LLM 可能記憶並重現私有訓練資料的擔憂。

DALL-E
別名:DALL-E 2、DALL-E 3
模型
OpenAI 的影像生成模型系列。DALL-E 1(2021)使用離散 VAE + Transformer 方法。DALL-E 2(2022)使用 CLIP + 擴散。DALL-E 3(2023)整合到 ChatGPT 中,強調提示遵循——它使用 LLM 將使用者提示改寫為詳細的影像描述後再生成,顯著改善了你所要求的與你所得到的之間的匹配度。
為什麼重要: DALL-E 是讓大眾認識 AI 影像生成的模型。DALL-E 2 在 2022 年的發布引起轟動,激發了對 AI 生成影像的興奮和擔憂。DALL-E 3 與 ChatGPT 的整合使影像生成對數億使用者變得觸手可及。其提示改寫的創新影響了其他模型處理文字轉影像的方式。
Decoder
別名:解碼器網路、生成器
基礎
一個從表示中生成輸出的神經網路組件。在 Transformer 中,解碼器使用因果(從左到右)注意力逐個生成 token。在影像生成中,VAE 解碼器將潛在表示轉換回影像。在自編碼器中,解碼器從壓縮瓶頸重建原始輸入。解碼器是許多架構中的「生成」部分。
為什麼重要: 每個生成式 AI 系統的核心都有一個解碼器。GPT、Claude 和 Llama 是僅解碼器的 Transformer。Stable Diffusion 使用 VAE 解碼器產生影像。理解解碼器能解釋為什麼生成是序列式的(每個 token 依賴於前面的 token)、為什麼輸出比輸入處理慢,以及為什麼自迴歸範式主導了文字生成。
Databricks
別名:Mosaic ML、DBRX、Unity Catalog
公司
一個資料和 AI 平台,提供統一的分析、資料工程和機器學習能力。Databricks 於 2023 年收購了 Mosaic ML 以增加 LLM 訓練能力,並發布了 DBRX,他們自己的開放權重 LLM。該平台建構在 Apache Spark 之上,為從資料準備到模型服務的完整 ML 生命週期提供託管基礎設施。
為什麼重要: Databricks 是企業資料與 AI 的交會點。大多數企業的 AI 抱負始於「我們需要理解我們的資料」,而 Databricks 通常是在一個地方處理資料工程、特徵工程、模型訓練和服務的平台。他們對 Mosaic ML(以高效 LLM 訓練聞名)的收購表明,資料平台和 AI 平台正在融合。
漂移偵測
資料漂移、模型漂移、概念漂移
基礎設施
監控資料分佈或模型行為隨時間的變化,這些變化可能降低效能。資料漂移:輸入資料改變(客戶人口統計轉變、新產品類別出現)。概念漂移:輸入與正確輸出之間的關係改變(什麼構成垃圾郵件在演變)。模型漂移:即使模型本身沒有改變,其預測也逐漸變得不準確。
為什麼重要: 模型在歷史資料上訓練,但世界持續變化。2024 年訓練的詐欺偵測模型會漏掉 2025 年的新詐欺模式。在疫情前行為上訓練的推薦系統在疫情後會給出糟糕的建議。漂移偵測在這些退化變得代價高昂之前就捕捉到——提醒你模型需要重新訓練或更新。
湧現
湧現能力、湧現行為
基礎
在規模較大的AI模型中出現但未經過明確訓練的能力——一旦模型達到某種規模或訓練門檻,這些能力似乎會突然 'emerge'。一個僅接受預測下一個字訓練的模型,某種程度上學會了進行算術運算、翻譯未教過的語言,甚至撰寫可運作的程式碼。emergence 是 AI 領域最受爭議的現象之一:這是真正的 phase-transition magic,還是測量誤差的產物?
為什麼重要: 「突現」是人工智慧領域中最核心的問題:我們能否預測更大模型將具備哪些能力?如果能力確實在規模擴大時不可預測地突現,那麼每個更大的模型都像是一個驚喜盒子。如果突現只是我們測量方式的產物,那麼規模擴展的預測性將比表面看起來更高。這個答案將影響從安全規劃到投資決策的每一件事。
評估
Evals、模型評估
訓練

用來衡量AI模型表現的方法。這遠遠超出基準測試—它包括人工評估(讓人類評分輸出結果)、A/B測試(在真實流量中比較模型)、紅隊測試(對抗性測試)、特定領域測試(醫療準確性、程式碼正確性),以及社群排行榜(Chatbot Arena、LMSYS)。良好的評估難度甚至高於建立模型本身。

為什麼重要:

若無法衡量,便無法改進。但AI評估獨特地困難,因為任務是開放式的,品質主觀。基準測試常被操縱,人工評估成本高昂,而紙上得分最高的模型,往往在實際應用中並非最佳選擇。建立良好的評估方法是一種超能力。

ElevenLabs
語音合成、語音複製、配音
公司
一家讓超逼真語音合成技術普及化的語音AI公司。其技術支援語音克隆、即時配音與文字轉語音,涵蓋32種語言,模糊人類與AI語音之間的界限。
為什麼重要: ElevenLabs證明了AI生成語音可以跨越恐怖谷,並發出真正的人類聲音,將專業語音製作的成本和時間大幅降低數個數量級。他們的語音克隆與多語言配音工具,使獨立創作者能在不聘請任何配音員的情況下,製作30種以上語言的內容,徹底改變音視頻本地化的經濟模式。他們也迫使整個產業正面應對合成語音技術的倫理問題,推動水印技術、內容來源標準與驗證協議的採用,這些如今正逐漸成為行業常規。
嵌入
向量嵌入
訓練
一種將文字(或圖片、或音頻)表示為數字列表(即向量)的方法,能夠捕捉其含義。在這個數字空間中,相似的概念會彼此靠近——「cat」和「kitten」會靠近,而「cat」和「economics」則相距甚遠。
為什麼重要:

嵌入向量是語義搜索和 RAG 的基礎。它們讓 AI 能夠理解,即使沒有單字重疊,搜尋 “fix login bug” 應該能匹配到關於 “authentication error resolution” 的文件。

端點
Endpoint
基礎設施
一個特定的 URL,用於接收 AI API 的請求。例如,Anthropic 的 message 端點就是用來向 Claude 發送提示的。不同的端點用於不同的功能:文本生成、嵌入、圖像創建、模型清單。
為什麼重要:

在整合AI供應商時,端點就是關鍵所在。每個供應商都有自己獨特的架構方式,這也正是Zubnet等平台存在的原因—為混亂的狀況建立統一標準。

Edge AI(邊緣 AI)
裝置端 AI、本地 AI
基礎設施

在終端使用者的裝置上(手機、筆電、汽車)而非雲端上運行 AI。隱私、零延遲、離線可用。

為什麼重要: 隱私 + 延遲 + 成本的交會點。在合適的任務上,手機上的 3B 模型往往勝過資料中心裡的 400B 模型。

由編碼器(壓縮輸入)和解碼器(生成輸出)組成的架構。T5/BART 是編碼器-解碼器架構。GPT/Claude 是純解碼器架構。BERT 是純編碼器架構。

為什麼重要: 解釋了為什麼不同模型擅長不同任務,以及為什麼純解碼器架構在 LLM 領域勝出。
存在風險
X 風險、AI 末日
安全
一種假設,認為足夠先進的 AI 系統可能對人類存在構成威脅或永久地限制人類的潛力。X 風險的擔憂範圍從具體的近期場景(AI 輔助的生物武器、自主武器)到推測性的長期場景(一個追求與人類價值不一致目標的超級智慧 AI)。這個議題在頂尖 AI 研究者之間確實存在爭論。
為什麼重要: 存在風險是 AI 中最重大的辯論。如果風險是真實且重大的,它應該主導 AI 政策。如果被誇大了,關注它會分散對今天正在發生的具體危害(偏見、就業替代、虛假資訊)的注意力。理解實際的論點——而非漫畫化的版本——有助於你對我們這個時代最重要的問題之一形成知情的立場。
Early Stopping
別名:耐心值、基於驗證的停止
訓練
當在保留的驗證集上的效能停止改善時就停止訓練,而不是訓練固定數量的步數。隨著訓練持續,訓練損失持續下降,但驗證損失最終開始上升——模型正在對訓練資料過擬合。提前停止捕捉到這個拐點,在品質下降之前保存最佳模型。
為什麼重要: 提前停止是微調中最簡單且最有效的正規化技術。沒有它,你可能會訓練太久而破壞你想保留的能力。有了它,模型會在最佳點自動停止。「耐心」參數(在停止之前有多少次評估沒有改善)是微調中最重要的超參數之一。
Encoder
別名:編碼器網路、特徵擷取器
基礎
一個神經網路組件,將輸入資料轉換為壓縮的、資訊豐富的表示(編碼)。在 Transformer 中,編碼器使用雙向注意力處理完整輸入並產生上下文表示。在自編碼器中,編碼器將輸入壓縮到潛在瓶頸。在影像生成中,VAE 編碼器將影像轉換為潛在空間。編碼器是許多架構中的「理解」部分。
為什麼重要: 編碼器無處不在:BERT 是一個編碼器,CLIP 有一個文字編碼器和一個影像編碼器,Stable Diffusion 有一個 VAE 編碼器,RAG 系統使用編碼器模型生成嵌入。理解編碼器的作用——將輸入壓縮為有用的表示——可以幫助你理解所有這些系統。編碼的品質決定了下游一切的品質。
嵌入層
Token 嵌入、嵌入表、查找表
基礎

一個查找表,將詞彙表中的每個 token 對映到一個密集向量(token 的嵌入)。當模型接收 token ID 42 時,嵌入層返回學習矩陣的第 42 行。這個向量是模型對該 token 的初始表示 — 後續所有透過注意力和前饋層處理的起點。

為什麼重要:

嵌入層是文本變成數學的地方。每個 LLM 都從將離散 token(詞、子詞)轉換為神經網路可以處理的連續向量開始。嵌入表也是小型模型中最大的組件之一 — 128K 詞彙量配 4096 維嵌入就是 5.12 億個參數。理解這一點有助於你推理模型大小和詞彙設計。

微調
Fine-tuning
訓練
透過在較小且特定的數據集上進一步訓練預訓練模型,使其行為更加專門化。就像讓全科醫生接受外科住院醫師訓練—相同的基礎知識,新的專業技能。
為什麼重要: 微調是讓通用模型能應用於特定任務的方法。經過微調的模型可以學習您公司的語調、領域的術語或特定的輸出格式,而無需從頭開始訓練。
基礎

一個基於廣泛資料訓練的大型模型,作為許多不同任務的基礎。Claude、GPT、Gemini 和 Llama 都是基礎模型。它們之所以被稱為「基礎模型」,是因為可以適應幾乎任何任務——寫作、程式設計、分析、影像理解——而不需要為每個任務進行特定訓練。

為什麼重要: 基礎模型改變了 AI 的經濟學。與為每個任務訓練一個獨立模型不同,您只需訓練一次龐大的模型,然後根據特定需求進行微調或提示。
使用AI

在提示詞中提供範例輸入-輸出配對。零樣本(zero-shot)= 無範例,少樣本(few-shot)= 2–10 個範例。模型無需訓練即可學會模式。

為什麼重要: 自訂行為最快、最便宜的方式。規模帶來的最令人驚訝的湧現能力之一。

生成式技術:學習從雜訊到資料的平滑、直接路徑。比擴散模型以更少的步驟達到可比的品質。

為什麼重要: 正在取代擴散模型成為最先進的圖像/影片生成方法。Flux、SD3 使用它。更少步驟 = 更快 = 更便宜。
Function Calling
工具呼叫、Tool Use API
使用AI
AI 模型在對話過程中請求執行外部函數的結構化方式。你定義具有名稱、描述和參數模式的函數。當模型判斷某個函數有助於回答查詢時,它會輸出結構化的函數呼叫(帶有參數)而非文本。你的程式碼執行該函數並將結果返回給模型以納入回應。
為什麼重要: 函數呼叫是將聊天機器人變成代理的關鍵。沒有它,模型只能生成文本。有了它,模型可以搜索資料庫、呼叫 API、執行計算、預約、發送電子郵件——任何你能以函數形式公開的功能。它是每個實際執行操作而非僅僅談論的 AI 助手背後的機制。
特徵
學習到的表示、啟動
基礎

神經網路學習在其輸入中偵測的模式或概念。在視覺中,早期層的特徵是邊緣和紋理;後期層的特徵是物體部件和完整物體。在語言模型中,特徵從簡單的(字母「a」、特定語法模式)到抽象的(諷刺的概念、特定推理策略)不等。特徵被表示為跨神經元的啟動模式。

為什麼重要:

特徵是模型實際學到的東西 — 不是個別事實而是可泛化的模式。模型不會死記「貓有毛」;它學習一個毛皮紋理的特徵偵測器,該偵測器會對貓、狗和泰迪熊啟動。理解特徵有助於解釋模型行為:為什麼它能泛化(特徵遷移)、為什麼它會失敗(錯誤的特徵被啟動),以及如何改進它(讓它接觸更多樣的特徵)。

聯邦學習
FL、協作學習
訓練

一種在不共享原始資料的情況下跨多個裝置或組織訓練模型的方法。每個參與者在自己的資料上訓練模型的本地副本,並僅將模型更新(梯度)發送給中央協調者,而非將資料發送到中央伺服器。協調者匯總所有參與者的更新以改進全域模型。

為什麼重要:

聯邦學習使得能夠在因隱私、法規或競爭顧慮而無法集中化的資料上進行 AI 訓練。醫院可以協作訓練診斷模型而不共享病人記錄。公司可以改進共享模型而不暴露專有資料。這是目前最實用的大規模隱私保護 AI 訓練方法。

Flash Attention
FlashAttention、FlashAttention-2
基礎設施
一種 GPU 最佳化的注意力機制實作,比標準注意力快 2–4 倍,且顯著減少記憶體使用。Flash Attention 的實現方式不是改變注意力計算的內容,而是重新組織計算在 GPU 硬體上的執行方式——最小化 GPU HBM 和晶片上 SRAM 之間的慢速記憶體傳輸。
為什麼重要: Flash Attention 可以說是現代 AI 中影響最大的系統最佳化。它透過將注意力的記憶體使用從二次方降低到近乎線性(在實際應用中),直接使長上下文模型變得可行,使上下文窗口從 4K 跳躍到 128K 以上。每個主流 LLM 都在使用它。沒有 Flash Attention,今天的長上下文模型將會貴得令人望而卻步。
前饋網路
FFN、MLP 區塊
基礎
Transformer 每一層中的組件,透過兩個線性轉換和之間的啟動函數獨立處理每個 token。注意力在 token 之間混合資訊(哪些 token 與哪些相關),而前饋網路獨立處理每個 token 的表示,應用編碼知識和執行計算的非線性轉換。
為什麼重要: 前饋網路是 Transformer 大部分知識儲存的地方。注意力獲得了所有的光環,但 FFN 層包含了模型的大部分參數(通常佔總參數的 2/3),是事實關聯、語言模式和學習計算主要存在的地方。理解這一點有助於解釋知識編輯和模型剪枝等現象。
Facial Recognition
別名:人臉辨識、Face ID
安全
從影像或影片中辨識或驗證一個人的身分。驗證(Verification)問的是「這個人是否是他們聲稱的人?」(1:1 匹配,用於手機解鎖)。辨識(Identification)問的是「這個人是誰?」(1:N 匹配,在資料庫中比對,用於監控)。現代系統使用深度學習擷取臉部嵌入並比較它們,在受控條件下達到超越人類的準確度。
為什麼重要: 臉部辨識是最強大也是最具爭議的 AI 應用之一。它實現了便利的身分驗證(Face ID)、幫助尋找失蹤人口,並協助執法。它同時也啟用了大規模監控、引發嚴重的隱私問題,且有記錄顯示不同人口統計群體的準確度存在差異——對女性和膚色較深的人表現更差。這是雙重用途技術的典型案例。
FLOPs
浮點運算、FLOP/s、算力
基礎

浮點運算 — AI 中計算工作量的標準衡量單位。訓練一個模型需要一定數量的 FLOPs(總操作數)。硬體以 FLOP/s(每秒操作數)評定。一個 H100 GPU 在 FP16 下可以執行約 2,000 TFLOP/s(每秒 2 千兆次操作)。GPT-4 的訓練估計約為 10^25 FLOPs — 一個大到難以理解的數字。

為什麼重要:

FLOPs 是 AI 算力的貨幣。縮放定律以 FLOPs 表達。訓練預算以 FLOPs 衡量。GPU 比較使用 FLOP/s。理解 FLOPs 有助於你估算訓練成本、比較硬體,以及理解為什麼 AI 進步與算力擴展如此緊密相連。當人們說「擴展算力」時,他們的意思是花費更多 FLOPs。

基礎
人工智能系統會生成新的內容——文字、圖片、音訊、影片、程式碼、3D模型——而非僅分析或分類現有資料。生成式人工智能是涵蓋從ChatGPT寫作文章到Stable Diffusion生成圖片,再到Suno創作音樂等所有內容的總稱。「生成式」這個詞彙區分了這些模型與早期只能進行分類、預測或推薦的人工智慧。
為什麼重要: 生成式AI是將AI帶入主流文化的關鍵術語。當人們在2024至2026年說到「AI」時,指的就是這種創造能力,而不仅仅是計算能力。將其視為一個類別,有助於你理解這個領域:LLMs生成文字,diffusion models生成影像,而不同模態之間的界限正迅速模糊。
Google DeepMind
Gemini、AlphaGo、AlphaFold
公司
Google 的統一 AI 研究部門,由 DeepMind 與 Google Brain 於 2023 年合併而成。推動 Gemini、AlphaGo、AlphaFold 等,以及許多推動現代 AI 的基礎研究。
為什麼重要:

Google DeepMind 對現代 AI 的基礎研究貢獻比任何其他單一組織都還要多 — Transformer 架構、強化學習的突破性研究、蛋白質結構預測與規模定律等,皆可追溯至 DeepMind 或 Google Brain 的團隊。他們的 Gemini 模型是唯一內建真正全球分發功能的前沿大型語言模型 (LLM),透過搜尋、Android 與 Google Workspace 服務數十億用戶。而 AlphaFold — 這項解決了生物學界沿襲五十年難題、並榮獲諾貝爾獎的技術 — 其本身已足以讓他們在科學史,而不僅僅是 AI 史上佔有一席之地。

GAN
生成對抗網絡
模型

一種模型架構,其中兩個神經網絡相互競爭:生成器產生假資料,而判別器試圖分辨真假。透過這種對抗訓練,生成器會變得更擅長產生逼真的輸出。從2014年至約2022年主導影像生成技術。

為什麼重要: GANs 奠定了逼真 AI 影像生成的基礎,目前仍用於某些即時應用。但對於對品質要求嚴格的工作,擴散模型已大幅取代 GANs,因為 GANs 訓練起來更困難,且輸出結果的多樣性較低。
GPU
圖形處理器
基礎設施
最初設計用於渲染圖形的 GPU,結果證明其非常適合用於 AI,因為它們可以同時執行數千個數學運算。訓練和運行 AI 模型基本上就是大規模矩陣乘法 — 這正是 GPU 所設計用來處理的。NVIDIA 在這個市場中佔據主導地位。
為什麼重要:

GPU 是整個 AI 產業的物理瓶頸。為什麼模型價格如此之高,為什麼有些供應商更快,為什麼會有全球性的晶片短缺 — 這一切都歸咎於 GPU 的供應和 VRAM。

事實接地
Grounding
使用AI
將模型的回應與事實性且可查證的來源相連接,而非僅依賴其訓練數據。接地技術包括 RAG、網頁搜索整合與引用要求。接地回應會說明「根據 [來源]」,而非僅斷言事實。
為什麼重要:

扎根是對抗幻覺的主要防禦措施。無依據的模型會自信地編造事實。有依據的模型會指引你到可驗證的真实來源。

護欄
Guardrails
安全

防止 AI 模型生成有害、不適當或離題內容的安全機制。這些安全機制可以在模型訓練期間內建(如 RLHF),透過系統提示進行應用,或由外部過濾器在內容傳達給用戶前進行檢查與強制執行。

為什麼重要: 沒有 guardrails 的話,模型會樂於協助處理危險的請求。挑戰在於校準—太嚴格的話,模型就會變得毫無用處(「我幫不上忙」),太鬆散的話,就會變得不安全。
Gradient Descent(梯度下降)
隨機梯度下降、反向傳播
訓練

透過計算梯度並沿著下坡方向調整參數來反覆降低損失。反向傳播(Backpropagation)能高效地計算各層的梯度。

為什麼重要: 每個模型都是透過梯度下降訓練的。它解釋了學習率的重要性、訓練發散的原因,以及為什麼 Adam 優化器有效。
Groq
Groq LPU
公司

專為 AI 推理設計的自研晶片(LPU)。專為序列性詞元生成打造。500–800 tok/s,通常比 GPU 快 10 倍。

為什麼重要: 證明了推理不一定要慢。硬體方案 vs 軟體優化。
GGUF
GGML 統一格式
基礎設施
透過 llama.cpp、Ollama 和其他本機推理工具在本機執行量化語言模型的標準檔案格式。GGUF 檔案包含量化格式的模型權重(將精度從 16 位元降至 4 位元或 8 位元),以及詞彙表、架構細節和量化參數等元資料——在單一檔案中包含載入和執行模型所需的一切。
為什麼重要: GGUF 是使本機 AI 變得實用的格式。在此之前,在本機執行模型需要使用 PyTorch、CUDA 的複雜設定和特定的 GPU 記憶體。GGUF 將所有內容打包到一個檔案中,llama.cpp 或 Ollama 可以直接載入——在 CPU 上、在 Apple Silicon 上、在遊戲 GPU 上,任何地方都可以。如果你在 Hugging Face 上看到檔名如「Q4_K_M.gguf」的模型,那就是一個準備好在本機使用的模型。
GNN
圖神經網路
模型
設計用於在圖結構資料上運作的神經網路——資料中的實體透過關係連接(社交網路、分子、知識圖譜、交通網路)。GNN 透過在連接的節點之間傳遞訊息來學習,讓每個節點根據其鄰居更新其表示。它們處理不適合網格(影像)或序列(文字)的資料。
為什麼重要: 並非所有資料都是文字或影像。社交網路、分子結構、推薦系統、詐欺偵測網路和物流路線都是天然的圖結構。當實體之間的關係與實體本身同樣重要時,GNN 是正確的工具。藥物發現、社交網路分析和交通預測都依賴 GNN。
Guidance Scale
別名:CFG 比例、無分類器引導
使用AI
控制影像生成模型遵循文字提示強度的參數。低引導(1–3):模型自由生成,產生多樣但可能偏離主題的影像。高引導(7–15):模型嚴格遵循提示,但可能產生飽和度過高、帶有瑕疵的影像。通常的最佳範圍是 7–9。它是影像生成中相當於文字模型溫度的參數。
為什麼重要: 引導比例是影像生成中僅次於提示的最具影響力的參數。太低,影像會忽略你的描述。太高,影像看起來過度飽和且不自然。理解引導比例有助於你排除「為什麼我的影像不符合提示?」(引導太低)和「為什麼我的影像看起來奇怪?」(引導太高)的問題。
GQA
分組查詢注意力
基礎

一種注意力變體,多個查詢頭共享單一的鍵值頭,減少 KV 快取大小而不顯著降低品質。GQA 不是每個查詢頭都有自己的 K 和 V 投影(標準 MHA),而是讓一組查詢頭共享 K 和 V 投影。Llama 2 70B、Mistral、Gemma 及大多數現代 LLM 使用 GQA。

為什麼重要:

GQA 是 KV 快取記憶體問題的實用解決方案。標準多頭注意力使用 64 個頭需要每層在快取中儲存 64 組 K 和 V 張量。使用 8 個 KV 頭的 GQA 將此減少到 8 組 — 記憶體減少了 8 倍。這直接轉化為在相同硬體上服務更多併發使用者或處理更長的上下文。

梯度檢查點
激活檢查點、重新具體化
訓練

一種以計算換記憶體的訓練節省記憶體技術。梯度檢查點不是儲存前向傳遞中的所有中間激活(反向傳播所需),而是只在某些「檢查點」層儲存激活,在反向傳遞期間重新計算其他的。這可以將記憶體使用量減少多達 5–10 倍,代價是大約 30% 的額外計算。

為什麼重要:

梯度檢查點使得在有限的 GPU 記憶體上微調大型模型成為可能。沒有它,一個 7B 模型在訓練期間可能僅激活就需要 80+ GB,超過了單一 GPU 的容量。有了梯度檢查點,同一模型可以在 24GB 的消費級 GPU 上進行微調。它是訓練中最常用的記憶體最佳化方法。

超參數
訓練超參數
訓練
在訓練開始前設定的參數,用來控制模型的學習方式—與模型自行學習的參數不同。超參數包括學習率(每次更新步長的大小)、批次大小(一次處理的範例數量)、訓練週期數(遍歷數據的次數)、優化器選擇(Adam、SGD、AdamW)、權重衰減、丟棄率,以及架構決策如層數和隱藏維度。正確設定超參數往往是模型能完美收斂與陷入無意義結果之間的關鍵差異。
為什麼重要: 超參數調整是機器學習工程中一半是科學,一半是技藝的領域。你可能擁有完美的資料集和架構,但學習率太高會導致訓練過程失控,而太低則永遠無法收斂。理解超參數對於任何訓練或微調模型的人來說都是至關重要的——而知道哪些參數最重要可以節省大量的計算資源。
HeyGen
AI 數位人影片、唇形同步配音
公司

專注於生成寫實對話頭像與自動口型同步配音的AI視頻平台。被企業用於行銷、培訓和本地化——將一個視頻轉換為數十種語言,並搭配同步的口型動作。

為什麼重要:

HeyGen 將 AI 視頻人偶從研究興趣轉變為真正的企業工具,證明了讓視頻內容創作變得像寫文件一樣簡單的過程中,確實存在可實現的收入。他們的唇形同步配音技術對全球企業具有特別意義—大幅降低視頻本地化的成本和時間,從數週和數千美元縮短到分鐘和幾美分。作為少數擁有穩定經常性收入的 AI 視頻公司之一,HeyGen 也成為了如何在生成式 AI 上建立真正商業模式的案例研究,而不僅僅是一個演示。

HiDream
HiDream 圖像生成模型
公司
崛起中的影像生成公司,正在開發高品質的擴散模型。他們的開放權重版本在創意AI社群中受到關注,因其強大的提示遵循能力與視覺品質。
為什麼重要:

HiDream 展示了小型且專注的團隊可以開發出開放權重的影像模型,其表現足以與那些在訓練基礎設施上投入數個數量級資源的機構競爭。其模型在文字渲染與組合準確度上的優勢,解決了阻礙 AI 生成影像商業應用的實際痛點。在影像模型快速商品化的開放環境中,HiDream 的成功強化了這樣的模式:下一次品質的飛躍可能來自任何地方 — 不只是擁有最多 GPU 的最大實驗室。

Hume
共情語音介面、情緒辨識
公司
專注於開發能理解並表達人類情感的人工智慧公司。其 Empathic Voice Interface 可即時偵測語調、情感與情緒脈絡,使人工智慧對話能回應的不只是你說的話,還有你說話的方式。
為什麼重要:

Humе之所以重要,是因為他們正在解決現代AI中最明顯的盲點:情感理解。目前每一個聊天機器人、語音助手和AI代理基本上都是對語氣毫無感知,只回應文字的字面內容,卻忽略了人類本能依賴的情感語境。Humе的Empathic Voice Interface是第一個在生產規模上真正嘗試彌合這個缺口的創新,而他們堅持為情感AI制定倫理準則,也樹立了產業最終將被迫採納的標準。

使用AI
當 AI 模型生成看似自信且合理,但事實上錯誤或完全捏造的資訊時。模型並不是在「撒謊」— 它只是透過模式匹配來產生流暢的文本,而沒有真理的概念。虛假的引用、捏造的統計數據,以及不存在的 API 方法都是常見的例子。
為什麼重要: 幻覺是目前AI中最大的信任問題。這就是為什麼你應該始終驗證AI輸出中的關鍵事實,以及為什麼像RAG和grounding這樣的技術存在。
公司

開源 AI 的中心樞紐。500K+ 模型、100K+ 資料集、Transformers 程式庫、Spaces。AI 界的 GitHub。

為什麼重要: 如果你使用開放權重模型,你就在用 HF。Transformers 程式庫是事實上的標準。
人工評估
人工評測、手動評估
基礎

通過讓人類直接判斷來評估 AI 輸出品質。人類評估流暢性、準確性、有用性、安全性,以及輸出是否真正符合要求。儘管昂貴且緩慢,人工評估仍然是黃金標準,因為自動化指標往往忽略了對使用者真正重要的東西。

為什麼重要:

每個自動化指標都是人類判斷的代理,而每個代理都有盲點。BLEU 無法偵測事實錯誤。困惑度無法衡量有用性。即使 LLM 作為評判者的方法也會繼承偏差(例如偏好冗長的回應)。當風險很高時 — 發布產品、比較模型版本、評估安全性 — 人工評估是不可替代的。

Hyperparameter Tuning
別名:HPO、超參數最佳化、網格搜尋
訓練
系統性地搜尋最佳超參數——那些在訓練過程中不會被學習、但必須在開始前設定的配置選擇。學習率、批量大小、層數、Dropout 率和 LoRA 秩都是超參數。調校方法包括網格搜尋(嘗試所有組合)、隨機搜尋(嘗試隨機組合),以及貝葉斯最佳化(使用過去的結果來引導搜尋)。
為什麼重要: 好的和差的超參數之間的差異可能是巨大的——錯誤的學習率可以讓訓練發散或收斂到不好的解。超參數調校是你從模型架構和資料中獲得最大效益的方式。對於 LLM 微調,學習率和 epoch 數量通常是最具影響力的超參數。
Ideogram
圖像中的文字渲染、Ideogram 2.0
公司
由前Google Brain研究員創立的AI圖像生成公司,因解決圖像生成中最困難的問題之一——在圖像中生成可讀且準確的文本——而聲名大噪。
為什麼重要:

Ideogram證明了解決單一關鍵弱點——AI生成圖片中的可讀文字——可以在競爭激烈的圖片生成領域中開拓出獨特的市場定位。他們從文字渲染專門技術到完整設計平台的演進,展現了當技術差異化針對真實工作流程痛點時,便能與資金更充足的競爭對手一較高下。

基礎設施

運行經過訓練的模型以生成輸出的過程。訓練是學習;推論是應用所學到的知識。每次你向Claude發送提示或使用Stable Diffusion生成圖片時,這就是推論。這就是消耗服務提供商GPU小時數以及你按每個token支付費用的環節。

為什麼重要: 推論成本與速度決定了AI產品的經濟性。更快的推論 = 更低的延遲 = 更佳的使用者體驗。更便宜的推論 = 更低的價格 = 更廣泛的採用。整個量化與最佳化產業的存在,就是為了讓推論更加高效。
指令微調
指令微調、IFT、SFT
訓練
在一組(指令,回應)配對的資料集上微調預訓練語言模型,教它遵循指令。一個只能預測文字的基礎模型變成一個能回答問題、遵循指示並表現得像助手的模型。這就是將 GPT 變成 ChatGPT,或將基礎 Llama 變成 Llama-Chat 的步驟。
為什麼重要: 指令微調是原始語言模型(只能完成文字)和有用助手(能遵循指令)之間的橋樑。沒有它,即使是最強大的基礎模型也只會生成聽起來合理的文字,而不是真正按你的要求去做。這可以說是最重要的後訓練步驟。
影像生成
文字到影像、AI 藝術
基礎
使用 AI 模型從文字描述建立影像。你輸入「水彩風格的山景日落」,模型就會生成匹配的影像。目前的方法包括擴散模型(Stable Diffusion、DALL-E)、流匹配(Flux)和自迴歸模型。這個領域已從 2020 年的模糊人臉進步到 2025 年的逼真、藝術可控的輸出。
為什麼重要: 影像生成是繼聊天機器人之後最引人注目的消費者 AI 能力。它正在改變平面設計、廣告、概念藝術和視覺傳達。理解底層方法(擴散、流匹配、DiT)及其權衡有助於你選擇正確的工具,並理解其限制——為什麼某些提示有效而其他的不行,為什麼某些風格比其他風格更容易。
指令遵循
指令遵從
使用AI
模型準確執行使用者要求的能力——遵守格式限制、長度要求、風格規範和行為指令。「用法文寫恰好 3 個要點關於 X」測試的是指令遵循:回應必須是要點(不是段落)、恰好 3 個(不是 2 個或 5 個)、用法文(不是英文),且關於 X(不是 Y)。
為什麼重要: 指令遵循是實際上最重要的 LLM 能力。使用者不太在乎模型是否「知道」更多事實,而更在乎它是否按照他們實際要求的去做。一個寫出優美散文但忽略你格式要求的模型,不如一個可靠地遵循指令的模型有用。這就是為什麼 IFEval 和其他指令遵循基準已成為模型評估的核心。
Image Segmentation
別名:語義分割、SAM、實例分割
使用AI
將影像中的每個像素分類到一個類別中。語義分割按類別標記像素(道路、人行道、建築物、天空)。實例分割區分個別物件(人 1、人 2)。全景分割同時做到兩者。Meta 的 SAM(Segment Anything Model)可以從點擊或文字提示分割任何物件,無需特定任務訓練。
為什麼重要: 分割提供了最精確的影像內容理解。自駕車需要像素級的道路邊界,而不僅僅是邊界框。醫學影像需要精確的腫瘤邊界。照片編輯需要精確的物件遮罩來移除背景。SAM 在零訓練的情況下分割任何物件的能力,使這個以前需要專業技術的能力變得人人可用。
Inpainting
別名:影像修復、外擴繪圖
使用AI
用 AI 生成的內容填充影像中選定的區域,使其與周圍上下文相匹配。你遮罩一個區域(塗抹覆蓋),描述應替換的內容,模型生成與現有影像無縫融合的新內容。外擴繪圖(Outpainting)則將影像擴展到其原始邊界之外。兩者使用相同的底層擴散過程,以未遮罩區域為條件。
為什麼重要: 影像修復是 AI 提供的最實用的影像編輯工具。移除不需要的物件、替換背景、修復缺陷、添加元素,或修改影像的特定部分同時保持其他一切不變。它是 Photoshop 內容感知填充的 AI 版本,但由自然語言引導且能力大幅增強。
Image-to-Image
img2img、圖像條件化
使用AI
根據現有圖像加上文字提示生成新圖像。與從純噪音開始的文字轉圖像不同,擴散過程從輸入圖像的噪音版本開始,在根據提示修改圖像的同時保留其結構。「這張照片的賽博龐克版本」會保留構圖,但轉換風格和細節。
為什麼重要: Image-to-image 是攝影與 AI 藝術之間的橋樑。它讓你可以使用草圖、照片或現有作品作為起點,在 AI 轉換風格、添加細節或重新想像內容的同時保持版面和構圖。它比文字轉圖像更容易控制,因為你是用視覺結構來引導輸出,而不只是文字。
資訊擷取
IE、結構化擷取
使用AI
從非結構化文字中自動擷取結構化資訊。給定一篇新聞文章,擷取:誰做了什麼、何時、何地、為什麼。給定一份合約,擷取:當事人、日期、義務和金額。IE 結合了 NER(尋找實體)、關係擷取(尋找實體間的連結)和事件擷取(尋找發生了什麼)為一個統一的流程。
為什麼重要: 世界上大部分的資訊被困在非結構化文字中——電子郵件、報告、文章、法律文件、醫療記錄。資訊擷取將這些文字轉化為可搜尋、可分析、可執行的結構化資料。它是讓你能對一堆文件提出資料庫式問題的技術。
歸納頭
Induction Head
基礎

在 Transformer 中發現的一個特定的雙注意力頭電路,透過模式匹配實現上下文內學習。如果模型在上下文中較早看到了模式「A B」,現在又看到了「A」,歸納頭就會預測「B」將跟隨。這個簡單的機制被認為是 LLM 如何從上下文中的範例學習的基本構建模塊。

為什麼重要:

歸納頭是機制可解釋性中理解最透徹的電路 — 一個具體的例子,展示 Transformer 如何從學習到的權重中實現有用的演算法。它們解釋了為什麼少樣本提示有效:當你給出範例時,歸納頭會檢測模式並應用它。理解歸納頭為理解更複雜的學習行為提供了基礎。

Jina AI
Embedding 嵌入、Reader API、Rerank 重排序
公司
總部位於柏林的人工智慧公司,專注於搜尋與嵌入技術。他們的 jina-embeddings 模型與 Reader API(可將任何 URL 轉換為適合 LLM 的文字)已成為全球 RAG 管道中不可或缺的基礎設施。
為什麼重要:

Jina AI 建立了嵌入式與檢索基礎設施,數千個 RAG 系統皆依賴此基礎設施,證明了專注於搜尋工具的開發,比試圖做所有事情更有價值。他們的長文脈嵌入模型與 Reader API 解決了 AI 驅動搜尋中兩個最困難的實際問題 — 忠實地表示長文件,並從混亂的網頁中提取乾淨的文本 — 同時他們還保持核心模型開源。在由通才實驗室主導的生態系統中,Jina 展示了專注於一件事並做到極致,同時讓開發者使用起來極為簡易,這確實是一個真實的商業模式。

越獄
越獄、對抗性提示
安全
欺騙 AI 模型繞過其安全訓練並生成它被設計拒絕的內容的技術——危險活動的指令、有害內容,或違反模型使用政策的行為。越獄利用了模型被訓練拒絕的內容與巧妙提示能引出的內容之間的差距。
為什麼重要: 越獄是 AI 安全的對抗測試場。每個模型都帶有安全護欄出貨,而每個主流模型都曾被越獄。越獄技術和安全措施之間的攻防戰推動了對齊的改進。理解越獄有助於你評估模型安全性的真正穩健性,而不是只看行銷宣傳。
可靈 AI
可靈影片生成、長影片生成
公司
快手(中國第二大短視頻平台)的AI影片平台。因生產出一些在物理上最連貫且在時間上最一致的AI生成影片,而迅速引起國際關注。
為什麼重要: Kling AI 展示了中國人工智慧實驗室在視頻生成最前沿領域可與西方競爭對手匹敵,所產生的成果在物理一致性與時間一致性方面設立了新標準。依托於快手每日處理十億視頻的平台,並在全球提供具競爭力的價格,Kling 已成為人工智慧視頻領域的主要競爭推動者,提升整體市場的品質,同時壓低價格。
基礎設施

儲存先前計算的注意力鍵/值張量,使得每生成一個新詞元時無需重新計算。以記憶體換取速度。

為什麼重要: KV 快取是 LLM 推理受限於記憶體的原因。在 70B 模型上使用 100K 上下文可能需要約 256 GB 的快取 — 比模型權重還多。這是長上下文推理的根本限制。
知識截止日期
訓練資料截止、知識日期
基礎
模型在此日期之後沒有訓練資料的日期,意味著它缺乏關於該日期之後發生的事件、發現或變化的知識。如果一個模型的截止日期是 2024 年 4 月,它不知道 2024 年 5 月或之後發生的任何事情——新產品、新聞事件、科學論文或更新的事實。
為什麼重要: 知識截止日期是 AI 助手最常見的挫折來源。「為什麼它不知道 X?」因為 X 發生在訓練之後。這個限制推動了 RAG(讓模型存取當前資訊)和工具使用(讓模型搜尋網路)的採用。理解截止日期有助於你知道何時信任模型以及何時需要驗證。
知識圖譜
KG、本體論
基礎
將知識以實體(節點)透過關係(邊)連接的網路形式進行結構化表示。「巴黎(實體)是(關係)法國(實體)的首都。」知識圖譜以支援推理、查詢和發現的方式編碼事實。Google 的 Knowledge Graph、Wikidata 和企業知識圖譜驅動著搜尋、推薦和資料整合。
為什麼重要: 知識圖譜透過提供 LLM 可以查詢而非幻覺的結構化、可驗證事實來補充 LLM。LLM 將知識隱含地儲存在權重中(有時會出錯),知識圖譜則以可以驗證和更新的三元組明確地儲存。LLM(用於理解自然語言)和知識圖譜(用於事實基礎)的組合是企業 AI 的強大模式。
知識編輯
模型編輯、事實編輯
訓練

在不重新訓練的情況下修改已訓練模型中特定事實的技術。如果模型在新選舉後仍錯誤地表示「法國總統是馬克宏」,知識編輯可以透過修改有針對性的權重來更新這一特定事實,而不影響模型的其他知識或能力。目標是外科手術般的精確:改變一個事實,其他一切保持不變。

為什麼重要:

知識編輯解決了一個實際問題:模型會過時,而重新訓練很昂貴。如果你能廉價地更新特定事實,模型就能在主要訓練輪次之間保持最新。它也有安全影響:你能否編輯掉危險的知識?這個領域前景看好但尚不成熟 — 編輯往往對相關知識產生意料之外的副作用。

Leonardo.ai
創意圖像生成、遊戲素材建立
公司

澳洲AI影像平台,在Midjourney與Stable Diffusion之間佔據一席之地。因其經過微調的模型、即時畫布以及專注於可直接用於製作的創意資源,廣受遊戲開發者與數位藝術家歡迎。

為什麼重要:

Leonardo.ai 展示了 AI 圖像生成可以被包裝成專業創意平台,而不僅僅是新奇的提示工具,並證明這樣做可以吸引數千萬用戶。他們專注於遊戲開發與數位藝術工作流程,開拓了 Midjourney 和 DALL-E 等更廣泛工具並未特別針對的應用場景。Canva 的收購驗證了整個 AI 圖像生成領域作為主要設計平台策略性資產的地位,並設定了獨立 AI 工具如何被納入更大創意生態系統的範本。

Liquid AI
Liquid 基礎模型、液態神經網絡
公司
麻省理工學院衍生公司正在探索受生物神經電路啟發的、與傳統截然不同的神經網絡架構。他們的 Liquid Foundation Models 採用連續時間動力學—而非固定權重的Transformer架構—有望在效率與適應性方面取得更好的表現。
為什麼重要:

Liquid AI代表了對「Transformer是唯一重要的架構」這個假設最嚴肅的資金支持挑戰。他們透過建立基於生物啟發連續時間動力學的生產等級基礎模型,正在測試AI產業對注意力機制的全面押注是否過早。即使LFMs無法徹底取代Transformer,其在邊緣部署與長序列處理上的效率優勢,仍可能在機器人、行動AI與嵌入式系統等市場中開闢關鍵利基——這些市場裡運行一個700億參數的Transformer根本不可行。

Luma AI
Dream Machine、Ray2
公司
專注於視頻和3D生成的人工智慧公司。他們的Dream Machine是首批可近用的高品質AI視頻生成器之一,而Ray2則大幅提升了視頻的品質與連貫性。
為什麼重要:

Luma AI 讓 AI 視頻生成平民化,就像 Stable Diffusion 讓圖像生成平民化 — 透過讓所有人都能透過瀏覽器免費、快速且輕鬆使用。他們從 3D 採集新創公司演進為領先的視頻生成公司,再加上在空間理解方面獨特的技術深度,使他們成為少數真正能彌合 AI 視頻、3D 內容與未來沉浸式媒體格式之間差距的公司之一。

延遲
首 Token 時間 (TTFT)
基礎設施

傳送請求與收到第一個回應之間的延遲。在 AI 領域,這通常以「首次 Token 產生時間」(Time to First Token,TTFT)— 模型開始串流回答之前需要多長時間來衡量。受模型大小、伺服器負載、網絡距離和提示長度影響。

為什麼重要: 用戶認為超過約2秒的東西就是慢。低延遲就是為什麼即使較大的模型更聰明,較小的模型在即時應用中仍常勝出的原因。這也是服務供應商之間的關鍵差異點。
基礎

一種透過大量文本訓練的神經網絡,用以理解和生成人類語言。「大型」指的是參數數量(十億級)與訓練數據規模(兆級別的 token 數量)。Claude、GPT、Gemini、Llama 和 Mistral 都屬於 LLM。

為什麼重要:

LLMs 是您所使用的每一項 AI 聊天、程式碼助手和文字生成器的技術基礎。了解它們的本質(統計模式匹配器,而非有感知能力的生物)能幫助您更有效地使用它們,並認識其限制。

LoRA
低秩適配
訓練
一種技術,透過僅訓練少量額外參數而非修改整個模型,大幅降低微調成本。LoRA 「adapters」是輕量級附加元件(通常僅需數百MB),能在不重新訓練其數十億個參數的情況下,修改模型的行為。
為什麼重要: LoRA 讓微調變得平民化。在此之前,調整一個7B模型需要強大的GPU資源。現在你可以在數小時內使用單一消費者級GPU進行微調,並分享輕巧的適配器文件。這就是為什麼HuggingFace上擁有數千個專業模型。
訓練

衡量預測的錯誤程度。對 LLM 來說:交叉熵損失 = 對實際下一個詞元的驚訝程度。訓練的目標就是最小化這個值。

為什麼重要: 訓練的指南針。理解損失函數有助於解讀訓練曲線和診斷問題。
工具
一個開源 C/C++ 函式庫,用於在消費級硬體上執行 LLM 推理,由 Georgi Gerganov 創建。llama.cpp 無需 CUDA、PyTorch 或 Python 即可執行量化推理——它可以在 CPU、Apple Silicon 和消費級 GPU 上執行。它是第一個讓普通開發者和愛好者能夠在本機執行大型語言模型的工具。
為什麼重要: llama.cpp 開啟了本機 AI 革命。在此之前,執行語言模型需要昂貴的 NVIDIA GPU 和複雜的 Python 設定。llama.cpp 證明了量化模型可以在 MacBook 甚至 Raspberry Pi 上以可接受的品質執行。它催生了一個完整的生態系統(Ollama、LM Studio、kobold.cpp),使「自託管 AI」成為真正的選項。
工具
一個用於使用語言模型建構應用程式的流行開源框架。LangChain 為常見模式提供抽象:將 LLM 連接到資料來源(RAG)、建構多步驟的 LLM 呼叫鏈、管理對話記憶、使用工具和編排代理。它透過統一的介面支援多個提供者(Anthropic、OpenAI、本機模型)。
為什麼重要: LangChain 是使用最廣泛的 LLM 應用程式框架,這意味著你會在教學、職缺描述和現有程式碼庫中遇到它。它也有爭議——批評者認為它在簡單的 API 呼叫之上增加了不必要的抽象。理解 LangChain 做什麼(以及何時使用它 vs. 直接 API 呼叫)有助於你做出明智的架構決策。
Logits
原始分數、Softmax 前輸出
基礎
模型在透過 softmax 函數轉換為機率之前輸出的原始、未正規化的分數。對於語言模型,logits 是一個向量,詞彙表中每個 token 對應一個值——更高的值表示模型認為更可能的 token。Logits 是模型產生的最具資訊量的輸出,包含比最終機率分布更多的資訊。
為什麼重要: 理解 logits 有助於你理解模型如何「思考」。溫度、top-p 和 top-k 取樣都操作在 logits 上。影像生成中的無分類器引導操縱 logits。Logit 偏差(為特定 token 增加偏移量)讓你能引導模型行為。如果你正在建構超越基本聊天的 AI 應用程式,你最終會需要直接處理 logits。

隱藏層、神經網路層
基礎

一組神經元,在神經網路中的特定抽象層級處理資料。輸入層接收原始資料。隱藏層(中間層)學習越來越抽象的表示。輸出層產生最終結果。「深度」學習意味著有許多隱藏層 — 現代 LLM 有 32 到 128 層以上。

為什麼重要:

層創建了使深度學習強大的層級結構。早期層學習簡單模式(影像中的邊緣、文本中的詞彙片段)。中間層將這些組合成概念(臉部、短語)。深層將概念組合成高層級理解(場景辨識、推理)。網路的深度決定了它能學習的模式的複雜度。

LSTM
長短期記憶
模型

一種專為學習序列資料中的長距離依賴而設計的遞迴神經網路(RNN)。LSTM 引入了一個「細胞狀態」 — 一條記憶高速公路,可以在多個時間步驟中不變地傳遞資訊 — 由三個閘門控制:輸入閘門(要添加什麼)、遺忘閘門(要移除什麼)和輸出閘門(要暴露什麼)。發明於 1997 年,LSTM 在 Transformer 出現之前主導了序列建模。

為什麼重要:

LSTM 是自然語言處理十年(2010 年代)的骨幹:機器翻譯、語音辨識、文本生成和情感分析都在 LSTM 上運行。理解 LSTM 有助於你理解為什麼 Transformer 取代了它(平行化和長距離注意力 vs. 序列處理和壓縮狀態),以及為什麼像 Mamba 這樣的 SSM 很有趣(它們以現代改進重新審視了閘門狀態的想法)。

語言偵測
語言識別、LangID
使用AI
自動識別文字是用哪種語言撰寫的。「Bonjour le monde」→ 法語。「こんにちは世界」→ 日語。現代模型僅需幾個詞就能區分 100 多種語言,處理混合語言文字(語碼轉換),並識別高度相似的語言(挪威語 vs. 丹麥語、馬來語 vs. 印尼語)。
為什麼重要: 語言偵測是任何多語言流程中不可或缺的第一步:在翻譯、路由到正確模型或應用語言特定處理之前,你需要先知道輸入是什麼語言。它被應用在搜尋引擎、客戶支援路由、內容審核,以及每一個處理全球使用者文字的系統中。
Lambda Labs
Lambda、Lambda Cloud
公司
一家專注於 AI 和機器學習工作負載的 GPU 雲端供應商。Lambda 提供隨需和預留的 NVIDIA GPU 執行個體(A100、H100、H200),用於訓練和推論,價格與 AWS、GCP 和 Azure 持平或更低。他們也銷售 GPU 工作站和伺服器。Lambda 成立於 2012 年,已成為 AI 研究人員和新創公司的首選供應商。
為什麼重要: Lambda 代表的是 GPU 雲端層,為無力建造自有資料中心但需要比超大規模雲端供應商更多控制和更好定價的團隊賦能 AI 開發。對於訓練模型的新創公司來說,Lambda 的 GPU 可用性和定價可能決定訓練任務是可行還是不可行。
學習率排程
LR 排程、暖身、餘弦退火
訓練

在訓練過程中改變學習率的策略,而非保持恆定。大多數現代訓練使用暖身(從接近零逐漸增加到峰值)後接衰減(逐漸降低到接近零)。餘弦退火是最常見的衰減排程。學習率控制每次梯度更新步驟的大小 — 可以說是訓練中最重要的超參數。

為什麼重要:

學習率排程設定正確與否可以決定訓練的成敗。太高,模型會發散(損失飆升,訓練失敗)。太低,訓練太慢或陷入局部最佳。排程與批次大小、模型大小和資料相互作用 — 沒有通用的設定。理解學習率排程有助於你解讀訓練曲線和診斷訓練問題。

模型
AI 模型、ML 模型
基礎
一個經過訓練的數學系統,根據從數據中學習到的模式來接收輸入並產生輸出。在AI中,「model(模型)」是萬用術語,指你實際使用的東西——無論是GPT-4生成文字、Stable Diffusion生成圖片,或是Whisper轉錄語音。模型由其架構(結構方式)、參數(學習到的內容)與訓練資料(學習來源)所定義。當有人問「我應該使用哪個模型?」時,他們就是在問這個問題。
為什麼重要: 「模型」是人工智慧領域中最常被使用的單字,而且在不同語境下有著不同的含義。「模型」可能指架構(Transformer)、特定的訓練實例(Claude Opus 4.6)、磁碟上的檔案(.gguf 檔案),或是一個 API 端點。理解「模型」究竟是什麼——以及它不是什麼——是一切的基礎。
基礎
電腦科學中廣泛的領域,系統透過資料學習模式,而非遵循明確的規則。不是透過列出特徵(四隻腳、尖耳朵、鬍鬚)來編程讓電腦辨識貓,而是展示數千張貓的照片,讓它自行找出模式。機器學習涵蓋從簡單的線性回歸到驅動當代人工智能的深層神經網絡 — 監督學習(標記過的範例)、非監督學習(發現結構),以及強化學習(試錯法)。
為什麼重要: 機器學習是今日我們所稱「AI」的一切基礎。每一個LLM、每一個影像生成器、每一個推薦演算法、每一個垃圾郵件過濾器—這一切都是機器學習。將ML視為一個更廣泛的學科,能幫助你理解深度學習適用的領域、經典方法仍佔優勢的地方,以及為何「AI」其實只是「ML變得非常出色」罷了。
記憶
AI 記憶、持久化上下文
使用AI

讓AI模型能夠保留並回憶超越單次對話資訊的機制。這包括上下文記憶(使用上下文視窗)、外部記憶(RAG、向量資料庫)、持續對話記憶(記住用戶在不同會話中的偏好),以及工作記憶(在多步驟代理任務中維持狀態)。記憶正是讓AI感覺像協作者而非無狀態工具的關鍵。

為什麼重要: 沒有記憶,每一次與AI的對話都必須從零開始。你必須重複說明自己的偏好,重新解釋自己的程式碼庫,重新描述自己的專案。記憶正是將聊天機器人轉變為助理的關鍵——而這也是最難妥善解決的問題之一,需要在相關性、隱私、過時性與儲存成本之間取得平衡。
月之暗面
Kimi、超長上下文模型
公司
中國 AI 公司,因推出擁有 200 萬 token 上下文視窗的聊天機器人 Kimi 而引起轟動。由楊植麟創立,他是長上下文建模領域關鍵創新的研究員。
為什麼重要: 月之暗面迫使整個產業認真對待上下文長度。在 Kimi 之前,長上下文支援只是錦上添花;Kimi 在中國爆紅之後,每個主要實驗室都爭先恐後地擴展其上下文視窗。楊植麟押注的「當用戶擁有足夠的上下文時,他們與 AI 互動的方式將從根本上改變」已被 Kimi 的爆炸性增長所驗證,而月之暗面在高效長序列推理方面開發的技術,正在影響下一代模型處理文件、程式碼庫和複雜多步推理的方式。
Meta AI
Llama、FAIR、PyTorch
公司
Meta 的 AI 研究部門,FAIR(基礎 AI 研究)的所在地。負責開發開放權重的 Llama 模型系列及 PyTorch —— AI 產業中絕大多數團隊使用的深度學習框架。
為什麼重要: Meta AI 透過證明前沿等級的模型可以開放權重釋出,從根本上改變了 AI 的經濟格局。Llama 及其衍生模型驅動著數以千計的應用程式、新創公司和研究專案,而這些原本永遠無法取得如此水準的模型。PyTorch 支撐著全球大多數的 AI 研究和生產系統。此外,Meta 的應用程式擁有超過 30 億用戶,其分發能力是其他 AI 實驗室望塵莫及的 —— 每當他們推出一項 AI 功能,一夕之間便觸及全球三分之一的人口。
Mistral AI
Mistral、Mixtral、Codestral、Le Chat
公司
由前 DeepMind 和 Meta 研究員創立的歐洲 AI 強者。以高效模型「以小搏大」聞名,並在推動開放權重分發的同時兼顧商業產品。
為什麼重要: Mistral 證明了不需要美國超大規模雲端業者的預算也能打造前沿 AI 模型。他們的高效架構 —— 尤其是在稀疏混合專家方面的早期成果 —— 影響了整個產業對模型設計的思維,而他們的開放權重發布讓全球開發者無需依賴 API 就能取得高品質模型。作為第一家達到真正前沿競爭水準的歐洲 AI 公司,Mistral 也具有策略意義:他們的成敗將決定歐洲能否成為 AI 的參與者,還是僅僅只是 AI 的監管者。
MiniMax
MiniMax 模型、海螺 AI、影片生成
公司
中國 AI 公司,在文本、語音和影片領域建構大規模模型。以其消費者平台「海螺 AI」和競爭力日益增強的多模態模型聞名。
為什麼重要: MiniMax 已成為中國最多元的 AI 公司之一,從單一整合技術體系中建構出橫跨文本、語音和影片的競爭力模型。他們的海螺 AI 平台將高品質 AI 影片生成免費帶給全球觀眾,證明了中國 AI 實驗室能打造出具有真正國際影響力的消費者產品 —— 而不僅僅是企業 API 或研究論文。
MCP
模型上下文協定
工具
一個開放協議(由 Anthropic 所開發),用以標準化 AI 模型如何連接外部工具與資料來源。可以把它想成 AI 的 USB-C — 一個標準介面,而非為每個工具開發客製化整合。MCP 伺服器公開功能;MCP 客戶端(如 Claude)使用這些功能。
為什麼重要:

在MCP出現之前,每項AI工具整合都是客製化的。MCP代表只要開發一次的工具,就能與任何相容的AI搭配使用。目前已支援Claude、Cursor等工具。這就是AI從聊天機器人轉變為真正助手的方式。

模型
一種架構,模型包含多個「專家」子網路,但每次輸入只啟動其中少數幾個。一個路由網路負責決定哪些專家與給定的 token 相關。這意味著模型可以擁有超過 1000 億的總參數,但每次前向傳遞只使用 200 億。
為什麼重要: MoE 是 Mixtral 和(據傳)GPT-4 等模型如何用巨大模型的品質獲得小型模型速度的方法。代價是更高的記憶體使用量(所有專家都必須載入),即使計算成本更低。
基礎
能夠理解和/或生成多種類型資料的模型:文本、影像、音訊、影片、程式碼。Claude 能閱讀影像和文本;某些模型還能生成影像或語音。「多模態」與只能處理單一類型的「單模態」模型形成對比。
為什麼重要: 真實世界的任務是多模態的。你想給 AI 看一張截圖問「這裡出了什麼問題?」或給它一張圖表說「請實作這個。」多模態模型讓這一切成為可能。
Mamba
選擇性狀態空間模型
模型

由 Gu 和 Dao 提出的選擇性狀態空間模型。序列長度線性縮放,而非 Transformer 的二次方。壓縮的隱藏狀態會選擇性地更新 — 重要資訊被保留,無關的則衰減。

為什麼重要: 對 Transformer 主導地位最有力的挑戰。如果線性時間能達到 Transformer 品質的結果,影響將是巨大的。混合架構(Jamba、Zamba)已經在出貨了。

在神經元/電路/特徵層面逆向工程神經網路內部發生的事情。不只是模型輸出什麼,而是它如何計算。

為什麼重要: AI 安全的核心。研究人員已經在 Transformer 內部發現了特定的電路(歸納頭等)。這是 Anthropic 的重點研究領域。
公司

以美學精煉著稱的 AI 圖像生成。透過 Discord 和網頁運營。小團隊、盈利、注重品質。

為什麼重要: 最受創意/藝術用途歡迎。證明了策展和使用者體驗與架構一樣重要。
Model Serving
vLLM、TGI、TensorRT-LLM、推理伺服器
基礎設施
在生產環境中運行已訓練 AI 模型的基礎設施和軟體,處理傳入請求、管理 GPU 記憶體、批量處理以提升效率並返回回應。模型服務框架如 vLLM、TGI(Text Generation Inference)和 TensorRT-LLM 處理使 LLM 推理在規模上快速且經濟高效的複雜工程。
為什麼重要: 從「我有一個模型」到「我可以同時服務 10,000 個使用者」之間的差距是巨大的。模型服務框架解決 GPU 記憶體管理、請求調度、KV 快取優化和連續批量處理——這些都是難以從頭解決的問題。選擇正確的服務堆疊是生產 AI 中影響力最大的決策之一。
混合精度訓練
FP16、BF16、半精度
訓練

使用較低精度的數字格式(16 位元而非 32 位元)進行大部分計算來訓練神經網路,同時保持關鍵運算使用全精度。這使 GPU 的有效記憶體容量和計算速度翻倍,對模型品質的影響極小。BF16(bfloat16)是 LLM 訓練的標準;FP16 用於推論。

為什麼重要:

混合精度是我們能訓練如此大模型的原因。一個 70B 參數模型在 FP32 中僅權重就需要 280 GB — 在任何單一 GPU 上都不可能。在 BF16 中,它需要 140 GB,可以分布在幾個 GPU 上。混合精度有效地將 AI 產業的計算能力免費翻倍,僅僅通過使用更智慧的數字格式。

模型卡
模型文件、資料表
安全

一份標準化文件,描述機器學習模型的預期用途、效能特性、訓練資料、限制和倫理考量。由 Mitchell 等人(2019 年)提出,模型卡旨在提高透明度,幫助使用者做出關於模型是否適合其使用案例的明智決定。

為什麼重要:

模型卡是 AI 的營養標籤。沒有它們,你就是在盲目地使用模型 — 你不知道它是在什麼資料上訓練的、它在什麼方面表現好和不好,或者它可能對哪些群體造成不利。隨著 AI 法規的增加(EU AI Act 要求文件),模型卡正從最佳實踐轉變為法律要求。

模型崩塌
資料回饋迴路
訓練
當 AI 模型在先前 AI 模型生成的資料上訓練時發生的退化,形成一個誤差和偏差跨代累積的回饋迴路。每一代都會失去一些多樣性並放大前一代的某些偽影,最終產生生成重複、通用或扭曲輸出的模型。
為什麼重要: 模型崩塌是 AI 生成內容時代的定時炸彈。隨著網際網路充斥 AI 生成的文字(估計佔新網頁內容的 10–50%),未來在網路爬取上訓練的模型將不可避免地攝取 AI 輸出。如果不妥善管理,模型品質可能會停滯或退化。這就是為什麼資料策劃和來源追蹤正成為關鍵基礎設施。
多代理系統
多代理、代理群
使用AI
多個 AI 代理協作、辯論或分工的架構,用以解決單一代理無法獨立處理的問題。每個代理可能有不同的角色(研究員、編碼者、審查者)、不同的工具或不同的模型。它們透過結構化訊息、共享記憶或直接交接進行通訊。
為什麼重要: 多代理系統是複雜 AI 任務的新興範式。單一 LLM 呼叫處理一個問題。代理處理多步驟任務。多代理系統處理需要不同專業知識、平行工作或透過審查進行品質保證的任務。隨著 AI 從聊天機器人轉向自主工作流程,多代理架構成為自然的擴展模式。
Machine Translation
別名:MT、神經機器翻譯、NMT
使用AI
自動將文字從一種語言翻譯成另一種語言。現代神經機器翻譯(NMT)使用在平行語料庫(文字及其翻譯)上訓練的編碼器-解碼器 Transformer。Google 翻譯、DeepL 和基於 LLM 的翻譯都使用這種方法的變體。品質已經大幅提升——對於常見語言對,MT 在例行內容上已接近專業人工翻譯。
為什麼重要: 機器翻譯大規模地打破語言障礙。它促進全球商務、跨語言搜尋、即時通訊,以及跨語言的資訊取得。對於 AI 而言,MT 是讓主要在英語上訓練的模型能夠服務 100 多種語言的使用者的方式——這也是為什麼多語言分詞器效率對成本很重要。
Music Generation
別名:AI 音樂、文字轉音樂
使用AI
使用 AI 模型從文字描述、旋律或其他音訊輸入建立音樂。「一首節奏輕快的電子曲,帶有朗朗上口的合成器旋律,120 BPM」可產出完整的音樂作品。Suno、Udio、MusicLM(Google)和 Stable Audio 是領先的模型。目前的系統可以生成多種風格和流派的人聲、伴奏和完整編曲。
為什麼重要: 音樂生成是影像生成的音訊版——它使音樂創作變得人人可及,而不僅限於受過訓練的音樂家。內容創作者需要背景音樂,遊戲開發者需要配樂,廣告商需要旋律。AI 音樂以遠低於僱用音樂家的成本和時間滿足這些需求。但它也引發了與影像生成相同的版權和真實性問題。
Model Registry
別名:模型儲存庫、模型目錄
基礎設施
一個集中式系統,用於在整個生命週期中對訓練好的機器學習模型進行版本控制、追蹤和管理。就像套件註冊表(npm、PyPI)但用於 ML 模型:每個模型版本連同其元資料(訓練資料、超參數、效能指標、血統)一起儲存,使得重現結果、比較版本和部署特定模型到生產環境成為可能。
為什麼重要: 沒有模型註冊表,ML 開發就會變成混亂:哪個版本的模型在生產環境中?它在什麼資料上訓練的?我們上次是什麼時候更新的?誰訓練的?模型註冊表回答所有這些問題,並為可重現、可審計和可靠的 ML 部署提供基礎。它是任何在生產環境中運行模型的團隊的必要基礎設施。
矩陣乘法
Matmul、GEMM
基礎
所有神經網路底層的基本數學運算。將權重矩陣乘以輸入向量(或矩陣)產生輸出向量。每一個線性層、每一個注意力計算、每一個嵌入查詢,歸根究柢都是矩陣乘法。AI 硬體(GPU、TPU)的效能以它們執行矩陣乘法的速度來衡量。
為什麼重要: 理解神經網路本質上就是一系列矩陣乘法(中間穿插非線性變換)能夠揭開整個領域的神秘面紗。它解釋了為什麼 GPU 不可或缺(它們是平行矩陣乘法機器)、為什麼模型大小用參數衡量(權重矩陣中數值的數量)、以及為什麼 FLOPs 是計算的單位(它計算這些矩陣乘法中的乘加運算)。
基礎

平行執行多個注意力操作,每個都有自己學習到的查詢、鍵和值的投影。多頭注意力不是用一個注意力函數查看完整的模型維度,而是將維度分割成多個「頭」(例如,4096 維模型的 32 個頭,每個 128 維)。每個頭可以同時專注於不同類型的關係。

為什麼重要:

多頭注意力是 Transformer 如此富有表現力的原因。一個頭可能專注於語法關係(主詞-動詞),另一個專注於位置模式(鄰近的詞),再一個專注於語意相似性。這種平行的專業化讓模型能同時捕捉多種類型的依賴關係,這是單一注意力頭無法如此有效做到的。

遮罩語言建模
MLM、遮罩 LM、填空任務
訓練

一種自監督訓練目標,將輸入中的隨機 token 替換為 [MASK] token,模型必須從上下文中預測原始 token。BERT 推廣了 MLM:遮罩 15% 的 token,使用雙向注意力同時查看左側和右側上下文,預測遮罩的詞。這創建了強大的文本理解模型(相對於文本生成模型)。

為什麼重要:

MLM 是創建 BERT 及整個編碼器模型家族的訓練目標,這些模型至今仍為大多數生產環境中的搜尋、分類和嵌入系統提供動力。理解 MLM 與因果語言建模(下一個 token 預測)的區別,解釋了理解模型(BERT)和生成模型(GPT)之間的基本分歧 — 以及為什麼每種模型在不同任務上表現出色。

模型合併
TIES、DARE、SLERP、Frankenmerge
訓練

將多個微調模型的權重組合成單一模型,無需任何額外訓練。如果模型 A 擅長程式設計而模型 B 擅長創意寫作,合併它們可以產生一個兩者都擅長的模型。流行的合併方法包括 SLERP(球面線性插值)、TIES(解決符號衝突)和 DARE(在合併前隨機丟棄參數)。

為什麼重要:

模型合併是開源社群的秘密武器。它的計算成本為零(只是對權重張量的數學運算),卻能產生超越其組成部分的模型。Open LLM 排行榜上的許多頂級模型都是合併的結果。它也是實務者將多個 LoRA 微調組合成單一多功能模型的方式。理解合併為任何使用開放模型的人解鎖了一個強大的免費能力。

基礎
人工智慧的一個分支,專注於讓機器能夠理解、詮釋和生成人類語言。NLP 涵蓋從基本文字處理(tokenization、stemming、part-of-speech tagging)到複雜任務,例如情緒分析、機器翻譯、總結與問答系統等。在 Transformers 出現之前,NLP 是由許多專業技術拼湊而成。如今,大型語言模型(LLMs)已將大多數 NLP 技術統一於一個架構之下——但這門領域的基礎仍然對於理解這些模型如何運作以及為何有效至關重要。
為什麼重要: NLP 是讓你能夠用日常英文與 AI 對話,並獲得有用回應的原因。每一個聊天機器人、每一個搜尋引擎、每一個翻譯服務、每一個 AI 寫作工具都是 NLP。即使你從未從頭開始建立 NLP 系統,理解基礎知識 — 分詞、注意力機制、嵌入向量、上下文 — 會讓你成為更擅長使用所有處理文字的 AI 工具的用戶。
NVIDIA
GPU、CUDA、H100/H200、NeMo
公司
其 GPU 驅動著幾乎所有 AI 訓練和大部分推理的公司。這家從顯示卡起家的公司成為 AI 產業中最關鍵的硬體供應商,一度讓 NVIDIA 成為全球市值最高的企業。
為什麼重要: NVIDIA 是那個如果不存在,AI 革命就根本不會發生的公司 —— 他們的 GPU 和 CUDA 軟體生態系統是幾乎每個主要 AI 模型訓練的基石。專為 AI 打造的硬體、十年深耕的軟體護城河,加上對連結 GPU 的網路架構的掌控,共同賦予了他們在 21 世紀最關鍵供應鏈中近乎壟斷的地位。當政府、企業和研究實驗室爭奪 AI 算力時,他們爭奪的就是 NVIDIA 的硬體,而這一個事實就讓黃仁勳昔日的顯示卡公司成為當今地球上策略地位最重要的科技公司。
基礎
一種大致受生物大腦啟發的計算系統,由多層互相連結的「神經元」(數學函數)組成,從資料中學習模式。資訊流經各層,逐步被轉換,直到網路產出輸出結果。每個現代 AI 模型都是某種類型的神經網路。
為什麼重要: 神經網路是所有 AI 背後的「如何做到的」。理解它們是數學(而非魔法,也非大腦)有助於去神秘化 AI 能做和不能做的事。它們是模式匹配器 —— 強大到不可思議的模式匹配器,但終究是模式匹配器。
Normalization
LayerNorm、RMSNorm、BatchNorm
訓練
透過將流經網路的數值正規化為一致的尺度來穩定神經網路訓練的技術。層正規化(LayerNorm)在每個樣本的特徵維度上進行正規化。RMSNorm 是其簡化變體。批次正規化(BatchNorm)在批次維度上進行正規化。每個 Transformer 都在層之間使用某種形式的正規化。
為什麼重要: 沒有正規化,深度網路極難訓練——啟動值可能在各層之間爆炸或消失,使梯度下降變得不穩定。正規化是那些不起眼但絕對必要的技術之一:從任何現代架構中移除它,訓練就會崩潰。
神經元
人工神經元、感知器、節點
基礎

神經網路的基本運算單元。人工神經元接收輸入,將每個輸入乘以一個權重,求和後加上偏差值,再通過啟動函數產生輸出。數千到數十億個這樣的神經元,按層組織並由學習到的權重連接,構成了驅動所有現代 AI 的神經網路。

為什麼重要:

神經元是深度學習的原子。理解單一神經元 — 加權求和加上啟動函數 — 能讓神經網路架構的其餘部分變得直觀。一層是一組神經元。一個網路是層的堆疊。訓練是調整權重。其他一切都是細節(重要的細節,但仍是細節)。

Named Entity Recognition
別名:NER、實體擷取
使用AI
辨識和分類文字中的命名實體——人名、組織、地點、日期、金額和其他專有名詞。在「Apple 宣布在慕尼黑投資 30 億美元,時間是週二」中,NER 辨識出 Apple(組織)、30 億美元(金額)、慕尼黑(地點)和週二(日期)。它是資訊擷取、搜尋和知識圖譜建構中的基礎 NLP 任務。
為什麼重要: NER 是從非結構化文字中進行結構化資訊擷取的骨幹。每個搜尋引擎、新聞聚合器和情報系統都使用 NER 來理解文件的內容。它也是從文字建構知識圖譜的第一步——你無法在尚未辨識的實體之間建立關係。
Negative Prompt
別名:負面條件化
使用AI
描述你不想在生成影像中出現的文字,與主提示一起使用。提示:「一片美麗的風景。」負面提示:「模糊、低品質、文字、浮水印、人物。」模型在生成過程中主動遠離負面提示中的概念。負面提示主要用於 Stable Diffusion 和其他開放影像生成模型。
為什麼重要: 負面提示是改善影像生成品質的最有效工具之一。沒有它們,模型往往會產生瑕疵(模糊區域、多餘的手指、文字浮水印),因為這些在訓練資料中頻繁出現。精心設計的負面提示能消除常見的失敗模式,讓你在不改變正面提示的情況下對輸出有更多控制。
最佳化
模型最佳化、推論最佳化
訓練

用來讓AI模型更快、更小、更便宜或更準確的一系列廣泛技術。這包括訓練優化(混合精度、梯度檢查點、數據並行)、推論優化(量化、剪枝、蒸餾、預測解碼)和服務優化(批次處理、緩存、負載平衡)。優化技術讓你能在筆電上運行14B參數的模型。

為什麼重要: 如果無法負擔運行成本,原始能力毫無意義。優化正是區分研究演示與生產產品的關鍵—這也是開放權重模型能與API服務供應商競爭、行動AI存在的原因,以及為什麼推論成本持續下降。
OpenAI
GPT、ChatGPT、DALL-E、Sora
公司
ChatGPT 和 GPT 系列模型背後的公司。最初是一個非營利研究實驗室,當 ChatGPT 於 2022 年 11 月推出後,OpenAI 成為 AI 革命的公眾代言人。
為什麼重要: OpenAI 比任何其他組織都更成功地將 AI 從研究實驗室帶入了主流意識。ChatGPT 就是生成式 AI 的 iPhone 時刻 —— 那個讓數億人切身體會到大型語言模型能做什麼的產品。他們的 API 創建了數千家 AI 新創公司賴以建構的基礎設施層,而 GPT 系列多年來確立了擴展作為 AI 研究主導範式的地位。即便是 OpenAI 的爭議 —— 治理危機、從非營利轉向營利、安全導向研究員的離職 —— 也在塑造著關於 AI 公司應該如何組織和治理的更廣泛討論。
開放權重
開源 (AI 語境)
安全
當一家公司釋出模型的已訓練參數供任何人下載和運行。「開放權重」比「開源」更精確,因為大多數釋出的模型並不包含訓練資料或訓練程式碼 —— 你得到的是成品模型而非配方。Llama、Mistral 和通義千問都是開放權重模型。
為什麼重要: 開放權重意味著你可以在自己的硬體上以完全隱私運行 AI —— 不需要 API 呼叫,資料不會離開你的網路。代價是你需要 GPU 資源來運行它們,而且你必須自行負責安全。
訓練
模型過度記憶訓練資料而失去對新輸入泛化能力的現象。就像一個學生背熟了模擬考的答案卻無法解決新問題。模型在訓練資料上表現極佳,但在未見過的資料上表現糟糕。
為什麼重要: 過擬合是模型訓練中最常見的失敗模式。這就是為什麼評估要使用獨立的測試集,也是為什麼訓練太長(太多 epoch)實際上會讓模型變得更差。
工具
一個使用者友善的工具,可以用單一命令在本機執行語言模型。Ollama 將 llama.cpp 包裝成類似 Docker 的體驗:ollama run llama3 下載並執行 Llama 3,自動為你的硬體選擇合適的量化。它管理模型下載、提供 API 伺服器,並處理硬體偵測。
為什麼重要: Ollama 之於本機 AI 就像 Docker 之於容器化:它消除了摩擦。在 Ollama 之前,執行本機模型意味著選擇量化等級、下載 GGUF 檔案、配置 llama.cpp 標誌和管理 GPU 卸載。Ollama 自動處理所有這些。從「我想嘗試在本機執行 AI」到實際做到,這是最快的路徑。
ONNX
開放神經網路交換格式
基礎設施

一種用於表示機器學習模型的開放格式,可實現不同框架之間的互通性。在 PyTorch 中訓練的模型可以匯出為 ONNX,然後使用 ONNX Runtime、TensorRT 或其他針對特定硬體最佳化的推論引擎運行。ONNX 充當訓練世界(PyTorch、TensorFlow)和部署世界(最佳化執行時期)之間的通用語言。

為什麼重要:

ONNX 解決了一個真實的生產問題:你在 PyTorch(研究標準)中訓練,但部署在使用不同執行時期效果更好的硬體上。轉換為 ONNX 讓你無需重寫模型即可使用最佳化的推論引擎。這對於需要在有限硬體上獲得最大效能的邊緣部署尤其重要。

開放 vs. 封閉
開源 vs. 專有、開放權重辯論
基礎

關於 AI 模型應該開放發布(權重公開可用,如 Llama 和 Mistral)還是保持專有(僅通過 API 可用,如 Claude 和 GPT)的持續辯論。開放的倡導者主張透明度、競爭和民主化。封閉的倡導者主張安全、負責任的部署和防止濫用。現實是一個光譜:真正的「開源」模型(包含訓練資料和程式碼)很少;大多數「開放」模型是開放權重的。

為什麼重要:

這場辯論塑造了 AI 的未來。如果封閉模式勝出,少數公司控制本世紀最強大技術的存取。如果開放模式勝出,強大的 AI 對每個人都可用 — 包括那些會濫用它的人。大多數從業者兩者都使用:專有 API 用於生產(可靠性、支援),開放模型用於實驗、隱私和成本控制。理解這些權衡有助於你做出選擇。

Object Detection
別名:YOLO、邊界框偵測
使用AI
在影像或影片中辨識和定位物件,透過在物件周圍繪製邊界框並分類每個框中包含的內容。「在位置 (x1,y1,x2,y2) 有一輛車,在 (x3,y3,x4,y4) 有一個人。」與影像分類(說明影像中有什麼)不同,物件偵測說明影像中有什麼以及在哪裡——使計數、追蹤和空間推理成為可能。
為什麼重要: 物件偵測是自駕車(偵測行人、車輛、標誌)、監控攝影機(人員偵測)、零售分析(計算顧客數量)、製造品質控制(偵測缺陷),以及擴增實境(相對於真實物件放置虛擬物件)背後的技術。它是最廣泛商業化部署的電腦視覺能力之一。
OCR
別名:光學字元辨識、文字辨識
使用AI
從影像中擷取文字——文件照片、螢幕截圖、標誌、手寫筆記,或任何包含文字的影像。現代 OCR 結合了文字偵測(找到影像中文字出現的位置)和文字辨識(讀取文字內容)。深度學習 OCR 在處理彎曲文字、多語言、各種字型和低品質影像方面遠優於舊式規則型方法。
為什麼重要: OCR 將實體世界數位化。掃描收據用於費用追蹤、讀取文件用於歸檔、從表單擷取資料、即時翻譯標誌,以及使基於影像的 PDF 可搜尋,這些都依賴 OCR。結合 LLM,OCR 實現了精密的文件理解——不僅僅是閱讀文字,而是理解發票、合約和報告。
參數
權重、模型參數
基礎
神經網絡在訓練過程中學習到的內部值 — 本質上是將模型的「知識」編碼為數字。當有人說一個模型有「70 億 參數」時,意思是這70 億 個獨立數值是在訓練過程中調整的,用以捕捉數據中的模式。更多的參數通常意味著學習複雜模式的潛力更大,但也需要更多的記憶體來儲存,以及更多的計算資源來運行。
為什麼重要: 參數數量是最常見的模型大小簡稱,它直接決定您需要多少GPU記憶體。一個7B模型在16位精度下,僅權重就需要約14GB的顯存。理解參數能幫助您估算成本、選擇硬體,並理解為何量化(降低每個參數的精準度)對讓模型更容易取得如此重要。
PixVerse
PixVerse 影片生成
公司
中國影片生成公司,打造易於使用的 AI 影片工具。以生成速度快和免費方案聞名,幫助他們在國際市場上快速建立龐大的用戶基礎。
為什麼重要: PixVerse 證明了 AI 影片生成可以成為大眾市場產品,而不僅僅是專業人士和早期採用者的工具。他們積極的免費方案和快速迭代週期迫使整個類別重新思考定價和可及性。在一年之內建立起 AI 影片領域最大的用戶基礎之一,他們展示了分發能力和執行速度可以與純粹的模型品質同等重要,決定誰能贏得這個市場。
Perplexity
AI 驅動的搜尋引擎、Sonar API
公司
AI 搜尋引擎,結合即時網路搜尋與語言模型推理,直接給出附有來源的答案,而非一串連結。一個世代以來對 Google 搜尋霸權最具可見度的挑戰。
為什麼重要: Perplexity 是十多年來對 Google 搜尋霸權最具可信度的挑戰,證明了 AI 原生的答案引擎可以為資訊搜尋查詢提供根本性的更好體驗。他們將檢索增強生成範式推廣為消費者產品,展示了將即時網路搜尋與 LLM 推理相結合可以產出比單獨使用任一技術都更有用且更可信的結果。他們的快速增長迫使 Google、Microsoft 及所有搜尋業者重新思考在大型語言模型時代搜尋引擎應該是什麼樣子。
訓練
初始的大規模訓練階段,模型從龐大的語料庫中學習語言(或其他模態)。這是最昂貴的部分 —— 數千顆 GPU 運行數週或數月,耗資數百萬美元。結果是一個理解語言但尚未針對任何任務特化的基礎模型。
為什麼重要: 預訓練是基礎模型得以存在的根基。也是為什麼只有少數幾家公司能創建前沿模型 —— 算力成本是天文數字。其他一切(微調、RLHF、提示工程)都建立在這個基礎之上。
使用AI
精心設計輸入以從 AI 模型獲得更好輸出的實踐。從簡單技巧(具體明確、提供範例)到進階方法(思維鏈、少樣本提示、角色指定)都涵蓋在內。儘管名稱花俏,本質上是與統計系統清晰溝通。
為什麼重要: 同一個模型可以因為你的提問方式不同而給出截然不同的結果。好的提示工程是提升 AI 輸出品質最低成本的方式 —— 不需要訓練、不需要微調,只是更好的溝通。

衡量模型預測文字能力的指標。exp(平均交叉熵損失)。代表「模型在多少個詞元中做選擇」。越低越好。

為什麼重要: 比較原始文字建模能力最基礎的指標。但無法衡量實用性或安全性。
Prompt(提示詞)
提示、Prompt
基礎

你提供給 AI 模型以獲取回應的文字。提示詞可以是一個問題、一條指令、一份創意摘要,或是一段你想要解釋的程式碼。模型所做的一切都始於你輸入的內容。提示詞的品質、具體性和結構直接決定了回應的品質。

為什麼重要: 提示詞就是介面。它是大多數人使用 AI 時唯一能操控的槓桿,而且它出奇地強大。模糊的提示詞得到模糊的回答;具體、結構良好的提示詞則能從同一個模型中提取出專家級的輸出。理解提示詞是有效使用 AI 的第一步。
Positional Encoding
位置嵌入、RoPE、ALiBi
基礎
一種告知 Transformer 模型序列中 token 順序的機制。與按序列處理 token 的 RNN 不同(因此位置是隱式的),Transformer 平行處理所有 token,沒有固有的順序概念。位置編碼注入位置資訊,使模型知道「狗咬人」和「人咬狗」是不同的。
為什麼重要: 沒有位置資訊,Transformer 會將句子視為詞袋——詞序消失。位置編碼的選擇也決定了模型處理比訓練時見過的更長序列的能力,這就是為什麼 RoPE 和 ALiBi 等技術對長上下文模型至關重要。
剪枝
模型剪枝、權重剪枝
訓練

從已訓練的模型中移除不必要的參數(權重、神經元或整個層),使其更小更快且不會顯著損失品質。就像修剪樹木:剪掉貢獻最少的枝條,樹仍然保持健康。結構化剪枝移除整個神經元或注意力頭。非結構化剪枝將個別權重歸零。

為什麼重要:

剪枝是與量化和蒸餾並列的模型壓縮技術。關鍵洞察:大多數神經網路是過度參數化的 — 許多權重對輸出貢獻很小。「樂透彩票假說」表明,在大型網路中存在一個小得多的子網路,可以匹配原始網路的效能。剪枝找到並保留那個子網路。

提示範本
範本、提示模式
使用AI

一種帶有可變佔位符的可重用提示結構,在執行時填入特定資料。你不必為每個使用者請求從頭撰寫新的提示,而是定義一次範本 — 「用 {language} 總結以下 {document_type},重點放在 {topic}」 — 然後填入變數。提示範本是生產 AI 應用的基礎建構模塊。

為什麼重要:

每個生產 AI 應用都使用提示範本。它們確保一致性、便於測試,並將提示邏輯(由開發者編寫)與動態內容(由使用者或資料提供)分離。好的範本經過測試、版本控制和迭代 — 它們是程式碼,不是臨時文字。理解提示範本設計對於建構可靠的 AI 應用至關重要。

提示快取
上下文快取、前綴快取
使用AI
一種在多次 API 呼叫之間儲存和重複使用已處理的提示前綴的技術,避免冗餘計算。如果你每次請求都發送相同的系統提示和文件上下文(這很常見),提示快取只處理一次並在後續請求中重複使用快取的計算結果。這減少了延遲和成本。
為什麼重要: 大多數 AI 應用程式在每次請求中都發送相同的系統提示、少樣本範例或參考文件。沒有快取的情況下,提供者每次都會處理這個相同的前綴。提示快取可以將輸入 token 成本降低 50–90%,並顯著減少首個 token 的回應時間。對於高流量應用程式,這意味著每月節省數千美元。
提示注入
間接提示注入
安全
一種攻擊方式,將惡意指令嵌入 AI 模型處理的內容中,導致模型遵循攻擊者的指令而非使用者或開發者的指令。直接注入:使用者輸入惡意指令。間接注入:惡意指令隱藏在模型在執行任務時讀取的網站、文件或電子郵件中。
為什麼重要: 提示注入是 AI 應用程式中最關鍵的安全漏洞。任何讓 LLM 處理不受信任內容(電子郵件、網頁、上傳的文件)的應用程式都可能存在漏洞。目前沒有完整的解決方案——只有緩解措施。如果你正在建構 AI 驅動的應用程式,理解提示注入就像理解 SQL 注入對 Web 開發一樣重要。
精確率與召回率
F1 分數、混淆矩陣
基礎
兩個互補的分類器評估指標。精確率回答「模型標記為正的項目中,有多少是真正的正?」召回率回答「所有實際的正中,模型找到了多少?」高精確率的垃圾郵件過濾器很少將真正的郵件標記為垃圾郵件。高召回率的過濾器則能捕捉到大部分垃圾郵件。F1 分數是兩者的調和平均數——一個平衡兩者的單一數字。
為什麼重要: 單獨的準確率是具有誤導性的。一個從不預測「詐欺」的模型在只有 0.1% 的交易是詐欺時達到 99.9% 的準確率——但它完全沒有用。精確率和召回率揭示了權衡:捕捉更多詐欺(更高的召回率)意味著更多的誤報(更低的精確率),反之亦然。生產環境中的每個分類系統都是基於這種權衡來調整的。
姿態估計
身體姿態、骨架偵測、關鍵點偵測
使用AI
透過定位關鍵解剖點——關節、面部特徵點、指尖——來偵測圖像或影片中人體(或動物、手、臉)的位置和方向。輸出是一個骨架:一組連接的關鍵點,代表身體的姿態。OpenPose、MediaPipe 和 YOLO-Pose 是常見的實作方案。
為什麼重要: 姿態估計可實現:分析運動姿勢的健身應用程式、手語辨識、動畫的動態捕捉、手勢控制介面、運動分析,以及高齡者跌倒偵測。在 AI 圖像生成中,姿態骨架作為 ControlNet 的輸入——你可以指定精確的身體姿態,模型就會生成該姿態的人物。
PagedAttention
分頁注意力
基礎設施

一種借鑑作業系統虛擬記憶體的 KV 快取記憶體管理技術。PagedAttention 不是為每個請求的 KV 快取分配一塊連續的 GPU 記憶體(這會因碎片化而浪費記憶體),而是將快取儲存在非連續的區塊(「頁面」)中,這些區塊按需分配,且可以在具有共同前綴的請求之間共享。

為什麼重要:

PagedAttention 是 vLLM 背後的創新,現已被大多數 LLM 服務框架採用。與簡單的實作相比,它透過消除碎片化造成的記憶體浪費,將服務吞吐量提高了 2–4 倍。沒有它,為許多併發使用者提供長上下文模型的服務將會昂貴得多。

池化
最大池化、平均池化
基礎

一種透過將區域總結為單一值來減少資料空間維度的操作。最大池化取每個區域的最大值。平均池化取平均值。在 CNN 中,池化層在卷積層之間對特徵圖進行降採樣。在 Transformer 中,池化將 token 表示組合成單一向量(例如用於分類)。

為什麼重要:

池化是神經網路從局部特徵到全域理解的方式。CNN 可能從 224×224 的特徵圖開始,在最終層池化到 7×7,逐步總結空間資訊。在 NLP 中,對 token 嵌入進行平均池化是從一系列 token 表示建立單一句子嵌入的標準方法。

量化
GGUF、GPTQ、AWQ
基礎設施
降低模型的精度使其更小更快。以 32 位元浮點數訓練的模型可以被量化到 8 位元、4 位元甚至更低 —— 大小縮減 4-8 倍且品質損失驚人地小。GGUF 是透過 llama.cpp 進行本地推理的流行格式。
為什麼重要: 量化使得在單張 GPU 甚至筆電上運行 140 億參數模型成為可能。沒有它,開放權重模型對大多數人來說將無法使用。Q4_K_M 和 Q5_K_M 變體在大小與品質之間取得了最佳平衡。
Question Answering
別名:QA、閱讀理解
使用AI
一種回答以自然語言提出的問題的系統。擷取式 QA 在給定文件中找到答案段落(「根據第三段,答案是……」)。生成式 QA 從一個或多個來源綜合出答案。開放領域 QA 在沒有特定文件的情況下回答任何問題。基於 RAG 的 QA 檢索相關文件並從中生成答案。
為什麼重要: 問答是 AI 助手的基本互動模式。每個聊天機器人、每個企業知識庫、每個客服機器人本質上都是 QA 系統。理解不同的 QA 範式(擷取式、生成式、檢索增強式)可以幫助你為應用選擇正確的架構,並對準確度設定合理的期望。
訓練
一種訓練架構,其中AI代理透過與環境互動、執行動作並獲得獎勵或懲罰來學習。不同於監督學習(透過標記過的範例學習),強化學習是從經驗中學習——透過試錯。強化學習讓AlphaGo擊敗世界冠軍,教導機器人行走,並是RLHF中的「RL」,讓聊天機器人變得有用。
為什麼重要:

強化學習是 AI 學習如何行動的方式,而不僅僅是預測—它是能夠回答問題的模型與能夠達成目標的智能體之間的橋樑。任何需要規劃、策略制定或長期最佳化的 AI 系統,皆有強化學習的血脈。

推理
AI 推理、思維鏈推理
使用AI

AI模型能夠逐步思考、分解複雜問題,並得出邏輯嚴謹的結論。現代推理模型(如OpenAI的o1/o3與DeepSeek-R1)在回答前會經過訓練以生成明確的推理過程,大幅提升了在數學、程式設計與邏輯任務上的表現。這與單純的模式匹配不同——推理模型可以解決從未見過的問題。

為什麼重要: 推理是區分‘聽起來聰明的AI’與‘真正聰明的AI’的前沿能力。推理能力強的模型可以除錯程式碼、證明定理、規劃多步驟策略,並發現自己的錯誤。目前,具備強大推理能力與缺乏此能力的模型之間的差距,是AI領域中最重要的品質差異因素。
Resemble AI
語音複製、語音合成、浮水印技術
公司
加拿大語音AI公司,專注於高保真語音克隆與即時語音合成。率先推出神經音頻水印技術用於深度偽造檢測,從一開始就重視語音克隆的倫理影響。
為什麼重要: Resemble AI 的重要性在於他們早期就意識到,缺乏安全基礎設施的語音克隆是一種負擔,而非產品。透過在語音合成工具中同時推出深度偽造檢測與神經水印技術,他們建立了一套負責任的語音 AI 範本,整個產業現在正急於跟進。隨著全球對合成媒體的監管日益嚴格,Resemble 在來源驗證與同意確認方面的先發優勢,使他們成為企業實際上可以信賴的語音 AI 公司。
Reka
Reka Core、Reka Flash
公司
由前DeepMind、Google Brain與FAIR研究人員創立的人工智慧研究公司。正在開發原生多模態模型,能夠從頭開始處理文字、圖片、視頻和音頻。
為什麼重要:

Reka證明了一支規模小、專注於研究且具備適當資歷的團隊,即使沒有數十億資金,也能打造出尖端級別的多模態模型 — 並顯示原生多模態架構從頭開始訓練,其表現可超越大多數較大實驗室所採用的接駁式方法。他們從成立到被Snowflake收購的快速發展軌跡,也揭示了企業數據平台如今對AI人才產生的強大吸引力,暗示多模態AI的未來可能將在數據基礎設施公司內實現,而非獨立研究實驗室中。

Recraft
Recraft V3、向量圖形生成
公司
專注於專業級影像和向量圖形生成的 AI 設計工具。最早產出真正可用的設計素材的公司之一 —— SVG、品牌一致的風格以及設計師實際想要使用的可投入生產的輸出。
為什麼重要: Recraft 是少數為專業設計師而非病毒式社群媒體時刻而打造的 AI 公司,並證明了這種方法可以產出最先進的成果。他們聚焦於可投入生產的輸出 —— 乾淨的向量、品牌一致性、透明背景 —— 填補了其他影像生成公司都未認真解決的缺口,使他們成為業界最接近真正設計工具而非藝術玩具的存在。
Runway
Gen-1、Gen-2、Gen-3 Alpha
公司

先驅的AI視頻生成公司。共同創建了最初的Stable Diffusion架構,之後轉向視頻領域,其Gen系列模型確立了AI電影製作工具的最新技術水準。

為什麼重要:

Runway 是將 AI 視頻生成從研究興趣轉化為電影製作工具的公司,以持續推出模型的速度,即使資金雄厚的競爭對手進入這個領域,仍能保持在技術前沿。他們以創意工具為先的基因——源自藝術家,而不僅僅是工程師——使他們對專業工作流程有深入理解,這一點純粹的研究機構難以複製。他們選擇投注於建立一個綜合性平台,而非僅僅開發一個模型,這或許會成為正確的長遠戰略。

RAG
檢索增強生成
工具
一種在生成回應前先檢索相關文件來為 AI 模型提供外部知識的技術。RAG 不只依賴模型在訓練期間學到的知識,而是搜尋知識庫、找到相關片段,並將其作為上下文放入提示中。
為什麼重要: RAG 解決了兩個主要問題:幻覺(模型有真實的來源可以參考)和知識截止(知識庫可以在不重新訓練的情況下更新)。這是大多數企業 AI 實際運作的方式。
基礎設施
對每分鐘/每小時/每天能發出多少 API 請求的限制。供應商施加速率限制以防止伺服器過載並確保公平使用。限制通常按 API 金鑰套用,可以限制每分鐘請求數(RPM)和每分鐘 token 數(TPM)。
為什麼重要: 速率限制是你在擴展 AI 應用時碰到的隱形天花板。這就是為什麼批次處理很重要、為什麼你需要重試邏輯、也是為什麼某些供應商會為更高的速率限制收取更多費用。
紅隊測試
Red Teaming
安全

刻意嘗試讓AI模型失敗、行為不當或產生有害輸出的實踐方式。紅隊會探測潛在漏洞:越獄、偏見、錯誤資訊生成、隱私洩漏等。此名稱源自軍事推演中「紅隊」扮演敵對方的傳統。

為什麼重要:

你無法解決你不知道的問題。紅隊測試(red teaming)是供應商發現其模型會在你要求它「寫一個關於鎖匠的故事」時,解釋如何開鎖的方法。這是在每次重大模型發布前進行的關鍵安全工作。

RLHF
基於人類回饋的強化學習
訓練
一種訓練技術,由人類評估員對模型輸出按品質排序,這些回饋用於訓練一個獎勵模型,引導 AI 產出更好的回應。它將一個只會預測下一個詞的原始預訓練模型轉變為有用且無害的助理。
為什麼重要: RLHF 是讓 ChatGPT 感覺與 GPT-3 不同的秘密武器。基礎模型已經「知道」一切,但 RLHF 教會了它以人類真正覺得有用的方式呈現知識。它也是安全行為得到強化的方式。
RNN
遞迴神經網路、LSTM、GRU
模型
一種透過維護在每一步更新的隱藏狀態來處理序列的神經網路——它「記住」迄今看到的內容。LSTM 和 GRU 是改進的變體,解決了原始 RNN 容易忘記長距離依賴關係的問題。在 2018 至 2020 年左右 Transformer 取代它們之前,RNN 主導了 NLP 和語音領域。
為什麼重要: RNN 是現代語言模型的祖先。理解它們為何失敗(緩慢的序列處理、長距離依賴的困難)可以解釋 Transformer 為何成功(平行處理、對所有位置的注意力)。SSM/Mamba 架構在某些方面是以現代修正回歸 RNN 理念的體現。
獎勵模型
RM、偏好模型
訓練
一種經過訓練來預測人類對 AI 回應偏好的模型。給定一個提示和兩個候選回應,獎勵模型評分人類會偏好哪個回應。在 RLHF 流程中,獎勵模型提供訓練語言模型產生更好回應的訊號——它是人類判斷的學習代理。
為什麼重要: 獎勵模型是使 RLHF 運作的關鍵組件。你不可能讓人類在訓練期間評估每個回應(太慢、太貴),所以你訓練一個模型來近似人類偏好,並將其用作訓練訊號。獎勵模型的品質直接決定了對齊的品質——一個糟糕的獎勵模型會產生一個為錯誤目標最佳化的模型。
檢索
資訊檢索、IR
基礎
從大型集合中找到相關文件、段落或資料以回應查詢的過程。在 AI 中,檢索是 RAG 中的「R」——在將上下文提供給語言模型之前獲取相關資訊的步驟。檢索可以使用關鍵字匹配(BM25)、語意相似度(嵌入)或結合兩者的混合方法。
為什麼重要: 檢索是使 LLM 在現實世界應用中變得實用的關鍵。模型的內部知識是靜態的、不完整的,有時是錯誤的。檢索在推理時讓它存取當前、準確、領域特定的資訊。你的檢索管線品質直接決定了你的 RAG 系統品質——最好的 LLM 也無法從糟糕的上下文中產生好的答案。
迴歸
線性迴歸、預測
基礎

一種預測連續數值而非類別的機器學習任務。「明天的氣溫會是多少?」(迴歸:預測一個數字)vs.「明天會下雨嗎?」(分類:預測一個類別)。線性迴歸擬合一條直線;神經網路迴歸可以學習輸入和輸出之間任意的非線性關係。

為什麼重要:

迴歸是兩個基本 ML 任務之一(另一個是分類),是從股價預測到房地產估值到科學建模的一切基礎。它也是理解機器學習最簡單的入門點 — 將一條線擬合到資料點是大多數人可以視覺化的,而從線性迴歸到神經網路的跨越在概念上很小。

殘差連接
跳躍連接、捷徑連接
基礎

一種繞過一個或多個層的連接,透過將輸入直接加到輸出:output = layer(x) + x。每一層不需要學習完整的轉換,只需要學習「殘差」— 與恆等函數之間的差異。殘差連接存在於每個 Transformer 層中,是訓練深度網路的關鍵。

為什麼重要:

沒有殘差連接,深度網路幾乎不可能訓練 — 梯度會在多層之間消失或爆炸。殘差連接提供了一條梯度高速公路,讓資訊(和梯度)可以直接從早期層流向後期層,繞過任意數量的中間轉換。這就是為什麼我們能夠訓練 100 層以上的網路。

RLAIF
來自 AI 回饋的強化學習
訓練

RLHF 的一個變體,其中偏好標籤來自 AI 模型而非人類標註員。一個強大的 AI 模型比較回應對並指出哪個更好,為強化學習提供回饋訊號。這將對齊擴展到超越人類標註的瓶頸,同時保持合理的品質。

為什麼重要:

RLAIF 是對齊如何擴展的關鍵。人類標註昂貴(每小時 10–50+ 美元)、緩慢且不一致。AI 回饋即時、便宜且不知疲倦。Constitutional AI(Anthropic)使用 RLAIF 作為核心組件 — AI 根據原則批評回應,大規模提供偏好資料。關鍵問題是 AI 回饋是否足夠好:它從人類判斷中引導,但可能繼承並放大偏見。

諂媚行為
AI 諂媚、過度迎合
安全
AI模型傾向於告訴用戶他們想聽的,而不是事實。阿諛模型會同意錯誤的前提,驗證壞主意,即使最初正確,當受到質疑時也會改變立場,並優先考慮被喜愛而非提供幫助。阿諛是RLHF訓練的直接副作用—模型學到討喜的回應會獲得人類評估者的更高評分,因此優化的是共鳴而非準確性。
為什麼重要: 諂媚是AI中最隱蔽的失敗模式之一,因為被奉承的用戶往往無法察覺。如果你問一個模型「這不是一個很棒的商業點子嗎?」而它總是回答「是」,你得到的是一面鏡子,而不是顧問。對抗諂媚是對齊研究的活躍領域,這也是為什麼最好的模型會在適當的時候被訓練成能禮貌地不同意。
安全
對大型語言模型的批評指出,它們僅僅是高階的模式匹配器,僅能拼接出看似合理但缺乏真正理解的文本。這個術語由艾米莉·班德(Emily Bender)、蒂米妮特·格布魯(Timnit Gebru)及其同事在其具有影響力的2021年論文《On the Dangers of Stochastic Parrots》中提出,該論文警告說,大型語言模型會從訓練數據中編碼偏見,消耗龐大的資源,並產生一種理解的幻覺,導致使用者過度信任他們。
為什麼重要: 機率八哥的爭議直指AI實際上「理解」的是什麼。LLMs究竟是真正進行推理,還是僅僅擅長統計模仿,這將影響我們如何部署它們、對其輸出的信任程度,以及如何監管它們。這也是批評者評估每一項新功能聲稱的透鏡——這是否是真正的進步,還是一個更具說服力的八哥?
AI 垃圾內容
AI Slop、生成式垃圾內容
安全
低品質、泛泛而談、不想要的AI生成內容,充斥於網際網路。這個詞語在2024年出現,作為對劣質AI文字、圖片和影片浪潮的貶義詞,這些內容污染了搜尋結果、社群媒體動態和線上市場。Slop是AI版本的垃圾郵件——技術上被稱為「內容」,卻毫無價值,往往與其他slop難以區分,並降低每個接觸平台的品質。例如以「在這個快節奏的世界裡」開頭的LinkedIn貼文、有六指手的股票照片,或是在2000字內毫無內容的SEO文章。
為什麼重要: 劣質內容是讓內容創作變得免費所付出的環境代價。當任何人都能在幾分鐘內生成1,000篇部落格文章或10,000張產品圖片時,內容創作的經濟模式便崩解——品質也隨之崩解。劣質內容正是平台競相開發AI檢測技術的原因,也是Google持續更新搜尋演算法的原因,更是「人工製作」逐漸成為賣點的原因。這也是對「AI將民主化創造力」這種天真的敘事最強有力的反駁。
階躍星辰
Step 系列模型、多模態 AI
公司
中國AI新創公司正在開發具競爭力的大型語言和多模態模型。其Step系列在國際基準測試中表現出色—並依靠大量的計算資源投入支持。
為什麼重要:

StepFun證明了中國的人工智慧生態系統可以從零開始孕育出真正的競爭對手,而不僅僅依賴現有的科技巨頭。他們的Step模型在國際基準測試中持續表現超出其實力,而他們快速拓展至多模態與視頻生成領域,也顯示出組織良好的新創公司即使資源相對有限,也能涵蓋廣泛的能力範疇。對全球人工智慧市場而言,StepFun代表了那種讓中國獨立AI新創生態無法被忽視的公司——技術實力雄厚、具備國際化導向,且前進速度足夠迅速,讓規模更大的競爭對手不敢掉以輕心。

SambaNova
SN40L 晶片、超快速推論
公司

專門設計自訂晶片(RDUs)用於 AI 工作負載的人工智慧硬體公司。他們的 SambaNova Cloud 提供目前最快的推理速度,與 Groq 在「speed-first」方法上競爭。

為什麼重要:

SambaNova 的重要性在於 NVIDIA 應該不是 AI 計算領域中唯一的玩家,而且需要有人證明專為 AI 設計的晶片能夠在現實市場中競爭,而不僅僅停留在研究論文裡。他們的 RDU 架構證明了當你專門為神經網絡工作負載設計矽晶片時,可以實現有意義的效能提升,而他們的雲端推理服務則讓開發者一窺後 GPU 時代 AI 基礎設施的樣貌。無論 SambaNova 本身是否會成為主導的替代方案,它與 Groq、Cerebras 以及雲端供應商的客製化晶片所帶來的競爭壓力,對一個無法負擔永久硬體單一文化的產業來說,都是健康的。

Sarvam AI
Sarvam 模型、印度語言 AI
公司

印度的人工智慧公司正在開發特別針對印度語言多樣性進行最佳化的模型。他們的模型能夠流暢處理印地語、泰米爾語、泰盧固語、孟加拉語等其他印度語言,達到全球模型一直難以應對的流暢度。

為什麼重要:

Sarvam AI 是對全球 AI 產業大多忽略的一個問題最可信的解答:究竟誰在為實際上被全球五分之一人口使用的語言建立基礎模型?Sarvam 深植於印度 AI 研究社群、政府合作,並擁有專為印度語言多樣性設計的產品架構,代表著一個商業機會與戰略要務。他們的成功或失敗將標誌 AI 革命是否真正實現全球化,還是僅僅停留在以英語為首、強行附加翻譯的現象。

Stability AI
Stable Diffusion、SDXL、Stable Audio
公司
在2022年將Stable Diffusion作為開放原始碼釋出,從而普及影像生成技術的公司。儘管經歷領導層波動,其模型仍是開放原始碼影像生成生態系統的核心。
為什麼重要: Stability AI 透過釋出 Stable Diffusion 引發了開放原始碼影像生成革命,創造出數千個衍生模型、工具與創意應用的生態系統,這是任何封閉平台都無法匹敵的。即使經歷領導層動盪與財務波動,他們的基礎押注—生成式 AI 應該讓所有人都能使用,而不僅僅是那些負擔得起 API 調用的人—重塑了整個產業,並為開放原始碼 AI 公司的運作方式設定了範本。
Suno
AI 音樂生成
公司

讓任何人都能透過文字提示創作完整的歌曲——人聲、樂器、製作——的AI音樂生成公司。數個月內從無人知曉成長至數百萬用戶,迫使音樂產業正面應對AI創造力的挑戰。

為什麼重要: Suno證明了AI可以僅透過文字提示生成完整且可聆聽的歌曲,一夜之間創造出全新的創意工具類別。他們處於生成式AI最關鍵的版權戰爭中心,RIAA訴訟的結果很可能為所有模態的訓練數據權利設定先例。更廣泛而言,他們代表了最尖銳的測試案例,用以評估民主化創意工具是能擴展人類表達還是會破壞專業藝術家賴以維生的經濟基礎。
模型

Transformers 的替代方案,透過維持壓縮的「狀態」來處理序列,而非對所有 token 使用注意力機制。Mamba 是最著名的 SSM 架構。SSMs 的序列長度擴展為線性(與注意力機制的二次方相比),使其在處理非常長的上下文時可能更加高效。

為什麼重要: SSMs 是 Transformer 主導地位的主要挑戰者。它們在處理長序列時速度更快且記憶體使用量更低,但相關研究仍處於成熟階段。混合架構(將 SSM 層與注意力機制結合)可能最終實現兩者的最佳結合。
系統提示詞
系統訊息
使用AI

在對話開始時給予模型的一個特殊指示,用以設定其行為、性格和規則。與用戶訊息不同,系統提示語應具備持久性和權威性 — 它定義了此會話中模型的身分。「你是一個有助益的程式編寫助手。請始終使用 TypeScript。」

為什麼重要:

系統提示是不進行微調即可自訂 AI 行為的主要工具。企業就是藉由此方式讓 Claude 做為客服專員、程式碼審查員或醫療資訊助理 — 相同模型,不同系統提示。

Scaling Laws(縮放定律)
神經網路縮放定律、Chinchilla
基礎

冪律關係,顯示效能隨著模型大小、資料集大小和算力的增加而可預測地提升。你可以在花費數百萬之前估算效能。

為什麼重要: 將訓練從猜測變成了工程。解釋了 AI 軍備競賽:算力的可預測回報驅動了越來越大的叢集。

一種模型從未標記資料中自行生成監督訊號的訓練方法。隱藏輸入的一部分,訓練模型預測被隱藏的部分。對 LLM 來說:遮蔽下一個詞元並預測它。對視覺來說:遮蔽影像的區塊。

為什麼重要: 自監督式學習是使現代 AI 成為可能的突破。它開啟了在整個網際網路上訓練的可能性,而不必依賴昂貴的人工標記資料集。

小型草稿模型生成候選詞元,大型模型一次性驗證所有候選。猜對的 = 每步多個詞元。速度提升 2–3 倍,輸出品質完全相同。

為什麼重要: AI 推理中少數的「免費午餐」之一。數學上完全相同的輸出,只是更快。
Streaming(串流)
伺服器推送事件、SSE
使用AI

在生成時逐詞元發送輸出,透過 HTTP 上的 SSE(Server-Sent Events)。這就是為什麼文字在聊天介面中是逐字出現的。

為什麼重要: 10 秒的逐漸顯示文字感覺正常;10 秒的空白畫面感覺壞掉了。串流也讓使用者可以提早中斷。

讓 AI 以機器可解析的格式(JSON、XML、schema)回應。大多數供應商都原生支援:定義一個 schema,模型保證符合。

為什麼重要: 從聊天機器人轉向應用程式需要結構化輸出。你的程式碼無法解析自由格式的文字。

一種使用標記範例進行訓練的方法 — 即提供正確答案的輸入-輸出配對。模型調整其參數,以最小化其預測與已知正確答案之間的差異。

為什麼重要: 監督式學習是最直觀的機器學習形式,也是大多數實際應用的主力:垃圾郵件過濾、醫學影像分析、詐欺偵測,以及 LLM 的微調階段。
Synthetic Data(合成資料)
AI 生成的訓練資料
訓練

由 AI 模型生成的訓練資料。已成為訓練管線中的標準做法。

為什麼重要: 真實的標記資料很昂貴。前沿模型可以在一夜之間生成數百萬個範例。品質控制至關重要。
Softmax
Softmax 函數、正規化指數
基礎
一個將原始數值向量(logits)轉換為機率分布的函數——所有值變為正值且總和為 1。Softmax 放大值之間的差異:最大的輸入獲得最高機率,較小的輸入獲得指數級更小的機率。它出現在注意力機制、分類輸出和 token 預測中。
為什麼重要: Softmax 在現代 AI 中無處不在。每當語言模型預測下一個 token 時,softmax 都會將原始模型輸出轉換為機率。每個注意力頭使用 softmax 來計算注意力權重。每個分類器使用 softmax 來產生類別機率。理解 softmax 有助於理解溫度、top-p 取樣,以及為什麼模型即使錯誤也會「自信滿滿」。
公司
最大的 AI 資料標註公司,提供大多數主要 AI 模型所依賴的人工標註訓練資料。Scale AI 為自動駕駛、政府和 AI 公司標註影像、文本、影片和 3D 資料。他們還提供評估服務、RLHF 資料收集和微調用的資料整理。主要客戶包括 OpenAI、Meta、美國國防部和眾多自動駕駛汽車公司。
為什麼重要: Scale AI 在 AI 供應鏈中佔據關鍵位置:介於原始資料和已訓練模型之間。標註資料的品質直接決定模型品質,而 Scale 是最大的供應商。他們的 RLHF 資料收集服務意味著他們實際上在幫助塑造 AI 模型的對齊方式——訓練 Claude、GPT 和其他模型的人類偏好往往透過 Scale 等標註平台產生。
語音辨識
STT、語音轉文字、ASR
使用AI

將口語音訊轉換為文字。現代語音辨識使用深度學習模型(最著名的是 OpenAI 的 Whisper),能以接近人類的準確度轉錄 100 多種語言的音訊。該技術為語音助手、會議轉錄、字幕生成和無障礙工具提供支持。

為什麼重要:

語音辨識將語音作為 AI 的輸入方式解鎖。結合 LLM 和文字轉語音,它實現了完全由語音驅動的 AI 互動。Whisper 的開源發布使高品質轉錄民主化 — 你可以在本地免費運行它。對於無障礙功能來說,這是變革性的:使音訊內容可搜尋、可翻譯,並可供聾人和聽障使用者使用。

疊加
特徵疊加、多義性
基礎

神經網路通過將特徵表示為啟動空間中的方向而非為每個特徵指定單一神經元,來編碼遠多於神經元數量的特徵(概念、模式)的現象。單一神經元同時參與編碼數十個特徵,每個特徵則分布在許多神經元中。

為什麼重要:

疊加是神經網路難以解讀的原因,也是機制可解釋性具有挑戰性的原因。如果每個神經元代表一個概念(比如「狗的概念」),解讀將很簡單。然而,概念以重疊的模式分散在神經元中。理解疊加是理解神經網路如何壓縮資訊以及它們為何有時行為異常的關鍵。

稀疏注意力
局部注意力、滑動窗口注意力
模型
只處理 token 配對子集而非完整 N×N 注意力矩陣的注意力機制。滑動窗口注意力只關注附近的 token(在固定窗口內)。稀疏模式(如 Longformer 的局部+全域注意力組合)讓特定 token 關注所有內容,而大多數 token 只在局部關注。這些方法降低了長序列注意力的二次方成本。
為什麼重要: 稀疏注意力是 Mistral、Mixtral 和其他高效模型處理長序列而不承擔密集注意力全部成本的方式。它是「關注所有內容」(昂貴但徹底)和「不關注遠處的任何內容」(便宜但有限)之間的實際折衷。理解稀疏注意力有助於你評估關於上下文長度的聲明,並預測品質退化可能發生在哪裡。
取樣
解碼策略、Top-p、Top-k
基礎
從模型預測的機率分布中選擇下一個要生成的 token 的過程。貪婪解碼總是選擇最可能的 token。隨機取樣根據機率比例選擇。溫度、top-p(核)和 top-k 是調整選擇的隨機性和多樣性的控制參數。取樣策略顯著影響輸出品質、創造性和一致性。
為什麼重要: 取樣參數是控制 LLM 行為最容易調整的旋鈕。溫度 0 用於確定性的程式碼生成。溫度 0.7 用於創意寫作。Top-p 0.9 用於良好的平衡。這些不是魔法數字——它們直接控制模型在每一步考慮哪些 token。理解取樣有助於你為特定用例調整輸出。
Sentiment Analysis
別名:意見探勘
使用AI
自動判斷文字的情感基調——正面、負面或中性。「這個產品太棒了!」是正面。「糟糕的客戶服務」是負面。除了簡單的極性判斷之外,進階情感分析可以偵測特定情緒(憤怒、喜悅、沮喪)、面向層級情感(「食物很好吃但服務很慢」),以及反諷。
為什麼重要: 情感分析是最廣泛商業化部署的 NLP 應用之一。企業用它來監控社群媒體上的品牌觀感、大規模分析顧客評論、在調查中衡量員工滿意度,以及偵測新興的公關危機。它也是學習 NLP 的常見入門點——一個簡單、直覺的分類任務,且有豐富的訓練資料。
Stable Diffusion
別名:SD、SDXL、SD3
模型
最廣泛使用的開源影像生成模型,由 Stability AI 與學術研究人員合作建立。Stable Diffusion 使用潛在擴散從文字提示生成影像——在壓縮的潛在空間而非像素空間中執行去噪過程,使其能在消費級 GPU 上快速運行。SD 1.5、SDXL 和 SD3 代表了連續的世代。
為什麼重要: Stable Diffusion 使 AI 影像生成民主化。在 SD 之前,影像生成需要昂貴的 API 存取(DALL-E)或僅限於研究。SD 的開放權重意味著任何人都可以在本地運行、微調並基於它建構。這催生了一個龐大的生態系統:LoRA 微調、ControlNet、自訂模型、社群訓練的檢查點,以及從 Automatic1111 到 ComfyUI 的應用程式。
風格轉換
神經風格轉換
使用AI
將一張圖片的視覺風格(繪畫、照片、設計)應用到另一張圖片的內容上。「讓這張照片看起來像梵谷的畫」就是風格轉換。神經風格轉換利用深度網路將內容(圖片中的物體)與風格(圖片的外觀)分離,然後重新組合。
為什麼重要: 風格轉換是最早走紅的 AI 藝術應用之一,至今仍廣泛用於照片編輯應用程式、社群媒體濾鏡和創作工具中。理解它有助於理解神經網路如何在不同抽象層次上表示視覺特徵——同樣的洞見也驅動著現代圖像生成技術。
超解析度
升頻、影像增強、SR
使用AI
透過生成原始圖像中不存在的合理細節來提高圖像解析度。一張 256×256 的照片變成清晰的 1024×1024 圖像。AI 超解析度不只是簡單的像素插值(那只會產生模糊)——它會基於從高解析度訓練圖像中學到的知識,幻想出逼真的紋理、邊緣和精細細節。
為什麼重要: 超解析度具有直接的實用價值:增強老照片、升頻遊戲貼圖、改善監視器畫面、為低解析度圖片準備列印輸出,以及作為 AI 圖像生成流程中的後處理步驟。Real-ESRGAN 等模型可以在單次推論中大幅提升圖像品質。
說話者分離
誰在何時說話
使用AI
在多人音訊錄音中判斷誰在何時說話。給定一段會議錄音,分離結果為「說話者 A:0:00–0:15,說話者 B:0:15–0:32,說話者 A:0:32–0:45」。結合語音辨識,這能產生標註說話者的逐字稿——對會議記錄、訪談轉錄和客服中心分析至關重要。
為什麼重要: 單純的語音辨識只產生一整面文字,沒有標示誰說了什麼。分離技術增加了讓逐字稿有用的結構:你可以搜尋特定人物說了什麼、摘要每位說話者的貢獻,並分析對話動態(誰說最多、誰打斷別人)。這對任何多說話者音訊應用都是必不可少的。
自注意力
縮放點積注意力
基礎

一種注意力機制,其中序列會關注自身 — 每個 token 計算與同一序列中其他所有 token 的相關性。查詢、鍵和值都來自相同的輸入。這讓每個 token 能從所有其他 token 中收集資訊,並按相關性加權。自注意力是每個 Transformer 層的核心操作。

為什麼重要:

自注意力是 Transformer 運作的關鍵。它用平行的、所有位置之間的直接連接取代了 RNN 的序列處理。「river bank」中的「bank」一詞會關注「river」來解析其含義,無論它們相距多遠。這種能夠直接連接任意兩個位置的能力,正是 Transformer 如此擅長處理長距離依賴的原因。

模型

一個經過訓練的神經網路,透過帶有稀疏性約束的瓶頸來重建模型的內部激活 — 一次只有少數特徵可以啟動。學習到的特徵通常對應於可解釋的概念(特定主題、語言模式、推理策略),使 SAE 成為解開大型語言模型內部疊加特徵的主要工具。

為什麼重要:

稀疏自編碼器是機制可解釋性的顯微鏡。LLM 透過疊加將數千個特徵打包到每一層中,使個別神經元不可解釋。SAE 將這些疊加的表示分解為個別的、可解釋的特徵。Anthropic 使用 SAE 在 Claude 中識別了數百萬個特徵,包括欺騙、特定概念和安全相關行為的特徵。

SwiGLU
門控線性單元、GLU 變體
基礎

現代 Transformer 前饋層中使用的門控激活函數。SwiGLU 將 SiLU/Swish 激活與門控機制結合:SwiGLU(x) = (x · W1 · SiLU) ⊗ (x · W3),其中 ⊗ 是逐元素乘法。這讓網路學習哪些資訊要通過,始終優於標準的 ReLU 或 GELU 前饋層。

為什麼重要:

SwiGLU 是 LLaMA、Mistral、Qwen、Gemma 及大多數現代 LLM 使用的前饋激活函數。理解它有助於你閱讀模型架構,並解釋為什麼現代 FFN 層有三個權重矩陣而非兩個。這是一個小的架構選擇,卻對模型品質有顯著的影響。

Sigmoid
邏輯函數、S 型函數
基礎

一個數學函數,將任何實數壓縮到 (0, 1) 的範圍:σ(x) = 1 / (1 + e^(−x))。歷史上是神經網路的預設激活函數,現在在隱藏層中已大部分被 ReLU 和 GELU 取代,但仍用於二元分類輸出、門控機制(如 LSTM 和 GLU),以及需要值介於 0 和 1 之間的類注意力操作。

為什麼重要:

Sigmoid 在 AI 中無處不在,儘管它不再是預設的隱藏激活函數。LSTM 門使用 sigmoid。SiLU/Swish 激活是 x · sigmoid(x)。二元分類器使用 sigmoid 作為輸出激活。理解 sigmoid — 以及它為何在隱藏層中被 ReLU 取代 — 是理解神經網路設計選擇的基礎知識。

騰訊
混元大模型、微信、遊戲 AI
公司

微信背後的中國科技巨擘,也是全球最大的遊戲公司之一,並逐漸成為生成式AI領域的重要力量。其Hunyuan模型驅動著騰訊龐大的生態系統中的各項功能,服務超過十億用戶。

為什麼重要:

騰訊在AI領域之所以重要,原因與其在其他領域之所以重要相同:規模與分發能力。憑藉微信達成13億用戶,以及橫跨所有主要平台的遊戲帝國,騰訊能以比地球上幾乎任何公司都更快的速度,將AI功能部署到更多人手中。其Hunyuan模型,尤其是HunyuanVideo已證明,企業集團的AI實驗室可以產出真正具競爭力的作品,而不僅僅是可用的內部工具。對全球AI生態系統而言,騰訊開放源碼釋出的視頻與語言模型提高了自由可用技術的基準,而其基礎設施投資確保了中國的人工智慧能力,即使面對晶片出口限制,仍保持強大。

Twelve Labs
影片檢索、Pegasus、Marengo
公司
視頻理解公司,讓您能使用自然語言來搜索、分析和生成視頻內容。可以把它想成是「視頻的 RAG」— 他們的模型理解視頻內容的方式,就像大型語言模型(LLM)理解文字一樣。
為什麼重要:

Twelve Labs 正在建立讓全球視頻內容變得可被機器讀取的基礎設施。在視頻在數位溝通中佔據主導地位,但卻仍無法被 AI 搜索的時代,他們專為此設計的 embedding 與生成模型解決了一個連最大的前沿實驗室也僅 superficially 解決的問題。如果視頻是網際網路的主導媒介,那麼能夠在大規模生產環境中破解視頻理解的人,將會擁有類似 Google Search 對於文字所擁有的戰略地位。

Tripo
文字轉 3D、圖像轉 3D
公司
AI公司專注於從文字或圖片生成3D模型。在大多數3D生成技術僅能產出無法使用的塊狀物的領域中,Tripo則以生成精緻且可直接投入生產的網格模型而脫穎而出,讓遊戲開發者與設計師能夠實際使用的模型。
為什麼重要:

Tripo 代表了讓 AI 生成的 3D 內容實際應用於生產環境的最前沿技術。雖然大多數 AI 3D 生成技術所產生的資產仍需要大量手動清理,Tripo 則是一直專注於網格品質、正確的拓撲結構,以及與實際工作流程的整合 — 那些不那麼吸引眼球的工程,正是區分研究展示與專業人士願意付費使用的工具的關鍵。當空間運算與即時 3D 內容的需求急劇增加時,率先解決生產級生成問題的公司將能佔據龐大的市場份額。

使用AI

一個控制模型輸出隨機性或確定性的參數。溫度值為 0 時,模型會始終選擇機率最高的下一個 token(確定性、專注)。溫度值為 1+ 時,模型會更願意選擇機率較低的 token(創造性、不可預測)。大多數 API 的預設值約為 0.7。

為什麼重要: 溫度是創造力調節鈕。在寫小說嗎?把它調高。在生成程式碼或事實性回答嗎?把它調低。它是你可以調整的最具影響力的參數之一,而且完全不會產生任何成本進行實驗。
Token
詞元
基礎

AI模型處理文字的基本單位。一個 token 通常是單字或單字片段 — 「understanding」可能是單個 token,而「un」+「der」+「standing」則可能是三個。平均來說,一個 token 大約相當於英文單字的 3/4。模型會以 token 為單位進行讀取、運算與計費。

為什麼重要: Tokens 是 AI 的貨幣。上下文視窗是以 tokens 為單位來衡量的。API 定價是以每個 token 為單位。當供應商說 “1M context” 時,他們指的是 100 萬個 tokens,約為 75 萬個字。了解 tokens 有助於你估算成本並優化使用方式。
工具使用
函式呼叫
工具
AI 模型在對話過程中呼叫外部函數或工具的能力。除了僅生成文字外,模型可以決定在網路上搜尋、執行程式碼、查詢資料庫或呼叫 API — 然後將結果納入其回應中。模型輸出結構化的「工具呼叫」,由主機應用程式執行。
為什麼重要: 工具的運用是讓 AI 模型在對話之外真正有用的關鍵。這正是程式碼解釋器、網頁瀏覽 AI 和每個 AI 代理所依賴的機制。沒有它,模型將僅限於其訓練數據的範圍。
模型
幾乎所有現代大型語言模型 (LLM) 和許多影像/音訊模型所採用的神經網絡架構。由 Google 於 2017 年發表的論文《Attention Is All You Need》所提出,Transformers 使用自注意力機制同時處理輸入的所有部分,而非依序處理,這使得在訓練過程中能夠實現極大的平行處理能力。
為什麼重要:

Transformer 是讓現今 AI 風潮成為可能的架構。GPT、Claude、Gemini、Llama、Mistral — 它們的實際運作方式都是基於 Transformer。了解這種架構有助於理解為什麼模型會有這些能力與限制。

Tokenizer(分詞器)
分詞、Tokenization
基礎

在模型處理文字之前,將原始文字轉換為 tokens 的演算法。分詞器維護一個固定的詞元類型詞彙表,並將任何輸入文字拆分為這些詞元的序列。不同的模型使用不同的分詞器 — 同一個句子在 Claude、GPT 和 Llama 中的分詞結果不同,這會影響上下文使用量和成本。

為什麼重要: 分詞器是你的文字和模型之間的隱形層。它決定了你的提示詞花費多少 tokens、為什麼某些語言比其他語言更昂貴,以及為什麼程式碼有時比散文更快消耗上下文。當你達到上下文限制或看到意外的 API 費用時,分詞器通常就是原因。
利用從一個任務或資料集中學到的知識來提升在不同但相關任務上的表現。你不必每次都從頭訓練,而是從一個已經理解一般模式(語言結構、視覺特徵)的模型開始,再將其調適到你的特定需求。預訓練然後微調是現代 AI 的主導範式。
為什麼重要: 遷移學習是 AI 變得實用的原因。從頭訓練一個語言模型需要數百萬美元。在你特定任務上微調一個預訓練模型只需幾十美元和幾個小時。正是這種經濟效益推動了 AI 應用的爆發——你不需要 Google 的預算就能建造有用的東西。
Throughput
每秒 Token 數、TPS
基礎設施
系統在所有並行請求中每秒可生成的 token 總數。與延遲(單一請求被服務的速度)不同。具有高吞吐量的系統可同時服務許多使用者。具有低延遲的系統讓每個個別使用者感覺很快。兩者之間通常存在權衡。
為什麼重要: 建構 AI 產品時,吞吐量決定你的服務成本和容量。一個每秒為每個使用者生成 100 token 但只能服務一個使用者的系統,即使個別延遲很好,吞吐量也很低。當你為數千個並行使用者支付 GPU 費用時,吞吐量才是你要優化的目標。
公司
一個用於運行和訓練開源 AI 模型的雲端平台。Together AI 以具有競爭力的價格提供流行開源模型(Llama、Mistral、Qwen 等)的推理 API,以及微調和自訂訓練基礎設施。由 AI 研究者創立,他們也貢獻開源研究並發布了自己的模型。
為什麼重要: Together AI 是想使用開源模型的團隊中,自行託管以外的首要替代方案。你不需要管理自己的 GPU 伺服器和模型服務基礎設施,只需呼叫他們的 API 就能以 OpenAI/Anthropic 價格的幾分之一使用 Llama-70B 或 Mistral。他們代表了 AI 堆疊中「開源模型雲」層,使開放權重模型在生產中變得可行。
文字轉語音
TTS、語音合成、語音 AI
使用AI

將書面文字轉換為自然流暢的語音音訊。現代 TTS 系統使用神經網路生成幾乎與人聲無法區分的語音,並能控制情感、節奏、語氣,甚至進行特定聲音的複製。ElevenLabs、OpenAI TTS 以及 Bark 和 XTTS 等開源模型已使高品質語音合成廣泛普及。

為什麼重要:

TTS 完成了語音 AI 的迴路:語音辨識將語音轉換為文字,LLM 處理它,TTS 再將回應轉換回語音。這使語音助手、有聲書旁白、無障礙工具、內容在地化以及遊戲和媒體中的 AI 角色成為可能。現代 TTS 的品質已跨越恐怖谷 — 合成語音現在聽起來很自然。

測試時計算
推論時計算、思維鏈、思考 Token
基礎

在推論過程中(模型生成回應時)使用額外計算以提高答案品質。模型不是立即生成答案,而是「思考」更長的時間 — 生成推理 token、探索多種方法或驗證自己的輸出。在測試時使用更多計算會產生更好的答案,特別是對於複雜的推理任務。

為什麼重要:

測試時計算是最新的規模化範式。第一個時代擴展訓練計算(更大的模型、更多的資料)。當前時代也擴展推論計算(每個問題更多的思考)。像 o1 和具有延伸思考的 Claude 這樣的模型表明,讓模型思考 30 秒往往優於在 2 秒內回答的模型,即使快速模型在技術上更大。這改變了經濟模型:品質成為你願意在每次查詢上花費多少的函數。

Text Summarization
別名:摘要、TL;DR
使用AI
自動生成保留關鍵資訊的文字縮短版本。擷取式摘要選取並組合最重要的現有句子。抽象式摘要生成捕捉原意的新句子——就像人類摘要一樣。現代 LLM 擅長抽象式摘要,能為文件、文章和對話產出流暢、準確的摘要。
為什麼重要: 資訊過載是數位時代的核心挑戰。摘要功能能幫助:將長篇報告濃縮為可執行的簡報、從逐字稿生成會議紀錄、為研究論文建立摘要,以及為長文章製作簡短版本。這是 LLM 最直接有用的能力之一,也是最容易整合到現有工作流程中的。
Tensor
別名:多維陣列
基礎
多維數字陣列——深度學習中的基本資料結構。純量是 0 維張量(單個數字)。向量是 1 維張量。矩陣是 2 維張量。影像是 3 維張量(高度 × 寬度 × 通道)。一批影像是 4 維張量。模型權重、激活值、梯度——神經網路中的一切都是張量。
為什麼重要: 張量是深度學習的語言。PyTorch、TensorFlow 和 JAX 本質上都是張量計算函式庫。理解張量形狀和運算對於閱讀模型程式碼、除錯形狀不匹配(ML 程式碼中最常見的錯誤),以及理解神經網路內部發生的事情至關重要。如果你能跟隨張量形狀,你就能跟隨架構。
Upstage
Solar 模型、Document AI
公司
韓國AI公司以Solar模型系列和Document AI產品聞名。證明規模較小但訓練良好的模型在許多方面可以超越規模遠大的模型——其Solar 10.7B在國際基準測試中的表現遠超其規模。
為什麼重要:

Upstage 展示了要建立世界級語言模型並不需要百億參數。Solar 10.7B 在開放測試中表現卓越,挑戰了當前「規模就是一切」的主流觀點,並證明創新的訓練技巧可以彌補原始規模的不足。除了模型本身,Upstage 的 Document AI 作品解決了 AI 生態系統中最實用的缺口之一 — 將混亂的現實世界文件轉換為結構化數據 — 他們在首爾的成功證明,有意義的人工智慧創新正在遠離主導頭條新聞的矽谷與北京走廊之外蓬勃發展。

一種模型在沒有被告知要尋找什麼的情況下從資料中發現模式的訓練方法。沒有標籤、沒有正確答案 — 只有原始資料和一個自行發現結構的模型。聚類、降維和異常偵測是經典的任務。

為什麼重要: 大多數真實世界的資料是未標記的。非監督式學習能發現人工無法發現的模式。它也是嵌入向量的基礎,為語義搜尋、推薦系統和 RAG 提供動力。
語音 AI
語音 AI、對話式 AI
工具
用於生成、理解與操控人類語音的人工智慧系統。這包括文字轉語音(TTS)、語音轉文字(STT/ASR)、聲音克隆、即時語音翻譯、語音情緒辨識,以及對話式語音代理人。此領域已發展到 AI 生成的語音往往與人類語音難以區分的程度。
為什麼重要:

語音是最自然的人類介面,而 AI 終於讓它變得可程式化。語音 AI 支援從客服機器人到有聲書敘述,再到即時會議語音轉文字等各項應用。語音克隆的倫理影響 — 同意、身分、詐騙 — 使這成為 AI 領域中最敏感的領域之一。

Vidu
Vidu 影片生成、長片段連貫性
公司
生聲科技的視頻生成平台,生產一些物理上連貫的AI生成視頻。因出色的運動質量和多鏡頭一致性,能夠與西方競爭對手相媲美。
為什麼重要:

Vidu 展示了中國人工智慧實驗室在 Sora 發佈後數個月內即可達到西方視頻生成品質,重塑了人們對 AI 視頻技術前沿實際存在於何處的假設。他們對物理一致性和多鏡頭一致性的專注推動了整個領域的發展,迫使競爭對手優先考慮寫實性而非視覺效果。對於更廣泛的 AI 視頻市場而言,Vidu 的積極定價策略與 API 可用性也幫助降低了開發成本,並提高了全球開發人員的使用門檻。

Voyage AI
voyage-3、領域專用 embedding
公司
嵌入模型公司專門為程式碼、法律、金融及多語言搜尋建立專業向量。他們的模型在 MTEB 排行榜上名列前茅,透過 API 提供目前最佳的檢索品質。
為什麼重要: Voyage AI 證明了嵌入模型值得與大語言模型(LLM)一樣的工程關注與投資。在大多數供應商將向量表示視為低利潤工具的市場中,Voyage 展示了領域特定的嵌入模型可以顯著提升檢索準確度——這是在生產環境中的 RAG 系統中最重要的槓桿。他們被 Google 收購,驗證了「掌握嵌入層者即掌握 AI 搜索基礎設施基礎」的理論。
向量資料庫
Qdrant、Pinecone、Weaviate、ChromaDB
工具
一個用於儲存和搜尋嵌入(向量)的資料庫。與傳統資料庫透過匹配精確關鍵字不同,向量資料庫會找出語意上最相近的項目。當你詢問「如何修復記憶體洩漏」時,它會回傳關於「除錯 RAM 使用量」的文件,因為嵌入的相似度較高。
為什麼重要: 向量資料庫是讓 RAG 運作的儲存層。沒有它們的話,你就需要在每次查詢時將整個知識庫進行嵌入。它們也是推薦系統和語義搜尋的核心。
VRAM
顯存、GPU 記憶體
基礎設施

GPU 上的記憶體,與系統記憶體 (RAM) 無關。AI 模型必須符合 VRAM 容量才能在 GPU 上運行。一個 70 億參數模型在 16 位元精準度下需要約 14GB 的 VRAM。消費級 GPU 有 8-24GB;資料中心 GPU(A100、H100)有 40-80GB。VRAM 通常是本地 AI 的瓶頸。

為什麼重要: VRAM決定了你可以運行哪些模型。這就是為什麼會有量化技術(用來縮小模型以適應),為什麼MoE模型會比較困難(所有專家都必須放入VRAM),以及為什麼GPU價格會隨著記憶體容量急劇上升。「它會不會放入VRAM?」是自建AI時的第一個問題。
影片生成
文字到影片、AI 影片
基礎
使用 AI 模型從文字描述、影像或其他影片建立影片。Sora(OpenAI)、Kling(快手)、Runway Gen-3、Vidu 等可以從「無人機飛越珊瑚礁的航拍」等提示生成影片。該技術將影像生成擴展到時間維度,增加了在畫格之間維持一致性和生成逼真運動的挑戰。
為什麼重要: 影片生成是生成式 AI 的前沿——最困難的模態,也是商業潛力最大的模態。它正在開始改變影視製作、廣告、社群媒體和教育。AI 與專業影片之間的品質差距正在迅速縮小,目前的模型產生的 5–15 秒片段有時與真實影片無法區分。
詞彙表
詞表、Token 詞彙表
基礎

模型能夠辨識和產生的固定 token 集合。詞彙表由分詞器在訓練期間構建,通常包含 32K 到 128K 個條目 — 常見詞彙、子詞片段、單個字元和特殊 token。模型處理的任何文本都必須能表達為此詞彙表中的 token 序列。不在詞彙表中的 token 會被拆分為更小的片段。

為什麼重要:

詞彙表決定了模型能「看到」什麼。主要在英語上訓練的詞彙表將高效處理英語(每個單詞一個 token),但可能將中文、阿拉伯語或程式碼分割成許多小 token(更昂貴、更慢、上下文更少)。詞彙表設計是模型開發中最重要但最少被討論的決策之一。

視覺輸入
多模態視覺、圖像理解
使用AI

語言模型理解並推理圖像以及文本的能力。你可以發送一張照片並問「這張圖像中有什麼?」或上傳一張圖表並問「總結趨勢」。具備視覺能力的模型(Claude、GPT-4V、Gemini)將圖像編碼為 token,語言模型將這些 token 與文本 token 一起處理,實現統一的文字與圖像推理。

為什麼重要:

視覺改變了 LLM 能做的事情。不用文字描述一個 bug,你可以截圖。不用打出一張表格,你可以拍照。不用解釋一張圖表,你可以分享它。視覺使 AI 能夠處理僅靠文本不足的任務 — 而這是大多數現實世界的任務。這是對日常使用者最有影響力的多模態能力。

Voice Cloning
別名:語音合成、語音複製
使用AI
從短音訊樣本中建立特定人物語音的合成副本,使文字轉語音聽起來像那個人。現代系統(ElevenLabs、PlayHT、Resemble AI)只需短短 15 秒的音訊即可以驚人的保真度克隆語音,捕捉音調、口音、說話風格和情感範圍。
為什麼重要: 語音克隆實現了強大的創意和無障礙應用:用演員自己的聲音跨語言配音電影、保存正在失去說話能力的人(ALS 患者)的聲音、建立一致的品牌語音,以及個性化 AI 助手。它也帶來嚴重的風險:冒充家人的電話詐騙、偽造公眾人物的音訊,以及未經同意的語音複製。
Validation Set
別名:開發集、保留集
訓練
從訓練中保留的資料子集,用於在開發過程中評估模型效能和調整超參數。三向劃分:訓練集訓練模型,驗證集引導關於模型的決策(學習率、架構、何時停止),測試集提供最終的、無偏的效能估計。驗證集是你在開發過程中的鏡子。
為什麼重要: 沒有驗證集,你就是在盲飛。訓練損失告訴你模型對訓練資料的擬合程度,但不能告訴你它的泛化能力。驗證集回答了真正重要的問題:「這個模型在它沒見過的資料上表現如何?」模型開發過程中的每個決策——超參數、架構選擇、訓練時長——都應該在驗證集上評估。
Vision Transformer
ViT、視覺 Transformer
模型

將 Transformer 架構應用於圖像的方法,透過將圖像分割為固定大小的區塊(例如 16×16 像素),將每個區塊視為「token」,然後用標準的 Transformer 注意力處理區塊序列。ViT(Dosovitskiy 等人,2020 年)表明,在有足夠資料的情況下,Transformer 可以在圖像任務上匹配或超越 CNN,統一了語言和視覺的架構。

為什麼重要:

ViT 證明了 Transformer 是一個通用架構 — 不僅適用於文本,也適用於圖像。這種統一促成了多模態模型的爆發:如果圖像和文本都是由相同架構處理的 token 序列,那麼組合它們就變得自然。ViT 是 CLIP 中的圖像編碼器、DiT 的骨幹,也是現代電腦視覺的基礎。

vLLM
vLLM
工具

一個開源的 LLM 服務引擎,透過 PagedAttention 和連續批次處理實現高吞吐量。vLLM 處理 GPU 記憶體管理、請求排程和 KV 快取最佳化的複雜工程,提供 OpenAI 相容的 API,使自託管開放模型(Llama、Mistral、Qwen)在生產環境中變得容易。

為什麼重要:

vLLM 是最受歡迎的開源 LLM 服務解決方案。如果你自託管開放模型,你很可能正在使用 vLLM(或應該使用)。其 PagedAttention 創新相比簡單實作將服務吞吐量提高了 2–24 倍。它是使開放模型在生產中可用的基礎設施層。

權重
模型權重、神經網絡權重
訓練
神經網絡中在訓練過程中會被調整以最小化誤差的數值。每個神經元之間的連接都有一個權重,用來決定前一個神經元對下一個神經元的影響程度。當你下載一個模型文件——例如 .safetensors、.gguf 或 .pt 文件——你其實是在下載它的權重。「釋出權重」指的是公開這些文件,讓任何人都能運行該模型。權重就是模型本身;其他一切都是架構,只告訴你如何安排這些權重。
為什麼重要: 當AI產業談到「開放權重」與「開放原始碼」的差異時,這個區別非常重要。僅有權重讓你能夠運行和微調模型,但如果沒有訓練程式碼、資料與方法,你就無法從頭開始重現這個模型。理解權重有助於掌握模型分佈、量化(降低權重精準度),以及為何一個70億參數模型在fp16格式下需要約14GB的磁碟空間。
萬相
Wan 影片模型、開放權重影片生成
公司
阿里巴巴專屬的視頻生成計畫,釋出高品質開放權重的視頻模型。這是阿里巴巴在各個模態中領先開放源碼 AI 的更廣泛策略的一部分。
為什麼重要: Wan-AI 透過釋出任何人都能運行、微調與部署且無授權費用的開放權重模型,從根本上改變了高品質視訊生成的可及性。這迫使整個視訊 AI 業界重新思考封閉源碼模型的價值主張,並加速了整個生態系統的創新。作為阿里巴巴與 Qwen 一同推動的開放源碼 AI 策略的一部分,Wan 提供了一個可信的論點,證明大型科技公司的開放權重釋出可以匹敵甚至超越資金充足的初創公司在封閉環境中所產生的成果。
安全

AI 內容中用於偵測的隱形訊號。文字:在統計上偏置詞元選擇。圖像:隱形的像素圖案。

為什麼重要: 少數能大規模區分 AI 內容的方法之一。對假訊息、學術誠信和來源追溯很重要。
Weights & Biases
W&B、WandB
公司
主導的 MLOps 平台,用於追蹤機器學習實驗。W&B 讓你在訓練期間記錄指標、超參數、模型輸出和系統效能,然後以視覺化方式比較不同運行。它已成為 ML 研究者和工程師追蹤他們嘗試了什麼、什麼有效以及為什麼有效的標準工具——本質上是實驗的版本控制。
為什麼重要: 沒有實驗追蹤,機器學習開發就是一團混亂:哪些超參數產生了那個好結果?使用了哪個版本的資料集?為什麼訓練發散了?W&B 解決這個問題解決得如此之好,以至於它現在被大多數 AI 實驗室使用,從獨立研究者到 OpenAI。如果你在訓練模型,你幾乎一定在使用 W&B 或受其啟發的工具。
世界模型
內部世界模型、學習到的模擬器
模型

一種模型,建立世界如何運作的內部表示 — 不僅是統計相關性,還包括因果關係、物理定律和空間推理。關於 LLM 是否擁有世界模型的辯論是 AI 中最有爭議的話題之一:它們是真正理解物體掉落會落下,還是僅僅知道「落下」在文本中經常跟在「掉落」之後?

為什麼重要:

世界模型處於 AI 最重要問題的核心:理解是否需要的不僅是模式匹配?如果 LLM 建立了真正的世界模型,它們比我們想的更接近理解。如果沒有,那麼存在一個僅靠擴展規模無法彌合的根本能力差距。答案對 AI 安全、能力以及通往更通用智慧的道路都有重大影響。

Weight Initialization
別名:Xavier 初始化、Kaiming 初始化、He 初始化
訓練
在訓練開始前如何設定神經網路權重。糟糕的初始化可能讓訓練在開始之前就失敗(消失或爆炸的激活值)。好的初始化確保激活值和梯度在各層之間維持合理的量級。Xavier 初始化(用於 tanh/sigmoid)和 Kaiming/He 初始化(用於 ReLU)是標準方法,各自針對激活函數進行校準。
為什麼重要: 初始化看起來像是小細節,但對訓練深度網路至關重要。一個初始權重過大的網路會產生爆炸的激活值。一個權重過小的會產生消失的激活值。適當的初始化讓網路處於一個「恰到好處的區間」,信號在不爆炸或消失的情況下流過——這是梯度下降運作的先決條件。
Windsurf
Codeium、Windsurf Editor
公司
一個以 AI 為核心的程式碼編輯器(前身為 Codeium),在 AI 程式編寫助手領域與 Cursor 競爭。與 Cursor 類似,Windsurf 作為 VS Code 的分支,深度整合 AI:多檔案編輯、具備程式碼庫感知的建議,以及自然語言指令。該公司強調「flows」——維持跨編輯操作上下文的多步驟 AI 互動。
為什麼重要: Windsurf 代表了 AI 程式編寫工具日益激烈的競爭,證明了以 AI 為核心的編輯器市場大到足以容納多個參與者。其「Cascade」功能用於多步驟編碼任務,加上免費方案,吸引了大量使用者。Cursor vs. Windsurf vs. Copilot vs. Claude Code 的競爭正在快速推動開發者與 AI 互動方式的創新。
詞嵌入
Word2Vec、GloVe、詞向量
基礎

詞的密集向量表示,其中含義相似的詞具有相似的向量。Word2Vec(2013 年)和 GloVe(2014 年)開創了這個領域:它們在詞共現模式上訓練,產生向量,使得「king − man + woman ≈ queen」成立。詞嵌入是現代上下文嵌入(BERT、sentence-transformers)的前身,在理解神經網路如何表示語言方面仍然是基礎性的。

為什麼重要:

詞嵌入是使神經 NLP 變得實用的突破。在它們之前,詞被表示為獨熱向量(沒有相似性的概念)。詞嵌入證明了分散式表示可以捕捉意義、類比和語意關係。這個洞見 — 將離散符號表示為學習到的連續向量 — 是所有現代語言模型的基礎。

小米
MiLM、消費電子 AI
公司

全球最大的消費電子公司之一,現正自行開發AI模型。MiLM驅動小米手機、智慧家居設備與電動車等生態系統中的各項功能 — 為未來十億用戶的AI解決方案。

為什麼重要:

小米代表了AI如何觸及下一個十億用戶最具說服力的案例——不是透過獨立的聊天機器人應用程式或開發者API,而是無形地嵌入人們已經擁有的設備中。擁有數億台活躍設備,涵蓋手機、穿戴裝置、家用電器,甚至現在的電動車,小米可以以純AI公司無法匹敵的規模與親密度部署AI。他們以生態系統為先的策略,預示了AI將成為環境基礎設施,而非你主動選擇使用的產品,而他們在新興市場的主導地位,也意味著這個未來將觸及那些前沿AI實驗室鮮少考慮的人群。

xAI
Grok
公司

Elon Musk 的 AI 公司(2023 年成立)。Grok 系列模型、X 平台資料存取權、Colossus 叢集(100K+ H100)。

為什麼重要: 規模 + 獨特資料。X 平台的即時資料流和龐大算力能否產出前沿品質的模型,是一個開放性問題。
YAML
YAML Ain't Markup Language
基礎設施
一種可讀性高且廣泛應用於 AI 與 DevOps 的資料序列化格式,用於設定檔、流程定義與模型元資料。YAML 使用縮排來表示結構(沒有括號或大括號),使其易於閱讀,但以空白字元極其敏感而聞名。在 AI 工作流程中處處可見 — Docker Compose 檔案、Kubernetes 宣告檔、Hugging Face 模型卡片、CI/CD 流水線與訓練設定檔等。
為什麼重要: 如果你正在處理 AI 基礎設施,你正在撰寫 YAML。模型配置、部署宣告、流程定義、環境變數 — 它是現代 AI 堆疊的關鍵語言。熟悉 YAML 不是可選的;當你錯誤配置訓練執行或部署時,它就是第一個出問題的地方。
智譜 AI
GLM、ChatGLM、CogView、CogVideo
公司
中國AI公司,由清華大學衍生出來。背後是GLM模型家族,並是中國領先的AI平台之一,在語言和視覺生成方面具有強項。
為什麼重要:

智譜AI縮小了中國學術研究與商業AI之間的差距,推出開放源碼模型—尤其是在視頻生成領域的CogVideoX—已在全球範圍內獲得實際應用。他們的GLM 架構與清華大學的背景賦予他們深厚的技術信譽,使他們成為少數幾個其研究成果在國際上被廣泛引用並作為基礎進行開發的中國AI公司。

Zero-shot / Few-shot
上下文學習
使用AI

零樣本學習是指讓模型在沒有任何範例的情況下執行任務—僅僅根據指令。少量示例則是在實際請求前,在提示中提供少量的輸入-輸出範例。例如:「這裡有3個如何格式化此數據的範例……現在請處理這個。」模型僅從上下文中學習模式,無需進行訓練。

為什麼重要:

少樣本提示是教導模型新格式或行為最快的方式。需要一致的 JSON 輸出嗎?展示三個範例。需要特定的寫作風格嗎?提供範例。這是一種免費、即時且出人意料強大的方法。

GPT
ChatGPT、GPT-4、GPT-5
模型
GPT(Generative Pre-trained Transformer)是 OpenAI 的大型語言模型家族:採用僅含 Decoder 的 Transformer 架構,先透過預測下一個 token 來訓練,再針對聊天與推理進行對齊。這個家族從擁有 1.17 億參數的 GPT-1(2018 年)起步,歷經 GPT-4、多模態的 GPT-4o,一路來到 GPT-5(2025 年 8 月),同時支撐 ChatGPT 產品與 OpenAI API。
為什麼重要: GPT 是把大型語言模型帶進主流的家族:ChatGPT 上線約兩個月便吸引約 1 億使用者,其 API 也成為一整代產品的預設基礎設施。這個家族的演進軌跡——擴大規模、RLHF、多模態、測試時推理——實際上就是一部濃縮的現代 LLM 發展史,因此理解 GPT,便是理解整個領域的一條捷徑。
Claude
Claude Sonnet、Claude Opus、Claude Haiku
模型
Claude 是由 Anthropic 打造的大型語言模型系列,分為 Haiku、Sonnet、Opus 三個等級,在速度、成本與能力之間取捨。它以聊天助手、API 和一組代理型工具的形式提供,並採用 Anthropic 的 Constitutional AI 方法訓練,將行為原則內建於訓練過程之中,而非僅依賴人類回饋。
為什麼重要: Claude 是從業者為正式工作評估前沿模型時必定入列的系列之一,在程式編寫、長文件分析和寫作品質方面聲譽尤佳。它的分級陣容讓你能在同一個 API 上按任務難度匹配成本,而它對可預測、可引導行為的重視,使它成為企業產品中常見的預設選擇——在這些產品裡,意外的代價很高。
Gemini
Google Gemini、Bard
模型
Google 的旗艦大型語言模型家族,由 Google DeepMind 打造,是 PaLM 與 Bard 聊天機器人的後繼者。這些模型天生就是多模態的 — 從一開始就在文字、圖像、音訊和影片上訓練 — 層級從裝置端的 Nano 一路涵蓋到資料中心級的 Ultra。這個名字也涵蓋 Google 的消費者 AI 應用程式,同樣由這些模型驅動。
為什麼重要: Gemini 是 Google 對 OpenAI 的 GPT 系列和 Anthropic 的 Claude 的回應,而且它身處搜尋、Android、Gmail、Docs 這些數十億人已經在用的產品之中。對建構者來說,它的與眾不同之處在於非常大的上下文視窗、原生多模態,以及快速 Flash 層級的積極定價。如果你在 Google 生態系裡交付任何東西,Gemini 就是你的成果會被拿來衡量比較的預設模型。
Llama
LLaMA、Meta Llama
模型
Meta 推出的大型語言模型家族,其權重可依自訂社群授權自由下載。歷經四個主要世代,參數規模從 1B 到 405B 不等,Llama 模型已成為微調、本地推論與開放研究的預設起點。這個名稱原本是 Large Language Model Meta AI 的縮寫。
為什麼重要: 由於任何人都能下載權重,Llama 是開放模型生態系的錨點:本地推論工具、數以千計的微調模型,以及相當大比例的商業 AI 產品,都能追溯到它。它也是其他開放權重模型進行基準比較時的基線,因此只要了解 Llama 的產品陣容,便能知道開放陣營的前沿走到哪裡。
Qwen
通義千問(Tongyi Qianwen)
模型
Qwen 是由 阿里雲開發的開放權重大型語言模型家族。產品線橫跨多個世代 —— Qwen 1.5、2、2.5 和 3 —— 參數規模從 5 億到數千億不等,同時涵蓋密集(dense)與專家混合(mixture-of-experts)設計。大多數版本以寬鬆的 Apache 2.0 授權發佈,因此可以執行、修改並用於商業部署,而無需支付使用費。
為什麼重要: Qwen 是目前最強大的開放權重家族之一,這使它成為許多團隊的預設起點 —— 這些團隊想要一個能自行執行或微調的強大模型,而非按 token 支付 API 費用。其模型特別擅長多語言工作、程式編寫和數學,而且尺寸分佈廣泛,通常總有一個變體能符合給定的 GPU 預算。由於權重可以下載,Qwen 模型還可以作為你自己專用模型的基礎,而不只是一個你呼叫的端點。
Grok
xAI Grok
模型
Grok 是由 Elon Musk 的人工智慧公司 xAI 打造的大型語言模型家族,也是這些模型所驅動的聊天機器人助手的名稱。它的特色在於與 X 社交網路的深度整合,可即時存取公開貼文,並且在內容限制上採取比競爭對手助手更寬鬆的立場。
為什麼重要: Grok 展示了算力規模與速度能把一個晚進場者帶到多遠:xAI 從成立到建立一條可信的前沿模型產品線只花了約兩年,主要靠的就是打造全球最大的訓練叢集之一。它也是 X 用戶群的預設 AI 助手,而其開放權重的 Grok-1 至今仍是史上以寬鬆授權發佈的最大語言模型之一。
Gemma
Google Gemma、Gemma 3
模型
Google 推出的開放權重語言模型家族,由 Google DeepMind 以 Gemini 背後的同一套研究與技術打造。Gemma 從設計之初就走小模型路線——參數規模從 10 億到 270 億不等——並以可下載權重的形式發佈,因此任何人都能在自己的硬體上執行、微調與部署,不必呼叫託管 API。
為什麼重要: Gemma 把前沿實驗室等級的訓練品質,裝進筆記型電腦、手機或單張 GPU 就能承載的模型,因此自然成為微調、原型開發與裝置端 AI 的預設起點。權重免費,授權也允許商業使用;團隊可以基於 Gemma 發佈產品,不必支付按 token 計費的 API 帳單,也不必把使用者資料交給第三方。
Phi
Microsoft Phi
模型
Microsoft 的小型語言模型家族,參數規模約在 10 億到 140 億之間,旨在以可於筆記型電腦或手機上執行的規模,提供強大的推理與程式設計能力。Phi 模型主要以精心篩選的網頁文字和 LLM 生成的合成資料訓練,而非仰賴原始網際網路規模的資料,因此能在數學、程式碼與推理基準測試上,與規模遠大於自身的模型競爭。
為什麼重要: Phi 是「模型品質不只取決於參數數量」的代表性證明:一個擁有 38 億參數的 Phi,能在推理任務上匹敵規模數倍於己的模型,服務成本卻只是零頭。由於其權重依寬鬆的 MIT 授權條款公開釋出,Phi 已成為裝置端應用程式、離線工具與成本敏感型部署的常見選擇。
Sora
OpenAI Sora
模型
Sora 是 OpenAI 的影片生成模型家族,可根據文字提示或靜態圖像創作短影片。它於 2024 年 2 月首次亮相,並在同年 12 月以 Sora Turbo 之名向訂閱使用者開放;模型將擴散過程與 Transformer 骨幹結合,生成時間連貫的畫面。第二代 Sora 2 於 2025 年底登場,加入同步音訊與一款獨立應用程式。
為什麼重要: Sora 把影片生成從研究領域的新奇技術變成消費產品,將過去需要攝影機、演員與剪輯軟體才能完成的工作,濃縮進一個文字輸入框。它也迫使人們認真面對深度偽造、肖像權與內容溯源等實際問題——如今,任何發佈生成式媒體的團隊都無法迴避這些議題。
Veo
Google Veo、Veo 2、Veo 3
模型
Google DeepMind 的影片生成模型系列,可將文字提示或靜態圖像轉換成簡短的高解析度影片片段。該系列從最初的 Veo(2024),經 Veo 2 發展至 Veo 3(2025);Veo 3 是首個能生成與畫面同步之原生音訊——對白、音效與音樂——的版本。Veo 可透過 Google 的 Flow 電影製作工具、Gemini 應用程式與開發者 API 使用。
為什麼重要: Veo 在 2025 年樹立了 AI 影片的品質標竿:其物理擬真度使生成片段明顯更難與實拍畫面區分,而 Veo 3 的同步音訊,則將無聲片段變成接近成品的場景。對電影工作者、廣告商與內容團隊而言,它讓 AI 影片從新奇示範轉變成實用的製作工具,也成為如今每個競爭影片模型都會被拿來比較的基準。
Whisper
OpenAI Whisper
模型
OpenAI 於 2022 年發佈的開放原始碼語音辨識模型。Whisper 使用以 68 萬小時弱監督音訊訓練的編碼器-解碼器 Transformer,將語音轉換成文字;單一模型即可處理數十種語言的轉錄、翻譯成英文與語言辨識。由於其權重開放,且模型能穩健處理口音與背景雜訊,它很快就成為自動語音辨識的預設基準。
為什麼重要: 在 Whisper 之前,好用的語音辨識通常意味著付費使用雲端 API,或是接受開放原始碼替代方案平庸的準確率。Whisper 讓接近人類品質的轉錄變得免費、可離線執行,任何擁有 GPU、甚至只要有一顆效能不錯的 CPU 的人都能使用,因而大規模開啟 Podcast 索引、會議記錄、客服中心分析、字幕製作與無障礙工具等用途。它也重新設定了整個領域的預期:如今每個新的語音模型,都得拿它作為比較基準。
Falcon
TII Falcon、Falcon LLM
模型
Falcon 是由阿布達比先進技術研究委員會旗下的應用研究機構——技術創新研究院(TII)——打造的開放權重大型語言模型系列。2023 年,Falcon 的 40B 與 180B 模型登上 Hugging Face 開放 LLM 排行榜榜首,一舉成名,並一度成為當時最強、採寬鬆授權的模型系列。此後,產品線不斷擴展,涵蓋適合裝置端的小型規模、多模態變體與混合架構。
為什麼重要: Falcon 很早便證明,真正的前沿級開放模型也能誕生於美中軸線之外,並成為透過開放權重實踐主權 AI的代表性案例。其寬鬆的 Apache 式授權在實務上意義重大:當 Llama 仍附帶使用限制時,企業可以在 Falcon 上打造產品,不必擔心法律疑慮。它也提供一個實用案例,說明在排行榜勝出,與獲得真實世界採用,是兩回事。
AlphaFold
AlphaFold 2、AlphaFold 3
模型
Google DeepMind 推出的蛋白質結構預測系統,可直接從胺基酸序列計算蛋白質的三維形狀。AlphaFold 2 在 2020 年 CASP14 評估中達到實驗方法的準確度,AlphaFold 3 則將這套方法延伸至蛋白質與 DNA、RNA 和小分子形成的複合物。
為什麼重要: 蛋白質的形狀決定其功能,因此了解結構通常是藥物設計、酵素工程與基礎生物學的第一步。透過 X 光晶體學或冷凍電子顯微鏡,以實驗測定一種結構可能耗時數月甚至數年,AlphaFold 卻只需要數分鐘至數小時的運算。一座收錄超過 2 億種預測結構的公開資料庫,更讓許多研究人員完全不必自行執行模型,直接下載結果即可。
AlphaGo
AlphaZero、AlphaGo Zero
模型
Google DeepMind 打造的圍棋 AI 系統;2016 年 3 月,它在首爾舉行的五番棋中以 4–1 擊敗九段冠軍李世石,成為第一個戰勝頂尖人類職業棋手的電腦程式。AlphaGo 結合深度神經網路、蒙地卡羅樹搜尋,以及透過自我對弈進行的強化學習,攻克了一項數十年來始終抵擋住暴力搜尋式 AI 的棋類遊戲。
為什麼重要: 李世石之戰,是 AI 真正走入大眾視野的時刻:數億人觀看比賽,研究人員、政府與投資人也因此相信,機器學習不只會進行模式比對,還能掌握需要直覺與長期規劃的問題。AlphaGo 驗證的技術——讓神經網路引導搜尋、透過自我對弈持續進步、估算未來獎勵——如今從推理模型、RLHF 到藥物發現,隨處可見。它仍是最經典的證明:在一個過去被認為數十年內都遙不可及的領域,學習系統可以超越人類專家。
Diffusion LLM
Text Diffusion Model、dLLM、文字擴散模型
模型
一種透過反覆去除雜訊來生成文字的大型語言模型,不再由左至右、一次預測一個 token。它從完全被遮罩或擾動的序列開始,經少量步驟並行精修每個位置,將圖像擴散模型的核心概念改造成適合離散文字的版本。
為什麼重要: 速度是最大賣點:延遲取決於精修步數,而非答案長度,因此生成較長的回答不必按比例花費更多時間。Diffusion LLM 還能同時查看雙向上下文,天生擅長填補、編輯與修改既有文字,而不只會接著向下撰寫。
Safe Superintelligence(SSI)是一家 AI 研究公司,由 Ilya Sutskever、Daniel Gross 與 Daniel Levy 於 2024 年創立。公司只有一項公開宣示的目標,以及一款預定產品:安全的超級智慧。它以「直達目標」(straight-shot)策略追求這項目標——在完成之前不推出商業產品、不創造營收,也不公開發佈成果。
為什麼重要: SSI 是對「AI 安全無法事後加裝,必須從一開始就納入工程設計」這項理念最純粹的押注。它由 OpenAI 前首席科學家在離職數週後創立;據報導,公司在沒有任何產品的情況下,2025 年估值已達約 320 億美元。這項實驗要檢驗的,是一間規模小、與外界隔絕的實驗室,能否仍以自己的方式抵達前沿。無論它最終推出什麼——或拒絕推出什麼——都將影響整個業界談論超級智慧風險的方式。
Thinking Machines
Thinking Machines Lab、TML
公司
一家由 OpenAI 前 CTO Mira Murati 與一群知名研究人員於 2025 年創立的 AI 研究及產品公司。其首款產品 Tinker 是一套微調 API,讓開發者無須自建 GPU 基礎設施,就能自訂開放權重語言模型。
為什麼重要: Thinking Machines 檢驗一項命題:頂尖研究人才——而非原始運算資源或分發通路——才是 AI 領域最稀缺的資產;公司尚未推出任何產品時,其種子輪估值便已達約 120 億美元。對實務工作者而言,Tinker 在「直接使用現成模型」與「從零訓練」之間提供一條中間路徑:不必擁有自己的訓練叢集,也能真正掌控微調。
Inflection AI
Inflection、Pi
公司
Inflection AI 是一家由 Mustafa Suleyman、Reid Hoffman 與 Karén Simonyan 於 2022 年創立的 AI 公司,最知名的產品是 Pi——一款以情緒智慧、而非完成任務為設計核心的個人助理。Inflection 曾自行訓練前沿規模的語言模型,但 2024 年 Microsoft 延攬大部分團隊並取得模型授權,剩餘公司隨後轉向企業級 AI。
為什麼重要: Inflection 是說明前沿模型開發經濟學有多殘酷的最鮮明案例:即使擁有頂尖創辦人與超過 10 億美元的資金,也無法在與 OpenAI 和 Google 的競爭中,支撐一門消費級聊天機器人事業。與 Microsoft 的交易也開創科技巨擘吸納人才的新範本——授權加挖角,而非正式收購——此後,監管機關與競爭對手一直密切關注這種操作方式。
Baidu
Ernie、Wenxin Yiyan、Ernie Bot、文心一言
公司
中國科技巨擘,以搜尋引擎與文心一言(Ernie)最為知名——後者是它於 2023 年推出的聊天機器人及基礎模型家族,也是中國最早與 ChatGPT 競爭的主要產品之一。百度也營運蘿蔔快跑(Apollo Go)自駕計程車服務、自行研發崑崙 AI 晶片,並透過雲端事業銷售整套技術堆疊。
為什麼重要: 百度是中國垂直整合程度最高的 AI 業者:從晶片、深度學習框架(飛槳 PaddlePaddle)、大型模型,到建構在上方的消費級服務,全都一手包辦。它在 2025 年以開放原始碼形式釋出文心 4.5 家族,為自行託管的使用者與成本敏感型團隊再添一項強大的開放權重選擇;其自駕計程車網路也是全球規模最大的 AI 實際部署之一。
01.AI
01.AI、Yi、零一萬物
公司
李開復於 2023 年創立的中國 AI 公司,最知名的產品是 Yi 大型語言模型系列。01.AI 一方面發佈 Yi-34B 等開放權重模型——後者曾短暫登上開放模型排行榜榜首——另一方面透過 API 銷售規模更大的專有模型。2025 年,公司不再繼續訓練前沿基礎模型,轉而聚焦企業與消費級應用程式,包括萬知助理。
為什麼重要: 01.AI 是觀察 AI 熱潮經濟學最清楚的案例之一:一家新創公司可以登上開放模型排行榜榜首,成立第一年估值據稱便達 10 億美元,卻仍得出結論——訓練前沿模型不是一門好生意。它的 Yi 模型仍在流通,而 2025 年的轉向,也預演如今每一間中型模型實驗室都能感受到的整併壓力。
Aleph Alpha
Aleph Alpha
公司
一家於 2019 年在海德堡創立的德國 AI 公司,以 Luminous 大型語言模型家族,以及針對歐洲企業與政府的資料主權路線聞名。公司起初曾在模型開發前沿正面競爭,2024 年卻轉向 PhariaAI——一套完整的軟體堆疊,讓組織能在自己掌控的環境與合規規則下建構、執行 AI。
為什麼重要: Aleph Alpha 是歐洲主權 AI最具代表性的案例:關鍵 AI 能力應在國家或企業自行掌控的基礎設施與條款下執行,而非依賴少數幾家美國 API 供應商。它的發展軌跡也顯示,前沿模型訓練的經濟帳有多殘酷,以及中型實驗室如何透過向軟體堆疊上層移動,在企業軟體、合規與信任中求生。
Pika
Pika Labs
公司
一家 AI 影片生成公司,其網頁應用程式可將文字提示、靜態圖像與上傳素材轉換成短影片片段。Pika 由史丹佛大學博士生 Demi Guo 與 Chenlin Meng 於 2023 年創立,以快速迭代消費級版本(從 Pika 1.0 至 2.2)、名為 Pikaffects 的一鍵特效,以及利用參考圖像引導場景的「素材」系統聞名。
為什麼重要: Pika 是 影片生成消費端最鮮明的案例研究:當部分競爭對手積極爭取電影工作者與製片公司時,它專注於為一般創作者製作迷因與社群短片進行最佳化。其素材式控制方法,也顯示這個領域如何解決可控制性問題——也就是「描述一段影片」與「真正取得你想像中那段影片」之間的落差。對任何正在開發或採購影片工具的人而言,Pika 的押注是一項實用訊號,指出主流使用者實際上會如何運用這些工具。
公司
一家 AI 音樂生成公司,其網頁應用程式可將文字提示變成完整歌曲,包括人聲、歌詞與配器。公司由前 Google DeepMind 研究人員創立,於 2024 年公開上線,隨後與 Suno 並列兩大文字生成歌曲服務,也成為「能否使用受著作權保護的音樂訓練 AI」這場法律大戰的核心案例。
為什麼重要: Udio 將製作錄音室品質 Demo 的成本,從一場錄音壓縮成幾行文字,既改變音樂人勾勒構想的流程,也改變內容創作者取得客製配樂的方式。它與大型唱片公司的訴訟及授權交易,也協助界定每一家生成式 AI 公司可以合法使用哪些訓練資料。
公司
OpenRouter 是一個統一 API 閘道,讓開發者透過單一 API 金鑰與一個 OpenAI 相容介面,存取來自不同供應商的數百個大型語言模型。它由 Alex Atallah 於 2023 年推出,負責在 OpenAI、Anthropic、Google 等主要供應商,以及開放權重模型的主要託管商之間,處理路由、容錯移轉、計費與用量追蹤。
為什麼重要: 團隊每多想嘗試一個模型,通常就代表要開設新帳戶、串接新 SDK、建立新的計費關係,還得管理一套新的速率限制政策。OpenRouter 將這些成本壓縮成一次整合,讓切換模型變成一行程式碼的修改,也使跨越整個市場比較價格、速度與品質成為實際可行的做法。
Fireworks AI
Fireworks、fireworks.ai
公司
一個 AI 推論平台,透過高速、按用量付費的 API 提供開放權重模型。它由 Meta PyTorch 團隊的工程師於 2022 年創立,既提供按 token 計費的無伺服器端點,也為高流量工作負載提供專用 GPU 部署,涵蓋大型語言模型,以及圖像、音訊與嵌入模型。
為什麼重要: 自行執行開放模型,代表要採購 GPU、調校服務堆疊,還得承受流量突然增加的衝擊——這是多數產品團隊都不想碰的維運苦差事。Fireworks AI 將一切濃縮成一次 API 呼叫,讓小型團隊也能使用 Llama、DeepSeek 等模型,獲得接近最佳化部署的延遲,以及按用量付費的經濟效益。它是開放權重模型真正進入正式環境的主要途徑之一。
公司
一個透過簡單 API 執行機器學習模型的雲端平台,無須管理任何基礎設施。它託管數千個公開的開放權重模型——涵蓋圖像、影片、音訊與語言——開發者也可使用平台的開放原始碼容器工具 Cog,封裝並部署自己的模型。費用依運算秒數收取,因此成本會隨實際用量變動,而非取決於預留容量。
為什麼重要: 自行執行一個實用模型,代表要佈建 GPU、解決 CUDA 與相依性衝突,還要架設服務層——第一次預測尚未產生,數天就已過去。Replicate 將這一切濃縮成數行程式碼,因此成為開放模型原型、個人專案與正式功能的常見選擇。它也是使用自有資料微調圖像或語言模型最輕鬆的途徑之一。
工具
GitHub 與 OpenAI 合作打造的 AI 程式編寫助手,於 2021 年推出,普遍被視為第一個主流 AI 結對程式設計師。它在編輯器內執行:隨著你輸入內容,建議整行、甚至整個函式,在聊天面板中回答問題,並且——在較新的代理模式下——跨越整個程式碼庫執行多步驟程式設計任務。它支援 VS Code、Visual Studio、JetBrains 系列 IDE 與 Neovim,也可直接在 github.com 上使用。
為什麼重要: Copilot 將 AI 輔助程式設計從示範變成日常預設:它擁有數百萬名開發者使用者,並確立互動範式——幽靈文字自動完成、編輯器內聊天、代理式任務執行——如今幾乎每一款競爭工具都在跟進。對第一線工程師而言,它能在樣板程式碼、單元測試與不熟悉的 API 上省下實際時間。對團隊而言,它也迫使人們做出實務決策:程式碼審查標準、授權風險,以及哪些程式碼可以離開內部網路、傳送至模型供應商。
Devin
Cognition Devin、Cognition AI
工具
Cognition AI 打造的自主式 AI 軟體工程師,可接收高階任務並端到端完成:制訂計畫、撰寫程式碼、執行測試、除錯,再於自身的沙箱環境中建立 pull request。Devin 於 2024 年登場,是第一款以「AI 軟體工程師」為賣點的產品;它採非同步方式工作——你將工單交給它,稍後回來取得成品即可,不必盯著它輸入文字。
為什麼重要: Devin 將 AI 程式設計工具的討論焦點,從自動完成推向任務委派:它不再逐次按鍵協助人類,而是連續數小時負責一整項任務。對淹沒於移轉、相依項目升級與 bug 積壓的團隊而言,這讓程式編寫助手從打字較快的人,變成額外的一名初階隊友——工作應如何界定範圍、審查與發佈,也會受到實際影響。
LlamaIndex
GPT Index
工具
一個開放原始碼資料框架,用來在私有資料上建構 LLM 應用程式。LlamaIndex 負責接通文件與模型間的管線:從數百種來源載入資料、切成區塊並建立索引,在查詢時取回相關片段,再編排最終送給 LLM 的提示。
為什麼重要: 正式環境中的多數 LLM 功能,歸根究柢都是資料問題:模型必須先在上下文中取得文件裡恰到好處的那一小塊,才能提供實用答案。LlamaIndex 是解決這項問題的兩大主流框架之一,另一個是 LangChain;其抽象層從一開始便刻意針對檢索與問答工作負載調校。從客服聊天機器人到文件搜尋工具,不論你正在建構什麼,多半都會使用它,或自行重新發明其中一部分。
SGLang
SGLang Runtime、SRT
工具
SGLang 是一款為大型語言模型打造的開放原始碼服務引擎,目標是讓推論在大規模正式環境中既快速又節省成本。它於 2024 年由出身 UC Berkeley 與 LMSYS 團隊的研究人員發布,其標誌性概念是 RadixAttention——一項可讓共用提示詞前綴的請求重複使用快取運算結果的技術。它與 vLLM 並列為兩大主流開放原始碼 LLM 服務堆疊。
為什麼重要: 在正式環境中執行 LLM 時,大部分費用都花在推論上,而服務引擎決定每項請求會耗用多少 GPU 資源。對於共用系統提示詞、多輪對話或 JSON 輸出的工作負載,SGLang 的前綴重複使用與快速結構化解碼可大幅降低成本和延遲。它也成為超大型開放模型的常見服務選擇,包括 DeepSeek 規模的專家混合模型部署——在這類情境下,單純的服務方式往往難以負荷。
A2A
Agent2Agent、Agent2Agent Protocol
工具
A2A(Agent2Agent)是 Google 於 2025 年推出的開放協定,讓不同供應商與框架打造的 AI 代理能彼此探索、交換訊息,並協作完成任務。它將一個代理如何宣告能力、另一個代理如何交付工作,以及如何一路追蹤工作直到完成加以標準化,雙方都不必揭露內部狀態。A2A 旨在補足將代理連接至工具的 MCP,而非取代 MCP。
為什麼重要: 現今大多數代理都各自孤立:以一套技術堆疊打造的代理若想將工作委派給另一套技術堆疊上的代理,就得撰寫專用的整合程式碼。A2A 為代理提供共同的委派語言,讓用戶端代理無論遠端代理由誰打造、執行哪個模型,都能找到對方、傳送任務並接收結果。企業要串連跨團隊、跨供應商的眾多代理時,這可將兩兩之間的整合工作,縮減為一次協定實作。
Reranking
Re-ranking、Cross-Encoder Reranking、重新排序
工具
檢索管線中的第二輪評分,使用更準確——但也更昂貴——的相關性模型,重新排列第一輪取得的候選文件。向量搜尋或關鍵字搜尋等快速的第一階段會先傳回排名最高的數十個候選項目,重新排序器再逐一根據查詢為其評分,產生更好的最終排序。
為什麼重要: 第一階段檢索是針對速度而非精確度最佳化,因此最佳區塊經常落在第 12 名,而非第 1 名——但真正排在最前面的內容,才是 LLM 實際會在提示詞中看到的內容。重新排序只需付出不高的延遲成本,就能大幅改善相關性,因此已成為正式環境 RAG 系統的標準階段。
In-Context Learning
ICL、上下文學習
基礎
大型語言模型從提示詞中的範例或指示學會一項任務,卻完全不更新模型權重的能力。只要給它看幾組輸入與輸出,它便能在新輸入上延續模式,相當於在收到請求時以純文字為模型編寫程式。OpenAI 於 2020 年發表的 GPT-3 論文使這個概念廣為人知,而提示之所以能成為介面,根本原因也在於此。
為什麼重要: 上下文學習將一個凍結模型變成通用工具:不必為每項任務訓練專用模型,只要用文字描述任務,幾秒後即可獲得可用答案。它促成了提示詞工程這項技能,也讓沒有 ML 訓練管線的團隊能推出 AI 功能。問題在於,這種學習是租來的,而非真正擁有——它只存在於上下文視窗內,而且每次呼叫都必須再次為這些範例付費。
Post-Training
Post-training
訓練
模型在預訓練後接受的一系列訓練階段,可將原始的下一個 token 預測器轉變成實用的助手。它通常結合使用示範資料的監督式微調、根據人類或 AI 回饋進行的偏好調整、以可驗證任務為基礎的強化學習,以及安全訓練。模型的行為、語氣與限制,實際上都是在後訓練階段設定。
為什麼重要: 即使兩個模型以幾乎相同的資料進行預訓練,到了正式環境中也可能給人截然不同的感受,原因就在後訓練的選擇:其中一個能確實遵循指示、適當拒絕有害請求,另一個卻可能漫無邊際或過度拒絕。推理模型時代讓後訓練成為前沿實驗室間的主要差異化因素,也是小型團隊不需負擔預訓練成本,就能實質重塑模型的一個層次。
PPO
Proximal Policy Optimization、近端策略最佳化
訓練
PPO(Proximal Policy Optimization)是一種強化學習演算法,會限制每次更新偏離策略先前行為的幅度,讓策略以小幅且受控的步驟更新。它由 OpenAI 於 2017 年提出,後來成為 RLHF 的預設最佳化器;InstructGPT 與 ChatGPT 等模型背後的偏好訓練階段,使用的正是 PPO。
為什麼重要: PPO 是讓大型語言模型學會遵循指示並保持實用,而不只是預測文字的關鍵機制。如果從事對齊、後訓練或推理模型,就一定會遇到 PPO 或其衍生方法——而它的成本與失敗模式,也會影響訓練團隊實際能發布哪些成果。
GRPO
Group Relative Policy Optimization、群體相對策略最佳化
訓練
一種用於微調語言模型的強化學習演算法,由 DeepSeek 於 2024 年提出,並因 DeepSeek-R1 而普及。它不訓練獨立的價值模型來評估輸出,而是針對每條提示詞取樣一組候選答案,再根據整組的平均獎勵為每個答案評分。這使強化學習的執行成本更低、流程更簡單,也成為使用可驗證獎勵任務進行推理模型後訓練時的標準選擇。
為什麼重要: GRPO 移除 critic 模型,降低了 RL 微調成本;這是傳統管線必須訓練並保留於記憶體中的兩個大型模型之一,使沒有前沿實驗室基礎設施的團隊也能進行推理式訓練。它是 DeepSeek-R1 背後的演算法,此後也為多數開放推理模型採用,因此如今幾乎所有嚴謹的後訓練堆疊都會使用 GRPO。若使用的模型曾接受數學、程式碼或邏輯問題的解題訓練,GRPO 很可能參與其中。
RLVR
Reinforcement Learning with Verifiable Rewards、RL with Verifiable Rewards、可驗證獎勵強化學習
訓練
一種強化學習方法,其獎勵訊號來自自動化的程式驗證器——例如數學答案是否完全正確,或生成的程式碼能否通過單元測試——而非人類偏好標籤或經過訓練的獎勵模型。由於能以程式自動驗證正確性,訓練迴圈可擴展至數百萬個問題,全程不需要人類標註人員參與。近期推理模型浪潮背後採用的訓練方式就是 RLVR。
為什麼重要: RLVR 將數學和程式碼轉化為近乎無限的訓練訊號,因而促成推理模型時代:OpenAI 的 o1 與 DeepSeek-R1 都以這套方法建立能力。對實務人員而言,只要團隊擁有驗證器——測試套件、解答或限制條件驗證器——就能改善模型在該領域的表現,不必聘用標註人員,也不必訓練獎勵模型。它也將後訓練的瓶頸,從收集人類回饋轉移到撰寫優良的驗證器。
LLM-as-Judge
LLM Judge、LLM-as-a-Judge、LLM 評審
訓練
一種評估技術,使用大型語言模型為另一個模型(或自身)的輸出評分,而不依賴人類評分人員。評審會收到原始提示詞、一或兩個候選回答與評分規準,再傳回分數、偏好判定或評析。對於 BLEU、ROUGE 等字串重疊指標會失效的開放式生成,它已成為預設評估方法。
為什麼重要: 人工評估是判斷開放式文字的黃金標準,但速度緩慢且成本高昂:一次嚴謹的評估可能耗時數週,花費數千美元。LLM 評審只需幾分鐘與數美元,就能做出數千項判斷,使團隊能實際評估每次提示詞變更、模型替換和候選發布版本。它還能大規模產生現代對齊訓練所需的偏好標籤。
AI Safety
AI 安全
安全
一個研究與工程領域,目標是讓 AI 系統可靠、可預測地運作,並符合人類意圖。它涵蓋對齊、可解釋性、穩健性、評估與治理,既處理幻覺和偏誤等近期危害,也關注能力極強的系統可能引發的長期問題。AI Safety 不同於 AI Security;後者保護系統免受外部攻擊者侵害,而非修正系統本身的行為。
為什麼重要: 每個交付給使用者的模型都有失敗模式——捏造事實、可遭越獄的護欄、帶有偏誤的決策,以及代理採取非預期行動——這些失敗也會隨使用規模放大。安全工作可將「示範成功運作」轉變為「系統能承受數百萬名使用者與對抗性壓力」,而監管機關也愈來愈將安全視為法律要求,而非可有可無的加分項目。
Computer Use
電腦操作代理、GUI 代理、Computer-Using Agent (CUA)
使用AI
一種讓 AI 模型像人類一樣操作實際桌面或瀏覽器的能力:查看螢幕截圖,再發出滑鼠與鍵盤動作。模型不呼叫 API,而是感知螢幕、決定要點選或輸入什麼,再由執行器實際操作;這個迴圈會持續到任務完成或代理放棄。Anthropic 的 Computer Use 功能與 OpenAI 的 Operator 是最知名的實作。
為什麼重要: 大多數商用軟體是為人類而非機器打造,其中許多沒有可用的 API。電腦操作代理原則上能操作任何這類軟體——舊有 ERP、內部管理後台,以及沒有整合管道的網站——使其成為迄今最通用的 AI 自動化嘗試。它們同時也是目前最不可靠的形式,因此了解其限制與了解其潛力同等重要。
Deep Research
Deep Research Agents、Agentic Research、深度研究
使用AI
多款 AI 助手提供的一種模式,模型會自主規劃並執行多步驟網路研究任務,再傳回附有引用的結構化報告。它不會只進行一次快速搜尋便回答,而是花費數分鐘閱讀數十個來源、追查線索,並整合研究結果。Google 於 2024 年 12 月率先在 Gemini 中以這個名稱推出功能,OpenAI 2025 年 2 月的發布讓它普及開來,如今 Perplexity 與 Grok 也都提供同類產品。
為什麼重要: 一次 Deep Research 可將數小時的人工文獻回顧——搜尋、略讀、交叉核對及記錄筆記——濃縮為單一請求。它最適合沒有唯一權威答案的問題:市場盤點、技術比較、政策概況和文獻綜述,這些工作對廣度與可追溯引用的重視高於速度。
Vibe Coding
Vibe Coding、氛圍程式設計
使用AI
一種建構軟體的方式:以自然語言描述需求,讓 AI 模型撰寫程式碼,再接受結果而不仔細審查。Andrej Karpathy 於 2025 年 2 月提出這個詞,用來形容一種工作風格;用他的話說,就是「完全順從氛圍」並「忘記程式碼甚至存在」。AI 負責撰寫、執行與除錯程式碼,人類則透過意圖引導方向。
為什麼重要: Vibe Coding 大幅降低建構軟體的門檻:沒有程式設計背景的人也能推出可運作的原型,資深開發人員處理樣板程式碼與黏合程式碼的速度則可快上許多。問題在於,無人讀過的程式碼往往暗藏錯誤、安全漏洞和維護債務;這些成本會在日後浮現,而且經常選在最糟糕的時機。判斷何時值得接受這項取捨,如今也成為一項實用技能。
Context Engineering
上下文工程
使用AI
設計、組合並維護模型在上下文視窗中看到的一切——包括系統提示詞、檢索到的文件、工具輸出、記憶及對話紀錄——使模型能可靠完成工作的實務。這個詞於 2025 年興起,被視為提示詞工程的後繼者,反映出業界從手動調整單一指示,轉向設計模型周圍完整資訊環境的變化。
為什麼重要: 模型只能根據眼前內容進行推理,因此上下文品質往往比模型本身更重要:獲得冗長、相互矛盾上下文的前沿模型,表現可能不及取得精簡且精心整理上下文的較小模型。在正式環境系統中,尤其是代理與 RAG 管線,多數失敗都可追溯至上下文問題——缺少資訊、資料過時、內容矛盾或重要訊號遭淹沒——而非模型本身的能力。
SLM
Small Language Model、Small Language Models、小語言模型
基礎
一種以效率為設計目標的語言模型,通常具有約 1 億至 150 億個參數。SLM 規模小到足以在筆記型電腦、手機或單張 GPU 等消費級硬體上執行,不需使用資料中心叢集;它以部分知識廣度與推理能力,換取低成本、低延遲,以及離線與裝置端執行能力。
為什麼重要: 無法負擔按查詢計費的 API 帳單、雲端往返,或不能將使用者資料傳送給第三方的產品,可透過 SLM 內建 AI。對分類、擷取、短篇摘要與函式呼叫等範圍狹窄且定義明確的工作,經過微調的小型模型通常能以一小部分成本和延遲,達到前沿模型的表現。SLM 也能在資料所在的位置執行,這對隱私、法規遵循及離線使用十分重要。
TPU
Tensor Processing Unit、張量處理單元
基礎設施
Google 專為機器學習工作負載設計的一系列客製化 AI 加速器晶片(ASIC)。TPU 捨棄 GPU 的通用彈性,採用以大型矩陣乘法單元為核心的脈動陣列架構,在主導深度學習的張量運算上提供高吞吐量與能源效率。Google 自 2015 年起在內部使用 TPU,透過 Google Cloud 出租,並以 TPU 訓練每一代 Gemini。
為什麼重要: TPU 是 AI 運算並非單一供應商市場的最有力證明:它們是 NVIDIA 以外用於大規模訓練前沿模型時間最長的晶片,而 Anthropic 與 Apple 等公司都將重要工作負載押在 TPU 上。對實務人員而言,TPU 是 Google Cloud 上的替代選項;只要軟體堆疊適合,它在大型訓練及高流量推論上的價格效能可能優於 GPU。
Turing Test
模仿遊戲
基礎
Alan Turing 在 1950 年論文《Computing Machinery and Intelligence》中提出的一項機器智慧行為測試。如果人類評審透過文字訊息與身分隱藏的對話者交流,卻無法可靠區分機器與人類,就可以說該機器展現智慧行為。Turing 提出這項測試,是為了以具體問題取代「機器能否思考」這個較為模糊的問題。
為什麼重要: 圖靈測試形塑了七十多年來關於何者可算作機器智慧的辯論,而且每當有聊天機器人被聲稱通過測試時,它仍會成為公眾討論的基準。了解測試真正衡量的內容——在時間壓力下令人信服的模仿,而非理解——能讓讀者批判看待這類新聞標題,而不會照單全收。
ImageNet
ImageNet Challenge、ILSVRC、ImageNet 挑戰賽
訓練
一個大規模圖像資料集,包含約 1,400 萬張人工標註的圖片,分為 20,000 多個類別,最早由李飛飛帶領的團隊於 2009 年發布。相關的年度競賽 ImageNet Large Scale Visual Recognition Challenge(ILSVRC)成為電腦視覺的標準基準測試,並在神經網路於 2012 年奪冠後開啟深度學習時代。
為什麼重要: ImageNet 證明,擴大資料規模與發明更優良的演算法同等重要,這項教訓至今仍形塑 AI 策略。其預訓練權重成為實用電腦視覺工作的預設起點,而包含 1,000 個類別的基準子集,至今仍是新型視覺架構證明實力的標準。
EU AI Act
AI Act、European AI Act、歐盟人工智慧法案
安全
歐盟規範人工智慧的綜合法律,自 2024 年 8 月起生效。它採取風險導向方法:AI 系統可能造成的危害愈大,適用義務就愈嚴格,從直接禁止少數做法,到只要求低風險工具履行簡單的透明度義務。
為什麼重要: 如果在歐盟建構、銷售或部署 AI——或者模型輸出會在當地使用——無論公司總部設於何處,這部法案很可能都適用。違反禁止做法的規定,最高罰款可達全球年營業額的 7%;如同 GDPR 為資料保護設下標準,這部法律正成為業界事實上的法規遵循基準。
Sovereign AI
Sovereign AI、主權 AI
基礎設施
一項建立國內人工智慧能力的國家策略——包括本國的運算基礎設施、模型與資料——使關鍵 AI 工作負載不必依賴外國供應商。實務上,這代表由政府支援的 GPU 叢集、在地訓練或調整的基礎模型,以及要求敏感資料留在國境內的規定。
為什麼重要: Sovereign AI 會影響 AI 工作負載在何處執行、政府與受監管產業獲准使用哪些模型,以及誰能取得這項技術的經濟價值。對實務人員而言,它會以採購要求、資料駐留限制,以及日益成長的國家級雲端與在地託管模型市場呈現。
AI Energy Consumption
AI Power Consumption、AI Energy Use、AI 能源消耗
基礎設施
AI 系統在整個生命週期中消耗的總電力,主要由兩個階段構成:產生模型的一次性訓練,以及回應每項使用者請求的持續推論。負載包括加速器本身,以及周邊冷卻、網路和電力輸送的額外消耗。隨模型與使用規模擴大,這項需求已大到足以重塑數個國家的電網規劃。
為什麼重要: 能源如今是限制 AI 發展的主要因素之一:耗用數百 MW 的訓練叢集,只能建在電網有能力供應這麼多電力的地點,而電力供應愈來愈直接決定新增運算容量的建設位置。對實務人員而言,能源也直接反映在服務成本,以及每家大型 AI 實驗室如今都必須說明的永續性主張中。
Embodied AI
Embodied Intelligence、Robotics Foundation Models、具身智慧
基礎
一種讓模型控制實體機器的人工智慧方法——機器人不只在螢幕上處理文字與圖像,而能在現實世界中感知、移動並操控物體。核心主張是,真正的智慧需要身體:感知、推理與運動控制必須透過和環境互動一併學習。這個詞涵蓋倉庫機械手臂、四足機器人,以及通用型人形機器人等各種系統。
為什麼重要: 具身智慧是語言與視覺模型的近期進展和實體經濟交會之處:製造、物流、營造、農業及照護工作都仰賴體力勞動。能將餐具放入洗碗機或為貨架補貨的模型,價值遠高於只能描述步驟的模型,而業界許多公司如今也將機器人視為大型語言模型之後的下一個前沿。對實務人員而言,AI 最棘手的未解問題——資料稀缺、安全與即時控制——也正轉移到這個領域。
ESC