Qwen
為什麼重要
深度解析
Qwen 不是單一模型,而是一整條產品線,讀懂命名規則會讓上手容易得多。像 Qwen2.5-7B-Instruct 這樣的典型版本名稱會告訴你世代(2.5)、參數量(70 億)和變體類型:Instruct 表示經過指令遵循與聊天調優,Base 則是原始的預訓練模型,作為進一步訓練的基礎。每個世代都同時推出多種尺寸,因此你可以先用小模型做原型,再放大規模而不必更換工具。權重發佈在 Hugging Face 和阿里巴巴自家的 ModelScope 平台上,並為所有主流服務堆疊打包 —— 從筆記型電腦上的 Ollama 到生產環境中的 vLLM 叢集。
世代與尺寸
這個家族在短時間內快速經歷了四個主要世代:1.5、2、2.5 和 3。每一代都帶來更多訓練資料、更長的上下文視窗和更好的指令調優,而且每一代都以階梯式的尺寸發佈 —— 以 2.5 系列為例,包含約 0.5B、1.5B、3B、7B、14B、32B 和 72B 參數的密集模型。較小的模型瞄準筆記型電腦和邊緣裝置,中階尺寸是人們微調的主力,大型模型則與前沿模型競爭。Qwen 3 還在陣容中加入了專家混合模型旗艦:頂級模型擁有 2350 億總參數,但每個 token 只啟動約 220 億,這讓推論成本更接近一個小得多的密集模型。
Qwen 3 還引入了混合思考模式:單一模型可以直接回答,也可以在回應前花費額外算力逐步推理,由提示或聊天範本中的一個開關控制。這模糊了聊天模型與專用推理模型之間的界線,此後已成為整個業界的常見模式。
專用變體
在核心聊天模型周圍,阿里巴巴還發佈針對特定任務訓練的專用產品線。Qwen-Coder 系列瞄準程式設計,從自動補全到代理式編碼任務,直接與專用程式碼模型競爭。QwQ 是推理產品線,訓練目標是在回答前用長思維鏈解決數學和邏輯問題;其中大部分能力後來被整合回 Qwen 3 的思考模式。在多模態方面,Qwen-VL 處理圖像和文件,此外還有音訊和數學導向的版本,以及用於檢索管線的嵌入和重排序模型。如果某種工作負載有名字,通常就有一個針對它的 Qwen 變體。
它不只是中文模型
一個常見的誤解是:既然 Qwen 來自中國公司,它就主要只對中文工作有用。實際上它是目前多語言能力最強的家族之一:模型經過訓練可處理數十種語言,英文能力確實很強,而且在 Hugging Face 上微調 Qwen 的人中有很大一部分從未接觸過中文。另一個浮現的擔憂是來源問題 —— 採用海外廠商的模型是否會帶來資料外洩風險。對於開放權重而言,這個擔憂基本上消失了,因為模型執行在你自己的硬體上,沒有任何提示資料離開你的機器;權重檔案本身只是一堆數字。
授權與自行執行
大多數 Qwen 版本採用 Apache 2.0 —— 業界最寬鬆的授權之一 —— 允許商業使用、修改和再散佈。少數尺寸和研究變體以阿里巴巴自有授權發佈並附帶額外條件,因此值得查看你計畫推出的特定版本的模型卡。日常實務上很簡單:量化的 GGUF 版本可透過 llama.cpp 或 Ollama 在本地執行,生產部署通常透過 vLLM 或 SGLang 提供全精度或 FP8 權重。量化到 4 位元可將記憶體佔用縮小約四倍,而品質損失有限,這就是一個 32B 模型最終能裝進單張高階消費級 GPU 的原因。
它在開放生態系中的位置
Qwen 與 Llama、Mistral、Gemma 和 DeepSeek 在同一個開放權重競技場中競爭,其發佈的版本經常在 Chatbot Arena 等公開排行榜上名列前茅 —— 在權重確實可以下載的模型之中。它更深層的影響在於作為基礎:寬鬆的授權和強大的小模型使 Qwen 成為社群微調最受歡迎的基礎之一,甚至其他實驗室也建構於其上 —— DeepSeek 將其 R1 推理模型以 Distillation 形式放入 Qwen 的尺寸發佈,這充分說明了業界信任誰的權重。如果你今天要選擇一個開放權重基礎模型,Qwen 幾乎預設就在候選名單上。