跳到主要內容
Zubnet AI學習Wiki › Qwen
模型

Qwen

別名:通義千問(Tongyi Qianwen)
Qwen 是由 阿里雲開發的開放權重大型語言模型家族。產品線橫跨多個世代 —— Qwen 1.5、2、2.5 和 3 —— 參數規模從 5 億到數千億不等,同時涵蓋密集(dense)與專家混合(mixture-of-experts)設計。大多數版本以寬鬆的 Apache 2.0 授權發佈,因此可以執行、修改並用於商業部署,而無需支付使用費。

為什麼重要

Qwen 是目前最強大的開放權重家族之一,這使它成為許多團隊的預設起點 —— 這些團隊想要一個能自行執行或微調的強大模型,而非按 token 支付 API 費用。其模型特別擅長多語言工作、程式編寫和數學,而且尺寸分佈廣泛,通常總有一個變體能符合給定的 GPU 預算。由於權重可以下載,Qwen 模型還可以作為你自己專用模型的基礎,而不只是一個你呼叫的端點。

深度解析

Qwen 不是單一模型,而是一整條產品線,讀懂命名規則會讓上手容易得多。像 Qwen2.5-7B-Instruct 這樣的典型版本名稱會告訴你世代(2.5)、參數量(70 億)和變體類型:Instruct 表示經過指令遵循與聊天調優,Base 則是原始的預訓練模型,作為進一步訓練的基礎。每個世代都同時推出多種尺寸,因此你可以先用小模型做原型,再放大規模而不必更換工具。權重發佈在 Hugging Face 和阿里巴巴自家的 ModelScope 平台上,並為所有主流服務堆疊打包 —— 從筆記型電腦上的 Ollama 到生產環境中的 vLLM 叢集。

世代與尺寸

這個家族在短時間內快速經歷了四個主要世代:1.5、2、2.5 和 3。每一代都帶來更多訓練資料、更長的上下文視窗和更好的指令調優,而且每一代都以階梯式的尺寸發佈 —— 以 2.5 系列為例,包含約 0.5B、1.5B、3B、7B、14B、32B 和 72B 參數的密集模型。較小的模型瞄準筆記型電腦和邊緣裝置,中階尺寸是人們微調的主力,大型模型則與前沿模型競爭。Qwen 3 還在陣容中加入了專家混合模型旗艦:頂級模型擁有 2350 億總參數,但每個 token 只啟動約 220 億,這讓推論成本更接近一個小得多的密集模型。

Qwen 3 還引入了混合思考模式:單一模型可以直接回答,也可以在回應前花費額外算力逐步推理,由提示或聊天範本中的一個開關控制。這模糊了聊天模型與專用推理模型之間的界線,此後已成為整個業界的常見模式。

專用變體

在核心聊天模型周圍,阿里巴巴還發佈針對特定任務訓練的專用產品線。Qwen-Coder 系列瞄準程式設計,從自動補全到代理式編碼任務,直接與專用程式碼模型競爭。QwQ 是推理產品線,訓練目標是在回答前用長思維鏈解決數學和邏輯問題;其中大部分能力後來被整合回 Qwen 3 的思考模式。在多模態方面,Qwen-VL 處理圖像和文件,此外還有音訊和數學導向的版本,以及用於檢索管線的嵌入和重排序模型。如果某種工作負載有名字,通常就有一個針對它的 Qwen 變體。

它不只是中文模型

一個常見的誤解是:既然 Qwen 來自中國公司,它就主要只對中文工作有用。實際上它是目前多語言能力最強的家族之一:模型經過訓練可處理數十種語言,英文能力確實很強,而且在 Hugging Face 上微調 Qwen 的人中有很大一部分從未接觸過中文。另一個浮現的擔憂是來源問題 —— 採用海外廠商的模型是否會帶來資料外洩風險。對於開放權重而言,這個擔憂基本上消失了,因為模型執行在你自己的硬體上,沒有任何提示資料離開你的機器;權重檔案本身只是一堆數字。

授權與自行執行

大多數 Qwen 版本採用 Apache 2.0 —— 業界最寬鬆的授權之一 —— 允許商業使用、修改和再散佈。少數尺寸和研究變體以阿里巴巴自有授權發佈並附帶額外條件,因此值得查看你計畫推出的特定版本的模型卡。日常實務上很簡單:量化的 GGUF 版本可透過 llama.cpp 或 Ollama 在本地執行,生產部署通常透過 vLLM 或 SGLang 提供全精度或 FP8 權重。量化到 4 位元可將記憶體佔用縮小約四倍,而品質損失有限,這就是一個 32B 模型最終能裝進單張高階消費級 GPU 的原因。

它在開放生態系中的位置

Qwen 與 Llama、Mistral、Gemma 和 DeepSeek 在同一個開放權重競技場中競爭,其發佈的版本經常在 Chatbot Arena 等公開排行榜上名列前茅 —— 在權重確實可以下載的模型之中。它更深層的影響在於作為基礎:寬鬆的授權和強大的小模型使 Qwen 成為社群微調最受歡迎的基礎之一,甚至其他實驗室也建構於其上 —— DeepSeek 將其 R1 推理模型以 Distillation 形式放入 Qwen 的尺寸發佈,這充分說明了業界信任誰的權重。如果你今天要選擇一個開放權重基礎模型,Qwen 幾乎預設就在候選名單上。

← 所有術語
ESC