跳到主要内容
Zubnet AI学习Wiki › Qwen
模型

Qwen

别名:通义千问
Qwen 是阿里云开发的开放权重大型语言模型家族。该系列横跨多个代际——Qwen 1.5、2、2.5 和 3——参数规模从 5 亿到数千亿不等,既有稠密设计,也有专家混合设计。大多数版本都以宽松的 Apache 2.0 许可证发布,因此可以免费用于商业运行、修改和部署。

为什么重要

Qwen 是目前最强的开放权重模型家族之一,这使其成为那些希望自己运行或微调模型、而不是按 token 支付 API 费用的团队的默认起点。它的模型尤其擅长多语言任务、编程和数学,而且尺寸分布很广,通常总有一个变体能装进给定的 GPU 预算。由于权重可以下载,Qwen 模型还可以作为你自己专用模型的底座,而不仅仅是一个可调用的端点。

深度解析

Qwen 不是单个模型,而是一条完整的产品线,读懂它的命名规则会让选型容易得多。一个典型的版本名如 Qwen2.5-7B-Instruct 会告诉你代际(2.5)、参数量(70 亿)和变体:Instruct 表示经过指令遵循和对话调优,Base 则是原始的预训练模型,作为进一步训练的基础。每一代都会同时发布多个尺寸,因此你可以用小模型做原型,再在不更换工具链的情况下放大规模。权重发布在 Hugging Face 和阿里自己的 ModelScope 平台上,并为所有主流推理栈打包好了——从笔记本上的 Ollama 到生产环境的 vLLM 集群。

代际与尺寸

这个家族在很短的时间内连续走过了四个大代际:1.5、2、2.5 和 3。每一代都带来了更多训练数据、更长的上下文窗口和更好的指令微调,并且每一代都以一串尺寸梯队发布——以 2.5 系列为例,稠密模型的参数量大致为 0.5B、1.5B、3B、7B、14B、32B 和 72B。小模型面向笔记本和边缘设备,中端模型是大家微调的主力,大模型则与前沿模型竞争。Qwen 3 还把专家混合模型旗舰加了进来:顶级模型总参数量 2350 亿,但每个 token 只激活约 220 亿,这让推理成本更接近一个小得多的稠密模型。

Qwen 3 还引入了混合思考模式:同一个模型既可以直接回答,也可以在回答前多花算力逐步推理,由提示词或聊天模板中的一个开关控制。这模糊了聊天模型和专用推理模型之间的界限,此后已成为整个行业的常见做法。

专用变体

在核心聊天模型之外,阿里还发布了一系列面向特定任务的专用产品线。Qwen-Coder 系列面向编程,从自动补全到智能体式编程任务,直接与专用代码模型竞争。QwQ 是推理系列,训练目标是在回答前用长思维链解数学和逻辑题;其中大部分能力后来被并回了 Qwen 3 的思考模式。多模态方面,Qwen-VL 处理图像和文档,此外还有音频和数学方向的版本,以及用于检索管道的嵌入和重排序模型。只要一种工作负载有名字,通常就有一个对应的 Qwen 变体。

它不只是一个中文模型

一个常见的误解是:既然 Qwen 来自一家中国公司,那它主要在你做中文任务时才有用。实际上它是多语言能力最强的模型家族之一:模型被训练为可以处理数十种语言,英语能力真正过硬,在 Hugging Face 上微调 Qwen 的人里有很大一部分根本不碰中文。另一个常被提起的担忧是来源问题——采用海外厂商的模型是否会带来数据暴露风险。对于开放权重而言,这种担忧基本不成立,因为模型运行在你自己的硬件上,提示词数据不会离开你的机器;权重文件本身只是一堆数字。

许可与自行部署

大多数 Qwen 版本采用 Apache 2.0——业内最宽松的许可证之一——允许商业使用、修改和再分发。少数尺寸和研究型变体使用阿里自己的许可证并附带额外条件,所以发布前最好查看你计划使用的具体版本的模型卡。日常使用的实际情况很简单:量化后的 GGUF 版本可以通过 llama.cpp 或 Ollama 在本地运行,生产部署通常通过 vLLM 或 SGLang 提供全精度或 FP8 权重。量化到 4 比特可以把内存占用降到约四分之一,而质量损失不大——这就是一个 32B 模型最终能塞进一张高端消费级 GPU 的原因。

它在开放生态中的位置

Qwen 与 Llama、Mistral、Gemma 和 DeepSeek 在同一个开放权重竞技场中竞争,其版本经常登上 Chatbot Arena 等公开排行榜中可实际下载权重模型的前列。它更深层的影响在于作为底座:宽松的许可证和强大的小模型使 Qwen 成为社区微调最受欢迎的基础之一,甚至连其他实验室也在它之上构建——DeepSeek 的 R1 推理模型就是以蒸馏到 Qwen 尺寸的形式发布的,这很能说明业界信任谁的权重。如果你今天在选一个开放权重基座模型,Qwen 几乎默认就在候选名单上。

← 所有术语
ESC