Aller au contenu principal
Zubnet AIApprendreWiki › Qwen
Modèles

Qwen

Aussi appelé : Tongyi Qianwen
Qwen est une famille de grands modèles de langage à poids ouverts développée par Alibaba Cloud. La gamme couvre plusieurs générations — Qwen 1.5, 2, 2.5 et 3 — avec des tailles allant d'un demi-milliard à des centaines de milliards de paramètres, dans des conceptions denses comme à mélange d'experts. La plupart des versions sont publiées sous la permissive licence Apache 2.0, ce qui permet de les exécuter, de les modifier et de les déployer commercialement sans redevance d'utilisation.

Pourquoi c’est important

Qwen est l'une des meilleures familles à poids ouverts disponibles, ce qui en fait un point de départ par défaut pour les équipes qui veulent un modèle performant qu'elles peuvent exécuter ou ajuster elles-mêmes au lieu de payer des frais d'API au token. Ses modèles sont particulièrement bons en multilingue, en programmation et en mathématiques, et l'éventail des tailles fait qu'il existe généralement une variante adaptée à un budget GPU donné. Comme les poids sont téléchargeables, un modèle Qwen peut aussi servir de base à votre propre modèle spécialisé, et pas seulement d'endpoint que l'on appelle.

En profondeur

Qwen n'est pas un modèle mais toute une gamme de produits, et comprendre la nomenclature la rend beaucoup plus facile à naviguer. Un nom de version typique comme Qwen2.5-7B-Instruct vous indique la génération (2.5), le nombre de paramètres (7 milliards) et la variante : Instruct signifie ajusté pour suivre des instructions et dialoguer, tandis que Base est le modèle pré-entraîné brut, conçu comme fondation pour un entraînement ultérieur. Chaque génération sort en plusieurs tailles à la fois, ce qui permet de prototyper avec un petit modèle puis de monter en gamme sans changer d'outillage. Les poids sont publiés sur Hugging Face et sur ModelScope, la plateforme propre d'Alibaba, et ils sont packagés pour toutes les grandes stacks de serving, d'Ollama sur un ordinateur portable aux clusters vLLM en production.

Les générations et les tailles

La famille a traversé quatre générations majeures en succession rapide : 1.5, 2, 2.5 et 3. Chaque génération a apporté plus de données d'entraînement, des fenêtres de contexte plus longues et un meilleur ajustement par instructions, et chacune est sortie en une échelle de tailles — dans la gamme 2.5, par exemple, cela voulait dire des modèles denses d'environ 0.5B, 1.5B, 3B, 7B, 14B, 32B et 72B de paramètres. Les plus petits modèles visent les ordinateurs portables et les appareils en périphérie, les milieux de gamme sont les bêtes de somme que l'on ajuste, et les plus gros rivalisent avec les modèles frontière. Qwen 3 a ajouté des fleurons à mélange d'experts : le modèle de tête compte 235 milliards de paramètres au total mais n'en active qu'environ 22 milliards par token, ce qui maintient le coût d'inférence proche d'un modèle dense bien plus petit.

Qwen 3 a aussi introduit un mode de réflexion hybride, où un même modèle peut soit répondre directement, soit dépenser du calcul supplémentaire pour raisonner étape par étape avant de répondre, contrôlé par un flag dans le prompt ou le template de chat. Cela a brouillé la frontière entre un modèle de chat et un modèle de raisonnement dédié, et c'est depuis devenu un schéma courant dans toute l'industrie.

Les variantes spécialisées

Autour des modèles de chat principaux, Alibaba publie des gammes spécialisées entraînées pour des tâches précises. La série Qwen-Coder cible la programmation, de l'autocomplétion aux tâches de codage agentique, et rivalise directement avec les modèles de code dédiés. QwQ est la gamme de raisonnement, entraînée à résoudre des problèmes de mathématiques et de logique avec de longues chaînes de pensée avant de répondre; une grande partie de cette capacité a ensuite été réintégrée dans le mode de réflexion de Qwen 3. Côté multimodal, Qwen-VL gère les images et les documents, et il existe aussi des versions orientées audio et mathématiques, plus des modèles d'embedding et de reranking pour les pipelines de retrieval. Si une charge de travail a un nom, il existe généralement une variante de Qwen qui la vise.

Ce n'est pas qu'un modèle chinois

Une idée reçue courante veut que Qwen ne soit vraiment utile que si vous travaillez en chinois, puisqu'il vient d'une entreprise chinoise. En pratique, c'est l'une des familles les plus multilingues qui soient : les modèles sont entraînés à gérer des dizaines de langues, la compétence en anglais est réellement solide, et une grande partie des gens qui ajustent Qwen sur Hugging Face ne touchent jamais au chinois. L'autre inquiétude qui revient concerne la provenance — adopter un modèle d'un fournisseur étranger crée-t-il un risque d'exposition des données? Avec des poids ouverts, cette crainte s'évapore en grande partie, parce que le modèle tourne sur votre propre matériel et qu'aucune donnée de prompt ne quitte vos machines; le fichier de poids lui-même n'est que des nombres.

Licence et exécution par vos soins

La plupart des versions de Qwen sont sous Apache 2.0, l'une des licences les plus permissives de l'industrie, qui autorise l'usage commercial, la modification et la redistribution. Quelques tailles et variantes de recherche ont été publiées sous les licences propres d'Alibaba avec des conditions supplémentaires, donc il vaut la peine de vérifier la fiche du modèle pour la version précise que vous comptez déployer. Au quotidien, la réalité pratique est simple : des builds GGUF quantifiés tournent en local via llama.cpp ou Ollama, et les déploiements en production servent typiquement les poids en pleine précision ou en FP8 via vLLM ou SGLang. La quantification en 4 bits réduit l'empreinte mémoire d'environ quatre fois avec une perte de qualité modeste, et c'est ainsi qu'un modèle 32B finit par tenir sur un seul GPU grand public haut de gamme.

Sa place dans l'écosystème ouvert

Qwen rivalise dans la même arène des poids ouverts que Llama, Mistral, Gemma et DeepSeek, et ses sorties se placent régulièrement en tête des classements publics comme Chatbot Arena parmi les modèles dont on peut réellement télécharger les poids. Son influence la plus profonde tient à son rôle de fondation : la licence permissive et les excellents petits modèles ont fait de Qwen l'une des bases les plus populaires pour l'ajustement fin communautaire, et même d'autres labos construisent dessus — DeepSeek a publié son modèle de raisonnement R1 sous forme de distillations dans des tailles Qwen, ce qui en dit long sur les poids auxquels l'industrie fait confiance. Si vous choisissez un modèle de base à poids ouverts aujourd'hui, Qwen figure sur la shortlist quasiment par défaut.

← Tous les termes
ESC