Qwen
Por qué importa
En profundidad
Qwen no es un modelo sino una línea de productos completa, y entender el esquema de nombres hace mucho más fácil orientarse. Un nombre de lanzamiento típico como Qwen2.5-7B-Instruct te dice la generación (2.5), el número de parámetros (7 mil millones) y la variante: Instruct significa ajustado para seguir instrucciones y conversar, mientras que Base es el modelo preentrenado crudo pensado como fundamento para entrenamiento adicional. Cada generación se publica en varios tamaños a la vez, así que puedes prototipar con un modelo pequeño y escalar sin cambiar de herramientas. Los pesos se publican en Hugging Face y en ModelScope, el hub propio de Alibaba, y vienen empaquetados para cada stack de servicio importante, desde Ollama en un portátil hasta clústeres de vLLM en producción.
Las generaciones y los tamaños
La familia ha pasado por cuatro generaciones importantes en rápida sucesión: 1.5, 2, 2.5 y 3. Cada generación trajo más datos de entrenamiento, ventanas de contexto más largas y mejor instruction tuning, y cada una se publicó en una escala de tamaños — en la línea 2.5, por ejemplo, eso significó modelos densos de aproximadamente 0.5B, 1.5B, 3B, 7B, 14B, 32B y 72B parámetros. Los modelos más pequeños apuntan a portátiles y dispositivos de borde, los de gama media son los caballos de batalla que la gente ajusta, y los grandes compiten con los modelos frontera. Qwen 3 añadió a la mezcla modelos insignia de mezcla de expertos: el modelo superior tiene 235 mil millones de parámetros totales pero solo activa unos 22 mil millones por token, lo que mantiene el costo de inferencia más cerca de un modelo denso mucho más pequeño.
Qwen 3 también introdujo un modo de pensamiento híbrido, en el que un solo modelo puede responder directamente o gastar cómputo extra razonando paso a paso antes de contestar, controlado por una marca en el prompt o en la plantilla de chat. Eso difuminó la línea entre un modelo de chat y un modelo de razonamiento dedicado, y desde entonces se ha convertido en un patrón común en toda la industria.
Las variantes especialistas
Alrededor de los modelos de chat centrales, Alibaba publica líneas especialistas entrenadas para trabajos específicos. La serie Qwen-Coder apunta a la programación, desde el autocompletado hasta tareas de codificación agéntica, y compite directamente con modelos de código dedicados. QwQ es la línea de razonamiento, entrenada para resolver problemas de matemáticas y lógica con largas cadenas de pensamiento antes de responder; gran parte de esa capacidad se reincorporó después al modo de pensamiento de Qwen 3. En el lado multimodal, Qwen-VL maneja imágenes y documentos, y también hay lanzamientos centrados en audio y en matemáticas, además de modelos de embeddings y de reranking para pipelines de recuperación. Si una carga de trabajo tiene nombre, normalmente hay una variante de Qwen apuntando a ella.
No es solo un modelo chino
Una idea equivocada común es que Qwen solo resulta útil si trabajas en chino, ya que viene de una empresa china. En la práctica es una de las familias más multilingües disponibles: los modelos están entrenados para manejar docenas de idiomas, la capacidad en inglés es genuinamente sólida, y gran parte de la gente que ajusta Qwen en Hugging Face no toca el chino en absoluto. La otra preocupación que surge es la procedencia — si adoptar un modelo de un proveedor extranjero crea riesgo de exposición de datos. Con pesos abiertos esa preocupación se evapora casi por completo, porque el modelo se ejecuta en tu propio hardware y ningún dato de tus prompts sale de tus máquinas; el archivo de pesos en sí es solo números.
Licencias y ejecución por cuenta propia
La mayoría de los lanzamientos de Qwen son Apache 2.0, una de las licencias más permisivas de la industria, que permite el uso comercial, la modificación y la redistribución. Algunos tamaños y variantes de investigación se han publicado bajo licencias propias de Alibaba con condiciones extra, así que vale la pena revisar la ficha de modelo del lanzamiento concreto que planeas distribuir. En el día a día, la historia práctica es simple: las compilaciones GGUF cuantizadas se ejecutan localmente a través de llama.cpp u Ollama, y los despliegues en producción normalmente sirven los pesos en precisión completa o FP8 a través de vLLM o SGLang. La cuantización a 4 bits reduce la huella de memoria aproximadamente cuatro veces con solo una pérdida modesta de calidad, que es cómo un modelo de 32B termina cabiendo en una sola GPU de consumo de gama alta.
Su lugar en el ecosistema abierto
Qwen compite en la misma arena de pesos abiertos que Llama, Mistral, Gemma y DeepSeek, y sus lanzamientos se colocan habitualmente cerca de la cima de las clasificaciones públicas como Chatbot Arena entre los modelos cuyos pesos realmente puedes descargar. Su influencia más profunda es como fundamento: la licencia permisiva y los sólidos modelos pequeños han convertido a Qwen en una de las bases más populares para el ajuste fino comunitario, e incluso otros laboratorios construyen sobre él — DeepSeek publicó su modelo de razonamiento R1 como destilaciones en tamaños de Qwen, lo que dice mucho sobre en qué pesos confía la industria. Si hoy estás eligiendo un modelo base de pesos abiertos, Qwen está en la lista corta casi por defecto.