阿里巴巴的 Qwen 团队于7月21日发布了 Qwen-Image-3.0,这是其图像生成模型的第三代。它主打实用胜于美观,是一款旨在生成足够实用、可直接用作广告、设计和影视工作素材的图像的模型,而不只是看上去好看的图片。
其核心能力是文本与结构。Qwen-Image-3.0 接受最长 4500 token 的提示词,是其前代所允许长度的四倍多,阿里巴巴表示它能在单次生成中渲染公式、几何图示、逻辑推导以及多层用户界面布局。它原生支持 12种语言和 20 多种字体,直指图像生成中最棘手的问题,即在图片中生成长篇、正确、可读的文本。
这一侧重反映了图像模型竞赛的走向。前沿不再是照片级真实感,而是模型能否排布出一整张信息图、一个 UI 原型或一张带有准确小字的海报,这些正是让生成图像在商业工作中可用、而非仅仅停留在演示层面的要素。
这次发布更耐人寻味的部分是随之缺失的东西。没有基准测试表,没有参数量,没有许可证,没有描述模型如何构建或测试的技术报告,也没有可下载的权重。这与 Qwen-Image 1.0 形成鲜明背离,后者在2025年8月推出时带有宽松的 Apache 2.0 许可证下的开放权重和一份当日技术报告,也与同样附带自身报告的 2.0 形成背离。API 试用是开放的,但目前该模型是闭源的,仅以产品的形态提供文档说明。
对阿里巴巴而言,这种模式正变得熟悉。几天前,该公司将其 Qwen3.8 Max 语言模型作为一个可购买的预览版推出,没有模型卡、基准测试或许可证,如今其旗舰图像模型也以同样的方式登场。Qwen 以身为所有主要实验室中最高产的开放权重发布者而建立声誉,因此来自同一团队的一连串闭源、API 优先的发布,是一个值得关注的信号,它揭示了即便是最开放的实验室,在其模型变得更具商业价值时会把界线划在哪里。
