阿里巴巴的 Qwen 團隊於 7 月 21 日發布 Qwen-Image-3.0,這是其影像生成模型的第三代。它主打實用性優先於美感,是一款旨在產生足夠實用影像的模型,這些影像實用到可直接當作廣告、設計與電影中的工作素材,而不只是看起來好看的圖片。

最主打的能力是文字與結構。Qwen-Image-3.0 可接受最長 4500 token 的提示詞,是前一版允許長度的四倍多,阿里巴巴表示它能在單次生成中呈現公式、幾何圖表、邏輯推導以及多層使用者介面版面。它原生支援 12種語言與逾 20種字型,直接瞄準影像生成中最困難的問題,也就是在圖片內產生冗長、正確且易讀的文字。

這樣的聚焦,正好對應影像模型競賽移動的方向。前沿已不再是照片級擬真,而是模型能否排出一張完整的資訊圖表、一份 UI 原型稿或一張含有精準小字的海報,這些正是讓生成影像能用於商業工作、而不只是展示樣品的關鍵。

這次發布更耐人尋味的部分,是它沒有隨附什麼。沒有基準測試表格、沒有參數量、沒有授權條款、沒有描述模型如何打造或測試的技術報告,也沒有可下載的權重。這與 Qwen-Image 1.0 形成鮮明落差,後者在 2025 年八月以寬鬆的 Apache 2.0 授權附上開放權重、並搭配同日技術報告推出,2.0 版同樣也附上自己的報告。API 試用已開放,但目前這款模型是封閉的,僅以產品的形式提供說明文件。

這種模式對阿里巴巴而言愈來愈熟悉。數天前,該公司將其 Qwen3.8 Max 語言模型以可付費購買的預覽形式推出,同樣沒有模型卡、基準測試或授權條款,如今其旗艦影像模型也以相同方式登場。Qwen 是靠著成為所有大型實驗室中最多產的開放權重發布者而建立聲譽,因此同一團隊接連推出封閉、API 優先的版本,是一個值得關注的訊號,關乎即使是最開放的實驗室,在其模型愈來愈具商業價值時,會把界線劃在哪裡。