阿里巴巴 Qwen 团队于周二正式推出 Qwen Image 3.0,此次发布的重点并非图像的美观度,而是强调输出结果能否在实际工作中真正派上用场。目前大多数 AI 图像工具——如 Reve、Nano Banana、Seedream——分别专注于创意、写实、编辑能力等特定领域,而 Qwen Image 3.0 则走向了不同的方向。
“Qwen-Image-3.0 不仅追求‘好看’,更追求‘有用’,让图像生成成为真正可部署的生产力工具。”Qwen 团队在官方公告中写道。
其核心亮点是阿里巴巴所称的“丰富内容”。该模型最多可接受 4500 个 token(上一代模型的 4.5 倍),相当于几页详细的指令。这意味着用户可以在单个提示中描述九个独立的信息图面板,并立即获得一张完整的图像。
“上图完全由 Qwen-Image-3.0 一次性生成,而非多张图片拼接而成。”阿里巴巴在博客中写道。演示中的每个面板都包含各自的图表、公式、标题和精细小字文本——全部一次性渲染,无需后期拼装。这是目前唯一能实现此效果且无重大错误的模型。
第二部分是“真实细节”。据阿里巴巴介绍,该模型“支持精确渲染小至 10 像素的文本,并生动再现毛孔、发丝等细节,达到栩栩如生的微观级描绘”。10 像素属于细印刷体——类似于药品说明书上的免责声明。模型还能准确处理 LaTeX(研究人员用于编写复杂数学公式的符号系统),并完整生成学术论文的模拟排版。
在我们常规测试中,通常会给出几个句子,观察模型如何呈现。Qwen Image 3.0 能够生成下图(源自阿里巴巴官方博客)。
我们使用模型最快的配置尝试了该功能。Qwen Image 3.0 成功复现了 Decrypt 的一篇完整文章。执行效果令人印象深刻,但结果并非完美无瑕。
第三大支柱是“深度知识”。据 Qwen 团队介绍,该模型“支持原生渲染 12 种语言,模拟网页、游戏、直播等主流界面,并调用丰富的世界知识”。它还能连接互联网获取实时数据,例如针对特定城市和日期的天气预报提示,会返回准确的图形,而非猜测。
例如,阿里巴巴分享了一张昆虫在叶片上的照片。模型能够根据对图像的理解生成相关文字。
阿里巴巴将目标用户锁定为设计工作室、内容团队、电商运营和教育工作者,他们需要批量生产可直接使用的视觉素材。不过值得注意的是,在阿里巴巴自家的 Qwen-Image-Bench 评估中(该基准测试对 18 个模型的图像质量、美学和真实世界保真度进行评分),此前旗舰版 Qwen Image 2.0 Pro 仅排名第五,OpenAI 的 GPT Image 2 位居榜首。新模型可能表现更好,但发布时并未提供基准测试表、可下载权重或技术报告,因此无法通过可测量的方式确认。
Qwen Image 1.0 发布时曾以 Apache 2.0 许可证开放权重,并同日发布了技术报告,而此次并未开放。作为阿里巴巴近期 AI 推动的一部分,现有证据完全来自公司选择发布的手选示例图片。API 试用已开放(chat.qwen.ai),定价尚未公布。
