阿里千问发布Qwen-Image-3.0图像生成基础模型:落字成画,字字如印
IT之家 7 月 21 日消息,阿里发布最新图像生成基础模型 Qwen-Image-3.0。新模型支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解、复杂 UI 界面,同时支持 12 国语言和 20 多款字体原生渲染,字字清晰,大幅降低多语言产品海报、影视 / 漫画分镜等“可读可用”商业素材的生产成本。
IT之家附官方详细介绍如下:
AI 图像生成模型的进步有目共睹 —— 画面越来越精致,风格越来越多元。但当需求从 " 生成一张好看的图 " 转向 " 完成一项实际工作 " 时,局限随之显现:模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文,或是去修复破损的古画。
一张图,能不能从 " 好看 " 真正走向 " 好用 "?今天,给出我们的答案。
我们正式推出 Qwen-Image-3.0 ,Qwen-Image 系列的第三代图像生成基础模型。如果说 Qwen-Image-1.0 的关键词是 " 准 " ,Qwen-Image-2.0 的关键词是 " 准多齐美真 " ,那么 Qwen-Image-3.0 的核心主线只有一个字 —— " 实 " 。
这个 " 实 " 体现在三个维度:
一言以蔽之,Qwen-Image-3.0 不只是在追求 " 好看 ",更在追求“ 好用 ”—— 让图像生成真正成为可落地的生产力工具。
现在,阿里云百炼、千问 AI 平台已开通 API 邀测,Qwen Studio 和千问 APP 也即将上线供免费体验。
内容可横展:知识九宫格
这是一张由 Qwen-Image-3.0 准确渲染的数学 PPT,包括空间关系、数学符号、定理描述等等这些丰富的视觉内容,有着合理的排版和相对位置关系。
而这只是 Qwen-Image-3.0 真实能力的“1/9”,因为这张图事实上只是 Qwen-Image-3.0 生成的一个复杂 9 宫格图片中的一个格子。让我们看原图:
上面整张图是 Qwen-Image-3.0 一次性生成的,而非多个图片拼接而成。这张图片难度在于,每个格子都是一张复杂信息图,如果要精准的描述完整的九宫格,整整需要 3.7k 个 token。
这 3.7k token 需要完整的刻画隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图、以及细胞 DNA 结构对比 —— 每一格都包含精确的中英文文字、公式、图表和漫画人物等等。
而这对于 Qwen-Image-3.0 来说依然轻松,因为 Qwen-Image-3.0 将可接受的指令长度提升至 4.5k token,这意味着模型 可以理解和渲染极其复杂、信息密集的视觉版面。
这就是 Qwen-Image-3.0" 内容丰实 " 的一个重要特点: 内容可横展(横向扩展)。 横展能力反映了模型 语义并置与空间控制 的实力 —— 能够让多种概念在同一画面中有序布局、互不干扰地渲染。
内容有纵深:界面嵌套
横展能力考验的是 " 在一张画布上摆放多少个并列元素 ",纵深能力则考验 模型的语义解构与逻辑嵌套 —— 能否在一幅图中层层递进地渲染多个嵌套的界面。
以下示例用一条指令在一幅图中从外到内依次展示了:VSCode 编程界面 → 千问聊天界面 → 社交媒体聊天界面 → 手冲咖啡海报。每一层都保持了各自 UI 的真实风格与细节,形成了 " 画中画中画 " 的视觉纵深。