阿里千问发布Qwen-Image-3.0图像生成基础模型

发布时间:2026-07-21 16:49

  阿里发布最新图像生成基础模型 Qwen-Image-3.0。新模型支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解、复杂 UI 界面,同时支持 12 国语言和 20 多款字体原生渲染,字字清晰,大幅降低多语言产品海报、影视 / 漫画分镜等“可读可用”商业素材的生产成本。

  AI 图像生成模型的进步有目共睹 —— 画面越来越精致,风格越来越多元。但当需求从 生成一张好看的图 转向 完成一项实际工作 时,局限随之显现:模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文,或是去修复破损的古画。

  ”—— 让图像生成真正成为可落地的生产力工具。现在,阿里云百炼、千问 AI 平台已开通 API 邀测,Qwen Studio 和千问 也即将上线供免费体验。

  这是一张由 Qwen-Image-3.0 准确渲染的数学 PPT,包括空间关系、数学符号、定理描述等等这些丰富的

  而这只是 Qwen-Image-3.0 线”,因为这张图事实上只是 Qwen-Image-3.0 生成的一个复杂 9 宫格中的一个格子。让我们看原

  上面整张图是 Qwen-Image-3.0 一次性生成的,而非多个拼接而成。这张难度在于,每个格子都是一张复杂信息图,如果要精准的描述完整的九宫格,整整需要 3.7k 个 token。

  这 3.7k token 需要完整的刻画隧道安全漫画、空间几何教学、

  横展能力反映了模型语义并置与空间控制的实力 —— 能够让多种概念在同一画面中有序布局、互不干扰地渲染。

  —— 能否在一幅图中层层递进地渲染多个嵌套的界面。以下示例用一条指令在一幅图中从外到内依次展示了:VSCode 编程界面 → 千问聊天界面 → 社交媒体聊天界面 → 手冲咖啡海报。每一层都保持了各自 UI 的真实风格与细节,形成了 画中画中画 的

  如果说 内容丰实 解决的是 画多少 的问题,那么 细节真实 解决的是 画多细 的问题。Qwen-Image-3.0 在微观细节上的渲染精度达到了新的高度:10px 小字清晰可辨,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。

  这是一张关于鲸鲨的知识图解,包含大量的文字和插图,而 Qwen-Image-3.0 能够准确渲染每个区域。

  学术论文是小字渲染的极限测试场,模型完整渲染了一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现,小字号下依然保持了极高的可读性。

  模型在书页上叠加了逼真的红色手写批注 —— 下划线、波浪线、圈画、箭头和简短评语,字迹自然流畅,完美模拟了高中生课堂笔记的风格。

  给定一幅破损或不完整的传统绘画,模型能够修复缺失的部分,同时保持原有的艺术风格和笔触。模型以与原画一致的笔法完成了鹰搏图的修复,保持了水墨渐变、羽毛质感和构图平衡,同时去除了霉斑和破损痕迹。

  内容丰实 回答了 能画多复杂 , 细节真实 回答了 能画多逼真 ,而 知识厚实 回答的是 能画多广 。Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100+ 艺术风格和多种 UI 界面的渲染能力,其背后是模型对世界知识的深度理解。

  模型结合强大的世界知识,基于真实图像生成一个复杂的信息图。模型在保留原始昆虫照片主体的同时,添加了分类学信息、形态标注、放大细节视图和比例尺等专业元素,生成了一张可以直接用于学术发表的研究配图。

  Qwen-Image-3.0 以 内容丰实、细节真实、知识厚实 三大特色为支撑,在多语言产品海报、复杂 UI 界面等高价值生产力场景中取得了显著突破。我们相信,随着图像生成模型能力的持续提升,它将在设计、内容创作、教育、电商等更多领域中释放出真正的生产力价值。

排行

精选