阿里千问发布 Qwen-Image-3.0,文本输入长度提升4.5倍

点击查看原文>

7 月 21 日,阿里发布图像生成基础模型 Qwen-Image-3.0。新模型支持最高 4.5K Token 文本输入,可根据较长提示词生成包含公式、几何图形、逻辑推导步骤等内容的知识图解和复杂 UI 界面,并支持 12 种语言及 20 多种字体的原生渲染。

Qwen-Image-3.0 是千问图像生成与编辑模型系列的第三代基础模型。阿里表示,新版本重点提升了复杂指令理解、文字渲染、空间布局以及多层信息组织能力,可用于人像摄影、数学试卷、网页界面、产品海报、影视分镜和古籍图像等场景。

与前代模型相比,Qwen-Image-3.0 可处理的文本输入长度提升至原来的 4.5 倍。在影视分镜、复杂信息图和产品说明页等场景中,用户可以通过较长提示词描述画面结构、文字内容、视觉风格和排版要求,而不必将需求压缩为简短指令。阿里称,这一能力有助于减少多轮生成和后续人工调整。

在复杂信息组织方面,Qwen-Image-3.0 可在同一张图片中组合不同类型的视觉元素。例如,模型可以根据一条指令生成由多个领域内容组成的九宫格知识图解,也可以在同一画面中嵌套网页、软件界面、聊天窗口和海报等内容。

比如,用户要求模型生成一张包含 VS Code 编程界面、千问 App、聊天窗口和手冲咖啡海报的多层嵌套图片。生成结果按照指令呈现了不同界面层级,并保留了截图时间、界面文字等较小尺寸文本。不过,相关效果目前主要来自企业展示,实际稳定性和不同场景下的生成质量仍需进一步测试。

Qwen-Image-3.0 采用图像生成与编辑一体化架构,将文字渲染、图像细节和知识理解能力同时用于生成和编辑任务。据介绍,该模型可处理古画修复、全景图扩展、手绘草图转演示文稿、多镜头视角生成等任务,也支持局部修改、内容扩展和风格转换。

一体化架构意味着用户可以在同一模型中连续完成初次生成和后续修改,不必在多个工具之间切换。其实际价值主要在于减少二次编辑过程中可能出现的文字变化、风格不一致和结构偏移。

目前,阿里云百炼和千问 AI 平台已经开放 Qwen-Image-3.0 API 邀测。Qwen Studio 和千问 App 也计划上线相关体验功能。


本文来源:InfoQ