阿里云近日正式推出图像生成领域的新一代基础模型Qwen-Image-3.0,该模型在多语言支持、复杂信息处理及编辑能力方面实现突破性进展。通过支持最大4.5k token的超长文本输入,用户可一次性输入包含公式符号、几何图形、逻辑推导步骤的详细指令,模型能精准生成知识图解、复杂UI界面等商业素材,显著降低影视分镜、多语言海报等场景的生产成本。
作为千问系列第三代模型,Qwen-Image-3.0在文本承载能力上较前代提升4.5倍,可完整解析用户撰写的需求文档,无需压缩关键信息。例如在影视短剧分镜设计中,用户能详细描述画面结构、文字排版及视觉风格,模型即可生成符合要求的图文内容。其独特的语义并置技术更支持单图生成9宫格知识图解,涵盖9个不同领域且文字清晰可辨。
该模型展现出强大的逻辑理解能力,可处理多层UI嵌套指令。当用户要求"在VSCode界面通过千问App生成聊天窗口中的咖啡海报"时,模型能依次呈现编程界面、应用界面、聊天窗口及海报内容,连截图中的时间数字和10像素小字都精准还原。这种能力源于模型对复杂指令和画面逻辑关系的深度解析。
创新性的"生图编辑一体化"架构使Qwen-Image-3.0突破传统生成与编辑的界限。在古画修复、全景图生成等复杂任务中,模型能保持原图语义一致性,实现局部改写、内容扩展和风格迁移。用户无需切换工具即可完成从草图转PPT、多镜头生成等操作,真正实现"所想即所得"的创作流程。
目前,阿里云百炼平台和千问AI已开放Qwen-Image-3.0的API邀测通道,Qwen Studio及千问移动端应用即将上线供用户免费体验。这项技术进步正在重塑商业图像创作领域的工作范式,为设计师和内容创作者提供更高效的工具支持。









