阿里开源 Qwen-Image:20B 参数,把"文字渲染"做成图像模型的主场
阿里通义千问 2025 年 8 月 4 日发布 Qwen-Image,一个 20B 参数的 MMDiT 图像基础模型,在复杂文本渲染(多行排版、段落语义、细粒度细节)上取得突破,支持中英文等多种语言,于 GitHub、Hugging Face、ModelScope 开源。
大多数图像生成模型在"画得好看"上使劲,却常常在"写好字"上翻车——海报上的中文字符总是缺笔少画。阿里通义千问在 2025 年 8 月 4 日发布的 Qwen-Image,选择正面攻克这个中文场景最痛的点:一个 20B 参数的 MMDiT(多模态 Diffusion Transformer)图像基础模型,把复杂文本渲染做成了自己的主场能力。
主打"文字密集型"图像
Qwen-Image 的关键特性高度聚焦:多行排版、段落级语义、细粒度细节等复杂文本渲染能力,同时支持中英文等多种字母/表意语言。这意味着海报、Logo、广告这类"文字即主体"的强文本场景,终于有了一个开源的、中文友好的底层模型。除文本渲染外,它作为图像基础模型也支持精确编辑。
用户可以在 Qwen Chat 中选择"Image Generation"直接体验,模型同时在 GitHub、Hugging Face、ModelScope 等平台开源发布——国内开发者无需翻墙即可下载使用,这对中文社区的工程落地是实打实的便利。
一场有延续性的开源战役
Qwen-Image 不是孤立动作。15 天后(8 月 19 日),团队又发布 Qwen-Image-Edit——基于同一 20B 底座把文本渲染能力扩展到编辑任务。这套"生成 + 编辑"双引擎与 DALL·E、Stable Diffusion、Flux 等国际模型形成直接竞争,也让
Qwen 成为阿里在多模态生成方向最具代表性的开源成果。
从行业视角看,Qwen-Image 的差异化打法相当聪明:避开与海外模型在"写真/艺术风格"上的正面消耗,转而锁定"中文文字渲染"这块海外模型普遍薄弱、而国内设计、电商、广告行业高频刚需的场景。对国内图像工具开发者而言,它提供了一个可商用、可微调的中文底座——这种"开源 + 中文场景适配"的组合,正是中国开源生态最需要的东西。
后续值得跟踪的几个方向:
- Qwen-Image 的社区生态:基于它微调的垂直模型(电商、广告、UI)数量。
- 中文长文本渲染的极限:超长段落、密集小字的稳定性是否经得起生产考验。
- 与 Flux/SD3.5 的开源对比:相同参数规模下,文本渲染与画质的两难如何权衡。
- 阿里多模态后续动作:Qwen-Image 是否会演进为视频生成底座的一部分。
用户评价