
2025年8月5日,通义千问团队正式开源其首个图像生成基础模型Qwen-Image。这款采用MMDiT架构、具备200亿参数的模型,以突破性的复杂文本渲染能力重新定义了AI生图的技术边界。作为通义千问系列向多模态领域的重要拓展,Qwen-Image不仅开源了模型权重与技术报告,其能力已同步集成至QwenChat平台,为开发者与普通用户提供了即时体验的可能。
技术突破:重新定义AI文本渲染的精度标准
在AI图像生成领域,文字渲染始终是技术难点。传统模型往往面临文字模糊、布局错乱、语义不符等问题,尤其在处理多语言混合、复杂排版场景时表现拉垮。Qwen-Image通过架构创新与训练策略优化,将这一领域的技术水平推向新高度。
从技术架构看,Qwen-Image采用专为多模态任务设计的MMDiT架构,通过强化文本-图像特征对齐机制,实现了文字与视觉元素的深度融合。在书店畅销书架这类复杂场景测试中,模型不仅能精准生成"New Arrivals This Week"等英文标识,还能同步呈现中文书籍名称,文字随书籍摆放角度产生的透视变形自然流畅,甚至连书架标签的字体大小、颜色对比度都符合真实场景的视觉逻辑。
针对中文文本渲染这一薄弱环节,Qwen-Image展现出显著优势。在"李白窗前写床前明月光"的情境插画中,诗句并非简单叠加于画面,而是呈现出毛笔书写的质感,与古典场景的宣纸、墨砚形成和谐统一的视觉语言。这种对文字形态、文化语境的双重理解,使其在ChineseWord等基准测试中大幅领先现有模型。
训练策略上,团队采用"课程学习"的渐进式方案:先通过非文字图像训练夯实基础视觉生成能力,再逐步引入单字、短语、句子乃至段落级文本任务。这种由简至繁的训练逻辑,使模型能够理解文字的语义内涵而非单纯生成图形符号。在面包店宣传图测试中,模型能将"动物奶油"字样精准对应到奶


4310

被折叠的 条评论
为什么被折叠?



