一、概述
Meta Superintelligence Labs 发布新一代多模态生成模型系列 Muse Image 与 Muse Video,核心范式从传统的「prompt 直接映射到像素」转向 Agentic Generation(智能体式生成)——模型在生成过程中主动调用编码、搜索等工具,并通过自我反思迭代优化输出质量。
该系列模型共享同一预训练基座,在 LMSYS Arena 人类偏好榜单中,Muse Image 位列文本生成图、单图编辑、多图编辑三项第 2 名;Muse Video(早期预览版)位列文本生成视频第 3 名。
二、Muse Image 核心架构:智能体式图像生成
与传统扩散模型或自回归图像模型不同,Muse Image 将生成过程建模为一个多步推理的智能体任务:模型不仅输出像素,还会在思维链中决定何时调用工具、何时自我修正、何时终止。
2.1 工具使用(Tool Use)
Muse Image 通过强化学习自然习得两类工具调用能力:
-
编码工具(Coding):针对精确几何图形、数据图表、QR 码等传统生成模型难以准确还原的结构化内容,模型自主编写并执行代码生成矢量/栅格结果,再融入整体画面。该能力与 Muse Spark 联动后可扩展至 GIF 生成、交互式网页乃至小型游戏。

-
搜索工具(Search):面对知识密集型 prompt(如特定品牌 Logo、实时事件、专业数据),模型主动检索网络获取事实信息,显著降低幻觉率,提升生成内容的事实准确性。
-


2.2 自我精炼(Self-Refinement)
自我精炼是 Muse Image 最显著的行为特征:模型在生成初步结果后,会自行检查输出质量并执行修正,形式包括局部重绘、整体再生、切换工具策略等。
该能力并非人工预设的工作流,而是 RL 训练中的涌现行为——因为反复打磨后的样本获得了更高的奖励信号,模型自发学会了**“先草稿、后修改”**的生成策略。

2.3 测试时计算扩展(Test-Time Compute Scaling)
这是 Muse Image 最核心的算法洞察:推理阶段投入的计算量与生成质量呈近似对数线性正相关。
核心规律:增加推理 token 总数(文本推理 token + 视觉生成 token),生成质量持续提升;推理计算量成为继模型参数、训练数据之后的第三维度扩展杠杆。
关键实验结论:
- Best-of-N 饱和快:简单增加采样次数取最优的策略,质量提升很快到达瓶颈;
- 深度推理扩展更优:让模型「多思考、多步骤」的推理扩展,质量增益显著高于 Best-of-N;
- 工具调用复合增益:推理扩展与工具使用结合时产生复利效应——思考越深,工具调用越精准,生成质量提升幅度非线性增长。

2.4 精确编辑与多参考图合成
- 图像编辑:支持精确指令级编辑,仅修改用户指定区域,且多轮编辑间保持画面一致性,支持迭代式头脑风暴。
- 多参考图合成:可在 prompt 中交错插入多张参考图,提取人物、物体、服饰、风格、环境等元素并融合到同一生成结果中,支持复杂的图文混合指令。

2.5 多模态交互式生成的奖励模型测评
Meta 开源了 Multimodal RewardBench 2,这是一个多模态奖励模型测评集。该测评集适配四大核心任务(每个任务 1000 条偏好对样本),统一采用多模态偏好对(Preference Pair)范式。
T2I 文生图任务(task_type: t2i)
任务特征:无输入图,纯文本生成图片。对比维度包括语义对齐、美学构图、细节完整性及无畸形失真。
核心结构特点:input_images 为空数组,仅对比输出图像质量。
{
"task_type": "t2i",
"prompt": "一张治愈系秋日森林插画,暖色调,光影柔和,写实风格",
"input_images": [],
"chosen": {
"text_content": "",
"image_content": ["高质量秋日森林插画,光影自然、色调统一、构图完整,无画面瑕疵"],
"overall_score": 9.2
},
"rejected": {
"text_content": "",
"image_content": ["秋日森林画面存在光影错乱、色调杂糅,树木结构畸形,构图失衡"],
"overall_score": 4.1
},
"criteria": "优先匹配prompt风格与语义,画面无畸形、无失真,光影构图自然舒适",
"source": "human_expert_annotated"
}
图像编辑任务(task_type: image_edit)
任务特征:提供原始输入图,根据文本指令进行局部编辑。对比维度包括编辑精准度、原始细节保留、指令跟随度及无额外瑕疵。
{
"task_type": "image_edit",
"prompt": "将图片中的白色花朵替换为红色玫瑰,保留背景和绿植不变",
"input_images": ["原始绿植白花实景图"],
"chosen": {
"text_content": "",
"image_content": ["精准替换花朵为红玫瑰,背景、绿植细节完全保留,画面融合自然无违和"],
"overall_score": 8.9
},
"rejected": {
"text_content": "",
"image_content": ["花朵替换畸形,背景绿植被篡改,色彩过渡生硬,存在画面模糊瑕疵"],
"overall_score": 3.8
},
"criteria": "严格执行编辑指令,仅修改指定区域,保留原始画面无关细节,画面自然无篡改",
"source": "human_expert_annotated"
}
图文交错生成任务(task_type: interleaved_ti)【核心创新任务】
任务特征:MMRB2 独有任务,输出为文本与图片交替混合序列。对比维度包括图文逻辑连贯、配图语义匹配、叙事完整及图文节奏合理。
核心结构特点:text_content 与 image_content 双向有效,这是区别于初代基准的核心差异。
{
"task_type": "interleaved_ti",
"prompt": "生成一段春日踏青短篇图文游记,图文交替排版",
"input_images": [],
"chosen": {
"text_content": "清晨的春日郊野微风和煦,草木萌发、繁花盛放。春风拂过林间,满目生机盎然。",
"image_content": ["春日林间踏青实景图,绿草繁花、光影清新,贴合游记文案意境"],
"overall_score": 9.0
},
"rejected": {
"text_content": "春日踏青风景优美,天气晴朗适合出游。",
"image_content": ["冬日雪景图片,与春日游记主题完全不符,图文割裂严重"],
"overall_score": 3.2
},
"criteria": "文本叙事流畅完整,配图与文本语义高度匹配,图文交替逻辑连贯、主题统一",
"source": "human_expert_annotated"
}
多模态推理任务(task_type: multimodal_reason)
任务特征:输入图片及推理提问,模型输出文本推理答案。对比维度包括逻辑正确性、推理严谨度、答案精准度及图文信息匹配度。
{
"task_type": "multimodal_reason",
"prompt": "根据图片中的物品摆放,判断桌面上一共有多少个水果?",
"input_images": ["桌面摆放苹果、香蕉、橙子实景图"],
"chosen": {
"text_content": "图片中可见3个苹果、2根香蕉、1个橙子,总计6个水果,统计准确无误",
"image_content": [],
"overall_score": 9.3
},
"rejected": {
"text_content": "桌面上一共有4个水果,统计遗漏橙子,数量计算错误",
"image_content": [],
"overall_score": 2.9
},
"criteria": "严格依据图片视觉信息推理,答案准确、逻辑严谨、无主观臆断",
"source": "human_expert_annotated"
}
三、Muse Video:早期预览
Muse Video 基于与 Muse Image 相同的预训练基座扩展而来,当前为早期预览版本。
| 维度 | 状态 |
|---|---|
| Prompt 遵循度 | 具备竞争力 |
| 视觉保真度 | 具备竞争力 |
| 时间一致性 | 具备竞争力 |
| 原生音频 | 已支持 |
| 音视频同步 | 优化中 |
| 高速物理运动 | 优化中 |
Muse Video 即将面向创作者开放,并集成至 Meta AI 产品体系。
四、Content Seal:不可见水印系统
为解决 AI 生成内容溯源问题,Muse Image 内置 Content Seal 不可见水印系统:
- 所有通过 Meta AI app 及 meta.ai 生成的图像均携带隐藏溯源信号;
- 水印在裁剪、压缩、缩放、截图后仍保持完整,鲁棒性显著强于传统可见水印;
- 配套检测工具已开放预览,可用于判断图像是否由 Meta AI 生成;
- 视频版 Content Seal 正在开发中。
五、基准表现
截至 2026 年 7 月 5 日 LMSYS Arena 人类偏好 Elo 排名:
| 赛道 | Muse 排名 |
|---|---|
| 文本生成图(Text-to-Image) | 第 2 名 |
| 单图编辑(Single-Image Editing) | 第 2 名 |
| 多图编辑(Multi-Image Editing) | 第 2 名 |
| 文本生成视频(Text-to-Video) | 第 3 名 |
六、技术意义总结
Muse 系列代表了多模态生成的一个重要范式转向:
- 从单步映射到多步智能体:生成不再是 prompt→image 的端到端黑箱,而是包含规划、工具调用、自我修正的推理过程;
- 测试时计算成为新扩展维度:推理算力可像模型参数一样规模化投入,为按需调节生成质量提供了灵活杠杆;
- RL 驱动的能力涌现:工具使用与自我精炼均非硬编码逻辑,而是奖励信号引导下的自发行为,验证了 RL 在多模态后训练中的关键作用;
- 统一基座的多模态扩展:图像与视频共享同一预训练基座,降低了多模态能力扩展的边际成本。
参考
- Introducing Muse Image and Muse Video (https://ai.meta.com/blog/introducing-muse-image-muse-video-msl/)
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
- https://huggingface.co/datasets/rl-research/multimodal-rewardbench-2
- https://github.com/facebookresearch/MMRB2/tree/main

406

被折叠的 条评论
为什么被折叠?



