NextStep-1横空出世:革新图像生成范式的自回归技术突破
【免费下载链接】NextStep-1-Large-Edit 项目地址: https://ai.gitcode.com/StepFun/NextStep-1-Large-Edit
在人工智能生成内容(AIGC)领域,自回归模型始终占据着基础性地位,其在视觉创作领域的应用边界不断被开发者们拓展。从早期的离散序列生成模式,到如今融合扩散模型优势的混合架构,每一次技术演进都凝聚着科研社区的集体智慧。MAR、Fluid、LatentLM等先驱性工作不仅为行业带来深刻启示,同时也揭示了当前技术路径中存在的优化空间——如何有效规避离散化处理导致的信息损耗?怎样构建更为轻量且高效的模型架构?带着这些关键问题,阶跃星辰团队开展了创新性探索,并正式发布了其阶段性研究成果:NextStep-1。
作为一项旨在开辟自回归图像生成新路径的尝试,NextStep-1的核心创新在于实现了连续视觉空间中的直接自回归生成。为达成这一目标,研发团队设计了轻量级的"流匹配头"(Flow Matching Head)组件,该模块赋予模型两项关键能力:一是在连续视觉空间中直接生成单个图像Patch,从根本上绕开传统离散化步骤造成的信息瓶颈;二是通过自回归方式逐一生成所有图像块,最终拼接为完整图像。这种架构设计带来了显著的简洁性优势——由于不再依赖外部大型扩散模型作为辅助解码器,NextStep-1实现了高度统一的端到端训练流程。阶跃星辰团队认为,这项研究验证了在保持连续性的前提下构建简洁高效自回归模型的可行性,目前已决定将该模型开源,期待能激发更多学术讨论,并与社区研究者共同推动生成技术的进步。
技术架构解析:突破传统桎梏的创新设计
NextStep-1的技术架构如图1所示,其核心由140亿参数的Transformer骨干网络与1.57亿参数的轻量级流匹配头组成,这种设计实现了连续图像Patch的直接生成。  如上图所示,该架构清晰展示了Transformer骨干网络与流匹配头的协同工作模式。这一极简设计带来了双重技术解放:既摆脱了对图像Tokenizer离散化处理的依赖,又消除了对外部扩散模型的需求,真正实现了纯粹的端到端自回归训练,为理解新一代生成模型架构提供了直观参考。
这种架构创新带来了两大革命性突破:首先是彻底解放了对离散化处理的依赖,模型可直接在连续空间中进行操作;其次是摆脱了对外部扩散模型的依赖,实现了真正意义上的端到端自回归训练流程。在模型开发过程中,研究团队获得了两项关键发现:
Transformer主导的生成机制
实验数据显示,流匹配头的尺寸变化(从1.57亿参数扩展至5.28亿参数)对最终图像质量影响甚微,这表明核心的生成建模与逻辑推理任务完全由Transformer骨干网络承担。流匹配头更像是精准的"画笔",负责将Transformer的潜在预测转化为具体的图像Patch。这一发现为未来模型优化指明了方向——应优先强化Transformer的特征学习能力。
连续空间稳定技术
在连续视觉Token操作过程中,团队发现了两项关键稳定技术:通道归一化(Channel-Wise Normalization)有效稳定了Token的统计特性,即使在高CFG指导强度下仍能生成清晰无伪影的图像;而在Tokenizer训练阶段引入更多噪声正则化,反而显著提升了最终生成质量。研究团队推测,这种"噪声注入"技术有助于构建更鲁棒、分布更均匀的潜在空间,为自回归主模型提供了更理想的工作平台。
性能验证:多维度基准测试中的卓越表现
NextStep-1在图像生成与编辑任务中展现出卓越性能,不仅支持物体增删、背景修改、动作调整、风格迁移等多种编辑操作,还能精准理解自然语言指令,实现灵活的创意编辑。  如上图所示,示例展示了模型在不同编辑任务中的效果对比。这些案例充分证明了NextStep-1在复杂视觉编辑任务中的精准控制能力,为设计师、内容创作者提供了强大的AI辅助工具,展示了自回归模型在精细视觉生成领域的巨大潜力。
在权威性能评估中,NextStep-1表现尤为突出:在GenEval、GenAI-Bench和DPG-Bench等综合基准测试中达到自回归模型的当前最佳水平(SOTA),并在多项指标上可与顶尖扩散模型直接竞争。特别在图像编辑专项评测中,该模型在GEdit-Bench和ImgEdit-Bench两个专业数据集上展现出优异的编辑精度和语义一致性。这些性能验证不仅证明了新架构的技术可行性,更为自回归模型在高保真视觉生成领域的应用开辟了新路径。
挑战与展望:持续进化的技术路线图
尽管NextStep-1取得了显著突破,但研发团队也坦诚指出了当前存在的技术挑战。在高维潜在空间扩展过程中,模型偶尔会出现生成不稳定现象,如图3所示的局部噪声、块状伪影和网格状伪影等问题。  如上图所示,失败案例直观展示了高通道配置下模型生成的缺陷。这些问题反映了自回归模型在高维空间建模时面临的独特挑战,为后续研究提供了明确的改进方向,帮助研究者理解连续空间自回归生成的技术边界。
经过分析,这些问题可能源于三个方面:生成后期的数值不稳定性导致局部噪声;模型训练尚未完全收敛引发的全局噪声;以及当前一维位置编码在捕捉二维空间关系时的局限性。针对这些挑战,团队提出了多维度的优化路线图:
推理效率优化
自回归模型的顺序解码特性导致推理速度瓶颈,理论分析显示,H100 GPU上单Token处理延迟主要来自两大方面:一是大模型骨干网络的顺序解码过程,二是流匹配头的多步采样开销。对此,团队计划从两方面突破:优化流匹配头设计,通过模型蒸馏和先进采样算法减少生成步数;借鉴大语言模型的多Token预测技术,开发适用于图像Token的并行生成方法。
高分辨率生成突破
相比技术生态成熟的扩散模型,NextStep-1在高分辨率生成方面面临两大挑战:一是顺序生成特性导致高分辨率图像需要更多训练步数才能收敛;二是扩散模型的先进技术(如timestep shift)难以直接迁移。团队计划开发基于二维空间归纳偏置的位置编码方案,并探索适用于自回归架构的分辨率扩展技术。
监督微调策略创新
小规模高质量数据集的微调实验显示,NextStep-1存在独特的过拟合风险——在百万级样本集上微调能获得稳定提升,但在小数据集上要么收效甚微,要么完全过拟合。研究团队正在开发新型正则化技术,旨在找到既能对齐目标风格又保持泛化能力的"甜蜜点"检查点,解决自回归模型在小样本学习中的稳定性问题。
【免费下载链接】NextStep-1-Large-Edit 项目地址: https://ai.gitcode.com/StepFun/NextStep-1-Large-Edit
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考



