当前主流的RL优化方法, Group Relative Policy Optimization, GRPO,正面临着固有的效率瓶颈。它们就像一个拥挤的多车道收费站,虽能处理车流,却常常因同步等待和重复工作而导致拥堵。
为了解决这些问题,来自腾讯的研究者们提出了一种名为单流策略优化(Single-stream Policy Optimization, SPO)的新方法。SPO选择回归强化学习的经典范式,摒弃了繁琐的“组”结构,为大模型的策略优化开辟了一条更高效、更稳健的“单行道高速公路”。
要理解SPO的创新,我们必须先审视其对标的方法——GRPO。GRPO的核心思想是“组内比较”:
对于一个给定的Prompt,模型会生成一个组的多个响应(例如8个或16个)。通过计算这组响应的平均奖励,得到一个动态的、即时的Baseline。将每个响应的奖励与该基线比较,得出优势,并据此更新模型策略。
这种方法虽然能一定程度上降低梯度方差,但带来了两个致命缺陷:
1.Wasted Computation from Degenerate Groups:当一个组内的所有响应获得相同奖励时(例如,对于一个简单问题全部回答正确,或对于一个难题全部回答错误),它们的“相对优势”全部变为零。这意味着整个组的计算完全浪费了,模型无法从中获得任何学习信号。
2.Synchronization Barrier:在分布式训练中,系统必须等待组内最慢的一个响应生成并评估完毕后,才能处理整个组。在需要多步工具调用或长链条推理的复杂任务中,响应的生成时间差异巨大。一个“慢车”就能拖慢整条车道的效率,严重影响了训练的吞吐量和扩展性。
SPO的设计哲学是“回归本源”。它摒弃了“组”的概念,让每个训练样本回归到一个独立的(提示,响应)对。为了克服单一样本带来的高方差问题,SPO巧妙地设计了三大核心组件:
SPO不再使用“即时”的组内基线,而是为每个提示维护一个持久化的KL自适应价值追踪器 (KL-Adaptive Value Tracker)。这个追踪器记录了模型在历史上处理该提示的长期成功概率。
它采用贝叶斯更新机制,将成功/失败的二元奖励建模为Beta分布。每当获得一个新的奖励 (成功为 1 ,失败为 0 ),追踪器就会更新其内部参数 和 :
这里的 是一个遗忘因子,它由当前策略与上次更新该提示时的策略之间的KL散度决定。如果模型策略变化很大, 就会变小,使得追踪器更快地“忘记”旧的历史记录,从而自适应地跟上模型的进化。这个设计提供了一个极其稳定且低方差的价值基线。
在计算出原始优势值 后,SPO并不会在小范围内进行标准化,而是在整个训练批次的所有样本中进行全局标准化。这避免了GRPO因小组统计量不准而引入的噪声,保证了学习信号的全局一致性和稳定性。
SPO的架构天然支持自适应课程学习。它会根据价值追踪器的不确定性来决定采样的优先级。具体来说,采样权重 与伯努利分布的标准差成正比:
从直观上看,优先采样那些模型时而答对,时而答错的提示,因为这些是模型最需要学习的知识。而对于已经完全掌握( )或完全不会( )的提示,则会降低其采样频率,从而将宝贵的计算资源用在刀刃上。
SPO vs. GRPO:全方位对比

为了更清晰地展示SPO的优势,我们可以整理出以下对比表格:

为何SPO的方差更低?
策略优化的核心是策略梯度定理。一个低方差的梯度估计对于稳定高效的训练至关重要。
其中, 即基线,其质量直接决定了梯度估计的方差。
SPO和GRPO的方差差异可以通过一个简化的量化公式来体现,该公式比较了两种方法在奖励项上的方差比:
基线噪声信息损失标准化噪声
基线噪声中,SPO的有效样本数 远大于GRPO的组大小 ,因此其基线更稳定。
信息损失这项里 Z_G§ 是GRPO产生退化组的概率。当问题很简单 或很难 时,这个概率会飙升,导致方差急剧膨胀。SPO没有此项损失。
最后一项标准化噪声,SPO在更大的批次 上进行标准化,其噪声 远小于GRPO在 上的噪声 。
SPO的成功不仅在于其卓越的性能和效率,更在于它挑战不必要的复杂性,回归基础而强大的原则。它证明了通过更精巧的设计,一个简单的单流方法可以完胜复杂的组方法。
如何学习AI大模型?
如果你对AI大模型入门感兴趣,那么你需要的话可以点击这里大模型重磅福利:入门进阶全套104G学习资源包免费分享!
这份完整版的大模型 AI 学习和面试资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

这是一份大模型从零基础到进阶的学习路线大纲全览,小伙伴们记得点个收藏!

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;
第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;
第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;
第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;
第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;
第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;
第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。
100套AI大模型商业化落地方案

大模型全套视频教程

200本大模型PDF书籍

👉学会后的收获:👈
• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;
• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;
• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;
• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。
LLM面试题合集

大模型产品经理资源合集

大模型项目实战合集

👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓


1715

被折叠的 条评论
为什么被折叠?



