告别GRPO瓶颈!腾讯SPO算法让大模型训练效率飙升!

当前主流的RL优化方法, Group Relative Policy Optimization, GRPO,正面临着固有的效率瓶颈。它们就像一个拥挤的多车道收费站,虽能处理车流,却常常因同步等待和重复工作而导致拥堵。

为了解决这些问题,来自腾讯的研究者们提出了一种名为单流策略优化(Single-stream Policy Optimization, SPO)的新方法。SPO选择回归强化学习的经典范式,摒弃了繁琐的“组”结构,为大模型的策略优化开辟了一条更高效、更稳健的“单行道高速公路”。

要理解SPO的创新,我们必须先审视其对标的方法——GRPO。GRPO的核心思想是“组内比较”:

对于一个给定的Prompt,模型会生成一个组的多个响应(例如8个或16个)。通过计算这组响应的平均奖励,得到一个动态的、即时的Baseline。将每个响应的奖励与该基线比较,得出优势,并据此更新模型策略。

这种方法虽然能一定程度上降低梯度方差,但带来了两个致命缺陷

1.Wasted Computation from Degenerate Groups:当一个组内的所有响应获得相同奖励时(例如,对于一个简单问题全部回答正确,或对于一个难题全部回答错误),它们的“相对优势”全部变为零。这意味着整个组的计算完全浪费了,模型无法从中获得任何学习信号。

2.Synchronization Barrier:在分布式训练中,系统必须等待组内最慢的一个响应生成并评估完毕后,才能处理整个组。在需要多步工具调用或长链条推理的复杂任务中,响应的生成时间差异巨大。一个“慢车”就能拖慢整条车道的效率,严重影响了训练的吞吐量和扩展性。

SPO的设计哲学是“回归本源”。它摒弃了“组”的概念,让每个训练样本回归到一个独立的(提示,响应)对。为了克服单一样本带来的高方差问题,SPO巧妙地设计了三大核心组件:

SPO不再使用“即时”的组内基线,而是为每个提示维护一个持久化的KL自适应价值追踪器 (KL-Adaptive Value Tracker)。这个追踪器记录了模型在历史上处理该提示的长期成功概率。

它采用贝叶斯更新机制,将成功/失败的二元奖励建模为Beta分布。每当获得一个新的奖励 (成功为 1 ,失败为 0 ),追踪器就会更新其内部参数 和 :

这里的 是一个遗忘因子,它由当前策略与上次更新该提示时的策略之间的KL散度决定。如果模型策略变化很大, 就会变小,使得追踪器更快地“忘记”旧的历史记录,从而自适应地跟上模型的进化。这个设计提供了一个极其稳定且低方差的价值基线。

在计算出原始优势值 后,SPO并不会在小范围内进行标准化,而是在整个训练批次的所有样本中进行全局标准化。这避免了GRPO因小组统计量不准而引入的噪声,保证了学习信号的全局一致性和稳定性。

SPO的架构天然支持自适应课程学习。它会根据价值追踪器的不确定性来决定采样的优先级。具体来说,采样权重 与伯努利分布的标准差成正比:

从直观上看,优先采样那些模型时而答对,时而答错的提示,因为这些是模型最需要学习的知识。而对于已经完全掌握( )或完全不会( )的提示,则会降低其采样频率,从而将宝贵的计算资源用在刀刃上。

SPO vs. GRPO:全方位对比

为了更清晰地展示SPO的优势,我们可以整理出以下对比表格:

为何SPO的方差更低?

策略优化的核心是策略梯度定理。一个低方差的梯度估计对于稳定高效的训练至关重要。

其中, 即基线,其质量直接决定了梯度估计的方差。

SPO和GRPO的方差差异可以通过一个简化的量化公式来体现,该公式比较了两种方法在奖励项上的方差比:

基线噪声信息损失标准化噪声

基线噪声中,SPO的有效样本数 远大于GRPO的组大小 ,因此其基线更稳定。

信息损失这项里 Z_G§ 是GRPO产生退化组的概率。当问题很简单 或很难 时,这个概率会飙升,导致方差急剧膨胀。SPO没有此项损失。

最后一项标准化噪声,SPO在更大的批次 上进行标准化,其噪声 远小于GRPO在 上的噪声 。

SPO的成功不仅在于其卓越的性能和效率,更在于它挑战不必要的复杂性,回归基础而强大的原则。它证明了通过更精巧的设计,一个简单的单流方法可以完胜复杂的组方法。

如何学习AI大模型?

如果你对AI大模型入门感兴趣,那么你需要的话可以点击这里大模型重磅福利:入门进阶全套104G学习资源包免费分享!

这份完整版的大模型 AI 学习和面试资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

在这里插入图片描述

这是一份大模型从零基础到进阶的学习路线大纲全览,小伙伴们记得点个收藏!

请添加图片描述
第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;

第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;

第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;

第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;

第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;

第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;

第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

100套AI大模型商业化落地方案

请添加图片描述

大模型全套视频教程

请添加图片描述

200本大模型PDF书籍

请添加图片描述

👉学会后的收获:👈

• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;

• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;

• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;

• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

LLM面试题合集

请添加图片描述

大模型产品经理资源合集

请添加图片描述

大模型项目实战合集

请添加图片描述

👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

在这里插入图片描述

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值