
论文:DeepSeekMath: Pushing the Limits of Mathematical
Reasoning in Open Language Models
1. 简述
GRPO(Group Relative Policy Optimization)是论文提出的一种优化大型语言模型(LLM)数学推理能力的强化学习(RL)方法。它是PPO(Proximal Policy Optimization,近端策略优化)的变体,专门设计用于减少计算资源消耗,同时提高数学推理能力。
2. 传统PPO的局限性
在传统的PPO算法中,模型需要训练策略模型(policy model)和价值模型(value model),其中:
- 策略模型(policy model)用于生成答案。
- 价值模型(value model)用于估算某个策略的优劣,提供“baseline”用于计算优势函数(advantage function),进而指导策略优化。
在LLM训练中,PPO面临几个问题:
- 高计算成本:价值模型通常与策略模型规模相当,占用大量内存和计算资源。

订阅专栏 解锁全文

2526

被折叠的 条评论
为什么被折叠?



