RL/强化学习
文章平均质量分 79
强化学习(RL/Reinforcement Learning)
u013250861
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
RLinf 具身模型 SFT 训练机制完整分析报告
我会先把 RLinf 的官方论文、代码仓库和训练脚本对齐起来,重点追踪 SFT(Supervised Fine-Tuning,监督微调) 的数据流:数据格式 → tokenizer/processor → model input → label mask → loss 计算 → batch/并行训练。然后我会给你一份“从样本到梯度”的完整报告,尽量把具身模型部分讲到能直接对照代码。目前已经确认:RLinf 现在把具身 SFT 单独做成了一条 的训练链路,而不是把它塞进 RL actor update 里;原创 2026-08-18 21:45:47 · 73 阅读 · 0 评论 -
蒙特卡洛算法
蒙特卡罗方法(Monte Carlo method),也称 统计模拟方法。蒙特卡洛方法的理论基础是大数定律。大数定律是描述相当多次数重复试验的结果的定律,在大数定理的保证下:所以只要设计一个随机试验,使一个事件的概率与某未知数有关,然后通过重复试验,以频率近似值表示概率,即可求得该未知数的近似值。此种方法可以求解微分方程,求多重积分,求特征值等。参考资料:经典算法:蒙特卡洛方法(MCMC)蒙特卡洛方法(入门详解)...原创 2022-06-28 23:55:30 · 408 阅读 · 0 评论 -
蒙特卡洛(MCMC)算法(马尔科夫-蒙特卡洛):通过“统计方法”来模拟推定“未知特性量”的计算方法【MCMC采样-->M-H采样-->Gibbs采样】
20世纪40年代,在冯·诺伊曼,斯塔尼斯拉夫·乌拉姆和尼古拉斯·梅特罗波利斯在洛斯阿拉莫斯国家实验室为核武器计划工作时,发明了蒙特卡罗方法。因为乌拉姆的叔叔经常在摩纳哥的蒙特卡洛赌场输钱得名,而蒙特卡罗方法正是以概率为基础的方法。是指使用随机数(或更常见的伪随机数)来解决很多计算问题的方法。1940年代中期由于科学技术的发展和电子计算机的发明。而提出的一种以概率统计理论为指导的数值计算方法。蒙特卡罗方法也称 统计模拟 方法。.........原创 2022-08-05 10:19:21 · 481 阅读 · 0 评论 -
蒙特卡洛方法、TD 方法、TD Error、GAE 与 Advantage 的关系
在 PPO、A2C、Actor-Critic 这类算法中,核心问题之一是:这个判断通常依赖 Advantage,也就是优势函数。优势函数定义为:A(st,at)=Q(st,at)−V(st)A(s_t,a_t)=Q(s_t,a_t)-V(s_t)A(st,at)=Q(st,at)−V(st)其中:如果:A(st,at)>0A(s_t,a_t)>0A(st,at)>0说明当前动作比平均水平好,策略应该提高该动作概率。如果:A(st,at)<0A(s_t,a_t)<0A(st,at原创 2026-05-07 00:40:16 · 282 阅读 · 0 评论 -
强化学习中的价值/优势估计方法:①TD方法(用一步奖励+下一状态价值估计状态价值)、②GAE(用多个TD error加权求和估计Advantage)、③蒙特卡洛方法(用完整真实回报估计状态价值)
在强化学习中,蒙特卡洛方法指的是:等一条轨迹真实采样完成后,用这条轨迹中真实获得的累计奖励来估计价值。从时刻tttGtrtγrt1γ2rt2⋯Gtrtγrt1γ2rt2⋯Gt∑l0∞γlrtlGtl0∑∞γlrtlrtr_trt是当前时刻的奖励;γ\gammaγ是折扣因子;GtG_tGt是从时刻ttt开始真实采样到的折扣累计回报。TD 是。原创 2026-05-07 00:26:43 · 283 阅读 · 0 评论 -
RL-算法-20250815:CHORD中的CHORD-φ【把SFT(离策略、基于专家示范)与RL(在策略、基于回报)真正融合,把 SFT 视作在 RL 过程中的辅助项,不是独立阶段】
相对“原始 SFT=平均交叉熵”,原创 2025-11-11 01:15:30 · 1182 阅读 · 0 评论 -
GRPO_Zero库分析:组内归一化、策略比率、KL散度约束
算法损失函数形式优势/回报估计方差缩减机制−minrtAcliprtAw1DKL−minrtAcliprtAw1DKL组内归一化Clip + KL + 组内归一化本项目 GRPO−logπθa⋅A−logπθa⋅A组内归一化组内归一化REINFORCE−logπθa⋅G−logπθa⋅G完整轨迹回报无(或简单baseline)关键区别。原创 2025-10-09 14:54:18 · 566 阅读 · 0 评论 -
强化学习微调LLM/VLM中的灾难性遗忘问题:深度技术分析
在使用强化学习(特别是RLHF - Reinforcement Learning from Human Feedback)对大语言模型(LLM)和视觉语言模型(VLM)进行微调时,灾难性遗忘(Catastrophic Forgetting)确实是一个普遍存在且需要重点关注的问题。灾难性遗忘是指模型在学习新任务或适应新分布时,显著丧失其在原有任务上的性能表现。知识退化:模型在通用基准测试上的表现下降能力丧失:原本具备的推理、编程、多语言等能力减弱分布偏移:模型过度拟合特定奖励函数,泛化能力下降。原创 2025-10-08 22:17:20 · 1301 阅读 · 0 评论 -
强化学习微调LLM/VLM中的灾难性遗忘问题:分析01
针对性 RL 数据确实会增加 VLM 遗忘风险,但通过。原创 2025-10-08 22:15:20 · 695 阅读 · 0 评论 -
GRPO强化学习训练详细流程分析
是一种用于大语言模型强化学习的算法,本项目实现了一个简化但高效的GRPO训练框架。分离式架构:训练模型、参考模型和生成模型分别运行在不同的GPU上高效内存管理:通过DeepSpeed Zero-2优化,支持在单张80G GPU上训练7B模型快速收敛:在30步内即可观察到"Aha moment"现象本项目实现的GRPO算法具有以下特点:✅简洁高效:仅200行核心代码,易于理解和修改✅内存友好:分离式架构支持在单卡80G上训练7B模型✅快速收敛。原创 2025-10-08 17:27:05 · 984 阅读 · 0 评论 -
LLM-PPO算法:Reward value v.s. Critic value
【代码】LLM-PPO算法:Reward value即时奖励值 vs Critic value累积奖励值。原创 2025-10-07 23:53:43 · 958 阅读 · 0 评论 -
PPO算法:Reward Model与Critic Model深度解析:理论、实现与数学原理
在RLHF(Reinforcement Learning from Human Feedback)的PPO训练中,Reward Model和Critic Model虽然架构相似,但它们解决的是完全不同的问题:Reward Model回答的是一个评价问题(Evaluation Problem):Critic Model回答的是一个预测问题(Prediction Problem):部分回答: AI是问题: 什么是AI?Critic ModelV_t1: 0.3V_t2: 0.5V_t3: 0.7V_t4: 0.原创 2025-10-07 23:40:32 · 1682 阅读 · 0 评论 -
EasyR1 强化学习训练详细分析
关键配置参数类别参数值说明模型model_pathQwen2.5-VL-7B-Instruct基础视觉-语言模型数据train_filesjourneybench-multi-image-vqa@train多图像VQA训练集val_filesjourneybench-multi-image-vqa@test多图像VQA测试集rollout_batch_size256Rollout批次大小limit_images2每个样本最多2张原创 2025-10-07 17:32:04 · 1423 阅读 · 0 评论 -
路径规划相关算法:图搜索(A*、Dijkstra、广度优先、深度优先等)、最短路径(Dijkstra、Bellman-Ford、Floyd-Warshall 等)、启发式(A*、蚁群优化)、动态规划
图搜索算法:如 A*、Dijkstra、广度优先、深度优先等,关注图的遍历和路径搜索。最短路径算法:如 Dijkstra、Bellman-Ford、Floyd-Warshall 等,特别关注最短路径问题。启发式算法:如 A*、贪婪最佳优先、蚁群优化等,利用启发式信息指导搜索。动态规划算法:如 Bellman-Ford、Floyd-Warshall,解决最短路径问题时采用动态规划。贪心算法:如 贪婪最佳优先搜索,常用于选择局部最优解以期得到全局最优解。递归算法。原创 2025-10-07 16:31:27 · 1085 阅读 · 0 评论 -
RL(强化学习)-训练开源库01:VeRL
(Volcano Engine Reinforcement Learning)是字节跳动 Seed 团队开源的强化学习训练框架,专为大规模语言模型(LLM)的后训练设计,特别适用于强化学习与人类反馈(RLHF)任务。该框架采用了混合控制器(HybridFlow)编程模型,旨在提供灵活、高效且适用于生产环境的训练能力。原创 2025-10-07 16:24:40 · 1057 阅读 · 0 评论 -
RL(强化学习)-训练开源库02:Stable-baselines3
Stable-Baselines3(SB3)是一个基于 PyTorch 的强化学习(RL)算法库,旨在为研究人员和开发者提供易用、可靠且高效的工具。原创 2025-10-07 16:19:14 · 587 阅读 · 0 评论 -
PPO-Replay 算法
然而,当行为策略和目标策略差异过大时,重要性采样的权重(即概率比)会变得非常大或非常接近于零,导致梯度估计的方差极大,训练过程会变得极不稳定 [52]。其中,“Actor”网络负责根据当前状态输出一个动作的概率分布(策略),而“Critic”网络则负责评估当前状态的价值(V值),用以指导Actor的学习 [8][12][16]。可以预见,随着这些研究的深入,未来可能会出现一种或多种成熟的、兼具PPO的鲁棒性和离线算法高效率的“下一代”策略优化算法,而“PPO-Replay”正是通往这一目标的重要探索路径。原创 2025-10-04 20:48:51 · 946 阅读 · 0 评论 -
强化学习(RL):过拟合(Overfitting)、泛化性(Generalization)问题
过拟合是指代理对训练数据(或环境)记忆过多,导致在新环境中表现较差。泛化性是指代理能够从有限的训练数据中学到普适的策略,从而在新环境中表现出色。在强化学习中,平衡过拟合和泛化性是至关重要的。通过优化训练过程、增强探索、多任务训练等手段,可以有效提升模型的泛化能力,避免过拟合,并确保代理能在更广泛的环境中表现优异。原创 2025-10-03 15:50:41 · 1034 阅读 · 0 评论 -
强化学习框架:VeRL(字节)、TRL(huggingface)、slime(智谱)
插件安装成功后会出现下图2中左下角1处 图标,然后点击2处 add cluster,在3处 添加服务器集群地址和端口号,ray默认地址 127.0.0.1:8265 (可Enter直接添加此地址)每一个worker独立控制自身,通过其他方式实现并行,例如数据并行,每个worker之间通过通信的方式汇总并行数据。首先,由于VeRL采用Ray进行分布式运行,因此传统的基于vscode的调用方法无法生效,需要安装插件。在Verl example中提供了许多有用的小例子,包括从数据处理到一些训练的例子。原创 2025-10-03 12:34:11 · 992 阅读 · 0 评论 -
OpenRLHF:基于 Ray、vLLM、ZeRO-3 和 HuggingFace Transformers 构建的开源高性能 RLHF 框架
OpenRLHF 是第一个基于 Ray、vLLM、ZeRO-3 和 HuggingFace Transformers 构建的开源高性能 RLHF 框架,旨在让 RLHF 训练变得简单易用:https://github.com/OpenRLHF/OpenRLHF/blob/main/README_zh.md原创 2025-08-27 15:01:09 · 505 阅读 · 0 评论 -
PPO、GRPO、GSPO 完整对比解析
核心发现:GSPO的创新在于将重要性比率从token级提升到序列级,这是一个重大的理论突破。策略优化是强化学习的核心,目标是让AI学会在不同情况下做出最好的决策。想象你在教一个机器人下棋:1.3 核心思想对比PPO:使用token级重要性比率和裁剪机制,需要价值网络估计优势函数GRPO:使用token级重要性比率但采用群组归一化优势,去除价值网络依赖GSPO:使用序列级重要性比率和序列级裁剪,解决token级方法的根本问题P(A∣B)=P(A∩B)P(B)P(A|B) = \frac{P(A \ca原创 2025-08-14 22:40:47 · 2190 阅读 · 1 评论 -
PPO-RLHF训练核心机制深度解析【基于deepspeedai/DeepSpeedExamples/tree/master/applications/DeepSpeed-Chat】
这种设计体现了分工合作模型职责输入输出训练数据质量评判员完整序列整体分数人类偏好数据策略顾问任意前缀价值估计PPO训练轨迹核心原理告诉我们"什么是好的"(价值观)告诉我们"如何达到好的结果"(策略)这种分离设计使得RLHF既能学习人类偏好,又能进行高效的强化学习优化,是现代RLHF系统的核心架构特点。在强化学习理论中,即时奖励rtr_trt在状态sts_tst执行动作ata_tat后立即获得的反馈与当前动作直接相关的奖励信号语义不匹配。原创 2025-07-15 21:41:59 · 642 阅读 · 0 评论 -
PPO (Proximal Policy Optimization) 实现流程详解【DeepSpeed-Chat项目】
当前项目实现了基于DeepSpeed的PPO算法,用于RLHF(Reinforcement Learning from Human Feedback)训练。: 策略网络,负责生成文本: 价值网络,估计状态价值: 参考策略,用于计算KL散度惩罚: 奖励模型,评估生成文本的质量PPO裁剪目标函数LCLIPθEtminrtθAtcliprtθ1−ϵ1ϵAtLCLIPθEtminrtθAtcliprtθ。原创 2025-07-14 20:34:34 · 534 阅读 · 0 评论 -
Policy Gradient Algorithms【A3C、A2C、DPG、DDPG、D4PG、MADDPG、TRPO、PPO、PPG、ACER、ACTKR、SAC、SAC with Automa】
每个智能体的随机策略仅涉及其自身的状态和动作: πθi:Oi×Ai↦[0,1] ,即在给定自身观测的情况下对动作的概率分布,或者是确定性策略: μθi:Oi↦Ai。例如,一个常见的基线是从动作值中减去状态值,如果应用此方法,我们将在梯度上升更新中使用优势 A(s,a)=Q(s,a)−V(s)。注意,由于策略是确定性的,我们只需要 Qμ(s,μθ(s)) 而不是 ∑aπ(a|s)Qπ(s,a) 作为给定状态 s 的估计奖励。首先,给定当前的 αT ,获得最大化 L(πT∗,αT) 的最佳策略 πT∗。原创 2025-05-18 18:46:53 · 1133 阅读 · 0 评论 -
图解大模型RLHF系列之:人人都能看懂的PPO原理与源码解读
智能体(Agent)与环境(Environment)强化学习中两个实体的交互:状态空间S:S即为State,指环境中所有可能状态的集合动作空间A:A即为Action,指智能体所有可能动作的集合R即为Reward,指智能体在环境的某一状态下所获得的奖励。在 t 时刻,环境的状态为 St ,达到这一状态所获得的奖励为 Rt智能体观测到 St 与 Rt ,采取相应动作 At智能体采取 At 后,环境状态变为 St+1 ,得到相应的奖励 Rt+1。原创 2025-03-10 23:05:31 · 1200 阅读 · 0 评论 -
RLHF几大常用框架实践对比(trl、deepspeedchat、colossalaichat)
其实SFT其实也展现出了很不错的性能,但是从实践上看,例如moss要做到和人类比较好的对齐,光微调的数据就达到100w的级别,这个级别的高质量数据收集起来代价还是比较高的,而后面RL的步骤,从实践结果来看,它能够用少量的数据让模型在对齐上的效果和泛化性达到一个新的高度。这篇文章里,提到了很多PPO的优化方法,里面我只试了一部分,目前来看,对优势值的正则化是有效的,能够让actor的loss变得稳定,如果是分布式的场景,记得要同步后再做正则,这块Trlx有相关的实现。我实践经验上看,多次迭代效果是更好的。原创 2025-03-10 23:04:06 · 1093 阅读 · 0 评论 -
深入解析TRL模型:Hugging Face的强化学习Transformer语言模型
TRL(Transformer Reinforcement Learning)是由Hugging Face推出的一款创新性语言模型,它巧妙地融合了深度学习与强化学习的技术优势,旨在通过动态的学习机制来增强模型的语言理解和生成能力。本文将深入探讨TRL模型的工作原理,并通过具体的代码示例展示其在实际应用中的强大功能。在当今的人工智能领域,Transformer架构与强化学习技术分别代表了自然语言处理与决策制定过程中的两大重要突破。原创 2025-02-11 21:33:52 · 849 阅读 · 0 评论 -
从零实现LLM-RLHF(LLM-RLHF-Tuning)【支持指令微调Alpaca模型;支持训练Reward模型;支持PPO算法训练RL模型】
sft模型:阶段1训练的有监督微调模型,作为策略模型的基线模型,在整个训练过程中参数固定不变,用于限制策略模型πθRL更新幅度,防止策略模型训练偏差过大rm模型:阶段2训练的奖励模型,在PPO训练过程中给生成的序列进行打分,在整个训练过程中参数固定不变。actor模型:策略模型,π(at|st,θ)根据状态 st 生成动作 at ,训练目标是最大化序列价值。critic模型:价值模型, Vϕ(st) 根据状态 st 进行打分,训练目标是打分更精准接近rm模型给的打分,估计折扣奖励更精准。原创 2025-02-11 18:34:06 · 232 阅读 · 0 评论 -
一文搞懂SFT、RLHF、DPO、IFT【LLM 微调的进化之路】
可是,随着训练的进行,LLMs 会逐渐偏离它自己最开始的偏好,损失函数又会错误地估计 LLMs 当前的能力(和上文中的 PT 和 SFT 类似),进而导致不理想的训练结果。,使模型依照自己上一步的预测结果再多预测一步,近似地构建了 LLMs 对于指令的完整回复,更准确地估计了 LLMs 的偏好,从而获得更好的训练结果。DPO 融合了打分模型和策略模型的训练过程,因此只需要标注过偏好的数据、参考模型和策略模型,就可以使 LLMs 直接对齐人类的偏好,极大地减轻了训练时对计算资源的消耗。原创 2025-02-11 12:34:44 · 430 阅读 · 0 评论 -
强化学习:第三方库【TRL - Transformer Reinforcement Learning】
【代码】强化学习:第三方库【TRL - Transformer Reinforcement Learning】原创 2024-12-23 21:14:42 · 1310 阅读 · 0 评论 -
[NLP] LLM---<训练中文LLama2(五)>对SFT后的LLama2进行DPO训练
这种方法稳定、高效、计算量小。1.定义policy模型(策略模型)和reference模型(参考模型),Policy模型是需要训练的对话生成模型,reference模型是给定的预训练模型或人工构建的模型。:偏好学习,RLHF或本文所提的DPO,可以让模型的输出更符合人类偏好,通俗说就是同样一句话,得调教的让模型输出人类喜欢的表达方式,好比高情商的人说话让人。已有一个SFT model,为了让它更好,对它的output进行偏好标注,然后使用DPO进行训练,这是最正常的使用场景,但是偏好数据集确实避免不了的。原创 2024-01-04 00:31:42 · 1667 阅读 · 0 评论 -
论文阅读-MOSS-RLHF:PPO
大语言模型(LLM)为人工通用智能的发展制定了蓝图。它的主要目标是作为一个以人为本(乐于助人、诚实无害)的助手。与人类保持一致具有至关重要的意义,人类反馈强化学习(RLHF)成为支撑这一追求的关键技术范式。目前的技术路线通常包括衡量人类偏好的奖励模型、优化策略模型输出的近端策略优化(PPO)以及提高逐步推理能力的过程监督。然而,由于奖励设计、环境交互和智能体训练的挑战,再加上大语言模型的巨大试错成本,人工智能研究人员在激励LLM的技术对齐和安全着陆发展方面存在重大障碍。RLHF的稳定训练仍然是一个谜。原创 2024-01-04 00:30:16 · 1720 阅读 · 0 评论 -
如何选择深度强化学习算法?MuZero/SAC/PPO/TD3/DDPG/DQN/等(2021-04)
高清图片见搜索图中的网址的加粗部分ElegantRL、LilianWeng、EwanLi 策略梯度 就能找到这里的「模型」指:状态转移模型。离散状态空间下的状态转移模型可以用 状态转移矩阵去描述。原创 2024-01-03 01:10:29 · 7498 阅读 · 0 评论 -
InstructGPT高效实践——【DeepSpeed-Chat】源码详解(2/3):Supervised Finetuning、Reward Model Finetuning
本篇为上中下三篇章的【中篇】,接续自【上篇主要针对三阶段训练中第一阶段、第二阶段较为重要的部分源码进行详解。尽管官方的上手文档均是以sh文件为例进行演示,且源码中确实也提供了便捷的sh文件供直接使用,但我仍建议通过各阶段的main.py文件()来运行训练,大致原因有二:其一是因为官方预设的sh文件调用了,其中对模型选型等参数进行了严格的限制,虽然提高了代码安全性,但对于以学习为目的的探索来说失去了一定的灵活性(见下方代码块),直接通过main.py进行传参即可实现绕过限制、使用更轻量的模型进行训练。原创 2023-12-31 21:52:19 · 1003 阅读 · 0 评论 -
InstructGPT高效实践——【DeepSpeed-Chat】源码详解(3/3):RLHF Finetuning
本篇为上中下三篇章的【下篇】,接续自【中篇主要针对整个DeepSpeed-Chat框架中最为复杂的第三阶段进行详解,其中涉及到部分InstructGPT所述相关原理的实践,基于其代码将更易于理解诸多原理中一笔带过的话题,如“用于经验采集的策略网络到底是SFT还是Actor”“Critic的迭代又是如何实现的”等等。尽管这是讨论DeepSpeed-Chat技术为主的文章,但还是不得不借用ColossalChat(另一个实现了RLHFPipeline的开源项目,项目地址。原创 2023-12-31 21:46:07 · 1080 阅读 · 0 评论 -
从零实现带RLHF的类ChatGPT:逐行解析微软DeepSpeed Chat的源码
如此文所述,微软开源的DeepSpeed Chat(简称DSC)实现的不错,其类似ChatGPT的三阶段训练方式,会给你一个完整而通透的“PPO算法/RLHF”的代码实现全流程(好的资料可以让你事半功)抠完它的关键代码后,你会发现和之前本博客内另一篇写的原理部分都一一对应起来了(ChatGPT技术原理解析,只有懂原理才能更好的理解实现或实际实现,特别是该文的第三部分),而把论文、原理/算法、公式、代码一一对应,可以让你的理解有个质变中文版英文版DSC的特点在于。原创 2023-12-31 21:37:31 · 1407 阅读 · 0 评论 -
DeepSpeed-Chat:Reward Model【奖励模型】
定义reward模型:选择OPT-350M模型作为backbone,并定义一个linear层用于分类。- OPT模型中,需要定义--,OPT默认首个字符为PAD token;- 对于每个chosen或,取第一个padding token的前一个token的得分作为当前chosen或rejected input的得分1,else:"""假设默认设置的batch_size为N,那么len(input_ids)=2*N。原创 2023-12-30 18:55:41 · 1764 阅读 · 0 评论 -
排序主要的三种损失函数(pointwise、pairwise、listwise)
本篇文章主要介绍三种损失函数,pointwise、pairwise、listwise。原创 2023-08-04 14:20:54 · 2318 阅读 · 0 评论 -
强化学习TRL包源码解读S2——PPO
强化学习TRL包源码介绍——PPO的训练流程和实现细节。原创 2023-12-26 01:42:16 · 881 阅读 · 0 评论 -
Proximal Policy Optimization (PPO)
基于参数化策略的思想,我们的目标就是找到那些可能获得更多奖励的动作,使它们对应的概率更大,从而策略就更有可能选择这些动作。为此,我们定义的最大化目标函数JθJ(\theta)JθmaxθJθmaxθEτ∼πθRτmaxθ∑τPτ;θRτ其中τ\tauτ是agent与环境交互产生的状态-动作轨迹τs1a。原创 2023-12-21 00:11:02 · 1894 阅读 · 0 评论
分享