从 RLHF 到 Agentic RL:重新理解 RL 的探索本质
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
COLLECTION
从强化学习基础、PPO 到 Agent 能力研究的持续学习系列。
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
从策略梯度、优势函数和 GAE 出发,推导 PPO 的概率比与 clipped objective,并说明它为何仍是 on-policy 算法。