之前提到"LLM 的强化学习",我脑子里几乎自动把它等同于 RLHF:让模型学会符合人类偏好、符合输出格式。最近在读 Agentic RL 方向的论文、并把 PPO/GRPO 从头复述一遍的过程中,这个理解被修正了。现在我会先问一个问题:这个 reward 到底编码了什么?
这篇文章记录这次认知更新的几个环节:SFT 与 RL 的分野、on-policy 的采样前提、RLHF 为什么"像 SFT"、verifiable reward 内部怎么分,以及 headroom 为什么是 GRPO 能否生效的开关。
1. SFT 拟合分布,RL 探索行为
SFT(有监督微调)的本质是拟合一个给定数据集的分布:给定输入,让模型输出的概率分布贴近标注数据。数据里有什么,模型就学什么。
RL 的动机不是拟合已有数据,而是在 reward 驱动下不断采样、试错,发现并固化更优的行为——可能是更长的推理链、自我纠错,甚至新的工具使用方式。DeepSeek-R1 报告把这一点说得很直接:不显式教模型怎么解题,只提供正确的激励,模型自主发展出高级解题策略。
一个直观类比:SFT 是让机器人学会走路和跑步(数据里有),RL 是让它在"跑得越远越好"的奖励下自己探索出三级跳(数据里没有)。
2. on-policy RL 的采样前提
“探索出新行为"有一个容易被忽略的前提:on-policy RL 只能强化被采样到的轨迹。GRPO/PPO 的梯度来自当前这批真实采样出来的 response;一条轨迹从未被采样到,这一轮梯度对它的贡献就是零。
所以"涌现"其实是两步:先在某次采样中出现(可能来自 SFT 后的小概率采样,也可能来自训练中策略变化后的新采样),再被正向 advantage 放大。没有第一步,就没有第二步。这也解释了为什么"reward 能被采样到”(reachable by sampling)如此关键。
一个边界:未采样到的行为这一轮不能直接加分,但训练其他行为会通过共享参数间接改变它的概率;等它真的被采样出来,才进入"直接加分"通道。
3. RLHF 为什么"像 SFT"
RLHF 形式上确实是 RL:采样 response、算 reward、更新策略。但它的 reward model 本身是从人类偏好数据里拟合出来的,再加上 KL 约束把策略钉在参考模型附近——所以它优化的其实是一个"偏好分布"的平滑版本,行为效果上非常接近 SFT:强化已有规范、风格和安全,而不是探索新解法。
RLHF 不可替代的价值在于:它让无法言说的标准进入训练。我们不需要定义绝对的"好",只需要给出"哪个更好"的相对判断或打分。这正是 non-verifiable 任务的典型形态。
4. verifiable reward 内部也分两种
verifiable 与 non-verifiable 的划分依据是:reward 能不能被自动、客观地检查。但 verifiable 内部差别很大:
- 格式奖励(输出是否合法 JSON、是否带指定标签):可验证,但信息量低;SFT 通常已经覆盖,greedy 已经合规——低 headroom,只能 reshape。
- 结果奖励(数学答案、代码测试用例):可验证且信息量高;如果任务有 headroom,才是真正的探索型 RL。
- 中间地带还有 process reward(逐步验证推理过程),例如数学中的 PRM。
5. headroom:GRPO 能否生效的开关
headroom 的定义很朴素:sampled 成功率 > greedy 成功率。意思是当前策略的随机采样已经能找到比贪心输出更好的轨迹,只是概率还不够高;GRPO 的工作就是把这些轨迹的概率调高,把"偶尔成功"变成"稳定成功"。
一篇受控实验论文(arXiv:2607.12640)把这个结论验证得很干净:在 agent 已基本掌握的任务上(无 headroom),18 组控制实验都没有可信提升;而在采样本身就能拿到奖励的任务上(有 headroom),同一套 harness 成功率提升了 22 个点。
这引出一个重要区分:add skill vs reshape behavior。跑 RL 的期望收益从来不只是让模型更稳定地做已擅长的事(那是 reshape),而是希望 reward 驱动的搜索发现并固化初始策略分布之外的新行为。这篇论文的阴性结果表明:至少在这个设定下,没有 headroom 时 GRPO 做不到这一点。
6. R1 的 aha moment(一次事实核查)
我一直把 DeepSeek-R1 的 aha moment 记成"用 LLM 当 judge",核对原文后发现是两件事被记混了:
- aha moment 发生在 R1-Zero:直接对基座模型做 RL,用的是 rule-based reward(正确答案验证 + 格式奖励)。报告明确说不用神经 reward model,因为大规模 RL 中容易 reward hacking。训练中模型自发出现 “Wait, wait. Wait. That’s an aha moment I can flag here” 这类重新评估步骤的行为。
- LLM-as-judge(把 ground-truth 和模型输出喂给 DeepSeek-V3 判断)出现在 R1 流水线的 rejection sampling / SFT 数据扩充阶段,用来筛选无法用规则验证的数据,与 aha moment 无关。
aha moment 恰好是"探索型 RL 涌现"的注脚:反思行为先被采样到,再被正确性奖励放大,最后成为稳定能力。
总结
| 训练方式 | 优化对象 | 行为效果 |
|---|---|---|
| SFT | 给定数据的分布 | 模仿 |
| RLHF | 从偏好数据拟合的 reward model | 近似拟合规范(reshape) |
| 格式奖励 RL | 输出表面约束 | 低 headroom,接近 SFT |
| 结果奖励 RL | 环境结果 | 有 headroom 时才是探索 |
这次更新对我最大的影响:看任何 RL 方案,先问两个问题——reward 编码了什么?有没有 headroom? 前者决定它是拟合还是探索,后者决定探索能不能发生。
参考资料
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, arXiv:2501.12948.
- Zhihong Shao et al., DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, arXiv:2402.03300(GRPO 出处).
- Chengguang Gan et al., A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent, arXiv:2607.12640.
- 站内系列:从策略梯度到 PPO:目标函数、GAE 与裁剪机制.