LESSON 8.2 · 理论 · 150 分钟

推理模型与可验证奖励强化学习

推理模型与可验证奖励强化学习:理解RLVR、GRPO、outcome reward、reasoning trace、test-time compute,完成“复现小模型在可验证任务上的推理 RL 实验”。属于「前沿大模型系统」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「推理模型与可验证奖励强化学习」解决了什么问题。
  2. 能围绕 RLVR、GRPO、outcome reward 画出变量与因果关系。
  3. 能完成「复现小模型在可验证任务上的推理 RL 实验」,并用证据而不是感觉判断结果。

核心概念

RLVR

RLVR在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。

GRPO

GRPO用采样轨迹估计行为对奖励的贡献。优势函数降低方差,KL 控制策略漂移;训练稳定性取决于奖励、采样和更新比例的共同设计。

outcome reward

outcome reward在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。

reasoning trace

reasoning trace在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。

test-time compute

test-time compute在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。

实践任务

复现小模型在可验证任务上的推理 RL 实验

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
  • 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
  • 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。

进入完整互动课程