LESSON 8.2 · 理论 · 150 分钟
推理模型与可验证奖励强化学习
推理模型与可验证奖励强化学习:理解RLVR、GRPO、outcome reward、reasoning trace、test-time compute,完成“复现小模型在可验证任务上的推理 RL 实验”。属于「前沿大模型系统」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「推理模型与可验证奖励强化学习」解决了什么问题。
- 能围绕 RLVR、GRPO、outcome reward 画出变量与因果关系。
- 能完成「复现小模型在可验证任务上的推理 RL 实验」,并用证据而不是感觉判断结果。
核心概念
RLVR
RLVR在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。
GRPO
GRPO用采样轨迹估计行为对奖励的贡献。优势函数降低方差,KL 控制策略漂移;训练稳定性取决于奖励、采样和更新比例的共同设计。
outcome reward
outcome reward在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。
reasoning trace
reasoning trace在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。
test-time compute
test-time compute在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。
实践任务
复现小模型在可验证任务上的推理 RL 实验
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
- 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
- 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。