LESSON 8.6 · 工程 · 150 分钟

面向 Agent 的后训练

面向 Agent 的后训练:理解tool-use trajectory、task synthesis、verifiable environment、process与outcome reward,完成“为工具型 Agent 设计可回放的训练与评测数据管线”。属于「前沿大模型系统」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「面向 Agent 的后训练」解决了什么问题。
  2. 能围绕 tool-use trajectory、task synthesis、verifiable environment 画出变量与因果关系。
  3. 能完成「为工具型 Agent 设计可回放的训练与评测数据管线」,并用证据而不是感觉判断结果。

核心概念

tool-use trajectory

tool-use trajectory必须同时标出论文目标、计算路径、质量约束和系统负载,避免把单点 benchmark 当成普遍结论。 先给它一个可操作的定义,并指出它解决的具体问题。

task synthesis

task synthesis必须同时标出论文目标、计算路径、质量约束和系统负载,避免把单点 benchmark 当成普遍结论。 把它放进前后依赖中:输入从哪里来,输出会改变谁。

verifiable environment

verifiable environment必须同时标出论文目标、计算路径、质量约束和系统负载,避免把单点 benchmark 当成普遍结论。 写出至少一个不变量、shape 约束或成立条件。

process与outcome reward

process与outcome reward在答案可自动验证的任务上强化成功行为,并允许推理时投入更多计算。奖励能验证最终结果,不代表每一步推理都真实可靠;长度和格式也可能被策略利用。

实践任务

为工具型 Agent 设计可回放的训练与评测数据管线

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:定义约束与成功指标,只保留回答核心问题所需的最小组件。
  • 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
  • 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。

进入完整互动课程