LESSON 5.6 · 工程 · 140 分钟

评测:先定义“好”再优化

评测:先定义“好”再优化:理解perplexity、task eval、LLM judge、污染与方差,完成“建立最小 eval harness”。属于「让模型成为助手」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「评测:先定义“好”再优化」解决了什么问题。
  2. 能围绕 perplexity、task eval、LLM judge 画出变量与因果关系。
  3. 能完成「建立最小 eval harness」,并用证据而不是感觉判断结果。

核心概念

perplexity

perplexity必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。

task eval

task eval必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。

LLM judge

LLM judge必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。

污染与方差

污染与方差必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。

实践任务

建立最小 eval harness

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:定义约束与成功指标,只保留回答核心问题所需的最小组件。
  • 验证:使用固定评测集、人工复核、置信区间与失败样本分层;保存参数、随机种子与原始结果。
  • 迁移:改变用户群、风险等级或奖励信号后重新设计评测,说明原结论是否仍成立。

进入完整互动课程