LESSON 5.6 · 工程 · 140 分钟
评测:先定义“好”再优化
评测:先定义“好”再优化:理解perplexity、task eval、LLM judge、污染与方差,完成“建立最小 eval harness”。属于「让模型成为助手」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「评测:先定义“好”再优化」解决了什么问题。
- 能围绕 perplexity、task eval、LLM judge 画出变量与因果关系。
- 能完成「建立最小 eval harness」,并用证据而不是感觉判断结果。
核心概念
perplexity
perplexity必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
task eval
task eval必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
LLM judge
LLM judge必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
污染与方差
污染与方差必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
实践任务
建立最小 eval harness
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:定义约束与成功指标,只保留回答核心问题所需的最小组件。
- 验证:使用固定评测集、人工复核、置信区间与失败样本分层;保存参数、随机种子与原始结果。
- 迁移:改变用户群、风险等级或奖励信号后重新设计评测,说明原结论是否仍成立。