LESSON 8.3 · 诊断 · 120 分钟
长上下文不是一个数字
长上下文不是一个数字:理解sparse attention、retrieval、position、context rot、needle与结构化评测,完成“建立从检索到多跳推理的分层长上下文评测”。属于「前沿大模型系统」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「长上下文不是一个数字」解决了什么问题。
- 能围绕 sparse attention、retrieval、position 画出变量与因果关系。
- 能完成「建立从检索到多跳推理的分层长上下文评测」,并用证据而不是感觉判断结果。
核心概念
sparse attention
sparse attention涉及模型能否在长序列里定位、组合和使用信息。最大窗口只是容量上限;评测还要分开检索、多跳推理、位置敏感性与干扰鲁棒性。
retrieval
retrieval必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
position
position必须同时标出论文目标、计算路径、质量约束和系统负载,避免把单点 benchmark 当成普遍结论。 写出至少一个不变量、shape 约束或成立条件。
context rot
context rot涉及模型能否在长序列里定位、组合和使用信息。最大窗口只是容量上限;评测还要分开检索、多跳推理、位置敏感性与干扰鲁棒性。
needle与结构化评测
needle与结构化评测必须先固定任务分布、评分规则和置信区间。单一平均分会掩盖子群失败;LLM-as-judge 还需做顺序、长度、自偏好与人工一致性校准。
实践任务
建立从检索到多跳推理的分层长上下文评测
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:先复现并冻结现场,只保留回答核心问题所需的最小组件。
- 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
- 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。