LESSON 8.1 · 研读 · 150 分钟
MoE、MLA 与多 Token 预测
MoE、MLA 与多 Token 预测:理解Mixture-of-Experts、routing、load balance、MLA、multi-token prediction,完成“拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标”。属于「前沿大模型系统」学习阶段。
学完你应该能够
- 能不用术语堆砌,解释「MoE、MLA 与多 Token 预测」解决了什么问题。
- 能围绕 Mixture-of-Experts、routing、load balance 画出变量与因果关系。
- 能完成「拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标」,并用证据而不是感觉判断结果。
核心概念
Mixture-of-Experts
Mixture-of-Experts决定模型反复看到什么。近重复会放大样本权重,评测污染会伪造能力;数据混合比例本质上也是一种训练目标,需要版本化和可追溯。
routing
routing通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。
load balance
load balance通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。
MLA
MLA通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。
multi-token prediction
multi-token prediction位于字符串与模型之间。BPE 反复合并高频相邻单元来换取更短序列,但词表、字节边界和特殊 token 会直接影响多语言、公平性与数字处理。
实践任务
拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标
- 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
- 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
- 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
- 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。