LESSON 8.1 · 研读 · 150 分钟

MoE、MLA 与多 Token 预测

MoE、MLA 与多 Token 预测:理解Mixture-of-Experts、routing、load balance、MLA、multi-token prediction,完成“拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标”。属于「前沿大模型系统」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「MoE、MLA 与多 Token 预测」解决了什么问题。
  2. 能围绕 Mixture-of-Experts、routing、load balance 画出变量与因果关系。
  3. 能完成「拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标」,并用证据而不是感觉判断结果。

核心概念

Mixture-of-Experts

Mixture-of-Experts决定模型反复看到什么。近重复会放大样本权重,评测污染会伪造能力;数据混合比例本质上也是一种训练目标,需要版本化和可追溯。

routing

routing通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。

load balance

load balance通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。

MLA

MLA通过稀疏激活、缓存压缩或额外预测目标改变训练与推理成本。比较时必须分别报告总参数、激活参数、通信、KV 占用和真实吞吐。

multi-token prediction

multi-token prediction位于字符串与模型之间。BPE 反复合并高频相邻单元来换取更短序列,但词表、字节边界和特殊 token 会直接影响多语言、公平性与数字处理。

实践任务

拆解 DeepSeek-V3 的激活参数、KV 压缩与训练目标

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:先看入口与数据流,只保留回答核心问题所需的最小组件。
  • 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
  • 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。

进入完整互动课程