LESSON 8.5 · 理论 · 130 分钟

扩散与块并行语言模型

扩散与块并行语言模型:理解masked diffusion、parallel decoding、block diffusion、quality-speed trade-off,完成“比较自回归、并行草稿与扩散草稿的时延模型”。属于「前沿大模型系统」学习阶段。

学完你应该能够

  1. 能不用术语堆砌,解释「扩散与块并行语言模型」解决了什么问题。
  2. 能围绕 masked diffusion、parallel decoding、block diffusion 画出变量与因果关系。
  3. 能完成「比较自回归、并行草稿与扩散草稿的时延模型」,并用证据而不是感觉判断结果。

核心概念

masked diffusion

masked diffusion是因果约束而非普通正则化。训练时整段序列并行计算,但第 t 个位置只能读取不晚于 t 的 token,否则模型会偷看答案并得到虚假低 loss。

parallel decoding

parallel decoding尝试并行修复或生成多个 token,减少纯自回归的串行步数。端到端收益取决于迭代次数、草稿接受率、目标模型验证成本和质量约束。

block diffusion

block diffusion尝试并行修复或生成多个 token,减少纯自回归的串行步数。端到端收益取决于迭代次数、草稿接受率、目标模型验证成本和质量约束。

quality-speed trade-off

quality-speed trade-off必须同时标出论文目标、计算路径、质量约束和系统负载,避免把单点 benchmark 当成普遍结论。 用反例说明忽略它时系统会怎样失败。

实践任务

比较自回归、并行草稿与扩散草稿的时延模型

  • 预测:在运行代码前,写下你预期的输出、趋势或失败位置。
  • 构建:从具体反例建立动机,只保留回答核心问题所需的最小组件。
  • 验证:使用最小实现、论文公式对照、匹配质量的基准与失败样本分层;保存参数、随机种子与原始结果。
  • 迁移:更换模型规模、任务域、上下文长度或并发后重新判断收益,说明原结论是否仍成立。

进入完整互动课程