LESSON 8.7 · 研读 · 180 分钟

Kimi K3:3T 级开放权重系统审计

Kimi K3:3T 级开放权重系统审计:理解KDA、AttnRes、Stable LatentMoE、MXFP4 QAT、million-token agentic RL、Kimi K3 License,完成“建立架构—训练—推理—评测—许可证五层审计矩阵”。属于「前沿大模型系统」学习阶段。

学完你应该能够

  1. 画出序列、深度、宽度三条信息流,解释 KDA、AttnRes 与 Stable LatentMoE 分别改变了什么。
  2. 区分 2.8T 总参数与 104B 激活参数,并把存储、通信、KV 状态和运行时开销分别核算。
  3. 按推理强度、Agent harness、工具权限、公开/私有题集、成本和失败样本审计评测声明。
  4. 区分开放权重与无条件开源,识别 Kimi K3 License 何时需要单独商用审查。

核心概念

KDA

大部分层用线性递归式的 Kimi Delta Attention,并周期性插入 Gated MLA 恢复全局内容寻址。审计时要核对 3:1 结构和最后的全局注意力层,不能只写“线性注意力”。

AttnRes

Attention Residuals 让当前 block 有选择地读取更早 block 和 embedding。要画清深度方向的可访问路径,并核算额外状态与通信。

Stable LatentMoE

模型有 896 个路由专家、每 token 选择 16 个,在紧凑 latent expert space 中工作;RMSNorm、SiTU-GLU 和 Quantile Balancing 都是稳定训练的一部分。

MXFP4 QAT

量化感知训练从后训练阶段开始,目标是 MXFP4 专家权重与 MXFP8 激活。不能由此推断整个 checkpoint 或服务栈都是每参数 4 bit。

Million-token agentic RL

后训练组合 SFT、长时程 Agent RL、保留 thinking history 与多档推理强度。百万 token 是容量上限,真正的长期任务能力仍需轨迹、压缩和恢复测试。

实践任务

建立架构—训练—推理—评测—许可证五层审计矩阵

  • 预测:先写下 2.8T 总参数、104B 激活参数、896/16 专家路由与百万上下文分别能说明什么、不能说明什么。
  • 构建:为每条声明补齐来源、证据等级、测量边界、依赖条件和可证伪实验。
  • 验证:交叉核对技术报告、官方仓库与许可证原文;把官方声明和独立证据分栏记录。
  • 迁移:把同一矩阵用于另一个开放权重模型,标出无法直接横向比较的字段。

进入完整互动课程