48小时扒光 Kimi K3:2.8 万亿参数背后的七年技术暗线

lxiol

22580 倍不是堆参数堆出来的

Baseten 花了 48 小时把 Kimi K3 的建模代码从头拆了一遍。最震撼的对比:2019 年的 GPT-2 只有 1.24 亿参数,而 K3 有 2.8 万亿——一个模型顶 22580 个 GPT-2。但拆解真正值钱的地方在于:这两万多倍根本不是堆参数堆出来的,而是七年架构演进的累积结果。

这篇文章的价值在于把一条完整的技术暗线串了起来:从 GPT-2 的 KV Cache 开始,到线性注意力、DeltaNet、Gated DeltaNet、KDA、MLA、AttnRes,每一步都在解决上一步留下的问题。

记忆系统的七级进化

模型的「记忆」处理是这次拆解的主线:

  1. KV Cache(GPT-2 时代):缓存已读内容避免重复计算,但缓存随上下文增长,显存压力大
  2. 线性注意力(2020):把历史压缩进固定大小的记忆 S,长文本成本骤降,但新旧信息互相干扰
  3. DeltaNet:先读旧值再算差值,只写入需要修改的部分——模型学会修改记忆
  4. Gated DeltaNet:加入遗忘开关 alpha,能主动让整块旧记忆淡出——模型学会遗忘
  5. KDA(Kimi Delta Attention):把统一的遗忘开关拆成 Diag(alpha) 独立通道,不同信息拥有不同保存时间——模型学会精细化记忆管理

KDA 在 Kimi Linear(480 亿参数/30 亿激活)上验证:100 万 token 上下文下最多减少 75% KV Cache 占用,解码吞吐量最高达传统注意力的 6 倍。

93 层的双通道信息找回

K3 总参数从 480 亿扩到 2.8 万亿,却没有把所有希望押在 KDA 上。架构是三层 KDA + 一层 MLA 组成基本循环,重复 23 次,共 93 个解码器层:

  • KDA 维护固定大小的长期记忆:快、省,适合记录主要信息(像会议纪要)
  • MLA 定期回到完整上下文找回原始细节:精确检索数字、代码、原文(像查原始会议记录)

同时解决「网络太深信息被稀释」问题的是 AttnRes(注意力残差)——分块式设计,每 12 层一个信息块,93 层共 8 块,后面的层只在这些块之间做加权选择,避免逐层检索全部历史的巨额成本。

2.8 万亿参数如何控制计算量

K3 的 MoE 设计:898 个专家(2 个共享 + 896 个路由按需选择),每个 Token 只有 18 个专家真正参与。总参数代表容量,不等于单 Token 的计算量。

更关键的是潜在空间 MoE:输入先压缩到更低维度再交给专家网络,计算完投影回原维度——专家网络的 FLOPs 几乎减少一半,让模型可以容纳更多更细的专家而不等比放大计算成本。

能力跃迁的规律

这条暗线印证了一个规律:前沿能力很少由孤立的灵感直接催生。KV Cache 记得完整但缓存膨胀;线性注意力压缩记忆但互相干扰;DeltaNet 能修改但不会遗忘;Gated DeltaNet 会遗忘但一刀切;KDA 精细化遗忘却仍会丢细节;MLA 补回细节;MoE 控制成本;AttnRes 对抗深度稀释——每个组件都是对前一个问题的回应。

大模型竞争的门槛因此变得更高:单点突破依然重要,但真正决定差距的,是一个团队能否把不同阶段的研究成果连接成可规模化运行的系统。

原文拆解:https://x.com/waterloo_intern/status/2081762065392541951(Baseten 技术分析)

  • 标题: 48小时扒光 Kimi K3:2.8 万亿参数背后的七年技术暗线
  • 作者: lxiol
  • 创建于 : 2026-07-31 00:00:00
  • 更新于 : 2026-07-31 10:53:52
  • 链接: https://blog.lxiol.cn/2026/07/31/kimi-k3-48h-architecture-teardown/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。