从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”
原帖《22580: From GPT2 to Kimi3, Explained》可以用一句话概括:
从 GPT-2 到 Kimi K3,大模型真正的进步不只是参数变多,而是学会了更高效地保存、修改、遗忘和重新检索信息。
一、“22580”究竟是什么意思?
原帖采用约 1.24 亿参数的 GPT-2 作为基准,而 Kimi K3 总参数量为 2.8 万亿:
2.8 万亿 ÷ 1.24 亿 ≈ 22580所以,一个 Kimi K3 的总参数量大约相当于 22580 个小型 GPT-2。
但这不代表 Kimi K3 的智力、速度或者效果是 GPT-2 的 22580 倍。Kimi K3 是 MoE 混合专家模型,虽然拥有 2.8 万亿总参数,但每个 token 实际激活的参数约为 1040 亿。其官方规格为:93 层、69 层 KDA、24 层 Gated MLA、896 个路由专家,每次选择其中16个,另有2个共享专家。MoonshotAI 官方资料
因此,“22580”更像一个有冲击力的规模对比,不是性能倍数。
二、GPT-2:把全部历史都保存下来
GPT-2 使用标准 Softmax Attention。生成一个新词时,模型会拿当前的 Query 与前面所有 token 的 Key 进行比较,再从 Value 中找出相关信息。
这就像写文章时,每增加一句话,都要重新翻阅前面的所有内容。
KV Cache 可以保存已经计算过的 Key 和 Value,避免重复计算,但它仍有两个问题:
上下文越长,KV Cache 占用的显存越大;
完整注意力的计算量随序列长度近似平方增长。
所以,当上下文扩展到几十万甚至一百万 token 时,传统注意力会变得非常昂贵。
三、Linear Attention:把历史压缩到一块“白板”里
线性注意力不再保存每个 token 独立的 Key 和 Value,而是把历史信息压缩进一个固定大小的状态矩阵。
可以把它理解为:
标准注意力:保存整本原始笔记,需要时逐页查找;
线性注意力:把笔记不断浓缩到一块固定大小的白板上。
这样做的好处是,生成新 token 时的状态大小不再随上下文长度持续增长,特别适合超长文本。
缺点也很明显:白板容量有限。内容越写越多,不同信息会相互覆盖和干扰,模型可能记得大意,却丢失精确细节。
四、DeltaNet:让模型学会“修改记忆”
普通线性注意力只是不断往白板上叠加内容,旧信息很难被精确修改。
DeltaNet 引入了 Delta Rule:
先用当前 Key 读取旧值;
比较旧值和准备写入的新值;
只写入两者之间的差异。
这就像数据库中的更新操作:不是在旧记录后面无限追加,而是定位原记录并进行修改。
由此,固定大小的状态不再只是一个累加器,而变成了可以更新的关联记忆。
五、Gated DeltaNet 与 KDA:让模型学会遗忘
DeltaNet 能修改特定记忆,但仍缺少主动清理旧信息的能力。
Gated DeltaNet 加入了遗忘门,可以让历史状态逐渐衰减。Kimi Delta Attention,也就是 KDA,又把这种遗忘机制细化到不同通道:
有些信息可以长期保留;
有些信息可以快速遗忘;
有些关联可以被新事实精确覆盖。
这相当于模型不但拥有一块白板,还拥有了分区域、分优先级的自动擦除机制。
六、Kimi K3 为什么仍然保留传统注意力?
固定状态再聪明,也不可能无损保存一百万 token 的全部细节。因此 Kimi K3 没有完全抛弃 Softmax Attention,而是采用混合架构:
69层 KDA:负责高速、低成本地维护滚动记忆;
24层 Gated MLA:周期性回到原始上下文中进行更精确的全局检索。
可以把它理解为:
平时看压缩摘要,需要核对细节时再翻原始资料。
这才是 Kimi K3 架构的关键:它不是押注某一种注意力机制,而是在“快速记忆”和“精确回查”之间做工程平衡。
此前的 Kimi Linear 在特定百万 token 测试环境中,报告了最高约6倍解码加速以及最多75%的 KV Cache 降低;这些是特定模型、硬件和上下文条件下的“最高值”,不能理解成所有任务都会快6倍。Kimi Linear 官方项目
七、MoE:容量巨大,但不是每次全部运行
Kimi K3 的2.8万亿参数主要来自 MoE 专家系统。
模型面对不同 token 时,会调用不同专家。例如:
代码内容交给更擅长代码的专家组合;
数学推理调用另一组专家;
普通语言、视觉或者工具操作又可能选择不同组合。
每次只激活16个路由专家和2个共享专家,因此它可以拥有巨大的知识容量,而不必让2.8万亿参数每次全部参与计算。
不过,未激活的参数虽然不参与本次运算,权重仍然需要保存和分布到大量设备上。即使按理想4bit计算,2.8万亿参数的原始权重也约需1.4TB,所以它仍不是64GB内存电脑能够本地运行的模型。
八、AttnRes:不仅向前查 token,也向上查“思考过程”
传统 Transformer 的残差连接,会把前面各层的输出不断相加。模型越来越深后,早期有价值的信息可能被大量后续输出稀释。
Attention Residuals(AttnRes)允许当前层根据输入内容,选择性地调用更早层的表示,而不是把所有层等权相加。
因此,Kimi K3 实际上在两个方向上管理记忆:
KDA和MLA解决“序列方向”的记忆:前面哪些 token 值得保留;
AttnRes解决“网络深度方向”的记忆:前面哪一层的理解最值得取回。
这相当于模型不仅能翻阅之前看过的资料,还能回到自己 earlier 的某一步分析结果。AttnRes 论文
九、需要注意的两个技术细节
第一,FlashAttention 并没有从数学上消除标准注意力的平方复杂度。它主要通过分块计算减少显存读写和中间矩阵占用,从而显著提速;真正改变序列长度复杂度的是线性注意力一类架构。
第二,Kimi K3 也不是“纯线性注意力模型”。它仍保留24层 Gated MLA,因此长上下文的精确检索能力并未被完全压缩成固定状态。它追求的是混合方案,而不是把所有历史都塞进一块有限白板。
总结
从 GPT-2 到 Kimi K3,技术演进可以归纳为三个问题:
存什么:从保存全部 KV,转向固定状态和稀疏专家;
怎么更新:从不断叠加,转向差分写入和选择性遗忘;
怎么检索:从逐 token 全量查找,转向滚动记忆、周期性全局回查和跨层检索。
所以,Kimi K3 最值得关注的并不是“参数达到 GPT-2 的22580倍”,而是它已经从一个单一的 Transformer,演变成了一套分层记忆系统:
日常使用压缩记忆,重要时回查原文;不同问题调用不同专家,必要时还可以返回早期思考层重新取回信息。
这可能也是未来大模型架构的重要方向:不再寻找一种包打天下的注意力机制,而是把快速记忆、精确检索、主动遗忘和稀疏专家组合成一个完整系统。