2.8万亿参数的“破壁者”:Kimi K3如何重新定义开源大模型的能力边界

2.8万亿参数的“破壁者”:Kimi K3如何重新定义开源大模型的能力边界

2026年7月16日,WAIC开幕前夕,月之暗面投下了一枚重磅炸弹——Kimi K3正式发布,2.8万亿参数,100万Token上下文,原生多模态。这是全球首个参数突破2万亿的开源模型,也是迄今为止全球参数最大的开源权重模型-。

当晚,英伟达股价收跌2.2%。市场的第一反应是恐慌——KDA线性注意力机制将KV cache带宽压力最高降低约10倍,空头逻辑很直接:GPU是不是要卖不动了?

然而,恐慌只持续了一夜。当技术细节被真正读懂,一个更深刻的结论浮出水面:Kimi K3不是算力的“终结者”,而是算力新范式的“开启者”。

一、从“堆参数”到“巧激活”:2.8万亿是如何炼成的

2.8万亿参数是什么概念?它超越了参数规模1.6万亿的DeepSeek-V4-Pro。但Kimi K3的真正创新,不在于“堆”了多少参数,而在于“用”了多少参数

K3采用了三项核心架构创新-:

Kimi Delta Attention(KDA)混合线性注意力机制。与传统Transformer的二次复杂度注意力不同,KDA将信息压缩为3个压缩状态和1个完整访问状态的组合-,在超长序列上大幅降低了注意力计算的开销。

注意力残差(Attention Residuals)技术。让信息在更长序列和更深模型中流动得更顺畅,解决了深层网络中的信息衰减问题-。

Stable LatentMoE框架。将专家数量扩展至896个,但单次推理仅激活16个专家。这意味着虽然模型总参数量达到2.8万亿,但每次推理只调用其中一小部分参数——用稀疏激活实现了密集模型的能力

叠加训练方法与数据配方的优化,K3相较前代K2实现了约2.5倍的整体缩放效率提升。这不再是简单的“堆算力”,而是用架构效率重构了规模与成本的关系

二、“越省越买”:KDA为何反而催生更大的算力需求

KDA降低了KV cache的带宽压力,但SemiAnalysis给出了一个反直觉的判断:“事实恰恰相反”。

原因有三:

第一,2.8万亿权重本身就需要天文数字的存储。单模型权重就要占据1.5TB以上HBM。KV cache省下的那点带宽,在模型权重本身的存储压力面前微不足道。

第二,WideEP策略将896个专家分布到多颗GPU上,每颗GPU只承载部分专家权重-。这虽然提升了单卡的计算利用率,但代价是每个Token都要跨卡进行all-to-all通信。省了注意力带宽,互联带宽反而更“饿”

第三,官方建议K3采用64张以上加速卡组成的超节点部署。这正是GB300 NVL72的主场——72卡、20TB显存、130TB/s NVLink。K3的推理架构,恰好与机柜级超节点系统高度匹配-。

于是,一个看似矛盾的结论诞生了:KDA越“省”,对HBM和超节点互联的需求反而越大。K3不是算力的“节省者”,而是超节点架构的“最佳代言人”

三、从“写代码”到“造芯片”:能力边界的实质性跨越

参数和架构是“里子”,能力才是“面子”。K3的能力跨越,可以用三个“第一次”来概括:

第一次,中国大模型登顶全球代码榜。在Frontend Code Arena全球大模型评测中,K3取得1679分,综合得分超越Claude Fable 5和GPT-5.6 Sol,位列全球第一-。这是中国大模型首次拿下该榜单榜首-。在七个前端细分领域中,K3拿下六项第一。

第一次,大模型自主完成芯片全流程设计。在48小时的自主运行中,K3用开源EDA工具在Nangate 45nm工艺库上完成了一颗芯片的设计、优化和验证。4平方毫米内集成了146万标准单元,100MHz频率下解码吞吐超过8700 tokens/s。团队称之为“由模型设计的芯片,为模型服务的芯片”

第一次,大模型从零写出GPU编译器。K3从零构建了一个名为MiniTriton的GPU编译器,包含自己的tile级IR层、优化pass和PTX代码生成管线,性能持平甚至超越Triton和torch.compile。在GPU kernel优化任务中,K3在MLA-512 kernel上达到517.8 TFLOPS,超过H200理论BF16峰值的一半

K3还展示了“vision in the loop”工作流——生成代码后直接查看实时运行截图,识别布局、色彩和层级问题,再修改代码,形成视觉反馈的闭环迭代。100万Token上下文窗口则可以一次性纳入大量组件文件、类型定义和项目文档,处理大型前端仓库的维护和跨文件功能开发-。

在真实生产案例中,K3生成AI ASIC行业研究网站时经历了120轮以上递归改进,完成2800次以上网页搜索与抓取,处理超过1.1万页内容。引力波分析案例则调用20个以上并发子Agent处理391个事件。这些任务已从一次问答转向检索、执行、校验、绘图和修改组成的长链路流程

四、告别“白菜价”:国产大模型商业化的分水岭

K3的API定价,释放了一个清晰的信号:国产大模型正在告别“价格战”

缓存命中输入、未命中输入和输出价格分别为$0.30、$3.00和$15.00/百万Token。输出价格是DeepSeek-V4高峰期价格的8倍,是智谱GLM-5.2的3倍多

这不是任性的涨价,而是能力升级后的价值重估。K3的产品定位已从低价模型服务转向长上下文、复杂推理和Agent任务驱动的旗舰能力定价。通过自动缓存和推理系统优化,K3在提升名义Token价格的同时维持了用户的实际使用门槛。

国产模型价格中枢正在随智能能力提升逐步向海外水平靠拢。行业竞争正由“单纯低价”转向“模型能力、缓存效率与算力利用率的综合比拼”。这是一场从“价格战”到“价值战”的产业升级。

五、开源生态的“破壁时刻”

K3的完整模型权重将于2026年7月27日前向全球开发者免费开放。这不仅仅是“开放”,而是把全球最大、能力最前沿的开源模型交到每一位开发者手中

观察人士已经开始将其与2025年初的“DeepSeek时刻”相提并论-。法新社报道称,K3“动摇了OpenAI、Anthropic等美国闭源模型的主导地位”,可能“引发资本市场的重新洗牌”-。特斯拉CEO马斯克在评论区留言:“Impressive(令人印象深刻)”-。

北京中关村学院院长刘铁岩说:“一批中国开源大模型从'单点亮相'走向'群体突破',为世界人工智能发展提供了新方案、新路径。”

2.8万亿参数、100万Token上下文、全球代码榜第一、48小时自主造芯片——这些标签共同勾勒出Kimi K3的全貌:它不是一个单纯的“大”模型,而是一个在架构效率、推理部署、工程能力、商业定价四个维度同时实现跨越的“破壁者”

当K3的权重在7月27日向全球开源,这场由2.8万亿参数引发的连锁反应,才刚刚开始。