【AI】中国 AI 实验室正在用开源的方式,把“最大、最强“的模型直接摆到全球开发者面前

【AI】中国 AI 实验室正在用开源的方式,把“最大、最强“的模型直接摆到全球开发者面前

本文导读:2026 年 7 月,国产大模型集体冲入"万亿参数 + 开放权重"俱乐部。月之暗面 Kimi K3、阿里通义千问 Qwen3.8 相继亮相,DeepSeek、腾讯混元紧随其后。本文精选本轮最具技术含量的两篇重点报道,翻译整理为中文,带你一次看懂这场"开源冲击波"的技术底牌。

目录

    • 一、写在前面
    • 二、重点文章一:月之暗面 Kimi K3 —— 全球首个"开放 3T 级"大模型
      • 2.1 核心事实
      • 2.2 两个"押注":不只是把模型堆大
      • 2.3 性能与生态影响
      • 2.4 对开发者意味着什么
    • 三、重点文章二:阿里 Qwen3.8-Max 预览版 —— 2.4 万亿参数原生多模态旗舰
      • 3.1 核心事实
      • 3.2 技术亮点:全域多模态 + 稀疏激活
      • 3.3 落地场景与体验渠道
      • 3.4 开源的分量
    • 四、横向速览:本轮其他重点动态
    • 五、总结:一个属于"开放前沿"的夏天
    • 参考来源

一、写在前面

如果说 2025 年是国产大模型"追赶"的一年,那么 2026 年 7 月这个夏天,风向明显变了——中国 AI 实验室正在用开源的方式,把"最大、最强"的模型直接摆到全球开发者面前

短短两周内:

  • 7 月 16 日,月之暗面(Moonshot AI)发布Kimi K3,2.8 万亿参数,号称"全球首个开放的 3T 级模型";
  • 7 月 19 日,阿里通义千问团队官宣Qwen3.8-Max 预览版,2.4 万亿参数原生多模态旗舰;
  • 7 月 27 日,Kimi K3 权重正式在 Hugging Face 开源。

更有意思的是,在 OpenRouter(全球主流模型调用路由平台)上,排名前五的模型全部来自中国团队:小米 MiMo、DeepSeek、MiNiMax、阿里 Qwen、月之暗面 Kimi。

下面我们挑两篇技术含量最高的报道,逐条拆解。


二、重点文章一:月之暗面 Kimi K3 —— 全球首个"开放 3T 级"大模型

编译整理自 Moonshot AI 官方发布、Hugging Face 模型卡及多篇技术深度报道(July 16–27, 2026)

2.1 核心事实

7 月 16 日,月之暗面正式发布 Kimi K3,并于 7 月 27 日在 Hugging Face 公开全部权重。官方将其定义为"全球首个开放的 3T 级(3-trillion-class)模型",这也是迄今为止参数规模最大的开放权重模型

关键参数一览:

维度规格
总参数量2.8 万亿(2.8T)
架构MoE 混合专家(Mixture-of-Experts)
专家数 / 激活数896 个专家,每 token 仅激活16 个(约 1.8%)
上下文窗口100 万 token(1M)
模态原生视觉多模态(native vision)
开源协议开放权重(open-weight),7 月 27 日全量放出
量化支持 MXFP4 量化,显著降低部署门槛

2.2 两个"押注":不只是把模型堆大

Kimi K3 最值得关注的地方,不在于"参数多",而在于它在注意力机制上做了两处偏离主流配方的架构创新:

  1. KDA(Kimi Delta Attention,Kimi 增量注意力)
    在超长上下文(百万 token 级)下,传统全量注意力的计算与显存开销近乎不可承受。KDA 通过增量式的注意力更新机制,让模型在长序列上保持高效推理。

  2. AttnRes(Attention Residuals,注意力残差)
    在注意力层之间引入残差连接思路,缓解深层网络中的信息衰减,提升训练稳定性与长程依赖建模能力。

💡通俗理解:MoE 让模型"知识量巨大但每次只调用一小撮专家",KDA + AttnRes 则让它"在超长文档里也能跑得动、记得住"。二者结合,才使得 2.8T 规模的模型在实际部署中具备可行性。

2.3 性能与生态影响

官方宣称 Kimi K3 的能力接近 Anthropic Fable 5(当前公开可用的最强模型之一)。发布后据彭博社报道,模型上线驱动了月之暗面日销售额约 6 倍的激增

资本市场同样给出剧烈反应——有海外媒体将其称为**“第二次 DeepSeek 时刻(second DeepSeek shock)”**。与此同时,月之暗面完成35 亿美元融资,估值在半年内翻了三倍。

2.4 对开发者意味着什么

  • 可自部署的前沿能力:2.8T 开放权重 + MXFP4 量化,意味着有条件的团队可以在本地/私有云跑接近第一梯队的模型;
  • 超长上下文落地:1M token 上下文对 RAG、代码库级理解、长文档分析等场景是实打实的能力提升;
  • 架构可借鉴:KDA / AttnRes 为长上下文优化提供了新的工程参考。

三、重点文章二:阿里 Qwen3.8-Max 预览版 —— 2.4 万亿参数原生多模态旗舰

编译整理自阿里云开发者社区、新浪财经及知乎技术专栏(July 19–20, 2026)

3.1 核心事实

紧随 Kimi K3 之后,7 月 19 日阿里通义千问团队发布Qwen3.8-Max-Preview,总参数规模2.4 万亿,是阿里云首款突破万亿参数的原生多模态旗舰模型

关键参数一览:

维度规格
总参数量2.4 万亿(2.4T)
架构MoE 混合专家 + 原生多模态
上下文窗口原生128K,特殊场景可无损扩展至1M
模态文本、图像、短视频、PDF/HTML/Markdown 文档,无需格式转换直接解析
性能定位官方称综合实力"仅次于 Anthropic Claude Fable 5"
开源承诺正式版开放代码、权重及推理部署方案

3.2 技术亮点:全域多模态 + 稀疏激活

Qwen3.8-Max 把自己定位为**“全域复杂任务处理中枢”**,核心卖点有三:

  1. 原生多模态、免转换
    可同时处理文本、图像、短视频,以及 PDF、HTML、Markdown 等多格式文档,无需提前做格式转换即可直接解析——这对文档智能、多模态 RAG 是很实用的工程优化。

  2. MoE 稀疏激活撑起万亿规模
    通过稀疏激活机制,模型保持万亿参数容量的同时,每次前向传播只激活一小部分专家网络,这是"万亿参数能真正跑起来"的关键。

  3. 工程级代码能力
    官方真实工程测评中,其代码能力达到行业顶尖水准,主打全栈开发、代码重构、漏洞批量修复、项目迭代优化等场景。

3.3 落地场景与体验渠道

Qwen3.8-Max 针对四类高端场景做了深度优化:高难度工程开发、多智能体长周期任务、全链路办公自动化、海量数据分析

目前抢先体验依托阿里云三大平台上线:

  • 百炼 Token Plan(模型调用)
  • Qoder编码平台
  • QoderWork办公终端

3.4 开源的分量

能同时进入**“万亿参数 + 开放权重”**俱乐部的模型,全球屈指可数。阿里延续了通义千问一贯的开源路线,承诺正式版开放权重——这意味着开发者未来有望在私有环境部署一个 2.4T 级别的多模态旗舰。


四、横向速览:本轮其他重点动态

除了 Kimi K3 与 Qwen3.8,7 月国产大模型阵营还有几条不容错过的技术新闻:

  • DeepSeek-V4 系列:推出 Pro(1.6T/49B)与 Flash(284B/13B)双模型,原生支持100 万 token上下文,采用全新CSA + HCA 混合注意力架构大幅降本;同时被曝正在推进自研 AI 推理芯片。
  • 腾讯混元 Hy3295B 总参 / 21B 激活的 MoE,256K 上下文,采用Apache 2.0商业友好开源协议;混元语言与多模态团队合并成立"基础模型部"。
  • 百度昆仑芯 P800:已在全国产集群上完成文心 5.1 重要版本训练,交付多个万卡集群,腾讯成为其客户,字节亦在评估;昆仑芯计划赴港上市。
  • 快手可灵 AI:完成上限 30 亿美元外部增资,投后估值 180 亿美元,创全球视频大模型公司最大额融资纪录。

五、总结:一个属于"开放前沿"的夏天

把这些碎片拼起来,能看到一条清晰的技术主线:

国产大模型正在用"开放权重 + 万亿参数 + 超长上下文 + 原生多模态"的组合拳,重新定义前沿模型的竞争规则。

对我们开发者来说,这带来的最直接红利是:接近第一梯队的能力,第一次可以以"可自部署、可研究、可二次开发"的形式拿到手里。无论是长上下文的 KDA、混合注意力的 CSA/HCA,还是原生多模态的免转换解析,都值得在自己的项目里认真评估一遍。

万亿参数不再是巨头的专利秀,而是逐渐变成开发者工具箱里的选项——这大概就是 2026 年这个夏天最重要的信号。


参考来源

  1. China reshapes global AI landscape with trillion-parameter open-weight models — China Daily
  2. China Narrows U.S. AI Gap With Moonshot AI’s Kimi K3, Alibaba’s Qwen 3.8 — Foreign Policy
  3. Kimi K3: A Technical Deep Dive into the First Open 3T-Class Model — Hyperstack
  4. Kimi K3 — 2.8T Parameters, MXFP4 Quantization(Hugging Face Blog)
  5. moonshotai/Kimi-K3 · Hugging Face 模型卡
  6. Chinese LLMs Take Top Five Spots On OpenRouter — Dataconomy
  7. 最新版通义千问(Qwen3.8-Max-Preview)功能介绍 — 阿里云开发者社区
  8. 比肩 Fable 5,2.4 万亿参数与原生"慢思考":阿里 Qwen 3.8 预览版正式亮相 — 知乎
  9. 阿里千问最强大模型 Qwen3.8 即将开源 — 新浪财经
  10. AI 应用周度观察(2026.07.20–2026.07.26)— 新浪财经

✍️本文由 AI 辅助整理,技术参数以各厂商官方发布为准。如果本文对你有帮助,欢迎点赞、收藏、关注三连~有想深入了解的模型,欢迎评论区留言。

标签#大模型#Kimi K3#通义千问Qwen#DeepSeek#MoE#开源模型#人工智能