2026年7月31日,DeepSeek 在 API 更新日志里悄悄官宣:DeepSeek-V4-Flash-0731 正式版上线公测。没有发布会、没有预告,却让全球开发者圈直接沸腾——一个轻量版模型,在 Agent 能力上全面反超自家 Pro 旗舰,还把 OpenAI 的 Codex 生态给「策反」了。
一、事件速览:一场「悄无声息」的重磅发布
2026年7月31日下午,DeepSeek 在官方 API 文档的更新日志中宣布:DeepSeek-V4-Flash 正式版 API 上线公测(版本号 V4-Flash-0731)。
几个关键事实:
- 没有新架构:模型结构、尺寸与 4 月 24 日发布的 V4-Flash 预览版完全一致,仅重新进行了后训练
- 无需改代码:开发者继续用
deepseek-v4-flash模型名调用,后台自动切换到新版本 - 仅限 API:DeepSeek App、网页端以及 V4-Pro API 均未变化,普通用户今天打开 DeepSeek,体验和昨天一模一样
- V4-Pro 正式版仍在路上:官方表示将「尽快发布」,预计 8 月初上线
也就是说,这是一次只给开发者看的升级。但信息量之大,让整个行业都坐不住了。
二、核心看点:Flash 把 Pro 给「以下克上」了
按照行业惯例,Pro 负责性能天花板,Flash 负责便宜大碗。但这次 DeepSeek 直接掀翻了这张桌子——V4-Flash 正式版在 Agent 能力上,多项基准测试全面反超三个月前的 V4-Pro 预览版。
2.1 官方公布的 9 项基准测试成绩
| 测试项目 | V4-Flash 正式版 (0731) | 说明 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 终端操作测试(预览版仅 61.8,暴涨 20.9 分) |
| Cybergym | 76.7 | 网络安全攻防模拟 |
| Toolathlon Verified | 70.3 | 工具调用综合测试 |
| NL2Repo | 54.2 | 自然语言生成代码仓库 |
| DeepSWE | 54.4 | 代码 Agent 任务(预览版仅 7.3,暴增近 7.5 倍) |
| DSBench-FullStack | 68.7 | 内部全栈开发测试 |
| DSBench-Hard | 59.6 | 高难度编码专项测试 |
| Agent Last Exam | 25.2 | 智能体综合测试 |
| Automation Bench (Public) | 25.1 | 自动化基准测试 |
横向对比更有冲击力:
| 模型 | Terminal Bench | Toolathlon Verified |
|---|---|---|
| DeepSeek V4-Flash 正式版 | 82.7 | 70.3 |
| GLM-5.2 | 81.0 | — |
| Claude Opus 4.8 | 85.0 | 76.2 |
| V4-Pro 预览版 | 67.9(Terminal Bench 2.0) | — |
一个开源轻量版,在终端操作测试上反超 GLM-5.2,距离 Opus 4.8 只差 2.3 分;工具调用差距也在快速收窄。注意 Terminal Bench 2.0 与 2.1 不是同一套测试集,直接对比不完全公平——但一个激活参数仅 130 亿的轻量模型跑出这个成绩,已经足以说明问题。
翻译成人话:新版 Flash 不只更会写代码,也更擅长「自己动手干活」——拆解任务、调用工具、发现错误、从头到尾把一件事做完。
2.2 最恐怖的一句话:「仅重新进行了后训练」
DeepSeek 在更新日志中的原话:
「DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。」
也就是说,骨架完全没变,只是更会「练」了。
打个比方:基础训练像「上学」,后训练更像「入职后的专项练习」——模型原本就会写代码、读文档,现在要反复练习怎么拆解任务、选择工具、发现错误,把一件事从头做到尾。身板没变,做事的习惯变了。
这传递了一个极其深刻的信号:在特定任务上,模型规模可能不再是决定性因素,训练方法和数据质量的权重正在快速上升。 谁说后训练只是「锦上添花」?在 DeepSeek 手里,这是化腐朽为神奇。
三、技术底牌:百万上下文背后的工程细节
V4-Flash 的能力暴增不是凭空来的,它站在 V4 系列强大的架构基础上。回顾 4 月发布的 V4 技术报告(《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),可以看到四个核心技术突破:
3.1 模型规格
| 参数 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数 | 1.6T(1.6万亿) | 284B(2840亿) |
| 激活参数 | 49B(490亿) | 13B(130亿) |
| 架构 | MoE 混合专家 | MoE 混合专家 |
| 上下文长度 | 1M tokens(原生) | 1M tokens(原生) |
| 最大输出长度 | 384K tokens | 384K tokens |
| 预训练数据 | 33T tokens | 32T tokens |
| 网络层数 | 未公布 | 43 层 |
两者在模型规模上相差一个数量级——但 Flash 通过后训练把 Agent 能力拉到了接近 Pro 的水平,这本身就是对「参数至上论」的有力反驳。
3.2 核心架构创新(V4 系列共通)
① CSA + HCA 混合稀疏注意力 —— 把 KV Cache 沿序列维度「叠罗汉」
- CSA(压缩稀疏注意力):把每 m 个相邻 token 的 KV 压缩成 1 个「摘要条目」(V4-Pro 中 m=4),再用一个轻量 Lightning Indexer 给每个 query 选 top-k 个最相关的压缩条目精读(top-k=1024)。相当于「先粗读,再精读」。
- HCA(重度压缩注意力):压缩比拉到 128,不做稀疏选择、保留 dense attention,把 1M tokens 压成约 7800 个 entry,所有 query 都能看——相当于一个「永远在线的全局摘要通道」。
- 两者交错排布,构成局部精读 + 全局浏览的双轨注意力,配合滑窗分支(保留最近 128 个 token 未压缩 KV)和 Attention Sink,兼顾细节与全局。
效率数据(1M token 场景下 vs V3.2):
| 指标 | V4-Pro | V4-Flash |
|---|---|---|
| 单 token 推理 FLOPs | V3.2 的 27% | V3.2 的 10% |
| KV Cache 占用 | V3.2 的 10% | V3.2 的 7% |
百万 token 上下文,从「演示用 demo」变成了「可以日常跑的工作负载」。
② mHC(流形约束超连接)—— 给残差通路加一条「信息守恒律」
V4 没有沿用标准残差连接,而是引入 Hyper-Connections 的演进版 mHC:把残差流宽度拓宽 4 倍,并强制将残差映射矩阵约束在 Birkhoff 多胞体(双随机矩阵流形)上——每行每列和为 1、元素非负。收益有两个:谱范数 ≤ 1,前向不会爆、反向梯度不会炸;双随机矩阵在乘法下封闭,深层堆叠的稳定性可以传递。这解决了 1.6T 参数规模训练不收敛/不稳定的世界级难题。
③ Muon 优化器 —— 方向更稳、收敛更快
替换主流的 AdamW,把「逐元素估计」换成「对整梯度矩阵做正交化」(通过 Newton-Schulz 迭代近似,前 8 步激进系数快速逼近、后 2 步保守系数稳定到 1),搭配 GRPO 强化学习 + KL 散度修正。Embedding、prediction head、RMSNorm 等仍用 AdamW。
④ FP4 QAT —— 把 MoE 权重再砍一半
对 MoE 专家权重和 CSA indexer 的 QK 路径引入 MXFP4 量化感知训练,推理时直接用真 FP4 权重,显存和带宽压力大幅下降,在国产 AI 芯片上也能稳定部署。
3.3 长上下文效率的意义
过去两年大模型的进步沿着两条主线:reasoning 模型靠更长思考链做 test-time scaling;agentic 工作流动辄处理跨多文档、多工具调用的长 horizon 任务。两条路都极度依赖上下文长度,而 vanilla attention 是 O(n²)——上下文翻一倍,算力和显存翻四倍。
DeepSeek V4 用这套组合拳,把 1M 上下文的边际成本压到了「能用、好用、日常用」的程度。同样一张显卡,以前只能跑 32K 上下文,现在可以稳定跑 1M。
四、定价与并发:不只是便宜,是「降维打击」
4.1 价格对比
| 计费项 | V4-Flash 正式版 | V4-Pro | GPT-4o 系列 |
|---|---|---|---|
| 输入(缓存命中) | 0.2 元 / 百万 tokens | 1 元 | — |
| 输入(未命中) | 1 元 / 百万 tokens($0.14) | 12 元($0.435) | 约 10 倍于 Flash |
| 输出 | 2 元 / 百万 tokens($0.28) | 24 元($0.87) | — |
V4-Flash 的价格约为 V4-Pro 的 三分之一。
4.2 并发能力:5 倍差距
| 指标 | V4-Flash | V4-Pro |
|---|---|---|
| 并发请求上限 | 2,500 | 500 |
对跑 Agent 任务来说,2500 vs 500 的并发差距比任何跑分都实在——Agent 场景对推理速度和成本极度敏感,多轮任务要反复调用工具,Flash 的低价 + 高并发在规模化落地时是压倒性优势。
4.3 隐藏信息:峰谷定价要来了
DeepSeek 还预告了峰谷定价政策:高峰时段(北京时间 09:00-12:00、14:00-18:00)价格按常规的 2 倍计费,具体生效日期未公布。高频调用团队需要提前评估账单影响。
五、生态攻势:把 OpenAI 的 Codex「策反」了
这次发布最让开发者兴奋的,是生态层面的动作:
5.1 原生支持 OpenAI Responses API(且是 Flash 独占)
- V4-Flash 正式版原生支持 OpenAI 力推的 Responses API 格式
- 关键点:Responses API 目前仅 Flash 支持,V4-Pro 要等到 8 月初
- 开发者无需修改 Base URL 即可切换模型
5.2 针对性适配 Codex
OpenAI 开源的 Codex 现在能直接接入 deepseek-v4-flash:
- Codex CLI ✅
- ChatGPT 桌面端 ✅
- VS Code 的 Codex IDE 扩展 ✅
三者共用同一份配置文件,完成一次配置,即可在不同客户端中选择 DeepSeek-V4-Flash。等于把 OpenAI 自家生态的 Agent 应用,低成本「平移」到了 DeepSeek 平台上。
5.3 既有 Agent 生态全覆盖
V4 预览版已完成对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品的适配优化。加上思考/非思考双模式切换、Tool Calls、JSON 输出、Anthropic API 格式,开发者的接入自由度很高。
六、彩蛋:DeepSeek Harness 首次亮相
这次更新还悄悄放出了一个「隐藏武器」——DeepSeek Harness。
官方注明:本次公开基准测试中的 Code Agent 任务,使用的是 DeepSeek Harness 极简模式作为测试框架(max 档位,topp=0.95,temperature=1.0)。该框架为模型提供终端操作、代码编辑、工具调用和任务验证环境,相关内容后续将正式公布。
背景信息:DeepSeek 的 Agent Harness 团队成立于 今年 3 月,负责人崔添翼是 90 后浙大计算机出身,手握 6 枚 ACM 亚洲区域赛金牌,曾在顶尖量化机构 Jane Street 任职九年,今年 3 月加入 DeepSeek,5 月大力招兵买马。
一个专门搞 Agent 评测的自研框架浮出水面,暗示 DeepSeek 在 Agent 能力上还有大量后手。
七、实测:3 块钱干完 5 件事
跑分终究是跑分,真实场景表现如何?爱范儿把 V4-Flash 接入自家 Agent 工具 Proma,做了 5 个从简单到复杂的实测任务(不追加提示、不人工干预):
| # | 任务 | 表现 |
|---|---|---|
| 1 | 分析 320 篇早报数据并生成交互式 HTML 报告 | 数字卡片 + 柱状图、折线图、环形图、雷达图、散点图,深色主题 UI 完成度极高 |
| 2 | 编写打砖块游戏(含物理引擎、4 种砖块、道具系统、粒子特效) | 弹性碰撞、动量传递、金属砖裂纹、爆炸砖波及、多球/激光/粘性挡板全部可触发 |
| 3 | 三体轨道模拟器(RK4 积分) | 四阶龙格-库塔法 + 引力软化 + 自适应步长,内置 figure-8、Lagrange 轨道预设 |
| 4 | 科幻控制舱仪表盘(实时波形、环形进度、超载模式) | 主次层级清晰,发光效果没有盖过数据,Web Audio 合成警报音 |
| 5 | 调用 GitHub API 生成开源 AI 项目周报 | 创建 Python 脚本、实际运行、检查结果,交付脚本 + Markdown 周报 + JSON 数据 + 网页 |
费用账单:393 次 API 请求,累计消耗约 3422 万 token,总花费 2.85 元。 测试前充的 10 元,连三分之一都没用完。
开发者们的评价也很直接:「V4-Flash 对我的使用场景来说,简直是性能溢出了」「这就是我想要的模型——够便宜,也够聪明」。
八、行业信号:AI 竞争进入「智价比」时代
8.1 同一天的两颗炸弹
7月31日这一天,行业里发生了一件戏剧性的事:
- DeepSeek:V4-Flash 正式版上线,能力大涨、价格不变
- OpenAI:突然宣布 GPT-5.6 系列大幅降价——Luna 价格下调约 80%,Terra 下调 20%(Luna 降至每百万 token 输入 0.2 美元、输出 1.2 美元),OpenRouter 上还有 5 折
顶级模型的竞争,正在从单纯比拼能力上限,转向争夺「智价比」。对厂商这是利润压力,对开发者和用户则是利好——Agent 可以调用更多次、思考更长时间,承担过去因成本过高而无法落地的任务。
8.2 「后训练」正在成为主战场
Flash 正式版「仅重训、不动架构」的成绩单,给整个行业上了一课:预训练决定了天花板,但后训练决定了你能摸到多高。 数据质量、强化学习、推理策略和训练方法,依然能从现有模型里挖出更多能力。
8.3 Agent 能力才是决赛圈
价格战打到现在,API 调用成本已不再是开发者选模型的决定性因素,真正稀缺的是能交付的 Agent 能力。DeepSeek 用轻量版证明:低价不等于低能。
8.4 国产大模型开始「各有所长」
- Kimi K3:2.8T 超大 MoE、原生多模态、主打全能综合推理
- V4-Flash:轻量 MoE、专攻文本效率与 Agent 落地、适配国产芯片、私有化门槛低
- GLM-5.2、MiniMax 新模型:各自卡位
国产模型不再是一个模子刻出来的「GPT 仿制品」,差异化竞争的格局正在形成,也正在打破海外闭源模型的定价垄断。
8.5 资本加持后的第一次技术兑现
今年 6 月,DeepSeek 完成首轮外部融资,总额超 74 亿美元(约合 500 亿元人民币),投后估值超 500 亿美元(约合 3380 亿元),创下中国 AI 行业单轮融资纪录(部分媒体报道估值已达 710 亿美元)。这次 Flash 正式版,是资本加持后的第一次技术兑现。
九、客观看待:还有哪些待解问题
写稿不易,理性吃瓜。这篇报道也要列出「泼冷水」的部分:
- 仅限 API 端:App 和网页端暂时无法体验,普通用户今天打开 DeepSeek 和昨天一样
- 权重尚未开源:Hugging Face 上目前还是 4 月的预览版权重(MIT 许可),V4-Flash-0731 的权重是否开源、何时开源,官方尚未明确
- 基准测试均为官方自测:9 项成绩来自 DeepSeek 自己的 Harness,截至 7 月 31 日尚无第三方独立复现
- 高推理强度依赖:好成绩多依赖高推理强度档位,单价优势可能被更长任务轨迹消耗的更多 token 抵消,实际任务总成本优势还需独立评测验证
- 能力上限仍低于 Pro:超复杂多步骤智能体任务、高精数理难题仍是 Flash 的短板
- 缺失原生多模态:V4-Flash 专注文本场景,图文混合分析需搭配 Kimi K3 或海外模型
写在最后
DeepSeek V4-Flash 正式版的发布,不是一次「小版本迭代」,而是对「规模至上」论的一次有力反击。
130 亿激活参数的模型,在 Agent 任务上足以与自家旗舰掰手腕、与闭源顶级模型叫板。这对整个行业的意义是:通往 AGI 的路不止「堆参数」这一条。更聪明的训练方法、更高质量的数据、更极致的工程优化——这些同样能带来质的飞跃。
而 DeepSeek 的战略意图也很清晰:用高性价比的轻量模型切入 Agent 应用市场,把百万 token 长上下文、函数调用、工具使用这些高阶能力「下放」到人人用得起的价格带。
对于开发者而言,一个 Agent 能力拉满、调用成本低到任性、原生兼容 OpenAI 生态、还能本地私有化部署的模型,意味着什么?
意味着「人人都能用上 Agent」的时代,真的来了。