文章目录
- DeepSeek-V4-Flash正式版技术解析:仅靠后训练如何实现Agent能力跃升
- 一、引言
- 二、从预览版到正式版:变的不是底座
- 2.1 两个关键节点
- 2.2 本次更新的准确边界
- 三、Agent 基准跃升:Flash 开始挑战 Pro 的任务区
- 3.1 九项正式版成绩
- 3.2 为什么后训练能显著改变 Agent 表现
- 3.3 Benchmark 不能脱离 Harness 阅读
- 四、API 工程实践:接口不迁移,能力要重新验收
- 4.1 用 Responses API 调用正式版
- 4.2 当前能力矩阵
- 4.3 上线前应做什么
- 五、成本与产品定位:为什么它是代码助手的生产力入口
- 5.1 Flash 与 Pro API 对比
- 5.2 横向选择:Flash 不是所有任务的答案
- 六、横纵交汇:模型竞争进入后训练与 Harness 阶段
- 七、总结
DeepSeek-V4-Flash正式版技术解析:仅靠后训练如何实现Agent能力跃升
一、引言
亲爱的朋友们,创作不容易,若对您有帮助的话,请点赞收藏加关注哦,您的关注是我持续创作的动力,谢谢大家!有问题请私信或联系邮箱:jasonai.fn@gmail.com
2026 年 7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测。开发者不需要迁移接口,只需把模型名设为deepseek-v4-flash,就能调用最新的 DeepSeek-V4-Flash-0731。
这次更新最值得关注的不是一个新参数,而是一组反常识的结果:**模型结构和尺寸与 V4-Flash-Preview 保持一致,仅重新进行了后训练,Agent 能力却出现大幅跃升。**Terminal Bench 2.1 达到 82.7,Toolathlon verified 达到 70.3,内部难题集 DSBench-Hard 达到 59.6。官方称多项成绩远超 V4-Pro-Preview。
对于代码助手团队,这意味着模型竞争正在从“谁的参数更多”转向“谁能在真实工具链中稳定完成更长的任务”。本文将从版本演进、Benchmark、Agent 机制、API 接入、成本与生产选型六个角度,拆解 V4-Flash 正式版的价值与边界。
二、从预览版到正式版:变的不是底座
2.1 两个关键节点
| 时间 | 版本节点 | 核心变化 | 产品定位 |
|---|---|---|---|
| 2026-04-24 | V4-Pro / V4-Flash 预览版 | 1M 上下文、全新 Token 压缩注意力与 DSA 稀疏注意力;适配 Claude Code、OpenCode 等 Agent 工具 | Pro 追求能力上限,Flash 提供更快、更经济的服务 |
| 2026-07-31 | V4-Flash 正式版公测 | 结构和尺寸不变,重新后训练;原生支持 Responses API,针对 Codex 适配 | 把 Flash 从“低成本版本”推向可用的 Agent 主力模型 |
4 月的 V4 预览版解决的是底座问题:用 Token 维度压缩结合 DeepSeek Sparse Attention,降低百万上下文的计算与显存成本;7 月正式版解决的则是行为问题:模型如何规划、调用工具、读取反馈、修正错误并持续推进任务。
2.2 本次更新的准确边界
| 项目 | 2026-07-31 的实际状态 |
|---|---|
| API 模型名 | deepseek-v4-flash,调用方式与 Base URL 不变 |
| 模型版本 | DeepSeek-V4-Flash-0731 |
| 模型结构与尺寸 | 与 V4-Flash-Preview 一致 |
| 训练变化 | 重新进行了后训练;官方未披露具体配方 |
| Responses API | Flash 原生支持,并针对 Codex 适配 |
| V4-Pro | 本次未升级,正式版将后续发布 |
| APP / Web | 本次未更新,只升级 Flash API 接口 |
因此,这不是一次“换了更大模型”的升级,也不能把成绩提高简单归功于更多参数。更合理的判断是:V4 的基础架构提供了能力上限,后训练决定这些能力能否在 Agent 长链路中稳定兑现。
三、Agent 基准跃升:Flash 开始挑战 Pro 的任务区
3.1 九项正式版成绩
| 基准 | V4-Flash 正式版 | 主要考察能力 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 在终端环境中执行多步工程任务 |
| NL2Repo | 54.2 | 从自然语言需求生成或修改仓库级代码 |
| Cybergym | 76.7 | 网络安全环境中的分析与操作 |
| DeepSWE | 54.4 | 软件工程问题理解、修改与验证 |
| Toolathlon verified | 70.3 | 多工具选择、参数构造与连续调用 |
| Agent Last Exam | 25.2 | 跨领域、长链路 Agent 综合能力 |
| Automation Bench (Public) | 25.1 | 自动化工作流执行能力 |
| DSBench-FullStack | 68.7 | DeepSeek 内部全栈开发测试集 |
| DSBench-Hard | 59.6 | DeepSeek 内部 Coding Agent 难题集 |
官方结论是这些成绩“远超 V4-Pro-Preview”。但更新日志没有在文本中同步列出 Pro 预览版的全部对照分数,因此不宜自行补齐或推算倍数。真正可靠的结论有两个:正式版的优势集中在代码、终端与工具调用;Flash 与 Pro 的分工,已经不再等同于“弱模型”和“强模型”的简单切分。
3.2 为什么后训练能显著改变 Agent 表现
一个 Coding Agent 的结果不是单轮代码生成,而是一条循环执行的轨迹:
用户目标 | v 理解仓库 -> 制定计划 -> 调用终端/搜索/编辑工具 ^ | | v 总结反馈 <- 修正错误 <- 读取命令输出与测试结果 | v 提交可验证结果底座能力相同,轨迹质量仍可能完全不同。一次错误的工具参数、漏读一条测试失败信息,或过早宣布完成,都会让后续步骤整体偏航。后训练可以针对这些行为做校准,例如更准确地遵循工具协议、更合理地分解任务、根据环境反馈纠错,以及延迟结束判断。
需要强调的是,DeepSeek 尚未公开 V4-Flash-0731 的后训练数据、奖励设计或训练阶段细节。上述机制是根据 Agent 任务特征做出的工程解释,不是官方技术配方。可以确认的是:在架构与尺寸不变的前提下,新增收益主要来自后训练和 Agent 适配,而不是推理时突然增加了模型容量。
3.3 Benchmark 不能脱离 Harness 阅读
正式版公开 Code Agent 基准使用即将发布的DeepSeek Harness 极简模式,推理强度为max,并设置top_p=0.95、temperature=1.0。这意味着分数是“模型 + Harness + 参数 + 执行环境”的系统结果,而不是裸模型的静态属性。
此外,DSBench-FullStack 与 DSBench-Hard 是内部测试集,外部团队暂时无法独立复现。选型时应把公开分数当作候选信号,再用自己的仓库、工具权限、超时和成本预算运行回归测试。
四、API 工程实践:接口不迁移,能力要重新验收
4.1 用 Responses API 调用正式版
V4-Flash 原生支持 OpenAI Responses API 格式。已有 OpenAI SDK 的项目只需设置 DeepSeek Base URL、API Key 与模型名:
importosfromopenaiimportOpenAI client=OpenAI(api_key=os.environ["DEEPSEEK_API_KEY"],base_url="https://api.deepseek.com",)response=client.responses.create(model="deepseek-v4-flash",instructions="你是一名严谨的软件工程助手。修改代码后必须运行测试。",input="分析当前项目的测试失败原因,并给出最小修复方案。",)print(response.output_text)截至 2026 年 8 月 1 日,Responses API 仅支持deepseek-v4-flash,V4-Pro 尚未支持。DeepSeek 还提供 Codex 配置方案,Codex CLI、ChatGPT 桌面端与 VS Code Codex 插件可共用同一份配置。
4.2 当前能力矩阵
| 能力 | V4-Flash 正式版状态 | 工程含义 |
|---|---|---|
| 上下文长度 | 1M | 可读取大型仓库,但仍需控制无关文件与上下文污染 |
| 最大输出 | 384K | 支持长任务产物,不代表每次都应生成超长输出 |
| 思考模式 | 支持,默认为思考模式 | 复杂 Agent 任务可用reasoning_effort=max |
| Tool Calls | 支持 | 可构建搜索、终端、数据库等工具循环 |
| Responses API | 支持 | 更容易接入 Codex 与既有 Agent Runtime |
| Anthropic API | 支持 | 便于迁移 Anthropic 协议客户端 |
| JSON Output | 支持 | 适合结构化结果与下游自动处理 |
4.3 上线前应做什么
| 检查项 | 建议 |
|---|---|
| 任务回归 | 从真实仓库抽取修 Bug、加测试、重构和终端任务,比较成功率而非只比较回答观感 |
| 工具安全 | 对 Shell、文件写入、网络和凭证设置最小权限;高风险动作保留审批 |
| 参数分层 | 日常任务从high开始,只有高难任务使用max,避免把榜单参数直接复制到全部流量 |
| 成本记录 | 分别记录输入、缓存命中、推理与输出 Token,观察单个成功任务的总成本 |
| 灰度路由 | 新旧模型并行一段时间,监控工具调用失败率、测试通过率、时延与重试次数 |
模型名不变降低了迁移成本,也提高了静默行为变化的风险。生产团队仍应把 0731 当作一次模型版本升级,重新跑回归,而不是看到“调用方式不变”就直接切换全部流量。
五、成本与产品定位:为什么它是代码助手的生产力入口
5.1 Flash 与 Pro API 对比
| 维度 | V4-Flash 正式版 | V4-Pro-Preview(当前 Pro API) |
|---|---|---|
| 上下文 / 最大输出 | 1M / 384K | 1M / 384K |
| 百万 Token 输入:缓存命中 | 0.02 元 | 0.025 元 |
| 百万 Token 输入:缓存未命中 | 1 元 | 3 元 |
| 百万 Token 输出 | 2 元 | 6 元 |
| 并发限制 | 2500 | 500 |
| Responses API / Codex | 已支持 | 暂不支持,官方预计 2026 年 8 月初支持 |
| 定位 | 高并发、低成本、Agent 生产流量 | 追求更高能力上限的复杂任务 |
按当前平时价格计算,一次任务若使用 60 万未缓存输入 Token 和 20 万输出 Token,Flash 费用约 1 元,Pro 约 3 元。这一规模同时处于 1M 上下文和 384K 最大输出限制内;1:3 的未缓存输入价差与输出价差,会在高频代码助手、批量自动化和多轮 Agent 中快速累积。
官方同时注明即将采用峰谷定价:北京时间 9:00—12:00、14:00—18:00 的高峰价格为平时两倍,具体执行时间以正式通知为准。因此,“高性价比”不应只看每百万 Token 单价,还要计算任务成功率、重试次数、缓存命中率和峰谷调度后的单个成功任务成本。
5.2 横向选择:Flash 不是所有任务的答案
| 场景 | 更适合的选择 | 原因 |
|---|---|---|
| IDE 代码助手、PR 修改、批量脚本 | V4-Flash 正式版 | 价格低、并发高、Responses API 与 Codex 已打通 |
| 终端型 Coding Agent | 先以 V4-Flash 做主路由 | Terminal Bench 2.1 表现突出,但需用自有 Harness 验证 |
| 极高难度、低频任务 | 保留 Pro 或其他前沿模型兜底 | Flash 的产品目标仍是效率,不能由部分 Benchmark 推导出全面领先 |
| APP / Web 普通对话 | 不受本次更新影响 | 0731 更新只覆盖 API 接口 |
| 要求可复现实验 | 优先公开集并自建评测 | 两项 DSBench 为内部测试集,无法独立复核 |
更务实的架构不是“全量押注一个模型”,而是让 Flash 承担高频主流任务,把失败重试、超高难任务和人工复核留给更昂贵的路径。V4-Flash 正式版真正改变的,是这条主路由的能力下限。
六、横纵交汇:模型竞争进入后训练与 Harness 阶段
纵向看,V4 的路线很清楚:4 月先用新注意力机制和 DSA 把 1M 上下文做成统一底座,7 月再通过后训练与 Agent Runtime 适配,把长上下文变成可执行的多步能力。结构没有变化而 Benchmark 大幅提高,说明“拥有知识和推理能力”与“稳定完成任务”之间,仍隔着工具协议、反馈纠错、任务终止和 Harness 设计。
横向看,Flash 与 Pro 的边界正在移动。Flash 仍以速度和成本为核心,但正式版已进入过去由高端模型占据的 Coding Agent 任务区。与此同时,官方测试使用特定 Harness 和max档位,内部基准又无法复现,这提醒团队不要把榜单直接等同于线上收益。
因此,V4-Flash 的战略价值不是“用小模型全面战胜大模型”,而是证明了一条更有工程意义的路线:用共享底座、精细后训练和协议适配,把足够强的模型做成高并发、低单价、可嵌入现有 Agent 工具链的生产入口。
七、总结
| 维度 | 核心结论 |
|---|---|
| 版本变化 | 结构和尺寸与 Preview 一致,主要变化来自重新后训练 |
| Agent 能力 | Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Toolathlon verified 为 70.3 |
| 接口能力 | 模型名为deepseek-v4-flash,支持 ChatCompletions、Anthropic 与 Responses API |
| 工程价值 | 1M 上下文、384K 最大输出、高并发和低价格适合代码助手主流流量 |
| 使用边界 | Benchmark 依赖 Harness 与参数,内部 DSBench 暂不可独立复现 |
| 上线策略 | 先用自有任务灰度回归,再按成功率、成本和风险进行分层路由 |
DeepSeek-V4-Flash 正式版最重要的信号,是 Agent 能力开始成为一个可以通过后训练系统性打磨的工程对象。对于代码助手团队,它确实提供了一个高性价比入口;但能否变成生产力,还取决于团队自己的 Harness、工具权限、回归集与成本治理。
参考资料:
- DeepSeek API 更新日志:DeepSeek-V4-Flash 更新
- DeepSeek-V4 预览版发布
- DeepSeek API 模型与价格
- DeepSeek Responses API 使用指南
- DeepSeek 接入 Codex 指南