近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化

近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化

近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化

主要信息源:DeepSeek API 官方更新日志、DeepSeek V4 官方发布页、模型与定价文档、Responses API 文档
关键词:DeepSeek V4、DeepSeek-V4-Flash-0731、AI Agent、Responses API、Codex、上下文缓存、API 迁移

2026 年 7 月 31 日,DeepSeek 将DeepSeek-V4-Flash正式版 API 开放公测。调用时仍然使用原来的模型名deepseek-v4-flash,但该别名目前已经指向DeepSeek-V4-Flash-0731

这次更新最容易产生的误解,是把它写成“DeepSeek V4 正式版全面发布”。官方更新日志给出的范围更窄:

  • 只升级了DeepSeek-V4-FlashAPI。
  • DeepSeek-V4-ProAPI 没有随本次更新改变。
  • DeepSeek App 和网页端模型没有随本次更新改变。
  • V4-Flash-0731 与 Flash Preview 的架构和模型规模相同,变化来自重新后训练。
  • DeepSeek-V4-Pro 正式版仍被描述为“即将发布”,官方没有在日志中给出确切日期。

因此,更准确的说法是:DeepSeek V4 系列完成了一次面向 Agent 与代码工作流的 Flash API 更新,而不是整个 V4 家族同时换代。

先把 V4、Flash 和 0731 的关系理顺

DeepSeek V4 Preview 最初于 2026 年 4 月 24 日发布。官方当时给出的两个版本分别是:

项目DeepSeek-V4-FlashDeepSeek-V4-Pro
总参数量284B1.6T
每 Token 激活参数量13B49B
API 模型名deepseek-v4-flashdeepseek-v4-pro
上下文长度1M Token1M Token
最大输出最高 384K Token最高 384K Token
Responses API支持暂不支持,官方称 2026 年 8 月上旬加入
7 月 31 日更新状态已升级至 V4-Flash-0731本次未更新

Flash 并不是 Pro 的简单量化版本。两者总参数量与激活参数量不同,面向的成本和吞吐目标也不同。V4-Flash 的 284B 总参数、13B 激活参数设计,更适合高并发 API 和代码 Agent;V4-Pro 则把更多模型容量留给复杂推理与高难度知识任务。

V4 在结构上使用 Token-wise Compression 与 DeepSeek Sparse Attention(DSA),目标是降低长上下文的计算和内存压力。官方把 1M Token 作为 V4 服务的标准上下文长度,但“窗口能装下 1M”不等于每个任务都应该塞满 1M。长输入仍然会增加首 Token 延迟、缓存依赖和失败重试成本。

这次不是扩模型,而是重新后训练

官方明确说明,V4-Flash-0731 保持了 Preview 的架构和规模,仅进行了重新后训练。

这句话很关键。Agent 能力并不只由预训练阶段的知识量决定,还依赖模型在后训练中学会怎样:

  1. 将一个长任务拆成可执行步骤。
  2. 根据工具返回值修正计划。
  3. 在多个文件和多轮工具调用之间保持任务状态。
  4. 发现测试失败后继续定位根因,而不是换一种措辞宣布完成。
  5. 生成符合工具 Schema 的参数,并处理异常、超时和空结果。

同一个底座经过不同的 Agent 轨迹、工具调用数据和强化学习训练,表现可能发生明显变化。这也是为什么 V4-Flash-0731 可以在不改变参数规模的情况下,把主要升级点放在代码 Agent、终端操作和自动化任务上。

官方 Agent 跑分提升了多少

DeepSeek 公布了 V4-Flash-0731 的九项 Agent 相关结果:

评测官方成绩主要方向
Terminal Bench 2.182.7终端环境中的多步任务
NL2Repo54.2从自然语言需求生成或修改代码仓库
CyberGym76.7网络安全环境任务
DeepSWE54.4软件工程 Agent
Toolathlon Verified70.3多工具调用
Agent Last Exam25.2综合 Agent 难题
Automation Bench(Public)25.1业务自动化
DSBench-FullStack68.7全栈开发,DeepSeek 内部集
DSBench-Hard59.6高难度代码 Agent,DeepSeek 内部集

官方称这些结果“远超 V4-Pro-Preview”,但更新日志没有在同一张表中列出 Pro Preview 的逐项分数,因此不能从公告直接计算每项提升百分比。

评测条件也需要一起阅读。公开代码 Agent 测试使用尚未发布的DeepSeek Harnessminimal 模式,推理强度为 max,top_p=0.95temperature=1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。

这带来三个限制:

  • Harness 尚未发布时,第三方无法完整复现官方运行方式。
  • 内部测试集缺少公开样本和独立提交结果,适合观察方向,不适合直接用于跨厂商排名。
  • max effort 的成绩不能代表默认设置下的延迟、Token 消耗和单位任务成本。

对开发团队来说,更可靠的验证方法是准备自己的 20~100 个真实任务,固定代码仓库版本、Prompt、工具权限、超时和最大尝试次数,同时记录一次成功率、平均 Token、测试通过率和人工返工时间。

Responses API 是本次更新的工程重点

V4-Flash-0731 原生支持 Responses API,并针对 Codex 做了适配。使用 OpenAI Python SDK 时,最小调用方式如下:

python-m venv.venv.venv\Scripts\Activate.ps1 python-m pip install--upgrade openai$env:DEEPSEEK_API_KEY="你的 API Key"
importosfromopenaiimportOpenAI client=OpenAI(api_key=os.environ["DEEPSEEK_API_KEY"],base_url="https://api.deepseek.com",)response=client.responses.create(model="deepseek-v4-flash",instructions=("你是代码分析助手。先定位根因和现有测试,""没有获得可复核证据时不要声称任务已经完成。"),input="检查任务队列为什么会重复消费,并给出最小修改方案。",max_output_tokens=4096,)print(response.output_text)print(response.usage)

模型名不需要添加-0731。继续使用deepseek-v4-flash,服务端就会路由到当前最新版本。这个方式便于无缝更新,但也意味着生产系统不能只记录模型别名:日志中最好同时保存请求时间、返回的实际模型版本和回归测试结果,否则同一份代码在不同日期可能得到不同表现。

“兼容 Responses API”不等于完整实现所有能力

DeepSeek 官方兼容性表列出了几项容易踩坑的差异:

  • API 当前是无状态的,不支持previous_response_idconversation
  • store固定为false,不提供服务端响应状态存储。
  • 支持函数工具和服务端网页搜索;Codex 兼容的自定义工具只支持名为apply_patch的类型。
  • file_searchcode_interpretercomputer_usemcp等内置工具会被忽略。
  • max_tool_calls会被忽略,应用必须自己限制工具调用次数。
  • 图片和文件输入尚不支持;传入后不会正常提供视觉或文件内容。
  • 超过上下文窗口不会自动截断,而是返回 400 错误。
  • 部分不支持的参数会被静默忽略,而不是直接报错。

最后一项尤其需要注意。请求成功只能说明接口接受了参数,不代表每个字段都生效。迁移现有 Responses API 客户端时,应根据官方兼容表逐项检查,而不是把“HTTP 200”当作兼容性测试完成。

流式响应也没有data: [DONE]结束标记。客户端应根据response.completedresponse.incompleteresponse.failed判断结束状态,并分别处理文本增量、推理内容、函数参数和最终 Usage。

旧模型名已经到迁移节点

V4 Preview 发布时,DeepSeek 宣布旧的deepseek-chatdeepseek-reasoner将在 2026 年 7 月 24 日 15:59(UTC)后退役。过渡期内,它们分别指向 V4-Flash 的非思考与思考模式。

现在已经超过官方给出的退役时间。新项目应直接使用:

deepseek-v4-flash deepseek-v4-pro

迁移时不要只做字符串替换,还要检查思考模式、最大输出、工具调用历史和错误处理。V4 同一模型支持思考与非思考模式,官方当前将思考模式列为默认模式;如果旧业务依赖deepseek-chat的短响应与较低 Token 消耗,应显式验证新默认行为。

价格很低,但缓存命中率会放大差距

官方价格页当前列出的单价如下,单位均为每 100 万 Token:

计费项V4-FlashV4-Pro
输入,缓存命中0.0028 美元0.003625 美元
输入,缓存未命中0.14 美元0.435 美元
输出0.28 美元0.87 美元
并发上限2500500

V4-Flash 的缓存命中输入价格只有未命中的 1/50。对于代码仓库、固定系统提示词和长工具定义,稳定前缀比反复压缩几百个 Token 更值得优化。

假设一次 Agent 任务使用 20 万输入 Token 和 2 万输出 Token:

情况计算估算费用
输入全部未命中缓存0.2 × $0.14 + 0.02 × $0.280.0336 美元
输入全部命中缓存0.2 × $0.0028 + 0.02 × $0.280.00616 美元

真实任务通常是部分命中,且工具返回内容、失败重试和推理 Token 都会改变费用。生产环境应记录input_tokens_details.cached_tokensoutput_tokens_details.reasoning_tokens,计算“每个成功任务成本”,而不只是每次请求成本。

价格页还预告了峰谷定价:每天北京时间 9:00~12:00、14:00~18:00 的所有计费项将按常规价格的 2 倍计费。但截至本次核对,官方尚未公布生效日期,因此不能把双倍价格写成已经实施。批处理系统可以提前预留调度开关,等官方确认生效后再避开峰值时段。

API 更新与新权重发布要分开看

4 月 24 日的 V4 Preview 公告提供了技术报告和开放权重集合。7 月 31 日的更新日志则明确讨论DeepSeek-V4-FlashAPI 公测,并称 0731 版本保持原架构和规模、仅重新后训练。

官方这次没有在更新日志中宣布新的 V4-Flash-0731 权重包。因此,可以确认的是线上 API 已升级,不能仅凭这份公告推导 0731 后训练权重已经同步开放。需要自托管的团队应以 DeepSeek 官方 Hugging Face 仓库中的具体模型卡、提交时间和许可证为准。

升级前可以做一轮小型回归

如果现有服务已经调用deepseek-v4-flash,代码可能不需要修改,但行为已经可能发生变化。上线前建议至少检查:

  1. 选取真实的代码修改、终端任务和工具调用轨迹建立固定测试集。
  2. 分别测试思考与非思考模式,并记录 Token 和延迟。
  3. 验证 JSON Schema、函数参数和多轮工具结果能否稳定回传。
  4. 在应用层限制工具次数、总耗时、写入路径和外部副作用。
  5. 测试超长输入、工具失败、流式中断和 400/429/5xx 的处理。
  6. 记录实际版本与请求时间,避免模型别名自动更新后无法定位回归。

V4-Flash-0731 的看点不是参数又变大了,而是 DeepSeek 试图用同一底座的后训练升级,换取更强的 Agent 执行能力,并通过 Responses API 进入现有代码代理工作流。

接下来更值得关注的,是 DeepSeek Harness 能否按承诺开放、公开测试能否复现官方成绩、V4-Pro 正式版何时发布,以及 0731 后训练权重是否会同步提供。对开发者而言,在这些信息落地以前,最有价值的动作仍然是用自己的任务集做回归,而不是只根据一张跑分表决定全量迁移。

参考资料

  • DeepSeek API:Change Log,DeepSeek-V4-Flash Update,2026-07-31
    https://api-docs.deepseek.com/updates
  • DeepSeek API:DeepSeek V4 Preview Release,2026-04-24
    https://api-docs.deepseek.com/news/news260424
  • DeepSeek API:Models & Pricing
    https://api-docs.deepseek.com/quick_start/pricing
  • DeepSeek API:Your First API Call
    https://api-docs.deepseek.com/
  • DeepSeek API:Using the Responses API
    https://api-docs.deepseek.com/guides/responses_api
  • DeepSeek API:Thinking Mode
    https://api-docs.deepseek.com/guides/thinking_mode
  • DeepSeek:V4 官方开放权重集合
    https://huggingface.co/collections/deepseek-ai/deepseek-v4