DeepSeek V4-Flash 正式版上线:Agent 分数大涨,但模型没换

2026-07-31 快照:DeepSeek V4-Flash 正式版 API 公测,Agent 基准远超 preview、原生支持 Responses API 并适配 Codex;模型结构与 preview 一致、只重做了后训练。怎么读这些数。

2026-07-31,DeepSeek 把 V4-Flash 正式版 API 上线公测。更新日志开头先给 Agent 基准,说这批分数「远超 V4-Pro-Preview」;后面两个集成改动比分数更值得注意:原生支持 Responses API,并针对 Codex 做了适配。

先别急着激动,有一句要划重点:V4-Flash-0731 的模型结构、尺寸和 V4-Flash-preview 完全一致,只是重新做了后训练。 这不是新架构,是同一个模型换了套调好的权重。另一句小字也重要:这次只升级了 V4-Flash 的 API 接口,V4-Pro API 和 APP/WEB 端模型都没动,官方说 V4-Pro 正式版「尽快发布」。

这次公告实际改了什么

项目之前(preview)正式版(2026-07-31)
模型 IDdeepseek-v4-flash不变;deepseek-chat / deepseek-reasoner 已于 2026-07-24 停用
架构V4-Flash-preview结构与尺寸不变,仅重新后训练
Responses API公告里没提原生支持
Codex通用工具调用针对性适配
V4-Pro API / APP / WEB维持现状未改动

有一件事建议你自己查一下:旧别名 deepseek-chatdeepseek-reasoner 原本计划在 V4 上线三个月后(约 2026-07-24)停用。如果你的 CI 还在用这两个名字,这次公告就是提醒你改成显式模型 ID,别等重试开始报错。

Agent 基准表(分两半读)

DeepSeek 报了九个分数,分成公开内部两套:

基准分数来源
Terminal Bench 2.182.7公开
NL2Repo54.2公开
Cybergym76.7公开
DeepSWE54.4公开
Toolathlon verified70.3公开
Agent Last Exam25.2公开
Automation Bench (Public)25.1公开
DSBench-FullStack68.7内部
DSBench-Hard59.6内部

DevCove 看法: 公开任务的分数是在 DeepSeek Harness 极简模式(尚未发布) 里跑的,max 档、topp=0.95temperature=1.0。评测用的 harness 比分数晚发布,对采购是个警示:先对齐 harness,别只对齐数字。

前七个是公开数据集,等 harness 发布后可以独立复现;后两个——DSBench-FullStack(全栈开发)和 DSBench-Hard(Coding Agent 难题)——是内部集,外部没法核对。当方向看,别当证据。

我们不会拿这些数字做什么

  • 不会因为一张厂商表就把 V4-Flash 叫「最强 agent 模型」;如何为真实项目选择 AI 编程模型 的规则照样适用——先看快照日期、harness 和任务构成。
  • 不会因为 headline 写「远超 V4-Pro-Preview」就换模型。preview 对比正式版本来就不公平;要比就跟你现在实际在跑的那个比。
  • 不会假设 Codex 适配是零配置。官方给了一份专门的 Codex 配置文档,那是真实配置步骤;在我们自己跑通之前,它进不了 上线检查清单

快速确认正式版接口

拿现有 base URL 发一个最小请求,模型名写全(用占位 key,别写真 key):

curl -s https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'

如果 deepseek-chat 已经开始报错、而 deepseek-v4-flash 正常返回,说明已经在正式版接口上。SDK 里的 base_url 不用改——DeepSeek 保持不变。

结论

该行动的是 Responses API + Codex 支持仅重做后训练 这两点;基准分数在 harness 发布、能复现之前,只当背景信息。团队已经在用 deepseek-v4-flash 的话,去看 Codex 文档、把退役的别名迁走;还在用 V4-Pro 的话,这次什么都没变——等正式版公告,别急着今天就做迁移。

相关:AI 编程模型排名 · Claude Opus 5 怎么选档 · Kimi K3 上生产 · AI 编程 Agent 的验证关卡

来源: DeepSeek API 更新日志 2026-07-31(api-docs.deepseek.com/zh-cn/updates);上线前以官方实时页面为准。

专题阅读

相关文章

完整指南如何为真实项目选择 AI 编程模型正确使用公开模型排行榜,不要把 benchmark 分数当成永久的编码质量结论。了解 Artificial Analysis 各项指标对成本、延迟、上下文和真实交付意味着什么。Claude Opus 5 怎么选档:别为榜单第一白付 max 的钱Opus 5 是一档一档的推理阶梯,不是单一模型。对照 DevCove 2026-07-25 快照,把 max/high/medium 对上真实仓库任务。Kimi K3 上生产:先修 agent 环,再谈模型K3 上线首先是 harness:写权限、1M 上下文喂什么、合并前门禁——不是再写一篇 benchmark 通稿。AI 编程 Agent 需要验证关卡,而不只是更好的 PromptAI 编程 Agent 可以生成比自动补全更大的补丁,但生产团队需要围绕输出建立测试、审查、沙箱和发布关卡。

相关工具

使用本文提到的工具

AI 编程上线检查清单AI coding checklist / AI app launch checklist / vibe coding checklist

继续学习相关格式

开发者 AI 基础课程面向开发者工作流的 AI 实用基础:模型、提示词、编程助手、结果验证、隐私与可靠协作。

返回文章列表