DeepSeek V4-Flash 正式版:エージェントベンチが急伸、だがモデルは変わっていない
2026-07-31 スナップショット:V4-Flash 正式版 API が公開ベータに。エージェントベンチは preview を大きく上回り、Responses API ネイティブ対応と Codex 向け最適化も。ただし構造は preview と同じで、再学習のみ。
2026-07-31、DeepSeek は V4-Flash を正式版 API エンドポイント(公開ベータと案内)に移しました。更新ログの冒頭はエージェントベンチで、これまで追ってきた V4-Pro-Preview の数値を大きく上回る 結果です。それ以上に注目すべき統合変更が二つあります。Responses API のネイティブ対応と、Codex 向けの最適化です。
先に冷静になるための一行を。V4-Flash-0731 のモデル構造とサイズは V4-Flash-preview と同じで、再学習されただけです。 新アーキテクチャではなく、同じモデルに調整済みの重みを載せたもの。もう一つの小さな字も重要です。変わったのは V4-Flash の API だけ で、V4-Pro API と APP/WEB のモデルは無傷。DeepSeek は V4-Pro 正式版も「まもなく」としています。
この告知で実際に変わったこと
| 項目 | 変更前(preview) | 正式版(2026-07-31) |
|---|---|---|
| モデル ID | deepseek-v4-flash | 同じ。deepseek-chat / deepseek-reasoner は 2026-07-24 に退役 |
| アーキテクチャ | V4-Flash-preview | 同じサイズ・構造、再学習のみ |
| Responses API | 告知には記載なし | ネイティブ対応 |
| Codex | 汎用ツール呼び出し | Codex 向けに最適化 |
| V4-Pro API / APP / WEB | 現状のまま | 変更なし |
ご自身でも確認したい点が一つ。旧エイリアス deepseek-chat と deepseek-reasoner は V4 リリースの 3 か月後、2026-07-24 頃に廃止予定でした。CI がどちらかを指したままだと、この告知は明示的なモデル ID への移行のリマインドです。リトライがエラーになり始める前に済ませましょう。
エージェントベンチの表(2 つに分けて読む)
DeepSeek は 9 件のスコアを公表し、公開と内部の 2 セットに分かれます。
| ベンチマーク | スコア | 出所 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 公開 |
| NL2Repo | 54.2 | 公開 |
| Cybergym | 76.7 | 公開 |
| DeepSWE | 54.4 | 公開 |
| Toolathlon verified | 70.3 | 公開 |
| Agent Last Exam | 25.2 | 公開 |
| Automation Bench (Public) | 25.1 | 公開 |
| DSBench-FullStack | 68.7 | 内部 |
| DSBench-Hard | 59.6 | 内部 |
DevCove の見解: 公開タスクは DeepSeek Harness ミニマルモード(未公開) で、
maxティア、topp=0.95、temperature=1.0で実行されました。ハーネスがスコアより後に公開されるのは、調達の警告サインです。数値より先にハーネスを合わせてください。
最初の 7 件は公開データセットで再現可能なため、ハーネスが公開されれば独立した検証が可能になります。最後の 2 件 — DSBench-FullStack(フルスタック開発)と DSBench-Hard(難しい Coding Agent 問題)— は内部セットで、外部からは確認できません。方向性の参考に留め、証拠としては扱わないでください。
この数値でやらないこと
- ベンダーの表 1 枚で V4-Flash を「最強のエージェントモデル」とは呼びません。実プロジェクトのための AI コーディングモデルの選び方 のルールがそのまま当てはまります。スナップショット日付、ハーネス、タスク構成が先です。
- 「V4-Pro-Preview を大幅に上回る」という見出しだけでモデルを乗り換えません。preview 対 正式版は不公平な比較です。今実際に使っているものと比べてください。
- Codex 対応がゼロコンフィグだとは決めつけません。告知が指す専用の Codex 設定ドキュメント があり、これは実際の設定手順です。自分たちで一度動かすまで、ship checklist には入れません。
正式版エンドポイントの確認方法
既存の base URL に、明示的なモデル ID で最小リクエストを送ります(プレースホルダーキーを使い、本物のキーは入れない):
curl -s https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'
旧 deepseek-chat がエラーになり、deepseek-v4-flash が応答するなら、正式版エンドポイント上にいます。SDK の base_url は変更不要です。DeepSeek はそのまま維持しています。
まとめ
行動すべきは Responses API + Codex 対応 と 再学習のみ の 2 点。ベンチのばらつきは、公開ハーネスで再現できるようになるまでは文脈情報です。すでに deepseek-v4-flash で DeepSeek を使っているなら、Codex ドキュメントを確認し、退役したエイリアスから移行しましょう。V4-Pro を使っている場合は、今回は何も変わりません。今日中に移行を計画せず、正式版の告知を待ってください。
関連:AI コーディングモデルランキング · Claude Opus 5 のティア · Kimi K3 とコーディングエージェント · AI コーディングエージェントの検証ゲート
出典: DeepSeek API 更新ログ 2026-07-31(api-docs.deepseek.com/zh-cn/updates)。本番投入前には公式ページで再確認してください。