DeepSeek V4-Flash GA: benchmarks de agente, Responses API e o que não mudou
Snapshot 2026-07-31: a GA do V4-Flash traz ganhos grandes em benchmarks de agente, Responses API nativo e adaptação para Codex — mas é a mesma arquitetura do preview, só re-treinada. Como ler os números.
Em 31 de julho de 2026, a DeepSeek levou o V4-Flash ao endpoint GA da API (anunciado como beta público). A nota começa com benchmarks de agente que ficam bem acima dos números do V4-Pro-Preview que acompanhávamos antes, além de duas mudanças de integração que importam mais que as notas: suporte nativo a Responses API e uma adaptação específica para Codex.
A parte que deveria te impedir de se empolgar: o V4-Flash-0731 tem o mesmo tamanho e a mesma estrutura do V4-Flash-preview, só que foi re-treinado. Isso não é arquitetura nova; é o mesmo modelo com pesos ajustados. A outra letra miúda: só a API do V4-Flash mudou — a API do V4-Pro e os modelos de APP/WEB ficaram intocados, e a DeepSeek diz que a GA do V4-Pro "virá em breve".
O que o anúncio realmente mudou
| Área | Antes (preview) | GA (2026-07-31) |
|---|---|---|
| Model ID | deepseek-v4-flash | O mesmo; deepseek-chat / deepseek-reasoner aposentados em 2026-07-24 |
| Arquitetura | V4-Flash-preview | Mesmo tamanho e estrutura, só re-treinado |
| Responses API | Não citado na nota | Suporte nativo |
| Codex | Chamada de ferramenta genérica | Adaptado para Codex |
| API V4-Pro / APP / WEB | Atuais | Inalterados |
Um detalhe para você conferir do seu lado: os aliases antigos deepseek-chat e deepseek-reasoner estavam previstos para sair três meses depois do lançamento do V4, por volta de 2026-07-24. Se seu CI ainda aponta para qualquer um dos dois, esta nota é o lembrete de migrar para o model ID explícito antes de as retentativas começarem a falhar.
A tabela de benchmarks de agente (leia em duas metades)
A DeepSeek reporta nove notas, divididas entre conjuntos públicos e internos:
| Benchmark | Nota | Origem |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | Pública |
| NL2Repo | 54.2 | Pública |
| Cybergym | 76.7 | Pública |
| DeepSWE | 54.4 | Pública |
| Toolathlon verified | 70.3 | Pública |
| Agent Last Exam | 25.2 | Pública |
| Automation Bench (Public) | 25.1 | Pública |
| DSBench-FullStack | 68.7 | Interna |
| DSBench-Hard | 59.6 | Interna |
Leitura da DevCove: as tarefas públicas rodaram no DeepSeek Harness em modo mínimo (ainda não lançado), no tier
max, comtopp=0.95etemperature=1.0. Um harness que sai depois da nota é sinal de alerta para quem compra: alinhe o harness, não o número.
Os primeiros sete são reproduzíveis em conjuntos públicos, então a verificação independente fica possível quando o harness for lançado. Os dois últimos — DSBench-FullStack (desenvolvimento full-stack) e DSBench-Hard (problemas difíceis de Coding Agent) — são internos e não dá para conferir de fora. Trate como direcional, não como evidência.
O que não faremos com esses números
- Não vamos chamar o V4-Flash de "melhor modelo de agente" por causa de uma tabela de fornecedor; a mesma regra de Como escolher modelos de AI coding para projetos reais vale — data do snapshot, harness e composição das tarefas primeiro.
- Não vamos trocar de modelo só porque o título diz "bem acima do V4-Pro-Preview". Preview versus GA é uma comparação injusta; compare com o que você realmente roda hoje.
- Não vamos supor que a adaptação para Codex é zero config. A nota aponta para uma doc de configuração do Codex; isso é um passo real de configuração e fica fora do nosso ship checklist até rodarmos por conta própria.
Jeito rápido de confirmar o endpoint GA
Mande um request mínimo para sua base URL atual com o model ID explícito (use um placeholder, nunca uma chave real):
curl -s https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'
Se o deepseek-chat antigo der erro enquanto o deepseek-v4-flash responder, você está no endpoint GA. O base_url no seu SDK permanece o mesmo — a DeepSeek o manteve estável.
Resumo
O que exige ação é Responses API + suporte a Codex e o detalhe de só re-treinamento; a dispersão de benchmarks é contexto até um harness publicado permitir reproduzir. Se seu time já usa DeepSeek via deepseek-v4-flash, confira a doc do Codex e saia dos aliases aposentados. Se você está no V4-Pro, nada mudou para você ainda — espere a nota da GA em vez de planejar uma migração hoje.
Relacionados: Rankings de modelos de AI coding · Tiers do Claude Opus 5 · Kimi K3 para agentes de código · Gates de verificação para agentes de código
Fonte: changelog da API DeepSeek, 2026-07-31 (api-docs.deepseek.com/zh-cn/updates); confirme na página oficial antes de produção.