DeepSeek V4-Flash GA: benchmarks de agente, Responses API e o que não mudou

Snapshot 2026-07-31: a GA do V4-Flash traz ganhos grandes em benchmarks de agente, Responses API nativo e adaptação para Codex — mas é a mesma arquitetura do preview, só re-treinada. Como ler os números.

Em 31 de julho de 2026, a DeepSeek levou o V4-Flash ao endpoint GA da API (anunciado como beta público). A nota começa com benchmarks de agente que ficam bem acima dos números do V4-Pro-Preview que acompanhávamos antes, além de duas mudanças de integração que importam mais que as notas: suporte nativo a Responses API e uma adaptação específica para Codex.

A parte que deveria te impedir de se empolgar: o V4-Flash-0731 tem o mesmo tamanho e a mesma estrutura do V4-Flash-preview, só que foi re-treinado. Isso não é arquitetura nova; é o mesmo modelo com pesos ajustados. A outra letra miúda: só a API do V4-Flash mudou — a API do V4-Pro e os modelos de APP/WEB ficaram intocados, e a DeepSeek diz que a GA do V4-Pro "virá em breve".

O que o anúncio realmente mudou

ÁreaAntes (preview)GA (2026-07-31)
Model IDdeepseek-v4-flashO mesmo; deepseek-chat / deepseek-reasoner aposentados em 2026-07-24
ArquiteturaV4-Flash-previewMesmo tamanho e estrutura, só re-treinado
Responses APINão citado na notaSuporte nativo
CodexChamada de ferramenta genéricaAdaptado para Codex
API V4-Pro / APP / WEBAtuaisInalterados

Um detalhe para você conferir do seu lado: os aliases antigos deepseek-chat e deepseek-reasoner estavam previstos para sair três meses depois do lançamento do V4, por volta de 2026-07-24. Se seu CI ainda aponta para qualquer um dos dois, esta nota é o lembrete de migrar para o model ID explícito antes de as retentativas começarem a falhar.

A tabela de benchmarks de agente (leia em duas metades)

A DeepSeek reporta nove notas, divididas entre conjuntos públicos e internos:

BenchmarkNotaOrigem
Terminal Bench 2.182.7Pública
NL2Repo54.2Pública
Cybergym76.7Pública
DeepSWE54.4Pública
Toolathlon verified70.3Pública
Agent Last Exam25.2Pública
Automation Bench (Public)25.1Pública
DSBench-FullStack68.7Interna
DSBench-Hard59.6Interna

Leitura da DevCove: as tarefas públicas rodaram no DeepSeek Harness em modo mínimo (ainda não lançado), no tier max, com topp=0.95 e temperature=1.0. Um harness que sai depois da nota é sinal de alerta para quem compra: alinhe o harness, não o número.

Os primeiros sete são reproduzíveis em conjuntos públicos, então a verificação independente fica possível quando o harness for lançado. Os dois últimos — DSBench-FullStack (desenvolvimento full-stack) e DSBench-Hard (problemas difíceis de Coding Agent) — são internos e não dá para conferir de fora. Trate como direcional, não como evidência.

O que não faremos com esses números

  • Não vamos chamar o V4-Flash de "melhor modelo de agente" por causa de uma tabela de fornecedor; a mesma regra de Como escolher modelos de AI coding para projetos reais vale — data do snapshot, harness e composição das tarefas primeiro.
  • Não vamos trocar de modelo só porque o título diz "bem acima do V4-Pro-Preview". Preview versus GA é uma comparação injusta; compare com o que você realmente roda hoje.
  • Não vamos supor que a adaptação para Codex é zero config. A nota aponta para uma doc de configuração do Codex; isso é um passo real de configuração e fica fora do nosso ship checklist até rodarmos por conta própria.

Jeito rápido de confirmar o endpoint GA

Mande um request mínimo para sua base URL atual com o model ID explícito (use um placeholder, nunca uma chave real):

curl -s https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'

Se o deepseek-chat antigo der erro enquanto o deepseek-v4-flash responder, você está no endpoint GA. O base_url no seu SDK permanece o mesmo — a DeepSeek o manteve estável.

Resumo

O que exige ação é Responses API + suporte a Codex e o detalhe de só re-treinamento; a dispersão de benchmarks é contexto até um harness publicado permitir reproduzir. Se seu time já usa DeepSeek via deepseek-v4-flash, confira a doc do Codex e saia dos aliases aposentados. Se você está no V4-Pro, nada mudou para você ainda — espere a nota da GA em vez de planejar uma migração hoje.

Relacionados: Rankings de modelos de AI coding · Tiers do Claude Opus 5 · Kimi K3 para agentes de código · Gates de verificação para agentes de código

Fonte: changelog da API DeepSeek, 2026-07-31 (api-docs.deepseek.com/zh-cn/updates); confirme na página oficial antes de produção.

Neste tópico

Artigos relacionados

Guia completoComo escolher modelos de AI coding para projetos reaisUse rankings públicos de modelos sem confundir pontuações de benchmark com qualidade permanente de código. Entenda o que as métricas da Artificial Analysis significam para custo, latência, contexto e entrega real.Claude Opus 5 no código: tiers, latência e quando descer de nívelOpus 5 é uma escada de tiers, não um modelo só. Use o snapshot DevCove 2026-07-25 para casar max, high ou medium ao seu repo — e pare de pagar preço max em trabalho de autocomplete.Kimi K3 para agentes de código: harness, contexto e verificaçãoK3 em produção é problema de harness primeiro: permissões, o que você injeta no contexto de 1M e gates antes do merge — não mais um recap de benchmark.Agentes de programação com IA precisam de gates de verificação, não só prompts melhoresAgentes de programação com IA podem escrever patches maiores que autocomplete, mas times de produção precisam de testes, revisão, sandbox e gates de release.

Ferramentas relacionadas

Use as ferramentas deste artigo

Checklist de lançamento para AI CodingAI coding checklist / AI app launch checklist / vibe coding checklist

Aprenda o formato

Alfabetização em IA para desenvolvedoresFundamentos práticos de IA para fluxos de desenvolvedores: modelos, prompts, assistentes de código, verificação, privacidade e trabalho assistido por IA.

Voltar aos artigos