DeepSeek V4-Flash GA: benchmarks de agente, Responses API y lo que no cambió

Snapshot 2026-07-31: la GA de V4-Flash trae grandes avances en benchmarks de agente, Responses API nativo y adaptación a Codex — pero es la misma arquitectura del preview, solo re-entrenada. Cómo leer los números.

El 31 de julio de 2026, DeepSeek llevó V4-Flash a su endpoint GA de API (anunciado como beta público). La nota arranca con benchmarks de agente que quedan muy por encima de los números de V4-Pro-Preview que seguíamos antes, más dos cambios de integración que importan más que las notas: soporte nativo a Responses API y una adaptación específica para Codex.

Lo que debería frenarte antes de emocionarte: el V4-Flash-0731 tiene el mismo tamaño y la misma estructura que el V4-Flash-preview, solo que fue re-entrenado. Esto no es arquitectura nueva; es el mismo modelo con pesos ajustados. La otra letra chica: solo cambió la API de V4-Flash — la API de V4-Pro y los modelos de APP/WEB quedaron intactos, y DeepSeek dice que la GA de V4-Pro "llegará pronto".

Qué cambió realmente con el anuncio

ÁreaAntes (preview)GA (2026-07-31)
Model IDdeepseek-v4-flashEl mismo; deepseek-chat / deepseek-reasoner retirados el 2026-07-24
ArquitecturaV4-Flash-previewMismo tamaño y estructura, solo re-entrenado
Responses APINo se mencionabaSoporte nativo
CodexTool calling genéricoAdaptado a Codex
API V4-Pro / APP / WEBActualesSin cambios

Un detalle para que revises por tu cuenta: los aliases viejos deepseek-chat y deepseek-reasoner estaban previstos para salir tres meses después del lanzamiento de V4, alrededor del 2026-07-24. Si tu CI sigue apuntando a cualquiera de los dos, esta nota es el recordatorio de migrar al model ID explícito antes de que los reintentos empiecen a fallar.

La tabla de benchmarks de agente (léela en dos mitades)

DeepSeek reporta nueve notas, divididas entre conjuntos públicos e internos:

BenchmarkNotaOrigen
Terminal Bench 2.182.7Público
NL2Repo54.2Público
Cybergym76.7Público
DeepSWE54.4Público
Toolathlon verified70.3Público
Agent Last Exam25.2Público
Automation Bench (Public)25.1Público
DSBench-FullStack68.7Interno
DSBench-Hard59.6Interno

Lectura de DevCove: las tareas públicas corrieron en el DeepSeek Harness en modo mínimo (aún no lanzado), en el tier max, con topp=0.95 y temperature=1.0. Un harness que sale después que la nota es señal de alerta para compras: alinea el harness, no el número.

Los primeros siete son reproducibles en conjuntos públicos, así que la verificación independiente será posible cuando se lance el harness. Los dos últimos — DSBench-FullStack (desarrollo full-stack) y DSBench-Hard (problemas difíciles de Coding Agent) — son internos y no se pueden comprobar desde afuera. Trátalos como direccional, no como evidencia.

Lo que no haremos con estos números

  • No llamaremos a V4-Flash "el mejor modelo de agente" por una tabla de vendor; vale la misma regla de Cómo elegir modelos de AI coding para proyectos reales — primero fecha del snapshot, harness y composición de tareas.
  • No cambiaremos de modelo solo porque el titular diga "muy por encima de V4-Pro-Preview". Preview versus GA es una comparación injusta; compara contra lo que realmente corres hoy.
  • No asumiremos que la adaptación a Codex es cero configuración. La nota apunta a una doc de configuración de Codex; es un paso real y queda fuera de nuestro ship checklist hasta que lo probemos nosotros mismos.

Forma rápida de confirmar el endpoint GA

Manda un request mínimo a tu base URL actual con el model ID explícito (usa un placeholder, nunca una key real):

curl -s https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'

Si el deepseek-chat viejo ya da error y deepseek-v4-flash responde, estás en el endpoint GA. El base_url de tu SDK queda igual — DeepSeek lo mantuvo estable.

Conclusión

Lo que exige acción es Responses API + soporte a Codex y el detalle de solo re-entrenamiento; la dispersión de benchmarks es contexto hasta que un harness publicado permita reproducirla. Si tu equipo ya usa DeepSeek vía deepseek-v4-flash, revisa la doc de Codex y sal de los aliases retirados. Si estás en V4-Pro, nada cambió para ti todavía — espera la nota de GA en vez de planear una migración hoy.

Relacionados: Rankings de modelos de AI coding · Tiers de Claude Opus 5 · Kimi K3 para agentes de código · Puertas de verificación para agentes de código

Fuente: changelog de la API DeepSeek, 2026-07-31 (api-docs.deepseek.com/zh-cn/updates); confirma en la página oficial antes de producción.

In this topic

Related articles

Complete guideCómo elegir modelos de AI coding para proyectos realesUsa los leaderboards públicos de modelos sin confundir puntuaciones de benchmark con calidad de código permanente. Aprende qué significan las métricas de Artificial Analysis para costo, latencia, contexto y entrega real.Claude Opus 5 para código: tiers, latencia y cuándo bajar de nivelOpus 5 es una escalera de tiers, no un solo modelo. Usa el snapshot DevCove 2026-07-25 para alinear max, high o medium con tu repo — y deja de pagar precio max por trabajo de autocompletado.Kimi K3 para agentes de código: harness, contexto y verificaciónK3 en producción es primero un problema de harness: permisos, qué metes en el contexto de 1M y gates antes del merge — no otro resumen de benchmark.Los agentes de código con IA necesitan puertas de verificación, no solo mejores promptsLos agentes de código con IA pueden escribir parches más grandes que las herramientas de autocompletado, pero los equipos en producción necesitan pruebas, revisión, sandboxing y puertas de release alrededor de su salida.

Herramientas relacionadas

Usa las herramientas de este artículo

Checklist de lanzamiento para AI CodingAI coding checklist / AI app launch checklist / vibe coding checklist

Cursos relacionados

curso de alfabetización en IA para desarrolladoresQué aprenderás en este curso práctico de alfabetización en IA para desarrolladores.

Volver a artículos