DeepSeek V4-Flash GA: benchmarks de agente, Responses API y lo que no cambió
Snapshot 2026-07-31: la GA de V4-Flash trae grandes avances en benchmarks de agente, Responses API nativo y adaptación a Codex — pero es la misma arquitectura del preview, solo re-entrenada. Cómo leer los números.
El 31 de julio de 2026, DeepSeek llevó V4-Flash a su endpoint GA de API (anunciado como beta público). La nota arranca con benchmarks de agente que quedan muy por encima de los números de V4-Pro-Preview que seguíamos antes, más dos cambios de integración que importan más que las notas: soporte nativo a Responses API y una adaptación específica para Codex.
Lo que debería frenarte antes de emocionarte: el V4-Flash-0731 tiene el mismo tamaño y la misma estructura que el V4-Flash-preview, solo que fue re-entrenado. Esto no es arquitectura nueva; es el mismo modelo con pesos ajustados. La otra letra chica: solo cambió la API de V4-Flash — la API de V4-Pro y los modelos de APP/WEB quedaron intactos, y DeepSeek dice que la GA de V4-Pro "llegará pronto".
Qué cambió realmente con el anuncio
| Área | Antes (preview) | GA (2026-07-31) |
|---|---|---|
| Model ID | deepseek-v4-flash | El mismo; deepseek-chat / deepseek-reasoner retirados el 2026-07-24 |
| Arquitectura | V4-Flash-preview | Mismo tamaño y estructura, solo re-entrenado |
| Responses API | No se mencionaba | Soporte nativo |
| Codex | Tool calling genérico | Adaptado a Codex |
| API V4-Pro / APP / WEB | Actuales | Sin cambios |
Un detalle para que revises por tu cuenta: los aliases viejos deepseek-chat y deepseek-reasoner estaban previstos para salir tres meses después del lanzamiento de V4, alrededor del 2026-07-24. Si tu CI sigue apuntando a cualquiera de los dos, esta nota es el recordatorio de migrar al model ID explícito antes de que los reintentos empiecen a fallar.
La tabla de benchmarks de agente (léela en dos mitades)
DeepSeek reporta nueve notas, divididas entre conjuntos públicos e internos:
| Benchmark | Nota | Origen |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | Público |
| NL2Repo | 54.2 | Público |
| Cybergym | 76.7 | Público |
| DeepSWE | 54.4 | Público |
| Toolathlon verified | 70.3 | Público |
| Agent Last Exam | 25.2 | Público |
| Automation Bench (Public) | 25.1 | Público |
| DSBench-FullStack | 68.7 | Interno |
| DSBench-Hard | 59.6 | Interno |
Lectura de DevCove: las tareas públicas corrieron en el DeepSeek Harness en modo mínimo (aún no lanzado), en el tier
max, contopp=0.95ytemperature=1.0. Un harness que sale después que la nota es señal de alerta para compras: alinea el harness, no el número.
Los primeros siete son reproducibles en conjuntos públicos, así que la verificación independiente será posible cuando se lance el harness. Los dos últimos — DSBench-FullStack (desarrollo full-stack) y DSBench-Hard (problemas difíciles de Coding Agent) — son internos y no se pueden comprobar desde afuera. Trátalos como direccional, no como evidencia.
Lo que no haremos con estos números
- No llamaremos a V4-Flash "el mejor modelo de agente" por una tabla de vendor; vale la misma regla de Cómo elegir modelos de AI coding para proyectos reales — primero fecha del snapshot, harness y composición de tareas.
- No cambiaremos de modelo solo porque el titular diga "muy por encima de V4-Pro-Preview". Preview versus GA es una comparación injusta; compara contra lo que realmente corres hoy.
- No asumiremos que la adaptación a Codex es cero configuración. La nota apunta a una doc de configuración de Codex; es un paso real y queda fuera de nuestro ship checklist hasta que lo probemos nosotros mismos.
Forma rápida de confirmar el endpoint GA
Manda un request mínimo a tu base URL actual con el model ID explícito (usa un placeholder, nunca una key real):
curl -s https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'
Si el deepseek-chat viejo ya da error y deepseek-v4-flash responde, estás en el endpoint GA. El base_url de tu SDK queda igual — DeepSeek lo mantuvo estable.
Conclusión
Lo que exige acción es Responses API + soporte a Codex y el detalle de solo re-entrenamiento; la dispersión de benchmarks es contexto hasta que un harness publicado permita reproducirla. Si tu equipo ya usa DeepSeek vía deepseek-v4-flash, revisa la doc de Codex y sal de los aliases retirados. Si estás en V4-Pro, nada cambió para ti todavía — espera la nota de GA en vez de planear una migración hoy.
Relacionados: Rankings de modelos de AI coding · Tiers de Claude Opus 5 · Kimi K3 para agentes de código · Puertas de verificación para agentes de código
Fuente: changelog de la API DeepSeek, 2026-07-31 (api-docs.deepseek.com/zh-cn/updates); confirma en la página oficial antes de producción.