Claude Opus 5 para código: tiers, latencia y cuándo bajar de nivel

Opus 5 es una escalera de tiers, no un solo modelo. Usa el snapshot DevCove 2026-07-25 para alinear max, high o medium con tu repo — y deja de pagar precio max por trabajo de autocompletado.

El trimestre pasado alguien pegó nuestro memo interno en una diapositiva: «Por defecto Opus 5 max — rank #1 en Artificial Analysis.» Finanzas vio la partida antes de que ingeniería sintiera la latencia. Anthropic no lanzó un solo Opus 5; lanzó peldaños en una escalera — max, xhigh, high, medium, low — cada uno con distinto retraso del primer chunk y costo por tarea en el mismo leaderboard público.

Este artículo va para quien elige el modelo por defecto en Claude Code o la API. Los números salen del snapshot 2026-07-25 de los rankings de modelos de AI coding de DevCove (fuente Artificial Analysis). Pueden cambiar; revisa siempre la fecha en la página de rankings antes de copiar una slide.

Qué se rompió en nuestro modelo mental

Tratábamos el Intelligence Index como GHz de CPU: más alto siempre mejor para código. En el snapshot, Opus 5 max lidera con 61, pero su primer chunk tarda ~64s en el harness de benchmark. Opus 5 medium queda en 56 con ~5,6s de primer chunk. Para quien espera en el IDE, esa brecha es el producto — no una nota al pie.

ErrorLo que pasa en la práctica
Max en cada refactorPagas el tier top por diffs que medium pasaría con los mismos tests
Medium en una migración cross-serviceAhorras en modelo y lo gastas en reparación humana cuando el plano fue fino
Ignorar el tier en comprasUn nombre de SKU esconde cinco facturas de latencia distintas

Cómo leemos snapshots: el Index ordena tareas de benchmark, no tu monorepo. Cruza la tabla con una prueba acotada y el ship checklist.

Escalera de tiers (snapshot 2026-07-25)

Abre Artificial Analysis para la metodología cruda. DevCove guarda estos campos para SKUs Opus 5:

TierRankIndexCosto / tareaPrimer chunkRespuesta totalCuándo compensa
max161$2.0364.52s73.64sPlan nocturno, prep de review de alto riesgo
xhigh260$1.5638.85s48.54sPaso de plano antes de un tier más barato en ejecución
high559$1.0624.94s33.37sLoops diarios de agente que aún necesitan razonamiento fuerte
medium856$0.625.63s15.52sChat interactivo, edits pequeños y acotados
lowConfirma el SKU en la doc del vendor antes de fiarte de la tabla

Claude Fable 5 (index 60, rank #3) es línea hermana, no «Opus lite». El mismo snapshot muestra ~110s de primer chunk — bien para lecturas profundas, duro para pair programming.

TCO: dónde max gana o pierde en silencio

Costo por tarea es una mezcla del snapshot, no tu factura. Aun así deja ver un patrón:

Factura mensual de modelo
│
├─ 70% de llamadas = "fix lint / tweak copy / diff pequeño"
│     └─ NO debería ser max → medium/high
│
├─ 20% = feature multi-archivo con tests
│     └─ high por defecto; xhigh si el plano falló una vez
│
└─ 10% = migración / apuesta de arquitectura
      └─ xhigh o max solo en paso de plano; baja tier al apply

Dejamos de preguntar «¿qué modelo es más listo?» y empezamos a etiquetar tickets: P0 interactivo, P1 batch de agente, P2 solo plano. Cada etiqueta mapea a un tope de tier. Pasarse exige una línea de motivo en la plantilla de PR — gobernanza aburrida, menos sorpresas en la factura.

Compara Kimi K3 en el mismo snapshot: $0,95 por tarea pero ~161s de primer chunk. Opus high puede ser más caro por tarea y aun más barato en minutos de ingeniero si alguien mira el spinner. Mira Kimi K3 vs Claude Opus 5.

Escenarios (elige tier antes de la pelea de vendors)

CargaEmpieza aquíEscala cuando
Bugfix en un serviciomediumLos tests fallen dos veces con el mismo prompt
Feature de 6–10 archivoshighSe rompan invariantes cross-package
Doc de diseño de migraciónxhigh en plano, high en patchesScope creep sin spec actualizada
Toque en auth / pagoshigh + review humanoNunca «merge autopilot max»

Opus 4.8 max sigue en 56 con ~26s de primer chunk en el snapshot. Algunos equipos se quedan en 4.8 no por nostalgia — la espera de punta a punta ganaba a Opus 5 max en el día a día hasta que una prueba demostró lo contrario.

Lo que no ponemos por defecto

  • Max porque rank #1 — el rank es clima fechado, no política.
  • Un tier para plano y apply — planear cuesta; aplicar no debería heredar max por inercia.
  • Saltarse el review del diff porque es Opus — usa el checklist de code review con IA.

Metodología y disciplina de snapshot: Mejores modelos de AI coding para proyectos reales. Notas de harness para trabajos largos: Kimi K3 para agentes de código (contraste, no endoso).

Snapshot: 2026-07-25 en rankings DevCove; tiers Anthropic y campos AA pueden moverse sin que esta página lo sepa hasta la próxima revisión.

In this topic

Related articles

Complete guideCómo elegir modelos de AI coding para proyectos realesUsa los leaderboards públicos de modelos sin confundir puntuaciones de benchmark con calidad de código permanente. Aprende qué significan las métricas de Artificial Analysis para costo, latencia, contexto y entrega real.Kimi K3 vs Claude Opus 5 para código: comparación con snapshotK3 vs Opus 5 no es pelea de corona — es forma de latencia, escalera de tiers y qué stack ya usas. Snapshot 2026-07-25 más dos lecturas de ingeniería.Kimi K3 para programar: benchmarks, API y cuándo probarloKimi K3 para software: contexto 1M, puesto #7 en el snapshot DevCove 2026-07-25, benchmarks de código, API y precios—sin afirmar el mejor modelo para siempre.Kimi K3 para agentes de código: harness, contexto y verificaciónK3 en producción es primero un problema de harness: permisos, qué metes en el contexto de 1M y gates antes del merge — no otro resumen de benchmark.Grok 4.5 para código: velocidad, costo y límites de la evidenciaGrok 4.5 se ve rápido y barato en papel — útil para chat acotado si demuestras calidad en tu repo. Somos honestos donde la evidencia pública de coding es fina.

Herramientas relacionadas

Usa las herramientas de este artículo

Checklist de lanzamiento para AI CodingAI coding checklist / AI app launch checklist / vibe coding checklistAI Code Review ChecklistAI generated code review checklist / review AI generated code / AI code review checklist

Cursos relacionados

curso de alfabetización en IA para desarrolladoresQué aprenderás en este curso práctico de alfabetización en IA para desarrolladores.

Volver a artículos