Claude Opus 5 para código: tiers, latencia y cuándo bajar de nivel
Opus 5 es una escalera de tiers, no un solo modelo. Usa el snapshot DevCove 2026-07-25 para alinear max, high o medium con tu repo — y deja de pagar precio max por trabajo de autocompletado.
El trimestre pasado alguien pegó nuestro memo interno en una diapositiva: «Por defecto Opus 5 max — rank #1 en Artificial Analysis.» Finanzas vio la partida antes de que ingeniería sintiera la latencia. Anthropic no lanzó un solo Opus 5; lanzó peldaños en una escalera — max, xhigh, high, medium, low — cada uno con distinto retraso del primer chunk y costo por tarea en el mismo leaderboard público.
Este artículo va para quien elige el modelo por defecto en Claude Code o la API. Los números salen del snapshot 2026-07-25 de los rankings de modelos de AI coding de DevCove (fuente Artificial Analysis). Pueden cambiar; revisa siempre la fecha en la página de rankings antes de copiar una slide.
Qué se rompió en nuestro modelo mental
Tratábamos el Intelligence Index como GHz de CPU: más alto siempre mejor para código. En el snapshot, Opus 5 max lidera con 61, pero su primer chunk tarda ~64s en el harness de benchmark. Opus 5 medium queda en 56 con ~5,6s de primer chunk. Para quien espera en el IDE, esa brecha es el producto — no una nota al pie.
| Error | Lo que pasa en la práctica |
|---|---|
| Max en cada refactor | Pagas el tier top por diffs que medium pasaría con los mismos tests |
| Medium en una migración cross-service | Ahorras en modelo y lo gastas en reparación humana cuando el plano fue fino |
| Ignorar el tier en compras | Un nombre de SKU esconde cinco facturas de latencia distintas |
Cómo leemos snapshots: el Index ordena tareas de benchmark, no tu monorepo. Cruza la tabla con una prueba acotada y el ship checklist.
Escalera de tiers (snapshot 2026-07-25)
Abre Artificial Analysis para la metodología cruda. DevCove guarda estos campos para SKUs Opus 5:
| Tier | Rank | Index | Costo / tarea | Primer chunk | Respuesta total | Cuándo compensa |
|---|---|---|---|---|---|---|
| max | 1 | 61 | $2.03 | 64.52s | 73.64s | Plan nocturno, prep de review de alto riesgo |
| xhigh | 2 | 60 | $1.56 | 38.85s | 48.54s | Paso de plano antes de un tier más barato en ejecución |
| high | 5 | 59 | $1.06 | 24.94s | 33.37s | Loops diarios de agente que aún necesitan razonamiento fuerte |
| medium | 8 | 56 | $0.62 | 5.63s | 15.52s | Chat interactivo, edits pequeños y acotados |
| low | — | — | — | — | — | Confirma el SKU en la doc del vendor antes de fiarte de la tabla |
Claude Fable 5 (index 60, rank #3) es línea hermana, no «Opus lite». El mismo snapshot muestra ~110s de primer chunk — bien para lecturas profundas, duro para pair programming.
TCO: dónde max gana o pierde en silencio
Costo por tarea es una mezcla del snapshot, no tu factura. Aun así deja ver un patrón:
Factura mensual de modelo
│
├─ 70% de llamadas = "fix lint / tweak copy / diff pequeño"
│ └─ NO debería ser max → medium/high
│
├─ 20% = feature multi-archivo con tests
│ └─ high por defecto; xhigh si el plano falló una vez
│
└─ 10% = migración / apuesta de arquitectura
└─ xhigh o max solo en paso de plano; baja tier al apply
Dejamos de preguntar «¿qué modelo es más listo?» y empezamos a etiquetar tickets: P0 interactivo, P1 batch de agente, P2 solo plano. Cada etiqueta mapea a un tope de tier. Pasarse exige una línea de motivo en la plantilla de PR — gobernanza aburrida, menos sorpresas en la factura.
Compara Kimi K3 en el mismo snapshot: $0,95 por tarea pero ~161s de primer chunk. Opus high puede ser más caro por tarea y aun más barato en minutos de ingeniero si alguien mira el spinner. Mira Kimi K3 vs Claude Opus 5.
Escenarios (elige tier antes de la pelea de vendors)
| Carga | Empieza aquí | Escala cuando |
|---|---|---|
| Bugfix en un servicio | medium | Los tests fallen dos veces con el mismo prompt |
| Feature de 6–10 archivos | high | Se rompan invariantes cross-package |
| Doc de diseño de migración | xhigh en plano, high en patches | Scope creep sin spec actualizada |
| Toque en auth / pagos | high + review humano | Nunca «merge autopilot max» |
Opus 4.8 max sigue en 56 con ~26s de primer chunk en el snapshot. Algunos equipos se quedan en 4.8 no por nostalgia — la espera de punta a punta ganaba a Opus 5 max en el día a día hasta que una prueba demostró lo contrario.
Lo que no ponemos por defecto
- Max porque rank #1 — el rank es clima fechado, no política.
- Un tier para plano y apply — planear cuesta; aplicar no debería heredar max por inercia.
- Saltarse el review del diff porque es Opus — usa el checklist de code review con IA.
Metodología y disciplina de snapshot: Mejores modelos de AI coding para proyectos reales. Notas de harness para trabajos largos: Kimi K3 para agentes de código (contraste, no endoso).
Snapshot: 2026-07-25 en rankings DevCove; tiers Anthropic y campos AA pueden moverse sin que esta página lo sepa hasta la próxima revisión.