Kimi K3, Claude Opus 5 y Grok 4.5: comparación para código
Tres modelos calientes comparados en latencia, costo y encaje de stack — snapshot 2026-07-25, cómo leer la matriz, stack sensato y prueba en la misma rama, con enlaces a tiers Opus, harness K3 y límites Grok.
Tres nombres dominan feeds de búsqueda a fines de julio de 2026. No son SKUs intercambiables — formas de latencia, techos de contexto y stacks de vendor distintos. Esta página es una comparación fechada para leer de un tirón y luego ir a los deep dives (tiers, harness, cara a cara). Cifras de tablas: DevCove 2026-07-25 (rankings).
Cómo usarla: Elige una fila en el router, lee el artículo enlazado, haz una prueba en la misma rama con los mismos tests. Rank #5 vs #7 no es una final — reintentos y minutos de fix humano mandan en la factura.
Una frase cada uno
| Modelo | Rol en una línea |
|---|---|
| Claude Opus 5 | Razonamiento en tiers dentro de herramientas Anthropic — high/medium a diario, max solo en pasos de plano. |
| Kimi K3 | Flagship Moonshot 1M+ para agentes acotados — harness primero, latencia después. |
| Grok 4.5 high | Perfil snapshot barato/rápido para tareas pequeñas — demuestra calidad localmente. |
Matriz snapshot
| K3 | Opus 5 high | Grok 4.5 high | |
|---|---|---|---|
| Rank | #7 | #5 | #12 |
| Index | 57 | 59 | 54 |
| Contexto | 1,05M | 1M | 500k |
| Costo / tarea | $0,95 | $1,06 | $0,31 |
| Primer chunk* | 161s | 25s | 12s |
*Campo harness AA — mide en tu IDE/agente.
Cómo leer estos campos
Index y rank resumen un snapshot de harness fijo — sirven para ordenar pruebas, no para slides de compras solos. Costo / tarea es estimación de una pasada; dos pasadas extra en un modelo barato pueden perder. Primer chunk es donde K3 y Opus divergen en la UX del editor. Grok gana costo y chunk en esta tabla, pero rank #12 exige prueba local en tu stack antes de default de merge.
Para Opus, nombra siempre el tier — ver Tiers Opus. Para K3 vs Opus en el mismo ticket, usa artículo vs en lugar de repetir aquí.
Cuándo no usar como default (negativos honestos)
| Modelo | Evita como default cuando… |
|---|---|
| Opus 5 | No puedes usar tooling Anthropic; solo necesitas chat barato sin contrato Claude. |
| K3 | Humanos esperan en vivo en el editor en el primer token; alcance difuso (toca archivos de más). |
| Grok 4.5 high | El cambio toca auth, migraciones o refactors multi-archivo sin un modelo más estricto en review. |
Son pistas de enrutado, no vetos — las excepciones van en notas de prueba.
Router de escenarios
| Necesitas… | Empieza | Lectura profunda |
|---|---|---|
| Tienda Claude Code, multi-archivo | Opus high | Tiers Opus |
| Moonshot aprobado, jobs largos de agente | K3 + alcance ajustado | Harness K3 |
| K3 vs Opus cara a cara | Prueba en la misma rama | Artículo vs |
| Chat barato, diffs pequeños | Prueba Grok | Límites Grok |
| Dos modelos en un sprint | Stack abajo | Esta sección + pilar |
| Cómo leer snapshots | — | Pilar metodología |
Stack sensato (un primario, dos especialistas)
La mayoría no debería correr tres defaults. Patrón que encaja con este snapshot:
- Camino principal de merge: Opus high (o tier Anthropic aprobado) para multi-archivo y reviews en las que confías para merge.
- Carril de borrador barato: Grok 4.5 high para boilerplate, logs, primera pregunta — nunca merge automático sin los mismos tests que Opus.
- Carril batch / contexto largo: K3 solo con Moonshot aprobado, alcance escrito (paths + tests de aceptación), humanos no bloqueados en first chunk — Harness K3.
Incoming task
│
├─ Touches prod auth / schema / >3 files?
│ └─ Yes → Opus high (or max for plan-only step) → human review
│
├─ Small, reversible, human waits in editor?
│ └─ Yes → Grok trial OR Opus medium — measure fix time, not hype
│
└─ Approved batch agent + frozen scope?
└─ Yes → K3 with harness; Opus as benchmark on same branch
Prueba en la misma rama (mínimo)
Una rama de feature, el mismo comando de test por modelo — anota minutos de fix humano.
git checkout -b trial/model-picker-$(date +%Y%m%d)
npm test
# run agent with model A, commit; note fix time
git reset --hard HEAD~1 # only if you want a clean re-trial on same base
npm test
# repeat for model B/C
Antes de merge en producción: AI coding ship checklist.
Cierre editorial
Sin #1 eterno — solo evidencia fechada y pruebas locales. Fecha del snapshot: 2026-07-25. Deep dives: Opus · K3 agents · Grok · K3 vs Opus · Cómo leemos rankings.