Grok 4.5 para código: velocidad, costo y límites de la evidencia
Grok 4.5 se ve rápido y barato en papel — útil para chat acotado si demuestras calidad en tu repo. Somos honestos donde la evidencia pública de coding es fina.
Añadimos Grok 4.5 (high) a un slot de “segundo modelo” para preguntas pequeñas y acotadas — stack traces, reescrituras de regex, ajustes de config — no porque ganara a Opus 5 max en una slide, sino porque el snapshot de rankings 2026-07-25 mostró $0,31 por tarea y ~11,6s de primer chunk junto a entradas frontier mucho más pesadas.
Ese ahorro solo importa si los diffs siguen pasando tests. No tenemos examen de coding Grok corrido por DevCove; lo siguiente mezcla hechos del snapshot con disciplina de prueba.
Tarjeta de snapshot (2026-07-25)
| Campo | Grok 4.5 high | Opus 5 medium | Kimi K3 |
|---|---|---|---|
| Rank | #12 | #8 | #7 |
| Index | 54 | 56 | 57 |
| Contexto | 500k | 1M | 1,05M |
| Costo / tarea | $0,31 | $0,62 | $0,95 |
| Primer chunk | 11,63s | 5,63s | 161,17s |
Contexto 500k es la mitad del club 1M — bien si las tools traen archivos; apretado si tu flujo es “pegar el monorepo”.
Dónde permitimos Grok en el loop
| Uso | ¿Permitido? | Guardrail |
|---|---|---|
| Explicar error + sugerir patch en un archivo | A menudo sí | Humano aplica el diff |
| Refactor multi-paquete | Rara vez por defecto | Prueba Opus/K3 primero |
| Cambio de schema en producción | Sin autopilot | Humano + checklist |
| Vendor bloqueado por compliance | Alto | Política gana al benchmark |
Protocolo de prueba de una tarde
- Tres tareas: bugfix, feature pequeña, backfill de test — mismos prompts que el modelo titular.
- Puntúa: minutos de fix manual, pass de tests, comandos sorpresa.
- No hagas merge sin ship checklist.
Resultado de prueba Grok
│
├─ ¿Tiempo de fix ≤ titular?
│ ├─ Sí → mantén como 2º modelo para chat acotado
│ └─ No → quita del default; solo brainstorming
│
└─ ¿Compliance OK?
└─ No → quita keys; no uses “en silencio”
Lo que no vamos a afirmar
- Grok es “rey frontier de coding” por index 54.
- Costo bajo por tarea garantiza gasto mensual bajo.
- El buzz de launch público reemplaza tus métricas de harness.
Compara hermanos: K3 vs Opus, tiers Opus, router tres modelos. Metodología: Mejores modelos de AI coding para proyectos reales.
Snapshot: 2026-07-25; nombres SKU xAI y campos pueden moverse.