Grok 4.5 para código: velocidade, custo e limites da evidência
Grok 4.5 parece rápido e barato no papel — útil para chat com escopo se você provar qualidade no repo. Somos honestos onde a evidência pública de coding é fina.
Colocamos Grok 4.5 (high) num slot de “segundo modelo” para perguntas pequenas e com escopo — stack traces, rewrites de regex, tweaks de config — não porque venceu Opus 5 max num slide, mas porque o snapshot de rankings 2026-07-25 mostrou $0,31 por tarefa e ~11,6s de primeiro chunk ao lado de entradas frontier bem mais pesadas.
Essa economia só importa se os diffs ainda passarem nos testes. Não temos prova de coding Grok feita pela DevCove; o que segue mistura fatos do snapshot com disciplina de trial.
Card de snapshot (2026-07-25)
| Campo | Grok 4.5 high | Opus 5 medium | Kimi K3 |
|---|---|---|---|
| Rank | #12 | #8 | #7 |
| Index | 54 | 56 | 57 |
| Contexto | 500k | 1M | 1,05M |
| Custo / tarefa | $0,31 | $0,62 | $0,95 |
| Primeiro chunk | 11,63s | 5,63s | 161,17s |
Contexto 500k é metade do clube 1M — ok se tools buscam arquivos; apertado se seu fluxo é “colar o monorepo”.
Onde permitimos Grok no loop
| Uso | Permitido? | Guardrail |
|---|---|---|
| Explicar erro + sugerir patch em um arquivo | Muitas vezes sim | Humano aplica o diff |
| Refactor multi-pacote | Raramente default | Trial Opus/K3 primeiro |
| Mudança de schema em produção | Sem autopilot | Humano + checklist |
| Vendor bloqueado por compliance | Pare | Política vence benchmark |
Protocolo de trial de uma tarde
- Três tarefas: bugfix, feature pequena, backfill de teste — mesmos prompts do modelo titular.
- Pontue: minutos de fix manual, pass de teste, comandos surpresa.
- Não faça merge sem ship checklist.
Resultado do trial Grok
│
├─ Tempo de fix ≤ titular?
│ ├─ Sim → mantém como 2º modelo para chat com escopo
│ └─ Não → tira do default; só brainstorming
│
└─ Compliance OK?
└─ Não → remove keys; não use “quieto”
O que não vamos afirmar
- Grok é “rei frontier de coding” pelo index 54.
- Custo baixo por tarefa garante gasto mensal baixo.
- Buzz de launch público substitui suas métricas de harness.
Compare irmãos: K3 vs Opus, tiers Opus, router três modelos. Metodologia: Melhores modelos de AI coding para projetos reais.
Snapshot: 2026-07-25; nomes de SKU xAI e campos podem mudar.