Claude Opus 5 no código: tiers, latência e quando descer de nível
Opus 5 é uma escada de tiers, não um modelo só. Use o snapshot DevCove 2026-07-25 para casar max, high ou medium ao seu repo — e pare de pagar preço max em trabalho de autocomplete.
No trimestre passado alguém colou nosso memo interno num slide: “Padrão Opus 5 max — rank #1 no Artificial Analysis.” Finanças viram a linha de custo antes de engenharia sentir a latência. A Anthropic não lançou um Opus 5 único; lançou degraus numa escada — max, xhigh, high, medium, low — cada um com atraso do primeiro chunk e custo por tarefa diferentes no mesmo leaderboard público.
Este texto é para quem escolhe o modelo padrão no Claude Code ou na API. Os números vêm do snapshot 2026-07-25 dos rankings de modelos de AI coding da DevCove (fonte Artificial Analysis). Podem mudar; confira sempre a data na página de rankings antes de copiar um slide.
O que quebrou no nosso modelo mental
Tratávamos o Intelligence Index como GHz de CPU: quanto maior, melhor para código. No snapshot, Opus 5 max lidera com 61, mas o primeiro chunk leva ~64s no harness de benchmark. Opus 5 medium fica em 56 com ~5,6s no primeiro chunk. Para quem espera no IDE, esse gap é o produto — não nota de rodapé.
| Erro | O que acontece de fato |
|---|---|
| Max em todo refactor | Você paga o tier topo por diffs que medium passaria nos mesmos testes |
| Medium numa migração cross-service | Economiza no modelo, gasta em retrabalho humano quando o plano ficou raso |
| Ignorar tier na compra | Um nome de SKU esconde cinco contas de latência diferentes |
Como lemos snapshots: o Index ranqueia tarefas de benchmark, não seu monorepo. Cruze a tabela com um trial limitado e o ship checklist.
Escada de tiers (snapshot 2026-07-25)
Abra o Artificial Analysis para a metodologia bruta. A DevCove guarda estes campos para SKUs Opus 5:
| Tier | Rank | Index | Custo / tarefa | Primeiro chunk | Resposta total | Quando vale a pena |
|---|---|---|---|---|---|---|
| max | 1 | 61 | $2.03 | 64.52s | 73.64s | Plano noturno, prep de review de alto risco |
| xhigh | 2 | 60 | $1.56 | 38.85s | 48.54s | Etapa de plano antes de tier mais barato na execução |
| high | 5 | 59 | $1.06 | 24.94s | 33.37s | Loops diários de agente que ainda precisam de raciocínio forte |
| medium | 8 | 56 | $0.62 | 5.63s | 15.52s | Chat interativo, edits pequenos e com escopo |
| low | — | — | — | — | — | Confirme o SKU na doc do vendor antes de confiar na tabela |
Claude Fable 5 (index 60, rank #3) é linha irmã, não “Opus lite”. O mesmo snapshot mostra ~110s no primeiro chunk — bom para leitura profunda, ruim para pair programming.
TCO: onde max ganha ou perde em silêncio
Custo por tarefa é um blend do snapshot, não sua fatura. Ainda assim expõe um padrão:
Conta mensal de modelo
│
├─ 70% das chamadas = "fix lint / tweak copy / diff pequeno"
│ └─ NÃO deveria ser max → medium/high
│
├─ 20% = feature multi-arquivo com testes
│ └─ high padrão; xhigh se o plano falhou uma vez
│
└─ 10% = migração / aposta de arquitetura
└─ xhigh ou max só na etapa de plano; baixe tier no apply
Paramos de perguntar “qual modelo é mais inteligente?” e passamos a etiquetar tickets: P0 interativo, P1 batch de agente, P2 só plano. Cada tag mapeia a um teto de tier. Estourar exige uma linha de motivo no template de PR — governança chata, menos surpresa na fatura.
Compare Kimi K3 no mesmo snapshot: $0,95 por tarefa mas ~161s no primeiro chunk. Opus high pode ser mais caro por tarefa e ainda mais barato em minutos de engenheiro se alguém está olhando o spinner. Veja Kimi K3 vs Claude Opus 5.
Cenários (escolha o tier antes da briga de vendor)
| Carga | Comece aqui | Escale quando |
|---|---|---|
| Bugfix em um serviço | medium | Testes falharem duas vezes no mesmo prompt |
| Feature 6–10 arquivos | high | Invariantes cross-package quebrarem |
| Doc de design de migração | xhigh no plano, high nos patches | Scope creep sem spec atualizada |
| Toque em auth / pagamentos | high + review humano | Nunca “merge autopilot max” |
Opus 4.8 max ainda ranqueia 56 com ~26s no primeiro chunk no snapshot. Alguns times ficam no 4.8 não por nostalgia — espera ponta a ponta batia Opus 5 max no dia a dia até um trial provar o contrário.
O que não colocamos como padrão
- Max porque rank #1 — rank é clima datado, não política.
- Um tier para plano e apply — planejar é caro; aplicar não deveria herdar max por inércia.
- Pular review de diff porque é Opus — use o checklist de code review com IA.
Metodologia e disciplina de snapshot: Melhores modelos de AI coding para projetos reais. Notas de harness para jobs longos: Kimi K3 para agentes de código (contraste, não endosso).
Snapshot: 2026-07-25 nos rankings DevCove; tiers Anthropic e campos AA podem mudar sem esta página saber até a próxima revisão.