Claude Opus 5 no código: tiers, latência e quando descer de nível

Opus 5 é uma escada de tiers, não um modelo só. Use o snapshot DevCove 2026-07-25 para casar max, high ou medium ao seu repo — e pare de pagar preço max em trabalho de autocomplete.

No trimestre passado alguém colou nosso memo interno num slide: “Padrão Opus 5 max — rank #1 no Artificial Analysis.” Finanças viram a linha de custo antes de engenharia sentir a latência. A Anthropic não lançou um Opus 5 único; lançou degraus numa escada — max, xhigh, high, medium, low — cada um com atraso do primeiro chunk e custo por tarefa diferentes no mesmo leaderboard público.

Este texto é para quem escolhe o modelo padrão no Claude Code ou na API. Os números vêm do snapshot 2026-07-25 dos rankings de modelos de AI coding da DevCove (fonte Artificial Analysis). Podem mudar; confira sempre a data na página de rankings antes de copiar um slide.

O que quebrou no nosso modelo mental

Tratávamos o Intelligence Index como GHz de CPU: quanto maior, melhor para código. No snapshot, Opus 5 max lidera com 61, mas o primeiro chunk leva ~64s no harness de benchmark. Opus 5 medium fica em 56 com ~5,6s no primeiro chunk. Para quem espera no IDE, esse gap é o produto — não nota de rodapé.

ErroO que acontece de fato
Max em todo refactorVocê paga o tier topo por diffs que medium passaria nos mesmos testes
Medium numa migração cross-serviceEconomiza no modelo, gasta em retrabalho humano quando o plano ficou raso
Ignorar tier na compraUm nome de SKU esconde cinco contas de latência diferentes

Como lemos snapshots: o Index ranqueia tarefas de benchmark, não seu monorepo. Cruze a tabela com um trial limitado e o ship checklist.

Escada de tiers (snapshot 2026-07-25)

Abra o Artificial Analysis para a metodologia bruta. A DevCove guarda estes campos para SKUs Opus 5:

TierRankIndexCusto / tarefaPrimeiro chunkResposta totalQuando vale a pena
max161$2.0364.52s73.64sPlano noturno, prep de review de alto risco
xhigh260$1.5638.85s48.54sEtapa de plano antes de tier mais barato na execução
high559$1.0624.94s33.37sLoops diários de agente que ainda precisam de raciocínio forte
medium856$0.625.63s15.52sChat interativo, edits pequenos e com escopo
lowConfirme o SKU na doc do vendor antes de confiar na tabela

Claude Fable 5 (index 60, rank #3) é linha irmã, não “Opus lite”. O mesmo snapshot mostra ~110s no primeiro chunk — bom para leitura profunda, ruim para pair programming.

TCO: onde max ganha ou perde em silêncio

Custo por tarefa é um blend do snapshot, não sua fatura. Ainda assim expõe um padrão:

Conta mensal de modelo
│
├─ 70% das chamadas = "fix lint / tweak copy / diff pequeno"
│     └─ NÃO deveria ser max → medium/high
│
├─ 20% = feature multi-arquivo com testes
│     └─ high padrão; xhigh se o plano falhou uma vez
│
└─ 10% = migração / aposta de arquitetura
      └─ xhigh ou max só na etapa de plano; baixe tier no apply

Paramos de perguntar “qual modelo é mais inteligente?” e passamos a etiquetar tickets: P0 interativo, P1 batch de agente, P2 só plano. Cada tag mapeia a um teto de tier. Estourar exige uma linha de motivo no template de PR — governança chata, menos surpresa na fatura.

Compare Kimi K3 no mesmo snapshot: $0,95 por tarefa mas ~161s no primeiro chunk. Opus high pode ser mais caro por tarefa e ainda mais barato em minutos de engenheiro se alguém está olhando o spinner. Veja Kimi K3 vs Claude Opus 5.

Cenários (escolha o tier antes da briga de vendor)

CargaComece aquiEscale quando
Bugfix em um serviçomediumTestes falharem duas vezes no mesmo prompt
Feature 6–10 arquivoshighInvariantes cross-package quebrarem
Doc de design de migraçãoxhigh no plano, high nos patchesScope creep sem spec atualizada
Toque em auth / pagamentoshigh + review humanoNunca “merge autopilot max”

Opus 4.8 max ainda ranqueia 56 com ~26s no primeiro chunk no snapshot. Alguns times ficam no 4.8 não por nostalgia — espera ponta a ponta batia Opus 5 max no dia a dia até um trial provar o contrário.

O que não colocamos como padrão

  • Max porque rank #1 — rank é clima datado, não política.
  • Um tier para plano e apply — planejar é caro; aplicar não deveria herdar max por inércia.
  • Pular review de diff porque é Opus — use o checklist de code review com IA.

Metodologia e disciplina de snapshot: Melhores modelos de AI coding para projetos reais. Notas de harness para jobs longos: Kimi K3 para agentes de código (contraste, não endosso).

Snapshot: 2026-07-25 nos rankings DevCove; tiers Anthropic e campos AA podem mudar sem esta página saber até a próxima revisão.

Neste tópico

Artigos relacionados

Guia completoComo escolher modelos de AI coding para projetos reaisUse rankings públicos de modelos sem confundir pontuações de benchmark com qualidade permanente de código. Entenda o que as métricas da Artificial Analysis significam para custo, latência, contexto e entrega real.Kimi K3 vs Claude Opus 5 para código: comparação com snapshotK3 vs Opus 5 não é briga de coroa — é formato de latência, escada de tiers e qual stack você já roda. Snapshot 2026-07-25 mais duas leituras de engenharia.Kimi K3 para código: benchmarks, API e quando testarKimi K3 para trabalho de software: contexto 1M, rank #7 no snapshot DevCove 2026-07-25, benchmarks de código, ID de API e preços—sem claim de melhor modelo permanente.Kimi K3 para agentes de código: harness, contexto e verificaçãoK3 em produção é problema de harness primeiro: permissões, o que você injeta no contexto de 1M e gates antes do merge — não mais um recap de benchmark.Grok 4.5 para código: velocidade, custo e limites da evidênciaGrok 4.5 parece rápido e barato no papel — útil para chat com escopo se você provar qualidade no repo. Somos honestos onde a evidência pública de coding é fina.

Ferramentas relacionadas

Use as ferramentas deste artigo

Checklist de lançamento para AI CodingAI coding checklist / AI app launch checklist / vibe coding checklistChecklist de revisão de código com IAAI generated code review checklist / review AI generated code / AI code review checklist

Aprenda o formato

Alfabetização em IA para desenvolvedoresFundamentos práticos de IA para fluxos de desenvolvedores: modelos, prompts, assistentes de código, verificação, privacidade e trabalho assistido por IA.

Voltar aos artigos