Voltar para AI Coding

Ranking de modelos de AI

Ranking de modelos de AI para código

Snapshot: 2026-08-13 · Última revisão: 2026-08-13

Metodologia

As métricas seguem um snapshot do leaderboard público de LLMs da Artificial Analysis: Índice de Inteligência, custo por tarefa e velocidade refletem o desempenho em benchmark na data do snapshot. Preço, disponibilidade e posições dos provedores mudam com frequência, e uma pontuação alta em benchmark não garante o melhor resultado para um codebase ou fluxo específico.

Fonte
Artificial Analysis
Última revisão
2026-08-13

Top 50 modelos

01

Modelo de raciocinio atual

Anthropic - Claude Opus - 5 (max)

Claude Opus 5 max lidera este snapshot com Intelligence Index 63 e contexto de 1M.

Melhor para: Análise frontier de repositórios, planejamento complexo e tarefas de agente de alto valor.

Anthropic

Contexto
1M
Índice AA
63
Custo por tarefa
$2.34
Velocidade
52 tok/s
Primeiro chunk
60.92s
Resposta total
70.52s
02

Modelo de raciocinio atual

Anthropic - Claude Opus - 5 (xhigh)

Empata o maior Intelligence Index, com menor custo por tarefa e latência inicial bem menor que max.

Melhor para: Edições multiarquivo profundas e agentes de código que ainda pedem qualidade frontier com melhor latência.

Anthropic

Contexto
1M
Índice AA
63
Custo por tarefa
$1.80
Velocidade
52 tok/s
Primeiro chunk
25.75s
Resposta total
35.32s
03

Modelo de raciocinio atual

Anthropic - Claude Fable - 5

Ainda entre os maiores Intelligence Index, com janela de contexto de 1M e boa velocidade de saída.

Melhor para: Análise profunda de repositórios, planejamento complexo e tarefas de agente de alto valor.

Anthropic

Contexto
1M
Índice AA
62
Custo por tarefa
$3.14
Velocidade
63 tok/s
Primeiro chunk
113.68s
Resposta total
121.60s
04

Modelo de raciocinio atual

Anthropic - Claude Opus - 5 (high)

Modo Opus 5 de alto raciocínio, latência bem menor que max/xhigh e ainda perto do topo.

Melhor para: Coding diário com agentes Claude, revisão e workflows com ferramentas que ainda exigem raciocínio forte.

Anthropic

Contexto
1M
Índice AA
61
Custo por tarefa
$1.23
Velocidade
51 tok/s
Primeiro chunk
13.43s
Resposta total
23.32s
05

Modelo de raciocinio atual

OpenAI - GPT Sol - 5.6 (max)

Topo da linha de raciocínio OpenAI neste snapshot, com contexto de 1M e forte Intelligence Index.

Melhor para: Agentes de código no ecossistema OpenAI, planejamento longo e tarefas com raciocínio máximo.

OpenAI

Contexto
1M
Índice AA
61
Custo por tarefa
$1.23
Velocidade
62 tok/s
Primeiro chunk
155.41s
Resposta total
163.54s
06

Modelo de raciocinio atual

SpaceXAI - Grok - 4.6 (high)

Nova entrada Grok 4.6 high perto do topo, contexto de 500k e custo por tarefa menor que os tiers max de Claude/OpenAI.

Melhor para: Agentes de código no ecossistema xAI, planejamento de contexto médio e experimentos frontier atentos a custo.

SpaceXAI

Contexto
500k
Índice AA
61
Custo por tarefa
$0.84
Velocidade
66 tok/s
Primeiro chunk
32.30s
Resposta total
39.89s
07

Modelo de raciocinio atual

Kimi - Kimi - K3 (max)

Flagship K3 max da Moonshot, contexto 1M+, forte em código; resposta total ainda relativamente longa.

Melhor para: Agentes de código de longo horizonte, geração frontend, stacks regionais e trabalho com contexto 1M.

Kimi

Contexto
1.05M
Índice AA
60
Custo por tarefa
$0.84
Velocidade
41 tok/s
Primeiro chunk
3.27s
Resposta total
64.72s
08

Modelo de raciocinio atual

OpenAI - GPT Sol - 5.6 (xhigh)

Modo GPT-5.6 Sol de alto raciocínio, contexto de 1M e menor custo por tarefa que max.

Melhor para: Coding diário com agentes, revisão e workflows com ferramentas que ainda exigem raciocínio forte.

OpenAI

Contexto
1M
Índice AA
59
Custo por tarefa
$0.81
Velocidade
61 tok/s
Primeiro chunk
57.84s
Resposta total
66.08s
09

Modelo de raciocinio atual

Anthropic - Claude Opus - 5 (medium)

Tier Opus 5 medium equilibrado, contexto de 1M e resposta total bem mais rápida que tiers superiores.

Melhor para: Sessões interativas de código com Claude, refatorações e loops de produto.

Anthropic

Contexto
1M
Índice AA
59
Custo por tarefa
$0.72
Velocidade
52 tok/s
Primeiro chunk
8.59s
Resposta total
18.29s
10

Modelo de raciocinio atual

Alibaba - Qwen - 3.8 Max

Novo flagship Qwen 3.8 Max, contexto de 1M, baixa latência inicial e Intelligence Index no top 10.

Melhor para: Coding multilíngue, stacks regionais e experimentos de agente centrados em Qwen.

Alibaba

Contexto
1M
Índice AA
58
Custo por tarefa
$1.13
Velocidade
47 tok/s
Primeiro chunk
2.72s
Resposta total
55.90s
11

Modelo de raciocinio atual

OpenAI - GPT Sol - 5.6 (high)

Tier GPT-5.6 Sol high equilibrado, contexto de 1M e tempo total de resposta responsivo.

Melhor para: Sessões interativas de código, refatorações e loops de produto em ferramentas OpenAI.

OpenAI

Contexto
1M
Índice AA
57
Custo por tarefa
$0.55
Velocidade
56 tok/s
Primeiro chunk
19.28s
Resposta total
28.15s
12

Modelo atual; métricas parciais

Meta - Muse Spark - 1.2 (xhigh)

Muse Spark 1.2 xhigh entra no top 12 com contexto 1M+; velocidade e latência públicas ainda incompletas.

Melhor para: Comparações de roteamento Meta de contexto longo quando o Intelligence Index pesa mais que a latência publicada.

Meta

Contexto
1.05M
Índice AA
57
Custo por tarefa
$0.40
Velocidade
tok/s
Primeiro chunk
Resposta total
13

Modelo de raciocinio atual

OpenAI - GPT Terra - 5.6 (max)

Tier GPT-5.6 Terra max, custo por tarefa menor que Sol max e saída muito rápida.

Melhor para: Código de contexto longo com foco em custo, quando throughput pesa mais que o primeiro token.

OpenAI

Contexto
1M
Índice AA
57
Custo por tarefa
$0.51
Velocidade
116 tok/s
Primeiro chunk
194.43s
Resposta total
198.74s
14

Modelo de raciocinio atual

SpaceXAI - Grok - 4.5 (high)

Grok 4.5 high com latência rápida, contexto de 500k e menor custo por tarefa que Grok 4.6 high.

Melhor para: Ajuda interativa rápida, loops de agente de contexto médio e experimentos no ecossistema xAI.

SpaceXAI

Contexto
500k
Índice AA
56
Custo por tarefa
$0.36
Velocidade
57 tok/s
Primeiro chunk
9.32s
Resposta total
18.11s
15

Modelo de raciocinio atual

OpenAI - GPT Sol - 5.6 (medium)

Tier GPT-5.6 Sol medium equilibra inteligência, contexto de 1M e baixo tempo total de resposta.

Melhor para: A maioria dos ciclos diários de código OpenAI em que velocidade e qualidade importam.

OpenAI

Contexto
1M
Índice AA
56
Custo por tarefa
$0.37
Velocidade
57 tok/s
Primeiro chunk
6.82s
Resposta total
15.62s
16

Modelo de raciocinio atual

Anthropic - Claude Sonnet - 5 (max)

Perfil Sonnet, alta inteligência e contexto de 1M, com primeira resposta lenta.

Melhor para: Trabalho em lote longo em que qualidade e contexto pesam mais que imediatismo.

Anthropic

Contexto
1M
Índice AA
55
Custo por tarefa
$1.72
Velocidade
71 tok/s
Primeiro chunk
191.38s
Resposta total
198.40s
17

Modelo de raciocinio atual

DeepSeek - DeepSeek V4 Pro - 0813 (max)

Nova entrada DeepSeek V4 Pro 0813 max no top 20, contexto de 1M, custo por tarefa muito baixo e latência inicial rápida.

Melhor para: Agentes de código econômicos no ecossistema aberto, análise longa e trabalho DeepSeek Pro sensível à latência.

DeepSeek

Contexto
1M
Índice AA
53
Custo por tarefa
$0.06
Velocidade
83 tok/s
Primeiro chunk
1.63s
Resposta total
31.68s
18

Modelo de raciocinio atual

OpenAI - GPT Terra - 5.6 (xhigh)

GPT-5.6 Terra xhigh combina menor custo por tarefa, contexto de 1M e saída rápida.

Melhor para: Código de contexto longo sensível a custo, com alto throughput e latência inicial aceitável.

OpenAI

Contexto
1M
Índice AA
53
Custo por tarefa
$0.31
Velocidade
106 tok/s
Primeiro chunk
29.77s
Resposta total
34.49s
19

Modelo de raciocinio atual

Z AI - GLM - 5.2 (max)

Alta posição com contexto de 1M, baixo custo por tarefa e latência inicial muito rápida.

Melhor para: Assistentes de código atentos a custo, análise longa e workflows sensíveis à latência.

Z AI

Contexto
1M
Índice AA
53
Custo por tarefa
$0.32
Velocidade
118 tok/s
Primeiro chunk
1.42s
Resposta total
22.58s
20

Modelo de raciocinio atual

Anthropic - Claude Opus - 5 (low)

Tier Opus 5 de baixa latência, com contexto de 1M e a resposta total mais rápida da linha Opus 5.

Melhor para: Pair programming interativo, correções rápidas e planejamento ágil no Claude Opus 5.

Anthropic

Contexto
1M
Índice AA
52
Custo por tarefa
$0.43
Velocidade
51 tok/s
Primeiro chunk
3.04s
Resposta total
12.90s
21

Modelo de raciocinio atual

OpenAI - GPT Luna - 5.6 (max)

Tier GPT-5.6 Luna max, custo por tarefa muito baixo, contexto de 1M e saída rápida.

Melhor para: Stacks OpenAI econômicos, edições em lote longas e assistentes de código de alto throughput.

OpenAI

Contexto
1M
Índice AA
52
Custo por tarefa
$0.05
Velocidade
150 tok/s
Primeiro chunk
136.64s
Resposta total
139.97s
22

Modelo de raciocinio atual

DeepSeek - DeepSeek V4 Flash - 0731 (max)

DeepSeek V4 Flash 0731 max, contexto de 1M, custo por tarefa muito baixo e latência inicial rápida.

Melhor para: Agentes de código econômicos no ecossistema aberto, análise longa e edições sensíveis à latência.

DeepSeek

Contexto
1M
Índice AA
52
Custo por tarefa
$0.03
Velocidade
122 tok/s
Primeiro chunk
1.44s
Resposta total
21.90s
23

Modelo geral atual

Google - Gemini - 3.6 Flash

Tier Gemini Flash, contexto de 1M, saída rápida e boa aderência ao ecossistema Google.

Melhor para: Loops rápidos no ecossistema Google, leitura de arquivos longos e assistentes de alto throughput.

Google

Contexto
1M
Índice AA
52
Custo por tarefa
$0.56
Velocidade
229 tok/s
Primeiro chunk
18.99s
Resposta total
21.17s
24

Modelo de raciocinio atual

OpenAI - GPT Sol - 5.6 (low)

Tier GPT-5.6 Sol de baixa latência, com contexto de 1M e a resposta total mais rápida da linha Sol.

Melhor para: Pair programming interativo, correções rápidas e planejamento ágil no GPT-5.6 Sol.

OpenAI

Contexto
1M
Índice AA
51
Custo por tarefa
$0.23
Velocidade
52 tok/s
Primeiro chunk
3.07s
Resposta total
12.74s
25

Modelo de raciocinio atual

OpenAI - GPT Terra - 5.6 (high)

Tier GPT-5.6 Terra high responsivo, contexto de 1M e tempo total de resposta muito curto.

Melhor para: Coding interativo OpenAI em que throughput e baixa latência importam.

OpenAI

Contexto
1M
Índice AA
50
Custo por tarefa
$0.22
Velocidade
97 tok/s
Primeiro chunk
3.79s
Resposta total
8.94s
26

Modelo de raciocinio atual

OpenAI - GPT Luna - 5.6 (xhigh)

Tier GPT-5.6 Luna xhigh econômico, contexto de 1M, custo por tarefa muito baixo e saída rápida.

Melhor para: Assistentes OpenAI sensíveis a custo e edições em lote de contexto longo.

OpenAI

Contexto
1M
Índice AA
50
Custo por tarefa
$0.03
Velocidade
147 tok/s
Primeiro chunk
50.93s
Resposta total
54.32s
27

Modelo de raciocinio atual

Kimi - Kimi - K3 (low)

Tier Kimi K3 low mantém contexto 1M+ e reduz o custo por tarefa frente ao K3 max.

Melhor para: Coding Kimi de contexto longo atento a custo quando esforço max não é necessário.

Kimi

Contexto
1.05M
Índice AA
48
Custo por tarefa
$0.24
Velocidade
37 tok/s
Primeiro chunk
3.24s
Resposta total
70.53s
28

Modelo geral atual

Google - Gemini - 3.1 Pro Preview

Preview Gemini 3.1 Pro, contexto de 1M e perfil equilibrado de custo/velocidade para stacks Google.

Melhor para: Testes de código no Google Cloud, protótipos multimodais e avaliação de contexto longo.

Google

Contexto
1M
Índice AA
48
Custo por tarefa
$0.33
Velocidade
114 tok/s
Primeiro chunk
31.61s
Resposta total
35.99s
29

Modelo atual; métricas parciais

Motif Technologies - Motif - 3

Motif 3 entra pelo Intelligence Index, contexto médio; a maioria das métricas públicas de velocidade e preço ainda está incompleta.

Melhor para: Avaliação inicial do Motif 3 quando a posição no benchmark importa mais que métricas públicas maduras.

Motif Technologies

Contexto
262k
Índice AA
47
Custo por tarefa
Velocidade
tok/s
Primeiro chunk
Resposta total
30

Modelo de raciocinio atual

OpenAI - GPT Luna - 5.6 (high)

Tier GPT-5.6 Luna high com custo por tarefa muito baixo, contexto de 1M e respostas rápidas.

Melhor para: Assistentes OpenAI de alto volume e workflows longos com orçamento apertado.

OpenAI

Contexto
1M
Índice AA
47
Custo por tarefa
$0.02
Velocidade
150 tok/s
Primeiro chunk
15.32s
Resposta total
18.66s
31

Modelo de raciocinio atual

OpenAI - GPT Terra - 5.6 (medium)

Tier GPT-5.6 Terra medium de baixa latência, contexto de 1M e resposta ponta a ponta muito curta.

Melhor para: Coding interativo ágil, refatorações e loops de agente OpenAI com muitas ferramentas.

OpenAI

Contexto
1M
Índice AA
47
Custo por tarefa
$0.12
Velocidade
97 tok/s
Primeiro chunk
1.78s
Resposta total
6.96s
32

Modelo atual; métricas parciais

Google - Gemini - 3.5 Flash (medium)

Modo Gemini 3.5 Flash medium, contexto de 1M e saída rápida; custo por tarefa não está totalmente público neste snapshot.

Melhor para: Experimentos no ecossistema Google em que a velocidade Flash medium pesa mais que o custo publicado.

Google

Contexto
1M
Índice AA
47
Custo por tarefa
Velocidade
162 tok/s
Primeiro chunk
17.53s
Resposta total
20.60s
33

Modelo atual; métricas parciais

OpenAI - GPT Codex - 5.3 (xhigh)

Tier GPT-5.3 Codex xhigh focado em código; custo por tarefa não está totalmente público neste snapshot.

Melhor para: Tarefas de software centradas em Codex, edições de repo e workflows de agent OpenAI.

OpenAI

Contexto
400k
Índice AA
46
Custo por tarefa
Velocidade
106 tok/s
Primeiro chunk
73.50s
Resposta total
78.22s
34

Modelo de raciocinio atual

MiniMax - MiniMax - M3

MiniMax M3 com contexto de 1M, baixo custo por tarefa e baixa latência inicial.

Melhor para: Assistentes de código atentos a custo, stacks regionais e edições interativas de baixa latência.

MiniMax

Contexto
1M
Índice AA
45
Custo por tarefa
$0.14
Velocidade
83 tok/s
Primeiro chunk
1.65s
Resposta total
31.83s
35

Modelo atual; métricas parciais

Motif Technologies - Motif - 3 (Beta)

Motif 3 Beta entra pelo Intelligence Index; a maioria das métricas públicas de velocidade e preço ainda está incompleta.

Melhor para: Avaliação inicial de provedores emergentes quando a posição no benchmark importa mais que métricas maduras.

Motif Technologies

Contexto
262k
Índice AA
45
Custo por tarefa
Velocidade
tok/s
Primeiro chunk
Resposta total
36

Modelo de raciocinio atual

DeepSeek - DeepSeek V4 Pro - max

DeepSeek V4 Pro max anterior (pré-0813), contexto de 1M e custo por tarefa muito baixo; resposta total mais longa que 0813.

Melhor para: Agentes de código econômicos, avaliação self-hosted e trabalho longo sensível a custo.

DeepSeek

Contexto
1M
Índice AA
45
Custo por tarefa
$0.05
Velocidade
67 tok/s
Primeiro chunk
1.68s
Resposta total
73.96s
37

Modelo de raciocinio atual

DeepSeek - DeepSeek V4 Pro - high

Tier DeepSeek V4 Pro high, contexto de 1M, baixo custo por tarefa e menor latência que max.

Melhor para: Coding interativo atento a custo e análise longa em endpoints DeepSeek.

DeepSeek

Contexto
1M
Índice AA
44
Custo por tarefa
$0.04
Velocidade
63 tok/s
Primeiro chunk
1.74s
Resposta total
41.34s
38

Modelo de raciocinio atual

Kimi - Kimi - K2.7 Code

Entrada Kimi K2.7 Code orientada a código, contexto de 256k e custo por tarefa publicado.

Melhor para: Workflows Kimi focados em código quando você não precisa da janela completa de 1M do K3.

Kimi

Contexto
256k
Índice AA
43
Custo por tarefa
$0.22
Velocidade
38 tok/s
Primeiro chunk
2.83s
Resposta total
74.36s
39

Modelo de raciocinio atual

Xiaomi - MiMo - V2.5-Pro

Xiaomi MiMo V2.5-Pro, contexto de 1M e custo por tarefa muito baixo para stacks regionais.

Melhor para: Coding multilíngue econômico, APIs regionais e assistentes longos de baixo custo.

Xiaomi

Contexto
1M
Índice AA
43
Custo por tarefa
$0.03
Velocidade
46 tok/s
Primeiro chunk
3.32s
Resposta total
57.11s
40

Modelo geral atual

Anthropic - Claude Sonnet - 5 (Non-reasoning)

Claude Sonnet 5 sem raciocínio, contexto de 1M, baixa latência e custo mais leve que max.

Melhor para: Coding diário com Claude, edições rápidas e sessões interativas sem raciocínio profundo.

Anthropic

Contexto
1M
Índice AA
43
Custo por tarefa
$0.42
Velocidade
60 tok/s
Primeiro chunk
1.92s
Resposta total
10.21s
41

Modelo de raciocinio atual

Thinking Machines - Inkling - base

Inkling da Thinking Machines com contexto de 1M, custo por tarefa publicado e boa latência inicial.

Melhor para: Avaliação de contexto longo de labs mais novos com preço e latência publicados.

Thinking Machines

Contexto
1M
Índice AA
42
Custo por tarefa
$0.34
Velocidade
74 tok/s
Primeiro chunk
1.86s
Resposta total
35.45s
42

Modelo de raciocinio atual

Tencent - Hy3 - base

Tencent Hy3, contexto médio, custo por tarefa muito baixo e latência inicial competitiva.

Melhor para: Stacks regionais de código, assistentes econômicos e experimentos no ecossistema Tencent.

Tencent

Contexto
256k
Índice AA
42
Custo por tarefa
$0.04
Velocidade
63 tok/s
Primeiro chunk
2.88s
Resposta total
42.48s
43

Modelo atual; métricas parciais

Nex AGI - Nex - N2-Pro

Nex N2-Pro entra com contexto médio e saída rápida; custo por tarefa não está totalmente público aqui.

Melhor para: Avaliação de provedores emergentes e experimentos de código de baixa latência fora dos grandes labs.

Nex AGI

Contexto
262k
Índice AA
42
Custo por tarefa
Velocidade
137 tok/s
Primeiro chunk
1.68s
Resposta total
19.92s
44

Modelo geral atual

OpenAI - GPT Sol - 5.6 (Non-reasoning)

GPT-5.6 Sol sem raciocínio, contexto de 1M e a menor latência inicial da linha Sol.

Melhor para: Loops de código OpenAI mais rápidos quando raciocínio estendido não é necessário.

OpenAI

Contexto
1M
Índice AA
42
Custo por tarefa
$0.24
Velocidade
59 tok/s
Primeiro chunk
1.33s
Resposta total
9.86s
45

Modelo atual; métricas parciais

Upstage - Solar Pro - 4

Upstage Solar Pro 4, contexto de 512k e velocidade publicada; custo por tarefa não está totalmente público neste snapshot.

Melhor para: Stacks regionais e document-heavy avaliando modelos Upstage pelo Intelligence Index.

Upstage

Contexto
512k
Índice AA
42
Custo por tarefa
Velocidade
65 tok/s
Primeiro chunk
2.18s
Resposta total
40.51s
46

Modelo de raciocinio atual

OpenAI - GPT Terra - 5.6 (low)

Tier GPT-5.6 Terra low de baixa latência, contexto de 1M e resposta ponta a ponta muito curta.

Melhor para: Coding OpenAI interativo rápido e refatorações ágeis quando raciocínio máximo não é necessário.

OpenAI

Contexto
1M
Índice AA
41
Custo por tarefa
$0.09
Velocidade
91 tok/s
Primeiro chunk
1.73s
Resposta total
7.20s
47

Modelo de raciocinio atual

Thinking Machines - Inkling Small - base

Variante menor do Inkling, contexto de 1M, baixo custo por tarefa e saída mais rápida que o Inkling base.

Melhor para: Avaliação econômica dos modelos Thinking Machines com metas mais apertadas de latência e custo.

Thinking Machines

Contexto
1M
Índice AA
41
Custo por tarefa
$0.07
Velocidade
128 tok/s
Primeiro chunk
1.58s
Resposta total
21.06s
48

Modelo atual; métricas parciais

China Mobile - JT - 4.1 Flash 236B A21B

JT-4.1 Flash da China Mobile entra pelo Intelligence Index; a maioria das métricas públicas de preço e velocidade ainda está incompleta.

Melhor para: Avaliação de stacks regionais China Mobile quando a posição no benchmark é o sinal principal.

China Mobile

Contexto
256k
Índice AA
40
Custo por tarefa
Velocidade
tok/s
Primeiro chunk
Resposta total
49

Modelo atual; métricas parciais

Sapiens AI - Agnes - 2.5 Pro Alpha

Agnes 2.5 Pro Alpha com contexto de 1M e saída rápida; custo por tarefa não está totalmente público aqui.

Melhor para: Avaliação inicial de contexto longo dos modelos emergentes da Sapiens AI.

Sapiens AI

Contexto
1M
Índice AA
40
Custo por tarefa
Velocidade
131 tok/s
Primeiro chunk
2.37s
Resposta total
21.42s
50

Modelo de raciocinio atual

Alibaba - Qwen - 3.7 Plus

Qwen 3.7 Plus com contexto de 1M, menor custo por tarefa que Qwen 3.8 Max e tempo total de resposta moderado.

Melhor para: Agentes de código Qwen atentos a custo e loops de produto multilíngues.

Alibaba

Contexto
1M
Índice AA
39
Custo por tarefa
$0.24
Velocidade
56 tok/s
Primeiro chunk
2.13s
Resposta total
46.67s