Volver a AI Coding

Ranking de modelos de IA

Ranking de modelos de IA para código

Instantánea: 2026-08-13 · Última revisión: 2026-08-13

Metodología

Las métricas siguen una instantánea del leaderboard público de LLM de Artificial Analysis: el Índice de Inteligencia, el coste por tarea y la velocidad reflejan el rendimiento en benchmark en la fecha de la instantánea. El precio, la disponibilidad y las posiciones de los proveedores cambian con frecuencia, y una puntuación alta en benchmark no garantiza el mejor resultado para un codebase o flujo concreto.

Fuente
Artificial Analysis
Última revisión
2026-08-13

Top 50 modelos

01

Modelo de razonamiento actual

Anthropic - Claude Opus - 5 (max)

Claude Opus 5 max lidera esta instantánea con Intelligence Index 63 y contexto de 1M.

Ideal para: Análisis frontier de repositorios, planificación compleja y tareas de agente de alto valor.

Anthropic

Contexto
1M
Índice AA
63
Coste por tarea
$2.34
Velocidad
52 tok/s
Primer chunk
60.92s
Respuesta total
70.52s
02

Modelo de razonamiento actual

Anthropic - Claude Opus - 5 (xhigh)

Empata el mayor Intelligence Index, con menor coste por tarea y menor latencia inicial que max.

Ideal para: Ediciones multiarchivo profundas y agentes de código que aún necesitan calidad frontier con mejor latencia.

Anthropic

Contexto
1M
Índice AA
63
Coste por tarea
$1.80
Velocidad
52 tok/s
Primer chunk
25.75s
Respuesta total
35.32s
03

Modelo de razonamiento actual

Anthropic - Claude Fable - 5

Sigue entre los mayores Intelligence Index, con contexto de 1M y buena velocidad de salida.

Ideal para: Análisis profundo de repositorios, planificación compleja y tareas de agente de alto valor.

Anthropic

Contexto
1M
Índice AA
62
Coste por tarea
$3.14
Velocidad
63 tok/s
Primer chunk
113.68s
Respuesta total
121.60s
04

Modelo de razonamiento actual

Anthropic - Claude Opus - 5 (high)

Modo Opus 5 de alto razonamiento, menor latencia que max/xhigh y aún cerca del tope.

Ideal para: Codificación diaria con agentes Claude, revisión y flujos con herramientas que aún requieren razonamiento fuerte.

Anthropic

Contexto
1M
Índice AA
61
Coste por tarea
$1.23
Velocidad
51 tok/s
Primer chunk
13.43s
Respuesta total
23.32s
05

Modelo de razonamiento actual

OpenAI - GPT Sol - 5.6 (max)

Tope de la línea de razonamiento OpenAI en esta instantánea, con contexto de 1M e fuerte Intelligence Index.

Ideal para: Agentes de código en ecosistema OpenAI, planificación larga y tareas con razonamiento máximo.

OpenAI

Contexto
1M
Índice AA
61
Coste por tarea
$1.23
Velocidad
62 tok/s
Primer chunk
155.41s
Respuesta total
163.54s
06

Modelo de razonamiento actual

SpaceXAI - Grok - 4.6 (high)

Nueva entrada Grok 4.6 high cerca del tope, contexto de 500k y menor coste por tarea que los tiers max de Claude/OpenAI.

Ideal para: Agentes de código en ecosistema xAI, planificación de contexto medio y experimentos frontier sensibles al coste.

SpaceXAI

Contexto
500k
Índice AA
61
Coste por tarea
$0.84
Velocidad
66 tok/s
Primer chunk
32.30s
Respuesta total
39.89s
07

Modelo de razonamiento actual

Kimi - Kimi - K3 (max)

Flagship K3 max de Moonshot, contexto 1M+, fuerte en código; respuesta total aún relativamente larga.

Ideal para: Agentes de código de largo horizonte, generación frontend, stacks regionales y trabajo con contexto 1M.

Kimi

Contexto
1.05M
Índice AA
60
Coste por tarea
$0.84
Velocidad
41 tok/s
Primer chunk
3.27s
Respuesta total
64.72s
08

Modelo de razonamiento actual

OpenAI - GPT Sol - 5.6 (xhigh)

Modo GPT-5.6 Sol de alto razonamiento, contexto de 1M y menor coste por tarea que max.

Ideal para: Codificación diaria con agentes, revisión y flujos con herramientas que aún requieren razonamiento fuerte.

OpenAI

Contexto
1M
Índice AA
59
Coste por tarea
$0.81
Velocidad
61 tok/s
Primer chunk
57.84s
Respuesta total
66.08s
09

Modelo de razonamiento actual

Anthropic - Claude Opus - 5 (medium)

Tier Opus 5 medium equilibrado, contexto de 1M y respuesta total mucho más rápida que tiers superiores.

Ideal para: Sesiones interactivas de código con Claude, refactorizaciones y ciclos de producto.

Anthropic

Contexto
1M
Índice AA
59
Coste por tarea
$0.72
Velocidad
52 tok/s
Primer chunk
8.59s
Respuesta total
18.29s
10

Modelo de razonamiento actual

Alibaba - Qwen - 3.8 Max

Nuevo flagship Qwen 3.8 Max, contexto de 1M, baja latencia inicial e Intelligence Index en el top 10.

Ideal para: Codificación multilingüe, stacks regionales y experimentos de agente centrados en Qwen.

Alibaba

Contexto
1M
Índice AA
58
Coste por tarea
$1.13
Velocidad
47 tok/s
Primer chunk
2.72s
Respuesta total
55.90s
11

Modelo de razonamiento actual

OpenAI - GPT Sol - 5.6 (high)

Tier GPT-5.6 Sol high equilibrado, contexto de 1M y tiempo total de respuesta ágil.

Ideal para: Sesiones interactivas de código, refactorizaciones y ciclos de producto en herramientas OpenAI.

OpenAI

Contexto
1M
Índice AA
57
Coste por tarea
$0.55
Velocidad
56 tok/s
Primer chunk
19.28s
Respuesta total
28.15s
12

Modelo actual; métricas parciales

Meta - Muse Spark - 1.2 (xhigh)

Muse Spark 1.2 xhigh entra en el top 12 con contexto 1M+; velocidad y latencia públicas aún incompletas.

Ideal para: Comparaciones de enrutamiento Meta de contexto largo cuando el Intelligence Index importa más que la latencia publicada.

Meta

Contexto
1.05M
Índice AA
57
Coste por tarea
$0.40
Velocidad
tok/s
Primer chunk
Respuesta total
13

Modelo de razonamiento actual

OpenAI - GPT Terra - 5.6 (max)

Tier GPT-5.6 Terra max, coste por tarea menor que Sol max y salida muy rápida.

Ideal para: Código de contexto largo con foco en coste, cuando el throughput importa más que el primer token.

OpenAI

Contexto
1M
Índice AA
57
Coste por tarea
$0.51
Velocidad
116 tok/s
Primer chunk
194.43s
Respuesta total
198.74s
14

Modelo de razonamiento actual

SpaceXAI - Grok - 4.5 (high)

Grok 4.5 high con latencia rápida, contexto de 500k y menor coste por tarea que Grok 4.6 high.

Ideal para: Ayuda interactiva rápida, bucles de agente de contexto medio y experimentos en ecosistema xAI.

SpaceXAI

Contexto
500k
Índice AA
56
Coste por tarea
$0.36
Velocidad
57 tok/s
Primer chunk
9.32s
Respuesta total
18.11s
15

Modelo de razonamiento actual

OpenAI - GPT Sol - 5.6 (medium)

Tier GPT-5.6 Sol medium equilibra inteligencia, contexto de 1M y bajo tiempo total de respuesta.

Ideal para: La mayoría de ciclos diarios de código OpenAI donde velocidad y calidad importan.

OpenAI

Contexto
1M
Índice AA
56
Coste por tarea
$0.37
Velocidad
57 tok/s
Primer chunk
6.82s
Respuesta total
15.62s
16

Modelo de razonamiento actual

Anthropic - Claude Sonnet - 5 (max)

Perfil Sonnet, alta inteligencia y contexto de 1M, con primera respuesta lenta.

Ideal para: Trabajo largo por lotes donde calidad y contexto importan más que inmediatez.

Anthropic

Contexto
1M
Índice AA
55
Coste por tarea
$1.72
Velocidad
71 tok/s
Primer chunk
191.38s
Respuesta total
198.40s
17

Modelo de razonamiento actual

DeepSeek - DeepSeek V4 Pro - 0813 (max)

Nueva entrada DeepSeek V4 Pro 0813 max en el top 20, contexto de 1M, coste por tarea muy bajo y latencia inicial rápida.

Ideal para: Agentes de código económicos en ecosistema abierto, análisis largo y trabajo DeepSeek Pro sensible a la latencia.

DeepSeek

Contexto
1M
Índice AA
53
Coste por tarea
$0.06
Velocidad
83 tok/s
Primer chunk
1.63s
Respuesta total
31.68s
18

Modelo de razonamiento actual

OpenAI - GPT Terra - 5.6 (xhigh)

GPT-5.6 Terra xhigh combina menor coste por tarea, contexto de 1M y salida rápida.

Ideal para: Código de contexto largo sensible al coste, con alto throughput y latencia inicial aceptable.

OpenAI

Contexto
1M
Índice AA
53
Coste por tarea
$0.31
Velocidad
106 tok/s
Primer chunk
29.77s
Respuesta total
34.49s
19

Modelo de razonamiento actual

Z AI - GLM - 5.2 (max)

Alta posición con contexto de 1M, bajo coste por tarea y latencia inicial muy rápida.

Ideal para: Asistentes de código sensibles al coste, análisis largo y flujos con baja latencia.

Z AI

Contexto
1M
Índice AA
53
Coste por tarea
$0.32
Velocidad
118 tok/s
Primer chunk
1.42s
Respuesta total
22.58s
20

Modelo de razonamiento actual

Anthropic - Claude Opus - 5 (low)

Tier Opus 5 de baja latencia, con contexto de 1M y la respuesta total más rápida de la línea Opus 5.

Ideal para: Pair programming interactivo, arreglos rápidos y planificación ágil en Claude Opus 5.

Anthropic

Contexto
1M
Índice AA
52
Coste por tarea
$0.43
Velocidad
51 tok/s
Primer chunk
3.04s
Respuesta total
12.90s
21

Modelo de razonamiento actual

OpenAI - GPT Luna - 5.6 (max)

Tier GPT-5.6 Luna max, coste por tarea muy bajo, contexto de 1M y salida rápida.

Ideal para: Stacks OpenAI económicos, ediciones por lotes largas y asistentes de código de alto throughput.

OpenAI

Contexto
1M
Índice AA
52
Coste por tarea
$0.05
Velocidad
150 tok/s
Primer chunk
136.64s
Respuesta total
139.97s
22

Modelo de razonamiento actual

DeepSeek - DeepSeek V4 Flash - 0731 (max)

DeepSeek V4 Flash 0731 max, contexto de 1M, coste por tarea muy bajo y latencia inicial rápida.

Ideal para: Agentes de código económicos en ecosistema abierto, análisis largo y ediciones sensibles a la latencia.

DeepSeek

Contexto
1M
Índice AA
52
Coste por tarea
$0.03
Velocidad
122 tok/s
Primer chunk
1.44s
Respuesta total
21.90s
23

Modelo general actual

Google - Gemini - 3.6 Flash

Tier Gemini Flash, contexto de 1M, salida rápida y encaje con el ecosistema Google.

Ideal para: Bucles rápidos en ecosistema Google, lectura de archivos largos y asistentes de alto throughput.

Google

Contexto
1M
Índice AA
52
Coste por tarea
$0.56
Velocidad
229 tok/s
Primer chunk
18.99s
Respuesta total
21.17s
24

Modelo de razonamiento actual

OpenAI - GPT Sol - 5.6 (low)

Tier GPT-5.6 Sol de baja latencia, con contexto de 1M y la respuesta total más rápida de la línea Sol.

Ideal para: Pair programming interactivo, arreglos rápidos y planificación ágil en GPT-5.6 Sol.

OpenAI

Contexto
1M
Índice AA
51
Coste por tarea
$0.23
Velocidad
52 tok/s
Primer chunk
3.07s
Respuesta total
12.74s
25

Modelo de razonamiento actual

OpenAI - GPT Terra - 5.6 (high)

Tier GPT-5.6 Terra high ágil, contexto de 1M y tiempo total de respuesta muy corto.

Ideal para: Codificación interactiva OpenAI donde throughput y baja latencia importan.

OpenAI

Contexto
1M
Índice AA
50
Coste por tarea
$0.22
Velocidad
97 tok/s
Primer chunk
3.79s
Respuesta total
8.94s
26

Modelo de razonamiento actual

OpenAI - GPT Luna - 5.6 (xhigh)

Tier GPT-5.6 Luna xhigh económico, contexto de 1M, coste por tarea muy bajo y salida rápida.

Ideal para: Asistentes OpenAI sensibles al coste y ediciones por lotes de contexto largo.

OpenAI

Contexto
1M
Índice AA
50
Coste por tarea
$0.03
Velocidad
147 tok/s
Primer chunk
50.93s
Respuesta total
54.32s
27

Modelo de razonamiento actual

Kimi - Kimi - K3 (low)

Tier Kimi K3 low mantiene contexto 1M+ y baja el coste por tarea frente a K3 max.

Ideal para: Codificación Kimi de contexto largo sensible al coste cuando el esfuerzo max no es necesario.

Kimi

Contexto
1.05M
Índice AA
48
Coste por tarea
$0.24
Velocidad
37 tok/s
Primer chunk
3.24s
Respuesta total
70.53s
28

Modelo general actual

Google - Gemini - 3.1 Pro Preview

Preview Gemini 3.1 Pro, contexto de 1M y perfil equilibrado de coste/velocidad para stacks Google.

Ideal para: Pruebas de código en Google Cloud, prototipos multimodales y evaluación de contexto largo.

Google

Contexto
1M
Índice AA
48
Coste por tarea
$0.33
Velocidad
114 tok/s
Primer chunk
31.61s
Respuesta total
35.99s
29

Modelo actual; métricas parciales

Motif Technologies - Motif - 3

Motif 3 entra por Intelligence Index, contexto medio; la mayoría de métricas públicas de velocidad y precio aún están incompletas.

Ideal para: Evaluación temprana de Motif 3 cuando la posición en el benchmark importa más que métricas públicas maduras.

Motif Technologies

Contexto
262k
Índice AA
47
Coste por tarea
Velocidad
tok/s
Primer chunk
Respuesta total
30

Modelo de razonamiento actual

OpenAI - GPT Luna - 5.6 (high)

Tier GPT-5.6 Luna high con coste por tarea muy bajo, contexto de 1M y respuestas rápidas.

Ideal para: Asistentes OpenAI de alto volumen y flujos largos con presupuesto ajustado.

OpenAI

Contexto
1M
Índice AA
47
Coste por tarea
$0.02
Velocidad
150 tok/s
Primer chunk
15.32s
Respuesta total
18.66s
31

Modelo de razonamiento actual

OpenAI - GPT Terra - 5.6 (medium)

Tier GPT-5.6 Terra medium de baja latencia, contexto de 1M y respuesta extremo a extremo muy corta.

Ideal para: Codificación interactiva ágil, refactorizaciones y bucles de agente OpenAI con muchas herramientas.

OpenAI

Contexto
1M
Índice AA
47
Coste por tarea
$0.12
Velocidad
97 tok/s
Primer chunk
1.78s
Respuesta total
6.96s
32

Modelo actual; métricas parciales

Google - Gemini - 3.5 Flash (medium)

Modo Gemini 3.5 Flash medium, contexto de 1M y salida rápida; el coste por tarea no está del todo público en esta instantánea.

Ideal para: Experimentos en ecosistema Google donde la velocidad Flash medium importa más que el coste publicado.

Google

Contexto
1M
Índice AA
47
Coste por tarea
Velocidad
162 tok/s
Primer chunk
17.53s
Respuesta total
20.60s
33

Modelo actual; métricas parciales

OpenAI - GPT Codex - 5.3 (xhigh)

Tier GPT-5.3 Codex xhigh centrado en código; el coste por tarea no está del todo público en esta instantánea.

Ideal para: Tareas de software centradas en Codex, ediciones de repo y flujos de agent OpenAI.

OpenAI

Contexto
400k
Índice AA
46
Coste por tarea
Velocidad
106 tok/s
Primer chunk
73.50s
Respuesta total
78.22s
34

Modelo de razonamiento actual

MiniMax - MiniMax - M3

MiniMax M3 con contexto de 1M, bajo coste por tarea y baja latencia inicial.

Ideal para: Asistentes de código sensibles al coste, stacks regionales y ediciones interactivas de baja latencia.

MiniMax

Contexto
1M
Índice AA
45
Coste por tarea
$0.14
Velocidad
83 tok/s
Primer chunk
1.65s
Respuesta total
31.83s
35

Modelo actual; métricas parciales

Motif Technologies - Motif - 3 (Beta)

Motif 3 Beta entra por Intelligence Index; la mayoría de métricas públicas de velocidad y precio aún están incompletas.

Ideal para: Evaluación temprana de proveedores emergentes cuando la posición en el benchmark importa más que métricas maduras.

Motif Technologies

Contexto
262k
Índice AA
45
Coste por tarea
Velocidad
tok/s
Primer chunk
Respuesta total
36

Modelo de razonamiento actual

DeepSeek - DeepSeek V4 Pro - max

DeepSeek V4 Pro max anterior (pre-0813), contexto de 1M y coste por tarea muy bajo; respuesta total más larga que 0813.

Ideal para: Agentes de código económicos, evaluación self-hosted y trabajo largo sensible al coste.

DeepSeek

Contexto
1M
Índice AA
45
Coste por tarea
$0.05
Velocidad
67 tok/s
Primer chunk
1.68s
Respuesta total
73.96s
37

Modelo de razonamiento actual

DeepSeek - DeepSeek V4 Pro - high

Tier DeepSeek V4 Pro high, contexto de 1M, bajo coste por tarea y menor latencia que max.

Ideal para: Codificación interactiva sensible al coste y análisis largo en endpoints DeepSeek.

DeepSeek

Contexto
1M
Índice AA
44
Coste por tarea
$0.04
Velocidad
63 tok/s
Primer chunk
1.74s
Respuesta total
41.34s
38

Modelo de razonamiento actual

Kimi - Kimi - K2.7 Code

Entrada Kimi K2.7 Code orientada a código, contexto de 256k y coste por tarea publicado.

Ideal para: Flujos Kimi centrados en código cuando no necesitas la ventana completa de 1M de K3.

Kimi

Contexto
256k
Índice AA
43
Coste por tarea
$0.22
Velocidad
38 tok/s
Primer chunk
2.83s
Respuesta total
74.36s
39

Modelo de razonamiento actual

Xiaomi - MiMo - V2.5-Pro

Xiaomi MiMo V2.5-Pro, contexto de 1M y coste por tarea muy bajo para stacks regionales.

Ideal para: Codificación multilingüe económica, APIs regionales y asistentes largos de bajo coste.

Xiaomi

Contexto
1M
Índice AA
43
Coste por tarea
$0.03
Velocidad
46 tok/s
Primer chunk
3.32s
Respuesta total
57.11s
40

Modelo general actual

Anthropic - Claude Sonnet - 5 (Non-reasoning)

Claude Sonnet 5 sin razonamiento, contexto de 1M, baja latencia y coste más ligero que max.

Ideal para: Codificación diaria con Claude, ediciones rápidas y sesiones interactivas sin razonamiento profundo.

Anthropic

Contexto
1M
Índice AA
43
Coste por tarea
$0.42
Velocidad
60 tok/s
Primer chunk
1.92s
Respuesta total
10.21s
41

Modelo de razonamiento actual

Thinking Machines - Inkling - base

Inkling de Thinking Machines con contexto de 1M, coste por tarea publicado y buena latencia inicial.

Ideal para: Evaluación de contexto largo de labs más nuevos con precio y latencia publicados.

Thinking Machines

Contexto
1M
Índice AA
42
Coste por tarea
$0.34
Velocidad
74 tok/s
Primer chunk
1.86s
Respuesta total
35.45s
42

Modelo de razonamiento actual

Tencent - Hy3 - base

Tencent Hy3, contexto medio, coste por tarea muy bajo y latencia inicial competitiva.

Ideal para: Stacks regionales de código, asistentes económicos y experimentos en ecosistema Tencent.

Tencent

Contexto
256k
Índice AA
42
Coste por tarea
$0.04
Velocidad
63 tok/s
Primer chunk
2.88s
Respuesta total
42.48s
43

Modelo actual; métricas parciales

Nex AGI - Nex - N2-Pro

Nex N2-Pro entra con contexto medio y salida rápida; el coste por tarea no está del todo público aquí.

Ideal para: Evaluación de proveedores emergentes y experimentos de código de baja latencia fuera de los grandes labs.

Nex AGI

Contexto
262k
Índice AA
42
Coste por tarea
Velocidad
137 tok/s
Primer chunk
1.68s
Respuesta total
19.92s
44

Modelo general actual

OpenAI - GPT Sol - 5.6 (Non-reasoning)

GPT-5.6 Sol sin razonamiento, contexto de 1M y la menor latencia inicial de la línea Sol.

Ideal para: Bucles de código OpenAI más rápidos cuando el razonamiento extendido no es necesario.

OpenAI

Contexto
1M
Índice AA
42
Coste por tarea
$0.24
Velocidad
59 tok/s
Primer chunk
1.33s
Respuesta total
9.86s
45

Modelo actual; métricas parciales

Upstage - Solar Pro - 4

Upstage Solar Pro 4, contexto de 512k y velocidad publicada; el coste por tarea no está del todo público en esta instantánea.

Ideal para: Stacks regionales y document-heavy evaluando modelos Upstage por Intelligence Index.

Upstage

Contexto
512k
Índice AA
42
Coste por tarea
Velocidad
65 tok/s
Primer chunk
2.18s
Respuesta total
40.51s
46

Modelo de razonamiento actual

OpenAI - GPT Terra - 5.6 (low)

Tier GPT-5.6 Terra low de baja latencia, contexto de 1M y respuesta extremo a extremo muy corta.

Ideal para: Codificación OpenAI interactiva rápida y refactorizaciones ágiles cuando el razonamiento máximo no es necesario.

OpenAI

Contexto
1M
Índice AA
41
Coste por tarea
$0.09
Velocidad
91 tok/s
Primer chunk
1.73s
Respuesta total
7.20s
47

Modelo de razonamiento actual

Thinking Machines - Inkling Small - base

Variante menor de Inkling, contexto de 1M, bajo coste por tarea y salida más rápida que Inkling base.

Ideal para: Evaluación económica de modelos Thinking Machines con objetivos más ajustados de latencia y coste.

Thinking Machines

Contexto
1M
Índice AA
41
Coste por tarea
$0.07
Velocidad
128 tok/s
Primer chunk
1.58s
Respuesta total
21.06s
48

Modelo actual; métricas parciales

China Mobile - JT - 4.1 Flash 236B A21B

JT-4.1 Flash de China Mobile entra por Intelligence Index; la mayoría de métricas públicas de precio y velocidad aún están incompletas.

Ideal para: Evaluación de stacks regionales China Mobile cuando la posición en el benchmark es la señal principal.

China Mobile

Contexto
256k
Índice AA
40
Coste por tarea
Velocidad
tok/s
Primer chunk
Respuesta total
49

Modelo actual; métricas parciales

Sapiens AI - Agnes - 2.5 Pro Alpha

Agnes 2.5 Pro Alpha con contexto de 1M y salida rápida; el coste por tarea no está del todo público aquí.

Ideal para: Evaluación temprana de contexto largo de modelos emergentes de Sapiens AI.

Sapiens AI

Contexto
1M
Índice AA
40
Coste por tarea
Velocidad
131 tok/s
Primer chunk
2.37s
Respuesta total
21.42s
50

Modelo de razonamiento actual

Alibaba - Qwen - 3.7 Plus

Qwen 3.7 Plus con contexto de 1M, menor coste por tarea que Qwen 3.8 Max y tiempo total de respuesta moderado.

Ideal para: Agentes de código Qwen sensibles al coste y ciclos de producto multilingües.

Alibaba

Contexto
1M
Índice AA
39
Coste por tarea
$0.24
Velocidad
56 tok/s
Primer chunk
2.13s
Respuesta total
46.67s