返回 AI Coding

AI 大模型排名

AI 代码大模型排名

榜单快照:2026-08-13 · 最后复核:2026-08-13

方法说明

以下指标来自 Artificial Analysis 公开 LLM 榜单的某个快照:智能指数、任务成本与速度反映的是快照当天的跑分表现。厂商价格、可用性与排名会频繁变化,跑分高也不代表在你的具体代码库或工作流中就是最佳选择。

来源
Artificial Analysis
最后复核
2026-08-13

Top 50 大模型

01

当前推理模型

Anthropic - Claude Opus - 5 (max)

Claude Opus 5 max 在本快照中以智能指数 63 领跑,支持 1M 上下文。

适合场景: 适合前沿代码库分析、复杂规划,以及需要顶级推理的高价值 agent 任务。

Anthropic

上下文
1M
AA 指数
63
任务成本
$2.34
速度
52 tok/s
首块延迟
60.92s
总响应
70.52s
02

当前推理模型

Anthropic - Claude Opus - 5 (xhigh)

与 max 并列最高智能指数,任务成本更低,首块延迟明显更快。

适合场景: 适合仍需前沿质量、又希望延迟更好的多文件修改与 coding agent。

Anthropic

上下文
1M
AA 指数
63
任务成本
$1.80
速度
52 tok/s
首块延迟
25.75s
总响应
35.32s
03

当前推理模型

Anthropic - Claude Fable - 5

智能指数仍处最前列,支持 1M 级上下文,输出速度较强。

适合场景: 适合深度代码库分析、复杂规划,以及能接受较高延迟的高价值 agent 任务。

Anthropic

上下文
1M
AA 指数
62
任务成本
$3.14
速度
63 tok/s
首块延迟
113.68s
总响应
121.60s
04

当前推理模型

Anthropic - Claude Opus - 5 (high)

Opus 5 高推理档,延迟明显低于 max/xhigh,排名仍靠前。

适合场景: 适合日常 Claude agent 编程、代码审查和仍需强推理的工具调用工作流。

Anthropic

上下文
1M
AA 指数
61
任务成本
$1.23
速度
51 tok/s
首块延迟
13.43s
总响应
23.32s
05

当前推理模型

OpenAI - GPT Sol - 5.6 (max)

本快照中 OpenAI 推理线前列档位,1M 上下文,智能指数强。

适合场景: 适合 OpenAI 生态 coding agent、长上下文规划和最高推理档软件任务。

OpenAI

上下文
1M
AA 指数
61
任务成本
$1.23
速度
62 tok/s
首块延迟
155.41s
总响应
163.54s
06

当前推理模型

SpaceXAI - Grok - 4.6 (high)

新上榜的 Grok 4.6 high 接近前列,500k 上下文,任务成本低于 Claude/OpenAI 的 max 档。

适合场景: 适合 xAI 生态 coding agent、中等上下文规划,以及成本可控的前沿实验。

SpaceXAI

上下文
500k
AA 指数
61
任务成本
$0.84
速度
66 tok/s
首块延迟
32.30s
总响应
39.89s
07

当前推理模型

Kimi - Kimi - K3 (max)

Moonshot K3 max 旗舰,1M+ 上下文,代码能力突出;总响应仍偏长。

适合场景: 适合长时程 coding agent、前端生成、区域 API 栈和成本可控的 1M 上下文任务。

Kimi

上下文
1.05M
AA 指数
60
任务成本
$0.84
速度
41 tok/s
首块延迟
3.27s
总响应
64.72s
08

当前推理模型

OpenAI - GPT Sol - 5.6 (xhigh)

GPT-5.6 Sol 高推理档,1M 上下文,任务成本低于 max。

适合场景: 适合日常 agent 编程、代码审查和仍需强推理的工具调用工作流。

OpenAI

上下文
1M
AA 指数
59
任务成本
$0.81
速度
61 tok/s
首块延迟
57.84s
总响应
66.08s
09

当前推理模型

Anthropic - Claude Opus - 5 (medium)

Opus 5 medium 平衡档,1M 上下文,总响应明显快于更高档位。

适合场景: 适合交互式 Claude 编程、重构和产品工程循环。

Anthropic

上下文
1M
AA 指数
59
任务成本
$0.72
速度
52 tok/s
首块延迟
8.59s
总响应
18.29s
10

当前推理模型

Alibaba - Qwen - 3.8 Max

新上榜的 Qwen 3.8 Max 旗舰,1M 上下文,首块延迟低,智能指数进入前十。

适合场景: 适合多语言编程、区域 API 栈和以 Qwen 为中心的 agent 实验。

Alibaba

上下文
1M
AA 指数
58
任务成本
$1.13
速度
47 tok/s
首块延迟
2.72s
总响应
55.90s
11

当前推理模型

OpenAI - GPT Sol - 5.6 (high)

GPT-5.6 Sol high 平衡档,1M 上下文,总响应时间较友好。

适合场景: 适合 OpenAI 工具内的交互式编程、重构和产品工程循环。

OpenAI

上下文
1M
AA 指数
57
任务成本
$0.55
速度
56 tok/s
首块延迟
19.28s
总响应
28.15s
12

当前模型;部分指标未公开

Meta - Muse Spark - 1.2 (xhigh)

Muse Spark 1.2 xhigh 以 1M+ 上下文进入前 12;公开速度与延迟指标仍不完整。

适合场景: 适合更看重智能指数、而非已公开延迟的长上下文 Meta 模型路由对比。

Meta

上下文
1.05M
AA 指数
57
任务成本
$0.40
速度
tok/s
首块延迟
总响应
13

当前推理模型

OpenAI - GPT Terra - 5.6 (max)

GPT-5.6 Terra max 档,任务成本低于 Sol max,输出速度很快。

适合场景: 适合成本敏感、长上下文编程,且吞吐比首 token 速度更重要的场景。

OpenAI

上下文
1M
AA 指数
57
任务成本
$0.51
速度
116 tok/s
首块延迟
194.43s
总响应
198.74s
14

当前推理模型

SpaceXAI - Grok - 4.5 (high)

Grok 4.5 high,延迟快,500k 上下文,任务成本低于 Grok 4.6 high。

适合场景: 适合快速交互式编程辅助、中等上下文 agent 循环和 xAI 生态实验。

SpaceXAI

上下文
500k
AA 指数
56
任务成本
$0.36
速度
57 tok/s
首块延迟
9.32s
总响应
18.11s
15

当前推理模型

OpenAI - GPT Sol - 5.6 (medium)

GPT-5.6 Sol medium 档,在智能、1M 上下文和低总响应之间取得平衡。

适合场景: 适合大多数日常 OpenAI 编程循环,速度与质量都重要。

OpenAI

上下文
1M
AA 指数
56
任务成本
$0.37
速度
57 tok/s
首块延迟
6.82s
总响应
15.62s
16

当前推理模型

Anthropic - Claude Sonnet - 5 (max)

Sonnet 档位,智能指数高、上下文 1M,但首块响应较慢。

适合场景: 适合质量和上下文优先、实时性要求不高的长任务。

Anthropic

上下文
1M
AA 指数
55
任务成本
$1.72
速度
71 tok/s
首块延迟
191.38s
总响应
198.40s
17

当前推理模型

DeepSeek - DeepSeek V4 Pro - 0813 (max)

新上榜的 DeepSeek V4 Pro 0813 max 进入前 20,1M 上下文,任务成本很低,首块延迟很快。

适合场景: 适合预算型开源生态 coding agent、长上下文分析和低延迟的 DeepSeek Pro 任务。

DeepSeek

上下文
1M
AA 指数
53
任务成本
$0.06
速度
83 tok/s
首块延迟
1.63s
总响应
31.68s
18

当前推理模型

OpenAI - GPT Terra - 5.6 (xhigh)

GPT-5.6 Terra xhigh,任务成本较低、1M 上下文、输出速度较快。

适合场景: 适合成本敏感的长上下文编程,吞吐强、首块延迟可接受。

OpenAI

上下文
1M
AA 指数
53
任务成本
$0.31
速度
106 tok/s
首块延迟
29.77s
总响应
34.49s
19

当前推理模型

Z AI - GLM - 5.2 (max)

排名高,支持 1M 上下文,任务成本低,首块延迟很快。

适合场景: 适合成本敏感的代码助手、长上下文分析和低延迟工作流。

Z AI

上下文
1M
AA 指数
53
任务成本
$0.32
速度
118 tok/s
首块延迟
1.42s
总响应
22.58s
20

当前推理模型

Anthropic - Claude Opus - 5 (low)

低延迟 Opus 5 档,保留 1M 上下文,Opus 5 系列总响应最快。

适合场景: 适合 Claude Opus 5 上的交互式结对编程、快速修复和快速规划循环。

Anthropic

上下文
1M
AA 指数
52
任务成本
$0.43
速度
51 tok/s
首块延迟
3.04s
总响应
12.90s
21

当前推理模型

OpenAI - GPT Luna - 5.6 (max)

GPT-5.6 Luna max 档,任务成本很低、1M 上下文、输出速度很快。

适合场景: 适合预算型 OpenAI 栈、长上下文批量修改和高吞吐代码助手。

OpenAI

上下文
1M
AA 指数
52
任务成本
$0.05
速度
150 tok/s
首块延迟
136.64s
总响应
139.97s
22

当前推理模型

DeepSeek - DeepSeek V4 Flash - 0731 (max)

DeepSeek V4 Flash 0731 max,1M 上下文,任务成本很低,首块延迟很快。

适合场景: 适合预算型开源生态 coding agent、长上下文分析和低延迟修改。

DeepSeek

上下文
1M
AA 指数
52
任务成本
$0.03
速度
122 tok/s
首块延迟
1.44s
总响应
21.90s
23

当前通用模型

Google - Gemini - 3.6 Flash

Gemini Flash 档,1M 上下文,输出速度很快,适合 Google 生态。

适合场景: 适合 Google 技术栈上的快速编程循环、长文件浏览和高吞吐助手任务。

Google

上下文
1M
AA 指数
52
任务成本
$0.56
速度
229 tok/s
首块延迟
18.99s
总响应
21.17s
24

当前推理模型

OpenAI - GPT Sol - 5.6 (low)

低延迟 GPT-5.6 Sol 档,保留 1M 上下文,Sol 系列总响应最快。

适合场景: 适合 GPT-5.6 Sol 上的交互式结对编程、快速修复和快速规划循环。

OpenAI

上下文
1M
AA 指数
51
任务成本
$0.23
速度
52 tok/s
首块延迟
3.07s
总响应
12.74s
25

当前推理模型

OpenAI - GPT Terra - 5.6 (high)

响应快的 GPT-5.6 Terra high 档,1M 上下文,总响应时间很短。

适合场景: 适合吞吐和低延迟都重要的交互式 OpenAI 编程。

OpenAI

上下文
1M
AA 指数
50
任务成本
$0.22
速度
97 tok/s
首块延迟
3.79s
总响应
8.94s
26

当前推理模型

OpenAI - GPT Luna - 5.6 (xhigh)

预算型 GPT-5.6 Luna xhigh 档,1M 上下文,任务成本很低,输出速度较快。

适合场景: 适合成本敏感的 OpenAI 代码助手和长上下文批量修改。

OpenAI

上下文
1M
AA 指数
50
任务成本
$0.03
速度
147 tok/s
首块延迟
50.93s
总响应
54.32s
27

当前推理模型

Kimi - Kimi - K3 (low)

Kimi K3 low 档保留 1M+ 上下文,任务成本低于 K3 max。

适合场景: 适合不需要 max 推理力度、但想控制成本的 Kimi 长上下文编程。

Kimi

上下文
1.05M
AA 指数
48
任务成本
$0.24
速度
37 tok/s
首块延迟
3.24s
总响应
70.53s
28

当前通用模型

Google - Gemini - 3.1 Pro Preview

Gemini 3.1 Pro 预览版,1M 上下文,成本与速度在 Google 生态中较均衡。

适合场景: 适合 Google Cloud 编程试用、多模态原型和长上下文预览评估。

Google

上下文
1M
AA 指数
48
任务成本
$0.33
速度
114 tok/s
首块延迟
31.61s
总响应
35.99s
29

当前模型;部分指标未公开

Motif Technologies - Motif - 3

Motif 3 靠智能指数上榜,中等上下文;多数公开速度与价格指标仍不完整。

适合场景: 适合在公开指标尚不成熟、但仍想对照榜单位次时,评估 Motif 3。

Motif Technologies

上下文
262k
AA 指数
47
任务成本
速度
tok/s
首块延迟
总响应
30

当前推理模型

OpenAI - GPT Luna - 5.6 (high)

任务成本很低的 GPT-5.6 Luna high 档,1M 上下文,响应较快。

适合场景: 适合高用量 OpenAI 代码助手和预算型长上下文工作流。

OpenAI

上下文
1M
AA 指数
47
任务成本
$0.02
速度
150 tok/s
首块延迟
15.32s
总响应
18.66s
31

当前推理模型

OpenAI - GPT Terra - 5.6 (medium)

低延迟 GPT-5.6 Terra medium 档,1M 上下文,端到端响应很短。

适合场景: 适合轻快的交互式编程、重构和工具调用密集的 OpenAI agent 循环。

OpenAI

上下文
1M
AA 指数
47
任务成本
$0.12
速度
97 tok/s
首块延迟
1.78s
总响应
6.96s
32

当前模型;部分指标未公开

Google - Gemini - 3.5 Flash (medium)

Gemini 3.5 Flash medium 模式,1M 上下文、输出快;本快照未完全公开任务成本。

适合场景: 适合更看重 Flash medium 速度、而非已公布任务成本的 Google 生态实验。

Google

上下文
1M
AA 指数
47
任务成本
速度
162 tok/s
首块延迟
17.53s
总响应
20.60s
33

当前模型;部分指标未公开

OpenAI - GPT Codex - 5.3 (xhigh)

GPT-5.3 Codex xhigh 编程向档位;本快照未完全公开任务成本。

适合场景: 适合以 Codex 为中心的软件任务、仓库修改和 OpenAI coding agent 工作流。

OpenAI

上下文
400k
AA 指数
46
任务成本
速度
106 tok/s
首块延迟
73.50s
总响应
78.22s
34

当前推理模型

MiniMax - MiniMax - M3

MiniMax M3,1M 上下文,任务成本低,首块延迟低。

适合场景: 适合成本敏感的代码助手、区域技术栈和低延迟交互式修改。

MiniMax

上下文
1M
AA 指数
45
任务成本
$0.14
速度
83 tok/s
首块延迟
1.65s
总响应
31.83s
35

当前模型;部分指标未公开

Motif Technologies - Motif - 3 (Beta)

Motif 3 Beta 靠智能指数上榜;多数公开速度与价格指标仍不完整。

适合场景: 适合在指标尚不成熟、但仍想对照榜单位次时,评估新兴模型厂商。

Motif Technologies

上下文
262k
AA 指数
45
任务成本
速度
tok/s
首块延迟
总响应
36

当前推理模型

DeepSeek - DeepSeek V4 Pro - max

较早的 DeepSeek V4 Pro max(0813 之前),1M 上下文,任务成本很低;总响应长于 0813。

适合场景: 适合预算型 coding agent、自托管评估和成本敏感的长上下文任务。

DeepSeek

上下文
1M
AA 指数
45
任务成本
$0.05
速度
67 tok/s
首块延迟
1.68s
总响应
73.96s
37

当前推理模型

DeepSeek - DeepSeek V4 Pro - high

DeepSeek V4 Pro high 档,1M 上下文,任务成本低,延迟低于 max。

适合场景: 适合成本敏感的交互式编程,以及 DeepSeek 端点上的长上下文分析。

DeepSeek

上下文
1M
AA 指数
44
任务成本
$0.04
速度
63 tok/s
首块延迟
1.74s
总响应
41.34s
38

当前推理模型

Kimi - Kimi - K2.7 Code

Kimi K2.7 Code 编程向条目,256k 上下文,任务成本已公开。

适合场景: 适合不需要完整 1M K3 上下文时的 Kimi 代码工作流。

Kimi

上下文
256k
AA 指数
43
任务成本
$0.22
速度
38 tok/s
首块延迟
2.83s
总响应
74.36s
39

当前推理模型

Xiaomi - MiMo - V2.5-Pro

小米 MiMo V2.5-Pro,1M 上下文,任务成本很低,适合区域技术栈。

适合场景: 适合预算型多语言编程、区域 API 和低成本长上下文助手。

Xiaomi

上下文
1M
AA 指数
43
任务成本
$0.03
速度
46 tok/s
首块延迟
3.32s
总响应
57.11s
40

当前通用模型

Anthropic - Claude Sonnet - 5 (Non-reasoning)

非推理 Claude Sonnet 5,1M 上下文,延迟低,成本档位轻于 max。

适合场景: 适合日常 Claude 编程、快速修改,以及不需要深度推理的交互会话。

Anthropic

上下文
1M
AA 指数
43
任务成本
$0.42
速度
60 tok/s
首块延迟
1.92s
总响应
10.21s
41

当前推理模型

Thinking Machines - Inkling - base

Thinking Machines 的 Inkling,1M 上下文,任务成本已公开,首块延迟不错。

适合场景: 适合在已有公开定价与延迟时,评估新实验室的长上下文能力。

Thinking Machines

上下文
1M
AA 指数
42
任务成本
$0.34
速度
74 tok/s
首块延迟
1.86s
总响应
35.45s
42

当前推理模型

Tencent - Hy3 - base

腾讯 Hy3,中等上下文,任务成本很低,首块延迟有竞争力。

适合场景: 适合区域编程技术栈、预算型助手和腾讯生态实验。

Tencent

上下文
256k
AA 指数
42
任务成本
$0.04
速度
63 tok/s
首块延迟
2.88s
总响应
42.48s
43

当前模型;部分指标未公开

Nex AGI - Nex - N2-Pro

Nex N2-Pro 以中等上下文和较快输出上榜;本快照任务成本未完全公开。

适合场景: 适合评估新兴厂商,以及主流实验室之外的低延迟编程实验。

Nex AGI

上下文
262k
AA 指数
42
任务成本
速度
137 tok/s
首块延迟
1.68s
总响应
19.92s
44

当前通用模型

OpenAI - GPT Sol - 5.6 (Non-reasoning)

非推理 GPT-5.6 Sol,1M 上下文,Sol 系列首块延迟最低。

适合场景: 适合不需要长推理、但想更快响应的 OpenAI 编程循环。

OpenAI

上下文
1M
AA 指数
42
任务成本
$0.24
速度
59 tok/s
首块延迟
1.33s
总响应
9.86s
45

当前模型;部分指标未公开

Upstage - Solar Pro - 4

Upstage Solar Pro 4,512k 上下文,速度已公开;本快照任务成本未完全公开。

适合场景: 适合按智能指数评估 Upstage 模型的区域与文档密集型编程栈。

Upstage

上下文
512k
AA 指数
42
任务成本
速度
65 tok/s
首块延迟
2.18s
总响应
40.51s
46

当前推理模型

OpenAI - GPT Terra - 5.6 (low)

低延迟 GPT-5.6 Terra low 档,1M 上下文,端到端响应很短。

适合场景: 适合不需要最高推理档的快速交互式 OpenAI 编程与快速重构。

OpenAI

上下文
1M
AA 指数
41
任务成本
$0.09
速度
91 tok/s
首块延迟
1.73s
总响应
7.20s
47

当前推理模型

Thinking Machines - Inkling Small - base

较小的 Inkling 变体,1M 上下文,任务成本低,输出速度快于基础 Inkling。

适合场景: 适合对延迟和成本更敏感时,评估 Thinking Machines 模型。

Thinking Machines

上下文
1M
AA 指数
41
任务成本
$0.07
速度
128 tok/s
首块延迟
1.58s
总响应
21.06s
48

当前模型;部分指标未公开

China Mobile - JT - 4.1 Flash 236B A21B

中国移动 JT-4.1 Flash 靠智能指数上榜;多数公开价格与速度指标仍不完整。

适合场景: 适合以榜单位次为主要信号时,评估中国移动区域技术栈。

China Mobile

上下文
256k
AA 指数
40
任务成本
速度
tok/s
首块延迟
总响应
49

当前模型;部分指标未公开

Sapiens AI - Agnes - 2.5 Pro Alpha

Agnes 2.5 Pro Alpha,1M 上下文,输出速度较快;本快照任务成本未完全公开。

适合场景: 适合对 Sapiens AI 新兴模型做早期长上下文评估。

Sapiens AI

上下文
1M
AA 指数
40
任务成本
速度
131 tok/s
首块延迟
2.37s
总响应
21.42s
50

当前推理模型

Alibaba - Qwen - 3.7 Plus

Qwen 3.7 Plus,1M 上下文,任务成本低于 Qwen 3.8 Max,总响应中等。

适合场景: 适合成本敏感的 Qwen coding agent 和多语言产品工程循环。

Alibaba

上下文
1M
AA 指数
39
任务成本
$0.24
速度
56 tok/s
首块延迟
2.13s
总响应
46.67s