返回 AI Coding

AI 大模型排名

AI 代码大模型排名

Artificial Analysis Top 50。

榜单快照:2026-10-03 · 最后复核:2026-10-03

方法说明

以下指标来自 Artificial Analysis 公开 LLM 榜单的某个快照:智能指数、任务成本与速度反映的是快照当天的跑分表现。厂商价格、可用性与排名会频繁变化,跑分高也不代表在你的具体代码库或工作流中就是最佳选择。

来源
Artificial Analysis
最后复核
2026-10-03

Top 50 大模型

01

当前推理模型

Anthropic - Claude Opus - 5.5 (max)

Claude Opus 5.5 max 以智能指数 58 领跑本快照,1M 上下文,任务成本 $5.98。中位 93 tok/s,首块 689.18s。

适合场景: 适合更看重榜首智能指数、可以接受很长首块等待的最高力度 Claude Opus 任务。

Anthropic

上下文
1M
AA 指数
58
任务成本
$5.98
速度
93 tok/s
首块延迟
689.18s
总响应
694.56s
02

当前推理模型

Anthropic - Claude Sonnet - 5.5 (max)

Claude Sonnet 5.5 max 位列第 2,智能指数 56,1M 上下文。任务成本 $7.67,是前十里最高的;首块 428.36s。

适合场景: 适合更看重智能指数、可以接受更高任务成本和较长等待的最高力度 Claude Sonnet 任务。

Anthropic

上下文
1M
AA 指数
56
任务成本
$7.67
速度
139 tok/s
首块延迟
428.36s
总响应
431.95s
03

当前推理模型

Anthropic - Claude Opus - 5.5 (xhigh)

Claude Opus 5.5 xhigh 与 Sonnet 5.5 max 同为智能指数 56,1M 上下文,任务成本 $3.46。首块 140.81s,短于 Sonnet 5.5 max。

适合场景: 适合要与 Sonnet 5.5 max 相同智能指数、又希望任务成本更低的高力度 Opus 5.5 编程。

Anthropic

上下文
1M
AA 指数
56
任务成本
$3.46
速度
83 tok/s
首块延迟
140.81s
总响应
146.82s
04

当前推理模型

Anthropic - Claude Opus - 5.5 (high)

Claude Opus 5.5 high 位列第 4,智能指数 54,1M 上下文。任务成本 $1.82,首块 37.37s,远低于 Opus 5.5 xhigh。

适合场景: 适合仍需较高智能指数、又不想等 xhigh 档首块的 Claude Opus 5.5 编程。

Anthropic

上下文
1M
AA 指数
54
任务成本
$1.82
速度
80 tok/s
首块延迟
37.37s
总响应
43.64s
05

当前推理模型

Anthropic - Claude Fable - 5.1 (max)

Claude Fable 5.1 max 位列第 5,智能指数 53,1M 上下文。任务成本 $7.63,仅次于 Sonnet 5.5 max;首块 186.52s。

适合场景: 适合更看重智能指数、可以接受较高任务成本和等待的最高力度 Claude Fable 任务。

Anthropic

上下文
1M
AA 指数
53
任务成本
$7.63
速度
67 tok/s
首块延迟
186.52s
总响应
193.93s
06

当前推理模型

Anthropic - Claude Fable - 5.1 (xhigh)

Claude Fable 5.1 xhigh 智能指数仍是 53,与 Fable 5.1 max 并列,1M 上下文,任务成本 $5.98。首块 96.75s,短于 Fable 5.1 max。

适合场景: 适合觉得 max 任务成本太高、但仍要相同智能指数的高力度 Fable 5.1 编程。

Anthropic

上下文
1M
AA 指数
53
任务成本
$5.98
速度
66 tok/s
首块延迟
96.75s
总响应
104.30s
07

当前推理模型

OpenAI - GPT Astra - 6 (max)

GPT-6 Astra max 位列第 7,智能指数 53,1M 上下文。任务成本 $3.26,低于 Fable 5.1 max;首块 319.00s。

适合场景: 适合能接受很长首块等待的 OpenAI 前沿 agent。

OpenAI

上下文
1M
AA 指数
53
任务成本
$3.26
速度
54 tok/s
首块延迟
319.00s
总响应
328.32s
08

当前模型;部分指标未公开

Google - Gemini - 4 Argon (high)

Gemini 4 Argon high 位列第 8,智能指数 53,与多款 53 分模型并列,1M 上下文,任务成本 $1.99。输出速度与延迟尚未公布。

适合场景: 适合更看重智能指数、可以接受速度尚未公开的 Google 前沿编程。

Google

上下文
1M
AA 指数
53
任务成本
$1.99
速度
— tok/s
首块延迟
—
总响应
—
09

当前推理模型

OpenAI - GPT Astra - 6 (xhigh)

GPT-6 Astra xhigh 位列第 9,智能指数 52,1M 上下文,任务成本 $2.31。首块 144.37s,短于 Astra max。

适合场景: 适合需要接近 max 的 Astra 质量、又希望任务成本更低的 OpenAI coding agent。

OpenAI

上下文
1M
AA 指数
52
任务成本
$2.31
速度
49 tok/s
首块延迟
144.37s
总响应
154.50s
10

当前推理模型

Anthropic - Claude Sonnet - 5.5 (xhigh)

Claude Sonnet 5.5 xhigh 位列第 10,智能指数 52,1M 上下文。任务成本 $2.75,中位 104 tok/s,首块 33.63s,远低于 Sonnet 5.5 max。

适合场景: 适合仍需较高智能指数、又不想等 max 档首块的 Claude Sonnet 5.5 编程。

Anthropic

上下文
1M
AA 指数
52
任务成本
$2.75
速度
104 tok/s
首块延迟
33.63s
总响应
38.45s
11

当前推理模型

OpenAI - GPT Sol - 6.1 (max)

OpenAI GPT Sol 6.1 (max) 在本快照中智能指数 52,1M 上下文,任务成本 $0.72,中位 57 tok/s,首块 282.35s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
52
任务成本
$0.72
速度
57 tok/s
首块延迟
282.35s
总响应
291.13s
12

当前推理模型

Anthropic - Claude Opus - 5.5 (medium)

Anthropic Claude Opus 5.5 (medium) 在本快照中智能指数 51,1M 上下文,任务成本 $1.34,中位 73 tok/s,首块 25.24s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
51
任务成本
$1.34
速度
73 tok/s
首块延迟
25.24s
总响应
32.06s
13

当前推理模型

Anthropic - Claude Fable - 5.1 (high)

Anthropic Claude Fable 5.1 (high) 在本快照中智能指数 51,1M 上下文,任务成本 $3.91,中位 56 tok/s,首块 25.00s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
51
任务成本
$3.91
速度
56 tok/s
首块延迟
25.00s
总响应
33.93s
14

当前推理模型

OpenAI - GPT Sol - 6.1 (xhigh)

OpenAI GPT Sol 6.1 (xhigh) 在本快照中智能指数 51,1M 上下文,任务成本 $0.39,中位 51 tok/s,首块 128.47s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
51
任务成本
$0.39
速度
51 tok/s
首块延迟
128.47s
总响应
138.37s
15

当前推理模型

OpenAI - GPT Astra - 6 (high)

OpenAI GPT Astra 6 (high) 在本快照中智能指数 51,1M 上下文,任务成本 $1.73,中位 48 tok/s,首块 65.56s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
51
任务成本
$1.73
速度
48 tok/s
首块延迟
65.56s
总响应
76.04s
16

当前推理模型

OpenAI - GPT Sol - 6.1 (high)

OpenAI GPT Sol 6.1 (high) 在本快照中智能指数 50,1M 上下文,任务成本 $0.32,中位 50 tok/s,首块 57.71s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
50
任务成本
$0.32
速度
50 tok/s
首块延迟
57.71s
总响应
67.64s
17

当前推理模型

OpenAI - GPT Astra - 6 (medium)

OpenAI GPT Astra 6 (medium) 在本快照中智能指数 50,1M 上下文,任务成本 $1.54,中位 46 tok/s,首块 4.70s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
50
任务成本
$1.54
速度
46 tok/s
首块延迟
4.70s
总响应
15.65s
18

当前推理模型

Anthropic - Claude Fable - 5.1 (medium)

Anthropic Claude Fable 5.1 (medium) 在本快照中智能指数 49,1M 上下文,任务成本 $2.98,中位 57 tok/s,首块 9.11s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
49
任务成本
$2.98
速度
57 tok/s
首块延迟
9.11s
总响应
17.85s
19

当前推理模型

Meta - Muse Spark - 1.3 (max)

Meta Muse Spark 1.3 (max) 在本快照中智能指数 48,1M 上下文,任务成本 $1.60,中位 135 tok/s,首块 52.46s。

适合场景: 适合 Meta coding agent、长上下文任务,以及按快照比较模型。

Meta

上下文
1M
AA 指数
48
任务成本
$1.60
速度
135 tok/s
首块延迟
52.46s
总响应
71.04s
20

当前推理模型

OpenAI - GPT Sol - 6.1 (medium)

OpenAI GPT Sol 6.1 (medium) 在本快照中智能指数 48,1M 上下文,任务成本 $0.21,中位 45 tok/s,首块 5.29s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
48
任务成本
$0.21
速度
45 tok/s
首块延迟
5.29s
总响应
16.30s
21

当前推理模型

Anthropic - Claude Fable - 5.1 (low)

Anthropic Claude Fable 5.1 (low) 在本快照中智能指数 47,1M 上下文,任务成本 $2.37,中位 55 tok/s,首块 4.73s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
47
任务成本
$2.37
速度
55 tok/s
首块延迟
4.73s
总响应
13.80s
22

当前推理模型

Anthropic - Claude Sonnet - 5.5 (high)

Anthropic Claude Sonnet 5.5 (high) 在本快照中智能指数 47,1M 上下文,任务成本 $1.12,中位 102 tok/s,首块 12.19s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
47
任务成本
$1.12
速度
102 tok/s
首块延迟
12.19s
总响应
17.09s
23

当前推理模型

SpaceXAI - Grok - 4.7 (xhigh)

SpaceXAI Grok 4.7 (xhigh) 在本快照中智能指数 46,500k 上下文,任务成本 $3.74,中位 79 tok/s,首块 41.26s。

适合场景: 适合 SpaceXAI coding agent、长上下文任务,以及按快照比较模型。

SpaceXAI

上下文
500k
AA 指数
46
任务成本
$3.74
速度
79 tok/s
首块延迟
41.26s
总响应
47.59s
24

当前推理模型

SpaceXAI - Grok - 4.7 (high)

SpaceXAI Grok 4.7 (high) 在本快照中智能指数 46,500k 上下文,任务成本 $2.73,中位 78 tok/s,首块 33.12s。

适合场景: 适合 SpaceXAI coding agent、长上下文任务,以及按快照比较模型。

SpaceXAI

上下文
500k
AA 指数
46
任务成本
$2.73
速度
78 tok/s
首块延迟
33.12s
总响应
39.49s
25

当前推理模型

Xiaomi - MiMo - V2.6 Pro

Xiaomi MiMo V2.6 Pro 在本快照中智能指数 46,1M 上下文,任务成本 $0.13,中位 45 tok/s,首块 3.82s。

适合场景: 适合 Xiaomi coding agent、长上下文任务,以及按快照比较模型。

Xiaomi

上下文
1M
AA 指数
46
任务成本
$0.13
速度
45 tok/s
首块延迟
3.82s
总响应
59.44s
26

当前推理模型

OpenAI - GPT Astra - 6 (low)

OpenAI GPT Astra 6 (low) 在本快照中智能指数 46,1M 上下文,任务成本 $0.82,中位 47 tok/s,首块 2.75s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
46
任务成本
$0.82
速度
47 tok/s
首块延迟
2.75s
总响应
13.34s
27

当前推理模型

Alibaba - Qwen - 3.8 Max (0902)

Alibaba Qwen 3.8 Max (0902) 在本快照中智能指数 45,984k 上下文,任务成本 $5.41,中位 38 tok/s,首块 2.67s。

适合场景: 适合 Alibaba coding agent、长上下文任务,以及按快照比较模型。

Alibaba

上下文
984k
AA 指数
45
任务成本
$5.41
速度
38 tok/s
首块延迟
2.67s
总响应
68.62s
28

当前推理模型

Meta - Muse Spark - 1.3 (xhigh)

Meta Muse Spark 1.3 (xhigh) 在本快照中智能指数 45,1M 上下文,任务成本 $1.37,中位 146 tok/s,首块 41.50s。

适合场景: 适合 Meta coding agent、长上下文任务,以及按快照比较模型。

Meta

上下文
1M
AA 指数
45
任务成本
$1.37
速度
146 tok/s
首块延迟
41.50s
总响应
58.68s
29

当前推理模型

Z AI - GLM - 5.3 (max)

Z AI GLM 5.3 (max) 在本快照中智能指数 45,1M 上下文,任务成本 $2.01,中位 74 tok/s,首块 3.18s。

适合场景: 适合 Z AI coding agent、长上下文任务,以及按快照比较模型。

Z AI

上下文
1M
AA 指数
45
任务成本
$2.01
速度
74 tok/s
首块延迟
3.18s
总响应
36.90s
30

当前推理模型

StepFun - Step - 5 Preview

StepFun Step 5 Preview 在本快照中智能指数 44,1M 上下文,任务成本 $0.72,中位 85 tok/s,首块 3.03s。

适合场景: 适合 StepFun coding agent、长上下文任务,以及按快照比较模型。

StepFun

上下文
1M
AA 指数
44
任务成本
$0.72
速度
85 tok/s
首块延迟
3.03s
总响应
32.40s
31

当前推理模型

Kimi - Kimi - K3 (max)

Kimi Kimi K3 (max) 在本快照中智能指数 44,1.05M 上下文,任务成本 $2.00,中位 36 tok/s,首块 4.12s。

适合场景: 适合 Kimi coding agent、长上下文任务,以及按快照比较模型。

Kimi

上下文
1.05M
AA 指数
44
任务成本
$2.00
速度
36 tok/s
首块延迟
4.12s
总响应
72.72s
32

当前推理模型

Anthropic - Claude Opus - 5.5 (low)

Anthropic Claude Opus 5.5 (low) 在本快照中智能指数 42,1M 上下文,任务成本 $0.55,中位 80 tok/s,首块 9.94s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
42
任务成本
$0.55
速度
80 tok/s
首块延迟
9.94s
总响应
16.18s
33

当前推理模型

SpaceXAI - Grok - 4.7 (low)

SpaceXAI Grok 4.7 (low) 在本快照中智能指数 42,500k 上下文,任务成本 $1.25,中位 75 tok/s,首块 8.62s。

适合场景: 适合 SpaceXAI coding agent、长上下文任务,以及按快照比较模型。

SpaceXAI

上下文
500k
AA 指数
42
任务成本
$1.25
速度
75 tok/s
首块延迟
8.62s
总响应
15.25s
34

当前推理模型

OpenAI - GPT Sol - 6.1 (low)

OpenAI GPT Sol 6.1 (low) 在本快照中智能指数 42,1M 上下文,任务成本 $0.13,中位 48 tok/s,首块 3.37s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
42
任务成本
$0.13
速度
48 tok/s
首块延迟
3.37s
总响应
13.78s
35

当前推理模型

OpenAI - GPT Terra - 5.6 (max)

OpenAI GPT Terra 5.6 (max) 在本快照中智能指数 42,1M 上下文,任务成本 $1.40,中位 102 tok/s,首块 172.37s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
42
任务成本
$1.40
速度
102 tok/s
首块延迟
172.37s
总响应
177.28s
36

当前推理模型

Z AI - GLM - 5.3 Flash

Z AI GLM 5.3 Flash 在本快照中智能指数 42,1M 上下文,任务成本 $0.25,中位 53 tok/s,首块 3.29s。

适合场景: 适合 Z AI coding agent、长上下文任务,以及按快照比较模型。

Z AI

上下文
1M
AA 指数
42
任务成本
$0.25
速度
53 tok/s
首块延迟
3.29s
总响应
50.21s
37

当前推理模型

Google - Gemini - 3.8 Flash (high)

Google Gemini 3.8 Flash (high) 在本快照中智能指数 41,1M 上下文,任务成本 $1.24,中位 242 tok/s,首块 16.13s。

适合场景: 适合 Google coding agent、长上下文任务,以及按快照比较模型。

Google

上下文
1M
AA 指数
41
任务成本
$1.24
速度
242 tok/s
首块延迟
16.13s
总响应
18.19s
38

当前推理模型

Anthropic - Claude Sonnet - 5.5 (medium)

Anthropic Claude Sonnet 5.5 (medium) 在本快照中智能指数 41,1M 上下文,任务成本 $0.59,中位 107 tok/s,首块 1.21s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
41
任务成本
$0.59
速度
107 tok/s
首块延迟
1.21s
总响应
5.88s
39

当前推理模型

Alibaba - Qwen - 3.8 2.4T A95B

Alibaba Qwen 3.8 2.4T A95B 在本快照中智能指数 40,262k 上下文,任务成本 $2.16,中位 39 tok/s,首块 2.78s。

适合场景: 适合 Alibaba coding agent、长上下文任务,以及按快照比较模型。

Alibaba

上下文
262k
AA 指数
40
任务成本
$2.16
速度
39 tok/s
首块延迟
2.78s
总响应
66.94s
40

当前推理模型

Alibaba - Qwen - 3.8 Flash Next

Alibaba Qwen 3.8 Flash Next 在本快照中智能指数 40,256k 上下文,任务成本 $0.37,中位 54 tok/s,首块 2.45s。

适合场景: 适合 Alibaba coding agent、长上下文任务,以及按快照比较模型。

Alibaba

上下文
256k
AA 指数
40
任务成本
$0.37
速度
54 tok/s
首块延迟
2.45s
总响应
48.98s
41

当前模型;部分指标未公开

Google - Gemini - 3.8 Flash (medium)

Google Gemini 3.8 Flash (medium) 在本快照中智能指数 40,1M 上下文,任务成本 $0.93。输出速度与延迟尚未公布。

适合场景: 适合 Google coding agent、长上下文任务,以及按快照比较模型。

Google

上下文
1M
AA 指数
40
任务成本
$0.93
速度
— tok/s
首块延迟
—
总响应
—
42

当前推理模型

DeepSeek - DeepSeek - V4.1 Flash (max)

DeepSeek DeepSeek V4.1 Flash (max) 在本快照中智能指数 39,1M 上下文,任务成本 $0.27,中位 224 tok/s,首块 1.02s。

适合场景: 适合 DeepSeek coding agent、长上下文任务,以及按快照比较模型。

DeepSeek

上下文
1M
AA 指数
39
任务成本
$0.27
速度
224 tok/s
首块延迟
1.02s
总响应
12.21s
43

当前推理模型

OpenAI - GPT Luna - 6 (max)

OpenAI GPT Luna 6 (max) 在本快照中智能指数 38,1M 上下文,任务成本 $0.07,中位 129 tok/s,首块 132.77s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
38
任务成本
$0.07
速度
129 tok/s
首块延迟
132.77s
总响应
136.65s
44

当前推理模型

OpenAI - GPT Terra - 5.6 (xhigh)

OpenAI GPT Terra 5.6 (xhigh) 在本快照中智能指数 38,1M 上下文,任务成本 $0.63,中位 91 tok/s,首块 28.50s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
38
任务成本
$0.63
速度
91 tok/s
首块延迟
28.50s
总响应
33.99s
45

当前推理模型

Xiaomi - MiMo - V2.6 Flash

Xiaomi MiMo V2.6 Flash 在本快照中智能指数 38,1M 上下文,任务成本 $0.06,中位 50 tok/s,首块 4.75s。

适合场景: 适合 Xiaomi coding agent、长上下文任务,以及按快照比较模型。

Xiaomi

上下文
1M
AA 指数
38
任务成本
$0.06
速度
50 tok/s
首块延迟
4.75s
总响应
54.95s
46

当前推理模型

DeepSeek - DeepSeek - V4 Pro 0813 (max)

DeepSeek DeepSeek V4 Pro 0813 (max) 在本快照中智能指数 36,1M 上下文,任务成本 $0.67,中位 109 tok/s,首块 1.73s。

适合场景: 适合 DeepSeek coding agent、长上下文任务,以及按快照比较模型。

DeepSeek

上下文
1M
AA 指数
36
任务成本
$0.67
速度
109 tok/s
首块延迟
1.73s
总响应
24.63s
47

当前推理模型

Anthropic - Claude Sonnet - 5.5 (low)

Anthropic Claude Sonnet 5.5 (low) 在本快照中智能指数 36,1M 上下文,任务成本 $0.42,中位 100 tok/s,首块 1.35s。

适合场景: 适合 Anthropic coding agent、长上下文任务,以及按快照比较模型。

Anthropic

上下文
1M
AA 指数
36
任务成本
$0.42
速度
100 tok/s
首块延迟
1.35s
总响应
6.33s
48

当前推理模型

DeepSeek - DeepSeek - V4 Flash Vision (max)

DeepSeek DeepSeek V4 Flash Vision (max) 在本快照中智能指数 35,1M 上下文,任务成本 $0.31,中位 219 tok/s,首块 0.94s。

适合场景: 适合 DeepSeek coding agent、长上下文任务,以及按快照比较模型。

DeepSeek

上下文
1M
AA 指数
35
任务成本
$0.31
速度
219 tok/s
首块延迟
0.94s
总响应
12.36s
49

当前推理模型

OpenAI - GPT Luna - 6 (xhigh)

OpenAI GPT Luna 6 (xhigh) 在本快照中智能指数 35,1M 上下文,任务成本 $0.04,中位 138 tok/s,首块 20.86s。

适合场景: 适合 OpenAI coding agent、长上下文任务,以及按快照比较模型。

OpenAI

上下文
1M
AA 指数
35
任务成本
$0.04
速度
138 tok/s
首块延迟
20.86s
总响应
24.48s
50

当前推理模型

Z AI - GLM - 5.3 (low)

Z AI GLM 5.3 (low) 在本快照中智能指数 34,1M 上下文,任务成本 $0.85,中位 69 tok/s,首块 3.13s。

适合场景: 适合 Z AI coding agent、长上下文任务,以及按快照比较模型。

Z AI

上下文
1M
AA 指数
34
任务成本
$0.85
速度
69 tok/s
首块延迟
3.13s
总响应
39.61s