AI Coding に戻る

AI モデルランキング

AI コーディングモデルランキング

スナップショット: 2026-08-13 ・ 最終確認: 2026-08-13

手法について

指標は Artificial Analysis の公開 LLM リーダーボードのある時点のスナップショットに基づきます。Intelligence Index、タスク単価、速度はスナップショット時点のベンチマーク結果です。プロバイダーの価格・提供状況・順位は頻繁に変わり、ベンチマークが高くても特定のコードベースや作業に最適とは限りません。

ソース
Artificial Analysis
最終確認
2026-08-13

Top 50 モデル

01

現行推論モデル

Anthropic - Claude Opus - 5 (max)

Claude Opus 5 max がこのスナップショットで Intelligence Index 63 の首位。1M コンテキスト対応。

適した用途: 最先端のリポジトリ分析、複雑な計画、高価値エージェントタスク向け。

Anthropic

コンテキスト
1M
AA Index
63
タスク単価
$2.34
速度
52 tok/s
最初のチャンク
60.92s
総応答
70.52s
02

現行推論モデル

Anthropic - Claude Opus - 5 (xhigh)

最高 Intelligence Index で並び、max よりタスク単価が低く初回レイテンシも大幅に速い。

適した用途: 最先端品質を保ちつつ低レイテンシが欲しい複数ファイル編集・coding agent 向け。

Anthropic

コンテキスト
1M
AA Index
63
タスク単価
$1.80
速度
52 tok/s
最初のチャンク
25.75s
総応答
35.32s
03

現行推論モデル

Anthropic - Claude Fable - 5

Intelligence Index は依然最上位圏。1M コンテキストで出力速度も強い。

適した用途: 深いリポジトリ分析、複雑な計画、高価値のエージェントタスク向け。

Anthropic

コンテキスト
1M
AA Index
62
タスク単価
$3.14
速度
63 tok/s
最初のチャンク
113.68s
総応答
121.60s
04

現行推論モデル

Anthropic - Claude Opus - 5 (high)

Opus 5 高推論モード。max/xhigh より低レイテンシで依然上位。

適した用途: 日常の Claude agent coding、レビュー、強い推論が必要なツール利用作業向け。

Anthropic

コンテキスト
1M
AA Index
61
タスク単価
$1.23
速度
51 tok/s
最初のチャンク
13.43s
総応答
23.32s
05

現行推論モデル

OpenAI - GPT Sol - 5.6 (max)

このスナップショットで OpenAI 推論ライン上位。1M コンテキストで Intelligence Index も強い。

適した用途: OpenAI 中心の coding agent、長文脈計画、最大推論タスク向け。

OpenAI

コンテキスト
1M
AA Index
61
タスク単価
$1.23
速度
62 tok/s
最初のチャンク
155.41s
総応答
163.54s
06

現行推論モデル

SpaceXAI - Grok - 4.6 (high)

新規の Grok 4.6 high が上位圏。500k コンテキストで、Claude/OpenAI の max より低タスク単価。

適した用途: xAI スタックの coding agent、中規模コンテキスト計画、コスト重視の最先端実験向け。

SpaceXAI

コンテキスト
500k
AA Index
61
タスク単価
$0.84
速度
66 tok/s
最初のチャンク
32.30s
総応答
39.89s
07

現行推論モデル

Kimi - Kimi - K3 (max)

Moonshot の K3 max フラッグシップ。1M+ コンテキストでコーディングに強いが、総応答はまだ長め。

適した用途: 長時間の coding agent、フロント生成、地域 API スタック、1M コンテキスト作業向け。

Kimi

コンテキスト
1.05M
AA Index
60
タスク単価
$0.84
速度
41 tok/s
最初のチャンク
3.27s
総応答
64.72s
08

現行推論モデル

OpenAI - GPT Sol - 5.6 (xhigh)

GPT-5.6 Sol 高推論モード。1M コンテキストで max より低タスク単価。

適した用途: 日常の agent coding、レビュー、強い推論が必要なツール利用作業向け。

OpenAI

コンテキスト
1M
AA Index
59
タスク単価
$0.81
速度
61 tok/s
最初のチャンク
57.84s
総応答
66.08s
09

現行推論モデル

Anthropic - Claude Opus - 5 (medium)

Opus 5 medium のバランス型。1M コンテキストで上位ティアより総応答が速い。

適した用途: 対話型 Claude coding、リファクタ、プロダクト開発ループ向け。

Anthropic

コンテキスト
1M
AA Index
59
タスク単価
$0.72
速度
52 tok/s
最初のチャンク
8.59s
総応答
18.29s
10

現行推論モデル

Alibaba - Qwen - 3.8 Max

新規の Qwen 3.8 Max。1M コンテキスト、低初回レイテンシで Intelligence Index はトップ10。

適した用途: 多言語 coding、地域 API スタック、Qwen 中心の agent 実験向け。

Alibaba

コンテキスト
1M
AA Index
58
タスク単価
$1.13
速度
47 tok/s
最初のチャンク
2.72s
総応答
55.90s
11

現行推論モデル

OpenAI - GPT Sol - 5.6 (high)

GPT-5.6 Sol high のバランス型。1M コンテキストで応答時間も扱いやすい。

適した用途: OpenAI ツール内の対話型 coding、リファクタ、プロダクト開発ループ向け。

OpenAI

コンテキスト
1M
AA Index
57
タスク単価
$0.55
速度
56 tok/s
最初のチャンク
19.28s
総応答
28.15s
12

現行モデル、一部指標のみ

Meta - Muse Spark - 1.2 (xhigh)

Muse Spark 1.2 xhigh は 1M+ コンテキストでトップ12。公開の速度・レイテンシはまだ不完全。

適した用途: 公開レイテンシより Intelligence Index を優先する長文脈 Meta ルーティング比較向け。

Meta

コンテキスト
1.05M
AA Index
57
タスク単価
$0.40
速度
tok/s
最初のチャンク
総応答
13

現行推論モデル

OpenAI - GPT Terra - 5.6 (max)

GPT-5.6 Terra max。Sol max より低タスク単価で出力速度も速い。

適した用途: コスト重視の長文脈 coding。初回 token よりスループット重視向け。

OpenAI

コンテキスト
1M
AA Index
57
タスク単価
$0.51
速度
116 tok/s
最初のチャンク
194.43s
総応答
198.74s
14

現行推論モデル

SpaceXAI - Grok - 4.5 (high)

Grok 4.5 high。低レイテンシ、500k コンテキスト、Grok 4.6 high より低タスク単価。

適した用途: 高速な対話型 coding 支援、中規模 agent ループ、xAI エコシステム実験向け。

SpaceXAI

コンテキスト
500k
AA Index
56
タスク単価
$0.36
速度
57 tok/s
最初のチャンク
9.32s
総応答
18.11s
15

現行推論モデル

OpenAI - GPT Sol - 5.6 (medium)

GPT-5.6 Sol medium。知能、1M コンテキスト、低い総応答時間のバランス型。

適した用途: 速度と品質の両方が重要な日常 OpenAI coding 向け。

OpenAI

コンテキスト
1M
AA Index
56
タスク単価
$0.37
速度
57 tok/s
最初のチャンク
6.82s
総応答
15.62s
16

現行推論モデル

Anthropic - Claude Sonnet - 5 (max)

Sonnet 価格帯で高い知能と 1M コンテキスト。ただし初回応答は長め。

適した用途: 品質とコンテキストを優先する長めのバッチ作業向け。

Anthropic

コンテキスト
1M
AA Index
55
タスク単価
$1.72
速度
71 tok/s
最初のチャンク
191.38s
総応答
198.40s
17

現行推論モデル

DeepSeek - DeepSeek V4 Pro - 0813 (max)

新規の DeepSeek V4 Pro 0813 max がトップ20。1M コンテキスト、非常に低タスク単価、速い初回レイテンシ。

適した用途: 予算型オープン生態系 coding agent、長文脈分析、低レイテンシの DeepSeek Pro 作業向け。

DeepSeek

コンテキスト
1M
AA Index
53
タスク単価
$0.06
速度
83 tok/s
最初のチャンク
1.63s
総応答
31.68s
18

現行推論モデル

OpenAI - GPT Terra - 5.6 (xhigh)

GPT-5.6 Terra xhigh。低タスク単価、1M コンテキスト、高速出力。

適した用途: コスト重視の長文脈 coding。高スループットで初回レイテンシも許容範囲。

OpenAI

コンテキスト
1M
AA Index
53
タスク単価
$0.31
速度
106 tok/s
最初のチャンク
29.77s
総応答
34.49s
19

現行推論モデル

Z AI - GLM - 5.2 (max)

1M コンテキスト、低いタスク単価、非常に速い初回レイテンシを兼ね備えた上位モデル。

適した用途: コスト重視のコード支援、長文脈分析、低レイテンシ作業向け。

Z AI

コンテキスト
1M
AA Index
53
タスク単価
$0.32
速度
118 tok/s
最初のチャンク
1.42s
総応答
22.58s
20

現行推論モデル

Anthropic - Claude Opus - 5 (low)

低レイテンシ Opus 5。1M コンテキストで Opus 5 系最速の総応答。

適した用途: Claude Opus 5 での対話型ペアプログラミング、クイック修正、高速計画向け。

Anthropic

コンテキスト
1M
AA Index
52
タスク単価
$0.43
速度
51 tok/s
最初のチャンク
3.04s
総応答
12.90s
21

現行推論モデル

OpenAI - GPT Luna - 5.6 (max)

GPT-5.6 Luna max。非常に低タスク単価、1M コンテキスト、高速出力。

適した用途: 予算重視 OpenAI スタック、長文脈バッチ編集、高スループット coding 支援向け。

OpenAI

コンテキスト
1M
AA Index
52
タスク単価
$0.05
速度
150 tok/s
最初のチャンク
136.64s
総応答
139.97s
22

現行推論モデル

DeepSeek - DeepSeek V4 Flash - 0731 (max)

DeepSeek V4 Flash 0731 max。1M コンテキスト、非常に低タスク単価、速い初回レイテンシ。

適した用途: 予算型オープン生態系 coding agent、長文脈分析、低レイテンシ編集向け。

DeepSeek

コンテキスト
1M
AA Index
52
タスク単価
$0.03
速度
122 tok/s
最初のチャンク
1.44s
総応答
21.90s
23

現行汎用モデル

Google - Gemini - 3.6 Flash

Gemini Flash。1M コンテキスト、高速出力で Google エコシステム向き。

適した用途: Google スタックでの高速 coding、長ファイル閲覧、高スループット支援向け。

Google

コンテキスト
1M
AA Index
52
タスク単価
$0.56
速度
229 tok/s
最初のチャンク
18.99s
総応答
21.17s
24

現行推論モデル

OpenAI - GPT Sol - 5.6 (low)

低レイテンシ GPT-5.6 Sol。1M コンテキストで Sol 系最速の総応答。

適した用途: GPT-5.6 Sol での対話型ペアプログラミング、クイック修正、高速計画向け。

OpenAI

コンテキスト
1M
AA Index
51
タスク単価
$0.23
速度
52 tok/s
最初のチャンク
3.07s
総応答
12.74s
25

現行推論モデル

OpenAI - GPT Terra - 5.6 (high)

応答が速い GPT-5.6 Terra high。1M コンテキストで総応答も短い。

適した用途: スループットと低レイテンシの両方が重要な対話型 OpenAI coding 向け。

OpenAI

コンテキスト
1M
AA Index
50
タスク単価
$0.22
速度
97 tok/s
最初のチャンク
3.79s
総応答
8.94s
26

現行推論モデル

OpenAI - GPT Luna - 5.6 (xhigh)

予算型 GPT-5.6 Luna xhigh。1M コンテキスト、非常に低タスク単価、高速出力。

適した用途: コスト重視の OpenAI coding 支援と長文脈バッチ編集向け。

OpenAI

コンテキスト
1M
AA Index
50
タスク単価
$0.03
速度
147 tok/s
最初のチャンク
50.93s
総応答
54.32s
27

現行推論モデル

Kimi - Kimi - K3 (low)

Kimi K3 low。1M+ コンテキストを保ち、K3 max より低タスク単価。

適した用途: max 推論が不要でコストを抑えたい Kimi 長文脈 coding 向け。

Kimi

コンテキスト
1.05M
AA Index
48
タスク単価
$0.24
速度
37 tok/s
最初のチャンク
3.24s
総応答
70.53s
28

現行汎用モデル

Google - Gemini - 3.1 Pro Preview

Gemini 3.1 Pro プレビュー。1M コンテキストで Google スタック向けのバランス型。

適した用途: Google Cloud coding 試験、マルチモーダル試作、長文脈プレビュー評価向け。

Google

コンテキスト
1M
AA Index
48
タスク単価
$0.33
速度
114 tok/s
最初のチャンク
31.61s
総応答
35.99s
29

現行モデル、一部指標のみ

Motif Technologies - Motif - 3

Motif 3 は Intelligence Index でランクイン。中規模コンテキスト。速度・価格の公開指標はまだ不完全。

適した用途: 成熟した公開指標よりベンチ順位を優先して Motif 3 を初期評価する用途向け。

Motif Technologies

コンテキスト
262k
AA Index
47
タスク単価
速度
tok/s
最初のチャンク
総応答
30

現行推論モデル

OpenAI - GPT Luna - 5.6 (high)

タスク単価が非常に低い GPT-5.6 Luna high。1M コンテキストで応答も速い。

適した用途: 高ボリューム OpenAI coding 支援と予算重視の長文脈作業向け。

OpenAI

コンテキスト
1M
AA Index
47
タスク単価
$0.02
速度
150 tok/s
最初のチャンク
15.32s
総応答
18.66s
31

現行推論モデル

OpenAI - GPT Terra - 5.6 (medium)

低レイテンシ GPT-5.6 Terra medium。1M コンテキストで端到端応答が短い。

適した用途: 軽快な対話型 coding、リファクタ、ツール多用の OpenAI agent ループ向け。

OpenAI

コンテキスト
1M
AA Index
47
タスク単価
$0.12
速度
97 tok/s
最初のチャンク
1.78s
総応答
6.96s
32

現行モデル、一部指標のみ

Google - Gemini - 3.5 Flash (medium)

Gemini 3.5 Flash medium。1M コンテキストで高速出力。このスナップショットではタスク単価が一部未公開。

適した用途: 公開タスク単価より Flash medium の速度を優先する Google エコシステム実験向け。

Google

コンテキスト
1M
AA Index
47
タスク単価
速度
162 tok/s
最初のチャンク
17.53s
総応答
20.60s
33

現行モデル、一部指標のみ

OpenAI - GPT Codex - 5.3 (xhigh)

GPT-5.3 Codex xhigh のコーディング向け。このスナップショットではタスク単価が一部未公開。

適した用途: Codex 中心のソフトウェア作業、リポジトリ編集、OpenAI coding agent 向け。

OpenAI

コンテキスト
400k
AA Index
46
タスク単価
速度
106 tok/s
最初のチャンク
73.50s
総応答
78.22s
34

現行推論モデル

MiniMax - MiniMax - M3

MiniMax M3。1M コンテキスト、低タスク単価、低初回レイテンシ。

適した用途: コスト重視のコード支援、地域スタック、低レイテンシ対話編集向け。

MiniMax

コンテキスト
1M
AA Index
45
タスク単価
$0.14
速度
83 tok/s
最初のチャンク
1.65s
総応答
31.83s
35

現行モデル、一部指標のみ

Motif Technologies - Motif - 3 (Beta)

Motif 3 Beta は Intelligence Index でランクイン。速度・価格の公開指標はまだ不完全。

適した用途: 成熟指標よりベンチ順位を優先して新興プロバイダーを初期評価する用途向け。

Motif Technologies

コンテキスト
262k
AA Index
45
タスク単価
速度
tok/s
最初のチャンク
総応答
36

現行推論モデル

DeepSeek - DeepSeek V4 Pro - max

以前の DeepSeek V4 Pro max(0813 より前)。1M コンテキスト、非常に低タスク単価。総応答は 0813 より長い。

適した用途: 予算型 coding agent、セルフホスト評価、コスト重視の長文脈作業向け。

DeepSeek

コンテキスト
1M
AA Index
45
タスク単価
$0.05
速度
67 tok/s
最初のチャンク
1.68s
総応答
73.96s
37

現行推論モデル

DeepSeek - DeepSeek V4 Pro - high

DeepSeek V4 Pro high。1M コンテキスト、低タスク単価、max より低レイテンシ。

適した用途: コスト重視の対話型 coding と DeepSeek エンドポイントでの長文脈分析向け。

DeepSeek

コンテキスト
1M
AA Index
44
タスク単価
$0.04
速度
63 tok/s
最初のチャンク
1.74s
総応答
41.34s
38

現行推論モデル

Kimi - Kimi - K2.7 Code

Kimi K2.7 Code。256k コンテキストのコーディング向けで、タスク単価も公開。

適した用途: K3 の 1M コンテキストが不要なときの Kimi コーディング作業向け。

Kimi

コンテキスト
256k
AA Index
43
タスク単価
$0.22
速度
38 tok/s
最初のチャンク
2.83s
総応答
74.36s
39

現行推論モデル

Xiaomi - MiMo - V2.5-Pro

Xiaomi MiMo V2.5-Pro。1M コンテキスト、非常に低タスク単価で地域スタック向き。

適した用途: 予算型多言語 coding、地域 API、低コスト長文脈支援向け。

Xiaomi

コンテキスト
1M
AA Index
43
タスク単価
$0.03
速度
46 tok/s
最初のチャンク
3.32s
総応答
57.11s
40

現行汎用モデル

Anthropic - Claude Sonnet - 5 (Non-reasoning)

非推論 Claude Sonnet 5。1M コンテキスト、低レイテンシ、max より軽いコスト。

適した用途: 日常の Claude coding、クイック修正、深い推論が不要な対話向け。

Anthropic

コンテキスト
1M
AA Index
43
タスク単価
$0.42
速度
60 tok/s
最初のチャンク
1.92s
総応答
10.21s
41

現行推論モデル

Thinking Machines - Inkling - base

Thinking Machines の Inkling。1M コンテキスト、タスク単価公開、初回レイテンシも良好。

適した用途: 公開価格とレイテンシがある新しいラボの長文脈評価向け。

Thinking Machines

コンテキスト
1M
AA Index
42
タスク単価
$0.34
速度
74 tok/s
最初のチャンク
1.86s
総応答
35.45s
42

現行推論モデル

Tencent - Hy3 - base

Tencent Hy3。中規模コンテキスト、非常に低タスク単価、初回レイテンシも競争力あり。

適した用途: 地域 coding スタック、予算型支援、Tencent エコシステム実験向け。

Tencent

コンテキスト
256k
AA Index
42
タスク単価
$0.04
速度
63 tok/s
最初のチャンク
2.88s
総応答
42.48s
43

現行モデル、一部指標のみ

Nex AGI - Nex - N2-Pro

Nex N2-Pro は中規模コンテキストと高速出力でランクイン。タスク単価はここでは一部未公開。

適した用途: 新興プロバイダー評価と、大手ラボ以外の低レイテンシ coding 実験向け。

Nex AGI

コンテキスト
262k
AA Index
42
タスク単価
速度
137 tok/s
最初のチャンク
1.68s
総応答
19.92s
44

現行汎用モデル

OpenAI - GPT Sol - 5.6 (Non-reasoning)

非推論 GPT-5.6 Sol。1M コンテキストで Sol 系最低の初回レイテンシ。

適した用途: 拡張推論が不要で、より速い OpenAI coding ループ向け。

OpenAI

コンテキスト
1M
AA Index
42
タスク単価
$0.24
速度
59 tok/s
最初のチャンク
1.33s
総応答
9.86s
45

現行モデル、一部指標のみ

Upstage - Solar Pro - 4

Upstage Solar Pro 4。512k コンテキストで速度は公開。このスナップショットではタスク単価が一部未公開。

適した用途: Intelligence Index で Upstage モデルを見る地域・文書中心の coding スタック向け。

Upstage

コンテキスト
512k
AA Index
42
タスク単価
速度
65 tok/s
最初のチャンク
2.18s
総応答
40.51s
46

現行推論モデル

OpenAI - GPT Terra - 5.6 (low)

低レイテンシ GPT-5.6 Terra low。1M コンテキストで端到端応答が短い。

適した用途: 最大推論が不要な高速対話型 OpenAI coding とクイックリファクタ向け。

OpenAI

コンテキスト
1M
AA Index
41
タスク単価
$0.09
速度
91 tok/s
最初のチャンク
1.73s
総応答
7.20s
47

現行推論モデル

Thinking Machines - Inkling Small - base

小型 Inkling。1M コンテキスト、低タスク単価、ベース Inkling より高速出力。

適した用途: レイテンシとコストをより厳しく見る Thinking Machines モデル評価向け。

Thinking Machines

コンテキスト
1M
AA Index
41
タスク単価
$0.07
速度
128 tok/s
最初のチャンク
1.58s
総応答
21.06s
48

現行モデル、一部指標のみ

China Mobile - JT - 4.1 Flash 236B A21B

China Mobile JT-4.1 Flash は Intelligence Index でランクイン。価格・速度の公開指標はまだ不完全。

適した用途: ベンチ順位が主なシグナルのときの China Mobile 地域スタック評価向け。

China Mobile

コンテキスト
256k
AA Index
40
タスク単価
速度
tok/s
最初のチャンク
総応答
49

現行モデル、一部指標のみ

Sapiens AI - Agnes - 2.5 Pro Alpha

Agnes 2.5 Pro Alpha。1M コンテキストで高速出力。タスク単価はここでは一部未公開。

適した用途: Sapiens AI の新興モデルを長文脈で初期評価する用途向け。

Sapiens AI

コンテキスト
1M
AA Index
40
タスク単価
速度
131 tok/s
最初のチャンク
2.37s
総応答
21.42s
50

現行推論モデル

Alibaba - Qwen - 3.7 Plus

Qwen 3.7 Plus。1M コンテキスト、Qwen 3.8 Max より低タスク単価、総応答は中程度。

適した用途: コスト重視の Qwen coding agent と多言語プロダクト開発ループ向け。

Alibaba

コンテキスト
1M
AA Index
39
タスク単価
$0.24
速度
56 tok/s
最初のチャンク
2.13s
総応答
46.67s