現行推論モデル
Anthropic - Claude Opus - 5 (max)
Claude Opus 5 max がこのスナップショットで Intelligence Index 63 の首位。1M コンテキスト対応。
適した用途: 最先端のリポジトリ分析、複雑な計画、高価値エージェントタスク向け。
Anthropic
- コンテキスト
- 1M
- AA Index
- 63
- タスク単価
- $2.34
- 速度
- 52 tok/s
- 最初のチャンク
- 60.92s
- 総応答
- 70.52s
AI モデルランキング
スナップショット: 2026-08-13 ・ 最終確認: 2026-08-13
指標は Artificial Analysis の公開 LLM リーダーボードのある時点のスナップショットに基づきます。Intelligence Index、タスク単価、速度はスナップショット時点のベンチマーク結果です。プロバイダーの価格・提供状況・順位は頻繁に変わり、ベンチマークが高くても特定のコードベースや作業に最適とは限りません。
現行推論モデル
Claude Opus 5 max がこのスナップショットで Intelligence Index 63 の首位。1M コンテキスト対応。
適した用途: 最先端のリポジトリ分析、複雑な計画、高価値エージェントタスク向け。
Anthropic
現行推論モデル
最高 Intelligence Index で並び、max よりタスク単価が低く初回レイテンシも大幅に速い。
適した用途: 最先端品質を保ちつつ低レイテンシが欲しい複数ファイル編集・coding agent 向け。
Anthropic
現行推論モデル
Intelligence Index は依然最上位圏。1M コンテキストで出力速度も強い。
適した用途: 深いリポジトリ分析、複雑な計画、高価値のエージェントタスク向け。
Anthropic
現行推論モデル
Opus 5 高推論モード。max/xhigh より低レイテンシで依然上位。
適した用途: 日常の Claude agent coding、レビュー、強い推論が必要なツール利用作業向け。
Anthropic
現行推論モデル
このスナップショットで OpenAI 推論ライン上位。1M コンテキストで Intelligence Index も強い。
適した用途: OpenAI 中心の coding agent、長文脈計画、最大推論タスク向け。
OpenAI
現行推論モデル
新規の Grok 4.6 high が上位圏。500k コンテキストで、Claude/OpenAI の max より低タスク単価。
適した用途: xAI スタックの coding agent、中規模コンテキスト計画、コスト重視の最先端実験向け。
SpaceXAI
現行推論モデル
Moonshot の K3 max フラッグシップ。1M+ コンテキストでコーディングに強いが、総応答はまだ長め。
適した用途: 長時間の coding agent、フロント生成、地域 API スタック、1M コンテキスト作業向け。
Kimi
現行推論モデル
GPT-5.6 Sol 高推論モード。1M コンテキストで max より低タスク単価。
適した用途: 日常の agent coding、レビュー、強い推論が必要なツール利用作業向け。
OpenAI
現行推論モデル
Opus 5 medium のバランス型。1M コンテキストで上位ティアより総応答が速い。
適した用途: 対話型 Claude coding、リファクタ、プロダクト開発ループ向け。
Anthropic
現行推論モデル
新規の Qwen 3.8 Max。1M コンテキスト、低初回レイテンシで Intelligence Index はトップ10。
適した用途: 多言語 coding、地域 API スタック、Qwen 中心の agent 実験向け。
Alibaba
現行推論モデル
GPT-5.6 Sol high のバランス型。1M コンテキストで応答時間も扱いやすい。
適した用途: OpenAI ツール内の対話型 coding、リファクタ、プロダクト開発ループ向け。
OpenAI
現行モデル、一部指標のみ
Muse Spark 1.2 xhigh は 1M+ コンテキストでトップ12。公開の速度・レイテンシはまだ不完全。
適した用途: 公開レイテンシより Intelligence Index を優先する長文脈 Meta ルーティング比較向け。
Meta
現行推論モデル
GPT-5.6 Terra max。Sol max より低タスク単価で出力速度も速い。
適した用途: コスト重視の長文脈 coding。初回 token よりスループット重視向け。
OpenAI
現行推論モデル
Grok 4.5 high。低レイテンシ、500k コンテキスト、Grok 4.6 high より低タスク単価。
適した用途: 高速な対話型 coding 支援、中規模 agent ループ、xAI エコシステム実験向け。
SpaceXAI
現行推論モデル
GPT-5.6 Sol medium。知能、1M コンテキスト、低い総応答時間のバランス型。
適した用途: 速度と品質の両方が重要な日常 OpenAI coding 向け。
OpenAI
現行推論モデル
Sonnet 価格帯で高い知能と 1M コンテキスト。ただし初回応答は長め。
適した用途: 品質とコンテキストを優先する長めのバッチ作業向け。
Anthropic
現行推論モデル
新規の DeepSeek V4 Pro 0813 max がトップ20。1M コンテキスト、非常に低タスク単価、速い初回レイテンシ。
適した用途: 予算型オープン生態系 coding agent、長文脈分析、低レイテンシの DeepSeek Pro 作業向け。
DeepSeek
現行推論モデル
GPT-5.6 Terra xhigh。低タスク単価、1M コンテキスト、高速出力。
適した用途: コスト重視の長文脈 coding。高スループットで初回レイテンシも許容範囲。
OpenAI
現行推論モデル
1M コンテキスト、低いタスク単価、非常に速い初回レイテンシを兼ね備えた上位モデル。
適した用途: コスト重視のコード支援、長文脈分析、低レイテンシ作業向け。
Z AI
現行推論モデル
低レイテンシ Opus 5。1M コンテキストで Opus 5 系最速の総応答。
適した用途: Claude Opus 5 での対話型ペアプログラミング、クイック修正、高速計画向け。
Anthropic
現行推論モデル
GPT-5.6 Luna max。非常に低タスク単価、1M コンテキスト、高速出力。
適した用途: 予算重視 OpenAI スタック、長文脈バッチ編集、高スループット coding 支援向け。
OpenAI
現行推論モデル
DeepSeek V4 Flash 0731 max。1M コンテキスト、非常に低タスク単価、速い初回レイテンシ。
適した用途: 予算型オープン生態系 coding agent、長文脈分析、低レイテンシ編集向け。
DeepSeek
現行汎用モデル
Gemini Flash。1M コンテキスト、高速出力で Google エコシステム向き。
適した用途: Google スタックでの高速 coding、長ファイル閲覧、高スループット支援向け。
現行推論モデル
低レイテンシ GPT-5.6 Sol。1M コンテキストで Sol 系最速の総応答。
適した用途: GPT-5.6 Sol での対話型ペアプログラミング、クイック修正、高速計画向け。
OpenAI
現行推論モデル
応答が速い GPT-5.6 Terra high。1M コンテキストで総応答も短い。
適した用途: スループットと低レイテンシの両方が重要な対話型 OpenAI coding 向け。
OpenAI
現行推論モデル
予算型 GPT-5.6 Luna xhigh。1M コンテキスト、非常に低タスク単価、高速出力。
適した用途: コスト重視の OpenAI coding 支援と長文脈バッチ編集向け。
OpenAI
現行推論モデル
Kimi K3 low。1M+ コンテキストを保ち、K3 max より低タスク単価。
適した用途: max 推論が不要でコストを抑えたい Kimi 長文脈 coding 向け。
Kimi
現行汎用モデル
Gemini 3.1 Pro プレビュー。1M コンテキストで Google スタック向けのバランス型。
適した用途: Google Cloud coding 試験、マルチモーダル試作、長文脈プレビュー評価向け。
現行モデル、一部指標のみ
Motif 3 は Intelligence Index でランクイン。中規模コンテキスト。速度・価格の公開指標はまだ不完全。
適した用途: 成熟した公開指標よりベンチ順位を優先して Motif 3 を初期評価する用途向け。
Motif Technologies
現行推論モデル
タスク単価が非常に低い GPT-5.6 Luna high。1M コンテキストで応答も速い。
適した用途: 高ボリューム OpenAI coding 支援と予算重視の長文脈作業向け。
OpenAI
現行推論モデル
低レイテンシ GPT-5.6 Terra medium。1M コンテキストで端到端応答が短い。
適した用途: 軽快な対話型 coding、リファクタ、ツール多用の OpenAI agent ループ向け。
OpenAI
現行モデル、一部指標のみ
Gemini 3.5 Flash medium。1M コンテキストで高速出力。このスナップショットではタスク単価が一部未公開。
適した用途: 公開タスク単価より Flash medium の速度を優先する Google エコシステム実験向け。
現行モデル、一部指標のみ
GPT-5.3 Codex xhigh のコーディング向け。このスナップショットではタスク単価が一部未公開。
適した用途: Codex 中心のソフトウェア作業、リポジトリ編集、OpenAI coding agent 向け。
OpenAI
現行推論モデル
MiniMax M3。1M コンテキスト、低タスク単価、低初回レイテンシ。
適した用途: コスト重視のコード支援、地域スタック、低レイテンシ対話編集向け。
MiniMax
現行モデル、一部指標のみ
Motif 3 Beta は Intelligence Index でランクイン。速度・価格の公開指標はまだ不完全。
適した用途: 成熟指標よりベンチ順位を優先して新興プロバイダーを初期評価する用途向け。
Motif Technologies
現行推論モデル
以前の DeepSeek V4 Pro max(0813 より前)。1M コンテキスト、非常に低タスク単価。総応答は 0813 より長い。
適した用途: 予算型 coding agent、セルフホスト評価、コスト重視の長文脈作業向け。
DeepSeek
現行推論モデル
DeepSeek V4 Pro high。1M コンテキスト、低タスク単価、max より低レイテンシ。
適した用途: コスト重視の対話型 coding と DeepSeek エンドポイントでの長文脈分析向け。
DeepSeek
現行推論モデル
Kimi K2.7 Code。256k コンテキストのコーディング向けで、タスク単価も公開。
適した用途: K3 の 1M コンテキストが不要なときの Kimi コーディング作業向け。
Kimi
現行推論モデル
Xiaomi MiMo V2.5-Pro。1M コンテキスト、非常に低タスク単価で地域スタック向き。
適した用途: 予算型多言語 coding、地域 API、低コスト長文脈支援向け。
Xiaomi
現行汎用モデル
非推論 Claude Sonnet 5。1M コンテキスト、低レイテンシ、max より軽いコスト。
適した用途: 日常の Claude coding、クイック修正、深い推論が不要な対話向け。
Anthropic
現行推論モデル
Thinking Machines の Inkling。1M コンテキスト、タスク単価公開、初回レイテンシも良好。
適した用途: 公開価格とレイテンシがある新しいラボの長文脈評価向け。
Thinking Machines
現行推論モデル
Tencent Hy3。中規模コンテキスト、非常に低タスク単価、初回レイテンシも競争力あり。
適した用途: 地域 coding スタック、予算型支援、Tencent エコシステム実験向け。
Tencent
現行モデル、一部指標のみ
Nex N2-Pro は中規模コンテキストと高速出力でランクイン。タスク単価はここでは一部未公開。
適した用途: 新興プロバイダー評価と、大手ラボ以外の低レイテンシ coding 実験向け。
Nex AGI
現行汎用モデル
非推論 GPT-5.6 Sol。1M コンテキストで Sol 系最低の初回レイテンシ。
適した用途: 拡張推論が不要で、より速い OpenAI coding ループ向け。
OpenAI
現行モデル、一部指標のみ
Upstage Solar Pro 4。512k コンテキストで速度は公開。このスナップショットではタスク単価が一部未公開。
適した用途: Intelligence Index で Upstage モデルを見る地域・文書中心の coding スタック向け。
Upstage
現行推論モデル
低レイテンシ GPT-5.6 Terra low。1M コンテキストで端到端応答が短い。
適した用途: 最大推論が不要な高速対話型 OpenAI coding とクイックリファクタ向け。
OpenAI
現行推論モデル
小型 Inkling。1M コンテキスト、低タスク単価、ベース Inkling より高速出力。
適した用途: レイテンシとコストをより厳しく見る Thinking Machines モデル評価向け。
Thinking Machines
現行モデル、一部指標のみ
China Mobile JT-4.1 Flash は Intelligence Index でランクイン。価格・速度の公開指標はまだ不完全。
適した用途: ベンチ順位が主なシグナルのときの China Mobile 地域スタック評価向け。
China Mobile
現行モデル、一部指標のみ
Agnes 2.5 Pro Alpha。1M コンテキストで高速出力。タスク単価はここでは一部未公開。
適した用途: Sapiens AI の新興モデルを長文脈で初期評価する用途向け。
Sapiens AI
現行推論モデル
Qwen 3.7 Plus。1M コンテキスト、Qwen 3.8 Max より低タスク単価、総応答は中程度。
適した用途: コスト重視の Qwen coding agent と多言語プロダクト開発ループ向け。
Alibaba