当前推理模型
Anthropic - Claude Opus - 5 (max)
Claude Opus 5 max 在本快照中以智能指数 63 领跑,支持 1M 上下文。
适合场景: 适合前沿代码库分析、复杂规划,以及需要顶级推理的高价值 agent 任务。
Anthropic
- 上下文
- 1M
- AA 指数
- 63
- 任务成本
- $2.34
- 速度
- 52 tok/s
- 首块延迟
- 60.92s
- 总响应
- 70.52s
AI 大模型排名
榜单快照:2026-08-13 · 最后复核:2026-08-13
以下指标来自 Artificial Analysis 公开 LLM 榜单的某个快照:智能指数、任务成本与速度反映的是快照当天的跑分表现。厂商价格、可用性与排名会频繁变化,跑分高也不代表在你的具体代码库或工作流中就是最佳选择。
当前推理模型
Claude Opus 5 max 在本快照中以智能指数 63 领跑,支持 1M 上下文。
适合场景: 适合前沿代码库分析、复杂规划,以及需要顶级推理的高价值 agent 任务。
Anthropic
当前推理模型
与 max 并列最高智能指数,任务成本更低,首块延迟明显更快。
适合场景: 适合仍需前沿质量、又希望延迟更好的多文件修改与 coding agent。
Anthropic
当前推理模型
智能指数仍处最前列,支持 1M 级上下文,输出速度较强。
适合场景: 适合深度代码库分析、复杂规划,以及能接受较高延迟的高价值 agent 任务。
Anthropic
当前推理模型
Opus 5 高推理档,延迟明显低于 max/xhigh,排名仍靠前。
适合场景: 适合日常 Claude agent 编程、代码审查和仍需强推理的工具调用工作流。
Anthropic
当前推理模型
本快照中 OpenAI 推理线前列档位,1M 上下文,智能指数强。
适合场景: 适合 OpenAI 生态 coding agent、长上下文规划和最高推理档软件任务。
OpenAI
当前推理模型
新上榜的 Grok 4.6 high 接近前列,500k 上下文,任务成本低于 Claude/OpenAI 的 max 档。
适合场景: 适合 xAI 生态 coding agent、中等上下文规划,以及成本可控的前沿实验。
SpaceXAI
当前推理模型
Moonshot K3 max 旗舰,1M+ 上下文,代码能力突出;总响应仍偏长。
适合场景: 适合长时程 coding agent、前端生成、区域 API 栈和成本可控的 1M 上下文任务。
Kimi
当前推理模型
GPT-5.6 Sol 高推理档,1M 上下文,任务成本低于 max。
适合场景: 适合日常 agent 编程、代码审查和仍需强推理的工具调用工作流。
OpenAI
当前推理模型
Opus 5 medium 平衡档,1M 上下文,总响应明显快于更高档位。
适合场景: 适合交互式 Claude 编程、重构和产品工程循环。
Anthropic
当前推理模型
新上榜的 Qwen 3.8 Max 旗舰,1M 上下文,首块延迟低,智能指数进入前十。
适合场景: 适合多语言编程、区域 API 栈和以 Qwen 为中心的 agent 实验。
Alibaba
当前推理模型
GPT-5.6 Sol high 平衡档,1M 上下文,总响应时间较友好。
适合场景: 适合 OpenAI 工具内的交互式编程、重构和产品工程循环。
OpenAI
当前模型;部分指标未公开
Muse Spark 1.2 xhigh 以 1M+ 上下文进入前 12;公开速度与延迟指标仍不完整。
适合场景: 适合更看重智能指数、而非已公开延迟的长上下文 Meta 模型路由对比。
Meta
当前推理模型
GPT-5.6 Terra max 档,任务成本低于 Sol max,输出速度很快。
适合场景: 适合成本敏感、长上下文编程,且吞吐比首 token 速度更重要的场景。
OpenAI
当前推理模型
Grok 4.5 high,延迟快,500k 上下文,任务成本低于 Grok 4.6 high。
适合场景: 适合快速交互式编程辅助、中等上下文 agent 循环和 xAI 生态实验。
SpaceXAI
当前推理模型
GPT-5.6 Sol medium 档,在智能、1M 上下文和低总响应之间取得平衡。
适合场景: 适合大多数日常 OpenAI 编程循环,速度与质量都重要。
OpenAI
当前推理模型
Sonnet 档位,智能指数高、上下文 1M,但首块响应较慢。
适合场景: 适合质量和上下文优先、实时性要求不高的长任务。
Anthropic
当前推理模型
新上榜的 DeepSeek V4 Pro 0813 max 进入前 20,1M 上下文,任务成本很低,首块延迟很快。
适合场景: 适合预算型开源生态 coding agent、长上下文分析和低延迟的 DeepSeek Pro 任务。
DeepSeek
当前推理模型
GPT-5.6 Terra xhigh,任务成本较低、1M 上下文、输出速度较快。
适合场景: 适合成本敏感的长上下文编程,吞吐强、首块延迟可接受。
OpenAI
当前推理模型
排名高,支持 1M 上下文,任务成本低,首块延迟很快。
适合场景: 适合成本敏感的代码助手、长上下文分析和低延迟工作流。
Z AI
当前推理模型
低延迟 Opus 5 档,保留 1M 上下文,Opus 5 系列总响应最快。
适合场景: 适合 Claude Opus 5 上的交互式结对编程、快速修复和快速规划循环。
Anthropic
当前推理模型
GPT-5.6 Luna max 档,任务成本很低、1M 上下文、输出速度很快。
适合场景: 适合预算型 OpenAI 栈、长上下文批量修改和高吞吐代码助手。
OpenAI
当前推理模型
DeepSeek V4 Flash 0731 max,1M 上下文,任务成本很低,首块延迟很快。
适合场景: 适合预算型开源生态 coding agent、长上下文分析和低延迟修改。
DeepSeek
当前通用模型
Gemini Flash 档,1M 上下文,输出速度很快,适合 Google 生态。
适合场景: 适合 Google 技术栈上的快速编程循环、长文件浏览和高吞吐助手任务。
当前推理模型
低延迟 GPT-5.6 Sol 档,保留 1M 上下文,Sol 系列总响应最快。
适合场景: 适合 GPT-5.6 Sol 上的交互式结对编程、快速修复和快速规划循环。
OpenAI
当前推理模型
响应快的 GPT-5.6 Terra high 档,1M 上下文,总响应时间很短。
适合场景: 适合吞吐和低延迟都重要的交互式 OpenAI 编程。
OpenAI
当前推理模型
预算型 GPT-5.6 Luna xhigh 档,1M 上下文,任务成本很低,输出速度较快。
适合场景: 适合成本敏感的 OpenAI 代码助手和长上下文批量修改。
OpenAI
当前推理模型
Kimi K3 low 档保留 1M+ 上下文,任务成本低于 K3 max。
适合场景: 适合不需要 max 推理力度、但想控制成本的 Kimi 长上下文编程。
Kimi
当前通用模型
Gemini 3.1 Pro 预览版,1M 上下文,成本与速度在 Google 生态中较均衡。
适合场景: 适合 Google Cloud 编程试用、多模态原型和长上下文预览评估。
当前模型;部分指标未公开
Motif 3 靠智能指数上榜,中等上下文;多数公开速度与价格指标仍不完整。
适合场景: 适合在公开指标尚不成熟、但仍想对照榜单位次时,评估 Motif 3。
Motif Technologies
当前推理模型
任务成本很低的 GPT-5.6 Luna high 档,1M 上下文,响应较快。
适合场景: 适合高用量 OpenAI 代码助手和预算型长上下文工作流。
OpenAI
当前推理模型
低延迟 GPT-5.6 Terra medium 档,1M 上下文,端到端响应很短。
适合场景: 适合轻快的交互式编程、重构和工具调用密集的 OpenAI agent 循环。
OpenAI
当前模型;部分指标未公开
Gemini 3.5 Flash medium 模式,1M 上下文、输出快;本快照未完全公开任务成本。
适合场景: 适合更看重 Flash medium 速度、而非已公布任务成本的 Google 生态实验。
当前模型;部分指标未公开
GPT-5.3 Codex xhigh 编程向档位;本快照未完全公开任务成本。
适合场景: 适合以 Codex 为中心的软件任务、仓库修改和 OpenAI coding agent 工作流。
OpenAI
当前推理模型
MiniMax M3,1M 上下文,任务成本低,首块延迟低。
适合场景: 适合成本敏感的代码助手、区域技术栈和低延迟交互式修改。
MiniMax
当前模型;部分指标未公开
Motif 3 Beta 靠智能指数上榜;多数公开速度与价格指标仍不完整。
适合场景: 适合在指标尚不成熟、但仍想对照榜单位次时,评估新兴模型厂商。
Motif Technologies
当前推理模型
较早的 DeepSeek V4 Pro max(0813 之前),1M 上下文,任务成本很低;总响应长于 0813。
适合场景: 适合预算型 coding agent、自托管评估和成本敏感的长上下文任务。
DeepSeek
当前推理模型
DeepSeek V4 Pro high 档,1M 上下文,任务成本低,延迟低于 max。
适合场景: 适合成本敏感的交互式编程,以及 DeepSeek 端点上的长上下文分析。
DeepSeek
当前推理模型
Kimi K2.7 Code 编程向条目,256k 上下文,任务成本已公开。
适合场景: 适合不需要完整 1M K3 上下文时的 Kimi 代码工作流。
Kimi
当前推理模型
小米 MiMo V2.5-Pro,1M 上下文,任务成本很低,适合区域技术栈。
适合场景: 适合预算型多语言编程、区域 API 和低成本长上下文助手。
Xiaomi
当前通用模型
非推理 Claude Sonnet 5,1M 上下文,延迟低,成本档位轻于 max。
适合场景: 适合日常 Claude 编程、快速修改,以及不需要深度推理的交互会话。
Anthropic
当前推理模型
Thinking Machines 的 Inkling,1M 上下文,任务成本已公开,首块延迟不错。
适合场景: 适合在已有公开定价与延迟时,评估新实验室的长上下文能力。
Thinking Machines
当前推理模型
腾讯 Hy3,中等上下文,任务成本很低,首块延迟有竞争力。
适合场景: 适合区域编程技术栈、预算型助手和腾讯生态实验。
Tencent
当前模型;部分指标未公开
Nex N2-Pro 以中等上下文和较快输出上榜;本快照任务成本未完全公开。
适合场景: 适合评估新兴厂商,以及主流实验室之外的低延迟编程实验。
Nex AGI
当前通用模型
非推理 GPT-5.6 Sol,1M 上下文,Sol 系列首块延迟最低。
适合场景: 适合不需要长推理、但想更快响应的 OpenAI 编程循环。
OpenAI
当前模型;部分指标未公开
Upstage Solar Pro 4,512k 上下文,速度已公开;本快照任务成本未完全公开。
适合场景: 适合按智能指数评估 Upstage 模型的区域与文档密集型编程栈。
Upstage
当前推理模型
低延迟 GPT-5.6 Terra low 档,1M 上下文,端到端响应很短。
适合场景: 适合不需要最高推理档的快速交互式 OpenAI 编程与快速重构。
OpenAI
当前推理模型
较小的 Inkling 变体,1M 上下文,任务成本低,输出速度快于基础 Inkling。
适合场景: 适合对延迟和成本更敏感时,评估 Thinking Machines 模型。
Thinking Machines
当前模型;部分指标未公开
中国移动 JT-4.1 Flash 靠智能指数上榜;多数公开价格与速度指标仍不完整。
适合场景: 适合以榜单位次为主要信号时,评估中国移动区域技术栈。
China Mobile
当前模型;部分指标未公开
Agnes 2.5 Pro Alpha,1M 上下文,输出速度较快;本快照任务成本未完全公开。
适合场景: 适合对 Sapiens AI 新兴模型做早期长上下文评估。
Sapiens AI
当前推理模型
Qwen 3.7 Plus,1M 上下文,任务成本低于 Qwen 3.8 Max,总响应中等。
适合场景: 适合成本敏感的 Qwen coding agent 和多语言产品工程循环。
Alibaba