Claude Opus 5 怎么选档:别为榜单第一白付 max 的钱

Opus 5 是一档一档的推理阶梯,不是单一模型。对照 DevCove 2026-07-25 快照,把 max/high/medium 对上真实仓库任务。

有人把内部 memo 贴进 PPT:「默认 Opus 5 max,Artificial Analysis 排名第一。」 财务先看到账单,工程才看到首 token 延迟。Anthropic 卖的不是一个 Opus 5,而是 max / xhigh / high / medium / low 一串档位——同一套公开榜里,首块延迟和单次任务成本 差很多。

下文给在 Claude Code 或 API 里选默认模型的人。数字来自 DevCove 2026-07-25 模型排名(Artificial Analysis 字段)。会过期,采购前先看排名页上的快照日期。

我们踩过的坑

Intelligence Index 当成 CPU 主频:越高越适合写代码。快照里 Opus 5 max 指数 61,首块约 64sOpus 5 medium 指数 56,首块约 5.6s。人在 IDE 里等的是后者这种体感,不是 slide 上的第一名。

常见做法实际后果
一切 refactor 开 max大量 diff 用 medium 也能过测,却按顶档付钱
大迁移为了省钱死磕 medium规划薄,人工返工把省下的钱吃回去
采购只写一个 SKU 名五档 latency 混在一条「Opus 5」里

我们怎么看榜: 指数排的是 benchmark 任务,不是你的 monorepo。表要对上 小范围 trial上线检查清单

档位表(2026-07-25 快照)

方法论见 Artificial Analysis。DevCove 里 Opus 5 各档大致如下:

档位排名指数任务成本首块总响应值得开这一档的时候
max161$2.0364.52s73.64s夜间规划、高风险方案稿
xhigh260$1.5638.85s48.54s只拿来做「计划步」
high559$1.0624.94s33.37s日常 agent,还要推理质量
medium856$0.625.63s15.52s对话式小改
low以官方 SKU 为准

Claude Fable 5(指数 60,#3)是并列产品线,不是「阉割 Opus」。同快照首块约 110s——读库合适,结对编程难受。

账单:max 什么时候赚、什么时候亏

任务成本 是快照混合口径,不是发票。但能看出结构:

月度模型支出
│
├─ 七成调用 =  lint / 文案 / 小 diff
│     └─ 不该用 max → medium / high
│
├─ 两成 = 多文件 feature(带测试)
│     └─ 默认 high;规划翻车再 xhigh
│
└─ 一成 = 迁移 / 架构赌注
      └─ 规划 xhigh 或 max;改代码降档

我们给 ticket 打标:P0 人要等P1 agent 批处理P2 只规划。超档要在 PR 里写一行理由——土,但少惊呆财务。

同快照 Kimi K3 任务成本 $0.95,首块约 161s。Opus high 单次可能更贵,人等的分钟 却可能更省。见 K3 vs Opus 5

场景怎么选(先档位,再站队)

workload先开什么时候升档
单服务 bugmedium同 prompt 两次测不过
六七个文件 featurehigh跨包约束被打穿
迁移方案规划 xhigh,改代码 high范围漂了先改 spec
支付 / 鉴权high + 人审别「max 自动合并」

Opus 4.8 max 在快照里仍有 56、首块约 26s。有些团队留着 4.8 不是怀旧——端到端等待 比 Opus 5 max 更贴日常,直到 trial 证明值得换。

我们不会在团队默认的

  • 因为 #1 就 max — 排名是带日期的天气。
  • 规划和改代码同一档 — 规划贵,apply 不该惯性继承 max。
  • 因为 Opus 就不 review — 见 代码审查清单

读榜方法:真实项目如何选 AI 编程模型。长跑 agent 和 K3 对照:K3 与 harness

快照:2026-07-25;Anthropic 档位与 AA 字段会变,以排名页复核为准。

专题阅读

相关文章

完整指南如何为真实项目选择 AI 编程模型正确使用公开模型排行榜,不要把 benchmark 分数当成永久的编码质量结论。了解 Artificial Analysis 各项指标对成本、延迟、上下文和真实交付意味着什么。Kimi K3 和 Claude Opus 5 怎么选:不是冠亚军,是两套工具链对比看延迟形状、Opus 分档和你们已在用的栈。2026-07-25 快照 + 交付和选型两个视角。Kimi K3 编程测评:基准、API 与何时值得试面向软件工作的 Kimi K3:1M 上下文、DevCove 2026-07-25 快照排名第 7、编程 benchmark、API 与定价要点,及与 Claude Opus 5 的对照——非「永远最佳模型」结论。Kimi K3 上生产:先修 agent 环,再谈模型K3 上线首先是 harness:写权限、1M 上下文喂什么、合并前门禁——不是再写一篇 benchmark 通稿。Grok 4.5 写代码值不值:快和便宜之外,证据够吗纸面延迟和任务成本好看,适合收束小问;是否在你们仓库好用,得自己试。公开 coding 证据薄的地方我们直说。

相关工具

使用本文提到的工具

AI 编程上线检查清单AI coding checklist / AI app launch checklist / vibe coding checklistAI 代码审查清单AI generated code review checklist / review AI generated code / AI code review checklist

继续学习相关格式

开发者 AI 基础课程面向开发者工作流的 AI 实用基础:模型、提示词、编程助手、结果验证、隐私与可靠协作。

返回文章列表