Claude Opus 5 でコードを書く:ティア・レイテンシ・下げどき

Opus 5 は単一モデルではなくティアの階段です。DevCove 2026-07-25 スナップショットで max / high / medium をリポジに合わせ、オートコンプリート作業に max 料金を払うのをやめましょう。

先四半期、誰かが社内メモをスライドに貼りました。「デフォルト Opus 5 max — Artificial Analysis で rank #1」 と。財務が行項目に気づくより先に、エンジニアリングはレイテンシに気づきませんでした。Anthropic が出したのは Opus 5 一本ではなく、max / xhigh / high / medium / low という 階段 です。同じ公開リーダーボードでも、ティアごとに ファーストチャンクの遅延とタスク単価 が違います。

この記事は、Claude Code や API でデフォルトモデルを選ぶ人向けです。数値は DevCove 2026-07-25AI コーディングモデルランキング スナップショット(Artificial Analysis 由来)です。変わり得ます。スライドに写す前に、ランキングページの日付を必ず確認してください。

頭の中のモデルが壊れたところ

Intelligence Index を CPU の GHz のように扱っていました。高いほど常にコーディング向き、と。Opus 5 max はスナップショットで 61 で首位ですが、ベンチハーネスでは ファーストチャンク約 64sOpus 5 medium56約 5.6s です。IDE で待つ人にとって、その差が製品そのもので、脚注ではありません。

よくある誤り実際に起きること
リファクタ全部 max同じテストなら medium で通る diff に最上位ティア代を払う
クロスサービス移行を mediumモデル代は安いが、計画が薄いと人手修復で戻す
調達でティアを無視一つの SKU 名の裏に、五種類のレイテンシ請求

スナップショットの読み方: Index は ベンチタスク の順位であり、あなたのモノレポではありません。表と ship checklist 付きの限定トライアルをセットで。

ティア階段(2026-07-25 スナップショット)

生の方法論は Artificial Analysis を参照。DevCove が Opus 5 SKU について保持するフィールド:

TierRankIndexCost / taskFirst chunkTotal response向く場面
max161$2.0364.52s73.64s夜間プラン、高リスク review 準備
xhigh260$1.5638.85s48.54s安い実行ティアの前の計画ステップ
high559$1.0624.94s33.37s強い推論が要る日常エージェントループ
medium856$0.625.63s15.52s対話チャット、小さくスコープした編集
low表を信じる前にベンダー doc で SKU 確認

Claude Fable 5(index 60、rank #3)は姉妹ラインで、「Opus lite」ではありません。同スナップショットで 約 110s ファーストチャンク — 深読み向き、ペアプロにはきつい。

TCO:max が静かに勝つ/負ける場所

Cost per task はスナップショットのブレンドで、請求書そのものではありません。それでもパターンは見えます:

月次モデル請求
│
├─ 70% = "lint 修正 / 文言 tweak / 小 diff"
│     └─ max にすべきでない → medium/high
│
├─ 20% = テスト付き複数ファイル機能
│     └─ デフォルト high;プランが一度失敗したら xhigh
│
└─ 10% = 移行 / アーキテクチャ賭け
      └─ プランのみ xhigh または max;apply はティアを下げる

「どのモデルが一番賢い?」をやめ、チケットに P0 対話P1 エージェント batchP2 プランのみ を付けました。各タグがティア上限に対応します。超過は PR テンプレに一行理由 — 退屈なガバナンスで、請求のサプライズを減らす。

同スナップショットの Kimi K3 はタスク $0.95 だが 約 161s ファーストチャンク。Opus highタスク単価では高くても、誰かがスピナーを見ているなら エンジニア分の方が安い ことがあります。Kimi K3 vs Claude Opus 5 を参照。

シナリオ(ベンダー争いより先にティア)

ワークロード最初はエスカレート
単一サービス bugfixmedium同じプロンプトでテストが二度失敗
6–10 ファイル機能highパッケージ横断の不変条件が壊れる
移行設計ドキュメントプラン xhigh、パッチ highspec 更新なしの scope creep
auth / 決済タッチhigh + 人 review「max オートパイロット merge」は never

Opus 4.8 max はスナップショットで 56約 26s ファーストチャンク。懐かしさで 4.8 に留まるチームも — 端到端の待ち が日常では Opus 5 max に勝つまで、トライアルで証明されない限り。

デフォルトにしないこと

  • rank #1 だから max — rank は日付付き天気で、ポリシーではない。
  • プランと apply で同一ティア — 計画は高い;apply が慣性で max を継承すべきではない。
  • Opus だから diff review を省略AI コード review チェックリスト を使う。

方法論とスナップショット規律:Best AI coding models for real projects。長ジョブの harness 注:Kimi K3 for coding agents(対比であり推奨ではない)。

Snapshot: 2026-07-25 DevCove ランキング;Anthropic ティアと AA フィールドは、このページが知る前に動く場合があります。

In this topic

Related articles

Complete guide実プロジェクトのための AI コーディングモデルの選び方公開されているモデルリーダーボードを、恒久的なコーディング品質のスコアと誤解せずに使う方法。Artificial Analysis の指標がコスト、レイテンシ、コンテキスト、実際のデリバリーにどう関わるかを解説。Kimi K3 vs Claude Opus 5:コーディング向けスナップショット比較K3 と Opus 5 は王座争いではなく、レイテンシの形・ティア階段・すでに動かしているツールの話です。2026-07-25 スナップショットとエンジニアリング視点ふたつ。Kimi K3 コーディング向けレビュー:ベンチマーク・API・試すタイミングソフトウェア向け Kimi K3:1M コンテキスト、DevCove 2026-07-25 スナップショット #7、コーディング benchmark、API、料金—永久ベストモデルではありません。Kimi K3 とコーディングエージェント:ハーネス・コンテキスト・検証本番の K3 はまずハーネスの問題です。権限、1M コンテキストに何を入れるか、マージ前のゲート — ベンチマークの繰り返しではありません。Grok 4.5 でコード:速度・コスト・証拠の限界Grok 4.5 は紙の上では速く安く見えます — リポで品質を示せればスコープ付きチャットに有用。公開コーディング証拠が薄いところは正直に書きます。

関連ツール

この記事で使うツール

AI Coding リリースチェックリストAI coding checklist / AI app launch checklist / vibe coding checklistAI Code Review ChecklistAI generated code review checklist / review AI generated code / AI code review checklist

関連コース

開発者向け AI リテラシー コース開発者向けの実践的 AI リテラシーコースで学ぶ内容を紹介します。

記事一覧へ戻る