Kimi K3・Claude Opus 5・Grok 4.5:コーディングモデル三角比較
話題の三モデルをレイテンシ・コスト・スタック適合で比較 — 2026-07-25 スナップショット、行列の読み方、現実的なスタック、同一ブランチ trial。Opus ティア・K3 ハーネス・Grok 限界へリンク。
2026 年 7 月下旬、検索フィードを占める名前は三つ。互換 SKU ではありません — レイテンシの形、コンテキスト上限、ベンダースタックが異なります。このページは 日付付きの三角比較 で、一読したあと sibling の深掘り(ティア、ハーネス、正面比較)へ進んでください。表の数値は DevCove 2026-07-25(ランキング)。
使い方: シナリオ表で行を選ぶ → リンク記事を読む → 同一ブランチ・同一テスト で各モデルを trial。Rank #5 と #7 は決勝戦ではありません — リトライと人間の修正時間が請求を決めます。
一言ずつ
| モデル | 一行での役割 |
|---|---|
| Claude Opus 5 | Anthropic ツール内のティア付き推論 — 日常 high/medium、max はプランステップのみ。 |
| Kimi K3 | スコープ付きエージェント向け Moonshot 1M+ 旗艦 — ハーネス優先、レイテンシはその次。 |
| Grok 4.5 high | 小タスク向けの安く速いスナップショット像 — 品質はローカルで証明。 |
スナップショット行列
| K3 | Opus 5 high | Grok 4.5 high | |
|---|---|---|---|
| Rank | #7 | #5 | #12 |
| Index | 57 | 59 | 54 |
| Context | 1.05M | 1M | 500k |
| Cost / task | $0.95 | $1.06 | $0.31 |
| First chunk* | 161s | 25s | 12s |
*AA ハーネスフィールド — 自分の IDE/エージェントで計測。
フィールドの読み方
Index と Rank は固定ハーネス上のスナップショット — trial の順序付け に使い、調達スライドだけの根拠にしない。Cost / task は 1 回の見積もり;安いモデルで 2 回余計に回すと負けうる。First chunk は K3 と Opus のエディタ UX 差が最も出る所。Grok は本表でコストと chunk に有利だが #12 なので、merge の default にする前に 自スタックで証明 が必要。
Opus は必ず ティア(`high` / `medium` / `max`)を名指し — Opus ティア。同一チケットの K3 vs Opus は Vs 記事 を使い、ここで再論しない。
default にしない方がよいとき(正直な除外)
| モデル | default を避けるのは… |
|---|---|
| Opus 5 | Anthropic ツールが使えない;最安 chat だけ欲しく Claude 契約がない。 |
| K3 | 人がエディタで初回トークンを待つ;スコープが曖昧(余計なファイルに触る)。 |
| Grok 4.5 high | auth・マイグレ・複数ファイル refactor で、review に厳しいモデルがいない。 |
ルーティングのヒント であり禁止ではない — 例外は trial メモへ。
シナリオルーター
| 必要なもの… | 最初に | 深掘り |
|---|---|---|
| Claude Code 店、複数ファイル | Opus high | Opus ティア |
| Moonshot 承認、長いエージェント job | タイトスコープの K3 | K3 ハーネス |
| K3 vs Opus 正面比較 | 同一ブランチ trial | Vs 記事 |
| 予算付き chat、小さな diff | Grok trial | Grok 限界 |
| 1 スプリントで二モデル | 下のスタック | 本節 + ピラー |
| スナップショットの読み方 | — | 方法論ピラー |
現実的なスタック(1 本線 + 2 専門)
多くのチームは 三 default は不要。本スナップショットに合う型:
- 主 merge 経路: Opus high(または承認済み Anthropic ティア)で複数ファイルと merge できる review。
- 安い下書きレーン: Grok 4.5 high でボイラープレート・ログ・初回質問 — Opus と 同じテスト なしの auto-merge は禁止。
- バッチ / 長コンテキスト: Moonshot 承認済み、スコープ固定(パス + 受け入れテスト)、first chunk で人を止めないときだけ K3 — K3 ハーネス。
Incoming task
│
├─ Touches prod auth / schema / >3 files?
│ └─ Yes → Opus high (or max for plan-only step) → human review
│
├─ Small, reversible, human waits in editor?
│ └─ Yes → Grok trial OR Opus medium — measure fix time, not hype
│
└─ Approved batch agent + frozen scope?
└─ Yes → K3 with harness; Opus as benchmark on same branch
同一ブランチ trial(最小)
機能ブランチ 1 本、モデルごとに 同じ npm test — 人間の修正分数 を記録。
git checkout -b trial/model-picker-$(date +%Y%m%d)
npm test
# run agent with model A, commit; note fix time
git reset --hard HEAD~1 # only if you want a clean re-trial on same base
npm test
# repeat for model B/C
本番マージ前:AI coding ship checklist。
編集台メモ
永遠の #1 なし — 日付付き証拠 とローカル trial のみ。スナップショット日: 2026-07-25。深掘り:Opus · K3 agent · Grok · K3 vs Opus · ランキングの読み方。