Grok 4.5 でコード:速度・コスト・証拠の限界
Grok 4.5 は紙の上では速く安く見えます — リポで品質を示せればスコープ付きチャットに有用。公開コーディング証拠が薄いところは正直に書きます。
Grok 4.5 (high) を「第二モデル」枠に入れました。小さくスコープした 質問向け — スタックトレース、regex 書き換え、設定 tweak — Opus 5 max がスライドで勝ったからではなく、2026-07-25 の ランキングスナップショット が、はるかに重い frontier エントリの隣で タスク $0.31、約 11.6s ファーストチャンクを示したからです。
節約は diff がテストを通るときだけ意味があります。DevCove 実施の Grok コーディング試験は ありません;以下は スナップショット事実 と トライアル規律 の混合です。
スナップショットカード(2026-07-25)
| 項目 | Grok 4.5 high | Opus 5 medium | Kimi K3 |
|---|---|---|---|
| Rank | #12 | #8 | #7 |
| Index | 54 | 56 | 57 |
| Context | 500k | 1M | 1.05M |
| Cost / task | $0.31 | $0.62 | $0.95 |
| First chunk | 11.63s | 5.63s | 161.17s |
500k コンテキスト は 1M クラブの半分 — ツールがファイル取得するなら十分;「モノレポを貼る」ワークフローならきつい。
ループで Grok を許す場所
| 用途 | 許可? | ガードレール |
|---|---|---|
| エラー説明 + 1 ファイル patch 提案 | しばしば yes | 人が diff を適用 |
| 複数パッケージ refactor | デフォルトは稀 | 先に Opus/K3 trial |
| 本番 schema 変更 | オートパイロット no | 人 + checklist |
| コンプライアンスで vendor ブロック | 停止 | ポリシーが benchmark より上 |
午後トライアル手順
- 三タスク:bugfix、小 feature、テスト backfill — 現行モデルと 同一プロンプト。
- 採点:手 fix 分、テスト pass、想外コマンド。
- ship checklist なしでマージしない。
Grok trial 結果
│
├─ fix 時間 ≤ 現行?
│ ├─ Yes → スコープ chat の第 2 モデルとして維持
│ └─ No → デフォルトから外す;ブレストのみ
│
└─ コンプライアンス OK?
└─ No → キー削除;「こっそり」使わない
主張しないこと
- index 54 から Grok が「frontier コーディング王」。
- タスク単価が低い = 月次 支出も低い保証。
- 公開 launch buzz が あなたの harness 指標に取って代わる。
関連:K3 vs Opus、Opus ティア、三モデル router。方法論:Best AI coding models for real projects。
Snapshot: 2026-07-25;xAI SKU 名とフィールドは変わる場合があります。