Kimi K3 上生产:先修 agent 环,再谈模型

K3 上线首先是 harness:写权限、1M 上下文喂什么、合并前门禁——不是再写一篇 benchmark 通稿。

Agent 跑绿了,直到有人看见 diff 里动了 migrations/。不是 K3「失控」——我们把写范围放在仓库根、往上下文里塞了 90 万 token 日志 指望模型自己悟。模型很听话:在错的层里改得理直气壮。

Kimi K3 发布解读 讲规格;这篇讲 K3 外面的环:Moonshot API 或 Kimi Code、1M 怎么喂、合并前怎么拦。DevCove 2026-07-25 快照:K3 #7、指数 57、表内首块约 161s——按 批处理 / agent 规划,别默认当秒回 IDE chat(除非你们的壳子把延迟藏好了)。

白板上怎么画 harness

┌──────────────────────────────────────────────┐
│  人:范围 + 验收测试                          │
├────────────────────┬─────────────────────────┤
│  上下文( curated) │  工具面(shell/MCP/网)   │
├────────────────────┴─────────────────────────┤
│  K3(API 里推理档写清楚)                      │
├──────────────────────────────────────────────┤
│  CI + 人审 diff(硬要求)                      │
└──────────────────────────────────────────────┘

环弱,换哪个 frontier 都像烂模型。先修框,再换名。

烂默认更好默认
范围「修一下服务」写清包名 + 允许改 的路径
上下文整库粘贴规格切片 + 失败测试 + 一篇 ADR
工具shell 全开白名单;破坏性命令要人点
输出一次改一堆文件分步小 patch

1M 是预算,不是垃圾场

1.05M 窗口容易诱发「全上传」。MoE 再大也不替你做策展。

值得喂别喂
用户故事 + 非目标整包 node_modules / 生成 SDK
一张架构锚点五十篇没排序的 README
最新一段 CI 失败全量历史日志
一个 golden test整套测试贴进 prompt

我们给 拼上下文 设 15 分钟上限。若策展比修 bug 还久,这 ticket 就不该交给 agent。

Kimi Code 还是 HTTP API

路径什么时候选
Kimi Code要 Moonshot 终端 agent 默认体验
HTTP APIkimi-k3嵌进自建编排
第三方 IDE仅官方支持时——查清数据 residency

安全审的是 权限,不是榜分。K3 benchmark 高不会自动批准生产库写权限。

验收环(不能省)

AI coding agent 的验收门禁

工单
  → 收束工具的 agent(K3)
  → 单测 + 集成测
  → lint / 类型
  → 人读 diff(不看摘要糊弄)
  → 发布分支跑 ship checklist

K3 有时比旧默认 patch 更宽。更宽就要 更宽 的 review,不是更快合并。

我们仍选 Opus 的情况

Claude Code 已合规时,同快照 Opus 5 high 往往交互更顺——见 K3 vs Opus 5。Moonshot 合同在1M 任务成本要紧、或 Kimi Code 贴 ops 时,才优先试 K3。

运维规矩: GitHub 限流别用 partial 快照覆盖;agent 重试也一样——别因为「通常能过」就关门禁。

链接: 排名 · 方法论 · Ship checklist

证据日期: 2026-07-25;上线前核对 Moonshot API 文档。

专题阅读

相关文章

完整指南如何为真实项目选择 AI 编程模型正确使用公开模型排行榜,不要把 benchmark 分数当成永久的编码质量结论。了解 Artificial Analysis 各项指标对成本、延迟、上下文和真实交付意味着什么。Kimi K3 编程测评:基准、API 与何时值得试面向软件工作的 Kimi K3:1M 上下文、DevCove 2026-07-25 快照排名第 7、编程 benchmark、API 与定价要点,及与 Claude Opus 5 的对照——非「永远最佳模型」结论。Kimi K3 和 Claude Opus 5 怎么选:不是冠亚军,是两套工具链对比看延迟形状、Opus 分档和你们已在用的栈。2026-07-25 快照 + 交付和选型两个视角。Claude Opus 5 怎么选档:别为榜单第一白付 max 的钱Opus 5 是一档一档的推理阶梯,不是单一模型。对照 DevCove 2026-07-25 快照,把 max/high/medium 对上真实仓库任务。AI 编程 Agent 需要验证关卡,而不只是更好的 PromptAI 编程 Agent 可以生成比自动补全更大的补丁,但生产团队需要围绕输出建立测试、审查、沙箱和发布关卡。

相关工具

使用本文提到的工具

AI 编程上线检查清单AI coding checklist / AI app launch checklist / vibe coding checklistAI 代码审查清单AI generated code review checklist / review AI generated code / AI code review checklist

继续学习相关格式

开发者 AI 基础课程面向开发者工作流的 AI 实用基础:模型、提示词、编程助手、结果验证、隐私与可靠协作。

返回文章列表