Kimi K3 × 三种 Coding Harness 真实 token 消耗对比 · 干货攻略
- 链接: https://x.com/rasbt/status/2082173006814568516
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-08-03
这是什么
2026 年 7 月 29 日,ML/AI 研究员 Sebastian Raschka(@rasbt)在 X 上公布了自己做的一个硬核实测:用 Kimi K3 模型在 28 个完全相同的任务上,分别跑三种主流 Coding Harness——Claude Code、Hermes、Kimi Code——并对比任务完成率与 token 消耗。
结果出乎意料:三个 Harness 任务完成率几乎相同,但 token 消耗差距最高达 30 倍。
后续补充(7 月 30 日)进一步确认:这一现象并非 Kimi K3 独有,Qwen3.6-27B 等其他模型上同样观察到 Claude Code 比其他 Harness 多消耗 2–3 倍 token,且成功率相当。Rasbt 本人也公开表示困惑——这是 Claude Code 的缺陷、设计取舍,还是有意为之,尚未有明确结论。
为什么值得关注
谁做的、解决什么问题
Rasbt 是前威斯康星大学统计学教授、《Build a Large Language Model From Scratch》作者,现任 Lightning AI 研究工程师,以一手实测拆解 AI 系统闻名。他的帖子通常附带真实代码、真实数据,不依赖官方营销材料。
这则帖子的价值在于把 Coding Harness 的成本问题量化了。业界普遍关注模型性能,却忽视了一个关键变量:同一模型在不同 Harness 下运行,token 消耗可能相差一个数量级。对成本敏感的团队来说,这是直接影响工程预算的现实问题。
核心发现
| 发现 | 原帖描述 | 核验结论 |
|---|---|---|
| Claude Code token 消耗是其他 Harness 的 2–3×(同成功率) | rasbt 实测,Jul 30 补充确认 | ✅ 多方独立来源一致验证 |
| 同一任务,不同 Harness token 消耗最高相差 30× | rasbt Jul 29 主帖 | ⚠️ 原帖主张,极端值未找到原始数据支撑 |
| Kimi K3 在 AA-Briefcase 每任务平均成本 $10.57 | Artificial Analysis 独立评测 | ✅ 官方可查 |
| Kimi K3 token 价格:$3/1M 输入,$15/1M 输出,$0.30/1M 缓存命中 | Moonshot AI 官方 | ✅ 官方文档确认 |
核验过程
官方来源
-
Kimi K3 技术报告(arXiv:2607.24653,2026-07-27) - 2.8T 总参,104B 激活参,896 专家每 token 选 16 个 - 架构:Kimi Delta Attention + Attention Residuals + Stable LatentMoE - scaling 效率比 K2 系列提升约 2.5× - 包含 coding、agentic、general RL post-training 说明
-
Moonshot AI 官方定价页 - 输入(未命中缓存):$3.00 / 1M tokens - 输入(命中缓存):$0.30 / 1M tokens - 输出:$15.00 / 1M tokens
-
Artificial Analysis AA-Briefcase 评测(2026-07-21) - Kimi K3 平均每任务 $10.57,平均耗时 56.4 分钟 - 平均每任务 83 个 turn,120k 输出 tokens - 同任务 Claude Fable 5 仅需约 22 分钟
交叉验证
Claude Code token 消耗更高的结论得到多方独立来源一致支持:
- codemyspec.com(2026):实测 Codex token 效率比 Claude Code 高 2–3×;Aider 高 4.2×(同成功率下)
- firecrawl.dev "Best AI Coding Agents 2026":社区对标数据显示 Claude Code 比 Codex 多消耗 3–4× token
- catdoes.com:同一 Express.js 重构任务,Claude Code 消耗 6.2M tokens,Codex 仅 1.5M(约 4×)
- derivity.com:Fable 5 在 Claude Code 每任务生成 119,611 tokens,Sol 在 Codex 仅 54,860 tokens(约 2.2×)
- rasbt Jul 30 补充帖:明确确认此现象在 Qwen3.6-27B 等其他模型上也存在
⚠️ 未完全核验项:rasbt 主帖称"同一任务 token 消耗最高相差 30×"——这一极端差值描述未找到原始数据支撑(Rasbt 在 X thread 中提及但未附详细表格),攻略中以"高达 30×"标注为原帖主张。
上手步骤
1. 跑你自己的 Harness 对比实验
Rasbt 的实验框架可以复现,以下是实操建议:
# 安装三个 Harness(以主流选项为例)
# Claude Code
npm install -g @anthropic-ai/claude-code
# Kimi Code(Kimi 官方 CLI)
pip install kimi-code # 或参见 kimi.moonshot.ai 官方文档
# Hermes(或其他开源 Harness,如 Aider)
pip install aider
# 最小化对比框架示例(伪代码)
# 目标:用同一模型+同一任务集,对比不同 Harness 的 token 消耗
tasks = load_benchmark_tasks("28-identical-tasks.json") # 你自己的测试集
harnesses = ["claude-code", "kimi-code", "aider"]
model = "kimi-k3" # 或 "qwen3.6-27b" 等
results = {}
for harness in harnesses:
total_tokens = 0
success_count = 0
for task in tasks:
result = run_task(harness, model, task)
total_tokens += result.token_count
success_count += result.success
results[harness] = {
"tokens": total_tokens,
"success_rate": success_count / len(tasks),
"tokens_per_task": total_tokens / len(tasks)
}
print(results)
2. 估算你的成本
知道每任务 token 消耗后,套用 Kimi K3 官方定价:
每月成本 ≈ 任务数 × (输入tokens × $3/1M + 输出tokens × $15/1M)
Kimi K3 官方披露缓存命中率在 coding 工作负载上 >90%,实际成本通常接近 $0.30/1M 输入。
3. 选择 Harness 的决策框架
If 任务关键性高(生产级、涉及复杂逻辑):
→ Claude Code(token 消耗更高,但覆盖更全面)
elif 成本敏感,且任务可拆分验证:
→ Kimi Code / Aider / Codex(token 效率高 2-4×)
elif 需要快速验证原型:
→ 用低 effort 模式(如 Claude Code 的 fast mode)
坑与适用边界
⚠️ 坑 1:rasbt "30×" 极端值为未详细公开数据
rasbt Jul 29 主帖提及"同一任务最高消耗相差 30×",但未附具体数据表。这一数值在多个交叉验证来源中均未出现独立支撑——可能是某些特定任务类型下的极值。攻略正文以"高达 30×"标注,建议不要直接引用这一数字用于决策,建议以"2–3×"作为规划参考。
⚠️ 坑 2:Harness 效率 ≠ 模型能力
token 消耗高不等于"更笨"或"更浪费"。Claude Code 消耗更多 token 部分是因为它读取更多上下文文件、做更多规划步骤。在高风险生产代码上,这可能反而是优点。选 Harness 时需要权衡质量成本比,而不是单纯看 token 数字。
⚠️ 坑 3:Kimi K3 权重发布进度
- API 先行(2026-07-16 已可用)
- 完整权重(96 个 Hugging Face shard)2026-07-27 才发布
- 本地部署建议配置:≥64 GPU(因 104B 激活参数),大多数团队仍建议用 API
⚠️ 坑 4:Claude Code Max 计划隐藏成本
用户报告在 $100 Max 计划下,30 天内可消耗约 $1,850 等值 token(按 API 费率折算)。订阅制掩盖了真实消耗,需要定期审计。
适用边界
- 适合:工程预算评估、Harness 选型决策、Kimi K3 性价比分析
- 不适合:作为最终结论(Rasbt 本人也表示需要进一步调查);Harness 之间二选一的绝对答案(成功率和 token 消耗需一起看)
一句话结论
Claude Code 在同成功率下 token 消耗确实比 Kimi Code / Aider / Codex 高出 2–3 倍(多方独立验证), rasbt 报告的极端情况高达 30× 但未公开详细数据;选 Harness 要同时看成功率和成本, Claude Code 的高覆盖度在关键任务上可能物有所值,但在成本敏感场景下轻量 Harness 更划算。