Kimi K3 × 三种 Coding Harness 真实 token 消耗对比 · 干货攻略

  • 链接: https://x.com/rasbt/status/2082173006814568516
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-08-03

这是什么

2026 年 7 月 29 日,ML/AI 研究员 Sebastian Raschka(@rasbt)在 X 上公布了自己做的一个硬核实测:用 Kimi K3 模型在 28 个完全相同的任务上,分别跑三种主流 Coding Harness——Claude CodeHermesKimi Code——并对比任务完成率与 token 消耗。

结果出乎意料:三个 Harness 任务完成率几乎相同,但 token 消耗差距最高达 30 倍

后续补充(7 月 30 日)进一步确认:这一现象并非 Kimi K3 独有,Qwen3.6-27B 等其他模型上同样观察到 Claude Code 比其他 Harness 多消耗 2–3 倍 token,且成功率相当。Rasbt 本人也公开表示困惑——这是 Claude Code 的缺陷、设计取舍,还是有意为之,尚未有明确结论。

为什么值得关注

谁做的、解决什么问题

Rasbt 是前威斯康星大学统计学教授、《Build a Large Language Model From Scratch》作者,现任 Lightning AI 研究工程师,以一手实测拆解 AI 系统闻名。他的帖子通常附带真实代码、真实数据,不依赖官方营销材料。

这则帖子的价值在于把 Coding Harness 的成本问题量化了。业界普遍关注模型性能,却忽视了一个关键变量:同一模型在不同 Harness 下运行,token 消耗可能相差一个数量级。对成本敏感的团队来说,这是直接影响工程预算的现实问题。

核心发现

发现 原帖描述 核验结论
Claude Code token 消耗是其他 Harness 的 2–3×(同成功率) rasbt 实测,Jul 30 补充确认 ✅ 多方独立来源一致验证
同一任务,不同 Harness token 消耗最高相差 30× rasbt Jul 29 主帖 ⚠️ 原帖主张,极端值未找到原始数据支撑
Kimi K3 在 AA-Briefcase 每任务平均成本 $10.57 Artificial Analysis 独立评测 ✅ 官方可查
Kimi K3 token 价格:$3/1M 输入,$15/1M 输出,$0.30/1M 缓存命中 Moonshot AI 官方 ✅ 官方文档确认

核验过程

官方来源

  1. Kimi K3 技术报告(arXiv:2607.24653,2026-07-27) - 2.8T 总参,104B 激活参,896 专家每 token 选 16 个 - 架构:Kimi Delta Attention + Attention Residuals + Stable LatentMoE - scaling 效率比 K2 系列提升约 2.5× - 包含 coding、agentic、general RL post-training 说明

  2. Moonshot AI 官方定价页 - 输入(未命中缓存):$3.00 / 1M tokens - 输入(命中缓存):$0.30 / 1M tokens - 输出:$15.00 / 1M tokens

  3. Artificial Analysis AA-Briefcase 评测(2026-07-21) - Kimi K3 平均每任务 $10.57,平均耗时 56.4 分钟 - 平均每任务 83 个 turn,120k 输出 tokens - 同任务 Claude Fable 5 仅需约 22 分钟

交叉验证

Claude Code token 消耗更高的结论得到多方独立来源一致支持:

  • codemyspec.com(2026):实测 Codex token 效率比 Claude Code 高 2–3×;Aider 高 4.2×(同成功率下)
  • firecrawl.dev "Best AI Coding Agents 2026":社区对标数据显示 Claude Code 比 Codex 多消耗 3–4× token
  • catdoes.com:同一 Express.js 重构任务,Claude Code 消耗 6.2M tokens,Codex 仅 1.5M(约 4×)
  • derivity.com:Fable 5 在 Claude Code 每任务生成 119,611 tokens,Sol 在 Codex 仅 54,860 tokens(约 2.2×)
  • rasbt Jul 30 补充帖:明确确认此现象在 Qwen3.6-27B 等其他模型上也存在

⚠️ 未完全核验项:rasbt 主帖称"同一任务 token 消耗最高相差 30×"——这一极端差值描述未找到原始数据支撑(Rasbt 在 X thread 中提及但未附详细表格),攻略中以"高达 30×"标注为原帖主张。

上手步骤

1. 跑你自己的 Harness 对比实验

Rasbt 的实验框架可以复现,以下是实操建议:

# 安装三个 Harness(以主流选项为例)
# Claude Code
npm install -g @anthropic-ai/claude-code

# Kimi Code(Kimi 官方 CLI)
pip install kimi-code  # 或参见 kimi.moonshot.ai 官方文档

# Hermes(或其他开源 Harness,如 Aider)
pip install aider
# 最小化对比框架示例(伪代码)
# 目标:用同一模型+同一任务集,对比不同 Harness 的 token 消耗

tasks = load_benchmark_tasks("28-identical-tasks.json")  # 你自己的测试集
harnesses = ["claude-code", "kimi-code", "aider"]
model = "kimi-k3"  # 或 "qwen3.6-27b" 等

results = {}
for harness in harnesses:
    total_tokens = 0
    success_count = 0
    for task in tasks:
        result = run_task(harness, model, task)
        total_tokens += result.token_count
        success_count += result.success
    results[harness] = {
        "tokens": total_tokens,
        "success_rate": success_count / len(tasks),
        "tokens_per_task": total_tokens / len(tasks)
    }

print(results)

2. 估算你的成本

知道每任务 token 消耗后,套用 Kimi K3 官方定价:

每月成本 ≈ 任务数 × (输入tokens × $3/1M + 输出tokens × $15/1M)

Kimi K3 官方披露缓存命中率在 coding 工作负载上 >90%,实际成本通常接近 $0.30/1M 输入。

3. 选择 Harness 的决策框架

If 任务关键性高(生产级、涉及复杂逻辑):
    → Claude Code(token 消耗更高,但覆盖更全面)
elif 成本敏感,且任务可拆分验证:
    → Kimi Code / Aider / Codex(token 效率高 2-4×)
elif 需要快速验证原型:
    → 用低 effort 模式(如 Claude Code 的 fast mode)

坑与适用边界

⚠️ 坑 1:rasbt "30×" 极端值为未详细公开数据

rasbt Jul 29 主帖提及"同一任务最高消耗相差 30×",但未附具体数据表。这一数值在多个交叉验证来源中均未出现独立支撑——可能是某些特定任务类型下的极值。攻略正文以"高达 30×"标注,建议不要直接引用这一数字用于决策,建议以"2–3×"作为规划参考。

⚠️ 坑 2:Harness 效率 ≠ 模型能力

token 消耗高不等于"更笨"或"更浪费"。Claude Code 消耗更多 token 部分是因为它读取更多上下文文件、做更多规划步骤。在高风险生产代码上,这可能反而是优点。选 Harness 时需要权衡质量成本比,而不是单纯看 token 数字。

⚠️ 坑 3:Kimi K3 权重发布进度

  • API 先行(2026-07-16 已可用)
  • 完整权重(96 个 Hugging Face shard)2026-07-27 才发布
  • 本地部署建议配置:≥64 GPU(因 104B 激活参数),大多数团队仍建议用 API

⚠️ 坑 4:Claude Code Max 计划隐藏成本

用户报告在 $100 Max 计划下,30 天内可消耗约 $1,850 等值 token(按 API 费率折算)。订阅制掩盖了真实消耗,需要定期审计。

适用边界

  • 适合:工程预算评估、Harness 选型决策、Kimi K3 性价比分析
  • 不适合:作为最终结论(Rasbt 本人也表示需要进一步调查);Harness 之间二选一的绝对答案(成功率和 token 消耗需一起看)

一句话结论

Claude Code 在同成功率下 token 消耗确实比 Kimi Code / Aider / Codex 高出 2–3 倍(多方独立验证), rasbt 报告的极端情况高达 30× 但未公开详细数据;选 Harness 要同时看成功率和成本, Claude Code 的高覆盖度在关键任务上可能物有所值,但在成本敏感场景下轻量 Harness 更划算。