Ember-1 · 40% 思考 token 压缩实战攻略 · 干货攻略

  • 链接: https://x.com/rasbt/status/2104326522354147793
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-09-28

这是什么

Ember-1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。

这不是新架构,也不是新基座模型,而是 K3 的一次 specialized intelligence 后训练版本。Fireworks 团队在 50+ 次训练实验、200+ 次评估之后,把它做成了 Fireworks 推理模型系列的第一款产品。

核心定位:代码 agent 场景下,用 Kimi K3 一样的质量,花更少的钱。


为什么值得关注

分享者 @rasbt(Sebastian Raschka,参与 AI 教育的知名研究者)盯这条的原因很直接:推理模型的思考 token 是 agent 成本的大头。

Kimi K3 这样的长思考模型,生成的 token 里超过 90% 是内部推理,真正的回答 token 占比很小。更要命的是,在多轮 agent 场景里,每轮都会把之前所有思考 token 重新塞回上下文——turn 越多,上下文长度接近平方增长,早期轮的思考被反复读、反复计费。

Fireworks 给出的答案是:与其让开发者自己调低 reasoning effort(质量崩),不如让模型学会更高效地思考。

关键数据(官方来源,A/B 实测)

指标 Kimi K3 Ember-1 变化
任务得分 0.751 0.753 基本持平
每任务步数 23.8 21.4 -10%
每任务输出 token 49.3K 29.9K -39%
推理 token 减少 — — -71.3%
输出成本/任务 $0.74 $0.45 -39%

数据来源:Fireworks 官方 A/B 测试(客户生产流量),coding 工作负载。

第二家客户实测约 35% fewer tokens per task at comparable quality(官方原话)。

在公开基准上的表现

Fireworks 官方评测(对比 K3 默认 high effort):

基准 K3 Max Ember-1 节省
Terminal Bench 2.1 80.9% 82.0% -$23.1/task
SWE-bench Verified (500) 93.2% 92.2% -$68.1/task
SWE-Interact (75) 21.3% 20.0% -$60.8/task
DeepSWE 1.1 (113) 66.4% 75.2% -$126.9/task
τ-2 Bench Airline (50) 64% 66% -$0.3/task

Ember-1 在 DeepSWE 上反而质量提升了,这被 Fireworks 归因于"过度思考反而引入错误"的问题被压缩解决。

Ember-1 还在 Doximity 的 Bedside Bench(医学临床场景基准)上对 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 建立了新的帕累托前沿。


核验过程

本攻略所有数字来源:

  1. Fireworks 官方博客 fireworks.ai/blog/ember-1:模型定位、训练方法、A/B 数据、各基准数字(2026年9月23日发布)
  2. OpenRouter 页面 openrouter.ai/fireworks/ember-1:API 定价 $3/$15/1M,模型 ID,tool calling 支持
  3. Pi.dev 模型页 pi.dev/models/fireworks/accounts-fireworks-models-ember-1:完整 API schema,确认 reasoning 模式参数
  4. costbench.com / kie.ai:Kimi K3 官方定价 $3/$15/1M,2026年7月16日 Moonshot 官方 rate card
  5. Zeniteq 独立评论 zeniteq.com:对 Ember-1 定位的客观分析(确认 research preview 状态)

核验结论: - Token 压缩数字:官方说法 35-50%,A/B 实测 39% 总 token / 71.3% 推理 token——有原始表格,数字可信 - 定价:Ember-1 定价与 Kimi K3 完全相同($3/$15/1M),均为 Fireworks Serverless 公开价 - 模型 ID:accounts/fireworks/models/ember-1 - 发布状态:Research Preview,非正式上线 - 无 GitHub 仓库:Ember-1 是 Fireworks 托管模型,非开源权重

未核验项:Kimi K3 的完整权重下载链接(原帖未提及,官方尚未开放公开下载)


上手步骤

1. API 调用(OpenAI 兼容)

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_FIREWORKS_API_KEY",
    base_url="https://api.fireworks.ai/inference/v1"
)

response = client.chat.completions.create(
    model="accounts/fireworks/models/ember-1",
    messages=[
        {"role": "system", "content": "You are a helpful coding assistant."},
        {"role": "user", "content": "Implement a rate limiter in Python."}
    ],
    temperature=0.7,
    max_tokens=4096
)

print(response.choices[0].message.content)

2. 通过 OpenRouter 调用(无需 Fireworks 账号)

curl -X POST https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "fireworks/ember-1",
    "messages": [{"role": "user", "content": "Explain the strategy pattern in Go."}]
  }'

3. 推理 token 控制参数

Ember-1 支持 Fireworks 的 reasoning 参数:

# 关闭思考 token(直接输出)
response = client.chat.completions.create(
    model="accounts/fireworks/models/ember-1",
    messages=[{"role": "user", "content": "What is 2+2?"}],
    reasoning={"include_reasoning": False}  # Ember-1 自带压缩,但仍保留思考
)

注:reasoninginclude_reasoning 是 Fireworks 特有参数,非标准 OpenAI API。

4. Agent 场景成本对比

以一个 50 步 coding agent 为例(每步 1K 输入 + 5K 输出,Kimi K3 默认):

K3 默认 Ember-1 节省
输入 token/步 1K 1K —
输出 token/步 5K ~3K(-39%) —
50步总输出 250K ~153K ~97K
输出成本($15/1M) $3.75 $2.29 $1.46/任务

5. 上下文缓存优化

Ember-1 支持 Fireworks 隐式 prompt 缓存,系统 prompt 和长文档前缀可享 $0.30/1M(vs $3/1M):

# 发送相同 system prompt + 文档时,缓存自动命中
messages = [
    {"role": "system", "content": system_prompt},  # 缓存命中
    {"role": "user", "content": long_codebase + user_question}  # 缓存命中
]

坑与适用边界

⚠️ Research Preview 状态

  • Ember-1 标注为 Research Preview,不是正式上线产品
  • 服务可用性 SLA 未公开,不适合直接用于有严格稳定性要求的生产系统
  • 建议先在 staging 验证,监控一段时间再切主流量

⚠️ 质量并非在所有场景都持平

  • SWE-bench Verified:Ember-1 92.2% vs K3 Max 93.2%,掉了 1 个点
  • 如果你的场景是极度追求 benchmark 刷分,Ember-1 未必更优
  • 但 DeepSWE 1.1 反而升了——说明"过度思考引错"类场景反而受益

⚠️ Token 压缩比例是均值,非每题固定

  • 35-50% 是跨基准均值;某些任务可能接近 0 压缩,某些可能更高
  • 不建议直接用 40% 做精确成本预算,留 20-30% buffer

✅ Ember-1 真正擅长的场景

  • 多轮 coding agent:每轮重塞 context 的场景,token 减少效果最显著
  • 长文档分析 + 对话:context 越长,隐式缓存价值越大
  • API 成本优化:对 token 成本敏感的 B2B SaaS 产品

❌ Ember-1 不适合的场景

  • 需要极强 benchmark 刷分能力(还是 K3 Max 更好)
  • 严格 SLO 要求的生产系统(等正式 GA)
  • 需要完整开源权重本地部署(Ember-1 无权重公开)

一句话结论

Ember-1 = 用跟 Kimi K3 一样的钱,换 35-50% 的 token 节省;在多轮 agent 场景和多步推理任务上是目前最具性价比的选择,但它是 Research Preview,建议验证后上车。

如果你用 K3 跑 coding agent,切换到 Ember-1 大概率省 30-40% 成本且质量不降;如果你是刷榜选手,先别动。