Ember-1 · 40% 思考 token 压缩实战攻略 · 干货攻略
- 链接: https://x.com/rasbt/status/2104326522354147793
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-09-28
这是什么
Ember-1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。
这不是新架构,也不是新基座模型,而是 K3 的一次 specialized intelligence 后训练版本。Fireworks 团队在 50+ 次训练实验、200+ 次评估之后,把它做成了 Fireworks 推理模型系列的第一款产品。
核心定位:代码 agent 场景下,用 Kimi K3 一样的质量,花更少的钱。
为什么值得关注
分享者 @rasbt(Sebastian Raschka,参与 AI 教育的知名研究者)盯这条的原因很直接:推理模型的思考 token 是 agent 成本的大头。
Kimi K3 这样的长思考模型,生成的 token 里超过 90% 是内部推理,真正的回答 token 占比很小。更要命的是,在多轮 agent 场景里,每轮都会把之前所有思考 token 重新塞回上下文——turn 越多,上下文长度接近平方增长,早期轮的思考被反复读、反复计费。
Fireworks 给出的答案是:与其让开发者自己调低 reasoning effort(质量崩),不如让模型学会更高效地思考。
关键数据(官方来源,A/B 实测)
| 指标 | Kimi K3 | Ember-1 | 变化 |
|---|---|---|---|
| 任务得分 | 0.751 | 0.753 | 基本持平 |
| 每任务步数 | 23.8 | 21.4 | -10% |
| 每任务输出 token | 49.3K | 29.9K | -39% |
| 推理 token 减少 | — | — | -71.3% |
| 输出成本/任务 | $0.74 | $0.45 | -39% |
数据来源:Fireworks 官方 A/B 测试(客户生产流量),coding 工作负载。
第二家客户实测约 35% fewer tokens per task at comparable quality(官方原话)。
在公开基准上的表现
Fireworks 官方评测(对比 K3 默认 high effort):
| 基准 | K3 Max | Ember-1 | 节省 |
|---|---|---|---|
| Terminal Bench 2.1 | 80.9% | 82.0% | -$23.1/task |
| SWE-bench Verified (500) | 93.2% | 92.2% | -$68.1/task |
| SWE-Interact (75) | 21.3% | 20.0% | -$60.8/task |
| DeepSWE 1.1 (113) | 66.4% | 75.2% | -$126.9/task |
| τ-2 Bench Airline (50) | 64% | 66% | -$0.3/task |
Ember-1 在 DeepSWE 上反而质量提升了,这被 Fireworks 归因于"过度思考反而引入错误"的问题被压缩解决。
Ember-1 还在 Doximity 的 Bedside Bench(医学临床场景基准)上对 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 建立了新的帕累托前沿。
核验过程
本攻略所有数字来源:
- Fireworks 官方博客
fireworks.ai/blog/ember-1:模型定位、训练方法、A/B 数据、各基准数字(2026年9月23日发布) - OpenRouter 页面
openrouter.ai/fireworks/ember-1:API 定价 $3/$15/1M,模型 ID,tool calling 支持 - Pi.dev 模型页
pi.dev/models/fireworks/accounts-fireworks-models-ember-1:完整 API schema,确认 reasoning 模式参数 - costbench.com / kie.ai:Kimi K3 官方定价 $3/$15/1M,2026年7月16日 Moonshot 官方 rate card
- Zeniteq 独立评论
zeniteq.com:对 Ember-1 定位的客观分析(确认 research preview 状态)
核验结论:
- Token 压缩数字:官方说法 35-50%,A/B 实测 39% 总 token / 71.3% 推理 token——有原始表格,数字可信
- 定价:Ember-1 定价与 Kimi K3 完全相同($3/$15/1M),均为 Fireworks Serverless 公开价
- 模型 ID:accounts/fireworks/models/ember-1
- 发布状态:Research Preview,非正式上线
- 无 GitHub 仓库:Ember-1 是 Fireworks 托管模型,非开源权重
未核验项:Kimi K3 的完整权重下载链接(原帖未提及,官方尚未开放公开下载)
上手步骤
1. API 调用(OpenAI 兼容)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_FIREWORKS_API_KEY",
base_url="https://api.fireworks.ai/inference/v1"
)
response = client.chat.completions.create(
model="accounts/fireworks/models/ember-1",
messages=[
{"role": "system", "content": "You are a helpful coding assistant."},
{"role": "user", "content": "Implement a rate limiter in Python."}
],
temperature=0.7,
max_tokens=4096
)
print(response.choices[0].message.content)
2. 通过 OpenRouter 调用(无需 Fireworks 账号)
curl -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "fireworks/ember-1",
"messages": [{"role": "user", "content": "Explain the strategy pattern in Go."}]
}'
3. 推理 token 控制参数
Ember-1 支持 Fireworks 的 reasoning 参数:
# 关闭思考 token(直接输出)
response = client.chat.completions.create(
model="accounts/fireworks/models/ember-1",
messages=[{"role": "user", "content": "What is 2+2?"}],
reasoning={"include_reasoning": False} # Ember-1 自带压缩,但仍保留思考
)
注:
reasoninginclude_reasoning是 Fireworks 特有参数,非标准 OpenAI API。
4. Agent 场景成本对比
以一个 50 步 coding agent 为例(每步 1K 输入 + 5K 输出,Kimi K3 默认):
| K3 默认 | Ember-1 | 节省 | |
|---|---|---|---|
| 输入 token/步 | 1K | 1K | — |
| 输出 token/步 | 5K | ~3K(-39%) | — |
| 50步总输出 | 250K | ~153K | ~97K |
| 输出成本($15/1M) | $3.75 | $2.29 | $1.46/任务 |
5. 上下文缓存优化
Ember-1 支持 Fireworks 隐式 prompt 缓存,系统 prompt 和长文档前缀可享 $0.30/1M(vs $3/1M):
# 发送相同 system prompt + 文档时,缓存自动命中
messages = [
{"role": "system", "content": system_prompt}, # 缓存命中
{"role": "user", "content": long_codebase + user_question} # 缓存命中
]
坑与适用边界
⚠️ Research Preview 状态
- Ember-1 标注为 Research Preview,不是正式上线产品
- 服务可用性 SLA 未公开,不适合直接用于有严格稳定性要求的生产系统
- 建议先在 staging 验证,监控一段时间再切主流量
⚠️ 质量并非在所有场景都持平
- SWE-bench Verified:Ember-1 92.2% vs K3 Max 93.2%,掉了 1 个点
- 如果你的场景是极度追求 benchmark 刷分,Ember-1 未必更优
- 但 DeepSWE 1.1 反而升了——说明"过度思考引错"类场景反而受益
⚠️ Token 压缩比例是均值,非每题固定
- 35-50% 是跨基准均值;某些任务可能接近 0 压缩,某些可能更高
- 不建议直接用 40% 做精确成本预算,留 20-30% buffer
✅ Ember-1 真正擅长的场景
- 多轮 coding agent:每轮重塞 context 的场景,token 减少效果最显著
- 长文档分析 + 对话:context 越长,隐式缓存价值越大
- API 成本优化:对 token 成本敏感的 B2B SaaS 产品
❌ Ember-1 不适合的场景
- 需要极强 benchmark 刷分能力(还是 K3 Max 更好)
- 严格 SLO 要求的生产系统(等正式 GA)
- 需要完整开源权重本地部署(Ember-1 无权重公开)
一句话结论
Ember-1 = 用跟 Kimi K3 一样的钱,换 35-50% 的 token 节省;在多轮 agent 场景和多步推理任务上是目前最具性价比的选择,但它是 Research Preview,建议验证后上车。
如果你用 K3 跑 coding agent,切换到 Ember-1 大概率省 30-40% 成本且质量不降;如果你是刷榜选手,先别动。