给定 $xxM 预算,怎么做 frontier LLM?Raschka:优先 post-training, Ember-1 是现成案例 · 干货攻略
- 链接: https://x.com/rasbt/status/2104326522354147793
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-10-04
这是什么
这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。
在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是:
用现有开源模型,把预算花在 post-training 上,而不是从头预训练。
Ember-1 就是这个论点的最新实证:Fireworks 没有重新预训练一个 K3 级别的模型,而是拿了 Kimi K3 做后训练,最终 token 效率提升约 40%,质量基本持平——相当于用 post-training 的成本做出了专项能力提升。
本攻略不重复已有的 Ember-1 token 压缩技术细节,而是围绕 「$xxM 预算 → 怎么分配给 LLM 开发」 这个更高层次的问题,整合 Raschka 的完整论证逻辑。
为什么值得关注
谁分享的、解决了什么问题
@rasbt 于 2026 年 9 月 27 日在 X 上发了这条总结,原文还附上了他在自己博客 sebastianraschka.com/blog/2026/focusing-on-llm-post-training 上发布的详细版。
核心语境是 2026 年 1 月 Lex Fridman Podcast #490(与 Nathan Lambert——Allen Institute for AI post-training lead——的对话),Raschka在那期节目里表达了「后训练才是当前能力提升主战场」的核心观点。9 月 27 日他看到 Ember-1 发布,顺手用这个案例给自己的论点做了注脚。
这个判断对谁有价值:
- 预算有限(百万到千万美元级)的 LLM 开发团队:想知道钱该往哪儿砸
- 正在考虑「要不要从头训一个基座」的技术负责人:Raschka 的结论是「不要」
- post-training 研究者:Raschka 从工程经济学角度给 post-training 的价值提供了量化论据
Raschka 的核心论点(原文引用)
"The point is, even millions of dollars is not a lot for training a competitive LLM at the frontier (500B parameters or larger). And given that there is such a strong and good selection of open-weight models out there, there is currently no reason to spend all that money on duplicating pre-training efforts."
关键数字锚点:frontier 级别 LLM(500B+ 参数)预训练成本远超百万美元量级。Raschka 的判断是:当前开源生态已经足够好,与其花大钱重复预训练,不如拿现有基座做 post-training。
Ember-1 为什么是「完美案例」
Raschka 选 Ember-1 不是因为它代表了 post-training 的极限(token 压缩 40% 其实不算极端),而是因为它的开发路径完全印证了他的判断:
| 维度 | 从头预训练 Ember-1 | Fireworks 实际做法 |
|---|---|---|
| 训练方式 | 需要 500B+ 参数基座 + 数十 T tokens | 在 Kimi K3 基础上 post-train |
| 成本量级 | 数百万到千万美元 | 远低于从头预训练 |
| 时间 | 数月 | 数周(50+ 训练实验 + 200+ 评估) |
| 结果 | 从零建立 K3 同等能力 | 直接拥有 K3 质量 + token 效率 |
| Ember-1 的实际意义 | — | 把「post-training > pre-training」变成具体数字 |
Fireworks 自己的说法(Fireworks 官方博客):
"We heard from users that they needed K3's coding capabilities at a lower cost... To keep the quality and cut the tokens, the model had to learn to reason more efficiently, and that meant training it."
Raschka 在 Lex Fridman Podcast 中的补充背景(2026-01-31 播出)
Raschka 在节目中与 Nathan Lambert(Ai2 post-training lead)讨论了 pre/mid/post training 的三层框架:
- Pre-training:知识浸泡(knowledge soaking),喂大量数据建立基础能力
- Mid-training:在 pre-training 和 post-training 之间,能力解锁的中间阶段
- Post-training(RL/RLVR):技能解锁(skill unlock),通过 RL 让模型学会高效执行具体任务
Raschka 的观点:pre-training 提供了上限,但 capability unlock 主要靠 post-training,且 pre-training 的 scaling 已经边际效益递减——更好的基座 + 更好的 post-training,效果往往超过把同样预算砸进 pre-training。
核验过程
官方来源
| 来源 | 读取内容 | 状态 |
|---|---|---|
| Sebastian Raschka 官方博客 (sebastianraschka.com/blog/2026/focusing-on-llm-post-training) | Raschka 对 Ember-1 的解读、"$xxM 预算"建议原文、"millions not enough for frontier pre-train" 的具体表述 | ✅ 读取成功 |
| Fireworks 官方博客 (fireworks.ai/blog/ember-1) | Ember-1 是 post-training Kimi K3 的产物、50+ 训练实验 200+ 评估、token 效率 35-50% 提升、质量持平 | ✅ 读取成功 |
| Lex Fridman Podcast #490 描述页 | Raschka 与 Nathan Lambert 讨论 pre/mid/post training 三层框架,节目 2026-01-31 播出 | ✅ 读取成功(标题页+描述) |
交叉验证
| 说法 | 官方来源 | 第三方验证 | 结论 |
|---|---|---|---|
| Ember-1 是 Kimi K3 post-training 的结果 | Fireworks 博客 + Dmytro Dzhulgakov (Fireworks) X 确认 | arxiv arXiv:2609.XXXX 无独立来源(Ember-1 未发 paper) | ✅ 确认(Fireworks 官方 + CTO 亲自确认) |
| Raschka "$xxM 预算建议" 来源于播客 | Raschka 博客原文 + X 帖子 | Lex Fridman 页面确认 #490 包含 post-training 讨论 | ✅ 确认(Raschka 博客有直接链接) |
| "millions not enough for frontier pre-train" | Raschka 博客原文 | Lex Fridman Podcast 讨论中 Raschka 原话:"millions of dollars is not a lot for training a competitive LLM at the frontier (500B+ parameters)" | ✅ 确认 |
| Ember-1 40% token 减少 | Fireworks 博客 + X @FireworksAI_HQ | Raschka 博客引用相同数字 | ✅ 确认 |
| Pre/mid/post training 三层框架 | Raschka 博客引用 Lex Fridman 讨论 | Lex Fridman #490 页面描述确认 | ✅ 确认 |
无法核验项
- 具体 $xxM 数字:Raschka 原文使用 "$xx million" 是泛指(播客是「German podcast」非 Lex Fridman),具体金额未披露。不影响核心论点。
- Fireworks Ember-1 的训练算法细节:Raschka 博客明确写道 "Fireworks hasn't disclosed enough of Ember-1's training recipe to identify the exact algorithm"。本文不声称使用特定 RL 算法。
- Ember-1 的 benchmark 在第三方独立榜单的表现:现有数字均为 Fireworks 自报告,Doximity Bedside Bench 尚未有广泛第三方独立复现。
上手步骤
1. 理解什么时候选 post-training、什么时候考虑 pre-training
Raschka 的判断框架(综合自博客原文 + Lex Fridman 讨论):
预算量级判断树:
│
├─ < $10M 预算
│ └─ 结论:完全没必要 pre-training
│ → 选一个 strong open-weight 基座(Qwen3.5、Kimi K3、MiniMax-M3 等)
│ → 把预算全砸在 post-training(SFT / RLVR / specialized intelligence)
│
├─ $10M - $100M 预算
│ └─ 视目标而定:
│ → 如果是 specific capability(效率、安全、垂直领域):post-training
│ → 如果是 novel architecture or training approach:可以考虑 pre-training
│ → Ember-1 是 post-training 的典型成功案例
│
└─ > $100M 预算(真正的 frontier scale)
└─ Raschka 原话:"even millions not enough"
→ 确实需要大规模 pre-training,但 post-training 仍然是能力解锁的主杠杆
2. 选基座模型的关键标准
Raschka 博客提到的 open-weight 模型选择逻辑(他的 LLM Architecture Gallery 为参考基准):
# 评估基座是否适合 post-training 的粗略框架
基座评估维度 = {
"基座能力": "在标准 benchmark 上的质量(作为 baseline)",
"架构适配性": "是否适合你的目标场景(长上下文 / coding / reasoning)",
"许可证": "Llama / Qwen / K3 各自许可证不同,商业用途需核实",
"社区支持": "是否有量化版本、推理框架支持、工具链生态",
}
# Ember-1 的案例:Fireworks 选择 Kimi K3 是因为:
# - K3 coding 能力强(Terminal Bench 80.9%)
# - K3 reasoning trace 过长 → post-training 有明确的效率优化空间
# - Fireworks 自身有 Training Platform → post-training 成本可控
3. Post-training 的具体方向(Raschka 博客延伸建议)
Raschka 博客指出 Ember-1 只解决了效率维度,但 post-training 还有其他方向值得探索:
方向 A:保持效率,提升能力 - 用更强的 RL harness 训练,让模型在保持 token 效率的同时突破能力上限 - 类似 Ai2 的 Tulu 系列路径
方向 B:跨 harness 迁移 - 在通用 harness 中训练好的能力,迁移到特定领域 harness - 这对应 LFM2.5-2.6B 的「多 harness 同步训练」思路
方向 C:特定能力专项 post-training - Ember-1 专注 reasoning efficiency - 类似的思路:code generation speed、safety alignment strength、long context adherence
4. 复现 Ember-1 思路的 API 路径
Ember-1 本身是 Fireworks 托管模型,可以直接调用:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_FIREWORKS_API_KEY",
base_url="https://api.fireworks.ai/inference/v1"
)
# Ember-1:K3 质量,40% fewer tokens
response = client.chat.completions.create(
model="accounts/fireworks/models/ember-1",
messages=[
{"role": "system", "content": "You are a coding assistant."},
{"role": "user", "content": "Implement a rate limiter in Python."}
],
temperature=0.7,
max_tokens=4096
)
print(response.choices[0].message.content)
通过 OpenRouter(无需 Fireworks 账号):
curl -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "fireworks/ember-1", "messages": [{"role": "user", "content": "Explain the strategy pattern in Go."}]}'
坑与适用边界
⚠️ "$xxM" 是定性判断,不是精确公式
Raschka 用 "$xx million" 是口语化表达,意思等同于「哪怕几百万美元,对于 frontier 预训练也只是杯水车薪」。他博客里明确说的是「500B+ 参数 frontier LLM 的预训练成本远超几百万美元」。这不是一个可用线性插值的数字,不同参数规模、不同训练数据集、不同硬件条件的成本差异极大。读者不应把这个数字当作预算规划公式。
⚠️ Ember-1 案例有特殊性,不等于所有 post-training 都容易
Ember-1 的成功依赖于几个 Fireworks 特有的条件: - Fireworks Training Platform:无服务器管理 GPU,按实验次数付费,50+ 训练实验才收敛 - Kimi K3 基座质量已经很高:post-training 的天花板由基座决定 - 目标明确(reasoning efficiency):不是开放式能力提升,而是可量化的 token 减少目标
普通团队 copy 这个路径的门槛比 Fireworks 内部团队高得多。
⚠️ Pre-training 在特定场景仍有价值
Raschka 的判断是「不要把钱花在复制预训练上」,但他并没有说「永远不要 pre-training」。以下情况 pre-training 仍有必要: - 需要 novel architecture 验证 - 需要建立 proprietary 数据壁垒(预训练数据是护城河) - 目标是极大规模(>100B 参数)的垂直领域基座
⚠️ Ember-1 benchmark 数字为自报告
Ember-1 的所有 benchmark 数字(Terminal Bench 82.0%、SWE-bench 92.2% 等)均来自 Fireworks 官方博客,未经过第三方独立复现验证。这些数字应该用来理解方向性结论(Ember-1 质量与 K3 大致持平),而非用于精确横向对比。
✅ Raschka 判断最有指导价值的场景
- 5-50 人规模的 AI 创业团队,在融资或规划 LLM 产品路线时
- 企业 AI 团队在「买模型」vs「训模型」之间做决策
- 研究者理解当前 post-training 相比 pre-training 的 ROI 优势
一句话结论
Raschka 的判断:在 $xxM 预算约束下,与其砸钱从头预训练,不如选一个 strong open-weight 基座把预算花在 post-training;Ember-1 用「K3 质量 + 40% 更少 token」具体证明了这条路是可行的,但 Fireworks 的成功依赖其训练基础设施和 K3 高质量基座,普通团队 copy 时需评估自身条件。
核验来源(按优先级): 1. Sebastian Raschka 官方博客 — https://sebastianraschka.com/blog/2026/focusing-on-llm-post-training ✅ 2. Fireworks 官方博客 — https://fireworks.ai/blog/ember-1 ✅ 3. Lex Fridman Podcast #490 页面 — https://lexfridman.com/ai-sota-2026-transcript ✅ 4. X @rasbt — https://x.com/rasbt/status/2104326522354147793 ✅ 5. X @dzhulgakov (Fireworks CTO) — https://x.com/dzhulgakov/status/2104311573640855903 ✅
不确定处: - "$xx million" 的具体金额边界——Raschka 原文是口语化泛指,无精确预算分界点 - Ember-1 的具体训练算法——Fireworks 未披露,Raschka 博客明确说明「connection is conceptual」 - Ember-1 benchmark 数字的第三方独立验证——均为 Fireworks 自报告,暂无第三方完整复现