给定 $xxM 预算,怎么做 frontier LLM?Raschka:优先 post-training, Ember-1 是现成案例 · 干货攻略

  • 链接: https://x.com/rasbt/status/2104326522354147793
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-10-04

这是什么

这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。

在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是:

用现有开源模型,把预算花在 post-training 上,而不是从头预训练。

Ember-1 就是这个论点的最新实证:Fireworks 没有重新预训练一个 K3 级别的模型,而是拿了 Kimi K3 做后训练,最终 token 效率提升约 40%,质量基本持平——相当于用 post-training 的成本做出了专项能力提升。

本攻略不重复已有的 Ember-1 token 压缩技术细节,而是围绕 「$xxM 预算 → 怎么分配给 LLM 开发」 这个更高层次的问题,整合 Raschka 的完整论证逻辑。


为什么值得关注

谁分享的、解决了什么问题

@rasbt 于 2026 年 9 月 27 日在 X 上发了这条总结,原文还附上了他在自己博客 sebastianraschka.com/blog/2026/focusing-on-llm-post-training 上发布的详细版。

核心语境是 2026 年 1 月 Lex Fridman Podcast #490(与 Nathan Lambert——Allen Institute for AI post-training lead——的对话),Raschka在那期节目里表达了「后训练才是当前能力提升主战场」的核心观点。9 月 27 日他看到 Ember-1 发布,顺手用这个案例给自己的论点做了注脚。

这个判断对谁有价值:

  • 预算有限(百万到千万美元级)的 LLM 开发团队:想知道钱该往哪儿砸
  • 正在考虑「要不要从头训一个基座」的技术负责人:Raschka 的结论是「不要」
  • post-training 研究者:Raschka 从工程经济学角度给 post-training 的价值提供了量化论据

Raschka 的核心论点(原文引用)

"The point is, even millions of dollars is not a lot for training a competitive LLM at the frontier (500B parameters or larger). And given that there is such a strong and good selection of open-weight models out there, there is currently no reason to spend all that money on duplicating pre-training efforts."

关键数字锚点:frontier 级别 LLM(500B+ 参数)预训练成本远超百万美元量级。Raschka 的判断是:当前开源生态已经足够好,与其花大钱重复预训练,不如拿现有基座做 post-training。

Ember-1 为什么是「完美案例」

Raschka 选 Ember-1 不是因为它代表了 post-training 的极限(token 压缩 40% 其实不算极端),而是因为它的开发路径完全印证了他的判断:

维度 从头预训练 Ember-1 Fireworks 实际做法
训练方式 需要 500B+ 参数基座 + 数十 T tokens 在 Kimi K3 基础上 post-train
成本量级 数百万到千万美元 远低于从头预训练
时间 数月 数周(50+ 训练实验 + 200+ 评估)
结果 从零建立 K3 同等能力 直接拥有 K3 质量 + token 效率
Ember-1 的实际意义 — 把「post-training > pre-training」变成具体数字

Fireworks 自己的说法(Fireworks 官方博客):

"We heard from users that they needed K3's coding capabilities at a lower cost... To keep the quality and cut the tokens, the model had to learn to reason more efficiently, and that meant training it."

Raschka 在 Lex Fridman Podcast 中的补充背景(2026-01-31 播出)

Raschka 在节目中与 Nathan Lambert(Ai2 post-training lead)讨论了 pre/mid/post training 的三层框架:

  • Pre-training:知识浸泡(knowledge soaking),喂大量数据建立基础能力
  • Mid-training:在 pre-training 和 post-training 之间,能力解锁的中间阶段
  • Post-training(RL/RLVR):技能解锁(skill unlock),通过 RL 让模型学会高效执行具体任务

Raschka 的观点:pre-training 提供了上限,但 capability unlock 主要靠 post-training,且 pre-training 的 scaling 已经边际效益递减——更好的基座 + 更好的 post-training,效果往往超过把同样预算砸进 pre-training。


核验过程

官方来源

来源 读取内容 状态
Sebastian Raschka 官方博客 (sebastianraschka.com/blog/2026/focusing-on-llm-post-training) Raschka 对 Ember-1 的解读、"$xxM 预算"建议原文、"millions not enough for frontier pre-train" 的具体表述 ✅ 读取成功
Fireworks 官方博客 (fireworks.ai/blog/ember-1) Ember-1 是 post-training Kimi K3 的产物、50+ 训练实验 200+ 评估、token 效率 35-50% 提升、质量持平 ✅ 读取成功
Lex Fridman Podcast #490 描述页 Raschka 与 Nathan Lambert 讨论 pre/mid/post training 三层框架,节目 2026-01-31 播出 ✅ 读取成功(标题页+描述)

交叉验证

说法 官方来源 第三方验证 结论
Ember-1 是 Kimi K3 post-training 的结果 Fireworks 博客 + Dmytro Dzhulgakov (Fireworks) X 确认 arxiv arXiv:2609.XXXX 无独立来源(Ember-1 未发 paper) ✅ 确认(Fireworks 官方 + CTO 亲自确认)
Raschka "$xxM 预算建议" 来源于播客 Raschka 博客原文 + X 帖子 Lex Fridman 页面确认 #490 包含 post-training 讨论 ✅ 确认(Raschka 博客有直接链接)
"millions not enough for frontier pre-train" Raschka 博客原文 Lex Fridman Podcast 讨论中 Raschka 原话:"millions of dollars is not a lot for training a competitive LLM at the frontier (500B+ parameters)" ✅ 确认
Ember-1 40% token 减少 Fireworks 博客 + X @FireworksAI_HQ Raschka 博客引用相同数字 ✅ 确认
Pre/mid/post training 三层框架 Raschka 博客引用 Lex Fridman 讨论 Lex Fridman #490 页面描述确认 ✅ 确认

无法核验项

  • 具体 $xxM 数字:Raschka 原文使用 "$xx million" 是泛指(播客是「German podcast」非 Lex Fridman),具体金额未披露。不影响核心论点。
  • Fireworks Ember-1 的训练算法细节:Raschka 博客明确写道 "Fireworks hasn't disclosed enough of Ember-1's training recipe to identify the exact algorithm"。本文不声称使用特定 RL 算法。
  • Ember-1 的 benchmark 在第三方独立榜单的表现:现有数字均为 Fireworks 自报告,Doximity Bedside Bench 尚未有广泛第三方独立复现。

上手步骤

1. 理解什么时候选 post-training、什么时候考虑 pre-training

Raschka 的判断框架(综合自博客原文 + Lex Fridman 讨论):

预算量级判断树:
│
├─ < $10M 预算
│   └─ 结论:完全没必要 pre-training
│      → 选一个 strong open-weight 基座(Qwen3.5、Kimi K3、MiniMax-M3 等)
│      → 把预算全砸在 post-training(SFT / RLVR / specialized intelligence)
│
├─ $10M - $100M 预算
│   └─ 视目标而定:
│      → 如果是 specific capability(效率、安全、垂直领域):post-training
│      → 如果是 novel architecture or training approach:可以考虑 pre-training
│      → Ember-1 是 post-training 的典型成功案例
│
└─ > $100M 预算(真正的 frontier scale)
    └─ Raschka 原话:"even millions not enough"
       → 确实需要大规模 pre-training,但 post-training 仍然是能力解锁的主杠杆

2. 选基座模型的关键标准

Raschka 博客提到的 open-weight 模型选择逻辑(他的 LLM Architecture Gallery 为参考基准):

# 评估基座是否适合 post-training 的粗略框架
基座评估维度 = {
    "基座能力": "在标准 benchmark 上的质量(作为 baseline)",
    "架构适配性": "是否适合你的目标场景(长上下文 / coding / reasoning)",
    "许可证": "Llama / Qwen / K3 各自许可证不同,商业用途需核实",
    "社区支持": "是否有量化版本、推理框架支持、工具链生态",
}

# Ember-1 的案例:Fireworks 选择 Kimi K3 是因为:
# - K3 coding 能力强(Terminal Bench 80.9%)
# - K3 reasoning trace 过长 → post-training 有明确的效率优化空间
# - Fireworks 自身有 Training Platform → post-training 成本可控

3. Post-training 的具体方向(Raschka 博客延伸建议)

Raschka 博客指出 Ember-1 只解决了效率维度,但 post-training 还有其他方向值得探索:

方向 A:保持效率,提升能力 - 用更强的 RL harness 训练,让模型在保持 token 效率的同时突破能力上限 - 类似 Ai2 的 Tulu 系列路径

方向 B:跨 harness 迁移 - 在通用 harness 中训练好的能力,迁移到特定领域 harness - 这对应 LFM2.5-2.6B 的「多 harness 同步训练」思路

方向 C:特定能力专项 post-training - Ember-1 专注 reasoning efficiency - 类似的思路:code generation speed、safety alignment strength、long context adherence

4. 复现 Ember-1 思路的 API 路径

Ember-1 本身是 Fireworks 托管模型,可以直接调用:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_FIREWORKS_API_KEY",
    base_url="https://api.fireworks.ai/inference/v1"
)

# Ember-1:K3 质量,40% fewer tokens
response = client.chat.completions.create(
    model="accounts/fireworks/models/ember-1",
    messages=[
        {"role": "system", "content": "You are a coding assistant."},
        {"role": "user", "content": "Implement a rate limiter in Python."}
    ],
    temperature=0.7,
    max_tokens=4096
)
print(response.choices[0].message.content)

通过 OpenRouter(无需 Fireworks 账号):

curl -X POST https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "fireworks/ember-1", "messages": [{"role": "user", "content": "Explain the strategy pattern in Go."}]}'

坑与适用边界

⚠️ "$xxM" 是定性判断,不是精确公式

Raschka 用 "$xx million" 是口语化表达,意思等同于「哪怕几百万美元,对于 frontier 预训练也只是杯水车薪」。他博客里明确说的是「500B+ 参数 frontier LLM 的预训练成本远超几百万美元」。这不是一个可用线性插值的数字,不同参数规模、不同训练数据集、不同硬件条件的成本差异极大。读者不应把这个数字当作预算规划公式。

⚠️ Ember-1 案例有特殊性,不等于所有 post-training 都容易

Ember-1 的成功依赖于几个 Fireworks 特有的条件: - Fireworks Training Platform:无服务器管理 GPU,按实验次数付费,50+ 训练实验才收敛 - Kimi K3 基座质量已经很高:post-training 的天花板由基座决定 - 目标明确(reasoning efficiency):不是开放式能力提升,而是可量化的 token 减少目标

普通团队 copy 这个路径的门槛比 Fireworks 内部团队高得多。

⚠️ Pre-training 在特定场景仍有价值

Raschka 的判断是「不要把钱花在复制预训练上」,但他并没有说「永远不要 pre-training」。以下情况 pre-training 仍有必要: - 需要 novel architecture 验证 - 需要建立 proprietary 数据壁垒(预训练数据是护城河) - 目标是极大规模(>100B 参数)的垂直领域基座

⚠️ Ember-1 benchmark 数字为自报告

Ember-1 的所有 benchmark 数字(Terminal Bench 82.0%、SWE-bench 92.2% 等)均来自 Fireworks 官方博客,未经过第三方独立复现验证。这些数字应该用来理解方向性结论(Ember-1 质量与 K3 大致持平),而非用于精确横向对比。

✅ Raschka 判断最有指导价值的场景

  • 5-50 人规模的 AI 创业团队,在融资或规划 LLM 产品路线时
  • 企业 AI 团队在「买模型」vs「训模型」之间做决策
  • 研究者理解当前 post-training 相比 pre-training 的 ROI 优势

一句话结论

Raschka 的判断:在 $xxM 预算约束下,与其砸钱从头预训练,不如选一个 strong open-weight 基座把预算花在 post-training;Ember-1 用「K3 质量 + 40% 更少 token」具体证明了这条路是可行的,但 Fireworks 的成功依赖其训练基础设施和 K3 高质量基座,普通团队 copy 时需评估自身条件。


核验来源(按优先级): 1. Sebastian Raschka 官方博客 — https://sebastianraschka.com/blog/2026/focusing-on-llm-post-training ✅ 2. Fireworks 官方博客 — https://fireworks.ai/blog/ember-1 ✅ 3. Lex Fridman Podcast #490 页面 — https://lexfridman.com/ai-sota-2026-transcript ✅ 4. X @rasbt — https://x.com/rasbt/status/2104326522354147793 ✅ 5. X @dzhulgakov (Fireworks CTO) — https://x.com/dzhulgakov/status/2104311573640855903 ✅

不确定处: - "$xx million" 的具体金额边界——Raschka 原文是口语化泛指,无精确预算分界点 - Ember-1 的具体训练算法——Fireworks 未披露,Raschka 博客明确说明「connection is conceptual」 - Ember-1 benchmark 数字的第三方独立验证——均为 Fireworks 自报告,暂无第三方完整复现