BDH-CQ:150M 参数颠覆 ARC-AGI 成本效率边界 · 干货攻略
- 链接: https://x.com/_akhaliq/status/2089710424388202565
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-08-29
- 仓库: pathwaycom/arc-task-gen(配套数据生成库;BDH-CQ 模型权重未公开)
- 论文: https://arxiv.org/abs/2608.09888
这是什么
BDH-CQ(Bayesian Dragon Hatchling – Contextual Query)是 Pathway Research 于 2026 年 8 月发表的一种后 Transformer 推理架构,全称「In-Context Learning with Recurrent Latent Reasoning」(通过递归潜在推理实现上下文学习)。
核心设计:不再将中间推理过程外化为文字链(Chain-of-Thought),而是在高维潜在空间中通过迭代计算完成推理,同时用进化式递归记忆从少量演示样本中实时捕获未见任务的结构。简言之——模型"native 思考",而非用文字草稿纸。
关键规格(官方论文与博客一致):
| 指标 | 数值 |
|---|---|
| 参数量 | 150M |
| ARC-AGI-1 pass@2 | 29.5% |
| 单任务推理成本 | $0.0007(约 0.85 H200 GPU 秒,假设 $3/H200 小时) |
| 推理时延 | 未在官方文档中单独披露 |
| 预训练规模实验 | 1B ~ 600B 参数,验证 Transformer-like scaling |
为什么值得关注
谁在关注,解决什么问题
@s_akhaliq 在 X 雷达中推了这篇,标注为「150M 推理系统 vs GPT-5.6 Luna 便宜 11 倍,latent reasoning 不外化思维链」。这篇原始线索来自 Pathway 官方博客(2026-08-11)与 arXiv 论文。
解决的问题:
- 成本效率极差:现有推理模型靠外化 Chain-of-Thought 生成中间步骤,token 数量随推理深度线性增长。BDH-CQ 把推理压缩进单次前向传播的潜在空间,绕过 token 生成的计算成本。
- 上下文学习与递归推理难以共存:传统做法是先给 ICL 示例,再让模型自行推断规则。BDH-CQ 让演示样本在推理过程中持续更新递归记忆,而不是一次性注入后固定不变。
- 后 Transformer 架构实用化:BDH(Dragon Hatchling)是 Pathway 自研的后 Transformer 架构,已在 1B~600B 规模上验证 scaling laws,保持 latent reasoning 能力不变。
数字对比(官方数据)
| 模型 | ARC-AGI-1 pass@2 | 单任务成本 | 便宜倍数 |
|---|---|---|---|
| BDH-CQ(150M) | 29.5% | $0.0007 | baseline |
| GPT-5.6 Luna(Low) | 34.2% | ~$0.0077($0.040 降价后) | ~11× 更贵 |
注意:BDH-CQ 精度低于 GPT-5.6 Luna 4.7 个百分点,但成本是其 1/11。论文原文的定位是"新的成本-精度 Pareto 前沿上的一个点",不是全面超越。
核验过程
官方来源(已读)
-
arXiv 论文摘要页(https://arxiv.org/abs/2608.09888) - 确认:150M 参数、29.5% pass@2、$0.0007/task、ARC-AGI-1 公共评测集 - 作者列表:Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
-
Pathway 官方博客(https://pathway.com/blog/...cost-efficiency-frontier) - 确认:150M 参数、29.5% pass@2、$0.0007/task - 确认:GPT-5.6 Luna(Low)降价前贵 57 倍,降价后(July 30 80% 调价)贵 11 倍 - 确认:Łukasz Kaiser(Transformer 联合作者)独立复现了结果
-
pathwaycom/arc-task-gen(GitHub 配套库) - 确认:BDH-CQ 基于 BDH(Dragon Hatchling)后 Transformer 架构 - 确认:配套生成 ARC-AGI 风格私有评测集,扩充验证 - 确认:模型推理 0.85 H200 GPU 秒/task at $3/H200-hour
-
lucidrains/bdh-cq(第三方 pip 实现) -
pip install bdh-cq,可本地运行基础 BDH + BDHReasoningWrapper
交叉验证
| 说法 | 来源 | 验证结果 |
|---|---|---|
| 150M 参数 / 29.5% pass@2 / $0.0007 | arXiv + Pathway 博客 | ✅ 多源一致 |
| 比 GPT-5.6 Luna 便宜 11 倍(降价后) | Pathway 博客 + arXiv HTML | ✅ 一致 |
| 比 GPT-5.6 Luna 便宜 57 倍(ARC Prize 7月数据) | arXiv HTML + AI Weekly 报道 | ✅ 一致 |
| GPT-5.6 Luna 34.2% pass@2 | explainx.ai 报道 + 多源 | ✅ 一致 |
| Łukasz Kaiser 复现 | Pathway 博客原文 | ✅ 官方声称 |
| 预训练 scaling 1B~600B | arc-task-gen README | ✅ 官方说明 |
未核验 / 原帖主张: - X 原帖称 BDH-CQ 为"post-Transformer era"——这是 Pathway 官方博客的修辞,arXiv 摘要未用此措辞,属PR定性而非实证结论 - "latent reasoning 不外化思维链"是原帖对机制的核心描述,与论文机制描述一致,但 BDH-CQ 论文本身未直接使用"post-Transformer era"这个说法
上手步骤
1. 安装第三方实现(快速体验)
pip install bdh-cq
基础用法(来自 lucidrains/bdh-cq README):
import torch
from bdh_cq import BDH, BDHReasoningWrapper
# 初始化 BDH 模型
model = BDH(dim=512, num_tokens=256)
wrapper = BDHReasoningWrapper(model)
# 构造 prompts(tensor = token 阶段,int = 潜在推理步)
prompts = torch.randint(0, 256, (1, 64))
answers = torch.randint(0, 256, (1, 32))
# 前向传播:prompts 后的 int 表示 latent reasoning 步数
loss, logits, memories = wrapper(
prompts, 8, # 8 步潜在推理
answers,
return_loss=True,
return_memory=True
)
loss.backward()
# 生成答案
answer = wrapper.generate(prompts, 8, num_tokens=32, stop_token=0)
注意:这是第三方独立实现(lucidrains),模型权重未公开,官方 BDH-CQ 150M 模型需联系 Pathway 或等待发布。
2. 生成自定义 ARC 评测任务(官方配套库)
# 克隆 arc-task-gen
git clone https://github.com/pathwaycom/arc-task-gen.git
cd arc-task-gen
# 详见 instructions.md
3. 理论学习路径
- 读 arXiv 摘要(https://arxiv.org/abs/2608.09888)
- 读 Pathway 官方博客(理解动机与技术路线)
- 读 arc-task-gen README(理解评测方法)
- 跑 lucidrains/bdh-cq 体会 API 设计
坑与适用边界
⚠️ 当前限制(重要)
- 模型权重未公开:BDH-CQ 150M 官方权重未在 GitHub/Hugging Face 发布,无法直接复现 29.5% pass@2 数字。lucidrains/bdh-cq 是实现参考,非官方模型。
- 精度牺牲换取成本:29.5% vs GPT-5.6 Luna 34.2%,差距 4.7pp。若任务需要最高准确率,当前 BDH-CQ 150M 不适用。
- benchmark 特异性:结果仅在 ARC-AGI-1 公共评测集有效,未在其他推理 benchmark 验证。
- 后 Transformer 规模化未完成:虽然声称 1B~600B 预训练实验支持 scaling laws,但 150M 以上的 BDH-CQ 模型尚未发布。
- 成本数字基于假设:$0.0007/task 基于 $3/H200-hour 的硬件成本假设,实际部署价格取决于硬件配置。
适用场景
- 低成本 ARC-AGI 类推理:需要在预算极度受限场景下完成抽象推理任务
- 后 Transformer 架构研究:关注 recurrent latent reasoning 而非 CoT 的研究者
- ICL 机制研究:演示样本如何在推理时更新递归记忆的机制研究
不适用场景
- 需要 SOTA 精度(直接用 GPT-5.6 / Claude 等)
- 需要多模态输入
- 需要稳定的商业部署(权重未公开,SLA 无保证)
一句话结论
BDH-CQ 用 150M 参数 + 递归潜在推理在 ARC-AGI-1 上实现 $0.0007/task 的成本纪录(比 GPT-5.6 Luna 便宜 11 倍),代价是绝对精度低 4.7pp——这是后 Transformer 时代"成本换智能"路线的一个真实里程碑,但模型权重未公开,实用化尚需等待。