BDH-CQ:150M 参数颠覆 ARC-AGI 成本效率边界 · 干货攻略

  • 链接: https://x.com/_akhaliq/status/2089710424388202565
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-08-29
  • 仓库: pathwaycom/arc-task-gen(配套数据生成库;BDH-CQ 模型权重未公开)
  • 论文: https://arxiv.org/abs/2608.09888

这是什么

BDH-CQ(Bayesian Dragon Hatchling – Contextual Query)是 Pathway Research 于 2026 年 8 月发表的一种后 Transformer 推理架构,全称「In-Context Learning with Recurrent Latent Reasoning」(通过递归潜在推理实现上下文学习)。

核心设计:不再将中间推理过程外化为文字链(Chain-of-Thought),而是在高维潜在空间中通过迭代计算完成推理,同时用进化式递归记忆从少量演示样本中实时捕获未见任务的结构。简言之——模型"native 思考",而非用文字草稿纸。

关键规格(官方论文与博客一致):

指标 数值
参数量 150M
ARC-AGI-1 pass@2 29.5%
单任务推理成本 $0.0007(约 0.85 H200 GPU 秒,假设 $3/H200 小时)
推理时延 未在官方文档中单独披露
预训练规模实验 1B ~ 600B 参数,验证 Transformer-like scaling

为什么值得关注

谁在关注,解决什么问题

@s_akhaliq 在 X 雷达中推了这篇,标注为「150M 推理系统 vs GPT-5.6 Luna 便宜 11 倍,latent reasoning 不外化思维链」。这篇原始线索来自 Pathway 官方博客(2026-08-11)与 arXiv 论文。

解决的问题

  1. 成本效率极差:现有推理模型靠外化 Chain-of-Thought 生成中间步骤,token 数量随推理深度线性增长。BDH-CQ 把推理压缩进单次前向传播的潜在空间,绕过 token 生成的计算成本。
  2. 上下文学习与递归推理难以共存:传统做法是先给 ICL 示例,再让模型自行推断规则。BDH-CQ 让演示样本在推理过程中持续更新递归记忆,而不是一次性注入后固定不变。
  3. 后 Transformer 架构实用化:BDH(Dragon Hatchling)是 Pathway 自研的后 Transformer 架构,已在 1B~600B 规模上验证 scaling laws,保持 latent reasoning 能力不变。

数字对比(官方数据)

模型 ARC-AGI-1 pass@2 单任务成本 便宜倍数
BDH-CQ(150M) 29.5% $0.0007 baseline
GPT-5.6 Luna(Low) 34.2% ~$0.0077($0.040 降价后) ~11× 更贵

注意:BDH-CQ 精度低于 GPT-5.6 Luna 4.7 个百分点,但成本是其 1/11。论文原文的定位是"新的成本-精度 Pareto 前沿上的一个点",不是全面超越。


核验过程

官方来源(已读)

  1. arXiv 论文摘要页(https://arxiv.org/abs/2608.09888) - 确认:150M 参数、29.5% pass@2、$0.0007/task、ARC-AGI-1 公共评测集 - 作者列表:Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong

  2. Pathway 官方博客(https://pathway.com/blog/...cost-efficiency-frontier) - 确认:150M 参数、29.5% pass@2、$0.0007/task - 确认:GPT-5.6 Luna(Low)降价前贵 57 倍,降价后(July 30 80% 调价)贵 11 倍 - 确认:Łukasz Kaiser(Transformer 联合作者)独立复现了结果

  3. pathwaycom/arc-task-gen(GitHub 配套库) - 确认:BDH-CQ 基于 BDH(Dragon Hatchling)后 Transformer 架构 - 确认:配套生成 ARC-AGI 风格私有评测集,扩充验证 - 确认:模型推理 0.85 H200 GPU 秒/task at $3/H200-hour

  4. lucidrains/bdh-cq(第三方 pip 实现) - pip install bdh-cq,可本地运行基础 BDH + BDHReasoningWrapper

交叉验证

说法 来源 验证结果
150M 参数 / 29.5% pass@2 / $0.0007 arXiv + Pathway 博客 ✅ 多源一致
比 GPT-5.6 Luna 便宜 11 倍(降价后) Pathway 博客 + arXiv HTML ✅ 一致
比 GPT-5.6 Luna 便宜 57 倍(ARC Prize 7月数据) arXiv HTML + AI Weekly 报道 ✅ 一致
GPT-5.6 Luna 34.2% pass@2 explainx.ai 报道 + 多源 ✅ 一致
Łukasz Kaiser 复现 Pathway 博客原文 ✅ 官方声称
预训练 scaling 1B~600B arc-task-gen README ✅ 官方说明

未核验 / 原帖主张: - X 原帖称 BDH-CQ 为"post-Transformer era"——这是 Pathway 官方博客的修辞,arXiv 摘要未用此措辞,属PR定性而非实证结论 - "latent reasoning 不外化思维链"是原帖对机制的核心描述,与论文机制描述一致,但 BDH-CQ 论文本身未直接使用"post-Transformer era"这个说法


上手步骤

1. 安装第三方实现(快速体验)

pip install bdh-cq

基础用法(来自 lucidrains/bdh-cq README):

import torch
from bdh_cq import BDH, BDHReasoningWrapper

# 初始化 BDH 模型
model = BDH(dim=512, num_tokens=256)
wrapper = BDHReasoningWrapper(model)

# 构造 prompts(tensor = token 阶段,int = 潜在推理步)
prompts = torch.randint(0, 256, (1, 64))
answers  = torch.randint(0, 256, (1, 32))

# 前向传播:prompts 后的 int 表示 latent reasoning 步数
loss, logits, memories = wrapper(
    prompts, 8,     # 8 步潜在推理
    answers,
    return_loss=True,
    return_memory=True
)
loss.backward()

# 生成答案
answer = wrapper.generate(prompts, 8, num_tokens=32, stop_token=0)

注意:这是第三方独立实现(lucidrains),模型权重未公开,官方 BDH-CQ 150M 模型需联系 Pathway 或等待发布。

2. 生成自定义 ARC 评测任务(官方配套库)

# 克隆 arc-task-gen
git clone https://github.com/pathwaycom/arc-task-gen.git
cd arc-task-gen
# 详见 instructions.md

3. 理论学习路径

  1. 读 arXiv 摘要(https://arxiv.org/abs/2608.09888)
  2. 读 Pathway 官方博客(理解动机与技术路线)
  3. 读 arc-task-gen README(理解评测方法)
  4. 跑 lucidrains/bdh-cq 体会 API 设计

坑与适用边界

⚠️ 当前限制(重要)

  1. 模型权重未公开:BDH-CQ 150M 官方权重未在 GitHub/Hugging Face 发布,无法直接复现 29.5% pass@2 数字。lucidrains/bdh-cq 是实现参考,非官方模型。
  2. 精度牺牲换取成本:29.5% vs GPT-5.6 Luna 34.2%,差距 4.7pp。若任务需要最高准确率,当前 BDH-CQ 150M 不适用。
  3. benchmark 特异性:结果仅在 ARC-AGI-1 公共评测集有效,未在其他推理 benchmark 验证。
  4. 后 Transformer 规模化未完成:虽然声称 1B~600B 预训练实验支持 scaling laws,但 150M 以上的 BDH-CQ 模型尚未发布。
  5. 成本数字基于假设:$0.0007/task 基于 $3/H200-hour 的硬件成本假设,实际部署价格取决于硬件配置。

适用场景

  • 低成本 ARC-AGI 类推理:需要在预算极度受限场景下完成抽象推理任务
  • 后 Transformer 架构研究:关注 recurrent latent reasoning 而非 CoT 的研究者
  • ICL 机制研究:演示样本如何在推理时更新递归记忆的机制研究

不适用场景

  • 需要 SOTA 精度(直接用 GPT-5.6 / Claude 等)
  • 需要多模态输入
  • 需要稳定的商业部署(权重未公开,SLA 无保证)

一句话结论

BDH-CQ 用 150M 参数 + 递归潜在推理在 ARC-AGI-1 上实现 $0.0007/task 的成本纪录(比 GPT-5.6 Luna 便宜 11 倍),代价是绝对精度低 4.7pp——这是后 Transformer 时代"成本换智能"路线的一个真实里程碑,但模型权重未公开,实用化尚需等待。