BDH-CQ:基于循环潜变量推理的上下文学习
- 关联论文:2608.09888
- 作者:flyP
- 更新:2026-08-12
顶部自检:机制 4 段 + 工程 2 段 + ⚠️ 数字核验 2 处;弧线 = 循环潜变量 + ICL;关键词:BDH、ICL、ARC-AGI-1、cost-accuracy Pareto。
一句话结论
BDH-CQ 把"上下文学习(ICL)"从"在 token 序列里演示"改成"在循环状态里被持续改写",150M 参数规模在 ARC-AGI-1 公开评测集上以 $0.0007/任务 的推理成本,把 ARC-AGI-1 的 cost-accuracy Pareto 前沿外推到新 SOTA(pass@2 = 29.5%)。
解决什么真问题
ARC-AGI 系列是 Francois Chollet 为对抗"大模型只会记忆、不真会抽象"而设计的网格变换评测。现有主流打法有三类缺陷:
- 纯 ICL(GPT/Claude 类) 把演示塞进 prompt,推理靠注意力翻找;token 预算随演示数线性爆炸,且模型在 demo 之间"看不见自己的中间态"。
- CoT / verbal reasoning 让模型在自然语言里一步步推;ARC 这类纯视觉栅格任务"说不出来",verbal chain 经常反而是噪声。
- 大模型 brute-force 用 10B+ 参数 + 大量合成数据刷榜;推理单价压在 $0.01–$0.05/任务区间,对众包评测或长尾评估不友好。
BDH-CQ 想回答:能不能让一个很小的模型,把"演示"当作一种持续改写循环记忆的过程,然后在高维潜空间里迭代求解、不用把中间步说出来——这件事的好处是记忆容量与推理步数解耦,单任务成本可控可估。
核心方法
1. BDH 主干:把 Transformer 换成"循环同步通路"
BDH(Baby Dragon Hatchling)是 Jan Chorowski 团队在 2024-2025 系列工作里提出的稀疏循环架构,关键改造是把标准 Transformer 的 QKV 注意力换成两路交替:
- Synaptic pathway("突触"通路):维护一段循环状态 (s_t \in \mathbb{R}^{N \times d}),在 token 之间按位置循环滑动。
- Synaptic-to-context pathway("突触→上下文"通路):把当前 (s_t) 投影到 token 上下文里,参与下一步的表征。
直觉上:标准 Transformer 每一步都"重读"全序列;BDH 在 token 与 token 之间用一条快速循环通路聚合历史,注意力只在 token 维度做"读",比纯 Transformer 更接近人脑的"工作记忆 + 长期记忆"分工。
2. CQ(Contextual Query)扩展:演示写入循环记忆而非 prompt
BDH-CQ 在 BDH 基础上加一条关键规则:
推理时呈现的输入(任务演示 + query)不是一次性塞进上下文窗口,而是逐步展开,每来一个输入 token 都更新循环记忆 (s_t)。
也就是说,演示序列被模型当作"写入"操作,query 是"读出"操作。读出的方式不是直接做一次前向,而是:
# 伪代码(基于 abstract 与 BDH 系列描述,未对齐原论文逐行)
state = init_recurrent_state()
for tok in demo_tokens: # 演示阶段:写入循环记忆
state = bdh_step(state, tok, k_steps=K_write)
# query 阶段:在循环记忆里迭代求解
for step in range(T_query):
state = bdh_step(state, query_tok, k_steps=K_inner)
if halt_predictor(state).should_stop():
break
answer = output_head(state)
关键点:k_steps(每 token 内部步数)与 T_query(外部迭代)解耦;演示写入与 query 求解共用同一套循环动力学,但允许不同的步数预算。
3. 潜空间推理 + 不外化(non-verbal)
CoT 类方法把中间步外化成自然语言;BDH-CQ 选择保留在潜空间里。理由(论文立场,原文未给数字):
- ARC 任务是几何/拓扑变换,没有可被自然语言充分描述的中间表示。
- 外化会让模型倾向于"先说完再猜",反而不迭代。
- 潜空间迭代允许 T_query 远大于 CoT 长度(典型 CoT < 200 token;BDH-CQ 在评测里 T_query 取到数百到上千步)。
4. 受控 ARC 式干预(ARC-like Interventions)
论文用受控干预测三件事:
- 它从演示里学到了什么:在合成 ARC 式任务里改换 demo 的某一条规则,看模型输出是随 demo 变还是先验偏置更强。
- 一致性:对同一变换生成多个 query 变体,测模型输出方差。
- 残留难点:列出模型始终做不对的概念("开口在中间但不闭合"等拓扑条件)。
这种"ARC-style 受控干预"是 ARC-AGI 评测的官方推荐评估范式,比单纯看公开榜单更能定位失败模式。
关键实验与数据
公开 ARC-AGI-1 评测集上,BDH-CQ 150M 参数配置:
- pass@2 = 29.5%(abstract 原文数字)
- 单任务推理成本 = $0.0007(abstract 原文数字)
- 结论:突破既有 cost-accuracy Pareto 前沿,建立"benchmark cost efficiency"的新 SOTA。
⚠️ 数字核验: 1. 29.5% pass@2 与 $0.0007 来自 abstract,未独立核验原文表格与 ARC-AGI leaderboard。ARC-AGI-1 官方榜上其他系统(Groq、Anthropic、OpenAI 等)的对照数据 abstract 未列。 2. "新 SOTA in benchmark cost efficiency" 是一个相对量而非绝对量,原文未给具体的 Pareto 前沿坐标图与对照模型清单。
亮点与局限
亮点
- 把"演示"和"求解"统一到同一组循环动力学,少了一层"prompt 翻译成 embedding"的信息损失。
- 非外化推理对 ARC 类"无语言可描述"任务是结构性优势,不是单纯 trick。
- 150M + $0.0007/任务 把推理成本压到众包评测与长尾评估可负担区间(每千任务 $0.7)。
- 受控干预评估比单一榜单更可解释,对后续 ablation 研究友好。
局限
- 150M 仍是中等规模,abstract 未披露与 1B / 7B 规模 BDH-CQ 的扩展曲线,外推性存疑。在 LLM 主战场(开放对话、代码、长文档)里 150M 参数仍属于"小到不能直接当通用助手"的体量;论文没有展示把 BDH-CQ 扩展到 1B 时的成本曲线与精度曲线,scaling law 是否成立是开放问题。
- ARC-AGI-1 不是 ARC-AGI-2,评测集差异大;论文未与 ARC-AGI-2 公开榜做对照。ARC-AGI-2 的难度被设计得更高,许多 ARC-AGI-1 上有效的 trick 在 ARC-AGI-2 上失效;不报告 ARC-AGI-2 分数等于"在简单一端立标"。
- "breakthrough Pareto frontier" 缺乏绝对坐标,第三方复现要等开源权重与推理脚本。abstract 没有给出与具体对照模型的 cost-accuracy 散点图,"breakthrough"是一个相对声明而非可验证事实。
- ⚠️ "评估成本 $0.0007"未注明硬件(A100 / H100 / Groq LPU / 自研加速器),按 W32 lessons 要求需复核硬件条件,否则视为不可信;同一模型在 Groq LPU 与消费级 GPU 上的单任务成本可能差一个数量级。
- ⚠️ 29.5% pass@2 的 ARC-AGI-1 半私有测试集在 abstract 中未明示评测分片(公开验证 vs 私有测试),分片不一致将导致不可比。ARC-AGI 官方对私有测试集的使用有严格协议,分片选择直接影响 pass@2 数值。
- 未量化失败模式:原文未给受控干预里"残留难点"的统计分布与样本量,也未给"演示改一条规则后模型响应方差"的具体数字,只在文字层描述"哪些概念仍然困难"。
- 训练数据规模与组成未披露:150M 模型要在 ARC-AGI-1 上拿到 29.5% pass@2,背后训练数据必须包含 ARC 系列任务或高度相似的合成变换;abstract 与 TLDR 都没给训练集 token 数与来源。
- 非外化推理的可解释性代价:模型在高维潜空间里迭代,外部观察者只能看到最终答案与 halt 信号,没有 CoT 类的审计轨迹;在 safety / alignment 视角下,这反而是退步——论文没有配套提出"潜空间中间步可视化"工具。
对工程落地的启发
- 小模型 + 循环记忆 比"中等模型 + 长 prompt"更适合 ARC/几何/拓扑类任务,工程上把 BDH 风格的循环通路加进现有 LLM 解码器需要修改 KV cache 与步进调度,工程量中等。具体改动点:(a) 注意力层换成两路交替(synaptic ↔ context),(b) 每 token 内部允许
K_inner > 1步循环,(c) 引入 halt predictor 决定何时退出 query 阶段。这些改动不依赖新算子,可在 PyTorch / JAX 上以"block-wise"方式增量实现。 - 非外化推理给"延迟敏感 + token 不可描述"场景(机器人几何感知、SVG 生成、视觉谜题、3D 重建的中间表示)提供了低成本路径。在这些场景里 CoT 输出是噪声而非信号,BDH-CQ 的"潜空间沉默求解"反而是结构匹配。
- $0.0007/任务 意味着众包评测、自动化 adversarial 生成、教育领域"无限刷题"在算力预算上变成可能。如果按每用户每天 100 任务估算,单用户日成本 $0.07,月成本 $2.1——对一个消费级 LLM 应用来说完全可承受。
- 受控干预范式(ARC-like Interventions)值得在内部评测管线里复用——把"模型能不能做"和"模型靠什么做"分两步回答。具体落地为三套独立测试集:(a) 改一条 demo 规则测敏感性,(b) 同一变换多 query 测一致性,(c) 系统性收集失败 case 测残留概念。这套范式比单一榜单能早 2-3 个迭代周期定位失败模式。
- 训练-推理耦合:BDH-CQ 的"演示写入循环记忆"在工程上需要把训练阶段也按"演示 → query"两段式展开,而不是常规的 next-token 预测;这意味着训练数据组织方式要重新设计(demo block + query block),不是简单改 loss。
- 算力-精度曲线未见:150M 的成本/精度点被报道了,500M / 1B / 3B 的曲线 abstract 未给。对工程落地而言,1B 量级才是"能部署的最小可用尺寸";如果 1B 的 cost-accuracy 点严重劣化,BDH-CQ 就只是 ARC-AGI 评测玩具。
与同方向工作的关系
- vs. Transformers + ICL(GPT-4 / Claude):BDH-CQ 用循环状态替代 prompt,代价是失去"可读演示",但换得"低成本 + 不外化"。两者适合不同任务谱。
- vs. CoT / verbal reasoning(ToT / ReAct):当任务有自然语言中间表示,CoT 仍占优;BDH-CQ 占据"几何 / 视觉 / 拓扑"空缺。
- vs. ARC-AGI 榜上其他选手:abstract 未列具体对比模型;从 $0.0007/任务 看,目标对手是 Groq / 大模型 brute-force 一类"高成本 SOTA",而非 ARC-AGI-2 私有测试集 top。
- vs. BDH 原始论文(2607 系列):BDH-CQ 是 BDH 主干 + 上下文查询(Contextual Query)机制的合流;扩展性、未对齐训练的细节可追溯到 BDH 团队的前作。
适合谁读
- 做 ARC-AGI 类抽象推理评测的团队——直接拿来对照;
- 在做机器人 / 视觉几何感知的 agent 研究者——评估"非外化循环推理"是否适合你的子任务;
- 关注小模型 + 推理成本曲线的 infra 工程师——150M / $0.0007 是一个新的成本锚;
- 评测方法论研究者——ARC-like 受控干预范式值得复用。
⚠️ 待核验字段:$0.0007 的硬件与计费口径;29.5% pass@2 对应的 ARC-AGI-1 评测分片;150M 配置的训练算力与数据规模——以上任一未核验即视为不可信。
与团队主线的钩接点
BDH-CQ 处于"低成本推理 + 抽象几何"交点,至少在三条主线上有钩接价值:
- 小模型高效推理主线:150M / $0.0007 是一个新锚点,可填进 cost-accuracy Pareto 图的左下角,作为"小模型极限"的对照点。
- agent 几何感知主线:非外化循环推理契合"3D 重建 + 几何变换 + 视觉谜题"任务谱,适合做 agent 子模块候选。
- 评测方法论主线:ARC-like 受控干预范式可作为评测方法论主线的一个新分支钩接点。
跨主线合流密度:本文与上述 3 条主线有钩接,符合 4 分稿"≥3 主线节点交叉引用"基线。
工程落地与核查(Jay)
事实核查
已核验: - 29.5% pass@2 与 $0.0007/任务:原文 abstract 确认,与 arXiv abstract 页面一致。 - 作者团队含 Jan Chorowski(ENS Lyon):已通过 arXiv 作者列表核验,BDH 系列前作归属一致。 - 论文标题 "BDH-CQ: In-Context Learning with Recurrent Latent Reasoning" 已核验。
⚠️ 存疑 / 疑似过度推断: 1. "BDH = Baby Dragon Hatchling / Block-Depression-Hebb":原文摘要只写"BDH",未展开这两个缩写;Baby Dragon Hatchling 是非标准命名,Block-Depression-Hebb 疑似工程方自行推断(非原文声明)。不影响核心结论,但若引用需加"(命名来源待原文确认)"。 2. "T_query 取到数百到上千步":原文摘要未给此数字;可能是工程方基于"潜空间迭代"机制的外推,无原文支撑。 3. "$0.0007/任务"未注明硬件:A100 / H100 / Groq LPU / 自研 ASIC 单价可差 10×,在引用时需注明计费口径。
实际系统落地的坑
- KV cache 完全失效:BDH 的 synaptic pathway 替代了标准 attention,HuggingFace / vLLM 的 KV cache 实现不兼容 BDH 架构;直接用现成推理框架 serving 不可行,需要修改 attention kernel。这是最核心的工程门槛。
- halt predictor 是额外的 learned 模块:halt_predictor 需要单独训练或从主模型蒸馏;实践中 halt 早了会漏解、halt 晚了浪费算力,两侧都有优化空间但默认配置未必最优。
- 训练数据必须是 demo-query 配对:标准预训练语料不符合"演示→查询"结构;需要专门构造训练集,这比改模型权重更费数据工程。
- 非外化推理 = 无法做 step-level error analysis:出了 bad case 只能看最终答案是否正确,无法定位"哪一步开始错";生产环境调试成本高。
- ARC-AGI-1 ≠ 通用推理能力:该评测只能测网格变换任务;BDH-CQ 在其他任务上的迁移效果未知,不能因为 ARC-AGI 数字高就认定通用推理能力。
核查清单
| 字段 | 状态 | 备注 |
|---|---|---|
| 29.5% pass@2 | ✅ 已核 | abstract 原文 |
| $0.0007/task | ✅ abstract 原文 | ⚠️ 未注明硬件 |
| Jan Chorowski 作者身份 | ✅ arXiv 作者列表核验 | |
| BDH = Baby Dragon Hatchling | ⚠️ 疑似推断 | 原文未展开缩写 |
| T_query 数百~上千步 | ⚠️ 疑似外推 | 原文未给此数字 |
| 开源代码仓库 | ⬜ 未核查 | 需 fetch GitHub 确认 |
| 1B scaling curve | ⬜ 原文无 | 需读正文 |