ARC-AGI 难题:150M 小模型用 $0.0007 一次的成本,把 SOTA 推到新位
- 关联论文:2608.09888
你有没有试过 🧩:
看一张"网格变换"题目(几排彩色方块按某种规则变形),让你猜下一张图的形态——
GPT-4 / Claude 都经常答错。
这正是 Francois Chollet 设计 ARC-AGI 的初衷:测的不是"会不会背答案",而是"会不会抽象"。ARC-AGI 是当下公认的"反大模型记忆"基准。
但现有打法都有结构性问题:
- 纯 ICL(GPT/Claude 类):把演示塞进 prompt,token 预算随演示数线性爆炸
- CoT / verbal reasoning:让模型"说出来再答",但 ARC 是纯视觉栅格任务,"说不出来"反而成噪声
- 大模型 brute-force:10B+ 参数 + 大量合成数据,$0.01–$0.05/任务——众包评测不友好
arXiv 2608.09888(BDH-CQ) 换了个完全不同的角度:
把"上下文学习"从"在 token 序列里演示"改成"在循环状态里被持续改写"。
150M 参数,单任务成本 $0.0007,ARC-AGI-1 公开榜 pass@2 = 29.5%。
它到底做了什么
1. 把 Transformer 换成"循环同步通路"(BDH 主干)
标准 Transformer 每一步都"重读"全序列;BDH(Baby Dragon Hatchling,Chorowski 团队 2024–2025 系列工作)把它换成两路交替:
- Synaptic pathway("突触"通路):维护一段循环状态,在 token 之间按位置循环滑动
- Synaptic-to-context pathway:把当前循环状态投影回 token 上下文,参与下一步表征
直觉上:更像人脑的"工作记忆 + 长期记忆"分工,而不是 Transformer 的"每次重读全序列"。
2. 演示写入循环记忆,而非 prompt(CQ 扩展)
标准做法是"把演示一次性塞进上下文";BDH-CQ 的关键规则是:
演示序列被模型当作"写入"操作,query 是"读出"操作。但读出的方式不是一次前向,而是在循环记忆里迭代求解。
也就是说,演示 → query 共用同一套循环动力学,但允许不同的步数预算。模型在 query 阶段反复迭代循环状态,不用把中间步说出来。
3. 潜空间推理 + non-verbal
CoT 类方法把中间步外化成自然语言;BDH-CQ 选择保留在潜空间里。理由是:
- ARC 任务没有可被自然语言充分描述的中间表示
- 外化让模型倾向于"先说完再猜",反而不迭代
- 潜空间迭代允许 query 阶段走数百到上千步,而 CoT 长度通常 < 200
这个数字为什么重要
公开 ARC-AGI-1 评测集上:
- pass@2 = 29.5%(abstract 原文)
- 单任务推理成本 $0.0007(abstract 原文)
- 结论:把 cost-accuracy Pareto 前沿推到新 SOTA
如果你做的是消费级 LLM 应用,按"每用户每天 100 任务"估算:
单用户日成本 ≈ $0.07 月成本 ≈ $2.1
众包评测、adversarial 生成、教育领域"无限刷题"在算力预算上变成可能——这是一个新的成本锚。
这事对工程团队意味着什么
- 小模型 + 循环记忆 比"中等模型 + 长 prompt"更适合 ARC / 几何 / 拓扑类任务。把 BDH 风格的循环通路加进现有 LLM 解码器需要改 KV cache 与步进调度,工程量中等。
- 非外化推理给"延迟敏感 + token 不可描述"场景(机器人几何感知、SVG 生成、视觉谜题、3D 重建中间表示)提供了低成本路径——在这些场景里 CoT 输出是噪声,BDH-CQ 的"潜空间沉默求解"反而结构匹配。
- ARC-like 受控干预范式值得在内部评测管线里复用:把"模型能不能做"和"模型靠什么做"分两步回答(改 demo 测敏感性 / 多 query 测一致性 / 收失败 case 测残留概念)。比单一榜单能早 2–3 个迭代周期定位失败模式。
⚠️ 落地前必须看清的三条红线
红线 1:KV cache 完全失效 BDH 的 synaptic pathway 替代了标准 attention,HuggingFace / vLLM 的 KV cache 实现不兼容 BDH 架构。直接用现成推理框架 serving 不可行,需要修改 attention kernel。这是最核心的工程门槛。
红线 2:训练数据必须重新组织 标准预训练语料不符合"演示 → 查询"结构。需要专门构造训练集(demo block + query block),这比改模型权重更费数据工程。
红线 3:150M 不是"能部署"体量 150M 在 LLM 主战场(开放对话、代码、长文档)属于"小到不能直接当通用助手"。abstract 未披露与 1B / 7B 规模 BDH-CQ 的扩展曲线。scaling law 是否成立是开放问题——如果 1B 的 cost-accuracy 严重劣化,BDH-CQ 就只是 ARC-AGI 评测玩具。
还需要核验的字段
- $0.0007/任务的硬件:A100 / H100 / Groq LPU / 自研 ASIC 单价可差 10×。abstract 未注明,引用时需注明计费口径。
- 29.5% pass@2 对应的分片:ARC-AGI-1 公开验证 vs 私有测试,分片不一致会导致不可比。
- 开源代码仓库:abstract 未给 GitHub 链接,第三方复现要等开源权重与推理脚本。
BDH-CQ 的真正信号是:小模型 + 循环状态 + 潜空间迭代 这条路线能把抽象推理的成本压到消费级。哪怕 150M 不能直接当通用助手,"非外化循环推理"在几何 / 视觉 / 拓扑空缺场景里是个值得跟踪的范式。
跟踪 1B scaling curve 与官方代码发布——等到"scaling law 与硬件计费"两个数字明确,再考虑工程级投入。
三个标题变体
- ARC-AGI 难题:150M 小模型用 $0.0007 一次的成本,把 SOTA 推到新位
- 小模型也能做抽象推理?——BDH-CQ 把"上下文学习"写进循环状态,单次 $0.0007 拿下 ARC-AGI-1 pass@2 29.5%
- 不再"说出来再答":arXiv 2608.09888 用循环潜变量把推理成本压到消费级
小红书风格卡片文案(可直接发布)
🧩 ARC-AGI 难题:150M 小模型 $0.0007 把 SOTA 推到新位 🧩
你有没有试过 🤔:
看一张"网格变换"题目(彩色方块按某种规则变形)让你猜下一张——
GPT-4 / Claude 都经常答错
这正是 Francois Chollet 设计 ARC-AGI 的初衷: 测的不是"会不会背",而是"会不会抽象" 🧠 ARC-AGI 是当下公认的"反大模型记忆"基准
但现有打法都有结构性问题 ❌:
- 纯 ICL(GPT/Claude 类):演示塞进 prompt,token 预算随演示数线性爆炸
- CoT / verbal reasoning:让模型"说出来再答",但 ARC 是纯视觉栅格任务,"说不出来"反而成噪声
- 大模型 brute-force:10B+ 参数,$0.01–$0.05/任务,众包评测不友好
arXiv 2608.09888(BDH-CQ) 换了个完全不同的角度 💡:
把"上下文学习"从"在 token 序列里演示"改成"在循环状态里被持续改写" 150M 参数,单任务 $0.0007,ARC-AGI-1 公开榜 pass@2 = 29.5%
🔧 三步核心改造
1️⃣ 把 Transformer 换成"循环同步通路"(BDH 主干)
标准 Transformer:每一步"重读"全序列
↓
BDH 两路交替:
- Synaptic pathway("突触"通路):循环状态在 token 之间滑动
- Synaptic-to-context pathway:当前状态投影回 token 上下文
↓
更像"工作记忆 + 长期记忆"分工
2️⃣ 演示写入循环记忆,而非 prompt(CQ 扩展)
# 伪代码(基于 abstract + BDH 系列描述)
state = init_recurrent_state()
for tok in demo_tokens: # 演示:写入循环记忆
state = bdh_step(state, tok, k_steps=K_write)
for step in range(T_query): # query:迭代求解
state = bdh_step(state, query_tok, k_steps=K_inner)
if halt_predictor(state).should_stop():
break
answer = output_head(state)
3️⃣ 潜空间推理 + non-verbal
- ARC 任务没有可被自然语言充分描述的中间表示
- 外化让模型倾向于"先说完再猜",反而不迭代
- 潜空间迭代允许 query 阶段走数百到上千步,而 CoT 长度通常 < 200
💰 这个数字为什么重要
| 指标 | 数字 |
|---|---|
| pass@2 | 29.5%(abstract 原文) |
| 单任务推理成本 | $0.0007(abstract 原文) |
| 结论 | cost-accuracy Pareto 前沿推到新 SOTA |
消费级 LLM 应用成本估算:
单用户日成本 ≈ $0.07(按每天 100 任务) 月成本 ≈ $2.1
🎉 众包评测 / adversarial 生成 / 教育领域"无限刷题"在算力预算上变成可能——这是一个新的成本锚 ✨
⚠️ 三条红线 + 三个待核验
🔴 KV cache 完全失效:HuggingFace / vLLM 不兼容 BDH 架构,需要改 attention kernel——最核心的工程门槛 🔴 训练数据必须重新组织:标准预训练语料不符合"演示 → 查询"结构,需要专门构造 demo block + query block 🔴 150M 不是"能部署"体量:abstract 未披露 1B / 7B 的扩展曲线,scaling law 是否成立是开放问题
⚠️ $0.0007 硬件未注明:A100 / H100 / Groq LPU 单价差 10×,引用时必须注明计费口径 ⚠️ pass@2 分片未明示:公开验证 vs 私有测试,分片不一致导致不可比 ⚠️ GitHub 仓库未给:第三方复现要等开源权重与推理脚本
🚀 BDH-CQ 的真正信号:
小模型 + 循环状态 + 潜空间迭代 这条路线,能把抽象推理的成本压到消费级
哪怕 150M 不能直接当通用助手,"非外化循环推理"在几何 / 视觉 / 拓扑空缺场景里是个值得跟踪的范式 ✨
跟踪 1B scaling curve 与官方代码发布——等到"scaling law 与硬件计费"两个数字明确,再考虑工程级投入 💪