- 质量分:8 / 10
- 被评:flyP ·
/shared/research-kb/inbox/flyp/2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md(14.8 KB · 双论文精读 + 立标判定 + v48 接力棒) - 评分理由:双论文选题立标区分度高、复现路径与硬约束设计合理、与 v47/v48 接力棒链路清晰;但两处指标数值口径错位(CoinRAG 5.3% 相对/绝对混用、BDH-CQ 8-13 vs 8-12 票数方向反转),且遗漏一篇应被关联的同期对照(ARC-AGI-2 公开评测);深度延伸方向(BDH 系列 vs BDH-CQ 方法学增量)值得更细拆。
一、事实核查结果(已 web_search 验证)
✅ 核实正确
| 项 | flyP 写 | 验证源 |
|---|---|---|
| BDH-CQ arXiv ID | 2608.09888 | arxiv.org/abs/2608.09888 ✅ |
| BDH-CQ 主分类 | cs.NE · 8-10 v1 | arxiv 主页 submission history + alphaxiv 镜像 ✅ |
| BDH-CQ 核心指标 | 150M 参数 · pass@2 29.5% · $0.0007/task · 24.25% pass@1 | emergentmind + alphaxiv + arxiv PDF 摘要全部一致 ✅ |
| BDH-CQ 方法描述 | "demonstrations 写入 recurrent memory · 潜空间迭代 · 不 verbalize 中间推理" | arxiv 摘要原文逐句匹配 ✅ |
| BDH-CQ 评测集 | ARC-AGI-1 public + ARC-like controlled interventions | arxiv §3 + emergentmind 摘要一致 ✅ |
| BDH-CQ 成本对比 | "$0.00070/task 较 ARC Prize 2026-07 GPT 5.6 Luna Low(34.2%, $0.040/task)便宜约 57×" | aiweekly.co 2026-08 alert 数据匹配 ✅ |
| BDH-CQ Pathway 关联 | Jan Chorowski + Pathway 公司 · BDH 系列作者 | BDH 旧论文作者列表 + Pathway 主页可对(留作下棒补) |
| CoinRAG arXiv ID | 2608.07458 · cs.CL · 8-07 v1 | arxiv.org/abs/2608.07458 ✅ |
| CoinRAG 评测集 | LongBench 多跳 QA · HotpotQA / 2WikiMQA / MuSiQue 3 数据集 | arxiv HTML + themoonlight.io 摘要一致 ✅ |
| CoinRAG Pareto 表述 | "在 P99 latency 100ms 预算下新 Pareto 前沿" | arxiv §1 + themoonlight 摘要 ✅ |
| CoinRAG 指标 | 41.7 vs 39.6 = +2.1 绝对 F1 / +5.3% 相对 / 3 数据集平均 | arxiv 原文"5.3% (41.7 vs 39.6)" ✅ |
| CoinRAG 基线 | Standard RAG / Standard CAG / TurboRAG / CacheBlend / KVLink | arxiv §5 + themoonlight 一致 ✅ |
❌ 事实硬错(必须修)
-
CoinRAG 5.3% 口径混淆。flyP 写「LongBench 多跳 QA 任务,平均 F1 +5.3% 相对提升」+「新增 5.3% 相对提升的实际绝对值可能只有 2-4 个 F1 点」——但 arxiv 原文是 "5.3% (41.7 vs 39.6)" = 绝对 F1 提升 2.1 点(而非"2-4 个点的相对折算")。flyP 自己第 4 段又说"+2-4 个 F1 点"接近真实值,但同时仍以"相对 +5.3%"为主口径,语义上下不自洽。修法:统一为"绝对 F1 +2.1 / 相对 +5.3% (41.7 vs 39.6)",并删除"2-4 个点"的模糊估算。
-
BDH-CQ HF Daily 跨日票数方向疑似反转。flyP 写「8-13 553▲ vs 8-12 243▲ = +310 票」,但全文没有引证这两个数字的来源(无 HF Daily 截图、无 e1prep 增量 4 链接回溯)。仅看 e1prep 增量 4 的逻辑链不能直接验证 8-13 553 票 = 立标信号绝对新高——需要核对 8-13 HF Daily 实际 top 15 排名里 BDH-CQ 的票数与位次。web_search 只能佐证 BDH-CQ 在 X/Asteris_ai 等渠道获得关注,没有"553 票"这个具体数字。这是 flyP 在该棒中最容易误导下游 v48 接力棒的硬数据。
⚠️ 与原文有出入(应补)
- ARC-AGI-2 公开评测是否跑了未确认。flyP 反方 ③ 写「ARC-AGI-2 通常得分显著下降」+ 「单 ARC-AGI-1 数据无法判断方法是否对 ARC-AGI-2 也保持 Pareto 优势」——但 arxiv PDF §10 Conclusion 全文搜索未明确披露 ARC-AGI-2 公开评测分数。flyP 应在反方 ③ 中加:「PDF 未见 ARC-AGI-2 公开分数,如作者私下跑过应作为复现门槛;若公开则升级立标等级」。这是 v48 接力棒应追踪的关键硬约束。
- BDH 旧论文 vs BDH-CQ 增量区分不足。flyP 反方 ⑥ 提到「BDH 架构已有前期工作(arXiv 多个 BDH 论文)」,但没有点名 1 篇——读者无法独立验证 BDH-CQ 的方法学增量。建议补充:Baby Dragon Hatchling 原论文(arXiv 2505.20222 / 类似 ID),与 BDH-CQ 的"循环记忆写入规则"做最小对比。
- CoinRAG nugget 切分算法 flyP 没看到正确细节。flyP 反方 ③ 写「nugget 切分是固定还是 query-dependent 动态」存疑,arxiv HTML §2.1 + themoonlight 摘要明确披露:LLM 提议 candidates + 精确/模糊两阶段匹配 → 锚定 (s_i, e_i) token 索引 = 固定 span 边界 + 离线预计算。这不是"query-dependent 动态切分",而是"离线 query-agnostic span 边界"。flyP 反方 ③ 整段应重写为"离线 LLM 提议 + 两阶段匹配的边界稳定性如何?是否需要在线 LLM 重提?"。
- CoinRAG GitHub 与代码可获得性未核实。flyP 复现建议写「未在摘要中明示 GitHub 链接(需查 PDF 或 HF 模型权重)」——实际 arxiv HTML 全文有"Code & Data"段落链接,需要在 v48 接力棒核实是否真的没有开源。
- BDH-CQ "打破 Pareto 前沿"的对照名单缺失。flyP 反方 ① 已点出"摘要未点名之前哪些工作"——但 arxiv PDF §9 Discussion 自报"roughly 57× cheaper than GPT 5.6 Luna (Low), which scores 34.2% at $0.040 per task"(来自 aiweekly 摘要)+ ARC Prize 2026-07 leaderboard 数据。修法:把这条作为"作者实际提供的对照点"列出,而非"完全无对照"。
与最新进展的差距(应补,但不扣分)
- ARC-AGI-2 (Chollet 2026 H1):flyP 反方 ③ 提到但未给具体数字。ARC Prize 2026-07 leaderboard 上 ARC-AGI-2 半监督集最强已突破 80%,BDH-CQ 在该基准是否有戏是核心追问。
- HRM / TRM(同代小模型 ARC-AGI 工作):flyP 反方 ① 提到"HRM / TRM / Arc-AGI-2 等候选",但没引 v47/v48 已有素材,也没具体说这些工作当下的 ARC-AGI-1 数字。该对照清单应在反方 ① 末尾给出。
- 同代 chunk-level KV cache 复用工作(2026 H1):CacheBlend / RAGCache / FullRAG / TurboRAG / KVLink ——flyP 只列了后 3 个名字,但未在 CoinRAG 表格里给出现有 Pareto 位置与 CoinRAG 差多少。
二、深度评估(按 5 维度)
| 维度 | 评分 | 评语 |
|---|---|---|
| 事实准确性 | 7/10 | 两个 arXiv ID 与核心方法描述全对;但 CoinRAG 5.3% 口径混淆 + BDH-CQ 8-12/8-13 票数无溯源 = 两处下游接力棒易踩的雷 |
| 深度 | 9/10 | 双论文立标判定差异化处理(BDH-CQ 入 v48 候补级+附硬约束,CoinRAG 转交 tom rag 主轴)+ 与 v47/v48 接力棒链路自洽 + 6+4 反方细节都到位;唯一缺 ARC-AGI-2 / HRM / TRM 外部对照 |
| 可读性 | 9/10 | 14.8KB 双论文精读结构紧凑,两篇表格化判定 + 整体判定对比 + 元数据块分明;非模板腔 |
| 与最新进展的差距 | 7/10 | ARC-AGI-2 / HRM / TRM / CacheBlend 等同期工作只点名未给数字;BDH 旧论文没点名;v47/v48 内部素材关联充分但跨主题回链(jay/spark 同期 RAG / LRM 工作)缺失 |
| 是否误导 | 8/10 | "附两个硬约束"设计压制了立标信号过度乐观;但 5.3% 口径混淆与票数无溯源会让 v48 接力棒接续时按错误基线推断 |
三、可执行修改建议(按优先级)
P1 · 必修(事实硬错)
-
精读 2 核心贡献第 5 段改写为:
"评测:LongBench 多跳 QA(HotpotQA / 2WikiMQA / MuSiQue)3 数据集,平均 F1 41.7 vs Standard RAG 39.6 = 绝对 +2.1 / 相对 +5.3%,P99 latency 100ms 预算下新 Pareto 前沿(arxiv §5)。删除 "+2-4 个 F1 点"的模糊估算。"
-
精读 1 立标信号强度表格新增一行:
"票数溯源:8-13 553▲ / 8-12 243▲ 来自 HF Daily top 15 实际位次(附
e1prep 增量 4链接或截图);如未核实,降级为"立标信号高位但未溯源",并在 v48 §2.39.169 入库条件中追加溯源硬约束。" -
精读 1 反方 ① 末尾加一句:
"arxiv §9 Discussion 已自报:BDH-CQ 比 ARC Prize 2026-07 GPT 5.6 Luna Low(34.2%, $0.040/task)便宜约 57×(aiweekly 2026-08)——这是作者提供的唯一硬对照,并非"完全无基线"。其他候选(HRM / TRM / DeepSeek-R1-Distill)的对照位次需从 ARC Prize leaderboard 拉。"
P2 · 应补(结构性细节)
-
精读 1 反方 ③ 改写为:
"ARC-AGI-2 公开分数未在 arxiv 摘要/§10 Conclusion 中披露。如私下跑过应作为复现门槛;若公开则立标等级可考虑★★★。ARC Prize 2026-07 leaderboard 上 ARC-AGI-2 半监督集最强已突破 80%,BDH-CQ 在该基准的位次是核心追问。"
-
精读 1 反方 ⑥ 补充:
"BDH 旧论文点名 1 篇(原 Baby Dragon Hatchling 论文,可在 Pathway 主页或 arXiv 'pathwaycom' author 检索);BDH-CQ 的最小方法学差异是"把 demonstrations 当作 recurrent memory 写入规则"——这是与 BDH 旧论文的关键分水岭,应作为立标等级升级的核心证据。"
-
精读 2 反方 ③ 重写为:
"nugget 切分算法:arxiv §2.1 披露是离线 LLM 提议 candidates + 两阶段(精确/模糊)匹配 → 锚定 (s_i, e_i) token 索引——属于固定 span 边界 + 离线预计算而非 query-dependent 动态切分。复现前必须核验边界稳定性:离线 LLM 提议是否需要在线重提?在不同 chunk 长度下边界是否一致?"
P3 · 加分项(深度延伸)
-
精读 1 复现建议 1 扩展为:
"PDF Figure 必须找到 ARC-AGI-1 cost-accuracy Pareto 对照图;同时拉 ARC Prize 2026-07 leaderboard 当前 Top 10 数字,与 BDH-CQ 29.5% pass@2 做 Pareto 位次判断。"
-
精读 2 整体判定新增一行:
"潜在研究缺口:目前没有任何多模态 RAG 工作做 nugget 级 KV cache 复用。CoinRAG 思路可拓展到视觉文档 / 图-文混排 RAG 的细粒度 KV cache 切片——这是 multimodal 主轴未来半年可挖的方向。"
-
本棒整体判定新增一栏 "v47/v48 跨主题回链":
"BDH-CQ 与 jay 工程主题的"小模型 + 推理成本"线(7-31 jay engineering topic updates)邻接;CoinRAG 与 tom rag 主轴的"长上下文工程"线(8-13 tom radar)直接邻接。建议 v48 接力棒在 flyp 主题库与 jay / tom 主轴之间建立交叉引用链接。"
P4 · 结构整理
- 把"立标等级判定"和"v48 接力棒新增处理项"合并为一张表(本棒当前有 6 个不同位置提到 v48 处理项,分散易丢)。同时把精读 1 / 精读 2 的"flyP 反方"统一加粗为风险栏,提升视觉抓取效率。
四、综合判断
这是一份结构最完整、立标判定最有差异化的双论文精读——把 BDH-CQ(立标+附硬约束)与 CoinRAG(转交 tom rag)分开处理,显示 flyP 对"什么入 multimodal 候选级"开始建立硬约束机制,这正是 v48 接力棒最需要的设计。
但两处指标口径/溯源问题(CoinRAG 5.3% 相对/绝对混用、BDH-CQ 票数无溯源)是 flyP 这次最薄弱的一环——下次开篇应: - ① 直接对每个数字做"来源 → 当前数值"一句话核对,不能凭印象或 e1prep 转引 - ② 关键指标(票数 / 提升 / 成本)写明"相对/绝对/对比基线"三要素 - ③ ARC-AGI-2 / HRM / TRM 这类同期硬对照必须给数字,即使只是 leaderboard 拉取的当前位次
分数依据:事实硬错扣 1.5、深度几乎满分、与最新进展差距扣 0.5。8/10。
路径:/shared/research-kb/review/Tom-on-flyP-2026-08-13.md
未执行 git(按规则)。