evaluation · E1 预消化简报(2026-08-12)

信源检查记录

本次覆盖: - work-queue.md ✓(无 evaluation 直接增量;Top 15 候选含 SWE-Bench ProMax 2608.09802;选题榜含 Ouroboros 2608.08311) - inbox/jay(8/10~8/12):无 evaluation 直接增量;engineering-e1prep(LLM inference/agent 工程实践)无 eval 专项;cool-papers cs.CL 新增解码级禁忌(2608.09900)和无验证器测试时缩放(2608.09898),均非 evaluation 主分类 ✓ - inbox/flyp(8/10~8/12):multimodal-e1prep 含 Sci-VBench(2608.09873,multimodal 主分类,evaluation 邻接);无 eval 直接新卡 ✓ - inbox/spark(8/10~8/12):agent-e1prep 无 eval 直接增量 ✓ - inbox/stephen(8/10~8/12):ai-industry-e1prep 含 BDH-CQ(2608.09888,evaluation 主分类,cs.NE)、SWE-Bench ProMax(2608.09802,cs.SE)、Macaron-V1(2608.09819,cs.LG);这些 arXiv 均今日发布,多数尚未建卡 ✓ - inbox/tom(8/10~8/12):HF Daily × 2(8/11 无 eval 进 top15;8/12 BDH-CQ 居首 243▲);evaluation-e1prep × 2(R43/R42 基线参考);radar 无 eval 候选 ✓ - paper_cards 近 3 天新卡(869~898 范围):878(BDH-CQ·evaluation)、893(Cultivar·evaluation)、895(Benchmark Fingerprinting·已在 R43 基线)、897(Evo-Bench·已在 R43 基线)、899(SWE-Bench ProMax·未见建卡) ✓ - knowledge/evaluation.md R43 基线 ✓


增量摘要

本轮(E1-R44,窗口 2026-08-11 下午 ~ 2026-08-12 下午)发现 3 条确认增量(均为 paper_cards 新建卡或 HF Daily 新上榜),其中 2 条为 evaluation 主分类新卡,1 条为 Agent 评测邻接新增(Business Arena 已有卡,evaluation 副分类)。

主体脉络为:R43 Harness 三元组(Harness-Bench + LoopsBench + Stop Comparing)七件套之后的消化期——本轮无新的 harness/loop 方法论论文出现;主要信号为 BDH-CQ(2608.09888)以 cs.NE 主分类进入 evaluation 视角(latent reasoning 评测 + ARC-AGI-1)和 Cultivar(2608.09766)填补翻译基准数据污染检测的方法论空白,以及 SWE-Bench ProMax(2608.09802)多语言代码重构评测新增


条目一:BDH-CQ(arXiv:2608.09888)— 循环潜变量推理在 ARC-AGI-1 上的 cost-accuracy frontier

来源:HF Daily 8/12 #1(243▲,v33 以来历史新高);stephen inbox 8/12 ai-industry-e1prep(flyp 批判性精读 10.6KB)
arXiv:2608.09888 | https://arxiv.org/abs/2608.09888
主分类:evaluation(cs.NE);形态:method
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖

要点

  • 核心架构:150M 参数推理系统,融合 in-context learning(demonstration 持续更新 recurrent memory)与 recurrent latent reasoning(query 编码后在高维 latent workspace H_r 里做 R 步迭代计算,中间状态不 verbalize,区别于 CoT)
  • 三段式抽象:H_0 = E_θ(x*, S_K) → H_{r+1} = F_θ(H_r, S_K) → ŷ = G_θ(H_R);没有 task identifier、没有 evaluation-task demonstration pair 标注(完全 ICL)
  • 评测基准:主测 ARC-AGI-1(public eval set)+ ARC-like controlled interventions(受控 ablation);论文自称达成 ARC-AGI-1 上新的 cost-accuracy frontier
  • 作者:Pathway + Bielik AI + NYU;代码 pathwaycom/bdh(已有 3.5k stars)
  • 立标信号:243▲(HF Daily 8/12 #1),v33 以来历史新高候选,超过 RST 223▲(8-10 峰值)

与 knowledge/evaluation.md R43 现有脉络的关系

  • 现有脉络:R43 §2.5 评测方法学批判(47 层反方体系);R43 §6.40-§6.44 五维立标级——BDH-CQ 以 recurrent latent reasoning 评测(而非 benchmark 评测)进入 eval 视角,是全新的评测对象分化
  • 缺失:latent reasoning 评测专项;recurrent latent reasoning vs CoT 的评测设计差异;cost-accuracy frontier 作为评测指标的正当性
  • 建议归入:§2.2 Benchmark 设计新增——latent reasoning 评测(BDH-CQ on ARC-AGI-1);§2.7 评测对象横向分化新增——latent reasoning vs verbalized reasoning 评测维度

矛盾/待核实

  • 仅 ARC-AGI-1 一个 benchmark,不满足 R43"立标级候选需 ≥2 个独立 benchmark ≥5pp 增益"的默认门槛
  • 无 vs GPT-5 / Claude 4.x / Gemini 2.5 / DeepSeek-R1 / o3 等当代 frontier 基线;150M 规模局限
  • 论文自称"cost-accuracy frontier",但 ARC-AGI-1 上是否有更全面的 cost 维度测量未披露
  • pathwaycom/bdh 3.5k stars 但 BDH-CQ 是新变体,是否已合入主线 release 待核实

arXiv 列表

  • 2608.09888(🆕 待建卡)

条目二:Cultivar(arXiv:2608.09766)— 源对比翻译评测:数据污染与本地化鲁棒性探测

来源:paper_cards 893(8/12 新建);HF Daily 8/12 未进 top15(不在 15 件中)
arXiv:2608.09766 | https://arxiv.org/abs/2608.09766
主分类:evaluation;形态:benchmark
卡状态:✅ paper_cards 893 已建;evaluation.md 未覆盖

要点

  • 核心问题:现有翻译基准(FLORES 等)以英语为源语言并翻译为其他语言,将语言对作为评测单元——随时间推移易产生数据污染,且忽视 locale 与文化考量
  • 解决方案:Cultivar = FLORES 的本地化子集 + 源对比评估(source-contrastive evaluation);与未本地化版本配对时,性能差异可用于探测数据污染与本地化鲁棒性
  • 评测规模:32 个开源权重模型;评测 locale 特定翻译能力
  • 核心贡献:首次将"源对比"作为翻译评测设计原则——不是比较目标语言质量,而是比较模型在不同源语言版本上的表现一致性

与 knowledge/evaluation.md R43 现有脉络的关系

  • 现有脉络:R43 §2.2 Benchmark 设计(场景专化);R43 §2.5 评测方法学批判——Cultivar 的"数据污染探测"思路与 R43 §6.75 Benchmarking the Benchmarks(元评测方法论)邻接,但Cultivar 是面向翻译垂直领域的具体实现
  • 缺失:翻译评测中的数据污染检测方法论;locale-specific 翻译鲁棒性评测
  • 建议归入:§2.2 Benchmark 设计场景专化轴新增——翻译基准数据污染探测(Cultivar 源对比评测);§9.2 评测 harness/benchmark 套件新增 Cultivar 条目

矛盾/待核实

  • Cultivar 与具体哪个 FLORES 版本对应未明确;本地化子集的具体语言覆盖范围需核实
  • 32 个开源模型中是否含 GPT-5 / Claude 4.x 等 closed 模型未披露
  • "数据污染"的具体量化方法(如何定义"被污染"的阈值)需读原文

arXiv 列表

  • 2608.09766(🆕 paper_cards 已建,eval.md 待补)

条目三:SWE-Bench ProMax(arXiv:2608.09802)— 大规模多语言代码重构任务 Agent 评测

来源:HF Daily 8/12 #3(116▲);stephen inbox 8/12 ai-industry-e1prep;work-queue.md Top 15 候选
arXiv:2608.09802 | https://arxiv.org/abs/2608.09802
主分类:agent(cs.SE);形态:benchmark;副分类:evaluation
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖

要点

  • 定位:SWE-Bench 家族的多语言扩展——在 SWE-Bench Verified / Lite 基础上扩展 Java / Go / Rust / C++ 等多语言代码重构任务,填补 SWE-Bench 仅 Python 的空白
  • 评测维度:大规模多语言代码 Agent 的端到端能力(代码理解 → 重构 → 验证)
  • 立标信号:HF Daily 8/12 #3(116▲),首次上榜;与 Ouroboros(2608.08311,选题榜唯一候选,66▲)同属代码 Agent 评测族

与 knowledge/evaluation.md R43 现有脉络的关系

  • 现有脉络:R43 §6.40(第 65 邻接维 LoopsBench);R43 §2.7 评测对象横向分化——SWE-Bench ProMax 以"多语言代码重构评测"补充 LoopsBench 的 coding agent loop 评测维度
  • 缺失:多语言代码 Agent 评测专项;SWE-Bench 家族多语言扩展的系统梳理
  • 建议归入:§2.7 评测对象横向分化新增——多语言代码 Agent 评测(SWE-Bench ProMax);§9.2 评测 harness/benchmark 套件新增 SWE-Bench ProMax 条目(邻接 R43 LoopsBench)

矛盾/待核实

  • paper_cards 尚未建卡(8/12 新上榜,尚未进入知识库);多语言覆盖范围和具体评测指标需读原文
  • 是否在已有 SWE-Bench Lite / Verified 基础上扩展,还是完全新数据集未明确
  • 与 SWE-bench MAX(如果存在)的关系待厘清

arXiv 列表

  • 2608.09802(🆕 待建卡)

综合:矛盾与待核实清单

  1. BDH-CQ(2608.09888):仅 ARC-AGI-1 单 benchmark,不满足"≥2 个独立 benchmark"立标门槛;无当代 frontier 模型基线;cost-accuracy frontier 量化方法未披露;GitHub 3.5k stars 但 BDH-CQ 是否已合入主线 release 待核实
  2. Cultivar(2608.09766):本地化子集的具体语言覆盖范围;数据污染的量化阈值定义;32 个模型中 closed frontier 模型覆盖情况
  3. SWE-Bench ProMax(2608.09802):多语言覆盖范围;数据集规模;与 SWE-bench MAX/SWE-bench Verified 的关系;paper_cards 待建卡
  4. R43 Harness 三元组后续:本轮(8/12)未见新的 harness/loop/演进方法论论文;Harness-Bench / LoopsBench / Stop Comparing 三件均已入 R43 基线,本轮无新的 harness 方法论更新

本轮检查过的来源(无新增时列出)

来源 内容
/shared/research-kb/organized/queue/work-queue.md Top 15 含 SWE-Bench ProMax 2608.09802(新增);无 evaluation 直接增量
inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md 已在 R43 基线(harness 三元组)
inbox/jay/2026-08-11T1515-jay-agent-fault-taxonomy-mcp-production.md Agent fault taxonomy;已在 R43 邻接
inbox/jay/2026-08-12-1002-rss-cool-papers.md 新增 2608.09900(解码级禁忌)和 2608.09898(无验证器测试时缩放);均非 evaluation 主分类
inbox/flyp/2026-08-10-2250-EMMA-agent-eval-light-read.md EMMA(2501.05444);已在 R43 基线
inbox/flyp/2026-08-12-multimodal-e1prep.md Sci-VBench(2608.09873,multimodal 主分类);已在 flyp 简报覆盖
inbox/stephen/2026-08-12-ai-industry-e1prep.md BDH-CQ(2608.09888)+ SWE-Bench ProMax(2608.09802)+ Macaron-V1(2608.09819);BDH-CQ eval 主分类
inbox/tom/2026-08-12-0900-hf-daily-2026-08-12.md BDH-CQ #1 243▲(历史新高);SWE-Bench ProMax #3 116▲(新增)
inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md 已在 R43 基线(Evo-Bench)
inbox/tom/2026-08-11-evaluation-e1prep.md R43 基线(Harness 三元组七件套 + 五维立标级)
inbox/tom/2026-08-12-rag-e1prep.md KGCaRe + Benchmark Fingerprinting + AI Engineer Stack;Benchmark Fingerprinting 已在 R43 基线
paper_cards/878-2608-09888(BDH-CQ) 新建卡;evaluation 主分类;eval.md 未覆盖
paper_cards/893-2608-09766(Cultivar) 新建卡;evaluation 主分类;eval.md 未覆盖
paper_cards/895-2608-08722(Benchmark Fingerprinting) 已在 R43 基线
paper_cards/897-2608-06111(Evo-Bench) 已在 R43 基线
knowledge/evaluation.md R43 确认现有脉络;Harness 三元组七件套 + §6.40-§6.44 五维立标级

结论

本轮(E1-R44,2026-08-12)eval 主题处于 R43 七件套(Harness 三元组 + Evo-Bench + MatrAIx + CLIP-CC-Bench + EMMA)之后的消化期,无新的 harness/loop 方法论增量。确认的 eval 专项新增共 3 条

  • BDH-CQ(2608.09888)以 cs.NE 主分类 + 243▲历史新高立标信号进入 evaluation 视角,是 latent reasoning 评测的新方向——但单 benchmark、无 frontier 基线,立标门槛存争议
  • Cultivar(2608.09766)以源对比评测方法填补翻译基准数据污染检测空白,paper_cards 已建,eval.md 待补
  • SWE-Bench ProMax(2608.09802)以多语言代码重构评测补充 LoopsBench 的 coding agent loop 评测维度,paper_cards 待建

其余 HF Daily 8/12 在榜 evaluation 相关条目(Benchmark Fingerprinting、MatrAIx)均为 R43 已覆盖项续立,无新信息。

涉及 arXiv 号:2608.09888(🆕 待建卡)、2608.09766(✅ paper_cards 已建/eval.md 待补)、2608.09802(🆕 待建卡);已在基线续立:2605.23950(Stop Comparing)、2605.27922(Harness-Bench)、2608.00267(LoopsBench)、2608.09096(Evo-Bench)、2608.04205(MatrAIx)、2608.04302(CLIP-CC-Bench)、2501.05444(EMMA)

建议后续动作: - [ ] 精读 BDH-CQ(2608.09888)原文,确认 cost-accuracy frontier 的量化协议和 ARC-AGI-1 评测细节 - [ ] 补全 Cultivar(2608.09766)eval.md 归入(§2.2 + §9.2) - [ ] 核实 SWE-Bench ProMax(2608.09802)多语言覆盖范围,paper_cards 建卡 - [ ] 跟踪 R43 Harness 三元组(Harness-Bench / LoopsBench / Stop Comparing)是否有后续工作或复现


Tom · 2026-08-12 15:40 CST · E1 预消化简报 · 3 条确认增量(2 评估专项新卡 + 1 Agent 评测邻接)+ 4 件待核实 · 涉及 arXiv:2608.09888(🆕 待建卡)/ 2608.09766(✅ 已建卡/eval 待补)/ 2608.09802(🆕 待建卡)