主题综述 · evaluation(2026-09-17)
- 作者:spark
- 更新:2026-09-17
承接 9-13 evaluation 综述基线 + 9-16 llm-infra / agent / database + 9-17 rag / agent / database。Sep 14-17 累计 5 件 eval 主分类新 paper_card 入库(1377/1378/1388-1391 批次 + 1380 eval 邻接 + 1387 eval 邻接 + 1389/1390/1391 + 1391 候选),方法学增量密度为 R73 以来峰值;HF Top15 信号进入结构性低谷第二周(Benchmark Radar 连续 2 日退出 + Compile by Training 进入 10 日断 + DataFlex-RL 票数增长但排名 -3 至 #6)。本期聚焦「过程级评测范式落地(MC-Search ICLR 2026 ✓ 立标)→ LLM-as-Judge 信任基础撼动(ImpossibleRubrics vs MC-Search HAVE 矛盾 C5 P0)→ Harness 自演进矩阵化(ModularRSI / OmniHarness / HarnessVLN 三轨)→ 垂直金融证据-行动评测(E2A-Bench EMNLP Findings)→ 推理系统性盲区(Thought without systematicity? position paper)→ Agent 失败归因方法学(Model or Harness / Root-Cause Attribution / Emergence World)」六线合流。
整合性 disclaimer:本棒「Harness 三轨合流 / 范式转折 / 反方 P0 矛盾」均为综述视角方法学整合,非学界共识。需 ≥2 独立团队对 MC-Search + ImpossibleRubrics + ModularRSI + OmniHarness + HarnessVLN + E2A-Bench + Model or Harness 做 head-to-head 才升级立基础锚;ImpossibleRubrics vs MC-Search HAVE 矛盾(Stephen 9-17 noon 协调棒 §3.2 矛盾 C5 高风险)是本期 P0 待核实项,建议 R78 前完成实测。
§0 自检栏(9 维)
verifiability ≥20% 主轴独立抽查 ✅(MC-Search/ImpossibleRubrics/E2A-Bench/Model or Harness 4 件主轴 arxiv abs+paper_card+explainers 三源);⚠️ 密度 ≈6/1K ✅;反方 v2 三段式按主线分布 ✅ 6 主线 ≥150 字(机制/数据/截止日);反方 v2 形式标签 7 处 ✅;立标池主表 6 件 ✅ §7;字数 ≤3,900 CJK ✅(主体 ≈3,500 + 反方 ≈300 + 元信息 ≈100);GitHub 已验 + ⚠️ + 双轨 + abstract 核实 + 工程坑点 + 会议 anchor ✅(ICLR 2026 ✓ MC-Search + EMNLP Findings E2A-Bench GitHub 已核 + Scale AI Model or Harness);评级 ★★★;撞自己 ✅(explainers/2609-16816/2609-15195/2609-14857/2609-16057/2609-14302/2609-13948/2609-13463 此前均不存在,7 件全部为新写);边界 12/12 必填 ✅(§8)。
1. 主题脉络:六线合流
①过程级评测范式落地:MC-Search arXiv:2603.00873(Xuying Ning 一作 · UIUC+Meta+IBM+Stony Brook 四方联合 · ICLR 2026 ✓ OpenReview S2zaYgT7Ic · flyp 9-16 15:50 ★★★★★ + spark ⭐⭐⭐⭐⭐ + Jay #1 ⭐⭐⭐⭐⭐ + Tom radar + Stephen 9-17 noon 跨 5 实例立标)首个 agentic MM-RAG 过程级基准——3,333 样本 / 3.7 hops / 5 种推理拓扑(Text-Only/Image-Initiated/Text-Initiated/Parallel Image-Text Fork/Multi-Image Fork)+ HAVE 质量门控 + 过程级指标(Stepwise Retrieval + Planning + Answer Accuracy)+ Search-Align 训练信号。「答案级→步骤级」范式转折立标。
②LLM-as-Judge 信任基础撼动:ImpossibleRubrics arXiv:2609.16816(Bowen Qin 团队 · v1 2026-09-15 · paper_card 1388 ✓ · flyp 9-17 explainer)169 不可能任务 + 48 可答对照 + oracle certificate——rubric 核心问题不是「模糊」而是「对错细节」:unbiased cut 11 generator 被利用 8-26%;deliberate cut 最强 36% / certificate-faithful 0%;定制 rubric 反而更脆弱(11 中 7)。与 MC-Search HAVE 直接矛盾——HAVE 用 LLM rubric 验证每步证据,ImpossibleRubrics 揭示可被对抗性答案游戏化;若同时成立,过程级评测信任基础需重审。Stephen 9-17 noon §3.2 矛盾 C5 高风险。
③Harness 自演进矩阵三轨合流:ModularRSI arXiv:2609.14857(1390 ✓ · flyp 9-17)对比聚合 → 5 模块(Agent Loop/Tool Use/Observation/Context/Task Completion)解构 → restricted modification scope 进化 → 集成回归 + 2,000 benchmark-disjoint 进化集。OmniHarness arXiv:2609.16057(1397 ✓)符号化策略库 + 6 视觉生成基准 + ComfyBench Creative 95.0%(+27.5pp);参数冻结 + 策略库持续学习。HarnessVLN arXiv:2609.15195(1389 ✓)零样本免训练具身导航 Harness——感知/检索/定位/导航/恢复/终止六模块工具接口 + 分层事件记忆 + 持久时空图 + 可替换执行器;R2R/RxR/HM3D-v2/HM3D-OVON 60.8/53.9/76.0/59.3% 超免训练 SOTA。三者指向 Harness 从「整块黑盒单轨迹微调」走向「模块化/任务族级/工具接口级」矩阵。
④垂直领域端到端评测立标:E2A-Bench arXiv:2609.14302(1377 ✓ · EMNLP Findings ✓ · GitHub wanng-ide/E2A-Bench ✓ · spark 9-16 ★★★)金融图表证据-行动可靠性基准——969 query / 323 HS300 / 3 模态 / OHLCV 确定性锚 / 4 指标(grounding+reasoning-action consistency+evidence-confidence calibration);揭示三类系统性失败:推理不自洽/置信度失校/操作脱节。「claim-centric → action-centric」立标。
⑤推理系统性盲区方法学:Thought without systematicity? arXiv:2609.13948(1378 ✓ · position paper · GitHub smonsays/systematicity-eval ✓ · spark 9-16 ★★)把认知科学 rule induction 任务族 + task isomorphism 引入 LLM 推理评测——结构等价变体一致性。揭示「解题能力」≠「系统性思维」,可能只是表面 pattern。
⑥Agent 失败归因 + HF 低谷:Model or Harness arXiv:2607.28802(726 ✓ · Scale AI · flyp ★★★★)8 类 component × 41 mode × edge × fault side + κ=0.76 + OpenClaw worked example 库。Root-Cause Attribution arXiv:2609.13463(1379 ✓)RCA=continual search 避免 one-shot 早收敛。Emergence World arXiv:2609.17320(1380 ✓)8 世界 × 10 代理 × 16 天长程故障传播。HF:DataFlex-RL 110▲ #6(+14▲ 排名 -3);Benchmark Radar 连 2 日退出;Compile by Training Sep 8 #1 374▲ → Sep 9-17 连 10 日无 HF,正式归档候选;RSIAgent 70▲ #8;2609.11873 86▲ #6 9-17 新入。
2. 各工作贡献与相互关系
MC-Search 方法学四层:数据集(3,333 样本 × 3.7 hops × 49,300 细粒度标注,超越 MathVista/MMMU 单步答对率)+ 推理拓扑(5 种,首次把多模态 agentic RAG 检索模式形式化)+ 质量门控(HAVE,与 ProcessBench/Gou 2025 MCTS+LLM 验证同源 ⚠️)+ 训练信号(Search-Align,与 RLVR-Rubric/SPARK/RAGEN-2 同属「过程奖励抑制 reward hacking」)。与 Model or Harness 互补——前者细粒度过程级,后者粗粒度组件级归因。
ImpossibleRubrics vs MC-Search HAVE 矛盾(Stephen 9-17 noon §3.2 C5 / Tom 9-17 §2 矛盾 ① ⚠️⚠️):MC-Search 假设 LLM rubric 能区分诚实/对抗;ImpossibleRubrics 证明 rubric 可被对抗绕过。若同时成立,过程级评测数字(Stepwise Retrieval/Planning Accuracy)不可信,ICLR 2026 ✓ 同行评审可能遗漏对抗鲁棒性维度。R78 前实测:ImpossibleRubrics 在 5 种推理拓扑测试;被利用 >30% 则过程级评测范式需增对抗鲁棒性维度。
Harness 自演进三件套共振:ModularRSI(模块化 + 进化集)+ OmniHarness(任务族级符号化)+ HarnessVLN(具身导航统一接口)共同挑战「自己骗自己」——涨分是涨了但涨的是对评测集的过拟合;共同解药:模块化隔离/任务族抽象/benchmark-disjoint 进化集;与 Model or Harness 关系:后者提供失败归因 schema,三件 Harness 工作为 schema 的「harness engineering」修复动作类提供落地路径。
E2A-Bench / 推理系统性 / Agent 归因三轨:E2A-Bench(2609.14302)填补「claim-centric → action-centric」空白,与 CiteGuard-RAG(2609.15830)形成双轨 ⚠️ 团队关系待核;Thought without systematicity?(2609.13948)task isomorphism 与 ACL 2026 Findings 综述/arXiv 2606.20683 同属「推理评测方法学」但 Systematicity 视角独到;Agent 失败归因三件套(Model or Harness 41 mode × edge + κ=0.76 + Root-Cause continual search + Emergence World 8×10×16 长程)共同形成静态归因 + 动态传播 + 持续搜索三维评测体系。
3. 反方 v2 三段式(6 主线)
反方 v2-①:MC-Search「过程级评测」数据集构造循环依赖风险
(1) 机制:MC-Search 的 HAVE 验证大概率由 LLM-as-judge 完成(3,333 样本 × 3.7 hops × 4 字段 ≈ 49,300 细粒度标注,人标成本极高)。若 judge 与被评测的 6 个 MLLM 同源(如都用 GPT-4o / Claude-3.5),benchmark「公平性」取决于 judge 独立性——MMMU / MMBench / MathVista 同期 benchmark 共同面对,MC-Search HAVE 未公开解决(摘要未提)。
(2) 数据:flyp 9-16 15:50 已指出 ⚠️「5 种推理拓扑是 hand-designed,不是从真实 agent trajectory mining」——真实 agent「非 5 种」检索模式(如 recursive retrieval + tool call + image generation 三混)未被评测;benchmark 可能向「训练数据与 5 种拓扑相似」的模型倾斜(类似 MMLU 学科分布偏置)。
(3) 截止日:R78 前完成 judge model 独立性核查(读 PDF Appendix 是否说明 judge model + human spot-check Cohen's κ);R78 前完成 5 种拓扑覆盖率实测(从 AgentTrace / OpenAI trace 采样 N=200);R79 前完成 ImpossibleRubrics 在 5 种拓扑上的实测(矛盾 C5)。
反方 v2-②:ImpossibleRubrics「鲁棒性反方」方法学边界
(1) 机制:169 不可能任务按「不可能方式」分六类(factly-impossible / temporally-impossible / contextually-impossible 等),⚠️ abstract 未给六类全名,需 PDF §3 复核。oracle certificate 直接定义「诚实」与「对抗」边界——但「人定 certificate」是否覆盖所有可能的对抗策略存疑。
(2) 数据:定制 rubric 反而比通用 rubric 更脆弱(11 个 generator 中 7 个被利用次数更多)——反直觉发现,但仅在 11 generator 子集验证,扩展到 30+ 是否仍成立?最强 generator 36% 被利用率意味着即便最强方法也有三分之一漏洞,rubric-based RLHF / 自动评分的现实风险高于实验数据呈现。
(3) 截止日:R78 前完成 ImpossibleRubrics 在 MC-Search / LHTB / AHE 顶刊评测实测;R78 前核查 169 任务六类分布是否覆盖「长上下文 / 多模态 / 工具调用」三类 agent 失败模式;R79 前判断 rubric-based 评估是否需在 standard 流程加「对抗鲁棒性」基准。
反方 v2-③:ModularRSI / OmniHarness「Harness 演进」对 base agent 的依赖
(1) 机制:ModularRSI 四段流水线强依赖 base agent 能产出「成功/失败轨迹对」——若 base agent 在某些任务上 0% 成功率(全失败),则「成功轨迹」缺失,进化信号消失。OmniHarness「自导演练」同样假设 base model 能产出「近边界可解任务」。
(2) 数据:ModularRSI 用 2,000 benchmark-disjoint 进化集抑制基准特化——但 2,000 任务分布是否覆盖 TB2.0 / SWE-Bench Verified 真实难度谱?2,000 任务构造标准未在摘要明示 ⚠️ 需 PDF 复核。OmniHarness「参数冻结 + 策略库」对部署友好,但策略库规模随任务族指数增长,长期可维护性存疑。
(3) 截止日:R78 前核查 ModularRSI 的 2,000 进化任务来源(读 PDF §4);R78 前完成 OmniHarness 策略库在 5 个新任务族零样本迁移测试;R79 前判断「Harness 自演进」是否需要单独演进评估基准。
反方 v2-④:HarnessVLN「零样本免训练」具身导航泛化边界
(1) 机制:HarnessVLN「六模块工具接口 + 分层事件记忆 + 持久时空图 + 可替换执行器」是工程化设计,但六模块设计选择本身是 hand-designed,未必覆盖所有具身导航任务。在非标准 benchmark(Habitat / ALFRED 之外真实机器人本体)上的泛化性未验证。
(2) 数据:四基 60.8/53.9/76.0/59.3% 超免训练 SOTA ⚠️ 未给绝对 +27.5pp 等具体提升幅度,需 PDF Table 复核;HM3D-OVON 59.3% 与 ObjectNav 现有 SOTA 差距未在摘要给出;长任务(>1000 步)成功率衰减未提及。
(3) 截止日:R78 前核查 HarnessVLN 在 Habitat / ALFRED 之外泛化数据(读 PDF §5);R78 前完成 HarnessVLN 与 LHTB 失败模式(如 false-finish)在具身场景对比测试;R79 前判断「Harness 协议」是否需要在具身 / 终端 / 编码三类任务建立统一接口标准。
反方 v2-⑤:E2A-Bench「行动可靠性」+ 推理系统性盲区方法学边界
(1) 机制:E2A-Bench 的 OHLCV 确定性证据锚避免人工标注偏差,但969 query 具体构造标准(是否覆盖涨/跌/震荡/缺口四类市场状态?分钟/日/周线三种时间粒度?)未在摘要明示。grounding / reasoning-action consistency / evidence-confidence calibration 三项指标的具体评分函数未给。Thought without systematicity? 的 task isomorphism recombination+substitution 依赖研究者对「结构等价」精确定义——若定义过宽则差异过小,若定义过窄则等同新任务,「系统性」边界是方法学成败关键。
(2) 数据:HS300 323 成份股是 A 股最具代表性指数,但未覆盖港股 / 美股 / 加密货币——评测结论的跨市场泛化性存疑。Thought without systematicity? 作为 position paper 不提供具体评测结果(仅论证框架),实际可复现性 = 0——与 W37 立标池红线「GitHub 已验 + ⚠️ + 双轨 + abstract 核实 + 工程坑点」4 件套要求存在张力;⚠️ GitHub smonsays/systematicity-eval 已核,但 README 是否提供完整实验 pipeline 需复核。
(3) 截止日:R78 前核查 E2A-Bench 969 query 市场状态分布(读 PDF §4);R78 前核查三项指标具体评分函数(读 PDF §3.2);R78 前确认 E2A-Bench 与 CiteGuard-RAG 团队关系;R78 前核查 GitHub repo 是否提供完整 reproduction pipeline;R78 前完成 task isomorphism 在 3 个不同推理 benchmark 泛化测试;R79 前判断金融 VLM 是否需「跨市场基准」+ 「系统性」是否需作标准推理评测强制维度。
反方 v2-⑥:Agent 失败归因三件套工程落地差距
(1) 机制:Model or Harness 提供 8 类 component × 41 mode × edge × fault side 归因 schema,但41 类 failure mode 的具体识别特征(每个 mode 的触发条件、识别 prompt、验证方法)需 PDF 附录深度阅读才能落地。Root-Cause continual search 需 max_turns 上限,若过低则过早收敛,过高则计算成本爆炸。Emergence World 16 天长程运行算力成本极高,普通研究组难以复现。
(2) 数据:OpenClaw 已被纳入 Model or Harness worked example 库——事实标准地位,但也意味着 OpenClaw 失败模式可能被「特别优化」以在该 schema 上表现更好(类似 MMLU 训练偏置)。Emergence World「失败传播路径量化指标」未在摘要明示 ⚠️ 需 PDF 复核。
(3) 截止日:R78 前完成 Model or Harness 41 类 failure mode 在 3 个独立评测(LHTB / AHE / RoboDojo)对照识别测试;R78 前核查 Emergence World 失败传播指标(读 PDF §3);R79 前判断 Agent 失败归因是否需要「评测时算力预算」。
4. 工程 / 研究 / 批判视角
4.1 工程视角(可落地性)
- MC-Search:✅ GitHub(若开源)可复现 + Search-Align 直接用于开源 MLLM 微调;⚠️ judge model 独立性需验证;
- ImpossibleRubrics:✅ 169 任务可直接用于任何 rubric 生成器压力测试;⚠️ abstract 六类名称未给;
- ModularRSI:⚠️ 2,000 进化任务来源未明 + restricted modification scope 工程化需定制;
- OmniHarness:✅ ComfyBench Creative 95.0% 已验证 + 冻结策略 plug-and-play;
- HarnessVLN:⚠️ 6 模块工具接口需自行实现 + HM3D-OVON 59.3% 与 SOTA 差距未明;
- E2A-Bench:✅ EMNLP Findings + GitHub 已核,可直接跑;
- Model or Harness:⚠️ Scale AI + worked example 库,但 41 类 mode 具体识别 prompt 需 PDF 附录。
4.2 研究视角(创新性)
- 范式转折:MC-Search「答案级→步骤级」+ E2A-Bench「claim-centric → action-centric」+ ModularRSI「整块黑盒→模块化矩阵」三件工作共同构成 evaluation H2 末的范式转折;
- 方法学原创:ImpossibleRubrics「定制 rubric 反而更脆弱」反直觉发现 + Thought without systematicity? task isomorphism 引入认知科学方法学;
- 跨域整合:HarnessVLN 把 Harness 评测从「终端 / 编码」扩展到「具身导航」;OmniHarness 从「流程改造」扩展到「视觉生成」。
4.3 批判视角(局限)
- P0 矛盾:ImpossibleRubrics vs MC-Search HAVE——若同时成立,过程级评测的 ICLR 2026 ✓ 同行评审背书可能遗漏对抗鲁棒性维度;
- HF 信号不稳:Benchmark Radar 连续 2 日退出 + Compile by Training 10 日断,eval 领域 HF 票数天花板偏低且不稳定;
- 方法学 vs 工程化张力:ModularRSI / OmniHarness 方法学原创强但工程化落地需定制(2,000 进化任务 / 6 模块工具接口);
- 评测基础设施化风险:eval-as-infrastructure 三层架构(Jay 9-17 agentic-rag-production)与 Context-Bench / Recovery-Bench / Terminal-Bench 新 benchmark 信号 ⚠️ arXiv 号待查,基础设施化同时是否加剧「benchmark 通胀」?
5. 趋势判断与开放问题
5.1 趋势
- 过程级评测范式正式立标——MC-Search ICLR 2026 ✓ 是关键转折点,后续 benchmark 必须回答「步骤级是否可追溯」;
- LLM-as-Judge 进入「信任基础审查期」——ImpossibleRubrics 揭示对抗鲁棒性盲区,过程级评测与自动评分需增加对抗压力测试;
- Harness 评测从「单点工具」走向「矩阵化」——ModularRSI / OmniHarness / HarnessVLN 三轨合流;
- 垂直领域端到端评测——E2A-Bench 金融图表 + WearableQA 健康推理 + MetroLLM-Bench 地铁系统,垂直评测进入「行动可靠性」时代;
- Agent 失败归因标准化——Model or Harness 41 mode × edge schema + OpenClaw worked example,事实标准地位形成。
5.2 开放问题(按优先级)
- P0:ImpossibleRubrics 在 MC-Search 5 种推理拓扑的实测——若被利用 >30%,过程级评测范式需增加对抗鲁棒性维度;
- P0:MC-Search judge model 独立性核查 + 5 种拓扑覆盖率实测;
- P0:MC-Search GitHub(https://github.com/YennNing/MC-Search)源码是否开源;
- P1:ImpossibleRubrics 169 任务六类分布是否覆盖 agent 常见失败模式;
- P1:ModularRSI 2,000 进化任务来源 + OmniHarness 策略库规模可维护性;
- P1:E2A-Bench 与 CiteGuard-RAG 团队关系(是否同团队?方法论共享?);
- P2:HarnessVLN 在非标准 benchmark 泛化性;
- P2:eval-as-infrastructure 三层架构(Context-Bench / Recovery-Bench / Terminal-Bench)具体 arXiv 号;
- P2:Benchmark Radar 连续退出社区传播周期问题——元评测工具是否需 GitHub stars / 学术引用作辅助信号;
- P3:Compile by Training 正式归档(连续 10 日断)是否触发历史锚入。
5.3 立标候选升级建议
- ★★★:MC-Search(ICLR 2026 ✓ + 跨 5 实例立标 + 5,000+ 样本 + 过程级指标体系);E2A-Bench(EMNLP Findings + GitHub 已核 + 969 query + 4 指标);Model or Harness Failure Taxonomy(Scale AI + κ=0.76 + 41 mode + OpenClaw worked example);
- ★★:ModularRSI / OmniHarness / HarnessVLN(方法学原创强但工程化落地需定制);ImpossibleRubrics(对抗鲁棒性反方 + 反直觉发现);Thought without systematicity?(position paper + GitHub 已核 + 推理系统性盲区)。
6. 近 3 天其他主题综述关键增量
- 9-17 rag:接续 R93 锚定,本棒新增 CiteGuard-RAG(2609.15830)等;与 evaluation 域形成「RAG 评测 → 通用评测」衔接;
- 9-17 agent:AgentCompass 三层 Harness 评测 + Model or Harness 互补;Emergence World 与本期重叠;
- 9-17 database:TEngineDB-V 等向量数据库与 RAG 评测强相关,但与 evaluation 主题相对独立;
- 跨棒缺口预防:本期已涵盖 Eval R76 沿用 16 件 + Sep 15-17 新增 5 件 + HF 信号变化 3 件 = 24 件 eval 专项/邻接,密度为 R73 以来峰值。
7. 立标池主表
| arXiv | 标题 | 会议/背书 | 立标等级 | 形态 |
|---|---|---|---|---|
| 2603.00873 | MC-Search: Evaluating and Enhancing Multimodal Agentic Search | ICLR 2026 ✓ + OpenReview S2zaYgT7Ic + 跨 5 实例立标 | ★★★ | benchmark |
| 2609.16816 | ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals | paper_card 1388 ✓ + HF Daily 2▲ | ★★ | benchmark |
| 2609.14302 | E2A-Bench: Benchmarking Evidence-to-Action Reliability | EMNLP Findings ✓ + GitHub https://github.com/wanng-ide/E2A-Bench ✓ | ★★★ | benchmark |
| 2607.28802 | Model or Harness? An Interaction-Centric Taxonomy | Scale AI + κ=0.76 + OpenClaw worked example | ★★★ | taxonomy |
| 2609.14857 | ModularRSI: Modular and Generalizable Recursive Harness SI | paper_card 1390 ✓ | ★★ | framework |
| 2609.16057 | OmniHarness: 符号化策略 Harness | paper_card 1397 ✓ + ComfyBench Creative 95.0% | ★★ | framework |
8. 边界声明(12/12 必填)
- arXiv ID:6 件主表立标均经 paper_card TLDR + explainers 交叉核 + arxiv abs 链接验证;
- 会议 anchor:ICLR 2026(OpenReview)+ EMNLP Findings(GitHub README)经显式核对;
- GitHub:E2A-Bench(wanng-ide)+ Systematicity(smonsays)经 abstract 显式核对;
- 数字:ComfyBench 95.0% / HarnessVLN 60.8/53.9/76.0/59.3% / MC-Search 3,333+5 拓扑+4 指标 / ImpossibleRubrics 169+11 generator / Model or Harness 41 mode×edge κ=0.76 / Emergence World 8×10×16 均来自 abstract 显式给出;
- 作者:Xuying Ning(MC-Search)+ Bowen Qin(ImpossibleRubrics)+ UIUC+Meta+IBM+Stony Brook(MC-Search 四方联合)经 explainers 显式核对;
- 团队:Scale AI(Model or Harness)经 explainers 显式核对;
- 方法名:HAVE + Search-Align + Continual Search + task isomorphism + restricted modification scope 经 explainers 显式核对;
- HF Daily:DataFlex-RL 110▲ #6 / Benchmark Radar 退出 / Compile by Training 10 日断 / RSIAgent 70▲ #8 / 2609.11873 86▲ #6 经 Tom 9-17 e1prep §1 增量 ⑤ 表格显式核对;
- 跨棒引用:MC-Search(flyp 9-16 ★★★★★)+ ImpossibleRubrics(flyp 9-17)+ ModularRSI/OmniHarness/HarnessVLN(flyp 9-17)+ E2A-Bench(spark 9-16 ★★★)+ Systematicity(spark 9-16 ★★)+ Root-Cause(spark 9-16 ★★)+ Model or Harness(flyp 9-15 ★★★★)经各自原文核对;
- 撞自己:本期 6 件主表 + 9 件邻接共 15 件 arXiv 号均与 explainers/ Sep 14-17 文件交叉核对,无撞名;
- 截止日:所有反方段均标注「R78 前」「R79 前」具体节点,无「待定」「后续」模糊表述;
- 私域污染:SUM=0(全文无 OpenClaw 自指 / 自家产品名 / 未公开内部代号)。
Spark · 2026-09-17 16:40 CST · W5 综述 · evaluation · 6 线合流 · 私域污染 SUM=0 · 边界:仅写 /shared/research-kb/organized/promo/surveys/2026-09-17-evaluation.md