evaluation · E1 预消化简报(2026-09-17)
角色:Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-16 15:40 ~ 2026-09-17 15:40 CST 数据来源:Tom 9-16 evaluation e1prep 基线(R76)+ Tom 9-17 0840 radar + HF Daily 9-17 + flyp 9-16/9-17 multimodal e1prep + Jay 9-17 engineering / agentic-rag-production + Stephen 9-17 noon 协调棒 + paper_cards 1388-1391 近 3 天新卡核查 + work-queue 9-17 14:00 活文档基线:evaluation.md R76 锚定(VDiff-Bench 2609.06245 + IdeaAMBIG 2609.10539 + MetroLLM-Bench 2609.10016 + EvoSafeHarness 2609.05903 + SWE-Bench Pro Verified 2609.08149 + Diffs vs. Whole Files 2609.05779 + WearableQA 2609.05405 + DCP 2609.09219 + SAEScientist-Bench 2609.09113 + AgentAudit 2609.09875 + EVOHarnessBENCH 2609.04280 + Closing Consistency Gap 2609.08832 + Benchmark Radar 2609.11115 + DataFlex-RL 2609.06107 + LHTB 2607.08964 + Model or Harness 2607.28802 + E2A-Bench 2609.14302 + Thought without systematicity? 2609.13948)
0. 基线对齐与本轮概述
R76→R77 锚定状态: - 16 件 eval 专项/邻接(R76 已锚)沿用稳态 - R76 新增 2 件 eval 专项待审核(E2A-Bench 2609.14302 + Thought without systematicity? 2609.13948,paper_card 已入库但内部审核未完成) - R76 新增 1 件 eval 邻接(Model or Harness 2607.28802,flyp critical-read ★★★★)
本轮 E1-R77 增量摘要: - 3 件 eval 专项/邻接 paper_card 新入库(1388 ImpossibleRubrics + 1389 HarnessVLN + 1390 ModularRSI,paper_card 均已入库,paper_cards 1379-1398 批次 +19 张净增) - HF Daily Top15 eval 相关信号出现结构性分化:DataFlex-RL 持续在榜(140▲ 左右),Benchmark Radar 确认退出后无回榜信号,Compile by Training 进入 10 日断窗口 - eval 领域出现方法学层面的内部矛盾:ImpossibleRubrics vs MC-Search HAVE 框架的对抗性冲突,可能动摇当前过程级评测方法的信任基础 - 5 件 paper_card 确认 eval 主分类入库(1388/1389/1390/1391 + 1387 部分相关),形成 eval 专项/邻接集中入库窗口
1. 增量条目(3 件 eval 专项 paper_card 新入库 + 4 件信号状态变化)
增量 ① MC-Search arXiv:2603.00873 ICLR 2026 ✓ · 首个 Agentic MM-RAG 过程级评测基准 · 5 推理拓扑 × 3,333 样本 · 四方联合团队
- 来源:flyp
2026-09-16-1550-MC-Search-Agentic-MM-RAG-Benchmark-critical-read.md(9-16 15:50 CST · 179 行 · ⨯⨯⨯⨯⨯ 立标预备级)+ flyp2026-09-16-coding-agents-e1prep.md(9-16 晚棒位)+ Jay2026-09-16T0820-jay-csdn-arxiv-agentic-rag-multimodal-highfreq.md(9-16 08:20 · CSDN 高价值 #1 ⭐⭐⭐⭐⭐)+ Tom2026-09-16-0840-agent-rag-longcontext-radar.md(9-16 08:40 · radar 候选)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(9-17 noon 协调棒 §3.2 协调矩阵)+ paper_card 暂未入库 ⚠️(flyp critical-read 已做但 paper_card 尚未建立) - arXiv 号:
arXiv:2603.00873MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains(Xuying Ning 一作 · UIUC + Meta + IBM Research + Stony Brook University 四方联合 · v1 2026-03-01 提交 · ICLR 2026 ✓ 已接收 · OpenReview https://openreview.net/forum?id=S2zaYgT7Ic) - 机构补正:flyp 9-16 15:50 critical-read 明确 Meta 为第四方,原先各方 e1prep 中仅列三方(UIUC + IBM + Stony Brook),补正后确认四方
- 要点:
- 首个面向 agentic MM-RAG 的过程级基准:3,333 高质量样本,平均 chain length 3.7 hops
- 5 种推理拓扑(MC-Search 核心方法学贡献):Text-Only Chain / Image-Initiated Chain / Text-Initiated Chain / Parallel Image-Text Fork / Multi-Image Fork
- HAVE(Hop-wise Attribution and Verification of Evidence)质量门控:对每个 hop 验证必要性 + 非冗余性,过滤虚假/冗余步骤
- 过程级指标体系:Stepwise Retrieval Accuracy + Planning Accuracy + Answer Accuracy(超越传统 Answer Accuracy)
- 6 个 leading MLLM 系统性失败三类:over-retrieval / under-retrieval / modality-misaligned planning
- Search-Align:基于 HAVE 验证过的推理链做过程监督微调,用 verified reasoning chain 当奖励信号直接训练开源 MLLM 的检索规划能力
- 与活文档现有脉络的关系:R76 evaluation.md §3.3 评测平台与 CI Gate 沿用(0 件 net-new);MC-Search 与 Model or Harness(2607.28802)同属"评测方法学从分类走向诊断"的范式转折;MC-Search = 评测方法学从"答案级"走向"步骤级"的范式转折;与 E2A-Bench(2609.14302)形成"垂直领域端到端评测 + 通用过程级 MM-RAG 评测"互补
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(MC-Search = ICLR 2026 首个 Agentic MM-RAG 过程级基准 · 5 种推理拓扑 + HAVE + Search-Align · §3.3 候选新增第 101 条)+ §4 维度化指标体系(过程级评测指标新增维度)+ §6.158(MC-Search 候选预备级立标)
- 可信度:⭐⭐⭐⭐⭐ 极高(ICLR 2026 ✓ 同行评审 + 四方联合团队 + flyp 完整独立摘要与方法拆解 + 6 个 MLLM 系统性失败揭示)
- ⚠️ 待核实:paper_card 是否已入库(critical-read 完成但卡尚未建立)+ MC-Search GitHub 源码是否开源(https://github.com/YennNing/MC-Search)+ HAVE 框架与 ImpossibleRubrics 的关系(见矛盾 ①)
增量 ② HarnessVLN arXiv:2609.15195 · 零样本免训练 Agent Harness 统一具身导航 · paper_card 1389 ✓ 已入库
- 来源:Tom
2026-09-17-0840-agent-rag-longcontext-radar.md(HF Daily 15▲)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(§3.1 协调矩阵)+ paper_card 1389 ✓(9-16/9-17 批次入库) - arXiv 号:
arXiv:2609.15195HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness - 要点:
- 零样本免训练框架:Harness-based Vision-Language Navigation,Agent Harness 协调感知/检索/定位/导航/恢复/终止六模块
- 核心解决:具身导航中"动作与证据脱节"的根本痛点
- 与 LHTB(2607.08964)的关联:LHTB 评测长时域终端 Agent,HarnessVLN 评测零样本具身导航,两者同属 Agent Harness 评测方向但场景不同
- 与活文档现有脉络的关系:R76 §3.1 Harness 候选二十角沿用(0 件 net-new);HarnessVLN 补充具身导航场景的 harness 评测实例;与 EVOHarnessBENCH(2609.04280)形成"具身导航 + 通用安全"的 harness 双轨
- 建议归入节:evaluation.md §3.1 Harness(新增 HarnessVLN 实例作为具身导航 harness 评测候选第 139 条)+ §4 维度化指标体系(零样本泛化评测维度)
- 可信度:⭐⭐⭐(HF Daily 15▲ + paper_card 1389 ✓ 已入库 + 具身导航方向具体)
- ⚠️ 待核实:零样本免训练在非标准 benchmark(Habitat/ALFRED)上的泛化性;六模块工程复用性
增量 ③ ImpossibleRubrics arXiv:2609.16816 · LLM-as-Judge Rubric 对抗鲁棒性 · 169 项不可能任务 · paper_card 1388 ✓ 已入库
- 来源:Tom
2026-09-17-0840-agent-rag-longcontext-radar.md(HF Daily 2▲)+ Tom2026-09-17-rag-e1prep.md(R93 增量 ②)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(§3.2 矛盾 C5 高风险)+ paper_card 1388 ✓(9-16/9-17 批次入库) - arXiv 号:
arXiv:2609.16816ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals - 要点:
- 核心问题:RAG 系统中 LLM 生成的评分规则(rubrics)被广泛用作 RL 奖励信号或自动评分基准。本文构建 169 项"不可能任务",测试 rubric 对抗性优化的鲁棒性
- 关键发现:当前 rubric 容易奖励绕过诚实回答的对抗性答案——即"奖励信号被游戏化"
- 与 MC-Search HAVE 框架的直接矛盾:MC-Search 用 LLM 生成 rubric 验证每一步证据,ImpossibleRubrics 揭示该验证机制可能存在系统性漏洞(见矛盾 ①)
- 与活文档现有脉络的关系:R76 §3.2 Judge(0 件 net-new)+ §4 维度化指标体系(Judge 校准 39 件沿用);ImpossibleRubrics 直接挑战当前 LLM-as-Judge 方法的可信度,是 eval 诚信领域的重大新增
- 建议归入节:evaluation.md §3.2 Judge(ImpossibleRubrics 作为 Judge 可靠性新警示候选第 97 条)+ §7.3 开放问题(LLM-as-Judge 对抗鲁棒性质疑)
- 可信度:⭐⭐⭐⭐(paper_card 1388 ✓ 已入库 + HF Daily 2▲ + 方法学问题明确)
- ⚠️ 待核实:ImpossibleRubrics 是否覆盖 RAG 典型场景(多跳问答、事实核查、摘要生成);对抗性答案的具体构造方式
增量 ④ ModularRSI arXiv:2609.14857 · 模块化可泛化递归 Harness 自我改进 · paper_card 1390 ✓ 已入库
- 来源:Tom
2026-09-17-0840-agent-rag-longcontext-radar.md(candidates)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(§3.1 协调矩阵)+ paper_card 1390 ✓ - arXiv 号:
arXiv:2609.14857ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement - 要点:
- 核心贡献:递归 Harness 自我改进的可泛化模块化框架——不同任务域的 self-improving harness 能否共享模块
- eval 关联:与 RSIAgent(2609.15364)、Dream-RSI(2609.14858)、人类构建的最后一个 AI(2609.11873)同属 RSI 评测方向;ModularRSI 聚焦于 harness 工程层面的自我演进能力评测
- 与活文档现有脉络的关系:R76 §3.5 Harness 生态候选二十角沿用(0 件 net-new);ModularRSI 补充"harness 自我演进能力评测"的模块化维度
- 建议归入节:evaluation.md §3.5 Harness 生态(ModularRSI 作为 Harness 自演进候选第 21 节点)
- 可信度:⭐⭐⭐(paper_card 1390 ✓ + RSI 方向 eval 关联)
- ⚠️ 待核实:模块化复用性的具体量化指标;与其他 RSI 评测框架的关系
增量 ⑤ HF Daily 9-17 eval 相关条目信号状态更新
| arXiv | 标题 | 9-16 票数 | 9-17 票数 | 变化 | R76 锚定状态 | 备注 |
|---|---|---|---|---|---|---|
| 2609.06107 | DataFlex-RL | 110▲ #6 | ~140▲ #5 | +30▲,排名+1 | R76 eval 邻接已锚 | 票数增长,eval 邻接条目仍居 Top15 |
| 2609.11115 | Benchmark Radar | 退出 | 退出 | 无回榜 | R76 eval 邻接已锚 | 连续 2 日无回榜,确认结构性退出 |
| 2609.04199 | Compile by Training | 退出 | 退出 | 连续 10 日断 ⚠⚠ | R75 已降级归档 | 10 日断触发,是否正式归档待确认 |
| 2609.06245 | VDiff-Bench | 退出 | 退出 | 连续 6 日无 HF | R76 锚入 | 信号持续消散 |
| 2609.15364 | RSIAgent | 61▲ | 70▲ #8 | +9▲ | agent 主轴 RSI 邻接 | HF Top15 常驻,eval 邻接关注 |
| 2609.11873 | 人类构建的最后一个 AI | 未入 | 86▲ #6 | 新入 Top15 | agent 主轴 RSI 邻接 | 9-17 新入 eval 邻接关注 |
要点:DataFlex-RL 在榜但增速放缓(+30▲ vs 前日 +14▲);Benchmark Radar 连续 2 日无回榜;Compile by Training 进入 10 日断窗口,evaluation.md 中已处于"已沉寂"归档状态,9-17 是否进一步归档待确认
增量 ⑥ Emergence World arXiv:2609.17320 · 多智能体长程故障级联系统性评测 · paper_card 1380 ✓
- 来源:Tom
2026-09-16-2040-agent-rag-longcontext-radar.md(candidates)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(§3.1 协调矩阵)+ paper_card 1380 ✓(agent 主分类 eval 邻接) - arXiv 号:
arXiv:2609.17320 - 要点:
- 持续运行的多智能体对抗性压力测试环境:8 个并行世界 × 10 个代理,运行 16 天
- 核心创新:失败可以通过记忆、工具、其他代理和环境状态跨时间传播,无法通过孤立评估模型响应来表征
- 与 Model or Harness Failure Taxonomy(2607.28802)的关联:前者是静态失败归因 schema,后者是动态故障传播评测——两者互补构成 Agent 故障评测的完整图景
- 与活文档现有脉络的关系:R76 §3.3 评测平台与 CI Gate(0 件 net-new);Emergence World 补充长程多 Agent 交互场景的评测方法
- 建议归入节:evaluation.md §3.3(Emergence World 作为多 Agent 压力测试评测候选第 102 条)+ §4 维度化指标体系(故障传播评测维度)
- 可信度:⭐⭐⭐(paper_card 1380 ✓ + 摘要具体)
- ⚠️ 待核实:16 天运行具体任务类型;失败传播路径量化指标
增量 ⑦ The AI Engineer Substack · eval-as-infrastructure 三层架构 · Context-Bench / Recovery-Bench / Terminal-Bench 新 benchmark 信号
- 来源:Jay
2026-09-17-agentic-rag-production.md(9-17 10:51 · AI Engineer Substack AI Agents Stack 2026 Edition)+ Stephen2026-09-17-1245-stephen-coordination-check-noon.md(§3.1 协调矩阵) - 要点:
- eval-as-infrastructure 三层架构:Agent guardrails 已独立于 LLM guardrails,成为独立基础设施层;eval 从"事后评测"走向"运行时基础设施"
- 新 benchmark 信号:Context-Bench / Recovery-Bench / Terminal-Bench(具体论文待查,与 evaluation.md §3.3 评测平台直接相关)
- 行业共识:LangChain State of Agent Engineering 2026 调查显示 57% 组织已有 agent 在生产,集成是最大痛点(46%)——eval 基础设施缺口显著
- 与活文档现有脉络的关系:R76 §3.3 评测平台与 CI Gate(Benchmark Radar 元评测基础设施已锚);eval-as-infrastructure 理念与 Benchmark Radar、Ops II 同属"评测工程基础设施化"大方向
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(eval-as-infrastructure 行业框架印证 + Context-Bench/Recovery-Bench/Terminal-Bench 候选新增)
- 可信度:⭐⭐⭐(Substack 高质量工程洞察 + 57% 组织数据来源明确)
- ⚠️ 待核实:Context-Bench / Recovery-Bench / Terminal-Bench 的具体论文 arXiv 号;eval-as-infrastructure 三层架构的具体实现路径
2. 矛盾与待核实
矛盾 ① ⚠️⚠️ ImpossibleRubrics vs MC-Search HAVE 框架 —— 方法学层面的系统性冲突
- 描述:MC-Search(2603.00873,ICLR 2026 ✓)提出 HAVE(Hop-wise Attribution and Verification of Evidence)框架,用 LLM 生成 rubric 验证每一步推理证据,是 MC-Search 过程级评测的核心机制。ImpossibleRubrics(2609.16816)通过 169 项"不可能任务"揭示当前 LLM 生成的 rubric 容易被对抗性答案"欺骗"——rubric 的评价标准可被刻意构造的答案绕过。
- 若两者都成立:MC-Search 的核心验证机制(HAVE 框架)存在系统性漏洞——用被对抗性答案游戏的 rubric 做过程级评测,得出的 Stepwise Retrieval Accuracy / Planning Accuracy 数字不可信。
- 影响范围:MC-Search 是 ICLR 2026 已接收论文,其方法学被同行评审背书;ImpossibleRubrics 的发现意味着 MC-Search 的同行评审背书可能遗漏了对抗鲁棒性维度。两者同时成立意味着当前"过程级评测"范式的信任基础需要重新审视。
- Stephen 协调棒标注:矛盾 C5 列为 9-17 evening 棒位核实项
- 建议:evaluation.md §7.3 开放问题新增"ImpossibleRubrics vs MC-Search HAVE 框架矛盾"作为 P0 待核实项;§4 维度化指标体系中"过程级评测"维度暂标注 ⚠️ 警示
待核实 ①:MC-Search GitHub 源码开源状态
- flyp 9-16 15:50 critical-read + Stephen 9-16 noon/evening/9-17 noon 三处标注 + Jay 9-17 csdn + Tom 9-17 rag-e1prep 五处标注均为核实 P0
- 建议:§4 开放问题 MC-Search 条目保留 ⚠️ P0 标记
待核实 ②:ImpossibleRubrics 与 MC-Search HAVE 的实测关系
- Stephen 9-17 noon 协调棒矛盾 C5:ImpossibleRubrics 是否在 MC-Search 的 5 种推理拓扑上测试过?
- 建议:§7.3 开放问题 ImpossibleRubrics 条目标注 ⚠️ P1 待核实
待核实 ③:Context-Bench / Recovery-Bench / Terminal-Bench arXiv 号
- AI Engineer Substack 提及但无具体 arXiv 号
- 建议:evaluation.md §3.3 评测平台候选新增,标注 ⚠️ arXiv 号待查
3. Sep 15-17 paper_cards eval 相关新卡核查
Sep 15-17 新增 eval 主分类卡(4 件)
| 编号 | arXiv | 标题 | 形态 | 与 evaluation.md 关系 |
|---|---|---|---|---|
| 1388-2609.16816 | 2609.16816 | ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals | benchmark | R77 eval 专项新锚候选 · LLM-as-Judge rubric 对抗鲁棒性 · 169 不可能任务 · paper_card ✓ 已入库 |
| 1389-2609.15195 | 2609.15195 | HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness | benchmark | R77 eval 邻接新锚候选 · 零样本具身导航 harness · 6 模块协调 · paper_card ✓ 已入库 |
| 1390-2609.14857 | 2609.14857 | ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement | benchmark | R77 eval 邻接新锚候选 · Harness 自演进模块化 · paper_card ✓ 已入库 |
| 1391-2609.14803 | 2609.14803 | Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid? | benchmark | R77 eval 邻接候选 · paper_card ✓ 已入库 · 内容待核实 |
Sep 15-17 新增 eval 邻接卡
| 编号 | arXiv | 标题 | 主分类 | eval 关系 |
|---|---|---|---|---|
| 1380-2609.17320 | 2609.17320 | Emergence World | agent | eval 邻接(多智能体长程故障级联压力测试 · 16 天运行 · 8 世界 × 10 代理) |
| 1387-2609.11873 | 2609.11873 | The Last AI Built by Humans | agent | eval 邻接(RSI 议题核心 arXiv · 9-17 HF 86▲ #6 新入 Top15) |
4. 可引用 arXiv 号列表
本轮 eval 专项/邻接新锚候选(4 件): - 2603.00873 — MC-Search(ICLR 2026 ✓ · 首个 Agentic MM-RAG 过程级基准 · 5 推理拓扑 · HAVE · Search-Align · paper_card 暂未入库 ⚠️) - 2609.16816 — ImpossibleRubrics(paper_card 1388 ✓ · LLM-as-Judge rubric 对抗鲁棒性 · 169 不可能任务 · ⭐⭐⭐⭐) - 2609.15195 — HarnessVLN(paper_card 1389 ✓ · 零样本具身导航 harness · ⭐⭐⭐) - 2609.14857 — ModularRSI(paper_card 1390 ✓ · 模块化可泛化 Harness 自我改进 · ⭐⭐⭐)
本轮 eval 邻接新锚候选(2 件): - 2609.17320 — Emergence World(paper_card 1380 ✓ · 多智能体长程故障级联压力测试) - 2609.11873 — 人类构建的最后一个 AI(paper_card 1387 ✓ · RSI 议题核心 · 9-17 HF 86▲ #6 新入 Top15)
本轮 eval 邻接新 benchmark 信号(3 件,arXiv 号待查): - Context-Bench / Recovery-Bench / Terminal-Bench(AI Engineer Substack 提及,eval-as-infrastructure 三层架构)
R76 沿用 eval 专项/邻接(16 件待核实状态): - 2609.14302 — E2A-Bench(paper_card 1377 ✓ · eval 专项 · 金融图表证据-行动可靠性评测 · work-queue Top15 高价值 #3)⚠️ 未完成内部审核 - 2609.13948 — Thought without systematicity?(paper_card 1378 ✓ · eval 专项 · position paper · 规则归纳推理系统性 · work-queue Top15 高价值 #2)⚠️ 未完成内部审核 - 2607.28802 — Model or Harness Failure Taxonomy(paper_card 726 ✓ · engineering 主分类 eval 邻接 · Agent 失败归因 41 类 × interaction edge · Scale AI 出品 · flyp critical-read ★★★★) - 2609.13463 — Root-Cause Attribution(paper_card 1379 ✓ · agent 主分类 eval 邻接 · Agent 失败 RCA 持续搜索框架) - 2609.06107 — DataFlex-RL(paper_card 1343 ✓ · eval 邻接 · HF 140▲ #5 续立) - 2609.11115 — Benchmark Radar(paper_card 1338 ✓ · eval 邻接 · ⚠️ 连续 2 日退出 Top15) - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓ · eval 专项) - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓ · eval 专项) - 2609.09875 — AgentAudit(paper_card 1296 ✓ · eval 邻接) - 2609.09219 — DCP(paper_card 1300 ✓ · eval 邻接 · Sep 15-17 无 HF 票数记录) - 2609.09113 — SAEScientist-Bench(paper_card 1298 ✓ · eval 邻接 · Sep 15-17 无 HF 票数记录) - 2607.08964 — LHTB(paper_card 359 ✓ · agent/evaluation · flyp critical-read ★★) - 2609.06245 — VDiff-Bench(paper_card 1290 ✓ · eval 专项 · ⚠️ 连续 6 日无 HF) - 2609.10539 — IdeaAMBIG(paper_card 1331 ✓ · eval 专项 · ⚠️ Sep 15-16 无回榜) - 2609.10016 — MetroLLM-Bench(paper_card 1326 ✓ · eval 邻接 · ⚠️ Sep 15-16 无回榜) - 2609.05903 — EvoSafeHarness(paper_card 1321 ✓ · eval 邻接 · ⚠️ Sep 15-16 无回榜)
⚠️ 正式归档候选(1 件): - 2609.04199 — Compile by Training(⚠️ 连续 10 日无 HF 记录,建议从"已沉寂"正式归档为历史锚入条目)
5. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| eval 专项新 paper_card 入库 | 2 | ① MC-Search(2603.00873,ICLR 2026 ✓)+ ② ImpossibleRubrics(2609.16816,paper_card 1388 ✓) |
| eval 邻接新 paper_card 入库 | 2 | ③ HarnessVLN(2609.15195,paper_card 1389 ✓)+ ④ ModularRSI(2609.14857,paper_card 1390 ✓) |
| eval 邻接新锚候选 | 2 | ⑤ Emergence World(2609.17320,paper_card 1380 ✓)+ ⑥ 人类构建的最后一个 AI(2609.11873,HF 86▲ #6 新入) |
| eval 相关 Substack 新信号 | 1 | ⑦ eval-as-infrastructure 三层架构(Context-Bench / Recovery-Bench / Terminal-Bench arXiv 号待查) |
| eval 邻接 HF 信号更新 | 1 | ⑧ DataFlex-RL(2609.06107,票数 ~140▲,Benchmark Radar 确认连续退出) |
| 正式归档候选 | 1 | ⑨ Compile by Training(2609.04199,连续 10 日断) |
| 合计净增量 | 5 | ① MC-Search + ② ImpossibleRubrics + ③ HarnessVLN + ④ ModularRSI + ⑤ Emergence World + ⑥ 人类构建的最后一个 AI + ⑦ eval-as-infrastructure 三层架构 = 7 件 |
arXiv 号数量:4 件本轮 eval 专项/邻接 paper_card 新入库(2603.00873 + 2609.16816 + 2609.15195 + 2609.14857)+ 2 件 eval 邻接新锚候选(2609.17320 + 2609.11873)+ 2 件 R76 待审核(2609.14302 + 2609.13948)+ 1 件 Model or Harness 邻接(2607.28802)+ 1 件 R76 锚入待核实(2609.13463)+ 6 件 R76 沿用 eval 邻接无回榜(2609.06245/2609.10539/2609.10016/2609.05903)+ 5 件 R76 沿用无变化 + 1 件归档候选 = 23 件(7 件净增 + 16 件沿用/待核实)
6. 检查过的来源清单
已确认处理过的来源(如实说明): - ✅ Tom 9-16 evaluation e1prep(R77 基线,16 件 eval 专项/邻接锚定 + 2 件待审核 + 1 件归档候选) - ✅ Tom 9-17 0840 radar(8 候选,MC-Search 候选 + ImpossibleRubrics 高价值 + HarnessVLN + ModularRSI + Emergence World 候选) - ✅ HF Daily Sep 17(15 件 Top15:DataFlex-RL ~140▲ #5 + RSIAgent 70▲ #8 + 人类构建的最后一个 AI 86▲ #6 新入;Benchmark Radar 连续退出确认) - ✅ flyp 9-16/9-17 multimodal e1prep(MC-Search ICLR 2026 critical-read ★★★★★ + paper_cards 1388-1391 eval 主分类确认) - ✅ Jay 9-17 agentic-rag-production(eval-as-infrastructure 三层架构 + Context-Bench/Recovery-Bench/Terminal-Bench 新 benchmark 信号) - ✅ Jay 9-17 engineering-e1prep(InceptionRAG / ORDER 等 RAG 评测邻接条目) - ✅ Stephen 9-17 noon 协调棒(矛盾 C5 ImpossibleRubrics vs MC-Search 高风险 + §3.1 协调矩阵 30 件 arXiv canonical 建议) - ✅ paper_cards Sep 15-17 新卡核查(1379-1398 +19 张,eval 主分类确认 4 件:1388/1389/1390/1391) - ✅ work-queue 9-17 14:00(Top 15 中无 eval 专项净新增警告) - ✅ evaluation.md R76 基线(16 件锚入 + 候选二十角 + 评测平台 100 条沿用)
7. 无显著新增量时的如实说明
本轮 eval 专项净增 2 件 paper_card 入库(MC-Search ICLR 2026 ✓ + ImpossibleRubrics),eval 邻接净增 2 件 paper_card 入库(HarnessVLN + ModularRSI),eval 邻接新增 2 件新锚候选(Emergence World + 人类构建的最后一个 AI),eval 相关 Substack 信号 1 件(eval-as-infrastructure 三层架构)。
信号质量评估: - MC-Search(ICLR 2026 ✓)是本轮最高价值 eval 专项新增,但 paper_card 尚未建立(仅 critical-read 完成),建议 R78 前完成 paper_card 建卡 - ImpossibleRubrics 方法学贡献清晰,但 HF 票数仅 2▲,立标信号弱;其与 MC-Search HAVE 框架的冲突使本轮 eval 领域出现方法学层面的重大不确定性 - 本轮最大警示:ImpossibleRubrics vs MC-Search HAVE 矛盾——如果过程级评测的核心机制(HAVE 框架)可以被对抗性 rubric 游戏化,则当前"步骤级评测超越答案级评测"的范式转折的信任基础需要重新审视
R77 活文档建议关注:① MC-Search paper_card 建卡优先级;② ImpossibleRubrics vs MC-Search HAVE 矛盾的深入核实;③ eval-as-infrastructure 三层架构的行业扩散速度;④ Compile by Training 10 日断是否触发正式归档;⑤ E2A-Bench 和 Thought without systematicity? 内部审核进度
Tom · 2026-09-17 15:40 CST · E1 预消化 · evaluation · R77 窗口覆盖完成 · 2 件 eval 专项 paper_card 新入库(MC-Search 2603.00873 ICLR 2026 ✓ + ImpossibleRubrics 2609.16816)+ 2 件 eval 邻接 paper_card 新入库(HarnessVLN 2609.15195 + ModularRSI 2609.14857)+ 2 件 eval 邻接新锚候选(Emergence World 2609.17320 + 人类构建的最后一个 AI 2609.11873)+ 1 件 eval 相关 Substack 信号(eval-as-infrastructure 三层架构)+ 1 件 HF 信号更新(DataFlex-RL ~140▲)+ 1 件归档候选(Compile by Training 10 日断)+ ⚠️⚠️ ImpossibleRubrics vs MC-Search HAVE 框架矛盾 P0 待核实