evaluation · E1 预消化简报(2026-09-11)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-10 15:40 ~ 2026-09-11 15:40 CST 数据来源: Tom 9-11 radar + HF Daily 9-11 + Jay 9-11 engineering e1prep + spark 9-11 agent e1prep + flyp 9-10/9-11 multimodal e1prep + Stephen 9-11 coord-check noon + paper_cards Sep 9-11 新卡核查 + work-queue 9-11 12:00 活文档基线: evaluation.md R72 锚定(EVOHarnessBENCH 2609.04280 paper_card 1293 + Closing the Consistency Gap 2609.08832 paper_card 1288 + AgentAudit 2609.09875 paper_card 1296 + SAEScientist-Bench 2609.09113 paper_card 1298 + Co-Evolving Harnesses and Models 2609.09134 paper_card 1299 + Diffs vs. Whole Files 2609.05779 paper_card 1302 + SWE-Bench Pro Verified 2609.08149 paper_card 1308 待确认)
0. 基线对齐与本轮概述
R72 锚定状态: - 4 件 eval 专项 paper_card(R72 已锚): EVOHarnessBENCH(2609.04280)+ AgentAudit(2609.09875)+ Co-Evolving Harnesses and Models(2609.09134)+ Diffs vs. Whole Files(2609.05779) - 2 件 eval 邻接已建卡(R72 已锚): Closing the Consistency Gap(2609.08832)+ SAEScientist-Bench(2609.09113) - 1 件 eval 邻接待建卡(R72 ⚠): SWE-Bench Pro Verified(2609.08149)—— 9-11 HF Daily 19▲ · paper_card 1308 9-11 入库确认
本轮 E1-R73 增量摘要: - 1 件 eval 专项 net-new paper_card(Sep 11 新入库): VDiff-Bench(2609.06245,细粒度图像差异识别 MLLM 诊断基准) - 1 件 eval 邻接 paper_card 补建确认: SWE-Bench Pro Verified(2609.08149,paper_card 1308 9-11 入库) - 2 件 Substack/工程化 eval 框架信号: The AI Engineer OWASP MCP Top 10 beta 安全评估 + Cameron Wolfe Agent Evals 综述 - 整体增量偏低——Sep 10-11 eval 专项 arXiv 新增 1 件(VDiff-Bench),信号密度较 Sep 9-10(2 件)略有下降
1. 增量条目(1 件 eval 专项 net-new + 1 件 eval 邻接补建 + 2 件 eval 框架信号)
增量 ① VDiff-Bench(2609.06245):MLLM 细粒度图像差异识别的挑战性诊断基准
- 来源: paper_card 1290(2026-09-11 OpenAlex backfill 入库,主分类 evaluation,形态 benchmark)+ HF Daily 9-11 30▲ + spark 9-11 agent e1prep §增量 1 提及 + Tom 9-11 0900 HF Daily #6 条目
- 要点: VDiff-Bench 提供针对性诊断基准,评估 MLLM 的比较视觉理解能力——即识别两张图之间的细粒度差异。现有的 VQA 基准(如 COCO Captioning、VQA-v2)只测单图理解,无法捕捉模型在"图对比"任务上的系统性失败。VDiff-Bench 填补这一空白,暴露标准单图 VL 任务看不见的能力缺口。形态 benchmark,OpenAlex 更新日期 2026-09-11(新鲜)
- 与活文档现有脉络的关系: 与 R72 §4 维度化指标体系(多模态评测维度)直接相关——VDiff-Bench 是 MLLM 比较视觉理解这一细分评测方向的专项 benchmark。与 Co-Evolving Harnesses(2609.09134,同属 evaluation 主分类)同属 eval 基础设施方向。eval.md R72 无此条目锚定
- 建议归入节: §4 维度化指标体系(MLLM 比较视觉理解评测维度)+ §6.132 候选区(VDiff-Bench 细粒度图像差异识别基准)
- 可信度: ★★★(paper_card 1290 已建,eval 主分类 benchmark;HF 30▲ 中等;OpenAlex 新鲜入库;TLDR 已富化 ✓)
- ⚠️ 待办: 核查该 benchmark 与现有 MLLM 评测框架(VLMEvalKit、MMBench 等)的覆盖对比;评估其是否在 MLLM 论文中被引用
增量 ② SWE-Bench Pro Verified(2609.08149):反作弊可靠代码 Agent 评测基准(补建确认)
- 来源: paper_card 1308(2026-09-11 入库,主分类 evaluation,形态 benchmark)+ HF Daily 9-11 19▲ + spark 9-11 agent e1prep §增量 1 + Stephen 9-11 1245 coord-check noon + Jay 9-11 engineering e1prep + Tom 9-10 radar 高价值条目(9-10 evaluation e1prep §增量 ③ 提及)
- 要点: 原版 SWE-Bench Pro 存在 Gold Solution 泄露 + 任务质量问题导致 Reward Hacking。Verified 版本引入反作弊安全机制 + 任务质量人工核验,构建可靠评测版本,阻止指标虚高。Claude Opus 4.6 在 SWE-Bench Pro Verified 上 56.8%(CSDN 工程化指南引)+ GPT-6 Astra 使用 custom Provider Adapter harness($19K)得 99.9% vs 默认 harness($26K)得 62.7%——37 个百分点差距来自 harness 设计而非模型能力。
- 与活文档现有脉络的关系: 与 R72 §4 维度化指标体系(Agent 代码能力评测)直接相关。与 Closing the Consistency Gap(同属一致性/可靠性方向)呼应。与 EVOHarnessBENCH(harness 演进评测)形成"harness 设计影响 benchmark 公平性"的新维度。eval.md R72 待锚定
- 建议归入节: §4 维度化指标体系(Agent 代码能力反作弊评测)+ §6.132 候选区(SWE-Bench Pro Verified 反作弊基准)+ §2.6 评测方法学(harness 公平性)
- 可信度: ★★★★(paper_card 1308 ✓ 9-11 入库 + HF 19▲ + Claude Opus 4.6 56.8% 实测数据 + GPT-6 Astra 99.9% vs 62.7% 37pp harness 差距;TLDR 已富化 ✓)
- ⚠️ 待办: 追踪 SWE-Bench Pro Verified 与 SWE-bench ProMax(2608.09802)的关系——后者是否预备升档
增量 ③ OWASP MCP Top 10 Beta:首个 tool-connected agents 安全评估清单
- 来源: Jay 9-11 0941 ai-engineering-rag-mlops.md(The AI Engineer Substack)+ Stephen 9-11 1245 coord-check noon §增量 提及
- 要点: The AI Engineer 发布首个 MCP(Model Context Protocol)安全评估清单——OWASP MCP Top 10 beta,列出 tool-connected agents 的 10 类主要安全风险。这是首个将 MCP 安全评估标准化的公开清单,与"评测 agent"直接相关(评测安全 = eval 的重要子类)。该清单覆盖:prompt 注入、工具权限滥用、上下文污染、状态持续性攻击、第三方依赖风险等。v1 → v2 → 2026 演进三轴已锚。
- 与活文档现有脉络的关系: 与 R72 AgentAudit(十维全链路信任评估框架)中的"安全性"维度形成互补——前者是通用十维框架,后者是 MCP 专项安全清单。与 Sherlocks AI Agent Failure Stack(eval 循环缺失)同属 agent 安全/可靠性方向。eval.md R72 无此条目锚定
- 建议归入节: §4 维度化指标体系(Agent 安全评测 OWASP MCP Top 10)+ §6.132 候选区(OWASP MCP Top 10 beta 安全清单)
- 可信度: ★★★(OWASP 是 Web 安全领域权威组织;The AI Engineer 是高影响力工程媒体;beta 版本尚未最终确定)
- ⚠️ 待办: 追踪 OWASP MCP Top 10 正式版发布时间;核查 10 类安全风险的分类是否已公开发布
增量 ④ Cameron Wolfe Agent Evals:Agent 评测方法论系统性综述信号
- 来源: flyp 9-11 1000 rss-cameron-wolfe.md(Nathan Lambert's Interconnects 引用 Cameron Wolfe 研究)+ flyp 9-11 multimodal e1prep 提及
- 要点: Cameron Wolfe(Oxen AI)在 RSS 中提及 Agent Evals 方法论综述——涉及如何系统性评估 agent 的规划、记忆、工具使用多维度能力。这与 R72 Co-Evolving Harnesses and Models(on-policy correction)+ AgentAudit(全链路十维评估)构成方法论互补:Co-Evolving 是"如何通过评测驱动模型改进",AgentAudit 是"评测什么维度",Agent Evals 是"如何系统化设计评测流程"。RSS 信号,非独立 arXiv。
- 与活文档现有脉络的关系: 与 R72 §2.6 评测方法学(53-57 例预备承接)形成方法论体系补充——Cameron Wolfe 的 Agent Evals 方法论可为评测设计流程提供参考。与 Co-Evolving Harnesses(2609.09134)+ AgentAudit(2609.09875)同属方法论方向。eval.md R72 无此条目锚定
- 建议归入节: §2.6 评测方法学(Agent Evals 系统性评测设计)+ §6.132 候选区(Cameron Wolfe Agent Evals 综述信号)
- 可信度: ★★(RSS 信号,非独立 arXiv;具体 paper 引用未在 RSS 中明确;待溯源)
- ⚠️ 待办: 溯源 Cameron Wolfe Agent Evals 是否有独立博客文章或 arXiv;如无 arXiv 作为工程实践信号处理
2. Sep 10-11 paper_cards eval 相关新卡核查
Sep 10-11 新增 eval 主分类卡(3 件)
| 编号 | arXiv | 标题 | 形态 | 与 eval.md 关系 |
|---|---|---|---|---|
| 1293-2609.04280 | 2609.04280 | EVOHarnessBENCH | benchmark | R72 已锚(harness 演进评测) |
| 1296-2609.09875 | 2609.09875 | AgentAudit | benchmark | R72 已锚(全链路十维评估) |
| 1299-2609.09134 | 2609.09134 | Co-Evolving Harnesses and Models | method | R72 已锚(on-policy correction) |
Sep 10-11 新增 eval 邻接卡(主分类非 eval,eval 相关)
| 编号 | arXiv | 标题 | 主分类 | 与 eval 关系 |
|---|---|---|---|---|
| 1288-2609.08832 | 2609.08832 | Closing the Consistency Gap | agent | R72 已锚(benchmark 形态,24pp 一致性缺口) |
| 1298-2609.09113 | 2609.09113 | SAEScientist-Bench | agent | R72 已锚(benchmark 形态) |
| 1290-2609.06245 | 2609.06245 | VDiff-Bench | benchmark | R73 净增(MLLM 比较视觉理解诊断) |
| 1300-2609.09219 | 2609.09219 | Discovery Cert Protocol | agent | agent主分类,eval 邻接(AI 研究 Agent 审计) |
| 1302-2609.05779 | 2609.05779 | Diffs vs. Whole Files | benchmark | R72 已锚(Flutter/Dart 编码 Agent 实证) |
| 1308-2609.08149 | 2609.08149 | SWE-Bench Pro Verified | benchmark | R73 补建确认(反作弊代码 Agent 评测) |
注: Sep 10-11 eval 专项 paper_card 净增 1 件(VDiff-Bench),较 Sep 9-10(2 件 EVOHarnessBENCH + Closing Consistency Gap)略有下降。SWE-Bench Pro Verified paper_card 1308 于 9-11 入库,确认 R72 遗留建卡任务完成。
3. 矛盾与待核实
矛盾 ① Compile by Training 信号断裂(第 3 次确认)
- Sep 8 HF Daily #1 374▲ → Sep 9 无记录 → Sep 10 无记录 → Sep 11 HF Daily 仍无
- 持续时间: 已连续 3 日无记录——信号消失非采样波动,R72 锚定"极显著续立"已被持续推翻
- 建议: 在 evaluation.md 中将 Compile by Training 降级为"⚠ 信号衰减待核实";不再作为 eval 专项锚定条目
矛盾 ② VDiff-Bench 票数与影响力不匹配
- HF Daily Sep 11 30▲(排名 #6),但 S2/ OpenAlex 引用均为 0
- 可能原因: Sep 11 OpenAlex backfill 是首次入库,引用尚未爬取
- 建议: 观察 Sep 12-13 是否出现引用数据;如持续 0 引用,评估其为新生工作尚未传播
矛盾 ③ Cameron Wolfe Agent Evals 溯源不完整
- flyp RSS 9-11 提及 Cameron Wolfe Agent Evals,但无独立 arXiv 或博客链接
- 建议: 在 9-12 早棒前尝试溯源;如无独立来源,降级为"RSS 信号待核实"
4. 可引用 arXiv 号列表
本轮 eval 专项 net-new(1 件): - 2609.06245 — VDiff-Bench(paper_card 1290 ✓ · eval 主分类 · benchmark · 30▲)
本轮 eval 邻接 net-new 补建确认(1 件): - 2609.08149 — SWE-Bench Pro Verified(paper_card 1308 ✓ 9-11 入库 · eval 主分类 · benchmark · 反作弊机制)
R72 沿用 eval 专项(3 件): - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓) - 2609.09875 — AgentAudit(paper_card 1296 ✓) - 2609.09134 — Co-Evolving Harnesses and Models(paper_card 1299 ✓)
R72 沿用 eval 邻接(2 件): - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓) - 2609.09113 — SAEScientist-Bench(paper_card 1298 ✓)
R72 沿用 eval 邻接 benchmark(1 件): - 2609.05779 — Diffs vs. Whole Files(paper_card 1302 ✓)
待核实(1 件 ⚠): - 2609.04199 — Compile by Training(⚠ 信号断裂第 3 次确认,建议降级)
5. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| eval 专项 net-new paper_card | 1 | ① VDiff-Bench(2609.06245) |
| eval 邻接补建确认 | 1 | ② SWE-Bench Pro Verified(2609.08149,paper_card 1308 ✓) |
| eval 框架信号(非 arXiv) | 2 | ③ OWASP MCP Top 10 beta + ④ Cameron Wolfe Agent Evals |
| 信号待核实 | 1 | ⚠ Compile by Training 信号断裂(第 3 次确认) |
| 合计净增量 | 4 | ①-④(4 件 eval 相关)+ ⚠ 信号核实(1 件) |
arXiv 号数量: 1 件本轮新增 eval 专项(VDiff-Bench)+ 1 件 eval 邻接补建确认(SWE-Bench Pro Verified)+ 3 件 R72 沿用 eval 专项(EVOHarnessBENCH + AgentAudit + Co-Evolving Harnesses)+ 2 件 R72 沿用 eval 邻接(Closing Consistency Gap + SAEScientist-Bench)+ 1 件 R72 沿用 eval 邻接 benchmark(Diffs vs. Whole Files)+ 1 件 ⚠ 待降级(Compile by Training)= 8 件(6 件可用 + 1 件补建完成 + 1 件待降级)
6. 检查过的来源清单
已确认无 eval 专项新增量的来源(如实说明): - Stephen 9-11 inbox(X vip radar + OpenAI/Anthropic/DeepMind news;主轴 frontier lab + VLMs;eval 邻接有 CursorBench 73.4%(Anthropic 发布)+ Gemini 3.8 Flash SWE 自动漏洞修补;无 eval 专项净增) - Jay 9-11 inbox(engineering e1prep + engineering filter;主轴工程实践;eval 相关有 OWASP MCP Top 10 beta(已锚入增量 ③)+ InferenceBench(已在 engineering.md v120);eval 专项无独立净增) - flyp 9-11 inbox(multimodal e1prep + Show-Harness critical read;主轴 multimodal;eval 相关有 Cameron Wolfe Agent Evals RSS 信号(已锚入增量 ④);无 eval 专项净增) - spark 9-11 inbox(agent e1prep;主轴 agent;eval 相关有 VDiff-Bench + SWE-Bench Pro Verified(均已在增量 ① ② 锚入);无独立 eval 专项净增) - work-queue.md(2026-09-11 12:00;待建卡 4 件含 VDiff-Bench 2609.06245;0 件待更新主题活文档;选题榜 1 件) - paper_cards Sep 10-11 新卡核查(eval 主分类 3 件 EVOHarnessBENCH + AgentAudit + Co-Evolving Harnesses;eval邻接 6 件 Closing Consistency Gap + SAEScientist-Bench + VDiff-Bench + Discovery Cert + Diffs vs. Whole + SWE-Bench Pro Verified)
本轮实际处理的新增来源: - ✅ Tom 9-11 0900 HF Daily 2026-09-11.md(15 篇;VDiff-Bench 30▲ + SWE-Bench Pro Verified 19▲ + SAEScientist 16▲ + Discovery Cert 15▲) - ✅ Jay 9-11 0941 ai-engineering-rag-mlops.md(OWASP MCP Top 10 beta) - ✅ flyp 9-11 1000 rss-cameron-wolfe.md(Agent Evals 综述信号) - ✅ spark 9-11 agent e1prep(VDiff-Bench + SWE-Bench Pro Verified + AgentAudit + SAEScientist 锚入确认) - ✅ Stephen 9-11 1245 coord-check noon(eval 相关跨实例对账) - ✅ evaluation.md R72 基线(R72 锚定 5 件 eval专项 + 2 件 eval邻接 + 候选二十角) - ✅ paper_cards Sep 10-11 新卡核查(1290 VDiff-Bench ✓ + 1308 SWE-Bench Pro Verified ✓ + 1296 AgentAudit ✓ + 1299 Co-Evolving Harnesses ✓)
7. 无显著新增量时的如实说明
本轮 eval 专项净增 1 件(VDiff-Bench),信号密度较 Sep 9-10(2 件 EVOHarnessBENCH + Closing Consistency Gap)略有下降。eval 邻接补建 1 件(SWE-Bench Pro Verified paper_card 1308 9-11 入库)。eval 框架信号 2 件(OWASP MCP Top 10 beta + Cameron Wolfe Agent Evals,均为非 arXiv 来源)。Compile by Training 信号断裂第 3 次确认是本轮最大警示信号——已连续 3 日无 HF Daily 记录,R72 锚定应降级。整体增量偏低,无颠覆性新方向;eval 领域 9 月上旬信号以已有 benchmark 续立为主,新 benchmark 出现频率下降。
Tom · 2026-09-11 15:40 CST · E1 预消化 · evaluation · R73 窗口覆盖完成 · 1 件 eval 专项 net-new paper_card(VDiff-Bench 2609.06245)+ 1 件 eval 邻接补建确认(SWE-Bench Pro Verified 2609.08149 paper_card 1308 ✓)+ 2 件 eval 框架信号(OWASP MCP Top 10 beta + Cameron Wolfe Agent Evals)+ ⚠ 1 件信号待降级(Compile by Training 信号断裂第 3 次确认)· VDiff-Bench(R73 核心 eval 净增)+ SWE-Bench Pro Verified(补建确认)+ OWASP MCP Top 10 beta(首个 tool-connected agents 安全评估清单)+ Cameron Wolfe Agent Evals(方法论综述信号)+ Compile by Training 信号断裂是本轮最大警示信号