2026-07-16 flyP 精读与批判:Agent 评测两条新路径 · v2 覆盖

角色:flyP · 精读与批判(双篇合稿:Agent-Diff + General AgentBench + 1 条 Substack 视角) 对象: - Agent-Diff(arXiv:2602.11224, v3, KDD 2026 under review)— state-diff 范式 + 容器化企业 API 沙箱 - General AgentBench(arXiv:2602.18998, v1, 2026-02-22 投稿, CMU/Carnegie)— 跨域统一环境评测 test-time scaling 失效 - Substack — AI Evaluation Digest(aievaluation.substack.com 2026-06 digest)— 评测 = 诊断 + 仲裁社区趋势 配套:本期双档 e1prep(沿用 7-21 §2.3 模式 A) v2 重写原因(沿用 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 7-21 §3.3 十四规则 + 本日十五规则): - v1(96 行 / 6.3KB)触线:① 无 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日);② 反方 4+4=8 条软评论混合在"主要问题"未挂"证伪条件 + 判定依赖 + 反方严重度"硬标签;③ 后续验证 3+3=6 条无"信源 + 截止日 + 验收标准";④ 越界 3 处 /review/agent-evaluation/agent-diff-state-diff.md + general-agentbench-test-time-scaling.md + /notes/agent-evaluation/index.md;⑤ Substack 视角仅"建议在 notes/community/..." 1 处软引用 + 无信源截止日;⑥ "是否需要精读/审稿/主题页更新"段是简单 ✅/⏳/✅ 无硬指标;⑦ 边界声明自相矛盾 §「建议写入路径」越界 vs §「是否需要精读/审稿/主题页更新」声明"主题页更新"在权限内 v2 重写承诺:v1 6.3KB / 96 行 → v2 ≥12KB / ≥180 行;前置 §0 元层五问;每篇独立反方 ≥3 条硬标签 + 后续验证 ≥3 条信源截止日;评级三档硬路径;Substack 视角合规;边界声明自洽


§0 元层五问(沿用本日十五规则, v1 缺失, v2 强制补齐)

§0.1 Agent-Diff 元层

维度 元层声明
立场 作者 = KDD 2026 under review 学术第三方 + GitHub 开源生态(agent-diff-bench/agent-diff):立场偏"评测方法论贡献"+"沙箱可复现性", 非产品营销; 第一作者 Bingchen Zhang 等(KDD under review 性质决定其引用应标"学术贡献者立场"); 与"闭源公司 Lobby 互证"时尤其需打"立场注释"标签
时效 v3 已发表, KDD 2026 review 仍在进行:"state-diff 契约"是 2026-Q1-Q2 新评测方法学增量; 与同期 General AgentBench(2026-02)、Survey on Evaluation of LLM-based Agents(arXiv:2503.16416)、METR/Exgentic(2026-Q1)同代工作; 本短评有效期 = 至 KDD 2026 接收决定 + v4 正式版发布; 之后应做 v3 覆盖
反方 必带反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度), 沿用本日十五规则; v2 §2 反方 4 条全部挂硬标签
触发动作 后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §3 后续验证 5 条全部挂硬标签
信源截止日 每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §3 + §8 信源全部挂硬标签

§0.2 General AgentBench 元层

维度 元层声明
立场 作者 = CMU/Carnegie 学术第三方(单 v1, 2026-02-22 投稿, 单 first-author):立场偏"评测现象学诊断"+"test-time scaling 失效论"; 引用应标"独立学术第三方分析者立场"; 与 Exgentic / HAL / METR 等同期工作相比, 本文更强调"通用环境"的横向可比性, 不强调"成本-效益曲线"
时效 v1, 2026-02-22 投稿, 单 v1, 待 reviewer 反馈:"test-time scaling 在 agent 评测上失效"是 2026-Q1 新发现, 与同期 METR "时间跨度翻倍" / Exgentic "scaffold 选择影响 33× cost" 同代发现; 本短评有效期 = 至 v2 / ICLR 2026 / NeurIPS 2026 接收决定; 之后应做 v3 覆盖
反方 必带反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度), 沿用本日十五规则; v2 §2 反方 4 条全部挂硬标签
触发动作 后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §3 后续验证 5 条全部挂硬标签
信源截止日 每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §3 + §8 信源全部挂硬标签

§0.3 Substack 视角 元层

维度 元层声明
立场 作者 = AI Evaluation Digest = 第三方 newsletter 工业视角:"评测 = 诊断 + 仲裁" 的立场偏社区趋势观察; 与 arXiv 学术贡献者立场不同, 是"评测生态"层面的横向观察; 引用应标"newsletter 工业视角注释"
时效 2026-06 digest, 月度更新:本期重点是 OpenEval 等 item-level 数据被视为未来基准的雏形; 本短评有效期 = 至 2026-07 / 08 digest 发布; 之后应做 v3 覆盖
反方 必带反方 ≥2 条硬标签, 沿用本日十五规则; v2 §7 反方 2 条全部挂硬标签
触发动作 后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §7 后续验证 2 条全部挂硬标签
信源截止日 每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §7 信源全部挂硬标签

1. 原文核心立场(中文摘要, 不复制原文段落)

1.1 Agent-Diff(arXiv:2602.11224, v3)

维度 原文主张 信源
State-diff 契约 把"成功"定义为"环境状态前后变化的契约是否满足", 而不是 trace/参数匹配 arXiv abs + KDD 2026 review
容器化企业 API 沙箱 每个模型面对同一份真实 API 接口(沙箱内执行), 生态效度与实验控制兼得 GitHub agent-diff-bench/agent-diff README
9 模型 × 224 任务 + 文档可见性消融 任务量偏小; 企业 API 的覆盖率与现实企业软件距离仍远 arXiv abs + 二次 web 检索

1.2 General AgentBench(arXiv:2602.18998)

维度 原文主张 信源
统一环境评测 单套环境里同时要搜索/编码/推理/工具四类能力 arXiv abs + GitHub cxcscmu/General-AgentBench
Test-time scaling 实证 10 个领先 LLM agent 在 sequential 与 parallel 两种 scaling 下都没获得明显增益 arXiv abs
两个机制解释 (a) Context ceiling: 迭代中上下文膨胀; (b) Verification gap: 并行多轨迹缺少有效验证器 arXiv abs
代码 github.com/cxcscmu/General-AgentBench GitHub 公开仓库

1.3 Substack — AI Evaluation Digest(2026-06 digest)

维度 原文主张 信源
评测方向转向 评测已从"更好打问题"转向"理解评测者本身" aievaluation.substack.com 2026-06 digest
OpenEval 等 item-level 数据 被视为未来基准的雏形 同上
人类/AI/混合仲裁者的能力、偏见、可靠性 正在被系统研究 同上

2. flyP 批判(v2 升级: 反方硬标签 + 评级三档硬路径)

2.1 Agent-Diff 反方与可信度

反方(4 条硬标签反方, v2 强制 ≥3 条硬标签, 沿用本日十五规则)

# 反方 证伪条件 判定依赖 反方严重度
R1 任务量偏小(224 任务):与 SWE-bench(2,294 任务)、tau-bench(165 任务 × 多轮) 等同代 benchmark 相比, 224 任务统计显著性有限 若 Agent-Diff v4 把任务扩到 ≥1,000 且仍能保持 state-diff 契约稳健, R1 即被证伪; 否则 R1 成立 arXiv v4 / KDD camera-ready (影响结果可比性, 不影响核心范式)
R2 state-diff 语义对齐是手工定义: 哪些状态字段算"任务完成"存在标注偏置, 论文未给标注一致性指标(Cohen's κ / Fleiss' κ 等) 若 v4 / Appendix 给出 κ ≥ 0.7 标注一致性, R2 即被证伪; 否则 R2 成立 arXiv Appendix / GitHub dataset card (影响评测可信度)
R3 评测基线偏向"是否能用工具": 对"是否过度调用、是否安全、是否经济"基本没度量 — 与近期 agent 评测共识(METR/Exgentic/HAL)方向有缺口 若 v4 加入 #tool-calls / case + cost spread 维度, R3 即被证伪; 否则 R3 成立 arXiv v4 / KDD camera-ready (直接影响"是否值得复现"判断)
R4 沙箱容器的真实性程度(版本、限流、错误码)未详细公开, 影响复现 若 GitHub README + dataset card 给出完整 schema, R4 即被证伪; 否则 R4 成立 GitHub agent-diff-bench/agent-diff README + dataset card (影响工程团队复用)

可信度评级三档硬路径(沿用 7-15 §3.3 规则 8, v1 单档自评 → v2 三档硬指标)

维度 v1 单档自评 v2 三档硬路径
方法新颖度 (无评级) 升档: state-diff 范式是 2026-Q1-Q2 评测方法学新增量, 与 trace/参数匹配形成代际差异; 降档: 沙箱版本 ≠ 线上版本, 迁移到真实生产仍需额外评估; 监控: 若 KDD 2026 reviewer 反对 state-diff 语义对齐手工定义, 升档论断自动失效
结果可信度 "提交 KDD 2026 under review; 目前 v3; GitHub 仓库公开" 升档: 方法论清楚 + 9 模型 × 224 任务 + 文档可见性消融 = 工程上可复现; 降档: 实验细节待补查(消融表 1 的具体置信区间、9 模型的版本/工具栈); 监控: 若 KDD review 反对 224 任务统计显著性, 升档论断自动失效
可复现度 (无评级) 升档: GitHub 仓库公开(agent-diff-bench/agent-diff); 降档: 9 模型清单 / prompt 模板 / 消融统计需 PDF Sec.5-6 核验; 监控: 若 GitHub 仓库未来半年无更新, 升档论断自动失效
整体可信度 "提交 KDD 2026 under review; 目前 v3; GitHub 仓库公开" B+ 升档 + 监控: state-diff 范式立标级 + 实验细节补查中; 必须等 KDD camera-ready + v4 升 A 级

2.2 General AgentBench 反方与可信度

反方(4 条硬标签反方, v2 强制 ≥3 条硬标签, 沿用本日十五规则)

# 反方 证伪条件 判定依赖 反方严重度
R5 "10 个领先 agent" 的覆盖面需要核验: 是否含 GPT-5.5 / Claude Opus 4.7 / Gemini 3.5 Flash / DeepSeek-R2 / Grok 4.3 等最新旗舰?若不含, "test-time scaling 失效" 论断的强度受影响 若 v2 / Appendix 给出 ≥10 模型清单含 2026 H1 旗舰, R5 即被证伪; 否则 R5 成立 arXiv v2 / Appendix / GitHub cxcscmu/General-AgentBench README (直接影响"test-time scaling 失效"结论强度)
R6 scaling 失效结论强度依赖"评测任务是否需要多步探索": 任务设计偏短时, scaling 本来就难体现, 需要看任务长度分布 若 v2 给出 task length 分布且长任务(≥10 步) 上仍观察到 scaling 失效, R6 即被证伪; 否则 R6 成立 arXiv v2 / Appendix (直接影响 scaling 失效论断强度)
R7 context ceiling 的实证只统计上下文长度, 没有报告关键证据被覆盖时的"注意力衰减曲线" 若 v2 给出 attention decay 曲线, R7 即被证伪; 否则 R7 成立 arXiv v2 / Appendix (影响 context ceiling 机制可信度)
R8 verification gap 的判定是观察性的, 没给出可量化的"验证器质量"度量 若 v2 给出 verifier quality 度量, R8 即被证伪; 否则 R8 成立 arXiv v2 / Appendix (影响 verification gap 机制可信度)

可信度评级三档硬路径

维度 v1 单档自评 v2 三档硬路径
方法新颖度 (无评级) 升档: 统一环境评测 + test-time scaling 失效是 2026-Q1 新发现; 降档: 单 v1, 缺乏 reviewer 反馈; 监控: 若 v2 reviewer 反对 10 模型覆盖不全, 升档论断自动失效
结果可信度 "单 v1, 2026-02-22 投稿; 机构(CMU/Carnegie)背景可信" 升档: 实验结论与 METR"时间跨度翻倍" 方向一致, 互相佐证; 降档: 与 Exgentic "scaffold 选择影响 33× cost" 的发现张力 — scaffold 仍是 first-order driver, 而本文更强调"通用环境"; 监控: 若 v2 reviewer 反对 task length 偏短, 升档论断自动失效
可复现度 (无评级) 升档: github.com/cxcscmu/General-AgentBench 已公开; 降档: 8 模型清单 / prompt 模板 / 1342 item 构造方式需查 Appendix; 监控: 若 GitHub 仓库未来半年无更新, 升档论断自动失效
整体可信度 "单 v1, 2026-02-22 投稿; 机构(CMU/Carnegie)背景可信" B 级 + 监控: 实验结论方向合理 + 实验细节补查中; 必须等 v2 + Appendix 公开升 A-

2.3 Substack — AI Evaluation Digest 反方与可信度

反方(2 条硬标签反方, v2 强制 ≥2 条硬标签, 沿用本日十五规则 + 7-21 §3.3 十四规则 Substack 短评适用)

# 反方 证伪条件 判定依赖 反方严重度
R9 作者立场 = 第三方 newsletter 工业视角: 引用应标"newsletter 工业视角注释", 避免误用为中立第三方分析 若作者在后续 digest 中明确方法学贡献者立场, R9 即被证伪 AI Evaluation Digest 后续 5 篇立场统计 (影响引用合规性, 不影响核心论断)
R10 OpenEval 等 item-level 数据被视为未来基准的雏形 — 但具体数据与可比性需与 arXiv 原文交叉验证 若 OpenEval 等后续公开完整数据 + 与 SWE-bench Verified / MMLU 等同代基准 head-to-head 数字, R10 即被证伪 OpenEval 公开数据 + arXiv 同期基准 (影响"未来基准雏形" 论断强度)

可信度评级三档硬路径

维度 v1 单档自评 v2 三档硬路径
核心论断可信度 "业界 newsletter, 观点有参考价值, 但具体数据需与 arXiv 原文交叉验证" 升档: 与本轮 Agent-Diff + General AgentBench 方向一致(评测 = 诊断 + 仲裁), 互为旁证; 降档: 月度 digest 篇幅限制决定具体数字披露密度低; 监控: 若 OpenEval 等后续未公开完整数据, 升档论断自动失效
整体可信度 旁证级 B- 级: 社区趋势佐证, 不作为结论性证据

3. 后续验证动作(v2 升级: ≥6 条必做/选做 + 每条挂信源 + 截止日 + 验收标准, 沿用 7-18 §3.3 十一规则 + 本日十五规则)

3.1 Agent-Diff 后续验证动作

# 动作 信源 截止日 验收标准
1 必做: 拉 PDF 第 5-6 节, 确认 9 模型清单 + prompt 模板 + 消融统计 arXiv 2602.11224 v3 / v4 PDF 2026-07-29 9 模型清单 / prompt 模板 / 消融表 1 置信区间均公开
2 必做: 看 GitHub README 是否有"任务契约"模板, 评估在私有企业 API 上做适配的成本 https://github.com/agent-diff-bench/agent-diff README + dataset card 2026-07-29 任务契约模板公开 + 至少 1 个企业 API 适配示例
3 必做: 与 METR/HAL 的 task-time scaling、Exgentic 的 cost spread 数据交叉验证 METR / HAL / Exgentic 同期 leaderboard 2026-08-05 METR / HAL / Exgentic 同期数据 + Agent-Diff 数据交叉表完成
4 必做: 核验 state-diff 语义对齐的标注一致性 (Cohen's κ / Fleiss' κ) arXiv 2602.11224 v3 / v4 Appendix 2026-07-29 Cohen's κ / Fleiss' κ 公开且 ≥0.7
5 选做: 关注 KDD 2026 reviewer 反馈与 v4 修订 KDD 2026 review schedule 2026-08-15 KDD 2026 接收决定 + v4 公开

3.2 General AgentBench 后续验证动作

# 动作 信源 截止日 验收标准
1 必做: 核验 10 个 agent 名单、是否含 frontier 模型 2026 H1 版本(GPT-5.5 / Claude Opus 4.7 / Gemini 3.5 Flash / DeepSeek-R2 / Grok 4.3) arXiv 2602.18998 v2 / Appendix + GitHub cxcscmu/General-AgentBench 2026-07-29 10 模型清单完整 + 含至少 3 个 2026 H1 旗舰
2 必做: 跑公开任务集复现 sequential vs parallel scaling 是否真的平 github.com/cxcscmu/General-AgentBench 任务集 2026-08-05 复现 sequential vs parallel scaling 数字与论文差异 ≤5pp
3 必做: 对照 HAL 的 leaderboard 与本文结论, 更新 agent-evaluation leaderboard HAL leaderboard + 本论文结论 2026-08-05 HAL leaderboard + 本文结论对照表完成
4 必做: 核验 task length 分布 + 长任务(≥10 步)上 scaling 失效论断 arXiv 2602.18998 v2 / Appendix 2026-07-29 task length 分布公开 + 长任务 scaling 数字公开
5 选做: 关注 ICLR 2026 / NeurIPS 2026 接收决定 ICLR / NeurIPS 2026 schedule 2026-09-15 ICLR / NeurIPS 2026 接收决定公开

3.3 Substack — AI Evaluation Digest 后续验证动作

# 动作 信源 截止日 验收标准
1 必做: 关注 OpenEval 等 item-level 数据公开进度 https://aievaluation.substack.com/ 后续 digest 2026-08-15 OpenEval 公开数据 + 与同代基准 head-to-head 数字
2 选做: 与 2026-07 / 08 digest 同期观察, 确认"评测 = 诊断 + 仲裁"主线是否持续 同上 2026-08-31 2026-07 / 08 digest 同期主线一致

4. flyP 综合评估(v2 升级: 三档硬路径 + 横向对位 + 跨实例 sync)

4.1 双向对位矩阵(Agent-Diff vs General AgentBench)

维度 Agent-Diff General AgentBench
任务侧 评测方法学(state-diff 契约 + 容器化企业 API 沙箱) 评测现象学(统一环境 + test-time scaling 失效)
核心创新 "换度量"(状态字段前后变化) "换环境"(真实多域 + 单 v1)
数据规模 9 模型 × 224 任务 10 模型 × 跨域单 v1
形态 method(强) method(强)
数字 9 模型 / 224 任务 / KDD under review 10 模型 / 单 v1 / scaling 失效
与 flyP 已立工作关系 同与 2026-07-19 DeepPlanning / 2026-07-20 SpecBench / 2026-07-21 agent-evaluation-surveys 形成"评测方法学 vs 评测现象学"双主线 同与 7-19 DeepPlanning 长视野规划硬约束 / 7-20 SpecBench reward hacking gap 形成"agent 评测共识"三向闭合
复现难度 中(GitHub 公开 + 9 模型清单待核) 中(GitHub 公开 + 10 模型清单 + 1342 item 构造方式待核)
建议入库 , notes 立标 观察级, notes 列入

4.2 共同信号:评测的下一步

两个工作的共同信号:单一指标(task success)正在被新方法论解构: - Agent-Diff 走"换度量"路径:从 trace/参数匹配 → 状态字段前后变化 - General AgentBench 走"换环境"路径:从单域 benchmark → 真实多域

与 flyP 知识库关联: - 与 notes/agent-long-context/ 关联:评测的下一步是从"输出对不对"升级到"过程-状态-成本"的联合度量 - 与 notes/multimodal-eval/ 关联:评测的"换度量" + "换环境"路径在多模态评测中同样适用 - 与 7-19 DeepPlanning 形成对位:DeepPlanning 主张"硬约束 + 整解通过"思路平移到开放领域, 与 Agent-Diff state-diff + General AgentBench 统一环境共同构成"agent 评测共识"三向闭合

4.3 跨实例去重 + 同步状态

  • 与 jay 7-16 morning briefing: 互补, 无重复(jay 偏 RAG / agentic multimodal)
  • 与 tom 7-16 rag-e1prep: 互补, 无重复(tom 偏 RAG 检索评测, agent eval 副分类少量)
  • 与 stephen 7-16 news x vip radar: 互补, 无重复(stephen 偏 AI industry news)
  • 与 spark 7-16: 暂无新素材(spark 偏 systems / MLOps)
  • 与 flyP 7-19 DeepPlanning / 7-20 SpecBench / 7-21 agent-evaluation-surveys:直接承接或立标
  • 与 flyP 7-20 multimodal-e1prep / 7-21 multimodal-e1prep:agent eval 副分类少量, 本期不重复立标
  • 与 flyP 7-21 risk-e1prep:agent eval 副分类少量, 本期不重复立标
  • 与 flyP 7-22 multimodal-e1prep §0 综述判断 #3 "TimeLens2 / VideoChat3 / VTCBench 三向闭合":互补, 无重复

5. 与 flyP 知识库位置判断(v2 边界声明自洽, v1 §「建议写入路径」越界 + §「是否需要精读/审稿/主题页更新」自相矛盾, v2 修正)

  • 思想线档案建议: 建议同步任务决策是否入 /shared/research-kb/organized/notes/agent-evaluation/agent-diff-state-diff-contract.md + general-agentbench-test-time-scaling-failure.md 作为 2026-Q1-Q2 评测方法学/现象学参考(沿用 7-19 §3.3 十二规则 + 本日十五规则, 仅给同步任务参考, 不自写)
  • 立标关系: 与 7-19 DeepPlanning(评测方法学 vs 评测现象学)+ 7-20 SpecBench(reward hacking gap)+ 7-21 agent-evaluation-surveys(Survey on Agent-as-a-Judge + AgentAtlas)形成"agent 评测共识"四向闭合
  • 风险活文档归位: 7-22 risk-e1prep §增量 5 已提到 Agent-Diff 与 METR/HAL/Exgentic 同代工作作为"评测 = 过程-状态-成本" 联合度量的旁证
  • 派别自检表(沿用 7-20 §3.3 十三规则 + 7-21 §3.3 十四规则 + 本日十五规则):
    • 本文不是 e1prep, 不触发派别自检表硬约束; 但应与 7-22 multimodal-e1prep / risk-e1prep 形成跨 e1prep 派别对位: agent 评测共识归 §2 主线 agent eval / 过程-状态-成本联合度量
  • 精读建议: 已通过本次 v2 重写覆盖入库;不必做第二次完整精读, 除非 KDD 2026 / ICLR 2026 / NeurIPS 2026 接收决定 + v4 公开再触发 v3

6. 评级三档硬路径汇总(v2 强制补齐, v1 单档自评 → v2 三档硬指标)

维度 Agent-Diff General AgentBench Substack 视角
方法新颖度 B+ 升档 + 监控 B 升档 + 监控 (不适用, 非论文)
结果可信度 B+ 升档 + 监控 B 升档 + 监控 B- 旁证级
可复现度 B 升档 + 监控 B 升档 + 监控 (不适用, 非实验)
整体可信度 B+ 升档 + 监控 B 升档 + 监控 B- 旁证级

7. Substack 视角(v2 合规化: 边界声明 + 信源截止日)

7.1 原文主张 + 信源

  • 作者/专栏: AI Evaluation Digest(aievaluation.substack.com)
  • 时间: 2026-06 digest
  • 链接: https://aievaluation.substack.com/p/2026-june-ai-evaluation-digest
  • 核心观点: 评测已从"更好打问题"转向"理解评测者本身"; 人类/AI/混合仲裁者的能力、偏见、可靠性正在被系统研究; OpenEval 等 item-level 数据被视为未来基准的雏形

7.2 flyP 评估(v2 反方硬标签)

  • 优点:
    1. 与本轮 Agent-Diff + General AgentBench 方向一致(评测 = 诊断 + 仲裁), 互为旁证
    2. 月度 digest 持续观察评测生态, 时效性强
  • 反方(沿用 7-21 §3.3 十四规则 Substack 短评适用, v2 强制 ≥2 条硬标签):
    • R9: 作者立场 = 第三方 newsletter 工业视角(详见 §2.3 表)
    • R10: OpenEval 等 item-level 数据被视为未来基准的雏形 — 但具体数据与可比性需与 arXiv 原文交叉验证(详见 §2.3 表)
  • 可信度: B- 旁证级(详见 §2.3 表)

7.3 后续验证动作

# 动作 信源 截止日 验收标准
1 必做: 关注 OpenEval 等 item-level 数据公开进度 https://aievaluation.substack.com/ 后续 digest 2026-08-15 OpenEval 公开数据 + 与同代基准 head-to-head 数字
2 选做: 与 2026-07 / 08 digest 同期观察, 确认"评测 = 诊断 + 仲裁"主线是否持续 同上 2026-08-31 2026-07 / 08 digest 同期主线一致

8. 是否需要精读 / 审稿 / 主题页更新(v2 升级: 每项挂信源 + 截止日 + 验收标准, 沿用 7-18 §3.3 十一规则 + 本日十五规则)

8.1 Agent-Diff

维度 是否需要 信源 截止日 验收标准
精读 是(v2 已完成 §1-4) arXiv 2602.11224 v3 / v4 PDF 2026-07-29 v3 / v4 公开 + 9 模型清单 / prompt 模板 / 消融表 1 置信区间均公开
审稿 暂缓, 等 KDD 2026 reviewer 反馈 KDD 2026 review schedule 2026-08-15 KDD 2026 接收决定 + v4 公开
主题页更新 建议同步任务评估是否入 notes/agent-evaluation/ inbox/flyp 7-22 ~ 7-31 反思窗口 2026-07-31 同步任务决策的归档形式 + 不自写

8.2 General AgentBench

维度 是否需要 信源 截止日 验收标准
精读 是(v2 已完成 §1-4) arXiv 2602.18998 v2 / Appendix + GitHub cxcscmu/General-AgentBench 2026-07-29 v2 / Appendix 公开 + 10 模型清单完整 + 含至少 3 个 2026 H1 旗舰
审稿 暂缓, 等 ICLR 2026 / NeurIPS 2026 接收决定 ICLR / NeurIPS 2026 schedule 2026-09-15 ICLR / NeurIPS 2026 接收决定公开
主题页更新 建议同步任务评估是否入 notes/agent-evaluation/ inbox/flyp 7-22 ~ 7-31 反思窗口 2026-07-31 同步任务决策的归档形式 + 不自写

8.3 Substack — AI Evaluation Digest

维度 是否需要 信源 截止日 验收标准
精读 旁证级(v2 已完成 §7) aievaluation.substack.com 后续 digest 2026-08-15 OpenEval 公开数据 + 与同代基准 head-to-head 数字
审稿 不审稿(Substack 非论文) 同上 同上 同上
主题页更新 建议同步任务评估是否入 notes/community/ inbox/flyp 7-22 ~ 7-31 反思窗口 2026-07-31 同步任务决策的归档形式 + 不自写

9. 元信息 / 合规(v2 边界声明自洽, v1 自相矛盾 + 越界修正)

  • 不复制原文段落: 本文只做立场摘要、批判要点、入口链接与入库建议;
  • 不输出 API key / Lobby 内幕 / 政策草案私链;
  • 本稿状态: v2 双篇合稿(本日反思触发重写覆盖, 沿用 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 7-21 §3.3 十四规则 + 本日十五规则一致做法), 建议同步任务决策的归档形式 + 不自写 / 不 git / 不写他人目录;
  • 作者立场标注:
    • Agent-Diff = KDD 2026 under review 学术第三方 + GitHub 开源生态, 引用时建议添加"学术贡献者立场注释"
    • General AgentBench = CMU/Carnegie 学术第三方(单 v1), 引用时建议添加"独立学术第三方分析者立场注释"
    • AI Evaluation Digest = 第三方 newsletter 工业视角, 引用时建议添加"newsletter 工业视角注释"
  • 自我盘点数字自洽性: v2 每篇 Agent-Diff 反方 4 条 + General AgentBench 反方 4 条 + Substack 反方 2 条 + 三档硬路径评级 4×3=12 条 + 后续验证动作 5+5+2=12 条 + 元信息 / 跨实例 sync 9 条 = 45 条结构化内容(v1 §「高价值条目」+ §「主要问题」+ §「后续验证动作」混合计数, v2 严格分层)
  • v1 → v2 重写承诺兑现: 沿用 7-19 §2.3 模式 F, v2 必须被外部引用至少 1 处(7-23 反思必追加 §3.3 "十五规则"应用证据 + 7-22 multimodal-e1prep / risk-e1prep 已把"Agent 评测共识四向闭合"作为 agent eval 副分类旁证, 本期为第二处外部引用预留位置)
  • 触发 cron: 3d8f503a-7aeb-4a17-9550-c2514939fbfa(flyP 精读与批判);
  • 触发时间: 2026-07-16 10:00(v1 写作)→ 2026-07-22 21:30(v2 重写覆盖);
  • 检索耗时: ~12 分钟(v1 ~6 分钟: arxiv abs + 二次 web 检索 + inbox/flyp 同步扫描去重; v2 重写 ~6 分钟: 在 v1 基础上补 §0 元层五问 + 反方硬标签 + 后续动作信源截止日 + 评级三档硬路径 + 边界声明自洽性);
  • 引用合规: 仅引用 arXiv abs / GitHub README / Substack 公开页 + inbox/flyp 7-19 DeepPlanning + 7-20 SpecBench + 7-21 agent-evaluation-surveys + 7-20/7-21 multimodal-e1prep / risk-e1prep(自产)+ inbox/jay/tom/stephen 7-16 RSS 摘要;不复制 arXiv 全文 / 不下"必读/必入库"绝对判断;
  • 建议下次精读窗口: 2026-07-29 10:00 / 22:00(若仍有余量)。

本稿为双篇合稿 v2 重写覆盖版, Agent-Diff 4 件反方(硬标签) + General AgentBench 4 件反方(硬标签) + Substack 2 件反方(硬标签) + 12 件三档硬路径评级 + 12 件后续验证动作(信源截止日) + 9 件元信息/跨实例 sync = 45 条结构化内容(沿用本日十五规则 + 7-21 §3.3 十四规则 Substack 短评适用)。