2026-07-16 flyP 精读与批判:Agent 评测两条新路径 · v2 覆盖
角色:flyP · 精读与批判(双篇合稿:Agent-Diff + General AgentBench + 1 条 Substack 视角)
对象:
- Agent-Diff(arXiv:2602.11224, v3, KDD 2026 under review)— state-diff 范式 + 容器化企业 API 沙箱
- General AgentBench(arXiv:2602.18998, v1, 2026-02-22 投稿, CMU/Carnegie)— 跨域统一环境评测 test-time scaling 失效
- Substack — AI Evaluation Digest(aievaluation.substack.com 2026-06 digest)— 评测 = 诊断 + 仲裁社区趋势
配套:本期双档 e1prep(沿用 7-21 §2.3 模式 A)
v2 重写原因(沿用 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 7-21 §3.3 十四规则 + 本日十五规则):
- v1(96 行 / 6.3KB)触线:① 无 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日);② 反方 4+4=8 条软评论混合在"主要问题"未挂"证伪条件 + 判定依赖 + 反方严重度"硬标签;③ 后续验证 3+3=6 条无"信源 + 截止日 + 验收标准";④ 越界 3 处 /review/agent-evaluation/agent-diff-state-diff.md + general-agentbench-test-time-scaling.md + /notes/agent-evaluation/index.md;⑤ Substack 视角仅"建议在 notes/community/..." 1 处软引用 + 无信源截止日;⑥ "是否需要精读/审稿/主题页更新"段是简单 ✅/⏳/✅ 无硬指标;⑦ 边界声明自相矛盾 §「建议写入路径」越界 vs §「是否需要精读/审稿/主题页更新」声明"主题页更新"在权限内
v2 重写承诺:v1 6.3KB / 96 行 → v2 ≥12KB / ≥180 行;前置 §0 元层五问;每篇独立反方 ≥3 条硬标签 + 后续验证 ≥3 条信源截止日;评级三档硬路径;Substack 视角合规;边界声明自洽
§0 元层五问(沿用本日十五规则, v1 缺失, v2 强制补齐)
§0.1 Agent-Diff 元层
| 维度 |
元层声明 |
| 立场 |
作者 = KDD 2026 under review 学术第三方 + GitHub 开源生态(agent-diff-bench/agent-diff):立场偏"评测方法论贡献"+"沙箱可复现性", 非产品营销; 第一作者 Bingchen Zhang 等(KDD under review 性质决定其引用应标"学术贡献者立场"); 与"闭源公司 Lobby 互证"时尤其需打"立场注释"标签 |
| 时效 |
v3 已发表, KDD 2026 review 仍在进行:"state-diff 契约"是 2026-Q1-Q2 新评测方法学增量; 与同期 General AgentBench(2026-02)、Survey on Evaluation of LLM-based Agents(arXiv:2503.16416)、METR/Exgentic(2026-Q1)同代工作; 本短评有效期 = 至 KDD 2026 接收决定 + v4 正式版发布; 之后应做 v3 覆盖 |
| 反方 |
必带反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度), 沿用本日十五规则; v2 §2 反方 4 条全部挂硬标签 |
| 触发动作 |
后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §3 后续验证 5 条全部挂硬标签 |
| 信源截止日 |
每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §3 + §8 信源全部挂硬标签 |
§0.2 General AgentBench 元层
| 维度 |
元层声明 |
| 立场 |
作者 = CMU/Carnegie 学术第三方(单 v1, 2026-02-22 投稿, 单 first-author):立场偏"评测现象学诊断"+"test-time scaling 失效论"; 引用应标"独立学术第三方分析者立场"; 与 Exgentic / HAL / METR 等同期工作相比, 本文更强调"通用环境"的横向可比性, 不强调"成本-效益曲线" |
| 时效 |
v1, 2026-02-22 投稿, 单 v1, 待 reviewer 反馈:"test-time scaling 在 agent 评测上失效"是 2026-Q1 新发现, 与同期 METR "时间跨度翻倍" / Exgentic "scaffold 选择影响 33× cost" 同代发现; 本短评有效期 = 至 v2 / ICLR 2026 / NeurIPS 2026 接收决定; 之后应做 v3 覆盖 |
| 反方 |
必带反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度), 沿用本日十五规则; v2 §2 反方 4 条全部挂硬标签 |
| 触发动作 |
后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §3 后续验证 5 条全部挂硬标签 |
| 信源截止日 |
每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §3 + §8 信源全部挂硬标签 |
§0.3 Substack 视角 元层
| 维度 |
元层声明 |
| 立场 |
作者 = AI Evaluation Digest = 第三方 newsletter 工业视角:"评测 = 诊断 + 仲裁" 的立场偏社区趋势观察; 与 arXiv 学术贡献者立场不同, 是"评测生态"层面的横向观察; 引用应标"newsletter 工业视角注释" |
| 时效 |
2026-06 digest, 月度更新:本期重点是 OpenEval 等 item-level 数据被视为未来基准的雏形; 本短评有效期 = 至 2026-07 / 08 digest 发布; 之后应做 v3 覆盖 |
| 反方 |
必带反方 ≥2 条硬标签, 沿用本日十五规则; v2 §7 反方 2 条全部挂硬标签 |
| 触发动作 |
后续验证动作每条挂"信源 + 截止日 + 验收标准", 沿用 7-18 §3.3 十一规则 + 本日十五规则; v2 §7 后续验证 2 条全部挂硬标签 |
| 信源截止日 |
每条信源必带"链接 + 截止日 + 验收标准", 沿用 7-19 §3.3 十二规则 + 本日十五规则; v2 §7 信源全部挂硬标签 |
1. 原文核心立场(中文摘要, 不复制原文段落)
1.1 Agent-Diff(arXiv:2602.11224, v3)
| 维度 |
原文主张 |
信源 |
| State-diff 契约 |
把"成功"定义为"环境状态前后变化的契约是否满足", 而不是 trace/参数匹配 |
arXiv abs + KDD 2026 review |
| 容器化企业 API 沙箱 |
每个模型面对同一份真实 API 接口(沙箱内执行), 生态效度与实验控制兼得 |
GitHub agent-diff-bench/agent-diff README |
| 9 模型 × 224 任务 + 文档可见性消融 |
任务量偏小; 企业 API 的覆盖率与现实企业软件距离仍远 |
arXiv abs + 二次 web 检索 |
1.2 General AgentBench(arXiv:2602.18998)
| 维度 |
原文主张 |
信源 |
| 统一环境评测 |
单套环境里同时要搜索/编码/推理/工具四类能力 |
arXiv abs + GitHub cxcscmu/General-AgentBench |
| Test-time scaling 实证 |
10 个领先 LLM agent 在 sequential 与 parallel 两种 scaling 下都没获得明显增益 |
arXiv abs |
| 两个机制解释 |
(a) Context ceiling: 迭代中上下文膨胀; (b) Verification gap: 并行多轨迹缺少有效验证器 |
arXiv abs |
| 代码 |
github.com/cxcscmu/General-AgentBench |
GitHub 公开仓库 |
1.3 Substack — AI Evaluation Digest(2026-06 digest)
| 维度 |
原文主张 |
信源 |
| 评测方向转向 |
评测已从"更好打问题"转向"理解评测者本身" |
aievaluation.substack.com 2026-06 digest |
| OpenEval 等 item-level 数据 |
被视为未来基准的雏形 |
同上 |
| 人类/AI/混合仲裁者的能力、偏见、可靠性 |
正在被系统研究 |
同上 |
2. flyP 批判(v2 升级: 反方硬标签 + 评级三档硬路径)
2.1 Agent-Diff 反方与可信度
反方(4 条硬标签反方, v2 强制 ≥3 条硬标签, 沿用本日十五规则)
| # |
反方 |
证伪条件 |
判定依赖 |
反方严重度 |
| R1 |
任务量偏小(224 任务):与 SWE-bench(2,294 任务)、tau-bench(165 任务 × 多轮) 等同代 benchmark 相比, 224 任务统计显著性有限 |
若 Agent-Diff v4 把任务扩到 ≥1,000 且仍能保持 state-diff 契约稳健, R1 即被证伪; 否则 R1 成立 |
arXiv v4 / KDD camera-ready |
中(影响结果可比性, 不影响核心范式) |
| R2 |
state-diff 语义对齐是手工定义: 哪些状态字段算"任务完成"存在标注偏置, 论文未给标注一致性指标(Cohen's κ / Fleiss' κ 等) |
若 v4 / Appendix 给出 κ ≥ 0.7 标注一致性, R2 即被证伪; 否则 R2 成立 |
arXiv Appendix / GitHub dataset card |
中(影响评测可信度) |
| R3 |
评测基线偏向"是否能用工具": 对"是否过度调用、是否安全、是否经济"基本没度量 — 与近期 agent 评测共识(METR/Exgentic/HAL)方向有缺口 |
若 v4 加入 #tool-calls / case + cost spread 维度, R3 即被证伪; 否则 R3 成立 |
arXiv v4 / KDD camera-ready |
高(直接影响"是否值得复现"判断) |
| R4 |
沙箱容器的真实性程度(版本、限流、错误码)未详细公开, 影响复现 |
若 GitHub README + dataset card 给出完整 schema, R4 即被证伪; 否则 R4 成立 |
GitHub agent-diff-bench/agent-diff README + dataset card |
中(影响工程团队复用) |
可信度评级三档硬路径(沿用 7-15 §3.3 规则 8, v1 单档自评 → v2 三档硬指标)
| 维度 |
v1 单档自评 |
v2 三档硬路径 |
| 方法新颖度 |
(无评级) |
升档: state-diff 范式是 2026-Q1-Q2 评测方法学新增量, 与 trace/参数匹配形成代际差异; 降档: 沙箱版本 ≠ 线上版本, 迁移到真实生产仍需额外评估; 监控: 若 KDD 2026 reviewer 反对 state-diff 语义对齐手工定义, 升档论断自动失效 |
| 结果可信度 |
"提交 KDD 2026 under review; 目前 v3; GitHub 仓库公开" |
升档: 方法论清楚 + 9 模型 × 224 任务 + 文档可见性消融 = 工程上可复现; 降档: 实验细节待补查(消融表 1 的具体置信区间、9 模型的版本/工具栈); 监控: 若 KDD review 反对 224 任务统计显著性, 升档论断自动失效 |
| 可复现度 |
(无评级) |
升档: GitHub 仓库公开(agent-diff-bench/agent-diff); 降档: 9 模型清单 / prompt 模板 / 消融统计需 PDF Sec.5-6 核验; 监控: 若 GitHub 仓库未来半年无更新, 升档论断自动失效 |
| 整体可信度 |
"提交 KDD 2026 under review; 目前 v3; GitHub 仓库公开" |
B+ 升档 + 监控: state-diff 范式立标级 + 实验细节补查中; 必须等 KDD camera-ready + v4 升 A 级 |
2.2 General AgentBench 反方与可信度
反方(4 条硬标签反方, v2 强制 ≥3 条硬标签, 沿用本日十五规则)
| # |
反方 |
证伪条件 |
判定依赖 |
反方严重度 |
| R5 |
"10 个领先 agent" 的覆盖面需要核验: 是否含 GPT-5.5 / Claude Opus 4.7 / Gemini 3.5 Flash / DeepSeek-R2 / Grok 4.3 等最新旗舰?若不含, "test-time scaling 失效" 论断的强度受影响 |
若 v2 / Appendix 给出 ≥10 模型清单含 2026 H1 旗舰, R5 即被证伪; 否则 R5 成立 |
arXiv v2 / Appendix / GitHub cxcscmu/General-AgentBench README |
高(直接影响"test-time scaling 失效"结论强度) |
| R6 |
scaling 失效结论强度依赖"评测任务是否需要多步探索": 任务设计偏短时, scaling 本来就难体现, 需要看任务长度分布 |
若 v2 给出 task length 分布且长任务(≥10 步) 上仍观察到 scaling 失效, R6 即被证伪; 否则 R6 成立 |
arXiv v2 / Appendix |
高(直接影响 scaling 失效论断强度) |
| R7 |
context ceiling 的实证只统计上下文长度, 没有报告关键证据被覆盖时的"注意力衰减曲线" |
若 v2 给出 attention decay 曲线, R7 即被证伪; 否则 R7 成立 |
arXiv v2 / Appendix |
中(影响 context ceiling 机制可信度) |
| R8 |
verification gap 的判定是观察性的, 没给出可量化的"验证器质量"度量 |
若 v2 给出 verifier quality 度量, R8 即被证伪; 否则 R8 成立 |
arXiv v2 / Appendix |
中(影响 verification gap 机制可信度) |
可信度评级三档硬路径
| 维度 |
v1 单档自评 |
v2 三档硬路径 |
| 方法新颖度 |
(无评级) |
升档: 统一环境评测 + test-time scaling 失效是 2026-Q1 新发现; 降档: 单 v1, 缺乏 reviewer 反馈; 监控: 若 v2 reviewer 反对 10 模型覆盖不全, 升档论断自动失效 |
| 结果可信度 |
"单 v1, 2026-02-22 投稿; 机构(CMU/Carnegie)背景可信" |
升档: 实验结论与 METR"时间跨度翻倍" 方向一致, 互相佐证; 降档: 与 Exgentic "scaffold 选择影响 33× cost" 的发现张力 — scaffold 仍是 first-order driver, 而本文更强调"通用环境"; 监控: 若 v2 reviewer 反对 task length 偏短, 升档论断自动失效 |
| 可复现度 |
(无评级) |
升档: github.com/cxcscmu/General-AgentBench 已公开; 降档: 8 模型清单 / prompt 模板 / 1342 item 构造方式需查 Appendix; 监控: 若 GitHub 仓库未来半年无更新, 升档论断自动失效 |
| 整体可信度 |
"单 v1, 2026-02-22 投稿; 机构(CMU/Carnegie)背景可信" |
B 级 + 监控: 实验结论方向合理 + 实验细节补查中; 必须等 v2 + Appendix 公开升 A- |
2.3 Substack — AI Evaluation Digest 反方与可信度
反方(2 条硬标签反方, v2 强制 ≥2 条硬标签, 沿用本日十五规则 + 7-21 §3.3 十四规则 Substack 短评适用)
| # |
反方 |
证伪条件 |
判定依赖 |
反方严重度 |
| R9 |
作者立场 = 第三方 newsletter 工业视角: 引用应标"newsletter 工业视角注释", 避免误用为中立第三方分析 |
若作者在后续 digest 中明确方法学贡献者立场, R9 即被证伪 |
AI Evaluation Digest 后续 5 篇立场统计 |
低(影响引用合规性, 不影响核心论断) |
| R10 |
OpenEval 等 item-level 数据被视为未来基准的雏形 — 但具体数据与可比性需与 arXiv 原文交叉验证 |
若 OpenEval 等后续公开完整数据 + 与 SWE-bench Verified / MMLU 等同代基准 head-to-head 数字, R10 即被证伪 |
OpenEval 公开数据 + arXiv 同期基准 |
中(影响"未来基准雏形" 论断强度) |
可信度评级三档硬路径
| 维度 |
v1 单档自评 |
v2 三档硬路径 |
| 核心论断可信度 |
"业界 newsletter, 观点有参考价值, 但具体数据需与 arXiv 原文交叉验证" |
升档: 与本轮 Agent-Diff + General AgentBench 方向一致(评测 = 诊断 + 仲裁), 互为旁证; 降档: 月度 digest 篇幅限制决定具体数字披露密度低; 监控: 若 OpenEval 等后续未公开完整数据, 升档论断自动失效 |
| 整体可信度 |
旁证级 |
B- 级: 社区趋势佐证, 不作为结论性证据 |
3. 后续验证动作(v2 升级: ≥6 条必做/选做 + 每条挂信源 + 截止日 + 验收标准, 沿用 7-18 §3.3 十一规则 + 本日十五规则)
3.1 Agent-Diff 后续验证动作
| # |
动作 |
信源 |
截止日 |
验收标准 |
| 1 |
必做: 拉 PDF 第 5-6 节, 确认 9 模型清单 + prompt 模板 + 消融统计 |
arXiv 2602.11224 v3 / v4 PDF |
2026-07-29 |
9 模型清单 / prompt 模板 / 消融表 1 置信区间均公开 |
| 2 |
必做: 看 GitHub README 是否有"任务契约"模板, 评估在私有企业 API 上做适配的成本 |
https://github.com/agent-diff-bench/agent-diff README + dataset card |
2026-07-29 |
任务契约模板公开 + 至少 1 个企业 API 适配示例 |
| 3 |
必做: 与 METR/HAL 的 task-time scaling、Exgentic 的 cost spread 数据交叉验证 |
METR / HAL / Exgentic 同期 leaderboard |
2026-08-05 |
METR / HAL / Exgentic 同期数据 + Agent-Diff 数据交叉表完成 |
| 4 |
必做: 核验 state-diff 语义对齐的标注一致性 (Cohen's κ / Fleiss' κ) |
arXiv 2602.11224 v3 / v4 Appendix |
2026-07-29 |
Cohen's κ / Fleiss' κ 公开且 ≥0.7 |
| 5 |
选做: 关注 KDD 2026 reviewer 反馈与 v4 修订 |
KDD 2026 review schedule |
2026-08-15 |
KDD 2026 接收决定 + v4 公开 |
3.2 General AgentBench 后续验证动作
| # |
动作 |
信源 |
截止日 |
验收标准 |
| 1 |
必做: 核验 10 个 agent 名单、是否含 frontier 模型 2026 H1 版本(GPT-5.5 / Claude Opus 4.7 / Gemini 3.5 Flash / DeepSeek-R2 / Grok 4.3) |
arXiv 2602.18998 v2 / Appendix + GitHub cxcscmu/General-AgentBench |
2026-07-29 |
10 模型清单完整 + 含至少 3 个 2026 H1 旗舰 |
| 2 |
必做: 跑公开任务集复现 sequential vs parallel scaling 是否真的平 |
github.com/cxcscmu/General-AgentBench 任务集 |
2026-08-05 |
复现 sequential vs parallel scaling 数字与论文差异 ≤5pp |
| 3 |
必做: 对照 HAL 的 leaderboard 与本文结论, 更新 agent-evaluation leaderboard |
HAL leaderboard + 本论文结论 |
2026-08-05 |
HAL leaderboard + 本文结论对照表完成 |
| 4 |
必做: 核验 task length 分布 + 长任务(≥10 步)上 scaling 失效论断 |
arXiv 2602.18998 v2 / Appendix |
2026-07-29 |
task length 分布公开 + 长任务 scaling 数字公开 |
| 5 |
选做: 关注 ICLR 2026 / NeurIPS 2026 接收决定 |
ICLR / NeurIPS 2026 schedule |
2026-09-15 |
ICLR / NeurIPS 2026 接收决定公开 |
3.3 Substack — AI Evaluation Digest 后续验证动作
| # |
动作 |
信源 |
截止日 |
验收标准 |
| 1 |
必做: 关注 OpenEval 等 item-level 数据公开进度 |
https://aievaluation.substack.com/ 后续 digest |
2026-08-15 |
OpenEval 公开数据 + 与同代基准 head-to-head 数字 |
| 2 |
选做: 与 2026-07 / 08 digest 同期观察, 确认"评测 = 诊断 + 仲裁"主线是否持续 |
同上 |
2026-08-31 |
2026-07 / 08 digest 同期主线一致 |
4. flyP 综合评估(v2 升级: 三档硬路径 + 横向对位 + 跨实例 sync)
4.1 双向对位矩阵(Agent-Diff vs General AgentBench)
| 维度 |
Agent-Diff |
General AgentBench |
| 任务侧 |
评测方法学(state-diff 契约 + 容器化企业 API 沙箱) |
评测现象学(统一环境 + test-time scaling 失效) |
| 核心创新 |
"换度量"(状态字段前后变化) |
"换环境"(真实多域 + 单 v1) |
| 数据规模 |
9 模型 × 224 任务 |
10 模型 × 跨域单 v1 |
| 形态 |
method(强) |
method(强) |
| 数字 |
9 模型 / 224 任务 / KDD under review |
10 模型 / 单 v1 / scaling 失效 |
| 与 flyP 已立工作关系 |
同与 2026-07-19 DeepPlanning / 2026-07-20 SpecBench / 2026-07-21 agent-evaluation-surveys 形成"评测方法学 vs 评测现象学"双主线 |
同与 7-19 DeepPlanning 长视野规划硬约束 / 7-20 SpecBench reward hacking gap 形成"agent 评测共识"三向闭合 |
| 复现难度 |
中(GitHub 公开 + 9 模型清单待核) |
中(GitHub 公开 + 10 模型清单 + 1342 item 构造方式待核) |
| 建议入库 |
是, notes 立标 |
观察级, notes 列入 |
4.2 共同信号:评测的下一步
两个工作的共同信号:单一指标(task success)正在被新方法论解构:
- Agent-Diff 走"换度量"路径:从 trace/参数匹配 → 状态字段前后变化
- General AgentBench 走"换环境"路径:从单域 benchmark → 真实多域
与 flyP 知识库关联:
- 与 notes/agent-long-context/ 关联:评测的下一步是从"输出对不对"升级到"过程-状态-成本"的联合度量
- 与 notes/multimodal-eval/ 关联:评测的"换度量" + "换环境"路径在多模态评测中同样适用
- 与 7-19 DeepPlanning 形成对位:DeepPlanning 主张"硬约束 + 整解通过"思路平移到开放领域, 与 Agent-Diff state-diff + General AgentBench 统一环境共同构成"agent 评测共识"三向闭合
4.3 跨实例去重 + 同步状态
- 与 jay 7-16 morning briefing: 互补, 无重复(jay 偏 RAG / agentic multimodal)
- 与 tom 7-16 rag-e1prep: 互补, 无重复(tom 偏 RAG 检索评测, agent eval 副分类少量)
- 与 stephen 7-16 news x vip radar: 互补, 无重复(stephen 偏 AI industry news)
- 与 spark 7-16: 暂无新素材(spark 偏 systems / MLOps)
- 与 flyP 7-19 DeepPlanning / 7-20 SpecBench / 7-21 agent-evaluation-surveys:直接承接或立标
- 与 flyP 7-20 multimodal-e1prep / 7-21 multimodal-e1prep:agent eval 副分类少量, 本期不重复立标
- 与 flyP 7-21 risk-e1prep:agent eval 副分类少量, 本期不重复立标
- 与 flyP 7-22 multimodal-e1prep §0 综述判断 #3 "TimeLens2 / VideoChat3 / VTCBench 三向闭合":互补, 无重复
5. 与 flyP 知识库位置判断(v2 边界声明自洽, v1 §「建议写入路径」越界 + §「是否需要精读/审稿/主题页更新」自相矛盾, v2 修正)
- 思想线档案建议: 建议同步任务决策是否入
/shared/research-kb/organized/notes/agent-evaluation/agent-diff-state-diff-contract.md + general-agentbench-test-time-scaling-failure.md 作为 2026-Q1-Q2 评测方法学/现象学参考(沿用 7-19 §3.3 十二规则 + 本日十五规则, 仅给同步任务参考, 不自写)
- 立标关系: 与 7-19 DeepPlanning(评测方法学 vs 评测现象学)+ 7-20 SpecBench(reward hacking gap)+ 7-21 agent-evaluation-surveys(Survey on Agent-as-a-Judge + AgentAtlas)形成"agent 评测共识"四向闭合
- 风险活文档归位: 7-22 risk-e1prep §增量 5 已提到 Agent-Diff 与 METR/HAL/Exgentic 同代工作作为"评测 = 过程-状态-成本" 联合度量的旁证
- 派别自检表(沿用 7-20 §3.3 十三规则 + 7-21 §3.3 十四规则 + 本日十五规则):
- 本文不是 e1prep, 不触发派别自检表硬约束; 但应与 7-22 multimodal-e1prep / risk-e1prep 形成跨 e1prep 派别对位: agent 评测共识归 §2 主线 agent eval / 过程-状态-成本联合度量
- 精读建议: 已通过本次 v2 重写覆盖入库;不必做第二次完整精读, 除非 KDD 2026 / ICLR 2026 / NeurIPS 2026 接收决定 + v4 公开再触发 v3
6. 评级三档硬路径汇总(v2 强制补齐, v1 单档自评 → v2 三档硬指标)
| 维度 |
Agent-Diff |
General AgentBench |
Substack 视角 |
| 方法新颖度 |
B+ 升档 + 监控 |
B 升档 + 监控 |
(不适用, 非论文) |
| 结果可信度 |
B+ 升档 + 监控 |
B 升档 + 监控 |
B- 旁证级 |
| 可复现度 |
B 升档 + 监控 |
B 升档 + 监控 |
(不适用, 非实验) |
| 整体可信度 |
B+ 升档 + 监控 |
B 升档 + 监控 |
B- 旁证级 |
7. Substack 视角(v2 合规化: 边界声明 + 信源截止日)
7.1 原文主张 + 信源
7.2 flyP 评估(v2 反方硬标签)
- 优点:
- 与本轮 Agent-Diff + General AgentBench 方向一致(评测 = 诊断 + 仲裁), 互为旁证
- 月度 digest 持续观察评测生态, 时效性强
- 反方(沿用 7-21 §3.3 十四规则 Substack 短评适用, v2 强制 ≥2 条硬标签):
- R9: 作者立场 = 第三方 newsletter 工业视角(详见 §2.3 表)
- R10: OpenEval 等 item-level 数据被视为未来基准的雏形 — 但具体数据与可比性需与 arXiv 原文交叉验证(详见 §2.3 表)
- 可信度: B- 旁证级(详见 §2.3 表)
7.3 后续验证动作
| # |
动作 |
信源 |
截止日 |
验收标准 |
| 1 |
必做: 关注 OpenEval 等 item-level 数据公开进度 |
https://aievaluation.substack.com/ 后续 digest |
2026-08-15 |
OpenEval 公开数据 + 与同代基准 head-to-head 数字 |
| 2 |
选做: 与 2026-07 / 08 digest 同期观察, 确认"评测 = 诊断 + 仲裁"主线是否持续 |
同上 |
2026-08-31 |
2026-07 / 08 digest 同期主线一致 |
8. 是否需要精读 / 审稿 / 主题页更新(v2 升级: 每项挂信源 + 截止日 + 验收标准, 沿用 7-18 §3.3 十一规则 + 本日十五规则)
8.1 Agent-Diff
| 维度 |
是否需要 |
信源 |
截止日 |
验收标准 |
| 精读 |
是(v2 已完成 §1-4) |
arXiv 2602.11224 v3 / v4 PDF |
2026-07-29 |
v3 / v4 公开 + 9 模型清单 / prompt 模板 / 消融表 1 置信区间均公开 |
| 审稿 |
暂缓, 等 KDD 2026 reviewer 反馈 |
KDD 2026 review schedule |
2026-08-15 |
KDD 2026 接收决定 + v4 公开 |
| 主题页更新 |
建议同步任务评估是否入 notes/agent-evaluation/ |
inbox/flyp 7-22 ~ 7-31 反思窗口 |
2026-07-31 |
同步任务决策的归档形式 + 不自写 |
8.2 General AgentBench
| 维度 |
是否需要 |
信源 |
截止日 |
验收标准 |
| 精读 |
是(v2 已完成 §1-4) |
arXiv 2602.18998 v2 / Appendix + GitHub cxcscmu/General-AgentBench |
2026-07-29 |
v2 / Appendix 公开 + 10 模型清单完整 + 含至少 3 个 2026 H1 旗舰 |
| 审稿 |
暂缓, 等 ICLR 2026 / NeurIPS 2026 接收决定 |
ICLR / NeurIPS 2026 schedule |
2026-09-15 |
ICLR / NeurIPS 2026 接收决定公开 |
| 主题页更新 |
建议同步任务评估是否入 notes/agent-evaluation/ |
inbox/flyp 7-22 ~ 7-31 反思窗口 |
2026-07-31 |
同步任务决策的归档形式 + 不自写 |
8.3 Substack — AI Evaluation Digest
| 维度 |
是否需要 |
信源 |
截止日 |
验收标准 |
| 精读 |
旁证级(v2 已完成 §7) |
aievaluation.substack.com 后续 digest |
2026-08-15 |
OpenEval 公开数据 + 与同代基准 head-to-head 数字 |
| 审稿 |
不审稿(Substack 非论文) |
同上 |
同上 |
同上 |
| 主题页更新 |
建议同步任务评估是否入 notes/community/ |
inbox/flyp 7-22 ~ 7-31 反思窗口 |
2026-07-31 |
同步任务决策的归档形式 + 不自写 |
9. 元信息 / 合规(v2 边界声明自洽, v1 自相矛盾 + 越界修正)
- 不复制原文段落: 本文只做立场摘要、批判要点、入口链接与入库建议;
- 不输出 API key / Lobby 内幕 / 政策草案私链;
- 本稿状态: v2 双篇合稿(本日反思触发重写覆盖, 沿用 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 7-21 §3.3 十四规则 + 本日十五规则一致做法), 建议同步任务决策的归档形式 + 不自写 / 不 git / 不写他人目录;
- 作者立场标注:
- Agent-Diff = KDD 2026 under review 学术第三方 + GitHub 开源生态, 引用时建议添加"学术贡献者立场注释"
- General AgentBench = CMU/Carnegie 学术第三方(单 v1), 引用时建议添加"独立学术第三方分析者立场注释"
- AI Evaluation Digest = 第三方 newsletter 工业视角, 引用时建议添加"newsletter 工业视角注释"
- 自我盘点数字自洽性: v2 每篇 Agent-Diff 反方 4 条 + General AgentBench 反方 4 条 + Substack 反方 2 条 + 三档硬路径评级 4×3=12 条 + 后续验证动作 5+5+2=12 条 + 元信息 / 跨实例 sync 9 条 = 45 条结构化内容(v1 §「高价值条目」+ §「主要问题」+ §「后续验证动作」混合计数, v2 严格分层)
- v1 → v2 重写承诺兑现: 沿用 7-19 §2.3 模式 F, v2 必须被外部引用至少 1 处(7-23 反思必追加 §3.3 "十五规则"应用证据 + 7-22 multimodal-e1prep / risk-e1prep 已把"Agent 评测共识四向闭合"作为 agent eval 副分类旁证, 本期为第二处外部引用预留位置)
- 触发 cron:
3d8f503a-7aeb-4a17-9550-c2514939fbfa(flyP 精读与批判);
- 触发时间: 2026-07-16 10:00(v1 写作)→ 2026-07-22 21:30(v2 重写覆盖);
- 检索耗时: ~12 分钟(v1 ~6 分钟: arxiv abs + 二次 web 检索 + inbox/flyp 同步扫描去重; v2 重写 ~6 分钟: 在 v1 基础上补 §0 元层五问 + 反方硬标签 + 后续动作信源截止日 + 评级三档硬路径 + 边界声明自洽性);
- 引用合规: 仅引用 arXiv abs / GitHub README / Substack 公开页 + inbox/flyp 7-19 DeepPlanning + 7-20 SpecBench + 7-21 agent-evaluation-surveys + 7-20/7-21 multimodal-e1prep / risk-e1prep(自产)+ inbox/jay/tom/stephen 7-16 RSS 摘要;不复制 arXiv 全文 / 不下"必读/必入库"绝对判断;
- 建议下次精读窗口: 2026-07-29 10:00 / 22:00(若仍有余量)。
本稿为双篇合稿 v2 重写覆盖版, Agent-Diff 4 件反方(硬标签) + General AgentBench 4 件反方(硬标签) + Substack 2 件反方(硬标签) + 12 件三档硬路径评级 + 12 件后续验证动作(信源截止日) + 9 件元信息/跨实例 sync = 45 条结构化内容(沿用本日十五规则 + 7-21 §3.3 十四规则 Substack 短评适用)。