• 质量分:8
  • 被评对象:flyP · 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md
  • 评审者:Tom
  • 评审时间:2026-10-07 14:40 Asia/Shanghai

1. 事实准确性(核查结果)

我通过 arxiv abstract + HF papers page + 一次 web_search 交叉验证了 flyP 文档的关键事实点:

flyP 文档说法 核查结论 备注
arxiv 2601.11044,v4,2026-04-23 提交 ✅ 准确 abs 页面与 html/2601.11044v4 均确认
32 场景 / 138 任务 / 6 大能力 / 平均 ~90 tool calls / ~1M tokens ✅ 准确 摘要原文一致
48.4% vs 32.1%(闭源 vs 开源) ✅ 准确 摘要原文:"closed-source models significantly outperform open-source models (48.4% vs 32.1%)"
Claude-4.5-Opus × Claude-Agent-SDK scaffold 例 ✅ 准确 摘要原文一致
通讯作者 Keyu Li、Pengfei Liu ✅ 准确 作者列表中 Keyu Li 为第一作者,Pengfei Liu 在末位(GAIR/SJTU 资深通讯)
"Shanghai Innovation Institute / SJTU / Hong Kong PolyU" 机构 ⚠️ 部分未核实 摘要未直接列机构(需 PDF/HTML 才能完全确认 PolyU 这一条),属次要风险
论文被 ACL 2026 Main 录用 ❌ 未提及 arxiv abs 页面与 HF page 均标注 "Accepted by ACL 2026 Main Conference"。这是 flyP 文档的一个明确疏漏——对"主题标签/归档价值"影响显著(ACL 顶会 vs workshop 差距大)
GitHub 仓库链接 ❌ 未给出 HF papers page 显示 GAIR/AgencyBench 已挂 dataset(数据集已公开),flyP 仅在第 6 节用"待补查"一笔带过,未主动验证。建议补实链接

事实分小结:核心硬数字全对;通讯作者/链接/录用情况有 3 处缺漏,整体准确性 8.5/10。

2. 深度评估

做得到位的地方: - 结构非常标准:定位/贡献/方法/实验/风险/复现/可信度/与库内关系/入库建议/一句话总结——这种"10 段式"对评审者和后续 cron_s2 富化都很友好。 - 风险表(§5)覆盖了任务集规模、user-sim 偏差、rubric 主观性、闭源/开源解读、评测成本、安全越权、数据污染 7 个维度,是真正有批判视角的部分,对我库"风险"维度有意义。 - §8 与库内已有选题的连接点(MMProLong、PACMS、mcompassrag、coding-agents-longcontext-mem0)选得准,对主题页 2026-long-context-agent-eval.md 的合并有直接价值。

不够深的地方: - 未给具体模型分数表:摘要只给"48.4% vs 32.1%"全局,但 ACL 2026 主会版本大概率给出每个模型(如 Claude-4.5-Opus、Gemini 2.5 Ultra、GPT-5.3、Qwen3-Max、DeepSeek-V4 等)的细分。flyP 没去 v4 HTML 抓数字,导致 §4 "实验与发现" 几乎是"摘要复读"。这是最关键的深度短板。 - rubric 与 user-sim 设计未拆解:双 rubric(视觉+功能)的具体度量逻辑、user-sim 的 prompt 工程、是否引入 adversarial user,这些都没展开。rubric 的可信度是整个 benchmark 可信度的命门,不展开就只能在 §5 说"主观性风险大"。 - 缺失与同代基准的硬对比:flyP 提到"与 OneMillion-Bench、WildClawBench、Evo-Bench 等横向对照",但没真正做——任务量分布(138 vs 多少)、能力维度覆盖、是否可联合评测、各自擅长什么。§9 第 3 条说"写一段三件套对照笔记",但当下稿里没有。 - 数据污染/任务泄露:摘要级论文几乎不提,flyP 仅以一句话点出,未评估"日常 AI 使用"任务是否会被闭源模型的训练数据覆盖。这个风险对"闭源 48.4% vs 开源 32.1%"差距解读至关重要(flyP 也提到了 scaffold/工具链,但没讨论"是否见过题目")。

深度分小结:结构扎实,但停留在摘要级复读,缺乏 PDF/HTML 级证据,6/10。

3. 误导性检查

  • "把日常真实任务扩成 32 个场景 / 138 个任务"——"扩成"略夸张,原文是"derived from daily AI usage"而非"扩成"。这是中文表述层面的轻微偏离,不是事实错误,但会让读者高估任务的生成复杂度。建议改为"由日常 AI 使用反推 / 反向构建"。
  • "把长上下文和 agent 绑定到 ≈1M token、小时级工作流,而不是单回合搜索/QA"——方向正确,但"绑定"用词过强,论文并未声称"agent 必须 1M",而是"评估这种规模"。改为"将评估重心放在 ≈1M token、小时级工作流"更准确。
  • 没有发现方向性误导(如把"开源落后"读成"开源无望",或把 rubric 自动化读成"无人参与")。

误导性分:低,8/10。

4. 与最新进展的差距

  • 论文时间差:arxiv v4 提交于 2026-04-23,ACL 2026 录用通知一般 Q1-Q2,flyP 在 2026-10-07 才写,滞后约 5 个月。同期已经有 Horizon-LHB(2026-07-08 deep-read)、LongHarness-Bench(2026-10-02)、SpecBench、Self-Challenging-Agent 等更新的"长时域 agent 评测"陆续入库;flyP 这篇选题本身在 5 个月前算前沿,现在已属于"补登"。
  • 建议联动:既然 §9 已经提议"对照 OneMillion-Bench / WildClawBench 写三件套",那更直接的对照对象应该是已在库的 LongHarness-Bench(2026-10-02-1550-flyP-critical-read-LongHarness-Bench-arxiv-2609-38137.md)和 EgoTools(2026-10-03-0950-flyP-critical-read-EgoTools-egocentric-tool-use.md)。flyP 完全没提这两份,说明 review/选题时缺少"跨期关联"检查。
  • 未涉及补强论文:2026-07 之后陆续有 Multi-Agent-Bottleneck、Reward-Under-Attack、Harness-Evolution-Eval、HazardBench(如果存在)等"agent eval 局限性"的反思类工作,应该在 §5 风险表中引用一两篇以增强说服力。

时效差距:5 个月滞后是主要扣分项;建议在 §0 或 §4 显式声明"本文基于 v4 (2026-04),实际入库时距原始论文约 5 个月"。

5. 可读性

  • 中文行文流畅,模板化程度中等(不是 high-quality zhihu 风格,但比 SOP 化的 critical-read 模板好)。
  • 表格清晰,§5 的 7 维风险表是亮点。
  • 缺少段落锚点(没在每段开头用 emoji 或 bold 小标题收束);长段落视觉密度偏高,对"扫读"不太友好。
  • 没有配图(rubric 流程图、user-sim 示意图、scaffold 矩阵图),对"1M token / hours of execution"这种数量级信息,缺一张对比图会让读者低估成本。

可读性分:7/10。

6. 可执行修改建议(按优先级)

  1. 【必做 · P0】补 ACL 2026 Main 录用事实——首段加 "Acceptance: ACL 2026 Main Conference (per arxiv abs, 2026-XX 公告)"。这直接影响"主题标签 → 入库优先级"的判断。
  2. 【必做 · P0】抓 v4 HTML 的具体模型分数表——§4 必须有 ≥1 个具体分数矩阵(每模型 × 6 能力),否则就是"摘要复读"。建议拉 HTML,从 §4 / §5 / Table 1/2 抽取。
  3. 【必做 · P0】补 GitHub / HF 仓库链接——HF papers page 显示 GAIR/AgencyBench(datasets),论文代码应同时挂在 GitHub。把这块从"待补查"改成"已核实 + 链接"。
  4. 【强烈建议 · P1】与库内 LongHarness-Bench、EgoTools、Self-Challenging-Agent 显式关联——§8 只列了 6 月的几篇旧文,应把 10 月的 flyP 同主题产出加入对照。
  5. 【强烈建议 · P1】rubric 设计 + user-sim prompt 工程展开——这是基准可信度的命门,至少给 1-2 段(含示例 prompt 或 rubric 维度定义)。
  6. 【建议 · P2】加 1 张对比图——把 AgencyBench / LongHarness-Bench / OneMillion-Bench / WildClawBench 的任务量、tool-call 平均、token 规模、自动化程度、是否开源做 1 张矩阵图(即使 ASCII 表也好)。
  7. 【建议 · P2】§5 风险表新增 1 行:"与最新 agent eval 反思文献的对照缺位"——如引用 1-2 篇"reward hacking"、"harness evolution"、"reliability without validity"类工作。
  8. 【可选 · P3】术语微调:"扩成" → "由…反向构建 / 反推";"绑定" → "将评估重心放在"。

7. 总体评分

维度 分数
事实准确性 8.5
深度 6
误导性 8
时效性 6
可读性 7
结构完整性 9
加权总分 8 / 10

结论:结构完整、批判角度在线、风险表是亮点;但停留在 arxiv 摘要级复读,缺 ACL 录用事实、缺具体分数表、缺 GitHub 链接、缺与同库 10 月同主题产出的横向对照——按 P0/P1 三条补齐后可直接入库并联动主题页 2026-long-context-agent-eval.md;当前版建议打回修订一次再入库。