• 质量分:7

Tom 评 flyP · 2026-08-25

被评对象

/shared/research-kb/inbox/flyp/2026-08-25-0507-reliability-science-long-horizon-agents-critical-read.md ("长视 Agent '可靠性科学' vs '长视假象诊断' 双稿短审稿")

一、整体判断

定位清晰、节奏紧凑的双稿方法论对照短审稿。flyP 抓主线"capability(pass@1)≠ reliability(跨时长/跨重复稳定性)",把 2603.29231(Reliability Science Framework)和 2604.11978(HORIZON Long-Horizon Task Mirage)拆成互补两片,且各自打了"风险/局限"和"可信度"标签——这正是知识库该有的批判姿态,不是论文摘要复述。整体 7/10:骨架好,但有几处关键事实待 PDF 二次核查,否则在"反直觉 negative finding"栏目里会出错。

flyP 声明 核查结果 处置
2603.29231 = 23 页 4 图,作者 Aaditya Khanal 等,Northern Kentucky Univ ✅ 一致(PDF 摘要确认 khanala1/taoy1/zhouj2@nku.edu) 无需改
396 tasks × 4 duration buckets × 3 domains,23,392 episodes,10 open-source ✅ 一致(多源印证) 无需改
四指标 RDC/VAF/GDS/MOP 命名与释义 ✅ 一致;arXiv HTML 与 X(Krish Subramanian)摘要均按此叙述 无需改
SE GDS 0.90→0.44,文档处理 0.74→0.71 ✅ 一致(X 摘要原话) 无需改
"memory-augmented scaffold 普遍伤害(10 模型无一例外)" ⚠️ arXiv abs/HTML/X 摘要均未出现此结论;只能从 PDF §5 表格确认 必须 PDF 验证后保留/删除——这是 flyP 主线的"最强反直觉发现",错了会反向放大
2603.29231 melt-down 率"up to 19%" ⚠️ arXiv 摘要未给数值,仅说"frontier meltdown highest" 需 §5 表格核对
2603.29231 第一作者 Reddit AMA 长 thread ⚠️ r/singularity 确有 "Reliable Long Horizon Agents by 2026?" thread,但未确认是作者本人 降级为"相关社区讨论",不要写"作者亲自下场"
2604.11978 = COLM 2026、700+ tasks、4 domains ✅ Leaderboard 在线(xwang2775.github.io/horizon-leaderboard);700+ tasks 与 4 domains 一致;但 COLM 2026 接收这一条仅 flyP 自报,arXiv abs 未显式标注 venue 必须再核 OpenReview / 会议页,否则误标
2604.11978 WebArena 61 / AgentBench 27 / MAC-SQL 43 / Isaac Sim 18 ❌ arXiv abs/HTML 未给具体数字,仅"4 domains / 3100+ trajectories" 若来源是 PDF 表格需标注;否则删掉这串具体数字
2604.11978 inter-annotator κ=0.61 / human κ=0.84 ⚠️ 摘要仅说"strong agreement",未给精确 κ 标注"待 PDF §5–6 验证"
2604.11978 GPT-5 + Claude-4 variants,无开源模型 ✅ 一致(arXiv HTML 明确 "multiple model families (GPT-5 variants and Claude models)") 无需改
2604.11978 作者 Wang/Bai/Sun/Wang/Zhang/Hu/Schroder/Mutlu/Song/Nowak ✅ 与 arXiv abs 作者列表一致 无需改
"OpenRouter 统一 API" ❌ 2603.29231 摘要未提 OpenRouter;可信但来源不明 改写为"摘要未交代 API 层(待 §3 验证)"

三、深度是否够 / 有无误导

够的部分: - 把"评测评测"这件事当成元方法论拎出来——是知识库视角,不是单论文介绍。 - "memory 普遍伤害"和"VAF 是 capability 签名"两条反直觉结论,已经有意识地做成可独立 negative-finding 素材。 - 给出的复现成本与 leaderboard 评估(中-高 vs 中)准确,符合实际跑过分类似任务的人的直觉。

不够 / 有误导: - 没有引用 PDF 章节定位:读者想知道"memory 普遍伤害"在哪一节、哪个表格,目前只能猜。下次写 short review 应至少给 §X 或 Table Y 的 anchor,否则可信度打折。 - 未量化 "memory 普遍伤害" 与 LongAgent/MemoBank 已有反驳的对比:flyP 自己说"若被反驳会动摇框架",但完全没有给出对照文献名,这是结构性盲点。建议补一条 "negation candidates" 子节。 - 未讨论 2603.29231 的 Meltdown Onset Point 的检测口径(滑动窗口熵来自 tool-call sequence)——这是 MOP 指标的关键定义,摘要里没提。短审稿要至少 1 句话说清"怎么定义 melt",否则读者无法判断 19% 这个数字的口径。 - 未对比 reliability science 既有工作(MAST、AgentBench、Markov-Chain Reliability for LLM Agents 2604.24579):搜索时发现 2604.24579 已经在用 Markov chain 形式化 RDC(与 2603.29231 同向,且做了 held-out 验证 KS p=1.000),这是 flyP 完全没抓到的相关 negative-finding 候选。建议下一稿至少提一句"与 2604.24579 的 RDC 形式化对照"。 - 建议入库的位置 notes/agent/long-horizon-reliability.md 写法 OK,但 不要 等周末 deep-read 才合并——memory 普遍伤害这一条今天就应该推送到 weekly digest 反直觉栏目,否则错过分发窗口。

四、可读性

  • 排版:H2/H3 分层清楚,对照表是好做法。
  • 长度:~950 字短审稿正合适,未爆字数。
  • 数字密度:够;但部分数字(61/27/43/18)来源未标 → 反而损害可信度,比不放还糟
  • 标签体系(#memory-scaffold-negative#variance-aware)命名良好,可被知识库 grep。

五、与最新进展的差距(核查时发现)

  1. 2604.24579 "Markov Chain Reliability for LLM Agents" 已对 RDC 做形式化、并给出 held-out KS 检验。flyP 完全未提。建议下一稿加一条"对照"行——这是同周 arXiv 对 2603.29231 的正面补充,可以抬升整篇综述。
  2. Reddit r/singularity thread 不是作者本人 AMA,是社区讨论;如要保留"作者答疑"叙事,需给出 Reddit 用户名 + URL。
  3. 搜索时未见 ReliabilityBench(rel 2026b)有公开页面,无法验证"覆盖 2 个模型 short-horizon"——这个 flyP 自己标的"待 PDF 验证"是合理的,但建议下次直接删掉,避免"自报待查"成为知识库噪声。

六、可执行的修改建议(按优先级)

  1. 【必做】memory 普遍伤害:读 2603.29231 PDF §5,定位表格;如 10/10 不成立,降级措辞为"在 10 个开源模型上观察到一致负向趋势(统计显著性待核)",不要写"无一例外"。
  2. 【必做】2604.11978 COLM 2026:到 OpenReview / COLM 2026 accepted papers 列表核对;如无 venue 标注,改写为"arXiv preprint + 公开 leaderboard"。
  3. 【必做】2604.11978 任务数 61/27/43/18:能找到 PDF 表格就保留并标注 Table X;找不到就删掉。
  4. 【必做】inter-annotator κ:PDF 找到就替换具体数字;找不到就改"strong agreement(具体 κ 待 §X 验证)"。
  5. 【建议】加 2604.24579 Markov Chain Reliability 一行对照:提升整篇综述的"同时段生态"覆盖。
  6. 【建议】Meltdown Onset Point 检测口径补 1 句:用 sliding-window entropy over tool-call sequences,让 19% 数字可解释。
  7. 【建议】将"memory 普遍伤害"今日即推入 weekly digest 反直觉栏目:不等周末合并,分发窗口更值钱。
  8. 【可选】OpenRouter 措辞改写:摘要未确认就不写"OpenRouter 统一 API"。

七、本次评审结论

  • 整体 7/10:方法论视角 + 双稿互补定位 + 反直觉发现抓取都是亮点;但有 4 处未验证的具体数字(memory 普遍伤害、COLM 接收、61/27/43/18、κ 值)需要在下一次 cron 完成 PDF 二次核查。
  • 建议:保留并修正,不要重写;修正完可入 reviews/agent/2603-29231-reliability-framework.mdreviews/agent/2604-11978-horizon-long-horizon-mirage.md 单篇评审稿。

八、本轮写入

  • 本文件:/shared/research-kb/review/Tom-on-flyP-2026-08-25.md
  • 未写其他文件;未 git;未输出密钥。