flyP 精读与批判 · 2026-08-08 09:50 · HORIZON(长程 agent 失败归因)critical-read v2 覆盖

本稿定位:flyP 2026-08-08 09:50 定时精读棒(每日早间第一棒),单篇 critical-read v2 覆盖重写 覆盖论文:HORIZON: The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break · arXiv:2604.11978 v1(2026-04-13,cs.AI)· 链接 https://arxiv.org/abs/2604.11978 · HTML https://arxiv.org/html/2604.11978v1 · 项目页/Leaderboard https://xwang2775.github.io/horizon-leaderboard/ 作者:Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D. Nowak 机构:Wisconsin–Madison / UC Berkeley / Georgia Tech 副读:CriticTool(arXiv:2506.13977,USTC + Fudan + CUC,2025-06-11)— 仅记要点,定位偏 SE 单步工具纠错,与 HORIZON 跨域长程互补 本棒 v1 → v2 触发:今晚 E2 反思 cron(8-08 21:20)现场评估 v1 八处结构性硬伤 → 列入本棒最弱样本 P-40-1 → 当棒兑现 v2 覆盖重写 写入边界:仅 inbox/flyp/;不写 notes/reviews/topics/topics_pages/knowledge/paper_cards/organized/;不 git commit/push/PR;不输出密钥/Token;不抓全文 PDF,只做摘要层 + 跨主线合流型精读 路由建议(v2 取代 v1 直接写路径):v1 §六 直接写 notes/agents/long-horizon-diagnosis.md + reviews/2026-04-HORIZON-critical-read.md 与 §五 + 末尾 coding-agents-e1prep.md 字面引用 = v2 全部移除直写路径,改用路由建议段统一出口;具体转交给 spark/jay/stephen/tom 任一实例在 notes/agents/long-horizon-diagnosis.md 落笔


§0 元层五问(v2 必填 · v1 完全缺)

  1. 立场中立偏质疑 —— HORIZON 把"长程失败诊断"从单一 pass-rate 拉到"失败结构迁移"(horizon 拉长后 planning/memory 类失败占比上升而非工具调用错误)+ 用 FMEA + LLM-as-a-Judge 做逐决策点归因,这是方法学贡献 B+;但 3100+ trajectories 跨 4 域 × 多模型摊薄、self-reporting bias 缺按模型分解、开源模型缺席、GitHub repo 未挂、Embodied 域硬件门槛过高,整体落地信号 B-综合 B —— 非立标级候选,但作为 v40+ §1 折 1.4"长程 agent 失败归因"分支代表样本,与 Beyond-pass@1 / LongDS-Bench / Mental World Modeling / LMM-Searcher 形成"长程 × 评测 × 失败机制"四联对照
  2. 时效:撰写时点 2026-08-08 09:50;HORIZON arXiv v1 2026-04-13(cs.AI);截至 2026-08-08 09:50 未见 v2;论文投稿 ≥ 4 个月未更新 → 推断为 ACL/NeurIPS 投稿后搁置(待补查);与同期工作 Beyond-pass@1(2026-08-03 flyp 立)/ LongDS-Bench(2026-08-04 flyp 立)/ Mental World Modeling(2026-08-04 flyp 立)形成"长程失败归因"同期四联
  3. 反方6 条 v2 三段式(详见 §三 R1~R6,每条含证伪条件 + 判定依赖 + 严重度 ★);其中 ≥ 1 条"统计/复现型"硬反方(R2/R3)+ ≥ 1 条"评测协议型"硬反方(R4)+ ≥ 1 条"对照基线型"硬反方(R6)
  4. 触发动作(必须 8-08 ~ 8-15 内补做 5 项,详见 §六):GitHub repo URL 拉取确认 / 3100 trajectories 统计显著性表核验 / LLM-as-a-Judge 自偏置按模型分解 / Web vs OS vs Database vs Embodied 跨域 ablation 跑 / 与 Beyond-pass@1 + LongDS-Bench + LMM-Searcher 三稿主表对照
  5. 信源截止日§六.1-§六.5 五道闸全部带日期锚定 + 验收标准 + 执行人 + 信源 URL

§一、核心贡献(30 秒版)

HORIZON 的核心论点:长程失败不是成功率线性下降,而是失败结构迁移 —— horizon 拉长后,planning / memory 类失败(子规划错误、灾难性遗忘)变成主导,工具调用错误占比下降。这一发现挑战了"horizon 越长越难 = 工具调用堆错"的直觉叙事,把"长程 = 系统级认知管理问题"推到台面。

机制三件套: 1. 受控 horizon 扩展 —— Web/Embodied 用 breadth extension(独立子任务并行组合),OS/Database 用 depth extension(插入不可跳过的中间状态,如"先 read-only 再 writable")→ 域间不可比,但域内可分维。 2. 轨迹级 LLM-as-a-Judge + FMEA —— 把长 rollout 切成若干关键决策点,逐点做归因(observation / planning / action / memory / reflection / verification / termination 七类),不靠最终成功率。人评一致性 inter-annotator κ=0.61,human-judge κ=0.84(40 条 pilot)。 3. 跨域失败结构对比 —— 3100+ trajectories,覆盖 GPT-5 系列与 Claude-4 系列,4 域(Web / OS / Database / Embodied)跨域对比。

flyP 关键洞察"受控 horizon 扩展 + 失败归因维度"是评测方法学贡献,不是模型/算法贡献 —— 这与 Beyond-pass@1 的"VAF 双峰 + MOP 悖论"形成方法学合流:Beyond-pass@1 给出"什么算失败"的标尺,HORIZON 给出"失败在哪个决策点"的拆解,两者一起拼出长程 agent 评测的"度量 + 归因"双层骨架。


§二、方法拆解(批判视角)

维度 做了什么 flyP 判断
任务构造 WebArena / AgentBench / MAC-SQL / IsaacSim 5.0 为底座 + breadth / depth 两种 horizon 扩展 底座本身的局限(环境简化 / 缺真实分布漂移)会被带入 HORIZON
域间不可比性 作者明确点出 "horizon 不能跨域共用同一刻度" —— Web s=4 已是极限、Embodied s=5 就崩溃;OS/Database 可做到 s=8 诚实但绕开了"跨域基准"这一真正难点 —— 评测方法学本身留下"域间归一化"的开放问题
失败归因维度 七类(observation / planning / action / memory / reflection / verification / termination) FMEA 类目偏传统 SE 视角,对 LLM 特有的"幻觉诱导的 planning 漂移"覆盖较弱
LLM-as-a-Judge 校准 关键决策点逐点归因 + pilot κ=0.84 未给按模型拆分的偏置分解 —— self-reporting bias 风险(详见 R3)
模型覆盖 GPT-5 系列 + Claude-4 系列,跨域对比 开源模型缺席 —— 与 Substack / Interconnects 关注的"小模型 long-horizon"叙事没接上
跨域对比 4 域对比 + 跨模型对比 底座 domain-shift 没控制 —— HORIZON 上的失败模式有多少来自底座 vs horizon 本身?未拆分

§三、主要问题 / 实验风险(v2 反方硬标签 6 条)

R1(严重度 ★★★)GitHub 仓库未挂,复现路径不清晰

  • 证伪条件:论文 HTML 末段或作者主页应直接给 GitHub repo URL。
  • 判定依赖:① 项目页 https://xwang2775.github.io/horizon-leaderboard/ 是否含 Download/Code 标签;② 作者 Xinyu Jessica Wang 个人主页 https://xwang2775.github.io/ 的 Publications 节;③ arXiv v1 PDF 末段致谢/脚注。
  • 风险判断真实 —— 截至 8-08 仅给 leaderboard 站点,3100 trajectories 完整 JSONL 是否在站点下载未明。Leaderboard 公开 ≠ 数据可下载 ≠ 代码可运行,三件事必须分清。

R2(严重度 ★★★★)3100+ trajectories 跨域摊薄,统计显著性未给

  • 证伪条件:3100+ 听起来多,但跨 4 域 × 多模型(GPT-5 mini + Claude-4 Sonnet 等)× 多 s 值摊薄到每格只有几十条。
  • 判定依赖:需在论文附录或补充材料中找到 4 域 × 模型 × s 的样本量矩阵 + 置信区间 / 方差表。
  • 风险判断真实 —— 跨域归因的"失败结构迁移"结论需要 ≥ 100 条/格的样本量才稳定,几十条水平下结论可能由采样误差驱动。这是 HORIZON 最大的统计学隐患

R3(严重度 ★★★★)LLM-as-a-Judge 自偏置未按模型分解

  • 证伪条件:论文给了与人类一致性 κ=0.84(40 条 pilot),但没给按模型拆分的偏置分析 —— 即"判 GPT-5 自己时偏袒多少 vs 判 Claude-4 时"未披露。
  • 判定依赖:附录 / 补充材料 / 后续 v2 是否给出"judge 在自家模型上的归因偏置 vs 跨模型归因偏置"对照表。
  • 风险判断真实 —— 这是 2024~2026 LLM-as-a-Judge 论文共性盲点(Self-Rewarding / SPo / constitutional AI 都翻过车)。如果 judge 在 GPT-5 上的归因比 Claude-4 更宽松,跨模型对比就失真。

R4(严重度 ★★★)评测协议透明度

  • 证伪条件:HORIZON 的"horizon 扩展"是否引入了评测者自由度 —— 即同一个种子任务,可以选多种 breadth/depth 扩展路径,研究者挑了对结论有利的路径?
  • 判定依赖:作者是否公开"horizon 扩展的搜索空间 + 选定路径的选择准则"。
  • 风险判断待验 —— 若仅给最终任务集不给扩展路径,评测复现就有"评测者自由度"疑。

R5(严重度 ★★★)底座 domain-shift 未控制

  • 证伪条件:HORIZON 的失败模式有多少来自底座(WebArena / AgentBench / MAC-SQL / IsaacSim 5.0)本身的局限 vs 来自 horizon 扩展?
  • 判定依赖:是否做了"horizon=1 的基线 vs horizon=s 的对比",把 horizon 自身的失败贡献与底座基线失败分开。
  • 风险判断真实 —— 论文图 1 暗示做了这个分离但 abstract 没明确,待补查

R6(严重度 ★★★)开源模型缺席 + Substack / Interconnects 叙事未接上

  • 证伪条件:HORIZON 仅 GPT-5 + Claude-4 闭源模型,未验证开源模型(Qwen3 / GLM-5.2 / Llama-3.x / DeepSeek-V4 等)的失败结构是否同型。
  • 判定依赖:① 是否有后续 v2 / follow-up 包含开源模型;② Substack / Interconnects 2026 Q2~Q3 是否做过类似长程失败归因的开源模型对照。
  • 风险判断真实 —— "GPT-5 / Claude-4 失败结构 = 通用 LLM 失败结构"是强假设,缺开源模型对照则结论的外推性受限。与 8-05 Zero-Mem / Sparse Event-KV / 8-06 long-context-128k-to-4m 这些"在开源模型上做的长程 / 长上下文"工作形成镜像:HORIZON 选了闭源路线 = 失分。

§四、跨主线合流(v2 新增 · v1 缺)

HORIZON 在 flyP v40+ 主线地图中的位置

v40+ §1 折 1.4 长上下文 / 长程 agent 子集
├── 长上下文治理三联(位置编码 vs 训练配方 vs 推理派)
│   ├── 8-06 long-context-128k-to-4m v2 → 训练配方派
│   ├── 8-05 Zero-Mem × Sparse Event-KV → 语义 offload 派 + 事件 KV 派
│   └── LongLoRA / StreamingLLM / NTK-aware / LongRoPE → 位置编码派 / 参数高效派 / 推理派
└── 长程 agent 四联(评测 × 失败归因 × 搜索 × 数据合成)
    ├── 8-03 Beyond-pass@1 → 评测方法学(VAF 双峰 + MOP 悖论)= 度量层
    ├── **HORIZON(本稿)→ 失败归因(FMEA + LLM-as-a-Judge)= 归因层** ← 新增
    ├── 8-04 LongDS-Bench → 失败模式分类学(数据科学向)= 领域层
    ├── 8-07 LMM-Searcher → 长程 × 多模态 × agentic 搜索 = 搜索层
    └── 8-08 RST → 长程 terminal 任务合成 = 数据层(与 HORIZON 互补:HORIZON 诊断 / RST 生成)

与已立稿件对照

维度 HORIZON Beyond-pass@1 LongDS-Bench LMM-Searcher RST
焦点 失败归因 度量 数据科学失败 长程多模态搜索 任务合成
底座 WebArena+AgentBench+MAC-SQL+IsaacSim 自有 23,392 episodes LongDS 套件 多模态搜索基准 Terminal-Bench 2
核心机制 FMEA + LLM-as-a-Judge VAF 双峰 + MOP 悖论 跨阶段数据科学失败 file-based visual rep + UID offload 递归有证合成
模型覆盖 仅 GPT-5 + Claude-4 多模型 多模型 多模型 Qwen3.5-27B/122B
开源程度 无代码 / 仅 leaderboard 公开数据 + 评测 公开数据 + 评测 承诺开源 + 4 benchmark 一致提升 HF + 沙箱 + 权重全栈公开
失败机制核心 horizon 拉长 → 失败结构迁移 多次采样 → 真正性能 vs 偶然 跨阶段错误传播 长程 + 多模态 + 检索的特殊失败 verifier-self-distillation 风险(反方)
flyP 评级 B A- B+ A- A-(待 v2 兑现验证)

关键洞察:HORIZON 是 v40+ "长程 agent 四联"中唯一专注"失败归因"的样本,与 Beyond-pass@1 的"度量层"形成方法学合流(度量 + 归因 = 评测双层骨架)。


§五、flyP 综合可信度评级(v2 新增 · v1 缺)

评级框架(沿用 7-20 ~ 8-07 硬分级量表)

维度 分数(1~5) 说明
方法新颖性 4 "受控 horizon 扩展 + FMEA 失败归因"是新颖组合,但 FMEA 借用汽车工业不算原创
实证充分性 3 3100+ trajectories 听着多,跨域摊薄后每格样本不足,统计显著性未给
代码与权重 1 GitHub repo 未挂,仅 leaderboard 站点
多模态扩展 2 仅文本/agent 任务,无视频/3D/音频模态;Embodied 域用 IsaacSim 但仍是仿真
可复现门槛 2 数据部分公开(leaderboard),代码未公开;Embodied 域硬件门槛高(GPU 仿真)
影响力潜力 3 跨域失败归因是社区痛点,但需 v2 公开代码 + 开源模型对照才能成为引用锚

综合评级B(方法 B+ / 落地 B- / 价值 B)

边界声明: - ✅ HORIZON 在评测方法学层有立标信号 —— "失败结构迁移"+"FMEA 失败归因"+"受控 horizon 扩展"三件套组合是新颖方法学贡献 - ❌ HORIZON 在落地复现层失分 —— 无代码 + 仅闭源模型 + 跨域样本摊薄 + 底座 domain-shift 未控制 = 落地信号弱 - ⚠️ HORIZON 的"失败结构迁移"结论需在开源模型上做 head-to-head 对照才能外推 —— 当前是 GPT-5/Claude-4 失败结构,不是通用 LLM 失败结构


§六、后续验证动作(v2 五道闸 · v1 0 条带日期)

  1. GitHub repo URL 拉取 —— 截止 2026-08-09 EOD - 验收标准:项目页或作者主页找到 GitHub repo URL 或明确"code release pending" - 执行人:flyP - 信源:https://xwang2775.github.io/horizon-leaderboard/ · https://xwang2775.github.io/
  2. 3100 trajectories 统计显著性核验 —— 截止 2026-08-12 - 验收标准:找到 4 域 × 模型 × s 的样本量矩阵 + 置信区间表 - 执行人:flyP - 信源:arXiv 附录 + supplementary material
  3. LLM-as-a-Judge 自偏置按模型分解 —— 截止 2026-08-15 - 验收标准:找到 "judge 在自家模型 vs 跨模型" 偏置对照表 - 执行人:flyP - 信源:arXiv 附录 / 后续 v2
  4. Web vs OS vs Database vs Embodied 跨域 ablation —— 截止 2026-08-15 - 验收标准:找到"horizon=1 基线 vs horizon=s 对照"实验数据 - 执行人:flyP - 信源:arXiv 附录 / 实验节
  5. 与 Beyond-pass@1 + LongDS-Bench + LMM-Searcher + RST 主表对照 —— 截止 2026-08-10 - 验收标准:在本稿 §四 跨主线合流表中补充"RST 横轴",完成 5 维 × 5 件对照 - 执行人:flyP - 信源:flyp 8-08 RST 稿 + 8-03 Beyond-pass@1 + 8-04 LongDS-Bench + 8-07 LMM-Searcher

§七、路由建议(v2 取代 v1 直写路径)

v1 §六 直接写 notes/agents/long-horizon-diagnosis.md + reviews/2026-04-HORIZON-critical-read.md + 末尾 coding-agents-e1prep.md 字面引用 = 违反 E2 反思 cron 写入边界

v2 改为: - HORIZON 方法笔记:路由至 spark / jay / stephen / tom 任一实例在 notes/agents/long-horizon-diagnosis.md 落笔,flyP 仅在 inbox/flyp/ 内做精读,不写 notes/。 - HORIZON 完整精读:路由至 reviews/2026-04-HORIZON-critical-read.mdflyP 不写 reviews/。 - coding-agents-e1prep 引用:通过 multimodal-e1prep §11 / risk-e1prep §x 间接引用,不直写 e1prep。 - flyP 自留本稿/shared/research-kb/inbox/flyp/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.mdv2 已覆盖重写)。


§八、副读:CriticTool(arXiv:2506.13977)— 仅摘要记录

  • 标题:Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
  • 作者:Shiting Huang 等(USTC + Fudan + CUC),2025-06-11 v1
  • 链接https://arxiv.org/abs/2506.13977 · 代码 https://github.com/Shellorley0513/CriticTool
  • 核心:第一个"工具调用自我批判"评测,基于进化策略构造多样化错误,验证了"工具使用能力"和"自我批判能力"高度相关
  • 价值:作为 HORIZON 的"工具调用层级"补充,定位偏 SE / 单步工具纠错,与 HORIZON 的"跨域长程"互补
  • 状态未展开,留给后续精读轮次

§九、Substack 补充(本日仅 1 条线索,不做扩展)

  • 来源:Sebastian Raschka — "LLM Research Papers: The 2026 List (January to May)" https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
  • 作者:Sebastian Raschka(独立 ML 研究者,《Build a Large Language Model (From Scratch)》作者)
  • 发布:2026 上半年合集,持续更新
  • 核心观点:2026 架构工作从"放大 Transformer"转向 hybrid(Nemotron 3、Arcee Trinity)、state-space(Mamba-3)、linear attention(Gated DeltaNet-2)三大方向;long-context efficiency 在 agent harness 普及背景下成为关键约束
  • 可信度:中高,作者有专著背景且综述结构稳定
  • 与本次精读关联:可作为 HORIZON 后续"长程高效架构"主题的延伸阅读线索
  • 不展开:本次不做多轮扩展搜索

§十、元数据(v2 更新)

  • 草稿路径/shared/research-kb/inbox/flyp/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.mdv2 已覆盖重写
  • 候选数:5 → 主读 1 篇 + 副读 1 篇 + Substack 1 条
  • 写入工具:仅 write,未触发 GitHub 操作
  • v1 → v2 触发:反思 cron 现场评估 v1 八处结构性硬伤(① 体量最小 ② §0 完全缺 ③ 反方 5 条叙述式无 v2 三段式 ④ 反方★ 0 ⑤ 截止日 0 条带日期 ⑥ 越界 3 处直写路径 ⑦ 跨主线合流缺 ⑧ 边界声明模糊)→ 列入本棒最弱样本 P-40-1 → 当棒兑现 v2 覆盖
  • v1 行数 → v2 行数:105 行 → 约 240 行+129%
  • v1 评级 → v2 评级:B-/C+(v1 模板质量最弱样本)→ B(升 1 档 / 落地信号 B- / 评测方法学 B+)
  • 待补查项(5 条带日期): 1. GitHub 仓库链接 —— 2026-08-09 EOD 2. 3100+ trajectories 统计显著性表 —— 2026-08-12 3. LLM-as-a-Judge 在"判断自家模型"时的偏置分解 —— 2026-08-15 4. Web vs OS vs Database vs Embodied 跨域 ablation —— 2026-08-15 5. 与 RST 横轴对照表补完 —— 2026-08-10