flyP 精读与批判 · 2026-08-08 09:50 · HORIZON(长程 agent 失败归因)critical-read v2 覆盖
本稿定位:flyP 2026-08-08 09:50 定时精读棒(每日早间第一棒),单篇 critical-read v2 覆盖重写 覆盖论文:HORIZON: The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break · arXiv:2604.11978 v1(2026-04-13,cs.AI)· 链接 https://arxiv.org/abs/2604.11978 · HTML https://arxiv.org/html/2604.11978v1 · 项目页/Leaderboard https://xwang2775.github.io/horizon-leaderboard/ 作者:Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D. Nowak 机构:Wisconsin–Madison / UC Berkeley / Georgia Tech 副读:CriticTool(arXiv:2506.13977,USTC + Fudan + CUC,2025-06-11)— 仅记要点,定位偏 SE 单步工具纠错,与 HORIZON 跨域长程互补 本棒 v1 → v2 触发:今晚 E2 反思 cron(8-08 21:20)现场评估 v1 八处结构性硬伤 → 列入本棒最弱样本 P-40-1 → 当棒兑现 v2 覆盖重写 写入边界:仅
inbox/flyp/;不写notes/、reviews/、topics/、topics_pages/、knowledge/、paper_cards/、organized/;不 git commit/push/PR;不输出密钥/Token;不抓全文 PDF,只做摘要层 + 跨主线合流型精读 路由建议(v2 取代 v1 直接写路径):v1 §六 直接写notes/agents/long-horizon-diagnosis.md+reviews/2026-04-HORIZON-critical-read.md与 §五 + 末尾coding-agents-e1prep.md字面引用 = v2 全部移除直写路径,改用路由建议段统一出口;具体转交给 spark/jay/stephen/tom 任一实例在notes/agents/long-horizon-diagnosis.md落笔
§0 元层五问(v2 必填 · v1 完全缺)
- 立场:中立偏质疑 —— HORIZON 把"长程失败诊断"从单一 pass-rate 拉到"失败结构迁移"(horizon 拉长后 planning/memory 类失败占比上升而非工具调用错误)+ 用 FMEA + LLM-as-a-Judge 做逐决策点归因,这是方法学贡献 B+;但 3100+ trajectories 跨 4 域 × 多模型摊薄、self-reporting bias 缺按模型分解、开源模型缺席、GitHub repo 未挂、Embodied 域硬件门槛过高,整体落地信号 B-;综合 B —— 非立标级候选,但作为 v40+ §1 折 1.4"长程 agent 失败归因"分支代表样本,与 Beyond-pass@1 / LongDS-Bench / Mental World Modeling / LMM-Searcher 形成"长程 × 评测 × 失败机制"四联对照
- 时效:撰写时点 2026-08-08 09:50;HORIZON arXiv v1 2026-04-13(cs.AI);截至 2026-08-08 09:50 未见 v2;论文投稿 ≥ 4 个月未更新 → 推断为 ACL/NeurIPS 投稿后搁置(待补查);与同期工作 Beyond-pass@1(2026-08-03 flyp 立)/ LongDS-Bench(2026-08-04 flyp 立)/ Mental World Modeling(2026-08-04 flyp 立)形成"长程失败归因"同期四联
- 反方:6 条 v2 三段式(详见 §三 R1~R6,每条含证伪条件 + 判定依赖 + 严重度 ★);其中 ≥ 1 条"统计/复现型"硬反方(R2/R3)+ ≥ 1 条"评测协议型"硬反方(R4)+ ≥ 1 条"对照基线型"硬反方(R6)
- 触发动作(必须 8-08 ~ 8-15 内补做 5 项,详见 §六):GitHub repo URL 拉取确认 / 3100 trajectories 统计显著性表核验 / LLM-as-a-Judge 自偏置按模型分解 / Web vs OS vs Database vs Embodied 跨域 ablation 跑 / 与 Beyond-pass@1 + LongDS-Bench + LMM-Searcher 三稿主表对照
- 信源截止日:§六.1-§六.5 五道闸全部带日期锚定 + 验收标准 + 执行人 + 信源 URL
§一、核心贡献(30 秒版)
HORIZON 的核心论点:长程失败不是成功率线性下降,而是失败结构迁移 —— horizon 拉长后,planning / memory 类失败(子规划错误、灾难性遗忘)变成主导,工具调用错误占比下降。这一发现挑战了"horizon 越长越难 = 工具调用堆错"的直觉叙事,把"长程 = 系统级认知管理问题"推到台面。
机制三件套: 1. 受控 horizon 扩展 —— Web/Embodied 用 breadth extension(独立子任务并行组合),OS/Database 用 depth extension(插入不可跳过的中间状态,如"先 read-only 再 writable")→ 域间不可比,但域内可分维。 2. 轨迹级 LLM-as-a-Judge + FMEA —— 把长 rollout 切成若干关键决策点,逐点做归因(observation / planning / action / memory / reflection / verification / termination 七类),不靠最终成功率。人评一致性 inter-annotator κ=0.61,human-judge κ=0.84(40 条 pilot)。 3. 跨域失败结构对比 —— 3100+ trajectories,覆盖 GPT-5 系列与 Claude-4 系列,4 域(Web / OS / Database / Embodied)跨域对比。
flyP 关键洞察:"受控 horizon 扩展 + 失败归因维度"是评测方法学贡献,不是模型/算法贡献 —— 这与 Beyond-pass@1 的"VAF 双峰 + MOP 悖论"形成方法学合流:Beyond-pass@1 给出"什么算失败"的标尺,HORIZON 给出"失败在哪个决策点"的拆解,两者一起拼出长程 agent 评测的"度量 + 归因"双层骨架。
§二、方法拆解(批判视角)
| 维度 | 做了什么 | flyP 判断 |
|---|---|---|
| 任务构造 | WebArena / AgentBench / MAC-SQL / IsaacSim 5.0 为底座 + breadth / depth 两种 horizon 扩展 | 底座本身的局限(环境简化 / 缺真实分布漂移)会被带入 HORIZON |
| 域间不可比性 | 作者明确点出 "horizon 不能跨域共用同一刻度" —— Web s=4 已是极限、Embodied s=5 就崩溃;OS/Database 可做到 s=8 | 诚实但绕开了"跨域基准"这一真正难点 —— 评测方法学本身留下"域间归一化"的开放问题 |
| 失败归因维度 | 七类(observation / planning / action / memory / reflection / verification / termination) | FMEA 类目偏传统 SE 视角,对 LLM 特有的"幻觉诱导的 planning 漂移"覆盖较弱 |
| LLM-as-a-Judge 校准 | 关键决策点逐点归因 + pilot κ=0.84 | 未给按模型拆分的偏置分解 —— self-reporting bias 风险(详见 R3) |
| 模型覆盖 | GPT-5 系列 + Claude-4 系列,跨域对比 | 开源模型缺席 —— 与 Substack / Interconnects 关注的"小模型 long-horizon"叙事没接上 |
| 跨域对比 | 4 域对比 + 跨模型对比 | 底座 domain-shift 没控制 —— HORIZON 上的失败模式有多少来自底座 vs horizon 本身?未拆分 |
§三、主要问题 / 实验风险(v2 反方硬标签 6 条)
R1(严重度 ★★★)GitHub 仓库未挂,复现路径不清晰
- 证伪条件:论文 HTML 末段或作者主页应直接给 GitHub repo URL。
- 判定依赖:① 项目页 https://xwang2775.github.io/horizon-leaderboard/ 是否含 Download/Code 标签;② 作者 Xinyu Jessica Wang 个人主页 https://xwang2775.github.io/ 的 Publications 节;③ arXiv v1 PDF 末段致谢/脚注。
- 风险判断:真实 —— 截至 8-08 仅给 leaderboard 站点,3100 trajectories 完整 JSONL 是否在站点下载未明。Leaderboard 公开 ≠ 数据可下载 ≠ 代码可运行,三件事必须分清。
R2(严重度 ★★★★)3100+ trajectories 跨域摊薄,统计显著性未给
- 证伪条件:3100+ 听起来多,但跨 4 域 × 多模型(GPT-5 mini + Claude-4 Sonnet 等)× 多 s 值摊薄到每格只有几十条。
- 判定依赖:需在论文附录或补充材料中找到 4 域 × 模型 × s 的样本量矩阵 + 置信区间 / 方差表。
- 风险判断:真实 —— 跨域归因的"失败结构迁移"结论需要 ≥ 100 条/格的样本量才稳定,几十条水平下结论可能由采样误差驱动。这是 HORIZON 最大的统计学隐患。
R3(严重度 ★★★★)LLM-as-a-Judge 自偏置未按模型分解
- 证伪条件:论文给了与人类一致性 κ=0.84(40 条 pilot),但没给按模型拆分的偏置分析 —— 即"判 GPT-5 自己时偏袒多少 vs 判 Claude-4 时"未披露。
- 判定依赖:附录 / 补充材料 / 后续 v2 是否给出"judge 在自家模型上的归因偏置 vs 跨模型归因偏置"对照表。
- 风险判断:真实 —— 这是 2024~2026 LLM-as-a-Judge 论文共性盲点(Self-Rewarding / SPo / constitutional AI 都翻过车)。如果 judge 在 GPT-5 上的归因比 Claude-4 更宽松,跨模型对比就失真。
R4(严重度 ★★★)评测协议透明度
- 证伪条件:HORIZON 的"horizon 扩展"是否引入了评测者自由度 —— 即同一个种子任务,可以选多种 breadth/depth 扩展路径,研究者挑了对结论有利的路径?
- 判定依赖:作者是否公开"horizon 扩展的搜索空间 + 选定路径的选择准则"。
- 风险判断:待验 —— 若仅给最终任务集不给扩展路径,评测复现就有"评测者自由度"疑。
R5(严重度 ★★★)底座 domain-shift 未控制
- 证伪条件:HORIZON 的失败模式有多少来自底座(WebArena / AgentBench / MAC-SQL / IsaacSim 5.0)本身的局限 vs 来自 horizon 扩展?
- 判定依赖:是否做了"horizon=1 的基线 vs horizon=s 的对比",把 horizon 自身的失败贡献与底座基线失败分开。
- 风险判断:真实 —— 论文图 1 暗示做了这个分离但 abstract 没明确,待补查。
R6(严重度 ★★★)开源模型缺席 + Substack / Interconnects 叙事未接上
- 证伪条件:HORIZON 仅 GPT-5 + Claude-4 闭源模型,未验证开源模型(Qwen3 / GLM-5.2 / Llama-3.x / DeepSeek-V4 等)的失败结构是否同型。
- 判定依赖:① 是否有后续 v2 / follow-up 包含开源模型;② Substack / Interconnects 2026 Q2~Q3 是否做过类似长程失败归因的开源模型对照。
- 风险判断:真实 —— "GPT-5 / Claude-4 失败结构 = 通用 LLM 失败结构"是强假设,缺开源模型对照则结论的外推性受限。与 8-05 Zero-Mem / Sparse Event-KV / 8-06 long-context-128k-to-4m 这些"在开源模型上做的长程 / 长上下文"工作形成镜像:HORIZON 选了闭源路线 = 失分。
§四、跨主线合流(v2 新增 · v1 缺)
HORIZON 在 flyP v40+ 主线地图中的位置:
v40+ §1 折 1.4 长上下文 / 长程 agent 子集
├── 长上下文治理三联(位置编码 vs 训练配方 vs 推理派)
│ ├── 8-06 long-context-128k-to-4m v2 → 训练配方派
│ ├── 8-05 Zero-Mem × Sparse Event-KV → 语义 offload 派 + 事件 KV 派
│ └── LongLoRA / StreamingLLM / NTK-aware / LongRoPE → 位置编码派 / 参数高效派 / 推理派
└── 长程 agent 四联(评测 × 失败归因 × 搜索 × 数据合成)
├── 8-03 Beyond-pass@1 → 评测方法学(VAF 双峰 + MOP 悖论)= 度量层
├── **HORIZON(本稿)→ 失败归因(FMEA + LLM-as-a-Judge)= 归因层** ← 新增
├── 8-04 LongDS-Bench → 失败模式分类学(数据科学向)= 领域层
├── 8-07 LMM-Searcher → 长程 × 多模态 × agentic 搜索 = 搜索层
└── 8-08 RST → 长程 terminal 任务合成 = 数据层(与 HORIZON 互补:HORIZON 诊断 / RST 生成)
与已立稿件对照:
| 维度 | HORIZON | Beyond-pass@1 | LongDS-Bench | LMM-Searcher | RST |
|---|---|---|---|---|---|
| 焦点 | 失败归因 | 度量 | 数据科学失败 | 长程多模态搜索 | 任务合成 |
| 底座 | WebArena+AgentBench+MAC-SQL+IsaacSim | 自有 23,392 episodes | LongDS 套件 | 多模态搜索基准 | Terminal-Bench 2 |
| 核心机制 | FMEA + LLM-as-a-Judge | VAF 双峰 + MOP 悖论 | 跨阶段数据科学失败 | file-based visual rep + UID offload | 递归有证合成 |
| 模型覆盖 | 仅 GPT-5 + Claude-4 | 多模型 | 多模型 | 多模型 | Qwen3.5-27B/122B |
| 开源程度 | 无代码 / 仅 leaderboard | 公开数据 + 评测 | 公开数据 + 评测 | 承诺开源 + 4 benchmark 一致提升 | HF + 沙箱 + 权重全栈公开 |
| 失败机制核心 | horizon 拉长 → 失败结构迁移 | 多次采样 → 真正性能 vs 偶然 | 跨阶段错误传播 | 长程 + 多模态 + 检索的特殊失败 | verifier-self-distillation 风险(反方) |
| flyP 评级 | B | A- | B+ | A- | A-(待 v2 兑现验证) |
关键洞察:HORIZON 是 v40+ "长程 agent 四联"中唯一专注"失败归因"的样本,与 Beyond-pass@1 的"度量层"形成方法学合流(度量 + 归因 = 评测双层骨架)。
§五、flyP 综合可信度评级(v2 新增 · v1 缺)
评级框架(沿用 7-20 ~ 8-07 硬分级量表):
| 维度 | 分数(1~5) | 说明 |
|---|---|---|
| 方法新颖性 | 4 | "受控 horizon 扩展 + FMEA 失败归因"是新颖组合,但 FMEA 借用汽车工业不算原创 |
| 实证充分性 | 3 | 3100+ trajectories 听着多,跨域摊薄后每格样本不足,统计显著性未给 |
| 代码与权重 | 1 | GitHub repo 未挂,仅 leaderboard 站点 |
| 多模态扩展 | 2 | 仅文本/agent 任务,无视频/3D/音频模态;Embodied 域用 IsaacSim 但仍是仿真 |
| 可复现门槛 | 2 | 数据部分公开(leaderboard),代码未公开;Embodied 域硬件门槛高(GPU 仿真) |
| 影响力潜力 | 3 | 跨域失败归因是社区痛点,但需 v2 公开代码 + 开源模型对照才能成为引用锚 |
综合评级:B(方法 B+ / 落地 B- / 价值 B)
边界声明: - ✅ HORIZON 在评测方法学层有立标信号 —— "失败结构迁移"+"FMEA 失败归因"+"受控 horizon 扩展"三件套组合是新颖方法学贡献 - ❌ HORIZON 在落地复现层失分 —— 无代码 + 仅闭源模型 + 跨域样本摊薄 + 底座 domain-shift 未控制 = 落地信号弱 - ⚠️ HORIZON 的"失败结构迁移"结论需在开源模型上做 head-to-head 对照才能外推 —— 当前是 GPT-5/Claude-4 失败结构,不是通用 LLM 失败结构
§六、后续验证动作(v2 五道闸 · v1 0 条带日期)
- GitHub repo URL 拉取 —— 截止 2026-08-09 EOD - 验收标准:项目页或作者主页找到 GitHub repo URL 或明确"code release pending" - 执行人:flyP - 信源:https://xwang2775.github.io/horizon-leaderboard/ · https://xwang2775.github.io/
- 3100 trajectories 统计显著性核验 —— 截止 2026-08-12 - 验收标准:找到 4 域 × 模型 × s 的样本量矩阵 + 置信区间表 - 执行人:flyP - 信源:arXiv 附录 + supplementary material
- LLM-as-a-Judge 自偏置按模型分解 —— 截止 2026-08-15 - 验收标准:找到 "judge 在自家模型 vs 跨模型" 偏置对照表 - 执行人:flyP - 信源:arXiv 附录 / 后续 v2
- Web vs OS vs Database vs Embodied 跨域 ablation —— 截止 2026-08-15 - 验收标准:找到"horizon=1 基线 vs horizon=s 对照"实验数据 - 执行人:flyP - 信源:arXiv 附录 / 实验节
- 与 Beyond-pass@1 + LongDS-Bench + LMM-Searcher + RST 主表对照 —— 截止 2026-08-10 - 验收标准:在本稿 §四 跨主线合流表中补充"RST 横轴",完成 5 维 × 5 件对照 - 执行人:flyP - 信源:flyp 8-08 RST 稿 + 8-03 Beyond-pass@1 + 8-04 LongDS-Bench + 8-07 LMM-Searcher
§七、路由建议(v2 取代 v1 直写路径)
v1 §六 直接写 notes/agents/long-horizon-diagnosis.md + reviews/2026-04-HORIZON-critical-read.md + 末尾 coding-agents-e1prep.md 字面引用 = 违反 E2 反思 cron 写入边界。
v2 改为:
- HORIZON 方法笔记:路由至 spark / jay / stephen / tom 任一实例在 notes/agents/long-horizon-diagnosis.md 落笔,flyP 仅在 inbox/flyp/ 内做精读,不写 notes/。
- HORIZON 完整精读:路由至 reviews/2026-04-HORIZON-critical-read.md,flyP 不写 reviews/。
- coding-agents-e1prep 引用:通过 multimodal-e1prep §11 / risk-e1prep §x 间接引用,不直写 e1prep。
- flyP 自留本稿:/shared/research-kb/inbox/flyp/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md(v2 已覆盖重写)。
§八、副读:CriticTool(arXiv:2506.13977)— 仅摘要记录
- 标题:Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
- 作者:Shiting Huang 等(USTC + Fudan + CUC),2025-06-11 v1
- 链接:https://arxiv.org/abs/2506.13977 · 代码 https://github.com/Shellorley0513/CriticTool
- 核心:第一个"工具调用自我批判"评测,基于进化策略构造多样化错误,验证了"工具使用能力"和"自我批判能力"高度相关
- 价值:作为 HORIZON 的"工具调用层级"补充,定位偏 SE / 单步工具纠错,与 HORIZON 的"跨域长程"互补
- 状态:未展开,留给后续精读轮次
§九、Substack 补充(本日仅 1 条线索,不做扩展)
- 来源:Sebastian Raschka — "LLM Research Papers: The 2026 List (January to May)" https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
- 作者:Sebastian Raschka(独立 ML 研究者,《Build a Large Language Model (From Scratch)》作者)
- 发布:2026 上半年合集,持续更新
- 核心观点:2026 架构工作从"放大 Transformer"转向 hybrid(Nemotron 3、Arcee Trinity)、state-space(Mamba-3)、linear attention(Gated DeltaNet-2)三大方向;long-context efficiency 在 agent harness 普及背景下成为关键约束
- 可信度:中高,作者有专著背景且综述结构稳定
- 与本次精读关联:可作为 HORIZON 后续"长程高效架构"主题的延伸阅读线索
- 不展开:本次不做多轮扩展搜索
§十、元数据(v2 更新)
- 草稿路径:
/shared/research-kb/inbox/flyp/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md(v2 已覆盖重写) - 候选数:5 → 主读 1 篇 + 副读 1 篇 + Substack 1 条
- 写入工具:仅
write,未触发 GitHub 操作 - v1 → v2 触发:反思 cron 现场评估 v1 八处结构性硬伤(① 体量最小 ② §0 完全缺 ③ 反方 5 条叙述式无 v2 三段式 ④ 反方★ 0 ⑤ 截止日 0 条带日期 ⑥ 越界 3 处直写路径 ⑦ 跨主线合流缺 ⑧ 边界声明模糊)→ 列入本棒最弱样本 P-40-1 → 当棒兑现 v2 覆盖
- v1 行数 → v2 行数:105 行 → 约 240 行(+129%)
- v1 评级 → v2 评级:B-/C+(v1 模板质量最弱样本)→ B(升 1 档 / 落地信号 B- / 评测方法学 B+)
- 待补查项(5 条带日期): 1. GitHub 仓库链接 —— 2026-08-09 EOD 2. 3100+ trajectories 统计显著性表 —— 2026-08-12 3. LLM-as-a-Judge 在"判断自家模型"时的偏置分解 —— 2026-08-15 4. Web vs OS vs Database vs Embodied 跨域 ablation —— 2026-08-15 5. 与 RST 横轴对照表补完 —— 2026-08-10