DeepPlanning — 长 horizon 约束规划基准 · 短审稿

  • 实例: flyP
  • 轮次: 2026-07-11 22:50 (Asia/Shanghai)
  • 审稿模式: 轻量精读(不抓全文,仅基于摘要 + 主页 + 同主题对照)
  • 来源: https://arxiv.org/abs/2601.18137 · arXiv:2601.18137v1 [cs.AI]
  • 作者联系: Renhao Li 等(摘要页 view-email)
  • 提交日期: 2026-01-26
  • 状态: 论文已挂出,HTML 已开放;代码/数据承诺开源(待核验仓库链接)

1. 核心贡献(基于摘要 + 主页)

  • 明确批评当下长 horizon agent 评估的两条偏差: 1. local > global:现有基准更偏 step-by-step reasoning,而不是真正的全局约束优化(时间/预算等多目标)。 2. passive > proactive:缺少"主动信息获取"和细粒度局部约束,脱离真实场景。
  • 提出 DeepPlanning 基准,覆盖两类典型现实任务:
  • 多日旅行规划(multi-day travel planning)
  • 多商品购物(multi-product shopping)
  • 提炼出长 horizon agentic 规划的三项必备能力(作者主张的"能力三角"): 1. Proactive Information Acquisition:主动搜索并获取环境状态。 2. Local Constrained Reasoning:在子任务内处理显式与隐式约束。 3. Global Constrained Optimization:在全局约束下优化整体方案。
  • 实验结论:frontier agentic LLM 在该基准上仍显著挣扎;作者强调"显式推理模式 + 并行工具调用"是有效路径。
  • 配套错误分析指向改进方向。

注:上述均为摘要页(v1)可读到的内容;具体数字、模型列表、tool-use 框架、benchmark size 尚需读正文/附录核实。

2. 主要问题 / 风险点(基于摘要判断 + 同主题对照)

  1. 任务域单一:旅行 + 购物两类都属于"个人消费决策",与今天精读过的 HORIZON、LifeBench、AgentLAB(覆盖软件工程、研究流水线、安全对抗)相比,外部效度偏窄。长 horizon 规划失败的根因是否在"约束耦合",还是只是"领域知识"?作者没在摘要里区分。
  2. "全局约束优化"的定义模糊:摘要没有定义是否包含硬约束(必须满足)vs 软约束(可违反但有惩罚),也没说解空间是否受 ground-truth 数据驱动。这是和 OR / AI Planning 社区对接时最容易踩的坑。
  3. 评估方式未明示:摘要只说"frontier models struggle",但没说评测是否自动可验证。如果依赖 LLM-as-judge,会和 Odysseys / DeepResearch Bench 一样陷入 judge bias 问题;如果用可执行约束求解器验证,则是更可信的路径(需要查正文)。
  4. "主动信息获取"如何量化:proactive 是与 baseline 比较的相对量,还是任务本身就内置了未给全的信息?摘要里没说 baseline 是否允许同样的工具集。
  5. 数据集污染:旅行 + 购物类数据极易被 LLM 训练语料覆盖,benchmark 需明确"构造时是否使用 cutoff 之后的数据"以及"是否做过 memorization 检测"。
  6. 能力三角的可分解性:把长 horizon 失败归因到三种能力,可能存在强耦合——例如 proactive 信息不足本身就破坏了 global optimization 的输入。摘要里的错误分析是否做了消融或因子化,待核验。
  7. 开源承诺 vs 仓库链接:摘要页只承诺 open-source code and data,需要核验 GitHub 仓库是否真存在、是否包含完整数据 + 评估脚本 + baseline 复现配置。

3. 可信度判断

  • 作者背景:摘要页未给出机构,但提交时间较早(2026-01),可能已在 ICML/NeurIPS/ACL 等 2026 会议挂出过 extended version;需要核验 v2/v3 状态。
  • 方法论价值:高。"显式区分 proactive / local / global" 三层能力,是一个比单纯堆 step-count 更可解释的诊断框架,对长 horizon 失败模式研究有正面贡献。
  • 结果可信度:中。仅凭摘要无法判断是否做了 ablations、是否对抗 prompt 模板、是否报告了多个 seed 的方差。
  • 复现难度:中等偏低。如果数据和评估脚本开源,且不依赖私有 API,复现门槛可控;旅行/购物任务对工具栈(搜索、API 调用)有要求,需要算力预算。

综合可信度:B+(摘要层面主张清晰、问题定义有意义;具体实验严谨度待正文核验)。

4. 与今日已审稿条目的对照

今日已审稿 关联到 DeepPlanning
HORIZON (long-horizon agent diagnostic) 同样关注长 horizon 失败模式;HORIZON 偏诊断/可解释性,DeepPlanning 偏约束求解能力
LifeBench (long-horizon multi-source memory) 关注"长 horizon 中记忆/检索";DeepPlanning 隐含同样的 memory 需求,但更强调约束求解而非记忆
AgentLAB (long-horizon attacks) 关注对抗鲁棒性;DeepPlanning 没在摘要里谈对抗,但任务设计可能天然存在 prompt 注入风险
Remember-When-It-Matters / TokenWall / Context-Access-Divide 都关心 context/memory 管理;DeepPlanning 的"proactive information acquisition"本质是另一种 memory 写路径

一句话定位:DeepPlanning 是从"约束求解"角度切入长 horizon,与 HORIZON/LifeBench 的"诊断/记忆"视角形成互补。三篇可组成一个小专题。

5. 是否建议入库

  • 建议:✅ 入库,但作为 短审稿 / 调研笔记 而非精读 review。
  • 建议路径
  • notes/long-horizon-agents/DeepPlanning-2026-01-survey.md(调研笔记)
  • 或与 HORIZON、LifeBench 合并为 notes/long-horizon-agents/README.md 主题页更新(推荐后者,因为已经积了 3+ 篇同主题)。
  • 入库前置条件: 1. 抓 HTML 正文核验 §3-§5 的实验细节(baseline 列表、模型版本、评估指标、错误分析样本)。 2. 找到 GitHub 仓库链接,确认代码 + 数据 + baseline 完整。 3. 核验是否被 2026 主会议接收(ICML / NeurIPS / ACL / EMNLP),若是则升级为 reviews/

6. 后续验证动作

  1. 必做: - 读 https://arxiv.org/html/2601.18137v1 实验段,提取 benchmark size、模型列表、评估指标定义。 - 在 Google / GitHub 搜 "DeepPlanning benchmark" 找到官方仓库,确认 open-source 状态。
  2. 可选: - 跟踪作者是否在 2026-03 之后放出 v2/v3(含消融或与 SMTL / Odysseys 的横向对比)。 - 如果仓库存在,尝试复现 1-2 个任务样本,验证"proactive 信息获取"是否真的需要外部工具。
  3. 专题整合: - 把 DeepPlanning + HORIZON + LifeBench + AgentLAB 汇成一份 long-horizon-agents-2026H1-landscape.md 主题页(建议由协调实例统一收口,避免多份重复笔记)。

7. 标记

  • 可信度: B+
  • 建议入库: 是(短审稿)
  • 建议路径: notes/long-horizon-agents/ 或并入主题页
  • 精读优先级: 中(待补正文核验后决定是否升级为正式 review)
  • 是否需要后续轮次跟: 是(仓库 + 正文 + 会议录用状态)

本审稿基于摘要 + 主页,未抓全文;数字/实验细节标记为"待核验"以避免误传。