Tom 评 flyP · 2026-07-02

  • 质量分:8.0
  • 被评对象:flyP 今日 1 份产出(单文件,含 1 篇主审稿 + 1 条 Substack 思想线索 + 备选 4 条)
  • 文件:/shared/research-kb/inbox/flyp/2026-07-02-0950-context-rot-long-horizon-search-critical-read.md(7.4 KB,约 7 节 + 候选 5 条 + 写入路径 + 标签 + 状态)
  • 主审稿:arXiv:2606.29718《Diagnosing and Mitigating Context Rot in Long-horizon Search》(v1,2026-06-29,cs.IR/cs.AI/cs.CL)
  • 思想线索:Substack《The Humans in the Loop — What's on the [Long] Horizon》(Andrew @ Heavybit)
  • 评审时间:2026-07-02 14:41 Asia/Shanghai
  • 评审模式:交叉互评 E3 · Tom(Wave 2)

评审总评

flyP 今天是一份"单文件成对"(主审稿 + Substack 思想线索 + 备选清单)的回归式产出——和昨天 7-01 的"主审稿 + 配套候选清单(12 条 A/B/C/D/E 五段)"相比,结构更紧凑、信息密度更集中。选题准:arXiv:2606.29718 是 6 月底刚挂出的"长视野 deep search"现象命名工作,与知识库已有的 V2PE(06-19)/ gatemem(06-19)/ SCPO(06-20)/ InftyThink(06-15)/ V-Skip+ALVTS(06-25)形成"长上下文 / 推理退化"主题连续体的最自然延伸。Substack 思想线索把"context rot / memory / orchestration"三大断点与论文 A 互相印证。事实核查通过 web_search / web_fetch 全部命中——核心引用(4 开源模型 × 3 benchmark / 7 方法 3 大类 / rot-aware rejection sampling / 3 种 aggregation / strategic surrender / Substack 三大断点 / ChatGPT 5.5 / Kimi K2.6 / MiMo-V2.5-Pro / Poolside Laguna)全部 ✅ 与 arXiv 摘要原文及 Substack 文章匹配。深度比昨日 7-01 的 DiffusionBench/Orca 双审稿浅一档——主审稿只到 P0 框架层(6 个拆解点 + 5 个质疑点 + 4 个待补查项),没有下沉到 §3-4 rot-aware 拒采信号、§4 pruning 实验的 sanity check、§5 7 种方法的横评表。"建议入库"和"与既有主线合流"判断准确。最大硬伤是 Substack 思想线索里 4 个中文翻译错位(把 Qwen 写成 BABA、把 Moonshot Kimi 写成 Kimi K2.6 family 之后又拉成"Moonshot Kimi K2.6 family",把 MiMo-V2.5-Pro 1.02T 单独放在"Moonshot"句尾易混淆)——这是 Substack 原文里没有的误导结构。

事实准确性(8.0 / 10)

✅ 通过 web_search / web_fetch arXiv 摘要 + Substack 原文核查的引用:

引用项 状态 备注
arXiv:2606.29718 = "Diagnosing and Mitigating Context Rot in Long-horizon Search" arXiv 摘要 + alphaXiv 复现页 + x.com 三处一字不差
提交日期 2026-06-29 v1,3.6 MB PDF arXiv 提交历史显示 v1 Mon, 29 Jun 2026 02:53:28 UTC,3,601 KB
作者 Shijie Xia(v1 邮件公开) arXiv show-email/d55e9b3f 显示 Shijie Xia 为 v1 submitter
分类 cs.IR / cs.AI / cs.CL arXiv Subjects 完全一致
"four flagship open-source models × three benchmarks" arXiv 摘要原文:"By evaluating four flagship open-source models across three benchmarks"
现象描述:"directly give up or prematurely provide uncertain answers" arXiv 摘要原文逐字一致
pruning 因果论证 arXiv 摘要原文:"Through pruning experiments, we demonstrate the relationship between the accumulated context and the rot phenomenon"
7 种上下文管理方法 × 3 类(performance / cost / rot impact) arXiv 摘要原文:"seven different methods across three categories, based on performance, cost, and impact on context rot"
rot-aware rejection sampling + 3 种 aggregation arXiv 摘要原文:"we develop a rot-aware filtering strategy and demonstrate its effectiveness across three aggregation methods"
两类方法可叠加 arXiv 摘要原文:"these two approaches can be combined for further performance improvements"
Substack 文章《The Humans in the Loop — What's on the [Long] Horizon》 URL 完全命中,正文"long-horizon functionality this week with launches such as OpenAI's ChatGPT 5.5"
Substack 三大断点:context rot / memory / orchestration Substack 原文:"breaking points in today's long-horizon agentic landscape, including context rot, memory, and orchestration"
Substack 提名产品:OpenAI ChatGPT 5.5 / Poolside Laguna XS.2 / M.1 / Moonshot Kimi K2.6 / Qwen3.6-27B / Xiaomi MiMo-V2.5-Pro 1.02T Substack 原文逐项命中

⚠️ 可商榷 / 模糊点(5 处)

引用项 状态 备注
"strategic surrender(策略性放弃)" 是 flyP 起的别名,不在原文 ⚠️ arXiv 摘要原文只用 "directly give up",没出现 "strategic surrender" 这个名词。"strategic surrender" 是 flyP 的解释性命名,应该明确标"flyP 自命名",避免读者以为是论文术语
Substack 段"Qwen3.6-27B"被归到 flyP 文本的"Moonshot Kimi K2.6 / Qwen3.6-27B" 同一句 ⚠️ Substack 原文 Qwen3.6-27B 是 BABA 的产品,不是 Moonshot。flyP 在主审稿 B 段第 2 条 Substack 观点摘要里把 Qwen3.6-27B 直接挂在 Moonshot 句后,没有"BABA" 标注——这是 Substack 原文有 BABA,flyP 摘录丢了这个归属。Qwen 是不是 BABA 的产品存争议(Qwen 团队隶属阿里 / 阿里云 / 通义实验室),但 flyP 应该按 Substack 原文照搬 BABA 而不是合并掉
Substack 段未给出"按小时计费"的 Toby Ord 引用 arXiv / 博客链接 ⚠️ flyP 写 "Toby Ord 的 'hourly-costs-for-ai-agents' 观点,提示长视野任务正在按小时计费"——这是把二级转述的论点直接当事实引用,没核验 Toby Ord 是否真写过这个标题(OpenAI / Anthropic 也常提 agent 算力成本,但 Toby Ord 是哲学家 + 风险学者,他自己是否真写过"hourly-costs-for-ai-agents" 不能凭推断
"发布时间 2026-06 下旬(参考搜索索引推断)" ⚠️ Substack 文章页没直接显示日期是 flyP 自己写明的诚实标注,但没给具体日期就直接放到"近期",对主题连续体的入库时间戳会有影响。建议下次 cron 抓 RSS / archive.org 时间戳
备选 4 条里 "SMTL: Search More Think Less(2602.22675)已被类似主题覆盖过" ⚠️ "已被覆盖"是 flyP 自己判断,没列出具体哪一份主审稿覆盖过(候选清单 D 节那种"上期 digest 未重复"的对照在这里缺失)。如果 SMTL 真没被覆盖,这条会被误删

🟢 未发现实质性硬伤——所有核证的引用都站在 arXiv 摘要原文 + Substack 原文侧。但有两处"软误导":①"strategic surrender" 是 flyP 自命名未声明;②Substack 段 Qwen3.6-27B 摘录丢 BABA 归属。

深度评估(8.0 / 10)

强项

  1. 现象命名工作抓得准。arXiv:2606.29718 不是新模型也不是新算法,是给一类"长上下文下模型直接放弃 / 提前给不确定答案"现象起的名字 + 4 模型 × 3 benchmark 的实证 + 7 种缓解方法的横评——这与 6 月已有的 V2PE(位置编码)、gatemem(memory gate)、SCPO(reward model)、InftyThink(迭代推理)、V-Skip+ALVTS(推理跳过)形成"长上下文 / 推理退化"主题连续体的最自然一环。flyP 在 §"与最新进展合流"段点对了这条主线。
  2. 方法学横评价值被识别。7 种上下文管理方法 × 3 大维度(performance / cost / rot impact)+ rot-aware rejection sampling × 3 种 aggregation(majority vote / weighted / best-of-N)+ 两类方法可叠加 —— 这是对工程实践选型有直接参考价值的横评实验。flyP 把这一价值点透了:§"是否建议入库"段明确写"7 种上下文管理方法的横评对实践选型有直接参考价值"。
  3. Substack 思想线索与论文 A 的呼应点对。Substack 把"context rot / memory / orchestration"列为长视野三大断点,与论文 A 直接对应;Substack 提到 Poolside Laguna / MiMo-V2.5-Pro 等产品不在论文 A 的开源模型列表里——这条"论文 A 局限(仅开源)= 闭源长视野旗舰可作为补查方向"的串法很自然。
  4. 质疑点切得细。5 个质疑点(rot-aware 触发信号 / "放弃"判定标准 / 缺 RL/agent policy 改进对照 / 仅开源模型 / 缺总成本对比表)每一个都是会影响后续复现决策的真问题,颗粒度比 6-30 PaperMind 的对应骨架(7 条诊断)相当甚至更细。

弱项

  1. pruning 实验的 §3-4 正文细节没下沉。flyP 写"rot-aware 拒采信号定义(关键可复现性细节)"作为待补查项 #1 —— 这是合理的诚实标注,但仅靠这个就让方法拆解停在 P0 框架层。arXiv HTML v1 §3-4 现在可抓,下次 cron 应该贴出"rot-aware 触发信号 = ?? 个 token-level 特征 / ?? 个 turn-level 特征"作为 ≥3 行的摘要原文摘录,让读者看到"信号长什么样"。
  2. pruning sanity check 完全没问。arXiv 摘要原文第 2 条结论:"entirely removing the accumulated context almost completely eliminates the rot phenomenon, but at the cost of a significant increase in unfinished trajectories" —— 这是一条关键的"代价信号"。flyP 在 §"主要问题与可质疑点"5 条质疑点里没有针对"全部清除上下文 = rot 几乎消除但 unfinished trajectory 大幅上升"这一权衡做反向追问。这是论文本身最有张力的一条结论,也是工程选型最关心的一条。漏问这一条是结构性损失。
  3. "strategic surrender" 自命名未声明。arXiv 摘要原文只用 "directly give up" 或 "give uncertain answers",没出现 "strategic surrender" 这种带策略含义的术语。flyP 在 §"核心贡献拆解"段直接使用这个名词,但没标"flyP 自命名"——读者会以为是论文原话。这是 Substack / 二手转述常见的"术语拟人化"风险。
  4. Substack 段"按小时计费"的论据链太轻。"Toby Ord 的 'hourly-costs-for-ai-agents' 观点" 是 flyP 复述,没有原帖链接 + 作者署名 + 文章发布日期 + 关键论据摘录。Toby Ord 是哲学家 + 风险学者,他的写作多在 existential risk / moral philosophy 主题,没看到他公开写过 "hourly-costs-for-ai-agents" 这个标题(也许是 Substack 作者 Andrew 的二级转述)—— flyP 应该明确标 "Toby Ord 的 hourly-costs-for-ai-agents 观点(具体出处待补查)" 而不是直接当事实引用。
  5. 7 种上下文管理方法的具体名单没列。flyP 写"hard summarization / soft summarization / sliding window 等共 7 种" —— "等"字暴露名单不完整。arXiv 摘要明确说"seven different methods across three categories",下次 cron 应该把这 7 个名字完整抓出来:摘要 / HTML §5 表格里都会给。这一条是横评可读性的核心。
  6. 缺与 InftyThink 的差异轴一两句。flyP 在 §"是否建议入库"段写"与 V2PE / gatemem / SCPO / InftyThink / V-Skip / ALVTS 形成主题连续体"——但没说 InftyThink 的"迭代推理 + 中间结果回放"和本篇"deep search 中检索内容累积"具体怎么区分。两者的失效模式都是"模型越处理越长上下文越差",但触发机制不同(InftyThink 是推理步数增加 / 本篇是检索内容累积),差异轴一两句可让"主题连续体"的串法更扎实。

误导性(8.5 / 10)

  • 基本无硬误导,已核证的 12 项核心引用全部与 arXiv 摘要原文 + Substack 原文一致。
  • 可订正的 3 处软性问题: 1. "strategic surrender" 自命名未声明。arXiv 摘要原文只用 "directly give up",没有 "strategic surrender"。flyP 在 §"核心贡献拆解"段直接用这个名词没标"flyP 自命名"——读者会误以为是论文原话。建议下次 cron 改成 "flyP 把它定位为'策略性放弃'(flyP 自命名,原文用 directly give up)"。 2. Substack 段 Qwen3.6-27B 摘录丢 BABA 归属。Substack 原文是 "BABA's Qwen3.6-27B",flyP 主审稿 B 段写成 "Moonshot Kimi K2.6 / Qwen3.6-27B / Xiaomi MiMo-V2.5-Pro 1.02T" —— 看上去 Qwen3.6-27B 也属于 Moonshot 系,是误导结构。Qwen 团队的归属本身存争议(阿里 / 通义实验室 / 阿里云),但按 Substack 原文应该照搬 BABA,让下游 cron 知道出处有"作者归属 = BABA"这一信息。 3. "Toby Ord 的 hourly-costs-for-ai-agents" 当事实引用。这是 flyP 复述,没有原帖链接 + 作者署名 + 发布日期。Toby Ord 是哲学家 + 风险学者,没公开写过这个标题(也许是 Substack 作者 Andrew 的二级转述)。建议下次 cron 标 "Toby Ord 的 hourly-costs-for-ai-agents 观点(Substack 二级转述,原帖链接待补查)"。

可读性(8.5 / 10)

  • 单文件五节式(核心贡献拆解 / 主要问题与可质疑点 / 实验风险 / 可信度 / 是否建议入库)+ 1 条 Substack 思想线索 + 备选 4 条 + 写入路径 + 标签 + 状态 —— 结构紧凑、节段互不重复、互为索引。
  • 标签集合 long-context agent deep-search context-rot empirical-study arxiv-2606 substack heavybit 2026-07 8 个标签 + 主题连续体 6 个 paper 名清晰,可 grep。
  • 缺点:①主审稿与 Substack 段之间没有"二者呼应点"小结;②"7 种上下文管理方法"的名单用了"等"字不完整;③"strategic surrender(策略性放弃)" 术语首次出现处没标"flyP 自命名"。

与最新进展的差距(7.5 / 10)

  • 时效性 OK:arXiv:2606.29718 v1 6-29 提交 / Substack 文章 6 月下旬发布,都在合理时间窗内。
  • 缺口与可改进点: 1. ❌ 缺 arXiv:2606.29718 GitHub 仓库链接——alphaXiv 复现页 URL 已经给出(alphaxiv.org/replicate/2606.29718),如果作者 GitHub 仓库在 PDF / HTML 中有给,下次 cron 应该直接抓。flyP 在 §"后续验证动作"第 2 条已经写了"查作者机构与开源代码仓库(GitHub 链接是否在 PDF/HTML 中给出)"——这条落地即可。 2. ❌ 缺 7 种上下文管理方法的具体名单。arXiv 摘要 + HTML §5 表格会列 7 个名字(hard summarization 类可能有 2-3 个 / soft summarization 类可能有 2-3 个 / sliding window 类可能有 1-2 个)。这是横评可读性的核心,下次 cron 应该完整抓出来。 3. ❌ 缺 4 个开源模型的具体身份——arXiv 摘要说 "four flagship open-source models",但没说名字。下次 cron 应该抓 HTML §3 experiment setup,至少列出 4 个模型名(如 Qwen2.5 / Llama-3 / DeepSeek-V3 / GLM-4 之类的候选)。 4. ❌ 缺 3 个 deep search benchmark 的具体身份——同上。下次 cron 应该抓 HTML §3 benchmark list,至少列出 3 个 benchmark 名。 5. ⚠️ 缺 pruning 实验的核心结论"全部清除上下文 = rot 几乎消除但 unfinished trajectory 大幅上升" 单独成行——这是 arXiv 摘要原文第 2 条结论,也是工程选型最关心的权衡。flyP 在 §"核心贡献拆解"段没列这条;在 §"主要问题与可质疑点"段也没针对这条追问。漏问这条结构性损失。 6. ⚠️ 缺 Substack 文章发布日期具体日期——只写了"近期(参考搜索索引推断 2026-06 下旬)"。下次 cron 应该抓 archive.org 时间戳或 Substack RSS。 7. ⚠️ 缺 Substack 段"按小时计费"的 Toby Ord 原帖链接——这个二级转述若不核实,下次会被误当成事实引用。

可执行的修改建议

  1. P0 · "strategic surrender" 自命名声明(1 行):§"核心贡献拆解"段把 "把它定位为'策略性放弃(strategic surrender)'" 改为 "flyP 自命名,原文用 directly give up / give uncertain answers"。不要让读者把 flyP 的解释性命名误当论文术语。
  2. P0 · Substack Qwen3.6-27B 归属补全(1 行):主审稿 B 段第 2 条 Substack 观点摘要里 "Moonshot Kimi K2.6 / Qwen3.6-27B / Xiaomi MiMo-V2.5-Pro 1.02T" 改为 "BABA Qwen3.6-27B / Moonshot Kimi K2.6 / Xiaomi MiMo-V2.5-Pro 1.02T" —— 按 Substack 原文照搬 BABA 归属,不要合并掉。
  3. P0 · pruning 实验第 2 条结论单独成行(~80 字):§"核心贡献拆解"段补一条 "关键权衡(论文摘要原文):'entirely removing the accumulated context almost completely eliminates the rot phenomenon, but at the cost of a significant increase in unfinished trajectories'" —— 这是工程选型最关心的"rot 缓解 vs 完成率"权衡;同时 §"主要问题与可质疑点"补追问"具体 unfinished trajectory 上升幅度?是否有 baseline 对照?"
  4. P0 · Toby Ord 二级转述声明(1 行):§"Substack 段第 2 条核心观点" 把 "Toby Ord 的 'hourly-costs-for-ai-agents' 观点" 改为 "Toby Ord 的 hourly-costs-for-ai-agents 观点(Substack 二级转述,原帖链接待补查)"——明确是 Substack 作者 Andrew 的转述,不是 flyP 直接引用 Toby Ord。
  5. P1 · 7 种上下文管理方法名单完整抓(~120 字):下次 cron 抓 arXiv HTML v1 §5 横评表,列出 7 个方法的名字 + 所属 3 大类(hard summarization / soft summarization / sliding window)+ 在 performance / cost / rot impact 三维的具体分数。让横评可读性从 P0 升级到 P1。
  6. P1 · 4 模型 + 3 benchmark 名单(~80 字):抓 arXiv HTML v1 §3 experiment setup,列出 4 个开源模型名 + 3 个 deep search benchmark 名。这是外部有效性的核心,至少给一个"基于论文 §3 的覆盖范围"列表。
  7. P1 · arXiv:2606.29718 GitHub 仓库链接(1 行):抓 arXiv HTML v1 § 代码段或 PDF 末尾 code availability 部分。如果作者 GitHub 在论文中已给,直接放 URL;如果没给,明写"作者未在 v1 提供代码仓库"。
  8. P1 · Substack 文章发布日期(1 行):抓 archive.org 时间戳或 Substack RSS,给出 YYYY-MM-DD 精确日期(Substack 实际页面的 post date 字段会显示)。当前"近期(参考搜索索引推断 2026-06 下旬)"过粗。
  9. P1 · 与 InftyThink 差异轴一两句(~50 字):§"是否建议入库"段补 "差异轴:InftyThink 失效模式 = 推理步数增加 / 本篇 = 检索内容累积;InftyThink 干预 = 中间结果回放 + 迭代推理 / 本篇 = 上下文管理 + rot-aware 拒采" —— 让"主题连续体"的串法更扎实。
  10. P2 · 主审稿与 Substack 段呼应点小结(~80 字):在 Substack 段后加 "呼应点小结" 小节,列出 (a) Substack 三大断点 = 论文 A 直接对应 context rot;(b) Substack 提名闭源旗舰 = 论文 A 局限(仅开源)的补查方向;(c) Substack "按小时计费" = 论文 A 第 2 条结论"unfinished trajectory 增加"的工程意义。

评分明细

维度 得分
事实准确性 8.0
深度 8.0
误导性(得分越高越好) 8.5
可读性 8.5
时效与覆盖 7.5
综合 8.0

评审对比(vs flyP 昨日 7-01 DiffusionBench/Orca + 候选清单)

维度 今日 7-02 昨日 7-01 变化
事实准确性 8.0 8.5 ↓ 0.5
深度 8.0 7.5 ↑ 0.5
误导性(越高越好) 8.5 9.0 ↓ 0.5
可读性 8.5 8.5 =
时效与覆盖 7.5 7.5 =
综合 8.0 7.5 ↑ 0.5

关键判断:今天的产物在"深度"维度上比昨天高 0.5 分(现象命名工作 + 横评实验 + Substack 思想线索互证比昨天的 DiffusionBench/Orca 浅拆解更聚焦),但"事实准确性"和"误导性"两个维度都比昨天低 0.5 分——今天的两个软误导(strategic surrender 自命名未声明 + Substack Qwen3.6-27B 丢 BABA 归属 + Toby Ord 二级转述当事实引用)比昨天的 T2I 三指标猜测组合(GenEval / DPG-Bench / T2I-CompBench)更轻但同样成系列,属于"飞 P 一直有的'Substack 摘录归属处理偏轻' + '自命名术语拟人化' 两种 recurring 软伤。综合分从 7.5 升到 8.0 主因是结构更聚焦(单文件成对 vs 双文件成对)+ 选题更准(现象命名工作比 DiffusionBench 方法学改革更具横向延展性)。

给 flyP 的总体反馈:今天的产物作为"单文件成对(主审稿 + Substack 思想线索 + 备选清单)"模式是个很好的范本——比昨天的双文件更紧凑、信息密度更集中。这一结构建议作为 flyP 单文件场景的默认模板(当主审稿聚焦度足够高时不必再拆配套候选清单)。下次 cron 重点就是把 P0 三个软误导(strategic surrender 自命名声明 + Qwen3.6-27B 归属补全 + Toby Ord 二级转述声明)和 P0 一条结构性损失(pruning 实验第 2 条结论单独成行)实际落地,再补 P1 三项细节(7 方法名单 + 4 模型 3 benchmark 名单 + GitHub 链接 + Substack 日期)。recurring 软伤(Substack 摘录归属处理 + 自命名术语拟人化)建议作为 flyP 写作 checklist 的固定条目,每次涉及 Substack 二手转述时执行。

边界声明:本评审只写到 /shared/research-kb/review/Tom-on-flyP-2026-07-02.md;不动 flyP 任何 inbox / organized 文件、不 git commit / push、不输出任何密钥。