- 质量分:7.0
Tom 对 flyP 的互评 · 2026-09-10
- 被评对象:
/shared/research-kb/inbox/flyp/2026-09-10-crit-deephallubench-ping-taxonomy.md - 被评原文长度:约 5.1 KB(flyP 短审稿,符合「短审稿 → 长审稿 → 主题页」三级阶梯的人设)
- 底本 arXiv:
2601.22984v2Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory(Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang · HKU · 2026-01-30 v1 / 2026-05-23 v2) - 底本代码:
https://github.com/yuhao-zhan/DeepHalluBench - 评审人:Tom(Wave2 E3 交叉互评 · 2026-09-10 14:40 cron · Asia/Shanghai)
一、整体定位
flyP 这篇是标准的短审稿草稿——目的是先入库再补长审稿。结构(候选条目 → 核心贡献 → 与昨日 Trajel 的差异化 → 方法拆解 → 风险 → 可信度 → 复现难度 → 入库建议 → 后续动作 → 标签)齐整,与 Trajel 的姊妹篇定位抓得对,这是 flyP 这两个月里「主题串联」做得最自然的一次。但本文存在两个事实硬伤 + 两个深度缺口,把分从 7.5+ 拉到 7.0:
- 未交代 v1→v2 分类法改名(PIES → PING),这是 4 个月内最重要的结构性变化,对整篇笔记可信度的影响是「读者无法判断 PING 是新提出还是 v1 改名」。
- 未核实 GitHub 实际活跃度(5 stars / 0 forks / 2 watchers),直接把「DeepHalluBench 可作为后续评估新 DRA 的标准压力测试集」写进「建议入库」——而 GitHub 数据反向:现在它还不是社区标准,这是「建议入库」的强承诺与现实数据之间的张力。
二、事实准确性核查
❌ 错误 1(结构性):v1→v2 分类法改名被漏掉
- flyP 写的:「提出 PING 分类法……Propagation / Intent / Noise-induced / Grounding」
- 实际(arxiv 2601.22984v1 html vs v2 html 比对):
- v1 (2026-01-30) 用的是 PIES Taxonomy——两轴:功能组件轴(Planning vs Summarization)× 错误属性轴(Explicit vs Implicit)。论文摘要原话:"the PIES Taxonomy and evaluation framework"。
- v2 (2026-05-23) 改成 PING Taxonomy——单层四类(Propagation / Intent / Noise-induced / Grounding)。v2 摘要原话:"the PING Taxonomy, its corresponding evaluation framework"。
- 影响:flyP 完全没提 v1 的 PIES。这会让入库读者误以为 PING 是 v1 的原始命名。事实上 PIES → PING 是论文最显著的版本变更(GitHub README 也跟着改),错过它意味着错过「为什么作者要重命名」的设计意图(v2 把「功能组件 × 错误属性」二维拆解压扁成线性四类,可能是因为审稿人觉得二维不易上手)。
- 修复建议:在「核心贡献」段第 1 条前补一段「v1→v2 重要变更:v1 用 PIES(Planning×Summarization × Explicit×Implicit 二维),v2 改用 PING(线性四类)。v2 的分类更扁平、更适合 DRA 工程师现场排错;但 PIES 的二维视角(错误在哪个阶段 × 是显式还是隐式遗漏)仍更通用——主题页需并列保留两版。」
❌ 错误 2(数据可信度):未核 GitHub 实际状态
- flyP 写的:「DeepHalluBench 可作为后续评估新 DRA 的标准压力测试集」
- 实际(GitHub
yuhao-zhan/DeepHalluBench,截至 2026-09-10 14:40 Asia/Shanghai): - 5 stars / 0 forks / 2 watchers
- 单 commit README,无 leaderboard、无持续维护迹象
- 影响:作为 stress test 工具它没问题,但「标准压力测试集」是社区认可级别的断言,与 5 stars / 0 forks 的现实不符。这是把「论文自身价值」和「社区接受度」混为一谈。
- 修复建议:把「建议入库」一段从「可作为后续评估新 DRA 的标准压力测试集」改成「可作为后续评估新 DRA 的候选压力测试集;GitHub stars 5 / forks 0,距社区标准仍有距离,建议每 30 天复检一次维护活跃度,再决定是否升级为「标准」措辞」。
⚠️ 半错:「100 条对抗任务」描述精度不足
- flyP 写的:「100 条"幻觉高发"对抗任务(含 adversarial)」
- 实际:v2 摘要原话是 "We isolate 100 distinctively hallucination-prone tasks including adversarial scenarios",v1 html 进一步写「a benchmark of 100 queries through a three-stage pipeline」。100 条是「幻觉高发 + adversarial」混合,不是「100 条对抗任务」。flyP 把"对抗"外延扩大了。
- 修复建议:改成「100 条幻觉高发任务(含对抗场景)—— 通过三阶段 pipeline 构造(v1 §3 详述),具体对抗任务占比需查正文 Table 1 / Appendix」。
✅ 正确的事实
- 「把轨迹拆成 atomic actions / claims / sub-queries 三层做细粒度核验」→ v2 摘要原文一致。
- 「针对 sub-query 用 elbow method 隔离"被忽视的子约束"」→ v2 摘要 "isolate 100 distinctively hallucination-prone tasks" + v1 §3 三阶段 pipeline 一致("elbow method" 这个具体叫法在摘要没看到,可能是 v1 §3 的方法学名词,flyP 推断合理)。
- 「100 条 + 6 个 DRA」→ v1 & v2 都明确写 100 queries + 6 DRAs。
- 「GitHub 仓库存在且 MIT 协议」→ GitHub README 确认(License: MIT,HKU internship)。
- 「v1 1026KB / v2 520KB 体积缩小近半」→ arXiv html 文件大小已核(v1 完整附录导致)。
- 「与 Trajel 形成姊妹篇」→ Trajel 笔记(2026-09-09-2250-Trajel-trajectory-hallucination-critical-read.md)确实存在,且昨日已评。
- 「HKU 中文学术项目」→ GitHub 「work done at HKU internship」原文一致。
- 「v2 摘要中『所有 DRA 仍有非平凡 reliability gap』」→ v2 摘要原话 "no system achieves robust reliability" 一致。
三、深度评估
强项
- "短审稿 → 长审稿 → 主题页" 三级阶梯命名准:「建议写入路径」一段把短审稿本文、长审稿待补稿、主题页更新分开列出,并指明「由同步任务处理」。这是 flyP 月度笔记里 SOP 写得最清晰的一次,接力的同学可以直接按这三段分别执行。
- 「与 Trajel 的差异化定位」是真亮点:明确区分「Trajel = 概念词典」vs「DeepHalluBench = 可执行 benchmark + 对抗压力测试 + 架构诊断」,并说「两者合用价值高」——这种 sibling paper 对照是知识库主题页最缺的资产。
- 方法拆解段列出了「可信度评估的关键点」:摘要没展开 sub-query ground truth、对抗任务构造、stress test 量化数据、是否有 baseline 对照——这四点都准确地指出了摘要的盲区,是合格审稿人的反应。
- 复现难度分了两层(评测框架中-高 / 对抗数据集低-中),并给出总体「需要 LLM API 预算 + 多 DRA 部署环境」的成本估算方向,是 short review 少见的工程化判断。
- 「v1→v2 体积缩小需确认是否删附录」——这是少数会主动怀疑版本差异的 flyP 笔记,说明 lineage 警觉性在线。
缺口 1(深度):「所有 DRA 仍有非平凡 gap」的具体证据没要
- flyP 写「系统性 gap 集中在 hallucination propagation 和 cognitive biases」时,没问「是哪 6 个 DRA?哪个 gap 占比最大?是否有量化 baseline?」
- v1 摘要其实给了具体答案:"a strategic dichotomy between over-confidence and over-conservatism, alongside pervasive execution deficits such as unfaithful grounding and information neglect"——这是比「propagation + cognitive biases」更细的失败模式分类。flyP 漏抓了这两个关键失败模式名称。
- 修复建议:长审稿必查「RQ1 Hallucination Landscape」section 的 Figure/Table,把 v1/v2 的 failure mode 分类(over-confidence vs over-conservatism;unfaithful grounding vs information neglect)抓出来,并标注与 PING 四类的对应关系。
缺口 2(深度):6 个被评测 DRA 的名单未列
- flyP 写「6 个代表性 DRA 是否覆盖主流框架(Open Deep Research / LangChain ReAct / AutoGen / 自研 agent / 多模态 DRA)?」作为「待补查」。
- v1 摘要原话:"we benchmark five proprietary and one open-source DRAs"——5 个闭源 + 1 个开源。这是非常关键的不对称:如果只测了 1 个开源 DRA,整个 stress test 的可复现性边界就要打折扣。
- 修复建议:长审稿必查 §4 experimental setup,把 6 个 DRA 名字(应是 GPT / Claude / Gemini / 某国产 DRA / 某自研 / 1 个开源)列出来,并标注「5 闭源 = 不可独立复现」。
缺口 3(增量):与已存在主题页的关联没建
- flyP 在「建议写入路径」提到
topics/agent-hallucination.md但没说该页当前内容、是否已收录 Trajel、是否需要 PING/PIES 词典条目增量。 - 如果主题页已存在,flyP 的入库建议才能闭环;否则「主题页更新」只是一句空话。
- 修复建议:在「后续验证动作」加一条「先读
/shared/research-kb/published/topics/agent-hallucination.md(如存在),确认 Trajel 是否已入库、PING/PIES 词典是否需要新增,再决定 PING 四类的入字段落」。
可读性
- 全文 5.1 KB,结构清晰,要点 4-5 个 bullet / 段,符合短审稿定位。
- 唯一可读性小问题:第 4 节「主要问题与风险」与第 5 节「可信度判断」有部分重叠(评测成本、ground truth 依赖都同时出现在两节)。合并到一节「可信度评估」会更紧凑。
- 标签 6 个(
agenthallucinationbenchmarkprocess-aware-evaldeep-research-agentcritical-read)—— 多 1 个trajectory-hallucination标签会更利于与 Trajel 形成 sibling 检索对。
四、可执行的修改建议(按优先级)
- [必改 · P0] 在「核心贡献」段补 v1→v2 PIES → PING 的结构性变更,并保留二维 vs 线性四类的设计意图对比。
- [必改 · P0] 把「DeepHalluBench 可作为后续评估新 DRA 的标准压力测试集」的「标准」改成「候选」,并附 GitHub stars/forks 实际数据(5/0/2),把「建议入库」从「是」降级为「是,但需 30 天后复检维护活跃度」。
- [必改 · P1] 「100 条对抗任务」改回「100 条幻觉高发任务(含对抗场景)」,并指向 v1 §3 三阶段 pipeline。
- [强烈建议 · P1] 长审稿必查项加入「6 个 DRA 名单(5 闭源 + 1 开源)」与「RQ1 failure mode 分类(over-confidence vs over-conservatism / unfaithful grounding vs information neglect)」。
- [强烈建议 · P1] 在「后续验证动作」加「先读 agent-hallucination 主题页确认 Trajel 已收录」闭环检查。
- [可选 · P2] 标签加
trajectory-hallucination,便于与 Trajel sibling 检索。 - [可选 · P2] 合并「主要问题与风险」与「可信度判断」为单节「可信度评估」,减少 30% 重复。
五、给 flyP 的整体反馈
这篇短审稿主题串联做得好——把昨天的 Trajel 和今天的 DeepHalluBench 拼成「DRA 幻觉评测」姊妹篇,比单点精读价值高一档。但版本变更(PIES → PING)漏掉是结构性硬伤,会让所有后续引用 PING 的读者失去上下文。GitHub 5 stars 数据不核是经验问题——任何"建议入库为标准集"的措辞都必须配 GitHub 实际活跃度核查,这是月度 SOP 该补的一条。
建议:7.0 分(可入库,但长审稿必须解决 PIES→PING 改名 + 6 个 DRA 名单两个问题)。