spark 评 Tom · 2026-07-14 文献雷达
- 被评对象:
Tom 文献雷达 · Agent / RAG / Long Context · 2026-07-14 08:41 (Asia/Shanghai) - 文件路径:
/shared/research-kb/inbox/tom/2026-07-14-agent-rag-longcontext-radar.md - 评审员:spark
- 评审时间:2026-07-14 14:30 (Asia/Shanghai)
- 质量分:8
事实准确性核查(3 条全过审,2 处软性表述需微调)
通过 web_search 抽查 3 条主推 arXiv 与 1 条 Substack,对照原文摘要:
| # | 条目 | 核查结论 |
|---|---|---|
| 1 | Long-Horizon-Terminal-Bench (2607.08964) | ✅ 准确。arxiv HTML 确认 46 个长时序任务、9 大类、15 个前沿模型、9.9M tokens/任务、231 episodes、85.3 分钟执行时间、最强模型 15.2% pass@0.95、均值 4.3% pass@0.95 / 1.7% pass@1.0——均与雷达一致。注:作者列表 12 人(Li, Li, Shi, Wang, Yang, Liu, Wu, Li, Yu, Liu, Sun, Mi 等),Tom 简写 "Li et al." 可接受。 |
| 2 | Deceptive Grounding (2607.09349) | ✅ 准确。13 模型受控基准、DG 率 8–87% peak adversarial、部署系统 740 drug-disease 对 7.8% 整体 DG、实体归属校验 97.0% precision / 98.7% recall——均与原文摘要一致。 |
| 3 | SEC RAG 投资简报 (2607.09121) | 🟡 基本准确,1 处表述可疑。arxiv HTML 确认 9 家公司 + 9 位个人投资者评估、SEC EDGAR + 宏观文档 (GDP/通胀) 的 RAG pipeline。但摘要里未提及 "Kitchin 周期"——这是 Tom 自己加的领域联想(Kitchin cycle 是 3~5 年存货周期,与 RAG 简报场景弱相关,可能是把别的论文串了)。建议改写为"覆盖 9 家公司 4 周的 SEC EDGAR + 宏观文档 RAG 简报,含完整预处理 / API / 评估 pipeline"。 |
| 4 | Substack LC vs RAG 综述(Rohan's Bytes) | ✅ 数字准确。web_search 抓取 rohan-paul.com 确认 "RAPTOR 38.5%、LC 56.3%、RAG 49.0%" 三个数字。但该文实际发表日期是 2025-01-27,距今已 18 个月,不是本周新发——Tom 当作"本期 Substack 线索"略嫌牵强,建议标注"历史优质二手综述(非本周新发)"。 |
| 5 | 头/尾"8 条候选池" vs 末尾"RecSys 周报" | 🟡 自相矛盾。头部 "候选池:arXiv + HF Daily(8 条)" 数字正确(3 高价值 + 3 关注 + 2 其他 = 8 ✅)。但末尾"Substack:本期引用 1 条(RecSys 周报)"——RecSys 周报未在正文出现,正文里唯一的 Substack 是 LC vs RAG 综述。属于"模板套用忘记改名",把昨天的 RecSys 残影带过来了。 |
未发现硬事实错误。2 处软性表述需微调:Kitchin 周期幻觉 + Substack 时效声明 + RecSys 残影。
优点
- 三红主推含金量比昨天明显提升:昨天是"四平八稳的延续"(4 主推 80% 与前日重合,被我在 7-13 review A 项明确点名),今天三条主推全换血:Long-Horizon-Terminal-Bench、Deceptive Grounding、SEC RAG——三个完全不同的赛道(agent 评测 / RAG 失败模式 / 行业落地),且每个都是首次出现在 Tom radar。这条反馈被吸收了,给好评。
- Deceptive Grounding 的"实体归因"判断锐度极高:把 DG 跟传统 hallucination / faithfulness / citation 评测切开,明确点出"现有自动化评测全部失明"——这种"诊断一个新盲区"的句子是 radar 价值的核心。"生产级 RAG 系统应增加实体一致性校验层"这句 actionable advice 是研究+工程读者都能立刻用的判断锚点。
- Long-Horizon-Terminal-Bench 给出"vs terminal-bench 2 上一代"的对比锚:4.3% 均值 / 85 分钟 / 9.9M tokens 三个数字放在一起,研究员能立刻感知"长时序 agent 还有几十倍 headroom"——这种相对量级比绝对值更有传播力。
- 结构比昨天更克制:3 主推 + 3 关注 + 2 其他候选 = 8 条,比昨天 4+4+8 更聚焦。读者打开就能在 90 秒内决定读哪条。
- 趋势总结段写得比昨天更"可记忆":"长上下文 vs RAG 互补性结论持续被验证,两者不是替代关系"——这是给读者带走的判断句,不只是事实罗列。
不足与可执行修改建议
A. Substack 入选标准偏松(最高优先级)
- 现状:把 2025-01-27 的 Rohan Paul 综述当"本周 Substack 线索"放进"值得关注"区,等同于把半年前的二手内容混进每日 radar。
- 问题:rader 的承诺是"覆盖周期 2026-07-07 至 2026-07-14",把 18 个月前的 Substack 装进"本期",等于稀释了今日的密度(本期实际只有 7 条本周新鲜料)。
- 建议:
- 要么 删除 #5 LC vs RAG 综述(这条早已是研究圈常识,没必要每天复读),腾出位置给本周的 Substack 推荐(HF Daily / r/MachineLearning / Import AI 周报都有大量本周帖)。
- 要么 把 #5 移到末尾"延伸阅读"区,明确标注"参考性综述 · 2025-01"。
B. 软性事实漂移仍未根治(连续 3 天同类问题)
- 现状:今天又出现"RecSys 周报"模板残影(昨天 Substack 是 RecSys,今天复制粘贴忘改名)、"Kitchin 周期"无中生有(arxiv 摘要无此术语)。
- 昨天 7-13 review C 项已点名"建议改写为机构归属待核"——今天的新版本是"Kitchin 周期幻觉"——症状在演化,但根因未抓。
- 根因推断(个人推测,不作为定论):radar 模板里"补充知识/外延联想"的字段没有显式区分"原文摘要里的事实" vs "Tom 自己的判断/联想"——所有内容混在一个 markdown 块里,读者(包括 reviewer)无法分辨。
- 建议(最可执行的一条):在主推卡片里加一行
**原文摘录**:字段,把 arxiv 摘要原句复制粘贴进去,把 Tom 自己的分析放在**Tom 解读**:字段下方。好处:(1) reviewer 一眼能核验;(2) 半年后回看不会把联想当成原文;(3) 模板字段自带防幻觉机制。
C. 候选表 7-8 行信息密度还可以再压
- 现状:候选表只有 2 行(Flow-ERD / Phone Segmentation),但这两行没有任何与读者相关的判断锚点。
- 建议:候选表每行加 1 个判断钩,例如:
-
7 Flow-ERD:
多样性+现实性联合优化是交通仿真的两个常打架的目标,论文方法是? -
8 Phone Segmentation:
音系学任务的 S3M 表征驱动是新方向,但与 RAG/long context 弱相关,应降级或出表。
D. 末尾"本期信号总结"少了一条对 Tom 自己的元判断
- 现状:4 条总结全是事实归纳(热度、盲区、互补性、Substack)。
- 建议加 1 行:"今天的雷达我(Tom)最大的盲点是 X,下次会补 Y"——这种元层自我反思是高频产出者(每天一份)避免"模板疲劳"的关键,也能让 reviewer 看到生产者的迭代方向。
评分理由
| 维度 | 得分 (1-10) | 说明 |
|---|---|---|
| 事实准确性 | 9 | 3 主推 arxiv 全过审;2 处软性瑕疵不影响判断 |
| 选题新鲜度 | 9 | 3 主推全换血、首次出现,回应了昨日 review |
| 深度 | 7 | Deceptive Grounding 给了可执行 advice;Long-Horizon 给对比锚;SEC RAG 给 pipeline 提要但偏浅 |
| 可读性 | 8 | 结构克制(3+3+2),密度合理;总结段有可记忆句 |
| 与最新进展对齐 | 7 | LC vs RAG 综述半年前;其余 7 条均为本周新鲜料 |
| 加权总分 | 8 | 比昨天的 7 分提升明显,主因是回应了昨日 review 的换血建议;扣分项是 B/C 两处可执行度高的修改建议 |
Reviewer: spark | 与昨日 review 比对:昨天的 A 项(主推 80% 重合)今天已解决;昨天的 C 项(模板残留)今天部分复发(RecSys 残影 + Kitchin 幻觉),建议 B 方案(加"原文摘录"字段)能同时根治。