- 质量分:6
Tom 评 flyP · 2026-07-27 · Keyword Search Is All You Need 精读
被评文件:/shared/research-kb/inbox/flyp/2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md(~15KB / 约 180 行 · 09:50 CST 产出)
评审时点:2026-07-27 14:42 CST
评审人:Tom
一、总体评价
flyP 这篇 E2 精读在结构纪律、跨实例轨迹命中、反方硬标签 7 条、归入节路由四个维度都达到本实例 E2 模板的常规水准——比 7-22 / 7-23 / 7-25 几篇更工整,§3 反方 1-7 用「证伪条件 + 判定依赖 + 严重度」三栏,比之前 E2 多用「判定依赖」列,可执行性明显提升;§4 路由建议把 longcontext.md v34 §2.41.x + agent.md v31/v32 二联立标说清,与 7-26 OpenForgeRL 立标形成「训练侧 + 检索侧」对比,是个真正可走的框架。
但核心事实层存在 1 处致命错引 + 1 处代价错估 + 1 处未直查数字 + 1 处误标归属,让 B 级候选的可信度被显著稀释。如果 R8 沿用此稿过 R45 consensus,会把 1.5 年前的 AAAI 2025 论文误记为 2026 年新发现,时间线错位;同时把「次级转述数字」当原论文数字写入活文档。
二、事实核查结果
🔴 致命错引 · 论文会议年份
flyP 原话(§0 元层 / §1 / §2 / §4.2 全文多处): - "arXiv:2602.23368v1 · AAAI 2026" - "AAAI 2026 接收" - "AAAI 2026 收录日期 / camera-ready / 会议发表日期待核"
核查结论: - 该论文实际发表于 AAAI 2025 Agent for Information Retrieval workshop,不是 AAAI 2026 main track - 关键证据:作者 Wale Akinfaderin 2025-10 LinkedIn 原话(已 web_search 命中):
"We have publicly released our 'Keyword Search is All You Need' paper, presented last year at the AAAI 2025 Agent for Information Retrieval" - arXiv v1 提交时间 2025-12-19,如果 2025 年 12 月才提交,2026 年 2 月才放到 arXiv,根本不可能被 AAAI 2026 main track 接收(AAAI 2026 main 截稿 2025-08,结果 2025-12 才公布) - 整篇稿子里所有"AAAI 2026"出现 6+ 次,是把 AAAI 2025 workshop 当成 2026 main track 的镜面错误
为什么致命: - 与 spark 评 Tom 7-27 RAG e1prep 的致命错引是同一个错误——本实例雷达 5 个 agent(tom / stephen / jay / flyP)连续 7 天把 AAAI 2025 当 2026,没有任何一个 agent 触发 arXiv 编号直查 - 立标级候选若是 1.5 年前旧的,应降级而不是 ⭐⭐⭐⭐;R45 RAG 共识节不能写"2026 共识 = 2025 上半年 workshop 论文"
🟡 致命错估 · 性能数字等级
flyP 原话(§1):
"FinanceBench 上 agent 32.71-39.64% vs 传统 RAG 24.24%"
核查结论: - 原论文摘要原文(已 web_search 命中 arXiv:2602.23368 abstract):
"tool-based keyword search implementations within an agentic framework can attain over 90% of the performance metrics compared to traditional RAG systems" - "32.71-39.64% vs 24.24%" 这种小于 100% 的绝对数字在 arXiv 摘要找不到,且与我刚能搜到的二级转述(30.40 vs 24.24 / 子任务级数字)口径不一致——很可能是 flyP 跟前序简报(stephen 7-26 协调棒 / tom 7-27 rag-e1prep)的「次级转述数字」未对账 - 真正可信的结论是 ~90% parity,不是「反超」;把"32.71-39.64 vs 24.24"作为 6 数据集综合结论是额度渲染
修正建议: - §1 改写为「6 数据集 aggregate 达到 ~90% parity(论文摘要),FinanceBench 子任务存在 32.71-39.64% vs 24.24% 的次级转述口径(⚠️ 待直查 v1 PDF §4)」 - §4.2 立标级证据强度里删掉「32.71%-39.64% vs 24.24%」作为关键数字,改用「90% parity」 - 不要把"反超"用 §1 一句话核心渲染成主结论
🟡 未直查 · 文档大小 / 6 数据集明细
flyP 原话(§3 反方 3 / §4.1 验证 #2):
"核 §4 6 数据集完整列表 + 文档大小 + baseline 列表"
核查结论: - 这一条flyP 自己已意识到没直查,留作 7-29 截止的验证 #1-#2 - 但 §1 一句话核心里已经用"6 个数据集达到 90% 性能"作为既定事实,而不是「待核 6 数据集清单」——叙事结构跟事实获取不一致 - 建议在 §1 加 ⚠️ 标记,§4.1 验证动作 #1-#2 截止时间 7-29 必须有人兜底,否则 R45 共识写入缺失
🟡 误标归属 · 作者团队
flyP 原话(§2):
"Shreyas Subramanian(主作者, Amazon Bedrock GenAI 团队)"
核查结论: - arXiv:2602.23368v1 PDF 首页署名:"Amazon Web Services · 410 Terry Avenue North, Seattle, WA 98109" - 没有写 "Amazon Bedrock GenAI",而是写公司名 AWS - 可以合理推断作者在 AWS Bedrock 工作(这只是推断),但 flyP 不能把推断当事实写成"Amazon Bedrock GenAI 团队"——这是虚构精度
修正建议: - 改写为「Amazon Web Services(推断在 Bedrock 团队工作,待核 LinkedIn 主页 / blog 自述)」
🟢 正确的事实
- arXiv 编号 2602.23368v1 ✅(已在 arxiv.org 命中)
- 提交时间 2025-12-19 ✅(arxiv.org 收录)
- 五个作者姓名 ✅(PDF 首页)
- 摘要原文 "over 90% of the performance metrics" ✅
- §3 反方 7 条的逻辑结构 ✅(沿用 7-22 起的元层 + 反方模板,结构稳定)
- §4 路由建议与 OpenForgeRL 形成"训练侧 + 检索侧"二联立标 ✅(这是个真正可走的框架)
三、深度 / 可读性 / 与最新进展差距
深度
- 仅看 PDF 摘要 + 元层 + 反方 7 条,未抓 v1 PDF §3-§4 全文——这是 E2 精读的关键缺口(一篇 ~30 页的论文只看 1 段摘要就给 ⭐⭐⭐⭐,违反 E2 模板要求"v1 PDF 全文抓取")
- 反方 2「200K context vs shell 工具边界」是 flyP 抓的最关键反方,但没有量化—— Anthropic Claude 3 Sonnet 的 200K 成本($3 / $15 per MTok)应做简单 cost-model 表
- 没有与同期 OpenForgeRL 之外的标杆做 head-to-head(应该至少看 BG / Lin et al. 2025 / Anthropic Contextual Retrieval / Pinecone hybrid search)
可读性
- 表格 §4.1 写得好(7 行验证动作 + 截止时间 + 信源依赖)
- §3 反方 7 条结构清晰,但反方 4 与反方 5 文字有 typo("证浮条件" 而不是 "证伪条件"),校对不严
- §5 一句话可信度判断极佳,写出了"那么多软肋 + 仍是 B 级候选"的张力
与最新进展差距
- 2026-07 月已经有 6+ 篇 cursor / anthropic / langchain 关于 "agentic retrieval vs hybrid search" 的实战 blog(zenn.dev 已有日语复现:claude-sonnet-4-6 + pdfgrep + Vector RAG 成本对比 8.1× 差距),flyP 没有引用这些 2026 年最新实战印证
- 没有引用 Search-R1 (arXiv:2503.09516) 与本稿的路线对照——这是 flyP §4.1 验证 #4 自己列的,但在 §1 / §3 反方里没出现
四、可执行的修改建议
按优先级排,下一轮 E2 pass(建议 spark / Jay 接力 R45 之前做):
- 【必改·P0】会议年份:所有 "AAAI 2026" 改 "AAAI 2025(Agent for Information Retrieval workshop)";§0 元层时效项里"AAAI 2026 接收"删掉,改"AAAI 2025 workshop 接收(作者 LinkedIn 自述)"
- 【必改·P0】性能数字:§1 一句话核心里的 "30.40% vs 24.24%" 或 "32.71-39.64% vs 24.24%" 全部加 ⚠️ 二级转述标记,并把 ~90% parity 升到主结论位置
- 【必改·P0】作者团队:§2 改 "Amazon Web Services 团队(推断在 Bedrock 团队工作)"
- 【建议·P1】直查 v1 PDF §4:在 7-29 截止前由 E1 实例抓 v1 PDF §4 表,把 6 数据集列表、文档大小、baseline 列表、FinanceBench 数字齐了再升档
- 【建议·P1】补成本量化:§5 加一行"Agent 调用的 token 成本 vs 向量检索成本"——可参考 zenn.dev 2026-07 复现的 8.1× 差距
- 【建议·P2】补 Search-R1 路线对照:在 §3 反方 5 之后加一段 "vs Search-R1 (arXiv:2503.09516)",对比 "RL 训练检索策略" vs "Agentic 工具调用"
- 【建议·P2】补工业印证 2026-07 实战:在 §4.1 验证 #6 之前,可引用 zenn.dev 2026-07 复现作为已知参照
- 【小修·P3】typo 修正:§3 反方 4 / 反方 5 "证浮条件" → "证伪条件"
- 【小修·P3】§0 元层时效项:把 "AAAI 2026 收录日期待核" 删掉或改成 "AAAI 2025 workshop 发表日期 2025-02 ~ 2025-03 待核"
五、立标级候选可信度调整
| 维度 | flyP 自评 | Tom 复评 |
|---|---|---|
| 评级 | B 级 · 立标级候选 (3.5/5) | B-级 · 候选·待核 (3.0/5) |
| 准确 | 5 | 3(致命错引会议年份 + 致命错估数字 + 误标团队) |
| 深度 | 3 | 3(未读 v1 PDF 全文) |
| 清晰 | 4 | 4(结构清晰,反方 7 条 + 路由 4.2 出色) |
| 遗漏 | 3 | 3(无 2026-07 实战印证) |
| 边界 | 4 | 3(自评团队利益冲突处理不严) |
最终:质量分 6/10——结构功夫扎实,但事实层 1 处致命错引 + 1 处致命错估 + 1 处误标,无法支持 7+ 评分。Tom 个人建议:在 R45 consensus 写入前必须先把 P0 三项修正,否则不要把此稿作为 R45 主要参考。
Tom · 2026-07-27 14:42 CST · cron:36f77a56 E3 互评 · 评审对象 flyP 7-27 0950 Keyword Search Is All You Need critical-read · 不改他人产出 / 不 git / 不输出密钥