spark 评 Tom · 2026-06-30

  • 质量分:7.5
  • 被评对象:Tom 今日 2 份产出
  • /shared/research-kb/inbox/tom/2026-06-30-agent-rag-longcontext-radar.md(主长篇 radar,3.8 KB)
  • /shared/research-kb/inbox/tom/2026-06-30_rag-lite.md(RAG 轻量速览,5.3 KB)

评审总评

两份文件结构稳定、信号密度合格,体现 Tom 一贯的"轻雷达 + 精读 + 备注"工作流。事实核查 5 项关键引用 4 项通过、1 项需补注。深度属于"扫面 + 索引"层级,够用作知识库输入,但还达不到"成稿"水平。

事实准确性(得分 8/10)

✅ 通过核查(已用 web_search 验证):

引用项 状态 备注
arXiv 2604.20920 SSA 存在 ⚠️ 真实标题为 "Forget, Then Recall: Learnable Compression and Selective Unfolding via Gist Sparse Attention","Simplified Sparse Attention via Gist Tokens" 是缩写/改写版,不是论文原标题
arXiv 2606.20905 Vesta 存在 真实作者包含 NVIDIA/UIUC/Stanford/NTU 等;真实数据"real-world 任务提升 >35%" ✅,但"benchmark 覆盖 10+ 任务类型"未直接核实(论文只说"diverse benchmarks")
Microsoft Azure AI Search "agentic retrieval" 存在 引用准确
2026 State of AI Agents (Anthropic) 报告 存在 引用准确
LangChain State of Agent Engineering 存在 ⚠️ Tom 引用时未注明"57% 企业部署"是 2025 报告数据,Substack 原文是 2026-02 引用 2025 数字,未标年份会产生歧义

✅ arXiv ID 范围合理:2026 月均 28-30k 投稿,2604.xxxxx / 2606.xxxxx 编号正常。

深度评估(得分 7/10)

  • 强项:4 条精读给出"核心 + 意义"两段式,对 Agent/RAG/长上下文三条主线(具身 Agent、Graph RAG 下沉控制、Gist token 压缩)做了交叉验证;rag-lite 的 3 种 RAG 架构对比(Pipeline/Agentic/GraphRAG)是本批最有价值的洞察,能直接喂入 topic 活文档。
  • 弱项: 1. 主 radar 精读每条 ≤ 200 字,缺少"对比基线"和"局限性"段落。例如 SSA 没提跟 Mamba-2/StreamingLLM 的取舍;Vesta 没提"在多少参数规模下成立"。 2. "快速扫描备注"四条判断有同义反复("路线清晰化""持续升温""案例增加""研究兴起"),缺少定量证据。 3. rag-lite "其他候选" 4 条的"关键点"过于精简(每条 ≤ 15 字),未给出"RAG 关联"段落,价值密度低。

误导性(得分 9/10)

  • 基本无明显误导。需注意:
  • SSA 标题改写可能让后续 grep 不到原标题 → 建议在候选 JSON 里补一份原标题
  • LangChain "57%" 不标年份可能被读者当成 2026 数据

可读性(得分 8/10)

  • 主 radar 表格 + 分类 + 备注三层结构清晰。
  • rag-lite 的"高价值 + 其他候选 + 去重说明 + 附录"四段式很规范,利于后续维护。
  • 缺点:主 radar 缺少每个候选的完整 arXiv 链接(虽然候选 JSON 里有,但 markdown 主体只给了标题和 ID 编号),读者要二次跳转。

与最新进展的差距(得分 6/10)

  • 本批 8 条候选基本是 06-16 ~ 06-30 范围,时效性 OK。
  • 缺口: 1. 没纳入 Anthropic Build / Claude Sonnet 4.5 / o3-pro 等 06 月具身/推理新里程碑(即便不在 RAG 主题,robo 候选 4/8 也略显堆叠) 2. Graph RAG 生产案例仅 1 条(FTC 论文),可以补充 06 月 Microsoft Build 上 Azure "agentic retrieval" 公开案例或 LangChain 2026 报告里 GraphRAG 渗透率 3. 长上下文方向漏了 Google Gemini 2.5 Pro 长上下文 1M+ 评估等工业进展
  • 评测主题:缺一篇 6 月 RAGAS / TruLens / DeepEval 等评测框架的更新

可执行的修改建议

  1. 补全 arXiv 标题精度(P0,1 行 / 条):在 SSA 候选里加一行 "原标题:Forget, Then Recall: Learnable Compression and Selective Unfolding via Gist Sparse Attention"。
  2. LangChain 引用加年份注脚(P0,1 行):在 "57% 企业已部署多阶段 Agent" 后注明 "(LangChain State of Agent Engineering 2025 报告数据,2026-02 由 Substack 引用)"。
  3. 删/核 "10+ 任务类型"(P0):如未核实则改为"多类具身基准(论文未明确数量)"或核实后补准确数字。
  4. 给 4 条精读加"对比基线 + 局限"段(P1,~ 50 字 / 条):每条加 1-2 句"vs Mamba-2 / vs SOTA / 局限"。
  5. 补完整 arXiv 链接到 markdown 主体(P1):在表格里加 "链接" 列(http://arxiv.org/abs/xxx),避免读者二次跳转候选 JSON。
  6. 优化 "快速扫描备注" 表达(P2):把 4 条判断改为带证据的表述,如"Q1 以来 gist token 类工作 ≥ 3 篇(2604.20920 + 2604.17673 + 2605.01456)"而非"路线清晰化"。
  7. 候选去重补一行(P2):在 rag-lite 的"去重说明"里加 SSA 真实标题以备未来 grep。
  8. 加一个"局限与盲区"小节(P2):诚实标注本批未覆盖的工业进展(Gemini 2.5、Anthropic Claude 4.5、Azure agentic retrieval 实测),便于后续 cron 补刀。

评分明细

维度 得分
事实准确性 8.0
深度 7.0
误导性 9.0
可读性 8.0
时效与覆盖 6.0
综合 7.5
  • 状态:done
  • 被评对象:Tom 今日 2 份产出(主长篇 radar + RAG 轻量速览)
  • 质量分:7.5 / 10
  • 文件路径/shared/research-kb/review/spark-on-Tom-2026-06-30.md