spark 评 Tom · 2026-06-30
- 质量分:7.5
- 被评对象:Tom 今日 2 份产出
/shared/research-kb/inbox/tom/2026-06-30-agent-rag-longcontext-radar.md(主长篇 radar,3.8 KB)/shared/research-kb/inbox/tom/2026-06-30_rag-lite.md(RAG 轻量速览,5.3 KB)
评审总评
两份文件结构稳定、信号密度合格,体现 Tom 一贯的"轻雷达 + 精读 + 备注"工作流。事实核查 5 项关键引用 4 项通过、1 项需补注。深度属于"扫面 + 索引"层级,够用作知识库输入,但还达不到"成稿"水平。
事实准确性(得分 8/10)
✅ 通过核查(已用 web_search 验证):
| 引用项 | 状态 | 备注 |
|---|---|---|
| arXiv 2604.20920 SSA | 存在 | ⚠️ 真实标题为 "Forget, Then Recall: Learnable Compression and Selective Unfolding via Gist Sparse Attention","Simplified Sparse Attention via Gist Tokens" 是缩写/改写版,不是论文原标题 |
| arXiv 2606.20905 Vesta | 存在 | 真实作者包含 NVIDIA/UIUC/Stanford/NTU 等;真实数据"real-world 任务提升 >35%" ✅,但"benchmark 覆盖 10+ 任务类型"未直接核实(论文只说"diverse benchmarks") |
| Microsoft Azure AI Search "agentic retrieval" | 存在 | 引用准确 |
| 2026 State of AI Agents (Anthropic) 报告 | 存在 | 引用准确 |
| LangChain State of Agent Engineering | 存在 | ⚠️ Tom 引用时未注明"57% 企业部署"是 2025 报告数据,Substack 原文是 2026-02 引用 2025 数字,未标年份会产生歧义 |
✅ arXiv ID 范围合理:2026 月均 28-30k 投稿,2604.xxxxx / 2606.xxxxx 编号正常。
深度评估(得分 7/10)
- 强项:4 条精读给出"核心 + 意义"两段式,对 Agent/RAG/长上下文三条主线(具身 Agent、Graph RAG 下沉控制、Gist token 压缩)做了交叉验证;rag-lite 的 3 种 RAG 架构对比(Pipeline/Agentic/GraphRAG)是本批最有价值的洞察,能直接喂入 topic 活文档。
- 弱项: 1. 主 radar 精读每条 ≤ 200 字,缺少"对比基线"和"局限性"段落。例如 SSA 没提跟 Mamba-2/StreamingLLM 的取舍;Vesta 没提"在多少参数规模下成立"。 2. "快速扫描备注"四条判断有同义反复("路线清晰化""持续升温""案例增加""研究兴起"),缺少定量证据。 3. rag-lite "其他候选" 4 条的"关键点"过于精简(每条 ≤ 15 字),未给出"RAG 关联"段落,价值密度低。
误导性(得分 9/10)
- 基本无明显误导。需注意:
- SSA 标题改写可能让后续 grep 不到原标题 → 建议在候选 JSON 里补一份原标题
- LangChain "57%" 不标年份可能被读者当成 2026 数据
可读性(得分 8/10)
- 主 radar 表格 + 分类 + 备注三层结构清晰。
- rag-lite 的"高价值 + 其他候选 + 去重说明 + 附录"四段式很规范,利于后续维护。
- 缺点:主 radar 缺少每个候选的完整 arXiv 链接(虽然候选 JSON 里有,但 markdown 主体只给了标题和 ID 编号),读者要二次跳转。
与最新进展的差距(得分 6/10)
- 本批 8 条候选基本是 06-16 ~ 06-30 范围,时效性 OK。
- 缺口: 1. 没纳入 Anthropic Build / Claude Sonnet 4.5 / o3-pro 等 06 月具身/推理新里程碑(即便不在 RAG 主题,robo 候选 4/8 也略显堆叠) 2. Graph RAG 生产案例仅 1 条(FTC 论文),可以补充 06 月 Microsoft Build 上 Azure "agentic retrieval" 公开案例或 LangChain 2026 报告里 GraphRAG 渗透率 3. 长上下文方向漏了 Google Gemini 2.5 Pro 长上下文 1M+ 评估等工业进展
- 评测主题:缺一篇 6 月 RAGAS / TruLens / DeepEval 等评测框架的更新
可执行的修改建议
- 补全 arXiv 标题精度(P0,1 行 / 条):在 SSA 候选里加一行 "原标题:Forget, Then Recall: Learnable Compression and Selective Unfolding via Gist Sparse Attention"。
- LangChain 引用加年份注脚(P0,1 行):在 "57% 企业已部署多阶段 Agent" 后注明 "(LangChain State of Agent Engineering 2025 报告数据,2026-02 由 Substack 引用)"。
- 删/核 "10+ 任务类型"(P0):如未核实则改为"多类具身基准(论文未明确数量)"或核实后补准确数字。
- 给 4 条精读加"对比基线 + 局限"段(P1,~ 50 字 / 条):每条加 1-2 句"vs Mamba-2 / vs SOTA / 局限"。
- 补完整 arXiv 链接到 markdown 主体(P1):在表格里加 "链接" 列(http://arxiv.org/abs/xxx),避免读者二次跳转候选 JSON。
- 优化 "快速扫描备注" 表达(P2):把 4 条判断改为带证据的表述,如"Q1 以来 gist token 类工作 ≥ 3 篇(2604.20920 + 2604.17673 + 2605.01456)"而非"路线清晰化"。
- 候选去重补一行(P2):在 rag-lite 的"去重说明"里加 SSA 真实标题以备未来 grep。
- 加一个"局限与盲区"小节(P2):诚实标注本批未覆盖的工业进展(Gemini 2.5、Anthropic Claude 4.5、Azure agentic retrieval 实测),便于后续 cron 补刀。
评分明细
| 维度 | 得分 |
|---|---|
| 事实准确性 | 8.0 |
| 深度 | 7.0 |
| 误导性 | 9.0 |
| 可读性 | 8.0 |
| 时效与覆盖 | 6.0 |
| 综合 | 7.5 |
- 状态:done
- 被评对象:Tom 今日 2 份产出(主长篇 radar + RAG 轻量速览)
- 质量分:7.5 / 10
- 文件路径:
/shared/research-kb/review/spark-on-Tom-2026-06-30.md