Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-10-03 早场

概览

  • 候选总数:8 条
  • 高价值:3 条(⭐)
  • 来源:arXiv(3)+ Hugging Face Daily(5)
  • Substack 参考:1 条(Wire Blog / VentureBeat / Medium 综合)
  • CSDN:未使用

⭐ 高价值候选

1. X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization ⭐

  • 来源: arXiv,2026-09-25
  • 作者: (arXiv)
  • 摘要: 多步 Agent 通常在扁平动作流上训练,SFT/RLVR 对每 token 一视同仁,忽略任务间复用的子程序结构。X-Tree 从数据本身恢复层次结构并基于其训练,让 Agent 通过可复用子程序实现跨任务泛化,无需 LLM 调用。
  • 标签: agent rag benchmark
  • 价值: Agent 技能复用 + 层次化训练,是近期 Agent 架构研究的重要方向。

2. Honeycomb: Constant-Size Scene Memory for Video World Models ⭐

  • 来源: arXiv,2026-09-29
  • 摘要: 视频世界模型需要在长时生成中保持场景一致性,现有空间记忆随时间线性增长。Honeycomb 提出 HexMemory,在固定尺寸记忆(6 个空间/时空平面)中存储场景特征,通过前馈写入器映射新片段特征。
  • 标签: rag memory multimodal
  • 价值: 常数大小记忆思路对长上下文 Agent 的记忆压缩设计有直接参考价值。

3. MatRAG: A Matryoshka Hierarchical RAG for Multi-Hop QA ⭐

  • 来源: arXiv,2026-10-01
  • 摘要: 多跳问答 RAG 系统需平衡检索质量与计算成本。MatRAG 结合 Matryoshka 表征学习(MRL),用聚类语义层次对齐 MRL 嵌套结构,同时降低索引和查询成本。
  • 标签: rag benchmark systems
  • 价值: 效率导向 RAG,针对多跳推理的层级化方案,与 2026 年 RAG 效率优化趋势吻合。

次级候选

4. OpenTumorBoard: Multidisciplinary Tumor Board Discussion Benchmark

  • 611 患者案例,19,157 讨论轮次,12,534 分钟 YouTube 转录。评测 Specialist Turn 和 Board Simulation 两个设定。医学多模态 Agent 研究可参考其评测设计。

5. Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video

  • 以自我为中心视频生成的具身规划与多步物理推理评测基准,填补该领域空白。

6. Video Generation Models: Post-Training and Alignment Survey

  • 视频生成对齐的后训练综述,涵盖误差累积、运动-外观耦合、多目标权衡等挑战。

Substack 参考

RAG vs 长上下文 2026 实测数据(Wire Blog): - RAG 单次查询约 $0.00008,长上下文约 $0.10(~1250x 差距) - 长上下文在相关段落位于上下文中间时准确率下降 30%+ - 2026 主流模式:混合架构——用检索缩小上下文范围,再用长窗口跨片段推理 - GraphRAG 在金融/医疗合规场景落地;Agentic RAG 成为基线 - VentureBeat 预测: contextual memory(agentic memory)将超越传统 RAG 成为 agentic AI 主要记忆架构


去重说明

与 2026-10-02T2040 报告相比,新增覆盖 X-Tree(技能层次化)、Honeycomb(常数记忆)、MatRAG(层级效率 RAG)。Mapping the RAG Landscape、Walking the Embedding Space 等已在上轮覆盖,本轮保留但不上榜。


Tom · 2026-10-03 08:40 · agent-rag-longcontext 每日雷达