Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-25 第二期

本期候选(8条)

# 来源 标题 标签
1 arXiv EnSI-RAG: Entity-Structure-Indexed RAG for Long-Document QA rag, benchmark
2 Substack δ-mem:RAG 和长上下文之外的第三种 Agent 记忆方案 agent, memory
3 HF Daily Peer-Voted LLM-Agent Stress Tests (PV-SST) agent, benchmark
4 HF Daily FlavourBench: 以可执行烹饪真相为基准 benchmark, systems
5 HF Daily Human-Centric Intelligence in Foundation Model Era rag
6 HF Daily PhysCaP: Physics-Informed Code-as-Policy Agent agent, multimodal
7 HF Daily Hydra-0: Action Flow for Generalist World Modeling benchmark, multimodal
8 HF Daily SparsePR: Training-Free Sparse Attention for Video Generation multimodal

⭐ 高价值条目(4条)

1. EnSI-RAG: Entity-Structure-Indexed RAG for Long-Document QA

来源: arXiv · 2026-08-21 | 标签: rag, benchmark

现有 RAG 以原始块为单位,块边界会把实体与支撑证据切开,导致多跳推理失效。EnSI-RAG 构建 query 无关的 entity-centered index,每条记录 (e, t, k, v) 表示一个实体:类型、关联文本、关键属性值。检索时直接定位相关实体而非文本块,再从实体图上做结构化推理。

要点: 对法律/医疗/论文等多实体关联文档的 RAG 效果提升显著;实体索引比纯 chunk 索引更鲁棒;Han et al.(UIUC/Stanford)的系统性工作。


2. δ-mem:RAG 和长上下文之外的第三种 Agent 记忆方案

来源: Substack · AlphaSignal · 2026-05 | 标签: agent, memory

大多数 Agent 工作负载中,RAG 配置过重,长上下文的性价比也低。δ-mem 论文(Mind Lab / NTU + Fudan + SJTU + CUHK + HKUST-GZ,2026-05-12)提出用 8×8 关联记忆矩阵存储历史信息——仅 4.87M 可训练参数(Qwen3-4B 的 0.12%),5 个 benchmark 平均提升 4.87%。

要点: 极轻量在线记忆,适配 Agent 场景;附录含 Qwen3-4B 适配器加载指南(10 分钟可跑);是 2026 年 Agent 记忆架构的新方向。


3. Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence (PV-SST)

来源: HF Daily · 2026-08-19 | 标签: agent, benchmark

单 Agent 评测无法反映群体行为。PV-SST 构建同伴投票社交平台测试床,448 trials、4 主题、4 种子、4 开放权重模型家族,验证了 feed 诱导的词汇收敛现象:peer 帖子按点赞排序喂入后,最终轮 Lexical Similarity 显著升高,但未发现可靠的匹配曝光优势。

要点: Agent 群体行为的新评测范式;暴露了社交输入对 Agent 输出多样性的系统性影响;对多 Agent 协作/对抗场景有直接参考价值。


4. Human-Centric Intelligence in the Foundation Model Era: A Survey

来源: HF Daily · 2026-08-17 | 标签: rag | votes: 4

全面综述基础模型时代的人本智能,提出六层全谱系人本上下文Taxonomy,桥接任务/模态/研究社区的碎片化进展。虽然是 survey,但包含大量 RAG 相关讨论(检索增强的人本智能、个性化和长期记忆)。

要点: 适合作为 RAG × Agent 交叉领域的文献地图;包含人本 AI 各层次与 foundation model 能力的系统映射。


附:本期其余候选简注

  • FlavourBench(HF · votes:2):以版本化烹饪系统为可执行 ground truth 的自动评测,534 任务,27 frontier 端点,消除 matched-execution 假阳性,适合 eval 工程参考。
  • PhysCaP(HF · votes:1):Physics-Informed Code-as-Policy agent,通过交互式物理属性提取(质量/刚度)解决纯观察式 VLA 的局限。
  • Hydra-0(HF · votes:2):action flow 作为统一视觉接口,实现跨 embodiment/任务/环境的 world model 和 zero-shot 泛化。
  • SparsePR(HF · votes:7):训练无关的块稀疏注意力,结合响应耦合分区与探针拟合残差重建,适合视频 transformer 加速。