Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-25 第二期
本期候选(8条)
| # | 来源 | 标题 | 标签 |
|---|---|---|---|
| 1 | arXiv | EnSI-RAG: Entity-Structure-Indexed RAG for Long-Document QA | rag, benchmark |
| 2 | Substack | δ-mem:RAG 和长上下文之外的第三种 Agent 记忆方案 | agent, memory |
| 3 | HF Daily | Peer-Voted LLM-Agent Stress Tests (PV-SST) | agent, benchmark |
| 4 | HF Daily | FlavourBench: 以可执行烹饪真相为基准 | benchmark, systems |
| 5 | HF Daily | Human-Centric Intelligence in Foundation Model Era | rag |
| 6 | HF Daily | PhysCaP: Physics-Informed Code-as-Policy Agent | agent, multimodal |
| 7 | HF Daily | Hydra-0: Action Flow for Generalist World Modeling | benchmark, multimodal |
| 8 | HF Daily | SparsePR: Training-Free Sparse Attention for Video Generation | multimodal |
⭐ 高价值条目(4条)
1. EnSI-RAG: Entity-Structure-Indexed RAG for Long-Document QA
来源: arXiv · 2026-08-21 | 标签: rag, benchmark
现有 RAG 以原始块为单位,块边界会把实体与支撑证据切开,导致多跳推理失效。EnSI-RAG 构建 query 无关的 entity-centered index,每条记录 (e, t, k, v) 表示一个实体:类型、关联文本、关键属性值。检索时直接定位相关实体而非文本块,再从实体图上做结构化推理。
要点: 对法律/医疗/论文等多实体关联文档的 RAG 效果提升显著;实体索引比纯 chunk 索引更鲁棒;Han et al.(UIUC/Stanford)的系统性工作。
2. δ-mem:RAG 和长上下文之外的第三种 Agent 记忆方案
来源: Substack · AlphaSignal · 2026-05 | 标签: agent, memory
大多数 Agent 工作负载中,RAG 配置过重,长上下文的性价比也低。δ-mem 论文(Mind Lab / NTU + Fudan + SJTU + CUHK + HKUST-GZ,2026-05-12)提出用 8×8 关联记忆矩阵存储历史信息——仅 4.87M 可训练参数(Qwen3-4B 的 0.12%),5 个 benchmark 平均提升 4.87%。
要点: 极轻量在线记忆,适配 Agent 场景;附录含 Qwen3-4B 适配器加载指南(10 分钟可跑);是 2026 年 Agent 记忆架构的新方向。
3. Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence (PV-SST)
来源: HF Daily · 2026-08-19 | 标签: agent, benchmark
单 Agent 评测无法反映群体行为。PV-SST 构建同伴投票社交平台测试床,448 trials、4 主题、4 种子、4 开放权重模型家族,验证了 feed 诱导的词汇收敛现象:peer 帖子按点赞排序喂入后,最终轮 Lexical Similarity 显著升高,但未发现可靠的匹配曝光优势。
要点: Agent 群体行为的新评测范式;暴露了社交输入对 Agent 输出多样性的系统性影响;对多 Agent 协作/对抗场景有直接参考价值。
4. Human-Centric Intelligence in the Foundation Model Era: A Survey
来源: HF Daily · 2026-08-17 | 标签: rag | votes: 4
全面综述基础模型时代的人本智能,提出六层全谱系人本上下文Taxonomy,桥接任务/模态/研究社区的碎片化进展。虽然是 survey,但包含大量 RAG 相关讨论(检索增强的人本智能、个性化和长期记忆)。
要点: 适合作为 RAG × Agent 交叉领域的文献地图;包含人本 AI 各层次与 foundation model 能力的系统映射。
附:本期其余候选简注
- FlavourBench(HF · votes:2):以版本化烹饪系统为可执行 ground truth 的自动评测,534 任务,27 frontier 端点,消除 matched-execution 假阳性,适合 eval 工程参考。
- PhysCaP(HF · votes:1):Physics-Informed Code-as-Policy agent,通过交互式物理属性提取(质量/刚度)解决纯观察式 VLA 的局限。
- Hydra-0(HF · votes:2):action flow 作为统一视觉接口,实现跨 embodiment/任务/环境的 world model 和 zero-shot 泛化。
- SparsePR(HF · votes:7):训练无关的块稀疏注意力,结合响应耦合分区与探针拟合残差重建,适合视频 transformer 加速。