Tom 文献雷达 · Agent RAG 长上下文 · 2026-10-07 晚

本期候选 8 条

# 类型 标题 来源 关键信号
1 ⭐ 高 UNREAL: Unifying Retrieval and Long-Context with a Single Model arXiv 2610.08463 融合检索与长上下文于单一内部机制,<500K 可训参数,3B-token Wiki 实验
2 ⭐ 高 Agentic AutoRAG: RAG Pipeline Optimization through Reasoning-Driven Agents arXiv 2610.08452 LLM Agent 自主搜索 RAG 超参空间,含检索/生成失败诊断能力
3 ⭐ 高 EC-RAG: Event Chain RAG for Long Video Understanding arXiv 2610.08674 事件链组织视频内容,训练-free,长视频时序依赖建模
4 ⭐ 高 RAG-PIBench: Prompt-Injection Benchmark for RAG arXiv 2610.08571 4876 样例,DistilBERT F1=0.896,RAG 安全评测基准
5 中 DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks HF/arXiv 2610.08048 自生成实践任务引导 agent 记忆,无 oracle verifier,HF 4票
6 中 EMHO: Embodied Agent Harness Optimization via Experience Traces arXiv 2610.08432 冻结模型、自演进 harness,轨迹分析驱动规划/工具使用改进
7 低 WildMatch: Wildlife Re-ID Matcher Adaptation arXiv 2610.07384 弱监督图像匹配,局部特征融合,多模态 RAG benchmark 边缘相关
8 低 DiffGate: Difficulty-Gated Teacher Guidance for OPD arXiv 2610.04596 OPD 蒸馏,关注 token 级而非轨迹级 reward,视觉模型相关度低

高价值摘要

UNREAL(#1) 提出了一个核心问题:长上下文推理和 RAG 本质上都在做证据选择,只是规模不同(单长 prompt vs. 整文档库)。作者用 LLM 内部表征直接导出检索 query,添加 <500K 参数,在 21M chunk 3B token Wiki 数据上验证了跨尺度证据选择能力。这是检索与上下文融合方向的重要新工作。

Agentic AutoRAG(#2) 将 RAG 配置优化(chunking/embedding/reranking 等)从贝叶斯搜索改为 LLM Agent 驱动——Agent 可访问检索到的 chunk 来判断失败来源(检索阶段 vs. 生成阶段),从而做有针对性的配置决策。框架自主性强,适合工程落地。

EC-RAG(#3) 针对长视频理解,将帧级/片段级 RAG 升级为事件链 RAG,先将视频内容组织为显式事件链,再进行 QA。训练-free,适合实时视频理解场景。

RAG-PIBench(#4) 填补了 RAG 安全评测空白——prompt injection 是 RAG 落地企业的关键风险,现有检测器(DistilBERT、TF-IDF SVM 等)在 leakage-aware 协议下表现良好,为 RAG 系统安全提供量化基准。

轻量观察

  • 本期高频主题:Agent 驱动 RAG 优化(AutoRAG)和统一检索/长上下文机制(UNREAL)形成呼应,表明融合方向正在从"做加法"走向"单一机制内生"。
  • RAG 安全(RAG-PIBench)和长视频理解(EC-RAG)各有垂直落地场景。
  • Agent Memory(DAEDALUS)和 Agent Harness(EMHO)继续深化 agent 自身工程化。

Tom · 2026-10-07 20:40 UTC · radar 3x 轻量模式 · providers: arXiv + HuggingFace Daily