Tom 文献雷达 · Agent RAG 长上下文 · 2026-10-07 晚
本期候选 8 条
| # | 类型 | 标题 | 来源 | 关键信号 |
|---|---|---|---|---|
| 1 | ⭐ 高 | UNREAL: Unifying Retrieval and Long-Context with a Single Model | arXiv 2610.08463 | 融合检索与长上下文于单一内部机制,<500K 可训参数,3B-token Wiki 实验 |
| 2 | ⭐ 高 | Agentic AutoRAG: RAG Pipeline Optimization through Reasoning-Driven Agents | arXiv 2610.08452 | LLM Agent 自主搜索 RAG 超参空间,含检索/生成失败诊断能力 |
| 3 | ⭐ 高 | EC-RAG: Event Chain RAG for Long Video Understanding | arXiv 2610.08674 | 事件链组织视频内容,训练-free,长视频时序依赖建模 |
| 4 | ⭐ 高 | RAG-PIBench: Prompt-Injection Benchmark for RAG | arXiv 2610.08571 | 4876 样例,DistilBERT F1=0.896,RAG 安全评测基准 |
| 5 | 中 | DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks | HF/arXiv 2610.08048 | 自生成实践任务引导 agent 记忆,无 oracle verifier,HF 4票 |
| 6 | 中 | EMHO: Embodied Agent Harness Optimization via Experience Traces | arXiv 2610.08432 | 冻结模型、自演进 harness,轨迹分析驱动规划/工具使用改进 |
| 7 | 低 | WildMatch: Wildlife Re-ID Matcher Adaptation | arXiv 2610.07384 | 弱监督图像匹配,局部特征融合,多模态 RAG benchmark 边缘相关 |
| 8 | 低 | DiffGate: Difficulty-Gated Teacher Guidance for OPD | arXiv 2610.04596 | OPD 蒸馏,关注 token 级而非轨迹级 reward,视觉模型相关度低 |
高价值摘要
UNREAL(#1) 提出了一个核心问题:长上下文推理和 RAG 本质上都在做证据选择,只是规模不同(单长 prompt vs. 整文档库)。作者用 LLM 内部表征直接导出检索 query,添加 <500K 参数,在 21M chunk 3B token Wiki 数据上验证了跨尺度证据选择能力。这是检索与上下文融合方向的重要新工作。
Agentic AutoRAG(#2) 将 RAG 配置优化(chunking/embedding/reranking 等)从贝叶斯搜索改为 LLM Agent 驱动——Agent 可访问检索到的 chunk 来判断失败来源(检索阶段 vs. 生成阶段),从而做有针对性的配置决策。框架自主性强,适合工程落地。
EC-RAG(#3) 针对长视频理解,将帧级/片段级 RAG 升级为事件链 RAG,先将视频内容组织为显式事件链,再进行 QA。训练-free,适合实时视频理解场景。
RAG-PIBench(#4) 填补了 RAG 安全评测空白——prompt injection 是 RAG 落地企业的关键风险,现有检测器(DistilBERT、TF-IDF SVM 等)在 leakage-aware 协议下表现良好,为 RAG 系统安全提供量化基准。
轻量观察
- 本期高频主题:Agent 驱动 RAG 优化(AutoRAG)和统一检索/长上下文机制(UNREAL)形成呼应,表明融合方向正在从"做加法"走向"单一机制内生"。
- RAG 安全(RAG-PIBench)和长视频理解(EC-RAG)各有垂直落地场景。
- Agent Memory(DAEDALUS)和 Agent Harness(EMHO)继续深化 agent 自身工程化。
Tom · 2026-10-07 20:40 UTC · radar 3x 轻量模式 · providers: arXiv + HuggingFace Daily