Tom 文献雷达 · Agent RAG LongContext · 2026-08-12 20:40

本期高价值论文(3 条)

⭐⭐⭐ InSight-doc · Agentic Long-Document 视觉理解

机构: 2026-08-10 · 8B SFT+RL
核心: 自适应分辨率 agent 框架——从低分辨率全局出发,按需 zoom-in 高分辨率区域,无需外部 retriever。构建 17.9K SFT + 19.2K hard RL 数据。在长文档 QA 上优于全分辨率方案,推理速度大幅提升。
标签: agent long-context visual-doc
信号: HF 3票 | 适合: 多页文档理解、RAG 检索增强视觉推理


⭐⭐⭐ DistilVDR · 524M 端到端视觉文档检索

机构: 2026-08-10 · Bilateral distillation from 8B teacher
核心: 视觉文档检索(VDR)压缩至 524M,单向量表示,双侧蒸馏(query+doc 同步压缩),端到端训练无需 relevance label。Index 效率和 serving 成本大幅下降。
标签: rag retrieval multimodal distillation
信号: HF 2票 | 适合: 大量图文混排文档的 RAG pipeline


⭐⭐ Self-Knowledge RAG for Patent Matching · 专利匹配 RAG 新框架

机构: arXiv 2026-08-11 · 6 位作者
核心: 针对专利文档结构复杂、术语密集问题,提出 self-knowledge RAG 框架,融合 LLM 内部知识与外部检索,减少领域微调成本和灾难遗忘。在专利匹配任务上超过现有 RAG baseline。
标签: rag patent domain-adaptation
适合: 专业知识库 RAG、知识产权检索场景


其他候选(5 条)

  • Decoding-Level Taboo · 在 logit space 强制模型偏离 nominal path,诊断 LLM 鲁棒性盲区。benchmark 方向,与 agent 评测相关。HF 7票 | benchmark systems
  • 360CityArena · 东京秋叶原 360° 视频重建的 embodied agent 导航 benchmark,175 任务,3 类推理能力。agent benchmark embodied
  • Decoding-Level Taboo: LLM Stress Test · 评测方向工具文,非本研究主题核心,参考备选。
  • AdvFD(视觉生成 Fréchet loss)、Articulated Object(关节3D重建)、UniMoMo(MoE 推荐压缩)— 偏离 agent/RAG/longcontext 主题,本期跳过。

💡 行业数据快照

RAG vs Long Context 2026 生产成本(Wire.io 实测): | | RAG | Long Context (冷) | |---|---|---| | 单次查询成本 | ~$0.00008 | $0.07–$3 | | 首 token 延迟 | <1s | 5–30s+ | | 跨文档推理 | 受限 | 窗口内强 | | 1M Token 适用场景 | 企业知识库(频繁更新) | 单文档全量分析 |

结论(2026-08): 混合架构已成主流——RAG 缩小上下文范围,Long Context 做窗口内推理。InSight-doc 的自适应 zoom-in 策略恰好契合这一范式。


📋 元数据

  • 生产时间: 2026-08-12 20:40 CST
  • 数据来源: arXiv metadata + HF Daily,候选 8 条
  • Substack: 未纳入(本期搜索未命中 Newsletter)
  • CSDN: 未使用
  • 写入路径: /shared/research-kb/inbox/tom/2026-08-12T2040-agent-rag-longcontext-radar.md
  • Lock: tom-daily-radar-3x TTL 1500s