📡 Tom 文献雷达 · Agent + RAG + Long Context · 2026-07-21

候选摘要(8 条)

# 来源 标题 关键信号
1 arXiv 07-20 Self-State Attacks on Self-Hosted AI Agents Agent 读写自身 memory/config 被攻击面;四维攻击空间;OS 防御边界
2 arXiv 07-20 Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning RAG 重定义为因果推断最近邻匹配;后悔分解框架;action-specific retrieval
3 HF 07-07 DeepSearch-World Web Agent 自演进;420K 多跳 QA 可验证环境;自蒸馏框架
4 HF 07-14 Diagnosing Tool-Call Boundary Drift 多教师蒸馏中工具调用边界漂移;over-calling 问题;隐式行为迁移
5 HF 07-10 GigaChat Audio 120 分钟音频时序锚定;时间感知 Audio LLM;RAG + 音频理解
6 HF 07-10 GigaAM Multilingual 低资源中亚语言 ASR;HuBERT + 聚类平衡策略;2M 小时预训练
7 HF 07-17 OCT-Bench 医学 OCT 图像理解评测;多模态 LLM 诊断推理评估
8 HF 07-19 ShotPlan 可学习规划 token;多镜头电影视频生成;视频 Agent 规划

🔥 高价值条目(4 条)

① Self-State Attacks on Self-Hosted AI Agents

  • 时间: 2026-07-20 | arXiv
  • 核心: Agent 读写自身 memory/配置文件导致的自状态攻击。四维攻击空间(Target/Mechanism/Granularity/Temporal),结构化分析了 OS 层预防/检测/恢复极限。
  • 价值: 首个系统化定义 Agent 自危害攻击面的论文,对 Memory Agent、安全 Agent 设计有直接参考意义。
  • 作者: Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber

② Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning

  • 时间: 2026-07-20 | arXiv
  • 核心: 将 RAG action selection 形式化为因果推断最近邻匹配;两阶段 regret 分解(候选生成 regret + 候选内选择 regret)。
  • 价值: 从因果推断视角重新理解 RAG,为 RAG 评测和 reward learning 提供新理论框架。
  • 作者: Masahiro Kato, Taka Kato

③ DeepSearch-World: Self-Distillation for Deep Search Agents

  • 时间: 2026-07-07 | HF(arXiv)
  • 核心: 420K 多跳 QA 可验证环境;Agent 自演进自蒸馏框架;解决了 SFT 固定轨迹和 RL 稀疏 reward 的弱点。
  • 价值: HF 热度 61 票,最活跃的 Web Agent 训练框架;工具调用 Agent 自进化方向重要进展。

④ Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation

  • 时间: 2026-07-14 | arXiv
  • 核心: 多教师蒸馏中工具调用边界漂移:tool-call recall 提升但 over-calling(不该调用时调用);aggregate loss 无法察觉。
  • 价值: 对训练 tool-use agent 有直接警示;多教师蒸馏场景值得关注的隐式副作用。

📌 趋势洞察

Agent 安全与记忆: Self-State Attacks 论文填补了 Agent 自危害攻击面系统研究的空白,Memory Agent 开发者需重点关注。

RAG 理论深化: 从向量检索到因果最近邻匹配,RAG 的理论基础正在被重新形式化;结合 policy learning 是新方向。

工具调用训练: 多教师蒸馏中 tool boundary drift 是一个未被充分讨论但实际普遍存在的问题,Boundary drift 指标值得纳入 Agent 训练评测集。

长上下文实际边界: 2026 中期"context window 1M 已成标配",但"lost in the middle"问题依然存在;实际有效上下文仍远低于标称值;RAG 与长上下文的成本交叉点已前移。


数据来源

  • arXiv metadata(当日 + 近7日)
  • Hugging Face Daily(当日策展,按主题过滤)

附注

  • 本次 Substack 搜索未获得高质量 newsletter 结果(搜索命中均为博客/评测文章),未使用 Substack 来源。
  • CSDN 未使用。
  • 写入路径:/shared/research-kb/inbox/tom/2026-07-21T2040-agent-rag-longcontext-radar.md