Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 08:40

概览

  • 主题:AI Agent、RAG、检索、长上下文、评测
  • 来源:arXiv + Hugging Face Daily(2026-08-13 ~ 08-19)
  • 候选总数:8 条
  • 高价值:4 条
  • Substack:1 条(The AI Engineer · 2026 Edition)
  • CSDN:跳过
  • 任务来源:cron 每日高频雷达第 2 次

🔥 高价值条目(4 条)

1. CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

  • 来源:arXiv · 2608.18613v1 · 2026-08-19
  • 作者:Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen
  • 标签agent rag benchmark
  • 核心:网络威胁情报(CTI)正被 LLM agent 在运行时消费,但语料仍是"嵌入索引后的 opaque chunks"。CTIFoundry 在构建时将威胁报告的潜在结构显式物化,供 agent 直接遍历而非暴力检索。提出了"agent-native corpus"的范式转换。
  • 意义:RAG 瓶颈不在模型能力而在语料结构;CTIFoundry 是 Agentic RAG 落地案例,对其他垂直领域(法律、医疗、金融)的 agent-native 知识库设计有参考价值。
  • 链接:http://arxiv.org/abs/2608.18613v1

2. MissDiag: Diagnostic Evaluation of Incomplete-Knowledge Robustness in KGQA and KG-RAG

  • 来源:arXiv · 2608.18489v1 · 2026-08-19
  • 作者:Hang Wang, Hang Dong, Lu Liu, Chuanru Ren
  • 标签rag benchmark systems
  • 核心:现有 KGQA/KG-RAG 鲁棒性评估只看"答案质量下降了多少",无法区分是缺失证据类型、评测系统响应还是匹配协议的问题。MissDiag 将不完整知识的鲁棒性诊断解耦为三个独立维度,提供细粒度诊断。
  • 意义:KG-RAG 评测方法论的重要改进;细粒度诊断可直接用于指导 RAG pipeline 的哪些模块需要加固。
  • 链接:http://arxiv.org/abs/2608.18489v1

3. SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

  • 来源:HF Daily · arXiv:2608.18852 · 2026-08-18
  • 标签agent
  • 核心:Agent 框架将程序性知识打包为可按需读取的 skill 文件,但"何时读哪个 skill"本身是策略决策,却无训练信号。SkillGate 解决了"selector credit starvation"问题:broadcast sequence-level advantage 下,选择 skill 的少数 token 携带的梯度信号趋于消失且逐渐反向。提出用 RL 训练 in-policy skill selector。
  • 意义:长程 agent 的 skill 路由问题此前未被正式定义和解决;SkillGate 为 skill-augmented agent 的训练范式提供了第一个系统性方案。
  • 链接:https://arxiv.org/abs/2608.18852

4. Bounded Agents: Delegation Security for Multi-Agent AI Systems

  • 来源:HF Daily · arXiv:2608.15888 · 2026-08-15
  • 标签agent benchmark systems
  • 核心:LLM agent 在会话开始时权限固定、请求独立评估,无法考虑先验动作序列或 sub-agent 授权传递。提出了 Agentic Principal Chain(APC)——将授权架构而非模型能力作为 prompt injection 防御的核心。权限需要在动作序列维度动态更新,而非仅在请求级别。
  • 意义:multi-agent 系统的权限/授权架构设计指南;是对传统静态权限模型的系统性反思,对构建安全 multi-agent 系统有直接工程价值。
  • 链接:https://arxiv.org/abs/2608.15888

📡 其他候选(4 条)

5. AdaPop: Adaptive Popularity for LLM Unlearning(HF Daily · 2608.14229) LLM unlearning 中高频事实比低频事实更难遗忘,AdaPop 用 popularity-dependent exponent + dual-ascent controller 自动化 forget-retain 平衡。tag: benchmark

6. VA-Judger: Reward Modeling for Joint Video-Audio Generation(HF Daily · 2608.18607) 现有 V-A 生成 reward model 各自评估音/视频质量,无法捕捉整体语义-时序一致性。VA-Judger 用人类偏好反馈构建联合 reward model。tag: rag benchmark multimodal

7. Evaluating Music Context Preservation (MuseCPEval)(HF Daily · 2512.14629) 音乐编辑系统的"上下文保持"评估框架,填补了音乐编辑评测空白。tag: benchmark systems

8. Real-Time LiDAR Scene Completion(HF Daily · 2608.16490) 端到端实时 LiDAR 场景补全,解决 initialize-and-refine 范式中非生成方法固定噪声尺度覆盖不全的问题。tag: agent rag


📬 Substack 条目(1 条)

The AI Agents Stack (2026 Edition) — The AI Engineer - 核心观点:2024 = RAG 年,2025 = Agent 年,2026 = Stateful Orchestration 年。memory 从"选个向量数据库做 RAG"演变为三层架构:in-context memory、dedicated memory infrastructure(Letta/Zep/Mem0)、persistent session memory。 - 关键洞察:in-context memory 在跨实例共享和跨 model provider 切换时失效;agent stack ≠ LLM stack,agent 需要 state management、tool access 协议、跨 session memory、guardrails。 - 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition


生成时间:2026-08-21 08:40 UTC | Tom 文献雷达 · 每日高频 Radar 第 2 次