Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 08:40
概览
- 主题:AI Agent、RAG、检索、长上下文、评测
- 来源:arXiv + Hugging Face Daily(2026-08-13 ~ 08-19)
- 候选总数:8 条
- 高价值:4 条
- Substack:1 条(The AI Engineer · 2026 Edition)
- CSDN:跳过
- 任务来源:cron 每日高频雷达第 2 次
🔥 高价值条目(4 条)
1. CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence
- 来源:arXiv · 2608.18613v1 · 2026-08-19
- 作者:Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen
- 标签:
agentragbenchmark - 核心:网络威胁情报(CTI)正被 LLM agent 在运行时消费,但语料仍是"嵌入索引后的 opaque chunks"。CTIFoundry 在构建时将威胁报告的潜在结构显式物化,供 agent 直接遍历而非暴力检索。提出了"agent-native corpus"的范式转换。
- 意义:RAG 瓶颈不在模型能力而在语料结构;CTIFoundry 是 Agentic RAG 落地案例,对其他垂直领域(法律、医疗、金融)的 agent-native 知识库设计有参考价值。
- 链接:http://arxiv.org/abs/2608.18613v1
2. MissDiag: Diagnostic Evaluation of Incomplete-Knowledge Robustness in KGQA and KG-RAG
- 来源:arXiv · 2608.18489v1 · 2026-08-19
- 作者:Hang Wang, Hang Dong, Lu Liu, Chuanru Ren
- 标签:
ragbenchmarksystems - 核心:现有 KGQA/KG-RAG 鲁棒性评估只看"答案质量下降了多少",无法区分是缺失证据类型、评测系统响应还是匹配协议的问题。MissDiag 将不完整知识的鲁棒性诊断解耦为三个独立维度,提供细粒度诊断。
- 意义:KG-RAG 评测方法论的重要改进;细粒度诊断可直接用于指导 RAG pipeline 的哪些模块需要加固。
- 链接:http://arxiv.org/abs/2608.18489v1
3. SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
- 来源:HF Daily · arXiv:2608.18852 · 2026-08-18
- 标签:
agent - 核心:Agent 框架将程序性知识打包为可按需读取的 skill 文件,但"何时读哪个 skill"本身是策略决策,却无训练信号。SkillGate 解决了"selector credit starvation"问题:broadcast sequence-level advantage 下,选择 skill 的少数 token 携带的梯度信号趋于消失且逐渐反向。提出用 RL 训练 in-policy skill selector。
- 意义:长程 agent 的 skill 路由问题此前未被正式定义和解决;SkillGate 为 skill-augmented agent 的训练范式提供了第一个系统性方案。
- 链接:https://arxiv.org/abs/2608.18852
4. Bounded Agents: Delegation Security for Multi-Agent AI Systems
- 来源:HF Daily · arXiv:2608.15888 · 2026-08-15
- 标签:
agentbenchmarksystems - 核心:LLM agent 在会话开始时权限固定、请求独立评估,无法考虑先验动作序列或 sub-agent 授权传递。提出了 Agentic Principal Chain(APC)——将授权架构而非模型能力作为 prompt injection 防御的核心。权限需要在动作序列维度动态更新,而非仅在请求级别。
- 意义:multi-agent 系统的权限/授权架构设计指南;是对传统静态权限模型的系统性反思,对构建安全 multi-agent 系统有直接工程价值。
- 链接:https://arxiv.org/abs/2608.15888
📡 其他候选(4 条)
5. AdaPop: Adaptive Popularity for LLM Unlearning(HF Daily · 2608.14229)
LLM unlearning 中高频事实比低频事实更难遗忘,AdaPop 用 popularity-dependent exponent + dual-ascent controller 自动化 forget-retain 平衡。tag: benchmark
6. VA-Judger: Reward Modeling for Joint Video-Audio Generation(HF Daily · 2608.18607)
现有 V-A 生成 reward model 各自评估音/视频质量,无法捕捉整体语义-时序一致性。VA-Judger 用人类偏好反馈构建联合 reward model。tag: rag benchmark multimodal
7. Evaluating Music Context Preservation (MuseCPEval)(HF Daily · 2512.14629)
音乐编辑系统的"上下文保持"评估框架,填补了音乐编辑评测空白。tag: benchmark systems
8. Real-Time LiDAR Scene Completion(HF Daily · 2608.16490)
端到端实时 LiDAR 场景补全,解决 initialize-and-refine 范式中非生成方法固定噪声尺度覆盖不全的问题。tag: agent rag
📬 Substack 条目(1 条)
The AI Agents Stack (2026 Edition) — The AI Engineer - 核心观点:2024 = RAG 年,2025 = Agent 年,2026 = Stateful Orchestration 年。memory 从"选个向量数据库做 RAG"演变为三层架构:in-context memory、dedicated memory infrastructure(Letta/Zep/Mem0)、persistent session memory。 - 关键洞察:in-context memory 在跨实例共享和跨 model provider 切换时失效;agent stack ≠ LLM stack,agent 需要 state management、tool access 协议、跨 session memory、guardrails。 - 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
生成时间:2026-08-21 08:40 UTC | Tom 文献雷达 · 每日高频 Radar 第 2 次