Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 20:40

概览

  • 主题:AI Agent、RAG、检索、长上下文、评测
  • 来源:arXiv + HuggingFace Daily(2026-08-12 ~ 08-19)
  • 候选总数:8 条
  • 高价值:3 条
  • Substack:使用(The AI Engineer · 2026 Stack)
  • CSDN:未使用
  • 任务来源:cron 每日高频雷达第 3 次

🔥 高价值条目(3 条)

1. CTIFoundry:面向 Agent 的 CTI 语料脚手架

  • 来源:arXiv · 2608.18613v1 · 2026-08-19
  • 作者:Cheng et al.
  • 标签agent rag benchmark
  • 核心:威胁情报(CTI)正被 LLM Agent 在查询时消费,但语料仍是"chunk + embedding index"的 RAG 旧范式,对 Agent 无结构可用。CTIFoundry 在构建时将威胁报告的潜在结构实体化,让 Agent 可直接探索关系而非读 chunks。
  • 意义:RAG 在 CTI Agent 场景的瓶颈不是模型能力,而是语料结构化;CTIFoundry 开了 Agent-Native Corpus 的先河,对安全 Agent、代码 Agent 的语料构建有通用参考价值。
  • 链接:http://arxiv.org/abs/2608.18613v1

2. SkillGate:长程 Agent 的策略性技能选择

  • 来源:arXiv · 2608.18852 · 2026-08-18 · HF votes: 1
  • 作者:未列出
  • 标签agent
  • 核心:Agent 框架把程序性知识打包为可按需读取的 skill 文件;哪个 skill 该被读取是 Agent 在 episode 中自己做决策,但没有任何训练信号教它选择。SkillGate 揭示了outcome-rewarded RL 无法教会它——存在"selector credit starvation"结构性原因,并提出新的训练目标。
  • 意义:Agent 技能路由(skill selection)作为可学习策略是新的开放问题;在 skill 生态爆炸(Public library thousands of skills)的背景下,意义重大。
  • 链接:http://arxiv.org/abs/2608.18852

3. OmniScientist:全模态全学科 AI 科学家

  • 来源:arXiv · 2608.13558 · 2026-08-12 · HF votes: 78
  • 作者:未列出
  • 标签agent rag systems
  • 核心:现有 AI 科学家只看文本/代码/标签;OmniScientist 直接从原始异构证据(空间/时间/跨通道/过程数据)做多学科研究,含 RAG 驱动的证据检索。
  • 意义:RAG 在科学发现场景落地,从预计算摘要扩展到原始多模态证据;Agentic RAG 边界扩展案例。
  • 链接:http://arxiv.org/abs/2608.13558

📚 Substack 参考

The AI Agents Stack(2026 Edition)

  • 来源:The AI Engineer · theaiengineer.substack.com
  • 核心洞察
  • 2024 年 memory = 选个向量数据库做 RAG;2026 年 memory 是三层架构原语(短期/长期/外部知识)
  • 大 context window 没有杀死 retrieval需求——它改变了 tradeoff:什么放 context,什么按需获取
  • Agent guardrails ≠ LLM guardrails:Agent 的 guardrails 需要授权工具调用、执行速率限制、验证实际行为
  • 很多 RAG 失败的瓶颈不是向量数据库本身,而是检索质量(选哪些 chunk、如何排序)
  • LongMemEval 表明:基础 long-context retrieval 加上大 context window 效果很好——所以先按 evals 优化,再按基础设施优化

其余候选(5 条)

条目 来源 核心 标签
Zetta ζ arXiv · 2608.16590 闭环具身 Agent 评测,边执行边进化 critics/skills agent benchmark
Co-RL arXiv · 2608.17253 多智能体 Cohort 无监督推理涌现 agent benchmark
Decision-Metric Alignment arXiv · 2608.18746 JEPA 世界模型中 latent distance 与真实任务排序的对齐诊断 agent
Scaling Creative Writing arXiv · 2608.13947 属性引导的体裁扩展替代故事中心数据 rag systems
AdaPop arXiv · 2608.14229 自适应热度指数的 LLM unlearning(遗忘热门事实更难) benchmark

去重备注

与 2026-08-20 08:40、14:41 雷达文件无重复条目。CTIFoundry/SkillGate 为本轮新增。