Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 20:40
概览
- 主题:AI Agent、RAG、检索、长上下文、评测
- 来源:arXiv + HuggingFace Daily(2026-08-12 ~ 08-19)
- 候选总数:8 条
- 高价值:3 条
- Substack:使用(The AI Engineer · 2026 Stack)
- CSDN:未使用
- 任务来源:cron 每日高频雷达第 3 次
🔥 高价值条目(3 条)
1. CTIFoundry:面向 Agent 的 CTI 语料脚手架
- 来源:arXiv · 2608.18613v1 · 2026-08-19
- 作者:Cheng et al.
- 标签:
agentragbenchmark - 核心:威胁情报(CTI)正被 LLM Agent 在查询时消费,但语料仍是"chunk + embedding index"的 RAG 旧范式,对 Agent 无结构可用。CTIFoundry 在构建时将威胁报告的潜在结构实体化,让 Agent 可直接探索关系而非读 chunks。
- 意义:RAG 在 CTI Agent 场景的瓶颈不是模型能力,而是语料结构化;CTIFoundry 开了 Agent-Native Corpus 的先河,对安全 Agent、代码 Agent 的语料构建有通用参考价值。
- 链接:http://arxiv.org/abs/2608.18613v1
2. SkillGate:长程 Agent 的策略性技能选择
- 来源:arXiv · 2608.18852 · 2026-08-18 · HF votes: 1
- 作者:未列出
- 标签:
agent - 核心:Agent 框架把程序性知识打包为可按需读取的 skill 文件;哪个 skill 该被读取是 Agent 在 episode 中自己做决策,但没有任何训练信号教它选择。SkillGate 揭示了outcome-rewarded RL 无法教会它——存在"selector credit starvation"结构性原因,并提出新的训练目标。
- 意义:Agent 技能路由(skill selection)作为可学习策略是新的开放问题;在 skill 生态爆炸(Public library thousands of skills)的背景下,意义重大。
- 链接:http://arxiv.org/abs/2608.18852
3. OmniScientist:全模态全学科 AI 科学家
- 来源:arXiv · 2608.13558 · 2026-08-12 · HF votes: 78
- 作者:未列出
- 标签:
agentragsystems - 核心:现有 AI 科学家只看文本/代码/标签;OmniScientist 直接从原始异构证据(空间/时间/跨通道/过程数据)做多学科研究,含 RAG 驱动的证据检索。
- 意义:RAG 在科学发现场景落地,从预计算摘要扩展到原始多模态证据;Agentic RAG 边界扩展案例。
- 链接:http://arxiv.org/abs/2608.13558
📚 Substack 参考
The AI Agents Stack(2026 Edition)
- 来源:The AI Engineer · theaiengineer.substack.com
- 核心洞察:
- 2024 年 memory = 选个向量数据库做 RAG;2026 年 memory 是三层架构原语(短期/长期/外部知识)
- 大 context window 没有杀死 retrieval需求——它改变了 tradeoff:什么放 context,什么按需获取
- Agent guardrails ≠ LLM guardrails:Agent 的 guardrails 需要授权工具调用、执行速率限制、验证实际行为
- 很多 RAG 失败的瓶颈不是向量数据库本身,而是检索质量(选哪些 chunk、如何排序)
- LongMemEval 表明:基础 long-context retrieval 加上大 context window 效果很好——所以先按 evals 优化,再按基础设施优化
其余候选(5 条)
| 条目 | 来源 | 核心 | 标签 |
|---|---|---|---|
| Zetta ζ | arXiv · 2608.16590 | 闭环具身 Agent 评测,边执行边进化 critics/skills | agent benchmark |
| Co-RL | arXiv · 2608.17253 | 多智能体 Cohort 无监督推理涌现 | agent benchmark |
| Decision-Metric Alignment | arXiv · 2608.18746 | JEPA 世界模型中 latent distance 与真实任务排序的对齐诊断 | agent |
| Scaling Creative Writing | arXiv · 2608.13947 | 属性引导的体裁扩展替代故事中心数据 | rag systems |
| AdaPop | arXiv · 2608.14229 | 自适应热度指数的 LLM unlearning(遗忘热门事实更难) | benchmark |
去重备注
与 2026-08-20 08:40、14:41 雷达文件无重复条目。CTIFoundry/SkillGate 为本轮新增。