Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-10-10
本期高价值条目(4 条)
1. Opera: Verbal Critic Framework for Long-horizon Coding Agents ⭐⭐⭐⭐
- 来源: arXiv (HF Daily, 7 votes) · https://arxiv.org/abs/2609.33987
- 日期: 2026-10-07
- 核心: 现有 critic 框架只评估轨迹+生成反馈,但不追踪反馈送达后的效果。Opera 把每次纠正当作持久化笔记持续追踪,直到问题真正解决。含周期性/事件触发审查、带类型算子诊断、反馈前证据审计等模块。
- 标签: agent / benchmark
2. Is Memorization Context-Sensitive? Prefix-Based Extraction Beyond Isolated Prefixes ⭐⭐⭐⭐
- 来源: arXiv · http://arxiv.org/abs/2610.12085v1
- 日期: 2026-10-08
- 核心: 研究 RAG 场景下,前缀提取攻击是否因上下文条件而改变。配对 item 级测量揭示:上下文条件确实会改变可提取样本集合,但并非简单缓解——攻击面发生转移。
- 标签: rag / benchmark / systems
3. Forms of LLM-Integrated Applications: From LLM-Chats to Autonomous AI Agent System ⭐⭐⭐⭐
- 来源: arXiv · http://arxiv.org/abs/2610.11899v1
- 日期: 2026-10-08
- 核心: 系统梳理从 chatbot 到 autonomous agent 的架构标签演变。copilot 意味着 router-worker 架构;agent 标签出现对应 AI 规划多步执行开始取代用户确认循环。提供了难得的厂商术语与真实架构对照分析。
- 标签: agent / rag / benchmark / systems
4. Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub ⭐⭐⭐
- 来源: arXiv (HF Daily) · https://arxiv.org/abs/2610.11169
- 日期: 2026-10-07
- 核心: 首个基于 GitSkills 数据集的 agent SKILL.md 拷贝网络研究。揭示了 agent skills 在 GitHub 间的传播路径、安全修复覆盖范围不清等供应链风险。对 skill 生态治理有直接参考价值。
- 标签: agent
其他候选(4 条)
5. ORCAGen: Orchestrating Context-Aware Malware Deception with RAG-Guided Generative AI
- 来源: arXiv · http://arxiv.org/abs/2610.12415v1 · 2026-10-08
- 离线的 RAG + 结构化提示工程生成恶意软件欺骗 playbook,验证后部署,属于 RAG 在安全对抗领域的应用。
6. The Geometry of Hierarchical Navigation: Accuracy and Query Cost for Point Process Input
- 来源: arXiv · http://arxiv.org/abs/2610.12312v1 · 2026-10-08
- 研究 HNSW/ANNS 类层级图结构在几何条件下的贪婪导航效率,给出了确定性覆盖条件。理论性强,对 RAG 检索基础设施有参考。
7. Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution
- 来源: arXiv (HF Daily, 3 votes) · https://arxiv.org/abs/2609.35855
- propose-evaluate-select 流程中,被拒绝的候选往往携带对后续优化有益的信息。Mara Chain 将失败转为 stepping stones,值得系统调优场景关注。
8. Hebero: GPU-Parallel Heterogeneous Benchmark for Robot Learning
- 来源: arXiv (HF Daily, 2 votes) · https://arxiv.org/abs/2606.03335
- GPU 并行 Isaac Lab benchmark,40 个异构任务上单策略联合训练与评估。RL benchmark 思路可迁移至 agent 评测。
Substack 参考(1 条)
The AI Agents Stack: LLM to Production (2026) — theaiengineer.substack.com
2024 年 memory = "向量数据库 + RAG";2026 年 memory 是三层独立架构primitive,上下文窗口变大反而没消灭检索需求,只是改变了"什么放上下文 vs. 什么按需检索"的取舍。
去重说明
对比近 7 天文件名(2026-10-09、2026-10-08、2026-10-07、2026-10-06、2026-10-05、2026-10-04、2026-10-03),本期条目均为 2026-10-07 及之后 arXiv/HF 新发表,未与历史雷达重复。
Tom 文献雷达 · 轻量模式 · 2026-10-10 08:40 UTC+8