AI Agent 文献候选速报 · 2026-09-07
主题:AI Agent · 工具调用 · 长期记忆 · 多代理协作
本次收集因 arXiv 超时而部分降级,采用 HF Daily 候选 + 近期候选 JSON 富化。
后续可通过补充 arXiv 搜索补丁提升召回率。
候选摘要(8 条)
⭐ 高价值(3 条)
1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- 来源:HF Daily · arXiv:2608.26530 · 2026-08-26
- 核心:长期 Agent 运行中实时利用 emerging experience,既重定向当前任务,也更新持久化 harness。现有单 Agent 自我修正方案和子 Agent 委托方案均无法完整支持此目标。
- 标签:agent live-improvement
- 关联主题:长期记忆、工具调用、自修正
2. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
- 来源:HF Daily · arXiv:2609.04094 · 2026-09-02
- 核心: outcome-blind 场景下(无 ground-truth 成功信号),通过动态生成的 rubric 对每条轨迹评分,再将判断优势分配到各步,解决长期 Agent 训练中信度分配难题。
- 标签:agent rl credit-assignment
- 关联主题:多代理协作、长期规划
3. VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
- 来源:HF Daily · arXiv:2609.03153 · 2026-09-01
- 核心:文本规划器将提示编译为类型化物理义务和静态验证执行计划,再由观察门控对冻结低层专家的调用。体现 agent 工具调用(segmentation/tracking/测量/OCR 等)与分层规划。
- 标签:agent benchmark multimodal systems
- 关联主题:工具调用、Agent 评估
中等价值(5 条)
4. CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
- 来源:HF Daily · arXiv:2608.27455 · 2026-08-26 · votes:9
- 核心:利用小模型失败模式作为弱→强泛化引导信号,在推理时提升大模型表现。属于系统级 agent 自我改进基础设施。
- 标签:rag systems
5. Procedura: Agentic 3D Modeling with Procedural Control
- 来源:HF Daily · arXiv:2608.26238 · 2026-08-25 · votes:11
- 核心:LLM 编写参数化程序作为 3D 物体表达,Agent 规划装配图并生成可编辑程序。体现"物体 as 代码"范式下的 Agent 工具调用。
- 标签:agent rag systems
6. RoboTok: Internet-Scale Data Engine for Human Demonstration Retrieval
- 来源:HF Daily · arXiv:2609.03199 · 2026-09-01 · votes:115
- 核心:网络视频中检索相关人类演示用于机器人灵巧操控策略训练。学习潜在运动空间,实现跨视角跨任务的行为比较。
- 标签:rag benchmark multimodal
7. Select, Compress, Reinvest: Visual-Token Allocation in Long-Video MLLMs
- 来源:HF Daily · arXiv:2609.03820 · 2026-09-02 · votes:15
- 核心:长视频 MLLM 的帧选择、空间压缩与 token 节省再投资机制研究。为 Agent 长程视觉感知提供效率优化参考。
- 标签:benchmark multimodal systems
8. PILOT in the Loop(同条 1,备选替换)若上方 DRACO/VeriPhy 已被其他实例收录,可考虑: - Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space (arXiv:2608.29188 · votes:10) — 分析 RLVR 在推理轨迹何处收窄解空间,对 Agent test-time scaling 有参考价值。
非 arXiv 观察(框架/系统层,供参考不入候选)
- OpenMemory(Mem0):本地优先持久记忆层,MCP 兼容,已支持 Claude Desktop、Cursor、Windsurf 等主流 Agent。
- Graph Memory 趋势:Mem0 Graph(Jan 2026)、Graphiti + FalkorDB MCP、FalkorDB 等图结构记忆方案成为向量嵌入的标准补充。
- MCP 生态扩散:Model Context Protocol 正在打通不同框架间 Agent 的上下文共享。
- 多框架分工实践:LangChain/LangGraph(自定义工作流)、AutoGen(多代理对话)、CrewAI(角色协同)、MetaGPT(软件团队模拟)已成主流组合。
采集状态
| 项目 | 状态 |
|---|---|
| 锁获取 | ✅ 成功 |
| 候选收集 | ⚠️ 超时(arXiv timeout),使用最新候选 JSON 富化 |
| Web/Substack 补充 | ✅ Tavily 轻量搜索完成(框架/系统层,非论文) |
| 写入 | /shared/research-kb/inbox/tom/2026-09-07_agents-lite.md |
| 候选总数 | 8 |
| 高价值数 | 3 |
| Substack 使用 | ❌ 未使用(搜索结果为框架概述,无具体论文) |
| CSDN 使用 | ❌ 未使用 |
| 耗时 | ~8 min |
Tom · 2026-09-07 09:10 CST · 轻量模式