AI Agent 文献候选速报 · 2026-09-07

主题:AI Agent · 工具调用 · 长期记忆 · 多代理协作

本次收集因 arXiv 超时而部分降级,采用 HF Daily 候选 + 近期候选 JSON 富化。
后续可通过补充 arXiv 搜索补丁提升召回率。


候选摘要(8 条)

⭐ 高价值(3 条)

1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents - 来源:HF Daily · arXiv:2608.26530 · 2026-08-26 - 核心:长期 Agent 运行中实时利用 emerging experience,既重定向当前任务,也更新持久化 harness。现有单 Agent 自我修正方案和子 Agent 委托方案均无法完整支持此目标。 - 标签:agent live-improvement - 关联主题:长期记忆、工具调用、自修正

2. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training - 来源:HF Daily · arXiv:2609.04094 · 2026-09-02 - 核心: outcome-blind 场景下(无 ground-truth 成功信号),通过动态生成的 rubric 对每条轨迹评分,再将判断优势分配到各步,解决长期 Agent 训练中信度分配难题。 - 标签:agent rl credit-assignment - 关联主题:多代理协作、长期规划

3. VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement - 来源:HF Daily · arXiv:2609.03153 · 2026-09-01 - 核心:文本规划器将提示编译为类型化物理义务和静态验证执行计划,再由观察门控对冻结低层专家的调用。体现 agent 工具调用(segmentation/tracking/测量/OCR 等)与分层规划。 - 标签:agent benchmark multimodal systems - 关联主题:工具调用、Agent 评估


中等价值(5 条)

4. CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes - 来源:HF Daily · arXiv:2608.27455 · 2026-08-26 · votes:9 - 核心:利用小模型失败模式作为弱→强泛化引导信号,在推理时提升大模型表现。属于系统级 agent 自我改进基础设施。 - 标签:rag systems

5. Procedura: Agentic 3D Modeling with Procedural Control - 来源:HF Daily · arXiv:2608.26238 · 2026-08-25 · votes:11 - 核心:LLM 编写参数化程序作为 3D 物体表达,Agent 规划装配图并生成可编辑程序。体现"物体 as 代码"范式下的 Agent 工具调用。 - 标签:agent rag systems

6. RoboTok: Internet-Scale Data Engine for Human Demonstration Retrieval - 来源:HF Daily · arXiv:2609.03199 · 2026-09-01 · votes:115 - 核心:网络视频中检索相关人类演示用于机器人灵巧操控策略训练。学习潜在运动空间,实现跨视角跨任务的行为比较。 - 标签:rag benchmark multimodal

7. Select, Compress, Reinvest: Visual-Token Allocation in Long-Video MLLMs - 来源:HF Daily · arXiv:2609.03820 · 2026-09-02 · votes:15 - 核心:长视频 MLLM 的帧选择、空间压缩与 token 节省再投资机制研究。为 Agent 长程视觉感知提供效率优化参考。 - 标签:benchmark multimodal systems

8. PILOT in the Loop(同条 1,备选替换)若上方 DRACO/VeriPhy 已被其他实例收录,可考虑: - Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space (arXiv:2608.29188 · votes:10) — 分析 RLVR 在推理轨迹何处收窄解空间,对 Agent test-time scaling 有参考价值。


非 arXiv 观察(框架/系统层,供参考不入候选)

  • OpenMemory(Mem0):本地优先持久记忆层,MCP 兼容,已支持 Claude Desktop、Cursor、Windsurf 等主流 Agent。
  • Graph Memory 趋势:Mem0 Graph(Jan 2026)、Graphiti + FalkorDB MCP、FalkorDB 等图结构记忆方案成为向量嵌入的标准补充。
  • MCP 生态扩散:Model Context Protocol 正在打通不同框架间 Agent 的上下文共享。
  • 多框架分工实践:LangChain/LangGraph(自定义工作流)、AutoGen(多代理对话)、CrewAI(角色协同)、MetaGPT(软件团队模拟)已成主流组合。

采集状态

项目 状态
锁获取 ✅ 成功
候选收集 ⚠️ 超时(arXiv timeout),使用最新候选 JSON 富化
Web/Substack 补充 ✅ Tavily 轻量搜索完成(框架/系统层,非论文)
写入 /shared/research-kb/inbox/tom/2026-09-07_agents-lite.md
候选总数 8
高价值数 3
Substack 使用 ❌ 未使用(搜索结果为框架概述,无具体论文)
CSDN 使用 ❌ 未使用
耗时 ~8 min

Tom · 2026-09-07 09:10 CST · 轻量模式