推广选题榜 · 2026-07-27
综合评分说明
综合「被引 + 评审分(星标)+ SOTA 性 + 新近度 + 话题热度」,选出以下 8 篇本周最值得推广的论文。
1. User as Code:面向个性化 Agent 的可执行记忆
arxiv: 2606.16707
为什么值得推广:提出将用户记忆从「检索对象」变为「可执行代码」的范式转变,规则直接编码为 Python 函数而非数据条目,直接挑战传统 RAG 记忆范式,是近期最有架构冲击力的工作之一。 建议形式:深度解读
2. PathRouter:在 Agentic Graph RAG 中将奖励与检索质量对齐
arxiv: 2606.16409
为什么值得推广:解决 GraphRAG 中 answer-path reward aliasing 的核心问题——正确答案是来自捷径还是有效证据路径,训练框架让 Agent 学会证据寻求而非记忆捷径,对可解释 Agent 检索有直接工程价值。 建议形式:深度解读
3. MAGE:Memory as Execution State Management for Long-Horizon Agents
arxiv: 2606.06090
为什么值得推广:分层状态树替代语义相似度组织历史,平均任务成功率提升 7.8–20.4 pp,token 消耗降低 55.1%,为长程 Agent 的记忆管理提供了可落地的工程方案。 建议形式:科普 + 视频
4. OpenComputer:面向 Computer-Use Agents 的可验证软件世界
arxiv: 2605.19769
为什么值得推广:硬编码验证器比 LLM-as-judge 更贴合人类裁定,尤其在任务成败依赖细粒度应用状态的场景,为 computer-use agent 评测提供了更可靠的 SOTA 方案,被引已达 5 次(近期最高)。 建议形式:深度解读
5. 理解环境感知信息检索的行为
arxiv: 2606.16817
为什么值得推广:ACL 2026 录用,首次系统揭示不同 retriever 需要不同 query 表述策略,强化学习能有效教会 LLM 为特定检索器定制 query,结论反直觉且工程意义强。 建议形式:科普
6. VideoRAG 与 V-RAGBench
arxiv: 2606.13141
为什么值得推广:首个将视频 RAG 的检索与生成解耦评测的基准,提出 CARVE 分块自适应重排序,为视频理解 + RAG 交叉领域提供了标准化评测框架,属于稀缺性 benchmark 工作。 建议形式:深度解读 + 视频
7. 向量数据库中的目录感知查询与维护
arxiv: 2606.16903
为什么值得推广:将目录拓扑作为向量数据库一等公民,原生前缀树替代扁平化方案,直接解决 Agent 记忆和企业知识库中层级目录的递归查询高延迟问题,工程价值高。 建议形式:深度解读
8. ForeSci:研究判断型 Agent 评测基准
arxiv: 2606.00644
为什么值得推广:评估 LLM Agent 从历史文献中做出前瞻性研究判断的能力,与「研究知识库运营」主题高度契合,是学术 AI 助手领域稀缺的评测基准,填补了研究判断类任务的评估空白。 建议形式:科普