推广选题榜 · 2026-08-10
基于近 30 天(2607·2608 批次)论文卡片,从「概念突破 × 话题热度 × 新近度」综合评估,Top 8 如下:
① Metis: Memory Foundation Model
arxiv: 2607.26760
将 Agent 记忆从外部模块重新定义为模型原生能力——这是记忆研究方向的范式转换。传统记忆依赖外部向量库或文件系统,Metis 首次提出记忆基础模型,使记忆本身成为模型架构的一等公民。多智能体共享记忆、跨会话持续进化等场景将因此被重新定义。 建议形式:深度解读(概念框架分析 + 与 VectorDB 的架构对比)
② Zero-Mem: Zero-Token Memory Operations for LLM Agents
arxiv: 2607.29377
在最终问答以外的任何步骤零 LLM 调用、零 token 消耗——这打破了「记忆操作必然带来推理成本」的惯性认知。其设计对长程 Agent 的部署成本和延迟有直接影响,工程落地价值显著。 建议形式:科普(面向开发者群体解释技术原理与使用场景)
③ PAST-Bench: Benchmarking Recursive Self-Improvement in Personal Agents
arxiv: 2608.04003
首个系统检验「个人 Agent 是否真的随时间变好」的基准,填补了自我进化评估空白。26 个场景、可控开关保留经验——这套方法论将成为下一代个人 Agent 的标准评测集。 建议形式:深度解读(Benchmark 设计亮点解读 + 行业评测格局影响)
④ AntiSkillBench: Persona Skill 中隐私泄漏、冒充风险与防御
arxiv: 2608.03700
Persona Skill 将用户交互历史提炼为可执行工件,但本工作揭示:碎片信号集中化 + 复用放大效应会系统性削弱隐私防御。与传统数据泄露不同,这是 AI Agent 特有的「记忆来源漂白」攻击路径,极具警示价值。 建议形式:科普(隐私风险警示 + 普通用户可理解的防御建议)
⑤ StealthBench: 自主攻击性安全 Agent 的操作隐蔽性评测
arxiv: 2607.26314
提出衡量「Agent 是否在完成任务的同时暴露自己」这一关键安全维度,填补了攻击性 AI Agent 评估空白。6 个 OPSEC 维度、11 个真实事件——在 Agent 能力快速扩张的当下,安全性评测迫在眉睫。 建议形式:深度解读(安全评测视角 + AI Agent 安全生态分析)
⑥ To Add Is Machine, To Delete Is Human: LLM 代码编辑中的删除回避
arxiv: 2607.28887
系统性揭示大语言模型在代码编辑中的「删除回避」偏差:即便任务明确要求删除,模型准确删除行数的召回率不足 52%。这不只是评测结果,更直接影响代码维护质量——任何依赖 AI 写代码的团队都应了解这一局限。 建议形式:科普(开发者群体 + 代码质量影响分析)
⑦ FactorJEPA: 面向拥挤混沌全球南方城市场景的世界模型
arxiv: 2608.01049
世界模型评测长期困在低密度、车道结构清晰的西方城市设定中。FactorJEPA 首次针对人口稠密、无序推挤、快速社会协商的非洲/南亚城市环境建模,这是对真实世界复杂性的重要纠偏。 建议形式:科普(世界模型评测的局限与真实世界复杂度)
⑧ Quo Vadis, World Modeling?
arxiv: 2608.02713
对世界模型研究现状的深度概念梳理与路线图描绘。核心论点:经典世界模型止步于「物理状态预测」,Agent 需要的是「可执行反馈」——这一区分将影响未来 2-3 年世界模型研究方向的选择。 建议形式:深度解读(概念辨析 + 领域路线图展望)