解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
记忆来源漂白:面向 LLM Agent 持久记忆的「非放大」防火墙
本文命名并形式化了「memory provenance laundering(记忆来源漂白)」这一新型 LLM Agent 安全威胁,并实现了一个轻量级中间件 PPMF(ProvenancePreserving Memory Firewall),通过保留平台维护的来源标签 + 按行动风险匹配记忆权威性,把经过有损记忆整…
EasyBCI Agent:迈向脑机接口的通用神经数据预处理
本文提出 EasyBCI,一种两阶段 LLM agent:先用 Plan Agent 把每条神经记录画像为纯文本"数据指纹(Data Fingerprint)"(绝不暴露原始数据给模型),再交给 Execution Agent 自动生成、运行并自校正预处理代码;通过质量门控的经验库积累可复用的策略,并由领域专家在两个决…
2014 年那篇告诉你"小步快跑比大步流星更管用"的 AI 论文,后来成了所有图像 AI 的爷爷
在它之前,大家都以为"卷积核越大越好"。 在它之后,全世界才反应过来:真正重要的不是你一步迈多远,而是你愿不愿意一步步走到底。 如果你今天用手机拍一张照片,相册自动分类"猫/狗/海滩/日落";如果你用人脸识别解锁手机;如果你看医生用 AI 帮你看 CT 片——这些功能的底层架构哲学,大部分都能追溯到一篇 2014 年的…
这家公司在 2023 年把"造 AI 大模型的秘密"全开源了——然后整个行业都变了
在 LLaMA 之前,做 AI 大模型是"巨头的游戏"。 在 LLaMA 之后,一个大学生用一张二手显卡,也能跑出当年最前沿的 AI。 你今天能在自己笔记本上跑 ChatGPT 的"平替",你能用 100 美元微调出一个专属于自己公司的客服 AI,你能看到 DeepSeek、Qwen、Mistral 这些国产或开源大模…
DecoEvo:让 Solver 与 Rubric-Generator 在文本空间解耦共进化
DecoEvo 提出「ScoreDecoupled CoEvolution」:在文本空间(不修改模型权重)里同时进化一个 solver skill 和一个 rubricgenerator skill,二者用互相解耦的目标函数驱动更新——solver 按「按条目的细粒度反馈」优化,rubricgenerator 按「覆盖…
CLBench-V:面向多模态上下文学习的评测基准
CLBenchV 把「多模态上下文学习」拆成 grounding / 应用新信息 / 学习新知识 三维坐标轴,在 3,443 个实例上证明当前最强的多模态大模型也只拿到 0.2847 分,多模态 incontext 能力远未饱和。 过去一年,「context learning」成为 RAG 之外另一条补足模型能力的路线…
CoRT:用反事实回放做 Token 级 Rubric 引导的策略优化
CoRT 提出一种「不训打分模型」就能给 rubricbased GRPO 加 token 级信用分配的技巧——通过在带 rubric 与去 rubric 两个 prompt 上对同一条样本做对数似然对比,把对比值映射成 token 级权重,去重分配 GRPO 的 advantage,在指令微调模型上平均比纯 resp…
Neural Approaches to Conversational AI:把问答、任务型、闲聊三类对话系统收口到一套深度学习框架的 95 页综述
Gao、Galley、Li 三人把 20132018 年间碎片化的「神经网络对话 AI」梳理成三块(QA agents、Taskoriented dialogue agents、Chatbots),给出一个统一的「自然语言 → 自然语言」端到端视角,并显式把当下每一类系统的 SOTA 训练范式、数据集与失败模式摆到同一…
RepoReasoner:长上下文语言模型仓库级代码推理能力评估
RepoReasoner(FSE'26)是首个专门评估 LLM 在跨多文件、复杂依赖结构场景下仓库级代码推理能力的 benchmark,通过动态 tracing 生成调用链真值、LLM 重写 I/O 减少记忆化效应,在 7 个 SOTA 模型上揭示了一个核心结论:即使提供 oracle 上下文,最强模型在跨文件执行推理…
并行解码蒸馏:面向快速图像与视频生成
PDD(Parallel Decoding Distillation)通过在单次网络评估中预测多个去噪步骤,将扩散/流匹配模型的生成步数从数十步压缩至 48 步,同时在视频多样性上显著优于所有竞争方法,且全程无需对抗损失或交替训练。 视频扩散模型和流匹配模型的生成成本极高:一次高质量视频需要数十甚至上百次网络评估(高 …
Metis:把记忆能力原生焊进 Foundation Model
Metis 提出「Memory Foundation Model」:把 agent 的「持久、可演化的记忆状态」从外挂向量库搬进 backbone 内部,并配套一套无梯度的「原生记忆程序」,让 LLM 在推理时通过标准前向计算自主读写记忆——是 agent 记忆能力「从外挂走向内置」的一次系统化尝试。 过去几年,fou…
Memory for Large Language Models(大语言模型的记忆机制综述)
这篇综述把 LLM 中"记忆"这一概念从隐式的计算副产品,重新定位为一类可显式、可控制的架构维度,并提出一套以"表示—更新—持久性"三轴为基础的统一分类法,把碎片化的瞬态注意力、循环状态、参数高效适配与可扩展查找等机制梳理进同一张地图;作者随后在四机制(writing / routing / state transit…
KAMR:基于知识对齐多跳检索的接地生成
KAMR 提出一种两阶段(先锚点全局检索、再沿图局部展开)的图基多跳检索器,通过区分"被查询强约束的锚点三元组"与"弱对齐但结构上相连的桥接三元组",并以部分对齐数据集 + 双层对比学习解决多跳 QA 训练中查询—三元组对齐监督缺失的问题,在 4 个基准、3 个 LLM backbone、14 个基线上一致提升多跳检索…
面向对话式 AI Agent 的图原生双时态记忆存储
作者 Alp Niksarli 提出一种Agent 本地(agentlocal)的 Neo4j 属性图记忆存储,配备 HNSW 向量索引与完整双时态(bitemporal)数据模型——每条记忆以"不可变 identity 节点 + 版本化 content 节点(携带 valid time 与 transaction t…
推广选题榜 · 2026-08-03
本周从近 30 天卡片中综合「被引 + 评审分 + SOTA + 新近度 + 话题热度」选出 Top 8。 1. User as Code:面向个性化 Agent 的可执行记忆 arxiv: 2606.16707 范式级想法:把用户记忆从「静态数据」变成「可执行代码」,Python 函数编码规则、对象承载状态,推理与执…
MindForge:用 Source-Free 程序合成教小模型走通软件工程全生命周期
MindForge 提出了一套「把开源 CLI 程序改造成只暴露可执行档与文档的 sourcefree 训练环境」的自动流水线,并用 GLM5.2 作为教师 agent 采样 fromscratch 程序合成轨迹,蒸馏到 Qwen3.627B 后在 ProgramBench 上把平均测试通过率从 37.98% 提升到 …
Voice Memory:把「领域知识」从 ASR 模型里抽到一个可审计的 memory.md 里
Voice Memory 把 agentic ASR 的「learned skill」从模型权重里剥离到一个 perdomain 的 memory.md 文件中:流式阶段由一个冻结 corrector 读 memory 决定是否改写 1best,异步阶段由一个 scoregated optimizer 在严格不降分的前…
πR²:让大骨干 Flow Policy 同时做到反应式 + 实时
πR² 在 actionchunking flow policy 之上引入「快 / 慢双通道条件 + 延迟自适应的 latent inpainting 调度」,把 inflight action 当作 inpainting 条件、单步去噪即可发射,让 GR00TN1.7 在 xArm6+XHand 真实平台上以约 25…
SpecFirst:将行为规约获取作为基于 Agent 从零程序合成中的一等步骤
SpecFirst 把从零做程序("白板合成")拆成两个 Agent 阶段——先用"规约 Agent"反复探测黑盒二进制,结合文档产生一份结构化行为规约,再交给"代码 Agent"按规约实现;在 ProgramBench 200 个实例、四个模型(两族、横跨一个数量级能力)上,把测试通过率提升 6.9%–21.3%,二…
CADENCE:通过 Coverage-Adaptive On-Policy 蒸馏弥合推理差距
CADENCE 提出一套覆盖 coldstart、coverage、reward 三类失败模式的 onpolicy 蒸馏框架,用 DRIFT 机制在 pertoken 层面做 forwardKL 与 reverseKL 的凸混合,并叠加 COVA / FTB / CCD / LAP / EMR / BSD 六项修正,使…
Beyond Semantic Organization:MAGE——将记忆重构为执行状态管理
MAGE 将 Agent 的记忆从「语义相似度检索」转变为「分层执行状态树管理」,通过 Grow/Compress/Maintain/Revise 四个耦合操作,在保留完整轨迹的同时将上下文增长速率从线性压到对数级,最终在 MemoryArena 上将任务成功率提升 7.8–20.4 个百分点,Token 消耗降低 5…
MRAgent:记忆是被重构而非被检索的——面向 LLM Agent 的图记忆框架
MRAgent(ICML 2026 录用)提出将 Agent 记忆从「静态检索然后推理」范式转变为「联想图 + 主动重构」机制:记忆被组织为 CueTagContent 异构图,Agent 在推理过程中动态探索和剪枝记忆路径,实现按需重构而非按相似度拉取,在 LoCoMo 和 LongMemEval 上相对最强基线提升…
π-Bench:长周期工作流中的主动式个人助手 Agent 评测
πBench 是首个针对个人助手 Agent「主动性」(Proactivity)的系统性评测基准,包含 100 个跨 5 个领域画像的多轮任务、524 个隐藏意图和 187 个工具;实验揭示当前最强模型(GPT5.4、Claude 4.6 Opus 等)在任务完成度(COMP)与主动性(PROC)上严重解耦——两者几乎…
再看 Speculative Decoding 中的有损验证:机制、权衡与失败模式
Speculative Decoding(SD)里那批花式「有损验证」方法看似百花齐放,本质上只分两族——截断式(truncation)与协作式(collaborative);其中截断式长期被拿错误基线衡量因而虚高,协作式的关键则在控制 draft 概率对 target 概率的「过冲」(overshoot),一旦过冲失…
Generative Adversarial Networks
GAN 通过让生成器(Generator)和判别器(Discriminator)以对抗方式相互博弈,首次实现了完全依赖神经网络和无监督学习的生成式建模,成为图像、视频、语音等领域生成式 AI 的技术基石。 在 GAN 出现之前,生成式模型主要依赖显式概率密度估计:要么用近似变分推断(VAE),要么用马尔可夫链采样(MC…
使用向量量化压缩深度卷积网络
通过向量量化(Vector Quantization,VQ)——包括 KMeans 聚类和乘积量化(Product Quantization,PQ)——对 CNN 权重进行压缩,在 ImageNet 1000 类分类任务上实现了 1624 倍压缩率,精度损失仅约 1%。 深度 CNN 虽然精度高,但模型体积巨大。201…
AI 看一段人打篮球的视频,就能在完全不同的场景里复刻动作?ShadowDancer 教世界模型"看影子学动作"
你有没有想过这件事: 你拍一段在篮球场打球的视频——能不能让 AI "学到这套动作",然后把它复刻到冰面上 / 草地上 / 卡通世界里,新场景里完全不需要任何演示数据? 过去两年,做交互式视频世界模型的研究者都在"动作接口"上撞墙: 用文本描述动作("他跳起来投了个三分")——太松,模型只能即兴展开,没法精确控制; 用…
你给 AI 发一张 PPT,它只能"看见图片";给它一份合同,身份证号就漏?DualG-MRAG 给出"双层图"破局
你有没有试过给 ChatGPT 一份包含图表 + 表格 + 文字的 PDF 让它"总结"——它说"看不太清"? 你有没有试过让企业 AI Agent "看一眼附件里的图,再翻一下合同第三页,告诉我数字对不对"——它要么"看错图",要么"两张表对不上"? 这不是 AI 不够聪明——这是当前多模态 RAG 在做"多跳推理"…
Flamingo:面向少样本学习的视觉语言模型
Flamingo 通过创新性的 Gated CrossAttention 机制,将冻结的预训练视觉编码器与冻结的语言模型连接起来,使单个模型在无需任何任务微调的情况下,仅凭少量示例就能在多种图文任务上达到 SOTA 水平。 在 Flamingo 之前,多模态视觉语言模型(VLM)普遍存在两个痛点: 1. 任务专属性:大…
LLaMA:开放、高效的基础语言模型
Meta AI 开源了参数规模从 7B 到 65B 的 LLaMA 系列模型,核心结论是:在高达 1.4 万亿 token 的公开数据集上训练之后,130 亿参数的 LLaMA13B 可以在大多数 benchmark 上超越拥有 1750 亿参数的 GPT3(0shot 设置),而 650 亿参数的 LLaMA65B …