Explainers · 学术推广产出

解读

1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Metis:把记忆能力原生焊进 Foundation Model
Metis 提出「Memory Foundation Model」:把 agent 的「持久、可演化的记忆状态」从外挂向量库搬进 backbone 内部,并配套一套无梯度的「原生记忆程序」,让 LLM 在推理时通过标准前向计算自主读写记忆——是 agent 记忆能力「从外挂走向内置」的一次系统化尝试。 过去几年,fou…
深度解读 arXiv:2607.26760 2026-08-03
Memory for Large Language Models(大语言模型的记忆机制综述)
这篇综述把 LLM 中"记忆"这一概念从隐式的计算副产品,重新定位为一类可显式、可控制的架构维度,并提出一套以"表示—更新—持久性"三轴为基础的统一分类法,把碎片化的瞬态注意力、循环状态、参数高效适配与可扩展查找等机制梳理进同一张地图;作者随后在四机制(writing / routing / state transit…
深度解读 arXiv:2607.25380 2026-08-03
KAMR:基于知识对齐多跳检索的接地生成
KAMR 提出一种两阶段(先锚点全局检索、再沿图局部展开)的图基多跳检索器,通过区分"被查询强约束的锚点三元组"与"弱对齐但结构上相连的桥接三元组",并以部分对齐数据集 + 双层对比学习解决多跳 QA 训练中查询—三元组对齐监督缺失的问题,在 4 个基准、3 个 LLM backbone、14 个基线上一致提升多跳检索…
深度解读 arXiv:2607.27136 2026-08-03
面向对话式 AI Agent 的图原生双时态记忆存储
作者 Alp Niksarli 提出一种Agent 本地(agentlocal)的 Neo4j 属性图记忆存储,配备 HNSW 向量索引与完整双时态(bitemporal)数据模型——每条记忆以"不可变 identity 节点 + 版本化 content 节点(携带 valid time 与 transaction t…
深度解读 arXiv:2607.26520 2026-08-03
MindForge:用 Source-Free 程序合成教小模型走通软件工程全生命周期
MindForge 提出了一套「把开源 CLI 程序改造成只暴露可执行档与文档的 sourcefree 训练环境」的自动流水线,并用 GLM5.2 作为教师 agent 采样 fromscratch 程序合成轨迹,蒸馏到 Qwen3.627B 后在 ProgramBench 上把平均测试通过率从 37.98% 提升到 …
深度解读 arXiv:2607.27146 2026-08-03
Voice Memory:把「领域知识」从 ASR 模型里抽到一个可审计的 memory.md 里
Voice Memory 把 agentic ASR 的「learned skill」从模型权重里剥离到一个 perdomain 的 memory.md 文件中:流式阶段由一个冻结 corrector 读 memory 决定是否改写 1best,异步阶段由一个 scoregated optimizer 在严格不降分的前…
深度解读 arXiv:2607.26410 2026-08-03
πR²:让大骨干 Flow Policy 同时做到反应式 + 实时
πR² 在 actionchunking flow policy 之上引入「快 / 慢双通道条件 + 延迟自适应的 latent inpainting 调度」,把 inflight action 当作 inpainting 条件、单步去噪即可发射,让 GR00TN1.7 在 xArm6+XHand 真实平台上以约 25…
深度解读 arXiv:2607.26055 2026-08-03
SpecFirst:将行为规约获取作为基于 Agent 从零程序合成中的一等步骤
SpecFirst 把从零做程序("白板合成")拆成两个 Agent 阶段——先用"规约 Agent"反复探测黑盒二进制,结合文档产生一份结构化行为规约,再交给"代码 Agent"按规约实现;在 ProgramBench 200 个实例、四个模型(两族、横跨一个数量级能力)上,把测试通过率提升 6.9%–21.3%,二…
深度解读 arXiv:2607.27167 2026-08-03
CADENCE:通过 Coverage-Adaptive On-Policy 蒸馏弥合推理差距
CADENCE 提出一套覆盖 coldstart、coverage、reward 三类失败模式的 onpolicy 蒸馏框架,用 DRIFT 机制在 pertoken 层面做 forwardKL 与 reverseKL 的凸混合,并叠加 COVA / FTB / CCD / LAP / EMR / BSD 六项修正,使…
深度解读 arXiv:2607.16955 2026-08-03
Beyond Semantic Organization:MAGE——将记忆重构为执行状态管理
MAGE 将 Agent 的记忆从「语义相似度检索」转变为「分层执行状态树管理」,通过 Grow/Compress/Maintain/Revise 四个耦合操作,在保留完整轨迹的同时将上下文增长速率从线性压到对数级,最终在 MemoryArena 上将任务成功率提升 7.8–20.4 个百分点,Token 消耗降低 5…
深度解读 arXiv:2606.06090 2026-08-03
MRAgent:记忆是被重构而非被检索的——面向 LLM Agent 的图记忆框架
MRAgent(ICML 2026 录用)提出将 Agent 记忆从「静态检索然后推理」范式转变为「联想图 + 主动重构」机制:记忆被组织为 CueTagContent 异构图,Agent 在推理过程中动态探索和剪枝记忆路径,实现按需重构而非按相似度拉取,在 LoCoMo 和 LongMemEval 上相对最强基线提升…
深度解读 arXiv:2606.06036 2026-08-03
π-Bench:长周期工作流中的主动式个人助手 Agent 评测
πBench 是首个针对个人助手 Agent「主动性」(Proactivity)的系统性评测基准,包含 100 个跨 5 个领域画像的多轮任务、524 个隐藏意图和 187 个工具;实验揭示当前最强模型(GPT5.4、Claude 4.6 Opus 等)在任务完成度(COMP)与主动性(PROC)上严重解耦——两者几乎…
深度解读 arXiv:2605.14678 2026-08-03
再看 Speculative Decoding 中的有损验证:机制、权衡与失败模式
Speculative Decoding(SD)里那批花式「有损验证」方法看似百花齐放,本质上只分两族——截断式(truncation)与协作式(collaborative);其中截断式长期被拿错误基线衡量因而虚高,协作式的关键则在控制 draft 概率对 target 概率的「过冲」(overshoot),一旦过冲失…
深度解读 arXiv:2607.26627 2026-08-03
Generative Adversarial Networks
GAN 通过让生成器(Generator)和判别器(Discriminator)以对抗方式相互博弈,首次实现了完全依赖神经网络和无监督学习的生成式建模,成为图像、视频、语音等领域生成式 AI 的技术基石。 在 GAN 出现之前,生成式模型主要依赖显式概率密度估计:要么用近似变分推断(VAE),要么用马尔可夫链采样(MC…
深度解读 arXiv:1406.2661 2026-08-03
使用向量量化压缩深度卷积网络
通过向量量化(Vector Quantization,VQ)——包括 KMeans 聚类和乘积量化(Product Quantization,PQ)——对 CNN 权重进行压缩,在 ImageNet 1000 类分类任务上实现了 1624 倍压缩率,精度损失仅约 1%。 深度 CNN 虽然精度高,但模型体积巨大。201…
深度解读 arXiv:1412.6115 2026-08-03
Flamingo:面向少样本学习的视觉语言模型
Flamingo 通过创新性的 Gated CrossAttention 机制,将冻结的预训练视觉编码器与冻结的语言模型连接起来,使单个模型在无需任何任务微调的情况下,仅凭少量示例就能在多种图文任务上达到 SOTA 水平。 在 Flamingo 之前,多模态视觉语言模型(VLM)普遍存在两个痛点: 1. 任务专属性:大…
深度解读 arXiv:2204.14198 2026-08-02
LLaMA:开放、高效的基础语言模型
Meta AI 开源了参数规模从 7B 到 65B 的 LLaMA 系列模型,核心结论是:在高达 1.4 万亿 token 的公开数据集上训练之后,130 亿参数的 LLaMA13B 可以在大多数 benchmark 上超越拥有 1750 亿参数的 GPT3(0shot 设置),而 650 亿参数的 LLaMA65B …
深度解读 arXiv:2302.13971 2026-08-02
Self-Consistency:自洽性解码策略提升语言模型的思维链推理
SelfConsistency 是一种基于"多数投票"的后处理解码策略:让 LLM 生成多条不同的推理路径,再选择出现频率最高的答案作为最终输出。在不改变模型本身、不需要任何额外训练的情况下,该方法将思维链提示(ChainofThought Prompting)的效果提升了 17.9%(GSM8K)到 3.9%(ARC…
深度解读 arXiv:2203.11171 2026-08-02
See2Think:多模态模型真的使用了中间视觉状态吗?
多模态大模型在推理中生成草图、标注、中间图像——但它们真的依赖这些视觉状态吗?See2Think 实验答案是:高度依赖,但「faithful rendering」是最大瓶颈;且有了高反馈利用率也不一定转化为精度提升。 多模态 LLM(如 GPT4V、Gemini、QwenVL 等)在推理时越来越多地使用中间视觉状态(i…
深度解读 arXiv:2607.26769 2026-08-02
基于文件系统的 LLM 智能体记忆:组织、演进与可持续性
当前 LLM 智能体普遍用「把 markdown 文件塞进文件夹」作为长期记忆,但实验证明:这种默认方式在记忆不断增长时组织会退化、没有最强管理 Agent 就无法维持收益——而且换一套工具集对记忆结构的影响几乎和换模型一样大。 现实部署的 LLM 智能体越来越依赖文件系统记忆(filesystembased memo…
深度解读 arXiv:2607.26637 2026-08-02
Deep Research 可靠吗?误导性知识会诱发错误结论
只需在 Deep Research 检索结果中插入一篇「看起来很专业但事实错误」的文档,主流 Deep Research 系统就有超过 50% 的概率把错误结论写进最终报告——而它们自己有能力判断这是误导信息。 Deep Research 智能体(如 DeerFlow、WebThinker、Gemini Deep Re…
深度解读 arXiv:2607.20891 2026-08-02
ShadowDancer:从视频与"阴影"中学习统一动力学表示,教视频世界模型任意动作
本文提出 ShadowDancer,用"影子配对(shadow pairs)"——一段动力学在两种外观独立重采样下的视频对——训练模型"从一个影子预测另一个影子",从而学到剥离外观、只保留动作的统一动力学表示;任何一段演示视频都能变成可复用的动作资产,在新场景里无动作标签、无运动估计器、无需微调即可做帧级控制;在多种动…
深度解读 arXiv:2607.28362 2026-08-01
Fairness Pruning:通过差异激活定位 GLU-MLP 层中的人口统计偏差
Fairness Pruning 提出一种"在推理阶段采集激活、用最小对比 prompt 对筛选差异响应神经元、再通过定向置零改变模型对人口统计属性响应"的轻量级结构性干预方法,在 ≤3B 模型上验证了偏差处理电路与通用能力电路可解耦(dissociable),并指出当前 BiasScore 缺乏符号信息会带来双向偏差…
深度解读 arXiv:2607.28319 2026-08-01
Σ-Mem:基于 LLM 的多智能体系统的在线可靠性记忆
本文提出 ΣMem(SigmaMem),一种面向多智能体系统的在线可靠性记忆:它不存储"交互内容",而是用两个实对称矩阵(每个对等方的历史能力证据 + 对等方两两之间的关系证据)显式建模"哪个 peer 在什么条件下可信",并用 Weyl 不等式给出每一步更新的谱变化上界,保证在线更新稳定、可叠加;同一个记忆可通过统一…
深度解读 arXiv:2607.27958 2026-08-01
DualG-MRAG:面向多模态 RAG 的宏观推理与微观匹配解耦
DualGMRAG 提出双层图解耦架构,将多跳多模态 RAG 中的全局拓扑路由(Macro Graph)与细粒度证据匹配(Micro Graph)分开,并通过 GNN Retriever 驱动的查询传导消息传递实现动态关联传播,在证据召回率和复杂问答准确率上均超越基线。 MMRAG(Multimodal Retriev…
深度解读 arXiv:2607.28580 2026-08-01
CoMem:利用 Transformer 深度分工实现无界上下文记忆
CoMem(Comprehension Memory)发现 Transformer 深度并非均匀使用——中低层负责语义理解,上层专化为预测——并将此分工规律转化为一种无界上下文记忆机制:对每个上下文 chunk 仅通过中间层写入,检索固定数量的缓存残差状态,然后在压缩包上重算上层,达成与存储长度无关的固定读取计算和内存…
深度解读 arXiv:2607.28263 2026-08-01
LEDGERMIND:基于结构化证据账本的可溯源约束多模态 Agent 推理
LEDGERMIND 将多模态 Agent 轨迹重新建模为可溯源约束的状态机,通过 Structured Evidence Ledger(结构化证据账本)将工具输出归一化,使下游推理声明必须引用账本中的有效条目,从而在实体和数值层面强制溯源,并在四种常见失败模式上取得显著改善。 当前多模态 Agent(VQA 场景)日…
深度解读 arXiv:2607.28374 2026-08-01
OmniScope:面向全模态大语言模型的模态解耦 Token 压缩
OmniScope 是一个免训练的全模态 LLM token 压缩框架,用「查询共享 + 显著性解耦」替代「单模态单向引导」,在激进压缩(25% token 保留率)下最多实现 3.53× prefill 加速、15% GPU 显存下降,平均准确率仅掉 0.35 个百分点。 全模态大语言模型(OmniLLM,如 Qwe…
深度解读 arXiv:2607.23193 2026-08-01
GLM-RAG:图语言模型驱动的知识图谱检索增强生成
GLMRAG 引入 Graph Language Model(GLM)作为知识图谱 RAG 的 Retriever,在跨域迁移能力和多跳推理效果上超越传统 GNNbased 和向量检索方法,在两个多跳 Benchmark 上达到 SOTA,且随参数规模和子图覆盖增加展现出良好的 scaling 特性。 知识图谱 RAG…
深度解读 arXiv:2607.28397 2026-07-31
ConMem:用贡献感知记忆重构长程工业巡检日志 RAG
ConMem 针对钢铁设备长程巡检场景,提出了基于 Shapley 值的贡献感知记忆框架,将历史日志中每个证据单元的诊断价值量化,在受限记忆预算下优先保留高价值弱信号,在真实数据集上实现 76.0% QA 准确率,并将 LLM 输入 token 数减少 88.2%、响应时间降低 86.6%。 工业巡检(尤其是钢铁设备)…
深度解读 arXiv:2607.28126 2026-07-31