Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

桥接协议与生产:基于 Model Context Protocol 部署 AI Agent 的设计模式
针对 Model Context Protocol(MCP)在企业级 Agent 工具集成中暴露出的三处协议级缺口——身份传递、工具超时预算、错误语义——本文提出三种互补机制 CABP / ATBA / SERF,把"能调用工具"升级为"能稳定、可观测、可恢复地调用工具"。 MCP 自 2024 年底由 Anthrop…
深度解读 arXiv:2603.13417 2026-08-23
KVP:用强化学习从 KV Cache 中"学会驱逐"
本文把 LLM 推理时的 KV cache 驱逐重新表述为强化学习问题,提出 KV Policy (KVP)——一组只在 K/V 向量上工作的轻量级 perhead RL 智能体,预测未来 token 的效用并据此排序,在 RULER(最长 128K)等长上下文基准上显著优于 recency / attentionsc…
深度解读 arXiv:2602.10238 2026-08-23
当迭代式 RAG 超越"理想证据":面向科学多跳问答的机制级诊断研究
在化学多跳问答基准 ChemKGMultiHopQA 上,"按需分阶段检索 + 推理"的同步控制器(Iterative RAG)可以稳定跑赢"一次性灌入全套黄金证据"的静态 RAG(Gold Context),最大领先可达 25.6 个百分点;非推理微调模型从中获益最大,差距主要由"晚跳覆盖、组合合成、锚点漂移、停步时…
深度解读 arXiv:2601.19827 2026-08-23
ViT-5:面向 2020 年代中期的 Vision Transformer
ViT5 在不破坏「AttentionFFN」骨架的前提下,把过去五年里 Language Model / 视觉骨干网络的成熟技巧(LayerScale、RMSNorm、2D RoPE、QKNorm、Register Token 等)系统地搬回 Vision Transformer,得到一套「即插即用」的新一代纯 Vi…
深度解读 arXiv:2602.08071 2026-08-23
Sparks of AGI:早期 GPT-4 实验 — 通用智能的"火花"
微软研究院对当时仍在活跃开发的早期 GPT4 进行了大规模定性评估,论证其在数学、代码、视觉、医学、法律、心理学等领域的零样本能力已接近人类水平,具备"通用人工智能(AGI)的早期火花"。 2023 年初,大型语言模型能力突飞猛进,但主流 NLP benchmark 已经接近饱和,研究者难以判断"模型到底会不会做难事"…
深度解读 arXiv:2303.12712 2026-08-23
BloombergGPT:50B 参数的金融领域 LLM,用混合语料证明"专业 + 通用"两条腿走路
引用:Shijie Wu, Ozan İrsoy, Steven Lu, Vadim Dabravolski, Mark Dredze, Sebastian Gehrmann, Prabhanjan Kambadur, David Rosenberg, Gideon Mann(Bloomberg + Johns Hop…
深度解读 arXiv:2303.17564 2026-08-23
Gemini 1.5:用稀疏 MoE 把多模态长上下文推到百万 token
引用:Gemini Team Google(1037+ 作者),"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context",arXiv:2403.05530,v1 20240308,v5 20241216。分…
深度解读 arXiv:2403.05530 2026-08-23
HuggingGPT:用 ChatGPT 当控制器,把 Hugging Face 上的模型串成多模态 Agent
HuggingGPT(又称 JARVIS)提出"LLM as Controller"范式:让 ChatGPT 作为大脑,把自然语言任务分解成子任务,自动挑选 Hugging Face 上合适的专家模型去执行,再用自然语言汇总结果,从而把跨模态、跨领域的孤立模型串成一个统一 Agent。 2023 年前后,Hugging…
深度解读 arXiv:2303.17580 2026-08-23
Text World Models:给 LLM Agent 装上一个"环境心理模型"
本文是一篇系统性综述(survey),围绕"形式化框架 + Agent 生命周期"两条主轴,把面向 LLMbased Agent 的 Text World Models(TWM,文本世界模型)这一快速分化的方向整合成四个部分——基础与表征、构建范式(LLMasWM vs CodeasWM)、应用方式(训练时 / 推理时…
深度解读 arXiv:2606.09032 2026-08-23
Agent Skill 评估与演化:框架与 Benchmark 综述
这是 2026 年关于 LLM Agent Skill(技能) 的首篇系统性综述:把 Skill 演化拆成 执行反馈 / 轨迹蒸馏 / 压缩与增强 / 强化学习 四种范式,再用 六个基准类别 对比评测体系——并明确指出仅靠技能名与描述匹配在大规模场景下不可靠、必须用 retriever+reranker 才能落地,给 …
深度解读 arXiv:2606.11435 2026-08-23
LLM Agent 安全综述:威胁面、攻击、防御与评估
这篇综述把 247 篇 LLM Agent 安全相关文献串成一张以"信息流 × 委托权限 × 持久状态"三轴为骨架的全景图,论证当下 prompt injection 与工具劫持仍是主战场,但状态污染与多 Agent 传播正在变成新的核心风险,而防御层彼此割裂、benchmark 又偏理想化,呼吁把 Agent 安全当…
深度解读 arXiv:2606.10749 2026-08-23
用图增强的大语言模型做空间检索:当 RAG 走出文本框
声明:本解读基于公开 arxiv 摘要页(abs/2606.22909)与所属分类(cs.DB / cs.AI / cs.IR)。论文卡在仓库内暂缺,所有具体数字若未在摘要中给出,标注"原文未明确"。 把 LLM 当成"提问者"、把空间数据库当成"回答者",用图结构(Rtree、邻接表、知识图谱)作为中介,让自然语言问…
深度解读 arXiv:2606.22909 2026-08-23
LISA:把"侧支网络"对齐到似然分数——视觉条件可控生成的加速器
声明:本解读基于 arxiv 公开 HTML 版(arxiv.org/html/2606.27192v1)的摘要与第 1–3 节,未下载 PDF、未运行代码。具体 FID / 用户研究等实验数字若未在上游页面给出,标注"原文未明确"或仅引用文中已经明文的指标(如图 1 的 2.78× 收敛、decoder 约 0.1%…
深度解读 arXiv:2606.27192 2026-08-23
参数高效的量子启发快速权重编程器用于流量矩阵预测
本文把"门控量子启发的 KolmogorovArnold 网络快速权重编程器"(GQKANFWP)搬上网络流量矩阵(Traffic Matrix, TM)预测任务,在只使用较大 LSTM 22.4% 参数量的前提下,于 Abilene 数据集上拿下最低的 pooled RMSE,并在通道级别取得明显多于 LSTM 的"…
深度解读 arXiv:2606.27821 2026-08-23
LLM Agent 综述:LLM 作为通用智能体的崛起与潜力
这篇 86 页综述(Xi et al., 复旦 NLP 实验室,arXiv:2309.07864)系统梳理了"基于大语言模型的智能体(LLMbased Agent)"这一方向:先追溯 Agent 概念从哲学到 AI 的演变,再提出"大脑感知行动"统一框架,最后覆盖单 Agent、多 Agent、人机协作、Agent 社…
深度解读 arXiv:2309.07864 2026-08-23
Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Tasks
Claude Opus 4.6 与 GPT5.4 xhigh 等顶级 Coding Agent,在面对生僻编程语言时,不是硬写目标语言代码,而是用 Python 生成目标语言代码(metaprogramming)——禁止这一策略后性能骤降,揭示了现有评测体系对真实能力的遮蔽。 主流 Coding Agent 评测(SW…
深度解读 arXiv:2606.10933 2026-08-23
理解环境感知信息检索:让 LLM 为不同 retriever 学会"换一种提问方式"
针对 RAG 中"同一个 query 用不同 retriever 效果差异巨大"这一长期被忽视的问题,本文用强化学习(RL)系统训练 LLM 为不同 retriever 学习差异化的 query 改写策略,并提出 branching rollout 提升多步检索的训练稳定性,是"retrieveraware RAG"的…
深度解读 arXiv:2606.16817 2026-08-23
Context-Aware RL for Agentic and Multimodal LLMs(上下文感知的强化学习,用于 Agent 与多模态大模型)
ContextRL 提出一种"上下文二选一"的间接辅助强化学习目标:让模型在"查询 + 答案 + 两个高度相似的上下文"之间选出真正支撑该答案的那一个,从而把"细粒度证据感知"写进 reward,平均在 5 个长周期基准上较 GRPO 提升 +2.2%、在 12 个 VQA 基准上提升 +1.8%,且增益并非来自"多了…
深度解读 arXiv:2606.17053 2026-08-23
Primacy Bias in Multimodal Retrieval-Augmented Question Answering
多模态 KBVQA 中的检索信息并非「迷失在中间」(U 形),而是「迷失在末尾」——gold passage 放在首位比放在末位可高出 26 分,且 retrievalside 修复全部无效,闭gap必须从 reader 侧下手。 当 VisionLanguage Model(VLM)需要在超出其参数知识范围的问题上给…
深度解读 arXiv:2606.16494 2026-08-23
Directory-Aware Query and Maintenance in Vector Databases
TrieHI 通过将目录拓扑保留为原生前缀树,使向量数据库首次实现了层级目录语义的高效递归检索与低维护成本写操作,已集成于字节跳动的开源 AI Agent 上下文数据库 OpenViking。 向量数据库(Vector DB)在现代 LLM / Agent 系统中处于核心基础设施地位——负责存储 Embedding、支…
深度解读 arXiv:2606.16903 2026-08-23
MMLongEmbed:长上下文多模态嵌入模型的系统性基准
MMLongEmbed 把「多模态嵌入模型(Multimodal Embedding Models, MEMs)真的能消化多长的输入」这一关键问题第一次做成可量化的系统基准:通过文本、文档、视频三种模态、四类检索任务、覆盖多个上下文长度区间的评测,作者揭示了一个刺眼的事实——当前 MEMs 在长上下文下严重依赖浅层特征…
深度解读 arXiv:2606.14747 2026-08-23
VideoRAG & V-RAGBench:视频检索的新范式——Chunk 自适应配置选择
VRAGBench 揭示了现有 VideoRAG 的两个根本问题——基准数据集无法真正评测检索(半数 Query 不用视频也能答对),且所有方法都在 Query 级别统一决定"用哪种模态和粒度"而非在 Chunk 级别自适应选择。CARVE 方法通过并行检索 + Chunk 自适应重排序,让每个视频片段用自己的"最优配…
深度解读 arXiv:2606.13141 2026-08-22
DeLM:基于共享上下文的去中心化多 Agent 系统
DeLM(Decentralized Language Models)提出一种去中心化多 Agent 框架,用「并行 Agent + 共享已验证上下文 + 任务队列」替代中心调度器,在 SWEbench Verified 上 Avg.@1 / Pass@2 / Pass@4 全面 SOTA(相对最强基线最高 +10.5…
深度解读 arXiv:2606.10662 2026-08-22
Agent Harness 的构成性定义:什么是、什么不是 harness
本文通过概念分析(conceptual analysis)+ 文献谱系学 + 灰文献对照,给出「agent harness」一个操作性 / 构成性定义,把它与 agent framework、agent SDK、IDE plugin、eval harness、orchestrator 一一划清边界;并用 6 个真实 h…
深度解读 arXiv:2606.10106 2026-08-22
Context-Fractured Decomposition:跨上下文多步越狱与「来源缺口」
本文揭示一种针对使用工具的 LLM Agent的部署级失效模式——「来源缺口(provenance gap)」,并提出 ContextFractured Decomposition(CFD)——一类跨上下文、多步的越狱攻击族:通过在早期交互中保留「看起来无害」的中间产物(工作区文件、日志等),在很久之后、在不同 Age…
深度解读 arXiv:2606.09084 2026-08-22
Parthenon Law:自我演化的法律 Agent 框架
本文提出 Parthenon,一种面向法律垂直领域的"自我演化"(selfevolving)Agent 框架:把 Model / Harness / Agent 角色 / 法律 Knowledge / 确定性 Tools / 程序性 Skills 拆成可审计面,配以"反泄漏的学习循环",把失败 case 自动沉淀到 s…
深度解读 arXiv:2606.04602 2026-08-22
OScaR:极低比特 KV Cache 量化的奥卡姆剃刀
OScaR 发现 Token Norm Imbalance(TNI)是 KV Cache 极端量化(INT2/INT4)的核心瓶颈,通过轻量级 Canalized Rotation + OmniToken Scaling 在不引入复杂训练流水线的前提下,实现了接近无损的压缩效果——解码速度提升 3.0×,内存占用降低 …
深度解读 arXiv:2605.19660 2026-08-22
M³Exam:真实用户-Agent 交互场景下的多模态记忆Benchmark
M³Exam 揭示了现有 MLLM 在真实多会话人Agent 交互中的多模态记忆缺陷:跨模态定位(crossmodal grounding)、跨会话推理(crosssession reasoning)和多模态上下文累积的效率成本是三个核心瓶颈。其提出的 M³Proctor 方法通过按需视觉消费,将准确率提升 13% 的…
深度解读 arXiv:2606.07402 2026-08-22
AsymCache:把 KV Cache 决策摆到 GPU 注意力内核的同一张桌子上
提出 AsymCache —— 一个计算延迟感知的 KV cache 管理系统,让"哪些 block 留下、哪些 block 驱逐"的决策显式对齐 GPU 注意力内核的执行效率,相比最新基线 TTFT(首 token 时间)降 1.90–2.03×、TPOT(每 token 时间)降 1.62–1.71×,并且可以无缝…
深度解读 arXiv:2606.02964 2026-08-22
ForeSci:把"AI 研究的前瞻判断力"做成时间受控的考卷
提出 ForeSci —— 一个时间受控的前瞻性 AI 研究判断基准,含 500 道任务、4 个快节奏 AI 子领域、4 类决策族,并配套评测了原生 LLM、Hybrid RAG、以及三种 researchagent 适配方案在 4 种骨干上的表现。显式组织证据能改善可追溯性,但增益强烈依赖决策族类型;诊断还发现一个反…
深度解读 arXiv:2606.00644 2026-08-22