解读
1524 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Keyword Search is All You Need:仅靠关键词检索的 Agent 能否替代向量 RAG?
引用:Shreyas Subramanian 等(Amazon Science),"Keyword search is all you need: Achieving RAGLevel Performance without vector databases using agentic tool use",arXiv:…
MCP 生态安全的首份横切面研究:两阶段攻击面与 MCPInspect
MCP(Model Context Protocol)把 LLM 接到外部工具的「最后一公里」标准化了,但也把攻击面从模型本身延伸到了注册表、服务器和工具描述三层。本文对 67,057 个公开 MCP 服务器做横切面审计,发现注册表弱校验 + 工具描述投毒 + 主机无独立校验三条链路都已可被利用,作者据此实现 MCPI…
PolyUQuest:异构图上的可验证、结构感知 Web RAG
PolyUQuest 把"网页不再是扁平文本"这件事工程化到底——它把页面间超链接、页面内 DOM 层级、跨页面实体关系三类结构信号统一到一张异构图里,用一个 twotier router 按问题结构类型分派到三种检索模式(直接块检索 / 跨页图遍历 / 多跳实体推理),每个答案都附带可回溯到结构证据的引用,在 Pol…
GPT-3:语言模型的少样本涌现
GPT3 把 Transformer 语言模型扩到 1750 亿参数后,不更新任何权重就能在多数 NLP 任务上匹配或超过当时为每个任务专门微调的 SOTA,把"上下文学习(incontext learning)"从偶发现象变成了 LLM 的核心能力之一。 2018 年 BERT、2019 年 GPT2 之后,NLP …
主题综述 · evaluation(2026-08-23)
2026 年的 LLM 评测研究,主线已经从"哪个模型在某 benchmark 上得了多少分"的单点准确率,转到了"我们的评测协议本身是否可信"的方法学反思。这一点在三个尺度上同时发生: (1) 综合维度 —— KDD 2025 接收的《Evaluation and Benchmarking of LLM Agents…
PyTorch:把"可编程性 + 高性能"统一起来的深度学习库
PyTorch 用"tensor + autograd + 动态计算图"的最小可编程单元,把 NumPy 风格的命令式编程体验与 GPU 加速、分布式训练、自动微分合并到同一个 Python 程序里,从而把研究阶段的"边写边跑"和工程阶段的"跑得快"做到了同一套 API。 2016 年前后的深度学习框架处在明显的两极分…
当 GPT-4 第一次让研究者「后背一凉」:Sparks of AGI 到底讲了什么?
2023 年初,OpenAI 把 GPT4 的 API 偷偷塞给了几个外部团队,让他们随便玩。其中微软研究院的 Bubeck、Chandrasekaran、Santanu 等人玩了三个月,写出了一份 154 页的评估报告——arXiv 2303.12712,标题就叫《Sparks of Artificial Gener…
让大模型「多想几次」再答:Self-Consistency 是什么神奇 trick?
你有没有过这种经历 🤔: 你问 ChatGPT 一道小学奥数题,它一步到位给出答案 18,你满心欢喜——结果老师批了个大红叉,正确答案是 16。 这时候你可能骂模型「不行」。但 2022 年那篇被引到飞起的论文 arXiv 2203.11171 给了一个极其朴素、却让整个 LLM 推理范式升一档的解法—— 「让模型自己…
Vanilla LoRA 可能就够了:学习率才是 LoRA 变体差异的真正来源
论文:Learning Rate Matters: Vanilla LoRA May Suffice for LLM Finetuning(arXiv:2602.04998v2,cs.LG,202605 更新;作者 YuAng Lee;代码 通过对 9 个有代表性的 LoRA 变体(含 PiSSA、DoRA、AdaLo…
分布式向量数据库在 HPC 上的性能实测:Qdrant × Polaris 超算
本文是首份在 Argonne 实验室 Polaris 超算(AMD EPYC Milan 7543P 32 核 × 512GB × 4×A100、HPE Slingshot 11 互联)上对分布式向量数据库 Qdrant 的实证性能研究,使用 Qwen3Embedding4B 对 829 万篇 peS2o 科学全文做嵌…
GLM:面向图思维链推理的多 Agent 框架与高效 LLM Serving 协同设计
GLM(GraphCoT LLM Multiagent)把"图上的多步推理"拆成四个协作 Agent,并通过 GraphCoT 专用的 KVcache 机制和流水线执行,把单 Agent GraphCoT 流水线重写为可线性扩展的多 Agent 系统,在 GRBench 五个领域上实现 准确率最高 +38%(vs. G…
主题综述 · risk(2026-08-23)
范围:近 4 周(20260726 → 20260823)LLM / Agent 风险研究主轴,覆盖幻觉、对齐税、隐私泄漏、模型窃取、多智能体安全、护栏 / 评测方法学延革 6 条主线 + frontier lab 主动治理 + 红队工具工业级成熟度两条延伸。 与 813 / 817 / 819 三篇 risk 综述的…
AHE:可观测性驱动的 Coding Agent Harness 自动演进
Agentic Harness Engineering (AHE) 用一套"组件 / 经验 / 决策"三层可观测性支柱把 Coding Agent 的 harness(系统提示、工具、中间件、长期记忆等模型外可编辑组件)变成可证伪、可逐文件回滚、自动进化的对象,10 次迭代就让 TerminalBench 2 的 pa…
Nemotron 3 Super:面向 Agentic Reasoning 的开放高效 MoE 混合 Mamba-Transformer 模型
Nemotron 3 Super 是 NVIDIA 推出的 120B 总参 / 12B 激活参数的混合 MambaAttention MoE 模型,首次在 Nemotron 3 系列中同时使用 LatentMoE、NVFP4 预训练与 MTP(MultiToken Prediction)层,并提供 FP8 与 NVFP…
从存储到经验:LLM Agent 记忆机制演化综述
原文标题:From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms,ACL 2026 Findings,arXiv:2605.06716v1(20260507),一作 Lin Hongzhan。 这是一篇把 …
RAGCap-Bench:把 Agentic RAG 的「中间能力」拆开评测
Agentic RAG 系统在端到端 QA 上已经「看起来不错」,但论文发现多跳问题的失败往往不出在最终答案生成,而出在中间几步(规划、检索查询构造、证据筛选、推理链组装)。RAGCapBench 把这些中间任务拆出来独立打分,让研究者能定位「模型到底在哪一步垮掉」,并验证了「慢思考」模型在中间能力强时,端到端结果也更…
AgentLeak:多智能体 LLM 系统内部通道隐私泄露基准
AgentLeak 是首个把多智能体 LLM 系统的隐私泄露测量从"输出层"扩展到"内部通道层"的基准——通过在 7 条隐私相关的通信路径上植入探针,作者在 1,000 个场景、5 个生产模型、4,979 条执行轨迹上证明了一件事:多 Agent 架构在降低最终输出泄露的同时,把大量隐私数据暴露在了 Agent 间消息…
LoRAFusion:消除冗余内存访问的多 LoRA 高效微调系统
LoRAFusion 通过算子级图分裂融合(kernellevel graphsplitting fusion)把 LoRA 微调里夹在大 GEMM 之间的小算子合并掉,砍掉冗余显存访问;同时引入多任务自适应批处理调度器(adaptive batching)把多个独立 LoRA 任务在共享底模的 GPU 上交错排程,端…
DashboardQA:在真实交互式仪表板上给视觉-语言 GUI Agent 出题的硬基准
DashboardQA 是首个明确面向真实交互式仪表板的视觉语言 GUI Agent 问答基准,包含 112 个来自 Tableau Public 的真实仪表板和 405 道跨五类的成对问答(多选、事实、假设、多仪表板、多轮对话)。在它上面,当前最强的闭源与开源 GUI Agent(SOTA 是基于 GeminiPro…
桥接协议与生产:基于 Model Context Protocol 部署 AI Agent 的设计模式
针对 Model Context Protocol(MCP)在企业级 Agent 工具集成中暴露出的三处协议级缺口——身份传递、工具超时预算、错误语义——本文提出三种互补机制 CABP / ATBA / SERF,把"能调用工具"升级为"能稳定、可观测、可恢复地调用工具"。 MCP 自 2024 年底由 Anthrop…
KVP:用强化学习从 KV Cache 中"学会驱逐"
本文把 LLM 推理时的 KV cache 驱逐重新表述为强化学习问题,提出 KV Policy (KVP)——一组只在 K/V 向量上工作的轻量级 perhead RL 智能体,预测未来 token 的效用并据此排序,在 RULER(最长 128K)等长上下文基准上显著优于 recency / attentionsc…
当迭代式 RAG 超越"理想证据":面向科学多跳问答的机制级诊断研究
在化学多跳问答基准 ChemKGMultiHopQA 上,"按需分阶段检索 + 推理"的同步控制器(Iterative RAG)可以稳定跑赢"一次性灌入全套黄金证据"的静态 RAG(Gold Context),最大领先可达 25.6 个百分点;非推理微调模型从中获益最大,差距主要由"晚跳覆盖、组合合成、锚点漂移、停步时…
ViT-5:面向 2020 年代中期的 Vision Transformer
ViT5 在不破坏「AttentionFFN」骨架的前提下,把过去五年里 Language Model / 视觉骨干网络的成熟技巧(LayerScale、RMSNorm、2D RoPE、QKNorm、Register Token 等)系统地搬回 Vision Transformer,得到一套「即插即用」的新一代纯 Vi…
Sparks of AGI:早期 GPT-4 实验 — 通用智能的"火花"
微软研究院对当时仍在活跃开发的早期 GPT4 进行了大规模定性评估,论证其在数学、代码、视觉、医学、法律、心理学等领域的零样本能力已接近人类水平,具备"通用人工智能(AGI)的早期火花"。 2023 年初,大型语言模型能力突飞猛进,但主流 NLP benchmark 已经接近饱和,研究者难以判断"模型到底会不会做难事"…
"他在看什么?"——AI 终于能用一句话告诉你了,GazeAnywhere 把注视估计从"装几个模块"变成"端到端可提问"
你有没有想过 🤔: 一张监控画面里有 5 个人——司机、乘客 A、乘客 B、后排小孩、路人。 你想知道"司机在看哪里"——是仪表盘、后视镜、还是手机? 现在的 AI 大概率会答错——因为传统方案是"先找人脸、再估计视线",5 张脸挤在一起,它根本分不清谁是谁。 或者在 AR/VR 里,你对眼镜说"看那个红色 app",…
BloombergGPT:50B 参数的金融领域 LLM,用混合语料证明"专业 + 通用"两条腿走路
引用:Shijie Wu, Ozan İrsoy, Steven Lu, Vadim Dabravolski, Mark Dredze, Sebastian Gehrmann, Prabhanjan Kambadur, David Rosenberg, Gideon Mann(Bloomberg + Johns Hop…
Gemini 1.5:用稀疏 MoE 把多模态长上下文推到百万 token
引用:Gemini Team Google(1037+ 作者),"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context",arXiv:2403.05530,v1 20240308,v5 20241216。分…
HuggingGPT:用 ChatGPT 当控制器,把 Hugging Face 上的模型串成多模态 Agent
HuggingGPT(又称 JARVIS)提出"LLM as Controller"范式:让 ChatGPT 作为大脑,把自然语言任务分解成子任务,自动挑选 Hugging Face 上合适的专家模型去执行,再用自然语言汇总结果,从而把跨模态、跨领域的孤立模型串成一个统一 Agent。 2023 年前后,Hugging…
Text World Models:给 LLM Agent 装上一个"环境心理模型"
本文是一篇系统性综述(survey),围绕"形式化框架 + Agent 生命周期"两条主轴,把面向 LLMbased Agent 的 Text World Models(TWM,文本世界模型)这一快速分化的方向整合成四个部分——基础与表征、构建范式(LLMasWM vs CodeasWM)、应用方式(训练时 / 推理时…
Agent Skill 评估与演化:框架与 Benchmark 综述
这是 2026 年关于 LLM Agent Skill(技能) 的首篇系统性综述:把 Skill 演化拆成 执行反馈 / 轨迹蒸馏 / 压缩与增强 / 强化学习 四种范式,再用 六个基准类别 对比评测体系——并明确指出仅靠技能名与描述匹配在大规模场景下不可靠、必须用 retriever+reranker 才能落地,给 …