Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Taming the Titans:高效 LLM 推理服务综述
这是一篇由苏州大学与华为云联合发布的 LLM 推理服务(LLM Serving)领域系统综述,把当前零散分布在系统、调度、存储、硬件等方向的优化手段,第一次按"实例级 → 集群级 → 新兴场景 → 杂项"四级层级串成一张可索引的地图,并指出 LLM Serving 正从"工程调优"向"理论优化"升级的研究范式转变。 L…
深度解读 arXiv:2504.19720 2026-08-25
ReMemR1:让长上下文 LLM Agent 能"回头看"的记忆回调与多级奖励
ReMemR1 把"记忆检索"机制嵌入到"边读边记"记忆更新过程中,并在强化学习训练阶段同时使用最终答案奖励与 step 级密集信号,使长上下文问答 Agent 能在数百万 token 文档里做非线性多跳推理,并以极小计算开销取得对 SOTA 的大幅领先。 长上下文问答(LongContext QA)是当前 LLM 的…
深度解读 arXiv:2509.23040 2026-08-25
LongVideoAgent:长视频多智能体推理
LongVideoAgent 提出一个"主 Agent + grounding Agent + vision Agent"三层多智能体框架,让一个 master LLM 显式规划、分工调度,专门解决小时级长视频问答中"压缩丢细节、工具太单一、规划不稳定"的老毛病,并在新数据集 LongTVQA / LongTVQA+ …
深度解读 arXiv:2512.20618 2026-08-25
Continuum:面向多轮 Agent 工作负载的 KV Cache TTL 调度系统
Continuum 提出一种基于 KV Cache TTL(timetolive)的多轮 Agent 请求调度策略,按 reload 成本与排队延迟选择性地把 KV cache pin 在 GPU 上,使多轮 Agent 工作流在 SWEBench、BFCL、OpenHand 等真实负载下的平均 Job Complet…
深度解读 arXiv:2511.02230 2026-08-25
STEP3-VL-10B 技术报告:10B 参数的多模态小巨人
StepFun(阶跃星辰)发布的多模态基础模型 STEP3VL10B,用 10B 的紧凑参数体量,借助"全参数解冻预训练 1.2T tokens + 1k+ 轮强化学习 + PaCoRe 并行协调推理"三板斧,在 MMBench、MMMU、AIME2025、MathVision、ScreenSpotV2 等基准上达到或…
深度解读 arXiv:2601.09668 2026-08-25
Compound AI Systems:从"单体大模型"到"集成智能体"的系统级综述
引用:Jiayi Chen 等,"From Standalone LLMs to Integrated Intelligence: A Survey of Compound AI Systems",arXiv:2506.04565v2,20250605 v1 提交,20260508 v2 更新。分类:cs.MA(多智能…
深度解读 arXiv:2506.04565 2026-08-25
UniSpace:把"理解-生成-编辑"压进同一套 ViT 视觉空间的统一表征
UniSpace 提出一种 Patch Reparameterization(Patch 重参数化)技巧,把一个已经预训练好的纯语义 ViT 同时改造成"既懂语义又看得清像素"的统一视觉表征,进而在此之上扩出一个 8B 的 MixtureofTransformerExperts 模型,让理解、生成、编辑三件事共用同一套…
深度解读 arXiv:2608.08676 2026-08-25
Hydra-0:用"像素级动作流"做通用世界模型与机器人控制的统一接口
Hydra0 把所有机器人动作都表示成 像素级运动(action flow)——也就是"动作在画面里造成哪些像素怎么动"——作为通用世界模型与控制的共享视觉接口,实现了跨 embodiment、跨任务、跨环境的统一条件信号,并在此基础上发现了一种反向模式:能从人类示教视频里的物体运动直接推出可执行的机器人动作。 通用机…
深度解读 arXiv:2608.18077 2026-08-25
Human-Centric Intelligence 综述:把"以人为中心"的 AI 重新装回 Foundation Model 的语境
这是一篇把"以人为中心的智能(HumanCentric Intelligence)"这条碎片化、跨任务跨模态跨社区的研究脉络 重新装回 Foundation Model 框架 的综述:用一套六层人类语境分类法 + 数据 / 架构 / 训练推理优化的方法论分层,把视觉外观、空间几何、运动学、交互、世界模拟、具身 agen…
深度解读 arXiv:2608.18184 2026-08-25
Scaling Embeddings Outperforms Scaling Experts:LongCat-Flash-Lite 与正交于 MoE 的稀疏维度
说明:工作队列中本条目最初以「LLM Research Papers: 2026 List」为标题索引(来自 Sebastian Raschka 的 newsletter 列表),但其对应的 arXiv ID 2601.21204 实际指向美团 LongCat 团队的 LongCatFlashLite 论文。本文按 a…
深度解读 arXiv:2601.21204 2026-08-24
Mamba-3:基于状态空间原理改进序列建模
Mamba3 通过"更富表达力的 SSM 离散化递推 + 复数值状态更新 + 多输入多输出(MIMO)"三项正交改进,在不增加 decode 延迟的前提下,把次二次(subquadratic)线性序列模型在检索、状态追踪与下游语言建模任务上推到了新的 Pareto 前沿,1.5B 规模相比 Gated DeltaNet…
深度解读 arXiv:2603.15569 2026-08-24
Agent UQ:LLM 智能体不确定性量化的基础、挑战与机遇
这篇论文主张 LLM 不确定性量化(UQ)研究必须从"单轮 QA"切到"交互式 Agent"场景,给出第一个能涵盖现有 UQ 设置的通用 Agent UQ 形式化,并系统列出 Agent 场景下四类独有挑战,在 τ²bench 上做了实证。 过去两年 LLM UQ 主流路线(verbalized confidence、…
深度解读 arXiv:2602.05073 2026-08-24
LLM 驱动的 AI Agent 系统及其行业应用综述
这是一篇定位为「行业工程师入门地图」的 LLM Agent 综述:它把从 preLLM 时代规则 agent,到当前 LLM 驱动的软件型 / 物理型 / 混合型 agent 的演化一次性梳理,并按行业(客服、软件开发、制造、个性化教育、金融交易、医疗)给出落地形态、挑战与缓解路径,最终指向一个结论——LLM agen…
深度解读 arXiv:2505.16120 2026-08-23
DualPath:打破 Agentic LLM 推理的存储带宽瓶颈
原文标题:Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference,arXiv:2602.21548v2(20260226),cs.DC。 作者:Yongtong Wu、Shaoyuan Chen、Yinmin Zhong 等共 13 人。 D…
深度解读 arXiv:2602.21548 2026-08-23
Natural-Language Agent Harnesses:把 Agent Harness 变成可执行的自然语言对象
这是一篇重新定义 agent harness 表示形式的论文:它提出 NaturalLanguage Agent Harnesses(NLAH)——用可编辑的自然语言文档描述运行级 harness 策略——以及 Intelligent Harness Runtime(IHR),一个把这些文档解释为 agent 调用、交…
深度解读 arXiv:2603.25723 2026-08-23
Keyword Search is All You Need:仅靠关键词检索的 Agent 能否替代向量 RAG?
引用:Shreyas Subramanian 等(Amazon Science),"Keyword search is all you need: Achieving RAGLevel Performance without vector databases using agentic tool use",arXiv:…
深度解读 arXiv:2602.23368 2026-08-23
MCP 生态安全的首份横切面研究:两阶段攻击面与 MCPInspect
MCP(Model Context Protocol)把 LLM 接到外部工具的「最后一公里」标准化了,但也把攻击面从模型本身延伸到了注册表、服务器和工具描述三层。本文对 67,057 个公开 MCP 服务器做横切面审计,发现注册表弱校验 + 工具描述投毒 + 主机无独立校验三条链路都已可被利用,作者据此实现 MCPI…
深度解读 arXiv:2510.16558 2026-08-23
PolyUQuest:异构图上的可验证、结构感知 Web RAG
PolyUQuest 把"网页不再是扁平文本"这件事工程化到底——它把页面间超链接、页面内 DOM 层级、跨页面实体关系三类结构信号统一到一张异构图里,用一个 twotier router 按问题结构类型分派到三种检索模式(直接块检索 / 跨页图遍历 / 多跳实体推理),每个答案都附带可回溯到结构证据的引用,在 Pol…
深度解读 arXiv:2607.08269 2026-08-23
GPT-3:语言模型的少样本涌现
GPT3 把 Transformer 语言模型扩到 1750 亿参数后,不更新任何权重就能在多数 NLP 任务上匹配或超过当时为每个任务专门微调的 SOTA,把"上下文学习(incontext learning)"从偶发现象变成了 LLM 的核心能力之一。 2018 年 BERT、2019 年 GPT2 之后,NLP …
深度解读 arXiv:2005.14165 2026-08-23
PyTorch:把"可编程性 + 高性能"统一起来的深度学习库
PyTorch 用"tensor + autograd + 动态计算图"的最小可编程单元,把 NumPy 风格的命令式编程体验与 GPU 加速、分布式训练、自动微分合并到同一个 Python 程序里,从而把研究阶段的"边写边跑"和工程阶段的"跑得快"做到了同一套 API。 2016 年前后的深度学习框架处在明显的两极分…
深度解读 arXiv:1912.01703 2026-08-23
Vanilla LoRA 可能就够了:学习率才是 LoRA 变体差异的真正来源
论文:Learning Rate Matters: Vanilla LoRA May Suffice for LLM Finetuning(arXiv:2602.04998v2,cs.LG,202605 更新;作者 YuAng Lee;代码 通过对 9 个有代表性的 LoRA 变体(含 PiSSA、DoRA、AdaLo…
深度解读 arXiv:2602.04998 2026-08-23
分布式向量数据库在 HPC 上的性能实测:Qdrant × Polaris 超算
本文是首份在 Argonne 实验室 Polaris 超算(AMD EPYC Milan 7543P 32 核 × 512GB × 4×A100、HPE Slingshot 11 互联)上对分布式向量数据库 Qdrant 的实证性能研究,使用 Qwen3Embedding4B 对 829 万篇 peS2o 科学全文做嵌…
深度解读 arXiv:2509.12384 2026-08-23
GLM:面向图思维链推理的多 Agent 框架与高效 LLM Serving 协同设计
GLM(GraphCoT LLM Multiagent)把"图上的多步推理"拆成四个协作 Agent,并通过 GraphCoT 专用的 KVcache 机制和流水线执行,把单 Agent GraphCoT 流水线重写为可线性扩展的多 Agent 系统,在 GRBench 五个领域上实现 准确率最高 +38%(vs. G…
深度解读 arXiv:2511.01633 2026-08-23
AHE:可观测性驱动的 Coding Agent Harness 自动演进
Agentic Harness Engineering (AHE) 用一套"组件 / 经验 / 决策"三层可观测性支柱把 Coding Agent 的 harness(系统提示、工具、中间件、长期记忆等模型外可编辑组件)变成可证伪、可逐文件回滚、自动进化的对象,10 次迭代就让 TerminalBench 2 的 pa…
深度解读 arXiv:2604.25850 2026-08-23
Nemotron 3 Super:面向 Agentic Reasoning 的开放高效 MoE 混合 Mamba-Transformer 模型
Nemotron 3 Super 是 NVIDIA 推出的 120B 总参 / 12B 激活参数的混合 MambaAttention MoE 模型,首次在 Nemotron 3 系列中同时使用 LatentMoE、NVFP4 预训练与 MTP(MultiToken Prediction)层,并提供 FP8 与 NVFP…
深度解读 arXiv:2604.12374 2026-08-23
从存储到经验:LLM Agent 记忆机制演化综述
原文标题:From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms,ACL 2026 Findings,arXiv:2605.06716v1(20260507),一作 Lin Hongzhan。 这是一篇把 …
深度解读 arXiv:2605.06716 2026-08-23
RAGCap-Bench:把 Agentic RAG 的「中间能力」拆开评测
Agentic RAG 系统在端到端 QA 上已经「看起来不错」,但论文发现多跳问题的失败往往不出在最终答案生成,而出在中间几步(规划、检索查询构造、证据筛选、推理链组装)。RAGCapBench 把这些中间任务拆出来独立打分,让研究者能定位「模型到底在哪一步垮掉」,并验证了「慢思考」模型在中间能力强时,端到端结果也更…
深度解读 arXiv:2510.13910 2026-08-23
AgentLeak:多智能体 LLM 系统内部通道隐私泄露基准
AgentLeak 是首个把多智能体 LLM 系统的隐私泄露测量从"输出层"扩展到"内部通道层"的基准——通过在 7 条隐私相关的通信路径上植入探针,作者在 1,000 个场景、5 个生产模型、4,979 条执行轨迹上证明了一件事:多 Agent 架构在降低最终输出泄露的同时,把大量隐私数据暴露在了 Agent 间消息…
深度解读 arXiv:2602.11510 2026-08-23
LoRAFusion:消除冗余内存访问的多 LoRA 高效微调系统
LoRAFusion 通过算子级图分裂融合(kernellevel graphsplitting fusion)把 LoRA 微调里夹在大 GEMM 之间的小算子合并掉,砍掉冗余显存访问;同时引入多任务自适应批处理调度器(adaptive batching)把多个独立 LoRA 任务在共享底模的 GPU 上交错排程,端…
深度解读 arXiv:2510.00206 2026-08-23
DashboardQA:在真实交互式仪表板上给视觉-语言 GUI Agent 出题的硬基准
DashboardQA 是首个明确面向真实交互式仪表板的视觉语言 GUI Agent 问答基准,包含 112 个来自 Tableau Public 的真实仪表板和 405 道跨五类的成对问答(多选、事实、假设、多仪表板、多轮对话)。在它上面,当前最强的闭源与开源 GUI Agent(SOTA 是基于 GeminiPro…
深度解读 arXiv:2508.17398 2026-08-23