Explainers · 学术推广产出

解读

1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

LLM Serving 需要数学优化与算法基础,而非仅靠启发式
这篇立场论文认为,LLM 推理 serving 已超越「通用启发式」的舒适区,必须把请求路由、调度、KV cache 淘汰当作可被数学建模与证明的算法问题,而不是分布式系统教科书的模板搬运。 LLM serving 系统(vLLM、SGLang、TGI 等)近年在工程上做了大量优化:PagedAttention、Con…
深度解读 arXiv:2605.01280 2026-07-15
The Last Harness You'll Ever Build:用 Meta-Evolution 让"自动化本身"也自动化
这篇论文提出一个两层框架,第一层(Automated Harness Engineering, AHE) 把"为新任务手写 harness"变成"自动搜索 harness",第二层(MetaEvolution) 进一步把"如何做自动搜索"本身也自动化——最后得到一个"对新任务零人工 harness 工程"的元学习蓝图 …
深度解读 arXiv:2604.21003 2026-07-15
Qwen-RobotNav 技术报告:面向 Agentic 导航系统的可扩展导航模型
QwenRobotNav 把"任务模式 + 观测参数(token 预算、相机权重等)"做成可在推理时被外部重配的参数化接口,配合训练期随机化和 15.6M 多任务数据,得到一个 2B→8B 都能 SOTA 跨基准、且天然适合被上层 Agent 当作可调用原语的导航模型。 Embodied AI / 机器人导航里有几类任…
深度解读 arXiv:2606.18112 2026-07-15
通过直接在线策略蒸馏实现弱到强泛化
Direct OnPolicy Distillation(DirectOPD)把"小模型做完 RLVR 后学到了什么"作为稠密隐式奖励,直接蒸馏到大模型上,让弱教师可以反复驱动强学生的提升,而不需要在每个新一代强模型上重跑稀疏奖励 RL。 RLVR(Reinforcement Learning with Verifia…
深度解读 arXiv:2607.05394 2026-07-15
基于 Gist Token 的简化稀疏注意力
提出 Simplified Sparse Attention (SSA):在 不改动任何模型架构 的前提下,仅靠一段「gist token + 受限 attention mask」的继续预训练,让模型学会把每个 chunk 的关键信息压缩到少量 gist token 之中;推理时用 query 仅与各 chunk 的 …
深度解读 arXiv:2604.20920 2026-07-14
MLOps 工具系统综述:工具采纳、生命周期覆盖与关键洞察
对聚焦 MLOps 工具 的学术文献做了一次系统综述(Systematic Review),把分散的工具映射到 MLOps 生命周期各阶段,揭示它们的功能、边界与所针对的挑战;指出 没有任何一款工具能覆盖完整生命周期,真实工程中必然是「多工具组合 + 互操作性」取胜,呼吁学术界与产业界重视跨工具互操作问题。 过去几年 …
深度解读 arXiv:2604.16371 2026-07-14
AlphaEval:在生产环境中评估 Agent —— 一份来自七家公司的 94 个真实任务基准
AlphaEval 提出了一份 productiongrounded 的 Agent 评测基准——94 个任务直接来自 7 家正在核心业务里部署 AI Agent 的真实公司,覆盖 6 个 ONET 领域,并把评估对象从"模型"抬升到"完整的 Agent 产品(如 Claude Code、Codex 等商业系统)",同…
深度解读 arXiv:2604.12162 2026-07-14
PAST-TIDE:原型锚定的语句调优与主题不变归一化方法用于立场检测
PASTTIDE 是一套面向低资源阿拉伯语立场检测(Stance Detection)的轻量方案:用「MLM cloze 式的语句调优(Statement Tuning)」替换随机初始化的分类头,叠加「原型对比学习(Prototypical Contrastive Learning)」与「主题条件层归一化(TopicC…
深度解读 arXiv:2607.04690 2026-07-14
衡量人类与 LLM 研究思路之间的差距
本文用一套两轴"研究品味(researchtaste)"分类法对人类与 LLM 在同一文献上下文下产出的研究思路做"分布级"对比,发现 LLM 的思路分布范围明显比人类更窄、且系统性偏向"桥接式动机 + 综合式方法"——即 LLM 更倾向把已有工作缝起来,而人类更愿意去发现失败、提出反例、暴露结构性缺口。 LLM 被大…
深度解读 arXiv:2607.01233 2026-07-14
Sparse Delta Memory:通过稀疏性扩展线性 RNN 的状态容量
本文提出 Sparse Delta Memory(SDM),在 Gated DeltaNet(GDN)的基础上用 ProductKey Memory(PKM)式稀疏寻址 把"密集 KV 外积更新"替换成"稀疏读 / 稀疏写到一个大容量显式 memory",在同等参数、同等 FLOPs 的约束下把隐状态容量扩展了三个数量…
深度解读 arXiv:2607.07386 2026-07-14
公共部门机器学习流水线的工程教训:从预标注到生产化
arXiv 链接: + cs.CY,11 页,2 图,4 表) 标题全称:From Prelabeling to Production: Engineering Lessons from a Machine Learning Pipeline in the Public Sector 参考资料:arXiv abstra…
深度解读 arXiv:2511.01545 2026-07-13
Generated Contents Enrichment(GCE):让图像生成的"脑补"过程白箱化
arXiv 链接: MB PDF) 参考资料:arXiv abstract 与 HTML 全文、研究知识库 paper card 002240503650.md。 这篇论文把"稀疏场景描述生成图像"重新定义为一个两步任务——先用显式的场景图(scene graph)把描述补全,再用下游图像生成器渲染,并通过联合训练的对…
深度解读 arXiv:2405.03650 2026-07-13
LogicalRAG:把 Agentic RAG 的控制权交回 LLM,把检索后端退化为倒排索引
arXiv 链接: 参考资料:arXiv abstract 与第三方解读(agentpatterns.ai 的 Boolean Queries over an Inverted Index)、研究知识库 paper card 161260527123.md。 LogicalRAG 主张 Agentic RAG 的瓶颈不…
深度解读 arXiv:2605.27123 2026-07-13
生成无知识泄漏的 RAG 评测基准:SeedRG 与 Reasoning Graph 重写机制
SeedRG 是一个"半合成"RAG 评测基准生成流水线:它先从 seed 题目里抽出一张 reasoning graph(推理图),再用"类型约束的实体替换"把图上的节点换成 LLM 参数化记忆里不大可能见过的新实体,从而制造出结构同构、但答案落在模型参数化知识之外的新题目,让评测分数不再被 parametric m…
深度解读 arXiv:2605.08838 2026-07-13
EvoArena + EvoMem:在"环境会变化"的真实世界里评测与改造 LLM Agent
EvoArena 是一个把"环境会演化"显式建模进评测的 Agent 基准套件,配套的 EvoMem 则是一种 git 风格的 patchbased 记忆机制——它把每一次记忆更新写成带 prestate、poststate、rationale、evidence 的结构化补丁,让 Agent 在面对跨版本规则/接口/用…
深度解读 arXiv:2606.13681 2026-07-13
KV Cache 队列论稳定性分析:首个把「显存」纳入 LLM 推理服务容量规划的排队论框架
本文提出首个同时把「算力」与「GPU 显存(KV Cache)」显式纳入模型的 LLM 推理排队论框架,给出严格的「稳定服务率」条件;运维只需把请求到达率与该条件对照,就能算出「避免无界排队」所需的最小 GPU 集群规模。实验在真实 GPU 产线环境跑过,预测偏差通常在 10% 以内。 LLM 在线推理服务(ChatG…
深度解读 arXiv:2605.04595 2026-07-12
AgenticRAGTracer:面向 Agentic RAG 的 Hop-Aware 多跳诊断基准
AgenticRAGTracer 是首个为 Agentic RAG 量身设计、由 LLM 自动构造并具备 hop 级逐步验证能力的多跳检索推理诊断基准;它在 1,305 条样例上让 GPT5 也只拿到 22.6% 的 EM 准确率,并揭示了"推理链提前坍缩"与"过度延伸"这两类传统评测无法捕捉的失败模式。 Agenti…
深度解读 arXiv:2602.19127 2026-07-12
DIVERGE:面向开放域信息检索的多样性增强 RAG 框架
DIVERGE 是一个即插即用的 agentic RAG 框架,通过"反思驱动的视角生成 + 视角条件化 RAG"的迭代循环,把开放域问答中的多样性提升约 2 倍而不损失答案质量;同时它定义了一套新的"多样性—质量"评估指标,把传统 RAG 在"知识坍缩"上的系统性短板量化暴露了出来。 绝大多数 RAG 系统都建立在"…
深度解读 arXiv:2602.00238 2026-07-12
Video-Oasis:重新审视视频理解的评估方式 —— 一份把"视觉捷径"暴露在阳光下的诊断套件
VideoOasis 是一个 针对现有视频理解基准的"审计工具":通过对一组系统化的诊断测试(decoupling visual and temporal cues),它揭示出 约 55% 的现有 benchmark 样本 可以不靠视觉输入或时序上下文就被答对;剔除这些"捷径样本"后,剩余真正依赖视觉与时序的视频原生挑…
深度解读 arXiv:2603.29616 2026-07-12
KV Cache 优化全景综述:五大方向与自适应多阶段流水线
这是一篇针对 LLM 推理场景下 KV cache 优化 的 24 页系统性综述,把目前散落在文献里的 KV cache 优化技术归纳为五大方向(eviction / compression / hybrid memory / novel attention / combination),并把每条技术映射到 7 类实际…
深度解读 arXiv:2603.20397 2026-07-12
RAGPerf:面向 RAG 系统的端到端基准测试框架
这是一篇偏系统实现的 benchmarking 工作:作者提出 RAGPerf——一个把 RAG pipeline 解耦为 embedding / indexing / retrieval / reranking / generation 五个模块,支持多模态负载与主流向量库的内置调度的端到端性能 / 精度基准框架,并…
深度解读 arXiv:2603.10765 2026-07-12
NetKV:面向分离式 LLM 推理的网络感知 Decode 实例选择
NetKV 提出一个 network cost oracle 抽象与一个 O(|D|) 的贪心调度器,在解耦式(disaggregated)LLM 推理中把"prefill 实例 → decode 实例"的路由从只看"算力负载 + prefix 缓存命中"升级为"算力 + 缓存 + 网络拓扑与拥塞",在 64GPU 四…
深度解读 arXiv:2606.03910 2026-07-11
MCP-Persona:通过环境模拟评估 LLM Agent 在真实个人应用上的表现
MCPPersona 是第一个专门面向"真实个人应用 + 个性化 MCP 工具"的 Agent 基准,覆盖 Reddit、小红书、Lark、Slack 等 10+ 款真实社交/协作 App,通过"环境模拟 + 个性化状态注入"评测当前 SOTA Agent 在个性化工具调用上的真实短板。 Model Context P…
深度解读 arXiv:2606.02470 2026-07-11
当 Agent 自动化变得有利可图:用 Trace-Economic Underwriting 量化与承保自主 AI 风险
本文提出 TraceEconomic Underwriting(trace 经济承保):把 Agent 的工具调用 trace 直接映射成"客户敞口 × 可索赔损失"的确定性经济标签,并基于该表示做定价、控制与风险转移——核心论点是"自主 AI 部署能不能被经济地接受"取决于期望收益是否超过保费 + 控制成本 + 残留…
深度解读 arXiv:2606.16465 2026-07-11
听见味道:用音频嵌入做「味道感知」的音乐检索
作者把心理学里「声音—味道联觉(crossmodal correspondence)」正式搬进 contentbased music information retrieval (MIR):用一个感知校验过的多源语料库,对 HEAR 四大族的 10 个 frozen audio encoder 套上统一多任务回归头,预…
深度解读 arXiv:2607.03296 2026-07-11
概率智能体跑不了确定性审计:MAS+HybridRAG 在德国 IT-Grundschutz 自动化认证中的真实边界
作者把多智能体系统(MultiAgent System, MAS)+ Hybrid RetrievalAugmented Generation (HybridRAG) 接到德国联邦信息安全局(BSI)的 ITGrundschutz(ITGS)合规认证流程上,用 BSI 官方的「RecPlast GmbH」案例作为人工专…
深度解读 arXiv:2606.25622 2026-07-11
何时组合大模型才真的有用?——67 个前沿模型上的共失效天花板
一句话结论:把多模型投票、路由、级联、MixtureofAgents 当作"白嫖提升"的常见做法其实有一个常被忽视的天花板——所有模型在同一题上都答错的比例 β。论文给出严格数学上界 + 67 个前沿模型实测,证明在缺乏强查询级路由信号时,组合几乎打不过单模型 SOTA;提升来自"模型在不同问题上错开",而不是"模型加…
深度解读 arXiv:2606.27288 2026-07-10
面向具身智能的 Mixture-of-Experts 视频预训练规模化
LingBotVideo 提出了一套从架构、数据、训练奖励三方面同时为具身智能(embodied intelligence)改造的视频基础模型流水线,并将首个大规模开源 MoE 视频基础模型发布给社区,旨在弥合「内容创作向」视频生成与「物理执行向」机器人控制之间的领域鸿沟。 过去两年,基于 DiT 的视频生成模型(Wa…
深度解读 arXiv:2607.07675 2026-07-10
支持多样化交互的无限世界:LingBot-World 2.0
LingBotWorld 2.0(别名 LingBotWorldInfinity)以「无限交互时长 + 60 fps 实时生成 + 多样化动作 / 事件 + Agentic Harness 双智能体编排 + 多玩家共享接口」五位一体升级了世界模型 LingBotWorld,并把 14B 主模型与 1.3B 单卡可部署版…
深度解读 arXiv:2607.07534 2026-07-10
S-Agent:借助空间工具使用激发空间智能推理
SAgent 是一个面向连续多视图图像与视频的空间工具使用 Agent 范式:把 VLM 当作"语义规划器"决定"还需要什么证据",由一组2D/3D 几何工具与专家去生成证据,再用场景记忆 + 智能体记忆两条时间线把跨帧、跨步的证据累积成高层空间知识(计数、测量、朝向、相对位置),从而把"逐帧识别"升级为"场景级理解"…
深度解读 arXiv:2606.20515 2026-07-10