Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

RAGPerf:面向 RAG 系统的端到端基准测试框架
这是一篇偏系统实现的 benchmarking 工作:作者提出 RAGPerf——一个把 RAG pipeline 解耦为 embedding / indexing / retrieval / reranking / generation 五个模块,支持多模态负载与主流向量库的内置调度的端到端性能 / 精度基准框架,并…
深度解读 arXiv:2603.10765 2026-07-12
咖啡味的爵士、放克里的海盐——这篇论文让 AI 学会了"听出味道",而且比人类评分员更准
你有没有过这种体验——听到某首歌的时候,嘴里会突然泛起一种味道? 低沉的贝斯线让你想起黑巧克力的苦,铜管的明亮小号让你联想到柠檬的酸,慵懒的爵士钢琴像是温热的焦糖玛奇朵……这不是玄学,神经科学和感官心理学里有大量证据证明"声音味道联觉"是真的存在(音高 ↔ 甜、苦涩 ↔ 低沉、铜管 ↔ 苦味)。 可问题是:音乐推荐系统…
科普版 arXiv:2607.03296 2026-07-12
RAG 第一次开口要等 3 秒,这篇论文只用存「位置」就把等待缩到 1.7 倍——24000 倍省下来的不是 GPU,是磁盘
你有没有这种感觉——你和 ChatGPT、Perplexity 这类带 RAG(检索增强生成)的应用聊天时,第一个字总是要等 1–3 秒,但一旦开始打字,回答就像开了倍速一样流畅? 那个 1–3 秒的等待时间,叫 TTFT(Time To First Token)。在 RAG 这种「把一堆相关文档塞进 Prompt 让…
科普版 arXiv:2606.09441 2026-07-12
你的 LLM 解数学题老出错?——这篇论文说"RAG 不是没用,是你塞错语料了"
如果你用 LLM 解过 AIME 这种数学竞赛题,或者让它写 LiveCodeBench 那种真实代码题,你大概率遇到过这种场面: 你给它看题,它算一步就卡住; 你塞几篇官方解题手册进去当 RAG,它还是算不对; 你换个更强的模型,效果是好了——但还是同一个模型在同一个 benchmark 上,涨不动。 你大概率以为:…
科普版 arXiv:2605.03344 2026-07-11
Agent 记忆不是"图谱越复杂越聪明"——一篇论文用 13 类带类型记忆 + 信息论检索,把长程记忆打到 SOTA
如果你做过 AI Agent,或者用过 ChatGPT 这种"长记忆助手",你大概率撞过这种墙: 三个月前你跟它说过"我不吃辣"——今天它又给你推荐川菜馆; 你想让它帮你整理"去年那个项目的偏好",它只回了"我没有这段对话的访问权限"; 想存"长期用户画像"吧,又得上一套知识图谱 + LLM 实体抽取,运维成本爆表。 …
科普版 arXiv:2604.22085 2026-07-11
NetKV:面向分离式 LLM 推理的网络感知 Decode 实例选择
NetKV 提出一个 network cost oracle 抽象与一个 O(|D|) 的贪心调度器,在解耦式(disaggregated)LLM 推理中把"prefill 实例 → decode 实例"的路由从只看"算力负载 + prefix 缓存命中"升级为"算力 + 缓存 + 网络拓扑与拥塞",在 64GPU 四…
深度解读 arXiv:2606.03910 2026-07-11
MCP-Persona:通过环境模拟评估 LLM Agent 在真实个人应用上的表现
MCPPersona 是第一个专门面向"真实个人应用 + 个性化 MCP 工具"的 Agent 基准,覆盖 Reddit、小红书、Lark、Slack 等 10+ 款真实社交/协作 App,通过"环境模拟 + 个性化状态注入"评测当前 SOTA Agent 在个性化工具调用上的真实短板。 Model Context P…
深度解读 arXiv:2606.02470 2026-07-11
当 Agent 自动化变得有利可图:用 Trace-Economic Underwriting 量化与承保自主 AI 风险
本文提出 TraceEconomic Underwriting(trace 经济承保):把 Agent 的工具调用 trace 直接映射成"客户敞口 × 可索赔损失"的确定性经济标签,并基于该表示做定价、控制与风险转移——核心论点是"自主 AI 部署能不能被经济地接受"取决于期望收益是否超过保费 + 控制成本 + 残留…
深度解读 arXiv:2606.16465 2026-07-11
听见味道:用音频嵌入做「味道感知」的音乐检索
作者把心理学里「声音—味道联觉(crossmodal correspondence)」正式搬进 contentbased music information retrieval (MIR):用一个感知校验过的多源语料库,对 HEAR 四大族的 10 个 frozen audio encoder 套上统一多任务回归头,预…
深度解读 arXiv:2607.03296 2026-07-11
概率智能体跑不了确定性审计:MAS+HybridRAG 在德国 IT-Grundschutz 自动化认证中的真实边界
作者把多智能体系统(MultiAgent System, MAS)+ Hybrid RetrievalAugmented Generation (HybridRAG) 接到德国联邦信息安全局(BSI)的 ITGrundschutz(ITGS)合规认证流程上,用 BSI 官方的「RecPlast GmbH」案例作为人工专…
深度解读 arXiv:2606.25622 2026-07-11
当 LLM 撑到千亿参数,谁来撑住它?——一份 45 页综述讲清楚「云原生 + 分布式」如何把大模型做稳、做大、做便宜
你有没有遇到过这种场景: 千卡训练集群利用率掉了 10%,电费 + 折旧足以拖垮一个中型项目; 高 QPS 在线服务、长上下文生成、批量离线打分三种负载在同一集群里互相打架; Kubernetes、Serverless、Edge、专用加速器、向量库、KV Cache 引擎各自为政,缺统一参考架构。 这三件事,是 202…
科普版 arXiv:2604.17227 2026-07-11
让 AI 自己写 GPU kernel:从「写一行 CUDA」到「闭环优化」的两年跃迁——一篇 IJCAI 2026 综述讲清楚 LLM 怎么重塑底层性能工程
你有没有想过这种画面: 你跟一个 AI 说「帮我写一个跑得比 cuBLAS 还快的矩阵乘」; 它没急着回你代码,而是先读 GPU 架构手册、再 profile 你的 shape、然后迭代十几次自己 debug; 最后扔给你一份「性能 5%、功能 100% 正确」的 Triton kernel,旁边还附一份诊断报告。 这…
科普版 arXiv:2601.15727 2026-07-11
世界模型第一次"撑得住了"——LingBot-World 2.0 把实时可交互世界从 demo 推到了产品级
你有没有想过这种体验: 你在游戏里按下"拔剑"——AI 不仅让你拔出来,还顺手生成了一段 NPC 走过来的剧情; 你在机器人仿真里下达"去厨房拿杯子"——AI 不仅给了你下一帧画面,还给物理引擎喂了一段合理的物体轨迹; 你在虚拟拍摄现场要求"突然下雨"——AI 不只是渲染雨滴,而是连灯光、地面积水、人物反应一起补上。 …
科普版 arXiv:2607.07534 2026-07-10
31B 的开源模型,凭什么能跟千亿 MoE 掰手腕?——Google Gemma 4 把"小而精"这件事做透了
你有没有想过一个问题: 你手机里跑的 AI 助手,背后往往是一个几百 GB 的庞然大物; 你在家用 RTX 4090 想本地跑一个"能推理、能看图、能听声音"的模型,结果发现显存一加就 24 GB 起步; 你看到排行榜上前 50 名几乎都是千亿参数 MoE,开源小模型连名字都挤不进去。 但 Google DeepMin…
科普版 arXiv:2607.02770 2026-07-10
何时组合大模型才真的有用?——67 个前沿模型上的共失效天花板
一句话结论:把多模型投票、路由、级联、MixtureofAgents 当作"白嫖提升"的常见做法其实有一个常被忽视的天花板——所有模型在同一题上都答错的比例 β。论文给出严格数学上界 + 67 个前沿模型实测,证明在缺乏强查询级路由信号时,组合几乎打不过单模型 SOTA;提升来自"模型在不同问题上错开",而不是"模型加…
深度解读 arXiv:2606.27288 2026-07-10
面向具身智能的 Mixture-of-Experts 视频预训练规模化
LingBotVideo 提出了一套从架构、数据、训练奖励三方面同时为具身智能(embodied intelligence)改造的视频基础模型流水线,并将首个大规模开源 MoE 视频基础模型发布给社区,旨在弥合「内容创作向」视频生成与「物理执行向」机器人控制之间的领域鸿沟。 过去两年,基于 DiT 的视频生成模型(Wa…
深度解读 arXiv:2607.07675 2026-07-10
支持多样化交互的无限世界:LingBot-World 2.0
LingBotWorld 2.0(别名 LingBotWorldInfinity)以「无限交互时长 + 60 fps 实时生成 + 多样化动作 / 事件 + Agentic Harness 双智能体编排 + 多玩家共享接口」五位一体升级了世界模型 LingBotWorld,并把 14B 主模型与 1.3B 单卡可部署版…
深度解读 arXiv:2607.07534 2026-07-10
S-Agent:借助空间工具使用激发空间智能推理
SAgent 是一个面向连续多视图图像与视频的空间工具使用 Agent 范式:把 VLM 当作"语义规划器"决定"还需要什么证据",由一组2D/3D 几何工具与专家去生成证据,再用场景记忆 + 智能体记忆两条时间线把跨帧、跨步的证据累积成高层空间知识(计数、测量、朝向、相对位置),从而把"逐帧识别"升级为"场景级理解"…
深度解读 arXiv:2606.20515 2026-07-10
PowerAgentBench-SS:面向电力系统稳态研究的 Agentic AI 基准
PowerAgentBenchSS 是首个在 IEEE 39 母线系统上、把"LLM Agent 是否能跑完一次完整的稳态工程工作流"作为评测对象的基准——结论是:只比"答对了哪条 contingency"远远不够,真正区分 Agent 的是验证预算怎么花、报告是否带证据、缓解措施是否合规。 电力系统领域已经有大量成熟…
深度解读 arXiv:2606.18789 2026-07-10
RODS:面向多轮工具使用 Agent 的奖励驱动在线数据合成
RODS(RewardDriven Online Data Synthesis)把 GRPO 训练中"进度奖励方差"当成零成本的能力边界检测器,围绕边界样本在线合成结构等价的训练样本,让 400 条人工种子 + ~800 条动态池就能追平 17K 样本离线流水线,训练轨迹数少约 20 倍。 多轮工具调用 Agent 用…
深度解读 arXiv:2606.19047 2026-07-10
vLLM 冷启动为什么慢到怀疑人生?一篇 MLSys 2026 论文把它拆成了六个清晰的阶段
你有没有这样的经历: 早上 9 点业务高峰来了,K8s 自动扩容了 50 个 vLLM 推理副本 但首请求平均等 40 秒才出第一个 token 用户在客户端狂点「重新生成」,P99 延迟直接飙到 3 分钟 「Cold start(冷启动)」是大模型部署里最容易被低估、又最影响用户体验的一段——首请求延迟(TimeTo…
科普版 arXiv:2606.07362 2026-07-10
Agentic RAG 真的比增强 RAG 强吗?最新 ACL 2026 论文给出了出乎意料的答案
如果你正在为公司挑选 RAG 架构,最近一年你一定听过两种声音: 「直接上 Agentic,让 LLM 自己决定怎么检索!」(LangGraph、AutoGen 派) 「别迷信 Agentic,老老实实把流水线写清楚更划算」(工业界老炮派) 直到 ACL 2026 Industry Track 出现了一篇标题直白的论文…
科普版 arXiv:2601.07711 2026-07-10
五十年的人工 Code Review,真的可以退休了——一篇观点论文把"强制人工评审"从软件工程地基里拔出来
你知道吗?你写的每一行代码,背后大概率都站着一个比你还累的人。 这个"人",就是代码评审员(code reviewer)。从 1976 年 Michael Fagan 在 IBM 提出这项制度开始,五十年没变过——每个 PR 提交以后,必须有人类同事看过、批过、改过,才能合并进主干。这是软件工程默认的"质量门槛"。 但…
科普版 arXiv:2606.13175 2026-07-09
终结人工代码评审:Coding Agents 已跨过能力门槛
这是一篇观点论文(position paper),主张「编码 Agent 已经跨过能力门槛,传统的人工 code review 已经不是软件质量流水线的必要环节」;它的最强论据是 SWEbench 上代到当代的端到端解决率从 ~1.7% 跃升到 70%,并把"目标—证据—成本—中间不稳态"四个维度一并摆出来。 代码评审…
深度解读 arXiv:2606.13175 2026-07-09
Qwen-RobotManip:以表示 / 运动 / 行为三层对齐,把 VLA 通用机器人大模型推到 38K 小时新规模
QwenRobotManip 是阿里通义千问团队发布的 VLA(VisionLanguageAction)通用机器人大模型技术报告。它用一套"表示 / 运动 / 行为"三层对齐框架,把来源极其异构的机器人轨迹数据在统一空间里训练,从而只用开源数据 + 人类演示视频就消化了约 38,100 小时的预训练语料;在 Robo…
深度解读 arXiv:2606.17846 2026-07-09
Gemma 4 技术报告:开源全模态密集 + MoE 模型家族,长上下文与端侧高效是本代核心
Gemma 4 是 Google DeepMind 发布的新一代开源(Apache 2.0)多模态语言模型家族,覆盖 2.3B / 4.5B / 12B / 31B 的密集配置和 26BA4B(3.8B 激活)的 MoE 配置。本代最重要的三件事是:(1)原生多模态(文本 + 图像 + 音频)+ 内置 thinking…
深度解读 arXiv:2607.02770 2026-07-09
SIFT:利用注意力不变性加速 RAG Prefill
SIFT 提出一种"只存高注意力位置的 bit 向量、不存任何 KV"的 RAG Prefill 加速方案,借助两个观察——文档内局部注意力位置在不同上下文间近似不变、文档内高注意力 Key 同样吸引后续文档的跨文档注意力——在 GPU 上把 TTFT 提升到约 1.71×,同时把精度损失控制在全量重算的 1% 以内,…
深度解读 arXiv:2606.09441 2026-07-09
击碎冷启动冰山:vLLM 启动延迟的六步系统化表征与解析建模
本文是首篇对 vLLM 推理引擎启动延迟做精细分解的工作:把整条启动流水线拆成六个语义清晰的基础步骤,证实它以 CPUbound 为主,再据此推导出一个轻量级的解析预测模型,让工程师在拿到硬件配置后能直接估出冷启动耗时,用于大规模推理部署的资源规划。 在大模型即服务(LLMasaService)的生产形态里,"首请求延…
深度解读 arXiv:2606.07362 2026-07-09
QBugLM:面向 OpenQASM 3.0 量子程序的多智能体调试流水线
本文提出 QBugLM——一个面向量子程序的多智能体调试框架,把"分类法驱动的缺陷注入 → LLM 缺陷检测与修复 → 量子仿真器验证"串成一条端到端流水线,并在框架无关的 OpenQASM 3.0 程序上做了系统基准:发现"一次重试"就能把 Pass@1 从不到 25% 拉到 80% 以上,而简单结构化提示在固定资源…
深度解读 arXiv:2606.07314 2026-07-09
你的企业知识库不是"搜不到",而是"看不见森林"——一篇论文把整个 RAG 从「检索」改成「导航」
做企业 RAG 的工程师都有一个痛点:用户问了一个稍微复杂点的问题,AI 翻来覆去找不到正确答案。 明明相关文档就在库里,明明向量检索已经跑了 topk——可答案就是不对。你去翻 trace,会发现关键证据根本没进检索窗口,AI 只看到"几片树叶",看不到"整片森林长什么样"。 传统 RAG 把大模型当成"检索结果的被…
科普版 arXiv:2604.14572 2026-07-09