解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
RAGPerf:面向 RAG 系统的端到端基准测试框架
这是一篇偏系统实现的 benchmarking 工作:作者提出 RAGPerf——一个把 RAG pipeline 解耦为 embedding / indexing / retrieval / reranking / generation 五个模块,支持多模态负载与主流向量库的内置调度的端到端性能 / 精度基准框架,并…
咖啡味的爵士、放克里的海盐——这篇论文让 AI 学会了"听出味道",而且比人类评分员更准
你有没有过这种体验——听到某首歌的时候,嘴里会突然泛起一种味道? 低沉的贝斯线让你想起黑巧克力的苦,铜管的明亮小号让你联想到柠檬的酸,慵懒的爵士钢琴像是温热的焦糖玛奇朵……这不是玄学,神经科学和感官心理学里有大量证据证明"声音味道联觉"是真的存在(音高 ↔ 甜、苦涩 ↔ 低沉、铜管 ↔ 苦味)。 可问题是:音乐推荐系统…
RAG 第一次开口要等 3 秒,这篇论文只用存「位置」就把等待缩到 1.7 倍——24000 倍省下来的不是 GPU,是磁盘
你有没有这种感觉——你和 ChatGPT、Perplexity 这类带 RAG(检索增强生成)的应用聊天时,第一个字总是要等 1–3 秒,但一旦开始打字,回答就像开了倍速一样流畅? 那个 1–3 秒的等待时间,叫 TTFT(Time To First Token)。在 RAG 这种「把一堆相关文档塞进 Prompt 让…
你的 LLM 解数学题老出错?——这篇论文说"RAG 不是没用,是你塞错语料了"
如果你用 LLM 解过 AIME 这种数学竞赛题,或者让它写 LiveCodeBench 那种真实代码题,你大概率遇到过这种场面: 你给它看题,它算一步就卡住; 你塞几篇官方解题手册进去当 RAG,它还是算不对; 你换个更强的模型,效果是好了——但还是同一个模型在同一个 benchmark 上,涨不动。 你大概率以为:…
Agent 记忆不是"图谱越复杂越聪明"——一篇论文用 13 类带类型记忆 + 信息论检索,把长程记忆打到 SOTA
如果你做过 AI Agent,或者用过 ChatGPT 这种"长记忆助手",你大概率撞过这种墙: 三个月前你跟它说过"我不吃辣"——今天它又给你推荐川菜馆; 你想让它帮你整理"去年那个项目的偏好",它只回了"我没有这段对话的访问权限"; 想存"长期用户画像"吧,又得上一套知识图谱 + LLM 实体抽取,运维成本爆表。 …
NetKV:面向分离式 LLM 推理的网络感知 Decode 实例选择
NetKV 提出一个 network cost oracle 抽象与一个 O(|D|) 的贪心调度器,在解耦式(disaggregated)LLM 推理中把"prefill 实例 → decode 实例"的路由从只看"算力负载 + prefix 缓存命中"升级为"算力 + 缓存 + 网络拓扑与拥塞",在 64GPU 四…
MCP-Persona:通过环境模拟评估 LLM Agent 在真实个人应用上的表现
MCPPersona 是第一个专门面向"真实个人应用 + 个性化 MCP 工具"的 Agent 基准,覆盖 Reddit、小红书、Lark、Slack 等 10+ 款真实社交/协作 App,通过"环境模拟 + 个性化状态注入"评测当前 SOTA Agent 在个性化工具调用上的真实短板。 Model Context P…
当 Agent 自动化变得有利可图:用 Trace-Economic Underwriting 量化与承保自主 AI 风险
本文提出 TraceEconomic Underwriting(trace 经济承保):把 Agent 的工具调用 trace 直接映射成"客户敞口 × 可索赔损失"的确定性经济标签,并基于该表示做定价、控制与风险转移——核心论点是"自主 AI 部署能不能被经济地接受"取决于期望收益是否超过保费 + 控制成本 + 残留…
听见味道:用音频嵌入做「味道感知」的音乐检索
作者把心理学里「声音—味道联觉(crossmodal correspondence)」正式搬进 contentbased music information retrieval (MIR):用一个感知校验过的多源语料库,对 HEAR 四大族的 10 个 frozen audio encoder 套上统一多任务回归头,预…
概率智能体跑不了确定性审计:MAS+HybridRAG 在德国 IT-Grundschutz 自动化认证中的真实边界
作者把多智能体系统(MultiAgent System, MAS)+ Hybrid RetrievalAugmented Generation (HybridRAG) 接到德国联邦信息安全局(BSI)的 ITGrundschutz(ITGS)合规认证流程上,用 BSI 官方的「RecPlast GmbH」案例作为人工专…
当 LLM 撑到千亿参数,谁来撑住它?——一份 45 页综述讲清楚「云原生 + 分布式」如何把大模型做稳、做大、做便宜
你有没有遇到过这种场景: 千卡训练集群利用率掉了 10%,电费 + 折旧足以拖垮一个中型项目; 高 QPS 在线服务、长上下文生成、批量离线打分三种负载在同一集群里互相打架; Kubernetes、Serverless、Edge、专用加速器、向量库、KV Cache 引擎各自为政,缺统一参考架构。 这三件事,是 202…
让 AI 自己写 GPU kernel:从「写一行 CUDA」到「闭环优化」的两年跃迁——一篇 IJCAI 2026 综述讲清楚 LLM 怎么重塑底层性能工程
你有没有想过这种画面: 你跟一个 AI 说「帮我写一个跑得比 cuBLAS 还快的矩阵乘」; 它没急着回你代码,而是先读 GPU 架构手册、再 profile 你的 shape、然后迭代十几次自己 debug; 最后扔给你一份「性能 5%、功能 100% 正确」的 Triton kernel,旁边还附一份诊断报告。 这…
世界模型第一次"撑得住了"——LingBot-World 2.0 把实时可交互世界从 demo 推到了产品级
你有没有想过这种体验: 你在游戏里按下"拔剑"——AI 不仅让你拔出来,还顺手生成了一段 NPC 走过来的剧情; 你在机器人仿真里下达"去厨房拿杯子"——AI 不仅给了你下一帧画面,还给物理引擎喂了一段合理的物体轨迹; 你在虚拟拍摄现场要求"突然下雨"——AI 不只是渲染雨滴,而是连灯光、地面积水、人物反应一起补上。 …
31B 的开源模型,凭什么能跟千亿 MoE 掰手腕?——Google Gemma 4 把"小而精"这件事做透了
你有没有想过一个问题: 你手机里跑的 AI 助手,背后往往是一个几百 GB 的庞然大物; 你在家用 RTX 4090 想本地跑一个"能推理、能看图、能听声音"的模型,结果发现显存一加就 24 GB 起步; 你看到排行榜上前 50 名几乎都是千亿参数 MoE,开源小模型连名字都挤不进去。 但 Google DeepMin…
何时组合大模型才真的有用?——67 个前沿模型上的共失效天花板
一句话结论:把多模型投票、路由、级联、MixtureofAgents 当作"白嫖提升"的常见做法其实有一个常被忽视的天花板——所有模型在同一题上都答错的比例 β。论文给出严格数学上界 + 67 个前沿模型实测,证明在缺乏强查询级路由信号时,组合几乎打不过单模型 SOTA;提升来自"模型在不同问题上错开",而不是"模型加…
面向具身智能的 Mixture-of-Experts 视频预训练规模化
LingBotVideo 提出了一套从架构、数据、训练奖励三方面同时为具身智能(embodied intelligence)改造的视频基础模型流水线,并将首个大规模开源 MoE 视频基础模型发布给社区,旨在弥合「内容创作向」视频生成与「物理执行向」机器人控制之间的领域鸿沟。 过去两年,基于 DiT 的视频生成模型(Wa…
支持多样化交互的无限世界:LingBot-World 2.0
LingBotWorld 2.0(别名 LingBotWorldInfinity)以「无限交互时长 + 60 fps 实时生成 + 多样化动作 / 事件 + Agentic Harness 双智能体编排 + 多玩家共享接口」五位一体升级了世界模型 LingBotWorld,并把 14B 主模型与 1.3B 单卡可部署版…
S-Agent:借助空间工具使用激发空间智能推理
SAgent 是一个面向连续多视图图像与视频的空间工具使用 Agent 范式:把 VLM 当作"语义规划器"决定"还需要什么证据",由一组2D/3D 几何工具与专家去生成证据,再用场景记忆 + 智能体记忆两条时间线把跨帧、跨步的证据累积成高层空间知识(计数、测量、朝向、相对位置),从而把"逐帧识别"升级为"场景级理解"…
PowerAgentBench-SS:面向电力系统稳态研究的 Agentic AI 基准
PowerAgentBenchSS 是首个在 IEEE 39 母线系统上、把"LLM Agent 是否能跑完一次完整的稳态工程工作流"作为评测对象的基准——结论是:只比"答对了哪条 contingency"远远不够,真正区分 Agent 的是验证预算怎么花、报告是否带证据、缓解措施是否合规。 电力系统领域已经有大量成熟…
RODS:面向多轮工具使用 Agent 的奖励驱动在线数据合成
RODS(RewardDriven Online Data Synthesis)把 GRPO 训练中"进度奖励方差"当成零成本的能力边界检测器,围绕边界样本在线合成结构等价的训练样本,让 400 条人工种子 + ~800 条动态池就能追平 17K 样本离线流水线,训练轨迹数少约 20 倍。 多轮工具调用 Agent 用…
vLLM 冷启动为什么慢到怀疑人生?一篇 MLSys 2026 论文把它拆成了六个清晰的阶段
你有没有这样的经历: 早上 9 点业务高峰来了,K8s 自动扩容了 50 个 vLLM 推理副本 但首请求平均等 40 秒才出第一个 token 用户在客户端狂点「重新生成」,P99 延迟直接飙到 3 分钟 「Cold start(冷启动)」是大模型部署里最容易被低估、又最影响用户体验的一段——首请求延迟(TimeTo…
Agentic RAG 真的比增强 RAG 强吗?最新 ACL 2026 论文给出了出乎意料的答案
如果你正在为公司挑选 RAG 架构,最近一年你一定听过两种声音: 「直接上 Agentic,让 LLM 自己决定怎么检索!」(LangGraph、AutoGen 派) 「别迷信 Agentic,老老实实把流水线写清楚更划算」(工业界老炮派) 直到 ACL 2026 Industry Track 出现了一篇标题直白的论文…
五十年的人工 Code Review,真的可以退休了——一篇观点论文把"强制人工评审"从软件工程地基里拔出来
你知道吗?你写的每一行代码,背后大概率都站着一个比你还累的人。 这个"人",就是代码评审员(code reviewer)。从 1976 年 Michael Fagan 在 IBM 提出这项制度开始,五十年没变过——每个 PR 提交以后,必须有人类同事看过、批过、改过,才能合并进主干。这是软件工程默认的"质量门槛"。 但…
终结人工代码评审:Coding Agents 已跨过能力门槛
这是一篇观点论文(position paper),主张「编码 Agent 已经跨过能力门槛,传统的人工 code review 已经不是软件质量流水线的必要环节」;它的最强论据是 SWEbench 上代到当代的端到端解决率从 ~1.7% 跃升到 70%,并把"目标—证据—成本—中间不稳态"四个维度一并摆出来。 代码评审…
Qwen-RobotManip:以表示 / 运动 / 行为三层对齐,把 VLA 通用机器人大模型推到 38K 小时新规模
QwenRobotManip 是阿里通义千问团队发布的 VLA(VisionLanguageAction)通用机器人大模型技术报告。它用一套"表示 / 运动 / 行为"三层对齐框架,把来源极其异构的机器人轨迹数据在统一空间里训练,从而只用开源数据 + 人类演示视频就消化了约 38,100 小时的预训练语料;在 Robo…
Gemma 4 技术报告:开源全模态密集 + MoE 模型家族,长上下文与端侧高效是本代核心
Gemma 4 是 Google DeepMind 发布的新一代开源(Apache 2.0)多模态语言模型家族,覆盖 2.3B / 4.5B / 12B / 31B 的密集配置和 26BA4B(3.8B 激活)的 MoE 配置。本代最重要的三件事是:(1)原生多模态(文本 + 图像 + 音频)+ 内置 thinking…
SIFT:利用注意力不变性加速 RAG Prefill
SIFT 提出一种"只存高注意力位置的 bit 向量、不存任何 KV"的 RAG Prefill 加速方案,借助两个观察——文档内局部注意力位置在不同上下文间近似不变、文档内高注意力 Key 同样吸引后续文档的跨文档注意力——在 GPU 上把 TTFT 提升到约 1.71×,同时把精度损失控制在全量重算的 1% 以内,…
击碎冷启动冰山:vLLM 启动延迟的六步系统化表征与解析建模
本文是首篇对 vLLM 推理引擎启动延迟做精细分解的工作:把整条启动流水线拆成六个语义清晰的基础步骤,证实它以 CPUbound 为主,再据此推导出一个轻量级的解析预测模型,让工程师在拿到硬件配置后能直接估出冷启动耗时,用于大规模推理部署的资源规划。 在大模型即服务(LLMasaService)的生产形态里,"首请求延…
QBugLM:面向 OpenQASM 3.0 量子程序的多智能体调试流水线
本文提出 QBugLM——一个面向量子程序的多智能体调试框架,把"分类法驱动的缺陷注入 → LLM 缺陷检测与修复 → 量子仿真器验证"串成一条端到端流水线,并在框架无关的 OpenQASM 3.0 程序上做了系统基准:发现"一次重试"就能把 Pass@1 从不到 25% 拉到 80% 以上,而简单结构化提示在固定资源…
你的企业知识库不是"搜不到",而是"看不见森林"——一篇论文把整个 RAG 从「检索」改成「导航」
做企业 RAG 的工程师都有一个痛点:用户问了一个稍微复杂点的问题,AI 翻来覆去找不到正确答案。 明明相关文档就在库里,明明向量检索已经跑了 topk——可答案就是不对。你去翻 trace,会发现关键证据根本没进检索窗口,AI 只看到"几片树叶",看不到"整片森林长什么样"。 传统 RAG 把大模型当成"检索结果的被…