解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
PowerAgentBench-SS:面向电力系统稳态研究的 Agentic AI 基准
PowerAgentBenchSS 是首个在 IEEE 39 母线系统上、把"LLM Agent 是否能跑完一次完整的稳态工程工作流"作为评测对象的基准——结论是:只比"答对了哪条 contingency"远远不够,真正区分 Agent 的是验证预算怎么花、报告是否带证据、缓解措施是否合规。 电力系统领域已经有大量成熟…
RODS:面向多轮工具使用 Agent 的奖励驱动在线数据合成
RODS(RewardDriven Online Data Synthesis)把 GRPO 训练中"进度奖励方差"当成零成本的能力边界检测器,围绕边界样本在线合成结构等价的训练样本,让 400 条人工种子 + ~800 条动态池就能追平 17K 样本离线流水线,训练轨迹数少约 20 倍。 多轮工具调用 Agent 用…
终结人工代码评审:Coding Agents 已跨过能力门槛
这是一篇观点论文(position paper),主张「编码 Agent 已经跨过能力门槛,传统的人工 code review 已经不是软件质量流水线的必要环节」;它的最强论据是 SWEbench 上代到当代的端到端解决率从 ~1.7% 跃升到 70%,并把"目标—证据—成本—中间不稳态"四个维度一并摆出来。 代码评审…
Qwen-RobotManip:以表示 / 运动 / 行为三层对齐,把 VLA 通用机器人大模型推到 38K 小时新规模
QwenRobotManip 是阿里通义千问团队发布的 VLA(VisionLanguageAction)通用机器人大模型技术报告。它用一套"表示 / 运动 / 行为"三层对齐框架,把来源极其异构的机器人轨迹数据在统一空间里训练,从而只用开源数据 + 人类演示视频就消化了约 38,100 小时的预训练语料;在 Robo…
Gemma 4 技术报告:开源全模态密集 + MoE 模型家族,长上下文与端侧高效是本代核心
Gemma 4 是 Google DeepMind 发布的新一代开源(Apache 2.0)多模态语言模型家族,覆盖 2.3B / 4.5B / 12B / 31B 的密集配置和 26BA4B(3.8B 激活)的 MoE 配置。本代最重要的三件事是:(1)原生多模态(文本 + 图像 + 音频)+ 内置 thinking…
SIFT:利用注意力不变性加速 RAG Prefill
SIFT 提出一种"只存高注意力位置的 bit 向量、不存任何 KV"的 RAG Prefill 加速方案,借助两个观察——文档内局部注意力位置在不同上下文间近似不变、文档内高注意力 Key 同样吸引后续文档的跨文档注意力——在 GPU 上把 TTFT 提升到约 1.71×,同时把精度损失控制在全量重算的 1% 以内,…
击碎冷启动冰山:vLLM 启动延迟的六步系统化表征与解析建模
本文是首篇对 vLLM 推理引擎启动延迟做精细分解的工作:把整条启动流水线拆成六个语义清晰的基础步骤,证实它以 CPUbound 为主,再据此推导出一个轻量级的解析预测模型,让工程师在拿到硬件配置后能直接估出冷启动耗时,用于大规模推理部署的资源规划。 在大模型即服务(LLMasaService)的生产形态里,"首请求延…
QBugLM:面向 OpenQASM 3.0 量子程序的多智能体调试流水线
本文提出 QBugLM——一个面向量子程序的多智能体调试框架,把"分类法驱动的缺陷注入 → LLM 缺陷检测与修复 → 量子仿真器验证"串成一条端到端流水线,并在框架无关的 OpenQASM 3.0 程序上做了系统基准:发现"一次重试"就能把 Pass@1 从不到 25% 拉到 80% 以上,而简单结构化提示在固定资源…
面向高效可扩展大模型的云原生与分布式系统:一份研究路线图
本文是一份由 Minxian Xu、Kejiang Ye、Chengzhong Xu、Rajkumar Buyya 等 20 位系统领域学者联合署名的 45 页综述,系统盘点"如何用云原生与分布式系统把 LLM 训练与推理做稳、做大、做便宜",并给出未来 25 年的研究路线图。 LLM 的训练与推理对算力、显存、带宽、…
别再检索,去导航:把企业知识蒸馏成可导航 Agent Skill 的 QA 与 RAG 方案(Corpus2Skill)
Corpus2Skill 把传统 RAG 的「黑盒检索」重写为「Agent 在已编译好的分层 Skill 目录里自顶向下浏览并回溯」——离线一次把语料蒸馏成文件系统形式的 SKILL.md / INDEX.md 树,服务时 LLM 用渐进披露(progressive disclosure)方式从鸟瞰层钻到文档层,在企业…
别只让 AI 生成算法,让 AI 一起把评测搭出来:ADRS 的评估器协同进化方法
ADRS(AIDriven Research for Systems)是用 LLM 自动发现系统算法的新范式,但数据库领域落地的瓶颈是评测本身——本文提出把「evaluator」和「solution」放进内外双环协同进化,在 buffer management、query rewriting、index selecti…
Memanto:面向长程 Agent 的带类型语义记忆 + 信息论检索
Memanto 用一个十三类带类型的记忆 schema + 自动冲突解决 + 时间版本控制,配 Moorcheh 的"无索引、确定性、亚 90ms"信息论检索引擎,在 LongMemEval 拿到 89.8%、LoCoMo 拿到 87.1% 的 SOTA 准确率,同时只需一次检索查询、零入库延迟——正面打脸"agent…
Agentic RAG 真的更值吗?一篇 ACL 2026 Industry Track 给出的可落地图鉴
作者用同一批 4 个公开数据集,把「Enhanced RAG(固定流水线)」与「Agentic RAG(LLM 作为 orchestrator)」并排跑了一遍:Agentic 在 Query Rewriting 与 用户意图理解 上整体更灵活,但在 文档精修(rerank) 这一步反而输给了显式 ELECTRA rer…
用 Triton 写出 SOTA Paged Attention:IBM Research 把 cross-vendor LLM 推理拉回「一种源码」
IBM Research Zurich(Ringlein、van Lunteren、Stoica、Parnell)只用一个开源 DSL——OpenAI Triton——写出一套 SOTA 级 Paged Attention kernel,在 NVIDIA H10080GB 和 AMD MI250/MI300 上都摸到 …
Towards Automated Kernel Generation in the Era of LLMs:把 GPU kernel 自动生成从一次性代码补全推进到「LLM + Agent + 反馈闭环」的综述
这是一篇 IJCAI 2026 综述(9 页正文 + 持续维护的 GitHub 资源库 flagosai/awesomeLLMdrivenkernelgeneration),把过去两年 LLM 与 Agent 驱动的 GPU kernel 自动生成 / 优化研究系统化为两条主线——LLM 直出(监督微调与强化学习) 与…
LLM Agent 长期记忆安全的综述:跨记忆生命周期的攻击、防御与治理
本文是首篇把"持久、可写、跨会话"的 LLM Agent 长期记忆(LTM)当作一种独立安全底座来系统化梳理的综述,提出 Memory Lifecycle Framework(六阶段 × 四安全目标)作为分类骨架,并据此推导出 Verifiable Memory Governance (VMG) 的五大架构原语及其谓词…
SoK: Agentic RAG —— 把「智能体式检索增强生成」拉回到决策论的统一语言
这是一篇 ACL 2026 级别的 Systematization of Knowledge(SoK)综述:把过去两年迅速膨胀的「Agentic RAG」从工程经验拼凑的状态,拽回到「有限时域 POMDP」的统一形式化语言上,建立了一套 按规划机制 / 检索编排 / 记忆范式 / 工具调用 四维度切分的分类法,并系统指…
BRTR: Beyond Rows to Reasoning —— 多模态电子表格上的 Agentic 检索框架
BRTR(Beyond Rows to Reasoning)把 多模态电子表格理解 重新建模为 Agentic Retrieval 任务:用迭代式工具调用循环替代单轮 RAG,在三个 SOTA 电子表格基准(FRTRBench、SpreadsheetLLM、FINCH)上分别相对 SOTA 提升 +25 / +7 / …