解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
AI 帮你改数据库,凭什么敢上生产?一篇论文让"评测"和"算法"一起进化,把搜索速度拉到 6.8 倍
你有没有这种感觉——大模型现在越来越能干,不仅能写代码、做总结,最近还开始有人让它"自动调数据库":让 AI 自己设计一种新的缓存替换策略、一种新的索引、一种新的查询重写规则——理由是,数据库优化这种事工程师手工调太慢,让 AI 每秒钟试一个候选,总比人强吧? 可问题是:谁去评判"这个候选好不好"? 这是一个看似朴素、…
多模态 AI 终于可以「先说结论再补细节」了——一篇被引 122 次的论文把「文字必须从左到右生成」的隐藏规则给拆了
你有没有被这种场面劝退过: 把一张工作流程图扔给 ChatGPT / Qwen2VL / GPT4V,让它「先告诉我这一页在讲什么,再让我追问细节」。 结果——它要么顺序全乱(「先讲第三步,再回过头讲第一步」),要么硬塞一堆「图片描述 + 重复问题」再答,要么干脆把图像压缩成「这是一张展示 X 主题的图」一句话糊弄你。…
你把 AI 办事员上线的那一刻,老板第一个问题不应该是「能不能用」,而是「我怎么知道你靠不靠谱」——直到这篇综述把「可靠性」放到了台面上
你有没有这种时刻—— AI 办事员在演示环境里把流程跑得飞起,你把它推到生产环境,第一个老板就抛过来一句话: 「这玩意儿 100 次里能成功几次?最坏一次得等多久?有没有出过金融事故?能不能审计?」 你翻遍 GitHub 的开源 agent,翻遍 HF 上榜的 agent benchmark,几乎所有的 README、…
面向高效可扩展大模型的云原生与分布式系统:一份研究路线图
本文是一份由 Minxian Xu、Kejiang Ye、Chengzhong Xu、Rajkumar Buyya 等 20 位系统领域学者联合署名的 45 页综述,系统盘点"如何用云原生与分布式系统把 LLM 训练与推理做稳、做大、做便宜",并给出未来 25 年的研究路线图。 LLM 的训练与推理对算力、显存、带宽、…
别再检索,去导航:把企业知识蒸馏成可导航 Agent Skill 的 QA 与 RAG 方案(Corpus2Skill)
Corpus2Skill 把传统 RAG 的「黑盒检索」重写为「Agent 在已编译好的分层 Skill 目录里自顶向下浏览并回溯」——离线一次把语料蒸馏成文件系统形式的 SKILL.md / INDEX.md 树,服务时 LLM 用渐进披露(progressive disclosure)方式从鸟瞰层钻到文档层,在企业…
别只让 AI 生成算法,让 AI 一起把评测搭出来:ADRS 的评估器协同进化方法
ADRS(AIDriven Research for Systems)是用 LLM 自动发现系统算法的新范式,但数据库领域落地的瓶颈是评测本身——本文提出把「evaluator」和「solution」放进内外双环协同进化,在 buffer management、query rewriting、index selecti…
Memanto:面向长程 Agent 的带类型语义记忆 + 信息论检索
Memanto 用一个十三类带类型的记忆 schema + 自动冲突解决 + 时间版本控制,配 Moorcheh 的"无索引、确定性、亚 90ms"信息论检索引擎,在 LongMemEval 拿到 89.8%、LoCoMo 拿到 87.1% 的 SOTA 准确率,同时只需一次检索查询、零入库延迟——正面打脸"agent…
AI 越来越像"贴心秘书",可没人给它的"记事本"立规矩——直到这篇综述把它拽回学术语言
你有没有这种感觉——ChatGPT 现在能"记住"你昨天说过的话,能从你上周的项目里抽出上下文,能在你下次开会时主动提示"上次你说要 followup 那件事"。 越来越像真人秘书了对吧? 可问题是:这个"记事本"从来没被严肃地审计过。它写进去的东西谁都能进、谁都能看、被污染了怎么办、被覆盖了能不能回滚、被错误地记住了…
一行 Triton 代码同时跑赢 NVIDIA 和 AMD:IBM Research 把大模型推理的「硬件鸿沟」填平了
你有没有这种体感——同样一个开源大模型,插在 H100 上跑得飞快,换一张 MI300 性能就掉一半?或者反过来,你给 AMD 卡买了一套推理服务,结果 NVIDIA 客户跑来问"你们是不是没优化"? 这不是你的工程水平问题。这是过去五年 AI 推理栈最隐蔽、也最贵的一道墙——顶尖的 attention kernel(…
当每个大厂都在做「Agentic RAG」时,一篇综述才终于说出那句大实话:你们连术语都没对齐
你有没有这种感觉:打开 arXiv,搜「Agentic RAG」,跳出来 300 篇论文,可读三篇就发现—— A 论文叫它「SelfRAG」,B 论文叫它「Corrective RAG」,C 论文直接新造了一个「Adaptive GraphRAG」。 你以为它们是三个完全不同的工作,结果翻到底层架构一看,几乎就是同一套…
Agentic RAG 真的更值吗?一篇 ACL 2026 Industry Track 给出的可落地图鉴
作者用同一批 4 个公开数据集,把「Enhanced RAG(固定流水线)」与「Agentic RAG(LLM 作为 orchestrator)」并排跑了一遍:Agentic 在 Query Rewriting 与 用户意图理解 上整体更灵活,但在 文档精修(rerank) 这一步反而输给了显式 ELECTRA rer…
用 Triton 写出 SOTA Paged Attention:IBM Research 把 cross-vendor LLM 推理拉回「一种源码」
IBM Research Zurich(Ringlein、van Lunteren、Stoica、Parnell)只用一个开源 DSL——OpenAI Triton——写出一套 SOTA 级 Paged Attention kernel,在 NVIDIA H10080GB 和 AMD MI250/MI300 上都摸到 …
Towards Automated Kernel Generation in the Era of LLMs:把 GPU kernel 自动生成从一次性代码补全推进到「LLM + Agent + 反馈闭环」的综述
这是一篇 IJCAI 2026 综述(9 页正文 + 持续维护的 GitHub 资源库 flagosai/awesomeLLMdrivenkernelgeneration),把过去两年 LLM 与 Agent 驱动的 GPU kernel 自动生成 / 优化研究系统化为两条主线——LLM 直出(监督微调与强化学习) 与…
AI 越来越像「办事员」,可没人给它立规矩——直到这篇综述把它拽回学术语言
你有没有一种隐隐的不安? ChatGPT 的「Browse」、Perplexity、各种企业 Copilot——它们现在的样子已经不太像「问答机器人」,反而像一个个会自己上网查资料、会自己调工具、会自己写邮件的小办事员。 它们背后那套「会自己检索、自己推理、自己动手」的技术,有个学名叫 Agentic RAG(智能体式…
让 AI 真正读懂 Excel:那个跑赢 SOTA 32 个百分点的「会自己翻表的代理」到底做对了什么
你有没有被这种场面劝退过:把一份几百兆的 Excel 工作簿扔给 ChatGPT,让它「帮我算一下各区域上季度的折扣后毛利,并标出异常单元格」。结果它要么说「我没法读取文件」,要么给你一段看起来很专业、但其实和你表格里的公式完全对不上的「幻觉答案」。 这不是你的 Excel 太刁钻,而是过去两年几乎所有「AI 读表格」…
LLM Agent 长期记忆安全的综述:跨记忆生命周期的攻击、防御与治理
本文是首篇把"持久、可写、跨会话"的 LLM Agent 长期记忆(LTM)当作一种独立安全底座来系统化梳理的综述,提出 Memory Lifecycle Framework(六阶段 × 四安全目标)作为分类骨架,并据此推导出 Verifiable Memory Governance (VMG) 的五大架构原语及其谓词…
SoK: Agentic RAG —— 把「智能体式检索增强生成」拉回到决策论的统一语言
这是一篇 ACL 2026 级别的 Systematization of Knowledge(SoK)综述:把过去两年迅速膨胀的「Agentic RAG」从工程经验拼凑的状态,拽回到「有限时域 POMDP」的统一形式化语言上,建立了一套 按规划机制 / 检索编排 / 记忆范式 / 工具调用 四维度切分的分类法,并系统指…
BRTR: Beyond Rows to Reasoning —— 多模态电子表格上的 Agentic 检索框架
BRTR(Beyond Rows to Reasoning)把 多模态电子表格理解 重新建模为 Agentic Retrieval 任务:用迭代式工具调用循环替代单轮 RAG,在三个 SOTA 电子表格基准(FRTRBench、SpreadsheetLLM、FINCH)上分别相对 SOTA 提升 +25 / +7 / …