Explainers · 学术推广产出

解读

257 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Agent 记忆不是"图谱越复杂越聪明"——一篇论文用 13 类带类型记忆 + 信息论检索,把长程记忆打到 SOTA
如果你做过 AI Agent,或者用过 ChatGPT 这种"长记忆助手",你大概率撞过这种墙: 三个月前你跟它说过"我不吃辣"——今天它又给你推荐川菜馆; 你想让它帮你整理"去年那个项目的偏好",它只回了"我没有这段对话的访问权限"; 想存"长期用户画像"吧,又得上一套知识图谱 + LLM 实体抽取,运维成本爆表。 …
科普版 arXiv:2604.22085 2026-07-11
当 LLM 撑到千亿参数,谁来撑住它?——一份 45 页综述讲清楚「云原生 + 分布式」如何把大模型做稳、做大、做便宜
你有没有遇到过这种场景: 千卡训练集群利用率掉了 10%,电费 + 折旧足以拖垮一个中型项目; 高 QPS 在线服务、长上下文生成、批量离线打分三种负载在同一集群里互相打架; Kubernetes、Serverless、Edge、专用加速器、向量库、KV Cache 引擎各自为政,缺统一参考架构。 这三件事,是 202…
科普版 arXiv:2604.17227 2026-07-11
让 AI 自己写 GPU kernel:从「写一行 CUDA」到「闭环优化」的两年跃迁——一篇 IJCAI 2026 综述讲清楚 LLM 怎么重塑底层性能工程
你有没有想过这种画面: 你跟一个 AI 说「帮我写一个跑得比 cuBLAS 还快的矩阵乘」; 它没急着回你代码,而是先读 GPU 架构手册、再 profile 你的 shape、然后迭代十几次自己 debug; 最后扔给你一份「性能 5%、功能 100% 正确」的 Triton kernel,旁边还附一份诊断报告。 这…
科普版 arXiv:2601.15727 2026-07-11
世界模型第一次"撑得住了"——LingBot-World 2.0 把实时可交互世界从 demo 推到了产品级
你有没有想过这种体验: 你在游戏里按下"拔剑"——AI 不仅让你拔出来,还顺手生成了一段 NPC 走过来的剧情; 你在机器人仿真里下达"去厨房拿杯子"——AI 不仅给了你下一帧画面,还给物理引擎喂了一段合理的物体轨迹; 你在虚拟拍摄现场要求"突然下雨"——AI 不只是渲染雨滴,而是连灯光、地面积水、人物反应一起补上。 …
科普版 arXiv:2607.07534 2026-07-10
31B 的开源模型,凭什么能跟千亿 MoE 掰手腕?——Google Gemma 4 把"小而精"这件事做透了
你有没有想过一个问题: 你手机里跑的 AI 助手,背后往往是一个几百 GB 的庞然大物; 你在家用 RTX 4090 想本地跑一个"能推理、能看图、能听声音"的模型,结果发现显存一加就 24 GB 起步; 你看到排行榜上前 50 名几乎都是千亿参数 MoE,开源小模型连名字都挤不进去。 但 Google DeepMin…
科普版 arXiv:2607.02770 2026-07-10
vLLM 冷启动为什么慢到怀疑人生?一篇 MLSys 2026 论文把它拆成了六个清晰的阶段
你有没有这样的经历: 早上 9 点业务高峰来了,K8s 自动扩容了 50 个 vLLM 推理副本 但首请求平均等 40 秒才出第一个 token 用户在客户端狂点「重新生成」,P99 延迟直接飙到 3 分钟 「Cold start(冷启动)」是大模型部署里最容易被低估、又最影响用户体验的一段——首请求延迟(TimeTo…
科普版 arXiv:2606.07362 2026-07-10
Agentic RAG 真的比增强 RAG 强吗?最新 ACL 2026 论文给出了出乎意料的答案
如果你正在为公司挑选 RAG 架构,最近一年你一定听过两种声音: 「直接上 Agentic,让 LLM 自己决定怎么检索!」(LangGraph、AutoGen 派) 「别迷信 Agentic,老老实实把流水线写清楚更划算」(工业界老炮派) 直到 ACL 2026 Industry Track 出现了一篇标题直白的论文…
科普版 arXiv:2601.07711 2026-07-10
五十年的人工 Code Review,真的可以退休了——一篇观点论文把"强制人工评审"从软件工程地基里拔出来
你知道吗?你写的每一行代码,背后大概率都站着一个比你还累的人。 这个"人",就是代码评审员(code reviewer)。从 1976 年 Michael Fagan 在 IBM 提出这项制度开始,五十年没变过——每个 PR 提交以后,必须有人类同事看过、批过、改过,才能合并进主干。这是软件工程默认的"质量门槛"。 但…
科普版 arXiv:2606.13175 2026-07-09
你的企业知识库不是"搜不到",而是"看不见森林"——一篇论文把整个 RAG 从「检索」改成「导航」
做企业 RAG 的工程师都有一个痛点:用户问了一个稍微复杂点的问题,AI 翻来覆去找不到正确答案。 明明相关文档就在库里,明明向量检索已经跑了 topk——可答案就是不对。你去翻 trace,会发现关键证据根本没进检索窗口,AI 只看到"几片树叶",看不到"整片森林长什么样"。 传统 RAG 把大模型当成"检索结果的被…
科普版 arXiv:2604.14572 2026-07-09
AI 帮你改数据库,凭什么敢上生产?一篇论文让"评测"和"算法"一起进化,把搜索速度拉到 6.8 倍
你有没有这种感觉——大模型现在越来越能干,不仅能写代码、做总结,最近还开始有人让它"自动调数据库":让 AI 自己设计一种新的缓存替换策略、一种新的索引、一种新的查询重写规则——理由是,数据库优化这种事工程师手工调太慢,让 AI 每秒钟试一个候选,总比人强吧? 可问题是:谁去评判"这个候选好不好"? 这是一个看似朴素、…
科普版 arXiv:2604.06566 2026-07-09
多模态 AI 终于可以「先说结论再补细节」了——一篇被引 122 次的论文把「文字必须从左到右生成」的隐藏规则给拆了
你有没有被这种场面劝退过: 把一张工作流程图扔给 ChatGPT / Qwen2VL / GPT4V,让它「先告诉我这一页在讲什么,再让我追问细节」。 结果——它要么顺序全乱(「先讲第三步,再回过头讲第一步」),要么硬塞一堆「图片描述 + 重复问题」再答,要么干脆把图像压缩成「这是一张展示 X 主题的图」一句话糊弄你。…
科普版 arXiv:2505.16933 2026-07-08
你把 AI 办事员上线的那一刻,老板第一个问题不应该是「能不能用」,而是「我怎么知道你靠不靠谱」——直到这篇综述把「可靠性」放到了台面上
你有没有这种时刻—— AI 办事员在演示环境里把流程跑得飞起,你把它推到生产环境,第一个老板就抛过来一句话: 「这玩意儿 100 次里能成功几次?最坏一次得等多久?有没有出过金融事故?能不能审计?」 你翻遍 GitHub 的开源 agent,翻遍 HF 上榜的 agent benchmark,几乎所有的 README、…
科普版 arXiv:2507.21504 2026-07-08
AI 越来越像"贴心秘书",可没人给它的"记事本"立规矩——直到这篇综述把它拽回学术语言
你有没有这种感觉——ChatGPT 现在能"记住"你昨天说过的话,能从你上周的项目里抽出上下文,能在你下次开会时主动提示"上次你说要 followup 那件事"。 越来越像真人秘书了对吧? 可问题是:这个"记事本"从来没被严肃地审计过。它写进去的东西谁都能进、谁都能看、被污染了怎么办、被覆盖了能不能回滚、被错误地记住了…
科普版 arXiv:2604.16548 2026-07-08
一行 Triton 代码同时跑赢 NVIDIA 和 AMD:IBM Research 把大模型推理的「硬件鸿沟」填平了
你有没有这种体感——同样一个开源大模型,插在 H100 上跑得飞快,换一张 MI300 性能就掉一半?或者反过来,你给 AMD 卡买了一套推理服务,结果 NVIDIA 客户跑来问"你们是不是没优化"? 这不是你的工程水平问题。这是过去五年 AI 推理栈最隐蔽、也最贵的一道墙——顶尖的 attention kernel(…
科普版 arXiv:2511.11581 2026-07-08
当每个大厂都在做「Agentic RAG」时,一篇综述才终于说出那句大实话:你们连术语都没对齐
你有没有这种感觉:打开 arXiv,搜「Agentic RAG」,跳出来 300 篇论文,可读三篇就发现—— A 论文叫它「SelfRAG」,B 论文叫它「Corrective RAG」,C 论文直接新造了一个「Adaptive GraphRAG」。 你以为它们是三个完全不同的工作,结果翻到底层架构一看,几乎就是同一套…
科普版 arXiv:2501.09136 2026-07-07
AI 越来越像「办事员」,可没人给它立规矩——直到这篇综述把它拽回学术语言
你有没有一种隐隐的不安? ChatGPT 的「Browse」、Perplexity、各种企业 Copilot——它们现在的样子已经不太像「问答机器人」,反而像一个个会自己上网查资料、会自己调工具、会自己写邮件的小办事员。 它们背后那套「会自己检索、自己推理、自己动手」的技术,有个学名叫 Agentic RAG(智能体式…
科普版 arXiv:2603.07379 2026-07-07
让 AI 真正读懂 Excel:那个跑赢 SOTA 32 个百分点的「会自己翻表的代理」到底做对了什么
你有没有被这种场面劝退过:把一份几百兆的 Excel 工作簿扔给 ChatGPT,让它「帮我算一下各区域上季度的折扣后毛利,并标出异常单元格」。结果它要么说「我没法读取文件」,要么给你一段看起来很专业、但其实和你表格里的公式完全对不上的「幻觉答案」。 这不是你的 Excel 太刁钻,而是过去两年几乎所有「AI 读表格」…
科普版 arXiv:2603.06503 2026-07-07