研究库 深度解读
Explainers · 学术推广产出

解读

502 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

AI 助理装上"眼睛"之后,为什么反而更健忘?——一篇 arXiv 论文戳破了多模态记忆的三大错觉
你有没有遇到过这种崩溃瞬间:跟一个号称"能看图"的 AI 助手聊了一周,你昨天发过的那张咖啡照片、那条会议截图、那份 PDF 文档,它今天问起来全忘了——甚至你说"上次那张咖啡图",它还要你重新发一遍? 更诡异的是,你给它看的图越多,它的回答反而越离谱。这听起来违反直觉,但这篇 arXiv 2606.07402(M³E…
科普版 arXiv:2606.07402 2026-09-12
机器人"做长任务"终于有救了:MaP-WAM 把记忆从执行器里卸载,推理时延压成常数
你有没有这种感觉:让机器人"做一道菜",它能切菜,但炒完菜之后它忘了切过菜了? 这不是段子——这是当前机器人操作领域的核心痛点。 主流的机器人策略(从行为克隆到 VLA 视觉语言动作模型)几乎都假设马尔可夫性:只看当前观测,预测下一步动作。这套打法在"抓杯子"、"推盒子"等单步任务上挺好用,但在长视野多步任务(散乱零件…
科普版 arXiv:2609.11561 2026-09-12
不学"正确答案",只学"如何不犯错"——NSD 把 LLM 的自我训练翻了个底朝天
你有没有这种感觉:让 AI 学生刷题,给它看"学霸的标准解法"反而会害了它?最近 arXiv 2609.11699(Negative SelfDistillation,负自蒸馏 NSD)就发现了这事——主流的"自蒸馏"训练范式,会让 LLM 在复杂推理任务上越练越笨。 听着反常识?往下看。 主流的 LLM 自我改进范式…
科普版 arXiv:2609.11699 2026-09-12
DeepSeek-V3 技术报告:671B 参数 MoE 只激活 37B,2.788M H800 小时训完,追平 GPT-4o——这是开源 LLM 把"训练成本"打成白菜价的关键工程范本
你有没有这种时刻—— 用着 DeepSeek 网页版 / App,惊叹"它怎么这么便宜",转头看到"671B 参数"心里打鼓——这么大量怎么训得起的? 看新闻说"DeepSeek 用 1/10 的算力追平 GPT4o",总觉得这种报道少说了什么技术细节; 想了解"MoE 是什么""FP8 是什么""为什么 MLA 推理…
科普版 arXiv:2412.19437 2026-09-11
让红绿灯"自己看路况"——2016 年这篇论文,把交通信号控制推到了深度强化学习的起跑线,今天所有 PressLight / CoLight 都得喊它一声"祖宗"
你有没有这种时刻—— 每天上下班路口等灯,左转道空空的,直行道堵成长龙,可信号灯还是按固定节奏轮转; 心想"这玩意儿能不能看眼摄像头,自己决定让谁先走?" 但凡说到"智能红绿灯"新闻里的多智能体 / 图注意力 / V2X 协同,全是一头雾水——不知道这条路到底从哪儿开始的。 这三个好奇,2016 年一篇会议论文给了一个…
科普版 arXiv:1611.01142 2026-09-11
你饭碗被 AI 抢走的概率有多大?—— OpenAI 自己做了一份系统性研究,结论是 80% 的人至少会受影响,但颠覆了所有人对"谁最危险"的直觉
你有没有这种时刻—— 看到新闻说"AI 要抢饭碗了",心里有两种声音打架: 乐观派:"AI 会像电力、互联网一样创造新职业,跟过去 30 年一样。" 悲观派:"这次不一样,AI 直接动知识工作者的奶酪。" 两者都没有可靠的实证。到底有多少工作、多少任务会被 AI 颠覆?哪些职业最危险?低收入蓝领还是高收入白领? 202…
科普版 arXiv:2303.10130 2026-09-11
你每问 ChatGPT 一次,地球就烧掉多少电?—— 2020 年这篇论文把 AI 的"电费账单"算清楚了,而且 6 年后欧盟 AI Act 直接按它的规矩来
你有没有这种时刻—— 看到新闻说"训练 GPT4 用了几十万吨二氧化碳排放",心里一愣:这是真的还是宣传? 想自己算一下 ChatGPT 一周用电多少——却发现连个像样的工具都没有:GPU 瞬时功耗 NVIDIASMI 能读,整机功耗要万用表,机房 PUE 是运营商的内部数据。 而且全世界的 AI 论文从来只报"我的模…
科普版 arXiv:2002.05651 2026-09-11
为什么 ChatGPT 能"一个模型干十件事"?2018 年这篇 Salesforce 论文,是 2020 年代所有"统一大模型"的祖师爷
你有没有想过—— 为什么 ChatGPT / GPT4 / Claude 能"一个模型搞定翻译、写摘要、做分析、答问题、写代码", 而 2017 年的 NLP 模型还每个任务一个 head、一个微调、一套评估指标? 这一切到底是"参数规模堆出来的奇迹",还是"背后有一个十年前的范式革命"? 后者才是真相。2018 年 …
科普版 arXiv:1806.08730 2026-09-11
当 AI 要"调参数"却连梯度都拿不到时:2013 年的这篇综述,把全球几十种"仿生算法"摆成一张地图
你有没有遇到过这种工程师—— 接到一个新问题:仿真器输入是 30 个连续参数、跑一次要 90 秒、梯度根本求不出来; 他随手掏出一段代码说"我用 PSO 跑 30 次,取中位数",半天就交了一份不错的解; 你问他:"为什么是 PSO,不是遗传算法?"他愣了一下——他自己也说不清,只是"大家都这么用"。 这就是 2013…
科普版 arXiv:1307.4186 2026-09-11
AI 医生能不能看病?2023 年这篇论文让医生在 8/9 个维度上更偏好 AI 答案
你有没有想过这种问题: 网上搜症状,搜出来的医疗信息要么是广告,要么是莆田系。 ChatGPT 写出来的医学回答看起来很专业,但你能信吗? 2023 年 5 月 Google 发的这篇 MedPaLM 2 论文,是第一次让医生在成对盲评中系统地更偏好 AI 答案——但它真的能替代医生看病吗? 直接说结论:能打辅助,不能…
科普版 arXiv:2305.09617 2026-09-10
从 GAN 到 ChatGPT,第一篇把 AIGC 完整历史串起来的综述到底说了什么
你有没有想过这种问题: 现在每天刷到的 AI 头像、AI 配音、AI 短文、AI 短视频……这些"AI 生成内容"是从什么时候开始爆发的? 2014 年的 GAN、2020 年的 Diffusion、2022 年的 ChatGPT——它们到底是什么关系?是接龙出现的,还是同时存在的? 为什么同一个"AI 生成"标签下,…
科普版 arXiv:2303.04226 2026-09-10
Agent 升级底座模型后,记忆系统悄悄失效?四种记忆表示形式的迁移损耗有多大
你是不是有过这种体验——给 LLM Agent 升级了更强的底座模型,结果用户反馈:"它好像忘了之前告诉过它的事"。直觉上"模型更强 = 体验更好",但实际生产中 Agent 记忆系统的迁移被严重低估,升级模型反而可能让记忆"静默失效"。 Agent 记忆有四种主流表示形式,迁移稳定性天差地别。 第一种 LCRAW——…
科普版 arXiv:2609.05339 2026-09-10
DeepSeek-R1 跑 100K 长思考链时显存撑爆?BeaconKV 用"信标聚类"砍掉 5.8× 显存
你有没有盯着 GPU 显存占用表,看 KV cache 一路飙红?用 DeepSeekR1、QwQ 这种"爱思考"的模型生成 5000 步推理链时,每生成一个 token 都要把之前所有 token 的 Key/Value 缓存下来做 attention,64K 上下文轻松吃掉 24GB——比模型权重本身还重。 旧办法…
科普版 arXiv:2609.04971 2026-09-10
一张商品图秒换"阳光窗边"或"夜景台灯"?RelightFormer 让前馈重光照第一次有了产品级的样子
你有没有用过那种"一键换背景"功能?把商品图换到海边、咖啡馆、雪山下。但那些多半只是换背景——光的方向、阴影的软硬、桌面的反光,全是错的。真正的"重光照"是:物体还是那个物体,但光照彻底换掉,材质本身的反光规律要跟新光照对上。这是图形学里出了名的硬骨头。 传统的"逆向渲染"路线是先估计反射率、法线、材质 BRDF,再做…
科普版 arXiv:2609.07414 2026-09-10
把 3.3 亿参数时序大模型塞进压缩器,居然能省 28% 比特?Cadence 给出了一道不算反常识但很扎实的算术题
你有没有想过,电网每小时的电力需求、地铁每分钟的进出站客流,这种时序数据一年能堆出上亿条?五到十年的积累,GB 级别只是起步。而我们一直用"按规则降采样"——比如每 1 分钟保留 1 个点——来压数据,但这条路的"最坏误差"是不可控的:哪一个窗口一旦丢点,事后查账就说不清谁的责任。 Cadence 这篇论文做了一件看似…
科普版 arXiv:2609.06008 2026-09-10
Google 把 Gemini 的"秘方"下放给社区了—— 一篇 2024 年被引 1200+ 的论文,重新定义了"开源大模型"该长什么样
你有没有这种感觉: GPT4 / Claude / Gemini Ultra 这些闭源旗舰模型越来越强,但它们怎么训出来的、用什么数据、安全怎么做的,全是黑盒。 2023 年 Llama 2 开了个头,但只发权重、不发训练细节——社区复现困难,也没法独立评估安全性。 开源大模型和闭源旗舰的差距在"同尺寸 SOTA"和"…
科普版 arXiv:2403.08295 2026-09-09
1.36 亿条"视频+字幕"是从哪儿白嫖来的?—— 一篇 2019 年论文把多模态 AI 的数据天花板直接掀翻
你有没有想过这种怪事: 教 AI 看视频,难的不是模型,是数据。 给一段 30 秒视频写一句"画面里在干嘛",人工标注 1 小时视频的成本是图像标注的几十倍。 2018 年最大的"视频文本"数据集 MSRVTT 也只有 1 万段视频,根本喂不饱模型。 怎么办? Google DeepMind + INRIA 的 Mie…
科普版 arXiv:1906.03327 2026-09-09
ChatGPT 之前,Google 是怎么解决"AI 一本正经胡说八道"的
你有没有过这种体验:问 AI 一个问题,它回答得头头是道,但仔细一看,有几个关键事实是编的?如果你点头,那你应该感谢 2022 年的一篇论文——它第一次让工业级对话 AI 严肃地面对"幻觉"和"安全"这两个问题,并且给出今天所有 RAG、工具调用、AI 安全微调的工程雏形。 LaMDA(Google 在 2022 年公…
科普版 arXiv:2201.08239 2026-09-09
一篇论文,带你读完"大模型到底是什么"
如果你刷到"LLM"、"大模型"、"ChatGPT 这类技术"这些词时,心里想问的永远是—— "这东西到底怎么工作的?为什么突然就这么厉害了?我需要懂多少才能不被忽悠?" 这篇 2023 年发布的综述,就是为这个问题写的。它不堆术语,不绕弯子,把过去十年大模型的核心拼图一次摊给你看。 这是 2023–2024 年 LL…
科普版 arXiv:2307.06435 2026-09-09
文档检索的"架构浪费"问题,被一篇论文正面解决了——NeoMME 用 260M 参数打败所有 <800M 竞品
你有没有想过 🤔: 你在公司文档库里搜一张发票的截图,问"这张发票上客户名是什么"。 现在的方案要拉一个几十亿参数的多模态大模型,让 VLM 把图像编码成向量,再去做相似度匹配。 但这件事根本不需要生成——你不需要 VLM 给你写一段话解释这张图,你只要"找到"它。 这就是当前视觉文档检索(ColPali、ColQwe…
科普版 arXiv:2609.01657 2026-09-09
看视频学折纸,AI 第一次真的能"动手"——FoldingAgent 把演示视频翻译成可执行的折叠程序
你有没有想过这个问题 🤔: YouTube 上那些折纸教学视频,几分钟就能教会你折一只千纸鹤。 但为什么让 AI"看一遍视频就学会折",这件事几十年都没真正解决? 因为视频里你看到的不是一张纸的最终长相,而是一双手在连续手势下把纸从 A 形状"搬运"到 B 形状的整个过程。要让 AI 输出"怎么做",就必须把这一段连续…
科普版 arXiv:2609.00377 2026-09-09
大模型怎么从「会聊天」变成「会做事」?2023 年复旦这篇 86 页综述,给 LLM Agent 立了第一套共同语言
你用过 Cursor、Devin、AutoGPT 这类「会自己跑流程」的 AI 工具吗?它们有一个共同的祖先——LLM Agent(基于大语言模型的智能体)。但 2023 年初这个概念还是一团乱麻:ReAct、Toolformer、Reflexion、MemGPT……各种工作各说各话,没有统一框架。 2023 年 9 …
科普版 arXiv:2309.07864 2026-09-08
大模型做数学题,2022 年这条 Google 路线告诉你:不用外挂计算器也能 SOTA
你让 ChatGPT 解一道「鸡兔同笼」或者「微积分」题,它能答对吗?很多时候能,但偶尔会算错或者「编一个不存在的公式」骗你。能不能让大模型像人一样一步步推、不靠 Python 计算器、也不用 Wolfram Alpha,依然做出大学水平的定量推理题? 2022 年 6 月 Google 的一篇论文(arXiv:220…
科普版 arXiv:2206.14858 2026-09-08
大模型 RL 后训练,自己当老师也能稳定变强吗?arXiv 2609.05295 给出 RISE 的"递归自外推"答案
在 RL posttraining 场景,RISE 用"RLVR 提供方向 + 外推放大位移 + OPD 提供 pertoken 监督 + recursive teacher refresh"四件套,让数学、STEM、代码、多轮 agent 四类任务相对 RLVRonly 训练和 OPSD 都取得持续提升,且 wall…
科普版 arXiv:arXiv 2609.05295 — *RISE: Recursive Improvement via Self-Extrapolating Policy Distillation*(Yang Li 等,2026-09-04 v1 提交 15:47:51 UTC,2,503 KB,cs.AI) 2026-09-08
为什么 ChatGPT 总是"一本正经地胡说"?2023 年这篇综述给出了第一张完整地图
你有没有试过问 ChatGPT 一个冷门历史人物的中文译名,它给了一个看起来很权威的答案——结果去维基一查,这个人根本不存在?或者让 GPT4 总结一篇论文,它言之凿凿地引用了 3 篇文献,但 3 篇都是 AI 编的? 这不是个例,而是大模型的系统性缺陷。研究者给它起了个名字——"幻觉"(Hallucination)。…
科普版 arXiv:2309.01219 2026-09-08
为什么自动驾驶“看深度”这件事,要先从两块小图“像不像”开始?
你有没有想过,自动驾驶车、ARVR 头显、扫地机器人,要先知道每个像素离自己多远——才能判断前面有没有车、脚下有没有台阶?这就是"立体匹配(stereo matching)"要做的事:给左眼一张图、右眼一张图,算出每个像素的深度。 听起来很简单,但 2015 年前后,这个领域陷入了一个奇怪的瓶颈:深度学习已经把图像识别…
科普版 arXiv:1510.05970 2026-09-08
AI 会自己写芯片“加速器程序”了?但关键不在会不会写代码
你有没有想过,大模型不只生成文字,还能直接帮你写出运行在 AI 芯片上的“加速器程序”?这类程序叫 kernel,它们负责让矩阵乘法、卷积、归约等计算跑得更快。它们不是普通 Python 脚本:既要算对,又要把数据安排得足够贴近芯片,才能真正提速。 问题在于,写高性能 kernel 很难。工程师需要理解内存怎么排布、数…
科普版 arXiv:2609.04523 2026-09-08
想让 AI"想得更久"还不想 GPU 烧钱?这篇论文把推理成本砍到三分之一而不掉性能
你有没有发现 🤔: 现在的 AI 不再是"答得快"——而是"想得久才能答得对"。 2024 到 2026 年 LLM 最确定的一条规律,叫 testtime scaling:让模型在答题前多想几步、多推几轮、多次验证,性能就能稳定提升——数学、代码、复杂推理全面受益。 代价是什么? 烧钱烧到 GPU 不够用。 模型每多…
科普版 arXiv:2608.26070 2026-09-07
想让 AI「读心」说出你脑子里的话?先把基础数据准备好——这份 100 小时脑磁图把赛道标准化了
你有没有想过 🤯: 有一天,你脑子里想说什么,机器就能直接把它变成文字发出去——不用动手、不用出声,甚至不用动嘴。 这是非侵入式脑机接口(BCI)讲的终极故事:对渐冻症患者、重度瘫痪患者来说,"把脑子里的语音解码成文字"是重新拿回表达能力的希望。 听起来很科幻对吧? 但现实是——这个领域过去十年都被一个特别土的问题卡着…
科普版 arXiv:2608.25204 2026-09-07
长视频在线 3D 重建总是"越跑越歪"?arXiv 2609.04201 把原因拆得很细:坏的不是眼睛,是全局位姿头
arXiv 2609.04201(ECCV 2026 · YuLun Liu 等) 解决一件具体的事: 在线 3D 重建模型在短片上一切正常,到长视频(几十分钟到几小时)就开始几何崩盘。Scal3R 把这个"长视频漂移"问题拆成两件独立的事——逐帧深度估计保持稳定,但全局位姿估计头崩盘——并据此给出只 ~1% 可学习 …
科普版 arXiv:2609.04201(*Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction*) 2026-09-07