解读
249 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
AI 在 360° 重建的秋叶原街考导航:最强 Gemini 只拿 17.1%,人类 77.3% —— 60 个百分点的"具身鸿沟"到底有多深
你有没有试过让 AI 帮你在陌生城市找路? 你给它一张街景图、问"附近有什么地标"—— 它答得头头是道。但一旦让它真的从 A 走到 B,半路就崩。 这是为什么? 因为今天大多数 AI 评测基准都长这样: 仿真渲染(Carla / AirSim) → 纹理过于干净 稀疏街道地图(VLNCE / Touchdown) → …
AI Agent 跨天跨月不"长记性"?这篇论文把"谁能写、写什么、何时生效"做成了协议级硬约束
你有没有想过一件事 🤔: 你让一个 AI Agent 跨天、跨周帮你管项目—— 它今天告诉你的"待办清单",三个月后可能根本不是它真正看到的事实。 为什么? 因为 Agent 跨天运行的时候,模型、工具、后台 worker 都在不停地往共享状态里写。旧版本模型还拿着过期凭据在写、外部工具读到了没经过权限校验的中间状态、…
"为什么 AI 认识猫的图片,却搞不定你朋友的关系网?"——一篇 7200+ 引的论文揭开了图神经网络的底层逻辑
你有没有想过:同样是深度学习,为什么 AI 看一张猫的照片能认出是猫,却不能直接看懂"你朋友 A 通过朋友 B 认识了你朋友 C"这种关系? 因为图像、文本是欧氏空间——规则网格,CNN 和 RNN 这套"在格子上滑动"的招式天然吃得上。但现实中绝大多数数据天然是图:社交网络、好友关系、分子结构、交通路网、推荐系统的"…
"AI 每读一个字就要算 N 次"的时代被终结了——一篇 8326 引的论文让大模型推理速度翻 5 倍
想象一下你读一本 10 万字的小说:每一页你都要回头翻一遍前面所有页,确认"这个人物是不是第三章出现过"。这就是今天几乎所有大语言模型读长文本时干的事——Transformer 的注意力机制决定了它每读一个字,都要和前面所有字重新算一遍关系。当文本从 1000 字涨到 10 万字,计算量不是涨 10 倍,是涨 100 …
它用 6144 块芯片 + 一个数学小技巧,把 AI 大模型的"涌现"第一次钉在屏幕上——PaLM 让"模型越大越聪明"这句话有了最强证据
你有没有这种感觉 🤔: 大模型这两年各家都在"刷榜",都说自己 100B、200B、500B 参数—— 但到底是真的越大越好,还是边际收益已经递减? 训一个 540B 模型的电费能买套房——万一赌错了呢? 这个"赌"的问题,是 2022 年整个 AI 圈最大的悬案。 arXiv 2204.02311(PaLM,Path…
这篇论文让 AI 学会"自己看懂世界"——MoCo 让无标签的 10 亿张图片,变成了能打败人工标注的视觉大脑
你有没有想过这件事 🤔: 人类小孩不需要谁在每张图旁边贴标签,就能学会"猫是猫、狗是狗"。 但你给 AI 看 100 万张"我自己标的猫狗图",它依然认不出自家猫主子和新角度的猫。 同样的"看",人类不挑数据,AI 死磕数据。 这件事的学名叫——「无监督视觉表征学习」。 它难在哪? 语言的最小单元是"词",天然适合做"…
你训练的 AI 模型换个场景就"翻车"?这篇被引近 6000 次的论文给出了"迁移学习"完整地图
你有没有这种感觉: 你训练了一个超准的"猫狗分类器",准确率 95%。 但老板说:"换个医院场景,给 CT 影像分类。" 你把模型拿过去——准确率直接掉到 60%。💥 这是 AI 落地最大的"坑"—— 模型在源领域(A 场景)训练得很好,但换到目标领域(B 场景)就水土不服。这种现象,业内叫"分布漂移"或"域差异"。 …
你以为大模型越"胖"越聪明?这篇被引 7600+ 次的论文把它打脸了
你有没有一种感觉: 大模型这两年,就是一个字——大。参数从几亿飙到几千亿,公司堆算力、堆数据、堆显卡,仿佛「更大 = 更强」是宇宙真理。 但 2019 年的一篇论文说:这个真理是错的。 arXiv 1909.11942(ALBERT) 做的事很反直觉—— 把 BERTlarge 的参数量从 3.4 亿压到 1800 万…
让 AI 看图回答问题,为什么"一句话概括"成了天花板?——LLaVA 用 GPT-4 合成 158k 条指令,把视觉对话打成 92.53% SOTA
你有没有试过这种体验 🖼️: 你把一张客厅照片丢给 AI,说"扮演一个室内设计师,分析这张图里沙发的摆放缺点并给出 3 条改进建议"—— 它回你"图像里有沙发、桌子、台灯" 🫠 它在背 caption。 不是它不聪明,而是它根本没学过"看图 + 按指令回答"。它只学过"看图 + 描述一句话"。 这件事有个名字:视觉指令…
这张图里有多少辆汽车?——SegFormer 如何用一个 84M 参数的 Transformer 看清每一条街
你有没有试过这种体验 🛣️: 你让 AI 看一张街景图,问"这条路上有几辆汽车、几棵树、几个行人"—— 它回你"这是一条繁忙的城市街道" 🫠 听起来"对",但完全没用。 城市街道、卫星图像、工厂表面、医学切片——这些场景里你真正需要的是逐像素的精确类别(哪里是车、哪里是路、哪里是墙),不是一句概括。 这件事有个专门的名…
不靠一张人工标注就能读懂街景文字?——SynthText 的"零成本"OCR 神话
你打开手机里的翻译 App,镜头对着外文菜单,几秒就出翻译结果。你以为这是"AI 的进步"。其实——2014 年的这篇论文,就把这件事的核心问题解了。 arXiv 1406.2227 是 Jaderberg 等人的 SynthText,做了一件当时看似不可能的事:用合成引擎生成的图片训练神经网络,完全不用任何人工标注,…
自动驾驶"先想象再开车"路线为什么上不了车?——arXiv 2608.07468 让视频生成器在训练期当陪练、推理期直接剪掉
你有没有坐过这种演示 🚗: 自动驾驶 AI 看着摄像头画面,先"想象"出未来几秒的视频, 然后基于想象决定方向盘怎么转、刹车怎么踩。 想得很美——上不了车 🚫。 为什么?因为这种"WorldAction Model"(世界–动作模型,简称 WAM)路线在演示效果和部署形态之间踩了一条死结: 推理时必须做未来帧生成——几…
长上下文 LLM 为何总被显存"卡脖子"?——arXiv 2608.07009 把 KV 缓存搬出显存,长文推理峰值吞吐抬到 4.7 倍
你有没有这种体验 🧠: 你让一个 AI 看一份 20 万字的合同、再写个摘要—— 它显存直接爆了。 明明模型算力还远没跑满,卡就先 OOM 了。 这件事 2026 年仍然每天在发生。 为什么?因为今天的 LLM serving 系统都默认把"模型读过的所有内容"——也就是 KV 缓存——堆在 GPU 显存里。KV 缓存…
当 AI 要算"一群图的平均图"——Wasserstein 重心如何从「算不动」变成「几小时跑完」
你有没有想过这样一个问题:如果给你一百张手写数字的图,怎么算出"最像它们全体"的那一张? 普通人会说,把一百张图叠在一起,每个像素取平均值。但你看一眼就知道——这种"普通平均"出来的图会糊成一团,原本清晰的轮廓全没了。 我们想要的是:保留每张图的几何形状,但又要找到一个"中心代表"。这听起来有点玄,但它背后是一类被数学…
当 AI 看一张猫和一张狗时,为什么不输出「猫」「狗」,而是「半只猫 + 半只狗」?——arXiv 1710.09412 用不到 10 行代码的「mixup」,意外治好了 AI 的三大绝症,被引超 12000 次
你有没有想过这个问题 🐱🐶: 你训练一个 AI 识别猫狗——怎么让它别把训练集里那张你 P 过的「半猫半狗」搞笑图也死记硬背下来? 你做自动驾驶感知模型——怎么让它对路上那些「故意贴的小贴纸」(对抗攻击)别太脆弱? 你做 GAN 生成人脸——怎么让生成器和判别器别互相「打架」,训到一半就崩了? 这三个看起来毫不相干的问…
为什么 AI 能「听懂」一段没字幕的英文歌、又能「看懂」一张没标签的图?——arXiv 1807.03748 给了同一个答案,被引超 14000 次,孕育了 CLIP/SimCLR/MoCo 整条对比学习血脉
你有没有想过这件事 🤔: 你手机里的「听歌识曲」功能——它从来没听过这首英文歌的歌词,为什么能识别出歌名? 你相册里 Google Photos 的「自动人物分类」——它从没看过你朋友的脸标过名字,为什么能把同一个人的几千张照片归到一起? 你用的 ChatGPT、Claude 之所以能「理解」你说的句子——它读的语料里…
当 Meta 决定「开源」700 亿参数的大模型时——arXiv 2307.09288 (Llama 2) 用 17768 次被引,改写了整个 AI 行业的竞争规则
你有没有注意到一件事 🦙: ChatGPT 发布后,所有中国大模型公司、美国大模型公司——百度文心、阿里通义、字节豆包、智谱 GLM——几乎都在同一时间开始「追赶」。 为什么是「几乎同一时间」?因为 2023 年 7 月,Meta 突然扔出了一颗开源核弹——Llama 2。 在它之前,大模型是闭源巨头的游戏:OpenA…
当自动驾驶汽车「看」世界时,它到底看到的是什么?——arXiv 1612.00593 让神经网络第一次「直接读懂」3D 点云,十年后所有自动驾驶、机器人和 AR 都靠它打地基
你有没有想过这个问题 🚗: 你手机里那张照片是 2D 的——一格一格的像素排成矩形。 但你身边的桌子、你站着的那栋楼、你正在坐的这把椅子——是 3D 的,有长宽高,有空间位置。 那么问题来了——自动驾驶汽车看到的世界,是什么形态? 答案既不是照片,也不是视频,而是一团 「点」——激光雷达每秒扫出几十万到几百万个点,每个…
你跟 AI 聊得越久越贵?——Zero-Mem:让"AI 记性"这件事一分钱都不用花
你有没有算过这笔账 💸: 你跟某个 AI 助手聊了 100 轮,每次它"记住"你说的话,都要额外调用一次大模型做摘要—— 这一调用就是几百到几千 token 的成本,还有几百毫秒的延迟。 对话越长,"记性"越贵。 更糟的是:摘要常常把原话改写成"差不多意思"——你要找"上次我说哪句话来着",它答不出原句。 arXiv …
AI 终于"长记性"了?——Metis:把记忆能力从外挂硬盘搬进模型大脑
你有没有这种感觉 🧠: ChatGPT 跟你聊得很热,但你下周开新对话,它真的不记得你——你上次提的项目、你的写作习惯、你说过"我对花生过敏"——全部归零。 今天所有 AI 产品都用同一套笨办法对付这个问题:"外挂硬盘"——把对话存在一个外部数据库里(向量库、KV 缓存、笔记系统),下次对话时再检索回来塞进 promp…
为什么 GPT-3 解不了小学数学题,加一句"让我们一步步想"就突然开窍了?——CoT Prompting 把"推理"从训练阶段搬到 prompt 阶段
你有没有遇到过这种时刻 🤔: 你问 GPT3(2020)一道小学数学题—— "小明有 12 个苹果,给小红一半后又买了 3 个,现在有几个?" 它直接答:"12"(错了) 你在 prompt 里加一句"让我们一步步想"—— 它忽然写出: "原来 12 个,给一半剩 6 个,又买 3 个 = 9 个" ✅ 这是 2022…
你手机里的输入法,是怎么在不偷看你聊天记录的前提下学会你的习惯的?——FedAvg 把"数据不出端"的联邦学习从概念变成算法
你有没有想过 🤔: 你每天在手机键盘上敲出的字,可能从来没离开过这台手机—— 但第二天,Gboard 还是更懂你了; 你用 iPhone 拍照、相册自动分类,苹果从不上传你的照片; 医院想联合几家训练癌症筛查模型,原始病历不能出院; 银行做反欺诈,客户交易明细绝对不能出库。 这些场景里,"数据不能动"是硬约束。但 AI…
当 AI 给你的 CT 影像「切器官」时,它用的是「卷积」还是「注意力」?—— 一篇被引 5400+ 次的论文改变了答案
你有没有做过 CT 体检? 影像科医生对着几百张 0.5mm 切片的 CT 影像,一寸一寸勾出肿瘤 / 器官的边界 —— 一份报告要花 2040 分钟。 如果 AI 能自动勾出 8 个腹部器官的轮廓、再让医生微调,医生每天能多看 30% 的病例。 arXiv 2105.05537(Semantic Scholar 被引…
当 AI 学会「写作文」之后,老师到底怎么打分?—— 一篇被引 9000+ 次的论文给出了答案
你有没有想过这个问题: ChatGPT 写了一段摘要、DeepL 翻了一篇论文、文心一言画了段文案 —— 怎么判断它写得好不好? 更尴尬的是 —— 传统打分方法(BLEU、ROUGE)会给完全同义但换了同义词的译文打极低分。 一句 "I love you" 翻成 "I adore you",BLEU 可能直接判 0。 …
当所有人都在问「GPT 和 Claude 哪个强」时,2019 年这篇论文早就回答了真正的问题——T5 如何用「一句话前缀」让一个模型干所有 NLP 任务
你有没有过这种崩溃 🌀: 你想做一个系统,同时干「评论分类 + 摘要生成 + 翻译 + 问答」四件事。你打开 HuggingFace——BERT 用来分类、GPT2 用来摘要、BART 用来翻译、还要再接一个 SpanBERT 做抽取—— 四个模型,四套 tokenizer,四套 finetune 流程,你要维护的是四…
七年了,我们还在用 2019 年这篇论文搭的「地基」训练每个大模型——PyTorch 为什么成了深度学习的唯一语言
你有没有想过这件事 🎯: 你在 MacBook 上跑的那段 loss.backward(),在你手机里的「语音助手」训练时也跑过同一份代码,马斯克训练 Grok 时也是这一行,Meta 最新 Llama 4 的预训练脚本还是这一行。 在 2019 年之前,这种事根本不存在——研究者在 TensorFlow 上写代码,工…
AI 写代码不一定要"跑测试"——arXiv 2606.26978 一篇论文让 SOTA 编程 Agent 禁用执行后,成功率只掉了 1.25%,但还能省下 8.8 次测试运行
你有没有想过这种可能 🤔: 你用 AI 帮你改 bug, 它"跑测试"这件事,不是必需的。 禁掉它, 修复成功率几乎不变(只差 1.25pp), 但每次任务少跑 8.8 次测试。 听起来反直觉? 2026 年 ISSTA 一篇论文 arXiv 2606.26978 告诉你: 当前所有 SOTA 编程 Agent,对"代…
AI 助手知道的太多了,谁来管?——arXiv 2606.26627 把"隐私"这事儿从「攻击类型」换成「数据触点」,挖出 Agent 时代最被忽视的 5 条泄露暗道
你有没有过这种体验 🤔: 你让 AI 帮你订机票, 它顺手就读了你的公司财报、老板邮件、上周看过的病历; 你问"我去年体检报告里血脂高吗?", 它秒回——但你从没授权它读那份报告。 你以为"AI 助手不会越权"? 错了。 arXiv 2606.26627 这篇综述把这件事拆开给你看: "LLM Agent 越能干,隐私…
ChatGPT 为什么突然"听话"了?——InstructGPT 用 13k 标注数据,让 1.3B 模型击败 175B 的 GPT-3
你有没有过这种体验 🤔: 你问 GPT3(2020)一个稍微复杂的问题—— 它写了一段语法完美的英文,但里面 30% 的事实是错的; 你让它"用一句话解释 Transformer"—— 它洋洋洒洒写了 500 字,全是堆术语,你一句没看懂; 你让它"列三个优点,不要超过 20 字"—— 它列了 8 个,每个都超过 50…
1750 亿参数的"大力出奇迹"——GPT-3 是怎么把 LLM 推进"用对话就能干活"的时代?
你有没有过这种体验 🤔: 你打开 ChatGPT,说一句"帮我写封道歉信,语气要真诚,但别太卑微"—— 它几乎立刻写完,而且几乎不用你再写示例。 5 年前这事儿根本做不到。 5 年前你要让 AI 翻译一句话,得先给它 10 个翻译对当示范; 5 年前你要让 AI 做情感分析,得训一个新模型; 5 年前你要让 AI 写代…