解读
504 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
想让 AI「读心」说出你脑子里的话?先把基础数据准备好——这份 100 小时脑磁图把赛道标准化了
你有没有想过 🤯: 有一天,你脑子里想说什么,机器就能直接把它变成文字发出去——不用动手、不用出声,甚至不用动嘴。 这是非侵入式脑机接口(BCI)讲的终极故事:对渐冻症患者、重度瘫痪患者来说,"把脑子里的语音解码成文字"是重新拿回表达能力的希望。 听起来很科幻对吧? 但现实是——这个领域过去十年都被一个特别土的问题卡着…
长视频在线 3D 重建总是"越跑越歪"?arXiv 2609.04201 把原因拆得很细:坏的不是眼睛,是全局位姿头
arXiv 2609.04201(ECCV 2026 · YuLun Liu 等) 解决一件具体的事: 在线 3D 重建模型在短片上一切正常,到长视频(几十分钟到几小时)就开始几何崩盘。Scal3R 把这个"长视频漂移"问题拆成两件独立的事——逐帧深度估计保持稳定,但全局位姿估计头崩盘——并据此给出只 ~1% 可学习 …
2018 年这篇综述,把「为什么 AI 怎么训都涨不动」这件事提前 8 年讲透了
你有没有过这种时刻:换了 5 个模型架构、调了 3 个月超参、跑了一堆 ablation——AI 准确率死活就停在那个数字不动了? 这时候大多数工程师会本能地怀疑"模型还不够大、训练还不够久"。但 arXiv 1811.03402(A Survey on Data Collection for Machine Lear…
让 AI「真正看懂图文」的算子,十年前就被这篇 arXiv 1606.01847 焊进了多模态基础
你有没有注意过——现在的 AI 越来越会看图说话了,但它到底是"看懂了图和文字的关系",还是只是"把图和文字凑在一起猜答案"? 这件事在 2016 年前后是 VQA(Visual Question Answering,看图问答)领域的核心焦虑:模型看着一张图、读一句问题,要给出答案。但当时所有主流系统用的"图文融合"方…
训练 AI 的同时把"可解释性"也焊进去——arXiv 2608.07594 让 8B 模型少用 16 倍算力也能打
你有没有想过——你用的 AI,它为什么这么回答?它学到了什么?它能不能改? 这三个问题,对今天的 LLM 来说大部分都答不上来。主流大模型走的是"训完再解释"的路子:先当黑盒训出来,再拿 SAE、probing、attention 可视化这些后验工具去挖它的内部表示。这种范式有三个老毛病——解释的可靠性难保证、能力越强…
AI 学会"自己升级自己"了?arXiv 2608.08311 让 Agent 在三个基准同时拿下第一名
你用的 Cursor、Claude Code、Devin 这些"AI 程序员",背后其实是一套叫 Harness 的执行外壳在干活——它管对话循环、调工具、拼上下文、出错时恢复。Harness 的代码通常是工程师手动 PR 改的,而模型每 36 个月迭代一代,Harness 的更新速度远远跟不上模型变化。 2026 年…
脑机接口领域 20 年没解决的"度量难题",被一篇 2026 论文用一个信息论公式终结了
你有没有想过——如果一个瘫痪病人脑子里想着"我想喝杯水",但他嘴巴说不出来,脑机接口(BCI)帮他把脑电波翻译成文字——我们怎么知道翻译得"够不够好"? 这件事远比想象中难。2026 年 9 月这篇来自 arXiv 2609.02887(OVMI) 的论文揭示了一个领域级测量危机:过去 20 年,全球几十个实验室、上百…
为什么同一个 AI,换个"壳"成绩就能差 14 分?arXiv 2609.01437 把 Agent 的"壳"本身变成了评测对象
你有没有想过——你用的 ChatBot、写代码的 Cursor、回邮件的 AI 助手,它们的"内核"其实是同一个大模型,但表现天差地别。这中间差的不是模型本身,而是那层"壳"——Harness。 Harness 是 Agent 的执行基础设施:负责管理对话循环、调用工具、处理上下文、出错时恢复、验证结果。它是把模型输出…
AI 没有标准答案时,怎么学会完成复杂任务?DRACO 用"动态评分标准 + 闭环分配"打开长视野 Agent 的黑盒
你有没有想过 🤔,让 AI 帮你跨 5 个网页查资料、填 10 个表单、调 3 个 API——这个任务怎么打分? 让 AI 做数学题,可以把答案代入程序检查;让 AI 写代码,可以跑测试用例。但客服 / 浏览器操作 / 企业 API 流程这类任务——过程几十步、结果很难自动验收——是 RLVR(Reinforcemen…
当 137M 小模型干翻了 175B GPT-3:被遗忘的多任务 Prompt 革命
你有没有想过 🤔,ChatGPT 那种"说一句就能干活"的能力,最早是从哪里冒出来的? 不是 GPT4,也不是 GPT3 本身——而是一篇 2021 年的论文,做了一个看似简单、却彻底改变了 LLM 走向的实验: 把一堆 NLP 任务统一成"自然语言 prompt",用 1.37 亿参数的小模型联合训练,结果在多个未见…
你看到的「AI 写代码 90 分」可能是假的:HumanEval+ 把所有人打回原形
你有没有想过 🤔,你买的"AI 程序员"到底能写对多少代码? 不是厂商宣传的那种「90% 一次通过率」,也不是新闻稿里的「接近人类水平」——是真实的、严格的、拿几千个刁钻测试用例砸过去以后,还能不能写对的那种"对"。 2023 年有一篇论文,做的事可以用一句话概括:把评判 AI 代码能力的考卷,从每题 8 道题改成每题…
当 AI 拿到「模糊目标」就开始摆烂:arXiv 2608.31111 揭穿了大模型自进化的最大谎言
你有没有想过——你让一个 AI Agent「帮我变强一点」,它会怎么做? 如果你以为它会自己诊断能力缺口、找学习材料、跑训练、验证效果,那你就太乐观了。2026 年 9 月这篇来自 arXiv 2608.31111(ASPIRE: Can Models SelfEvolve from Vague Goals?) 的论文…
机器人「标称速度满分、一加速就崩」:arXiv 2609.01453 揭开了模仿学习的跨速度死穴
你有没有想过——为什么实验室里能完美抓取快递包裹的机器人,到仓库里提速到 1.5 倍就频频手滑、把包裹怼歪在货架边缘? 传统答案是「机器学习模型的鲁棒性还不够」。但这个答案太模糊了——所有 AI 都说自己鲁棒,所有论文都说自己 SOTA。真正的问题被绕过去了:现有的模仿学习评测,几乎全是在「标称速度」下跑的。 2026…
AI 蒸馏不是"中段失效"——arXiv 2609.01532 用一个 entropy 路由让推理 +1.6x、事实记忆保 96.8%
arXiv 2609.01532 解决一件具体的事: 知识蒸馏(KD)在预训练阶段能同时提升小模型的推理与事实记忆,但在中期训练(midtraining)阶段——精选语料上的自监督中间阶段——标准 forwardKL 蒸馏会让事实记忆变慢,尽管推理还在涨。Meta/FAIR 团队把原因溯源到 teacher confi…
Spark 里那个被忽视的 ML 库:10 年前这篇论文,把"数据清洗 + 训练 + 上线"塞进了同一个引擎
你可能不知道——今天所有大厂"数据 + AI 一体化"的工程思路,最早可以追溯到 2015 年 Apache Spark 内置的 MLlib 论文(arXiv 1505.06807)。 听起来很"老",但这篇论文讲的事情,至今仍然是分布式 ML 工程的核心命题:"别把数据搬出去训练,让训练引擎直接住在数据所在的引擎里"…
不用"自注意力"的视觉 AI:高分辨率图片终于不被显存吃光了
你有没有想过——为什么手机拍一张 1200 万像素的照片,AI 想"看懂"它就要花掉好几 G 显存? 2024 年 1 月的一篇论文(Vision Mamba / Vim,arXiv 2401.09417)给出了一个反直觉的答案:别用"自注意力"了。 听起来很反常识——过去 5 年,视觉 AI 的主流路线就是 Tran…
一张图既能渲染又能算深度还能符合物理:arXiv 2609.04196 把 3D 世界生成的「拼乐高」管线直接干掉了
你有没有想过——为什么 AI 生成的 3D 视频里,物体会突然穿模、漂在空中、或者重力方向莫名其妙? 传统答案是:「这是 AI 的老毛病了」。过去几年,几乎所有 AI 生成 3D 内容的工作,都是「拼乐高」式的管线:用一个 AI 算深度,用另一个 AI 算物理,再用第三个 AI 算外观,最后用相机标定把它们粘起来。问题…
让 AI「边看边忘」的旧套路翻篇了:arXiv 2609.04131 用三层潜在记忆让长视频问答不再越看越慢
你有没有想过——你让一个 AI 看你家客厅的实时监控问"刚才门口有没有快递员来过",AI 是怎么从过去 6 小时视频里找到答案的? 传统答案是:「把每一帧存起来,问的时候再去翻」。这就是过去几年视频 AI 的主流做法——"存了再取"(storeandretrieve)。但这条路有三个致命问题:延迟越来越高、记的东西越来…
终于不用先听完整段会议再分谁说话了:arXiv 2609.02812 把 ASR 和「说话人归属」第一次合并成一个流式模型
你开过视频会议吧?你有没有注意到——Zoom / 飞书 / 腾讯会议的「实时转录字幕 + 说话人标签」总是慢半拍、还经常把「张总说的话」标成「李总说的」? 这背后的原因是「行业默认做法」: 1. 先让一个 ASR 模型把音频转成文字 2. 再让一个独立的「说话人聚类」(diarization)模型去分「谁说了哪句」 3…
让 AI 帮你一行一行「验」操作系统的代码:arXiv 2609.04043 在 77 天里抓出 9 个真实内核 bug
你有没有想过——你手机里、汽车里、银行服务器上跑的操作系统内核,几十万行 C 代码,到底有没有 bug? 传统答案是:「靠测试、靠 review、靠时间慢慢磨出来」。这是过去 50 年的现实:哪怕是 seL4 这样号称"经过形式化验证"的内核,也只能证明到「C 源码 → 中间汇编语义」这一层就停步了——再往下钻到 MM…
Office 大眼夹背后的引擎:30 年前这篇论文,把"该不该弹窗"变成了一道数学题
你见过 Office 里那只大眼睛的回形针吗?——"看起来你在写信,需要帮助吗?" 它叫 Clippy,被评为"微软最失败的产品之一"。但它背后的推理引擎,其实是 AI 史上最早的"主动推荐系统"工业级落地。 1998 年,Horvitz 等人在 UAI 大会上发表了 Lumiere Project——把"该不该弹窗"…
让 AI 真正"看懂"动作:10 年前这篇论文,把"骨架识别"的天花板顶了上去
你有没有想过,体感游戏机是怎么知道你挥的是"上勾拳"还是"摆拳"的?康复机器人是怎么分辨患者在"慢走"还是"跛行"的? 不是靠摄像头拍画面——而是靠 25 个贴在你身上的小红点(关节点)。这些红点连起来,就是你身体的"骨架"。 机器只看你这 25 个关节点的 3D 坐标变化,就能判断你在做什么动作——这叫"骨架动作识别…
"每个新类别只给你 5 张照片"——AI 怎么学?一篇被引 2,191 次的综述把这个问题讲透了
你接到一个新任务: "我们公司新上了 20 个产品,每个产品的图片只有 5 张。AI 能不能自动识别客户上传的图片属于哪个产品?" 你可能脱口而出:"才 5 张图?肯定不够啊。" 但这个场景在现实中每天都在发生——医疗罕见病、工厂新缺陷类型、长尾品类识别、安防新威胁…… 这就是 FewShot Learning(小样本…
把视频"打 95% 马赛克"再让 AI 复原,为什么反而更聪明?—— 被引 2,207 次的 VideoMAE 给出的反直觉答案
你敢信吗? 把一段视频 95% 的画面都涂黑,让 AI 只能看到剩下 5% 的零碎片段,然后让它"凭记忆"把被涂掉的部分复原出来—— 这个看似"故意刁难 AI"的做法,反而比让 AI 看完整视频学得更好。 这不是玄学。这是 2022 年南京大学 MCG 团队提出的 VideoMAE(Video Masked Autoe…
当 SLAM 不再"囤记忆":arXiv 2608.27529 用 11 帧 KV 缓存做长程流式 3D 重建,城市级 ATE 降到 4.35 米
你可能不知道:自动驾驶汽车、AR 眼镜、扫地机器人要"知道自己在哪、周围是什么形状",靠的是一个叫 SLAM(同步定位与建图) 的底层技术。它要求从摄像头视频里实时估计相机位姿 + 场景 3D 几何。 过去几年的主流做法是"囤记忆"——把过去几百、几千帧的关键信息都存起来,再让 Transformer 在这堆记忆里做全…
当 AI 看人像开始悄悄"偏心":arXiv 2608.25375 用「球面弧线」给大模型纠偏,连「答得好不好」都没掉
你有没有想过:当你用 LLaVA、QwenVL 这种"能看图也能说话"的大模型去描述一张人像简历,它会不会因为肤色、性别、年龄段的不同,给出不一样的形容词?这不是科幻,而是 20252026 年多家研究反复验证过的事实——生成式视觉语言模型(generative VLM)在人本场景(招聘筛选、人脸属性描述、客服图像问答…
让 AI 评估 AI,最容易错在哪里?从 3,808 个工具调用任务说起
如果一个 AI Agent 真的完成了任务,谁来判断它是不是“做对了”? 过去常见做法,是再叫来一个更强的语言模型当评委:给它看问题和 Agent 的操作记录,让它判断结果好不好。这个方法听起来合理,毕竟 AI 评委能读懂自然语言,也能处理复杂背景。但它真的可靠吗?如果 Agent 调用的不是一个普通聊天问题,而是一串…
让 AI 连续写 70+ 次代码还能"修一处不崩三处"?arXiv 2609.01481 把 coding agent 包了一层"元层 harness"
你有没有这种感觉: 你让 AI 写代码做项目——第一天干得漂亮,第二天开始修 bug,第三天修了 A 崩了 B、修了 B 又崩了 C。你以为这是模型不够强。不。 这是所有「AI Agent 框架」自己埋的雷:多日迭代没有"持续改进"的系统目标,只有"每次跑完就行"的局部最优。 arXiv 2609.01481(Harn…
你的 RAG 检索这么贵,效果几乎没差别?arXiv 2608.12875 戳破了「LLM 当 embedder」的幻觉
你有没有这种感觉: 你在做 RAG,团队争论"要不要直接用 GPT/ Gemini 当 embedder,扔掉专用 embedding 模型"。支持派说"通用能力强",反对派说"贵 + 慢"。两边各有工业案例,但没人拿出受控实验给量化答案。 直到 arXiv 2608.12875(The Embedder's Dile…
当 AI 读完一本小说就"懂"每句话——2015 年 Skip-Thought 如何用"猜前后句"训出跨任务句向量(事实守约版 · A/B/C 类划分 + P-31-2 重写)
⚠️ 事实守约声明 · A/B/C 类划分版(20260902 evening 反思棒重写 · v2 范式同步) 本稿解读对象是 arXiv 1506.06726(SkipThought Vectors · Ryan Kiros, Yukun Zhu, Ruslan Salakhutdinov, Richard S. …