Explainers · 学术推广产出

解读

249 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Switch Transformer:Google 用 1.6 万亿参数的"专家团"把大模型训练提速 7 倍
你有没有想过 🤔: 现在的语言模型动不动就上千亿参数。 但每次你问它问题,它真的"动了所有参数"吗?——不是。其实每次只动了其中一小撮。 这件事听起来反直觉,但它是 2021 年 Google 那篇 Switch Transformer(arXiv 2101.03961)证明的——1.6 万亿参数的模型,跑起来却比同等…
科普版 arXiv:2101.03961 2026-08-19
MOSS-VL:让 AI 真正"边说边看"的开源多模态模型——11.3B 参数拿下 3 个第一
你有没有试过 🤔: 让 AI 助手看视频流——它一边讲、一边接住新进来的画面。 但你又不想让它"卡顿"——视频越拉越长,它讲话的"首字延迟"(TTFT)不能跟着炸开。 这件事听起来理所当然,但今天大多数 VLM(视觉语言模型)做不到。 传统 VLM 把视觉 token 拼进 LLM 输入序列——结果是一旦开始生成,新来…
科普版 arXiv:2608.15045 2026-08-19
LLM 脑子里到底有没有一扇"门"?——一篇新论文说:没有,但有一道"中段搬运工"
你有没有想过 🤔: 你让 AI 读一段长上下文,然后问"这段话里那个数字是多少"——它答得上来。 但它到底是怎么把这串数字从上下文里搬到"能回答"的当前位置的? 这是认知科学里"全局工作空间理论"(Global Workspace Theory, GWT)一直想回答的问题:人脑里是不是有一个"门",只让被选中的信息进入…
科普版 arXiv:2608.15022 2026-08-19
你和 AI 语音助手对话时,有没有觉得它"好像一边说话一边在想事情"?——其实有一篇论文真把这事做出来了
你有没有过这种体验 🤔: 让 Siri 或者某国产语音助手"帮我查一下明天北京到上海的航班"—— 然后它沉默了一秒,才慢吞吞地说"明天有……9 个航班"。 沉默的那一秒,其实是它在调云端大模型"想事情"。 而你听到的第一个字之前,已经过去了 500~1500 毫秒——这就是 AI 语音助手的天花板。 arXiv 251…
科普版 arXiv:2511.07397 2026-08-18
AI 看视频,为啥永远分不清"开门"和"关门"?——一篇论文说:它根本就没在学"动作"
你有没有想过 🤔: 为什么现在的视频 AI 能认出"牛在吃草",但你让它看一段"关上抽屉"的视频—— 它可能给你标成"打开抽屉"? 按说"关"和"开"差一个字,人类一秒就能分。 但 AI 经常分错,而且错的不是"差一点",是彻底搞反。 arXiv 2601.16211 直接撕开这件事: AI 没在学"动作"——它在偷懒…
科普版 arXiv:2601.16211 2026-08-18
把"可信度"从分数搬上排序前沿:为什么 Pareto 重排序是 2026 信息流可信工程的实用派
你有没有试过刷信息流,看到一条"政策辟谣"被排到第 30 位,而一条"耸动标题党"被推到了第 3 位? 你大概率会觉得:这套推荐系统在纵容 misinformation。 但你换一个角度想——直接把"耸动标题党"硬降权或删除,会引发另一个问题:用户的相关性预期被打乱,"猫猫视频"被挤到"政策辟谣"前面,整个排序系统就崩…
科普版 arXiv:2606.18031 2026-08-18
为什么 GPT-4 解"24 点"比登天还难,让它"在心里下三盘棋"就能 74% 一次过?——Tree of Thoughts 把"思考"从一条线变成了一棵树
你有没有这种感觉: 你让 GPT4 玩 24 点 —— 给定 4 个数字,用加减乘除算出 24。 它直接答:"4×4+4+4 = 24" ❌(用了三个 4,题目只给了一个 4) 你说"一步步想"——它写出推理链,但一条路走到底,中间错了也不知道回头。 这是 2023 年所有"思维链"(ChainofThought)方法…
科普版 arXiv:2305.10601 2026-08-18
为什么 AI Agent 写代码一错再错,你只要告诉它"你刚才又错了",它就能自己改对?——Reflexion 把"反思"做成了 agent 的肌肉记忆
你有没有这种感觉: 你让 ChatGPT 写一个 Python 函数,它第一次写错了。 你说"不对,你再想想",它改了。 又错了,你说"还是不对",它又改。 第 5 次终于对了——但前 4 次的"错在哪",它一个都没记住。 下次遇到类似问题,它又从第一次错的版本开始重来。 这是 2023 年所有 LLM agent 的…
科普版 arXiv:2303.11366 2026-08-18
让 AI 看病这件事,2022 年 Google 第一次严肃做对了——为什么 Med-PaLM 把「医学 LLM 评估」从「选择题正确率」升级到「人类医生打分」是真的封神
你有没有想过 🤔: 当你今天用 ChatGPT 问「我吃了布洛芬能不能喝酒」「孩子发烧 39 度要不要去医院」,得到一段看起来专业、看起来面面俱到的回答—— 你真的信吗?这回答有没有漏掉禁忌症?有没有把偏方说成主推?会不会因为太「礼貌」把医生本该拒答的边缘问题「圆回去」? 这件事在 2022 年底之前,整个 AI 圈没…
科普版 arXiv:2212.13138 2026-08-17
ChatGPT 自己「主动去查 Google」之前一年,已经有一篇论文让 AI「自己教自己用计算器」——为什么 Toolformer 是 Agent 时代的「地基」
你有没有想过 🤔: 今天的 ChatGPT、Claude、Gemini,主动帮你查实时天气、调计算器算 17×23、打开数据库跑 SQL,这件事看起来理所当然—— 但它们都是「主动」调用的,不是你一步一步指挥的。 让 AI 学会「自己决定什么时候该用工具、该用哪个工具、参数怎么填」——这件事真正被一篇论文工程化地跑通,…
科普版 arXiv:2302.04761 2026-08-17
Karpathy 2014 用"碎片级对齐"奠定图文匹配"可解释"范式
你有没有试过,让一个 AI 系统去匹配"一只黑狗跑过绿草"和一张图片,然后反问它:"你为什么觉得这张图和这句话匹配?"? 十年前的 AI 主流答案是:"我不知道,模型说匹配就匹配"。 arXiv 1406.5679(Karpathy & FeiFei 2014 年的 Deep Fragment Embeddings f…
科普版 arXiv:1406.5679 2026-08-17
「AI 为什么这么判」到底是不是一个好问题——一篇被引 5400 次的位置论文,给整个可解释机器学习领域立了规矩
你有没有想过 🤔: 当银行用 AI 拒绝你的贷款申请,它告诉你「因为你的年龄和职业」,这个解释是真的吗? 当医院用 AI 诊断你的 CT 影像,它圈出「这块组织有 90% 概率是肿瘤」,医生敢不敢真的相信? 当 ChatGPT 给你写一段话,你问「你为什么这么说」,它答「根据 X 论文……」,这个回答是不是套话? 所有…
科普版 arXiv:1702.08608 2026-08-17
让机器人「看懂室内」这件事,2017 年之前为什么没人能跑通——一篇被引近 6000 次的论文,靠 iPad + 流水线把它从「实验室小作坊」变成「基础设施」
你有没有想过 🤔: 当你让家里的扫地机器人「把客厅里的玩具都收进柜子里」,它是怎么知道「客厅是什么」「柜子在哪里」「玩具长什么样」的? 当 AR 眼镜把虚拟家具「摆到你的真实客厅」里,它怎么知道墙壁在哪里、桌子有多大、沙发是什么形状? 当你想训练一个机器人去「医院查房、在走廊里穿梭、帮人拿药」,它怎么知道走廊是走廊、病…
科普版 arXiv:1702.04405 2026-08-17
长上下文推理的"显存爆"终于有解了:Maglev 把固定大小记忆做到可并行训练
你有没有想过 🤔: 当你和 AI 聊到第 200 轮,或者让它读完一整个代码库再回答问题——它背后那块 GPU 的显存正在线性爆炸。 因为标准的 Transformer 会把整段对话的"中间状态"都存下来。上下文越长,显存占用越大。百万级 token 的会话,没有一张消费级显卡能扛得住。 arXiv 2608.0287…
科普版 arXiv:2608.02870 2026-08-17
当机器人学会"全身"思考:为什么 LingBot-VLA 2.0 把 20 种构型的数据都喂给了一个模型?
你有没有想过 🤔: 一个会走会抓的家用机器人,背后那个 AI 其实只"看见"过机械臂末端的那一小段动作—— 它的躯干怎么转、腰怎么扭、基座怎么挪,几乎从来没学过。 这就是为什么同一套 VLA 模型,今天在你家桌面上抓杯子很顺,明天换一台工业机械臂就完全抓瞎。 arXiv 2607.06403(LingBotVLA 2.…
科普版 arXiv:2607.06403 2026-08-17
让 AI "听懂人话"这件事的转折点——Whisper 凭什么成了语音识别的默认基线?
你有没有想过:为什么 2022 年之前的语音识别(ASR)总是"换场景就崩"? 在安静的办公室里转写挺好,一到地铁、商场、电话会议,立刻变成听不懂的乱码——专有名词乱猜、英文夹中文乱飞、专业术语全错。 不是 AI 不努力。是整个 ASR 领域长期处于两个极端: 1. 有监督路线:高质量标注数据集规模有限(LibriSp…
科普版 arXiv:2212.04356 2026-08-16
让 GAN 训练不再"三天两头崩"——一篇被引 1.1 万次的论文,靠"梯度惩罚"救活了整个领域
你有没有想过:为什么 2017 年之前的 GAN 训练,总是玄学? loss 一会儿上天一会儿下地,生成器画出来的脸忽男忽女,训到一半突然「模式崩塌」——所有猫都长成一个样。 不是研究者手笨。是整个领域缺一条"稳定训练"的工程底线。直到 2017 年 4 月挂上 arXiv 的 1704.00028(WGANGP) 出…
科普版 arXiv:1704.00028 2026-08-16
一篇 2015 年的 CNN 综述,为什么今天还在被引?——读懂「卷积神经网络设计手册」
你有没有这种感觉—— 「为什么这个网络要加残差连接?」 「为什么换 ReLU 比 sigmoid 好?」 「为什么 BatchNorm 之后训练快很多?」 这些都是CNN 时代每个工程师都踩过的坑。2015 年底挂上 arXiv 的 1512.07108 做了一件事:把"现代卷积网络是怎么搭、怎么训、怎么用"拆成六个维…
科普版 arXiv:1512.07108 2026-08-16
AI 看 CT 片,第一次能像放射科医生一样"既看局部又看全局"
你有没有想过:为什么 2021 年之前,AI 看医学影像总是「抓不到完整器官」? 左边肺看对了,右边肺却漏一块;心脏边界切得准,但胰腺、肾脏这种小器官又糊成一团。 不是 AI 不努力。是它只有「局部眼睛」没有「全局眼睛」: CNN(卷积神经网络) 像显微镜:看得清像素级边缘、毛细血管,但视野只有一小块。它看的 CT 切…
科普版 arXiv:2102.04306 2026-08-16
「问 AI 一张图,AI 给答案」这件事的祖师爷:VQA 这篇论文给了 9 年多模态比赛的标准答案
你有没有想过 🤔: 当你给 ChatGPT 发一张图、问「这张图里的猫在做什么」,它能秒回「趴在窗台上晒太阳」——这个「看图 + 理解问题 + 自然语言回答」的能力是怎么来的? 当 GPT4V、QwenVL、LLaVA 在各种「视觉问答」榜单上刷分时,它们究竟在和什么样的基准做对比? 答案是:2015 年由 21 位作…
科普版 arXiv:1505.00468 2026-08-15
让 AI「看图写一句话」这件事的祖师爷:Karpathy 这篇论文打开了图像描述的整条血脉
你有没有想过 🤔: 当你手机相册自动生成「一只狗在草地上追飞盘」这样的标题时,微信扫一扫能识别图里的菜单,淘宝拍立淘能从一张照片里找出同款商品——它们背后其实都是同一个核心问题:机器怎么把一张图变成一句自然语言? 今天这事听起来理所当然,但在 2014 年之前,AI 看到一张图能做的只有两件事: 而真正能让 AI 「理…
科普版 arXiv:1412.2306 2026-08-15
当 AI 自己当"质检员"——BLIP 凭什么成了多模态时代的奠基工作?
你训练 AI 看图说话,数据是从网上抓的——结果 caption 乱七八糟,一半是错的。 你有两个选择:雇人重新标注(贵到天际),或者把数据全部丢掉(心疼)。 2022 年 Salesforce 的一篇论文,给出了第三个选项:让 AI 自己给自己当裁判,把错的踢出去。它就是 arXiv 2201.12086 的 BLI…
科普版 arXiv:2201.12086 2026-08-15
让 AI 一边"想"一边"动手查"——ReAct 凭什么成了 Agent 时代的开山祖师?
你用过 ChatGPT 的"联网搜索"吗?或者让 AI 帮你订外卖、比价下单、查航班?你有没有想过——它是怎么做到"想一句、查一句、再想一句"的? 这个看似理所当然的能力,背后其实有一篇 2022 年的论文,几乎凭一己之力奠定了整个 Agent 时代的玩法。它就是 arXiv 2210.03629 的 ReAct,被 …
科普版 arXiv:2210.03629 2026-08-15
让机器人"先在脑子里演练一遍再动手":DreamX-Phi 拿下世界大赛双榜头部
你有没有想过 🤔: 机器人想抓一个杯子,AI 不是直接控制它动手,而是先"在脑子里"把整个动作跑一遍视频——看看如果按这个角度伸手,会不会碰倒旁边的水壶、会不会抓空、杯子会不会翻。 然后挑一个最稳的方案去执行。 这听起来像科幻,但其实是一个被工程界严肃追求的方向:视频世界模型。 最近在 WorldArena 2.0 C…
科普版 arXiv:2608.13489 2026-08-15
当 AI 替你查"议员们说过啥",你拿到的是不是真相?一篇被 ISWC 2026 接收的论文说:不一定是
你有没有想过 🤔: 你想搞清楚"意大利议员们对 AI 监管到底怎么看的",于是打开一个 AI 助手问了一句—— 它给你列了一堆引用,看上去挺像那么回事。但这些引用真的平衡吗?那些话真的是那位议员说的吗?那位议员真的有资格谈这个话题吗? 听起来像哲学问题,但它是一个真实的政治风险——arXiv 2608.13410(Pa…
科普版 arXiv:2608.13410 2026-08-15
ARC-AGI 难题:150M 小模型用 $0.0007 一次的成本,把 SOTA 推到新位
你有没有试过 🧩: 看一张"网格变换"题目(几排彩色方块按某种规则变形),让你猜下一张图的形态—— GPT4 / Claude 都经常答错。 这正是 Francois Chollet 设计 ARCAGI 的初衷:测的不是"会不会背答案",而是"会不会抽象"。ARCAGI 是当下公认的"反大模型记忆"基准。 但现有打法都…
科普版 arXiv:2608.09888 2026-08-14
让 AI 自己当科学家:它读 13000 篇论文,只为搞清楚"模型为什么会犯傻"
你有没有想过 🤔: 你训了一个大模型,它有时拒绝回答无害问题、有时对错误答案异常自信、有时 pretraining 阶段"突然"学会新技能…… 这些行为是怎么来的? 以前,要回答这种问题,人类研究员得花几周到几个月:设计对照实验、加 probing、写 intervention、写论文。可模型迭代速度早已超过人脑的解析…
科普版 arXiv:2608.12036 2026-08-14
当 AI 还在凭"长相"认人时,2013 年的这篇综述就告诉你:距离才是核心
你有没有试过让 kNN 分类器跑一个真实业务? 鸢尾花上准到 96%,换到人脸识别就掉到 60% 出头——不是因为模型不行,是距离函数用错了。 欧氏距离把人脸的高维像素"摊平"到一根尺上,鼻子到眼睛的距离和嘴角到下巴的距离等量齐观——但人眼根本不是这样认人的。我们看的是"五官比例的协调",是"局部关系的匹配",是一个有…
科普版 arXiv:1306.6709 2026-08-14
AI 帮你看财报,你敢信吗?——一份 2026 年的金融 QA 评测,给"指标单一"这件事狠狠打了脸
你有没有想过一件事 🤔: 你在某银行 App 里问"2024 Q3 净利润多少"——AI 助手秒答:"约 35 亿美元"。 你信吗? 按说,这种"金融短答案问答"系统应该已经很成熟了——但 2026 年的一份评测直接揭底: 前 4 名的 ROUGE1 F1 差距不足 1 个百分点——但具体数字完全没公开。 这是 arX…
科普版 arXiv:2607.19867 2026-08-14
Deep Research Agent 烧钱太快?这篇论文告诉你:问题不在模型,在"哪里丢 token"
你有没有这种感觉 🤔: 每次让 ChatGPT / Gemini / Claude 帮你"深度研究"一个开放问题—— 比如"调研一下 2026 年有哪些 AI Agent 框架值得学"—— 上下文窗口跑着跑着就撑满了,钱也跟着飞。 最离谱的是——最后看报告,发现大量段落其实没什么用。 为什么? 因为现在几乎所有 dee…
科普版 arXiv:2608.08389 2026-08-14