解读
502 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
想让 LLM 落地?3 年前这篇综述给了你一张完整的「上手机械图纸」
你有没有这种感觉 🤖? 你刚加入一家公司,团队要做 LLM 产品。你打开 Slack 看见满屏问题:"我们该不该 finetune?RLHF 和 DPO 哪个好?RAG 怎么做?Agent 是不是又是炒作?幻觉怎么治?上生产要踩哪些坑?" 同事扔过来 100 篇论文让你"先看看"。你打开第一篇,看 5 分钟关掉——全是…
AI 模型在新场景"水土不服"——9 年前这篇综述给了它"水土适应"的全部药方
你有没有这种感觉 🤖? 你花了几十万张图、几十个小时训出来的"识别产品瑕疵"的 AI 模型,搬到一条新产线,准确率直接掉到 50%。同一台相机、同样的灯光条件,为什么换个车间就不行了? 这不是你的模型不行。是它没学会"适应新环境"这件事。 2017 年的一篇综述,做了一件奠基级的事——它第一次把"AI 怎么从一个场景迁…
让 ChatGPT 做研究生数学题,它偷偷交白卷——2023 年这篇论文撕开 AI 数学能力的底裤
想象一下这个场景: 2023 年 1 月,全网都在刷「ChatGPT 通过谷歌 L3 工程师面试」「GPT4 通过美国医师执照」——一时间,「AI 数学家」似乎呼之欲出。 你大概率以为:数学是 LLM 的强项——毕竟它能写出 LaTeX,能解释定理。 但 NeurIPS 2023 Datasets and Benchm…
当年那个「不卷」的视觉 AI:5 亿张网页图 + 一句话目标,结果把同行全部甩开——SimVLM 凭「最笨」赢了 SOTA
想象一下这个场景: 2021 年,所有做「看图说话」AI 的团队都在拼同一件事——给视觉模型塞更多人工标注、叠更多任务目标、对齐到更精细的物体框。Faster RCNN 抽特征、object tag 喂标签、4 个 loss 同时优化——pipeline 像「俄罗斯套娃」,每个环节都要专门调参。 你大概率以为:这条路越…
机器人看视频的速度,被这套方法从「卡帧」提到「秒级」——浅层砍掉 52 倍
想象一下这个场景: 你戴着一副 AR 眼镜在厨房做饭,AI 助手在边上看你的每一个动作——切菜、翻锅、关火——并实时告诉你下一步该放多少盐。它必须在 1 秒内响应,否则你已经糊锅了。 你大概率以为:现在 GPT4V / Gemini 这类多模态大模型这么强,做个流式视频理解应该很简单吧? 但 2026 年 9 月 Sh…
你的 AI Agent 真的「听话」吗?arXiv 2609.09875 给它打了个「全链路体检」——外挂式 trace reader + 十维评分 + 行为归因
arXiv 2609.09875(AgentAudit: An Open Framework for Trustworthiness Evaluation of AI Agents Across the Lifecycle,20260909 上传,23 页 / 12 图)做了一件让所有部署 AI Agent 的团队都能…
你的下一局 PUBG,可能要带一个「会说话的 AI 队友」上线了——141 个国家、3.9 万场真实战斗、净推荐意愿 +25.1 个百分点
arXiv 2609.29837(PUBG Ally: An Embodied Conversational Agent as a Teammate in PUBG: BATTLEGROUNDS,20260924 上传,55 页 / 19 图 / 16 表,KRAFTON 等机构 24 位作者)做了一件把「AI 队友」…
不破解模型就能"偷看"AI 内心独白:一篇用标准 API 重建 GPT-6 类前沿模型思维链的论文
arXiv 2609.26637(Toolbased CoT Extraction, Tao Ren et al., 奥尔堡大学 / 哥本哈根大学, 33 页 + 14 图, 202609 上传)做了一件反常识的事——它没说"破解模型",而是挖出 API 设计里一个厂商能堵却没堵的口子:只要你还能在 OpenAI / …
9 年前这篇论文悄悄给 LoRA 打了地基:1 个骨干 + 10 个"小挂件"就能服务 10 个视觉任务
你有没有这种感觉—— 你公司想做一个「能识别 100 类商品」的视觉模型。市面上每个公开数据集都只解决一小块:ImageNet 识别物体、交通标志识别、花卉识别、车型识别…… 传统做法:为每个任务训一个完整模型,存 100 份权重,部署 100 个推理服务。 但你隐约觉得:这 100 个模型 90% 的参数应该都是一样…
让 AI 像学生一样"做完 5 道题对答案":Self-Consistency 用最笨的办法拿下数学题 17.9 分
你有没有这种感觉—— 你给 ChatGPT / Claude / Gemini 出一道小学应用题:「小明有 12 个苹果,送给小华 3 个,又买了 5 个,现在有几个?」它有时候能算对,有时候算错——而且你也不知道它这次是蒙对了还是真的算对了。 更糟的是—— 同样的题目,换个问法,它又错了。 这种现象的本质:模型推理时…
不再把网页"切碎成文本块"再检索——香港理工大学 PolyUQuest 用一张异构图,让 AI 问答能逐句对照原文找证据
你有没有这种感觉—— 你在企业内网 / 学校官网 / 政府门户问 AI 一个问题,AI 给你一段看上去"很靠谱"的回答。但你想追问"这段话到底来自哪个页面、哪个章节"——AI 答不上来。或者更糟:AI 把几个不相干的段落拼在一起,听着像那么回事,其实有一句是编的。 你大概率以为:这是大模型的"幻觉"问题,没法治。 但香…
把"用自然语言写软件"做成真——Yuntian Deng 团队 Compile by Training 让企业反复调用的任务一次编译成本地小函数
你有没有这种感觉—— 你公司里有一些反复要做的事:合同里的"甲方名称 / 金额 / 签章日期"字段抽取、客服回复的标准化改写、报表里某列的格式归一化。这些事每次都得调一次 GPT4 / Claude API,几万 token 一次,一年下来 token 账单能烧掉几十万。 你大概率想过:有没有办法把这种"重复 prom…
给 VLM 上一堂「物理感」补习课:arXiv 2609.23038 用「交互轨迹」让 AI 看懂动作前后的世界
arXiv 2609.23038(SpatialInteractor: Learning Spatial Reasoning through Interaction with the Observable Physical World,20260924 上传)做了一件对「具身智能 / VLM 空间推理」圈子影响很大的事…
让 AI 学会同时画画和配音:arXiv 2609.29816 用「模态锚定」把音视频联合 RL 后训练的成本砍到接近单模态
arXiv 2609.29816(AVGRPO: ModalityAnchored Decoupled Diffusion RL for Joint AudioVideo Generation,20260924 上传)做了一件对「音视频联合生成」模型圈影响很大的事——他们没有换 backbone、没有换 codec、没…
一次调用答多个对齐问题:arXiv 2609.29429 用 Jev 把 AI 对齐检测的成本砍到原来的 1/63
arXiv 2609.29429(Reinforcement Learning for Calibrated Decisions as a ZeroShot Detector of AI Alignment Failures,20260926 更新)把"对齐失败检测"这个赛道彻底换了一组接口——Jev 是 RLCD 范…
当 AI 自己给自己写规划器:三个 coding agent 在 28 个仿真环境里,用 9.8 万次试验打败了人类写的 TAMP 规划器
arXiv 2609.30233(Coding Agents for Generalized Task and Motion Planning Problems,20260926 更新)把"广义任务与运动规划"这个问题整个翻了过来——过去要靠工程师一个环境一个环境地写专属 TAMP planner,现在让 coding…
训练一个更"扛揍"的图像分类模型,只要加 5 行代码?—— Manifold Mixup 这个被低估的正则化技巧
你有没有这种感觉? 你训练了一个 ResNet,测试集准确率挺高。但给它加一点噪声或遮挡,准确率就崩了。同事说"这模型泛化不行",你委屈——训练集表现明明很完美。 问题不在数据量、不在模型规模、不在优化器——问题在网络没有学到"平滑的决策边界"。通俗讲:它把训练集背得太死了,稍微一变脸就认不出。 arXiv 1806.…
为什么医生不敢信 AI 诊断结果?—— 一篇被引 641 次的论文,把医疗 AI 的"信任门槛"说透了
你有没有这种感觉? 医院推了一款 AI 辅助诊断,准确率写着 95%。医生看了一眼说:"准确率是挺高。但它说这张 CT 是肺癌,我凭什么信?" 这不是医生挑剔。这是一个真实存在的法律 + 信任双重门槛——准确率再高,如果 AI 说不出"我为什么这么判断",它在欧盟就不能上线。 arXiv 1712.09923(Open…
把 GPT / LLaMA / PaLM 三大族谱装进同一张图——Minaee 等 2024 LLM 综述成为后续所有 LLM 论文的"方法论骨架"
你有没有这种感觉—— 2022 年 11 月 ChatGPT 发布之后,LLM 论文像雨后春笋——每个月都有新模型、新对齐算法、新 benchmark、新 prompt 技巧。你如果想入门 LLM,大概率会卡在同一个地方: "这么多东西,到底谁是谁?怎么串起来?" 光看名字就能把人整晕:GPT 系列、LLaMA 系列、…
一篇论文让视觉模型学会"看粗看细、看静看动、看 RGB 看深度"——微软 Florence 把多任务视觉玩出"通用基础模型"的范式
你有没有这种感觉—— 你每天刷到的"通用视觉基础模型"动辄 10 亿参数、刷 40+ benchmark SOTA。但你如果回到 2021 年,问那个时代的 CV 研究者:"能不能用一个模型同时搞定分类、检测、VQA、视频动作识别、深度估计?"——大概率会被笑:"你太贪心。" 那时候的现实是: CLIP(202101)…
Transformer 其实可以"同时想两件事":把两段文本叠加,一次前向生成两路续写
arXiv 2609.29845(Your Transformer Can Hold Two Thoughts at Once,20260926 更新)给出了一个反直觉的机制发现——Transformer 在 embedding 层天然支持"线性叠加":把两段独立文本的 token embedding 加权求和后送进模…
1024 个 AI Agent 同时干活,没人指挥:Agensh 把多 Agent 协作从"公司管理"变成"蜂群协议"
arXiv 2609.26781(Agensh,20260924 更新)做了一件反主流的事——把多 Agent 编排里那个"中心调度员"彻底干掉。 主流的 AutoGen / CrewAI / MetaGPT 都是"一个老板 + 一群小弟"的架构,所有任务派发、上下文传递、结果汇总都流经中心节点,于是规模上限被中心节点…
还在用 GAN 画人脸?——一篇 2020 年的综述把上百种 GAN 变体压成"六族分类",现在读懂它依然有用
你有没有这种感觉—— 你刷到一张"不存在的人"的高清人脸,肤纹毛孔清晰到能骗过人眼,身份证都敢用作参考图。你大概率以为这是 Stable Diffusion / FLUX 干的——因为现在 AI 画图早就是扩散模型的天下。 但 2020 年 1 月,香港中文大学(深圳)等团队发表的 GAN 综述 A Review on…
你训的模型为什么「越训越长」?——arXiv 2609.20511 找到 OPD 长度膨胀的真正元凶(v2 重写覆盖 v1)
arXiv 2609.20511(When EOS Tokens Disagree: Understanding Length Inflation in OnPolicy Distillation,Weitong Zhang 等,UNC Scientific ML,20260917 v1 / 30 页 / 12 图 /…
别让一个 AI 同时"当裁判又当运动员":IterSynth 把搜索 Agent 拆成两个人
arXiv 2609.29444(IterSynth,20260925 v1)做了一件反常识的事——它不再让一个 LLM Agent(智能体:能自主规划、调用工具、完成任务的 AI 系统)同时承担"规划"和"综合答案"两种能力,而是把它显式拆成两个角色:Planner(规划者)专门判断"还需要什么证据",Synthes…
你家 AI 的"记性"到底该查字典还是靠直觉?MemoryAthena 让模型自己决定
arXiv 2609.25853(MemoryAthena,20260922 v1)做了一件特别接地气的事——它不再让 AI 记忆系统在"死查表"和"凭记忆瞎编"之间二选一,而是训练一个 201M 参数的小路由器(参数量约 2 亿,相当于 GPT3 175B 的千分之一),让模型自己判断这一次该查表、还是让生成路径帮忙…
睡眠 AI 这件事的"祖师爷"回来了:2017 年那篇论文用 61 个 PSG 记录把整个赛道撬起来
arXiv 1707.03321(Chambon 等人 2017 年的开创性工作)是 PSG(多导睡眠图)信号分类领域的第一篇「不抽频谱图、不手工特征、端到端训练、用全 PSG 模态」的深度学习方案——它把「空间时间双卷积 + 30 秒窗口 + ±30 秒时序上下文」封装为统一网络,在 61 个公开 PSG 记录上达到…
"以图搜图"还能告诉你在图里哪个位置?这篇 2015 年的论文悄悄给整个行业打地基
arXiv 1511.05879(Tolias 等人 2015 年的开创性工作)做了一件工程界等了五年的事——让 CNN 在单次前向里同时产出「整图检索向量」+「物体定位框」两个输出,把"以图搜图"和"指出图里在哪"这两件原本割裂的事合并到同一条 pipeline 里。它靠一招"积分图 + maxpooling"扩展(…
机器人也开始"先想后做"了:X-Planner 把任务规划从"塞进 token 序列"里救了出来
arXiv 2609.25187(XPlanner,XSquareRobot 出品,20260921 v1)把具身智能里的"任务规划"拆成两个并行接口——一个吐离散事件状态(人类能读懂、出错能定位),一个吐跨 Transformer 深度的潜变量轨迹(语义不漂、推理不贵)。在 BERTScoreF1 / JudgeOv…
压缩大模型别再"一刀切"了:GeoPair 教模型按"长相相似度"找搭子,跨层共享不破坏精度
arXiv 2609.25963(GeoPair,20260922 v1)是一套免训练(trainingfree)的大模型压缩框架——它不再按"挨得近的层就该共享参数"这种粗暴规则配对,而是先算每一层自己的"长相"(即权重/激活的主子空间结构),把"长相够像"的层配成一对再共享字典(dictionary)做低秩分解。a…