解读
502 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
标一行就把 DPO 数据准备时间砍掉 52%?这套「标错位置就重写」的标注神器悄悄上线了(v2 重写版)
arXiv 2609.24983(onPanda, 20260923 v1)是一套把"AI 标错了整段重写"变成"找到第一个错字 → 替换 → 继续往下写"循环的标注工具——保留模型自己生成的 90% token,只让人改一行字,顺手还能免费产出精确到 token 的偏好对,论文自报中位标注时间下降 52%(N=12 …
AI 导师比肩人类专家,成本仅 1/918:StudentBench 用 2,383 人真实 GRE 数据说话
arXiv 2609.28470(StudentBench,Handshake AI Research 团队,20260924 更新)做了第一份"AI 能不能真的教人"的工程级对照实验——招募 2,383 名真实参与者做 GRE 题目、随机分配到 AI tutoring / 人类专家 tutoring / 无 tuto…
Agent 的"考前临时抱佛脚"比"平时记笔记"更管用:JitMem 把记忆系统整个翻了过来
arXiv 2609.27334(JustinTime Memory / JitMem,20260923 提交)做了一件反常识的事——它把 Agent 的"记忆系统"从"任务刚结束就写摘要"搬到"任务来了再合成":保留原始轨迹不压缩,等到 query 来了,由一个 learned curator 实时合成"为这次任务量…
把 GPT-3 "塞 32 个例子 AI 就能学会" 这件事讲清楚的中文综述:为什么 1170 次引用都说它必读
arXiv 2301.00234 (Dong et al. 202212 v1,202410 v6)是清华 + 北大 + 苏州大学 + 微软亚研 14 位作者合著、历经六年八版的 incontext learning (ICL)综述 — 它把 "在 prompt 里塞几个例子,模型就能不更新权重地学会新任务" 这件事,…
当 AI 第一次学会"看图说话":m-RNN 把 1285 次引用的工作,怎样悄悄奠定了今天所有 VLM 的地基
arXiv 1412.6632(mRNN)是 2014 年百度研究院 + UCLA 的 Mao 等人写的一篇 56 页论文 —— 它第一次让一个神经网络端到端地"看着图写字",而不是先把图里的物体都标出来、再套模板写出句子。今天 GPT4V、GPT5、LLaVA、QwenVL 看见图片就能和你聊天,这条技术线的第一锹土…
Gemini 报告把多模态从「拼接」变成「原生」——这是 2023 年底 AI 圈集体转向多模态 LLM 的标志性事件
arXiv 2312.11805 (Gemini 家族技术报告) 是 Google DeepMind 在 2023 年 12 月发布的 60+ 页技术报告,介绍 Ultra / Pro / Nano 三档规模、文本+图像+音频+视频+代码原生多模态的密集 Decoderonly Transformer。其旗舰模型 Ge…
5,000 小时人类玩家录屏 + 47 个 AI 模型对打 100 万次:这套「游戏 AI 高考」凭什么改变一切
arXiv 2609.25001(GameHorizon Suite)是第一份把"AI 打游戏到底会什么"做成公开标准化考试的工程级 benchmark——用 21 款当代 3A 大作、5,000 小时人类专家录屏、47 个多模态 AI 模型 × 100 万次推理的离线 + 在线双轨评测,告诉你"今天的 AI 在游戏里…
一群开源极客,把 80+ 种编程语言"喂"给了一个 AI——然后 GitHub Copilot 第一次有了真正能打的开源对手
你有没有用过 AI 写代码? 如果你 2023 年用 GitHub Copilot,你用的是 OpenAI 的闭源模型——背后跑啥、长啥样、训练数据哪来的,统统不知道。 如果你当时想自己搭一个"代码助手",开源社区能选的模型没一个能打——要么只支持几种语言,要么质量差 Copilot 几条街。 然后 2023 年 5 …
54 亿参数的小模型,靠"翻字典"答赢了 5400 亿的大模型——这件事,为什么影响每个人?
你有没有想过 🤔:你手机里的 AI 助手回答"昨天欧冠决赛谁赢了"这件事,它真的"知道"吗? 如果你用的是 2023 年之前的纯参数化大模型(比如 GPT3、PaLM 540B),答案是——它不知道。它只是从训练数据里"猜"出一个看似合理的名字。 如果装的是另一套 2022 年的架构(Atlas),答案是——它不猜,它…
你训的 DPO 模型为什么"答非所问越来越像但质量越来越差"?——arXiv 2609.19144 给出了范式级解药
如果你是做 LLM 后训练(posttraining)的工程师,大概率遇到过这种崩溃: 你用一批人类偏好数据训 DPO(一种主流的"让模型按人类偏好学"的算法),训练 loss 在下降、reward 在涨、看着挺美——可等你把训好的模型拿去做用户测试,发现输出确实越来越像偏好数据的"风格",但实际质量、事实正确性、甚至…
LLM 说自己"70% 把握"到底能不能信?——arXiv 2609.17708 用历史成绩单给它打分
你有没有被 LLM 的"自信"坑过? 让大模型帮你写一段 SQL、规划一次出差、做一道数学题,它可能斩钉截铁地告诉你"答案就是 X"——结果一跑就报错。让它解释一段代码,它胸有成竹地说"这段逻辑没问题",但实际上有个隐藏的边界条件没处理。 更尴尬的是,当你追问它"你有多大把握?",它会说"我有 80% 把握"——可这个…
设计师还在凭感觉调色?——arXiv 2609.20816 给一个 hex 字符串就能让 AI 精准上色,T2I 与编辑同时涨 85% / 28%
你有没有这种感觉:设计稿改到第 18 版,客户一句"蓝色再深一点"就要把所有图层重做一遍;或者你用 AI 出图,告诉它"蓝色",出来的可能是天蓝、宝蓝、普鲁士蓝、电光蓝——怎么都"差那么一点"? 这件事在专业设计里叫"颜色意图到落地"的精度问题。在印刷 / 品牌 VI / UI 设计里,设计师要的不是"差不多的蓝",而…
高德地图把推荐系统升级了:同样 60ms 延迟,点得多 2.4%——arXiv 2609.21346 怎么做到的
你有没有这种感觉:同一个外卖 App、同一个刷脸门禁,底层那个"猜你想看"的模型越做越大,延迟却越压越紧,最后只能在"算力"和"猜得准"之间反复二选一? 这件事在工业界叫"推荐系统的算力账"。在国内推荐场景里,60 毫秒是一个硬指标——超过这条线,用户还没看到结果就划走了。但模型要更聪明,就得让更多"专家"一起投票,这…
表格数据也能搞"基础模型"了?——arXiv 2609.17488 用一个模型同时拿下预测 + 因果发现,3 大基准全 SOTA
你有没有这种感觉:表格数据是 AI 落地里"最被低估"的战场——金融风控要预测,医疗诊断要找因果,工业质检要做归因,业务侧维护着 XGBoost、LightGBM、CatBoost 一堆专用模型,每个数据集单独训、单独调、单独部署,成本高到飞起。 2026 年 9 月来自 arXiv 2609.17488(LimiX2…
你家 AI Agent 真能放心让它"帮你付款"吗?——arXiv 2609.22076 用 22.6 万次评测告诉你,加一层"通行证"违规收款直接清零
你有没有这种感觉:Agent 助手越来越能干,能订外卖、能买机票、能调 API 付费额度——但你真的敢让它替你刷信用卡吗? 2026 年 9 月来自 arXiv 2609.22076(APort Vault) 的工作把这件事端到了台面上:他们复盘了一场公开 CTF 中人类对真实支付 Agent 写的 4,371 次攻击…
为什么你的 LLM RLHF 训练总是"奖励不涨、loss 震荡"?——arXiv 2609.18708 找到了 PPO Critic 的隐藏 bug
如果你做过 LLM 的 RLHF 后训练,大概率遇到过这种崩溃:训练 loss 看起来在下降,但模型在 reward model 上的得分纹丝不动、甚至反降;PPO 的 clip 目标在剧烈震荡;你开始怀疑 reward model 是不是有问题、KL 惩罚是不是太重——但都没找到原因。 你可能漏掉了一个 PPO 训练…
你蒸馏的"小模型"为什么总爱犯和老师一样的错?——arXiv 2609.21619 找到方法,只用一半信号就能反超完整蒸馏
你有没有这种感觉:让大模型带小模型,小模型越练越像老师,包括老师的那些"小毛病"? 比如让 GPT4 当老师教 7B 学生做数学题,老师偶尔会把"显然"挂在嘴边、跳过几步验证。学生模型一开始确实学到了推理能力,但用着用着你也发现:它也开始喜欢说"显然"了,也学会了跳过验证——这些老师自己的坏习惯,蒸馏过程中悄悄被一起传…
AI 助手跟你聊到第 7 次就翻脸?——arXiv 2603.07670 把「Agent 记忆」从玄学拉成了一门工程学科
你大概率有过这种经历:跟 AI 助手第一次对话时它温温柔柔、记性超好——知道你不吃辣、项目 deadline 是下周五、讨厌用 emoji;等到第 7 次对话,它把这些全忘了,又开始用 emoji、推荐川菜、问你 deadline 是什么时候。 你以为它"不听话"了。 arXiv 2603.07670(Memory f…
AI Agent 越来越"会做事"了,为啥生产里还是翻车?——arXiv 2602.16666 用 12 个指标把"靠谱"这事儿拆明白
你有没有这种感觉:Agent 跑 demo 时像天才,一上生产就开始掉链子——同一道题问两次,答案不一样;用户换个说法,Agent 跑偏;偶尔还来个"误删数据库"或者把 prompt 里的密钥吐到日志里。 你以为是模型不够大。arXiv 2602.16666(AI Agent Reliability)说,问题根本不在模…
为什么 arXiv 1511.02136 这篇"图上的扩散卷积",是 GCN 之前图深度学习的关键奠基——而且你今天用的所有 GNN 都欠它一笔
你有没有这种感觉 🕸️? 你做推荐系统 / 知识图谱 / 社交网络分析,想把图数据喂给神经网络——但 CNN 处理不了"节点数不固定 + 邻居顺序任意 + 全局结构无规律"的图。 你去翻 paper,发现 GCN(Graph Convolutional Network)似乎是最经典的图神经网络。 你想搞清楚"GCN 是…
当 GPT-4 去做美国医生执照考试——为什么 arXiv 2303.13375 这篇"让通用大模型上医学考场"的论文,是 2023 年整个医疗 AI 行业的转折点
你有没有这种感觉 🩺? 2023 年初,医疗 AI 圈都在说"通用大模型不懂医学,必须做专才微调"。 Google 花大价钱做了 MedPaLM——基于 540B 参数的 FlanPaLM 做医学微调 + 510 条专家示例 prompt + 多次采样投票改写,专门刷医学题。 大家都以为"医疗 AI 必须这么干"。 然…
机器人学"左转 30°"和"右转 60°"分不清?——arXiv 2609.18487 用「物理秩一致性」给动作分词器上了道新保险
你有没有见过这种机器人 demo:仿真里能完美抓杯子,放到真机却「学了但学错方向」——该往左抓的往右抓,该慢一点的猛冲? 这种"看着像学会了,实际上系统性偏差"的坑,2026 年具身智能圈几乎每个团队都在踩。根因藏在 VLA(VisionLanguageAction)模型最底层的那一步——把连续动作切成离散 token…
长上下文 AI 的「显存税」怎么压到 1/4?——DeepSeek-V4.1-Flash 让百万 token 上下文不再是大公司的特权
你有没有被这种账单刺到过:跑一个能读一整本书的 AI Agent,光是「记住你说的每一句话」这件事,就要吃掉好几块 GPU 的显存? 这就是 2026 年 AI Infra 圈最头疼的现实:长上下文 = 长账本。要让一个 Agent 真正"陪你跑一周的工作",它必须记住几万到几百万字的对话历史、文档片段、工具调用记录—…
当 AI 助手说"我懂你",凭什么信?——arXiv 2609.17496 用「带隐藏动机的剧本」造出社会推理的真值
你有没有遇到过这种尴尬瞬间:同事说"你这个方案不错啊",你不确定他是在真夸,还是在反讽? 这种"揣摩他人真实意图"的能力,叫社会推理(social reasoning),被公认为人类智力的最后几个高地之一。但 LLM 助手能不能做这件事?能不能评测?——这才是 2026 年真正的难题:情境主观、答案无客观真值,怎么测"…
你公司的 RAG 检索越来越难调?——arXiv 2609.19656 让搜索索引自己"长出"最优形态
你有没有遇到过这种崩溃瞬间:花了三周调好的 RAG 检索,业务方换了一份合同模板,准确率一夜回到解放前? 这种"调好就崩、崩了重调"的人肉循环,在 2026 年的 RAG、Search Agent、Agent Memory 三个赛道几乎每天都在上演。问题出在哪?出在索引的"形状"被人为写死了——而最优形状本应该跟着语料…
Agent 训练「SFT → RL」管线里那个隐藏的开关——arXiv 2609.20715 改一行 loss mask 就拿 +4.2 pp
做 Agent 后训练的工程师这两年大概都被这个现象折磨过 😤: 你用专家轨迹做 SFT 初始化策略,训完看着不错,agent 在分布内任务上 80% pass@1。 接上 GRPO 跑 RL 微调,第一轮就崩了—— 熵塌缩飞快,策略瞬间窄化到「只会做 SFT 见过的事」; 碰到分布外状态,agent 完全盲试,pas…
你公司花了 1.3M A100 小时训了一个 50B 的"领域 LLM",结果 2024 年的开源 7B 微调一下就追上了——但 arXiv 2303.17564 的方法论仍然价值连城
你有没有这种感觉 🤖? 你老板说:"我们做金融/医疗/法律的,GPT4 太贵,开源 7B 效果差——干脆自训一个领域 LLM。" 你点头。3 个月后,团队汇报:"我们花了 1.3M A100GPUhour、53 天、$5M+ 算力成本,训出一个 50B 的领域模型,金融任务上打败了 GPT3 175B!" 老板鼓掌。但…
你花了三个月训练的图像分类模型,遇到一个训练集里从没出现过的物种,吐出"99% 是猫"——这种灾难其实有五个名字,而这篇 arXiv 2110.11334 告诉你:它们其实是同一件事
你有没有遇到过这种事 🤖? 你在生产环境部署了一个训练了几个月的图像分类模型——自动驾驶摄像头 / 工业质检线 / 推荐系统 / 内容审核——上线第一天一切正常。 第二周遇到一个训练集里完全没有的样本:一只从没见过的动物、一颗新品类零件、一个完全陌生的用户行为模式。 模型毫无警觉地吐出一个高置信预测:"99% 是猫"。…
"参数越大越好"是个谎言——arXiv 2305.10403 PaLM 2 用三个维度证明:训练范式比堆参数更重要,今天每个开源 LLM 都沿用这条路线
你有没有这种感觉 🤖? 2023 年初,业界普遍相信一句话:"模型越大,效果越好"。GPT4、PaLM、Claude 都在堆参数——540B、1.8T、10T token 数据集。 你心想:"小模型没机会吧?" 然后你看到 Llama 2、Mistral、Qwen、DeepSeek 一波接一波——7B、13B、70B …
你公司那条"灵魂 prompt"——很可能只是某次午饭时某个产品经理随手写的。这篇 arXiv 2211.01910 告诉你:机器写的 prompt 已经在 19/24 个任务上超过人类了
你有没有这种感觉 🤖? 你打开 ChatGPT / Claude / 内部 LLM 平台,信心满满写下一段精心打磨的 prompt——"请你作为一个资深分析师,从以下三个维度……"——结果输出要么"看起来对但答非所问",要么"废话一堆但关键点没说"。 你心想:"是我的 prompt 不够好吗?换一种说法试试?" 换完三…