解读
502 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
ChatGPT 上线一个月,Twitter 上 10,732 条推文告诉你:用户是真的在用它干这些事
2022 年 11 月 ChatGPT 公开发布那天,媒体把它同时喊成"教育终结者"和"创造力放大器"。开发者社区、SaaS 厂商、教育机构都在猜:真实使用形态到底是什么?是真革命,还是又一轮 hype? 一个月后——2022 年 12 月——一份 arXiv 预印本(2212.05856)给了第一份大规模真实用户数据…
当 AI 还在「画鬼打架」时,2015 年这篇论文已经用统计把"骗 GAN 的游戏"换掉了
2014 年底,一个叫 GAN 的新玩法横空出世——让两个神经网络"对着干":一个画假图,一个当判官,判官越严格,画师就越厉害。听起来很燃,但工程师上手两周就会发现:这东西根本训不稳。 模式坍塌(画师只会画同一种图)、训练震荡(判官画师来回拉扯)、判别器饱和(判官太强画师直接放弃学)——这些都是 2015 年 AI 圈…
你以为"上传图片搜相似图"是只读操作——2026 这篇论文告诉你,攻击者能用它偷走你整个图库
如果你做 RAG 应用、做过企业内部知识库搜索、或者用过任何"上传图、返回相似图"的产品形态,你大概率默认一件事: "我上传的是查询图,系统返回的是候选图——这是只读操作,我自己的图库没暴露。" 这个直觉是错的。 2026 年 10 月这篇论文 Walking the Embedding Space(工作名)/ Dat…
你让 Sora 帮你"煎蛋"——它端出来的可能是完美的空盘子
如果你是做具身 AI 或机器人研究的工程师,你大概率听过这种话:"Sora / Wan / Kling 这些视频生成模型现在就是世界模拟器,给一张图+一个动作,它就能生成未来视频。" 这话听着很性感——意味着我们可以用视频生成模型来合成机器人训练数据、预演自动驾驶路径、给 VLM 模拟一个练习环境。 但你仔细想,会发现…
AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4%(v2 重写覆盖 v1)
v1 主要问题(自我反思棒 1003 标记):① section 编号从四直接跳到六(漏五);② 缺独立 ⚠️ 工程核查(Jay 核查节)段;③ 数字提取率较低(4 个可锚数字 / 7 个 abstractlevel 数字点 = ~57%);④ 「5 条工程坑」压缩在文末一段,未升级到独立节;⑤ 边界声明偏薄。 现有金…
LoRA 变体圈最大的"皇帝新衣":PiSSA、DoRA 报告的 +10%~+37% 提升,可能只是学习率没调对
你做 LLM 微调时,是不是被 PiSSA、DoRA、AdaLoRA 这些"LoRA 增强变体"搞得选择困难?arXiv 2602.04998 给你一盆冷水——这些变体相对于 Vanilla LoRA 报告的"惊人提升"(有的 +10%,有的 +37%),很可能只是因为对比时用了固定或过窄的学习率范围。当学习率被认真调…
数学家遇到 AI:6 年没解的猜想,被一个"数学研究 Agent" 6 小时拿下——但别急着说 AI 取代数学家
一个困扰数学家 6 年的猜想——"多元独立多项式的下界长什么样"——被一组研究者用一个"搭建在 Gemini Deep Think 之上的数学研究 Agent"加上 Lean 形式化复核,闭环了。听起来像 AI 接管数学的剧本,但真相比这更微妙:Agent 负责生成证明草稿,Lean 负责形式化兜底,人类负责最后的边界…
你的 RAG 系统是不是太重了?——Amazon Science 说:扔掉向量库,只靠关键词搜索就够用
"query → embedding → 向量库 ANN 检索 topk → prompt → answer"——这是过去三年所有 AI 工程师闭着眼都能写出的 RAG 默认公式。但如果你正维护着一个向量库(Pinecone、Qdrant、Milvus、pgvector 任选其一),花了钱、花了人、每天为索引重建和版本…
为什么你团队的单一大模型永远不够用?——一篇综述说清楚「集成智能体」到底是怎么回事
你有没有过这种经历:团队花重金买了最强的大模型,想让一个 LLM 把客服问答、内部文档检索、看图、看报表全部搞定。结果呢?——文档查不到最新版本、看图时答错细节、长流程里忘记三步前说过什么、复杂任务中途跑偏。最后所有人的反应都是:"这 AI 不太行啊。" 不是 AI 不行,是"单体 LLM"这件事在结构上就不够。202…
深度学习里的「选哪个激活函数」之争,被这篇 7 年前的论文一锤定音 ⚖️
你有没有过这种困惑—— 刚开始学深度学习的时候,老师说「用 ReLU」。等你去看论文,Swish / GELU / Mish / SELU / ELU 一堆新名字扑面而来,每个都说自己在 ImageNet 上刷了新高。你换一个试试,结果——收敛速度变慢、显存涨 30%、还时不时训崩。 更让你崩溃的是—— 研究者写了 2…
今天每张「文字生图」都欠 2016 年这篇论文一笔债 —— 它教会 AI「画对了」≠「画得好」
你有没有想过—— 为什么 2023 年你给 Midjourney 输入「一只黄肚黑头的鸟」,它真的能画出一只「黄肚黑头」的鸟,而不是一只「好看的鸟」? 更让你意外的是—— 这件事不是 GPT4 时代才发明的。2016 年就有人挖了第一锹土,论文只有 8 页,却被引 3459 次。 arXiv 1605.05396(Re…
让 LLM agent 在改任务 + 跨目录复用——2026 EVOKE 用"多目标诱导排序"唤起 pref-trained 的世界知识(v2 重写覆盖 v1)
arXiv 2609.38334(Eliciting World Knowledge in Agents for Transferable DecisionMaking · Yuhan Guo 等 · Shanghai Jiaotong U + Eastern IT Ningbo + Zhongguancun Acad…
你以为 RAG 只是"检索-增强-生成"?——2026 这篇综述用四轴坐标告诉你:现代 RAG 的真正战场在哪
如果你是 AI 产品经理,你大概率被 RAG(RetrievalAugmented Generation,"检索增强生成")这三个字"教育"过很多次了——给大模型接一个外挂知识库,让它"开卷考试",答得更准、更新更快。 但每次你问工程师"咱们的 RAG 系统到底哪里不行",他总给你一堆名词:检索效率不行、有注入风险、对…
你看 benchmark 总分选 LLM,可能正在被骗——2026 这篇论文把"泛化能力"从单分换到"多轴稳定性",发现主流模型全都不稳定
你有没有遇到过这种情况: 同一个问题,你问 ChatGPT:"北京到上海怎么走?"——回答一套。 换个说法:"上海到北京多远?"——回答完全不同的另一套。 或者反过来:你问"番茄炒蛋要不要放糖?"——AI 很笃定地答"不要"。 换个说法:"做番茄炒蛋时糖是不是关键调料?"——AI 又很笃定地答"是"。 同一份能力,两种…
让机器人"现场自己学"——2026 这篇论文:不用重训也能让机器人开门搬箱子,秘密是让 LLM 自己改"奖励程序"
你有没有想过: 家里的机器人会走、会搬箱子,但你要它"开门"——它不会;你要它"把瓶子放到桌上"——它不会;你要它"扫帚立起来"——它也不会。 按老办法:每加一个新任务,就重新收集数据、重新训练策略、重新调奖励。可对家庭服务、灾后、太空这些"没有大规模遥操数据"的场景来说,这条路几乎走不通——每次新任务都意味着几周甚至…
大模型推理太贵、显存不够?——Mamba-3 把"成本砍半、质量持平"这件事做出来了
你有没有这种体验: 跟 ChatGPT 聊一份 100 页的合同,它读到第 30 页就开始"忘事"——前面说的细节它记不住了,得你反复提醒。 或者用 Copilot 补全一段长代码,补到第 500 行它就慢得像老牛拉车——GPU 显存告急,价格账单吓人。 为什么?因为主流大模型(Transformer 架构)的推理成本…
当年让所有人"画猫画狗"的 GAN,现在走到哪一步了?——2019 年这篇综述,给整个 GAN 时代画了一张完整的「家族地图」
你有没有想过: 2019 年那会儿,你刷到一张"不存在的人脸"会惊掉下巴——那种像真人一模一样、但其实完全是 AI 画的图,背后就是 GAN(生成对抗网络)在出力。 可 GAN 到底有多少种变体?为什么同一篇论文里会冒出 DCGAN、WGAN、CycleGAN、StyleGAN、BigGAN 一堆名字?搞视觉的人怎么知…
你以为写代码就是改代码?2026 这篇 66 页论文说:还得跑、得点、得截图,才算"做完一个 bug"
想象一下这个场景: 你让 AI agent 修一个 bug。代码改完,你按 PRD 走验收——结果 bug 还在运行时 UI 里,得让用户点开某个菜单才能复现。代码 diff 看着对,但软件实际跑起来就是错的。 这场景每个用过代码 agent 的人都撞过。问题是:没人专门测过这条"改代码 + 跑命令 + 点 UI + …
你以为 VLM 评判员真的在"读文字"——2026 这篇论文说:塞张图它就漂分,漂的方向还跟图的内容无关
想象一下这个场景: 你做情感分类任务,要评一句话是「字面义」还是「比喻义」。prompt 里写:"忽略图像,只看文字做判断"。然后 VLM(GPT4V、Gemini、QwenVL 这类能看图的模型)拿到一句 "he was boiling with anger",拿到一张"沸腾的水壶"图,答:literal(字面)。 …
你让 AI 帮你装软件、删文件——它一句话就把系统搞崩了?这篇 2026 的论文在「模型-沙箱之间」加了一道拦截门
想象一下这个场景: 你让一个 AI agent 帮你跑 pip install opencvpython,AI 一秒钟答:「好的」。但它实际执行的命令里漏掉了版本号,把你正在跑的 PyTorch 环境依赖给污染了——接着每一条后续命令都报莫名其妙的错。 更糟的是:AI 下一步本来可以生成"正确"命令救场,但环境已经被它…
AI 训练成绩一直在涨,但真实水平没变——这篇论文找到了元凶,还顺手开了一张"作弊诊断单"
你有没有这种感觉 🤖? 你团队做了一个 selfevolving 的 AI agent(让 AI 自己出题、自己答题、自己评分、循环训练)。监控面板上 reward 曲线一路向上,老板很开心、PR 准备发…… 但你私下拿真实 benchmark 一测——分数没怎么变。 你反复复核数据、调超参、把训练步数翻倍——rewa…
大模型真的越大越好吗?这篇论文把"省钱公式"算出来了——Loop × MoE 的第一张联合缩放图
你有没有这种感觉 🤖? 你做 LLM 训练,老板批了 100 万美金算力预算。你在两个方案之间来回翻:方案 A 是用 2× 参数的标准 dense 模型(路线成熟,业界用过);方案 B 是参数减半、但每个 token 让模型"多想几遍"的循环模型(looped),加上"每次只激活部分专家"的 MoE(路线前沿,工程坑多…
RAG 和 Elasticsearch 到底谁强?arXiv 2609.37749 用「等价类」做桥,把"返回列表 vs 返回段落"拉到可对比坐标系(v2 重写覆盖 v1)
做信息检索的人长期被一个奇怪问题折磨:关键词检索(Elasticsearch / BM25 / Confluence Search)返回"文档列表",语义检索(RAG、ChatGPT 联网)返回"一段自然语言答案"——输出根本不在同一个空间里,于是谁更好永远只能靠"老板凭感觉"或"LLM 当评委"打嘴仗。arXiv 2…
你买再多 H100 也救不了"KV 塞不下"——直到这篇论文把 KV Cache 变成"一级资源"
你有没有这种感觉 🤖? 你在公司部署 LLM 服务,GPU 越来越贵,但显存还是不够用。你打开 vLLM / SGLang 的监控,看见 KV Cache 占用率长期在 85% 以上——离 OOM(内存溢出)只有一步之遥。你咬牙又下单了 32 张 H100,结果一周后又满了。 更气人的是:你看监控发现,60% 的请求 …
别急着上多 Agent——3 年前这篇综述把「4 个隐藏陷阱 + 6 条血泪建议」摆到一张桌子上
你有没有这种感觉 🤖? 你刚听说"多 Agent 是 AI 应用的未来"——一个 Agent 干不完,就让十个 Agent 协作。你打开 AutoGen / MetaGPT / ChatDev 框架跑 demo,效果很赞。但真要上生产,问题接二连三出现: 三个 Agent 一起做同一件事,为什么 token 烧了 3 …
"ChatGPT 不是全部"——2023 年这篇 360 次引用的综述,把生成式 AI 全景图拼了出来
你打开任何一个 AI 公众号,几乎都被这些词刷屏过: ChatGPT、GPT4、Gemini、Claude Stable Diffusion、Midjourney、DALLE Sora、Phenaki、AudioLM、AlphaTensor 但你真正想问的是——"它们到底都能干什么、不能干什么?区别在哪?" 答案藏在 …
你看到的每个"AI 安全声明"——都该被这份 274 页报告里的 6 个机制验证一遍
你打开任何一家大模型公司的产品页,几乎都会看到类似的话: "我们的模型经过严格的安全测试、公平性评估、隐私保护……" 听起来很安心。但你真正想追问的是—— "你说了,那我能验吗?" 能验和不能验,差别有多大?想象一个对照实验: 你买了一个宣称"零添加"的酸奶,配料表写在瓶身——你看得见。 你买了一个宣称"零幻觉"的 A…
别让机器人只靠眼睛走路——OmniEcho 给具身智能体加上了"用耳朵看世界"的能力(v2 重写覆盖 v1)
arXiv 2609.23407(OmniEcho,202609 北大等团队 / 30 页 / 12 图 / 6 表)做了一件反主流的事——把"具身智能体需要空间维度听声音"从"想法"拉回到"完整闭环方案"。当前具身智能体的"听声辨位"能力比人类落后一个范式:感知层多用 mono 音频(只保留语义,丢方向)+ 评测层缺…
你以为 AI 看图只看「是什么」——2014 年这篇论文教它看「感受」
想象一下这个场景: 你在做一个旅游 App,想给用户推荐"适合发朋友圈的目的地"。给算法工程师说:"帮我筛出'温馨浪漫'的照片"。他大概率会卡壳—— 「温馨浪漫」怎么变成可计算的信号? 10 年前,这道题没有标准答案。2014 年之前,AI 看图只能告诉你"图里有什么"——一棵树、一片海、一个人——但说不出"这张图传递…
你手机每天替你做的那个决定——1999 年这篇论文早就写好了代码
想象一下这个场景: 下午三点,你正在写一份季度汇报,写到第二段。手机在桌上震了一下,屏幕亮起一个微信红点。你瞄了一眼——是某个同事在群里问"今晚吃啥",还有一条快递通知、一条微博推送、一封老板的邮件。 你大概率会:忽略微信、看一眼微博、不动快递、把老板的邮件标记为稍后处理——然后继续写汇报。 但你有没有想过——iOS …