解读
502 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
传统 RAG 找不到答案?2026 这篇论文说:那是因为你需要的不是"找材料",而是"算出材料"
你有没有这种经历:问公司财务系统"过去六个月哪个月的运营利润率最高",传统的 RAG(检索增强生成)把相关行翻出来给你,结果你还是要自己算。其实你问的不是"哪个 chunk 含答案",而是"基于已有数据,应该查哪些记录、用什么公式、保留哪些中间结果、什么时候算够了"。换句话说,context engineering(上…
把"被骗"变成"反杀"——2026 这篇论文用 RAG 让 AI 写出能真的骗回去的剧本
你有没有想过:黑客用勒索软件、键盘记录器、信息窃取工具攻击你的时候,为什么你只能"发现 → 隔离 → 删除"?这一套被动流程最大的浪费是——你明明抓到了一只攻击者,却没能趁机布下陷阱让他踩雷。Lasse B. Strand 等人在 arXiv 2610.12415 里提了一个思路:用 RAG(检索增强生成)让 AI 离…
你家 MLLM 的"音视频描述"分数可能是假的——2026 这篇 NeurIPS 论文,把"整段打分"拆成"逐原子单元打分"
arXiv 2610.12458(OmniCapBench)是 2026 年 10 月公开、NeurIPS 2026 接收的 benchmark 论文 —— 它把多模态大模型(MLLM)的"音视频描述"评测,从依赖不稳定 LLM 判官的整段打分,重写为对 786 个视频、跨「实体指代 / 视觉镜头 / 音频事件」三轨的…
你玩过的 3D 场景全是"死"的——2026 这篇论文,把"会动的 3D 循环世界"做成了无掩码、可任意走入的 cinemagraph
arXiv 2610.12461(OuroWorld)是 2026 年 10 月公开的工作 —— 它把任一 3D Gaussian Splatting 静态场景无掩码地提升为「任意视角无缝循环」的 3D 动态影像。先用 VLM 推断合理动态,再用视频模型合成参考视频,最后用「Fourier 级数变形场(构造性保证循环)…
机器人策略练到 99% 不算数,真机那一刻才会"原形毕露"——arXiv 2607.04434 把仿真和真机焊在了一起
如果你做过机器人策略训练,2026 年你大概率被这件事折磨过—— 你在 Isaac Sim 里把策略训到了 99% 成功率,搬上真机直接腰斩到 40%。不是你的代码有问题,是仿真和真机之间那道隐形的墙一直没被系统量化过。 更头疼的是:业内根本没有统一基准。有的用 RLBench、有的用 LIBERO、有的干脆自造场景—…
「我们到底要不要上 LLM Agent?」——arXiv 2505.16120 这篇综述,给你一张行业选型地图
过去 18 个月,几乎每个公司的技术规划会上都出现过这句话:"我们要不要上 LLM Agent?" 然后散会——因为没人能回答这三个问题: 1. 我们的场景到底跑得通吗?是 demo,还是生产级? 2. 真正卡脖子的工程问题是延迟、不确定性、评估、还是安全? 3. 是先做客服、先做代码助手、先做金融、还是先做医疗? a…
LLM 长推理"塞不下又算不动"怎么办?InftyThink 把推理从一条长河切成短段+摘要,ICLR 2026 收录的真实解法
如果你用 DeepSeekR1、Qwen3、QwQ 这些"会思考"的模型跑过数学题或代码生成,你大概率撞过这三堵墙: 1. 算力随推理长度二次增长——推理链越长,GPU 显存和延迟被迅速吃光。 2. 被最大上下文长度锁死——32K、200K 都有顶,模型必须在中途截断。 3. 超出预训练窗口后掉点——不只是放不下,而是…
把 Transformer 的"加号残差"换成"跨层 attention",48B 的 Kimi Linear 居然真的把它训起来了——Attention Residuals 这事比你想象的更工程
如果你用过 LLaMA、Qwen、Kimi,或者你自己训过一个超过 70 亿参数的模型,你大概率踩过一个"玄学坑":模型越深,效果不一定越好。很多团队甚至发现,从 32 层加到 64 层,验证集 perplexity 不降反升,loss 出现平台甚至掉点。 这事在 2023 年之前还有过几次小范围讨论。但真正把锅摆到台…
AI Agent 怎么"越用越聪明"?——2026 这篇 ACL 综述,把所有记忆设计画在同一张图上
arXiv 2605.06716(From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms, ACL 2026 Findings)是一作 Lin Hongzhan 的综述 —— 它把近两年 LLM Agent…
AI 工程师都在糊"胶水代码"——2026 这篇论文,把"Agent 周边那一坨"变成了一份"可审阅的文档"
arXiv 2603.25723(NaturalLanguage Agent Harnesses, NLAH)是 Linyue Pan 等 2026 年 3 月发表的工作 —— 它把 AI Agent 周围那一坨"胶水代码"(怎么组织上下文、怎么路由工具、怎么校验、怎么交接状态)从耦合度极高的 Python 文件里拆出…
企业 RAG 别再"凭直觉调"——2026 这篇论文把"调参"升级成"对话式调优",准确率 77% 时成本只要 58%
如果你们公司在用 RAG(RetrievalAugmented Generation)搭企业内部问答——无论是客服知识库、医疗病历检索、还是多跳推理 QA——你大概率会撞到同一个场景:调一晚上 RAG,chunk size 调到 256 还是 512、embedding 模型换不换、reranker 选哪个、topk …
后训练 LLM 别再"瞎卷"——2026 这篇论文教 RL 工程师用 verifier 当"教练",让小模型也能"刷难题"
如果你们团队正在做 LLM 后训练(posttraining / RLHF / RLAIF / 蒸馏 / GRPO 变体)——让 Qwen30.6B、Qwen31.7B 这种小模型去刷 code / math 任务——你大概率会遇到一个让人抓狂的现象:模型在前几次训练时 pass@k 涨得很好,但到了训练中后期就开始左…
一款 AI 模型发布 7 天后,GitHub 上发生了什么?——一篇 2026 论文用 2,170 个项目告诉你答案
2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了一个叫 Jev 的快速决策模型(走"零样本能力 + 一次前向决策"路线,定位介于传统监督分类器和 LLM 之间)。7 天后,GitHub 上多了 1,865 个新仓库、305 个已有项目集成、43,750 stars。听起来是个"爆款叙事"对吧…
你公司刚装上的「AI 工具插件」,可能是别人安插的「间谍」——一篇 DSN 2026 论文,第一次把这件事的全貌摆到桌面上
MCP(全称 Model Context Protocol,你可以把它想成"AI 世界的 USBC 接口")这两年被吹成"Agent 时代的统一标准",Claude Desktop、Cursor、Cline、OpenAI 工具链全都接进来了。但 2026 年 DSN 顶会这篇论文(arXiv 2510.16558)做了…
你以为 AI 数学竞赛拿了金牌就是"真懂数学"——2026 这篇论文告诉你:它可能只是"算得准"而已
如果你是做 AI 数学 / AI 推理 / AI 教育的产品经理,你大概率在朋友圈看过这种标题: "DeepSeekMath 拿下 AIME 84.3%!国产数学 AI 又一次吊打 GPT4!" 你点开模型 demo,看到模型一步一步写出漂亮的解题路径,最后得出正确答案。你截图发到团队群里,老板转给你一句:"咱们能不能…
AI 自主运营一家公司,靠"刷题数据"是不够的——2026 这篇论文给"enterprise AGI 训练数据"装了个新发动机
如果未来真的会出现「一家能自我运营的公司(a company that runs itself)」——由多个 AI Agent 当 CEO、当运营、当营销、当财务——这些 Agent 是怎么被训练出来的? 2026 年 10 月这篇论文(arXiv 2610.05912,MiniCorp)正面回答了一个被工程圈长期回避…
把 AI 塞进业务流程,不是给它"加一节选修课"——2026 斯德哥尔摩大学这篇论文,给所有公司上了一节反常识课
如果你们公司想让 AI 进业务流程——比如让 AI 处理银行的客户入职、医疗的病历摘要、电商的售后分流——大多数团队的做法是"在现有流程末尾加一节 AI 选修课"或者"在流程图里零散插入几个 AI 节点"。斯德哥尔摩大学 Amin Jalali 团队 2026 年 10 月这篇论文(arXiv 2610.06207)直…
你以为"上下文窗口不够大"是 LLM 的死穴——2025 这篇论文把 prompt 编程成外部环境,8B 模型直接打平 GPT-5
如果你是 LLM 应用工程师、AI 基础设施负责人、或者正在做长文档分析 / 代码库理解 / Agent 记忆系统的开发者——这篇文章写给你。 你可能已经默认一件事:LLM 处理不了超出窗口的输入,要么压缩,要么 RAG 检索,要么放弃。 你可能还默认一件事:要做长上下文任务,只能上 GPT5、Claude 这类带 2…
你公司每年花几十万做"网络安全意识培训",其实在心理学上注定无效——30 年前就被这篇论文说透了
如果你是 CISO、合规负责人、HR 学习发展负责人,或者只是公司里被强制要求看钓鱼测试邮件的普通员工——这篇文章写给你。 你公司每年发海报、推月度邮件、搞钓鱼模拟、做入职培训……你以为这是在"提高安全意识"。 现实是:同一批员工在反复培训后,依然点击钓鱼链接、依然把密码写在便签上、依然在客户名旁标"123456"。 …
双臂机器人终于学会"换手"了——2026 这篇论文把组合泛化从 5% 拉到 21%
你有没有想过——为什么家里的双臂机器人(比如宇树的 G1、Figure 02 这类)从来不会真的"两只手一起做事"?要么让左臂干一下、右臂干一下,要么干脆每只手臂独立跑一套策略——完全没有"组合"的概念。2026 年 10 月这篇论文(arXiv 2610.06184)正面解决了这件事:它把"组合泛化"拆成"按臂"和"…
你手机里那个 100K 上下文的 AI——为什么聊到第 80 轮开始"变傻"?一篇 2026 顶会论文终于说清楚了
你有没有过这种体验——和 AI 聊天聊到第 50、80 轮,它开始"忘记"你开头说过的话,开始答非所问?这是因为 AI 每说一句话都要"把所有上下文装进脑子才能接话",上下文越长脑子越重。2026 年 EMNLP 顶会有一篇论文(arXiv 2610.06479)正面解决了这件事:它换掉了过去 4 年大家一直在用的"哪…
当 AI 工具调用"看起来变好"——SAKIKO 揭示:净指标涨了 50 个百分点,却悄悄损害了一半原本正确的事(v2 重写覆盖 v1)
v2 主要改进(7+ 条 · 详见 §七工程核查 + 修正说明):① 修正标题数字:从 v1 "+55 分" → v2 "+50 个百分点"——明示是绝对百分点变化,避免与"分"混淆(v1 戏剧化失真违反 abstract verbatim 提取硬约束);② 修正小红书卡开头:从 v1 "平均分涨了 5%" → v2 …
你让 AI 记住你爱喝冰美式——可它两个月后还在推荐你热拿铁?2026 这篇论文告诉你:你以为的"长期记忆"根本就是测错了
如果你是做 AI 陪伴 / AI 助手 / AI 客服的产品经理,你大概率被老板问过这种问题: "用户都用了三个月了,怎么 AI 还是记不住他上次说过的忌口?" 你打开评测看板:长期记忆准确率 91%。你把成绩贴到周报里。可用户投诉还在涨——他们说"我三个月前跟 AI 说过我猫死了,它今天还问我'你家猫叫什么名字'"。…
LLM 训出来的"数据集"到底行不行?2026 年这篇论文,终于给了个"以终为始"的判官
做 LLM 的工程师最近两年集体遇到一个尴尬:花大价钱合成了一批"看起来很美"的训练数据,但下游 finetune 完一看 —— 模型涨分跟没训一样。 同事互相问:"这批数据到底行不行?"十个人给十种答案:有人说 Perplexity 太低、有人说多样性不够、有人说 LLMasJudge 给了 9 分、还有人说 Rew…
不用再"赌"协方差了 ——2026 年这篇 8 页论文,给投资组合风险装上了一张「数学免死金牌」
做投资的朋友最近可能有种感觉:不管你怎么换模型,「协方差矩阵」就像房间里的大象 —— 所有人都知道它很重要,但没人敢拍胸脯说"我估得准"。 2026 年 9 月,一篇单作论文悄悄换了一条赛道:它干脆 不估协方差,改用大模型给公司新闻算出来的「分布」,直接给系统性风险画了一条 "数学上严格的上界" —— 而且这条上界在 …
你以为"AI 会用浏览器"很强——2026 这篇论文告诉你:大部分题目闭卷就能答,根本不考"搜"
如果你过去一年用过 GPT4 + 联网浏览、Claude + Computer Use、或者 Gemini + Search,你大概率见过厂商这种宣传: "我们的 Agent 能像人一样浏览网页——查资料、写报告、做对比分析——你不用动手它就干完了。" 听起来很惊艳,但 2026 年 10 月这篇论文 HyperBro…
你以为"两个 AI 一起改文件"就是协同——2026 这篇论文告诉你:那叫 lost update
如果你用过 LangChain、AutoGen、CrewAI 这类多 Agent 编排框架,你大概率有过这种体验: 我让两个 Agent 一起干活——一个写代码、一个写文档——感觉挺美。但线上跑两天就出事:Agent A 改了 config.yaml,Agent B 同时也改了 config.yaml,最后提交到 gi…
当 AI 自己当「上下文管家」:arXiv 2609.37725 把上下文管理权从脚手架交回模型,准确率 +11.4%、算力 -21.5%(v3 重写覆盖 v2 / v1)
作者 / 团队(13 人,按 arXiv 摘要顺序): Rulin Shao¹,²(第一作者 · UW + Meta Superintelligence Labs) Shannon Zejiang Shen³ Junjie Oscar Yin¹,² Yuetai Li¹ Minheng Wang¹ Hamish Ivi…
你做 LLM 评测每次都烧几千美元——2026 这篇论文告诉你:换个"轻量法官",只花 0.36% 的钱还能保住 99% 准确度
如果你做过 LLM 应用,你大概率踩过这个坑: 我想用 GPT4 judge 给我的 chatbot 输出打个分,看哪条 prompt 更好——结果跑了 2 万条评估集,账单直接到 4000 美元。 这件事在 20252026 年特别扎心——LLMasajudge(用大模型评估大模型输出)已经是事实上的标准做法,但每次…
你以为"机器人会做家务"是一个 AI 模型搞定的事——2026 这篇论文把它拆成 6 块乐高,谁都能拼
如果你最近刷过机器人视频,你大概率见过这种 demo: "给机器人看一段人类做饭的视频,它就能在家帮我们收拾碗筷、洗菜、叠衣服——这就是 VLA(VisionLanguageAction)模型的未来。" 这种视频看着很爽,但如果你自己动手跑过类似项目,你大概率也踩过这种坑: 我换了一个视频生成 backbone(比如从…