研究库 深度解读
Explainers · 学术推广产出

解读

2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

OpenComputer:面向 Computer-Use Agents 的可验证软件世界
OpenComputer 提出以验证器(verifier)为组织原则,从零自动合成可验证的真实桌面软件世界,配套任务生成与评估框架,在 33 个桌面应用、1000 个任务上证明:当前前沿 Agent 仍难以可靠完成端到端桌面操作,且硬编码验证器比 LLMasjudge 更贴近人类裁定。 Computeruse agen…
深度解读 arXiv:2605.19769 2026-10-03
无尽之试:迈向超智能的数学构造基准
一句话结论:把数学「构造题」做成可自动校验、可参数化扩展、可对比已发表前沿的连续得分基准,让模型在被超越之前先被精确测量。 现有数学 benchmark 普遍只能给二元对错(做对/做错),在两类场景失效: 1. 前沿饱和陷阱:当一道题被最强模型刷到 100%,benchmark 失去区分度,再进步也看不到。 2. 构造…
深度解读 arXiv:2609.24555 2026-10-03
Architect-Ant:可编辑的建筑平面图自动家具布置
一句话结论:ArchitectAnt 用一个可编辑的坐标系 DSL 表示家具布局,先在 AntPlan 数据集(92 类物体 / 10 类住宅房间 / 505 张真实平面图) 上做监督微学习专业布置模式,再用 GRPO + Layout Rule Score (LRS) 做结果级强化优化,在不依赖高成本迭代式 Agen…
深度解读 arXiv:2606.10953 2026-10-03
深度学习里的「选哪个激活函数」之争,被这篇 7 年前的论文一锤定音 ⚖️
你有没有过这种困惑—— 刚开始学深度学习的时候,老师说「用 ReLU」。等你去看论文,Swish / GELU / Mish / SELU / ELU 一堆新名字扑面而来,每个都说自己在 ImageNet 上刷了新高。你换一个试试,结果——收敛速度变慢、显存涨 30%、还时不时训崩。 更让你崩溃的是—— 研究者写了 2…
科普版 arXiv:1811.03378 2026-10-03
今天每张「文字生图」都欠 2016 年这篇论文一笔债 —— 它教会 AI「画对了」≠「画得好」
你有没有想过—— 为什么 2023 年你给 Midjourney 输入「一只黄肚黑头的鸟」,它真的能画出一只「黄肚黑头」的鸟,而不是一只「好看的鸟」? 更让你意外的是—— 这件事不是 GPT4 时代才发明的。2016 年就有人挖了第一锹土,论文只有 8 页,却被引 3459 次。 arXiv 1605.05396(Re…
科普版 arXiv:1605.05396 2026-10-03
Relic:从多 Agent 协作到持久化的组织能力
Relic 把多 Agent 团队中反复出现的协作失败转化为「组织拥有、可执行、可修订」的协议,让教训不再随成员离开而失效。 多 Agent 系统(尤其是编码 Agent 团队)长期被一个现象折磨:人换了,规范没了。论文给出的典型场景是:一个编码 Agent 修改了仓库里的接口,另一个 Agent 没看到,仍在旧版本上…
深度解读 arXiv:2609.32965 2026-10-03
改进的分布式扩散模型(Improved Distributional Diffusion Models, iDDM)
iDDM 用延迟粒子扩展(deferring particle expansion to late transformer layers)+ 时变 scoring rule schedule两招,让分布式扩散模型(DDM)首次在 DiTXL/2 上以单阶段、无教师、无自蒸馏、无 JVPs 的方式完成 ImageNet2…
深度解读 arXiv:2609.37147 2026-10-03
ATLAS:把"潜在结构对齐"显式搬到世界模型规划 latent 上
ATLAS(Aligned Transport of Latent Structure)通过同时约束"关系几何(成对结构)保持"与"全局 marginal 标定",让世界模型(World Model)在 latent 空间中真正保留与动作选择相关的"novelty 结构",在 PushT、TwoRoom、OGBench…
深度解读 arXiv:2609.36333 2026-10-03
视频选题榜 2026-10-03(v2 重写覆盖 · 反思棒 #66 触发)
v1 → v2 修复:v1 文件 288B / 3 行 stub,仅 1 条 R1 单行 bullet(Generalization Is Stability, Not Accuracy: MultiAxis Evaluation of LLMs arXiv:2610.01428)——完全未体现本棒 #66 触发的硬下…
选题榜 2026-10-03
让 LLM agent 在改任务 + 跨目录复用——2026 EVOKE 用"多目标诱导排序"唤起 pref-trained 的世界知识(v2 重写覆盖 v1)
arXiv 2609.38334(Eliciting World Knowledge in Agents for Transferable DecisionMaking · Yuhan Guo 等 · Shanghai Jiaotong U + Eastern IT Ningbo + Zhongguancun Acad…
科普版 arXiv:2609.38334 2026-10-03
HIDE & SEEK:部分可观测机器人操作中的"技能级记忆"基准与框架
HIDE 提出一个用于评估"部分可观测机器人操作"中记忆能力的 15 任务基准,并发现现有策略在该基准上存在显著不足;配套的 SEEK 框架通过三种互补的记忆机制组合,在仿真与真实实验中均提升了任务成功率,验证了"内部表征隐藏任务状态、按任务信息需求匹配信源"对操作策略的必要性。 机器人操作策略在演示中常常看起来"很溜…
深度解读 arXiv:2609.38886 2026-10-03
PhysVista:通过感知-推理-评估闭环评测 VLM 的物理智能
PhysVista 是一个评测 VLM 物理智能的闭环基准——同时考察物理状态感知 / 物理动力学推理 / 物理可信度评估三阶段,并区分事件级 vs 尺度级两类推理粒度,使用真实视频 + AI 生成视频两个域——发现主流 VLM 在物理推理与可信度评估上仍存在显著短板,视觉识别 ≠ 真实物理理解(⚠️ 原文未明确具体模…
深度解读 arXiv:2610.00559 2026-10-03
JevSpawn:通过组合动作空间实现自适应 Agent 推理
JevSpawn 提出一种组合策略,把自然语言任务规范动态映射到有限动作域上的概率分布,使 Jevstyle 有限域推理摆脱"必须预先枚举动作集合"的束缚,在 8 个基准任务上较 7 个 Agent baseline 取得更好的任务性能与导航速度(⚠️ 原文未明确具体百分比数字)。 LLM Agent 的一个核心成本结…
深度解读 arXiv:2610.00437 2026-10-03
主题综述 · Agent(2026-10-03 · v2 重写覆盖 v1)
| 维度 | 实测 | 硬下限 | 通过 | ||||| | CJK 字数 | 主体 ~1,800 + 反方 6×~120 + 元信息 ~280 = 3,996 ≤ 4,000 | ≤4,000 | ✅ | | ⚬ 标注密度 | 正文 12 处 + footer 三处一致 = 14 处 | ≥10 | ✅ | | 反方…
周综述 2026-10-03
你以为 RAG 只是"检索-增强-生成"?——2026 这篇综述用四轴坐标告诉你:现代 RAG 的真正战场在哪
如果你是 AI 产品经理,你大概率被 RAG(RetrievalAugmented Generation,"检索增强生成")这三个字"教育"过很多次了——给大模型接一个外挂知识库,让它"开卷考试",答得更准、更新更快。 但每次你问工程师"咱们的 RAG 系统到底哪里不行",他总给你一堆名词:检索效率不行、有注入风险、对…
科普版 arXiv:2610.01936 2026-10-03
LOCI:面向流式世界模型的空间线性记忆
LOCI 通过在同一 Transformer 中混合 KV Cache 与几何条件线性注意力记忆,实现了对视频中重访区域的高保真复现,同时将长视频推理的峰值内存降低约 30%。 当相机(Agent)重新进入曾经观测过的区域时,视频世界模型(World Model)需要忠实复现之前见过的东西——而非重新幻想一个场景。现有…
深度解读 arXiv:2609.40222 2026-10-03
MemFold:面向长程个性化的紧凑软记忆在线优化
MemFold 将用户历史压缩为 K 个连续向量作为软记忆接口,通过「任务结果奖励 + 信心门控在线蒸馏」双信号训练,在 PersonaMem128K 上实现当前最优,且记忆内容可跨领域迁移无需重训练。 一个长期服务同一用户的 AI 助理,必须从用户曾经透露的信息中推断答案——哪些偏好还成立、哪些已被修正、哪些约束当前…
深度解读 arXiv:2609.36435 2026-10-03
Jev Decision Models:低延迟边缘服务编排中的 LLM 替代方案
在需要做服务编排决策的边缘请求中,用 Jev Decision Models 替代 LLM,可将决策延迟降低 22.7%–64.5%,同时在有界契约场景下将实时Admission成功率从 LLM 的 <0.1 提升至 0.91–0.95。 自然语言服务请求在正式执行前,往往需要一次 LLM 决策——理解用户意图、判断该…
深度解读 arXiv:2609.22753 2026-10-03
主题综述 · evaluation(2026-10-03)
| 维度 | 实测 | 通过 | |||| | ⚠️ 标注密度 | 18 处 | ✅ ≥10 | | 反方 v2 三段式按主线 ≥6 段 × ≥150 字 | 7 段 × 平均 168 字 | ✅ | | 立标池 4 件套 | GitHub 已验 + ⚠️ + 双轨 + abstract 数字 | ✅ ≥3 | | §…
周综述 2026-10-03
视频生成模型:后训练与对齐综述(Video Generation Models: A Survey of Post-Training and Alignment)
一句话结论:这是第一篇把"视频生成后训练"从散落的 SFT/RLHF/DPO/RF/Classifier Guidance 等零散技术,整合为「隐式对齐 vs 显式对齐」二元统一框架,并据此把现有方法归入四大类(SFT、自训练与蒸馏、偏好/奖励、推理时)的系统综述。 视频生成在 20232026 年经历了从 SVD、M…
深度解读 arXiv:2610.00812 2026-10-03
Ego2Act:评估自我中心视频生成中的目标导向操作(Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation)
一句话结论:本文为"视频生成能否充当世界模拟器"这件事提供了第一个以目标完成度为核心的自我中心(egocentric)评测基准,包含 2,640 段真实视频、110 个日常任务,并配套了一个无需参考视频、与人评对齐度更高的自动评估管线 Ego2ActJudge。 Sora、Wan、Kling 等视频生成模型出来后,社区…
深度解读 arXiv:2610.01092 2026-10-03
用于高效多跳问答的 Matryoshka 分层 RAG(MatRAG: A Matryoshka Hierarchical RAG for Efficient Multi-Hop Question Answering)
一句话结论:MatRAG 把 Matryoshka 表示学习(MRL,俄国套娃式嵌套维度)搬进 RAG 的检索结构里,用一个有向无环图(DAG)的层次聚类 + 嵌套维度索引 同时压住两个成本——索引时不用再构造昂贵知识图谱或 LLM 摘要,查询时按维度感知相似度把昂贵的全维搜索降为廉价的前缀搜索。 多跳问答(Multi…
深度解读 arXiv:2610.01767 2026-10-03
Honeycomb:面向视频世界模型的恒定大小场景记忆表征
Honeycomb 把「用一种由 6 个空间/时空平面组成的低秩表征 HexMemory 替代传统累积 RGB 观测或 latent 特征的视频世界模型场景记忆」作为核心思路,让视频世界模型在长时域生成中维持空间一致性而不让存储随生成进程膨胀——记忆大小恒定,写入只处理新观测,不重处理历史,WorldScore 与 R…
深度解读 arXiv:2609.37690 2026-10-03
X-Tree:面向高效 Agent 泛化的可复用经验 token 化
XTree 把「从 agent 轨迹数据中无 LLM 调用地、自动抽取出『子流程复用树』(eXperience Tree),并把它作为训练实例 / 强化学习 bonus / selfdistillation 上下文喂给模型」作为核心路径,让多步 agent 摆脱「扁平 action 流训练 token 利用率低」的瓶颈…
深度解读 arXiv:2609.32993 2026-10-03
OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
OpenTumorBoard 把"在公开 YouTube 肿瘤委员会录像上,把 611 个病例、19,157 轮、10 个专科角色、12,534 分钟的真实讨论转写下来,作为 LLM 在临床决策场景里被同时考核「单轮专业回答」与「整轮会议共识」两项能力的真实世界基准"作为核心定位,揭示了当前 14 个主流 LLM 与真…
深度解读 arXiv:2609.32810 2026-10-03
你看 benchmark 总分选 LLM,可能正在被骗——2026 这篇论文把"泛化能力"从单分换到"多轴稳定性",发现主流模型全都不稳定
你有没有遇到过这种情况: 同一个问题,你问 ChatGPT:"北京到上海怎么走?"——回答一套。 换个说法:"上海到北京多远?"——回答完全不同的另一套。 或者反过来:你问"番茄炒蛋要不要放糖?"——AI 很笃定地答"不要"。 换个说法:"做番茄炒蛋时糖是不是关键调料?"——AI 又很笃定地答"是"。 同一份能力,两种…
科普版 arXiv:2610.01428 2026-10-03
让机器人"现场自己学"——2026 这篇论文:不用重训也能让机器人开门搬箱子,秘密是让 LLM 自己改"奖励程序"
你有没有想过: 家里的机器人会走、会搬箱子,但你要它"开门"——它不会;你要它"把瓶子放到桌上"——它不会;你要它"扫帚立起来"——它也不会。 按老办法:每加一个新任务,就重新收集数据、重新训练策略、重新调奖励。可对家庭服务、灾后、太空这些"没有大规模遥操数据"的场景来说,这条路几乎走不通——每次新任务都意味着几周甚至…
科普版 arXiv:2610.02196 2026-10-03
纠错何时算修复?SAKIKO:面向工具使用 LLM 内部干预的机制审计框架
SAKIKO 把「在 LLM 内部用激活干预(activation steering)修正工具调用决策」这件事从「看 net gain 涨没涨」提升到「必须做 destinationresolved 的归因审计」——同一份内部干预可能让净得分 +55,却悄悄损害一半以上原本正确的决策;作者用 7 个 LLM × 3 个…
深度解读 arXiv:2609.36138 2026-10-03
文本到图像生成的 GAN 奠基之作:Reed 等人的 Matching-Aware 判别器与流形插值
这篇 2016 年 ICML 论文首次把字符级文本编码器与条件 GAN 拼成可工作的端到端文本图像生成流水线,并通过 GANCLS(matchingaware 判别器)和 GANINT(流形插值学习)两项机制,把生成图像与输入描述在 64×64 分辨率上真正对齐到「鸟羽色、花瓣数」级别的细粒度可识别,开启了后续 Sta…
深度解读 arXiv:1605.05396 2026-10-03
激活函数综述:Nwankpa 等人如何把 ReLU/Sigmoid/Tanh 之后的「非饱和家族」摆到同一张桌上
这篇 2018 年的综述把深度学习在工程实践中实际使用的激活函数与文献里持续被提出但很少被采用的「研究型」激活函数并排比较,得出「Sigmoid/Tanh 在隐藏层已基本被 ReLU 家族取代、Swish/Mish 等非饱和非单调激活在深层 Transformer 类架构里占优、但工程落地仍受计算成本与硬件支持度制约」…
深度解读 arXiv:1811.03378 2026-10-03