研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Fathom:面向卸载 KV 缓存稀疏解码的每查询读取深度
把 KV cache 的 K 端按通道 bit plane 存,每个 query 根据自己通道的方差加权重要性做反向注水(reverse waterfilling),动态决定每个通道读多少 bit —— 让百万 token、agent 多会话场景下的 topk 注意力键扫描比 Double Sparsity / Lok…
深度解读 arXiv:2609.17652 2026-09-17
在 BraTS-GoAT 2026 中评估 nnU-Net 跨脑肿瘤人群的泛化能力
在 BraTSGoAT 2026 异构人群脑肿瘤分割挑战赛上,用一个标准 3D nnUNet(1,351 例标注 + 五折交叉验证 + 1,000 epoch/折)拿到 ET/TC/WT 全局 DSC 0.7805 / 0.8288 / 0.8854,并量化了「源域 OOF → 汇总验证集」之间平均 Dice 0.07…
深度解读 arXiv:2609.15524 2026-09-17
FLAT:将图像和文本重采样为 1D 变长对齐跨模态 token 用于检索与生成
FLAT 通过将视觉与文本映射到统一的 1D 序列空间,并联合优化共享编码器与双向上下文生成目标,使多模态表征同时具备可区分性(检索)和可生成性(条件生成),在 T2I 生成任务上 GenEval 达 71.1 分。 传统多模态系统将表征学习(contrastive / selfsupervised visual en…
深度解读 arXiv:2609.16591 2026-09-17
Agora: Git as Shared Memory for Collective AutoResearch
Agora 是一个让多个 LLM Agent 共享研究状态的协作系统:将每个研究贡献(发现、假设、验证、报告)建模为 Git commit,构成一条可溯源的 DAG(有向无环图),使多个 Agent 在无需中央调度的情况下实现去中心化的集体科学研究。 AutoResearch 等自主研究框架证明单个 LLM codin…
深度解读 arXiv:2609.18094 2026-09-17
XConf:经验驱动的 LLM 置信度估计新范式
1. 这篇在解决什么真问题? —— 现有 LLM 置信度估计只读"当前推理"(内省/token 概率/重采样),对历史经验视而不见,导致 agent 长链路任务里校准很差。 2. 方法本体是什么形态? —— 一种格式无关、零 logit、零权重更新的「经验驱动置信度估计」框架 XConf,由 Recall + Refl…
深度解读 arXiv:2609.17708 2026-09-17
ComPO:零阶优化视角下的 LLM 偏好对齐新路径
1. 这篇在解决什么真问题? —— DPO 类直接对齐方法在「偏好对似然差很小」时出现 likelihood displacement,严重浪费偏好信号;ComPO 提出零阶比较 oracle 提取方向信息,绕开显式偏好损失。 2. 方法本体是什么形态? —— 一种基于 comparison oracle 的 zero…
深度解读 arXiv:2609.19144 2026-09-17
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
PPO 在 LLM 训练中使用的 Critic 网络存在一个系统性缺陷——Value Flattening(价值扁平化):状态价值在中间状态之间急剧变化,但 Critic 的预测却相对平坦,导致策略更新失去有效信号。SP³O 通过在每个 response 中仅对少量稀疏分布的状态施加价值损失,从根本上缓解了这一问题,在…
深度解读 arXiv:2609.18708 2026-09-17
ActionPiece:VLA 自回归动作分词的「物理秩一致性」新视角
1. 这篇在解决什么真问题? —— VLA 自回归策略的动作分词器普遍用 MSE 评估「单点误差」,无法揭示「重建后不同上下文的动作调整是否被保留」;ActionPiece 提出 PRC(物理秩一致性)度量并据此设计联合损失。 2. 方法本体是什么形态? —— 一种保留动作间物理近/远关系的自回归 VLA 动作分词器,…
深度解读 arXiv:2609.18487 2026-09-17
HypoEvolve:用遗传算法让多智能体 LLM 自主提出可证伪的科学假说
HypoEvolve 把"科学假说发现"建模成显式的遗传算法——一群专职 LLM 智能体(机制论证 / 假设重审 / 证据与可检验性评估)按代际对假说种群做筛选、变异、重组与保留——并在 34 种癌症的药物重定位任务上以 DepMap 选择性 0.171 击败六类基线(最强基线 0.115),跨保持的癌症类型上也展示出…
深度解读 arXiv:2609.15938 2026-09-17
Zing-0.5:可实时键盘+文本联合控制的 5B 自回归世界模型
Zing0.5 是一个 5B 参数的自回归世界模型,核心卖点是"可玩性":用户可以一边用键盘探索生成世界,一边用在线文本指令改变事件走向而不打断生成;技术上以"统一动作与文本条件 + 事件尺度监督 + 四步实时生成 + 流式上下文保持"四件套实现 832×480 @ 24 FPS 推理,按摘要估算的服务器租用成本约 U…
深度解读 arXiv:2609.17909 2026-09-17
SpectralShift:用频谱重参数化扩展 Gated DeltaNet 上下文窗口
SpectralShift 从线性注意力状态转移矩阵的频谱视角出发,对 Gated DeltaNet(GDN)做"频谱重参数化"——重塑 α 投影的衰减谱并配合专门的学习率缩放——在不破坏快速衰减模的前提下拓宽慢谱带,从而在持续预训练阶段高效扩展 GDN 的有效上下文窗口。⚠️ 代码已开源(RUCAIBox/GDNSp…
深度解读 arXiv:2609.14320 2026-09-17
OmniHarness:通过符号化策略学习实现可泛化的视觉生成
OmniHarness 把"已验证执行"抽象成可复用的符号化策略,模型参数保持冻结,只让策略库在自导演练与下游反馈中持续扩展,让多模态智能体在六个视觉生成基准上把 ComfyBench Creative 任务的解决率推到 95.0%(较最强基线 +27.5 个百分点)。 视觉生成智能体(基于 ComfyUI、SD、Di…
深度解读 arXiv:2609.16057 2026-09-17
用于扩散语言模型有界状态推理的 Register Tokens
作者在掩码扩散语言模型 (dLLM) 中引入固定数量、固定位置的"register tokens",让它的连续隐状态作为推理进度的"压缩记忆"在分块生成之间携带,实验证明在 LLaDA 和 Dream 上全面优于"用离散文本携带历史"的方式,math 任务最高 +8.5 点、code 任务最高 +19.5 点。 掩码扩…
深度解读 arXiv:2609.16372 2026-09-17
LimiX-2:迈向通用结构化数据智能的上下文机制网络
LimiX2 用「上下文机制网络 (CMNs)」范式和「上下文条件掩码建模 (CCMM)」预训练,把表格基础模型 (Tabular PFN) 的目标从传统的 p(y|x, D_context) 重新定位为 p(x, y|D_context),从而在同一模型里同时拿下预测性能与因果骨架恢复,并在 TabArena、TAL…
深度解读 arXiv:2609.17488 2026-09-17
广义 Agent 迭代:把递归自改进纳入经典 GPI 框架的一次形式化尝试
1. ⚠️ 标注密度:目标 ≥10/千字 2. 反方 v2 三段式(机制/数据/截止日):每主线 ≥150 字 3. 立标池 4 件套:GitHub 已验 + ⚠️ + 双轨 + abstract 核实 ≥3 件 4. §七 合流密度:与同方向工作对照 ≥3 处 5. 字数 CJK ≤3,900(主体 ≤3,500 +…
深度解读 arXiv:2609.13406 2026-09-17
RelateAnything:把开放词汇能力从检测/分割推进到关系预测
1. ⚠️ 标注密度:目标 ≥10/千字 2. 反方 v2 三段式(机制/数据/截止日):每主线 ≥150 字 3. 立标池 4 件套:GitHub 已验 + ⚠️ + 双轨 + abstract 核实 ≥3 件 4. §七 合流密度:与同方向工作对照 ≥3 处 5. 字数 CJK ≤3,900(主体 ≤3,500 +…
深度解读 arXiv:2609.12552 2026-09-17
跨模态上下文学习的会聚涌现:ICL 是普遍现象还是 LLM 特例?
1. ⚠️ 标注密度:目标 ≥10/千字 2. 反方 v2 三段式(机制/数据/截止日):每主线 ≥150 字 3. 立标池 4 件套:GitHub 已验 + ⚠️ + 双轨 + abstract 核实 ≥3 件 4. §七 合流密度:与同方向工作对照 ≥3 处 5. 字数 CJK ≤3,900(主体 ≤3,500 +…
深度解读 arXiv:2609.14011 2026-09-17
ModularRSI:面向长时序编码与终端任务的模块化、可泛化递归框架自我改进
ModularRSI 把「让 Agent Harness 学会自己变好」这件事从「整块黑盒单轨迹微调」拆成「对比成功/失败轨迹 → 定位模块缺陷 → 在受限范围内独立进化 → 集成回归」的四段流水线,并用一份与下游评测基准不相交的 2,000 任务进化集抑制基准特化拟合,从而在 TB2.0 与 SWEBench Ver…
深度解读 arXiv:2609.14857 2026-09-17
HarnessVLN:用 Agent Harness 把零样本具身导航统一起来
HarnessVLN 提出一种零样本、免训练的具身导航框架:用一套统一的「Agent Harness」把感知、检索、定位、导航、恢复、终止六类能力装到同一个工具接口下,配合「分层事件记忆 + 持久时空图 + 可替换导航执行器」三件套,让同一个 Harness 协议既能跑指令跟随(InstructionFollowing…
深度解读 arXiv:2609.15195 2026-09-17
Another Blueprint In The Wall:当孩子向前沿 AI 提问时会发生什么?
这篇论文做了一件非常「人文学科式」的实验:让来自 OpenAI、Anthropic、xAI、Google DeepMind 的六种前沿模型,在面向学校听众的三阶段提示下,独立想象「下一代架构」并画出 ASCII 骨干。结果显示几乎所有模型都收敛到同一套架构模式——持久潜在状态、自适应计算、记忆、专家路由、验证、停止控制…
深度解读 arXiv:2609.14803 2026-09-17
LynnReal-Omni:面向 Agent 视觉工作流的原生多模态视频生成
1. 谁写、给谁看:作者 flyP 等(具体名单见 PDF §7 Contributors);读者是视频生成研究者、agent 视觉创作平台架构师,以及对"可控 + 高保真 + 实时"三重需求同时有要求的团队。 2. 它的真问题是什么:视频扩散模型随机性强、难以精确控制,长时场景在外观 / 交互 / 时间一致性上都会漂…
深度解读 arXiv:2609.15863 2026-09-16
Grouped Value Attention:通过按需 Key 重建实现高效 KV 缓存
1. 机制层:把"键"扔掉、用学习到的线性映射从值里"反算"出来——为什么可行?⚠️ 论文假设内容键的内容分量能由值线性表达(参见 GQA/MLA 同类假设),但没有给出表征能力的形式化下界。 2. 工程层:把"线性映射吸进 query"等价于一次矩阵合并——为什么这能在不重训已部署 checkpoint 的前提下替换…
深度解读 arXiv:2609.13285 2026-09-16
构建生产级希腊语-英语语音识别器
1. 机制层:为什么"双语 ASR 在生产门控下没有一次能同时通过 9 项"?⚠️ 论文把问题归因于希腊语噪声环境与英语 LID 的"步数不对称"——希腊语 ≈ 1500 步密集领域暴露、英语 LID 仅容忍 ≈ 250 步。这是数据层面的容量竞争,不是模型架构问题。 2. 工程层:6 阶段数据管线 + 9 项生产门控…
深度解读 arXiv:2609.13498 2026-09-16
无损推测解码真的无损吗?数值精度在 Orthrus 中的作用
Orthrus 的无损推测解码在 BF16 精度下实际仅有 43%–45% 的概率能精确复现 AR 模型输出轨迹;换用 FP32 后才实现 100% 轨迹匹配——所谓"无损"高度依赖数值精度,而非算法本身的固有属性。 加速自回归语言模型(AR LLM)推理是 LLM 部署的核心挑战。Speculative Decodi…
深度解读 arXiv:2609.15504 2026-09-16
PhysStream:把"位置控制"换成"速度增量"的可交互物理视频生成
PhysStream 提出一种自回归图像到视频(I2V)的物理视频生成框架,核心是把控制信号从"物体位置"换成"稀疏速度增量",并把"位置图 + 物体跟踪图"作为结构化场景记忆在线滚动更新,使生成过程中可以中途交互式控制多物体桌面试刚体场景,在合成 benchmark 上 FVMD 降 33%、轨迹误差降 12%,野外…
深度解读 arXiv:2609.17521 2026-09-16
ModAR:把"RGB-only"换成"多模态自回归"的机器人世界-动作模型
ModAR 提出首个跨多模态自回归去噪的世界动作模型(WAM):先逐个预测点轨迹、DINO 特征、深度图等"非 RGB 视觉模态",再以这些模态为条件预测机器人动作;在与最强基线 Flexπ(视频模型初始化)同等条件下,达到 75% 平均成功率 vs 72%,训练 FLOPs 仅约 1/20 且无需预训练,并在三个真实…
深度解读 arXiv:2609.17524 2026-09-16
InceptionRAG:用"多跳推理投毒"绕过 RAG 现有防御的隐蔽攻击
InceptionRAG 提出一种针对 RAG 系统的新型隐蔽投毒攻击:把恶意载荷拆成多条看似无害的"休眠段落"散布到语料库中,单独看任何一条都不触发现有的单文档防御;只有当 RAG 把它们一起检索出来时,LLM 通过多跳推理自行"涌现"出目标错误信息。在 3 数据集 × 3 LLM 上攻击成功率 80%,能绕过主流单…
深度解读 arXiv:2609.16818 2026-09-16
Mind2Dialogue:用「心理状态模拟」补上 Human-Aware LLM 的监督缺口
1. 这篇论文真正在解决的问题是什么? 当前 LLM 助手训练数据里几乎没有「基于用户没说出口的信念 / 目标」的「知情响应」——这是结构性监督缺口;用户心智状态不可观测,扩规模扩不到。Mind2Dialogue 用「心理状态模拟器 + 特权蒸馏」绕开这个缺口。 2. 它和同方向工作的本质差异在哪? 多数 humana…
深度解读 arXiv:2609.15972 2026-09-16
「最后由人类建造的 AI」:迈向真正的递归自我改进
1. 这篇论文真正在解决的问题是什么? 不是「让 LLM 自我迭代」这种宽泛口号,而是「为什么现有 LLM 的能力天花板已经被锁死,以及如何按层级打开」——一个被现有评测体系系统性低估的、可被逐级拆解的工程路线图问题。 2. 它和同方向工作的本质差异在哪? 多数 RSI(SelfImproving / SelfImpr…
深度解读 arXiv:2609.11873 2026-09-16
没有显式推理轨迹也能训练专家模型?——一篇把「学生蒸馏」当探针的研究
1. 这篇论文真正在解决的问题是什么? 业界默认「专家模型好」来自显式 reasoning trace(CoT / RFT)做蒸馏;但若只用 questionanswer 对训练,专家模型内部到底「在干什么」?本文把学生蒸馏当成「与专家无关的探针」,反向揭示专家的隐式推理分布。 2. 它和同方向工作的本质差异在哪? 多…
深度解读 arXiv:2609.13770 2026-09-16