研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

RelightFormer:把"潜在光照模块 + 置换不变位置编码"塞进视频基础模型的多视角重光照
RelightFormer 把一个视频基础模型(video foundation model)适配为前馈式生成 Transformer,专门做单视图与多视图图像重光照(image relighting):用一个潜在光照模块通过 crossattention 把目标环境贴图动态注入空间特征,并配合置换不变位置编码(per…
深度解读 arXiv:2609.07414 2026-09-09
Encoded Early, Used Late:Transformer 在残差流里"先编码、后使用"伙伴专业度的层间分隔
本文用一个模型扮演四级专业度角色的多轮研究规划对话语料 ExpertCollab,借助线性探针(linear probe)与反事实补丁(counterfactual patching),定位出 Transformer 内"伙伴专业度"这一推断型关系属性的表征位置(早期层可线性解码)与因果使用位置(网络过半之后才真正影响…
深度解读 arXiv:2609.07139 2026-09-09
Cadence:把时序基础模型塞进误差有界压缩器,是赚是赔?
Cadence 把 Google 的 330M 参数时序基础模型 TimesFM3 接到一个自适应算术编码器上,做出"误差有界有损压缩器"——保证每个样本 |x_t x̂_t| ≤ τ;但论文先甩出一条负面结论"无损压缩下大模型几乎没用",再用工程细节(contextmodelled binarization、确定性保…
深度解读 arXiv:2609.06008 2026-09-09
Mask Forcing:通过双噪声掩码自展开改进自回归视频扩散蒸馏
⚠️ 本文基于 arxiv 摘要与项目页(公开内容),未读取 PDF 全文,所有具体数据均引自摘要或显式标注"原文未明确"。被引/评审分等卡片字段尚未抓取(paper_card 字段 S2=0/无评审分),解读定位为二轮 [0.5] 队列稿。 Mask Forcing 提出一种双噪声掩码自展开(DualNoise Ma…
深度解读 arXiv:2609.09123 2026-09-09
Gander:把全双工交互、Omni 感知和 Agent 能力装进同一个端到端模型
⚠️ 本文基于 arXiv 摘要与项目页(公开内容),未读取 PDF 全文,未引用具体实验数字的项目页截图;所有量化数字与胜出率均按摘要用词或标注"原文未明确"。卡片 S2=0 / 评审分未抓取(队列 [0.5] 二轮解读)。 Gander 是一个端到端 omni 模型,通过 CerebellumBrain 双系统协同…
深度解读 arXiv:2609.08977 2026-09-09
Marigold V2:把 Diffusion Transformer 蒸馏成 SOTA 单目深度估计器
⚠️ 本文基于 arxiv 摘要(公开内容)与"SIGGRAPH Asia 2026"会议标注(公开信息)。未读 PDF 全文。卡片 S2=0、stars=0,属于候补未解读池中的方法学扎实 + 已接收顶会的一篇,作为本轮第三篇补位。⚠️ 量化数字仅引自摘要或显式标注"原文未明确"。 Marigold V2 把预训练的…
深度解读 arXiv:2609.08084 2026-09-09
CoVeR:基于空间覆盖度的 Token 剪枝,让多视图 3D 推理的 VLM 又快又全
CoVeR 是一个训练无关、确定性的视觉 token 选择器:只看 token 的 2D 坐标,不依赖任何 learned signal,按「空间覆盖度」从多视图图像里挑出能覆盖整个 3D 场景的 token 子集,精确控制在每个场景的预算内,打破了 learned importance 和 voxelization …
深度解读 arXiv:2609.08345 2026-09-09
AuK:用自然语言统一语音生成与编辑的开源基础模型
AuK 是一个把语音生成与编辑统一到同一套自然语言指令接口的开源语音基础模型:约 30.3 亿条「指令音频」实例、195 万小时有效监督,覆盖 5 大任务族;架构上把多模态 LLM、跨域 VAE、混合 rectifiedflow Transformer 串成端到端流水线;通过一致性初始化和 Decoupled DMD …
深度解读 arXiv:2609.08936 2026-09-09
TANGO:用全身视觉-语言-动作模型,让类人机器人在杂乱室内场景穿行
TANGO 是首个把语言条件下的类人机器人杂乱环境导航建模为「全身视觉语言动作」联合决策的端到端框架:给定自然语言指令和第一人称 RGB,直接预测 29 自由度关节空间动作,由下游全身控制器执行;在仿真里以 SOTA 跑通视觉语言导航,并在零样本实机(Unitree G1)上完成杂乱场景穿越。 传统视觉语言导航(VLN…
深度解读 arXiv:2609.09158 2026-09-09
RoboSPA:VLA 模型能跳出"简单场景 + 短程任务"的天花板吗?
§0 元层五问 RQ1 这篇到底回答了什么真问题? 现有 VLA(VisionLanguageAction)benchmark 都在"预定义场景 + 短程任务 + 二元成功率"维度评估,无法诊断"空间关系复杂度上升"与"程序链长度上升"时模型究竟在哪一环节崩掉。 RQ2 是不是简单把已有基准加难度? 不是。它显式拆出两…
深度解读 arXiv:2609.05324 2026-09-09
TransNormal-2:把"几何感知"与"边缘解码"装进 rectified flow,搞定精确法向估计
§0 元层五问 RQ1 这篇到底回答了什么真问题? 扩散式单目几何估计的精度上限被 VAE 编解码器的重建退化卡死——即使把 groundtruth normals 编解码一遍,都会引入 1.3~8.5° 的平均角度误差(MAE),边缘 MAE 高达全局 MAE 的 2.8 倍。TransNormal2 在 VAE 解…
深度解读 arXiv:2609.06665 2026-09-09
BeaconKV:用"信标查询"指导 KV cache 压缩,解放大推理模型的显存瓶颈
§0 元层五问 RQ1 这篇到底回答了什么真问题? 现有 KV cache 压缩方法假设"近期 query 是未来 attention 的良好代理",但在 LRM(大推理模型)的长 CoT 解码过程中,这一假设会因"Thought Revisiting Tokens"(重访早期上下文的 token)而失效——Beaco…
深度解读 arXiv:2609.04971 2026-09-09
Split-LLM 训练中的隐私失败:返回的梯度让诱饵失效
在「本地节点持有隐私 loss + 云端节点只看到混合行」这种 splitLLM 训练协议里,「decoy 行梯度恒为零」这个事实会让返回梯度的零模式直接把真实样本位置泄露给云端,且这种泄漏能通过既有的 forwardchannel 隐私检查与模型质量检查——这是论文用预先固化的协议、九次独立种子全量复现验证得到的硬结…
深度解读 arXiv:2609.04382 2026-09-09
为谁安全?用于可控 LLM 安全拒绝的边界感知自蒸馏
把"安全对齐"从主题级问题(这个话题有害吗?)重新形式化为 narrowboundary safety(同一主题内不同部署需要划不同拒绝线),提出离线自生成框架:受控主题生成 + 覆盖修复 + 同分布补偿数据 + 有害无害配对,数据组成直接调控安全可用性权衡;在 Qwen38B 上把目标域拒绝率从 9.47% 抬到 8…
深度解读 arXiv:2609.04482 2026-09-09
通过上下文集成统一保形语言任务
把保形预测(conformal prediction)原本需要人工设计 LLM 评分 prompt 的步骤,替换成"上下文示例自动策展 + 集成打分"的 Conformal Relevance 框架,在覆盖性有统计保证的前提下,把摘要与抽取式 QA 等七项 NLP 任务的简洁性一并提升,并给出集成何时优于最差句得分的理…
深度解读 arXiv:2609.03005 2026-09-09
因果基础模型
把"基础模型"范式(一次性大规模预训练 + 无需微调迁移)首次系统化地搬进因果推断,定义 Causal Foundation Models(CFM):预训练一次即可通过 incontext learning 估计平均处理效应(ATE)等因果量,无需任何模型更新;论文以教程形式给出背景、定义与示例代码。 因果推断(cau…
深度解读 arXiv:2609.03003 2026-09-09
Uno:用离散扩散解锁 LLM 的无损推理加速
1. 真问题是什么:AR 解码的串行性是 LLM 推理的硬瓶颈;现有两大加速路线(speculative decoding 需 draft model、diffusion LLM 牺牲 AR 质量)都有结构性代价。 2. 方法核心一句话:把 AR 模型的"分布"保留下来,另学一组轻量扩散权重,从该分布里一次并行采多个 …
深度解读 arXiv:2609.04010 2026-09-08
ENEAS:嵌入引导的自适应分割神经集成
ENEAS 是用于实例追踪与语义发现的统一文本可提示方法:追踪路径扩展几何鲁棒的 SeC 架构加上文本提示适配器 + 时间记忆;发现路径用"高速视觉嵌入匹配 + 条件 VLM 精化"级联,仅对模糊候选启用语义推理;统一在视频、图像库、无序数据集合上做高质量语义追踪与分割,并能区分"视觉相似但本体不同"的「替身(dopp…
深度解读 arXiv:2609.03756 2026-09-08
EmbodiedSkills:用于编排、训练和部署 VLA Agent 的统一框架
EmbodiedSkills 把 VLA 模型产出的「skill 决策」统一为"执行提案",在统一的 executableskill 接口下把高层 skill 选择、低层 VLA 执行、事后验证串成一个 agent 闭环;以 OpenPI/pi0.5 + Qwen3VL 实例化后在 RoboTwin 2.0 50 个任…
深度解读 arXiv:2609.01281 2026-09-08
一个症状,三个杠杆:On-Policy Self-Distillation 的批判性综述
OPSD(OnPolicy SelfDistillation)把"用更大教师模型做 onpolicy 蒸馏"中的教师替换为"同模型 + 特权信息(参考答案 / 计划 / 环境反馈)",早期看似达到与 RL 相当的精度但只花一小部分 token;然而产生信号的不对称性同时也在系统性塌缩(collapse)模型可产的推理路…
深度解读 arXiv:2608.25936 2026-09-08
FlowBalance:基于验证信号从在线推理经验中自改进
FlowBalance 通过 verifiergrounded 自引导机制解决了推理模型自我改进内循环的核心脆弱性:利用冻结训练时视角的同一策略产生 token 级 logprobability 增量,并用验证信号校正自引导分数,实现无需 token 级模仿损失的 outcomecalibrated 自改进,在 Qwe…
深度解读 arXiv:2609.03241 2026-09-08
知道不该回答什么:视觉语言模型中的选择性不遵从
KoNA 提出选择性不遵从评估基准,揭示当前主流 VLM 在复合 query 中无法正确区分可回答与应拒绝成分的根本缺陷,并证明基于该 benchmark 微调可显著提升选择性拒绝能力,同时几乎不损害正常回答性能。 VLM 在实际应用中面临的不是「全部遵从」或「全部拒绝」的二选一,而是更精细的选择性不遵从能力:一个 q…
深度解读 arXiv:2609.04720 2026-09-08
UniMate:一个统一模型驱动多样化骨骼动画
UniMate 是首个统一的 articulated motion foundation model,仅需 rigged 3D 资产与文本 prompt 即可驱动任意骨骼拓扑(从双足到蛇形)的运动合成,无需逐骨骼微调或测试时优化,在生成质量、跨拓扑泛化和推理效率三个维度均大幅超越 SOTA baselines。 自动 …
深度解读 arXiv:2609.05415 2026-09-08
KnowChange:用真实世界知识引导遥感变化数据合成
KnowChange 提出一个用预训练视觉语言模型(VLM)做"知识源"的遥感变化数据合成框架,绕过手工规则对类别迁移的局限,让小规模合成数据也能在合成→真实迁移和数据增强两个场景下稳定超越现有合成集。 遥感变化检测(Change Detection, CD)模型的瓶颈长期不在算法,而在标注数据:双时相遥感影像需要专家…
深度解读 arXiv:2608.24263 2026-09-08
TGOPD:用提示级教师门控提升 On-Policy Distillation 的可靠性
TGOPD(TeacherGated OnPolicy Distillation)在 OnPolicy Distillation(OPD)中插入一个"教师可靠性"提示级门控:用少量验证器打分探针估计教师在当前 prompt 上的可靠度,可靠就放行到密集 token 级蒸馏,否则改走验证器监督的 GRPO——以此同时提升…
深度解读 arXiv:2609.02998 2026-09-08
会话式 artifact 的"局部修订 → 全局传播":EMNLP 2026 工业赛道基准与 9 种方法的系统比较
本文定义并系统评估了一个新问题——会话式 artifact 中的修订传播(revision propagation):用户在多轮对话中只提出一个局部修改,LLM 必须识别相关依赖、把变更扩散到 artifact 的所有受影响部分;同时发布配套 benchmark,比较了 9 种修订方法,结论是"三路并行采样 + 选择器…
深度解读 arXiv:2609.03254 2026-09-08
展开世界:在强化空间推理中分解 4D 属性(FactoSR)
FactoSR 把 VLM 的"4D 空间推理"显式拆成平面对应(XY)、深度一致性(Z)、时序可逆(T) 三条正交、可打分、可验证的子目标,用 Group Relative Policy Optimization(GRPO)联合强化学习,让原本只见过 2D 投影的 VLM 在多视角与视频基准上获得稳定提升(VSIBe…
深度解读 arXiv:2609.03729 2026-09-08
一个编辑器,多种编辑:统一免训练视频编辑框架(EditVid)
EditVid 是一个免训练的视频编辑统一框架,把"局部连贯"、"长程身份保持"、"编辑局部性"三类问题分别用稀疏因果记忆 + 基于对应关系的后注意力 token 注入 + 软潜在融合三个机制串起来,在同一套流程里同时支持指令引导和参考引导编辑(风格迁移、属性修改、对象插入、部分级编辑、主体替换),并在 FiVE 上以…
深度解读 arXiv:2609.04190 2026-09-08
Refuse without Refusal:把安全响应结构化以减少误拒(RwR)
RwR 把语言模型的安全调优响应拆成拒答声明(refusal statement) 与拒答理由(rationale) 两个组件,论证只要让模型只学"理由"而不学模板化的"我不能协助……"式拒答声明,就能在保持有害 query 拒答率基本不变的同时,大幅降低对表面形似 harmful 的良性 query 的误拒(fals…
深度解读 arXiv:2609.04714 2026-09-08
HarvestBench:当 LLM Agent 必须为"不杀死动物"付出代价
blocklistgreppreflight: 0 hits / 20260908T14:30+08:00 · v1 · anchor: arxiv:2609.04444 / 9 models × 7,201 decisions / 提交日期 20260903 HarvestBench 是第一个把"避免副作用"标定价格…
深度解读 arXiv:2609.04444 2026-09-08