Explainers · 学术推广产出

解读

1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

DreamTraj:通过读取未渲染的视频扩散潜在生成 6-DoF 物体轨迹
DreamTraj 提出了"读潜在(readlatent)"新范式:给定单张 RGB 图与一条任务指令,不生成视频、不调用深度/CAD,而是从冻结的 imagetovideo 扩散模型早期去噪步的内部表征里,由一个轻量 flowmatching Reader 直接解出物体 6DoF 相对轨迹;在翻译与旋转两项上都刷新 …
深度解读 arXiv:2608.00486 2026-08-05
DeepVoyager-VL:激励视觉在环的搜索以应对长程多模态 Agent
DeepVoyagerVL 把"视觉证据"从多模态搜索 Agent 的输入/输出端位置前移到中间推理环节,构造了一个面向长程、多轮、视觉驱动的 deepsearch 框架:用多模态事件图合成数据、用专门的 agent 框架做主动视觉获取与按需图像加载、无需 RL 即可在 10 个多模态搜索基准上拿到稳定提升。 多模态大…
深度解读 arXiv:2608.01827 2026-08-05
GPTQ-2D:把双侧自适应舍入从 O(n⁴) 砸到 O(n³) 的同解算法
GPTQ2D 是对 GPTQ / Babai 最近平面算法的"双侧推广版",输出与朴素 Kronecker 还原法完全相同的舍入矩阵,但把时间复杂度从矩阵维度的四次方降到三次方——核心做法是不再"沿某一固定坐标轴逐元素 round",而是"沿反对角线逐线 round",同一反对角线上的元素彼此独立,可并行。 LLM 权…
深度解读 arXiv:2607.27042 2026-08-05
基于影响匹配的数据集蒸馏
InfMatch 提出一种结果对齐视角的数据集蒸馏方法:不再对齐训练轨迹或逐步梯度,而是直接学习一个合成集合,使其对模型收敛后参数的影响与全量真实数据一致;用一个线性时间、可微、样本级的影响估计器避免逆 Hessian 与凸性假设,在分类与视觉语言蒸馏任务上同时刷新 SOTA。 数据集蒸馏(Dataset Distil…
深度解读 arXiv:2607.16859 2026-08-05
Scaling Native Multimodal Pre-Training From Scratch:给原生多模态预训练画一张「算力地图」
这是一篇把「原生多模态预训练」(Native Multimodal Pretraining) 当作一门可以系统研究 scaling law 的工程学科,并第一次给出可直接用于「模型规模 / Token 数量 / 数据配比」联合决策的「效率前沿」(efficiency frontier) 的实证工作。它回答的不是「要不要…
深度解读 arXiv:2607.22043 2026-08-05
Teachy Mini:面向高等教育的知识驱动生成式社交机器人开发与初步评估
把"知识驱动设计(KnowledgeBased Design, KBD)"这一组信息先决条件,通过 system prompting、检索增强生成(RAG)和有状态的 prompt 编排落地到 Reachy Mini 机器人平台上,做出 Teachy Mini 这一生成式社交机器人(GSR)辅导系统;与不遵循 KBD …
深度解读 arXiv:2607.22345 2026-08-05
用于生成建模的三体散射(Three-Body Scattering for Generative Modeling)
TBSM 将物理「三体散射」思想引入生成建模,用一个真实样本吸引、一个生成样本排斥的恒定规模交互替代传统 GAN 的对抗 Critic 或扩散的完整噪声路径,在单步生成(NFE=1)下实现 SOTA FID。 现代生成模型有三条主流技术路线,各有瓶颈: TBSM 提出的核心问题是:能否找到一种监督信号,既能给出样本级(…
深度解读 arXiv:2607.18198 2026-08-05
多模态说话人验证对说话人匿名化的威胁(Multimodal Speaker Verification as a Threat to Speaker Anonymization)
当前主流说话人匿名化方案只针对单条语音的声学特征进行压制,但当攻击者能聚合多条匿名化语音的声学、韵律和语言信息时,匿名化效果大幅退化——仅 5 条匿名语音融合音频与文本即可将 EER 相对降低 15% 以上。 说话人匿名化(Speaker Anonymization)是保护语音数据隐私的核心技术。传统方案(如 form…
深度解读 arXiv:2607.19636 2026-08-05
Vision-aligned Latent Reasoning:视觉对齐的隐空间推理,让 MLLM 不再遗忘图像
VaLR 通过在每个 Chain of Thought(CoT)推理步骤前动态生成"视觉对齐的 latent token",从根本上解决了 MLLM 在长序列推理过程中视觉信息被逐步稀释的问题——VSIBench 从 33.0% 跃升至 52.9%,比 Qwen2.5VL 高出近 20 个百分点,并首次在多模态大语言模…
深度解读 arXiv:2602.04476 2026-08-05
User as Code(UaC):把用户记忆写成可执行的 Python 代码
UaC 将 Agent 对用户的记忆建模为一个活的软件项目——用类型化 Python 对象存储用户状态,用 Python 函数编码行为规则,从而在同一个解释器可运行的媒介内完成用户表示与推理,解决了传统"文本检索式记忆"无法处理聚合查询、矛盾消解和主动安全告警的根本缺陷。 当前 Agent 的用户记忆几乎都采用"文本检…
深度解读 arXiv:2606.16707 2026-08-05
DataPrep-Bench:以「下游效用」为锚的 LLM 数据准备统一基准
DataPrepBench 是第一个把「数据构造」与「数据质量评估」放进同一个下游训练基准里联合打分的统一评测框架,并伴随发布了一个能跑赢主流 Agent 与 DataFlow 系统的 Skillguided 构造基线(DataConstructionSkill),以及一个在四个领域拿到最强跨模型相关性的分布型评估器(…
深度解读 arXiv:2607.20465 2026-08-05
RAG 综述(Gao et al. 2023):把「检索 + 生成」这件事范式化
这是 2023 年下半年最被广泛引用的 RAG 综述。它给出的最大遗产不是某条具体公式,而是 「Naive / Advanced / Modular」三阶段范式 与 「Retrieval / Generation / Augmentation」三支柱矩阵——任何一个想做 RAG 的团队都可以拿这两张图当白板来对照自家系…
深度解读 arXiv:2312.10997 2026-08-05
Spectral Prior for Reducing Exposure Bias in Diffusion Models(SPA)
关联论文: 2607.22091 作者: Yuya Kobayashi(Sony Research;摘要原文 From: Yuya Kobayashi) 更新: 20260728 精修: 20260805(Jay 二读者审校 + 工程补强) SPA(Spectral Prior / Spectral Alignment…
深度解读 arXiv:2607.22091 2026-08-05
Interactive Training 2: Auditable Control Plane for Live Model Training
Interactive Training 2 是一个 面向活体训练(live training)的开源控制面(control plane)——通过共享协议让训练应用声明可调参数与可执行动作,使人类和自动化 Agent 用同一套接口下发请求;训练循环在「安全控制点」校验并应用,同时记录到一份带时间线的审计日志(基于定制的…
深度解读 arXiv:2607.18314 2026-08-05
Continual Learning from Deployment Feedback for Frozen-Weights Agents
原标题(解读): Learning on the Job:让冻结权重 Agent 从部署反馈中持续学习 实标题: Continual Learning from Deployment Feedback for FrozenWeights Agents 关联论文: 2607.22157 作者: Valentin Tabl…
深度解读 arXiv:2607.22157 2026-08-05
O-VAD:用「对象中心 + 时间状态轨迹」做工业视频异常推理(免训练 Agent 框架)
OVAD 是一个 免训练、对象中心(objectcentric)的工业视频异常检测 Agent 框架——不依赖领域知识注入、不依赖 normalclip 微调,而是像人类质检员一样去追踪每个对象的空间时间状态演化,再用 VLM 在对象级时间状态轨迹上做推理,最终输出可解释的异常过程与类型报告(已被 ECCV 2026 …
深度解读 arXiv:2607.18142 2026-08-05
把 RAG-LLM 当作认知计算的组件:面向法规知识管理的本地化架构
本文论证了"本地部署的小尺寸 LLM + RAG"在 法规知识管理(Regulatory Knowledge Management, RKM) 场景下,可以从"文本生成器"升级为"认知计算基础设施中的语义处理模块"——关键不是更强的基座,而是 可审计、可追溯、可动态更新 的混合架构。 在法律/合规这种"高信息波动 + …
深度解读 arXiv:2607.24352 2026-08-05
LLM Agent 的评估与基准测试:综述
LLM Agent 评估是碎片化重灾区——这篇 KDD 2025 综述为它建立了一个二维分类体系(评什么 + 怎么评),并指出企业场景下被学界长期忽视的关键挑战。 LLM Agent 正在从研究原型走向真实部署(客服机器人、编码 Copilot、数字助理等),但评估这些系统的方法论严重滞后。与单纯评估 LLM 的文本生…
深度解读 arXiv:2507.21504 2026-08-05
鲁棒的历史文档解读:基于查询推断与执行的 Agentic GraphRAG
本文提出一个 semisymbolic agentic retrieval system,把 postOCR word spotting、知识图谱查询、LLM 驱动的代码生成三者交织——agent 在 LLM 的语义灵活性与 KG 的结构可问责性之间穿梭,最终在历史文档(OCR 噪声、转写错误普遍存在)场景下,比传统 …
深度解读 arXiv:2607.24475 2026-08-04
统一稀疏与稠密多模态嵌入:UEmbed 一个前向传播同时输出两种检索向量
UEmbed 证明了 decoderonly 多模态模型可以在单次前向传播中同时输出 sparse(稀疏词汇级)和 dense(稠密语义)两种嵌入向量,用同一套参数同时服务精确关键词匹配和语义相似度检索,打破了 Learned Sparse Retrieval(LSR)必须依赖 encoder 双句模型的多年桎梏。 现…
深度解读 arXiv:2608.02583 2026-08-04
超越形态:基于抽象运动表征的跨类目运动迁移
论文提出 Motion Beyond Morphology 这一新视角,把"参考视频驱动目标对象动画"这件事从固定的形态结构对应中解放出来:通过两阶段框架(Stage I 学多粒度抽象运动表征 + Stage II 直接以参考视频为条件生成),用自举构造的跨类目视频对做监督,最终在图像/文本条件下的运动迁移任务上达到 …
深度解读 arXiv:2608.01628 2026-08-04
LongHorizon-Harness:将长程 Agent 执行重新建模为外部任务状态管理问题
LongHorizonHarness 发现现有 Agent 评测框架把「任务执行、状态追踪、完成评估」全部塞进同一个 LLM context 是长程任务崩溃的根源,提出将任务状态显式外置到 LLM 外部,仅用 MEA(ManagerExecuteAuditor)循环中经过环境验证的事实更新状态,实现 Qwen3.7Pl…
深度解读 arXiv:2608.01964 2026-08-04
渐进式智能体技能生成:通过强化学习
论文提出 Skillα,把「Agent 技能(skill)生成」建模成一个由强化学习驱动的序列编辑过程:每一步对候选技能做一个小改动,并通过「rollback reward」比较改动前后的下游执行表现来决定奖励,让技能库按训练逐步长出来。在 CLBench 与 tau2bench 上,Skillα 比最强的基于启发式 …
深度解读 arXiv:2608.01678 2026-08-04
DAPD:解决 OPSD 蒸馏中『特权幻觉』问题的双向锚定框架
DAPD 首次系统诊断了 OnPolicy Self Distillation(OPSD)中「特权幻觉」(Privilege Illusion)的根本原因——训练时有特权信息教师、推理时没有——并提出 DualPath Anchoring + DualSource Anchoring(DPA+DSA)的双层锚定方案,让…
深度解读 arXiv:2608.01735 2026-08-04
LeapTalk:用单步桥式蒸馏打通 Talking Head 的延迟-质量权衡
LeapTalk 提出了一种单步 Brownian bridge 蒸馏框架,让 talking head 生成从"多步扩散 → 高质量但无法流式"和"自回归 → 实时但身份漂移"的两难中跳出来,在 1 步推理下达到 200 FPS、保持长时间稳定身份与唇音同步。 Talking head 生成长期存在延迟质量权衡(la…
深度解读 arXiv:2608.00079 2026-08-04
CADENA:逐步生长的参数化 CAD 反向工程
CADENA 把"3D mesh → 参数化 CAD 程序"这件事从一次性生成改成逐步生长、每步对照中间几何:每生成一个 CAD 操作就把它执行一次,看当前几何还差多少、决定下一个操作该补什么,像人类工程师那样"feature by feature"地把零件拼出来。 现代工程离不开 CAD(ComputerAided …
深度解读 arXiv:2608.00799 2026-08-04
3DZip:面向 3D 问答的空间感知 + 特征多样性 Token 压缩
3DZip 针对 3D 视觉语言模型(3D VLM)的 token 海啸问题,提出三阶段 token 压缩框架(粗体素化 → DPP 多样性选 anchor → 空间约束合并),把单场景几千 token 压到 128 个,仍保留 94.7% 原始性能、推理提速 1.92×。 3D VLM 做 3D Question A…
深度解读 arXiv:2608.01185 2026-08-04
从 Pascal 到 Blackwell 的 Warp 分歧特性分析
通过跨代硬件微基准测试与编译器 SASS 代码静态分析,本文证明了 Volta 引入独立线程调度(ITS)以来,NVIDIA GPU 的 warp 分歧执行遵循稳定且可预测的线性串行化模型(T(k) ≈ sk),与具体架构世代无关,同时揭示了编译器重汇聚机制的代际演进:Pascal 使用 SSY/SYNC 栈,而 Am…
深度解读 arXiv:2607.23402 2026-08-04
IndicTalk:面向印度语系的大规模人格化多语言对话语料库
IndicTalk 是一个面向 9 种印度语系语言、共 18 种语言变体、约 132.8 万条基于真实事件的多轮对话语料库,通过全自动流水线(真实新闻锚定 + 人格条件式多语 LLM 生成 + 自动质量校验)生成,重点解决印度语系中"印地英语"代码混合(codemixed)对话资源稀缺、且原生文字与罗马化混用难以覆盖的…
深度解读 arXiv:2607.23242 2026-08-04
Chamaileon:基于上下文建模与混合采样的跨上下文结合子设计
Chamaileon 把蛋白质结合子(binder)设计从"单目标、单状态"框架升级为"跨上下文结合景观建模",用 InContext Complex CoDesign (I3CD) 训练范式让模型同时学序列结构联合生成,并在推理时用 MixtureofPaths Sampling (MoPS) 在多构象/多靶点之间采…
深度解读 arXiv:2607.23518 2026-08-04