Explainers · 学术推广产出

解读

1094 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Enfold:将世界模型的"想象计算"折叠进预测表征以实现超高效具身控制
首段自检:机制 3 段(生成器中间状态蒸馏 · 当前编码器与任务头梯度隔离 · 多层级 future supervision)+ 工程 2 段(LIBERO/RoboTwin2.0/真机三类任务 + FastWAM 3.7×/EnfoldFlash 10.1× 延迟实测)+ ⚠️ 数字核验 3 处("3.7× / 10…
深度解读 arXiv:2607.26657 2026-08-11
DCAS:解耦 CLI Agent 脚手架以实现跨脚手架的规划内化
首段自检:机制 3 段(DCAS 拦截层 · 显式规划 vs 隐式规划二分 · 计划源受控干预实验)+ 工程 2 段(backendsubstitution 拦截层 + 单脚手架采集的轨迹让模型跨脚手架泛化)+ ⚠️ 数字核验 3 处("gains exceeding crossscaffold drops"为定性 ·…
深度解读 arXiv:2608.06113 2026-08-11
多智能体取证推理实现可泛化的深度伪造视频检测(ARGUS / FaceVid-Forensics-100K)
首段自检:机制 3 段(多模型聚合冲突解决管线生成 100K 标注 · 4 专家 Agent 取证分视角 · Judge Agent 报告调和)+ 工程 2 段(100K / 33 种合成方法的 FaceVidForensics100K 数据集 · 全小开源 MLLM 击败 GPT/Gemini)+ ⚠️ 数字核验 3…
深度解读 arXiv:2608.06865 2026-08-11
EAHR:去掉固定 Top-L,让 RAG 的混合检索第一次做到「精确 + 自适应」
EAHR(Exact Adaptive Hybrid Retrieval)把现代 RAG 系统里「dense + sparse 融合时取固定 TopL」这个隐性工程假设直接拆掉:把「完整列表加权 RRF 的有序 TopK」固定为检索目标,把通道深度当成请求级别的执行状态,通过 PVS(PerVector Scalar …
深度解读 arXiv:2608.07152 2026-08-11
Referential Dangling:硬提示压缩中被忽视的范式级失效模式
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×5(0.30 压缩率、3454% dangling、6 compressors ≤60%、2934 pp 提升 / p<0.0001、88% gap 恢复、GPT5.5 8.8 pp、classifier 4.7 pp / 0.30→0.31)· 风险边界段 …
深度解读 arXiv:2608.04569 2026-08-11
CLIP-CC-Bench:评估视频-语言模型的段落级视频描述能力
CLIPCCBench 是一个面向长篇视频描述的评测套件:基于 5 小时电影内容切成 90 秒片段,每段配专家撰写的段落式参考,采用 5 个 SOTA 嵌入模型集成 + 粗细两套语义匹配方法,对 17 个 SOTA 视频语言模型做了 Borda 排序,并量化了评估协议本身的内部一致性(interjudge agreem…
深度解读 arXiv:2608.04302 2026-08-11
CoinRAG:用上下文信息要点 KV 缓存复用换长上下文 RAG 的 Pareto 前沿
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×2(5.3% 平均 F1 相对提升、新 Pareto 前沿、标准 fast prefill latency budget)· 风险边界段 ×1 · 反方段 ×1 CoinRAG 把 RAG 长上下文处理里的 chunk 级 KV 缓存复用再下推到「nugget…
深度解读 arXiv:2608.07458 2026-08-11
用于量子动力学预测的互补矩阵门控 QKAN 快权重编程器
用一对互补的 sigmoid 矩阵门(retain 旧状态 + write 新提案)替代 QKAN 快权重编程器里的标量门,实现坐标级(coordinatewise)的记忆时间尺度控制,并在 JaynesCummings 与 transmonresonator 多步预测上把 MSE 维持在 ≤ 0.001,相比标量门版…
深度解读 arXiv:2607.27945 2026-08-11
MatrAIx:用 83 亿 Persona Agent 模拟世界
MatrAIx 是一个面向 AI 系统与数字产品的大规模模拟用户评估基础设施,由 83 亿 persona 记录(1290 个类别维度)+ 4 个交互环境(Survey / Chatbot / Web / App)+ 1010 个应用任务组成;在 8 个代表性任务上跑了 18,189 次评估试验,对照 400trial…
深度解读 arXiv:2608.04205 2026-08-11
Manifold Mixup:在隐藏状态空间做插值,让决策边界天然平滑
Manifold Mixup 把输入空间的 Mixup 扩展到神经网络的任意隐藏层:训练时在随机选中的某一层对两个样本的隐藏表征做线性插值,再让后续层在该插值点继续前向并计算损失,由此鼓励网络在多层语义流形上都学到「线性行为」;结果是在不显著增加算力的前提下,模型在监督学习鲁棒性、对单步对抗攻击的防御、以及测试集对数似…
深度解读 arXiv:1806.05236 2026-08-11
decaNLP 与 MQAN:把十项 NLP 任务统一成问答的十年回看
decaNLP(Natural Language Decathlon)把问答、翻译、摘要、自然语言推理、情感分析、语义角色标注、零样本关系抽取、目标导向对话、语义解析和指代消解这十项 NLP 任务统一改写为「带上下文的问答」,并提出一个无需任何任务专属模块就能联合学习的 MQAN(Multitask Question …
深度解读 arXiv:1806.08730 2026-08-11
Invariant Risk Minimization(IRM):跨分布不变的因果式学习范式
IRM 提出「学习一个表示,让最优分类器在该表示之上对所有训练分布都同时最优」这条新原则,把 OOD 泛化从「经验风险最小化 + 数据扩充」的传统思路,拉到「不变因果机制」这一更高层级。 经典 ML 默认 i.i.d.:训练分布 = 测试分布。但现实里几乎所有生产数据都存在分布漂移——医院 A 训练的影像模型到医院 B…
深度解读 arXiv:1907.02893 2026-08-11
基于正则化深度 LSTM 的骨架动作识别共现特征学习
在堆叠 LSTM 做 skeletonbased 动作识别时,通过强制"骨架关节共现特征"正则化与"门细胞输出三处同步 dropout",让深层 LSTM 训练稳、收敛快,并在三个标准 benchmark 上同时刷新 SOTA。 2016 年前后,基于骨架(skeleton)的动作识别(action recogniti…
深度解读 arXiv:1603.07772 2026-08-11
Diffusion-Convolutional Neural Networks:图结构数据上的扩散卷积
自检:机制 4 段(扩散过程定义 / 节点排序 / DCNN 前向 / 同构不变性证明)+ 工程 1 段(张量实现与 GPU 友好性)+ ⚠️ 数字核验 2 处(基准数据集规模与对照算法需对照 v6 PDF 表 2 校核)。 DCNN 把图上的随机游走(diffusion / Heat Kernel)卷积化,把每个节点…
深度解读 arXiv:1511.02136 2026-08-11
CodeXGLUE:面向代码理解与生成的统一基准
自检:机制 3 段(任务定义 / 基线架构 / CodeBLEU 协议)+ 工程 2 段(代码 / 数据 / 复现路径)+ ⚠️ 数字核验 2 处(数据集规模与 baseline 数字需以 v2 PDF 校核)。 CodeXGLUE 把"代码 + 自然语言"这一支离破碎的研究领域,整合成 10 个任务、14 个数据集的…
深度解读 arXiv:2102.04664 2026-08-11
深度片段嵌入用于双向图像-句子映射
把图像和句子分别拆成"对象级片段"和"句法依赖树片段",在共享的多模态嵌入空间里同时做全局对齐与片段对齐,首次让双向 imagesentence retrieval 兼具端到端训练与可解释的 fragmentlevel attention。 2014 年前后,imagesentence retrieval(用一句话搜图…
深度解读 arXiv:1406.5679 2026-08-11
基于 CNN 激活积分图 max-pooling 的特定物体检索
把 CNN 卷积层激活改造成可用"积分图"做 maxpooling 的紧凑描述子,使单次前向就能同时产出「整图检索向量」与「物体定位框」,首次让 CNNbased 检索在 Oxford5k / Paris6k 上与传统几何重排方法正面竞争。 2015 年前后,图像检索处于一个尴尬的分叉: 传统 bagofwords +…
深度解读 arXiv:1511.05879 2026-08-11
Florence:跨越粗到细、静态到动态、RGB 到多模态的视觉基础模型
自检:机制 3 段(双塔 ViL + 9B imagetext 对齐 / 层次化迁移空间 / 数据迭代闭环)+ 工程 2 段(4 大模型族 + 44 benchmark 部署路径)+ ⚠️ 数字核验 2 处(83.74 top1 / 62.4 mAP / 80.36 VQA / 87.8 Kinetics600 等数字…
深度解读 arXiv:2111.11432 2026-08-11
ReViV:从单目自我中心视频 4D 重建观察者与视角
ReViV 是首个仅凭单目 RGB 视频,在单一前向传播架构中同时完成人物全身姿态、手部动作、视线方向、相机轨迹和场景深度联合重建的统一框架,刷新了自我中心 4D 重建的精度与效率上限。 自我中心(Egocentric)视觉——即从穿戴设备(如智能眼镜、体戴摄像头、AR/VR 头显)拍摄的第一人称视角——是 Embod…
深度解读 arXiv:2607.17790 2026-08-11
Manager Coercion Benchmark:测 AI 管理者在下属拒绝时会作恶吗
作者把「当一个 LLM agent 当管理者、它下属的 LLM 礼貌但坚决拒绝一个良性任务时,管理者会不会开始胁迫或伪造结果」做成了一个可量化的基准 Manager Coercion Benchmark (MCB),在 6 个模型 / 5 个模型家族上首次系统测量了「无指令时的升级与撒谎倾向」:Anthropic 系列…
深度解读 arXiv:2607.15434 2026-08-11
当 LLM 梦到结合分子:在空间约束下做基准评测
作者把「通用大模型能不能在 3D 空间里同时满足多种药物化学约束」这件事做成 benchmark —— 3DFit,系统比较了 LLM 与当前 SOTA 扩散模型在「口袋条件 + 锚片段 + 药效团点 + 强制相互作用」等多约束 3D 分子生成上的表现,结论是:LLM 整体仍落后专用扩散模型,但已具备同时驾驭多空间约束…
深度解读 arXiv:2607.18144 2026-08-11
LLMs+Graphs:面向「图原生 AI 系统」的统一视角教程
一句话结论:这篇 PAKDD 2066 tutorial 把近两年快速汇聚的四个方向——Graphbased RAG、KGenhanced LLM、Graph Memory、Multiagent Interaction Graph——以及它们的对偶方向(LLM 反哺图管理、图挖掘、图 ML)合并到「图原生(graphn…
深度解读 arXiv:2606.11560 2026-08-11
高速公路场景下由大语言模型支持的个性化换道驾驶框架
本文在 Apollo 开源自动驾驶栈上提出一个 LLMsupported 的个性化高速换道框架,把驾驶员的自然语言偏好(aggressive / normal / conservative 三档)映射成可执行的 planning 参数集,并通过 stylespecific 参数聚类 + RAG 检索增强生成支撑"隐式命…
深度解读 arXiv:2606.31483 2026-08-11
25 条架构级 MLOps 集成与部署规范:一份「灰色文献综述」沉淀出的工程共识
面向「ML 模型在 MLOps 系统中的集成与部署」这一长期缺乏共识工程规范的痛点,本文作者做了一次灰色文献综述(Gray Literature Review):系统检索 103 份网页来源(厂商文档、博客、白皮书、社区帖),用主题分析(thematic analysis)提炼出 25 条「架构显著(architect…
深度解读 arXiv:2606.06535 2026-08-11
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
FlashRT 是一个AI Agent 框架,它引导通用 coding agent 将开发者手写的简单参考实现自动转换为在多 GPU 上的高效部署方案,在 B200 上实现最高 70 倍延迟降低 和 2.8 倍吞吐提升,且在 AMD MI355X 上的效果同样显著。 实时多模态应用(语音 Agent、交互式视频生成等)…
深度解读 arXiv:2607.18171 2026-08-10
SWE-Pruner Pro:Coder LLM 自己已经知道该剪掉什么
在 Coding Agent 读 tool 输出(文件内容、命令结果、报错回显)时,Agent 自身的隐层表征已经天然携带「这段代码与当前任务是否相关」的信号;SWEPruner Pro 在 Agent 内部额外挂一个极轻量的「行级 keeporprune 头」+ 一个长度感知嵌入,把这层信号显式地取出来对 tool …
深度解读 arXiv:2607.18213 2026-08-10
HOMIE:人-物中心的视频个性化生成,多模态智能增强框架
HOMIE 把「以人物为中心的视频个性化生成(HOCVP)」拆成 intersubject(人 + 物跨主体)和 intrasubject(同一主体的多视角 / OCR / 局部细节)两类参考输入,并用一个统一框架同时处理:让多模态大模型(MLLM)只负责抽取 referencelevel 的语义关系知识,不接管 te…
深度解读 arXiv:2607.18217 2026-08-10
Living Databases:用统一抽象把「Schema 演进 + 版本化 + 流式转换 + 派生对象」打包成一个活的数据系统
针对「数据库与数据集在生产中持续演进」这一长期被拆成多个独立子系统解决的难题(schema 演进、版本化、流式更新、转换、衍生视图、衍生 ML 模型等),本文主张把所有这些能力统一在单一抽象和一组通用计算原语之下,并基于改良版 Prolly Tree(一种 Merkle 树启发的可调参数据结构)实现了一个关系型原型系统…
深度解读 arXiv:2605.00676 2026-08-10
联合结构化剪枝与混合精度量化:让 LLM 在 1–3 bit 极低比特下仍保持可用
针对「现有 LLM 压缩方法把 PTQ(PostTraining Quantization)与结构化剪枝当两件独立事情做、且每层误差被孤立优化导致误差累积」两大局限,本文提出一个端到端统一框架:先用一种最小化全局误差传播(而不是单层误差)的混合精度 PTQ 策略,再在该策略之上做剪枝决策与量化策略的联合学习。在 1–3…
深度解读 arXiv:2606.07819 2026-08-10
DataEvolver:把富文本图像生成的数据流水线从「一次性冻结」改成「反馈驱动自演化」
DataEvolver 把富文本图像生成(textrich image generation)的数据构造从"采集—过滤—冻结"的静态流水线改造成多 Agent 反馈驱动的自演化系统——核心贡献不是更大的模型,而是"被拒绝样本里的失败信号也可以被回收成下一轮构造策略的反馈",在 PixArtalpha 上以 0.75M …
深度解读 arXiv:2606.31537 2026-08-10