研究库 深度解读
Explainers · 学术推广产出

解读

1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Steerling-8B:把可解释性「焊进」训练目标,扩散语言模型也能做闭环路干预
⚠️ 状态:未注明开源情况(abstract 无权重 / 代码发布声明;论文体量 12,100 KB,附录可能含完整实验,review 阶段数字可能调整) 论文挑战「可解释性 = 能力税」这一普遍假设,把可解释性作为训练约束与语言建模目标一起优化,在三个数量级的算力跨度、两种 LLM 范式(自回归 + 扩散)上证明:可…
深度解读 arXiv:2608.07594 2026-08-11
Factorized Hypothesis Search:用「分维度因子化假设」解开间接证据的检索难题
⚠️ 状态:Manuscript under review(abstract 无开源声明,权重 / 代码是否发布待正文核实) FHS 把「间接证据 → 分类法标签」的检索拆成沿若干语义维度的并行假设,再用结构化查询 + 维度级候选校验做排序,在金融分类标签和 CodiEsp 临床编码两个评测上都拿到非 oracle 方…
深度解读 arXiv:2608.06614 2026-08-11
Evo-Bench:当 LLM 开始改自己的 Agent Harness,评测该怎么重新做
EvoBench 是第一个专门评测「LLM 自主优化自己 Agent harness(执行框架)」能力的基准,覆盖 Search / Office / General 三个 Agent 域,并提出「辅助任务演化 + 敏感度感知分层切分」的构建框架来排除 base model 强度与任务过拟合的混淆;在 9 个前沿与开源…
深度解读 arXiv:2608.09096 2026-08-11
RynnValue:以「时间距离」作为跨具身奖励基础模型的监督锚点
针对通用机器人策略学习长期被"奖励模型"卡脖子的问题,RynnValue 用时间距离(temporal distance)取代人类偏好与归一化进度两类主流监督锚,在 7000+ 小时、约 300 万条指令条件片段上训练出开源价值基础模型,OOD 任务上 Kendall's τₐ 0.675 超过偏好监督 SOTA,且能…
深度解读 arXiv:2608.09853 2026-08-11
What to Edit Next:面向对话式图像创作的"下一步编辑"推荐系统
针对对话式图像创作助手"下一步编辑推荐"长期缺乏多模态方案的问题,Qwen App 团队公开了一个三阶段框架(SFT → 多目标 RL → 视觉验证器微调),在百万级真实用户的 A/B 测试中把推荐视觉不一致率从 3.7% 降到 0.9%,推荐 CTR 提升 32.70%、图片带走率提升 16.32%、人均对话轮次提升…
深度解读 arXiv:2608.07565 2026-08-11
OasisKV:用 Speculative Decoding 把 KV Cache 搬到 HBM 之外
OasisKV 是一个内存中心的 LLM 推理系统:在 decode 阶段把 KV cache 从 HBM 解耦出来,仅在 HBM 中保留"未来最相关 token"的 KV;通过 speculative decoding 草拟的 lookahead token 提前预测重要 KV 块,再从 host/remote me…
深度解读 arXiv:2608.08097 2026-08-11
Ouroboros:自演化、可审核的代码 Agent Harness
Ouroboros 提出一种"自演化 Agent 框架"——Agent 的工具、prompt、上下文组装乃至核心代码,都通过可审核的 commit 演进,新版本直接成为下一轮工作的运行时,并在 TerminalBench 2.1、OSWorldVerified、CLBench 三个代码/桌面 Agent 基准上同时刷新…
深度解读 arXiv:2608.08311 2026-08-11
Agent Memory Distillation:把大模型 Agent 的"三段记忆"蒸馏给小模型
AMD(Agent Memory Distillation)是一个免训练框架:让小语言模型(4B8B)通过"工作流—子任务—函数调用"三层结构化记忆,蒸馏大教师 Agent(GPT5mini 作为示例教师)的成功轨迹,在 AppWorld / BFCL V3 / ToolSandbox 三个工具调用基准上分别取得 +2…
深度解读 arXiv:2608.07169 2026-08-11
HiSparse:分层 KV 缓存管理扩展稀疏注意力解码
首段自检:机制段 3 / 工程段 3 / ⚠️ 数字核验 4 处(4.7× peak throughput / H200/B200/GH200 三平台 / 三种 sparseattention 家族 / 已合入上游 SGLang 均来自 abstract,已二次核验 v1);私域编号清除已执行。 HiSparse 把稀…
深度解读 arXiv:2608.07009 2026-08-11
LitTraceQA:科学问答中的多阶段定位与验证基准(论文检索 → 证据定位 → 答案生成 三段评测)
首段自检:机制 3 段(三段输出契约:paper ID + evidence location + answer · 五类证据:表格 / 图形 / 文本段 / 公式或算法 / 引用上下文 · 三段评测:检索 / grounding / 答案准确率独立打分)+ 工程 2 段(公开 55 例 dev split 含 26 …
深度解读 arXiv:2608.07370 2026-08-11
基于分类法的开源 AI 风险缓解工具分析(21 工具 × MIT AI Risk Taxonomy 32 子类映射)
首段自检:机制 3 段(LLM 辅助 RAG 抽取能力 · 21 工具 × 32 子类二值映射矩阵 · Fleiss Kappa 0.509 多人独立复核 + 多数投票 F1=75.5%)+ 工程 2 段(21 个开源工具枚举 · 映射协议可直接套用到任何工具集)+ ⚠️ 数字核验 3 处("21 tools / 32…
深度解读 arXiv:2608.07446 2026-08-11
Enfold:将世界模型的"想象计算"折叠进预测表征以实现超高效具身控制
首段自检:机制 3 段(生成器中间状态蒸馏 · 当前编码器与任务头梯度隔离 · 多层级 future supervision)+ 工程 2 段(LIBERO/RoboTwin2.0/真机三类任务 + FastWAM 3.7×/EnfoldFlash 10.1× 延迟实测)+ ⚠️ 数字核验 3 处("3.7× / 10…
深度解读 arXiv:2607.26657 2026-08-11
DCAS:解耦 CLI Agent 脚手架以实现跨脚手架的规划内化
首段自检:机制 3 段(DCAS 拦截层 · 显式规划 vs 隐式规划二分 · 计划源受控干预实验)+ 工程 2 段(backendsubstitution 拦截层 + 单脚手架采集的轨迹让模型跨脚手架泛化)+ ⚠️ 数字核验 3 处("gains exceeding crossscaffold drops"为定性 ·…
深度解读 arXiv:2608.06113 2026-08-11
多智能体取证推理实现可泛化的深度伪造视频检测(ARGUS / FaceVid-Forensics-100K)
首段自检:机制 3 段(多模型聚合冲突解决管线生成 100K 标注 · 4 专家 Agent 取证分视角 · Judge Agent 报告调和)+ 工程 2 段(100K / 33 种合成方法的 FaceVidForensics100K 数据集 · 全小开源 MLLM 击败 GPT/Gemini)+ ⚠️ 数字核验 3…
深度解读 arXiv:2608.06865 2026-08-11
EAHR:去掉固定 Top-L,让 RAG 的混合检索第一次做到「精确 + 自适应」
EAHR(Exact Adaptive Hybrid Retrieval)把现代 RAG 系统里「dense + sparse 融合时取固定 TopL」这个隐性工程假设直接拆掉:把「完整列表加权 RRF 的有序 TopK」固定为检索目标,把通道深度当成请求级别的执行状态,通过 PVS(PerVector Scalar …
深度解读 arXiv:2608.07152 2026-08-11
Referential Dangling:硬提示压缩中被忽视的范式级失效模式
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×5(0.30 压缩率、3454% dangling、6 compressors ≤60%、2934 pp 提升 / p<0.0001、88% gap 恢复、GPT5.5 8.8 pp、classifier 4.7 pp / 0.30→0.31)· 风险边界段 …
深度解读 arXiv:2608.04569 2026-08-11
CLIP-CC-Bench:评估视频-语言模型的段落级视频描述能力
CLIPCCBench 是一个面向长篇视频描述的评测套件:基于 5 小时电影内容切成 90 秒片段,每段配专家撰写的段落式参考,采用 5 个 SOTA 嵌入模型集成 + 粗细两套语义匹配方法,对 17 个 SOTA 视频语言模型做了 Borda 排序,并量化了评估协议本身的内部一致性(interjudge agreem…
深度解读 arXiv:2608.04302 2026-08-11
CoinRAG:用上下文信息要点 KV 缓存复用换长上下文 RAG 的 Pareto 前沿
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×2(5.3% 平均 F1 相对提升、新 Pareto 前沿、标准 fast prefill latency budget)· 风险边界段 ×1 · 反方段 ×1 CoinRAG 把 RAG 长上下文处理里的 chunk 级 KV 缓存复用再下推到「nugget…
深度解读 arXiv:2608.07458 2026-08-11
用于量子动力学预测的互补矩阵门控 QKAN 快权重编程器
用一对互补的 sigmoid 矩阵门(retain 旧状态 + write 新提案)替代 QKAN 快权重编程器里的标量门,实现坐标级(coordinatewise)的记忆时间尺度控制,并在 JaynesCummings 与 transmonresonator 多步预测上把 MSE 维持在 ≤ 0.001,相比标量门版…
深度解读 arXiv:2607.27945 2026-08-11
MatrAIx:用 83 亿 Persona Agent 模拟世界
MatrAIx 是一个面向 AI 系统与数字产品的大规模模拟用户评估基础设施,由 83 亿 persona 记录(1290 个类别维度)+ 4 个交互环境(Survey / Chatbot / Web / App)+ 1010 个应用任务组成;在 8 个代表性任务上跑了 18,189 次评估试验,对照 400trial…
深度解读 arXiv:2608.04205 2026-08-11
Manifold Mixup:在隐藏状态空间做插值,让决策边界天然平滑
Manifold Mixup 把输入空间的 Mixup 扩展到神经网络的任意隐藏层:训练时在随机选中的某一层对两个样本的隐藏表征做线性插值,再让后续层在该插值点继续前向并计算损失,由此鼓励网络在多层语义流形上都学到「线性行为」;结果是在不显著增加算力的前提下,模型在监督学习鲁棒性、对单步对抗攻击的防御、以及测试集对数似…
深度解读 arXiv:1806.05236 2026-08-11
decaNLP 与 MQAN:把十项 NLP 任务统一成问答的十年回看
decaNLP(Natural Language Decathlon)把问答、翻译、摘要、自然语言推理、情感分析、语义角色标注、零样本关系抽取、目标导向对话、语义解析和指代消解这十项 NLP 任务统一改写为「带上下文的问答」,并提出一个无需任何任务专属模块就能联合学习的 MQAN(Multitask Question …
深度解读 arXiv:1806.08730 2026-08-11
Invariant Risk Minimization(IRM):跨分布不变的因果式学习范式
IRM 提出「学习一个表示,让最优分类器在该表示之上对所有训练分布都同时最优」这条新原则,把 OOD 泛化从「经验风险最小化 + 数据扩充」的传统思路,拉到「不变因果机制」这一更高层级。 经典 ML 默认 i.i.d.:训练分布 = 测试分布。但现实里几乎所有生产数据都存在分布漂移——医院 A 训练的影像模型到医院 B…
深度解读 arXiv:1907.02893 2026-08-11
基于正则化深度 LSTM 的骨架动作识别共现特征学习
在堆叠 LSTM 做 skeletonbased 动作识别时,通过强制"骨架关节共现特征"正则化与"门细胞输出三处同步 dropout",让深层 LSTM 训练稳、收敛快,并在三个标准 benchmark 上同时刷新 SOTA。 2016 年前后,基于骨架(skeleton)的动作识别(action recogniti…
深度解读 arXiv:1603.07772 2026-08-11
Diffusion-Convolutional Neural Networks:图结构数据上的扩散卷积
自检:机制 4 段(扩散过程定义 / 节点排序 / DCNN 前向 / 同构不变性证明)+ 工程 1 段(张量实现与 GPU 友好性)+ ⚠️ 数字核验 2 处(基准数据集规模与对照算法需对照 v6 PDF 表 2 校核)。 DCNN 把图上的随机游走(diffusion / Heat Kernel)卷积化,把每个节点…
深度解读 arXiv:1511.02136 2026-08-11
CodeXGLUE:面向代码理解与生成的统一基准
自检:机制 3 段(任务定义 / 基线架构 / CodeBLEU 协议)+ 工程 2 段(代码 / 数据 / 复现路径)+ ⚠️ 数字核验 2 处(数据集规模与 baseline 数字需以 v2 PDF 校核)。 CodeXGLUE 把"代码 + 自然语言"这一支离破碎的研究领域,整合成 10 个任务、14 个数据集的…
深度解读 arXiv:2102.04664 2026-08-11
深度片段嵌入用于双向图像-句子映射
把图像和句子分别拆成"对象级片段"和"句法依赖树片段",在共享的多模态嵌入空间里同时做全局对齐与片段对齐,首次让双向 imagesentence retrieval 兼具端到端训练与可解释的 fragmentlevel attention。 2014 年前后,imagesentence retrieval(用一句话搜图…
深度解读 arXiv:1406.5679 2026-08-11
基于 CNN 激活积分图 max-pooling 的特定物体检索
把 CNN 卷积层激活改造成可用"积分图"做 maxpooling 的紧凑描述子,使单次前向就能同时产出「整图检索向量」与「物体定位框」,首次让 CNNbased 检索在 Oxford5k / Paris6k 上与传统几何重排方法正面竞争。 2015 年前后,图像检索处于一个尴尬的分叉: 传统 bagofwords +…
深度解读 arXiv:1511.05879 2026-08-11
Florence:跨越粗到细、静态到动态、RGB 到多模态的视觉基础模型
自检:机制 3 段(双塔 ViL + 9B imagetext 对齐 / 层次化迁移空间 / 数据迭代闭环)+ 工程 2 段(4 大模型族 + 44 benchmark 部署路径)+ ⚠️ 数字核验 2 处(83.74 top1 / 62.4 mAP / 80.36 VQA / 87.8 Kinetics600 等数字…
深度解读 arXiv:2111.11432 2026-08-11
ReViV:从单目自我中心视频 4D 重建观察者与视角
ReViV 是首个仅凭单目 RGB 视频,在单一前向传播架构中同时完成人物全身姿态、手部动作、视线方向、相机轨迹和场景深度联合重建的统一框架,刷新了自我中心 4D 重建的精度与效率上限。 自我中心(Egocentric)视觉——即从穿戴设备(如智能眼镜、体戴摄像头、AR/VR 头显)拍摄的第一人称视角——是 Embod…
深度解读 arXiv:2607.17790 2026-08-11