Explainers · 学术推广产出

解读

1096 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Chambon 2017:端到端多模态睡眠分期网络的奠基之作
Chambon 等人 2017 年在 arXiv 公开的"端到端多通道多模态睡眠分期网络"是 PSG(多导睡眠图)信号分类领域的第一篇"不抽频谱图、不手工特征、端到端训练、用全 PSG 模态"深度学习方案——它把"空间时间双卷积 + 30 秒窗口的时序上下文"封装为统一网络,在 61 个公开 PSG 记录上达到 SOT…
深度解读 arXiv:1707.03321 2026-08-07
DRIFT:用对抗 patch 偏转流匹配 VLA 的去噪轨迹
贴在机械臂夹爪上的一个通用对抗 patch 就能让流匹配 VLA(pi0 / pi0.5)在 LIBERO 四个套件上几乎 100% 失效,且只攻击第一个去噪步反而比攻击更宽步窗口更有效——这件事直接戳破了"流匹配 VLA 对对抗扰动天然鲁棒"的错觉。 视觉语言动作模型(VLA)正大量部署到机器人上,pi0 这类基于流…
深度解读 arXiv:2608.03207 2026-08-07
GDPevo:评估 agent 自进化能力的真实业务基准
GDPevo 把企业工作流拆成原子业务规则,按"训练任务用规则子集、测试任务重组未见规则子集"的方式构造基准,从而可归因地度量 agent 自进化能力;在四类 agent × 四类监督设置下,自进化在测试集上稳定提升最多 16.44 个百分点,但与全知 oracle 91.6% 的天花板仍有巨大差距。 "agent 自…
深度解读 arXiv:2608.03764 2026-08-07
BEiT:把 BERT 的掩码预训练范式搬进 Vision Transformer
BEiT(Bidirectional Encoder representation from Image Transformers)通过掩码图像建模(MIM)+ 离散视觉 tokenizer(DALLE 风格的 dVAE) 的两路视图,在 ImageNet1K 上让 ViTBase 达到 83.2%、ViTLarge …
深度解读 arXiv:2106.08254 2026-08-07
用任务同方差不确定性为多任务损失自动加权(Kendall et al., CVPR 2018)
这篇论文提出把多任务学习中各任务的损失权重重参数化为一个可学习的"同方差不确定性(homoscedastic uncertainty)"标量,完全不需要手调权重,在 monocular 深度、语义分割、实例分割三个回归+分类任务的联合训练中超过了各任务单独训练模型的水平。 多任务学习(MTL)听上去很美:一个网络同时输…
深度解读 arXiv:1705.07115 2026-08-07
Swin-Unet:纯 Transformer 的 U 形医学图像分割网络
SwinUnet 把 Swin Transformer 的层次化窗口注意力搬进对称的 U 形 Encoder–Decoder,并用 patch expanding 替代反卷积做上采样,首次给出了不依赖任何卷积的、端到端的纯 Transformer 医学图像分割架构,在多器官 CT 与心脏 MRI 数据集上验证可行。 医…
深度解读 arXiv:2105.05537 2026-08-07
基于工作流归纳的多轮智能体科学文献搜索(PaperPilot)
PaperPilot 把科学文献搜索建模成「工作流归纳」——给定一篇锚定论文与用户查询,Agent 自动构造一个由 keyword search、citation expansion、filtering、scoring、reranking、evidence extraction 等算子组成的有向无环图(DAG),通过监…
深度解读 arXiv:2607.00597 2026-08-07
A-TMA:解耦长时 Agent 记忆中的状态感知失效
ATMA 提出"幽灵记忆(ghost memory)"这一长时记忆失效现象——旧事实、当前事实与过渡事实共存于记忆库、检索时混在一起、误导最终答案——并设计 ATMA 这一状态感知叠加层(stateaware overlay),把当前 / 历史 / 过渡三类标签显式暴露给 QA 模块,配套发布了高冲突基准 LTP(Lo…
深度解读 arXiv:2607.01935 2026-08-07
DocOps:面向复杂文档操作的自主 Agent 可验证基准
DocOps 是首个对 AI Agent 文档操作能力进行确定性验证的层次化基准,揭示即使最先进的 frontier 模型在高度耦合、长范围的文档任务中仍存在系统性缺陷——长程状态追踪崩溃、语义验证浅表化、结构元数据被破坏性编辑。 大语言模型驱动的自主 Agent(LLMbased autonomous agents)…
深度解读 arXiv:2607.19865 2026-08-07
Mathematical Capabilities of ChatGPT
通过新数据集 GHOSTS/miniGHOSTS 对 ChatGPT 和 GPT4 的数学能力做了至今最细致的评估:两者均无法达到研究生水平,ChatGPT 适合作为数学搜索引擎,GPT4 可胜任本科数学但会在研究生级别题目上失败。 2023 年初,媒体大量报道 ChatGPT/GPT4 "通过医学考试""通过司法考试…
深度解读 arXiv:2301.13867 2026-08-07
StarCoder: may the source be with you!
BigCode 社区开源了 15.5B 参数的 StarCoder/StarCoderBase——首个在 80+ 编程语言上达到 SOTA 匹配 OpenAI codecushman001 的完全开源 Code LLM,并配套完整的数据治理框架 The Stack。 Code LLM 领域长期存在"开源不如闭源"的问题…
深度解读 arXiv:2305.06161 2026-08-07
LLM 写的代码到底对不对?一篇把代码 benchmark 打回原形的解读:EvalPlus / HumanEval+
通过大规模自动补充测试用例,把 HumanEval 的 164 道题从「每个题 710 个测试用例」扩成「每个题平均 764+ 个测试用例(80× 增幅)」,得到 HumanEval+ —— 结果令业界大跌眼镜:所有主流 LLM 的真实代码正确率比原榜单平均下降 19.328.9 个百分点,甚至部分模型的相对排名都发生…
深度解读 arXiv:2305.01210 2026-08-07
ENTRAP-VL:面向视觉-语言模型的双重上下文诱导探测基准
ENTRAPVL 不是一份"又一组 VQA 题",而是一套为研究 VLM 中"上下文诱导"现象而手工构建的分类学化探测工具:1500 条样本,沿"上下文与目标项的关联性 × 与事实真值的耦合"两条轴组织成 8 类,划分为文本诱导流(8 种上下文条件)与视觉诱导流(3 种上下文条件),目的不是给某个模型打分,而是给社区一…
深度解读 arXiv:2607.20092 2026-08-07
可微分逻辑门网络用于边缘设备低延迟 EEG 分类
这篇论文把可微分逻辑门网络(DiffLogic)——一种训练时模拟、推理时编译成纯布尔电路、按位 CPU 操作执行的"硬件原生"网络——首次系统地用于边缘设备上的实时 EEG 分类。在四个 EEG 数据集、两类任务(痴呆症二分类、3 类情绪识别)、50k–500k 四档参数规模上做严格 isoparameter 实验,…
深度解读 arXiv:2607.18149 2026-08-07
Color Pass-Through:用相机-显示耦合把"所见即所得"做到端到端
把相机和屏幕作为一个端到端可学习的耦合系统直接优化,跳过"分别标定 + 低维颜色变换"这条传统瓶颈链路,显著缩小"相机拍到的世界"和"屏幕上看到的画面"之间的颜色、亮度与对比度差距。 拍一张照片,再把照片传到屏幕上回放——这件事看起来平淡无奇,实际却是一个隐形的体验裂缝:原场景的色温、明暗、对比度、肤色还原,到屏幕上往…
深度解读 arXiv:2607.12746 2026-08-07
任务未定型时代:Kaddour 等《Challenges and Applications of Large Language Models》综述解读
本文是一篇面向机器学习研究者的 LLM 路线图——把 2022 年末到 2023 年中期混乱的 LLM 文献,整理成 1)通用能力与改进方向的开放问题清单,2)真实工程应用领域版图,3)落地时的实战踩坑提醒,让一个"懂 ML 但不熟 LLM"的人能少走半年弯路。 2023 年 Q2 前后,所有 ML 团队都在赶着上 L…
深度解读 arXiv:2307.10169 2026-08-07
对齐 LLM 也能被「通用对抗后缀」撬开:解读 GCG 越狱攻击
注:本文档按 arxiv ID 2307.15043 解读。该 ID 真实指向 Andy Zou 等人《Universal and Transferable Adversarial Attacks on Aligned Language Models》(即业内常称的 GCG 攻击 / Greedy Coordinate…
深度解读 arXiv:2307.15043 2026-08-07
ReOPD:多轮 Agent 蒸馏的前缀回放新范式
ReOPD(前缀回放在策略蒸馏)解决了多轮 Agent 训练中「在线蒸馏」成本过高的问题——通过复用预采集的教师轨迹作为「回放前缀」,让学生在无需调用工具、无需真实环境交互的情况下完成蒸馏训练,速度提升 4 倍以上,同时保持甚至超越在线 OPD 的精度。 在 LLM Agent 训练中,一个常见范式是 OnPolicy…
深度解读 arXiv:2607.04763 2026-08-07
AutoGen:用"会说话的智能体"搭下一代 LLM 应用
注:本卡 arXiv ID 在工作队列中曾被错误标注为 "AIKernel Semantic DSL Compiler and Deterministic Agent Execution Architecture"。经核实 arXiv 2308.08155 实际收录的论文为 Microsoft Research / P…
深度解读 arXiv:2308.08155 2026-08-06
K12-KGraph:面向教育 LLM 的课程对齐知识图谱基准
K12KGraph 首次将中国 K12 教材中的知识点结构(先修链、概念分类、实验关联、教学排序、视觉定位)显式建模为知识图谱,并由此导出 23,640 道选择题的评测基准 K12Bench——当前最强模型 Gemini3Flash 仅得 57%,Gemma431BIT 仅 46%,Prereq 和 Neighbor …
深度解读 arXiv:2605.09635 2026-08-06
PaLM 2 技术报告:Google 的"性价比路线"路线图
PaLM 2 不是"更大的 PaLM",而是用混合训练目标 + 更多非英语数据 + 更小但更聪明的尺寸三个维度同时压缩成本、提升多语言能力与推理能力,最终在多个 benchmark 上与 GPT4 正面竞争、并在推理效率上反超前代 PaLM 的 Transformer 语言模型家族。 2023 年 4 月,PaLM(5…
深度解读 arXiv:2305.10403 2026-08-06
FinanceComplexQA:面向工业级金融文档的智能体推理基准测试
本文发布 FinanceComplexQA:一个面向"工业级金融文档"的开放式智能体推理基准,包含 2,000 份合成的专业金融文档 + 6,000 个高质量问答对(另含 2,026 个深度研究任务),并配套 FinanceLaTeX Skill(基于 LaTeX 的专家级文档合成流程)与 AgentasaJudge …
深度解读 arXiv:2607.19238 2026-08-06
Distill Where You Fail:用自适应教师引导把 GRPO 的"零方差组"救回来
一句话结论:把 onpolicy distillation (OPD) 当"补丁"打——只在 GRPO 的零方差负组上、且只看高 student entropy 或大 teacherstudent 离散度的 token,并对这些样本额外补一轮 SFT。在数学 +3.02%、代码 +3.05% 之外,把 RL 后训练里"…
深度解读 arXiv:2608.00782 2026-08-06
AVE-Compass:首个音视频联合编辑能力全面评测基准
当前 SOTA 视频生成模型在同时编辑音频与画面时严重力不从心——AVECompass 通过 2,688 条细粒度检查项首次系统揭示了这一跨模态协同缺陷,并提出 AVEAgent 以模块化 Agent 架构显著改善指令执行与音画一致性。 以文本指令驱动视频编辑的技术近年来进展迅速,但现有 benchmark 存在两个根…
深度解读 arXiv:2607.24821 2026-08-06
Ego2Robot:用第一人称视频大规模合成机器人训练数据
一句话结论:Ego2Robot 把海量第一人称人类操作视频通过动作重定向、机械臂视觉合成与多级质量筛选,转化为 18,561 小时的机器人训练数据——覆盖 15 种机器人形态,是目前规模最大的 egotorobot 合成数据集,且在大规模预训练中验证了对分布外泛化的显著提升效果。 机器人操作策略泛化困难的根源之一是训练…
深度解读 arXiv:2608.02580 2026-08-06
WorldCycle:用可逆动作循环做自验证 RL,让视频世界模型少 drift
一句话结论:把"动作 + 反动作 = 回原点"作为天然校验信号,设计空间闭环 + 时序一致两个奖励,无需任何未来状态标注就能给长视野视频世界模型的 RL 后训练打分,把 statereturning drift 最多压掉 44%、复合动作准确率近 4×。 交互式视频世界模型(interactive video worl…
深度解读 arXiv:2608.04964 2026-08-06
BridgeVLA++:给 3D 机器人 VLA 装上一块"时空记忆"
一句话结论:在 3D point cloud + VLA(VisionLanguageAction)框架里新增统一时空记忆模块,让模型同时具备"空间场景持久化 + 时序交互历史"两点能力,同时保持 BridgeVLA 原本的数据效率与泛化,在两个 memorydependent 基准上刷 SOTA,并跨真实机器人平台与…
深度解读 arXiv:2608.05042 2026-08-06
K-EXAONE 2.0:韩国最大开源多语言 MoE 大模型,冲刺全球前沿
LG AI Research 通过"升级回收"(upcycling)KEXAONE 架构,将模型扩展至 750B 总参数 / 37B 激活参数的 MoE 架构,在 24 项 benchmark 上平均得分 70.1(相对前身提升超 10%),长上下文检索与安全两项尤为突出,并以 Apache 2.0 许可证完全开源。 …
深度解读 arXiv:2608.04505 2026-08-06
Teaching Nemotron Greek:把现代希腊语拉进 NVIDIA Nemotron 检索栈,并配套首个希腊语 RAG 大规模基准 HERA
把 NVIDIA Nemotron 检索栈(embedding + reranker + MoE reader)端到端适配到现代希腊语四类专业领域(法律、能源、金融、医疗),并发布首个大规模希腊语 RAG 基准 HERA;适配后 embedder 在 specialist 语料上 nDCG@10 从 0.362 飙到 …
深度解读 arXiv:2608.05138 2026-08-06
MultiPathFormer:把多径传播当作预训练对象的无线基础模型
提出 MultiPathFormer——一个把"多径传播"(multipath propagation)作为基本预训练 token 的无线基础模型,每个发射接收链路被表示成一条由连续值 path token 组成的有序序列,用 nextpath prediction 自回归训练;并引入 Environmental RA…
深度解读 arXiv:2608.05076 2026-08-06