Explainers · 学术推广产出

解读

1094 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

上下文学习综述:把 GPT-3 那一道"涌现"系统化讲清楚的中文研究者代表作
一句话结论:清华 + 北大 + 苏州大学 + 微软亚研的 Dong、Li、Dai 等 14 人合著的这篇综述(2022 年 12 月 v1、2024 年 10 月 v6,长达 8,290 KB),把"incontext learning (ICL)"从 GPT3 那篇 2020 年的 32 个示例小实验,扩展成覆盖 训…
深度解读 arXiv:2301.00234 2026-08-12
What do We Need to Build Explainable AI Systems for the Medical Domain?
医疗领域的 AI 模型必须是可解释的,不仅因为医学专业本身要求决策透明,更因为 GDPR 等法规要求在特定情况下能够追溯自动化决策的根据;本文系统梳理了医学 AI 面临的核心挑战,并从医学影像、组学数据和自然语言三类主要数据模态出发,阐述了可解释 AI(XAI)的研究方向及其对医疗落地的意义。 深度学习在医学影像诊断(…
深度解读 arXiv:1712.09923 2026-08-12
AdaTrans:用「错误自适应」的策略级 RAG 把 C 代码自动转 Rust
AdaTrans 把「C → Rust」这个比 CtoC++ 难几个数量级(Rust 的所有权/借用语义必须显式保证)的语言迁移任务,包装成一个 strategydriven RAG + 错误分层策略 + 多阶段验证 的工程流水线:在 104 个算法题的评测集上拿到了 平均编译通过率 95.51% 与 题目解题率 81…
深度解读 arXiv:2606.31706 2026-08-12
二十年物体检测综述:从 Viola-Jones 到深度学习时代
Zhengxia Zou 等人用一份 400+ 页的综述把「物体检测」从 1990 年代的 ViolaJones 一路梳理到 2022 年的深度学习 SOTA,按里程碑检测器、数据集与指标、骨干网络、加速技巧四象限归类,是把「检测这件事到底是什么」讲得最系统的一份工程地图。 物体检测(object detection)…
深度解读 arXiv:1905.05055 2026-08-12
大语言模型的涌现能力:定义、证据与争议
一句话结论:Wei 等人把"小模型没有、模型大到某个尺度后突然出现的能力"命名为 emergent abilities,并用 BIGBench、PaLM、LaMDA 等公开实验绘制了第一张涌现能力地图,由此引发学界关于"涌现究竟是模型内禀现象还是评测指标选型的人为产物"的持续争论。 自检:机制 1 段(涌现定义与判定方…
深度解读 arXiv:2206.07682 2026-08-12
门控图序列神经网络:把 GNN 升级成序列预测器的那篇 ICLR 2016 经典
一句话结论:Li 等人把 Scarselli 2009 年提出的 Graph Neural Network 用 GRU 改造并扩展到序列输出,得到 Gated Graph Sequence Neural Networks(GGSNN)——这一架构在 ICLR 2016 上同时拿下"图结构表征 + 程序验证子图匹配 SO…
深度解读 arXiv:1511.05493 2026-08-12
广义 OOD 检测综述:把异常 / 新颖 / 开放集 / 离群点五件事说成一件事
一句话结论:Yang 等人把"异常检测 / 新颖检测 / 开放集识别 / OOD 检测 / 离群点检测"五类问题统一到一个 Generalized OOD Detection 框架下,主张这五者在动机上同源、方法上互通——并在 3000 多页的综述里梳理出分类式、密度式、距离式三条方法主线,是后续 OOD 论文的术语共…
深度解读 arXiv:2110.11334 2026-08-12
多任务 Prompt 微调:让小模型也能 zero-shot 泛化——FLAN/T0 论文深度解读
通过将大量 NLP 任务统一转化为自然语言 prompt 格式,再用 encoderdecoder 模型(T5)做多任务联合微调,能让仅 137M 参数的模型在多个未见任务上达到甚至超越 175B 参数 GPT3 的 zeroshot 性能——这证明了显式多任务学习而非隐式预训练才是 zeroshot 泛化的关键。 G…
深度解读 arXiv:2110.08207 2026-08-12
TrustMargin:免训练的「直接回答 vs RAG」仲裁层
一句话结论:给定同一冻结 LLM 产出的「Direct 答案」与「RAG 答案」,TrustMargin 用模型自身的对数似然组合成两个 margin(参数记忆的接受度 + 检索证据对问题的特异性支持),在不微调、不调用外部裁判、不再额外生成的前提下,自动决定信哪一个。它在 2WikiMQA / CWQA 上用 LLa…
深度解读 arXiv:2606.08397 2026-08-12
Tutti:把 SSD 当 KV Cache 主力存储的生产级方案
一句话结论:Tutti 把 CPU 从 HBM↔SSD 的关键 I/O 路径里彻底剔除,改成 GPU 直接驱动 NVMe(GPU io_uring + GPU 原生 KV cache 对象抽象 + slackaware 调度),把 GDS 仍存在的 CPU 瓶颈变成「GPU 自己管对象」,结果相对 SSDbacked …
深度解读 arXiv:2605.03375 2026-08-12
多模态大模型到底懂不懂 OCT?OCT-Bench 给出的系统答卷
OCTBench 用 10,076 道多选题、4,137 张 OCT 图像、覆盖 20 个细粒度能力子任务(分 Perception / Cognition / Reasoning 三层),系统评估了 20 个代表性 MLLM,结论是当前所有模型离"可临床落地的 OCT 理解"都还有相当距离,而且"换更大的模型"或"做…
深度解读 arXiv:2607.16609 2026-08-11
ShotPlan:用可学习规划 token 拍出多镜头电影级视频
ShotPlan 在视频扩散基础模型上引入一组"可学习规划 token"作为镜头级过渡的显式控制信号,配合 Fractional Temporal Rotary Position Embedding(FRoPE)实现帧级时间建模,让模型能按预设时间戳做多镜头切换,实验显示在跨镜头一致性和镜头管理灵活性上都显著优于现有电…
深度解读 arXiv:2607.17675 2026-08-11
用 Chunk Coverage 测试 RAG 系统:不给参考答案也能衡量检索覆盖度
作者提出了 Chunk Coverage (CC):一种不依赖参考答案或相关性标注的 RAG 检索组件测试充分性准则。CC 衡量「在整个测试套件中,语料库的每个 chunk 至少被检索到一次的比例」,把 RAG 测试从「查询级别」抬到「语料级别」。在临床与金融领域两类 RAG 场景下,CC 引导的用例选择比随机策略快 …
深度解读 arXiv:2607.18155 2026-08-11
用于交互式放射学报告起草的离散扩散语言模型
把一个 MoE 离散扩散语言模型 DiffusionGemma26B 适配到医学影像问答与放射报告起草场景,在相同的 LoRA 配置下与同规模自回归模型 Gemma426B 打平甚至略胜,且解码速度提升 3.5–4.4 倍;更难能可贵的是,扩散模型天生适合"任意位置填词"的交互式起草,让放射科医生能先固定某些句子片段,…
深度解读 arXiv:2607.01436 2026-08-11
LaMDA:面向对话的大语言模型与安全 / 事实性增强
LaMDA 是 Google 在 2022 年公开的对话专用 Transformer 系列 LLM(最大 137B 参数,1.56T 词预训练),系统论证了「仅靠 scale 不能解决 safety 与 factual grounding」——必须靠微调 + 调用外部知识源(检索 / 翻译 / 计算器)才能让对话模型既…
深度解读 arXiv:2201.08239 2026-08-11
AGE:面向图检索增强生成中图嵌入的自适应掩码方法
⚠️ Jay 补录:原始版本(20260723)无首段自检、无数字核验标注,W32 精修补录本文。本文件关联论文为 graph embedding 方法论文,与 2607.23379(Activation Oracle)完全无关,原自检中"nearidentical loss / up to 41%"数字系 2608.…
深度解读 arXiv:2607.00052 2026-08-11
当激活预言机学会不去读取:微调预言机中的概念特定盲区
首段自检:机制段 3 / 工程段 2 / ⚠️ 数字核验 2 处(Taboo 实验设定为单 SR 报告;"nearidentical loss" 与 "up to 41%" 等表述以 abstract 为准、未独立核验 v1 PDF);私域编号清除已执行。 ⚠️ 就地修正:原文"单 SR 报告"与 abstract "…
深度解读 arXiv:2607.23379 2026-08-11
高效 LLM 知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失
首段自检:机制段 3 / 工程段 3 / ⚠️ 数字核验 3 处(29% / 41% / 4× context 直接来自 abstract,可核验;扩展性 claim 256K 来源于 isolated kernel benchmark 段落,已二次核验);私域编号清除已执行。 通过把 KD 训练从"在线重算教师 lo…
深度解读 arXiv:2608.03796 2026-08-11
DuplexGen:面向场景自适应的人-AI 全双工轮替对话合成
⚠️ 状态:Manuscript under review(abstract 无开源声明;数字未定稿,结论可能调整) 自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×2(6 个任务场景与 slotlevel 偏好量、fullduplex 模型训练细节)· 风险边界段 ×1 · 反方段 ×1 DuplexGe…
深度解读 arXiv:2607.26178 2026-08-11
Steerling-8B:把可解释性「焊进」训练目标,扩散语言模型也能做闭环路干预
⚠️ 状态:未注明开源情况(abstract 无权重 / 代码发布声明;论文体量 12,100 KB,附录可能含完整实验,review 阶段数字可能调整) 论文挑战「可解释性 = 能力税」这一普遍假设,把可解释性作为训练约束与语言建模目标一起优化,在三个数量级的算力跨度、两种 LLM 范式(自回归 + 扩散)上证明:可…
深度解读 arXiv:2608.07594 2026-08-11
Factorized Hypothesis Search:用「分维度因子化假设」解开间接证据的检索难题
⚠️ 状态:Manuscript under review(abstract 无开源声明,权重 / 代码是否发布待正文核实) FHS 把「间接证据 → 分类法标签」的检索拆成沿若干语义维度的并行假设,再用结构化查询 + 维度级候选校验做排序,在金融分类标签和 CodiEsp 临床编码两个评测上都拿到非 oracle 方…
深度解读 arXiv:2608.06614 2026-08-11
Evo-Bench:当 LLM 开始改自己的 Agent Harness,评测该怎么重新做
EvoBench 是第一个专门评测「LLM 自主优化自己 Agent harness(执行框架)」能力的基准,覆盖 Search / Office / General 三个 Agent 域,并提出「辅助任务演化 + 敏感度感知分层切分」的构建框架来排除 base model 强度与任务过拟合的混淆;在 9 个前沿与开源…
深度解读 arXiv:2608.09096 2026-08-11
RynnValue:以「时间距离」作为跨具身奖励基础模型的监督锚点
针对通用机器人策略学习长期被"奖励模型"卡脖子的问题,RynnValue 用时间距离(temporal distance)取代人类偏好与归一化进度两类主流监督锚,在 7000+ 小时、约 300 万条指令条件片段上训练出开源价值基础模型,OOD 任务上 Kendall's τₐ 0.675 超过偏好监督 SOTA,且能…
深度解读 arXiv:2608.09853 2026-08-11
What to Edit Next:面向对话式图像创作的"下一步编辑"推荐系统
针对对话式图像创作助手"下一步编辑推荐"长期缺乏多模态方案的问题,Qwen App 团队公开了一个三阶段框架(SFT → 多目标 RL → 视觉验证器微调),在百万级真实用户的 A/B 测试中把推荐视觉不一致率从 3.7% 降到 0.9%,推荐 CTR 提升 32.70%、图片带走率提升 16.32%、人均对话轮次提升…
深度解读 arXiv:2608.07565 2026-08-11
OasisKV:用 Speculative Decoding 把 KV Cache 搬到 HBM 之外
OasisKV 是一个内存中心的 LLM 推理系统:在 decode 阶段把 KV cache 从 HBM 解耦出来,仅在 HBM 中保留"未来最相关 token"的 KV;通过 speculative decoding 草拟的 lookahead token 提前预测重要 KV 块,再从 host/remote me…
深度解读 arXiv:2608.08097 2026-08-11
Ouroboros:自演化、可审核的代码 Agent Harness
Ouroboros 提出一种"自演化 Agent 框架"——Agent 的工具、prompt、上下文组装乃至核心代码,都通过可审核的 commit 演进,新版本直接成为下一轮工作的运行时,并在 TerminalBench 2.1、OSWorldVerified、CLBench 三个代码/桌面 Agent 基准上同时刷新…
深度解读 arXiv:2608.08311 2026-08-11
Agent Memory Distillation:把大模型 Agent 的"三段记忆"蒸馏给小模型
AMD(Agent Memory Distillation)是一个免训练框架:让小语言模型(4B8B)通过"工作流—子任务—函数调用"三层结构化记忆,蒸馏大教师 Agent(GPT5mini 作为示例教师)的成功轨迹,在 AppWorld / BFCL V3 / ToolSandbox 三个工具调用基准上分别取得 +2…
深度解读 arXiv:2608.07169 2026-08-11
HiSparse:分层 KV 缓存管理扩展稀疏注意力解码
首段自检:机制段 3 / 工程段 3 / ⚠️ 数字核验 4 处(4.7× peak throughput / H200/B200/GH200 三平台 / 三种 sparseattention 家族 / 已合入上游 SGLang 均来自 abstract,已二次核验 v1);私域编号清除已执行。 HiSparse 把稀…
深度解读 arXiv:2608.07009 2026-08-11
LitTraceQA:科学问答中的多阶段定位与验证基准(论文检索 → 证据定位 → 答案生成 三段评测)
首段自检:机制 3 段(三段输出契约:paper ID + evidence location + answer · 五类证据:表格 / 图形 / 文本段 / 公式或算法 / 引用上下文 · 三段评测:检索 / grounding / 答案准确率独立打分)+ 工程 2 段(公开 55 例 dev split 含 26 …
深度解读 arXiv:2608.07370 2026-08-11
基于分类法的开源 AI 风险缓解工具分析(21 工具 × MIT AI Risk Taxonomy 32 子类映射)
首段自检:机制 3 段(LLM 辅助 RAG 抽取能力 · 21 工具 × 32 子类二值映射矩阵 · Fleiss Kappa 0.509 多人独立复核 + 多数投票 F1=75.5%)+ 工程 2 段(21 个开源工具枚举 · 映射协议可直接套用到任何工具集)+ ⚠️ 数字核验 3 处("21 tools / 32…
深度解读 arXiv:2608.07446 2026-08-11