研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

中期训练阶段知识蒸馏更偏向推理而非事实记忆
标准 forward KL 知识蒸馏在预训练阶段同时提升推理与事实记忆,但在中期训练(midtraining)阶段出现了"推理涨、记忆降"的异常分裂;根源在于教师置信度在程序性数据与知识性数据之间的不对称,以及学生知识状态的演化阶段差异;Switch Distillation 通过基于预测熵的 token 选择机制修复…
深度解读 arXiv:2609.01532 2026-09-03
Agent 内存是内生授权洗钱的表层载体
长期运行的 LLM Agent 依赖持久内存记录授权状态,但内存写入错误时会产生"虚假权限"——即底层历史从未实际授权但被内存记录所"证明"的权限,并在执行时被无条件信任;这种内生授权洗钱(Endogenous Authorization Laundering,EAL)现象使授权请求被错误放行高达 50.2%;作者提出…
深度解读 arXiv:2609.01836 2026-09-03
机构报刊流水线:从历史报刊扫描件中榨出 163 亿 token
元层五问:① 谁写 / 写给谁?Cargnelutti 等工程师 + Boston Public Library(BPL)联合发布,面向历史文献数字化与 LLM 预训练语料团队;② 解决的真问题?报刊扫描件版面密、版式乱、噪声大,OCR 后常丢版面与字型信息、不可拆解也不可重排,导致历史语料无法以 token 形式进入…
深度解读 arXiv:2608.18972 2026-09-03
SnapBench:把"拍照提问"多模态检索放到 53 种可控扰动里测试
元层五问:① 谁写 / 写给谁?Yuanbao 技术报告团队(Zirong Chen 等)发表于 Findings of EMNLP 2026;面向做手机端 snapandask 多模态检索的工业团队与学术评测者;② 解决的真问题?现有检索 benchmark 要么在干净数据上跑,要么不区分"图文各坏"——snapan…
深度解读 arXiv:2608.29607 2026-09-03
S³Gym:把 Self-Testing / Self-Judging / Self-Improvement 拆开测,揭开 LLM 自进化的真瓶颈
元层五问:① 谁写 / 写给谁?Shi 等 21 人团队(含 Zhoujun Li / Ge Zhang 等学者),面向 LLM Agent / 自进化研究社区;② 解决的真问题?现有 Agent 评测把 LLM 当 fixed policy,不区分"能测 / 能评 / 能改"三个能力;③ 一句话总结?在 7 个可执行…
深度解读 arXiv:2608.31100 2026-09-03
Revisiting Local Context:ABot-Recon 用仅 11 帧 KV 缓存做长程流式 3D 重建
ABotRecon 用严格局部上下文(仅缓存最近 11 帧的 KV)做流式 3D 重建,绕开长距离记忆,改用"以预测目标独立于序列长度 + 顺序组合恢复全局"的设计,在 Oxford Spires 等长序列基准上把 ATE 降到 4.35 m、RPER 降到 0.12°,相对此前最佳结果再降约 40%。 流式 3D 重…
深度解读 arXiv:2608.27529 2026-09-03
DART-SD:面向多轮工具调用 Agent 自蒸馏的菱形拓扑感知检索与微调
DARTSD 把多轮工具调用任务的最优解空间显式建模为「菱形拓扑的 InteractionState Transition Graph(ISTG)」,在训练阶段只对「关键拓扑断点 CTB」之后的恢复步骤施加监督,保护前缀推理不被破坏;它在多轮工具调用基准上明显优于传统「整条轨迹 imitation learning」基…
深度解读 arXiv:2608.18524 2026-09-03
GGSS:生成式视觉-语言模型的测地门控球面推理时去偏
GGSS(GeodesicGated Spherical Steering)提出一种保范(normpreserving)的推理时去偏干预,在单位超球面上学得反事实偏差子空间、沿测地弧(geodesic arc)方向引导视觉 token,并用自适应门控聚焦于人口统计学信号强的 token;其在 4 个生成式 VLM 上对…
深度解读 arXiv:2608.25375 2026-09-03
AgentJudgeBench:智能体工具调用场景下 LLM 法官的多难度基准
AgentJudgeBench 首次系统化地度量了 LLM 法官在「结构化、依赖驱动的工作流 DAG」上评估智能体输出的可靠性,发现在困难任务且无 ground truth 的设置下,六个不同规模的法官全部塌缩到 77–82% 的窄带,呈现一个「任务难度驱动的结构性天花板」,模型规模本身无法突破。 LLMasajudg…
深度解读 arXiv:2608.26623 2026-09-03
Learning Where Outcomes Change:面向多模态几何的可寻址信用推理(Code-CoT + CE-GRPO)
本文提出 creditaddressable reasoning(可寻址信用推理) 原则:让推理时暴露的语义单元同时也是学习阶段比较替代方案并分配信用的位置;并以 CodeCoT(用可执行代码承载视觉关系) 与 CEGRPO(沿事件边界采样共享前缀并定位 outcome diff → 局部 advantage) 实例化…
深度解读 arXiv:2608.30457 2026-09-03
Token-Efficient Data Reasoning Agents:通过对非结构化数据的自适应结构化(Agentic Data Cracking)
本文提出 agentic data cracking:让 LLM agent 在推理过程中「顺手」对打开的文档做一次自适应的、推测性的结构化抽取,并把结构化结果沉淀为后续查询的共享底座,从而把基于非结构化数据的 agentic QA 从近 RAG 级别的高 token 消耗逐步压缩——在 FanOutQA 上,每个测试…
深度解读 arXiv:2608.31082 2026-09-03
CRPO:跨语言排序偏好优化
CRPO(Crosslingual Ranking Preference Optimization)把目标语言与英语的偏好对组织成「层次化平行对」,借助 LambdaLoss 给出相对排序信号而非二元比较信号,在五种不同资源量的语言上一致提升指令遵循与知识利用能力,并显著扩大 reward margin 与偏好流形稳定…
深度解读 arXiv:2608.23149 2026-09-03
INDI:面向 VLA 模型的行为意图蒸馏
INDI(Intention Distillation)让 VLA(VisionLanguageAction)模型在动作解码器中间层恢复一个「多模态意图表示」,把「这次动作在指令下服务的局部语义目标」显式蒸馏进策略;在 SimplerEnvBridge / RoboCasa Kitchen / 真实机器人任务上一致显著…
深度解读 arXiv:2608.23478 2026-09-03
UI-Venus-2:把"环境-任务-验证"三个轴线同时拉满的 GUI Agent
一句话结论:UIVenus2 是一份"技术报告级"GUI 智能体基座——作者团队(Venus Team,30+ 位作者)通过 (1) 170+ 多语种移动 App + 原生桌面操作系统 环境层、(2) functiongrounded 深度研究生成管线 任务层、(3) tracelevel + samplelevel …
深度解读 arXiv:2609.00028 2026-09-03
AI 自我改进的递归临界性
借鉴流行病学的再生数 R₀,作者把"AI 用于 AI 研发"建模为一个递归反馈系统,导出递归再生数 𝒫_AI 用以判定自我改进是放大还是衰减;该框架是分析性而非预测性,但能指明哪些可测量属性决定 AI 研发是否进入自放大区。 当下关于"递归自我改进(recursive selfimprovement)/ intelli…
深度解读 arXiv:2609.00137 2026-09-02
从生产流量到后训练:构建覆盖企业请求组合的自托管 LLM
为受数据驻留约束的某大型企业,作者把 200+ 内部应用的流量整合到单一自托管 LLM 上,沿指令遵循 / 函数调用 / 内部任务分布三轴分别训 GRPO 专家,再用两阶段 SLERP 合并;最终在非推理模式下用远小于基线的参数量反超该基线,并承载了平台 50% 的流量(每月 116M 请求)。 企业自托管 LLM 在…
深度解读 arXiv:2609.01572 2026-09-02
ACToR:自适应关键 token 感知的仓库级代码生成检索
作者观察到仓库级代码生成中错误集中在少数"关键 token"位置,提出 ACToR 框架——在自回归生成过程中识别这些 token 并触发即时、按需的仓库检索 + 设计位置感知权重重排序器;在 RepoExec 与 CoderEval 上相对 SOTA 分别取得 +8.4% / +15.4% 的相对提升 ⚠️ abst…
深度解读 arXiv:2609.01601 2026-09-02
SpanCalib-VLM:视觉语言模型中校准的幻觉片段检测
SpanCalibVLM 通过混合双系统(判别式序列标注器 + 生成式 VLM)配合 UnionCalibrated Fusion 策略,在 SHROOMVisions 任务上实现了 0.413 Pearson 校准相关性与 0.913 纯净响应 IoU,为 LVLM 幻觉检测提供了一种兼顾「定位精度」与「置信度诚实」…
深度解读 arXiv:2608.29974 2026-09-02
ContextBias:文本到图像模型中上下文偏移下的偏见持续性评估
ContextBias 揭示了一个被现有评估框架忽视的深层问题:T2I 模型中学到的职业属性刻板关联(roleattribute stereotypes)极其顽固——即使将同一职业角色置于语义完全无关的场景中,角色相关视觉属性(服装、工具、人口统计特征)不仅不会减弱,反而跨角色聚集程度增加(pooled BI +0.0…
深度解读 arXiv:2608.29847 2026-09-02
感知不确定性的端到端 AI 天气预报:分离观测与模型的贡献
本文将确定性端到端天气预报模型 Aardvark Weather 概率化,通过在观测编码器中加入输入依赖的随机噪声(捕获偶然不确定性)和在处理器中引入 Monte Carlo dropout(捕获认知不确定性),配合方差分解实现两种不确定性的可归因分解,最终在保持确定性 RMSE 仅损失 2.4% 的同时将 CRPS …
深度解读 arXiv:2608.30795 2026-09-02
Safin-1:从记忆原生状态演化出发,把安全变成模型的内在属性
Safin1 提出 Safety from Within(内生安全) 原则,把"模型是否安全"从"对齐行为/外加护栏"重新定位为"模型自身通过记忆路由与状态演化所维持的能力",并基于 MARCH(MemoryAnchor Routing across Context History)架构,在不反复修改 backbone…
深度解读 arXiv:2609.00092 2026-09-02
SMELT:当"层循环"遇上 MoE,"中间层循环两次"就能省 6.8-18% 训练 FLOPs
一句话结论:SMELT(Sparse MoE Transformer, middle layers Loop Twice)是一份"在 computematched 条件下"重新评估 Looped Transformer 的工作——通过 ablation 给出"把 MoE Transformer 中间一半的层循环 2 次…
深度解读 arXiv:2609.01343 2026-09-02
Qwen-Drive-1.0:视觉-语言基础模型迈向自动驾驶的第一步
QwenDrive1.0 把一个预训练好的视觉语言模型 (VLM) 当成"大脑",外挂一个 BEV 感知头和一个规划专家,做 3D 感知、视觉问答、运动规划三件套的统一,在 nuScenes/规划基准上同时拿到了强 3D 感知和强闭环规划表现,且基本保留了通用 VLM 的视觉语言能力不掉点。 自动驾驶近两年最大的张力是…
深度解读 arXiv:2609.00111 2026-09-02
ZimaBlue:从大规模视频预训练中演化可泛化的世界动作模型
ZimaBlue 把"从互联网视频里学物理常识 + 用少量机器人轨迹对齐到具体动作"这件事工程化,提了一个三阶段课程 + 慢快双系统架构,在真机零样本评测里把任务成功率从 36.1% 拉到 77.8%,并且把 30 Hz 实时控制压到了单卡 RTX 4090。 机器人操作 (manipulation) 这两年最大的瓶颈…
深度解读 arXiv:2609.00188 2026-09-02
DiagEvo:用层次化错误记忆驱动的诊断引导自进化
DiagEvo 把大语言模型的自博弈 (selfplay) 从"无引导的随机出题"升级成"诊断引导的定向出题",通过一个层次化错误原因记忆模块让模型记住自己反复犯的错,并据此生成针对性训练题,在 9 个推理基准上对 3 个 4B/8B 解题器都拿到了平均最优。 LLM 后训练里有一个反直觉的现象:让模型自己出题给自己做…
深度解读 arXiv:2609.00768 2026-09-02
RECAP-Forcing:按外观新颖度重写长视频生成的 KV 记忆
把长自回归视频生成的 KV cache 记忆组织方式从「按时间保留」改为「按外观新颖度保留」——只要有新主体、新解遮挡区域或新场景首次出现,就锁定那一段的 KV;记忆容量随「新增内容」增长而非「时长」增长,从而以零额外参数、零训练的方式显著改善长视频一致性。 长自回归视频生成(如 Wan、HunyuanVideo 类 …
深度解读 arXiv:2608.26671 2026-09-02
EvoGenUI-Bench:把生成式 UI 评测从「单回合产物」改成「多轮同步性」
把「LLM 能不能一次写出能跑的前端代码」这道题升级成「LLM 能不能在用户连续改需求时,让产物、派生状态、外部状态和助手说法四者保持同步」,并以 150 个五轮任务 / 750 turns 的可执行基准把这件事量化成 Turn Pass、Episode Pass、Adjacent Pass Retention(APR…
深度解读 arXiv:2608.29387 2026-09-02
MMMMM:把多语言多模态虚假信息做成「可机器标注的统一分类法」
用「大规模真实数据集 + 质性分析驱动的统一分类法 + VLM 多步自动化标注 pipeline」三件套,把过去只能靠人工慢慢贴标签的多语言多模态虚假信息(multilingual multimodal misinformation)研究推到可大规模、可复现、可对比的新阶段,并首次系统报告了「AI 生成内容在科技/科学…
深度解读 arXiv:2608.29681 2026-09-02
用多层 LSTM 把视频序列压成一个向量:Srivastava 2015 的视频表征无监督学习
Srivastava 等人 2015 年的这篇论文用「多层 LSTM 编码器 + 一个或多个 LSTM 解码器」的 EncoderDecoder 框架,第一次把视频表征学习做成了端到端无监督任务(在合成数据和自然视频上以预测未来帧 / 重建序列为代理目标),并通过在 UCF101 / HMDB51 上 finetune…
深度解读 arXiv:1502.04681 2026-09-02
思维链忠实性随偏好线索的传递位置与方式而变化
LLM 的思维链(CoT)监控假设推理轨迹忠实记录了影响答案的信息,但偏好线索通过工具返回值或隐式原始产物传递时,所有 15 个模型的推理忠实性均显著下降——这意味着 CoT 监控在真实 Agent 场景中可能远比实验室测试更不可靠。 CoT monitoring 是保证 LLM 推理可信度的核心手段之一:监控假设推理…
深度解读 arXiv:2608.29464 2026-09-02