研究库 深度解读
Explainers · 学术推广产出

解读

1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

选择何时取代抽取?基于类型化决策模型的 Agent 记忆预注册测试
Agent 长对话记忆到底该"抽取事实"还是"挑选原始轮次"?这篇预注册研究给出一个干净回答:在紧预算下,单次调用一个轻量级类型化决策模型(Jev)选出的原始轮次,与 LLM 抽取式记忆呈非劣效,且写入成本低 3,061 倍;而抽取式系统只在"慷慨预算"下才反超——这把"抽取 vs 选择"这场口水仗变成了一个随预算变化…
深度解读 arXiv:2609.34227 2026-10-07
网络安全意识运动:为何它们没能改变行为?
意识运动之所以反复失败,不是因为"宣传不够",而是因为它们几乎只做了"告知风险"这一半——而行为改变真正需要的前半段是"人能理解并执行建议",后半段是"人有动机与意愿去做",这两个前置条件在大多数运动的设计里被彻底遗漏。 企业和监管机构每年在网络安全意识活动上投入巨大——海报、月度邮件、钓鱼模拟、入职培训。但实证数据显…
深度解读 arXiv:1901.02672 2026-10-07
HLA:通过分块动态混合提升表达性的混合线性注意力
线性注意力通过把历史压缩成循环状态来实现长上下文的高效解码,但这种压缩让"选择性访问稀疏且遥远的信息"变得困难;HLA 把"分块混合系数"从固定改为查询相关(querydependent),用每个 chunk 的紧凑自注意摘要动态决定"该 chunk 的历史记忆按多大比例混合进当前查询",从而在保持线性复杂度与每 ch…
深度解读 arXiv:2610.05842 2026-10-07
UndoBench:把"任务能力"和"恢复能力"从工具调用 Agent 评测中拆开
现在的 Agent 评测普遍只看"任务完成率",把"规划能力"和"故障恢复能力"混在一起计分——UndoBench 用反事实配对试验(同一随机种子下,完整工作流 vs 中途插入故障)把两者拆开,并在冻结的"丢确认(lostacknowledgment)"场景中测出:标称任务完成率 83.54%,而条件恢复成功率(CRS…
深度解读 arXiv:2610.05622 2026-10-07
保留行为一致性的 KV Cache 压缩:一种 training-free 的 logits-KL 淘汰策略
把 KV cache 压缩的目标函数从"注意力分数高就保留"换成"移除后对 nexttoken 分布的 KL 散度增加得少才保留",用 preeviction forward 阶段收集到的统计量近似估算"压缩后 logits",无需为每个候选 token 跑独立 masked forward——实现了一种 traini…
深度解读 arXiv:2610.06479 2026-10-06
双臂 VLA 的"按臂组合泛化"——ACG-Bench 与 AE-VLA 解读
把"组合泛化"显式拆成"原子技能 × 跨臂重新组合"两维度,构建 ACGBench 基准(含 23 组任务条件、8 类任务、6 组域内 + 17 组未见的"重排序/同步/组合/跨任务"),并据此叠出 AEVLA = SkillLoRA × Armwise Attention 的组合策略,在仿真与真机(SO101)上把未…
深度解读 arXiv:2610.06184 2026-10-06
Nexus:把 AI Agent 跑成"长生命周期服务"的云-边执行底座
Nexus 提出一套把单次 agent 调用升级为持久任务(persistent task)的云边执行底座,用 OpenWrt 改造的分布式 runtime + runscoped 委托 + 持久化账本三件套,把 LLM Agent 从"短对话推理"变成"长生命周期、可跨 Computer 与 Mobile、被故障和撤…
深度解读 arXiv:2610.05709 2026-10-06
非结构化知识编辑中通过聚焦视图提升原子事实回忆
FOVEATED 通过在编辑时对上下文中非目标句子的 RoPE 位置编码(Key 侧)施加随机扰动,人为拉平段落级编辑目标中「后文事实因上下文更丰富而被低估学习难度」的问题,显著提升非结构化知识编辑(UKE)中原子事实的无上下文回忆能力,在 5 个 KE 编辑器、2 个 LLM 主干、3 个基准上取得一致改进。 大语言…
深度解读 arXiv:2610.02772 2026-10-06
4DCodeBench:动态场景逆向图形中的 Agent 基准测试
4DCodeBench 通过让 Agent 将动态视频重建为可执行图形程序,首次系统性地评估了模型在 4D 逆向图形(空间 + 时间)上的代码生成能力,揭示了当前顶级模型「静态重建强、动态建模弱」的关键短板。 让 AI Agent 理解并程序化地重建真实世界的动态场景——这件事本质上横跨了 Computer Visio…
深度解读 arXiv:2610.03715 2026-10-06
CUAWright:面向数字 Agent 的极简统一接口
CUAWright 用约 3000 行代码构建了一个极简终端 harness,以 bash 为唯一动作接口,以文件系统为可演化工具空间,在 OSWorld 2.0、OnlineMind2Web、Odysseys 等多个数字 Agent 基准上显著超越 GUIharness 方案,同时将成本降低 37.5%。 当前主流 …
深度解读 arXiv:2610.04116 2026-10-06
PerturBot:用扰动式训练打破 VLA 模型的捷径先验
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.04616 2026-10-06
Code2Games:用 Coding Agent 从自然语言意图生成可玩游戏世界
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.05033 2026-10-06
MemAdapter:用反事实适配抵抗"记忆诱发的谄媚"
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.05162 2026-10-06
QuantCode Model:把通用代码 LLM 变成「可执行」的交易策略生成器
论文系统比较了「继续预训练 + 监督微调(SFT)」两条互补路径,用于把通用代码 LLM 变成能在 Backtrader 框架上生成语义忠实、可回测通过的可执行交易策略代码的模型,并用 400 题 QuantCodeBench 量化两条路径单独/合并使用时的能力跃迁与能力流失现象。 把自然语言策略描述翻译成能在专业交易…
深度解读 arXiv:2609.39420 2026-10-06
The Missing Primitive:诊断并修复 LLM 的结构化数学理解
论文提出「数学原语(Mathematical Primitive)」概念,用以探测 LLM 的结构性数学理解,并构建沿"发现 / 生成 / 消化 / 执行"四维评测的新基准;同时识别出"发现"是当前 LLM 数学推理的主导瓶颈,并提出"原语导向的自蒸馏框架"做针对性修复。 LLM 在前沿数学问题(AIME / Olym…
深度解读 arXiv:2610.02191 2026-10-06
SourceLearn:从「知识访问」到「源学习」,让 Agent 真正"认识"信息源
论文提出「Source Learning」新范式,把 LLM agent 与持久权威信息源的关系从「每次重新访问」升级为「可累积的源专属能力(sourcespecific competence)」,并以 SourceLearn 双机制框架(SelfDirected + TaskGuided)在 5 个 benchmar…
深度解读 arXiv:2610.02150 2026-10-06
PointWAM:面向灵巧机器人操作的 3D World Action Modeling
PointWAM 把"世界"显式拆成场景点云 + 手部点云,并在统一的时空坐标系里联合预测它们的轨迹,再用轨迹到动作的 retargeting 把人手运动迁移到机器人手——在十个 DexJoCo 任务上把 SOTA 平均成功率拉高 11.7 个百分点。 灵巧操作(dexterous manipulation)一直被两个…
深度解读 arXiv:2610.02840 2026-10-06
EyeRobot 2.0:用主动注视替代腕部摄像头
EyeRobot 2.0 仅用一对会主动"转头"的体侧立体相机(无腕部摄像头),就能在双臂细粒度操作上达到甚至超过"腕部 + 体侧"双相机方案的精度——核心机制是分层强化学习训练出的注视伺服 + 目标选择器,把视觉 token 集中到注视点,并把夹爪动作表示为注视相对 SE(3) 帧,从而把腕部摄像头"看局部"的物理优…
深度解读 arXiv:2610.03710 2026-10-06
Software-in-the-Loop Reconstruction:把现有科学软件变成终端 Agent 的训练场
论文提出 SWR(SoftwareintheLoop Reconstruction)——一种自监督框架:从现有科学软件工作流(结构化输入 → 可执行程序 → 输出)中反推出参考解与验证目标,无需人工为每个任务手写参考答案,就能批量生成面向 Terminal Agent 的训练环境与 verified trajector…
深度解读 arXiv:2610.02710 2026-10-06
JEPA-TTT:让潜在世界模型在测试时持续自适应的方法
JEPATTT 把"测试时训练(TestTime Training, TTT)"塞进了动作条件 JEPA 世界模型的潜在动力学预测器里——只更新这一小块、冻结视觉编码器和奖励头,并用 dense replay 缓冲跨回合累积自监督信号,从而在动态漂移下仍能让规划不靠目标图像、不靠在线奖励。 世界模型(World Mod…
深度解读 arXiv:2610.00722 2026-10-06
Tail-Influence Sampling:让 CVaR 策略评估的预算花在下尾最关键的环节
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者 Pauline Bourigault 已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库;abstract 中"MMLUPro 2…
深度解读 arXiv:2609.38096 2026-10-06
WM-VLM:用内部世界模型做交错视觉-文本推理,让 VLM"会想象"
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者 Yuheng Zha 已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库(abstract 与 arxiv 页均未列);正文中"心…
深度解读 arXiv:2609.34826 2026-10-06
The Extender:日志结构 Transformer,长上下文持久 KV 记忆压缩 104×
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;作者归属仅核对到 v1 提交作者 Jakob Eriksson(来自 arXiv submission history),未独立验证机构归属;未找到公开 GitHub 仓库;文中数据 verbatim 自 abstract,未触…
深度解读 arXiv:2609.32759 2026-10-06
Collective Bias Mitigation:通过模型路由与协作的集体偏见缓解
提出 Collective Bias Mitigation (CBM) 框架,把偏见缓解从「单一 LLM 自纠」升级为「多模型细粒度行为学习 + 路由/协作」,在多类社会偏见基准上显著优于独立模型基线,并在推理成本与缓解效果间给出可调谐的拓扑选择。 LLM 在公共健康、金融、治理等高 stakes 场景被部署时,需要同…
深度解读 arXiv:2610.03240 2026-10-06
Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability
对三类施加长度压力的高效推理训练方法做系统对比后发现:「缩短 CoT」会显著降低 CoT faithfulness(一致性变差),但对 monitorability(CoT 是否揭示输入干预对输出的影响)相对稳健——短 CoT 仍会「承认」被干预的事实。 CoT 让人类能检查 LLM 是怎么得到答案的,所以既是「可解释…
深度解读 arXiv:2610.03509 2026-10-06
Multilingual GSM-Symbolic:跨语言能力迁移由什么决定?
构建 30,000 题 / 15 语言、可模板化无限扩展的 Multilingual GSMSymbolic 多语言数学评测集,联合估计后给出四大能力迁移决定因素的 β 系数:模型规模 β=1.77、语言资源水平 β=0.77、推理能力 β=0.67、类型学距离 β=0.25;分析框架可解释 92% 的跨语言方差与 2…
深度解读 arXiv:2610.03367 2026-10-06
Rollout-Marginal Distillation:把长程自回归视频生成的"评分信号"切成块独立打分
把 DMD(Distribution Matching Distillation,分布匹配蒸馏)的"整段 rollout 联合打分"拆成"逐 chunk 独立打分 + 视频级一致性后处理"两步,让自回归(AR)视频扩散在超出训练时长时仍能保持视觉质量。 自回归(AR)视频扩散的优势在于一边生成一边流式输出、延迟低、能做…
深度解读 arXiv:2609.37925 2026-10-05
LVMT:长期视频分割的"轻量 GRU 传播 + 截断查询传播"双招
用"轻量 GRU 做目标信息的自适应门控传播 + 截断查询传播(TQP)做长视频可训练化",把在线视频分割的 SOTA 速度从"快"推到"10× 于此前 SOTA"且精度不降。 在线视频分割(Video Object Segmentation, VOS)要在视频一帧一帧进来时把指定目标一直跟出来、给它上 mask。在短…
深度解读 arXiv:2609.34895 2026-10-05
ProWAM:用渐进视觉子目标给世界动作模型装上"看得见的进度条"
让世界动作模型(World Action Model, WAM)同时预测动作和按序排列的稀疏视觉子目标,用子目标做"进度锚点"引导动作生成;用一次视频 backbone 前向 + 轻量动作去噪做 replanning,把长程任务的规划效率提上去。 WAM 是机器人控制的一种新兴范式:从初始观测 + 自然语言指令,联合预…
深度解读 arXiv:2610.02508 2026-10-05
CLIMB:置信度引导的互补证据多模态 RAG
CLIMB 通过 MMR 风格的多样性证据池构建 + R/E/C 三维评分器 + 置信度控制解码,在不修改底层检索器或 MLLM 的前提下,让多模态 RAG 系统在 EncyclopedicVQA 和 InfoSeek 两个基准上稳定超越 TopK 检索基线。 多模态大模型(MLLM)在视觉推理上进步显著,但知识密集型…
深度解读 arXiv:2610.03421 2026-10-05