研究库 深度解读
Explainers · 学术推广产出

解读

1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

LOCI:面向流式世界模型的空间线性记忆
LOCI 通过在同一 Transformer 中混合 KV Cache 与几何条件线性注意力记忆,实现了对视频中重访区域的高保真复现,同时将长视频推理的峰值内存降低约 30%。 当相机(Agent)重新进入曾经观测过的区域时,视频世界模型(World Model)需要忠实复现之前见过的东西——而非重新幻想一个场景。现有…
深度解读 arXiv:2609.40222 2026-10-03
MemFold:面向长程个性化的紧凑软记忆在线优化
MemFold 将用户历史压缩为 K 个连续向量作为软记忆接口,通过「任务结果奖励 + 信心门控在线蒸馏」双信号训练,在 PersonaMem128K 上实现当前最优,且记忆内容可跨领域迁移无需重训练。 一个长期服务同一用户的 AI 助理,必须从用户曾经透露的信息中推断答案——哪些偏好还成立、哪些已被修正、哪些约束当前…
深度解读 arXiv:2609.36435 2026-10-03
Jev Decision Models:低延迟边缘服务编排中的 LLM 替代方案
在需要做服务编排决策的边缘请求中,用 Jev Decision Models 替代 LLM,可将决策延迟降低 22.7%–64.5%,同时在有界契约场景下将实时Admission成功率从 LLM 的 <0.1 提升至 0.91–0.95。 自然语言服务请求在正式执行前,往往需要一次 LLM 决策——理解用户意图、判断该…
深度解读 arXiv:2609.22753 2026-10-03
视频生成模型:后训练与对齐综述(Video Generation Models: A Survey of Post-Training and Alignment)
一句话结论:这是第一篇把"视频生成后训练"从散落的 SFT/RLHF/DPO/RF/Classifier Guidance 等零散技术,整合为「隐式对齐 vs 显式对齐」二元统一框架,并据此把现有方法归入四大类(SFT、自训练与蒸馏、偏好/奖励、推理时)的系统综述。 视频生成在 20232026 年经历了从 SVD、M…
深度解读 arXiv:2610.00812 2026-10-03
Ego2Act:评估自我中心视频生成中的目标导向操作(Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation)
一句话结论:本文为"视频生成能否充当世界模拟器"这件事提供了第一个以目标完成度为核心的自我中心(egocentric)评测基准,包含 2,640 段真实视频、110 个日常任务,并配套了一个无需参考视频、与人评对齐度更高的自动评估管线 Ego2ActJudge。 Sora、Wan、Kling 等视频生成模型出来后,社区…
深度解读 arXiv:2610.01092 2026-10-03
用于高效多跳问答的 Matryoshka 分层 RAG(MatRAG: A Matryoshka Hierarchical RAG for Efficient Multi-Hop Question Answering)
一句话结论:MatRAG 把 Matryoshka 表示学习(MRL,俄国套娃式嵌套维度)搬进 RAG 的检索结构里,用一个有向无环图(DAG)的层次聚类 + 嵌套维度索引 同时压住两个成本——索引时不用再构造昂贵知识图谱或 LLM 摘要,查询时按维度感知相似度把昂贵的全维搜索降为廉价的前缀搜索。 多跳问答(Multi…
深度解读 arXiv:2610.01767 2026-10-03
Honeycomb:面向视频世界模型的恒定大小场景记忆表征
Honeycomb 把「用一种由 6 个空间/时空平面组成的低秩表征 HexMemory 替代传统累积 RGB 观测或 latent 特征的视频世界模型场景记忆」作为核心思路,让视频世界模型在长时域生成中维持空间一致性而不让存储随生成进程膨胀——记忆大小恒定,写入只处理新观测,不重处理历史,WorldScore 与 R…
深度解读 arXiv:2609.37690 2026-10-03
X-Tree:面向高效 Agent 泛化的可复用经验 token 化
XTree 把「从 agent 轨迹数据中无 LLM 调用地、自动抽取出『子流程复用树』(eXperience Tree),并把它作为训练实例 / 强化学习 bonus / selfdistillation 上下文喂给模型」作为核心路径,让多步 agent 摆脱「扁平 action 流训练 token 利用率低」的瓶颈…
深度解读 arXiv:2609.32993 2026-10-03
OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
OpenTumorBoard 把"在公开 YouTube 肿瘤委员会录像上,把 611 个病例、19,157 轮、10 个专科角色、12,534 分钟的真实讨论转写下来,作为 LLM 在临床决策场景里被同时考核「单轮专业回答」与「整轮会议共识」两项能力的真实世界基准"作为核心定位,揭示了当前 14 个主流 LLM 与真…
深度解读 arXiv:2609.32810 2026-10-03
纠错何时算修复?SAKIKO:面向工具使用 LLM 内部干预的机制审计框架
SAKIKO 把「在 LLM 内部用激活干预(activation steering)修正工具调用决策」这件事从「看 net gain 涨没涨」提升到「必须做 destinationresolved 的归因审计」——同一份内部干预可能让净得分 +55,却悄悄损害一半以上原本正确的决策;作者用 7 个 LLM × 3 个…
深度解读 arXiv:2609.36138 2026-10-03
文本到图像生成的 GAN 奠基之作:Reed 等人的 Matching-Aware 判别器与流形插值
这篇 2016 年 ICML 论文首次把字符级文本编码器与条件 GAN 拼成可工作的端到端文本图像生成流水线,并通过 GANCLS(matchingaware 判别器)和 GANINT(流形插值学习)两项机制,把生成图像与输入描述在 64×64 分辨率上真正对齐到「鸟羽色、花瓣数」级别的细粒度可识别,开启了后续 Sta…
深度解读 arXiv:1605.05396 2026-10-03
激活函数综述:Nwankpa 等人如何把 ReLU/Sigmoid/Tanh 之后的「非饱和家族」摆到同一张桌上
这篇 2018 年的综述把深度学习在工程实践中实际使用的激活函数与文献里持续被提出但很少被采用的「研究型」激活函数并排比较,得出「Sigmoid/Tanh 在隐藏层已基本被 ReLU 家族取代、Swish/Mish 等非饱和非单调激活在深层 Transformer 类架构里占优、但工程落地仍受计算成本与硬件支持度制约」…
深度解读 arXiv:1811.03378 2026-10-03
RAG 全景测绘:效率 / 防御 / 交互 / 推理四轴分类法
这篇综述把近两年 RAG 文献从「单管道视角」拉到「四轴分类法」,主张 RAG 不再只是"检索增强生成"三件套,而要同时回答四个工程问题——怎么更快、怎么更安全、怎么更可交互、怎么更会推理——才算一个完整的现代 RAG 系统。 现有 RAG 综述大多围绕"架构演进"做主线(Naive RAG → Advanced RA…
深度解读 arXiv:2610.01936 2026-10-03
Walking the Embedding Space:从多模态 RAG 中提取私有数据集
作者提出 imMRAG——一种自适应、黑盒、针对 imagereturning MRAG 的数据提取攻击:把恶意指令藏在用户上传的图像里而不是文本 prompt 里,通过混合"已恢复图像 + 攻击者持有的影子图像"与相关性重采样,主动游走 embedding 空间,在 2,500 次查询内可恢复多达 611 张放射影像…
深度解读 arXiv:2610.01871 2026-10-03
Generalization Is Stability, Not Accuracy:用 SAGO 把 LLM 评测从"单分"换到"多轴稳定性"
作者提出 SAGO(StabilityAware Generalization Objective)——一个把"LLM 泛化能力"从单点准确率重新定义为多轴稳定性的评测框架:对同一输入在多种变体下衡量"行为变化了多少"而不是"答对了多少次",并实证指出主流模型在生成一致性、内部激活、置信度、镜像响应四个轴上都呈现统计显…
深度解读 arXiv:2610.01428 2026-10-03
DyRAD:面向动态驾驶场景的雷达新视角合成
DyRAD 通过将动态驾驶场景解耦为静态背景反射器与运动追踪动态点反射器,并借助解析式 PSF(点扩散函数)渲染完整的 rangeazimuthDoppler(RAD) tensor,实现了雷达Novel View Synthesis(NVS)在动态场景下的突破,RADIal 数据集上目标检测召回率从 26.9% 提升…
深度解读 arXiv:2609.39841 2026-10-02
Memorizon:用"按需检索 + 跨帧共享 bank"突破世界模型的上下文窗口限制
Memorizon 提出了一种用于"流式世界模型"(streaming world model)的训练与监督方法:通过让训练样本覆盖任意长的时间跨度、但每个样本只在最后 k 个 chunk 上打分,并以"相机共视性检索 + 共享 bank"代替对历史的 dense attention,把"长跨度监督"与"短跨度 att…
深度解读 arXiv:2610.00544 2026-10-02
InterEvolve:面向人形机器人 loco-manipulation 的测试时奖励程序进化
InterEvolve 把"在测试时、靠 LLM + 数值优化器协作改写可执行奖励程序、释放既有全身控制器中早已存在但未被调用的运动能力"作为核心路径,让人形机器人无需重新训练就能完成训练集外、接触密集、多阶段的 locomanipulation 任务,并在 Unitree G1 物理机上跑通了自演化出的新策略。 人形…
深度解读 arXiv:2610.02196 2026-10-02
RoPE 走到尽头了吗?长上下文失效的理论、诊断与缓解
一句话结论:把 RoPE 长上下文失效拆成「语义反转」与「位置不敏感」两类可测量病灶,给出零成本诊断工具与免训练的针对性修复,Qwen38B/Llama3.18BInstruct 准确率最大提升 20/25 pp。 RoPE(Rotary Position Embedding)是当前主流 LLM 的位置编码标配,但在长…
深度解读 arXiv:2609.39929 2026-10-02
RAGScope:面向 RAG 幻觉分诊的泄漏可控、成本感知证据门控协议
一句话结论:给 RAG 系统一个能「便宜地把生成的答案分三档路由——接受 / 复核 / 强验证」的证据门控评估协议,本地特征即可达到 6.22 ms/example 的 CPU 推理,但跨域校准是真正的工程陷阱。 RAG 系统的幻觉问题通常用两类方式兜底:强 NLI 模型或 LLMasjudge。前者贵(百毫秒级)、后…
深度解读 arXiv:2609.39075 2026-10-02
通过位置选择性自蒸馏从语言反馈训练 LLM 评判器
在训练 LLM 评判器时,用语言反馈(偏好理由)做自蒸馏(SelfDistillation),再通过熵移筛选过滤高熵移位置(context sharpening 区),保留低熵移位置(context spreading 区),可显著提升模型在主观任务上的分布外泛化能力,超越 GRPO 类 outcomesupervis…
深度解读 arXiv:2609.38792 2026-10-02
DataMagic:用声明式多智能体编排自动生成"数据视频"
§0 自检栏(v2 模板):TLDR 有 ✓ | arxiv 已 fetch ✓ | GitHub 项目页已验(HKUSTDial/DataMagic)✓ | 顶会 anchor IEEE VIS 2026 ✓ | ⚠️ 标注 11 处 | 反方 4 段(机制/数据/截止日/边界)| §八 工程坑 6 个 | 诚实局限…
深度解读 arXiv:2609.33403 2026-10-02
Smaller Models, Better Rejects:用小模型生成 Preference Distillation 的 rejected 反而更强
§0 自检栏(v2 模板):TLDR 有 ✓ | arxiv 已 fetch ✓ | GitHub 项目页未在 abstract 给出(诚实承认)⚠️ | 顶会 anchor abstract 未明 ⚠️ | ⚠️ 标注 11 处 | 反方 4 段(机制/数据/截止日/边界)| §八 工程坑 6 个 | 诚实局限 3 …
深度解读 arXiv:2609.38987 2026-10-02
HeteroFold:跨模型族的 Prefill-Free KV Cache 迁移,让异构多 Agent LLM 跳过重复 Prefill
§0 自检栏(v2 模板):TLDR 有 ✓ | arxiv 已 fetch ✓ | GitHub 项目页未在 abstract 给出(诚实承认)⚠️ | 顶会 anchor abstract 未明 ⚠️ | ⚠️ 标注 10 处 | 反方 4 段(机制/数据/截止日/边界)| §八 工程坑 6 个 | 诚实局限 3 …
深度解读 arXiv:2609.32259 2026-10-02
MILO:通过多 Agent 协同进化自动化发现 Agent Harness
1. 它要解决的"真问题"是什么? Agentic 系统(LLM + harness)的瓶颈不在模型而在 harness(执行控制 + 工具/环境交互封装),而 harness 设计是组合爆炸空间,每次换模型都要重做;现有自动化方法要么只动 prompt、要么只动 skill,要么被固定搜索策略困在局部利用。 2. 它…
深度解读 arXiv:2609.38349 2026-10-02
DAGent:先评估再扩张——给深度研究 Agent 的增量式 DAG 规划
1. 它要解决的"真问题"是什么? 现有 DAG 多 Agent 框架在执行前一次性展开整张任务图,失败 / 缺证据后才修补——这在深度研究任务里特别脆:证据最薄弱时系统最笃定,后续修补又得重做无谓的子任务分支。 2. 它提出的关键新意在哪? 把"一次性计划"换成 EvaluatethenGrow:Orchestrat…
深度解读 arXiv:2609.39154 2026-10-02
Tacit-TTS:免转录、10× 加速的零样本语音克隆
1. 它要解决的"真问题"是什么? 现有零样本语音克隆 TTS 走两条路:(a) 自回归(AR)语义建模——零样本质量与表现力强,但顺序解码延迟大;(b) 非自回归(NAR)——快,但通常要求推理时拿到参考语音的转录文本(transcriptdependent),把限制条件转嫁给了 ASR。 2. 它提出的关键新意在哪…
深度解读 arXiv:2609.38658 2026-10-02
PixelUMM:在像素空间统一图像与视频理解和生成的无编码器多模态模型
PixelUMM(Pixelspace Unified Multimodal Model)通过把图像表示为空间 patch、视频表示为时空 tubelet,用单层线性投影直接把原始像素接入共享的多模态 backbone,并采用 MixtureofTransformers 架构(共享 attention + 任务专属参数…
深度解读 arXiv:2609.38597 2026-10-02
RWTD:用奖励加权传输蒸馏对齐一步生成器
RWTD(RewardWeighted Transport Distillation)提出了一种只需要生成样本和标量奖励、不需要可微似然也不需要去噪轨迹的后训练方法,把一步生成器(如 SANA Sprint 1.6B)的 GenEval 分数从 0.73 推到 0.80,并能在多奖励切换时保持组合能力的稳定。 一步生成…
深度解读 arXiv:2609.30840 2026-10-02
BIABench:用 16 项真实生物图像任务给 AI agent 出一道"长时序难题"
BIABench 从已发表的生物图像研究中重建了 16 个端到端任务,要求 agent 通过代码、专业软件、渲染视图完成 2D/3D/时序图像分析,并用"outcome 分数(文件级对比)"和"process 分数(VLM 评估方法选择与质控)"双轨评分——结果发现:在常规 2D 任务上 agent 已经能用,但在加入…
深度解读 arXiv:2609.34274 2026-10-02