研究库 深度解读
Explainers · 学术推广产出

解读

1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

reViT:一个 Transformer block 在多个深度里循环
reViT 用一个 Transformer block 循环应用 N 次匹配全深度视觉编码器的精度,每个循环深度的 FFN 由"小型共享专家库的凸组合"表示,连续归一化深度坐标控制这个混合系数,从而在 FFN 参数空间走出一条可重采样的轨迹。 视觉 Transformer(ViT)的标准做法是把 L 个独立 Trans…
深度解读 arXiv:2610.12448 2026-10-09
AgenticBBO-Bench:把 LLM Agent 拉进黑盒优化的同一张考卷
AgenticBBOBench 给"用 LLM Agent 做黑盒优化"这件事提供了第一个跨 5 个领域、统一个有限预算评测协议的横向基准,结论是 Agentic BBO 在所有领域家族平均分都强过纯 LLM 直接出解、并在 4/5 领域上击败最强数值优化器。 黑盒优化(BBO)在科学和工程里无处不在——超参调优、数据…
深度解读 arXiv:2610.12183 2026-10-09
REMORY:用残差记忆做上下文压缩
REMORY 提出一种神经网络记忆模块,为长时程 LLM Agent 在压缩上下文后追加一串"软记忆 token",用近似残差连接的方式让冻结 LLM 在只看到摘要时也能逼近完整历史的续写质量。 长时程 Agent(BrowseComp、TerminalBench 这类多步工具调用场景)天然要面对"上下文窗口有限、历史…
深度解读 arXiv:2610.11287 2026-10-09
层次近似最近邻的贪心导航:何时能又快又准,几何条件首次给出
§0 自检栏 选题维度:垂直链路 / 数据结构 / RAG 与推荐系统的向量召回内核 / 几何分析 + 概率过程 受众:ANN 索引工程师、RAG 检索栈设计者、推荐系统召回层研究者、计算几何/概率论方向研究生 风险:抽象级高、无工程 bench 直接可跑、对生产 HNSW/IVFPQ 类参数选择只给条件、不给具体值 …
深度解读 arXiv:2610.12312 2026-10-09
ORCAGen:用 RAG 引导生成式 AI 编出可执行的反欺骗剧本
§0 自检栏 选题维度:水平链路 / 网络安全 + LLM 应用 / RAG × 主动防御 / 恶意软件侧 受众:安全研究员、主动防御工程师、LLM 应用开发者、对 RAG 落地非问答场景感兴趣的同学 风险:依赖 2026 时期 LLM 产品代号、抽象级高、顶会 anchor 弱化(W39 已失势) 为什么读:把"主动…
深度解读 arXiv:2610.12415 2026-10-09
WorldGuide:用闭环视觉世界模型做程序化任务,从"生成好看视频"走到"按生成结果决定下一步"
§0 自检栏 选题维度:水平链路 / 多模态 × 智能体 / 程序化视频生成 + 闭环世界模型 受众:视频生成研究者、具身/世界模型研究者、agent × multimodal 跨方向工程师 风险:作者署名较新、模型代号 "MiniMaxH3" 未在公开模型库出现、benchmark 自建 为什么读:把程序化视频生成从…
深度解读 arXiv:2610.12459 2026-10-09
MiMo-V2.6:把强化学习算力作为自我改进主轴的全模态模型族
小米 LLMCore Team 发布的 MiMoV2.6 系列(Pro 1.02T 总参 / 42B 激活、Flash 310B 总参 / 15B 激活)把"RL 算力规模化"作为驱动 agentic 自我改进的核心杠杆:通过更大的异步 batch、更长上下文的 rollout、更复杂的多 harness 环境与 gr…
深度解读 arXiv:2610.11959 2026-10-09
RAG 不擦除记忆,只重塑它:上下文敏感的前缀记忆提取
Groningen / Leiden 团队(Satvaty 等,已收 EMNLP 2026)通过对 prefixsuffix 样本做 paired itemlevel 后缀概率测量,证明上下文并不会"擦除"LLM 的训练记忆,而是把它拆成 contextrobust core(跨上下文稳健可提取的核心)+ contex…
深度解读 arXiv:2610.12085 2026-10-09
LLM 集成应用的七种架构形态:从 Chat 到 Agent 系统
Irene Weber(Kempten 应用技术大学)发表的这一综述,把市面上被叫作 chatbot / copilot / RAG / workflow / coding agent / AI agent 等的"标签"逐一拆开,证明这些词汇在大厂原始语境下确实承载了可识别的架构差异 —— 综述在统一的"agent 与…
深度解读 arXiv:2610.11899 2026-10-09
用于 X 射线衍射的自学习科学 Agent
Gan Jiang 是一个面向粉末 X 射线衍射(XRD)的自学习 LLM Agent,它不重训语言模型也不改物理模型,而是把分析经验自动诊断、修订、验证后沉淀为可复用技能,在 DeltaXRDbench 等多基准上把单相 top1 准确率从最强对照组的 58.00% / 58.47% / 26.45% 提升到 96.…
深度解读 arXiv:2610.07862 2026-10-09
Inherit-MAS:通过工作流与执行继承实现多 Agent 系统的测试时演化
InheritMAS 把生物进化里的「继承 + 选择」拆成两件独立的事:让工作流图本身可以被结构化继承而不是每次整体重写,让已跑过的执行结果可以被精确复用而不是无脑重跑;在 WorkBench / HotpotQA FullWiki 上同时做到 SOTA 完成率和显著 token 节流。 由 LLM 组成的多 Agen…
深度解读 arXiv:2610.02396 2026-10-09
Self-Retrospection Distillation:把事后经验变成事前远见
SelfRetrospection Distillation(SRD)抓住 RLVR 在「整组 rollout 都得同分」时信号消失的盲点,把事后才看得到的成败教训回灌成 Agent 在行动前就该有的远见预测——只在训练时用,推理时不开销,让 2B 模型在 98% 全失败组里从 0.0% 升到 60.6%。 RLVR(…
深度解读 arXiv:2610.08077 2026-10-09
Foundations of Large Language Models:一本给工程读者用的 LLM 基础「地图册」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「LLM 综合综述」吗? | 不是综合综述,是基础概念书,明确「primary focus on foundational concepts rather than comprehensi…
深度解读 arXiv:2501.09223 2026-10-09
OmniCapBench:把音视频描述评估从「整段打分」拆成「可验证原子单元」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「音视频描述」这一个任务吗? | 不是仅一个任务,而是把评测目标改写为结构化诊断:把整段自由文本预测换成三轨「实体指代 / 视觉镜头 / 音频事件」的原子单元集合 | | Q2 | 谁在为…
深度解读 arXiv:2610.12458 2026-10-09
OuroWorld:把任意 3D Gaussian Splatting 场景「无掩码」变成无缝循环的 3D Cinemagraph
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「动态 3D 场景生成」吗? | 是——且特别强调maskfree 与 endlessly looping:把任一静态 3DGS 场景提升为「任意视角无缝循环」的 3D 动态影像 | | …
深度解读 arXiv:2610.12461 2026-10-09
文档结构真能帮稠密检索?一份安慰剂对照消融把四种流行机制拆给你看
RAG 里四处常见的"利用文档结构"的小技巧(结构对齐分块、LLM 补的 chunk context、heading path 元数据、分层两阶段检索)并不是在同等条件下被验证的——这篇论文把它们拉到同一协议下跑了对照实验,结论是"真结构"确实帮得上(约 +0.010~+0.022 covnDCG@10),但"分块前加…
深度解读 arXiv:2610.10170 2026-10-09
5000 万 token 的"长期记忆":靠 KV 落盘而不是重计算,让 12B/31B 模型"记得更久也更便宜"
"长上下文"不是只能靠更大的 attention 窗口——论文实测了一个公开包 galahadkv,把每个 ~16k token 块的 KV 状态加密落盘到本地 NVMe,加载时字节级一致不重计算,在单卡 H100 + vLLM 上用 Gemma 4 12B / 31B 跑了 5000 万 token 的真实文本,10…
深度解读 arXiv:2610.10845 2026-10-09
RoboJEPA:把机器人潜变量世界模型做大——8B 参数 + 二阶幂律 + 12 种机器人形态
RoboJEPA 是目前最大的 JEPA 预测器(8B 参数),在涵盖 12 种机器人形态的大规模数据上训练,首次为多形态机器人世界模型建立了关于算力的二阶幂律——这意味着你不用真跑到目标规模,就能从拟合的曲线预测想象误差(imagination error)会到多少;更进一步,想象误差与真实机器人规划性能强相关,让"…
深度解读 arXiv:2610.10515 2026-10-09
Agent Plasticity:通过经验衡量自我改进
Agent Plasticity 把「AI Agent 能不能从经验中学到东西」这件事从单点性能比较改写成了一个效率量纲——用「训练期间投入多少 cost 能在多大程度上转化为对未见过的环境的提升」来刻画 Agent 的可塑性,并用这个量纲发现前沿模型之间的能力差异更多来自学习效率与泛化而不是终点能力。 主流 Agen…
深度解读 arXiv:2610.08902 2026-10-09
CADFather:通过协同工具调用实现自主 CAD 重建
CADFather 是一个"零额外训练"的自主 Agent 系统,把视觉语言模型(VLM)作为调度器,协同一组互补的 CAD 操作提案工具与数值优化器,从 3D 网格逐步恢复出可编辑的参数化 CAD 程序,并在 DeepCAD、Fusion360、MCB 全量测试集与 CADENABench / CADBench / …
深度解读 arXiv:2610.09127 2026-10-09
UniSkill:为持续进化的策略学习与执行者对齐的技能提案
UniSkill 提出一种「无新 rollout 的对比式动作反馈」机制,让 LLM Agent 的技能库(skillbank)与执行策略(actor)共享同一策略但解耦训练目标,从而在 ALFWorld 上达到 98.4%、WebShop 上达到 84.7% 的成功率,规避了"靠后续 rollout 复用率打分候选技…
深度解读 arXiv:2610.10164 2026-10-09
SheetSage2:用合成监督学习连贯的 lead-sheet 转录
SheetSage2 证明,音乐转录的关键不只是"把每个时间点预测得更准",而是要让 tempo grid、chord、melody 和 section 在同一条可解码的序列里彼此一致;它先用结构化 Prober 把噪声标签整理成完整伪标签,再蒸馏给一个更简单的 autoregressive student。 lead…
深度解读 arXiv:2610.05336 2026-10-09
NAMVIS:把多视图新视角合成改成几何条件下的 next-scale 自回归
NAMVIS 不再用几十次 diffusion denoising 反复"擦"出每个目标视角,而是把目标图像拆成由粗到细的离散 residual token,在每个尺度内并行生成所有 token 和所有目标视图,再用显式相机几何把 source observation 与 target view 对齐;在论文评测设置中…
深度解读 arXiv:2610.04722 2026-10-09
FastOPD:把 foundation VLA 蒸馏成少步、可部署的轻量策略
FastOPD 不试图把大 VLA 的每一轮 denoising 都压缩掉,而是先让轻量 student 在 onpolicy 状态下对齐 teacher 的局部 velocity,再用"一步跳转应等于中点两步跳转"的 selfconsistency 约束把知识延伸到有限区间 flow map;论文报告它在 LIBER…
深度解读 arXiv:2610.02832 2026-10-09
RECAST:让模型学会"算出正确的上下文",而不只是检索上下文
RECAST 把 RAG 的"找材料"升级为"主动构造证据":轻量 RouterLM 在多轮决策中选择检索或计算操作,必要时让 CompilerLM 临时生成代码,直到它判断证据充分,再交给冻结的 AnswerLM 作答。 传统 RAG 默认"答案所需证据已经以可直接检索的形式存在于某个片段中"。但在财报表格、数据库、…
深度解读 arXiv:2610.10507 2026-10-08
ExperienceIndex:把 Agent 的长期记忆从"会什么"改成"熟悉哪些资料"
ExperienceIndex(ExpIdx)以 artifact 而非用户或抽象 reasoning pattern 为记忆锚点,从历史任务轨迹中积累单 artifact 的用途和 artifact pair 的关系,再作为 middleware 引导后续 Agent 更快找到更完整的证据集合。 法律、咨询、科研和企…
深度解读 arXiv:2610.10091 2026-10-08
Agentic RAG 系统分类综述:自主 AI 驱动的检索增强生成
Agentic RAG 通过将 AI Agent 的反思(Reflection)、规划(Planning)、工具调用(Tool Use)和多智能体协作(MultiAgent)四大设计模式嵌入 RAG 流水线,使静态检索问答系统升级为能够动态管理检索策略、迭代精调上下文、自适应编排工作流的自主推理伙伴。 传统 RAG 系…
深度解读 arXiv:2501.09136 2026-10-08
LLM Agent 评估与基准测试综述:面向真实场景部署的系统性评估框架
这篇 KDD 2025 综述为 LLM Agent 评估提供了一个二维分类体系:沿"评估目标"(评估什么)和"评估流程"(如何评估)两个正交维度组织现有工作,并指出企业场景中常被学术研究忽视的特殊挑战,为研究者和从业者提供了系统性评估 LLM Agent 的实用框架。 LLM Agent(基于大语言模型的自主智能体)正…
深度解读 arXiv:2507.21504 2026-10-08
LLaDA-V:纯扩散范式多模态大语言模型的视觉指令微调
LLaDAV 是首个完全基于 Masked Diffusion 架构的多模态 LLM(MLLM),将视觉指令微调与扩散语言模型相结合——在视觉编码器(SigLIP)+ MLP 连接层 + LLaDA 扩散语言模型的标准架构下,LLaDAV 在多项基准上取得了纯扩散 MLLM 的 SOTA 表现,且在同规模数据下展现出优…
深度解读 arXiv:2505.16933 2026-10-08
SkillForge:让 Agent 的技能库在 RL 中生老病死,而不是越写越臃肿
SkillForge 不再把 procedural memory 当只增不减的仓库,而是让每个 skill 在 trial → active → stable → retired 生命周期中随 Agent 能力变化接受淘汰、降级、稳定和重写;预训练先过滤,SFT 冷启动,随后 RL 与 skill library 协同…
深度解读 arXiv:2610.09832 2026-10-08