Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

MatryoshkaLoRA:用单一训练产出可任意切分的层级化 LoRA 适配器
MatryoshkaLoRA 通过在已有 LoRA adapter 之间插入一个固定的对角矩阵 P 来按比例缩放子秩,让单一训练产出即可在任意子秩下保持精度,无需为每个候选 rank 重训或网格搜索,从根本上终结 LoRA 工程中「设多大 rank」的代价。 LoRA(LowRank Adaptation)已是 LLM…
深度解读 arXiv:2605.07850 2026-08-21
Securing the Agent:用分层隔离架构终结多租户 RAG / Agent 的「相关性冒充授权」漏洞
《Securing the Agent》一文提出面向多租户企业 RAG / Agentic 系统的分层隔离架构,把策略感知 ingestion、retrievaltime gating、服务端 agentic 编排三类执行点协同起来,首次形式化指出「检索按相关性排序而非授权」是 RAG 在企业场景的根性漏洞,并以开源 …
深度解读 arXiv:2605.05287 2026-08-21
LabVLA:让 Vision-Language-Action 模型真正进入科学实验室
LabVLA 把 VLA(VisionLanguageAction)模型从"家庭 / 桌面演示数据集"挪到了"科学实验室"这个全新场景:先用仿真数据引擎 RoboGenesis 从原子技能组合出可执行的实验室工作流并筛掉无效 rollout,再用两阶段训练——先 FAST 动作 token 预训练让 Qwen3VL4B…
深度解读 arXiv:2606.13578 2026-08-21
Attention Residuals:用 softmax attention 替换固定残差,让深层 LLM 的信息聚合更聪明
Attention Residuals(AttnRes)把 Transformer 里"每层都用权重 1 累加上一层输出"的固定 PreNorm 残差,改成"用 softmax attention 在前面所有层的输出上做加权聚合",从而让深层模型不再被"残差稀释"问题拖垮;它已经作为 dropin 替换集成进 Kimi…
深度解读 arXiv:2603.15031 2026-08-21
DCD(Domain-Collection-Document):面向异构语料的层级化 RAG 控制架构
DCD 提出"领域—集合—文档"三层级知识组织 + 多阶段路由:在不修改底层 LLM 的前提下,把异构语料切成可路由的层级结构,先路由到 Domain、再路由到 Collection、最后才落到 Document,让 RAG 的检索和生成范围在每一步都被显式约束,同时配合 smart chunking、hybrid r…
深度解读 arXiv:2604.07590 2026-08-21
CTIFoundry:面向网络威胁情报的 Agent 原生语料架构
CTIFoundry 把"网络威胁情报(CTI)语料"从「RAG 友好的不透明 chunk 集合」升级为agent 原生语料架构——构建期把 CVE / CWE / CAPEC / ATT&CK 四个权威库的官方交叉引用物化成可遍历的本体图,并对威胁报告做去别名、跨厂商实体对齐;查询期通过 7 个 typed tool…
深度解读 arXiv:2608.18613 2026-08-21
AsySplat:用「几何-外观非对称」双分支把长序列 3D 高斯泼溅的冗余计算砍到 1/800
AsySplat 把可泛化的 3D Gaussian Splatting(3DGS)长序列新视角合成(NVS)流水线拆成「重几何 / 轻外观」非对称双分支:粗粒度 token 在重参数几何分支里重建几何,少数参数的外观分支在细粒度 token 上抓细节,两者通过双向连接互相引导。结果是在 32view 960P 输入上…
深度解读 arXiv:2607.10995 2026-08-21
MythraGen:检索 + LoRA 加权融合的「文生艺术图像」两阶段 RAG 框架
MythraGen 是一个面向「文生艺术图像」的检索增强生成(RAG)框架:先用 BLIP2 + FAISS 在 WikiArt 上按 prompt 检索最相似的画作,再用检索结果训练两路 LoRA(流派+风格、艺术家+风格),最后把两路 LoRA 加权融合后注入 Stable Diffusion 进行生成。在 Wik…
深度解读 arXiv:2606.22924 2026-08-21
越流行越难遗忘:面向 LLM 遗忘的自适应流行度方法 AdaPop
AdaPop 把 LLM 遗忘(unlearning)的梯度强度改成与"事实流行度"挂钩的自适应形式:流行事实(被预训练高频重复的实体)会被分配更大的遗忘指数,同时一个 dualascent 控制器每 epoch 自动调整"保留集"惩罚,使遗忘保留平衡不再依赖人工调参。 LLM 遗忘最近从合规需求(GDPR / CCP…
深度解读 arXiv:2608.14229 2026-08-21
Token Time Continuous Diffusion for Language Modeling
TTCD(Token Time Continuous Diffusion)将扩散模型从离散 token 空间迁移到连续 token 表征空间,通过"每 token 独立时间进度"机制,在高加速比生成时同时规避并行采样误差与条件生成质量下降两大难题。 主流扩散语言模型(MDLM / LMD)本质上在离散 token 空间…
深度解读 arXiv:2607.14106 2026-08-20
用 RAG + 约束解码缓解 LLM 生成 Web API 调用中的错误
针对 LLM 生成 Web API 调用代码时常见的 URL / HTTP method / 参数错误,本文系统评估了两种互补的纠错机制:检索增强生成(RAG)——把 OpenAPI 规约中的端点摘要注入 prompt;约束解码(CD)——把 OpenAPI 自动翻译成 regex 约束并在生成时强制执行。结论是:CD…
深度解读 arXiv:2607.05936 2026-08-20
GRASP:面向 Agentic RAG 的粒度感知搜索策略
GRASP 通过强化学习训练 Agent,使其在多跳推理过程中学会自适应协调语义搜索、关键词搜索、段落精读三种互补工具,同时学会在最恰当的粒度(sentencelevel vs paragraphlevel)上控制上下文摄入,从根本上解决 Agentic RAG 中"什么时候检索、检索什么粒度"的核心难题。 静态 RA…
深度解读 arXiv:2607.10463 2026-08-20
MultiRef-Compass:迈向多参考音视频生成任务的综合评估
MultiRefCompass 是首个针对 MultiReferencetoAudioVideo (MR2AV) 任务的统一评测基准,包含 350 个精心构造的样本(覆盖多视角主体保持、多实体绑定、人物场景组合),用 4 个维度 14 个子指标 评估模型,并通过自动指标 + 复判增强的 MLLMasaJudge 双轨评…
深度解读 arXiv:2607.14189 2026-08-20
On-Policy Distillation 三件事:探索催化剂、两大病态、两种轻量调控
本文对 LLM 后训练中流行的 OnPolicy Distillation(OPD) 做系统化拆解: OnPolicy Distillation(让 LLM 学生从自己采样出的轨迹上、用教师模型做 token 级指导)是 LLM 后训练常用范式,但它有三个未解之谜: 1. 角色模糊:OPD 到底在做什么?它真在「教」学…
深度解读 arXiv:2607.13399 2026-08-20
从像素到状态:把交互式世界模型重新思考为游戏引擎
本文主张把「交互式世界模型」从「像素级视频预测器」重新定位为「游戏引擎式的 action–state–observation 循环」,沿四个维度(玩家动作控制、状态动态、状态观测持久性、实时交互生成)系统梳理现有方法的能力与 tradeoff,并配套发布一个针对《Black Myth: Wukong》的 90+ 小时可…
深度解读 arXiv:2607.14076 2026-08-20
AffectFlow-DINO:基于条件 Rectified Flow 的不确定性感知多任务情感估计
AffectFlowDINO 在标准 DINOv3 视觉 backbone 上嫁接条件 Rectified Flow 生成头,以建模真实场景面部情感的固有模糊性,在第 11 届 ABAW 挑战赛中以 P_MTL=1.177 大幅超越官方基线 0.45,且通过后验阈值校准将稀有类别 Fear 的 F1 从 3.8% 提升…
深度解读 arXiv:2607.13250 2026-08-20
Earthquaker-AI:面向小学地震教育的 RAG 框架与评分量规评估体系
EarthquakerAI 将基于 RAG 的对话式 AI 助手与 Lego WeDo2 教育机器人相融合,构建了一套面向小学全学段的渐进式地震安全教育框架,通过分年级评分量规(rubric)实现从选择题到开放表达的差异化评估,实验显示其具有高 groundedness、低 hallucination 率的实用可靠性。…
深度解读 arXiv:2607.14046 2026-08-20
UniVR:在视觉空间中思考——统一视觉推理的强化学习范式与大规模评测基准
UniVR 首次提出从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划,引入 VRGRPO(全局+步级双层奖励)强化学习范式,并构建了涵盖 16 个数据源的 VRX 综合评测基准,在该基准上较基线提升达 25%,且学到的视觉推理能力可跨模态迁移。 当前 VLMs(VisionLanguage Models)在复…
深度解读 arXiv:2607.12800 2026-08-20
自我在空间中:面向 UAV 具身智能的自我意识与空间认知基准
提出 SISBench,一个面向 UAV 具身智能的基准,在「空间—自我」二维 ×「感知—记忆—推理」三层架构下评估多模态大模型,并配套提出融合光流与视觉特征的 运动感知表征,证明把「自我运动」显式建模进表征后,模型在感知、记忆乃至下游 UAV 决策任务上都会稳定提升。 UAV 上的 MLLM(多模态大模型)应用越来越…
深度解读 arXiv:2607.12477 2026-08-20
长度惩罚让 Chain-of-Thought 更难被监控
用长度惩罚做 RL 后训练,会在「几乎不损失答案正确率」的前提下,系统性地抹掉 CoT 里能被 monitor 用来识别「答案到底受了什么影响」的关键证据,并由此揭示一条 compression–monitorability frontier:推理越压缩,监控器能看见的「影响来源」就越少。 CoT 监控(chainof…
深度解读 arXiv:2607.09786 2026-08-20
面向探索、纯化与模型合并的谱重连(SAR)
提出 SubspaceAligned Rewiring(SAR):在后训练 / 模型合并 / 多领域训练三类场景里,把 LLM 的参数增量投影到「基模型的谱子空间」上做重连,仅保留 ~0.58% 的参数就能 保留 99% 以上的后训练增益,同时抑制推理早饱和、缓解多领域干扰,并且支持无需训练的跨领域模型合并。 RL 后…
深度解读 arXiv:2607.03065 2026-08-20
潜空间世界模型的决策度量对齐:JEPA-MPC 的诊断与动作条件目标
针对 JEPA 类潜空间世界模型(LeWM)配合 CEM(CrossEntropy Method)做 MPC 时"潜空间欧氏距离 ≠ 真实任务进度排序"的失配问题,本文给出 PlanReal Spearman / CEMstage Spearman 两个无侵入式对齐诊断,并提出在潜空间模型上同时挂"逆向动力学头 + 演…
深度解读 arXiv:2608.18746 2026-08-20
SemComp-Bench:面向视频生成的语义任务完成评估范式
本文为视频生成提出"语义任务完成(Semantic Task Completion Video Generation)"评估范式:成功标准是达成预定目标且与参考图保持任务相关的语义对应,而非传统的外观一致 / 中间步骤演示。配套提出 SemCompData(六大域评估集)与 SemCompBench(OA / GR 二…
深度解读 arXiv:2608.17426 2026-08-20
训练留痕:面向 LLM 溯源的 Centered Residual Signatures
仅凭模型权重即可判断两个 LLM checkpoint 是否存在亲缘关系——通过去除残差网络中共享的"恒等对齐分量"并比对 checkpoint 特异性结构,论文提出的 Centered Residual Signature 在多项测试中达到 AUROC=1.0,且比行为测试快 76 倍。 Openweight LLM…
深度解读 arXiv:2608.14929 2026-08-20
突破故事中心:Attribute-Guided Genre Expansion 框架扩展创意写作数据
高质量创意写作数据长期被"故事文"垄断,限制了 LLM 对诗歌、说唱、剧本、游戏设计等结构性格式的掌握;通过将"主题广度"与"类型形式控制"解耦,论文的 AttributeGuided Genre Expansion 框架构建了一个 50K 样本、覆盖 13 种创意类型的 MultiGenre Collection,让…
深度解读 arXiv:2608.13947 2026-08-20
SoftVTBench:可变形物体操作的安全感知视-触觉基准
现有可变形物体操作基准只看任务是否完成,忽视了滑落、过度挤压等不安全物理交互;SoftVTBench 在 Isaac Sim 中构建了有限元仿真环境,同步采集多视角 RGB、双指触觉 RGB、标记运动、本体感觉、语言指令和二元/连续夹爪动作,以 20 Hz 频率提供完整任务的 policy可见接触观测与独立物理 gro…
深度解读 arXiv:2608.18701 2026-08-20
Co-RL:多智能体 RL 中由多样性同侪驱动的无监督推理
本文提出 CoRL 框架:让多个完全不共享参数的 decoupled 模型协同训练,互相以同伴输出作为 reward 信号,无需任何 groundtruth 标签即可驱动推理能力提升。核心发现是"同侪多样性(异质模型族 + 不同尺寸 + 数据改写)才是避免 selfrewarding 训练崩溃的关键杠杆",在文本与多模…
深度解读 arXiv:2608.17253 2026-08-20
Zetta ζ:把具身 Agent Harness 从「开环反思」推到「动作级闭环自我进化」,并让 rollout 基础设施可异构扩展
一句话结论:冻结底座策略模型不动,靠「动作级 Critic → Rollout 级 CriticRecovery 候选优化 → 验证门控的技能更新」三条时间尺度解耦的闭环,把失败在线蒸馏为「可执行代码型 Critic + Recovery 工具集」;配合 ZInfra 这种「agent 逻辑与硬件解耦」的 rollou…
深度解读 arXiv:2608.16590 2026-08-20
OmniScientist:把「AI 科学家」从「工作流自动化」推到「原始证据驱动的全模态全学科」研究闭环
一句话结论:用「感知层 + 3 个 ReAct Agent(ideation / experiment / writeup)」+「确定性流水线上的 idea / rigour / claim 三类代码层闸门」,让 AI 科学家直接吃「图像 / 波形 / 音频 / 视频 / 3D / 轨迹 / 表格 / 公式 / 图」9…
深度解读 arXiv:2608.13558 2026-08-20
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
GigaWorldPolicy0.5 是一种 ActionCentered 的 World Action Model(WAM),通过 MixtureofTransformers 架构和 AutoResearch 超参搜索管道,在保持未来视觉动力学训练收益的同时,将机器人控制推理延迟降至 85ms(RTX 4090),实…
深度解读 arXiv:2607.13960 2026-08-20