研究库 深度解读
Explainers · 学术推广产出

解读

1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

EngramEdit:只改条件记忆,在不碰 Transformer 主干的情况下更新事实
EngramEdit 把 DeepSeek Engram 一类 conditional memory 从"增加模型容量的查表层"改造成可编辑的知识接口:先为同一事实的多种表达求出共同的记忆目标,再联立更新共享 ngram embeddings,并对高频、短 ngram 施加更强约束,从而在保持通用能力的同时获得更好的跨…
深度解读 arXiv:2610.10533 2026-10-08
PersonTTS:从优化 Pareto 前沿转向满足每个用户的联合偏好
PersonTTS 把 TestTime Scaling 的优化单位从"单一边缘上的固定 tradeoff"改成"用户 profile 下的可执行 controller",以 accuracy、latency、inference cost 三项同时达标为 JSR;再通过相似需求 controller warmstart…
深度解读 arXiv:2610.09684 2026-10-08
Diffusion On-Policy Context Distillation(D-OPCD):把 Agent Harness 的能力烧进扩散模型权重
DOPCD 提出「OnPolicy Context Distillation」——把 agent harness 反复打磨后的 prompt 当作 privileged context,通过 onpolicy 蒸馏把 harness 的知识烧进 TexttoImage 扩散模型的权重里,让模型在只接收原始 query …
深度解读 arXiv:2610.07250 2026-10-08
PhysEvo:让 Astra 既能动又能自改进的物理递归自改进框架
PhysEvo 提出「物理递归自改进(Physical Recursive Selfimprovement, RSI)」框架,围绕一个冻结的 Astra 模型,让 task agent 负责执行、metaagent 负责诊断失败与修订工具/技能,且 metaagent 还能改进自己的诊断工具——所有修订都不动模型权重;…
深度解读 arXiv:2610.08995 2026-10-08
Robo-COP:VLA 策略与 VLM Orchestrator 的部署中共进化
RoboCOP 提出一个让机器人在部署过程中自改进的飞轮:用 VLM orchestrator 与 VLA policy 共同在真实部署里 coevolve——policy 升级前先验证、orchestrator 随 policy 调整而调整,从而把 VLA policy 从「系统的瓶颈」变成「可被吸收进 harnes…
深度解读 arXiv:2610.09228 2026-10-08
DeCoPrune:用"去噪一致性"作为 KV-Cache 剪枝的内在信号
DeCoPrune 把自回归视频扩散的 KVCache 压缩当作"去噪一致性问题"处理,无需训练:度量当前 chunk 中每个 token 的"中间预测与最终去噪结果之间的不一致度"作为长期保留信号,把高不一致的 token 留在长期 cache、低不一致的丢弃,从而在 LingBot World v2 上实现"剪掉 …
深度解读 arXiv:2609.39096 2026-10-08
摩洛哥 Turba 施肥机器学习技术栈:把「场地特异性施肥推荐」做成可复现的开源三层栈
arXiv 编号 + 提交日期连贯性声明:arXiv:2610.05949(v1,提交时间 20261005 08:04:09 UTC),与论文页所示 4 天前提交一致。 Turba 把摩洛哥场地特异性施肥推荐拆成 turbaclient / turbadata / turbamodels 三层开源栈,把「可程序化访问…
深度解读 arXiv:2610.05949 2026-10-08
DMAD:把分布匹配蒸馏重写成对抗蒸馏,丢掉辅助扩散模型
DMAD 把 DMD 系列的"分数差"路线重写为"对抗式 logdensity 比"路线,在 ImageNet64×64 上以一步生成实现 FID 1.04,在 SDXL 4 步上把 FID 推到 14.47,在 Wan2.1T2V14B 4 步上拿到 VBench 85.15(反超多步教师),并把 DMD 系列一直背…
深度解读 arXiv:2610.02188 2026-10-08
为 Agentic RL 重塑 MoE 路由:让专家选择跟着操作走
作者把长程 LLM agent 的"行为结构"(READ/UPDATE/... 等回合级操作)与 MoE 的"专家路由"显式对齐——回合一级的专家选择要跟着操作走,token 一级的专家选择要做局部一致——并在所有评测基准上拿到 10 个百分点以上的成功率提升,同时给出熵门控机制稳定 RL 后训练。 长程 LLM ag…
深度解读 arXiv:2610.07332 2026-10-08
Sensor-Language-Action:用语言做传感器与动作之间的统一接口
作者提出 SensorLanguageAction(SLA) 框架,把多模态传感器观测、自然语言与动作统一进一个模型,用语言作为感知与动作之间的语义接口;并发布覆盖 116,000+ 个体、79 种传感器模态、60 类动作组的大规模基准,以及统一模型 OpenSLA,在临床预测、手术室与代谢健康等真实任务上反超 SOT…
深度解读 arXiv:2610.08244 2026-10-08
DiffGate:按难度门控的教师引导,离策略蒸馏与可验证奖励的混合
在 Qwen30.6B 与 Qwen31.7B 上,DiffGate 让 GRPO 在 code 与 math 两个领域的 pass@8 全面提升,code 上 avg@8 与 pass@8 较 matched GRPO 分别 +1.7/+1.8 与 +1.6/+5.7,math 上 pass@8 提升 +1.1/+3…
深度解读 arXiv:2610.04596 2026-10-08
Agentic AutoRAG:用推理驱动 Agent 优化 RAG 流水线,并区分检索失败与生成失败
Agentic AutoRAG 在三个 multihop QA 基准上用 LLMjudge 准确率超过所有对比 baseline,且前 10 次 trial 就能追平统计 baseline 跑满 30 次的 LLMjudge 准确率;在真实医疗语料 costaware 模式下达到中位 77% 准确率(vs 最强 bas…
深度解读 arXiv:2610.08452 2026-10-08
WildMatch:仅靠身份标签的弱监督关键点匹配器,自适应野生动物重识别
WildMatch 用身份标签当隐式正/负信号去对比式 finetune 一个现成的关键点匹配器,在多个开源野生动物 reID 数据集上超过 offtheshelf 匹配器与一个 SOTA 局部全局融合方法,并且在 openworld(heldout 个体)设定下学到的是"可迁移对应先验"而非记忆训练身份。 野生动物相…
深度解读 arXiv:2610.07384 2026-10-08
DAEDALUS:用「自生成任务」给 LLM Agent 冷启动一份可复用记忆
DAEDALUS 是一个不需要预置环境知识、不需要 oracle 验证器的 Agent 记忆构建框架。它让一对 Agent(一个 explorer、一个 solver)在环境里互相对弈:explorer 出题,solver 做题,只有当 solver 在「带启发式」情况下反复成功,才把启发式写进记忆库。在 AppWor…
深度解读 arXiv:2610.08048 2026-10-07
EMHO:用「经验轨迹」自我进化的具身 Agent Harness
EMHO(EMbodied Agent Harness Optimization)是一个保持底座模型冻结、用「执行轨迹 + 历史 harness」迭代改写 harness 自身的具身 Agent 自进化框架。它不优化技能 / 恢复 prompt 这一层,而是修改 agent 如何观察、如何用视觉工具、如何把观察落到动作…
深度解读 arXiv:2610.08432 2026-10-07
EC-RAG:把长视频问答搬到「事件链」上的免训练检索增强框架
ECRAG(Event Chain RetrievalAugmented Generation)是一个完全免训练的长视频理解框架,它先把视频切成「语义事件段」并链接成结构化的事件链,再用事件级而不是帧级/片段级的检索去回答问题。在 VideoMME、MLVU、LongVideoBench 三个长视频基准上一致优于 fr…
深度解读 arXiv:2610.08674 2026-10-07
从证据到行动:工具调用 Agent 在哪里出错
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;项目页 已找到,但 GitHub 仓库许可证与数据集商业可用性未核实;"静态评估 ≥90% → 交互执行 …
深度解读 arXiv:2610.07753 2026-10-07
UNREAL:用单一模型统一检索与长上下文证据选择
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库;abstract 中 HotpotQA 49.1→73.2%、NoLiMa 1.…
深度解读 arXiv:2610.08463 2026-10-07
RAG-PIBench:可识别泄漏的 RAG 提示注入检测基准
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库;abstract 中"DistilBERT F1 = 0.896 / PRAUC…
深度解读 arXiv:2610.08571 → 2610.08571 2026-10-07
LLM 即已经是 Jev 风格决策模型——何时以及如何微调
Qwen3.54B 无需任何训练即可作为 Jev 风格决策模型使用,性能与社区专用 Jev 模型相当;微调只在特定场景(弱 backbone、高意图路由基数)带来实质提升,而 KL 散度锚定机制是防止对话能力退化的关键工程护栏。 软件系统每天都在做结构化决策:路由工单、识别用户意图、验证规则满足情况。传统方案让 LLM…
深度解读 arXiv:2610.02076 2026-10-07
大语言模型的数值线性代数:一座连接两个世界的双向桥
这是 NLA 领域泰斗 Yousef Saad(明尼苏达大学)与卡塔尔计算研究所 Abdelkader Baggag 合著的综述,系统以数值线性代数视角解读 LLM 的底层矩阵机制——让 NLA 专家看懂 Transformer 在做什么,也让 ML 社区看到 NLA 能为 LLM 带来什么。 NLA 与深度学习两个社…
深度解读 arXiv:2610.04631 2026-10-07
潜在推理应当满足什么:用流匹配做 LLM 隐式 CoT 的五维清单与 FLaRe 配方
本文为"LLM 在连续潜空间里思考、只外化最终答案"的隐式推理路线提出五项硬性要求(有用 / 多样 / 可解释 / 可加计算 / 高效),论证基于流匹配(flow matching)的参数化是当前最有望同时满足它们的家族,并给出一份端到端训练配方 FLaRe,在算术基准上以 1/4 的延迟达到显式 CoT 97% 的准…
深度解读 arXiv:2610.06666 2026-10-07
AI-Decision Checkpoints:为 AI 增强的业务流程管理构建决策框架
斯德哥尔摩大学 Amin Jalali 团队提出用"AI 决策检查点"(AIDecision Checkpoints)替代 BPM 课程中 AI 作为附加技术的落后定位——在业务流程开发生命周期的每个阶段强制学生做 AI 采纳的结构化推理,而非简单地在课后加一节 AI 选修课。该框架通过一个虚构银行客户入职案例(Ban…
深度解读 arXiv:2610.06207 2026-10-07
MiniCorp:AI 自主运营公司的"最后一公里"模拟器
提出 MiniCorp:一个面向电商公司的"双世界"办公模拟器,让多个 AI Agent 在外部市场(客户/对手/价格机制)与内部公司(事件观察→讨论→决策)的闭环中持续协作并被记录,由此为 AI 公司运营研究规模化地生成纵向(longitudinal)+反事实(counterfactual)的企业数据。 "enter…
深度解读 arXiv:2610.05912 2026-10-07
把记忆装进参数:面向 LLM 的 In-Parameter Memory 综述
这是一篇综述:把"在 LLM 推理时把可复用的记忆信息以参数对象(adapter / 嵌入 / attention / FFN 等)形式插入前向通路"的方法统一命名为 inparameter memory,并用两条正交轴——参数放置位置(Parameter Placement) 与 参数获取时间(Parameter A…
深度解读 arXiv:2610.08630 2026-10-07
VLA 在机器人执行误差下的自补偿与压力测试
提出 selfcompensating VLA(自补偿视觉语言动作策略):在部署阶段用「策略输出的指令动作」与「机器人实际执行的运动」之间的残差做在线微调,让 VLA 在生成指令时就预先抵消机械磨损、负载变化等执行误差,并在配套的 RoboStress 仿真基准上把仿真真机一致性往前推了一步。 VLA(VisionLa…
深度解读 arXiv:2609.37334 2026-10-07
Agentic-ZTA:用多智能体流水线把零信任落地为可执行的访问决策
本文提出 AgenticZTA,把 NIST SP 800207 定义的零信任架构(ZTA)控制环用多智能体决策流水线实现——策略知识走 RAG、访问上下文走多智能体接力、可信度评分聚合——在测试床上达到 95.0% 准确率 / 93.9% 精确率 / 96.3% 召回率,证明"用 AI 代理做零信任强制执行"在访问控…
深度解读 arXiv:2610.05782 2026-10-07
给持续吸入文档的 RAG 向量库加一道"暂态可见"闸门:定时验证 + 谱系隔离
本文针对持续摄入型 RAG 向量库的"数据进入可检索之前还没完成验证"这一时间攻击面,提出 bounded provisional visibility 协议——新内容以有截止时间的暂态可见方式准入,超时未验证则自动隐藏,并支持谱系隔离;在五个自然语言文档工作负载上,把中毒检索中位数从 34 降到 7(同等降低被挤掉的…
深度解读 arXiv:2610.05826 2026-10-07
弥合上下文鸿沟:表格上下文学习的激活对齐
TabPFN、TabFM 这类"表格基础模型"做 incontext learning(ICL)时必须把全部训练样本塞进每次前向——推理贵到爆炸。少塞样本能省钱,但性能掉得厉害。本文提出 Activation Alignment:在完整上下文(teacher)与裁剪上下文(student)之间训练一个轻量级线性变换器,…
深度解读 arXiv:2610.06679 2026-10-07
从蒸馏后的私有健康记录中以 Agent 方式发现血液生物标志物
医疗数据"看得见但用不了"是 Agent 落地的最大拦路虎之一。本文把以色列 Clalit 医疗集团 540 万患者的全血细胞计数(CBC)蒸馏成一个可发布的"评分器"权重——图注意力网络 + 病例对照 AUC 预测器——让前沿 LLM Agent 能在不接触任何原始病历的前提下,通过"提出—评分—迭代"循环挖掘 13…
深度解读 arXiv:2610.04749 2026-10-07