研究库 深度解读
Explainers · 学术推广产出

解读

1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

H2R-Bench:评估视频世界模型从人到机器人跨具身迁移能力
H2RBench 是一份评估"视频世界模型把第一人称人类操作视频转换成机器人视角操作视频"能力的系统化基准,覆盖 11 个 SOTA 模型 × 6 类操作任务 × 2 种机器人具身,用五维指标诊断当前模型在跨具身迁移上的真实瓶颈,结论是当前 SOTA 在 embodiment consistency、functiona…
深度解读 arXiv:2608.13049 2026-08-14
ParliamentRAG:意大利议会辩论的权威感知多视角检索增强生成
ParliamentRAG 是一套面向意大利众议院辩论记录的 RAG 系统,核心贡献是话题相关的发言者权威模型(topicdependent authority model),把发言者的职业、教育、过往发言等可解释特征与当前查询绑定,联合缓解高频发言人主导、专长无法加权、引用错配三大政治敏感文本 RAG 风险,已被 I…
深度解读 arXiv:2608.13410 2026-08-14
Vibe-Coded 应用的安全困境:当 AI Agent 接管软件开发
论文系统研究了"vibe coding"——用户通过自然语言与 AI Agent 协作开发应用——这一新范式下的安全态势,构建了"AI Agent 辅助审计 + 人工验证"的漏洞分析框架,揭示 VibeCoded 应用存在三类特有漏洞模式(占位逻辑、未过滤输入、密钥泄露),根因是 Agent 的记忆丢失、局部目标优化与…
深度解读 arXiv:2606.23130 2026-08-14
RaysUp:基于几何感知光线表示的超轻量通用特征上采样
RaysUp 将特征图上采样从 2D 插值空间「升维」到几何感知的光线(Ray)域,以仅 AnyUp 16% 的参数量实现了 7 倍推理加速且精度全面超越,打破了通用特征上采样长期无法同时兼顾语义保真度与效率的困境。 预训练 Vision Foundation Model(VFM,DINO 系列、CLIP 系列、Sig…
深度解读 arXiv:2606.22749 2026-08-14
AOHP:面向个性化、高效与安全交互的开源操作系统级 Agent 框架
AOHP(Android Open Harness Project)将 Android 操作系统改造为「以 Agent 为一等公民」的运行时——在 AOSP 之上引入自适应 UI、并行后台执行、跨应用记忆和安全信息流追踪,使 AI Agent 在移动端的任务完成率提升 21%、Token 消耗和延迟近乎减半,从根本上重…
深度解读 arXiv:2606.23449 2026-08-14
概念驱动的视觉注视目标估计:GazeAnywhere 与 PGE 新范式
一句话结论:把野外注视目标估计(gaze target estimation)从「检测头框→估计姿态→回归视线」的多阶段脆弱管线,改造成一个端到端、可自然语言或视觉提示(promptable)的概念驱动范式 PGE,配套发布 120K 数据集 GazeCo 与首个 PGE 模型 GazeAnywhere,在多个 ben…
深度解读 arXiv:2608.11367 2026-08-14
Mechanist:作为科学仪器的 AI,自主发现智能的机制
一句话结论:Mechanist 把 AI 当"科学仪器"使用——构建约 13000 篇可解释性论文的知识图谱 + 26 个学科 4300 万篇的多学科语料库 + 32 个机制分析/因果干预/验证的基础方法库,组合成 agentic 系统,让 AI 自主提出关于模型行为的机制假设并执行实验,与 Claude Code 与…
深度解读 arXiv:2608.12036 2026-08-14
Ready Cohorts:LLM-Agent 控制中界定 GPU 机会并避免 Host 来回
一句话结论:Ready Cohorts 把 LLMagent 服务里"模型调用 ↔ 工具调用"的确定性小转换形式化为两个可度量闸门——deadlinefeasible cohort supply(F / P / U / A 四量纲)与 observation placement(设备驻留决策是否绕开 host roun…
深度解读 arXiv:2608.12123 2026-08-14
参数空间探索的变分视角:3PO 让 RLVR 摆脱温度缩放束缚
首段自检(机制 N 段 + 工程 M 段 + ⚠️ 数字核验 K 处)。 自报条数:机制 3(§3 parameterspace posterior / §4 3PO 策略族 / §5 rollout grouping 与 reward 估计)/ 工程 2(§6 实验配置 OLMo3 + Qwen2.5Math / §…
深度解读 arXiv:2608.09805 2026-08-14
离散扩散的单纯形松弛(Simplax)
一句话结论:在不改 uniform discrete diffusion 主流程的前提下,用 Dirichlet–categorical 增广把每个被 corruption 的类别状态耦合一个单纯形辅助变量,推出可解析的 Rao–Blackwellized reversebridge 训练目标与对应采样器,让 deno…
深度解读 arXiv:2608.10615 2026-08-14
Diffusion-LLM:分布感知 Diffusion + LLM 融合,实现鲁棒超长期时间序列预测
DiffusionLLM 创新性地将条件扩散模型(Conditional DDPM)嵌入 LLM 预测管道,以「分布感知正则化」方式同时解决 LLM 跨模态对齐难题和长期预测的均值回归问题——在 ETT、Weather、ECL 等 6 个基准上全面超越现有 LLMbased 方法,尤其在超长期预测(3000+ 步)和少…
深度解读 arXiv:2606.23391 2026-08-14
Character-Aware Neural Language Models:从字符出发的神经语言模型
仅以字符序列作为输入的神经语言模型在英语 Penn Treebank 上即可与当时最强词级 LSTM 基线持平(且参数减少约 60%),并在阿拉伯语、捷克语、法语、德语、西班牙语、俄语等形态丰富语言上一致超越词级/语素级 LSTM——证明"对很多语言,字符级输入已足够"。 2015 年的神经语言模型主流仍是 wordl…
深度解读 arXiv:1508.06615 2026-08-14
Lumiere Project:基于 Bayesian 用户建模推断软件用户的目标与需求
Horvitz 等在 Lumiere 项目中把"用户建模"显式建模成 Bayesian 推理问题——以概率与效用为统一框架,从用户背景、动作、查询中推断其时变目标与需求,并将整套思路落到 Microsoft Office '97 Office Assistant 这一大规模商用智能助手中。 1990 年代中期的智能助手…
深度解读 arXiv:1301.7385 2026-08-14
SkillZip:面向可扩展 Agent 技能库的契约保持型图压缩
SkillZip 把 LLM Agent 的"技能库"显式建模成可执行过程图,在 sectionlevel 进行契约保持型压缩——把反复出现的合法子图改写成可逆的 ported macro,保留边界签名、依赖闭包、verifier 可达性、源码可展开性,从而在 3.46× 压缩率、99.2% 依赖保留、98.7% ve…
深度解读 arXiv:2608.05604 2026-08-14
AFTER:评估 LLM Agent 程序性记忆的 382 个企业任务基准
AFTER 是评估「程序性记忆(procedural memory)」在 LLM Agent 中的可迁移性基准:382 个真实企业任务 × 6 个专业角色 × 22 项程序性技能;关键发现是——程序性记忆确实在工业流程中稳定提升 3.7–6.7 分,但部分技能会退化为角色专属,迁移后失效;且多模型执行轨迹混合演化出的技…
深度解读 arXiv:2606.23127 2026-08-14
当置信度走上歧路:诊断 RAG 中的「检索状态锁定」
RAG 系统的「置信度」经常被骗——同一个坏掉的检索状态会反复产生高度一致的错误答案,传统「多次采样看一致性」的不确定性方法对此完全失效;本文把这现象命名为「retrievalstate lockin」,给出可测量的诊断信号与一条「答案/证据/检索状态三方一致才接受」的决策规则。 RAG 系统里一个常见做法:用 LLM…
深度解读 arXiv:2606.22728 2026-08-14
AIConfigurator:把 LLM 推理配置搜索从「GPU profiling」解放到「秒级闭环」
这是一套不依赖 GPU 实测 profiling 的 LLM 推理配置自动调优系统:把推理分解为 GEMM / Attention / Communication / Memory 四个可解析 primitives,配套校准过的 kernel 性能数据库,再加一层「自动解析最优启动参数」的抽象层。生产评测显示它能把稠密…
深度解读 arXiv:2601.06288 2026-08-14
MedRLM:递归多模态健康智能框架
MedRLM 将患者案例视为"可递归检查的外部临床环境",通过专门化 Agent 协调文本、EHR、医学影像、生理传感器、指南检索和转诊规划,配合 Clinical Evidence Graph Memory 连接患者观测与证据知识,为临床决策支持提供从单点问答到多源异构证据链推理的根本范式升级。 现实中的临床决策支持…
深度解读 arXiv:2606.20164 2026-08-14
SAC:基于 CXL 的稀疏注意力 LLM disaggregated KV Cache 系统
SAC 利用 CXL 的细粒度 load/store 语义,在稀疏注意力 LLM Serving 场景下实现 KV Cache 的按需获取,将 RDMA 方案中"全量预取"导致的传输瓶颈和本地内存浪费问题一举解决,在 DeepSeekV3.2 + SGLang 真实 Serving 环境中达到 2.1× 吞吐提升和 9…
深度解读 arXiv:2606.19746 2026-08-14
HAKARI-Bench:同条件轻量基准,把 5 类检索架构 + 效率变体放在同一张图上比
HAKARIBench 把 MTEB、MMTEB、BEIR 等大型检索基准拆解、再封装成 35 个 Nanoset × 551 个任务 × 43 种语言的统一格式小数据集,让 55 个模型在 BM25 / dense / sparse / late interaction / reranker 五类检索架构及其降维、量…
深度解读 arXiv:2606.22778 2026-08-14
ReAct:在语言模型中协同推理与行动
ReAct 把 ChainofThought(CoT)的"思考"和 Action Plan Generation(行动生成)合并到同一个 prompt 里的交错序列(Thought → Action → Observation → Thought → ...),让 LLM 在推理时即时调用外部工具(搜索/查询/执行)来…
深度解读 arXiv:2210.03629 2026-08-14
Chinchilla:算力最优的大模型训练法则
Chinchilla 通过对 400+ 个 70M–16B 参数、5B–500B tokens 的 Transformer LM 做系统性消融拟合,得到一条"算力最优训练"的近 IsoFLOP 边界:模型参数与训练 tokens 应按等比例同步放大——并以此把 Gopher(280B)换成一个 70B / 4× 数据的…
深度解读 arXiv:2203.15556 2026-08-14
Skip-Thought Vectors:句子级分布式表示的早期里程碑
SkipThought 把"跳格阅读"的自监督思路从 word2vec(CBOW/Skipgram,预测中心词 / 上下文词)扩展到句子级:用一个 GRU encoder 把当前句子编码成向量,再用两个 GRU decoder 分别重建"前一句"和"后一句"——最终得到的 sentence vector 在 8 个下游…
深度解读 arXiv:1506.06726 2026-08-14
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
LLM Agent 普遍存在「过度特权」问题——明明低权限工具就够用,偏偏选高权限工具,而且临时故障反而加剧这种倾向;通用的 Safety Alignment 并不自动迁移到 LeastPrivilege 原则;通过特权感知的 PostTraining 防御(privilegeaware posttraining),可…
深度解读 arXiv:2606.20023 2026-08-14
人-AI 协同进化动力学:用形式化动力学解释「社交智能」为何只在长期交互中涌现
论文提出 HACDH(HumanAI Coevolution Dynamics Framework),把长期人AI 对话视为一个「自组织的社会认知动力系统」,并用 14700 轮的实证数据证明:社交智能来自于跨时间尺度的协同进化,而不是任何单轮的对话技巧。 当前「社交型 AI」(陪伴、角色扮演、个性化助手)普遍存在三个…
深度解读 arXiv:2606.19144 2026-08-14
Qiskit Code Migration with LLMs:基于 Taxonomy-RAG 的量子代码自动化迁移
针对 Qiskit 版本演进带来的 API 弃用和代码技术债问题,该工作提出用 Taxonomybased RAG 架构引导 LLM(Gemini Flash2.5 / Gptoss20b)完成量子代码迁移;限制性检索模式(Restrictive Scheme)显著降低幻觉率并提升迁移建议质量,Gemini Flash…
深度解读 arXiv:2606.20173 2026-08-14
Muon 何时有助于 Agentic 强化学习?
本文在 ALFWorld 稀疏奖励 agentic RL 场景下系统比较了 Muon 与 AdamW 优化器,证实「Muon 仅作用于隐藏层权重矩阵 + 与合适的优势估计器与学习率匹配」时能显著提升 agentic RL 训练效率,并把 finalwindow validation success 从 0.290 推到…
深度解读 arXiv:2607.16169 2026-08-14
NOWJ@COLIEE 2026:面向法律检索与推理的自适应流水线
NOWJ 团队在 COLIEE 2026 全部五项任务中采用「按任务难度与查询特性自适应切换」的设计思路,用稠密检索 + 多阶段重排序 + 少样本/零样本提示 LLM 的组合,在法律案例检索、案例蕴含、法条检索、法律文本蕴含与判决预测五个赛道上分别给出流水线方案。 法律 NLP 长期面对两个痛点:其一,法律文本高度专业…
深度解读 arXiv:2607.16603 2026-08-14
Distilled RL:把教师监督塞进 RL 目标,做更细粒度的 LLM 后训练
针对 LLM 后训练里 RL(粗粒度 outcome 监督、credit assignment 难)与 OnPolicy Distillation / OPD(用 KL 无条件对齐教师 logits,要么"学不到新东西"要么"教师信号失效")的两难,本文提出 Distilled Reinforcement Learni…
深度解读 arXiv:2607.17247 2026-08-14
MCompassRAG:用「主题元数据」做语义罗盘,把段落检索的天花板抬高一个量级
论文提出 MCompassRAG,一种「主题元数据 + 同空间 embedding + LLM 教师蒸馏」的检索框架:在 chunk embedding 里同时塞进主题元数据,让轻量级 retriever 自己学会「按主题找段落」,无需推理时再调 LLM,在 6 个复杂检索基准上把信息效率平均提升 8.24%,延迟降到…
深度解读 arXiv:2606.18508 2026-08-13