研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

SCoRE:显式证据选择与整合的 Agentic Visual RAG
本文解读遵循 lessons2026W37 / W36 / W35 的写作指引:v2 模板覆盖率 ≥90%、字数 ≤3,900 CJK、⚠️ 密度 ≈1.0/1K 字、§0 元层五问显式声明、R 命名反方、边界声明 12/12 必填。所有要点来自 abstract 与公开页事实,论文未公开内容一律标注「原文未明确」。 …
深度解读 arXiv:2609.15800 2026-09-16
CiteGuard-RAG:以验证为中心的证据落地问答系统
本文解读遵循 lessons2026W37 / W36 / W35 的写作指引:v2 模板覆盖率 ≥90%、字数 ≤3,900 CJK、⚠️ 密度 ≈1.0/1K 字、§0 元层五问显式声明、R 命名反方、边界声明 12/12 必填。所有要点来自 abstract 与公开页事实,论文未公开内容一律标注「原文未明确」。 …
深度解读 arXiv:2609.15830 2026-09-16
ModaLens:报告条件下医学 VLM 的图像敏感性审计
本文解读遵循 lessons2026W37 / W36 / W35 的写作指引:v2 模板覆盖率 ≥90%、字数 ≤3,900 CJK、⚠️ 密度 ≈1.0/1K 字、§0 元层五问显式声明、R 命名反方、边界声明 12/12 必填。所有要点来自 abstract 与公开页事实,论文未公开内容一律标注「原文未明确」。 …
深度解读 arXiv:2609.15635 2026-09-16
根因归因是一个搜索问题:面向长时序 Agent 失败的持续搜索
⚠️ 本文基于 arxiv 摘要级信息(abstract + TLDR)撰写,方法细节与具体数字若未在摘要中给出则标注「原文未明确」,不编造。GitHub 仓库:原文未明确代码链接是否公开(摘要未提供),仅 abstract 提到的 MegaRCAMix 数据集。 | 维度 | 状态 | ||| | 主轴独立 veri…
深度解读 arXiv:2609.13463 2026-09-16
没有系统性的思维?在规则归纳任务上评估推理模型
⚠️ 本文基于 arxiv abstract + paper_card TLDR 撰写,仅含 abstract 显式信息的方法/结论/数字。GitHub 已核(abstract 显式给出 | 维度 | 状态 | ||| | 主轴独立 verifiability ≥20% 抽查 | ✅ 三源(arxiv abs + pa…
深度解读 arXiv:2609.13948 2026-09-16
E2A-Bench:金融图表推理中证据到行动可靠性的基准测试
⚠️ 本文基于 arxiv abstract + paper_card TLDR 撰写,abstract 已给出会议(EMNLP Findings)、GitHub( 与会议 anchor 均经 abstract 显式核对。 | 维度 | 状态 | ||| | 主轴独立 verifiability ≥20% 抽查 | ✅…
深度解读 arXiv:2609.14302 2026-09-16
Atria Dawn:Agentic 超级智能的黎明——面向科研工程的基础智能体模型
Q1 这篇论文真正在解决什么问题? 科学发现与软件工程的生产链条本身正在被 AI 代理改写:当代理参与到"训练下一代代理"的循环里,人类研究者该往哪里使劲?Atria Dawn 同时回答两个问题:(a) 一个面向科研/工程/数字工作流的基础智能体模型能不能达到前沿水平?(b) 人机共研的真实研发流程目前是什么形状? Q…
深度解读 arXiv:2609.15818 2026-09-15
RSIAgent:新环境下的递归自我改进多智能体框架
Q1 这篇论文真正在解决什么问题? 数字代理(Digital Agent)在被部署到一个新的 OS/GUI/工具链环境时,预训练模型对界面、工具调用、错误模式没有先验,传统解法要么做大量有标注 SFT/RL,要么写脆弱的规则脚本。RSIAgent 把"在陌生环境里学会用环境"做成了一个训练无关的训练部署闭环。 Q2 为…
深度解读 arXiv:2609.15364 2026-09-15
TRACE:面向火灾后不可逆损毁的物体理解基准与特征恢复模块
Q1 这篇论文真正在解决什么问题? 火灾后的物体经历不可逆的物理形变(几何塌缩、材质烧蚀、外观变化),现有视觉模型在通用图像损坏基准(噪声 / 遮挡 / 天气)上表现良好,但物理结构性退化让它们几乎崩盘。TRACE 提供一个新基准 + 一个冻结式恢复模块专门处理这类退化。 Q2 为什么这件事过去做不到? 两个独立原因:…
深度解读 arXiv:2609.12078 2026-09-15
Ambient @ EgoLongQA 2026: Distilling Long-Video Perception into a Sub-2B Model
ECCV 2026 WearableAI Challenge EgoLongQA 赛道冠军方案:用工具调用 Agent 流水线的 junior 感知模块作为蒸馏信号,将 10 分钟第一人称视频理解能力压缩进 1.9985B 视觉语言模型,仅用大流程 1.1% 的参数量达到 89% 准确率。 可穿戴设备(AR 眼镜等)上…
深度解读 arXiv:2609.07154 2026-09-15
ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs
现有 MLLM 在突发物理危险面前几乎无法可靠反应:约 1/3 的危险场景处理错误、不随模型规模增长而改善——ReactHuman 首次用 240Hz 刚体仿真提供了可复现的诊断基准与训练信号。 将 MLLM 部署为家庭机器人决策核心的硬性前提,是其能对突发物理危险做出即时、安全关键的动作反应(接住滑落的盘子、躲避坠落…
深度解读 arXiv:2609.10895 2026-09-15
Ambient @ EgoProactive 2026: Proactive Egocentric Assistance with Visually Grounded Supervision
ECCV 2026 Wearable AI Challenge EgoProactive 赛道冠军方案(大模型组第一、≤2B 组第二):将介入时机决策从自由生成重构为单 token yes/no 分类,macroF1 提升 0.249,Gmean 提升 0.30;同时用工具调用视频 Agent 生成监督信号,证明视觉 …
深度解读 arXiv:2609.07099 2026-09-15
HazardAuditor:让 Computer-Use Agent 真正可被「执行级」安全审计
Computeruse agent 在运行时同时调度浏览器、终端、文件系统与外部服务,安全风险藏在「执行动作序列」里,而不是单条 prompt / response 文本里。现有 guard 模型只看静态文本、现有可执行安全平台只产出评测判定而非归一化监督信号——两边都缺。HazardAuditor 把异构 agent…
深度解读 arXiv:2609.15134 2026-09-15
When Agents Slow Down:用 Elo-per-token 看清 LLM Agent 的测试时策略
LLM Agent 在测试时一边修订方案、一边调用工具、一边探索替代、一边决定何时停止——这种「自适应测试时计算」让传统的 pass@k / 最终得分指标无法刻画 agent 究竟有多会「算」。论文提出 Elopertoken 分析:在每个 token 预算点追踪当前 bestofbudget 的连续分,用 Bradl…
深度解读 arXiv:2609.15309 2026-09-15
Pick Your Poison:把后门投毒评估从「随机抽 N 条」改成「选哪 N 条」
固定模型、固定干净数据、固定中毒条数,仅仅换一组随机抽出来的毒样本,攻击成功率就能从 3% 跳到 80%——也就是说当前主流后门评测普遍低估最坏情况。论文把「挑哪 N 条」形式化为 oraclebudgeted set optimization,提出 SAILS:用几百次 finetuneandevaluate 训练一…
深度解读 arXiv:2609.15029 2026-09-15
Vibe Design Agents 的"探索 / 实现"分离:用结构化设计规格代替温度
1. 这篇到底在解决什么问题? 当前的"vibe design agent"(自然语言 → UI 渲染 + 前端代码)只能产出"一个有效页面",但用户实际想要的是"一组连贯的备选方案供我选"。直接调高 LLM 采样温度是个"钝刀"——它把"美学决策的差异"和"语法敏感代码的差异"耦合在一起,结果是同一个温度下"主题风格…
深度解读 arXiv:2609.15078 2026-09-15
Realtime-Venus:双 9B 模型 + 异步委托的全双工多模态交互系统
1. 这篇到底在解决什么问题? 现有"全双工(fullduplex)"语音/视频交互系统通常要么是延迟高、回合制(用户说完→模型思考→生成回复,中间停顿几百毫秒到几秒),要么是多模型串联(ASR → LLM → TTS 串行,每段都吃延迟)。RealtimeVenus 想做一个单模型承担"连续感知 + 对话控制 + 语…
深度解读 arXiv:2609.13814 2026-09-15
Agent as Policy:通用 Agent 直接驱动真实机器人的零训练范式
1. 这篇到底在解决什么问题? 现有机器人策略要么走"任务专属模仿学习/强化学习"(每个新任务都要重新采集、训练),要么走"通用大模型 + 任务专属 prompt 模板"(仍然需要环境特定 finetune 或仿真预训练)。本文问的是:能不能把"任务规划"和"动作执行"完全交给一个通用 LLM Agent,让它看视觉证…
深度解读 arXiv:2609.12541 2026-09-15
临床 LLM 的确定性算术求解器:让模型「写代码」而不是「算数」
本文提出 ProgramSolve 接口——让 LLM 不直接算术,而是写针对具体病例的 Python 代码,由受限本地执行器作为确定性求解器运行;模型的任务降级为「决定怎么调用求解器」。在 MedCalcBench Verified(1,100 病例 / 55 计算器)上,Qwen2.532BAWQ 走 Progra…
深度解读 arXiv:2609.10728 2026-09-15
Pelican-Sim 1.0:面向具身智能的通用世界模型模拟器
PelicanSim 1.0 提出了一个统一动作表征 + 动作视频注入 + 稀疏 MoE + 四步自回归蒸馏的通用世界模型模拟器,在约 100 万条真实与仿真轨迹上训练后,能跨异构具身体(机械臂、双臂、移动底盘等)预测未来观测,并在 AgiBotWorld Beta / RoboMIND / RoboTwin 三个基准…
深度解读 arXiv:2609.12036 2026-09-15
Competence-Gated Pooling:让 LLM 在事件预测中学会「不说话」
本文提出 Competence Gate(能力门控)——一种用「已结算结果」反推领域级权重的池化机制:在已有市场/众包/统计预测的前提下,LLM 只在它能「打补丁」时才上场,否则保持沉默;Brier 损失在 2,357 道已结算二元题、5 个 LLM 上从主外部基线 0.0771 降到 0.0732,并显著优于全局池化…
深度解读 arXiv:2609.12101 2026-09-15
Occamy-1.0:面向协作工作流的开放成本-性能帕累托前沿 35B 模型
Occamy1.0 是一个 35B 级别的"协作(cowork)"专用智能体模型,思路不是堆参数,而是在 Qwen3.635BA3B 的基础上用"可执行任务合同 + 多 harness 长程轨迹回放 + 分阶段后训练"三件套,专门训练模型在跨数十到上百次模型调用的端到端工作流里保持状态连续性、工具契约遵从与失败恢复,从…
深度解读 arXiv:2609.11977 2026-09-15
MobileVLA-R1 2.0:面向移动机器人的 RL 增强视觉-语言-动作推理
MobileVLAR1 2.0 是一个面向移动机器人的 VLA(VisionLanguageAction)框架,核心做法是把"结构化具身推理"和"可执行动作生成"显式解耦——用 CoT 监督对齐 + 强化学习联合训练多粒度推理能力,再用"推理条件动作解码器"把推理表示映射到任务级动作目标,最后由机器人控制器转成具体执行…
深度解读 arXiv:2609.06251 2026-09-15
ReMoMask-2:潜空间检索增强的掩码运动生成
ReMoMask2 把"检索增强文本到运动生成(RAGT2M)"从粗粒度、表征分离的设计推进到结构感知 + 潜空间检索的范式:第一代 ReMoMask 解决"如何结构化地检索与融合",ReMoMask2 解决"如何让检索证据直接进入生成器的潜空间"——结果在 HumanML3D / KITML / SnapMoGen …
深度解读 arXiv:2609.08365 2026-09-15
RAG:检索增强生成的奠基之作(Lewis et al., 2020)
⚠️ 注意:本文评论对象为 Lewis 等人 2020 年提出的通用 RAG 模型,是检索增强生成(RAG)范式的奠基论文;主分类为 rag,形态 method,S2 被引 18185(OpenAlex 3066),影响因子 1634,被 NeurIPS 2020 接收。 RAG 把「冻结的稠密检索器(DPR)+ 可微…
深度解读 arXiv:2005.11401 2026-09-15
StepAudio 3 Gen:用离散自回归统一 TTS / 声音设计 / 音效 / 音乐
⚠️ 注意:本文评论对象为 StepFun 等机构 2026 年 9 月公开的 StepAudio 3 Gen Technical Report;主分类 multimodal,形态 method;这是 StepAudio 系列第三代,定位是「通用音频生成」而非「专用 TTS」;提交时间 2026 年 9 月,被引尚未生…
深度解读 arXiv:2609.12945 2026-09-15
Feyospace-v1:Cyber Mercury Seven 如何训练前沿网络安全模型
Feyospacev1 是一份由 7 人小团队独立完成的端到端网络安全大模型训练技术报告,核心贡献不是新算法,而是数据为中心的五系统协同框架——Choulea(隐式推理特征分析)+ SkyReal(教师采样降本)+ Hongzwang(绕 API 限制)+ PSBreakup(恢复合并模型能力)+ Kreator(专家…
深度解读 arXiv:2609.08418 2026-09-14
DataFlex-RL:面向 RLVR 数据策略的评测平台
DataFlexRL 在统一 GRPO 训练流程下系统评测了 13 种 RLVR 数据策略(rollout 选择、reward 重加权、领域混合),结论是 uniform GRPO 已经把 Qwen2.57BBase 的领域均衡平均准确率提升 7.76 pp,但 8 种 rollout 选择/重加权方法与 unifor…
深度解读 arXiv:2609.06107 2026-09-14
基于有限反馈的 LLM 专家在线学习
在每轮只能拿到稀疏反馈($m \ll T$)的在线路由场景下,本文给出"先建模成带特征的上下文 Bandit,再通过选择性观察奖励"的两段式算法,分别在全信息与 Bandit 反馈设定下取得 $\tilde{O}(d\sqrt{T}/\sqrt{m})$ 与 $\tilde{O}(d\sqrt{TK/m})$ 的 re…
深度解读 arXiv:2609.05820 2026-09-14
超越 Top-k:用 DPP 让 LLM Agent 的技能路由从"独立排序"升级到"互补集合选择"
现有 Skill Router 普遍按"查询相关性"独立给候选 Skill 打分,然后取 Topk——这在 Skill 注册表存在大量功能冗余时会浪费上下文预算;本文提出 Diverse Skill Routing (DSR),用 Determinantal Point Process (DPP) 做重排序,并设计 q…
深度解读 arXiv:2609.05824 2026-09-14