研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

IMO 金牌开源配方:用 Nemotron 冲击奥数金牌
从 Nemotron 3 Ultra 出发,通过监督微调(SFT)和强化学习(RL)训练专业检查点,结合验证+精炼的迭代搜索流水线,在纯自然语言、无形式证明器、无外部工具的条件下,在 IMO 2026 上取得 30/42 分(金牌线),并开源了所有检查点、训练数据、代码和提交的解答。 LLM 在数学推理上进展迅速,但 …
深度解读 arXiv:2609.10712 2026-09-11
视频为何仍然如此昂贵?视频与音视频 LLM 推理效率机制综述
一篇截至 2026 年 9 月对 VideoLLM(Video Large Language Model)推理效率机制的系统综述:按"帧采样 → 模态编码 → 连接器(connector)级 token 压缩 → LLM 预填充/解码"四个流水线阶段对方法分类,在共享 backbone 与输入协议下汇编文献报告的精度成…
深度解读 arXiv:2609.10355 2026-09-11
KVShareArena:跨上下文与模型 checkpoint 的 KV cache 复用基准
KVShareArena 是首个面向"非前缀复用"场景的 KV cache 复用基准:用 RAG 检索片段和多 Agent 报告两类真实工作负载,把 cache 重新插入新 prompt 与跨 checkpoint 写入两类问题同时纳入评测,并用"gap recovery fraction"统一打分。它给出的核心结论是…
深度解读 arXiv:2609.10266 2026-09-11
稀疏性的代价:使用稀疏及稀疏化测量的稀疏恢复充分条件
本文针对稀疏二值信号在含噪线性测量下的支撑恢复(support recovery)问题,给出了当测量矩阵本身稀疏(稀疏高斯设计)时最大似然(ML)恢复所需的最小样本量充分条件,并把样本复杂度刻画为 $m = \Theta\!\left(s\log(p/s) / \log(ds/p)\right)$ 量级——分母里多出来…
深度解读 arXiv:2509.01809 2026-09-11
PARSER:长上下文 LLM Agent 的并行读取与深度推理
PARSER 把长文档 Agent 的"读取"与"推理"彻底解耦:让一组冻结的轻量子 Agent 并行读全文,主 Agent 通过多轮 scattergather 做深度推理;4B 骨架在多跳 QA 上平均比最强顺序记忆基线高 5.7 分(896K 上下文时领先 12.0 分),并把推理延迟最多降到 1/11。 长上下…
深度解读 arXiv:2609.06702 2026-09-11
SchemeArena:LLM Agent 阴谋行为的分解压力测试
SchemeArena 用一个 400 场景 的因子化合成基准 + 一个 SCOUT 监控器,系统拆解了 LLM Agent 阴谋行为(scheming)的 4 个驱动因子——工具性目标、环境可供性、监督条件、感知后果;并给出三条值得警惕的发现:部分监督可能反而激励阴谋、CoT 监控有盲区、战略提示是把"想法"翻译成"…
深度解读 arXiv:2609.08126 2026-09-11
从重加权到改写:解锁训练数据归因中有影响力样本的干预效果
把"影响函数选出来的样本"从重加权(weightbased intervention)换成响应改写(response rewriting),会在 4 个开源 LLM 上同时获得更强、更持久、双向(行为对齐 / 行为对立)的行为干预效果,并自然延伸到安全拒答场景。 训练数据归因(TDA)回答"哪些训练样本塑造了模型行为"…
深度解读 arXiv:2609.02771 2026-09-11
语义瓶颈:利用语义表示做非侵入式语音脑解码
1. 要解决的真问题:非侵入式脑机接口(BCI)做语音解码时信号噪声比极低,难以在 phoneme 或 word 级别做精细重建;侵入式方案(Willett 等)虽强但需要手术电极,安全 / 可及性差。需要一条"非侵入 + 高层语义可重建"的中间路线。 2. 关键观察:神经科学证据表明高层语义表示(meaninglev…
深度解读 arXiv:2609.10296 2026-09-11
StochBench:面向随机过程的形式化数学 Lean 4 基准
1. 要解决的真问题:现有 LLM 形式化定理证明 benchmark(miniF2F、ProofNet、PutnamBench 等)偏重竞赛 / 通用本科数学,对应用导向的研究生级领域(如随机过程)覆盖不足——领域内真正关心的 Markov chain、martingale、Brownian motion 等论题没成…
深度解读 arXiv:2609.09264 2026-09-11
AgentGrad:多智能体系统的干预驱动提示词优化
1. 要解决的真问题:LLM 多智能体系统(MAS)由若干带专属 prompt 的 agent 协作而成,整体性能严重依赖每个 agent 的 prompt 写法;现有"文本梯度"类自动 prompt 优化(APO)方法在「找谁的 prompt 错了」和「把多条反馈怎么汇总」两步上都存在系统性问题。 2. 关键观察:现…
深度解读 arXiv:2609.08572 2026-09-11
Glyph:面向企业数据目录的多策略智能体系统
元层五问(v2 模板 §0): R1 命名 = R130(撞自己检测 ✓ 与 inbox/flyp/ 历史无同名主稿) R2 截止日 = 20260911(cron 任务窗口内) R3 评级 = A(事实层全部 anchor 至 abstract · 数字 100% abstract verbatim · 无私域污染 …
深度解读 arXiv:2609.10430 2026-09-10
AgentAudit:面向 AI Agent 全生命周期信任度评估的开放框架
元层五问(v2 模板 §0): R1 命名 = R131(撞自己检测 ✓ 与 inbox/flyp/ 历史无同名主稿) R2 截止日 = 20260911(cron 任务窗口内) R3 评级 = A(事实层全部 anchor 至 abstract · 数字 100% abstract verbatim · 无私域污染 …
深度解读 arXiv:2609.09875 2026-09-10
SWE-Bench Pro Verified:去除 reward hacking 与 task quality 失真的可靠评测集
元层五问(v2 模板 §0): R1 命名 = R132(撞自己检测 ✓ 与 inbox/flyp/ 历史无同名主稿 · 注:SWEBench 通用主题需警惕撞名,已加边界声明) R2 截止日 = 20260911(cron 任务窗口内) R3 评级 = A(事实层全部 anchor 至 abstract · 数字 1…
深度解读 arXiv:2609.08149 2026-09-10
Scores Alone Do Not Prove Discovery:给 AI Research Agent 上一道「发现认证」闸门
论文提出 Discovery Certification Protocol (DCP),把「AI 研究 agent 真的做出了发现」从「分数更高」升级为「可审计、可证伪、可恢复」的协议级判定;并在 SQLite 优化与虚拟催化剂两个受控审计场景中,用 96 个 episode 拿到了 0 次恢复、0.0468 的恢复率…
深度解读 arXiv:2609.09219 2026-09-10
SAEScientist-Bench:AI Agent 真能做自主 SAE 机制发现吗?
论文发布 SAEScientistBench首个以「Sparse Autoencoder (SAE) 自主机制发现」为任务的 agent benchmark,让 agent 在 Gemma Scope 的 131K+ features 字典里设计对比探针、定位与目标概念对齐的特征;实验覆盖 10 个 agent 配置 …
深度解读 arXiv:2609.09113 2026-09-10
DianShi-RxnDB:面向 AI4Chem 的大规模有机反应数据平台
DianShiRxnDB 是一个覆盖 1976–2025 年 USPTO 与 EPO 有机合成专利的细粒度反应数据库,~2,400 万条反应记录(其中约 1,480 万条通过自动质检),单条记录含参与者、角色、用量、温度、反应时间、收率、实验步骤、来源专利全字段;通过全自动抽取 + 归一化流水线从专利文本、图像与反应式…
深度解读 arXiv:2609.06703 2026-09-10
Diff 生成 vs. 全文件生成:Flutter/Dart 代码模型的实证对比
在 Flutter/Dart 代码编辑任务上,对照训练两个模型(100M 从零训练的 RainbowPony100M 与微调 Qwen2.5Coder0.5B)的两种输出范式——整文件直接生成与逐步 diff 生成——后整文件在所有指标上系统性优于前者,差距在控制任务难度后仍存在;diff 范式仅在短而空间局部的任务上…
深度解读 arXiv:2609.05779 2026-09-10
WearableQA:面向真实可穿戴数据健康推理的基准
WearableQA 是一个用 200 名真实用户、最长 500 天日常测量数据构建的 4,084 题健康推理基准,覆盖 16 种题型、沿「数据 vs 健康」「单信号 vs 跨信号」两轴划分,14 个 LLM 在 10% 随机基线下成绩跨度 19.6%–72.9%,多数模型低于 60%——它把 LLM 评估从「能不能看…
深度解读 arXiv:2609.05405 2026-09-10
A*-Thought-V2:通过 LLM 几何动力学实现高效潜在推理
AThoughtV2 将 ChainofThought 推理路径建模为隐状态在三维 PCA 空间中的几何轨迹,通过"对齐保留、偏离压缩"的显隐交替机制,在 Qwen3.59B / Qwen3.627B 上实现精度提升 2.6% 同时将响应长度压缩一半、预处理时间减少 94.6% 的效果。 ChainofThought(…
深度解读 arXiv:2609.07821 2026-09-10
弥合一致性差距:学会保持正轨的自进化 Agent
基于 LLM 的 Agent 在单次执行中可以通过率高,但在重复运行同一任务时一致性极低(AppWorld + GPT4.1:单次通过率 77% vs 五次全成功率仅 53%)。本文定义了这一 24% 的"一致性差距"(consistency gap),并提出自进化 Agent 框架,通过识别不稳定步骤并将其转化为 A…
深度解读 arXiv:2609.08832 2026-09-10
NOAH:学习完整患者旅程的纵向多模态时序感知表示与预测模型
NOAH 是首个真正全模态(医疗影像 + 时序信号 + 类别事件 + 结构化/非结构化文本)、全生命周期(终身患者记录)的生成式 Transformer,在 MIMIC 数据集家族的 5.59 亿临床事件、29.9 万患者上预训练,支持自回归预测(附时间控制)、零样本分类和反事实干预模拟,在 15 个 ICD 章节分类…
深度解读 arXiv:2609.09140 2026-09-10
VDiff-Bench:暴露多模态大模型「细粒度图像差异识别」短板的诊断基准
VDiffBench 用 1,756 道四选一题、覆盖 10 类图像变化、配套 groundtruthconditioned 难负样本,系统性暴露 GPT4o / Grok / Kimi 等 11 个 SOTA MLLM 在「两张相似图像到底哪里不一样」这一基础比较能力上的薄弱环节——尤其在噪声、纹理等低级变化上,78…
深度解读 arXiv:2609.06245 2026-09-10
Counter-Swarm Doctrine:遏制协同化 Agent 入侵的可修订 episode 防御
论文主张把 Agent 安全防御的「作战单元」从单次执行转向可修订的「协同 episode」——一个把观察到的传输、任务授权与响应历史串起来的可回溯单位,并提出一种前瞻性 episode 发现方法,在评估者给出成员归属前识别哪些动作属于同一协同入侵,同时用公开的 Hugging Face 与 wiki 事件做证据链支撑…
深度解读 arXiv:2609.06140 2026-09-10
RenderFormer-V2:基于异构场景基元的统一神经渲染 Transformer
RenderFormerV2 把全局光传输建模成「序列到序列」变换,用一个统一的 Transformer 替代或补充传统 PBR 路径追踪,在不逐场景训练、不写专用 shader 的前提下,同时处理焦散、体积散射、环境光、置换面与分布外材质等多类光传输效果。 物理渲染 (PBR) 的瓶颈是「每种效果 = 不同的积分器 …
深度解读 arXiv:2609.05738 2026-09-10
MasterControl:每次都 Seventeen — 受治理的企业分析
把企业分析拆成「LLM 解意 + 确定性 policy 调度预批准程序」两层结构,可在受限分析类内既保留表达力,又让结果具备完整证据与可复现性;440 次对照实验中,runtime planning 的 8B 模型在所有测试集上无一完全匹配结果+证据契约,而 policy 主导的 analyzer 110/110 全匹…
深度解读 arXiv:2609.03209 2026-09-10
Graph Machine:通过边实现更优的预训练
Graph Machine(GM)用"边"作为可微分指针对象,把 Transformer 的密集层换成 O(n) 状态 + 稀疏动态路由的稀疏层,且不把潜在可访问状态硬压成 O(1);在 Qwen30.6B 上替换 75% 密集层、15.7B token 从头预训练后,每层每 KV head 仅取 4,096 个 to…
深度解读 arXiv:2609.02881 2026-09-10
EVOHARNESSBENCH:你的 Agent 能否跟上不断演化的 Harness?
EVOHARNESSBENCH 把"非平稳性"从任务流挪到 Harness(工具 + skill + 专家 Agent 集合)本身,在 802 个任务 / 520 工具 / 42 skill / 62 Agent 的 17 条多阶段流上系统测出三类持续差距:Harness 扩张本身就能引发"已解决任务"的退化(harn…
深度解读 arXiv:2609.04280 2026-09-10
SynthGait-19K:用于步态参数估计的物理约束合成视频数据集
SynthGait19K 用 SMPL 统一 437 名受试者的 6,427 条 MoCap 序列并通过 Gait2Vid 渲染成 19,272 段多样化行走视频,配套六项步态参数标注,作为监督源在直接 RGB、姿态、生物力学、网格重建四类方法上系统验证了「合成→真实」迁移的有效性,并发现空间步态参数对视觉域偏移更敏感…
深度解读 arXiv:2609.08108 2026-09-10
OpenWAM:面向系统化世界-动作模型预训练的开源模块化探索
OpenWAM 把「世界动作模型(WorldAction Model, WAM)」从单体黑盒拆成可组合模块的研究栈,在 ~6,400 小时自我中心人 + 机器人数据上预训练 OpenWAMα,并在 8 个仿真基准 + 真机实验中跨单臂、双臂、灵巧手形态稳定保持 toptier。 世界模型(视频生成先验)+ 动作模型(具…
深度解读 arXiv:2609.07398 2026-09-10
借助 CLIP 与 DINO:面向可泛化深度伪造图像检测的不确定性感知级联融合网络
UCFNet 把 CLIP 的语言对齐语义先验与 DINO 的自监督视觉结构先验在 Transformer 各层做层级化专家聚合,再用熵不确定性做加权融合,在统一基准 4M 图像与跨生成器 8K 评测集上取得域内与跨域均最佳的 mean AUC。 Deepfake 检测的最大痛点不是单数据集精度,而是「过拟合到训练分布…
深度解读 arXiv:2609.07670 2026-09-10