研究库 深度解读
Explainers · 学术推广产出

解读

1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

StarHarness:用分层搜索进化企业 Agent 的 Harness 框架
1. 本稿要解决的真问题:工具密集型企业任务(SRE / ITSM / 金融自动化)中,固定模型权重不变时,"模型环境失配"是 Agent 性能的隐性瓶颈——同模型换一套 prompt / 工具接口 / subagent 结构就能差出几十个百分点,但如何系统性地发现并修复这层失配,过去没有可复现的方法。 2. 为什么非…
深度解读 arXiv:2608.24804 2026-08-31
The Embedder's Dilemma:LLM 当 embedder 比传统 vector 模型到底贵多少?
在 37 个任务 + 10 个 LLM + 26 个 embedding 模型(参数从 118M 到 14B)的受控对比下,最好的 LLM embedder(Gemini 3.1 Pro, 77.6)只比最好的传统 embedder(77.2)高 0.4 分——几乎平手,但 LLM 单次推理贵 1,431×(154 美…
深度解读 arXiv:2608.12875 2026-08-30
Scaling Laws for Neural Language Models:开启 LLM 时代的「算力分配」教科书
在语言模型交叉熵损失上同时拟合出对模型规模 N、数据集大小 D、计算量 C 三条 powerlaw 曲线,并据此推导出「在大模型上欠训练比在小模型上充分训练更划算」的算力最优分配策略——这是后续 GPT3/PaLM/LLaMA 几乎所有大模型「过度参数化 + 提前 stop」经验法则的直接理论出处。 2020 年初,在…
深度解读 arXiv:2001.08361 2026-08-30
DeepSentiBank:用深度 CNN 把视觉情感变成可分类的形容词-名词对
用 ImageNet 预训练的 CNN 在一百万 Flickr 图像 + 自动挖掘的"形容词名词对(ANP)"标签上 finetune,把视觉情感分类从 SentiBank 的二分类 SVM 推到深度卷积网络的 softlabel 分类器——是 2014 年最早把"视觉情感"从语言学多模态研究搬进工业可复现 bench…
深度解读 arXiv:1410.8586 2026-08-30
将 Agentic 游戏开发作为可扩展世界模型的可验证轨迹数据引擎
视频世界模型一味靠"堆更多爬取视频 + 更多算力"扩展是低效的——本文把 Agentic 游戏开发改造成"可执行世界规范 + 可验证奖励 + 长程轨迹数据"的递归数据引擎,提出 RLHEV(Reinforcement Learning with HumanEngine Verification) 后训练范式,让游戏引擎…
深度解读 arXiv:2608.25518 2026-08-29
Procedura:基于过程化控制的 Agentic 三维建模
原生 3D 生成器能恢复逼真 mesh,但密集网格在该硬的地方软、没有部件分解、暴露不出可编辑参数——Procedura 把 "3D 形即代码" 范式推到工程化高度:让 Agent 把物体写成过程化装配体(parametric program + 具名部件 + 类型化可机器校验的配合关系),按 mated frame …
深度解读 arXiv:2608.26238 2026-08-29
PILOT in the Loop:长时序 Agent 的实时自我改进
现有 Agent 自我改进方法都是"跑完再反思"——PILOT 把 supervisorworker 拆开,让 supervisor 在 worker 执行过程中实时纠偏,同时把执行中暴露的程序/失败模式即时蒸馏为可复用 skills/memory;这个 harness 在 TerminalBench 2.0 上比对照…
深度解读 arXiv:2608.26530 2026-08-29
EditaLive! 面向直播的统一人物视频编辑
EditaLive 将预训练图像动画模型 WanAnimate 改造为流式推理架构,在 CharEdit50K 数据集上实现「两步采样器 + 对齐自 rollout 蒸馏」,在保持面部表情一致性的前提下完成低延迟实时人物视频编辑。 传统 video editing 关注场景级内容优化,而直播场景(live stream…
深度解读 arXiv:2608.27123 2026-08-29
FlowEvo:通过工作流与可执行 Skill 协同演化的自演化 Agent
FlowEvo 是一个免训练的推理时框架,让 LLM agent 的"工作流"与"可执行技能"在同一回合内协同进化——成功的工作流被编译成可调用技能存入持久化技能库,技能又被检索出来作为新工作流的构件,并通过对下游效用的持续追踪抑制负迁移技能;以 GPT4omini 为统一 backbone,在 ALFWorld / …
深度解读 arXiv:2607.21596 2026-08-29
评估工件"授权"了什么?Inspect Evals 提交绑定声明相对推理普查
这篇 position 论文提出"声明回放(claimreplay)层"概念:LLM 评测工件(task + scorer + 指标)只规定了一次前向计算,并不自动授权"该指标所承载的比较性声明";论文对 Inspect Evals 仓库固定提交下的全部 124 个机械合格单元做了普查,发现 110 个在确定性推理前即…
深度解读 arXiv:2608.19269 2026-08-29
Luce:可重光照高斯表示的图像到 3D 资产生成
Luce 提出一种把"几何 + PBR(基于物理的渲染)材质"统一在体素化多模态高斯云里的 3D 表示法,每种 PBR 模态(反照率 albedo、金属度粗糙度 metallicroughness、法线 normals)使用专用高斯基元;通过 VAE 压缩到材质感知潜空间,再用 rectifiedflow Transf…
深度解读 arXiv:2608.23943 2026-08-29
TacForcing:融合执行时间触觉反馈的流式动作生成
TacForcing 是面向富含接触(contactrich)的接触式操作任务的流式动作生成框架。它用"流式动作专家(streaming action expert)"替代标准动作专家,无需独立高频反应控制器即可在执行期间融合触觉观测;同时引入 ExecutionAware Tactile Attention (EAT…
深度解读 arXiv:2608.25798 2026-08-29
TTPO:测试时策略优化 —— 把数学推理后训练从"标签依赖"解放出来
TTPO(TestTime Policy Optimization)提出一种不对称训练目标:让同一 prompt 下与多数投票伪标签一致的 rollout 走 OnPolicy SelfDistillation(OPSD)蒸馏、不一致的 rollout 走 Grouped RL 惩罚,并在 token 级别再筛一遍 —…
深度解读 arXiv:2608.27448 2026-08-28
CaSKG:用反事实-因果校准让 Agent Skill Graph 在规模化时仍可检索
CaSKG(CounterfactualCausal Skill Graphs)把"skill graph 的边可信度"当作一等公民:先用高召回的语义/词法/IO/结构证据建候选图,再用方向条件化的文本反事实 probe(remove / substitute / reorder)做边校准 + 贝叶斯平滑,最后发布一个…
深度解读 arXiv:2608.25500 2026-08-28
Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
提出 MMLVE(MultiInstruction MultiShot LongVideo Editing)任务及 MMLVEAgent 框架:用 LLM + VLM 协同实现 shotlevel 视频解耦,定义三个核心目标(CSEC/MID/ZDSS)并通过 agentic editing pipeline 解决长视…
深度解读 arXiv:2608.26809 2026-08-28
PlanSightRAG:面向土木标准图自动化合规审查的视觉优先多模态 RAG
PlanSightRAG 针对土木基础设施合规审查场景,提出直接对 2D 图纸图像进行索引和推理的视觉优先 Multimodal RAG 框架,集成 ColNomic3B 多向量检索、PlannerRetrieverAuditorSynthesizer 智能体流程和 MaxSim 热力图证据链,在五个州交通部(DOT)…
深度解读 arXiv:2608.26091 2026-08-28
Aphanta:诊断任务对齐的图像编辑中间结果用于多模态推理
Aphanta 是一个自动化任务发现与闭环诊断框架,通过三路对比实验(直接推理 / 编辑器生成中间结果 / 理想参考中间结果)揭示 MLLM→图像编辑器→MLLM 流水线中视觉中间结果的真实有效边界,而非假设"任何视觉表征都能帮助推理"。 现代 MLLM 可以利用裁剪、缩放、标记、素描等手段生成显式视觉中间状态作为"视…
深度解读 arXiv:2608.26993 2026-08-28
GameWAM:视频游戏的世界动作模型
GameWAM 提出了 WorldAction Model(WAM)的概念——联合建模未来视觉观测与可执行键盘鼠标轨迹,并通过 blockcausal conditioning、flow matching、blockcycle control 等机制首次实现原生封闭循环游戏玩法与 GUI 控制,是游戏 AI 领域首个同…
深度解读 arXiv:2608.26200 2026-08-28
Skill Issue:LLM 中的 Skill 是否具备语言无关性?
同一 LLM 在不同语言接口下玩同一个博弈游戏时,会表现出显著且系统性的"技能"差异——这种差异与"知识不一致"正交,可被多语言 selfplay 隔离出来;当仅切换中间推理语言时,部分场景下的能力下降能被大幅恢复,提示语言对决策的不同阶段存在差异化影响。 多语言 LLM 评测长期聚焦"知识差异"(同一问题用不同语言问…
深度解读 arXiv:2608.25832 2026-08-28
一种面向 CT 扫描空间关系验证的、可靠且模块化的 Agent 系统
针对 CT 影像中"左肺上叶前方的结节位于哪一侧"这类二元空间关系问答,作者把端到端 VLM 拆成 语言解析 → 解剖定位 → 几何验证 三段流水线,借 YOLO 检测器 + 确定性几何规则替代模型内部的黑箱判断,在 MIRP 空间 QA 基准上把 accuracy 从 Qwen2VL 直接 prompting 的约 …
深度解读 arXiv:2608.21140 2026-08-28
GUI-Primitives:诊断视觉语言 GUI grounding 中的空间推理失败
作者用 994 条对比指令对(仅关系词变化,截图与锚点固定)把 VLM 的 GUI grounding 错误拆成两个独立失败源——候选定位失败(predicted point 落在两个候选框之外)与 关系理解失败(落在候选框内但选错)——在 19 个 VLM 上跑出严格点框准确率 ≤32%,并证明多数失败发生在定位阶段…
深度解读 arXiv:2608.21832 2026-08-28
Prefix Sliding:面向高效 test-time scaling 的前缀滑动方法
针对长链推理中"全量 attention 把整条 reasoning trace 留在 KV cache 内存里导致推理成本随生成长度线性爆炸"的痛点,作者提出 Prefix Sliding——只保留系统 prompt + 工具的前缀 KV 块,以及最近几千 token 的滑动窗口 KV 块,中间推理 token 的 …
深度解读 arXiv:2608.26070 2026-08-28
多模态知识图谱上的多粒度上下文增强 RAG
针对多模态 RAG 中"图像与文本独立处理、再后融合"造成的图文语义缺口,本文提出 CEMMKG(ContextEnhanced Multimodal Knowledge Graph)框架,在图像的局部上下文与全局上下文两层做注入,并允许局部上下文按语义由细到粗多粒度组织,从而在不改动下游任何 GraphRAG 主干的…
深度解读 arXiv:2608.25986 2026-08-27
RetrievalRouter:文档检索的模态与架构联合选择
在高风险文档检索场景(金融、医疗、法律)中,最有效的多模态 + lateinteraction pipeline 慢得不可用,最快的稀疏 / 纯文本 pipeline 又漏检复杂文档证据——RetrievalRouter 用一个仅看 query 文本的轻量路由器为每个查询动态选 pipeline,并用一个可调参数同时跑…
深度解读 arXiv:2608.25625 2026-08-27
LibriBrain100:面向大规模神经语音解码的百小时广深 MEG 数据集
LibriBrain100 把单被试脑磁图(MEG)数据规模从学界此前的"个位数小时"推到 ~80 小时、把广度覆盖推到 32 个被试 + 100+ 小时总量,并配套发布标准 train/val/test 划分、可复现 Python 库、公开 leaderboard 与 ML 竞赛,从而把非侵入式脑机接口(BCI)语音…
深度解读 arXiv:2608.25204 2026-08-27
SWE Refactor Bench:编码 Agent 能否完成长时序全仓库技术栈迁移?
现有 SWE 类基准普遍被"复制原实现让测试通过"的 Blindness 捷径攻破,SWE Refactor Bench 把"迁移是否真的发生"做成独立审计环节,并据此证明当前最强编码 Agent 在 20 个真实仓库级迁移任务上三阶段全过率仅 5.4%、最佳模型也只有 47.0/100,长时序整库技术栈迁移远未解决。…
深度解读 arXiv:2608.23564 2026-08-27
当智能体"换司机":LLM Agent 跨模型轨迹交接的代价与设计
把一段由便宜模型跑出来的 Coding Agent 轨迹"接着"让强模型写下去,并不能像想象中那样直接获得强模型收益——完整轨迹交接只能回收不到一半的强弱质量差距;方向反过来的"降级"反而划算,且最优交接接口随方向反转。 Coding Agent 现在普遍跑几十轮 tool call、改文件、写 commit,单次任务…
深度解读 arXiv:2608.24358 2026-08-27
Video-IFBench:当视频 MLLM 不听指挥,标准才算数
现有的视频多模态评测基本都在测"模型能不能看懂",却几乎没人测"模型听不听话"——VideoIFBench 把"指令遵循"作为一等指标摆到台面,用 4 类模板 × 32 种任务 × 39 种约束搭出 1.5K 样本,对 20+ 主流视频 MLLM 评测后发现:约束越多、语义越复杂、嵌套条件越深,模型越跟不住。 视频多模…
深度解读 arXiv:2608.25529 2026-08-27
不写显式 CoT 也能训练推理模型?Next-Chunk RL 的真正对手是 Mixed SFT
号称"用无 CoT 数据训练推理"的 nextchunk reasoning RL 方案,并不是真的赢在 RL 本身——论文用一个被忽视的简单基线 Mixed SFT(一阶段联合训练无 CoT + 长 CoT 数据)证明:Mixed SFT 训练算力低 60+ 倍,postRLVR 性能上限反而更高。 RL 后训练(p…
深度解读 arXiv:2608.23256 2026-08-27
FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
FIRMVideo 通过"先核查后评分"原则,将 T2V 奖励模型从不可靠的整体评分,变为可验证的维度级清单核查,在精度与效率之间找到了更稳固的平衡点。 TexttoVideo(T2V)模型的评估长期依赖两种极端路线:一是基于固定评分规则的整体裁判(如 VBench),二是端到端开放推理(如 LLMasJudge)。前…
深度解读 arXiv:2608.21839 2026-08-27