Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

FinanceComplexQA:面向工业级金融文档的智能体推理基准测试
本文发布 FinanceComplexQA:一个面向"工业级金融文档"的开放式智能体推理基准,包含 2,000 份合成的专业金融文档 + 6,000 个高质量问答对(另含 2,026 个深度研究任务),并配套 FinanceLaTeX Skill(基于 LaTeX 的专家级文档合成流程)与 AgentasaJudge …
深度解读 arXiv:2607.19238 2026-08-06
Distill Where You Fail:用自适应教师引导把 GRPO 的"零方差组"救回来
一句话结论:把 onpolicy distillation (OPD) 当"补丁"打——只在 GRPO 的零方差负组上、且只看高 student entropy 或大 teacherstudent 离散度的 token,并对这些样本额外补一轮 SFT。在数学 +3.02%、代码 +3.05% 之外,把 RL 后训练里"…
深度解读 arXiv:2608.00782 2026-08-06
AVE-Compass:首个音视频联合编辑能力全面评测基准
当前 SOTA 视频生成模型在同时编辑音频与画面时严重力不从心——AVECompass 通过 2,688 条细粒度检查项首次系统揭示了这一跨模态协同缺陷,并提出 AVEAgent 以模块化 Agent 架构显著改善指令执行与音画一致性。 以文本指令驱动视频编辑的技术近年来进展迅速,但现有 benchmark 存在两个根…
深度解读 arXiv:2607.24821 2026-08-06
主题综述 · evaluation(2026-08-01 · v2 重写版)
重写说明:v1 版定位偏移——本应作为"对 20260801 evaluation 主题的独立深度综述",实际却是协作团队内部活文档的二次消化稿。v2 全面修正:(1) 私域编号(R 序列 / 内部活文档节点 / 内部优先级术语)清除,改为领域共识术语;(2) 所有团队内部信箱路径脱敏为通用描述;(3) 综述定位回归"…
周综述 2026-08-01
Ego2Robot:用第一人称视频大规模合成机器人训练数据
一句话结论:Ego2Robot 把海量第一人称人类操作视频通过动作重定向、机械臂视觉合成与多级质量筛选,转化为 18,561 小时的机器人训练数据——覆盖 15 种机器人形态,是目前规模最大的 egotorobot 合成数据集,且在大规模预训练中验证了对分布外泛化的显著提升效果。 机器人操作策略泛化困难的根源之一是训练…
深度解读 arXiv:2608.02580 2026-08-06
WorldCycle:用可逆动作循环做自验证 RL,让视频世界模型少 drift
一句话结论:把"动作 + 反动作 = 回原点"作为天然校验信号,设计空间闭环 + 时序一致两个奖励,无需任何未来状态标注就能给长视野视频世界模型的 RL 后训练打分,把 statereturning drift 最多压掉 44%、复合动作准确率近 4×。 交互式视频世界模型(interactive video worl…
深度解读 arXiv:2608.04964 2026-08-06
BridgeVLA++:给 3D 机器人 VLA 装上一块"时空记忆"
一句话结论:在 3D point cloud + VLA(VisionLanguageAction)框架里新增统一时空记忆模块,让模型同时具备"空间场景持久化 + 时序交互历史"两点能力,同时保持 BridgeVLA 原本的数据效率与泛化,在两个 memorydependent 基准上刷 SOTA,并跨真实机器人平台与…
深度解读 arXiv:2608.05042 2026-08-06
主题综述 · multimodal(2026-08-06)
今日立题说明:年积日 218 mod 8 = 2 → multimodal。surveys/ 近 72 小时内的覆盖谱为 83 agent / 83 risk / 84 evaluation / 85 engineering / 85 rag / 86 database——multimodal 已 4 天(115h)未…
周综述 2026-08-06
K-EXAONE 2.0:韩国最大开源多语言 MoE 大模型,冲刺全球前沿
LG AI Research 通过"升级回收"(upcycling)KEXAONE 架构,将模型扩展至 750B 总参数 / 37B 激活参数的 MoE 架构,在 24 项 benchmark 上平均得分 70.1(相对前身提升超 10%),长上下文检索与安全两项尤为突出,并以 Apache 2.0 许可证完全开源。 …
深度解读 arXiv:2608.04505 2026-08-06
Teaching Nemotron Greek:把现代希腊语拉进 NVIDIA Nemotron 检索栈,并配套首个希腊语 RAG 大规模基准 HERA
把 NVIDIA Nemotron 检索栈(embedding + reranker + MoE reader)端到端适配到现代希腊语四类专业领域(法律、能源、金融、医疗),并发布首个大规模希腊语 RAG 基准 HERA;适配后 embedder 在 specialist 语料上 nDCG@10 从 0.362 飙到 …
深度解读 arXiv:2608.05138 2026-08-06
MultiPathFormer:把多径传播当作预训练对象的无线基础模型
提出 MultiPathFormer——一个把"多径传播"(multipath propagation)作为基本预训练 token 的无线基础模型,每个发射接收链路被表示成一条由连续值 path token 组成的有序序列,用 nextpath prediction 自回归训练;并引入 Environmental RA…
深度解读 arXiv:2608.05076 2026-08-06
视频选题榜 2026-08-06
· VideoDeepResearch: Towards the NextGeneration Multimodal Deepresearch Agent · 解耦 perceptionexploration pipeline + stagewise tool unlocking 强制先看视频再上网,35BA3B 64…
选题榜 2026-08-06
Switch Transformer:把 MoE 路由简化到极致,训练出首个万亿参数稀疏语言模型
Fedus、Zoph、Shazeer(Google Brain)将 MixtureofExperts 的"每 token 路由到 topk 个专家"简化成 top1(即 Switch),用更稳定的训练技巧(路由 dropout、专家容量因子、可选择性精度)让稀疏 MoE 第一次能在 bfloat16 下训练到万亿参数级…
深度解读 arXiv:2101.03961 2026-08-06
主题综述 · database(2026-08-06)
如果用一张图把 2026 年 8 月这一周的 database 主线画出来,它不是一张分类树,而是三条相互正交的演化轴。第一条轴是部署形态:从 pgvector 与 pgvectorscale(Timescale 202604 公布的 50M 471 QPS @ p95 28× vs Pinecone,参见 organ…
周综述 2026-08-06
BERTopic:用预训练 Transformer + 类 TF-IDF 重新定义主题建模
BERTopic 把主题建模拆成"三段流水线"——预训练 Transformer 文档嵌入 → 密度聚类 → 类级 TFIDF 抽取主题词——用极其轻量的工程结构把 LDA 之后十余年停滞的主题建模重新拉回到 SOTA 区间,并成为首个工业级广泛落地的主题建模开源工具。 主题建模长期面临两难: Embedding + …
深度解读 arXiv:2203.05794 2026-08-06
FinIndices:用长周期财报实测 LLM 的"真结构推理"还是"表层模式匹配"
用一套最大 32K token、未裁剪的真实财报构建的自动化 benchmark FinIndices,系统性地打脸了"LLM 懂金融"这个直觉——结论是:在去掉公式提示后,Gemini3.1Pro 在表格任务上的准确率从 70.70% 掉到 38.22%,证明现有 SOTA 模型更多是"背下了公式模板",而不是真正具…
深度解读 arXiv:2607.28661 2026-08-06
STAMP / STAMPlus:让"对话 + 分割" 同时在 MLLM 里跑得快、跑得准、还兼顾多目标
论文直面了 MLLM(多模态大模型)做分割的"三难困境"(高分割性能 + 保留对话能力 + 快速推理),提出 AllMask Prediction 把自回归对话与非自回归 mask 预测解耦,首个二值实例 STAMP 在一次前向中对所有 token 做前景/背景分类;进一步升级到 Structured AllMask …
深度解读 arXiv:2608.02791 2026-08-06
PosterMELD:面向可控设计多样化的多 Agent 论文转海报生成,输出可编辑的可印刷成品
PosterMELD 用"模板条件化 + 容量感知槽位 + 确定性门控/VLM 审核"把论文转海报做成一条可失败路由的多 Agent 流水线,在 621 篇论文评测中 PrintReady Rate(PRR)达到 81.3%,约为 P2P 的 3.4 倍、PosterGen 的 5.2 倍,并把单次请求的"原生可编辑性…
深度解读 arXiv:2608.02218 2026-08-06
多任务多帧视觉钢琴转写:V2N(Video to Notes)
V2N 是首个"完整"的视觉钢琴转写(Visual Piano Transcription, VPT)系统:用共享时序 backbone 同时接 onset / offset / key hold / velocity 四个任务头,并以逐帧监督(perframe)取代"仅窗口中心监督",在 PianoVAM 与 R3 …
深度解读 arXiv:2608.03419 2026-08-06
ContinualSkillBench:LLM Agent 的"技能库"是真进化,还是只在临场上下文里打补丁?
ContinualSkillBench 是一个专门测"agent 能不能跨任务把经验沉淀为可复用 skill"的动态评测框架——它在 5 个领域各设 100 个难度递增的子任务,并对比"显式维护 skill 库"和"纯上下文学习",结论是:incontext 持续学习与显式 skill 维护在平均水平上效果相当,意味着…
深度解读 arXiv:2608.03874 2026-08-06
LegalPincite:多级法律信息检索数据集,把"段落级 pincite"从装饰品做成可评估的硬指标
LegalPincite 把欧盟法院 (CJEU) 判决书里的"段落级精确引用 (pincite)"做成一个去泄露、可人工校验、支持 casetocase / paragraphtocase / paragraphtoparagraph 三种检索粒度的大规模法律 IR 数据集,把现有公开法律 IR benchmark …
深度解读 arXiv:2608.03756 2026-08-06
RestoreKV:用可学习恢复补全 query-agnostic 的 KV cache 压缩
RestoreKV 提出一种「在同一 KV 预算内,先选择再恢复」的两阶段范式:在 queryagnostic eviction 之后,让少量 restore tokens 在一次 LoRApass 中去 attend 完整的 evicted KV cache,生成一段紧凑的、由上下文条件化的 restore cach…
深度解读 arXiv:2608.01247 2026-08-06
ARCHead:用激活度量残差校正把 LM-head 压到 BF16 的 25%
ARCHead 提出一种针对 LLM 最后一层 LMhead 的打包式压缩方案,把原本「H × V 大矩阵、BF16 持久保留」的一块存储替换成 量化低秩核 + 组内 INT4 残差 + 基于激活度量拟合的低秩校正;在 Qwen38BBase 上只用 25.6% BF16 头存储就达到了 1.007 相对 perple…
深度解读 arXiv:2608.02703 2026-08-06
学会适时停止:面向减少过度思考的片段级信用分配(DASH)
提出 DASH(DriftAware advantage SHaping):在 GRPO 训练中按"推理片段是靠近还是远离正确答案"分配优势,把奖励塑形从 token/序列粒度下沉到 段(segment)粒度,让模型同时学会"答对"和"及时停"。 推理类 LLM 的"过度思考"(overthinking)不是单纯的长度…
深度解读 arXiv:2607.00482 2026-08-06
当多个答案都有效时,投票失效:CALVER —— Best-of-K 因果推理的符号验证器
提出 CALVER(Causal AxiomLevel VERification):一种 无需训练 的符号验证器,把每条 LLM 推理轨迹按 Pearl 因果准则(d分离、后门调整、do算子干预)逐条打分,在没有参考答案的前提下选出因果最合法的候选——在 CLEAR 等 findonevalid 查询上把 Bestof…
深度解读 arXiv:2608.03506 2026-08-06
ReflectRL:从 Golden Negative Trajectories 中学习的反思—直推双阶段推理训练
提出 ReflectRL:在 onpolicy RL 训练中,把专家模型 做错 的"金负样本轨迹"(Golden Negative Trajectories, GNT)当成 反思对象 而非 模仿对象,先让模型在 GNT 上做反思式推理(Reflective Reasoning),再通过 ReflectivetoDire…
深度解读 arXiv:2608.03972 2026-08-06
ChronoLens:跨时间、语言与语言学层面的历史语言变化测量
ChronoLens 提出一个把"历史语言变化"放进同一分析空间的评测框架:用冻结的多语 LLM + featurealigned crosscoders + posthoc linguistic interventions 提取稀疏的、语言学可解读的特征表示,在 44.98 M 文档 / ~17.2 B token、…
深度解读 arXiv:2608.03507 2026-08-06
当注意力"失明":ALiBi 位置编码中的数值失效
论文揭示了 ALiBi(Attention with Linear Biases)位置编码一个此前被忽视的失效模式:其线性偏置缩放在浮点精度下发生下溢,导致大量注意力权重被置零,使受影响的头"部分失明";在 148M 参数 decoder 的对照预训练中,这种失效会显著损害 token 检索能力,但对标准 decode…
深度解读 arXiv:2608.03994 2026-08-06
机器人抓东西"开了 10 步盲区就卡死"?——arXiv 2607.01804 给 VLA 加了一个"事件驱动的自适应动作时域"保险丝
你有没有见过这种画面 🤖: 让家用机器人开抽屉——它规划了一串动作,前 10 步一口气执行完,结果第 7 步撞到抽屉边缘卡住了。它根本没意识到卡住,因为它的"大脑"(VLA 模型)只在第 1 步看了现场,后面 9 步全凭"预想"在执行。 这在机器人圈叫 "predictthenblindlyexecute" 范式——预…
科普版 arXiv:2607.01804 2026-08-06
训练一半想换学习率、暂停、注入 checkpoint?——arXiv 2607.18314 把训练现场升级成"可被人和 AI 同时接管"的可审计控制面
你有没有遇到过这种尴尬 🛠️: 跑一个 7 天的 RLHF 微调,跑到第 3 天 loss 突然发散——你发现是学习率定高了。想立刻降一档再继续,却发现只能 Ctrl+C 杀进程 → 改 config → 重启 → loss 从断点续不上。三天的 GPU 时长就这么打水漂。 或者你做了一个 AutoML agent,想…
科普版 arXiv:2607.18314 2026-08-06