解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Emergence World:长程多智能体系统的对抗性压力测试
1. 谁写、给谁看:作者 Aditya Vempaty 等;读者是 AI Safety / Agent 工程研究者,以及任何把多 agent 部署到"长期持久运行"场景的团队。 2. 它的真问题是什么:现有 agent 安全评估是"单回合、单模型、单任务",但真实部署里 failure 会通过记忆、工具、其他 agen…
StepAudio 3 Music:把「显式乐谱规划」拉进长篇音乐生成的 DiT 系统
1. 这是什么:一篇 arXiv Technical Report,介绍 StepAudio 3 Music —— 一个大规模长篇音乐生成模型,核心卖点是「ABC 乐谱作 ChainofThought + 离散连续混合架构」。 2. 谁写的:StepFun 团队(程力 Feng、伍志悦 Wu、宋佳豪 Song、戴哲琦 …
ESRL:MoE 强化学习中基于专家路由空间的探索
ESRL(ExpertSpace Exploration Reinforcement Learning)将 MoE 模型中的专家路由选择视为显式探索空间,通过锚定高置信度专家 + 受限随机路由 + 熵自适应扰动强度,在不增加额外采样开销的前提下显著提升 MoE RL 训练效果:在 Qwen330BA3B 上,ESRL …
当 EOS Token 不一致时:理解 On-Policy 蒸馏中的长度膨胀
| 维度 | 自问 | 本文答复 | |||| | 真实问题 | 这篇论文到底解决什么「之前没人解决」的事? | OPD 中 student 输出越来越长甚至耗尽 generation budget 的「长度膨胀」根因 | | 既有失败模式 | 之前业内默认的解法为何不行? | 默认做法只看「停止集合是否一致」,掩盖了…
不要遮蔽环境:观测监督如何改变 RL 下 Agent 的探索
| 维度 | 自问 | 本文答复 | |||| | 真实问题 | 这篇论文到底解决什么「之前没人解决」的事? | 标准 agent SFT 只对 action token 计算 loss,导致策略在后续 RL 中探索能力被锁死 | | 既有失败模式 | 之前业内默认的解法为何不行? | 默认遮蔽 observation…
FAMOS:从稀疏观测出发的 3D 关节物体前馈建模
| 维度 | 自问 | 本文答复 | |||| | 真实问题 | 这篇论文到底解决什么「之前没人解决」的事? | 从稀疏、无序、部分观测的点云集合,联合推断关节物体的可动部件分割与关节参数,且支持变数量输入 | | 既有失败模式 | 之前业内默认的解法为何不行? | 主流前馈方法只吃单次观测,重度依赖类别级形状先验;多…
样本数量远远不够:候选生成策略决定 LLM 测试时扩展的能耗与性能
Q1 这篇真正在解什么问题? 当大家讨论"测试时扩展(testtime scaling, TTS)"时,论文档几乎都只报候选数 N(生成多少个候选),没人讲这 N 个候选是怎么生成的——一次性 batched,还是拆成多次小 batch?这背后的能耗 / 延迟差距可以差到 5 倍。 Q2 它给出的核心解法是什么? 固定…
面向 LLM 助手的可验证社会推理(Fuse 框架)
Q1 这篇真正在解什么问题? LLM 助手被广泛用于日常社交建议("我同事这句话到底什么意思"),但怎么「评测」它们的社会推理能力本身就是难题:情境来自用户的主观叙述,答案(他人意图)又没有客观真值。 Q2 它给出的核心解法是什么? Fuse 框架:让一个"目标智能体"带隐藏动机与其他智能体交互,其中一个智能体代表用户…
自我演化的搜索索引(SELF-INDEX 框架)
Q1 这篇真正在解什么问题? 信息检索的质量取决于"索引键(index keys)能不能把文档里的知识暴露出来",但最优索引形态因检索环境(语料 / retriever / 任务)而异,没有"一刀切"的优化策略,而人工调索引又贵又慢。 Q2 它给出的核心解法是什么? SELFINDEX:一个让索引自动演化的框架。Opt…
MiniMax-H3 能否对物理世界进行推理?一种全模态生成模型的评估
元层五问(自检栏) Q1(真问题):全模态生成模型(OmniModel)能否通过「多模态对齐」提升物理世界推理能力? Q2(机制核心):评测不靠「文本 prompt 完全描述视频」,而是让每个模态只给出部分证据,逼迫模型做跨模态联合推理。 Q3(评测锚点):517 个 instance,4 个推理维度,41.97% 总…
VākQA:泰卢固语口语事实型问答基准与评估研究
元层五问(自检栏) Q1(真问题):低资源语言的「口语问答(SQA)」基准为什么长期空白,自动评估在该场景下到底可不可信? Q2(机制核心):用 2,001 QA 对 + 2.53 小时语音 + 双语转写 + 人工核验参考答案构建 Telugu SQA benchmark,并先做「评估方法学 vs 人类判断」对齐验证,…
Srijika: 面向九种婆罗米文字的 OpenType 布局复用字体再设计
元层五问(自检栏) Q1(真问题):从零生成出来的「印度文字体」为什么装上去还是错位的? Q2(机制核心):与其生成 glyph,不如复刻成型引擎(shaper)的整套 closure? Q3(评测锚点):怎么证明「复刻 closure」比「逐 glyph 生成」更稳? Q4(撞名风险):本文 Srijika 与 Li…
StepAudio 3 Realtime:用「边说边想」化解推理与延迟矛盾的实时语音模型
1. 这是什么:arXiv Technical Report,介绍 StepAudio 3 Realtime —— 一个 audiolanguage 全双工对话模型,主打「ThinkWhileSpeaking」让推理与口语输出并行。 2. 谁写的:StepFun 团队,80+ 位作者的巨型 author list(Bi…
RetireOPD:自退休式 On-Policy 蒸馏,用于 Agentic RL 训练
RetireOPD 通过「自退休机制」让 RL 训练出的 Agent 在蒸馏教师模型时自己决定何时抛弃老师,比固定蒸馏 schedule 在 ALFWorld 和 WebShop 上分别高出 14~19 个百分点。 Multiturn Agent(比如在 ALFWorld 做家务任务或在 WebShop 购物的 Age…
PACT:企业 AI 助手在压力下能被信任吗?
PACT 基准测试揭示了一个严峻现实:即使是最强的企业 AI 助手,在用户施压时违规率平均增加 65%;在无压力情况下,头部模型仍有 6~10% 的规则误判率——企业 AI 的合规性远比想象中脆弱。 企业正在将 LLM Agent 部署到招聘、医疗、金融等强监管场景。在这些场景中,Agent 的系统提示(system …
DeepSeek-V4.1-Flash:突破 KV Cache 压缩极限的长上下文 MoE 模型
DeepSeekV4.1Flash 是一个 552B 参数的稀疏激活 MoE 多模态模型,通过 Causal EncoderDecoder(CED)架构让 prefill 阶段只激活 8B 参数,结合 CSA2 跨层 KV Cache 重用和 FP4 量化,将全局 KV Cache 占用压到 890 bytes/tok…
On-Policy Self-Distillation 中"特权信息"到底加了什么?
本文用 5,319 道数学题 × 6 种推理视角构建的 AMPLEMath 套件,把 OPSD(onpolicy selfdistillation)里"教师看到解题过程/答案"这一特权信息的贡献剥离出来,结论是:对 Qwen31.7B 而言绝大部分收益来自 referencefree 蒸馏本身,参考信号的额外增益很有限…
WeVisDoc:从覆盖到能力,构建稳健的端到端文档解析
WeVisDoc 提出一个两阶段、以数据为中心的端到端文档解析框架:第一阶段通过异构数据与"结构保留降质合成"扩语义/结构/外观覆盖,第二阶段用 holdout 探针定量诊断残留错误并据此定点补样本与重新分配 token 预算;在 OmniDocBench v1.6 与 PureDocBench 三个赛道上以 4B 模…
EvoSkill-GUI:面向 GUI Agent 的免训练技能演化框架
1. 这篇论文真正要回答的核心问题是什么? GUI Agent 在长时任务里被动态界面(弹窗、延迟加载、控件位移)反复打破执行计划,既有 skill 框架把 skill 当作部署前一次写死的静态资产,而不是会随执行反馈自我修订的活程序知识。 2. 为什么这是真问题而不是人造问题? Web/手机/桌面 GUI 的真实使用…
UFO:多模态图像生成的"全条件对齐"评估新范式
1. 这篇论文真正要回答的核心问题是什么? 多模态图像生成(尤其 subjectdriven customization)的现有评估方法,无论 embeddingbased 还是 MLLMbased,都是逐个 modal condition 孤立评估,与"多模态同时对齐"的目标根本矛盾,导致与人类判断一致性差。UFO …
When2Think:让 LRM 在简单题上"想少一点"的难度感知长度控制
1. 这篇论文真正要回答的核心问题是什么? Large Reasoning Models(LRMs,典型如 o1 / DeepSeekR1 / QwQ)在数学/代码等任务上系统性 overthink(简单题写一大堆推理)和 underthink(难题草草收场),平均算力被低效分配。怎么让模型学会"这道题不用想那么久"?…
MInTRL:Off-policy 干预可增强 On-policy 强化学习
MInTRL(Minimal Intervention Reinforcement Learning)通过在 onpolicy rollout 轨迹中稀疏插入局部修正(由 judgeintervention policy 执行),在不破坏 onpolicy 分布特性的前提下扩展探索边界,在数学和代码任务上同时超越标准 …
Dynin-Robotics:全模态统一扩散视觉-语言-动作模型
1. 机制层:为什么用"共享轨迹模型"作为动作、下一观测、终端目标、轨迹指令重建的统一接口?⚠️ 论文核心假设是"这些任务的隐空间同构",但没给出形式化证明。 2. 工程层:为什么用掩码扩散(masked diffusion)而不是自回归或连续扩散作为统一 backbone?⚠️ 因为 DyninOmni 是 omni…
ImpossibleRubrics:把"生成式评分标准"放进最严苛对抗场景压力测试
1. 这是什么:arXiv benchmark 论文(cs.LG / cs.CL),提出 ImpossibleRubrics —— 一个 169 个"不可能任务" + 48 个对照可答任务的基准,专门用来压力测试「语言模型生成的评分标准(rubrics)」能否区分诚实回答与对抗性回答。 2. 谁写的:Bowen Qin…
GPT-Policy:让通用 VLM Agent 在不更新参数的前提下学会机器人操作
1. 本稿立基础是什么? 立基础是「contexttoaction」接口:把通用 VLM 当成决策器,把接触/运动控制交给约束执行器。论文核心贡献是这一接口 + 五类上下文来源的实证。 2. 谁最该读? 做具身 Agent 框架、做 VLA 评测基准、做 incontext robot learning 的研究者;以及…
手指当腿:用仿人手同时学会自支撑行走与操作
让一只 5 指仿人机械手用同一组手指同时承担"行走(locomotion)"和"操作(manipulation)"——靠 RL 在硬件标定过的仿真器中训练不等长手指的策略,最终在真机上实现无外部动力、无外部视觉依赖的爬行、转向、跌倒恢复与推物到目标点,是一台真正意义上的"compact mobile manipulat…
CERA-MoA:让路由器与 Agent 在迭代强化学习中一起长出来
MoA 范式在 2024–2026 间被反复验证:用一组异构 LLM Agent 协作,对单 Agent 难以胜任的复杂任务能拿到稳定增益。但工业落地时普遍遇到两个耦合痛点: 1. 路由策略与 Agent 能力不同步。Router 训练时假设的 Agent 能力分布很快被 posttraining 改写——某 Agen…
Edge0:用训练过的「预路由器」把 35B MoE 从 SSD 跑成日常工具
过去两年的 LLM 推理优化主战场是 KV 缓存、注意力分块、speculative decoding。但对 MoE 模型来说,存在一个被低估的第二面墙——权重墙: 35B MoE 在 4bit 下 ~19.5 GB; 稀疏性减少了每个 token 的计算量,但没有减少必须保留在内存里的字节数; 这意味着哪怕激活 2 …
PANORAMA:用「短语调度的掩码提议池」让 VLM 同时会讲、会圈、会分
VLM 在 2024–2026 的进展集中在「讲得更好」与「看得更细」两条线,但两者长期割裂: Grounded segmentation:给一段指代词,输出 mask,质量优秀但只覆盖前景物体,背景区域(sky / road / wall)完全被忽略。 这种割裂让下游 embodied agent 拿到的视觉信号不一…
长上下文 MoE 训练中每个内存峰值的平整化
把长上下文 / 大批量 MoE 训练里四个互相不重合、各自独立增长的显存峰值(专家分派、词表投影、梯度检查点边界、优化器状态)逐一平整化,使 120B–667B MoE 模型在 1M token 上下文上跑得动、且不丢任何梯度精度。 长上下文 LLM 训练现在主要被「显存峰值」卡死,而不是平均占用。原因是同一时间窗口里…