解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Learning to Discover Interesting Mathematics(学习发现有趣的数学)
1. 它真正解决的问题:当 LLM 已经能在 Olympiad / Lean 形式化证明上批量产出「新定理」时,数学共同体对「这个新定理值不值得继续推下去」缺乏可量化的信号;论文把「有趣度」从审美判断变成一个可计算、可验证的标量。 2. 它用什么范式解:定义内在有趣度 = proof_length / statemen…
直接问 Jev:RLCD 校准决策作为 AI 对齐失败零样本检测器
Q1 这篇真正解决的是什么 alignment 痛点? 当下对齐评测要么靠 LLMasjudge 每条标准解码一次,要么靠 token 概率分类器一次给一个固定标签;这两类都很贵且 tokenlevel 粒度不够细。 Q2 它比 Llama Guard / 生成式 judge 改在哪? Jev 来自 RLCD 训练范式…
DeltaWAM:面向双手操作的 Delta 世界动作模型
Q1 论文真正解决的是哪个 robotics 痛点? 把预训练视频生成器当作世界模型塞给机器人做双手操作控制时,"未来帧冗余"与"重视频专家推理过慢"两个具体工程痛点。 Q2 它比上一代 WAM/FastWAM 改在哪? 不再预测稠密未来帧,而预测"视觉 delta";并用 Streaming Delta Memory…
用于广义任务与运动规划问题的编程智能体
Q1 这篇真正解决的是什么 TAMP 痛点? 任务与运动规划(TAMP)即使在完全可观测、objectcentric 状态下也难,因为离散决策与几何/运动学/动力学耦合;广义 TAMP 想跨实例复用,但需要大量 TAMPspecific engineering。 Q2 它比手工 planner / 一次生成 / LLM…
Neural Spectral Capacity:从架构规格就能算的「网络容量标尺」
⚠️ 读本节时建议先看 §六 边界声明:本文以 arxiv v1 abstract 与 paper card 为依据。 1. 谁在意这个问题:做 NAS、设计 Transformer family、做训练无关剪枝(trainingfree pruning)、做模型压缩选型的工程团队。 2. 现有方案差在哪:用 #Par…
OmniEcho:让具身智能体「用耳朵看世界」的统一基准 + 模型
⚠️ 本解读基于 arxiv v2 abstract(20260923,30.8 MB,HTML 版可读)+ paper card TLDR;HTML 全文细节本文未独立逐图复述。 1. 谁在意这个问题:做 embodied AI、audiovisual navigation、机器人/AR 音频感知、做多模态融合的团队…
ViRDM:让视频扩散模型「丢开老师」也能 few-step 生成
⚠️ 本解读基于 arxiv v1 abstract(20260924,43.8 MB)+ paper card TLDR;本文未独立精读 PDF 全实验节。 1. 谁在意这个问题:做 fewstep / realtime 视频扩散、AR/Streaming 生成、video LDM 蒸馏的研究与工程团队。 2. 现有…
Rufus-Air:一份完全开源可复现的 LLM 后训练配方(八阶段串行管线)
| # | 元层问题 | 本稿回答 | |||| | Q1 | 这篇论文要解决的真问题是什么? | 开源 LLM 后训练的「工程黑箱」:业内大多只发权重,不发数据配方、reward 设计、阶段顺序与基础设施 | | Q2 | 它给出的最核心方法机制是什么? | 在 GLM4.5AirBase(106BA12B)上跑一条…
PUBG Ally:作为「AI 队友」的对话式具身 Agent
| # | 元层问题 | 本稿回答 | |||| | Q1 | 这篇论文要解决的真问题是什么? | 在 强延迟约束 + 不断变化的游戏世界 中,让 LLM agent 既能像队友一样说话、又能像玩家一样行动——把「agentic tool use」与「实时控制」两层叠加 | | Q2 | 它给出的最核心方法机制是什么?…
IterSynth:角色解耦的迭代式深度搜索 Agent
IterSynth 通过将搜索 Agent 的「规划者」与「综合者」角色解耦,并用 summary 作为持久状态,解决了传统 ReAct 式 Agent 的能力耦合与上下文噪声两大顽疾,8B 模型在 5 个长程深度搜索基准上平均得分 50.7,较同规模最强 baseline 提升 +4.2%。 深度搜索任务(如 Bro…
AgentKernel:面向 AI Agent 的信任原生操作系统
AgentKernel 首次提出将传统 OS 的安全原则下推到语义平面,围绕 Identity、Perception、Cognition、Execution 四个支柱构建 Agent 的信任原生操作系统 substrate,为 Agent 的安全治理提供 mandatory、nonbypassable 的底层基础设施。…
World Action Agent:用 VLM 操控机器人的世界-动作排练框架
World Action Agent(WAA)提出让 VLM 在一个视觉动作工作空间中直接「排练修正执行」机器人操作,通过 Contact Views、Action Rehearsal 和 InView Correction 三项机制,在 LIBEROPro 上以 75.6% 平均成功率刷新 SOTA,并将 9B 模型…
MemoryAthena:Adaptive Routing over Latent and Generated Memories
authored_by:Jay · R2 0925 中午档自撰 explainer · 首篇自撰 explainer(沿用 dailyplan §4 范式) date:20260925 触发:cron fff1e54857b54da1a4e709b7de706448 · 视频矩阵 · Jay 选题雷达 R2 · 每天1…
能力出众却简洁高效:从前沿模型中提取并刻画隐藏的思维链
1. 真问题:前沿闭源模型的"原生 CoT"被隐藏,能否不破解模型就重建一份与原生 CoT 行为等价的推理轨迹? 2. 新颖处:方法是方法学——API 标准功能(自定义 tool + toolchoice 控制)就能诱导模型把推理倾倒到工具参数里。 3. 实验验证什么:(a) 开源模型上提取 CoT ≈ 原生 CoT;…
自组织 Agent 团队学习协同推理
提出 SelfOrganizing Agent Teams(SAT)——一组固定成员的多智能体从过往协作中学习可复用的"团队策略"(角色、对话阶段、参与度、信息流),在不做显式任务分解、不依赖路由器的情况下,让团队在数学与物理基准上达到 66.7% 平均准确率,比最强单成员(48.8%)、与该成员算力对齐的单体推理(5…
线性表示假说需要一个群作用
本文主张"线性表示假说(Linear Representation Hypothesis, LRH)"并不是一个假说,而是一族以表示等价性区分的假说;为了在跨模型之间讨论表示,必须显式声明"何时两个表示应被视为等价"。论文用群作用(group action)作为形式化工具,把"被研究的表示对象 / 生成它的过程 / 最…
面向持续文档撰写的知识 Pull Request
提出 Knowledge Pull Requests(KPR)——一种让"持续修订文档"变得可解释的框架。它把每一次修订拆成两层:一层是知识变化(新提取的 claim、过滤、路由、冲突检测),另一层是文本变化(最终的文档 diff),并产出 ChangeLog 让审稿人能看到"为什么改"。在跨语言维基百科修订与查询驱动…
把校准列为 LLM 评估的一等标准
NLP 评估长期把「模型的置信度是否有意义」当作可选项,论文主张把校准当作每一项 benchmark 与每一个模型发布的硬性必报项,并指出 LLMasajudge、合成数据生成、active learning 三类研究流水线已经悄悄踩进「未校准就使用」的坑里。 LLM 评估的工业实践里存在两段割裂: 1. 校准是一个研…
Six Layers Less:面向 Whisper 的无标签恢复编码器剪枝
Whisper 的解码器剪枝(whisperlargev3turbo 把 32 层减到 4 层,DistillWhisper 减到 2 层)已经成熟,但编码器侧长期缺乏可广泛落地的方案。论文给出「按 leaveonelayerout 的 WER 变化排名 → 砍掉最不重要的 6 层 → 用无标签单语语音数据做无监督蒸馏…
FLEET:从 logits 熵到文本生成中的增强轨迹
传统温度采样是无记忆的——每条新样本都不知道前几条采过什么,结果是随着采样数增多,语义重复答案的比例不断上升,准确率收益递减。FLEET 把「记忆机制」嵌进生成过程:把每次生成表示为穿过「熵超过阈值的状态」的稀疏轨迹,再用这些轨迹推断每个 token 的 utility 分数去调整 logits——同预算下与 repe…
GeoPair:面向免训练 Transformer 压缩的几何保持跨层分解
1. 元命题:Transformer 跨层冗余不应被启发式处理,必须用"几何保持"作为优化目标来识别真正结构兼容的层对。 2. 元对象:现有免训练压缩管线要么逐层孤立优化,要么用粗粒度的"相邻层同基"分组,忽略每层的激活几何差异。 3. 元约束:在零训练预算下,同时优化"跨层配对"与"共享字典分解",并保持每层的标定几…
X-Planner:面向具身智能的事件结构化任务规划前端
1. 元命题:在长视野具身操控中,"任务规划"应该被当作一等公民显式建模,而不是塞给 VLA 主干当隐性副产品。 2. 元对象:现有 VLA/CoT 规划器要么用粗粒度任务级标注(监督弱),要么把整条推理按 token 序列化(表示贵)。 3. 元约束:监督和表示必须同时升级——既要"事件级、可解释、能反映错误识别"的…
Uranus:面向具身 AI 的下一代数据驱动机器人仿真基础设施
1. 元命题:机器人仿真不应再走"手工建模资产 + 物理引擎"路线,而应走"联合轨迹条件自回归扩散"路线,把仿真器当成一个可数据驱动的生成模型。 2. 元对象:传统仿真器(Isaac Sim / MuJoCo / SAPIEN)资产构建昂贵、扩展困难、跨本体不通用。 3. 元约束:仿真器必须满足三项硬指标——流式开放式…
AI 导师效果比肩人类专家,成本低 918 倍:StudentBench 全解
Handshake AI Research 团队推出 StudentBench 评估套件,通过对 2,383 名真实参与者的 GRE 学习效果实验,证明了 AI 导师(LLM)在学习增益上与专家人类导师统计等价(p=.015),而成本仅为人类的 1/918(每提升 1% 得分:AI $0.0052 vs 人类 $4.8…
PackLab:面向机器人装箱的 MLLM 闭环框架(开发·训练·评测一体化)
Q1 这篇到底在解决什么真问题? 机器人 bin packing(把不规则物体装进箱子)不是"挑一个位置塞进去"的一次性任务,而是长时序、闭环、序贯决策问题——每放一件都改变剩余空间分布,后续每一步的可行解集合都被前序选择重写。已有两条路:几何启发式(基于"最低重心/最大接触面积/极值点"等 handcrafted 规…
Spatial-Interactor:通过物理世界交互学习空间推理
SpatialInteractor 通过将交互轨迹(Observation → Action → Observation)作为直接监督信号,让 VLM 从"观察变化"中学习物理世界状态转移,弥补了现有 VLM 在动态环境中的空间推理短板。 VLM 在静态图像理解上进步很大,但一到动态、三维、时序相关的物理世界任务就露怯…
On the Diffusibility of High-Dimensional Latents:用 x₀-prediction 拯救"高维潜空间难扩散"的反直觉发现
Q1 这篇到底在解决什么真问题? Representation Autoencoders(RAE)让扩散模型工作在预训练视觉编码器的特征空间里,而不是像素空间——这能极大加速生成(SDXL/Flux 一类 latent diffusion 都是这套路)。但许多现成 encoder 重建质量差(为下游任务优化的,丢掉细节…
RecCAR:多模态联合视频扩散中的"反向互注意力鸿沟"——用 KL 正则化让伴生模态真正约束视频
Q1 这篇到底在解决什么真问题? 联合多模态视频生成(video+3D body motion / video+audio)用共享 diffusion transformer 同时去噪多个模态流,理论上伴生模态(3D 骨架、音频)可以反向约束视频生成,使姿态对得上嘴型、身体动作连贯。但实际存在不对称性:伴生模态能很好地…
EmbodiedSWE:用 Coding Agent 破解长程灵巧机器人任务
Frontier coding agent 可以自主写程序解决需要半小时的长程灵巧操作任务,且其验证通过的解法还能作为数据引擎,批量生成多样化演示来训练可泛化的通用机器人 VLA 策略。 通用机器人最大的瓶颈不是"感知不够好",而是无法低成本、大规模地获得长程任务的演示数据。 Teleoperation(遥操作)慢且贵…
物理先验嵌入机器人学习:一篇把"数据驱动 ↔ 物理建模"打成统一分类法的综述
RQ1 这篇在解决什么真问题? 机器人学习领域近年论文增长极快,"把物理先验塞进学习系统"的叫法五花八门——physicsinformed / physicsguided / physicsencoded 等术语各异。术语不统一导致三件事做不动——跨论文横向比较、做新端到端学习系统时找不到现成基线、对"物理真法是否真优…