解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
GameHorizon Suite:面向多时域的游戏数据与评测套件
GameHorizon 是一个面向多时域(multihorizon)的开源游戏评测套件:先用可扩展的自动标注管线把 21 款 AAA 游戏、5,000 小时专家玩家录屏变成带语言指令的对齐数据,再用"离线标准化题目 + 步骤级在线回放"两轨评测 47 个模型,最终把"游戏里 AI 到底会什么"这件事变成可复现、可分级的…
IER-OPD:1% token 就够的 on-policy 蒸馏里,到底哪些 token 该被监督
一句话结论:IEROPD 把稀疏 onpolicy 蒸馏里的「该给哪些 token 教师监督」这件事,重新建模为「在固定 prefix 下教师梯度估计的信号噪声比问题」,提出 InformationEfficiency Ratio (IER) 作为打分函数;在数学与医学推理任务上,IER 与已有 usefulness …
Harness-Zero:把「harness 增益」蒸馏进权重,部署时摆脱专用 harness
一句话结论:HarnessZero 提出 agentasharness 思路——用一个「harnessing agent」在 target harness 的 action space 内、参考 optimized harness 给出引导并修正 student 响应,把 optimized harness 行为直接转…
CARE:让 VLA 真正会从失败里爬起来
一句话结论:CARE 用「失败经验驱动」的合成管线(不再靠手工或随机扰动制造故障),把 VLA 在偏离轨道时拉回正轨;论文同时给出了 FSRBench 这个针对中间故障状态的恢复基准,并报告了跨多 VLA 主干、模拟与真机双臂任务上仿真平均 +14.5、真机 +15.9 任务成功率点的提升。 VLA 在 robotic…
Grounded Action Model:把"物体在哪里"先解决,再让机器人动手
把"3D 物体在哪里"这件事从 VLA/WAM 的隐式学习中抽出来做成显式接地,再叠加到动作预测上:在 RoboTwin 2.0 50 任务平均 55.3% / 场景随机化 47.6%(vs AbotM0 30.4%)/ LIBEROPRO 61%(vs π0.5 53%)/ 真实机器人视觉偏移 17/20(vs π0…
OmniEdu:把教育大模型从"做题机"拆成四种能力后再拼回去
把教育大模型从"按数据源或任务类型分桶训练"切到"按能力维度(学科 / 课程 / 诊断 / 教学)分桶训练",27B 模型在 K12Bench 63.12% EM / MathTutorBench Scaffold 78.74% / LongTutor Teaching 3.02(同档最高),三条独立教育 benchm…
用变异分析测 GPU 内核基准的"裁判":当 LLM 写 CUDA 时,谁来判定它对不对
把软件测试里的 mutation adequacy 思想搬到 GPU 内核基准上,给"LLM 写出来的 CUDA kernel 对不对"这件事一个可量化的裁判质量分——官方 KernelBench 的 oracle 在 188 题上漏掉 16.9% 的"故意 bug",且漏检高度偏科(精度类 78.6% 漏检、算术类仅…
Designer-RSI:从用户流量演化过程式记忆用于智能体平面设计
1. 这篇要回答的真问题是什么? 专业平面设计是「长时程(longhorizon)」智能体任务:成品由数十步动作生成,且没有可靠程序化奖励(oracle)。给定没有真实标签、没有权重更新、没有程序化评估,怎样让一个冻结的前沿模型通过「过程式记忆」持续变强? 2. 它提出了什么解法? DesignerRSI:冻结 fro…
Gricea:面向对话式 AI 研究的开放科学平台
1. 这篇要回答的真问题是什么? 当下的对话式 AI(CAI)研究里,每篇论文对「研究流程」「参与者系统」「任务对话行为」的报告是碎片化的,别人的研究几乎不可复现、不可扩展、不可积累。Gricea 想让 CAI 研究「像开源代码一样可共享」。 2. 它提出了什么解法? 把 CAI 研究本身建模成可执行、可部署、可检视的…
GAVEL:用图世界模型验证并加速长视野 LLM 任务规划
GAVEL 把"长视野 LLM 规划"拆成"显式图世界模型 + LLM 重规划"两层流水线,借助符号推理自动修复大多数前置条件违例,让 8B 规模的 Qwen3 也能在 BEHAVIOR1K 上把单任务成功率从 41.2% 提到 91.8%、多任务成功率从 19.9% 提到 92.6%。 LLM 作为机器人规划器时有三…
PARTS:在真实机器人上对长视野操作做"最小人工介入"的子任务强化学习
PARTS 提出"在瓶颈子任务上做 RL、其余步骤由 frozen pretrained policy 提供 nominal action"的 realworld 训练框架,让双臂 YAM 任务完整成功率从 32% 升到 61%、单臂 Franka 任务从 50% 升到 95%,每个任务平均只用"几十分钟"真实环境 R…
BI-Agent 与 BI-Bench:端到端商业智能自动化的工具增强 + 域内后训练范式
论文把"商业智能(BI)端到端问答"做成 BIAgent + BIBench 双件套:通过工具增强把 BI 拆为 search / join / transform 等原子子任务,再用真实 BI 项目轨迹做 SFT 与 RL 后训练,最终让 vanilla LLM 在 BIBench 上的精度提升高达 40 个百分点,…
SiliconBench:统一内存桌面上 LLM 服务的速度、内存与保真度
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题? | 本地 LLM 服务栈评测只拼速度——结果忽略"统一内存桌面"上极关键的内存余量与输出保真度(fidelity),导致选型时跑得快但要 OOM、或者结果悄悄偏离参考实现 | | Q2 | 核心方法机制为何有效且可区分? | 通过三视…
CADWorld:面向长视野计算机辅助设计的计算机使用基准
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题? | 现有 computeruse 基准(OSWorld / WebArena 等)几乎不覆盖"输出是持久结构化制品"的专业工程场景——机械 CAD 是一类特别严苛的长视野任务,尺寸、参数结构、下游工程状态必须有效 | | Q2 | 核…
SteerDuplex:可操纵的全双工语音对话模型
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题,而非表面热点? | 现有全双工语音对话模型(Moshi 等)在"低延迟轮流发言 / 打断 / 反馈回应"之外,能否听用户一句话临时切换语气、角色、语速、声音风格 这一可操纵性问题,是评测和模型都还没解决的 | | Q2 | 核心方法机制…
干细胞显微成像中 Cellpose-SAM 的保留约束训练后量化
元层五问 1. 解决的真问题:iPSC 培养依赖 CellposeSAM 这类分割基础模型,但实验室 CPU 与边缘硬件放不下 FP32 模型;既缺压缩方案,也缺"压缩后到底还能不能用"的可审计判定标准。 2. 为何过去没人做好:量化评估通常只看平均精度下降或全局 F1,对单视野的灾难性塌缩不敏感;而生命科学领域又恰好…
精化本身即可编辑:基于生成式精化网络的无训练 Prompt-to-Prompt 图像编辑
元层五问 1. 解决的真问题:文本引导图像编辑必须在"改对地方"和"别动无关区域"之间走钢丝——扩散系靠空间控制易错位、因果自回归系被固定解码顺序锁死无法修订早先决策。 2. 为何过去没人做好:扩散编辑已经把空间控制玩得很熟,但因果自回归(VAR / LlamaGen 系)图像生成天然按"由粗到细"或"按 token …
OmniVChat:面向原生音视频对话的合成、基准与训练
元层五问 1. 解决的真问题:omni 模型(同时处理音频+视频并返回文本)的研究受两大瓶颈——用户用自己设备录制的真实对话数据稀缺;以及因为回复依赖用户周围环境、表情与附近物体,关键词匹配作为评测手段不可靠。 2. 为何过去没人做好:过往的"视频问答"或"音频对话"benchmark 都假设存在独立文本问题或外部 c…
IntBMoE:将块级条件化融入专家组合的全参与 Mixture-of-Experts
IntBMoE 用一个小型可学习 codebook 索引 block、一个 perlayer 的轻量 hypernetwork 把整层所有专家 dense 组合起来、再用 sparse 路由只跑少量 block,把 MoE 的三个独立维度(participation / execution / materializat…
APort Vault:基于 Open Agent Passport 的 AI Agent 支付授权基准
APort Vault 复盘了一场公开 CTF 中人类对真实支付 Agent 写的 4,371 次攻击,覆盖 8 个实验室 14 个模型、5 种策略配置、2 条重放轨道(有 / 无 Open Agent Passport 预检层),共完成 225,964 次评测,结论是:模型单体在 Level 2–4 把 140 笔钱…
价值几何:语言模型伦理偏好对齐中的任务向量组合
这篇文章用一份 12,000 实例 / 4 种语言(印地、阿拉伯、西班牙、中文)/ 三对价值冲突(Honesty vs Justice / Justice vs Autonomy / Autonomy vs Honesty)的二选一数据集,先在 GPT5mini 与 Llama3.21/3B 上量化测出「跨语言一致偏好…
FRAUDSkill:冻结权重下的结构化技能优化,让音频反欺诈模型随业务规则一起进化
一句话结论:FRAUDSkill 在不改动底层大型音频语言模型权重的前提下,通过外挂的「技能程序 + 路由策略 + 决策规则」三层结构,把反欺诈推理对齐到一个固定的「业务场景识别 → 是否欺诈 → 欺诈类型」决策协议上,并在 TeleAntiFraud 上把 MacroF1 从共享冻结基线的 41.54% 拉到 73.…
DeformSmith:物理 harness 引导的可形变资产分层生成,让机器人学会自己造可揉的物体
一句话结论:DeformSmith 把「几何 + 外观 + 物理属性 + 机器人交互」四个互相耦合的需求装进一个分层 agentic 框架,用一个共享的物理 harness 反复「建—测—改」可形变物体(deformable assets),直到生成的资产在仿真里既视觉可信又能被机器人稳定操作;与 PhysGen3D …
训练自适应卷积稀疏编码:把稀疏系数变成可微变量,让视觉表征自己学「保留多少」
一句话结论:把卷积稀疏编码(CSC)的稀疏系数从「人工固定值」改为「和网络一起端到端学习的可微变量」,并用 FISTA 展开求解,再从信息瓶颈角度解释其含义;在 CIFAR 与 ImageNet 上达到与 SOTA 可比的干净数据识别准确率,同时在多种输入扰动下显著提升鲁棒性。 1. 这是关于什么的? 关于视觉特征学习…
TeleAntiFraud 2.0:可月度刷新、profile-grounded、音频级的电信反欺诈基准
一句话结论:TeleAntiFraud 2.0 用「MixedTree AntiFraud Generation Pipeline + 月度冻结评估协议」建了一套可滚动刷新、profilegrounded、音频级的中文电信反欺诈基准;它通过把合法同域通话(neardomain negatives)与欺诈通话放到同一份 …
Paint-Anything:用 hex 提示统一「任意颜色控制」让图像生成与编辑同时达标
一句话结论:PaintAnything 学到一个对象级 hexprompt 共享接口,把图像生成(T2I)与编辑(Edit)统一在同一接口下:在 FLUX.24B 上把 ACBenchT2I 与 ACBenchEdit 分别相对基线提升 85.3% / 28.3%,并在 CompColor 上达到对比方法中最高平均分;…
混合记忆Embedding:让 Token 查表读懂上下文语义
MoME(MixtureofMemory Embeddings)通过给每个 Token 的查表机制增加"多候选槽位 + 隐藏态门控路由",解决了传统 memoryaugmented LLM 将同一表面 Token 的不同语义压缩进单一固定向量的坍缩问题,在 nanochat / Llama3/MobileLLM / Q…
HEAL:解构"协同头"中信息分布漂移,从源头抑制多模态大模型幻觉
HEAL(HeadlEvel information disentAnglement and caLibration)首次从因果干预视角揭示 MLLM 幻觉的本质成因——不是模态专属头数量不足,而是"协同头"(Synergy Heads)中信息分布偏离健康平衡态。方法上先用因果噪声干预过滤冗余头,再用反事实 DiD 把…
Cal-OPD:校准推理模型蒸馏中教师偏差,让 52%~65% 的信号就能打赢完整蒸馏
CalOPD(Calibrated OnPolicy Distillation)发现标准 OPD 蒸馏中教师模型自身偏差(selfdeviation)会混入学生观测到的 token 级差异,导致学生同时学习教师能力和教师缺陷。CalOPD 通过正负特权干预(privileged intervention)估计教师的"自…
ORDER:查询条件化的RAG索引与检索联合路由
1. 谁写、给谁看:作者 Aurelien Pellet 等(法国研究机构,通过 CCSD 代理投递);读者是从事领域专家型 RAG 工程的研究员/工程师,尤其关心异构语料下"一套 chunking 走天下"的失败模式。 2. 它的真问题是什么:固定预处理(fixed preprocessing)的 RAG 流水线在面…