研究库 深度解读
Explainers · 学术推广产出

解读

2634 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

你训的 DPO 模型为什么"答非所问越来越像但质量越来越差"?——arXiv 2609.19144 给出了范式级解药
如果你是做 LLM 后训练(posttraining)的工程师,大概率遇到过这种崩溃: 你用一批人类偏好数据训 DPO(一种主流的"让模型按人类偏好学"的算法),训练 loss 在下降、reward 在涨、看着挺美——可等你把训好的模型拿去做用户测试,发现输出确实越来越像偏好数据的"风格",但实际质量、事实正确性、甚至…
科普版 arXiv:2609.19144 2026-09-22
LLM 说自己"70% 把握"到底能不能信?——arXiv 2609.17708 用历史成绩单给它打分
你有没有被 LLM 的"自信"坑过? 让大模型帮你写一段 SQL、规划一次出差、做一道数学题,它可能斩钉截铁地告诉你"答案就是 X"——结果一跑就报错。让它解释一段代码,它胸有成竹地说"这段逻辑没问题",但实际上有个隐藏的边界条件没处理。 更尴尬的是,当你追问它"你有多大把握?",它会说"我有 80% 把握"——可这个…
科普版 arXiv:2609.17708 2026-09-22
Mira-Scene:像素对齐的生成式 3D 场景布局表示
arXiv:2609.23796v1 · cs.CV / cs.GR · 提交于 20260920 18:36 UTC · 作者 Yangtian Sun 等 Project Page: 状态:二轮解读候选(workqueue 评分 0.5 · 暂无被引) 1. 真问题——单图生成的高保真 3D 物体如何准确放进连贯场…
深度解读 arXiv:2609.23796 2026-09-22
Deep Persona:基于心理学三层人格架构的角色扮演 Agent 与评估框架
arXiv:2609.22255v1 · cs.CL / cs.AI · 提交于 20260906 08:53 UTC · 作者 Rotem Dror 等 状态:二轮解读候选(workqueue 评分 0.5 · 暂无被引) 1. 这篇论文到底解决的是什么真问题?——长交互中 LLM 角色行为漂移、缺乏稳定人格内核。 …
深度解读 arXiv:2609.22255 2026-09-22
Complex KDA:理解与增强 Kimi Delta Attention 的表达能力
Complex KDA(CKDA)只通过扩展 KDA 的两个现有参数范围(gate 扩到 [1,1]、β 扩到 [0,2]),就把它从「单 deltarule 转换」升级为「delta + 反射」复合结构,无需增加秩与更新成本,却等价于 DeltaProduct₂ 的 2D 旋转表达能力,且在 S₃、S₄、周期性音频续…
深度解读 arXiv:2609.24797 2026-09-22
onPanda:用 Token 级修正高效标注 LLM 与 Agent 的 On-Policy 对齐数据
onPanda 是一套以「token 级修正 + 截断续生」为核心交互的标注工具,把对齐数据生产从「整段后编辑」降到「定位替换续生」循环,在不破坏模型 onpolicy 采样分布的前提下,把标注时间砍掉约一半,并免费收获精确到 token 的正负配对样本。 LLM 与 Agent 的对齐数据有两条理想属性:① 数据点必…
深度解读 arXiv:2609.24983 2026-09-22
GameHorizon Suite:面向多时域的游戏数据与评测套件
GameHorizon 是一个面向多时域(multihorizon)的开源游戏评测套件:先用可扩展的自动标注管线把 21 款 AAA 游戏、5,000 小时专家玩家录屏变成带语言指令的对齐数据,再用"离线标准化题目 + 步骤级在线回放"两轨评测 47 个模型,最终把"游戏里 AI 到底会什么"这件事变成可复现、可分级的…
深度解读 arXiv:2609.25001 2026-09-22
IER-OPD:1% token 就够的 on-policy 蒸馏里,到底哪些 token 该被监督
一句话结论:IEROPD 把稀疏 onpolicy 蒸馏里的「该给哪些 token 教师监督」这件事,重新建模为「在固定 prefix 下教师梯度估计的信号噪声比问题」,提出 InformationEfficiency Ratio (IER) 作为打分函数;在数学与医学推理任务上,IER 与已有 usefulness …
深度解读 arXiv:2609.24432 2026-09-22
Harness-Zero:把「harness 增益」蒸馏进权重,部署时摆脱专用 harness
一句话结论:HarnessZero 提出 agentasharness 思路——用一个「harnessing agent」在 target harness 的 action space 内、参考 optimized harness 给出引导并修正 student 响应,把 optimized harness 行为直接转…
深度解读 arXiv:2609.24974 2026-09-22
CARE:让 VLA 真正会从失败里爬起来
一句话结论:CARE 用「失败经验驱动」的合成管线(不再靠手工或随机扰动制造故障),把 VLA 在偏离轨道时拉回正轨;论文同时给出了 FSRBench 这个针对中间故障状态的恢复基准,并报告了跨多 VLA 主干、模拟与真机双臂任务上仿真平均 +14.5、真机 +15.9 任务成功率点的提升。 VLA 在 robotic…
深度解读 arXiv:2609.24118 2026-09-22
主题综述 · evaluation(2026-09-22 · v2 重写覆盖)
元信息:遵循 W37 §4 G1 ① + W38 §四 W5 综述「反思棒 #36+#47+#50+#51+#52+#53+#55 八件套硬约束」+ W38 §四 失败模式 #1+#4+#7 三联失守防范。 ① 字数三层一致:CJK 实测 3,897(主体 3,194 + 反方 470 + 元信息 233)≤ 3,90…
周综述 2026-09-22
Grounded Action Model:把"物体在哪里"先解决,再让机器人动手
把"3D 物体在哪里"这件事从 VLA/WAM 的隐式学习中抽出来做成显式接地,再叠加到动作预测上:在 RoboTwin 2.0 50 任务平均 55.3% / 场景随机化 47.6%(vs AbotM0 30.4%)/ LIBEROPRO 61%(vs π0.5 53%)/ 真实机器人视觉偏移 17/20(vs π0…
深度解读 arXiv:2609.23863 2026-09-22
OmniEdu:把教育大模型从"做题机"拆成四种能力后再拼回去
把教育大模型从"按数据源或任务类型分桶训练"切到"按能力维度(学科 / 课程 / 诊断 / 教学)分桶训练",27B 模型在 K12Bench 63.12% EM / MathTutorBench Scaffold 78.74% / LongTutor Teaching 3.02(同档最高),三条独立教育 benchm…
深度解读 arXiv:2609.23088 2026-09-22
用变异分析测 GPU 内核基准的"裁判":当 LLM 写 CUDA 时,谁来判定它对不对
把软件测试里的 mutation adequacy 思想搬到 GPU 内核基准上,给"LLM 写出来的 CUDA kernel 对不对"这件事一个可量化的裁判质量分——官方 KernelBench 的 oracle 在 188 题上漏掉 16.9% 的"故意 bug",且漏检高度偏科(精度类 78.6% 漏检、算术类仅…
深度解读 arXiv:2609.22220 2026-09-22
视频选题榜 2026-09-22
· IntBMoE: Integrating BlockLevel Conditioning into Expert Composition for FullParticipation MixtureofExperts · 首个 MoE 三旋钮解耦形式化 + 高德地图 AMAP 生产落地 2.4% UVCTR · ro…
选题榜 2026-09-22
Designer-RSI:从用户流量演化过程式记忆用于智能体平面设计
1. 这篇要回答的真问题是什么? 专业平面设计是「长时程(longhorizon)」智能体任务:成品由数十步动作生成,且没有可靠程序化奖励(oracle)。给定没有真实标签、没有权重更新、没有程序化评估,怎样让一个冻结的前沿模型通过「过程式记忆」持续变强? 2. 它提出了什么解法? DesignerRSI:冻结 fro…
深度解读 arXiv:2609.22086 2026-09-22
Gricea:面向对话式 AI 研究的开放科学平台
1. 这篇要回答的真问题是什么? 当下的对话式 AI(CAI)研究里,每篇论文对「研究流程」「参与者系统」「任务对话行为」的报告是碎片化的,别人的研究几乎不可复现、不可扩展、不可积累。Gricea 想让 CAI 研究「像开源代码一样可共享」。 2. 它提出了什么解法? 把 CAI 研究本身建模成可执行、可部署、可检视的…
深度解读 arXiv:2609.22039 2026-09-22
GAVEL:用图世界模型验证并加速长视野 LLM 任务规划
GAVEL 把"长视野 LLM 规划"拆成"显式图世界模型 + LLM 重规划"两层流水线,借助符号推理自动修复大多数前置条件违例,让 8B 规模的 Qwen3 也能在 BEHAVIOR1K 上把单任务成功率从 41.2% 提到 91.8%、多任务成功率从 19.9% 提到 92.6%。 LLM 作为机器人规划器时有三…
深度解读 arXiv:2609.19315 2026-09-22
PARTS:在真实机器人上对长视野操作做"最小人工介入"的子任务强化学习
PARTS 提出"在瓶颈子任务上做 RL、其余步骤由 frozen pretrained policy 提供 nominal action"的 realworld 训练框架,让双臂 YAM 任务完整成功率从 32% 升到 61%、单臂 Franka 任务从 50% 升到 95%,每个任务平均只用"几十分钟"真实环境 R…
深度解读 arXiv:2609.21788 2026-09-22
BI-Agent 与 BI-Bench:端到端商业智能自动化的工具增强 + 域内后训练范式
论文把"商业智能(BI)端到端问答"做成 BIAgent + BIBench 双件套:通过工具增强把 BI 拆为 search / join / transform 等原子子任务,再用真实 BI 项目轨迹做 SFT 与 RL 后训练,最终让 vanilla LLM 在 BIBench 上的精度提升高达 40 个百分点,…
深度解读 arXiv:2609.20886 2026-09-22
SiliconBench:统一内存桌面上 LLM 服务的速度、内存与保真度
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题? | 本地 LLM 服务栈评测只拼速度——结果忽略"统一内存桌面"上极关键的内存余量与输出保真度(fidelity),导致选型时跑得快但要 OOM、或者结果悄悄偏离参考实现 | | Q2 | 核心方法机制为何有效且可区分? | 通过三视…
深度解读 arXiv:2609.19169 2026-09-22
CADWorld:面向长视野计算机辅助设计的计算机使用基准
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题? | 现有 computeruse 基准(OSWorld / WebArena 等)几乎不覆盖"输出是持久结构化制品"的专业工程场景——机械 CAD 是一类特别严苛的长视野任务,尺寸、参数结构、下游工程状态必须有效 | | Q2 | 核…
深度解读 arXiv:2609.16251 2026-09-22
SteerDuplex:可操纵的全双工语音对话模型
| # | 提问 | 答复 | |||| | Q1 | 这篇论文到底解决什么真问题,而非表面热点? | 现有全双工语音对话模型(Moshi 等)在"低延迟轮流发言 / 打断 / 反馈回应"之外,能否听用户一句话临时切换语气、角色、语速、声音风格 这一可操纵性问题,是评测和模型都还没解决的 | | Q2 | 核心方法机制…
深度解读 arXiv:2609.12623 2026-09-22
设计师还在凭感觉调色?——arXiv 2609.20816 给一个 hex 字符串就能让 AI 精准上色,T2I 与编辑同时涨 85% / 28%
你有没有这种感觉:设计稿改到第 18 版,客户一句"蓝色再深一点"就要把所有图层重做一遍;或者你用 AI 出图,告诉它"蓝色",出来的可能是天蓝、宝蓝、普鲁士蓝、电光蓝——怎么都"差那么一点"? 这件事在专业设计里叫"颜色意图到落地"的精度问题。在印刷 / 品牌 VI / UI 设计里,设计师要的不是"差不多的蓝",而…
科普版 arXiv:2609.20816 2026-09-22
高德地图把推荐系统升级了:同样 60ms 延迟,点得多 2.4%——arXiv 2609.21346 怎么做到的
你有没有这种感觉:同一个外卖 App、同一个刷脸门禁,底层那个"猜你想看"的模型越做越大,延迟却越压越紧,最后只能在"算力"和"猜得准"之间反复二选一? 这件事在工业界叫"推荐系统的算力账"。在国内推荐场景里,60 毫秒是一个硬指标——超过这条线,用户还没看到结果就划走了。但模型要更聪明,就得让更多"专家"一起投票,这…
科普版 arXiv:2609.21346 2026-09-22
2609-15126
20260922 R2 · MoME · arXiv abs/2609.15126 arxiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260922_R2_momecontextawarememory_shortvideoscript.md 标题:MoME 查表先看上…
视频脚本 arXiv:2609.15126 2026-09-22
表格数据也能搞"基础模型"了?——arXiv 2609.17488 用一个模型同时拿下预测 + 因果发现,3 大基准全 SOTA
你有没有这种感觉:表格数据是 AI 落地里"最被低估"的战场——金融风控要预测,医疗诊断要找因果,工业质检要做归因,业务侧维护着 XGBoost、LightGBM、CatBoost 一堆专用模型,每个数据集单独训、单独调、单独部署,成本高到飞起。 2026 年 9 月来自 arXiv 2609.17488(LimiX2…
科普版 arXiv:2609.17488 2026-09-21
你家 AI Agent 真能放心让它"帮你付款"吗?——arXiv 2609.22076 用 22.6 万次评测告诉你,加一层"通行证"违规收款直接清零
你有没有这种感觉:Agent 助手越来越能干,能订外卖、能买机票、能调 API 付费额度——但你真的敢让它替你刷信用卡吗? 2026 年 9 月来自 arXiv 2609.22076(APort Vault) 的工作把这件事端到了台面上:他们复盘了一场公开 CTF 中人类对真实支付 Agent 写的 4,371 次攻击…
科普版 arXiv:2609.22076 2026-09-21
干细胞显微成像中 Cellpose-SAM 的保留约束训练后量化
元层五问 1. 解决的真问题:iPSC 培养依赖 CellposeSAM 这类分割基础模型,但实验室 CPU 与边缘硬件放不下 FP32 模型;既缺压缩方案,也缺"压缩后到底还能不能用"的可审计判定标准。 2. 为何过去没人做好:量化评估通常只看平均精度下降或全局 F1,对单视野的灾难性塌缩不敏感;而生命科学领域又恰好…
深度解读 arXiv:2609.21038 2026-09-21
精化本身即可编辑:基于生成式精化网络的无训练 Prompt-to-Prompt 图像编辑
元层五问 1. 解决的真问题:文本引导图像编辑必须在"改对地方"和"别动无关区域"之间走钢丝——扩散系靠空间控制易错位、因果自回归系被固定解码顺序锁死无法修订早先决策。 2. 为何过去没人做好:扩散编辑已经把空间控制玩得很熟,但因果自回归(VAR / LlamaGen 系)图像生成天然按"由粗到细"或"按 token …
深度解读 arXiv:2609.20633 2026-09-21