解读
2634 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
机器人也开始"先想后做"了:X-Planner 把任务规划从"塞进 token 序列"里救了出来
arXiv 2609.25187(XPlanner,XSquareRobot 出品,20260921 v1)把具身智能里的"任务规划"拆成两个并行接口——一个吐离散事件状态(人类能读懂、出错能定位),一个吐跨 Transformer 深度的潜变量轨迹(语义不漂、推理不贵)。在 BERTScoreF1 / JudgeOv…
压缩大模型别再"一刀切"了:GeoPair 教模型按"长相相似度"找搭子,跨层共享不破坏精度
arXiv 2609.25963(GeoPair,20260922 v1)是一套免训练(trainingfree)的大模型压缩框架——它不再按"挨得近的层就该共享参数"这种粗暴规则配对,而是先算每一层自己的"长相"(即权重/激活的主子空间结构),把"长相够像"的层配成一对再共享字典(dictionary)做低秩分解。a…
GeoPair:面向免训练 Transformer 压缩的几何保持跨层分解
1. 元命题:Transformer 跨层冗余不应被启发式处理,必须用"几何保持"作为优化目标来识别真正结构兼容的层对。 2. 元对象:现有免训练压缩管线要么逐层孤立优化,要么用粗粒度的"相邻层同基"分组,忽略每层的激活几何差异。 3. 元约束:在零训练预算下,同时优化"跨层配对"与"共享字典分解",并保持每层的标定几…
X-Planner:面向具身智能的事件结构化任务规划前端
1. 元命题:在长视野具身操控中,"任务规划"应该被当作一等公民显式建模,而不是塞给 VLA 主干当隐性副产品。 2. 元对象:现有 VLA/CoT 规划器要么用粗粒度任务级标注(监督弱),要么把整条推理按 token 序列化(表示贵)。 3. 元约束:监督和表示必须同时升级——既要"事件级、可解释、能反映错误识别"的…
Uranus:面向具身 AI 的下一代数据驱动机器人仿真基础设施
1. 元命题:机器人仿真不应再走"手工建模资产 + 物理引擎"路线,而应走"联合轨迹条件自回归扩散"路线,把仿真器当成一个可数据驱动的生成模型。 2. 元对象:传统仿真器(Isaac Sim / MuJoCo / SAPIEN)资产构建昂贵、扩展困难、跨本体不通用。 3. 元约束:仿真器必须满足三项硬指标——流式开放式…
标一行就把 DPO 数据准备时间砍掉 52%?这套「标错位置就重写」的标注神器悄悄上线了(v2 重写版)
arXiv 2609.24983(onPanda, 20260923 v1)是一套把"AI 标错了整段重写"变成"找到第一个错字 → 替换 → 继续往下写"循环的标注工具——保留模型自己生成的 90% token,只让人改一行字,顺手还能免费产出精确到 token 的偏好对,论文自报中位标注时间下降 52%(N=12 …
主题综述 · multimodal(2026-09-21)
① 字数三层一致:CJK 实测 3,679(主体 2,940 + 反方 541 + 元信息 198)≤ 3,900 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1~§3.4 四主线(机制/数据/截止日证伪),各主线 CJK 实测 152 / 158 / 145 …
AI 导师比肩人类专家,成本仅 1/918:StudentBench 用 2,383 人真实 GRE 数据说话
arXiv 2609.28470(StudentBench,Handshake AI Research 团队,20260924 更新)做了第一份"AI 能不能真的教人"的工程级对照实验——招募 2,383 名真实参与者做 GRE 题目、随机分配到 AI tutoring / 人类专家 tutoring / 无 tuto…
Agent 的"考前临时抱佛脚"比"平时记笔记"更管用:JitMem 把记忆系统整个翻了过来
arXiv 2609.27334(JustinTime Memory / JitMem,20260923 提交)做了一件反常识的事——它把 Agent 的"记忆系统"从"任务刚结束就写摘要"搬到"任务来了再合成":保留原始轨迹不压缩,等到 query 来了,由一个 learned curator 实时合成"为这次任务量…
AI 导师效果比肩人类专家,成本低 918 倍:StudentBench 全解
Handshake AI Research 团队推出 StudentBench 评估套件,通过对 2,383 名真实参与者的 GRE 学习效果实验,证明了 AI 导师(LLM)在学习增益上与专家人类导师统计等价(p=.015),而成本仅为人类的 1/918(每提升 1% 得分:AI $0.0052 vs 人类 $4.8…
PackLab:面向机器人装箱的 MLLM 闭环框架(开发·训练·评测一体化)
Q1 这篇到底在解决什么真问题? 机器人 bin packing(把不规则物体装进箱子)不是"挑一个位置塞进去"的一次性任务,而是长时序、闭环、序贯决策问题——每放一件都改变剩余空间分布,后续每一步的可行解集合都被前序选择重写。已有两条路:几何启发式(基于"最低重心/最大接触面积/极值点"等 handcrafted 规…
Spatial-Interactor:通过物理世界交互学习空间推理
SpatialInteractor 通过将交互轨迹(Observation → Action → Observation)作为直接监督信号,让 VLM 从"观察变化"中学习物理世界状态转移,弥补了现有 VLM 在动态环境中的空间推理短板。 VLM 在静态图像理解上进步很大,但一到动态、三维、时序相关的物理世界任务就露怯…
On the Diffusibility of High-Dimensional Latents:用 x₀-prediction 拯救"高维潜空间难扩散"的反直觉发现
Q1 这篇到底在解决什么真问题? Representation Autoencoders(RAE)让扩散模型工作在预训练视觉编码器的特征空间里,而不是像素空间——这能极大加速生成(SDXL/Flux 一类 latent diffusion 都是这套路)。但许多现成 encoder 重建质量差(为下游任务优化的,丢掉细节…
RecCAR:多模态联合视频扩散中的"反向互注意力鸿沟"——用 KL 正则化让伴生模态真正约束视频
Q1 这篇到底在解决什么真问题? 联合多模态视频生成(video+3D body motion / video+audio)用共享 diffusion transformer 同时去噪多个模态流,理论上伴生模态(3D 骨架、音频)可以反向约束视频生成,使姿态对得上嘴型、身体动作连贯。但实际存在不对称性:伴生模态能很好地…
EmbodiedSWE:用 Coding Agent 破解长程灵巧机器人任务
Frontier coding agent 可以自主写程序解决需要半小时的长程灵巧操作任务,且其验证通过的解法还能作为数据引擎,批量生成多样化演示来训练可泛化的通用机器人 VLA 策略。 通用机器人最大的瓶颈不是"感知不够好",而是无法低成本、大规模地获得长程任务的演示数据。 Teleoperation(遥操作)慢且贵…
视频选题榜 2026-09-24
· JEVasaJudge: Accept When Confident, Escalate When Unsure · 决策型 judge + 冻结级联 + 置信度门控 = 0.36% 成本 + 99% 准确度保留 · round=R1 · LatentPort: Beyond KV Cache — CrossMod…
主题综述 · Agent(2026-09-24)
1. 字数 CJK:主体 2,876 / 反方 312 / 元信息 168 = 3,356 CJK ≤ 3,900 硬上限 ✅ 2. ⚠️ 标注密度:正文 11 处 + §五合流 3 处 = 14 处 ≥ 10 硬下限 ✅ 3. 反方 v2 三段式按主线分布:5 主线 × ≥150 字 = 5 段均命中(§3.1–§3…
物理先验嵌入机器人学习:一篇把"数据驱动 ↔ 物理建模"打成统一分类法的综述
RQ1 这篇在解决什么真问题? 机器人学习领域近年论文增长极快,"把物理先验塞进学习系统"的叫法五花八门——physicsinformed / physicsguided / physicsencoded 等术语各异。术语不统一导致三件事做不动——跨论文横向比较、做新端到端学习系统时找不到现成基线、对"物理真法是否真优…
Just-in-Time Memory:把 Agent 记忆系统从"写时固化"搬到"读时按需合成"
RQ1 这篇在解决什么真问题? 当下几乎所有 Agent 记忆系统都在"任务刚结束时"就把 trajectory 蒸馏成一个固定的 artifact(reflection / workflow / skill / reasoning strategy),等到未来某个 query 来了再用相似度检索出来用。⚠️ 这种"w…
HappyWorld-Bench:把"世界模型"从生成好看拉到交互可靠
RQ1 这篇在解决什么真问题? 现有 World Model 评测集中在"生成质量"(图像是否真实、视频是否连贯)——一旦把 World Model 用作 Agent 的环境模拟器,它必须满足"交互可靠性"——多次访问同一区域、修改对象、跨步保持状态、物理规则一致。⚠️ 这件事没有统一 benchmark。本文填这个坑…
2301.00234 · 小红书推广卡片文案
1. 「在 prompt 里塞 3 个例子 AI 就能学会新任务」这件事的教科书,六年八版被引 1170 ✨ 2. 做 Prompt / RAG / Agent 的姐妹必读:这篇综述六年八版,几乎是 ICL 的「坐标系」🎯 3. 1170 次引用、清华 + 北大合著 —— 把 GPT3 那道「涌现」系统化讲清楚的中文 …
1412.6632 · 小红书推广卡片文案
1. 2014 年那篇论文悄悄奠定了今天 GPT4V 看图的底层 —— 11 年后读它依然震感拉满 ⚡ 2. 「看图说话」AI 的第一锹土,被这 56 页论文挖在了 2014 年冬 ❄️ 3. 做多模态的姐妹听我说:你今天用的所有 VLM,都得感谢这篇 11 年前的论文 🫶 做多模态的姐妹听我说 🫶 你今天用的 GPT…
把 GPT-3 "塞 32 个例子 AI 就能学会" 这件事讲清楚的中文综述:为什么 1170 次引用都说它必读
arXiv 2301.00234 (Dong et al. 202212 v1,202410 v6)是清华 + 北大 + 苏州大学 + 微软亚研 14 位作者合著、历经六年八版的 incontext learning (ICL)综述 — 它把 "在 prompt 里塞几个例子,模型就能不更新权重地学会新任务" 这件事,…
当 AI 第一次学会"看图说话":m-RNN 把 1285 次引用的工作,怎样悄悄奠定了今天所有 VLM 的地基
arXiv 1412.6632(mRNN)是 2014 年百度研究院 + UCLA 的 Mao 等人写的一篇 56 页论文 —— 它第一次让一个神经网络端到端地"看着图写字",而不是先把图里的物体都标出来、再套模板写出句子。今天 GPT4V、GPT5、LLaVA、QwenVL 看见图片就能和你聊天,这条技术线的第一锹土…
Tri-PvP:通过感知-命题证据冲突暴露全模态大模型的模态偏置
1. 论文是否真正解决一个评测痛点?是:现有 OLLM 评测把"模态内证据"和"证据形式"混为一谈,无法干净归因偏置来源。 2. 数字是否能在 abstract 中逐字溯源?是:8,000 样本 trimodal benchmark、5 个 OLLM 被测、layerwise linear probing + cont…
RoboFollow:揭示具身智能体中指令遵循的幻象
1. 论文是否真正解决一个评测痛点?是:现有 embodied 评测任务单一,policy 可以「几乎不用语言」就拿高分,掩盖了真实指令遵循能力的不足。 2. 数字是否能在 abstract 中逐字溯源?部分:abstract 给出「L0 强但 L1–L3 不迁移」+「9 个 VLA/WAM policy」;具体表格数…
Agensh:将组织智能扩展到 1,024 个智能体
1. 论文是否真正解决一个工程痛点?是:多 agent harness 在中心编排器下被任务分配瓶颈锁死规模上限。 2. 数字是否能在 abstract 中逐字溯源?是:19.31%→28.78%(5 任务均值,相对 +49%)、33.89%→55.06%(pandoc 单任务)。 3. 是否有可复现的实证核心?是:P…
2609-25053
日期与轮次:20260924 R2(中午档) arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260924_R2_latentporthybridstatehandoff_shortvideoscript.md 标题:LatentPort 跨模型活记忆交接 目…
Gemini 报告把多模态从「拼接」变成「原生」——这是 2023 年底 AI 圈集体转向多模态 LLM 的标志性事件
arXiv 2312.11805 (Gemini 家族技术报告) 是 Google DeepMind 在 2023 年 12 月发布的 60+ 页技术报告,介绍 Ultra / Pro / Nano 三档规模、文本+图像+音频+视频+代码原生多模态的密集 Decoderonly Transformer。其旗舰模型 Ge…
BlameBERT:丹麦议会中的政治对立与问责归因(1997–2026)
1. 这篇论文的真问题是什么?——政客语言是否真的越来越"狠",还是只是新闻放大?需要可量化的纵向证据。 2. 它真解决了问题吗?——给出一个 1997–2026 的议会辩论问责时间序列,并量化"政府 vs 反对派"的不对称机制。 3. 解决得有多彻底?——单语、单国会,丹麦议会;但提供了可复制的低资源语料注释流水线,…