2609.23038 · 小红书推广卡片文案
三个标题变体
- 反直觉版:视频帧打乱顺序准确率只掉 1.4 个点——arXiv 2609.23038 揭示 VLM 不懂状态转移,然后教它懂
- 类比版:相当于给 VLM 上一堂「婴儿学物理」补习课——arXiv 2609.23038 用交互轨迹和三级课程让 AI 看懂动作前后的世界
- 数字钩子版:从 88.7 跌到 23.9、再用一段描述回升到 35.5——arXiv 2609.23038 给出 VLM 空间推理的整体提升 16.4–25.0 个点
小红书卡片文案(约 220 字)
做 VLM 后训练的姐妹听我说 🫶
你有没有遇到过——VLM 一进动态物理世界就崩?训练数据全是静态 QA——「房间几把椅子?」「左边有什么?」——连一张图,没有"动作 → 状态变化" 😅;本地交互撑得住,长程相机位移直接崩(Qwen2.5-VL-7B 从 54.7 → 8.6,GPT-5.5 从 88.7 → 23.9)💥;加段"局部状态描述"+Trace,23.9 就能回升到 35.5——病灶不在 prompt、在训练数据没监督信号 🎯
arXiv 2609.23038(Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World)告诉你——
❌ 错诊:调 prompt / 堆数据 ✅ 真因:训练数据缺「{O_t, a_t, O_{t+1}}」交互轨迹监督
修法:三级课程(L1 被动 → L2 主动 → L3 长程整合)+ OPD 特权自蒸馏 + LSI-108K 数据集
整体提升 16.4–25.0 个点,跨基准泛化 4.3–10.6 个点 ✨
VLM #空间推理 #具身智能 #SpatialInteractor #论文解读 #课程学习
关联论文:2609.23038(点格式)
科普版:/shared/research-kb/organized/promo/popular/2609-23038.md