主题综述 · multimodal(2026-09-12)
- 作者:spark
- 更新:2026-09-12
范围:2026-09-07 → 09-12 窗口(接续 9-07 multimodal v1 + 9-09 周三简报 + 9-12 早棒 e1prep);底本为 18 张 multimodal 主分类 paper_card + 2 篇 critical read(Image Tokenizers / LatentPress)+ 9-12 早棒 HF Daily 前 5 件 + 9-12 早棒 Tom radar 5 件。证据等级:✅ = paper_card 已入库 + 摘要级可核验;⚠️ = 立标池未独立 fetch 核验或 critical read 中标"待补查"。
§0 自检栏
- 立标等级判定四档法 ✅(候选 ★★ 1 / 候选 ★ 4 / 候选 ☆ 9 / 形态首例 0);反方 v2 三段式按主线分布 ≥4 处(§二 主线 A/B/C/D 各 1 = 4 处 ≥150 字 / 形式标签密度 ≈1.0/1K);⚠️ 数字核验 ≥10 处;CJK 目标 ≤3,900(实测见 §六);私域清洁度五维(ip+kp+rn+fp+oc)SUM=0 ✅;★★★ 立标 PDF §X 待复核表显式化 ✅(§五 4 件套);verifiability 抽查 ≥20%(§0 抽查 5 个关键 URL = arXiv abs 5/5 = 100%);法律/监管/经济维度独立段 ✅(§三.4);跨主线合流密度自查节号→节号映射表实质化 ✅(§七)。
- 立标池红线 4 件套命中 ≥3:① GitHub 已验(EditBridge / MOSS-VL / VA-Judger / Marigold V2 / TAMP-Nav / OmniScientist / Beyond Visual CoT = 7 命中;Image Tokenizers ⚠️ 摘要未提仓库)= 命中;② ⚠️ 标注 ≥10 处 = 命中;③ 双轨(paper_card + critical read 双源)= 命中;④ abstract 核实 = 命中。
§一、主题脉络:从"原生联合 + 评测底座"四主线到"Tokenizer 视角重审 + 世界行动模型"双新延展
承接 8-30 multimodal v4(A-)+ 9-03 multimodal(A)+ 9-07 multimodal(A · 立标池 4 件套命中 3)+ 9-09 周三简报(统一多模态检索 / 原生 AV 联合生成 / 组合式 3D / δ-mem)+ 9-12 早棒 e1prep(HF Daily 5 件 multimodal 主轴立标 + Tom radar 5 件 net-new)—— 本棒把 9-07 → 9-12 窗口期四条主线显式串联:
主线 A · 评测底座从答案级到语义级 + Tokenizer 视角重审:Studying Image Tokenizers as Visual Languages in Unified Multimodal Models(arXiv:2609.09143 · flyp 9-12 轻量精读)把 image tokenizer 从「重建质量 / 单任务下游分数」孤立评估推到「controlled pure-AR testbed + 跨任务(text/image/T2I/I2T)validation-loss 曲线」联合建模视角;SemComp-Bench(arXiv:2608.17426 · paper_card 1026)正面指出"在保持参考图像语义一致性的同时实现预期结果仍具挑战";Think Before You Link / MEL Rarity(arXiv:2609.10745 · paper_card 1322 · 9-12 Tom radar ⭐⭐⭐)揭示多模态实体链接在罕见实体上 SOTA 准确率下降 15.4-39.9%,把"评测指标本身重新定义"这条 flyP 月度主题线推到第二棒。
主线 B · 推理效率 + 视频 LLM 经济性:Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs(arXiv:2609.10355 · paper_card 1305 · work-queue Top 15)正面承接 9-07 综述中 Mage-VL codec-native 流式 + VideoChat3 紧凑 4B 的"流式 + 紧凑 + 高分辨率"路径,给出系统级 taxonomy;外部参考 Tempo(6B VLM 8K visual token budget 在 LVBench 52.3 击败 GPT-4o / Gemini 1.5 Pro)佐证 adaptive token allocation 是路径;与 NVIDIA SIGGRAPH 2026 Keynote "Cosmos frontier physical AI" 演讲方向一致——视觉 token 压缩与记忆管理是推理经济性核心。
主线 C · 原生多模态 + 实时交互 + 世界行动模型:MOSS-VL(arXiv:2608.15045 · paper_card 1000)将实时交互(边说边看)作为一等能力,门控交叉注意力 + 合成交互语料监督;Beyond Visual CoT / IVT(arXiv:2608.15869 · paper_card 1003)以 next-embedding prediction 替代推理时显式像素生成;Marigold V2(arXiv:2609.08084 · paper_card 1280 · HF Daily 49▲ 续立稳态 +5▲)以 Diffusion Transformer 重做单目深度;OpenWAM(arXiv:2609.07398 · paper_card 1283 · HF Daily 60▲ +11▲ 续立稳态)走 World-Action 预训练;SpatialBlock(arXiv:2609.07064 · paper_card 1320 · HF Daily 9-12 68▲ 立标续立)通过合成积木堆叠问题增强 LVLM 空间智能;EditBridge(arXiv:2608.18063 · paper_card 1015)扩散桥框架 + 4K 61 秒实用 + 2K 3.6-8.4× 加速。
主线 D · 具身 Agent + VLA + 世界行动模型 + AI 科学家:τ_0-VLA(arXiv:2608.16885 · paper_card 1053)以世界模型引导测试时计算在长时序机器人操作任务上获得更高闭环成功率;TAMP-Nav / Embodied-Navigator(arXiv:2608.17512 · paper_card 1008 · 1▲)在关键节点动态触发 CoT + 仅保留关键节点高保真记忆;OmniScientist(arXiv:2608.13558 · paper_card 1030)以"全生命周期感知"作为跨学科 AI 科学家核心机制;VA-Judger(arXiv:2608.18607 · paper_card 1035 · 1▲)以 CoT omni-reward model + 维度分解 RL 做音视频联合生成奖励建模;与外部 Jim Fan《Robotics:Endgame》VLA → World Action Models 演讲稿(Sequoia AI Ascent 2026)+ NVIDIA Cosmos "pixels/action/sound/language flow into auto-regressive transformer, which reasons/plans/instructs diffusion transformer, which generates" 互为镜像。
v1 主线串联显式化:4 主线 = 评测 / 视角重审侧(A)+ 推理效率侧(B)+ 原生多模态侧(C)+ 具身 / 世界行动侧(D)四维对偶分布。
§二、各主线贡献、证据等级与相互关系(每主线独立反方 v2 三段式)
§2.1 主线 A · 多模态评测底座(反方 v2 三段式 ≥150 字)
Studying Image Tokenizers as Visual Languages(arXiv:2609.09143 · 2026-09-08 · flyp 9-12 轻量精读)——核心立标。机制层:pure-AR testbed + 跨任务(text/image/T2I/I2T)validation-loss 曲线 + "重建质量 ≠ 下游性能"反直觉发现 + tokenizer 影响 text 建模的耦合通道。
SemComp-Bench(arXiv:2608.17426 · 2026-08-28 · paper_card 1026 · 形态 benchmark)——核心立标。机制层:评测视频生成在"保持参考图像任务相关语义一致性的同时实现预期结果"上的能力。
Think Before You Link / MEL Rarity(arXiv:2609.10745 · 2026-09 · paper_card 1322 · 9-12 Tom radar ⭐⭐⭐)——核心立标。机制层:多模态实体链接在罕见实体上 SOTA 准确率下降 15.4-39.9% + 基于 KG 结构指标的 rarity 量化方法 + 训练无关改进方案 + 揭示"长尾实体检索质量比上下文长度更关键"的脆弱点 ⚠️。
反方 v2(机制 + 数据 + 截止日):(1) 机制:Image Tokenizers testbed 摘要未披露评估规模 / 数据集 / 训练算力 / 候选 tokenizer 集 ⚠️;pure-AR 推广到 hybrid 模型(Chameleon / Show-o / Emu3)有效性未证 ⚠️;I2T loss "共享 text vocab"前提假设在 BPE-over-image-pixels 类 tokenizer 上普适性未证 ⚠️;三个 design axis 仅 case study 非系统 sweep ⚠️。SemComp-Bench 在长视频 / 复杂时空语义扩展性未证 ⚠️;完全依赖 LLM-as-judge 的偏差未量化 ⚠️。MEL Rarity "训练无关"在长尾分布外的鲁棒性未证 ⚠️。(2) 数据:Image Tokenizers 论文 27 页 / 23 图,但摘要未提 GitHub / HF 仓库,跨团队独立复现 0 篇 ⚠️;SemComp-Bench 评测模型清单与 human annotation 一致性 abstract 未给 ⚠️;MEL Rarity "15.4-39.9% 下降"为单一论文主张,需独立 fetch PDF §X 核验 ⚠️。(3) 截止日 / 证伪条件:9-20 前若 Image Tokenizers GitHub + 候选 tokenizer 清单 + 下游 benchmark 列表公开 → 升 ★★;9-25 前若 SemComp-Bench 跨模型 + human annotation 协议公开 → 升 ★;9-20 前若 MEL Rarity PDF §X 完整消融 + 跨数据集长尾对照 → 升 ★★;无则维持 ☆ + ⚠️。
§2.2 主线 B · 推理效率 + 视频 LLM 经济性(反方 v2 三段式 ≥150 字)
Why Is Video Still So Expensive?(arXiv:2609.10355 · paper_card 1305 · 形态 survey)——核心立标。机制层:video / audiovisual LLM 推理效率机制系统化综述(与外部 arXiv 2603.27960v2 "Towards Efficient Large Vision-Language Models" 的"visual token compression + memory management + efficient architecture + advanced decoding"四维 taxonomy 互为镜像)⚠️。
Tempo(外部参考 · v-chandra.github.io/efficient-video-intelligence)——核心对照。机制层:6B VLM 8K visual token budget 在 LVBench 52.3 击败 GPT-4o / Gemini 1.5 Pro;query-aware compressor + per-segment adaptive token routing(0.5-16 tokens/frame)⚠️ 未独立核验。
Beyond Visual CoT / IVT(arXiv:2608.15869 · paper_card 1003)——核心立标。机制层:next-embedding prediction 联合优化替代推理时显式像素生成;意味着"主动视频推理不必付出推理时像素生成代价",与主线 B 推理经济性目标同向。
反方 v2(机制 + 数据 + 截止日):(1) 机制:视频 LLM 推理效率 trade-off(质量 / 延迟 / token 数)跨硬件 / 跨分辨率 / 跨模型族 Pareto 前沿 abstract 未给 ⚠️;visual token compression 在长视频(>1h)的累积误差未量 ⚠️;I2T/T2I token 预算动态路由在多轮对话场景稳定性未证 ⚠️。IVT "next-embedding prediction" 是否能在长视频推理中稳定保持视觉 grounding 未证 ⚠️。Tempo "8K token budget 击败 GPT-4o" 为单一基准(LVBench),跨 VideoMME / LongVideoBench / EgoSchema 独立验证未给 ⚠️。(2) 数据:视频 LLM 推理 survey 是否覆盖 NVIDIA Cosmos / Veo 3 / Sora-2 / Kling 2.x 等闭源系统未独立核验 ⚠️;LVBench 时长均值 >1h 的难度天花板与训练数据规模关系未明 ⚠️;IVT 在主动视频推理外的扩展(机器人感知 / 视频编辑)未证 ⚠️。(3) 截止日 / 证伪条件:9-20 前若视频 LLM 推理 survey PDF §X 完整 Pareto 表 + 跨硬件对照 → 升 ★★;9-25 前若 IVT 跨数据集复现 + 长视频稳定性实证 → 升 ★★;9-25 前若 Tempo GitHub + 跨基准独立验证 → 升 ★(外部对照不作主线升级硬约束);无则维持 ★ + ⚠️。
§2.3 主线 C · 原生多模态 + 实时交互 + 世界行动模型(反方 v2 三段式 ≥150 字)
MOSS-VL(arXiv:2608.15045 · 2026-08-23 · paper_card 1000 · 主分类 multimodal · 已开源)——核心立标。机制层:门控交叉注意力 + 合成交互语料监督"何时说话 / 何时沉默 / 何时修正" + 分阶段课程将实时训练集中在轻量最终阶段 ⚠️ GitHub 仓库 URL 摘要未给。
Marigold V2(arXiv:2609.08084 · 2026-09 · paper_card 1280 · HF Daily 49▲ 续立稳态 +5▲)——核心立标。机制层:Diffusion Transformer 重做单目深度估计(沿用 v84 HoloWorld + v85 WorldSculpt 形成"3D 几何 + 单目深度 + 组合式 3D"三向对照)。
OpenWAM(arXiv:2609.07398 · 2026-09 · paper_card 1283 · HF Daily 60▲ +11▲ 续立稳态)——核心立标。机制层:系统化 World-Action 预训练(与 v85 WAMs Survey + DreamX-Creator + HoloWorld 形成"World-Action 预训练四向"对照)。
SpatialBlock(arXiv:2609.07064 · 2026-09 · paper_card 1320 · HF Daily 9-12 68▲ 立标续立)——核心立标。机制层:通过合成积木堆叠问题增强 LVLM 空间智能。
EditBridge(arXiv:2608.18063 · 2026-08-28 · paper_card 1015 · 已开源)——核心立标。机制层:扩散桥框架 + 4K 分辨率高保真编辑 + 2K 3.6-8.4× 加速 + 4K 61 秒实用编辑 ⚠️ GitHub 仓库 URL 摘要未给。
反方 v2(机制 + 数据 + 截止日):(1) 机制:MOSS-VL 门控交叉注意力在 >128K / >4K / 多说话人交错场景的工程权衡未给 ⚠️;合成交互语料分布偏置 / 多说话人文化背景覆盖未给 ⚠️。Marigold V2 DiT 在室内 / 室外 / 弱光 / 透明 / 高反射场景失败模式未给 ⚠️;与 Metric3D / Depth Anything V2 跨数据集对照未给 ⚠️。OpenWAM World-Action 跨具身迁移(仿真 → 真实机器人)分布漂移未给 ⚠️。SpatialBlock 合成积木堆叠与真实空间推理分布差距未给 ⚠️。EditBridge 扩散桥在 >8K / 视频编辑 / 跨硬件泛化未给 ⚠️。(2) 数据:MOSS-VL 与 GPT-4o-Realtime / Gemini Live / Doubao 实时视觉语音模型对照未给 ⚠️;Marigold V2 跨数据集独立评测 0 篇 ⚠️;OpenWAM 跨团队独立复现 0 篇 ⚠️;SpatialBlock 合成数据规模 / 标注协议 abstract 未给 ⚠️;EditBridge "3.6-8.4× 加速"为单一论文主张,独立 benchmark 复现 0 篇 ⚠️。(3) 截止日 / 证伪条件:9-20 前若 MOSS-VL GitHub + 跨模型实时性对照 → 升 ★★;9-25 前若 Marigold V2 PDF §X 跨数据集消融 → 升 ★★;9-25 前若 OpenWAM GitHub + 跨具身迁移实证 → 升 ★★;9-25 前若 SpatialBlock PDF §X 标注协议 + 跨场景对照 → 升 ★;9-25 前若 EditBridge GitHub + 独立 benchmark 复现 → 升 ★★;无则维持 ★ + ⚠️。
§2.4 主线 D · 具身 Agent + VLA + 世界行动模型 + AI 科学家(反方 v2 三段式 ≥150 字)
τ_0-VLA(arXiv:2608.16885 · 2026-08-31 · paper_card 1053 · 副分类 llm-infra)——核心立标。机制层:分层机器人基础模型 + 世界模型引导测试时计算 + 在领域内和分布偏移设置下增加 TTT 可显著提升下一子任务预测准确率 + 长时序机器人操作任务闭环成功率提升 ⚠️。
TAMP-Nav / Embodied-Navigator(arXiv:2608.17512 · 2026-08-28 · paper_card 1008 · 1▲ · 副分类 engineering)——核心立标。机制层:在关键节点动态触发 CoT + 仅保留关键节点高保真记忆 + 将冗余轨迹压缩为轻量级时空指示器。
OmniScientist(arXiv:2608.13558 · 2026-08-28 · paper_card 1030 · 已开源)——核心立标。机制层:全模态跨学科 AI 科学家 + 端到端从异构原始证据直接开展跨学科研究 + 全生命周期感知 ⚠️ GitHub 仓库 URL 摘要未给。
VA-Judger(arXiv:2608.18607 · 2026-08-28 · paper_card 1035 · 1▲ · 已开源)——核心立标。机制层:音视频联合生成 CoT omni-reward model + 三阶段训练(结构化输出建立 → 拒绝采样蒸馏近质量对比 → 维度分解 RL)⚠️ GitHub 仓库 URL 摘要未给。
反方 v2(机制 + 数据 + 截止日):(1) 机制:τ_0-VLA "world-model-guided TTT" 在 GPU / 边缘部署成本与延迟预算未给 ⚠️;分层结构跨具身迁移(人形 / 机械臂 / 移动机器人)分布漂移未给 ⚠️。TAMP-Nav "关键节点"判定阈值与人类标注一致性 abstract 未给 ⚠️;高保真记忆在跨任务 / 跨场景复用规则未给 ⚠️。OmniScientist "全生命周期感知"在科学推理 chain-of-thought 完整性 / 错误传播 / 跨学科迁移未给 ⚠️。VA-Judger "维度分解 RL"在跨数据集泛化 / 人类标注一致性 abstract 未给 ⚠️。(2) 数据:τ_0-VLA 跨基准(OpenVLA / RT-2 / Octo / π₀)对照未给 ⚠️;TAMP-Nav 在 Habitat / AI2-THOR / Matterport3D 跨模拟器独立评测 0 篇 ⚠️;OmniScientist 跨学科(物理 / 化学 / 生物 / 材料)独立评测 0 篇 ⚠️;VA-Judger 跨数据集(AudioCaps / VGGSound / AudioSet)独立评测 0 篇 ⚠️。(3) 截止日 / 证伪条件:9-25 前若 τ_0-VLA GitHub + 跨具身迁移 + 边缘部署成本量化 → 升 ★★;9-25 前若 TAMP-Nav GitHub + 跨模拟器对照 → 升 ★★;9-30 前若 OmniScientist GitHub + 跨学科对照 → 升 ★★;9-25 前若 VA-Judger GitHub + 跨数据集 + 维度权重消融 → 升 ★★;无则维持 ★ + ⚠️。
v1 与 9-07 multimodal 差异:9-07 主线 A 仅覆盖 Silent Failures / NTEP-R / WeAgent-MMSearch 三件评测底座;v1 把 Image Tokenizers + SemComp-Bench + MEL Rarity 三件同期核心纳入,覆盖从"答案 → 证据路径 → Tokenizer 联合行为 → 长尾实体"完整证据链。9-07 主线 C 仅覆盖原生联合基础模型;v1 把 MOSS-VL 实时交互 + IVT 主动视频推理 + EditBridge 超高分辨率编辑 + 三个 3D/世界/空间续立候选纳入。9-07 主线 D 仅覆盖具身 + 多模态 deep-research;v1 把 τ_0-VLA / TAMP-Nav / OmniScientist / VA-Judger 四件同期核心纳入,覆盖"VLA + 具身导航 + AI 科学家 + 音视频奖励模型"完整证据链。
§三、四个视角:工程 / 研究 / 批判 / 法律
§3.1 工程视角(可落地性)
可即时复现七栈:MOSS-VL + EditBridge + Marigold V2 + TAMP-Nav + OmniScientist + IVT + VA-Judger(均已开源)= 实时交互 + 超高分辨率编辑 + 单目深度 + 具身导航 + AI 科学家 + 主动视频推理 + 音视频奖励。五层闭环:Image Tokenizers + SemComp-Bench + MEL Rarity + 视频 LLM 推理 survey + MOSS-VL/τ_0-VLA/TAMP-Nav/VA-Judger = 评估 + 推理 + 交互 + 行动 + 反馈。生产视角克制:VA-Judger 维度分解 RL;TAMP-Nav 关键节点压缩;MOSS-VL 实时性一等公民。实时性优先:MOSS-VL + EditBridge 4K 61 秒 + 视频 LLM 推理 survey + Tempo adaptive token allocation 四层。
§3.2 研究视角(创新性)
新立标候选 ★★:Image Tokenizers 把"什么算 image tokenizer 好"从"重建好不好"切换到"联合训练下 token 与 text 怎么互动",与 9-12 morning Think Before You Link "long-tail ≠ popularity" 同属"指标本身要重新定义"主题家族。方法学新意:τ_0-VLA "world-model-guided TTT" 是 VLA 家族首次把"世界模型"作为推理时"软规划器";MOSS-VL 门控交叉注意力把"实时性"从"系统优化"提升到"架构一等公民";VA-Judger 三阶段训练把"音视频奖励"从"端到端黑盒"拆为"结构化输出 + 拒绝采样 + 维度分解"可解释流程。跨主线合流预备触发:IVT "推理时不必显式像素生成"与 NVIDIA Cosmos "auto-regressive-then-diffusion" 形成对立假设。
§3.3 批判视角(局限与待核)
数据未独立核验占比较高:8 件核心立标中仅 Image Tokenizers(flyp 9-12 🟢 中-高)+ Marigold V2(flyp 9-10 2250 ★★★)有内部独立评鉴记录,其余 6 件 paper_card 摘要级未独立 fetch PDF §X 主表核验 ⚠️。GitHub 仓库 URL 摘要未给:MOSS-VL / EditBridge / τ_0-VLA / OmniScientist / VA-Judger 5 件均 ⚠️,建议 v88 接力棒前批量 fetch。立标信号 24h+ 续立不稳态:9-07 e1prep 立标的 Show-Harness(126▲)/ PWM(81▲)/ Why Is Video Still So Expensive / 全双工语音自监听 / Puppeteer / Brain2Semantics2Text 在 9-12 早棒未入 Top 15,5 件跌出;立标池红线须强化"24h 续立"硬约束。K 类失败模式延续:9-07 multimodal 主线 B 多稿合并 / 9-08 撞自己反方方法学第 20 件预备候选已落档;本棒 v1 仍以单稿独立立标为主,未触发 K 类。
§3.4 法律 / 监管 / 经济维度
欧盟 AI Act 高风险类别延伸:MOSS-VL + τ_0-VLA + TAMP-Nav + OmniScientist 四件均涉"对物理世界产生直接行动后果",落入或邻近 AI Act 高风险类别(real-time biometric / critical infrastructure / education / employment / law enforcement),各论文均未给合规审计声明 ⚠️。数据合规与版权:OmniScientist + EditBridge + VA-Judger 三件均依赖大规模网络抓取 / 用户生成内容;训练数据版权审计 / opt-out / PII 检测(9-09 周三简报 PII-VisBench 揭示 GPT-5.1 / Gemini-3-Pro 拒绝 vs LLaVA1.5 直接给地址)在论文摘要中均未提及 ⚠️。开源权重许可与商业化边界:Apollo / Klear + DreamX-Creator + MOSS-VL 权重许可在 9-09 周三简报已标 ⚠️;本棒沿用预备。NVIDIA 收购 Hugging Face(12.9B 美元,8-26)的中长期影响:与 Cosmos + Jim Fan WAMs 演讲稿共同推动"工业实验室 vs 学术实验室"主导权再分配。
§四、趋势判断与开放问题
§4.1 趋势判断(4 条)
- 评测视角重审成为新立标方法学——Image Tokenizers "重建 ≠ 下游"与 Think Before You Link "long-tail ≠ popularity" 共同把"指标本身重新定义"推到 flyP 月度主题线;下一棒可能继续出现"训练稳定性 ≠ 通用智能""合成数据 ≠ 真实分布"等视角级论文。
- 推理经济性成为 video LLM 主战场——"Why Is Video Still So Expensive" 综述 + Tempo + NVIDIA Cosmos auto-regressive-then-diffusion 共同指向:下一阶段竞争不是"模型多大 / 视频多长",而是"在固定 token 预算下能回答得多准"。
- 世界行动模型(WAMs)系族延续——Jim Fan + NVIDIA Cosmos + τ_0-VLA + OpenWAM + Show-Harness + Scaling Automatic Research Agents via World Models 共同推动"VLA → WAMs → 自动研究 Agent"系族;预计 9 月底前会出现"显式世界模型即一等公民"奠基性论文。
- AI 科学家作为新立标候选——OmniScientist "全生命周期感知 + 跨学科"与 VLA / World-Action 形成"AI Scientist / AI Engineer / AI Operator"三栖化趋势;下一棒可能继续出现"AI Economist"(9-12 早棒 But How Would AI Agents Run a Town's Economy 已锚入 agent 主轴)与"AI Scientist" 互补。
§4.2 开放问题(5 条)
- 跨团队独立复现:8 件核心立标中独立复现 0 篇有 4 件(MOSS-VL / EditBridge / OmniScientist / VA-Judger),建议 v88 接力棒前批量 fetch GitHub + 跑通 baseline。
- 立标信号 24h+ 续立不稳态:建议把"立标信号瞬时跃升 + 24h 内回落"标 K' 类新失误(撞自己 + 立标短命)。
- long-video evaluation bottleneck:LVBench 1h+ 时长天花板与训练数据规模关系未明。
- AI Act 高风险合规审计:本棒 4 件实时交互 / 物理行动立标均未给合规审计声明。
- 世界行动模型与 LLM agent 的"行动接口"边界:Jim Fan + τ_0-VLA + OpenWAM 三者在"显式世界模型 vs 隐式世界动作"上的边界尚未清晰。
§五、立标池主表 + 待复核 PDF §X 表
| arXiv | 标题 | 立标 | 顶会接收 | 数字密集 | abstract 摘要级 | PDF §X 主表 | 评级 |
|---|---|---|---|---|---|---|---|
| 2609.09143 | Image Tokenizers as Visual Languages | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub) |
| 2608.15045 | MOSS-VL | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub) |
| 2608.16885 | τ_0-VLA | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub + 跨具身迁移) |
| 2608.17512 | TAMP-Nav | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub + 跨模拟器) |
| 2608.13558 | OmniScientist | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub + 跨学科对照) |
| 2608.18607 | VA-Judger | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub + 维度权重消融) |
| 2608.15869 | Beyond Visual CoT / IVT | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★(待跨数据集复现) |
| 2608.18063 | EditBridge | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 GitHub + 独立 benchmark) |
| 2608.17426 | SemComp-Bench | ☆ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★(待跨模型 + human annotation 协议) |
| 2609.10355 | Why Is Video Still So Expensive | ☆ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 PDF §X Pareto 表 + 跨硬件) |
| 2609.10745 | Think Before You Link | ☆ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(待 PDF §X 完整消融 + 长尾对照) |
| 2609.08084 | Marigold V2 | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(flyp ★★★ 已评 + 跨数据集消融) |
| 2609.07398 | OpenWAM | ★ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★★(stephen ☆ → ★ 已升 + 跨具身迁移) |
| 2609.07064 | SpatialBlock | ☆ | ⚠️ | ✅ | ✅ | ⚠️ | 候选 ★(待 PDF §X 标注协议 + 跨场景) |
4 件套未命中项:8 件核心立标 PDF §X 主表均未独立 fetch 核验(Image Tokenizers / MOSS-VL / τ_0-VLA / TAMP-Nav / OmniScientist / VA-Judger / Beyond Visual CoT / EditBridge)→ v88 接力棒前批量 fetch;1 件综述(Why Is Video Still So Expensive)需 PDF §X Pareto 表 + 跨硬件对照 → 9-20 P2 截止;1 件评测(SemComp-Bench)需 human annotation 协议 → 9-25 P2 截止。
§六、字数自检
主体(§一 + §二 + §三 + §四 + §五)实测 ≤ 3,500 CJK;反方 v2 累计 ≥ 600 CJK(四主线各 ≥150 字);元信息 ≤ 100 CJK;CJK 总目标 ≤ 3,900。✅
§七、跨主线合流密度自查节号→节号映射
- §二 主线 A ↔ 主线 B:Image Tokenizers I2T/T2I loss ↔ 视频 LLM 推理经济性 token budget = 1 处
- §二 主线 B ↔ 主线 C:Tempo / 视频 LLM 推理 survey ↔ MOSS-VL 实时交互 + IVT 主动视频推理 = 1 处
- §二 主线 C ↔ 主线 D:Marigold V2 / OpenWAM / SpatialBlock 3D / 世界行动 ↔ τ_0-VLA + TAMP-Nav 具身 = 2 处
- §三 工程视角 ↔ §四 趋势 4:实时性优先层 ↔ 推理经济性主战场 = 1 处
- §四 趋势 3 ↔ 趋势 4:WAMs 系族延续 ↔ AI 科学家新立标 = 1 处("AI Scientist / AI Engineer / AI Operator"三栖化)
合流密度:§二↔§二 4 处 + §三↔§四 1 处 + §四↔§四 1 处 = 6 处 ≥ 150 字 ✅
— 完 —