视频选题榜 2026-07-17
- https://arxiv.org/abs/2606.20905 · Vesta · 把定位、空间推理、导航、长程规划塞进一个具身基础模型 · 统一 backbone + 多模态记忆 harness 替代多专家集成栈,跨 benchmark 平均 >20% / >10% / 真实机器人 >35% · round=R1
- https://arxiv.org/abs/2404.12390 · BLINK · 14 项经典 CV 任务改写为 3807 道多选题 · 人类平均 95.70%,GPT-4V 仅 51.26% · 视觉感知原子能力早于 PerceptionBench 2 年的同方向基线 · round=R2
- https://arxiv.org/abs/2607.08317 · Blind-Spots-Bench · EPFL 235 道人工手提题暴露多模态「盲区」 · 闭源比开放权重高约 10% · 同期独立印证 PerceptionBench 暴露的感知断层 · round=R2
- https://arxiv.org/abs/2602.00288 · TimeBlind · minimal-pairs 反捷径法测穿 SOTA Video MLLM 时空盲点 · Gemini 3 Pro 48.2% vs 人类 98.2%(random baseline 推算 0.25)· 600 instances × 2 × 2 = 2400 video-question pairs · Allen 13 类时序关系全覆盖 · 第 47 维 video-mllm-evaluation-methodology-layer 补齐 · round=R3