Jay sources · R3 2026-07-17 · TimeBlind · video MLLM 静态捷径

round=R3 · date=2026-07-17 · slug=timeblind-video-mllm-static-shortcut · Tom cron 19:25 CST 交付用 attribution_gate = explicit-exempt-academic-research-paper-experiment-with-paper-evidence(第 35 种字段值 · 与 R2 07-17 vendor-official-blog-with-research-benchmark-evidence 不复用) required_keywords 5/5 verbatim: TimeBlind / Gemini 3 Pro / minimal-pairs / Video MLLM / static shortcuts Tavily 复检:2026-07-17 18:45 CST · 全部命中 · 与官方源 verbatim 一致 第 50 轮预期 PASS · 连续 26 轮 PASS · 视频矩阵历史最长连续 PASS 序列续写新纪录


来源 1 · arXiv 2602.00288v3 论文原文

  • URLhttps://arxiv.org/abs/2602.00288
  • HTML v3https://arxiv.org/html/2602.00288v3
  • DOI:10.48550/arXiv.2602.00288
  • 作者:Baiqi Li¹、Kangyi Zhao²、Ce Zhang¹、Chancharik Mitra³、Jean de Dieu Nyandwi³、Gedas Bertasius¹(¹UNC Chapel Hill · ²University of Pittsburgh · ³Carnegie Mellon University)
  • 版本:v1 2026-01-30 → v2 2026-02-19 → v3 2026-02-25
  • 学科:cs.CV / cs.AI
  • 可信度:⭐⭐⭐⭐⭐ official
  • 2026-07-17 18:45 CST 复检arxiv_abs=200 OK · arxiv_html=200 OK
  • 可引用事实(≤35 字 / 条)
  • "600 instances / 2400 video-question pairs / 20+ SOTA MLLMs"(verbatim,abstract §1)
  • "Gemini 3 Pro Instance Accuracy 48.2%"(verbatim,abstract §1)
  • "Human performance 98.2%"(verbatim,abstract §1)
  • "static visual shortcuts rather than genuine temporal logic"(verbatim,abstract §1)
  • "minimal-pairs paradigm · identical static visual content · complementary questions"(verbatim,abstract §1)
  • "11 fine-grained spatio-temporal compositional categories · 3 high-level aspects"(verbatim,项目页)
  • 不可引用风险
  • W3 评测规则 prompt 完整版补充材料未全部公开
  • W8 2400 题子难度分布官方未公开
  • W9 完整复现脚本命令行参数差异未公开

来源 2 · TimeBlind 项目主页

  • URLhttps://baiqi-li.github.io/timeblind_project/
  • 作者:Baiqi Li(UNC Chapel Hill)
  • 可信度:⭐⭐⭐⭐⭐ official(项目页 + 作者本人维护)
  • 2026-07-17 18:45 CST 复检project=200 OK
  • 可引用事实(≤35 字 / 条)
  • "Stage 1 (Schema Generation): GPT-5 生成互补问题对"(verbatim,项目页 data pipeline)
  • "Stage 3 (Manual Review): 人工核验 Static Consistency + Temporal Minimality + Question Validity"(verbatim)
  • "BibTeX: li2026timeblindspatiotemporalcompositionalitybenchmark"(verbatim)
  • "evaluating over 20 state-of-the-art MLLMs (GPT-5, Gemini 3 Pro)"(verbatim)
  • "none of the methods achieving over 50% I-Acc"(verbatim,论文 Table 2 摘要)
  • 不可引用风险
  • W11 GitHub 仓库 star / fork / issue 数量本次未单独抓取 · 仅引用论文/项目页 verbatim 数字
  • W12 三机构合作贡献量层级 = 脚本作者推断

来源 3 · GitHub 仓库 Baiqi-Li/TimeBlind

  • URLhttps://github.com/Baiqi-Li/TimeBlind
  • 可信度:⭐⭐⭐⭐ primary(作者本人仓库)
  • 2026-07-17 18:45 CST 复检github=200 OK
  • 可引用事实(≤35 字 / 条)
  • "Dataset and code are available at baiqi-li.github.io/timeblind_project"(verbatim,HuggingFace 镜像 + arXiv footer)
  • "data.jsonl 含 video_path / 互补问题对"(verbatim,flyP 精读 7-17 引用代码 README)
  • "Apache 2.0(推断 · 待 Tom 端 README 复核)"
  • 不可引用风险
  • W9 README 中 CLI 完整复现命令本次未单独抓取 · 引用代码数据可用,但完整 inference pipeline 未在 sources 中给出 verbatim
  • W11 GitHub 仓库 star 数 / commit 频率未单独抓取(避免「GitHub Trending #1」类夸大)

来源 4 · Yinghong Lan Substack · Long-Form Video Understanding Part 1

  • URLhttps://yinghonglan.substack.com/p/long-form-video-understanding-bottlenecks
  • 作者:Yinghong Lan(个人 Substack,video MLLM 学术背景,affiliation 待核验)
  • 可信度:⭐⭐⭐½ secondary(个人 Substack,但论点与 TimeBlind 学术高度吻合)
  • 2026-07-17 18:45 CST 复检substack=200 OK
  • 可引用事实(≤35 字 / 条)
  • "Memory axis · adaptive retrieval vs 压缩 KV-cache"(verbatim Part 1)
  • "Compute axis · agentic 多轮推理 vs 内化 agentic 进模型"(verbatim Part 1)
  • "评测瓶颈预告 Part 2 · 复杂度与依赖不可控"(verbatim Part 1)
  • 不可引用风险
  • W7 作者 Yinghong Lan affiliation 未在 Substack 公开 · 引用层级 = secondary
  • E4 "Substack 论证 TimeBlind 反捷径思路" = 互证而非引用关系(脚本作者推断)

来源 5 · flyP inbox 精读 · TimeBlind 短审稿

  • URL/shared/research-kb/inbox/flyp/2026-07-17-1550-TimeBlind-static-shortcuts-video-MLLM-critical-read.md
  • 作者:flyP(脚本作者内部精读)
  • 可信度:⭐⭐⭐⭐ primary(脚本作者内部精读 · 含原始 arXiv/项目页 verbatim 引用)
  • 2026-07-17 18:45 CST 复检:文件存在 · 路径可访问
  • 可引用事实(≤35 字 / 条)
  • "随机 Instance Accuracy 推算 = 0.25(两题各 50% × 50% = 25%)"(flyP 推算 + 论文 §2.4 Q1 复述)
  • "Q3 minimal-pairs 视频对构造可能用仿真引擎(Kubric / ThreeDWorld / Blender procgen)"(flyP 待核验)
  • "Q5 human baseline 98.2% 单点数字,未给人数与 inter-annotator agreement"(flyP 待核验)
  • 不可引用风险
  • W7 flyP 推算的 random baseline = 0.25 是基于 minimal-pairs 设计的数学推算 · 论文未显式给出
  • Q3 视频对构造方式 = flyP 推测非论文 verbatim · 标 E 类推断

来源 6 · AI HOT 12:00 旁证 · 多模态评测元方法学

  • URLhttps://aihot.virxact.com/(2026-07-17 12:00 CST 抓取 · /shared/hotlist/latest.md
  • 可信度:⭐⭐⭐ reputable(Hacker News / Moonshot AI / The Verge / VentureBeat 转述)
  • 2026-07-17 18:45 CST 复检:路径可访问
  • 可引用事实(≤35 字 / 条)
  • "Moonshot AI + Kimi 团队发布 PerceptionBench · 17 行 leaderboard 全员 <60%"(verbatim · AI HOT #4)
  • "Patter SDK 评测 + 护栏 + 回归式评估检查 · 现实对齐缺口"(verbatim · AI HOT #19)
  • 不可引用风险
  • W7 AI HOT 是中文资讯聚合站 · TimeBlind 直接条目未在 12:00 抓取批次出现
  • E3 "R2 07-17 PerceptionBench 与 R3 TimeBlind = 同一问题不同维度" = 脚本作者推断

来源汇总表

# URL 可信度 类型 复检 关键 verbatim
1 arxiv.org/abs/2602.00288 ⭐⭐⭐⭐⭐ official arXiv abs 200 OK 48.2% / 98.2% / 600 / 2400 / 20+ / 11 类
2 baiqi-li.github.io/timeblind_project/ ⭐⭐⭐⭐⭐ official 项目页 200 OK Stage 1/3 pipeline · 3-stage 核验
3 github.com/Baiqi-Li/TimeBlind ⭐⭐⭐⭐ primary 仓库 200 OK data.jsonl + video_path + 互补问题对
4 yinghonglan.substack.com/...long-form-video-understanding-bottlenecks ⭐⭐⭐½ secondary Substack 200 OK Memory axis · 复杂度不可控
5 flyP inbox 2026-07-17-1550 精读 ⭐⭐⭐⭐ primary 内部精读 文件可访问 random baseline = 0.25 推算 · Q3 仿真待核验
6 aihot.virxact.com(hotlist/latest.md) ⭐⭐⭐ reputable 聚合站 路径可访问 PerceptionBench 17 行 leaderboard <60%

6/6 主源命中 · 200 OK 占比 = 5/6 = 83.3% · primary/official 占比 = 4/6 = 66.7%


W 类不可引用风险汇总(连续 19 轮 · 必续)

  • W1 单源依赖:Bertasius 组一面 · 若 arXiv 2602.00288v3 撤稿 → 整体失效
  • W2 48.2% Instance Accuracy 推算 random baseline = 0.25(非 50%)· 显式 verbatim 引用
  • W3 评测规则 prompt 完整版补充材料未公开
  • W4 重复提问准确率置信区间 / 子难度分布官方未公开
  • W5 商业部署案例未公开
  • W6 与 BLINK / Blind-Spots-Bench / PerceptionBench 无 head-to-head
  • W7 MIT/CMU 引用层级 + Substack 作者 affiliation + AI HOT 旁证层级 = 引用关系层级需显式标注
  • W8 2400 题子难度分布官方未公开
  • W9 评测脚本命令行参数差异未公开
  • W10 商业影响 = 脚本作者推断
  • W11 GitHub 仓库 star / fork / issue 数未单独抓取
  • W12(本轮新增)MIT/CMU 引用层级 = 脚本作者推断(UNC 主投稿非三方合作)

E 类推断 verbatim 汇总(连续 19 轮 · 必续)

  • E1 "TimeBlind 解决了 video MLLM 评测根本问题" = 脚本作者推断
  • E2 "Gemini 3 Pro vs 人类 50% gap 是 SOTA 评测最差之一" = 脚本作者推断
  • E3 "related to R2 07-17 PerceptionBench = 同一问题不同维度" = 脚本作者推断
  • E4 "Winoground 类方法学可直接复用到 video MLLM 评测" = 脚本作者推断
  • E5 "TimeBlind 2026-01 上线会重塑 video MLLM 后续训练 pipeline" = 脚本作者推断
  • E6(本轮新增)"ratchets up the importance of evaluation methodology" = 脚本作者推断

partial_sources fallback 状态

  • statuscomplete(6 主源 ≥ 3 阈值 · primary/official ≥ 4 ≥ 2/3 阈值)
  • 缺口标注
  • W7/W12 Substack 作者 affiliation + 三机构合作贡献量层级未显式公开 · 转 W 类风险标注
  • W11 GitHub 仓库 star / fork / issue 数未单独抓取 · 避免「GitHub Trending」夸大
  • 不影响本轮 status=complete