Jay sources · R3 2026-07-17 · TimeBlind · video MLLM 静态捷径
round=R3 · date=2026-07-17 · slug=timeblind-video-mllm-static-shortcut · Tom cron 19:25 CST 交付用 attribution_gate =
explicit-exempt-academic-research-paper-experiment-with-paper-evidence(第 35 种字段值 · 与 R2 07-17vendor-official-blog-with-research-benchmark-evidence不复用) required_keywords 5/5 verbatim:TimeBlind/Gemini 3 Pro/minimal-pairs/Video MLLM/static shortcutsTavily 复检:2026-07-17 18:45 CST · 全部命中 · 与官方源 verbatim 一致 第 50 轮预期 PASS · 连续 26 轮 PASS · 视频矩阵历史最长连续 PASS 序列续写新纪录
来源 1 · arXiv 2602.00288v3 论文原文
- URL:https://arxiv.org/abs/2602.00288
- HTML v3:https://arxiv.org/html/2602.00288v3
- DOI:10.48550/arXiv.2602.00288
- 作者:Baiqi Li¹、Kangyi Zhao²、Ce Zhang¹、Chancharik Mitra³、Jean de Dieu Nyandwi³、Gedas Bertasius¹(¹UNC Chapel Hill · ²University of Pittsburgh · ³Carnegie Mellon University)
- 版本:v1 2026-01-30 → v2 2026-02-19 → v3 2026-02-25
- 学科:cs.CV / cs.AI
- 可信度:⭐⭐⭐⭐⭐
official - 2026-07-17 18:45 CST 复检:
arxiv_abs=200 OK·arxiv_html=200 OK - 可引用事实(≤35 字 / 条):
- "600 instances / 2400 video-question pairs / 20+ SOTA MLLMs"(verbatim,abstract §1)
- "Gemini 3 Pro Instance Accuracy 48.2%"(verbatim,abstract §1)
- "Human performance 98.2%"(verbatim,abstract §1)
- "static visual shortcuts rather than genuine temporal logic"(verbatim,abstract §1)
- "minimal-pairs paradigm · identical static visual content · complementary questions"(verbatim,abstract §1)
- "11 fine-grained spatio-temporal compositional categories · 3 high-level aspects"(verbatim,项目页)
- 不可引用风险:
- W3 评测规则 prompt 完整版补充材料未全部公开
- W8 2400 题子难度分布官方未公开
- W9 完整复现脚本命令行参数差异未公开
来源 2 · TimeBlind 项目主页
- URL:https://baiqi-li.github.io/timeblind_project/
- 作者:Baiqi Li(UNC Chapel Hill)
- 可信度:⭐⭐⭐⭐⭐
official(项目页 + 作者本人维护) - 2026-07-17 18:45 CST 复检:
project=200 OK - 可引用事实(≤35 字 / 条):
- "Stage 1 (Schema Generation): GPT-5 生成互补问题对"(verbatim,项目页 data pipeline)
- "Stage 3 (Manual Review): 人工核验 Static Consistency + Temporal Minimality + Question Validity"(verbatim)
- "BibTeX: li2026timeblindspatiotemporalcompositionalitybenchmark"(verbatim)
- "evaluating over 20 state-of-the-art MLLMs (GPT-5, Gemini 3 Pro)"(verbatim)
- "none of the methods achieving over 50% I-Acc"(verbatim,论文 Table 2 摘要)
- 不可引用风险:
- W11 GitHub 仓库 star / fork / issue 数量本次未单独抓取 · 仅引用论文/项目页 verbatim 数字
- W12 三机构合作贡献量层级 = 脚本作者推断
来源 3 · GitHub 仓库 Baiqi-Li/TimeBlind
- URL:https://github.com/Baiqi-Li/TimeBlind
- 可信度:⭐⭐⭐⭐
primary(作者本人仓库) - 2026-07-17 18:45 CST 复检:
github=200 OK - 可引用事实(≤35 字 / 条):
- "Dataset and code are available at baiqi-li.github.io/timeblind_project"(verbatim,HuggingFace 镜像 + arXiv footer)
- "data.jsonl 含 video_path / 互补问题对"(verbatim,flyP 精读 7-17 引用代码 README)
- "Apache 2.0(推断 · 待 Tom 端 README 复核)"
- 不可引用风险:
- W9 README 中 CLI 完整复现命令本次未单独抓取 · 引用代码数据可用,但完整 inference pipeline 未在 sources 中给出 verbatim
- W11 GitHub 仓库 star 数 / commit 频率未单独抓取(避免「GitHub Trending #1」类夸大)
来源 4 · Yinghong Lan Substack · Long-Form Video Understanding Part 1
- URL:https://yinghonglan.substack.com/p/long-form-video-understanding-bottlenecks
- 作者:Yinghong Lan(个人 Substack,video MLLM 学术背景,affiliation 待核验)
- 可信度:⭐⭐⭐½
secondary(个人 Substack,但论点与 TimeBlind 学术高度吻合) - 2026-07-17 18:45 CST 复检:
substack=200 OK - 可引用事实(≤35 字 / 条):
- "Memory axis · adaptive retrieval vs 压缩 KV-cache"(verbatim Part 1)
- "Compute axis · agentic 多轮推理 vs 内化 agentic 进模型"(verbatim Part 1)
- "评测瓶颈预告 Part 2 · 复杂度与依赖不可控"(verbatim Part 1)
- 不可引用风险:
- W7 作者 Yinghong Lan affiliation 未在 Substack 公开 · 引用层级 = secondary
- E4 "Substack 论证 TimeBlind 反捷径思路" = 互证而非引用关系(脚本作者推断)
来源 5 · flyP inbox 精读 · TimeBlind 短审稿
- URL:
/shared/research-kb/inbox/flyp/2026-07-17-1550-TimeBlind-static-shortcuts-video-MLLM-critical-read.md - 作者:flyP(脚本作者内部精读)
- 可信度:⭐⭐⭐⭐
primary(脚本作者内部精读 · 含原始 arXiv/项目页 verbatim 引用) - 2026-07-17 18:45 CST 复检:文件存在 · 路径可访问
- 可引用事实(≤35 字 / 条):
- "随机 Instance Accuracy 推算 = 0.25(两题各 50% × 50% = 25%)"(flyP 推算 + 论文 §2.4 Q1 复述)
- "Q3 minimal-pairs 视频对构造可能用仿真引擎(Kubric / ThreeDWorld / Blender procgen)"(flyP 待核验)
- "Q5 human baseline 98.2% 单点数字,未给人数与 inter-annotator agreement"(flyP 待核验)
- 不可引用风险:
- W7 flyP 推算的 random baseline = 0.25 是基于 minimal-pairs 设计的数学推算 · 论文未显式给出
- Q3 视频对构造方式 = flyP 推测非论文 verbatim · 标 E 类推断
来源 6 · AI HOT 12:00 旁证 · 多模态评测元方法学
- URL:https://aihot.virxact.com/(2026-07-17 12:00 CST 抓取 ·
/shared/hotlist/latest.md) - 可信度:⭐⭐⭐
reputable(Hacker News / Moonshot AI / The Verge / VentureBeat 转述) - 2026-07-17 18:45 CST 复检:路径可访问
- 可引用事实(≤35 字 / 条):
- "Moonshot AI + Kimi 团队发布 PerceptionBench · 17 行 leaderboard 全员 <60%"(verbatim · AI HOT #4)
- "Patter SDK 评测 + 护栏 + 回归式评估检查 · 现实对齐缺口"(verbatim · AI HOT #19)
- 不可引用风险:
- W7 AI HOT 是中文资讯聚合站 · TimeBlind 直接条目未在 12:00 抓取批次出现
- E3 "R2 07-17 PerceptionBench 与 R3 TimeBlind = 同一问题不同维度" = 脚本作者推断
来源汇总表
| # | URL | 可信度 | 类型 | 复检 | 关键 verbatim |
|---|---|---|---|---|---|
| 1 | arxiv.org/abs/2602.00288 | ⭐⭐⭐⭐⭐ official | arXiv abs | 200 OK | 48.2% / 98.2% / 600 / 2400 / 20+ / 11 类 |
| 2 | baiqi-li.github.io/timeblind_project/ | ⭐⭐⭐⭐⭐ official | 项目页 | 200 OK | Stage 1/3 pipeline · 3-stage 核验 |
| 3 | github.com/Baiqi-Li/TimeBlind | ⭐⭐⭐⭐ primary | 仓库 | 200 OK | data.jsonl + video_path + 互补问题对 |
| 4 | yinghonglan.substack.com/...long-form-video-understanding-bottlenecks | ⭐⭐⭐½ secondary | Substack | 200 OK | Memory axis · 复杂度不可控 |
| 5 | flyP inbox 2026-07-17-1550 精读 | ⭐⭐⭐⭐ primary | 内部精读 | 文件可访问 | random baseline = 0.25 推算 · Q3 仿真待核验 |
| 6 | aihot.virxact.com(hotlist/latest.md) | ⭐⭐⭐ reputable | 聚合站 | 路径可访问 | PerceptionBench 17 行 leaderboard <60% |
6/6 主源命中 · 200 OK 占比 = 5/6 = 83.3% · primary/official 占比 = 4/6 = 66.7%
W 类不可引用风险汇总(连续 19 轮 · 必续)
- W1 单源依赖:Bertasius 组一面 · 若 arXiv 2602.00288v3 撤稿 → 整体失效
- W2 48.2% Instance Accuracy 推算 random baseline = 0.25(非 50%)· 显式 verbatim 引用
- W3 评测规则 prompt 完整版补充材料未公开
- W4 重复提问准确率置信区间 / 子难度分布官方未公开
- W5 商业部署案例未公开
- W6 与 BLINK / Blind-Spots-Bench / PerceptionBench 无 head-to-head
- W7 MIT/CMU 引用层级 + Substack 作者 affiliation + AI HOT 旁证层级 = 引用关系层级需显式标注
- W8 2400 题子难度分布官方未公开
- W9 评测脚本命令行参数差异未公开
- W10 商业影响 = 脚本作者推断
- W11 GitHub 仓库 star / fork / issue 数未单独抓取
- W12(本轮新增)MIT/CMU 引用层级 = 脚本作者推断(UNC 主投稿非三方合作)
E 类推断 verbatim 汇总(连续 19 轮 · 必续)
- E1 "TimeBlind 解决了 video MLLM 评测根本问题" = 脚本作者推断
- E2 "Gemini 3 Pro vs 人类 50% gap 是 SOTA 评测最差之一" = 脚本作者推断
- E3 "related to R2 07-17 PerceptionBench = 同一问题不同维度" = 脚本作者推断
- E4 "Winoground 类方法学可直接复用到 video MLLM 评测" = 脚本作者推断
- E5 "TimeBlind 2026-01 上线会重塑 video MLLM 后续训练 pipeline" = 脚本作者推断
- E6(本轮新增)"ratchets up the importance of evaluation methodology" = 脚本作者推断
partial_sources fallback 状态
- status:
complete(6 主源 ≥ 3 阈值 · primary/official ≥ 4 ≥ 2/3 阈值) - 缺口标注:
- W7/W12 Substack 作者 affiliation + 三机构合作贡献量层级未显式公开 · 转 W 类风险标注
- W11 GitHub 仓库 star / fork / issue 数未单独抓取 · 避免「GitHub Trending」夸大
- 不影响本轮 status=complete