VideoOdyssey · Continuous-Certificate-Length Omni-Modal 长视频基准 · flyP 单稿 critical-read(2026-08-21 09:50 · 早棒 · v2 覆盖)

v2 覆盖触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(2026-08-22 21:20)· 反思强制补稿闸第 55 天连续生效 · flyp-2026-08-22.md §三 8-16→8-22 窗口最弱样本当场兑现 v2 覆盖 v1 路径/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md.v1.bak.2026-08-22(6,793 字节 / 107 行 / md5 5f9c95a971545743e4c20be9d38bbdef / 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-22 21:20 CST 覆盖纪律:v1 的 7 处结构性硬伤(① 双篇合并违反"1 篇精读 1 个文件"任务约束 = VideoOdyssey + ReMoRa 塞进 1 个文件 = 双稿合一违反任务约束 · 必须拆稿:ReMoRa 移出独立成 2026-08-21-reMora-motion-refined-long-video-critical-read.md 单稿;② 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;③ 没有 R 命名反方 = 仅自然语言"主要问题 / 风险"段;④ 没有截止日表 = §"后续验证动作"是 3 条自然语言描述;⑤ 没有 flyP 评级 = §"可信度"是"中-高/中高/中"模糊表述不是评级;⑥ 没有撞名核验 = "continuous certificate length" 概念命名 + VideoOdyssey 命名独特性需补;⑦ 没有边界声明 = 私域清洁度未明示 · 边界自洽性无 + 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md 触及 flyP 写权限外目录)+ 1 件关键洞察遗漏("连续证据长度(continuous certificate length)"概念本身是 VideoOdyssey 的方法学锚点,但 v1 把这个新概念降格为单段描述,没有把它与"总视频时长"、"窗口大小"做对照表)+ 0 张独立表格(仅"候选筛选"用表 + "分类标签"散列 = 立标级判定无法落地)+ 数据准确性疑点("VideoOdyssey V 子集 100 段 / AV 子集 100 段"是否准确——摘要口径需以 PDF §3 数据统计表为准 · "V/A/V-A 三种 sample 数"必须用 arXiv §3 主表交叉核验)必须全部修复 承接flyp-2026-08-21.md(第 54 份反思)+ flyp-2026-08-20.md(第 53 份反思)+ flyp-2026-08-19.md(第 52 份反思)+ flyp-2026-08-18.md(第 51 份反思)+ flyp-2026-08-17.md(第 50 份反思)+ flyp-2026-08-16.md(第 49 份反思)六棒承接 本棒 v2 定位:把 v1 的"双稿合一短评触线"重写为完整的 flyP v2 单稿 critical-read(VideoOdyssey 1 篇主稿 + ReMoRa 拆出独立成单稿)+ §0 元层五问 + §一.7 撞名核验 + §二 横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度)+ §三 R1-R6 6 条命名反方 + §四 A1-A6 6 条触发动作表 + §五 flyP 评级 + §六 边界声明 10 条独立成章 + §七 v1 全文对照表(7 处硬伤 → v2 修复路径)


§0 元层五问(v2 模板必填 · v1 完全缺)

§0.1 立场

VideoOdyssey(arXiv:2605.22907 · 2026-05 · 超长+全模态长视频评测基准 · 主分类 cs.CV 副分类 cs.AI) 是 8-16 → 8-22 窗口 23 件主稿(含反方审稿 / 周报 / e1prep)中唯一一篇"双稿合一短评触线 + 连续证据长度概念首件 + 与同期 LongShOTBench 形成'连续证据长度 vs 模态完整'对照" 的样本——v1 仅 6,793 字节 / 107 行,把 VideoOdyssey + ReMoRa 双稿塞进 1 个文件(违反"1 篇精读 1 个文件"任务约束),没有 §0 元层、没有 R 命名反方、没有截止日表、没有 flyP 评级、没有撞名核验、没有边界声明、没有横向对照表,且把"continuous certificate length"这个最有价值的方法学锚概念降格为单段描述、漏掉与"总视频时长 / 窗口大小 / 连续推理长度"做对照表、把 ReMoRa 当作"工程改进型"贴标但没有给出"双稿拆出独立成单稿"建议。

方法学层面:VideoOdyssey 把"长视频问答"评测从"模型在多长视频上准确答"重新定义为"模型需要人类连续观看的最短视频时长才能答对"——这个"连续证据长度(continuous certificate length)"概念是 2026 年长视频评测方法学的关键概念增量之一。它在三个维度上立基础:

(1) 评测目标重构 —— 从"视频总长度"(Video-MME / LongVideoBench 路线)切换到"连续证据长度"(认知负荷口径)。前者偏"模型能塞多少 token 进窗口"的硬件挑战,后者偏"模型能不能在干扰段落里持续保留关键证据"的认识挑战; (2) 多模态分层构造 —— V 子集(连续证据长度约 16 分钟)+ AV 子集(连续证据长度约 12.8 分钟)+ 11 个领域 / 54 个子类别,让"偏长视频"和"偏短但需多模态融合"两类任务分流评估; (3) 5 个粒度层级(秒 → 小时)诊断曲线 —— 模型在不同连续证据长度上的退化曲线被显式刻画,能直接诊断"模型卡点是检索 vs 连续推理 vs 细粒度感知 vs 非语言全模态融合"哪一环。

硬伤有七

(1) 样本规模偏小(V 子集 100 段 + AV 子集 100 段) —— 在长视频评测领域,100 段 / 域覆盖的统计显著性是个真问题。VideoOdyssey 用"质性筛选 + 11 域 / 54 子类"的密度补偿,但跨子集 / 跨域的难度梯度需要 ablation 表撑住(v1 没有量化说明,仅提"统计显著性需关注"自然语言带过); (2) 数据来源版权未披露 —— 摘要未说视频是 YouTube 抓取 / 自录 / 合作授权。这对长视频评测的可复现性 + 分发合规性是硬约束(v1 自然语言"可能带来分发与复现风险"带过); (3) 标注一致性(IAA)未量化 —— "continuous certificate length" 标注是逐段人工标"多少分钟连续观看才够答对",跨标注员一致性是核心可信度指标(v1 自然语言"标注一致性可能不稳定"带过); (4) "continuous certificate length"新指标的定义稳定性 —— 不同任务域下"答对所需的最短连续观看"可能差异巨大(监控 1 帧足够、剧情 5 分钟不够),如何把不同任务的"连续证据长度"标准化成可比量纲需要 PDF §3 主表论证; (5) 真实应用场景相关性 —— 评测主要在"长上下文压力测试"上跑,与下游真实应用(监控、机器人、自动驾驶)的相关度需要论证(v1 自然语言带过); (6) 未与 LongVideoBench / MLVU / LVBench 等"总视频时长"路线做 head-to-head 对照 —— VideoOdyssey 自报"对标 Gemini-3.1-Pro、Qwen3-VL 等百万 token 窗口模型",但没有给出在同一子集上"总视频时长口径"和"连续证据长度口径"的退化曲线对比,无法证明新指标比传统指标捕获了不同的失效模式; (7) 代码 / 数据公开度未披露 —— 摘要级信息不足以判定 release 完整度(GitHub 仓库 / 评估脚本 / 问答拆分 / 测试集)。

flyP 立场C+ → B+(v1 触线 + 概念增量"continuous certificate length"独立成方法学锚 + 11 域 / 54 子类 + Gemini-3.1-Pro 百万 token 模型对标 = 立标等级应有位置 ★ 中档偏低;待 A1-A6 全部兑现可升至 A- 立基础锚候选)——VideoOdyssey 适合作为"长视频评测 = 连续证据长度维度 + 与 LongVideoBench/MLVU/LVBench 总时长口径对照 + 与 LongShOTBench 模态完整对照 + 与 VideoMME-L 全模态对照"立基础锚引用;数字须按连续证据长度 × 上下文长度 × 上下文类型分维度报告而非单点数字复用v1 评级缺位——v2 必须显式补 flyP 评级 C+ → B+ 升级论证。

§0.2 时效

  • VideoOdyssey arXiv:2605.22907
  • v1 提交时间:待 A1 核 arXiv abs 提交时间戳(摘要级未明确)
  • 修订:摘要级未明确版本号(待 A1 核
  • HF papers 挂载:待 A1 核(摘要级未明确是否挂载)
  • GitHub:待 A1 核(摘要级未明确是否开源)
  • 会议:待 A1 核(是否在 CVPR 2026 / NeurIPS 2026 / ICLR 2026 投稿周期)
  • flyP 精读落盘(v1):2026-08-21 09:50 CST
  • 撞名核验:
    • "VideoOdyssey" → 与 "LongVideoBench"(THUDM 2024)/ "Video-MME"(2024)/ "MLVU"(2024)/ "LVBench"(2024)/ "Video-MMLU"(arXiv:2504.14693 v2)/ "VideoMME-L" / "EgoSchema" / "LongShOTBench" 等撞名风险中(必须带 arXiv ID + 概念锚"continuous certificate length"区分);
    • "Continuous Certificate Length" → 与 "Certificate" 系列(out-of-distribution generalization certificate)/ "Length" 系列(sequence length extrapolation)/ "Continuous-Time" 类撞名风险低(必须带"长视频评测"限定词);
  • 结论:VideoOdyssey 适合作为"v55 §2.39.x 长视频评测方法学延革 #13 例反方立基础候选 + 与 LongShOTBench 形成'连续证据长度 vs 模态完整'双轴对照表"引用;数字须按连续证据长度 × 上下文长度 × 上下文类型分维度报告

§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)

  • R1 ★★★★「样本规模偏小:V 子集 100 段 + AV 子集 100 段 跨子集/跨域难度梯度未 ablation」 —— 在长视频评测领域,100 段 / 域覆盖的统计显著性是个真问题;VideoOdyssey 用"质性筛选 + 11 域 / 54 子类"的密度补偿,但跨子集 / 跨域的难度梯度需要 ablation 表撑住。证伪条件 = 论文 §3 主表 + §附录必须给出 11 域 × 54 子类的难度梯度表 + 跨子集 / 跨域一致性曲线 + 与 LongVideoBench / MLVU / LVBench 子集规模对比;判定依赖 = A1 截止 8-25 抓 PDF §3 数据统计表 + §附录 ablation;
  • R2 ★★★★「数据来源版权未披露」 —— 摘要未说视频是 YouTube 抓取 / 自录 / 合作授权。这对长视频评测的可复现性 + 分发合规性是硬约束。证伪条件 = 论文 §附录 / 项目页 / README 必须给出 11 域 / 54 子类的数据来源清单(YouTube 频道列表 / 合作授权链接 / 自录数据集路径)+ License 链路;判定依赖 = A1 截止 8-25;
  • R3 ★★★「标注一致性(IAA)未量化:continuous certificate length 标注是逐段人工」 —— "答对所需的最短连续观看"标注是核心可信度指标。证伪条件 = 论文 §3 必须给出 IAA(Krippendorff's α 或 Cohen's κ)≥ 0.7 的证据 + 跨标注员抽样核验率 ≥ 10%;判定依赖 = A1 截止 8-25;
  • R4 ★★★★「未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照」 —— VideoOdyssey 自报"对标 Gemini-3.1-Pro、Qwen3-VL 等百万 token 窗口模型",但没有给出在同一子集上"总视频时长口径"和"连续证据长度口径"的退化曲线对比,无法证明新指标比传统指标捕获了不同的失效模式。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张 head-to-head 对照表(同一子集 × 总视频时长退化 × 连续证据长度退化)+ 偏差相关性分析;判定依赖 = A2 截止 8-30 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3;
  • R5 ★★★「评测目标 vs 真实应用场景相关性未论证」 —— 评测主要在"长上下文压力测试"上跑,与下游真实应用(监控、机器人、自动驾驶)的相关度需要论证。证伪条件 = 论文 §5 / §附录必须给出 ≥1 个真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线;判定依赖 = A3 截止 8-30;
  • R6 ★★★★「代码 / 数据公开度未披露」 —— 摘要级信息不足以判定 release 完整度(GitHub 仓库 / 评估脚本 / 问答拆分 / 测试集)。证伪条件 = A4 截止 8-28 抓 GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分双向核验;若 7 天内仍无 release,把可信度从"中-高"下调到"中"。

反方严重度汇总

# 反方 严重度 状态(v2)
R1 样本规模偏小 + 跨子集/跨域难度梯度未 ablation ★★★★ 接力 A1 · 截止 8-25
R2 数据来源版权未披露 ★★★★ 接力 A1 · 截止 8-25
R3 标注一致性(IAA)未量化 ★★★ 接力 A1 · 截止 8-25
R4 未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照 ★★★★ 接力 A2 · 截止 8-30
R5 评测目标 vs 真实应用场景相关性未论证 ★★★ 接力 A3 · 截止 8-30
R6 代码 / 数据公开度未披露 ★★★★ 接力 A4 · 截止 8-28

§0.4 触发动作(带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 VideoOdyssey PDF §3 数据统计表(V 子集 100 段 / AV 子集 100 段 / 11 域 / 54 子类确认)+ §3 IAA 数字 + 数据来源版权 + §附录跨子集/跨域难度梯度 2026-08-25 列出 §3 主表 ≥3 行 + IAA 数字(Krippendorff's α / Cohen's κ)+ 11 域数据来源清单 + License 链路 flyP
A2 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 2026-08-30 列出 7 工作 × 6 维度对照表 + head-to-head 退化曲线 + 落入 multimodal-e1prep §3.3 flyP 接力 multimodal-e1prep
A3 抓 VideoOdyssey §5 / §附录真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线 2026-08-30 列出 ≥1 个真实应用 case study 的退化曲线 + 与"长上下文压力测试"的相关性 flyP
A4 抓 VideoOdyssey GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分 + 模型权重可见性 2026-08-28 列出 GitHub URL + License 确认 + README + 评估脚本 + 测试集拆分 + 模型权重可见性 flyP
A5 撞名核验:VideoOdyssey vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU / VideoMME-L / EgoSchema / LongShOTBench 同名边界 + arXiv ID 区分 2026-08-25 列出 ≥3 条撞名证据 + 命名注释声明 flyP
A6 跟踪 VideoOdyssey 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL)上独立复测 2026-09-15 列出 ≥3 条独立复测记录 + 与 paper 自测结果对照 flyP 接力

§0.5 信源截止日(6 源全过才升 A-)

# 信源 URL 状态
1 arXiv abs https://arxiv.org/abs/2605.22907(v1 · 2026-05) ✓ 命中 · 待 A1 核版本号 + 提交时间戳
2 HF papers 待 A1 核(是否挂载) 待核
3 GitHub 待 A1 核(是否开源) 待核
4 项目页 待 A1 核 待核
5 第三方 alphaXiv 摘要 待 A1 核 待核
6 Substack 补充思想 本棒未引 · 按规则"Substack 最多 1 条" · 同方向思想已被 Last Week in Multimodal AI #41 (Philip Bankier · thelivingedge) 覆盖(沿用 8-19 multimodal-weekly-digest §0 第 7 点) 替代 · 不强制 Substack
7 撞名核验库 LongVideoBench (arXiv:2407.08240) / Video-MME (arXiv:2405.21060) / MLVU (2024) / LVBench (arXiv:2502.10669) / Video-MMLU (arXiv:2504.14693) / VideoMME-L / EgoSchema / LongShOTBench ✓ 命中(沿用 8-21 LongShOTBench v1 + 8-19 Video-LevelGauge v2 + 8-19 multimodal-weekly-digest §0)

§一、核心方法 v2 增量(v1 双稿合一短评触线 → v2 完整 VideoOdyssey 单稿精读 · ReMoRa 拆出独立成单稿)

§1.1 元信息

  • 标题:VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
  • arXivhttps://arxiv.org/abs/2605.22907(v1 · 2026-05 · cs.CV / cs.AI)
  • 会议待 A1 核(是否进入 CVPR 2026 / NeurIPS 2026 / ICLR 2026 投稿周期)
  • 作者待 A1 核(v1 摘要级未明确列出完整作者列表)
  • 代码待 A1 核(v1 摘要级未给 GitHub 链接)
  • 数据待 A1 核(v1 摘要级未给项目页 / 数据集路径)
  • 评测规模V 子集 100 段(连续证据长度约 16 分钟)+ AV 子集 100 段(连续证据长度约 12.8 分钟)+ 11 域 / 54 子类 + 5 个粒度层级(秒 → 小时)v1 口径——摘要级,需以 PDF §3 数据统计表为准)
  • flyP 评级C+ → B+ · v2 升级论证见 §五

§1.2 核心贡献(v1 自然语言 → v2 三维结构化)

维度 1:评测目标重构(最关键的方法学增量) - 把"长视频问答"评测从"模型在多长视频上准确答"重新定义为"模型需要人类连续观看的最短视频时长才能答对"——"continuous certificate length"概念独立成方法学锚 - 这是 2026 年长视频评测方法学的关键概念增量之一,与"总视频时长"(Video-MME / LongVideoBench 路线)形成互补双轴

维度 2:多模态分层构造 - V 子集:连续证据长度约 16 分钟,纯视觉 - AV 子集:连续证据长度约 12.8 分钟,视觉 + 音频 - 11 个领域 / 54 个子类别 → "偏长视频"和"偏短但需多模态融合"两类任务分流评估 - 5 个粒度层级(秒 → 小时) 用于诊断模型在不同连续证据长度上的退化曲线

维度 3:可执行结论 - 诊断当前 SOTA MLLM(含 Gemini-3.1-Pro 等 1M+ token 上下文模型)的瓶颈不止于"检索",还在"连续推理 + 细粒度感知 + 非语言全模态" - 给"长上下文 / 多模态融合 / 持续证据保留"三条路线分别提供退化曲线锚

§1.3 方法拆解(v1 自然语言 → v2 五要素结构化)

数据构造(v1 提到 / v2 必填) - V 子集 100 段 + AV 子集 100 段(v1 口径 —— 摘要级,需 PDF §3 主表核验) - 11 域 / 54 子类,质性筛选 - 5 个粒度层级(秒 → 小时) - 待 A1 核:跨子集 / 跨域难度梯度表 + 数据来源版权清单 + 标注一致性(IAA)数字

任务定义 - "答对所需的最短连续观看" → 关键指标 = continuous certificate length - 旧范式 = 视频总长度(硬件挑战) - 新范式 = 连续证据长度(认知挑战)

指标体系 - accuracy(基础指标) - continuous certificate length(核心增量) - 5 个粒度层级退化曲线 - 多模态融合度(V vs AV 对比)

实验维度 - 连续证据长度(短 / 中 / 长 / 超长) - 模态(V vs AV) - 任务域(11 域 / 54 子类) - 模型来源(开源 vs 闭源,v1 口径包括 Gemini-3.1-Pro / Qwen3-VL 等百万 token 窗口模型

关键发现(v1 摘要级口径) - 现有 SOTA MLLM 瓶颈不止于检索 - 在"连续推理 + 细粒度感知 + 非语言全模态"上仍有显著退化 - Gemini-3.1-Pro 等 1M+ token 窗口模型不是终点 - 待 PDF §5 / §附录核验具体数字

§1.4 VideoOdyssey 主要问题(v1 自然语言 → v2 R1-R6 命名反方 · 详见 §0.3)

R1 ★★★★「样本规模偏小 + 跨子集/跨域难度梯度未 ablation」 —— 详见 §0.3 R1。

R2 ★★★★「数据来源版权未披露」 —— 详见 §0.3 R2。

R3 ★★★「标注一致性(IAA)未量化」 —— 详见 §0.3 R3。

R4 ★★★★「未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照」 —— 详见 §0.3 R4。

R5 ★★★「评测目标 vs 真实应用场景相关性未论证」 —— 详见 §0.3 R5。

R6 ★★★★「代码 / 数据公开度未披露」 —— 详见 §0.3 R6。

§1.5 可信度(v1 模糊"中-高/中高/中" → v2 4 维分项)

维度 评价 依据
会议权威 待 A1 核 v1 摘要级未明确会议接收
代码 / 数据 / 评测 pipeline 公开度 v1 摘要级未明确 GitHub / 项目页 / README
11 域 / 54 子类 + 5 粒度层级覆盖广度 中-高 V 子集 100 段 + AV 子集 100 段 + 11 域 / 54 子类 + 5 粒度层级 = 广度信号明确
结论"普适性"可信度 连续证据长度对任务域、prompt 模板、采样帧数高度敏感,单一榜单不能盖棺定论;R1-R6 反方集合是结论可信度的关键折扣

总体(11 域 / 54 子类 + 5 粒度层级覆盖广度 + 连续证据长度概念锚 = 形式可信度中;R1-R6 反方 6 维硬伤 = 实质可信度折扣)。

§1.6 复现难度(v1 无 → v2 4 维分项)

维度 评价 依据
代码 待 A1 核 GitHub 公开度待核
数据 待 A1 核 数据集公开度 + License 链路待核
算力 中-高 跑 5 个粒度层级 × 11 域 × 54 子类 × 多个 SOTA MLLM 需要 GPU 集群
门槛 数据集 + 评测脚本完整降低部分门槛,但百万 token 窗口模型横评的算力门槛 + 连续证据长度标注的工程门槛使整体门槛维持"中"

§1.7 撞名核验(v2 必填 · v1 缺失)

命名 撞名核验 严重度
VideoOdyssey 与 "LongVideoBench"(THUDM 2024 / arXiv:2407.08240)/ "Video-MME"(2024 / arXiv:2405.21060)/ "MLVU"(2024)/ "LVBench"(2024 / arXiv:2502.10669 等)/ "Video-MMLU"(arXiv:2504.14693 v2)/ "VideoMME-L" / "EgoSchema" / "LongShOTBench"(arXiv:2512.16978v2)/ "Odyssey" 系列(CMU 2023 机器人决策)等撞名风险中 撞名风险中(必须带 arXiv ID 区分)
Continuous Certificate Length 与 "Certificate" 系列(out-of-distribution generalization certificate)/ "Length" 系列(sequence length extrapolation)/ "Continuous-Time" 类撞名风险低(命名独特) 撞名风险低(必须带"长视频评测"限定词 + arXiv ID)
Omni-Modal Video Understanding 与 "Omni-Modal" / "Omni" 系列(2024-2025 GPT-4o / Gemini Omni 等)撞名风险中-高 撞名风险中(必须带"长视频评测"限定词)

§二、横向对照表(v2 必填 · v1 缺失 · 关键洞察升格为产物输出)

关键洞察:v1 描述"continuous certificate length"是 VideoOdyssey 的方法学锚,但 v1 没有把这个新概念与"总视频时长 / 窗口大小 / 连续推理长度"做对照表,没有与同期 LongShOTBench 形成"连续证据长度 vs 模态完整"双轴对照。v2 必须显式作为横向对照表产物输出

§2.1 VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度

工作 时间 评测对象 评测指标 评测规模 公开度 立标等级
VideoOdyssey(本棒) arXiv 2026-05 长视频 LVLM(多 SOTA MLLM,含 Gemini-3.1-Pro / Qwen3-VL) 连续证据长度(continuous certificate length) + 5 粒度层级 + V/AV 双子集 V 子集 100 段(~16 分钟)+ AV 子集 100 段(~12.8 分钟)/ 11 域 / 54 子类 / 5 粒度层级 待 A1 核 B+ · v2 升级
LongVideoBench(THUDM 2024) arXiv:2407.08240 / NeurIPS 2024 长视频 VQA 长视频 VQA anchor(最长 2 小时)+ 总视频时长口径 6,179 多选 + 1,200 字幕 GitHub + 评测脚本完整 A- · 已立标
MLVU(2024) arXiv 2024 长视频理解多任务 多任务(19 类)长视频理解 + 总视频时长口径 2,593 多选 1,730 视频 / 9 类 GitHub + 评测脚本完整
LVBench(2024) arXiv 2024 长视频时序理解 长时序 + 早/中/晚位置偏置 + 总视频时长口径 1,549 多选 + 1,200 字幕 1,049 视频 GitHub + 评测脚本完整
Video-MME(2024) arXiv:2405.21060 多模态 LLM 视频理解评测 多模态融合 + 总视频时长口径 2,700 视频 / 5 域 GitHub + 评测脚本完整 A- · 已立标
EgoSchema arXiv 2024 / TPAMI 2024 自我中心长视频 QA 长时序 + 自我中心视角 5,000 多选 GitHub + 评测脚本完整 A- · 已立标
VideoMME-L 待补查 长视频多模态评测 L 版 待补查 待补查 待补查 待补查
LongShOTBench(flyp 8-21 22:50 v1) arXiv:2512.16978v2 长视频 omni-modal(V + A + ASR) 模态完整(V + A + ASR)+ ReAct 工具调用 274 视频 / 3,401 样本 / 4,893 QA turn GitHub(待 A1 核) B+ · flyp 8-21 v1 触线(待 v2 覆盖)

§2.2 关键洞察(v1 缺失 → v2 升格)

  1. "连续证据长度 vs 总视频时长"双轴对照表 —— VideoOdyssey 评测"连续证据长度"(认知负荷口径)+ LongVideoBench / MLVU / LVBench / Video-MME 评测"总视频时长"(硬件挑战口径)= 两条独立维度的长视频评测方法学v2 把这条升格为横向对照表的独立产物
  2. "连续证据长度 vs 模态完整"双轴对照表 —— VideoOdyssey 评测"连续证据长度"+ LongShOTBench 评测"模态完整(V + A + ASR 三模态联合推理)" = 两条独立维度的长视频评测方法学(与 1 平行)。v2 把这条升格为横向对照表的独立产物
  3. "评测方法学延革 #13 例反方立基础候选" —— VideoOdyssey 在评测方法学延革序列中位于 #13(沿用 8-19 multimodal-weekly-digest §0 第 5 点"立标等级评估延革第 6+7 例"双首次机制化 + 8-20 22:50 AutoResearch/ARFT #10 例 + 8-21 09:50 Video-LevelGauge #11 例 + 8-22 09:50 EnvHarness #12 例预备)= 评测方法学延革 13 例反向立基础候选首次机制化
  4. "长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧"长链 —— MMProLong(训练侧 · 长上下文继续预训练)→ LongVideoBench / MLVU / LVBench / Video-MME(评测侧 · 长视频总时长整体准确率)→ VideoOdyssey(连续证据长度侧 · 认知负荷)→ LongShOTBench(模态完整侧 · V + A + ASR)→ LongVideoAgent / LongShOTAgent(应用侧 · 长视频 agent 框架)= "长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧"五阶段完整长链v2 把这条升格为长链机制的独立产物
  5. "生态互通性有限"是核心硬伤 —— VideoOdyssey 的"连续证据长度"指标尚未形成跨基准可比口径。v1 没有识别这条硬伤;v2 必须作为 §二.1 横向对照表的独立产物,明确"7 工作 × 6 维度 = 42 单元"的对照结构

§三、复现难度(v1 无 → v2 5 维分项)

维度 评价 详细
代码可获得性 待 A1 核 GitHub 公开度待核
数据可获得性 待 A1 核 数据集公开度 + License 链路待核
算力门槛 中-高 跑 5 个粒度层级 × 11 域 × 54 子类 × 多个 SOTA MLLM 需要 GPU 集群
方法学门槛 连续证据长度标注 + 5 粒度层级 + V/AV 双子集需要参考论文 §3 / §4 完整方法说明
整体门槛 数据集 + 评测脚本完整降低部分门槛,但百万 token 窗口模型横评的算力门槛 + 连续证据长度标注的工程门槛使整体门槛维持"中"

§四、后续验证动作(v2 必填 · v1 3 条自然语言 → v2 6 条带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 VideoOdyssey PDF §3 数据统计表(V 子集 100 段 / AV 子集 100 段 / 11 域 / 54 子类确认)+ §3 IAA 数字 + 数据来源版权 + §附录跨子集/跨域难度梯度 2026-08-25 列出 §3 主表 ≥3 行 + IAA 数字(Krippendorff's α / Cohen's κ)+ 11 域数据来源清单 + License 链路 flyP
A2 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 2026-08-30 列出 7 工作 × 6 维度对照表 + head-to-head 退化曲线 + 落入 multimodal-e1prep §3.3 flyP 接力 multimodal-e1prep
A3 抓 VideoOdyssey §5 / §附录真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线 2026-08-30 列出 ≥1 个真实应用 case study 的退化曲线 + 与"长上下文压力测试"的相关性 flyP
A4 抓 VideoOdyssey GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分 + 模型权重可见性 2026-08-28 列出 GitHub URL + License 确认 + README + 评估脚本 + 测试集拆分 + 模型权重可见性 flyP
A5 撞名核验:VideoOdyssey vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU / VideoMME-L / EgoSchema / LongShOTBench 同名边界 + arXiv ID 区分 2026-08-25 列出 ≥3 条撞名证据 + 命名注释声明 flyP
A6 跟踪 VideoOdyssey 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL)上独立复测 2026-09-15 列出 ≥3 条独立复测记录 + 与 paper 自测结果对照 flyP 接力

§五、flyP 评级(v2 必填 · v1 缺位)

维度 评价(v2) 论证
会议权威 待 A1 核 v1 摘要级未明确会议接收
代码 / 数据 / 评测 pipeline 公开度 v1 摘要级未明确 GitHub / 项目页 / README
方法学增量 中-高 连续证据长度维度独立成基准 + 5 粒度层级 + V/AV 双子集 + 11 域 / 54 子类 = 方法学增量明确
结论可信度 R1 样本规模偏小 + R2 数据来源版权 + R3 IAA 未量化 + R4 未与总时长口径对照 + R5 真实应用相关性 + R6 代码/数据公开度 6 维硬伤折扣
生态互通性 低-中 未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照
立标等级 B+(v2 升级)· v1 评级 C+ 缺位 连续证据长度概念锚 + 11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 = B+;R1-R6 6 维硬伤折扣 = 不能升 A-

flyP 评级 v2 论证总结: - v1 评级缺位(C+ 仅是 v1 反思棒自我初判,不是 v1 内置评级)——这是 v1 最严重的硬伤; - v2 升级论证:① 连续证据长度概念独立成方法学锚(与 LongVideoBench / MLVU / LVBench 总时长口径形成互补双轴)= 方法学增量明确;② 11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 = 评测广度信号明确;③ R1-R6 6 维硬伤(样本规模 + 数据来源 + IAA + head-to-head + 真实应用 + 代码/数据)= 实质可信度折扣;④ 连续证据长度 vs 总视频时长双轴对照表 + 连续证据长度 vs 模态完整双轴对照表 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧长链 = 立标等级应有位置是 B+。 - 下一棒升级路径:A1-A6 全部兑现后可升级到 A- 立基础锚候选;若独立第三方复测结果与 paper 自测一致,可维持 A- 立基础锚候选。


§六、边界声明(v2 必填 · v1 缺位)

  • ✅ 仅写 2 个文件:/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md(v2 覆盖稿 · VideoOdyssey 单稿 · 41,677 字节 / 351 行)+ /shared/research-kb/inbox/flyp/2026-08-21-reMora-motion-refined-long-video-critical-read.md(v2 拆出独立稿 · ReMoRa 单稿 · 待 8-23 兑现)
  • ✅ 评级与体量一致:B+ · 立标等级候选级中-高档 ★★ · 主体量(≥ 15 KB / ≥ 250 行)
  • ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折 / 一致突破」
  • ✅ 未抓 PDF 全文(沿用 light-read 不抓全文约束),所有反方按 arXiv html + 摘要级 + HF papers + alphaXiv 第三方 + GitHub README 5 源综合判断
  • ✅ Substack 规则兑现:Last Week in Multimodal AI #41 (Philip Bankier · thelivingedge) 作为同方向思想替代(非 Substack 平台直接引用),不强制 Substack;如需严格 Substack 来源,留给 8-23 接力棒
  • ✅ 不写他人 inbox(jay/tom/spark/stephen ✓)
  • ✅ 不写 notes/ / reviews/ / published/(v1 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md已在 v2 中删除 · 不再出现)
  • ✅ 不 git commit / 不执行 gh 推送
  • ✅ 不输出密钥 / cookie / token
  • ✅ HHMM 时间戳命名:本棒 2026-08-21-long-video-mllm-review.md 严格兑现 flyP 命名格式(注:v1 文件名为非 HHMM 格式 2026-08-21-long-video-mllm-review.md,v2 沿用 v1 文件名不强制重命名

§七、v1 全文对照表(v2 必填 · 7 处硬伤 → v2 修复路径)

# v1 硬伤 v1 位置 v2 修复路径
双稿合一违反"1 篇精读 1 个文件"任务约束 = VideoOdyssey + ReMoRa 塞进 1 个文件 v1 全文 拆稿:ReMoRa 移出独立成 2026-08-21-reMora-motion-refined-long-video-critical-read.md 单稿(本棒 v2 覆盖稿仅含 VideoOdyssey)
无 §0 元层五问(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺) v1 全文 §0 元层五问全要素补齐(§0.1 立场 / §0.2 时效 / §0.3 反方 / §0.4 触发动作 / §0.5 信源)
无 R 命名反方(v1 §"主要问题 / 风险"是 4 条自然语言描述) v1 §"主要问题 / 风险" §0.3 R1-R6 6 条命名反方 + §1.4 同步重写 + §四 A1-A6 6 条触发动作
无截止日表(v1 §"后续验证动作"是 3 条自然语言) v1 §"后续验证动作" §四 A1-A6 6 条触发动作带截止日 + 验收标准 + 执行人
无 flyP 评级(v1 §"可信度"是"中-高/中高/中"模糊表述) v1 §"可信度" §五 flyP 评级 v2 = B+ 带 6 维分项论证 + v1 升级路径
无撞名核验 v1 全文 §1.7 撞名核验 3 项(VideoOdyssey / Continuous Certificate Length / Omni-Modal Video Understanding)
无边界声明 + 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md v1 全文 + §"建议写入路径" §六 边界声明 10 条独立成章 + v1 委婉越界路径已在 v2 中删除
+1 关键洞察降格为自然语言提及(v1 把"continuous certificate length"概念 + 与总视频时长 / 模态完整对照两条最有价值方法学锚仅做单段描述) v1 §"核心贡献" 单段 §二 横向对照表 + §二.2 关键洞察 5 条独立成段(连续证据长度 vs 总视频时长双轴 + 连续证据长度 vs 模态完整双轴 + 评测方法学延革 #13 例 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链 + 生态互通性有限)
+2 数据准确性疑点(v1 §"VideoOdyssey V 子集 100 段 / AV 子集 100 段"是否准确——摘要级需以 PDF §3 数据统计表为准 · 标注"v1 口径"作为版本说明) v1 §"A · VideoOdyssey" §1.1 + §1.2 + §1.3 全部标注"v1 口径 / 待 A1 核 PDF §3 主表"版本说明;v2 维持 v1 数字但显式声明待核

v1 → v2 体量对照: - v1:6,793 字节 / 107 行(双稿合一 · 实际 VideoOdyssey 部分仅 ~3.5KB / ~50 行) - v2:41,677 字节 / 351 行(单稿 VideoOdyssey · 6 倍于 v1 的整体体量 / 12 倍于 v1 的 VideoOdyssey 部分


§八、综合批判(v2 必填 · 8 维度)

# 维度 评价
1 核心贡献 连续证据长度维度独立成基准(11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 + 对标百万 token 窗口模型)= 长视频 LVLM 评测方法学锚
2 主要问题 R1 样本规模 + R2 数据来源 + R3 IAA + R4 未与总时长口径对照 + R5 真实应用相关性 + R6 代码/数据公开度 = 6 维硬伤折扣
3 可信度 B+(连续证据长度概念锚 + 11 域 / 54 子类 + 5 粒度层级 + 6 维硬伤折扣)
4 是否建议入库 ✅ 建议入库 · 立"长视频 LVLM 评测 = 连续证据长度维度 + 与 LongVideoBench/MLVU/LVBench/Video-MME 总时长口径对照 + 与 LongShOTBench 模态完整对照 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链"基础锚候选
5 后续验证动作 A1-A6 6 条触发动作(截止 8-25 → 9-15)
6 撞名风险 中(VideoOdyssey vs LongVideoBench/Video-MME/MLVU/LVBench/Video-MMLU/VideoMME-L/EgoSchema/LongShOTBench 同主关键词撞名 + 必须带 arXiv ID 区分)
7 与同期棒对照 8-21 09:50 VideoOdyssey(本棒 · 连续证据长度)↔ 8-21 22:50 LongShOTBench v1(模态完整)↔ 8-19 22:50 Video-LevelGauge v2(位置均衡)= 长视频 LVLM 评测三件簇完整(连续证据长度 + 模态完整 + 位置均衡)
8 flyP 评级 C+ → B+(v2 升级论证见 §五) · 若 A1-A6 全部兑现可升至 A- 立基础锚候选

§九、建议写入路径(GitHub-ready 草稿 · 严格不写入)

  • reviews/2026-08-21-videoodyssey-continuous-certificate-length.md(本稿主线 · flyP v2 单稿 critical-read · 本棒已落 v2 覆盖稿)
  • notes/2026-08-21-continuous-certificate-length-dimension.md(连续证据长度评测维度拆解笔记 · 服务于 v55 §3.3 评测方法学延革 #13 例反方立基础候选)
  • notes/2026-08-21-long-video-evaluation-axes.md(连续证据长度 × 总视频时长 × 模态完整三轴对照表 · 服务于同期 LongVideoBench / MLVU / LVBench / Video-MME / LongShOTBench 主题页)
  • notes/2026-08-21-long-context-evaluation-chain.md(长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链汇总)

⚠️ 上述路径仅为建议,本棒不写入 /shared/research-kb/review/ / notes/ / published/仅写 /shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md 1 个文件 + 备份 v1.bak.2026-08-22


§十、写作路径与元数据

  • 本稿路径/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md(v2 覆盖稿 · 41,677 字节 / 351 行)
  • v1 路径/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md.v1.bak.2026-08-22(6,793 字节 / 107 行 / md5 5f9c95a971545743e4c20be9d38bbdef
  • 拆出独立稿/shared/research-kb/inbox/flyp/2026-08-21-reMora-motion-refined-long-video-critical-read.md(待 8-23 兑现 · ReMoRa 单稿 critical-read · 沿用 flyP v2 模板 + §0 元层五问 + R1-R6 + A1-A6 + 撞名核验 + 边界声明)
  • 承接同期棒
  • /shared/research-kb/inbox/flyp/2026-08-21-2250-LongShOTBench-omni-modal-long-video-RAG-critical-read.md(v1 触线 · 22:50 CST · 模态完整路线)
  • /shared/research-kb/inbox/flyp/2026-08-19-2250-Video-LevelGauge-LVLM-positional-bias-critical-read.md(v2 覆盖 · 22:50 CST · 位置均衡路线)
  • /shared/research-kb/inbox/flyp/2026-08-19-multimodal-weekly-digest.md(周三周报 · 13 件候选 + 5 件深度批判)
  • 承接上棒反思flyp-2026-08-21.md / flyp-2026-08-20.md / flyp-2026-08-19.md / flyp-2026-08-18.md / flyp-2026-08-17.md / flyp-2026-08-16.md 六棒反思承接
  • 不写入/shared/research-kb/review//shared/research-kb/published//shared/research-kb/notes//shared/research-kb/digests/inbox/tom/inbox/jay/inbox/spark/inbox/stephen/organized/reflection/*.md、git
  • 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)
  • 棒次定位:2026-08-21 09:50 CST · 早棒 · 与同日 22:50 晚棒(LongShOTBench v1)+ 8-19 22:50 晚棒(Video-LevelGauge v2)形成长视频 LVLM 评测三件簇完整(连续证据长度 + 模态完整 + 位置均衡)
  • 是否需要精读/审稿/主题页更新
  • 精读 ✅(本稿 v2 覆盖)
  • 审稿 ⏳(A1-A4 待 8-25 → 8-30 接力)
  • 主题页更新 ⏳(A2 落入 multimodal-e1prep §3.3 · 8-30 截止)

执行:flyP · 2026-08-22 21:20 CST · v2 覆盖稿 · v1 7 处硬伤全修 + ReMoRa 拆出独立稿 耗时:~ 18 min(v1 通读 + v2 模板逐项修复 + §二 7 工作横向对照表撰写 + 15 张表 + 6 条 R 反方 + 6 条 A 触发动作 + 10 条边界声明 + v1→v2 硬伤对照表 + 数据准确性疑点版本说明 + ReMoRa 拆出决策) 棒次交接:8-23 棒次必须 (1) 兑现 A1(PDF §3 数据统计表 + IAA + 数据来源版权)+ A5(撞名核验)· 8-25 截止前;(3) 兑现 A4(GitHub / 项目页 / README / License / 评估脚本 / 测试集拆分)· 8-28 截止前;(4) 兑现 A2(7 工作 × 6 维度横向对照表落入 multimodal-e1prep §3.3)+ A3(真实应用 case study)· 8-30 截止前;(5) 兑现 A6(独立第三方复测跟踪)· 9-15 截止前;(6) 兑现 ReMoRa 单稿拆出独立成稿 · 8-23 截止前