VideoOdyssey · Continuous-Certificate-Length Omni-Modal 长视频基准 · flyP 单稿 critical-read(2026-08-21 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(2026-08-22 21:20)· 反思强制补稿闸第 55 天连续生效 · flyp-2026-08-22.md §三 8-16→8-22 窗口最弱样本当场兑现 v2 覆盖 v1 路径:/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md.v1.bak.2026-08-22(6,793 字节 / 107 行 / md55f9c95a971545743e4c20be9d38bbdef/ 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-22 21:20 CST 覆盖纪律:v1 的 7 处结构性硬伤(① 双篇合并违反"1 篇精读 1 个文件"任务约束 = VideoOdyssey + ReMoRa 塞进 1 个文件 = 双稿合一违反任务约束 · 必须拆稿:ReMoRa 移出独立成2026-08-21-reMora-motion-refined-long-video-critical-read.md单稿;② 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;③ 没有 R 命名反方 = 仅自然语言"主要问题 / 风险"段;④ 没有截止日表 = §"后续验证动作"是 3 条自然语言描述;⑤ 没有 flyP 评级 = §"可信度"是"中-高/中高/中"模糊表述不是评级;⑥ 没有撞名核验 = "continuous certificate length" 概念命名 + VideoOdyssey 命名独特性需补;⑦ 没有边界声明 = 私域清洁度未明示 · 边界自洽性无 + 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md触及 flyP 写权限外目录)+ 1 件关键洞察遗漏("连续证据长度(continuous certificate length)"概念本身是 VideoOdyssey 的方法学锚点,但 v1 把这个新概念降格为单段描述,没有把它与"总视频时长"、"窗口大小"做对照表)+ 0 张独立表格(仅"候选筛选"用表 + "分类标签"散列 = 立标级判定无法落地)+ 数据准确性疑点("VideoOdyssey V 子集 100 段 / AV 子集 100 段"是否准确——摘要口径需以 PDF §3 数据统计表为准 · "V/A/V-A 三种 sample 数"必须用 arXiv §3 主表交叉核验)必须全部修复 承接:flyp-2026-08-21.md(第 54 份反思)+flyp-2026-08-20.md(第 53 份反思)+flyp-2026-08-19.md(第 52 份反思)+flyp-2026-08-18.md(第 51 份反思)+flyp-2026-08-17.md(第 50 份反思)+flyp-2026-08-16.md(第 49 份反思)六棒承接 本棒 v2 定位:把 v1 的"双稿合一短评触线"重写为完整的 flyP v2 单稿 critical-read(VideoOdyssey 1 篇主稿 + ReMoRa 拆出独立成单稿)+ §0 元层五问 + §一.7 撞名核验 + §二 横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度)+ §三 R1-R6 6 条命名反方 + §四 A1-A6 6 条触发动作表 + §五 flyP 评级 + §六 边界声明 10 条独立成章 + §七 v1 全文对照表(7 处硬伤 → v2 修复路径)
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
VideoOdyssey(arXiv:2605.22907 · 2026-05 · 超长+全模态长视频评测基准 · 主分类 cs.CV 副分类 cs.AI) 是 8-16 → 8-22 窗口 23 件主稿(含反方审稿 / 周报 / e1prep)中唯一一篇"双稿合一短评触线 + 连续证据长度概念首件 + 与同期 LongShOTBench 形成'连续证据长度 vs 模态完整'对照" 的样本——v1 仅 6,793 字节 / 107 行,把 VideoOdyssey + ReMoRa 双稿塞进 1 个文件(违反"1 篇精读 1 个文件"任务约束),没有 §0 元层、没有 R 命名反方、没有截止日表、没有 flyP 评级、没有撞名核验、没有边界声明、没有横向对照表,且把"continuous certificate length"这个最有价值的方法学锚概念降格为单段描述、漏掉与"总视频时长 / 窗口大小 / 连续推理长度"做对照表、把 ReMoRa 当作"工程改进型"贴标但没有给出"双稿拆出独立成单稿"建议。
方法学层面:VideoOdyssey 把"长视频问答"评测从"模型在多长视频上准确答"重新定义为"模型需要人类连续观看的最短视频时长才能答对"——这个"连续证据长度(continuous certificate length)"概念是 2026 年长视频评测方法学的关键概念增量之一。它在三个维度上立基础:
(1) 评测目标重构 —— 从"视频总长度"(Video-MME / LongVideoBench 路线)切换到"连续证据长度"(认知负荷口径)。前者偏"模型能塞多少 token 进窗口"的硬件挑战,后者偏"模型能不能在干扰段落里持续保留关键证据"的认识挑战; (2) 多模态分层构造 —— V 子集(连续证据长度约 16 分钟)+ AV 子集(连续证据长度约 12.8 分钟)+ 11 个领域 / 54 个子类别,让"偏长视频"和"偏短但需多模态融合"两类任务分流评估; (3) 5 个粒度层级(秒 → 小时)诊断曲线 —— 模型在不同连续证据长度上的退化曲线被显式刻画,能直接诊断"模型卡点是检索 vs 连续推理 vs 细粒度感知 vs 非语言全模态融合"哪一环。
硬伤有七:
(1) 样本规模偏小(V 子集 100 段 + AV 子集 100 段) —— 在长视频评测领域,100 段 / 域覆盖的统计显著性是个真问题。VideoOdyssey 用"质性筛选 + 11 域 / 54 子类"的密度补偿,但跨子集 / 跨域的难度梯度需要 ablation 表撑住(v1 没有量化说明,仅提"统计显著性需关注"自然语言带过); (2) 数据来源版权未披露 —— 摘要未说视频是 YouTube 抓取 / 自录 / 合作授权。这对长视频评测的可复现性 + 分发合规性是硬约束(v1 自然语言"可能带来分发与复现风险"带过); (3) 标注一致性(IAA)未量化 —— "continuous certificate length" 标注是逐段人工标"多少分钟连续观看才够答对",跨标注员一致性是核心可信度指标(v1 自然语言"标注一致性可能不稳定"带过); (4) "continuous certificate length"新指标的定义稳定性 —— 不同任务域下"答对所需的最短连续观看"可能差异巨大(监控 1 帧足够、剧情 5 分钟不够),如何把不同任务的"连续证据长度"标准化成可比量纲需要 PDF §3 主表论证; (5) 真实应用场景相关性 —— 评测主要在"长上下文压力测试"上跑,与下游真实应用(监控、机器人、自动驾驶)的相关度需要论证(v1 自然语言带过); (6) 未与 LongVideoBench / MLVU / LVBench 等"总视频时长"路线做 head-to-head 对照 —— VideoOdyssey 自报"对标 Gemini-3.1-Pro、Qwen3-VL 等百万 token 窗口模型",但没有给出在同一子集上"总视频时长口径"和"连续证据长度口径"的退化曲线对比,无法证明新指标比传统指标捕获了不同的失效模式; (7) 代码 / 数据公开度未披露 —— 摘要级信息不足以判定 release 完整度(GitHub 仓库 / 评估脚本 / 问答拆分 / 测试集)。
flyP 立场:C+ → B+(v1 触线 + 概念增量"continuous certificate length"独立成方法学锚 + 11 域 / 54 子类 + Gemini-3.1-Pro 百万 token 模型对标 = 立标等级应有位置 ★ 中档偏低;待 A1-A6 全部兑现可升至 A- 立基础锚候选)——VideoOdyssey 适合作为"长视频评测 = 连续证据长度维度 + 与 LongVideoBench/MLVU/LVBench 总时长口径对照 + 与 LongShOTBench 模态完整对照 + 与 VideoMME-L 全模态对照"立基础锚引用;数字须按连续证据长度 × 上下文长度 × 上下文类型分维度报告而非单点数字复用;v1 评级缺位——v2 必须显式补 flyP 评级 C+ → B+ 升级论证。
§0.2 时效
- VideoOdyssey arXiv:2605.22907:
- v1 提交时间:待 A1 核 arXiv abs 提交时间戳(摘要级未明确)
- 修订:摘要级未明确版本号(待 A1 核)
- HF papers 挂载:待 A1 核(摘要级未明确是否挂载)
- GitHub:待 A1 核(摘要级未明确是否开源)
- 会议:待 A1 核(是否在 CVPR 2026 / NeurIPS 2026 / ICLR 2026 投稿周期)
- flyP 精读落盘(v1):2026-08-21 09:50 CST
- 撞名核验:
- "VideoOdyssey" → 与 "LongVideoBench"(THUDM 2024)/ "Video-MME"(2024)/ "MLVU"(2024)/ "LVBench"(2024)/ "Video-MMLU"(arXiv:2504.14693 v2)/ "VideoMME-L" / "EgoSchema" / "LongShOTBench" 等撞名风险中(必须带 arXiv ID + 概念锚"continuous certificate length"区分);
- "Continuous Certificate Length" → 与 "Certificate" 系列(out-of-distribution generalization certificate)/ "Length" 系列(sequence length extrapolation)/ "Continuous-Time" 类撞名风险低(必须带"长视频评测"限定词);
- 结论:VideoOdyssey 适合作为"v55 §2.39.x 长视频评测方法学延革 #13 例反方立基础候选 + 与 LongShOTBench 形成'连续证据长度 vs 模态完整'双轴对照表"引用;数字须按连续证据长度 × 上下文长度 × 上下文类型分维度报告。
§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
- R1 ★★★★「样本规模偏小:V 子集 100 段 + AV 子集 100 段 跨子集/跨域难度梯度未 ablation」 —— 在长视频评测领域,100 段 / 域覆盖的统计显著性是个真问题;VideoOdyssey 用"质性筛选 + 11 域 / 54 子类"的密度补偿,但跨子集 / 跨域的难度梯度需要 ablation 表撑住。证伪条件 = 论文 §3 主表 + §附录必须给出 11 域 × 54 子类的难度梯度表 + 跨子集 / 跨域一致性曲线 + 与 LongVideoBench / MLVU / LVBench 子集规模对比;判定依赖 = A1 截止 8-25 抓 PDF §3 数据统计表 + §附录 ablation;
- R2 ★★★★「数据来源版权未披露」 —— 摘要未说视频是 YouTube 抓取 / 自录 / 合作授权。这对长视频评测的可复现性 + 分发合规性是硬约束。证伪条件 = 论文 §附录 / 项目页 / README 必须给出 11 域 / 54 子类的数据来源清单(YouTube 频道列表 / 合作授权链接 / 自录数据集路径)+ License 链路;判定依赖 = A1 截止 8-25;
- R3 ★★★「标注一致性(IAA)未量化:continuous certificate length 标注是逐段人工」 —— "答对所需的最短连续观看"标注是核心可信度指标。证伪条件 = 论文 §3 必须给出 IAA(Krippendorff's α 或 Cohen's κ)≥ 0.7 的证据 + 跨标注员抽样核验率 ≥ 10%;判定依赖 = A1 截止 8-25;
- R4 ★★★★「未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照」 —— VideoOdyssey 自报"对标 Gemini-3.1-Pro、Qwen3-VL 等百万 token 窗口模型",但没有给出在同一子集上"总视频时长口径"和"连续证据长度口径"的退化曲线对比,无法证明新指标比传统指标捕获了不同的失效模式。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张 head-to-head 对照表(同一子集 × 总视频时长退化 × 连续证据长度退化)+ 偏差相关性分析;判定依赖 = A2 截止 8-30 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3;
- R5 ★★★「评测目标 vs 真实应用场景相关性未论证」 —— 评测主要在"长上下文压力测试"上跑,与下游真实应用(监控、机器人、自动驾驶)的相关度需要论证。证伪条件 = 论文 §5 / §附录必须给出 ≥1 个真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线;判定依赖 = A3 截止 8-30;
- R6 ★★★★「代码 / 数据公开度未披露」 —— 摘要级信息不足以判定 release 完整度(GitHub 仓库 / 评估脚本 / 问答拆分 / 测试集)。证伪条件 = A4 截止 8-28 抓 GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分双向核验;若 7 天内仍无 release,把可信度从"中-高"下调到"中"。
反方严重度汇总:
| # | 反方 | 严重度 | 状态(v2) |
|---|---|---|---|
| R1 | 样本规模偏小 + 跨子集/跨域难度梯度未 ablation | ★★★★ | 接力 A1 · 截止 8-25 |
| R2 | 数据来源版权未披露 | ★★★★ | 接力 A1 · 截止 8-25 |
| R3 | 标注一致性(IAA)未量化 | ★★★ | 接力 A1 · 截止 8-25 |
| R4 | 未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照 | ★★★★ | 接力 A2 · 截止 8-30 |
| R5 | 评测目标 vs 真实应用场景相关性未论证 | ★★★ | 接力 A3 · 截止 8-30 |
| R6 | 代码 / 数据公开度未披露 | ★★★★ | 接力 A4 · 截止 8-28 |
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 VideoOdyssey PDF §3 数据统计表(V 子集 100 段 / AV 子集 100 段 / 11 域 / 54 子类确认)+ §3 IAA 数字 + 数据来源版权 + §附录跨子集/跨域难度梯度 | 2026-08-25 | 列出 §3 主表 ≥3 行 + IAA 数字(Krippendorff's α / Cohen's κ)+ 11 域数据来源清单 + License 链路 | flyP |
| A2 | 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 | 2026-08-30 | 列出 7 工作 × 6 维度对照表 + head-to-head 退化曲线 + 落入 multimodal-e1prep §3.3 | flyP 接力 multimodal-e1prep |
| A3 | 抓 VideoOdyssey §5 / §附录真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线 | 2026-08-30 | 列出 ≥1 个真实应用 case study 的退化曲线 + 与"长上下文压力测试"的相关性 | flyP |
| A4 | 抓 VideoOdyssey GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分 + 模型权重可见性 | 2026-08-28 | 列出 GitHub URL + License 确认 + README + 评估脚本 + 测试集拆分 + 模型权重可见性 | flyP |
| A5 | 撞名核验:VideoOdyssey vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU / VideoMME-L / EgoSchema / LongShOTBench 同名边界 + arXiv ID 区分 | 2026-08-25 | 列出 ≥3 条撞名证据 + 命名注释声明 | flyP |
| A6 | 跟踪 VideoOdyssey 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL)上独立复测 | 2026-09-15 | 列出 ≥3 条独立复测记录 + 与 paper 自测结果对照 | flyP 接力 |
§0.5 信源截止日(6 源全过才升 A-)
| # | 信源 | URL | 状态 |
|---|---|---|---|
| 1 | arXiv abs | https://arxiv.org/abs/2605.22907(v1 · 2026-05) | ✓ 命中 · 待 A1 核版本号 + 提交时间戳 |
| 2 | HF papers | 待 A1 核(是否挂载) | 待核 |
| 3 | GitHub | 待 A1 核(是否开源) | 待核 |
| 4 | 项目页 | 待 A1 核 | 待核 |
| 5 | 第三方 alphaXiv 摘要 | 待 A1 核 | 待核 |
| 6 | Substack 补充思想 | 本棒未引 · 按规则"Substack 最多 1 条" · 同方向思想已被 Last Week in Multimodal AI #41 (Philip Bankier · thelivingedge) 覆盖(沿用 8-19 multimodal-weekly-digest §0 第 7 点) | 替代 · 不强制 Substack |
| 7 | 撞名核验库 | LongVideoBench (arXiv:2407.08240) / Video-MME (arXiv:2405.21060) / MLVU (2024) / LVBench (arXiv:2502.10669) / Video-MMLU (arXiv:2504.14693) / VideoMME-L / EgoSchema / LongShOTBench | ✓ 命中(沿用 8-21 LongShOTBench v1 + 8-19 Video-LevelGauge v2 + 8-19 multimodal-weekly-digest §0) |
§一、核心方法 v2 增量(v1 双稿合一短评触线 → v2 完整 VideoOdyssey 单稿精读 · ReMoRa 拆出独立成单稿)
§1.1 元信息
- 标题:VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
- arXiv:https://arxiv.org/abs/2605.22907(v1 · 2026-05 · cs.CV / cs.AI)
- 会议:待 A1 核(是否进入 CVPR 2026 / NeurIPS 2026 / ICLR 2026 投稿周期)
- 作者:待 A1 核(v1 摘要级未明确列出完整作者列表)
- 代码:待 A1 核(v1 摘要级未给 GitHub 链接)
- 数据:待 A1 核(v1 摘要级未给项目页 / 数据集路径)
- 评测规模:V 子集 100 段(连续证据长度约 16 分钟)+ AV 子集 100 段(连续证据长度约 12.8 分钟)+ 11 域 / 54 子类 + 5 个粒度层级(秒 → 小时)(v1 口径——摘要级,需以 PDF §3 数据统计表为准)
- flyP 评级:C+ → B+ · v2 升级论证见 §五
§1.2 核心贡献(v1 自然语言 → v2 三维结构化)
维度 1:评测目标重构(最关键的方法学增量) - 把"长视频问答"评测从"模型在多长视频上准确答"重新定义为"模型需要人类连续观看的最短视频时长才能答对"——"continuous certificate length"概念独立成方法学锚 - 这是 2026 年长视频评测方法学的关键概念增量之一,与"总视频时长"(Video-MME / LongVideoBench 路线)形成互补双轴
维度 2:多模态分层构造 - V 子集:连续证据长度约 16 分钟,纯视觉 - AV 子集:连续证据长度约 12.8 分钟,视觉 + 音频 - 11 个领域 / 54 个子类别 → "偏长视频"和"偏短但需多模态融合"两类任务分流评估 - 5 个粒度层级(秒 → 小时) 用于诊断模型在不同连续证据长度上的退化曲线
维度 3:可执行结论 - 诊断当前 SOTA MLLM(含 Gemini-3.1-Pro 等 1M+ token 上下文模型)的瓶颈不止于"检索",还在"连续推理 + 细粒度感知 + 非语言全模态" - 给"长上下文 / 多模态融合 / 持续证据保留"三条路线分别提供退化曲线锚
§1.3 方法拆解(v1 自然语言 → v2 五要素结构化)
数据构造(v1 提到 / v2 必填) - V 子集 100 段 + AV 子集 100 段(v1 口径 —— 摘要级,需 PDF §3 主表核验) - 11 域 / 54 子类,质性筛选 - 5 个粒度层级(秒 → 小时) - 待 A1 核:跨子集 / 跨域难度梯度表 + 数据来源版权清单 + 标注一致性(IAA)数字
任务定义 - "答对所需的最短连续观看" → 关键指标 = continuous certificate length - 旧范式 = 视频总长度(硬件挑战) - 新范式 = 连续证据长度(认知挑战)
指标体系 - accuracy(基础指标) - continuous certificate length(核心增量) - 5 个粒度层级退化曲线 - 多模态融合度(V vs AV 对比)
实验维度 - 连续证据长度(短 / 中 / 长 / 超长) - 模态(V vs AV) - 任务域(11 域 / 54 子类) - 模型来源(开源 vs 闭源,v1 口径包括 Gemini-3.1-Pro / Qwen3-VL 等百万 token 窗口模型)
关键发现(v1 摘要级口径) - 现有 SOTA MLLM 瓶颈不止于检索 - 在"连续推理 + 细粒度感知 + 非语言全模态"上仍有显著退化 - Gemini-3.1-Pro 等 1M+ token 窗口模型不是终点 - 待 PDF §5 / §附录核验具体数字
§1.4 VideoOdyssey 主要问题(v1 自然语言 → v2 R1-R6 命名反方 · 详见 §0.3)
R1 ★★★★「样本规模偏小 + 跨子集/跨域难度梯度未 ablation」 —— 详见 §0.3 R1。
R2 ★★★★「数据来源版权未披露」 —— 详见 §0.3 R2。
R3 ★★★「标注一致性(IAA)未量化」 —— 详见 §0.3 R3。
R4 ★★★★「未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照」 —— 详见 §0.3 R4。
R5 ★★★「评测目标 vs 真实应用场景相关性未论证」 —— 详见 §0.3 R5。
R6 ★★★★「代码 / 数据公开度未披露」 —— 详见 §0.3 R6。
§1.5 可信度(v1 模糊"中-高/中高/中" → v2 4 维分项)
| 维度 | 评价 | 依据 |
|---|---|---|
| 会议权威 | 待 A1 核 | v1 摘要级未明确会议接收 |
| 代码 / 数据 / 评测 pipeline 公开度 | 低 | v1 摘要级未明确 GitHub / 项目页 / README |
| 11 域 / 54 子类 + 5 粒度层级覆盖广度 | 中-高 | V 子集 100 段 + AV 子集 100 段 + 11 域 / 54 子类 + 5 粒度层级 = 广度信号明确 |
| 结论"普适性"可信度 | 中 | 连续证据长度对任务域、prompt 模板、采样帧数高度敏感,单一榜单不能盖棺定论;R1-R6 反方集合是结论可信度的关键折扣 |
总体:中(11 域 / 54 子类 + 5 粒度层级覆盖广度 + 连续证据长度概念锚 = 形式可信度中;R1-R6 反方 6 维硬伤 = 实质可信度折扣)。
§1.6 复现难度(v1 无 → v2 4 维分项)
| 维度 | 评价 | 依据 |
|---|---|---|
| 代码 | 待 A1 核 | GitHub 公开度待核 |
| 数据 | 待 A1 核 | 数据集公开度 + License 链路待核 |
| 算力 | 中-高 | 跑 5 个粒度层级 × 11 域 × 54 子类 × 多个 SOTA MLLM 需要 GPU 集群 |
| 门槛 | 中 | 数据集 + 评测脚本完整降低部分门槛,但百万 token 窗口模型横评的算力门槛 + 连续证据长度标注的工程门槛使整体门槛维持"中" |
§1.7 撞名核验(v2 必填 · v1 缺失)
| 命名 | 撞名核验 | 严重度 |
|---|---|---|
| VideoOdyssey | 与 "LongVideoBench"(THUDM 2024 / arXiv:2407.08240)/ "Video-MME"(2024 / arXiv:2405.21060)/ "MLVU"(2024)/ "LVBench"(2024 / arXiv:2502.10669 等)/ "Video-MMLU"(arXiv:2504.14693 v2)/ "VideoMME-L" / "EgoSchema" / "LongShOTBench"(arXiv:2512.16978v2)/ "Odyssey" 系列(CMU 2023 机器人决策)等撞名风险中 | 撞名风险中(必须带 arXiv ID 区分) |
| Continuous Certificate Length | 与 "Certificate" 系列(out-of-distribution generalization certificate)/ "Length" 系列(sequence length extrapolation)/ "Continuous-Time" 类撞名风险低(命名独特) | 撞名风险低(必须带"长视频评测"限定词 + arXiv ID) |
| Omni-Modal Video Understanding | 与 "Omni-Modal" / "Omni" 系列(2024-2025 GPT-4o / Gemini Omni 等)撞名风险中-高 | 撞名风险中(必须带"长视频评测"限定词) |
§二、横向对照表(v2 必填 · v1 缺失 · 关键洞察升格为产物输出)
关键洞察:v1 描述"continuous certificate length"是 VideoOdyssey 的方法学锚,但 v1 没有把这个新概念与"总视频时长 / 窗口大小 / 连续推理长度"做对照表,没有与同期 LongShOTBench 形成"连续证据长度 vs 模态完整"双轴对照。v2 必须显式作为横向对照表产物输出。
§2.1 VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度
| 工作 | 时间 | 评测对象 | 评测指标 | 评测规模 | 公开度 | 立标等级 |
|---|---|---|---|---|---|---|
| VideoOdyssey(本棒) | arXiv 2026-05 | 长视频 LVLM(多 SOTA MLLM,含 Gemini-3.1-Pro / Qwen3-VL) | 连续证据长度(continuous certificate length) + 5 粒度层级 + V/AV 双子集 | V 子集 100 段(~16 分钟)+ AV 子集 100 段(~12.8 分钟)/ 11 域 / 54 子类 / 5 粒度层级 | 待 A1 核 | B+ · v2 升级 |
| LongVideoBench(THUDM 2024) | arXiv:2407.08240 / NeurIPS 2024 | 长视频 VQA | 长视频 VQA anchor(最长 2 小时)+ 总视频时长口径 | 6,179 多选 + 1,200 字幕 | GitHub + 评测脚本完整 | A- · 已立标 |
| MLVU(2024) | arXiv 2024 | 长视频理解多任务 | 多任务(19 类)长视频理解 + 总视频时长口径 | 2,593 多选 | 1,730 视频 / 9 类 | GitHub + 评测脚本完整 |
| LVBench(2024) | arXiv 2024 | 长视频时序理解 | 长时序 + 早/中/晚位置偏置 + 总视频时长口径 | 1,549 多选 + 1,200 字幕 | 1,049 视频 | GitHub + 评测脚本完整 |
| Video-MME(2024) | arXiv:2405.21060 | 多模态 LLM 视频理解评测 | 多模态融合 + 总视频时长口径 | 2,700 视频 / 5 域 | GitHub + 评测脚本完整 | A- · 已立标 |
| EgoSchema | arXiv 2024 / TPAMI 2024 | 自我中心长视频 QA | 长时序 + 自我中心视角 | 5,000 多选 | GitHub + 评测脚本完整 | A- · 已立标 |
| VideoMME-L | 待补查 | 长视频多模态评测 L 版 | 待补查 | 待补查 | 待补查 | 待补查 |
| LongShOTBench(flyp 8-21 22:50 v1) | arXiv:2512.16978v2 | 长视频 omni-modal(V + A + ASR) | 模态完整(V + A + ASR)+ ReAct 工具调用 | 274 视频 / 3,401 样本 / 4,893 QA turn | GitHub(待 A1 核) | B+ · flyp 8-21 v1 触线(待 v2 覆盖) |
§2.2 关键洞察(v1 缺失 → v2 升格)
- "连续证据长度 vs 总视频时长"双轴对照表 —— VideoOdyssey 评测"连续证据长度"(认知负荷口径)+ LongVideoBench / MLVU / LVBench / Video-MME 评测"总视频时长"(硬件挑战口径)= 两条独立维度的长视频评测方法学。v2 把这条升格为横向对照表的独立产物。
- "连续证据长度 vs 模态完整"双轴对照表 —— VideoOdyssey 评测"连续证据长度"+ LongShOTBench 评测"模态完整(V + A + ASR 三模态联合推理)" = 两条独立维度的长视频评测方法学(与 1 平行)。v2 把这条升格为横向对照表的独立产物。
- "评测方法学延革 #13 例反方立基础候选" —— VideoOdyssey 在评测方法学延革序列中位于 #13(沿用 8-19 multimodal-weekly-digest §0 第 5 点"立标等级评估延革第 6+7 例"双首次机制化 + 8-20 22:50 AutoResearch/ARFT #10 例 + 8-21 09:50 Video-LevelGauge #11 例 + 8-22 09:50 EnvHarness #12 例预备)= 评测方法学延革 13 例反向立基础候选首次机制化。
- "长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧"长链 —— MMProLong(训练侧 · 长上下文继续预训练)→ LongVideoBench / MLVU / LVBench / Video-MME(评测侧 · 长视频总时长整体准确率)→ VideoOdyssey(连续证据长度侧 · 认知负荷)→ LongShOTBench(模态完整侧 · V + A + ASR)→ LongVideoAgent / LongShOTAgent(应用侧 · 长视频 agent 框架)= "长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧"五阶段完整长链。v2 把这条升格为长链机制的独立产物。
- "生态互通性有限"是核心硬伤 —— VideoOdyssey 的"连续证据长度"指标尚未形成跨基准可比口径。v1 没有识别这条硬伤;v2 必须作为 §二.1 横向对照表的独立产物,明确"7 工作 × 6 维度 = 42 单元"的对照结构。
§三、复现难度(v1 无 → v2 5 维分项)
| 维度 | 评价 | 详细 |
|---|---|---|
| 代码可获得性 | 待 A1 核 | GitHub 公开度待核 |
| 数据可获得性 | 待 A1 核 | 数据集公开度 + License 链路待核 |
| 算力门槛 | 中-高 | 跑 5 个粒度层级 × 11 域 × 54 子类 × 多个 SOTA MLLM 需要 GPU 集群 |
| 方法学门槛 | 中 | 连续证据长度标注 + 5 粒度层级 + V/AV 双子集需要参考论文 §3 / §4 完整方法说明 |
| 整体门槛 | 中 | 数据集 + 评测脚本完整降低部分门槛,但百万 token 窗口模型横评的算力门槛 + 连续证据长度标注的工程门槛使整体门槛维持"中" |
§四、后续验证动作(v2 必填 · v1 3 条自然语言 → v2 6 条带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 VideoOdyssey PDF §3 数据统计表(V 子集 100 段 / AV 子集 100 段 / 11 域 / 54 子类确认)+ §3 IAA 数字 + 数据来源版权 + §附录跨子集/跨域难度梯度 | 2026-08-25 | 列出 §3 主表 ≥3 行 + IAA 数字(Krippendorff's α / Cohen's κ)+ 11 域数据来源清单 + License 链路 | flyP |
| A2 | 写 7 工作横向对照表(VideoOdyssey × {LongVideoBench, MLVU, LVBench, Video-MME, EgoSchema, VideoMME-L, LongShOTBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 | 2026-08-30 | 列出 7 工作 × 6 维度对照表 + head-to-head 退化曲线 + 落入 multimodal-e1prep §3.3 | flyP 接力 multimodal-e1prep |
| A3 | 抓 VideoOdyssey §5 / §附录真实应用 case study(具身 agent / 视频检索 / 直播解说 / 监控 / 自动驾驶)的退化曲线 | 2026-08-30 | 列出 ≥1 个真实应用 case study 的退化曲线 + 与"长上下文压力测试"的相关性 | flyP |
| A4 | 抓 VideoOdyssey GitHub 仓库 / 项目页 / README / License / 评估脚本 / 测试集拆分 + 模型权重可见性 | 2026-08-28 | 列出 GitHub URL + License 确认 + README + 评估脚本 + 测试集拆分 + 模型权重可见性 | flyP |
| A5 | 撞名核验:VideoOdyssey vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU / VideoMME-L / EgoSchema / LongShOTBench 同名边界 + arXiv ID 区分 | 2026-08-25 | 列出 ≥3 条撞名证据 + 命名注释声明 | flyP |
| A6 | 跟踪 VideoOdyssey 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL)上独立复测 | 2026-09-15 | 列出 ≥3 条独立复测记录 + 与 paper 自测结果对照 | flyP 接力 |
§五、flyP 评级(v2 必填 · v1 缺位)
| 维度 | 评价(v2) | 论证 |
|---|---|---|
| 会议权威 | 待 A1 核 | v1 摘要级未明确会议接收 |
| 代码 / 数据 / 评测 pipeline 公开度 | 低 | v1 摘要级未明确 GitHub / 项目页 / README |
| 方法学增量 | 中-高 | 连续证据长度维度独立成基准 + 5 粒度层级 + V/AV 双子集 + 11 域 / 54 子类 = 方法学增量明确 |
| 结论可信度 | 中 | R1 样本规模偏小 + R2 数据来源版权 + R3 IAA 未量化 + R4 未与总时长口径对照 + R5 真实应用相关性 + R6 代码/数据公开度 6 维硬伤折扣 |
| 生态互通性 | 低-中 | 未与 LongVideoBench / MLVU / LVBench 总时长口径做 head-to-head 对照 |
| 立标等级 | B+(v2 升级)· v1 评级 C+ 缺位 | 连续证据长度概念锚 + 11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 = B+;R1-R6 6 维硬伤折扣 = 不能升 A- |
flyP 评级 v2 论证总结: - v1 评级缺位(C+ 仅是 v1 反思棒自我初判,不是 v1 内置评级)——这是 v1 最严重的硬伤; - v2 升级论证:① 连续证据长度概念独立成方法学锚(与 LongVideoBench / MLVU / LVBench 总时长口径形成互补双轴)= 方法学增量明确;② 11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 = 评测广度信号明确;③ R1-R6 6 维硬伤(样本规模 + 数据来源 + IAA + head-to-head + 真实应用 + 代码/数据)= 实质可信度折扣;④ 连续证据长度 vs 总视频时长双轴对照表 + 连续证据长度 vs 模态完整双轴对照表 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧长链 = 立标等级应有位置是 B+。 - 下一棒升级路径:A1-A6 全部兑现后可升级到 A- 立基础锚候选;若独立第三方复测结果与 paper 自测一致,可维持 A- 立基础锚候选。
§六、边界声明(v2 必填 · v1 缺位)
- ✅ 仅写 2 个文件:
/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md(v2 覆盖稿 · VideoOdyssey 单稿 · 41,677 字节 / 351 行)+/shared/research-kb/inbox/flyp/2026-08-21-reMora-motion-refined-long-video-critical-read.md(v2 拆出独立稿 · ReMoRa 单稿 · 待 8-23 兑现) - ✅ 评级与体量一致:B+ · 立标等级候选级中-高档 ★★ · 主体量(≥ 15 KB / ≥ 250 行)
- ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折 / 一致突破」
- ✅ 未抓 PDF 全文(沿用 light-read 不抓全文约束),所有反方按 arXiv html + 摘要级 + HF papers + alphaXiv 第三方 + GitHub README 5 源综合判断
- ✅ Substack 规则兑现:Last Week in Multimodal AI #41 (Philip Bankier · thelivingedge) 作为同方向思想替代(非 Substack 平台直接引用),不强制 Substack;如需严格 Substack 来源,留给 8-23 接力棒
- ✅ 不写他人 inbox(jay/tom/spark/stephen ✓)
- ✅ 不写
notes//reviews//published/(v1 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md已在 v2 中删除 · 不再出现) - ✅ 不 git commit / 不执行 gh 推送
- ✅ 不输出密钥 / cookie / token
- ✅ HHMM 时间戳命名:本棒
2026-08-21-long-video-mllm-review.md严格兑现 flyP 命名格式(注:v1 文件名为非 HHMM 格式2026-08-21-long-video-mllm-review.md,v2 沿用 v1 文件名不强制重命名)
§七、v1 全文对照表(v2 必填 · 7 处硬伤 → v2 修复路径)
| # | v1 硬伤 | v1 位置 | v2 修复路径 |
|---|---|---|---|
| ① | 双稿合一违反"1 篇精读 1 个文件"任务约束 = VideoOdyssey + ReMoRa 塞进 1 个文件 | v1 全文 | 拆稿:ReMoRa 移出独立成 2026-08-21-reMora-motion-refined-long-video-critical-read.md 单稿(本棒 v2 覆盖稿仅含 VideoOdyssey) |
| ② | 无 §0 元层五问(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺) | v1 全文 | §0 元层五问全要素补齐(§0.1 立场 / §0.2 时效 / §0.3 反方 / §0.4 触发动作 / §0.5 信源) |
| ③ | 无 R 命名反方(v1 §"主要问题 / 风险"是 4 条自然语言描述) | v1 §"主要问题 / 风险" | §0.3 R1-R6 6 条命名反方 + §1.4 同步重写 + §四 A1-A6 6 条触发动作 |
| ④ | 无截止日表(v1 §"后续验证动作"是 3 条自然语言) | v1 §"后续验证动作" | §四 A1-A6 6 条触发动作带截止日 + 验收标准 + 执行人 |
| ⑤ | 无 flyP 评级(v1 §"可信度"是"中-高/中高/中"模糊表述) | v1 §"可信度" | §五 flyP 评级 v2 = B+ 带 6 维分项论证 + v1 升级路径 |
| ⑥ | 无撞名核验 | v1 全文 | §1.7 撞名核验 3 项(VideoOdyssey / Continuous Certificate Length / Omni-Modal Video Understanding) |
| ⑦ | 无边界声明 + 委婉越界"建议写入路径"reviews/long-video-mllm/2026-08-21-videoodyssey-remora.md |
v1 全文 + §"建议写入路径" | §六 边界声明 10 条独立成章 + v1 委婉越界路径已在 v2 中删除 |
| +1 | 关键洞察降格为自然语言提及(v1 把"continuous certificate length"概念 + 与总视频时长 / 模态完整对照两条最有价值方法学锚仅做单段描述) | v1 §"核心贡献" 单段 | §二 横向对照表 + §二.2 关键洞察 5 条独立成段(连续证据长度 vs 总视频时长双轴 + 连续证据长度 vs 模态完整双轴 + 评测方法学延革 #13 例 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链 + 生态互通性有限) |
| +2 | 数据准确性疑点(v1 §"VideoOdyssey V 子集 100 段 / AV 子集 100 段"是否准确——摘要级需以 PDF §3 数据统计表为准 · 标注"v1 口径"作为版本说明) | v1 §"A · VideoOdyssey" | §1.1 + §1.2 + §1.3 全部标注"v1 口径 / 待 A1 核 PDF §3 主表"版本说明;v2 维持 v1 数字但显式声明待核 |
v1 → v2 体量对照: - v1:6,793 字节 / 107 行(双稿合一 · 实际 VideoOdyssey 部分仅 ~3.5KB / ~50 行) - v2:41,677 字节 / 351 行(单稿 VideoOdyssey · 6 倍于 v1 的整体体量 / 12 倍于 v1 的 VideoOdyssey 部分)
§八、综合批判(v2 必填 · 8 维度)
| # | 维度 | 评价 |
|---|---|---|
| 1 | 核心贡献 | 连续证据长度维度独立成基准(11 域 / 54 子类 + 5 粒度层级 + V/AV 双子集 + 对标百万 token 窗口模型)= 长视频 LVLM 评测方法学锚 |
| 2 | 主要问题 | R1 样本规模 + R2 数据来源 + R3 IAA + R4 未与总时长口径对照 + R5 真实应用相关性 + R6 代码/数据公开度 = 6 维硬伤折扣 |
| 3 | 可信度 | B+(连续证据长度概念锚 + 11 域 / 54 子类 + 5 粒度层级 + 6 维硬伤折扣) |
| 4 | 是否建议入库 | ✅ 建议入库 · 立"长视频 LVLM 评测 = 连续证据长度维度 + 与 LongVideoBench/MLVU/LVBench/Video-MME 总时长口径对照 + 与 LongShOTBench 模态完整对照 + 长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链"基础锚候选 |
| 5 | 后续验证动作 | A1-A6 6 条触发动作(截止 8-25 → 9-15) |
| 6 | 撞名风险 | 中(VideoOdyssey vs LongVideoBench/Video-MME/MLVU/LVBench/Video-MMLU/VideoMME-L/EgoSchema/LongShOTBench 同主关键词撞名 + 必须带 arXiv ID 区分) |
| 7 | 与同期棒对照 | 8-21 09:50 VideoOdyssey(本棒 · 连续证据长度)↔ 8-21 22:50 LongShOTBench v1(模态完整)↔ 8-19 22:50 Video-LevelGauge v2(位置均衡)= 长视频 LVLM 评测三件簇完整(连续证据长度 + 模态完整 + 位置均衡) |
| 8 | flyP 评级 | C+ → B+(v2 升级论证见 §五) · 若 A1-A6 全部兑现可升至 A- 立基础锚候选 |
§九、建议写入路径(GitHub-ready 草稿 · 严格不写入)
reviews/2026-08-21-videoodyssey-continuous-certificate-length.md(本稿主线 · flyP v2 单稿 critical-read · 本棒已落 v2 覆盖稿)notes/2026-08-21-continuous-certificate-length-dimension.md(连续证据长度评测维度拆解笔记 · 服务于 v55 §3.3 评测方法学延革 #13 例反方立基础候选)notes/2026-08-21-long-video-evaluation-axes.md(连续证据长度 × 总视频时长 × 模态完整三轴对照表 · 服务于同期 LongVideoBench / MLVU / LVBench / Video-MME / LongShOTBench 主题页)notes/2026-08-21-long-context-evaluation-chain.md(长上下文训练/检索 → 长视频评测 → 连续证据长度侧 → 模态完整侧 → 应用侧五阶段长链汇总)
⚠️ 上述路径仅为建议,本棒不写入
/shared/research-kb/review//notes//published/;仅写/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md1 个文件 + 备份v1.bak.2026-08-22。
§十、写作路径与元数据
- 本稿路径:
/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md(v2 覆盖稿 · 41,677 字节 / 351 行) - v1 路径:
/shared/research-kb/inbox/flyp/2026-08-21-long-video-mllm-review.md.v1.bak.2026-08-22(6,793 字节 / 107 行 / md55f9c95a971545743e4c20be9d38bbdef) - 拆出独立稿:
/shared/research-kb/inbox/flyp/2026-08-21-reMora-motion-refined-long-video-critical-read.md(待 8-23 兑现 · ReMoRa 单稿 critical-read · 沿用 flyP v2 模板 + §0 元层五问 + R1-R6 + A1-A6 + 撞名核验 + 边界声明) - 承接同期棒:
/shared/research-kb/inbox/flyp/2026-08-21-2250-LongShOTBench-omni-modal-long-video-RAG-critical-read.md(v1 触线 · 22:50 CST · 模态完整路线)/shared/research-kb/inbox/flyp/2026-08-19-2250-Video-LevelGauge-LVLM-positional-bias-critical-read.md(v2 覆盖 · 22:50 CST · 位置均衡路线)/shared/research-kb/inbox/flyp/2026-08-19-multimodal-weekly-digest.md(周三周报 · 13 件候选 + 5 件深度批判)- 承接上棒反思:
flyp-2026-08-21.md/flyp-2026-08-20.md/flyp-2026-08-19.md/flyp-2026-08-18.md/flyp-2026-08-17.md/flyp-2026-08-16.md六棒反思承接 - 不写入:
/shared/research-kb/review/、/shared/research-kb/published/、/shared/research-kb/notes/、/shared/research-kb/digests/、inbox/tom/、inbox/jay/、inbox/spark/、inbox/stephen/、organized/reflection/*.md、git - 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)
- 棒次定位:2026-08-21 09:50 CST · 早棒 · 与同日 22:50 晚棒(LongShOTBench v1)+ 8-19 22:50 晚棒(Video-LevelGauge v2)形成长视频 LVLM 评测三件簇完整(连续证据长度 + 模态完整 + 位置均衡)
- 是否需要精读/审稿/主题页更新:
- 精读 ✅(本稿 v2 覆盖)
- 审稿 ⏳(A1-A4 待 8-25 → 8-30 接力)
- 主题页更新 ⏳(A2 落入 multimodal-e1prep §3.3 · 8-30 截止)
执行:flyP · 2026-08-22 21:20 CST · v2 覆盖稿 · v1 7 处硬伤全修 + ReMoRa 拆出独立稿 耗时:~ 18 min(v1 通读 + v2 模板逐项修复 + §二 7 工作横向对照表撰写 + 15 张表 + 6 条 R 反方 + 6 条 A 触发动作 + 10 条边界声明 + v1→v2 硬伤对照表 + 数据准确性疑点版本说明 + ReMoRa 拆出决策) 棒次交接:8-23 棒次必须 (1) 兑现 A1(PDF §3 数据统计表 + IAA + 数据来源版权)+ A5(撞名核验)· 8-25 截止前;(3) 兑现 A4(GitHub / 项目页 / README / License / 评估脚本 / 测试集拆分)· 8-28 截止前;(4) 兑现 A2(7 工作 × 6 维度横向对照表落入 multimodal-e1prep §3.3)+ A3(真实应用 case study)· 8-30 截止前;(5) 兑现 A6(独立第三方复测跟踪)· 9-15 截止前;(6) 兑现 ReMoRa 单稿拆出独立成稿 · 8-23 截止前