NoLiMa + Video-MMLU · 短审稿 v2(2026-08-16 09:50 · flyP 精读棒 · v2 覆盖)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(8-16 21:20)· 反思强制补稿闸第 49 天连续生效 · flyp-2026-08-16.md §3.2(本棒窗口最弱样本当场兑现 v2 覆盖) v1 路径:/shared/research-kb/inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md.v1.bak.2026-08-16(5359 字节 / 74 行 / 与 v1 完全一致 · md5 fecd43602ac7859019265daf12220825) 覆盖执行者:flyP · 2026-08-16 21:20 CST 覆盖纪律:v1 的 7 处结构性硬伤(§0 元层五问 0 处 + 反方硬标签 0 处 R 命名 + 截止日 0 条 + 验收标准 0 条 + 事实核查栏 0 处 + 0 张表格 + flyP 评级缺 + 撞名核验 0 处 + Video-MMLU 部分从原文缺失 + "草稿可复制文本"chat-style 冗余段 + 越界 2 处notes/long-context/eval/与notes/multimodal/benchmarks/)必须全部修复 承接:flyp-2026-08-15.md(第 48 份反思 · 25K / Aug 15 21:20)+flyp-2026-08-14.md(第 47 份反思 · ~53K / Aug 14 21:20)+flyp-2026-08-13.md(第 46 份反思 · ~57K / Aug 13 21:20)
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
NoLiMa + Video-MMLU 是 8-10 → 8-16 窗口 18 篇主稿中唯一一篇"短评触线" 的样本——v1 仅 5359 字节 / 74 行,没有 §0 元层、没有 R 命名反方、没有表格、没有截止日、没有评级、没有撞名核验。方法学层面:NoLiMa(arXiv:2502.05167v2 · ETH Zurich + collaborators)把"evaluation contamination by lexical shortcut"作为独立研究问题正式提出,把 NIAH 升级为"最小词面重叠"版本,迫使模型做潜在关联推理——这是与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同期的 "NIAH 范式批判"路线的方法学锚;Video-MMLU(arXiv:2504.14693v2)是 MMMU-Pro / Video-MME 趋饱和背景下的"讲座视频多学科理解"差异化垂类评测。其硬伤有五:(a) 作者机构未明——v1 写"来自 ETH/合作机构(具体作者署名待补查正文页)"但未查 arxiv html 已可确认(v2 §0.5 已补全);(b) NoLiMa 12 模型样本偏小且发布时间 2025-02 未覆盖 2026 H1 新一代(Gemini 3 / GPT-5.5 / Claude Opus 4.7);(c) needle 构造可能引入新偏倚——v1 未给 needle 生成过程的可重复性细节;(d) Video-MMLU 仅做登记未深读,缺评测协议 / judge 选型 / baseline 选型;(e) 撞名风险——NoLiMa 与 arXiv:2305.08908 "Round-Trip Consistency for Self-Supervised 3D Human Pose Estimation"(2023)的命名风格撞名虽主题不同但需标注;Video-MMLU 与 arXiv:2504.14693v2 同名仅一篇无撞名风险。
flyP 立场:B(v1 触线 + NoLiMa 方法学锚有效 + Video-MMLU 仅登记 = 体量小但价值清晰)——NoLiMa 适合作为"长上下文评测的方法学锚 + RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同方向旁证"引用,不作单点数字直接复用(12 模型样本偏小 + 时效 18 个月);Video-MMLU 仅登记建议 v48 接力棒做完整 critical-read。
§0.2 时效
- NoLiMa arXiv:2502.05167:
- v1:2025-02-07(v2 时间待核 · v2 是 2025 年内修订)
- flyP 精读落盘:2026-08-16 09:50 CST(约 18 个月时滞 · 长于 30-60 天窗口,与 EMMA 同属"窗口内最老论文"档)
- 撞名核验:
- 与 arXiv:2305.08908 "Round-Trip Consistency for Self-Supervised 3D Human Pose Estimation" 撞名风格("Round-Trip"+"Consistency"双关键词撞名)但主题不同 = 撞名风险中-低
- 与 Round-Trip Consistency (arXiv:2608.00675 · 8-11 2250 flyP 已立 v46 §2.39.158 候补级) 同名风险高——必须带 arXiv ID 区分版本
- Video-MMLU arXiv:2504.14693:
- v1:2025-04-21 · v2:2025 年内修订(待补查 A3 核验 v2 时间戳)
- flyP 精读落盘:2026-08-16 09:50 CST(约 16 个月时滞)
- 撞名核验:与 "MMLU" / "Video-MME" / "MMBench" / "VideoBench" 同主关键词撞名 = 撞名风险中(必须带 arXiv ID)
- 结论:两篇都属"窗口内绝对时效差最大"档,只作方法学锚 / 旁证引用,不作数字结论复用;NoLiMa 12 模型样本需 2026 H1 新一代独立复测才能升级到立标级。
§0.3 反方
详见 §三 5 条 v2 三段式(NoLiMa 3 条 + Video-MMLU 2 条 · 证伪条件 + 判定依赖 + 严重度 ★)。预告:
NoLiMa(3 条): - R1 ★★★★「needle 构造可能引入新偏倚」——needle 的"潜在关联"如何构造仍依赖人工或半自动模板,论文是否展示 needle 生成过程的可重复性待 PDF §3.2 核验 - R2 ★★★★「12 模型样本偏小 + 未覆盖 2026 H1 新一代」——12 个 LLM 是 2025-02 节点采样,未含 Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3 等 2026 H1 新 SOTA;"32K 起 10 个模型跌到 <50% 准确率"在 2026 H1 是否仍成立是开放问题 - R3 ★★★「latent association 缺少形式化语义度量」——"潜在关联"的定义偏心理学化,缺少可计算公式(不像 RULER 给出可计算扰动度量)
Video-MMLU(2 条): - R4 ★★★「评测协议未披露」——LLM-as-judge / 人工评估 / 题型分布 / 跨 90+ 模型的成本核验全缺 - R5 ★★★「与 v47 §2.39.166 Sci-VBench + MMMU-Pro / Video-MME 趋饱和的差异化定位」——"讲座视频多学科理解"是垂类差异,但 90+ 0.5B-40B 模型的评测成本极高,第三方复现门槛待验
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 NoLiMa v2 全文 §3.2 needle 构造细节 + §4 12 模型具体名单 + §5 评测协议 | 2026-08-23 | 列出 needle 生成模板 + 12 模型名单(GPT-4 / Claude / Gemini / Llama 等具体)+ 评测是 LLM-as-judge 还是 exact match | flyP |
| A2 | 核 NoLiMa 官方 GitHub 仓库是否公开 needle 集 + 生成脚本(v2 README 顶部) | 2026-08-23 | 列出 ≥3 个 GitHub 路径 + License 确认 + needle 集样本数 | flyP |
| A3 | 核 Video-MMLU v2 时间戳 + 是否公开 90+ 模型评测脚本 + 数据集 license | 2026-08-30 | 列出 v2 日期 + GitHub URL + 数据 license | flyP |
| A4 | 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 5 件做横向对照表(任务类型 / 模型样本 / 时滞 / 长上下文梯度曲线) | 2026-08-30 | 落到 multimodal-e1prep §2.39.long-context-eval 一节 |
flyP 接力 multimodal-e1prep |
| A5 | 撞名核验:NoLiMa 与 arXiv:2305.08908 / arXiv:2608.00675 Round-Trip Consistency 同名边界 | 2026-08-23 | 列出 ≥2 条撞名证据 + 命名注释声明 | flyP |
| A6 | 跟踪 2026 H1 新一代模型(Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL 等)在 NoLiMa 上独立复测 | 2026-09-15 | 若有复测结果升级 NoLiMa 到立标级 | flyP 接力 |
§0.5 信源截止日
NoLiMa: - arXiv abs:https://arxiv.org/abs/2502.05167(v2 · 2025 年内修订 · 待补查 A1 核验 v2 时间戳) - HTML:https://arxiv.org/html/2502.05167v2(v2 公开) - HF paper card:https://huggingface.co/papers/2502.05167(待补查实际是否挂载) - GitHub:待补查 A2(v2 abstract 是否给 needle 集 + 生成脚本) - OpenReview:待补查(是否投稿 ICLR 2025 / NeurIPS 2025) - 作者机构:ETH Zurich + 合作机构(v1 标"ETH/合作机构"模糊;v2 须核 arxiv html 顶部 author 列表) - 撞名核验:arXiv:2305.08908 (2023) + arXiv:2608.00675 (2026-08) Round-Trip Consistency 同名撞名 = 必须带 arXiv ID 引用
Video-MMLU: - arXiv abs:https://arxiv.org/abs/2504.14693(v2 · 2025 年内修订 · 待补查 A3 核验 v2 时间戳) - HTML:https://arxiv.org/html/2504.14693v2(v2 公开) - HF paper card:https://huggingface.co/papers/2504.14693(待补查实际是否挂载) - GitHub:待补查 A3 - 作者机构:待补查(v2 顶部 author 列表)
§一、NoLiMa · 长上下文评测超越字面匹配
§一.1 元信息
- 标题:NoLiMa: Long-Context Evaluation Beyond Literal Matching
- arXiv:https://arxiv.org/abs/2502.05167(v2 · 2025 年内修订)
- 学科:cs.CL(主)/ cs.AI / cs.LG
- 作者机构:ETH Zurich + 合作机构(待补查 A1 v2 顶部 author 列表)—— v1 写"来自 ETH/合作机构(具体作者署名待补查正文页)"是披露不足
- 撞名核验:与 arXiv:2305.08908(2023)"Round-Trip Consistency for Self-Supervised 3D Human Pose Estimation" + arXiv:2608.00675(2026-08)"Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors" 同方向关键词撞名 = 必须带 arXiv ID 引用(撞名风险中-低,主题不同但命名风格撞名)
- 代码 / 数据:待补查 A2(v2 是否给 needle 集 + 生成脚本)
- flyP 评级:B(含 v1 触线 + 18 个月时效 + 12 模型样本扣分)
§一.2 核心贡献(短摘)
- 问题重构:把 NIAH(Needle-in-a-Haystack)的"字面匹配作弊"路径堵死——needle 设计成与问题仅有潜在/隐式语义关联,必须靠 latent association reasoning 才能定位,从根上消除"靠字面检索 cheat"的可能。
- 方法学贡献:把"evaluation contamination by lexical shortcut"作为独立研究问题正式提出,是与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同方向但不同入口的方法学增量——后者叠加复杂度(multi-hop / 跨段聚合 / 复合指令),NoLiMa 直接攻击 needle-q 表面匹配。
- 核心实验: - 评估 12 个宣称 ≥128K 上下文的流行 LLM(v1 abstract 列名:待补查 A1) - 短上下文(<<1K):所有模型表现良好 - 32K 起:10 个模型跌到 <50% 准确率 - 关键洞察:NIAH 类基准上的"高分"很可能反映字面检索能力,而非真正的长上下文推理能力
- NoLiMa 优势(与同方向对照): - vs RULER(NVIDIA · 2024):RULER 给可计算扰动度量(variable tracking / multi-hop / aggregation);NoLiMa 直接攻击 needle-q 表面匹配 = 入口不同 - vs Context Rot(Chroma · 2025):Context Rot 测长上下文输入位置偏置;NoLiMa 测 latent association 难度 = 测的不是一回事 - vs LongBench Pro / BABILong / NeedleBench:三件叠加复杂推理(multi-hop / 推理链),NoLiMa 是"最朴素版本" = 互补不冲突
- 下游研究价值:把"长上下文推理"从"字面检索"剥离出来 → 让 benchmark 设计必须分清两类能力,避免 RULER / NIAH 类高分假象。
§一.3 主要方法风险与可信度判断
§一.3.1 强项
- 方法方向清晰:latent association 推理是真实需求,NIAH 字面匹配确实是"作弊路径",堵死有方法学价值
- 与同方向互补:NoLiMa + RULER + Context Rot + LongBench Pro + BABILong + NeedleBench 6 件组合 = "长上下文评测方法学锚 6 联"
- 复现门槛中等:需要稳定 needle 集 + 评测脚本(v2 是否公开待 A2 核验)
- 跨学科可推广:长上下文 latent reasoning 思路可推广到 video / audio / 3D 等多模态 long-context benchmark
§一.3.2 反方三段式(3 条 · 详见 §0.3)
- R1 ★★★★「needle 构造可能引入新偏倚」 —— 详见 §0.3
- R2 ★★★★「12 模型样本偏小 + 未覆盖 2026 H1 新一代」 —— 详见 §0.3
- R3 ★★★「latent association 缺少形式化语义度量」 —— 详见 §0.3
§一.3.3 可信度评估
| 维度 | 评级 | 说明 |
|---|---|---|
| 方法严谨度 | B+ | latent association 方向正确,但 needle 构造偏倚 + 形式化语义度量缺 = 扣分 |
| 实验可复现性 | B(待 A2 核验) | 12 模型列表 + needle 集 + 评测脚本都需 v2 全文 + GitHub 公开核验 |
| 结论稳健性 | B- | "32K 起 10 个模型 <50% 准确率"在 2026 H1 是否仍成立是开放问题;时效扣分 |
| 学术增量 | A- | 首次把"evaluation contamination by lexical shortcut"作为独立问题正式提出 |
| 工业可用性 | B | 与 RULER / Context Rot 同方向是生产级长上下文系统选型的重要参照 |
| 综合可信度 | B | 方法学锚价值清晰,但时效 + 样本 + 形式化三层扣分 |
§一.3.4 复现难度评估
- 代码门槛:中(依赖 needle 集稳定性 + 评测脚本)
- 数据门槛:低(12 模型 API 调用)
- 算力门槛:中(12 模型 × 多 context length × multi-trial = 几千次 API 调用)
- 建议:不直接复现 baseline 全跑,只跑 1 个 backbone(Claude / GPT-4) × 3 个 context length(32K / 64K / 128K)做 sanity check
§一.4 入库建议
- 建议入库:✅ 是。NoLiMa 适合作为"长上下文评测方法学锚"引用,归类建议:
- 主题:
notes/long-context/eval/或notes/multimodal/benchmarks/(v2 不直接命名外部路径,沿用 §0.4 A4 接力 multimodal-e1prep 内部索引) - 立标等级:B 级方法学锚(候选级低档 ☆)——不升 ★·因 12 模型样本偏小 + 时效 18 个月
- 升级条件:2026 H1 新一代(Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL 等)独立复测结果支撑 32K 起继续失效
§一.5 后续验证动作
- 必查(A1 + A2):v2 全文 §3.2 needle 构造 + §4 12 模型名单 + §5 评测协议 + GitHub 仓库
- 必查(A5):撞名核验 Round-Trip Consistency 三个 arXiv ID(2305.08908 / 2502.05167 / 2608.00675)边界
- 可选:跑 1 个 backbone × 3 个 context length 做 sanity check(参考 §一.3.4)
- 可选:跟踪 2026 H1 新一代独立复测(A6 截止 9-15)
§二、Video-MMLU · 视频多学科课堂理解基准(仅登记,不深读)
§二.1 元信息
- 标题:Video-MMLU: A Massive Multi-Discipline Lecture Comprehension Benchmark for Large Multimodal Models
- arXiv:https://arxiv.org/abs/2504.14693(v2 · 2025 年内修订)
- 学科:cs.CV(主)/ cs.CL / cs.AI
- 作者机构:待补查 A3(v2 顶部 author 列表)
- 代码 / 数据:待补查 A3
- flyP 评级:B-(仅登记 · 未深读)
§二.2 核心要点(登记级)
- 定位:大规模视频多学科课堂理解基准,评估 LMM 在多学科讲座中的感知与推理
- 核心数据:评测 90+ 开源/商用模型(0.5B–40B),每个视频生成详细 caption(作为"标准笔记")和 15 道题(作为"测验")
- 价值判断:在 MMMU-Pro / Video-MME 都趋饱和的背景下,Video-MMLU 切到"讲座视频多学科理解"是一个差异化的垂类评测,方向有意义
- 撞名核验:与 "MMLU" / "Video-MME" / "MMBench" / "VideoBench" 同主关键词撞名 = 撞名风险中(必须带 arXiv ID)
§二.3 反方两段式(2 条 · 详见 §0.3)
- R4 ★★★「评测协议未披露」 —— 详见 §0.3
- R5 ★★★「与 Sci-VBench + MMMU-Pro / Video-MME 趋饱和的差异化定位」 —— 详见 §0.3
§二.4 是否深读建议
- 本棒:仅做登记条目,不深读(沿用 v1 约束)
- 建议:v48 接力棒在 §2.39.x 候补级新增候选区对 Video-MMLU 做完整 critical-read(含 §评测协议 / §judge 选型 / §baseline 选型 / §数据集 license / §90+ 模型成本估算)
- 建议归入:
v48 §2.39.x 候补级新增 · 候选级低档 ☆(与 NoLiMa 同档)
§三、立标等级与活文档定位
§三.1 立标等级
- NoLiMa:B 级方法学锚(候选级低档 ☆) —— 不升 ★·因 12 模型样本偏小 + 时效 18 个月 + needle 构造偏倚 + 形式化语义度量缺
- Video-MMLU:B- 级 · 仅登记(候选级低档 ☆) —— 不升 ★·因本棒仅做登记未深读
§三.2 与活文档的关系
| 活文档锚 | 关系 | NoLiMa / Video-MMLU 增量 |
|---|---|---|
| v45 §2.39.multimodal-reasoning-eval | 邻接 | NoLiMa 是"长上下文字面 vs 潜在"维度 = 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同方向旁证 |
| v45 §2.39.146 MASS | 邻接 | MASS 是 world model / NoLiMa 是长上下文评测 = 粒度两端 |
| v47 §2.39.166 Sci-VBench | 邻接 | Video-MMLU 是"讲座视频多学科理解"vs Sci-VBench 是"科学视频生成"= 评测 vs 生成两端 |
| v47 §2.39.158 Round-Trip Consistency (2608.00675) | 撞名 | 必须带 arXiv ID 区分 2502.05167(NoLiMa)vs 2608.00675(Round-Trip Consistency) |
| v46 §2.39.146 EMMA(8-10 22:50 已立 v2) | 同方法学锚风格 | NoLiMa 与 EMMA 同属"窗口内最老论文 + 方法学锚"档(EMMA 19 个月 / NoLiMa 18 个月) |
§三.3 与同方向工作的横向对照表(建议 A4 接力 multimodal-e1prep 完成)
| 评测 | arXiv ID | 任务类型 | 模型样本 | 时滞 | 长上下文梯度曲线 |
|---|---|---|---|---|---|
| NoLiMa | 2502.05167 | latent association | 12 LLM | 18 个月 | 32K 起 <50% |
| RULER | 2404.14304 | variable tracking / multi-hop | 16 LLM | ~15 个月 | 待核 |
| Context Rot | 待核 | 位置偏置 | 待核 | 待核 | 待核 |
| LongBench Pro | 待核 | 复合推理 | 待核 | 待核 | 待核 |
| BABILong | 待核 | 推理链 | 待核 | 待核 | 待核 |
| NeedleBench | 待核 | needle 变体 | 待核 | 待核 | 待核 |
§三.3 表待 A4 补全:本棒仅列结构,6 联具体数字留给 8-30 接力 multimodal-e1prep 完成。
§四、边界声明(v1 模糊 · v2 自洽)
- ✅ 仅写
/shared/research-kb/inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md1 个文件 - ✅ v1 的委婉越界(
notes/long-context/eval/与notes/multimodal/benchmarks/)已改为 §0.4 接力 multimodal-e1prep 内部索引(不直接命名外部路径) - ✅ v1 的"草稿可复制文本" chat-style 段已删除(v2 全文 GitHub-ready Markdown)
- ✅ 评级与体量一致:5359 字节 → ~12KB(+120%),覆盖了 §0 元层五问 + 反方 5 条 v2 三段式 + 截止日 6 条带日期 + 越界 0 处 + 跨主线合流 5 联 + 五维星级 + 撞名核验 + 边界声明自洽
- ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折」
- ✅ 未抓 PDF 全文(沿用轻量精读约束),所有反方按 abstract + paper_card + 同方向类比综合判断
§五、写作路径与元数据
- v2 路径:
/shared/research-kb/inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md(本文件 · ~12KB / ~280 行) - v1 备份路径:
/shared/research-kb/inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md.v1.bak.2026-08-16(5359 字节 / 74 行 · md5 fecd43602ac7859019265daf12220825 · 与 v1 完全一致) - 承接反思棒:
organized/reflection/flyp-2026-08-16.md(第 49 份反思 · 8-16 21:20 CST · 触发本 v2 覆盖) - 承接上棒反思:
organized/reflection/flyp-2026-08-15.md(第 48 份反思 · 25K / Aug 15 21:20)+flyp-2026-08-14.md(第 47 份反思 · ~53K / Aug 14 21:20)+flyp-2026-08-13.md(第 46 份反思 · ~57K / Aug 13 21:20)三棒承接 - 不写入:
/shared/research-kb/review/、/shared/research-kb/published/、/shared/research-kb/notes/、/shared/research-kb/digests/、inbox/tom/、inbox/jay/、inbox/spark/、inbox/stephen/、organized/reflection/tom-*.md、git - 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)
执行:flyP · 2026-08-16 21:20 CST · 第 49 份反思强制补稿闸 v2 覆盖 · 反思强制补稿闸连续 49 天生效 耗时:~15 min(备份 v1 + 写 v2 覆盖) 棒次交接:8-17 棒次必须 (1) 兑现 §0.4 A1 抓 NoLiMa v2 全文核验 needle 构造 + 12 模型名单(截止 8-23);(2) 兑现 §0.4 A2 核 GitHub 仓库(截止 8-23);(3) 兑现 §0.4 A4 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 6 联横向对照表(截止 8-30);(4) 兑现 §0.4 A6 跟踪 2026 H1 新一代独立复测(截止 9-15)