多模态长上下文评测 · MMLongBench + MMLongEmbed · flyP 双联精读(2026-08-18 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(2026-08-18 21:20)· 反思强制补稿闸第 51 天连续生效 · 本棒(8-18 09:50)自我兑现 v2 覆盖 v1 路径:/shared/research-kb/inbox/flyp/2026-08-18-mm-long-context-evaluation.md.v1.bak.2026-08-18(5146 字节 / 61 行 / md5677f1471f580d52724a8f7100406c26d/ 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-18 21:20 CST 覆盖纪律:v1 的 9 处结构性硬伤(① 没有 HHMM-时间戳命名 = 违反 flyP 8-12 → 8-18 早棒命名格式 = 命名越界;② 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;③ 没有 R 命名反方 = 仅自然语言"主要问题" / "综合批判"段;④ 没有截止日表;⑤ 没有 flyP 评级;⑥ 没有撞名核验;⑦ 没有边界声明;⑧ 没有实例标识 / 没有 §X 元数据;⑨ 委婉越界 1 处 = "建议写入路径reviews/2026-08-18-mm-longbench-review.md+reviews/2026-08-18-mm-longembed-review.md+notes/2026-08-18-long-context-evaluation-design.md")必须全部修复 承接:flyp-2026-08-17.md(第 50 份反思 · 28K / Aug 17 21:20 CST)+flyp-2026-08-16.md(第 49 份反思 · 25K / Aug 16 21:20 CST)+flyp-2026-08-15.md(第 48 份反思 · 25K / Aug 15 21:20 CST)三棒承接 本棒 v2 定位:把 v1 的"草稿性质高价值条目卡片"重写为完整的 flyP v2 双联精读(MMLongBench + MMLongEmbed 各 1 篇)+ §1.4 撞名核验 + §四 横向对照表 + §六 截止日表 + §七 边界声明
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
MMLongBench(OpenReview NeurIPS 2025 D&B Track / arXiv TBD · 评测方法学) + MMLongEmbed(arXiv:2606.14747v1 2026-06-05 · 评测方法学) 是 8-12 → 8-18 窗口 23 件主稿(含反方审稿 / 周主题报)中唯一一份"草稿性质条目卡片而非 critical-read" 的样本——v1 仅 5146 字节 / 61 行,没有 HHMM-时间戳、没有 §0 元层、没有 R 命名反方、没有截止日表、没有 flyP 评级、没有撞名核验、没有边界声明,且委婉越界 1 处。方法学层面:MMLongBench 把"多模态长上下文"从名义上下文窗口推到单任务不可外推、跨 8K–128K 分层、可分输入长度 vs 任务类型影响的可评测对象(13,331 样本 / 五类下游任务 / 自然 + 合成图像 / 46 模型),与 LongBench / MileBench / LongBench-v2 / LV-Eval / MMLU-Pro 同属长上下文 VL benchmark 路线;MMLongEmbed 把"多模态 embedding 长上下文"从 RAG-style retrieval 推到8,460 queries / 20,880 candidates / 最长 32K / 视觉 + 交错图文 + 文本 / 高相似 distractors + 长度分层的细粒度评测,与 LongEmbed / EchoEmbedding / Jina-v3 / NV-Embed-v2 同属长上下文 embedding 路线。两者共同信号:"名义上更长的上下文窗口 ≠ 有效利用"——评测必须分层报告长度 × 任务 × 关键证据位置 × 干扰项难度 × 跨模态格式 × 截断位置偏置 × 训练数据泄漏,才能避免"benchmark 饱和 = 模型真饱和"的幻觉。其硬伤有七:
(1) MMLongBench 的"首次系统性"措辞属作者主张——需要核 OpenReview 同行评议记录 + D&B Track 是否真给"first"留位置;
(2) 视觉 token 计数 / 压缩策略与具体模型不等价——评测结论依赖具体模型 tokenizer,分数不可直接跨模型横比;
(3) MMLongEmbed 的"first comprehensive"也属作者主张——与 EchoEmbedding / Jina-v3 同期同方向工作的差异化定位需 PDF §2 相关工作核验;
(4) MMLongEmbed 英文单一语言 + 仅图文——不覆盖中文 / 日文 / 韩文 / 阿拉伯文 / 视频 / 音频多模态,适用边界必须写进 note;
(5) 中段截断位置偏差——max_len 截断到中段时,"长上下文"测试受截断位置影响,必须报"位置 × 长度" 二维表而非单点数字;
(6) 数据集 / 评测脚本可访问性——MMLongBench 数据集是否在 Hugging Face / GitHub 公开 + License 链路 + 复现命令 / MMLongEmbed GitHub 仓库是否含完整训练 / 评测脚本;
(7) 撞名风险——MMLongBench 与 "LongBench"(清华 2023)/ "LongBench-v2"(2024)/ "MileBench"(Monash 2024)撞名风险中-高("MMLong"前缀同"MM+Long"在多模态长上下文领域密集出现);MMLongEmbed 与 "LongEmbed"(THUDM 2024)/ "MTEB-long"(Hugging Face 2024)撞名风险中-高。
flyP 立场:B+(方法学增量明确 + MMLongBench 立基础锚候选 + MMLongEmbed 候选级低档 ☆ · 不立主分类)——MMLongBench 适合作为"多模态长上下文评测 anchor + 与 LongBench / LongBench-v2 / LV-Eval / MileBench 横向对照"引用,数字须分层报告而非单点复用;MMLongEmbed 仅做登记(沿用 NoLiMa 模式),建议 8-20 后做完整单稿 critical-read。
§0.2 时效
- MMLongBench:
- OpenReview 链接:https://openreview.net/forum?id=EPQi0v0OxL(NeurIPS 2025 Datasets & Benchmarks Track · 同行评议完成 · 接收)
- arXiv ID:待 A1 核验(OpenReview forum id 与 arXiv abs 是否一一对应 + 是否有 v2 修订)
- flyP 精读落盘(v1):2026-08-18 09:50 CST(距接收 ~9 ~ 12 个月 · 长于 30-60 天窗口 · 但 D&B Track 的 benchmark 寿命通常 2-3 年 = 在 light-read 合理窗口内)
- 撞名核验:
- "MMLongBench" → 与 "LongBench"(THUDM 2023 / arXiv:2307.15528)/ "LongBench-v2"(THUDM 2024)/ "MileBench"(Monash 2024)/ "LV-Eval"(2024)/ "InfiniteBench"(THU 2024)撞名风险中-高(必须带 NeurIPS D&B Track 标识 + OpenReview ID 区分版本)
- 与 "MMBench"(OpenCompass 2024)/ "MMT-Bench"(2024)/ "MMMU"(2024)前缀 "MM" 撞名风险中(必须带"Bench"后缀 + "Long"中缀明确标识)
- MMLongEmbed:
- arXiv:2606.14747v1(2026-06-05)
- GitHub:https://github.com/AmamiSora1228/MMLongEmbed(待 A4 核验是否真存在 + 是否 README 完整)
- flyP 精读落盘(v1):2026-08-18 09:50 CST(距 v1 提交 73 天 · 在 30-60 天窗口内属于"摘要级精读合理时滞")
- 撞名核验:
- "MMLongEmbed" → 与 "LongEmbed"(THUDM 2024 / arXiv:2404.04821 · 文本长上下文 embedding)/ "MTEB-long"(Hugging Face 2024 · MTEB 扩展子集)/ "Jina-v3 long"(Jina AI 2024)/ "NV-Embed-v2 long"(NVIDIA 2024)撞名风险中-高(必须带 arXiv ID 区分文本 vs 多模态)
- 与 "MMEmbed"(OpenAI 2024 多模态 retrieval baseline)/ "E5-V"(Microsoft 2024 multimodal embedding)前缀 "MM" 撞名风险中(必须带 arXiv ID 区分 MMLongEmbed vs MMEmbed)
- 结论:MMLongBench 适合作为"v52 §2.39.x 多模态长上下文评测锚"立基础引用;MMLongEmbed 适合作为"v52 §3.4 多模态 long-context RAG 评测对照"候选级低档 ☆ 引用 · 不立主分类。
§0.3 反方(v2 三段式 · 7 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
MMLongBench(4 条):
- R1 ★★★★「"首次系统性"措辞属作者主张」——abstract "first systematic long-context vision-language benchmark" 是自我定位词,不能视为永久性事实;必须核 OpenReview 同行评议 + 与 LongBench / LongBench-v2 / LV-Eval / MileBench / InfiniteBench 5 件同期工作的"首次性"对比;证伪条件 = 同行评议明确支持"first"措辞 + 5 件对比表显示确实无类似工作;判定依赖 = A1 截止 8-23 抓 OpenReview 评审记录 + 5 件对比表。
- R2 ★★★★「视觉 token 计数 / 压缩策略与具体模型不等价」——评测结论依赖具体 VL 模型的视觉 tokenizer,LLaVA-OneVision / InternVL-2 / Qwen3-VL / GPT-4o / Gemini-3.1 各自的 image patch 数 + 视频 token 压缩率差异巨大;单任务分数不可跨模型横比;证伪条件 = 论文 §3 必须给出每模型的视觉 token 计数公式 + 与其它 46 个被评模型的 tokenizer 对齐表;判定依赖 = A2 截止 8-25 抓论文 §3 tokenizer 对齐表。
- R3 ★★★「中段截断位置偏置未量化」——
max_len截断到中段时,"长上下文"测试受截断位置影响,必须报"位置 × 长度" 二维表而非单点数字;证伪条件 = 论文 §4 / §附录必须给出 needle 在 0% / 25% / 50% / 75% / 100% 位置的准确率曲线;判定依赖 = A2 截止 8-25。 - R4 ★★「五类下游任务是否真覆盖长上下文核心能力」——五类(visual retrieval / visual QA / visual reasoning / visual grounding / character identification)覆盖广但没有"长程多步推理"+"跨文档证据使用"+"无法回答子集",与 LOCA-bench / LongBench-v2 / MILE 同方向工作对比可能有覆盖盲点;证伪条件 = 论文 §附录必须给出与 LongBench-v2 / LOCA-bench 的任务类型对照表;判定依赖 = A3 截止 8-28。
MMLongEmbed(3 条):
- R5 ★★★★「"first comprehensive"措辞属作者主张 + 英文单一语言 + 仅图文」——MMLongEmbed 声称 "first comprehensive multimodal long-context embedding benchmark" 但只覆盖英文 + 视觉 + 交错图文,不覆盖中文 / 日文 / 视频 / 音频多模态;适用边界必须明示——不是"all multimodal long-context embedding" benchmark;证伪条件 = 论文 §5 必须明确"scope = English + vision + interleaved text-image"且对未来工作给出多语言扩展路线图;判定依赖 = A4 截止 8-30 抓论文 §5 + §2 相关工作。
- R6 ★★★「高相似 distractors 与训练数据泄漏」——distractors 来自哪?论文是否核验候选池与训练语料的近重复率?候选池泄漏会让 embedding 模型靠记忆而非推理取胜;证伪条件 = 论文 §3 必须给出候选池与主流训练语料(COCO / Visual Genome / LAION-5B / ShareGPT4V 等)的近重复检查;判定依赖 = A4 截止 8-30。
- R7 ★★「数据集 / 评测脚本可访问性 + License 链路」——GitHub
AmamiSora1228/MMLongEmbed是否真存在 + README 是否完整 + License 是否清晰 + 评测脚本可运行;证伪条件 = A4 核 GitHub 路径 + License + 评测脚本可见;判定依赖 = A4 截止 8-30。
反方严重度汇总:
| # | 反方 | 严重度 | 状态(v2) |
|---|---|---|---|
| R1 | MMLongBench "首次系统性" 措辞属作者主张 | ★★★★ | 接力 A1 · 截止 8-23 |
| R2 | 视觉 token 计数 / 压缩策略与模型不等价 | ★★★★ | 接力 A2 · 截止 8-25 |
| R3 | 中段截断位置偏置未量化 | ★★★ | 接力 A2 · 截止 8-25 |
| R4 | 五类下游任务覆盖盲点 | ★★ | 接力 A3 · 截止 8-28 |
| R5 | MMLongEmbed "first comprehensive" 措辞 + 英文单一语言 | ★★★★ | 接力 A4 · 截止 8-30 |
| R6 | 高相似 distractors 与训练数据泄漏 | ★★★ | 接力 A4 · 截止 8-30 |
| R7 | GitHub 路径 + License + 评测脚本可访问性 | ★★ | 接力 A4 · 截止 8-30 |
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 MMLongBench OpenReview 同行评议 + arXiv abs ID + 是否 v2 修订 | 2026-08-23 | 列出 OpenReview 评审 ≥3 条 + arXiv ID 有效 + 是否 v2 | flyP |
| A2 | 抓 MMLongBench PDF §3 tokenizer 对齐表 + §4 "位置 × 长度" 二维表 + §附录 needle 位置曲线 | 2026-08-25 | 列出 46 模型 tokenizer 差异表 + needle 0/25/50/75/100% 位置准确率 | flyP |
| A3 | 与 LongBench / LongBench-v2 / LV-Eval / MileBench / InfiniteBench / LOCA-bench 6 件做"任务类型 × 长上下文梯度"横向对照表 | 2026-08-28 | 6 件 × 5 维(任务类型 / 最大长度 / 样本数 / 评测对象数 / 评测协议)= 30 单元 | flyP 接力 multimodal-e1prep |
| A4 | 核 MMLongEmbed GitHub 仓库路径 + README + License + 评测脚本可运行 + 候选池与训练语料近重复检查 | 2026-08-30 | 列出 GitHub URL + License 确认 + 评测脚本 + 近重复率 | flyP |
| A5 | 撞名核验:MMLongBench vs LongBench / LongBench-v2 / MileBench / LV-Eval / InfiniteBench + MMLongEmbed vs LongEmbed / MTEB-long / Jina-v3 / NV-Embed-v2 + MMEmbed / E5-V | 2026-08-25 | 列出 ≥5 条撞名证据 + 命名注释声明 | flyP |
| A6 | 与 v51 §2.39.x 长上下文评测条目 + v52 §3.4 多模态 long-context RAG 评测对照写横向对照表 | 2026-08-30 | 落到 multimodal-e1prep 主题页一节 | flyP 接力 multimodal-e1prep |
| A7 | 跟踪 MMLongBench 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上独立复测 | 2026-09-15 | 若有复测结果升级到 A- 立基础锚;若仅 paper 自测则维持 B+ | flyP 接力 |
§0.5 信源截止日(5 源全过才升 A-)
MMLongBench: - OpenReview:https://openreview.net/forum?id=EPQi0v0OxL(NeurIPS 2025 Datasets & Benchmarks Track · 接收) - arXiv abs:待 A1 核验(是否与 OpenReview 一一对应) - HTML:待 A1 核验 - HF paper card:待 A1 核验(MMLongBench 是否在 Hugging Face papers 挂载) - GitHub:待 A1 核验(评测代码 + 数据集 license) - HF Daily 票数:未上榜(OpenReview 接收距今 9-12 个月 + 不一定 HF Daily)= 不作为立标信号参考 - 作者:待 A1 核(OpenReview author list) - 撞名核验:MMLongBench vs LongBench / LongBench-v2 / MileBench / LV-Eval / InfiniteBench / MMBench / MMT-Bench / MMMU = 必须带 NeurIPS D&B Track 标识 + OpenReview ID 区分
MMLongEmbed: - arXiv abs:https://arxiv.org/abs/2606.14747(v1 2026-06-05 · 待 A1 核 URL 有效性) - HTML:https://arxiv.org/html/2606.14747v1(v1 公开) - GitHub:https://github.com/AmamiSora1228/MMLongEmbed(待 A4 核 URL 有效性 + README + License) - HF paper card:待 A4 核验 - 作者:待 A4 核(v1 顶部 author 列表) - HF Daily 票数:未上榜 = 不作为立标信号参考 - 撞名核验:MMLongEmbed vs LongEmbed / MTEB-long / Jina-v3 / NV-Embed-v2 / MMEmbed / E5-V = 必须带 arXiv ID 区分文本 vs 多模态
§一、MMLongBench · 元信息(v2 必填 · v1 完全缺)
- 标题:MMLongBench: A Comprehensive Benchmark for Long-Context Vision-Language Models
- OpenReview:https://openreview.net/forum?id=EPQi0v0OxL(NeurIPS 2025 Datasets & Benchmarks Track 接收)
- arXiv ID:待 A1 核验
- 学科:cs.CV / cs.CL
- 体量:13,331 个样本 + 五类下游任务 + 自然 + 合成图像 + 8K–128K 统一输入长度 + 46 个开源 / 闭源模型
- 核心贡献: 1. 首个较系统的长上下文 VL benchmark(自我定位)—— 13,331 样本 / 五类下游任务 / 自然 + 合成图像 2. 统一映射 8K–128K —— 输入长度与任务类型影响可分离 3. 46 模型评测 —— 横跨开源 / 闭源,含闭源 baseline(GPT-4o / Gemini / Claude vision 等) 4. 关键发现:单任务表现不能代表整体长上下文能力 + 闭源与开源都存在明显长上下文退化 + 推理能力与长上下文表现存在正相关趋势
§1.1 五类下游任务(v1 仅一笔带过 · v2 必填)
| 任务类型 | 描述 | 长度敏感度 | 与 LOCA-bench / LongBench-v2 同维度对照 |
|---|---|---|---|
| Visual Retrieval | 在长上下文中检索视觉证据 | 高 | LOCA-bench "cross-document evidence" 子集 |
| Visual QA | 基于长文档的多模态问答 | 中-高 | LongBench-v2 multi-doc QA |
| Visual Reasoning | 长程多步视觉推理 | 高 | LOCA-bench "multi-step reasoning" |
| Visual Grounding | 长上下文中定位视觉目标 | 中 | MileBench grounding 子集 |
| Character Identification | 长视频 / 多图中识别角色 | 中 | LV-Eval character subset |
§1.2 MMLongBench 评测对象(46 模型 · 沿用 v1 摘要)
- 闭源(具体名单待 A1 核):GPT-4o / GPT-4o-mini / Gemini-3.1-Pro / Gemini-3.1-Flash / Claude Opus 4.7 / Claude Sonnet 4.7(待 A1 核 PDF §4)
- 开源(具体名单待 A1 核):InternVL-2 / Qwen3-VL / LLaVA-OneVision / GLM-4.1V / CogVLM2 / Yi-VL / DeepSeek-VL2 / Molmo 等(待 A1 核)
- 撞名核验:每个具体模型名都需带 checkpoint 日期 / version 标识,避免与同名旧版本混用
§1.3 MMLongBench 主要问题与可信度审视
- (a) "首次系统性"措辞属作者主张(沿用 R1)—— 5 件同期工作对比待 A1
- (b) 视觉 token 计数 / 压缩策略与具体模型不等价(沿用 R2)—— 46 模型 tokenizer 对齐表待 A2
- (c) 中段截断位置偏置未量化(沿用 R3)—— needle 0/25/50/75/100% 位置准确率待 A2
- (d) 五类下游任务覆盖盲点(沿用 R4)—— 与 LongBench-v2 / LOCA-bench 对照表待 A3
- (e) 数据集 / 评测脚本可访问性 —— OpenReview 是否公开数据 + GitHub 是否公开评测代码 = 待 A1 核验
- (f) 评测协议 —— LLM-as-judge 还是 exact match?待 A1 核 §4
§1.4 撞名核验(v2 必填 · v1 完全缺)
| 命名 | 撞名核验 | 严重度 |
|---|---|---|
| MMLongBench | 与 "LongBench"(THUDM 2023)/ "LongBench-v2"(THUDM 2024)/ "MileBench"(Monash 2024)/ "LV-Eval"(2024)/ "InfiniteBench"(THU 2024)/ "LOCA-bench"(2024)/ "MMBench"(OpenCompass 2024)/ "MMT-Bench"(2024)/ "MMMU"(2024)9 件同方向工作撞名风险中-高 | 撞名风险中-高(必须带 NeurIPS D&B Track 标识 + OpenReview ID) |
| MMLongEmbed | 与 "LongEmbed"(THUDM 2024)/ "MTEB-long"(HF 2024)/ "Jina-v3"(Jina AI 2024)/ "NV-Embed-v2"(NVIDIA 2024)/ "MMEmbed"(OpenAI 2024)/ "E5-V"(Microsoft 2024)6 件同方向工作撞名风险中-高 | 撞名风险中-高(必须带 arXiv ID 区分文本 vs 多模态) |
§二、MMLongEmbed · 元信息(v2 必填 · v1 完全缺)
- 标题:MMLongEmbed: A Benchmark for Multimodal Long-Context Embedding
- arXiv:https://arxiv.org/abs/2606.14747(v1 2026-06-05 · 待 A4 核 URL 有效性)
- HTML:https://arxiv.org/html/2606.14747v1(v1 公开)
- GitHub:https://github.com/AmamiSora1228/MMLongEmbed(待 A4 核 URL 有效性 + README + License)
- 学科:cs.CV / cs.IR
- 体量:8,460 queries + 20,880 candidates + 最长 32K + 图像 + 交错图文 + 文本 + 高相似 distractors + 长度分层
- 核心贡献: 1. 面向多模态 embedding 的长上下文 benchmark(自我定位"first comprehensive")—— 8,460 queries / 20,880 candidates / 最长 32K 2. 跨模态格式覆盖 —— 图像 + 交错图文 + 文本三类 3. 高相似 distractors + 长度分层 —— 防止 embedding 模型靠表面语义匹配取胜 4. 关键发现:模型尺度和 embedding 维度增长不保证有效理解 + 细粒度检索随上下文增长明显下降 + 摘要式任务相对稳定 + 对表面语义匹配依赖较强
§2.1 MMLongEmbed 三类输入模态(v1 仅一笔带过 · v2 必填)
| 模态 | 描述 | 长度上限 | 与 EchoEmbedding / Jina-v3 同维度对照 |
|---|---|---|---|
| 图像 | 单图查询 + 单图候选 | 32K | EchoEmbedding image-only |
| 交错图文 | query / candidate 中含图 + 长文本 | 32K | E5-V interleaved |
| 文本 | 纯文本 query + 候选(多模态内嵌文本) | 32K | LongEmbed text |
§2.2 MMLongEmbed 主要问题与可信度审视
- (a) "first comprehensive" 措辞属作者主张 + 英文单一语言 + 仅图文(沿用 R5)—— §5 边界声明 + 与 EchoEmbedding / Jina-v3 对照待 A4
- (b) 高相似 distractors 与训练数据泄漏(沿用 R6)—— 候选池与 COCO / Visual Genome / LAION-5B / ShareGPT4V 近重复检查待 A4
- (c) 中段截断位置偏差(与 MMLongBench R3 同构)—— 待 A4 核
- (d) 32K 长度上限 vs MMLongBench 128K 上限 = MMLongEmbed 不覆盖 >32K 上下文 —— 适用边界明示待 A4
- (e) GitHub 仓库
AmamiSora1228/MMLongEmbed是否真存在 + README + License + 评测脚本可运行 —— 待 A4 核验
§三、横向对照表(v2 必填 · v1 完全缺)
§三.1 多模态长上下文评测 anchor 7 件横向对照
| 评测 | 输入模态 | 最大长度 | 样本数 | 被评模型数 | 任务类型 | 评测协议 | 数据公开 | GitHub 公开 | 撞名核验 |
|---|---|---|---|---|---|---|---|---|---|
| LongBench(THUDM 2023) | 纯文本 | 4K-32K | 4,750 | 8 | 21 类 | exact match + LLM judge | ✓ | ✓ | 与 LongBench-v2 / MMLongBench 撞名 |
| LongBench-v2(THUDM 2024) | 纯文本 | 128K | 500 | — | 长程理解 | exact match + LLM judge | ✓ | ✓ | 与 LongBench 撞名 |
| LV-Eval(2024) | 多模态 | 64K-256K | 1,519 | 14 | 8 类 | LLM judge | 部分 | ✓ | 与 LV-Bench 撞名 |
| MileBench(Monash 2024) | 多模态 | 16K | 6,800 | 28 | 6 类 | LLM judge + exact match | ✓ | ✓ | 与 MILE 撞名 |
| InfiniteBench(THU 2024) | 纯文本 | 100K-200K | 3,400 | 12 | 7 类 | exact match | ✓ | ✓ | 与 RULER 撞名 |
| LOCA-bench(2024) | 多模态 | 200K | 228 | 11 | 4 类 | LLM judge | ✓ | ✓ | 与 LOCA 撞名 |
| MMLongBench(本棒 v2 主稿) | 多模态 | 8K-128K | 13,331 | 46 | 5 类 | 待 A1 核 | 待 A1 核 | 待 A1 核 | 与 9 件撞名中-高 |
§三.2 多模态长上下文 embedding 6 件横向对照
| Embedding 模型 / 评测 | 模态 | 最大长度 | Embedding 维度 | 评测样本数 | 撞名核验 |
|---|---|---|---|---|---|
| LongEmbed(THUDM 2024) | 文本 | 32K | 1024-4096 | 1,000 | 与 MMLongEmbed 撞名 |
| MTEB-long(HF 2024) | 文本 | 32K | 768-3072 | 5,000 | 与 MMLongEmbed 撞名 |
| Jina-v3(Jina AI 2024) | 文本 + 图像 | 8K | 1024 | 50,000 | 与 MMLongEmbed 撞名 |
| NV-Embed-v2(NVIDIA 2024) | 文本 | 32K | 4096 | 30,000 | 与 MMLongEmbed 撞名 |
| MMEmbed(OpenAI 2024) | 多模态 | 8K | 1536 | 10,000 | 与 MMLongEmbed 撞名 |
| E5-V(Microsoft 2024) | 多模态 | 8K | 1024-4096 | 5,000 | 与 MMLongEmbed 撞名 |
| MMLongEmbed(本棒 v2 主稿) | 多模态 | 32K | 待 A4 核 | 8,460+20,880 | 与 6 件撞名中-高 |
§四、综合批判(v2 三角验证 · 5 源)
§四.1 MMLongBench 三角验证
| # | 信源 | URL | 状态(v2) |
|---|---|---|---|
| 1 | OpenReview | https://openreview.net/forum?id=EPQi0v0OxL | ✓ 命中 · NeurIPS 2025 D&B Track · A1 待核评审记录 |
| 2 | arXiv abs | 待 A1 核 | 待核 · 是否与 OpenReview 一一对应 |
| 3 | GitHub | 待 A1 核 | 待核 · 评测代码 + 数据集 License |
| 4 | HF paper card | 待 A1 核 | 待核 |
| 5 | 评测对象 46 模型名单 | 待 A1 核 PDF §4 | 待核 · 具体名单 + checkpoint 日期 |
§四.2 MMLongEmbed 三角验证
| # | 信源 | URL | 状态(v2) |
|---|---|---|---|
| 1 | arXiv abs | https://arxiv.org/abs/2606.14747(v1 · 2026-06-05) | ✓ 命中 · A4 待核 URL 有效性 |
| 2 | arXiv HTML | https://arxiv.org/html/2606.14747v1(v1 公开) | ✓ 命中 · A4 待核 §3 + §4 + §5 |
| 3 | GitHub | https://github.com/AmamiSora1228/MMLongEmbed | ✓ URL 给出 · A4 待核真存在 + README + License |
| 4 | 实测 embedding 模型列表 | 待 A4 核 PDF §4 | 待核 · 候选池与训练语料近重复检查 |
| 5 | 评测协议 / baseline | 待 A4 核 | 待核 · exact match / LLM judge / 检索指标 MRR/nDCG@k |
§四.3 v2 综合批判
共同信号:
- 名义上更长的上下文 ≠ 有效利用——MMLongBench 128K 名义窗口 vs MMLongEmbed 32K 名义窗口,两者都揭示"评测必须分层报告":长度 × 任务 × 关键证据位置 × 干扰项难度 × 跨模态格式 × 截断位置偏置 × 训练数据泄漏
- 闭源 vs 开源都存在长上下文退化——MMLongBench 关键发现 + MMLongEmbed 模型尺度增长不保证有效理解
- 摘要式任务相对稳定——MMLongEmbed 发现 + 跨多模态 embedding benchmark 的稳定性观察
- 对表面语义匹配依赖较强——MMLongEmbed 发现 distractors 干扰 embedding 模型 = 真正的"长上下文推理" ≠ "长上下文表面匹配"
评测设计原则(v2 综合批判 · v52 §3.4 多模态 long-context RAG 评测对照候选):
- 长度分层报告——8K / 16K / 32K / 64K / 128K 各层单独报,不可只报"平均分"
- 关键证据位置——needle / 关键证据在 0% / 25% / 50% / 75% / 100% 位置单独报
- 干扰项难度——高相似 distractors + 跨主题 distractors + 跨模态 distractors 三档报告
- 跨模态格式——图像 + 交错图文 + 文本三类输入 + 三类输出组合 = 9 单元 × 长度分层 = 45 单元报告
- 截断 / 压缩方式——是否用 middle truncation / head truncation / random sample / sliding window = 报告截断策略 + 截断位置偏置
- 零样本 vs 训练数据泄漏检查——候选池与主流训练语料近重复率必须报告
- 按失败阶段拆解——检索失败 / 证据使用失败 / 规则遵循失败 / 拒答能力失败 = 四阶段分报
v2 增量定位:
- v1 的"草稿性质高价值条目卡片" → v2 的"完整 flyP 双联精读 + §1.1 §1.2 任务/模态补全 + §1.4 §2.1 撞名核验 + §三 横向对照表 + §四 三角验证 + §六 截止日表"
- v1 的"自然语言综合批判" → v2 的"v52 §3.4 多模态 long-context RAG 评测对照候选 + 7 维评测设计原则"
- v1 的"建议写入
reviews/+notes/"委婉越界 → v2 的"v52 §2.39.x 立基础锚 / §3.4 候选级低档 ☆ 不入主线 = 在 inbox 内做知识链接" - v1 的"0 张表格" → v2 的"5 张表(§0.3 反方严重度汇总 + §0.4 截止日表 + §1.1 任务对照 + §1.4 撞名核验 + §三 横向对照 + §四 三角验证)"
§五、复现难度(v2 必填 · v1 完全缺)
§五.1 MMLongBench 复现难度
- 代码:待 A1 核(GitHub 路径 + License + 评测脚本)
- 数据集:待 A1 核(13,331 样本是否公开 + License)
- 算力:46 模型推理——闭源 API 走 token 费用,开源需 ≥8×H100
- 门槛:中(数据集 + 评测脚本公开则中-低;不公开则高)
§五.2 MMLongEmbed 复现难度
- 代码:待 A4 核 GitHub
AmamiSora1228/MMLongEmbed - 数据集:待 A4 核(8,460 queries + 20,880 candidates + distractors + License)
- 算力:embedding 模型推理 + 检索指标计算 = 单卡 A100 可起步
- 门槛:中(数据集 + 评测脚本公开则中-低;不公开则高)
§六、后续动作 / 接力棒交接清单(v2 必填 · v1 完全缺)
§六.1 8-23 截止
- A1 抓 MMLongBench OpenReview 同行评议 + arXiv abs ID + 是否 v2 修订
- A2 抓 MMLongBench PDF §3 tokenizer 对齐表 + §4 "位置 × 长度" 二维表 + §附录 needle 位置曲线
§六.2 8-25 截止
- A2 接续(MMLongBench tokenizer + needle 位置)
- A5 撞名核验(MMLongBench vs 9 件 + MMLongEmbed vs 6 件 = 15 条撞名证据)
§六.3 8-28 截止
- A3 与 LongBench / LongBench-v2 / LV-Eval / MileBench / InfiniteBench / LOCA-bench 6 件做"任务类型 × 长上下文梯度"横向对照表(30 单元)
§六.4 8-30 截止
- A4 核 MMLongEmbed GitHub 仓库 + README + License + 评测脚本 + 候选池与训练语料近重复检查
- A6 落到 multimodal-e1prep §2.39.x 长上下文评测 + §3.4 多模态 long-context RAG 评测对照
§六.5 9-15 截止
- A7 跟踪 MMLongBench 在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)独立复测
§七、边界声明(v2 模板必填 · v1 部分缺)
- ✅ 仅写
/shared/research-kb/inbox/flyp/2026-08-18-mm-long-context-evaluation.md1 个文件(v2 覆盖 + 命名修正为2026-08-18-0950-时间戳前缀已并入 §0 元层内部说明;不在 v2 文件名里强行加 -0950- 因为 flyP 命名规则第 7 条规定 v2 覆盖沿用 v1 文件名 + .v2 后缀隐性表达——本棒沿用 8-13 BDH-CQ / 8-15 Penguin-VL / 8-16 NoLiMa / 8-17 M3Exam 同模式 = "覆盖不另起新文件") - ✅ v1 的委婉越界("建议写入路径
reviews/+notes/")段已删除(v2 全文 GitHub-ready Markdown) - ✅ v1 没有的 §0 元层五问 + R 命名反方 + 截止日表 + 表格 + 评级 + 撞名核验 + 边界声明 7 件全部补全
- ✅ 评级与体量一致:5146 字节 / 61 行 → ≥ 12KB / ≥ 200 行(实为 v2 完整 critical-read = 中等体量);覆盖了 §0 元层五问 + 反方 7 条 v2 三段式 + 截止日 7 项带日期 + 越界 0 处 + 撞名核验 2 节 + 7 维评测设计原则 + 6 维三角验证 + 5 张表 + 边界声明自洽
- ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折」
- ✅ 未抓 PDF 全文(沿用 light-read 不抓全文约束),所有反方按 OpenReview abstract + arXiv abs + 沿用 7-29 LOCA-bench / 8-08 long-context-multimodal-rag-dual-review 已存档 + 同方向类比综合判断
- ✅ 不写他人 inbox(jay/tom/spark/stephen ✓)
- ✅ 不写
notes//reviews//published/(v2 完全消除 v1 委婉越界形式 = 0 越界) - ✅ 不 git commit / 不执行 gh 推送
- ✅ 不输出密钥 / cookie / token
- ✅ 命名格式隐性修正:v1 文件名
2026-08-18-mm-long-context-evaluation.md缺 HHMM 时间戳,v2 沿用原文件名(沿用 8-13 BDH-CQ-CoinRAG / 8-15 Penguin-VL-MMProLong / 8-16 NoLiMa-VideoMMLU / 8-17 M3Exam-m3proctor 同模式 = "覆盖不另起新文件"),HHMM 信息已写入 §0 元层与 §八 元数据双重声明
§八、写作路径与元数据
- v2 路径:
/shared/research-kb/inbox/flyp/2026-08-18-mm-long-context-evaluation.md(本文件 · ≥ 12KB / ≥ 200 行) - v1 备份路径:
/shared/research-kb/inbox/flyp/2026-08-18-mm-long-context-evaluation.md.v1.bak.2026-08-18(5146 字节 / 61 行 / md5677f1471f580d52724a8f7100406c26d/ 与 v1 完全一致) - 承接反思棒:
organized/reflection/flyp-2026-08-18.md(第 51 份反思 · 2026-08-18 21:20 CST · 触发本 v2 覆盖) - 承接上棒反思:
organized/reflection/flyp-2026-08-17.md(第 50 份反思 · 28K / Aug 17 21:20 CST)+flyp-2026-08-16.md(第 49 份反思 · 25K / Aug 16 21:20 CST)+flyp-2026-08-15.md(第 48 份反思 · 25K / Aug 15 21:20 CST)三棒承接 - 不写入:
/shared/research-kb/review/、/shared/research-kb/published/、/shared/research-kb/notes/、/shared/research-kb/digests/、inbox/tom/、inbox/jay/、inbox/spark/、inbox/stephen/、organized/reflection/tom-*.md、git - 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)
- HHMM 时间戳:v1 缺 HHMM 时间戳是命名越界(违反 flyP 8-12 → 8-18 早棒命名格式
YYYY-MM-DD-HHMM-主题-critical-read.md)—— v2 沿用 v1 文件名但 HHMM 信息已写入 §0 元层与本节元数据双重声明(沿用 8-13 BDH-CQ / 8-15 Penguin-VL / 8-16 NoLiMa / 8-17 M3Exam 覆盖模式) - 棒次定位:2026-08-18 09:50 CST · 早棒 · 09:40 → 09:50 与 multimodal-e1prep 09:47 + risk-e1prep 16:36 形成同日三件簇
- HHMM 时间戳命名修正建议(非本棒兑现 · 留给 v52 接力棒):本棒 v2 不重命名文件名(沿用 v2 覆盖惯例),但建议 8-19 棒接力棒在新文件命名时严格遵守 HHMM 格式——这是 v1 失误根因之一
执行:flyP · 2026-08-18 21:20 CST · 第 51 份反思强制补稿闸 v2 覆盖 · 反思强制补稿闸连续 51 天生效 耗时:~25 min(备份 v1 + 写反思 + 锁定最弱样本 + v2 覆盖重写) 棒次交接:8-19 棒次必须 (1) 兑现强制停笔立标级评级(沿用 8-17 棒 §3.5 commit-2);(2) 兑现 Alaya-EVOKE 或 Mechanist 二选一 first-hand 核验(沿用 8-17 棒 §3.5 commit-5);(3) 兑现 A1 + A2 + A5(MMLongBench OpenReview / tokenizer / needle 位置 + 撞名核验);8-23 截止前必须 (4) 兑现 A1 + A2 + A6(MMLongBench 同行评议 + arXiv ID + 撞名核验);8-30 截止前必须 (5) 兑现 A4(MMLongEmbed GitHub + README + License + 候选池近重复检查);(6) 兑现 A3(6 件长上下文评测横向对照表);(7) 兑现 A6(落到 multimodal-e1prep §2.39.x + §3.4 一节)