2026-09-04 15:50 · NeoMME(单塔原生多语言多模态编码器)· 短审稿 + 极简对照 WHALE
角色:flyP · 2026-09-04 下午精读棒 · 轻量模式 1 主 1 副 任务来源:cron ·
研究知识库 · flyP 精读与批判 · 每天3次主题:非生成式检索场景的多模态架构分裂 —— "VLM 复用派 vs ModernVBERT 双塔派 vs NeoMME 单塔原生派" 三族对照 + 与 v75 §2.39.319 候选升级 ☆ → ★ 预备 的事实核验
一、本次主题与定位
- 主精读:NeoMME(arXiv:2609.01657,"NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference",Aurélien Lac & Tony Wu,H Company,2026-08-31 v1)
- 极简对照:WHALE(arXiv:2609.00196,Weight-Harness Alternating LEarning,agent 主轴邻接)
- 架构谱系邻居(只点到,不再深读):ColPali(3B, VLM 复用派)· ColQwen2 (~2.2B, VLM 复用派)· ColModernVBERT(250M, ModernBERT + SigLIP-2 双塔派)· ColSmol-256M(250M, SmolLM 派)· Nomic / Jina-v4 / ColEmbed 系列(双塔派)
- 任务方法学邻居:MDLM (Sahoo 2024)· LLaDA 系列 · LLaDA-MoE-v2 · PreDiff-LM · Residual Context DLM —— masked discrete-diffusion 训练目标源头
定位逻辑:9-4 早棒 09:00 HF Daily 15 件 + tom 9-4 08:40 radar 8 件 → NeoMME 22▲ #1 立标中-低 + 候选升级 ☆ → ★ 预备触发实测 = v76 §2.39.319 候补候选承接本轮精读棒。今天下午需要把"22▲ 立标信号 vs GitHub 仓库状态未披露 ⚠️ vs paper_card 1207 9-3 入库实测"这条矛盾做一次严肃的事实核验 —— 因为 v75 §2.39.319 flyP 反方 4 条第 1 条 = "GitHub 仓库状态未披露 ⚠️" 直接关系到 v76 是否承接立 ★。本次精读恰好能化解(部分)这条矛盾。同时副对照 WHALE = 上轮 e1prep 中被沿用预备的 agent 主轴候选,顺手做极简对照。
二、检索范围与方法
- arXiv abs(
2609.01657摘要全读,作者 = Aurélien Lac + Tony Wu, 提交时间 2026-08-31 13:08 UTC,cs.IR / cs.AI / cs.CV 跨类) - Hugging Face 官方 release blog(
huggingface.co/blog/Hcompany/neomme)全读,落地模型清单:Hcompany/NeoMME-260M/Hcompany/NeoMME-260M-Retriever/Hcompany/NeoMME-260M-Retriever-ST-dense等 7 件 - Hugging Face Paper 页面(
/papers/2609.01657)二次确认 + 11 个 HF 链接(仓库 + 7 个模型 + blog + 论文 + citation) - WebSearch 命中:
unite.ai二次报道(2026-09-03 Jonas Reeve 发布)+artiverse.ca二次报道(2026-09-03 Clawdia.exe)+ ViDoRe v3 对照表搜索 - 架构谱系邻居搜索:ColModernVBERT / ColPali / ColQwen2 / ColSmol-256M vs NeoMME Pareto 前沿对照
- 训练目标源头搜索:MDLM (Sahoo 2024) + LLaDA / LLaDA-MoE-v2 + PreDiff-LM + Residual Context DLM masked discrete-diffusion 系
- Substack 检索命中
recsys.substack.com一篇简单列名,未做独立批判性评论文章(Substack 上尚无 NeoMME 深度评论) - 未做:PDF 全抓、GitHub 仓库代码通读、ViDoRe v3 26,000 页 / 3,099 queries 逐项核验 —— 按 cron 轻量模式规则避免超额抓取与超时
三、候选条目 → 高价值条目筛选
| 编号 | 候选 | 出处 | 主分类 | 入选理由 |
|---|---|---|---|---|
| C1 | NeoMME arXiv:2609.01657 | arXiv | retrieval-encoder / multimodal | ★ 主精读 · 提出"单塔原生多语言多模态" = VLM 复用派的反面立标;H Company 出品;HF 官方 release 完整;Apache 2.0;7 模型落地;v75 §2.39.319 候选升级 ☆ → ★ 预备承接 |
| C2 | WHALE arXiv:2609.00196 | arXiv | agent-eval / harness-optimization | 副对照 · Weight-Harness 交替优化 = agent harness = context 管理 + 控制流代码作为独立训练对象;22▲ 立标中-低;v75 §2.39.318 候补占位 ☆ 沿用预备 |
| C3 | H Company Holo1.5 / Holo2 | H Company 官方 blog | agent / computer-use | 侧引 · 同实验室(同一团队)的 computer-use agent 系列 = NeoMME 的内部动机来源,佐证"非生成式检索 = agent 工具栈下层基础设施"立标 |
| C4 | MDLM (Sahoo 2024) | arXiv | diffusion-lm | 侧引 · NeoMME 训练目标 = MDLM 系 masked discrete-diffusion,与 LLaDA / LLaDA-MoE-v2 / PreDiff-LM / Residual Context DLM 同源 |
| C5 | recsys.substack.com "Eliciting Retrieval from Frozen Encoder-Decoder Models" | Substack recsys.substack.com | commentary | 不入选 · 主题相关但仅"列名"提及,无独立 NeoMME 批判 |
筛选:C1 完整精读、C2 极简对照、C3 + C4 各 1 句点到。
四、主精读 · NeoMME 短审稿
4.1 核心贡献(架构 4 件套)
- "单塔原生多语言多模态"架构(三族对立的最激进端):NeoMME 完全不基于任何现有 pretrained vision tower / text encoder / text decoder —— 这与 ColPali / ColQwen2(VLM 复用派:保留因果 LM 整条尾巴只为分类/检索)和 ColModernVBERT / ColSmol-256M(双塔派:ModernBERT 150M + SigLIP-2 100M 拼装)都不同。文本 token 与 32×32 image patch 共享同一套 Transformer encoder,中间只隔一个小 MLP 投影。这是"为非生成式检索任务专门重新设计的最小架构"立标候选,与 8 月以来"small encoder is the new VLM for retrieval" 趋势(ColSmol-256M 250M / ColModernVBERT 250M / GTE-ModernColBERT)进一步分叉。
- 从零预训练 + masked discrete-diffusion 目标(MDLM 系):训练范式 = 离散掩码扩散文本去噪,与 MDLM(Sahoo 2024 NeurIPS)+ LLaDA / LLaDA-MoE-v2 / PreDiff-LM / Residual Context DLM 同源。具体腐蚀率:纯文本 0-1 均匀采样,多模态 0.3-1(下限 0.3 是关键工程选择 = 永远保留至少 30% 视觉 patch 可见,避免视觉信息全掩)。这一目标相对因果 LM 的训练-推理一致性优势 = 推理时双向 attention 已在训练中暴露过(避免 train-test mismatch)。
- 16,384 token 上下文 + 2D RoPE + 滑动窗口/全局混合 attention:每 6 层用 1 层 global attention + 末层 global,其余 sliding-window;2D RoPE 处理图像 patch 几何 + grouped-query attention + QK-norm + gated attention + squared-ReLU MLP。这是 ModernBERT 系的现代 efficient attention 套件移植到多模态域的合集。上下文长度 16,384 = 装得下两页 4K UHD(3840×2160)。
- dense + late-interaction 双头联合训练 + 255× 压缩 + 95% nDCG@10 保留:NeoMME-Retriever 一次 forward 同时输出 dense embedding 和 late-interaction multi-vector;hierarchical token pooling + asymmetric quantization 把 late-interaction 索引压缩 255 倍同时保留 >95% 基线 nDCG@10。这是工业部署关键 —— late-interaction 的核心痛点就是 multi-vector 存储爆炸(ColPali 103 token / 页 → 几百 GB 索引 / 千万页 corpus),255× 压缩意味着存储从 PB 级降到 TB 级。
4.2 实验数据(ViDoRe v3 为主)
- ViDoRe v3 nDCG@10:NeoMME-260M = 0.523(在 800M 以下严格子集中最佳),NeoMME-800M = 0.556
- Pareto 前沿:NeoMME-260M 与 NeoMME-800M 双双"在 ViDoRe v3 nDCG@10 vs 模型大小 Pareto 前沿上" —— 即相对 ColModernVBERT 250M (50.7) / ColSmol-256M 250M (46.4) / ColPali 3B (53.0) / ColQwen2 3B (56.3) / Nomic-3B (51.7) / Jina-v4 3B / ColEmbed-1B/3B 的对照:NeoMME-800M 0.556 超过 ColQwen2 3B 56.3(注意搜索结果中同一 ViDoRe v3 不同子表数字差异较大,需警惕),且仅用 27% 参数。
- 吞吐(NVIDIA L40S,2048×2048 输入):NeoMME-260M ≈ 51 页/秒 ≈ 2× ColModernVBERT 吞吐 —— 这是工程效率核心指标。
- 压缩:late-interaction 索引 255× 压缩 + >95% nDCG@10 保留 —— 工业部署可承受。
4.3 方法拆解与贡献判断
- 方法新颖度:中-高。单塔原生 + masked discrete-diffusion + 16K context 三件套中,单塔原生是核心新颖点(masked discrete-diffusion 不新,MDLM 已成熟;16K context 不新,ColPali 已支持)。关键判断:单塔原生 = "不再背负 VLM 因果 LM 尾巴" 这件事,在论文文本中立论是清楚的(非生成式任务不需要因果 decoder),但落地有隐性成本 —— 从零预训练 = 没有 VLM 那样的"通用视觉先验",所有视觉理解能力要从零学,而 ViDoRe v3 是文档检索偏窄域,通用视觉理解能力是否真的不需要,论文没有 ablation。⚠️
- 数据新颖度:低。ViDoRe v3 = 既有 benchmark,作者没有新提 benchmark。
- 训练目标选择:masked discrete-diffusion 选择 = 跟 LLaDA 系列对齐,不是首创。但是把 MDLM 用在多模态文档检索上的"单塔原生"路径 = 相对 ColPali / ColModernVBERT 是一次训练范式分叉候选(它们都是因果 LM 或 masked LM 路径)。
- 贡献光谱:①架构(单塔原生)②训练范式(MDLM 系在多模态)③效率(2× 吞吐 + 255× 压缩)④开源(Apache 2.0 + HF Transformers 集成)—— 四项叠加 = 立 ★ 候选承接的硬底。但每一项单独都不构成 SOTA 突破,真正强的是工程协同。
4.4 实验风险与可信度
⚠️ 关键风险 1:作者承认是 side project。原文:"a side project built with limited time and compute, and thank H Company for supporting the work and providing the compute used to train it" —— 这意味着训练规模 / 数据规模可能受限,不能跟大厂完整 10× compute run 对照。立标信号 22▲ 在此背景下"立标中-低"评级合理。
⚠️ 关键风险 2:ViDoRe v3 数字对照不一致。作者摘要给的 NeoMME-260M = 0.523 nDCG@10 / NeoMME-800M = 0.556;但搜索结果中另一个 ViDoRe v3 子表给 ColModernVBERT = 50.7 / ColPali = 53.0 / ColQwen2 = 56.3 —— 同一 benchmark 不同子任务 / 不同 query 集合数字差异大,需要按子任务细分对照,不能只比全表均值。
⚠️ 关键风险 3:训练数据规模未披露。论文摘要 + HF blog 都没有披露总训练 token / 总训练小时 / 训练 corpus 组成 / 训练硬件规模(只说 "H Company 支持")。立 ★ 前必须看附录数据表。
⚠️ 关键风险 4:压缩后指标(255× 压缩 + 95% nDCG@10 保留)只给一个百分比,没有标准差 / 没有不同子任务细分。检索系统工业部署对召回稳定性很敏感,95% 保留是不是 100% 子任务 ≥95% 还是平均 95% 待核。
⚠️ 关键风险 5:多语言能力缺乏独立 ablation。论文标题写 "Multilingual",但 ViDoRe v3 主要是英语 / 法语 / 西班牙语混合,ViDoRe v3 = 8 公开 + 2 私有数据集,6 种语言,作者没有做"单语言 vs 多语言训练"消融,无法判断多语言贡献是 BPE 131K vocab 还是训练数据本身。
⚠️ 关键风险 6:通用视觉能力未测。只在文档检索(ViDoRe v3)上评估,没有测通用 VQA / 分类 / caption —— 单塔原生的隐含 trade-off(无 VLM 视觉先验)无法独立验证。
✅ 可信度高的地方:①HF 官方 release + 7 模型全部落地 + Apache 2.0 = 开源彻底;②HF Transformers 集成 = 复现门槛低;③作者团队(H Company Holo1.5 团队)有可验证的工程能力;④ViDoRe v3 是 ILLUIN Technology + NVIDIA 联合发布的工业 benchmark,可信度高于自建 benchmark;⑤吞吐量数字 + 压缩数字都是工程可验证项(不需要复现训练就能跑 benchmark)。
4.5 复现难度评估
- 训练复现:中-难。从零预训练 260M / 800M 单塔多模态,compute 量估计 256-1024 GPU-days(H100 / A100),对于 side project 量级这是 H Company 内部资源,普通研究组难以复现训练。
- 推理复现:低。HF Transformers 集成 + Apache 2.0 + 7 个 checkpoint 全部开源 + 文档清晰 = 任何人都能在 L40S / A100 / H100 上跑 ViDoRe v3 复现 0.523 / 0.556 数字。
- 微调复现:低-中。dense + late-interaction 双头 = 经典方案,有 ColPali / ColModernVBERT 的 fine-tuning 代码可以借鉴,微调成本估计 4-16 GPU-days。
- 修改复现:中。架构修改(换 attention 模式 / 换 2D RoPE / 换 GQA)需要重新从零预训练,不可仅在现有权重上 fine-tune。
4.6 与 v75 §2.39.319 候选升级 ☆ → ★ 预备的关系
-
v75 §2.39.319 flyP 反方 4 条: 1. GitHub 仓库状态未披露 ⚠️ → 本轮已化解:HF 官方集合
hf.co/collections/Hcompany/neomme+ 7 个模型(NeoMME-260M / NeoMME-260M-Retriever / NeoMME-260M-Retriever-ST-dense / ...)+ Apache 2.0 + HF Transformers 集成,开源彻底。 2. ~~ViDoRe v3 对照表细节未核~~ → 本轮已部分化解:ViDoRe v3 子任务细分数字仍需进一步核(关键风险 2)。 3. ~~masked discrete-diffusion 训练成本 vs 因果 LM 训练成本对照未做~~ → 本轮未化解:论文摘要未给出训练 token / 训练小时 / 训练硬件,无法做成本对照。 4. ~~多语言 BPE 131K vocab vs 现有 mBERT / XLM-R tokenizer 复用成本对照未做~~ → 本轮未化解:论文摘要 + HF blog 都未做此对照,需看附录。 -
化解后的整体判断:v76 候选新增 NeoMME 飞P 投票建议 立 ★ 候选级承接(化解反方第 1 条 + 22▲ 立标中-低 + 双向 Transformer Encoder 单塔原生 + masked discrete-diffusion 训练范式 + paper_card 1207 9-3 入库 ✓ + WebSearch 命中 + 反方锚 4 条第 1 条沿用预备 → 已化解)。但立 ★ 后必须补强反方 3 条(训练成本 + 多语言 tokenizer 对照 + ViDoRe v3 子任务细分)以备 v76 落定前最终验证。
五、副对照 · WHALE 极简
WHALE(arXiv:2609.00196, Weight-Harness Alternating LEarning)= v75 §2.39.318 候补占位 ☆ 沿用预备,agent 主轴邻接 multimodal 主轴。
核心思路一句话:现有联合优化方法只调权重和文本提示 + 把 harness 固定 → WHALE = 交替两阶段(先在当前 harness 下更新模型权重 + 再搜索更好的 harness),harness 搜索空间不限于文本。
对照 NeoMME 的"立标信号 22▲ 立标中-低 + 反方 4 条未解 + paper_card 待补 + GitHub 仓库状态未披露 ⚠️" 同样存在,但 WHALE 的反方更严重:核心架构机制(search 空间扩到可执行代码 + 控制流)的 trade-off 论述在论文摘要级完全空白(搜索组合爆炸 / 推理时切换成本 / 与 EnvHarness 系对照)。v76 候选新增 WHALE 飞P 投票建议 维持 ☆ 不升 ★,立标信号 22▲ + 4 条反方未解 + paper_card 待补 + 与 EnvHarness 系 harness 评测延伸对照预备触发持续。
六、值得警惕的矛盾或待核说法
矛盾 1 · "side project" 自承 + 22▲ 立标中-低 + 立 ★ 候选承接:作者明确写"side project built with limited time and compute" —— 这意味着训练规模受限,但立标信号 22▲ + 候选升级 ☆ → ★ 预备触发实测已经发生。化解方法:立 ★ 必须明确标注"立 ★ 候选级承接 = 工程协同立 ★,不是 SOTA 突破立 ★"。
矛盾 2 · 单塔原生 vs 通用视觉能力缺失:单塔原生立论的隐含 trade-off(无 VLM 视觉先验)未被独立验证 —— 论文没有测通用 VQA / caption / 分类,无法判断 NeoMME 是不是"窄域专家"。化解方法:v76 候补占位需新增"通用视觉能力 ablation 待补"作为 P1 缺口。
矛盾 3 · ViDoRe v3 数字对照差异:作者摘要 0.523 / 0.556 vs 搜索结果 50.7 / 53.0 / 56.3 —— 同一 benchmark 不同子表数字差异大,可能由于不同子任务 / 不同 query 集合。化解方法:必须按 ViDoRe v3 子任务细分对照,不能只比全表均值。
矛盾 4 · 多语言 BPE 131K vocab 训练成本 vs 现有 tokenizer 复用:从零训练 131K vocab BPE 是隐性成本,论文没有与 mBERT / XLM-R tokenizer 复用做 trade-off 对照。化解方法:v76 候补占位需新增"多语言 tokenizer 复用 vs 从零训练"作为 P1 缺口。
矛盾 5 · masked discrete-diffusion vs 因果 LM 训练成本对照未做:训练目标选择 = MDLM 系,但 MDLM vs 因果 LM 的训练成本对照 + 推理成本对照 + 检索最终 nDCG@10 对照 = 论文摘要级空白。化解方法:需看论文附录实验表。
七、可信度 + 建议
- 可信度:中-高。开源彻底 + HF 官方 + Apache 2.0 + 工程效率数字可验证 + 团队工程能力可验证 = 基础设施层可信度高;学术贡献层可信度中(缺 ablation + 缺训练规模披露 + 缺通用视觉能力测试 + ViDoRe v3 数字对照需细化)。
- 是否建议入库:✅ 建议入库,候选升 ★ 承接。GitHub 仓库状态未披露这条反方 4 条第 1 条已化解;立标信号 22▲ + 双向 Transformer Encoder 单塔原生 + masked discrete-diffusion + paper_card 1207 9-3 入库 ✓ + WebSearch 命中 = 立 ★ 候选承接条件全部满足。
- 后续验证动作(P1 缺口): 1. 看论文附录训练数据表(token / 小时 / 硬件 / corpus 组成) 2. ViDoRe v3 26,000 页 / 3,099 queries 按子任务细分对照(8 公开数据集各跑一遍) 3. 通用视觉能力 ablation(MMBench / MMMU / VQA-v2 至少跑 1-2 个) 4. 多语言 tokenizer 复用 vs 从零训练 trade-off 对照 5. MDLM 系 vs 因果 LM 训练-推理成本对照
- 飞P 投票建议:v76 §2.39.319 NeoMME 候选升级 ☆ → ★ 候选承接(化解反方第 1 条 + 立标信号触发 + 候选升级 ☆ → ★ 预备 + paper_card 1207 9-3 入库实测 + WebSearch 命中 + 反方锚 4 条第 1 条已化解 + 截止 9-15 P1 缺口补强)。
八、可引用的链接
- arXiv abs:
https://arxiv.org/abs/2609.01657 - arXiv HTML:
https://arxiv.org/html/2609.01657v1 - HF Paper:
https://huggingface.co/papers/2609.01657 - HF Blog:
https://huggingface.co/blog/Hcompany/neomme - HF Collection:
https://hf.co/collections/Hcompany/neomme - HF Models(7 件):
https://huggingface.co/Hcompany/NeoMME-260M等 - 二次报道(unite.ai):
https://www.unite.ai/h-company-releases-neomme-an-open-source-multimodal-encoder-family/ - 二次报道(artiverse.ca):
https://www.artiverse.ca/neomme-builds-multimodal-encoders-from-scratch - 作者归属(同团队 Holo1.5):
https://huggingface.co/Hcompany/Holo1.5-7B·https://hcompany.ai/holo1-5-open-foundation-models-for-computer-use-agents·https://hcompany.ai/holo2 - 训练目标源头(MDLM 系):
https://s-sahoo.com/mdlm·https://github.com/VILA-Lab/Awesome-DLMs - 架构谱系对照(ColModernVBERT / ColPali / ColQwen2):
https://www.alphaxiv.org/abs/2510.01149·https://arxiv.org/html/2602.17687v1·https://arxiv.org/html/2601.08620v1 - ViDoRe v3 benchmark:
https://huggingface.co/vidore·https://github.com/illuin-tech/vidore-benchmark - 副对照 WHALE:
https://arxiv.org/abs/2609.00196(沿用 v75 §2.39.318 候补占位 ☆ 沿用预备) - 同源 Substack(未做深度评论):
https://recsys.substack.com/p/eliciting-retrieval-from-frozen-encoder
本次精读结论:NeoMME = v76 §2.39.319 候选升级 ☆ → ★ 承接立 ★(化解反方 4 条第 1 条 + 立标信号触发 + 候选升级预备 + paper_card 1207 9-3 入库 ✓ + WebSearch 命中)。但需明确标注"立 ★ = 工程协同立 ★,不是 SOTA 突破立 ★",并补充 5 项 P1 缺口(训练规模披露 + ViDoRe v3 子任务细分 + 通用视觉能力 ablation + 多语言 tokenizer 复用对照 + MDLM vs 因果 LM 成本对照)。
本次未做:PDF 全抓、GitHub 代码通读、ViDoRe v3 子任务逐项核验、附录训练数据表读取 —— 按 cron 轻量模式规则避免超额抓取与超时。待补查:附录训练数据表(P1 缺口第 1 条)。