NeoMME:单塔多模态原生多语言基础编码器,面向高效文档检索微调与推理
- 关联论文:2609.01657
- 作者:flyP
- 更新:2026-09-04
一句话结论
NeoMME 提出一个单塔、双向 Transformer 编码器(260M / 800M 两个尺寸),直接从零预训练,统一处理多语言文本与原始图像 patch,以"掩码离散扩散文本目标 + 可见图像 patch 条件"为目标,在 ViDoRe v3 文档检索基准上 260M 档位超过所有 <800M 模型、800M 档位达到 0.556 nDCG@10,并通过层级 token pooling + 非对称量化把 late-interaction 检索向量压缩 255×。
解决的真问题
当前多模态模型主流架构是"视觉编码器 + 因果语言模型"的双塔堆叠,这本身是为生成式 VLM 设计的;而视觉文档检索(visual document retrieval,如 ColPali、ColQwen 系列)只是把这些 VLM 当 encoder 用,把生成式架构的参数与算力开销全部继承下来用于非生成任务,架构-任务不匹配带来的浪费巨大。
NeoMME 要做的就是:从架构上重新设计一个原生面向"多模态非生成式编码"任务的模型,而不是把生成式 VLM 当 encoder 凑合用——具体表现为单塔、双向、面向多语言多模态、压缩友好。
核心方法
1. 架构:单塔 + 双向 + 多模态原生
输入:
text tokens (multilingual) image patches (16x16 raw pixels)
↓ ↓
└──────────┬─────────────────────────┘
↓
┌─── Single Bidirectional Transformer Encoder ───┐
│ • 260M 或 800M 参数 │
│ • 16,384 token 上下文(可容纳 2 张 4K UHD) │
│ • text + image patch 同序列输入 │
└─────────────────────┬────────────────────────┘
↓
hidden states (multilingual + multimodal)
↓
┌─────────── 任务特定 head (检索时) ───────────┐
│ dense head + late-interaction head(联合训练)│
└───────────────────────────────────────────────┘
关键架构选择:
- 单塔:文本与图像 patch 在同一 Transformer 内交互,避免双塔信息流瓶颈。
- 双向:只做 encoding,不需要 causal mask,可完整利用上下文。
- 从零预训练:不像 ColPali 那样复用 VLM 权重,而是按"原生编码"目标重新训练。
- 多语言:在多语言文本上训练,文本 token 不受英语限制。
2. 预训练目标:掩码离散扩散文本
对文本 token:采样掩码比例 ρ,被掩码位置以离散扩散方式逐步恢复
对图像 patch:保持可见(不被掩码),作为条件信息
联合目标: L = L_text_diffusion (masked) + L_multimodal_alignment
"离散扩散文本"区别于传统 MLM:在每一步恢复中,被掩码位置经过若干步离散去噪恢复为 token,而不是一步预测。这种目标对长文本与多语言更友好。
3. 检索微调:密集头 + Late-Interaction 头联合
下游文档检索时,NeoMME 加两个 head:
- Dense head:把整段图文的 [CLS] / pooled 表征映射到单向量,做 cosine 相似度,适合快速粗排。
- Late-interaction head:对每个 token / patch 输出局部向量,做 ColBERT 风格的多对多相似度聚合,精排质量更高。
两个 head 联合训练,而非各训各的;检索时 dense 做候选、late-interaction 做重排。
4. 推理压缩:层级 token pooling + 非对称量化
为了让 late-interaction 向量在生产环境可部署:
- 层级 token pooling:把相邻 patch / token 的向量池化为更稀疏的表示,显著减少存储。
- 非对称量化:query 端用浮点(精度优先),document 端用低 bit(压缩优先)——前提是 query 量小、document 量大,这是 ColBERT 检索的经典工程实践。
组合下来,多模态文档向量压缩 255× 同时保留 ≥95% 的 baseline nDCG@10(原文 abstract 数字)。
关键实验与数据
(数字来自 arxiv abstract 主表)
- 基准:ViDoRe v3 文档检索。
- 档位 1:NeoMME-Retriever 260M:
- 在 <800M 参数模型中取得最佳,nDCG@10 = 0.523。
- 档位 2:NeoMME-Retriever 800M:
- nDCG@10 = 0.556。
- 吞吐(2048×2048 image input,NVIDIA L40S):
- NeoMME-260M 比 ColModernVBERT 快约 2×。
- 压缩:
- 层级 token pooling + 非对称量化 = late-interaction 向量压缩 255×,保留 ≥95% baseline nDCG@10。
- 上下文:
- 16,384 token 上下文,够容纳 2 张标准 4K UHD 图像。
- 开源:
- 集成进 Hugging Face Transformers,预训练 backbone 与检索兼容 checkpoint 以 Apache 2.0 释出(Hcompany 集合)。
⚠️ 上表是 abstract 给出的核心数字;完整对照(含与 ColPali、ColQwen、Jina-v3 等的逐档对比)需查 PDF 主表与附录。
亮点与局限
亮点
- 架构与任务对齐:从"把 VLM 当 encoder 用"转向"原生设计编码器",参数与算力效率显著提升,260M 击败所有 <800M 竞品。
- 多模态 + 多语言 + 双向 + 单塔:四个属性同时满足,在文档检索场景是少见的全面组合。
- late-interaction 工程化到位:255× 压缩 + ≥95% 保留让生产部署在向量库层面变得可行,这是文档检索从"实验玩具"走向"工业可用"的关键。
- 吞吐可观:2× ColModernVBERT,且能在单卡 L40S 上跑,部署门槛低。
- 生态友好:直接进 Hugging Face Transformers + Apache 2.0,开源生态接入成本极低。
局限
- 生成能力为零:仅做 encoding,不能直接用于 VQA、caption、对话;若需生成式能力还得另接 LLM(回到双塔)。
- 2 张 4K UHD 上限:16,384 token 上下文对超长文档(>40 页 PDF)仍不够,需要额外切分 / 分层策略(⚠️ 是否有 hierarchical encoding 论文未明确)。
- ViDoRe v3 单基准主导:abstract 数据集中在 ViDoRe v3,在其他文档检索基准(DuReader-Vis、ViDoRe v1/v2、MTEB 文档类)的表现需查 PDF 主表(⚠️)。
- 未明确多语言覆盖的具体语种:abstract 只说"multilingual",但支持哪些语种、低资源语种表现如何未明确。
- 从零预训练成本:单塔双向原生预训练意味着不能用现成 VLM 权重,训练算力成本是隐性门槛(论文未给出训练 token 量与 GPU 小时)。
对工程落地的启发
- 架构-任务对齐原则:非生成任务就该用非生成架构,不要把 VLM 当 encoder 凑数——这是文档检索、embedding、向量召回等任务选型时应坚持的原则。
- late-interaction 是文档检索的"精度+可压缩"折中:保留细粒度匹配能力 + 通过 pooling/量化把存储打到工业可承受档位,NeoMME 的 255× 压缩是当前公开论文里的先进档位之一。
- Apache 2.0 + Hugging Face 集成 = 上手成本最低:任何文档检索系统升级都可直接试 NeoMME-Retriever 260M,看看是否替换现有 encoder 即可带来 nDCG@10 提升。
- 多语言文档检索:跨境电商文档、国际法律合同、多语种客服知识库这类场景,NeoMME 是少数同时支持多语言 + 多模态 + 检索的现成方案。
- 256× 压缩后的工程含义:255× 压缩意味着原来存 1 TB 的 late-interaction 向量现在只需约 4 GB,可以放进单节点内存甚至部分 SSD 缓存——直接降低向量库硬件成本。
与同方向工作的关系
- vs. ColPali / ColQwen:同属视觉文档检索,但 ColPali 复用 VLM 权重,NeoMME 从零原生预训练,效率与精度同时更好。
- vs. ColModernVBERT:NeoMME-260M 直接在吞吐上 2× 于 ColModernVBERT,且检索精度更优——是当前 260M 档位的更优替代。
- vs. Jina v3 / BGE-M3 等通用 embedding:后者偏纯文本多语言,NeoMME 多了原生图像 patch 处理能力,适合图文混排文档。
- vs. 双塔图文检索(CLIP 系):双塔图文检索只做粗粒度对齐,NeoMME 的 late-interaction 提供 token/patch 级细粒度匹配,精度上限更高。
适合谁读
- 文档检索 / RAG 工程师:正在评估 ColPali / ColQwen / ColModernVBERT 的升级路径,NeoMME-Retriever 是直接候选。
- 向量数据库 / Embedding 基础设施团队:需要压缩友好、吞吐高、Apache 2.0 友好的多模态 encoder。
- 多语言文档处理团队(跨境电商 / 国际法务 / 多语种客服):需要同时支持多语言文本 + 图像的检索方案。
- Hugging Face 生态用户:可直接 transformers.load() 上手,集成成本极低。
- 不太适合:需要 VLM 生成能力(对话、caption、VQA)的研究者——本工作只做 encoding。
元信息
- arXiv 编号:2609.01657(v1,2026-08-31 提交)
- 主分类:multimodal;副分类:engineering
- 来源核验:paper_card 1207-2609-01657.md + arxiv abstract 双源
- 开源地址:https://hf.co/collections/Hcompany/neomme
- 不确定处:多语言覆盖语种、超长文档策略、其他基准对比需查 PDF 主表与附录