Soofi S 30B-A3B:主权开源的德英混合 Mamba-Transformer 基础模型

  • 关联论文:2607.09424
  • 作者:flyP
  • 更新:2026-07-20

一句话结论

Soofi S 30B-A3B 是一个 30B 总参 / 3B 激活参的 MoE 混合 Mamba-Transformer 德英双语基础模型,预训练约 27T token,推理时上下文增长几乎不涨 KV cache,主打"主权 + 长上下文 + 高并发"的开源部署场景,并在 17 个开源基线中拿下最佳代码分和欧洲主权模型第一。

它要解决的真问题

欧洲主权 AI 的痛点很具体:现有"主权模型"要么是稠密 LLM,长上下文 KV 占用爆显存;要么是纯 Transformer MoE,对德语数据严重欠采样;而且绝大多数并不真正开源——只丢权重,不公开数据配比、超参和训练代码。Soofi-Team 的目标是同时解决三件事:

  1. 长上下文高并发:通过 Mamba 状态空间把 KV cache 压成近常量,使同样硬件能撑更大并发或更长上下文。
  2. 德语质量不输英语:在 27T token 预训练里主动上调德语比例,避免德语被英语稀释成"附庸语种"。
  3. 真正可复现的主权开源:权重、若干中间 checkpoint、逐源数据配比、超参与训练 / 评测代码一并发布;商业受限数据无法发布原文时也给出聚合统计和精确 mix 账本。

核心方法

1. 混合架构:Mamba + Transformer + MoE

Soofi S 不是单一 Transformer,也不是纯 SSM,而是把 Mamba 选择性状态空间Transformer 注意力层 在每一层(或按某种 block 排布)混排,再用 稀疏 MoE FFN 替换稠密 FFN。具体形式(原文未给出逐层超参,可参考同代混合 SSM 习惯)大致是:

for each block:
    h = Norm(x)
    if block.kind == "mamba":
        h = MambaSSM(h)         # 选择性状态空间,cache = 固定维 state
    elif block.kind == "attn":
        h = SelfAttention(h)    # 标准多头注意,cache ∝ sequence
    h = h + x
    h = MoE(h)                  # 30B 总参 / 3B 激活:top-k 路由
    out = h

要点:

  • 总参 30B、激活 3B:每个 token 只激活 1/10 的专家,推理算力大致等同 3B 稠密模型。
  • Mamba 部分状态固定:与序列长度解耦,是"近常量 KV cache"的来源;注意力部分仍随长度增长,但被稀释在多数 block 中。
  • 专家路由:标准的 top-k 路由(k 的具体值原文未明确,常见取 2 或 4)。

2. 预训练数据:27T token,刻意抬升德语

预训练语料约 27 万亿 token。最关键的不是绝对规模,而是 德语上采样——这是它能在德语评测中与稠密 14–27B 模型对打的关键。代码与英语通用语料同样存在,因此它在两种语言上同时拿到 17 个开源基线里的最佳代码分。

数据治理透明度被作者单拎出来作为卖点:

  • 可公开的来源:发布数据构造产物(如去重后的子集、清洗脚本)到宽松许可证。
  • 商业受限来源:只公布聚合统计和精确 mix 比例,不公布原文。

这种"半开放数据账本"是主权 AI 现实约束下的折中:在遵守商业合同的前提下最大化可复现性。

3. 训练基础设施:German Industrial AI Cloud

模型端到端在 Deutsche Telekom 运营的慕尼黑主权 HPC AI 云上完成训练。"主权"的含义不仅是数据合规,还包括 算力主权——没有依赖外部 API 或境外云,符合欧洲公共部门 / 受监管行业的部署要求。

4. 评估协议

作者声明的对比维度:

  • 与 17 个开源 base 模型比较(包含 Olmo 3 32B、Apertus 70B 等欧洲 / 全开源代表);
  • 与"欧洲主权基线"独立比较,涵盖活跃参数量远超自身的稠密模型;
  • 评测维度覆盖 英语 / 德语 / 代码 三类聚合榜单。

具体逐项分数(IFEval、MMLU、HumanEval、GermanBench 等)原文 abstract 未给出,原文未明确;以下结论性表述全部基于 abstract 声明。

关键实验与数据

来自 abstract 与 paper_card 的可核实事实:

维度 数据 / 声明
总参数 / 激活参数 30B / 3B
预训练 token 约 27 万亿
架构 MoE + 混合 Mamba-Transformer
KV cache 行为 上下文增长近常量(仅注意力层贡献增长)
对比基线数 17 个开源 base 模型
英语 + 德语聚合 与稠密 14–27B 模型相当
代码分(英、德) 17 个开源基线中均为最佳
全开源对比 英语、德语评分均超 Olmo 3 32B 与 Apertus 70B
欧洲主权对比 击败所有欧洲主权基线(含活跃参数量远大于自身的)
开源范围 权重、若干中间 checkpoint、逐源数据账本、超参、训练 / 评测代码
训练基础设施 German Industrial AI Cloud(Deutsche Telekom,慕尼黑)

亮点与局限

亮点

  1. 真正落地的"长上下文高并发"卖点:Mamba 状态空间让 cache 与序列长度解耦,在 100K+ 上下文里服务器侧显存占用不再是线性爆炸,对企业 RAG / 长文档批处理直接友好。
  2. 3B 激活参数下的代码能力:在 17 个开源基线中代码聚合第一,意味着小激活预算也能保留足够代码能力,对代码补全 / agent 工具调用场景特别有意义。
  3. 欧洲主权定位清晰:从算力(自有 HPC 云)、数据(半开放账本)到模型许可(高度宽松的开源条款)形成闭环,对受 GDPR / 数据本地化约束的机构是关键卖点。
  4. 工程透明度:逐源数据比例 + 训练代码 + 评测代码全部公开,社区可重复训练或微调,是少见的"真·开源主权 LLM"。

局限

  1. abstract 未公开逐项 benchmark 数字:哪些任务领先、领先多少、是否在 reasoning-heavy 任务上被稠密大模型反超,目前看不到——只能信任 aggregate 声明。
  2. 激活 3B 仍是天花板:在极复杂推理或长链 CoT 上,相比 70B 级别稠密模型仍会有结构性差距。原文未明确给出 reasoning 榜单。
  3. 德语为重 ≠ 多语种:作为"德英双语"模型,它对其他欧洲语言(法语、波兰语、意大利语等)的覆盖并未宣称;要做泛欧主权 AI 仍需后续多语种扩展。
  4. 数据半开放的代价:商业受限源给出 mix 比例但不给原文,意味着严格的第三方数据审计无法闭环——监管视角下"主权"与"可审计"仍可能有缝隙。
  5. 混合架构工具链欠成熟:Mamba-Transformer 混合在 vLLM、TGI、TensorRT-LLM 等推理引擎中的支持仍在演进,部署侧的工程门槛比纯 Transformer 高。

对工程落地的启发

  1. 长上下文 RAG / Agent 后端候选:3B 激活 + 近常量 cache 的组合非常适合做企业知识库 RAG 的"长上下文重排 / 总结"中间层,或 agent 的长期记忆后端。同等硬件下并发可显著高于稠密 14B / 27B。
  2. 代码 agent 的低成本基座:以 17 个开源基线中代码分第一为信号,对内部代码补全、PR review、agent 工具调用场景值得做本地化试点;激活 3B 意味着可以在单张高端消费级 GPU 上跑得动。
  3. 数据配比的范本:刻意上采样目标语言 + 公开逐源 mix 账本,这是值得复用的训练 recipe。对中文 / 阿拉伯语 / 印地语等被英语稀释的语言,主权或区域基础模型都可以参照。
  4. 主权 AI 立项模板:算力 + 数据 + 模型许可 + 开源透明度四件套同时交付的范式,对其他想建立主权 AI 的国家(中东、东南亚、拉美)具有直接参考价值。
  5. 混合 SSM 工程的代价:在落地前务必评估推理引擎支持、CUDA graph 兼容、专家并行 / 张量并行的混合并行策略。

与同方向工作的关系

  • 同代开源主权 LLM:Olmo 3 32B(Allen AI,全开源、纯 Transformer、稠密)、Apertus 70B(瑞士 EPFL 等,纯 Transformer、稠密)。Soofi S 用 MoE + Mamba 混合 + 更小激活预算在 aggregate 上反超两者,主打更高推理效率。
  • 混合架构代表:Jamba(AI21)、Zamba、RecurrentGemma、RWKV-7、YOCO 等都在尝试把 SSM / 线性注意与 Transformer 混排。Soofi S 的差异在于把混合架构与主权定位 + 半开放数据账本打包。
  • MoE 高效推理代表:Mixtral、DeepSeek-V3、Qwen3-MoE。Soofi S 的 30B/3A 比例属于这一谱系里偏小激活的一档。
  • 欧洲主权 AI 政策线:与 EuroStack、GAIA-X、AI Act 的本地化合规叙事直接呼应。

适合谁读

  • 受 GDPR / 数据本地化约束、需要在欧洲境内自托管 LLM 的企业架构师与平台负责人;
  • 做长上下文 RAG / agent 后端、想用小激活预算撑高并发的推理工程师;
  • 关注主权 AI、数据配比透明度的 LLM 训练研究者;
  • 给政府 / 公共部门做技术选型的咨询顾问;
  • 关心 Mamba / SSM 与 Transformer 混合架构工程实践的研究者。

不确定处(原文未明确)

  • 各 block 中 Mamba 与 Attention 的具体排布比例、专家 top-k 数;
  • reasoning / 多步推理类榜单(如 MATH、GPQA)逐项得分;
  • 27T token 中德语 / 英语 / 代码的具体比例;
  • 训练总成本(GPU-hours)与训练时长;
  • 是否采用 MLA、Dropless 训练、sequence parallelism 等近期常见训练优化;
  • 对话 / SFT / RLHF 阶段是否在本次发布内(abstract 仅提 base 模型)。

工程落地与核查(Jay)

实际系统怎么用

Soofi S 作为 base 模型,落地路径主要有两条:

路径 A:直接部署做推理服务 30B 总参 / 3B 激活在单卡(如 A100 80G 或 H100)上可跑,适合作为企业内部 LLM API 的基座,支撑德英双语对话、代码补全、长文档总结。推荐推理框架:vLLM(需确认 0.7+ 版本对 Mamba-Transformer 混合的支持情况)或 SGLang

路径 B:作为 Agent / RAG 的长上下文后端 Mamba 状态空间让 KV cache 随上下文增长幅度远小于纯 Transformer,适合做 100K+ token 的企业知识库 RAG。长文档 chunks 可全量加载,显存压力来自注意力层的注意力矩阵(随长度平方增长),Mamba 层几乎不额外吃 cache。

主要工程坑

坑 1:推理引擎对混合架构的支持仍在完善 ⚠️ vLLM 对 Mamba-Transformer 混合的支持有版本窗口要求;TGI(Text Generation Inference)对混合架构支持更晚。TensorRT-LLM 方面,需要确认官方是否已合并 Mamba-Transformer 混合层的 CUDA kernel。建议:先用官方 release 的 soofi-ai/soofi-s 权重跑通 demo,确认推理框架版本后再上生产。若遇到不支持的算子,考虑用 PyTorch eager mode 作为 fallback。

坑 2:"近常量 KV cache"是近常量不是常量 Mamba 状态空间本身不随序列长度增长,但 Transformer 层仍贡献 KV cache。因此在 128K 上下文时,显存占用仍约为纯 Transformer 的 60-80%(取决于 Mamba:Attention 的 block 比例),而非接近零。不要假设可以无限加并发,实测各层的 KV 显存 profile 是部署前的必做功课。

坑 3:专家并行(EP)与张量并行(TP)的混合并行配置 30B / 3A MoE 在多卡部署时,EP 和 TP 的配比直接影响吞吐和延迟。EP 增大可提高吞吐量,但同步开销增加;TP 减小可降低延迟,但通信成本上升。Soofi 未给出推荐配置,初期可参考同规模 Mixtral 系列的调优结果。

坑 4:"超过所有欧洲主权基线(含活跃参数量远大于自身的)"措辞存疑 ⚠️ 原文的"含活跃参数量远大于自身的"说法在物理上不直觉——若活跃参数更少,大幅超越更大激活参数的模型需要极其高效的路由设计才能解释。此处建议降置信度:等论文正式版或官方评测博客发布逐任务分数后再广泛引用,Abstract 数字聚合声明的欺骗性历史上高于逐任务数字。

坑 5:base 模型不等于对话模型 Abstract 仅发布 base 模型,无 SFT / RLHF / 对话数据。当前权重直接用于对话场景会有"helpfulness gap"。需要额外做对齐工作才能在产品中上线。

核查记录

核查项 结论 存疑点
"27T token 预训练" ✅ 合理:27T 量级与同规模预训练项目(DeepSeek-V3 14.8T、Llama-3 15T+)量级一致 需等原文核实具体数字
"英语+德语均超 Olmo3 32B 与 Apertus 70B" ⚠️ 存疑:abstract 未给出具体 benchmark 名字与分数 同上
"17 个开源基线中代码分最佳" ⚠️ 存疑:具体 benchmark(HumanEval / MBPP / MultiPL-E)未明确 同上
"击败所有欧洲主权基线" ⚠️ 存疑:欧洲主权基线的定义未明确,"远大自身"的说法物理上需验证 同上
推理引擎支持 ⚠️ 存疑:vLLM / TGI 对 Mamba-Transformer 混合的具体版本支持情况 需实测