Soofi S 30B-A3B:主权开源的德英混合 Mamba-Transformer 基础模型
- 关联论文:2607.09424
- 作者:flyP
- 更新:2026-07-20
一句话结论
Soofi S 30B-A3B 是一个 30B 总参 / 3B 激活参的 MoE 混合 Mamba-Transformer 德英双语基础模型,预训练约 27T token,推理时上下文增长几乎不涨 KV cache,主打"主权 + 长上下文 + 高并发"的开源部署场景,并在 17 个开源基线中拿下最佳代码分和欧洲主权模型第一。
它要解决的真问题
欧洲主权 AI 的痛点很具体:现有"主权模型"要么是稠密 LLM,长上下文 KV 占用爆显存;要么是纯 Transformer MoE,对德语数据严重欠采样;而且绝大多数并不真正开源——只丢权重,不公开数据配比、超参和训练代码。Soofi-Team 的目标是同时解决三件事:
- 长上下文高并发:通过 Mamba 状态空间把 KV cache 压成近常量,使同样硬件能撑更大并发或更长上下文。
- 德语质量不输英语:在 27T token 预训练里主动上调德语比例,避免德语被英语稀释成"附庸语种"。
- 真正可复现的主权开源:权重、若干中间 checkpoint、逐源数据配比、超参与训练 / 评测代码一并发布;商业受限数据无法发布原文时也给出聚合统计和精确 mix 账本。
核心方法
1. 混合架构:Mamba + Transformer + MoE
Soofi S 不是单一 Transformer,也不是纯 SSM,而是把 Mamba 选择性状态空间 与 Transformer 注意力层 在每一层(或按某种 block 排布)混排,再用 稀疏 MoE FFN 替换稠密 FFN。具体形式(原文未给出逐层超参,可参考同代混合 SSM 习惯)大致是:
for each block:
h = Norm(x)
if block.kind == "mamba":
h = MambaSSM(h) # 选择性状态空间,cache = 固定维 state
elif block.kind == "attn":
h = SelfAttention(h) # 标准多头注意,cache ∝ sequence
h = h + x
h = MoE(h) # 30B 总参 / 3B 激活:top-k 路由
out = h
要点:
- 总参 30B、激活 3B:每个 token 只激活 1/10 的专家,推理算力大致等同 3B 稠密模型。
- Mamba 部分状态固定:与序列长度解耦,是"近常量 KV cache"的来源;注意力部分仍随长度增长,但被稀释在多数 block 中。
- 专家路由:标准的 top-k 路由(k 的具体值原文未明确,常见取 2 或 4)。
2. 预训练数据:27T token,刻意抬升德语
预训练语料约 27 万亿 token。最关键的不是绝对规模,而是 德语上采样——这是它能在德语评测中与稠密 14–27B 模型对打的关键。代码与英语通用语料同样存在,因此它在两种语言上同时拿到 17 个开源基线里的最佳代码分。
数据治理透明度被作者单拎出来作为卖点:
- 可公开的来源:发布数据构造产物(如去重后的子集、清洗脚本)到宽松许可证。
- 商业受限来源:只公布聚合统计和精确 mix 比例,不公布原文。
这种"半开放数据账本"是主权 AI 现实约束下的折中:在遵守商业合同的前提下最大化可复现性。
3. 训练基础设施:German Industrial AI Cloud
模型端到端在 Deutsche Telekom 运营的慕尼黑主权 HPC AI 云上完成训练。"主权"的含义不仅是数据合规,还包括 算力主权——没有依赖外部 API 或境外云,符合欧洲公共部门 / 受监管行业的部署要求。
4. 评估协议
作者声明的对比维度:
- 与 17 个开源 base 模型比较(包含 Olmo 3 32B、Apertus 70B 等欧洲 / 全开源代表);
- 与"欧洲主权基线"独立比较,涵盖活跃参数量远超自身的稠密模型;
- 评测维度覆盖 英语 / 德语 / 代码 三类聚合榜单。
具体逐项分数(IFEval、MMLU、HumanEval、GermanBench 等)原文 abstract 未给出,原文未明确;以下结论性表述全部基于 abstract 声明。
关键实验与数据
来自 abstract 与 paper_card 的可核实事实:
| 维度 | 数据 / 声明 |
|---|---|
| 总参数 / 激活参数 | 30B / 3B |
| 预训练 token | 约 27 万亿 |
| 架构 | MoE + 混合 Mamba-Transformer |
| KV cache 行为 | 上下文增长近常量(仅注意力层贡献增长) |
| 对比基线数 | 17 个开源 base 模型 |
| 英语 + 德语聚合 | 与稠密 14–27B 模型相当 |
| 代码分(英、德) | 17 个开源基线中均为最佳 |
| 全开源对比 | 英语、德语评分均超 Olmo 3 32B 与 Apertus 70B |
| 欧洲主权对比 | 击败所有欧洲主权基线(含活跃参数量远大于自身的) |
| 开源范围 | 权重、若干中间 checkpoint、逐源数据账本、超参、训练 / 评测代码 |
| 训练基础设施 | German Industrial AI Cloud(Deutsche Telekom,慕尼黑) |
亮点与局限
亮点
- 真正落地的"长上下文高并发"卖点:Mamba 状态空间让 cache 与序列长度解耦,在 100K+ 上下文里服务器侧显存占用不再是线性爆炸,对企业 RAG / 长文档批处理直接友好。
- 3B 激活参数下的代码能力:在 17 个开源基线中代码聚合第一,意味着小激活预算也能保留足够代码能力,对代码补全 / agent 工具调用场景特别有意义。
- 欧洲主权定位清晰:从算力(自有 HPC 云)、数据(半开放账本)到模型许可(高度宽松的开源条款)形成闭环,对受 GDPR / 数据本地化约束的机构是关键卖点。
- 工程透明度:逐源数据比例 + 训练代码 + 评测代码全部公开,社区可重复训练或微调,是少见的"真·开源主权 LLM"。
局限
- abstract 未公开逐项 benchmark 数字:哪些任务领先、领先多少、是否在 reasoning-heavy 任务上被稠密大模型反超,目前看不到——只能信任 aggregate 声明。
- 激活 3B 仍是天花板:在极复杂推理或长链 CoT 上,相比 70B 级别稠密模型仍会有结构性差距。原文未明确给出 reasoning 榜单。
- 德语为重 ≠ 多语种:作为"德英双语"模型,它对其他欧洲语言(法语、波兰语、意大利语等)的覆盖并未宣称;要做泛欧主权 AI 仍需后续多语种扩展。
- 数据半开放的代价:商业受限源给出 mix 比例但不给原文,意味着严格的第三方数据审计无法闭环——监管视角下"主权"与"可审计"仍可能有缝隙。
- 混合架构工具链欠成熟:Mamba-Transformer 混合在 vLLM、TGI、TensorRT-LLM 等推理引擎中的支持仍在演进,部署侧的工程门槛比纯 Transformer 高。
对工程落地的启发
- 长上下文 RAG / Agent 后端候选:3B 激活 + 近常量 cache 的组合非常适合做企业知识库 RAG 的"长上下文重排 / 总结"中间层,或 agent 的长期记忆后端。同等硬件下并发可显著高于稠密 14B / 27B。
- 代码 agent 的低成本基座:以 17 个开源基线中代码分第一为信号,对内部代码补全、PR review、agent 工具调用场景值得做本地化试点;激活 3B 意味着可以在单张高端消费级 GPU 上跑得动。
- 数据配比的范本:刻意上采样目标语言 + 公开逐源 mix 账本,这是值得复用的训练 recipe。对中文 / 阿拉伯语 / 印地语等被英语稀释的语言,主权或区域基础模型都可以参照。
- 主权 AI 立项模板:算力 + 数据 + 模型许可 + 开源透明度四件套同时交付的范式,对其他想建立主权 AI 的国家(中东、东南亚、拉美)具有直接参考价值。
- 混合 SSM 工程的代价:在落地前务必评估推理引擎支持、CUDA graph 兼容、专家并行 / 张量并行的混合并行策略。
与同方向工作的关系
- 同代开源主权 LLM:Olmo 3 32B(Allen AI,全开源、纯 Transformer、稠密)、Apertus 70B(瑞士 EPFL 等,纯 Transformer、稠密)。Soofi S 用 MoE + Mamba 混合 + 更小激活预算在 aggregate 上反超两者,主打更高推理效率。
- 混合架构代表:Jamba(AI21)、Zamba、RecurrentGemma、RWKV-7、YOCO 等都在尝试把 SSM / 线性注意与 Transformer 混排。Soofi S 的差异在于把混合架构与主权定位 + 半开放数据账本打包。
- MoE 高效推理代表:Mixtral、DeepSeek-V3、Qwen3-MoE。Soofi S 的 30B/3A 比例属于这一谱系里偏小激活的一档。
- 欧洲主权 AI 政策线:与 EuroStack、GAIA-X、AI Act 的本地化合规叙事直接呼应。
适合谁读
- 受 GDPR / 数据本地化约束、需要在欧洲境内自托管 LLM 的企业架构师与平台负责人;
- 做长上下文 RAG / agent 后端、想用小激活预算撑高并发的推理工程师;
- 关注主权 AI、数据配比透明度的 LLM 训练研究者;
- 给政府 / 公共部门做技术选型的咨询顾问;
- 关心 Mamba / SSM 与 Transformer 混合架构工程实践的研究者。
不确定处(原文未明确)
- 各 block 中 Mamba 与 Attention 的具体排布比例、专家 top-k 数;
- reasoning / 多步推理类榜单(如 MATH、GPQA)逐项得分;
- 27T token 中德语 / 英语 / 代码的具体比例;
- 训练总成本(GPU-hours)与训练时长;
- 是否采用 MLA、Dropless 训练、sequence parallelism 等近期常见训练优化;
- 对话 / SFT / RLHF 阶段是否在本次发布内(abstract 仅提 base 模型)。
工程落地与核查(Jay)
实际系统怎么用
Soofi S 作为 base 模型,落地路径主要有两条:
路径 A:直接部署做推理服务 30B 总参 / 3B 激活在单卡(如 A100 80G 或 H100)上可跑,适合作为企业内部 LLM API 的基座,支撑德英双语对话、代码补全、长文档总结。推荐推理框架:vLLM(需确认 0.7+ 版本对 Mamba-Transformer 混合的支持情况)或 SGLang。
路径 B:作为 Agent / RAG 的长上下文后端 Mamba 状态空间让 KV cache 随上下文增长幅度远小于纯 Transformer,适合做 100K+ token 的企业知识库 RAG。长文档 chunks 可全量加载,显存压力来自注意力层的注意力矩阵(随长度平方增长),Mamba 层几乎不额外吃 cache。
主要工程坑
坑 1:推理引擎对混合架构的支持仍在完善
⚠️ vLLM 对 Mamba-Transformer 混合的支持有版本窗口要求;TGI(Text Generation Inference)对混合架构支持更晚。TensorRT-LLM 方面,需要确认官方是否已合并 Mamba-Transformer 混合层的 CUDA kernel。建议:先用官方 release 的 soofi-ai/soofi-s 权重跑通 demo,确认推理框架版本后再上生产。若遇到不支持的算子,考虑用 PyTorch eager mode 作为 fallback。
坑 2:"近常量 KV cache"是近常量不是常量 Mamba 状态空间本身不随序列长度增长,但 Transformer 层仍贡献 KV cache。因此在 128K 上下文时,显存占用仍约为纯 Transformer 的 60-80%(取决于 Mamba:Attention 的 block 比例),而非接近零。不要假设可以无限加并发,实测各层的 KV 显存 profile 是部署前的必做功课。
坑 3:专家并行(EP)与张量并行(TP)的混合并行配置 30B / 3A MoE 在多卡部署时,EP 和 TP 的配比直接影响吞吐和延迟。EP 增大可提高吞吐量,但同步开销增加;TP 减小可降低延迟,但通信成本上升。Soofi 未给出推荐配置,初期可参考同规模 Mixtral 系列的调优结果。
坑 4:"超过所有欧洲主权基线(含活跃参数量远大于自身的)"措辞存疑 ⚠️ 原文的"含活跃参数量远大于自身的"说法在物理上不直觉——若活跃参数更少,大幅超越更大激活参数的模型需要极其高效的路由设计才能解释。此处建议降置信度:等论文正式版或官方评测博客发布逐任务分数后再广泛引用,Abstract 数字聚合声明的欺骗性历史上高于逐任务数字。
坑 5:base 模型不等于对话模型 Abstract 仅发布 base 模型,无 SFT / RLHF / 对话数据。当前权重直接用于对话场景会有"helpfulness gap"。需要额外做对齐工作才能在产品中上线。
核查记录
| 核查项 | 结论 | 存疑点 |
|---|---|---|
| "27T token 预训练" | ✅ 合理:27T 量级与同规模预训练项目(DeepSeek-V3 14.8T、Llama-3 15T+)量级一致 | 需等原文核实具体数字 |
| "英语+德语均超 Olmo3 32B 与 Apertus 70B" | ⚠️ 存疑:abstract 未给出具体 benchmark 名字与分数 | 同上 |
| "17 个开源基线中代码分最佳" | ⚠️ 存疑:具体 benchmark(HumanEval / MBPP / MultiPL-E)未明确 | 同上 |
| "击败所有欧洲主权基线" | ⚠️ 存疑:欧洲主权基线的定义未明确,"远大自身"的说法物理上需验证 | 同上 |
| 推理引擎支持 | ⚠️ 存疑:vLLM / TGI 对 Mamba-Transformer 混合的具体版本支持情况 | 需实测 |