Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
- 链接: https://x.com/rasbt/status/2081374704753950742
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-07-29
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。
这是什么
Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 款当周新发布的开源/开放权重模型,并亲手绘制了架构图。这 6 款模型覆盖从 1B 到 314B 的多个档位,各自在架构层面有值得关注的创新:
| # | 模型 | 关键架构 | 规模 |
|---|---|---|---|
| 1 | Nanbeige 4.2 3B | Looped Transformer(层循环复用) | 3B 非嵌入参数 |
| 2 | Laguna S 2.1 | 稀疏 MoE + sliding window GQA | 118B 总 / 8B 激活 |
| 3 | Motif-3-Beta | GDLA 注意力 + Grouped PolyNorm | 314B 总 / 13B 激活 |
| 4 | Solar Open 2 | 混合线性/softmax 注意力 + NoPE | 250B 总 / 15B 激活 |
| 5 | Antares 1B | IBM Granite 1B 基础 + SFT+GRPO 安全微调 | 1B 总参数 |
| 6 | BTL-3 | Qwen3.6-27B + rank-32 LoRA adapter | 27B 基座 + adapter |
为什么值得关注
当前开源模型发布密度极高,单纯看 benchmark 分数容易忽略架构演进背后的设计逻辑。Raschka 的价值在于他不是罗列数字,而是从工程实现角度解释每款模型在解决什么问题、trade-off 是什么。对于需要选型或深入理解 MoE/长上下文/推理优化的工程师来说,这是难得的实操参考。尤其是 MoE 架构的新变种(GDLA、混合线性注意力)和循环深度共享两个方向,代表了 2026 年中开源 LLM 架构的主要演进方向。
核验过程
以下每款模型的参数均来自其官方 HuggingFace 模型卡或官方博客,Raschka 原帖描述与官方来源对照如下:
| 模型 | 原帖关键描述 | 官方来源 | 核对结论 |
|---|---|---|---|
| Nanbeige 4.2 3B | 22 层 block 循环两次,3B 非嵌入参数,约 75% token 效率 | HuggingFace 模型卡(附 arxiv 技术报告 2607.22083) | ✅ 确认:Looped Transformer,22 层 stack 两次,3B 非嵌入参数,2x 计算 / 相同显存 |
| Laguna S 2.1 | 118B 总参 / 8B 激活,1M token 上下文,36 sliding-window + 12 global GQA 层 | poolside.ai 官方博客 | ✅ 确认:118B total / 8B active,1M context,36 sliding-window + 12 global gated-GQA;官方另补充:BF16 需两台 DGX Spark,4-bit 可单台运行 |
| Motif-3-Beta | 314B-A13B 稀疏 MoE,GDLA 注意力,源自 DeepSeek V4 的 mHC | HuggingFace 模型卡(Motif-Technologies/Motif-3-Beta) | ✅ 确认:~314B 总 / ~13B 激活,53 层,384 routed experts(top-8)+ 1 shared expert,262,144 token 上下文,GDLA + Grouped PolyNorm + mHC |
| Solar Open 2 | 250B-A15B 混合 MoE,Upstage,3 层线性注意力 + 1 层 softmax | HuggingFace 模型卡(upstage/Solar-Open2-250B,附 arxiv 2607.20062) | ✅ 确认:250,287,794,944 总参,15B 激活,48 层,321 experts(320 routed + 1 shared),pattern [Softmax, Linear×3] × 12,NoPE,1M context |
| Antares 1B | 1B,IBM Granite 4.0 1B 基础,SFT+GRPO,终端网络安全 | HuggingFace 模型卡(fdtn-ai/antares-1b,附 Cisco 技术报告) | ✅ 确认:1B 总参,IBM Granite 4.0 1B backbone,SFT→GRPO 两阶段,VLoc Bench File F1 0.209,单卡 H100 约 13 分钟跑完 500 任务 |
| BTL-3 | Qwen3.6-27B 的 rank-32 LoRA,编码 agent 用 | HuggingFace 模型卡(badtheorylabs/BTL-3) | ✅ 确认:冻结 RL-0013 rank-32 PEFT adapter,需单独获取 Qwen3.6-27B 基座;BFCL v4 AST 88.5%,HumanEval 95.12%,LiveCodeBench v6 88.1%;Compact 版 8.39GB(< 2.5 bits/param) |
交叉验证结论:6 款模型的核心架构参数(总参、激活参、层数、专家数、上下文长度)均与对应 HuggingFace 模型卡或官方博客一致,未发现显著冲突。Raschka 的描述准确,个别细节(如 Laguna S 的 expert 数量、BF16 需求)在原帖中被省略,不构成错误。
上手步骤
1. Nanbeige 4.2 3B — Looped Transformer 小钢炮
架构要点:单次 forward 经过同一个 22 层 transformer block 两次(循环深度共享),等效 44 层深度但只占用 22 层的显存权重,实现 2x 计算量但相同内存占用。其技术报告(第 2.1 节)指出两次循环是性价比最优解,更多次循环几乎没有额外收益,反而显著拖慢训练。
# HuggingFace 加载
from transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "Nanbeige/Nanbeige4.2-3B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="bfloat16", device_map="auto")
messages = [{"role": "user", "content": "用 Python 写一个快速排序"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
关键文件:modeling_nanbeige.py 中包含 LoopSplit、mHC with depth attention、concatenated n-gram embeddings 等架构组件,这些已融入 Nanbeige 4.5 训练流程。
2. Laguna S 2.1 — 单 DGX Spark 可跑的长上下文编码 MoE
架构要点:118B 总参 / 8B 激活,36 个 sliding-window attention 层 + 12 个 global(gated-)GQA 层,1M token 上下文。架构本身偏标准,但与同等规模的竞品相比,它的独特优势在于可以在单台 DGX Spark(< 80GB RAM,4-bit 量化)上运行。官方开源了完整 eval trajectories,允许多次运行结果独立核查,这在业内极为罕见。
# vLLM 推理(官方 day-one 支持 vLLM / SGLang / Ollama)
vllm serve poolside/laguna-s-2-1 \
--dtype half \
--max-model-len 1048576 \
--gpu-memory-utilization 0.90
# OpenRouter 接入(免费 256K,付费 $0.10/$0.20/$0.01 per 1M input/output/cache-read tokens)
BF16 精度需两台 DGX Spark;4-bit 量化单台可跑;官方同步支持 NVIDIA NeMo AutoModel、Prime Intellect Prime Lab、ZML LLMD 等训练框架做后训练。
3. Motif-3-Beta — 全新自研 MoE + GDLA 注意力
架构要点:53 层,384 个 routed experts(top-8 激活)+ 1 个 shared expert,GDLA(Grouped Differential Latent Attention)+ Grouped PolyNorm + mHC,262,144 token 上下文(256K),bfloat16。Motif Technologies 强调这是全自研设计,不是对任何现有开源架构的重新参数化,这一点在 2026 年 MoE 模型中较为独特。
# HuggingFace 加载(需要 trust_remote_code)
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "Motif-Technologies/Motif-3-Beta"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
trust_remote_code=True,
dtype=torch.bfloat16,
device_map="auto",
attn_implementation="flash_attention_2",
)
messages = [{"role": "user", "content": "解释 GDLA 与标准 MLA 的区别"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
GDLA 原理简述(官方模型卡描述):标准 MLA 将 key/value 压缩到低秩潜在空间以减少 KV cache;GDLA 在此基础上将注意力头分组(groups),并为每组额外学习一个 noise head,用于过滤信号。Regular MLA 主要优化显存,GDLA 在压缩的同时增加了信号滤波机制。
⚠️ 注意:Motif-3-Beta 是预览检查点(preview checkpoint),非最终版本;商业使用需书面申请。Artificial Analysis 评测得分 44(Intelligence Index),但评测期间模型输出了 190M tokens(中位数仅 61M),verbosity 显著偏高。
4. Solar Open 2 — 线性注意力 + NoPE 百万上下文
架构要点:250,287,794,944 总参,15B 激活,48 层,321 experts(320 routed + 1 shared),每 4 层中有 3 个线性注意力层 + 1 个 softmax 注意力层(pattern [Softmax, Linear×3] × 12),彻底移除 rotary 位置编码(NoPE),1M token 上下文,预训练 ~12T tokens,NVIDIA B200 训练 2M GPU hours。
# 量化部署:2× NVIDIA H200 即可
vllm serve upstage/Solar-Open2-250B \
--dtype half \
--max-model-len 1048576 \
--tensor-parallel-size 2
# 官方技术报告 arxiv: 2607.20062
NoPE 原理简述(官方模型卡描述):线性注意力层的 recurrent 状态天然编码了 token 顺序,无需显式位置信息,从而彻底移除了 RoPE 及其外推限制。只有 12 层(共 48 层)保留 KV cache,服务长上下文记忆。仅支持英文、韩文、日文三种语言。
架构初始化从 Solar Open 1(102B)通过选择性权重迁移(selective weight transfer)启动——仅 2.3% 的权重通过架构变化存活,其余随机初始化,官方称这提升了 250B 规模训练的起始点和早期收敛速度。
5. Antares 1B — 终端安全漏洞定位小模型
架构要点:1B 总参,基于 IBM Granite 4.0 1B,SFT → GRPO 两阶段训练,专门做漏洞定位(不是通用代码生成)。模型通过终端接口导航代码仓库(执行 grep/find/cat 等命令),在 VLoc Bench 上 File F1 达到 0.209,超越比自己大数百倍的模型。
# Antares CLI(官方提供 ZIP 包,需配置 OpenAI 兼容推理端点)
# 支持目标 CWE 分析和全仓库扫描,输出 human-readable / JSON / SARIF
antares analyze --repo /path/to/repo \
--cwe CWE-79 \
--format sarif \
--endpoint http://localhost:11434
# 单卡 H100,16 并行 worker,约 13 分钟完成 500 任务 VLoc Bench
适用边界:Antares 只做漏洞定位,不生成代码,不回答通用编程问题。Cisco 提供完整技术报告(fdtn.ai/contact 申请),评估成本极低(500 任务 < $1,~15 分钟单卡)。
6. BTL-3 — Qwen3.6-27B 高效 Agent 编码 LoRA 适配器
架构要点:冻结的 rank-32 PEFT adapter,接 Qwen3.6-27B 基座(需单独获取,Apache-2.0),91.2% BFCL irrelevance(正确避免不必要工具调用),HumanEval 95.12%,LiveCodeBench v6 88.1%。有独立 8.39GB Compact 版(< 2.5 bits/param),在 100 回合工具契约测试中保留了 92.2% 的完整模型行为。
# vLLM 加载 LoRA adapter
vllm serve Qwen/Qwen3.6-27B \
--revision 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 \
--served-model-name BTL-3 \
--enable-lora \
--max-lora-rank 32 \
--lora-modules BTL-3=/path/to/BTL-3 \
--lora-target-modules \
q_proj k_proj v_proj o_proj \
in_proj_qkv in_proj_z in_proj_b in_proj_a out_proj \
gate_proj up_proj down_proj \
--reasoning-parser qwen3 \
--language-model-only \
--max-model-len 32768
关键要求:基座 checkpoint 必须 pin 到指定 revision(6a9e13bd6fc8f0983b9b99948120bc37f49c13e9)才能稳定加载;adapter 本身 Apache-2.0 可自由商用,但基座 Qwen3.6-27B 需另行遵循其许可。
坑与适用边界
-
Motif-3-Beta 是预览版:非最终 checkpoint,用于生产请等待正式版;许可限制商业使用,Artificial Analysis 评测中 verbosity 偏高(190M vs 61M median tokens),结果需独立验证。
-
Laguna S 2.1 的 thinking 模式 token 消耗:Terminal-Bench 2.1 70.2% 成绩默认开启 thinking,DeepSWE 从 16.5% 跳到 40.4%,重度使用时要预估 token 成本。BF16 精度需要两台 DGX Spark,量化版才是单卡可跑。
-
Solar Open 2 的 NoPE 外推限制:线性注意力天然支持长上下文,但 NoPE 在极端分布外文本上的表现仍缺乏独立 benchmark 报告,实用中建议做针对性测试。
-
Nanbeige 4.2 的 "75% token 效率":来自技术报告 2.1 节,指两次循环相比标准 44 层架构的效率比率,具体测量方式技术报告中未展开,实用中建议以实际任务表现为准。
-
BTL-3 需要基座模型:adapter 不含基座权重,必须预先获取 Qwen3.6-27B 且 pin 到指定 revision;LoRA target modules 较长,注意确认 vLLM 版本支持。
-
Antares 1B 是专用安全工具:专注漏洞定位,不生成代码,不做代码补全,不适合作为通用编码助手使用。
一句话结论
六月 LLM Architecture Gallery 更新收录了六款架构层面各有突破的开源模型:Nanbeige 4.2 以循环层复用证明了小模型也能有深推理深度;Laguna S 2.1 刷新了单卡可跑编码 MoE 的规模上限;Motif-3-Beta 的 GDLA 注意力机制是潜在注意力领域值得关注的新变种;Solar Open 2 用 NoPE + 线性注意力组合突破了百万上下文瓶颈;Antares 1B 示范了小模型专用后训练在安全场景的可行性;BTL-3 则再次证明 LoRA 适配器在 2026 年仍是高效调优的利器。六款模型均为开放权重,适合本地部署研究。