Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略

  • 链接: https://x.com/rasbt/status/2081374704753950742
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-07-29

本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。


这是什么

Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 款当周新发布的开源/开放权重模型,并亲手绘制了架构图。这 6 款模型覆盖从 1B 到 314B 的多个档位,各自在架构层面有值得关注的创新:

# 模型 关键架构 规模
1 Nanbeige 4.2 3B Looped Transformer(层循环复用) 3B 非嵌入参数
2 Laguna S 2.1 稀疏 MoE + sliding window GQA 118B 总 / 8B 激活
3 Motif-3-Beta GDLA 注意力 + Grouped PolyNorm 314B 总 / 13B 激活
4 Solar Open 2 混合线性/softmax 注意力 + NoPE 250B 总 / 15B 激活
5 Antares 1B IBM Granite 1B 基础 + SFT+GRPO 安全微调 1B 总参数
6 BTL-3 Qwen3.6-27B + rank-32 LoRA adapter 27B 基座 + adapter

为什么值得关注

当前开源模型发布密度极高,单纯看 benchmark 分数容易忽略架构演进背后的设计逻辑。Raschka 的价值在于他不是罗列数字,而是从工程实现角度解释每款模型在解决什么问题、trade-off 是什么。对于需要选型或深入理解 MoE/长上下文/推理优化的工程师来说,这是难得的实操参考。尤其是 MoE 架构的新变种(GDLA、混合线性注意力)和循环深度共享两个方向,代表了 2026 年中开源 LLM 架构的主要演进方向。


核验过程

以下每款模型的参数均来自其官方 HuggingFace 模型卡或官方博客,Raschka 原帖描述与官方来源对照如下:

模型 原帖关键描述 官方来源 核对结论
Nanbeige 4.2 3B 22 层 block 循环两次,3B 非嵌入参数,约 75% token 效率 HuggingFace 模型卡(附 arxiv 技术报告 2607.22083) ✅ 确认:Looped Transformer,22 层 stack 两次,3B 非嵌入参数,2x 计算 / 相同显存
Laguna S 2.1 118B 总参 / 8B 激活,1M token 上下文,36 sliding-window + 12 global GQA 层 poolside.ai 官方博客 ✅ 确认:118B total / 8B active,1M context,36 sliding-window + 12 global gated-GQA;官方另补充:BF16 需两台 DGX Spark,4-bit 可单台运行
Motif-3-Beta 314B-A13B 稀疏 MoE,GDLA 注意力,源自 DeepSeek V4 的 mHC HuggingFace 模型卡(Motif-Technologies/Motif-3-Beta) ✅ 确认:~314B 总 / ~13B 激活,53 层,384 routed experts(top-8)+ 1 shared expert,262,144 token 上下文,GDLA + Grouped PolyNorm + mHC
Solar Open 2 250B-A15B 混合 MoE,Upstage,3 层线性注意力 + 1 层 softmax HuggingFace 模型卡(upstage/Solar-Open2-250B,附 arxiv 2607.20062) ✅ 确认:250,287,794,944 总参,15B 激活,48 层,321 experts(320 routed + 1 shared),pattern [Softmax, Linear×3] × 12,NoPE,1M context
Antares 1B 1B,IBM Granite 4.0 1B 基础,SFT+GRPO,终端网络安全 HuggingFace 模型卡(fdtn-ai/antares-1b,附 Cisco 技术报告) ✅ 确认:1B 总参,IBM Granite 4.0 1B backbone,SFT→GRPO 两阶段,VLoc Bench File F1 0.209,单卡 H100 约 13 分钟跑完 500 任务
BTL-3 Qwen3.6-27B 的 rank-32 LoRA,编码 agent 用 HuggingFace 模型卡(badtheorylabs/BTL-3) ✅ 确认:冻结 RL-0013 rank-32 PEFT adapter,需单独获取 Qwen3.6-27B 基座;BFCL v4 AST 88.5%,HumanEval 95.12%,LiveCodeBench v6 88.1%;Compact 版 8.39GB(< 2.5 bits/param)

交叉验证结论:6 款模型的核心架构参数(总参、激活参、层数、专家数、上下文长度)均与对应 HuggingFace 模型卡或官方博客一致,未发现显著冲突。Raschka 的描述准确,个别细节(如 Laguna S 的 expert 数量、BF16 需求)在原帖中被省略,不构成错误。


上手步骤

1. Nanbeige 4.2 3B — Looped Transformer 小钢炮

架构要点:单次 forward 经过同一个 22 层 transformer block 两次(循环深度共享),等效 44 层深度但只占用 22 层的显存权重,实现 2x 计算量但相同内存占用。其技术报告(第 2.1 节)指出两次循环是性价比最优解,更多次循环几乎没有额外收益,反而显著拖慢训练。

# HuggingFace 加载
from transformers import AutoTokenizer, AutoModelForCausalLM

model_id = "Nanbeige/Nanbeige4.2-3B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="bfloat16", device_map="auto")

messages = [{"role": "user", "content": "用 Python 写一个快速排序"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

关键文件modeling_nanbeige.py 中包含 LoopSplit、mHC with depth attention、concatenated n-gram embeddings 等架构组件,这些已融入 Nanbeige 4.5 训练流程。


2. Laguna S 2.1 — 单 DGX Spark 可跑的长上下文编码 MoE

架构要点:118B 总参 / 8B 激活,36 个 sliding-window attention 层 + 12 个 global(gated-)GQA 层,1M token 上下文。架构本身偏标准,但与同等规模的竞品相比,它的独特优势在于可以在单台 DGX Spark(< 80GB RAM,4-bit 量化)上运行。官方开源了完整 eval trajectories,允许多次运行结果独立核查,这在业内极为罕见。

# vLLM 推理(官方 day-one 支持 vLLM / SGLang / Ollama)
vllm serve poolside/laguna-s-2-1 \
  --dtype half \
  --max-model-len 1048576 \
  --gpu-memory-utilization 0.90

# OpenRouter 接入(免费 256K,付费 $0.10/$0.20/$0.01 per 1M input/output/cache-read tokens)

BF16 精度需两台 DGX Spark;4-bit 量化单台可跑;官方同步支持 NVIDIA NeMo AutoModel、Prime Intellect Prime Lab、ZML LLMD 等训练框架做后训练。


3. Motif-3-Beta — 全新自研 MoE + GDLA 注意力

架构要点:53 层,384 个 routed experts(top-8 激活)+ 1 个 shared expert,GDLA(Grouped Differential Latent Attention)+ Grouped PolyNorm + mHC,262,144 token 上下文(256K),bfloat16。Motif Technologies 强调这是全自研设计,不是对任何现有开源架构的重新参数化,这一点在 2026 年 MoE 模型中较为独特。

# HuggingFace 加载(需要 trust_remote_code)
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "Motif-Technologies/Motif-3-Beta"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    trust_remote_code=True,
    dtype=torch.bfloat16,
    device_map="auto",
    attn_implementation="flash_attention_2",
)

messages = [{"role": "user", "content": "解释 GDLA 与标准 MLA 的区别"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))

GDLA 原理简述(官方模型卡描述):标准 MLA 将 key/value 压缩到低秩潜在空间以减少 KV cache;GDLA 在此基础上将注意力头分组(groups),并为每组额外学习一个 noise head,用于过滤信号。Regular MLA 主要优化显存,GDLA 在压缩的同时增加了信号滤波机制。

⚠️ 注意:Motif-3-Beta 是预览检查点(preview checkpoint),非最终版本;商业使用需书面申请。Artificial Analysis 评测得分 44(Intelligence Index),但评测期间模型输出了 190M tokens(中位数仅 61M),verbosity 显著偏高。


4. Solar Open 2 — 线性注意力 + NoPE 百万上下文

架构要点:250,287,794,944 总参,15B 激活,48 层,321 experts(320 routed + 1 shared),每 4 层中有 3 个线性注意力层 + 1 个 softmax 注意力层(pattern [Softmax, Linear×3] × 12),彻底移除 rotary 位置编码(NoPE),1M token 上下文,预训练 ~12T tokens,NVIDIA B200 训练 2M GPU hours。

# 量化部署:2× NVIDIA H200 即可
vllm serve upstage/Solar-Open2-250B \
  --dtype half \
  --max-model-len 1048576 \
  --tensor-parallel-size 2

# 官方技术报告 arxiv: 2607.20062

NoPE 原理简述(官方模型卡描述):线性注意力层的 recurrent 状态天然编码了 token 顺序,无需显式位置信息,从而彻底移除了 RoPE 及其外推限制。只有 12 层(共 48 层)保留 KV cache,服务长上下文记忆。仅支持英文、韩文、日文三种语言。

架构初始化从 Solar Open 1(102B)通过选择性权重迁移(selective weight transfer)启动——仅 2.3% 的权重通过架构变化存活,其余随机初始化,官方称这提升了 250B 规模训练的起始点和早期收敛速度。


5. Antares 1B — 终端安全漏洞定位小模型

架构要点:1B 总参,基于 IBM Granite 4.0 1B,SFT → GRPO 两阶段训练,专门做漏洞定位(不是通用代码生成)。模型通过终端接口导航代码仓库(执行 grep/find/cat 等命令),在 VLoc Bench 上 File F1 达到 0.209,超越比自己大数百倍的模型。

# Antares CLI(官方提供 ZIP 包,需配置 OpenAI 兼容推理端点)
# 支持目标 CWE 分析和全仓库扫描,输出 human-readable / JSON / SARIF
antares analyze --repo /path/to/repo \
  --cwe CWE-79 \
  --format sarif \
  --endpoint http://localhost:11434

# 单卡 H100,16 并行 worker,约 13 分钟完成 500 任务 VLoc Bench

适用边界:Antares 只做漏洞定位,不生成代码,不回答通用编程问题。Cisco 提供完整技术报告(fdtn.ai/contact 申请),评估成本极低(500 任务 < $1,~15 分钟单卡)。


6. BTL-3 — Qwen3.6-27B 高效 Agent 编码 LoRA 适配器

架构要点:冻结的 rank-32 PEFT adapter,接 Qwen3.6-27B 基座(需单独获取,Apache-2.0),91.2% BFCL irrelevance(正确避免不必要工具调用),HumanEval 95.12%,LiveCodeBench v6 88.1%。有独立 8.39GB Compact 版(< 2.5 bits/param),在 100 回合工具契约测试中保留了 92.2% 的完整模型行为。

# vLLM 加载 LoRA adapter
vllm serve Qwen/Qwen3.6-27B \
  --revision 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 \
  --served-model-name BTL-3 \
  --enable-lora \
  --max-lora-rank 32 \
  --lora-modules BTL-3=/path/to/BTL-3 \
  --lora-target-modules \
    q_proj k_proj v_proj o_proj \
    in_proj_qkv in_proj_z in_proj_b in_proj_a out_proj \
    gate_proj up_proj down_proj \
  --reasoning-parser qwen3 \
  --language-model-only \
  --max-model-len 32768

关键要求:基座 checkpoint 必须 pin 到指定 revision(6a9e13bd6fc8f0983b9b99948120bc37f49c13e9)才能稳定加载;adapter 本身 Apache-2.0 可自由商用,但基座 Qwen3.6-27B 需另行遵循其许可。


坑与适用边界

  1. Motif-3-Beta 是预览版:非最终 checkpoint,用于生产请等待正式版;许可限制商业使用,Artificial Analysis 评测中 verbosity 偏高(190M vs 61M median tokens),结果需独立验证。

  2. Laguna S 2.1 的 thinking 模式 token 消耗:Terminal-Bench 2.1 70.2% 成绩默认开启 thinking,DeepSWE 从 16.5% 跳到 40.4%,重度使用时要预估 token 成本。BF16 精度需要两台 DGX Spark,量化版才是单卡可跑。

  3. Solar Open 2 的 NoPE 外推限制:线性注意力天然支持长上下文,但 NoPE 在极端分布外文本上的表现仍缺乏独立 benchmark 报告,实用中建议做针对性测试。

  4. Nanbeige 4.2 的 "75% token 效率":来自技术报告 2.1 节,指两次循环相比标准 44 层架构的效率比率,具体测量方式技术报告中未展开,实用中建议以实际任务表现为准。

  5. BTL-3 需要基座模型:adapter 不含基座权重,必须预先获取 Qwen3.6-27B 且 pin 到指定 revision;LoRA target modules 较长,注意确认 vLLM 版本支持。

  6. Antares 1B 是专用安全工具:专注漏洞定位,不生成代码,不做代码补全,不适合作为通用编码助手使用。


一句话结论

六月 LLM Architecture Gallery 更新收录了六款架构层面各有突破的开源模型:Nanbeige 4.2 以循环层复用证明了小模型也能有深推理深度;Laguna S 2.1 刷新了单卡可跑编码 MoE 的规模上限;Motif-3-Beta 的 GDLA 注意力机制是潜在注意力领域值得关注的新变种;Solar Open 2 用 NoPE + 线性注意力组合突破了百万上下文瓶颈;Antares 1B 示范了小模型专用后训练在安全场景的可行性;BTL-3 则再次证明 LoRA 适配器在 2026 年仍是高效调优的利器。六款模型均为开放权重,适合本地部署研究。