2026 年 1-2 月 10 款开源权重 LLM 架构纵览 · 干货攻略

  • 链接:https://x.com/rasbt/status/2026659971467706603
  • 分类:x-tips
  • 来源:X @rasbt
  • 作者:Jay
  • 更新:2026-08-30

本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自 Raschka 官方 LLM Architecture Gallery(sebastianraschka.com/llm-architecture-gallery)及其杂志文章「A Dream of Spring for Open-Weight LLMs: 10 Architectures from Jan-Feb 2026」(magazine.sebastianraschka.com)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。


这是什么

2026 年 1 月 27 日至 2 月 17 日短短三周内,开源权重社区集中释放了 10 款架构各异的 LLM,形成史上最高密度的发布窗口之一。Sebastian Raschka(@rasbt)于 2026 年 2 月 25 日发表文章,按时间顺序逐一解析这 10 款模型的核心架构设计,帮助工程师快速建立全局视图。

这 10 款模型覆盖从 3B 到 1T 参数、从纯 Dense 到稀疏 MoE、从标准 GQA 到线性注意力混合的完整技术光谱,是理解 2026 年中开源 LLM 架构演进不可多得的实战素材。


为什么值得关注

谁分享的: Sebastian Raschka,AI 教育者、前 Ahead of AI 编辑,以画架构图和写技术深度解析闻名,在开源 LLM 架构领域有极高的技术权威性。

解决什么问题: 开源模型发布频率越来越高,单纯跟踪 benchmark 分数容易迷失在数字里。Raschka 的价值在于从工程架构维度解释每款模型在做什么——注意力机制怎么选、MoE 稀疏度怎么定、为什么要用 MTP、线性注意力为什么开始受关注。这些是选型、压缩、微调工程师真正需要的信息。

本批的核心主题:

  • GQA 成为事实标准 — 几乎所有新模型都采用 Grouped Query Attention,不再使用完整 MHA(Multi-Head Attention),因为 GQA 在 KV cache 效率和推理质量之间提供了最佳平衡点。
  • MLA 与 DeepSeek 模板扩散 — DeepSeek V3 开创的 Multi-Head Latent Attention + 共享专家 MoE 模板被 Kimi K2.5、GLM-5 等多个 1T 参数级模型直接继承或微调。
  • 混合注意力走向主流 — Qwen3.5 将原本只用于 Qwen3-Next(编程专用)的 DeltaNet+Gated Attention 混合机制引入主系列;Ling 2.5 则采用 Lightning Attention + MLA 压缩,走另一条线性注意力路线。线性注意力混合不再是实验性设计,已进入旗舰模型的主线架构。
  • MTP 从训练走进推理 — Step 3.5 Flash 首次在推理阶段正式使用 MTP-3(预测 3 个额外 token),吞吐量比同规模 DeepSeek V3.2 高出 3 倍(100 vs 33 tokens/sec @ 128k context)。

核验过程

官方来源

模型 主来源 关键架构参数
Arcee AI Trinity Large HuggingFace config + 技术报告 arxiv:2602.17004 400B 总参,13B 激活(3.3%),3:1 滑动窗口/全局 gated GQA
Moonshot Kimi K2.5 arXiv:2602.02276 + HuggingFace 1T 总参,32B 激活(3.2%),MLA,DeepSeek V3 模板放大
StepFun Step 3.5 Flash arXiv:2602.10604 + HuggingFace 196B 总参,11B 激活,MTP-3,100 tokens/sec @ 128k
Qwen3-Coder-Next Raschka Gallery + HuggingFace 80B 总参,3B 激活,3:1 Gated DeltaNet + Gated Attention,262k context
z.AI GLM-5 Raschka Gallery(active-parameter-ratio 744B 总参,40B 激活(5.4%),MLA + DeepSeek Sparse Attention
MiniMax M2.5 Raschka Gallery 230B 总参,标准 GQA
Nanbeige 4.1 3B Raschka Gallery 3B Dense,Llama 3 风格
Qwen 3.5 Raschka Gallery + HuggingFace 397B 总参,17B 激活(4.3%),3:1 Gated DeltaNet + Gated Attention
Ant Group Ling 2.5 Raschka Gallery 1T 总参,Lightning Attention + MLA 压缩
Cohere Tiny Aya Raschka Gallery 3.35B,多语言

交叉验证结论

  • 原帖描述 Arcee Trinity 性能「与 GLM-4.5 基本持平」— 技术报告 benchmark 数据支持此说法(见 arxiv:2602.17004)。
  • Kimi K2.5 参数量(1T)与 Raschka Gallery 的 active-parameter-ratio 表一致(32B active,3.2%),无冲突。
  • Step 3.5 Flash 的 100 vs 33 tokens/sec 数据来自 HuggingFace 模型卡标注,与 Raschka 文章引用的数据一致。
  • GLM-5 总参 744B、激活 40B(5.4%)来自 Raschka Gallery 的 active-parameter-ratio 表,属官方配置数据。
  • Qwen3.5 的 397B 总参、17B 激活(4.3%)同样来自 Raschka Gallery 官方表格。
  • 不确定处: Ling 2.5 的具体激活参数量和 Lightning Attention 实现细节在 Raschka Gallery 中未展开,原帖对此描述简略,攻略从 Gallery 表取值并注明「参数细节待官方文档确认」。

上手步骤

访问 sebastianraschka.com/llm-architecture-gallery,按以下维度筛选:

  • 按发布日期排序:查看本批模型集中出现的时间窗口(2026-01-27 至 2026-02-17)
  • 按 Attention 类型筛选:区分 GQA、MLA、DeltaNet 混合、Lightning Attention
  • 按活跃参数量排序:对比各 MoE 模型的稀疏度效率

每个模型卡都包含:架构图(高清可放大)、fact sheet(参数量、context length、vocab size、license)、config.json 链接、技术报告链接、以及与任意其他模型的 diff 对比工具。

进入 Gallery 页面,选择任意两款模型,点击「Compare」可获得并排 fact sheet。以 Kimi K2.5 vs Kimi K2 为例,可直观看到 K2.5 在此基础上加入了多模态(视觉)支持,核心 MoE 架构基本不变。

3. 查看 Active Parameter Ratio 排名表

sebastianraschka.com/llm-architecture-gallery/active-parameter-ratio 展示了各 MoE 模型的稀疏度(活跃参数量/总参数量)。本批中:

模型 总参 活跃参 活跃比例
Arcee Trinity Large 400B 13B 3.3%
Kimi K2.5 1T 32B 3.2%
GLM-5 744B 40B 5.4%
Qwen3.5 397B 17B 4.3%
Ling 2.5 1T

活跃比例越低,推理时每 token 计算量越少,但 MoE 路由开销会增加,选型时需综合考虑。

4. 下载架构图做团队分享

Gallery 每个模型卡下方有「Download」选项,可获取 Raschka 亲手绘制的架构图(含高清 PNG),适合内部 tech talk 或文档使用。


坑与适用边界

  1. 架构图不等于完整技术报告:Raschka 的图是高度抽象的简化版,MoE 层的 expert 数量、FFN 维度等细节不在图中,需要阅读对应技术报告补充。
  2. Linear Attention 混合目前主用于推理优化:Ling 2.5 和 Qwen3.5 的线性注意力层在训练稳定性上仍逊于标准 softmax attention,是否采用取决于你的推理 latency 目标 vs 训练成本权衡。
  3. MTP-3 推理例外不是通用范式:Step 3.5 Flash 在推理时使用 MTP-3(生成 3 个额外 token),这对支持的推理框架有要求,不是所有部署环境都能启用。
  4. 多模态 vs 纯文本:Kimi K2.5 是多模态模型(支持视觉),其余大多数是纯文本——在 Gallery 中查看时注意区分 text decoder 架构信息与多模态部分。
  5. 本批多数模型需自行评估许可证:Arcee Trinity(Custom license)、Kimi K2.5(Modified MIT)、GLM-5(MIT)、MiniMax(Modified MIT)、Qwen3.5(Apache 2.0)、Tiny Aya(待确认),商业使用前务必核实。

一句话结论

2026 年 1-2 月的 10 款开源权重模型密集展示了 GQA→MLA→线性注意力混合三条技术路线的并行演进;MoE 稀疏化已无争议,差异在于注意力机制的选择和 MTP 的使用方式——这将直接决定推理 latency 与训练稳定性的 trade-off,是你选型时最值得比较的两个维度。


本文档基于 Raschka LLM Architecture Gallery(sebastianraschka.com/llm-architecture-gallery)和「A Dream of Spring for Open-Weight LLMs」文章(magazine.sebastianraschka.com)整理,所有模型参数均来自官方配置或技术报告。