2026 年 1-2 月 10 款开源权重 LLM 架构纵览 · 干货攻略
- 链接:https://x.com/rasbt/status/2026659971467706603
- 分类:x-tips
- 来源:X @rasbt
- 作者:Jay
- 更新:2026-08-30
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自 Raschka 官方 LLM Architecture Gallery(sebastianraschka.com/llm-architecture-gallery)及其杂志文章「A Dream of Spring for Open-Weight LLMs: 10 Architectures from Jan-Feb 2026」(magazine.sebastianraschka.com)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。
这是什么
2026 年 1 月 27 日至 2 月 17 日短短三周内,开源权重社区集中释放了 10 款架构各异的 LLM,形成史上最高密度的发布窗口之一。Sebastian Raschka(@rasbt)于 2026 年 2 月 25 日发表文章,按时间顺序逐一解析这 10 款模型的核心架构设计,帮助工程师快速建立全局视图。
这 10 款模型覆盖从 3B 到 1T 参数、从纯 Dense 到稀疏 MoE、从标准 GQA 到线性注意力混合的完整技术光谱,是理解 2026 年中开源 LLM 架构演进不可多得的实战素材。
为什么值得关注
谁分享的: Sebastian Raschka,AI 教育者、前 Ahead of AI 编辑,以画架构图和写技术深度解析闻名,在开源 LLM 架构领域有极高的技术权威性。
解决什么问题: 开源模型发布频率越来越高,单纯跟踪 benchmark 分数容易迷失在数字里。Raschka 的价值在于从工程架构维度解释每款模型在做什么——注意力机制怎么选、MoE 稀疏度怎么定、为什么要用 MTP、线性注意力为什么开始受关注。这些是选型、压缩、微调工程师真正需要的信息。
本批的核心主题:
- GQA 成为事实标准 — 几乎所有新模型都采用 Grouped Query Attention,不再使用完整 MHA(Multi-Head Attention),因为 GQA 在 KV cache 效率和推理质量之间提供了最佳平衡点。
- MLA 与 DeepSeek 模板扩散 — DeepSeek V3 开创的 Multi-Head Latent Attention + 共享专家 MoE 模板被 Kimi K2.5、GLM-5 等多个 1T 参数级模型直接继承或微调。
- 混合注意力走向主流 — Qwen3.5 将原本只用于 Qwen3-Next(编程专用)的 DeltaNet+Gated Attention 混合机制引入主系列;Ling 2.5 则采用 Lightning Attention + MLA 压缩,走另一条线性注意力路线。线性注意力混合不再是实验性设计,已进入旗舰模型的主线架构。
- MTP 从训练走进推理 — Step 3.5 Flash 首次在推理阶段正式使用 MTP-3(预测 3 个额外 token),吞吐量比同规模 DeepSeek V3.2 高出 3 倍(100 vs 33 tokens/sec @ 128k context)。
核验过程
官方来源
| 模型 | 主来源 | 关键架构参数 |
|---|---|---|
| Arcee AI Trinity Large | HuggingFace config + 技术报告 arxiv:2602.17004 | 400B 总参,13B 激活(3.3%),3:1 滑动窗口/全局 gated GQA |
| Moonshot Kimi K2.5 | arXiv:2602.02276 + HuggingFace | 1T 总参,32B 激活(3.2%),MLA,DeepSeek V3 模板放大 |
| StepFun Step 3.5 Flash | arXiv:2602.10604 + HuggingFace | 196B 总参,11B 激活,MTP-3,100 tokens/sec @ 128k |
| Qwen3-Coder-Next | Raschka Gallery + HuggingFace | 80B 总参,3B 激活,3:1 Gated DeltaNet + Gated Attention,262k context |
| z.AI GLM-5 | Raschka Gallery(active-parameter-ratio) | 744B 总参,40B 激活(5.4%),MLA + DeepSeek Sparse Attention |
| MiniMax M2.5 | Raschka Gallery | 230B 总参,标准 GQA |
| Nanbeige 4.1 3B | Raschka Gallery | 3B Dense,Llama 3 风格 |
| Qwen 3.5 | Raschka Gallery + HuggingFace | 397B 总参,17B 激活(4.3%),3:1 Gated DeltaNet + Gated Attention |
| Ant Group Ling 2.5 | Raschka Gallery | 1T 总参,Lightning Attention + MLA 压缩 |
| Cohere Tiny Aya | Raschka Gallery | 3.35B,多语言 |
交叉验证结论
- 原帖描述 Arcee Trinity 性能「与 GLM-4.5 基本持平」— 技术报告 benchmark 数据支持此说法(见 arxiv:2602.17004)。
- Kimi K2.5 参数量(1T)与 Raschka Gallery 的 active-parameter-ratio 表一致(32B active,3.2%),无冲突。
- Step 3.5 Flash 的 100 vs 33 tokens/sec 数据来自 HuggingFace 模型卡标注,与 Raschka 文章引用的数据一致。
- GLM-5 总参 744B、激活 40B(5.4%)来自 Raschka Gallery 的 active-parameter-ratio 表,属官方配置数据。
- Qwen3.5 的 397B 总参、17B 激活(4.3%)同样来自 Raschka Gallery 官方表格。
- 不确定处: Ling 2.5 的具体激活参数量和 Lightning Attention 实现细节在 Raschka Gallery 中未展开,原帖对此描述简略,攻略从 Gallery 表取值并注明「参数细节待官方文档确认」。
上手步骤
1. 使用 Raschka LLM Architecture Gallery 快速查模型
访问 sebastianraschka.com/llm-architecture-gallery,按以下维度筛选:
- 按发布日期排序:查看本批模型集中出现的时间窗口(2026-01-27 至 2026-02-17)
- 按 Attention 类型筛选:区分 GQA、MLA、DeltaNet 混合、Lightning Attention
- 按活跃参数量排序:对比各 MoE 模型的稀疏度效率
每个模型卡都包含:架构图(高清可放大)、fact sheet(参数量、context length、vocab size、license)、config.json 链接、技术报告链接、以及与任意其他模型的 diff 对比工具。
2. 使用 Gallery Diff 工具对比两款架构
进入 Gallery 页面,选择任意两款模型,点击「Compare」可获得并排 fact sheet。以 Kimi K2.5 vs Kimi K2 为例,可直观看到 K2.5 在此基础上加入了多模态(视觉)支持,核心 MoE 架构基本不变。
3. 查看 Active Parameter Ratio 排名表
sebastianraschka.com/llm-architecture-gallery/active-parameter-ratio 展示了各 MoE 模型的稀疏度(活跃参数量/总参数量)。本批中:
| 模型 | 总参 | 活跃参 | 活跃比例 |
|---|---|---|---|
| Arcee Trinity Large | 400B | 13B | 3.3% |
| Kimi K2.5 | 1T | 32B | 3.2% |
| GLM-5 | 744B | 40B | 5.4% |
| Qwen3.5 | 397B | 17B | 4.3% |
| Ling 2.5 | 1T | — | — |
活跃比例越低,推理时每 token 计算量越少,但 MoE 路由开销会增加,选型时需综合考虑。
4. 下载架构图做团队分享
Gallery 每个模型卡下方有「Download」选项,可获取 Raschka 亲手绘制的架构图(含高清 PNG),适合内部 tech talk 或文档使用。
坑与适用边界
- 架构图不等于完整技术报告:Raschka 的图是高度抽象的简化版,MoE 层的 expert 数量、FFN 维度等细节不在图中,需要阅读对应技术报告补充。
- Linear Attention 混合目前主用于推理优化:Ling 2.5 和 Qwen3.5 的线性注意力层在训练稳定性上仍逊于标准 softmax attention,是否采用取决于你的推理 latency 目标 vs 训练成本权衡。
- MTP-3 推理例外不是通用范式:Step 3.5 Flash 在推理时使用 MTP-3(生成 3 个额外 token),这对支持的推理框架有要求,不是所有部署环境都能启用。
- 多模态 vs 纯文本:Kimi K2.5 是多模态模型(支持视觉),其余大多数是纯文本——在 Gallery 中查看时注意区分 text decoder 架构信息与多模态部分。
- 本批多数模型需自行评估许可证:Arcee Trinity(Custom license)、Kimi K2.5(Modified MIT)、GLM-5(MIT)、MiniMax(Modified MIT)、Qwen3.5(Apache 2.0)、Tiny Aya(待确认),商业使用前务必核实。
一句话结论
2026 年 1-2 月的 10 款开源权重模型密集展示了 GQA→MLA→线性注意力混合三条技术路线的并行演进;MoE 稀疏化已无争议,差异在于注意力机制的选择和 MTP 的使用方式——这将直接决定推理 latency 与训练稳定性的 trade-off,是你选型时最值得比较的两个维度。
本文档基于 Raschka LLM Architecture Gallery(sebastianraschka.com/llm-architecture-gallery)和「A Dream of Spring for Open-Weight LLMs」文章(magazine.sebastianraschka.com)整理,所有模型参数均来自官方配置或技术报告。