SWE-bench 2026 年 2 月官方榜单解读——Bash Only 赛道的真相 · 干货攻略

  • 链接: https://simonwillison.net/2026/Feb/19/swe-bench/
  • 分类: x-tips
  • 来源: X @simonw
  • 作者: Jay
  • 更新: 2026-08-13

这是什么

2026 年 2 月,SWE-bench 官方团队对主流大模型做了一次非自报告的独立评测(官方 leaderboard 批量运行),Simon Willison 对此做了详细分析笔记。

这次的核心数据是 Bash Only 赛道的榜单——所有模型在相同系统提示词下、用相同的 mini-swe-agent(约 9,000 行 Python)跑 SWE-bench Verified(500 题人工验证子集),而非完整 SWE-bench 原集。

⚠️ 原帖存在一处笔误:Simon 在文中说"runs against SWE-bench",但随后在更正中说明实际跑的是 SWE-bench Verified(500 题),不是 2,294 题的完整集。


为什么值得关注

1. 非自报告的独立第三方数据

SWE-bench 官方 leaderboard 定期跑完整的模型评测,结果不依赖各实验室自述——这比各家的"新闻稿数字"更可信。Simon 的帖子专门强调了这个价值。

2. Claude Opus 4.5 意外超越 Opus 4.6

这是最反直觉的发现:Claude Opus 4.5(high reasoning)以 76.8% 排第一,Opus 4.6 以 75.6% 排第四,两者相差约 1 个百分点。

Simon 特别指出:需要看 transcripts 才能理解这种细微差距的真正原因。排行榜数字相近不代表能力相近,但高 reasoning 版本的 4.5 能在标准化测试中赢过 4.6,仍然值得深思。

3. 中国模型集体崛起

Top 10 中有 4 个中国模型

排名 模型 得分 备注
3 MiniMax M2.5 75.8% MoE, 229B 总参/10B 活跃
5 GLM-5 72.8% 744B 总参/40B 活跃
8 Kimi K2.5 71.4% ——
9 DeepSeek V3.2 70.8% ——

MiniMax M2.5 的背景值得特别关注(已通过多源交叉验证):

  • 发布时间:2026 年 2 月 12 日(Fireworks AI 博客、人工智能分析均确认)
  • 架构:稀疏 MoE,总 229B 参数,每次 forward 只激活 10B
  • Context window:约 200K tokens
  • License:MiniMax-Open(Modified MIT)
  • GitHub:github.com/MiniMax-AI/MiniMax-M2.5
  • 同日发布的还有 GLM-5(总 744B / 40B 活跃)

4. GPT-5.3-Codex 缺席

OpenAI 最高编程模型 GPT-5.3-Codex 并未出现在榜单上,Simon 推测原因:当时还未上线 OpenAI API,暂时无法参与评测。

5. 中国模型主导 Top 10 的结构原因

Top 10 中 Django 相关题目占 SWE-bench Verified 约 46%(231/500 题)。Web 开发类题目权重大,对 Django 生态强的模型天然有利——这是榜单结构偏差,不完全是模型综合能力差异。


核验过程

官方来源(已读)

  1. Simon Willison 博客原文(simonwillison.net/2026/Feb/19/swe-bench) - 确认:Bash Only 赛道 Top 10 排名及百分比 - 确认:mini-swe-agent 技术栈(9,000 行 Python,同一系统提示词) - 确认:SWE-bench Verified vs 原集的区别(500 题 vs 2,294 题) - 确认:Claude Opus 4.5 > Opus 4.6 的观察

  2. SWE-bench 官方 leaderboard(swebench.com) - 确认:官方批量运行机制,非自报告 - 确认:mini-swe-agent GitHub 仓库入口

  3. Fireworks AI 博客(fireworks.ai/blog/best-open-source-llms-may-2026) - 交叉验证:MiniMax M2.5 发布于 2026-02-12 - 交叉验证:总 229B / 活跃 10B MoE 架构,200K context - 交叉验证:GitHub github.com/MiniMax-AI/MiniMax-M2.5

  4. Artificial Analysis(artificialanalysis.ai) - 交叉验证:MiniMax M2.5 参数规格(229B 总 / 10B 活跃) - 交叉验证:2026-02-13 发布日期

  5. Medium @mlabonne(2026-02-13) - 交叉验证:SWE-bench Verified 80.2%(与 Steel.dev leaderboard 交叉一致)

  6. Steel.dev SWE-bench Verified Leaderboard(leaderboard.steel.dev) - 交叉验证:MiniMax M2.5 得分 80.2%,Claude Opus 4.5 得分 80.9%,Gemini 3 Flash 78.0% - 注:Steel.dev 数字与 Simon 帖子中的数字(76.8%/75.8%)属于不同评测条件(Bash Only 赛道 vs 其他赛道),两者不矛盾

交叉验证结论

说法 来源 核验结果
MiniMax M2.5 2026-02-12 发布 Fireworks/Artificial Analysis ✅ 已验证
MoE 总 229B / 活跃 10B Fireworks/Artificial Analysis ✅ 已验证
SWE-bench Verified 得分 80.2% Steel.dev/多源 ✅ 已验证(Verified 赛道)
Claude 4.5 Bash Only 76.8% Simon 博客原文 ✅ 来自官方 leaderboard
Top 10 中 4 个中国模型 Simon 博客原文 ✅ 已验证

上手步骤

查看官方完整榜单(交互式)

访问 SWE-bench 官方 leaderboard,按以下步骤筛选 Bash Only 赛道:

1. 打开 https://www.swebench.com/
2. 点击 "Compare results"
3. 选择 "Select top 10"
4. 默认显示的即为 Bash Only / mini-swe-agent 结果

Simon 用 Claude for Chrome 成功向图表注入百分比标签——通过 Browser_evaluate 调用 Chart.js 的 canvas API 实现:

// Claude 注入的 Chart.js 百分比标签代码
meta.data.forEach((bar, index) => {
  const value = dataset.data[index];
  if (value !== undefined && value !== null) {
    ctx.save();
    ctx.textAlign = 'center';
    ctx.textBaseline = 'bottom';
    ctx.fillStyle = '#333';
    ctx.font = 'bold 12px sans-serif';
    ctx.fillText(value.toFixed(1) + '%', bar.x, bar.y - 5);
  }
});

获取各模型 API 并复现

MiniMax M2.5(开源权重):

# GitHub
git clone https://github.com/MiniMax-AI/MiniMax-M2.5
# 或通过 Fireworks API 调用
curl -X POST https://api.fireworks.ai/inference/v1/chat/completions \
  -H "Authorization: Bearer $FIREWORKS_API_KEY" \
  -d '{"model": "accounts/minimax/models/MiniMax-M2.5", "messages": [...]}'

其他模型: - Claude Opus 4.5/4.6 → Anthropic API - Gemini 3 Flash → Google AI Studio / Vertex AI - GLM-5 → Zhipu AI API - Kimi K2.5 → Moonshot API - DeepSeek V3.2 → DeepSeek API

在 mini-swe-agent 上复现评测

git clone https://github.com/SWE-agent/mini-swe-agent
cd mini-swe-agent
pip install -e .
python -m miniflow evaluate \
  --model your-model \
  --benchmark swebench \
  -- harness bash_only

坑与适用边界

适用场景

  • 模型选型:在编程任务上对比各模型真实表现,不依赖各家的自报告数字
  • Benchmark 研究:理解 SWE-bench Verified 的题目分布(Django 占 46%),评估偏差
  • 复现研究:mini-swe-agent 开源,任何人都可以复现或修改评测环境

重要边界

  1. Bash Only ≠ 全能力评测:Bash Only 赛道只测试 bash 环境下的代码任务,不测多模态、长对话等能力。同一模型在不同赛道得分差异可能很大。

  2. 题目分布偏差:SWE-bench Verified 中 Django 占 231/500 题(46%),这个结构偏差会让擅长 Django 的模型被高估。

  3. 80.2% vs 75.8% 的数字不矛盾:Steel.dev 上的 MiniMax M2.5 Verified 得分 80.2%,Simon 帖子中的 75.8% 来自 Bash Only 赛道。不同评测环境,不可直接对比。

  4. Claude 4.5 > 4.6 的幅度很小:1 个百分点在统计上未必显著,Simon 也建议去看 transcripts 了解细节差距来源。

  5. 时间差:这是 2026 年 2 月的榜单,各模型后续版本可能已更新;建议以官方 leaderboard 的最新数字为准。


一句话结论

2026 年 2 月 SWE-bench 官方榜单最大的 lesson:Claude Opus 4.5 意外赢了 4.6,MiniMax M2.5 这类 MoE 模型(10B 活跃)已接近顶级闭源模型编程水平——但 Top 10 里中国模型占四席更多是题目分布(Django)的结果,跨模型比较仍需看细分赛道和 transcripts。