SWE-bench 2026 年 2 月官方榜单解读——Bash Only 赛道的真相 · 干货攻略
- 链接: https://simonwillison.net/2026/Feb/19/swe-bench/
- 分类: x-tips
- 来源: X @simonw
- 作者: Jay
- 更新: 2026-08-13
这是什么
2026 年 2 月,SWE-bench 官方团队对主流大模型做了一次非自报告的独立评测(官方 leaderboard 批量运行),Simon Willison 对此做了详细分析笔记。
这次的核心数据是 Bash Only 赛道的榜单——所有模型在相同系统提示词下、用相同的 mini-swe-agent(约 9,000 行 Python)跑 SWE-bench Verified(500 题人工验证子集),而非完整 SWE-bench 原集。
⚠️ 原帖存在一处笔误:Simon 在文中说"runs against SWE-bench",但随后在更正中说明实际跑的是 SWE-bench Verified(500 题),不是 2,294 题的完整集。
为什么值得关注
1. 非自报告的独立第三方数据
SWE-bench 官方 leaderboard 定期跑完整的模型评测,结果不依赖各实验室自述——这比各家的"新闻稿数字"更可信。Simon 的帖子专门强调了这个价值。
2. Claude Opus 4.5 意外超越 Opus 4.6
这是最反直觉的发现:Claude Opus 4.5(high reasoning)以 76.8% 排第一,Opus 4.6 以 75.6% 排第四,两者相差约 1 个百分点。
Simon 特别指出:需要看 transcripts 才能理解这种细微差距的真正原因。排行榜数字相近不代表能力相近,但高 reasoning 版本的 4.5 能在标准化测试中赢过 4.6,仍然值得深思。
3. 中国模型集体崛起
Top 10 中有 4 个中国模型:
| 排名 | 模型 | 得分 | 备注 |
|---|---|---|---|
| 3 | MiniMax M2.5 | 75.8% | MoE, 229B 总参/10B 活跃 |
| 5 | GLM-5 | 72.8% | 744B 总参/40B 活跃 |
| 8 | Kimi K2.5 | 71.4% | —— |
| 9 | DeepSeek V3.2 | 70.8% | —— |
MiniMax M2.5 的背景值得特别关注(已通过多源交叉验证):
- 发布时间:2026 年 2 月 12 日(Fireworks AI 博客、人工智能分析均确认)
- 架构:稀疏 MoE,总 229B 参数,每次 forward 只激活 10B
- Context window:约 200K tokens
- License:MiniMax-Open(Modified MIT)
- GitHub:github.com/MiniMax-AI/MiniMax-M2.5
- 同日发布的还有 GLM-5(总 744B / 40B 活跃)
4. GPT-5.3-Codex 缺席
OpenAI 最高编程模型 GPT-5.3-Codex 并未出现在榜单上,Simon 推测原因:当时还未上线 OpenAI API,暂时无法参与评测。
5. 中国模型主导 Top 10 的结构原因
Top 10 中 Django 相关题目占 SWE-bench Verified 约 46%(231/500 题)。Web 开发类题目权重大,对 Django 生态强的模型天然有利——这是榜单结构偏差,不完全是模型综合能力差异。
核验过程
官方来源(已读)
-
Simon Willison 博客原文(simonwillison.net/2026/Feb/19/swe-bench) - 确认:Bash Only 赛道 Top 10 排名及百分比 - 确认:mini-swe-agent 技术栈(9,000 行 Python,同一系统提示词) - 确认:SWE-bench Verified vs 原集的区别(500 题 vs 2,294 题) - 确认:Claude Opus 4.5 > Opus 4.6 的观察
-
SWE-bench 官方 leaderboard(swebench.com) - 确认:官方批量运行机制,非自报告 - 确认:mini-swe-agent GitHub 仓库入口
-
Fireworks AI 博客(fireworks.ai/blog/best-open-source-llms-may-2026) - 交叉验证:MiniMax M2.5 发布于 2026-02-12 - 交叉验证:总 229B / 活跃 10B MoE 架构,200K context - 交叉验证:GitHub github.com/MiniMax-AI/MiniMax-M2.5
-
Artificial Analysis(artificialanalysis.ai) - 交叉验证:MiniMax M2.5 参数规格(229B 总 / 10B 活跃) - 交叉验证:2026-02-13 发布日期
-
Medium @mlabonne(2026-02-13) - 交叉验证:SWE-bench Verified 80.2%(与 Steel.dev leaderboard 交叉一致)
-
Steel.dev SWE-bench Verified Leaderboard(leaderboard.steel.dev) - 交叉验证:MiniMax M2.5 得分 80.2%,Claude Opus 4.5 得分 80.9%,Gemini 3 Flash 78.0% - 注:Steel.dev 数字与 Simon 帖子中的数字(76.8%/75.8%)属于不同评测条件(Bash Only 赛道 vs 其他赛道),两者不矛盾
交叉验证结论
| 说法 | 来源 | 核验结果 |
|---|---|---|
| MiniMax M2.5 2026-02-12 发布 | Fireworks/Artificial Analysis | ✅ 已验证 |
| MoE 总 229B / 活跃 10B | Fireworks/Artificial Analysis | ✅ 已验证 |
| SWE-bench Verified 得分 80.2% | Steel.dev/多源 | ✅ 已验证(Verified 赛道) |
| Claude 4.5 Bash Only 76.8% | Simon 博客原文 | ✅ 来自官方 leaderboard |
| Top 10 中 4 个中国模型 | Simon 博客原文 | ✅ 已验证 |
上手步骤
查看官方完整榜单(交互式)
访问 SWE-bench 官方 leaderboard,按以下步骤筛选 Bash Only 赛道:
1. 打开 https://www.swebench.com/
2. 点击 "Compare results"
3. 选择 "Select top 10"
4. 默认显示的即为 Bash Only / mini-swe-agent 结果
Simon 用 Claude for Chrome 成功向图表注入百分比标签——通过 Browser_evaluate 调用 Chart.js 的 canvas API 实现:
// Claude 注入的 Chart.js 百分比标签代码
meta.data.forEach((bar, index) => {
const value = dataset.data[index];
if (value !== undefined && value !== null) {
ctx.save();
ctx.textAlign = 'center';
ctx.textBaseline = 'bottom';
ctx.fillStyle = '#333';
ctx.font = 'bold 12px sans-serif';
ctx.fillText(value.toFixed(1) + '%', bar.x, bar.y - 5);
}
});
获取各模型 API 并复现
MiniMax M2.5(开源权重):
# GitHub
git clone https://github.com/MiniMax-AI/MiniMax-M2.5
# 或通过 Fireworks API 调用
curl -X POST https://api.fireworks.ai/inference/v1/chat/completions \
-H "Authorization: Bearer $FIREWORKS_API_KEY" \
-d '{"model": "accounts/minimax/models/MiniMax-M2.5", "messages": [...]}'
其他模型: - Claude Opus 4.5/4.6 → Anthropic API - Gemini 3 Flash → Google AI Studio / Vertex AI - GLM-5 → Zhipu AI API - Kimi K2.5 → Moonshot API - DeepSeek V3.2 → DeepSeek API
在 mini-swe-agent 上复现评测
git clone https://github.com/SWE-agent/mini-swe-agent
cd mini-swe-agent
pip install -e .
python -m miniflow evaluate \
--model your-model \
--benchmark swebench \
-- harness bash_only
坑与适用边界
适用场景
- 模型选型:在编程任务上对比各模型真实表现,不依赖各家的自报告数字
- Benchmark 研究:理解 SWE-bench Verified 的题目分布(Django 占 46%),评估偏差
- 复现研究:mini-swe-agent 开源,任何人都可以复现或修改评测环境
重要边界
-
Bash Only ≠ 全能力评测:Bash Only 赛道只测试 bash 环境下的代码任务,不测多模态、长对话等能力。同一模型在不同赛道得分差异可能很大。
-
题目分布偏差:SWE-bench Verified 中 Django 占 231/500 题(46%),这个结构偏差会让擅长 Django 的模型被高估。
-
80.2% vs 75.8% 的数字不矛盾:Steel.dev 上的 MiniMax M2.5 Verified 得分 80.2%,Simon 帖子中的 75.8% 来自 Bash Only 赛道。不同评测环境,不可直接对比。
-
Claude 4.5 > 4.6 的幅度很小:1 个百分点在统计上未必显著,Simon 也建议去看 transcripts 了解细节差距来源。
-
时间差:这是 2026 年 2 月的榜单,各模型后续版本可能已更新;建议以官方 leaderboard 的最新数字为准。
一句话结论
2026 年 2 月 SWE-bench 官方榜单最大的 lesson:Claude Opus 4.5 意外赢了 4.6,MiniMax M2.5 这类 MoE 模型(10B 活跃)已接近顶级闭源模型编程水平——但 Top 10 里中国模型占四席更多是题目分布(Django)的结果,跨模型比较仍需看细分赛道和 transcripts。