Microsoft Research Orchard:开源 Agent 建模框架
类型:开源框架 · Agent 训练 · SWE-agent · 多 Harness 评估
来源:Microsoft Research · arXiv:2605.15040v1 + MSR Blog
发布时间:MSR Blog 2026-08-03
作者:Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Jianfeng Gao 等(Microsoft Research)
链接:
- arXiv:https://arxiv.org/html/2605.15040v1
- MSR Blog:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
- HuggingFace:https://huggingface.co/datasets/microsoft/Orchard
标签:microsoft-research orchard swe-agent agent-training open-source huggingface-datasets multi-harness-evaluation teacher-distillation mini-swe-agent open-hands
核心问题与动机
SWE-agent 训练的两大瓶颈
- Limited Supervision(监督有限):成功的执行轨迹难以获取,负样本更多
- Sparse Rewards(奖励稀疏):任务周期长,反馈延迟,稀疏奖励难以指导有效学习
Orchard 的解决思路
通过多 teacher 模型蒸馏 + Orchard Env 统一 sandbox + Multi-harness 评估,绕过上述两大瓶颈。
框架架构
三大组件
1. Orchard Env
统一 sandbox 基础设施,支持两种轨迹类型: - SWE 轨迹:代码编辑、测试执行、git 操作 - GUI 轨迹:网页自动化操作(pae-webvoyager subset)
2. Orchard-SWE
基于 Mini-SWE-Agent 框架的训练 workflow,目标是在真实代码库上自主解决软件工程任务。评估基准为 SWE-bench Verified(业界最广泛使用的 SWE Agent 评估集)。
3. Orchard Dataset
107K 轨迹数据集,从强 teacher 模型蒸馏而来:
| Teacher 模型 | 来源 |
|---|---|
| Qwen3.5-397B | Qwen Team, 2026 |
| MiniMax-M2.5 230B | MiniMax, 2026 |
数据集在两种 harness 下采集: - OpenHands harness - mini-swe-agent harness
训练方法
多 Teacher 蒸馏
- 目的:增加成功轨迹多样性,同时保持下游 action space 不变
- 采样策略:每个任务实例采样 5 个 rollout trajectory
- 过滤策略:保留所有成功解决任务的轨迹(即使路径不同)
关键数据
- 107K trajectories 在真实 SWE-bench 任务上采集
- 覆盖SWE-rebench、SWE-rebench V2、Scale-SWE
Multi-harness 评估设计(核心工程贡献)
为什么单 benchmark 不够
Scale-SWE(64.0%)和 OpenSWE-32B(62.4%)在 SWE-bench Verified 上分数相近,但这是假阳性相似——
跨 3 种 harness × 3 种任务的评估揭示了巨大泛化差异:
| 评估维度 | Harnesses | 任务 |
|---|---|---|
| OpenHands | mini-swe-agent | SWE-bench Verified |
| mini-swe-agent | Kimi-CLI | SWE-bench Multilingual |
| — | — | Terminal-Bench 2.0 |
结论:单 benchmark 分数掩盖了 agent 的真实泛化能力,multi-harness 评估才能暴露问题。
工程价值评估
优点
- HuggingFace 直接可用:
datasets.load_dataset("microsoft/Orchard") - 训练数据可直接用于微调:107K 轨迹覆盖多种 harness,是高质量微调数据
- Multi-harness 评估方法可直接借鉴:这个设计思路适用于任何 SWE-agent 评估 pipeline
- 技术栈真实:mini-swe-agent + OpenHands 都是开源框架,可独立使用
限制
- 教师模型为闭源模型(Qwen3.5-397B、MiniMax-M2.5 230B),蒸馏过程不可复现
- Orchard 框架本身的开源程度需进一步核实
后续行动
- [ ] 本周:核实 HuggingFace datasets
microsoft/Orchard的实际可用性和数据格式 - [ ] 本周:了解 Mini-SWE-Agent 框架的开源实现(GitHub: microsoft/mini-swe-agent)
- [ ] 评估:将 multi-harness 评估设计纳入团队 SWE-agent 评估 pipeline
- [ ] 追踪:Scale-SWE 和 OpenSWE-32B 的最新 resolve rates(目前报告为 64.0% 和 62.4%)
相关资源
- Mini-SWE-Agent(Yang et al., 2024)
- OpenHands(Wang et al., 2025b)
- SWE-rebench(Badertdinov et al., 2025)
- SWE-rebench V2(Badertdinov et al., 2026)
- Scale-SWE(Zhao et al., 2026)
- Terminal-Bench 2.0(Merrill et al., 2026)
Jay · 开源框架报告 · 2026-09-18 · 不执行 GitHub 写入