Microsoft Research Orchard:开源 Agent 建模框架

类型:开源框架 · Agent 训练 · SWE-agent · 多 Harness 评估 来源:Microsoft Research · arXiv:2605.15040v1 + MSR Blog 发布时间:MSR Blog 2026-08-03 作者:Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Jianfeng Gao 等(Microsoft Research) 链接: - arXiv:https://arxiv.org/html/2605.15040v1 - MSR Blog:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ - HuggingFace:https://huggingface.co/datasets/microsoft/Orchard 标签microsoft-research orchard swe-agent agent-training open-source huggingface-datasets multi-harness-evaluation teacher-distillation mini-swe-agent open-hands


核心问题与动机

SWE-agent 训练的两大瓶颈

  1. Limited Supervision(监督有限):成功的执行轨迹难以获取,负样本更多
  2. Sparse Rewards(奖励稀疏):任务周期长,反馈延迟,稀疏奖励难以指导有效学习

Orchard 的解决思路

通过多 teacher 模型蒸馏 + Orchard Env 统一 sandbox + Multi-harness 评估,绕过上述两大瓶颈。


框架架构

三大组件

1. Orchard Env

统一 sandbox 基础设施,支持两种轨迹类型: - SWE 轨迹:代码编辑、测试执行、git 操作 - GUI 轨迹:网页自动化操作(pae-webvoyager subset)

2. Orchard-SWE

基于 Mini-SWE-Agent 框架的训练 workflow,目标是在真实代码库上自主解决软件工程任务。评估基准为 SWE-bench Verified(业界最广泛使用的 SWE Agent 评估集)。

3. Orchard Dataset

107K 轨迹数据集,从强 teacher 模型蒸馏而来:

Teacher 模型 来源
Qwen3.5-397B Qwen Team, 2026
MiniMax-M2.5 230B MiniMax, 2026

数据集在两种 harness 下采集: - OpenHands harness - mini-swe-agent harness


训练方法

多 Teacher 蒸馏

  • 目的:增加成功轨迹多样性,同时保持下游 action space 不变
  • 采样策略:每个任务实例采样 5 个 rollout trajectory
  • 过滤策略:保留所有成功解决任务的轨迹(即使路径不同)

关键数据

  • 107K trajectories 在真实 SWE-bench 任务上采集
  • 覆盖SWE-rebench、SWE-rebench V2、Scale-SWE

Multi-harness 评估设计(核心工程贡献)

为什么单 benchmark 不够

Scale-SWE(64.0%)和 OpenSWE-32B(62.4%)在 SWE-bench Verified 上分数相近,但这是假阳性相似——

跨 3 种 harness × 3 种任务的评估揭示了巨大泛化差异:

评估维度 Harnesses 任务
OpenHands mini-swe-agent SWE-bench Verified
mini-swe-agent Kimi-CLI SWE-bench Multilingual
Terminal-Bench 2.0

结论:单 benchmark 分数掩盖了 agent 的真实泛化能力,multi-harness 评估才能暴露问题。


工程价值评估

优点

  • HuggingFace 直接可用datasets.load_dataset("microsoft/Orchard")
  • 训练数据可直接用于微调:107K 轨迹覆盖多种 harness,是高质量微调数据
  • Multi-harness 评估方法可直接借鉴:这个设计思路适用于任何 SWE-agent 评估 pipeline
  • 技术栈真实:mini-swe-agent + OpenHands 都是开源框架,可独立使用

限制

  • 教师模型为闭源模型(Qwen3.5-397B、MiniMax-M2.5 230B),蒸馏过程不可复现
  • Orchard 框架本身的开源程度需进一步核实

后续行动

  • [ ] 本周:核实 HuggingFace datasets microsoft/Orchard 的实际可用性和数据格式
  • [ ] 本周:了解 Mini-SWE-Agent 框架的开源实现(GitHub: microsoft/mini-swe-agent)
  • [ ] 评估:将 multi-harness 评估设计纳入团队 SWE-agent 评估 pipeline
  • [ ] 追踪:Scale-SWE 和 OpenSWE-32B 的最新 resolve rates(目前报告为 64.0% 和 62.4%)

相关资源

  • Mini-SWE-Agent(Yang et al., 2024)
  • OpenHands(Wang et al., 2025b)
  • SWE-rebench(Badertdinov et al., 2025)
  • SWE-rebench V2(Badertdinov et al., 2026)
  • Scale-SWE(Zhao et al., 2026)
  • Terminal-Bench 2.0(Merrill et al., 2026)

Jay · 开源框架报告 · 2026-09-18 · 不执行 GitHub 写入