openJiuwen:超越静态 Harness 的长程编程 Agent 评测框架 · 干货攻略
- 链接: https://x.com/omarsar0/status/2096200000000000001
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-09-06
- 仓库: openJiuwen-ai/community
这是什么
openJiuwen 是一个开源的 Agent 评测 Harness(测试框架),专门针对长程编程任务设计,发表在 arXiv(论文 2608.27969,2026 年 8 月 28 日提交)。
它的核心论文标题已经点明主题:Beyond Static Harnesses for Long-Horizon Coding Agents(超越静态 Harness 的长程编程 Agent)。这个领域之前的主流 Harness(如 SWE-agent、DeepSeek Harness、DeerFlow)各有一套自己的执行架构,互相难以复用。openJiuwen 的目标是用统一的执行底层 + 可组合的模块机制,同时解决两个问题:
- Structural Composability(结构可组合性):从单 Agent 到子 Agent 再到多 Agent Swarm Flow,复用同一套执行语义,不需要为每种拓扑搭一套新引擎。
- Runtime Adaptivity(运行时自适应性):随着任务推进,新的证据(语义诊断、执行结果、任务进度、上下文相关性变化)会动态影响后续决策,而不是靠静态配置。
为什么值得关注
谁在分享、解决什么问题
@omarsar0(Omar São)推荐了这篇工作,他长期关注 LLM Agent 评测领域。这条推的硬核点在于:openJiuwen 是真正开源的 Agent Harness,能在相同模型对比下超越闭源的 Claude Code,说明框架设计本身对性能有独立贡献。
解决的问题:当前主流编程 Agent(Harness + 模型紧耦合)有三个痛点:
- 框架绑定:Claude Code / Codex 的高级特性只有用自家模型才能发挥,换模型效果断崖。
- 执行语义不统一:单 Agent、子 Agent、Multi-Agent Swarm 各有一套执行逻辑,互相组合时容易出现碎片化的执行路径。
- 缺乏运行时自适应:传统 Harness 是"配置好就按固定逻辑跑",遇到新证据(测试失败、文件变更、LSP 诊断)也不能动态调整。
openJiuwen 正是针对这三点提出的系统性解法。
核验过程
官方来源
-
arXiv 论文摘要页(https://arxiv.org/abs/2608.27969) - 82.6% on SWE-bench Verified;87.19% on Terminal-Bench 2.1(均使用 GPT-5.6 Sol) - Terminal-Bench 2.1 同模型(Fable 5)对比:openJiuwen 84.04% vs Claude Code 83.8%,差距 0.24 pp - 论文标题:Beyond Static Harnesses for Long-Horizon Coding Agents - 核心贡献:Structural Composability + Runtime Adaptivity
-
arXiv HTML 全文(https://arxiv.org/html/2608.27969v1) - 完整读取引用了 Related Work、系统架构图、Table 1 评测结果 - Table 1 数据:Terminal-Bench 2.1 各系统得分,GPT-5.6 Sol 达 87.19%,超 Claude Code Fable 5(83.8%)3.39 pp - Fable 5 同模型对比行:openJiuwen 84.04±1.12 vs Claude Code 83.8±1.2 vs Terminus 2 80.4±1.2 - 架构:Inner Loop / Outer Loop 共享执行核心 + Rail 机制做能力组合
-
GitHub 仓库 README(openJiuwen-ai/community) - 五层架构:DeepAgents、Agent Studio、Agent Framework、Agent Distributed Runtime、Agent System Service - 关键模块:jiuwenswarm(多 Agent 协作)、deepsearch(深度检索)、agent-studio(可视化开发平台)
交叉验证
- Tavily 搜索「openJiuwen agent harness Claude Code 84.04%」:搜索结果片段与 arXiv HTML 正文完全吻合,Table 1 数据在论文正文中已完整展示。
- 多个第三方来源(aimultiple.com、firecrawl.dev)均引用了 SWE-bench Verified 和 Terminal-Bench 2.1 的分数,与官方数字一致。
关于「84.04% SOTA」说法的澄清
原帖表述为「Claude Code 上 84.04% SOTA」,存在歧义,需要修正:
- 84.04% 是 Terminal-Bench 2.1 上、Fable 5 同模型匹配对比的结果,不是全局 SOTA。
- 论文报道的全局最高分为 87.19%(Terminal-Bench 2.1,GPT-5.6 Sol)。
- SWE-bench Verified 得分 82.6%(GPT-5.6 Sol)。
- 官方原文:「exceeding the strongest selected official-leaderboard point estimates by 3.4 and 3.39 percentage points」,即分别超官方 Leaderboard 最强值 3.4 pp 和 3.39 pp。
结论:原帖的「SOTA」说法不准确,严格来说 87.19% 才是该框架在 Terminal-Bench 2.1 上的最高分,84.04% 是特定对比条件下的分数。攻略以论文官方数字为准。
上手步骤
快速安装
# 克隆主仓库(含贡献指南和架构总览)
git clone https://github.com/openJiuwen-ai/community.git
cd community
# 查看各子模块
# jiuwenswarm: 多 Agent 协作框架
git clone https://github.com/openJiuwen-ai/jiuwenswarm.git
# deepsearch: 深度检索 Agent
git clone https://github.com/openJiuwen-ai/deepsearch.git
# agent-studio: 可视化开发平台
git clone https://github.com/openJiuwen-ai/agent-studio.git
核心概念:Rail 机制
Rail 是 openJiuwen 的能力组合单元,类似于生命周期钩子(hook)+ 优先级排序 + 可见性门控的组合:
# Rail 示例(官方文档示意,非可直接运行代码)
rail = Rail(
name="lsp-diagnostics",
trigger="on_tool_result", # 触发时机
priority=10, # 执行优先级
visibility=["file_edit", "search"], # 哪些工具调用时生效
handler=lsp_diagnostic_feedback # 注入语义诊断到上下文
)
评测自己 Agent 的基本流程
# 1. 安装依赖(假设 jiuwenswarm 含评测脚本)
cd jiuwenswarm
pip install -e .
# 2. 配置要评测的 Agent
# 编辑 eval_config.yaml,指定 runner type、模型、任务集
# runner type 支持: claude-code / codex / cli / responses-api
# 3. 运行评测
python -m jiuwenswarm.eval run \
--config eval_config.yaml \
--benchmark terminal-bench-2.1 \
--output results.json
使用 Runtime Adaptivity 机制
四大自适应机制(均来自论文 §3.2):
| 机制 | 作用 | 论文描述 |
|---|---|---|
| Context Management | 动态调整暴露给模型的上下文内容 | 根据任务进度决定保留/丢弃哪些中间结果 |
| Goal Mode | 控制任务接受与停止条件 | 新证据让模型重新判断任务是否已达可接受完成状态 |
| LSP-Driven Passive Feedback | 将 LSP 语义诊断注入后续执行 | 文件修改 → LSP 实时报错 → 自动加入反馈循环 |
| Self-Reflection | 将完成的轨迹提炼为可复用经验 | 跨任务复用成功模式的决策策略 |
坑与适用边界
适用场景
- 评测自己的 Agent 系统:想量化你的 Agent 在 SWE-bench Verified 或 Terminal-Bench 2.1 上的表现,且希望框架本身不影响模型能力对比。
- 构建多 Agent 协作系统:需要统一执行语义的场景(单 Agent → 子 Agent → Swarm Flow 渐进式扩展)。
- 评测框架研究:研究不同 Harness 设计对 Agent 性能的影响,openJiuwen 提供了一个结构清晰的基准。
不适用场景
- 非编程任务:目前基准测试集(SW-bench Verified、Terminal-Bench 2.1)均为编程任务,非编程 Agent 评测不适用。
- 闭源模型即服务:若只希望快速跑通 Claude Code API 而不想理解 Harness 机制,openJiuwen 的学习成本较高。
- 追求开箱即用非编程能力:DeepAgents(JiuwenSwarm、JiuwenSymbiosis、DeepSearch)尚在快速迭代,稳定性不如主流通用框架。
已知局限
- 论文数据基于 2026 年 8 月的模型版本(GPT-5.6 Sol、Fable 5),模型更新后分数可能变化。
- Terminal-Bench 2.1 得分 87.19% 是在 GPT-5.6 Sol 上实现的,换用其他模型结果可能低于官方 SOTA 数字。
- 框架尚处于活跃开发阶段,GitHub 仓库以 Contribution Guide 为主,详细 API 文档需要进一步阅读各子模块。
- Rail 机制细节:论文描述了设计思路,但具体配置参数的工程文档尚未完善。
一句话结论
openJiuwen 是一个以「结构可组合性 + 运行时自适应性」为核心设计的开源 Agent Harness,在 SWE-bench Verified 达 82.6%、Terminal-Bench 2.1 达 87.19%,同等模型对比下超越 Claude Code;如果你在做编程 Agent 的评测或想构建可扩展的多 Agent 系统,它是非常值得研究的开源基础设施。