IBM/AssetOpsBench · 上手攻略
- 仓库:IBM/AssetOpsBench
- 链接:https://github.com/IBM/AssetOpsBench
- 分类:benchmark · agent · industry-4.0
- 作者:Tom
- 更新:2026-08-10
是什么
AssetOpsBench 是 IBM 研究院推出的工业资产运维 AI Agent 基准测试框架,已正式接收为 KDD 2026 Datasets & Benchmarks Track 论文。它模拟真实工业环境(工厂、车间设施),覆盖 9 大资产类别、141+ 运维场景、5 类领域专家 Agent(IoT/FMSR/TSFM/WO/Vibration),提供多 Agent 编排蓝图(MetaAgent、AgentHive)和标准化评估流程。
核心定位:端到端评估工业场景下 LLM Agent 的多步骤推理、工具调用与跨系统数据协同能力。
解决什么问题
工业运维团队面临的核心痛点:传感器数据(IoT)、设备故障模式(FMSR)、时序预测模型(TSFM)、工单系统(WO)、振动信号分析(Vibration)通常由不同系统管理,LLM Agent 需要跨系统协同才能完成"传感器异常 → 查故障模式 → 选预测模型 → 开维修工单"这类真实任务。
AssetOpsBench 提供: - 标准化场景库:在 Hugging Face 上公开,141+ 可复现场景 - MCP 协议接口:六类 FastMCP Server(IoT/TSFM/FMSR/WO/Vibration/Utilities),共 90+ 工具 - 评估流水线:LLM Judge(Llama-4-Maverick-17B)六维评分(推理/执行/数据处理) - 编排框架:Plan-Execute、Deep Agent、Claude Agent、OpenAI Agent 多种 runner
快速安装
# 克隆仓库
git clone https://github.com/IBM/AssetOpsBench.git
cd AssetOpsBench
# 安装依赖(Python 3.12+,推荐 uv)
pip install -e .
# 或使用 uv
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync
# 启动 CouchDB(IoT 数据存储,后端依赖)
docker compose -f src/couchdb/docker-compose.yaml up -d
# 验证 CouchDB 运行状态
curl -X GET http://localhost:5984/
环境配置:复制 .env.public 为 .env,填入 IBM WatsonX 凭证(WATSONX_APIKEY 和 WATSONX_PROJECT_ID,注册地址:https://www.ibm.com/watsonx):
cp .env.public .env
# 编辑 .env,填入 WATSONX_APIKEY 和 WATSONX_PROJECT_ID
⚠️ CouchDB 默认端口 5984,默认用户名/密码为 admin/password,首次运行建议通过 Docker Compose 启动预配置的 CouchDB 实例。
核心用法
运行 Plan-Execute Agent(最简路径,无需 API key)
uv sync
source .venv/bin/activate
# Plan-Execute 模式(使用 WatsonX,需配置 API key)
uv run plan-execute "What sensors are on Chiller 6 in MAIN site?"
# 指定模型
uv run plan-execute --model-id watsonx/granite-3-8b-instruct \
"List all failure modes for pump assets"
MCP Server 独立启动
# IoT Server(CouchDB 中读取传感器数据)
uv run iot-mcp-server
# TSFM Server(时序模型目录与特征工程)
uv run tsfm-mcp-server
# FMSR Server(故障模式推理)
uv run fmsr-mcp-server
Python Client 调用 MCP 工具
from mcphub import MCPHub
hub = MCPHub()
# 列出 MAIN 站点所有资产
assets = hub.iot.assets(site="MAIN")
print(assets)
# 查 Chiller 6 的传感器
sensors = hub.iot.installed_sensors(asset_id="CHILLER-6")
print(sensors)
# 用 TSFM 查可用预测模型
models = hub.tsfm.list_models(model_type="forecasting")
print(models)
⚠️ TSFM Server 目前有 41 个工具,涵盖模型卡片、特征目录、配方执行与结果查询,详细接口见 docs/mcp-servers.md。
评估流程
# 触发评估(需要指定 scenario 和 judge model)
uv run evaluate --scenario "Chiller-Anomaly-Detection" \
--judge-model llama-3-8b-instruct \
--output-dir ./results
评估采用六维标准:任务理解、计划质量、工具调用准确性、数据检索完整性、响应质量、总体合理性。
典型适用场景
| 场景 | 描述 |
|---|---|
| 工业设备健康监测 | Agent 自动查询传感器数据、调用 TSFM 做异常检测、生成维修建议 |
| 多 Agent 编排研究 | 对比 MetaAgent / AgentHive / Deep Agent 等不同编排策略在同一场景的表现 |
| MCP 协议应用 | 以 AssetOpsBench 为例学习 Model Context Protocol 的 stdio 服务端实现 |
| 行业 AI 落地评估 | 在真实工业数据(传感器/工单/故障模式)上系统评估 GPT-4o / Claude / Granite 等模型的差距 |
| KDD 2026 复现 | 对应论文 arXiv:2506.03828,可复现 ACL 2026 IndustryAssetEQA 等多篇顶会工作 |
坑与注意
-
WatsonX API Key 必需:Plan-Execute 和基于 WatsonX 的 Agent 必须提供
WATSONX_APIKEY,纯本地运行仅能使用不带--model-id的简化路径(或通过--model-id litellm_proxy/配合自建 LiteLLM proxy) -
CouchDB 是硬依赖:六类 MCP Server 中 IoT / WO / FMSR / Vibration / TSFM 都依赖 CouchDB 作为后端存储,
docker compose up -d是绕不过的前置步骤 -
Python 3.12+:项目
pyproject.toml明确要求 Python 3.12,低版本 Python 可能出现依赖冲突 -
分支策略复杂:main 分支为活跃开发版;发表论文使用的代码在 ACL 2026 分支
IndustryAssetEQA;历史实验代码在main-0.x,不要在论文复现场景使用 main 分支 -
Colab 演示仅作说明:Colab notebook 展示的是 LLM Agent 概念验证,不是生产级实现;部分 scenario 标注为 "WIP with latest models"
-
LLM Judge 置信度:评分使用 Llama-4-Maverick-17B 作为 judge model,其评分结果的客观性仍有局限,建议结合人工 review 使用
与同类对比
| 维度 | AssetOpsBench | WebArena / MiniWob++ | LangChain AgentEval | Helicone |
|---|---|---|---|---|
| 领域 | 工业运维 4.0 | Web UI 自动化 | 通用 LLM 应用 | LLM 可观测性 |
| 工具协议 | MCP(6 Server/90+ 工具) | Playwright DOM | LangChain Tools | OpenTelemetry |
| 评估方式 | 六维 LLM Judge | 任务完成率 | 通用指标 | 追踪存储 |
| 多 Agent | MetaAgent / AgentHive 原生支持 | 单 Agent | 需自行组装 | 不支持 |
| 数据规模 | 141+ 场景,真实工业数据 | 数百 Web 任务 | 无标准数据集 | 无数据集 |
| 许可 | Apache 2.0 | MIT | MIT | 专有/私有化部署 |
AssetOpsBench 的独特价值在于工业垂直场景 + MCP 协议 + 多 Agent 编排评估三合一,是目前少有的工业 AI Agent 完整基准。
一句话推荐结论
如果你在做工业 AI Agent(设备监控、预测性维护、工单自动化),或想用 MCP 协议构建多 Agent 编排系统,AssetOpsBench 是目前最完整的评估框架——9 大资产类、141+ 场景、开箱即用的 MCP Server,六维评分标准,KDD 2026 背书,值得作为基准首选。
原始链接: - 仓库:https://github.com/IBM/AssetOpsBench - 论文:https://arxiv.org/abs/2506.03828 - HF 数据集:https://huggingface.co/datasets/ibm-research/AssetOpsBench - Colab:https://colab.research.google.com/github/IBM/AssetOpsBench/blob/main-0.x/notebook/LLM_Agent.ipynb