IBM/AssetOpsBench · 上手攻略

  • 仓库:IBM/AssetOpsBench
  • 链接:https://github.com/IBM/AssetOpsBench
  • 分类:benchmark · agent · industry-4.0
  • 作者:Tom
  • 更新:2026-08-10

是什么

AssetOpsBench 是 IBM 研究院推出的工业资产运维 AI Agent 基准测试框架,已正式接收为 KDD 2026 Datasets & Benchmarks Track 论文。它模拟真实工业环境(工厂、车间设施),覆盖 9 大资产类别、141+ 运维场景、5 类领域专家 Agent(IoT/FMSR/TSFM/WO/Vibration),提供多 Agent 编排蓝图(MetaAgent、AgentHive)和标准化评估流程。

核心定位:端到端评估工业场景下 LLM Agent 的多步骤推理、工具调用与跨系统数据协同能力


解决什么问题

工业运维团队面临的核心痛点:传感器数据(IoT)、设备故障模式(FMSR)、时序预测模型(TSFM)、工单系统(WO)、振动信号分析(Vibration)通常由不同系统管理,LLM Agent 需要跨系统协同才能完成"传感器异常 → 查故障模式 → 选预测模型 → 开维修工单"这类真实任务。

AssetOpsBench 提供: - 标准化场景库:在 Hugging Face 上公开,141+ 可复现场景 - MCP 协议接口:六类 FastMCP Server(IoT/TSFM/FMSR/WO/Vibration/Utilities),共 90+ 工具 - 评估流水线:LLM Judge(Llama-4-Maverick-17B)六维评分(推理/执行/数据处理) - 编排框架:Plan-Execute、Deep Agent、Claude Agent、OpenAI Agent 多种 runner


快速安装

# 克隆仓库
git clone https://github.com/IBM/AssetOpsBench.git
cd AssetOpsBench

# 安装依赖(Python 3.12+,推荐 uv)
pip install -e .
# 或使用 uv
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync

# 启动 CouchDB(IoT 数据存储,后端依赖)
docker compose -f src/couchdb/docker-compose.yaml up -d

# 验证 CouchDB 运行状态
curl -X GET http://localhost:5984/

环境配置:复制 .env.public.env,填入 IBM WatsonX 凭证(WATSONX_APIKEYWATSONX_PROJECT_ID,注册地址:https://www.ibm.com/watsonx):

cp .env.public .env
# 编辑 .env,填入 WATSONX_APIKEY 和 WATSONX_PROJECT_ID

⚠️ CouchDB 默认端口 5984,默认用户名/密码为 admin/password,首次运行建议通过 Docker Compose 启动预配置的 CouchDB 实例。


核心用法

运行 Plan-Execute Agent(最简路径,无需 API key)

uv sync
source .venv/bin/activate

# Plan-Execute 模式(使用 WatsonX,需配置 API key)
uv run plan-execute "What sensors are on Chiller 6 in MAIN site?"

# 指定模型
uv run plan-execute --model-id watsonx/granite-3-8b-instruct \
  "List all failure modes for pump assets"

MCP Server 独立启动

# IoT Server(CouchDB 中读取传感器数据)
uv run iot-mcp-server

# TSFM Server(时序模型目录与特征工程)
uv run tsfm-mcp-server

# FMSR Server(故障模式推理)
uv run fmsr-mcp-server

Python Client 调用 MCP 工具

from mcphub import MCPHub

hub = MCPHub()

# 列出 MAIN 站点所有资产
assets = hub.iot.assets(site="MAIN")
print(assets)

# 查 Chiller 6 的传感器
sensors = hub.iot.installed_sensors(asset_id="CHILLER-6")
print(sensors)

# 用 TSFM 查可用预测模型
models = hub.tsfm.list_models(model_type="forecasting")
print(models)

⚠️ TSFM Server 目前有 41 个工具,涵盖模型卡片、特征目录、配方执行与结果查询,详细接口见 docs/mcp-servers.md

评估流程

# 触发评估(需要指定 scenario 和 judge model)
uv run evaluate --scenario "Chiller-Anomaly-Detection" \
  --judge-model llama-3-8b-instruct \
  --output-dir ./results

评估采用六维标准:任务理解、计划质量、工具调用准确性、数据检索完整性、响应质量、总体合理性。


典型适用场景

场景 描述
工业设备健康监测 Agent 自动查询传感器数据、调用 TSFM 做异常检测、生成维修建议
多 Agent 编排研究 对比 MetaAgent / AgentHive / Deep Agent 等不同编排策略在同一场景的表现
MCP 协议应用 以 AssetOpsBench 为例学习 Model Context Protocol 的 stdio 服务端实现
行业 AI 落地评估 在真实工业数据(传感器/工单/故障模式)上系统评估 GPT-4o / Claude / Granite 等模型的差距
KDD 2026 复现 对应论文 arXiv:2506.03828,可复现 ACL 2026 IndustryAssetEQA 等多篇顶会工作

坑与注意

  1. WatsonX API Key 必需:Plan-Execute 和基于 WatsonX 的 Agent 必须提供 WATSONX_APIKEY,纯本地运行仅能使用不带 --model-id 的简化路径(或通过 --model-id litellm_proxy/ 配合自建 LiteLLM proxy)

  2. CouchDB 是硬依赖:六类 MCP Server 中 IoT / WO / FMSR / Vibration / TSFM 都依赖 CouchDB 作为后端存储,docker compose up -d 是绕不过的前置步骤

  3. Python 3.12+:项目 pyproject.toml 明确要求 Python 3.12,低版本 Python 可能出现依赖冲突

  4. 分支策略复杂:main 分支为活跃开发版;发表论文使用的代码在 ACL 2026 分支 IndustryAssetEQA;历史实验代码在 main-0.x,不要在论文复现场景使用 main 分支

  5. Colab 演示仅作说明:Colab notebook 展示的是 LLM Agent 概念验证,不是生产级实现;部分 scenario 标注为 "WIP with latest models"

  6. LLM Judge 置信度:评分使用 Llama-4-Maverick-17B 作为 judge model,其评分结果的客观性仍有局限,建议结合人工 review 使用


与同类对比

维度 AssetOpsBench WebArena / MiniWob++ LangChain AgentEval Helicone
领域 工业运维 4.0 Web UI 自动化 通用 LLM 应用 LLM 可观测性
工具协议 MCP(6 Server/90+ 工具) Playwright DOM LangChain Tools OpenTelemetry
评估方式 六维 LLM Judge 任务完成率 通用指标 追踪存储
多 Agent MetaAgent / AgentHive 原生支持 单 Agent 需自行组装 不支持
数据规模 141+ 场景,真实工业数据 数百 Web 任务 无标准数据集 无数据集
许可 Apache 2.0 MIT MIT 专有/私有化部署

AssetOpsBench 的独特价值在于工业垂直场景 + MCP 协议 + 多 Agent 编排评估三合一,是目前少有的工业 AI Agent 完整基准。


一句话推荐结论

如果你在做工业 AI Agent(设备监控、预测性维护、工单自动化),或想用 MCP 协议构建多 Agent 编排系统,AssetOpsBench 是目前最完整的评估框架——9 大资产类、141+ 场景、开箱即用的 MCP Server,六维评分标准,KDD 2026 背书,值得作为基准首选。


原始链接: - 仓库:https://github.com/IBM/AssetOpsBench - 论文:https://arxiv.org/abs/2506.03828 - HF 数据集:https://huggingface.co/datasets/ibm-research/AssetOpsBench - Colab:https://colab.research.google.com/github/IBM/AssetOpsBench/blob/main-0.x/notebook/LLM_Agent.ipynb