E-Commerce Bench:首个长周期 AI 电商智能体评测基准 · 干货攻略
- 链接: https://x.com/omarsar0 | https://arxiv.org/abs/2608.30730
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-09-04
- 仓库: QwenLM/E-CommerceBench · openJiuwen-ai/openJiuwen
这是什么
E-Commerce Bench 是 QwenLM 团队发布的首个长周期 AI 智能体评测基准(arXiv:2608.30730,2026),核心思路是:
给每个 LLM Agent 发放 ¥100,000 启动资金,让它同时经营最多 4 家网店整整 365 个模拟日,涵盖采购谈判、库存管理、定价策略、订单履约、退货处理和现金流运作,最终以年末总资产衡量胜负。
数据集来自真实电商平台(商品信息和供应商数据),并叠加了全年促销活动、自然灾害和供应链冲击等动态事件,确保评测环境接近真实商业复杂性。评测采用确定性市场模型(消费者购买/退货遵循固定需求模型,谈判内核决定供应商定价和让步),LLM 仅负责生成谈判话术,排除随机性干扰。
评测覆盖 18 个前沿模型,从 GPT-5.6 Sol 到 Qwen3.5-Plus,从 7 个维度打分:年末资产、欺诈规避率(BadSpend%)、资金回撤(Drawdown/peak)、运营效率(¥ per tool call)、可控回报率、议价能力(CSE⁺)和学习能力(AnchorRatio)。
为什么值得关注
谁分享的、解决什么问题
E-Commerce Bench 论文由清华-腾讯联合团队发表,第一作者为 Wei Fan。该工作的核心贡献是填补了"长周期 Agent 评测"的空白——现有 Agent 评测多为单次任务或短链任务(如 HotpotQA、MiniWob++),无法衡量 Agent 在时序决策、多目标权衡和动态适应方面的能力。
电商场景天然具有以下挑战,正好对应当前 Agent 的核心弱点:
| 挑战类型 | E-Commerce Bench 中的体现 |
|---|---|
| 时序决策 | 365 天经营,需要跨阶段分配资源 |
| 多轮谈判 | 与供应商多轮议价,欺诈供应商混杂其间 |
| 动态事件 | 促销活动/自然灾害改变需求,必须实时调整 |
| 现金流约束 | 库存积压或断货都会导致资产缩水 |
| 多目标权衡 | 利润率 vs. 资金周转 vs. 欺诈规避需同时兼顾 |
官方评测结果(关键数字均有据可查)
- 启动资金: ¥100,000/模型
- 评测 episodes: 每模型 5 次独立运行,取均值
- 模型数量: 18 个(含 GPT-5.6 Sol、Fable5、Claude Opus 4.8、Qwen3.8-Max-Preview 等)
专有模型排名(按年末总资产):
| 模型 | 年末资产(¥k,均值) | 欺诈规避(BadSpend%) |
|---|---|---|
| GPT-5.6 Sol (max) | 1,431(14.3x) | 18.48%(第16名) |
| Fable5 (max) | 805(8x) | 3.46% |
| GPT-5.5 | 702(7x) | 16.59%(2/5次破产) |
| Claude Opus 4.8 (max) | 498(5x) | 5.41% |
| Claude Opus 4.7 (max) | 259(2.6x) | 0.12% |
开源模型排名:
| 模型 | 年末资产(¥k,均值) |
|---|---|
| Qwen3.8-Max-Preview | 416(4.2x,开源第一) |
| GLM 5.2 (high) | 301(3x) |
| Kimi K3 | 265(2.7x) |
| DeepSeek-V4-Pro-Preview (max) | 190(1.9x) |
| Qwen3.5-Plus | 1.1(0.01x,4/5次破产) |
注意:原帖称 openJiuwen "SOTA 84.04%",经核验,该数字指的是 openJiuwen 在 Terminal-Bench 2.1 上配合 Fable5 模型取得的 84.04%(vs Claude Code 83.8%),并非 E-Commerce Bench 的数字,需区分两个不同评测体系。
核验过程
官方来源
- arXiv 论文摘要(https://arxiv.org/abs/2608.30730):确认 E-Commerce Bench 的设定为 365 天、4 店、18 模型、7 维度、¥100k 启动资金,GPT-5.6 Sol 年末 1,431,425(即 ¥1,431k)。
- GitHub README(https://github.com/QwenLM/E-CommerceBench):确认评测框架设计、评分指标定义(主分为年末总资产/开盘资金倍率)、18 模型排行榜完整数据。
- openJiuwen arXiv HTML(https://arxiv.org/html/2608.27969v1):确认 openJiuwen 的 84.04% 是 Terminal-Bench 2.1 上配合 Fable5 的成绩,对应 Claude Code 83.8%;SWE-bench Verified 为 82.6%,Terminal-Bench 2.1 为 87.19%(openJiuwen + GPT-5.6 Sol)。
交叉验证结论
- 论文摘要与 GitHub README 数据一致,GPT-5.6 Sol 年末 1,431,425 yen 换算即 ¥1,431k,倍率 14.3x,官方排行榜标注为 ¥1,431。
- 18 模型排行榜数据在 README 中完整列出,7 个维度均与摘要描述一致。
- openJiuwen 84.04% 数字在论文正文中明确对应 Terminal-Bench 2.1(Fable5 对比组),原帖引用时未注明是另一评测体系,已在本文中纠正。
上手步骤
运行 E-Commerce Bench(官方 GitHub)
# 克隆仓库
git clone https://github.com/QwenLM/E-CommerceBench.git
cd E-CommerceBench
# 安装依赖(推荐 Python 3.10+)
pip install -r requirements.txt
# 查看评测配置
cat config/eval_config.yaml
# 运行评测(以 Qwen3.8-Max-Preview 为例)
python -m ecbench.run_eval \
--model qwen3.8-max-preview \
--episodes 5 \
--output results/qwen3.8-max-preview
# 查看排行榜
python -m ecbench.visualize --results results/
关键配置项说明
| 参数 | 含义 |
|---|---|
--model |
指定评测模型(如 gpt-5.6-sol、qwen3.8-max-preview) |
--episodes |
独立运行次数,官方用 5 次取均值 |
--max_days |
模拟天数,默认 365 |
--num_stores |
同时经营店铺数,默认 4 |
使用 openJiuwen 构建自己的 Agent Harness
# 安装 openJiuwen
pip install openjiuwen
# 初始化项目
openjiuwen init my-agent --template coding
# 定义 Rail(结构化能力组合)
# 编辑 rails/my_rail.yaml
openjiuwen run --rail rails/my_rail.yaml --model gpt-5.6-sol
openJiuwen 的核心创新在于Rail 机制(结构化能力组合)和证据驱动的运行时适应——随着任务执行产生新的证据(诊断、进度、上下文变化),框架自动调整 context、feedback 和 task control,无需重写 harness 逻辑。
坑与适用边界
⚠️ 评测局限性
- 模拟环境简化:尽管数据来自真实平台,市场模型(供需/谈判)是确定性规则,不能完全代表真实电商运营的混沌性。
- 资金单位为日元(¥):¥100,000 实为 10 万日元,非人民币或美元,资产倍率的实际购买力需换算理解。
- 破产风险不对称:部分模型(GPT-5.5、Qwen3.5-Plus)出现多次破产运行,排行榜均值被严重拉低,但中位数可能更有参考价值(README 仅公布均值)。
- 封闭域评测:仅覆盖电商场景,不能泛化到其他长周期任务(代码开发、科研探索等)。
⚠️ openJiuwen 84.04% 的误读风险
原帖将 openJiuwen 的 84.04% 与 E-Commerce Bench 混在一起描述,实际上这是 Terminal-Bench 2.1(代码终端任务)的成绩,两者在任务类型和评测指标上完全不同,不可混用。
适用边界
- ✅ 想评估模型在长周期时序决策上的能力
- ✅ 研究多目标权衡(利润 vs. 风险 vs. 效率)
- ✅ 构建电商场景 Agent 或想用真实商业数据训练
- ❌ 想评估单次编程或短任务能力(用 SWE-bench、Terminal-Bench)
- ❌ 想评估通用推理(用 MMLU、GPQA)
一句话结论
E-Commerce Bench 是目前唯一一个覆盖完整年度商业周期的 LLM Agent 评测,18 模型跑分揭示了"最强赚钱模型"(GPT-5.6 Sol 14.3x)与"最稳健风控模型"(Claude Opus 4.7 0.12% BadSpend)之间的根本权衡;而 openJiuwen 作为动态 Agent Harness,在 Terminal-Bench 2.1 上以 87.19% 证明了结构化可组合性 + 证据驱动适应是超越静态 harness 的关键路径——两者共同指向一个结论:长周期 Agent 的瓶颈不在模型本身,而在 harness 的动态适应能力。