CoffeeBench:长视野 LLM Agent 在异构多 Agent 经济中的基准测试

  • 关联论文:2606.16613
  • 作者:flyP
  • 更新:2026-07-11

一句话结论

CoffeeBench 把 LLM Agent 放进一个由咖啡产业链上的农户、烘焙商、零售商组成的 90 天多 Agent 经济模拟里,检验它们在长视野、异构对手、真实现金流和库存压力下能否持续做出有利可图的决策——结论是当前主流模型虽然都能跑赢"什么都不做"的被动基线,但在沟通频率、长程规划与"行动瘫痪"(idle-drift)上呈现出显著差异。

它在解决什么真问题

现有的 Agent 评测多把环境当作被动的、单 Agent 面对的工具集(GAIA、SWE-bench、WebArena 等),很少考核 Agent 在多方博弈长视野两个维度上同时存在压力的真实经济系统中的表现。CoffeeBench 想回答的是:

  1. 当 Agent 必须持续与异构对手(不同目标、不同体量、不同风险偏好)沟通、谈判、交易时,跨模型的能力差异到底有多大?
  2. 在 90 天这种长视野的时间跨度下,Agent 会不会因为"今天的决策影响明天的现金流和库存"而出现系统性的失败模式?
  3. 失败到底是"算错了"还是"想明白了但不敢动"?

作者认为,传统 benchmark 把 Agent 当成静态任务执行者,忽略了 Agent 真正要在生产里长期生存所要面对的经济激励和对手不确定性。

核心方法:CoffeeBench 的设计

1. 一个可拆解的多 Agent 经济系统

模拟一条简化但完整的咖啡价值链,包含三类角色共 6 个企业:

  • 2 个农户(farmers):负责种植、收获、决定卖给谁、谈判价格;
  • 2 个烘焙商(roasters):从农户买入生豆、烘焙、管理库存和销售给零售商;
  • 2 个零售商(retailers):从烘焙商买入成品、管理店面库存和定价。

每个企业都有自己的现金、库存、定价、产能上限,目标是 90 天模拟结束时的累计净收入最大化

2. 评测时只让一个角色由 LLM 接管

这是设计的关键:被评测的 LLM 只控制其中一个烘焙商,其他 5 个企业由固定的参考 Agent(reference agents)驱动。这样做的好处是:

  • 横向可比:所有被测模型面对的是同一组对手策略;
  • 排除了"对手能力差异"对结果的污染;
  • 模拟多 Agent 经济中的异构性——被测 Agent 必须在"和自己不一样"的对手之间生存。

3. 长视野与通信机制

模拟按"天"推进,每天所有企业可以做多次行动,包括:

  • 库存管理(进货、出货、调整产能);
  • 定价决策;
  • 与其他企业的自由文本通信(报价、议价、请求延期等);
  • 现金和库存约束必须严格满足(不能赊账透支)。

90 天意味着 Agent 必须考虑信用、库存周转、对手反应等长程因素,而不是单步优化。

4. 指标与基线

  • 主指标:90 天累计净收入(revenue − cost);
  • 基线:一个被动基线,什么都不做;
  • 横向对比多个 SOTA 模型的开源权重版与闭源版。

伪代码大致可以这样描述评测流程:

initialize 2 farmers, 2 roasters, 2 retailers with reference policies
replace one roaster with the LLM under test
for day in 1..90:
    for each firm:
        observe state (cash, inventory, market, messages)
        decide action (trade, price, message, wait)
    resolve trades, update cash/inventory
    log trajectory
return total net income of the LLM-controlled roaster

关键实验与数据

论文报告了几组关键发现(数值范围以原 abstract 与 card 提供的范围为依据):

  • 所有被测模型都跑赢了被动基线,且大多数取得正净收入,说明当前主流 LLM 在 90 天多 Agent 经济里至少不会"亏穿";
  • 表现更好的模型与对手企业的沟通更活跃——这暗示长程表现与"主动议价 / 主动协调"行为高度相关,而不是单纯靠"沉默优化";
  • Claude Haiku 4.5 出现一种独特的 failure mode:idle-drift。它的内部评估和规划是连贯的(能讲清楚局势),但反复选择不行动("想明白了但不下单"),最终净收入显著低于同档对手;
  • 不同模型在现金管理、库存周转、议价成功率等子指标上呈现出清晰的能力分层;
  • 论文公开了完整代码与所有 Agent trajectory,方便后续做 mechanistic interpretability、prompt ablation、对手策略对抗等二次研究。

需要强调的是,具体的净收入绝对数值、模型排名与置信区间,原文未在 abstract 中逐项给出——上文结论全部基于 abstract 与卡片 TLDR 给出的方向性判断,更精确的对比表需要读正文 8 张图与 23 页附录。

行为画像:失败模式分类

把 abstract 透露的结论展开看,CoffeeBench 给出的行为画像大致可以归为三类:

  • 积极沟通型:在每个时间步主动发起议价、报价、催促等行为,对手策略变化时能快速调整;这批模型通常是最终净收入的前列。
  • 保守规划型:在内部 reasoning 中给出连贯而合理的计划,但落到行动层往往"少做或不做",典型代表就是 Claude Haiku 4.5 的 idle-drift。
  • 被动基线型:接近"什么都不做"策略,净收入趋近 0,但不会主动亏损。

这种画像区分度比单看 net income 一个数字更有信息量——它直接告诉你模型在长视野压力下的"行为偏好",对工程选型至关重要。

与既有"长视野"评测的对比

如果和已有 Agent 评测横向比较,CoffeeBench 的"长视野"更接近真实业务:

  • SWE-bench / SWE-bench Verified 解决的是"修一个 bug",时间跨度是分钟级;
  • GAIA 解决的是"回答一个需要多步推理的问题",时间跨度也是单任务级;
  • τ-bench / τ²-bench 一定程度上引入了"客服 + 用户多轮"的长视野,但仍然是单人对话;
  • CoffeeBench 第一次把"长视野 + 多方异构对手 + 经济激励"三个属性同时压在 Agent 身上,更接近"Agent 是不是能在真实产业链里跑 90 天"这种问题。

亮点与局限

亮点

  1. 从"单 Agent 工具使用"切到"多 Agent 经济生存":评测范式本身有突破,把 benchmark 从"会不会用工具"推进到"能不能在多方博弈里活下来"。
  2. 异构性 + 长视野同时成立:90 天 + 6 家异构企业是真正的双重压力,区分度比短视野单 Agent 基准高得多。
  3. 明确揭示 idle-drift 这种新型失败模式:相比"答错题","想明白却不动"更接近真实生产 Agent 失效的样子,对工程团队有直接警示价值。
  4. 可复现性:代码、轨迹全公开,第三方可以复现、对抗训练、研究沟通模式。

局限

  1. 仍是"软经济"模拟:农产品价格、产能上限都是模拟出来的,与真实商品市场还有距离;论文作者也承认这是抽象的"经济脚手架"。
  2. 烘焙商单点替换:只测一个角色,农户与零售商都是固定参考 Agent,没有覆盖"全 LLM 经济"的情况,结论不能直接外推到完全异构的全 LLM 系统。
  3. 没有覆盖真实通信扰动与对抗攻击:对手是固定策略,没有考虑恶意 Agent 主动欺骗或操纵报价。
  4. 评测周期 90 天是 1 个数量级上的"长",但相对真实企业经营还是短的,长期策略与代际决策不在范围内。
  5. 被引数较少(卡片显示 1 次影响力引用),作为新基准,下游比较和复现实验还少。

对工程落地的启发

  1. 如果你的 Agent 需要在多方之间持续交易(撮合、谈判、调度),单步正确率不是关键指标,长程下的"沟通频率 + 库存/现金闭环"才是。建议在内部评测里加入"30 天以上连续博弈、对手换策略"的压力测试。
  2. 警惕 idle-drift:当 Agent 表现"想得很清楚但迟迟不下单"时,往往是 prompt 里的风险语气过重,或 reward 设计过度惩罚了错误。可以加一条强制行动下限(例如"如果 3 步没动作则触发提醒")来对冲。
  3. prompt 工程方向:高表现模型在 CoffeeBench 里更愿意主动发起对话,意味着"沟通指令显式化"("请在每个回合至少尝试一次与对手议价")在生产 Agent 中可能比"思考再思考"更划算。
  4. 基础设施:长视野多 Agent 模拟对状态管理、消息总线、轨迹回放的要求很高,可以参考 CoffeeBench 的开源实现搭建内部 sim harness,用于回归测试和红队演练。
  5. 风险与合规视角:如果 Agent 真的参与交易决策,需要给 idle-drift 类的"沉默式失败"加监控指标,否则业务侧只看到"系统在跑",看不到"系统在做正确的事"。

与同方向工作的关系

CoffeeBench 的位置可以这样描述:

  • 相对 GAIA / SWE-bench / WebArena:这些是"单 Agent + 静态环境 + 短视野",CoffeeBench 是"单 Agent + 多对手 + 长视野",补足了 Agent 评测中的"经济生存"维度。
  • 相对 AgentVerse / ChatDev / MetaGPT 这类多 Agent 协作框架:那些关心"多个 LLM 怎么合作完成一个任务",CoffeeBench 关心"多个 LLM/规则 Agent 在一个经济系统里怎么博弈生存",更接近多智能体强化学习(MARL)中的混合动机博弈。
  • 相对经济类仿真(如 Agent-Based Modeling, ABM)传统工作:CoffeeBench 把 LLM 当作经济主体嵌入 ABM 框架,相当于给传统 ABM 装上了"自然语言沟通 + 工具调用"的接口。
  • 相对 AI Economist、Marketplace 模拟等工作:同样是 LLM-in-economy,CoffeeBench 强调长视野 + 异构对手 + 自由文本沟通,差异化明显。

适合谁读

  • Agent 平台 / 框架的架构师:想找新的评测角度来对比自家 Agent 与 SOTA;
  • AI 产品经理 / 解决方案架构师:在撮合、调度、谈判类业务里需要决策类 Agent 的同学;
  • MARL / ABM 研究者:想把 LLM 接入自己的经济仿真;
  • AI 治理与安全团队:idle-drift 这种"沉默失败"模式对生产监控设计有直接启发;
  • 对 LLM 长程规划与博弈感兴趣的 PhD 学生

不适合的读者:只想找一个"Agent 跑分表"做模型选型的人——CoffeeBench 的价值在于机制观察而不是单一榜单分数。

复现与扩展建议

如果想在内部复现或扩展 CoffeeBench,可以从以下三点入手:

  1. 先复现 idle-drift 现象:选定一个已知会出现 idle-drift 的模型(如 Claude Haiku 4.5),在自己的 prompt 模板下重跑 90 天,确认问题是否随 prompt 工程消失或加剧——这能快速验证你团队的 prompt 工程对"沉默失败"是否真的有效。
  2. 替换参考 Agent 策略:把农户/零售商的 reference agent 换成"激进砍价型"或"延迟付款型",观察被测模型在不同对手风格下的鲁棒性。
  3. 加一个"沟通频率"维度做 ablation:把模型强制限制为"每天最多 1 条消息"和"不限制消息"两组做对照,可以直接量化"沟通活跃度"对净收入的因果贡献,而不仅仅是相关关系。

一句话回顾

CoffeeBench 把 Agent 评测从"答对题"推进到"在 90 天多 Agent 经济里活下来",并首次系统地揭示了 idle-drift 这种"想明白却不动"的新型失败模式,对长程决策类 Agent 的设计与监控都有直接借鉴意义。

工程落地与核查(Jay)

事实核查摘要

断言 核查结论 备注
"所有被测模型都跑赢了被动基线" 可信,方向性结论出自 abstract 但 abstract 未给出具体净收入数字,解读未编造
"Claude Haiku 4.5 出现 idle-drift" 模型名称存疑:截至 2026 年 7 月,Anthropic 官方型号列表中无 "Claude Haiku 4.5",正确命名可能为 Claude Haiku 3.5 或类似版本。原文如此,转述时建议核实原论文正文 如引用需注明"原文型号名",避免误导
"idle-drift = 内部规划连贯但反复选择不行动" claim 逻辑可信,为 abstract 描述的观察现象 但"想明白了却不下单"的措辞是对 failure mode 的合理推断,非原文精确表述
90 天模拟、6 个企业、3 类角色 可信,与 abstract 描述一致
"表现更好的模型与对手沟通更活跃" 方向性可信,abstract 有述 但相关 vs 因果未区分——沟通活跃可能是高收入的原因,也可能是高收入后更愿意冒险沟通
代码与轨迹全公开 可信,abstract 明确说明开源 GitHub 链接需回原文 §5 或项目页核实
与 GAIA/SWE-bench/WebArena 的对比 合理对齐,属于同一评测体系内的定位比较,不是具体数字对比 解读中"补足了经济生存维度"的表述是作者的认知主张,有一定主观性

可读性精修建议

  1. "Claude Haiku 4.5" 需核实:建议对照原论文正文确认实际模型名称,传播时避免使用未经核实的型号版本号。
  2. "idle-drift" 直译"行动瘫痪"已加注,但在后续段落中"保守规划型"的描述里直接使用 idle-drift 而非中文,对专业读者友好,但建议首次出现时统一注释。
  3. "90 天意味着 Agent 必须考虑信用、库存周转、对手反应等长程因素"——这段说理稍强,abstract 并未明确说"信用"也是模拟维度,建议改为"现金流和库存等长程因素",去掉未确认的"信用"一项。
  4. §4 "行为画像" 小节标注为"把 abstract 透露的结论展开看",但其中对三类行为画像的描述部分为解读者的推断(非直接引自 abstract),建议加注"以下画像为解读者的归纳推演,非原文原文描述"。

工程落地关键点

1. 实际系统怎么用

CoffeeBench 的工程价值是评测方法论而非生产系统。落地方向:

  • 评测 pipeline 集成:把 CoffeeBench 的 90 天模拟框架作为内部 agent 评测标准之一,特别是对"多交易方、长视野、现金流约束"场景有天然适配。
  • idle-drift 监控:在生产 agent 系统里加一个"连续 N 步无外部 action 触发"的告警,对冲 idle-drift 风险。
  • 沟通指令显式化:在 agent prompt 里加入"每轮至少尝试一次与对手通信"的显式指令,而非依赖 agent 自发主动。

2. 主要坑

  • Sim2Real gap:CoffeeBench 是纯模拟环境,真实撮合/谈判场景里有更多未建模因素(人类对手、市场冲击、信息不对称)。模拟 SOTA 不等于真实 SOTA。
  • 单角色评测的代表性:只评测烘焙商一个角色,结论不能推广到农户、零售商或其他业务类型。
  • 参考 Agent 策略固定:对手是 rule-based 固定策略,对抗鲁棒性未知。真实场景中对手也可能升级策略。
  • idle-drift 的根因未定位:论文观察到现象但未给出理论解释,可能是"风险惩罚过高"、"工具调用成本过大"或"规划粒度不匹配"等多重因素,盲目加"强制行动"可能矫枉过正。
  • 模型名称错误传播风险:如不核实 "Claude Haiku 4.5" 直接引用,会在技术社区造成误导。

3. 可行性评估

  • 短期(1–2 月):直接用 CoffeeBench 开源代码复现基准,评测现有 agent 模型的技术可行性高。
  • 中期(3–6 月):基于 CoffeeBench 框架改造成自己业务场景的多方博弈评测,需要重新定义角色、reward 和对手策略,工程量中等。
  • 长期(季度+):将 90 天连续评测纳入 CI/CD,作为 agent 发布的必要关卡,需要配套 infra 支持。

4. 与竞品评测的工程取舍

评测方案 视野长度 多方博弈 经济激励 工程成本
GAIA / SWE-bench
τ-bench 部分(单人对话) 部分
CoffeeBench 长(90天) ✅(6方异构) ✅(现金流/库存) 高(需 sim harness)
真实撮合平台 A/B 真实 真实 真实 极高

结论:CoffeeBench 是当前最接近"agent 经济生存"场景的评测,但工程成本高。建议与短视野评测(SWE-bench 等)配合使用,用短视野测能力下限、CoffeeBench 测长视野稳定性,两者互补。