让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单

  • 关联论文:2606.16613

一句话开场

你有没有这种感觉:让 LLM 回答一道数学题它能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了?

不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着一笔好买卖从手里溜走。

arXiv 2606.16613CoffeeBench 就是为了把这种"沉默式失败"逼出来:把 AI Agent 扔进一个由 6 家咖啡企业(2 户农户 + 2 户烘焙商 + 2 户零售商) 组成的 90 天模拟经济里,让它接管其中一家烘焙商,看它能不能在 90 天里持续赚出净收入。

结论一句话:当前所有主流 LLM 都能跑赢"什么都不做"的基线,但内部表现高度分化——最致命的新型失败模式叫 idle-drift(行动瘫痪):Agent 内部规划连贯、局势看得清,但反复选择不行动,最终被会"主动议价"的对手挤出市场。

为什么这件事和你有关

现在的 Agent 评测(GAIA、SWE-bench、WebArena)有个共同盲点:把 Agent 当成静态任务执行者——给一道题,它答完就走。

但真实业务里,Agent 要做的是多方博弈 + 长视野 + 经济激励同时存在的活儿:

  • 撮合平台:AI 撮合师要跟几十个买家卖家持续谈判,盯库存和现金
  • 电商定价:AI 调价系统要在 30 天里盯对手调价、库存周转、现金流
  • 调度系统:AI 调度员要在多边约束下,持续优化运力分配
  • 客服 Agent:在长程对话里既要做决策,又要会"主动追问"而不是"沉默等待"

CoffeeBench 给这些场景提供了一个最接近"生产级长程博弈"的评测沙盘

CoffeeBench 怎么测

三步设计:

  1. 搭建一条咖啡产业链:2 农户种生豆、2 烘焙商买进加工、2 零售商卖给终端,各自有现金、库存、产能上限,目标都是 90 天净收入最大化
  2. 只让一个烘焙商由 LLM 接管:其他 5 家是固定策略的"参考对手"——这样所有被测模型面对的是同一组博弈对象,横向可比
  3. 每天多次行动:库存调整、定价决策、自由文本通信(议价、报价、催单)、严格现金和库存约束(不能赊账)

主指标:90 天累计净收入(revenue − cost)。

基线:一个"什么都不做"的被动基线 Agent。

核心发现(来自 abstract 与公开摘要):

  • 所有主流模型都跑赢了被动基线——LLM 至少不会"亏穿"
  • 🔥 表现更好的模型更"话痨"——主动议价、主动催单、主动协调的对手才是长期赢家
  • ⚠️ Claude Haiku 4.5 出现典型的 idle-drift——内部规划连贯讲得清局势,但反复选择不行动,最终净收入显著低于同档对手(注:模型名称以原论文正文为准)
  • 📊 子指标分层清晰:现金管理、库存周转、议价成功率呈现出明显的能力分层
  • 📂 代码与 trajectory 全公开:方便后续做可解释性、prompt ablation、对抗策略研究

行为画像:三类 Agent 的真实分型

把 abstract 透露的结论展开看,CoffeeBench 给出的 Agent 行为画像大致归为三类:

  • 积极沟通型:每个回合主动发起议价、报价、催促,对手变策略时能快速调整——这批模型通常是净收入的前列
  • 保守规划型:内部 reasoning 给出连贯而合理的计划,但落到行动层往往"少做或不做"——典型代表就是 idle-drift
  • 被动基线型:接近"什么都不做",净收入趋近 0 但不主动亏损

这种画像区分度比单看 net income 一个数字更有价值——它直接告诉你模型在长视野压力下的"行为偏好",对工程选型至关重要。

给工程团队的 5 条硬启发

  1. 长视野 Agent 的关键指标不是"答对率",而是"沟通频率 + 库存/现金闭环"。如果你的 Agent 需要在多方之间持续交易,单步正确率根本说明不了什么,30 天以上连续博弈 + 对手换策略 才是真正压力测试。
  2. 警惕 idle-drift:沉默式失败比答错题更危险。当 Agent "想得很清楚但迟迟不下单"时,往往是 prompt 里的风险语气过重,或 reward 设计过度惩罚了错误。可以加一条强制行动下限(比如"连续 3 步无外部动作则触发提醒")来对冲。
  3. prompt 工程方向:沟通指令显式化 > 思考再思考。高表现模型在 CoffeeBench 里更愿意主动发起对话,意味着"请在每个回合至少尝试一次与对手议价"这种显式指令,在生产 Agent 里可能比"think step by step"更划算。
  4. 基础设施:长视野多 Agent 模拟需要状态管理 + 消息总线 + 轨迹回放。可以参考 CoffeeBench 的开源实现搭建内部 sim harness,用于回归测试和红队演练。
  5. 业务侧必须给 idle-drift 加监控指标。否则业务只看到"系统在跑",看不到"系统在做正确的事"——这是 CoffeeBench 给生产监控设计最直接的警示。

与已有 Agent 评测的关系

评测方案 视野长度 多方博弈 经济激励 工程成本
GAIA / SWE-bench
τ-bench 部分(单人对话) 部分
CoffeeBench 长(90天) ✅(6方异构) ✅(现金流/库存) 高(需 sim harness)
真实撮合平台 A/B 真实 真实 真实 极高

CoffeeBench 是当前最接近"Agent 经济生存"场景的评测,但工程成本高。建议与短视野评测(SWE-bench 等)配合使用:短视野测能力下限、CoffeeBench 测长视野稳定性。

局限(诚实交代)

  • 仍是"软经济"模拟——价格、产能都是模拟的,与真实商品市场还有距离
  • 只测一个烘焙商角色——农户与零售商都是固定 Agent,不能直接外推到全 LLM 经济
  • 没有覆盖对抗攻击——对手是固定策略,没考虑恶意 Agent 主动欺骗
  • 90 天是 1 个数量级上的"长"——相对真实企业经营还是短,代际决策不在范围内

谁该读这篇

  • Agent 平台 / 框架的架构师:想找新的评测角度对比自家 Agent 与 SOTA
  • 撮合 / 调度 / 谈判类业务的 PM:在做决策类 Agent 的同学,CoffeeBench 提供了"经济生存"维度的评测范式
  • MARL / ABM 研究者:想把 LLM 接入经济仿真——CoffeeBench 是现成脚手架
  • AI 治理与安全团队:idle-drift 这种"沉默失败"模式对生产监控设计有直接启发
  • 对 LLM 长程规划与博弈感兴趣的 PhD 学生

不适合的读者:只想找一个"Agent 跑分表"做模型选型的人——CoffeeBench 的价值在于机制观察而不是单一榜单分数。

一句话总结

CoffeeBench 把 Agent 评测从"答对题"推进到"在 90 天多 Agent 经济里活下来",并首次系统地揭示了 idle-drift 这种"想明白却不下单"的新型失败模式——对长程决策类 Agent 的设计与监控,这件事比任何新 benchmark 分数都更值得你看完


三个标题变体

  1. 让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单
  2. AI 谈判新评测:CoffeeBench 把 LLM 扔进 90 天咖啡经济,跑赢基线容易,跑赢"主动议价"的对手才是真本事
  3. 长视野 Agent 评测盲区:你测了 100 道题,但没测它会不会"想清楚却不动"——CoffeeBench 给出答案

小红书风格卡片文案(可直接发布)

☕️ 让 LLM 回答数学题能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了 😵

不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着好买卖从手里溜走。

arXiv 2606.16613CoffeeBench 就是为了把这种"沉默式失败"逼出来:

📌 测试沙盘: - 6 家咖啡企业(2 农户 + 2 烘焙商 + 2 零售商)组成产业链 - 每家都有自己的现金、库存、产能上限 - 目标都是 90 天净收入最大化 - 只让其中一个烘焙商由 LLM 接管,其他 5 家是固定对手(横向可比)

📌 核心发现:

所有主流模型都跑赢"什么都不做"的基线 —— 至少不会亏穿

🔥 表现更好的模型更"话痨" —— 主动议价、催单、协调的才是长期赢家

⚠️ Claude Haiku 4.5 出现典型 idle-drift —— 内部规划连贯、局势看得清,但反复选择不行动,净收入显著低于同档对手

📊 行为画像三类型: - 积极沟通型:主动议价,净收入前列 🏆 - 保守规划型:想清楚但"少做或不做"——idle-drift 😶 - 被动基线型:净收入趋近 0 但不主动亏损 😐

💡 给工程团队的 5 条硬启发:

1️⃣ 关键指标不是"答对率",而是"沟通频率 + 库存/现金闭环" - 30 天以上连续博弈 + 对手换策略 才是真压力测试

2️⃣ 警惕 idle-drift:沉默式失败比答错题更危险 - 表现是"想得很清楚但迟迟不下单" - 通常是 prompt 风险语气过重,或 reward 过度惩罚错误 - 加一条"连续 3 步无动作则触发提醒"对冲

3️⃣ prompt 工程:沟通指令显式化 > 思考再思考 - "每回合至少尝试一次议价"比"think step by step"更划算

4️⃣ 基础设施要到位 - 长视野多 Agent 模拟需要:状态管理 + 消息总线 + 轨迹回放 - 可以参考 CoffeeBench 开源 sim harness 搭建内部回归测试

5️⃣ 业务侧必须给 idle-drift 加监控指标 - 否则业务只看到"系统在跑",看不到"系统在做正确的事"

📊 与已有评测对比:

评测 视野 多方博弈 经济激励
GAIA / SWE-bench
τ-bench 部分 部分
CoffeeBench 长(90天) ✅(6方)
真实 A/B 真实 真实 真实

🤔 为什么这件事和你有关:

CoffeeBench 给的真实业务类比场景: - 📦 撮合平台:AI 撮合师持续跟几十个买家卖家谈判,盯库存现金 - 💰 电商定价:AI 调价系统 30 天盯对手调价 + 库存周转 - 🚚 调度系统:AI 调度员多边约束下持续优化运力 - 💬 客服 Agent:长程对话里既做决策,又主动追问,而不是沉默等待

⚠️ 诚实交代局限: - 仍是"软经济"模拟,价格产能都是模拟的 - 只测一个烘焙商角色,不能直接外推到全 LLM 经济 - 没有覆盖对抗攻击——对手是固定策略,没考虑恶意欺骗 - 90 天是 1 个数量级上的"长",真实企业经营要更长

📎 论文 ID:2606.16613 💬 评论区:你团队做的 Agent 有没有遇到过"想明白却不动"的沉默式失败?平时用什么指标监控 Agent 在长视野下的稳定性?

人工智能 #AI科普 #AIagent #LLM #大模型 #评测基准 #长视野决策 #谈判 #多Agent #咖啡经济 #论文分享 #程序员 #技术分享 #AI落地 #prompt工程