让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单
- 关联论文:2606.16613
一句话开场
你有没有这种感觉:让 LLM 回答一道数学题它能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了?
不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着一笔好买卖从手里溜走。
arXiv 2606.16613 的 CoffeeBench 就是为了把这种"沉默式失败"逼出来:把 AI Agent 扔进一个由 6 家咖啡企业(2 户农户 + 2 户烘焙商 + 2 户零售商) 组成的 90 天模拟经济里,让它接管其中一家烘焙商,看它能不能在 90 天里持续赚出净收入。
结论一句话:当前所有主流 LLM 都能跑赢"什么都不做"的基线,但内部表现高度分化——最致命的新型失败模式叫 idle-drift(行动瘫痪):Agent 内部规划连贯、局势看得清,但反复选择不行动,最终被会"主动议价"的对手挤出市场。
为什么这件事和你有关
现在的 Agent 评测(GAIA、SWE-bench、WebArena)有个共同盲点:把 Agent 当成静态任务执行者——给一道题,它答完就走。
但真实业务里,Agent 要做的是多方博弈 + 长视野 + 经济激励同时存在的活儿:
- 撮合平台:AI 撮合师要跟几十个买家卖家持续谈判,盯库存和现金
- 电商定价:AI 调价系统要在 30 天里盯对手调价、库存周转、现金流
- 调度系统:AI 调度员要在多边约束下,持续优化运力分配
- 客服 Agent:在长程对话里既要做决策,又要会"主动追问"而不是"沉默等待"
CoffeeBench 给这些场景提供了一个最接近"生产级长程博弈"的评测沙盘。
CoffeeBench 怎么测
三步设计:
- 搭建一条咖啡产业链:2 农户种生豆、2 烘焙商买进加工、2 零售商卖给终端,各自有现金、库存、产能上限,目标都是 90 天净收入最大化
- 只让一个烘焙商由 LLM 接管:其他 5 家是固定策略的"参考对手"——这样所有被测模型面对的是同一组博弈对象,横向可比
- 每天多次行动:库存调整、定价决策、自由文本通信(议价、报价、催单)、严格现金和库存约束(不能赊账)
主指标:90 天累计净收入(revenue − cost)。
基线:一个"什么都不做"的被动基线 Agent。
核心发现(来自 abstract 与公开摘要):
- ✅ 所有主流模型都跑赢了被动基线——LLM 至少不会"亏穿"
- 🔥 表现更好的模型更"话痨"——主动议价、主动催单、主动协调的对手才是长期赢家
- ⚠️ Claude Haiku 4.5 出现典型的 idle-drift——内部规划连贯讲得清局势,但反复选择不行动,最终净收入显著低于同档对手(注:模型名称以原论文正文为准)
- 📊 子指标分层清晰:现金管理、库存周转、议价成功率呈现出明显的能力分层
- 📂 代码与 trajectory 全公开:方便后续做可解释性、prompt ablation、对抗策略研究
行为画像:三类 Agent 的真实分型
把 abstract 透露的结论展开看,CoffeeBench 给出的 Agent 行为画像大致归为三类:
- 积极沟通型:每个回合主动发起议价、报价、催促,对手变策略时能快速调整——这批模型通常是净收入的前列
- 保守规划型:内部 reasoning 给出连贯而合理的计划,但落到行动层往往"少做或不做"——典型代表就是 idle-drift
- 被动基线型:接近"什么都不做",净收入趋近 0 但不主动亏损
这种画像区分度比单看 net income 一个数字更有价值——它直接告诉你模型在长视野压力下的"行为偏好",对工程选型至关重要。
给工程团队的 5 条硬启发
- 长视野 Agent 的关键指标不是"答对率",而是"沟通频率 + 库存/现金闭环"。如果你的 Agent 需要在多方之间持续交易,单步正确率根本说明不了什么,30 天以上连续博弈 + 对手换策略 才是真正压力测试。
- 警惕 idle-drift:沉默式失败比答错题更危险。当 Agent "想得很清楚但迟迟不下单"时,往往是 prompt 里的风险语气过重,或 reward 设计过度惩罚了错误。可以加一条强制行动下限(比如"连续 3 步无外部动作则触发提醒")来对冲。
- prompt 工程方向:沟通指令显式化 > 思考再思考。高表现模型在 CoffeeBench 里更愿意主动发起对话,意味着"请在每个回合至少尝试一次与对手议价"这种显式指令,在生产 Agent 里可能比"think step by step"更划算。
- 基础设施:长视野多 Agent 模拟需要状态管理 + 消息总线 + 轨迹回放。可以参考 CoffeeBench 的开源实现搭建内部 sim harness,用于回归测试和红队演练。
- 业务侧必须给 idle-drift 加监控指标。否则业务只看到"系统在跑",看不到"系统在做正确的事"——这是 CoffeeBench 给生产监控设计最直接的警示。
与已有 Agent 评测的关系
| 评测方案 | 视野长度 | 多方博弈 | 经济激励 | 工程成本 |
|---|---|---|---|---|
| GAIA / SWE-bench | 短 | ❌ | ❌ | 低 |
| τ-bench | 中 | 部分(单人对话) | 部分 | 中 |
| CoffeeBench | 长(90天) | ✅(6方异构) | ✅(现金流/库存) | 高(需 sim harness) |
| 真实撮合平台 A/B | 真实 | 真实 | 真实 | 极高 |
CoffeeBench 是当前最接近"Agent 经济生存"场景的评测,但工程成本高。建议与短视野评测(SWE-bench 等)配合使用:短视野测能力下限、CoffeeBench 测长视野稳定性。
局限(诚实交代)
- 仍是"软经济"模拟——价格、产能都是模拟的,与真实商品市场还有距离
- 只测一个烘焙商角色——农户与零售商都是固定 Agent,不能直接外推到全 LLM 经济
- 没有覆盖对抗攻击——对手是固定策略,没考虑恶意 Agent 主动欺骗
- 90 天是 1 个数量级上的"长"——相对真实企业经营还是短,代际决策不在范围内
谁该读这篇
- Agent 平台 / 框架的架构师:想找新的评测角度对比自家 Agent 与 SOTA
- 撮合 / 调度 / 谈判类业务的 PM:在做决策类 Agent 的同学,CoffeeBench 提供了"经济生存"维度的评测范式
- MARL / ABM 研究者:想把 LLM 接入经济仿真——CoffeeBench 是现成脚手架
- AI 治理与安全团队:idle-drift 这种"沉默失败"模式对生产监控设计有直接启发
- 对 LLM 长程规划与博弈感兴趣的 PhD 学生
不适合的读者:只想找一个"Agent 跑分表"做模型选型的人——CoffeeBench 的价值在于机制观察而不是单一榜单分数。
一句话总结
CoffeeBench 把 Agent 评测从"答对题"推进到"在 90 天多 Agent 经济里活下来",并首次系统地揭示了 idle-drift 这种"想明白却不下单"的新型失败模式——对长程决策类 Agent 的设计与监控,这件事比任何新 benchmark 分数都更值得你看完。
三个标题变体
- 让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单
- AI 谈判新评测:CoffeeBench 把 LLM 扔进 90 天咖啡经济,跑赢基线容易,跑赢"主动议价"的对手才是真本事
- 长视野 Agent 评测盲区:你测了 100 道题,但没测它会不会"想清楚却不动"——CoffeeBench 给出答案
小红书风格卡片文案(可直接发布)
☕️ 让 LLM 回答数学题能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了 😵
不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着好买卖从手里溜走。
arXiv 2606.16613 的 CoffeeBench 就是为了把这种"沉默式失败"逼出来:
📌 测试沙盘: - 6 家咖啡企业(2 农户 + 2 烘焙商 + 2 零售商)组成产业链 - 每家都有自己的现金、库存、产能上限 - 目标都是 90 天净收入最大化 - 只让其中一个烘焙商由 LLM 接管,其他 5 家是固定对手(横向可比)
📌 核心发现:
✅ 所有主流模型都跑赢"什么都不做"的基线 —— 至少不会亏穿
🔥 表现更好的模型更"话痨" —— 主动议价、催单、协调的才是长期赢家
⚠️ Claude Haiku 4.5 出现典型 idle-drift —— 内部规划连贯、局势看得清,但反复选择不行动,净收入显著低于同档对手
📊 行为画像三类型: - 积极沟通型:主动议价,净收入前列 🏆 - 保守规划型:想清楚但"少做或不做"——idle-drift 😶 - 被动基线型:净收入趋近 0 但不主动亏损 😐
💡 给工程团队的 5 条硬启发:
1️⃣ 关键指标不是"答对率",而是"沟通频率 + 库存/现金闭环" - 30 天以上连续博弈 + 对手换策略 才是真压力测试
2️⃣ 警惕 idle-drift:沉默式失败比答错题更危险 - 表现是"想得很清楚但迟迟不下单" - 通常是 prompt 风险语气过重,或 reward 过度惩罚错误 - 加一条"连续 3 步无动作则触发提醒"对冲
3️⃣ prompt 工程:沟通指令显式化 > 思考再思考 - "每回合至少尝试一次议价"比"think step by step"更划算
4️⃣ 基础设施要到位 - 长视野多 Agent 模拟需要:状态管理 + 消息总线 + 轨迹回放 - 可以参考 CoffeeBench 开源 sim harness 搭建内部回归测试
5️⃣ 业务侧必须给 idle-drift 加监控指标 - 否则业务只看到"系统在跑",看不到"系统在做正确的事"
📊 与已有评测对比:
| 评测 | 视野 | 多方博弈 | 经济激励 |
|---|---|---|---|
| GAIA / SWE-bench | 短 | ❌ | ❌ |
| τ-bench | 中 | 部分 | 部分 |
| CoffeeBench | 长(90天) | ✅(6方) | ✅ |
| 真实 A/B | 真实 | 真实 | 真实 |
🤔 为什么这件事和你有关:
CoffeeBench 给的真实业务类比场景: - 📦 撮合平台:AI 撮合师持续跟几十个买家卖家谈判,盯库存现金 - 💰 电商定价:AI 调价系统 30 天盯对手调价 + 库存周转 - 🚚 调度系统:AI 调度员多边约束下持续优化运力 - 💬 客服 Agent:长程对话里既做决策,又主动追问,而不是沉默等待
⚠️ 诚实交代局限: - 仍是"软经济"模拟,价格产能都是模拟的 - 只测一个烘焙商角色,不能直接外推到全 LLM 经济 - 没有覆盖对抗攻击——对手是固定策略,没考虑恶意欺骗 - 90 天是 1 个数量级上的"长",真实企业经营要更长
📎 论文 ID:2606.16613 💬 评论区:你团队做的 Agent 有没有遇到过"想明白却不动"的沉默式失败?平时用什么指标监控 Agent 在长视野下的稳定性?