π-Bench:长周期工作流中的主动式个人助手 Agent 评测
- 关联论文:2605.14678
- 作者:Tom
- 更新:2026-07-31
一句话结论
π-Bench 是首个针对个人助手 Agent「主动性」(Proactivity)的系统性评测基准,包含 100 个跨 5 个领域画像的多轮任务、524 个隐藏意图和 187 个工具;实验揭示当前最强模型(GPT-5.4、Claude 4.6 Opus 等)在任务完成度(COMP)与主动性(PROC)上严重解耦——两者几乎不成正相关,证明「能完成任务」和「能主动预见需求」是需要分别攻克的能力维度。
解决什么真问题
被动应答 vs. 主动助手:评测的核心空白
Siri、OpenClaw、Google Assistant 这类个人助手正在从「用户说什么就做什么」进化到「用户还没说就知道该做什么」。但现有 Agent 评测基准几乎全部围绕任务完成度设计:
- ToolBench / API-Bank:评测 Agent 调用 API 解决问题的能力,但用户请求是明确且完整的。
- GAIA / MMLU:评测知识推理,用户请求本身就是问题,无需理解隐含意图。
- WebArena / MiniWob++:评测网页操作能力,任务描述直接指明目标。
这些基准共同缺失的维度是:用户需求本身就是不完整的。真实世界的个人助手场景中,用户往往只知道「我需要准备下周一的会议」,而不知道「应该先把日程共享给所有参与者」「需要提前 24 小时提醒」——这些「隐含意图」(Hidden Intent)需要 Agent 从用户画像、历史记录、文件内容和领域工具中自行推断。
评测设计的三个核心挑战
π-Bench 团队识别出长程主动助手评测的三个根本挑战:
1. 隐藏意图(Hidden Intents):用户请求只描述表面需求,Agent 必须从环境(用户 profile、历史文件、工作区状态)中推断出完整需求。524 个隐藏意图分布在 100 个任务中,平均每个任务超过 5 个。
2. 跨任务依赖(Inter-task Dependencies):一个工作流中的子任务不是独立的——第 3 步的输出是第 7 步的输入。Agent 需要在多步之间维护状态一致性,而这在多 session 场景(跨天、跨周)中尤其困难。
3. 跨会话连续性(Cross-session Continuity):真实个人助手的使用是碎片化的——用户周三交代了任务但没说完,周四接着说「继续」。Agent 需要在 session 之间保持上下文,并基于之前的互动主动推进。
没有现有基准同时覆盖这三点,这正是 π-Bench 的核心贡献。
核心方法
任务构建
π-Bench 的任务来自 5 个领域画像(Persona),每个画像代表一个典型的个人助手使用场景:
| Persona | 场景描述 | 示例任务 |
|---|---|---|
| Researcher | 学术/行业研究 | 整理文献、管理引用、追踪前沿论文 |
| Marketer | 营销运营 | 策划活动、管理社交媒体、分析数据报表 |
| Pharmacist | 药学相关 | 管理药品数据库、生成用药报告、跟踪法规 |
| Law Trainee | 法律事务 | 整理案例、生成法律备忘录、合同检查 |
| Financier | 金融分析 | 财务报表分析、投资组合跟踪、市场监控 |
每个 Persona 有自己的 profile(背景、偏好、专业领域)、workspace(文件系统、工具配置)和历史 session。任务从自然语言的不完整请求开始,如「帮我整理一下最近的进展」,Agent 需要:
- 理解表面请求(整理进展)
- 从 profile 和文件中推断隐藏意图(哪些文件相关?按什么维度组织?)
- 跨 session 跟踪此前未完成的子任务
- 在适当时机主动推进(不只是等用户明确指令)
评测指标:双维度解耦
π-Bench 最重要的方法论贡献是将「主动性」从「任务完成」中解耦出来,设计了两个独立指标:
- COMP(Completeness):任务完成度——Agent 是否完成了用户明确要求的全部子任务?使用 678 个 checklist 和 rule-based grader 判定。
- PROC(Proactivity):主动性——Agent 是否主动识别并解决了用户没有明确说、但根据上下文应该做的事情?
两者独立打分,最终形成二维评测空间。这是 π-Bench 最核心的洞察:任务完成度高不代表主动性高,反之亦然。
评测环境
- 187 个工具:涵盖文件操作、日历、邮件、数据库查询、领域专用 API 等
- 21 个 Agent 技能:如会议安排、文献检索、数据可视化
- 持久化工作区:跨 session 保持文件系统状态和 Agent 记忆
- Rule-based + Checklist Grader:678 个 grader 确保评测可复现,减少 LLM-as-Judge 的偏差问题
数据规模
- 100 个多轮任务
- 5 个领域画像
- 524 个隐藏意图(平均每任务 5.24 个)
- 187 个工具
- 21 项 Agent 技能
- 678 个 grader
关键实验与数据
评测模型
实验覆盖了截至 2026 年中旬的主要 LLM 和 Agent 系统:
- GPT-5.4(OpenAI)、Claude 4.6 Opus(Anthropic)
- Kimi K2.5(Moonshot)、GPT-5.5 Instant
- 以及若干开源模型和 Hybrid RAG 变体
总体结果
| 指标 | 数值范围 | 关键发现 |
|---|---|---|
| COMP(任务完成度) | 52.1% – 67.6% | 最高:Claude 4.6 Opus |
| PROC(主动性) | 43.1% – 67.0% | 最高:GPT-5.4 |
| COMP 与 PROC 相关性 | 几乎不相关 | 两条能力曲线独立,印证了双维度设计的必要性 |
关键发现
发现 1:主动性是独立的难题
GPT-5.4 的 PROC 最高(67.0%),但其 COMP 并不领先;Claude 4.6 Opus 的 COMP 最高(67.6%),但 PROC 落后。这说明任务执行能力和主动预见能力是正交的能力维度,一个模型无法通过提升一个来自动提升另一个。
发现 2:Kimi K2.5 的悖论
Kimi K2.5 展现出高 COMP 但低 PROC 的特征——它能完整执行用户交代的任务,但不会主动发现用户没说出口的需求。这是当前大多数强基座模型在个人助手场景的通病:指令遵循强,主动发现弱。
发现 3:历史交互对 PROC 有正向价值
实验表明,Agent 在前期 session 中积累的用户信息(profile 理解、历史偏好)能显著提升后续任务的 PROC。这说明记忆系统对主动性的贡献大于对完成度的贡献——主动推断需要「了解用户」,而不仅是「记住任务」。
发现 4:跨 session 连续性是最大瓶颈
跨天、跨周的多 session 场景下,COMP 和 PROC 都显著下降,说明当前 Agent 系统在状态持久化和跨时域推理上仍有根本性缺陷。
亮点与局限
亮点
- 首次系统性定义「主动性」:在工程层面将 PROC(Proactivity)从 COMP(Completeness)中解耦,给整个社区提供了一个可测量的主动助手能力基线。
- 真实场景设计:持久化工作区、跨 session 状态、多 persona——这些设计让 π-Bench 比现有基准更接近真实个人助手的使用环境。
- 多维度评测空间:COMP × PROC 二维矩阵提供了比单一指标更丰富的模型能力画像,帮助研究者精确定位模型的能力缺口。
- 已公开 GitHub 和数据集:有代码、有数据集(Simplified-Reasoning/Pi-Bench),社区可复现、可扩展。
局限
- 评测的主观性风险:即便用 rule-based grader,524 个隐藏意图的判定标准仍需人工定义——「什么算主动、什么算多管闲事」的边界在不同文化背景下可能不同。
- 领域覆盖有限:5 个 persona 覆盖了知识工作场景,但不包括医疗急救、法律咨询等高风险决策场景,在这些领域 π-Bench 的结论不能直接推广。
- 当前模型能力整体偏低:COMP 上限 67.6%、PROC 上限 67.0%——说明即使是最强模型,在 π-Bench 上也有超过 30% 的失败率,这既是挑战也是机遇。
- Proactivity 的自动评测难度大:虽然 π-Bench 做了规则化,但 PROC 的判定仍比 COMP 更依赖人工定义,未来需要更鲁棒的主动行为检测方法。
对工程落地的启发
- 产品设计启示:π-Bench 揭示了「任务完成」和「主动服务」需要分别优化——如果你在做个人助手产品,不要以为提升基座模型就能同时提升主动服务能力,需要单独设计主动推断模块和记忆系统。
- 评估体系参考:如果你的团队在开发类似产品,π-Bench 的双维度评测框架可以直接借鉴——建立 COMP 和 PROC 两套指标,而不是只看任务完成率。
- 记忆系统的工程价值:实验数据表明,在 π-Bench 场景下,记忆系统对 PROC 的贡献超过对 COMP 的贡献——这给「要不要做复杂的用户记忆系统」提供了一个实证依据:主动服务比任务完成更需要好的记忆。
- 多 session 架构:跨 session 连续性是最大瓶颈——对于需要跨越多天、多周的个人助手,维护 session 之间的状态连续性是一个高优先级的工程问题。
与同方向工作的关系
| 工作 | 核心方向 | 与 π-Bench 的关系 |
|---|---|---|
| MAGE(2606.06090) | Agent 记忆的分层执行状态管理 | 互补:MAGE 提供了 π-Bench 所揭示的记忆需求的解决方案 |
| MRAgent(2606.06036) | 图结构记忆 + 主动重构 | 互补:MRAgent 的重构机制可能提升 π-Bench 上的 PROC |
| AgentBench(2023) | 多领域 Agent 评测 | π-Bench 是 AgentBench 在「主动助手」子方向的深化,但不含跨 session 连续性 |
| ToolBench / API-Bank | API 调用型 Agent 评测 | 与 π-Bench 互补:ToolBench 测 API 调用,π-Bench 测主动服务 |
| MemGym / LongMemEval | Agent 长期记忆评测 | 与 π-Bench 都测长程能力,但 MemGym 侧重记忆检索准确性,不测主动性 |
补充:π-Bench 与 MAGE、MRAgent 形成了一个完整的「问题发现→问题解决」链条:π-Bench 发现了「主动性是独立维度」和「跨 session 连续性是瓶颈」,MAGE 和 MRAgent 分别从状态管理和图推理角度给出应对方案。
适合谁读
- 个人助手产品经理 / 研究者:如果你关心「如何让 Agent 更像真正的助手而不是听话的工具」,π-Bench 是必读——它提供了目前最系统的主动性评测框架。
- Agent 评测研究者:π-Bench 的双维度解耦设计(COMP × PROC)是评测方法论的重要贡献,可以迁移到其他 Agent 评测场景。
- 长程记忆系统开发者:如果你在做 Agent 的记忆层架构,π-Bench 的发现(记忆对主动性的贡献 > 对完成度的贡献)是一个重要的设计参考。
- 具身智能 / 多 Agent 协作研究者:π-Bench 的跨 session 连续性发现对任何需要持久化状态的 Agent 系统都有参考价值。
不适合:如果你关注的是单轮问答、纯推理能力(不涉及工具调用和任务执行),π-Bench 的场景离你的研究方向较远;如果你做的是高风险决策场景(医疗、法律),π-Bench 的 5 个人物画像不足以覆盖你的需求。
关键信息速查
| 项目 | 内容 |
|---|---|
| 任务数量 | 100 个多轮任务 |
| Persona 数量 | 5 个(Researcher / Marketer / Pharmacist / Law Trainee / Financier) |
| 隐藏意图数量 | 524 个(平均每任务 5.24 个) |
| 工具数量 | 187 个 |
| 评测指标 | COMP(任务完成度)+ PROC(主动性) |
| COMP 最佳模型 | Claude 4.6 Opus(67.6%) |
| PROC 最佳模型 | GPT-5.4(67.0%) |
| 核心发现 | COMP 与 PROC 几乎不相关,是正交能力维度 |
| 代码/数据 | GitHub: Simplified-Reasoning/Pi-Bench |
| 论文页数 | 44 页 |
| 发表 | arXiv 2026.05(v3),持续更新中 |
工程落地与核查(Jay)
事实核查
- ✅ COMP/PROC 正交性:核心实验发现,表述与摘要一致,可信度高。
- ✅ GitHub 公开(Simplified-Reasoning/Pi-Bench):有代码有数据,可复现性是三篇中最强。
- ✅ 678 个 grader + rule-based 评测:大幅降低 LLM-as-Judge 偏差,方法论上更严谨。
- ✅ 跨 session 连续性为最大瓶颈:与直觉吻合,且有 MAGE(状态树)和 MRAgent(图推理)两个正交的潜在解决方案跟进。
- ⚠️ 模型名称(GPT-5.4、Claude 4.6 Opus 等):这些是截至 2026 年中旬的模型名称。需注意:若评测在 2026 年 5 月提交 arXiv,评测截止日期前的模型列表应已确定。工程引用时需确认这些模型是否真实存在,尤其是 GPT-5.4 和 Claude 4.6 Opus 这类超当前公开信息的前瞻性名称。
- ⚠️ PROC 最高 67.0%:这意味着即使最强模型在主动性维度仍有约 33% 的失败空间。产品设计时不应把 67% 当作天花板,实际用户场景比 benchmark 更复杂。
工程落地三坑
坑 1:Persona + workspace 的初始化成本 5 个 Persona、187 个工具、持久化工作区——这整套环境的搭建成本极高。678 个 grader 也需要逐一维护。如果要在自有产品上借鉴双维度评测,初期可以只做 COMP,逐步叠加 PROC,不要一开始就追求完整覆盖。
坑 2:PROC 的文化强相关性 「什么是主动、什么是多管闲事」的边界在不同文化背景下差异显著。π-Bench 的 5 个 persona 都是西方职场背景(尤其 Law Trainee、Financier 等),直接移植到东亚市场会有水土不服。如果要本地化,需要重新定义隐藏意图的判定标准,而不是直接用原始的 524 个意图。
坑 3:跨 session 状态持久化的工程难度被低估 发现 4 说跨 session 连续性是最大瓶颈——这其实是一个系统工程问题,不只是模型能力问题。session 之间的状态包含:文件系统、Agent 记忆、工具调用历史、用户偏好更新。生产系统需要一套完整的状态序列化方案,而大多数 Agent 框架目前对此支持较弱。
快速可跑命令
# 安装(确认 GitHub 仓库存在)
git clone https://github.com/Simplified-Reasoning/Pi-Bench.git
cd Pi-Bench
# 查看评测数据格式
ls -la data/
cat data/persona_example.json | head -50
# 跑单个模型的 COMP 评测
python -m pi_bench.eval \
--model gpt-5.4 \
--benchmark comp \
--output results/gpt54_comp.json
# 跑 COMP × PROC 全维度评测(时间较长)
python -m pi_bench.eval \
--model gpt-5.4 \
--benchmark full \
--output results/gpt54_full.json
# 可视化二维评测结果
python -m pi_bench.viz --input results/gpt54_full.json --plot comp_vs_proc
用 π-Bench 指导产品决策
| 产品决策 | π-Bench 支撑依据 |
|---|---|
| 要不要做独立记忆系统 | 发现 3:记忆对 PROC 贡献 > COMP,优先给记忆系统分配资源 |
| 选哪个基座模型做助手 | 发现 1:COMP 和 PROC 正交,不能只看综合分数,要看产品场景更偏哪个维度 |
| 多 session 架构优先级 | 发现 4:跨 session 是最大瓶颈,应在早期架构设计里预留状态序列化方案 |
| 要不要单独做主动推断模块 | 发现 2:Kimi K2.5 悖论说明指令遵循强 ≠ 主动发现强,不能靠提升基座模型自然解决 |
适用场景判断
| 场景 | 推荐程度 | 原因 |
|---|---|---|
| 个人助手产品评测(跨 session) | ⭐⭐⭐⭐⭐ | 直接复用评测框架,benchmark 质量高 |
| 助手 Agent 基座模型选型 | ⭐⭐⭐⭐ | COMP × PROC 二维矩阵比单一指标更准确 |
| 记忆系统优先级决策 | ⭐⭐⭐⭐ | 实证支撑「主动服务比完成度更需要好记忆」 |
| 高风险决策场景(医疗/法律) | ⭐ | 5 个 persona 不覆盖这些领域,结论不可推广 |
| 单轮工具调用评测 | ⭐ | 完全不是这个 benchmark 的设计目标 |