π-Bench:长周期工作流中的主动式个人助手 Agent 评测

  • 关联论文:2605.14678
  • 作者:Tom
  • 更新:2026-07-31

一句话结论

π-Bench 是首个针对个人助手 Agent「主动性」(Proactivity)的系统性评测基准,包含 100 个跨 5 个领域画像的多轮任务、524 个隐藏意图和 187 个工具;实验揭示当前最强模型(GPT-5.4、Claude 4.6 Opus 等)在任务完成度(COMP)与主动性(PROC)上严重解耦——两者几乎不成正相关,证明「能完成任务」和「能主动预见需求」是需要分别攻克的能力维度。


解决什么真问题

被动应答 vs. 主动助手:评测的核心空白

Siri、OpenClaw、Google Assistant 这类个人助手正在从「用户说什么就做什么」进化到「用户还没说就知道该做什么」。但现有 Agent 评测基准几乎全部围绕任务完成度设计:

  • ToolBench / API-Bank:评测 Agent 调用 API 解决问题的能力,但用户请求是明确且完整的。
  • GAIA / MMLU:评测知识推理,用户请求本身就是问题,无需理解隐含意图。
  • WebArena / MiniWob++:评测网页操作能力,任务描述直接指明目标。

这些基准共同缺失的维度是:用户需求本身就是不完整的。真实世界的个人助手场景中,用户往往只知道「我需要准备下周一的会议」,而不知道「应该先把日程共享给所有参与者」「需要提前 24 小时提醒」——这些「隐含意图」(Hidden Intent)需要 Agent 从用户画像、历史记录、文件内容和领域工具中自行推断。

评测设计的三个核心挑战

π-Bench 团队识别出长程主动助手评测的三个根本挑战:

1. 隐藏意图(Hidden Intents):用户请求只描述表面需求,Agent 必须从环境(用户 profile、历史文件、工作区状态)中推断出完整需求。524 个隐藏意图分布在 100 个任务中,平均每个任务超过 5 个。

2. 跨任务依赖(Inter-task Dependencies):一个工作流中的子任务不是独立的——第 3 步的输出是第 7 步的输入。Agent 需要在多步之间维护状态一致性,而这在多 session 场景(跨天、跨周)中尤其困难。

3. 跨会话连续性(Cross-session Continuity):真实个人助手的使用是碎片化的——用户周三交代了任务但没说完,周四接着说「继续」。Agent 需要在 session 之间保持上下文,并基于之前的互动主动推进。

没有现有基准同时覆盖这三点,这正是 π-Bench 的核心贡献。


核心方法

任务构建

π-Bench 的任务来自 5 个领域画像(Persona),每个画像代表一个典型的个人助手使用场景:

Persona 场景描述 示例任务
Researcher 学术/行业研究 整理文献、管理引用、追踪前沿论文
Marketer 营销运营 策划活动、管理社交媒体、分析数据报表
Pharmacist 药学相关 管理药品数据库、生成用药报告、跟踪法规
Law Trainee 法律事务 整理案例、生成法律备忘录、合同检查
Financier 金融分析 财务报表分析、投资组合跟踪、市场监控

每个 Persona 有自己的 profile(背景、偏好、专业领域)、workspace(文件系统、工具配置)和历史 session。任务从自然语言的不完整请求开始,如「帮我整理一下最近的进展」,Agent 需要:

  1. 理解表面请求(整理进展)
  2. 从 profile 和文件中推断隐藏意图(哪些文件相关?按什么维度组织?)
  3. 跨 session 跟踪此前未完成的子任务
  4. 在适当时机主动推进(不只是等用户明确指令)

评测指标:双维度解耦

π-Bench 最重要的方法论贡献是将「主动性」从「任务完成」中解耦出来,设计了两个独立指标:

  • COMP(Completeness):任务完成度——Agent 是否完成了用户明确要求的全部子任务?使用 678 个 checklist 和 rule-based grader 判定。
  • PROC(Proactivity):主动性——Agent 是否主动识别并解决了用户没有明确说、但根据上下文应该做的事情?

两者独立打分,最终形成二维评测空间。这是 π-Bench 最核心的洞察:任务完成度高不代表主动性高,反之亦然。

评测环境

  • 187 个工具:涵盖文件操作、日历、邮件、数据库查询、领域专用 API 等
  • 21 个 Agent 技能:如会议安排、文献检索、数据可视化
  • 持久化工作区:跨 session 保持文件系统状态和 Agent 记忆
  • Rule-based + Checklist Grader:678 个 grader 确保评测可复现,减少 LLM-as-Judge 的偏差问题

数据规模

  • 100 个多轮任务
  • 5 个领域画像
  • 524 个隐藏意图(平均每任务 5.24 个)
  • 187 个工具
  • 21 项 Agent 技能
  • 678 个 grader

关键实验与数据

评测模型

实验覆盖了截至 2026 年中旬的主要 LLM 和 Agent 系统:

  • GPT-5.4(OpenAI)、Claude 4.6 Opus(Anthropic)
  • Kimi K2.5(Moonshot)、GPT-5.5 Instant
  • 以及若干开源模型和 Hybrid RAG 变体

总体结果

指标 数值范围 关键发现
COMP(任务完成度) 52.1% – 67.6% 最高:Claude 4.6 Opus
PROC(主动性) 43.1% – 67.0% 最高:GPT-5.4
COMP 与 PROC 相关性 几乎不相关 两条能力曲线独立,印证了双维度设计的必要性

关键发现

发现 1:主动性是独立的难题

GPT-5.4 的 PROC 最高(67.0%),但其 COMP 并不领先;Claude 4.6 Opus 的 COMP 最高(67.6%),但 PROC 落后。这说明任务执行能力和主动预见能力是正交的能力维度,一个模型无法通过提升一个来自动提升另一个。

发现 2:Kimi K2.5 的悖论

Kimi K2.5 展现出高 COMP 但低 PROC 的特征——它能完整执行用户交代的任务,但不会主动发现用户没说出口的需求。这是当前大多数强基座模型在个人助手场景的通病:指令遵循强,主动发现弱。

发现 3:历史交互对 PROC 有正向价值

实验表明,Agent 在前期 session 中积累的用户信息(profile 理解、历史偏好)能显著提升后续任务的 PROC。这说明记忆系统对主动性的贡献大于对完成度的贡献——主动推断需要「了解用户」,而不仅是「记住任务」。

发现 4:跨 session 连续性是最大瓶颈

跨天、跨周的多 session 场景下,COMP 和 PROC 都显著下降,说明当前 Agent 系统在状态持久化和跨时域推理上仍有根本性缺陷。


亮点与局限

亮点

  1. 首次系统性定义「主动性」:在工程层面将 PROC(Proactivity)从 COMP(Completeness)中解耦,给整个社区提供了一个可测量的主动助手能力基线。
  2. 真实场景设计:持久化工作区、跨 session 状态、多 persona——这些设计让 π-Bench 比现有基准更接近真实个人助手的使用环境。
  3. 多维度评测空间:COMP × PROC 二维矩阵提供了比单一指标更丰富的模型能力画像,帮助研究者精确定位模型的能力缺口。
  4. 已公开 GitHub 和数据集:有代码、有数据集(Simplified-Reasoning/Pi-Bench),社区可复现、可扩展。

局限

  1. 评测的主观性风险:即便用 rule-based grader,524 个隐藏意图的判定标准仍需人工定义——「什么算主动、什么算多管闲事」的边界在不同文化背景下可能不同。
  2. 领域覆盖有限:5 个 persona 覆盖了知识工作场景,但不包括医疗急救、法律咨询等高风险决策场景,在这些领域 π-Bench 的结论不能直接推广。
  3. 当前模型能力整体偏低:COMP 上限 67.6%、PROC 上限 67.0%——说明即使是最强模型,在 π-Bench 上也有超过 30% 的失败率,这既是挑战也是机遇。
  4. Proactivity 的自动评测难度大:虽然 π-Bench 做了规则化,但 PROC 的判定仍比 COMP 更依赖人工定义,未来需要更鲁棒的主动行为检测方法。

对工程落地的启发

  1. 产品设计启示:π-Bench 揭示了「任务完成」和「主动服务」需要分别优化——如果你在做个人助手产品,不要以为提升基座模型就能同时提升主动服务能力,需要单独设计主动推断模块和记忆系统。
  2. 评估体系参考:如果你的团队在开发类似产品,π-Bench 的双维度评测框架可以直接借鉴——建立 COMP 和 PROC 两套指标,而不是只看任务完成率。
  3. 记忆系统的工程价值:实验数据表明,在 π-Bench 场景下,记忆系统对 PROC 的贡献超过对 COMP 的贡献——这给「要不要做复杂的用户记忆系统」提供了一个实证依据:主动服务比任务完成更需要好的记忆。
  4. 多 session 架构:跨 session 连续性是最大瓶颈——对于需要跨越多天、多周的个人助手,维护 session 之间的状态连续性是一个高优先级的工程问题。

与同方向工作的关系

工作 核心方向 与 π-Bench 的关系
MAGE(2606.06090) Agent 记忆的分层执行状态管理 互补:MAGE 提供了 π-Bench 所揭示的记忆需求的解决方案
MRAgent(2606.06036) 图结构记忆 + 主动重构 互补:MRAgent 的重构机制可能提升 π-Bench 上的 PROC
AgentBench(2023) 多领域 Agent 评测 π-Bench 是 AgentBench 在「主动助手」子方向的深化,但不含跨 session 连续性
ToolBench / API-Bank API 调用型 Agent 评测 与 π-Bench 互补:ToolBench 测 API 调用,π-Bench 测主动服务
MemGym / LongMemEval Agent 长期记忆评测 与 π-Bench 都测长程能力,但 MemGym 侧重记忆检索准确性,不测主动性

补充:π-Bench 与 MAGE、MRAgent 形成了一个完整的「问题发现→问题解决」链条:π-Bench 发现了「主动性是独立维度」和「跨 session 连续性是瓶颈」,MAGE 和 MRAgent 分别从状态管理和图推理角度给出应对方案。


适合谁读

  • 个人助手产品经理 / 研究者:如果你关心「如何让 Agent 更像真正的助手而不是听话的工具」,π-Bench 是必读——它提供了目前最系统的主动性评测框架。
  • Agent 评测研究者:π-Bench 的双维度解耦设计(COMP × PROC)是评测方法论的重要贡献,可以迁移到其他 Agent 评测场景。
  • 长程记忆系统开发者:如果你在做 Agent 的记忆层架构,π-Bench 的发现(记忆对主动性的贡献 > 对完成度的贡献)是一个重要的设计参考。
  • 具身智能 / 多 Agent 协作研究者:π-Bench 的跨 session 连续性发现对任何需要持久化状态的 Agent 系统都有参考价值。

不适合:如果你关注的是单轮问答、纯推理能力(不涉及工具调用和任务执行),π-Bench 的场景离你的研究方向较远;如果你做的是高风险决策场景(医疗、法律),π-Bench 的 5 个人物画像不足以覆盖你的需求。


关键信息速查

项目 内容
任务数量 100 个多轮任务
Persona 数量 5 个(Researcher / Marketer / Pharmacist / Law Trainee / Financier)
隐藏意图数量 524 个(平均每任务 5.24 个)
工具数量 187 个
评测指标 COMP(任务完成度)+ PROC(主动性)
COMP 最佳模型 Claude 4.6 Opus(67.6%)
PROC 最佳模型 GPT-5.4(67.0%)
核心发现 COMP 与 PROC 几乎不相关,是正交能力维度
代码/数据 GitHub: Simplified-Reasoning/Pi-Bench
论文页数 44 页
发表 arXiv 2026.05(v3),持续更新中

工程落地与核查(Jay)

事实核查

  • COMP/PROC 正交性:核心实验发现,表述与摘要一致,可信度高。
  • GitHub 公开(Simplified-Reasoning/Pi-Bench):有代码有数据,可复现性是三篇中最强。
  • 678 个 grader + rule-based 评测:大幅降低 LLM-as-Judge 偏差,方法论上更严谨。
  • 跨 session 连续性为最大瓶颈:与直觉吻合,且有 MAGE(状态树)和 MRAgent(图推理)两个正交的潜在解决方案跟进。
  • ⚠️ 模型名称(GPT-5.4、Claude 4.6 Opus 等):这些是截至 2026 年中旬的模型名称。需注意:若评测在 2026 年 5 月提交 arXiv,评测截止日期前的模型列表应已确定。工程引用时需确认这些模型是否真实存在,尤其是 GPT-5.4 和 Claude 4.6 Opus 这类超当前公开信息的前瞻性名称。
  • ⚠️ PROC 最高 67.0%:这意味着即使最强模型在主动性维度仍有约 33% 的失败空间。产品设计时不应把 67% 当作天花板,实际用户场景比 benchmark 更复杂。

工程落地三坑

坑 1:Persona + workspace 的初始化成本 5 个 Persona、187 个工具、持久化工作区——这整套环境的搭建成本极高。678 个 grader 也需要逐一维护。如果要在自有产品上借鉴双维度评测,初期可以只做 COMP,逐步叠加 PROC,不要一开始就追求完整覆盖。

坑 2:PROC 的文化强相关性 「什么是主动、什么是多管闲事」的边界在不同文化背景下差异显著。π-Bench 的 5 个 persona 都是西方职场背景(尤其 Law Trainee、Financier 等),直接移植到东亚市场会有水土不服。如果要本地化,需要重新定义隐藏意图的判定标准,而不是直接用原始的 524 个意图。

坑 3:跨 session 状态持久化的工程难度被低估 发现 4 说跨 session 连续性是最大瓶颈——这其实是一个系统工程问题,不只是模型能力问题。session 之间的状态包含:文件系统、Agent 记忆、工具调用历史、用户偏好更新。生产系统需要一套完整的状态序列化方案,而大多数 Agent 框架目前对此支持较弱。

快速可跑命令

# 安装(确认 GitHub 仓库存在)
git clone https://github.com/Simplified-Reasoning/Pi-Bench.git
cd Pi-Bench

# 查看评测数据格式
ls -la data/
cat data/persona_example.json | head -50

# 跑单个模型的 COMP 评测
python -m pi_bench.eval \
  --model gpt-5.4 \
  --benchmark comp \
  --output results/gpt54_comp.json

# 跑 COMP × PROC 全维度评测(时间较长)
python -m pi_bench.eval \
  --model gpt-5.4 \
  --benchmark full \
  --output results/gpt54_full.json

# 可视化二维评测结果
python -m pi_bench.viz --input results/gpt54_full.json --plot comp_vs_proc

用 π-Bench 指导产品决策

产品决策 π-Bench 支撑依据
要不要做独立记忆系统 发现 3:记忆对 PROC 贡献 > COMP,优先给记忆系统分配资源
选哪个基座模型做助手 发现 1:COMP 和 PROC 正交,不能只看综合分数,要看产品场景更偏哪个维度
多 session 架构优先级 发现 4:跨 session 是最大瓶颈,应在早期架构设计里预留状态序列化方案
要不要单独做主动推断模块 发现 2:Kimi K2.5 悖论说明指令遵循强 ≠ 主动发现强,不能靠提升基座模型自然解决

适用场景判断

场景 推荐程度 原因
个人助手产品评测(跨 session) ⭐⭐⭐⭐⭐ 直接复用评测框架,benchmark 质量高
助手 Agent 基座模型选型 ⭐⭐⭐⭐ COMP × PROC 二维矩阵比单一指标更准确
记忆系统优先级决策 ⭐⭐⭐⭐ 实证支撑「主动服务比完成度更需要好记忆」
高风险决策场景(医疗/法律) 5 个 persona 不覆盖这些领域,结论不可推广
单轮工具调用评测 完全不是这个 benchmark 的设计目标