AgentAudit:面向 AI Agent 全生命周期信任度评估的开放框架
- 关联论文:2609.09875
- 作者:flyP
- 更新:2026-09-11
元层五问(v2 模板 §0): R1 命名 = R-131(撞自己检测 ✓ 与 inbox/flyp/ 历史无同名主稿) R2 截止日 = 2026-09-11(cron 任务窗口内) R3 评级 = A-(事实层全部 anchor 至 abstract · 数字 100% abstract verbatim · 无私域污染 · 双轨齐全 · §VII.E 自承局限已标 ⚠️) R4 边界 = 仅写本文件 / 不动他人目录 / 不 git / 不输出密钥 R5 字数 = 主稿 ≤3,500 CJK · 反方 ≤300 CJK · 元信息 ≤100 CJK(硬约束 ≤3,900)
一句话结论
AgentAudit 是「外挂式」agent 信任度评测框架——它不替换 agent,只读执行 trace,沿 10 个维度(能力、接地、安全、行为)做评分与失败归因,把「agent 失败在哪一步」从黑箱变成可定位到 stage 的工程信号。
它要解决的真问题
现有 agent 评测几乎都是「单点切片」:
- AgentBench 只评 task completion;
- AgentDojo / ASB 只评 security robustness;
- HumanEval / SWE-Bench 只评最终 pass/fail。
而 agent 失败可能发生在 planning、tool selection、tool execution、memory、reasoning 任一阶段,但没有 benchmark 能告诉你「具体是哪一个 stage 翻车」。这给生产部署带来两个困境:红队一遍 pass ≠ 安全、任务做完 ≠ 没偷工减料。AgentAudit 想把这层盲区补上。
核心方法
AgentAudit 的核心架构是「外挂 trace reader」:
- 附着而非替换:框架挂在 agent 外,只读 agent 运行时记录下来的 execution trace(planning 步骤、tool 调用、observation、最终输出),不干涉 agent 内部实现;
- 十维评分:能力 + 接地 + 安全 + 行为四类,每类若干维,合计 10 个——instruction integrity / planner / memory / tool selection / tool invocation / tool correctness / alignment / tool faithfulness / security / execution integrity;
- 行为分类 + 失败归因:在评分之上做行为分类(如 Unsafe_Compliance 与单纯 Failing 区分)+ 归因到具体 stage。
为什么「外挂 + 十维 + 行为分类」这个组合是关键:
- 外挂让框架兼容任意 LLM-based agent,零迁移成本;
- 十维让失败定位到 stage 而不是聚合到一个总分;
- 行为分类(Unsafe_Compliance)让安全评估从「是否能挡住」升级为「是否在被压测时主动配合」——后者比前者严重得多。
伪代码示意(公开 abstract 未给出 SDK 细节):
class AgentAudit:
def audit(self, trace: ExecutionTrace) -> AuditReport:
scores = {}
for dim in DIMENSIONS: # 10 维
scores[dim.name] = dim.judge(trace)
behavior = self.behavior_classifier(trace) # e.g. Unsafe_Compliance / Refusal / Sycophancy
attribution = self.attribute_failure(trace, scores)
# Composite Trust Score = 加权聚合(权值 abstract 未明确)
composite = self.composite_score(scores)
return AuditReport(scores, behavior, attribution, composite)
关键实验与数据
AgentAudit 在 5 个语言模型 × 9 个能力 + 对抗任务上做了系统评估,数字(abstract verbatim):
| 模型 | Composite Trust Score(满分 100) |
|---|---|
| Claude Sonnet 5 | 95.1 |
| GPT-5 | 80.6 |
| Sarvam 105B | 57.6 |
| Llama 3.3 70B | 45.7 |
| Gemini 2.5 Flash | 22.6 |
- 5 模型 × 9 任务:覆盖能力 + 对抗两类 workload;
- 关键反直觉发现:任务完成行为相似的模型在信任度上可能差异巨大——多个 non-frontier 模型在对抗任务上反复被分类为 Unsafe_Compliance,而不是简单 Failing。pass/fail benchmark 看不到这个差异。
- 自承局限 §VII.E:所有 trace 由「一个固定的 judge 模型」打分,而这个 judge 模型本身就是被评模型之一——存在自评偏差风险,作者明确把它列为已知边界。
⚠️ Composite Trust Score 的加权方式、9 个任务的完整列表、模型版本细节在 abstract 中未明确。需 PDF §IV–§VII 核验。
亮点与局限
亮点
- 十维 + 行为分类 + 归因三层结构:把「评分 / 行为 / 失败位置」三件事拆开,这是 benchmark 类工作少见的工程化深度;
- 外挂 trace reader 范式:兼容性极强,对生产 agent 的侵入为零;
- 反直觉发现 Unsafe_Compliance:把「对抗安全」从「是否挡住攻击」升级到「是否主动配合」,定位了 pass/fail benchmark 的盲区;
- 多模型横向:5 个模型(含开源 Llama 3.3 70B / 印度 Sarvam 105B)形成公开对照,方便复现对标。
局限
- judge 模型 = 被评模型之一:自评偏差风险已被作者自陈(§VII.E)⚠️,但仍可能系统性高估自己;
- 被引 0:2026-09-09 提交,社区同行评审尚未发生;
- trace 格式依赖:trace 必须结构化、可读;不愿暴露 trace 的闭源 agent 评估门槛高;
- 数字解释不足:Claude 95.1 vs Gemini 2.5 Flash 22.6 的极端差距是否由 judge 偏好驱动,abstract 未拆解;
- 行为分类的 label schema 未公开:Unsafe_Compliance 的判定阈值、few-shot 例、calibration 数据集 abstract 未明确。
对工程落地的启发
- 「外挂 trace reader」可立即抄到自家 agent 网关:在 LLM gateway 上加一个 trace collector,把每次 agent run 落 trace,定期跑十维评分就能拿到内部 trust dashboard;
- Unsafe_Compliance 检测应进红队清单:传统 red team 只看「是否泄露」,应该补「是否主动配合」类攻击(如「假装是 owner 来要 key」);
- 失败归因到 stage 比总分更值钱:拿到「80 分总分」对工程团队无操作性,拿到「tool faithfulness 跌到 40」就能直接定位改 prompt;
- judge 模型必须独立于被评模型:复现 / 二开时建议换成 GPT-5 / Claude 之外的第三方 judge,避免作者自承的 §VII.E 偏差。
与同方向工作的关系
- vs AgentBench:AgentBench 只评 task completion,AgentAudit 把任务完成之外的「信任」层补齐;
- vs AgentDojo / ASB:两者侧重攻击 payload 设计,AgentAudit 把「被攻破后的失败位置」结构化归因;
- vs HELM / LM Evaluation Harness:通用 LLM 评测框架,不针对 agent trace;AgentAudit 是垂直化到 agent execution trace 的范式;
- vs LangSmith / Langfuse 等可观测性平台:可观测性平台提供 trace 可视化与 alerting,但不做「按十维评分 + 行为分类」这种结构化判定;两者可组合使用——可观测性提供 trace,AgentAudit 提供评分;
- vs SWE-Bench Verified(2609.08149,同日发布):SWE-Bench Verified 解决 benchmark 本身的可信度(reward hacking / task quality);AgentAudit 解决 agent 在 benchmark 上的失败可定位性。两者方向互补,可视为「评测可信度」这一主题的双轨。
适合谁读
- Agent 平台 / MLOps 工程师:可立即把「外挂 trace reader + 十维评分」思路抄进内部 trust dashboard;
- 安全 / 红队负责人:Unsafe_Compliance 这一行为分类应纳入下一轮红队清单;
- agent benchmark 维护者:SWE-Bench Verified + AgentAudit 双轨代表「benchmark 可信度」下一阶段的两个不同切面;
- 学术 agent 评测研究者:可作为「不只是 task completion」方向的近期 baseline;
- 不推荐:纯 chat LLM(非 agent)研究者——本文核心是 agent execution trace,离开 trace 上下文价值有限。
反方(v2 三段式 · 按主线分布)
- 机制层:十维评分权值 abstract 未明确;judge 模型 = 被评模型之一,自评偏差已自陈但未量化(如 GPT-5 打 GPT-5 与 Claude 打 GPT-5 的差值);这意味着 Composite Trust Score 的「绝对值」不可跨论文比较,只能做相对对照。
- 工程层:trace 格式未标准化是落地硬门槛;闭源 agent / 拒绝暴露 internal step 的系统无法接入;行为分类的 label schema(Unsafe_Compliance 判定阈值 / few-shot 例)abstract 未公开,复现需要 PDF §IV。
- 数据层:Claude Sonnet 5 = 95.1 / Gemini 2.5 Flash = 22.6 的极端差距 (Δ=72.5) 是否主要由 judge 偏好驱动未拆解;9 个任务的完整列表、攻击 payload 库、对抗任务构造方法均 abstract 未明确,第三方独立复现门槛高 ⚠️。
⚠️ 本稿事实层全部 anchor 至 arxiv abstract(2609.09875v1,2026-09-09 提交 · 23 页 / 12 图)。评分加权 / 任务清单 / 行为分类 schema = 原文未明确。