CaSKG:用反事实-因果校准让 Agent Skill Graph 在规模化时仍可检索
- 关联论文:2608.25500
- 作者:spark
- 更新:2026-08-28
一句话结论
CaSKG(Counterfactual-Causal Skill Graphs)把"skill graph 的边可信度"当作一等公民:先用高召回的语义/词法/IO/结构证据建候选图,再用方向条件化的文本反事实 probe(remove / substitute / reorder)做边校准 + 贝叶斯平滑,最后发布一个 state-filtered 的加权图供任务条件化扩展。在 6 个 LLM backbone × ALFWorld + ScienceWorld 上 12 个组合全部第一,相对 Graph-of-Skills(GoS)把 ScienceWorld 六模型宏平均从 72.62 推到 80.50,ALFWorld 成功率从 80.01% 推到 86.79%。
解决什么真问题
Reusable skill library 是 LLM agent 跨任务复用程序性知识的标配方案。但"库"一旦膨胀,记忆访问就变成检索问题——而当前的检索方案各有硬伤:
| 方案 | 优点 | 硬伤 |
|---|---|---|
| Full-library prompting | 覆盖全 | context 成本爆炸 |
| Vector retrieval | 紧凑邻域 | 把 skill 当独立文本,丢失工作流上下文 |
| Graph-based retrieval(如 GoS) | 能恢复工作流 | 边不可靠时反而误导 |
核心矛盾是:graph 检索能不能给你对的工作流片段,取决于图里边的可信度。如果"放盐→尝味→调整"这条边是噪声连的,检索回来只会让 agent 更迷路。
CaSKG 的主张:在检索之前,先把图的边做可信度校准。它不发明新检索算法,而是给"边的概率"补一次反事实-因果证据。
核心方法
CaSKG 是一条三段式 pipeline:建候选图 → 反事实校准边 → state-filtered 任务条件扩展。
3.1 阶段一:建高召回候选图(offline)
汇集四类证据,构造有向候选图 $G_c = (V, E_c)$:
- 语义证据:skill 描述的 embedding 相似度。
- 词法证据:skill 名/描述的 token 重合。
- Input/Output 证据:前序 skill 的输出 schema 是否匹配后序 skill 的输入 schema。
- 结构证据:skill 在历史轨迹中的共现统计(先后顺序)。
每条候选边拿到一个初步分;可选 LLM judge + repair evidence 进一步 refine。
⚠️ 关键设计取舍:这一阶段刻意追求 high recall,宁可多保留候选边,避免漏掉真正有效的边。校准留给下一阶段。
3.2 阶段二:反事实-因果校准边(核心创新)
对每条候选边 $(u, v)$,施加方向条件化的文本反事实 probe——不是改 embedding,而是直接改 skill 文本:
| 操作 | 含义 | 测什么 |
|---|---|---|
| Remove | 把 $u$ 从 prompt 里去掉,看 $v$ 的成功率 | $u$ 是否是 $v$ 的前置? |
| Substitute | 用一个相似 skill $u'$ 替代 $u$,看 $v$ 的成功率 | $u$ 是否是 $v$ 的特定前置? |
| Reorder | 把 $v$ 提前到 $u$ 之前,看是否能跑通 | $(u, v)$ 的方向是否真有意义? |
把这三类证据聚合起来,用贝叶斯平滑给每条边打分: $$w(u, v) = \mathrm{Beta}(\alpha + s_{uv}, \beta + f_{uv})$$
其中 $s_{uv}$、$f_{uv}$ 分别是反事实 probe 的"成功 / 失败"计数;$\alpha, \beta$ 是先验(论文未明确具体值,⚠️ 待 PDF 核验)。
这一步是 CaSKG 的机制分水岭——它不靠 embedding 相似度做边,而是靠"把边打断/换掉/重排,看任务能不能继续跑"来给边打分。这是典型的因果干预思路,而非相关性。
3.3 阶段三:State-Filtered 任务条件扩展
发布一张 state-filtered 的 weighted 图 $\hat{G}$:只保留 $w(u, v) > \tau$ 的边,并按当前任务的 state 做一次 BFS/条件扩展,给出与任务状态匹配的 skill 子图供下游 agent 使用。
⚠️ 关键属性:CaSKG 图是 offline 构造的,检索时不改下游 agent 的 policy、不改 task interface——纯基础设施层的改造,对 agent 透明。
3.4 整体流程伪代码
# Offline
edges_raw = build_candidate_graph(skills, evidence=[semantic, lexical, io, structural])
edges_calibrated = {}
for (u, v) in edges_raw:
s, f = counterfactual_probe(u, v) # remove/substitute/reorder
w = beta_smoothing(s + alpha, f + beta)
edges_calibrated[(u, v)] = w
G_hat = state_filter(edges_calibrated, threshold=tau)
# Online(每个任务)
subgraph = task_conditioned_expand(G_hat, current_state)
skills = retrieve(subgraph, query)
agent.execute(skills)
关键实验与数据
来源:arxiv abstract(2026-08-26 上线)。
| 维度 | 数值 |
|---|---|
| LLM backbones | 6 个(未点名,⚠️ 待 PDF 核验) |
| Benchmarks | ALFWorld ID-140, ScienceWorld U211 |
| 配置组合 | 12 个(6 backbone × 2 benchmark) |
| 第一名占比 | 12/12 |
| ScienceWorld 六模型宏平均(vs GoS) | 72.62 → 80.50(+7.88) |
| ALFWorld 成功率(vs GoS) | 80.01% → 86.79%(+6.78 pp) |
| 环境步数 | 两 benchmark 均下降(具体数值未明) |
| 定性观察 | 校准边能保留 prerequisites / state-changing actions / verification routines / final completion steps |
⚠️ 不确定处: - 6 个 backbone 具体是哪些(GPT-4 / Claude / Llama / Qwen ...?)abstract 未列;需 fetch PDF §4 实验设置。 - "Task score"在 ScienceWorld 上的定义(与 ALFWorld 成功率是否同口径)abstract 未明确。 - Beta 平滑的 $\alpha, \beta$ 先验、阈值 $\tau$、counterfactual probe 的次数——这些超参敏感性 abstract 都没给。 - 代码已开源:https://github.com/ZhiyuanLi218/Caskg 。
亮点与局限
亮点
- 反事实 probe 是真正的因果干预:不是改 embedding 看相似度,而是改 skill 文本看任务能不能跑通;这是从相关性到因果性的一次方法学升级。
- 贝叶斯平滑 + 高召回候选图:把"宁可错杀一千"留给候选图阶段,把"不可误放"留给反事实阶段;两阶段分工清晰。
- 12/12 第一 + 宏平均大幅提升:在 6 个 backbone × 2 benchmark 上全胜,说明方法不挑模型,跨架构可迁移。
- 离线构造、在线透明:不污染下游 agent 的 policy,纯基础设施层升级——这一属性对企业级部署至关重要。
- 保留可解释结构:定性结果显示校准后的边确实抓住了 prerequisites / verification routines / completion steps 等可命名的工作流角色,便于做 agent 行为审计。
局限
- ⚠️ 反事实 probe 的成本:每条候选边都要做 remove / substitute / reorder 三类 probe,规模上去后成本可观;abstract 没给离线构建时间与算力账。
- ⚠️ 先验与阈值的脆弱性:Beta 平滑的 $\alpha, \beta$ 与 state-filter 的 $\tau$ 是 hyper-parameter,对不同 domain 需重新调;跨域迁移成本未量化。
- ⚠️ 6 backbone 名称未公开:abstract 没列具体模型名,是出于 review 盲审还是技术原因?复现性受限。
- state-filter 假设强:把任务 state 当作"能用于 BFS 条件扩展"的显式表示;很多 agent 任务的 state 是隐式的(藏在 context 里),如何对齐?abstract 未明。
- probe 的语义稳定性:substitute 用"相似 skill"替代,相似度怎么定义?这一选择会影响校准结果;原文未明。
对工程落地的启发
- Skill Library 治理:对企业内部 agent 平台,可以把 CaSKG 的"高召回候选 + 反事实校准"做成 skill 入库 / 出库流程,自动淘汰低质 skill,避免 skill 库无限膨胀。
- agent 可观测性:校准后的边本身就是一份"工作流知识图",可直接用于产品级的行为解释、错误归因、流程审计。
- 跨任务迁移:state-filtered 扩展机制天然支持"任务间技能复用"——把同一企业内部的多 agent 跑同一张图,节省冷启动成本。
- 离线优先:纯 offline 图构建 + 在线透明检索,部署成本可控,不需要把推理栈也升级。
- 与 self-evolution 互补:可与 PILOT 类 live self-evolution 方案叠加——一边实时沉淀 skill(write path),一边离线做边校准(curate path)。
与同方向工作的关系
- vs Graph-of-Skills (GoS):GoS 是 CaSKG 的直接 baseline;CaSKG 通过反事实校准把边的可信度从"统计共现"升级到"反事实验证",这是从相关性到因果性的跨越。
- vs Voyager 的 skill library:Voyager 强调"持续探索中学 skill",偏重 write path;CaSKG 强调"已有 skill 的图结构质量",偏重 curate path。两者结合是 skill library 的完整生命周期。
- vs RAG 的图检索(如 GraphRAG):GraphRAG 把文档图谱化以辅助 QA;CaSKG 把 skill 图谱化以辅助 agent 决策。同源方法论、不同应用层。
- vs Self-RAG / Self-Verification:Self-RAG 在生成端做自校准;CaSKG 在检索端做边校准——一个管 LLM 输出的可信度,一个管 LLM 调用的可信度,互补。
适合谁读
- Agent infra 工程师:skill library 与图检索的工程改造可直接参考 CaSKG pipeline;代码已开源。
- Long-horizon agent 研究者:state-filtered 任务条件扩展 + 离线图构建是稀缺的方向。
- RAG / GraphRAG 实践者:方法论可移植到知识图谱、工具图谱等场景。
- 可解释 AI 研究者:反事实 probe 的因果视角对 agent 行为解释有方法学价值。
来源: - arxiv abstract:https://arxiv.org/abs/2608.25500(web_fetch,2026-08-28) - paper_card:/shared/research-kb/organized/paper_cards/1126-2608-25500.md - 代码:https://github.com/ZhiyuanLi218/Caskg
不确定处:见正文 ⚠️ 标注。