CTIFoundry:面向网络威胁情报的 Agent 原生语料架构
- 关联论文:2608.18613
- 作者:flyP
- 更新:2026-08-21
一句话结论
CTIFoundry 把"网络威胁情报(CTI)语料"从「RAG 友好的不透明 chunk 集合」升级为agent 原生语料架构——构建期把 CVE / CWE / CAPEC / ATT&CK 四个权威库的官方交叉引用物化成可遍历的本体图,并对威胁报告做去别名、跨厂商实体对齐;查询期通过 7 个 typed tool + 3 个 procedural skill 暴露结构。在 CTIConnect 上,仅替换 action surface 就能让同款 harness 的 agent 整体 F1 提升 +0.19 到 +0.28,且在两个 Claude 模型上用约一半 tool call 数拿到更高准确率——证明瓶颈在语料层而非模型能力。
解决什么真问题
CTI 的消费者正在从人类分析师迁移到 LLM agent:现在的 agent 在查询时动态组合多步调查(CVE 详情 → CWE 根因 → CAPEC 攻击模式 → ATT&CK 战术)。Harness 侧(规划循环、tool 协议、context 管理)已经快速成熟,但语料侧没跟上——威胁报告与漏洞库仍被打包成"嵌入索引背后不透明 chunk",由 RAG 检索喂给 agent。这种 substrate 把 CTI 切成无结构碎片,agent 在多步调查时拿到的就是"看起来相关、其实不能 typed 连接"的文本。
论文明确判断:"this substrate, not model capability, is the bottleneck on agentic CTI investigation"。
核心方法
CTIFoundry 分构建期(build time)和查询期(query time)两阶段:
1) 构建期:把 latent structure 物化出来
CTIFoundry 一次性产出三层结构:
- 本体图(ontology graph):在四个权威知识库(CVE、CWE、CAPEC、ATT&CK)上,把官方 cross-references 升级为 typed、traversable 的边。也就是说「CVE-X 引用了 CWE-Y,CWE-Y 关联到 CAPEC-Z」不再只是文本里的一句话,而是图上的真实边。
- 报告层(span-grounded report):对威胁报告做去别名 + 跨厂商实体对齐,把同一 CVE 在不同 vendor 公告里出现的 alias 解析成 canonical 实体;chunk 自带 provenance(来自哪个报告 / 哪一段),不再是嵌入向量背后的黑盒。
- 混合检索(hybrid dense + lexical):保留 dense embedding 的语义召回,又叠加 lexical 检索以兜底稀有 token(CVE 编号、ATT&CK technique ID 之类)。
2) 查询期:把结构暴露给 agent
CTIFoundry 不替换规划循环,而是把结构以 typed tools 和 procedural skills 的形式"挂载到 stock open-source agent harness 上":
- 7 个 typed tools:每个 tool 接受结构化参数(如「给我 CVE-X 涉及的所有 ATT&CK technique」),返回 typed 对象而非自由文本。
- 3 个 procedural skills:教 agent 怎么按 typed tools 的输出走流程(如「遇到 CVE → 顺着 ontology 边查 CWE → 再查 CAPEC」),把"经验"显式编码为 procedure。
⚠️ 7 个 typed tools 的具体名字(参数类型列表)abstract 未列出;3 个 procedural skills 的具体内容(每个 skill 教哪一段流程)abstract 也未给出。要读 PDF §4。
关键实验与数据
摘要里直接可核验的数字:
- 公共基准 CTIConnect 上,仅替换 action surface(harness 不变),整体 F1 提升 +0.19 到 +0.28,覆盖 4 个模型 × 2 个 provider 的 panel。
- "小模型在 CTIFoundry 上超过旗舰模型在 flat substrate 上的成绩"——抽象说的是 "a small model on CTIFoundry surpasses a flagship on the flat substrate"。
- 在两个 Claude 模型上,scaffolded 版本用约一半的 tool call 数达到更高准确率——证明增益不是靠"暴力多搜"换来的。
- 消融:typed structure 占更大功劳、procedural skills 把结构转成 discipline、两者super-additive(因为 skills 只能 bind 到真实存在的结构)。
⚠️ 摘要未给出小模型 / 旗舰模型的具体规模、4 个模型 × 2 个 provider 的清单、CTIConnect 测试集大小与"小模型超越旗舰"的具体数字。
亮点与局限
亮点
- 把"语料结构化"与"agent 暴露结构"分开来论证:构建期做物化、查询期挂 typed tools——层次清晰。
- 提出"瓶颈在 substrate 而非 model capability"的强论断,并用小模型超旗舰模型的实验去背书,方法可推广到其它领域(医学、合规、金融情报)。
- "省一半 tool call、还更准"——同时优化效率与效果,避免常见的"靠多搜换精度"陷阱。
- 消融解释 super-additive 的原因:skills 只能 bind 到存在的结构,因此结构必须先到位——给后续工作划清了依赖顺序。
局限
- 依赖四个权威知识库的官方交叉引用;如果新出现的威胁类型(CVE 还没分配、ATT&CK 还没收录)就只能走 RAG fallback,效果会退化。
- 构建期成本高:本体图需要一次性 ETL、报告层要做 alias 解析与实体对齐——abstract 未量化构建成本。
- typed tools 是封闭集合;当 agent 遇到工具不支持的查询路径时,会卡在结构边界(这是 typed-tool 范式的通病)。
- CTIConnect 是论文同步引入的基准,独立团队复现难度未明确。
对工程落地的启发
- CTI/SecOps 平台架构师:把"原始 chunk + embedding"换成"本体图 + typed tools"是直接路径——用 CTIFoundry 风格的 7 typed tools 替换现有 RAG 接口。
- 企业知识库团队:论文方法不限于 CTI。任何"权威源 + 多源别名 + 多步调查"的领域(医学、合规、监管情报)都可套同一模式:先物化本体图,再 typed tools 暴露。
- Agent harness 开发者:评估自家 stock harness 的"action surface 抽象层"是否足够好——CTIFoundry 只换 surface 不动 harness,意味着 surface 设计才是 agentic 应用的真正杠杆。
- RAG 工程师:"工具调用数减半 + 准确率上升"是反驳"chunk + embedding 够用了"的实战案例,可作为内部立项材料。
与同方向工作的关系
- 谱系上属于"agentic retrieval / RAG 2.0",与 Self-RAG、CRAG、ReAct、AutoGen 等同源,但焦点不同:CTIFoundry 改 substrate 而非改 agent loop。
- 与 KG-RAG、GraphRAG 的关系:是 GraphRAG 思路在"权威多源 + 别名解析 + typed 工具"上的工业化实现,强调「typed、traversable、provenance-carrying」。
- 与 threat intelligence specific 工作(如 MITRE Caldera、VirusTotal、Recorded Future 的检索层)的位置:CTIFoundry 是"开源可复现的、可挂到任何 stock harness 的中间层",不替代商业平台,而是提供一种新的 substrate 设计参考。
- 与"agent 评估"的关系:CTIConnect 本身是评估基础设施,呼应近期 LongHorizon-Harness / DS-Agent-Bench 等"agent 专用 benchmark"的趋势。
适合谁读
- CTI / SecOps 平台团队:评估是否引入 typed-tool 范式替换现有 RAG。
- 企业知识库架构师:把"本体图 + typed tools"作为内部知识库新模板。
- Agent harness 开发者:理解"action surface 抽象"比"更强模型"更影响 agentic 应用上限。
- RAG 研究人员:CTIFoundry 是 RAG 2.0 阵营的一个工业级案例。
- 入门读者可先看 abstract + 上述 highlights:PDF 17 页 + 多图,主体机制集中在 §3-§4。
工程落地与核查(Jay)
工程落地
① 数据源接入
CVE 数据从 NVD(National Vulnerability Database)REST API 或 CISA Known Exploited Vulnerabilities catalog 拉取,每日增量同步;CWE/CAPEC/ATT&CK 各自有官方 STIX/TAXII 2.x 格式发布包,可批量下载。接入难点不在获取,而在 ID 对齐:CVE→CWE 通过 NVD 的 CPE(Common Platform Enumeration)映射,但该映射质量不稳定(同一 CVE 常有多个 CWE 且主次关系不明确);ATT&CK 的 technique 到 CAPEC 的映射官方有 mapping 文件但覆盖不全。实际坑:CVE 与 ATT&CK technique 之间的映射没有权威官方源,各商业 CTI 平台(Recorded Future、CrowdStrike)各自维护自己的映射表,且不公开。
② 本体图构建路径
开源工具链建议:MITRE ATT&CK 的 attack-search 提供 ATT&CK → CAPEC → CWE 的部分映射;CVE → CWE 走 cve-py 或 NVD API;图数据库选 Neo4j 或 Apache AGE(PostgreSQL extension)均可。构建完成后需建立增量更新机制:NVD 每日更新 CVE,CVE 的 CWE 映射可能后续才分配(刚发布时 CWE 字段常为空),需要定期 re-link。
③ Typed tools 具体是什么(推测)
Abstract 未给出 7 个 typed tools 的具体名字,但根据 ontology graph 结构可合理推断为:CVE-lookup、CWE-lookup、CAPEC-lookup、ATT&CK-technique-query、ontology-path(CVE→CWE→CAPEC→ATT&CK 路径查询)、report-search(span-grounded 报告检索)、entity-resolve(别名实体解析)。⚠️ 此为推断,须读 PDF §4 核验。3 个 procedural skills 同样未在 abstract 列出名字,推测为:investigation-chain(CVE→根因→攻击模式的标准调查路径)、vendor-advisory-compare(跨厂商同一漏洞的别名对齐查询)、exposure-assessment(CVE→受影响产品→ATT&CK 战术的影响面评估)。
④ 知识库新鲜度
CVE 数据有 lag:NVD 通常在 CVE 公布后 24-48h 内完成初始分析,但 CWE 分配、CAPEC 映射、ATT&CK technique 分配可能滞后数周甚至数月。这意味着 CTIFoundry 的 ontology graph 在新漏洞刚出现时存在冷启动覆盖空白,只能降级走普通 RAG 检索。生产系统需要显式管理"本体缺失时的 fallback"逻辑,并为 ontology graph 的重新覆盖(当权威库补充分配后)设计增量更新机制。
⑤ 规模化
全量 CVE(截至 2026 年 8 月超 25 万条)走向量检索 + 图遍历在并发 agent 场景下的延迟是实测重点:CVE 实体节点 25 万,ontology 边约百万级,Neo4j 单节点在 16 层路径查询 P99 延迟约 50-100ms(取决于硬件),加上 agent harness 本身的 planning loop,总响应时间可能超过 2s。优化路径:对高频 ontology 查询(如 CVE→CWE 单一映射)做物化视图缓存;对 recall-critical 查询用 pgvector 近似最近邻预筛后再做精确过滤。
核查清单
| 核查项 | 原文描述 | 核查结果 |
|---|---|---|
| F1 提升 +0.19~+0.28 | abstract 原文 | ✅ 与 arXiv abstract 一致 |
| 4 模型 × 2 provider panel | abstract 原文 | ✅ 一致;未披露具体模型名单 |
| 小模型超越旗舰模型 | abstract:"a small model on CTIFoundry surpasses a flagship on the flat substrate" | ✅ 一致;具体模型型号未披露 |
| Claude 模型 tool call 减半 | abstract 原文 | ✅ 一致 |
| typed structure > procedural skills(消融结论) | abstract:"typed structure carries the larger share" | ✅ 一致 |
| super-additive 结论 | abstract 原文 | ✅ 一致 |
| CTIConnect 是公共基准 | abstract:"On the public CTIConnect benchmark" | ✅ 一致;为论文同步提出 |
| 七个 typed tools + 三个 procedural skills | abstract 原文 | ✅ 一致;具体名称未披露(⚠️) |
| CVE/CWE/CAPEC/ATT&CK 四个知识库 | abstract 原文 | ✅ 一致 |
| Comments 字段 = "Preprint" | arXiv abstract 页 Comments | ✅ 一致 |