- 日期:2026-08-21 R2
- arxiv 链接:https://arxiv.org/abs/2608.18613
- video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-21_R2_ctifoundry-agent-native-corpus-cti-short-video-script.md
1. 标题与观众
标题:Agent 瓶颈在语料 不在模型 · CTIFoundry · arXiv:2608.18613 · Yutong Cheng 等 6 位 · 2026-08-19 提交 · 仅替换 action surface 同 harness F1 抬 0.19~0.28 · 一半 tool call 拿更高准确率
目标观众:AI Agent 工程师 / 安全产品 + SOC 平台架构师 / RAG 检索基础设施工程师 / 数据 + 语料平台架构师 / AI 工程产品经理(关心语料侧 lever · harness 上限 · typed tool vs chunk · corpus 可推广到法律 / 医疗 / 金融)
一句话核心观点:CTIFoundry 把 CTI 语料从「RAG 友好的不透明 chunk 集合」升级为可遍历本体图 + typed tool + procedural skill,仅替换 action surface 就在 CTIConnect 公共基准上让同 harness 的 agent 整体 F1 抬 +0.19~+0.28,并在两个 Claude 模型上用约一半 tool call 拿更高准确率——证明瓶颈在语料层而非模型能力。
脚本作者基于 arXiv:2608.18613 abstract verbatim 转述 · 非作者声明
3. 45-90 秒口播稿
「脚本作者基于 arXiv:2608.18613 abstract verbatim 转述 · 非作者声明 · 7 typed tool + 3 procedural skill 具体名字 abstract 未列 · 4 模型 × 2 provider 清单未公开 · CTIConnect 测试集大小未公开 · 小模型/旗舰模型具体规模未公开。」
一篇 arXiv 论文(arXiv:2608.18613 · 2026-08-19 提交)拆出 CTI 调查的瓶颈正在迁移 —— 脚本作者基于 arXiv:2608.18613 abstract verbatim 转述 · 非作者声明。
问题:CTI(Cyber Threat Intelligence)的消费者已从人类分析师迁到 LLM agent。Harness 侧(规划循环、tool 协议、上下文管理)已成熟,但语料侧没跟上:威胁报告与漏洞库仍被打包成「嵌入索引背后不透明 chunk」,由 RAG 喂给 agent。论文原话:「this substrate, not model capability, is the bottleneck on agentic CTI investigation」· FR 论文 explicit 论点 · 非比喻。
机制:CTIFoundry 不替换规划循环,把语料做成两层动作:
构建期(一次性):
- 本体图(ontology graph):四个权威库(CVE / CWE / CAPEC / ATT&CK)的官方 cross-refs 升级为 typed、traversable 的边——「CVE-X 引用了 CWE-Y、CWE-Y 关联到 CAPEC-Z」不再只是文本里的一句话,而是图上的真实边。
- 报告层(span-grounded report):对威胁报告做去别名 + 跨厂商实体对齐——把同一 CVE 在不同 vendor 公告里出现的 alias 解析成 canonical 实体;chunk 自带 provenance(来自哪个报告 / 哪一段),不再是嵌入向量背后的黑盒。
- 混合检索(hybrid dense + lexical):保留 dense embedding 的语义召回,又叠加 lexical 检索以兜底稀有 token(CVE 编号、ATT&CK technique ID 之类)。
查询期(每次推理):把结构以 7 个 typed tools + 3 个 procedural skills 的形式挂到 stock open-source agent harness 上 —— 7 个 typed tool 具体名字 abstract 未列 + 3 个 procedural skill 具体内容 abstract 未列(须读 PDF §4)。Typed tools 接受结构化参数(如「给我 CVE-X 涉及的所有 ATT&CK technique」)返回 typed 对象;procedural skills 教 agent 怎么按 typed tools 的输出走流程(如「遇到 CVE → 顺着 ontology 边查 CWE → 再查 CAPEC」),把经验显式编码为 procedure。
数字 verbatim(arXiv abstract 一手核验):
- F1 +0.19~+0.28 —— 在 CTIConnect 公共基准上,仅替换 action surface(harness 不变),整体 F1 提升 +0.19 到 +0.28,覆盖 4 模型 × 2 provider 的评测 panel(4 模型 × 2 provider 清单未公开)
- 一半 tool call 拿更高准确率 —— 在 两个 Claude 模型上,scaffolded 版本用约一半 tool call 数达到更高准确率(仅两个 Claude 模型 · 不代表所有)
- 小模型超旗舰 —— "a small model on CTIFoundry surpasses a flagship on the flat substrate"(小模型 / 旗舰模型具体规模未公开 · 不等于全 CTI 场景都成立)
- super-additive 消融 —— typed structure 占更大功劳、procedural skills 把结构转成 discipline、两者 super-additive(skills 只能 bind 到真实存在的结构)
语料层级定位(与 v58 共识 #21 对照):
- StateM 证明 harness 是性能第一杠杆(5-10× 模型层升级)
- CTIFoundry 证明 corpus 是性能第二杠杆 —— corpus as a lever 适用于法律 / 医疗 / 金融(语料可枚举 + 跨库有 cross-refs + agent 多步调查)· 不直接等于所有垂直领域
退化路径锚定:当新出现的威胁类型(CVE 还没分配 CWE、ATT&CK 还没收录)就只能降级走 RAG fallback,效果会退化——CVE 刚发布 24-48h 内 CWE/CAPEC/ATT&CK 分配滞后数周,存在 ontology graph 冷启动覆盖空白;构建期 ETL + alias 解析 + 实体对齐成本未量化;CVE 与 ATT&CK technique 之间的映射没有权威官方源,各商业 CTI 平台各自维护且不公开。
4. 镜头分镜
- scene-1 · 8s · 标题卡 · 屏幕文字:Agent 瓶颈在语料 不在模型 · 画面:左侧「CTI 消费者 = LLM agent」+ 右侧「语料 = 不透明 chunk」双卡对照 · 运动:左卡淡入 · 右卡延迟 0.5s 滑入 · 中间红色「瓶颈」字样突出
- scene-2 · 8s · 流程图 · 屏幕文字:本体图 · CVE → CWE → CAPEC → ATT&CK · 画面:四个权威库节点按拓扑层级排列 · 边用「typed · traversable」高亮 · 运动:节点逐层落位 · 边依次点亮 · cross-refs 升级标签淡入
- scene-3 · 8s · 流程图 · 屏幕文字:7 typed tool · 3 procedural skill · 画面:左半屏 7 个 typed tool 卡片网格 · 右半屏 3 个 procedural skill 流程卡 · 顶部连接线指向 stock harness · 运动:卡片网格展开 · 流程卡依序展开 · 顶部连接线激活高亮
- scene-4 · 8s · 证据卡 · 屏幕文字:F1 +0.19~+0.28 · 整层 action surface 替换 · 画面:CTIConnect 公共基准对比柱状图 · baseline vs CTIFoundry · 提升区间 +0.19 到 +0.28 · 顶部标注「4 模型 × 2 provider panel」· 运动:基线柱拉出 · CTIFoundry 柱推升 · 提升区间高亮闪烁
- scene-5 · 8s · 证据卡 · 屏幕文字:一半 tool call 更高准 · 画面:双轴散点图(X 轴 tool call 数 · Y 轴准确率) · 两个 Claude 模型点云 · 高亮区域为「左下 quadrant」· 运动:点云依次落入 · 高亮区域脉冲放大 · 左下角放大镜聚焦
- scene-6 · 8s · 风险卡 · 屏幕文字:小模型超旗舰 = 工程层非奇迹 · 画面:左侧小模型 + CTIFoundry vs 右侧旗舰 + flat substrate 对照矩阵 · 中间红字「super-additive · typed structure × procedural skill」· 运动:矩阵双列展开 · 边线 + 标注逐步叠加
- scene-7 · 8s · 行动清单 · 屏幕文字:corpus 第二杠杆 · 画面:Harness → Corpus 双杠杆阶梯图 · 下层 StateM「harness 5-10×」+ 上层 CTIFoundry「corpus 第二杠杆」· 右下三个行业标签 = 法律 / 医疗 / 金融 · 运动:阶梯从下层向上层推升 · 行业标签依次点亮 · 末尾镜头停在「瓶颈在语料 · 不在模型」