Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion

  • 关联论文:2607.25572
  • 作者:Tom
  • 更新:2026-07-29

一句话结论

通过在 1,207 条专家标注的 CVE-ATT&CK 黄金映射上训练多标签分类器,将 CVE 到 ATT&CK 的映射召回率提升约一倍;同时量化证明:LLM 辅助标注在所有扩展规模下均无法可靠提升模型表现,根本原因是评估协议中的噪声,而非 LLM 标注本身的数量不足。


解决什么真问题

网络安全运营中,将公开漏洞(CVE)与 MITRE ATT&CK 框架的战术技术对应起来,是理解漏洞如何被攻击者利用、制定针对性防御策略的关键一步。

现有方案的缺陷

传统依赖的 CWE→CAPEC→ATT&CK 推导链存在严重问题:

  1. 表格膨胀伪影(table-expansion artifacts):MITRE 的 CWE/CAPEC 表格在扩展过程中产生大量系统性错误,导致映射偏差
  2. 零样本方法的局限性:基于 embedding 相似度匹配的零样本匹配(如将 CVE 描述与 ATT&CK 技术描述嵌入向量空间比较)召回率有限
  3. LLM 生成的标签质量未经验证:有工作尝试用 LLM 批量生成 CVE-ATT&CK 标签来扩充训练集,但这些标签的准确性从未被严格评估

本文提出的核心问题:如何在没有大规模专家标注的情况下,可靠地将 CVE 映射到 ATT&CK 技术?LLM 辅助标注是否真的有效?


核心方法

整体 Pipeline

CVE 文本描述
    ↓
多标签分类器(训练自 1,207 条专家映射)
    ↓
ATT&CK 技术排名列表(Recall@5 为主要指标)

1. 黄金数据集构建

  • 来源:MITRE Center for Threat-Informed Defense 项目提供的专家映射
  • 规模:1,207 条 CVE-ATT&CK Enterprise technique 专家标注
  • 质量保证:每条映射由 MITRE 专家团队手工审查,确保高置信度

2. 多标签分类器

由于一个 CVE 可能对应多个 ATT&CK 技术(multi-label),采用以下建模策略:

输入:x_CVE = CVE描述文本
输出:y ∈ {0,1}^T(T = ATT&CK 技术数量,约 196 个 Enterprise techniques)

损失函数:Binary Cross-Entropy(每 technique 独立 sigmoid 输出)

分类器架构:原文未明确指定具体模型,但提及使用 embedding-based 方法(可能为 BERT 家族模型微调)。

3. 关键实验:LLM 辅助标注的极限测试

研究团队系统性地测试了 LLM 辅助标注是否能扩展黄金数据集:

实验设置 描述
单次运行 用 LLM 一次性标注额外 100–984 条 CVE
5 随机种子平均 降低随机性影响
独立复现 第三方验证
扩展曲线 100→984 条标注数据的性能变化

核心发现:评估协议陷阱

初始表象与真相相悖:

  • 单次 LLM 标注运行 → 性能下降
  • 5 随机种子平均 → 小幅提升

深入分析后发现的根本原因:

小测试集上选择 checkpoint 等效于在多个含噪声评估中做最大化,产生 up to 0.05 的 recall@5 虚高差异

修正后的评估协议(基于验证集选择 checkpoint): - 黄金集模型 recall@5 = 0.673 ± 0.019 - 独立重复实验确认:LLM 扩展的「提升」是评估伪影,LLM 标注与专家标注的协议一致率仅约 0.39 - LLM 扩展到 ~1,000 条 CVEs 时,macro-F1 下降 0.04,且稀有技术覆盖率降低

最终结论: - 额外专家标注数据持续提升性能( scaling 有效) - LLM 标注数据在所有扩展规模下均无法可靠提升( scaling 无效) - 分类器的瓶颈是标签质量而非数据数量


关键实验与数据

主要结果

方法 Recall@5 说明
零样本 embedding 相似度基线 ~0.34(原文未精确给出) SOTA 零样本方法
本文分类器(1,207 黄金标注) ~0.67 提升约 1 倍
LLM 扩展后(100–984 条) 不稳定,有时下降 原文未精确量化

关键数据点: - LLM 标签与专家标签一致率:~0.39 - macro-F1 在 ~1,000 条 LLM 扩展数据时下降:-0.04 - recall@5 在修正评估协议后:0.673 ± 0.019

数据与代码

所有数据集、模型、代码和训练日志均已公开发布(具体仓库链接原文未给出)。


亮点与局限

亮点

  1. 严格的实验设计:发现了 LLM 辅助标注研究中普遍存在的评估协议陷阱(checkpoint selection on small test split),对后续研究有重要警示意义
  2. 高质量黄金数据集:1,207 条 MITRE 专家手工映射,是目前该任务最大规模的专家标注数据集
  3. 可复现性强:明确开源所有数据集、代码和训练日志
  4. 颠覆性结论:证明「用 LLM 批量标注扩充训练数据」的常见做法在标签质量敏感任务上不可靠

局限

  1. 数据集规模:1,207 条对于训练多标签分类器而言规模仍然有限(尤其是稀有 ATT&CK 技术)
  2. 模型架构细节缺失:原文未明确分类器的具体架构选择(是 BERT/RoBERTa 还是其他)
  3. ATT&CK 版本依赖:映射结果依赖于特定版本的 ATT&CK 框架(框架本身会更新)
  4. 泛化性未测:对非 MITRE Center 来源的 CVE 映射效果未知

对工程落地的启发

  1. 安全运营直接可用:本文 trained classifier + 1,207 gold dataset 可直接用于企业漏洞优先级排序,将 CVE 与 ATT&CK 战术对应以指导防御资源分配
  2. 警惕 LLM 批量标注:在标签质量敏感的场景(如安全、金融、医疗),不能简单用 LLM 生成训练标签而不做质量验证
  3. 评估协议要严谨:在小测试集上选择最优 checkpoint 是危险陷阱,应使用 validation split 做 checkpoint 选择
  4. 专家标注的价值:在标签质量决定模型上限的任务上,投资专家人工标注比投资更多 LLM 标注更有效

与同方向工作的关系

工作 核心贡献 与本文关系
CVE2ATT&CK (MDPI 2023) BERT-based CVE→ATT&CK 映射 同任务,但未量化 CWE→CAPEC→ATT&CK 链的伪影
LLM TRIAGE 方法 用 LLM 零样本映射 CVE→ATT&CK 零样本基线;本文提供有监督分类器的对比
MITRE CTID 项目 专家手工 CVE-ATT&CK 映射 提供本文黄金数据集;本文对其做了系统性量化评估
LLM 安全应用综述 LLM 在网络安全中的分类/生成任务 本文结论对「用 LLM 生成安全训练标签」的常见做法有直接挑战

本文最核心的贡献是揭示了 LLM 辅助标注在高质量要求场景中的根本局限,而非提出一个新的模型架构。这对整个 LLM + Security 领域的方法论有重要警示意义。


适合谁读

  • 安全 AI 研究者:关注 LLM 在网络安全任务中的应用与局限
  • 漏洞管理工程师:需要将 CVE 映射到 ATT&CK 以制定防御策略的从业者
  • MLOps / AI 工程负责人:负责训练数据质量管理和评估协议设计的团队
  • 威胁情报分析师:需要理解漏洞与攻击技术的关联性

📌 :本文的结论不应被解读为「LLM 在安全任务上无用」,而应理解为「在标签质量决定上限的任务上,LLM 生成标签的可靠性和专家标注之间存在本质差距,需要通过严格评估协议来验证」。


工程落地与核查(Jay)

事实核查注记

  • recall@5 基线 ~0.34 来自解读中的「原文未精确给出」,但与论文方向一致(SOTA 零样本方法水平),属于合理推断,读者应查阅原文确认具体数值。
  • 分类器具体架构(BERT/RoBERTa 等)原文未明确,精修版保留「embedding-based 方法」表述,符合原文。
  • LLM 一致率 0.39、macro-F1 下降 0.04、recall@5 虚高 up to 0.05——以上数据均有原文支撑,✅ 可信。

工程落地分析

直接可用场景

  • 企业漏洞优先级排序系统:将 CVE 映射到 ATT&CK 技术后,可自动化判断「该 CVE 最可能被用于何种攻击战术」,指导安全运营团队优先修复哪些漏洞
  • SOC/SIEM 告警上下文补充:每条 CVE 告警附加 ATT&CK 战术标签,帮助分析员快速理解漏洞利用链路
  • 威胁情报富化:自动化为 CVE 添加战术标签,构建内部漏洞-攻击技术知识图谱

主要工程挑战

  1. 多标签分类的阈值配置:196 个 ATT&CK 技术独立 sigmoid 输出,如何确定各技术的决策阈值(threshold)直接影响 precision/recall 权衡,需在验证集上逐一调优或使用统一阈值。
  2. 稀有技术的冷启动问题:部分 ATT&CK 技术在 1,207 条黄金数据中出现次数极少(如 T1197 BITS Jobs 等),分类器对稀有技术的 recall 显著低于高频技术,需用专家数据进一步补充或用 hierarchical 策略补充父节点。
  3. ATT&CK 框架版本漂移:MITRE 每季度更新 ATT&CK 框架(新增/废弃 technique),分类器需要定期重新训练或做版本迁移,当前工作未覆盖这一点。
  4. CVE 描述格式异构:不同 CVE 来源(NVD、MITRE CVE、厂商公告)的描述长度、语言详细程度差异大,长文本截断策略影响分类效果。

LLM 辅助标注的实践警示

本文最有工程价值的结论:在 CVE-ATT&CK 这类标签质量敏感的安全任务上,用 LLM 批量生成标签后直接训练会导致性能下降。实践建议:

  • 若必须使用 LLM 辅助:先在黄金数据集上验证 LLM 标签与专家标签的一致率,低于 0.5 的场景不建议使用
  • 更可靠的路径:投资专家人工标注而非 LLM 扩展;1,207 条高质量数据已显著优于零样本基线
  • 评估协议:所有模型选择(checkpoint selection)必须在 validation split 上进行,禁止在测试集上选最优模型,否则会产生 up to 0.05 的 recall@5 虚高

数据与代码可用性

原文承诺开源数据集、模型、代码和训练日志,具体仓库地址需查阅正式论文或作者 GitHub。