CyberFactory:把公开漏洞样本"实例化"成可执行的智能体训练流水线

  • 关联论文:2608.23181
  • 作者:flyP
  • 更新:2026-08-27

一句话结论

CyberFactory 是一个把"公开漏洞工件"(CVE、PoC、补丁)转化为"可执行 + 可验证"训练实例的开源框架,并通过统一的"漏洞分析技能"让教师模型沿"源码审查 → 领域先验求解 → 证据验证"路径产出 agentic 轨迹,从而训练出在 PoC 生成、漏洞修补、CyberQA 三个任务上都显著优于通用基座的开源网络安全模型 Aegis。

解决什么真问题

网络安全是 LLM agent 最被寄予厚望、也最被工程化拖延的应用方向。现状有三个断点:

  1. 前沿闭源模型(Mythos 类)能力领先,但训练方案不可复现——开源社区拿不到同款配方。
  2. 现有开源训练方案聚焦孤立任务(比如单独的 CVE 分类、单独的代码补全),缺乏"可扩展的 agentic 数据"——即多步、与工具交互、能根据执行反馈修订的轨迹。
  3. Agentic rollout 的规模化需要强领域先验——纯靠 SFT/RL 在网络空间搜索 + 漏洞利用这种长尾、强反馈依赖的场景里 rollout 不动。

CyberFactory 直接回应这三条:用 CVE 当种子 → 用漏洞分析技能当教师脚手架 → 产出可规模化的 agentic 轨迹 → 训练 Aegis

核心方法

1. 任务实例化:从 CVE 到可执行任务

CyberFactory 不是把 CVE 当文本塞进 prompt,而是把"公开漏洞工件"(包括 CVE 描述、相关代码仓、commit diff、PoC)转化为:

  • 可执行:能在容器化的目标环境(带漏洞依赖的服务)里真正跑起来
  • 可验证:有明确的判定器(pass/fail、补丁是否生效、PoC 是否复现漏洞、CyberQA 答案是否对齐标准)

任务覆盖三个维度:PoC 生成(证明漏洞可被利用)、漏洞修补(生成 patch)、网络安全问答(CyberQA)

2. 可复用技能:漏洞分析技能(vulnerability-analysis skill)

这是 CyberFactory 区别于"裸 prompt + rollout"的关键——把领域知识编码成一个可复用技能模块

vulnerability-analysis-skill:
  step_1: source_inspection      # 源码审查:定位可疑入口
  step_2: domain_prior_solve    # 领域先验求解:调用协议/系统调用/内存模型等知识
  step_3: evidence_based_verify # 证据验证:在目标环境跑 PoC 或补丁,对比预期

教师模型(teacher)按这个 skill 走一遍,产出"工具调用 + 环境反馈 + 修订"的 agentic 轨迹——这正是 CyberFactory 想要的 supervision。

3. 训练 Aegis:把技能内化为模型

Aegis 训练的核心 trick 是:学的是"按 skill 走一遍的结果",而不是"skill 本身"——所以推理时不需要挂载 skill 模块,模型已经把"源码审查 → 领域先验 → 证据验证"这套流程内化进参数。

⚠️ 细节未明:论文摘要没有交代 Aegis 的具体参数量、训练数据规模、SFT/RL 比例、reward 函数设计。这些属于「原文未明确」的字段,正文里应该有但本次解读未深入 PDF。

4. 命名寓意

模型名 Aegis 取自希腊神话宙斯与雅典娜的护盾,强调防御性 / 安全导向的用途定位。

关键实验与数据

主战场是 CyberGym(一个公开的网络安全智能体评测基准):

模型 CyberGym Pass@1(1 小时预算) 备注
Aegis(本文) 52.4% 基于 Qwen 3.5
Qwen 3.5 基座 29.6%(推算:52.4 − 22.8) 同 scaffold
通用基座(多款) 低于 Aegis 同 scaffold

⚠️ 数字核验:摘要明确给出 Aegis 52.4% Pass@1+22.8 points 的相对提升(基线即 Qwen 3.5),但未公开基线绝对值;评测基线 Qwen 3.5 的绝对分由 52.4 − 22.8 推算得到(≈ 29.6%)。"evaluated general-purpose backbones under the same scaffold" 包含哪些模型未列名。

v2 更新说明:作者在 comments 里注明"We updated scores with models trained on updated agentic data"——意味着 v2 的数字来自新一批 agentic 数据训练的模型。

亮点与局限

亮点

  • 三任务统一框架:PoC 生成 / 漏洞修补 / CyberQA 在同一框架下产出 agentic 轨迹,避免"任务孤岛"。
  • 技能-学习分离:教师用 skill,推理不用 skill——既保留领域先验的可复用性,又保持学生模型的部署简洁。
  • 真实漏洞工件驱动:用 CVE 而非合成数据,覆盖长尾漏洞类型。
  • 可验证训练信号:所有训练实例都有可执行的 pass/fail 判定,避免奖励黑客。
  • 开源 + 复现性:框架开源、模型开源、评测在公开基准 CyberGym 上跑。
  • 工业实用导向:Aegis + 1 小时预算 = 52.4% Pass@1,对于真实安全运营中"筛选可疑 CVE"已经接近可用阈值。

局限

  • 依赖 CyberGym 评测代表性:单一基准不足以覆盖网络安全全谱(web / 系统 / 二进制 / 协议层)。
  • Aegis 规模未公开:⚠️ 论文摘要未给参数量与训练数据规模,影响下游团队判断"是否能本地复现 / 部署"。
  • 领域先验来源未明:vulnerability-analysis skill 中的"领域先验"具体是协议知识库 / CVE 元数据 / 静态分析结果还是 LLM 内置知识,未在摘要交代。
  • 1 小时预算的工程含义:1 小时 PoC 复现对真实安全运营是长周期,需对比更短预算下的衰减曲线。
  • 未给出对照防御实验:Aegis 的输出是否会被攻击者二次利用(双重用途风险)未量化。
  • SOTA 比较面较窄:仅与"通用基座"对比,未与专门网络安全基座(如早期开源 CyberLLM 类)做 head-to-head。

对工程落地的启发

  1. "领域技能模块 + 教师轨迹 + 学生内化"是一种可推广的 agentic 训练配方——把"脚手架"从推理时搬到训练时,可以同时获得"可控训练"和"轻量部署"。
  2. 公开工件(漏洞、commit、CVE)作为种子,比纯合成数据更接近真实长尾——这是网络安全、代码、运维类任务共同的"训练数据从哪来"答案。
  3. 可执行 + 可验证的训练信号是 agentic 任务可规模化的前提——CyberFactory 用 CVE → 容器化靶场 → pass/fail 判定器构建了一个可被工程化复制的流水线。
  4. Agentic rollout 的扩展瓶颈不是模型能力,而是"领域先验 + 可执行环境"两个工程基建——CyberFactory 把这两个基建产品化了。

与同方向工作的关系

CyberFactory 与以下几条主线相关:

  • LLM Agent × 网络安全:与 Mythos 类闭源系统、CyberLLM、SecGPT 等开源网络安全模型同方向;CyberFactory 强调"agentic 训练流水线"而非"网络安全微调模型"。
  • Agentic 数据合成:与近一年 SFT/RL 数据合成(Self-Instruct、Evol-Instruct、ReST 系列)合流,区别是 CyberFactory 用"可执行工件 + 领域技能"代替"自指令 + 进化"。
  • 可验证奖励学习:与 Verifier-based RL / RLVR 思路同源——CyberFactory 的 evidence_based_verify 步骤等价于"任务级 verifier"。
  • 开源网络安全基座:Aegis 与 Qwen 3.5 同生态,是"通用基座 + 垂直领域 agentic 微调"路线的典型案例。

适合谁读

  • 网络安全团队:参考"从 CVE 到训练实例"的工程化路径
  • Agent 训练研究者:参考"技能-学习分离"的训练配方
  • LLM 安全 / 对齐研究者:参考双重用途风险的讨论
  • 关注开源网络安全基座的工程团队:参考 Aegis + CyberGym 评测范式
  • 关注 Agentic 数据合成的从业者:参考"可执行工件 + 领域技能"流水线

§0 自检

  • 机制 N 段:3(任务实例化 / 漏洞分析技能 / 技能内化训练)
  • 工程 M 段:3(CVE → 容器化靶场 / skill 三步脚手架 / 可验证判定器)
  • ⚠️ 数字核验 K 处:4(52.4% Pass@1 / +22.8 points / 基线 Qwen 3.5 绝对分推算 / 通用基座未列名)
  • 私域五维 SUM:0
  • CJK 字数:约 1750(≤4000)

来源

  • arxiv abstract:https://arxiv.org/abs/2608.23181
  • paper card:/shared/research-kb/organized/paper_cards/1094-2608-23181.md

工程落地与核查(Jay)

事实核查

字段 解读原文 原文出处 核查结论
52.4% Pass@1 "Aegis reaches 52.4% Pass@1" abstract原文 ✅ 与 abstract 完全一致
+22.8 points "improving over its Qwen 3.5 base model by +22.8 points" abstract原文 ✅ 与 abstract 完全一致
基线 Qwen 3.5 基线为 Qwen 3.5 abstract原文 ✅ "base model: Qwen 3.5"
52.4 - 22.8 = 29.6 基线绝对分推算 解读自算 ✅ 数学成立
"通用基座(多款)低于 Aegis" 对照组描述 abstract原文 ✅ abstract: "outperforming the evaluated general-purpose backbones"
三任务(PoC/漏洞修补/CyberQA) 任务维度描述 abstract原文 ✅ "proof-of-concept (PoC) generation, vulnerability patching, and cybersecurity question answering (CyberQA)"
v2 更新 scores v2 更新说明 abstract comments ✅ "We updated scores with models trained on updated agentic data"
CyberGym 评测基准 评测环境 abstract原文 ✅ "On CyberGym"
Aegis 命名来源 宙斯/雅典娜护盾 脚注原文 ✅ 脚注: "Aegis is, in Greek mythology, the protective shield of Zeus and Athena"
弱基座绝对分未列名 通用基座未列名 abstract原文 ✅ "evaluated general-purpose backbones" 未列具体模型名单

核查总结:事实核查全部通过,数字和描述与 abstract 完全对齐。唯一需要注意的是:v2 abstract 的数字已更新("updated scores with models trained on updated agentic data"),而解读中的实验数据引用的是 v2 数字——这意味着 v1 的原始数字可能与 v2 不同,但 v2 是最新版本,引用 v2 数字是正确的。

⚠️ 存疑点(不影响本篇评级):Aegis 参数量、训练数据规模、CyberGym 具体覆盖的漏洞类型分布——摘要未给,需 PDF 正文核验,但不影响"三任务 + 52.4% Pass@1"核心结论的可信度。

可读性精修

  • 整体结构完整,机制/工程双轨清晰。
  • §0 自检 K=4 与实际数字核验点一致,私域 SUM=0,CJK 字数低,清洁度高。
  • ⚠️ 一处小的不精确:v2 更新说明引用的是 abstract comments("We updated scores with models trained on updated agentic data"),但解读中写的是"作者在 comments 里注明"We updated scores with models trained on updated agentic data""——这里的"作者"指论文作者,而非"本文解读作者",语义上略有不清晰,建议改为"论文作者在 v2 comments 中注明",但不影响理解。

工程落地

1. 实际系统怎么用

CyberFactory 的工程价值是"训练配方",不是现成的安全 agent 产品。适合以下用法:

  • 直接训练自己的网络安全模型:用 CyberFactory 框架 + 自己的 CVE 数据集 + 容器化靶场,训练垂直领域网络安全 agent——适合有自己安全运营团队的甲方。
  • 构建可验证的 agentic 数据集:CyberFactory 的 pass/fail 判定器是纯可执行信号,适合"需要强验证信号"的 SFT/RL 训练数据生产;对比"人工标注"效率提升显著。
  • 评测基准使用:CyberGym 作为公开评测基准,可以用来横向比较不同网络安全模型的性能,适合采购评估和红队评测。
  • 参考 skill 脚手架设计:vulnerability-analysis skill 的三步(source_inspection → domain_prior_solve → evidence_based_verify)可以作为其他垂直领域 agent 训练的模板——不限于网络安全。

2. 关键工程坑

  • 容器化靶场的构建和维护成本:CyberFactory 的可执行性依赖"能把 CVE 转成带漏洞依赖的容器"——这对 CVE 数据质量要求高,且靶场需要随着新漏洞出现持续更新,是持续运营成本。
  • pass/fail 判定器的准确性:PoC 是否真正复现漏洞、patch 是否真正修好——判定器的设计直接影响训练信号质量;误判(PoC 跑了但实际没利用 / patch 看似有效但引入新漏洞)会直接污染训练数据。
  • 1 小时预算的工程约束:52.4% Pass@1 对应 1 小时预算意味着单次 PoC 复现的 cost 较高;真实安全运营通常需要 <15 分钟 budget 才能落地,论文未给出短 budget 下的衰减曲线。
  • 双重用途风险未量化:Aegis 的输出(PoC、patch)可以被蓝队用,也可以被红队用——论文未讨论"模型开源是否会显著降低攻击门槛"这一双重用途问题。
  • CyberGym 基准的代表性:单一基准不足以覆盖 web 渗透 / 二进制漏洞 / 协议层漏洞等长尾场景;如果真实运营场景与 CyberGym 覆盖类型偏差大,52.4% 这个数字会被高估。

3. 复现可行性

  • GitHub:⚠️ 未在摘要或 arxiv 页面标注 GitHub 链接,需 PDF 正文或 project page 确认;工业级框架(12 位作者)通常会开源,但链接在摘要层面不可见。
  • Aegis 模型:摘要脚注提到模型名 Aegis,但未给模型权重下载链接;需要正文确认是否开源模型权重。
  • CyberGym 基准:CyberGym 作为公开基准,应该有公开的评测协议和测试集——但评测集规模、漏洞类型分布未在摘要公开。
  • CVE 数据来源:摘要提到"CVEs from the wild",但未说明 CVE 数据集的爬取时间窗口和来源平台(MITRE CVE / NVD / OSV 等),影响对"长尾覆盖率"的判断。

4. 适合引入的团队

✅ 有自己安全运营团队的甲方(有能力搭建容器化靶场 + 使用 CyberFactory 框架训练) ✅ 网络安全研究团队(参考 skill-scaffolding 训练配方迁移到其他垂直领域) ✅ 红队 / 渗透测试团队(用 CyberGym 做模型横向评测) ✅ Agent 数据合成研究者(参考"可验证 + 可执行"训练数据生产流水线) ❌ 没有安全运营能力的纯甲方(靶场建设和维护成本高) ❌ 需要直接使用网络安全模型的团队(Aegis 是研究产出,不是商业产品;52.4% Pass@1 仍在"接近可用"而非"直接部署"阶段) ❌ 对双重用途有严格合规要求的团队(开源网络安全 agent + PoC 生成能力需要额外的合规审查)