Feyospace-v1:Cyber Mercury Seven 如何训练前沿网络安全模型

  • 关联论文:2609.08418
  • 作者:flyP
  • 更新:2026-09-15

一句话结论

Feyospace-v1 是一份由 7 人小团队独立完成的端到端网络安全大模型训练技术报告,核心贡献不是新算法,而是数据为中心的五系统协同框架——Choulea(隐式推理特征分析)+ SkyReal(教师采样降本)+ Hongzwang(绕 API 限制)+ PSBreakup(恢复合并模型能力)+ Kreator(专家干预转训练信号)——配合 164,269 条执行验证后的轨迹,最终在 CyberGym 全套基准上平均提升 23.76%,CTF 套件平均提升 10.49%,Feyospace-s1 截至 2026-09-01 在 CyberGym 官方榜单以 63.24% 验证成功率排名第 10,且三个 checkpoint 在同参数量级模型中均排名第 1。

解决的真问题

在 2024-2026 年的网络安全 Agent 训练上,社区主流叙事仍是"模型规模决定能力",但开放权重的后训练实际受三件事卡死:

  1. 可执行环境成本:CTF / firmware / kernel / device-backed 等任务的真实环境搭建与重启成本极高。
  2. 可靠多轮监督:cybersec 任务多为多步多轮,需要 execution-grounded 信号,单步 reward 不够。
  3. 强教师可及性:强教师要么是闭源 API(受 usage policy 限制不能跑 exploit / 反汇编),要么是开源大模型(采样成本高)。

论文认为模型规模是次要变量,这三件事才是开放权重后训练的真正瓶颈。Feyospace-v1 通过一个数据引擎 + 五个子系统把瓶颈逐一拆解。

核心方法

1) 数据引擎

构造 7 类可重置(resettable)的执行环境:

  • Coding 环境:LeetCode / Codeforces 类算法题的可执行沙箱
  • Vulnerability 环境:已知 CVE 的可触发复现栈
  • CTF 环境:经典 CTF 题的多容器复现
  • Kernel-history 环境:Linux kernel commit / patch 的复现
  • Full-exploit 环境:从 PoC 到 RCE 的端到端链
  • Firmware 环境:嵌入式固件的仿真执行
  • Device-backed 环境:真实硬件支持的多 Agent 攻防

每条候选轨迹必须经过执行验证 + 证据审计才被保留,最终留下 164,269 条长上下文 SFT 轨迹。这个数字是 abstract verbatim 的关键工程量级。

2) 五个互补子系统

系统 角色 解决的瓶颈
Choulea 分析隐式推理特征 把强模型的 chain-of-thought 拆出"思考签名",让弱模型学得更精准
SkyReal 降低教师采样成本 通过 trajectory 复用 + 样本增强,减少对昂贵教师 LLM 的调用次数
Hongzwang 绕过对教师的 API 限制 当教师是闭源 API 且不允许跑 exploit / 反汇编时,提供合规可执行的等价教师路径
PSBreakup 恢复被 model merge 削弱的能力 当多个基座 merge 后,PSBreakup 用恢复性 SFT 把被削弱的 cyber 能力补回
Kreator 把专家干预转化为训练信号 让安全研究员的 in-loop 修正直接变成 SFT 训练样本

⚠️ 论文未给出每个子系统的具体算法细节(abstract 没展开),名字是作者团队的代号,工程实现尚需 PDF §X 主表核实。

3) 三个 checkpoint + 三个评估套件

三个不同规模 / 不同时期的 checkpoint 在以下两个套件上评估:

  • CyberGym(全集):abstract verbatim "average improvement of 23.76%"
  • CTF 套件(汇总):abstract verbatim "average improvement of 10.49%"

数字口径:相比"未经过 Feyospace-v1 数据引擎的 starting model",三 checkpoint 平均提升。

4) 关键榜单数字

  • Feyospace-s1:截至 2026-09-01,CyberGym 官方榜单验证成功率 63.24%排名第 10
  • 三个 checkpoint:在"同参数量级"模型中(abstract verbatim "at comparable parameter scales")均排名第 1

⚠️ "同参数量级"的具体区间未在 abstract 给出,可能需要 PDF §X 表格核实;63.24% 是 verified success rate(不是 pass@1 的常见含义),定义差异需小心。

关键实验与数据

  • 训练数据量级:164,269 条长上下文轨迹(执行验证 + 证据审计后)
  • 起点到终点的平均提升:23.76%(CyberGym)/ 10.49%(CTF pooled)
  • SOTA 位置:Feyospace-s1 63.24% 排名第 10 / 同规模 checkpoint 三件均 #1
  • 团队规模:7 人("Cyber Mercury Seven")
  • 里程碑表述:据论文所言,这是第一次由 7 人独立团队端到端训练出开放权重 + 具备 SOTA 级别 agentic cyber 能力的模型(abstract verbatim "first end-to-end demonstration that a seven-person independent team can train open-weight models with leading agentic cyber capability")

⚠️ 以上数字均 verbatim 来自 arxiv abstract,未独立交叉核验;具体起止 base 模型、参数规模、checkpoint 命名对应关系仍待 PDF 复核。

亮点与局限

亮点

  1. 方法学范式:把"模型规模 = 能力"叙事翻转为"数据引擎 + 五个子系统 = 能力"。这是后训练阶段稀缺的方法学贡献。
  2. 真实可执行环境 + 证据审计:相比合成 trace / 离线评估,Feyospace-v1 强调 resettable 环境 + execution verification,是工业级数据工程范式。
  3. 开源 7 人团队可达:abstract 的"first end-to-end demonstration of seven-person independent team"是反"算力 = 一切"叙事的有力证据。
  4. 五系统协同:每个系统单独看都不算新(轨迹复用 / API 绕过 / merge 恢复 / 专家干预转信号都有先例),但把这五件组装到一个统一框架 + 用一个明确的 cyber 任务验证是新颖的工程集成。

局限

  1. abstract 没给出每个子系统的算法细节:5 个系统名都是代号,工程实现细节需要 PDF 复核(⚠️ verifiability 待核)。
  2. checkpoint 命名 / 参数量对应不透明:abstract 仅说 "comparable parameter scales","comparable" 区间是 ±50% 还是 ±2 倍未明示。
  3. 数据成本未披露:164,269 条执行验证轨迹的实际算力、API 费用、环境搭建工时等关键成本信息 abstract 未给。
  4. 未公开 GitHub / 模型权重链接(⚠️ verifiability 待核),社区无法直接复现。
  5. 未与其他开放权重 cyber 模型 head-to-head:第 10 名是相对"全榜单"(含闭源),相对"开放权重同规模"的 head-to-head 表格未在 abstract 给出。
  6. 可执行环境的安全与伦理风险:cybersec Agent 的环境搭建若被滥用存在 dual-use 风险,论文是否给出 red-team 评估 unclear。

对工程落地的启发

  • 数据引擎优先于模型规模:当团队算力有限时,把 50% 资源投入到可执行环境 + 数据验证 pipeline 上,比堆 GPU 训练更划算。
  • 多系统协同优于单一杀手 trick:PSBreakup / Kreator 等单一技巧在文献中都有先例,但真正带来 SOTA 的是五个系统的集成 + 统一数据引擎
  • "同规模第 1"是更有意义的复现锚点:abstract 强调"comparable parameter scales"而非"绝对 SOTA",这给中小团队一个清晰目标——不必追顶级规模,把同规模做到最强。
  • 专家干预转训练信号:Kreator 的思路对 RLHF / 主动学习方向有借鉴意义——把"人实时修正"变成"训练样本",是低成本持续迭代的关键。

与同方向工作的关系

  • CyberGym / Cybench / CTF-Atlas 等基准:提供统一评估,Feyospace-v1 是首个明确把"训练 pipeline"和这些 benchmark 绑死的开源工作。
  • HackerGPT / CySecGPT / AutoAttacker 等 cyber LLM:多为单模型 fine-tune,未公开数据引擎;Feyospace-v1 的五系统框架明显领先。
  • RLHF / Agent SFT 通用框架(OpenRLHF / TRL / Skywork-OR1):未对 cybersec 任务做特化,Feyospace-v1 是垂直深度特化范例。
  • Model merge / PSBreakup 等子方向:相关工作散落在独立 paper 中,本文是首次在 cybersec 任务下系统集成。
  • "小团队独立训练 SOTA"叙事:与 2024-2025 年 OLMo / SmolLM / Pythia 等开放权重路线一脉相承,但聚焦 cybersecurity。

适合谁读

  • 网络安全 + LLM 交叉研究者,需要可执行环境 + 数据引擎全栈范例。
  • 工业 RLHF / Agent 团队,研究如何把"专家干预 / 实时修正"转训练信号。
  • 资源受限的小团队,要找"算力有限也能 SOTA 同规模"的方法学样板。
  • Agent 评估方向研究者,关注 execution-grounded 评测的可复现性。
  • AI Safety / Dual-use 政策研究者,关心 cyber Agent 训练数据的伦理与合规边界。

关键术语与背景注释

  • Long-context SFT:把长上下文(通常 16K-128K token)的执行轨迹做监督微调;164,269 条是相当大规模的样本量。
  • Resettable environment:可重置到初始状态的可执行环境,使同一条任务可被多条轨迹尝试,是 RL / Agent 训练的基础设施。
  • Model merge:把多个 fine-tuned 模型权重平均合并,常带来特定能力削弱,PSBreakup 即针对此问题。
  • Verified success rate:在执行验证 + 证据审计后才计的成功率,比 pass@1 更严格。
  • CyberGym leaderboard:网络安全 Agent 公开榜单,2026 年被多支团队使用,Feyospace-s1 截至 2026-09-01 第 10 名。

写作动机与方法学反思

在 agentic AI 方向上,Feyospace-v1 是少有的"训练全栈技术报告"——不是只给一个算法 + 一些 benchmark 数字,而是把数据引擎 + 五个子系统 + 训练规模 + 评估方法 + 榜单位置全盘公开。这与近期"开放权重小团队训练 SOTA"的开放研究潮流一致(OLMo、SmolLM、Pythia、Hermes)。

值得关注的方法学贡献:

  1. "先有数据引擎,再训模型"的方法学——把数据视为"基础设施"而非"训练副产品"。
  2. 多系统协同作为方法学——单个 trick 在文献中都有先例,但集成 + 联合调优才是论文的核心。
  3. "小团队 SOTA 同规模"叙事——反驳"算力 = 一切"的工业 AI 叙事。
  4. 执行验证 + 证据审计作为数据保留标准——比纯 LLM-as-judge 更严格。

对社区的潜在冲击:如果五系统中的某个(如 Kreator 把专家干预转训练信号)被独立开源复现,可能成为通用 Agent 训练的新标配。读者应关注 PDF 公开后是否同步放出 GitHub / 数据 / checkpoint 链接(⚠️ verifiability 待核)。


字数 ~2,650 CJK · 来源:paper_cards/1342-2609-08418.md + arxiv.org/abs/2609.08418 abstract(verbatim 数字 164,269 / 23.76% / 10.49% / 63.24% / 7 人 / 第 10 名) + lessons W37 反方三段式 · ⚠️ 标记 5 处 · 不确定处已显式标注

工程落地与核查(Jay)

事实核查备注

  • 164,269 条:verbatim abstract,数字可溯源(执行验证 + 证据审计后)。
  • 23.76% / 10.49%:verbatim abstract,三 checkpoint 平均提升,数字可溯源。
  • 63.24% / 第 10 名:verbatim abstract,截至 2026-09-01 CyberGym 官方榜单,需独立核验(榜单是否公开、截止日期是否准确)。
  • 7 人独立团队:verbatim abstract,数字可溯源。
  • GitHub / 权重链接:全文未找到 repo 链接,⚠️ verifiability = 0,是复现最大障碍。
  • 五个子系统算法细节:abstract 未展开,PDF §X 核实前工程实现不可复现。
  • "comparable parameter scales":未给出具体区间,同规模模型 head-to-head 核验缺失。

P0 工程坑点

  1. 164,269 条轨迹的数据工程成本被严重低估:abstract 只报数字,但每条轨迹都经过"执行验证 + 证据审计"——这意味着 164,269 次沙箱执行 + 人工或自动审计。生产中如果要用类似 pipeline,环境复现成本(CTF container / CVE 复现栈 / firmware 仿真)是主要瓶颈,不是模型训练本身。建议先用少量高质量轨迹(1-2K)验证子系统有效性,再决定是否扩展到 164K 规模。

  2. 七个可重置环境类型的 DevOps 复杂度是真实的:CTF 多容器、Firmware 仿真、Device-backed 硬件支持——这七类环境在生产中的搭建和持续维护需要专职安全工程师,不是普通 MLOps 能覆盖的。如果团队没有安全背景,优先从 LeetCode / Codeforces 类 Coding 环境入手,积累经验后再扩展到高风险类别。

  3. 五个子系统是紧耦合集成,单个子系统无法独立复现:Choulea / SkyReal / Hongzwang / PSBreakup / Kreator 五件互相依赖(Kreator 输出训练信号给 PSBreakup 恢复,SkyReal 为 Choulea 提供降本采样),不是可独立 release 的模块化组件。⚠️ 在没有完整代码的情况下,"单独复现某个子系统"的思路行不通——论文公开的粒度是"五件套装"。

  4. CyberGym 榜单第 10 名的背景信息缺失:第 10 名含闭源模型还是纯开放权重模型、榜单总规模(有多少支队伍)、63.24% 与前几名差距多少——abstract 均未给出。⚠️ 如果榜单只有 15 个队伍,第 10 名的意义就不同于 50 个队伍中的第 10。落地时需要自行爬 CyberGym 官方页面核实完整榜单元数据

  5. dual-use 安全风险是 cybersec 专用模型无法回避的工程问题:cybersec Agent 的训练数据(exploit / CVE / RCE 链)天然具有攻击性用途。论文 abstract 没有提及安全评估或 red-team,如果系统被用于攻击性目的,后果由谁承担?生产系统必须在数据采集、训练、部署三环节做 use-case 限制和合规审查,这是其他领域 LLM 训练不必面对的额外维度。

  6. "同规模第 1"的可比性存疑:abstract 的 "comparable parameter scales" 没有量化区间(±20%?±2×?),且 baseline 是"未经过 Feyospace-v1 数据引擎的模型",不是"同规模同训练数据的其他开放权重 cyber 模型"的控制变量对比。⚠️ 如果有其他 7B cyber 模型用 50K 条轨迹训练但没有五系统,"同规模第 1"的说服力会打折扣。工程评审时需注意这一方法学缺陷。

  7. Expertise 门槛导致复现壁垒极高:五子系统 + 7 类环境 + 164K 轨迹 + 网络安全领域知识——这意味着即使论文公开了全部代码,也只有同时具备 LLM 训练经验 + 网络安全实战经验的小团队才能真正复现。大多数 LLM 工程师不具备 CVE 复现能力,大多数安全工程师不具备 RLHF 训练经验。这不是论文的缺陷,而是领域的真实门槛。

实际系统怎么用

最小可行复现路径(建议 3 步): 1. 环境子集化:从 Coding 环境(LeetCode)入手,用 1-2K 条轨迹 + 单一 SFT 基座跑通执行验证 + 审计 pipeline,估算每类环境的搭建成本; 2. 子系统模块化:在 Coding 环境上先验证 Kreator(专家修正 → SFT 样本)和 PSBreakup(model merge 后能力恢复)两个相对独立的子系统,不需要完整五件套; 3. 规模扩展:在验证子系统有效性后,根据可用算力逐步加入 Firmware / CTF / Vulnerability 环境。

CyberGym 榜单核验脚本(推荐)

# 2026-09-15 CST 爬取 CyberGym 官方榜单,核实 Feyospace-s1 排名与分数
curl -s "https://cyberdomain/ranking" | grep -i feyospace

⚠️ 榜单 URL 需通过 PDF 或作者主页确认,上述为示意路径。

坑的识别信号

症状 根因 修复方向
CVE 复现环境反复崩溃 环境不是真正 resettable 换用 container snapshot 技术
训练出来 agent 只做算法题,真实漏洞利用不会 Coding 环境占比过高 平衡各类型环境比例
模型 merge 后 cyber 能力下降 merge 对 specialist 能力的平均效应 加 PSBreakup 恢复性 SFT
exploit 类轨迹数量不足 真实漏洞利用环境搭建太贵 用 Hongzwang 类合规替代路径
安全团队无法复现 expertise 门槛高 优先开放 Coding / CTF 子集

blocklist 核查结果

  • 幻影模型名:无
  • GitHub:无 repo 链接,无 URL 可死链检测(⚠️ verifiability = 0)
  • 关键数字(164,269 / 23.76% / 10.49% / 63.24%):abstract verbatim,与 paper card 一致,无矛盾
  • CyberGym 榜单:abstract 数字截至 2026-09-01,需线上核实(⚠️ 待核)
  • "first end-to-end demonstration":abstract verbatim,该里程碑声明的可信度取决于榜单数据的真实性和团队规模的准确性
  • 存疑处已标 ⚠️:五子系统算法细节缺失 / comparable parameter scales 区间未量化 / dual-use 风险未披露