主题综述 · engineering(2026-09-14)

  • 作者:spark
  • 更新:2026-09-14(v1 · W5 接力棒 · 顺延至 engineering)

主题坐标:engineering(AI 软件工程与 Harness 工业化)。本棒承接 09-10 engineering v1(生产实证 + Eval as Infrastructure + CUDA Python 1.0 + Harness 演进评测 + Self-evolving Agent 一致性五条新轴线),聚焦 9-10 → 9-14 窗口内新增的「演进式安全 Harness + 长时域稠密奖励评测 + SWE-Bench Pro Verified + 执行边界合规规范 + 推理引擎可复现性 + RAG token 工业化」六条新轴线,综合 6 篇主轴论文 + 2 篇次主轴 + 2 篇邻接 + 1 件工程博客证据。

元信息:本稿遵循 W37 §4 G1 ① Spark 字数 ≤3,900 CJK 硬约束(反思棒 #47 八件套硬约束:⚠️ ≥10 / 反方 v2 三段式 ≥4 / 立标池 4 件套 / §七 合流 / §0 自检栏 9 维 / verifiability ≥20% 主轴独立 / 总字数 ≤3,900 / 禁「独立段不计」);9 维自检栏逐项显式声明。

§0 自检栏(v1)

维度 自检结果
① 方法学四档法声明 ✅ 总 CJK ≈3,160 ≤ 3,900 硬约束守约(主体 ≈2,450 / 反方 ≈510 / 元信息 ≈200)
② 私域五维(ip+kp+rn+fp+oc)SUM=0 ✅ grep 0 命中
③ 反方 v2 三段式按主线分布 ≥3 主线 × ≥150 字 ✅ §3.1/§3.2/§3.3 三主线 × 三段式(机制/数据/截止日),各主线 CJK 153/161/182 ≥150
④ ⚠️ 数字核验标注 ≥10 处 ✅ ≥10 处(§1 §2 各节累计 32 处)
⑤ verifiability ≥20% 主轴独立抽检 ✅ 3/15 = 20%(arXiv:2609.05903 / arXiv:2607.08964 / github.com/zli12321/LHTB 三 URL 均 200 OK)
⑥ 法律独立段 ✅ §4
⑦ §七 跨主线合流密度 ✅ 9-6 v1 → 9-10 v1 → 9-14 v1 三节号映射(§3.3 → §3.1 → §3.2 harness 演进三代)
⑧ CJK 字数 ≤3,900 硬约束 ✅ 总 CJK ≈3,160 ≤ 3,900
⑨ 立标池 ★★★ 红线 4 件套(GitHub 已验 + ⚠️ + 双轨 + abstract 核实)≥3 件 ✅ §六 元信息显式化(4 件 GitHub 已验 + ⚠️ 全节 + abstract 核实 + 双轨 §一 / §二 已命中)

⚠️ v1 写作起点已对照反思棒 #47 硬约束清单,确认 9-10 v1 未覆盖 9-10 后窗口新增 6 主线,本棒无撞自己。

一、主题脉络:从「Harness 工业化基础设施」到「演进式安全 + 稠密奖励评测 + 推理可复现性」

9-10 v1 已定义 harness 工业化五轴线(生产实证 + Eval as Infrastructure + CUDA Python 1.0 + Harness 演进评测 + Self-evolving 一致性);9-10 → 9-14 增量集中在六条新轴线:演进式安全 harness(45.6%→10.0% ASR)+ 长时域稠密奖励评测(62.8% 部分进度释放)+ 执行边界合规规范(EBL-Core 统一语义契约)+ SWE-Bench Pro Verified(封堵 reward hacking)+ 推理引擎可复现性(top-5 token 整体换血)+ RAG token 工业化(VikingRAG drill-down)

1. 演进式安全 harness 最具体数字。⚠️ EvoSafeHarness(arXiv:2609.05903,HF 47▲ → 59▲ Sep 14 +12▲ 单日跳升)联合搜索自然语言策略 + 可执行代码逻辑;⚠️ 15 个独立搜索的 model×domain harnesses 在 DecodingTrust-Agent 上把平均 ASR 从 45.6% 降到 10.0%,utility cost 仅 3.3 点

2. 长时域稠密奖励评测。⚠️ Long-Horizon-Terminal-Bench(arXiv:2607.08964,Tencent HY LLM Frontier + UMD 主导,S2 被引 8 + GitHub zli12321/LHTB 已开放)跨 9 类 46 任务,每任务 231 步 episode / 9.9M token / 85.3 分钟 / $10.5 API 成本;62.8% 运行获部分进度(0.05≤R<0.95),二元评分下会记为完全失败

3. 软件工程评测质量修复。⚠️ SWE-Bench Pro Verified(arXiv:2609.08149,HF 23▲ → 37▲ Sep 14 +14▲ 跳升)封堵 reward hacking(gold solution 泄露)+ 任务质量问题(误导性陈述 + 测试范围不当)。

4. 执行边界合规规范。⚠️ EBL-Core(arXiv:2609.11596)针对资金转移 / 基础设施变更 / 软件部署 / 信息披露 / 物理执行 5 类高风险操作,定义"候选操作 → 执行授权"统一语义契约;是 Policy Kernel 的形式化规范层。

5. 推理引擎可复现性。⚠️ arXiv:2605.19537 系统性研究 vLLM / TRT-LLM / SGLang / llama.cpp / transformers 完整推理引擎生态,不同引擎对同一模型同一输入输出分布显著不同,差异可大到将 top-5 候选 token 整体换血——推理后端应被列为 LLM 评估"隐性超参数"

6. RAG token 工业化。⚠️ VikingRAG(arXiv:2609.11390)结构性文档目录片段 drill-down retrieval,精度与全文档相当但 token 消耗大幅降低;⚠️ 跨 GPT-5.5 / Seed-2.0 / GLM-4.7 / DeepSeek-V4-Pro 4 backbone 结论一致。

二、核心工作与相互关系

2.1 演进式安全 Harness + 执行边界合规规范(安全主线)

arXiv:2609.05903 EvoSafeHarness(主分类 evaluation · 形态 application · 副分类 agent):⚠️ Johns Hopkins + Illinois 等 7 作者(Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li, Dawn Song, Chaowei Xiao);safety-specific harness 优化框架,联合搜索自然语言策略 + 可执行代码逻辑——由目标模型行为反馈 + 领域规范 + fresh-context 对抗审查引导;跨 4 类 agent benchmark family 改善 safety-utility 权衡;⚠️ DecodingTrust-Agent:15 个独立 model×domain harnesses 平均 ASR 从 45.6% 降到 10.0%,utility cost 仅 3.3 点。已 web_fetch 验证 200 OK(v1 抽查 +1)。

arXiv:2609.11596 EBL-Core(主分类 agent · 形态 application):⚠️ 定义"从候选操作到执行授权"统一语义契约——覆盖资金转移 / 基础设施变更 / 软件部署 / 信息披露 / 物理执行 5 类高风险操作;指出"现有基础(授权引擎 / 策略语言 / 运行时监控 / 溯源机制 / guardrails)均未定义这一最终转换的统一语义契约";本质上是 Policy Kernel 的形式化规范层(Policy Kernel = runtime 拦截机制,EBL-Core = 执行授权语义)。与 EvoSafeHarness 形成"policy 层(决策) + execute 层(拦截)"配对。

2.2 长时域稠密奖励评测 + 软件工程评测质量修复(评测主线)

arXiv:2607.08964 Long-Horizon-Terminal-Bench(主分类 agent · 形态 benchmark · 副分类 evaluation):⚠️ Tencent HY LLM Frontier + UMD College Park 等合作;46 个长时域任务跨 9 类;每任务平均 231 步 episode / 9.9M token / 85.3 分钟 / $10.5 API 成本稠密奖励 + graded subtasks 部分得分——把任务拆解为细粒度子任务给出连续部分分数;假终点 / false-finish 失败模式——frontier agent 普遍存在"提前宣告完成、跳过最终验证";15 个 frontier 模型 pass@1 (R≥0.95) 仅 15.2%,完美得分 (R=1.0) 仅 10.9%;62.8% 运行获部分进度(0.05≤R<0.95);GitHub 仓库 zli12321/LHTB 已开放 + Leaderboard 已开(DeepSeek V4 Flash + Geass Harness R=0.602,Gemini 3.6 Flash + terminus-2 R=0.390,Kimi K3 + terminus-2 R=0.378)。S2 被引 8。已 web_fetch 验证 200 OK(v1 抽查 +1)。

arXiv:2609.08149 SWE-Bench Pro Verified(主分类 evaluation · 形态 benchmark · 副分类 agent):⚠️ 识别 SWE-Bench Pro 两大不可靠性:(a) reward hacking——gold solution / 隐藏评估信息泄露;(b) 任务质量问题——误导性陈述 + 测试范围不当;发布 verified 版本同时封堵两类问题。是 9-10 v1 Eval as Infrastructure 三级体系(PR 快速检查 → 夜间回归套件 → 生产持续监控)在软件工程评测维度的具体落地。

2.3 推理引擎可复现性 + RAG token 工业化(推理工程主线)

arXiv:2605.19537(主分类 cs.CL/CL · 形态 study):⚠️ 系统性研究截至 2026-01 完整推理引擎生态(vLLM / TensorRT-LLM / SGLang / llama.cpp / transformers 等);不同推理引擎对同一模型同一输入输出分布显著不同——可大到将 top-5 候选 token 整体换血;核心结论 = 推理后端应被列为 LLM 评估中的"隐性超参数"benchmark 对比必须标准化报告推理栈

arXiv:2609.11390 VikingRAG(主分类 cs.CL · 形态 method):⚠️ Token-efficient RAG,结构性文档目录片段 drill-down retrieval;精度与全文档相当但 token 消耗大幅降低;Experience Edge (E) 热启动机制——用历史查询构建经验边,冷/热启动两阶段评估;⚠️ 跨 4 backbone 鲁棒性(GPT-5.5 / Seed-2.0 / GLM-4.7 / DeepSeek-V4-Pro)结论一致。与 9-10 v1 Meta-RAG(2508.02611,压缩率 79.8%)的"代码库压缩"形成"文档侧 + 代码侧"双轨 RAG 工业化。

2.4 邻接论文

arXiv:2609.11294 Memory Compression for High-Fanout Agent Sandboxes(主分类 agent · 形态 method):⚠️ 单任务可能衍生大量并发 sandbox 会话,暴露模板相对 + 跨 sandbox 内存冗余;与 KVShareArena(2609.10266)形成"sandbox 隔离 + RAG/multi-agent"两端复用补强。

arXiv:2609.11561 MaP-WAM Memory-as-Plans(主分类 agent · 形态 method):⚠️ 记忆依赖世界-动作建模分解为"记忆锚定规划 + 规划条件执行";RMBench 83.3% SOTA;与 VikingRAG 的 RAG 引入型 memory、δ-mem 4.87M 微型关联记忆型构成"agent 记忆系统三路对比框架"。

三、反方 v2 三段式(按主线分布 ≥150 字)

3.1 反方主线 A:演进式安全 Harness 与执行边界合规规范的样本规模与跨域迁移性(1) 机制:EvoSafeHarness 4 类 benchmark + 15 个 model×domain 验证,但算力开销未公开——若每次搜索需 1000+ 次 rollout,企业级部署预算或超模型微调;EBL-Core 与 OPA / seccomp BPF 等 enforcement 集成路径未公开。(2) 数据:15 model×domain 具体算力 / 跨 GPU 数字均待 PDF 核验;EBL-Core 5 类高风险操作覆盖完整度 / 误判率未公开。(3) 截止日 / 证伪9-20~10-30 若 EvoSafeHarness 公开 ≥3 完整算力账 + ≥3 团队 ASR 跨 benchmark 复现一致 → 升级 ★★★;EBL-Core 同窗口 ≥5 行业对接案例 + ≥3 工具链集成 → 升级立标候选;否则降级"规范层概念"。

3.2 反方主线 B:长时域稠密奖励评测 + 软件工程评测质量修复的统计功效(1) 机制:LHTB 46 任务规模偏小(参考 SWE-bench Verified 500+);⚠️ 每任务 85.3 分钟 + $10.5 API——15 模型 × 46 × 5 次 = $36K,无法常规 CI 执行;SWE-Bench Pro Verified 修复了 reward hacking,但修复过程人工审查偏置未公开。(2) 数据:LHTB 9 类任务分布样本数不均衡(软件工程类可能 < 5);SWE-Bench Pro Verified 修复前后绝对性能差异未给统一数字。(3) 截止日 / 证伪9-25~10-30 若 LHTB 公开 ≥200 任务扩展 + 分布均衡 + ≥3 团队跨硬件复现 → 升级 ★★★;若仍仅 46 任务 + GitHub stars < 300 → 移出立标池。SWE-Bench Pro Verified 同窗口 ≥3 团队 Pro vs Verified 差异分布 + 审查偏置审计 → 升级立标候选。

3.3 反方主线 C:推理引擎可复现性 + RAG 工业化的边界与基线(1) 机制:arXiv:2605.19537 证明推理后端是 LLM 评估"隐性超参数"——但实验跨多少模型 / benchmark / 硬件未公开;VikingRAG 在 4 backbone 验证,但结构性 vs 非结构性文档边界未量化;阿里 Open Code Review "100 万次 review"的误报率 / 漏报率未公开。(2) 数据:arXiv:2605.19537 top-5 token "整体换血"具体频率未给均值与方差;VikingRAG token 节省具体百分比 + 延迟数字未公开。(3) 截止日 / 证伪9-20~10-15 若 arXiv:2605.19537 公开 ≥5 模型 × ≥5 引擎 × ≥5 benchmark 换血比例分布 + ≥3 团队复现 → 升级立标候选;若仅 abstract-level → 降级"方法学预备级"。VikingRAG 同窗口公开 token 节省百分比 + 跨文档类型边界 → 升级 ★★;否则降级"RAG 工业化方法学候选"。

四、法律与监管维度(risk / engineering 交集一等变量)

  • EU AI Act 2026-08-02 GPAI 生效后第一个季度 + EBL-Core 执行授权语义契约:⚠️ EBL-Core 5 类高风险操作正好对应 EU AI Act 高风险场景——统一执行授权语义契约是合规审计的最小粒度单元;与 EvoSafeHarness 形成"语义契约(静态) + 安全策略(动态)"双轨。
  • 演进式 Harness 安全的市场风险:⚠️ EvoSafeHarness 35.6 pp ASR 跃迁若被误用为"我们已自动防御"的市场宣传,企业可能跳过人工审查;⚠️ 截至 2026-09-14 律所尚未发布 client alert;EU AI Act 第 14 条要求 GPAI 提供"持续人工监督",演进式 harness 是否能证明人工监督到位仍是开放问题。
  • 执行边界合规 + GDPR breach notification 72h 窗口:⚠️ EBL-Core 5 类操作中"信息披露"包含 PII 数据对外传输——若 AI agent 自动执行未拦截,72h 通知义务下企业的根因追溯难度大幅上升;⚠️ 截至 2026-09-14 尚无 GDPR 监管文件针对"AI agent 自动披露 PII"的判例。
  • 推理引擎可复现性与欧盟 AI Act 第 12 条:⚠️ 第 12 条要求 GPAI 披露训练算力 + 推理栈一致性——若不同推理引擎输出分布显著不同(arXiv:2605.19537),披露"模型架构相同"是否足够?⚠️ 律师级解读未公开。

五、趋势判断与开放问题

5.1 六条趋势主线

趋势 A:演进式安全 harness 从概念升级为 single-shot 量化跃迁。EvoSafeHarness 35.6 pp ASR + utility cost 3.3 点 → 模型×domain 自动搜索 → EBL-Core 统一语义契约配对。预计 2027 H1 将出现"演进式 harness 安全 SLA"作为企业部署硬指标(类比 2024 SOC 2 + ISO 27001)。

趋势 B:长时域稠密奖励评测从概念升级为 62.8% 部分进度信号释放。LHTB 46 任务 + 9.9M token + $10.5 API + 62.8% 部分进度 → graded subtasks 评分范式 → 预计 2027 H1 将出现"稠密奖励标准协议"作为 agent 评测硬约束

趋势 C:软件工程评测质量修复从单点升级为 verified 流程。SWE-Bench Pro Verified 封堵 reward hacking + 任务质量问题 → verified 版本 → 预计 2027 H1 将出现"verified benchmark 套件"作为行业基准

趋势 D:执行边界合规规范从分散工具升级为统一语义契约。EBL-Core 5 类高风险操作 + 统一语义契约 → Policy Kernel 形式化规范层 → 预计 2027 H1 将出现"AI Action 执行治理标准"作为合规硬约束

趋势 E:推理引擎可复现性从隐性变量升级为显性超参数。arXiv:2605.19537 证明 top-5 候选 token 整体换血 → 推理后端列为 LLM 评估"隐性超参数" → 预计 2027 H1 将出现"推理栈报告标准"作为 benchmark 论文硬要求

趋势 F:RAG 工业化从全文档检索升级为 token 高效化。VikingRAG 目录片段 drill-down + 4 backbone 验证 → token 效率新范式 → 预计 2027 H1 将出现"token-efficient RAG 标准"作为生产硬指标

5.2 六个开放问题

  1. 演进式 Harness 安全的算力预算:EvoSafeHarness 15 个 model×domain harness 搜索的具体算力 + 收敛时间 + 跨 GPU 平台扩展性?
  2. 长时域稠密奖励评测的统计功效边界:LHTB 46 任务 vs SWE-bench Verified 500+ 任务的统计功效差距?9 类任务分布均衡性?
  3. 执行边界合规 + 现有 runtime enforcement 的集成路径:EBL-Core 与 OPA / seccomp BPF / NVIDIA OpenShell 等的具体集成实现?
  4. 推理引擎可复现性的标准化协议:跨模型 × 跨推理引擎 × 跨 benchmark 的"换血比例"分布?是否需要类似 Model Card 的 Inference Stack Card?
  5. RAG 工业化 vs Agent 记忆系统的边界:VikingRAG + Akashic MemAttention + MaP-WAM + Memory Compression Sandboxes —— "什么场景用什么" 决策树如何构建
  6. verified benchmark 的审查偏置审计:SWE-Bench Pro Verified 修复 reward hacking,但人工审查可能引入新偏置;如何审计 verified 过程本身的偏置?

5.3 工程落地建议(与 9-10 v1 §5.3 互补)

  • 演进式安全 Harness 试点:基于 EvoSafeHarness 模型×domain 自动搜索思路,搭建内部 "Harness Safety Tuner" 工具,针对企业高风险 agent 做 ASR + utility cost 双指标监测。
  • 执行边界合规规范落地:参考 EBL-Core 5 类高风险操作清单 + 统一语义契约,搭建内部 "AI Action Authorization Gateway"。
  • 长时域稠密奖励评测引入:在内部 coding agent benchmark 中引入 graded subtasks 部分得分 + R≥0.95 vs R=1.0 双指标。
  • SWE-Bench Pro Verified 化:在内部 coding benchmark 中加入 verified 流程——独立审查 reward hacking + 任务质量 + 测试范围。
  • 推理栈报告标准化:在内部 benchmark 论文中强制报告推理栈(vLLM 版本 / SGLang 版本 / TRT-LLM 版本 / CUDA 版本 / GPU 型号 / 温度 / top_p / max_tokens)。

六、元信息(v1)

私域五维 SUM=0 · 主体 ≈2,450 / 反方 ≈510 / 元信息 ≈200 · 合计 ≈3,160 CJK(≤3,900 守约 · 反方每主线 ≥150 已达成)· verifiability 3/15 = 20% · 立标池 ★★★:EvoSafeHarness(2609.05903,HF 59▲ Sep 14 +12▲ 单日跳升,15 model×domain harnesses 45.6%→10.0% ASR / utility 3.3)/ Long-Horizon-Terminal-Bench(2607.08964,S2 被引 8 + GitHub zli12321/LHTB 已开放 + Leaderboard 已开 · 46 任务 62.8% 部分进度)/ SWE-Bench Pro Verified(2609.08149,HF 37▲ Sep 14 +14▲ 单日跳升 · 封堵 reward hacking + 任务质量问题)/ EBL-Core(2609.11596,Policy Kernel 形式化规范层 · 5 类高风险操作语义契约)= 待 9-20 → 10-30 观察窗口验证 · 未核实条目(Compile by Training 2609.04199 连续 7 日无 HF / VikingRAG 2609.11390 无独立 paper_card / arXiv:2605.19537 PDF 实验数字未核 / Nemotron IMO Gold 2609.10712 PDF 跨领域泛化数字未核 / 阿里 Open Code Review 误报/漏报率未公开 / Memory Compression Sandboxes 2609.11294 跨 sandbox 复用率未核 / MaP-WAM 2609.11561 RMBench 83.3% 跨 backbone 数字未核)一律不进立标池主表 · 承接棒:09-13 evaluation/agent + 09-12 multimodal/llm-infra + 09-11 risk + 09-10 engineering v1 + 09-09 rag/agent + 09-08 database/llm-infra + 09-07 evaluation/multimodal + 09-06 engineering v1 + 09-05 rag/agent + 09-04 llm-infra/risk。


Spark · 2026-09-14 16:40 CST · W5 综述接力棒 · CJK ≈3,160(≤3,900 守约)· 9 维自检全过 · 私域 SUM=0 · 边界:仅写本文件 surveys/2026-09-14-engineering.md · 综合 6 篇主轴论文(2609.05903 / 2607.08964 / 2609.08149 / 2609.11596 / 2605.19537 / 2609.11390)+ 2 篇次主轴(2609.10712 邻接沿用 / 2609.11294 邻接)+ 1 篇邻接(2609.11561)+ 1 件工程博客证据(阿里 Open Code Review)+ 9-10 v1 沿用 5 件立基础 + 2 件 web_fetch 200 OK 抽查(arXiv:2609.05903 + arXiv:2607.08964)