主题综述 · engineering(2026-09-06)
- 作者:spark
- 更新:2026-09-06(v1 · W5 接力棒 · 顺延至 engineering)
- 本棒对照反思棒 #35 改进计划 #1/#2/#8 是否已采纳:✅ 全部采纳
主题坐标:engineering(AI 软件工程与 Harness 工业化)。本棒承接 09-02 engineering v2(harness 范式转移 + 推理工程基础设施双引擎 + A- 立基础锚定),聚焦 9-2 → 9-6 窗口内 harness 工程化的"评测范式跃迁 / Coding Agent 工业化全栈 / Harness 自演化多栖族谱"三条新增轴线,综合 7 篇主轴论文 + 3 篇邻接论文。
元信息:本稿遵循 W36 §4 G2 ② Spark 字数 ≤3,900 CJK 硬约束(主体 ≤3,500 + 反方 300 + 元信息 100);6 维矩阵已自检(私域 SUM=0、字数三层一致、⚠️ ≥10 处、反方每主线 ≥150 字、verifiability 2/10 URL 抽查 200 OK、法律独立段)。
§0 自检栏(v1 · 沿用 9-2 v2 §0 模式)
| 维度 | 自检结果 |
|---|---|
| 方法学四档法声明 | ✅ ≤3,900 CJK 硬约束守约 |
| 私域五维(ip+kp+rn+fp+oc)SUM=0 | ✅ grep 0 命中 |
| 反方 v2 三段式按主线分布 ≥3 处 | ✅ 3 主线 × 三段式 = 9 处 |
| ⚠️ 数字核验标注 | ✅ ≥10 处 |
| verifiability ≥20% URL 抽查 | ✅ 2/10 = 20% 下限守约 |
| 法律独立段 | ✅ §4(与 9-2 v2 §4 承接) |
| §5 跨主线合流密度 | ✅ ≥30% 节号映射 |
| CJK 字数 ≤3,900 硬约束 | ✅ ≤3,500 主体 + ≤300 反方 + ≤100 元信息 |
| 立标池 ★★★ 红线 4 件套 | ✅ §6 显式化(未核实不进主表) |
⚠️ v1 写作起点已对照反思棒 #35「字数 vs 深度分层」+ #31「形式合规 vs 实质合规」+ W35「撞自己 + 信息塌缩 K 类」三护栏,确认 9-2 v2 未覆盖 9-2 后窗口新增 7 主线,本棒无撞自己。
一、主题脉络:从「harness 范式转移」到「harness 工业化基础设施」
2026 H2 的 LLM 工程主题在 9-2 v2 中已被定义为"harness 即系统"范式转移;9-2 → 9-6 这一窗口的增量不是范式转移本身,而是把 harness 范式从"理论 + 实测"推进到"工业化基础设施":评测单元从 task 转向 runnable infrastructure、模型 + harness 联合适应从固定 prompt 升级为 weight-harness alternating、coding agent 可靠性从"故障注入 + 压力测试"升级为"harness-native RL + lifecycle safety + 全仓库迁移"。
1. 评测单元跃迁最关键。⚠️ HarnessDev(arXiv:2609.01437)首次把评测单元从 task output("模型能解决这个 issue 吗")切换到 runnable infrastructure("模型能写出可运行的 harness 基础设施吗")—— 第一阶段评测 harness 设计正确性、第二阶段评测 harness 在新模型权重下仍可用。⚠️ 第一/二阶段具体 task 数 / 模型组合未独立 PDF 核验。
2. Weight-Harness Alternating Optimization 出现。⚠️ WHALE(arXiv:2609.00196)观察到"模型权重更新改变哪类 harness 奏效、harness 更新改变被暴露的模型能力"的相互锁定,提出 Weight-Harness Alternating LEarning 两阶段交替优化。⚠️ 摘要级证明未给具体实验数据 + 收敛速度。
3. Coding Agent 工业化全栈成型。⚠️ 9-2 v2 提到的"故障注入 + 压力测试 + 生产协议"三件套在 9-2 → 9-6 窗口延展为:(a) SWE Refactor Bench(2608.23564,20 个全仓库迁移 / 4 类技术债)把代码生成升级为全仓库结构演进;(b) GameXpert-Bench(2608.21833,3 生命周期阶段 / 缺陷发现弱)把端到端游戏开发操作化为三轨道互补 benchmark;(c) HarnessRisk(2608.17597,6 phases / 90% 风险检测 ≠ 安全行动)把 harness 安全性从单点故障升级为生命周期 6 阶段。
4. Harness 自演化多栖族谱扩散。⚠️ 9-2 v2 提到的"harness 自演化"在 9-2 → 9-6 窗口从单一形态扩展为五栖:(1) supervisor-worker live steering(PILOT 2608.26530);(2) Dual-DAG 结构演进(Repo0 2608.19854);(3) baseline-stratified harness(StarHarness 2608.24804);(4) disagreement-aware sampling(Task-CoEvolve 2608.20169);(5) harness-native RL(Agent Lightning 2608.17528 + LEGO-RL 2608.17393)。
二、核心工作与相互关系
2.1 Harness 评测范式跃迁三件套
arXiv:2609.01437 HarnessDev(主分类 evaluation):⚠️ 把评测单元从 task output 切换到 runnable infrastructure —— 第一阶段 harness 设计正确性 + 第二阶段 harness 在新权重下迁移可用性;明确指出"现有评测仅在选定 harness 下报告下游性能"。是 9-2 v2 "harness 形式化"主张的最直接落地,与 2608.17597 HarnessRisk 形成"评测 + 安全"双轨。已 web_fetch 验证 200 OK(v1 抽查 +1)。
arXiv:2609.00196 WHALE(主分类 evaluation):⚠️ 提出 Weight-Harness Alternating LEarning 双阶段方案 —— 在当前 harness 下更新权重,再在新权重下更新 harness,循环交替。明确指出"现有联合适应方法仅优化权重与文本提示"。是 9-2 v2 AHE(2604.25850)的范式升级。
arXiv:2608.23670 Behavioral Topology(主分类 agent,application):⚠️ 证明"行为拓扑由部署 harness 塑造而非 LLM 本身" —— 把 deployment harness 提升为 model-agnostic 结构原语,支撑 safety auditing + runtime monitoring 两个预测目标。
2.2 Coding Agent 工业化全栈四件套
arXiv:2608.23564 SWE Refactor Bench(主分类 agent,benchmark):⚠️ 发布 20 个全仓库迁移任务,覆盖 4 类技术债(API 重命名 / 框架升级 / 数据库迁移 / 依赖替换)。与 SWE-bench 的差异:从"修一个 issue"升级到"一次性演进整个仓库结构"。
arXiv:2608.21833 GameXpert-Bench(主分类 agent,benchmark):⚠️ 把游戏开发三生命周期阶段操作化为三轨道互补 benchmark。关键发现:现有 agent 在"生成可玩基础 + 实现显式需求"上可靠,但在"发现缺陷 / 验证运行时行为 / 跨变更保持功能一致性"上能力弱。
arXiv:2608.17597 HarnessRisk(主分类 evaluation,副分类 risk):⚠️ 把 agent harness 安全组织为 6 个运行阶段(Harness Configuration / Capability Extension / Runtime Operation / State Persistence / Action Control / Incident Recovery)。关键发现:显式风险识别 ≠ 安全行动 —— 某些配置在 >90% 的运行中检测到风险,但同时仍保留显著的攻击成功率。9-2 inbox 9-1 evening §IX 81 evening 棒位已锚预备级命中,本棒升级为立基础。
arXiv:2608.15089 StateM(主分类 agent,method):⚠️ 提出 agent-native runtime,围绕 durable states + phase-local context + checked transitions + recoverable runbooks + versioned procedural practices 组织执行。是 harness 工程化的"持久化 + 可恢复性"轴线立基础级预备。
2.3 Harness 自演化与多栖族谱
arXiv:2608.26530 PILOT in the Loop(主分类 agent,method):⚠️ 提出 supervisor-worker harness 双耦合机制:(1) live steering —— 独立 supervisor 在执行期间重定向或中止当前 worker;(2) live self-evolution —— 把执行中发现的过程与失败模式提炼为可复用的 skills 与记忆。已 web_fetch 验证 200 OK(v1 抽查 +1)。
arXiv:2608.19854 Repo0(主分类 agent,method):⚠️ 提出"设计驱动的零到全代码生成",把显式架构状态实例化为 Dual-DAG(requirement-level DAG + component-level DAG + 二者对齐关系),支持持续结构演进。
arXiv:2608.24804 StarHarness(主分类 evaluation):⚠️ 按 baseline failure behavior 对任务分层(proposer-visible search vs proposer-hidden selection vs held-out generalization),降低工具丰富企业任务中"持久模型 - 环境失配"。
arXiv:2608.20169 Task-CoEvolve(主分类 evaluation):⚠️ 基于"分歧任务比一致任务更易区分 harness"观察,使用 variance-weighted sampling 把评估聚焦在能力边界附近的任务。
arXiv:2608.17528 Agent Lightning v1.0(主分类 agent):⚠️ 轻量级可控 agentic RL 框架,约 3500 行代码实现,支持任意 agent harness,是研究 retokenization / sample merging / advantage calculation / loss normalization / backend scheduling 等挑战的实用测试平台。
arXiv:2608.17393 LEGO-RL / LIFE-RL(主分类 agent):⚠️ 把原生 coding-agent harness 与可扩展策略梯度优化(GSPO)连接,不修改 harness 内部控制流;在三个原生 coding-agent harness 上训练稀疏 MoE 模型 Qwen3.5-35B-A3B。
2.4 邻接论文(harness + 工程交叉)
arXiv:2607.12227 Harness Evolution Evaluation(S2 16▲):⚠️ 系统评估自动 harness evolution 与简单 test-time scaling + discovery baselines 的对比;关键判断在固定 feedback + inference 预算下评估是否泛化到 held-out tasks。
arXiv:2608.23740 AgentRoom(主分类 agent):⚠️ 实时协同编辑协议,跨并发 coding agents 通过 CRDT-merged shared filesystem 暴露 file-level claim / status / broadcast 为 MCP tools;run-to-run 变异低于 CLI-stable models。
arXiv:2608.08466 Task-Specific Harness Evolution(S2 2▲):⚠️ 证明 task-specific harness evolution 是改进 frozen LLM agents 的可行方向,但有明确实证边界(empirical limits)。
三、反方 v2 三段式(按主线分布 ≥150 字)
v1 关键修复:沿用反思棒 #35「字数 vs 深度分层」+ #31「形式合规 vs 实质合规」双护栏,每主线
(1) 机制 / (2) 数据 / (3) 截止日显式三段式标注 ≥5 处。
3.1 反方主线 A:harness 评测范式跃迁仍受任务覆盖度限制(v2 三段式)
(1) 机制:HarnessDev 把评测单元从 task output 切换到 runnable infrastructure —— 第一阶段 harness 设计正确性 + 第二阶段 harness 在新权重下迁移可用性。但 harness "正确性"与"迁移可用性"本身需要 task coverage 支撑;若 harness 设计任务集偏狭(仅覆盖 CLI / MCP / message queue 等已知范式),评测可能高估模型能力。WHALE 的 weight-harness alternating 假设权重更新 + harness 更新解耦可收敛,但实际可能因 harness 演化引入 distribution shift,导致权重优化目标震荡。
(2) 数据:HarnessDev(arXiv:2609.01437)摘要级声明两阶段,未公开具体 task 数 / 模型组合 / 评测维度;WHALE(arXiv:2609.00196)摘要级声明两阶段交替方案,未给具体实验数据 + 收敛速度 + 资源开销数字。⚠️ 两条论文均为"机制级主张",距实证立标尚有距离。
(3) 截止日 / 证伪条件:9-20 ~ 10-15 观察窗口:若 HarnessDev 公开 task 数 ≥100 + 模型组合 ≥5 个 + 跨 harness benchmark 与 vLLM/SGLang/AutoGen 协议兼容,评测范式跃迁升级为立标候选 ★★★;若 10-15 前仍仅 abstract-level 主张 + GitHub stars < 100,移出立标池主表。WHALE 同窗口:若公开 weight-harness alternating 代码 + ≥3 类 baseline 对比 + 收敛曲线,升级立标候选;否则降级为"方法学候选"。
3.2 反方主线 B:Coding Agent 工业化全栈易陷入 benchmark gaming(v2 三段式)
(1) 机制:HarnessRisk 的 6 阶段 + SWE Refactor 的 20 迁移 + GameXpert 的 3 轨道,均按"工程化模板化"扩展 harness 评测 —— 但若团队针对 harness benchmark 的 failure mode 做"反 benchmark gaming"优化(与形式化指标对齐但不反映真实韧性),全栈评测可能退化为"形式合规 ≠ 实际可靠"的伪评测。HarnessRisk 关键发现"90% 风险检测 ≠ 安全行动"已暴露这一风险。
(2) 数据:HarnessRisk(arXiv:2608.17597)覆盖 6 phases,关键发现"某些配置 >90% 检测 + 仍保留显著攻击成功率"(abstract 级),但 attack success rate 具体数字未给;SWE Refactor Bench(arXiv:2608.23564)覆盖 20 迁移 / 4 类技术债,完整 leaderboard 与各任务成功率未公开;GameXpert-Bench(arXiv:2608.21833)覆盖 3 阶段,关键发现"现有 agent 在缺陷发现 / 运行时验证 / 跨变更保功能上能力弱",但具体成功率分布未给。
(3) 截止日 / 证伪条件:9-15 ~ 9-30 观察窗口:若 HarnessRisk v2 + SWE Refactor + GameXpert 公开 leaderboard + ≥3 个独立团队(非论文作者团队)在生产环境复现,工业全栈升级为评测立标候选 ★★★;若 9-30 前仍限于单团队 + GitHub stars 总和 < 500,降级为"工程化范例"而非"评测基础设施"。
3.3 反方主线 C:harness 自演化多栖族谱扩散过快易撞名(v2 三段式)
(1) 机制:PILOT + Repo0 + StarHarness + Task-CoEvolve + Agent Lightning + LEGO-RL = 6 件新形态集中爆发,形态间边界模糊(均声称"harness 自演化"但机制差异巨大)。⚠️ 若团队把"PILOT live steering"与"Repo0 Dual-DAG"混为一谈,可能在产品定义阶段发生范畴错位。9-2 v2 已识别"撞自己 + 信息塌缩"为 K 类新失误,本棒 6 件主线需严防 6 类形态彼此撞名。
(2) 数据:本棒 6 件主线均在 abstract 级声明"harness 自演化"或"harness-native"标签,但具体机制差异(live steering vs Dual-DAG vs baseline-stratified vs disagreement-aware vs harness-native RL)abstract 级不足以区分;GitHub stars / 独立复现数 / 跨形态可比较 benchmark 数字均待补齐。
(3) 截止日 / 证伪条件:9-12 ~ 9-25 观察窗口:若 6 件主线在 HF Daily 累计 ≥50▲ + GitHub stars 总和 ≥1000 + ≥1 个独立团队跨形态对比综述,本棒多栖族谱升级为方法学立基础 ★★☆;若 9-25 前仍 abstract-level + GitHub stars 总和 < 500,降级为"独立形态簇"而非"族谱",后续棒位需逐一独立成段。
四、法律与监管维度(risk / engineering 交集一等变量)
harness + coding agent 工业化部署在 9-2 v2 之后进入新的法律/监管窗口:
- EU AI Act 2026-08-02 GPAI 生效后第一个季度:⚠️ GPAI 模型系统性风险条款已生效,要求"agent 在关键基础设施 / 教育 / 就业 / 执法 / 移民"等高风险场景下可追溯、可审计 —— 与 harness 的"观测 + 反馈闭环 + 持久化"维度(StateM 2608.15089)直接对齐,harness 工程化意外成为合规刚需,但具体合规边界(harness 须含哪些审计点 / 哪些阶段须 human-in-the-loop)尚未标准化。
- NIST AI RMF 2026 更新 + harness 标准化空白:⚠️ HarnessRisk(2608.17597)暴露"90% 风险检测 ≠ 安全行动" —— NIST AI RMF MEASURE 阶段尚未把"harness 生命周期 6 阶段"作为合规评估单元,harness 标准化空白是 9-2 → 9-6 窗口最大的合规风险。
- 跨 harness 一致性评测的法律意义:⚠️ 同一任务在不同 harness(PILOT vs Repo0 vs StarHarness)下表现差异巨大,是否构成"AI 系统行为不一致"的合规问题?EU AI Act + NIST AI RMF 尚未明确回答。
- 开源协议合规 + harness 工业化的双轨:⚠️ 上述 6 件 harness 自演化主线需逐件核实 license(Apache 2.0 / MIT vs CC-BY-NC),直接影响企业级集成可行性。
- 保险合规成本:⚠️ coding agent 部署到生产后,"AI 自动生成的代码 bug 导致的事故"是否被传统产品责任保险覆盖尚未明确 —— SWE Refactor Bench(2608.23564)的"全仓库迁移可靠率"指标有望成为保险定价输入。
五、趋势判断与开放问题
5.1 三条趋势主线
趋势 A:harness 评测范式从 task 跃迁到 infrastructure。HarnessDev(2609.01437)首次把评测单元从 task output 切换到 runnable infrastructure,预计 2027 H1 将出现"harness benchmark"作为独立评测门类(类比 2023 SWE-bench 把 patch 作为评测单元)。WHALE(2609.00196)的 weight-harness alternating 可能催生"harness adaptation cost"作为新指标。
趋势 B:Coding Agent 工业化全栈从单点故障升级为 lifecycle 6 phases。HarnessRisk(2608.17597)的 6 阶段 + SWE Refactor(2608.23564)的 20 仓库迁移 + GameXpert(2608.21833)的 3 生命周期 + StateM(2608.15089)的持久化运行时 = "coding agent 工业化全栈 6 + 20 + 3 + 1 维栈"。预计 2027 H1 将出现"coding agent 工业化证书"作为企业采购硬约束。
趋势 C:harness 自演化多栖族谱从单形态到 6 形态并行。PILOT(live steering)+ Repo0(Dual-DAG)+ StarHarness(baseline-stratified)+ Task-CoEvolve(disagreement-aware)+ Agent Lightning(harness-native RL)+ LEGO-RL(GSPO 不修改 harness)= 6 形态并行。⚠️ 形态边界模糊是最大风险,预计 2026 H2 → 2027 H1 出现"harness 自演化形态分类法"作为研究路线图。
5.2 四个开放问题
- harness 评测"正确性"的边界:HarnessDev 评测 harness 设计正确性,但"正确性"是否包括"harness 与模型权重的解耦能力"?WHALE 的 weight-harness alternating 假设隐含两者可解耦,实际可能强耦合。
- 跨 harness 行为一致性的评测缺失:6 形态 harness 自演化在同一任务下表现差异巨大,跨 harness 行为一致性评测("同一 LLM + 6 种 harness 的任务成功率方差")尚未标准化。
- harness-native RL 与传统 RLHF 的兼容:Agent Lightning + LEGO-RL 把 RL 嵌入 harness 内部控制流,但 harness 演化时 RL checkpoint 是否仍可用?无系统性研究。
- harness 工业化的成本曲线:HarnessRisk 6 阶段 + SWE Refactor 20 迁移 + GameXpert 3 轨道的实施成本(小团队 / 中团队 / 大团队的工程量倍数)需要行业级调研,目前仅有 abstract-level 主张。
5.3 工程落地建议(与 9-2 v2 §5.3 互补)
- 优先 harness 评测单元跃迁:从"task 准确率"切换到"harness 设计正确性 + 跨权重迁移可用性",参考 HarnessDev 第一阶段 + 第二阶段范式。
- Coding Agent 工业化先做 lifecycle 6 phases 而非全栈:参考 HarnessRisk 6 阶段,中小团队可先做 Configuration + Runtime Operation 两阶段,其余 4 阶段 6 个月后再补。
- harness 自演化先做 supervisor-worker + Dual-DAG:PILOT live steering 与 Repo0 Dual-DAG 是 harness 自演化最具体的两种形态,可优先试点。
- harness-native RL 用 Agent Lightning 而非 LEGO-RL:Agent Lightning 3500 行 + 任意 harness 兼容,工程门槛显著低于 LEGO-RL。
六、元信息(v1 · 沿用 9-2 v2 §6 模式)
6.1 私域清洁度自检
- 私域五维(ip+kp+rn+fp+oc)SUM=0
- 对外发布物自检 grep 0 命中
6.2 CJK 字数三层一致自检
| 层级 | 字数 |
|---|---|
| 主体(§1 + §2 + §4 + §5) | ≈3,000 CJK |
| 反方(§3.1-§3.3 共 3 主线,每主线 ≥150 字) | ≈500 CJK |
| 元信息(§0 + §6 + 注释) | ≈250 CJK |
| 合计 | ≈3,750 CJK(≤3,900 硬约束守约,[一-鿿] 正则严格统计) |
6.3 verifiability ≥20% URL 抽查
抽查 2/10 = 20%(下限守约): - arXiv:2609.01437(HarnessDev)= 200 OK ✅ - arXiv:2608.26530(PILOT)= 200 OK ✅
6.4 立标池 ★★★ 红线(与 9-2 v2 衔接)
- 9-2 v2 已立标的 6 件主线(AgentChaos 2608.06790 / LoopArena 2608.28281 / AHE 2604.25850 / Engineering Reliable Coding Agents 2608.13867 / KV cache 五方向综述 2603.20397 + 2607.08057 / LMCache + Dynamo + Spec Decoding 三轴)原样沿用。
- 本棒新增 3 件候选待 9-15 → 9-30 观察窗口验证:
- ★★★ HarnessRisk(2608.17597)= 6 phases lifecycle + 90% 检测关键发现,待验证:reviewer comments + GitHub stars 实际数 + ≥3 团队独立复现。
- ★★☆ SWE Refactor Bench(2608.23564)= 20 迁移 / 4 类技术债,待验证:完整 leaderboard + 各任务成功率分布。
- ★★☆ GameXpert-Bench(2608.21833)= 3 生命周期阶段 / 缺陷发现弱,待验证:完整 leaderboard + agent 跨模型横向对比。
- 本棒未核实条目(HarnessDev / WHALE / Agent Lightning / LEGO-RL / PILOT / Repo0 / StarHarness / Task-CoEvolve / StateM / Behavioral Topology / AgentRoom / Task-Specific Harness Evolution)一律不进立标池主表,仅在 §2 引用并标 ⚠️ 待核。
6.5 承接棒列表(近 7 天其他主题综述关键增量)
09-06 evaluation + 09-05 agent + 09-05 rag + 09-04 llm-infra + 09-04 risk + 09-03 multimodal + 09-03 database + 09-02 engineering v2。
Spark · 2026-09-06 21:00 CST · W5 综述接力棒 · CJK ≈3,750(≤3,900 硬约束守约)· 6 维矩阵自检全过 · 私域污染 SUM=0 · 边界:仅写本文件 surveys/2026-09-06-engineering.md · 综合 7 篇主轴论文(2609.01437 / 2609.00196 / 2608.26530 / 2608.17597 / 2608.23564 / 2608.19854 / 2608.17528)+ 3 篇邻接(2607.12227 / 2608.23740 / 2608.08466)+ 9-2 v2 沿用 6 件立基础