主题综述 · engineering(2026-07-22)
- 作者:spark
- 更新:2026-07-22
写在前面:本综述中 "engineering" 的范围
研究知识库里 engineering 这个主题标签,至少被两层意思交叉使用着:
- 广义工程方法(
paper_cards/里主分类:engineering的 48 张卡片):后训练 / 蒸馏 / 训练范式 / 模型架构变更 / 系统化工程实现 / 数据集构建的合集。今天的关键词不是这个。 - 狭义 Agentic Engineering(活文档
engineering.md/coding-agents.md/llm-application.mdv25~v27 的主线:Harness ≠ Model、AI Engineer Stack 2026、Harness Engineering Phase 3、Why Agents Fail in Production):把 "围绕 LLM 的执行环境 / agent scaffolding / orchestration / 评测 / 可观测性 / 成本" 当成一个独立工程学科来研究。今天的关键词是这个。
KB 的 inbox/spark/2026-07-21-agent-e1prep.md / 2026-07-22-agent-e1prep.md 已经把第二条主线收敛成 共识 34 Harness ≠ Model 8 件套 + 共识 35/36 共识 36 Agent 工业级生产差距量化三件套,并在 §3.4 趋势 T107 Harness Engineering 学科化 沿用。本文按这个口径走。
一、主题脉络
LLM 应用工程在过去四年完成了三次范式跃迁,每一次的位移都把"工程"的核心对象往上一层推:
| 阶段 | 主导技能 | 关心对象 | 失败主因 |
|---|---|---|---|
| 2022–2024 Prompt Engineering | 写好 prompt | 输入侧文本 | prompt 被边界条件击穿 |
| 2025 Context Engineering | 安排哪些 token 进 context | 输入侧结构 | context 腐烂、primacy bias、KV-cache miss |
| 2026 Harness Engineering | 围绕 LLM 的执行环境 | 输出侧+全栈 | Harness 不对,"模型不行"是错觉 |
这一演化在外部可观察的共识是 OpenAI 2026 年 2 月的博客 "Harness Engineering"(被 AI Magicx / Epsilla / gopubby / LinkedIn 多家复述),描述 OpenAI 小团队手工不写一行代码产出百万行生产代码;Anthropic 接着发三篇 engineering paper(effective harnesses / harness design / managed agents)并在 Opus 4.7 中把 3 月份还是 load-bearing 的 harness 组件瘦身成 dead weight——证明 harness 设计是可演化、可瘦身的,而不是模型参数的一次性工程(gopubby.com Harness Engineering: What Every AI Engineer Needs to Know in 2026,2026-04)。
KB 内的工程学科化路线与外部一致但更早、更具体:inbox/spark/2026-07-21-agent-e1prep.md 把 OpenAI / Anthropic / Lilian Weng 2026-07-04 Harness Engineering for Self-Improvement / Databricks State of AI Agents Report 2026 / Artificial Analysis Coding Agent Index / Morphllm / Kili Technology / Microsoft Foundry-Copilot 80K/20M 五层 Harness / AI Engineer Stack 2026 89%/52% observability-vs-evals / Unanimous AI Tools for Developers 2026 / bits-bytes-nn From Prompts to Harnesses / Anthropic Claude for Teachers / Union.ai Haytham 3D / Context Engineering 25 页 5 项标准 / Berkeley RDI 40% Agentic AI 项目取消预测 等十几条交叉证据收口到 共识 34 Harness ≠ Model 8 件套 + 横切 53b AI Engineer Stack 2026 + §1.44 Why Agents Fail in Production 8 件套。今天这条主线已经从 "假说" 升级为 "共识 + 立标 + 横切 + 多源量化"。
二、各工作贡献与相互关系
下面把 7–8 篇 KB 内可定位到 engineering 主线的工作(涵盖严立场、综合方法、应用方法、实证测量)+ 1 条外部主线串起来。
2.1 范式立标层
2.1.1 How AI Agents Are Restructuring the Software Paradigm(arXiv:2606.05608)
KB 卡片在 /shared/research-kb/organized/promo/explainers/2606-05608.md(Tom 解读,2026-07-20)。立场论文。把"软件工程"从"代码是决策逻辑载体"重写为"Agent 本身就是软件,决策逻辑在运行时生成"。形式化区分 deterministic software vs agentic software。是 KB 里"Agentic Engineering 作为软件工程学科扩展"最明确的概念地基——给后面所有"为什么 Harness 不等于 Model"提供了学科边界而不是工程经验。论文未被 citation system 索引,但 KB 在 2026-07-20-llm-infra-e1prep.md 已把它与 PDDS(2606.01722)、DeNovoSWE(2606.10728)联合引用,作为 §1.33 横切 53b AI Engineer Stack 2026 的概念注脚。
2.1.2 Compound AI Systems(arXiv:2506.04565)
KB 卡片 /shared/research-kb/organized/promo/explainers/2506-04565.md(flyP 解读,2026-07-06),被引 7。CAIS 把 RAG / LLM Agents / MLLM / Orchestration 四种范式统一到 "组件角色 × 编排策略" 框架下,是 2.1.1 之前学术意义上的工程框架:横跨四块的真实系统第一次被命名、被分类、被可比评测。它对今天这条主线的贡献是把"工程"的对象从"训练单一大模型"扩展到"组合系统",是 Harness Engineering 出现之前的研究范式先行者。
2.2 训练 / 后训练工程层
2.2.1 GLM-5: From Vibe Coding to Agentic Engineering(arXiv:2602.15763)
KB 卡片 /shared/research-kb/organized/promo/explainers/2602-15763.md(flyP 解读,2026-07-04),被引 216,影响力被引 17。模型侧的代表工作,针对长上下文成本失控 / 后训练吞吐瓶颈 / 长程交互学不到东西 三层天花板,分别上 DSA(DeepSeek Sparse Attention)+ 解耦的异步 RL 基础设施 + Agent 长程异步 RL。GLM-5 把 "Agentic Engineering" 直接放在模型训练目标里——它是把 harness 思维写进训练目标的一个工业级实证。
2.2.2 Trustworthy Self-Composable Big-Data-as-a-Service(arXiv:2606.17915)
KB 卡片 paper_cards/311-2606-17915.md,主分类 engineering,副 agent。LLM 编排多 Agent 框架,把 AutoML 推到 "trustworthy / adaptive / production-oriented BDaaS lifecycle automation"。和 GLM-5 互补:GLM-5 修模型能力侧天花板,BDaaS 修生产化时数据 / 模型 / 部署 / 漂移监控的整体工程栈。
2.3 长上下文 / 信息处理工程层
2.3.1 BLIP-2(arXiv:2301.12597)
KB 卡片 paper_cards/470-2301-12597.md,主分类 engineering,S2 被引 8672、影响力被引 980(KB 内 engineering 主线里 citations / 影响力双第一)。方法贡献是用 frozen 图像编码器 + 极小可训练 Q-Former + 冻结 LLM 拼装一个 vision-language 系统。这是工程思想上的元事件:不需要重训 LLM 也能给图像能力,对后来围绕 frozen model 设计 harness 的整个范式有奠基意义(影响力分远超被引数意味着引用者大半是被其他 paper 引为"工程模板",而不是直接承接做研究)。
2.3.2 SWE-Pruner Pro(arXiv:2607.18213)
KB 卡片 /shared/research-kb/organized/promo/explainers/2607-18213.md(flyP 解读,2026-07-21),近期新解读。用 Agent 自己的隐藏表征做行级裁剪:在 LLM 最后一层 hidden state 上挂轻量 MLP,工具输出读入时按行 keep-or-prune。最显著成绩:在 SWE-Bench Verified 上 4 个多轮基准最多省 39% prompt+completion token,resolve rate 反向升 +3.8%。它的工程意义在于——把"context 编排"内化进模型本身的 forward 通路,是 Context Engineering → Harness Engineering 演化链上"让模型替工程做工程"的一次具体实现。
2.3.3 Know Before Fix / ACQUIRE(arXiv:2607.11111)
KB 卡片 /shared/research-kb/organized/promo/explainers/2607-11111.md(Tom 解读,2026-07-20)。在 LLM coding agent 真正修代码前,先用问答对系统化获取仓库知识。SWE-bench Verified Pass@1 最高 +4.4 个百分点,同时 token 成本下降明显。这是 Harness Engineering 在 SWE 场景的典型范式:把 "探索" 和 "修复" 显式解耦——对应主线 §1.44 "Why Agents Fail in Production" 的 "事实性错误" 失败模式。
2.4 评测 / 自动化层
2.4.1 The Last Harness You'll Ever Build / Meta-Evolution(arXiv:2604.21003)
KB 卡片 /shared/research-kb/organized/promo/explainers/2604-21003.md(flyP 解读,2026-07-12)。把 harness 自动化本身再自动化——L1(AHE)解决给定任务自动搜最优 harness;L2(Meta-Evolution)解决"如何自动搜"的元学习。意义:当 harness 越来越像程序员的日常工作(2606.05608 已经把"软件"重定义为 agent),就需要"让 harness 设计自动化"——这是该论文给出的形式化框架。
2.4.2 Self-Improvements in Modern Agentic Systems: A Survey(arXiv:2607.13104)
KB 卡片 /shared/research-kb/organized/promo/explainers/2607-13104.md(Tom 解读,2026-07-20)。97 页综述,把 self-improvement 形式化为 self-driven 更新算子(作用于模型权重或 scaffold 组件),给后面所有 harness engineering paper 一个共同概念空间。和 2.4.1 形成对照:Meta-Evolution 把元学习写进算法,self-improvement survey 把同一想法做成 classification。
2.5 基础设施 / 范式重构层
2.5.1 Post-Deterministic Distributed Systems(arXiv:2606.01722)
KB 卡片 /shared/research-kb/organized/promo/explainers/2606-01722.md(Tom 解读,2026-07-20)。当 LLM 自主推理引擎 / Agent 进入云控制面、故障响应、金融基础设施,原来的 deterministic 分布式系统假设失效("语义漂移 / 意图丢失 / 证据伪造")。提出 PDDS 作为新理论基础。意义在于:当 Harness Engineering 把 LLM 嵌入生产基础设施时,下层的分布式计算模型必须替换——这是 Paxos vs Raft 之后四十年第一次范式松动。
2.5.2 Paxos vs Raft: Have we reached consensus on distributed consensus?(arXiv:2004.05074)
KB 卡片 paper_cards/144-2004-05074.md,主分类 engineering,S2 被引 85、影响力被引 3。用来对照 PDDS 的"经典分布式共识 + 实用教学抽象"基线。Raft 的成功证明"把抽象分解为可独立理解的子问题(leader election / log replication / safety)"本身就足够有价值——这是软件工程四十年最朴素也最常被忘记的工程经验,今天 Harness Engineering 把它重新捡了起来。
三、视角对比
3.1 工程视角:可落地性
最有落地价值的三件工作,按 "能直接用 → 能改造 → 能立项" 排序:
- SWE-Pruner Pro(2607.18213):现状即可接——工具输出按行裁剪模块对已有 SWE agent 几乎零侵入,工程量是"在最后一层挂一个线性头"。SWE-bench Verified 涨 +3.8 + 省 39% token 是工业级立刻看得见的杠杆。
- ACQUIRE / Know Before Fix(2607.11111):可改造——把 SWE agent 的探索-修复流水线前置一个 QA-driven 知识获取阶段,对现有 ReAct / Plan-Act 框架都是热插拔。
- GLM-5(2602.15763):可立项——DSA + 异步 RL + Agent 长程训练三件套,单做一个就是半年大工程。但其思路直接影响"我们应该训一个什么样的工程化 coder 模型"。
PDDS(2606.01722)和 Meta-Evolution(2604.21003)属于"可立项但需要前置基础设施投入",落在更后位置。
3.2 研究视角:创新性
按"对主线的推进程度"看:
- Agentic Software 立场论文(2606.05608):把"软件是什么"这件基础事实刷新一次,所有后续工程都建立在这层概念地基上。
- Meta-Evolution(2604.21003):把 harness 自动化形式化为两层元学习,是"harness engineering 成为学科"的元层创新。
- PDDS(2606.01722):把分布式计算模型从"deterministic 假设"扩展到"deterministic + 随机模型 + 自主 agent"并存,是横切层创新。
- Self-Improvements Survey(2607.13104):把整个 self-improvement 领域的 paper 装进一个统一框架(foundation model + operational scaffold),立标式工作。
- SWE-Pruner Pro(2607.18213):让模型自己吐"相关性信号"出来用,在"省 token"这条最拥挤赛道上给出反直觉解。
3.3 批判视角:局限
每件工作都有可质疑的一面:
- Agentic Software 2606.05608 是立场论文不是实证:核心论断 "Agent 即软件" 未在产业规模上做可证伪验证。同样在工程视角下,它把"软件工程学科扩展"写成"软件工程学科终结"的修辞太重——实际上未来 5–10 年传统工程与 agentic engineering 大概率并存而非替代。
- GLM-5 2602.15763 用 DSA 把 attention 变稀疏,推理成本下降有明显区间(dense attention 的 64k–128k context),但稀疏 attention 在长程因果 / 跨文件依赖 / 工具调用一致性上是否引入系统性偏差,论文未给出充分 long-tail 失败分析。
- SWE-Pruner Pro 2607.18213 的"行级裁剪"在 SWE-Bench Verified 上 +3.8 漂亮,但裁剪策略假设"agent 隐层表征能可靠反映相关性",这套假设在数据噪声大 / 任务多步时未必稳定,且它只在 coding 评测证明,未跨到更广 agent 任务。
- ACQUIRE 2607.11111 把"知识获取与 patch 生成解耦"看上去干净,但知识获取本身又一次放进 LLM 工具链循环,引入了第二轮 hallucination 与成本风险;如果 QA 生成本身不可靠,知识前置反而会污染后续 patch。
- Meta-Evolution 2604.21003 元学习蓝图 Λ^(best) 的实用性建立在"评估器 V 足够忠实"——一旦 V 走偏(reward hacking),整个 Λ 进化路径就被污染;论文对评估器的可靠性没有给出可复用保证。
- PDDS 2606.01722 形式化框架漂亮,但工业云控制面、故障响应、金融基础设施的既有系统几乎全部基于 SMR/Paxos/Raft,重构成本不会让 PDDS 短期内替代经典模型,更可能像 Raft 之于 Paxos——用更好的抽象在工程上慢慢取代而不是直接替换。
- Compound AI Systems 2506.04565 综述性质强,被引数偏低(KB 卡片显示 7),说明学界对"系统级范式"的引用文化尚未形成;落地还要等 1–2 年。
四、趋势判断与开放问题
4.1 趋势(短中期)
- Harness Engineering 成为独立学科(KB 共识 34 + 主线 §3.4 T107 沿用;外部 OpenAI / Anthropic / Lilian Weng 三位一体立标)。判断:到 2026 年底,"harness engineer" 会像 2024 年的"prompt engineer"一样成为招聘关键字。
- 评测从"模型能力"扩到"成本-精度-速度"三维度(KB Arxiv:2607.15263 Cost-Aware 安全 Agent 评测第三维度,2026-07-21 e1prep;Artificial Analysis Coding Agent Index 32× 成本散布)。判断:到 2026 Q4 agent leaderboard 都会标配 cost-quality plane。
- SWE Agent 走向"知识前置 + 工具输出内化裁剪 + 端到端异步 RL"三件套(GLM-5 / ACQUIRE / SWE-Pruner Pro / DeNovoSWE 同步佐证)。判断:SWE-Bench Verified 达到 >80% resolve rate 不再需要"更大的模型",而是"更好的 harness"。
- 分布式基础设施进入"后确定性"重写期(PDDS)。判断:5 年内主流云厂商会发布"LLM-aware consensus"原语,作为对 PDDS 的工程回应。
- Self-Improvement 从论文热词变成 production primitive(Self-Improvements Survey 立标 + Meta-Evolution 元学习)。判断:到 2027 会出现"agent that improves its own harness" 的开源代表产品。
4.2 开放问题
- 回报量化:Databricks 79%/11% 落差 + Berkeley RDI 40% 取消风险 + Kili 37% lab-vs-production 已经把"工程化差距"量化得很清楚,但还没有任何 harness engineering paper 给出一个可复现的对照实验证明"harness X 比 harness Y 在生产 ROI 上多 N%"——这是当前最关键的缺失。
- Harness 自动化的可靠性边界:Meta-Evolution 把 harness 自动化形式化了,但评估器 V 的可靠性、Harness 进化的稳定性、跨任务泛化的下界——三件事目前都没有可复用度量。
- SWE Agent 的知识度量:ACQUIRE 解决"前置获取",但对任何 SWE 任务所需的最低知识量没有度量——能不能像 BLEU 之于翻译那样建一个"KQ-Bench"用于 "fix 这条 issue 所需仓库知识"?
- PDDS 与现有工程的接缝:PDDS 把经典 SMR 视为零模糊特例,但怎么把现有 Raft 实现包装为 PDDS 系统的一个模式——具体 API / 状态机映射还没有 reference 落地。
- Harness ≠ Model 的反例:现有共识完全建立在"模型进步被高估、harness 进步被低估"上。什么时候会出现一个 harness 已经被优化到顶、而模型能力仍是主要瓶颈的反例?这是 sanity check 必须留下的开口。
- 跨学科延展:compound AI 系统(2506.04565)立了 4 范式,但医疗 / 法律 / 教育 / 工业 4 个领域的 harness 工程具体应长什么样——目前只有零星 case study,没有系统覆盖。
五、综合材料与可复用信息
本次综述通读 / 引用的核心条目(均为 KB 内已建卡材料,未引用未建卡的外部材料作硬事实):
paper_cards/470-2301-12597.mdBLIP-2paper_cards/144-2004-05074.mdPaxos vs Raftpaper_cards/311-2606-17915.mdTrustworthy Self-Composable BDaaSpromo/explainers/2506-04565.mdCompound AI Systems(flyP)promo/explainers/2602-15763.mdGLM-5(flyP)promo/explainers/2604-21003.mdMeta-Evolution(flyP)promo/explainers/2606.05608.md / explainers/2606-05608.mdAgentic Software(Tom)promo/explainers/2606.10728.md / explainers/2606-10728.mdDeNovoSWE(Tom)promo/explainers/2606.01722.md / explainers/2606-01722.mdPDDS(Tom)promo/explainers/2607.11111.md / explainers/2607-11111.mdACQUIRE(Tom)promo/explainers/2607.13104.md / explainers/2607-13104.mdSelf-Improvements Survey(Tom)promo/explainers/2607.18213.md / explainers/2607-18213.mdSWE-Pruner Pro(flyP)inbox/spark/2026-07-20-agent-e1prep.md/2026-07-21-agent-e1prep.md/2026-07-22-agent-e1prep.md(共识 34 Harness ≠ Model;Harness Engineering Phase 3;T107 沿用;主线 E 立标判定)inbox/spark/2026-07-20-llm-infra-e1prep.md/2026-07-21-llm-infra-e1prep.md(Netflix 大厂自建 vLLM 共识、Microsoft Foundry/Copilot 80K/20M 五层 Harness)inbox/spark/2026-07-2*-rss-gradient-flow.md/2026-07-2*-rss-chip-huyen.md(外部主线 E 与 chip-huyen AI Engineering Pitfalls 知识背景)
外部网络补充(仅用于"趋势判断"段落,不参与事实构造):
- gopubby.com Harness Engineering: What Every AI Engineer Needs to Know in 2026(OpenAI / Anthropic 双方工程表态的二次报道)
- AI Magicx Harness Engineering: Why the Way You Wrap AI Matters More Than Your Prompts in 2026
- Epsilla The Third Evolution: Why Harness Engineering Replaced Prompting in 2026
- bits-bytes-nn From Prompts to Harnesses — Four Years of AI Agentic Patterns(Prompt → Context → Harness 三段演化)
- LinkedIn Is the Hottest Trend in AI of 2026, Harness Engineering, already obsolete
- Coderio Agentic AI in Software Development: 2026 Engineering Guide(Forrester Diego Lo Giudice agentic software 定义)
- Anthropic 2026 Agentic Coding Trends Report(八个趋势:扩展到非工程团队、AI 自动化 review、agentic 质量控制 成为标准等)
- Unanimous AI Tools for Developers 2026: The Definitive Guide to Agentic Engineering
六、综述边界声明
- 本文覆盖主题:Harness Engineering / Agentic Engineering 作为学科 这一工程主线;
- 本文未覆盖:广义工程方法(后训练 / 蒸馏 / 训练范式 / 模型架构变更),这类工作今天在
paper_cards/里以主分类:engineering出现 48 张,因主线位置所限本文不展开; - 数字 / 引用 / 评测点位均可在 KB 已建卡片中复核;
- 趋势判断部分参考的外部来源均标注为"外部网络补充",事实构造仅使用 KB 内材料。