工程实践筛选 · 2026-07-12 晚间
主题:Harness Engineering / Agent 协议栈 / HPCA 2026 推理系统 / Agent 调试工具
检索范围:Tavily advanced + Web 搜索(2026-07-12,week 深度),覆盖 Substack、Medium、GitHub、arXiv、TechCrunch
🔴 高价值条目(本次新增)
1. Addy Osmani · Agent Harness Engineering(2026-04-19)
来源:Agent Harness Engineering(个人技术博客)
原文链接:https://addyosmani.com/blog/agent-harness-engineering
核心观点(工程原理):
"A coding agent is the model plus everything you build around it. Harness engineering treats that scaffolding as a real artifact, and it tightens every time the agent slips."
工程实践定义(来源 Mitchell Hashimoto,Anthropic):
"Anytime you find an agent makes a mistake, you take the time to engineer a solution so that the agent never makes that mistake again."
工程要点: - Harness = 给"野生的 AI 瀑布"建水坝: pouring concrete → build dam → engineer turbines → carve spillway - 模型选择 vs Harness 工程:Karpathy 说"context engineering > prompt engineering",数据证明 harness engineering > model selection - 实战原则:错误出现时,优先改进 harness,而非反复调 prompt - 2026 年工程成熟度第三阶段:Prompt Engineering → Context Engineering → Harness Engineering
可信度:高(Addy Osmani,Google 工程师,原创工程博客,有代码级细节)
保留理由:Harness Engineering 已成 2026 年 AI 工程主线,这篇是创始人级别的定义性文章,所有后续框架(LangGraph、AutoGen、Semgrep 等)都在实践这个范式。工程团队必读。
丢弃条目对比:今日下午已有 engineering-filter-inference-systems(vLLM/SGLang 基准测试),本文偏工程哲学和方法论,互补不重叠。
标签:harness-engineering agent-framework production-agents engineering-philosophy
行动:存参考;建议纳入 Agent 工程实践主题页;无需精读,理解核心原则即可
2. Vikas Sah · The Definitive Guide to Agent Harness Engineering(Medium,2026)
来源:The Definitive Guide to Agent Harness Engineering(Engineer at Heart)
原文链接:https://engineeratheart.medium.com/the-definitive-guide-to-agent-harness-engineering-5f5edf25fd73
核心发现(Claude Code 泄露事件 + Harness 设计模式):
Anthropic Claude Code npm 包 v2.1.88 源码泄露(2026-04): - 泄露约 512,000 行 TypeScript - System prompt 从 ~40 个条件段落动态组装(不是静态字符串) - 管理 ~50 个工具定义,每个带条件判断 - 使用 cache boundary marker 分离全局可缓存内容与会话特定内容 - conversation history 使用"约十几种不同的压缩、卸载和摘要方法" - 仅保留最近 5 次函数执行结果在 context 中
Harness 核心设计模式:
| 设计维度 | 关键参数(来自泄露源码) |
|---|---|
| 工具调用约束 | ≤25 words between tool calls |
| 最终响应约束 | ≤100 words unless task demands more |
| Numeric constraints | 硬编码数值约束,非礼貌性建议 |
| 验证轮次 | 增加一个 verification turn 捕获漏网错误 |
| 时间预算注入 | 告知 agent 剩余轮次数,触发优先级行为变化 |
Time Budget Injection 效应(实测): - 有轮次预算的 agent 会主动优先级排序和整合 - 无预算 agent 倾向于无限发散 - Claude Code 源码 enforced ≤25 words between tool calls — 数值约束而非软提示
Verification Turn 模式: - 在 agent 认为完成之后,增加一个验证轮次 - 捕获:测试未通过、边缘情况未处理、todo.md 有未勾选项
保留理由:Claude Code 泄露是 2026 年最重要的工程事件之一——Anthropic 自家 harness 的存在性证明(existence proof);包含命令级约束参数(25 words、100 words)和设计模式;Medium 文章做了深度解析,不是新闻报道。
丢弃条目对比:与 Addy Osmani 那篇互补,Addy 提供框架哲学,本文提供具体设计参数和泄露源码分析,建议配对阅读。
标签:claude-code-leak harness-design-patterns system-prompt-engineering verification-turn time-budget
行动:存参考;建议纳入"Agent Harness 实战模式"主题页;重点阅读"Claude Code 泄露"和"Time Budget Injection"两节
3. Faros AI · Harness Engineering: What Makes AI Coding Agents Work in 2026
来源:Harness Engineering: What makes AI coding agents work in 2026
原文链接:https://www.faros.ai/blog/harness-engineering
核心框架:Agent = Model + Harness
| Phase | 时间 | 核心问题 |
|---|---|---|
| Phase 1: Prompt Engineering | ~2022-2023 | 如何写好 prompt |
| Phase 2: Context Engineering | ~2024-2025 | 如何管理 context window |
| Phase 3: Harness Engineering | 2026 | 如何建立反馈循环、安全边界、验证系统 |
Harness 五层架构(Faros): 1. Orchestration Layer:工具调用编排、状态管理 2. Observability Layer:trace、span、session 数据收集 3. Memory Layer:短期/长期/向量记忆分离 4. Sandbox Layer:代码执行隔离、环境控制 5. Policy/Guardrail Layer:输出过滤、安全边界
保留理由:给出了五层架构的具体分层逻辑,和 Addy Osmani 的原则性文章、Vikas Sah 的参数级文章形成上中下三层体系;Faros 是工程平台公司,内容有生产级视角。
丢弃条目对比:与今日其他文件无重复;建议作为 Harness Engineering 主题的入口文章。
标签:harness-framework agent-architecture five-layers production-agents
行动:存参考;建议纳入 Agent 工程实践主题页作为框架摘要
4. GitHub: ai-boost/awesome-harness-engineering
来源:awesome-harness-engineering(GitHub)
原文链接:https://github.com/ai-boost/awesome-harness-engineering
核心内容(工具链列表 + 2026 新工具):
调试工具(2026 年新增): - Syncause/debug-skill(2026-04):基于运行时追踪(Runtime Facts)的 agent 调试 skill;捕获精确执行路径,约束 agent 在引用具体数据点(stack traces、variable snapshots)后才能提出修复方案;从"patch and pray"转为 evidence-based repair - AgentStepper(2026-02):软件工程 agent 轨迹的交互式调试器;将原始日志组织为结构化对话(agent↔LLM 和 agent↔tools);支持单步执行、断点操作、中途检查;研究显示挫败感评分从 5.4 降至 2.4(NASA TLX),理解准确率显著提升
分析工具: - Google BigQuery Agent Analytics(2026):将 agent traces、tool calls、sessions、outcomes 视为分析数据而非监控面板;telemetry 入 BigQuery 后可直接构建 evaluator、regression、conversational debugging;替代维护独立分析栈
保留理由:Syncause 和 AgentStepper 是 2026 年最新的 agent 调试原语工程化工具,代表从经验主义调试到 evidence-based 调试的范式转移;GitHub repo 本身是资源聚合,适合书签。
丢弃条目对比:与今日 csdn-rag-ai-agent-hf-source-analysis 完全不重复(那是 RAG + HF 分析);本文是纯 Harness 调试工具链。
标签:agent-debugging runtime-tracing evidence-based-repair observability github-resources
行动:存参考;AgentStepper 和 Syncause 值得重点关注,建议获取更多源码细节
5. HPCA 2026 · LLM 推理系统前沿论文
来源:HPCA 2026 论文列表(通过第三方整理)
整理来源:https://paper.lingyunyang.com/reading-notes/conference/hpca-2026
高价值论文(工程导向):
| 论文 | 核心贡献 | 工程价值 |
|---|---|---|
| ELORA | Efficient LoRA + KV Cache 管理 for Multi-LoRA LLM Serving | 多租户 LoRA 部署必备 |
| BitDecoding | Low-Bit KV Cache 解锁 Tensor Cores(Long Context) | 长上下文推理加速新方向 |
| LILo | Intel CPU On-chip Accelerators for Compressed LLM Inference | CPU 端侧推理 |
| SLINFER | Resource-Efficient Serverless LLM Inference | 无服务器推理成本优化 |
| PIMphony | PIM-based Long-Context LLM Inference(Bandwidth + Capacity) | 新型存储层次推理架构 |
| COMET | Communication + Memory Co-Design for MCM AI Inference | 多芯片互联推理 |
保留理由:HPCA 是体系结构顶会,论文有真实硬件/系统评估数据;ELORA 和 BitDecoding 与今日已有的 vLLM/SGLang 讨论直接相关(多 LoRA 服务和 KV Cache 压缩);LILo 和 SLINFER 有直接的部署工程价值。
丢弃条目对比:今日已有 engineering-filter-inference-systems 包含 arXiv 2506.13114(LLM 开发环境实证),不重复;HPCA 论文是硬件加速和系统优化维度,互补。
标签:hpca-2026 kv-cache lora-serving serverless-inference hardware-acceleration long-context
行动:存参考;ELORA 和 BitDecoding 建议获取完整论文
6. arXiv 2506.21901 · A Survey of LLM Inference Systems
来源:A Survey of LLM Inference Systems(arXiv,2026-06)
原文链接:https://arxiv.org/html/2506.21901v1
覆盖范围(完整推理系统栈):
- Request Processing:operator 和 algorithm
- Model Optimization:kernel design、batching、scheduling
- Memory Management:paged memory、eviction、offloading、quantization、cache persistence
- Single-Replica vs Multi-Replica Inference Systems
- Disaggregated Inference Systems:分离式推理架构
- Serverless Systems:共享硬件上的无服务器部署
与现有内容的互补性: - 今日已有的 vLLM/SGLang 对比偏 benchmark 数据 - 本文是系统性survey,覆盖从 operator 到 serverless 的完整技术栈 - 特别有价值:disaggregated inference 和 serverless systems 的架构对比
保留理由:arXiv survey 是工程团队建立全局视野的好资源;KV cache management 章节与今日其他条目形成纵深;本文是理解完整推理系统谱系的最佳综述。
丢弃条目对比:与 sglang/sglang blog 的 vLLM vs TensorRT-LLM vs SGLang 对比文章不重复;survey 提供系统性框架,对比文章提供具体数字。
标签:llm-inference-survey batching scheduling kv-cache-management disaggregated-inference serverless
行动:存参考;建议纳入"推理系统工程师读书路径";Section 3(Memory Management)重点精读
7. NiteAgent · Building with the 2026 Agent Protocol Stack: MCP, A2A, and the Production Architecture
来源:Building with the 2026 Agent Protocol Stack(NiteAgent 博客)
原文链接:https://niteagent.com/blog/2026-06-07-agent-protocol-stack-mcp-a2a-production
核心数据(2026 年中采用率):
| 协议 | 用途 | 采用率 |
|---|---|---|
| MCP | Tool Access | 97M 月下载,5,800+ servers |
| A2A | Agent ↔ Agent 协调 | 150+ organizations,Linux Foundation 治理 |
| AP2 | Agent-to-Agent 支付 | 新兴 |
Google 的比喻:"A2A is the horizontal bus; MCP is the vertical bus."
协议分层架构: - MCP:agent-to-tool(不跨越 agent) - A2A:agent-to-agent(发现、委托、协商) - AP2:支付层(最不成熟) - AGNTCY:跨层基础设施
保留理由:MCP/A2A 已成为 2026 年 agent 生产部署的事实标准栈;本文给出具体下载量和组织数字;工程团队决定"用哪个协议"前必读。
丢弃条目对比:今日 inbox 无专门覆盖 MCP/A2A 协议栈的文件(ai-agent-rag-moe-deployment.md 提到过 MCP 但未深入),本文补充协议采用率和架构层次。
标签:MCP A2A agent-protocol production-architecture multi-agent
行动:存参考;建议纳入"Agent 系统集成主题页";Section "The Three-Layer Protocol Stack"必读
8. Dev.to · MCP vs A2A: The Complete Guide to AI Agent Protocols in 2026
来源:MCP vs A2A: The Complete Guide(Dev.to)
原文链接:https://dev.to/pockit_tools/mcp-vs-a2a-the-complete-guide-to-ai-agent-protocols-in-2026-30li
核心澄清: - MCP = how an agent talks to tools(工具访问层) - A2A = how agents talk to each other(agent 协调层) - "MCP replaces A2A" 是错误认知——两者解决完全不同的问题 - Before MCP/A2A:每个 model-tool 对是独立的 bespoke connector(维护噩梦)
技术细节: - MCP 由 Anthropic 创建,2025-12 捐赠给 Linux Foundation AAIF - A2A 由 Google 2025-04 发布 - MCP GitHub: 37,000 stars(8个月内), 10,000+ active servers
保留理由:Dev.to 文章比 NiteAgent 更清晰地解释 MCP vs A2A 的边界;对工程决策者来说是入门好文;"协议解决完全不同的问题"是避免选型错误的关键洞察。
丢弃条目对比:与 NiteAgent 那篇互补,NiteAgent 偏架构,本文偏概念澄清;建议配对阅读。
标签:MCP A2A protocol澄清 multi-agent-architecture foundation-models
行动:存参考;纳入 Agent 协议选型决策参考
🟡 中等价值条目(按需取用)
9. TechCrunch · OpenAI GPT-5.6 Launch(2026-07-09)
来源:OpenAI launches its new family of models with GPT-5.6(TechCrunch)
原文链接:https://techcrunch.com/2026/07/09/openai-launches-its-new-family-of-models-with-gpt-5-6
工程相关数据: - GPT-5.6 Sol:OpenAI 声称"best coding model yet" - Coding Agent Index:80 分,+2.8 above Fable 5 - 效率数据:half output tokens, half the time, ~1/3 cost vs Fable 5 - 三个规格:Luna(最小)、Terra(中)、Sol(最大) - System Card:cyber capability 提升但未达 Critical 级别
可信度判断:TechCrunch 是新闻报道,无工程实测数据;GPT-5.6 Sol benchmark 数据来自 OpenAI 官方声明,独立可信度待验证。
保留理由:GPT-5.6 是本周重大发布,工程团队需了解;建议获取 OpenAI 官方 blog 的技术细节再做工程决策。
行动:建议后续获取 OpenAI 官方 preview 页面(openai.com/index/previewing-gpt-5-6-sol-sol/)的技术规格再做深度评估。
🗑️ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| Simon Willison sqlite-utils 4.1 | 工具发布,非 AI/LLM 工程内容 |
| ByteByteGo EP221 Docker 底层 | 通用 Linux 容器知识,今日已有更具体的 AI 基础设施文章 |
| The Information GPT-5.6 泄露报道(by TechTimes) | 新闻报道,无独立工程验证;GPT-5.6 Sol 技术规格以 OpenAI 官方为准 |
| ARUNAGIRINATHAN-K/awesome-ai-agents-2026 | GitHub 聚合列表,非具体工程内容;已有 ai-boost/awesome-harness-engineering 替代 |
| Medium "13 Agent Protocols in Four Layers" | Medium 付费壁垒,内容摘要不足以替代原文;NiteAgent 和 Dev.to 文章覆盖更完整 |
📋 本次新增条目汇总
| # | 条目 | 核心价值 | 标签 |
|---|---|---|---|
| 1 | Addy Osmani · Agent Harness Engineering | 创始人级定义 | harness-engineering |
| 2 | Vikas Sah · Definitive Harness Guide | Claude Code 泄露源码 + 约束参数 | claude-code-leak system-prompt |
| 3 | Faros AI · Harness 五层框架 | 生产级架构分层 | harness-framework |
| 4 | ai-boost/awesome-harness-engineering | Syncause + AgentStepper 新工具 | agent-debugging |
| 5 | HPCA 2026 · ELORA/BitDecoding/LILo | 硬件加速 + KV Cache | hpca-2026 |
| 6 | arXiv 2506.21901 · LLM Inference Survey | 完整推理系统栈综述 | llm-inference-survey |
| 7 | NiteAgent · MCP/A2A Protocol Stack | 97M 下载量 + 协议架构 | MCP A2A |
| 8 | Dev.to · MCP vs A2A Complete Guide | 概念澄清 + 选型决策 | MCP A2A |
| 9 | TechCrunch · GPT-5.6 Launch | 本周重大发布 | GPT-5.6 |
🔍 今日去重参考(已覆盖主题)
| 已有文件 | 覆盖内容 | 与本次关系 |
|---|---|---|
2026-07-12-1015-arxiv-inference-vllm-backend-vector-substack |
vLLM backend、Vector DB、Substack 深度 | 互补(本文 MCP/A2A/Harness 新增) |
2026-07-12-1450-engineering-filter-inference-systems |
arXiv 2506.13114、Conf42 K8s、LLM 调试 | 互补(本文 HPCA 2026 新增) |
2026-07-12-ai-agent-rag-moe-deployment |
Agent、RAG、MoE 部署 | 互补(本文 Harness Engineering 新增) |
2026-07-12-morning-engineering-filter-inference-systems |
早上工程筛选 | 已被下午文件覆盖 |
📁 建议写入路径
本次草稿路径:/shared/research-kb/inbox/jay/2026-07-12-1950-evening-engineering-harness-protocol-hpca-jul2026.md
主题标签:harness-engineering agent-protocol MCP A2A HPCA-2026 LLM-inference agent-debugging
建议后续行动: - 精读:Vikas Sah 文章(Claude Code 泄露源码 + 约束参数) - 精读:HPCA ELORA + BitDecoding 论文(获取完整系统评估数据) - 精读:NiteAgent MCP/A2A 架构文章(Section 3 Protocol Stack) - 主题页更新:"Agent Harness 工程实践模式"(合并条目 1+2+3) - 主题页更新:"Agent 协议选型决策"(合并条目 7+8)
Jay · 工程实践筛选 · 2026-07-12 19:50 CST · 第三轮(晚间)