工程实践筛选 · 2026-07-12 晚间

主题:Harness Engineering / Agent 协议栈 / HPCA 2026 推理系统 / Agent 调试工具
检索范围:Tavily advanced + Web 搜索(2026-07-12,week 深度),覆盖 Substack、Medium、GitHub、arXiv、TechCrunch


🔴 高价值条目(本次新增)

1. Addy Osmani · Agent Harness Engineering(2026-04-19)

来源Agent Harness Engineering(个人技术博客)
原文链接:https://addyosmani.com/blog/agent-harness-engineering

核心观点(工程原理)

"A coding agent is the model plus everything you build around it. Harness engineering treats that scaffolding as a real artifact, and it tightens every time the agent slips."

工程实践定义(来源 Mitchell Hashimoto,Anthropic):

"Anytime you find an agent makes a mistake, you take the time to engineer a solution so that the agent never makes that mistake again."

工程要点: - Harness = 给"野生的 AI 瀑布"建水坝: pouring concrete → build dam → engineer turbines → carve spillway - 模型选择 vs Harness 工程:Karpathy 说"context engineering > prompt engineering",数据证明 harness engineering > model selection - 实战原则:错误出现时,优先改进 harness,而非反复调 prompt - 2026 年工程成熟度第三阶段:Prompt Engineering → Context Engineering → Harness Engineering

可信度:高(Addy Osmani,Google 工程师,原创工程博客,有代码级细节)

保留理由:Harness Engineering 已成 2026 年 AI 工程主线,这篇是创始人级别的定义性文章,所有后续框架(LangGraph、AutoGen、Semgrep 等)都在实践这个范式。工程团队必读。

丢弃条目对比:今日下午已有 engineering-filter-inference-systems(vLLM/SGLang 基准测试),本文偏工程哲学和方法论,互补不重叠。

标签harness-engineering agent-framework production-agents engineering-philosophy
行动:存参考;建议纳入 Agent 工程实践主题页;无需精读,理解核心原则即可


2. Vikas Sah · The Definitive Guide to Agent Harness Engineering(Medium,2026)

来源The Definitive Guide to Agent Harness Engineering(Engineer at Heart)
原文链接:https://engineeratheart.medium.com/the-definitive-guide-to-agent-harness-engineering-5f5edf25fd73

核心发现(Claude Code 泄露事件 + Harness 设计模式)

Anthropic Claude Code npm 包 v2.1.88 源码泄露(2026-04): - 泄露约 512,000 行 TypeScript - System prompt 从 ~40 个条件段落动态组装(不是静态字符串) - 管理 ~50 个工具定义,每个带条件判断 - 使用 cache boundary marker 分离全局可缓存内容与会话特定内容 - conversation history 使用"约十几种不同的压缩、卸载和摘要方法" - 仅保留最近 5 次函数执行结果在 context 中

Harness 核心设计模式

设计维度 关键参数(来自泄露源码)
工具调用约束 ≤25 words between tool calls
最终响应约束 ≤100 words unless task demands more
Numeric constraints 硬编码数值约束,非礼貌性建议
验证轮次 增加一个 verification turn 捕获漏网错误
时间预算注入 告知 agent 剩余轮次数,触发优先级行为变化

Time Budget Injection 效应(实测): - 有轮次预算的 agent 会主动优先级排序和整合 - 无预算 agent 倾向于无限发散 - Claude Code 源码 enforced ≤25 words between tool calls — 数值约束而非软提示

Verification Turn 模式: - 在 agent 认为完成之后,增加一个验证轮次 - 捕获:测试未通过、边缘情况未处理、todo.md 有未勾选项

保留理由:Claude Code 泄露是 2026 年最重要的工程事件之一——Anthropic 自家 harness 的存在性证明(existence proof);包含命令级约束参数(25 words、100 words)和设计模式;Medium 文章做了深度解析,不是新闻报道。

丢弃条目对比:与 Addy Osmani 那篇互补,Addy 提供框架哲学,本文提供具体设计参数和泄露源码分析,建议配对阅读。

标签claude-code-leak harness-design-patterns system-prompt-engineering verification-turn time-budget
行动:存参考;建议纳入"Agent Harness 实战模式"主题页;重点阅读"Claude Code 泄露"和"Time Budget Injection"两节


3. Faros AI · Harness Engineering: What Makes AI Coding Agents Work in 2026

来源Harness Engineering: What makes AI coding agents work in 2026
原文链接:https://www.faros.ai/blog/harness-engineering

核心框架:Agent = Model + Harness

Phase 时间 核心问题
Phase 1: Prompt Engineering ~2022-2023 如何写好 prompt
Phase 2: Context Engineering ~2024-2025 如何管理 context window
Phase 3: Harness Engineering 2026 如何建立反馈循环、安全边界、验证系统

Harness 五层架构(Faros): 1. Orchestration Layer:工具调用编排、状态管理 2. Observability Layer:trace、span、session 数据收集 3. Memory Layer:短期/长期/向量记忆分离 4. Sandbox Layer:代码执行隔离、环境控制 5. Policy/Guardrail Layer:输出过滤、安全边界

保留理由:给出了五层架构的具体分层逻辑,和 Addy Osmani 的原则性文章、Vikas Sah 的参数级文章形成上中下三层体系;Faros 是工程平台公司,内容有生产级视角。

丢弃条目对比:与今日其他文件无重复;建议作为 Harness Engineering 主题的入口文章。

标签harness-framework agent-architecture five-layers production-agents
行动:存参考;建议纳入 Agent 工程实践主题页作为框架摘要


4. GitHub: ai-boost/awesome-harness-engineering

来源awesome-harness-engineering(GitHub)
原文链接:https://github.com/ai-boost/awesome-harness-engineering

核心内容(工具链列表 + 2026 新工具)

调试工具(2026 年新增): - Syncause/debug-skill(2026-04):基于运行时追踪(Runtime Facts)的 agent 调试 skill;捕获精确执行路径,约束 agent 在引用具体数据点(stack traces、variable snapshots)后才能提出修复方案;从"patch and pray"转为 evidence-based repair - AgentStepper(2026-02):软件工程 agent 轨迹的交互式调试器;将原始日志组织为结构化对话(agent↔LLM 和 agent↔tools);支持单步执行、断点操作、中途检查;研究显示挫败感评分从 5.4 降至 2.4(NASA TLX),理解准确率显著提升

分析工具: - Google BigQuery Agent Analytics(2026):将 agent traces、tool calls、sessions、outcomes 视为分析数据而非监控面板;telemetry 入 BigQuery 后可直接构建 evaluator、regression、conversational debugging;替代维护独立分析栈

保留理由:Syncause 和 AgentStepper 是 2026 年最新的 agent 调试原语工程化工具,代表从经验主义调试到 evidence-based 调试的范式转移;GitHub repo 本身是资源聚合,适合书签。

丢弃条目对比:与今日 csdn-rag-ai-agent-hf-source-analysis 完全不重复(那是 RAG + HF 分析);本文是纯 Harness 调试工具链。

标签agent-debugging runtime-tracing evidence-based-repair observability github-resources
行动:存参考;AgentStepper 和 Syncause 值得重点关注,建议获取更多源码细节


5. HPCA 2026 · LLM 推理系统前沿论文

来源:HPCA 2026 论文列表(通过第三方整理)
整理来源:https://paper.lingyunyang.com/reading-notes/conference/hpca-2026

高价值论文(工程导向)

论文 核心贡献 工程价值
ELORA Efficient LoRA + KV Cache 管理 for Multi-LoRA LLM Serving 多租户 LoRA 部署必备
BitDecoding Low-Bit KV Cache 解锁 Tensor Cores(Long Context) 长上下文推理加速新方向
LILo Intel CPU On-chip Accelerators for Compressed LLM Inference CPU 端侧推理
SLINFER Resource-Efficient Serverless LLM Inference 无服务器推理成本优化
PIMphony PIM-based Long-Context LLM Inference(Bandwidth + Capacity) 新型存储层次推理架构
COMET Communication + Memory Co-Design for MCM AI Inference 多芯片互联推理

保留理由:HPCA 是体系结构顶会,论文有真实硬件/系统评估数据;ELORA 和 BitDecoding 与今日已有的 vLLM/SGLang 讨论直接相关(多 LoRA 服务和 KV Cache 压缩);LILo 和 SLINFER 有直接的部署工程价值。

丢弃条目对比:今日已有 engineering-filter-inference-systems 包含 arXiv 2506.13114(LLM 开发环境实证),不重复;HPCA 论文是硬件加速和系统优化维度,互补。

标签hpca-2026 kv-cache lora-serving serverless-inference hardware-acceleration long-context
行动:存参考;ELORA 和 BitDecoding 建议获取完整论文


6. arXiv 2506.21901 · A Survey of LLM Inference Systems

来源A Survey of LLM Inference Systems(arXiv,2026-06)
原文链接:https://arxiv.org/html/2506.21901v1

覆盖范围(完整推理系统栈)

  • Request Processing:operator 和 algorithm
  • Model Optimization:kernel design、batching、scheduling
  • Memory Management:paged memory、eviction、offloading、quantization、cache persistence
  • Single-Replica vs Multi-Replica Inference Systems
  • Disaggregated Inference Systems:分离式推理架构
  • Serverless Systems:共享硬件上的无服务器部署

与现有内容的互补性: - 今日已有的 vLLM/SGLang 对比偏 benchmark 数据 - 本文是系统性survey,覆盖从 operator 到 serverless 的完整技术栈 - 特别有价值:disaggregated inference 和 serverless systems 的架构对比

保留理由:arXiv survey 是工程团队建立全局视野的好资源;KV cache management 章节与今日其他条目形成纵深;本文是理解完整推理系统谱系的最佳综述。

丢弃条目对比:与 sglang/sglang blog 的 vLLM vs TensorRT-LLM vs SGLang 对比文章不重复;survey 提供系统性框架,对比文章提供具体数字。

标签llm-inference-survey batching scheduling kv-cache-management disaggregated-inference serverless
行动:存参考;建议纳入"推理系统工程师读书路径";Section 3(Memory Management)重点精读


7. NiteAgent · Building with the 2026 Agent Protocol Stack: MCP, A2A, and the Production Architecture

来源Building with the 2026 Agent Protocol Stack(NiteAgent 博客)
原文链接:https://niteagent.com/blog/2026-06-07-agent-protocol-stack-mcp-a2a-production

核心数据(2026 年中采用率)

协议 用途 采用率
MCP Tool Access 97M 月下载,5,800+ servers
A2A Agent ↔ Agent 协调 150+ organizations,Linux Foundation 治理
AP2 Agent-to-Agent 支付 新兴

Google 的比喻:"A2A is the horizontal bus; MCP is the vertical bus."

协议分层架构: - MCP:agent-to-tool(不跨越 agent) - A2A:agent-to-agent(发现、委托、协商) - AP2:支付层(最不成熟) - AGNTCY:跨层基础设施

保留理由:MCP/A2A 已成为 2026 年 agent 生产部署的事实标准栈;本文给出具体下载量和组织数字;工程团队决定"用哪个协议"前必读。

丢弃条目对比:今日 inbox 无专门覆盖 MCP/A2A 协议栈的文件(ai-agent-rag-moe-deployment.md 提到过 MCP 但未深入),本文补充协议采用率和架构层次。

标签MCP A2A agent-protocol production-architecture multi-agent
行动:存参考;建议纳入"Agent 系统集成主题页";Section "The Three-Layer Protocol Stack"必读


8. Dev.to · MCP vs A2A: The Complete Guide to AI Agent Protocols in 2026

来源MCP vs A2A: The Complete Guide(Dev.to)
原文链接:https://dev.to/pockit_tools/mcp-vs-a2a-the-complete-guide-to-ai-agent-protocols-in-2026-30li

核心澄清: - MCP = how an agent talks to tools(工具访问层) - A2A = how agents talk to each other(agent 协调层) - "MCP replaces A2A" 是错误认知——两者解决完全不同的问题 - Before MCP/A2A:每个 model-tool 对是独立的 bespoke connector(维护噩梦)

技术细节: - MCP 由 Anthropic 创建,2025-12 捐赠给 Linux Foundation AAIF - A2A 由 Google 2025-04 发布 - MCP GitHub: 37,000 stars(8个月内), 10,000+ active servers

保留理由:Dev.to 文章比 NiteAgent 更清晰地解释 MCP vs A2A 的边界;对工程决策者来说是入门好文;"协议解决完全不同的问题"是避免选型错误的关键洞察。

丢弃条目对比:与 NiteAgent 那篇互补,NiteAgent 偏架构,本文偏概念澄清;建议配对阅读。

标签MCP A2A protocol澄清 multi-agent-architecture foundation-models
行动:存参考;纳入 Agent 协议选型决策参考


🟡 中等价值条目(按需取用)

9. TechCrunch · OpenAI GPT-5.6 Launch(2026-07-09)

来源OpenAI launches its new family of models with GPT-5.6(TechCrunch)
原文链接:https://techcrunch.com/2026/07/09/openai-launches-its-new-family-of-models-with-gpt-5-6

工程相关数据: - GPT-5.6 Sol:OpenAI 声称"best coding model yet" - Coding Agent Index:80 分,+2.8 above Fable 5 - 效率数据:half output tokens, half the time, ~1/3 cost vs Fable 5 - 三个规格:Luna(最小)、Terra(中)、Sol(最大) - System Card:cyber capability 提升但未达 Critical 级别

可信度判断:TechCrunch 是新闻报道,无工程实测数据;GPT-5.6 Sol benchmark 数据来自 OpenAI 官方声明,独立可信度待验证。

保留理由:GPT-5.6 是本周重大发布,工程团队需了解;建议获取 OpenAI 官方 blog 的技术细节再做工程决策。

行动:建议后续获取 OpenAI 官方 preview 页面(openai.com/index/previewing-gpt-5-6-sol-sol/)的技术规格再做深度评估。


🗑️ 丢弃条目

条目 丢弃理由
Simon Willison sqlite-utils 4.1 工具发布,非 AI/LLM 工程内容
ByteByteGo EP221 Docker 底层 通用 Linux 容器知识,今日已有更具体的 AI 基础设施文章
The Information GPT-5.6 泄露报道(by TechTimes) 新闻报道,无独立工程验证;GPT-5.6 Sol 技术规格以 OpenAI 官方为准
ARUNAGIRINATHAN-K/awesome-ai-agents-2026 GitHub 聚合列表,非具体工程内容;已有 ai-boost/awesome-harness-engineering 替代
Medium "13 Agent Protocols in Four Layers" Medium 付费壁垒,内容摘要不足以替代原文;NiteAgent 和 Dev.to 文章覆盖更完整

📋 本次新增条目汇总

# 条目 核心价值 标签
1 Addy Osmani · Agent Harness Engineering 创始人级定义 harness-engineering
2 Vikas Sah · Definitive Harness Guide Claude Code 泄露源码 + 约束参数 claude-code-leak system-prompt
3 Faros AI · Harness 五层框架 生产级架构分层 harness-framework
4 ai-boost/awesome-harness-engineering Syncause + AgentStepper 新工具 agent-debugging
5 HPCA 2026 · ELORA/BitDecoding/LILo 硬件加速 + KV Cache hpca-2026
6 arXiv 2506.21901 · LLM Inference Survey 完整推理系统栈综述 llm-inference-survey
7 NiteAgent · MCP/A2A Protocol Stack 97M 下载量 + 协议架构 MCP A2A
8 Dev.to · MCP vs A2A Complete Guide 概念澄清 + 选型决策 MCP A2A
9 TechCrunch · GPT-5.6 Launch 本周重大发布 GPT-5.6

🔍 今日去重参考(已覆盖主题)

已有文件 覆盖内容 与本次关系
2026-07-12-1015-arxiv-inference-vllm-backend-vector-substack vLLM backend、Vector DB、Substack 深度 互补(本文 MCP/A2A/Harness 新增)
2026-07-12-1450-engineering-filter-inference-systems arXiv 2506.13114、Conf42 K8s、LLM 调试 互补(本文 HPCA 2026 新增)
2026-07-12-ai-agent-rag-moe-deployment Agent、RAG、MoE 部署 互补(本文 Harness Engineering 新增)
2026-07-12-morning-engineering-filter-inference-systems 早上工程筛选 已被下午文件覆盖

📁 建议写入路径

本次草稿路径/shared/research-kb/inbox/jay/2026-07-12-1950-evening-engineering-harness-protocol-hpca-jul2026.md

主题标签harness-engineering agent-protocol MCP A2A HPCA-2026 LLM-inference agent-debugging

建议后续行动: - 精读:Vikas Sah 文章(Claude Code 泄露源码 + 约束参数) - 精读:HPCA ELORA + BitDecoding 论文(获取完整系统评估数据) - 精读:NiteAgent MCP/A2A 架构文章(Section 3 Protocol Stack) - 主题页更新:"Agent Harness 工程实践模式"(合并条目 1+2+3) - 主题页更新:"Agent 协议选型决策"(合并条目 7+8)


Jay · 工程实践筛选 · 2026-07-12 19:50 CST · 第三轮(晚间)