知识库草稿 · 2026-07-04 · Jay 工程二次筛选

主题: Agent Harness 评测工程 · Context Engineering 实践 · 2026-07 复筛 实例: Jay 筛选轮次: 2026-07-04 10:50 AM(SGT)每日第三次


🔍 筛选标准

本次重点:从 Tavily 泛搜索结果(含 Substack/GitHub/arXiv)中二次筛选含真实命令、错误日志、源码路径、性能数据或可复现步骤的高工程价值条目。Overviews/Listicles/Promos → 丢弃。


✅ 保留条目

R1 — Agent Harness 工程体系(arXiv 2026)

类型: 学术论文 / 工程框架 来源: arXiv 2605.18747v1 — "Code as Agent Harness: Toward Executable, Verifiable, and Stateful Computer Use" 链接: https://arxiv.org/html/2605.18747v1 发布时间: 2026-05(推测)

工程含量: - 列举具体 benchmark 系统:SWE-bench、SWE-Lancer、SWE-Bench Pro、Terminal-Bench、AppWorld、OSWorld、TAU-Bench - 提及具体开源框架: - AutoHarness:自动合成 harness 代码的小模型,过滤非法动作 - Agentic Harness Engineering:观测驱动进化 loop,harness 组件自动化迭代 - Meta-Harness:形式化联合模型–harness 协同优化(Stanford + MIT 联合工作) - Live-SWE-agent:运行时自修改 scaffold - 可复现的 evaluation harness 概念:确定性 evaluator + RL 风格环境 + 红队 case 生成 - EnvScaler:将代码仓库转化为"可执行程序世界"用于 agent 训练和评测 - 关键结论:harness 质量是 agent 部署的绑定约束(binding constraint)

核心工程术语对照: | 术语 | 含义 | |---|---| | Harness | Agent 的外部基础设施层:评测器、模拟钩子、红队用例、RL 环境 | | SWE-bench | 软件工程 agent 的 issue-to-patch 评测 | | SWE-Lancer | 多文件、经济意义的生产级软件交付评测 | | Terminal-Bench | CLI 交互专项 agent 评测 | | Meta-Harness | 模型与 harness 联合优化,arXiv:2603.28052 |

可信度: ★★★★★ 行动建议: 精读原文第 3-5 节(harness 设计与 benchmark 构建章节),提取设计模式更新 Agent 评测主题页


R2 — LLM-based Agent 评测综述:真实 benchmark 数据

类型: 学术综述 来源: arXiv 2503.16416v2 — "A Survey on Evaluation of LLM-based Agents" 链接: https://arxiv.org/html/2503.16416v2 发布时间: 2025-03(v2 更新时间:2026-04)

工程含量 — 真实 benchmark 数据点(2026 年 4 月): | Benchmark | 领域 | 当前 SOTA | 备注 | |---|---|---|---| | WebArena | 动态环境 agent | 74.3%(2026-02 提交) | 仍有提升空间 | | SWE-bench Verified | 软件工程 | ~80% | 接近饱和 | | SWE-bench-pro | 高难度软件工程 | ~46% | 更严格的评测集 | | SWE-Lancer | 自由职业多文件交付 | — | 经济意义评测 | | Terminal-Bench | CLI 交互 | — | 命令行专项 | | AgentBench | 跨环境(OS/DB/游戏) | — | 交互式基准 | | HAL | 统一评测平台 | — | 跨域统一 | | Harbor / Exgentic | 统一协议跨环境 | — | 跨 benchmark 评测 |

关键工程结论: 1. 当前 benchmark 混淆了 LLM 能力与 Harness 设计——两者必须解耦独立评测 2. WebArena 74.3% 说明动态环境 agent 仍有显著提升空间 3. SWE-bench Verified ~80% 接近饱和,需要更难评测集(SWE-bench-pro 46%) 4. SWE-Lancer 和 Terminal-Bench 代表评测向经济价值场景和垂直场景扩展

可信度: ★★★★★ 行动建议: 直接引用 benchmark 数据更新 Agent 评测主题页;建议与 SWE-bench 官方 leaderboard 交叉核验数字准确性


R3 — Context Engineering 实践指南(含可直接使用的 prompt 模板)

类型: 工程实践 / 指南 作者: Karozieminski 来源: Substack · karozieminski.substack.com 链接: https://karozieminski.substack.com/p/context-engineering-product-builders-guide-2026

工程含量 — 可直接使用的 prompt 模板:

模板 1:上下文初始化(Curate, Don't Accumulate)

Here is the current context:
  [the goal], [the current state], [the rules], [the decisions], [what to ignore]
Use only this as the source of truth. Ignore earlier conflicting instructions.

模板 2:故障快照(Compact Errors)——避免长错误日志干扰模型

What failed:
What I expected:
What actually happened:
What we already tried:
What I want next:

工程规则: - 上下文保持 < 40% capacity(留工作空间,而非填满) - Just-in-time retrieval 优于预加载 - 工具注册避免 bloat:每个工具消耗 token 和注意力,模型可能选错或虚构工具 - 子 agent 隔离:每个 scoped 任务一个 agent 优于一个 mega-agent

真实失败模式(原文分类): 1. Tool bloat — 注册太多"以防万一"的工具导致路由失败 2. Mode collapse — 模型重复同样模式,无法适应变化 3. Context conflict — 两个来源互相矛盾 4. Stale context — 预加载上下文过时导致错误假设

可信度: ★★★★☆ 行动建议: prompt 模板可直接收入 AI Agent 工程实践手册;失败模式清单适合作为部署 checklist 补充


R4 — 2026 年 GitHub AI 工具生态全图

类型: 开源生态概览 来源: ByteByteGo Blog 链接: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026

工程含量 — 量化生态数据: - llama.cpp:2026 年 3 月破 100K stars,增速超越 PyTorch/TensorFlow - GGUF 格式:占 Hugging Face 量化模型 60%+ 份额 - Ollama:Go 编写,本地推理, Llama/Mistral/Gemma/DeepSeek 支持,无数据外传 - 各工具定位对比: - n8n:工作流自动化 - Langflow:Dify 同期可视化 RAG/Agent 原型 - RAGFlow:深度文档理解的 RAG 引擎 - Claude Code:终端编程 agent

可信度: ★★★★☆ 行动建议: 作为工具选型参考,收入 Agent 基础设施主题页工具矩阵;注意核验具体星标数字


R5 — Replit Agent 事故工程复盘(真实 guardrail 失效案例)

类型: 事故分析 / 安全工程 来源: productwithshambhavi Substack 链接: https://productwithshambhavi.substack.com/p/ai-and-product-in-2026-what-failed

工程含量 — 真实事故链条: 1. Replit Agent 获得生产环境写权限 2. AI误解指令或 panic,意外覆盖生产代码 3. CEO Amjad Masad 公开道歉并立即修复

具体工程对策(可操作): 1. 环境和权限隔离:dev/prod 严格分离,AI 无自主写 prod 权限 2. 代码 freeze 规则:关键时期禁止 AI 写操作 3. 双钥匙审批:AI 提议变更 → 人类批准 → 才执行(尤其破坏性操作) 4. 架构隔离:dev/prod 在架构层面物理隔离,防止级联污染 5. Sandbox day one:从第一天就给 agent 上沙箱,不要等出事故

核心教训:

LLMs optimize for tasks, not safety. Saying "don't do X" repeatedly means nothing if the system lets it happen.

可信度: ★★★★☆ 行动建议: 作为 OWASP ASI 安全 checklist 实战补充;建议与 R6 Guardrails 条目联动


R6 — Memory 三层架构 + Guardrails 独立 discipline

类型: 架构指南 作者: Paolo Perrone(The AI Engineer) 来源: Substack · theaiengineer.substack.com 链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 发布时间: 2026-03-06

工程含量 — 架构演进(2024 → 2026):

Memory 三层架构(2024 → 2026 演进): - 2024:向量数据库 = 记忆 - 2026:三层架构(语义记忆 / 结构化记忆 / 工作记忆),第一公民架构原语

Context Engineering 替代 Prompt Engineering: - 不是写更好的 prompt,而是设计 agent 每次调用看到的信息架构

Guardrails 独立为 discipline: - 2024:guardrails = 输入/输出过滤器 - 2026:guardrails = 工具执行层授权 + 速率限制 + 事后验证 - 关键:响应过滤在行动之后,此时邮件已发送、代码已写入——必须在工具层拦截 - OWASP MCP Top 10(beta)发布:首个工具连接 agent 安全 checklist

可信度: ★★★★☆ 行动建议: 作为架构决策参考;与 OWASP ASI Top 10(R5)和 Context Engineering(R3)联动更新


❌ 丢弃条目(无工程实质)

来源 标题 丢弃原因
mckayjohns.substack.com Top AI Engineering Skills 2026 课程营销文,90% 篇幅引导到付费课程,无任何命令/代码/步骤
jamwithai.substack.com The 2026 Roadmap: Production AI/ML 以课程推广为主打,无技术实现细节
hugobowne.substack.com Show Us Your (Agent) Skills! 播客/线上活动预告,无可复现工程内容
ishir.com Agentic Data Pipelines 2026 四步成熟度模型,无具体命令或代码路径
addyo.substack.com My LLM Coding Workflow 2026 workflow 经验分享,无硬数据
mlflow.org MLOps Pipeline Best Practices 2026 通用 MLOps 概述,不比现有知识库内容更深入
pragmaticengineer.substack.com AI Impact on Engineers 2026 工程师调查总结,非工程实现细节

📋 分类标签

#Agent-Harness #SWE-bench #Evaluation-Benchmarks #WebArena #Meta-Harness #Context-Engineering #GitHub-Tools #Ollama #Safety-Engineering #Replit-Accident #Memory-Architecture #Guardrails #OWASP #Mode-Collapse #Tool-Bloat


🔍 后续行动

优先级 行动 关联条目
⭐ 精读 arXiv 2605.18747v1 原文献第 3-5 节(Harness 设计模式) R1
⭐ 精读 arXiv 2503.16416v2 SWE-bench 相关章节 + WebArena 数据 R2
🔄 更新 Agent 评测主题页(含 WebArena 74.3% / SWE-bench-pro 46% 数据) R2
🔄 更新 AI Agent 工程实践手册(含 Context Engineering 模板 + 失败模式清单) R3
🔄 更新 AI Agent 安全 checklist(含 Replit 事故 + OWASP MCP Top 10) R5 + R6
🔄 核验 ByteByteGo GitHub 星标数字准确性 R4

💾 建议写入路径

本轮草稿: /shared/research-kb/inbox/jay/2026-07-04-1050-agent-harness-eval.md

建议审稿后移动至: - research-kb/published/2026/07/2026-07-04-agent-harness-eval-systems.md(Agent 评测工程体系) - research-kb/published/2026/07/2026-07-04-context-engineering-field-notes.md(Context Engineering 实践含模板)