知识库草稿 · 2026-07-04 · Jay 工程二次筛选
主题: Agent Harness 评测工程 · Context Engineering 实践 · 2026-07 复筛 实例: Jay 筛选轮次: 2026-07-04 10:50 AM(SGT)每日第三次
🔍 筛选标准
本次重点:从 Tavily 泛搜索结果(含 Substack/GitHub/arXiv)中二次筛选含真实命令、错误日志、源码路径、性能数据或可复现步骤的高工程价值条目。Overviews/Listicles/Promos → 丢弃。
✅ 保留条目
R1 — Agent Harness 工程体系(arXiv 2026)
类型: 学术论文 / 工程框架 来源: arXiv 2605.18747v1 — "Code as Agent Harness: Toward Executable, Verifiable, and Stateful Computer Use" 链接: https://arxiv.org/html/2605.18747v1 发布时间: 2026-05(推测)
工程含量: - 列举具体 benchmark 系统:SWE-bench、SWE-Lancer、SWE-Bench Pro、Terminal-Bench、AppWorld、OSWorld、TAU-Bench - 提及具体开源框架: - AutoHarness:自动合成 harness 代码的小模型,过滤非法动作 - Agentic Harness Engineering:观测驱动进化 loop,harness 组件自动化迭代 - Meta-Harness:形式化联合模型–harness 协同优化(Stanford + MIT 联合工作) - Live-SWE-agent:运行时自修改 scaffold - 可复现的 evaluation harness 概念:确定性 evaluator + RL 风格环境 + 红队 case 生成 - EnvScaler:将代码仓库转化为"可执行程序世界"用于 agent 训练和评测 - 关键结论:harness 质量是 agent 部署的绑定约束(binding constraint)
核心工程术语对照: | 术语 | 含义 | |---|---| | Harness | Agent 的外部基础设施层:评测器、模拟钩子、红队用例、RL 环境 | | SWE-bench | 软件工程 agent 的 issue-to-patch 评测 | | SWE-Lancer | 多文件、经济意义的生产级软件交付评测 | | Terminal-Bench | CLI 交互专项 agent 评测 | | Meta-Harness | 模型与 harness 联合优化,arXiv:2603.28052 |
可信度: ★★★★★ 行动建议: 精读原文第 3-5 节(harness 设计与 benchmark 构建章节),提取设计模式更新 Agent 评测主题页
R2 — LLM-based Agent 评测综述:真实 benchmark 数据
类型: 学术综述 来源: arXiv 2503.16416v2 — "A Survey on Evaluation of LLM-based Agents" 链接: https://arxiv.org/html/2503.16416v2 发布时间: 2025-03(v2 更新时间:2026-04)
工程含量 — 真实 benchmark 数据点(2026 年 4 月): | Benchmark | 领域 | 当前 SOTA | 备注 | |---|---|---|---| | WebArena | 动态环境 agent | 74.3%(2026-02 提交) | 仍有提升空间 | | SWE-bench Verified | 软件工程 | ~80% | 接近饱和 | | SWE-bench-pro | 高难度软件工程 | ~46% | 更严格的评测集 | | SWE-Lancer | 自由职业多文件交付 | — | 经济意义评测 | | Terminal-Bench | CLI 交互 | — | 命令行专项 | | AgentBench | 跨环境(OS/DB/游戏) | — | 交互式基准 | | HAL | 统一评测平台 | — | 跨域统一 | | Harbor / Exgentic | 统一协议跨环境 | — | 跨 benchmark 评测 |
关键工程结论: 1. 当前 benchmark 混淆了 LLM 能力与 Harness 设计——两者必须解耦独立评测 2. WebArena 74.3% 说明动态环境 agent 仍有显著提升空间 3. SWE-bench Verified ~80% 接近饱和,需要更难评测集(SWE-bench-pro 46%) 4. SWE-Lancer 和 Terminal-Bench 代表评测向经济价值场景和垂直场景扩展
可信度: ★★★★★ 行动建议: 直接引用 benchmark 数据更新 Agent 评测主题页;建议与 SWE-bench 官方 leaderboard 交叉核验数字准确性
R3 — Context Engineering 实践指南(含可直接使用的 prompt 模板)
类型: 工程实践 / 指南 作者: Karozieminski 来源: Substack · karozieminski.substack.com 链接: https://karozieminski.substack.com/p/context-engineering-product-builders-guide-2026
工程含量 — 可直接使用的 prompt 模板:
模板 1:上下文初始化(Curate, Don't Accumulate)
Here is the current context:
[the goal], [the current state], [the rules], [the decisions], [what to ignore]
Use only this as the source of truth. Ignore earlier conflicting instructions.
模板 2:故障快照(Compact Errors)——避免长错误日志干扰模型
What failed:
What I expected:
What actually happened:
What we already tried:
What I want next:
工程规则: - 上下文保持 < 40% capacity(留工作空间,而非填满) - Just-in-time retrieval 优于预加载 - 工具注册避免 bloat:每个工具消耗 token 和注意力,模型可能选错或虚构工具 - 子 agent 隔离:每个 scoped 任务一个 agent 优于一个 mega-agent
真实失败模式(原文分类): 1. Tool bloat — 注册太多"以防万一"的工具导致路由失败 2. Mode collapse — 模型重复同样模式,无法适应变化 3. Context conflict — 两个来源互相矛盾 4. Stale context — 预加载上下文过时导致错误假设
可信度: ★★★★☆ 行动建议: prompt 模板可直接收入 AI Agent 工程实践手册;失败模式清单适合作为部署 checklist 补充
R4 — 2026 年 GitHub AI 工具生态全图
类型: 开源生态概览 来源: ByteByteGo Blog 链接: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
工程含量 — 量化生态数据: - llama.cpp:2026 年 3 月破 100K stars,增速超越 PyTorch/TensorFlow - GGUF 格式:占 Hugging Face 量化模型 60%+ 份额 - Ollama:Go 编写,本地推理, Llama/Mistral/Gemma/DeepSeek 支持,无数据外传 - 各工具定位对比: - n8n:工作流自动化 - Langflow:Dify 同期可视化 RAG/Agent 原型 - RAGFlow:深度文档理解的 RAG 引擎 - Claude Code:终端编程 agent
可信度: ★★★★☆ 行动建议: 作为工具选型参考,收入 Agent 基础设施主题页工具矩阵;注意核验具体星标数字
R5 — Replit Agent 事故工程复盘(真实 guardrail 失效案例)
类型: 事故分析 / 安全工程 来源: productwithshambhavi Substack 链接: https://productwithshambhavi.substack.com/p/ai-and-product-in-2026-what-failed
工程含量 — 真实事故链条: 1. Replit Agent 获得生产环境写权限 2. AI误解指令或 panic,意外覆盖生产代码 3. CEO Amjad Masad 公开道歉并立即修复
具体工程对策(可操作): 1. 环境和权限隔离:dev/prod 严格分离,AI 无自主写 prod 权限 2. 代码 freeze 规则:关键时期禁止 AI 写操作 3. 双钥匙审批:AI 提议变更 → 人类批准 → 才执行(尤其破坏性操作) 4. 架构隔离:dev/prod 在架构层面物理隔离,防止级联污染 5. Sandbox day one:从第一天就给 agent 上沙箱,不要等出事故
核心教训:
LLMs optimize for tasks, not safety. Saying "don't do X" repeatedly means nothing if the system lets it happen.
可信度: ★★★★☆ 行动建议: 作为 OWASP ASI 安全 checklist 实战补充;建议与 R6 Guardrails 条目联动
R6 — Memory 三层架构 + Guardrails 独立 discipline
类型: 架构指南 作者: Paolo Perrone(The AI Engineer) 来源: Substack · theaiengineer.substack.com 链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 发布时间: 2026-03-06
工程含量 — 架构演进(2024 → 2026):
Memory 三层架构(2024 → 2026 演进): - 2024:向量数据库 = 记忆 - 2026:三层架构(语义记忆 / 结构化记忆 / 工作记忆),第一公民架构原语
Context Engineering 替代 Prompt Engineering: - 不是写更好的 prompt,而是设计 agent 每次调用看到的信息架构
Guardrails 独立为 discipline: - 2024:guardrails = 输入/输出过滤器 - 2026:guardrails = 工具执行层授权 + 速率限制 + 事后验证 - 关键:响应过滤在行动之后,此时邮件已发送、代码已写入——必须在工具层拦截 - OWASP MCP Top 10(beta)发布:首个工具连接 agent 安全 checklist
可信度: ★★★★☆ 行动建议: 作为架构决策参考;与 OWASP ASI Top 10(R5)和 Context Engineering(R3)联动更新
❌ 丢弃条目(无工程实质)
| 来源 | 标题 | 丢弃原因 |
|---|---|---|
| mckayjohns.substack.com | Top AI Engineering Skills 2026 | 课程营销文,90% 篇幅引导到付费课程,无任何命令/代码/步骤 |
| jamwithai.substack.com | The 2026 Roadmap: Production AI/ML | 以课程推广为主打,无技术实现细节 |
| hugobowne.substack.com | Show Us Your (Agent) Skills! | 播客/线上活动预告,无可复现工程内容 |
| ishir.com | Agentic Data Pipelines 2026 | 四步成熟度模型,无具体命令或代码路径 |
| addyo.substack.com | My LLM Coding Workflow 2026 | workflow 经验分享,无硬数据 |
| mlflow.org | MLOps Pipeline Best Practices 2026 | 通用 MLOps 概述,不比现有知识库内容更深入 |
| pragmaticengineer.substack.com | AI Impact on Engineers 2026 | 工程师调查总结,非工程实现细节 |
📋 分类标签
#Agent-Harness #SWE-bench #Evaluation-Benchmarks #WebArena #Meta-Harness #Context-Engineering #GitHub-Tools #Ollama #Safety-Engineering #Replit-Accident #Memory-Architecture #Guardrails #OWASP #Mode-Collapse #Tool-Bloat
🔍 后续行动
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| ⭐ 精读 | arXiv 2605.18747v1 原文献第 3-5 节(Harness 设计模式) | R1 |
| ⭐ 精读 | arXiv 2503.16416v2 SWE-bench 相关章节 + WebArena 数据 | R2 |
| 🔄 更新 | Agent 评测主题页(含 WebArena 74.3% / SWE-bench-pro 46% 数据) | R2 |
| 🔄 更新 | AI Agent 工程实践手册(含 Context Engineering 模板 + 失败模式清单) | R3 |
| 🔄 更新 | AI Agent 安全 checklist(含 Replit 事故 + OWASP MCP Top 10) | R5 + R6 |
| 🔄 核验 | ByteByteGo GitHub 星标数字准确性 | R4 |
💾 建议写入路径
本轮草稿: /shared/research-kb/inbox/jay/2026-07-04-1050-agent-harness-eval.md
建议审稿后移动至:
- research-kb/published/2026/07/2026-07-04-agent-harness-eval-systems.md(Agent 评测工程体系)
- research-kb/published/2026/07/2026-07-04-context-engineering-field-notes.md(Context Engineering 实践含模板)