Jay 工程实践筛选 · 2026-07-24
本次主题
AI Agent 工程实践 · MCP 安全生态 · RAG 系统工程
检索范围
- arXiv (2605, 2603 系列)
- GitHub Trending / Topics (agentic-coding-tool, agentic-engineering)
- Substack (Gradient Flow, Aishwarya Srinivasan, Future AGI, IAEE)
- GitHub Gist (Shipwright PDLC Research)
- awesome-harness-engineering 精选
候选条目清单
| # | 条目 | 来源 | 类型 | 工程细节评分 |
|---|---|---|---|---|
| 1 | Engineering Robustness into Personal Agents with the AI Workflow Store | arXiv 2605.10907 | 论文 | ⭐⭐⭐⭐⭐ |
| 2 | Context Engineering: From Prompts to Corporate Multi-Agent Architecture | arXiv 2603.09619 | 论文 | ⭐⭐⭐⭐ |
| 3 | All you need to know about RAG (in 2026) | Substack / Aishwarya Srinivasan | 技术博客 | ⭐⭐⭐⭐ |
| 4 | Shipwright PDLC Research - AgentCI Competitive Intelligence | GitHub Gist | 竞品分析 | ⭐⭐⭐⭐ |
| 5 | awesome-harness-engineering (MCP/GitHub Agentic) | GitHub | 资源列表 | ⭐⭐⭐⭐ |
| 6 | RAG Reimagined: 5 Breakthroughs You Should Know | Substack / Gradient Flow | 技术博客 | ⭐⭐⭐ |
| 7 | MCP Security Landscape (2026) | GitHub Topics / Gist | 工程实践 | ⭐⭐⭐ |
| 8 | agentic-coding-tool GitHub Topics 列表 | GitHub Topics | 资源列表 | ⭐⭐⭐ |
| 9 | Top 10 Trending AI GitHub Repositories July 2026 | Analytics Vidhya | 列表 | ⭐⭐ |
| 10 | Multimodal AI in 2026 | Substack / Future AGI | 博客 | ⭐⭐ |
保留条目详情
✅ 条目 1:AI Workflow Store — ArXiv 2605.10907 [最高优先]
标题: Engineering Robustness into Personal Agents with the AI Workflow Store
作者: Roxana Geambasu (Columbia + Google), Mariana Raykova, Pierre Tholoniat, Trishita Tiwari, Lillian Tsai, Wen Zhang (Google)
发布时间: 2026(确切日期未标注,基于上下文推断为近期)
链接: https://arxiv.org/html/2605.10907
核心观点: 当前 agent 范式的核心问题:on-the-fly 循环(几秒内合成并执行计划)跳过了传统软件工程的 disciplined processes(设计、测试、安全评估、分阶段部署)。文章提出 AI Workflow Store 概念:将 agent 工作流硬化(hardened)和确定性约束(deterministically constrained),使其可以跨用户和时间复用,从而分摊 SE 过程的高昂成本。
工程细节(真实环境/命令/错误/性能): - 引用真实故障案例:删除整个收件箱(Flynn 2026)、抹除代码库(Ramesh 2026)、GitHub title 提示注入导致机器被入侵(Grith Team 2026) - 明确提出 6 类 SE 过程:需求收集、设计、工件实现、测试、对抗性评估、分阶段部署 - 指出 on-the-fly 执行在延迟和计算成本上的矛盾:即使每步多几秒推理也常被视为不可接受(Microsoft Dynamics 365 Team 2026) - 关键假设:SE 开销可以通过 AI 自动化比人类驱动开发快几个数量级 - 工作流可参数化泛化(例如"预订 Bob 推荐的 Airbnb")
可信度: 高(Google + Columbia 联合署名,有真实故障引用)
后续行动: 精读,追踪是否已发表;核实引用的 2026 年故障案例原文
保留理由: 首个系统阐述 agent "工程化 robustness" 缺位的论文,有真实故障数据支撑,概念框架完整。
✅ 条目 2:Context Engineering — ArXiv 2603.09619 [高优先]
标题: Context Engineering: From Prompts to Corporate Multi-Agent Architecture
作者: V.V. Vishnyakova
发布时间: 2026-03-10(v1),2026-03-13(v2)
链接: https://arxiv.org/abs/2603.09619 | https://ar5iv.labs.arxiv.org/html/2603.09619
学科: cs.AI, cs.MA | ACM: I.2.11, I.2.4
核心观点: 提出四学科金字塔成熟度模型: 1. Prompt Engineering (PE) — 制作单个查询(必要但不足) 2. Context Engineering (CE) — 设计、管理 AI agent 决策的完整信息环境;五维质量标准:relevance、sufficiency、isolation、economy、provenance 3. Intent Engineering (IE) — 将组织目标、价值观和权衡层次编码进 agent 基础设施 4. Specification Engineering (SE) — 创建机器可读的组织策略和标准语料库
企业数据:75% 企业计划两年内部署 agentic AI(Deloitte 2026),但实际部署遭遇规模复杂性后回撤(KPMG 2026)。
工程细节: - 参考架构:Google ADK、Anthropic、LangChain - 参考框架:ACE framework、Google DeepMind's intelligent delegation - "whoever controls the agent's context controls its behavior"
可信度: 高(25页,有明确的 maturity model,引用企业调研数据)
后续行动: 精读 PDF 版本,确认是否包含具体系统架构图或命令示例
保留理由: 多 agent 系统组织工程的系统性框架,五维质量标准可作为工程实践评估框架。
✅ 条目 3:RAG 2026 深度技术博客 [高优先]
标题: All you need to know about RAG (in 2026)
作者: Aishwarya Srinivasan
来源: Substack
链接: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-rag-in
发布时间: 2026(具体日期待确认)
核心观点与工程细节:
-
Context-Aware Partitioning(上下文感知分块) - 不按字符数切分,而用模型判断句子间 cosine distance 阈值,超过阈值则断点 - 子块(100 tokens)检索 → 父文档(元数据存储)补充上下文 - 效果:手术刀式精度 + 大文档丰富上下文
-
Hybrid Search + Reciprocal Rank Fusion(混合搜索) - 向量搜索(语义)+ BM25(词汇精确)并行运行 - RRF 公式:
score(d) = Σᵣ 1/(k + r(d)),k=60 标准常数 - 两路搜索 top-5 命中的文档获得数学叠加boost,过滤语义噪声 -
Cross-Encoder Re-Ranking - Bi-Encoder(快但有损)→ 初步 top-100 → Cross-Encoder 精排 → top-5~10 送 LLM - 工具:Cohere Rerank 3.5 或 BGE-Reranker - 解决 "Lost in the Middle" 现象
-
Naive RAG 2026 危机 - 根本问题:bi-encoder embedding 对"特异性"(specifics)灾难性丢失 - 示例:"Q3 2025 revenue vs Q3 2024 baseline",向量搜索可能返回2024数据(一字之差对embedding模型语义距离可忽略)
工程细节评分: 高(RRF公式、数值k=60、两阶段pipeline:检索→重排→生成、子父块架构) 可信度: 中高(技术细节具体,但为博客形式,非正式发表) 后续行动: 核实是否有命令示例或代码仓库;补充 Cohere Rerank 3.5 基准数据
保留理由: 混合搜索 + RRF + 两阶段重排是 2026 生产 RAG 标配,本文给出了最清晰的pipeline描述。
✅ 条目 4:AgentCI 竞品情报 [高优先]
标题: Shipwright PDLC Research - AgentCI (2026-03-28)
来源: GitHub Gist
链接: https://gist.github.com/dipandhali2021/f4753824c87cbbc5ff3e94d2c9d3e54f
作者: competitive-analyst(自动化研究 agent)
核心内容(表格化关键数据):
| 工具 | Stars | 核心能力 | 弱点 | 定价 |
|---|---|---|---|---|
| Invariant MCP-Scan | ~2,000(被 Snyk 2026-01吸收) | 静态+动态扫描、tool pinning、proxy模式、检测poisoning/shadowing/rug pulls、--local-only | Hosted Explorer已关闭、无CI gate | Free OSS + 企业定价 |
| Snyk Agent-Scan | 2,000 | 自动发现 Claude/Cursor/Windsurf/Gemini 配置、15+风险类别、REST API | 需Snyk API token、企业定价不透明 | Free + 企业 |
| Cisco MCP Scanner | N/A(企业) | YARA+LLM-as-judge、CFG/taint跟踪 | 需Cisco订阅、有限社区采纳 | Open-source CLI免费 |
| Obot MCP Gateway | ~3,000 | 完整MCP控制平面、RBAC、审计日志、K8s原生 | Gateway架构、非扫描器、K8s专精 | Apache 2.0 + 企业版 |
关键工程发现: - MCP 月 SDK 下载量:2026-02 突破 9700 万次 - MCP 生态规模:270+ MCP servers 可用 - 43% MCP 实现存在命令注入漏洞(command injection) - MCP Inspector 官方工具自身存在 CVE-2025-49596 RCE 漏洞 - 三项未满足的工程需求: 1. 统一 health score(安全 + 规范符合 + 认证配置 + 工具描述质量) 2. CI gate(规范符合失败则阻止 PR 合并) 3. 轻量级 mcp-health CLI(GitHub Actions 可用,无需 Snyk 账户)
工程细节评分: ⭐⭐⭐⭐(工具对比表、命令行flag如--local-only、CVE编号、下载量数据) 可信度: 中(研究型agent产出,表格数据来自公开信息,但原始来源未逐一标注) 后续行动: 交叉核实 Snyk Agent-Scan 2026-03-25 v0.4.10 更新内容;验证 CVE-2025-49596
保留理由: 提供了 MCP 安全生态最完整的工程化工具对比,含真实star数、CLI flag、漏洞编号,不可多得的竞品技术基准。
✅ 条目 5:awesome-harness-engineering [高优先]
标题: Under the Hood: Security Architecture of GitHub Agentic Workflows
来源: GitHub / awesome-harness-engineering
链接: https://github.com/ai-boost/awesome-harness-engineering
发布时间: 2026-03-09(GitHub architecture write-up)
核心工程内容(防御纵深架构): GitHub 2026年3月的架构文档描述了 coding agent 在 CI 内运行时的防御层次: 1. Isolated agent container(隔离 agent 容器) 2. Firewall(防火墙) 3. MCP Gateway(MCP 网关) 4. API Proxy(API 代理) 5. Staged safe outputs(分阶段安全输出) 6. Zero-secret execution(零密钥执行)
核心理念:将 agent 执行视为 hostile workload inside automation infrastructure。
Block's Goose(2026-04 捐赠给 Linux Foundation): - MCP-native 架构:每个能力都作为 MCP server - 成为构建 vendor-neutral、extensible harness 的实用参考 - 工具集整合为主要扩展机制(非框架特定插件)
Agentic Development 四项基础设施能力要求(Agentic Engineering 文章): 1. Per-task isolated sandboxes(per-task 隔离沙箱) 2. Sub-100ms startup(启动 <100ms,排除传统 VM 和大多数 K8s 方案) 3. API-driven lifecycle management(API 驱动生命周期管理) 4. MCP-native environment control(MCP 原生环境控制)
工程细节评分: ⭐⭐⭐⭐(具体架构层次、命名组件、100ms 性能约束) 可信度: 高(来自 GitHub 官方 write-up 和 Linux Foundation 捐赠公告) 后续行动: 获取 GitHub 2026-03-09 原文;追踪 Goose MCP-native 架构的 GitHub 仓库
保留理由: GitHub 官方 CI agent 安全架构 + Block Goose 是 2026 Agent Harness 工程实践的两大标杆案例。
⚠️ 条目 6:RAG Reimagined — Gradient Flow [中优先]
来源: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
保留原因: 涵盖 RAG 2.0(集成系统)、Grounded LM(可验证答案)、Agentic RAG、多模态 RAG、Lance v2 基础设施
丢弃理由: 内容偏综述,未包含具体命令或代码片段,工程深度不及条目3
丢弃条目及理由
| 条目 | 丢弃理由 |
|---|---|
| Multimodal AI in 2026 (Future AGI Substack) | 高层次概述,无工程细节,无命令/代码/基准数据 |
| Top 10 Trending AI GitHub July 2026 (Analytics Vidhya) | 列表性质,无深度技术内容;Colibri 纯C推理引擎虽有趣但缺乏具体编译命令 |
| 5 Essential GitHub Repos for AI Engineers (LinkedIn) | 纯列表,无工程细节 |
| GitHub Copilot agentic harness blog (GitHub Blog) | 营销性质为主,无具体性能数据或可复现步骤 |
| UniversalRAG paper reference | 仅在本文中被提及,未提供原论文链接和具体数据 |
| Context Engineering paper (ar5iv abstract) | 摘要层面,无系统架构图或命令示例(但PDF版本值得获取) |
分类标签
agent-harness MCP-security RAG-engineering software-engineering GitHub-agentic workflow-store context-engineering enterprise-agents
建议写入路径
/shared/research-kb/inbox/jay/2026-07-24-engineering-filter.md ✅(已写入)
后续行动建议
| 优先级 | 行动 | 目标 |
|---|---|---|
| 🔴 高 | 精读 AI Workflow Store 原文 | 获取完整第2节动机示例和第3节架构设计 |
| 🔴 高 | 获取 Context Engineering PDF | 补充 maturity model 完整图示和五维标准详解 |
| 🟡 中 | 追踪 Goose MCP-native 仓库 | 获取 github.com/block/goose 或 Linux Foundation 链接 |
| 🟡 中 | 核实 Snyk Agent-Scan v0.4.10 | 确认 --local-only CLI 标志的准确行为 |
| 🟡 中 | 补充 MCP CVE-2025-49596 详情 | 确认 MCP Inspector RCE 影响范围和修复版本 |
| 🟢 低 | RAG Re-Ranking 基准数据 | 查找 Cohere Rerank 3.5 vs BGE-Reranker 量化对比 |