Jay 工程实践筛选 · 2026-08-27 10:50 (UTC+8)

筛选范围

  • LLM Agent / RAG / MLOps 工程实践
  • 学术平台: arXiv, Papers with Code
  • GitHub trending / 工程博客
  • Substack 高价值专栏
  • 重点: 真实环境、命令、错误、源码、性能数据、可复现步骤

保留条目 (Keep)

1. Harbor Framework (GitHub) ⭐⭐⭐⭐⭐

链接: https://github.com/harbor-framework/harbor
来源: GitHub · 4.5k stars · Apache-2.0
时间: 2026 (持续更新)
评分: 0.789

保留理由: - ✅ 真实 CLI 命令: harbor run --help, harbor datasets list - ✅ 支持 SWE-Bench、Aider Polyglot 等标准 benchmarks - ✅ 容器化评估环境 (pass the --env flag) - ✅ 完整 pyproject.toml / registry.json / skills-lock.json 配置 - ✅ 1474 commits,活跃开发 - ✅ DOI: 10.5281/zenodo.20953922

工程价值: Agent 评估框架,提供标准化 benchmark 环境,适合接入 CI/CD。


2. Azure AI Foundry 12-Step Agent 教程 ⭐⭐⭐⭐

链接: https://tech-insider.org/how-to-build-azure-ai-foundry-agents-2026
来源: tech-insider.org
时间: 2026-08

保留理由: - ✅ 完整 12 步骤可复现教程 (~100 分钟) - ✅ 真实环境变量配置: .env 分离 credentials - ✅ DurableWorkflow checkpoint/resume 代码示例 - ✅ MCP server 集成 (mcp_server/incident_lookup.py) - ✅ Container App 部署结构 (setup(Step 12) │ └── main.py) - ✅ eval_harness.py 评估流程

工程价值: Azure 平台上手指南,有真实命令和代码结构。


3. Trustworthy RAG - RAG 安全性评估 (arXiv) ⭐⭐⭐⭐

链接: https://arxiv.org/html/2608.21095v1
来源: arXiv · ICSEA 2026 论文
时间: 2026-08

保留理由: - ✅ 具体毒化策略: instruction injection, contradiction, entity swap - ✅ 量化指标: ROC-AUC 0.73-0.81, F1 92% (instruction injection blocking) - ✅ OWASP Top 10 + CWE 安全编码知识库 - ✅ 4 类毒化方法对比实验 - ✅ Secure-coding assistant 真实场景

工程价值: RAG 安全性 + 评估指标具体化,有数值支撑。


4. strands-agents Organization (GitHub) ⭐⭐⭐⭐

链接: https://github.com/strands-agents
来源: GitHub · harness-sdk 6.9k stars
时间: 2026-08 (近期活跃)

保留理由: - ✅ harness-sdk: 生产 AI agent 控制平面,Python/TypeScript 双支持 - ✅ evals: 完整评估框架 - ✅ shell: agent 安全 shell 访问 (Rust) - ✅ agent-sop: 多步骤工作流可靠性 (1.1k stars) - ✅ 真实项目结构,适合工程落地

工程价值: AWS/Nordic Semiconductor 背景,开源 SDK 质量高。


5. Eval-Driven Development Guide (Medium) ⭐⭐⭐⭐

链接: https://medium.com/@roanmonteiro/the-definitive-guide-to-eval-driven-development-for-llm-and-agent-systems-2026-0ddc9f25ba3a
来源: Medium · Roan Brasil Monteiro
时间: 2026

保留理由: - ✅ Traces / golden sets / RAG metrics / LLM-as-judge 全链路 - ✅ G-Eval, rubric, calibration 方法 - ✅ Agent trajectory evaluation - ✅ CI pipeline 集成方案 - ✅ 生产采样和闭环反馈

工程价值: Eval 工程实践方法论,具体 metric 定义。


6. AI Agent Evaluation Metrics (TestDino) ⭐⭐⭐

链接: https://testdino.com/blog/ai-agent-evaluation-metrics
来源: TestDino Blog
时间: 2026-08

保留理由: - ✅ 评估循环迭代方法 - ✅ LangSmith / Microsoft Agent Framework 工具调用准确率 - ✅ Playwright Skill 测试模式 - ✅ 任务成功率 + 多维度指标

工程价值: 评估流程工程化,有具体工具集成。


7. Aishwarya Srinivasan - Harness Engineering (Substack) ⭐⭐⭐

链接: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
来源: Substack · 付费专栏
时间: 2026

保留理由: - ✅ "Only 5% enterprise AI agents reach production" — 统计洞察 - ✅ Harness vs Model 区分 - ✅ Google Cloud / Vertex AI 实战 (含 code 50OFF) - ✅ Forward Deployed Engineer 技能栈

工程价值: 工程化视角,harness 是差异化竞争点。


8. AgentEval .NET (GitHub) ⭐⭐⭐

链接: https://github.com/AgentEvalHQ/AgentEval
来源: GitHub · MIT license
时间: 2026-07 GA

保留理由: - ✅ 微软 .NET agent 评估工具包 - ✅ fluent assertions on disclosure trace - ✅ Skill Health & Security Index - ✅ red-team attack for poisoned skill - ✅ Gatekeeper deterministic gates

工程价值: .NET 生态唯一专业评估工具,填补空缺。


丢弃条目 (Discard)

条目 原因
Context Engineering for AI Agents (Sentra) 概念介绍为主,缺具体命令/代码
AI Engineer Roadmap 2026 (LinkedIn) 职业路线图,无工程实践
AI Engineering in 2026 (LinkedIn) 路线图式内容
Winder.ai Agent Harness Comparison 产品对比为主,非工程细节
SimpliAxis Best AI Agents 2026 功能对比,缺具体实现
javarevisited Substack (AI Skills) 课程推荐,知识整理
System Design Newsletter 21 concepts 概念列表,无工程深度
IT News / Data Connectors Substack 行业新闻,无技术细节
Wevolver Edge AI Report 2026 综合性报告,缺命令/代码

分类标签

  • agent-evaluation · benchmark · SWE-bench
  • azure-ai-foundry · MCP · DurableWorkflow
  • RAG-security · OWASP · CWE
  • harness · eval-driven · LLM-as-judge
  • strands-agents · dotnet · AgentEval

建议写入路径

/shared/research-kb/inbox/jay/2026-08-27-1050-jay-engineering-filter.md

后续行动

  1. Harbor Framework — 可考虑作为 agent eval 主题页核心条目
  2. Trustworthy RAG — RAG 安全评估具体数值,适合 RAG 主题页
  3. strands-agents — harness-sdk 适合工程落地参考
  4. Azure AI Foundry — 12-step 教程可作为平台上手参考

是否需要精读/审稿/主题页更新

  • 🔍 Harbor Framework: 建议精读 README + examples
  • 🔍 Trustworthy RAG: 建议精读 Section IV (实验部分)
  • 📝 Agent Evaluation 主题页: 建议更新,加入 strands-agents 和 AgentEval
  • ⏭️ 其他条目: 扫描即可