Jay 工程实践筛选 · 2026-08-27 10:50 (UTC+8)
筛选范围
- LLM Agent / RAG / MLOps 工程实践
- 学术平台: arXiv, Papers with Code
- GitHub trending / 工程博客
- Substack 高价值专栏
- 重点: 真实环境、命令、错误、源码、性能数据、可复现步骤
保留条目 (Keep)
1. Harbor Framework (GitHub) ⭐⭐⭐⭐⭐
链接: https://github.com/harbor-framework/harbor
来源: GitHub · 4.5k stars · Apache-2.0
时间: 2026 (持续更新)
评分: 0.789
保留理由:
- ✅ 真实 CLI 命令: harbor run --help, harbor datasets list
- ✅ 支持 SWE-Bench、Aider Polyglot 等标准 benchmarks
- ✅ 容器化评估环境 (pass the --env flag)
- ✅ 完整 pyproject.toml / registry.json / skills-lock.json 配置
- ✅ 1474 commits,活跃开发
- ✅ DOI: 10.5281/zenodo.20953922
工程价值: Agent 评估框架,提供标准化 benchmark 环境,适合接入 CI/CD。
2. Azure AI Foundry 12-Step Agent 教程 ⭐⭐⭐⭐
链接: https://tech-insider.org/how-to-build-azure-ai-foundry-agents-2026
来源: tech-insider.org
时间: 2026-08
保留理由:
- ✅ 完整 12 步骤可复现教程 (~100 分钟)
- ✅ 真实环境变量配置: .env 分离 credentials
- ✅ DurableWorkflow checkpoint/resume 代码示例
- ✅ MCP server 集成 (mcp_server/incident_lookup.py)
- ✅ Container App 部署结构 (setup(Step 12) │ └── main.py)
- ✅ eval_harness.py 评估流程
工程价值: Azure 平台上手指南,有真实命令和代码结构。
3. Trustworthy RAG - RAG 安全性评估 (arXiv) ⭐⭐⭐⭐
链接: https://arxiv.org/html/2608.21095v1
来源: arXiv · ICSEA 2026 论文
时间: 2026-08
保留理由: - ✅ 具体毒化策略: instruction injection, contradiction, entity swap - ✅ 量化指标: ROC-AUC 0.73-0.81, F1 92% (instruction injection blocking) - ✅ OWASP Top 10 + CWE 安全编码知识库 - ✅ 4 类毒化方法对比实验 - ✅ Secure-coding assistant 真实场景
工程价值: RAG 安全性 + 评估指标具体化,有数值支撑。
4. strands-agents Organization (GitHub) ⭐⭐⭐⭐
链接: https://github.com/strands-agents
来源: GitHub · harness-sdk 6.9k stars
时间: 2026-08 (近期活跃)
保留理由: - ✅ harness-sdk: 生产 AI agent 控制平面,Python/TypeScript 双支持 - ✅ evals: 完整评估框架 - ✅ shell: agent 安全 shell 访问 (Rust) - ✅ agent-sop: 多步骤工作流可靠性 (1.1k stars) - ✅ 真实项目结构,适合工程落地
工程价值: AWS/Nordic Semiconductor 背景,开源 SDK 质量高。
5. Eval-Driven Development Guide (Medium) ⭐⭐⭐⭐
链接: https://medium.com/@roanmonteiro/the-definitive-guide-to-eval-driven-development-for-llm-and-agent-systems-2026-0ddc9f25ba3a
来源: Medium · Roan Brasil Monteiro
时间: 2026
保留理由: - ✅ Traces / golden sets / RAG metrics / LLM-as-judge 全链路 - ✅ G-Eval, rubric, calibration 方法 - ✅ Agent trajectory evaluation - ✅ CI pipeline 集成方案 - ✅ 生产采样和闭环反馈
工程价值: Eval 工程实践方法论,具体 metric 定义。
6. AI Agent Evaluation Metrics (TestDino) ⭐⭐⭐
链接: https://testdino.com/blog/ai-agent-evaluation-metrics
来源: TestDino Blog
时间: 2026-08
保留理由: - ✅ 评估循环迭代方法 - ✅ LangSmith / Microsoft Agent Framework 工具调用准确率 - ✅ Playwright Skill 测试模式 - ✅ 任务成功率 + 多维度指标
工程价值: 评估流程工程化,有具体工具集成。
7. Aishwarya Srinivasan - Harness Engineering (Substack) ⭐⭐⭐
链接: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
来源: Substack · 付费专栏
时间: 2026
保留理由: - ✅ "Only 5% enterprise AI agents reach production" — 统计洞察 - ✅ Harness vs Model 区分 - ✅ Google Cloud / Vertex AI 实战 (含 code 50OFF) - ✅ Forward Deployed Engineer 技能栈
工程价值: 工程化视角,harness 是差异化竞争点。
8. AgentEval .NET (GitHub) ⭐⭐⭐
链接: https://github.com/AgentEvalHQ/AgentEval
来源: GitHub · MIT license
时间: 2026-07 GA
保留理由: - ✅ 微软 .NET agent 评估工具包 - ✅ fluent assertions on disclosure trace - ✅ Skill Health & Security Index - ✅ red-team attack for poisoned skill - ✅ Gatekeeper deterministic gates
工程价值: .NET 生态唯一专业评估工具,填补空缺。
丢弃条目 (Discard)
| 条目 | 原因 |
|---|---|
| Context Engineering for AI Agents (Sentra) | 概念介绍为主,缺具体命令/代码 |
| AI Engineer Roadmap 2026 (LinkedIn) | 职业路线图,无工程实践 |
| AI Engineering in 2026 (LinkedIn) | 路线图式内容 |
| Winder.ai Agent Harness Comparison | 产品对比为主,非工程细节 |
| SimpliAxis Best AI Agents 2026 | 功能对比,缺具体实现 |
| javarevisited Substack (AI Skills) | 课程推荐,知识整理 |
| System Design Newsletter 21 concepts | 概念列表,无工程深度 |
| IT News / Data Connectors Substack | 行业新闻,无技术细节 |
| Wevolver Edge AI Report 2026 | 综合性报告,缺命令/代码 |
分类标签
agent-evaluation·benchmark·SWE-benchazure-ai-foundry·MCP·DurableWorkflowRAG-security·OWASP·CWEharness·eval-driven·LLM-as-judgestrands-agents·dotnet·AgentEval
建议写入路径
/shared/research-kb/inbox/jay/2026-08-27-1050-jay-engineering-filter.md
后续行动
- Harbor Framework — 可考虑作为 agent eval 主题页核心条目
- Trustworthy RAG — RAG 安全评估具体数值,适合 RAG 主题页
- strands-agents — harness-sdk 适合工程落地参考
- Azure AI Foundry — 12-step 教程可作为平台上手参考
是否需要精读/审稿/主题页更新
- 🔍 Harbor Framework: 建议精读 README + examples
- 🔍 Trustworthy RAG: 建议精读 Section IV (实验部分)
- 📝 Agent Evaluation 主题页: 建议更新,加入 strands-agents 和 AgentEval
- ⏭️ 其他条目: 扫描即可