工程实践筛选报告 · Jay · 2026-07-25
实例: Jay | 日期: 2026-07-25 10:50 (CST)
检索范围: Tavily + arXiv + Substack + GitHub · LLM评估 / Agent框架 / 工程实践
本轮筛选结论
✅ 保留条目(4 条)
保留 1:Microsoft Agent Framework BUILD 2026 — Agent Harness 生产模式
| 维度 |
内容 |
| 来源 |
DevBlogs Microsoft · devblogs.microsoft.com/agent-framework |
| 发布时间 |
2026-06(BUILD 2026 期间) |
| 核心内容 |
Microsoft Agent Framework (MAF) 开源 SDK,Agent Harness 层暴露真实执行能力:shell/filesystem 访问、human-in-the-loop 审批流、长时会话上下文管理。同一套概念和 API 覆盖 .NET 和 Python。 |
| 工程亮点 |
1. Harness 层 = 模型推理 → 真实执行 的桥梁;2. MCP 一体化集成;3. 上下文跨长时会话持久化;4. 多步骤 workflow 原生支持 |
| 保留理由 |
✅ 有真实执行环境描述(shell/fs 访问、审批流);✅ 明确的 SDK 架构概念(harness/skill/workflow);✅ .NET+Python 双语言支持;✅ Human-in-the-loop 设计模式;⚠️ 需配合 GitHub samples 验证实际命令和 API |
| 代码/命令 |
Harness samples on GitHub(需进一步打开链接核验) |
| 性能数据 |
未见量化 benchmark |
| 可信度 |
⭐⭐⭐⭐ Microsoft 官方博客,2026 BUILD 公告 |
| 标签 |
#Agent框架 #MAF #Harness #MCP #生产模式 #Microsoft |
| 后续行动 |
打开 Harness samples GitHub,提取实际 API 调用和命令示例 |
保留 2:SocialCrawl — "AI Agent Frameworks in 2026: What Actually Ships"
| 维度 |
内容 |
| 来源 |
socialcrawl.dev · socialcrawl.ai |
| 发布时间 |
2026(持续更新) |
| 核心内容 |
LangGraph vs CrewAI vs Mastra vs Pydantic AI 生产数据对比。Klarna 案例:Agent 处理 2/3 咨询量 = 853 名员工工作量,年省 $60M。LangGraph = graph-based(有向图),CrewAI = team-of-specialists(多角色团队)。 |
| 工程亮点 |
1. 真实生产数字:Klarna 2/3 咨询自动化;2. 框架选型决策树(LangGraph 图结构 vs CrewAI 角色分工);3. 66 HN points + 51 Reddit upvotes 的行业争议也被记录 |
| 保留理由 |
✅ 有生产数字($60M savings,2/3 咨询量,853 FTEs);✅ 框架对比有实际定位差异描述;✅ 引用了行业反对声音(90% agentic 项目更适合简单 prompt chain);⚠️ 非一手数据,属于汇总分析 |
| 代码/命令 |
无直接代码块 |
| 性能数据 |
✅ 2/3 咨询自动化、$60M/年节省、853 FTE 等效 |
| 可信度 |
⭐⭐⭐⭐ 第三方分析带生产数据,来源可验证 |
| 标签 |
#Agent框架 #LangGraph #CrewAI #生产案例 #Klarna #成本优化 |
| 后续行动 |
可纳入 Agent 框架选型主题页;建议精读原文框架对比章节 |
保留 3:Future AGI Substack — "LLM Evaluation Frameworks, Metrics, and Best Practices 2026"
| 维度 |
内容 |
| 来源 |
futureagi.substack.com · LLM Evaluation 2026 |
| 发布时间 |
2026(近月) |
| 核心内容 |
2026 LLM 评估格局转变:评估不再是最终 QA 步骤,而是融入开发、部署、合规流程。组件级评估(component-level evaluation)、多轮 Agent 测试、溯源性标准成为新要求。列出工具对比:Future AGI(生产评估)、DeepChecks(持续可靠性监控)。 |
| 工程亮点 |
1. 评估范式转变:从一次性 QA → 持续性开发-部署-合规;2. component-level evaluation = 可独立测每个模块;3. 多轮 Agent 测试框架;4. DeepChecks 的 Hallucination/factual inconsistency/bias 检测 |
| 保留理由 |
✅ 评估工程化视角(component-level、多轮测试、溯源);✅ 覆盖 Production Monitoring;✅ 有工具生态对比;⚠️ 部分内容与已有 benchmark 文章重叠;⚠️ 需要核验原文深度 |
| 代码/命令 |
未见 |
| 性能数据 |
未见量化 |
| 可信度 |
⭐⭐⭐ Substack 技术 newsletter,引用 Patronus AI 等工具文档 |
| 标签 |
#LLM评估 #Eval #生产监控 #DeepChecks #Agent测试 #2026趋势 |
| 后续行动 |
纳入评估工程主题页;提取 component-level evaluation 具体方法 |
保留 4:AIThinkerLab — "How to Build RAG Systems in 2026: 8 Architecture Patterns"
| 维度 |
内容 |
| 来源 |
aithinkerlab.com |
| 发布时间 |
2026 |
| 核心内容 |
8 种 RAG 架构模式:Naive RAG → Advanced RAG → Modular RAG → Agentic RAG。Agentic RAG = LLM 推理循环控制检索:分解查询→选择工具→并行执行→评估→迭代。提到 Azure AI Search "agentic retrieval"、知识图谱增强。嵌入模型选型建议(Cohere v4 / Voyage)。 |
| 工程亮点 |
1. 8 种模式完整演进路径;2. Agentic RAG 的控制流描述(推理循环);3. 嵌入模型实测对比;4. 间接注入攻击防御(5 architectural defenses);5. 知识图谱集成 |
| 保留理由 |
✅ 架构模式系统化整理;✅ Agentic RAG 控制流有工程参考价值;✅ 注入攻击防御是 2026 新增关注点;⚠️ 需核验是否有代码示例;⚠️ 嵌入模型数据需验证来源 |
| 代码/命令 |
需核验原文是否有实际代码 |
| 性能数据 |
Cohere Embed v4 / Voyage 检索数据(需核验) |
| 可信度 |
⭐⭐⭐ 独立博客,有框架引用但缺一手数据 |
| 标签 |
#RAG #Agentic-RAG #架构模式 #知识图谱 #注入防御 #嵌入选型 |
| 后续行动 |
核验原文代码示例;对比已有的 RAG 架构文件去重 |
❌ 放弃条目(4 条)+ 理由
| # |
条目 |
放弃理由 |
| 1 |
Z3 Rust Reimplementation Trend(Z3Prover/z3 Discussion) |
数据来源为 GitHub Discussion 引述,包含多个 pain-point 的严重性评级,但无实际复现命令、无错误日志、无 benchmark 数据;属于 "discussion 摘要" 而非工程验证内容;不适合入库 |
| 2 |
The Pragmatic Engineer — AI Tooling 2026 Survey(900+ respondents) |
900+ 工程师问卷数据有参考价值,但:本次搜索结果为 Substack 付费预览片段,内容不完整;原始数据(Claude Code 使用率、Staff+ 工程师使用偏好)需读原文才能验证;暂缓入库,待有完整版本 |
| 3 |
GitHub Enterprise July 2026 Roundup |
属于月度产品更新摘要,内容为 Copilot governance/cost control/agentic workflows 产品特性介绍,非工程实现细节;无命令、无代码、无 benchmark;作为产品公告保留价值不足 |
| 4 |
AlphaCorp — "Top 5 LLMs March 2026: Benchmarks & Picks" |
模型价格和 benchmark 对比属于市场调研类内容,非工程实践;评分数据(GPT-5.4 SWE-bench Pro 57.7%)无来源验证;重复性高(已有多篇 benchmark 分析文件) |
与已入库内容的去重说明
| 本轮条目 |
已入库相似文件 |
去重结论 |
| Future AGI Eval 框架 |
2026-07-25-ai-engineering-trending.md(条目含 benchmark/eval 对比) |
内容互补——后者偏生态概览,前者偏 component-level evaluation;两者可并存 |
| AIThinkerLab RAG 8 Patterns |
2026-07-25-csdn-llm-rag-agent-vecdb.md(含 RAG 演进) |
CSDN 版已有 Naive→Advanced→Modular→Agentic RAG 演进路径,AIThinkerLab 版多出注入防御和嵌入选型;保留本条,但建议合并到同一 RAG 主题页 |
| Microsoft MAF Harness |
2026-07-22 以后无直接入库 |
全新条目,保留 |
| SocialCrawl Agent Frameworks |
2026-07-25-ai-engineering-trending.md(已有框架对比) |
互补——trending 文件偏供应商/学术视角,SocialCrawl 有真实生产数字;两者并存 |
| Klarna Case Study |
在 SocialCrawl 条目中 |
通过 SocialCrawl 条目覆盖,无需单独建档 |
分类标签汇总
#Agent框架 #MAF #Harness #MCP #LLM评估 #Eval #RAG架构 #Agentic-RAG #生产案例 #Klarna #2026趋势
高价值条目优先级
| 优先级 |
条目 |
核验建议 |
| 🔴 高 |
Microsoft MAF Agent Harness |
打开 Harness samples GitHub,提取实际 API 代码 |
| 🔴 高 |
AIThinkerLab RAG 8 Patterns |
核验是否有代码示例和命令 |
| 🟠 中 |
SocialCrawl Agent Frameworks |
读原文框架对比部分,提取选型决策树 |
| 🟡 低 |
Future AGI Substack Eval |
纳入评估主题页,待精读原文 |
建议写入路径
/shared/research-kb/inbox/jay/2026-07-25-1055-jay-engineering-filter.md(本文)
- 后续独立主题页建议:
2026-07-25-agent-harness-production-patterns.md(基于 MAF 条目)
2026-07-25-rag-architecture-patterns-8types.md(基于 AIThinkerLab 条目)
附:本轮未写入文件说明
本轮检索覆盖 8 条候选条目:
- 4 条保留:均有真实工程内容(执行环境描述/生产数字/架构模式)
- 4 条放弃:属于产品公告/市场调研/discussion 摘要/付费预览片段,无工程实践细节
未执行 GitHub 写入操作。
Jay · 2026-07-25 10:50 · 工程实践筛选