工程实践筛选报告 · Jay · 2026-07-25

实例: Jay | 日期: 2026-07-25 10:50 (CST) 检索范围: Tavily + arXiv + Substack + GitHub · LLM评估 / Agent框架 / 工程实践


本轮筛选结论

✅ 保留条目(4 条)


保留 1:Microsoft Agent Framework BUILD 2026 — Agent Harness 生产模式

维度 内容
来源 DevBlogs Microsoft · devblogs.microsoft.com/agent-framework
发布时间 2026-06(BUILD 2026 期间)
核心内容 Microsoft Agent Framework (MAF) 开源 SDK,Agent Harness 层暴露真实执行能力:shell/filesystem 访问、human-in-the-loop 审批流、长时会话上下文管理。同一套概念和 API 覆盖 .NET 和 Python。
工程亮点 1. Harness 层 = 模型推理 → 真实执行 的桥梁;2. MCP 一体化集成;3. 上下文跨长时会话持久化;4. 多步骤 workflow 原生支持
保留理由 ✅ 有真实执行环境描述(shell/fs 访问、审批流);✅ 明确的 SDK 架构概念(harness/skill/workflow);✅ .NET+Python 双语言支持;✅ Human-in-the-loop 设计模式;⚠️ 需配合 GitHub samples 验证实际命令和 API
代码/命令 Harness samples on GitHub(需进一步打开链接核验)
性能数据 未见量化 benchmark
可信度 ⭐⭐⭐⭐ Microsoft 官方博客,2026 BUILD 公告
标签 #Agent框架 #MAF #Harness #MCP #生产模式 #Microsoft
后续行动 打开 Harness samples GitHub,提取实际 API 调用和命令示例

保留 2:SocialCrawl — "AI Agent Frameworks in 2026: What Actually Ships"

维度 内容
来源 socialcrawl.dev · socialcrawl.ai
发布时间 2026(持续更新)
核心内容 LangGraph vs CrewAI vs Mastra vs Pydantic AI 生产数据对比。Klarna 案例:Agent 处理 2/3 咨询量 = 853 名员工工作量,年省 $60M。LangGraph = graph-based(有向图),CrewAI = team-of-specialists(多角色团队)。
工程亮点 1. 真实生产数字:Klarna 2/3 咨询自动化;2. 框架选型决策树(LangGraph 图结构 vs CrewAI 角色分工);3. 66 HN points + 51 Reddit upvotes 的行业争议也被记录
保留理由 ✅ 有生产数字($60M savings,2/3 咨询量,853 FTEs);✅ 框架对比有实际定位差异描述;✅ 引用了行业反对声音(90% agentic 项目更适合简单 prompt chain);⚠️ 非一手数据,属于汇总分析
代码/命令 无直接代码块
性能数据 ✅ 2/3 咨询自动化、$60M/年节省、853 FTE 等效
可信度 ⭐⭐⭐⭐ 第三方分析带生产数据,来源可验证
标签 #Agent框架 #LangGraph #CrewAI #生产案例 #Klarna #成本优化
后续行动 可纳入 Agent 框架选型主题页;建议精读原文框架对比章节

保留 3:Future AGI Substack — "LLM Evaluation Frameworks, Metrics, and Best Practices 2026"

维度 内容
来源 futureagi.substack.com · LLM Evaluation 2026
发布时间 2026(近月)
核心内容 2026 LLM 评估格局转变:评估不再是最终 QA 步骤,而是融入开发、部署、合规流程。组件级评估(component-level evaluation)、多轮 Agent 测试、溯源性标准成为新要求。列出工具对比:Future AGI(生产评估)、DeepChecks(持续可靠性监控)。
工程亮点 1. 评估范式转变:从一次性 QA → 持续性开发-部署-合规;2. component-level evaluation = 可独立测每个模块;3. 多轮 Agent 测试框架;4. DeepChecks 的 Hallucination/factual inconsistency/bias 检测
保留理由 ✅ 评估工程化视角(component-level、多轮测试、溯源);✅ 覆盖 Production Monitoring;✅ 有工具生态对比;⚠️ 部分内容与已有 benchmark 文章重叠;⚠️ 需要核验原文深度
代码/命令 未见
性能数据 未见量化
可信度 ⭐⭐⭐ Substack 技术 newsletter,引用 Patronus AI 等工具文档
标签 #LLM评估 #Eval #生产监控 #DeepChecks #Agent测试 #2026趋势
后续行动 纳入评估工程主题页;提取 component-level evaluation 具体方法

保留 4:AIThinkerLab — "How to Build RAG Systems in 2026: 8 Architecture Patterns"

维度 内容
来源 aithinkerlab.com
发布时间 2026
核心内容 8 种 RAG 架构模式:Naive RAG → Advanced RAG → Modular RAG → Agentic RAG。Agentic RAG = LLM 推理循环控制检索:分解查询→选择工具→并行执行→评估→迭代。提到 Azure AI Search "agentic retrieval"、知识图谱增强。嵌入模型选型建议(Cohere v4 / Voyage)。
工程亮点 1. 8 种模式完整演进路径;2. Agentic RAG 的控制流描述(推理循环);3. 嵌入模型实测对比;4. 间接注入攻击防御(5 architectural defenses);5. 知识图谱集成
保留理由 ✅ 架构模式系统化整理;✅ Agentic RAG 控制流有工程参考价值;✅ 注入攻击防御是 2026 新增关注点;⚠️ 需核验是否有代码示例;⚠️ 嵌入模型数据需验证来源
代码/命令 需核验原文是否有实际代码
性能数据 Cohere Embed v4 / Voyage 检索数据(需核验)
可信度 ⭐⭐⭐ 独立博客,有框架引用但缺一手数据
标签 #RAG #Agentic-RAG #架构模式 #知识图谱 #注入防御 #嵌入选型
后续行动 核验原文代码示例;对比已有的 RAG 架构文件去重

❌ 放弃条目(4 条)+ 理由

# 条目 放弃理由
1 Z3 Rust Reimplementation Trend(Z3Prover/z3 Discussion) 数据来源为 GitHub Discussion 引述,包含多个 pain-point 的严重性评级,但无实际复现命令、无错误日志、无 benchmark 数据;属于 "discussion 摘要" 而非工程验证内容;不适合入库
2 The Pragmatic Engineer — AI Tooling 2026 Survey(900+ respondents) 900+ 工程师问卷数据有参考价值,但:本次搜索结果为 Substack 付费预览片段,内容不完整;原始数据(Claude Code 使用率、Staff+ 工程师使用偏好)需读原文才能验证;暂缓入库,待有完整版本
3 GitHub Enterprise July 2026 Roundup 属于月度产品更新摘要,内容为 Copilot governance/cost control/agentic workflows 产品特性介绍,非工程实现细节;无命令、无代码、无 benchmark;作为产品公告保留价值不足
4 AlphaCorp — "Top 5 LLMs March 2026: Benchmarks & Picks" 模型价格和 benchmark 对比属于市场调研类内容,非工程实践;评分数据(GPT-5.4 SWE-bench Pro 57.7%)无来源验证;重复性高(已有多篇 benchmark 分析文件)

与已入库内容的去重说明

本轮条目 已入库相似文件 去重结论
Future AGI Eval 框架 2026-07-25-ai-engineering-trending.md(条目含 benchmark/eval 对比) 内容互补——后者偏生态概览,前者偏 component-level evaluation;两者可并存
AIThinkerLab RAG 8 Patterns 2026-07-25-csdn-llm-rag-agent-vecdb.md(含 RAG 演进) CSDN 版已有 Naive→Advanced→Modular→Agentic RAG 演进路径,AIThinkerLab 版多出注入防御和嵌入选型;保留本条,但建议合并到同一 RAG 主题页
Microsoft MAF Harness 2026-07-22 以后无直接入库 全新条目,保留
SocialCrawl Agent Frameworks 2026-07-25-ai-engineering-trending.md(已有框架对比) 互补——trending 文件偏供应商/学术视角,SocialCrawl 有真实生产数字;两者并存
Klarna Case Study 在 SocialCrawl 条目中 通过 SocialCrawl 条目覆盖,无需单独建档

分类标签汇总

#Agent框架 #MAF #Harness #MCP #LLM评估 #Eval #RAG架构 #Agentic-RAG #生产案例 #Klarna #2026趋势


高价值条目优先级

优先级 条目 核验建议
🔴 高 Microsoft MAF Agent Harness 打开 Harness samples GitHub,提取实际 API 代码
🔴 高 AIThinkerLab RAG 8 Patterns 核验是否有代码示例和命令
🟠 中 SocialCrawl Agent Frameworks 读原文框架对比部分,提取选型决策树
🟡 低 Future AGI Substack Eval 纳入评估主题页,待精读原文

建议写入路径

  • /shared/research-kb/inbox/jay/2026-07-25-1055-jay-engineering-filter.md(本文)
  • 后续独立主题页建议:
  • 2026-07-25-agent-harness-production-patterns.md(基于 MAF 条目)
  • 2026-07-25-rag-architecture-patterns-8types.md(基于 AIThinkerLab 条目)

附:本轮未写入文件说明

本轮检索覆盖 8 条候选条目: - 4 条保留:均有真实工程内容(执行环境描述/生产数字/架构模式) - 4 条放弃:属于产品公告/市场调研/discussion 摘要/付费预览片段,无工程实践细节

未执行 GitHub 写入操作。


Jay · 2026-07-25 10:50 · 工程实践筛选