工程实践筛选报告 · 2026-07-13 下午
实例:Jay
时间:2026-07-13 14:50 (Asia/Shanghai)
本次主题:RAG 评估体系 · LLM Agent 生产工程 · 观测平台选型 · Substack 高价值线索
§一 · 候选条目汇总(12 条)
| # | 来源 | 标题 | 工程密度 | Substack 筛选 |
|---|---|---|---|---|
| 1 | Ellipsis blog | Lessons from 15 Months of Building LLM Agents | ⭐⭐⭐⭐⭐ | — |
| 2 | FutureAGI blog | RAG Evaluation Metrics Deep Dive 2026 | ⭐⭐⭐⭐⭐ | — |
| 3 | datavlab.ai | RAG Evaluation 2026: Methods, Metrics, Frameworks | ⭐⭐⭐⭐ | — |
| 4 | Latitude.so blog | Agent Engineering 系列(含 self-healing / tool-call errors / observability) | ⭐⭐⭐⭐ | — |
| 5 | MLflow blog | Setting Up LLM Observability Pipelines in 2026 | ⭐⭐⭐⭐ | — |
| 6 | Redis blog | RAG System Evaluation: Metrics, Frameworks & Infrastructure | ⭐⭐⭐ | — |
| 7 | nextbigteng.substack | AI Infrastructure Roadmap: Five frontiers for 2026 | ⭐⭐⭐ | ✅ |
| 8 | aiamastery.substack | Lesson 44: Evaluating Agentic RAG Reliability | ⭐⭐⭐ | ✅ |
| 9 | alexeyondata.substack | What 1,000+ Job Descriptions Reveal About AI Engineer Role 2026 | ⭐⭐⭐ | ✅ |
| 10 | futureagi.substack | Top 5 Tools to Evaluate RAG Performance in 2026 | ⭐⭐⭐ | ✅ |
| 11 | futureagi.substack | LLM Evaluation Frameworks, Metrics, Best Practices 2026 | ⭐⭐⭐ | ✅ |
| 12 | sarthakai.substack | What to Expect from AI Engineering World in 2026 | ⭐⭐ | ✅ |
§二 · 高价值条目详细评估
🔴 保留 ① — Ellipsis: Lessons from 15 Months of Building LLM Agents
链接:https://www.ellipsis.dev/blog/lessons-from-building-llm-agents
作者:Nick Bradford (@nsbradford)
发布时间:2026-05-01
可信度:⭐⭐⭐⭐⭐(公司官方工程博客,生产系统数据)
Substack 规则覆盖:❌ 非 Substack
核心工程内容
五大生产原则(来自真实多 Repo 24/7 部署):
- Context Quality > Prompt Engineering:信息缺失无法靠 prompt 弥补,检索质量决定输出上限
- Structured Output 是生产基线:free-form text 无法解析,JSON + schema 验证 + retry loop 是标准做法
- 沙箱隔离不可妥协:自主执行代码的 Agent 必须有沙箱,无中间地带
- 可配置性:用户需控制 Agent 行为边界、触发条件和告警阈值
- 成本架构:模型路由 + 增量处理 + 缓存是架构需求而非优化选项
成本优化实测数据(每代码审查):
# 每 Agent 调用成本(大致)
# 优化前:$0.80 - $2.50
# 分层模型后:$0.30 - $0.90
# 增量处理后:$0.15 - $0.60
# 加缓存后:$0.08 - $0.35
# 生产平均:$0.12 / 次
可靠性核心结论:LLM 输出非确定性,靠模型精度无法解决,需在系统层构建可靠性(retry 机制)。
保留理由
✅ 真实生产数字(成本、每调用价格) ✅ 多 Repo 落地验证(代码审查、PR 生成、Bug 修复、报表生成) ✅ 具体架构原则而非模糊概念 ✅ 沙箱、Structured Output、成本路由均有明确工程结论
是否精读
建议:精读,适合作为 Agent 工程最佳实践页面的核心参考来源。
🔴 保留 ② — FutureAGI: RAG Evaluation Metrics Deep Dive 2026
链接:https://futureagi.com/blog/rag-evaluation-metrics-deep-dive-2026
发布时间:2026(持续更新)
可信度:⭐⭐⭐⭐⭐(SDK 官方文档,附精确 EvalTemplate ID)
Substack 规则覆盖:❌ 非 Substack(公司博客)
核心工程内容
核心诊断原则:
Aggregate 掩盖了失败层。A RAG pipeline 有两个失败面:检索(返回错误 chunk)和生成(chunk 正确但答案错误)。Aggregate 将 retrieval regression 和 generation regression 合并为一个数字,本该 5 分钟的故障定位拖成 3 天。
分层评估原则:
| 层级 | 指标 | 含义 |
|---|---|---|
| 检索层 | Context Relevance | 返回 chunk 与 query 的相关性 |
| 检索层 | Chunk Attribution | 哪些 chunk 被用于生成答案 |
| 检索层 | Chunk Utilization | chunk 被使用的程度 |
| 生成层 | Groundedness (eval_id=47) | 答案是否仅含支持性内容 |
| 生成层 | Context Adherence (eval_id=5) | 答案是否遵循检索上下文 |
| 生成层 | Completeness (eval_id=10) | 答案完整性 |
| 生成层 | Factual Accuracy (eval_id=66) | 事实准确性 |
| 生成层 | Answer Refusal (eval_id=88) | 拒绝回答的能力 |
代码示例:
from fi.evals import Evaluator
from fi.evals.templates import ContextRelevance, ChunkAttribution, ChunkUtilization
ev = Evaluator(fi_api_key="...", fi_secret_key="...")
retrieval_health = ev.evaluate(
eval_templates=[ContextRelevance(), ChunkAttribution(), ChunkUtilization()],
inputs=[{"input": question, "output": answer, "context": retrieved_chunks}],
)
本地无 API 等价指标:groundedness、faithfulness、claim_support、factual_consistency、context_recall、context_precision、ndcg、mrr、precision_at_k、recall_at_k、context_utilization、answer_relevancy——基于 DeBERTa 模型,无 API 调用开销。
生产观测:
- 离线 eval 覆盖可想到的回归;生产覆盖其余
- 生产追踪:采样 5-10% 流量做 LLM-judge rubrics;Citation validity 和 ChunkUtilization 100% 运行(便宜)
- traceAI:Apache 2.0,50+ AI surface,14 种 span kind,含 first-class RETRIEVER、RERANKER、EMBEDDING
保留理由
✅ 精确 EvalTemplate ID(可直接对应 SDK) ✅ 分层评估原则有明确工程价值(解决 aggregate 掩盖问题) ✅ 代码片段可直接运行 ✅ 本地 NLI 模型替代方案,成本可控
是否精读
建议:精读,RAG 评估页面的方法论核心来源。
🟡 保留 ③ — datavlab.ai: RAG Evaluation 2026 Methods, Metrics, Frameworks
链接:https://datavlab.ai/post/rag-evaluation-methods-metrics-2026-guide
可信度:⭐⭐⭐⭐(行业分析,框架引用准确)
Substack 规则覆盖:❌ 非 Substack
核心工程内容
四个 RAGAS 核心指标: - Faithfulness(0.75 阈值):答案是否仅含检索内容支持的主张 - Answer Relevancy(0.8 阈值):答案是否真正回答了问题 - Context Precision(0.7 阈值):相关 chunk 是否排在前面 - Context Recall(0.8 阈值):检索上下文是否包含回答所需的全部信息
框架生命周期:
探索期 → RAGAS(灵活探索)
CI/CD → DeepEval(自动化测试集成)
生产监控 → Patronus(幻觉检测)/ Langfuse(追踪)/ Lynx(偏见评估)
LLM-judge 评估成本:$0.001-0.003 / 测试用例
六种失败模式: 1. Hallucinated answer(听起来技术正确但内容虚构) 2. Right docs, wrong order(排序错误) 3. Chunk boundary cuts answer(切分位置不当) 4. Generator drifts from context(训练数据冲突导致漂移) 5. Stale retrieval(政策/数据过期) 6. Tool-selection drift(Agent 工具选择漂移)
保留理由
✅ 框架生命周期映射实用(知道什么阶段用什么工具) ✅ 失败模式描述有诊断价值 ✅ LLM-judge 成本数字对预算规划有用
是否精读
建议:参考,RAG 评估框架层面的补充来源,不需要精读。
🟡 保留 ④ — Latitude.so: Agent Engineering 系列
链接:https://latitude.so/blog
可信度:⭐⭐⭐⭐(产品为评估平台,工程内容与产品深度绑定)
Substack 规则覆盖:❌ 非 Substack
近期高价值文章列表
| 文章 | 类型 | 核心内容 |
|---|---|---|
| How We Built a System for Agents to Fix Themselves(7/8) | How-to | 7步自愈循环:遥测→语义搜索→标注→Signals→生成评估→编码Agent→CI回归测试 |
| How to Detect Tool-Call Errors in an Agentic Workflow(7/10) | How-to | Agent 工作流中工具调用错误检测的 12 分钟指南 |
| Agent Observability: Tracing Multi-Turn Conversations(6/30) | Engineering deep-dive | 多轮对话追踪、Langfuse vs LangSmith vs Braintrust 对比 |
| Tracking LLM Failures in Production(6/30) | Engineering deep-dive | 生产 LLM 故障追踪 |
| Real-Time Eval Strategies for LLMs(6/30) | Engineering deep-dive | 实时评估策略 |
| Continuous Drift Detection: Preventing AI Regressions(6/30) | Engineering deep-dive | 漂移检测防 AI 回归 |
| Behavioral Testing for LLMs: Best Practices(6/30) | How-to | LLM 行为测试最佳实践 |
| Managing Data Quality for LLM Evals(6/30) | Engineering deep-dive | 评估数据质量管理 |
关键工程洞察(来自 Observability 文章)
多轮对话可调试性四原则: 1. 稳定 session ID——确保每轮在同一 trace 内 2. 全栈插桩:LLM 调用、工具、内存、护栏 3. 将生产 trace 作为评估数据主要来源 4. 用平台将生产 trace 转为回归测试
平台对比: - Langfuse:开源、自托管、MIT、21K+ GitHub stars,适合需要数据主权的团队 - LangSmith:LangChain/LangGraph 深度集成,数据集实验强,生产 14 天保留/400 天扩展 - Braintrace:从第一天起就把评估作为主工作流,建 golden 数据集
eval 来自生产故障的原则:
Your eval suite should come from what's breaking in production, not from edge cases someone dreamed up in a planning doc.
保留理由
✅ 自愈 Agent 七步法有可操作步骤 ✅ 可调试性原则有工程约束价值 ✅ 平台对比表适合评估工具选型决策
是否精读
建议:参考,系列文章质量参差,"How We Built a System for Agents to Fix Themselves" 适合精读,其余快速浏览。
🟡 保留 ⑤ — MLflow: Setting Up LLM Observability Pipelines in 2026
链接:https://mlflow.org/articles/setting-up-llm-observability-pipelines-in-2026
可信度:⭐⭐⭐⭐(MLflow 官方,Apache 2.0 项目)
Substack 规则覆盖:❌ 非 Substack
核心工程内容
采样率分层策略:
开发/ staging:100% 采样
生产(head-based):10-30% trace 级采样(成本管理)
生产(tail-based):错误或高延迟时触发
OpenTelemetry 插桩验证清单: - 发出测试请求,确认 span 在 backend 出现,属性名正确 - 检查 parent-child 关系完整 - 检查 token counts 存在
LLM 应用调试 vs 传统应用: - 传统应用:stack trace 说明全部问题 - LLM 应用:需要跨 prompt 构建、模型推理、检索步骤、工具调用、评估评分的追踪
保留理由
✅ 采样率具体数字可直接用于架构设计 ✅ OpenTelemetry 验证清单可操作 ✅ 传统调试 vs LLM 调试的对比有教育价值
是否精读
建议:参考,作为 MLflow 官方文档,适合查询而非通读。
§三 · Substack 高价值条目(按规则筛选)
🟡 保留 S1 — nextbigteng: AI Infrastructure Roadmap Five Frontiers 2026
链接:https://nextbigteng.substack.com/p/ai-infrastructure-roadmap-five-frontiers-for-2026
专栏:nextbigteng(AI/基础设施方向)
发布时间:2026
可信度:⭐⭐⭐(行业分析,有具体公司/产品名)
Substack 规则覆盖:✅ 记录
核心观点
五大前沿(2026 AI 基础设施重心转移):
- "Harness" 基础设施:组合 AI 系统需要比基础 RAG 更复杂的记忆基础设施;公司历史数据(CRM、文档)必须被 AI 系统访问以减少幻觉
- 专业化推理优化:新一代 infra 创业公司: - TensorMesh → LMCache(消除冗余重计算) - RadixArk → SGLang 路由调度(多轮对话) - Inferact → vLLM 性能边界 - Gimlet Labs + NVIDIA → 异构推理创新
- 记忆基础设施:企业 AI 系统"组织失忆症"的解法——历史数据和组织知识必须被可访问
- Agent Scaling Law:核心瓶颈从单芯片 FLOPS 转向通信效率、内存墙、全局 TCO
记录要点
- 公司/产品线索:TensorMesh、RadixArk、Inferact、Gimlet Labs
- 方向判断:2026 AI infra 重心从模型竞争转向" Harness "(模型利用层)
- 可信度判断:⭐⭐⭐,行业观察,有具体创业公司名但未深度核验
是否需要核验
建议:核验 TensorMesh / RadixArk / Inferact 官网和 GitHub,判断是否在生产环境使用。
🟡 保留 S2 — aiamastery.substack: Evaluating Agentic RAG Reliability
链接:https://aiamastery.substack.com/p/lesson-44-evaluating-agentic-rag
专栏:AI Mastery Course(教育向,Hands-on AI Agent 系统课程)
发布时间:2026-04-09
可信度:⭐⭐⭐(课程配套,有具体工作流步骤)
Substack 规则覆盖:✅ 记录
核心观点
分层评估采样策略:
Continuous(每次推理):仅便宜指标——answer length、retrieval latency、cache hit rate
Sampled(生产流量 5%):随机样本做完整 Ragas metrics
Scheduled(每晚):对 canonical 测试数据集跑完整 benchmark 套件
评估工作流延伸 L43 的 pipeline trace:Agentic RAG 处理问题时存储结构化 trace,evaluator 异步处理,并行计算指标,写入 metrics store,dashboard 查询展示。
State Machine:与 L43 pipeline trace 配合使用。
记录要点
- 三层评估策略有工程直接参考价值
- 评价:课程内容,实用但偏向教学,非生产一手数据
是否需要核验
建议:无需深度核验,工作流框架可参考,具体阈值需根据实际流量校准。
🟡 保留 S3 — alexeyondata: What 1,000+ Job Descriptions Reveal About AI Engineer Role 2026
链接:https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
专栏:Alex Chen(数据分析向)
发布时间:2026
可信度:⭐⭐⭐(数据驱动,定量统计)
Substack 规则覆盖:✅ 记录
核心数据点
工具使用分布(AI 工程师 JD): - Infra 工具:AWS (40.1%), Docker (31.0%), CI/CD (29.3%), Kubernetes (29.1%), Azure (23.9%), GCP (23.0%) - GenAI 框架:LangChain (18.8%), LangGraph (8.0%), LlamaIndex (5.8%) - LLM 提供商:OpenAI API (8.7%), Anthropic API (5.5%)
角色类型分布(1000+ JD 样本): - AI-first 角色(约 70%):直接做 LLM/GenAI 系统(RAG、agents、评估、生产部署) - AI-support 角色(约 28.5%):基础设施和平台(GPU/inference 基础设施、数据管道、监控) - 传统 ML/DL 角色(<2%):标准 ML/DL(scikit-learn、XGBoost、PyTorch、TensorFlow)
记录要点
- Docker + Kubernetes + CI/CD 是 AI 工程师标准基线(超 29% JD 要求)
- LangChain 仍是最多要求的框架,但 LangGraph 正在增长
- 框架忠诚度不重要,架构理解更重要
是否需要核验
建议:无需深度核验,数据来源未公开原始样本,可作为趋势参考。
🟢 降级 S4 — futureagi.substack: Top 5 Tools to Evaluate RAG Performance in 2026
链接:https://futureagi.substack.com/p/top-5-tools-to-evaluate-rag-performance
专栏:FutureAGI(公司 Substack,与 futureagi.com 同一内容)
可信度:⭐⭐⭐(公司宣传材料,但技术数据准确)
Substack 规则覆盖:✅ 记录
降级理由
此内容与 FutureAGI 官方博客 futureagi.com/blog/rag-evaluation-metrics-deep-dive-2026 高度重复,且 Substack 版本不如官方博客详细。保留作为 Substack 来源线索,不重复收录。
🟢 丢弃 S5 — sarthakai: What to Expect from AI Engineering World in 2026
链接:https://sarthakai.substack.com/p/what-to-expect-from-the-ai-engineering
可信度:⭐⭐(观点综述,无一手数据)
Substack 规则覆盖:✅ 记录
丢弃理由
❌ 无真实环境、命令、错误、源码、性能数据
❌ 属于市场趋势评论,非工程实践
❌ 与已有 alexeyondata 的 JD 分析相比信息密度更低
§四 · 丢弃条目汇总
| # | 来源 | 标题 | 丢弃理由 |
|---|---|---|---|
| 1 | futureagi.substack | Top 5 Tools to Evaluate RAG Performance in 2026 | 与官方博客内容重复,Substack 版信息密度更低 |
| 2 | sarthakai.substack | What to Expect from AI Engineering World in 2026 | 观点综述,无工程细节,不符合工程筛选标准 |
| 3 | theboringfinanceguy.substack | The AI Infrastructure Supercycle | 金融/投资分析,无工程内容 |
§五 · 本次主题标签与建议写入路径
分类标签:#RAG评估 #LLM观测 #Agent工程 #生产可靠性 #Substack线索
建议写入路径:
- 主草稿:/shared/research-kb/inbox/jay/2026-07-13-1500-engineering-filter-rag-eval-observability-jul2026.md
- 参考补充:Ellipsis 的五大原则可并入 Agent 工程最佳实践
- RAG 评估体系:FutureAGI + datavlab + aiamastery 可合并为"RAG 评估方法论 2026Q3"主题页草稿
建议后续行动: 1. 核验 TensorMesh / RadixArk / Inferact 的 GitHub 和官网,确认是否进入生产可用状态 2. 将 Ellipsis 的成本数据纳入 Agent 工程成本估算参考 3. FutureAGI 的 EvalTemplate ID 体系(eval_id=47/5/9/10/11/12/66/88)可作为 RAG 评估页面的标准 ID 索引
本次筛选结论:保留 6 条高价值(5 条技术博客 + 1 条 Substack),降级 2 条,丢弃 3 条。RAG 评估 + LLM 观测 + Agent 可靠性是本轮最密集的工程主题。