工程实践筛选报告 · Jay · 2026-08-08 10:50

主题

LLM/AI 工程实践二次筛选(第三批次)—— 重点判断:真实环境、命令、错误、源码、性能数据、可复现步骤


筛选范围

  • 来源:MLflow Blog · Inngest Blog · MetafiedLab · NVIDIA Developer · Thomas Wiegold Blog · Medium(Addy Osmani) · AppScale Blog · dataskew.io · ReactJava Substack · TowardsAI
  • 检索关键词:production AI agents, RAG pipeline, inference optimization, LLM evaluation, guardrails, context engineering

✅ 保留条目(含真实工程数据/命令/可复现步骤)

1. MLflow - Building Production-Ready AI Agents in 2026

  • 链接:https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
  • 保留理由
  • 有真实工程失败模式分析:Skill/plugin security vulnerabilities(运行时安全风险集中在 skill/plugin 边界)、Monolithic agent fragility(单体会导致调试复杂度指数增长)
  • 具体安全实践:signed skill manifests、plugin supply chain review、sandbox every skill execution context
  • 关键工程原则:LLM 用于意图分类和自然语言理解,确定性执行(事务、财务计算)路由到 typed/testable code
  • 工程价值:⭐⭐⭐⭐
  • 是否精读:建议精读「Failure Modes and Debugging」章节

2. Inngest - The Principles of Production AI

  • 链接:https://www.inngest.com/blog/principles-of-production-ai
  • 保留理由
  • 2026 年 130 工程师基准调查数据(DEV Community 2026)
  • 三大支柱框架:LLM Evaluation + Guardrails + Orchestration
  • 评估分层实践:prototyping phase → release gate → production monitoring
  • LLM as a judge 方法用于生产日志采样评估
  • 工程价值:⭐⭐⭐⭐
  • 是否精读:可浏览,作为工程框架参考

3. MetafiedLab - How to Build a Production-Ready RAG Pipeline in 2026

  • 链接:https://metafiedlab.com/blog/how-to-build-a-production-ready-rag-pipeline-in-2026
  • 保留理由(最高工程价值):
  • 具体指标阈值:faithfulness >0.85、answer relevancy >0.8、context precision >0.75、context recall >0.8(面向客户系统)
  • 三层评估框架:离线测试(50-200 QA pairs 黄金数据集)+ CI/CD 质量门(DeepEval + GitHub Actions)+ 生产监控(5-10% 采样 + 7 天滚动 faithfulness 报警阈值 0.75)
  • 具体 benchmark 数据:混合检索比纯 dense 提升 17% recall、语义分块比固定分块提升 70% 准确率
  • 幻觉率降低数据:正确实现 RAG 后幻觉率降低 70-90%(对比 standalone LLM)
  • 72% 企业 Q1 2026 已上线 RAG(DEV Community 2026)
  • 工程价值:⭐⭐⭐⭐⭐
  • 是否精读强烈建议精读,RAG 评估体系完整且可直接落地

4. NVIDIA Developer Blog - Mastering LLM Techniques: Inference Optimization

  • 链接:https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization
  • 保留理由
  • NVIDIA 官方文档,解释 Prefill vs Decode 两阶段机制
  • Prefill:高度并行化,处理输入 token,compute-bound
  • Decode:自回归单 token 生成,memory-bound(内存带宽瓶颈)
  • KV Cache 机制详解:避免重复计算但导致大 batch/长序列下的内存问题
  • 并行策略:tensor parallelism、pipeline parallelism、sequence parallelism
  • 工程价值:⭐⭐⭐⭐⭐
  • 是否精读:建议精读,理解推理优化底层原理

5. Thomas Wiegold - Prompt Engineering Best Practices 2026

  • 链接:https://thomas-wiegold.com/blog/prompt-engineering-best-practices-2026
  • 保留理由
  • Context Engineering 新概念:2025 年 6 月 Karpathy 提出 LLM = CPU、context window = RAM
  • 核心洞察:生产失败不是坏 prompt,是坏 context assembly(检索错误文档、历史过多、缺少 tool definitions)
  • 实战教训:2023-2024 年的 ALL-CAPS 指令式写法已过时
  • Phil Schmid(Hugging Face)观点:大多数 agent 失败现在是 context failure 而非 model failure
  • 工程价值:⭐⭐⭐⭐
  • 是否精读:建议浏览,更新对 context engineering 的认知框架

6. Addy Osmani - My LLM coding workflow going into 2026

  • 链接:https://medium.com/@addyosmani/my-llm-coding-workflow-going-into-2026-52fe1681325e
  • 保留理由
  • Google 工程师实践,有具体工作流模式
  • 核心原则:specs before code、不要让 AI 生成大 monolithic 输出
  • 建议:一次只推进一个 ticket 或 step,聚焦 prompt
  • 多 agent 并行实验:Conductor 等工具运行 3-4 个 agent 并行任务
  • 洞察:AI「奖励已有最佳实践」,深厚软件工程基础者获益更大
  • 工程价值:⭐⭐⭐⭐
  • 是否精读:建议浏览,学习 AI 辅助工程的工作流组织方式

❌ 丢弃条目(缺乏具体工程细节/错误数据/可复现步骤)

1. AppScale Blog - The Complete Guide to Production LLM Systems 2026

  • 链接:https://appscale.blog/en/blog/the-complete-guide-to-production-llm-systems-2026
  • 丢弃理由:总结性文章,缺乏具体命令、错误处理、benchmark 数据;内容偏宽泛概述

2. dataskew.io - AI Engineer Roadmap 2026

  • 链接:https://dataskew.io/roadmaps/ai-engineering
  • 丢弃理由:教育路线图,非生产工程经验;缺少真实场景错误和性能数据

3. ReactJava Substack - 10 Must-Read AI Books

  • 链接:https://reactjava.substack.com/p/10-must-read-ai-and-llm-engineering
  • 丢弃理由:书单推荐,非原创工程实践;无命令、无错误分析、无性能数据

4. TowardsAI - 25 LLM Best Practices Every Engineer Should Learn

  • 链接:https://pub.towardsai.net/25-llm-best-practices-i-believe-every-engineer-should-learn-early-259ce970e06c
  • 丢弃理由:通用原则罗列,缺少具体环境、命令、错误场景、可复现步骤

5. Chip Huyen - Building LLM applications for production(经典旧文)

  • 链接:https://huyenchip.com/2023/04/11/llm-engineering.html
  • 丢弃理由:经典文章但 2023 年,已过时;更多信息已在 2024-2026 年更新版本中覆盖

分类标签

Production AI RAG Evaluation LLM Inference Context Engineering Guardrails Agent Security Multi-Agent Engineering Workflow


建议写入路径

  • RAG 工程主题页MetafiedLab 三层评估框架 + 具体阈值 + benchmark 数据
  • 推理优化主题页NVIDIA 两阶段机制 + KV Cache 原理
  • Agent 工程主题页MLflow 失败模式 + 安全实践 + Addy Osmani 工作流
  • AI 工程概论页Inngest 三大支柱框架 + 130 工程师调查数据

综合评估

条目 优先级 来源 核心价值
MetafiedLab RAG Pipeline P0 工程博客 完整评估体系 + 具体阈值
NVIDIA Inference Optimization P0 官方文档 推理原理 + 两阶段机制
MLflow AI Agents P1 工程博客 失败模式 + 安全实践
Addy Osmani Workflow P1 Medium Google 工程师实践
Inngest Principles P2 工程博客 框架参考 + 统计数据
Thomas Wiegold Context Eng P2 个人博客 新概念认知更新

Jay · 2026-08-08 10:50 · 工程实践筛选第三批次草稿