工程实践筛选报告 · Jay · 2026-08-08 10:50
主题
LLM/AI 工程实践二次筛选(第三批次)—— 重点判断:真实环境、命令、错误、源码、性能数据、可复现步骤
筛选范围
- 来源:MLflow Blog · Inngest Blog · MetafiedLab · NVIDIA Developer · Thomas Wiegold Blog · Medium(Addy Osmani) · AppScale Blog · dataskew.io · ReactJava Substack · TowardsAI
- 检索关键词:production AI agents, RAG pipeline, inference optimization, LLM evaluation, guardrails, context engineering
✅ 保留条目(含真实工程数据/命令/可复现步骤)
1. MLflow - Building Production-Ready AI Agents in 2026
- 链接:https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
- 保留理由:
- 有真实工程失败模式分析:Skill/plugin security vulnerabilities(运行时安全风险集中在 skill/plugin 边界)、Monolithic agent fragility(单体会导致调试复杂度指数增长)
- 具体安全实践:signed skill manifests、plugin supply chain review、sandbox every skill execution context
- 关键工程原则:LLM 用于意图分类和自然语言理解,确定性执行(事务、财务计算)路由到 typed/testable code
- 工程价值:⭐⭐⭐⭐
- 是否精读:建议精读「Failure Modes and Debugging」章节
2. Inngest - The Principles of Production AI
- 链接:https://www.inngest.com/blog/principles-of-production-ai
- 保留理由:
- 有2026 年 130 工程师基准调查数据(DEV Community 2026)
- 三大支柱框架:LLM Evaluation + Guardrails + Orchestration
- 评估分层实践:prototyping phase → release gate → production monitoring
- LLM as a judge 方法用于生产日志采样评估
- 工程价值:⭐⭐⭐⭐
- 是否精读:可浏览,作为工程框架参考
3. MetafiedLab - How to Build a Production-Ready RAG Pipeline in 2026
- 链接:https://metafiedlab.com/blog/how-to-build-a-production-ready-rag-pipeline-in-2026
- 保留理由(最高工程价值):
- 具体指标阈值:faithfulness >0.85、answer relevancy >0.8、context precision >0.75、context recall >0.8(面向客户系统)
- 三层评估框架:离线测试(50-200 QA pairs 黄金数据集)+ CI/CD 质量门(DeepEval + GitHub Actions)+ 生产监控(5-10% 采样 + 7 天滚动 faithfulness 报警阈值 0.75)
- 具体 benchmark 数据:混合检索比纯 dense 提升 17% recall、语义分块比固定分块提升 70% 准确率
- 幻觉率降低数据:正确实现 RAG 后幻觉率降低 70-90%(对比 standalone LLM)
- 72% 企业 Q1 2026 已上线 RAG(DEV Community 2026)
- 工程价值:⭐⭐⭐⭐⭐
- 是否精读:强烈建议精读,RAG 评估体系完整且可直接落地
4. NVIDIA Developer Blog - Mastering LLM Techniques: Inference Optimization
- 链接:https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization
- 保留理由:
- NVIDIA 官方文档,解释 Prefill vs Decode 两阶段机制
- Prefill:高度并行化,处理输入 token,compute-bound
- Decode:自回归单 token 生成,memory-bound(内存带宽瓶颈)
- KV Cache 机制详解:避免重复计算但导致大 batch/长序列下的内存问题
- 并行策略:tensor parallelism、pipeline parallelism、sequence parallelism
- 工程价值:⭐⭐⭐⭐⭐
- 是否精读:建议精读,理解推理优化底层原理
5. Thomas Wiegold - Prompt Engineering Best Practices 2026
- 链接:https://thomas-wiegold.com/blog/prompt-engineering-best-practices-2026
- 保留理由:
- Context Engineering 新概念:2025 年 6 月 Karpathy 提出 LLM = CPU、context window = RAM
- 核心洞察:生产失败不是坏 prompt,是坏 context assembly(检索错误文档、历史过多、缺少 tool definitions)
- 实战教训:2023-2024 年的 ALL-CAPS 指令式写法已过时
- Phil Schmid(Hugging Face)观点:大多数 agent 失败现在是 context failure 而非 model failure
- 工程价值:⭐⭐⭐⭐
- 是否精读:建议浏览,更新对 context engineering 的认知框架
6. Addy Osmani - My LLM coding workflow going into 2026
- 链接:https://medium.com/@addyosmani/my-llm-coding-workflow-going-into-2026-52fe1681325e
- 保留理由:
- Google 工程师实践,有具体工作流模式
- 核心原则:specs before code、不要让 AI 生成大 monolithic 输出
- 建议:一次只推进一个 ticket 或 step,聚焦 prompt
- 多 agent 并行实验:Conductor 等工具运行 3-4 个 agent 并行任务
- 洞察:AI「奖励已有最佳实践」,深厚软件工程基础者获益更大
- 工程价值:⭐⭐⭐⭐
- 是否精读:建议浏览,学习 AI 辅助工程的工作流组织方式
❌ 丢弃条目(缺乏具体工程细节/错误数据/可复现步骤)
1. AppScale Blog - The Complete Guide to Production LLM Systems 2026
- 链接:https://appscale.blog/en/blog/the-complete-guide-to-production-llm-systems-2026
- 丢弃理由:总结性文章,缺乏具体命令、错误处理、benchmark 数据;内容偏宽泛概述
2. dataskew.io - AI Engineer Roadmap 2026
- 链接:https://dataskew.io/roadmaps/ai-engineering
- 丢弃理由:教育路线图,非生产工程经验;缺少真实场景错误和性能数据
3. ReactJava Substack - 10 Must-Read AI Books
- 链接:https://reactjava.substack.com/p/10-must-read-ai-and-llm-engineering
- 丢弃理由:书单推荐,非原创工程实践;无命令、无错误分析、无性能数据
4. TowardsAI - 25 LLM Best Practices Every Engineer Should Learn
- 链接:https://pub.towardsai.net/25-llm-best-practices-i-believe-every-engineer-should-learn-early-259ce970e06c
- 丢弃理由:通用原则罗列,缺少具体环境、命令、错误场景、可复现步骤
5. Chip Huyen - Building LLM applications for production(经典旧文)
- 链接:https://huyenchip.com/2023/04/11/llm-engineering.html
- 丢弃理由:经典文章但 2023 年,已过时;更多信息已在 2024-2026 年更新版本中覆盖
分类标签
Production AI RAG Evaluation LLM Inference Context Engineering Guardrails Agent Security Multi-Agent Engineering Workflow
建议写入路径
- RAG 工程主题页:
MetafiedLab三层评估框架 + 具体阈值 + benchmark 数据 - 推理优化主题页:
NVIDIA两阶段机制 + KV Cache 原理 - Agent 工程主题页:
MLflow失败模式 + 安全实践 +Addy Osmani工作流 - AI 工程概论页:
Inngest三大支柱框架 + 130 工程师调查数据
综合评估
| 条目 | 优先级 | 来源 | 核心价值 |
|---|---|---|---|
| MetafiedLab RAG Pipeline | P0 | 工程博客 | 完整评估体系 + 具体阈值 |
| NVIDIA Inference Optimization | P0 | 官方文档 | 推理原理 + 两阶段机制 |
| MLflow AI Agents | P1 | 工程博客 | 失败模式 + 安全实践 |
| Addy Osmani Workflow | P1 | Medium | Google 工程师实践 |
| Inngest Principles | P2 | 工程博客 | 框架参考 + 统计数据 |
| Thomas Wiegold Context Eng | P2 | 个人博客 | 新概念认知更新 |
Jay · 2026-08-08 10:50 · 工程实践筛选第三批次草稿