Jay 工程实践筛选 · 2026-08-19 · LLM 工程实战 Roundup

筛选总览

  • 本次主题:LLM/RAG/Agent 生产工程 · Inference 优化 · MCP 实践
  • 检索范围:Substack(theaiengineer / futureagi / addyo)、arXiv、Lyceum/Zylos/DeployBase 基准站、Render/DevX 工程指南、CSDN 高价值技术文
  • 候选条目:20+ 条
  • 高价值保留:11 条(含 3 篇 arXiv)
  • 丢弃条目:9 条(泛泛概述 / 课程广告 / 无代码的入门科普)
  • 分类标签Agent RAG Inference MCP Evaluation Production Benchmark

🔍 高价值条目(保留)

1. The AI Agents Stack (2026 Edition)

  • 来源theaiengineer.substack.com
  • 类型:Stack Map / 架构图
  • 工程价值:✅ 极高
  • 6 层架构图:LLM → Memory → Tools(MCP) → Agent Logic → Evaluation → Guardrails
  • MCP 2026 定位:工具层已全面 MCP 化
  • Guardrails 新范式:"guardrails before action"(在工具执行层而非输出层做拦截)
  • OWASP MCP Top 10 (beta) 首次发布,工具连接 Agent 安全 checklist
  • 推理模型使单步 Agent 替代部分多步 Chain
  • Memory 升级为第一等架构原语(不再只是 Vector DB)
  • 保留理由:当前最完整的生产 Agent 架构地图,包含 2024→2026 关键变化;是 RAG 与 Agent Stack 关系的最清晰梳理
  • 可信度:⭐⭐⭐⭐⭐(专业 AI 工程 Newsletter,10k+ 工程师订阅)
  • 后续行动:建议精读 → 更新「Agent 工程」主题页

2. LLM Deployment Best Practices in 2026: A Production Checklist

  • 来源futureagi.com(futureagi Research)
  • 类型:工程 Checklist
  • 工程价值:✅ 极高
  • 7 步生产工作流:scoping → data → base model → fine-tune → gateway → eval → monitor/rollback
  • 每步有 exit criteria,可量化判断是否可发布
  • 2026 关键判断:observability > scaling(框架 API 变便宜,难点是幻觉/注入/工具失败/漂移/合规审计)
  • Prompt versioning + Eval gates 作为发布门槛
  • Gateway routing + Fallback 降级模式
  • 保留理由:Vendor-neutral,真正可操作的发布检查清单,不是泛泛而谈
  • 可信度:⭐⭐⭐⭐(专注 AI 可靠性工程 Newsletter)
  • 后续行动:建议审稿 → 可加入「LLM 生产部署 SOP」主题页

3. Production LLM Monitoring Checklist for 2026: 10 Items Before You Ship

  • 来源:futureagi.com(同上团队)
  • 类型:监控 Checklist
  • 工程价值:✅ 高
  • 10 项具体检查:OTel 可观测性、eval gates、漂移告警、PII 去标识化、A/B 回滚、runbooks
  • Vendor-neutral
  • 保留理由:与 #2 配套,构成完整的部署+监控链路
  • 可信度:⭐⭐⭐⭐
  • 后续行动:建议审稿

4. vLLM vs TensorRT-LLM: 2026 Production Benchmark & Guide

  • 来源lyceum.technology
  • 类型:Benchmark + 选型指南
  • 工程价值:✅ 极高
  • 真实吞吐量数字、延迟数据、成本对比
  • vLLM:PagedAttention,连续 batching,OpenAI 兼容 API
  • TensorRT-LLM:最高 NVIDIA 性能,复杂配置(1-2 周 setup)
  • SGLang:RadixAttention + Prefix Caching,agent/RAG 工作负载领先
  • 2026 新变化:H100 价格正常化($3-4/hr),成为 A100 替代默认
  • 高可用架构:8xA100 primary + 4xA100 secondary,$29.16/hr,$21,287/月
  • 多模型Serving路由策略:简单 query → 小模型,复杂 → 大模型,吞吐提升 40-60%
  • 保留理由:少有的工程成本数字 + 硬件配置数据,不是"哪个框架最好"的泛泛讨论
  • 可信度:⭐⭐⭐⭐(技术媒体,有具体数字)
  • 后续行动:建议精读 → 可加入「Inference 优化」主题页

5. LLM Inference Optimization and Quantization 2026

  • 来源zylos.ai
  • 类型:综合优化指南
  • 工程价值:✅ 高
  • 框架对比表(含真实数字):vLLM 120-160 req/s,SGLang up to 3.1x vLLM,TensorRT-LLM 最高但配置复杂
  • 优化层级(按影响力排序):FP8(Hopper) → PagedAttention → Continuous Batching → Speculative Decoding
  • FP8:Hopper GPU 2026 新默认,近无损,30%+ 提速
  • Continuous Batching:最高 23x 吞吐提升
  • Speculative Decoding:2-3x 延迟降低
  • KV Cache 优化策略
  • Edge 部署:<9B 模型可本地运行
  • 保留理由:数字驱动,不是推荐驱动;提供了完整的优化技术栈层级
  • 可信度:⭐⭐⭐⭐(Zylos Research 专业基准站)
  • 后续行动:建议精读 → 可加入「Inference 优化」主题页

6. MCP Servers in Production: A Complete Guide

  • 来源devxlabs.ai
  • 类型:工程实现指南
  • 工程价值:✅ 极高
  • 为什么 REST API 不是 Agent 工具接口的答案(4 个原因)
  • MCP 三原语:Tools(动作)/ Resources(数据)/ Prompts(模板)
  • 真实代码结构
  • 速率限制 + 幂等性:防止 LLM loop 调用打挂第三方 API
  • 幂等 Circuit Breaker + 指数退避
  • 请求去重保护(非幂等端点不能被 LLM 重试 50 次)
  • 保留理由:工程陷阱(幂等性、速率限制)是非常容易被忽略但会导致生产事故的细节
  • 可信度:⭐⭐⭐⭐(DevX Labs 技术博客)
  • 后续行动:建议审稿 → 可加入「MCP 工程实践」主题页

7. Building and Hosting MCP Servers: Complete Guide

  • 来源render.com
  • 类型:MCP 部署指南
  • 工程价值:✅ 高
  • Python fastmcp 代码示例(完整可运行片段)
  • 本地 stdio → 远程 HTTP 的完整过渡路径
  • OAuth 实现模式
  • 2026 MCP Roadmap:stateless 水平扩展 / .well-known 发现 / 企业审计日志
  • Python MCP SDK + TypeScript MCP SDK 双语言对照
  • Render 自托管 MCP 服务器参考实现
  • 保留理由:Render 大厂背书 + 完整代码示例 + 部署步骤,可直接参照
  • 可信度:⭐⭐⭐⭐⭐(Render 官方文档,工程团队可直接参照)
  • 后续行动:建议精读 → 可加入「MCP 工程实践」主题页

8. How to Debug MCP Servers in Production (StackOne/Truto)

  • 来源truto.one
  • 类型:MCP 生产 Debug + 安全
  • 工程价值:✅ 高
  • JSON-RPC 检测、Token 生命周期、429 处理(含代码)
  • OAuth Identity Passthrough:Token 刷新模式 / 断开时吊销 / 委托链审计
  • 事件响应 Runbooks
  • Agent-to-Agent Coordination(Q3 2026 路线图):Agent 分层架构
  • MCP Registry(Q4 2026):安全审计 + 使用统计 + SLA 承诺
  • 保留理由:生产级 Debug + 安全视角,填补了很多教程的空白
  • 可信度:⭐⭐⭐⭐(工程安全深度文章)
  • 后续行动:建议审稿

9. My LLM Coding Workflow Going Into 2026 (Addy Osmani)

  • 来源addyo.substack.com
  • 类型:工程工作流
  • 工程价值:✅ 高
  • Specs before code:不要直接丢给 LLM,先定义问题和解决方案
  • 小块迭代(one function/fix bug at a time)而非大段输出
  • AI "reward existing best practices":软件工程基础越好 AI 放大效果越强
  • Simon Willison 观点:高级工程师的核心技能(设计系统、管理复杂度、知道什么该自动化)正是 AI 最放大的东西
  • AI-native 工程师 = 高层抽象能力 + AI 代劳 boilerplate,但需要人先有设计能力
  • 保留理由:来自 Google 工程师的真实工作流反思,不是工具推荐
  • 可信度:⭐⭐⭐⭐⭐(Addy Osmani,Google 工程师,AI 工程社区重要声音)
  • 后续行动:建议精读 → 可加入「AI 工程方法论」主题页

10. Measuring Agents in Production (arXiv 2512.04123)

  • 来源arXiv pdf
  • 类型:学术 Survey
  • 工程价值:✅ 高
  • 真实生产 Agent 数据(MAP 项目,31 名从业者访谈)
  • 评估方法分布:74.2% 有人工回环,51.6% LLM-as-Judge,41.9% RAG+知识图谱,38.7% 规则检查
  • 66% 回答"用了 Agent 相比替代方案更好了";34%"替代方案不存在"
  • 部署环境:read-only 模式最小化失败影响
  • 34% 生产 Agent 无任何替代方案对比(说明 Agent 本身的价值尚无基准)
  • 生产 Agent 主要痛点:工具调用可靠性、上下文长度管理、多步骤推理漂移
  • 保留理由:少有的生产 Agent 实证数据,不是论文benchmark
  • 可信度:⭐⭐⭐⭐⭐(ICML 2026 论文,UC Berkeley + IBM Research)
  • 后续行动:建议精读 → 可加入「Agent 工程」主题页的数据支撑

11. Harness Engineering for Auditable Enterprise LLM Agents (arXiv 2607.08028)

  • 来源arXiv html
  • 类型:学术论文
  • 工程价值:✅ 高
  • 企业 Agent 审计框架:harness = output contract + recovery path + audit trail
  • OpenRouter 作为路由基础设施,请求 3 个模型(Claude Sonnet 4 / GPT-4.1-mini / Gemini-2.5-Flash)
  • JSON output artifact 存储:evals/results/live-llm-composition-boundary.full-30x3.2026-06-03.json
  • 跟踪内容:model ID / output-contract status / recovery path / harness-contract result / hash + preview
  • 不存储原始 LLM 输出(隐私合规),只存 trace 元数据
  • Composition boundary check:模型组合边界敏感性记录
  • 保留理由:企业级合规审计的实际工程架构,有代码级别的输出规范设计
  • 可信度:⭐⭐⭐⭐⭐(Hanwha + 学术机构联合研究,工程导向)
  • 后续行动:建议审稿 → 可加入「Agent 安全/合规」主题页

12. Context Engineering: From Prompts to Corporate Multi-Agent Architecture (arXiv 2603.09619)

  • 来源arXiv pdf
  • 类型:学术论文
  • 工程价值:✅ 高
  • Context Engineering 正式定义:超越 Prompt Engineering 的系统设计学科
  • 4 层累积成熟度金字塔:Prompt Engineering → Context Engineering → Intent Engineering → Specification Engineering
  • 多 Agent 编排中的可控性问题:谁看到什么?哪条策略适用于哪个 Agent?状态如何转移?
  • MCP + A2A(Agent-to-Agent Protocol) 作为上下文边界的实现手段
  • Deloitte 2026 调查:75% 企业计划 2 年内部署 Agentic AI,但仅 34% 报告深度转型成功
  • KPMG 2026:Agent 部署从 Q1 11% 飙升到 Q3 42%,Q4 回落到 26%(从试点转向生产级难度显现)
  • Token 计费经济性:Agent 经济上不划算往往比技术上失败来得更早
  • 保留理由:制度化学术视角,填补"上下文边界"工程设计的空白
  • 可信度:⭐⭐⭐⭐⭐(完整学术论文,引用丰富)
  • 后续行动:建议审稿 → 可加入「多 Agent 架构」主题页

13. CSDN 高价值:RAG+AI Agent 企业级方案(可运行代码)

  • 来源CSDN OPC
  • 类型:代码实战
  • 工程价值:✅ 中高(有代码但质量中等)
  • LangChain AgentExecutor 完整代码片段(Python)
  • RAG Chain:retriever | format_docs | prompt | llm | StrOutputParser
  • 企业场景:温度 0.1~0.3、函数调用、多工具 Agent
  • 生产部署:FastAPI + Uvicorn、Milvus Docker + K8s
  • 检索优化:bge-reranker、混合检索(向量+关键词)、动态 Top-K
  • 数据安全:私有化部署、内网隔离、权限控制
  • 保留理由:唯一含生产级 Docker/K8s 部署方案的 CSDN 文章;有完整可运行代码片段
  • 可信度:⭐⭐⭐(CSDN 博客,有代码但缺乏版本环境说明)
  • 后续行动:建议验证代码版本后收录

14. CSDN:Elasticsearch MCP OAuth2.1 认证

  • 来源CSDN 博客
  • 类型:安全工程
  • 工程价值:✅ 中高
  • OAuth2.1 替代 API Key 的完整实现方案
  • 短期令牌 + 30 天自动刷新 + 单独撤销机制
  • 每个连接独立权限 + 审计能力
  • 解决了 API Key 长期有效导致的安全风险
  • 保留理由:MCP 安全落地的真实实现参考
  • 可信度:⭐⭐⭐(CSDN 搬运 Elastic 官方博客)
  • 后续行动:建议核实原始 Elastic 文档后收录

❌ 丢弃条目及理由

标题 丢弃理由
11 Must-Read AI Books (javarevisited) 书单整理,无代码/无工程细节,仅作参考
The 2026 Roadmap: Production AI/ML (jamwithai) 课程广告,无新工程内容,仅 Q1-Q4 时间线
AI Skills Are Changing Faster (packtdatapro) 技能概述文章,无具体命令/步骤/数据
The 2026 Path to Learning AI Agents (aiagentssimplified) 入门路径图,无工程深度,无代码
Beyond Naive RAG (Medium/vskrishnan) 偏概念,Agentic RAG 描述多但实际步骤少
一文读懂2026年大模型核心 (CSDN) 科普概述,无代码/无排障经验,不符合高价值标准
AI Engineers/influencing in 2026 (LinkedIn) 纯观点帖,"notebook to production" 洞见有趣但无工程细节
The AI/ML Engineer Interview Guide (thecuriousmak) 面试指南,非工程实践,不符合本轮筛选重点
LangChain State of Agent Engineering (langchain.com) 报告类,付费,无公开技术细节

📋 建议写入路径

/shared/research-kb/inbox/jay/
└── 2026-08-19-llm-engineering-roundup.md   ← 本次草稿(已写入)

🎯 后续行动建议

优先级 行动 关联条目
🔴 精读 The AI Agents Stack (2026 Edition) → 更新 Agent 主题页 #1
🔴 精读 Addy Osmani 工作流 → 加入 AI 工程方法论 #9
🔴 精读 arXiv Measuring Agents in Production → 数据支撑 Agent 主题 #10
🟡 审稿 LLM Deployment Checklist + Monitoring Checklist #2, #3
🟡 审稿 MCP Servers in Production Guide + Render 部署指南 #6, #7
🟡 审稿 arXiv Harness Engineering + Context Engineering #11, #12
🟢 验证 CSDN RAG+Agent 企业方案代码版本 #13
🟢 验证 CSDN Elasticsearch MCP OAuth 原始文档 #14

Jay · 2026-08-19 · 工程文章二次筛选 · 第 2 轮