Jay 工程实践筛选 · 2026-08-19 · LLM 工程实战 Roundup
筛选总览
- 本次主题:LLM/RAG/Agent 生产工程 · Inference 优化 · MCP 实践
- 检索范围:Substack(theaiengineer / futureagi / addyo)、arXiv、Lyceum/Zylos/DeployBase 基准站、Render/DevX 工程指南、CSDN 高价值技术文
- 候选条目:20+ 条
- 高价值保留:11 条(含 3 篇 arXiv)
- 丢弃条目:9 条(泛泛概述 / 课程广告 / 无代码的入门科普)
- 分类标签:
AgentRAGInferenceMCPEvaluationProductionBenchmark
🔍 高价值条目(保留)
1. The AI Agents Stack (2026 Edition)
- 来源:theaiengineer.substack.com
- 类型:Stack Map / 架构图
- 工程价值:✅ 极高
- 6 层架构图:LLM → Memory → Tools(MCP) → Agent Logic → Evaluation → Guardrails
- MCP 2026 定位:工具层已全面 MCP 化
- Guardrails 新范式:"guardrails before action"(在工具执行层而非输出层做拦截)
- OWASP MCP Top 10 (beta) 首次发布,工具连接 Agent 安全 checklist
- 推理模型使单步 Agent 替代部分多步 Chain
- Memory 升级为第一等架构原语(不再只是 Vector DB)
- 保留理由:当前最完整的生产 Agent 架构地图,包含 2024→2026 关键变化;是 RAG 与 Agent Stack 关系的最清晰梳理
- 可信度:⭐⭐⭐⭐⭐(专业 AI 工程 Newsletter,10k+ 工程师订阅)
- 后续行动:建议精读 → 更新「Agent 工程」主题页
2. LLM Deployment Best Practices in 2026: A Production Checklist
- 来源:futureagi.com(futureagi Research)
- 类型:工程 Checklist
- 工程价值:✅ 极高
- 7 步生产工作流:scoping → data → base model → fine-tune → gateway → eval → monitor/rollback
- 每步有 exit criteria,可量化判断是否可发布
- 2026 关键判断:observability > scaling(框架 API 变便宜,难点是幻觉/注入/工具失败/漂移/合规审计)
- Prompt versioning + Eval gates 作为发布门槛
- Gateway routing + Fallback 降级模式
- 保留理由:Vendor-neutral,真正可操作的发布检查清单,不是泛泛而谈
- 可信度:⭐⭐⭐⭐(专注 AI 可靠性工程 Newsletter)
- 后续行动:建议审稿 → 可加入「LLM 生产部署 SOP」主题页
3. Production LLM Monitoring Checklist for 2026: 10 Items Before You Ship
- 来源:futureagi.com(同上团队)
- 类型:监控 Checklist
- 工程价值:✅ 高
- 10 项具体检查:OTel 可观测性、eval gates、漂移告警、PII 去标识化、A/B 回滚、runbooks
- Vendor-neutral
- 保留理由:与 #2 配套,构成完整的部署+监控链路
- 可信度:⭐⭐⭐⭐
- 后续行动:建议审稿
4. vLLM vs TensorRT-LLM: 2026 Production Benchmark & Guide
- 来源:lyceum.technology
- 类型:Benchmark + 选型指南
- 工程价值:✅ 极高
- 真实吞吐量数字、延迟数据、成本对比
- vLLM:PagedAttention,连续 batching,OpenAI 兼容 API
- TensorRT-LLM:最高 NVIDIA 性能,复杂配置(1-2 周 setup)
- SGLang:RadixAttention + Prefix Caching,agent/RAG 工作负载领先
- 2026 新变化:H100 价格正常化($3-4/hr),成为 A100 替代默认
- 高可用架构:8xA100 primary + 4xA100 secondary,$29.16/hr,$21,287/月
- 多模型Serving路由策略:简单 query → 小模型,复杂 → 大模型,吞吐提升 40-60%
- 保留理由:少有的工程成本数字 + 硬件配置数据,不是"哪个框架最好"的泛泛讨论
- 可信度:⭐⭐⭐⭐(技术媒体,有具体数字)
- 后续行动:建议精读 → 可加入「Inference 优化」主题页
5. LLM Inference Optimization and Quantization 2026
- 来源:zylos.ai
- 类型:综合优化指南
- 工程价值:✅ 高
- 框架对比表(含真实数字):vLLM 120-160 req/s,SGLang up to 3.1x vLLM,TensorRT-LLM 最高但配置复杂
- 优化层级(按影响力排序):FP8(Hopper) → PagedAttention → Continuous Batching → Speculative Decoding
- FP8:Hopper GPU 2026 新默认,近无损,30%+ 提速
- Continuous Batching:最高 23x 吞吐提升
- Speculative Decoding:2-3x 延迟降低
- KV Cache 优化策略
- Edge 部署:<9B 模型可本地运行
- 保留理由:数字驱动,不是推荐驱动;提供了完整的优化技术栈层级
- 可信度:⭐⭐⭐⭐(Zylos Research 专业基准站)
- 后续行动:建议精读 → 可加入「Inference 优化」主题页
6. MCP Servers in Production: A Complete Guide
- 来源:devxlabs.ai
- 类型:工程实现指南
- 工程价值:✅ 极高
- 为什么 REST API 不是 Agent 工具接口的答案(4 个原因)
- MCP 三原语:Tools(动作)/ Resources(数据)/ Prompts(模板)
- 真实代码结构
- 速率限制 + 幂等性:防止 LLM loop 调用打挂第三方 API
- 幂等 Circuit Breaker + 指数退避
- 请求去重保护(非幂等端点不能被 LLM 重试 50 次)
- 保留理由:工程陷阱(幂等性、速率限制)是非常容易被忽略但会导致生产事故的细节
- 可信度:⭐⭐⭐⭐(DevX Labs 技术博客)
- 后续行动:建议审稿 → 可加入「MCP 工程实践」主题页
7. Building and Hosting MCP Servers: Complete Guide
- 来源:render.com
- 类型:MCP 部署指南
- 工程价值:✅ 高
- Python
fastmcp代码示例(完整可运行片段) - 本地 stdio → 远程 HTTP 的完整过渡路径
- OAuth 实现模式
- 2026 MCP Roadmap:stateless 水平扩展 /
.well-known发现 / 企业审计日志 - Python MCP SDK + TypeScript MCP SDK 双语言对照
- Render 自托管 MCP 服务器参考实现
- 保留理由:Render 大厂背书 + 完整代码示例 + 部署步骤,可直接参照
- 可信度:⭐⭐⭐⭐⭐(Render 官方文档,工程团队可直接参照)
- 后续行动:建议精读 → 可加入「MCP 工程实践」主题页
8. How to Debug MCP Servers in Production (StackOne/Truto)
- 来源:truto.one
- 类型:MCP 生产 Debug + 安全
- 工程价值:✅ 高
- JSON-RPC 检测、Token 生命周期、429 处理(含代码)
- OAuth Identity Passthrough:Token 刷新模式 / 断开时吊销 / 委托链审计
- 事件响应 Runbooks
- Agent-to-Agent Coordination(Q3 2026 路线图):Agent 分层架构
- MCP Registry(Q4 2026):安全审计 + 使用统计 + SLA 承诺
- 保留理由:生产级 Debug + 安全视角,填补了很多教程的空白
- 可信度:⭐⭐⭐⭐(工程安全深度文章)
- 后续行动:建议审稿
9. My LLM Coding Workflow Going Into 2026 (Addy Osmani)
- 来源:addyo.substack.com
- 类型:工程工作流
- 工程价值:✅ 高
- Specs before code:不要直接丢给 LLM,先定义问题和解决方案
- 小块迭代(one function/fix bug at a time)而非大段输出
- AI "reward existing best practices":软件工程基础越好 AI 放大效果越强
- Simon Willison 观点:高级工程师的核心技能(设计系统、管理复杂度、知道什么该自动化)正是 AI 最放大的东西
- AI-native 工程师 = 高层抽象能力 + AI 代劳 boilerplate,但需要人先有设计能力
- 保留理由:来自 Google 工程师的真实工作流反思,不是工具推荐
- 可信度:⭐⭐⭐⭐⭐(Addy Osmani,Google 工程师,AI 工程社区重要声音)
- 后续行动:建议精读 → 可加入「AI 工程方法论」主题页
10. Measuring Agents in Production (arXiv 2512.04123)
- 来源:arXiv pdf
- 类型:学术 Survey
- 工程价值:✅ 高
- 真实生产 Agent 数据(MAP 项目,31 名从业者访谈)
- 评估方法分布:74.2% 有人工回环,51.6% LLM-as-Judge,41.9% RAG+知识图谱,38.7% 规则检查
- 66% 回答"用了 Agent 相比替代方案更好了";34%"替代方案不存在"
- 部署环境:read-only 模式最小化失败影响
- 34% 生产 Agent 无任何替代方案对比(说明 Agent 本身的价值尚无基准)
- 生产 Agent 主要痛点:工具调用可靠性、上下文长度管理、多步骤推理漂移
- 保留理由:少有的生产 Agent 实证数据,不是论文benchmark
- 可信度:⭐⭐⭐⭐⭐(ICML 2026 论文,UC Berkeley + IBM Research)
- 后续行动:建议精读 → 可加入「Agent 工程」主题页的数据支撑
11. Harness Engineering for Auditable Enterprise LLM Agents (arXiv 2607.08028)
- 来源:arXiv html
- 类型:学术论文
- 工程价值:✅ 高
- 企业 Agent 审计框架:harness = output contract + recovery path + audit trail
- OpenRouter 作为路由基础设施,请求 3 个模型(Claude Sonnet 4 / GPT-4.1-mini / Gemini-2.5-Flash)
- JSON output artifact 存储:
evals/results/live-llm-composition-boundary.full-30x3.2026-06-03.json - 跟踪内容:model ID / output-contract status / recovery path / harness-contract result / hash + preview
- 不存储原始 LLM 输出(隐私合规),只存 trace 元数据
- Composition boundary check:模型组合边界敏感性记录
- 保留理由:企业级合规审计的实际工程架构,有代码级别的输出规范设计
- 可信度:⭐⭐⭐⭐⭐(Hanwha + 学术机构联合研究,工程导向)
- 后续行动:建议审稿 → 可加入「Agent 安全/合规」主题页
12. Context Engineering: From Prompts to Corporate Multi-Agent Architecture (arXiv 2603.09619)
- 来源:arXiv pdf
- 类型:学术论文
- 工程价值:✅ 高
- Context Engineering 正式定义:超越 Prompt Engineering 的系统设计学科
- 4 层累积成熟度金字塔:Prompt Engineering → Context Engineering → Intent Engineering → Specification Engineering
- 多 Agent 编排中的可控性问题:谁看到什么?哪条策略适用于哪个 Agent?状态如何转移?
- MCP + A2A(Agent-to-Agent Protocol) 作为上下文边界的实现手段
- Deloitte 2026 调查:75% 企业计划 2 年内部署 Agentic AI,但仅 34% 报告深度转型成功
- KPMG 2026:Agent 部署从 Q1 11% 飙升到 Q3 42%,Q4 回落到 26%(从试点转向生产级难度显现)
- Token 计费经济性:Agent 经济上不划算往往比技术上失败来得更早
- 保留理由:制度化学术视角,填补"上下文边界"工程设计的空白
- 可信度:⭐⭐⭐⭐⭐(完整学术论文,引用丰富)
- 后续行动:建议审稿 → 可加入「多 Agent 架构」主题页
13. CSDN 高价值:RAG+AI Agent 企业级方案(可运行代码)
- 来源:CSDN OPC
- 类型:代码实战
- 工程价值:✅ 中高(有代码但质量中等)
- LangChain AgentExecutor 完整代码片段(Python)
- RAG Chain:
retriever | format_docs | prompt | llm | StrOutputParser - 企业场景:温度 0.1~0.3、函数调用、多工具 Agent
- 生产部署:FastAPI + Uvicorn、Milvus Docker + K8s
- 检索优化:bge-reranker、混合检索(向量+关键词)、动态 Top-K
- 数据安全:私有化部署、内网隔离、权限控制
- 保留理由:唯一含生产级 Docker/K8s 部署方案的 CSDN 文章;有完整可运行代码片段
- 可信度:⭐⭐⭐(CSDN 博客,有代码但缺乏版本环境说明)
- 后续行动:建议验证代码版本后收录
14. CSDN:Elasticsearch MCP OAuth2.1 认证
- 来源:CSDN 博客
- 类型:安全工程
- 工程价值:✅ 中高
- OAuth2.1 替代 API Key 的完整实现方案
- 短期令牌 + 30 天自动刷新 + 单独撤销机制
- 每个连接独立权限 + 审计能力
- 解决了 API Key 长期有效导致的安全风险
- 保留理由:MCP 安全落地的真实实现参考
- 可信度:⭐⭐⭐(CSDN 搬运 Elastic 官方博客)
- 后续行动:建议核实原始 Elastic 文档后收录
❌ 丢弃条目及理由
| 标题 | 丢弃理由 |
|---|---|
| 11 Must-Read AI Books (javarevisited) | 书单整理,无代码/无工程细节,仅作参考 |
| The 2026 Roadmap: Production AI/ML (jamwithai) | 课程广告,无新工程内容,仅 Q1-Q4 时间线 |
| AI Skills Are Changing Faster (packtdatapro) | 技能概述文章,无具体命令/步骤/数据 |
| The 2026 Path to Learning AI Agents (aiagentssimplified) | 入门路径图,无工程深度,无代码 |
| Beyond Naive RAG (Medium/vskrishnan) | 偏概念,Agentic RAG 描述多但实际步骤少 |
| 一文读懂2026年大模型核心 (CSDN) | 科普概述,无代码/无排障经验,不符合高价值标准 |
| AI Engineers/influencing in 2026 (LinkedIn) | 纯观点帖,"notebook to production" 洞见有趣但无工程细节 |
| The AI/ML Engineer Interview Guide (thecuriousmak) | 面试指南,非工程实践,不符合本轮筛选重点 |
| LangChain State of Agent Engineering (langchain.com) | 报告类,付费,无公开技术细节 |
📋 建议写入路径
/shared/research-kb/inbox/jay/
└── 2026-08-19-llm-engineering-roundup.md ← 本次草稿(已写入)
🎯 后续行动建议
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 精读 | The AI Agents Stack (2026 Edition) → 更新 Agent 主题页 | #1 |
| 🔴 精读 | Addy Osmani 工作流 → 加入 AI 工程方法论 | #9 |
| 🔴 精读 | arXiv Measuring Agents in Production → 数据支撑 Agent 主题 | #10 |
| 🟡 审稿 | LLM Deployment Checklist + Monitoring Checklist | #2, #3 |
| 🟡 审稿 | MCP Servers in Production Guide + Render 部署指南 | #6, #7 |
| 🟡 审稿 | arXiv Harness Engineering + Context Engineering | #11, #12 |
| 🟢 验证 | CSDN RAG+Agent 企业方案代码版本 | #13 |
| 🟢 验证 | CSDN Elasticsearch MCP OAuth 原始文档 | #14 |
Jay · 2026-08-19 · 工程文章二次筛选 · 第 2 轮