工程实践筛选报告 · Jay · 2026-08-12

任务概述

  • 执行时间: 2026-08-12 14:50 (Asia/Shanghai)
  • 检索范围: arXiv、GitHub、Hugging Face、技术博客、Substack、工程实践
  • 主题: LLM Inference / Agent / RAG / MLOps 工程实践
  • 去重检查: 已查阅 inbox 目录(flyp/jay/spark/stephen/tom)

候选条目汇总(按工程价值排序)

🔴 高价值条目(保留)

1. The Engineering Behind LLM Inference: Serving in Production — YouTube · Aug 2026

分类: LLM Inference · Serving Architecture 保留理由: - 连续 batching (Orca) 如何实现 36.9x throughput 提升的具体数据 - PagedAttention、KV Cache 调度细节 - Sarathi-Serve chunked prefill 机制 - Prefill/Decode 分离(DistServe/Splitwise)的生产实践 - SGLang 96 H100 实测:52,300 input + 22,300 output tokens/sec/node 工程指标: 有具体 benchmark 数字 建议: ⭐ 精读,建议纳入 inference engineering 主题页

2. The Engineering Behind LLM Inference: Speculative Decoding and Long Context — YouTube · Aug 2026

分类: LLM Inference · Speculative Decoding 保留理由: - Medusa、EAGLE、Lookahead Decoding 的具体 acceptance rule - 尾延迟(P99)在生产中的实际意义 - Fleet sizing 基于尾延迟而非平均值 工程指标: 有具体技术细节 建议: ⭐ 精读

3. vLLM vs TensorRT-LLM: 2026 Production Benchmarks — Lyceum Technology

分类: LLM Inference · GPU Serving 保留理由: - vLLM PagedAttention 原理:KV cache 虚拟内存管理 - Continuous batching 机制 - SGLang 作为第三候选的 RadixAttention + Prefix Caching - 三种场景选型:High-Throughput API、Real-Time Interactive、Regulated European Enterprise 工程指标: 有场景化选型建议 建议: ⭐ 精读,适合工程选型参考

4. Serving Fine-Tuned LLMs on Serverless GPUs — Cerebrium

分类: LLM Inference · Serverless · Cost Optimization 保留理由: - 实测数据:Llama-3-8B FP8 on A10 → ~1700 output tokens/sec - 权重加载时间:~10-15秒(GPU memory load) - Full vLLM cold start on g5.12xlarge:~50秒 - Snapshot restore from S3:2.25秒(9GiB checkpoint) - Snapshot restore from NVMe:9秒 - GPU成本对比:A100 80GB $0.000592/s vs H100 $0.000953/s 工程指标: 具体命令、实测延迟、成本数据 建议: ⭐⭐ 强保留,可复现步骤,成本计算可直接使用

5. arxiv:2608.01526v1 — An Internet for the KV Cache — arXiv · 2026

分类: LLM Inference · KV Cache Optimization 保留理由: - KV Cache 复用作为一等公民的系统设计理念 - DeepSeek-V3.2 → V4-Pro:100K tokens KV Cache 从 9GB 压缩到 1GB(9x) - SOLA/ThunderServe/Seesaw/Libra 等调度算法对比 - 生产级 KV Cache 管理策略 工程指标: 有量化数据 建议: ⭐ 精读,KV Cache 是 2026 inference 优化核心

6. Prompt, Context, Loop: The Three Engineering Layers Every RAG System Is Built On — Towards Data Science

分类: RAG · Agent Loop · Context Engineering 保留理由: - 2022 单轮 QA vs 2026 多智能体 40 turn/6小时 的场景演变 - Loop Engineering 作为新兴工程层(2026年5月 Boris Cherny 提出"Anthropic Dynamic Workflows") - 四大控制面:next-call trigger / stop condition / failure recovery / independent verification - 瓶颈定位方法:模型说错话→prompt eng;流畅但错→context eng;重复4次→loop eng 工程洞察: 高于工具层面,是系统设计的架构思维 建议: ⭐⭐ 强保留,工程架构视角

7. awesome-ai-agents-2026 — GitHub · 持续更新

分类: AI Agents · Tools · Evaluation 保留理由: - Patronus AI / DeepEval / OpenHands / Dify / Cline / Mem0 / LangSmith / Helicone / Braintrust - DeepEval: Pytest-style eval framework,14+ built-in metrics(G-Eval, hallucination, faithfulness) - OpenHands: 开源 AI 软件工程平台 - LLMOps 工具链完整覆盖 工程价值: 工具选型参考手册 建议: ⭐ 收藏,适合工具调研

8. rohitg00/ai-engineering-from-scratch — GitHub

分类: AI Engineering · Learning Path 保留理由: - 28 phases / 503 lessons,Phase 11-28 覆盖工程主题 - SRE for AI — Multi-Agent Incident Response - Chaos Engineering for LLM Production - FinOps for LLMs — Unit Economics - Self-Hosted Serving Selection 工程完整性: 课程体系化,适合系统性学习 建议: ⭐ 参考学习路径

9. awesome-harness-engineering — GitHub

分类: Agent · Harness Architecture · Scheduler 保留理由: - 70 个开源 LLM agent 项目的系统分析 - 五大执行模式:Agent Loop / Event-driven / State-machine / Graph/flow / Hybrid - Agent Loop 模式占 60% - Hindsight:retain/recall/reflect 三操作 + MCP server(June 2026) - ClawVM:虚拟内存语义应用于 agent context 管理 工程框架: 系统架构决策参考 建议: ⭐ 架构师级别参考

10. hands-on-modern-rl — GitHub

分类: RL · LLM Alignment · Agentic RL 保留理由: - RLVR (Reinforcement Learning from Visual Feedback) 实践 - Agentic RL 项目:Deep Research / rLLM - VLM RL (GeoQA) 实验 - 可复现的训练示例和代码 工程价值: 有源码和复现步骤 建议: ⭐ 实验代码参考

11. Netflix In-House LLM Serving — Netflix Tech Blog

分类: LLM Inference · Production 保留理由: - 生产级 vLLM 选型过程 - TensorRT-LLM 对比评估 - 实际流量场景下的决策依据 工程洞察: 大厂生产实践 建议: ⭐ 参考

12. AI Engineering Interview Questions and Answers — GitHub

分类: AI Engineering · Interview 保留理由: - 生产问题:rate limiting、structured output、cost optimization、provider switching - LLM routing、prompt versioning、model rollback、A/B testing for LLM - CI/CD for AI、feature flags in AI deployments、logging/tracing for LLM 工程覆盖: 真实生产场景问题 建议: ⭐ 工具目录/面试题库

13. awesome-free-models — GitHub

分类: Learning Resources · Open Source 保留理由: - LLM Zoomcamp (DataTalksClub): 10周构建 RAG/agents/vector search/evaluation - AI Engineering from Scratch: 503 lessons,MIT license,41K+ stars - 资源经过验证(2026-08-07) 建议: ⭐ 学习路径

分类: LLM Engineering · Resource List 保留理由: - 包含 RAG 架构 6 种类型(Hybrid/Graph/Agentic/Corrective/Adaptive/Multimodal) - 每种类型有定义、适用场景、最佳实践、常见错误 建议: ⭐ RAG 工程选型参考


🟡 中等价值(有限保留)

15. RAG Architecture Guide 2026 — Encodedots

分类: RAG Architecture 保留理由: - 六种 RAG 架构系统梳理 - GraphRAG 实体关系查询案例(金融合规场景) - CRAG 置信度评估 + fallback 机制 局限: 营销性质较强,细节不如专业 blog 建议: 入门参考

16. Top 11 MLOps Tools in 2026 — Kodekloud

分类: MLOps · LLMOps 保留理由: - LangSmith vs Langfuse 对比 - LLMOps 建立在 MLOps 基础上的观点 - 2026 年生产 ML 团队同时运行 classical MLOps + LLMOps 局限: 工具罗列为主 建议: 工具选型初筛

17. Stockholm MLOps Event #28 — 2026-02-27

分类: MLOps · AI Infrastructure 保留理由: - AI Factory 概念:可重复运营 AI 系统需要部署标准、observability、治理 - 基础设施决策如何影响 AI 能力本身 - 开源 AI → 实验工具 → 运营基础设施的转变 局限: 会议总结,无具体命令/代码 建议: 趋势参考

分类: LLM Inference · Memory Optimization 保留理由: - 70B 模型在单卡 4GB 显存推理(layer-wise inference) 局限: 实用性和稳定性待验证 建议: 关注


⚫ 丢弃条目

条目 丢弃理由
Instagram/TikTok reels 无实质工程内容,营销/流量为主
Clixlogix / CaliberFocus blog 同质化营销内容,无具体实现
DataCamp Facebook post 课程推广,无技术深度
80,000 Hours Substack AGI 预测,非工程实践
普通社交媒体帖子 非一手技术来源

本次主题分析

核心发现

  1. LLM Inference 工程成熟度:2026年 inference 优化从单点技术进入系统整合阶段,KV Cache 复用、prefix caching、continuous batching 已标准化

  2. Loop Engineering 崛起:从单轮 QA 到多智能体长时运行,Loop Engineering 成为独立工程层

  3. 成本优化实战化:snapshot restore、serverless GPU、FinOps 等有具体数字的成本优化方案涌现

  4. Eval/Testing 工具链完善:DeepEval 等 Pytest-style 框架出现,LLM 测试从研究进入工程化

高频主题

  • vLLM vs TensorRT-LLM 选型
  • KV Cache 优化(9x compression DeepSeek案例)
  • 生产级 benchmark 方法论
  • Agent Loop / Harness 架构

建议写入路径

本次草稿: /shared/research-kb/inbox/jay/2026-08-12-llm-inference-agent-engineering.md

如需后续精读文件: - /shared/research-kb/inbox/jay/2026-08-12-llm-inference-deep-dive.md — inference 工程核心技术 - /shared/research-kb/inbox/jay/2026-08-12-agent-loop-harness-architecture.md — agent/harness 架构 - /shared/research-kb/inbox/jay/2026-08-12-kv-cache-optimization-survey.md — KV Cache 优化综述


分类标签

LLM-Inference Serving KV-Cache vLLM TensorRT-LLM Agent Harness RAG MLOps LLMOps Benchmark Cost-Optimization Eval Production Serverless


后续行动建议

  1. ⭐⭐ 优先精读: Cerebrium serverless GPU 文章(有具体命令和成本数据)
  2. ⭐⭐ 架构参考: Prompt-Context-Loop 文章(系统设计视角)
  3. KV Cache: arxiv:2608.01526(9x compression 数据)
  4. 工程序列: YouTube Inference Engineering 系列(连续8集系统梳理)
  5. 📝 工具调研: awesome-ai-agents-2026 工具链补充

报告生成时间: 2026-08-12 14:50 CST · Jay · 工程实践筛选