工程实践筛选报告 · Jay · 2026-08-12
任务概述
- 执行时间: 2026-08-12 14:50 (Asia/Shanghai)
- 检索范围: arXiv、GitHub、Hugging Face、技术博客、Substack、工程实践
- 主题: LLM Inference / Agent / RAG / MLOps 工程实践
- 去重检查: 已查阅 inbox 目录(flyp/jay/spark/stephen/tom)
候选条目汇总(按工程价值排序)
🔴 高价值条目(保留)
1. The Engineering Behind LLM Inference: Serving in Production — YouTube · Aug 2026
分类: LLM Inference · Serving Architecture 保留理由: - 连续 batching (Orca) 如何实现 36.9x throughput 提升的具体数据 - PagedAttention、KV Cache 调度细节 - Sarathi-Serve chunked prefill 机制 - Prefill/Decode 分离(DistServe/Splitwise)的生产实践 - SGLang 96 H100 实测:52,300 input + 22,300 output tokens/sec/node 工程指标: 有具体 benchmark 数字 建议: ⭐ 精读,建议纳入 inference engineering 主题页
2. The Engineering Behind LLM Inference: Speculative Decoding and Long Context — YouTube · Aug 2026
分类: LLM Inference · Speculative Decoding 保留理由: - Medusa、EAGLE、Lookahead Decoding 的具体 acceptance rule - 尾延迟(P99)在生产中的实际意义 - Fleet sizing 基于尾延迟而非平均值 工程指标: 有具体技术细节 建议: ⭐ 精读
3. vLLM vs TensorRT-LLM: 2026 Production Benchmarks — Lyceum Technology
分类: LLM Inference · GPU Serving 保留理由: - vLLM PagedAttention 原理:KV cache 虚拟内存管理 - Continuous batching 机制 - SGLang 作为第三候选的 RadixAttention + Prefix Caching - 三种场景选型:High-Throughput API、Real-Time Interactive、Regulated European Enterprise 工程指标: 有场景化选型建议 建议: ⭐ 精读,适合工程选型参考
4. Serving Fine-Tuned LLMs on Serverless GPUs — Cerebrium
分类: LLM Inference · Serverless · Cost Optimization 保留理由: - 实测数据:Llama-3-8B FP8 on A10 → ~1700 output tokens/sec - 权重加载时间:~10-15秒(GPU memory load) - Full vLLM cold start on g5.12xlarge:~50秒 - Snapshot restore from S3:2.25秒(9GiB checkpoint) - Snapshot restore from NVMe:9秒 - GPU成本对比:A100 80GB $0.000592/s vs H100 $0.000953/s 工程指标: 具体命令、实测延迟、成本数据 建议: ⭐⭐ 强保留,可复现步骤,成本计算可直接使用
5. arxiv:2608.01526v1 — An Internet for the KV Cache — arXiv · 2026
分类: LLM Inference · KV Cache Optimization 保留理由: - KV Cache 复用作为一等公民的系统设计理念 - DeepSeek-V3.2 → V4-Pro:100K tokens KV Cache 从 9GB 压缩到 1GB(9x) - SOLA/ThunderServe/Seesaw/Libra 等调度算法对比 - 生产级 KV Cache 管理策略 工程指标: 有量化数据 建议: ⭐ 精读,KV Cache 是 2026 inference 优化核心
6. Prompt, Context, Loop: The Three Engineering Layers Every RAG System Is Built On — Towards Data Science
分类: RAG · Agent Loop · Context Engineering 保留理由: - 2022 单轮 QA vs 2026 多智能体 40 turn/6小时 的场景演变 - Loop Engineering 作为新兴工程层(2026年5月 Boris Cherny 提出"Anthropic Dynamic Workflows") - 四大控制面:next-call trigger / stop condition / failure recovery / independent verification - 瓶颈定位方法:模型说错话→prompt eng;流畅但错→context eng;重复4次→loop eng 工程洞察: 高于工具层面,是系统设计的架构思维 建议: ⭐⭐ 强保留,工程架构视角
7. awesome-ai-agents-2026 — GitHub · 持续更新
分类: AI Agents · Tools · Evaluation 保留理由: - Patronus AI / DeepEval / OpenHands / Dify / Cline / Mem0 / LangSmith / Helicone / Braintrust - DeepEval: Pytest-style eval framework,14+ built-in metrics(G-Eval, hallucination, faithfulness) - OpenHands: 开源 AI 软件工程平台 - LLMOps 工具链完整覆盖 工程价值: 工具选型参考手册 建议: ⭐ 收藏,适合工具调研
8. rohitg00/ai-engineering-from-scratch — GitHub
分类: AI Engineering · Learning Path 保留理由: - 28 phases / 503 lessons,Phase 11-28 覆盖工程主题 - SRE for AI — Multi-Agent Incident Response - Chaos Engineering for LLM Production - FinOps for LLMs — Unit Economics - Self-Hosted Serving Selection 工程完整性: 课程体系化,适合系统性学习 建议: ⭐ 参考学习路径
9. awesome-harness-engineering — GitHub
分类: Agent · Harness Architecture · Scheduler 保留理由: - 70 个开源 LLM agent 项目的系统分析 - 五大执行模式:Agent Loop / Event-driven / State-machine / Graph/flow / Hybrid - Agent Loop 模式占 60% - Hindsight:retain/recall/reflect 三操作 + MCP server(June 2026) - ClawVM:虚拟内存语义应用于 agent context 管理 工程框架: 系统架构决策参考 建议: ⭐ 架构师级别参考
10. hands-on-modern-rl — GitHub
分类: RL · LLM Alignment · Agentic RL 保留理由: - RLVR (Reinforcement Learning from Visual Feedback) 实践 - Agentic RL 项目:Deep Research / rLLM - VLM RL (GeoQA) 实验 - 可复现的训练示例和代码 工程价值: 有源码和复现步骤 建议: ⭐ 实验代码参考
11. Netflix In-House LLM Serving — Netflix Tech Blog
分类: LLM Inference · Production 保留理由: - 生产级 vLLM 选型过程 - TensorRT-LLM 对比评估 - 实际流量场景下的决策依据 工程洞察: 大厂生产实践 建议: ⭐ 参考
12. AI Engineering Interview Questions and Answers — GitHub
分类: AI Engineering · Interview 保留理由: - 生产问题:rate limiting、structured output、cost optimization、provider switching - LLM routing、prompt versioning、model rollback、A/B testing for LLM - CI/CD for AI、feature flags in AI deployments、logging/tracing for LLM 工程覆盖: 真实生产场景问题 建议: ⭐ 工具目录/面试题库
13. awesome-free-models — GitHub
分类: Learning Resources · Open Source 保留理由: - LLM Zoomcamp (DataTalksClub): 10周构建 RAG/agents/vector search/evaluation - AI Engineering from Scratch: 503 lessons,MIT license,41K+ stars - 资源经过验证(2026-08-07) 建议: ⭐ 学习路径
14. awesome-llm-engineering-2026 — via Search
分类: LLM Engineering · Resource List 保留理由: - 包含 RAG 架构 6 种类型(Hybrid/Graph/Agentic/Corrective/Adaptive/Multimodal) - 每种类型有定义、适用场景、最佳实践、常见错误 建议: ⭐ RAG 工程选型参考
🟡 中等价值(有限保留)
15. RAG Architecture Guide 2026 — Encodedots
分类: RAG Architecture 保留理由: - 六种 RAG 架构系统梳理 - GraphRAG 实体关系查询案例(金融合规场景) - CRAG 置信度评估 + fallback 机制 局限: 营销性质较强,细节不如专业 blog 建议: 入门参考
16. Top 11 MLOps Tools in 2026 — Kodekloud
分类: MLOps · LLMOps 保留理由: - LangSmith vs Langfuse 对比 - LLMOps 建立在 MLOps 基础上的观点 - 2026 年生产 ML 团队同时运行 classical MLOps + LLMOps 局限: 工具罗列为主 建议: 工具选型初筛
17. Stockholm MLOps Event #28 — 2026-02-27
分类: MLOps · AI Infrastructure 保留理由: - AI Factory 概念:可重复运营 AI 系统需要部署标准、observability、治理 - 基础设施决策如何影响 AI 能力本身 - 开源 AI → 实验工具 → 运营基础设施的转变 局限: 会议总结,无具体命令/代码 建议: 趋势参考
18. AirLLM 70B with 4GB GPU — GitHub Trending
分类: LLM Inference · Memory Optimization 保留理由: - 70B 模型在单卡 4GB 显存推理(layer-wise inference) 局限: 实用性和稳定性待验证 建议: 关注
⚫ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| Instagram/TikTok reels | 无实质工程内容,营销/流量为主 |
| Clixlogix / CaliberFocus blog | 同质化营销内容,无具体实现 |
| DataCamp Facebook post | 课程推广,无技术深度 |
| 80,000 Hours Substack | AGI 预测,非工程实践 |
| 普通社交媒体帖子 | 非一手技术来源 |
本次主题分析
核心发现
-
LLM Inference 工程成熟度:2026年 inference 优化从单点技术进入系统整合阶段,KV Cache 复用、prefix caching、continuous batching 已标准化
-
Loop Engineering 崛起:从单轮 QA 到多智能体长时运行,Loop Engineering 成为独立工程层
-
成本优化实战化:snapshot restore、serverless GPU、FinOps 等有具体数字的成本优化方案涌现
-
Eval/Testing 工具链完善:DeepEval 等 Pytest-style 框架出现,LLM 测试从研究进入工程化
高频主题
- vLLM vs TensorRT-LLM 选型
- KV Cache 优化(9x compression DeepSeek案例)
- 生产级 benchmark 方法论
- Agent Loop / Harness 架构
建议写入路径
本次草稿: /shared/research-kb/inbox/jay/2026-08-12-llm-inference-agent-engineering.md
如需后续精读文件:
- /shared/research-kb/inbox/jay/2026-08-12-llm-inference-deep-dive.md — inference 工程核心技术
- /shared/research-kb/inbox/jay/2026-08-12-agent-loop-harness-architecture.md — agent/harness 架构
- /shared/research-kb/inbox/jay/2026-08-12-kv-cache-optimization-survey.md — KV Cache 优化综述
分类标签
LLM-Inference Serving KV-Cache vLLM TensorRT-LLM Agent Harness RAG MLOps LLMOps Benchmark Cost-Optimization Eval Production Serverless
后续行动建议
- ⭐⭐ 优先精读: Cerebrium serverless GPU 文章(有具体命令和成本数据)
- ⭐⭐ 架构参考: Prompt-Context-Loop 文章(系统设计视角)
- ⭐ KV Cache: arxiv:2608.01526(9x compression 数据)
- ⭐ 工程序列: YouTube Inference Engineering 系列(连续8集系统梳理)
- 📝 工具调研: awesome-ai-agents-2026 工具链补充
报告生成时间: 2026-08-12 14:50 CST · Jay · 工程实践筛选