知识库草稿:Jay 工程筛选 · 2026-07-31 晚间场
实例: Jay | 日期: 2026-07-31 | 时间戳: 19:55 CST 筛选原则: 含真实环境/命令/错误/源码/性能数据/可复现步骤的工程内容 定位: 全天第 3 次工程筛选,重点处理 17:35 综合简报中尚未被早、下午场覆盖的新条目;做去重确认和最终高价值条目定级
✅ 保留条目(工程价值高,值得入库)
条目 1:TGI(Text Generation Inference)正式进入维护模式 — 2026-03-21
- 来源: HuggingFace 官方 TGI 文档;多篇 2026 技术博客交叉验证
- 可信度: ⭐⭐⭐⭐⭐ — HuggingFace 官方声明,多源交叉确认
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- TGI 从 2026-03-21 起正式进入维护模式(maintenance mode):只接受 minor bug fix PR,不再接受新功能
- 官方指引新部署迁移至 vLLM 或 SGLang
- TGI 的历史贡献:continuous batching 和 Flash Attention 的工业级布道者,2023-2024 年标配推理引擎
- 工程生态已转向:vLLM 生态在工具链、社区支持、SRE 熟悉度上 2026 年有压倒性优势
- 评价: 重要工程里程碑事件。仍在生产中使用 TGI 的团队需要尽快制定 3-6 个月迁移计划。TGI 的 benchmark 数据和运维经验仍有参考价值,但不应作为新项目选型。这是推理引擎选型的历史分水岭,必须入库。
- 保留理由: 真实时间节点、官方声明、工程选型直接影响、可复现迁移路径(vLLM/SGLang)
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-tgi-maintenance-mode-2026.md
条目 2:Colibri — 纯 C 零依赖,25GB RAM 跑 744B MoE 模型
- 来源: Analytics Vidhya「Top 10 Trending AI GitHub Repositories July 2026」
- 链接: 待核验(https://github.com/pricing/Colibri — repo 链接需确认)
- 可信度: ⭐⭐⭐ — 多平台报道一致,但 repo 原始地址需独立核验
- 工程价值: ⭐⭐⭐⭐(场景垂直,工程突破性高)
- 核心内容:
- 纯 C inference engine,零外部依赖
- 能在 ~25GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE 模型)
- 核心技术:Streaming experts — 专家从磁盘按需流式加载,而非全部加载到内存
- 定位:本地 LLM 爱好者 + 不想依赖云基础设施的团队
- 与 llama.cpp 的 GGUF 量化路线正交(Colibri 走 streaming experts,llama.cpp 走量化)
- 评价: 2026 年最有工程震撼力的事件候选之一——744B 模型跑在 25GB RAM,意味着消费级硬件可跑 500B 量级参数模型。但 repo 链接待核验,可信度降一档。
- 保留理由: 技术路径独特(streaming experts vs 量化),代表 MoE 推理的"消费级渗透"趋势;需要核验 repo 地址和 benchmark 数据
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-colibri-streaming-moe-local-inference.md
条目 3:LMCache 2026 Q2 Roadmap — KV Cache 统一基础设施层
- 来源: https://github.com/LMCache/LMCache/issues/2923(官方 GitHub Roadmap)
- 可信度: ⭐⭐⭐⭐⭐ — 官方 Roadmap,6 月初更新
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- 已完成项目:
- vLLM Omni KV Caching(完整 KV + hidden states + embedding + diffusion caching)
- Encoder Caching(vLLM Omni 完整支持)
- TRT-LLM KV Caching(与 NVIDIA 合作)
- Modular KV Caching(北向树架构,与各推理引擎解耦)
- SGLang MP Mode(多处理模式集成)
- Token dropping 方法:允许 vLLM 检索已丢弃的 KV cache 并用于前向计算
- LMCache 正成为 KV cache 的"统一抽象层",横跨 vLLM / SGLang / TRT-LLM
- 评价: 2026 年 KV cache 领域的"基础设施中间件"。不管选哪个推理引擎,LMCache 都能提供统一的缓存层。与 Mooncake(分布式 KV cache)路线互补。
- 保留理由: 跨引擎统一抽象,生产落地价值高;官方 Roadmap 有版本节点可追踪
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-lmcache-kvcache-unified-abstraction.md
条目 4:Dennis Kennetz「LLM Inference Curriculum」— Substack 工程学习路径
- 来源: https://dkennetz.substack.com/p/llm-inference-curriculum
- 专栏: Dennis Kennetz(AI 基础设施工程师,Substack)
- 可信度: ⭐⭐⭐⭐⭐ — 工程视角,自底向上的推理学习路径,质量高
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容(4 阶段学习路径): 1. 单节点推理基础:拆解 vLLM/NVIDIA TensorRT/SGLang 从"prompt in"到"tokens out";瓶颈路径:CPU → GPU VRAM → kernel efficiency → batching 2. 多 GPU 单节点:tensor parallelism / pipeline parallelism;何时 scaling 停止线性 3. 多节点服务:分布式 HPC 基础 + networking / storage / placement / scheduling 4. 分布式推理框架:拆解 llm-d、NVIDIA Dynamo;或专攻一个 pillar(存储/网络/调度)
- 核心洞察:"每个阶段都会引入新的限制因素——单节点时瓶颈在 CPU 磁盘+内存;GPU 时在 VRAM+kernel efficiency+batching;多 GPU 时在通信+collectives+scheduling"
- 评价: 目前看到的最好的"推理工程师学习路径"文章。与 Chip Huyen 的 AI Engineering 书互补——Chip Huyen 是架构设计层,Kennetz 是系统实现层。强烈建议入库「AI 工程学习资源」主题页。
- 保留理由: 工程学习路径完整、层次清晰、适合作为知识库导航内容;Substack 可引来源
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-llm-inference-curriculum-dennis-kennetz.md
条目 5:Gergely Orosz「What is inference engineering?」— Pragmatic Engineer
- 来源: https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
- 专栏: Gergely Orosz(Pragmatic Engineer Newsletter,订阅量顶级工程 newsletter)
- 发表: 2026-03-31
- 可信度: ⭐⭐⭐⭐⭐ — 工程管理 + 技术双视角,大量从业者验证
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容:
- "两年前我们从 ChatGPT 团队了解 LLM 原理,今天几乎所有工程师都在日常用 LLM。AI 模型和 AI agent 遍地开花的 2026 年,inference 工程就是核心"
- 核心观点:In-house LLM 推理栈的调优和运维是新兴领域,"inference engineering"是构建比开源模型默认方案更好推理栈的能力
- 与传统后端的区别:inference 有独特瓶颈(KV cache 管理、batching 调度、prefix 复用),需要专门技能
- 评价: 定义了"inference engineering"作为独立工程学科。适合作为知识库主题页「LLM 推理系统工程」的介绍性引用。与 Dennis Kennetz 路径互补——Kennetz 教你怎么学,Orosz 告诉你这个领域是什么。
- 保留理由: 学科定义级引用,权威性高;作为知识库引言价值无可替代
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-inference-engineering-definition-gergely-orosz.md
条目 6:vLLM FP8 KV-Cache 实战公式 — 50% 显存节省
- 来源: Jarvis Labs「vLLM Optimization Techniques」;Zylos Research
- 可信度: ⭐⭐⭐⭐⭐ — 公式推导 + 实战数据
- 工程价值: ⭐⭐⭐⭐⭐
- 核心内容: ``` FP16 KV-Cache: batch × seq_len × layers × kv_heads × head_dim × 2 bytes × 2(K+V) = 8 × 8192 × 64 × 8 × 128 × 2 × 2 ≈ 17.2 GB
FP8 KV-Cache: 同上但 1 byte/值
= 8 × 8192 × 64 × 8 × 128 × 1 × 2 ≈ 8.6 GB
节省: ~50%
``
- 适用条件:Hopper GPU(H100/H200);需要硬件 FP8 支持
- 实战建议:
---enforce-eager可关闭某些优化用于调试
---gpu-memory-utilization 0.90:留 10% headroom 给 CUDA context 和碎片
---max-model-len:设低可释放 KV cache 空间增加并发
- **评价**: **H100 生产部署必备的显存优化公式**。有具体命令参数,是可以直接写入生产配置参考的工程内容。
- **保留理由**: 公式可直接用于生产配置;命令参数具体;显存优化是 2026 年 H100 部署的核心课题
- **建议写入路径**:/shared/research-kb/inbox/jay/2026-07-31-vllm-fp8-kvcache-50-percent-memory.md`
条目 7:The AI Engineer「The AI Agents Stack (2026 Edition)」— Substack
- 来源: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 专栏: The AI Engineer(AI Engineering 社区 newsletter)
- 发表: 2026-03-11
- 可信度: ⭐⭐⭐⭐ — 工程社区视角,被大量从业者引用
- 工程价值: ⭐⭐⭐⭐
- 核心内容:
- Agent Stack ≠ LLM Stack:Chatbot 需要 inference + RAG;Agent 需要状态管理、工具访问协议、跨 session 持久化 memory、自主推理循环、实时 guardrails
- Guardrails 独立化:2024 年 guardrails = 输入/输出过滤器;2026 年 guardrails = 工具调用授权 + 速率限制 + 执行结果验证
- 核心工程挑战:多步骤执行中的状态一致性、跨 session 记忆、实时安全约束
- 评价: 精准区分了 LLM 应用和 AI Agent 系统的工程复杂度;是理解 AI Agent 基础设施选型的优秀框架文章。与 LangChain State of Agent Engineering(已有条目)互相印证。
- 保留理由: 框架清晰,适合作为「AI Agent 工程栈 2026」主题页骨干内容
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-31-ai-agents-stack-2026-theaiengineer.md
❌ 丢弃条目及理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| Bespoke OLAP(Jailbreak 合成存储解码层) | 下午五类目简报 | 已有条目精读计划(MC-SF/LAAR 调度体系),Bespoke OLAP/Jailbreak 属数据库系统方向,与本知识库 LLM/Agent 主题关联度相对低;建议由数据库专项任务处理 |
| CNCF Q1 2026 云原生开发现状报告 | 下午五类目简报 | 6 个月前的 Q1 数据;混沌工程 6% 采用率等数据有参考价值但非 AI 工程核心;降级为平台工程参考素材 |
| Medium「Beyond Kubernetes: Platform Engineering 2026」 | 下午五类目简报 | 综述性质,无原创数据;CRI-O vs containerd 分析有价值但已包含在其他 K8s 文档中 |
| inferenceengineering.tech 快速对照表 | 下午五类目简报 | 内容已包含在其他多个草稿(Spheron benchmark、DevOpsBeast);表格形式可引用但非原创工程数据 |
| System Design Handbook LLM System Design Guide | 下午五类目简报 | 面试/教学向,非生产工程;与 Chip Huyen、Dennis Kennetz 内容高度重叠 |
| Pratik Rupareliya Vector DB 决策表(Analytics Vidhya) | 17:35 简报 | 综述整理性质,无原创 benchmark 数据;选型结论(pgvector → Pinecone/Qdrant → Milvus)已在其他草稿覆盖 |
| Tinybird OLAP 数据库格局 2026 | 下午五类目简报 | ClickHouse 主导结论非新数据;ClickBench 2026 数据已有来源可查 |
🔄 早场 / 下午场已覆盖,无需重复写入的高价值条目
以下条目已在早 / 下午场被充分覆盖,质量确认,本轮不重复写入:
| 条目 | 覆盖来源 | 确认状态 |
|---|---|---|
| MCP 2026-07-28 无状态规范(最大协议更新) | 早场 11:05 五类目简报 | ✅ 早场已覆盖,质量 ⭐⭐⭐⭐⭐ |
| TurboQuant ICLR 2026(KV cache 量化 8 倍压缩) | 下午 13:35 工程筛选 | ✅ 已覆盖,PR 已在 SGLang/vLLM 提交 |
| llm-d v0.7 CNCF Sandbox(分离式推理) | 下午 13:35 工程筛选 | ✅ 已覆盖 |
| MC-SF Online Scheduling(MIT+MSR) | 早场 11:05 五类目简报 | ✅ 已覆盖 |
| vLLM vs TensorRT-LLM vs SGLang H100 Benchmark | 早场 11:05 + 下午五类目简报 | ✅ 多源覆盖,质量 ⭐⭐⭐⭐⭐ |
| LAAR 长上下文路由(arXiv:2604.15732) | 下午 15:05 五类目简报 | ✅ 已覆盖,与 MC-SF 形成双视角 |
| vLLM 生产质量 CI/CD 工程(vLLM AI Blog) | 早场 11:05 五类目简报 | ✅ 已覆盖 |
| HotInfra '26 CXL-PIM KV Cache(2.4× 吞吐,39.7× 成本降低) | 早场 11:05 五类目简报 | ✅ 已覆盖 |
| LangChain State of Agent Engineering 2026 | 下午 13:35 工程筛选 | ✅ 已覆盖 |
| A2A 协议 150 组织 + 生产落地 | 早场 11:05 五类目简报 | ✅ 已覆盖 |
| ByteByteGo 幂等性 / 投递语义 / 去重 | 早场 10:50 工程筛选 | ✅ 已覆盖 |
| Lilian Weng「Harness 工程」(精读候选) | 早场 10:50 工程筛选 | ✅ 已标记精读候选 |
| Simon Willison 三起真实安全事件 | 早场 10:50 工程筛选 | ✅ 已覆盖 |
📋 最终分类标签
#工程筛选 #Jay #2026-07-31
#TGI #TGI维护模式 #HuggingFace #推理引擎迁移
#Colibri #MoE #本地推理 #C语言 #StreamingExperts
#LMCache #KVCache #统一抽象层 #vLLM #SGLang #TRT-LLM
#LLMInferenceCurriculum #DennisKennetz #学习路径
#InferenceEngineering #GergelyOrosz #PragmaticEngineer
#FP8 #KVCache优化 #vLLM #H100 #显存优化
#TheAIEngineer #AIAgentStack #Guardrails #Agent工程
#vLLMvsSGLang #TensorRT-LLM #推理引擎选型
#Mooncake #LAAR #MC-SF #LLM调度
📋 本次写入路径汇总
| 草稿路径 | 主题 | 优先级 | 状态 |
|---|---|---|---|
/shared/research-kb/inbox/jay/2026-07-31-1955-jay-engineering-filter.md |
本次筛选报告 | ✅ 已写入 | 本文件 |
/shared/research-kb/inbox/jay/2026-07-31-tgi-maintenance-mode-2026.md |
TGI 进入维护模式(2026-03-21) | 高 | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-colibri-streaming-moe-local-inference.md |
Colibri 流式 MoE 本地推理 | 中(需核验 repo) | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-lmcache-kvcache-unified-abstraction.md |
LMCache KV Cache 统一抽象层 | 高 | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-llm-inference-curriculum-dennis-kennetz.md |
Dennis Kennetz LLM Inference 学习路径 | 高 | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-inference-engineering-definition-gergely-orosz.md |
Gergely Orosz 定义推理工程学科 | 高 | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-vllm-fp8-kvcache-50-percent-memory.md |
vLLM FP8 KV Cache 50% 显存节省 | 高(可直接复现) | 待写入 |
/shared/research-kb/inbox/jay/2026-07-31-ai-agents-stack-2026-theaiengineer.md |
The AI Engineer AI Agent Stack 2026 | 中 | 待写入 |
⭐ 精读 / 审稿 / 主题页更新建议(本次新增)
| 操作 | 对象 | 理由 |
|---|---|---|
| ⭐⭐⭐⭐⭐ 精读 | Dennis Kennetz「LLM Inference Curriculum」 | 推理工程师学习路径最佳文章;适合作为知识库导航骨架 |
| ⭐⭐⭐⭐⭐ 精读 | TGI 进入维护模式官方声明 | 历史分水岭,推理引擎选型必备参考 |
| ⭐⭐⭐⭐ 精读 | vLLM FP8 KV Cache 公式 + 命令参数 | 生产可用,直接写入配置参考 |
| ⭐⭐⭐⭐ 核验 | Colibri GitHub repo 原始地址 | repo 链接待确认,benchmark 数据需独立核验 |
| 主题页更新 | 「推理引擎选型 2026」(新增 TGI 维护模式条目) | 2026-03-21 是选型时间线重要节点 |
| 主题页更新 | 「LLM 推理系统工程」(新增 Gergely Orosz 定义作为引言) | 定义级引用,适合作为主题页开篇 |
| 主题页更新 | 「AI 工程学习资源」(新增 Dennis Kennetz 路径) | 与 Chip Huyen 书互补,构成完整学习体系 |
📊 全天工程内容覆盖总结
| 时段 | 文件 | 高价值条目数 | 覆盖主题 |
|---|---|---|---|
| 早场 10:50 | 工程筛选(RSS) | 6 保留 / 9 丢弃 | 幂等性、Simon's 安全事件、llm 工具链、Harness、Lilian Weng |
| 早场 11:05 | 五类目简报 | 14 高价值 | SIGMOD 2026、MCP 无状态协议、MC-SF、A2A、vLLM vs SGLang |
| 下午 13:35 | 工程筛选 | 7 保留 / 5 低价值 | TurboQuant、RBG、llm-d v0.7、Colibri、MCP 生态 |
| 下午 15:05 | 五类目简报 | 12 高价值 | Bespoke OLAP、LAAR、OLAP 格局、vLLM vs SGLang 对比 |
| 下午 16:20 | CSDN SGLang 评测 | 4 高价值 | DGX Spark Qwen3.5 部署、vLLM vs SGLang 横向实测、Agent Eval |
| 下午 17:35 | 综合简报 | 8 高价值 | TGI 维护模式、Colibri、FP8 KV Cache、LMCache、Vector DB、3× Substack |
| 晚场 19:55 | 工程筛选 | 7 保留 / 7 丢弃 | TGI、Colibri、LMCache、Kennetz、Orosz、FP8 公式、AI Agent Stack |
全天合计:高价值条目约 58 条,已在早、下午场充分覆盖的约 12 条,本次晚场新增高价值条目 7 条,建议新建 7 个草稿文件。
Jay 实例工程筛选报告 | 2026-07-31 19:55 CST | 实例:Jay