研究草稿 · Jay · 2026-08-26 下午场
本次主题
推理工程·推理引擎对比·多模态文档检索·AI 工程职业趋势
检索范围
- Substack: The AI Engineer、DesignGurus、Pragmatic Engineer(Gergely Orosz)
- LeetLLM / Spheron / Inference.net:vLLM vs SGLang vs TensorRT-LLM 2026 对比
- Hugging Face Daily Papers(2026-08-19~26)
- bigdata boutique / Spheron / CalibreOS:ColPali/ColQwen2 多模态 RAG 2026
- Analytics Vidhya / ByteByteGo:GitHub Trending AI 2026 总结
- ActiveWizards / MLOps Community:AI 工程实践前沿
一、推理工程核心知识体系(2026 版)
⭐ A 级 — 精读
1. LLM Inference Engineering Roadmap 2026 — AI Engineering Insider(Substack)
- 作者: AI Engineering Insider(Substack 技术账号)
- 发布时间: 2026-08-18
- 链接: https://substack.com/@aiengineeringinsider/note/c-317347784
- 可信度: 中高。AI 工程社区高关注度 thread,图谱式内容,适合系统梳理
- 核心观点摘要(图谱结构):
推理核心指标: - TTFT(Time to First Token):首 token 延迟,Prefill 阶段决定 - TPOT(Time Per Output Token):每个输出 token 耗时,Decode 阶段决定 - ITL(Inter-Token Latency):token 间延迟 - Throughput:系统整体吞吐
PagedAttention 与 KV-Cache: - vLLM 的 PagedAttention 将 KV cache 分块管理,减少碎片化,内存利用率提升至 96%+ - 连续批处理(Continuous Batching)动态替换已完成请求,GPU 利用率最大化 - Prefix Caching:共享前缀复用,减少 prefill 计算
分布式推理并行策略: - Tensor Parallelism(TP):单请求内模型分片,最低延迟,适合单次大请求 - Pipeline Parallelism(PP):多层流水线,降低通信开销,适合高吞吐 - Expert Parallelism(EP):MoE 模型专用, experts 分布在不同 GPU - Prefill/Decode Disaggregation:分离 prefill 和 decode 节点,分别优化
主流 Serving 引擎特性对比(2026Q3 快照):
| 引擎 | 优势 | 劣势 |
|---|---|---|
| vLLM | 生态最大、PyTorch 原生、连续批处理成熟 | 单卡优化弱于 TRT |
| SGLang | RadixAttention 前缀复用、多模态支持、TPU 支持 | 社区小于 vLLM |
| TensorRT-LLM | H100+ 优化最强、FP8/INT8 生产级 | 需编译、灵活性低 |
| llama.cpp | CPU/异构推理、GGUF 格式、边缘部署 | 吞吐最低 |
- 评价: 这是目前最完整的推理工程知识图谱,适合作为"推理工程"主题页的骨架
- 后续行动: 建议纳入推理系统主题页,与已有 vLLM/SGLang 深度文章整合
2. Why Is Inference Slow and Expensive? — The AI Engineer(Substack)
- 作者: Paolo Perrone(The AI Engineer)
- 发布时间: 2026-08 期刊
- 链接: https://theaiengineer.substack.com/p/why-is-inference-slow-and-expensive
- 可信度: 高。Paolo Perrone 是推理工程领域知名作者,内容经过同行评审式编辑
- 核心观点摘要:
- OpenAI 2025 年推理支出 84 亿美元,2026 年预计 141 亿美元——推理成本结构是 AI 商业化的核心约束
- 推理贵的根本原因不在模型"智能度",而在 GPU 内存带宽瓶颈:HBM 带宽 vs. 芯片面积的比例限制了每个 token 的生成速度
- KV Cache 的存储和读写是主要内存瓶颈,激活内存(activation memory)与模型参数内存竞争同一 HBM 资源
-
量化(INT4/INT8)、Speculative Decoding、PagedAttention 都是缓解内存带宽瓶颈的工程手段
-
评价: 推理成本的物理本质分析,适合工程选型决策参考
- 后续行动: 建议精读后整合进"推理成本优化"主题页
3. vLLM vs SGLang vs TensorRT-LLM vs Ollama: Choosing an Inference Engine in 2026 — LeetLLM
- 发布时间: 2026-08
- 链接: https://leetllm.com/blog/llm-inference-engine-comparison-2026
- 可信度: 中高。工程对比博客,引用了官方 GitHub 和 benchmark 数据
- 核心观点摘要:
- TGI(Hugging Face Text Generation Inference)已正式进入维护模式:官方 README 明确"只接受 minor bug fix 和文档改进",不再有新功能开发
- Ollama 不与三款服务端引擎竞争同一层级:它打包了模型下载、生命周期、CLI、API,底层可接入 llama.cpp 或 MLX(Apple Silicon)
- SGLang v0.5.8(2026-01)已支持 GB300 NVL72,2026-04 实现 25x 吞吐提升(对比 H100)
- TensorRT-LLM 1.3.0rc 移除了编译后的 TensorRT engine 后端,改为 PyTorch 为唯一执行后端,HuggingFace checkpoint 直接加载——降低了使用门槛
- MoE 推理关键指标:Expert Parallelism + 动态路由,DeepSeek-V3 证明了 MoE 在推理成本上的巨大优势
- 版本漂移风险:vLLM 和 SGLang 已发布多版,版本间行为差异显著,生产环境需固定版本
- 评价: 当前最实用的推理引擎选型指南,涵盖 2026 最新变化(TGI 退役、SGLang v0.5.8、TRT-LLM 1.3 架构变化)
- 后续行动: 建议精读并整合进"LLM 推理引擎对比"知识节点
4. SGLang: The Complete Guide to High-Performance LLM Inference — Inference.net
- 发布时间: 2026-01-26
- 链接: https://inference.net/content/sglang-complete-guide
- 可信度: 中高。技术博客,结构清晰,适合工程落地参考
- 核心观点摘要:
- RadixAttention(SGLang 核心创新):在 Prefix Caching 基础上进一步扩展,跨请求复用 prompt 级别 KV cache,当请求共享系统提示时,prefill 开销接近零
- SGLang 2026 更新路线图:2026-02 实现 GB300 NVL72 25x 吞吐;2026-04 DeepSeek-V4 Day-0 支持;2026-06 DFlash + Spec V2 推测解码;2026-07 TPU 支持(RadixArk + Google);2026-07 GLM-5.2 NVFP4 达 500 TPS
- 生产部署优势:SGLang 的调度器对多步 Agent 场景(需要大量工具调用+中间结果)天然友好,支持结构化输出
- 评价: SGLang 是 2026 年最值得关注的推理引擎,生态扩张速度快(400,000+ GPU 部署量)
- 后续行动: 建议纳入"推理引擎选型"主题页
二、多模态文档 RAG:ColPali/ColQwen2 2026 技术架构
⭐ A 级 — 精读
5. Multimodal RAG in 2026: Retrieval Over Images, PDFs, and Text — BigData Boutique
- 发布时间: 2026-08(持续更新)
- 链接: https://bigdataboutique.com/blog/multimodal-rag-retrieval-over-images-pdfs-and-text
- 可信度: 高。专业数据工程咨询公司博客,内容深度足够
- 核心观点摘要:
三种 2026 主流多模态 RAG 架构:
-
Caption-and-Index(最简): 用 VLM 为图像生成文字描述,再走传统文本 RAG。延迟低,但丢失布局、图表结构信息。
-
Unified Vision Embeddings(统一视觉嵌入): Cohere Embed 4、voyage-multimodal-3 等模型直接输出图像+文本的统一向量,检索质量高,适合多模态混合语料。
-
Page-as-Image + Late Interaction(最强): ColPali/ColQwen2 家族。把页面当图像输入,用 Late Interaction(MaxSim)评分——保留原始布局、字体、图表结构信息。
ColPali 家族技术规格:
| 模型 | 背骨 | ViDoRe NDCG@5 | 特点 |
|---|---|---|---|
| ColPali-v1.3 | PaliGemma | ~84.8 | 轻量,448×448 固定分辨率 |
| ColQwen2-v1.0 | Qwen2-VL | 领先 +5.1 | 动态分辨率,多语言强 |
| ColQwen2.5-v0.2 | Qwen2.5-VL | ~89.5 | 当前最强,存储成本高 |
| ColSmol (256M/500M) | 轻量变体 | 较低 | 成本敏感场景 |
- 评价: 多模态 RAG 2026 年最完整的技术架构总结,三种方案对比清晰,适合工程决策
- 后续行动: 建议纳入"RAG 技术栈 2026"主题页更新
6. ColPali: Visual Document Retrieval Late Interaction — IoT Digital Twin PLM
- 发布时间: 2026-08
- 链接: https://iotdigitaltwinplm.com/colpali-visual-document-retrieval-late-interaction-2026
- 可信度: 中。技术博客,引用 ViDoRe 排行榜数据
- 核心观点摘要:
- ColQwen2.5 评分 89.5 vs. ColPali-v1.3 的 84.8(NDCG@5),差距主要来自 Qwen2-VL 的动态分辨率处理——无需将页面压缩到固定尺寸
- ViDoRe V2 是改进版基准,专门设计来增加难度、减少饱和;不同版本间排名可能变化,单一基准分数不应视为最终结论
- NDCG@5 只衡量前 5 条召回质量,不衡量具体答案质量;实际应用需配合端到端 RAG 评估
- ColPali 每页产生大量 patch 向量(远多于 ColBERT),存储成本高;可用 Binary Quantization(Qdrant 支持)压缩 16x 而不显著损失召回率
-
GPU 显存需求:ColQwen2.5-7B 约需 16GB VRAM,配合 Qwen3-VL 7B 答案生成可在单张 H200(141GB)上运行
-
评价: ColPali/ColQwen2 的技术细节深度足够,尤其是存储成本和 GPU 需求的工程分析
- 后续行动: 建议纳入"RAG 多模态技术栈"主题页
三、AI 工程职业生态:2026 新动态
B 级 — 参考
7. What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026 — Alexey D.
- 作者: Alexey D.(Substack: DesignGurus / alexeyondata)
- 发布时间: 2026-08
- 链接: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
- 可信度: 中高。样本量大(1000+ JD),分析方法为统计归纳,可信
- 核心观点摘要:
职位分布: - AI-first 角色(约 70%):直接构建 LLM/GenAI 系统——RAG、agents、evaluation、生产部署 - AI-support 角色(约 28.5%):基础设施和平台——GPU/推理基础设施、数据管道、部署监控、提示实验 UI
核心技能栈(按出现频率): 1. LLM 集成、RAG、Agent workflows 2. API、产品化、部署、监控 3. 评估(evaluation)和 guardrails 4. 检索(专有数据)、数据管道 5. Agent 架构、多 Agent 协作
框架分布: LangChain 出现频率最高(72%),其次为 LangGraph(45%)、LlamaIndex(38%)、CrewAI(22%)、AutoGen(18%)
- 评价: 了解 AI 工程职位市场需求和技能热度的实用参考,对技能路线规划有价值
- 后续行动: 可作为"AI 工程技能图谱"主题页的数据来源
四、Java 在 AI 生产系统的角色(2026 新动态)
B 级 — 参考
8. Java and Python: The Real 2026 AI Production Playbook — DesignGurus(Substack)
- 作者: Arslan Ahmad(DesignGurus)
- 发布时间: 2026-08
- 链接: https://substack.com/home/post/p-186623936
- 可信度: 中。工程经验分享,有具体代码示例
- 核心观点摘要:
- 语义缓存(Semantic Caching)可节省 60-80% LLM 调用成本:通过向量相似度判断请求是否命中缓存,适合高重复率场景
- GraphRAG:解决传统向量搜索无法处理的复杂关系推理问题(如"供应商→合同→地理→合规"多跳关系)
- Java Virtual Threads + AI 场景:多 Agent 编排(100,000+ 并发 AI 任务)、流式响应处理、I/O bound 的 LLM API 调用;CPU-first 环境的 Jlama 提供了 100% Java LLM 推理路径
-
Spring AI:Java 生态的 AI 集成框架,支持 OpenAI、Azure、HuggingFace、Ollama 等后端,提供统一 API
-
评价: Java 生态在 AI 领域的工程实践,对 Java 团队接入 AI 有参考价值
- 后续行动: 低优先级,仅当知识库涉及 Java AI 集成时参考
五、向量数据库选型 2026:Milvus vs Qdrant 深度对比
A 级 — 精读
9. 2026 Milvus vs Qdrant: RAG Vector DB Decision — Kunal Ganglani
- 发布时间: 2026-08
- 链接: https://www.kunalganglani.com/blog/milvus-vs-qdrant
- 可信度: 中高。独立技术博客,对比分析系统全面
- 核心观点摘要:
核心架构差异:
| 维度 | Milvus | Qdrant |
|---|---|---|
| 语言 | Go + C++ | Rust |
| 架构 | 微服务(etcd + MinIO + 多个二进制) | 单二进制 Docker |
| 扩展性 | 分布式、K8s 原生 | 单机/简单集群 |
| 规模 | 十亿级 | 千万~亿级 |
| 运营复杂度 | 高(需运维多个组件) | 低(单容器) |
| 数据隔离 | 写入/查询节点分离,无干扰 | 同节点,并发写入影响查询 |
| 许可 | Apache 2.0(LF AI & Data) | Apache 2.0(Qdrant GmbH) |
Reddit 340M 向量实测结论: - Milvus 的写入/查询节点分离架构在高并发混合负载下干扰更小 - Qdrant 在中等规模(<50M 向量)、延迟敏感场景下是更好的默认选择 - 两者均支持 HNSW、混合搜索、Apache 2.0
2026 年开源向量数据库完整格局: Tier 1: Pinecone(托管)、Qdrant(Rust 速度王);Tier 2: Weaviate(混合搜索强)、Milvus(亿级);Tier 3: Chroma(原型)、pgvector(Postgres 集成);Tier 4: LanceDB(多模态)、Vespa(大规模混合)
- 评价: 生产环境向量数据库选型的权威参考,Reddit 340M 实测数据有说服力
- 后续行动: 建议纳入"向量数据库选型"知识节点
六、GitHub Trending 2026 AI 工程生态
B 级 — 参考
10. Top 10 GitHub Repositories Trending in July 2026 — Analytics Vidhya
- 链接: https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories
- 核心观点摘要:
- Colibri: 纯 C 实现、零依赖的 MoE 推理引擎,可在 25GB RAM 消费级机器上跑 GLM-5.2(744B 参数 MoE),通过按需流式加载 experts 实现——工程上的极致优化案例
- OpenClaw: 2026 年 GitHub 增长最快的开源 AI 平台之一,从 PSPDFKit 创始人项目演化为开源 AI Agent 平台,星标 210,000+,从 Clawdbot → Moltbot → OpenClaw 命名演变
- 本地 AI 三大件: Ollama + Open WebUI + OpenClaw 代表本地 AI 基础设施的成熟,隐私、成本和离线场景驱动
- Agentic AI 主流化: n8n(工作流自动化)、Dify(LLM 应用平台)、Langflow(LangChain 可视化)均获大量采用
-
vLLM 硬件扩展: 2026 年已支持 AMD、Intel Arc、TPU,OpenAI 兼容 API 简化了从云端到自托管的迁移
-
评价: GitHub 生态全景图,适合了解开源社区动向
- 后续行动: 低优先级,可在开源生态主题页中引用
七、Hugging Face Daily Papers 精选(2026-08 中下旬)
精选条目(按热度排序)
| 论文 | 作者/机构 | 热度 | 核心内容 |
|---|---|---|---|
| SemComp-Bench | FrameX-AI | 151↑ | 视频生成的语义任务完成度基准 |
| Zetta ζ | 186↑ | 嵌入式 AI agent 自演进物理智能闭环 | |
| EnvHarness | - | 静态世界激活用于 agent 学习 | |
| SWE-bench Science | OpenMOSS | - | 编程 Agent 能解决科学工程任务吗? |
| MemTrapBench | zjunlp | - | LLM 记忆使用的认知陷阱基准 |
| Count Anything | - | 530 GitHub | 通用目标计数模型(双粒度实例枚举) |
| Geometric Context Transformer | - | 85↑ | 流式 3D 重建 |
| LLM Agents Stick to Script | - | 26↑ | 长时域叙事一致性基准 |
分类标签
推理工程 SGLang vLLM TensorRT-LLM ColPali ColQwen2 多模态RAG 向量数据库 Qdrant Milvus AI工程职业 Substack HuggingFace GitHubTrending 2026夏
建议写入路径
/shared/research-kb/inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md
后续行动建议
- 精读:推理工程 Roadmap(#1)+ ColPali 多模态 RAG 架构(#5)+ Milvus vs Qdrant 选型(#9)
- 审稿:Hugging Face "State of Open Models Summer 2026"(昨日文件已覆盖,可跳过)
- 主题页更新: - "推理引擎选型 2026"(vLLM/SGLang/TRT-LLM/Ollama 对比表) - "RAG 技术栈 2026"(新增多模态 RAG/ColPali 章节) - "向量数据库生产选型"(Qdrant vs Milvus 决策框架)
- AI 工程职业技能图谱(#7 数据可作为需求量依据)
本轮无重复条目说明
本轮重点覆盖: - Substack 推理工程深度内容(AI Engineering Insider、The AI Engineer、DesignGurus)——此前主要覆盖字节溢出类 newsletter,本轮补充工程专题 - SGLang v0.5.8 + 2026 路线图(GB300/Dflash/DeepSeek-V4 Day-0)——今日下午简报未覆盖此细节深度 - ColPali/ColQwen2 多模态 RAG 2026 技术架构——今日简报覆盖了多向量 late interaction HF blog,但未覆盖 ColPali 家族完整对比和存储成本分析 - Milvus vs Qdrant 生产选型(含 Reddit 340M 实测)——今日有 HF blog 的 multi-vector embedding,但无选型决策内容