研究草稿 · Jay · 2026-08-26 下午场

本次主题

推理工程·推理引擎对比·多模态文档检索·AI 工程职业趋势

检索范围

  • Substack: The AI Engineer、DesignGurus、Pragmatic Engineer(Gergely Orosz)
  • LeetLLM / Spheron / Inference.net:vLLM vs SGLang vs TensorRT-LLM 2026 对比
  • Hugging Face Daily Papers(2026-08-19~26)
  • bigdata boutique / Spheron / CalibreOS:ColPali/ColQwen2 多模态 RAG 2026
  • Analytics Vidhya / ByteByteGo:GitHub Trending AI 2026 总结
  • ActiveWizards / MLOps Community:AI 工程实践前沿

一、推理工程核心知识体系(2026 版)

⭐ A 级 — 精读

1. LLM Inference Engineering Roadmap 2026 — AI Engineering Insider(Substack)

  • 作者: AI Engineering Insider(Substack 技术账号)
  • 发布时间: 2026-08-18
  • 链接: https://substack.com/@aiengineeringinsider/note/c-317347784
  • 可信度: 中高。AI 工程社区高关注度 thread,图谱式内容,适合系统梳理
  • 核心观点摘要(图谱结构):

推理核心指标: - TTFT(Time to First Token):首 token 延迟,Prefill 阶段决定 - TPOT(Time Per Output Token):每个输出 token 耗时,Decode 阶段决定 - ITL(Inter-Token Latency):token 间延迟 - Throughput:系统整体吞吐

PagedAttention 与 KV-Cache: - vLLM 的 PagedAttention 将 KV cache 分块管理,减少碎片化,内存利用率提升至 96%+ - 连续批处理(Continuous Batching)动态替换已完成请求,GPU 利用率最大化 - Prefix Caching:共享前缀复用,减少 prefill 计算

分布式推理并行策略: - Tensor Parallelism(TP):单请求内模型分片,最低延迟,适合单次大请求 - Pipeline Parallelism(PP):多层流水线,降低通信开销,适合高吞吐 - Expert Parallelism(EP):MoE 模型专用, experts 分布在不同 GPU - Prefill/Decode Disaggregation:分离 prefill 和 decode 节点,分别优化

主流 Serving 引擎特性对比(2026Q3 快照):

引擎 优势 劣势
vLLM 生态最大、PyTorch 原生、连续批处理成熟 单卡优化弱于 TRT
SGLang RadixAttention 前缀复用、多模态支持、TPU 支持 社区小于 vLLM
TensorRT-LLM H100+ 优化最强、FP8/INT8 生产级 需编译、灵活性低
llama.cpp CPU/异构推理、GGUF 格式、边缘部署 吞吐最低
  • 评价: 这是目前最完整的推理工程知识图谱,适合作为"推理工程"主题页的骨架
  • 后续行动: 建议纳入推理系统主题页,与已有 vLLM/SGLang 深度文章整合

2. Why Is Inference Slow and Expensive? — The AI Engineer(Substack)

  • 作者: Paolo Perrone(The AI Engineer)
  • 发布时间: 2026-08 期刊
  • 链接: https://theaiengineer.substack.com/p/why-is-inference-slow-and-expensive
  • 可信度: 高。Paolo Perrone 是推理工程领域知名作者,内容经过同行评审式编辑
  • 核心观点摘要:
  • OpenAI 2025 年推理支出 84 亿美元,2026 年预计 141 亿美元——推理成本结构是 AI 商业化的核心约束
  • 推理贵的根本原因不在模型"智能度",而在 GPU 内存带宽瓶颈:HBM 带宽 vs. 芯片面积的比例限制了每个 token 的生成速度
  • KV Cache 的存储和读写是主要内存瓶颈,激活内存(activation memory)与模型参数内存竞争同一 HBM 资源
  • 量化(INT4/INT8)、Speculative Decoding、PagedAttention 都是缓解内存带宽瓶颈的工程手段

  • 评价: 推理成本的物理本质分析,适合工程选型决策参考

  • 后续行动: 建议精读后整合进"推理成本优化"主题页

3. vLLM vs SGLang vs TensorRT-LLM vs Ollama: Choosing an Inference Engine in 2026 — LeetLLM

  • 发布时间: 2026-08
  • 链接: https://leetllm.com/blog/llm-inference-engine-comparison-2026
  • 可信度: 中高。工程对比博客,引用了官方 GitHub 和 benchmark 数据
  • 核心观点摘要:
  • TGI(Hugging Face Text Generation Inference)已正式进入维护模式:官方 README 明确"只接受 minor bug fix 和文档改进",不再有新功能开发
  • Ollama 不与三款服务端引擎竞争同一层级:它打包了模型下载、生命周期、CLI、API,底层可接入 llama.cpp 或 MLX(Apple Silicon)
  • SGLang v0.5.8(2026-01)已支持 GB300 NVL72,2026-04 实现 25x 吞吐提升(对比 H100)
  • TensorRT-LLM 1.3.0rc 移除了编译后的 TensorRT engine 后端,改为 PyTorch 为唯一执行后端,HuggingFace checkpoint 直接加载——降低了使用门槛
  • MoE 推理关键指标:Expert Parallelism + 动态路由,DeepSeek-V3 证明了 MoE 在推理成本上的巨大优势
  • 版本漂移风险:vLLM 和 SGLang 已发布多版,版本间行为差异显著,生产环境需固定版本
  • 评价: 当前最实用的推理引擎选型指南,涵盖 2026 最新变化(TGI 退役、SGLang v0.5.8、TRT-LLM 1.3 架构变化)
  • 后续行动: 建议精读并整合进"LLM 推理引擎对比"知识节点

4. SGLang: The Complete Guide to High-Performance LLM Inference — Inference.net

  • 发布时间: 2026-01-26
  • 链接: https://inference.net/content/sglang-complete-guide
  • 可信度: 中高。技术博客,结构清晰,适合工程落地参考
  • 核心观点摘要:
  • RadixAttention(SGLang 核心创新):在 Prefix Caching 基础上进一步扩展,跨请求复用 prompt 级别 KV cache,当请求共享系统提示时,prefill 开销接近零
  • SGLang 2026 更新路线图:2026-02 实现 GB300 NVL72 25x 吞吐;2026-04 DeepSeek-V4 Day-0 支持;2026-06 DFlash + Spec V2 推测解码;2026-07 TPU 支持(RadixArk + Google);2026-07 GLM-5.2 NVFP4 达 500 TPS
  • 生产部署优势:SGLang 的调度器对多步 Agent 场景(需要大量工具调用+中间结果)天然友好,支持结构化输出
  • 评价: SGLang 是 2026 年最值得关注的推理引擎,生态扩张速度快(400,000+ GPU 部署量)
  • 后续行动: 建议纳入"推理引擎选型"主题页

二、多模态文档 RAG:ColPali/ColQwen2 2026 技术架构

⭐ A 级 — 精读

5. Multimodal RAG in 2026: Retrieval Over Images, PDFs, and Text — BigData Boutique

  • 发布时间: 2026-08(持续更新)
  • 链接: https://bigdataboutique.com/blog/multimodal-rag-retrieval-over-images-pdfs-and-text
  • 可信度: 高。专业数据工程咨询公司博客,内容深度足够
  • 核心观点摘要:

三种 2026 主流多模态 RAG 架构:

  1. Caption-and-Index(最简): 用 VLM 为图像生成文字描述,再走传统文本 RAG。延迟低,但丢失布局、图表结构信息。

  2. Unified Vision Embeddings(统一视觉嵌入): Cohere Embed 4、voyage-multimodal-3 等模型直接输出图像+文本的统一向量,检索质量高,适合多模态混合语料。

  3. Page-as-Image + Late Interaction(最强): ColPali/ColQwen2 家族。把页面当图像输入,用 Late Interaction(MaxSim)评分——保留原始布局、字体、图表结构信息。

ColPali 家族技术规格:

模型 背骨 ViDoRe NDCG@5 特点
ColPali-v1.3 PaliGemma ~84.8 轻量,448×448 固定分辨率
ColQwen2-v1.0 Qwen2-VL 领先 +5.1 动态分辨率,多语言强
ColQwen2.5-v0.2 Qwen2.5-VL ~89.5 当前最强,存储成本高
ColSmol (256M/500M) 轻量变体 较低 成本敏感场景
  • 评价: 多模态 RAG 2026 年最完整的技术架构总结,三种方案对比清晰,适合工程决策
  • 后续行动: 建议纳入"RAG 技术栈 2026"主题页更新

6. ColPali: Visual Document Retrieval Late Interaction — IoT Digital Twin PLM

  • 发布时间: 2026-08
  • 链接: https://iotdigitaltwinplm.com/colpali-visual-document-retrieval-late-interaction-2026
  • 可信度: 中。技术博客,引用 ViDoRe 排行榜数据
  • 核心观点摘要:
  • ColQwen2.5 评分 89.5 vs. ColPali-v1.3 的 84.8(NDCG@5),差距主要来自 Qwen2-VL 的动态分辨率处理——无需将页面压缩到固定尺寸
  • ViDoRe V2 是改进版基准,专门设计来增加难度、减少饱和;不同版本间排名可能变化,单一基准分数不应视为最终结论
  • NDCG@5 只衡量前 5 条召回质量,不衡量具体答案质量;实际应用需配合端到端 RAG 评估
  • ColPali 每页产生大量 patch 向量(远多于 ColBERT),存储成本高;可用 Binary Quantization(Qdrant 支持)压缩 16x 而不显著损失召回率
  • GPU 显存需求:ColQwen2.5-7B 约需 16GB VRAM,配合 Qwen3-VL 7B 答案生成可在单张 H200(141GB)上运行

  • 评价: ColPali/ColQwen2 的技术细节深度足够,尤其是存储成本和 GPU 需求的工程分析

  • 后续行动: 建议纳入"RAG 多模态技术栈"主题页

三、AI 工程职业生态:2026 新动态

B 级 — 参考

7. What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026 — Alexey D.

  • 作者: Alexey D.(Substack: DesignGurus / alexeyondata)
  • 发布时间: 2026-08
  • 链接: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
  • 可信度: 中高。样本量大(1000+ JD),分析方法为统计归纳,可信
  • 核心观点摘要:

职位分布: - AI-first 角色(约 70%):直接构建 LLM/GenAI 系统——RAG、agents、evaluation、生产部署 - AI-support 角色(约 28.5%):基础设施和平台——GPU/推理基础设施、数据管道、部署监控、提示实验 UI

核心技能栈(按出现频率): 1. LLM 集成、RAG、Agent workflows 2. API、产品化、部署、监控 3. 评估(evaluation)和 guardrails 4. 检索(专有数据)、数据管道 5. Agent 架构、多 Agent 协作

框架分布: LangChain 出现频率最高(72%),其次为 LangGraph(45%)、LlamaIndex(38%)、CrewAI(22%)、AutoGen(18%)

  • 评价: 了解 AI 工程职位市场需求和技能热度的实用参考,对技能路线规划有价值
  • 后续行动: 可作为"AI 工程技能图谱"主题页的数据来源

四、Java 在 AI 生产系统的角色(2026 新动态)

B 级 — 参考

8. Java and Python: The Real 2026 AI Production Playbook — DesignGurus(Substack)

  • 作者: Arslan Ahmad(DesignGurus)
  • 发布时间: 2026-08
  • 链接: https://substack.com/home/post/p-186623936
  • 可信度: 中。工程经验分享,有具体代码示例
  • 核心观点摘要:
  • 语义缓存(Semantic Caching)可节省 60-80% LLM 调用成本:通过向量相似度判断请求是否命中缓存,适合高重复率场景
  • GraphRAG:解决传统向量搜索无法处理的复杂关系推理问题(如"供应商→合同→地理→合规"多跳关系)
  • Java Virtual Threads + AI 场景:多 Agent 编排(100,000+ 并发 AI 任务)、流式响应处理、I/O bound 的 LLM API 调用;CPU-first 环境的 Jlama 提供了 100% Java LLM 推理路径
  • Spring AI:Java 生态的 AI 集成框架,支持 OpenAI、Azure、HuggingFace、Ollama 等后端,提供统一 API

  • 评价: Java 生态在 AI 领域的工程实践,对 Java 团队接入 AI 有参考价值

  • 后续行动: 低优先级,仅当知识库涉及 Java AI 集成时参考

五、向量数据库选型 2026:Milvus vs Qdrant 深度对比

A 级 — 精读

9. 2026 Milvus vs Qdrant: RAG Vector DB Decision — Kunal Ganglani

  • 发布时间: 2026-08
  • 链接: https://www.kunalganglani.com/blog/milvus-vs-qdrant
  • 可信度: 中高。独立技术博客,对比分析系统全面
  • 核心观点摘要:

核心架构差异:

维度 Milvus Qdrant
语言 Go + C++ Rust
架构 微服务(etcd + MinIO + 多个二进制) 单二进制 Docker
扩展性 分布式、K8s 原生 单机/简单集群
规模 十亿级 千万~亿级
运营复杂度 高(需运维多个组件) 低(单容器)
数据隔离 写入/查询节点分离,无干扰 同节点,并发写入影响查询
许可 Apache 2.0(LF AI & Data) Apache 2.0(Qdrant GmbH)

Reddit 340M 向量实测结论: - Milvus 的写入/查询节点分离架构在高并发混合负载下干扰更小 - Qdrant 在中等规模(<50M 向量)、延迟敏感场景下是更好的默认选择 - 两者均支持 HNSW、混合搜索、Apache 2.0

2026 年开源向量数据库完整格局: Tier 1: Pinecone(托管)、Qdrant(Rust 速度王);Tier 2: Weaviate(混合搜索强)、Milvus(亿级);Tier 3: Chroma(原型)、pgvector(Postgres 集成);Tier 4: LanceDB(多模态)、Vespa(大规模混合)

  • 评价: 生产环境向量数据库选型的权威参考,Reddit 340M 实测数据有说服力
  • 后续行动: 建议纳入"向量数据库选型"知识节点

B 级 — 参考

  • 链接: https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories
  • 核心观点摘要:
  • Colibri: 纯 C 实现、零依赖的 MoE 推理引擎,可在 25GB RAM 消费级机器上跑 GLM-5.2(744B 参数 MoE),通过按需流式加载 experts 实现——工程上的极致优化案例
  • OpenClaw: 2026 年 GitHub 增长最快的开源 AI 平台之一,从 PSPDFKit 创始人项目演化为开源 AI Agent 平台,星标 210,000+,从 Clawdbot → Moltbot → OpenClaw 命名演变
  • 本地 AI 三大件: Ollama + Open WebUI + OpenClaw 代表本地 AI 基础设施的成熟,隐私、成本和离线场景驱动
  • Agentic AI 主流化: n8n(工作流自动化)、Dify(LLM 应用平台)、Langflow(LangChain 可视化)均获大量采用
  • vLLM 硬件扩展: 2026 年已支持 AMD、Intel Arc、TPU,OpenAI 兼容 API 简化了从云端到自托管的迁移

  • 评价: GitHub 生态全景图,适合了解开源社区动向

  • 后续行动: 低优先级,可在开源生态主题页中引用

七、Hugging Face Daily Papers 精选(2026-08 中下旬)

精选条目(按热度排序)

论文 作者/机构 热度 核心内容
SemComp-Bench FrameX-AI 151↑ 视频生成的语义任务完成度基准
Zetta ζ Google 186↑ 嵌入式 AI agent 自演进物理智能闭环
EnvHarness Google - 静态世界激活用于 agent 学习
SWE-bench Science OpenMOSS - 编程 Agent 能解决科学工程任务吗?
MemTrapBench zjunlp - LLM 记忆使用的认知陷阱基准
Count Anything - 530 GitHub 通用目标计数模型(双粒度实例枚举)
Geometric Context Transformer - 85↑ 流式 3D 重建
LLM Agents Stick to Script - 26↑ 长时域叙事一致性基准

分类标签

推理工程 SGLang vLLM TensorRT-LLM ColPali ColQwen2 多模态RAG 向量数据库 Qdrant Milvus AI工程职业 Substack HuggingFace GitHubTrending 2026夏

建议写入路径

/shared/research-kb/inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md

后续行动建议

  1. 精读:推理工程 Roadmap(#1)+ ColPali 多模态 RAG 架构(#5)+ Milvus vs Qdrant 选型(#9)
  2. 审稿:Hugging Face "State of Open Models Summer 2026"(昨日文件已覆盖,可跳过)
  3. 主题页更新: - "推理引擎选型 2026"(vLLM/SGLang/TRT-LLM/Ollama 对比表) - "RAG 技术栈 2026"(新增多模态 RAG/ColPali 章节) - "向量数据库生产选型"(Qdrant vs Milvus 决策框架)
  4. AI 工程职业技能图谱(#7 数据可作为需求量依据)

本轮无重复条目说明

本轮重点覆盖: - Substack 推理工程深度内容(AI Engineering Insider、The AI Engineer、DesignGurus)——此前主要覆盖字节溢出类 newsletter,本轮补充工程专题 - SGLang v0.5.8 + 2026 路线图(GB300/Dflash/DeepSeek-V4 Day-0)——今日下午简报未覆盖此细节深度 - ColPali/ColQwen2 多模态 RAG 2026 技术架构——今日简报覆盖了多向量 late interaction HF blog,但未覆盖 ColPali 家族完整对比和存储成本分析 - Milvus vs Qdrant 生产选型(含 Reddit 340M 实测)——今日有 HF blog 的 multi-vector embedding,但无选型决策内容