Jay 晚间简报 · 2026-08-29 下午场(晚)
实例: Jay · 时间: 2026-08-29 21:00 (Asia/Shanghai) 主题: MAX 推理引擎深度解析 / ACM 推理引擎综述 / Substack 工程洞察 / 多模态 RAG 2026 新范式 检索范围: Tavily · Fish Audio Blog · DeployBase · ACM TIST · Substack (Gradient Flow / Hugobowne / Rocky Bhatia / The AI Engineer) · GitHub
一、推理引擎新增:MAX (Modular AI) 非 CUDA 架构 ⭐⭐⭐ 高
2026 下半年新进入三分天下的推理引擎,与 vLLM/SGLang 并列为三大生产级选项之一。
M1 · MAX vs SGLang vs vLLM 深度横评(Fish Audio Blog)⭐⭐⭐
- 来源: https://fish.audio/blog/open-source-llm-inference-engines-2026
- 发布时间: 2026(推断;内容含 2026 年各框架最新状态)
- 核心创新对比:
| 特性 | SGLang | vLLM | MAX (Modular) |
|---|---|---|---|
| GitHub Stars | ~25,000 | ~75,000 | ~25,600 |
| 许可证 | Apache 2.0 | Apache 2.0 | Apache 2.0 + LLVM Exc. / Modular Community License |
| 商业实体 | RadixArk ($400M估值) | Inferact ($150M融资) | Modular AI ($1.6B估值) |
| 核心创新 | RadixAttention (radix tree KV cache) | PagedAttention (虚拟内存 KV cache) | 全栈 MLIR 编译器,无 CUDA 依赖 |
- MAX 核心技术亮点:
- Mojo 内核替代 cuBLAS/cuDNN/FlashAttention: 用 Mojo 编写 matmul 内核,在 B200 上达到 1,772 TFLOPS,超越 cuBLAS
- 完全无 CUDA: 唯一不依赖 NVIDIA CUDA 生态的推理引擎栈,Mojo 内核可移植到任意硬件
- 基准数据: L40 + Qwen3-8B:MAX 500 prompts 耗时 50.6s vs SGLang 54.2s vs vLLM 58.9s(比 vLLM 快 16%);Vast.ai + Llama 3.1 8B:MAX 89.9 tok/s vs vLLM 75.9 tok/s(比 vLLM 快 18%),TTFT 几乎减半
- MAX 局限:
- 编译器部分仍使用 Modular 社区许可证(限制商业使用)
- 生态系统小于 vLLM,生产部署案例较少
- Mojo 语言本身的学习曲线
- 选型结论(2026 下半年更新):
- 云端高性能 / 多 GPU → TensorRT-LLM
- 云端灵活部署 / 最大生态 → vLLM
- Agent 场景 / 多轮对话 / 共享前缀 → SGLang(RadixAttention 优势显著)
- Mac / 非 NVIDIA 硬件 / 需要 CUDA 替代 → MAX
- 本地测试 / 快速原型 → Ollama
- 移动端 → MLC LLM
- 国内 GPU(昇腾等)→ LMDeploy
- 分类标签:
推理引擎MAXModular AIMojo非CUDABenchmark - 建议路径:
/shared/research-kb/inbox/jay/inference/max-modular-inference-engine-2026.md - 是否精读: 中 — Fish Audio 有具体 benchmark 数据,需核实测试环境一致性
M2 · ACM TIST 2026 综述:LLM 推理引擎全景 ⭐⭐⭐
- 来源: ACM Trans. Intell. Syst. Technol. · "A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency" (2026)
- 论文链接: https://doi.org/10.1145/3803798(arXiv 预印本可能存在)
- 作者: Park et al. — ACM 正式期刊论文(同行评审)
- 覆盖范围(来自 Awesome-LLM-Inference-Engine GitHub 引用):
- 异构设备分类:单节点 vs 多节点
- 同构设备分类:LLM 推理引擎全面梳理
- 关键采样优化技术:EAGLE(多 token 推测解码)/ Medusa(树形多头解码)/ ReDrafter(长上下文重生成)/ MineDraft(vLLM 插件,批量并行推测解码)
- MineDraft 特别标注(2026 新增): 批量并行推测解码,重叠起草和验证阶段
- 分类标签:
学术论文ACM综述推理引擎推测解码 - 建议路径:
/shared/research-kb/inbox/jay/inference/acm-tist-llm-inference-engine-survey-2026.md - 是否精读: 中高 — ACM 正式期刊论文,引用价值高;需核验 MineDraft vLLM PR 编号
二、Substack 工程洞察(未在 16:20 批次覆盖)
S1 · RAG 范式重塑:2026 五项突破(Gradient Flow / Ben Lorica)⭐⭐ 高
- 来源: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
- 作者: Ben Lorica(Gradient Flow 编辑,O'Reilly AI Conference / AI Agent Conference / NLP Summit 组织者)
- 专栏可信度: 高(数据+AI 领域资深媒体人,读者群为工程和数据专业人士)
- 五大突破(2026 RAG 范式演进): 1. Agentic RAG: 动态检索策略,模型自主决定何时/是否检索(替代固定 RAG pipeline) 2. 知识图谱增强 RAG: EY 案例(见本简报 S2);多跳推理,跨文档关系建模 3. 多模态 RAG: 图/表/PDF 布局感知;ColPali / ColQwen2.5 / ColNomic late-interaction 模式(见本批次多模态 RAG 调研) 4. 纠错 RAG(Corrective RAG): 检索结果自评估, hallucination 过滤层 5. 上下文压缩 / 重排序: 查询聚焦压缩 + 交叉编码器重排(而非仅向量相似度)
- Block (Jackie Brosamer + Brad Axen) 的观点: AI 工程中 solid document processing 被严重低估——"垃圾进,垃圾出"在 RAG 中尤为突出
- 与 15:05 批次关联: 与 KV Cache 作为基础设施原语(arXiv:2608.01526)呼应;RAG 检索质量决定注入 LLM 的 context 质量
- 分类标签:
RAGSubstackGradient FlowBen Lorica多模态RAG知识图谱 - 建议路径:
/shared/research-kb/inbox/jay/sources/rag-reimagined-5-breakthroughs-gradientflow-2026.md - 是否需要核验: 是 → 核验 Block 观点原始来源(可能是 Goose Agent 访谈内容)
S2 · EY 多模态知识图谱 RAG(SiliconANGLE)⭐⭐ 中高
- 来源: https://siliconangle.com/2026/07/17/ey-re-envisions-rag-around-multimodal-knowledge-graphs-improve-accuracy/
- 核心观点: EY 白皮书描述了三种构建检索关系的路径:确定性关键词匹配 / 基于 embedding 的语义相似度 / ML 推理隐式关联
- gleaning 过程: 查找缺失链接 / 消歧 / 识别跨文档关联,结果为异构图,支持多跳推理
- 检索分阶段: modality-specific index → 知识图谱邻域遍历 → multimodal re-ranker(最终排序后注入 LLM prompt)
- 启示: 企业 RAG 在 2026 年正在从"向量相似度"向"知识图谱推理"演进;RAG + 知识图谱 = 多跳推理基础设施
- 分类标签:
RAG知识图谱EY多模态企业RAG多跳推理 - 建议路径:
/shared/research-kb/inbox/jay/sources/ey-multimodal-knowledge-graph-rag-2026.md
S3 · Hugobowne:LLM 架构 2026(Agent Harnesses / Hybrid Models)⭐⭐ 中
- 来源: https://hugobowne.substack.com/p/llm-architecture-in-2026-agent-harnesses
- 作者: Hugo Bowne-Anderson(数据科学领域知名作者,Substack 早期写作者)
- 核心框架: LLM sits inside an agent harness that provides tools, memory, context, and control flow
- 观点: "If you take a working LLM architecture as an anchor point, you can go in both directions — plug it into an agent harness, or look at what's under the hood."
- 与 16:20 批次 The AI Engineer Stack 的关系: The AI Engineer 提供的是 6 层工程师视角,Hugobowne 提供的是 LLM 自身架构视角——互补
- 分类标签:
SubstackLLM架构AgentHugobowne教育 - 建议路径:
/shared/research-kb/inbox/jay/sources/hugobowne-llm-architecture-2026-agent-harnesses.md - 行动项: 可与 The AI Engineer Stack 2026 版合并作为 Agent 架构双视角参考
S4 · Rocky Bhatia:2026 学习 Agentic AI 十层路线图 ⭐⭐⭐
- 来源: https://rockybhatia.substack.com/p/how-to-learn-agentic-ai-in-2026
- 核心结构(10层学习路径): 1. LLM fundamentals(tokenization / context windows / embeddings / inference latency / sampling / hallucination / context degradation) 2. Retrieval systems 3. Workflow orchestration 4. Tool execution 5. Memory architectures 6. Evaluation & reliability 7. Security + governance 8. Multi-agent coordination 9. Operational economics 10. Production deployment
- 关键洞察: "Agent ≠ chatbot;Agent = LLM + Retrieval + Memory + Tools + Planning + State + Observability + Constraints + Execution Infrastructure"
- 模型通常不是最难的部分
- 允许 LLM 行动而非仅响应时,工程问题完全改变(需要执行边界 / 回滚机制 / 审计 / 可观测性 / 权限系统 / 验证层 / 超时处理 / 故障隔离)
- "Don't prototype in production" 警示: AutoGPT 风格 demo 在生产中崩溃的原因:demo 环境干净,生产环境从不干净
- 评价: 目前看到的最结构化的 Agentic AI 学习路径之一;适合作为知识库学习路线图基础
- 分类标签:
SubstackAgentic AI学习路径Rocky Bhatia工程教育 - 建议路径:
/shared/research-kb/inbox/jay/sources/rockybhatia-agentic-ai-learning-path-2026.md - 行动项: 建议纳入知识库 AI Agent 主题页作为学习路线图基础;与 The AI Engineer 6 层架构对照整合
三、工程学习资源:GitHub 推理工程教程 ⭐⭐ 中高
G1 · LLM Inference Engineering 学习路径(Outcome School / Amit Shekhar)⭐⭐
- 来源: https://github.com/amitshekhariitbhu/llm-inference-engineering
- 许可证: Apache 2.0(Outcome School 维护)
- 覆盖内容(分章节):
- Part 1: GQA(Grouped Query Attention)/ KV Cache / vLLM 架构
- Part 2: PagedAttention / FlashAttention / 连续批处理
- Part 3: 吞吐量和延迟优化 / Continuous Batching
- (持续更新中)
- 特色: 从 KV cache 基础到 PagedAttention 到 vLLM 到 SGLang 到 GPU 调优——系统化学习路径,非碎片化博客
- 评价: 与 Lilian Weng / Simon Willison 风格互补——更偏工程入门,系统性更强;与吴恩达课程风格相近但聚焦在 LLM inference
- 分类标签:
GitHub学习资源LLM推理KV CachePagedAttentionvLLMSGLang - 建议路径:
/shared/research-kb/inbox/jay/sources/llm-inference-engineering-github-learning-path.md
四、补充:2026-08 推理引擎 Benchmark 快照(综合更新)
本节汇总本轮新收集的基准数据,与 15:05 批次(vLLM vs SGLang vs LMDeploy)互补。
| 引擎 | 吞吐量 | TTFT | 适用场景 | 备注 |
|---|---|---|---|---|
| MAX | 89.9 tok/s (Llama3.1 8B) | ~短 | 非 NVIDIA / Mac / 需要 CUDA 替代 | 比 vLLM 快 18% |
| SGLang | 最高 1800 tok/s (8k 短文本) | 80ms(最快) | Agent / 多轮对话 / 共享前缀 | 长文本降至 900 tok/s |
| vLLM | 1200 tok/s 稳定 (32k, 50+并发) | 150ms | 高并发 API / 吞吐敏感 | 生态最成熟 |
| TGI | 2500 tokens/s | 250ms | HuggingFace 生态 | 略慢 |
来源: DeployBase (deploybase.ai) · Fish Audio · premai.io
五、本轮汇总
| 类别 | 高价值条目 | 优先级 |
|---|---|---|
| 推理引擎 | MAX (Modular AI) 非 CUDA 推理栈深度解析 + benchmark vs SGLang/vLLM | ⭐⭐⭐⭐ |
| 学术 | ACM TIST 2026 LLM 推理引擎综述(MineDraft / EAGLE / Medusa / ReDrafter) | ⭐⭐⭐ |
| Substack | Rocky Bhatia 10层 Agentic AI 学习路径(最佳学习路线图之一) | ⭐⭐⭐ |
| Substack | Gradient Flow RAG 五大突破(EY 知识图谱 / ColPali / Corrective RAG) | ⭐⭐⭐ |
| Substack | Hugobowne LLM 架构 2026(Agent Harness 视角) | ⭐⭐ |
| 工程资源 | Outcome School LLM Inference Engineering GitHub 教程 | ⭐⭐ |
| Benchmark | 2026-08 MAX / SGLang / vLLM / TGI 吞吐量对比表 | ⭐⭐⭐ |
六、建议写入路径
本轮草稿: /shared/research-kb/inbox/jay/2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md
推荐专题合并(供后续主题页更新参考):
- inference/max-modular-ai-inference-engine.md — MAX 深度解析(建议与 15:05 vLLM/SGLang/LMDeploy 对比合并)
- agents/agentic-ai-learning-pathway-rockybhatia.md — 10层学习路线图(建议与 The AI Engineer 6层架构合并)
- rag/rag-reimagined-2026-gradientflow.md — RAG 五大突破(建议与 EY 知识图谱 RAG 合并)
- inference/llm-inference-engineering-github-learning-path.md — GitHub 教程资源页
七、后续行动建议
| 优先级 | 行动 | 目标 |
|---|---|---|
| P1 | MAX 实测 benchmark 核实(Fish Audio 测试环境 vs 官方 Modular 声明一致性) | 推理引擎主题页精读项 |
| P2 | 核验 MineDraft vLLM PR(批量并行推测解码 2026 新增) | 推测解码技术追踪 |
| P2 | Rocky Bhatia 10层路线图 vs The AI Engineer 6层架构整合为知识库 Agent 学习路径 | Agent 主题页更新 |
| P3 | ACM TIST 2026 论文精读(arXiv 版本可用性确认) | 学术论文入库 |
| P3 | Block (Goose Agent) 原始来源核验(RAG + solid document processing 观点) | Substack 核验项 |