知识库草稿 · Jay · 2026-10-09
主题
LLM推理引擎三分天下 · Agent框架2026生产选型 · HuggingFace开源模型生态 · MLOps K8s GPU部署 · 分布式OLAP · arXiv投机解码新论文
一、LLM推理引擎格局(2026晚期)
🔷 条目 1|三大推理引擎全面对比
- 来源: Fish Audio Blog / Yotta Labs / Deploybase 联合综述
- URLs:
- https://fish.audio/blog/open-source-llm-inference-engines-2026
- https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
- https://deploybase.ai/articles/best-llm-inference-engine
- 发布: 2026(多篇,9月)
- 核心观点:
- HuggingFace TGI 已进入维护模式,2026年晚期只剩三个活跃开源引擎:vLLM、SGLang、MAX(Modular)
- vLLM(Stars ~75k):PagedAttention 虚拟内存 KV cache,吞吐量 3,500 tokens/sec,商用公司 Inferact($150M 融资),GPU 生产部署首选
- SGLang(Stars ~25k):RadixAttention radix tree KV cache,首 token 延迟最优(80ms),多模态支持完整(已支持 diffusion LLM),Day-0 支持新模型,部署超 40 万 GPU,商用公司 RadixArk($400M 估值)
- MAX(Modular)(Stars ~25.6k):全栈 MLIR 编译器,脱离 CUDA 依赖,商用公司 Modular($1.6B 估值,收购了 BentoML)
- TensorRT-LLM:延迟 150ms,内存效率略优,但部署复杂度高
- H100/H200 在生产中仍为主流,Blackwell B200/GB200 NVL72 适合大规模训练和超密度推理
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 含吞吐量/延迟基准对比表
- ✅ 含许可证分析(Apache 2.0 vs Modular Community License)
- ✅ 明确标注 TGI 维护状态,避免选型踩坑
- 分类标签:
LLM推理引擎vLLMSGLangMAXTensorRT-LLM2026晚期格局 - 建议写入:
/shared/research-kb/review/llm-inference-engine-2026-comparison.md - 是否精读: 是(生产选型必读,含三引擎横向对比)
🔷 条目 2|SGLang 2026年重大更新汇总
- 来源: SGLang GitHub README / 官方博客
- URL: https://github.com/sgl-project/sglang
- 发布: 2026持续更新
- 核心观点:
- 2026/04: DeepSeek-V4 Day-0 支持,含 RL 验证(与 Miles 集成)
- 2026/04: GB300 NVL72 上 25x 推理性能提升
- 2026/06: DFlash + Spec V2 下一代投机解码
- 2026/07: Kimi K3 Day-0 支持;Google TPU 全面支持
- 2026/07: GLM5.2 NVFP4 agentic 推理,500 TPS
- 已支持 Block Diffusion LLM(dLLM),遵循 LLaDA 首个扩散语言模型 RFC
- SGLang 和 Google 合作将完整特性移植到 TPU
- 工程价值: ⭐⭐⭐⭐
- ✅ 多模态 + diffusion LLM 支持是 2026 新方向
- ✅ TPU 支持降低对 NVIDIA 的依赖
- 分类标签:
SGLang推理引擎2026更新多模态dLLM - 建议写入:
/shared/research-kb/review/sglang-2026-updates.md
二、Agent框架2026生产选型
🔷 条目 1|Agentic AI框架生产对比
- 来源: Uvik Software
- URL: https://uvik.net/blog/agentic-ai-frameworks
- 发布: 2026
- 核心观点:
- 框架选择是一阶成本驱动因素:LLM API 调用占 Agent 运营成本 40-60%,框架若增加 40% token 开销,相当于整体成本增加 40%(最大单项!)
- 框架选型可使相同模型的基准性能相差 30 个百分点
- 三结论:①框架是一阶成本驱动 ②部署仍是 DIY ③Guardrails 从 LLM 输入/输出过滤升级为工具调用授权+速率限制+执行验证
- LangGraph:2025年10月 v1.0 发布,Uber、JP Morgan、LinkedIn、Klarna 生产部署,生产图编排标准
- CrewAI:最快路径到多 Agent 原型(2-4小时)
- OpenAI Agents SDK:GPT 中心化部署最优
- AutoGen 已进入维护模式,Microsoft Agent Framework 是其生产继承者
- "自己动手"流派增长:2024年用过 LangChain 后踩坑的团队正在写薄封装 + MCP,框架迁移成本高
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 含框架选择决策树
- ✅ 明确 AutoGen 维护状态
- ✅ 强调框架 token 开销是隐形成本
- 分类标签:
Agent框架LangGraphCrewAI生产选型成本优化 - 建议写入:
/shared/research-kb/review/agent-framework-2026-production.md - 是否精读: 是(生产 Agent 必读,澄清了 AutoGen 状态和成本陷阱)
🔷 条目 2|AI Agents Stack 2026版(Substack)
- 来源: The AI Engineer Substack(Paolo Perrone)
- URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者/专栏: The AI Engineer(Paolo Perrone)
- 发布: 2026(具体日期未标)
- 核心观点:
- Agent 栈分为六层:Models → Protocols & Tools → Memory → Frameworks → Evals → Deployment
- Layer 1(Models):Cursor 在 Claude、GPT-4 和自微调模型间路由
- Layer 2(Protocols & Tools):MCP 连接编辑器/终端/文件系统/git
- Layer 3(Memory):代码库感知检索 + 重排序,Agent 不读全仓库,只取相关文件
- Layer 4(Frameworks):定制编排 + RL 循环,不是 LangGraph,是自建控制流
- 部署仍是 DIY:LangGraph Cloud 和 Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra(这是最大 unplanned 工程时间)
- Guardrails 分化为独立学科:2024年 Guardrails=输入/输出过滤器;2026年 Agent Guardrails = 工具调用授权 + 速率限制 + 执行验证
- 四种 Agent 类型选型:
- 简单 ReAct 单工具循环:无需框架,50行脚本+MCP
- 有状态多步骤工作流:LangGraph(含持久化 checkpointer)
- 跨会话学习 Agent:Memory-first + vector DB + eval(难点在于记忆取舍和上下文污染)
- 多 Agent 系统:需要 trace-level eval 先于第二个 Agent 就位
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ Substack 工程洞察,非营销内容
- ✅ 六层架构清晰,可作为 Agent 系统设计模板
- ✅ 强调 eval 先于多 Agent 构建
- 分类标签:
Agent架构MCPEval驱动生产工程SubstackThe AI Engineer - 建议写入:
/shared/research-kb/review/ai-agents-stack-2026.md - 是否精读: 是(架构设计参考,Layer 分工值得内化)
三、Hugging Face 开源模型生态(2026夏)
🔷 条目 1|HF 2026夏开源模型状态报告
- 来源: Hugging Face 官方博客
- URL: https://huggingface.co/blog/state-of-open-models-summer-2026
- 作者: Adina Yakefu, Apolinário, Irene Solaiman
- 发布: 2026年夏
- 核心观点:
- gguf 库声明增长 464%,lerobot 194%,Apple mlx 148%——运行时层增长最快
- AI race = 短跑 + 马拉松,llama.cpp 有助于本地大模型部署,但生态 + 商业采用仍是关键
- Qwen 是社区基础模型:HF Hub 下载量前十中 Qwen 家族占主导(非 Llama)
- Agents 首次成为 HF Hub 第一大用户类型——下一代报告可能形态完全不同
- 2026年工具变化:Papers 支持机器可读 Markdown(3月);Agent traces 成头等数据集类型(4月);hf_fs tool 暴露仓库/存储/文档/Papers 通过 MCP 服务器(7月);MCP 进入 Linux Foundation Agentic AI Foundation
- 工程价值: ⭐⭐⭐⭐
- ✅ 官方数据,非坊间估算
- ✅ gguf/Apple mlx 高增速暗示推理正在向端侧和轻量化下沉
- 分类标签:
HuggingFace开源模型Qwen端侧推理MCP - 建议写入:
/shared/research-kb/review/hf-open-models-summer-2026.md
🔷 条目 2|HF 2026年最下载模型(5月快照)
- 来源: Presenc AI
- URL: https://presenc.ai/research/huggingface-most-downloaded-models-2026
- 发布: 2026年5月
- 核心观点:
- HF 下载量第一不是 LLM:sentence-transformers/all-MiniLM-L6-v2(80MB embedding 模型)以 2.59亿次下载居首,RAG 和搜索基础设施运行在此模型上比任何 LLM 都多
- Qwen 主导文本生成:前20文本生成模型中 Qwen 占11个,合计约1亿次下载;Llama 3个模型合计约2000万次
- 多语言 Agent 可见性启示:中文品牌收录(Qwen 训练语料)对多语言 Agent 可见性优化比 Llama 更重要
- 工程价值: ⭐⭐⭐⭐
- ✅ 打破"Llama统治开源"的媒体叙事
- ✅ MiniLM-L6-v2 下载量第一说明生产 RAG 的检索层被严重低估
- 分类标签:
HuggingFaceEmbedding模型QwenRAG下载量数据 - 建议写入:
/shared/research-kb/review/hf-download-ranking-2026.md
四、向量数据库2026选型
🔷 条目 1|2026向量数据库八强格局
- 来源: Digital Applied
- URL: https://www.digitalapplied.com/blog/vector-databases-for-ai-agents-pinecone-qdrant-2026
- 发布: 2026年4月
- 核心观点:
- Tier 1(管理型):Pinecone(托管领导者)、Vertex Vector(GCP)
- Tier 2(开源首选):Qdrant(Rust 高性能)、Weaviate(混合搜索+GraphQL)、Milvus(大规模)
- Tier 3(嵌入式+Postgres集成):Chroma(DX 领先)、pgvector(默认 Postgres 扩展)
- Tier 4(大规模混合):Vespa
- 八强锚定了2026年AI Agent 工作负载
- 工程价值: ⭐⭐⭐⭐
- ✅ 清晰的 Tier 分层,选型逻辑清楚
- 分类标签:
向量数据库QdrantWeaviateMilvusChromaPinecone - 建议写入:
/shared/research-kb/review/vector-db-2026-landscape.md
🔷 条目 2|Qdrant vs Chroma 2026 深度对比
- 来源: Kunal Ganglani Blog
- URL: https://www.kunalganglani.com/blog/qdrant-vs-chroma
- 发布: 2026
- 核心观点:
- Qdrant:Rust 原生,服务器优先,高级 payload 过滤,量化(INT8 压缩4x,binary 压缩32x),gRPC,分布式集群
- Chroma:Python 原生,嵌入式优先,开发者体验,快速原型
- 从 Chroma 迁移到 Qdrant 可行:embedding 模型、chunking 逻辑、检索提示完全可移植;主要工作是重建索引
- 量化是性能差距变成本差距的关键:Qdrant INT8 量化内存削减约4x,召回损失<1%
- 工程价值: ⭐⭐⭐⭐
- ✅ 含量化成本分析
- ✅ Chroma → Qdrant 迁移路径
- 分类标签:
向量数据库QdrantChroma量化压缩 - 建议写入:
/shared/research-kb/review/vector-db-qdrant-chroma-2026.md
五、MLOps + K8s GPU部署2026
🔷 条目 1|MLOps on Kubernetes 2026生产现实
- 来源: GheWare DevOps Blog
- URL: https://devops.gheware.com/blog/posts/mlops-model-deployment-kubernetes-2026.html
- 发布: 2026
- 核心观点:
- Notebook 到生产的差距从"数周"缩短到"数天"——但成熟 MLOps 环境中 git push 到 kubectl apply 仍有24小时平均延迟
- 放弃单一最佳框架:采用多语言方法,底层基础设施抽象模型框架,Llama 变体或 XGBoost 部署模式相同
- GPU 调度是必备项:kata-containers/gVisor 用于推理隔离 + nodeSelector/tolerations
- 关键配置:requests 设为平均推理内存峰值而非最大,可减少60%的抢占事件
- 行业标准收敛到 Kserve(原 Kubeflow Serving)
- 模型供应链安全是最大风险:不是模型本身,而是供应链
- 金丝雀部署:5% 流量到新模型版本,监控漂移
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 含 K8s Deployment manifest 示例
- ✅ 含 GPU 调度和资源请求配置
- ✅ 强调供应链安全是最大盲区
- 分类标签:
MLOpsKubernetesKserveGPU调度生产部署 - 建议写入:
/shared/research-kb/review/mlops-k8s-2026-production.md - 是否精读: 是(K8s AI 部署必读,含配置模式和陷阱)
🔷 条目 2|KEDA 实现推理服务零缩放
- 来源: JobPrep Arena Academy
- URL: https://www.jobpreparena.com/blog/keda-for-mlops-scaling-your-model-inference-services-to-zero-on-kubernetes
- 发布: 2026
- 核心观点:
- KEDA:基于任意事件源(队列深度/请求率/Prometheus 自定义指标)缩放,而非 HPA 的 CPU/内存
- GPU 推断用 KEDA 零缩放:空闲期缩至零 pod,流量高峰快速扩展,GPU 成本降低 40-70%(对比静态配置)
- 模式:Redis/Kafka 缓冲请求 → KEDA Scaler → ScaledObject → Deployment (0-N pods)
- 最佳实践:minReplicaCount: 0, maxReplicaCount: 20,scaleDown stabilization 300s
- GPU 利用率触发:用 Prometheus scaler 监控实际 GPU 利用率,避免 HPA 基于 CPU 缩放的陷阱
- 工程价值: ⭐⭐⭐⭐
- ✅ 含完整的 KEDA ScaledObject YAML 示例
- ✅ Redis queue 触发示例
- 分类标签:
KEDAKubernetesGPU缩放零缩放成本优化 - 建议写入:
/shared/research-kb/review/keda-mlops-gpu-scaling-2026.md
六、arXiv 投机解码新研究(2026)
🔷 条目 1|SpecSA:投机解码 + 稀疏注意力
- URL: https://arxiv.org/html/2605.19893v1
- 发布: 2026
- 可信度: 学术论文
- 核心观点:
- SpecSA 桥接投机解码与稀疏注意力,减少长上下文解码的 KV-cache 访问
- 两级内核融合策略:routing-aware partial fusion + cross-layer index stability
- 稀疏注意力动态选择 KV 子集,减少计算和 KV-cache 访问
- 是否核验: 需核验论文实现和基准数字
- 分类标签:
arXiv投机解码稀疏注意力LLM推理优化
🔷 条目 2|Speculative Speculative Decoding(SSD)
- URL: https://arxiv.org/pdf/2603.03251
- 发布: 2026年5月(v3)
- 可信度: 学术论文(Stanford)
- 核心观点:
- 无损加速:draft 模型和 target 模型在不同硬件上,draft 在独立硬件生成猜测 token
- 解决了普通投机解码中 verifier 等待 draft 猜测的 idle 时间问题
- 可与扩散 LLM 或 SSM 作为 draft 模型结合
- 是否核验: 需核验跨硬件延迟开销是否抵消收益
- 分类标签:
arXiv投机解码分布式推理Stanford
🔷 条目 3|Learning To Draft:RL 自适应投机解码
- URL: https://arxiv.org/html/2603.01639v1
- 发布: 2026
- 可信度: 学术论文
- 核心观点:
- 现有 SOTA 方法用静态时间分配,动态方法优化代理指标(接受长度)但忽略真实时间成本
- 将投机解码建模为 RL 环境,直接最大化每轮 draft-verify 循环吞吐量
- 交替优化 size policy 和 depth policy
- 是否核验: 需核验与 EAGLE/MeDUSA 等现有方法的对比
- 分类标签:
arXiv投机解码强化学习推理优化
🔷 条目 4|FASER:动态 LLM Serving 中投机解码粒度管理
- URL: https://arxiv.org/html/2604.20503v1
- 发布: 2026
- 可信度: 学术论文
- 核心观点:
- 在线推理工作负载高度动态,但现有 SD 系统粗粒度管理投机 token 长度(整批统一设置)
- 串行化 draft 和 verify 执行导致动态流量下性能不足
- 细粒度 phase 管理适配波动在线流量
- 是否核验: 需核验生产动态流量场景下的收益
- 分类标签:
arXiv投机解码LLM Serving动态调度
🔷 条目 5|Lever:智能手机上的投机 LLM 推理
- URL: https://arxiv.org/html/2605.16786v1
- 发布: 2026
- 可信度: 学术论文
- 核心观点:
- 小模型作为 draft 保留在 DRAM,大模型(LVM)存于 flash,仅周期性调用
- 投机解码天然匹配手机 DRAM-flash 异构存储结构
- 隐私保护(数据不离设备)+ 成本降低
- 是否核验: 端侧部署参考价值高,需核验能效比
- 分类标签:
arXiv投机解码端侧推理移动AI
七、分布式OLAP数据库2026
🔷 条目 1|ClickHouse vs 竞品2026生产选型
- 来源: ClickHouse Engineering Blog
- URL: https://clickhouse.com/resources/engineering/how-to-choose-a-database-for-real-time-analytics-in-2026
- 发布: 2026
- 核心观点:
- ClickHouse:单节点到数百服务器同一二进制,无需 ETL,用 Parquet 就地查询
- CDC 连接 OLTP → OLAP:Aurora zero-ETL 秒级,ClickPipes Postgres CDC 约10秒
- 2026 年生产团队典型架构:PostgreSQL/MySQL 服务写,ClickHouse/Snowflake/BigQuery 服务分析读,CDC 管道秒级同步
- OLTP vs OLAP 分界仍然存在,但分离成本已大幅降低
- 工程价值: ⭐⭐⭐⭐
- ✅ 含 ClickHouse 与 Pinot/Druid 对比
- ✅ 含 join 算法和 Bloom filter 优化说明
- 分类标签:
OLAPClickHouseCDC实时分析分布式数据库 - 建议写入:
/shared/research-kb/review/olap-database-2026-clickhouse.md
本轮汇总
| 条目 | 类型 | 高价值 | 是否精读 | 建议写入路径 |
|---|---|---|---|---|
| 三大推理引擎对比 | 博客综述 | ⭐⭐⭐⭐⭐ | 是 | review/llm-inference-engine-2026-comparison.md |
| SGLang 2026更新 | GitHub/Official | ⭐⭐⭐⭐ | 是 | review/sglang-2026-updates.md |
| Agent框架生产选型 | 博客 | ⭐⭐⭐⭐⭐ | 是 | review/agent-framework-2026-production.md |
| AI Agents Stack 2026(Substack) | Substack | ⭐⭐⭐⭐⭐ | 是 | review/ai-agents-stack-2026.md |
| HF开源模型夏报 | HF官方 | ⭐⭐⭐⭐ | 是 | review/hf-open-models-summer-2026.md |
| HF下载量排名 | 第三方分析 | ⭐⭐⭐⭐ | 否 | review/hf-download-ranking-2026.md |
| 向量数据库八强 | 博客 | ⭐⭐⭐⭐ | 是 | review/vector-db-2026-landscape.md |
| Qdrant vs Chroma | 博客 | ⭐⭐⭐⭐ | 否 | review/vector-db-qdrant-chroma-2026.md |
| MLOps K8s生产现实 | 博客 | ⭐⭐⭐⭐⭐ | 是 | review/mlops-k8s-2026-production.md |
| KEDA GPU零缩放 | 博客 | ⭐⭐⭐⭐ | 是 | review/keda-mlops-gpu-scaling-2026.md |
| SpecSA arXiv | 学术 | 待核验 | 待核验 | — |
| SSD arXiv | 学术 | 待核验 | 待核验 | — |
| Learning To Draft arXiv | 学术 | 待核验 | 待核验 | — |
| FASER arXiv | 学术 | 待核验 | 待核验 | — |
| Lever arXiv | 学术 | 待核验 | 待核验 | — |
| ClickHouse OLAP选型 | 官方博客 | ⭐⭐⭐⭐ | 否 | review/olap-database-2026-clickhouse.md |
本轮主题:LLM推理引擎三足鼎立 + Agent框架生产选型 + MLOps K8s部署 + OLAP格局 + arXiv投机解码前沿
建议后续行动: 1. SGLang vs vLLM 生产选型专题页(高优先级) 2. AI Agents Stack 2026 六层架构图(可视化) 3. 向量数据库选型矩阵(已有Qdrant/Chroma,可整合ParadeDB) 4. KEDA + Prometheus GPU 缩放实操指南