知识库草稿 · Jay · 2026-10-09

主题

LLM推理引擎三分天下 · Agent框架2026生产选型 · HuggingFace开源模型生态 · MLOps K8s GPU部署 · 分布式OLAP · arXiv投机解码新论文


一、LLM推理引擎格局(2026晚期)

🔷 条目 1|三大推理引擎全面对比

  • 来源: Fish Audio Blog / Yotta Labs / Deploybase 联合综述
  • URLs:
  • https://fish.audio/blog/open-source-llm-inference-engines-2026
  • https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
  • https://deploybase.ai/articles/best-llm-inference-engine
  • 发布: 2026(多篇,9月)
  • 核心观点:
  • HuggingFace TGI 已进入维护模式,2026年晚期只剩三个活跃开源引擎:vLLM、SGLang、MAX(Modular)
  • vLLM(Stars ~75k):PagedAttention 虚拟内存 KV cache,吞吐量 3,500 tokens/sec,商用公司 Inferact($150M 融资),GPU 生产部署首选
  • SGLang(Stars ~25k):RadixAttention radix tree KV cache,首 token 延迟最优(80ms),多模态支持完整(已支持 diffusion LLM),Day-0 支持新模型,部署超 40 万 GPU,商用公司 RadixArk($400M 估值)
  • MAX(Modular)(Stars ~25.6k):全栈 MLIR 编译器,脱离 CUDA 依赖,商用公司 Modular($1.6B 估值,收购了 BentoML)
  • TensorRT-LLM:延迟 150ms,内存效率略优,但部署复杂度高
  • H100/H200 在生产中仍为主流,Blackwell B200/GB200 NVL72 适合大规模训练和超密度推理
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 含吞吐量/延迟基准对比表
  • ✅ 含许可证分析(Apache 2.0 vs Modular Community License)
  • ✅ 明确标注 TGI 维护状态,避免选型踩坑
  • 分类标签: LLM推理引擎 vLLM SGLang MAX TensorRT-LLM 2026晚期格局
  • 建议写入: /shared/research-kb/review/llm-inference-engine-2026-comparison.md
  • 是否精读: 是(生产选型必读,含三引擎横向对比)

🔷 条目 2|SGLang 2026年重大更新汇总

  • 来源: SGLang GitHub README / 官方博客
  • URL: https://github.com/sgl-project/sglang
  • 发布: 2026持续更新
  • 核心观点:
  • 2026/04: DeepSeek-V4 Day-0 支持,含 RL 验证(与 Miles 集成)
  • 2026/04: GB300 NVL72 上 25x 推理性能提升
  • 2026/06: DFlash + Spec V2 下一代投机解码
  • 2026/07: Kimi K3 Day-0 支持;Google TPU 全面支持
  • 2026/07: GLM5.2 NVFP4 agentic 推理,500 TPS
  • 已支持 Block Diffusion LLM(dLLM),遵循 LLaDA 首个扩散语言模型 RFC
  • SGLang 和 Google 合作将完整特性移植到 TPU
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 多模态 + diffusion LLM 支持是 2026 新方向
  • ✅ TPU 支持降低对 NVIDIA 的依赖
  • 分类标签: SGLang 推理引擎 2026更新 多模态 dLLM
  • 建议写入: /shared/research-kb/review/sglang-2026-updates.md

二、Agent框架2026生产选型

🔷 条目 1|Agentic AI框架生产对比

  • 来源: Uvik Software
  • URL: https://uvik.net/blog/agentic-ai-frameworks
  • 发布: 2026
  • 核心观点:
  • 框架选择是一阶成本驱动因素:LLM API 调用占 Agent 运营成本 40-60%,框架若增加 40% token 开销,相当于整体成本增加 40%(最大单项!)
  • 框架选型可使相同模型的基准性能相差 30 个百分点
  • 三结论:①框架是一阶成本驱动 ②部署仍是 DIY ③Guardrails 从 LLM 输入/输出过滤升级为工具调用授权+速率限制+执行验证
  • LangGraph:2025年10月 v1.0 发布,Uber、JP Morgan、LinkedIn、Klarna 生产部署,生产图编排标准
  • CrewAI:最快路径到多 Agent 原型(2-4小时)
  • OpenAI Agents SDK:GPT 中心化部署最优
  • AutoGen 已进入维护模式,Microsoft Agent Framework 是其生产继承者
  • "自己动手"流派增长:2024年用过 LangChain 后踩坑的团队正在写薄封装 + MCP,框架迁移成本高
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 含框架选择决策树
  • ✅ 明确 AutoGen 维护状态
  • ✅ 强调框架 token 开销是隐形成本
  • 分类标签: Agent框架 LangGraph CrewAI 生产选型 成本优化
  • 建议写入: /shared/research-kb/review/agent-framework-2026-production.md
  • 是否精读: 是(生产 Agent 必读,澄清了 AutoGen 状态和成本陷阱)

🔷 条目 2|AI Agents Stack 2026版(Substack)

  • 来源: The AI Engineer Substack(Paolo Perrone)
  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者/专栏: The AI Engineer(Paolo Perrone)
  • 发布: 2026(具体日期未标)
  • 核心观点:
  • Agent 栈分为六层:Models → Protocols & Tools → Memory → Frameworks → Evals → Deployment
  • Layer 1(Models):Cursor 在 Claude、GPT-4 和自微调模型间路由
  • Layer 2(Protocols & Tools):MCP 连接编辑器/终端/文件系统/git
  • Layer 3(Memory):代码库感知检索 + 重排序,Agent 不读全仓库,只取相关文件
  • Layer 4(Frameworks):定制编排 + RL 循环,不是 LangGraph,是自建控制流
  • 部署仍是 DIY:LangGraph Cloud 和 Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra(这是最大 unplanned 工程时间)
  • Guardrails 分化为独立学科:2024年 Guardrails=输入/输出过滤器;2026年 Agent Guardrails = 工具调用授权 + 速率限制 + 执行验证
  • 四种 Agent 类型选型:
    1. 简单 ReAct 单工具循环:无需框架,50行脚本+MCP
    2. 有状态多步骤工作流:LangGraph(含持久化 checkpointer)
    3. 跨会话学习 Agent:Memory-first + vector DB + eval(难点在于记忆取舍和上下文污染)
    4. 多 Agent 系统:需要 trace-level eval 先于第二个 Agent 就位
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ Substack 工程洞察,非营销内容
  • ✅ 六层架构清晰,可作为 Agent 系统设计模板
  • ✅ 强调 eval 先于多 Agent 构建
  • 分类标签: Agent架构 MCP Eval驱动 生产工程 Substack The AI Engineer
  • 建议写入: /shared/research-kb/review/ai-agents-stack-2026.md
  • 是否精读: 是(架构设计参考,Layer 分工值得内化)

三、Hugging Face 开源模型生态(2026夏)

🔷 条目 1|HF 2026夏开源模型状态报告

  • 来源: Hugging Face 官方博客
  • URL: https://huggingface.co/blog/state-of-open-models-summer-2026
  • 作者: Adina Yakefu, Apolinário, Irene Solaiman
  • 发布: 2026年夏
  • 核心观点:
  • gguf 库声明增长 464%,lerobot 194%,Apple mlx 148%——运行时层增长最快
  • AI race = 短跑 + 马拉松,llama.cpp 有助于本地大模型部署,但生态 + 商业采用仍是关键
  • Qwen 是社区基础模型:HF Hub 下载量前十中 Qwen 家族占主导(非 Llama)
  • Agents 首次成为 HF Hub 第一大用户类型——下一代报告可能形态完全不同
  • 2026年工具变化:Papers 支持机器可读 Markdown(3月);Agent traces 成头等数据集类型(4月);hf_fs tool 暴露仓库/存储/文档/Papers 通过 MCP 服务器(7月);MCP 进入 Linux Foundation Agentic AI Foundation
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 官方数据,非坊间估算
  • ✅ gguf/Apple mlx 高增速暗示推理正在向端侧和轻量化下沉
  • 分类标签: HuggingFace 开源模型 Qwen 端侧推理 MCP
  • 建议写入: /shared/research-kb/review/hf-open-models-summer-2026.md

🔷 条目 2|HF 2026年最下载模型(5月快照)

  • 来源: Presenc AI
  • URL: https://presenc.ai/research/huggingface-most-downloaded-models-2026
  • 发布: 2026年5月
  • 核心观点:
  • HF 下载量第一不是 LLM:sentence-transformers/all-MiniLM-L6-v2(80MB embedding 模型)以 2.59亿次下载居首,RAG 和搜索基础设施运行在此模型上比任何 LLM 都多
  • Qwen 主导文本生成:前20文本生成模型中 Qwen 占11个,合计约1亿次下载;Llama 3个模型合计约2000万次
  • 多语言 Agent 可见性启示:中文品牌收录(Qwen 训练语料)对多语言 Agent 可见性优化比 Llama 更重要
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 打破"Llama统治开源"的媒体叙事
  • ✅ MiniLM-L6-v2 下载量第一说明生产 RAG 的检索层被严重低估
  • 分类标签: HuggingFace Embedding模型 Qwen RAG 下载量数据
  • 建议写入: /shared/research-kb/review/hf-download-ranking-2026.md

四、向量数据库2026选型

🔷 条目 1|2026向量数据库八强格局

  • 来源: Digital Applied
  • URL: https://www.digitalapplied.com/blog/vector-databases-for-ai-agents-pinecone-qdrant-2026
  • 发布: 2026年4月
  • 核心观点:
  • Tier 1(管理型):Pinecone(托管领导者)、Vertex Vector(GCP)
  • Tier 2(开源首选):Qdrant(Rust 高性能)、Weaviate(混合搜索+GraphQL)、Milvus(大规模)
  • Tier 3(嵌入式+Postgres集成):Chroma(DX 领先)、pgvector(默认 Postgres 扩展)
  • Tier 4(大规模混合):Vespa
  • 八强锚定了2026年AI Agent 工作负载
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 清晰的 Tier 分层,选型逻辑清楚
  • 分类标签: 向量数据库 Qdrant Weaviate Milvus Chroma Pinecone
  • 建议写入: /shared/research-kb/review/vector-db-2026-landscape.md

🔷 条目 2|Qdrant vs Chroma 2026 深度对比

  • 来源: Kunal Ganglani Blog
  • URL: https://www.kunalganglani.com/blog/qdrant-vs-chroma
  • 发布: 2026
  • 核心观点:
  • Qdrant:Rust 原生,服务器优先,高级 payload 过滤,量化(INT8 压缩4x,binary 压缩32x),gRPC,分布式集群
  • Chroma:Python 原生,嵌入式优先,开发者体验,快速原型
  • 从 Chroma 迁移到 Qdrant 可行:embedding 模型、chunking 逻辑、检索提示完全可移植;主要工作是重建索引
  • 量化是性能差距变成本差距的关键:Qdrant INT8 量化内存削减约4x,召回损失<1%
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 含量化成本分析
  • ✅ Chroma → Qdrant 迁移路径
  • 分类标签: 向量数据库 Qdrant Chroma 量化压缩
  • 建议写入: /shared/research-kb/review/vector-db-qdrant-chroma-2026.md

五、MLOps + K8s GPU部署2026

🔷 条目 1|MLOps on Kubernetes 2026生产现实

  • 来源: GheWare DevOps Blog
  • URL: https://devops.gheware.com/blog/posts/mlops-model-deployment-kubernetes-2026.html
  • 发布: 2026
  • 核心观点:
  • Notebook 到生产的差距从"数周"缩短到"数天"——但成熟 MLOps 环境中 git push 到 kubectl apply 仍有24小时平均延迟
  • 放弃单一最佳框架:采用多语言方法,底层基础设施抽象模型框架,Llama 变体或 XGBoost 部署模式相同
  • GPU 调度是必备项:kata-containers/gVisor 用于推理隔离 + nodeSelector/tolerations
  • 关键配置:requests 设为平均推理内存峰值而非最大,可减少60%的抢占事件
  • 行业标准收敛到 Kserve(原 Kubeflow Serving)
  • 模型供应链安全是最大风险:不是模型本身,而是供应链
  • 金丝雀部署:5% 流量到新模型版本,监控漂移
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 含 K8s Deployment manifest 示例
  • ✅ 含 GPU 调度和资源请求配置
  • ✅ 强调供应链安全是最大盲区
  • 分类标签: MLOps Kubernetes Kserve GPU调度 生产部署
  • 建议写入: /shared/research-kb/review/mlops-k8s-2026-production.md
  • 是否精读: 是(K8s AI 部署必读,含配置模式和陷阱)

🔷 条目 2|KEDA 实现推理服务零缩放

  • 来源: JobPrep Arena Academy
  • URL: https://www.jobpreparena.com/blog/keda-for-mlops-scaling-your-model-inference-services-to-zero-on-kubernetes
  • 发布: 2026
  • 核心观点:
  • KEDA:基于任意事件源(队列深度/请求率/Prometheus 自定义指标)缩放,而非 HPA 的 CPU/内存
  • GPU 推断用 KEDA 零缩放:空闲期缩至零 pod,流量高峰快速扩展,GPU 成本降低 40-70%(对比静态配置)
  • 模式:Redis/Kafka 缓冲请求 → KEDA Scaler → ScaledObject → Deployment (0-N pods)
  • 最佳实践:minReplicaCount: 0, maxReplicaCount: 20,scaleDown stabilization 300s
  • GPU 利用率触发:用 Prometheus scaler 监控实际 GPU 利用率,避免 HPA 基于 CPU 缩放的陷阱
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 含完整的 KEDA ScaledObject YAML 示例
  • ✅ Redis queue 触发示例
  • 分类标签: KEDA Kubernetes GPU缩放 零缩放 成本优化
  • 建议写入: /shared/research-kb/review/keda-mlops-gpu-scaling-2026.md

六、arXiv 投机解码新研究(2026)

🔷 条目 1|SpecSA:投机解码 + 稀疏注意力

  • URL: https://arxiv.org/html/2605.19893v1
  • 发布: 2026
  • 可信度: 学术论文
  • 核心观点:
  • SpecSA 桥接投机解码与稀疏注意力,减少长上下文解码的 KV-cache 访问
  • 两级内核融合策略:routing-aware partial fusion + cross-layer index stability
  • 稀疏注意力动态选择 KV 子集,减少计算和 KV-cache 访问
  • 是否核验: 需核验论文实现和基准数字
  • 分类标签: arXiv 投机解码 稀疏注意力 LLM推理优化

🔷 条目 2|Speculative Speculative Decoding(SSD)

  • URL: https://arxiv.org/pdf/2603.03251
  • 发布: 2026年5月(v3)
  • 可信度: 学术论文(Stanford)
  • 核心观点:
  • 无损加速:draft 模型和 target 模型在不同硬件上,draft 在独立硬件生成猜测 token
  • 解决了普通投机解码中 verifier 等待 draft 猜测的 idle 时间问题
  • 可与扩散 LLM 或 SSM 作为 draft 模型结合
  • 是否核验: 需核验跨硬件延迟开销是否抵消收益
  • 分类标签: arXiv 投机解码 分布式推理 Stanford

🔷 条目 3|Learning To Draft:RL 自适应投机解码

  • URL: https://arxiv.org/html/2603.01639v1
  • 发布: 2026
  • 可信度: 学术论文
  • 核心观点:
  • 现有 SOTA 方法用静态时间分配,动态方法优化代理指标(接受长度)但忽略真实时间成本
  • 将投机解码建模为 RL 环境,直接最大化每轮 draft-verify 循环吞吐量
  • 交替优化 size policy 和 depth policy
  • 是否核验: 需核验与 EAGLE/MeDUSA 等现有方法的对比
  • 分类标签: arXiv 投机解码 强化学习 推理优化

🔷 条目 4|FASER:动态 LLM Serving 中投机解码粒度管理

  • URL: https://arxiv.org/html/2604.20503v1
  • 发布: 2026
  • 可信度: 学术论文
  • 核心观点:
  • 在线推理工作负载高度动态,但现有 SD 系统粗粒度管理投机 token 长度(整批统一设置)
  • 串行化 draft 和 verify 执行导致动态流量下性能不足
  • 细粒度 phase 管理适配波动在线流量
  • 是否核验: 需核验生产动态流量场景下的收益
  • 分类标签: arXiv 投机解码 LLM Serving 动态调度

🔷 条目 5|Lever:智能手机上的投机 LLM 推理

  • URL: https://arxiv.org/html/2605.16786v1
  • 发布: 2026
  • 可信度: 学术论文
  • 核心观点:
  • 小模型作为 draft 保留在 DRAM,大模型(LVM)存于 flash,仅周期性调用
  • 投机解码天然匹配手机 DRAM-flash 异构存储结构
  • 隐私保护(数据不离设备)+ 成本降低
  • 是否核验: 端侧部署参考价值高,需核验能效比
  • 分类标签: arXiv 投机解码 端侧推理 移动AI

七、分布式OLAP数据库2026

🔷 条目 1|ClickHouse vs 竞品2026生产选型

  • 来源: ClickHouse Engineering Blog
  • URL: https://clickhouse.com/resources/engineering/how-to-choose-a-database-for-real-time-analytics-in-2026
  • 发布: 2026
  • 核心观点:
  • ClickHouse:单节点到数百服务器同一二进制,无需 ETL,用 Parquet 就地查询
  • CDC 连接 OLTP → OLAP:Aurora zero-ETL 秒级,ClickPipes Postgres CDC 约10秒
  • 2026 年生产团队典型架构:PostgreSQL/MySQL 服务写,ClickHouse/Snowflake/BigQuery 服务分析读,CDC 管道秒级同步
  • OLTP vs OLAP 分界仍然存在,但分离成本已大幅降低
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 含 ClickHouse 与 Pinot/Druid 对比
  • ✅ 含 join 算法和 Bloom filter 优化说明
  • 分类标签: OLAP ClickHouse CDC 实时分析 分布式数据库
  • 建议写入: /shared/research-kb/review/olap-database-2026-clickhouse.md

本轮汇总

条目 类型 高价值 是否精读 建议写入路径
三大推理引擎对比 博客综述 ⭐⭐⭐⭐⭐ 是 review/llm-inference-engine-2026-comparison.md
SGLang 2026更新 GitHub/Official ⭐⭐⭐⭐ 是 review/sglang-2026-updates.md
Agent框架生产选型 博客 ⭐⭐⭐⭐⭐ 是 review/agent-framework-2026-production.md
AI Agents Stack 2026(Substack) Substack ⭐⭐⭐⭐⭐ 是 review/ai-agents-stack-2026.md
HF开源模型夏报 HF官方 ⭐⭐⭐⭐ 是 review/hf-open-models-summer-2026.md
HF下载量排名 第三方分析 ⭐⭐⭐⭐ 否 review/hf-download-ranking-2026.md
向量数据库八强 博客 ⭐⭐⭐⭐ 是 review/vector-db-2026-landscape.md
Qdrant vs Chroma 博客 ⭐⭐⭐⭐ 否 review/vector-db-qdrant-chroma-2026.md
MLOps K8s生产现实 博客 ⭐⭐⭐⭐⭐ 是 review/mlops-k8s-2026-production.md
KEDA GPU零缩放 博客 ⭐⭐⭐⭐ 是 review/keda-mlops-gpu-scaling-2026.md
SpecSA arXiv 学术 待核验 待核验 —
SSD arXiv 学术 待核验 待核验 —
Learning To Draft arXiv 学术 待核验 待核验 —
FASER arXiv 学术 待核验 待核验 —
Lever arXiv 学术 待核验 待核验 —
ClickHouse OLAP选型 官方博客 ⭐⭐⭐⭐ 否 review/olap-database-2026-clickhouse.md

本轮主题:LLM推理引擎三足鼎立 + Agent框架生产选型 + MLOps K8s部署 + OLAP格局 + arXiv投机解码前沿

建议后续行动: 1. SGLang vs vLLM 生产选型专题页(高优先级) 2. AI Agents Stack 2026 六层架构图(可视化) 3. 向量数据库选型矩阵(已有Qdrant/Chroma,可整合ParadeDB) 4. KEDA + Prometheus GPU 缩放实操指南