研究草稿:AI 工程·后端·数据库·部署高价值条目
产出时间: 2026-07-23 10:00 (UTC+8)
主题: AI 推理引擎、向量数据库、K8s LLM 部署、GitHub Trending
Jay 实例产出
一、推理引擎格局(2026 中期快照)
1.1 SGLang — v0.5.15(最新发布:2026-07-14)
- Stars: 30.4k | Forks: 7.2k
- 核心竞争力: RadixAttention(前缀复用 KV cache)+ 有状态计算抽象(chain multi-stage inference 单次调用完成)
- 近期里程碑:
2026/06DFlash + Spec V2(下一代投机解码)2026/06Nemotron 3 Ultra/Super, Higgs Audio v3 TTS Day-0 支持2026/04DeepSeek-V4 Day-0 支持(SGLang + Miles)2026/02GB300 NVL72 集群 25x 推理性能(blog)- 适用场景: 共享前缀多的 Chatbot、RAG Pipeline、多轮对话;TTFT 领先 vLLM 30-40%
- 可信度: 高 — GitHub Releases + 官方 Blog,可核验
链接: - https://github.com/sgl-project/sglang/releases - https://www.sglang.tech/blog
1.2 vLLM — 2026 新动态
- 核心竞争力: 最广模型覆盖(无需预编译)+ 丰富量化/并行选项
- 近期动态:
- P-EAGLE(Parallel Speculative Decoding):RedHat 测评显示代码类工作负载每 1M output token 成本降低 19.4%(SWE-bench)
- Disaggregated Serving 支持 Hybrid SSM(状态空间模型)
- AMD Instinct GPU 投机解码正式支持
- HuggingFace Inference Endpoints 已将 vLLM 设为默认引擎
- 可信度: 高 — vLLM 官方 Blog + RedHat Developer 文章
链接: - https://vllm-project.github.io - https://developers.redhat.com/articles/2026/04/16/performance-improvements-speculative-decoding-vllm-gpt-oss - https://docs.vllm.ai/en/latest/features/speculative_decoding
1.3 TGI 进入维护模式(2025-12)
- HuggingFace 官方宣布 TGI(Text Generation Inference)只接受 Bug Fix,不再新增功能
- HF Inference Endpoints 默认切换至 vLLM,SGLang 为替代选项
- 工程建议: 新项目不选 TGI;现有 TGI 部署评估迁移 vLLM
可信度: 高 — TGI GitHub 公告 + TECHSY 测评文章
链接: - https://techsy.io/en/blog/vllm-vs-sglang
1.4 2026 推理引擎选型参考
| 维度 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| 延迟(TTFT) | 中 | 最优(80-120ms) | 中 |
| 吞吐(高并发) | 优 | 优 | 最优(预编译场景) |
| 模型覆盖 | 最广 | 较广 | 需预编译 |
| 生态成熟度 | 最高 | 快速增长 | 中 |
| 共享前缀优化 | 无 | RadixAttention | 无 |
| 投机解码 | EAGLE/MTP/PARD/Parallel | EAGLE/Spec V2 | 支持 |
| 硬件支持 | NVIDIA + AMD | NVIDIA + AMD(MI300X) | NVIDIA only |
| 推荐场景 | 通用生产、多模型 | 交互式/多轮/前缀复用 | 单模型长期固定吞吐 |
链接: - https://deploybase.ai/articles/best-llm-inference-engine - https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
二、向量数据库(2026-05 月度动态)
2.1 Qdrant v1.18 — 技术亮点
- TurboQuant 量化:新量化引擎,精度/速度权衡优化
- Dynamic Named Vectors:同一 Collection 支持多向量字段
- io_uring 优化:Linux 异步 I/O 路径优化,减少 I/O 阻塞
- 社区定位: 2026 年技术社区最爱向量 DB;ANN 搜索速度 + 过滤能力最强
链接: - https://ranksquire.com/2026/05/27/vector-database-news-may-2026
2.2 pgvector 0.8.2 — 紧急安全补丁
- CVE-2026-3172:跨关系数据泄露风险(Cross-relation data exposure)
- 影响: 所有使用 pgvector 的 PostgreSQL 生产环境
- 行动: 7 天内必须升级
- 适用判断: 已有 PostgreSQL 的团队,添加 pgvector = 零新增运维依赖 + 事务跨数据/向量 + JOIN 查询能力
链接: - https://ranksquire.com/2026/05/27/vector-database-news-may-2026
2.3 Milvus 3.0.0-beta — Zero-copy Data Lake Queries
- 允许直接在向量 DB 内查询数据湖格式(Parquet 等),无需数据搬迁
2.4 Pinecone — Builder Tier GA
- \$20/月新定价层;Nexus knowledge engine 预览;全文本搜索预览
2.5 向量 DB 选型速查
| 场景 | 推荐 |
|---|---|
| 已有 PostgreSQL,增量向量搜索 | pgvector |
| 高性能专用向量 DB,最佳 ANN 速度 | Qdrant |
| 内置向量化 + GraphQL + 多模态 | Weaviate |
| 大规模分布式向量 + 数据湖 | Milvus |
| 全托管、无运维 | Pinecone |
链接: - https://devstarsj.github.io/ai/database/2026/04/30/vector-databases-2026-pinecone-weaviate-pgvector-qdrant-comparison - https://www.pkgpulse.com/guides/pgvector-vs-qdrant-vs-weaviate-vector-databases-2026
三、vLLM K8s 生产部署(2026 实战要点)
核心问题
标准 Kubernetes HPA 对 LLM 推理无效: - 推理时 CPU 利用率低(工作压在 GPU) - GPU 显存被 vLLM 预分配(KV cache),HPA 无法感知真实负载
7 个经过生产验证的 Pattern(来源 thegoodshell.com)
- Autoscaling on queue depth + KV cache utilization(KEDA,不是 HPA on CPU/Memory)
- Model weights 预缓存:用 PVC 预加载权重,消除冷启动
- On-Demand GPU 节点跑推理,Spot 跑训练
- GPU Operator 必须安装:NVIDIA GPU Operator 使 K8s 可调度 GPU 资源
- Tensor Parallelism 多卡:单 Pod 多 GPU 水平扩展
- vLLM + Ray:分布式推理编排
- 本地推理 P50 TTFT 15-30ms vs 云 API P50 TTFT 100-300ms
链接: - https://thegoodshell.com/vllm-kubernetes - https://docs.cloud.google.com/kubernetes-engine/docs/best-practices/machine-learning/inference/llm-optimization - https://reintech.io/blog/running-llms-on-kubernetes-infrastructure-for-ai-inference
四、GitHub Trending 高价值条目(2026-07-16 后新上榜)
4.1 lopopolo/harness-engineering ⭐ 2194
- 描述: Ryan Lopopolo 的 Harness Engineering 选集、现场指南和 Agent Context Bundle
- 主题标签: #AI工程 #harness-engineering #agent-context
- 评价: 面向 AI 系统工程的元级别整理,适合了解 AI Agent 工程实践前沿
4.2 xiejunjie524/handdraw-story-video ⭐ 621
- 描述: 将手绘故事插图转为 35-45 秒线条揭示+渐进着色视频(HyperFrames)
- 主题标签: #AI视频 #creative-tools #frame-generation
- 评价: AI 生成视频工程化案例,非核心收录但可关注视频生成 pipeline
4.3 Icex0/wp2shell-poc ⭐ 488
- 描述: CVE-2026-63030 & CVE-2026-60137 WordPress RCE 全链路漏洞利用
- 主题标签: #安全 #CVE #RCE #Web安全
- 评价: 关注 WordPress 6.x 漏洞;安全工程团队建议精读
4.4 nethical6/conversation-steganography ⭐ 987
- 描述: 用 LLM 在正常对话中隐藏信息(隐写术)
- 主题标签: #LLM安全 #steganography
- 评价: 研究向,关注 LLM 在安全/对抗性场景的应用
五、Hugging Face 高下载量模型(截至 2026-07-23)
| 模型 | 下载量 | 类型 |
|---|---|---|
LargitData/gemma-4-26b-a4b-it-fp8 |
56,605 | FP8 量化 Gemma 4 |
LargitData/gemma-4-31b-it-fp8 |
5,073 | FP8 量化 Gemma 4 |
Novaciano/Uncensored-1b-Creative_Writing_RP-GGUF |
1,301 | GGUF llama 写作 |
XythicK/qwen-coder-14b-vulrepair-GGUF |
410 | Qwen 代码修复 |
XythicK/Mag-Mell-R1-Uncensored-21B-GGUF |
369 | R1 GGUF |
muranAI/gemma-3n-E4B-it-GGUF |
177 | Gemma 3n llama.cpp |
观察: Gemma 4 FP8 量化版本主导下载量;Qwen-Coder-14B 代码修复专用量化版值得关注。
六、DGX Spark 新动态(2026)
- SGLang + EAGLE 投机解码:在 4x DGX Spark 上运行 GLM-4.7-FP8(355B MoE),验证了多节点 SGLang 部署可行性
- vLLM + Ray 多节点:GB10 平台上的 MXFP4 量化仍落后于 SGLang/llama.cpp(社区正在调试)
- NVIDIA 官方提供 DGX Spark 专用 SGLang Docker 镜像(2026-05 以来)
七、分类标签汇总
#推理引擎 #SGLang #vLLM #TGI #TensorRT-LLM
#投机解码 #SpeculativeDecoding #P-EAGLE #SpecV2
#向量数据库 #Qdrant #pgvector #Milvus #Pinecone #Weaviate
#安全漏洞 #CVE-2026-3172 #CVE-2026-63030
#K8s #GPU调度 #LLM部署 #KEDA #vLLM-K8s
#HuggingFace #Gemma4 #FP8量化 #GGUF
#GitHub-Trending #AI工程 #HarnessEngineering
#DGX-Spark #NVIDIA #GB300
八、建议后续行动
精读优先级
- ⭐⭐⭐ SGLang GB300 NVL72 25x 性能 blog — 分布式推理工程标杆
- ⭐⭐⭐ vLLM Kubernetes 7 Pattern 文章 — 实操性强,直接可落地
- ⭐⭐⭐ pgvector CVE-2026-3172 — 若有生产部署,紧急处理
- ⭐⭐ TGI 维护模式 + vLLM/SGLang 对比 — 决策参考
- ⭐⭐ RedHat P-EAGLE 性能测评 — 投机解码成本量化
审稿/主题页更新建议
- 建议更新「LLM 推理引擎选型」主题页:TGI 状态变化 + SGLang/vLLM 2026 新功能
- 建议更新「向量数据库选型」主题页:Qdrant v1.18 + pgvector 安全补丁
- 建议增加「K8s LLM 部署」主题页:现有中文资料少,质量文章稀缺