研究草稿 · AI 工程 & 后端部署动态
检索时间:2026-08-18 17:35 UTC
检索范围:GitHub Trending、Hugging Face 官方博客、arXiv、机器学习基础设施博客、VectorDB 对比分析
本次主题:LLM 推理服务 / AI 部署工程 / VectorDB 选型 / Rust + AI 后端
📌 高价值条目
1. Hugging Face 官方博客 · State of Open Models: Summer 2026
来源:https://huggingface.co/blog/state-of-open-models-summer-2026
可信度:⭐⭐⭐⭐⭐(官方一手数据)
核心观点:
- Qwen 已取代 Llama 成为社区默认 base model,生态粘性最强
- 小模型(<10B)仍是实际部署主力,下载量远超大模型
- Agent 是 2026 年新增长点:模型开始互相调用(model-as-user)
- 开源模型价值链从"模型本身"转移到"周边工具、部署平台、数据集"
评价:Hugging Face 每半年一次的权威生态报告,数据详实,是把握开源 LLM 全景的最佳参考。值得精读全文。
标签:LLM 开源生态 HuggingFace 2026-H2
后续行动:建议纳入"开源模型选型"主题页数据来源
2. Zylos Research · LLM Inference Optimization and Quantization 2026
来源:https://zylos.ai/research/2026-01-15-llm-inference-optimization
可信度:⭐⭐⭐⭐(专业 ML 博客,定量数据丰富)
核心观点:
- vLLM:生产级标准,120-160 req/s,Industry standard
- SGLang:Agent/RAG 场景领先 vLLM 最高 3.1x(RadixAttention 对长序列 KV cache 复用优化)
- TensorRT-LLM:NVIDIA 硬件最优,但部署复杂度高(1-2周 setup)
- llama.cpp/Ollama:本地/边缘最优,CPU 场景首选
- 量化格式推荐:Q5_K_M(质量/体积最佳平衡);FP8 是 Hopper GPU 新默认
- 连续批处理(continuous batching)相比静态批处理提升最高 23x throughput
评价:2026 年初的系统性推理框架对比,覆盖主流框架的选型决策树。数据来自实际 benchmark,有参考价值。
标签:LLM推理 vLLM SGLang 量化 部署优化
后续行动:建议纳入"推理服务工程"技术页
3. arXiv · LLM Serving Needs Mathematical Optimization and Algorithmic Foundations (Position Paper)
来源:https://arxiv.org/html/2605.01280v1
可信度:⭐⭐⭐⭐⭐(学术论文,可直接引用)
核心观点:
- 当前 vLLM/SGLang 的核心算法(JSQ 路由、FIFO 调度、LRU eviction)均来自经典分布式计算,未针对 LLM 结构特性优化
- 论文主张引入数学优化理论(排队论、约束求解)来设计 LLM serving 调度器
- 形式化方法可提供 worst-case robustness 和 fundamental capacity limits,而启发式方法只能在平均 benchmark 上表现良好
评价:这篇 position paper 代表了 LLM serving 系统研究的前沿方向——从工程调优走向理论优化。对理解未来推理系统演进有重要参考价值。
标签:LLM推理 调度优化 学术前沿 arXiv
后续行动:建议审稿,关注是否已有实验验证
4. Kalvium Labs · pgvector vs Pinecone vs Qdrant vs Weaviate (2026)
来源:https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
可信度:⭐⭐⭐⭐(实测 benchmark,数字具体)
核心量化数据(500K-1M vectors @ 1536 dims):
| 配置 | QPS | p95 Latency |
|------|-----|-------------|
| Qdrant (self-hosted) | ~850 | ~8ms |
| Weaviate | ~380 | ~18ms |
| pgvector HNSW (m=16, 4 workers) | ~360 | ~58ms |
| Pinecone Serverless | ~340 | ~28ms |
选型结论: - <10M vectors + Postgres 团队:pgvector(最低摩擦) - 追求性价比/自托管:Qdrant(Rust 实现,单二进制,2026-04 v1.14 支持 GPU 加速索引) - 强混合搜索需求:Weaviate(BM25 + dense vector 原生融合,2026-04 v1.37 首个原生 MCP Server) - >100M vectors:Milvus(唯一可行选项)
评价:生产数据对比,可作为技术选型报告的数据支撑。
标签:VectorDB Qdrant Weaviate pgvector 技术选型
后续行动:建议纳入"RAG 工程"主题页的数据库选型章节
5. LangChain · State of Agent Engineering 2026
来源:https://www.langchain.com/state-of-agent-engineering
可信度:⭐⭐⭐⭐(行业报告,样本量大)
核心数据:
- 63%+ 的受访组织已有 Agent 在生产环境运行(2025: 51%)
- AgentOps 概念兴起:2027 年预计 50% 企业将部署 AI Agent(Deloitte 预测)
- 评估方法:LLM-as-judge(53.3%)+ 人工审查(59.8%)组合使用
- ROUGE/BLEU 等传统指标在 Agent 评估中采用率极低
评价:目前最权威的 Agent 工程行业报告,反映 2026 年中企业级 Agent 采纳状态。LLM-as-judge 评估方法论值得 RAG/Agent 系统设计参考。
标签:Agent LLMOps AgentOps 行业报告
后续行动:建议纳入"AI Agent 工程"主题页
6. Harness Blog · AI Deployment in Production: Orchestrate LLMs, RAG, Agents
来源:https://www.harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
可信度:⭐⭐⭐(工程博客,概念清晰但无一手数据)
核心观点:
- AI 部署 ≠ 调用 API;需包含:prompts、data pipelines、RAG 架构、agents、tools、guardrails 的完整编排
- RAG 本质是 LLM 的"研究助手" 软件架构,而非模型本身
- Agent = LLM + 工具调用 + 记忆 + 规划循环的编排系统
评价:适合作为 AI 部署工程概念的入门梳理,非深度技术内容。
标签:RAG Agent LLMOps 概念梳理
后续行动:低优先级,可作为科普引用
7. CNCF Blog · Extending AI gateways with Rust: Custom transformations in kgateway
来源:https://www.cncf.io/blog/2026/05/15/extending-ai-gateways-with-rust-custom-transformations-in-kgateway
可信度:⭐⭐⭐⭐(CNCF 官方博客,工程案例)
核心观点:
- kgateway 是 CNCF 旗下的 AI gateway 项目(Rust 实现),支持自定义 prompt guards / auth / rate limiting 扩展
- 2026 年 AI gateway 标准化趋势:GIE(Gateway Intelligence Extension)v1.4.0 规范出现
- Envoy 生态正在向 AI-native gateway 演进
AgentGateway GA:https://agentgateway.dev - Rust-based, GIE v1.4.0 conformant,生产流量层,支持 K8s
评价:Rust 在 AI 基础设施层面的落地正在加速,CNCF 生态的背书具有说服力。kgateway + GIE 值得关注。
标签:Rust AI-Gateway CNCF kgateway AgentGateway
后续行动:建议关注 kgateway 项目进展,可作为"Rust + AI 工程"主题线索
8. Medium · Python vs Go vs Rust for AI APIs: 5M Requests Benchmark
来源:https://medium.com/@rameshkannanyt0078/python-vs-go-vs-rust-for-ai-apis-2026-i-benchmarked-5-million-llm-requests-the-winner-saved-me-69b1bc4365e1
可信度:⭐⭐⭐(独立开发者实测,样本量大但未公开原始数据)
核心结论:
- 5M LLM API 请求压测,切换语言后基础设施费用节省 $2,340/月
- Go/Python 在高并发 LLM 流量下延迟更高、资源占用更大
- Rust 在 API 网关层、工具执行层有明确性能优势
评价:非受控实验,无原始数据可查,但方向性结论与行业共识一致。可作参考,不可作权威引用。
标签:Rust Go 后端性能 AI-API
后续行动:低优先级,仅作方向参考
🗂️ 分类汇总
| 类别 | 条目 | 优先级 |
|---|---|---|
| LLM 推理服务 | HuggingFace State of Open Models, Zylos 推理框架对比, arXiv 调度优化论文 | ⭐⭐⭐⭐⭐ |
| VectorDB 选型 | Qdrant/Weaviate/pgvector benchmark, 2026 VectorDB 选型指南 | ⭐⭐⭐⭐ |
| Agent 工程 | LangChain Agent Engineering 报告, Harness AI 部署博客 | ⭐⭐⭐⭐ |
| AI Gateway / Rust | kgateway CNCF, AgentGateway GA, Rust for AI Agents | ⭐⭐⭐ |
| 概念梳理 | AI 工程路线图 2026, LLMOps vs MLOps | ⭐⭐⭐ |
📁 建议写入路径
/shared/research-kb/review/2026-08-18-ai-engineering-trending.md
🔬 后续行动建议
- 精读:HuggingFace State of Open Models Summer 2026 全文(官方权威)
- 审稿:arXiv LLM Serving 调度优化论文(理论深度高)
- 主题页更新: - "LLM 推理服务工程" → 纳入 vLLM/SGLang 对比 + arXiv 调度优化方向 - "VectorDB 选型指南" → 纳入 Qdrant v1.14 / Weaviate MCP Server 新进展 - "AI Agent 工程" → 纳入 LangChain State of Agent 2026 数据
Jay · 2026-08-18 · 知识库草稿 · 请勿直接提交 GitHub