知识库草稿:AI 工程 · GitHub Trending / HF / 推理引擎 / 数据库

实例: Jay
产出时间: 2026-09-21 09:35 (Asia/Shanghai)
检索范围: GitHub Trending · Hugging Face · arXiv Daily Papers · 官方技术博客 · 向量数据库评测
分类标签: AI工程 LLM推理 向量数据库 PostgreSQL Agent框架 本地部署


一、LLM 推理引擎格局(2026 成熟期三足鼎立)

核心结论

引擎 适用场景 冷启动 模型覆盖 代表用户
vLLM 通用生产首选,冷启动重要 ~62s(最快) 最广(数百种架构) 主流团队
SGLang 多轮 Agent、共享上下文 中等 主流模型 xAI Grok 3、Azure DeepSeek R1
LMDeploy 低配硬件 + 量化模型 主流模型 端侧部署
TensorRT-LLM 延迟敏感(<100ms)、H100 慢(需编译) 主流模型 超低延迟场景

关键趋势: - SGLang 已正式加入 PyTorch 生态,生产用户包括 xAI、Microsoft Azure、AMD、NVIDIA、LinkedIn、Cursor、Baseten、Nebius、Runpod。 - 2026 年 3 月整合 PyTorch 后,官方定位为生产级推理框架。 - vLLM 的 prefix caching 对重复 prompt 多的场景有 15-25% 吞吐提升。

Benchmark 参考(AIMultiple,H100,Llama 3.1 8B,1000 ShareGPT prompts): - SGLang ≈ LMDeploy 吞吐最高,vLLM 落后约 29%(但生态成熟度弥补)。 - 内存配置参考:gpu_memory_utilization: 7B=0.95, 13B=0.85, 70B=0.90

→ 建议写入路径: topics/llm-inference-engine-comparison.md(更新现有主题页)

→ 精读价值: ⭐⭐⭐ 高——推理引擎选型直接影响部署成本,是高频决策场景。


二、向量数据库格局(2026 Agent 驱动增长)

核心结论

数据库 类型 最佳场景 p50 延迟 QPS(1M 向量) 代表厂商
Pinecone 全托管 零运维生产 RAG ~4.2ms ~800 需要快速上线团队
Qdrant 开源自托管+云 性能敏感、自托管 ~2.1ms ~1200 成本敏感+性能需求
Weaviate 开源 混合搜索(向量+BM25) 需要混合检索
Chroma 轻量 原型、本地开发 早期验证
Milvus 开源 超大规模、定制化 超大向量场景

2026 新变化: - AI Agents 已成为向量数据库的核心驱动力,从「语义搜索」升级为「Agent 记忆层」。 - Intel 因 Agent 驱动需求出现 20% 股价涨幅,硬件迎来数据中心刷新潮。 - 厂商路线趋同:原生混合搜索(向量+关键词)+ RBAC + 水平扩展成为标配。 - MySQL 9.7.1 和 PostgreSQL 18 均强化了向量搜索能力,关系型数据库正在侵蚀专用向量库市场。

→ 建议写入路径: topics/vector-database-landscape-2026.md(新建)

→ 精读价值: ⭐⭐⭐ 高——RAG 和 Agent 记忆基础设施,是当前 AI 应用部署的核心组件。


3.1 OpenClaw(本地 AI 助手,210k+ ⭐)

  • 创始人:PSPDFKit Peter Steinberger;曾用名 Clawdbot → Moltbot → OpenClaw。
  • 增长轨迹:9,000 → 60,000 ⭐ 仅用数天(2026-01 病毒式传播),现已突破 210k ⭐。
  • 定位:本地优先、多模型支持(Llama、Mistral、Gemma、DeepSeek 等),有 macOS/Windows 桌面端。
  • 技术标签:本地推理 多模型路由 Agent 开源助手

→ 精读价值: ⭐⭐(关联自身定位参考,但非本知识库直接研究对象)

3.2 Bumblebee(依赖供应链安全扫描,Perplexity AI)

  • 功能:检查依赖、MCP servers、编辑器扩展中的可疑包,秒级出结果。
  • 定位:supply chain 安全,面向 AI 工程团队。

→ 精读价值: ⭐⭐(AI 工程安全相关,建议收录)

3.3 CLAUDE.md 行为原则(207k ⭐)

  • 来源:Forrest Chang 将 Andrej Karpathy 2026-01 对 Agent 编码失败的吐槽整理为单文件行为原则。
  • 增长:最快速成长的 AI workflow repo 之一,零运行时依赖。
  • 内容:4 条行为原则,指导 AI coding agent 的可靠行为。

→ 精读价值: ⭐⭐⭐(Agent 行为规范,实用性极强,建议收录工程笔记)

3.4 Langflow(低代码 RAG/Agent 平台)

  • 基于 LangChain,拖拽式构建 prompt chains、tools、memory 模块和数据源。
  • 支持所有主流 LLM 和向量数据库。
  • 定位:面向不写代码的业务团队 + 快速原型验证。

→ 精读价值: ⭐⭐(低代码 RAG 编排,可作为参考架构)

3.5 SmolAgents(Hugging Face,27k ⭐)

  • 核心特性:CodeAgent——不是 JSON tool call,而是直接写 Python 代码执行。
  • 2026-05 已发布,定位为 transformers.agents 的继任者。
  • 相比传统 Agent 框架,代码量少(几千行),抽象轻。
  • 生产部署:Spheron 提供 H100/L40S GPU 云部署指南。

→ 精读价值: ⭐⭐⭐(HF 官方 Agent 框架,代码即 agent action 是重要范式演进)

3.6 Ollama(本地推理,成熟生态)

  • 简单命令下载、运行、服务本地模型,支持 Llama、Mistral、Gemma、DeepSeek 等。
  • 有 macOS/Windows 桌面端,非开发者也能上手。
  • 合作伙伴持续增加中。

→ 精读价值: ⭐⭐(本地推理参考标准之一)


四、Hugging Face 生态动态(Summer 2026)

4.1 State of Open Models 核心数据

  • GGUF 格式库增长率:464%(本地推理格式爆发)
  • LeRobot(机器人库)GitHub ⭐ 接近翻 3 倍。
  • llama.cpp 已加入 Hugging Face(GGML 团队 2026-02 并入),项目保持开源社区治理。
  • llama.cpp 现在支持 DeepSeek-V4-Flash ~284B 参数的 GGUF 构建,以及 Kimi-K3 ~2.8T 参数。
  • 本地推理定义已被刷新:从前是 8B 笔记本模型,现在是跨多台消费级机器跑万亿参数 MoE。
  • 实际下载量仍以小模型为主(Qwen3-0.6B 手机端领先,22.5M 下载量)。

4.2 HF Daily Papers 高价值条目(2026-09-21 前后)

论文/项目 机构 标签 精读价值
SkillOpt(text-space optimizer for agent skills) Microsoft Research Agent RL 技能优化 ⭐⭐⭐
RetireOPD(On-Policy Distillation for Agentic RL) Agent RL 蒸馏 ⭐⭐
JEPA-Anything(跨世界预测模型) World Model 自监督 ⭐⭐
RiskChainBench(混淆消息恢复+网络取证) 安全 Benchmark ⭐⭐
Reflect, Revise, Reuse(GUI Agent 免训练技能演化) GUI Agent 技能复用 ⭐⭐⭐
An Empirical Study of Harness Design for Coding Agents Zoom Coding Agent 评估 ⭐⭐⭐

4.3 Anthropic: Engineering Reliable Multi-Agent LLM Systems

  • 核心观点:生产 Agent 性能取决于 Model + Harness 的组合,而非单纯模型选择。
  • 关键建议:从单 Agent 基线开始 → 再演进到多 Agent;避免过早复杂度。
  • 涉及话题:context management、context compaction、prompt caching、generator-verifier、orchestrator-sub-agent、shared state、message bus、observability。

→ 建议写入路径: topics/multi-agent-system-design.md(新建)

→ 精读价值: ⭐⭐⭐(工程实践指导,来自 Anthropic 企业落地经验)

4.4 LinkedIn: Semantic Retrieval for Follows Recommendations

  • 使用 bi-encoder + supervised contrastive learning(InfoNCE)+ PEFT/LoRA。
  • FAISS + Ray + GPU inference + HDFS 向量搜索生产实践。
  • 覆盖:冷启动、向量搜索排序、A/B 测试。

→ 精读价值: ⭐⭐(工业级向量检索系统设计参考)


五、数据库性能对比(PostgreSQL vs MySQL,2026 实测)

5.1 Sysbench 基准(Ubuntu Linux,2026-01)

操作 PostgreSQL 18.1 QPS MySQL 9.5 QPS 胜者
单行 INSERT 21,338 4,383 PostgreSQL(4.9x)
批量 INSERT 100 rows 3,535 1,883 PostgreSQL(1.9x)
UPDATE (indexed) PostgreSQL(3.7x lower latency)
99th pct INSERT latency 4.0ms 42.7ms PostgreSQL(10.7x)
OLTP read_write PostgreSQL(2x faster)
groupby_scan PostgreSQL(2.7x faster)
  • PostgreSQL 在 17 项 Sysbench 测试中,中位延迟比 MySQL 低 2.3 倍,写操作低 3.5 倍。
  • MySQL 在简单单表 OLTP 场景(简单读写)有 21% 更高峰值 TPS,是其唯一领先场景。

5.2 PostgreSQL 18 新特性(2025-09 正式发布)

  • JSON Table Functions:关系型 + JSON 混合查询更自然。
  • 查询管道改进:短查询 QPS 显著提升,直接缩小与 MySQL 的读取性能差距。
  • PostgreSQL 17(2024-10):并行查询性能提升 35%。

5.3 水平扩展

  • Citus 扩展:将标准 PostgreSQL 集群转为分布式数据库,分片透明化,已在生产中实现每秒数百万级事务 + 一致低延迟

→ 建议写入路径: topics/postgresql-mysql-production-comparison-2026.md(更新)

→ 精读价值: ⭐⭐⭐(2026 最新基准数据,直接影响数据库选型决策)


六、本次建议行动

优先级 行动 对应路径
新建「LLM 推理引擎选型指南(2026)」主题页 topics/llm-inference-engine-comparison.md
新建「向量数据库格局(2026)」主题页 topics/vector-database-landscape-2026.md
精读 SkillOpt 论文 + Reflect Revise Reuse arXiv 原文
更新 PostgreSQL/MySQL 对比主题页 topics/postgresql-mysql-production-comparison-2026.md
新建「多 Agent 系统工程指南」引用 Anthropic 文章 topics/multi-agent-system-design.md
更新 HF 生态趋势页(GGUF 爆发、llama.cpp 并入 HF) topics/huggingface-ecosystem-trends.md

七、可复制草稿(未写入文件时使用)

本次已写入文件: /shared/research-kb/inbox/jay/2026-09-21-ai-engineering-trending.md


草稿状态:初稿,待审稿。引用均保留原始链接,请在使用前核验内容准确性。