2026-08-20 Jay 研究简报:推理引擎 vs 向量数据库 vs Agent Harness

时间: 2026-08-20 13:35 (Asia/Shanghai) 实例: Jay 主题: LLM 推理引擎选型 / 向量数据库选型 / Agent Harness 范式 / OpenClaw 爆发式增长


一、本次主题

本次研究聚焦 2026 年中 AI 工程核心技术选型,覆盖: 1. LLM 推理引擎三强对比(vLLM / SGLang / LMDeploy) 2. 向量数据库生产选型(Qdrant / pgvector / Milvus) 3. Agent Harness 范式崛起(从 LangChain 到 Claude Code / Codex) 4. OpenClaw 爆发式增长(本地优先 AI Agent) 5. RAG 评估与可观测性工具格局 6. MLOps/LLMOps 工具链现状(Hugging Face Spring 2026 State of OS 报告)


二、检索范围

  • Tavily 搜索:GitHub Trending AI engineering、vLLM SGLang、向量数据库、RAG 评估、Substack AI Agent Stack
  • Hugging Face Trending Papers(OpenMLE 递归自改进、Frontis-MA1)
  • arXiv:AI 工程会议论文(CAIN 2026)、Agentic AI 研究
  • Substack:The Nuanced Perspective、The Tool Nerd、ByteByteGo、Alexey on Data
  • Microsoft Build 2026 资源库(GitHub Topics build-2026)

三、候选条目

3.1 LLM 推理引擎(高价值)

引擎 优势场景 核心指标 生产就绪度
vLLM 追求稳定性和兼容性的团队;高并发高吞吐量场景 PagedAttention、continuous batching、TTFT 稳定 ⭐⭐⭐⭐⭐
SGLang 多轮对话、Agentic 工作流、前缀缓存复用场景 RadixAttention 多轮增益 10-20% over vLLM ⭐⭐⭐⭐
LMDeploy 受限硬件上的量化模型部署 最低 TTFT,量化支持最好 ⭐⭐⭐
TensorRT-LLM NVIDIA 硬件极致性能优化 底层硬件优化,最低延迟 ⭐⭐⭐⭐
Hugging Face TGI 快速部署开源模型,原生 HF 生态集成 生态集成度最高 ⭐⭐⭐⭐

关键洞察: - vLLM 建立了 PagedAttention 标准,是最安全的生产选择 - SGLang 的 RadixAttention 在 100 并发共享上下文时比 vLLM 高出 10-20% throughput - LMDeploy 在量化模型上 TTFT 最低,适合边缘部署 - NVIDIA Dynamo 出现:分布式编排层,位于 vLLM/SGLang/TensorRT-LLM 之上,支持 prefill-decode 分解 - vLLM V1 已发布:重架构调度器、near-zero 开销 prefix caching、cleaner tensor parallelism

可信度: 高(多方对比评测,一致性强)

3.2 向量数据库选型(高价值)

数据库 适用规模 核心优势 劣势
Qdrant <50M 向量,单节点或集群 Rust 实现、低延迟(p50 ~4ms)、payload filter 强 超大规模不如 Milvus
pgvector + pgvectorscale <50-100M 向量,已有 Postgres 团队 SQL+向量合一,运维成本低,471 QPS @99% recall >100M 后 HNSW rebuild 变慢
Milvus 亿级向量,分布式 水平扩展、GPU 加速、摄入/查询节点隔离好 运维陡峭
Pinecone 全托管,SaaS 零运维、最强 RAG 生态 成本高,无开源
Weaviate 多租户、混合搜索 原生 BM25+向量融合,合规多租户 纯向量性能不如 Qdrant
Chroma / LanceDB <10M,向量嵌入优先 嵌入式、零部署、学习原型最快 不适合生产
Redis 缓存层向量加速 与现有 Redis 栈集成 非专业向量库

决策框架: - 有 Postgres 基础设施 → pgvector(<50M向量) - 新建向量基础设施 → Qdrant(默认最优) - 亿级规模 + 有 MLOps 团队 → Milvus - 需要零运维 → Pinecone(成本高) - 快速原型 → Chroma/LanceDB

可信度: 高(多个来源一致:aiml.qa、alphacorp.ai、sukruyusufkaya.com)

3.3 Agent Harness 范式(高价值)

核心转变:2025 年框架之战(LangChain vs LlamaIndex vs AutoGen),2026 年进入 Harness 时代

什么是 Harness:预接线的完整产品,内置 agent loop、planner、tool registry、memory、streaming protocol,开发者只需选择和使用。

主流 Harness(2026): | Harness | 定位 | 特点 | |---------|------|------| | Claude Code | 编码 Agent | 最强代码能力,Anthropic 官方 | | Codex | OpenAI 编码 Agent | OpenAI 内部 90%+ 工程团队已迁移 | | Cursor Agent Mode | IDE 内 Agent | 对抗 Claude Code 的 UX 优势 | | Replit Agent | 全栈 Agent | 从零构建应用 | | LangChain Deep Agents | LangChain 生态生产级 Harness | LangGraph + LangSmith 集成 | | OpenClaw | 本地优先个人 Agent | 本地运行,连接 50+ 工具(消息平台为主) |

Framework vs Harness 对比: - Framework:灵活性高,工程量大,需自建 fault tolerance、retry、state management - Harness:开箱即用,定制空间小,适合标准工作流

评价:Aishwarya Naresh Reganti(Substack "The Nuanced Perspective")观点,可信度: 中高(行业观察,样本量 1000+ JD)

Substack 原文https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026 补充https://open.substack.com/pub/thetoolnerd/p/10-agent-harnesses-every-ai-builder

3.4 OpenClaw(值得特别关注)

背景:OpenClaw 是 Jay 实例运行的底层框架(但本简报不涉及 Jay 实例自身架构)。

增长数据: - 2026 年 1 月:~9,000 GitHub stars - 2026 年中(数月内):→ 382,000+ stars - Sam Altman 公开背书(创建者加入 OpenAI 后) - Fortune 专题报道 - 创造了 GitHub stars 增长速度新纪录,超越 React 10 年记录

核心能力: - 本地优先:运行在用户自有硬件,数据不经过云端 - 原生浏览器控制:Chrome DevTools Protocol(CDP) - 持久化记忆:SQLite - 工具注册表:ClawHub(社区驱动 skills registry) - 连接 50+ 工具:WhatsApp、Telegram、Slack、Discord 及常见企业应用

商业模式: - 开源:Self-hosted(免费) - OpenClaw Cloud:$59/月,托管服务

可信度: 高(多个独立来源确认:skywork.ai、ayautomate.com、turingpost.com) 原文https://skywork.ai/skypage/en/openclaw-github-agent-framework-guide/2037016917617414144

3.5 RAG 评估与可观测性工具(高价值)

RAG 三元组(基础指标): 1. Context Relevance(检索相关性) 2. Faithfulness(生成忠实度) 3. Answer Relevance(回答相关性)

2026 年主流工具对比

工具 定位 核心指标 优势 劣势
Ragas 开源 RAG 评估 3 大指标 + 自定义 scorer 开放、自托管、灵活 无生产追踪 UI
Arize Phoenix 检索可观测性 嵌入可视化、漂移检测 检索诊断能力强 偏向观测非评估
LangSmith LangChain 原生追踪 全链路 tracing、prompt 版本 LangChain 深度集成 绑定 LangChain
DeepEval pytest 风格测试 50+ 指标、幻觉/毒性/偏见 CI/CD 友好 仅测试,无生产追踪
Maxim AI 端到端评估+可观测 仿真+评估+生产监控 统一生命周期 较新
Galileo (Braintrust) LLM 可观测性托管平台 20+ 内置指标(幻觉检测等) Luna-2 judge model 闭源托管

关键洞察: - 2026 年 "Eval as Core Engineering" 成为共识:不做 eval 的团队在第三周必然失败 - 10-20% 流量抽样 judge 评估是成本与覆盖的平衡点 - Judge 模型漂移问题:三个月后可能偏离人工标注,需定期人工校准

可信度: 中高(Braintrust 对比文章、Redis 官方博客、Goodeye Labs) 原文https://www.braintrust.dev/articles/best-rag-evaluation-toolshttps://redis.io/blog/rag-system-evaluation

3.6 Hugging Face Spring 2026 State of OS(高价值)

关键数据点: - 平均下载模型参数规模:2023 年 827M → 2025 年 20.8B(中位数从 326M → 406M) - 均值和中位数差距拉大:高端用户拉高均值,小模型使用依然稳定 - 开源模型质量差距已闭合:Qwen-3、Llama-3.3、DeepSeek-V3 在 Open LLM Leaderboard 上匹配或超越 GPT-4 - 使用封闭 API 的理由变为成本和便利性,不再是质量差距 - 多模态无处不在:视觉-语言模型成为标配

可信度: 高(Hugging Face 官方博客)

3.7 arXiv 重要论文(2026 年 8 月)

论文 作者/机构 主题 核心洞察 可信度
Frontis-MA1 Frontis AI AI4AI 递归自改进 OpenMLE:结合执行 grounding 和长期演化搜索,35B 模型显著提升 benchmark 高(GitHub 471 stars,arXiv)
Workstream arXiv:2604.17055 本地优先开发者命令中心 FastAPI + SQLite + Vanilla JS,零配置,2 命令启动 高(完整源码描述)
A Systematic Review of MLOps Tools IEEE/ACM CAIN 2026 MLOps 工具系统综述 工具采用率、生命周期覆盖、关键洞察 高(学术同行评审)
Engineering a Governance-Aware AI Sandbox arXiv:2603.03394 AI 沙箱治理 模块化后端(Express.js)、SQLite→PostgreSQL 迁移路径、RBAC 高(EASE 2026 录用)
LLMoxie arXiv:2607.02703 Agentic AI 科研软件开发 科学工具+检索+可扩展插件的研究工作流编排 中高(学术研究)
Automated Data Readiness for Scientific AI arXiv:2607.02771 科学 AI 数据就绪性 预处理成本分析、瓶颈因领域差异显著 中高(学术研究)

3.8 Microsoft Build 2026 资源(GitHub Topics build-2026)

Repo Stars 主题
microsoft/Build26-BRK231 14 SQL DB + Cosmos DB + HorizonDB for AI apps
microsoft/Build26-BRK223 14 设计 AI Apps 的数据库(Rows to Reasoning)
microsoft/Build26-BRK231-rl 12 生产 Agent 的 RL(强化学习)
microsoft/Build26-BRK240 10 跨设备 Agent(GitHub Copilot SDK)
microsoft/Build26-BRK231-deploy 10 部署+可观测+生产 Agent 工程模式

注意:部分资源 star 较低(<15),内容质量需进一步核验。


四、高价值条目汇总

🔥 最高优先级(可直接引用)

  1. vLLM vs SGLang vs LMDeploy 对比https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
  2. 向量数据库 2026 生产选型https://aiml.qa/vector-database-comparison-2026
  3. Qdrant vs Milvus 对比https://www.kunalganglani.com/blog/milvus-vs-qdrant
  4. RAG 评估工具对比(Braintrust)https://www.braintrust.dev/articles/best-rag-evaluation-tools
  5. The AI Agent Stack in 2026(Substack)https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026
  6. 10 Agent Harnesses(Substack)https://open.substack.com/pub/thetoolnerd/p/10-agent-harnesses-every-ai-builder
  7. OpenClaw 2026 指南https://skywork.ai/skypage/en/openclaw-github-agent-framework-guide/2037016917617414144
  8. Hugging Face Spring 2026 State of OShttps://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
  9. vLLM Blog(V1 新架构)https://vllm.ai/blog
  10. MLOps in 2026: Best Practiceshttps://www.kernshell.com/best-practices-for-scalable-machine-learning-deployment

五、分类标签

  • 推理引擎 vLLM SGLang LMDeploy TensorRT-LLM NVIDIA-Dynamo
  • 向量数据库 Qdrant pgvector Milvus Pinecone RAG
  • Agent-Harness Claude-Code Codex Cursor LangChain LangGraph
  • OpenClaw 本地优先AI ClawHub
  • RAG评估 可观测性 Ragas Arize-Phoenix LangSmith DeepEval
  • MLOps LLMOps Hugging-Face Microsoft-Build-2026
  • arXiv AI工程 IEEE/ACM-CAIA-2026
  • Frontend FastAPI SQLite Workstream

六、建议写入路径

本次草稿路径

/shared/research-kb/inbox/jay/2026-08-20T1335-jay-inference-vecdb-harness-substack-aug20.md

七、行动建议

需要精读

  1. vLLM V1 官方博客:新架构调度器、near-zero prefix caching 生产验证(https://vllm.ai/blog
  2. Qdrant vs Milvus 原文:选型决策树,细节更丰富(https://www.kunalganglani.com/blog/milvus-vs-qdrant
  3. Frontis-MA1 arXiv 原文:OpenMLE 递归自改进实现细节(arXiv,需找到具体链接)

需要审稿

  • Agent Harness 范式崛起(Substack 原文需完整读一遍,当前只有摘要)
  • MLOps 工具综述(CAIN 2026 论文,需要找到 PDF 全文)

主题页更新建议

  • AI工程 - 推理引擎选型:更新 vLLM V1、SGLang RadixAttention、LMDeploy、NVIDIA Dynamo
  • AI工程 - Agent框架:从 LangChain/LlamaIndex 主叙事切换到 Harness 范式
  • AI工程 - 向量数据库:Qdrant 作为默认推荐,pgvector 作为 Postgres 团队首选
  • AI工程 - RAG评估:更新为 Ragas/Arize/LangSmith/DeepEval 四选一框架

八、本次研究局限性

  1. arXiv 论文具体链接未获取:Frontis-MA1、LLMoxie、Workstream 等论文需直接访问 arXiv 获取 PDF 和完整摘要
  2. Microsoft Build 2026 资源 star 较低:部分 repo star < 15,内容质量存疑,需进一步核验
  3. Substack 原文未全文读取:The Nuanced Perspective 和 The Tool Nerd 的 Harness 文章只有搜索摘要,未读原文
  4. 时鲜性:搜索结果反映的是 2026 年 8 月中上旬的生态,OpenClaw 382K stars 数据可能已过时(可能更高或更低)

本简报由 Jay 实例生成,仅作为研究线索和技术洞察来源,不复制原文,不输出私密信息。 下次建议:获取 arXiv 论文直接链接、完整读取 Substack Harness 文章、交叉验证 OpenClaw 最新 star 数量。