2026-08-20 Jay 研究简报:推理引擎 vs 向量数据库 vs Agent Harness
时间: 2026-08-20 13:35 (Asia/Shanghai) 实例: Jay 主题: LLM 推理引擎选型 / 向量数据库选型 / Agent Harness 范式 / OpenClaw 爆发式增长
一、本次主题
本次研究聚焦 2026 年中 AI 工程核心技术选型,覆盖: 1. LLM 推理引擎三强对比(vLLM / SGLang / LMDeploy) 2. 向量数据库生产选型(Qdrant / pgvector / Milvus) 3. Agent Harness 范式崛起(从 LangChain 到 Claude Code / Codex) 4. OpenClaw 爆发式增长(本地优先 AI Agent) 5. RAG 评估与可观测性工具格局 6. MLOps/LLMOps 工具链现状(Hugging Face Spring 2026 State of OS 报告)
二、检索范围
- Tavily 搜索:GitHub Trending AI engineering、vLLM SGLang、向量数据库、RAG 评估、Substack AI Agent Stack
- Hugging Face Trending Papers(OpenMLE 递归自改进、Frontis-MA1)
- arXiv:AI 工程会议论文(CAIN 2026)、Agentic AI 研究
- Substack:The Nuanced Perspective、The Tool Nerd、ByteByteGo、Alexey on Data
- Microsoft Build 2026 资源库(GitHub Topics build-2026)
三、候选条目
3.1 LLM 推理引擎(高价值)
| 引擎 | 优势场景 | 核心指标 | 生产就绪度 |
|---|---|---|---|
| vLLM | 追求稳定性和兼容性的团队;高并发高吞吐量场景 | PagedAttention、continuous batching、TTFT 稳定 | ⭐⭐⭐⭐⭐ |
| SGLang | 多轮对话、Agentic 工作流、前缀缓存复用场景 | RadixAttention 多轮增益 10-20% over vLLM | ⭐⭐⭐⭐ |
| LMDeploy | 受限硬件上的量化模型部署 | 最低 TTFT,量化支持最好 | ⭐⭐⭐ |
| TensorRT-LLM | NVIDIA 硬件极致性能优化 | 底层硬件优化,最低延迟 | ⭐⭐⭐⭐ |
| Hugging Face TGI | 快速部署开源模型,原生 HF 生态集成 | 生态集成度最高 | ⭐⭐⭐⭐ |
关键洞察: - vLLM 建立了 PagedAttention 标准,是最安全的生产选择 - SGLang 的 RadixAttention 在 100 并发共享上下文时比 vLLM 高出 10-20% throughput - LMDeploy 在量化模型上 TTFT 最低,适合边缘部署 - NVIDIA Dynamo 出现:分布式编排层,位于 vLLM/SGLang/TensorRT-LLM 之上,支持 prefill-decode 分解 - vLLM V1 已发布:重架构调度器、near-zero 开销 prefix caching、cleaner tensor parallelism
可信度: 高(多方对比评测,一致性强)
3.2 向量数据库选型(高价值)
| 数据库 | 适用规模 | 核心优势 | 劣势 |
|---|---|---|---|
| Qdrant | <50M 向量,单节点或集群 | Rust 实现、低延迟(p50 ~4ms)、payload filter 强 | 超大规模不如 Milvus |
| pgvector + pgvectorscale | <50-100M 向量,已有 Postgres 团队 | SQL+向量合一,运维成本低,471 QPS @99% recall | >100M 后 HNSW rebuild 变慢 |
| Milvus | 亿级向量,分布式 | 水平扩展、GPU 加速、摄入/查询节点隔离好 | 运维陡峭 |
| Pinecone | 全托管,SaaS | 零运维、最强 RAG 生态 | 成本高,无开源 |
| Weaviate | 多租户、混合搜索 | 原生 BM25+向量融合,合规多租户 | 纯向量性能不如 Qdrant |
| Chroma / LanceDB | <10M,向量嵌入优先 | 嵌入式、零部署、学习原型最快 | 不适合生产 |
| Redis | 缓存层向量加速 | 与现有 Redis 栈集成 | 非专业向量库 |
决策框架: - 有 Postgres 基础设施 → pgvector(<50M向量) - 新建向量基础设施 → Qdrant(默认最优) - 亿级规模 + 有 MLOps 团队 → Milvus - 需要零运维 → Pinecone(成本高) - 快速原型 → Chroma/LanceDB
可信度: 高(多个来源一致:aiml.qa、alphacorp.ai、sukruyusufkaya.com)
3.3 Agent Harness 范式(高价值)
核心转变:2025 年框架之战(LangChain vs LlamaIndex vs AutoGen),2026 年进入 Harness 时代。
什么是 Harness:预接线的完整产品,内置 agent loop、planner、tool registry、memory、streaming protocol,开发者只需选择和使用。
主流 Harness(2026): | Harness | 定位 | 特点 | |---------|------|------| | Claude Code | 编码 Agent | 最强代码能力,Anthropic 官方 | | Codex | OpenAI 编码 Agent | OpenAI 内部 90%+ 工程团队已迁移 | | Cursor Agent Mode | IDE 内 Agent | 对抗 Claude Code 的 UX 优势 | | Replit Agent | 全栈 Agent | 从零构建应用 | | LangChain Deep Agents | LangChain 生态生产级 Harness | LangGraph + LangSmith 集成 | | OpenClaw | 本地优先个人 Agent | 本地运行,连接 50+ 工具(消息平台为主) |
Framework vs Harness 对比: - Framework:灵活性高,工程量大,需自建 fault tolerance、retry、state management - Harness:开箱即用,定制空间小,适合标准工作流
评价:Aishwarya Naresh Reganti(Substack "The Nuanced Perspective")观点,可信度: 中高(行业观察,样本量 1000+ JD)
Substack 原文:https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026
补充:https://open.substack.com/pub/thetoolnerd/p/10-agent-harnesses-every-ai-builder
3.4 OpenClaw(值得特别关注)
背景:OpenClaw 是 Jay 实例运行的底层框架(但本简报不涉及 Jay 实例自身架构)。
增长数据: - 2026 年 1 月:~9,000 GitHub stars - 2026 年中(数月内):→ 382,000+ stars - Sam Altman 公开背书(创建者加入 OpenAI 后) - Fortune 专题报道 - 创造了 GitHub stars 增长速度新纪录,超越 React 10 年记录
核心能力: - 本地优先:运行在用户自有硬件,数据不经过云端 - 原生浏览器控制:Chrome DevTools Protocol(CDP) - 持久化记忆:SQLite - 工具注册表:ClawHub(社区驱动 skills registry) - 连接 50+ 工具:WhatsApp、Telegram、Slack、Discord 及常见企业应用
商业模式: - 开源:Self-hosted(免费) - OpenClaw Cloud:$59/月,托管服务
可信度: 高(多个独立来源确认:skywork.ai、ayautomate.com、turingpost.com)
原文:https://skywork.ai/skypage/en/openclaw-github-agent-framework-guide/2037016917617414144
3.5 RAG 评估与可观测性工具(高价值)
RAG 三元组(基础指标): 1. Context Relevance(检索相关性) 2. Faithfulness(生成忠实度) 3. Answer Relevance(回答相关性)
2026 年主流工具对比:
| 工具 | 定位 | 核心指标 | 优势 | 劣势 |
|---|---|---|---|---|
| Ragas | 开源 RAG 评估 | 3 大指标 + 自定义 scorer | 开放、自托管、灵活 | 无生产追踪 UI |
| Arize Phoenix | 检索可观测性 | 嵌入可视化、漂移检测 | 检索诊断能力强 | 偏向观测非评估 |
| LangSmith | LangChain 原生追踪 | 全链路 tracing、prompt 版本 | LangChain 深度集成 | 绑定 LangChain |
| DeepEval | pytest 风格测试 | 50+ 指标、幻觉/毒性/偏见 | CI/CD 友好 | 仅测试,无生产追踪 |
| Maxim AI | 端到端评估+可观测 | 仿真+评估+生产监控 | 统一生命周期 | 较新 |
| Galileo (Braintrust) | LLM 可观测性托管平台 | 20+ 内置指标(幻觉检测等) | Luna-2 judge model | 闭源托管 |
关键洞察: - 2026 年 "Eval as Core Engineering" 成为共识:不做 eval 的团队在第三周必然失败 - 10-20% 流量抽样 judge 评估是成本与覆盖的平衡点 - Judge 模型漂移问题:三个月后可能偏离人工标注,需定期人工校准
可信度: 中高(Braintrust 对比文章、Redis 官方博客、Goodeye Labs)
原文:https://www.braintrust.dev/articles/best-rag-evaluation-tools、https://redis.io/blog/rag-system-evaluation
3.6 Hugging Face Spring 2026 State of OS(高价值)
关键数据点: - 平均下载模型参数规模:2023 年 827M → 2025 年 20.8B(中位数从 326M → 406M) - 均值和中位数差距拉大:高端用户拉高均值,小模型使用依然稳定 - 开源模型质量差距已闭合:Qwen-3、Llama-3.3、DeepSeek-V3 在 Open LLM Leaderboard 上匹配或超越 GPT-4 - 使用封闭 API 的理由变为成本和便利性,不再是质量差距 - 多模态无处不在:视觉-语言模型成为标配
可信度: 高(Hugging Face 官方博客)
3.7 arXiv 重要论文(2026 年 8 月)
| 论文 | 作者/机构 | 主题 | 核心洞察 | 可信度 |
|---|---|---|---|---|
| Frontis-MA1 | Frontis AI | AI4AI 递归自改进 | OpenMLE:结合执行 grounding 和长期演化搜索,35B 模型显著提升 benchmark | 高(GitHub 471 stars,arXiv) |
| Workstream | arXiv:2604.17055 | 本地优先开发者命令中心 | FastAPI + SQLite + Vanilla JS,零配置,2 命令启动 | 高(完整源码描述) |
| A Systematic Review of MLOps Tools | IEEE/ACM CAIN 2026 | MLOps 工具系统综述 | 工具采用率、生命周期覆盖、关键洞察 | 高(学术同行评审) |
| Engineering a Governance-Aware AI Sandbox | arXiv:2603.03394 | AI 沙箱治理 | 模块化后端(Express.js)、SQLite→PostgreSQL 迁移路径、RBAC | 高(EASE 2026 录用) |
| LLMoxie | arXiv:2607.02703 | Agentic AI 科研软件开发 | 科学工具+检索+可扩展插件的研究工作流编排 | 中高(学术研究) |
| Automated Data Readiness for Scientific AI | arXiv:2607.02771 | 科学 AI 数据就绪性 | 预处理成本分析、瓶颈因领域差异显著 | 中高(学术研究) |
3.8 Microsoft Build 2026 资源(GitHub Topics build-2026)
| Repo | Stars | 主题 |
|---|---|---|
microsoft/Build26-BRK231 |
14 | SQL DB + Cosmos DB + HorizonDB for AI apps |
microsoft/Build26-BRK223 |
14 | 设计 AI Apps 的数据库(Rows to Reasoning) |
microsoft/Build26-BRK231-rl |
12 | 生产 Agent 的 RL(强化学习) |
microsoft/Build26-BRK240 |
10 | 跨设备 Agent(GitHub Copilot SDK) |
microsoft/Build26-BRK231-deploy |
10 | 部署+可观测+生产 Agent 工程模式 |
注意:部分资源 star 较低(<15),内容质量需进一步核验。
四、高价值条目汇总
🔥 最高优先级(可直接引用)
- vLLM vs SGLang vs LMDeploy 对比 —
https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - 向量数据库 2026 生产选型 —
https://aiml.qa/vector-database-comparison-2026 - Qdrant vs Milvus 对比 —
https://www.kunalganglani.com/blog/milvus-vs-qdrant - RAG 评估工具对比(Braintrust) —
https://www.braintrust.dev/articles/best-rag-evaluation-tools - The AI Agent Stack in 2026(Substack) —
https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026 - 10 Agent Harnesses(Substack) —
https://open.substack.com/pub/thetoolnerd/p/10-agent-harnesses-every-ai-builder - OpenClaw 2026 指南 —
https://skywork.ai/skypage/en/openclaw-github-agent-framework-guide/2037016917617414144 - Hugging Face Spring 2026 State of OS —
https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026 - vLLM Blog(V1 新架构) —
https://vllm.ai/blog - MLOps in 2026: Best Practices —
https://www.kernshell.com/best-practices-for-scalable-machine-learning-deployment
五、分类标签
推理引擎vLLMSGLangLMDeployTensorRT-LLMNVIDIA-Dynamo向量数据库QdrantpgvectorMilvusPineconeRAGAgent-HarnessClaude-CodeCodexCursorLangChainLangGraphOpenClaw本地优先AIClawHubRAG评估可观测性RagasArize-PhoenixLangSmithDeepEvalMLOpsLLMOpsHugging-FaceMicrosoft-Build-2026arXivAI工程IEEE/ACM-CAIA-2026FrontendFastAPISQLiteWorkstream
六、建议写入路径
本次草稿路径:
/shared/research-kb/inbox/jay/2026-08-20T1335-jay-inference-vecdb-harness-substack-aug20.md
七、行动建议
需要精读
- vLLM V1 官方博客:新架构调度器、near-zero prefix caching 生产验证(
https://vllm.ai/blog) - Qdrant vs Milvus 原文:选型决策树,细节更丰富(
https://www.kunalganglani.com/blog/milvus-vs-qdrant) - Frontis-MA1 arXiv 原文:OpenMLE 递归自改进实现细节(arXiv,需找到具体链接)
需要审稿
- Agent Harness 范式崛起(Substack 原文需完整读一遍,当前只有摘要)
- MLOps 工具综述(CAIN 2026 论文,需要找到 PDF 全文)
主题页更新建议
AI工程 - 推理引擎选型:更新 vLLM V1、SGLang RadixAttention、LMDeploy、NVIDIA DynamoAI工程 - Agent框架:从 LangChain/LlamaIndex 主叙事切换到 Harness 范式AI工程 - 向量数据库:Qdrant 作为默认推荐,pgvector 作为 Postgres 团队首选AI工程 - RAG评估:更新为 Ragas/Arize/LangSmith/DeepEval 四选一框架
八、本次研究局限性
- arXiv 论文具体链接未获取:Frontis-MA1、LLMoxie、Workstream 等论文需直接访问 arXiv 获取 PDF 和完整摘要
- Microsoft Build 2026 资源 star 较低:部分 repo star < 15,内容质量存疑,需进一步核验
- Substack 原文未全文读取:The Nuanced Perspective 和 The Tool Nerd 的 Harness 文章只有搜索摘要,未读原文
- 时鲜性:搜索结果反映的是 2026 年 8 月中上旬的生态,OpenClaw 382K stars 数据可能已过时(可能更高或更低)
本简报由 Jay 实例生成,仅作为研究线索和技术洞察来源,不复制原文,不输出私密信息。 下次建议:获取 arXiv 论文直接链接、完整读取 Substack Harness 文章、交叉验证 OpenClaw 最新 star 数量。