知识库草稿 · Jay · 2026-06-30

本次主题

AI 工程·后端·数据库·部署 — 第26周周度研究


一、LLM 推理引擎格局(2026年中)

高价值条目

1. vLLM vs SGLang vs TensorRT-LLM H100 基准对比(2026) - 来源:Spheron Network Blog(技术博客,非论文) - URL:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - 核心观点: - 三引擎在 H100 80GB + Llama 3.3 70B FP8 下做了一致性基准测试 - vLLM 和 SGLang 使用 CUDA 13.0,TensorRT-LLM v1.2.0 使用 CUDA 13.1 - Modular MAX 作为第五候选者出现,用 Mojo 图编译内核在高频并发场景超越 vLLM - SGLang 的 RadixAttention(前缀复用) vs vLLM 的 PagedAttention(KV 分页)是两个核心差异 - 评价:⭐⭐⭐⭐ 有实际 benchmark 数据,非营销文,适合工程选型参考 - 标签:LLM推理 vLLM SGLang TensorRT-LLM Benchmark - 后续行动:建议纳入「推理引擎选型」主题页精读对比

2. DeployBase:2026 最佳 LLM 推理引擎对比 - 来源:DeployBase 技术文章 - URL:https://deploybase.ai/articles/best-llm-inference-engine - 核心观点: - vLLM:Throughput 约 3,500 tokens/sec(A100 80GB,Llama 70B),单卡 40GB 可跑 Llama 70B - TGI(HuggingFace):2,500 tokens/sec 同配置 - llama.cpp:H100 上 4,500 tokens/sec,面向 CPU 和边缘推理场景 - 结论:推理引擎选型对成本的影响已经超过模型选型本身 - 评价:⭐⭐⭐⭐ 数字清晰,适合快速技术选型对比 - 标签:LLM推理 vLLM TGI llama.cpp 工程选型


二、向量数据库 2026年5月动态

高价值条目

3. Vector Database News May 2026(RankSquire) - 来源:RankSquire 技术聚合站 - URL:https://ranksquire.com/2026/05/27/vector-database-news-may-2026 - 核心观点(按产品分): - Pinecone:Launch Week,Builder Tier($20/月)正式 GA;Nexus knowledge engine 预览;新加坡和法兰克福区域 GA - Milvus:v3.0.0-beta 发布,支持 zero-copy 数据湖查询;v2.6.16 GA - Qdrant:v1.18.0/1.18.1,TurboQuant 量化、dynamic named vectors、io_uring 优化 - pgvector:0.8.2 安全补丁——CVE-2026-3172(跨 relation 数据泄露风险),生产环境需7天内升级 - Redis:8.6.3 多 CVE 补丁 - MongoDB Atlas:Automated Embedding 和 Nested Embedding 进入公测 - Chroma:v1.5.9 分片改进 - Weaviate:v1.37.4 / v1.35.19 稳定性补丁 - 评价:⭐⭐⭐⭐⭐ 信息密度极高,pgvector 安全补丁是紧急行动项 - 标签:向量数据库 向量索引 pgvector Qdrant Milvus 安全 - 后续行动:高优先级 — 生产环境如使用 pgvector,需确认版本 ≥0.8.2

4. Vector Database Benchmarks 2026(CallSphere) - 来源:CallSphere 博客 - URL:https://callsphere.ai/blog/vector-database-benchmarks-2026-pgvector-qdrant-weaviate-milvus-lancedb - 核心观点(pgvector 0.9 为基准): - pgvector:~5K-15K QPS(单 Postgres 实例,HNSW,1024维向量);2026年 hybrid search 和 late-interaction 支持最佳 - Qdrant:纯向量检索性能领先,hybrid + late interaction - Milvus:超大规模场景首选 - LanceDB:嵌入式场景优势 - 选型决策树:SQL 原生需求→pgvector;混合检索 + 高性能→Qdrant;超大规模→Milvus - 评价:⭐⭐⭐⭐ 有量化指标和决策框架 - 标签:向量数据库 Benchmark pgvector Qdrant 选型


三、AI Agent 工程与框架

高价值条目

5. The AI Agents Stack: LLM to Production(2026 Edition) - 来源:The AI Engineer(Substack),作者 theaiengineer - URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 核心观点: - 2024年11月 Letta 发行的 agent stack 图在业界广泛引用;2026年已演进为6层 - 2026年新增三个独立层:Memory/State、Orchestration、Observability - 三个月的教训:状态图14节点、自定义 checkpointer 写 Redis、重试逻辑一旦失控每周烧掉$1000+ - 核心论点:框架本身的角色是让基础原语足够便宜,工程资源应集中在 tool design 和 retrieval quality - 评价:⭐⭐⭐⭐⭐ 来自实践的沉淀,不是框架广告,2026 agent stack 认知框架 - 标签:AI Agent Agent框架 LLM工程 Stack - 后续行动:建议纳入「AI Agent 工程实践」主题页;Substack 原文值得精读

6. The 2026 AI Agent Platform Guide(Substack) - 来源:Micheal Lanham(Substack) - URL:https://micheallanham.substack.com/p/the-2026-ai-agent-platform-guide - 核心观点: - 选 AI agent 框架本质是 12 个月的生产承诺 - Klarna 和 Sierra 的案例:80% 查询解决时间缩减,自动化替代数百 FTE 工作量 - 四大核心原语:Tool Calling / Memory & State / Orchestration / Observability - "3:00 AM Test":选能在凌晨三点生产告警时团队能理解的平台 - 成功取决于 tool design、retrieval quality 和 evaluation discipline,不只是框架本身 - 评价:⭐⭐⭐⭐ 战略视角 + 可操作维度,适合做选型决策参考 - 标签:AI Agent 平台选型 Agent框架 战略

7. FROAV: A Framework for RAG Observation and Agent Verification - 来源:arXiv preprint arXiv:2601.07504,TH Lin & CH Kao - URL:https://arxiv.org/pdf/2601.07504 - 核心观点: - 提出 FROAV:一个 RAG 观察和 agent 验证框架,降低 LLM agent 研究门槛 - 架构:n8n(no-code 工作流)+ PostgreSQL(数据管理)+ FastAPI(后端)+ Streamlit(人机交互) - 多阶段 RAG pipeline + LLM-as-Judge 评估系统 - 演示场景:金融文档分析,但架构是领域无关的 - 核心价值:让研究者专注 hypothesis testing 和算法创新,而不是系统集成 - 评价:⭐⭐⭐⭐ 论文,学术贡献清晰,有开源代码潜力 - 标签:RAG Agent 评估框架 arXiv LLM工程

8. MLE-Dojo: Training LLM Agents for Machine Learning Engineering - 来源:GoPenAI Blog(arXiv 深度解读) - URL:https://blog.gopenai.com/mle-dojo-training-a-new-breed-of-llm-agents-to-master-machine-learning-engineering-04485b6cb554 - 核心观点: - MLE-Dojo:类似 Gym 的交互环境,用于训练和评测 LLM agent 在机器学习工程任务上的能力 - 从原始数据集到 Kaggle 级别问题的端到端自动化:数据处理→架构选择→超参调优→debug→提交 - 填补了 AI 自动化在 MLE 领域的空白 - 评价:⭐⭐⭐ 与 AI Agent 工程相关,但更多偏向 agent benchmark 环境构建 - 标签:AI Agent MLE Benchmark Agent训练


候选条目

9. tolaria / tolaria ⭐ 17.7k - 语言:TypeScript - 描述:Desktop app to manage markdown knowledge bases - 标签:知识管理 Markdown 桌面应用 - 评价:相关性一般,与知识库管理有关但非 AI 工程核心

10. ai-berkshire / ai-berkshire ⭐ 7.1k - 语言:Python - 描述:AI 时代伯克希尔——价值投资研究框架,多 Agent 并行研究 - 标签:Multi-Agent 投资研究 Claude Code - 评价:有意思的多 Agent 应用案例,但非基础设施级别

11. logto-io / logto ⭐ 12.9k - 语言:TypeScript - 描述:AI 应用的认证授权基础设施,基于 OIDC/OAuth 2.1,多租户、SSO、RBAC - 标签:Auth SaaS AI应用 身份认证 - 评价:⭐⭐⭐⭐ AI 应用部署需要考虑的认证层,对知识库项目有参考价值

12. simplex-chat / simplex-chat ⭐ 17.1k - 语言:Haskell - 描述:无用户标识符的隐私消息网络 - 标签:隐私 通讯 安全 - 评价:非本次主题方向


模型 类型 规模 热度 备注
baidu/Unlimited-OCR Image-Text-to-Text 3B 429k ⭐ 百度 OCR 模型,关注多模态
deepseek-ai/DeepSeek-V4-Pro-DSpark Text Generation 889B 6.94k ⭐ DeepSeek V4 Pro 版本
deepseek-ai/DeepSeek-V4-Flash-DSpark Text Generation 165B 4.45k ⭐ Flash 版本,更轻量
nvidia/GLM-5.2-NVFP4 Text Generation 381B 105k ⭐ NVIDIA FP4 量化版 GLM
Qwen/Qwen-AgentWorld-35B-A3B Text Generation 35B 28.5k ⭐ Qwen AgentWorld,Agent 专用
LiquidAI/LFM2.5-230M Text Generation 0.2B 17.8k ⭐ 轻量高效,关注
WeiboAI/VibeThinker-3B Text Generation 3B 67.8k ⭐ 微博 VibeThinker

Jay 标注:DeepSeek-V4 和 Qwen-AgentWorld 值得持续关注;LFM2.5-230M 的极小化方向有工程意义。


六、AI Observability 工程实践

13. AI Observability Agent on Kubernetes(GKE + Elasticsearch + GitHub Actions) - 来源:YouTube / Tech Tutorials with Piyush,GitHub: piyushsachdeva/AI-observability - 技术栈:GKE Autopilot + ArgoCD + Elasticsearch(Elastic Cloud)+ OpenTelemetry + Claude(Agent Builder) - 核心场景:把 pod OOMKill 自动关联到 Git commit 和负责人,替代20+分钟的 kubectl 排查 - 关键架构: - OTel kube-stack 收集 pod logs 和 metrics → Elasticsearch - GitHub Actions 将部署元数据(commit SHA、author、diffs)索引到 ES - Claude Agent 通过 ES|QL LOOKUP JOIN 关联 crash 和部署历史 - 评价:⭐⭐⭐⭐⭐ AI + Kubernetes 可观测性最佳实践,GitOps + LLM 的完整闭环 - 标签:Kubernetes AI Observability Elasticsearch LLM GitOps - 后续行动:建议纳入「AI 工程运营」主题页


分类标签汇总

  • LLM推理:条目 1、2
  • 向量数据库:条目 3、4
  • AI Agent:条目 5、6、7、8
  • Benchmark:条目 1、2、4
  • 安全补丁:条目 3(pgvector CVE)
  • KubernetesAI Observability
  • 多Agentai-berkshire
  • 知识管理tolaria
  • 身份认证logto-io

建议写入路径

草稿路径/shared/research-kb/inbox/jay/2026-06-30-ai-engineering-weekly.md

建议纳入主题页: 1. LLM推理引擎选型 — 条目 1、2 2. 向量数据库工程实践 — 条目 3(安全补丁高优先级)、4 3. AI Agent 工程栈 — 条目 5、6 4. AI 工程运营/Observability — 条目 13


精读/审稿优先级

优先级 条目 原因
🔴 紧急 条目3(pgvector CVE-2026-3172) 安全补丁,7天内升级
🟠 高 条目5(AI Agents Stack 2026) 业界广泛引用,需纳入主题页
🟠 高 条目1(SGLang vs vLLM benchmark) 工程选型参考
🟡 中 条目13(GKE AI Observability) 完整工程闭环,可作案例
🟡 中 条目7(FROAV arXiv) 学术价值高,可做论文摘要
🟢 低 条目4(Vector DB Benchmark) 补充性参考

行动项

  1. pgvector 安全确认:如知识库涉及 pgvector 部署,检查版本是否 ≥ 0.8.2
  2. 推理引擎选型页:整合条目 1、2 数据,建立中文选型对照表
  3. Substack 精读:条目 5(theaiengineer)原文建议进一步提取,建立 2026 Agent Stack 六层模型中文版
  4. FROAV 论文:可生成短篇 arXiv 摘要笔记

草稿由 Jay 生成于 2026-06-30 09:36 UTC | 共 13 条候选条目 | 高价值 8 条 | 紧急行动项 1 条