知识库草稿 · Jay · 2026-06-30
本次主题
AI 工程·后端·数据库·部署 — 第26周周度研究
一、LLM 推理引擎格局(2026年中)
高价值条目
1. vLLM vs SGLang vs TensorRT-LLM H100 基准对比(2026)
- 来源:Spheron Network Blog(技术博客,非论文)
- URL:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
- 核心观点:
- 三引擎在 H100 80GB + Llama 3.3 70B FP8 下做了一致性基准测试
- vLLM 和 SGLang 使用 CUDA 13.0,TensorRT-LLM v1.2.0 使用 CUDA 13.1
- Modular MAX 作为第五候选者出现,用 Mojo 图编译内核在高频并发场景超越 vLLM
- SGLang 的 RadixAttention(前缀复用) vs vLLM 的 PagedAttention(KV 分页)是两个核心差异
- 评价:⭐⭐⭐⭐ 有实际 benchmark 数据,非营销文,适合工程选型参考
- 标签:LLM推理 vLLM SGLang TensorRT-LLM Benchmark
- 后续行动:建议纳入「推理引擎选型」主题页精读对比
2. DeployBase:2026 最佳 LLM 推理引擎对比
- 来源:DeployBase 技术文章
- URL:https://deploybase.ai/articles/best-llm-inference-engine
- 核心观点:
- vLLM:Throughput 约 3,500 tokens/sec(A100 80GB,Llama 70B),单卡 40GB 可跑 Llama 70B
- TGI(HuggingFace):2,500 tokens/sec 同配置
- llama.cpp:H100 上 4,500 tokens/sec,面向 CPU 和边缘推理场景
- 结论:推理引擎选型对成本的影响已经超过模型选型本身
- 评价:⭐⭐⭐⭐ 数字清晰,适合快速技术选型对比
- 标签:LLM推理 vLLM TGI llama.cpp 工程选型
二、向量数据库 2026年5月动态
高价值条目
3. Vector Database News May 2026(RankSquire)
- 来源:RankSquire 技术聚合站
- URL:https://ranksquire.com/2026/05/27/vector-database-news-may-2026
- 核心观点(按产品分):
- Pinecone:Launch Week,Builder Tier($20/月)正式 GA;Nexus knowledge engine 预览;新加坡和法兰克福区域 GA
- Milvus:v3.0.0-beta 发布,支持 zero-copy 数据湖查询;v2.6.16 GA
- Qdrant:v1.18.0/1.18.1,TurboQuant 量化、dynamic named vectors、io_uring 优化
- pgvector:0.8.2 安全补丁——CVE-2026-3172(跨 relation 数据泄露风险),生产环境需7天内升级
- Redis:8.6.3 多 CVE 补丁
- MongoDB Atlas:Automated Embedding 和 Nested Embedding 进入公测
- Chroma:v1.5.9 分片改进
- Weaviate:v1.37.4 / v1.35.19 稳定性补丁
- 评价:⭐⭐⭐⭐⭐ 信息密度极高,pgvector 安全补丁是紧急行动项
- 标签:向量数据库 向量索引 pgvector Qdrant Milvus 安全
- 后续行动:高优先级 — 生产环境如使用 pgvector,需确认版本 ≥0.8.2
4. Vector Database Benchmarks 2026(CallSphere)
- 来源:CallSphere 博客
- URL:https://callsphere.ai/blog/vector-database-benchmarks-2026-pgvector-qdrant-weaviate-milvus-lancedb
- 核心观点(pgvector 0.9 为基准):
- pgvector:~5K-15K QPS(单 Postgres 实例,HNSW,1024维向量);2026年 hybrid search 和 late-interaction 支持最佳
- Qdrant:纯向量检索性能领先,hybrid + late interaction
- Milvus:超大规模场景首选
- LanceDB:嵌入式场景优势
- 选型决策树:SQL 原生需求→pgvector;混合检索 + 高性能→Qdrant;超大规模→Milvus
- 评价:⭐⭐⭐⭐ 有量化指标和决策框架
- 标签:向量数据库 Benchmark pgvector Qdrant 选型
三、AI Agent 工程与框架
高价值条目
5. The AI Agents Stack: LLM to Production(2026 Edition)
- 来源:The AI Engineer(Substack),作者 theaiengineer
- URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 核心观点:
- 2024年11月 Letta 发行的 agent stack 图在业界广泛引用;2026年已演进为6层
- 2026年新增三个独立层:Memory/State、Orchestration、Observability
- 三个月的教训:状态图14节点、自定义 checkpointer 写 Redis、重试逻辑一旦失控每周烧掉$1000+
- 核心论点:框架本身的角色是让基础原语足够便宜,工程资源应集中在 tool design 和 retrieval quality
- 评价:⭐⭐⭐⭐⭐ 来自实践的沉淀,不是框架广告,2026 agent stack 认知框架
- 标签:AI Agent Agent框架 LLM工程 Stack
- 后续行动:建议纳入「AI Agent 工程实践」主题页;Substack 原文值得精读
6. The 2026 AI Agent Platform Guide(Substack)
- 来源:Micheal Lanham(Substack)
- URL:https://micheallanham.substack.com/p/the-2026-ai-agent-platform-guide
- 核心观点:
- 选 AI agent 框架本质是 12 个月的生产承诺
- Klarna 和 Sierra 的案例:80% 查询解决时间缩减,自动化替代数百 FTE 工作量
- 四大核心原语:Tool Calling / Memory & State / Orchestration / Observability
- "3:00 AM Test":选能在凌晨三点生产告警时团队能理解的平台
- 成功取决于 tool design、retrieval quality 和 evaluation discipline,不只是框架本身
- 评价:⭐⭐⭐⭐ 战略视角 + 可操作维度,适合做选型决策参考
- 标签:AI Agent 平台选型 Agent框架 战略
7. FROAV: A Framework for RAG Observation and Agent Verification
- 来源:arXiv preprint arXiv:2601.07504,TH Lin & CH Kao
- URL:https://arxiv.org/pdf/2601.07504
- 核心观点:
- 提出 FROAV:一个 RAG 观察和 agent 验证框架,降低 LLM agent 研究门槛
- 架构:n8n(no-code 工作流)+ PostgreSQL(数据管理)+ FastAPI(后端)+ Streamlit(人机交互)
- 多阶段 RAG pipeline + LLM-as-Judge 评估系统
- 演示场景:金融文档分析,但架构是领域无关的
- 核心价值:让研究者专注 hypothesis testing 和算法创新,而不是系统集成
- 评价:⭐⭐⭐⭐ 论文,学术贡献清晰,有开源代码潜力
- 标签:RAG Agent 评估框架 arXiv LLM工程
8. MLE-Dojo: Training LLM Agents for Machine Learning Engineering
- 来源:GoPenAI Blog(arXiv 深度解读)
- URL:https://blog.gopenai.com/mle-dojo-training-a-new-breed-of-llm-agents-to-master-machine-learning-engineering-04485b6cb554
- 核心观点:
- MLE-Dojo:类似 Gym 的交互环境,用于训练和评测 LLM agent 在机器学习工程任务上的能力
- 从原始数据集到 Kaggle 级别问题的端到端自动化:数据处理→架构选择→超参调优→debug→提交
- 填补了 AI 自动化在 MLE 领域的空白
- 评价:⭐⭐⭐ 与 AI Agent 工程相关,但更多偏向 agent benchmark 环境构建
- 标签:AI Agent MLE Benchmark Agent训练
四、GitHub Trending 相关(2026-06-30)
候选条目
9. tolaria / tolaria ⭐ 17.7k
- 语言:TypeScript
- 描述:Desktop app to manage markdown knowledge bases
- 标签:知识管理 Markdown 桌面应用
- 评价:相关性一般,与知识库管理有关但非 AI 工程核心
10. ai-berkshire / ai-berkshire ⭐ 7.1k
- 语言:Python
- 描述:AI 时代伯克希尔——价值投资研究框架,多 Agent 并行研究
- 标签:Multi-Agent 投资研究 Claude Code
- 评价:有意思的多 Agent 应用案例,但非基础设施级别
11. logto-io / logto ⭐ 12.9k
- 语言:TypeScript
- 描述:AI 应用的认证授权基础设施,基于 OIDC/OAuth 2.1,多租户、SSO、RBAC
- 标签:Auth SaaS AI应用 身份认证
- 评价:⭐⭐⭐⭐ AI 应用部署需要考虑的认证层,对知识库项目有参考价值
12. simplex-chat / simplex-chat ⭐ 17.1k
- 语言:Haskell
- 描述:无用户标识符的隐私消息网络
- 标签:隐私 通讯 安全
- 评价:非本次主题方向
五、Hugging Face Trending 关键模型(截至 2026-06-30)
| 模型 | 类型 | 规模 | 热度 | 备注 |
|---|---|---|---|---|
| baidu/Unlimited-OCR | Image-Text-to-Text | 3B | 429k ⭐ | 百度 OCR 模型,关注多模态 |
| deepseek-ai/DeepSeek-V4-Pro-DSpark | Text Generation | 889B | 6.94k ⭐ | DeepSeek V4 Pro 版本 |
| deepseek-ai/DeepSeek-V4-Flash-DSpark | Text Generation | 165B | 4.45k ⭐ | Flash 版本,更轻量 |
| nvidia/GLM-5.2-NVFP4 | Text Generation | 381B | 105k ⭐ | NVIDIA FP4 量化版 GLM |
| Qwen/Qwen-AgentWorld-35B-A3B | Text Generation | 35B | 28.5k ⭐ | Qwen AgentWorld,Agent 专用 |
| LiquidAI/LFM2.5-230M | Text Generation | 0.2B | 17.8k ⭐ | 轻量高效,关注 |
| WeiboAI/VibeThinker-3B | Text Generation | 3B | 67.8k ⭐ | 微博 VibeThinker |
Jay 标注:DeepSeek-V4 和 Qwen-AgentWorld 值得持续关注;LFM2.5-230M 的极小化方向有工程意义。
六、AI Observability 工程实践
13. AI Observability Agent on Kubernetes(GKE + Elasticsearch + GitHub Actions)
- 来源:YouTube / Tech Tutorials with Piyush,GitHub: piyushsachdeva/AI-observability
- 技术栈:GKE Autopilot + ArgoCD + Elasticsearch(Elastic Cloud)+ OpenTelemetry + Claude(Agent Builder)
- 核心场景:把 pod OOMKill 自动关联到 Git commit 和负责人,替代20+分钟的 kubectl 排查
- 关键架构:
- OTel kube-stack 收集 pod logs 和 metrics → Elasticsearch
- GitHub Actions 将部署元数据(commit SHA、author、diffs)索引到 ES
- Claude Agent 通过 ES|QL LOOKUP JOIN 关联 crash 和部署历史
- 评价:⭐⭐⭐⭐⭐ AI + Kubernetes 可观测性最佳实践,GitOps + LLM 的完整闭环
- 标签:Kubernetes AI Observability Elasticsearch LLM GitOps
- 后续行动:建议纳入「AI 工程运营」主题页
分类标签汇总
LLM推理:条目 1、2向量数据库:条目 3、4AI Agent:条目 5、6、7、8Benchmark:条目 1、2、4安全补丁:条目 3(pgvector CVE)Kubernetes:AI Observability多Agent:ai-berkshire知识管理:tolaria身份认证:logto-io
建议写入路径
草稿路径:/shared/research-kb/inbox/jay/2026-06-30-ai-engineering-weekly.md
建议纳入主题页:
1. LLM推理引擎选型 — 条目 1、2
2. 向量数据库工程实践 — 条目 3(安全补丁高优先级)、4
3. AI Agent 工程栈 — 条目 5、6
4. AI 工程运营/Observability — 条目 13
精读/审稿优先级
| 优先级 | 条目 | 原因 |
|---|---|---|
| 🔴 紧急 | 条目3(pgvector CVE-2026-3172) | 安全补丁,7天内升级 |
| 🟠 高 | 条目5(AI Agents Stack 2026) | 业界广泛引用,需纳入主题页 |
| 🟠 高 | 条目1(SGLang vs vLLM benchmark) | 工程选型参考 |
| 🟡 中 | 条目13(GKE AI Observability) | 完整工程闭环,可作案例 |
| 🟡 中 | 条目7(FROAV arXiv) | 学术价值高,可做论文摘要 |
| 🟢 低 | 条目4(Vector DB Benchmark) | 补充性参考 |
行动项
- pgvector 安全确认:如知识库涉及 pgvector 部署,检查版本是否 ≥ 0.8.2
- 推理引擎选型页:整合条目 1、2 数据,建立中文选型对照表
- Substack 精读:条目 5(theaiengineer)原文建议进一步提取,建立 2026 Agent Stack 六层模型中文版
- FROAV 论文:可生成短篇 arXiv 摘要笔记
草稿由 Jay 生成于 2026-06-30 09:36 UTC | 共 13 条候选条目 | 高价值 8 条 | 紧急行动项 1 条