Jay · 晚间五类简报 · 2026-08-17 21:05 (Asia/Shanghai)

本次主题:Agentic RAG · VLM 2026 · Vector DB 生产选型 · Inference Engine v0.27 vs SGLang · KV Cache 优化工程


一、Database / Vector DB

📌 Vector DB 2026 生产选型共识(综合 Marktechpost / Firecrawl / Actian DEV)

场景 推荐方案 关键理由
<5M 向量,已有 PG pgvector 同库事务、无同步管道、最简运维
5M–100M,PG 用户 pgvector + pgvectorscale 迭代索引扫描改善过滤召回
百亿向量企业级 Milvus / Zilliz Cloud 独立扩缩容,GPU 索引构建
混合搜索(语义+关键词) Weaviate BM25+向量+元数据过滤原生融合
预算敏感 / 最佳免费层 Qdrant SPLADE/ColBERT 多向量支持
原型 / MVP Chroma 对象存储后端 + Collection Forking
嵌入式 / 本地优先 LanceDB 无服务器嵌入,轻量边缘

2026 新动态: - pgvector 已成为"首选默认"推荐,Reddit/HN 舆论明显转向 - Agent 系统正在打破传统 Query 模型:向量 DB 需原生支持 Tool Calls / Memory - 过滤策略改进:从 pre/post-filter 转向 one-stage filtering(HNSW 图遍历期间应用元数据过滤) - Pinecone 新增内置 embedding + rerank + 全文混合搜索,支持 BYOC

评价:选型决策树已趋成熟,pgvector vs 专用向量 DB 的边界在 500 万向量;Agent 场景推动混合搜索成为事实标准。

来源: - https://www.marktechpost.com/2026/05/10/best-vector-databases-in-2026/ - https://www.firecrawl.dev/blog/best-vector-databases - https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo


二、Backend / Inference Engine

📌 vLLM vs SGLang vs LMDeploy · H100 基准实测(PremAI Blog / Spheron / Yotta Labs)

吞吐量对比(H100,tokens/sec)

Engine H100 吞吐量 备注
SGLang ~16,200 tok/s 多轮对话最优,Prefix Cache 命中率 75–95%
LMDeploy ~16,200 tok/s 量化模型部署首选
vLLM ~12,500 tok/s 落后约 29%,但生态最成熟

前缀缓存命中率实测: - Few-shot 共享示例:85–95%(vs PagedAttention 15–25%) - 多轮聊天:75–90%(vs 10–20%) - 代码分析:60–80%(vs 5–15%)

v0.27.1 当前版本(LeetLLM 检查于 2026-08-13): - SGLang v1.2.1 / TensorRT-LLM v1.3.0rc24 / Ollama b10375

RadixArk 分拆融资:SGLang 核心团队 RadixArk 获 $100M 种子轮,估值方向指向 Inference 赛道整合加速

建议: - 多轮 Agent 场景 → SGLang(RadixAttention 前缀复用优势显著) - 通用生产稳定 → vLLM(社区成熟,bug 修复快) - 量化模型 + 约束硬件 → LMDeploy

来源: - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared - https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026 - https://www.spheron.network/blog/vllm-vs-sglang-2026


三、Cloud-Native / MLOps

📌 KV Cache 优化工程指南 2026(Digital Applied / IBM Redbooks)

五种技术家族

技术 效果 备注
PagedAttention (vLLM) 内存碎片↓,利用率↑ 固定块 KV 管理
Prefix Caching 命中时 85–95% 计算节省 SGLang RadixAttention 自动发现
MQA/GQA/MLA Attention Head 压缩 DeepSeek MLA 最高压缩率
KV Cache Quantization FP8 → 50% 显存节省 与 MLA 叠加效果最强
Hybrid Memory (NVMe Offload) 显存外溢出 延迟敏感场景需谨慎

1M Context KV 内存占用(Llama 70B): - MHA FP16:138 GB(爆炸性) - GQA INT8:~35 GB(可接受) - MLA + FP8:~17 GB(生产可行)

arXiv 新论文(2026): - 2603.20397 · KV Cache Optimization Strategies Survey(Xu, Khaira, Singh · Dell · Mar 2026)— 全面综述 - 2604.05012 · Comparative Characterization of KV Cache Management(Oteo Mamo et al.)— vLLM vs InfiniGen vs H2O 实证对比 - 2602.08005 · DeltaKV: Residual-Based KV Cache Compression — 长程相似性压缩 - 2602.00328 · Harvest: Opportunistic Peer-to-Peer GPU Caching — NVLink 互联多卡场景

ACM 论文 · KV Cache Compression for Inference Efficiency in LLMs: A Review(AI&IIP 2026): - 混合优化(选择性驱逐+量化+注意力压缩)是未来方向 - 关键挑战:量化精度损失会削弱注意力压缩鲁棒性,需统一融合框架

来源: - https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide - https://arxiv.org/pdf/2603.20397 - https://dl.acm.org/doi/10.1145/3778534.3778567


四、CSDN 高价值文章

本次未新发现独立 CSDN 高价值条目(本日已有 csdn-substack-inference-rag-agent-highvalue.md 归档)。

本日 CSDN 高价值文章回顾(来自本日已归档文件): - vLLM 0.27 Breaking Changes 工程清单 - SGLang vs vLLM 命令对照 - RAG Eval CI/CD threshold 0.65/0.75 数字 - CircleCI RAGAS 自动评估 pipeline YAML


五、Reproduction / 可复现项

📌 可复现命令集

vLLM 生产部署基准命令(SitePoint):

# 启动
python -m vllm.entrypoints.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --dtype auto \
  --gpu-memory-utilization 0.90 \
  --enable-prefix-caching \
  --port 8000

# Benchmark
python benchmarks/benchmark_serving.py \
  --backend vllm \
  --endpoint /v1/completions \
  --model llama-3.1-8b \
  --dataset-name sharegpt \
  --num-prompts 500 \
  --request-rate 10 \
  --base-url http://localhost:8000

pgvector 混合搜索(Actian DEV 示例)

# 预过滤后向量相似度
result = conn.execute(
    "SELECT id, embedding <=> %s AS distance FROM documents "
    "WHERE category = %s ORDER BY distance LIMIT 10",
    (query_vector, "engineering")
)

Qdrant 过滤搜索

from qdrant_client import QdrantClient
client = QdrantClient(url="http://localhost:6333")
results = client.search(
    collection_name="documents",
    query_vector=query_vector,
    query_filter={
        "must": [{"key": "category", "match": {"value": "engineering"}}]
    },
    limit=10
)

六、Substack / Newsletter 高价值条目

📌 Turing Post · 20 Advanced RAG Types in 2026

2026 RAG 技术图谱(精选):

类型 核心机制 适用场景
Agentic RAG LLM 规划+编排多步检索+记忆+工具调用 复杂推理、迭代证据收集
MiA-RAG 多代理协同防御 安全关键场景
HGMem 分层全局记忆 长时记忆跨会话
Graph-O1 图推理增强 知识图谱问答
Bidirectional RAG 前向+后向检索融合 深度理解任务
Multimodal RAG 图像+文本+音频统一检索 文档+图片混合知识库
Security RAG 子图重构攻击防御 隐私保护知识库

评价:Agentic RAG 已成 2026 主流范式,不再是"retrieve-then-generate"管道,而是 LLM 自主决策的推理+记忆+工具层。

来源:https://www.turingpost.com/p/ragtypes

📌 Awesome-Search-Agent-Papers · 2026 年 6 月新收录

论文 方向 值得注意
Contrastive Reflection for Iterative Prompt Optimization Prompt 优化 arXiv 2026.6
FORT-Searcher: Shortcut-Resistant Search Tasks 对抗检索 实用性强
LatentRAG: Latent Reasoning + Retrieval 隐式推理 RAG 高效架构
LongSeeker: Elastic Context Orchestration 长程搜索 上下文弹性编排
Agent-Orchestrated Adaptive RAG 自适应多跳检索 企业知识库
ActiveMem: Distributed Active Memory 分布式主动记忆 长程推理

来源:https://github.com/YunjiaXi/Awesome-Search-Agent-Papers

📌 Hugging Face · State of Open Models: Summer 2026

关键数据: - HF Hub 模型数:1.26M → 2.96M(半年翻番) - Qwen 衍生模型:151,448 个(是 Meta 2.6 倍) - 下载分布极端:前 50 个模型占 80% 下载量 - 92.48% 的下载是 <1B 参数小模型 - 向量嵌入类占下载量 55.5%(以 all-MiniLM-L6-v2 为绝对主导)

2026 趋势: 1. 中国实验室(DeepSeek、Kimi、Qwen)跳过小模型直接发布顶级旗舰 2. Qwen 成为社区事实基础模型 3. 小模型仍是实际落地主力

来源:https://huggingface.co/blog/state-of-open-models-summer-2026


排名 模型/论文 方向
#1 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 世界模型
#2 LLMRouter: Unified Infrastructure for LLM Routers 路由基础设施
#3 DreamX-Phi 1.0: Action-Conditioned Video World Model 机器人操纵
#4 DarwinX: Evolving Agent Harnesses Through Natural Selection Agent 评估

新发布:Meta Muse Glimmer(本地 Agentic 多模态开源)、LFM2.5-VL-3B(边缘 VLM)、OlmoEarth Embeddings


分类标签

vector-db vllm sglang lmdeploy kv-cache rag agentic-rag multimodal vlm-2026 hf-trending production quantization substack reproduction


建议写入路径

主要草稿/shared/research-kb/inbox/jay/2026-08-17T2105-jay-evening-five-category-briefing.md(即本文)

归档参考(本日已有): - 2026-08-17/2026-08-17T1505-jay-afternoon-synthesis-briefing.md - 2026-08-17T1220-jay-csdn-inference-quantization-agent-2026.md - 2026-08-17T1620-jay-csdn-rag-agent-enterprise-architecture-highvalue.md


是否需要精读 / 审稿 / 主题页更新

动作 对象 优先级
精读 DeltaKV (2602.08005) + Ada-KV 中 · KV Cache 优化工程
精读 Hugging Face State of Open Models Summer 2026 中 · 生态全景
审稿 Turing Post 20 RAG Types 低 · 综述类,可作导航
更新 Agentic RAG 主题页 建议 · 2026 范式已成熟
跟踪 RadixArk 融资后续 低 · 商业事件

本简报由 Jay 实例生成 · 2026-08-17 21:05 CST 检索覆盖:Tavily · arXiv · Hugging Face Blog · Turion.ai · LeetLLM · Spheron · PremAI · Turing Post · Awesome-Search-Agent-Papers · Digital Applied · ACM / AI&IIP