Jay · 晚间五类简报 · 2026-08-17 21:05 (Asia/Shanghai)
本次主题:Agentic RAG · VLM 2026 · Vector DB 生产选型 · Inference Engine v0.27 vs SGLang · KV Cache 优化工程
一、Database / Vector DB
📌 Vector DB 2026 生产选型共识(综合 Marktechpost / Firecrawl / Actian DEV)
| 场景 | 推荐方案 | 关键理由 |
|---|---|---|
| <5M 向量,已有 PG | pgvector | 同库事务、无同步管道、最简运维 |
| 5M–100M,PG 用户 | pgvector + pgvectorscale | 迭代索引扫描改善过滤召回 |
| 百亿向量企业级 | Milvus / Zilliz Cloud | 独立扩缩容,GPU 索引构建 |
| 混合搜索(语义+关键词) | Weaviate | BM25+向量+元数据过滤原生融合 |
| 预算敏感 / 最佳免费层 | Qdrant | SPLADE/ColBERT 多向量支持 |
| 原型 / MVP | Chroma | 对象存储后端 + Collection Forking |
| 嵌入式 / 本地优先 | LanceDB | 无服务器嵌入,轻量边缘 |
2026 新动态: - pgvector 已成为"首选默认"推荐,Reddit/HN 舆论明显转向 - Agent 系统正在打破传统 Query 模型:向量 DB 需原生支持 Tool Calls / Memory - 过滤策略改进:从 pre/post-filter 转向 one-stage filtering(HNSW 图遍历期间应用元数据过滤) - Pinecone 新增内置 embedding + rerank + 全文混合搜索,支持 BYOC
评价:选型决策树已趋成熟,pgvector vs 专用向量 DB 的边界在 500 万向量;Agent 场景推动混合搜索成为事实标准。
来源: - https://www.marktechpost.com/2026/05/10/best-vector-databases-in-2026/ - https://www.firecrawl.dev/blog/best-vector-databases - https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo
二、Backend / Inference Engine
📌 vLLM vs SGLang vs LMDeploy · H100 基准实测(PremAI Blog / Spheron / Yotta Labs)
吞吐量对比(H100,tokens/sec):
| Engine | H100 吞吐量 | 备注 |
|---|---|---|
| SGLang | ~16,200 tok/s | 多轮对话最优,Prefix Cache 命中率 75–95% |
| LMDeploy | ~16,200 tok/s | 量化模型部署首选 |
| vLLM | ~12,500 tok/s | 落后约 29%,但生态最成熟 |
前缀缓存命中率实测: - Few-shot 共享示例:85–95%(vs PagedAttention 15–25%) - 多轮聊天:75–90%(vs 10–20%) - 代码分析:60–80%(vs 5–15%)
v0.27.1 当前版本(LeetLLM 检查于 2026-08-13): - SGLang v1.2.1 / TensorRT-LLM v1.3.0rc24 / Ollama b10375
RadixArk 分拆融资:SGLang 核心团队 RadixArk 获 $100M 种子轮,估值方向指向 Inference 赛道整合加速
建议: - 多轮 Agent 场景 → SGLang(RadixAttention 前缀复用优势显著) - 通用生产稳定 → vLLM(社区成熟,bug 修复快) - 量化模型 + 约束硬件 → LMDeploy
来源: - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared - https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026 - https://www.spheron.network/blog/vllm-vs-sglang-2026
三、Cloud-Native / MLOps
📌 KV Cache 优化工程指南 2026(Digital Applied / IBM Redbooks)
五种技术家族:
| 技术 | 效果 | 备注 |
|---|---|---|
| PagedAttention (vLLM) | 内存碎片↓,利用率↑ | 固定块 KV 管理 |
| Prefix Caching | 命中时 85–95% 计算节省 | SGLang RadixAttention 自动发现 |
| MQA/GQA/MLA | Attention Head 压缩 | DeepSeek MLA 最高压缩率 |
| KV Cache Quantization | FP8 → 50% 显存节省 | 与 MLA 叠加效果最强 |
| Hybrid Memory (NVMe Offload) | 显存外溢出 | 延迟敏感场景需谨慎 |
1M Context KV 内存占用(Llama 70B): - MHA FP16:138 GB(爆炸性) - GQA INT8:~35 GB(可接受) - MLA + FP8:~17 GB(生产可行)
arXiv 新论文(2026):
- 2603.20397 · KV Cache Optimization Strategies Survey(Xu, Khaira, Singh · Dell · Mar 2026)— 全面综述
- 2604.05012 · Comparative Characterization of KV Cache Management(Oteo Mamo et al.)— vLLM vs InfiniGen vs H2O 实证对比
- 2602.08005 · DeltaKV: Residual-Based KV Cache Compression — 长程相似性压缩
- 2602.00328 · Harvest: Opportunistic Peer-to-Peer GPU Caching — NVLink 互联多卡场景
ACM 论文 · KV Cache Compression for Inference Efficiency in LLMs: A Review(AI&IIP 2026): - 混合优化(选择性驱逐+量化+注意力压缩)是未来方向 - 关键挑战:量化精度损失会削弱注意力压缩鲁棒性,需统一融合框架
来源: - https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide - https://arxiv.org/pdf/2603.20397 - https://dl.acm.org/doi/10.1145/3778534.3778567
四、CSDN 高价值文章
本次未新发现独立 CSDN 高价值条目(本日已有
csdn-substack-inference-rag-agent-highvalue.md归档)。
本日 CSDN 高价值文章回顾(来自本日已归档文件): - vLLM 0.27 Breaking Changes 工程清单 - SGLang vs vLLM 命令对照 - RAG Eval CI/CD threshold 0.65/0.75 数字 - CircleCI RAGAS 自动评估 pipeline YAML
五、Reproduction / 可复现项
📌 可复现命令集
vLLM 生产部署基准命令(SitePoint):
# 启动
python -m vllm.entrypoints.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--dtype auto \
--gpu-memory-utilization 0.90 \
--enable-prefix-caching \
--port 8000
# Benchmark
python benchmarks/benchmark_serving.py \
--backend vllm \
--endpoint /v1/completions \
--model llama-3.1-8b \
--dataset-name sharegpt \
--num-prompts 500 \
--request-rate 10 \
--base-url http://localhost:8000
pgvector 混合搜索(Actian DEV 示例):
# 预过滤后向量相似度
result = conn.execute(
"SELECT id, embedding <=> %s AS distance FROM documents "
"WHERE category = %s ORDER BY distance LIMIT 10",
(query_vector, "engineering")
)
Qdrant 过滤搜索:
from qdrant_client import QdrantClient
client = QdrantClient(url="http://localhost:6333")
results = client.search(
collection_name="documents",
query_vector=query_vector,
query_filter={
"must": [{"key": "category", "match": {"value": "engineering"}}]
},
limit=10
)
六、Substack / Newsletter 高价值条目
📌 Turing Post · 20 Advanced RAG Types in 2026
2026 RAG 技术图谱(精选):
| 类型 | 核心机制 | 适用场景 |
|---|---|---|
| Agentic RAG | LLM 规划+编排多步检索+记忆+工具调用 | 复杂推理、迭代证据收集 |
| MiA-RAG | 多代理协同防御 | 安全关键场景 |
| HGMem | 分层全局记忆 | 长时记忆跨会话 |
| Graph-O1 | 图推理增强 | 知识图谱问答 |
| Bidirectional RAG | 前向+后向检索融合 | 深度理解任务 |
| Multimodal RAG | 图像+文本+音频统一检索 | 文档+图片混合知识库 |
| Security RAG | 子图重构攻击防御 | 隐私保护知识库 |
评价:Agentic RAG 已成 2026 主流范式,不再是"retrieve-then-generate"管道,而是 LLM 自主决策的推理+记忆+工具层。
来源:https://www.turingpost.com/p/ragtypes
📌 Awesome-Search-Agent-Papers · 2026 年 6 月新收录
| 论文 | 方向 | 值得注意 |
|---|---|---|
| Contrastive Reflection for Iterative Prompt Optimization | Prompt 优化 | arXiv 2026.6 |
| FORT-Searcher: Shortcut-Resistant Search Tasks | 对抗检索 | 实用性强 |
| LatentRAG: Latent Reasoning + Retrieval | 隐式推理 RAG | 高效架构 |
| LongSeeker: Elastic Context Orchestration | 长程搜索 | 上下文弹性编排 |
| Agent-Orchestrated Adaptive RAG | 自适应多跳检索 | 企业知识库 |
| ActiveMem: Distributed Active Memory | 分布式主动记忆 | 长程推理 |
来源:https://github.com/YunjiaXi/Awesome-Search-Agent-Papers
📌 Hugging Face · State of Open Models: Summer 2026
关键数据: - HF Hub 模型数:1.26M → 2.96M(半年翻番) - Qwen 衍生模型:151,448 个(是 Meta 2.6 倍) - 下载分布极端:前 50 个模型占 80% 下载量 - 92.48% 的下载是 <1B 参数小模型 - 向量嵌入类占下载量 55.5%(以 all-MiniLM-L6-v2 为绝对主导)
2026 趋势: 1. 中国实验室(DeepSeek、Kimi、Qwen)跳过小模型直接发布顶级旗舰 2. Qwen 成为社区事实基础模型 3. 小模型仍是实际落地主力
来源:https://huggingface.co/blog/state-of-open-models-summer-2026
七、本日 HF Trending 速览(2026-08-17)
| 排名 | 模型/论文 | 方向 |
|---|---|---|
| #1 | Alaya-EVOKE: From Linear-Scaling Supervision to Endless World | 世界模型 |
| #2 | LLMRouter: Unified Infrastructure for LLM Routers | 路由基础设施 |
| #3 | DreamX-Phi 1.0: Action-Conditioned Video World Model | 机器人操纵 |
| #4 | DarwinX: Evolving Agent Harnesses Through Natural Selection | Agent 评估 |
新发布:Meta Muse Glimmer(本地 Agentic 多模态开源)、LFM2.5-VL-3B(边缘 VLM)、OlmoEarth Embeddings
分类标签
vector-db vllm sglang lmdeploy kv-cache rag agentic-rag multimodal vlm-2026 hf-trending production quantization substack reproduction
建议写入路径
主要草稿:/shared/research-kb/inbox/jay/2026-08-17T2105-jay-evening-five-category-briefing.md(即本文)
归档参考(本日已有):
- 2026-08-17/2026-08-17T1505-jay-afternoon-synthesis-briefing.md
- 2026-08-17T1220-jay-csdn-inference-quantization-agent-2026.md
- 2026-08-17T1620-jay-csdn-rag-agent-enterprise-architecture-highvalue.md
是否需要精读 / 审稿 / 主题页更新
| 动作 | 对象 | 优先级 |
|---|---|---|
| 精读 | DeltaKV (2602.08005) + Ada-KV | 中 · KV Cache 优化工程 |
| 精读 | Hugging Face State of Open Models Summer 2026 | 中 · 生态全景 |
| 审稿 | Turing Post 20 RAG Types | 低 · 综述类,可作导航 |
| 更新 | Agentic RAG 主题页 | 建议 · 2026 范式已成熟 |
| 跟踪 | RadixArk 融资后续 | 低 · 商业事件 |
本简报由 Jay 实例生成 · 2026-08-17 21:05 CST 检索覆盖:Tavily · arXiv · Hugging Face Blog · Turion.ai · LeetLLM · Spheron · PremAI · Turing Post · Awesome-Search-Agent-Papers · Digital Applied · ACM / AI&IIP