Jay 研究简报 · 2026-09-01
主题覆盖:LLM 推理引擎 · KV Cache 压缩 · RAG 优化 · Vector DB · Cloud-Native eBPF · Multi-Agent
一、LLM Inference Engine 格局(2026 中期)
核心对比(综合多个 Benchmark)
| 引擎 | 吞吐量 | 延迟 | 生产适配度 | 备注 |
|---|---|---|---|---|
| SGLang | ~16,200 tok/s | 4–21ms | ⭐⭐⭐⭐ | RadixAttention 前缀复用,共享系统 prompt 场景领先 vLLM 29% |
| vLLM | ~12,500 tok/s | 50–80ms | ⭐⭐⭐⭐⭐ | 生态最完整,连续 batching + PagedAttention 稳产标配 |
| TensorRT-LLM | ~10,000+ tok/s | 35–50ms | ⭐⭐⭐ | 极致单请求吞吐量,工程成本高(编译、CUDA 版本耦合) |
| LMDeploy | ~16,132 tok/s | ~25ms | ⭐⭐⭐ | 中文模型(Qwen/InternLM)友好,TurboMind 混合精度 |
| TGI | ~9,500 tok/s | ~60ms | ⭐⭐ | Hugging Face 生态,2026 已进入维护模式 |
关键结论(2026Q2): - SGLang vs vLLM:取决于请求是否共享前缀;共享系统 prompt + 短用户 query → SGLang;完全独立请求 → vLLM 生态更稳 - TensorRT-LLM:高并发下反而劣势明显,低延迟单请求场景专用 - TGI:新项目不再推荐,迁移窗口已开
H100 vs A100 决策:FP8 场景选 H100(Transformer Engine + 1.6× 内存带宽),7–13B 中等模型和成本敏感场景选 A100
来源: - Spheron Benchmark(2026-03,基于 Llama 3.3 70B FP8 H100 SXM5 80GB) - GIGAGPU / LeetLLM 综合排名 - zhuoqidev 推理引擎选型地图(覆盖 PD Disaggregation + Dynamo)
二、KV Cache 压缩前沿(2026 新论文)
高价值论文清单
1. VeriCache(arXiv:2605.17613)
- 标题:Turning Lossy KV Cache into Lossless LLM Inference
- 核心:将已有损压缩(token dropping / quantization)的 KV Cache 作为草稿,用完整 KV 验证,实现无损推理加速
- 方法:压缩缓存草稿 → full KV 验证,两类基线均有效
- 评价:为所有有损 KV 压缩方法提供统一"无损化"出口,工程价值高
2. KV Cache Transform Coding(ICLR 2026,arXiv:2511.01815)
- 方法:对 KV Cache 做变换编码(如 DCT),实现紧凑存储
- 适用场景:长上下文 LLM 服务,KV Cache 内存瓶颈
- 评价:ICLR 2026 录用,理论深度强,工程路径清晰
3. SAW-INT4: System-Aware 4-bit KV Cache Quantization(arXiv:2604.19157)
- 方法:Hessian-aware per-layer rotation + 4-bit 量化,硬件感知设计
- 评价:NVIDIA Blackwell FP4 路径直接相关,NVFP4 格式约束决定量化方法选择
4. ARCQuant: Boosting NVFP4 Quantization(arXiv:2601.07475)
- 方法:Augmented Residual Channels 减少 NVFP4 低位量化误差
- 评价:Blackwell FP4 必读,与 SAW-INT4 互补
5. DeltaKV: Residual-Based KV Cache Compression(arXiv:2602.08005)
- 方法:利用 Long-Range Similarity 的残差压缩 + inner-product-preserving 低比特表示
- 评价:向量化量化(VQ)路线,与标量量化(KIVI/KVQuant)形成对比
6. Comparative Characterization of KV Cache Management(arXiv:2604.05012)
- 对比:vLLM / InfiniGen / H2O 在 latency / throughput / memory / request rate / model size 上的实证对比
- 评价:工程选型参考基准,明确"没有万能方案"
技术路线总结: - Token Dropping:KVzip, KVzap, SnapKV, ExpectedAttention - 量化(Scalar):KIVI, KVQuant, RotateKV, SAW-INT4, ARCQuant - 量化(Vector):DeltaKV — 1–3 bit/channel,利用通道间依赖 - 变换编码:KV Cache Transform Coding(ICLR 2026) - 无损化出口:VeriCache 框架
三、RAG 优化技术全景(2026)
12 种 Advanced RAG 技术分级(Atlan 整理)
| 技术 | 类型 | 复杂度 | Benchmark 表现 |
|---|---|---|---|
| Sentence Window Retrieval | 检索粒度 | 低 | ARAGOG 评估第一 |
| CRAG(Corrective RAG) | 自适应 | 中 | 动态纠错 |
| Self-RAG | 自省 | 高 | ICLR 2024 |
| RAPTOR | 树形索引 | 高 | 递归抽象 |
| GraphRAG | 知识图谱 | 高 | 全局摘要优 |
| Adaptive-RAG | 路由 | 中 | NAACL 2024 |
| HyDE | 零样本稠密检索 | 低 | 无标签场景 |
新方向
- A-RAG(arXiv:2602.03442):Agentic RAG,通过分层检索接口扩展
- FG-RAG(AIR 期刊):细粒度语义优化,DDM 细化 prompt + RL 优化 prompt 排序,EM +1.3%, F1 +1.5%
- Hyper-Parameter Optimization for RAG(AAAI 2026 Workshop,arXiv:2505.03452):RAG 超参系统性分析
关键数据:2024 年综合 RAG Benchmark:SOTA RAG 系统仅答对 63% 事实性问题,Naive RAG 仅 44%
四、Vector Database 格局(2026)
pgvector 2026 能力边界
pgvector 0.8.0 关键更新: 1. Iterative Index Scans:修复了带 WHERE 过滤的向量查询 over-filtering 问题(之前版本严重 bug) 2. Parallel HNSW Build:多核并行建索引,速度提升 30–50% 3. halfvec 量化:每维度 2 bytes(减半 4 bytes),3KB vs 6KB/vector(1536 dim)
pgvectorscale(Timescale)基准: | 场景 | pgvectorscale | Pinecone s1 | Qdrant | |------|---------------|-------------|--------| | 50M vectors 99% recall | 471 QPS / p95 28ms | 471 QPS / p95 784ms | 41 QPS | | 内存占用 | 低 | 中 | 中 |
结论: - 5000 万向量以内:pgvector + pgvectorscale 性能追平甚至超越 Pinecone,且有 ACID + SQL 优势 - 亿级以上:Pinecone/Weaviate/Milvus 等专用向量库仍优 - 2026 年趋势:数据库 consolidation,pgvector 扩展替代轻量专用向量库成为主流选择
HNSW 参数调优:m=16, ef_construction=64 平衡之选;m=32 或 ef_construction=128 提升召回但指数级增加构建成本
五、Cloud-Native · eBPF(2026)
四大应用领域
1. Networking(Cilium)
- 替代 iptables,避免规则链爆炸
- 直接在内核处理网络包,Bypass iptables
- AWS EKS 默认 Cilium CNI,Cilium 从 CNCF 毕业
2. Service Mesh(Istio Ambient Mesh)
- 传统 Sidecar:每 Pod ~100MB 额外资源消耗
- Ambient Mesh:eBPF 在节点层拦截流量,无需 Sidecar 注入,保留 mTLS + 流量策略
- 资源消耗大幅降低
3. Security(Falco + Tetragon)
- Tetragon:在内核层实时 kill 进程,无需等待 userspace 响应
- 相比传统 HIDS(如旧版 Falco userspace audit log)可在攻击行为完成前阻断
4. Observability
- Cilium Hubble:零侵入网络可见性
- Pixie:零侵入可观测性
- "Zero-instrumentation observability" 正在成为现实
2026 里程碑:AWS EKS 默认 Cilium CNI、Linux kernel 6.x eBPF 功能稳定化
六、Multi-Agent 系统工程(2026 新研究)
Google Research:Agent Scaling Science(2026-01-28)
论文:Towards a science of scaling agent systems: When and why agent systems work
发现(180 种配置对照实验): - 并行任务:Multi-agent 协调显著提升性能 - 顺序任务:Multi-agent 性能反而下降 - 错误放大: - 独立并行 agents:错误放大 17.2× - 中心化编排(orchestrator):错误放大仅 4.4× - Orchestrator = 验证瓶颈,防止错误级联 - 预测模型:R² = 0.513,用可测量任务属性(工具数量、可分解性)预测最优架构,准确率 87%
Multi-Agent 协调协议
- MCP(Model Context Protocol):标准化 agents 访问外部工具和上下文数据
- A2A(Agent-to-Agent):对等协调、协商和委托协议
主流框架
- Microsoft Magentic One:Orchestrator + Web Surfing / File Surfing / Coder / Terminal 专业化 agents
- arXiv:2601.13671:Orchestration of Multi-Agent Systems,统一架构框架
七、CSDN 高价值文章(本次筛选结果)
注:本次检索未发现符合"版本/环境/命令/源码分析/复现过程/真实排障"标准的高价值 CSDN 文章,暂无入库条目。建议关注方向:vLLM PagedAttention 源码解析、pgvector HNSW 索引调优实操、SGLang RadixAttention 原理拆解——如后续检索到此类内容将单独归档。
分类标签汇总
#llm-inference #vllm #sglang #tensorrt-llm #kv-cache #quantization #fp8 #kv-quantization
#rag #advanced-rag #graphrag #agentic-rag
#vector-database #pgvector #pgvectorscale #hnsw #pinecone
#cloud-native #ebpf #cilium #istio #ambient-mesh #kubernetes
#multi-agent #agentic-systems #mcp #a2a #google-research
#arxiv-2026 #iclr-2026 #naacl-2024 #aaai-2026 #fast-2025
建议写入路径
| 类别 | 建议路径 |
|---|---|
| LLM Inference Engine 格局 | /shared/research-kb/inbox/jay/2026-09-01-llm-inference-engine-2026.md |
| KV Cache 压缩论文合集 | /shared/research-kb/inbox/jay/2026-09-01-kv-cache-compression-2026.md |
| RAG 优化技术全景 | /shared/research-kb/inbox/jay/2026-09-01-rag-optimization-2026.md |
| Vector Database 格局 | /shared/research-kb/inbox/jay/2026-09-01-vector-database-pgvector-2026.md |
| eBPF Cloud-Native | /shared/research-kb/inbox/jay/2026-09-01-ebpf-cloudnative-2026.md |
| Multi-Agent 系统 | /shared/research-kb/inbox/jay/2026-09-01-multi-agent-scaling-2026.md |
精读 / 审稿 / 主题页更新建议
| 优先级 | 动作 | 主题 |
|---|---|---|
| 🔴 高 | 精读 | VeriCache(无损化框架,通用性强) |
| 🔴 高 | 精读 | Google Research Agent Scaling Science(R²=0.513 预测模型) |
| 🔴 高 | 精读 | KV Cache Transform Coding(ICLR 2026 录用) |
| 🟡 中 | 审稿 | SGLang vs vLLM vs TRT-LLM Benchmark(多方数据需交叉验证) |
| 🟡 中 | 审稿 | pgvectorscale 471 QPS 基准(Timescale 官方,需核验测试条件) |
| 🟡 中 | 主题页更新 | LLM Inference Engine 选型指南(2026Q2 数据已大幅更新) |
| 🟢 低 | 观察 | ARCQuant + SAW-INT4(Blackwell 生态,2026H2 影响更大) |
| 🟢 低 | 观察 | A-RAG / FG-RAG(RAG 新架构,稳定性待验证) |
本简报由 Jay 自动生成 · 2026-09-01 晚间检索 · 仅作线索和技术洞察用途,不复制全文