📋 Jay · 知识库简报 · 2026-07-03 上午
本次主题:LLM 推理优化 × 多模态 RAG × 向量数据库选型 × 推理引擎工程实践 检索范围:arXiv / Tavily / Substack / 技术博客 / 工程评测
🗂️ 分类标签
quantization inference-engineering RAG multimodal-RAG vector-database cloud-native backend arXiv-2026
🔬 高价值条目
1. Quantization Survey · JCST 2026 — quantization survey
来源:Journal of Computer Science and Technology (JCST),2026年1月刊 作者:Chen YD, Zheng KJ, Guo ZH et al. 核心观点:系统性综述 LLM 量化技术演进,覆盖预训练阶段到推理阶段的全链路量化方法,聚焦硬件效率与精度损失的权衡。 可信度:⭐⭐⭐⭐⭐ 高——JCST 为 CCF-B 期刊,同行评审 后续行动:可精读,特别关注 post-training quantization 与训练阶段量化的边界条件分析
2. LLM Compression: Joint Architectural + Quantization Co-design · arXiv:2606.04063 — quantization architecture arXiv
来源:arXiv,2026年6月提交 核心观点:将模型架构搜索与量化选择联合优化的新范式,突破传统"先训练后量化"两阶段做法的局限。 可信度:⭐⭐⭐⭐ 新鲜 arXiv preprint,需核验代码 后续行动:关注 GitHub 是否有配套代码仓库;精读价值高
3. ITQ3_S: High-Fidelity 3-bit LLM Inference · arXiv:2603.27914 — quantization 3bit arXiv
来源:arXiv,2026年3月 核心观点:通过交错三元量化 + 旋转域平滑实现 3-bit 高保真推理,突破极低比特量化精度瓶颈。 可信度:⭐⭐⭐⭐ arXiv peer review 后续行动:值得关注,若代码开源可纳入复现清单
4. Muon-Optimized Distillation + Quantization · arXiv:2601.09865 — quantization distillation arXiv
来源:arXiv,2026年1月 核心观点:Muon 优化器结合蒸馏与量化,用于 LLM 高效部署。 可信度:⭐⭐⭐ 新鲜 arXiv 后续行动:代码是否开源待查
5. PLENA: Long-Context Agentic LLM Inference Co-design · arXiv:2509.09505 — inference long-context KV-cache arXiv
来源:arXiv 核心观点:post-training quantization 纳入优化循环,联合搜索硬件配置与量化参数(datatype/precision of activations and KV cache)。使用 Roofline 模型评估精度、延迟与面积。 可信度:⭐⭐⭐⭐ 系统性 co-design 方法,工程价值高 后续行动:精读 Algorithm 1 PLENA 量化流程;关注与 vLLM/SGLang 的集成可行性
6. Energy-to-Token: LLM Inference Evaluation Framework · arXiv:2605.11733 — inference evaluation economics arXiv
来源:arXiv,2026年5月 核心观点:提出以"能量→Token 产出"评估 LLM 推理,而非传统延迟/吞吐指标。包含 2026 年主流模型(DeepSeek-V4-Pro、Kimi K2.6、GPT-5.5 等)API 价格对比。 可信度:⭐⭐⭐⭐⭐ 跨供应商成本分析详尽,数据来源可查 后续行动:适合纳入主题页"LLM 推理经济学";高价值精读
7. MegaRAG: Multimodal KG-Based RAG · arXiv:2512.20626 — RAG multimodal knowledge-graph ACL-2026
来源:arXiv,ACL 2026 投稿 核心观点:基于多模态知识图谱的 RAG,超越纯文本向量检索的语义关联能力。 可信度:⭐⭐⭐⭐ ACL 2026 peer review 后续行动:关注 ACL 2026 录用结果;精读知识图谱构建方法
8. MG²-RAG: Multi-Granularity Graph RAG · arXiv:2604.04969 — RAG multimodal graph arXiv
来源:arXiv 核心观点:多粒度图结构增强多模态 RAG 检索质量。 可信度:⭐⭐⭐ 后续行动:与 MegaRAG 对比阅读
9. Uncertainty Quantification for Multimodal RAG · arXiv:2605.29956 — RAG multimodal uncertainty arXiv
来源:arXiv,2026年5月 核心观点:多模态 RAG 中置信度校准问题——检索到的视觉信息会虚假提升模型置信度但不反映正确性。 可信度:⭐⭐⭐⭐⭐ 高——RAG 系统安全性相关,工程意义强 后续行动:高优先级精读;可纳入 RAG 安全主题页
10. A Survey of Multimodal RAG · arXiv:2510.15253 — RAG multimodal survey arXiv
来源:arXiv,2025年10月(2026年持续更新) 核心观点:全面综述多模态 RAG 现状,涵盖答案质量、faithfulness、可解释性与成本联合评估框架。 可信度:⭐⭐⭐⭐⭐ 高质量综述 后续行动:精读;作为 RAG 主题页的结构性参考
11. 20 Advanced RAG Types in 2026 · TuringPost — RAG agentic multimodal survey
来源:TuringPost newsletter 核心观点:2026 年 Advanced RAG 全景图,覆盖 MiA-RAG、HGMem、MegaRAG、Disco-RAG(长文档/记忆);A-RAG、HiFi-RAG(Agentic RAG);MG²-RAG、TV-RAG(多模态);并提出 agent-based RAG 的可靠性评估框架。 可信度:⭐⭐⭐⭐ 行业洞察性综述,引用来源丰富 后续行动:作为 RAG 2026 主题页的导航图;精读分类体系
12. mKG-RAG: Multimodal KG + VQA · arXiv:2508.05318 — RAG multimodal VQA SIGIR-2026
来源:arXiv,SIGIR 2026 投稿 核心观点:多模态知识图谱用于知识密集型视觉问答检索。 可信度:⭐⭐⭐⭐ SIGIR 2026 后续行动:关注 SIGIR 2026 录用
⚙️ 推理引擎工程实践
13. vLLM vs TensorRT-LLM vs SGLang H100 Benchmarks 2026 · Spheron — inference-engineering benchmark vLLM TensorRT-LLM SGLang
核心数据(H100,实测): - 吞吐:TensorRT-LLM 领先,50并发时比 vLLM 快 ~13%;SGLang 居中 - TTFT:SGLang(prefix caching 场景)最优 - VRAM:SGLang 最省(peak load),三者差距 < 4GB - 冷启动:vLLM ~62s,SGLang ~58s,TensorRT-LLM ~28分钟(编译) - 建议:先上 vLLM;模型稳定且跑数月的高QPS场景切换 TensorRT-LLM;prefix-heavy 场景选 SGLang
可信度:⭐⭐⭐⭐⭐ 详细实测数据,工程参考价值高 后续行动:纳入推理引擎选型主题页;建议精读完整 benchmark
14. vLLM vs TensorRT-LLM Production Decision Guide · Yotta Labs — inference-engineering vLLM TensorRT-LLM
核心观点: - TensorRT-LLM 适合:模型不变、高流量、需压榨每 token/s 的稳定生产环境 - vLLM 适合:快速迭代、模型频繁更新、工程资源有限团队 - 混合策略:长尾模型用 vLLM,1-2个核心高流量模型用 TRT-LLM - SGLang:TTFT 对共享前缀场景有优势(RadixAttention/prefix caching)
可信度:⭐⭐⭐⭐⭐ 决策框架清晰,量化指标丰富 后续行动:纳入推理工程最佳实践;适合作为团队内部分享引用
15. TensorRT-LLM vs vLLM Deep Dive · Introl Blog — inference-engineering TensorRT-LLM quantization
核心数据: - Llama 70B @ A100:TensorRT-LLM ~700 tokens/s vs vLLM ~600-650 tokens/s - 短序列 TPOT 优势:1.34x;长序列 TPOT 优势:2.72x - FP8 量化:最佳精度/性能比(Hopper/Blackwell);INT8 SmoothQuant(Ada 回退);INT4 AWQ(小 batch 内存受限场景) - 70B FP8 VRAM 估算:weights 70GB + KV cache ~120GB + overhead ~30GB ≈ 220GB → 需 3× H100 80GB 或 2× H200 141GB
可信度:⭐⭐⭐⭐⭐ NVIDIA 生态深度分析,工程决策必备 后续行动:精读;纳入推理引擎成本建模参考
16. Best LLM Inference Engines 2026 · Yotta Labs — inference-engineering TGI SGLang
核心框架对比: | 框架 | 核心优势 | 量化格式支持 | |------|---------|------------| | vLLM | GPU 利用率、并发管理 | GPTQ/AWQ/SqueezeLLM/bitsandbytes | | TensorRT-LLM | 硬件级优化、内核融合 | FP8/INT8(编译时绑定) | | TGI | HuggingFace 生态集成 | 广泛 | | SGLang | RadixAttention、前缀复用、灵活执行 | 与 vLLM 相近 |
可信度:⭐⭐⭐⭐ 后续行动:纳入推理引擎选型对比表
🗄️ 向量数据库 / Cloud-Native
17. Best Open Source Vector DBs 2026 · Redis Blog — vector-database cloud-native
选型指南: - Milvus:K8s 友好、百亿级向量、分布式;组件多、运维复杂,<10M 向量时杀鸡用牛刀 - Qdrant:Rust 实现、过滤能力强、延迟低;成熟生产级 - pgvector:已在用 PostgreSQL 时首选,~数千万向量够用,技能复用好 - Chroma:原型快速验证;生产级功能在发展中 - Vald:云原生 NGT 算法、超十亿向量、自动复制自愈、K8s 原生 - Weaviate:多模态(文本/图片)内置 embedding、云原生
可信度:⭐⭐⭐⭐ 后续行动:纳入向量数据库选型主题页
18. Vector DB Market 2026 · Research & Markets — vector-database market cloud-native
核心数据: - 2026 年全球向量数据库市场规模:USD 10-40 亿 - 北美主导,年增长率 11%-32.5% - 云超大规模厂商(AWS/GCP/Azure/Alibaba)纷纷以内置服务入场 - 托管服务 vs 自部署:受监管行业(EU AI Act)倾向 on-premises/souverain
可信度:⭐⭐⭐ 商业报告,提供市场全景 后续行动:市场背景数据,供战略参考
19. On-Device Vector DBs 2026 · ObjectBox — vector-database edge cloud-native
核心洞察:本地向量数据库从"有趣想法"变为隐私/离线/低延迟场景的必需品。挑战不仅是 ANN 搜索算法,更是持久化、增量更新、选择性同步、存储占用的系统工程。 可信度:⭐⭐⭐⭐ 边缘 AI 场景洞察 后续行动:关注移动端/IoT + AI 交叉场景
20. Probabilistic Consensus (vs Threshold-based) · arXiv:2602.11362 — distributed-systems consensus arXiv
来源:arXiv,2026年2月 核心观点:传统拜占庭容错以 f-threshold 建模过于简化现实,建议用概率故障模型替代,可探索绕过 majority quorum intersection 传统瓶颈的路径,实现更可靠、高效、低成本、可持续的系统。 可信度:⭐⭐⭐⭐⭐ 高创新性观点,对 Raft/Paxos 生产实践有启发 后续行动:精读;与分布式系统主题页关联;关注是否有实际系统实现
21. Post-Deterministic Distributed Systems · arXiv:2606.01722 — distributed-systems consensus arXiv
来源:arXiv,2026年6月 核心观点:传统 SMR(状态机复制)以确定性行为为前提;PDDS 探讨非确定性参与者的分布式系统新范式,涉及 epistemic state replication(认知状态复制)与 agent memory consistency。 可信度:⭐⭐⭐⭐ 理论创新,open research agenda 后续行动:关注后续工作;适合作为分布式 AI 系统交叉研究方向
🔖 主题分类索引
| 类别 | 条目编号 |
|---|---|
| database | 17, 18, 19, 20, 21 |
| backend | 20, 21 |
| cloud-native | 17, 18, 19 |
| inference-engineering | 1, 2, 3, 4, 5, 6, 13, 14, 15, 16 |
| RAG | 7, 8, 9, 10, 11, 12 |
| quantization | 1, 2, 3, 4, 5, 15 |
| csdn | 本次无高价值 CSDN 条目(注:工程筛选侧重 vLLM/SGLang 深度博文,参考 Yotta Labs/Spheron 等技术媒体) |
| reproduction | 2, 3, 4(arXiv 代码待核验);6(API 价格数据可复现);13/14/15(benchmark 数据可验证) |
✅ 建议写入路径
主草稿:/shared/research-kb/inbox/jay/2026-07-03-1105-briefing-quantization-rag-vecdb-inference.md
关联草稿(可合并或补充更新):
- 2026-07-03-1105-briefing-quantization-rag-vecdb-inference.md ← 本次主文件
- 2026-07-03-database-backend-cloudnative-engineering.md ← 已有,可对比去重
- 2026-07-03-morning-briefing-mcsearch-stack2026-rag-eval-hf.md ← 已有,可对比
📌 后续行动建议
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 精读 | Energy-to-Token 推理评估框架 | #6 |
| 🔴 精读 | Multimodal RAG 不确定性/置信度校准 | #9 |
| 🟠 精读 | 20 Advanced RAG Types 2026 分类体系 | #11 |
| 🟠 精读 | H100 Benchmark vLLM vs TRT-LLM vs SGLang | #13 |
| 🟡 主题页更新 | 推理引擎选型决策框架(融合 #13-#16) | 主题页 |
| 🟡 主题页更新 | RAG 2026 技术全景图(融合 #7-#12) | 主题页 |
| 🟡 关注 | PLENA Long-Context Inference Co-design | #5 |
| 🟢 核验代码 | arXiv:2606.04063 联合优化(#2)、ITQ3_S 3-bit(#3) | GitHub |
Jay · 2026-07-03 11:05 CST · /shared/research-kb/inbox/jay/