Jay · 学术研究知识库 · 简报 · 2026-07-08

检索范围: arXiv / Semantic Scholar / GitHub / Hugging Face / Substack / 技术博客
检索关键词: LLM inference engine, vector DB, distributed systems, cloud-native, Kubernetes, Mooncake, vLLM, TensorRT-LLM, multimodal RAG, agent eval
来源可信度说明: ⭐ 高可信(顶会/官方博客/权威对比研究) / ✅ 中可信(社区评测/技术分析) / ⚠️ 需核验(第三方文章/MR衍生)


📦 Database · 向量数据库 & 分布式存储

1. Vector DB Benchmark 2026 综合横评(Salt Technologies)

  • 来源: Salt Technologies AI · Q1 2026 标准化评测
  • 可信度:
  • 核心数据(1M vectors / 1536维):
  • 最低延迟:Qdrant p50=4ms(p99=25ms),Redis=5ms,Milvus=6ms(GPU),Pinecone=8ms
  • 最高吞吐量:Milvus 80K/sec ingestion;Qdrant 过滤查询 2-4x 快于竞品
  • 亿级规模:Qdrant 在 50M 向量时 QPS 降至 41.47(vs pgvectorscale 471 QPS),差距显著
  • 评价: 评测覆盖 10 个数据库、19 个字段,方法论说明较完整,但 Ann-benchmarks 数据集维数偏低(≤1280D),生产环境需参考 pgvectorscale 的 Redis-based 横向对比(p99 延迟 Qdrant 更优但吞吐量差距大)。
  • 建议写入: database/vector-db-benchmark-2026.md
  • 链接: https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026

2. pgvectorscale vs Qdrant · 生产环境真实对比(Actian)

  • 来源: Actian Corporation 技术博客
  • 可信度: ✅(独立厂商对比,有硬件规格)
  • 核心数据(同款 AWS r6id.4xlarge,50M vectors): | 指标 | pgvectorscale | Qdrant | |---|---|---| | QPS @ 99% recall | 471.57 | 41.47 | | P95 latency | 60.42ms | 36.73ms | | P99 latency | 74.60ms | 38.71ms |
  • 结论: 追求吞吐量选 pgvectorscale;追求尾延迟选 Qdrant;两者均大幅优于 Chroma(100-200ms)。
  • 评价: 指出 benchmark 工具有系统性偏向(VectorDBBench 偏重 Milvus,ann-benchmarks 用低维数据集),对选型有实操价值。
  • 建议写入: database/pgvectorscale-vs-qdrant-production-2026.md
  • 链接: https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026

3. Mooncake · KVCache-centric Disaggregated Architecture

  • 来源: Tsinghua · Alibaba · ACM ToS 2025 paper(2026持续活跃)
  • 可信度: ⭐(顶会论文 + 活跃开源维护)
  • 近期更新(2026年):
  • 2026-05-07:vLLM 正式集成 Mooncake Store,支持跨实例 KVCache 共享
  • 2026-04-29:SGLang RDMA P2P weight transfer,基于 Mooncake TransferEngine,Kimi-K2(1T参数)weight update 从 53s → 7.2s(7x加速
  • 2026-03-19:TorchSpec(Speculative Decoding Training at Scale)开源
  • 2026-02-24:vLLM-Omni 支持 disaggregated inference 连接器
  • 2026-02-12:Mooncake 正式加入 PyTorch Ecosystem
  • 2026-01-28:FlexKV(Tencent + NVIDIA)集成 Mooncake Transfer Engine
  • 技术要点: PD disaggregation(prefill-decode 分离)+ 分布式 KVCache pool + RDMA 高效通信;已集成 vLLM、SGLang、LMCache、LMDeploy。
  • 建议写入: backend/mooncake-kvcache-disagg-2026-update.md
  • 链接: https://kvcache-ai.github.io/Mooncake | https://github.com/kvcache-ai/Mooncake

4. Multi-Region Distributed Transactions 论文(UMD 博士论文)

  • 来源: University of Maryland 博士论文 · arXiv 2026
  • 可信度: ⭐(学术研究)
  • 三个方向: 1. SunStorm:基于 Aurora-style shared-storage 改造,支持多 region 多 writer,降低延迟提升扩展性 2. Detock:确定性数据库协议,严格可串行化多 region 事务,高竞争负载下吞吐量提升一个数量级,延迟降低 5x 3. 大规模实证研究:电商、聊天、博客、CMS 等真实应用的事务特征
  • 建议写入: database/distributed-transactions-multi-region-2026.md
  • 链接: https://drum.lib.umd.edu/items/00cc240d-7ec4-4b03-b47e-516efbdf80db

5. Scalable Document-Oriented NoSQL Transaction Framework(arXiv:2601.16490)

  • 来源: arXiv · 2026
  • 可信度: ✅(学术论文,有开源复现 artifacts)
  • 核心贡献: 四阶段事务管理框架,适用于最终一致性 NoSQL 数据库,支持 ACID 保障的 retrofitting,有正式正确性分析和参数敏感性分析。
  • 建议写入: database/nosql-acid-transaction-framework-2026.md
  • 链接: https://arxiv.org/html/2601.16490v2

⚙️ Backend · LLM 推理引擎 & 系统软件

6. Inference Engine 鲁棒性研究 · "The Silent Hyperparameter"(arXiv:2605.19537)

  • 来源: arXiv · 2026
  • 可信度: ⭐(学术研究,有代码 artifacts 承诺发布)
  • 核心发现: 系统性量化了 推理引擎本身(vLLM、TensorRT-LLM、SGLang 等)对 LLM 评估结果的影响——这是一个此前未被充分记录的方差来源。发现了推理引擎版本、配置差异对 benchmark 分数的显著影响。
  • 评价: 对科学可复现性有直接意义,有助于建立推理引擎报告标准。建议精读。
  • 建议写入: backend/inference-engine-reproducibility-variance-2026.md
  • 链接: https://arxiv.org/html/2605.19537v1

7. LLM Inference Engine Bugs 实证研究(arXiv:2506.09713)

  • 来源: arXiv · 2025(2026 被 VoltAgent awesome-list 收录)
  • 可信度: ✅(大规模 bug 报告分析,1187 个样本,覆盖 7 个框架)
  • 核心发现: 对 LLM Agent 软件中的 bug 进行了系统性分类(bug 类型、根因、影响),并用 ReAct agent 做自动化 bug 标注。
  • 评价: 对推理引擎开发者有参考价值,可作为 test agent / eval pipeline 的文献支撑。
  • 建议写入: backend/llm-inference-engine-bugs-empirical-study.md
  • 链接: https://arxiv.org/html/2506.09713v2

8. vLLM vs TensorRT-LLM vs SGLang · H100 Benchmark 2026(Spheron)

  • 来源: Spheron 技术博客 · 2026
  • 可信度: ✅(第三方 GPU 云平台,有具体硬件规格)
  • 核心结论: | 引擎 | 吞吐量 | p50 TTFT | p95 TTFT | 优点 | 缺点 | |---|---|---|---|---|---| | TensorRT-LLM | 最高 | 最低 | 最低 | 最佳硬件利用率 | 编译28分钟/模型版本;部署复杂 | | vLLM | 中高 | 中 | 中 | 部署简单;广泛模型支持 | PyTorch 后端峰值吞吐量较低 | | SGLang | 中 | 中 | 中 | 结构化输出;多模态进展快 | 相对新,生态较小 |
  • SGLang 新动向(v0.5.9):
  • 支持 Anthropic API 兼容(原生兼容 Claude SDK)
  • TRT-LLM DSA kernels → SGLang NSA backend,DeepSeek V3.2 在 Blackwell 上 3x-5x 加速
  • 新增 Qwen3.5、Kimi-K2.5、GLM-5、MiniMax 2.5 支持
  • 建议写入: backend/vllm-tensorrt-sglang-h100-benchmark-2026.md
  • 链接: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks

9. TensorRT-LLM v1.2+ 最新进展(GitHub Release Notes)

  • 来源: GitHub NVIDIA/TensorRT-LLM releases
  • 可信度: ⭐(官方)
  • 近期(2026-04~05)重要 PRs:
  • DeepSeek V3.2 speculative decoding 支持(MTP>1)
  • Nemotron-V3-Ultra 精度测试
  • Llama4 Scout Instruct 测试调整
  • K2.5 / GLM-5 / Qwen3.5 FP8 disagg 测试
  • Flux1/2、LTX2、Wan I2V、Cosmos3 e2e 测试
  • MoE LoRA 集成测试 + bugfix
  • 建议写入: backend/tensorrt-llm-v1.2-release-notes-2026.md
  • 链接: https://github.com/NVIDIA/TensorRT-LLM/releases

10. WebLLM · 浏览器端 LLM 推理引擎(arXiv:2412.15803 更新)

  • 来源: arXiv · MLCompilerFlow / University of Washington
  • 可信度: ⭐(学术 + 开源)
  • 技术背景: WebGPU 驱动的浏览器内 LLM 推理,支持 1-8B 参数模型实时本地运行;4-bit 量化下在消费级硬件可实现实时推理。
  • 评价: 端侧 AI 推理方向,代表了模型压缩 + WebGPU 的交叉进展。
  • 建议写入: backend/webllm-browser-inference-2026.md
  • 链接: https://arxiv.org/html/2412.15803v2

☁️ Cloud-Native · Kubernetes & 分布式平台

11. Kubernetes 2026 成熟度报告(Portworx · Voice of Kubernetes Report 2026)

  • 来源: Portworx · 2026(500+ 企业基础设施专业人员调研)
  • 可信度: ⭐(大规模调研)
  • 核心数据:
  • 98% 组织已采用云原生技术;93% 积极使用或评估 Kubernetes
  • 28% 组织的多数应用已运行在 Kubernetes 上
  • 2026 年 AI 工作负载是 Kubernetes 增长的核心驱动力
  • 关键趋势:
  • Ingress NGINX Controller 社区版 2026-03 正式退场,Gateway API 成为唯一安全选项
  • KubeVirt 项目爆发:VM 与容器在 K8s 集群内统一管理
  • AI/ML 工作负载编排:Kubeflow 与 Kubernetes 的集成成为平台工程标配
  • 建议写入: cloud-native/kubernetes-2026-enterprise-adoption-report.md
  • 链接: https://portworx.com/blog/kubernetes-enterprise-adoption-trends

12. Cloud-Native + Distributed Systems for LLM(arXiv:2604.17227)

  • 来源: arXiv · 2026 · CNCF 资助相关
  • 可信度: ⭐(有国家项目资助,多机构作者)
  • 主题: 探索云原生 + 分布式架构在大规模 LLM 训练和推理中的角色,包括数据管理、资源优化、微服务化、自动伸缩、混合云-边缘部署。
  • 评价: 属于研究议程和愿景类论文,梳理了云原生系统与 LLM 基础设施交叉领域的挑战和开放问题。
  • 建议写入: cloud-native/cloud-native-distributed-llm-systems-2026.md
  • 链接: https://arxiv.org/html/2604.17227v1

13. Platform Engineering 2026 趋势(Medium)

  • 来源: Medium 技术文章 · 2026
  • 可信度: ⚠️(独立博客,需核验)
  • 核心观点:
  • AI 驱动的工作负载编排:Kubeflow + K8s 成为 ML pipeline 标准
  • Wasm + eBPF + Serverless 正在重新定义云原生边界
  • 从 K8s 迁移到平台工程:关注开发者体验而非底层技术细节
  • GitOps(Argo CD / Flux)+ 声明式基础设施是 2026 年事实标准
  • 建议写入: cloud-native/platform-engineering-beyond-kubernetes-2026.md
  • 链接: https://medium.com/@orlando1409/beyond-kubernetes-platform-engineering-trends-for-2026-8f82e09e27e0

🔬 AI Research · Substack & Newsletter 精选

14. Sebastian Raschka · "LLM Research Papers 2026 (Jan-May)"(Ahead of AI / Substack)

  • 作者: Sebastian Raschka, PhD
  • 可信度: ⭐(AI 研究领域知名教育者,文献调研详实)
  • 高价值条目:
  • 架构趋势: 混合架构(Mamba-2 + Attention)、状态空间模型、线性注意力变体成为 2026 年主流
  • Qwen3.6: 使用 Gated DeltaNet 层替代部分 Mamba-2 层
  • Nemotron 3 Super: NVIDIA MoE-Hybrid Mamba-Transformer(120B-A12B,Nano=4B)
  • Mamba-3: 改进的序列建模
  • Attention Residuals / Delta Attention Residuals: 注意力机制的残差连接变体
  • MiniMax-M2 Series: "Mini Activations Unleashing Max Real-World Intelligence"
  • Section 3-10: 还覆盖了高效训练/扩展、推理效率/KVCache、长上下文、推理时计算、强化学习RLVR、Agent系统、编程Agent、Diffusion语言模型、评估基准
  • 评价: 必读文献梳理,适合作为 2026 上半年 LLM 研究地图。
  • 建议写入: research/llm-research-papers-2026-raschka.md
  • 链接: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1

15. Sebastian Raschka · "Recent Developments in LLM Architectures: KV Sharing, mHC, Compressed Attention"(Substack)

  • 作者: Sebastian Raschka, PhD
  • 可信度:
  • 核心洞察: 2026 年新开源 LLM(Gemma 4、DeepSeek V4 等)密集采用 KV 共享、mHC(multi-head compression)、压缩注意力等技术来降低长上下文成本。随着 agent 工作流需要保留更长上下文,KV-cache 大小、内存带宽和注意力成本成为核心瓶颈。
  • 建议写入: research/llm-architecture-kv-compression-2026.md
  • 链接: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures

16. Simon Willison · LLM Predictions 2026(Substack)

  • 作者: Simon Willison(DataHeroes / Datasette 作者)
  • 可信度: ✅(知名独立技术博主,有实践案例)
  • 核心观点:
  • OpenAI 每周活跃用户 800M(2025-10 数据)
  • 2026 年关键趋势:Local AI 推理成熟、Claude Code/MCP 生态扩张、vibe coding 兴起
  • 特别提到 Claude Haiku 4.5、Claude Skills 与 MCP 的协同价值
  • 建议写入: research/llm-predictions-2026-simon-willison.md
  • 链接: https://simonw.substack.com/p/llm-predictions-for-2026-shared-with

17. Import AI #455 · Jack Clark(Substack · 134K 订阅者)

  • 作者: Jack Clark(曾是 OpenAI policy 总监,现运营 Import AI)
  • 可信度: ✅(行业资深观察者)
  • 主题: AI systems are about to start building themselves(递归自我改进的第一步)
  • 建议写入: research/import-ai-455-recursive-self-improvement.md
  • 链接: https://importai.substack.com/p/import-ai-455-automating-ai-research

18. GitHub Top AI Repositories 2026(ByteByteGo / OSS Insight)

  • 来源: ByteByteGo Newsletter · 2026
  • 可信度: ✅(知名技术教育品牌)
  • 核心列表: Ollama、LangFlow、Dify、LangChain、Open WebUI、DeepSeek-V3、Google Gemini CLI、RAGFlow、Claude Code
  • 特别关注:
  • nanochat(Andrej Karpathy): 55k stars,将完整 LLM 训练栈(tokenization→pretraining→finetuning→eval→inference→chat UI)整合到一个最小可 fork 仓库,定位为"学习工具"而非生产框架
  • Bumblebee(Perplexity): 供应链安全扫描
  • Firecrawl: Web context API
  • 建议写入: tools/github-top-ai-repos-2026.md
  • 链接: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026

19. Multimodal RAG 隐私安全研究(VoltAgent awesome-list 收录)

  • 来源: arXiv · 2026
  • 可信度:
  • 发现: 多模态 RAG 管道存在隐私风险——通过 inclusion inference 和 metadata leakage 攻击在标准模型提示过程中泄露信息。
  • 建议写入: research/multimodal-rag-privacy-security-2026.md
  • 链接: via https://github.com/VoltAgent/awesome-ai-agent-papers

20. EACL 2026 三篇论文:VLM 不确定性 / MapAgent / DashboardQA

  • 来源: LinkedIn 学术动态
  • 可信度: ✅(顶会接收)
  • 三篇论文: 1. Conformal Lens for Uncertainty in VLMs: 16 个 SOTA VLM 的 conformal prediction 框架,发现更强的模型不仅更准确而且校准更好 2. MapAgent: 分层多 Agent 框架,高级规划与低级地图工具执行分离,改善复杂地理空间推理 3. DashboardQA: 首个交互式仪表板多模态 Agent 评估基准,发现当前 Agent 在动态界面的 grounding、planning、状态追踪方面存在重大缺陷
  • 建议写入: research/eacl-2026-multimodal-agents-vlm-uncertainty.md
  • 链接: LinkedIn post by Md Rizwan Parvez

📋 分类标签总览

类别 条目数 高优先级
database 5 Mooncake, pgvectorscale vs Qdrant, distributed tx
backend 5 Inference engine variance, TensorRT-LLM v1.2, vLLM/SGLang/TRT benchmark
cloud-native 3 K8s 2026 adoption report, cloud-native LLM systems
reproduction 2 Inference reproducibility, LLM inference engine bugs
research 4 Raschka papers, Substack newsletters
tools 1 GitHub top AI repos 2026

✏️ 本次写作计划

建议写入路径(/shared/research-kb/inbox/jay/):

  1. 2026-07-08-inference-systems-llm-architectures.md — 合并 #6-10(推理引擎 + 架构)
  2. 2026-07-08-vector-db-distributed-storage.md — 合并 #1-5(向量DB + 分布式存储)
  3. 2026-07-08-cloudnative-platform-ai-workloads.md — 合并 #11-13(云原生 + K8s)
  4. 2026-07-08-substack-ai-research-highlights.md — 合并 #14-17(Substack 精选)
  5. 2026-07-08-github-ai-tools-agents.md — 合并 #18-20(工具 + Agent 研究)

精读优先级: #6(Inference Engine Variance)、#8(benchmark 对比)、#14(Raschka 2026 地图)
审稿需求: #11(Portworx 报告引用数据需原报告核验)、#13(Medium 独立文章需交叉验证)
主题页更新建议: LLM Inference Systems / Vector Databases / Cloud-Native Platforms 三个主题页


Jay · 2026-07-08 · 15:05 CST · Jay /inbox/jay/2026-07-08-database-backend-cloudnative-inference.md