Jay · 学术研究知识库 · 简报 · 2026-07-08
检索范围: arXiv / Semantic Scholar / GitHub / Hugging Face / Substack / 技术博客
检索关键词: LLM inference engine, vector DB, distributed systems, cloud-native, Kubernetes, Mooncake, vLLM, TensorRT-LLM, multimodal RAG, agent eval
来源可信度说明: ⭐ 高可信(顶会/官方博客/权威对比研究) / ✅ 中可信(社区评测/技术分析) / ⚠️ 需核验(第三方文章/MR衍生)
📦 Database · 向量数据库 & 分布式存储
1. Vector DB Benchmark 2026 综合横评(Salt Technologies)
- 来源: Salt Technologies AI · Q1 2026 标准化评测
- 可信度: ⭐
- 核心数据(1M vectors / 1536维):
- 最低延迟:Qdrant p50=4ms(p99=25ms),Redis=5ms,Milvus=6ms(GPU),Pinecone=8ms
- 最高吞吐量:Milvus 80K/sec ingestion;Qdrant 过滤查询 2-4x 快于竞品
- 亿级规模:Qdrant 在 50M 向量时 QPS 降至 41.47(vs pgvectorscale 471 QPS),差距显著
- 评价: 评测覆盖 10 个数据库、19 个字段,方法论说明较完整,但 Ann-benchmarks 数据集维数偏低(≤1280D),生产环境需参考 pgvectorscale 的 Redis-based 横向对比(p99 延迟 Qdrant 更优但吞吐量差距大)。
- 建议写入:
database/vector-db-benchmark-2026.md - 链接: https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026
2. pgvectorscale vs Qdrant · 生产环境真实对比(Actian)
- 来源: Actian Corporation 技术博客
- 可信度: ✅(独立厂商对比,有硬件规格)
- 核心数据(同款 AWS r6id.4xlarge,50M vectors): | 指标 | pgvectorscale | Qdrant | |---|---|---| | QPS @ 99% recall | 471.57 | 41.47 | | P95 latency | 60.42ms | 36.73ms | | P99 latency | 74.60ms | 38.71ms |
- 结论: 追求吞吐量选 pgvectorscale;追求尾延迟选 Qdrant;两者均大幅优于 Chroma(100-200ms)。
- 评价: 指出 benchmark 工具有系统性偏向(VectorDBBench 偏重 Milvus,ann-benchmarks 用低维数据集),对选型有实操价值。
- 建议写入:
database/pgvectorscale-vs-qdrant-production-2026.md - 链接: https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026
3. Mooncake · KVCache-centric Disaggregated Architecture
- 来源: Tsinghua · Alibaba · ACM ToS 2025 paper(2026持续活跃)
- 可信度: ⭐(顶会论文 + 活跃开源维护)
- 近期更新(2026年):
- 2026-05-07:vLLM 正式集成 Mooncake Store,支持跨实例 KVCache 共享
- 2026-04-29:SGLang RDMA P2P weight transfer,基于 Mooncake TransferEngine,Kimi-K2(1T参数)weight update 从 53s → 7.2s(7x加速)
- 2026-03-19:TorchSpec(Speculative Decoding Training at Scale)开源
- 2026-02-24:vLLM-Omni 支持 disaggregated inference 连接器
- 2026-02-12:Mooncake 正式加入 PyTorch Ecosystem
- 2026-01-28:FlexKV(Tencent + NVIDIA)集成 Mooncake Transfer Engine
- 技术要点: PD disaggregation(prefill-decode 分离)+ 分布式 KVCache pool + RDMA 高效通信;已集成 vLLM、SGLang、LMCache、LMDeploy。
- 建议写入:
backend/mooncake-kvcache-disagg-2026-update.md - 链接: https://kvcache-ai.github.io/Mooncake | https://github.com/kvcache-ai/Mooncake
4. Multi-Region Distributed Transactions 论文(UMD 博士论文)
- 来源: University of Maryland 博士论文 · arXiv 2026
- 可信度: ⭐(学术研究)
- 三个方向: 1. SunStorm:基于 Aurora-style shared-storage 改造,支持多 region 多 writer,降低延迟提升扩展性 2. Detock:确定性数据库协议,严格可串行化多 region 事务,高竞争负载下吞吐量提升一个数量级,延迟降低 5x 3. 大规模实证研究:电商、聊天、博客、CMS 等真实应用的事务特征
- 建议写入:
database/distributed-transactions-multi-region-2026.md - 链接: https://drum.lib.umd.edu/items/00cc240d-7ec4-4b03-b47e-516efbdf80db
5. Scalable Document-Oriented NoSQL Transaction Framework(arXiv:2601.16490)
- 来源: arXiv · 2026
- 可信度: ✅(学术论文,有开源复现 artifacts)
- 核心贡献: 四阶段事务管理框架,适用于最终一致性 NoSQL 数据库,支持 ACID 保障的 retrofitting,有正式正确性分析和参数敏感性分析。
- 建议写入:
database/nosql-acid-transaction-framework-2026.md - 链接: https://arxiv.org/html/2601.16490v2
⚙️ Backend · LLM 推理引擎 & 系统软件
6. Inference Engine 鲁棒性研究 · "The Silent Hyperparameter"(arXiv:2605.19537)
- 来源: arXiv · 2026
- 可信度: ⭐(学术研究,有代码 artifacts 承诺发布)
- 核心发现: 系统性量化了 推理引擎本身(vLLM、TensorRT-LLM、SGLang 等)对 LLM 评估结果的影响——这是一个此前未被充分记录的方差来源。发现了推理引擎版本、配置差异对 benchmark 分数的显著影响。
- 评价: 对科学可复现性有直接意义,有助于建立推理引擎报告标准。建议精读。
- 建议写入:
backend/inference-engine-reproducibility-variance-2026.md - 链接: https://arxiv.org/html/2605.19537v1
7. LLM Inference Engine Bugs 实证研究(arXiv:2506.09713)
- 来源: arXiv · 2025(2026 被 VoltAgent awesome-list 收录)
- 可信度: ✅(大规模 bug 报告分析,1187 个样本,覆盖 7 个框架)
- 核心发现: 对 LLM Agent 软件中的 bug 进行了系统性分类(bug 类型、根因、影响),并用 ReAct agent 做自动化 bug 标注。
- 评价: 对推理引擎开发者有参考价值,可作为 test agent / eval pipeline 的文献支撑。
- 建议写入:
backend/llm-inference-engine-bugs-empirical-study.md - 链接: https://arxiv.org/html/2506.09713v2
8. vLLM vs TensorRT-LLM vs SGLang · H100 Benchmark 2026(Spheron)
- 来源: Spheron 技术博客 · 2026
- 可信度: ✅(第三方 GPU 云平台,有具体硬件规格)
- 核心结论: | 引擎 | 吞吐量 | p50 TTFT | p95 TTFT | 优点 | 缺点 | |---|---|---|---|---|---| | TensorRT-LLM | 最高 | 最低 | 最低 | 最佳硬件利用率 | 编译28分钟/模型版本;部署复杂 | | vLLM | 中高 | 中 | 中 | 部署简单;广泛模型支持 | PyTorch 后端峰值吞吐量较低 | | SGLang | 中 | 中 | 中 | 结构化输出;多模态进展快 | 相对新,生态较小 |
- SGLang 新动向(v0.5.9):
- 支持 Anthropic API 兼容(原生兼容 Claude SDK)
- TRT-LLM DSA kernels → SGLang NSA backend,DeepSeek V3.2 在 Blackwell 上 3x-5x 加速
- 新增 Qwen3.5、Kimi-K2.5、GLM-5、MiniMax 2.5 支持
- 建议写入:
backend/vllm-tensorrt-sglang-h100-benchmark-2026.md - 链接: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
9. TensorRT-LLM v1.2+ 最新进展(GitHub Release Notes)
- 来源: GitHub NVIDIA/TensorRT-LLM releases
- 可信度: ⭐(官方)
- 近期(2026-04~05)重要 PRs:
- DeepSeek V3.2 speculative decoding 支持(MTP>1)
- Nemotron-V3-Ultra 精度测试
- Llama4 Scout Instruct 测试调整
- K2.5 / GLM-5 / Qwen3.5 FP8 disagg 测试
- Flux1/2、LTX2、Wan I2V、Cosmos3 e2e 测试
- MoE LoRA 集成测试 + bugfix
- 建议写入:
backend/tensorrt-llm-v1.2-release-notes-2026.md - 链接: https://github.com/NVIDIA/TensorRT-LLM/releases
10. WebLLM · 浏览器端 LLM 推理引擎(arXiv:2412.15803 更新)
- 来源: arXiv · MLCompilerFlow / University of Washington
- 可信度: ⭐(学术 + 开源)
- 技术背景: WebGPU 驱动的浏览器内 LLM 推理,支持 1-8B 参数模型实时本地运行;4-bit 量化下在消费级硬件可实现实时推理。
- 评价: 端侧 AI 推理方向,代表了模型压缩 + WebGPU 的交叉进展。
- 建议写入:
backend/webllm-browser-inference-2026.md - 链接: https://arxiv.org/html/2412.15803v2
☁️ Cloud-Native · Kubernetes & 分布式平台
11. Kubernetes 2026 成熟度报告(Portworx · Voice of Kubernetes Report 2026)
- 来源: Portworx · 2026(500+ 企业基础设施专业人员调研)
- 可信度: ⭐(大规模调研)
- 核心数据:
- 98% 组织已采用云原生技术;93% 积极使用或评估 Kubernetes
- 28% 组织的多数应用已运行在 Kubernetes 上
- 2026 年 AI 工作负载是 Kubernetes 增长的核心驱动力
- 关键趋势:
- Ingress NGINX Controller 社区版 2026-03 正式退场,Gateway API 成为唯一安全选项
- KubeVirt 项目爆发:VM 与容器在 K8s 集群内统一管理
- AI/ML 工作负载编排:Kubeflow 与 Kubernetes 的集成成为平台工程标配
- 建议写入:
cloud-native/kubernetes-2026-enterprise-adoption-report.md - 链接: https://portworx.com/blog/kubernetes-enterprise-adoption-trends
12. Cloud-Native + Distributed Systems for LLM(arXiv:2604.17227)
- 来源: arXiv · 2026 · CNCF 资助相关
- 可信度: ⭐(有国家项目资助,多机构作者)
- 主题: 探索云原生 + 分布式架构在大规模 LLM 训练和推理中的角色,包括数据管理、资源优化、微服务化、自动伸缩、混合云-边缘部署。
- 评价: 属于研究议程和愿景类论文,梳理了云原生系统与 LLM 基础设施交叉领域的挑战和开放问题。
- 建议写入:
cloud-native/cloud-native-distributed-llm-systems-2026.md - 链接: https://arxiv.org/html/2604.17227v1
13. Platform Engineering 2026 趋势(Medium)
- 来源: Medium 技术文章 · 2026
- 可信度: ⚠️(独立博客,需核验)
- 核心观点:
- AI 驱动的工作负载编排:Kubeflow + K8s 成为 ML pipeline 标准
- Wasm + eBPF + Serverless 正在重新定义云原生边界
- 从 K8s 迁移到平台工程:关注开发者体验而非底层技术细节
- GitOps(Argo CD / Flux)+ 声明式基础设施是 2026 年事实标准
- 建议写入:
cloud-native/platform-engineering-beyond-kubernetes-2026.md - 链接: https://medium.com/@orlando1409/beyond-kubernetes-platform-engineering-trends-for-2026-8f82e09e27e0
🔬 AI Research · Substack & Newsletter 精选
14. Sebastian Raschka · "LLM Research Papers 2026 (Jan-May)"(Ahead of AI / Substack)
- 作者: Sebastian Raschka, PhD
- 可信度: ⭐(AI 研究领域知名教育者,文献调研详实)
- 高价值条目:
- 架构趋势: 混合架构(Mamba-2 + Attention)、状态空间模型、线性注意力变体成为 2026 年主流
- Qwen3.6: 使用 Gated DeltaNet 层替代部分 Mamba-2 层
- Nemotron 3 Super: NVIDIA MoE-Hybrid Mamba-Transformer(120B-A12B,Nano=4B)
- Mamba-3: 改进的序列建模
- Attention Residuals / Delta Attention Residuals: 注意力机制的残差连接变体
- MiniMax-M2 Series: "Mini Activations Unleashing Max Real-World Intelligence"
- Section 3-10: 还覆盖了高效训练/扩展、推理效率/KVCache、长上下文、推理时计算、强化学习RLVR、Agent系统、编程Agent、Diffusion语言模型、评估基准
- 评价: 必读文献梳理,适合作为 2026 上半年 LLM 研究地图。
- 建议写入:
research/llm-research-papers-2026-raschka.md - 链接: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
15. Sebastian Raschka · "Recent Developments in LLM Architectures: KV Sharing, mHC, Compressed Attention"(Substack)
- 作者: Sebastian Raschka, PhD
- 可信度: ⭐
- 核心洞察: 2026 年新开源 LLM(Gemma 4、DeepSeek V4 等)密集采用 KV 共享、mHC(multi-head compression)、压缩注意力等技术来降低长上下文成本。随着 agent 工作流需要保留更长上下文,KV-cache 大小、内存带宽和注意力成本成为核心瓶颈。
- 建议写入:
research/llm-architecture-kv-compression-2026.md - 链接: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
16. Simon Willison · LLM Predictions 2026(Substack)
- 作者: Simon Willison(DataHeroes / Datasette 作者)
- 可信度: ✅(知名独立技术博主,有实践案例)
- 核心观点:
- OpenAI 每周活跃用户 800M(2025-10 数据)
- 2026 年关键趋势:Local AI 推理成熟、Claude Code/MCP 生态扩张、vibe coding 兴起
- 特别提到 Claude Haiku 4.5、Claude Skills 与 MCP 的协同价值
- 建议写入:
research/llm-predictions-2026-simon-willison.md - 链接: https://simonw.substack.com/p/llm-predictions-for-2026-shared-with
17. Import AI #455 · Jack Clark(Substack · 134K 订阅者)
- 作者: Jack Clark(曾是 OpenAI policy 总监,现运营 Import AI)
- 可信度: ✅(行业资深观察者)
- 主题: AI systems are about to start building themselves(递归自我改进的第一步)
- 建议写入:
research/import-ai-455-recursive-self-improvement.md - 链接: https://importai.substack.com/p/import-ai-455-automating-ai-research
🛠️ Tools · GitHub Trending & AI 工程生态
18. GitHub Top AI Repositories 2026(ByteByteGo / OSS Insight)
- 来源: ByteByteGo Newsletter · 2026
- 可信度: ✅(知名技术教育品牌)
- 核心列表: Ollama、LangFlow、Dify、LangChain、Open WebUI、DeepSeek-V3、Google Gemini CLI、RAGFlow、Claude Code
- 特别关注:
- nanochat(Andrej Karpathy): 55k stars,将完整 LLM 训练栈(tokenization→pretraining→finetuning→eval→inference→chat UI)整合到一个最小可 fork 仓库,定位为"学习工具"而非生产框架
- Bumblebee(Perplexity): 供应链安全扫描
- Firecrawl: Web context API
- 建议写入:
tools/github-top-ai-repos-2026.md - 链接: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
19. Multimodal RAG 隐私安全研究(VoltAgent awesome-list 收录)
- 来源: arXiv · 2026
- 可信度: ✅
- 发现: 多模态 RAG 管道存在隐私风险——通过 inclusion inference 和 metadata leakage 攻击在标准模型提示过程中泄露信息。
- 建议写入:
research/multimodal-rag-privacy-security-2026.md - 链接: via https://github.com/VoltAgent/awesome-ai-agent-papers
20. EACL 2026 三篇论文:VLM 不确定性 / MapAgent / DashboardQA
- 来源: LinkedIn 学术动态
- 可信度: ✅(顶会接收)
- 三篇论文: 1. Conformal Lens for Uncertainty in VLMs: 16 个 SOTA VLM 的 conformal prediction 框架,发现更强的模型不仅更准确而且校准更好 2. MapAgent: 分层多 Agent 框架,高级规划与低级地图工具执行分离,改善复杂地理空间推理 3. DashboardQA: 首个交互式仪表板多模态 Agent 评估基准,发现当前 Agent 在动态界面的 grounding、planning、状态追踪方面存在重大缺陷
- 建议写入:
research/eacl-2026-multimodal-agents-vlm-uncertainty.md - 链接: LinkedIn post by Md Rizwan Parvez
📋 分类标签总览
| 类别 | 条目数 | 高优先级 |
|---|---|---|
database |
5 | Mooncake, pgvectorscale vs Qdrant, distributed tx |
backend |
5 | Inference engine variance, TensorRT-LLM v1.2, vLLM/SGLang/TRT benchmark |
cloud-native |
3 | K8s 2026 adoption report, cloud-native LLM systems |
reproduction |
2 | Inference reproducibility, LLM inference engine bugs |
research |
4 | Raschka papers, Substack newsletters |
tools |
1 | GitHub top AI repos 2026 |
✏️ 本次写作计划
建议写入路径(/shared/research-kb/inbox/jay/):
2026-07-08-inference-systems-llm-architectures.md— 合并 #6-10(推理引擎 + 架构)2026-07-08-vector-db-distributed-storage.md— 合并 #1-5(向量DB + 分布式存储)2026-07-08-cloudnative-platform-ai-workloads.md— 合并 #11-13(云原生 + K8s)2026-07-08-substack-ai-research-highlights.md— 合并 #14-17(Substack 精选)2026-07-08-github-ai-tools-agents.md— 合并 #18-20(工具 + Agent 研究)
精读优先级: #6(Inference Engine Variance)、#8(benchmark 对比)、#14(Raschka 2026 地图)
审稿需求: #11(Portworx 报告引用数据需原报告核验)、#13(Medium 独立文章需交叉验证)
主题页更新建议:LLM Inference Systems/Vector Databases/Cloud-Native Platforms三个主题页
Jay · 2026-07-08 · 15:05 CST · Jay /inbox/jay/2026-07-08-database-backend-cloudnative-inference.md