Jay · 每日知识库简报 · 第三场

整理时间:2026-09-14 11:05 (UTC+8) 实例:Jay 检索范围:arXiv Sep 2026 · vLLM/SGLang 推理引擎 · Kubernetes v1.37 · LLM 推理综述 · Substack AI Agent Stack · PostgreSQL vs MySQL 2026


一、DATABASE(数据库系统)

🔴 高价值条目

1. FlintKV — 快速持存储引擎(arXiv 2607.02401)

  • 链接:https://arxiv.org/abs/2607.02401
  • 发布时间:2026年9月(v2,Sep 2026)
  • 主题:面向现代数据库的快速持久化 KV 存储引擎
  • 核心贡献
  • 整合无锁 skiplist(原子批量更新 + 快照语义)与崩溃一致性
  • 与 RocksDB 对齐 API(Put/Get/Delete/Snapshot Iterator)
  • 适合 NVMe 直连场景,对高并发写入友好
  • 可信度:高(arXiv 学术论文,有版本历史)
  • 精读建议建议精读 — 存储引擎层面 crash consistency 设计细节,RocksDB 替代候选
  • 后续行动:待核验是否有开源代码仓;对比 LMDB-FILE 与 Rust 版 RocksDB fork

2. SPI — Streaming RAG 查询深度自适应索引(arXiv 2511.16681)

  • 链接:https://arxiv.org/abs/2511.16681
  • 发布时间:2026年6月(last revised 2026-09 持续活跃)
  • 主题:向量数据库中面向 Streaming RAG 的查询深度自适应索引
  • 核心贡献:根据查询深度(短窗口/长上下文)动态调整索引结构,适配流式 RAG 场景
  • 可信度:高(arXiv 学术论文)
  • 精读建议建议精读 — RAG 系统+向量数据库交叉方向,工程落地价值高
  • 后续行动:核验论文实验规模和代码可用性

3. Living Databases — 持续 Schema 演化和版本化统一模型(ICDE 2026)

  • 链接:https://arxiv.org/abs/2605.00676
  • 发布时间:2026年5月,ICDE 2026 DEFT track
  • 主题:统一模型处理 Schema 持续演化、版本控制和转换
  • 核心贡献
  • Prolly-tree + 列式布局的快照图抽象
  • 自治调优引擎(自动管理 chunk 策略/压缩/物化决策)
  • 兼顾事务更新和分析查询访问模式
  • 可信度:高(IEEE ICDE 2026 论文)
  • 精读建议建议精读 — Schema 演化是生产数据库常见痛点,自动化 tuning 是 ML4DB 热点方向
  • 后续行动:对比现有 Schema migration 方案(Flyway/Liquibase + AI)

4. GenDB — 合成查询处理引擎(arXiv 2603.02081)

  • 链接:https://arxiv.org/abs/2603.02081
  • 发布时间:2026年3月
  • 主题:用 LLM 多智能体管道自动合成 C++ 查询处理管道
  • 核心观点:Jailbreak 四智能体 LLM 管道自动化合成 PostgreSQL heap/MySQL InnoDB 存储页读取器;GenDB 合成整个查询处理管线而非人工设计
  • 可信度:中(研究原型,概念验证)
  • 精读建议可选精读 — 概念前沿,工程可行性待验证
  • 后续行动:关注 VLDB 2026 Workshop AIDB 后续

5. LEANN — 低存储向量索引(arXiv 2506.08276)

  • 链接:https://arxiv.org/abs/2506.08276
  • 发布时间:2025年6月
  • 主题:低存储占用的向量索引算法
  • 可信度:高(arXiv 学术论文,cs.DB)
  • 精读建议可选精读 — 存储优化视角,适合嵌入式/边缘向量检索场景

6. Filtered Approx Nearest Neighbor — 结构化过滤+向量索引交叉(arXiv 2602.11443)

  • 链接:https://arxiv.org/html/2602.11443
  • 发布时间:2026年2月
  • 主题:向量数据库中带结构化过滤条件的 ANN 搜索
  • 核心观点:现有融合方法(ACORN/Filtered-DiskANN/HQANN)牺牲灵活性;通用向量 DB 路线仍有研究盲点
  • 精读建议建议泛读 — 生产中过滤向量查询很常见,对 Milvus/PgVector 优化有参考价值

🟡 中等价值条目(线索)

条目 主题 来源 行动
Factorized and Vectorized Execution 分析+语义查询向量化执行 arXiv 2609.09002(Sep 2026) 待核验全文
OmniTable 统一宽表抽象+LLM数据策展 arXiv 2609.11148(Sep 2026) 核验是否开源
Testing Computation Pushdown in Distributed DB 分布式数据库计算下推测试 ISSTA 2026 关注测试方法论
ML4DB-paper-list ML4DB 论文列表(含 Divo/OmniTune/QUITE 等 2026 论文) GitHub 补充进 DB 主题页

📌 Database 分类标签

#database #vector-index #storage-engine #streaming-RAG #schema-evolution #ML4DB #inference-index


二、BACKEND(推理引擎与后端系统)

🔴 高价值条目

1. Awesome-LLM-Inference-Engine — ACM TIST 2026 综述

  • 链接:https://github.com/sihyeong/Awesome-LLM-Inference-Engine
  • 论文:ACM Trans. Intell. Syst. Technol. 2026,"A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency"
  • 核心贡献
  • 系统梳理当前主流推理引擎优化技术全景图
  • 采样优化:Eagle(多 token 推测解码)、Medusa(树状多头解码)、ReDrafter、MineDraft(vLLM 插件)
  • 吞吐量优化:Continuous Batching。并行化、缓存复用
  • 延迟优化:Stall-free Scheduling、Chunked Prefill、Priority-aware Execution
  • 可信度:高(ACM 期刊论文,学术+工程综述)
  • 精读建议建议精读 — 推理引擎完整技术栈地图,工程选型参考框架
  • 后续行动:补充进 inference-engine 主题页参考源

2. vLLM vs SGLang vs TensorRT-LLM 2026 决策框架(Spheron)

  • 链接:https://www.spheron.network/blog/llm-inference-optimization-2026
  • 发布时间:2026年8月
  • 核心观点
  • vLLM = 最高吞吐量 + OpenAI 兼容 API,PagedAttention
  • SGLang = 前缀共享场景最优,RadixAttention
  • TensorRT-LLM = 最低延迟,NVIDIA 深度优化
  • 关键变量:模型切换频率、前缀共享比例、并发量
  • SGLang Breakable CUDA Graph:2026 默认降低 GPU 成本
  • 可信度:高(工程对比,有 benchmark 数据)
  • 精读建议建议精读 — 生产推理引擎选型实用指南

3. LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework(DeployBase)

  • 链接:https://deploybase.ai/articles/best-llm-inference-engine
  • 发布时间:2026年3月(持续更新)
  • 核心内容
  • 各引擎优化参数具体配置(gpu_memory_utilization、enable_prefix_caching 等)
  • SGLang 状态图 API 示例:sgl.gen(name="reasoning", max_tokens=500)
  • TGI bfloat16 + TensorRT-LLM 构建命令
  • Prefix caching 配置:llm = LLM(model="...", enable_prefix_caching=True)
  • 可信度:高(工程配置手册,含真实命令)
  • 精读建议建议精读 — 推理引擎生产调优参数速查

4. vLLM Blog — V1 架构重构(2026年)

  • 链接:https://vllm.ai/blog
  • 核心内容
  • vLLM V1:重新架构引擎,简化的调度器,near-zero 开销 prefix caching,更干净的 tensor parallelism,多进程 API server,默认高吞吐优化
  • vLLM Korea Meetup 2026:社区增长、V1 更新、生产栈采纳、 accelerator 集成
  • Prefill-Decode Disaggregation:AMD MORI-IO 单节点 prefill/decode 分离
  • Blackwell Inference:FP4 kernels,Pareto 前沿 benchmark
  • 可信度:高(官方博客)
  • 精读建议建议精读 — vLLM V1 架构变化是 2026 推理工程重要里程碑

5. The Community Stories of vLLM and SGLang(Medium/@ant-oss)

  • 链接:https://medium.com/@ant-oss/the-community-stories-of-vllm-and-sgl-d4675e77da6a
  • 发布时间:2026年
  • 核心观点
  • vLLM 和 SGLang 均源于 Berkeley(Ion Stoica 实验室)
  • vLLM:2023年6月起步;SGLang:约6个月后
  • 2025年9-12月 vLLM 增长放缓,V1 后恢复;SGLang 自 v0.2 稳步攀升
  • DeepSeek V3/R1 推动两者进入新一轮快速增长
  • 两大引擎功能趋同:Continuous Batching、PagedAttention、RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving
  • 可信度:中(技术评论,视角性内容)
  • 精读建议建议泛读 — 理解社区动态和技术演进路线

6. The Rise of Modern LLM Inference Engines in 2026(LinkedIn/Umesh Khandelwal)

  • 链接:https://www.linkedin.com/pulse/rise-modern-llm-inference-engines-2026-umesh-khandelwal-p5cde
  • 可信度:中(行业评论)
  • 精读建议可选泛读 — 行业趋势观察

📌 Backend 分类标签

#inference-engine #vLLM #SGLang #TensorRT-LLM #speculative-decoding #PagedAttention #RadixAttention #prefix-caching #continuous-batching


三、CLOUD-NATIVE(云原生与 Kubernetes)

🔴 高价值条目

1. Kubernetes 2.0 — 2026十年最大版本(tech-insider.org)

  • 链接:https://tech-insider.org/kubernetes-2-0-everything-developers-need-to-know-about-the-biggest-release-in-a-decade
  • 发布时间:2025年12月 GA,2026年持续演进
  • 核心变化
  • eBPF 原生网络栈:替代 kube-proxy,2026年3月 Cilium 份额达 60%,消除 iptables 瓶颈,支持高级流量管理
  • 原生 Sidecar 容器:v1.33 GA stable,Pod 生命周期原语,代理/可观测 sidecar 更安全可靠
  • 简化 CRD 创作
  • 内置多集群联邦
  • v1.36:原生 gang scheduling(AI workload),GPU 利用率提升 25%(2026年6月数据)
  • 可信度:高(引用 Kubernetes 官方 changelog)
  • 精读建议建议精读 — Kubernetes 2.0 是生产 K8s 升级的重要参考节点

2. Kubernetes v1.37 — 67项增强(The New Stack)

  • 链接:https://thenewstack.io/kubecon-kubernetes-updates-security
  • 发布时间:2026年9月11日(KubeCon 期间)
  • 核心内容
  • Azure AKS:autoscaling for VM node pools GA,v1.37 preview 推出
  • 67项增强,重点在 AI infrastructure 和 operator 可用性
  • 仍有 access-control gap 需要关注
  • 可信度:高(The New Stack 技术媒体,现场报道)
  • 精读建议建议精读 — v1.37 是最新稳定版,KubeCon NA 2026 重点版本

3. Kubernetes Security 2025 Stable Features & 2026 Preview(CN CF 官方)

  • 链接:https://www.cncf.io/blog/2025/12/15/kubernetes-security-2025-stable-features-and-2026-preview
  • 核心内容
  • Sidecar containers(v1.33 GA):更安全的 sidecar 生命周期管理
  • Recursive read-only mounts(v1.33 GA):关闭可写路径滥用攻击面
  • Bound ServiceAccount token improvements(v1.33):唯一 token ID + node binding,防止 token 复用和节点冒用
  • Robust image pull authorization(Beta,v1.35):kubelet 可重新验证镜像凭证,关闭缓存镜像冒用场景
  • 可信度:高(CN CF 官方博客)
  • 精读建议建议精读 — K8s 安全加固实用指南

4. State of Cloud-Native Security 2026(Red Hat)

  • 链接:https://www.redhat.com/en/resources/state-of-cloud-native-security-ebook
  • 发布时间:2026年
  • 核心观点
  • AI 带来新的风险维度,治理速度必须追上创新速度
  • 运行时保护扩展
  • 多云/混合环境安全治理
  • 可信度:高(Red Hat 年度安全报告)
  • 精读建议建议泛读 — 2026 云原生安全全局视图

📌 Cloud-Native 分类标签

#kubernetes #k8s-2.0 #eBPF #Cilium #sidecar-containers #kubecon-2026 #v1.37 #cloud-native-security


四、CSDN(中文技术社区高价值条目)

🔴 高价值条目

1. PostgreSQL vs MySQL 2026 全面对比(多源综合)

  • 来源:tech-insider.org / kunalganglani.com / dharmops.com / builder.ai2sql.io
  • 核心数据
  • DB-Engines 2026年7月:PostgreSQL 687.80(↑6.92 YoY),MySQL 846.46(↓94.27 YoY)
  • PostgreSQL 唯一上升的 Top 4 数据库;Oracle 和 SQL Server 均大幅下滑
  • PostgreSQL 优势:复杂分析查询、JSON/向量扩展(pgvector)、MVCC 强一致性、AI-ready 架构
  • MySQL 优势:简单 OLTP 读、高并发连接、Thread-per-connection 低开销
  • PostgreSQL 18:异步 I/O 子系统重大改进,VACUUM 内存消耗降低 20 倍(v17 已降 20x)
  • 写密集 benchmark:MySQL 高约 30%(单节点配置)
  • 连接池:MySQL 500 idle connections 可消耗 2-3x Postgres 内存
  • 可信度:高(多源 benchmark 汇总)
  • 精读建议建议精读 — 2026 数据库选型必读
  • 后续行动:补充 PostgreSQL 18 async I/O 详细配置参数

2. AI Agent 架构 2026:RAG vs Fine-Tuning vs Multi-Agent(LaderaLabs)

  • 链接:https://laderalabs.io/blog/ai-agent-architecture-patterns-rag-vs-fine-tuning-2026
  • 发布时间:2026年
  • 核心观点
  • Q2 2026 架构决策决定 Q3 2027 能构建什么
  • 选商品 wrapper 本季度省事,下季度重建
  • 自定义 RAG + fine-tuning 管线 + 多智能体系统本季度构建将形成能力复利
  • 工具调用是 2026 Agent 标准能力,非附加功能
  • 可信度:中(技术博客,工程经验为主)
  • 精读建议建议泛读 — 架构决策方法论

📌 CSDN 分类标签

#PostgreSQL #MySQL #database-comparison #pgvector #2026-trends


五、REPRODUCTION(可复现研究条目)

🔴 高价值条目

1. ACM TIST 2026 推理引擎综述 — Awesome-LLM-Inference-Engine

  • 论文:https://github.com/sihyeong/Awesome-LLM-Inference-Engine(Survey Paper,ACM TIST 2026)
  • 可复现性:高(GitHub 维护,持续更新,含引用文献)
  • 复现建议:构建推理引擎特性对比表,覆盖各引擎支持的技术

2. vLLM V1 架构重构 — 官方博客系列

  • 链接:https://vllm.ai/blog
  • 可复现性:高(含源码和 benchmark)
  • 复现建议:在多 GPU 节点实测 PagedAttention vs RadixAttention prefix caching 对比

3. Kubernetes 2.0 eBPF 网络栈 — Cilium 对比测试

  • 可复现性:中(需多节点集群)
  • 复现建议:测试 Cilium eBPF vs kube-proxy 在大并发下的吞吐量差异

4. LLM Inference Engines 对比基准(Spheron + DeployBase)

  • 链接:https://www.spheron.network/blog/llm-inference-optimization-2026 | https://deploybase.ai/articles/best-llm-inference-engine
  • 可复现性:高(有具体配置参数)
  • 复现建议:在相同硬件上实测 vLLM/SGLang/TensorRT-LLM 的 prefix-heavy vs unique workload 对比

📌 Reproduction 分类标签

#reproduction #inference-benchmark #vllm #sglang #k8s-2.0 #ebpf


六、SUBSTACK 精选(AI Agent Stack 2026)

🔴 高价值条目

1. The AI Agents Stack(2026 Edition)— The AI Engineer

  • 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 发布时间:2026年
  • 核心洞察
  • Agent guardrails 独立于 LLM guardrails:2026 年 guardrails 需覆盖工具调用授权、速率限制、行为验证
  • "Evaluation as infrastructure" 三层收敛:PR 级快速检查 / 夜间回归(LLM judge)/ 生产持续监控
  • 新 Benchmark:Context-Bench(记忆)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
  • 可信度:高(AI Engineer 专业 newsletter)
  • 精读建议建议精读 — Agent 工程实践路线图

2. Multi-Agent System Memory and RAG — llmengg.com

  • 链接:https://llmengg.com/multi-agent-system-memory-rag
  • 发布时间:2026年4月 Workshop
  • 核心内容
  • 集中式 RAG 服务暴露为 MCP server,多智能体通过 typed MCP tool call 访问
  • 连接池 + 共享检索缓存避免冗余 embedding 搜索
  • 长运行 Agent 记忆管理:TTL 驱逐 + 重要性压缩 + 记忆相关性衰减 + 会话摘要
  • MCP(Model Context Protocol):Anthropic 提出的 Agent 间结构化编排标准
  • 可信度:高(Workshop 深度内容)
  • 精读建议建议精读 — Agent 记忆架构和生产 RAG 设计

3. My LLM Coding Workflow into 2026 — Addy Osmani(Addy Osmani @ Substack)

  • 链接:https://addyo.substack.com/p/my-llm-coding-workflow-going-into
  • 核心观点
  • 监督式 AI 辅助:让 AI 生成和运行代码,但人保持监控
  • 并行 Agent 工具:3-4 个 Agent 同时处理不同任务
  • 坚实软件工程基础 + AI = 能力倍增;基础薄弱 + AI = 混乱放大
  • LLMs "reward existing best practices"
  • 可信度:高(Addy Osmani,Google 工程师)
  • 精读建议建议泛读 — AI 工程实践方法论

📌 Substack 分类标签

#substack #AI-agent-stack #MCP #agent-guardrails #agent-evaluation #memory-management #multi-agent-RAG


七、本次简报汇总

高价值精读候选(优先级排序)

  1. Awesome-LLM-Inference-Engine(ACM TIST 2026) — 推理引擎全景综述,工程选型必备
  2. vLLM V1 架构重构(官方博客)— 2026 推理工程核心变化
  3. Kubernetes 2.0 eBPF + v1.37(tech-insider + The New Stack)— 云原生重大升级
  4. The AI Agents Stack 2026 Edition(The AI Engineer)— Agent 工程路线图
  5. Multi-Agent System Memory and RAG(llmengg.com)— 生产 Agent 记忆架构
  6. SPI: Streaming RAG Query-Depth-Adaptive Indexing(arXiv)— RAG+向量索引交叉前沿
  7. Living Databases(ICDE 2026)— Schema 自动化演进
  8. FlintKV(arXiv)— 新一代持久化 KV 引擎候选

建议写入路径

/shared/research-kb/inbox/jay/2026-09-14-1105-jay-five-category-briefing.md

分类标签汇总

#database #inference-engine #kubernetes #cloud-native #vLLM #SGLang #AI-agent-stack #RAG #vector-index #k8s-2.0 #pgvector #2026


本简报由 Jay 实例自动生成 · 2026-09-14 11:05 UTC+8 不执行 GitHub 写入 · 草稿存放于 /shared/research-kb/inbox/jay/