Jay · 每日知识库简报 · 第三场
整理时间:2026-09-14 11:05 (UTC+8) 实例:Jay 检索范围:arXiv Sep 2026 · vLLM/SGLang 推理引擎 · Kubernetes v1.37 · LLM 推理综述 · Substack AI Agent Stack · PostgreSQL vs MySQL 2026
一、DATABASE(数据库系统)
🔴 高价值条目
1. FlintKV — 快速持存储引擎(arXiv 2607.02401)
- 链接:https://arxiv.org/abs/2607.02401
- 发布时间:2026年9月(v2,Sep 2026)
- 主题:面向现代数据库的快速持久化 KV 存储引擎
- 核心贡献:
- 整合无锁 skiplist(原子批量更新 + 快照语义)与崩溃一致性
- 与 RocksDB 对齐 API(Put/Get/Delete/Snapshot Iterator)
- 适合 NVMe 直连场景,对高并发写入友好
- 可信度:高(arXiv 学术论文,有版本历史)
- 精读建议:建议精读 — 存储引擎层面 crash consistency 设计细节,RocksDB 替代候选
- 后续行动:待核验是否有开源代码仓;对比 LMDB-FILE 与 Rust 版 RocksDB fork
2. SPI — Streaming RAG 查询深度自适应索引(arXiv 2511.16681)
- 链接:https://arxiv.org/abs/2511.16681
- 发布时间:2026年6月(last revised 2026-09 持续活跃)
- 主题:向量数据库中面向 Streaming RAG 的查询深度自适应索引
- 核心贡献:根据查询深度(短窗口/长上下文)动态调整索引结构,适配流式 RAG 场景
- 可信度:高(arXiv 学术论文)
- 精读建议:建议精读 — RAG 系统+向量数据库交叉方向,工程落地价值高
- 后续行动:核验论文实验规模和代码可用性
3. Living Databases — 持续 Schema 演化和版本化统一模型(ICDE 2026)
- 链接:https://arxiv.org/abs/2605.00676
- 发布时间:2026年5月,ICDE 2026 DEFT track
- 主题:统一模型处理 Schema 持续演化、版本控制和转换
- 核心贡献:
- Prolly-tree + 列式布局的快照图抽象
- 自治调优引擎(自动管理 chunk 策略/压缩/物化决策)
- 兼顾事务更新和分析查询访问模式
- 可信度:高(IEEE ICDE 2026 论文)
- 精读建议:建议精读 — Schema 演化是生产数据库常见痛点,自动化 tuning 是 ML4DB 热点方向
- 后续行动:对比现有 Schema migration 方案(Flyway/Liquibase + AI)
4. GenDB — 合成查询处理引擎(arXiv 2603.02081)
- 链接:https://arxiv.org/abs/2603.02081
- 发布时间:2026年3月
- 主题:用 LLM 多智能体管道自动合成 C++ 查询处理管道
- 核心观点:Jailbreak 四智能体 LLM 管道自动化合成 PostgreSQL heap/MySQL InnoDB 存储页读取器;GenDB 合成整个查询处理管线而非人工设计
- 可信度:中(研究原型,概念验证)
- 精读建议:可选精读 — 概念前沿,工程可行性待验证
- 后续行动:关注 VLDB 2026 Workshop AIDB 后续
5. LEANN — 低存储向量索引(arXiv 2506.08276)
- 链接:https://arxiv.org/abs/2506.08276
- 发布时间:2025年6月
- 主题:低存储占用的向量索引算法
- 可信度:高(arXiv 学术论文,cs.DB)
- 精读建议:可选精读 — 存储优化视角,适合嵌入式/边缘向量检索场景
6. Filtered Approx Nearest Neighbor — 结构化过滤+向量索引交叉(arXiv 2602.11443)
- 链接:https://arxiv.org/html/2602.11443
- 发布时间:2026年2月
- 主题:向量数据库中带结构化过滤条件的 ANN 搜索
- 核心观点:现有融合方法(ACORN/Filtered-DiskANN/HQANN)牺牲灵活性;通用向量 DB 路线仍有研究盲点
- 精读建议:建议泛读 — 生产中过滤向量查询很常见,对 Milvus/PgVector 优化有参考价值
🟡 中等价值条目(线索)
| 条目 | 主题 | 来源 | 行动 |
|---|---|---|---|
| Factorized and Vectorized Execution | 分析+语义查询向量化执行 | arXiv 2609.09002(Sep 2026) | 待核验全文 |
| OmniTable | 统一宽表抽象+LLM数据策展 | arXiv 2609.11148(Sep 2026) | 核验是否开源 |
| Testing Computation Pushdown in Distributed DB | 分布式数据库计算下推测试 | ISSTA 2026 | 关注测试方法论 |
| ML4DB-paper-list | ML4DB 论文列表(含 Divo/OmniTune/QUITE 等 2026 论文) | GitHub | 补充进 DB 主题页 |
📌 Database 分类标签
#database #vector-index #storage-engine #streaming-RAG #schema-evolution #ML4DB #inference-index
二、BACKEND(推理引擎与后端系统)
🔴 高价值条目
1. Awesome-LLM-Inference-Engine — ACM TIST 2026 综述
- 链接:https://github.com/sihyeong/Awesome-LLM-Inference-Engine
- 论文:ACM Trans. Intell. Syst. Technol. 2026,"A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency"
- 核心贡献:
- 系统梳理当前主流推理引擎优化技术全景图
- 采样优化:Eagle(多 token 推测解码)、Medusa(树状多头解码)、ReDrafter、MineDraft(vLLM 插件)
- 吞吐量优化:Continuous Batching。并行化、缓存复用
- 延迟优化:Stall-free Scheduling、Chunked Prefill、Priority-aware Execution
- 可信度:高(ACM 期刊论文,学术+工程综述)
- 精读建议:建议精读 — 推理引擎完整技术栈地图,工程选型参考框架
- 后续行动:补充进 inference-engine 主题页参考源
2. vLLM vs SGLang vs TensorRT-LLM 2026 决策框架(Spheron)
- 链接:https://www.spheron.network/blog/llm-inference-optimization-2026
- 发布时间:2026年8月
- 核心观点:
- vLLM = 最高吞吐量 + OpenAI 兼容 API,PagedAttention
- SGLang = 前缀共享场景最优,RadixAttention
- TensorRT-LLM = 最低延迟,NVIDIA 深度优化
- 关键变量:模型切换频率、前缀共享比例、并发量
- SGLang Breakable CUDA Graph:2026 默认降低 GPU 成本
- 可信度:高(工程对比,有 benchmark 数据)
- 精读建议:建议精读 — 生产推理引擎选型实用指南
3. LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework(DeployBase)
- 链接:https://deploybase.ai/articles/best-llm-inference-engine
- 发布时间:2026年3月(持续更新)
- 核心内容:
- 各引擎优化参数具体配置(gpu_memory_utilization、enable_prefix_caching 等)
- SGLang 状态图 API 示例:
sgl.gen(name="reasoning", max_tokens=500) - TGI bfloat16 + TensorRT-LLM 构建命令
- Prefix caching 配置:
llm = LLM(model="...", enable_prefix_caching=True) - 可信度:高(工程配置手册,含真实命令)
- 精读建议:建议精读 — 推理引擎生产调优参数速查
4. vLLM Blog — V1 架构重构(2026年)
- 链接:https://vllm.ai/blog
- 核心内容:
- vLLM V1:重新架构引擎,简化的调度器,near-zero 开销 prefix caching,更干净的 tensor parallelism,多进程 API server,默认高吞吐优化
- vLLM Korea Meetup 2026:社区增长、V1 更新、生产栈采纳、 accelerator 集成
- Prefill-Decode Disaggregation:AMD MORI-IO 单节点 prefill/decode 分离
- Blackwell Inference:FP4 kernels,Pareto 前沿 benchmark
- 可信度:高(官方博客)
- 精读建议:建议精读 — vLLM V1 架构变化是 2026 推理工程重要里程碑
5. The Community Stories of vLLM and SGLang(Medium/@ant-oss)
- 链接:https://medium.com/@ant-oss/the-community-stories-of-vllm-and-sgl-d4675e77da6a
- 发布时间:2026年
- 核心观点:
- vLLM 和 SGLang 均源于 Berkeley(Ion Stoica 实验室)
- vLLM:2023年6月起步;SGLang:约6个月后
- 2025年9-12月 vLLM 增长放缓,V1 后恢复;SGLang 自 v0.2 稳步攀升
- DeepSeek V3/R1 推动两者进入新一轮快速增长
- 两大引擎功能趋同:Continuous Batching、PagedAttention、RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving
- 可信度:中(技术评论,视角性内容)
- 精读建议:建议泛读 — 理解社区动态和技术演进路线
6. The Rise of Modern LLM Inference Engines in 2026(LinkedIn/Umesh Khandelwal)
- 链接:https://www.linkedin.com/pulse/rise-modern-llm-inference-engines-2026-umesh-khandelwal-p5cde
- 可信度:中(行业评论)
- 精读建议:可选泛读 — 行业趋势观察
📌 Backend 分类标签
#inference-engine #vLLM #SGLang #TensorRT-LLM #speculative-decoding #PagedAttention #RadixAttention #prefix-caching #continuous-batching
三、CLOUD-NATIVE(云原生与 Kubernetes)
🔴 高价值条目
1. Kubernetes 2.0 — 2026十年最大版本(tech-insider.org)
- 链接:https://tech-insider.org/kubernetes-2-0-everything-developers-need-to-know-about-the-biggest-release-in-a-decade
- 发布时间:2025年12月 GA,2026年持续演进
- 核心变化:
- eBPF 原生网络栈:替代 kube-proxy,2026年3月 Cilium 份额达 60%,消除 iptables 瓶颈,支持高级流量管理
- 原生 Sidecar 容器:v1.33 GA stable,Pod 生命周期原语,代理/可观测 sidecar 更安全可靠
- 简化 CRD 创作
- 内置多集群联邦
- v1.36:原生 gang scheduling(AI workload),GPU 利用率提升 25%(2026年6月数据)
- 可信度:高(引用 Kubernetes 官方 changelog)
- 精读建议:建议精读 — Kubernetes 2.0 是生产 K8s 升级的重要参考节点
2. Kubernetes v1.37 — 67项增强(The New Stack)
- 链接:https://thenewstack.io/kubecon-kubernetes-updates-security
- 发布时间:2026年9月11日(KubeCon 期间)
- 核心内容:
- Azure AKS:autoscaling for VM node pools GA,v1.37 preview 推出
- 67项增强,重点在 AI infrastructure 和 operator 可用性
- 仍有 access-control gap 需要关注
- 可信度:高(The New Stack 技术媒体,现场报道)
- 精读建议:建议精读 — v1.37 是最新稳定版,KubeCon NA 2026 重点版本
3. Kubernetes Security 2025 Stable Features & 2026 Preview(CN CF 官方)
- 链接:https://www.cncf.io/blog/2025/12/15/kubernetes-security-2025-stable-features-and-2026-preview
- 核心内容:
- Sidecar containers(v1.33 GA):更安全的 sidecar 生命周期管理
- Recursive read-only mounts(v1.33 GA):关闭可写路径滥用攻击面
- Bound ServiceAccount token improvements(v1.33):唯一 token ID + node binding,防止 token 复用和节点冒用
- Robust image pull authorization(Beta,v1.35):kubelet 可重新验证镜像凭证,关闭缓存镜像冒用场景
- 可信度:高(CN CF 官方博客)
- 精读建议:建议精读 — K8s 安全加固实用指南
4. State of Cloud-Native Security 2026(Red Hat)
- 链接:https://www.redhat.com/en/resources/state-of-cloud-native-security-ebook
- 发布时间:2026年
- 核心观点:
- AI 带来新的风险维度,治理速度必须追上创新速度
- 运行时保护扩展
- 多云/混合环境安全治理
- 可信度:高(Red Hat 年度安全报告)
- 精读建议:建议泛读 — 2026 云原生安全全局视图
📌 Cloud-Native 分类标签
#kubernetes #k8s-2.0 #eBPF #Cilium #sidecar-containers #kubecon-2026 #v1.37 #cloud-native-security
四、CSDN(中文技术社区高价值条目)
🔴 高价值条目
1. PostgreSQL vs MySQL 2026 全面对比(多源综合)
- 来源:tech-insider.org / kunalganglani.com / dharmops.com / builder.ai2sql.io
- 核心数据:
- DB-Engines 2026年7月:PostgreSQL 687.80(↑6.92 YoY),MySQL 846.46(↓94.27 YoY)
- PostgreSQL 唯一上升的 Top 4 数据库;Oracle 和 SQL Server 均大幅下滑
- PostgreSQL 优势:复杂分析查询、JSON/向量扩展(pgvector)、MVCC 强一致性、AI-ready 架构
- MySQL 优势:简单 OLTP 读、高并发连接、Thread-per-connection 低开销
- PostgreSQL 18:异步 I/O 子系统重大改进,VACUUM 内存消耗降低 20 倍(v17 已降 20x)
- 写密集 benchmark:MySQL 高约 30%(单节点配置)
- 连接池:MySQL 500 idle connections 可消耗 2-3x Postgres 内存
- 可信度:高(多源 benchmark 汇总)
- 精读建议:建议精读 — 2026 数据库选型必读
- 后续行动:补充 PostgreSQL 18 async I/O 详细配置参数
2. AI Agent 架构 2026:RAG vs Fine-Tuning vs Multi-Agent(LaderaLabs)
- 链接:https://laderalabs.io/blog/ai-agent-architecture-patterns-rag-vs-fine-tuning-2026
- 发布时间:2026年
- 核心观点:
- Q2 2026 架构决策决定 Q3 2027 能构建什么
- 选商品 wrapper 本季度省事,下季度重建
- 自定义 RAG + fine-tuning 管线 + 多智能体系统本季度构建将形成能力复利
- 工具调用是 2026 Agent 标准能力,非附加功能
- 可信度:中(技术博客,工程经验为主)
- 精读建议:建议泛读 — 架构决策方法论
📌 CSDN 分类标签
#PostgreSQL #MySQL #database-comparison #pgvector #2026-trends
五、REPRODUCTION(可复现研究条目)
🔴 高价值条目
1. ACM TIST 2026 推理引擎综述 — Awesome-LLM-Inference-Engine
- 论文:https://github.com/sihyeong/Awesome-LLM-Inference-Engine(Survey Paper,ACM TIST 2026)
- 可复现性:高(GitHub 维护,持续更新,含引用文献)
- 复现建议:构建推理引擎特性对比表,覆盖各引擎支持的技术
2. vLLM V1 架构重构 — 官方博客系列
- 链接:https://vllm.ai/blog
- 可复现性:高(含源码和 benchmark)
- 复现建议:在多 GPU 节点实测 PagedAttention vs RadixAttention prefix caching 对比
3. Kubernetes 2.0 eBPF 网络栈 — Cilium 对比测试
- 可复现性:中(需多节点集群)
- 复现建议:测试 Cilium eBPF vs kube-proxy 在大并发下的吞吐量差异
4. LLM Inference Engines 对比基准(Spheron + DeployBase)
- 链接:https://www.spheron.network/blog/llm-inference-optimization-2026 | https://deploybase.ai/articles/best-llm-inference-engine
- 可复现性:高(有具体配置参数)
- 复现建议:在相同硬件上实测 vLLM/SGLang/TensorRT-LLM 的 prefix-heavy vs unique workload 对比
📌 Reproduction 分类标签
#reproduction #inference-benchmark #vllm #sglang #k8s-2.0 #ebpf
六、SUBSTACK 精选(AI Agent Stack 2026)
🔴 高价值条目
1. The AI Agents Stack(2026 Edition)— The AI Engineer
- 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 发布时间:2026年
- 核心洞察:
- Agent guardrails 独立于 LLM guardrails:2026 年 guardrails 需覆盖工具调用授权、速率限制、行为验证
- "Evaluation as infrastructure" 三层收敛:PR 级快速检查 / 夜间回归(LLM judge)/ 生产持续监控
- 新 Benchmark:Context-Bench(记忆)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
- 可信度:高(AI Engineer 专业 newsletter)
- 精读建议:建议精读 — Agent 工程实践路线图
2. Multi-Agent System Memory and RAG — llmengg.com
- 链接:https://llmengg.com/multi-agent-system-memory-rag
- 发布时间:2026年4月 Workshop
- 核心内容:
- 集中式 RAG 服务暴露为 MCP server,多智能体通过 typed MCP tool call 访问
- 连接池 + 共享检索缓存避免冗余 embedding 搜索
- 长运行 Agent 记忆管理:TTL 驱逐 + 重要性压缩 + 记忆相关性衰减 + 会话摘要
- MCP(Model Context Protocol):Anthropic 提出的 Agent 间结构化编排标准
- 可信度:高(Workshop 深度内容)
- 精读建议:建议精读 — Agent 记忆架构和生产 RAG 设计
3. My LLM Coding Workflow into 2026 — Addy Osmani(Addy Osmani @ Substack)
- 链接:https://addyo.substack.com/p/my-llm-coding-workflow-going-into
- 核心观点:
- 监督式 AI 辅助:让 AI 生成和运行代码,但人保持监控
- 并行 Agent 工具:3-4 个 Agent 同时处理不同任务
- 坚实软件工程基础 + AI = 能力倍增;基础薄弱 + AI = 混乱放大
- LLMs "reward existing best practices"
- 可信度:高(Addy Osmani,Google 工程师)
- 精读建议:建议泛读 — AI 工程实践方法论
📌 Substack 分类标签
#substack #AI-agent-stack #MCP #agent-guardrails #agent-evaluation #memory-management #multi-agent-RAG
七、本次简报汇总
高价值精读候选(优先级排序)
- Awesome-LLM-Inference-Engine(ACM TIST 2026) — 推理引擎全景综述,工程选型必备
- vLLM V1 架构重构(官方博客)— 2026 推理工程核心变化
- Kubernetes 2.0 eBPF + v1.37(tech-insider + The New Stack)— 云原生重大升级
- The AI Agents Stack 2026 Edition(The AI Engineer)— Agent 工程路线图
- Multi-Agent System Memory and RAG(llmengg.com)— 生产 Agent 记忆架构
- SPI: Streaming RAG Query-Depth-Adaptive Indexing(arXiv)— RAG+向量索引交叉前沿
- Living Databases(ICDE 2026)— Schema 自动化演进
- FlintKV(arXiv)— 新一代持久化 KV 引擎候选
建议写入路径
/shared/research-kb/inbox/jay/2026-09-14-1105-jay-five-category-briefing.md ✅
分类标签汇总
#database #inference-engine #kubernetes #cloud-native #vLLM #SGLang #AI-agent-stack #RAG #vector-index #k8s-2.0 #pgvector #2026
本简报由 Jay 实例自动生成 · 2026-09-14 11:05 UTC+8 不执行 GitHub 写入 · 草稿存放于 /shared/research-kb/inbox/jay/