Jay 研究知识库 · 晚间简报 · 2026-06-28

本次轮次:第 3 次(晚间场)
主题:Database · Backend · Cloud-Native · Inference Systems · HF Trending
去重依据:已参考 Tom agent-rag-longcontext-radar(2026-06-28 afternoon)和 Stephen HF Daily,无重叠条目


🔴 高价值条目

【Database】SIGMOD 2026 议程精华:向量检索进入主流数据库赛道

来源SIGMOD 2026 详细议程
标签:database / vector-search / sigmod

摘要:SIGMOD 2026(印度班加罗尔)将向量搜索与索引(Research-27)、LLM+向量检索(Research-8)单列为独立 Track,说明向量数据库已从专用工具升级为 DBMS 内核能力。同时有专门的 Learned & Vector Indexing(Research-14)、Query Processing & Optimization(Industry-3)Track。

关键洞察:Industry-5 专题为"LLM for Data Management, Semantic Systems & AI-Augmented Pipelines",表明数据库社区已正式接纳 LLM 为一等公民。Panel-2 探讨"Practical Secure Databases",隐私计算方向值得关注。

评价:议程层面确认向量搜索进入主流 DBMS,可作为知识库"数据库选型"主题页更新依据。


【Backend / Inference】LMCache:KV Cache 已是企业级第一公民数据结构

来源Modular MLSys 2026 报道
标签:backend / inference / kv-cache / mlsys2026 | ⭐ 重要

摘要:LMCache 论文(MLSys 2026)在论文中将 KV Cache 从"推理副产品"重新定位为"一等数据结构"。5 周生产遥测数据显示:主流部署中超过 50% 的 KV Cache 已超出单卡显存,需分布式存储;跨用户 token 复用率增长超过 19%。

系统支持:LMCache 现支持 8 种存储后端(NFS / WEKA / GPU-Direct Storage / Mooncake Store / NIXL / S3 / InfiniStore / Valkey),覆盖 NVIDIA / AMD / Ascend / TPU 四种处理器,vLLM / SGLang 双引擎。

评价:这是 inference systems 领域的里程碑式认知转变——KV Cache 不是缓存,是存储。对于知识库"推理系统工程"主题页,该论文是核心引用。


【Inference】HiSparse:稀疏注意力 + 分层内存,GLM-5.1-FP8 吞吐提升 5 倍

来源Modular MLSys 2026 报道
标签:backend / inference / sparse-attention / glM-5

摘要:SGLang 团队提出 HiSparse,将稀疏注意力与分层内存层次结合:GPU 保留热 KV 区域在设备缓冲区,非活跃条目卸载到主机内存。在 GLM-5.1-FP8 长上下文任务上实现 5 倍吞吐提升。

关联:KIVI / SnapKV / K=V 等 KV 剪枝方向可作为对比参照。


【Inference】Modular MAX vs SGLang vs vLLM:B300 基准实测

来源Modular MLSys 2026 报道 + SemiAnalysis DeepSeekV4 跟踪

摘要:在 NVIDIA B300 GPU + 400B+ 参数模型上,Modular MAX 实现: - 平均 TTFT < 500ms(对比 SGLang 快约 30%) - P99 端到端延迟快 22% - Flux.2-dev 图像生成比 PyTorch Diffusers + torch.compile 快 6.9 倍(B200)/ 3.8 倍(AMD MI355x)

评价:MAX 在 B300 上的优势来自从 kernel 到云的纵向全栈优化,而非单点改进。对于知识库"推理引擎选型"有重要参考价值。

SemiAnalysis 数据显示 GB300 NVL72 + SGLang 在 DeepSeekV4 推理中持续领先,AMD ROCm vLLM 仍大幅落后 CUDA 版本。


【Backend】vLLM vs SGLang 2026 决策指南(Spheron/TECHSY 综合)

来源Spheron vLLM vs SGLang 2026 / TECHSY
标签:backend / inference / vllm / sglang / decision-guide

决策矩阵

场景 推荐引擎 核心理由
前缀/RAG 负载 >60% 共享前缀 SGLang RadixAttention 命中率高
推理依赖 Speculative Decoding vLLM Eagle-3 集成更成熟
多样化硬件(AMD/TPU) vLLM 生态最广
NVIDIA 极致性能 SGLang(H200+)/ TensorRT-LLM H200 SGLang 性价比最优
迁移自 TGI 两者皆可 均已支持 OpenAI API

Benchmark 亮点:H200 + SGLang = 3,200 tok/s,成本 $0.51/1M tokens;H100 + SGLang = 2,550 tok/s,成本 $0.44/1M tokens。

Hugging Face TGI 状态:2025 年 12 月进入维护模式,不再接受新功能 PR,建议迁移 vLLM 或 SGLang。


【Model · HF Trending】2026 年 6 月 HF 热门模型排名

来源Presenc AI HF Trending June 2026 + Kilo AI Leaderboard + Qubrid AI Coding Guide

2026 年 6 月 HF 下载量 Top 5(文本生成)

排名 模型 机构 许可证 核心特点
1 DeepSeek V4.1 Flash DeepSeek DeepSeek License 1M 上下文,$0.14/M 输入
2 Qwen 3.7 (flagship) Alibaba Qwen License 主流最强开源之一
3 Gemma 4 (31B Dense) Google Apache 2.0 单卡可跑,16GB VRAM
4 Llama 4.5 Maverick Meta Llama License 平衡性价比
5 GLM-6 (flagship MoE) Zhipu AI MIT-modified 高效 MoE

Coding 模型格局(2026-06-16 更新)

模型 SWE-Bench Verified 亮点
DeepSeek V4-Pro 80.6% LiveCodeBench 93.5%,1M 上下文
Kimi K2.6 80.2% 长自主运行、Agent 协作
MiniMax M3 59.0% (Pro) 首个开源 1M 上下文多模态,$0.30/M 输入
GLM-5.1 SOTA (Pro) 前端编码最强开源
Qwen3-Coder-480B 38.70% (Pro 公开榜) Apache 2.0,最宽松许可
Qwen3.6-27B 77.2% 单 GPU 高效

重要发布:Kimi K2.7 Code(2026-06-12)是首个在 MCP tool-use 准确率上超越 Claude Opus 4.8 的开源模型。


【Model · Architecture】DeepSeek V4 架构解析:CSA/HCA 混合注意力

来源BentoML 博客 / Latent.Space AINews

核心架构: - CSA(Compressed Sparse Attention):小 chunk tokens 摘要,新 token 仅 attend 相关摘要集合 - HCA(Heavily Compressed Attention):大 chunk 压缩为单一表示,提供廉价的全局视图 - 两种机制跨层交错,保留近期 token 不压缩(局部精度) - 配合 DeepSeek 稀疏注意力血统,在 1M 上下文下实现高效 KV Cache

评价:CSA/HCA 是对"全注意力和纯稀疏"之间trade-off的工程级解答,对知识库"长上下文推理"主题有直接意义。


🟡 一般候选

# 标题 来源 标签 备注
1 Actian VectorAI DB:边缘向量数据库,22x QPS 优势 Actian PR database / edge-AI 特定垂直场景,非通用选型
2 CrossPool:Cold MoE 权重/KV Cache 分离调度 arXiv:2606.24506 backend / inference / moe 学术前沿,生产待验证
3 Eagle-3 Speculative Decoding 生产基准(H100/H200/B200) Spheron inference / spec-decoding 3.5-3.7x 加速,vLLM/SGLang 均已合并
4 "开源模型已经够用":Epoch AI 差距分析 + NIST DeepSeek V4-Pro 评估 Substack (Josep) model / strategy 决策参考,非技术深度
5 Graph vs Vector DB:企业 AI 混合架构建议 TigerGraph database / graph-rag 常识性总结,价值一般
6 AITER + ATOM:AMD ROCm vLLM/SGLang 加速插件 AMD 活动页面 backend / inference / amd 7 月 23 日活动预告

分类标签汇总

#database  #vector-search  #kv-cache  #sglang  #vllm  #tensorrt-llm
#deepseek-v4  #qwen3  #glm-5  #kimi-k2  #minimax-m3  #llama-4
#inference-systems  #speculative-decoding  #modular-max  #mlsys2026
#sigmod2026  #hf-trending  #coding-models  #moe
#cloud-native  #distributed-inference

建议写入路径

草稿路径/shared/research-kb/inbox/jay/2026-06-28-evening-database-backend-cloudnative-inference.md

主题页更新建议: 1. topics/inference-systems/ → 更新 vLLM vs SGLang 2026 决策矩阵 + H200/B200 基准数据 2. topics/database/ → 新增 SIGMOD 2026 议程要点(向量搜索 DBMS 主流化) 3. topics/long-context/ → DeepSeek V4 CSA/HCA 架构解析 4. topics/kv-cache/ → LMCache 论文核心结论(生产级分布式 KV Cache 存储)

是否需要精读/审稿: - LMCache 论文:建议精读,KV Cache as First-Class Data Structure 是 inference systems 里程碑 - CrossPool 论文:可纳入审稿队列,MoE 分离调度方向有工程价值 - HiSparse(SGLang团队):建议关注,与 RAG/LRA 任务相关


Jay · 2026-06-28 21:05 CST · 晚间简报完成