Jay 研究知识库 · 晚间简报 · 2026-06-28
本次轮次:第 3 次(晚间场)
主题:Database · Backend · Cloud-Native · Inference Systems · HF Trending
去重依据:已参考 Tomagent-rag-longcontext-radar(2026-06-28 afternoon)和 Stephen HF Daily,无重叠条目
🔴 高价值条目
【Database】SIGMOD 2026 议程精华:向量检索进入主流数据库赛道
来源:SIGMOD 2026 详细议程
标签:database / vector-search / sigmod
摘要:SIGMOD 2026(印度班加罗尔)将向量搜索与索引(Research-27)、LLM+向量检索(Research-8)单列为独立 Track,说明向量数据库已从专用工具升级为 DBMS 内核能力。同时有专门的 Learned & Vector Indexing(Research-14)、Query Processing & Optimization(Industry-3)Track。
关键洞察:Industry-5 专题为"LLM for Data Management, Semantic Systems & AI-Augmented Pipelines",表明数据库社区已正式接纳 LLM 为一等公民。Panel-2 探讨"Practical Secure Databases",隐私计算方向值得关注。
评价:议程层面确认向量搜索进入主流 DBMS,可作为知识库"数据库选型"主题页更新依据。
【Backend / Inference】LMCache:KV Cache 已是企业级第一公民数据结构
来源:Modular MLSys 2026 报道
标签:backend / inference / kv-cache / mlsys2026 | ⭐ 重要
摘要:LMCache 论文(MLSys 2026)在论文中将 KV Cache 从"推理副产品"重新定位为"一等数据结构"。5 周生产遥测数据显示:主流部署中超过 50% 的 KV Cache 已超出单卡显存,需分布式存储;跨用户 token 复用率增长超过 19%。
系统支持:LMCache 现支持 8 种存储后端(NFS / WEKA / GPU-Direct Storage / Mooncake Store / NIXL / S3 / InfiniStore / Valkey),覆盖 NVIDIA / AMD / Ascend / TPU 四种处理器,vLLM / SGLang 双引擎。
评价:这是 inference systems 领域的里程碑式认知转变——KV Cache 不是缓存,是存储。对于知识库"推理系统工程"主题页,该论文是核心引用。
【Inference】HiSparse:稀疏注意力 + 分层内存,GLM-5.1-FP8 吞吐提升 5 倍
来源:Modular MLSys 2026 报道
标签:backend / inference / sparse-attention / glM-5
摘要:SGLang 团队提出 HiSparse,将稀疏注意力与分层内存层次结合:GPU 保留热 KV 区域在设备缓冲区,非活跃条目卸载到主机内存。在 GLM-5.1-FP8 长上下文任务上实现 5 倍吞吐提升。
关联:KIVI / SnapKV / K=V 等 KV 剪枝方向可作为对比参照。
【Inference】Modular MAX vs SGLang vs vLLM:B300 基准实测
来源:Modular MLSys 2026 报道 + SemiAnalysis DeepSeekV4 跟踪
摘要:在 NVIDIA B300 GPU + 400B+ 参数模型上,Modular MAX 实现:
- 平均 TTFT < 500ms(对比 SGLang 快约 30%)
- P99 端到端延迟快 22%
- Flux.2-dev 图像生成比 PyTorch Diffusers + torch.compile 快 6.9 倍(B200)/ 3.8 倍(AMD MI355x)
评价:MAX 在 B300 上的优势来自从 kernel 到云的纵向全栈优化,而非单点改进。对于知识库"推理引擎选型"有重要参考价值。
SemiAnalysis 数据显示 GB300 NVL72 + SGLang 在 DeepSeekV4 推理中持续领先,AMD ROCm vLLM 仍大幅落后 CUDA 版本。
【Backend】vLLM vs SGLang 2026 决策指南(Spheron/TECHSY 综合)
来源:Spheron vLLM vs SGLang 2026 / TECHSY
标签:backend / inference / vllm / sglang / decision-guide
决策矩阵:
| 场景 | 推荐引擎 | 核心理由 |
|---|---|---|
| 前缀/RAG 负载 >60% 共享前缀 | SGLang | RadixAttention 命中率高 |
| 推理依赖 Speculative Decoding | vLLM | Eagle-3 集成更成熟 |
| 多样化硬件(AMD/TPU) | vLLM | 生态最广 |
| NVIDIA 极致性能 | SGLang(H200+)/ TensorRT-LLM | H200 SGLang 性价比最优 |
| 迁移自 TGI | 两者皆可 | 均已支持 OpenAI API |
Benchmark 亮点:H200 + SGLang = 3,200 tok/s,成本 $0.51/1M tokens;H100 + SGLang = 2,550 tok/s,成本 $0.44/1M tokens。
Hugging Face TGI 状态:2025 年 12 月进入维护模式,不再接受新功能 PR,建议迁移 vLLM 或 SGLang。
【Model · HF Trending】2026 年 6 月 HF 热门模型排名
来源:Presenc AI HF Trending June 2026 + Kilo AI Leaderboard + Qubrid AI Coding Guide
2026 年 6 月 HF 下载量 Top 5(文本生成):
| 排名 | 模型 | 机构 | 许可证 | 核心特点 |
|---|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | DeepSeek | DeepSeek License | 1M 上下文,$0.14/M 输入 |
| 2 | Qwen 3.7 (flagship) | Alibaba | Qwen License | 主流最强开源之一 |
| 3 | Gemma 4 (31B Dense) | Apache 2.0 | 单卡可跑,16GB VRAM | |
| 4 | Llama 4.5 Maverick | Meta | Llama License | 平衡性价比 |
| 5 | GLM-6 (flagship MoE) | Zhipu AI | MIT-modified | 高效 MoE |
Coding 模型格局(2026-06-16 更新):
| 模型 | SWE-Bench Verified | 亮点 |
|---|---|---|
| DeepSeek V4-Pro | 80.6% | LiveCodeBench 93.5%,1M 上下文 |
| Kimi K2.6 | 80.2% | 长自主运行、Agent 协作 |
| MiniMax M3 | 59.0% (Pro) | 首个开源 1M 上下文多模态,$0.30/M 输入 |
| GLM-5.1 | SOTA (Pro) | 前端编码最强开源 |
| Qwen3-Coder-480B | 38.70% (Pro 公开榜) | Apache 2.0,最宽松许可 |
| Qwen3.6-27B | 77.2% | 单 GPU 高效 |
重要发布:Kimi K2.7 Code(2026-06-12)是首个在 MCP tool-use 准确率上超越 Claude Opus 4.8 的开源模型。
【Model · Architecture】DeepSeek V4 架构解析:CSA/HCA 混合注意力
来源:BentoML 博客 / Latent.Space AINews
核心架构: - CSA(Compressed Sparse Attention):小 chunk tokens 摘要,新 token 仅 attend 相关摘要集合 - HCA(Heavily Compressed Attention):大 chunk 压缩为单一表示,提供廉价的全局视图 - 两种机制跨层交错,保留近期 token 不压缩(局部精度) - 配合 DeepSeek 稀疏注意力血统,在 1M 上下文下实现高效 KV Cache
评价:CSA/HCA 是对"全注意力和纯稀疏"之间trade-off的工程级解答,对知识库"长上下文推理"主题有直接意义。
🟡 一般候选
| # | 标题 | 来源 | 标签 | 备注 |
|---|---|---|---|---|
| 1 | Actian VectorAI DB:边缘向量数据库,22x QPS 优势 | Actian PR | database / edge-AI | 特定垂直场景,非通用选型 |
| 2 | CrossPool:Cold MoE 权重/KV Cache 分离调度 | arXiv:2606.24506 | backend / inference / moe | 学术前沿,生产待验证 |
| 3 | Eagle-3 Speculative Decoding 生产基准(H100/H200/B200) | Spheron | inference / spec-decoding | 3.5-3.7x 加速,vLLM/SGLang 均已合并 |
| 4 | "开源模型已经够用":Epoch AI 差距分析 + NIST DeepSeek V4-Pro 评估 | Substack (Josep) | model / strategy | 决策参考,非技术深度 |
| 5 | Graph vs Vector DB:企业 AI 混合架构建议 | TigerGraph | database / graph-rag | 常识性总结,价值一般 |
| 6 | AITER + ATOM:AMD ROCm vLLM/SGLang 加速插件 | AMD 活动页面 | backend / inference / amd | 7 月 23 日活动预告 |
分类标签汇总
#database #vector-search #kv-cache #sglang #vllm #tensorrt-llm
#deepseek-v4 #qwen3 #glm-5 #kimi-k2 #minimax-m3 #llama-4
#inference-systems #speculative-decoding #modular-max #mlsys2026
#sigmod2026 #hf-trending #coding-models #moe
#cloud-native #distributed-inference
建议写入路径
草稿路径:/shared/research-kb/inbox/jay/2026-06-28-evening-database-backend-cloudnative-inference.md
主题页更新建议:
1. topics/inference-systems/ → 更新 vLLM vs SGLang 2026 决策矩阵 + H200/B200 基准数据
2. topics/database/ → 新增 SIGMOD 2026 议程要点(向量搜索 DBMS 主流化)
3. topics/long-context/ → DeepSeek V4 CSA/HCA 架构解析
4. topics/kv-cache/ → LMCache 论文核心结论(生产级分布式 KV Cache 存储)
是否需要精读/审稿: - LMCache 论文:建议精读,KV Cache as First-Class Data Structure 是 inference systems 里程碑 - CrossPool 论文:可纳入审稿队列,MoE 分离调度方向有工程价值 - HiSparse(SGLang团队):建议关注,与 RAG/LRA 任务相关
Jay · 2026-06-28 21:05 CST · 晚间简报完成