inference-changelog
2026-08-21 | Tom
- CoRun连续batching形状固定(15-324%吞吐/bit-identical)+DASH HBM+Flash KV双层管理(MoE 197GB KV→1.92×吞吐/48%降低)+HBF Sucks全栈路线+SGLang Advanced CUDA Graph生产建议(breakable/tc_piecewise vs full)+DeployBase A100基准+ArXiv形式化优化(arXiv:2605.01280)+CSDN OOM计算+gpu_memory_utilization软限制警示+争议新增6条(CoRun可复现性/开源状态/DASH endurance/DASH vs HBF关系/full模式边界/形式化优化实验验证)+引→220(+9)
2026-08-22 | Tom
- vLLM 0.27.1 patch(DSpark修复)+0.27.0详尽release notes(NIXL 1.x/Mooncake KVConnector/561commits)+vLLM安全五连发(CVE-2026-73558/73559/CVE-2026-22778补丁不完整/GHSA-cqm8/GHSA-33cg等)+LMDeploy CVE-2026-33626 SSRF 12h武器化(<0.12.3)+SGLang三CVE(CVE-2026-3059/3060/3989)+Serving Security独立子节+FlashPrefill V2(arXiv:2608.19758块稀疏prefill生产里程碑)+InferScale(arXiv:2607.27090 KV Injection 1.8-4.8GB/conversation)+Online KV Cache Compaction(arXiv:2608.00902)+SGLang vs vLLM Schema 7×差距(深嵌套+42% vs +6%)+HotInfra'26 Memory-Centric KV(PIM-DIMM 39.7×成本降低,研究原型)+DualPath(arXiv:2602.21548v2)+Harvest(arXiv:2602.00328v1生产集群GPU利用率43.48%)+引→234(+14)
2026-08-23 | Tom
- vLLM 0.28(M2默认dense+Experimental Rust前端+DP Supervisor+device_ids变更);HiSparse 4.7×合并SGLang上游(2608.07009);RMM训练无关矩阵乘1B-70B(2608.13426);K8s生产数值层(Mistral-Large 123B 0.344MB/token/128K-44GB/H100并发16-44/KEDA扩缩/GIE路由);DefensiveKV ICLR2026修正SnapKV(39.0分实测vs声称无损/LayerDefensiveKV 91.4/2行KVPRESS);kv-cache-analyzer CLI(RAG-QA within-session30%);Spheron竞品benchmark(vLLM1850/SGLang1920/TRT2100/50并发/TRT冷启动28min);HLD Blog三篇vLLM-V1/SGLang-EPD/PD-disagg架构分析;TurboQuant数字矛盾警示(2.69-4.4×vs6×8×);kv-cache-analyzer可观测性子节;llm-d KV Events upstreamed v0.23;引→245(+11)