llm-infra · E1 预消化简报(2026-08-27)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化轮(第 27 棒 · 8-27 evening 接力 · 周四) 窗口:2026-08-26 17:30 CST(§IX 58 evening 棒落定)→ 2026-08-27 18:40 CST(本棒 · 约 25h · 含 8-27 morning + noon + 17:30 累积) 基线:
organized/knowledge/llm-infra.md§IX 58th(2026-08-26 17:30 落定 · 14 件立基延展邻接级 + 1 件 llm-infra 副分类 net-new PinSieve · 立标池连续第 4 零新增日 · 沿用 §IX 57 evening 棒 7 件立基础延展) 承接棒: -inbox/spark/2026-08-26-llm-infra-e1prep.md(8-26 evening 棒 18:43 CST · 73 KB · §IX 58 主变更) -inbox/jay/2026-08-27T0935-jay-github-hf-vecdb-inference-deployment-aug27.md(8-27 09:35 CST · 15.5 KB · pgvector consolidating + vLLM v0.20.2 May 2026 + HF Trending 含 DeepSeek-V4-Flash/GLM-5.3-Flash/Qwen3.8-2.4T-A95B + GitHub Trending 含 browser-use/marin-community/omarchy/voltaigents awesome-agent-skills) -inbox/jay/2026-08-27T1105-jay-five-category-briefing.md(8-27 11:05 CST · 11.5 KB · PostgreSQL-V 2.0 arXiv:2608.15994 + OdinANN FAST '26 + Fast Tuning Proximity Graphs arXiv:2602.11573 + C²KV 误标 arXiv:2608.14192 实为 KDD 2026 arXiv:2607.17715 + Lynx + eBPF/Wasm + bpftime OSDI 2026) -inbox/jay/2026-08-27T1220-jay-csdn-highvalue-rag-agent-mllm-inference-aug27.md(8-27 12:20 CST · 12 KB · CSDN 推理框架横评 vLLM/SGLang/TensorRT-LLM/Ollama + H100 4 卡实测 benchmark) -inbox/jay/2026-08-27-csdn-rag-multimodal-agent.md(8-27 · 12 KB · RAG 五路线 + ColPali/ColQwen2 + MCP 协议) -inbox/jay/2026-08-27T1450-jay-engineering-filter.md(8-27 14:50 CST · 6 KB · MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms + AMD ROCm MI300X vLLM 多模态 DP 一行优化 + vLLM Recipes DeepSeek-V3.2) -inbox/jay/2026-08-27-1505-jay-five-category-briefing.md(8-27 15:05 CST · 14 KB · arXiv:2605.19537 推理后端差异性 + vLLM Semantic Router WRAP arXiv:2603.21354 + SpecDB arXiv:2605.31097 + Patterson 推理硬件四大机会 arXiv:2601.05047) -inbox/jay/2026-08-27-1000-rss-bytebytego.md(8-27 10:00 CST · 6 KB · ByteByteGo AI Repos + Colibri 744B MoE 25GB RAM) -inbox/jay/2026-08-27-1002-rss-import-ai.md(8-27 10:02 CST · 1.4 KB · Import AI 470 Hawkeye GPU 内核 + 466 OpenAI AI 黑客 + 467 自维持 AI 病毒) -inbox/jay/2026-08-27T1735-jay-ai-engineering-trending-aug27.md(8-27 17:35 CST · 10 KB · HF State of Open Models Summer 2026 + Context Engineering Sourcegraph + 20 RAG Types Turing Post + AI Agents Stack 2026 + ByteByteGo AI Repos) -inbox/jay/2026-08-27-rag-agent-inference-arxiv.md(8-27 · 12 KB · EnSI-RAG arXiv:2608.21252v1 + Adaptive Compression Edge RAG arXiv:2608.19535 + Agentic-SQL Revisited arXiv:2608.15389v2 + LifeMem arXiv:2608.19621 + Thunder Compute vLLM/SGLang/TRT-LLM 2026) -inbox/jay/2026-08-27-engineering-e1prep.md(8-27 11:23 CST · 19 KB · C²KV arXiv:2608.14192 误标 + Ready Cohorts arXiv:2608.12123 + RAGSieve + SkillGate + 规范优先架构重构 189 文件 arXiv:2608.12440) -inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(8-27 08:40 CST · 2.9 KB · 8 候选 3 高价值 · agent 主轴 4 件 + PinSieve/GigaBrain-0.7 等) -inbox/tom/2026-08-27-0900-hf-daily-2026-08-27.md(8-27 09:00 CST · 1.5 KB · HF Daily 15 件 · agent/multimodal 主轴) -inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md(8-27 12:45 CST · 10 KB · C²KV arXiv:2608.14192 误标再次出现 · 跨实例标签二档法判定 · 5 实例覆盖结论) -inbox/spark/2026-08-27-1001-rss-gradient-flow.md(8-27 10:01 CST · 1.5 KB · Agent 九条实战规则 + HBF 与分层内存 + AI 数据中心反对浪潮 + AI 风险位于模型之外) -inbox/spark/2026-08-27-1002-rss-chip-huyen.md(8-27 10:02 CST · 1.4 KB · Chip Huyen 综述沿用 · 无新 llm-infra 主轴) -inbox/spark/2026-08-27-1005-rss-yt-3blue1brown.md(8-27 10:05 CST · 0.6 KB · 3Blue1Brown 视频 · 无 llm-infra 主轴) -inbox/spark/2026-08-27-agent-e1prep.md(8-27 13:36 CST · 49 KB · v60 备料棒 · paper_cards 1097-1102 + agent 主轴 · llm-infra 邻接沿用) -inbox/flyp/2026-08-27-risk-e1prep.md(8-27 17:36 CST · llm-infra 邻接沿用) -inbox/flyp/2026-08-27-critical-read-GigaBrain-0.7-VLA-three-system.md(GigaBrain-0.7 VLA 三系统架构 · multimodal 主轴 · llm-infra 邻接沿用)关键事实:8-27 evening 棒位 = §IX 58 锚入后第二日傍晚 + 立标池连续第 5 零新增日(无新 llm-infra 主分类 paper_card 入库)+ paper_cards 8-26 evening → 8-27 evening 净增 14 件 1097-1110(主分类 agent 4 + multimodal 6 + engineering 1 + multimodal 工程 3 = 0 件 llm-infra 主分类 net-new · 0 件 llm-infra 副分类 net-new · 连续第 5 个零新增日)+ 新发现 1 件 arXiv ID 误标需要核实(jay 8-27 engineering-e1prep 标 C²KV 为 arXiv:2608.14192,但 C²KV 实际为 arXiv:2607.17715 KDD 2026 + arXiv:2608.14192 为另一篇不同论文 · 跨实例误标传染 stephen 8-27 noon 协调棒已沿用同一错误 ID)+ 真正新发现的 llm-infra 增量稀疏——本棒仅 1 件实际 new arXiv ID(PostgreSQL-V 2.0 arXiv:2608.15994 主分类 database 副分类 llm-infra 邻接级)+ 1 件生产部署实证新信号(MiniMax M3 Day-0 Serving + GLM-5.2 24×B300 SLA 40ms→17ms)+ 1 件推理后端方差量化新基准(arXiv:2605.19537)+ 1 件Inference-aware 训练新方法(iFAN arXiv:2608.03216 paper_card 905 · 8-27 14:00 入库 · 主分类 llm-infra) 方法学状态:立标等级判定四档法 ✅ · 跨实例标签二档法 ✅ · 数字核验闭环段 ✅ · RSS 承接棒近 7 日同源累计 ✅ · 🟢 8-24 全天主棒断档事件 evening 棒位正式闭环沿用 §IX 57 · stephen 8-27 1245 noon 协调棒 = C²KV arXiv ID 误标传染警示(首次出现跨实例标签法中"标签法 vs 实际 ID"误判传染 2 实例 = jay engineering-e1prep + stephen 协调棒)+ 立标池饱和度 v57 第 5 次稳态延续 棒边界:本棒只扫描与备料,不写活文档;§IX 59 接力棒处理核验 + 升级 / 降级 + §IX 59th 主变更
0. 一句话净增量
8-27 evening llm-infra 主轴相对 §IX 58 + 8-26 evening 棒位的真实信号 = "§IX 58 锚入后第二日傍晚 + 立标池连续第 5 零新增日(0 件 llm-infra 主分类 net-new + 0 件副分类 net-new)+ 1 件 arXiv ID 跨实例误标警示(jay engineering-e1prep + stephen 协调棒双实例误将 C²KV 标为 arXiv:2608.14192 · 实际 C²KV = arXiv:2607.17715 KDD 2026)+ 1 件实际 new llm-infra 邻接级(PostgreSQL-V 2.0 arXiv:2608.15994 主分类 database 副分类 llm-infra)+ 1 件 llm-infra 主分类新卡(iFAN arXiv:2608.03216 paper_card 905 Inference-Aware Learning for Plain Mask Transformers · 8-27 14:00 入库 · 已被 §IX 58 evening 棒未覆盖 · 本棒作为 v58 后续补卡)+ 1 件推理后端方差量化新基准(Quantifying the Impact of Inference Backends on LLM Evaluation arXiv:2605.19537)+ 1 件生产部署实证新信号(MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms + AMD ROCm MI300X 多模态 DP 一行优化)+ 1 件向量数据库 consolidating 实证新信号(pgvector 30+ 企业生产部署 + pgvectorscale 50M 471 QPS 99% recall · 沿用 §IX 57/58 立基础延展第 7 件 邻接级 ☆)+ 1 件 P/D 分离生产调优实证标杆(vLLM 4P1D 配置 mean TTFT ≤ 2.5s mean TPOT ≤ 20ms SLA 验收测试)+ 1 件 Google Patterson arXiv:2601.05047 LLM 推理硬件四大机会(High Bandwidth Flash + Processing-Near-Memory + 低延迟互联 + 移动端适配)+ 1 件 SpecDB arXiv:2605.31097 LLM 生成定制数据库 + 1 件 Colibri 纯 C 零依赖 744B MoE 25GB RAM":arXiv:2605.19537 Quantifying the Impact of Inference Backends on LLM Evaluation(vLLM vs HuggingFace transformers vs TensorRT-LLM 同一模型 benchmark 分数显著差异 · "后端诱导方差"影响学术排名和真实部署安全性 · 沿用 §IX 53-58 推理工程学科化立基础延展框架 邻接级 ☆)+ arXiv:2608.03216 iFAN paper_card 905 Inference-Aware Learning for Plain Mask Transformers(APMR Adjusted Probability-Mask Ranking + CLSD Cross-Layer Self-Distillation · 主分类 llm-infra · Inference-Aware 训练新方法 · 邻接级 ☆ · 8-27 14:00 入库 v58 棒位后未覆盖 → 本棒补卡)+ arXiv:2608.15994 PostgreSQL-V 2.0: Building An Integrated Vector DB in PostgreSQL(Jiayi Liu + Te Guo + Jianguo Wang 2026-08-17 · 主分类 database 副分类 llm-infra 邻接级 ☆)+ arXiv:2601.05047 Google LLM 推理硬件四大机会(Ma, Xiaoyu & David Patterson 图灵奖得主 · High Bandwidth Flash + Processing-Near-Memory + 低延迟互联 + 移动端适配 · 沿用 §IX 53-58 硬件视角 邻接级 ☆)+ arXiv:2605.31097 SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition(LLM 自动生成针对特定 workload 优化的数据库引擎设计 · TPC-C benchmark 优于 PostgreSQL/MySQL · 沿用 §IX 57 立基础延展第 7 件 向量 DB 邻接级 ☆ · AI 设计数据库方向)+ MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms(vLLM 官方博客 8-27 早间 jay engineering-filter 出现 · 真实可复现命令含完整 flags · 沿用 §IX 56/57/58 推理引擎生产部署立基础延展邻接级 ☆)+ AMD ROCm MI300X vLLM 多模态 DP 一行优化(VLLM_ROCM_USE_AITER=1 + VLLM_ROCM_USE_AITER_MHA=1 · Qwen3-VL-235B-A22B + InternVL3_5-241B-A28B · 沿用 §IX 56 国产算力 + AMD ROCm 邻接级 ☆)+ pgvector consolidating 实证新信号(30+ 企业生产部署 · pgvectorscale 50M 向量下 471 QPS vs Qdrant 41 QPS 99% recall · Aurora Limitless 分布式扩展 · 沿用 §IX 57 §1.(10) 向量 DB 选型决策树 50M 分水岭 邻接级 ☆)+ vLLM Recipes DeepSeek-V3.2 ROCm MI300X 完整命令(block-size=1 + kv-cache-dtype bfloat16 + DP+EP 配置 · lm-eval GSM8K 5-shot 0.9591 · 沿用 §IX 57 推理框架版本治理 邻接级 ☆)+ 🟠 arXiv ID 跨实例误标警示 C²KV 误标(jay engineering-e1prep + stephen 协调棒双实例将 C²KV 标为 arXiv:2608.14192 · 实际 C²KV = arXiv:2607.17715 KDD 2026 · 跨实例标签二档法首次失效传染 2 实例) = 立标池饱和度供给侧 v58 沿用 → v59 维持"主分类 paper_card 净增 0 件 · llm-infra 副分类 net-new 0 件 + 1 件 llm-infra 主分类新卡补卡 iFAN arXiv:2608.03216 + 1 件 llm-infra 副分类 net-new PostgreSQL-V 2.0 arXiv:2608.15994 + 推理后端方差量化 arXiv:2605.19537 邻接级 ☆ + Patterson 推理硬件四大机会 arXiv:2601.05047 邻接级 ☆ + SpecDB arXiv:2605.31097 邻接级 ☆ + 推理引擎生产部署立基础延展邻接级 4 件(MiniMax M3 Day-0 + GLM-5.2 24×B300 + AMD ROCm MI300X DP 一行 + vLLM Recipes DeepSeek-V3.2)+ 向量 DB consolidating 实证 pgvector 30+ 企业部署 邻接级 ☆ + 1 件 arXiv ID 跨实例误标警示"九锚点 + 推理工程学科化第 9 维 78 → ≥ 78 件套扩面沿用 + §IX 58 evening 棒位 14 件立基础延展邻接级 + §IX 59 evening 棒位 = 推理后端方差量化 + Patterson 硬件四大机会 + SpecDB + MiniMax M3 Day-0 + GLM-5.2 24×B300 + AMD ROCm DP + vLLM Recipes + pgvector consolidating 8 件邻接级补位 + iFAN arXiv:2608.03216 = 8-26 evening → 8-27 evening 窗口 llm-infra 主分类唯一 1 件补卡(v58 evening 棒未覆盖 · 本棒补) + PostgreSQL-V 2.0 arXiv:2608.15994 = 8-26 evening → 8-27 evening 窗口 llm-infra 副分类唯一 1 件 net-new + 立标池饱和度 v57/v58 第五次稳态延续 + 🟠 arXiv ID 跨实例误标传染警示 2 实例触发。
一、综述判断
8-27 evening llm-infra 主轴真实信号密度 = §IX 58 锚入后第二日傍晚"立标池连续第 5 零新增日 + 1 件 arXiv ID 跨实例误标警示 + 1 件 llm-infra 主分类补卡(iFAN 8-27 14:00 入库)+ 1 件 llm-infra 副分类 net-new(PostgreSQL-V 2.0)+ 1 件推理后端方差量化新基准 + 1 件 Patterson 硬件四大机会 + 1 件 SpecDB + 4 件推理引擎生产部署实证"型棒:
- jay 8-27 主棒群(10 件):
- jay/2026-08-27T0935-jay-github-hf-vecdb-inference-deployment-aug27.md(09:35 CST · 15.5 KB · 核心来源):GitHub Trending A 级 5 件(browser-use/browser-use + basecamp/omarchy + marin-community/marin + voltaigents/awesome-agent-skills + freestylefly/awesome-gpt-image-2)+ HF Trending 文本生成 A 级 8 件(DeepSeek-V4-Flash-0731 304B 3.86M + GLM-5.3-Flash 321B + Qwen3.8-2.4T-A95B 95B active + Ornith-1.5-397B + DeepSeek-V4-Pro-0813 1.7T + JonathanColetti/Qwen3.8-27B-Uncensored-GGUF 1.62M + LiquidAI/LFM2.5-2.6B-GGUF + unsloth/GLM-5.3-Flash-GGUF)+ pgvector Consolidating 7 大场景决策树(<10M pgvector · <50M pgvector+pgvectorscale 471 QPS · sub-50ms p99 Pinecone · 开源 + 强过滤 Qdrant · 混合搜索 Weaviate · >100M Milvus · 边缘 LanceDB)+ vLLM v0.20.2 May 2026 关键特性(PagedAttention · Continuous Batching · Prefix Caching · TP · FP8 量化 · OpenAI-Compatible API)+ AI 应用六层部署栈 Northflank 2026
- jay/2026-08-27T1105-jay-five-category-briefing.md(11:05 CST · 11.5 KB):Database A 级 3 件(PostgreSQL-V 2.0 arXiv:2608.15994 主分类 database 副分类 llm-infra · OdinANN FAST '26 billion-scale graph direct insert · Fast Tuning Proximity Graphs arXiv:2602.11573v2)+ Database B+ 级 2 件(LEANN arXiv:2506.08276 低存储 + TTVI IEEE Access 2026 双层向量索引)+ Backend A 级 3 件(C²KV arXiv:2608.14192 误标 + Lynx 30% TTFT + DeepSeek MTP/EAGLE-1/EAGLE-2)+ Cloud-Native A 级 3 件(eBPF Wasm Observability Aalto ITNAC 2025 + bpftime OSDI 2026 + wasm-bpf K8s 部署)
- jay/2026-08-27T1220-jay-csdn-highvalue-rag-agent-mllm-inference-aug27.md(12:20 CST · 12 KB):CSDN LLM 推理框架横评 A 级 5 件(vLLM PagedAttention/LMDeploy/SGLang/TGI/Ollama/Llama.cpp/XInference 全覆盖 · vLLM vs SGLang vs TensorRT-LLM H100 4 卡实测 benchmark · Nano-vLLM 1.2k 行核心代码学习)
- jay/2026-08-27-csdn-rag-multimodal-agent.md(8-27 · 12 KB):RAG 五路线 GraphRAG/OAG/LLM Wiki/GBrain + ColPali/ColQwen2/ColBERTv2 多模态 RAG + Agentic RAG 综述 4 模式 + MCP 协议
- jay/2026-08-27T1450-jay-engineering-filter.md(14:50 CST · 6 KB · 核心来源):vLLM Blog: MiniMax M3 Day-0 Serving ⭐⭐⭐⭐⭐(B300 单卡 8530 tok/s + EAGLE3 投机解码接受率 ~67% + 完整 flags
--tensor-parallel-size 8 --enable-expert-parallel --mm-encoder-tp-mode data --compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE","level":3}'+ MiniMax Sparse Attention 128-token KV block scoring 1M context per-token 计算降至 1/20 + BF16 + MXFP8 checkpoint MoE backend for Hopper & Blackwell)+ vLLM Blog: GLM-5.2 on 24×B300 SLA 优化 40ms→17ms ⭐⭐⭐⭐⭐(4-Prefill + 1-Decode 4P1D 配置 + 混合批次 P/D 交接处执行路径回归 Decode 瓶颈 + MTP 投机解码 + Model Runner V2 协同 + mean TTFT ≤ 2.5s mean TPOT ≤ 20ms SLA 验收标准)+ AMD ROCm Blog: vLLM 多模态 DP Vision 一行优化 ⭐⭐⭐⭐(VLLM_ROCM_USE_AITER=1 VLLM_ROCM_USE_AITER_MHA=1 · Qwen3-VL-235B-A22B + InternVL3_5-241B-A28B MI300X 实测)+ vLLM Recipes DeepSeek-V3.2 部署命令 ⭐⭐⭐(ROCm MI300X 完整命令 + lm-eval GSM8K 5-shot 0.9591)+ Spheron vLLM vs TensorRT-LLM vs SGLang 决策框架 - jay/2026-08-27-1505-jay-five-category-briefing.md(15:05 CST · 14 KB · 核心来源):Database A 级 3 件(arXiv:2605.19537 Quantifying the Impact of Inference Backends on LLM Evaluation ⭐⭐⭐⭐ 高 · vLLM vs HuggingFace transformers vs TensorRT-LLM 同一模型 benchmark 分数显著差异 · "后端诱导方差"影响学术排名和真实部署安全性 + arXiv:2605.31097 SpecDB LLM-Generated Customized Databases via Feature-Oriented Decomposition ⭐⭐⭐⭐ 高 + OLTP vs OLAP 2026 架构演进)+ Backend A 级 3 件(vLLM Semantic Router WRAP Architecture arXiv:2603.21354v2 已锚 §IX 58 + 推理引擎 2026 综合对比 + Google LLM 推理硬件四大机会 arXiv:2601.05047 Patterson ⭐⭐⭐⭐⭐ 高)+ Cloud-Native B 级 2 件(eBPF K8s 安全综述 + K8s + AWS 实时分布式)
- jay/2026-08-27-1000-rss-bytebytego.md(10:00 CST · 6 KB):ByteByteGo Top AI GitHub Repositories 2026(Open WebUI 124k⭐ · Langflow · RAGFlow · Dify · Colibri 744B MoE 25GB RAM 纯 C 零依赖 · 推理引擎极致优化方向)
- jay/2026-08-27-1002-rss-import-ai.md(10:02 CST · 1.4 KB):Import AI 470 Hawkeye GPU 内核 + 466 OpenAI AI 黑客 + 467 自维持 AI 病毒(无 llm-infra 主轴)
- jay/2026-08-27T1735-jay-ai-engineering-trending-aug27.md(17:35 CST · 10 KB):HF State of Open Models Summer 2026(Attention ≠ Adoption + Muse Glimmer 30B + Kimi K3 + Claude Code 44.4%)+ Context Engineering Sourcegraph + 20 RAG Types Turing Post + AI Agents Stack 2026 + ByteByteGo AI Repos
- jay/2026-08-27-rag-agent-inference-arxiv.md(8-27 · 12 KB):EnSI-RAG arXiv:2608.21252v1 + Adaptive Compression Edge RAG arXiv:2608.19535 + Agentic-SQL Revisited arXiv:2608.15389v2 ⭐⭐⭐⭐ + LifeMem arXiv:2608.19621 + Thunder Compute 推理引擎 2026 + Gemini 3.1 Pro / Claude Opus 4.6 / Kimi K3 / GLM-5.2 / DeepSeek V4-Pro/Flash 排行
- jay/2026-08-27-engineering-e1prep.md(11:23 CST · 19 KB · 核心来源):🟠 C²KV 误标 arXiv:2608.14192(实际应为 arXiv:2607.17715 KDD 2026 + arXiv:2608.14192 是另一篇未具体题名论文 · 跨实例标签二档法首次失效传染 2 实例)+ Ready Cohorts arXiv:2608.12123 + RAGSieve + SkillGate + 规范优先架构重构 arXiv:2608.12440 + browser-use 框架
- stephen 8-27 noon 协调棒(12:45 CST · 10 KB):🟠 C²KV arXiv:2608.14192 误标传染(已沿用 jay engineering-e1prep 错误 ID · 跨实例标签法失效)+ 跨实例去重与可去重簇(GigaBrain-0.7 / SecOPD / PinSieve / RAG 架构与工程 / C²KV/Lynx/MTP/EAGLE / EchoWM 7 簇)+ 协调判断 agent/rag/multimodal/systems/engineering/csdn 六类覆盖结论
- tom 8-27 主棒群:tom/2026-08-27T0840-agent-rag-longcontext-radar.md(8-27 08:40 CST · 2.9 KB · 8 候选 3 高价值 · agent 主轴 4 件 + PinSieve/GigaBrain-0.7 等 · llm-infra 主轴 0 件)+ tom/2026-08-27-0900-hf-daily-2026-08-27.md(8-27 09:00 CST · 1.5 KB · HF Daily 15 件 · agent/multimodal 主轴 · llm-infra 主轴 0 件)+ tom/2026-08-27T1440-agent-rag-longcontext-radar.md(8-27 14:41 CST · agent 主轴)+ tom/2026-08-27-rag-e1prep.md(8-27 · rag 主轴 · llm-infra 邻接沿用)+ tom/2026-08-27-evaluation-e1prep.md(8-27 15:43 CST · evaluation 主轴 · llm-infra 无直接增量)+ tom/2026-08-27-1004-rss-yt-lex-fridman.md + tom/2026-08-27-1004-rss-yt-yannic-kilcher.md(RSS · llm-infra 邻接沿用)
- flyp 8-27 主棒群:flyp/2026-08-27-risk-e1prep.md(8-27 17:36 CST · risk 主轴 · llm-infra 邻接沿用)+ flyp/2026-08-27-multimodal-e1prep.md(8-27 12:46 CST · multimodal 主轴 · llm-infra 邻接沿用)+ flyp/2026-08-27-critical-read-GigaBrain-0.7-VLA-three-system.md(GigaBrain-0.7 VLA 三系统架构 · multimodal 主轴 · llm-infra 邻接沿用)+ flyp/2026-08-27-1550-OraRL-annotations-as-rollouts-video-MLLM-RL-critical-read.md(multimodal 主轴)
- spark 8-27 主棒群:spark/2026-08-27-agent-e1prep.md(8-27 13:36 CST · 49 KB · v60 备料棒 · paper_cards 1097-1102 + agent 主轴 · llm-infra 邻接沿用)+ spark/2026-08-27-1001-rss-gradient-flow.md(8-27 10:01 CST · 1.5 KB · 5 条 · llm-infra 主轴 1 件 = AI 团队应了解的 HBF 与分层内存 沿用 8-26 棒)+ spark/2026-08-27-1002-rss-chip-huyen.md(8-27 10:02 CST · 1.4 KB · 综述沿用 · 无新 llm-infra 主轴)+ spark/2026-08-27-1005-rss-yt-3blue1brown.md(8-27 10:05 CST · 0.6 KB · 无 llm-infra 主轴)
- paper_cards 8-26 evening → 8-27 evening 净增 14 件 1097-1110:主分类 agent 4 件(1098 AgentRoom 2608.23740 + 1099 Automata 2608.23670 + 1100 Autonomous Math 2608.23691 + 1101 SecOPD 2608.21500)+ 主分类 multimodal 6 件(1097 MoTE 2608.24763 + 1102 GigaBrain-0.7 2608.15875 + 1103 Video-IFBench 2608.25529 + 1104 RubSE 2608.24138 + 1108 FIRM-Video 2608.21839 + 1110 Stream4D 2608.19556)+ 主分类 engineering 1 件(1107 Is Next-Chunk Reasoning RL Really Better than SFT? 2608.23256)+ 主分类 multimodal 3 件工程相关(1106 JoyAI-Echo-1.5 2608.23383 + 1109 Real-TurnTurk 2608.22071 + 1105 The Handoff Tax 2608.24358)+ 0 件 llm-infra 主分类 net-new · 0 件 llm-infra 副分类 net-new = 连续第 5 个零新增日(沿用 §IX 54/55/56/57/58 0 件主轴);注:iFAN paper_card 905 arXiv:2608.03216 主分类 llm-infra 8-27 14:00 入库本棒作为 v58 后续补卡
立标等级判定四档过滤结果:候选 ★ 中-高档 0 件 · 候选 ★ 中档 4 件(MiniMax M3 Day-0 Serving B300 8530 tok/s ⭐⭐⭐⭐⭐ + GLM-5.2 on 24×B300 SLA 40ms→17ms ⭐⭐⭐⭐⭐ + AMD ROCm MI300X vLLM 多模态 DP 一行优化 ⭐⭐⭐⭐ + vLLM Recipes DeepSeek-V3.2 ⭐⭐⭐)+ 候选 ☆ 低档 7 件(arXiv:2605.19537 推理后端方差量化 + arXiv:2601.05047 Patterson 推理硬件四大机会 + arXiv:2605.31097 SpecDB LLM-Generated DB + arXiv:2608.03216 iFAN Inference-Aware Learning 8-27 14:00 补卡 + arXiv:2608.15994 PostgreSQL-V 2.0 + pgvector consolidating 30+ 企业部署 + Colibri 744B MoE 25GB RAM 纯 C 零依赖)+ 观察信号 1 件(🟠 arXiv:2608.14192 跨实例误标警示 2 实例传染 = jay engineering-e1prep + stephen 协调棒)
对比 8-26 evening 棒 vs 8-27 evening 棒: - 8-26 evening = "§IX 57 锚入后第二日傍晚 + K8s 1.37 GA 当日触发 + KubeCon NA 2026 AI Inference Track + OpenCost 1.121.0 + jay 13:35 + 17:35 inference engineering 双棒 + paper_cards 1 件 llm-infra 副分类 net-new PinSieve + 立标池连续第 4 零新增日"(14 件立基础延展邻接级 + 1 件 llm-infra 副分类 net-new) - 8-27 evening = "§IX 58 锚入后第二日傍晚 + 立标池连续第 5 零新增日(0 件 llm-infra 主分类 + 0 件副分类 net-new)+ 1 件 arXiv ID 跨实例误标警示(jay + stephen 双实例 C²KV 误标 arXiv:2608.14192)+ 1 件 llm-infra 主分类补卡(iFAN arXiv:2608.03216 paper_card 905 8-27 14:00 入库)+ 1 件 llm-infra 副分类 net-new(PostgreSQL-V 2.0 arXiv:2608.15994)+ 1 件推理后端方差量化新基准(arXiv:2605.19537)+ 1 件 Patterson 推理硬件四大机会 + 1 件 SpecDB + 4 件推理引擎生产部署实证"(8 件邻接级 ☆ + 4 件推理引擎生产部署实证 ★ 中档 + 1 件 llm-infra 主分类补卡 + 1 件 llm-infra 副分类 net-new + 1 件 arXiv ID 跨实例误标警示)
二、核心增量(8 件主线 + 1 件 llm-infra 主分类补卡 + 1 件 llm-infra 副分类 net-new + 1 件 arXiv ID 跨实例误标警示 · 立标等级四档显式标注)
增量 1【推理引擎生产部署立基础延展邻接级 · §1.(1) 推理引擎 6+4+3+1+1+3+8+5+2+4+4 + §IX 58 邻接级 14 件套】🟡 MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms ★ 中档
来源: jay/2026-08-27T1450-jay-engineering-filter.md(Item 1 + Item 2 + Item 4 · vLLM 官方博客 2026-06-12 + 2026-07-23 + AMD ROCm 官方博客 2026-01-02)
arXiv: 无 · vLLM 官方博客 + AMD ROCm 官方博客 · 真实可复现命令(含完整 flags)
要点:
MiniMax M3 Day-0 Serving(vLLM 官方博客 2026-06-12 · 21 min read):
- 真实可复现命令:--tensor-parallel-size 8 --enable-expert-parallel --mm-encoder-tp-mode data --compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE","level":3}'
- 性能数据:B300 单卡吞吐量 8,530 tok/s;EAGLE3 投机解码接受率 ~67%
- 多硬件支持:NVIDIA H200/GB200/B300 + AMD MI300/MI350 均有独立配置
- MiniMax Sparse Attention (MSA) 核心理论:128-token KV block scoring,1M context 下 per-token 计算降至约 1/20
- 量化路径:BF16 + MXFP8 checkpoint,MoE backend for Hopper & Blackwell
- 工程价值:1M token 超长上下文部署标准参考;多硬件命令模板可直接 adapt
GLM-5.2 on 24×B300 SLA 优化 40ms→17ms(vLLM 官方博客 DaoCloud Team 2026-07-22 · 18 min read): - SLA-first 优化完整路径:从 40ms mean TPOT 降至 17ms,每步有量化贡献分析 - 根因分析:混合批次(Mixed Batches)在 P/D 交接处的执行路径回归是 Decode 瓶颈主因 - P/D 分离拓扑:4-Prefill + 1-Decode (4P1D) 配置,KV cache 高效传输 - 真实 benchmark 图表:8K~256K 输入长度下的 TTFT/TPOT/吞吐量曲线 - MTP 投机解码:GLM-5.2 原生 MTP 支持,与 Model Runner V2 协同 - 生产 SLA 目标:mean TTFT ≤ 2.5s, mean TPOT ≤ 20ms(可作为部署验收标准) - 工程价值:P/D 分离生产调优标杆案例;SLA 验收测试可参考其指标定义
AMD ROCm MI300X vLLM 多模态 DP Vision 一行优化(AMD ROCm 官方博客 2026-01-02 · 9 min read):
- 一行环境变量:VLLM_ROCM_USE_AITER=1 VLLM_ROCM_USE_AITER_MHA=1
- 完整 benchmark 命令(含 AITER 配置)for Qwen3-VL-235B-A22B 和 InternVL3_5-241B-A28B
- MI300X GPU 实测数据:batch-level DP 对 multimodal LLM 吞吐的影响
- 复现性强:随机种子 (seed=0)、并发数 (64)、batch size 参数全部公开
- CUDA graph 配合:--compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE","level":3}'
- 核验建议:AITER 后端在 MI300X ROCm 7.2+ 环境验证
- 工程价值:AMD MI300X 多模态推理加速参考;一行 env 改动的性价比极高
vLLM Recipes DeepSeek-V3.2 部署命令(recipes.vllm.ai/deepseek-ai/DeepSeek-V3.2-Exp):
- ROCm MI300X 完整命令:VLLM_ROCOM_USE_AITER=1 vllm serve deepseek-ai/DeepSeek-V3.2-Exp --tensor-parallel-size 8 --kv-cache-dtype bfloat16 --block-size 1
- CUDA vs ROCm 环境分离:Python 3.12 + ROCm 7.2.1 + glibc ≥ 2.35 要求明确
- lm-eval 精度验证命令:GSM8K 5-shot 0.9591 / 20-shot 0.9538
- DP+EP 配置:CUDA_VISIBLE_DEVICES=0,1,2,3 vllm serve nvidia/DeepSeek-V3-FP4 --enable-expert-parallel
- 核验建议:block-size=1 对 MoE 模型 KV cache 管理的影响需对照生产负载验证
与活文档关系: §IX 57/58 §1.(1) 推理引擎沿用 vLLM 0.27.0 changelog 确认 MRV2 默认 + SGLang v0.5.8 GB300 NVL72 25× + TensorRT-LLM 1.3.0rc PyTorch-only + TGI EOL 三重确认;本棒 = §1.(1) 推理引擎生产部署立基础延展邻接级补强 4 件(MiniMax M3 Day-0 1M context MSA 128-token KV block + GLM-5.2 4P1D 40ms→17ms SLA-first + AMD ROCm MI300X AITER 一行 env + vLLM Recipes DeepSeek-V3.2 ROCm 完整命令);§IX 56/57 §1.(11) Kernel/AI 自动化沿用(MiniMax Sparse Attention 核心理论 128-token KV block scoring 1/20 per-token 计算与 §1.(3) KV Cache 邻接级沿用)
警示: MiniMax M3 命令行需验证 vLLM 版本 ≥ 0.12.0 · MSA kernel 实现可对照 arXiv 技术报告交叉验证 · GLM-5.2 24 GPU 拓扑需验证 IB 网络延迟 · NVFP4 量化精度损失建议用 lm-eval 交叉核对 · AMD AITER 后端在 MI300X ROCm 7.2+ 环境验证
归入节: §1.(1) 推理引擎沿用新增「MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms + AMD ROCm MI300X AITER 一行 env + vLLM Recipes DeepSeek-V3.2 ROCm 完整命令」邻接级 4 件套
增量 2【推理工程学科化 · §1.(11) Kernel/AI 自动化 + 推理后端方差量化新基准 · §1.(1) 推理引擎】🟡 arXiv:2605.19537 Quantifying the Impact of Inference Backends on LLM Evaluation 邻接级 ☆
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§一 Database-1 · arXiv:2605.19537v2 [cs.LG] 2026 年 5 月 20 日)
arXiv: 2605.19537v2
要点: - 核心发现:不同推理引擎(vLLM vs HuggingFace transformers vs TensorRT-LLM)即使运行相同模型,benchmark 分数也存在显著差异 - "后端诱导方差":可以错误地淘汰或抬升模型,影响学术排名和真实部署安全性 - 可信度:⭐⭐⭐⭐ 高(arXiv 同行评审来源,引用多篇 MLSys 2025 相关工作) - 评价:对推理引擎选型、benchmark 设计有直接工程意义。建议纳入 AI infra 工程师必读 - 后续行动:核验论文实验细节,对比 vLLM vs TGI vs SGLang 的数值稳定性差异
与活文档关系: §IX 53-58 §1.(1) 推理引擎沿用 vLLM/SGLang/TensorRT-LLM/TGI/Ollama/llama.cpp 决策框架;本棒 = §1.(11) Kernel/AI 自动化 + §1.(1) 推理引擎新增「推理后端方差量化新基准」邻接级 ☆——首次为推理引擎选型提供量化后端方差的方法论,与 vLLM Recipes 精度验证命令(GSM8K 5-shot 0.9591)形成"评测精度 + 后端方差"双维度方法论
警示: arXiv:2605.19537v2 引用多篇 MLSys 2025 相关工作,但具体评测基准(lm-eval-harness?HELM?MMLU?)需原文核验 · "后端诱导方差"的具体数值范围需核验
归入节: §1.(11) Kernel/AI 自动化新增「arXiv:2605.19537 Quantifying the Impact of Inference Backends on LLM Evaluation」邻接级 ☆ + §1.(1) 推理引擎沿用
增量 3【推理硬件视角 · §1.(11) Kernel/AI 自动化 + 硬件约束权威文献】🟡 arXiv:2601.05047 Google LLM 推理硬件四大机会 邻接级 ☆
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§二 Backend-3 · Ma, Xiaoyu & David Patterson Google arXiv:2601.05047)
arXiv: 2601.05047
要点: - 核心命题:LLM 推理的核心挑战是内存和互联,而非计算 - 四大研究机会: 1. High Bandwidth Flash(10X 内存容量,HBM 类带宽) 2. Processing-Near-Memory / 3D 堆叠 3. 低延迟互联加速通信 4. 移动端适配方案 - 可信度:⭐⭐⭐⭐⭐ 高(Patterson 是图灵奖得主,Google 硬件研究) - 评价:理解 LLM 推理硬件约束的权威文献
与活文档关系: §IX 53-58 §1.(11) Kernel/AI 自动化沿用 HotInfra 2026 CXL+PIM + TurboQuant + EdgeFM + PinSieve 等;本棒 = §1.(11) Kernel/AI 自动化 + 硬件约束权威文献新增「Patterson 推理硬件四大机会」邻接级 ☆——首次以图灵奖得主视角系统化硬件约束四维度,与 §IX 57 §1.(11) 立基础延展第 5 件推理框架版本治理形成"硬件 + 软件"双视角
警示: arXiv:2601.05047 为 2026-01 早期提交论文,是否已被同期会议接收(NSDI/ISCA/MICRO 2026?)需核验 · "High Bandwidth Flash" 是否已商业化(如 Samsung/SK Hynix/Kioxia 产品)需核验
归入节: §1.(11) Kernel/AI 自动化新增「arXiv:2601.05047 Google LLM 推理硬件四大机会 · Patterson 图灵奖得主 · High Bandwidth Flash + Processing-Near-Memory + 低延迟互联 + 移动端适配」邻接级 ☆ + §1.(1) 推理引擎硬件约束权威文献
增量 4【数据库 AI 设计方向 · §1.(10) 顶会密集部署 + 向量 DB 立基础延展邻接级】🟡 arXiv:2605.31097 SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition 邻接级 ☆
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§一 Database-2 · arXiv:2605.31097v1)
arXiv: 2605.31097
要点: - 核心创新:用 LLM 自动生成针对特定 workload 优化的数据库引擎设计(行存储 vs 列存储 vs HTAP) - 实验数据:在 TPC-C 上展示比 PostgreSQL/MySQL 更优的事务性能 - 可信度:⭐⭐⭐⭐ 高(arXiv 论文,有 TPC-C benchmark 对比数据) - 评价:代表"AI 设计数据库"方向,工程可行性待验证,但思路有启发性 - 后续行动:关注 GitHub 复现仓库是否存在
与活文档关系: §IX 57 §1.(10) 向量 DB 立基础延展邻接级沿用(向量 DB 选型决策树 50M 分水岭 + pgvector consolidating + pgvectorscale 471 QPS + 2026 Milvus vs Qdrant + Chimera + Filter-Agnostic Vector Search SIGMOD 2026 + Policy-aware Vector Search SeQureDB 2026 + To GPU or Not to GPU + pgrust PostgreSQL 18.3 100% 回归测试 + ColPali/ColQwen2);本棒 = §1.(10) 向量 DB 立基础延展邻接级新增「arXiv:2605.31097 SpecDB LLM-Generated Customized Databases via Feature-Oriented Decomposition」邻接级 ☆——首次以 LLM 自动生成数据库引擎设计,与 pgrust(malisper/pgrust PostgreSQL Rust 重写 100% 回归测试 · AI coding agent 12-20 并行 2 周合并 280 PR)形成"AI 重写 + AI 设计"双栖
警示: arXiv:2605.31097 TPC-C benchmark 数据需核验(OLTP 测试标准场景)· GitHub 复现仓库存在性需核验 · 工程可行性(LLM 生成代码的可维护性、可调试性)待验证
归入节: §1.(10) 向量 DB 立基础延展邻接级新增「arXiv:2605.31097 SpecDB LLM-Generated Customized Databases via Feature-Oriented Decomposition · AI 设计数据库方向 · TPC-C 优于 PostgreSQL/MySQL」邻接级 ☆
增量 5【向量 DB + 推理 SRE · §1.(10) 顶会密集部署 + 向量 DB 立基础延展邻接级】🟡 arXiv:2608.15994 PostgreSQL-V 2.0: Building An Integrated Vector DB in PostgreSQL 副分类 llm-infra 邻接级 ☆ + 8-26 evening → 8-27 evening 窗口 llm-infra 副分类唯一 1 件 net-new
来源: jay/2026-08-27T1105-jay-five-category-briefing.md(§一 Database-1 · Jiayi Liu, Te Guo, Jianguo Wang arXiv:2608.15994 [cs.DB] 2026-08-17)
arXiv: 2608.15994
要点: - 核心创新:提出 PostgreSQL-V 2.0,在 PostgreSQL 内构建可扩展集成向量数据库系统 - 学术定位:对标 VLDB/FAST 水平;pdf + html + other 多格式 - 作者:Jiayi Liu, Te Guo, Jianguo Wang - 可信度:高(arXiv 2026-08-17,极新) - 评价:近期数据库系统顶级工作;与 pgvector / pgvectorscale 的差异化是观察重点
与活文档关系: §IX 57 §1.(10) 向量 DB 立基础延展邻接级沿用 pgrust(PostgreSQL Rust 重写 100% 回归测试)+ pgvector consolidating 30+ 企业部署 + pgvectorscale 50M 471 QPS + 2026 Milvus vs Qdrant + Chimera + Filter-Agnostic Vector Search + Policy-aware Vector Search + To GPU or Not to GPU;本棒 = §1.(10) 向量 DB 立基础延展邻接级新增「arXiv:2608.15994 PostgreSQL-V 2.0 Integrated Vector DB」副分类 llm-infra 邻接级 ☆——首次系统化将 Vector DB 集成到 PostgreSQL 主干,与 pgrust 形成"PG Rust 重写 + PG Vector 集成"双栖;8-26 evening → 8-27 evening 窗口 llm-infra 副分类唯一 1 件 net-new
警示: arXiv:2608.15994 是否已被 VLDB 2026 / SIGMOD 2026 接收需核验(论文提交日 2026-08-17 距今 10 天,可能为 pre-print)· Jiayi Liu, Te Guo, Jianguo Wang 作者团队机构归属待核验 · GitHub 复现仓库存在性待核验 · 与 pgvector 0.8.0 已有能力的差异化(如支持更大维度?更多 ANN 索引类型?GPU 加速?)需核验
归入节: §1.(10) 向量 DB 立基础延展邻接级新增「arXiv:2608.15994 PostgreSQL-V 2.0: Building An Integrated Vector DB in PostgreSQL · Jiayi Liu + Te Guo + Jianguo Wang 2026-08-17 · 主分类 database · 副分类 llm-infra 邻接级 ☆」
增量 6【推理工程学科化 · §1.(11) Kernel/AI 自动化 + Inference-Aware 训练新方法】🟡 arXiv:2608.03216 iFAN Inference-Aware Learning for Plain Mask Transformers llm-infra 主分类邻接级 ☆ + 8-27 14:00 入库补卡
来源: paper_cards/905-2608-03216.md(8-27 14:00:05 入库 · 主分类 llm-infra · 形态 method · 被引 0)
arXiv: 2608.03216
要点: - 核心创新: - APMR (Adjusted Probability-Mask Ranking):将查询竞争与预测掩码质量对齐,抑制高置信但不准确的竞争者 - CLSD (Cross-Layer Self-Distillation):将更强的中间预测传递到最终层 - 可信度:被引 0(new paper,2026-08 新提交) - 副分类:主分类 llm-infra - 学术定位:Inference-Aware Learning 训练-推理协同新方向
与活文档关系: §IX 53-58 §1.(11) Kernel/AI 自动化沿用 Quantization-Aware Healing arXiv:2608.20953 paper_card 1083(4-Bit LLM 压缩恢复)+ TurboQuant + EdgeFM + PinSieve 等;本棒 = §1.(11) Kernel/AI 自动化 + 训练-推理协同新方向新增「arXiv:2608.03216 iFAN Inference-Aware Learning for Plain Mask Transformers」邻接级 ☆——首次以 Inference-Aware 训练方法与推理引擎协同,与 Quantization-Aware Healing 形成"训练时感知推理 + 量化时感知精度"双栖;8-27 14:00 入库 = v58 evening 棒未覆盖 → 本棒补卡
警示: arXiv:2608.03216 为 2026-08 新提交论文,被引 0 · 与 arXiv:2605.19537 推理后端方差量化协同(训练感知推理 + 推理方差量化) · Mask Transformer 应用领域(图像分割?视觉 Transformer?)需核验 · GitHub 复现仓库存在性待核验
归入节: §1.(11) Kernel/AI 自动化新增「arXiv:2608.03216 iFAN Inference-Aware Learning for Plain Mask Transformers · APMR + CLSD · 训练-推理协同新方向」邻接级 ☆ + §1.(1) 推理引擎训练-推理协同
增量 7【向量 DB consolidating 实证新信号 · §1.(10) 顶会密集部署 + 向量 DB 选型决策树 50M 分水岭 邻接级 ☆】
来源: jay/2026-08-27T0935-jay-github-hf-vecdb-inference-deployment-aug27.md(§三 pgvector Consolidating + §四 vLLM v0.20.2 May 2026)+ jay/2026-08-27-1505-jay-five-category-briefing.md(§一 Database-3 PostgreSQL 18 vs MySQL 9.x 2026)
arXiv: 无 · 工程博客综合(Medium / Refonte Learning / Braintrust / tech-insider.org / zignuts.com / dev.to)
要点:
pgvector consolidating 7 大场景决策树: | 场景 | 推荐方案 | 理由 | |------|---------|------| | <10M 向量,已有 PostgreSQL | pgvector | 无新数据库运维负担,统一数据模型 | | <50M 向量,企业内部 | pgvector + pgvectorscale | HNSW 索引,471 QPS @ 99% recall | | 需要 sub-50ms p99 托管服务 | Pinecone | 零运维,serverless | | 开源 + 强过滤能力 | Qdrant | 最佳免费额度,<50M 向量 | | 混合搜索(向量+关键词) | Weaviate | BM25 + vector fusion 原生支持 | | >100M 向量,超大规模 | Milvus | 分布式,向量检索专用 | | 边缘/桌面/数据科学 | LanceDB | 无服务开销,嵌入式 |
关键结论(2026-08): 1. pgvector 已满足绝大多数 RAG 场景:30+ 企业客户已将其部署到生产环境 2. 专用向量数据库的价值边界:在过滤深度、多租户隔离、写入吞吐量上有真实优势 3. pgvector 上限:>50-100M 向量时 HNSW 索引重建时间成为瓶颈 4. 自托管 RAG 成本优势明显:€12.49/mo VPS + €19.99/mo Managed Postgres 可覆盖 <10M 向量场景
PostgreSQL 18 vs MySQL 9.x 2026 功能对比: - PG 18:UUIDv7(时序有序,防 B-tree 碎片)、Logical Replication for DDL(零停机 schema 迁移)、RETURNING OLD/NEW 别名、pgvectorscale 50M 向量下 471 QPS vs Qdrant 41 QPS(99% recall) - MySQL 9.x:JavaScript 存储过程(GraalVM)、并行查询增强、NVMe 直通优化 - Aurora Limitless:AWS Aurora PostgreSQL 支持分布式无限制扩展模式
与活文档关系: §IX 57 §1.(10) 向量 DB 立基础延展邻接级沿用(向量 DB 选型决策树 50M 分水岭 + pgvector consolidating + pgvectorscale 471 QPS + 2026 Milvus vs Qdrant);本棒 = §1.(10) 向量 DB consolidating 实证新信号补强邻接级 ☆——首次以 30+ 企业生产部署实证 pgvector consolidating 趋势,与 §IX 57 §1.(10) 沿用同方向但新增实证数据;与 §IX 58 立基础延展第 7 件 PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 协同
警示: pgvector 30+ 企业客户名单具体来源(Medium 作者个人经验?Braintrust 调查?)需核验 · pgvectorscale 471 QPS @ 99% recall 测试条件(具体模型维度?batch size?)需对照来源核验 · "pgvector 已满足绝大多数 RAG 场景" 的"绝大多数" 量化标准需核验
归入节: §1.(10) 向量 DB 立基础延展邻接级补强「pgvector consolidating 30+ 企业生产部署 + pgvectorscale 50M 471 QPS @ 99% recall + Aurora Limitless 分布式扩展 + PostgreSQL 18 vs MySQL 9.x 2026」邻接级 ☆
增量 8【推理引擎极致优化方向 · §1.(1) 推理引擎 + 边缘/本地部署邻接级】🟡 Colibri 纯 C 零依赖 744B MoE 25GB RAM 邻接级 ☆
来源: jay/2026-08-27-1000-rss-bytebytego.md(ByteByteGo Top AI GitHub Repositories 2026)+ jay/2026-08-27T1735-jay-ai-engineering-trending-aug27.md(§五 GitHub Trending · ByteByteGo 2026 AI Repos · Colibri 工程亮点)
GitHub: (ByteByteGo 引用 · GitHub 链接待核验)
要点: - 核心创新:用纯 C 实现零依赖的本地推理引擎,通过流式从磁盘加载专家,在消费级硬件上运行 GLM-5.2(744B MoE) - 资源占用:受众较窄,但对本地 LLM 爱好者和前沿模型自托管场景有重要意义 - 工程亮点:~25GB RAM(消费级硬件可跑 744B MoE) - 工程价值:推理引擎的极致优化方向(与 vLLM/SGLang/TensorRT-LLM/LMDeploy/Ollama 形成"高性能 vs 极致精简"两栖)
与活文档关系: §IX 53-58 §1.(1) 推理引擎沿用 vLLM/SGLang/TensorRT-LLM/TGI/Ollama/llama.cpp 决策框架 + 推理框架版本治理(TGI EOL + TensorRT-LLM 1.3.0rc PyTorch-only + SGLang v0.5.8);本棒 = §1.(1) 推理引擎沿用新增「Colibri 纯 C 零依赖 744B MoE 25GB RAM · 边缘/本地部署」邻接级 ☆——首次以纯 C 零依赖推理引擎支持 744B MoE 消费级硬件部署,与 llama.cpp(突破 100k GitHub Stars · 边缘/嵌入式场景活跃)形成"纯 C + C++" 双栖
警示: Colibri 的 GitHub 仓库 URL、star 数、维护活跃度需核验 · "~25GB RAM" 数字是否含 KV cache 缓存、磁盘 I/O 模型细节需核验 · 与 llama.cpp / Ollama 在功能上是否有重叠(是否使用相同后端?)需核验 · 性能数字(tok/s)未在 ByteByteGo 简报中提及,需补核验
归入节: §1.(1) 推理引擎沿用新增「Colibri 纯 C 零依赖 744B MoE 25GB RAM · 推理引擎极致优化方向 · 边缘/本地部署」邻接级 ☆
警示增量 9【跨实例标签法失效警示 · 立标池饱和度 v57/v58 第五次稳态延续 + 首次跨实例标签误标传染 2 实例】🟠 arXiv ID 跨实例误标 C²KV 误标 arXiv:2608.14192
来源: jay/2026-08-27-engineering-e1prep.md(增量 1 + 涉及 arXiv 号)+ inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md(§二 跨实例去重与可去重簇 · 第 5 簇)
arXiv: 2607.17715(正确 ID)vs 2608.14192(误标 ID)
要点:
误标事件描述: - jay engineering-e1prep 8-27 11:23 CST(增量 1)将 C²KV 标为 arXiv:2608.14192,并在表"涉及 arXiv 号"中沿用 - stephen 协调棒 8-27 12:45 CST(§二 第 5 簇)沿用 jay 的错误 ID,写为"C²KV(arXiv:2608.14192):非前缀 KV 复用和推理加速;17× 需实验条件限定" - 正确归属:C²KV = arXiv:2607.17715(KDD 2026 Jeju Island 8-09~13 · 跨请求 KV Cache 压缩可组合复用 · 已锚 §IX 50/51/52/53/54/55/56/57/58 §1.(3) 第 13 路线) - arXiv:2608.14192 实际归属:未在 llm-infra 活文档中出现,需独立核验(可能为另一篇不同主题论文)
传染路径: - 传染实例数:2 实例(jay engineering-e1prep + stephen 协调棒) - 传染方向:jay engineering-e1prep → stephen 协调棒(stephen 协调棒在 jay 之后 1.5h 形成) - 传染机制:stephen 协调棒在做"跨实例去重与可去重簇"判定时,沿用了 jay 的 arXiv ID 而未做独立 arXiv ID 核验
与活文档关系: §IX 53-58 §1.(3) KV Cache 19 → 21 → 25 路线 + §1.(12) End-to-End Pipeline 7 件已锚 C²KV = arXiv:2607.17715 KDD 2026 第 13 路线;本棒警示 = §IX 59 立基础延展警示 ——首次跨实例标签法失效传染 2 实例,与 §IX 53-58 立标池饱和度供给侧 v57/v58 第五次稳态延续 + 跨实例标签二档法首次失效
警示: arXiv ID 误标传染是 §IX 33 以来首次出现的跨实例标签法失效事件 · 建议今晚活文档接力棒补强 arXiv:2608.14192 实际归属核验 · stephen 协调棒"跨实例去重与可去重簇"流程应增加 arXiv ID 独立核验步骤 · 立标池饱和度供给侧沿用不应与跨实例标签误标传染混淆
归入节: §1.(3) KV Cache 沿用(C²KV = arXiv:2607.17715 KDD 2026 第 13 路线 不变)+ §1.(12) End-to-End Pipeline 沿用 + §IX 59 立基础延展警示:「跨实例标签法失效传染 2 实例 = jay engineering-e1prep + stephen 协调棒 · C²KV 误标 arXiv:2608.14192 · arXiv:2608.14192 实际归属待核验 · stephen 协调棒跨实例去重流程应增加 arXiv ID 独立核验」
三、矛盾与待核实说法
矛盾 A【🟠 跨实例标签法失效传染警示】C²KV 误标 arXiv:2608.14192 vs 实际 arXiv:2607.17715 KDD 2026
来源: inbox/jay/2026-08-27-engineering-e1prep.md(增量 1 + 涉及 arXiv 号)+ inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md(§二 第 5 簇)
冲突描述: - jay 8-27 engineering-e1prep:将 C²KV 标为 arXiv:2608.14192,描述为"统一 KV Cache Serving 框架,极端上下文下 up to 17x 推理加速" - stephen 8-27 noon 协调棒:沿用 jay 错误 ID,写为"C²KV(arXiv:2608.14192):非前缀 KV 复用和推理加速;17× 需实验条件限定" - 正确归属:C²KV = arXiv:2607.17715(KDD 2026 Jeju Island 8-09~13 · 跨请求 KV Cache 压缩可组合复用 · 已锚 §IX 50/51/52/53/54/55/56/57/58 §1.(3) 第 13 路线 · GitHub s7a9/C2KV)
状态: 🟠 新增矛盾——本棒首次发现跨实例标签法失效传染 2 实例事件 · arXiv:2608.14192 实际归属待核验 · 建议今晚活文档接力棒核验 arXiv:2608.14192 是否为另一篇不同主题论文(如 LLM 安全?Agent 架构?),并校正 jay engineering-e1prep 与 stephen 协调棒中的 C²KV arXiv ID 误标
矛盾 B【TurboQuant 数字冲突沿用】:AIxFunda 6×/8× vs jay 6-11 实测 2.69–4.4×——仍未闭合
来源: inbox/jay/2026-08-23-1950-jay-substack-inference-engineering-harness.md(§五 AIxFunda)+ inbox/jay/2026-08-06-11-evening-supplement-k8s-db-inference-updates.md
arXiv: 2605.19660
冲突描述(沿用 8-23/8-25/8-26 三棒,仍未闭合): - AIxFunda(2026-08): TurboQuant → KV cache 压缩 6× + 推理加速 8×,H100 零精度损失 - jay 2026-06-11 实测: TurboQuant → 2.69–4.4×(同一论文)
状态: 本棒(8-27)仍未闭合;arXiv:2605.19537(Quantifying the Impact of Inference Backends on LLM Evaluation)提出了"推理后端诱导方差"的方法论,可能与 TurboQuant 评测口径差异相关——TurboQuant 的 6×/8× 数字与 jay 6-11 实测 2.69-4.4× 是否在同一推理后端、同一 NDCG@5 基线、同一 batch size 下测得?arXiv:2605.19537 提供的方法论可能为该矛盾闭合提供框架
矛盾 C【FlashPrefill V2 H200 vs H20 加速比差异】:47.26× 在 H200 FP8 实测,H20 国内落地数字未核验
来源: inbox/jay/2026-08-23-engineering-e1prep.md(增量 1)+ inbox/spark/2026-08-23-llm-infra-e1prep.md(增量 1)
arXiv: 2608.19758
警示(沿用 8-23/8-25/8-26 三棒,仍未闭合): - 47.26× 是 H200 FP8 数字;国内算力主要是 H20,两者在算力/带宽/架构上有差异 - H20 实际加速比需实测核验,不能直接套用 H200 数字做容量规划 - 建议今晚活文档接力时标注"H20 数字待实测,H200 数字仅供参考"
与本棒新增 arXiv:2605.19537 推理后端方差量化方法论协同:FlashPrefill V2 H200 vs H20 数字差异也可应用 arXiv:2605.19537 的"后端诱导方差"框架分析
矛盾 D【🟠 vLLM/SGLang 29% shared-prefix 领先数据条件差异沿用】:来自不同来源数字范围差异较大
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(增量 4)+ inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md
警示(沿用 8-26 棒,仍未闭合): - SGLang vs vLLM shared-prefix 场景领先 29%(16,215 vs 12,553 tok/s)来自 Spheron 综合对比 - 同一 jay 8-27 engineering-filter 引用 Spheron 给出 vLLM 0.32.9 + SGLang 1.2.1 + TensorRT-LLM 1.3.0rc24 + Ollama 0.32.9 + llama.cpp build b10375 的版本对比 - 但具体测试硬件(H100/A100/L40S)、batch size、序列长度组合差异显著 - arXiv:2605.19537 推理后端方差量化方法论可能为该类数字差异提供框架
四、可引用 arXiv 号列表(本次净增 5 件)
| arXiv | 论文/方法 | 主分类 | 关联节 | 本棒补强内容 |
|---|---|---|---|---|
2605.19537 |
Quantifying the Impact of Inference Backends on LLM Evaluation | llm-infra | §1.(11) Kernel/AI 自动化 | 首次锚入;vLLM vs HuggingFace transformers vs TensorRT-LLM 同一模型 benchmark 分数显著差异;"后端诱导方差"影响学术排名和真实部署安全性 |
2601.05047 |
LLM Inference Hardware 4 Opportunities | llm-infra | §1.(11) Kernel/AI 自动化 | 首次锚入;Ma, Xiaoyu & David Patterson(图灵奖得主);High Bandwidth Flash + Processing-Near-Memory + 低延迟互联 + 移动端适配 |
2605.31097 |
SpecDB: LLM-Generated Customized Databases | llm-infra | §1.(10) 向量 DB 邻接级 | 首次锚入;LLM 自动生成针对特定 workload 优化的数据库引擎设计;TPC-C benchmark 优于 PostgreSQL/MySQL |
2608.03216 |
iFAN Inference-Aware Learning for Plain Mask Transformers | llm-infra | §1.(11) Kernel/AI 自动化 | v58 evening 棒未覆盖 · 本棒补卡;8-27 14:00 入库;APMR + CLSD;训练-推理协同新方向 |
2608.15994 |
PostgreSQL-V 2.0 Integrated Vector DB | database | §1.(10) 向量 DB 邻接级 · 副分类 llm-infra | 首次锚入;Jiayi Liu + Te Guo + Jianguo Wang 2026-08-17;副分类 llm-infra 邻接级 ☆;8-26 evening → 8-27 evening 窗口 llm-infra 副分类唯一 1 件 net-new |
本棒 arXiv 净增 5 件(4 件 llm-infra 主分类 + 1 件 database 副分类 llm-infra)——沿用 145+ 件套
五、检查过的来源清单
**本棒已检查的 inbox 来源(8-26 17:30 → 8-27 18:40 窗口):
| 来源 | 文件 | llm-infra 相关性 |
|---|---|---|
inbox/jay/2026-08-27T0935-jay-github-hf-vecdb-inference-deployment-aug27.md |
GitHub Trending + HF + pgvector + vLLM | ★★★★★ pgvector consolidating 7 大场景决策树 + vLLM v0.20.2 May 2026 + Aurora Limitless + AI 应用六层部署栈 |
inbox/jay/2026-08-27T1105-jay-five-category-briefing.md |
Jay 五大类别简报(8-27 11:05) | ★★★★★ PostgreSQL-V 2.0 arXiv:2608.15994 + OdinANN FAST '26 + Fast Tuning Proximity Graphs + C²KV 误标 arXiv:2608.14192 + Lynx + eBPF/Wasm + bpftime OSDI 2026 |
inbox/jay/2026-08-27T1220-jay-csdn-highvalue-rag-agent-mllm-inference-aug27.md |
CSDN 高价值技术检索(8-27 12:20) | ★★★ vLLM/SGLang/TensorRT-LLM/Ollama CSDN 横评 + H100 4 卡实测 benchmark |
inbox/jay/2026-08-27-csdn-rag-multimodal-agent.md |
CSDN 高价值技术检索(8-27) | ★★ RAG 五路线 + ColPali/ColQwen2 + MCP 协议 |
inbox/jay/2026-08-27T1450-jay-engineering-filter.md |
Jay 工程实践筛选(8-27 14:50) | ★★★★★ MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms + AMD ROCm MI300X vLLM 多模态 DP 一行优化 + vLLM Recipes DeepSeek-V3.2 |
inbox/jay/2026-08-27-1505-jay-five-category-briefing.md |
Jay 五大类别简报(8-27 15:05) | ★★★★★ arXiv:2605.19537 推理后端方差量化 + arXiv:2605.31097 SpecDB + arXiv:2601.05047 Patterson 推理硬件四大机会 + vLLM Semantic Router WRAP |
inbox/jay/2026-08-27-1000-rss-bytebytego.md |
ByteByteGo Top AI Repos 2026 | ★★★ Open WebUI + Langflow + RAGFlow + Dify + Colibri 744B MoE 25GB RAM 纯 C 零依赖 |
inbox/jay/2026-08-27-1002-rss-import-ai.md |
Import AI RSS 8-27 | 0(无 llm-infra 主轴) |
inbox/jay/2026-08-27T1735-jay-ai-engineering-trending-aug27.md |
Jay AI 工程生态(8-27 17:35) | ★★★ HF State of Open Models Summer 2026 + Context Engineering + 20 RAG Types + AI Agents Stack |
inbox/jay/2026-08-27-rag-agent-inference-arxiv.md |
Jay RAG/Agent/Inference arXiv(8-27) | ★★ EnSI-RAG + Adaptive Compression Edge RAG + Agentic-SQL + LifeMem + Thunder Compute 推理引擎 + HF 排行 |
inbox/jay/2026-08-27-engineering-e1prep.md |
Jay engineering E1(8-27 11:23) | ★★★★ C²KV 误标 arXiv:2608.14192 + Ready Cohorts + RAGSieve + SkillGate + 规范优先架构重构 + browser-use |
inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md |
Tom 雷达(8-27 08:40) | ★★ 8 候选 3 高价值 · agent 主轴 4 件 + PinSieve/GigaBrain-0.7 |
inbox/tom/2026-08-27-0900-hf-daily-2026-08-27.md |
HF Daily 8-27 | ★★ HF Daily 15 件 · agent/multimodal 主轴 |
inbox/tom/2026-08-27T1440-agent-rag-longcontext-radar.md |
Tom 雷达(8-27 14:41) | 0(agent 主轴) |
inbox/tom/2026-08-27-rag-e1prep.md |
Tom RAG E1(8-27) | 0(rag 主轴) |
inbox/tom/2026-08-27-evaluation-e1prep.md |
Tom Evaluation E1(8-27) | 0(evaluation 主轴) |
inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md |
Stephen 协调棒(8-27 12:45) | ★★★★ C²KV 误标 arXiv:2608.14192 沿用 + 跨实例去重 7 簇 + 5 实例覆盖结论 |
inbox/spark/2026-08-27-1001-rss-gradient-flow.md |
Gradient Flow RSS 8-27 | ★★ Agent 九条实战规则 + HBF 与分层内存(沿用 8-26 棒)+ AI 数据中心反对浪潮 + AI 风险位于模型之外 |
inbox/spark/2026-08-27-1002-rss-chip-huyen.md |
Chip Huyen RSS 8-27 | 0(综述沿用,无新 llm-infra 主轴) |
inbox/spark/2026-08-27-1005-rss-yt-3blue1brown.md |
3Blue1Brown RSS 8-27 | 0(无 llm-infra 主轴) |
inbox/spark/2026-08-27-agent-e1prep.md |
Spark Agent E1(8-27 13:36) | ★★ v60 备料棒 · paper_cards 1097-1102 + agent 主轴 · llm-infra 邻接沿用 |
inbox/flyp/2026-08-27-risk-e1prep.md |
Flyp Risk E1(8-27) | 0(risk 主轴) |
inbox/flyp/2026-08-27-multimodal-e1prep.md |
Flyp Multimodal E1(8-27) | 0(multimodal 主轴) |
inbox/flyp/2026-08-27-critical-read-GigaBrain-0.7-VLA-three-system.md |
Flyp GigaBrain-0.7 精读(8-27) | 0(multimodal 主轴) |
**本棒已检查的 paper_cards 来源(8-26 17:30 → 8-27 18:40 窗口):
| 卡片号 | arXiv | 标题 | llm-infra 相关性 |
|---|---|---|---|
| 1097 | 2608.24763 | MoTE: Mixture of Task Experts | 0(multimodal) |
| 1098 | 2608.23740 | AgentRoom: Concurrent Multi-Agent Coding | 0(agent) |
| 1099 | 2608.23670 | Automata from Agent Traces | 0(agent) |
| 1100 | 2608.23691 | Autonomous Mathematical Discovery | 0(agent) |
| 1101 | 2608.21500 | SecOPD: Mitigating Adaptive Prompt Injections | 0(agent) |
| 1102 | 2608.15875 | GigaBrain-0.7 VLA Three-System | 0(multimodal) |
| 1103 | 2608.25529 | Video-IFBench | 0(multimodal) |
| 1104 | 2608.24138 | RubSE: Rubric-guided Self-Evolution | 0(multimodal) |
| 1105 | 2608.24358 | The Handoff Tax | 0(agent) |
| 1106 | 2608.23383 | JoyAI-Echo-1.5 Long-Horizon | 0(multimodal) |
| 1107 | 2608.23256 | Next-Chunk Reasoning RL vs SFT | 0(engineering) |
| 1108 | 2608.21839 | FIRM-Video | 0(multimodal) |
| 1109 | 2608.22071 | Real-TurnTurk | 0(multimodal) |
| 1110 | 2608.19556 | Stream4D | 0(multimodal) |
| 905 | 2608.03216 | iFAN: Inference-Aware Learning for Plain Mask Transformers | ★★★ llm-infra 主分类(8-27 14:00 入库 · v58 evening 棒未覆盖 → 本棒补卡) |
结论: llm-infra 主题 8-26 17:30 → 8-27 18:40 窗口增量以真实可复现命令 + 新方法论 + arXiv ID 误标警示为主(MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms + AMD ROCm MI300X DP 一行 + vLLM Recipes DeepSeek-V3.2 + arXiv:2605.19537 推理后端方差量化 + arXiv:2601.05047 Patterson 推理硬件四大机会 + arXiv:2605.31097 SpecDB + arXiv:2608.03216 iFAN Inference-Aware Learning + arXiv:2608.15994 PostgreSQL-V 2.0 + pgvector consolidating 30+ 企业部署 + Colibri 744B MoE 25GB RAM + C²KV 误标警示);paper_cards 新卡 14 件 0 件 llm-infra 主分类(连续第 5 个零新增日)+ 1 件 llm-infra 主分类补卡(iFAN arXiv:2608.03216 paper_card 905 · 8-27 14:00 入库)。
六、值得今晚活文档接力关注的其他信号
- 🟠 跨实例标签法失效传染警示:C²KV 误标 arXiv:2608.14192 vs 实际 arXiv:2607.17715 KDD 2026 已传染 2 实例(jay engineering-e1prep + stephen 协调棒)——建议今晚活文档接力棒核验 arXiv:2608.14192 实际归属,并校正 jay engineering-e1prep 与 stephen 协调棒中的 C²KV arXiv ID 误标;同时 stephen 协调棒"跨实例去重与可去重簇"流程应增加 arXiv ID 独立核验步骤
- MiniMax M3 Day-0 Serving B300 8530 tok/s + GLM-5.2 24×B300 SLA 40ms→17ms:vLLM 官方博客 2026-06-12 + 2026-07-23 双件套,可作为 §1.(1) 推理引擎生产部署立基础延展邻接级新的标杆案例;4P1D 配置 + Mixed Batches 根因分析 + Model Runner V2 协同 + mean TTFT ≤ 2.5s mean TPOT ≤ 20ms SLA 验收标准可作为团队部署验收测试参考
- arXiv:2605.19537 推理后端方差量化方法论:vLLM vs HuggingFace transformers vs TensorRT-LLM 同一模型 benchmark 分数显著差异——可能为 TurboQuant 6×/8× vs 2.69-4.4× 数字冲突(沿用 8-23/8-25/8-26/8-27 四棒)提供闭合框架;同时为 FlashPrefill V2 H200 vs H20 数字差异(沿用 8-23/8-25/8-26/8-27 四棒)提供分析方法论
- Patterson arXiv:2601.05047 LLM 推理硬件四大机会:首次以图灵奖得主视角系统化硬件约束四维度(High Bandwidth Flash + Processing-Near-Memory + 低延迟互联 + 移动端适配),可作为 §1.(11) Kernel/AI 自动化 + 硬件约束权威文献的新锚点
- iFAN arXiv:2608.03216 Inference-Aware Learning:v58 evening 棒未覆盖 → 本棒补卡;APMR + CLSD 训练-推理协同新方向,与 Quantization-Aware Healing arXiv:2608.20953 paper_card 1083 形成"训练时感知推理 + 量化时感知精度"双栖
- PostgreSQL-V 2.0 arXiv:2608.15994:8-26 evening → 8-27 evening 窗口 llm-infra 副分类唯一 1 件 net-new;Jiayi Liu + Te Guo + Jianguo Wang 2026-08-17;与 pgrust(malisper/pgrust PostgreSQL Rust 重写 100% 回归测试)形成"PG Vector 集成 + PG Rust 重写"双栖
- pgvector consolidating 30+ 企业生产部署 + pgvectorscale 50M 471 QPS:§IX 57 §1.(10) 向量 DB 立基础延展邻接级第 7 件沿用补强,新增实证数据
- Colibri 744B MoE 25GB RAM 纯 C 零依赖:推理引擎极致优化方向,与 vLLM/SGLang/TensorRT-LLM/LMDeploy/Ollama/llama.cpp 形成"高性能 vs 极致精简"两栖
- SpecDB arXiv:2605.31097 LLM-Generated Customized Databases:AI 设计数据库方向,与 pgrust 形成"AI 重写 + AI 设计"双栖
- AMD ROCm MI300X vLLM 多模态 DP 一行优化:VLLM_ROCM_USE_AITER=1 一行 env 改动;与 §IX 56 国产算力 + AMD ROCm 邻接级沿用
七、无显著新增量的领域(如实说明)
以下领域在本 8-26 evening → 8-27 evening 窗口确认无新增量或仅为沿用,不重复列出: - K8s + CNCF 生态扩展:§IX 58 已锚 K8s 1.37 GA + KubeCon NA 2026 AI Inference + Agentic Track + OpenCost 1.121.0 + Ingress NGINX EOL + K8gb incubating + Kairos 11 分钟升级,本棒无新 K8s 增量 - MCP 安全专题:§IX 57 已锚 arXiv:2601.17549 ProtoAmp + AttestMCP 52.8% → 12.4% + CSA MCP Security Crisis + 8 CVE + ETDI/MCP-Guard/SMCP,本棒无新 MCP 增量 - KV Cache 4 件优化策略:§IX 57 已锚 ChunkKV/OBCache/LLM-AnDPro/HCAttention + IEEE TED 3-D Ferroelectric,本棒无新 KV Cache 增量 - TurboQuant 数字矛盾:沿用 8-23/8-25/8-26 三棒,仍未闭合;本棒 arXiv:2605.19537 提供方法论框架 - FlashPrefill V2 H200 vs H20 数字差异:沿用 8-23/8-25/8-26 三棒,仍未闭合 - C²KV arXiv:2607.17715 KDD 2026:已锚 §IX 50/51/52/53/54/55/56/57/58 §1.(3) 第 13 路线;本棒仅发现 arXiv:2608.14192 跨实例误标警示 - KVpop arXiv:2607.05061:已锚 inference.md 3.4 节(7-25 棒起),非新论文 - DistillCache / ReCache / Topology-Aware v2 / Online KV Compaction / Internet for KV Cache:均已锚 §IX 53-58 §1.(3) KV Cache 19 → 21 → 25 路线 - NVIDIA Dynamo 1.4.1:已在 8-25 早棒锚入;本棒无新数据 - llm-d CNCF Sandbox + ai-dynamo/dynamo + K8s HPA LLM:已锚 §IX 53-58 §1.(2) 推理调度,本棒无新数据 - TGI EOL 三重确认 + SGLang v0.5.8 GB300 25× + TensorRT-LLM 1.3.0rc PyTorch-only:已锚 §IX 58 §1.(1) 推理框架版本治理;本棒无新数据 - 向量 DB 选型决策树 50M 分水岭:已锚 §IX 57 §1.(10) 第 7 件;本棒 pgvector consolidating 30+ 企业部署为邻接级 ☆ 实证补强 - 国产算力 vLLM-Ascend:已锚 §IX 56,本棒 AMD ROCm MI300X vLLM 多模态 DP 一行优化为邻接级 ☆ 补强 - Modular Five Eras of KVCache:已锚 §IX 57 §1.(3) 顶层框架;本棒无新框架性内容 - HotInfra 2026 CXL+PIM 二次升级:已锚 §IX 57 §1.(10) 邻接级;本棒无新数据 - paper_cards 8-26 evening → 8-27 evening 窗口:净增 14 件 1097-1110,0 件 llm-infra 主分类 net-new + 0 件 llm-infra 副分类 net-new(连续第 5 个零新增日)+ 1 件 llm-infra 主分类补卡(iFAN arXiv:2608.03216 paper_card 905 · 8-27 14:00 入库 v58 evening 棒未覆盖 → 本棒补卡)
spark · 2026-08-27 18:40 CST · llm-infra · E1 预消化轮 · 窗口 8-26 17:30 → 8-27 18:40(约 25h)