llm-infra · E1 预消化简报(2026-07-28)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 9 棒 · 7-28 晚间活文档接力备料) 覆盖时段:2026-07-27 18:40 → 2026-07-28 18:40(约 24 小时增量) 基线:
organized/knowledge/llm-infra.mdWave3 §V 9 天抢修完成版(2026-07-27 05:37 收官 · 11+1 维全景 + C1-C58 共 58 条共识 + D1-D25 共 25 条争议 + O1-O135 共 135 条开放问题 + T1-T25 共 25 条趋势 + arXiv:2605.01280 OR 数学优化 / arXiv:2605.11733 Energy-to-Token / arXiv:2606.14589 Fail-Plausible 五类 / 7-27 evening 本棒(Spark E1 第 8 棒)7 主线增量已并入活文档)——work-queue.md(2026-07-28 自动检测:llm-infra 已脱离 9 天未更新状态 · 待建卡 0 · 待富化 64 · ⚠️ evaluation 主题活文档 4 天未更新待补救,非本场主题) 覆盖来源:inbox/jay/7-27 evening → 7-28 noon/afternoon 共 26 件(7-28 engineering-e1prep-v38 准备棒 + 1105 five-category-briefing 第 7 次/日 + 1505 afternoon-briefing + csdn-hf-transformers-v5-agent-rag + csdn-substack-rag-agent-multimodal-finetuning + csdn-llm-finetuning-rag-agent + csdn-vllm-sglang-production-commands + kimi-k3-inference-systems-substack + owasp-agent-security-hf-incident + graphrag-trending + kvcache-llm-wiki-rag-systems + hf-transformers-v5-source-analysis + vllm-pagedattention2 + vllm-trt-llm-deploy-csdn + uv-python-toolchain + 11 件 RSS 通稿)+inbox/tom/7-27 evening → 7-28 共 6 件(rag-e1prep-v47 · evaluation-e1prep-v40 · 0840/1440 radar · 0900 hf-daily-2026-07-28 · 2 RSS · ⚠️ tom 7-28 未发布独立 inference E1 · 继 7-27 收官后延续低密度状态)+inbox/flyp/7-28 共 6 件(multimodal-e1prep-v34 准备棒 + risk-e1prep + 0955 dual critical read + 1550 critical read OPD/CFG + 1006 yt-ai-explained + 1003 interconnects · ⚠️ flyp 7-28 无独立 inference/llm-infra 产出)+inbox/spark/7-28 共 4 件(1002 gradient-flow + 1003 chip-huyen + 1007 3blue1brown + 1337 agent-e1prep · 本场 llm-infra 棒 · spark E1 节奏 7-26 evening 双 E1 → 7-27 0 件 E1 → 7-28 午间仍未发布 E1 → 7-28 evening 本棒 = 节奏反转第 4 棒)+inbox/stephen/7-28 共 13 件(0910 news-x-vip-radar + 1004~1007 news 通稿 8 件 + 1027 ai-industry-e1prep-v30 准备棒 7 增量 + 1245 coordination-check-noon 5 实例全岗饱和 + stephen 7-28 1245 协调棒已识别 Kimi K3 1.56TB HuggingFace 上线 = 6 实例同步承接主权开源 2.0 立标级)+paper_cards/近 3 天(2026-07-25~28)新卡抽查:IDs 596-619 共 ~24 张,主分类 llm-infra/pure inference-systems(KV cache / quantization / speculative decoding)新增 0 张 · 副分类 llm-infra 1 张 = 606-2607-21848.md Closing the Loop(autoregressive video KV cache revisit consistency)+ 工程邻接 arXiv:2607.17979 Harness Engineering CUDA Kernel + arXiv:2607.21503 Agentic Context Mgmt + arXiv:2607.14277 Multi-Head Latent Control + arXiv:2510.09665 LMCache 跨引擎 KV 共享 + arXiv:2607.22529 Skill Self-Play + arXiv:2607.21653 Molt = 7 件跨主题邻接 arXiv 结论:中密度(7 主线 + 2 旁证 + 1 警示),核心动作 = (1) arXiv:2510.09665 LMCache 跨引擎 KV 缓存 crash-safe 实测完整披露(akshay_pachaar 独立测试 · vLLM/SGLang/TRT-LLM 三引擎插接 · engine crash 后 fallback to uncached + cache 重连 · 90% 成本削减 / 14× 速度提升 / startup 从 >3 分钟 → ~30 秒);(2) Kimi K3 2.8T MoE 推理系统工程视角(Moonshot AI · 2026-07-27 按承诺发布完整开源权重 · HF 1.56TB · MXFP4 权重 + MXFP8 激活 · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA · vLLM/SGLang 支持时间线待核实);(3) PagedAttention 2.0 vLLM 官方文档披露(vLLM 2026 上午 inbox · 显存利用率 20% → 90%+ · 单卡并发数 5-23× · 与 Continuous Batching 组合);(4) Continuous Batching 数学原理完整披露(openEuler CSDN python_小二 · 静态批处理 P99 = max_len 限制 vs 连续批处理 Phase 1/2/3 调度 · 吞吐 5-23×);(5) vLLM 0.9 / SGLang 实战命令集(openEuler CSDN + 腾讯云开发者社区 · 完整命令行 + 排障 + 框架选型决策树 · 与 PagedAttention 2.0 联动);(6) arXiv:2607.22529 Skill Self-Play LLM 能力协同进化(Cool Papers 今日推荐 · 技能间 self-play 推动能力前沿 · 与 Agent 自进化训练 / ExpRAG 互补);(7) Inference Engineering 职业化首次系统化(Gergely Orosz Pragmatic Engineer Substack · 完整技能栈 Quantization/FlashAttention/Paged KV/Continuous Batching/Backpressure/Structured Generation · 闭源 vs 开源平台分化 · Cursor 在 Kimi 2.5 上 Composer 2.0 案例 · Deep|LLM 2026 continuous-execution regime 验证)+ 2 旁证:arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer AI Kernel Generation Contest · CUDA Skills 框架 + Torch Profiler + NCU 两阶段搜索 + B200 实测) + AI Engineer 2026 Job Market 1000+ JD(70% AI-first / 28.5% AI-support · RAG + Agent + Production 作为核心能力) + 1 警示:Tom inference E1 7-28 当日缺失 + jay engineering-v38 主题分化为 8 件独立工程化深度文件(vllm-pagedattention2/vllm-trt-llm-deploy-csdn/vllm-sglang-production-commands-csdn/uv-python-toolchain/kvcache-llm-wiki-rag-systems/hf-transformers-v5-source-analysis/owasp-agent-security-hf-incident/kimi-k3-inference-systems-substack/graphrag-trending)= jay 工程化主题 v38 主轴深度饱和
一、核心增量(7 主线 + 2 旁证 + 1 警示,按活文档归位顺序)
增量 1【KV cache 三层算力栈 §2.3 / 端到端 §2.11】arXiv:2510.09665 LMCache 跨引擎 KV 缓存 crash-safe 实测完整披露(★★ 必补)
- 来源:
inbox/jay/2026-07-28-1050-jay-engineering-filter.mdA 级条目 2(akshay_pachaar Twitter/X 2026-07-27)+inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend 条目 B4 +inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md综合判断 +inbox/jay/2026-07-28-kvcache-llm-wiki-rag-systems.md沿用 +organized/knowledge/llm-infra.md§2.3 KV cache 三层算力栈已收 Mooncake/LMCache/FlexKV/VeriCache/DUAL-BLADE/SwiftCache/Tutti/AsymCache 等 14 件套;LMCache arXiv:2510.09665 在活文档已立标一层(USENIX-style 跨引擎 KV 共享),但 akshay_pachaar 7-27 crash-safe 实测数据(90% 成本 / 14× 速度 / 30s startup)尚未入位
LMCache arXiv:2510.09665 完整展开:
- 核心问题:vLLM / SGLang / TensorRT-LLM 三个主流推理引擎的 KV cache 在 engine crash 后无自恢复机制——uncached fallback 需重建全量 cache,cold start > 3 分钟(生产实时服务不可接受)
- LMCache 解决方案:以独立中间层插接三引擎,crash 后 engine 侧自动 fallback 至 uncached inference,cache 重连后自动恢复,无需重启服务
- akshay_pachaar 独立实测(2026-07-27 · Twitter/X · 标题"Your KV Caching Is Broken"):
- input token 成本削减 90%
- 推理速度提升至 14×
- startup time 从 >3 分钟降至约 30 秒(via LMCache 直接 Plug)
- 架构定位:在 LLM 推理引擎和异构存储/网络设备之间,提供标准化高性能 KV 缓存移动和管理 substrate
- GitHub 活跃 + arXiv:2510.09665 论文已接受:已集成 vLLM/SGLang/TensorRT-LLM 三引擎
- LMCache vs arXiv:2607.18141 HyMCache 关系(横向参照而非重复):
- LMCache = 生产层故障容忍(engine crash 下的 fall-back + cache re-attach)
- HyMCache = 内存层级问题(三层 GPU HBM/CXL DRAM/SSD 分层)
- 两者互补:LMCache 解决"什么时候丢"+ HyMCache 解决"丢到哪里"——生产推理系统必须同时面对这两个问题
- 与活文档关系:§2.3 KV cache 三层算力栈 14 件套已收 LMCache 一行(USENIX);但 akshay_pachaar 7-27 独立实测数据(90% 成本削减 / 14× 速度提升 / 30s startup)+ crash-safe 实测场景 + 跨 vLLM/SGLang/TRT-LLM 三引擎插接架构 + 「Your KV Caching Is Broken」标题级披露未作为生产级小节点入位
- 建议归入:§2.3 KV cache 三层算力栈(新增「LMCache 跨引擎 KV 缓存 crash-safe 实测完整披露(arXiv:2510.09665v1 · akshay_pachaar 7-27 独立实测 · 90% 成本 / 14× 速度 / 30s startup · 跨 vLLM/SGLang/TRT-LLM 三引擎插接 · 与 arXiv:2607.18141 HyMCache 形成『故障容忍 + 内存层级』互补)」小节);新增 C68 共识候选:"LLM 推理引擎 KV cache 必须设计 crash-safe fallback · LMCache(arXiv:2510.09665v1)跨 vLLM/SGLang/TRT-LLM 三引擎插接实测:cost −90% / speed 14× / startup 3min → 30s · 与 arXiv:2607.18141 HyMCache(内存层级)形成『故障容忍 + 内存层级』互补";新增 O141 试金石:"LMCache 是否在 2026 H2 进入 vLLM Helm chart 默认依赖;engine crash 后 cache 重连窗口的 SLA 边界(秒级可用 vs 分钟级不可用);crash-tolerant KV cache 是否进入 CNCF llm-d 标准栈"
增量 2【推理引擎 §2.1 / 模型发布 / 推理经济学 §2.11】Kimi K3 2.8T MoE 推理系统工程视角(★★ 必补)
- 来源:
inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend 条目 B1(⭐⭐⭐⭐⭐)+inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md完整展开 +inbox/jay/2026-07-28-ai-eng-job-market-vector-db-landscape-hf-sos.md+inbox/tom/2026-07-28-0900-hf-daily-2026-07-28.md+inbox/stephen/2026-07-28-1245-stephen-coordination-check-noon.md6 实例同步承接 = 主权开源 2.0 立标级 +organized/knowledge/llm-infra.md§2.1 vLLM v0.19.0 (2026-04-03) Kimi K3 Production-Scale Preview + MiniMax-M3 已收一行,但7-27 evening 1.56TB HuggingFace 正式发布完整开源权重 + MXFP4/MXFP8 + KDA/AttnRes/Stable LatentMoE 三项架构创新 + 推理系统工程视角未单独作为「主权开源 2.0 立标级」节点入位
Kimi K3 推理系统工程视角完整展开: - 核心规格:Moonshot AI(月之暗面)· 2026-07-27 按承诺发布完整开源权重· HF 模型页面 https://huggingface.co/khoichk/kimi-k3 · 模型大小约 1.56TB - 架构创新(三项): - KDA(Kimi Delta Attention):注意力机制改进(替代 vanilla Transformer attention) - AttnRes(Attention Residuals):注意力残差连接(residual pathway) - Stable LatentMoE:稳定化 Latent MoE(替代 vanilla MoE 路由) - 量化(MXFP = Mixed-Precision Floating Point): - 权重 MXFP4(4-bit 混合精度浮点):非 INT4,针对 MoE 稀疏激活特性的定制化量化格式 - 激活 MXFP8(8-bit 混合精度浮点):非 INT8,匹配权重低精度 - 对比 INT8/INT4:MXFP 是 MoE 量化的重要进步,适合内存受限部署场景 - Benchmark(官方宣传,第三方核实中): - General Intelligence:SOTA - Coding:SOTA - Agentic:SOTA(重点优化方向) - 主权开源 2.0 立标级证据: - 6 实例同步承接(stephen §5 ⭐⭐⭐⭐ + jay D1 ⭐⭐⭐⭐⭐ + jay B1 五分类 #1 + spark gradient-flow 三款前沿级模型沿用 + tom rag-e1prep 沿用 + flyp multimodal 沿用) - 首个 3T 参数级别的开源模型(2.8T,DeepSeek-V4 直接竞争者) - 完整开源权重(7-16 预告,7-27 按承诺兑现)
- 与活文档关系:§2.1 vLLM v0.19.0 (2026-04-03) Kimi K3 Production-Scale Preview + MiniMax-M3 已立;§2.9 量化 4 路线图(TurboQuant / SAW-INT4 / Don't Waste Bits / RotorQuant)未收 MXFP;但 Kimi K3 7-27 evening 1.56TB HuggingFace 完整开源 + KDA/AttnRes/Stable LatentMoE 三项架构 + MXFP4/MXFP8 量化 + Coding/Agentic SOTA + 6 实例同步承接「主权开源 2.0 立标级」未单独作为量化经济学主线第 5 路线候选入位
- 建议归入:§2.1 推理引擎 6 寡头(新增「Kimi K3 2.8T MoE 推理系统工程视角(Moonshot AI · 2026-07-27 HuggingFace 1.56TB 完整开源 · MXFP4 权重 + MXFP8 激活 · KDA + AttnRes + Stable LatentMoE 三项架构创新 · Coding/Agentic SOTA · 6 实例同步承接主权开源 2.0 立标级)」小节)+ §2.9 量化经济学(新增「MXFP4 + MXFP8 作为量化路线图第 5 分叉(MoE 量化 · 内存受限部署场景 · 与 TurboQuant / SAW-INT4 / Don't Waste Bits / RotorQuant 并列)」候选);新增 C69 共识候选:"主权开源模型 2.0 立标 = Kimi K3 2.8T MoE(Moonshot AI · 2026-07-27 1.56TB HF 完整开源 · MXFP4/MXFP8 · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA · 6 实例同步承接);新增 O142 试金石:"vLLM/SGLang 官方对 Kimi K3 Day-0 支持时间线;MXFP4 量化在 NVIDIA H100/H200/B200 GPU 上精度损失实测;KDA / AttnRes / Stable LatentMoE 三项架构与 DeepSeek-V4 MoE 实现差异;3T 参数级 MoE 在 H100 8 卡 / 16 卡 / GB200 部署的 TTFT/TPOT 实测"
增量 3【推理引擎 §2.1 / 选型决策树 §2.13】vLLM PagedAttention 2.0 官方文档披露(★ 必补)
- 来源:
inbox/jay/2026-07-28-vllm-pagedattention2.md+inbox/jay/2026-07-28-vllm-sglang-production-commands-csdn.md+inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend B4 沿用 +organized/knowledge/llm-infra.md§2.1 vLLM V0.25.1 + MRV2 + V1 connector + §2.7 vLLM K8s OOM 三陷阱(7-26 已立)+ §2.13 推理引擎可复现性危机(含 Turion.ai 7-27 evening 已立)均收 PagedAttention 一行;PagedAttention 2.0 官方文档披露(7-28 inbox vllm-pagedattention2.md)未单独作为「PagedAttention 内部演进」节点入位
vLLM PagedAttention 2.0 关键数据(完整披露):
- 显存利用率提升原理:
PagedAttention 前:~20% 显存利用率(静态分配)
PagedAttention 后:90%+ 显存利用率
效果:单卡并发数提升 5~23 倍
- 核心创新 = OS 虚拟内存式 KV Cache 分页管理:
- 相同前缀请求复用已有 KV blocks(RAG multi-turn、agent 编排、客服 system prompt)
- 前缀缓存(Prefix Caching)成为 vLLM 一等公民
- 实战命令(vLLM 0.9):
bash
vllm serve Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.9 \
--max-model-len 8192 --max-num-seqs 256 \
--enforce-eager
- 分布式 TP=8 命令(70B+ 模型):
bash
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
vllm serve Qwen/Qwen2.5-72B-Instruct \
--tensor-parallel-size 8 --port 8000
- 常见排障:
- CUDA OOM → 降低 --max-num-seqs 或开启 --enforce-eager
- vLLM 8000 端口 + nginx proxy → 需加 Content-Length header
- TRT-LLM 编译失败 → CUDA 12.1 + TRT 8.6 版本必须严格匹配
- 与活文档关系:§2.1 vLLM V0.25.1 + MRV2 + V1 connector + §2.7 vLLM K8s OOM 三陷阱 + §2.13 推理引擎可复现性危机 + §2.7 vLLM K8s 生产 OOM runbook(7-26 evening)均收 PagedAttention 一行;但 PagedAttention 2.0 官方文档披露(显存利用率 20% → 90%+ · 单卡并发数 5-23× · 完整 vLLM 0.9 实战命令 + 分布式 TP=8 命令 + 三大排障)+ 与连续批处理组合(Phase 1/2/3 调度)+ Prefix Caching 一等公民化未单独作为「PagedAttention 内部演进」节点入位
- 建议归入:§2.1 vLLM(新增「vLLM PagedAttention 2.0 官方文档披露(显存利用率 20% → 90%+ · 单卡并发数 5-23× · 完整 vLLM 0.9 实战命令 · 分布式 TP=8 · 三大排障 · 与 Continuous Batching 组合 Phase 1/2/3)」小节)+ §2.7 vLLM K8s 生产 OOM runbook(沿用 + 强化 5-23× 显存提升数据 + Prefix Caching 一等公民化);新增 C70 共识候选:"vLLM PagedAttention 2.0 显存利用率 20% → 90%+ · 单卡并发数 5-23× · Continuous Batching Phase 1/2/3 调度可视化 · Prefix Caching 一等公民化(相同前缀请求复用已有 KV blocks) · vLLM K8s 生产 OOM runbook 三排障(CUDA OOM / nginx Content-Length / TRT-LLM CUDA-TRT 版本匹配)"
增量 4【推理引擎 §2.1 / 选型决策树 §2.13】Continuous Batching 数学原理完整披露(★ 必补)
- 来源:
inbox/jay/2026-07-28-vllm-sglang-production-commands-csdn.md(openEuler CSDN python_小二 · 2026-07-24 · ⭐⭐⭐⭐⭐)+inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdCSDN 条目 S2 +inbox/jay/2026-07-28-vllm-pagedattention2.md沿用 +inbox/jay/2026-07-28-vllm-trt-llm-deploy-csdn.md沿用 +organized/knowledge/llm-infra.md§2.1 vLLM V0.25.1 已收 Continuous Batching 一行,完整数学原理 + Phase 1/2/3 可视化调度未单独入位
Continuous Batching 数学原理完整展开:
静态批处理问题(static batching):
请求A:[Start] 今天 天 气 [Pad][Pad][Pad] → 长度=5
请求B:[Start] 你 好 [Pad][Pad][Pad][Pad] → 长度=3
请求C:[Start] 机器 学习 是 [Pad][Pad] → 长度=5
→ 整批需 pad 到 max_len=5
→ P99 延迟由最长请求决定
→ GPU 利用率低(短请求等待长请求)
连续批处理 / Iteration-level Scheduling 解决方案:
Phase 1: 请求A、B、C 同时 decode
Phase 2: 请求B 完成(生成 [EOS]),移出 → 调度新请求D 进入批处理
Phase 3: 请求C 生成慢,继续;请求A、D 并发 decode
...
→ GPU 利用率最大化
→ 吞吐提升 5~23x(vs 静态批处理)
与 PagedAttention 2.0 联动: - PagedAttention 2.0 = 显存利用率(20% → 90%+) - Continuous Batching = 时间利用率(静态 → 迭代级调度,5-23× 吞吐) - 两者组合 = vLLM/SGLang v0.9 生产部署的「显存 × 时间」双维度最优
SGLang RadixAttention 调参:
import sglang as sgl
@sgl.gen_fn
def batched_agent(context, query):
sgl.select(current, {"context": context})
sgl.gen("answer", max_tokens=256, temperature=0.8)
# RadixAttention 调参
# gpu_memory_utilization=0.88, max_model_len=8192
框架选型决策树(2026 中期):
高并发 API 服务(通用) → vLLM(生态最完善)
多轮对话 / Agent / 前缀共享 → SGLang(RadixAttention 自动前缀复用,结构化输出 99.8%)
极致 NVIDIA datacenter 性能 → TensorRT-LLM(FP8 原生,A100/H100 深度优化)
快速上线 / HF 模型无缝 → TGI(HuggingFace 官方,AWS/Azure 原生)
本地 / CPU / 边缘 → llama.cpp(GGUF 格式,macOS/iPhone 可运行)
极致低延迟 / 企业级实时 → LMDeploy(TurboMind 引擎)
- 与活文档关系:§2.1 vLLM V0.25.1 + 6 寡头 + V1 connector + Continuous Batching 一行已收;§2.13 推理引擎决策框架已收 vLLM vs SGLang 边界 + vLLM vs TensorRT-LLM 决策树 v2.0;但 openEuler CSDN Continuous Batching 完整数学原理 + Phase 1/2/3 可视化调度 + 5-23× 吞吐数据 + 与 PagedAttention 2.0 显存 × 时间双维度组合 + 6 框架选型决策树 2026 中期未单独作为「Continuous Batching 系统化」节点入位
- 建议归入:§2.1 vLLM(新增「Continuous Batching 数学原理完整披露 + Phase 1/2/3 可视化调度 + 5-23× 吞吐提升 · 与 PagedAttention 2.0 显存 × 时间双维度组合」小节)+ §2.13 推理引擎决策框架(新增「6 框架选型决策树 2026 中期(vLLM 通用高并发 / SGLang 多轮 Agent / TensorRT-LLM NVIDIA 极致 / TGI HF 模型 / llama.cpp CPU 边缘 / LMDeploy 极致低延迟)」候选);新增 C71 共识候选:"vLLM/SGLang 生产推理 = PagedAttention 2.0 显存利用率(20% → 90%+ · 5-23× 并发)+ Continuous Batching 时间利用率(迭代级调度 · 5-23× 吞吐)双维度最优 · 6 框架选型决策树 2026 中期(vLLM 通用 / SGLang 多轮 / TensorRT-LLM NVIDIA 极致 / TGI HF / llama.cpp 边缘 / LMDeploy 低延迟)"
增量 5【Inference Engineering §2.11 / 训练基础设施】vLLM 0.9 / SGLang 实战命令集(★ 必补)
- 来源:
inbox/jay/2026-07-28-vllm-sglang-production-commands-csdn.md+inbox/jay/2026-07-28-csdn-llm-finetuning-rag-agent.md沿用 +inbox/jay/2026-07-28-vllm-trt-llm-deploy-csdn.md沿用 +organized/knowledge/llm-infra.md§2.7 vLLM K8s 生产 OOM 三陷阱(7-26 已立)沿用;完整 vLLM 0.9 / SGLang 命令行 + 常见排障 + 框架选型决策树未作为「实战命令集」节点入位
vLLM 0.9 / SGLang 实战命令集(完整披露):
vLLM 0.9 一键启动(Qwen2.5-7B):
vllm serve Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.9 \
--max-model-len 8192 --max-num-seqs 256 \
--enforce-eager
SGLang 一键启动:
python -m sglang.launch_server \
--model-path Qwen/Qwen2.5-7B-Instruct \
--port 8000 --host 0.0.0.0 \
--mem-fraction-static 0.88 --max-running-req 256
Docker 运行 vLLM:
docker run --gpus all -p 8000:8000 \
-v /model:/model \
vllm/vllm-openai:latest \
--model ...
5 推理引擎 2026 中期对比(沿用 7-27 evening 棒): | 引擎 | 核心优化 | 最佳场景 | Llama 70B A100 吞吐 | |------|---------|---------|--------------------| | vLLM | PagedAttention 2.0 + Continuous Batching + Prefix Caching | 通用生产部署,OpenAI 兼容 | ~3,500 tokens/s | | SGLang | RadixAttention 2.0 + State Graph + PD 分离 | 多阶段推理、结构化输出、DeepSeek / Qwen | 高并发多轮 | | TensorRT-LLM | FP8 + CUDA Kernel Fusion | NVIDIA 峰值性能 | ~4,500 tokens/s H100 | | llama.cpp | CPU / 边缘量化 | Mac / Windows / 边缘 | CPU 高效 | | TGI | bfloat16 + Continuous Batching(维护模式) | HuggingFace 官方(已迁 vLLM/SGLang) | ~2,500 tokens/s |
- 与活文档关系:§2.7 vLLM K8s OOM 三陷阱(7-26 已立)+ §2.1 vLLM V0.25.1 沿用;但 vLLM 0.9 / SGLang 完整命令集(Docker + TP=8 + 排障 + 框架选型决策树)未作为「实战命令参考库」节点入位
- 建议归入:§2.1 vLLM(新增「vLLM 0.9 / SGLang 实战命令集完整命令集(Qwen2.5-7B / 72B · TP=8 · Docker · 排障 · 6 框架选型决策树 2026 中期)」小节)+ §2.7 vLLM K8s OOM runbook(沿用 + 强化 0.9 + CUDA OOM + nginx Content-Length + TRT-LLM CUDA-TRT 版本匹配排障);新增 C72 共识候选:"vLLM 0.9 / SGLang 实战命令集已生产化 · Docker 部署 + TP=8 多卡 + 三大排障 + 6 框架选型决策树 2026 中期 · 五推理引擎对比矩阵 Llama 70B A100(vLLM 3,500 / TensorRT-LLM 4,500 H100 / SGLang 高并发多轮 / TGI 2,500 维护模式 / llama.cpp CPU 高效)"
增量 6【训练基础设施 / 推理经济学】arXiv:2607.22529 Skill Self-Play LLM 能力协同进化(★ 必补)
- 来源:
inbox/jay/2026-07-28-1002-rss-cool-papers.md(Cool Papers 今日推荐)+inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md第二部分 +inbox/tom/2026-07-28-0900-hf-daily-2026-07-28.mdHF Daily Skill Self-Play 30▲ 新立标候选 4/5 +organized/knowledge/llm-infra.md§1.6 Agent 自改进 + OpenForgeRL arXiv:2607.21557(7-25 已立)
arXiv:2607.22529 Skill Self-Play 完整展开: - 核心主张:LLM 训练从人工设计与标注转向交互驱动的自进化;现有自进化方法在任务泛化与能力涌现之间面临根本性困境 - Skill Self-Play 框架:通过技能间的协同进化(skill coevolution) 推动 LLM 能力前沿 - 多个技能 agent 在 self-play 机制下相互训练 - 核心洞察:技能不是单独进化的,而是通过交互协同涌现的 - 工程意义: - 打破了"任务泛化 vs 能力上限"的 trade-off - 为 Agent 系统的训练数据生成提供新范式 - 与 ExpRAG arXiv:2603.18272(experience trajectory retrieval)互相补充 - 与 OpenForgeRL arXiv:2607.21557(harness-native agent training)协同
- 与活文档关系:§1.6 Agent 自改进已收 Self-Improvements Survey arXiv:2607.13104 + OpenForgeRL arXiv:2607.21557;但 arXiv:2607.22529 Skill Self-Play 作为「技能协同进化」新范式 + Cool Papers 今日推荐 + HF Daily 30▲ 立标级候选 4/5 + 与 ExpRAG 互补未作为新训练范式入位
- 建议归入:§1.6 Agent 自改进(新增「arXiv:2607.22529 Skill Self-Play(技能间协同进化推动 LLM 能力前沿 · Cool Papers 今日推荐 · HF Daily 30▲ 新立标候选 4/5)」小节);新增 C73 共识候选:"LLM 自进化训练新范式 = Skill Self-Play(arXiv:2607.22529 · Cool Papers 推荐 · HF Daily 30▲ 立标候选 4/5 · 技能间协同进化推动能力前沿 · 与 OpenForgeRL arXiv:2607.21557 + ExpRAG arXiv:2603.18272 + Self-Improvements Survey arXiv:2607.13104 形成「harness + 协同进化 + 经验检索 + 形式化综述」四线互补)"
增量 7【推理经济学 §2.11 / Inference Engineering 职业化】Gergely Orosz「Inference Engineering」职业定位 + AI Engineer 2026 Job Market 1000+ JD(★★ 必补)
- 来源:
inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md第三部分 +inbox/jay/2026-07-28-ai-engineering-backend-database-deployment.md+inbox/jay/2026-07-28-ai-eng-job-market-vector-db-landscape-hf-sos.md+inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend B5 + B6 +inbox/fundaai.substack.com/p/deepllm-2026-from-the-illusion-ofDeep|LLM 2026 +organized/knowledge/llm-infra.md§2.11 推理经济学 + T25(LLM Infra 工程师六维复合角色 + Inference Engineering 职业化)已立
Gergely Orosz Pragmatic Engineer 「Inference Engineering」职业化完整展开(⭐⭐⭐⭐⭐):
- 职业定义:从 prompt 输入到 token 输出的端到端系统工程;不是 model training,而是 production inference optimization
- 核心技能栈:
Inference Engineering 技能栈
├── Quantization(量化)
│ ├── INT8/INT4
│ └── MXFP4/MXFP8(Kimi K3 采用)
├── Flash Attention
├── Paged KV Cache(vLLM PagedAttention 2.0)
├── GPU Kernel Tuning
├── Continuous Batching(迭代级调度)
├── Backpressure handling
└── Output control(structured generation)
- 平台分化:
- 闭源模型(API):inference engineering 由 AI 工程师团队完成(全球可能只有几千人)
- 开源模型(自托管):inference engineering 成为更多团队的核心能力
- Cursor 案例:在开源 Kimi 2.5 基础上构建 Composer 2.0 模型(说明:开源模型 + inference engineering = 构建差异化产品的路径)
- 职业价值:"Picking up inference engineering = a valuable skill — and it's also new and interesting" · "Running your own inference stack on top of an open model gives control and pricing options"
AI Engineer 2026 职位市场分析(Alexey Data Substack · 1000+ JD 样本): - 角色分布: - AI-first roles(≈70%):直接构建 RAG/agents/eval/production deployment - AI-support roles(≈28.5%):infra/platform/GPU/MLOps tooling - 核心职责(AI-first):构建 RAG / Productionize(API 部署、监控)/ Evaluation / guardrails / 延伸:私有数据检索 + 内部 AI 平台 - 关键洞察:"The exact tools and titles will continue to evolve, but the core of AI engineering in 2026 is already clear" · 核心:RAG、agent 架构理解 + 生产化能力 · 框架会变,架构理解不变
Deep|LLM 2026 范式转移(FundaAI Substack): - AI 进入 continuous-execution regime(持续执行模式) - 瓶颈从 per-inference FLOPS 转向系统级能力: - Long-context management - KV-cache persistence - Concurrent sessions - Tool state - Reliability & rollback - Scaling Laws 仍在,但第一范式 exhausted:模型侧 scaling 边际收益递减 · 真正瓶颈:longer inference time horizons + higher usage intensity + structurally persistent infrastructure - Agent 系统经济可行性决定因素:Throughput / Latency / Cost / State consistency
- 与活文档关系:§2.11 推理经济学 + T25 LLM Infra 工程师六维复合角色 + Inference Engineering 职业化(7-26 evening 已立)+ §5 趋势沿用;但 Gergely Orosz Pragmatic Engineer 完整技能栈(Quantization/FlashAttention/Paged KV/Continuous Batching/Backpressure/Structured Generation)+ Cursor Kimi 2.5 + Composer 2.0 案例 + Alexey Data 1000+ JD 数据(70%/28.5%)+ Deep|LLM 2026 continuous-execution regime 完整范式转移 + KV-cache persistence as new bottleneck 四个维度未作为「Inference Engineering 职业化 2026 H1 立标」节点入位
- 建议归入:§2.11 推理经济学(新增「Inference Engineering 职业化 2026 H1 立标(Gergely Orosz Pragmatic Engineer Substack · 完整技能栈 · Cursor Kimi 2.5 + Composer 2.0 案例 · AI Engineer 2026 JD 70%/28.5% · Deep|LLM 2026 continuous-execution regime 范式转移 · KV-cache persistence as new bottleneck)」小节);新增 C74 共识候选:"Inference Engineering 2026 H1 立标 = Gergely Orosz Pragmatic Engineer 完整技能栈 + Cursor Kimi 2.5 + Composer 2.0 案例 + AI Engineer 2026 Job Market 70% AI-first / 28.5% AI-support + Deep|LLM 2026 continuous-execution regime 范式转移 + KV-cache persistence as new bottleneck · 4 维独立证据汇聚;新增 T26 趋势候选:"AI 行业 bottleneck 从 per-inference FLOPS 转向 system-level capabilities(KV-cache persistence + concurrent sessions + tool state + reliability & rollback)= Inference Engineering 成为独立工程学科;新增 O143 试金石:"Gergely Orosz Inference Engineering 专栏是否在 2026 H2 进入主流 AI Engineer 职涯规划;Job Market 70% AI-first 比例在 LlamaIndex Workflows 1.0 / Microsoft Agent Framework 1.0 / Claude Agent SDK S 级落地后是否进一步上升;open-source model 上自托管 inference 的成本模型(Deep|LLM 2026)是否在 2026 H4 跑通"
增量 8【横切层 §2.10 / Kernel / AI 自动化】arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(★★ 旁证)
- 来源:
inbox/jay/2026-07-28-1050-jay-engineering-filter.mdA 级条目 1 +inbox/jay/2026-07-28-1105-jay-five-category-briefing.md沿用 +organized/knowledge/llm-infra.md§1.11 Kernel / AI 自动生成已收 Fable + FlashInfer-Bench + μCUTLASS DSL 等
arXiv:2607.17979 MLSys 2026 FlashInfer AI Kernel Generation Contest 完整展开: - 核心设计原则:将 evaluation harness 与 profile-backed optimization controller 分离 - CUDA Skills 框架:通用 CUDA skill + FlashInfer B200 specific skill,YAML 格式定义 kernel 优化目标 - 两阶段搜索:编译验证 → latency profile → 选择最优 kernel 配置 - 集成 Torch Profiler + NVIDIA Nsight Compute(NCU)分析脚本 - 提供竞争级 CUDA kernel 优化 harness,含真实 B200 GPU 实验床 - GitHub:github.com/syhya/mlsys26-flashinfer-contest - 工程意义:Awesome-harness-engineering GitHub 2026 年最新学术来源;与「State of Agent Engineering 2026」(LangChain 调查:57.3% 生产 agents)构成 harness engineering 的实践与学术互证
- 与活文档关系:§1.11 Kernel / AI 自动生成已收 Fable 18.71× + μCUTLASS DSL + GeVA 2.8× + Triton Attention Kernel + FlashInfer-Bench(MLSys 2026 Contest DSA Dogace 37.07×)等;但 arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer Contest · CUDA Skills YAML · 两阶段搜索 · Torch Profiler + NCU 集成 · B200 实验床)未作为「harness engineering + Kernel 优化双线交汇」节点入位
- 建议归入:§1.11 Kernel / AI 自动化(新增「arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer AI Kernel Contest · CUDA Skills YAML + Torch Profiler + NCU 两阶段搜索 · B200 实验床)」小节);新增 C75 共识候选:"Kernel 自动优化 = Harness Engineering + Kernel 双线交汇(arXiv:2607.17979 MLSys 2026 FlashInfer Contest · CUDA Skills YAML 框架 · 编译验证 → latency profile 两阶段搜索 · Torch Profiler + NCU 集成 · B200 实验床 · 与 awesome-harness-engineering GitHub 2026 年更新批次互相印证)"
增量 9【横切层 §2.10 / AI Engineer 职业化】AI Engineer 2026 JD Market 1000+ 数据(★ 旁证)
- 来源:
inbox/jay/2026-07-28-ai-eng-job-market-vector-db-landscape-hf-sos.md完整披露 +inbox/jay/2026-07-28-1105-jay-five-category-briefing.md沿用
AI Engineer 2026 JD 1000+ 样本量化数据: - 数据来源:Alexey Data Substack(https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal) - 样本规模:1300+ 从业者数据引用 + 1000+ JD 样本 - 关键洞察: - AI-first roles ≈ 70%:直接构建 RAG/agents/eval/production deployment - AI-support roles ≈ 28.5%:infra/platform/GPU infrastructure/data pipelines - RAG + agent 架构理解 + productionize 能力是核心竞争力 - 框架会变,架构理解不变
- 与活文档关系:§2.11 推理经济学 + T25 Inference Engineering 职业化沿用;但 AI Engineer 2026 JD 1000+ 量化数据(70% AI-first / 28.5% AI-support)未作为「Inference Engineering 职业化量化验证」节点入位
- 建议归入:§2.11 推理经济学 + T25 Inference Engineering 职业化(沿用 + 强化 70% AI-first / 28.5% AI-support 量化数据)
增量 10【警示】Tom inference E1 7-28 当日缺失 + jay engineering-v38 主题分化 8 件独立工程化深度文件 + spark E1 节奏连续 3 日回落(警示)
- 来源:
inbox/tom/7-28 共 5 件(0840/1440 radar + 0900 hf-daily + 1006/1007 RSS · 未发布独立 inference E1)+inbox/jay/2026-07-28-engineering-e1prep.md7-28 engineering-v38 准备棒 + 7-28 早间独立工程化深度文件 8 件 +inbox/spark/7-28 截至 18:40 仅 3 件 RSS + 1 件 agent-e1prep noon,未发布 llm-infra E1(连续 3 日:7-26 evening → 7-27 evening → 7-28 evening · spark E1 节奏连续 3 日) - ⚠️ 警示:
- Tom inference E1 7-28 当日缺失:tom 7-28 仅 5 件(rag-v47 + eval-v40 + 2 radar + hf-daily + 2 RSS),未发布独立 inference E1——继 7-27 inference E1 3 主线增量收官后延续低密度状态;inference.md 已 7-27 03:50 收官,延续 inference 主题已稳定稳态
- jay engineering-v38 主题分化为 8 件独立工程化深度文件:vllm-pagedattention2 / vllm-trt-llm-deploy-csdn / vllm-sglang-production-commands-csdn / uv-python-toolchain / kvcache-llm-wiki-rag-systems / hf-transformers-v5-source-analysis / owasp-agent-security-hf-incident / kimi-k3-inference-systems-substack / graphrag-trending = 9 件独立文件覆盖 vLLM PagedAttention 2.0 / SGLang 部署 / vLLM-TRT-LLM 排障 / Python 工具链 / KV-Wiki-RAG / Transformers v5 源码 / OWASP 安全 / Kimi K3 推理 / GraphRAG = jay 工程化主题 v38 主轴深度饱和
- Spark E1 节奏连续 3 日回落(stephen 1245 协调棒已确认):7-26 noon 仅 RSS 通稿 → 7-26 evening 双 E1 完整恢复第 2 棒 → 7-27 截至 12:45 仍仅 RSS 通稿 → 7-27 evening 仍仅 RSS 通稿 → 7-28 截至 12:45 仍仅 RSS 通稿 = spark E1 节奏连续 3 日回落第 3 棒
- 本场 spark 已发布 llm-infra E1 棒(本棒) = 节奏反转第 4 棒 = 解除回落诊断(stephen 1245 协调棒已预测「7-28 evening 协调棒观察是否再次反转」)
- llm-infra 主题活文档已 7-27 05:37 收官 9 天抢修完成(Wave3 §V 7-27 凌晨版)——本场为脱离 9 天未更新状态后第 2 棒 E1
- Tom inference E1 7-28 当日缺失非信号衰减 = tom 7-27 inference E1 3 主线增量已覆盖核心新增量,延续 inference.md 7-27 03:50 收官后稳定状态
- ⚠️ evaluation 主题活文档 4 天未更新待补救(工作队列自动检测持续提示 2026-07-24 00:18 → 2026-07-28 18:40 · 非本场主题但需提示)
- 与活文档关系:本场作为 llm-infra 主题活文档脱离 9 天未更新状态后第 2 棒 E1 预消化,7 主线增量与活文档 §1.1 / §1.3 / §1.6 / §1.11 / §2.1 / §2.3 / §2.7 / §2.10 / §2.11 / §2.13 各节均有衔接
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:LMCache akshay_pachaar 7-27 实测数据(90% 成本削减 / 14× 速度 / 30s startup)的测试条件对齐
- 来源:akshay_pachaar Twitter/X 2026-07-27 · Your KV Caching Is Broken
- 问题:90% 成本削减 / 14× 速度提升 / 30s startup 数据的测试条件(模型 / 序列长度 / batch size / 硬件 GPU 型号 / driver 版本)是否对齐存疑(独立工程师实测 vs 厂商软文 / 受控 benchmark vs 工业生产)
- 核实建议:对照 LMCache GitHub README + 官方 benchmark paper arXiv:2510.09665 · 检索跨 vLLM/SGLang/TRT-LLM 兼容矩阵
⚠️ 待核实 2:Kimi K3 vLLM/SGLang Day-0 支持时间线
- 来源:jay 7-28 kimi-k3-inference-systems-substack
- 问题:vLLM/SGLang 官方对 Kimi K3 Day-0 支持时间线未明确(2.8T MoE · MXFP4 + MXFP8 · KDA + AttnRes + Stable LatentMoE = 推理引擎需实现 4 项新特性)
- 核实建议:vLLM GitHub PR + SGLang release notes + Moonshot AI 官方博客
⚠️ 待核实 3:Kimi K3 MXFP4 量化在 NVIDIA H100/H200/B200 GPU 上精度损失
- 来源:jax 7-28 five-category-briefing B1
- 问题:MXFP4(混合精度浮点 4-bit)vs INT4(整数 4-bit) 在 NVIDIA GPU 上的精度损失实测未公开
- 核实建议:Moonshot AI 官方技术报告 + KDA/AttnRes/Stable LatentMoE 架构论文 + 第三方 benchmark(Simon Willison / Import AI / Nathan Benaich)
⚠️ 待核实 4:Cool Papers Skill Self-Play(arXiv:2607.22529)能力涌现实验数据
- 来源:Cool Papers 今日推荐 + HF Daily 30▲
- 问题:Skill Self-Play 技能间协同进化推动能力前沿的具体实验数据(skill 间 interactions / compute-optimal / convergence rate)未完整披露
- 核实建议:精读 arXiv:2607.22529 方法论 + 实验章节;对照 Self-Improvements Survey arXiv:2607.13104 形式化框架
⚠️ 待核实 5:Gergely Orosz「全球可能只有几千人」做闭源 inference engineering
- 来源:Pragmatic Engineer Substack
- 问题:「闭源模型 inference engineering 全球可能只有几千人」 的数据来源未明确(为何是「几千人」规模)
- 核实建议:Pragmatic Engineer 调研 + LinkedIn 公开数据交叉验证;Cursor Kimi 2.5 + Composer 2.0 案例的具体技术细节
⚠️ 待核实 6:Continuous Batching 5-23× 数据的具体测试条件
- 来源:openEuler CSDN python_小二 · 2026-07-24
- 问题:5-23× 吞吐提升 vs 静态批处理 的具体测试条件(模型 / 序列长度 / 并发数 / 硬件 GPU)未完整披露
- 核实建议:vLLM/SGLang 官方 benchmark 套件独立复现 + Continuous Batching 论文检索
⚠️ 待核实 7:PagedAttention 2.0 单卡并发 5-23× 数据是否与 vLLM 0.25.1 默认 RECOMPUTE preemption + Chunked Prefill 组合后保持
- 来源:jay 7-28 vllm-pagedattention2.md
- 问题:PagedAttention 2.0 5-23× 单卡并发数 是否在 vLLM 0.25.0/0.25.1(V0 中 RECOMPUTE + Chunked Prefill + NUMA-aware 调度 + Data Parallelism)组合下保持
- 核实建议:vLLM 官方 benchmark + vLLM V1 docs + Turion.ai vLLM vs SGLang workload 分类数据(7-27 已立)交叉验证
⚠️ 待核实 8:arxiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation 的 B200 实测数据
- 来源:MLSys 2026 FlashInfer Contest
- 问题:B200 GPU 实验床 的具体 kernel 优化 baseline(Naive / 手写 CUDA / Triton / μCUTLASS DSL)对比数据未完整披露
- 核实建议:GitHub:github.com/syhya/mlsys26-flashinfer-contest 提交记录 + MLSys 2026 论文集
三、可引用的 arXiv 号列表(本轮新增 / 涉及)
| arXiv 号 | 标题 / 主题 | 增量归属 | 与 llm-infra.md 现有脉络关系 |
|---|---|---|---|
| arXiv:2510.09665 | LMCache: KV Cache Management for LLM Serving(跨 vLLM/SGLang/TRT-LLM 三引擎插接 + crash-safe fallback + 标准化 KV 缓存移动 substrate) | 增量 1 | §2.3 KV cache 三层算力栈新增「LMCache crash-safe 实测」小节(沿用 + 强化 akshay_pachaar 7-27 数据) |
| arXiv:2607.22529 | Skill Self-Play: Skill Coevolution for LLM Capability Frontier(技能间协同进化推动 LLM 能力前沿 · Cool Papers 今日推荐 · HF Daily 30▲ 立标候选 4/5) | 增量 6 | §1.6 Agent 自改进新增「Skill Self-Play」小节 |
| arXiv:2607.17979 | Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer AI Kernel Contest · CUDA Skills YAML + Torch Profiler + NCU 两阶段搜索 · B200 实验床) | 增量 8 | §1.11 Kernel / AI 自动生成新增「Harness Engineering + Kernel 优化双线交汇」小节 |
| arXiv:2605.01280 | LLM Serving OR 立场论文(Chen et al. 2026 Ω(√(B log G)) 改善因子) | 存量已立(tom 7-26 / 7-27 inference E1 已完整展开) | §2.2 调度 9 学派 OR 数学框架已有完整小节 |
| arXiv:2605.11733 | LLM 推理应评估为 Energy-to-Token 产出(140T token/日 + Doubao 120T/日 + 高质量人类数据 2026-2028 稀缺) | 存量已立(tom 7-26 inference E1 已完整展开) | §2.11 推理经济学已有完整小节 |
| arXiv:2606.14589 | Silent Failures in Production LLM Agent Systems(8 周生产数据 + 五类分类法 + Class D fail-plausible) | 存量已立(tom 7-26 inference E1 已完整展开) | §2.5 服务层并发安全已有完整小节 |
| arXiv:2607.18141 | HyMCache: CXL-Hybrid Memory KV Cache Framework(沿用 7-27 evening 棒) | 存量已立(spark 7-27 llm-infra E1 增量 1) | §2.79 CXL KV 新增框架级系统化表述小节 |
| arXiv:2603.20397 | KV Cache Optimization Strategies for Scalable and Efficient LLM Inference(沿用) | 存量已立(spark 7-27 llm-infra E1 增量 1 旁证) | §2.3 KV cache 三层算力栈 ACL 2026 System-Aware KVCache Survey 沿用 |
| arXiv:2607.21557 | OpenForgeRL: Train Harness-native Agents in Any Environment(沿用) | 存量已立(flyp 7-25 / spark 7-26 主题页已立) | §1.6 Agent 自改进已有完整小节 |
| arXiv:2607.21503 | Agentic Context Management(沿用) | 存量已立(tom 7-27 / 7-28 radar + rag-e1prep) | §1.6 Agent 自改进新立标 |
| arXiv:2607.14277 | Multi-Head Latent Control(沿用) | 存量已立(tom 7-28 radar) | §1.6 Agent 自改进立标 |
| arXiv:2607.22043 | Scaling Native Multimodal Language Models(沿用) | 存量已立(flyp 7-28 dual critical read) | multimodal 主题 |
| arXiv:2607.18142 | O-VAD Industrial Video Anomaly Detection(沿用) | 存量已立(flyp 7-28 dual critical read) | multimodal 主题 |
| arXiv:2607.21324 | GradRAG: Multi-Agent RAG Prompt Adaptation(沿用) | 存量已立(jay 7-28 five-category-briefing D3) | rag 主题 |
| arXiv:2605.25480 | LLM-Wiki Agent-Native Retrieval(沿用) | 存量已立(jay 7-28 five-category-briefing D1) | rag 主题 |
| arXiv:2411.18077 | MiniKV: KV Cache 选择性压缩 + 2-bit 量化(沿用) | 存量已立(spark 7-27 llm-infra E1 增量 4) | §2.79 CXL KV MiniKV 子节 |
| arXiv:2607.21653 | Molt: PyTorch-Native Agentic RL(沿用) | 存量已立(jay 7-28 engineering-e1prep 增量 4) | §2.10 横切层 engineering 主题 |
| arXiv:2607.16859 | Dataset Distillation by Influence Matching(沿用) | 存量已立(jay 7-28 engineering-e1prep P2) | engineering 主题 |
| arXiv:2607.14277 | Multi-Head Latent Control(沿用 · paper_cards 608 已建卡) | 存量已立(tom 7-28 radar 立标) | agent 主题 |
| arXiv:2607.12756 | VisCo: VLM Visual Token Compression(沿用) | 存量已立(jay 7-28 engineering-e1prep P2) | multimodal 主题 |
| arXiv:2607.19238 | FinanceComplexQA(沿用) | 存量已立(tom 7-27 / 7-28 rag) | agent / evaluation 主题 |
| arXiv:2607.04763 | ReOPD Multi-Turn On-Policy Distillation(沿用) | 存量已立(spark 7-26 agent E1) | coding-agents 主题 |
| arXiv:2607.21576 | Self-Supervised Structured Dynamics(沿用 · HF Daily 跌出 7-28 前 15 名外 ⚠️) | 存量已立(stephen ai-industry-v30 增量 6 反方) | multimodal 主题 |
| arXiv:2607.22157 | Learning on the Job(沿用 · paper_cards 610 已建卡) | 存量已立(tom 7-28 rag-v47) | agent 主题 |
注:本轮 llm-infra 主题核心新增 arXiv 号 3 个(arXiv:2510.09665 LMCache + arXiv:2607.22529 Skill Self-Play + arXiv:2607.17979 Harness Engineering for Kernel);其余 21 个均为存量沿用(跨主题引用)。
四、检查过的来源清单
inbox/jay(7-28 共 26 件,全部已读): - ✅ 2026-07-28-1050-jay-engineering-filter.md(5 条保留条目 + 3 条 B 级 + 3 条 C 级;Harness Engineering for Kernel / LMCache / Awesome-harness-engineering GitHub / Trace-Driven Optimization / Multi-Agent Debugging 5 条 A 级) - ✅ 2026-07-28-1105-jay-five-category-briefing.md(27.6KB · Database D1-D5 RAG 主题硬资产 + Backend B1-B6 Kimi K3 + LMCache + Skill Self-Play + Inference Engineering + AI Engineer JD + Cloud-Native C1-C5 + CSDN S1-S4 + Reproduction R1-R2 = 第 7 次/日) - ✅ 2026-07-28-1505-jay-five-category-afternoon-briefing.md(14.6KB · 下午场 briefing · 第 8 次/日 · 增 Kimi K3 / OpenForgeRL / LMCache 等) - ✅ 2026-07-28-engineering-e1prep.md(15.4KB · v37 后 12h 第 38 版准备棒 · 7 件主线增量 · 3 待核实) - ✅ 2026-07-28-vllm-pagedattention2.md(1.4KB · vLLM PagedAttention 2.0 关键数据) - ✅ 2026-07-28-vllm-sglang-production-commands-csdn.md(9.3KB · openEuler CSDN python_小二 2026-07-24 + 腾讯云 + GagA246 · vLLM 0.9 / SGLang 实战命令集) - ✅ 2026-07-28-vllm-trt-llm-deploy-csdn.md(1.8KB · vLLM + TensorRT-LLM 生产部署排障) - ✅ 2026-07-28-csdn-hf-transformers-v5-agent-rag-high-value.md(8.9KB · HF Transformers v5 agent/RAG 高价值) - ✅ 2026-07-28-csdn-substack-rag-agent-multimodal-finetuning-jul2026.md(14.7KB · CSDN 高价值 10 件 RAG/Agent/Finetuning) - ✅ 2026-07-28-csdn-llm-finetuning-rag-agent.md(12.6KB · LLM 微调 / RAG / Agent · 2026 实战) - ✅ 2026-07-28-kimi-k3-inference-systems-substack.md(9.3KB · Kimi K3 + Skill Self-Play + Inference Engineering + Deep|LLM 2026 + AI Engineer JD) - ✅ 2026-07-28-kvcache-llm-wiki-rag-systems.md(8.6KB · KV Cache + LLM Wiki + RAG Systems) - ✅ 2026-07-28-owasp-agent-security-hf-incident.md(12.1KB · OWASP Agent + HF 七月安全事故) - ✅ 2026-07-28-hf-transformers-v5-source-analysis.md(8.4KB · HF Transformers v5.8.0.dev0 缓存系统深度分析) - ✅ 2026-07-28-graphrag-trending.md(1.4KB · GraphRAG trending) - ✅ 2026-07-28-uv-python-toolchain.md(1.5KB · uv Python 工具链) - ✅ 2026-07-28-1140-news-x-tech-radar.md(3.0KB · X 硬核干货雷达) - ✅ 2026-07-28-ai-engineering-backend-database-deployment.md(8.4KB · AI Engineering 综合) - ✅ 2026-07-28-ai-eng-job-market-vector-db-landscape-hf-sos.md(12.6KB · AI Eng JD + Vector DB + Landscape + HF SoS) - ✅ 2026-07-28-1000/1001/1002/1003/1006/1007 RSS 通稿 9 件(bytebytego + raschka + nathan-benaich + simon-willison + cool-papers + lilian-weng + cool-papers-ir + import-ai + msr-blog + yt-karpathy + yt-fireship)
inbox/tom(7-28 共 6 件 · 全部已读 · tom inference E1 7-28 当日缺失): - ✅ 2026-07-28-0900-hf-daily-2026-07-28.md(HF Daily 7-28 票榜 15 件 · 5 件 net-new 续立/翻倍 · Skill Self-Play 30▲ + Molt 24▲ 立标) - ✅ 2026-07-28T0840-agent-rag-longcontext-radar.md(8 候选 + 3 高价值:Agentic Context 2607.21503 + Multi-Head Latent Control 2607.14277 + O-VAD 2607.18142 · 立标候选 4/5) - ✅ 2026-07-28T1440-agent-rag-longcontext-radar.md(下午场雷达) - ✅ 2026-07-28-1006-rss-yt-yannic-kilcher.md / 2026-07-28-1007-rss-yt-lex-fridman.md(2 件 RSS 通稿) - ✅ 2026-07-28_rag-lite.md(8 候选 + 3 高价值) - ✅ 2026-07-28-rag-e1prep-v47.md(16.2KB · v46 后 24h 第 47 版准备棒 · 5 件主线增量:LAMAR + δ-mem Substack + Learning on the Job + LlamaParse Harness + AAAI Subramanian 7 反方验证) - ✅ 2026-07-28-evaluation-e1prep.md(13.2KB · evaluation 主题 · 非本场主题) - ⚠️ tom inference E1 7-28 当日缺失(继 tom 7-27 inference E1 3 主线收官后延续低密度状态 · inference.md 7-27 03:50 已收官稳态 · 无新增 inference 专项)
inbox/flyp(7-28 共 6 件 · 全部已读): - ✅ 2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md(16.1KB · dual critical read B 级 · 立标级候选 3/5 · 2 件短审稿 + 3 反方硬标签新增) - ✅ 2026-07-28-1000-rss-cameron-wolfe.md / 1003-rss-interconnects.md / 1006-rss-yt-ai-explained.md(3 件 RSS 通稿) - ✅ 2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read.md(16.2KB · OPD / CFG / Multi-Turn / Long-Horizon Critical Read) - ✅ 2026-07-28-multimodal-e1prep.md(70.8KB · multimodal v34 准备棒) - ✅ 2026-07-28-risk-e1prep.md(72.8KB · risk 主题) - ⚠️ flyp 7-28 无独立 inference / llm-infra 产出(归属 multimodal / coding-agents / risk 主题)
inbox/spark(7-28 共 4 件 · 本场 E1 棒): - ✅ 2026-07-28-1002-rss-gradient-flow.md(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 沿用) - ✅ 2026-07-28-1003-rss-chip-huyen.md(chip-huyen 7-28 RSS 通稿 · 无 llm-infra 专项) - ✅ 2026-07-28-1007-rss-yt-3blue1brown.md(3blue1brown 7-28 RSS 通稿 · 无 llm-infra 专项) - ✅ 2026-07-28-agent-e1prep.md(51.0KB · agent 主题 noon 棒 · 非本场主题) - 🟢 本场 E1 棒 2026-07-28-llm-infra-e1prep.md(本文件 · 7 主线增量 + 2 旁证 + 1 警示 · spark E1 节奏反转第 4 棒 = 解除 3 日回落诊断)
inbox/stephen(7-28 共 13 件 · 全部已读): - ✅ 2026-07-28-0910-news-x-vip-radar.md(X VIP radar · 沿用) - ✅ 2026-07-28-1004-news-anthropic-news.md / 1004-news-openai-news.md / 1005-news-deepmind-news.md / 1005-news-google-ai.md / 1005-news-hf-blog.md / 1005-news-tldr-ai.md / 1006-news-bens-bites.md / 1007-news-yt-anthropic.md / 1007-news-yt-deepmind.md / 1007-news-yt-openai.md(10 件 frontier lab news 通稿) - ✅ 2026-07-28-1245-stephen-coordination-check-noon.md(48.1KB · stephen 1245 协调棒已识别 Kimi K3 1.56TB HF 上线 = 6 实例同步承接主权开源 2.0 立标级 + spark E1 节奏连续 3 日回落第 3 棒 + evaluation 主题 4 天未更新待补救) - ✅ 2026-07-28-ai-industry-e1prep-v30.md(39.3KB · 第 30 版准备棒 · 7 件主线增量 · 14 张 paper_cards 抽样) - ⚠️ stephen 7-28 无独立 inference / llm-infra E1(归属 ai-industry 主题)
paper_cards(近 3 天新卡 IDs 596-619 共 ~24 张,抽查结果): - 主分类 llm-infra / pure inference-systems(LLM serving / KV cache / quantization / speculative decoding)新增 0 张 - 副分类 llm-infra 1 张:606-2607-21848.md = Closing the Loop(autoregressive video + KV cache revisit consistency · multimodal 主 + llm-infra 副) - 工程邻接 7 张: - 585-2607-21557 OpenForgeRL(agent / evaluation 主 + arXiv:2607.21557 入 coding-agents / agent 主题) - 576-2607-04763 ReOPD(agent 主 + arXiv:2607.04763 入 coding-agents 主题) - 607-2607-21653 Molt(engineering 副 + arXiv:2607.21653 PyTorch-Native Agentic RL) - 608-2607-14277 Multi-Head Latent Control(agent / application 主 + engineering 副 + arXiv:2607.14277) - 610-2607-22157 Learning on the Job(engineering 主 + arXiv:2607.22157 Continual Learning Frozen-Weights) - 609-2607-12756 VisCo(engineering 副 + arXiv:2607.12756 VLM Token Compression) - 602-2607-16859 Dataset Distillation by Influence Matching(engineering 主 + arXiv:2607.16859) - 延续 7-25/7-26/7-27 同期趋势:paper_cards 近 3 天无实质性 pure inference-systems 新卡(24 张新卡全部为 agent / multimodal / engineering / rag / evaluation / coding-agents 主分类);arXiv:2510.09665 LMCache 主卡未建,需补建
work-queue.md(2026-07-28 自动生成): - ✅ llm-infra 主题已脱离 9 天未更新状态(Wave3 §V 7-27 凌晨版 2026-07-27 05:37 收官 · 工作队列自动检测已解除) - 待建卡 0 - 待富化 64(全主题通用,非 llm-infra 专项) - ⚠️ evaluation 主题活文档 4 天未更新待补救(2026-07-24 00:18 → 2026-07-28 18:40 · 工作队列自动检测持续提示 · 非本场主题)
五、结论与今晚活文档接力建议
本次 llm-infra 主题 E1 预消化轮共发现 7 主线增量 + 2 旁证 + 1 警示,来自 jay 7-28 全天 26 件 + stephen 1245 协调棒 6 实例同步承接 Kimi K3 立标级证据 + tom 7-28 radar/rag/eval/hf-daily 跨主题引用 + flyp 7-28 multimodal/risk 跨主题引用 + spark 7-28 RSS 通稿 + paper_cards 近 3 天主分类 llm-infra/pure inference-systems 0 张新卡 + arXiv 3 个核心新增(LMCache + Skill Self-Play + Harness Engineering for Kernel)。最重要的工程洞察是:
- arXiv:2510.09665 LMCache 跨引擎 KV 缓存 crash-safe 实测完整披露——akshay_pachaar 7-27 独立测试 · vLLM/SGLang/TRT-LLM 三引擎插接 · engine crash 后 fallback to uncached + cache 重连 · 90% 成本削减 / 14× 速度提升 / startup 从 >3 分钟 → ~30 秒 · 标准化 KV 缓存移动 substrate · 与 arXiv:2607.18141 HyMCache 形成「故障容忍 + 内存层级」互补
- Kimi K3 2.8T MoE 推理系统工程视角——Moonshot AI · 2026-07-27 按承诺发布完整开源权重 · HF 1.56TB · MXFP4 权重 + MXFP8 激活 · KDA + AttnRes + Stable LatentMoE 三项架构创新 · Coding/Agentic SOTA · 6 实例同步承接主权开源 2.0 立标级
- vLLM PagedAttention 2.0 官方文档披露——vLLM 2026 上午 inbox · 显存利用率 20% → 90%+ · 单卡并发数 5-23× · vLLM 0.9 实战命令(单卡 + TP=8)+ 三大排障 + Prefix Caching 一等公民化
- Continuous Batching 数学原理完整披露——openEuler CSDN python_小二 · 静态批处理 P99 = max_len 限制 vs 连续批处理 Phase 1/2/3 调度 · 5-23× 吞吐提升 · 与 PagedAttention 2.0 形成「显存 × 时间」双维度最优
- vLLM 0.9 / SGLang 实战命令集——openEuler CSDN + 腾讯云 + GagA246 · 完整命令行 + Docker 部署 + TP=8 多卡 + 三大排障 + 6 框架选型决策树 2026 中期 · 与 PagedAttention 2.0 + Continuous Batching 联动
- arXiv:2607.22529 Skill Self-Play LLM 能力协同进化——Cool Papers 今日推荐 · HF Daily 30▲ 新立标候选 4/5 · 技能间协同进化推动 LLM 能力前沿 · 与 OpenForgeRL arXiv:2607.21557 + ExpRAG arXiv:2603.18272 + Self-Improvements Survey arXiv:2607.13104 四线互补
- Inference Engineering 职业化 2026 H1 立标——Gergely Orosz Pragmatic Engineer Substack · 完整技能栈 Quantization/FlashAttention/Paged KV/Continuous Batching/Backpressure/Structured Generation · Cursor Kimi 2.5 + Composer 2.0 案例 · AI Engineer 2026 JD Market 1000+ 数据(70% AI-first / 28.5% AI-support)+ Deep|LLM 2026 continuous-execution regime 范式转移 + KV-cache persistence as new bottleneck · 4 维独立证据汇聚 + 2 旁证:arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer Contest · CUDA Skills YAML + Torch Profiler + NCU 两阶段搜索 · B200 实验床) + AI Engineer 2026 JD Market 1000+ 量化数据(70% AI-first / 28.5% AI-support) + 1 警示:Tom inference E1 7-28 当日缺失 + jay engineering-v38 主题分化为 8 件独立工程化深度文件 + spark E1 节奏连续 3 日回落第 3 棒
涉及 arXiv 号 24 个(本轮核心新增 3 个 + 存量沿用 21 个): - 本轮核心新增:arXiv:2510.09665 LMCache KV Cache 跨引擎 crash-safe(增量 1)+ arXiv:2607.22529 Skill Self-Play LLM 协同进化(增量 6)+ arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(增量 8) - 存量沿用:arXiv:2605.01280 OR 数学优化 + arXiv:2605.11733 Energy-to-Token + arXiv:2606.14589 Fail-Plausible(均已立标);arXiv:2607.18141 HyMCache + arXiv:2603.20397 KV Cache 综述 + arXiv:2411.18077 MiniKV(7-27 棒已立);arXiv:2607.21557 OpenForgeRL + arXiv:2607.21503 Agentic Context + arXiv:2607.14277 Multi-Head Latent Control + arXiv:2607.22043 Scaling Native Multimodal + arXiv:2607.18142 O-VAD + arXiv:2607.21324 GradRAG + arXiv:2605.25480 LLM-Wiki + arXiv:2607.21653 Molt + arXiv:2607.16859 Dataset Distillation + arXiv:2607.12756 VisCo + arXiv:2607.19238 FinanceComplexQA + arXiv:2607.04763 ReOPD + arXiv:2607.21576 Self-Supervised Structured Dynamics + arXiv:2607.22157 Learning on the Job(均为 7-28 跨主题引用)
今晚活文档接力建议:llm-infra 主题活文档已脱离 9 天未更新状态(Wave3 §V 7-27 凌晨版 2026-07-27 05:37 收官);本场 7 主线增量集中在 §2.1 推理引擎 6 寡头(Kimi K3 2.8T MoE 推理系统工程视角 + vLLM PagedAttention 2.0 + Continuous Batching 数学原理完整披露 + vLLM 0.9/SGLang 实战命令集 + arXiv:2607.22529 Skill Self-Play)+ §2.3 KV cache 三层算力栈(arXiv:2510.09665 LMCache crash-safe 实测完整披露)+ §1.6 Agent 自改进(arXiv:2607.22529 Skill Self-Play Cool Papers 今日推荐)+ §1.11 Kernel / AI 自动生成(arXiv:2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation)+ §2.7 vLLM K8s 生产 OOM runbook(沿用 + 强化 PagedAttention 2.0 5-23× + 0.9 + 三大排障)+ §2.9 量化经济学(MXFP4 + MXFP8 作为量化路线图第 5 分叉候选)+ §2.10 横切层(MXFP4 量化 + Harness Engineering for Kernel + AI Engineer JD 量化数据)+ §2.11 推理经济学(Inference Engineering 职业化 2026 H1 立标:Gergely Orosz + Cursor Kimi 2.5 + AI Engineer JD 70%/28.5% + Deep|LLM 2026 continuous-execution regime)+ §2.13 推理引擎决策框架(6 框架选型决策树 2026 中期 + vLLM PagedAttention 2.0 + Continuous Batching 双维度最优);建议今晚活文档接力棒按上述 10 节依次入位,新增 C68-C75 共 8 条共识候选 + T26 趋势候选(AI bottleneck per-inference FLOPS → system-level capabilities)+ O141-O143 共 3 条试金石(LMCache 是否进入 vLLM Helm chart 默认依赖 + Kimi K3 vLLM/SGLang Day-0 支持时间线 + Inference Engineering 是否在 2026 H2 进入主流 AI Engineer 职涯规划);9 个跨主题引用 arXiv 号保持沿用。
Spark E1 节奏反转第 4 棒:spark E1 节奏连续 3 日回落(7-26 noon 仅 RSS 通稿 → 7-26 evening 双 E1 完整恢复第 2 棒 → 7-27 截至 12:45 仍仅 RSS 通稿 → 7-27 evening 仍仅 RSS 通稿 → 7-28 截至 12:45 仍仅 RSS 通稿)→ 7-28 evening 本棒 = 节奏反转第 4 棒 = 解除回落诊断。stephen 7-28 1245 协调棒已识别「spark E1 节奏连续 3 日回落第 3 棒」并预测「7-28 evening 协调棒观察是否再次反转」,本场 E1 棒发布即解除该诊断。llm-infra 主题活文档已 7-27 05:37 收官 9 天抢修完成——本场为脱离 9 天未更新状态后第 2 棒 E1。
evaluation 主题活文档 4 天未更新待补救(2026-07-24 00:18 → 2026-07-28 18:40 · 工作队列自动检测持续提示 · 非本场主题但需提示)。
主权开源 2.0 立标级 6 实例同步承接:Kimi K3 7-27 evening 1.56TB HuggingFace 上线 = stephen §5 ⭐⭐⭐⭐ + jay D1 ⭐⭐⭐⭐⭐ + jay B1 五分类 briefing #1 + spark gradient-flow 三款前沿级模型沿用 + tom rag-e1prep 沿用 + flyp multimodal 沿用 = 6 实例同步承接;与「主权开源 2.0 立标级」(在主权开源 1.0 = DeepSeek-V3 的基础上,主权开源 2.0 升级为 3T 参数级 MoE + MXFP4/MXFP8 定制量化 + KDA + AttnRes + Stable LatentMoE 架构创新)正式立标。
paper_cards 主分类 llm-infra 新增 0 张:本轮纯 inference-systems(KV cache / quantization / speculative decoding)新卡继续为 0,延续 7-25/7-26/7-27 同期趋势;建议 cron_classify_llm 补建 arXiv:2510.09665 LMCache 主卡(本轮核心新增)及沿用的 arXiv:2607.18141 HyMCache + arXiv:2511.18077 MiniKV 主卡;6 月以来的 SKILL.md llm-infra.md 主分类补建工作需后续 cron 排程跟进。
本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:spark · 2026-07-28 18:40(Asia/Shanghai) llm-infra 主题活文档已脱离 9 天未更新状态 · Wave3 §V 7-27 凌晨版 2026-07-27 05:37 收官 · 本场为脱离 9 天未更新状态后第 2 棒 E1