inference · E1 预消化简报(2026-07-28)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-07-27 22:00 → 2026-07-28 22:00(约 24 小时) 基线:
organized/knowledge/inference.md(2026-07-28 更新 · vLLM 0.26.0 + SGLang v0.6 · 十节 · 引用→90) 基线快照: inference.md §1 已收 vLLM 0.26.0(Spark + DeepSeek-V4 + Inkling) + §2.4 SGLang v0.6(DSpark / GLM-5.2 DSA cache split / ReplaySSM 6.4× / Inkling / FlashInfer 强制);§2.1/2.3 KV cache 14 件套已收 LMCache(USENIX 一行);§9 新趋势已收 HyMCache(arXiv:2607.18141 CXL 三层) + HotInfra '26 检查来源: work-queue.md + inbox/jay/(2026-07-28 五分类简报 B1-B6 + kimi-k3-inference-systems-substack + engineering-filter + csdn-vllm-pagedattention2 + csdn-vllm-sglang-production-commands + csdn-vllm-trt-llm-deploy + kvcache-llm-wiki-rag-systems + hf-transformers-v5-source-analysis) + inbox/tom/(0840/1440/2040 radar + 0900 hf-daily-2026-07-28 + rag-e1prep-v47 + evaluation-e1prep-v40) + inbox/flyp/(1550 OPD/CFG critical read + multimodal-e1prep + risk-e1prep) + inbox/spark/(agent-e1prep + llm-infra-e1prep-v9) + inbox/stephen/(ai-industry-e1prep-v30 + coordination-check-noon + llm-application-e1prep) + paper_cards/602-625 近 3 天共 24 张(主分类 inference-systems 新增 0 张;副分类邻接 1 张=606 Closing the Loop autoregressive video KV cache revisit) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考
0. 综述判断
本场 inference 主题 24h 窗口增量性质:低密度(4 主线 + 1 警示 + 1 待核实)。SGLang v0.6 Breaking Changes 与 inference.md §2.4 高度重叠(DSpark / GLM-5.2 / ReplaySSM / Inkling 均已入位),本场实际新增独立增量集中在 4 条,核心动作是将 Kimi K3 2.8T MoE 推理系统工程视角立标入 §2.1 + 将 LMCache akshay_pachaar crash-safe 实测数据从 llm-infra 跨主题迁移补入 §2.3 + 将 Skill Self-Play 自进化训练旁路作为 §5 训练侧邻接节点入位 + Inference Engineering 职业化以独立小节锚定在 §2.11。无 inference-specific 新 arXiv 卡片(602-625 共 24 张新卡主分类均为 application/multimodal/benchmark,0 张 inference-systems)。
1. 核心增量(4 主线 + 1 警示 + 1 待核实,按活文档归位顺序)
增量 1【推理引擎 §2.1 / 模型发布 / 推理经济学 §2.11】Kimi K3 2.8T MoE 推理系统工程视角——主权开源 2.0 立标级首次覆盖(★★ 必补)
来源:inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B1(⭐⭐⭐⭐⭐)+ inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md 完整展开 + inbox/tom/2026-07-28-0900-hf-daily-2026-07-28.md + inbox/spark/2026-07-28-llm-infra-e1prep.md §增量 2 + inbox/stephen/2026-07-28-1245-stephen-coordination-check-noon.md 6 实例同步承接 + inbox/spark/2026-07-28-1337-agent-e1prep.md §增量 5 Kimi K3 沿用 + organized/knowledge/inference.md §2.1 Kimi K3 Production-Scale Preview 已收一行(2026-04-03 v0.19.0),但 7-27 evening 1.56TB HF 完整开源 + MXFP4/MXFP8 + KDA/AttnRes/Stable LatentMoE 三项架构 + Coding/Agentic SOTA 未作为独立节点入位
Kimi K3 推理系统工程视角完整展开: - 模型规格:Moonshot AI · 2026-07-27 按承诺发布完整开源权重 · HF 模型页面约 1.56TB · 参数量 2.8T(首个 3T 参数级别开源 MoE) - 三项架构创新: - KDA(Kimi Delta Attention):注意力机制改进(替代 vanilla Transformer attention);SGLang v0.6 已实现正确 KDA MTP 路径 - AttnRes(Attention Residuals):注意力残差连接(residual pathway) - Stable LatentMoE:稳定化 Latent MoE(替代 vanilla MoE 路由) - 量化格式 MXFP(Mixed-Precision Floating Point): - MXFP4:4-bit 混合精度浮点权重(非 INT4,针对 MoE 稀疏激活特性定制) - MXFP8:8-bit 混合精度浮点激活(非 INT8,匹配权重低精度) - 与 TurboQuant / SAW-INT4 / Don't Waste Bits / RotorQuant 并列,构成量化路线图第 5 分叉 - Benchmark(官方宣传,第三方核实中):General Intelligence SOTA / Coding SOTA / Agentic SOTA(重点优化方向) - 推理系统工程影响: - SGLang v0.6 Inkling Day-0 支持(SGLang + Miles 联合实现)已有 975B MoE 案例,Kimi K3 插接路径可参考 - vLLM 0.26.0 DeepSeek-V4 性能推送路线(专用路由 kernel / fused_topk_bias / redundant repeat/copy removal)可类比为 Kimi K3 推理优化提供参照 - 显存需求:1.56TB HF 权重,H100 8×80GB 可加载(FP8 或 MXFP4 量化后)
与活文档关系:inference.md §2.1 推理引擎格局已收 vLLM/SGLang/TensorRT-LLM/Ollama/Colibri/LMDeploy 六框架;Kimi K3 2.8T MoE 7-27 HF 完整开源 + KDA/AttnRes/Stable LatentMoE + MXFP4/MXFP8 未作为独立框架侧节点入位;§9 新趋势未收录 KDA/AttnRes 与 SGLang v0.6 Blackwell linear attention 的关联
建议归入:§2.1 推理引擎格局(新增「Kimi K3 2.8T MoE · Moonshot AI · 2026-07-27 HuggingFace 1.56TB 完整开源 · MXFP4 权重 + MXFP8 激活 · KDA + AttnRes + Stable LatentMoE 三项架构创新 · Coding/Agentic SOTA · SGLang v0.6 Inkling Day-0 路径可参照 · 6 实例同步承接主权开源 2.0 立标级」小节)+ §2.9 量化经济学(新增 MXFP4/MXFP8 为第 5 量化路线候选);新增 C69 共识候选:"主权开源 2.0 立标 = Kimi K3 2.8T MoE(Moonshot AI · 2026-07-27 1.56TB HF 完整开源 · MXFP4/MXFP8 · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA · 6 实例同步承接)";新增 O142 试金石:"vLLM/SGLang 官方对 Kimi K3 Day-0 支持时间线;MXFP4 在 H100/H200/B200 精度损失实测;KDA/AttnRes/Stable LatentMoE vs DeepSeek-V4 MoE 架构差异量化;3T MoE 在 H100 8×80GB 量化部署 TTFT/TPOT 实测"
增量 2【KV cache 三层算力栈 §2.3】arXiv:2510.09665 LMCache akshay_pachaar crash-safe 独立实测数据完整披露(★ 必补)
来源:inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B4(⭐⭐⭐⭐⭐)+ inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md + inbox/spark/2026-07-28-llm-infra-e1prep.md §增量 1 + organized/knowledge/inference.md §2.3 KV cache 14 件套已收 LMCache(USENIX arXiv:2510.09665 一行);llm-infra.md §2.3 已收 LMCache 完整数据(含 akshay_pachaar 实测),但 inference.md §2.3 仅收 USENIX 一行,akshay_pachaar crash-safe 实测数据(90% 成本 / 14× 速度 / 30s startup)未入位
LMCache crash-safe 实测完整展开: - 核心问题:vLLM / SGLang / TensorRT-LLM 三个主流推理引擎的 KV cache 在 engine crash 后无自恢复机制——uncached fallback 需重建全量 cache,cold start > 3 分钟(生产实时服务不可接受) - LMCache 解决方案:以独立中间层插接三引擎,crash 后 engine 侧自动 fallback 至 uncached inference,cache 重连后自动恢复,无需重启服务 - akshay_pachaar 独立实测(2026-07-27 · Twitter/X · 标题"Your KV Caching Is Broken"): - input token 成本削减 90% - 推理速度提升至 14× - startup time 从 >3 分钟降至约 30 秒 - LMCache vs HyMCache(arXiv:2607.18141)互补关系: - LMCache = 生产层故障容忍(crash fallback + cache re-attach,回答"什么时候丢") - HyMCache = 内存层级问题(GPU HBM / CXL DRAM / SSD 三层分层,回答"丢到哪里") - 两者互补:生产推理系统必须同时面对这两个问题
与活文档关系:inference.md §2.3 KV cache 14 件套已收 LMCache(USENIX 一行);但 akshay_pachaar 7-27 独立实测(90% cost / 14× speed / 30s startup)+ crash-safe 场景 + 三引擎插接架构未作为生产级节点入位;§9 新趋势已收 HyMCache CXL 三层但未建立 LMCache/HyMCache 互补关系
建议归入:§2.3 KV cache(扩展 LMCache 小节点,新增 akshay_pachaar crash-safe 实测数据);§9 新趋势(新增「LMCache(故障容忍)+ HyMCache(内存层级)互补关系」横评);新增 C68 共识候选:"LLM 推理引擎 KV cache 必须设计 crash-safe fallback · LMCache(arXiv:2510.09665)跨 vLLM/SGLang/TRT-LLM 三引擎插接实测:cost −90% / speed 14× / startup 3min → 30s · 与 arXiv:2607.18141 HyMCache(内存层级)形成『故障容忍 + 内存层级』互补";新增 O141 试金石:"LMCache 是否在 2026 H2 进入 vLLM Helm chart 默认依赖;engine crash 后 cache 重连窗口的 SLA 边界;crash-tolerant KV cache 是否进入 CNCF llm-d 标准栈"
增量 3【LLM 训练 §5 / Agent 自进化】arXiv:2607.22529 Skill Self-Play:技能间协同进化推动 LLM 能力前沿(★ 建议补)
来源:inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B2(⭐⭐⭐⭐)+ inbox/spark/2026-07-28-llm-infra-e1prep.md §增量 6 + inbox/stephen/2026-07-28-llm-application-e1prep.md §增量 4 + Cool Papers 今日推荐 + paper_cards/607(Molt arXiv:2607.21653)、/610(Learning on the Job arXiv:2607.22157)横向邻接
Skill Self-Play 核心展开: - 核心问题:LLM 训练从人工设计/标注转向交互驱动的自进化后,现有自进化方法在任务泛化之间面临根本性困境 - Skill Self-Play 方案:通过技能间的协同进化(co-evolution)推动 LLM 能力前沿——不同技能 agent 之间进行 self-play,形成能力迭代的正反馈 - 与现有训练范式的关系: - vs. RLAIF/RLHF:不需要人工标注或 reward model - vs. Self-Play(围棋/代码):多技能间协同进化,非单一任务 - vs. ExpRAG(inference.md §3.5):ExpRAG 通过推理时环境交互增强;Skill Self-Play 在训练阶段进行能力进化 - vs. Molt(arXiv:2607.21653 · paper_cards/607 · 今日新卡):Molt = PyTorch-Native agentic RL 训练框架;Skill Self-Play = 协同进化机制;两者互补(训练框架 + 进化策略) - vs. Learning on the Job(arXiv:2607.22157 · paper_cards/610):冻结权重持续学习;Skill Self-Play = 权重更新阶段的能力进化
与活文档关系:inference.md §5(训练与部署协同)已收分布式训练与推理耦合(ExpRAG / speculation as training signal);但 Skill Self-Play 作为"训练侧推理进化"机制未入位;§9 新趋势未收录自进化训练前沿
建议归入:§5 训练与部署协同(新增「Skill Self-Play arXiv:2607.22529:技能间协同进化推动 LLM 能力前沿(与 Molt/ Learning on the Job/ ExpRAG 互补))」小节);新增 O143 试金石:"Skill Self-Play 框架在 2026 H2 是否进入开源训练框架(如 SFTTrainer/VLLM-RL)官方支持;技能协同进化在生产 Agent 系统中的实用性评估;Skill Self-Play 与 Multi-Agent RAG(GradRAG/MemGraphRAG)协同路径"
增量 4【推理经济学 §2.11 / AI Engineer 职业化】Inference Engineering 职业化首次系统化——独立学科确立(★ 建议补)
来源:inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B5(⭐⭐⭐⭐)+ inbox/spark/2026-07-28-llm-infra-e1prep.md §增量 7 + inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B6(AI Engineer 2026 Job Market)+ inbox/stephen/2026-07-28-llm-application-e1prep.md AI Engineer Job Market 旁证
Inference Engineering 职业化完整展开: - 定义(Gergely Orosz / Pragmatic Engineer Substack,2026):"推理 = 训练后模型接收输入并逐 token 生成输出的过程;推理工程 = 围绕这一过程的所有工程挑战:batching(批处理)、caching(缓存)、quantization(量化)" - 核心技能栈:Quantization / Flash Attention / Paged KV Cache / Continuous Batching / GPU Kernel Tuning / Backpressure / Structured Generation - 平台分化: - 闭源模型(API 调用):推理工程师需求集中在 API 封装、cost optimization、structured output - 开源模型(自托管):推理工程师需求覆盖硬件选型、引擎配置、量化部署、性能 profiling - 典型案例:Cursor 在开源 Kimi 2.5 基础上构建 Composer 2.0,说明开源主权模型 + inference engineering 可以支撑顶级产品 - 行业需求验证(Alexey Data Substack · 1000+ JD 样本): - AI-first roles ≈ 70%(直接构建 RAG/agents/eval/production deployment) - AI-support roles ≈ 28.5%(infra/platform/GPU/MLOps tooling) - 关键洞察:框架会变,但 RAG/agent 架构理解 + 生产化能力是核心竞争力
与活文档关系:inference.md §2.11 推理经济学已收 vLLM vs SGLang 成本对比、Turion.ai benchmark、vLLM 三参数调优 35% 波动;但 Inference Engineering 作为独立学科首次系统化(Pragmatic Engineer + Cursor 案例 + AI Engineer 2026 Job Market 量化)未入位
建议归入:§2.11 推理经济学(新增「Inference Engineering 职业化确立:独立技能栈 + 闭源/开源平台分化 + Cursor Kimi 2.5 案例 + 2026 Job Market 70% AI-first 量化验证」小节);新增 T25 趋势候选:"Inference Engineering 从 AI Engineering 独立出来成为专门学科(2026年为元年)"
警示【推理引擎 §2.1】⚠️ Kimi K3 vLLM/SGLang 官方支持时间线待核实
来源:inbox/jay/2026-07-28-1105-jay-five-category-briefing.md Backend B1 后续行动 + inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md 后续行动
警示内容:Kimi K3 7-27 HF 1.56TB 完整开源权重已发布,但截至 2026-07-28 vLLM 和 SGLang 对 Kimi K3 的官方支持(Day-0 或 Day-N)时间线尚未确认。SGLang v0.6 Inkling Day-0 支持已存在(975B MoE),但 Kimi K3 的具体支持状态需跟进 vLLM GitHub Issues 和 SGLang Release Notes。inference.md §2.1 框架选型时"Kimi K3 插接哪家引擎"属于开放问题,暂不宜作为确定性共识写入。
2. 值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | Kimi K3 MXFP4 量化精度损失实测数据缺失 | jay kimi-k3-inference-systems-substack.md | 🟡 待核实 | 等 vLLM/SGLang 官方 benchmark 或第三方评测 |
| 2 | Kimi K3 Coding/Agentic SOTA 属官方宣传 | jay five-category-briefing Backend B1 | 🟡 待核实 | 需第三方评测(LiveBench / BFCL / TEA 对照) |
| 3 | SGLang v0.6 DSpark 383.7 tok/s 数据基于 DeepSeek-V4-Pro(TP8,B300,bs=1) | inference.md §2.4 + spark llm-infra-e1prep | 🟢 已知条件限 | 注意不是通用数字,适用于特定配置 |
| 4 | LMCache akshay_pachaar 实测为 Twitter/X 帖子,非 peer-reviewed | jay Backend B4 | 🟡 待核实 | 等待正式 arXiv 版本或 GitHub benchmark |
| 5 | Skill Self-Play arXiv:2607.22529 尚未 peer-reviewed | jay Backend B2 | 🟡 学术新增 | 关注后续社区复现 |
3. 本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2607.22529 | Skill Self-Play:技能间协同进化 | 增量 3 | §5 训练与部署协同 |
| 2510.09665 | LMCache 跨引擎 KV 缓存 crash-safe 实测 | 增量 2 | §2.3 KV cache 三层算力栈 |
| 2607.18141 | HyMCache CXL 三层 KV cache(已在 inference.md §9,横向参照) | — | §2.3/§9 横向 |
| 2607.21653 | Molt PyTorch-Native Agentic RL(邻接,paper_cards/607) | 横向参照 | §5 训练旁证 |
| 2607.22157 | Learning on the Job 冻结权重持续学习(邻接,paper_cards/610) | 横向参照 | §5 训练旁证 |
| 2607.22375 | IDEAgent Agentic QD-Search(邻接,paper_cards/604) | 横向参照 | §5/§9 旁证 |
| 2607.22345 | Teachy Mini 评估(邻接,paper_cards/611) | 横向参照 | §6 评估旁证 |
4. 已检查来源清单
以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay/2026-07-28-vllm-pagedattention2.md→ llm-infra 增量 3(vLLM PagedAttention 2.0 官方文档)inbox/jay/2026-07-28-vllm-sglang-production-commands-csdn.md→ llm-infra 增量 5(实战命令集)inbox/jay/2026-07-28-vllm-trt-llm-deploy-csdn.md→ llm-infra 增量 5(框架选型决策树)inbox/jay/2026-07-28-kvcache-llm-wiki-rag-systems.md→ 涉及 LMCache,已合并至增量 2inbox/jay/2026-07-28-hf-transformers-v5-source-analysis.md→ 非 inference 主题inbox/jay/2026-07-28-owasp-agent-security-hf-incident.md→ 安全主题,非 inferenceinbox/jay/2026-07-28-graphrag-trending.md→ RAG 主题inbox/jay/2026-07-28-uv-python-toolchain.md→ 工程工具链,非 inferenceinbox/tom/2026-07-28T0840-agent-rag-longcontext-radar.md→ Agent/RAG 主题,无 inference 新增inbox/tom/2026-07-28T1440-agent-rag-longcontext-radar.md→ Agent/RAG 主题inbox/tom/2026-07-28T2040-agent-rag-longcontext-radar.md→ Agent/RAG 主题(Physics of Multi-Turn Planning arXiv:2607.24720 邻接 agent)inbox/tom/2026-07-28-0900-hf-daily-2026-07-28.md→ 已在 stephen/stephen llm-application-e1prep §增量 1 中全量引用inbox/tom/2026-07-28_rag-lite.md→ RAG 主题inbox/flyp/2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read.md→ RAG/Agent 配置 critical read,非 inference 系统工程inbox/spark/2026-07-28-1337-agent-e1prep.md→ Agent 主题(Kimi K3 沿用已引用)inbox/stephen/2026-07-28-ai-industry-e1prep.md→ AI industry 主题(Skill Self-Play 邻接已引用)inbox/stephen/2026-07-28-1245-stephen-coordination-check-noon.md→ 协调棒(Kimi K3 6 实例已引用)- paper_cards/602-625 共 24 张新卡 → 主分类 0 张 inference-systems(application/benchmark/multimodal 为主);1 张邻接(606 Closing the Loop autoregressive video KV cache revisit consistency,副分类 llm-infra)
5. 本次 E1 预消化结论
增量条数:4 主线 + 1 警示 + 1 待核实
结论:inference 主题 7-27 22:00 → 7-28 22:00 约 24h 窗口为低密度,主因是 SGLang v0.6(7-27)和 vLLM 0.26.0(7-26)已在前次 E1 充分覆盖,本场新增独立增量集中在 Kimi K3 推理系统工程视角(跨主题迁移)、LMCache akshay_pachaar 实测补录(跨主题迁移)、Skill Self-Play 训练侧新增、Inference Engineering 职业化新增四条,均为中等体量。无 inference-specific 新 arXiv 卡片是本场重要信号——7-27~28 的 research frontier 集中在 application/benchmark/multimodal,inference-systems 暂时沉寂。
建议今晚活文档 v28 接力动作: 1. Kimi K3 独立节点入 §2.1(主权开源 2.0 立标级) 2. LMCache akshay_pachaar 实测入 §2.3(从 llm-infra 迁移补全) 3. Skill Self-Play入 §5(训练侧邻接新增) 4. Inference Engineering 职业化入 §2.11(新学科锚定) 5. C68/C69 共识 + O141-O143 试金石写入对应候选池