inference · E1 预消化简报(2026-08-02)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-08-01 22:00 → 2026-08-02 22:00(约 24 小时) 基线:
organized/knowledge/inference.md(2026-08-01 更新 · 十节 · 引用→123;基线含 GoodServe/AMPD/LAAR/Harvest/Agent Memory/Token-Operations 四层/MCP 2.0 三层栈等 E1-0801 增量) 基线快照(昨日 E1 收官状态): §1 已收 vLLM 0.26.0 + SGLang v0.6 + TGI EOL + vLLM 1,918 commits/月;§2.1 已收 PagedAttention 2.0 + vLLM MRV2 + SGLang v0.6;§2.2 调度已收 GoodServe(2605.16867 E2E-SLO goodput) + AMPD(2602.14516 multi-round PD) + LAAR(2604.15732 NUMA-aware) + OmniServe + Blink + Disagg 5 节点;§2.3 KV cache 已收 Harvest(P2P 43.48%) + Agent Memory(edge Q4) + LMCache;§2.5 已收 Token-Operations 四层 + P-EAGLE/MeanCache/Cortex;§3 投机解码已收 Lossy Verification(2607.26627);§7 Agent 已收 MCP 2.0 + Lilian Weng Harness + ByteByteGo 三层栈 检查来源: work-queue.md + inbox/jay/(2026-08-02T1400-jay-evening-briefing-llm-inference-hf-security-disaggregation-2026 20.6KB Transformers vLLM 原生后端★/PD disaggregation AMD MI300X★/GPU idle Dharma★/Prefill-Decode选型表★/vLLM vs SGLang vs LMDeploy benchmark★ · 2026-08-02T1105-jay-five-category-briefing 16.8KB Filtered ANNS★/VoltAgent awesome-ai-agent-papers★★/HF安全事件★★★/CNCF云原生★ · 2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608 13.7KB vLLM v0.26.0 XPU★/LMCache MLSys★★★/Modular MAX★★/Agent Memory栈★★★ · 2026-08-02T1055-jay-engineering-filter 12.4KB Spheron Context Engineering★★★/vLLM Korea AMD MI300X★★/SitePoint vLLM Production★★/effloow H100 benchmark★★/LMCache MLSys★★★/Lilian Weng Harness★★/MCP 2.0 Simon Willison★★★ · 2026-08-02T1900-jay-evening-briefing-vecdb-mcp-agent-memory-2026 23.1KB PingCAP Vector DB选型表★★★/Mem0 2026状态★★★/RAG 500K临界点★★★/Langfuse→ClickHouse收购★★/Modular MAX★★/Alice Labs Agent Framework排名★★★/Brain Bytes 2026 Stack★★★/Pulumi CLI vs MCP★★ · 2026-08-02-csdn-llm-agent-rag-mlops · 2026-08-02-database-e1prep · 2026-08-02-engineering-e1prep · 2026-08-02T1450-jay-engineering-filter-p2 · 2026-08-02T1950-jay-engineering-filter-p3) + inbox/tom/(2026-08-02-0900-hf-daily-2026-08-02 15件 Memory Decoder at Scale(2607.27919)★/Frontis-MA1(2607.28568)★★ · 2026-08-02-1004-rss-yt-yannic-kilcher · 2026-08-02-1005-rss-yt-lex-fridman · 2026-08-02-agent-rag-longcontext-radar · 2026-08-02-evaluation-e1prep · 2026-08-02-rag-e1prep) + inbox/spark/(2026-08-02-llm-infra-e1prep · 2026-08-02-agent-e1prep · 2026-08-02-1001-rss-gradient-flow · 2026-08-02-1003-rss-chip-huyen · 2026-08-02-1005-rss-yt-3blue1brown) + inbox/flyp/(2026-08-02-1000-rss-cameron-wolfe · 2026-08-02-1002-rss-interconnects · 2026-08-02-1004-rss-yt-two-minute-papers · 2026-08-02-1005-rss-yt-ai-explained · 2026-08-02-RecMem-recurrence-memory-consolidation-critical-read · 2026-08-02-multimodal-e1prep · 2026-08-02-risk-e1prep) + inbox/stephen/(2026-08-02-0910-news-x-vip-radar · 2026-08-02-1003-news-anthropic/deepmind/openai · 2026-08-02-ai-industry-e1prep · 2026-08-02-llm-application-e1prep) + paper_cards/682-688 共7张新卡(主分类 inference-systems 新增 0 张;682 Filesystem-Based Memory agent;683 Σ-Mem agent;684 Fairness Pruning evaluation;685 See2Think multimodal;686 Filesystem-Based Memory agent;687 Deep Research agent;688 OmniScope multimodal) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考
0. 综述判断
本场 inference 主题 24h 窗口增量性质:中低密度(4 主线 + 2 旁证 + 1 警示)。
本场无主分类 inference-systems 新增 paper_card(连续第 3 个零新增日),但工程层新增 4 条有实质数字和版本支撑的增量,均为 inference.md 尚未覆盖的内容:① vLLM Model Runner v2(vLLM Korea Meetup)——PD disaggregation on AMD MI300X + MORI-IO + GPU-native Triton kernels 消除 CPU 瓶颈,是今日工程密度最高条目;② Spheron Context Engineering Guide——2026 年生产 Agent 单次请求实际输入 50K-500K tokens 实证 + vLLM APC 16-token block 粒度具体参数;③ Hugging Face Dharma AI Blog——idle GPU = P&L 损失的生产经济学分析,填补 inference.md §1 GPU 调度经济学视角;④ vLLM Conference 2026-08-24~26——首届 vLLM Conference 纳入 Ray Summit,标志 vLLM 基础设施化。本场是工程收束轮,无新 inference-systems 学术论文批量涌入,邻接来源(jay engineering-filter/inference 相关工程 + spark llm-infra E1)的 inference 邻接增量质量较高但均属工程博客层而非学术 paper 层,建议今晚活文档接力以 small additions 为主。
1. 核心增量(4 主线)
增量 1【推理引擎 §1 / 调度 §2.2】vLLM Model Runner v2 + PD Disaggregation on AMD MI300X with MORI-IO(vLLM Korea Meetup 2026)★★★ 建议补)
来源: inbox/jay/2026-08-02T1400-jay-evening-briefing-llm-inference-hf-security-disaggregation-2026.md 条目5 + inbox/jay/2026-08-02T1055-jay-engineering-filter.md 条目5 + inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md 条目3
两条来源综合展开:
vLLM Model Runner v2 · GPU-native Triton Kernels 消除 CPU 瓶颈:
- 核心突破:vLLM Model Runner v2 将关键路径移入 GPU-native Triton kernels,完全消除 CPU 瓶颈
- Transformers 原生后端里程碑:--model-impl transformers 标志现已比 vLLM hand-written 原生实现更快或持平——覆盖 Qwen3 全系列(4B 单卡、32B 张量并行、235B FP8 MoE,8×H100 数据+专家并行)
- 技术路径:transformers 提供建模代码,vLLM 提供 inference 优化层,两者解耦 → 模型作者无需额外 porting 即可利用 vLLM 的 continuous batching 和自定义 attention kernels
- zero-bubble async scheduling:piecewise CUDA graphs 消除传统 pipeline bubbles
- 可信度:高(Hugging Face 官方博客,含 benchmark gist 可复现)
- 来源:https://huggingface.co/blog/native-speed-vllm-transformers-backend(HF Blog 2026-07-08,已被今日 jay 工程筛选保留)
vLLM PD Disaggregation on AMD MI300X + MORI-IO:
- 硬件拓扑:8-GPU AMD MI300X 节点(不是 NVIDIA 生态)
- MORI-IO 隔离方案:在 8-GPU MI300X 节点分离 prefill/decode,转移 KV cache,稳定 ITL,提升 goodput
- 与 NVIDIA Dynamo/vLLM NPD 的对比:AMD MI300X + MORI-IO 是首次有 vLLM 官方文档记录的 AMD PD disaggregation 生产配置
- 可信度:高(vLLM 官方博客 Korea Meetup 2026)
- 来源:https://vllm.ai/blog(vLLM Korea Meetup 片段)
与活文档关系:inference.md §1 已收 vLLM 0.26.0 + vLLM AI Blog 2026-07-16 生产工程规模(1,918 commits/月);§2.2 调度已收 AMPD(2602.14516 multi-round 自适应 PD 分离)/GoodServe/LAR;但 vLLM Model Runner v2(GPU-native Triton kernels + --model-impl transformers 持平或超越 hand-written)+ vLLM PD on AMD MI300X with MORI-IO 未入位
建议归入:§1 vLLM(新增「vLLM Model Runner v2:GPU-native Triton kernels 完全消除 CPU 瓶颈 + --model-impl transformers 持平/超越 hand-written 实现(HF Blog 2026-07-08)+ piecewise CUDA graphs 消除 pipeline bubbles + zero-bubble async scheduling」小节)+ §2.2 调度(邻接,新增「vLLM PD Disaggregation AMD MI300X + MORI-IO:首个 AMD 8-GPU MI300X PD 分离生产配置 + KV cache 跨节点转移 + goodput 提升 · 与 NVIDIA Dynamo/vLLM NPD 互补 · vLLM Korea Meetup 2026」);新增 O181 试金石:"--model-impl transformers 在本机构实际模型(非 Qwen3)上的 benchmark 实测;AMD MI300X MORI-IO 方案迁移到 NVIDIA 拓扑的可行性"
增量 2【推理优化 §2.5 / GPU 经济学 §2.10】Spheron Context Engineering Guide:2026 年生产 Agent 50K-500K tokens/请求 + vLLM APC 16-token block 粒度(★★★ 建议补)
来源: inbox/jay/2026-08-02T1055-jay-engineering-filter.md 条目4(⭐⭐⭐保留)
核心展开:
- 2026 年生产实际数据(Spheron Blog,2026-08 最新):
- Agent 单次请求输入 50,000–500,000 tokens(这是 2026 年生产实际数字,远超 benchmark 常见 4K/32K 场景)
- 这是理解 KV cache 成本和 prefix caching 价值的核心背景数据
- vLLM 自动前缀缓存(APC)具体参数:
- 默认 16-token block 粒度哈希复用(不是粗粒度的 chunk 级别)
gpu_memory_utilization调优区间的具体说明(需配合硬件+模型实测找最优)- Prefix Caching vs. KV Cache 决策树(Spheron 给出具体配置原则):
- 共享系统提示词/模板 → prefix caching 收益最大(block 粒度哈希)
- 独立长文档 → KV cache 共享无效,需 PagedAttention 管理
- 混合场景 → vLLM APC 自动处理,系统不可见
- Context Engineering 是 2026 年生产 LLM 最大成本杠杆(Spheron 原文判断)
与活文档关系:inference.md §2.5 推理优化已收 Token-Operations 四层 + FlashInfer + P-EAGLE/MeanCache;§2.3 KV cache 已收 Harvest P2P + Agent Memory edge Q4;但 2026 年生产 Agent 实际 token 规模(50K-500K)+ vLLM APC 16-token block 粒度具体参数未作为独立节点入位
建议归入:§2.5 推理优化(新增「Spheron Context Engineering Guide 2026:生产 Agent 单次请求实际输入 50K-500K tokens(2026 年实测)+ vLLM APC 默认 16-token block 粒度哈希复用 + gpu_memory_utilization 调优区间 + Prefix Caching vs KV Cache 决策树 · Context Engineering 是 2026 年生产 LLM 最大成本杠杆」小节);新增 O182 试金石:"本机构生产工作负载的 token 长度分布 p50/p95/p99;50K 以上请求占比与 prefix overlap 率的相关性"
增量 3【推理引擎 §1 / GPU 经济学 §2.10】Hugging Face Dharma AI Blog:Idle GPU = P&L 损失 + GPU 利用率经济学(★ 建议补)
来源: inbox/jay/2026-08-02T1400-jay-evening-briefing-llm-inference-hf-security-disaggregation-2026.md 条目2 + inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md 条目8(GPU Management)
核心展开:
- 类比:idle GPU = 接地飞机(airplane on the ground generates no revenue)
- 核心问题:GPU 空闲是 AI 基础设施的主要浪费来源(直接 P&L 损失),与 inference 调度的经济学直接相关
- 三个维度: 1. GPU 利用率可视化:必须先量化才能优化(Harvest arXiv:2602.00328 的 43.48% 平均利用率数据是实证基础) 2. 调度优化:从 batch scheduling 到 goodput scheduling(与 GoodServe E2E-SLO goodput 调度呼应) 3. 抢占式调度:Spot/Preemptible 实例用于 fault-tolerant inference 任务
- 来源:
https://huggingface.co/blog/Dharma-AI/gpu-management(HF Dharma AI Blog 2026-07-30) - 可信度:中高(Hugging Face 官方博客,Dharma AI 团队)
与活文档关系:inference.md §2.10 系统栈(硬件/网络/存储)已收 GH200 NVL2 + SuperInfer;§2.2 调度已收 GoodServe E2E-SLO goodput;但 idle GPU = P&L 损失的生产经济学分析 + 调度优化三个维度未作为独立节点入位
建议归入:§2.10 系统栈(新增「HF Dharma AI Blog 2026-07-30:Idle GPU = P&L 损失经济学 · GPU 利用率可视化 + goodput scheduling(呼应 GoodServe)+ 抢占式调度(Spot/Preemptible for inference)+ Harvest 43.48% GPU 利用率实证数据锚点」小节)+ §2.2 调度(邻接,goodput 调度经济学层);新增 O183 试金石:"本机构 GPU 利用率中位数;idle GPU 成本 vs goodput scheduling 改造成本 ROI"
增量 4【推理引擎 §1 / 系统栈 §2.10】vLLM Conference 2026-08-24~26 @ Ray Summit:首届 vLLM 社区会议(★ 建议补)
来源: inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md 条目3(vLLM v0.26.0 部分)+ inbox/jay/2026-08-02T1400-jay-evening-briefing-llm-inference-hf-security-disaggregation-2026.md 条目3末尾
核心展开:
- vLLM v0.26.0(2026-07-27)关键更新:
- 新增 XPU 支持(Intel GPU),vLLM 从 CUDA 独占向多后端演进(XPU/CUDA/ROCm 三后端)
- CUDA 13.0 支持(兼容 13.0-13.1)
- Transformers 版本提升至 5.14.1
- 100+ releases 累积
- 第一届 vLLM Conference 2026-08-24~26(与 Ray Summit 同期举办):
- 标志 vLLM 从开源项目演化为独立技术生态
- 是 inference engine 基础设施化的里程碑事件
- NVIDIA 官方预编译模型列表 2026-08 更新:
- Qwen3-8B/14B/32B FP8 + NVFP4 量化版
- Gemma 4 全系列(31B/26B/E4B/E2B)
- Qwen3-VL Reranker 2B/8B + Embedding 2B
- Phi-4 multimodal + reasoning plus 系列
与活文档关系:inference.md §1 已收 vLLM 0.26.0 + vLLM AI Blog 生产工程规模;§1 框架格局已收 vLLM/SGLang/TGI/TensorRT-LLM/Ollama/LMDeploy/Colibri;但 vLLM Conference 2026-08-24 首届会议 + XPU 支持(Intel GPU)+ CUDA 13.0 未作为独立节点入位
建议归入:§1 vLLM(扩展现有 v0.26.0 小节,增加「XPU 支持 Intel GPU + CUDA 13.0 + Transformers 5.14.1 + 第一届 vLLM Conference 2026-08-24~26 @ Ray Summit = vLLM 基础设施化里程碑」);新增 O184 试金石:"vLLM Conference 2026 发布的重大功能更新(会后跟进);XPU 后端生产可用性(Intel GPU inference benchmark)"
2. 旁证(2 条)
旁证 1【KV Cache §2.3 / 调度 §2.2】LMCache MLSys 2026 Talk:30+ 公司生产部署,包括 Google Cloud / AWS / NVIDIA / IBM(★★★)
来源: inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md 条目8(LMCache MLSys) + inbox/jay/2026-08-02T1055-jay-engineering-filter.md 条目8(LMCache MLSys 2026)
两条来源综合:
- LMCache 项目:Yuhan Liu(UChicago,EuroSys Best Paper)主导,已在 30+ 公司生产部署
- 部署客户:Google Cloud、AWS、NVIDIA、IBM(具体哪些产品使用需核验)
- 与 vLLM PagedAttention 2.0 的关系:LMCache 是独立于 vLLM 内置 KV cache 的跨引擎 KV cache 中间层(vLLM/PagedAttention 是引擎内建,LMCache 是跨引擎抽象)
- 定位:适合多引擎共存环境(vLLM + SGLang + TensorRT-LLM 混部)的统一 KV cache 复用层
- 来源:
https://mlsys.org/virtual/2026/invited-talk/3646(MLSys 2026 invited talk)
建议归入:§2.3 KV cache(扩展 LMCache 节点,新增「MLSys 2026 Talk:30+ 公司生产部署(Google Cloud/AWS/NVIDIA/IBM)+ 跨引擎 KV cache 中间层定位 + 与 vLLM PagedAttention 2.0 的正交关系」);新增 O185 试金石:"LMCache vs vLLM 内置 PagedAttention 在混合引擎环境下的 KV cache 复用率对比;Google Cloud/NVIDIA 具体使用 LMCache 的产品名称"
旁证 2【推理引擎 §1】Modular MAX:第五推理引擎入局(Mojo graph-compiled kernels)★★
来源: inbox/jay/2026-08-02T1900-jay-evening-briefing-vecdb-mcp-agent-memory-2026.md 条目4 + inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md 条目4
核心展开:
- Modular MAX:使用 graph-compiled Mojo 内核,在高并发场景下对 dense models 性能超越 vLLM
- 与 vLLM/SGLang/TensorRT-LLM/TGI/LMDeploy 并列为 2026 年五大推理引擎之一(Jay 晚间 briefing 2026-08-02 原文)
- Benchmark 参考(effloow.com 2026-04 数据):
- vLLM v0.17.1(H100, Llama 8B)吞吐量 ~12,500 tok/s,GPU 利用率 85-92%
- SGLang H100 吞吐量 ~16,200 tok/s(+29%),利用率 90-94%
- TensorRT-LLM H100 ~18,000 tok/s,95%+ 利用率(NVIDIA 独占)
- TGI 进入维护模式(2025-12)
- Modular MAX 高并发 dense models 场景超越 vLLM(具体数字待精读)
- 可信度:中(独立基准博客,benchmark 配置需独立核验;Jay 工程筛选降级为参考级)
- 来源:
https://deploybase.ai/articles/best-llm-inference-engine(effloow.com 2026-04)
建议归入:§1 推理引擎(新增「Modular MAX:第五推理引擎 · graph-compiled Mojo 内核 · 高并发 dense models 场景超越 vLLM · 2026-04 benchmark · 与 vLLM/SGLang/TensorRT-LLM/TGI/LMDeploy 五大引擎并列」小节);新增 O186 试金石:"Modular MAX 高并发场景 benchmark 独立核验;Mojo 生态在推理场景的生产可用性"
3. 值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | vLLM Model Runner v2 --model-impl transformers benchmark:HF Blog 2026-07-08 称「比 hand-written 更快或持平」,但 benchmark gist 可复现性需核验;effloow.com(2026-04)vLLM H100 ~12,500 tok/s 与 HF Blog 数字是否可对标 |
jay 1400 briefing + effloow | 🟡 待核实 | 核验 HF benchmark gist 是否覆盖非 Qwen3 常用模型(Llama 3.1 8B/70B) |
| 2 | Modular MAX benchmark:Jay 工程筛选降级为「参考级」,benchmark 配置和测试环境细节不足;graph-compiled Mojo 在 long-context 场景的表现未验证 | jay 1900 briefing + effloow | 🟡 待核实 | Modular 官方 benchmark 数据;与 vLLM 官方 H100 numbers 交叉核验 |
| 3 | LMCache MLSys 2026 部署客户:Google Cloud/AWS/NVIDIA/IBM 具体在哪些产品中使用 LMCache?是否有公开 reference? | jay 0942 briefing | 🟡 待核实 | LMCache GitHub README 生产案例;MLSys talk 视频文字记录 |
| 4 | vLLM PD on AMD MI300X MORI-IO:AMD MI300X 拓扑与 NVIDIA NVLink 拓扑存在本质差异(GPU-CPU vs GPU-GPU),MORI-IO 的 KV cache 转移方案是否可迁移到 NVIDIA GH200/NVL72 | jay engineering-filter | 🟡 待核实 | vLLM Korea Meetup 完整幻灯片;MORI-IO 与 NVIDIA NVLink-C2C 架构对比 |
| 5 | Spheron 50K-500K tokens/请求:这是 Spheron 客户数据还是行业调查数据?样本量和行业分布如何? | jay engineering-filter | 🟡 待核实 | Spheron Blog 原文方法论部分 |
4. 本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2607.26627 | Lossy Verification in Speculative Decoding(已在 inference.md §3/§8.2;昨日 E1 已覆盖) | 基线继承 | §3/§8.2 |
| 2605.16867 | GoodServe E2E-SLO Goodput 调度(已在 inference.md §2.2;昨日 E1 已覆盖) | 基线继承 | §2.2 |
| 2602.14516v2 | AMPD Multi-round Disaggregated Serving(已在 inference.md §2.2;昨日 E1 已覆盖) | 基线继承 | §2.2 |
| 2604.15732v1 | LAAR Long-Context NUMA-Aware Routing(已在 inference.md §2.2;昨日 E1 已覆盖) | 基线继承 | §2.2 |
| 2602.00328v1 | Harvest P2P GPU Cache(已在 inference.md §2.3;昨日 E1 已覆盖) | 基线继承 | §2.3 |
| 2603.04428v1 | Agent Memory Edge Q4 KV Cache(已在 inference.md §2.3;昨日 E1 已覆盖) | 基线继承 | §2.3 |
| 2606.20295v1 | Token-Operations 四层架构(已在 inference.md §2.5;昨日 E1 已覆盖) | 基线继承 | §2.5 |
| 2607.28568 | Frontis-MA1:面向 ML 工程中递归自我改进的 AI4AI 模型训练(HF Daily 2026-08-02 votes=162;与 inference 邻接,RSI 框架用于 inference 系统自优化;主分类 agent,非 pure inference-systems;但与 inference §2.11 自优化系统方向邻接) | 横向邻接 | §2.11(邻接参考) |
| 2607.27919 | Memory Decoder at Scale:预训练的参数化长期记忆(HF Daily 2026-08-02 votes=48;长期记忆参数化解码,与 inference §2.3 KV cache 邻接;主分类 memory/agent,非 pure inference-systems) | 横向邻接 | §2.3(邻接参考) |
5. 已检查来源清单
以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay/2026-08-02T1400-jay-evening-briefing-llm-inference-hf-security-disaggregation-2026.md→ 主要来源:① vLLM Transformers 原生后端(增量1)+ ② idle GPU Dharma AI(增量3)+ ③ PD disaggregation AMD MI300X(增量1)+ ④ vLLM vs SGLang vs LMDeploy benchmark(H100 + 框架选型表,已在 8-1 E1 基线覆盖);⑤ AI Engineer 1000 JD 分析(engineering 主题);⑥ HF 安全事件(security 主题);无 pure inference-systems 新增inbox/jay/2026-08-02T1105-jay-five-category-briefing.md→ Filtered ANNS(database 主题);VoltAgent awesome-ai-agent-papers(agent 论文库);HF 安全事件(security);CNCF 云原生;无 pure inference 新增inbox/jay/2026-08-02T0942-jay-github-trending-huggingface-inference-agents-202608.md→ 主要来源:vLLM v0.26.0 XPU(增量4)+ LMCache MLSys(旁证1)+ Modular MAX(旁证2)+ Agent Memory/GitHub Stars 生态(graphify 81k/mem0 60k/headroom 58k——agent 主题);无 pure inference-systems 新增inbox/jay/2026-08-02T1055-jay-engineering-filter.md→ 主要来源:Spheron Context Engineering(增量2)+ vLLM Korea AMD MI300X(增量1)+ SitePoint vLLM Production(工程参考)+ effloow H100 benchmark(旁证2)+ LMCache MLSys(旁证1)+ Lilian Weng Harness(已在 8-1 E1 基线覆盖)+ MCP 2.0 Simon Willison(已在 8-1 E1 基线覆盖);无 pure inference-systems 新增inbox/jay/2026-08-02T1900-jay-evening-briefing-vecdb-mcp-agent-memory-2026.md→ PingCAP Vector DB 选型(database 主题);Mem0 2026 state(agent-memory 主题);RAG 500K 临界点(rag 主题);Langfuse→ClickHouse(backend 主题);Modular MAX(旁证2);Alice Labs Agent Framework 排名(agent 主题);Brain Bytes 2026 Stack(agent 主题);Pulumi CLI vs MCP(agent 主题);无 pure inference-systems 新增inbox/jay/2026-08-02-csdn-llm-agent-rag-mlops.md→ CSDN 批量筛选(rag/agent/mlops 主题)inbox/jay/2026-08-02T1450-jay-engineering-filter-p2.md→ 工程筛选 P2(未见新 inference 内容)inbox/jay/2026-08-02T1950-jay-engineering-filter-p3.md→ 工程筛选 P3(未见新 inference 内容)inbox/tom/2026-08-02-0900-hf-daily-2026-08-02.md→ 15件 HF Daily(Memory Decoder at Scale + Frontis-MA1 + Σ-Mem + Filesystem Memory 等;已在 arXiv 列表中;无 pure inference-systems 卡片建卡)inbox/tom/2026-08-02-1004-rss-yt-yannic-kilcher.md→ YouTube RSS(无 inference 新增)inbox/tom/2026-08-02-1005-rss-yt-lex-fridman.md→ YouTube RSS(无 inference 新增)inbox/tom/2026-08-02-agent-rag-longcontext-radar.md→ Agent/RAG/Long-Context 主题inbox/tom/2026-08-02-evaluation-e1prep.md→ evaluation 主题inbox/tom/2026-08-02-rag-e1prep.md→ RAG 主题inbox/spark/2026-08-02-llm-infra-e1prep.md→ llm-infra 主题专属(与 inference 有交叉但主要增量为 llm-infra 侧)inbox/spark/2026-08-02-agent-e1prep.md→ Agent 主题inbox/spark/2026-08-02-1001-rss-gradient-flow.md→ RSS(无 inference 新增)inbox/spark/2026-08-02-1003-rss-chip-huyen.md→ RSS(无 inference 新增)inbox/spark/2026-08-02-1005-rss-yt-3blue1brown.md→ RSS(无 inference 新增)inbox/flyp/2026-08-02-1000-rss-cameron-wolfe.md→ RSS(无 inference 新增)inbox/flyp/2026-08-02-1002-rss-interconnects.md→ RSS(无 inference 新增)inbox/flyp/2026-08-02-1004-rss-yt-two-minute-papers.md→ RSS(无 inference 新增)inbox/flyp/2026-08-02-1005-rss-yt-ai-explained.md→ RSS(无 inference 新增)inbox/flyp/2026-08-02-RecMem-recurrence-memory-consolidation-critical-read.md→ memory consolidation 主题(RecMem)inbox/flyp/2026-08-02-multimodal-e1prep.md→ multimodal 主题inbox/flyp/2026-08-02-risk-e1prep.md→ risk 主题inbox/stephen/2026-08-02-0910-news-x-vip-radar.md→ X VIP radar(OpenAI/DeepMind/Anthropic news)inbox/stephen/2026-08-02-ai-industry-e1prep.md→ AI industry 主题inbox/stephen/2026-08-02-llm-application-e1prep.md→ llm-application 主题- paper_cards/682-688 共 7 张新卡 → 主分类 inference-systems 0 张(682/683/686 agent;684 evaluation;685/688 multimodal;687 agent);主分类 llm-infra 0 张;连续第 3 个零新增日
6. 本次 E1 预消化结论
增量条数:4 主线 + 2 旁证
结论:inference 主题 8-1 22:00 → 8-2 22:00 约 24h 窗口为中低密度,主因是 paper_cards 主分类 inference-systems 连续第 3 个零新增日(7-31、8-1、8-2 连续三日无新卡),但工程层提供了 4 条有实质数字支撑的增量。本场最重要的信号是 vLLM Model Runner v2 + PD Disaggregation on AMD MI300X + MORI-IO——vLLM 正在从单一 NVIDIA 生态向多后端(XPU/CUDA/ROCm)+ 多厂商(NVIDIA/AMD)扩展,Model Runner v2 GPU-native Triton kernels 是 engine 架构层面的重要里程碑。Spheron Context Engineering Guide 给出了 2026 年生产 Agent 的真实 token 规模(50K-500K tokens/请求),为 KV cache 和 prefix caching 的工程价值提供了量化锚点。HF Dharma AI Blog 提供了 idle GPU 的生产经济学框架,与 GoodServe E2E-SLO goodput 调度形成经济学生态闭环。本场无顶级学术 inference-systems 论文批量涌入,信号密度低于均值,建议今晚活文档接力以 small additions 为主,不做大幅章节重构。
建议今晚活文档接力动作:
1. vLLM Model Runner v2 入 §1(GPU-native Triton kernels + --model-impl transformers 持平/超越 + zero-bubble async scheduling)
2. vLLM PD Disaggregation AMD MI300X + MORI-IO 入 §2.2(与 AMPD/Dynamo 互补,AMD 首个 PD 分离生产配置)
3. Spheron Context Engineering Guide 入 §2.5(50K-500K tokens/请求实测 + vLLM APC 16-token block 粒度 + Prefix vs KV Cache 决策树)
4. HF Dharma AI Blog idle GPU = P&L 损失 入 §2.10(GPU 利用率经济学 + goodput scheduling + 抢占式调度)
5. vLLM Conference 2026-08-24~26 + v0.26.0 XPU/CUDA 13.0 入 §1(vLLM 基础设施化里程碑)
6. LMCache MLSys 2026 30+ 部署 入 §2.3(扩展现有 LMCache 节点)
7. Modular MAX 第五引擎 入 §1(高并发 dense models 超越 vLLM,需独立核验)
8. O181-O186 试金石 写入候选池