工程文章二次筛选报告 · Jay · 2026-07-14 晚间版

主题: 晚间工程精选 · arXiv 推理系统新论文 · vLLM/SGLang 排障 + 2026 H100 横向评测 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 覆盖范围: arXiv (LLM serving/inference) + GitHub Issues + Substack benchmarks + 生产排障


一、arXiv 推理系统工程新论文(2026 年 6-7 月)

1. Beyond Prediction: Tail-Aware Scheduling for LLM Inference

  • arXiv: 2606.18431
  • 核心数据: P99 TTLT 比 SRPT (perfect length prediction) 低 35-50%;TTFT 低 34-47%(含 reasoning-heavy 和 chat-heavy 任务)
  • 关键观点: 依赖长度预测的调度策略(SRPT/SJF)在分布偏移、突发流量和显存压力下表现脆弱,无法有效控制 P90-P99 尾延迟
  • 工程价值:保留。生产 LLM serving 尾延迟控制是 2026 年工程痛点,论文有真实生产 trace 验证
  • 标签: inference-engineering / scheduling / tail-latency

2. Self-Speculative Forking to Accelerate Agentic LLM Inference

  • arXiv: 2607.03333
  • 核心价值: 现代 serving 系统(vLLM/SGLang)缓存 prefix KV states,在此基础上做 fork 分叉加速;专门针对 agentic 多分支推理场景
  • 工程价值:保留。直接针对 vLLM/SGLang 的 KV cache prefix 机制优化,与 agent 工作流高度相关
  • 标签: inference-engineering / agent / speculative-decoding

3. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

  • arXiv: 2606.21238
  • 核心数据: KV cache hit rate 提升 10.8%,TTFT 降低 12.6%(合成 QA 工作负载);真实对话场景 2.1% 和 2.0%
  • 关键观点: naive vLLM 的 KV cache 策略没有利用 recency/frequency 信息,自适应策略效果显著
  • 工程价值:保留。有明确量化数据,直接对比 vLLM baseline,工程可复现性强
  • 标签: inference-engineering / kv-cache / vllm-optimization

4. Understanding and Recovering LLM Serving Performance cliffs

  • arXiv: 2606.23969v2
  • 核心价值: 分析 vLLM/SGLang/DistServe 在调度、batching、KV 管理和 disaggregation 上的性能悬崖(performance cliffs)
  • 工程价值:保留。覆盖当前主流三大开源 serving 系统的对比分析,工程决策参考价值高
  • 标签: inference-engineering / benchmarking / vllm-sglang-distserve

5. OmniPilot: Uncertainty-Aware LLM Inference Advisor for Heterogeneous GPU Clusters

  • arXiv: 2607.01579
  • 核心数据: 跨 A100/H100/H200 四种精度 460 次 benchmark;MAPE 6.2%,R²=0.92;top-1 准确率 95%,utility regret 仅 0.003
  • 关键观点: 在异构 GPU 集群上选择 GPU 类型/TP 度量/精度时提供 uncertainty-aware 建议,并主动拒绝(abstention)超出测量支持范围的请求
  • 工程价值:保留。MAPE 6.2% 在实际生产中可用,abstention 机制设计值得借鉴
  • 标签: inference-engineering / gpu-scheduling / heterogeneous-clusters

6. KernelSight-LM: A Kernel-Level LLM Inference Simulator

  • arXiv: 2606.28565v2
  • 核心数据: cross-generation tier 预测误差 12.1%(roofline baseline 为 22%);target-measured tier 误差 3.8%(vs baseline 27.7%)
  • 关键观点: 将每次 serving step 分解为 roofline kernel model + 通信模型 + host-overhead 模型,支持 prefix caching 和 continuous batching 模拟
  • 工程价值:保留。与 vLLM profiled ground truth 验证,可替代部分真实 profiling 工作
  • 标签: inference-engineering / profiling / kernel-simulation

7. Akashic: Low-Overhead LLM Inference Service with MemAttention

  • arXiv: 2607.05708
  • 核心数据: task accuracy 提升 10.2 points,throughput 1.21×,sustainable request rate 1.88×(四 workload × 三 model sizes)
  • 关键观点: 多轮 agent 交互中 context 快速增长导致 prefill 成本高且易超出 limit;MemAttention 将 context 组织为 bounded chunks 保留跨 chunk 证据
  • 工程价值:保留。直接解决 agent 多轮 context 膨胀问题,量化数据充分
  • 标签: inference-engineering / agent / multi-turn-context

8. Think Before You Grid-Search: Floor-First Triage for LLM Serving

  • arXiv: 2607.05876v2
  • 核心案例: DeepSeek-V3.2-style 671B MoE/MLA 在 16× H20 GPU 上的分析;KV-capacity-limited 到 ~70 concurrent requests;EP16+DP-attention 布局可达 ~644 requests
  • 关键观点: 先建分析 floor,再 reconcile benchmark,最后才 escalation to profiling;避免在异构硬件上无脑 grid-search
  • 工程价值:保留。671B MoE/MLA + H20 组合是国内生产常见配置,具体数字可直接参考
  • 标签: inference-engineering / benchmarking / moe-inference

9. SpecGen: Accelerating Agentic Kernel Optimization with Speculative Generation

  • arXiv: 2606.17518
  • 核心数据: resource utilization 从 4.2-17.6% 提升到 88.2-96.1%,kernel 性能提升 1.24-1.91×
  • 关键观点: agentic kernel optimization 将 kernel 优化作为 feedback-guided iterative search;speculative generation 在 LLM reasoning 期间提前生成候选 kernel
  • 工程价值:保留。CUDA kernel 自动优化是 2026 年前沿方向,与 Fable/AI-generated kernels 趋势呼应
  • 标签: inference-engineering / kernel / auto-optimization

10. LLM-Guided Compiler for Direct CUDA Inference

  • arXiv: 2606.07665v1
  • 核心价值: 将 LLM-guided inference 优化转化为语义搜索问题, formulation 为 compiler-defined candidate search
  • 工程价值: ⚠️ 降级。偏学术 formulation 工程落地路径不明确,先标记跟踪
  • 标签: inference-engineering / kernel / compilation

二、GitHub Issues 生产排障数据(工程真实性高)

1. SGLang CUDA OOM: Gemma3 12B vs vLLM(Issue #12496)

  • URL: https://github.com/sgl-project/sglang/issues/12496
  • 场景: 2×4090 workstation,同模型 Gemma3 12B instruct,vLLM 可启动,SGLang CUDA OOM
  • 根因: SGLang 的 --mem-fraction-static 与 vLLM 的 --gpu_memory_utilization 0.8 行为差异显著;KV cache 分配策略和 max context length 处理不同
  • 日志片段: WARNING server_args.py:972: Disable hybrid SWA memory for Gemma3ForConditionalGeneration For Gemma 3, we downcast float32 to bfloat16 instead of float16 by default.
  • 工程价值:保留。生产常见 vLLM vs SGLang 选型对比,故障现场真实
  • 标签: troubleshooting / sglang / vllm / cuda-oom

2. SGLang offline inference CUDA OOM(Issue #4248)

  • URL: https://github.com/sgl-project/sglang/issues/4248
  • 场景: 4× A100 80G,Qwen2.5-7B-Instruct,offline inference 启动即 OOM
  • 工程价值:保留。A100 多卡场景具有代表性
  • 标签: troubleshooting / sglang / a100 / qwen

3. vLLM Troubleshooting Official Docs

  • URL: https://docs.vllm.ai/en/latest/usage/troubleshooting
  • 核心内容:
  • --load-format dummy 跳过模型权重加载,隔离下载/加载问题
  • OOM 时 not enough GPU memory 错误溯源流程
  • 工程价值:保留。vLLM 官方排障文档,生产直接可用
  • 标签: troubleshooting / vllm / official-docs

4. vLLM OOM Root Cause Diagnosis Guide(Parallel60)

  • URL: https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis
  • 三种 OOM 模式: 1. 长上下文 OOM:发生在 32K/128K 请求,KV cache 单体超过模型权重显存 2. 启动 OOM:发生在首 batch 或模型加载时,不受请求长度影响 3. 加载 OOM:与请求长度/batch size 完全无关
  • 工程价值:保留。诊断分类可直接映射生产 debug 流程
  • 标签: troubleshooting / vllm / oom-patterns

三、vLLM vs SGLang 横向 Benchmark(2026 H100 实测)

1. TECHSY: vLLM vs SGLang 2026 H100 Benchmarks

  • URL: https://techsy.io/en/blog/vllm-vs-sglang
  • 关键数据(Llama 3.1 8B, H100):
  • vLLM throughput: ~12,500 tok/s
  • SGLang throughput: ~16,200 tok/s
  • 选型建议:
  • 选 vLLM:硬件支持最广、社区最大、生产路径最成熟(AWS/GCP/Azure)
  • 选 SGLang:多轮对话、结构化输出、prefix-heavy 负载(RAG);400,000+ GPU 在生产运行
  • 工程价值:保留。2026 年选型直接参考,TGI 已进入 maintenance mode 背景
  • 标签: inference-engineering / benchmarking / vllm-sglang-h100

2. The AI Engineer: vLLM vs Ollama vs SGLang vs TensorRT-LLM

  • URL: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 核心观点:
  • Ollama:5 分钟内本地运行,无需纠结
  • vLLM:生产默认选择,PagedAttention 防显存浪费
  • TensorRT-LLM:最高性能但需要 1-2 周调优时间,绑定 NVIDIA
  • 工程价值:保留。行业技术选型概述,Substack 合规引用
  • 标签: inference-engineering / framework-selection / comparison

3. SGLang GitHub Issue #21061: SGLang vs vLLM 高并发扩展性对比

  • URL: https://github.com/sgl-project/sglang/issues/21061
  • 内容: 2026 年 3 月提交的 benchmark 对比 issue,专项测试 RadixAttention vs PagedAttention 高并发表现
  • 工程价值:保留。GitHub 官方 issue,生产参考性强
  • 标签: inference-engineering / benchmarking / sglang-vllm-concurrency

4. DGX Spark + Qwen3-Next-80B 实测

  • URL: https://forums.developer.nvidia.com/t/dgx-spark-qwen3-next-80b-proven-performance-but-missing-clear-path-to-nim-tensorrt-llm-web-uis/357820
  • 数据: Qwen3-Next-80B-A3B-Thinking FP8 @ DGX Spark 单机,~45 tokens/sec sustained(ShareGPT_V3_unfiltered 负载)
  • 问题: 官方 compatibility table 停止在 Qwen3-32B,80B 型号缺失官方支持路径
  • 工程价值: ⚠️ 降级。具体数字参考价值高,但 DGX Spark 非通用硬件
  • 标签: inference-engineering / benchmark / qwen3-next-dgx-spark

四、晚间精读优先级排序

优先级 条目 核心价值 预计时间
P0 Beyond Prediction: Tail-Aware Scheduling (2606.18431) 尾延迟优化,35-50% P99 改善 45min
P0 Recency/Frequency Adaptive KV Caching (2606.21238) vLLM baseline 明确对比,10.8% hit rate 提升 30min
P0 SGLang CUDA OOM Issue #12496 vLLM vs SGLang 真实故障对比 20min
P1 vLLM OOM Root Cause Diagnosis Guide 三种 OOM 模式分类,生产直接用 20min
P1 Floor-First Triage (2607.05876) 671B MoE + H20 国内生产参考 45min
P1 Akashic MemAttention (2607.05708) 多轮 agent context 膨胀解决方案 40min
P2 OmniPilot (2607.01579) 异构 GPU 集群 cost advisor,6.2% MAPE 30min
P2 KernelSight-LM (2606.28565) kernel 仿真工具,可替代部分 profiling 40min
P2 SpecGen (2606.17518) kernel auto-optimization agentic 方法 45min

五、本日草稿去重与合并建议

现有草稿汇总: - 2026-07-14-1050-engineering-filter...rag-harness-arxiv.md → 早间版,含 RAG + harness + arXiv - 2026-07-14-1105-morning-briefing...mamba3-inference.md → 早间工程简报 - 2026-07-14-1220-csdn-vllm-sglang...engineering.md → CSDN 专项 - 2026-07-14-1335-inference-rag-vecdb...trending.md → RAG + VecDB + GitHub trending - 2026-07-14-1450-engineering-filter-round2...md → 下午二次筛选轮次 2 - 2026-07-14-afternoon-inference-backend...trending.md → 下午综合 trending

晚间新增归档建议: - 本文件作为晚间精选,可直接合并入明日 engineering-filter 主报告 - 建议按主题拆分为: - inference-engineering/scheduling/ → Tail-Aware Scheduling - inference-engineering/kv-cache/ → Recency/Frequency Adaptive KV - inference-engineering/troubleshooting/ → OOM 排障专题 - inference-engineering/benchmarking/ → vLLM vs SGLang H100 对比


建议写入路径: /shared/research-kb/inbox/jay/2026-07-14-1950-evening-engineering-filter-arxiv-jul2026.md 是否需要精读: P0 条目建议本周内完成精读并产出笔记 后续行动: arXiv 新论文建议同步更新对应主题页(kv-cache、scheduling、benchmark)