Jay · 工程筛选报告 · 2026-07-02 上午档
筛选时间:2026-07-02 10:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日全部候选条目 · 重点判断是否含真实环境、命令、错误、源码、性能数据、可复现步骤
一、今日候选条目总览
| # | 条目 | 来源 | 初始价值 | 工程满足度 |
|---|---|---|---|---|
| 1 | Spheron vLLM vs SGLang H100 Benchmark 2026 | Web (spheron.network) | 🔴 高 | ✅ 满足 |
| 2 | SGLang GitHub Issue #4245:vLLM TTFT 快 10 倍 | GitHub Issue | 🔴 高 | ✅ 满足 |
| 3 | SGLang GitHub Issue #21061:高并发扩展性实测 | GitHub Issue | 🔴 高 | ✅ 满足 |
| 4 | VS Code Copilot Agent Harness 架构(2026-05) | Blog (code.visualstudio.com) | 🔴 高 | ✅ 满足 |
| 5 | awesome-harness-engineering GitHub 库 | GitHub | 🟡 中 | 🟡 部分满足 |
| 6 | Faros.ai Harness Engineering 五层框架(2026) | Blog | 🟡 中 | 🟡 部分满足 |
| 7 | Turion.ai vLLM vs SGLang 2026 对比 | Web | 🟡 中 | 🟡 部分满足 |
| 8 | SGLang vs vLLM Particula.tech 实测 | Web | 🟡 中 | 🟡 部分满足 |
| 9 | Cool Papers cs.CL 5 条(RSS) | RSS | 🟢 低 | 🟢 不满足 |
| 10 | arXiv 2502.07115 KV Cache 在线调度(理论) | arXiv | 🟡 中 | 🟡 部分满足 |
| 11 | arXiv 2504.11320 WAIT 调度策略 | arXiv | 🟡 中 | 🟡 部分满足 |
二、🔴 保留条目(高工程价值)
条目 1 ✅ 保留:Spheron vLLM vs SGLang 2026 Benchmark
保留理由:
- ✅ 具体版本号锚定:vllm/vllm-openai:v0.18.0、lmsysorg/sglang:v0.5.9-cu130-runtime
- ✅ 具体硬件规格:H100 SXM5 80GB、Host driver 590.48.01、CUDA 13.0 containers、裸金属无虚拟化
- ✅ 具体 benchmark 数据:
Llama 3.3 70B FP8 H100 唯一提示词吞吐(无前缀共享):
| Concurrency | vLLM tok/s | SGLang tok/s | Delta |
|---|---|---|---|
| 1 | 120 | 125 | +4% |
| 10 | 650 | 680 | +5% |
| 50 | 1,850 | 1,920 | +4% |
| 100 | 2,400 | 2,460 | +2% |
TTFT p50/p95(前缀繁重负载,80% 共享 512 token 系统提示词):
| Metric | vLLM | SGLang |
|---|---|---|
| TTFT p50 | 380ms (50 conc) | 360ms (50 conc) |
| TTFT p95 | 740ms (100 conc) | 710ms (100 conc) |
成本数据(H100 SXM5 on-demand):$4.06/hr → $0.61/1M tokens(vLLM)、$0.44/1M tokens(SGLang) H200 SXM5:$5.92/hr → $0.51/1M tokens(SGLang)
- ✅ 选型决策矩阵:RadixAttention(token 级)vs PagedAttention(block 级)具体差异解释、前缀缓存行为区别
- ✅ 具体适用场景推荐:RAG/多轮对话 → SGLang;批处理/多硬件 → vLLM
质量判断:⭐⭐⭐⭐⭐ 本批最高工程价值条目,唯一同时含具体版本号、硬件规格、吞吐数据、延迟数据、成本数据的 benchmark 对比文章。
条目 2 ✅ 保留:SGLang GitHub Issue #4245 — vLLM TTFT 快 10 倍
保留理由:
- ✅ 真实 bug 报告:用户报告相同条件下 vLLM TTFT 比 SGLang 快近 10 倍
- ✅ 具体复现环境:Qwen/Qwen2.5-0.5B 模型、具体 vLLM 和 SGLang 启动命令
- ✅ 具体报错信息:TORCH_CUDA_ARCH_LIST is not set 警告、Pytorch C++ extension 信息
- ✅ GPU 硬件:涉及 PCIe NUMA 拓扑(SYS/PHB/NVB 等)
- ✅ 社区参与:Issue 开放讨论,官方回复参与
质量判断:⭐⭐⭐⭐ 真实的推理引擎 bug/性能问题报告,含具体命令和环境信息,是 SGLang/vLLM 选型调优的重要工程参考。
条目 3 ✅ 保留:SGLang GitHub Issue #21061 — 高并发扩展性实测
保留理由:
- ✅ 具体 benchmark 实测:150 并发、g2-standard-32(1× NVIDIA L4,32 vCPU)
- ✅ 量化数据:
- vLLM:363.76 req/s、0.4140s 延迟、251.12% CPU 利用率
- SGLang:150.00 req/s、1.0134s 延迟、127.09% CPU 利用率
- ✅ 工程洞察:SGLang Python GIL 争用 vs vLLM C++ CUDA 扩展的多线程扩展行为差异
- ✅ 具体测试命令:/v1/completions 端点、共享 payload pool 查询
- ✅ 结论:vLLM 在高并发 Python GIL 争用场景下吞吐量是 SGLang 的 2.4 倍
质量判断:⭐⭐⭐⭐⭐ 高并发生产场景下的真实 benchmark 数据,揭示了 SGLang 在 Python GIL 下的扩展瓶颈,含具体数字和硬件配置。
条目 4 ✅ 保留:VS Code Copilot Agent Harness 架构(2026-05)
保留理由: - ✅ 官方来源:VS Code 团队直接发布,非第三方分析 - ✅ 具体架构细节:三条核心循环职责(context assembly、tool exposure、tool execution) - ✅ 多提供商路由:Anthropic/Google/OpenAI/xAI/Mistral 混合路由机制 - ✅ 具体评测套件:VSC-Bench eval suite with PR-gated assessment - ✅ eager-construction scaffolding:预构建所有组件消除首调用延迟和竞态条件 - ✅ compound multi-model architecture:不同模型实例分别处理 execution/reasoning/critique/vision 任务
质量判断:⭐⭐⭐⭐⭐ GitHub Copilot 官方工程揭秘,含 Coding Agent harness 的核心设计原则,是 awesome-harness-engineering 的标杆案例。
三、🟡 降级保留条目(中等工程价值)
条目 5 🟡 降级保留:awesome-harness-engineering GitHub
降级理由: - ✅ 系统性资源聚合:工具、模式、模板、论文综合 - ✅ 明确收录标准:只收录解决具体 harness 工程问题的资源(context、tools、planning、memory、verification、sandboxing) - ✅ 明确过滤标准:不含通用 AI/ML 论文、模型 benchmark、产品营销 - ✅ 标杆内容:VoltAgent/awesome-ai-agent-papers(含 363+ 篇 2026 年 arXiv 论文)、GitHub Copilot harness 论文 - ⚠️ 资源聚合库,非原创工程内容 - ⚠️ 收录内容质量参差,需二次筛选
最终决定:参考性归档,适合作为 Harness Engineering 主题页的资源索引入口。
条目 6 🟡 降级保留:Faros.ai Harness Engineering 五层框架
降级理由: - ✅ 五层框架具体:tool orchestration、verification loops、context and memory、guardrails、observability - ✅ 具体可测量指标:cost per merged PR、time-to-merge for agent-assisted PRs、review velocity relative to PR size、compute spend per developer - ✅ 2026 年最新实践:当前工程投资重点 - ⚠️ 框架性内容,无具体命令或源码 - ⚠️ 与条目 4(Copilot harness)同属 harness 工程大类,但深度不足
最终决定:参考性归档,适合作为 Agent 评估主题页的 2026 年行业实践背景。
条目 7 🟡 降级保留:Turion.ai vLLM vs SGLang
降级理由: - ✅ 具体数据:Llama 70B 冷启动 60s(H100),TensorRT-LLM 需 25-40 分钟编译 - ✅ 决策框架:DeepSeek → SGLang;批处理/多硬件 → vLLM - ⚠️ 核心 benchmark 数据与 spheron.network 重复,无新增独特数据点 - ⚠️ 本轮已有 spheron.network 条目(版本号更全),本条目降级
最终决定:参考性归档,以 spheron.network 为主要 benchmark 来源,本条目作为辅助交叉验证。
条目 8 🟡 降级保留:Particula.tech SGLang vs vLLM
降级理由: - ✅ 具体数据:TTFT 79ms vs 103ms(SGLang 快 23%)、ITL 6ms vs 7.1ms(SGLang 快 15%)、输出吞吐量 894 vs 413 tok/s(SGLang +117%) - ✅ 有 6.4x prefix-heavy workload 数据 - ⚠️ 核心数据与 spheron.network 高度重复 - ⚠️ 无独特版本号或硬件配置
最终决定:参考性归档,作为 spheron.network 的交叉验证数据点。
条目 10 🟡 降级参考:arXiv 2502.07115 KV Cache 在线调度
降级理由: - ✅ 理论完整:hindsight optimal benchmark、整数规划、竞争比分析 - ✅ 具体结论:无确定性在线算法能在任意到达过程下达到常数竞争比 - ✅ WAIT 类算法可在特定条件下达到常数竞争比 - ⚠️ 纯理论工作,无具体系统参数或生产 benchmark 数字 - ⚠️ 与 2026-06 早档的 arXiv 2605.01280(LLM Serving 数学优化)同属一类
最终决定:参考性归档,适合作为推理调度理论背景,非生产工程直接参考。
四、🟢 丢弃条目
| # | 条目 | 丢弃理由 |
|---|---|---|
| 9 | Cool Papers cs.CL (5条) | 纯 NLP 研究(introspective coupling/metacognitive feedback/table referencing),无工程落地细节;与本知识库 LLM/RAG/Agent 聚焦方向关联度低 |
| 11 | arXiv 2504.11320 WAIT 调度策略 | 理论算法分析,有 Vidur 模拟但缺真实 GPU benchmark 具体数字;与条目 10 同属一类,深度不足 |
五、工程筛选元数据
本轮过滤结果
- 筛选时间:2026-07-02 10:50 (UTC+8)
- 候选总数:11 条
- 🔴 保留:4 条(高工程价值)
- 🟡 降级保留:5 条(参考性)
- 🟢 丢弃:2 条
- 过滤率:18.2%
分类标签
vLLM SGLang H100 H200 Benchmark TTFT ITL PagedAttention RadixAttention Prefix-Caching Concurrency Python-GIL CUDA Inference-Engine GitHub-Issue Production Cost-Per-Token Harness-Engineering Agent-Harness Scaffolding Tool-Orchestration Verification-Loops Guardrails Observability VSCode GitHub-Copilot Awesome-List
六、🔴 本轮最高工程价值条目 TOP3
TOP1:Spheron vLLM vs SGLang H100 Benchmark 2026
- 工程价值:⭐⭐⭐⭐⭐
- 判断依据:唯一同时含具体版本号(v0.18.0/v0.5.9)、硬件规格(H100 SXM5/CUDA 13.0)、吞吐数据、TTFT/p95 延迟数据、美元成本的完整 benchmark
- 可直接复用:推理引擎选型决策表、生产成本估算
TOP2:SGLang GitHub #21061 高并发扩展性实测
- 工程价值:⭐⭐⭐⭐⭐
- 判断依据:150 并发实测数据揭示 Python GIL 瓶颈,363 vs 150 req/s 具体数字
- 可直接复用:高并发 Agent 场景引擎选型避坑
TOP3:VS Code Copilot Agent Harness 架构(官方)
- 工程价值:⭐⭐⭐⭐⭐
- 判断依据:VS Code 官方发布的 Copilot harness 三层循环架构 + 多提供商路由 + VSC-Bench eval suite
- 可直接复用:Harness Engineering 主题页标杆案例
七、建议写入路径
- 本次写入:
/shared/research-kb/inbox/jay/2026-07-02-1050-engineering-filter-jul2026-inference-harness.md
八、精读/审稿/主题页更新建议
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 精读 | Spheron benchmark 全文(含 TTFT p95 详细表) | 条目 1 |
| 🔴 精读 | VS Code Copilot harness 官方博客(含 VSC-Bench 详情) | 条目 4 |
| 🔴 核实 | SGLang #21061 issue 是否已解决(Python GIL 修复计划) | 条目 3 |
| 🟡 归档 | awesome-harness-engineering 资源列表 | 条目 5 |
| 🟡 参考 | Turion.ai / Particula.tech benchmark 数据交叉验证 | 条目 7/8 |
主题页更新建议:
- 推理引擎主题页:新增条目 1(Spheron 2026 benchmark,含版本号和成本数据)+ 条目 3(SGLang 高并发 GIL 瓶颈)
- Harness-Engineering 主题页:新增条目 4(VS Code Copilot 官方架构)+ 条目 5(awesome-harness 工程资源索引)
Jay · 工程筛选报告 · 2026-07-02 10:50 (Asia/Shanghai) 本轮候选:11 条 · 保留:4 条 · 过滤率:18.2%