Jay 工程文章筛选 · 第三轮 · 2026-09-30 晚间

执行时间: 2026-09-30 19:50 (Asia/Shanghai) 筛选原则: 保留含真实环境/命令/错误/源码/性能数据/可复现步骤的条目;去重已覆盖内容。


✅ 本轮保留条目


1. Google Developers: Harness Engineering Anatomy(Sep 9, 2026)

属性 内容
标题 The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents
来源 Google Developers Blog · developers.googleblog.com
作者 Taylor Mullen(Principal Engineer)+ Christian Gunderman(Staff Software Engineer)
发布日期 2026-09-09
可信度 ⭐⭐⭐⭐⭐ 官方工程博客,Google 一线工程师
核心工程价值 揭示 end-to-end benchmark 的陷阱:composite score 移动几个百分点但团队不知道为什么;提出 harness 拆解方法论;benchmark 微小变化溯源技术
真实数据 未披露具体数字,但有明确方法论框架(benchmark 拆解 → 变量控制 → 定位机制)
与今日已覆盖内容关系 独立于 awesome-harness-engineering;更偏向 Google 内部工程实践
标签 agent-harness benchmark-methodology Google evaluation production
建议行动 精读;提炼 harness 调试方法论入知识库;与 Agent Eval 主题页交叉
Substack 备注 非 Substack;Google Developers Blog 属工程博客

2. Spheron: FlashInfer Deployment Guide(含 benchmark 命令序列)

属性 内容
标题 Deploy FlashInfer on GPU Cloud: LLM Inference Kernels for vLLM and SGLang (2026 Guide)
来源 Spheron Blog · spheron.network/blog/deploy-flashinfer-gpu-cloud-llm-inference-kernels
发布日期 2026-09(最新)
可信度 ⭐⭐⭐⭐
核心工程价值 含完整 4 步 benchmark 命令序列,可复现:
真实命令 bash\n# Step 1: torch_sdpa baseline\ndocker run --gpus all --ipc=host -p 8000:8000 \\\n vllm/vllm-openai:latest \\\n --model meta-llama/Llama-3.1-70B-Instruct \\\n --dtype bfloat16 \\\n --attention-backend torch_sdpa \\\n --gpu-memory-utilization 0.92 \\\n --max-model-len 16384\n\n# Step 2: benchmark\npython -m vllm.benchmarks.benchmark_serving \\\n --model meta-llama/Llama-3.1-70B-Instruct \\\n --dataset-name random \\\n --random-input-len 2048 \\\n --random-output-len 512 \\\n --num-prompts 200 --concurrency 32 \\\n --host localhost --port 8000\n\n# Step 3: switch to FlashInfer backend\n --attention-backend flashinfer\n\n# Step 4: re-run benchmark\n
关键结论 FlashInfer 适合需要频繁换模型的团队(无 60-120 分钟 engine recompile);TRT-LLM 适合锁定模型追求极致吞吐
标签 vLLM FlashInfer attention-backend benchmark commands production
建议行动 入 inference 工程主题页;提取 --attention-backend 参数对比数据
与今日已覆盖内容关系 新增;未在已有 13 条中覆盖

3. Winder.ai: vLLM vs Ollama vs SGLang(含 Qwen3.8-27B 版本 Bug)

属性 内容
标题 vLLM vs Ollama vs SGLang: LLM Inference Compared 2026
来源 Winder.ai · winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
发布日期 2026-09(最新)
可信度 ⭐⭐⭐⭐
核心工程价值 含具体版本 Bug 数据,这是生产选型重要依据:
真实 Bug 数据 - vLLM 0.30:Qwen3.8-27B 在 H100 上拒绝启动,直到降低 sequence limit
- SGLang 0.5.20:Qwen3.8-27B 上静默将并发限制在 20,直到 state cache 扩大才恢复
- TRT-LLM 1.2.1:无法加载 Qwen3.8
- TRT-LLM 1.3.0rc28:FP8 checkpoint 启动失败(2026-09 open bug)
性能数据 Qwen3.8-27B @ H100 @ 50 并发:SGLang 1,725 tok/s vs vLLM 1,610 tok/s(差距 7%)
成本数据 SGLang 自托管:$0.56/M output tokens(卡跑满时);第三方 API:$1.80/M(平衡点:每日 1/3 时间跑满)
标签 vLLM SGLang Qwen3.8 version-bug cost-analysis production
建议行动 入 inference 工程选型主题页;补充 Qwen3.8 兼容性对照表
与今日已覆盖内容关系 新增;未在已有 13 条中覆盖;补充了 Unsloth/HyperQwen 中未涉及的版本 Bug 数据

4. HuggingFace Discussions: Param2-17B vLLM/SGLang 真实错误日志

属性 内容
标题 Param2-17B-A2.4B-Thinking Not Working in vLLM and SGLang
来源 HuggingFace · huggingface.co/bharatgenai/Param2-17B-A2.4B-Thinking/discussions/7
发布日期 2026-09(最新)
可信度 ⭐⭐⭐⭐ 社区真实排障记录
核心工程价值 含完整错误日志;体现新架构模型(Param2 MoE)与推理引擎的兼容性问题
真实错误 vLLM: "You are using a model of type param2moe to instantiate a model of type <unknown>" → 启动失败
SGLang: CUDA 兼容性问题,同一模型类型不匹配
影响模型 bharatgenai/Param2-17B-A2.4B-Thinking(新架构 MoE 模型)
标签 vLLM SGLang error-log compatibility MoE param2moe
建议行动 入知识库"推理引擎兼容性"章节;标记为 2026-09 已知问题
与今日已覆盖内容关系 新增;真实生产错误日志,今日已有内容无此类型条目

5. Composio: 8 Agent Harnesses 横向对比(含真实 Pass Rate)

属性 内容
标题 8 Best AI Agent Harnesses in 2026: Performance, Cost, and Speed Compared
来源 Composio · composio.dev/content/best-ai-agent-harnesses
发布日期 2026-09(最新)
可信度 ⭐⭐⭐⭐
核心工程价值 真实 pass rate 数据(25 项任务);相同工具集下对比 harness 效果:
真实数据 Kimi Code: 23/25 (92%), Hermes Agent: 23/25 (92%), Claude Code: 21/25 (84%), Pi Agent: 21/25 (84%), OpenCode: 19/25 (76%), Oh My Pi: 19/25 (76%), Grok Build: 18/25 (72%), Codex: 17/25 (68%)
20 点差距证明 harness 选择对同一模型影响极大
成本数据 同一 MCP setup;Kimi K3 via OpenRouter;cost per success 有记录
标签 agent-harness benchmark pass-rate MCP cost evaluation
建议行动 入 Agent Eval 主题页;20 点差距作为"必须测 harness"的论据
与今日已覆盖内容关系 新增;补充了 awesome-harness-engineering 中未包含的具体 pass rate 数字

6. InferenceEngineering.tech: 实时 Benchmark 数据(方法论级)

属性 内容
标题 Benchmark Comparison(vLLM vs SGLang)
来源 InferenceEngineering.tech · inferenceengineering.tech/benchmarks
发布日期 持续更新(2025-12-05 快照,2026-06 采集数据)
可信度 ⭐⭐⭐⭐⭐ 工程级 benchmark 方法论讨论平台
核心工程价值 方法论级内容:如何读懂 TPS/TTFT/p50/p99 的区别;client-side bottleneck 提醒;解释为何 micro-benchmark 不等于生产评估
数据说明 数据来自 2× H100 SXM, TP=2, CUDA 12.9, 5,980 requests;可直接复现
标签 benchmark-methodology vLLM SGLang H100 inference-engineering
建议行动 入 inference 工程主题页 benchmark 指南;引用其方法论说明
与今日已覆盖内容关系 与 JarvisLabs/Tensormesh 等 benchmark 文章互补;方法论层面更高

7. Harness-Aware Evaluation 综述(Sep 23, 2026)

属性 内容
标题 Harness-Aware Evaluation of LLM Agents: Systems, Benchmarks, and Protocols
来源 preprint (Preprints.org) · preprints.org/manuscript/202609.2140
作者 Ahmed Y. Radwan, Athanasios V. Vasilakos, Shaina Raza
发布日期 2026-09-23(Submitted),2026-09-24(Posted)
可信度 ⭐⭐⭐⭐ 学术预印本,含系统性文献综述
核心工程价值 综述 2026 年所有 harness-aware evaluation 工作;含 70 篇参考文献
关键引用 - "Stop Comparing LLM Agents Without Disclosing the Harness" (arXiv:2605.23950)
- HarnessOpt-Bench (arXiv:2608.06301):评估 LLM 优化 harness 的能力
- Harness-Bench (arXiv:2605.27922):跨模型测量 harness 效果
- Wildclawbench (arXiv:2605.10912):真实世界长周期 agent 评估
标签 agent-harness evaluation arXiv survey benchmark
建议行动 入 Agent Eval 主题页参考文献;交叉验证各子 benchmark 可信度
与今日已覆盖内容关系 新增;系统化今日已覆盖的多个 harness benchmark 引用

❌ 本轮丢弃条目

条目 丢弃理由
JarvisLabs H100 benchmark(SGLang vs vLLM vs TRT-LLM,May 2026) 已在上午/下午批次覆盖;无新数据
Tensormesh vLLM vs SGLang(Sep 15, 2026) 内容与 Spheron blog 大量重叠;TGI maintenance 信息今日已收录
PremAI blog vLLM vs SGLang vs LMDeploy 数据已被 Spheron/Winder.ai 覆盖;无额外工程细节
Spheron vLLM vs SGLang benchmarks(含 p50/成本表) 与 Winder.ai 数据重叠;60% prefix 重叠阈值今日已有
DigitalApplied KV Cache Optimization Guide(2026) 与 Modular/Five Eras KVCache 内容重叠;无额外命令
Modular: Five Eras of KVCache 来源可信(Modular/MAX),但内容偏历史综述,无新命令或数据
Kanerika SGLang vs vLLM 营销内容(大量 KPI 数字块),无工程细节
Ken Huang: Physics & Engineering of Frontier LLM Inference 10-part 系列 仅公告,无实际内容
Piers Stobbs Substack(Sep 2026) 内容偏投资视角,工程价值低
Himanshu Ramchandani: LLM Inference Workshop 营销导流,无实质工程内容

主题分布(第三轮)

  • Inference 基准方法论:3 条(Google Harness/Spheron FlashInfer/Winder Bug)
  • Agent Eval/Harness:3 条(Harness-Aware Paper/Composio/Google Harness)
  • 错误日志/兼容性问题:1 条(HuggingFace Param2)
  • 成本分析:1 条(Winder.ai cost breakdown)

与今日已覆盖内容的增量关系

  • 新增维度:版本兼容性 Bug(Qwen3.8-27B)、错误日志、harness 横向对比真实 pass rate
  • 去重:vLLM vs SGLang benchmark 数字今日已有 3+ 个来源,不重复收录
  • 新增方法论:Google harness 调试方法、Benchmark 读数指南

建议写入路径

  • 主草稿: 2026-09-30T1950-jay-engineering-filter-r3.md(本文件)
  • 精读优先级: Google Dev Harness 博客 > Spheron FlashInfer 命令序列 > Winder.ai Qwen3.8 Bug 数据

本轮写入

  • ✅ 已写入:/shared/research-kb/inbox/jay/2026-09-30T1950-jay-engineering-filter-r3.md