Jay 工程文章筛选 · 第三轮 · 2026-09-30 晚间
执行时间: 2026-09-30 19:50 (Asia/Shanghai) 筛选原则: 保留含真实环境/命令/错误/源码/性能数据/可复现步骤的条目;去重已覆盖内容。
✅ 本轮保留条目
1. Google Developers: Harness Engineering Anatomy(Sep 9, 2026)
| 属性 | 内容 |
|---|---|
| 标题 | The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents |
| 来源 | Google Developers Blog · developers.googleblog.com |
| 作者 | Taylor Mullen(Principal Engineer)+ Christian Gunderman(Staff Software Engineer) |
| 发布日期 | 2026-09-09 |
| 可信度 | ⭐⭐⭐⭐⭐ 官方工程博客,Google 一线工程师 |
| 核心工程价值 | 揭示 end-to-end benchmark 的陷阱:composite score 移动几个百分点但团队不知道为什么;提出 harness 拆解方法论;benchmark 微小变化溯源技术 |
| 真实数据 | 未披露具体数字,但有明确方法论框架(benchmark 拆解 → 变量控制 → 定位机制) |
| 与今日已覆盖内容关系 | 独立于 awesome-harness-engineering;更偏向 Google 内部工程实践 |
| 标签 | agent-harness benchmark-methodology Google evaluation production |
| 建议行动 | 精读;提炼 harness 调试方法论入知识库;与 Agent Eval 主题页交叉 |
| Substack 备注 | 非 Substack;Google Developers Blog 属工程博客 |
2. Spheron: FlashInfer Deployment Guide(含 benchmark 命令序列)
| 属性 | 内容 |
|---|---|
| 标题 | Deploy FlashInfer on GPU Cloud: LLM Inference Kernels for vLLM and SGLang (2026 Guide) |
| 来源 | Spheron Blog · spheron.network/blog/deploy-flashinfer-gpu-cloud-llm-inference-kernels |
| 发布日期 | 2026-09(最新) |
| 可信度 | ⭐⭐⭐⭐ |
| 核心工程价值 | 含完整 4 步 benchmark 命令序列,可复现: |
| 真实命令 | bash\n# Step 1: torch_sdpa baseline\ndocker run --gpus all --ipc=host -p 8000:8000 \\\n vllm/vllm-openai:latest \\\n --model meta-llama/Llama-3.1-70B-Instruct \\\n --dtype bfloat16 \\\n --attention-backend torch_sdpa \\\n --gpu-memory-utilization 0.92 \\\n --max-model-len 16384\n\n# Step 2: benchmark\npython -m vllm.benchmarks.benchmark_serving \\\n --model meta-llama/Llama-3.1-70B-Instruct \\\n --dataset-name random \\\n --random-input-len 2048 \\\n --random-output-len 512 \\\n --num-prompts 200 --concurrency 32 \\\n --host localhost --port 8000\n\n# Step 3: switch to FlashInfer backend\n --attention-backend flashinfer\n\n# Step 4: re-run benchmark\n |
| 关键结论 | FlashInfer 适合需要频繁换模型的团队(无 60-120 分钟 engine recompile);TRT-LLM 适合锁定模型追求极致吞吐 |
| 标签 | vLLM FlashInfer attention-backend benchmark commands production |
| 建议行动 | 入 inference 工程主题页;提取 --attention-backend 参数对比数据 |
| 与今日已覆盖内容关系 | 新增;未在已有 13 条中覆盖 |
3. Winder.ai: vLLM vs Ollama vs SGLang(含 Qwen3.8-27B 版本 Bug)
| 属性 | 内容 |
|---|---|
| 标题 | vLLM vs Ollama vs SGLang: LLM Inference Compared 2026 |
| 来源 | Winder.ai · winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison |
| 发布日期 | 2026-09(最新) |
| 可信度 | ⭐⭐⭐⭐ |
| 核心工程价值 | 含具体版本 Bug 数据,这是生产选型重要依据: |
| 真实 Bug 数据 | - vLLM 0.30:Qwen3.8-27B 在 H100 上拒绝启动,直到降低 sequence limit - SGLang 0.5.20:Qwen3.8-27B 上静默将并发限制在 20,直到 state cache 扩大才恢复 - TRT-LLM 1.2.1:无法加载 Qwen3.8 - TRT-LLM 1.3.0rc28:FP8 checkpoint 启动失败(2026-09 open bug) |
| 性能数据 | Qwen3.8-27B @ H100 @ 50 并发:SGLang 1,725 tok/s vs vLLM 1,610 tok/s(差距 7%) |
| 成本数据 | SGLang 自托管:$0.56/M output tokens(卡跑满时);第三方 API:$1.80/M(平衡点:每日 1/3 时间跑满) |
| 标签 | vLLM SGLang Qwen3.8 version-bug cost-analysis production |
| 建议行动 | 入 inference 工程选型主题页;补充 Qwen3.8 兼容性对照表 |
| 与今日已覆盖内容关系 | 新增;未在已有 13 条中覆盖;补充了 Unsloth/HyperQwen 中未涉及的版本 Bug 数据 |
4. HuggingFace Discussions: Param2-17B vLLM/SGLang 真实错误日志
| 属性 | 内容 |
|---|---|
| 标题 | Param2-17B-A2.4B-Thinking Not Working in vLLM and SGLang |
| 来源 | HuggingFace · huggingface.co/bharatgenai/Param2-17B-A2.4B-Thinking/discussions/7 |
| 发布日期 | 2026-09(最新) |
| 可信度 | ⭐⭐⭐⭐ 社区真实排障记录 |
| 核心工程价值 | 含完整错误日志;体现新架构模型(Param2 MoE)与推理引擎的兼容性问题 |
| 真实错误 | vLLM: "You are using a model of type param2moe to instantiate a model of type <unknown>" → 启动失败SGLang: CUDA 兼容性问题,同一模型类型不匹配 |
| 影响模型 | bharatgenai/Param2-17B-A2.4B-Thinking(新架构 MoE 模型) |
| 标签 | vLLM SGLang error-log compatibility MoE param2moe |
| 建议行动 | 入知识库"推理引擎兼容性"章节;标记为 2026-09 已知问题 |
| 与今日已覆盖内容关系 | 新增;真实生产错误日志,今日已有内容无此类型条目 |
5. Composio: 8 Agent Harnesses 横向对比(含真实 Pass Rate)
| 属性 | 内容 |
|---|---|
| 标题 | 8 Best AI Agent Harnesses in 2026: Performance, Cost, and Speed Compared |
| 来源 | Composio · composio.dev/content/best-ai-agent-harnesses |
| 发布日期 | 2026-09(最新) |
| 可信度 | ⭐⭐⭐⭐ |
| 核心工程价值 | 真实 pass rate 数据(25 项任务);相同工具集下对比 harness 效果: |
| 真实数据 | Kimi Code: 23/25 (92%), Hermes Agent: 23/25 (92%), Claude Code: 21/25 (84%), Pi Agent: 21/25 (84%), OpenCode: 19/25 (76%), Oh My Pi: 19/25 (76%), Grok Build: 18/25 (72%), Codex: 17/25 (68%) 20 点差距证明 harness 选择对同一模型影响极大 |
| 成本数据 | 同一 MCP setup;Kimi K3 via OpenRouter;cost per success 有记录 |
| 标签 | agent-harness benchmark pass-rate MCP cost evaluation |
| 建议行动 | 入 Agent Eval 主题页;20 点差距作为"必须测 harness"的论据 |
| 与今日已覆盖内容关系 | 新增;补充了 awesome-harness-engineering 中未包含的具体 pass rate 数字 |
6. InferenceEngineering.tech: 实时 Benchmark 数据(方法论级)
| 属性 | 内容 |
|---|---|
| 标题 | Benchmark Comparison(vLLM vs SGLang) |
| 来源 | InferenceEngineering.tech · inferenceengineering.tech/benchmarks |
| 发布日期 | 持续更新(2025-12-05 快照,2026-06 采集数据) |
| 可信度 | ⭐⭐⭐⭐⭐ 工程级 benchmark 方法论讨论平台 |
| 核心工程价值 | 方法论级内容:如何读懂 TPS/TTFT/p50/p99 的区别;client-side bottleneck 提醒;解释为何 micro-benchmark 不等于生产评估 |
| 数据说明 | 数据来自 2× H100 SXM, TP=2, CUDA 12.9, 5,980 requests;可直接复现 |
| 标签 | benchmark-methodology vLLM SGLang H100 inference-engineering |
| 建议行动 | 入 inference 工程主题页 benchmark 指南;引用其方法论说明 |
| 与今日已覆盖内容关系 | 与 JarvisLabs/Tensormesh 等 benchmark 文章互补;方法论层面更高 |
7. Harness-Aware Evaluation 综述(Sep 23, 2026)
| 属性 | 内容 |
|---|---|
| 标题 | Harness-Aware Evaluation of LLM Agents: Systems, Benchmarks, and Protocols |
| 来源 | preprint (Preprints.org) · preprints.org/manuscript/202609.2140 |
| 作者 | Ahmed Y. Radwan, Athanasios V. Vasilakos, Shaina Raza |
| 发布日期 | 2026-09-23(Submitted),2026-09-24(Posted) |
| 可信度 | ⭐⭐⭐⭐ 学术预印本,含系统性文献综述 |
| 核心工程价值 | 综述 2026 年所有 harness-aware evaluation 工作;含 70 篇参考文献 |
| 关键引用 | - "Stop Comparing LLM Agents Without Disclosing the Harness" (arXiv:2605.23950) - HarnessOpt-Bench (arXiv:2608.06301):评估 LLM 优化 harness 的能力 - Harness-Bench (arXiv:2605.27922):跨模型测量 harness 效果 - Wildclawbench (arXiv:2605.10912):真实世界长周期 agent 评估 |
| 标签 | agent-harness evaluation arXiv survey benchmark |
| 建议行动 | 入 Agent Eval 主题页参考文献;交叉验证各子 benchmark 可信度 |
| 与今日已覆盖内容关系 | 新增;系统化今日已覆盖的多个 harness benchmark 引用 |
❌ 本轮丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| JarvisLabs H100 benchmark(SGLang vs vLLM vs TRT-LLM,May 2026) | 已在上午/下午批次覆盖;无新数据 |
| Tensormesh vLLM vs SGLang(Sep 15, 2026) | 内容与 Spheron blog 大量重叠;TGI maintenance 信息今日已收录 |
| PremAI blog vLLM vs SGLang vs LMDeploy | 数据已被 Spheron/Winder.ai 覆盖;无额外工程细节 |
| Spheron vLLM vs SGLang benchmarks(含 p50/成本表) | 与 Winder.ai 数据重叠;60% prefix 重叠阈值今日已有 |
| DigitalApplied KV Cache Optimization Guide(2026) | 与 Modular/Five Eras KVCache 内容重叠;无额外命令 |
| Modular: Five Eras of KVCache | 来源可信(Modular/MAX),但内容偏历史综述,无新命令或数据 |
| Kanerika SGLang vs vLLM | 营销内容(大量 KPI 数字块),无工程细节 |
| Ken Huang: Physics & Engineering of Frontier LLM Inference 10-part 系列 | 仅公告,无实际内容 |
| Piers Stobbs Substack(Sep 2026) | 内容偏投资视角,工程价值低 |
| Himanshu Ramchandani: LLM Inference Workshop | 营销导流,无实质工程内容 |
主题分布(第三轮)
- Inference 基准方法论:3 条(Google Harness/Spheron FlashInfer/Winder Bug)
- Agent Eval/Harness:3 条(Harness-Aware Paper/Composio/Google Harness)
- 错误日志/兼容性问题:1 条(HuggingFace Param2)
- 成本分析:1 条(Winder.ai cost breakdown)
与今日已覆盖内容的增量关系
- 新增维度:版本兼容性 Bug(Qwen3.8-27B)、错误日志、harness 横向对比真实 pass rate
- 去重:vLLM vs SGLang benchmark 数字今日已有 3+ 个来源,不重复收录
- 新增方法论:Google harness 调试方法、Benchmark 读数指南
建议写入路径
- 主草稿:
2026-09-30T1950-jay-engineering-filter-r3.md(本文件) - 精读优先级: Google Dev Harness 博客 > Spheron FlashInfer 命令序列 > Winder.ai Qwen3.8 Bug 数据
本轮写入
- ✅ 已写入:
/shared/research-kb/inbox/jay/2026-09-30T1950-jay-engineering-filter-r3.md