工程二次筛选报告 · Jay · 2026-08-23 下午

任务说明

对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤不执行 GitHub 写入。


一、本次新增候选条目

A. 推理引擎基准数据(新鲜来源:PremAI / Atomic / Particula / AIMultiple)

1. SGLang vs vLLM vs LMDeploy H100 基准(PremAI · Aug 2026)

  • 来源: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
  • 数据类型: 数值基准
  • SGLang: ~16,200 tok/s(H100)
  • vLLM: ~12,500 tok/s(H100)
  • LMDeploy: ~16,200 tok/s(H100)
  • 差距: SGLang/LMDeploy 比 vLLM +29% throughput
  • SGLang v0.4 零开销调度器:CPU 调度开销从 15-25% 降至 <2%
  • 保留理由: 有具体 tok/s 数字、H100 GPU 型号、引擎版本,可作生产选型参考
  • 丢弃理由: 无命令/源码/复现步骤,仅第三方汇总,数字未标注置信区间
  • 最终判断: 🔴 保留作线索(补充 13:35 vLLM 草稿中的 benchmark 部分,原草稿缺具体数值)

2. SGLang vs vLLM PD 分离 + DeepSeek V3 加速(Particula · Aug 2026)

  • 来源: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
  • 数据类型: 实测数值表
  • SGLang output throughput: 894 tok/s vs vLLM 413 tok/s(+117%
  • TTFT: SGLang 79ms vs vLLM 103ms(-23%
  • ITL: SGLang 6.0ms vs vLLM 7.1ms(-15%
  • DeepSeek V3: SGLang 比 vLLM 快 3.1x(MLA 优化)
  • EAGLE 推测解码: decode speedup 1.8x(batch=1)、1.5x(batch=32)
  • 并发 50 unique prompts: SGLang 1,920 tok/s vs vLLM 1,850 tok/s(差距仅 +3.8%
  • 保留理由: 有完整数值表,区分 prefix-heavy 和 unique-prompt 两种场景,是 13:35 草稿中"PD 分离"的数值补充
  • 丢弃理由: 无命令/复现步骤
  • 最终判断: 🟡 保留作线索(工程选型高价值,数字需注明来源)

3. SGLang 2026 功能时间线(GitHub README 摘要)

  • 来源: https://github.com/sgl-project/sglang
  • 条目:
  • 2026/07: SGLang + Miles → Kimi K3 day-0 支持
  • 2026/07: SGLang + Google → TPU 全功能支持
  • 2026/07: GLM5.2 NVFP4 agentic workloads → 500 TPS达成(两周)
  • 2026/06: DFlash + Spec V2(下一代推测解码)
  • 2026/04: DeepSeek-V4 day-0 → Verified RL with SGLang + Miles
  • 2026/02: NVIDIA GB300 NVL72 → 25x 性能提升
  • 2026/01: SGLang Diffusion 加速视频/图像生成
  • 保留理由: 覆盖 2026 年 inference 关键里程碑
  • 最终判断: 🟢 保留(官方 GitHub 公开信息,可纳入推理引擎时间线)

B. Harness Engineering 学术文献

4. ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents

  • 来源: arXiv 2604.10352(EuroMLSys '26 · DOI: 10.1145/3805621.3807648)
  • 核心: 将 VM 思想引入 agent harness,stateful tool-use 的虚拟内存管理
  • 数据集引用: Long-MemEval benchmark(Long-MemEval benchmark)
  • 相关引用:
  • OpenClaw forget bug 作为真实 failure case 被引用(Reddit r/AI_Agents,2026-02-06)
  • Hu et al. 2026: ICLR 2026 论文(evaluating memory in LLM agents)
  • "Memory as Action" (Zhang et al. 2025, arXiv 2510.12635)
  • 保留理由: EuroMLSys '26 论文,有正式 DOI,Harness VM 是新概念
  • 丢弃理由: 尚无源码/命令/复现步骤(arXiv 预印本)
  • 最终判断: 🟡 保留作线索(需等正式发表后追踪 GitHub repo)

5. MemoHarness: Agent Harnesses That Learn(arXiv 2607.14159)

  • 核心: harness 本身可被搜索/适应的新范式,区分于 training-time artifact
  • 相关工作: Meta-Harness(Lee et al. 2026)、Natural-Language Agent Harnesses(Pan et al. 2026)、Terminal-Bench(Merrill et al. 2026)
  • 保留理由: 工程化 harness 的学术前沿方向
  • 最终判断: 🔴 暂存作线索(等 GitHub repo 出现再入知识库)

6. From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

  • 来源: arXiv 2607.08028v1
  • 核心: 企业 agent 的可审计性 harness
  • 数据格式: JSONL eval results(evals/results/live-llm-composition-boundary.full-30x3.2026-06-03.json)
  • 保留理由: 生产可审计性是 2026 agent 工程盲点,此文提出具体工程方案
  • 最终判断: 🟡 保留作线索(追踪 GitHub repo 及企业落地案例)

7. OneDayAgent: Towards Long-Horizon Harness(arXiv 2608.05013v1)

  • 核心: GLM-5.2 backend,7200 秒超时,200 ReAct iterations,128K max tokens
  • 配置原文: temperature 1.0, top-pp 0.95, 128K max tokens, 200 ReAct iterations, 7200-second timeout, up to 6 subtasks, context compression at 0.9×budget
  • 保留理由: 有完整实验配置,可复现参考
  • 最终判断: 🟢 保留(工程配置详尽,可作 agent 超参工程参考)

8. EvoHarness-RL: Self-Evolving Runtime Harness(arXiv 2608.05446v1)

  • 核心: runtime layer(prompts、tools、memory、state trackers、verifiers)作为优化对象
  • 保留理由: 2026 年 harness engineering 新方向,衔接 13:35 草稿中"harness engineering"关键词
  • 最终判断: 🔴 暂存作线索(需等源码/GitHub)

9. Externalization in LLM Agents(arXiv 2604.08224v1)

  • 核心: Weights → Context → Harness 三层演进框架(2022-2026 时间线)
  • 关键洞察: file-centric state abstraction(InfiAgent,Yu et al. 2026)——以文件系统为唯一权威状态记录
  • 保留理由: 概念框架对工程系统设计有指导意义
  • 最终判断: 🟡 保留作线索(附时间线,可纳入 agent 系统架构主题页)

C. Substack 高价值条目

10. The AI Engineer: AI Agents Stack 2026 Edition

  • 来源: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 核心观点:
  • "Agent stack ≠ LLM stack"(state management、tool access、memory、reasoning loops、guardrails 是独立基础设施层)
  • Cursor 路由: Claude + GPT-4 + 自有 fine-tuned 模型
  • MCP servers: 编辑器、terminal、文件系统、git 的协议层
  • Codebase-aware retrieval with reranking
  • 与 13:35 草稿关系: 补充了"AI Agent 框架选型矩阵"背后的为什么这样选逻辑
  • 最终判断: 🟢 保留(高质量工程洞察,不重复)

11. FutureAGI: The Definitive Guide to AI Agent Evaluation(2026)

  • 来源: https://futureagi.substack.com/p/the-definitive-guide-to-ai-agent
  • 核心失败模式(工程价值高): 1. Hallucinating success: agent 收到 500 错误但继续"成功"编造结果 2. Silent failure: 任务超时无解释 3. Retry storm: 无退避重试导致故障放大 4. Context loss on recovery: 正确退避但丢失上下文
  • 评估原则: per-dimension thresholds > aggregate gate(aggregate 0.80 可掩盖某维度 0.50)
  • 最终判断: 🟢 保留(工程失败模式清单,生产实用性极强,建议纳入 agent 工程 checklist

12. The AI Engineer: Open-Source Agent Toolkit 2026

  • 来源: https://theaiengineer.substack.com/p/the-open-source-agent-toolkit-in
  • 核心:
  • Mem0: 记忆即检索;temporal reasoning 需要图结构("上周说的与今天矛盾的")
  • Stagehand v3(Feb 2026): Chrome DevTools Protocol 重写引擎,44% 提速
  • Mem0 ceiling: temporal reasoning 需要 graph 记录时间边
  • 最终判断: 🟢 保留(Mem0 vs graph memory 对比是生产工程选型参考)

13. The Nuances Perspective: AI Agent Stack 2026

  • 来源: https://thenuancedperspective.substack.com/p/how-to-choose-your-ai-agent-stack
  • 核心:
  • 80% 请求路由到廉价专用模型,20% 保留给前沿模型( orchestration 本身用最强模型)
  • 2022 年 GPT-4 等价 $20/M tokens → 2026 年 $0.40,2026 年最低 <$0.10
  • Gartner 预测 2030 再降 90%
  • 混合搜索(vector + keyword + metadata)是 2026 生产默认,naive RAG 罕见
  • 最终判断: 🟡 保留作线索(成本数据值得归档,但无工程命令)

D. GitHub 新增工程条目

14. elizabetht/100-days-of-inference(持续更新中)

  • 来源: https://github.com/elizabetht/100-days-of-inference
  • 状态: 26/102 entries(Runtime Layer 18/18 ✅,Infrastructure Layer 8/8 ✅,Tooling Layer 0/3,Deep Implementation 0/23)
  • 集群: spark-01 192.168.1.76 · spark-02 192.168.1.77(DGX Sparks 家庭实验室)
  • 书籍: Philip Kiely《Inference Engineering》(Baseten Books, 2026)
  • 每个 entry 是可运行脚本
  • 保留理由: 每个 entry 有脚本,真实硬件环境,可复现性强,是 inference 工程实践稀缺资源
  • 最终判断: 🟢 保留(强烈建议纳入知识库,重点追踪)

15. ai-boost/awesome-harness-engineering

  • 来源: https://github.com/ai-boost/awesome-harness-engineering
  • 内容: tools、patterns、evals、memory、MCP、permissions、observability、orchestration
  • Google A2A 案例: Python LLM extraction agent → Go deterministic validator via A2A,跨语言多智能体团队
  • 保留理由: A2A 协议 2026 生产模式,harness-level orchestration 是 agent 工程核心
  • 最终判断: 🟢 保留(A2A 生产模式可纳入 agent 架构主题页)

二、二次筛选汇总

条目 类型 保留/丢弃 理由
PremAI SGLang vs vLLM 基准 数值汇总 🔴线索 无原始命令/复现,仅第三方汇总
Particula SGLang vs vLLM 详细基准 实测数值表 🟡线索 数值详尽,但无复现步骤;补充 13:35 benchmark
SGLang 2026 官方时间线 工程里程碑 🟢保留 GitHub 官方,纳入推理引擎时间线
ClawVM(EuroMLSys '26) 学术论文 🟡线索 新概念,需等源码
MemoHarness 学术预印本 🔴暂存 无源码,暂不入库
From Prompts to Contracts 学术论文 🟡线索 JSONL 格式有价值,但需追踪 GitHub
OneDayAgent 学术论文 🟢保留 完整实验配置,agent 超参参考
EvoHarness-RL 学术预印本 🔴暂存 无源码
Externalization in LLM Agents 综述论文 🟡线索 三层框架有参考价值
The AI Engineer: AI Agents Stack 2026 Substack 🟢保留 高质量工程洞察,补充 13:35 选型逻辑
FutureAGI: Agent Evaluation Guide Substack 🟢保留 生产失败模式清单,工程实用性极强
The AI Engineer: OSS Agent Toolkit Substack 🟢保留 Mem0 temporal reasoning ceiling,Stagehand v3 44% 提速
The Nuances: AI Agent Stack Cost Substack 🟡线索 成本数据归档,无工程命令
100-days-of-inference GitHub 🟢保留 可运行脚本,真实硬件,可复现
awesome-harness-engineering GitHub 🟢保留 A2A 生产模式,harness 工程聚合

三、本轮可写入草稿

本次筛选发现 5 个新高质量条目值得立即入库:

草稿 A:推理引擎基准数据包(补充 13:35 草稿)

## 补充:推理引擎 H100 基准数值(来源:PremAI · Particula · Atomic · AIMultiple · Aug 2026)

### 吞吐对比(SGLang vs vLLM vs LMDeploy)
| 引擎 | H100 tok/s | 相对 vLLM |
|---|---|---|
| SGLang v0.4 | ~16,200 | +29% |
| LMDeploy | ~16,200 | +29% |
| vLLM | ~12,500 | baseline |

### 输出吞吐(相同输入+输出测试)
| 引擎 | Output tok/s | TTFT | ITL |
|---|---|---|---|
| SGLang | 894 | 79ms | 6.0ms |
| vLLM | 413 | 103ms | 7.1ms |

### 场景差异
- Unique prompts 并发50: SGLang 1,920 vs vLLM 1,850(仅+3.8%)
- Prefix-heavy / agent: SGLang 领先 20-29%(RadixAttention KV cache 复用)
- DeepSeek V3: SGLang 比 vLLM 快 3.1x(MLA 优化)
- EAGLE 推测解码: batch=1 时 decode speedup 1.8x

### SGLang 2026 功能时间线
- 2026/07: Kimi K3 day-0(via Miles)
- 2026/07: TPU 全功能支持(with Google)
- 2026/07: GLM5.2 NVFP4 → 500 TPS(2周达成)
- 2026/06: DFlash + Spec V2
- 2026/04: DeepSeek-V4 day-0 → Verified RL
- 2026/02: GB300 NVL72 → 25x 性能

来源: github.com/sgl-project/sglang, premi.io, particula.tech, aimultiple.com

草稿 B:Agent 工程生产失败模式清单

## Agent 生产失败模式清单(FutureAGI · 2026 · thedefinitivet guide to AI agent evaluation)

### 四大高危失败模式
1. **Hallucinating success**: agent 收到 500 错误继续编造"成功"结果(最危险,输出连贯)
2. **Silent failure**: 任务超时无解释,用户/调用系统得不到反馈
3. **Retry storm**: 无退避重试,放大原始 API 故障
4. **Context loss on recovery**: 正确退避但丢失 prior turns 上下文,任务实质重启

### 评估原则
- **Per-dimension thresholds > aggregate gate**
  - 例:task_completion 0.95 + instruction_adherence 0.90 + error_recovery 0.50
  - aggregate 0.80 通过,但 error_recovery 0.50 在生产中是灾难
- 正确做法:每个维度单独设阈值,任一低于阈值则失败

### 工程建议
- 所有外部调用必须有超时+错误回调
- 重试必须有指数退避+最大次数限制
- 有状态 agent 恢复时需从 checkpoint 重建上下文,不依赖内存

草稿 C:100-days-of-inference 追踪卡片

## GitHub 工程实践:100-days-of-inference(持续更新中)

### 基本信息
- Repo: github.com/elizabetht/100-days-of-inference
- 状态: 26/102(Runtime Layer ✅,Infrastructure Layer ✅,其余进行中)
- 硬件: DGX Spark ×2(spark-01 192.168.1.76,spark-02 192.168.1.77)
- 图书: Philip Kiely《Inference Engineering》(Baseten Books, 2026)
- 每个 entry 是**可运行脚本**

### 已完成模块
- Runtime Layer: 18/18 ✅(CUDA kernel、FlashAttention、PagedAttention 等)
- Infrastructure Layer: 8/8 ✅(网络、存储、K8s 等)

### 工程价值
- 稀缺的家庭实验室真实硬件 inference 实验记录
- 每个 entry 独立可运行,适合复现学习
- 建议纳入「inference 工程实践」主题页

### 追踪建议
- 每周检查新 entry
- Runtime Layer 完成度高,可优先提取关键脚本路径

四、标签

推理引擎 #SGLang #vLLM #Benchmark #Harness-Engineering #Agent-Evaluation #Production-Failures #Substack #arXiv

建议写入路径

/shared/research-kb/inbox/jay/2026-08-23-1450-jay-engineering-benchmarks-harness-substack.md


撰写实例: Jay
时间: 2026-08-23 14:50 (Asia/Shanghai)
筛选方法: 二次工程价值判断(命令/源码/性能数据/可复现性) 与 13:35 草稿关系: 补充推理引擎基准数值 + 新增 harness 工程 + agent 失败模式 建议主题页更新: Inference 引擎基准 / Agent 工程失败模式 / Harness Engineering