工程二次筛选报告 · Jay · 2026-08-23 下午
任务说明
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。
一、本次新增候选条目
A. 推理引擎基准数据(新鲜来源:PremAI / Atomic / Particula / AIMultiple)
1. SGLang vs vLLM vs LMDeploy H100 基准(PremAI · Aug 2026)
- 来源: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
- 数据类型: 数值基准
- SGLang: ~16,200 tok/s(H100)
- vLLM: ~12,500 tok/s(H100)
- LMDeploy: ~16,200 tok/s(H100)
- 差距: SGLang/LMDeploy 比 vLLM +29% throughput
- SGLang v0.4 零开销调度器:CPU 调度开销从 15-25% 降至 <2%
- 保留理由: 有具体 tok/s 数字、H100 GPU 型号、引擎版本,可作生产选型参考
- 丢弃理由: 无命令/源码/复现步骤,仅第三方汇总,数字未标注置信区间
- 最终判断: 🔴 保留作线索(补充 13:35 vLLM 草稿中的 benchmark 部分,原草稿缺具体数值)
2. SGLang vs vLLM PD 分离 + DeepSeek V3 加速(Particula · Aug 2026)
- 来源: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
- 数据类型: 实测数值表
- SGLang output throughput: 894 tok/s vs vLLM 413 tok/s(+117%)
- TTFT: SGLang 79ms vs vLLM 103ms(-23%)
- ITL: SGLang 6.0ms vs vLLM 7.1ms(-15%)
- DeepSeek V3: SGLang 比 vLLM 快 3.1x(MLA 优化)
- EAGLE 推测解码: decode speedup 1.8x(batch=1)、1.5x(batch=32)
- 并发 50 unique prompts: SGLang 1,920 tok/s vs vLLM 1,850 tok/s(差距仅 +3.8%)
- 保留理由: 有完整数值表,区分 prefix-heavy 和 unique-prompt 两种场景,是 13:35 草稿中"PD 分离"的数值补充
- 丢弃理由: 无命令/复现步骤
- 最终判断: 🟡 保留作线索(工程选型高价值,数字需注明来源)
3. SGLang 2026 功能时间线(GitHub README 摘要)
- 来源: https://github.com/sgl-project/sglang
- 条目:
- 2026/07: SGLang + Miles → Kimi K3 day-0 支持
- 2026/07: SGLang + Google → TPU 全功能支持
- 2026/07: GLM5.2 NVFP4 agentic workloads → 500 TPS达成(两周)
- 2026/06: DFlash + Spec V2(下一代推测解码)
- 2026/04: DeepSeek-V4 day-0 → Verified RL with SGLang + Miles
- 2026/02: NVIDIA GB300 NVL72 → 25x 性能提升
- 2026/01: SGLang Diffusion 加速视频/图像生成
- 保留理由: 覆盖 2026 年 inference 关键里程碑
- 最终判断: 🟢 保留(官方 GitHub 公开信息,可纳入推理引擎时间线)
B. Harness Engineering 学术文献
4. ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents
- 来源: arXiv 2604.10352(EuroMLSys '26 · DOI: 10.1145/3805621.3807648)
- 核心: 将 VM 思想引入 agent harness,stateful tool-use 的虚拟内存管理
- 数据集引用: Long-MemEval benchmark(Long-MemEval benchmark)
- 相关引用:
- OpenClaw forget bug 作为真实 failure case 被引用(Reddit r/AI_Agents,2026-02-06)
- Hu et al. 2026: ICLR 2026 论文(evaluating memory in LLM agents)
- "Memory as Action" (Zhang et al. 2025, arXiv 2510.12635)
- 保留理由: EuroMLSys '26 论文,有正式 DOI,Harness VM 是新概念
- 丢弃理由: 尚无源码/命令/复现步骤(arXiv 预印本)
- 最终判断: 🟡 保留作线索(需等正式发表后追踪 GitHub repo)
5. MemoHarness: Agent Harnesses That Learn(arXiv 2607.14159)
- 核心: harness 本身可被搜索/适应的新范式,区分于 training-time artifact
- 相关工作: Meta-Harness(Lee et al. 2026)、Natural-Language Agent Harnesses(Pan et al. 2026)、Terminal-Bench(Merrill et al. 2026)
- 保留理由: 工程化 harness 的学术前沿方向
- 最终判断: 🔴 暂存作线索(等 GitHub repo 出现再入知识库)
6. From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
- 来源: arXiv 2607.08028v1
- 核心: 企业 agent 的可审计性 harness
- 数据格式: JSONL eval results(evals/results/live-llm-composition-boundary.full-30x3.2026-06-03.json)
- 保留理由: 生产可审计性是 2026 agent 工程盲点,此文提出具体工程方案
- 最终判断: 🟡 保留作线索(追踪 GitHub repo 及企业落地案例)
7. OneDayAgent: Towards Long-Horizon Harness(arXiv 2608.05013v1)
- 核心: GLM-5.2 backend,7200 秒超时,200 ReAct iterations,128K max tokens
- 配置原文:
temperature 1.0, top-pp 0.95, 128K max tokens, 200 ReAct iterations, 7200-second timeout, up to 6 subtasks, context compression at 0.9×budget - 保留理由: 有完整实验配置,可复现参考
- 最终判断: 🟢 保留(工程配置详尽,可作 agent 超参工程参考)
8. EvoHarness-RL: Self-Evolving Runtime Harness(arXiv 2608.05446v1)
- 核心: runtime layer(prompts、tools、memory、state trackers、verifiers)作为优化对象
- 保留理由: 2026 年 harness engineering 新方向,衔接 13:35 草稿中"harness engineering"关键词
- 最终判断: 🔴 暂存作线索(需等源码/GitHub)
9. Externalization in LLM Agents(arXiv 2604.08224v1)
- 核心: Weights → Context → Harness 三层演进框架(2022-2026 时间线)
- 关键洞察: file-centric state abstraction(InfiAgent,Yu et al. 2026)——以文件系统为唯一权威状态记录
- 保留理由: 概念框架对工程系统设计有指导意义
- 最终判断: 🟡 保留作线索(附时间线,可纳入 agent 系统架构主题页)
C. Substack 高价值条目
10. The AI Engineer: AI Agents Stack 2026 Edition
- 来源: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 核心观点:
- "Agent stack ≠ LLM stack"(state management、tool access、memory、reasoning loops、guardrails 是独立基础设施层)
- Cursor 路由: Claude + GPT-4 + 自有 fine-tuned 模型
- MCP servers: 编辑器、terminal、文件系统、git 的协议层
- Codebase-aware retrieval with reranking
- 与 13:35 草稿关系: 补充了"AI Agent 框架选型矩阵"背后的为什么这样选逻辑
- 最终判断: 🟢 保留(高质量工程洞察,不重复)
11. FutureAGI: The Definitive Guide to AI Agent Evaluation(2026)
- 来源: https://futureagi.substack.com/p/the-definitive-guide-to-ai-agent
- 核心失败模式(工程价值高): 1. Hallucinating success: agent 收到 500 错误但继续"成功"编造结果 2. Silent failure: 任务超时无解释 3. Retry storm: 无退避重试导致故障放大 4. Context loss on recovery: 正确退避但丢失上下文
- 评估原则: per-dimension thresholds > aggregate gate(aggregate 0.80 可掩盖某维度 0.50)
- 最终判断: 🟢 保留(工程失败模式清单,生产实用性极强,建议纳入 agent 工程 checklist)
12. The AI Engineer: Open-Source Agent Toolkit 2026
- 来源: https://theaiengineer.substack.com/p/the-open-source-agent-toolkit-in
- 核心:
- Mem0: 记忆即检索;temporal reasoning 需要图结构("上周说的与今天矛盾的")
- Stagehand v3(Feb 2026): Chrome DevTools Protocol 重写引擎,44% 提速
- Mem0 ceiling: temporal reasoning 需要 graph 记录时间边
- 最终判断: 🟢 保留(Mem0 vs graph memory 对比是生产工程选型参考)
13. The Nuances Perspective: AI Agent Stack 2026
- 来源: https://thenuancedperspective.substack.com/p/how-to-choose-your-ai-agent-stack
- 核心:
- 80% 请求路由到廉价专用模型,20% 保留给前沿模型( orchestration 本身用最强模型)
- 2022 年 GPT-4 等价 $20/M tokens → 2026 年 $0.40,2026 年最低 <$0.10
- Gartner 预测 2030 再降 90%
- 混合搜索(vector + keyword + metadata)是 2026 生产默认,naive RAG 罕见
- 最终判断: 🟡 保留作线索(成本数据值得归档,但无工程命令)
D. GitHub 新增工程条目
14. elizabetht/100-days-of-inference(持续更新中)
- 来源: https://github.com/elizabetht/100-days-of-inference
- 状态: 26/102 entries(Runtime Layer 18/18 ✅,Infrastructure Layer 8/8 ✅,Tooling Layer 0/3,Deep Implementation 0/23)
- 集群:
spark-01 192.168.1.76·spark-02 192.168.1.77(DGX Sparks 家庭实验室) - 书籍: Philip Kiely《Inference Engineering》(Baseten Books, 2026)
- 每个 entry 是可运行脚本
- 保留理由: 每个 entry 有脚本,真实硬件环境,可复现性强,是 inference 工程实践稀缺资源
- 最终判断: 🟢 保留(强烈建议纳入知识库,重点追踪)
15. ai-boost/awesome-harness-engineering
- 来源: https://github.com/ai-boost/awesome-harness-engineering
- 内容: tools、patterns、evals、memory、MCP、permissions、observability、orchestration
- Google A2A 案例: Python LLM extraction agent → Go deterministic validator via A2A,跨语言多智能体团队
- 保留理由: A2A 协议 2026 生产模式,harness-level orchestration 是 agent 工程核心
- 最终判断: 🟢 保留(A2A 生产模式可纳入 agent 架构主题页)
二、二次筛选汇总
| 条目 | 类型 | 保留/丢弃 | 理由 |
|---|---|---|---|
| PremAI SGLang vs vLLM 基准 | 数值汇总 | 🔴线索 | 无原始命令/复现,仅第三方汇总 |
| Particula SGLang vs vLLM 详细基准 | 实测数值表 | 🟡线索 | 数值详尽,但无复现步骤;补充 13:35 benchmark |
| SGLang 2026 官方时间线 | 工程里程碑 | 🟢保留 | GitHub 官方,纳入推理引擎时间线 |
| ClawVM(EuroMLSys '26) | 学术论文 | 🟡线索 | 新概念,需等源码 |
| MemoHarness | 学术预印本 | 🔴暂存 | 无源码,暂不入库 |
| From Prompts to Contracts | 学术论文 | 🟡线索 | JSONL 格式有价值,但需追踪 GitHub |
| OneDayAgent | 学术论文 | 🟢保留 | 完整实验配置,agent 超参参考 |
| EvoHarness-RL | 学术预印本 | 🔴暂存 | 无源码 |
| Externalization in LLM Agents | 综述论文 | 🟡线索 | 三层框架有参考价值 |
| The AI Engineer: AI Agents Stack 2026 | Substack | 🟢保留 | 高质量工程洞察,补充 13:35 选型逻辑 |
| FutureAGI: Agent Evaluation Guide | Substack | 🟢保留 | 生产失败模式清单,工程实用性极强 |
| The AI Engineer: OSS Agent Toolkit | Substack | 🟢保留 | Mem0 temporal reasoning ceiling,Stagehand v3 44% 提速 |
| The Nuances: AI Agent Stack Cost | Substack | 🟡线索 | 成本数据归档,无工程命令 |
| 100-days-of-inference | GitHub | 🟢保留 | 可运行脚本,真实硬件,可复现 |
| awesome-harness-engineering | GitHub | 🟢保留 | A2A 生产模式,harness 工程聚合 |
三、本轮可写入草稿
本次筛选发现 5 个新高质量条目值得立即入库:
草稿 A:推理引擎基准数据包(补充 13:35 草稿)
## 补充:推理引擎 H100 基准数值(来源:PremAI · Particula · Atomic · AIMultiple · Aug 2026)
### 吞吐对比(SGLang vs vLLM vs LMDeploy)
| 引擎 | H100 tok/s | 相对 vLLM |
|---|---|---|
| SGLang v0.4 | ~16,200 | +29% |
| LMDeploy | ~16,200 | +29% |
| vLLM | ~12,500 | baseline |
### 输出吞吐(相同输入+输出测试)
| 引擎 | Output tok/s | TTFT | ITL |
|---|---|---|---|
| SGLang | 894 | 79ms | 6.0ms |
| vLLM | 413 | 103ms | 7.1ms |
### 场景差异
- Unique prompts 并发50: SGLang 1,920 vs vLLM 1,850(仅+3.8%)
- Prefix-heavy / agent: SGLang 领先 20-29%(RadixAttention KV cache 复用)
- DeepSeek V3: SGLang 比 vLLM 快 3.1x(MLA 优化)
- EAGLE 推测解码: batch=1 时 decode speedup 1.8x
### SGLang 2026 功能时间线
- 2026/07: Kimi K3 day-0(via Miles)
- 2026/07: TPU 全功能支持(with Google)
- 2026/07: GLM5.2 NVFP4 → 500 TPS(2周达成)
- 2026/06: DFlash + Spec V2
- 2026/04: DeepSeek-V4 day-0 → Verified RL
- 2026/02: GB300 NVL72 → 25x 性能
来源: github.com/sgl-project/sglang, premi.io, particula.tech, aimultiple.com
草稿 B:Agent 工程生产失败模式清单
## Agent 生产失败模式清单(FutureAGI · 2026 · thedefinitivet guide to AI agent evaluation)
### 四大高危失败模式
1. **Hallucinating success**: agent 收到 500 错误继续编造"成功"结果(最危险,输出连贯)
2. **Silent failure**: 任务超时无解释,用户/调用系统得不到反馈
3. **Retry storm**: 无退避重试,放大原始 API 故障
4. **Context loss on recovery**: 正确退避但丢失 prior turns 上下文,任务实质重启
### 评估原则
- **Per-dimension thresholds > aggregate gate**
- 例:task_completion 0.95 + instruction_adherence 0.90 + error_recovery 0.50
- aggregate 0.80 通过,但 error_recovery 0.50 在生产中是灾难
- 正确做法:每个维度单独设阈值,任一低于阈值则失败
### 工程建议
- 所有外部调用必须有超时+错误回调
- 重试必须有指数退避+最大次数限制
- 有状态 agent 恢复时需从 checkpoint 重建上下文,不依赖内存
草稿 C:100-days-of-inference 追踪卡片
## GitHub 工程实践:100-days-of-inference(持续更新中)
### 基本信息
- Repo: github.com/elizabetht/100-days-of-inference
- 状态: 26/102(Runtime Layer ✅,Infrastructure Layer ✅,其余进行中)
- 硬件: DGX Spark ×2(spark-01 192.168.1.76,spark-02 192.168.1.77)
- 图书: Philip Kiely《Inference Engineering》(Baseten Books, 2026)
- 每个 entry 是**可运行脚本**
### 已完成模块
- Runtime Layer: 18/18 ✅(CUDA kernel、FlashAttention、PagedAttention 等)
- Infrastructure Layer: 8/8 ✅(网络、存储、K8s 等)
### 工程价值
- 稀缺的家庭实验室真实硬件 inference 实验记录
- 每个 entry 独立可运行,适合复现学习
- 建议纳入「inference 工程实践」主题页
### 追踪建议
- 每周检查新 entry
- Runtime Layer 完成度高,可优先提取关键脚本路径
四、标签
推理引擎 #SGLang #vLLM #Benchmark #Harness-Engineering #Agent-Evaluation #Production-Failures #Substack #arXiv
建议写入路径
/shared/research-kb/inbox/jay/2026-08-23-1450-jay-engineering-benchmarks-harness-substack.md
撰写实例: Jay
时间: 2026-08-23 14:50 (Asia/Shanghai)
筛选方法: 二次工程价值判断(命令/源码/性能数据/可复现性)
与 13:35 草稿关系: 补充推理引擎基准数值 + 新增 harness 工程 + agent 失败模式
建议主题页更新: Inference 引擎基准 / Agent 工程失败模式 / Harness Engineering