工程筛选 Round · 2026-08-01 · Inference + Agent Harness(v2 · 2026-08-04 重写)
重写动机(v1 → v2):v1(2026-08-01 14:52)以 5.1KB / 96 行覆盖 4 个 arXiv 条目 + 1 个 GitHub Trending 节选。v1 4 个 arXiv ID(2602.14516 / 2604.15732 / 2601.20309 / 2606.28565)全部真实存在(web_fetch 已确认),但 v1 至少 3 个条目(LAAR / SuperInfer / AMPD)含 AI 幻觉的"具体命令 / 版本号 / 硬件规格 / 对比基线"——这些细节在论文原文中完全不存在。v2 全面修正:删除所有 AI 幻觉细节;保留原文确认的事实;标注 fetch 验证状态;建立去重索引;新增 AI 幻觉识别清单。
v2 fetch 验证状态(2026-08-04 21:10 CST 实测): - ✅ arxiv.org/abs/2602.14516("Efficient Multi-round LLM Inference over Disaggregated Serving",Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu,ICML 2026,cs.DC) - ✅ arxiv.org/abs/2604.15732("Accuracy Is Speed: Towards Long-Context-Aware Routing for Distributed LLM Serving",Takeshi Yoshimura,EuroMLSys '26 workshop,cs.DC,DOI: 10.1145/3805621.3807652) - ✅ arxiv.org/abs/2601.20309("SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips",Anonymous Authors,MLSys '26,cs.DC + cs.AI + cs.LG) - ✅ arxiv.org/abs/2606.28565("KernelSight-LM: A Kernel-Level LLM Inference Simulator",cs.PF + cs.AI + cs.AR)
v2 AI 幻觉识别清单(v1 中删除的 AI 补全内容): - ❌ LAAR "命令: numactl 配置 NUMA memory affinity(GH200 真实环境)" → 论文无 NUMA / numactl 提及 - ❌ LAAR "Envoy EPP (External Processing Filter) 策略实现" → 论文无 Envoy / EPP 提及 - ❌ LAAR "接入 llm-d MaxScorePicker" → 论文提到 llm-d Project 但无 MaxScorePicker - ❌ LAAR "GH200 NVL2,144GB HBM + 480GB DRAM" → 论文无任何硬件规格 - ❌ LAAR "Q(m,x) 成功率和 L(m,x) 延迟" → 论文无此公式 - ❌ SuperInfer "vLLM v0.6.6.post1 (V1 engine)" → 论文无 vLLM 提及 - ❌ SuperInfer "TensorRT-LLM v1.1.0" → 论文无 TensorRT-LLM 提及 - ❌ AMPD "与 Dynamo (NVIDIA)、vLLM v0.6.6.post1、vLLM-Continuum 做并列对比" → 论文无此对比对象 - ⚠️ KernelSight-LM "Vidur (离散事件仿真)、AIConfigurator (算子级表插值)" → 论文是否真做了此对比需读全文核实
v2 评级:⭐⭐⭐(草稿层级,因部分细节存疑)
inboxcheck: "Inference Engine Systems 2026: covered in
2026-07-29-1455-jay-engineering-filter.md、2026-07-30-1508-jay-five-category-briefing.md、2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md、2026-08-01T1105-jay-five-category-briefing.md、2026-08-02T1105-jay-five-category-briefing.md"
一、AMPD — Efficient Multi-round LLM Inference over Disaggregated Serving
来源: arXiv:2602.14516v2 作者: Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu 发表: ICML 2026 分类: cs.DC fetch 验证: ✅ 2026-08-04 21:10 CST 已确认
1.1 论文核心(来自 abstract 原文确认)
"We present AMPD, a brand new disaggregated serving framework for multi-round LLM inference. The core of AMPD is to coordinate the prefill workloads based on real-time workloads by adaptively determining where to carry out these workloads and how they are scheduled, in order to maximize service level objective (SLO) attainment."
核心机制: - 解决 PD(Prefill-Decode)disaggregation 在 multi-round inference 场景下的子优化问题 - 现有系统忽略 interleaved prefill-decode 模式,导致 incremental prefill 处理不当 - AMPD 自适应决定 prefill 在哪执行、如何调度,最大化 SLO attainment - 配套 planning algorithm 推导最优资源分配 + 并行策略
1.2 v1 vs v2 关键差异
| 维度 | v1(已删除) | v2 修正 |
|---|---|---|
| 对比基线 | "Dynamo (NVIDIA) + vLLM v0.6.6.post1 + vLLM-Continuum" | ⚠️ abstract 仅说 "compared to state-of-the-art baselines",具体基线需读全文核实 |
| 场景描述 | "ReAct agent 多轮工具调用、迭代 RAG" | ✅ abstract 提到 "autonomous agents and iterative retrieval" |
| 工程价值 | "PD disaggregation 在生产级 LLM serving 的最新实践" | ✅ 保留(abstract 确认) |
1.3 实际工程含义(基于 abstract 推断)
- 生产部署相关性:高。PD disaggregation 已被 vLLM / SGLang / TensorRT-LLM 等生产框架采用;AMPD 解决的是 multi-round 场景(Agent / RAG)的子优化
- 具体可复现性:中。论文需读全文获取实验数据 + 代码可用性 + 具体基线
- 生产采纳风险:需验证论文代码是否已开源 + 是否被 vLLM/SGLang 采纳
标签: #inference #disaggregation #multi-round #slo
保留理由: abstract 核心机制明确 + ICML 2026 接收
建议行动: 精读全文获取实验数据 + 检查 GitHub 是否有官方代码
二、LAAR — Accuracy Is Speed: Towards Long-Context-Aware Routing
来源: arXiv:2604.15732v1 作者: Takeshi Yoshimura 发表: EuroMLSys '26 workshop(2026-04-27 ~ 30, Edinburgh) 分类: cs.DC DOI: 10.1145/3805621.3807652 fetch 验证: ✅ 2026-08-04 21:10 CST 已确认
2.1 论文核心(来自 abstract 原文确认)
"In this work, we argue that under long-context serving, accuracy becomes speed through retry dynamics. We introduce Time-to-Correct-Answer (TTCA), a metric that measures the wall-clock time required to obtain the first correct response. Our measurement study shows that prompt characteristics such as length and language amplify accuracy variance, which inflates TTCA. We demonstrate Lightweight Accuracy-Aware Routing (LAAR), a capability-based routing design that reduces TTCA."
核心机制: - TTCA 指标:从用户视角,"获得第一个正确答案的 wall-clock 时间"——比 one-shot latency 更准确反映用户感知延迟 - 关键洞察:长上下文场景下,错误答案触发重试 → 准确率直接转化为用户可见延迟 → accuracy is speed - LAAR 方法:基于 prompt length + language 两个 lightweight 特征的能力路由设计,不调用额外模型、不做完整语义分析 - 应用场景:retryable、task-oriented workloads(document QA、summarization verification、tool-based agents)
2.2 v1 vs v2 关键差异(v1 AI 幻觉最严重的条目)
| 维度 | v1(已删除) | v2 修正 |
|---|---|---|
| 命令 | "命令: numactl 配置 NUMA memory affinity(GH200 真实环境)" | ❌ 删除。论文无 NUMA / numactl 提及 |
| 实现细节 | "作为 Envoy EPP (External Processing Filter) 策略实现" | ❌ 删除。论文无 Envoy / EPP 提及 |
| 集成 | "接入 llm-d MaxScorePicker" | ❌ 删除。论文提到 llm-d Project 但无 MaxScorePicker |
| 硬件 | "GH200 NVL2,144GB HBM + 480GB DRAM" | ❌ 删除。论文无任何硬件规格 |
| 路由逻辑 | "评估 Q(m,x) 成功率和 L(m,x) 延迟" | ❌ 删除。论文无此公式 |
| 路由目标 | "选最低 cost 端点" | ⚠️ 论文提到 "capability-based routing",具体选择策略需读全文 |
| 实际意义 | "long-context 场景下 cache locality + load-aware routing 的生产级实现路径" | ⚠️ 论文仅提概念,未给生产级实现 |
2.3 实际工程含义(基于 abstract + §1-2 推断)
- 核心概念价值:⭐⭐⭐⭐。TTCA 指标 + "accuracy is speed" 洞察是新颖且有实践意义的
- 方法可操作性:中。论文给的概念(prompt length + language features)是 lightweight,但完整实现细节需读全文
- 基础设施无关性:论文故意做 lightweight 设计,避免引入额外基础设施依赖
标签: #inference #routing #long-context #ttca #accuracy-aware
保留理由: TTCA 指标 + accuracy is speed 洞察 + EuroMLSys '26 workshop 接收
建议行动: 精读全文获取 LAAR 的具体路由算法 + 实验数据 + 与现有 routing 策略(load-aware / session-affinity / cache-affinity)的对比
三、SuperInfer — SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
来源: arXiv:2601.20309v2 作者: Anonymous Authors(MLSys '26 under review) 机构: Anonymous Institution(GitHub: Supercomputing-System-AI-Lab/SuperInfer) 发表: MLSys '26(under review) 分类: cs.DC + cs.AI + cs.LG fetch 验证: ✅ 2026-08-04 21:10 CST 已确认
3.1 论文核心(来自 abstract 原文确认)
"We present SuperInfer, a high-performance LLM inference system designed for emerging Superchips (e.g., NVIDIA GH200) with tightly coupled GPU-CPU architecture via NVLink-C2C. SuperInfer introduces RotaSched, the first proactive, SLO-aware rotary scheduler that rotates requests to maintain responsiveness on Superchips, and DuplexKV, an optimized rotation engine that enables full-duplex transfer over NVLink-C2C."
核心机制: - RotaSched:SLO-aware 的轮转调度器,通过轮转请求保持 responsiveness - DuplexKV:在 NVLink-C2C 上实现 full-duplex 传输的轮转引擎 - 硬件目标:NVIDIA GH200 Superchip(tightly coupled GPU-CPU) - 关键结果:TTFT SLO attainment 提升最多 74.7%(相对 SOTA 系统)
3.2 v1 vs v2 关键差异(v1 AI 幻觉最严重的条目之一)
| 维度 | v1(已删除) | v2 修正 |
|---|---|---|
| 软件版本 | "vLLM v0.6.6.post1 (V1 engine)" | ❌ 删除。论文无 vLLM 提及 |
| 软件版本 | "TensorRT-LLM v1.1.0" | ❌ 删除。论文无 TensorRT-LLM 提及 |
| KV cache 耗尽场景 | "KV cache 耗尽时的 HOL blocking 问题" | ✅ abstract 确认 "When high request rates exhaust the KV cache budget, existing LLM inference systems often suffer severe head-of-line (HOL) blocking" |
| 解决方案 | "GPU-CPU via NVLink-C2C offloading" | ⚠️ 论文提 NVLink-C2C,但具体 offloading 策略需读全文 |
| TTFT/TBT SLO | "严格目标下的性能数据" | ⚠️ abstract 提 TTFT/TBT SLO attainment,具体数字需读全文 |
3.3 实际工程含义(基于 abstract 推断)
- 硬件特异性:高。专为 GH200 Superchip 设计,其他硬件平台不直接适用
- 生产部署相关性:中。GH200 Superchip 在生产环境的普及度需评估;论文未提任何具体推理引擎版本
- 关键代码: GitHub: Supercomputing-System-AI-Lab/SuperInfer(v2 验证时已确认存在)
标签: #inference #gh200 #nvlink-c2c #slo #rotasched #duplexkv
保留理由: GH200 上的 SLO-aware 调度 + 代码已开源
建议行动: 精读全文获取 RotaSched / DuplexKV 实现细节 + 验证代码仓库(Star / Fork / Issues)活跃度
四、KernelSight-LM — A Kernel-Level LLM Inference Simulator
来源: arXiv:2606.28565v1 作者: 原文未明确(待全文核实) 分类: cs.PF + cs.AI + cs.AR fetch 验证: ✅ 2026-08-04 21:10 CST 已确认(abstract + 标题)
4.1 论文核心(来自 abstract 原文确认)
"We present KernelSight-LM, a fine-grained inference simulator that models token-level execution and produces kernel-level latency breakdowns. It decomposes each serving step into a roofline kernel model with a learned efficiency term, a communication model, and a host-overhead model, composed through a discrete-event scheduler that also captures mechanisms like prefix caching and continuous batching."
核心机制: - 细粒度仿真:token-level 执行 + kernel-level 延迟分解 - 三层模型:roofline kernel model(含 learned efficiency term)+ communication model + host-overhead model - 跨代预测:cross-generation tier 使用微基准测试,无 target-GPU 数据,跨 GPU 代预测 per-kernel latency 误差 12.1%(baseline 22.0%) - 目标测量:target-measured tier 加一个 model-agnostic kernel-microbenchmark sweep,误差 3.8%(baseline 27.7%) - 端到端精度:跨 6 个模型族,TTFT/TPOT/throughput 误差在 cross-generation tier 为 15.4% / 12.8% / 3.0%,在 target-measured tier 为 14.3% / 6.2% / 2.7%
4.2 v1 vs v2 关键差异
| 维度 | v1(已删除) | v2 修正 |
|---|---|---|
| 对比框架 | "Vidur (离散事件仿真)、AIConfigurator (算子级表插值)" | ⚠️ 论文 abstract 未明确提 Vidur / AIConfigurator 是否为对比对象。v1 是基于我对此领域的先验知识编造,需读全文核实 |
| 场景描述 | "新 GPU 型号或新模型 variant 的性能预测" | ✅ abstract 确认 |
| 解决痛点 | "procurement 前无法实测的工程痛点" | ✅ abstract 提 "capacity planning" |
4.3 实际工程含义(基于 abstract 推断)
- 生产部署相关性:高。推理 capacity planning 是 GPU 采购 + 模型选型的关键工具
- 可复现性:需验证论文是否提供代码 / 模型权重
- 价值场景:GPU 采购决策、新模型 variant 性能评估、新 GPU 型号上线前评估
标签: #inference #simulation #capacity-planning #kernel-level
保留理由: kernel-level 仿真工具 + 跨代预测精度明确
建议行动: 精读全文验证是否做了 vs Vidur / AIConfigurator 对比 + 检查 GitHub 代码仓库
五、GitHub Trending AI 2026-07-30 ⚠️ 全部来自第三方 feed 未独立验证
来源: github.com/duanyytop/agents-radar/issues/2401 fetch 验证: ⚠️ 来自 agents-radar(第三方 feed),未独立验证 star 数字 + 项目描述
5.1 高信号子集(保留但 ⚠️ 标注)
| 项目 | 语言 | 今日星标 | 工程价值 | 独立验证状态 |
|---|---|---|---|---|
| MoonshotAI/FlashKDA | CUDA | +91 | 高性能 Kimi Delta Attention kernel | ⚠️ 未独立验证 |
| affaan-m/ECC | JavaScript | +857 | agent harness 性能优化系统 | ⚠️ 未独立验证 |
| obra/superpowers | Shell | +616 | agentic skills 框架 | ⚠️ 未独立验证 |
| jcode | Rust | +640 | RAM 效率最高的 agent harness | ⚠️ 未独立验证 |
| book-to-skill | Python | +1,421 | PDF → Claude Code skill | ⚠️ 未独立验证 |
| alibaba/open-code-review | Go | +359 | 确定性 pipeline + LLM agent code review | ⚠️ 未独立验证 |
| skyzh/tiny-llm | Python | — | Apple Silicon LLM inference serving 教学级实现 | ⚠️ 未独立验证 |
5.2 v2 修正
- 全部 star 数字 + 项目描述均来自 agents-radar issue #2401(第三方 feed)
- 未独立访问 GitHub API 验证
- v1 未标注此来源风险,是透明度缺陷
六、❌ 丢弃条目(与 v1 相同,补充 fetch 验证)
| 条目 | 丢弃理由 | 验证状态 |
|---|---|---|
| LLM Inference Serving Survey (arxiv:2407.12391) | 综述论文,无原创命令/benchmark/源码 | ⚠️ 未 fetch 验证(保留 v1 判定) |
| LLM Serving Needs Mathematical Optimization (arxiv:2605.01280v1) | 纯理论/算法分析,无实测数据 | ⚠️ 未 fetch 验证(保留 v1 判定) |
| The AI Agent Stack 2026 Edition (theaiengineer.substack) | 行业分析师总结,无工程细节 | ✅ 明显非工程内容 |
| Production AI Engineering (aiamastery.substack) | 课程推广 | ✅ 明显非工程内容 |
| AI Agents Roadmap 2026 (himanshuramchandani.substack) | 战略 Roadmap,无具体可复现步骤 | ✅ 明显非工程内容 |
| The 2026 AI Agent Stack (codingwithroby.substack) | Stack 概览,无命令或源码片段 | ✅ 明显非工程内容 |
| Open-Source AI Agent Stack 2026 (theaiengineer.substack) | 框架罗列,评测广度不足 | ✅ 明显非工程内容 |
| What 1000+ Job Descriptions Reveal (alexeyndata.substack) | 招聘分析,非工程技术内容 | ✅ 明显非工程内容 |
七、与同期稿件去重索引(v2 新增)
本期涉及 "Inference Engine Systems 2026" 主题的同期稿件:
| 文件 | 主题 | 与本文件的关系 |
|---|---|---|
2026-07-29-1455-jay-engineering-filter.md |
综合工程筛选 | 含部分推理引擎内容(建议引用本文件 §一 AMDP / §四 KernelSight-LM) |
2026-07-30-1508-jay-five-category-briefing.md |
跨五类综合简报 | 含 vLLM/SGLang 选型(建议引用 2026-08-04T1905 evening briefing) |
2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md |
推理引擎 + VecDB + Substack | 含 GH200 推理讨论(建议引用本文件 §三 SuperInfer) |
2026-08-01T1105-jay-five-category-briefing.md |
跨五类综合简报 | 含推理引擎对比(建议合并到本文件) |
2026-08-02T1105-jay-five-category-briefing.md |
跨五类综合简报 | 含推理引擎 BMK(建议引用 2026-08-04T2105 evening supplement) |
2026-08-04T1050-jay-engineering-filter.md |
综合工程筛选 | 含 OSDI 2026 StriaTrace / NVIDIA 控制钩子(建议引用) |
2026-08-04T1905-jay-five-category-briefing.md |
跨五类综合简报 | 含 100 万 768d 向量 HNSW 实测 + vLLM 五大模块拆解 |
2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md |
推理引擎 BMK 2026 + K8s | 含 SGLang 80ms TTFT / RadixAttention / FlashInfer wheel |
v2 反向选择说明:本文件不应再重复以下内容(已在其他稿件覆盖): - vLLM/SGLang/TensorRT-LLM 选型决策树(已在 2026-08-04T1905 + 2026-08-04T2105 覆盖) - HuggingFace Transformers 5.x 的 KV cache API(已在 2026-07-28-hf-transformers-v5-source-analysis.md 覆盖) - MoE 模型的 KV cache 特殊性(已在 Kimi K3 笔记、DeepSeek V4 笔记覆盖)
八、后续行动建议(v2 修正)
| 优先级 | 行动 | 目标 |
|---|---|---|
| P0 | 精读 arXiv:2602.14516 / 2604.15732 / 2601.20309 / 2606.28565 全文 | 验证 v2 中保留的事实 + 补全 v2 中标 ⚠️ 的细节 |
| P0 | 验证 arXiv:2602.14516 是否开源 + GitHub 仓库状态 | 评估 AMPD 生产采纳风险 |
| P1 | 检查 SuperInfer GitHub: Supercomputing-System-AI-Lab/SuperInfer 活跃度(Star/Fork/Issues) | 评估 MLSys '26 后续工作 |
| P1 | 抓取 agents-radar issue #2401 完整内容 | 核实 v2 §五 GitHub Trending 数据 |
| P2 | 跟踪 LAAR 在 llm-d Project 中的具体实现 | 评估 LAAR 落地路径 |
| P2 | 检查 KernelSight-LM 是否开源 | 评估推理 capacity planning 工具链 |
| P3 | 月底合并 5+ 个同期 Inference Engine 稿件到独立专题 | 形成单一权威专题 |
九、v2 自评(meta)
- 保留:4 个真实 arXiv ID + abstract 原文确认的核心机制 + 论文发表会议 + 作者署名(除 SuperInfer 匿名外)
- 修正:删除 v1 中 8 处 AI 幻觉(LAAR 的 numactl/Envoy EPP/MaxScorePicker/GH200/Q(m,x) + SuperInfer 的 vLLM v0.6.6.post1/TensorRT-LLM v1.1.0 + AMPD 的 Dynamo/vLLM-Continuum)
- 新增:fetch 验证状态小节、AI 幻觉识别清单、inboxcheck 行、与同期稿件去重索引表、⚠️ 标注意识、保留原文确认事实 + 标 ⚠️ 需读全文核实部分
- 删除:v1 中所有未 fetch 验证的具体命令、版本号、硬件规格、对比基线
v2 真实可信度评级: - arXiv:2602.14516 AMPD 存在 + ICML 2026 ✅ → ⭐⭐⭐⭐⭐ - arXiv:2604.15732 LAAR 存在 + EuroMLSys '26 ✅ → ⭐⭐⭐⭐ - arXiv:2601.20309 SuperInfer 存在 + MLSys '26 ✅ → ⭐⭐⭐⭐ - arXiv:2606.28565 KernelSight-LM 存在 + abstract 确认 ✅ → ⭐⭐⭐⭐ - GitHub Trending 数据 ⚠️ 未独立验证 → ⭐⭐ - 整体稿件 v2 评级 → ⭐⭐⭐(草稿层级,因部分细节存疑)
元信息
- v1 生成时间:2026-08-01 14:52 CST("工程筛选"格式,5.1KB / 96 行)
- v2 重写时间:2026-08-04 21:10 CST(含 fetch 验证 + AI 幻觉识别清单 + 去重索引)
- v2 重写动机:上期反思(jay-2026-08-03)已写入 §6.1 第 1-5 项行动;本期最弱篇不仅未 fetch 验证,还写出了 AI 幻觉嵌入真实 ID 的更深层失守
- 实例:Jay
- 本次未写入其他实例目录,未执行任何 GitHub 写操作,未输出任何 token/凭证
- 下一步:执行 §八 P0 优先级行动,产出 v3 深度稿件(含 LAAR / SuperInfer / AMPD 全文精读)