工程筛选报告 · 推理引擎内核 & Agent 协议工程 · 2026-08-09 19:50
实例:Jay · 角色:工程文章二次筛选(真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤)· 本轮去重:已覆盖 2026-08-09T1050 / T1505 / T1735
一、推理引擎内核 · 保留条目
🔴 保留 1|HPC-Ops × SGLang:Tencent 生产级算子集成(LMSYS Blog)
- 来源:
https://www.lmsys.org/blog/2026-08-07-hpc-ops-sglang - 作者: Tencent Hunyuan AI Infra + SGLang Team
- 发布时间: 2026-08-07
- 评级: ⭐⭐⭐⭐⭐(生产级 benchmark,含源码集成路径)
- 保留理由:
- 真实生产环境: Tencent 大规模线上推理已部署,非实验室数字
- 具体性能数字: Hy3 模型 TPOT 降低 48.8%,动态调度在混合 batch 下比 FlashInfer/FlashAttention 快 2.95×(1×128K + 31×4K 混合)
-
Benchmark 表格(latency µs):
Batch HPC-Ops SGLang vLLM Triton vLLM CUTLASS Speedup vs 最好竞品 16 85.7 88.6 124.2 209.2 1.03× 64 147.2 164.4 374.9 330.3 1.12× 256 170.1 191.5 310.9 351.6 1.13× 1024 281.4 300.5 652.7 438.3 1.07× 4096 872.0 899.2 1366.0 1230.7 1.03× 8192 1695.0 1712.7 2216.8 2362.9 1.01× -
内核亮点: Dynamic Attention(动态注意力)+ Fused MoE + Router GEMM,已合入 SGLang main branch
- 工程价值: 可直接用于 SGLang 生产部署选型参考;混合 prefix 场景(agentic 工作流典型特征)加速效果最显著(2.95×)
- 后续行动: 补充到「推理引擎 benchmark」主题页;验证 SGLang main branch 最新版是否已含此算子
🔴 保留 2|Photon 2.0:Physical AI 专用推理引擎(Moondream Blog)
- 来源:
https://moondream.ai/blog/photon-2-launch - 作者: Moondream
- 发布时间: 2026-08-03
- 评级: ⭐⭐⭐⭐(新推理范式,有实测数据)
- 保留理由:
- 差异化定位: 专为 Physical AI 场景设计(区别于通用 chat 引擎),冷启动优势明显
- 具体命令:
pip install moondream && pip install moondream(两条独立安装指令) - Benchmark(ChartQA): Photon 2.0 在所有 batch size(1/2/4/8)均优于 vLLM 和 SGLang
- Megakernel 编译策略: 整图编译为单 GPU kernel,消除 operator 间同步开销,编译器可见性跨 operator 边界
- 支持模型: Moondream 2/3、Qwen3.5/3.6(0.8B/2B/4B/9B)、Gemma 4 E2B/E4B;硬件仅 H100
- 工程价值: Physical AI / 机器人场景的推理引擎选型参考;与 vLLM/SGLang 非竞争而是补充
- 丢弃理由(反向): 目前仅支持 H100,硬件覆盖窄;但这是新方向,值得标注
- 后续行动: 列入「推理引擎选型图谱」新兴引擎条目
🔴 保留 3|C2KV:KDD 2026 · 压缩可组合 KV Cache 复用
- 来源:
https://arxiv.org/pdf/2607.17715(KDD '26, Aug 9-13, Jeju) - 发布时间: 2026-08(会议中)
- 评级: ⭐⭐⭐⭐(顶会论文 + 公开源码)
- 保留理由:
- C2Token 机制: 每个 block 对应一个 C2Token,block 内 token 可见性由因果注意力隐式强制,无需修改模型
- 跨请求复用: C2KV cache 可跨请求直接复用(系统 prompt / KV / Document 分层)
- GitHub 公开:
https://github.com/s7a9/C2KV - 工程价值: KV cache 复用是 agentic / 多轮对话场景的核心瓶颈,此工作解决的核心问题有工程落地价值
- 后续行动: 关注代码可复现性;对比 DroidSpeak、CacheBlend 等同类工作
🔴 保留 4|gpuinsights.net:vLLM vs SGLang vs TensorRT-LLM 2026 工程指南
- 来源:
https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026 - 发布时间: August 2026
- 评级: ⭐⭐⭐⭐(独立第三方,含真实 benchmark 数字)
- 保留理由:
- 关键结论: 中等并发(50 concurrent requests, H100, Llama 3.3 70B FP8),三者差距 < 14%(TensorRT-LLM 2,100 tok/s vs SGLang 1,920 vs vLLM 1,850)
- 选型建议: SGLang → prefix-heavy / 多轮 / agentic 工作流;TensorRT-LLM → 纯吞吐 + NVIDIA only;vLLM → 多硬件兼容 + 频繁更新
- 动态调度数据: 混合 batch 下 SGLang 动态调度比静态调度快 2.95×(来自 HPC-Ops 集成数据)
- 工程价值: 实际帮助做推理引擎选型决策,非 marketing 材料
- 后续行动: 补充到「推理引擎选型决策树」
🔴 保留 5|DeepInfra Blog:vLLM vs SGLang Feature Matrix(Aug 4, 2026)
- 来源:
https://deepinfra.com/blog/vllm-vs-sglang - 发布时间: 2026-08-04
- 评级: ⭐⭐⭐⭐(版本号新鲜,feature 对比清晰)
- 保留理由:
- 版本号对照: v0.25.1(2026-07-14 发布)vs SGLang v0.5.15.post1
- Feature 收敛确认: continuous batching / chunked prefill / speculative decoding / structured generation / FP8 & INT4 / tensor parallelism / multi-LoRA → 两家全有
- 架构差异: vLLM = PagedAttention KV paging;SGLang = RadixAttention prefix reuse
- Ecosystem 数字: vLLM 86,819 ★ vs SGLang 30,590 ★(差距不等于质量,用于评估社区活跃度)
- 丢弃理由: 结论与 atomic.chat / gpuinsights 重叠,但版本号新鲜
- 后续行动: 与 atomic.chat 数据合并,建立 2026 年推理引擎版本追踪表
🔴 保留 6|atomic.chat:SGLang vs vLLM 前缀缓存 benchmark
- 来源:
https://atomic.chat/blog/llm-updates/sglang-vs-vllm - 评级: ⭐⭐⭐⭐(具体 benchmark 数据,prefix-heavy 场景)
- 保留理由:
-
Prefix-heavy 场景 benchmark(高前缀复用):
指标 SGLang vLLM 差距 吞吐(tok/s) ~16,200 ~12,500 +29% TTFT 单请求 ~42 ms ~45 ms -7% TTFT 100 并发请求 ~710 ms ~740 ms -4% -
适用场景: agent 系统反复发送相同 system prompt / tool definitions / conversation context
- SGLang RadixAttention 原理: 相同前缀的 KV 状态只计算一次,支持跨请求复用
- 后续行动: 补充到「Agent 推理性能优化」页
🔴 保留 7|particula.tech:SGLang vs vLLM(含 DeepSeek 专项数据)
- 来源:
https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison - 评级: ⭐⭐⭐(DeepSeek V3 场景有独特数据)
- 保留理由:
- DeepSeek V3 专属数字: SGLang 3.1× faster than vLLM(MLA 优化:FlashAttention3 / FlashInfer / FlashMLA / CutlassMLA)
- EAGLE 投机解码: Multi-Token Prediction,batch=1 时 decode speedup 1.8×,batch=32 时 1.5× on H200
- Structured output: SGLang 在 JSON 输出场景有可测量优势
-
并发对比表(DeepSeek V3):
并发 vLLM (tok/s) SGLang (tok/s) Delta 1 120 125 ~4% 50 1,850 1,920 ~4% 100 2,400 2,460 ~2% -
后续行动: 提炼 DeepSeek 部署选型建议
🔴 保留 8|servermo.com:SGLang vs vLLM 裸机安装与 Benchmark
- 来源:
https://www.servermo.com/blogs/sglang-vs-vllm-benchmark - 更新时间: 2026-08-04
- 评级: ⭐⭐⭐(操作步骤清晰,含 SRE 视角)
- 保留理由:
- Phase 3 安全加固: "Securing the 0.0.0.0 Vulnerability"(推理引擎常见生产安全错误配置)
- Rust 调度器优势: SGLang 的 Rust router 消除 Python GIL 瓶颈,数千并发请求下 TTFT 提升 5×,VRAM 节省 80%
- SRE 实操视角: 裸机部署步骤、batch 类型选择依据(unique prompts → vLLM;multi-turn/agentic → SGLang)
- 后续行动: 提取安全加固 checklist 到「推理引擎生产安全」页
二、Agent 协议工程 · 保留条目
🔴 保留 9|Instaclustr Blog:A2A + Kafka 生产部署(三篇系列)
- 来源:
https://www.instaclustr.com/blog/scaling-agent-systems-with-kafka-and-a2a-part-3-agent2agent-protocol-explained - 发布时间: 2026-08-03
- 作者: Paul B. (Instaclustr)
- 评级: ⭐⭐⭐⭐⭐(A2A 生产部署实操,含架构图和步骤)
- 保留理由:
- A2A 核心对象模型: Agent Card / Task / Message / Part / Artifact;Artifact 生命周期在 Task 上而非独立响应类型
- Agent Card
supportedInterfaces: 支持多 binding 协商(WebSocket / MQTT / 自定义),按 preference order 选择 - Transport vs Extension 区别: Transport 改底层传输,Extension 在现有 binding 上增加行为
- 生产部署四步骤:
- Wrap existing agent → A2A-compatible server(用 framework SDK 或 ADK 处理协议细节)
- Deploy as HTTPS endpoint(container / VM / serverless + TLS + token auth)
- Publish Agent Card(描述 skills / capabilities / auth requirements)
- Discover & delegate(client 获取 card → 发结构化请求 → 跟踪 Task → 消费 Artifact)
- A2A 协议未定义内容: 部署、扩缩容、安全由实现者决定(这是设计空白也是机会)
- 后续行动: 提取 A2A 生产部署 checklist;与 Google ADK A2A codelab 合并
🔴 保留 10|ADK-Rust:A2A 生产就绪检查清单
- 来源:
https://adk-rust.com/en/a2a - 评级: ⭐⭐⭐⭐(Rust 代码示例,生产就绪清单)
- 保留理由:
- 生产就绪四步:
- Publish an honest card — 只广告部署真正支持的 skills / bindings / streaming / push delivery / security
- Choose durable state — InMemoryTaskStore 仅用于开发;长期任务需要进程重启后仍存在的存储
- Secure both directions — 双向安全
- Idempotency —
RequestHandler::with_runner显式选择 task store / push sender / Agent Card
- Rust 代码片段(RemoteA2aAgent): 可直接用于 ADK-Rust 项目集成参考
- Streaming 语义: 首条 SSE event 即完整 Task,后续 events 只携带 status 和 artifact 更新(客户端始终知道 stream 归属)
- 后续行动: 对比 ADK-Python A2A 实现差异;提取 Rust 技术栈 A2A 指南
🔴 保留 11|Google ADK A2A Codelab:Cloud Run 部署实战
- 来源:
https://codelabs.developers.google.com/adk-a2a-agent-runtime - 评级: ⭐⭐⭐⭐⭐(Google 官方 codelab,Step-by-step,可复现)
- 保留理由:
- 端到端步骤: Reservation Agent(session state 管理)→ 部署到 Gemini Enterprise Agent Platform Runtime → Foodie Finds concierge agent 通过
RemoteA2aAgent消费 Reservation Agent - Session state 管理:
ToolContext管理 reservation 数据,无需数据库 - 部署目标: Cloud Run(HTTPS endpoint)+ Agent Runtime
- 集成模式: orchestrator agent 通过 MCP Toolbox 获取菜单信息,通过 A2A 消费远程 reservation agent
- 实战价值: 展示了 MCP+A2A 双协议协作的标准模式
- 丢弃理由(反向): Google 平台绑定强,但 codelab 步骤清晰,架构模式可迁移
- 后续行动: 列入「Multi-Agent 架构模式」参考;对比 AWS / Azure A2A 托管方案
三、丢弃条目 · 丢弃理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| The AI Agents Stack 2026 Edition(The AI Engineer) | Substack | 今日 17:35 run 已覆盖;框架性文章,无新 benchmark 数据 |
| OWASP Top 10 Agents(alexewerlof) | Substack | 今日 17:35 run 已覆盖;安全条目非本轮工程筛选重点 |
| What 1000+ Job Descriptions Reveal(alexeyondata) | Substack | 行业调研,非工程实现文章 |
| awesome-harness-engineering(GitHub) | GitHub | 列表性质,无新内容增量 |
| The Hitchhiker's Guide to Agentic AI(arXiv 2606.24937) | arXiv | 新arxiv但无具体命令/banchmark数据,更多概念性 |
| Selective KV Cache Protection(arxiv 2607.29076) | arXiv | 模拟 CIM 硬件场景,工程普适性有限 |
四、分类标签
#推理引擎 #SGLang #vLLM #TensorRT-LLM #HPC-Ops #KV-Cache
#Photon2 #Megakernel #PhysicalAI #C2KV #KDD2026
#Agent协议 #A2A #MCP #Google-ADK #ADK-Rust
#Kafka #CloudRun #Gemini-Enterprise-Agent-Platform
#Benchmark #TPOT #TTFT #RadixAttention #PagedAttention
#EAGLE-Speculative-Decoding #DeepSeek-V3 #MLA
#生产部署 #多协议协作 #Multi-Agent
五、建议写入路径
| 条目 | 建议路径 | 行动 |
|---|---|---|
| HPC-Ops × SGLang | inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md |
本文即为草稿 |
| 推理引擎 benchmark 汇总 | review/inference-engines/benchmark-matrix-2026.md |
后续合并到主题页 |
| A2A 生产部署指南 | review/multi-agent/a2a-production-deployment-guide.md |
后续合并到主题页 |
| C2KV 源码 | review/kv-cache/C2KV-kdd2026-analysis.md |
独立细读笔记 |
六、本轮总结
本轮主题: 推理引擎内核 benchmark + Agent 协议工程部署
高价值条目: 11 条保留 / 6 条丢弃
最值得精读: 1. HPC-Ops × SGLang 全文(含 benchmark 表格和集成路径) 2. Google ADK A2A Codelab(可复现步骤) 3. Instaclustr A2A + Kafka 部署四步(生产 checklist)
是否需要主题页更新: ✅ 是 - 「推理引擎选型 2026」主题页 → 补充 HPC-Ops 数据、DeepSeek V3 专属数字 - 「Multi-Agent 架构」主题页 → 补充 A2A 生产部署 checklist(ADK-Rust + Google ADK)
Jay · 2026-08-09 19:50 · 工程筛选第三轮(晚间)