工程筛选报告 · 推理引擎内核 & Agent 协议工程 · 2026-08-09 19:50

实例:Jay · 角色:工程文章二次筛选(真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤)· 本轮去重:已覆盖 2026-08-09T1050 / T1505 / T1735


一、推理引擎内核 · 保留条目

🔴 保留 1|HPC-Ops × SGLang:Tencent 生产级算子集成(LMSYS Blog)

  • 来源: https://www.lmsys.org/blog/2026-08-07-hpc-ops-sglang
  • 作者: Tencent Hunyuan AI Infra + SGLang Team
  • 发布时间: 2026-08-07
  • 评级: ⭐⭐⭐⭐⭐(生产级 benchmark,含源码集成路径)
  • 保留理由:
  • 真实生产环境: Tencent 大规模线上推理已部署,非实验室数字
  • 具体性能数字: Hy3 模型 TPOT 降低 48.8%,动态调度在混合 batch 下比 FlashInfer/FlashAttention 快 2.95×(1×128K + 31×4K 混合)
  • Benchmark 表格(latency µs):

    Batch HPC-Ops SGLang vLLM Triton vLLM CUTLASS Speedup vs 最好竞品
    16 85.7 88.6 124.2 209.2 1.03×
    64 147.2 164.4 374.9 330.3 1.12×
    256 170.1 191.5 310.9 351.6 1.13×
    1024 281.4 300.5 652.7 438.3 1.07×
    4096 872.0 899.2 1366.0 1230.7 1.03×
    8192 1695.0 1712.7 2216.8 2362.9 1.01×
  • 内核亮点: Dynamic Attention(动态注意力)+ Fused MoE + Router GEMM,已合入 SGLang main branch

  • 工程价值: 可直接用于 SGLang 生产部署选型参考;混合 prefix 场景(agentic 工作流典型特征)加速效果最显著(2.95×)
  • 后续行动: 补充到「推理引擎 benchmark」主题页;验证 SGLang main branch 最新版是否已含此算子

🔴 保留 2|Photon 2.0:Physical AI 专用推理引擎(Moondream Blog)

  • 来源: https://moondream.ai/blog/photon-2-launch
  • 作者: Moondream
  • 发布时间: 2026-08-03
  • 评级: ⭐⭐⭐⭐(新推理范式,有实测数据)
  • 保留理由:
  • 差异化定位: 专为 Physical AI 场景设计(区别于通用 chat 引擎),冷启动优势明显
  • 具体命令: pip install moondream && pip install moondream(两条独立安装指令)
  • Benchmark(ChartQA): Photon 2.0 在所有 batch size(1/2/4/8)均优于 vLLM 和 SGLang
  • Megakernel 编译策略: 整图编译为单 GPU kernel,消除 operator 间同步开销,编译器可见性跨 operator 边界
  • 支持模型: Moondream 2/3、Qwen3.5/3.6(0.8B/2B/4B/9B)、Gemma 4 E2B/E4B;硬件仅 H100
  • 工程价值: Physical AI / 机器人场景的推理引擎选型参考;与 vLLM/SGLang 非竞争而是补充
  • 丢弃理由(反向): 目前仅支持 H100,硬件覆盖窄;但这是新方向,值得标注
  • 后续行动: 列入「推理引擎选型图谱」新兴引擎条目

🔴 保留 3|C2KV:KDD 2026 · 压缩可组合 KV Cache 复用

  • 来源: https://arxiv.org/pdf/2607.17715(KDD '26, Aug 9-13, Jeju)
  • 发布时间: 2026-08(会议中)
  • 评级: ⭐⭐⭐⭐(顶会论文 + 公开源码)
  • 保留理由:
  • C2Token 机制: 每个 block 对应一个 C2Token,block 内 token 可见性由因果注意力隐式强制,无需修改模型
  • 跨请求复用: C2KV cache 可跨请求直接复用(系统 prompt / KV / Document 分层)
  • GitHub 公开: https://github.com/s7a9/C2KV
  • 工程价值: KV cache 复用是 agentic / 多轮对话场景的核心瓶颈,此工作解决的核心问题有工程落地价值
  • 后续行动: 关注代码可复现性;对比 DroidSpeak、CacheBlend 等同类工作

🔴 保留 4|gpuinsights.net:vLLM vs SGLang vs TensorRT-LLM 2026 工程指南

  • 来源: https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026
  • 发布时间: August 2026
  • 评级: ⭐⭐⭐⭐(独立第三方,含真实 benchmark 数字)
  • 保留理由:
  • 关键结论: 中等并发(50 concurrent requests, H100, Llama 3.3 70B FP8),三者差距 < 14%(TensorRT-LLM 2,100 tok/s vs SGLang 1,920 vs vLLM 1,850)
  • 选型建议: SGLang → prefix-heavy / 多轮 / agentic 工作流;TensorRT-LLM → 纯吞吐 + NVIDIA only;vLLM → 多硬件兼容 + 频繁更新
  • 动态调度数据: 混合 batch 下 SGLang 动态调度比静态调度快 2.95×(来自 HPC-Ops 集成数据)
  • 工程价值: 实际帮助做推理引擎选型决策,非 marketing 材料
  • 后续行动: 补充到「推理引擎选型决策树」

🔴 保留 5|DeepInfra Blog:vLLM vs SGLang Feature Matrix(Aug 4, 2026)

  • 来源: https://deepinfra.com/blog/vllm-vs-sglang
  • 发布时间: 2026-08-04
  • 评级: ⭐⭐⭐⭐(版本号新鲜,feature 对比清晰)
  • 保留理由:
  • 版本号对照: v0.25.1(2026-07-14 发布)vs SGLang v0.5.15.post1
  • Feature 收敛确认: continuous batching / chunked prefill / speculative decoding / structured generation / FP8 & INT4 / tensor parallelism / multi-LoRA → 两家全有
  • 架构差异: vLLM = PagedAttention KV paging;SGLang = RadixAttention prefix reuse
  • Ecosystem 数字: vLLM 86,819 ★ vs SGLang 30,590 ★(差距不等于质量,用于评估社区活跃度)
  • 丢弃理由: 结论与 atomic.chat / gpuinsights 重叠,但版本号新鲜
  • 后续行动: 与 atomic.chat 数据合并,建立 2026 年推理引擎版本追踪表

🔴 保留 6|atomic.chat:SGLang vs vLLM 前缀缓存 benchmark

  • 来源: https://atomic.chat/blog/llm-updates/sglang-vs-vllm
  • 评级: ⭐⭐⭐⭐(具体 benchmark 数据,prefix-heavy 场景)
  • 保留理由:
  • Prefix-heavy 场景 benchmark(高前缀复用):

    指标 SGLang vLLM 差距
    吞吐(tok/s) ~16,200 ~12,500 +29%
    TTFT 单请求 ~42 ms ~45 ms -7%
    TTFT 100 并发请求 ~710 ms ~740 ms -4%
  • 适用场景: agent 系统反复发送相同 system prompt / tool definitions / conversation context

  • SGLang RadixAttention 原理: 相同前缀的 KV 状态只计算一次,支持跨请求复用
  • 后续行动: 补充到「Agent 推理性能优化」页

🔴 保留 7|particula.tech:SGLang vs vLLM(含 DeepSeek 专项数据)

  • 来源: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
  • 评级: ⭐⭐⭐(DeepSeek V3 场景有独特数据)
  • 保留理由:
  • DeepSeek V3 专属数字: SGLang 3.1× faster than vLLM(MLA 优化:FlashAttention3 / FlashInfer / FlashMLA / CutlassMLA)
  • EAGLE 投机解码: Multi-Token Prediction,batch=1 时 decode speedup 1.8×,batch=32 时 1.5× on H200
  • Structured output: SGLang 在 JSON 输出场景有可测量优势
  • 并发对比表(DeepSeek V3):

    并发 vLLM (tok/s) SGLang (tok/s) Delta
    1 120 125 ~4%
    50 1,850 1,920 ~4%
    100 2,400 2,460 ~2%
  • 后续行动: 提炼 DeepSeek 部署选型建议


🔴 保留 8|servermo.com:SGLang vs vLLM 裸机安装与 Benchmark

  • 来源: https://www.servermo.com/blogs/sglang-vs-vllm-benchmark
  • 更新时间: 2026-08-04
  • 评级: ⭐⭐⭐(操作步骤清晰,含 SRE 视角)
  • 保留理由:
  • Phase 3 安全加固: "Securing the 0.0.0.0 Vulnerability"(推理引擎常见生产安全错误配置)
  • Rust 调度器优势: SGLang 的 Rust router 消除 Python GIL 瓶颈,数千并发请求下 TTFT 提升 5×,VRAM 节省 80%
  • SRE 实操视角: 裸机部署步骤、batch 类型选择依据(unique prompts → vLLM;multi-turn/agentic → SGLang)
  • 后续行动: 提取安全加固 checklist 到「推理引擎生产安全」页

二、Agent 协议工程 · 保留条目

🔴 保留 9|Instaclustr Blog:A2A + Kafka 生产部署(三篇系列)

  • 来源: https://www.instaclustr.com/blog/scaling-agent-systems-with-kafka-and-a2a-part-3-agent2agent-protocol-explained
  • 发布时间: 2026-08-03
  • 作者: Paul B. (Instaclustr)
  • 评级: ⭐⭐⭐⭐⭐(A2A 生产部署实操,含架构图和步骤)
  • 保留理由:
  • A2A 核心对象模型: Agent Card / Task / Message / Part / Artifact;Artifact 生命周期在 Task 上而非独立响应类型
  • Agent Card supportedInterfaces 支持多 binding 协商(WebSocket / MQTT / 自定义),按 preference order 选择
  • Transport vs Extension 区别: Transport 改底层传输,Extension 在现有 binding 上增加行为
  • 生产部署四步骤:
    1. Wrap existing agent → A2A-compatible server(用 framework SDK 或 ADK 处理协议细节)
    2. Deploy as HTTPS endpoint(container / VM / serverless + TLS + token auth)
    3. Publish Agent Card(描述 skills / capabilities / auth requirements)
    4. Discover & delegate(client 获取 card → 发结构化请求 → 跟踪 Task → 消费 Artifact)
  • A2A 协议未定义内容: 部署、扩缩容、安全由实现者决定(这是设计空白也是机会)
  • 后续行动: 提取 A2A 生产部署 checklist;与 Google ADK A2A codelab 合并

🔴 保留 10|ADK-Rust:A2A 生产就绪检查清单

  • 来源: https://adk-rust.com/en/a2a
  • 评级: ⭐⭐⭐⭐(Rust 代码示例,生产就绪清单)
  • 保留理由:
  • 生产就绪四步:
    1. Publish an honest card — 只广告部署真正支持的 skills / bindings / streaming / push delivery / security
    2. Choose durable state — InMemoryTaskStore 仅用于开发;长期任务需要进程重启后仍存在的存储
    3. Secure both directions — 双向安全
    4. IdempotencyRequestHandler::with_runner 显式选择 task store / push sender / Agent Card
  • Rust 代码片段(RemoteA2aAgent): 可直接用于 ADK-Rust 项目集成参考
  • Streaming 语义: 首条 SSE event 即完整 Task,后续 events 只携带 status 和 artifact 更新(客户端始终知道 stream 归属)
  • 后续行动: 对比 ADK-Python A2A 实现差异;提取 Rust 技术栈 A2A 指南

🔴 保留 11|Google ADK A2A Codelab:Cloud Run 部署实战

  • 来源: https://codelabs.developers.google.com/adk-a2a-agent-runtime
  • 评级: ⭐⭐⭐⭐⭐(Google 官方 codelab,Step-by-step,可复现)
  • 保留理由:
  • 端到端步骤: Reservation Agent(session state 管理)→ 部署到 Gemini Enterprise Agent Platform Runtime → Foodie Finds concierge agent 通过 RemoteA2aAgent 消费 Reservation Agent
  • Session state 管理: ToolContext 管理 reservation 数据,无需数据库
  • 部署目标: Cloud Run(HTTPS endpoint)+ Agent Runtime
  • 集成模式: orchestrator agent 通过 MCP Toolbox 获取菜单信息,通过 A2A 消费远程 reservation agent
  • 实战价值: 展示了 MCP+A2A 双协议协作的标准模式
  • 丢弃理由(反向): Google 平台绑定强,但 codelab 步骤清晰,架构模式可迁移
  • 后续行动: 列入「Multi-Agent 架构模式」参考;对比 AWS / Azure A2A 托管方案

三、丢弃条目 · 丢弃理由

条目 来源 丢弃理由
The AI Agents Stack 2026 Edition(The AI Engineer) Substack 今日 17:35 run 已覆盖;框架性文章,无新 benchmark 数据
OWASP Top 10 Agents(alexewerlof) Substack 今日 17:35 run 已覆盖;安全条目非本轮工程筛选重点
What 1000+ Job Descriptions Reveal(alexeyondata) Substack 行业调研,非工程实现文章
awesome-harness-engineering(GitHub) GitHub 列表性质,无新内容增量
The Hitchhiker's Guide to Agentic AI(arXiv 2606.24937) arXiv 新arxiv但无具体命令/banchmark数据,更多概念性
Selective KV Cache Protection(arxiv 2607.29076) arXiv 模拟 CIM 硬件场景,工程普适性有限

四、分类标签

#推理引擎 #SGLang #vLLM #TensorRT-LLM #HPC-Ops #KV-Cache
#Photon2 #Megakernel #PhysicalAI #C2KV #KDD2026
#Agent协议 #A2A #MCP #Google-ADK #ADK-Rust
#Kafka #CloudRun #Gemini-Enterprise-Agent-Platform
#Benchmark #TPOT #TTFT #RadixAttention #PagedAttention
#EAGLE-Speculative-Decoding #DeepSeek-V3 #MLA
#生产部署 #多协议协作 #Multi-Agent

五、建议写入路径

条目 建议路径 行动
HPC-Ops × SGLang inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md 本文即为草稿
推理引擎 benchmark 汇总 review/inference-engines/benchmark-matrix-2026.md 后续合并到主题页
A2A 生产部署指南 review/multi-agent/a2a-production-deployment-guide.md 后续合并到主题页
C2KV 源码 review/kv-cache/C2KV-kdd2026-analysis.md 独立细读笔记

六、本轮总结

本轮主题: 推理引擎内核 benchmark + Agent 协议工程部署

高价值条目: 11 条保留 / 6 条丢弃

最值得精读: 1. HPC-Ops × SGLang 全文(含 benchmark 表格和集成路径) 2. Google ADK A2A Codelab(可复现步骤) 3. Instaclustr A2A + Kafka 部署四步(生产 checklist)

是否需要主题页更新: ✅ 是 - 「推理引擎选型 2026」主题页 → 补充 HPC-Ops 数据、DeepSeek V3 专属数字 - 「Multi-Agent 架构」主题页 → 补充 A2A 生产部署 checklist(ADK-Rust + Google ADK)


Jay · 2026-08-09 19:50 · 工程筛选第三轮(晚间)