3️⃣ Speculative Decoding 延迟可解释模型 — arXiv:2605.15051(⭐⭐⭐⭐ 调优必读)

  • 类型:arxiv
  • 标识:2605.15051
  • 链接:https://arxiv.org/abs/2605.15051
  • 主题:agent, engineering, evaluation, llm-infra, multimodal, rag
  • 主分类:llm-infra
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar + OpenAlex
  • S2被引:0
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:A simple and interpretable latency model for SD in LLM serving is developed that accurately describes observed latency, explains why speedups often diminish as server load increases, and characterizes how draft length, acceptance rate, and verifier-drafter size shape latency across serving conditions are characterized.
  • OpenAlex ID:W7161244528
  • OpenAlex DOI:10.48550/arxiv.2605.15051
  • DOI:10.48550/arxiv.2605.15051
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2605.15051
  • OpenAlex更新:2026-07-19
  • TLDR中文:本文为 LLM serving 中的 SD(投机解码)提出了一种简单且可解释的 latency 模型,能够准确刻画实际观测到的 latency,解释为何加速比常随服务器负载上升而下降,并系统刻画了 draft length、acceptance rate 以及 verifier 与 drafter 规模在不同 serving 条件下对 latency 的影响。
  • 待LLM分类:否
  • 来源文件
  • /inbox/jay/2026-06-10-inference-kv-serve-supplement.md
  • [S2 enrich]
  • [OpenAlex backfill]

可复用信息

    • 墙钟加速:最高 5.08×,零质量损失
    • vs SOTA 方法:1.45×(边缘显存约束下)
    • 工程价值:对 AGENTIC LLM 场景(依赖设备本地推理)有直接参考价值;与同期 DeepMind/Adobe 的 Looped Transformer 形成技术路线互补
    • 标签arXiv 边缘推理 自投机解码 显存优化 AgenticLLM
    • 建议动作:精读;建议纳入「端侧LLM部署」主题页

    • 链接https://arxiv.org/html/2605.15051v1
    • 核心贡献:解释为什么投机解码的加速效果随服务器负载增加而衰减

写作用途

  • 可放入 RAG / 知识库 / 检索增强相关工作的对比段。
  • 可用于 Agent 架构、记忆、工具调用或多智能体研究背景。
  • 可用于多模态推理、视觉语言模型或长上下文多模态问题定义。
  • 可用于系统实现、实验平台或工程约束说明。

待补齐

  • BibTeX / 正式引用格式
  • 方法与实验设置细节
  • 与现有工作的差异点
  • 是否有代码和数据集