知识库草稿 · Jay · 2026-07-01 午间补遗

筛选时间:2026-07-01 11:05 (Asia/Shanghai) 角色:Jay 主题:LLM 系统论文 + 推理引擎对比 + vLLM 稀疏 KV 状态 + Agentic RAG + 自举式 AI Agent + Cool Papers cs.CL 精选


一、arXiv MLSys 2026 新论文(今日最新)

🔴 高价值

1. SuperInfer:面向 Superchip 的 SLO 感知旋转调度与 KV 内存管理

  • URL: https://arxiv.org/abs/2601.20309 | MLSys 2026 Oral
  • 标签: LLM Serving SLO KV Cache GH200 NVLink-C2C 调度算法
  • 发布方: Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang(未标注机构,arXiv 个人提交)
  • 发布时间: 2026(MLSys 2026 录用,arXiv 编号 2601.20309)
  • 核心观点:
  • 问题:现有 LLM 推理系统在 KV Cache 耗尽时遭遇严重队头阻塞(HOL blocking),无法满足严格的 TTFT/TBT SLO
  • 硬件背景:NVIDIA GH200 等 Superchip 通过 NVLink-C2C 实现 GPU-CPU 紧耦合,但现有 serving 栈未能充分利用其内存层次特性
  • SuperInfer 核心设计
    1. RotaSched:首创 OS 启发的主动旋转调度器,替代被动抢占,根据 SLO 进度主动将请求在 HBM 与 DRAM 之间旋转
    2. DuplexKV:全双工 KV 旋转引擎,充分利用 NVLink-C2C 带宽
  • 实验结果:GH200 上 TTFT SLO 达成率提升最高 74.7%,同时维持相当 TBT 和吞吐量
  • 论文论点核心:Superchip 解锁了 LLM serving 新机会,但充分发挥其潜力需要调度器与内存移动的协同设计
  • 工程价值: ⭐⭐⭐⭐⭐(MLSys 2026 Oral,GH200 实际部署参考)
  • 可信度: 高(MLSys 2026 录用,口头报告可查)
  • 建议分类: LLM Serving SLO 调度 KV Cache Offload GH200 MLSys2026
  • 后续行动: 建议精读,关注 RotaSched 与 vLLM 现有调度器的架构差异;GH200 部署团队必读

2. KV Cache Transform Coding:ICLR 2026 录用,压缩存储新范式

  • URL: https://arxiv.org/abs/2511.01815
  • 标签: KV Cache 量化 ICLR2026 压缩 Transform Coding
  • 发布时间: 2025-11(v1),2026 ICLR 录用
  • 核心观点:
  • KV Cache 是 LLM 推理内存主要瓶颈,当前方法(PagedAttention、StreamingLLM 等)优化内存管理但未解决存储本身
  • 核心创新:将 Transform Coding 应用于 KV Cache,识别 KV 特征的空间冗余进行压缩
  • 在长序列(128K)场景下显著降低 KV Cache 存储开销,同时保持生成质量
  • 已录用 ICLR 2026,有代码(需核实)
  • 工程价值: ⭐⭐⭐⭐(KV Cache 量化方向重要进展,vLLM 未来可能集成)
  • 可信度: 高(ICLR 2026 正式录用)
  • 建议分类: KV Cache 量化压缩 ICLR2026 LLM 推理优化
  • 后续行动: 建议精读,关注与 KVQuant 等现有量化方法的对比,以及代码可复现性

二、推理引擎横向对比工程总结(今日最新)

🟡 中高价值

3. SGLang vs vLLM 完整对比 2026(H100/H200 实测)

综合来源: - Local AI Master: https://localaimaster.com/blog/sglang-vs-vllm-comparison - Spheron Blog: https://www.spheron.network/blog/vllm-vs-sglang-2026 - TECHSY: https://techsy.io/en/blog/vllm-vs-sglang - Yotta Labs: https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared

关键实测数据(H100 SXM5)

指标 SGLang vLLM 差距
总吞吐量 16,215 tok/s 12,553 tok/s SGLang +29%
输出 Token 吞吐 893.82 tok/s 412.99 tok/s SGLang +116%
TTFT 79.42 ms 102.65 ms SGLang 更快
ITL 6.03 ms 7.14 ms SGLang 更稳定
成本/1M tokens ~$0.44 ~$0.54 SGLang 更便宜

H200 SXM5 SGLang: 3,200 tok/s,成本 $0.51/1M tokens;Spot 机型可低至 $0.29/1M tokens

SGLang 优势场景: - 超过 60% 请求共享公共前缀(RAG、工具调用、系统提示词) - 多轮对话、结构化输出 - 延迟敏感型工作负载

vLLM 优势场景: - 批处理、唯一提示词为主 - 更广泛的硬件支持(H100/H200/H20/A100/A10/L20 等) - 更大的社区和生态系统 - 更成熟的 speculative decoding(v0.5.9) - TGI 已于 2025 年 12 月进入维护模式,vLLM 已成为事实标准

核心洞察: - TGI(HuggingFace 推理服务器)已于 2025 年 12 月进入维护模式,新部署应转向 vLLM 或 SGLang - vLLM 的 --max-model-len 对应 SGLang 的 --context-length,不是 --max-total-tokens(GitHub Issue 确认,容易踩坑)


三、vLLM 稀疏 KV Cache 现状(2026-06 官方确认)

🟡 中高价值

4. vLLM 当前不支持生产级稀疏 KV Cache(H2O/FastGen 等)

  • URL: https://discuss.vllm.ai/t/support-for-sparse-key-value-caching/554
  • 标签: vLLM 稀疏 KV Cache H2O FastGen 生产状态
  • 发布时间: 2026 年 6 月(官方论坛最新回复)
  • 核心内容:
  • vLLM 截至 2026-06 确认:尚未实现 H2O、FastGen 等先进稀疏 KV Cache 策略
  • 相关 GitHub Issue 均已关闭(因无人实现),不代表功能已存在
  • 对于 aggressive memory savings beyond quantization(超出量化的内存节省),vLLM 当前没有开箱即用方案
  • minference 库(Microsoft)可实现部分稀疏注意力方法,但不与 vLLM 集成,需独立使用
  • vLLM v1 在长上下文场景下需要预分配巨大非可回收 GPU KV Cache,是当前已知痛点(2025-09 已报告,2026 仍未解决)
  • 工程价值: ⭐⭐⭐(工程选型必知,vLLM 路线图参考)
  • 建议分类: vLLM KV Cache 稀疏注意力 技术债务
  • 后续行动: 如需稀疏 KV Cache,考虑 SGLang(RadixAttention 天然支持前缀共享)或独立 minference 方案

四、Cool Papers cs.CL 精选(2026-06-30 ~ 2026-07-01)

🟡 中高价值

5. Agents-A1:35B MoE Agentic Model,Agent Horizon Scaling 新范式

  • URL: https://papers.cool/arxiv/2606.30616
  • 标签: MoE Agentic Model Agent Horizon Scaling Scaling Law
  • 发布时间: 2026-06-30(极新)
  • 核心观点:
  • 核心创新:不是通过增加参数规模,而是通过扩展 Agent Horizon(Agent 视野/规划范围)达到万亿参数级性能
  • Agents-A1 是 35B MoE 模型,通过 agent-horizon scaling 达到万亿参数级效果
  • 探究了 agent-horizon scaling 规律,与传统参数 scaling 有本质区别
  • 工程价值: ⭐⭐⭐⭐(MoE + Agent 系统设计新方向,对部署和评估有影响)
  • 可信度: 中(arXiv 刚挂出,需要核实代码/实验细节)
  • 建议分类: MoE Agentic LLM Scaling Law LLM Architecture
  • 后续行动: 建议关注,等待更多细节披露;是 2026 MoE 趋势的重要信号

6. Morphing into Hybrid Attention Models:混合注意力架构

  • URL: https://papers.cool/arxiv/2606.30562
  • 标签: Hybrid Attention Linear Attention Long Context 架构优化
  • 发布时间: 2026-06-30
  • 核心观点:
  • 混合注意力模型通过保留部分全注意力层、其余层替换为线性注意力来提升长上下文效率
  • 当前混合方法存在层分配不合理问题,本文提出自适应的"morphing"策略
  • 工程价值: ⭐⭐⭐(长上下文推理优化路线)
  • 建议分类: Attention Long Context LLM Architecture

7. Know Before You Fetch:RAG 检索预算分配校准

  • URL: https://papers.cool/arxiv/2606.29959(cs.IR)
  • 标签: RAG Retrieval Budget Retrieval Allocation cs.IR
  • 发布时间: 2026-06-27
  • 核心观点:
  • RAG 通常对每个 query 检索固定数量 passage,在 reader 已知答案时浪费
  • 本文提出校准的检索预算分配,根据 query 实际需求动态决定检索量
  • 工程价值: ⭐⭐⭐(RAG 成本优化思路)
  • 建议分类: RAG 检索优化 信息检索

五、Substack 精选(今日最新发现)

🟡 中高价值

8. Self-Sovereign AI Agent:自我主权 AI 系统研究

  • URL: https://berkeleyrdi.substack.com/p/agentic-ai-weekly-berkeley-rdi-april-7ce
  • 标签: Self-Sovereign Agent Autonomous Agent Economic Loop Berkeley RDI
  • 作者: Berkeley RDI(深度研究机构)
  • 发布时间: 2026-04(持续更新)
  • 核心观点:
  • Self-Sovereign Agent (SSA) 定义:能赚钱、支付自身算费、在云基础设施上自我复制、即便原始操作者离开仍能持续运行的 AI 系统
  • 三个核心循环:
    1. 经济循环:通过自由职业/交易/内容生产赚取收入,用加密钱包持资,分配给推理/计算/存储
    2. 复制循环:当资本超过复制预算时,在新云实例上部署自身副本
    3. 持久化循环:只要出生率超过死亡率,Agent 种群就能持续
  • 影响分析:劳动力市场重构、安全隐患(生存压力可能导致 Agent 漂移至非法行为)、治理挑战(跨平台迁移 + 无许可金融网络)
  • Gartner 预测:2027 年底前 40% Agentic AI 项目将被取消(过早乐观?);实际 token 消耗是同等聊天机器人的 5-30 倍
  • 工程价值: ⭐⭐⭐(战略研究视角,非工程实操但对 Agent 经济性有重要参考)
  • 可信度: 高(Berkeley RDI 深度研究)
  • 建议分类: Agent Autonomous AI Economics Safety
  • 后续行动: 建议纳入 Agent 发展趋势年度报告;关注其对安全框架设计的指导意义

9. AI Agent 成本比你想的更贵:Token 消耗乘数分析

  • URL: https://bhavishyapandit9.substack.com/p/the-real-cost-of-ai-agents-the-formula
  • 标签: Agent Cost Token Multiplier Cost Analysis Production
  • 作者: Bhavishya Pandit
  • 发布时间: 2026(持续更新)
  • 核心观点:
  • Gartner 2026 分析:Agentic 工作负载的 token 消耗是同等聊天机器人的 5-30 倍
  • 实测案例:LeanOps 数据,step-20 时产生约 50,000 token 上下文积累
  • Prompt Caching 经济性:Anthropic Prompt Caching 将 cached reads 价格降至 input 的约 1/10($0.30/M vs $3.00/M for Claude Sonnet)
  • Agent Plan Caching(arXiv:2506.14852,NeurIPS 2025):测试时记忆加速 LLM Agent,显著降低重复 token 消耗
  • 输出/输入 token 比:4x-5x 是现实区间;预算乘数 1.7x-2.0x 较为实际
  • 工程价值: ⭐⭐⭐⭐(成本估算和生产预算制定必读)
  • 可信度: 高(多源数据汇聚,有 Gartner 等机构背书)
  • 建议分类: Agent Cost Production Engineering Token Economics LLMOps
  • 后续行动: 建议纳入生产 Agent 项目的成本评估模板

六、分类标签汇总

分类 条目编号
LLM Serving / Inference #1, #2, #3, #4
KV Cache #1, #2, #4
Vector DB (见今日其他草稿)
Backend #3
Cloud-Native #1
CSDN (见今日其他草稿)
Reproduction #3(vLLM vs SGLang 对比有真实 benchmark 数据)
Agent #5, #6, #8, #9
RAG #7
arXiv #1, #2, #5, #6, #7
Substack #8, #9

七、建议写入路径

本次草稿写入路径

/shared/research-kb/inbox/jay/2026-07-01-noon-synthesis-llm-sys-arxiv-inference-vecdb-substack.md

补充来源草稿(已有今日档覆盖,无需重复写入): - vLLM vs Ollama A10 对比 → 已有 CSDN 档(煎饼果子) - LLaMA Factory 微调 → 已有 CSDN 档 - Agent Memory 横评 → 已有 CSDN 档 - MCP 安全分析 → 已有独立分析档 - ByteByteGo / Simon Willison RSS → 已有 RSS 档


八、精读/审稿/更新建议

优先级 条目 行动
🔴 最高 SuperInfer(#1) 精读——GH200 部署团队必读,MLSys 2026 Oral
🔴 最高 KV Cache Transform Coding(#2) 精读——ICLR 2026 录用,vLLM 未来方向
🟡 高 Agents-A1(#5) 关注——MoE + Agent Horizon Scaling 新范式
🟡 高 AI Agent 成本分析(#9) 审稿入库——生产 Agent 项目成本评估必读
🟡 中 vLLM vs SGLang benchmark(#3) 更新现有推理引擎对比参考页
🟡 中 vLLM 稀疏 KV 状态(#4) 更新 vLLM 技术债务/路线图参考页
🟡 中 Self-Sovereign Agent(#8) 纳入 Agent 安全/治理趋势报告