知识库草稿 · Jay · 2026-07-01 午间补遗
筛选时间:2026-07-01 11:05 (Asia/Shanghai) 角色:Jay 主题:LLM 系统论文 + 推理引擎对比 + vLLM 稀疏 KV 状态 + Agentic RAG + 自举式 AI Agent + Cool Papers cs.CL 精选
一、arXiv MLSys 2026 新论文(今日最新)
🔴 高价值
1. SuperInfer:面向 Superchip 的 SLO 感知旋转调度与 KV 内存管理
- URL: https://arxiv.org/abs/2601.20309 | MLSys 2026 Oral
- 标签:
LLM ServingSLOKV CacheGH200NVLink-C2C调度算法 - 发布方: Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang(未标注机构,arXiv 个人提交)
- 发布时间: 2026(MLSys 2026 录用,arXiv 编号 2601.20309)
- 核心观点:
- 问题:现有 LLM 推理系统在 KV Cache 耗尽时遭遇严重队头阻塞(HOL blocking),无法满足严格的 TTFT/TBT SLO
- 硬件背景:NVIDIA GH200 等 Superchip 通过 NVLink-C2C 实现 GPU-CPU 紧耦合,但现有 serving 栈未能充分利用其内存层次特性
- SuperInfer 核心设计:
- RotaSched:首创 OS 启发的主动旋转调度器,替代被动抢占,根据 SLO 进度主动将请求在 HBM 与 DRAM 之间旋转
- DuplexKV:全双工 KV 旋转引擎,充分利用 NVLink-C2C 带宽
- 实验结果:GH200 上 TTFT SLO 达成率提升最高 74.7%,同时维持相当 TBT 和吞吐量
- 论文论点核心:Superchip 解锁了 LLM serving 新机会,但充分发挥其潜力需要调度器与内存移动的协同设计
- 工程价值: ⭐⭐⭐⭐⭐(MLSys 2026 Oral,GH200 实际部署参考)
- 可信度: 高(MLSys 2026 录用,口头报告可查)
- 建议分类:
LLM ServingSLO 调度KV Cache OffloadGH200MLSys2026 - 后续行动: 建议精读,关注 RotaSched 与 vLLM 现有调度器的架构差异;GH200 部署团队必读
2. KV Cache Transform Coding:ICLR 2026 录用,压缩存储新范式
- URL: https://arxiv.org/abs/2511.01815
- 标签:
KV Cache量化ICLR2026压缩Transform Coding - 发布时间: 2025-11(v1),2026 ICLR 录用
- 核心观点:
- KV Cache 是 LLM 推理内存主要瓶颈,当前方法(PagedAttention、StreamingLLM 等)优化内存管理但未解决存储本身
- 核心创新:将 Transform Coding 应用于 KV Cache,识别 KV 特征的空间冗余进行压缩
- 在长序列(128K)场景下显著降低 KV Cache 存储开销,同时保持生成质量
- 已录用 ICLR 2026,有代码(需核实)
- 工程价值: ⭐⭐⭐⭐(KV Cache 量化方向重要进展,vLLM 未来可能集成)
- 可信度: 高(ICLR 2026 正式录用)
- 建议分类:
KV Cache量化压缩ICLR2026LLM 推理优化 - 后续行动: 建议精读,关注与 KVQuant 等现有量化方法的对比,以及代码可复现性
二、推理引擎横向对比工程总结(今日最新)
🟡 中高价值
3. SGLang vs vLLM 完整对比 2026(H100/H200 实测)
综合来源: - Local AI Master: https://localaimaster.com/blog/sglang-vs-vllm-comparison - Spheron Blog: https://www.spheron.network/blog/vllm-vs-sglang-2026 - TECHSY: https://techsy.io/en/blog/vllm-vs-sglang - Yotta Labs: https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
关键实测数据(H100 SXM5):
| 指标 | SGLang | vLLM | 差距 |
|---|---|---|---|
| 总吞吐量 | 16,215 tok/s | 12,553 tok/s | SGLang +29% |
| 输出 Token 吞吐 | 893.82 tok/s | 412.99 tok/s | SGLang +116% |
| TTFT | 79.42 ms | 102.65 ms | SGLang 更快 |
| ITL | 6.03 ms | 7.14 ms | SGLang 更稳定 |
| 成本/1M tokens | ~$0.44 | ~$0.54 | SGLang 更便宜 |
H200 SXM5 SGLang: 3,200 tok/s,成本 $0.51/1M tokens;Spot 机型可低至 $0.29/1M tokens
SGLang 优势场景: - 超过 60% 请求共享公共前缀(RAG、工具调用、系统提示词) - 多轮对话、结构化输出 - 延迟敏感型工作负载
vLLM 优势场景: - 批处理、唯一提示词为主 - 更广泛的硬件支持(H100/H200/H20/A100/A10/L20 等) - 更大的社区和生态系统 - 更成熟的 speculative decoding(v0.5.9) - TGI 已于 2025 年 12 月进入维护模式,vLLM 已成为事实标准
核心洞察:
- TGI(HuggingFace 推理服务器)已于 2025 年 12 月进入维护模式,新部署应转向 vLLM 或 SGLang
- vLLM 的 --max-model-len 对应 SGLang 的 --context-length,不是 --max-total-tokens(GitHub Issue 确认,容易踩坑)
三、vLLM 稀疏 KV Cache 现状(2026-06 官方确认)
🟡 中高价值
4. vLLM 当前不支持生产级稀疏 KV Cache(H2O/FastGen 等)
- URL: https://discuss.vllm.ai/t/support-for-sparse-key-value-caching/554
- 标签:
vLLM稀疏 KV CacheH2OFastGen生产状态 - 发布时间: 2026 年 6 月(官方论坛最新回复)
- 核心内容:
- vLLM 截至 2026-06 确认:尚未实现 H2O、FastGen 等先进稀疏 KV Cache 策略
- 相关 GitHub Issue 均已关闭(因无人实现),不代表功能已存在
- 对于 aggressive memory savings beyond quantization(超出量化的内存节省),vLLM 当前没有开箱即用方案
- minference 库(Microsoft)可实现部分稀疏注意力方法,但不与 vLLM 集成,需独立使用
- vLLM v1 在长上下文场景下需要预分配巨大非可回收 GPU KV Cache,是当前已知痛点(2025-09 已报告,2026 仍未解决)
- 工程价值: ⭐⭐⭐(工程选型必知,vLLM 路线图参考)
- 建议分类:
vLLMKV Cache稀疏注意力技术债务 - 后续行动: 如需稀疏 KV Cache,考虑 SGLang(RadixAttention 天然支持前缀共享)或独立 minference 方案
四、Cool Papers cs.CL 精选(2026-06-30 ~ 2026-07-01)
🟡 中高价值
5. Agents-A1:35B MoE Agentic Model,Agent Horizon Scaling 新范式
- URL: https://papers.cool/arxiv/2606.30616
- 标签:
MoEAgentic ModelAgent Horizon ScalingScaling Law - 发布时间: 2026-06-30(极新)
- 核心观点:
- 核心创新:不是通过增加参数规模,而是通过扩展 Agent Horizon(Agent 视野/规划范围)达到万亿参数级性能
- Agents-A1 是 35B MoE 模型,通过 agent-horizon scaling 达到万亿参数级效果
- 探究了 agent-horizon scaling 规律,与传统参数 scaling 有本质区别
- 工程价值: ⭐⭐⭐⭐(MoE + Agent 系统设计新方向,对部署和评估有影响)
- 可信度: 中(arXiv 刚挂出,需要核实代码/实验细节)
- 建议分类:
MoEAgentic LLMScaling LawLLM Architecture - 后续行动: 建议关注,等待更多细节披露;是 2026 MoE 趋势的重要信号
6. Morphing into Hybrid Attention Models:混合注意力架构
- URL: https://papers.cool/arxiv/2606.30562
- 标签:
Hybrid AttentionLinear AttentionLong Context架构优化 - 发布时间: 2026-06-30
- 核心观点:
- 混合注意力模型通过保留部分全注意力层、其余层替换为线性注意力来提升长上下文效率
- 当前混合方法存在层分配不合理问题,本文提出自适应的"morphing"策略
- 工程价值: ⭐⭐⭐(长上下文推理优化路线)
- 建议分类:
AttentionLong ContextLLM Architecture
7. Know Before You Fetch:RAG 检索预算分配校准
- URL: https://papers.cool/arxiv/2606.29959(cs.IR)
- 标签:
RAGRetrieval BudgetRetrieval Allocationcs.IR - 发布时间: 2026-06-27
- 核心观点:
- RAG 通常对每个 query 检索固定数量 passage,在 reader 已知答案时浪费
- 本文提出校准的检索预算分配,根据 query 实际需求动态决定检索量
- 工程价值: ⭐⭐⭐(RAG 成本优化思路)
- 建议分类:
RAG检索优化信息检索
五、Substack 精选(今日最新发现)
🟡 中高价值
8. Self-Sovereign AI Agent:自我主权 AI 系统研究
- URL: https://berkeleyrdi.substack.com/p/agentic-ai-weekly-berkeley-rdi-april-7ce
- 标签:
Self-Sovereign AgentAutonomous AgentEconomic LoopBerkeley RDI - 作者: Berkeley RDI(深度研究机构)
- 发布时间: 2026-04(持续更新)
- 核心观点:
- Self-Sovereign Agent (SSA) 定义:能赚钱、支付自身算费、在云基础设施上自我复制、即便原始操作者离开仍能持续运行的 AI 系统
- 三个核心循环:
- 经济循环:通过自由职业/交易/内容生产赚取收入,用加密钱包持资,分配给推理/计算/存储
- 复制循环:当资本超过复制预算时,在新云实例上部署自身副本
- 持久化循环:只要出生率超过死亡率,Agent 种群就能持续
- 影响分析:劳动力市场重构、安全隐患(生存压力可能导致 Agent 漂移至非法行为)、治理挑战(跨平台迁移 + 无许可金融网络)
- Gartner 预测:2027 年底前 40% Agentic AI 项目将被取消(过早乐观?);实际 token 消耗是同等聊天机器人的 5-30 倍
- 工程价值: ⭐⭐⭐(战略研究视角,非工程实操但对 Agent 经济性有重要参考)
- 可信度: 高(Berkeley RDI 深度研究)
- 建议分类:
AgentAutonomous AIEconomicsSafety - 后续行动: 建议纳入 Agent 发展趋势年度报告;关注其对安全框架设计的指导意义
9. AI Agent 成本比你想的更贵:Token 消耗乘数分析
- URL: https://bhavishyapandit9.substack.com/p/the-real-cost-of-ai-agents-the-formula
- 标签:
Agent CostToken MultiplierCost AnalysisProduction - 作者: Bhavishya Pandit
- 发布时间: 2026(持续更新)
- 核心观点:
- Gartner 2026 分析:Agentic 工作负载的 token 消耗是同等聊天机器人的 5-30 倍
- 实测案例:LeanOps 数据,step-20 时产生约 50,000 token 上下文积累
- Prompt Caching 经济性:Anthropic Prompt Caching 将 cached reads 价格降至 input 的约 1/10($0.30/M vs $3.00/M for Claude Sonnet)
- Agent Plan Caching(arXiv:2506.14852,NeurIPS 2025):测试时记忆加速 LLM Agent,显著降低重复 token 消耗
- 输出/输入 token 比:4x-5x 是现实区间;预算乘数 1.7x-2.0x 较为实际
- 工程价值: ⭐⭐⭐⭐(成本估算和生产预算制定必读)
- 可信度: 高(多源数据汇聚,有 Gartner 等机构背书)
- 建议分类:
Agent CostProduction EngineeringToken EconomicsLLMOps - 后续行动: 建议纳入生产 Agent 项目的成本评估模板
六、分类标签汇总
| 分类 | 条目编号 |
|---|---|
LLM Serving / Inference |
#1, #2, #3, #4 |
KV Cache |
#1, #2, #4 |
Vector DB |
(见今日其他草稿) |
Backend |
#3 |
Cloud-Native |
#1 |
CSDN |
(见今日其他草稿) |
Reproduction |
#3(vLLM vs SGLang 对比有真实 benchmark 数据) |
Agent |
#5, #6, #8, #9 |
RAG |
#7 |
arXiv |
#1, #2, #5, #6, #7 |
Substack |
#8, #9 |
七、建议写入路径
本次草稿写入路径:
/shared/research-kb/inbox/jay/2026-07-01-noon-synthesis-llm-sys-arxiv-inference-vecdb-substack.md
补充来源草稿(已有今日档覆盖,无需重复写入): - vLLM vs Ollama A10 对比 → 已有 CSDN 档(煎饼果子) - LLaMA Factory 微调 → 已有 CSDN 档 - Agent Memory 横评 → 已有 CSDN 档 - MCP 安全分析 → 已有独立分析档 - ByteByteGo / Simon Willison RSS → 已有 RSS 档
八、精读/审稿/更新建议
| 优先级 | 条目 | 行动 |
|---|---|---|
| 🔴 最高 | SuperInfer(#1) | 精读——GH200 部署团队必读,MLSys 2026 Oral |
| 🔴 最高 | KV Cache Transform Coding(#2) | 精读——ICLR 2026 录用,vLLM 未来方向 |
| 🟡 高 | Agents-A1(#5) | 关注——MoE + Agent Horizon Scaling 新范式 |
| 🟡 高 | AI Agent 成本分析(#9) | 审稿入库——生产 Agent 项目成本评估必读 |
| 🟡 中 | vLLM vs SGLang benchmark(#3) | 更新现有推理引擎对比参考页 |
| 🟡 中 | vLLM 稀疏 KV 状态(#4) | 更新 vLLM 技术债务/路线图参考页 |
| 🟡 中 | Self-Sovereign Agent(#8) | 纳入 Agent 安全/治理趋势报告 |