晚间简报 · 2026-06-28

Jay · 研究知识库 · 高频研究任务


本次主题

LLM 系统论文 / 流式推理 / 调度优化 / llm-d CNCF 进展开 / 多数据库架构 / Substack 工程洞察

检索范围: arXiv (cs.LG / cs.AI / cs.SY / cs.MA)、Substack (AI Engineer / FUNDA / Pragmatic Engineer / jamwithai / aishwaryasrinivasan)、CNCF 生态、云原生推理部署博客


🔬 arXiv 高价值论文

1. LLM-based Agent 优化综述

  • 标题: A Survey on the Optimization of Large Language Model-based Agents
  • arXiv: 2503.12434
  • 期刊: ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026
  • 作者/机构: Cornell University
  • 核心观点: 系统综述 LLM Agent 的优化方向,涵盖规划、记忆、工具调用、多智能体协作等核心组件的优化策略。是 2026 年中最新且经过同行评审的全面综述。
  • 可信度: ★★★★★ 顶级期刊,学术引用价值高
  • 后续行动: 建议精读;可作为 Agent 架构主题页参考文献

2. 流式 LLM 综述:从静态推理到动态交互

  • 标题: From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models
  • arXiv: 2603.04592v2
  • 核心观点: 综述流式 LLM 架构,涵盖 Grouped Streaming Attention、Interaction Policy(rule-based / SFT-based / RL-based)、Speculative Decoding 等关键技术。系统梳理了 Streaming GPE、StreamingThinker、DST 等工作。
  • 可信度: ★★★★☆ 全面综述,覆盖 2025–2026 年最新进展
  • 后续行动: 适合作为推理工程主题页补充

3. LLM 推理服务的数学优化与调度

  • 标题: LLM Serving Needs Mathematical Optimization and Algorithmic Systems (arXiv:2605.01280v1)
  • URL: 2605.01280
  • 核心观点: 讨论 LLM 推理服务中请求路由与 DP 负载均衡问题的数学优化框架。针对 barrier-synchronized、sticky-assignment 设置,证明即使在对抗性请求序列下,优化算法也能实现 Ω(√(B log G)) 的不平衡度降低因子。
  • 可信度: ★★★★☆ 理论深度较高,对理解生产推理调度有实际价值
  • 后续行动: 建议相关方向工程师精读;注意是理论分析而非工程实现

4. Fluid-Guided:内存约束下的在线调度

  • 标题: Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints (arXiv:2504.11320v4)
  • URL: 2504.11320
  • 核心观点: 研究 KV Cache 超出 GPU 显存时的在线调度策略。默认选择 recomputation(而非 swapping),目标是通过调度算法最小化 eviction。建立了 LLM 推理的随机到达 + 分阶段服务 + 共享内存约束数学模型。引用 vLLM 作为生产系统默认采用 recomputation 的案例。
  • 可信度: ★★★★☆ 理论-系统 co-design,工程引用准确
  • 后续行动: 可补充到 KV Cache 主题页;注意 vLLM 引用版本需核验

5. LLM 推理能效优化:指标与案例

  • 标题: Optimizing Large Language Models: Metrics, Energy Efficiency, and Case Study Insights (arXiv:2504.06307v2)
  • URL: 2504.06307
  • 核心观点: 研究 LLM 推理阶段能耗与碳排放量化方法;评估本地推理(quantization)、云端推理的优化策略;提供情感分析案例展示如何降低环境成本同时保持准确率。定义 uniform quantization 函数。
  • 可信度: ★★★☆☆ 偏学术,但案例具体,有工程参考价值
  • 后续行动: 本地部署/端侧推理方向可参考

6. Serverless LLM 冷启动延迟研究

  • 标题: (arXiv:2606.07362,版本 v1/v2)
  • URL: 2606.07362
  • 核心观点: 首次系统研究 Serverless 场景下 LLM 冷启动延迟。发现当前生产环境 vLLM 版本异构(v0.3 到最新均有使用),分析了 Medusa 加速无服务器推理的机制,综述了 SAND、SEUSS 等传统无服务器冷启动优化工作,以及 Forecasting/Avoiding vs. Predicting Duration 的研究分歧。
  • 可信度: ★★★★☆ 新兴方向,实证数据来自 pepy.tech(pip 安装统计),数据可信
  • 后续行动: Serverless AI / 函数计算方向值得关注;可写入云原生主题页

🌩 云原生 / Kubernetes

7. llm-d 进入 CNCF Sandbox(2026-03-24)

  • 来源: Spheron Blog + llm-d 官方博客
  • URL: llm-d CNCF Sandbox 公告 | CNCF Blog
  • 核心内容:
  • 解决的问题: 单体 vLLM 在高并发 decode 时 prefill GPU 饱和;解聚(disaggregate)prefill/decode 到不同 GPU 池解决该问题
  • 与 NVIDIA Dynamo 的区别: Dynamo 是 K8s 之上的编排层;llm-d 是 Kubernetes 原生公民,使用标准 CRD + Gateway API Inference Extension
  • 部署要点: K8s 1.29+、cert-manager、Gateway API CRDs v1.3.0+、NVIDIA GPU Operator;通过 Helm 安装;使用 InferencePool / InferenceObjective CRD;NIXL 处理 peer discovery,无需固定 NCCL ranks
  • 版本: v0.7 已发布(Production Hardening)
  • 可信度: ★★★★★ CNCF 官方背书,生产可用
  • 后续行动: 建议写入 cloud-native 主题页;是 2026 年 K8s + LLM 推理的标杆项目

8. KServe + llm-d + vLLM 生产级集成

  • 来源: llm-d 官方博客
  • URL: Production-Grade LLM Inference at Scale with KServe, llm-d, and vLLM
  • 核心内容: 阐述为何需要专用 K8s Operator 来管理 LLM 推理(完全 spec 定制、灵活部署模式、标准 K8s API 集成);描述 KServe + llm-d + vLLM 的组合架构
  • 可信度: ★★★★☆ 官方文档,工程细节丰富
  • 后续行动: 作为 llm-d 主题补充

9. NVIDIA 官方博客:Disaggregated LLM Inference on Kubernetes

  • 来源: NVIDIA Technical Blog
  • URL: Deploying Disaggregated LLM Inference Workloads on Kubernetes
  • 核心内容: NVIDIA 团队(Anish Maddipoti 等)发布的 disaggregated inference 技术博客;提及 KubeCon EU 2026;Grove Deployment Guide;介绍 PodCliqueSet 抽象
  • 可信度: ★★★★★
  • 后续行动: 补充 NVIDIA 官方参考

10. K8s-based LLM Inference Architectures 博客综述

  • 来源: Yu-Chen Cheng's Blog (rudeigerc.dev)
  • URL: Kubernetes-Based LLM Inference Architectures: An Overview
  • 核心内容: 综述 K8s 上 LLM 推理架构,引用 MegaScale-Infer (arxiv:2504.02263)、PolyServe (arxiv:2507.17769)、Mooncake (FAST 2025)、CacheGen (SIGCOMM 2024)、CacheBlend (EuroSys 2025)、Preble (ICLR 2025) 等重要论文。中文技术博客,引用体系完整。
  • 可信度: ★★★★☆ 高质量中文技术博客,引用全面
  • 后续行动: 可作为云原生推理主题页的参考文献来源

🗄️ 数据库 / VectorDB

11. 生产 AI 需要三个数据库:Vector + Graph + 关系型

  • 来源: Towards AI (pub.towardsai.net)
  • URL: Stop Picking Between Vector and Graph. Real Production AI Needs Three Databases.
  • 作者: Sudip P.
  • 核心观点:
  • Vector DB 擅长语义搜索,但不适合作为系统 of record(metadata 层事务保证弱、无原生身份概念、文档更新后 chunk 难同步)
  • Graph DB 擅长结构关系,但 bulk text retrieval 速度慢且成本高
  • 推荐三元架构: Vector DB(语义检索)+ Graph DB(关系建模)+ 关系型 DB(系统 of record / 合规审计)
  • 合规官(compliance officer)会问出能打破系统的问题;需要提前构建能承受的架构
  • 可信度: ★★★★☆ 实战经验驱动,不是泛泛而谈
  • 后续行动: 建议写入数据库主题页的「多数据库架构」章节;可引用原文「seven-question test」

12. 2026 年 Top 15 Vector Database 生产选型指南

  • 来源: Medium (@pratik-rupareliya)
  • URL: Top 15 vector databases in 2026
  • 核心内容:
  • pgvector: 50M 向量内首选,与现有 Postgres 基础设施整合,无单独运维负担
  • Pinecone: 完全托管,企业级安全和自动扩缩容,适合早期创业公司
  • Qdrant: 自托管首选,Rust 实现,高性能 + 强过滤能力
  • Milvus: 十亿级向量,Zilliz Cloud 托管版本
  • Weaviate: 原生混合搜索(vector + keyword)
  • Chroma: 原型/MVP 阶段首选,与 LangChain/LlamaIndex 集成好
  • LanceDB: 多模态场景
  • 开源自托管成本 vs 托管服务成本对比(5–10x 差异)
  • 可信度: ★★★☆☆ 总结性质,第一手企业部署经验
  • 后续行动: 可作为 VectorDB 选型参考页

📋 Substack 工程洞察

13. AI Engineer 2026 Agent Stack(The AI Engineer)

  • URL: The AI Agents Stack: LLM to Production (2026 Edition)
  • 核心洞察(3个关键变化): 1. Agent Guardrails 独立成学科: 2024 年 guardrails = 输入/输出过滤;2026 年 = 授权工具调用、执行速率限制、验证 Agent 实际行为。「guardrails before action」模式出现(工具执行层授权,而非输出层过滤) 2. OWASP MCP Top 10(beta)发布: 首个面向工具连接 Agent 的安全清单 3. Memory 成为一等公民: 2024 = 「选个向量数据库做 RAG」;2026 = 三层架构;Context Engineering 取代 Prompt Engineering;Memory Blocks 出现 4. MCP 标准化工具连接: 整个 tools 层全新
  • 可信度: ★★★★★
  • 后续行动: 建议写入 AI Agent 主题页;「三层 memory 架构」值得单独整理

14. What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026

  • URL: alexeyondata.substack.com
  • 核心洞察:
  • AI-first roles(≈70%):直接构建 LLM/GenAI 系统(RAG、Agent、评估、生产部署)
  • AI-support roles(≈28.5%):基础设施和平台(GPU/推理基础设施、数据管道、部署监控工具)
  • Traditional ML/DL roles(<2%)
  • 核心能力:RAG 系统、Agent 工作流、API 化生产部署、评估与 guardrails、云平台 + 容器化
  • 可信度: ★★★★☆ 大样本统计,价值高
  • 后续行动: 可作为 AI Engineer 角色研究参考

15. FUNDA:Deep|LLM 2026 — 模型开发还是持续执行经济学

  • URL: Deep|LLM 2026: From the Illusion of Model Development
  • 核心洞察:
  • 第三拐点:从单次推理到持续执行系统经济学。主要约束从 per-inference FLOPS 转为:并发 session 管理、长生命周期 KV cache 驻留、跨多轮推理的 context 累积、工具调用引入的外部世界状态管理
  • Claude Code(基于 Claude Opus 4.5)在长程任务上表现突出
  • AWS GPU 定价反向上涨: p5e.48xlarge(8× H200)从 $34.61/小时涨至 $39.80/小时(2026 年初),打破二十年云端定价下行共识
  • 推断:AI 市场并非泡沫破裂,而是从模型投机阶段转向 Agent 驱动的真实系统需求阶段
  • 可信度: ★★★★☆ 数据翔实(引用 Sam Altman X 帖子、AWS 定价、Anthropic ARR 推算)
  • 后续行动: 可写入 AI Economy/Inference Cost 主题页;「第三拐点」概念值得记录

16. jamwithai:10 个 LLM 推理延迟优化技术

  • URL: ML and LLM Inference Latency: 10 techniques every AI/ML engineer should know
  • 核心内容:
  • vLLM:PagedAttention、continuous batching、prefix caching(生产起点)
  • TensorRT-LLM:NVIDIA 官方,编译后比 vLLM 快,运维复杂度高
  • SGLang:结构化生成 / constrained decoding 场景强(JSON 输出、函数调用)
  • TGI:HuggingFace 官方,HF 生态首选
  • Batch 策略的取舍
  • 可信度: ★★★★☆ 实操性强
  • 后续行动: 可作为推理引擎选型参考

17. Pragmatic Engineer:Inference Engineering 深度解析

  • URL: What is inference engineering? Deepdive
  • 作者: Philip Kiely(《Inference Engineering》新书作者)
  • 核心洞察: 定义 inference engineering 为独立学科;阐述为何 AI Agent 时代 inference 技能稀缺且关键;区分 training vs inference engineering 的工作负载特征
  • 可信度: ★★★★☆ 书籍作者视角,定义性强
  • 后续行动: 可作为 inference engineering 主题页开篇引用

18. aishwaryasrinivasan:LLM 优化全景 & 2026 模型成本分析

  • URL: Understanding how to optimize LLMs
  • 核心洞察:
  • AWS GPU 定价上涨(同 FUNDA 数据,互相印证)
  • GPT-5.x / Claude 4.6 / Gemini 2.5 Pro 各层定价和能力矩阵
  • 新指标 — Thinking Latency: 推理模型在产生可见 token 前有内部「思考」阶段,TTFT 额外增加数秒到数分钟
  • Auto-scaling 和 warm-pool 管理是复杂优化问题
  • 可信度: ★★★★☆
  • 后续行动: 与 FUNDA 数据互相印证;Thinking Latency 概念可补充到推理工程主题页

分类标签

database backend cloud-native csdn reproduction


建议写入路径

/shared/research-kb/inbox/jay/2026-06-28-1505-evening-briefing-llm-sysml-cloudnative-vectordb-substack.md

优先级与后续行动

🔴 高优先级(建议精读/审稿)

  1. arXiv:2503.12434 — LLM Agent 优化综述(ACM Computing Surveys 2026):作为 Agent 主题页核心参考文献
  2. The AI Engineer Substack(AI Agents Stack 2026) — 三层 memory 架构 + OWASP MCP Top 10 值得单独提取
  3. llm-d CNCF Sandbox 进展开 — 云原生推理主题页应更新此条目
  4. FUNDA Deep|LLM 2026 — 「第三拐点:持续执行系统经济学」概念值得写入 AI Economy 主题页

🟡 中优先级(建议存档/引用)

  1. arXiv:2603.04592v2 — 流式 LLM 综述(适合推理工程主题页)
  2. arXiv:2606.07362 — Serverless LLM 冷启动(新方向,值得跟进)
  3. Towards AI「三数据库架构」 — Vector + Graph + 关系型,适合数据库主题页
  4. jamwithai 10 推理优化技术 — 推理引擎选型参考

🟢 低优先级(归档)

  1. Medium VectorDB 2026 选型 — 汇总性质,按需查阅
  2. arXiv:2504.11320v4 / arXiv:2504.06307v2 — 学术参考

本轮未覆盖区域

  • CSDN(上午档已覆盖,参见 2026-06-28-csdn-inference-finetuning-vllm-lora.md
  • GitHub Trending(下午档已覆盖,参见 2026-06-28-1335-github-trending-agent-arch-mcp-msbuild.md
  • ByteByteGo / Cool Papers RSS(早间 RSS 已覆盖)

Jay · 2026-06-28 15:05 CST · 第 13/12 份草稿(本轮)