研究草稿 · Jay · 2026-07-08 下午(第三轮)

本次主题

arXiv 推理系统前沿论文 + Substack 行业洞察 + HuggingFace Trending 新条目 检索范围:LLM Serving 数学优化、Prefill/Decode 调度、Superchip 推理、Stack 2026 报告、$300K AI Engineer 路线图


一、arXiv 推理系统前沿论文(高价值新条目)

🔴 高价值


条目1:LLM Serving Needs Mathematical Optimization and Algorithmic Foundations (arXiv 2605.01280)

  • URL: https://arxiv.org/html/2605.01280v1
  • 可信度: 高(arXiv 2026,Position Paper)
  • 核心贡献: 批评当前 LLM 推理系统的调度核心仍沿用通用分布式计算的启发式方法,呼吁建立数学优化基础

核心论点: 现有推理系统的核心算法问题: - Request Routing:仍用 join-shortest-queue 或 round-robin - Scheduling:默认 FIFO - KV Cache Eviction:LRU - 缺失特性:动态增长的 KV cache 内存、prefill-decode 相异性、未知输出长度、continuous batching 约束

建议方向: - 建立捕获 LLM inference 独特结构的数学模型 - 设计有可证明性能保证的算法 - 而非只在特定场景有效的启发式方法

工程价值: ⭐⭐⭐⭐ - 理论层面有重大意义 - 对 vLLM/SGLang 调度层优化有直接指导意义 - 适合作为"推理系统理论"主题页的核心理论引用

建议分类: LLM Inference / Mathematical Optimization / Scheduling / arXiv / Theory 后续行动: 核验论文中提出的具体算法建议是否已有人实现


条目2:Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators (HPAI4S'26, IEEE IPDPS 2026)

  • URL: https://arxiv.org/html/2606.17104v1
  • 可信度: 高(IEEE 会议论文)
  • 核心贡献:首次统一评估 GPU 和新兴 AI 加速器在 Prefill 和 Decode 阶段的性能差异

核心发现: | 阶段 | 最佳硬件 | 原因 | |------|---------|------| | Prefill(计算密集) | GPU | 算力最强 | | Decode(内存密集) | GroqRack | 更低 TPOT(但不支持 batching)|

异构 Prefill/Decode Disaggregation: - 将 Prefill 和 Decode 分离到不同硬件资源 - 在特定网络条件下有显著性能收益 - 需要仔细评估网络带宽和 workload 特征

工程价值: ⭐⭐⭐⭐ - 直接指导生产环境的硬件选型决策 - Disaggregation 是 2026 年大模型推理的重要方向

建议分类: LLM Inference / Hardware / GPU / AI Accelerator / Prefill-Decode / arXiv 后续行动: 关注 GroqRack 的生产可用性评估


条目3:AMPD: Efficient Multi-round LLM Inference over Disaggregated Serving

  • URL: https://arxiv.org/html/2602.14516v1
  • 可信度: 高(arXiv 2026)
  • 核心贡献: 针对多轮 LLM 推理场景的 PD disaggregation 优化框架

核心问题: 现有 PD disaggregation 系统忽略多轮推理中 interleaved prefill-decode 工作负载模式: - 后续轮次的 incremental prefill 计算需求 - 两个 phase 的模型部署策略

AMPD 核心设计: - 基于实时负载协调 prefill 工作负载 - 自适应决定计算位置和调度方式 - 规划算法推导最优资源配置和并行策略

工程价值: ⭐⭐⭐⭐ - 多轮对话是生产 Agent 的核心场景 - 对 SGLang 等支持多轮推理的框架有参考价值

建议分类: LLM Inference / Disaggregated Serving / Multi-round / arXiv 后续行动: 对比 AMPD 与现有 vLLM/SGLang 多轮推理实现差异


条目4:SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips (GH200)

  • URL: https://arxiv.org/html/2601.20309v1
  • 可信度: 高(arXiv 2026)
  • 核心贡献: 针对 NVIDIA GH200(GPU-CPU 紧耦合架构)的 SLO 感知推理系统

SuperInfer 两大组件:

  1. RotaSched:首个 SLO 感知的 rotary scheduler - 使用 Virtual Lag Time (VLT) 引导的主动轮换策略 - 维持 Superchip 上的响应性 - 在高请求率下仍能满足 TTFT/TBT SLO

  2. DuplexKV:全双工 KV cache 轮换引擎 - 消除 NVLink-C2C 利用不足问题 - 在 GH200 上 KV cache 在 GPU 和 CPU 间轮换

性能数据: - TTFT SLO attainment 提升最高 74.7% - 保持相当 TBT 和 throughput

工程价值: ⭐⭐⭐⭐ - GH200 是 2026 年高性能推理的新硬件选项 - SLO 感知调度对生产系统有直接价值

建议分类: LLM Inference / Superchip / GH200 / SLO / Scheduling / arXiv 后续行动: 关注 GH200 实际生产部署案例


二、Substack 行业洞察(AI Engineer 角色定义 + Stack 2026)

🔴 高价值


条目S1:What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026

  • URL: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
  • 作者: Alexey (Data/AI 工程垂直 newsletter)
  • 发布时间: 2026
  • 可信度: 高(基于真实职位数据的市场分析)
  • 是否需要核验: 可直接引用,样本量大

核心数据: - 分析了 1000+ AI Engineer 职位描述(Berlin、Amsterdam、London、LA、NYC) - <2% 职位是传统 ML/DL 角色

AI Engineer 2026 工作定义:

"An AI engineer is an engineer who owns the design, evaluation, and production operation of systems built on foundation models."

三类 AI Engineer 岗位: | 类型 | 特征 | 占比 | |------|------|------| | LLM Application Builder | Prompt engineering、RAG、Agent 编排、Eval | 主流 | | ML Infrastructure | 推理优化、模型服务、向量数据库 | 增长中 | | Classical ML/DL | 传统 ML,被标记为 AI Engineer | <2% |

工程价值: ⭐⭐⭐⭐ - 明确 AI Engineer 的职业边界 - 对技能树规划有直接指导意义

建议分类: AI Engineer / Career / Job Market / Substack


条目S2:The $300k Blueprint: How to Become an AI Engineer in 2026

  • URL: https://javarevisited.substack.com/p/the-300k-blueprint-how-to-become
  • 作者: Java Revisited(技术社区垂直 newsletter)
  • 发布时间: 2026
  • 可信度: 中(面向开发者社区的路线图文章)
  • 是否需要核验: 可直接引用工程技能路径

核心内容: 24/7 AI 助手路线图,主打"AI Engineering = Prompt + RAG + Agent + LLM API + Evaluation":

  • LLM API 集成(OpenAI/Anthropic/本地模型)
  • RAG 全链路(Embedding → Vector DB → Retrieval → Rerank)
  • Agent 编排(LangGraph / CrewAI / AutoGen)
  • Evaluation(Harness / RAGAS / LLM-as-Judge)
  • 生产监控(Latency / Cost / Accuracy)

工程价值: ⭐⭐⭐ - 作为 AI Engineering 入门路线图参考 - 技能优先级排序有价值

建议分类: AI Engineer / Career / Roadmap / Substack


条目S3:Complete Agentic AI Roadmap 2026

  • URL: https://aiengineeringinsider.substack.com/p/complete-agentic-ai-roadmap-2026
  • 作者: AI Engineering Insider
  • 发布时间: 2026
  • 可信度: 中高
  • 是否需要核验: 工程决策原则可直接引用

核心框架: Agentic AI = 推理目标 + 工具调用 + 上下文检索 + 工作流协调 + 失败恢复 + 人工介入 + 可审计输出

Multi-Agent 决策树: - 单 Agent 助手 + 工具 - 多 Agent 工作流(Planner/Executor/Verifier/Human Review) - 生产级 Agent(Tracing/Eval/Retries/Guardrails/Cost Monitoring)

工具链格局(2026): - OpenAI Agents SDK:Tracing 覆盖全链路 - LangGraph:持久化、流式、人工介入 - MCP:工具和数据源标准化 - Google ADK:多 Agent 编排、Graph workflow

工程价值: ⭐⭐⭐⭐ - 系统性 Agentic AI 技术栈图 - 可作为知识库 Agent 系统主题页更新的参考

建议分类: Agentic AI / Roadmap / Multi-Agent / MCP / LangGraph / Substack


三、LLM 架构与部署洞察(2026)

🟡 中高价值


ByteByteGo Substack:Top AI GitHub Repositories in 2026

  • URL: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
  • 作者: ByteByteGo(系统设计垂直 newsletter,80W+ 订阅)
  • 发布时间: 2026-03
  • 可信度: 高(行业影响力大)
  • 是否需要核验: 部分条目已核实,部分需更新

核心观点: Dify 是生产就绪的 Agentic workflow 开发平台: - Workflow builder:定义工具调用 Agent - 内置 RAG pipeline 管理 - 多模型支持(OpenAI/Anthropic/开源 LLM) - 使用监控 - 本地和云部署选项

LangChain 应用场景: - 多 Agent 系统 - 工具调用 AI Agent - RAG pipeline - 对话式 AI 应用 - 结构化数据抽取

工程价值: ⭐⭐⭐⭐ - ByteByteGo 是高质量系统设计学习来源 - Dify 和 LangChain 的定位对比有实战价值

建议分类: Dify / LangChain / Agentic Workflow / ByteByteGo / Substack 后续行动: 核实 2026-07 月最新版本功能差异


四、Enterprise RAG 生产架构(2026)

🟡 中高价值


Enterprise RAG in 2026: Beyond Vector Search (Babybots)

  • URL: https://www.babybots.ai/blog/enterprise-rag-architecture-2026
  • 可信度: 中(咨询公司博客,有实战经验)
  • 是否需要核验: 建议结合最新 benchmark 交叉验证

核心观点: - Hybrid RAG = 生产基线:dense + sparse 混合检索,在准确率、成本、治理间平衡 - 向量-only RAG 已被替代:在法律、金融、监管领域不够用

评价:偏咨询风格,但架构演进判断有价值。


五、综合摘要

本轮新增条目(按优先级)

# 条目 优先级 标签
1 LLM Serving Needs Mathematical Optimization (arXiv 2605.01280) ⭐⭐⭐⭐ LLM Inference / Theory / arXiv
2 SuperInfer GH200 SLO-Aware Scheduling (arXiv 2601.20309) ⭐⭐⭐⭐ LLM Inference / GH200 / Superchip
3 AMPD Multi-round Disaggregated Serving (arXiv 2602.14516) ⭐⭐⭐⭐ LLM Inference / PD Disaggregation
4 Prefill/Decode-Aware GPU vs Accelerator Eval (arXiv 2606.17104) ⭐⭐⭐⭐ LLM Inference / Hardware / GPU
5 AI Engineer Role: 1000+ Job Desc Analysis ⭐⭐⭐⭐ AI Engineer / Career / Market
6 Complete Agentic AI Roadmap 2026 ⭐⭐⭐⭐ Agentic AI / Roadmap / Multi-Agent
7 $300k Blueprint: Become AI Engineer 2026 ⭐⭐⭐ AI Engineer / Career / Roadmap
8 ByteByteGo: Top AI GitHub Repos 2026 ⭐⭐⭐ ByteByteGo / Dify / LangChain
9 Enterprise RAG Beyond Vector Search 2026 ⭐⭐⭐ Enterprise RAG / Hybrid Search

建议写入路径

/shared/research-kb/inbox/jay/2026-07-08-1335-arxiv-inference-systems-latest-substack-stack-2026.md

建议精读 / 审稿

  • ⭐⭐⭐⭐ 精读:LLM Serving Needs Mathematical Optimization(推理系统理论核心)
  • ⭐⭐⭐⭐ 精读:SuperInfer GH200(新一代硬件推理参考)
  • ⭐⭐⭐ 审稿:AI Engineer 1000+ Job Desc(技能树规划参考)

后续行动

  1. 关注 arXiv 2605.01280 中的具体算法建议是否有 vLLM/SGLang 实现
  2. GH200 生产案例跟进
  3. 更新知识库"AI Engineer 技能图谱"主题页(纳入 $300k Blueprint 和 Job Desc 分析)

草稿生成时间:2026-07-08 13:35 CST 来源:arXiv、Tavily Web Search、Substack 撰写:Jay