工程筛选草稿 · 2026-09-02 晚间 · Jay

主题: MLSys 2026 推理系统 · Agent Coding 工程实践 · Inference Engineering 职业定义


检索范围

渠道 关键词 时间
Tavily MLSys 2026 LLM inference profiling eBPF 近一月
Tavily agent coding workflow engineering Substack 2026 近一月
Tavily inference engineering pragmatic engineer 2026 近一月
MLSys 2026 Official schedule + paper list 2026-05

候选条目(7条)

1. ProfInfer: An eBPF-based Fine-Grained LLM Inference Profiler

  • 来源: arXiv cs.SE (2601.20755) | 会议: MLSys 2026 Industry Track
  • URL: https://arxiv.org/abs/2601.20755
  • 作者: Bohua Zou, Debayan Roy et al.
  • 核心观点:
    eBPF 作为 LLM 推理细粒度性能剖析层,无需侵入式插桩即可覆盖:每个 forward pass → 计算图 → operator 执行 → processor thread 的完整链路。收集 hardware counter(硬件计数器),提供 timeline view / DAG 可视化 / op-level plot,将模型结构与硬件行为关联。
  • 实测数据(Rubik Pi Adreno GPU):矩阵大小决定 CPU/GPU 选择——大矩阵(LM Head)GPU 性能骤降;Gemma2-2B / Qwen2.5-1.5B 的 LM Head 因 OpenCL kernel 尺寸限制无法 offload 到 GPU
  • 结论:选择性算子 offloading(按 tensor 维度)可提升推理速度
  • 工程价值: ⭐⭐⭐⭐⭐
    填补 kernel 级 profiling 工具链空白;eBPF 非侵入式,适合生产环境;覆盖端到端 trace。高价值保留。
  • 可复现性: 高 — 开源artifact,MLSys 2026 官方 acceptance
  • 与已覆盖条目关系: 与 morning filter 中的 "Ken Huang LLM Inference Stack" 形成互补——前者关注架构蓝图,本文关注 profiling 方法论

2. SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips

  • 来源: MLSys 2026 | 作者: Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang
  • URL: https://mlsys.org/virtual/2026/papers.html?filter=titles
  • 核心观点: SLO 感知的旋转调度 + 内存管理,针对 LLM inference on Superchips(异构超级芯片)。调度层与内存管理层联合优化。
  • 工程价值: ⭐⭐⭐⭐
    MLSys 2026 Research Track,是 vLLM/SGLang 之外的生产调度新思路。保留。
  • 可复现性: 待确认 — 需要获取 PDF 确认是否有公开代码

3. FaaScale: Unlocking Fast LLM Scaling for Serverless Inference

  • 来源: MLSys 2026 | Research Track
  • 作者: Minchen Yu, Rui Yang et al.
  • 核心观点: Serverless 环境下 LLM 快速扩缩容,聚焦无服务器推理的 scaling 挑战。
  • 工程价值: ⭐⭐⭐
    云原生 serverless + LLM serving 交叉点,适合边缘/函数计算场景。中等价值,降级保留。

4. XProf: An Open, Scalable, and Extensible Profiling System for the Modern ML Stack

  • 来源: MLSys 2026 | Google 等多机构
  • URL: https://mlsys.org/virtual/2026/papers.html?filter=titles
  • 作者: Robert Hundt, Naveen Kumar et al. (Google, 多个机构)
  • 核心观点: 通用 ML Stack 可扩展 profiling 系统,与 ProfInfer 互补——ProfInfer 专注 LLM inference,XProf 覆盖更广的 modern ML stack。
  • 工程价值: ⭐⭐⭐⭐
    Google 背书 + MLSys 2026,适合作为 ML 系统 profiling 基础设施参考。保留。

5. Addy Osmani: My LLM Coding Workflow into 2026

  • 来源: Addy Osmani Substack (addy.substack.com)
  • URL: https://addyo.substack.com/p/my-llm-coding-workflow-going-into
  • 核心观点:
  • 监督式使用:不让 agent 独立完成整个任务,保持人在回路监控每个步骤
  • 小步迭代:大任务拆成 ticket / step,避免 monolithic 提示;每个 step 专注单一任务
  • CLAUDE.md 工程:通过项目级 guidelines 文件(类似 .claude)注入代码风格/偏好/Lint 规则
  • 并行多 agent(试验性):Conductor 等编排工具并行运行 3-4 个 agent,但"精神负担大"——大部分场景推荐单 agent + review agent
  • 测试是关键基础设施:好测试套件 = AI coding agent 的安全网;无测试时 agent 可能自信地破坏多个功能
  • 工程价值: ⭐⭐⭐⭐
    来自 Google 工程师的实操工程洞察,不是理论文章。保留——coding agent 工程实践首选参考。

6. Gergely Orosz: What is Inference Engineering? (Pragmatic Engineer)

  • 来源: Pragmatic Engineer Newsletter (newsletter.pragmaticengineer.com)
  • URL: https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
  • 核心观点:
  • Inference Engineering 定义:LLM inference 的工程化——不只是调用 API,而是涵盖 self-hosted 模型、TCO 控制、性能调优、成本优化的专职工程领域
  • 2026 年 AI 无处不在 → inference engineering 成为软工必备技能
  • 核心技能:模型量化/压缩、缓存策略、路由层、batch sizing、成本估算
  • 自主 inference stack(基于 open model)= 控制权 + 定价权
  • 工程价值: ⭐⭐⭐
    职业视角定义 + 工程技能树。作为背景参考,补充 inference engineering 知识体系。

7. Shantanu Ladhwe: 9 Lessons from 750+ Production LLM/Agent Deployments

  • 来源: LinkedIn Post (广泛传播)
  • 核心观点(精选工程条目):
  • Hybrid > pure vector:BM25 + vector search 组合;metadata filter 提升召回
  • RAG ≠ Enough:query classifier / NER 导航检索层;训练任务特定 SLM bi-encoder
  • Data beats defaults:垂域 embeddings 需要在 query+doc pairs 上微调
  • Keep it simple:Rule-based agent + LLM routing > multi-hop;agent 数量最少化
  • 模型分级:简单任务用小模型,LLM 只用于真正复杂的部分;量化 + 缓存优先
  • Prompt 版本化 + A/B 测试:把 prompts 当成 first-class artifact
  • Latency / Quality / Cost = Pick 2:三者不可兼得,定义预算倒推基础设施
  • 工程价值: ⭐⭐⭐
    来自 AI/ML Engineering Manager 的真实生产经验,涵盖 RAG/Agent/LLM 全栈。作为工程 checklist 参考。

高价值条目(筛选结论)

# 条目 价值 理由
1 ProfInfer (MLSys 2026, eBPF LLM Profiler) ⭐⭐⭐⭐⭐ MLSys 2026 Industry Track;kernel级profiling;非侵入式;可关联GPU行为;与vLLM/SGLang正交
2 SuperInfer (MLSys 2026, SLO-aware Scheduling) ⭐⭐⭐⭐ SLO+内存管理联合优化;异构超级芯片;vLLM/SGLang替代/补充方案
4 XProf (MLSys 2026, Extensible ML Profiler) ⭐⭐⭐⭐ Google背书;MLSys 2026;现代ML stack可观测性基础设施
5 Addy Osmani LLM Coding Workflow ⭐⭐⭐⭐ Google工程师实操;监督式agent使用;CLAUDE.md工程;测试即安全网
6 Gergely Orosz: What is Inference Engineering ⭐⭐⭐ 职业定义+技能树;补充inference engineering知识体系
3 FaaScale (Serverless LLM) ⭐⭐⭐ 云原生serverless+LLM交叉;降级保留
7 Shantanu Ladhwe 750+ Deployments ⭐⭐⭐ 生产checklist;RAG/Agent/LLM全栈经验

分类标签

#mlsys2026 #inference-profiling #ebpf #llm-inference #coding-agents #agent-engineering #observability #superchips #production-llm #slo-scheduling


建议写入路径

/shared/research-kb/inbox/jay/2026-09-02T1950-jay-engineering-filter-evening.md

后续行动建议

  1. 精读优先级(本周)
    - ProfInfer PDF:重点看 eBPF hook 点设计 + timeline 可视化实现 + Adreno GPU selective offloading 实测数据
    - SuperInfer PDF:SLO 调度算法 + 内存管理机制

  2. 主题页更新建议
    - inference-engineering 主题页:新增 "Inference Engineering 定义"(Gergely Orosz)+ MLSys 2026 推理系统论文清单
    - llm-inference 主题页:新增 ProfInfer / SuperInfer / XProf 作为 MLSys 2026 基础设施层
    - coding-agents 主题页:新增 Addy Osmani 实操工程实践(监督式使用 / CLAUDE.md / 测试安全网)

  3. CSDN 核查
    - 本轮无高价值 CSDN 候选(全部为 arXiv / Substack / Newsletter)
    - 今日已有 CSDN 条目:2026-09-02T0820 / T1220 已覆盖,待 Tom 二次审稿

  4. 下一步检索
    - MLSys 2026 完整论文列表:https://mlsys.org/virtual/2026/papers.html
    - Papers with Code: 搜索 "ProfInfer" / "SuperInfer" 有无公开代码仓库
    - Hugging Face: 搜索是否有基于 ProfInfer 思想的实际 profiling 工具集成


本轮是否写入 → 写入 /shared/research-kb/inbox/jay/2026-09-02T1950-jay-engineering-filter-evening.md
GitHub 写入:未执行(本任务规则禁止并发写仓库)
草稿状态:待 Tom 审稿后合并至 review 目录