工程筛选草稿 · 2026-09-02 晚间 · Jay
主题: MLSys 2026 推理系统 · Agent Coding 工程实践 · Inference Engineering 职业定义
检索范围
| 渠道 | 关键词 | 时间 |
|---|---|---|
| Tavily | MLSys 2026 LLM inference profiling eBPF | 近一月 |
| Tavily | agent coding workflow engineering Substack 2026 | 近一月 |
| Tavily | inference engineering pragmatic engineer 2026 | 近一月 |
| MLSys 2026 | Official schedule + paper list | 2026-05 |
候选条目(7条)
1. ProfInfer: An eBPF-based Fine-Grained LLM Inference Profiler
- 来源: arXiv cs.SE (2601.20755) | 会议: MLSys 2026 Industry Track
- URL: https://arxiv.org/abs/2601.20755
- 作者: Bohua Zou, Debayan Roy et al.
- 核心观点:
eBPF 作为 LLM 推理细粒度性能剖析层,无需侵入式插桩即可覆盖:每个 forward pass → 计算图 → operator 执行 → processor thread 的完整链路。收集 hardware counter(硬件计数器),提供 timeline view / DAG 可视化 / op-level plot,将模型结构与硬件行为关联。 - 实测数据(Rubik Pi Adreno GPU):矩阵大小决定 CPU/GPU 选择——大矩阵(LM Head)GPU 性能骤降;Gemma2-2B / Qwen2.5-1.5B 的 LM Head 因 OpenCL kernel 尺寸限制无法 offload 到 GPU
- 结论:选择性算子 offloading(按 tensor 维度)可提升推理速度
- 工程价值: ⭐⭐⭐⭐⭐
填补 kernel 级 profiling 工具链空白;eBPF 非侵入式,适合生产环境;覆盖端到端 trace。高价值保留。 - 可复现性: 高 — 开源artifact,MLSys 2026 官方 acceptance
- 与已覆盖条目关系: 与 morning filter 中的 "Ken Huang LLM Inference Stack" 形成互补——前者关注架构蓝图,本文关注 profiling 方法论
2. SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
- 来源: MLSys 2026 | 作者: Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang
- URL: https://mlsys.org/virtual/2026/papers.html?filter=titles
- 核心观点: SLO 感知的旋转调度 + 内存管理,针对 LLM inference on Superchips(异构超级芯片)。调度层与内存管理层联合优化。
- 工程价值: ⭐⭐⭐⭐
MLSys 2026 Research Track,是 vLLM/SGLang 之外的生产调度新思路。保留。 - 可复现性: 待确认 — 需要获取 PDF 确认是否有公开代码
3. FaaScale: Unlocking Fast LLM Scaling for Serverless Inference
- 来源: MLSys 2026 | Research Track
- 作者: Minchen Yu, Rui Yang et al.
- 核心观点: Serverless 环境下 LLM 快速扩缩容,聚焦无服务器推理的 scaling 挑战。
- 工程价值: ⭐⭐⭐
云原生 serverless + LLM serving 交叉点,适合边缘/函数计算场景。中等价值,降级保留。
4. XProf: An Open, Scalable, and Extensible Profiling System for the Modern ML Stack
- 来源: MLSys 2026 | Google 等多机构
- URL: https://mlsys.org/virtual/2026/papers.html?filter=titles
- 作者: Robert Hundt, Naveen Kumar et al. (Google, 多个机构)
- 核心观点: 通用 ML Stack 可扩展 profiling 系统,与 ProfInfer 互补——ProfInfer 专注 LLM inference,XProf 覆盖更广的 modern ML stack。
- 工程价值: ⭐⭐⭐⭐
Google 背书 + MLSys 2026,适合作为 ML 系统 profiling 基础设施参考。保留。
5. Addy Osmani: My LLM Coding Workflow into 2026
- 来源: Addy Osmani Substack (addy.substack.com)
- URL: https://addyo.substack.com/p/my-llm-coding-workflow-going-into
- 核心观点:
- 监督式使用:不让 agent 独立完成整个任务,保持人在回路监控每个步骤
- 小步迭代:大任务拆成 ticket / step,避免 monolithic 提示;每个 step 专注单一任务
- CLAUDE.md 工程:通过项目级 guidelines 文件(类似 .claude)注入代码风格/偏好/Lint 规则
- 并行多 agent(试验性):Conductor 等编排工具并行运行 3-4 个 agent,但"精神负担大"——大部分场景推荐单 agent + review agent
- 测试是关键基础设施:好测试套件 = AI coding agent 的安全网;无测试时 agent 可能自信地破坏多个功能
- 工程价值: ⭐⭐⭐⭐
来自 Google 工程师的实操工程洞察,不是理论文章。保留——coding agent 工程实践首选参考。
6. Gergely Orosz: What is Inference Engineering? (Pragmatic Engineer)
- 来源: Pragmatic Engineer Newsletter (newsletter.pragmaticengineer.com)
- URL: https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
- 核心观点:
- Inference Engineering 定义:LLM inference 的工程化——不只是调用 API,而是涵盖 self-hosted 模型、TCO 控制、性能调优、成本优化的专职工程领域
- 2026 年 AI 无处不在 → inference engineering 成为软工必备技能
- 核心技能:模型量化/压缩、缓存策略、路由层、batch sizing、成本估算
- 自主 inference stack(基于 open model)= 控制权 + 定价权
- 工程价值: ⭐⭐⭐
职业视角定义 + 工程技能树。作为背景参考,补充 inference engineering 知识体系。
7. Shantanu Ladhwe: 9 Lessons from 750+ Production LLM/Agent Deployments
- 来源: LinkedIn Post (广泛传播)
- 核心观点(精选工程条目):
- Hybrid > pure vector:BM25 + vector search 组合;metadata filter 提升召回
- RAG ≠ Enough:query classifier / NER 导航检索层;训练任务特定 SLM bi-encoder
- Data beats defaults:垂域 embeddings 需要在 query+doc pairs 上微调
- Keep it simple:Rule-based agent + LLM routing > multi-hop;agent 数量最少化
- 模型分级:简单任务用小模型,LLM 只用于真正复杂的部分;量化 + 缓存优先
- Prompt 版本化 + A/B 测试:把 prompts 当成 first-class artifact
- Latency / Quality / Cost = Pick 2:三者不可兼得,定义预算倒推基础设施
- 工程价值: ⭐⭐⭐
来自 AI/ML Engineering Manager 的真实生产经验,涵盖 RAG/Agent/LLM 全栈。作为工程 checklist 参考。
高价值条目(筛选结论)
| # | 条目 | 价值 | 理由 |
|---|---|---|---|
| 1 | ProfInfer (MLSys 2026, eBPF LLM Profiler) | ⭐⭐⭐⭐⭐ | MLSys 2026 Industry Track;kernel级profiling;非侵入式;可关联GPU行为;与vLLM/SGLang正交 |
| 2 | SuperInfer (MLSys 2026, SLO-aware Scheduling) | ⭐⭐⭐⭐ | SLO+内存管理联合优化;异构超级芯片;vLLM/SGLang替代/补充方案 |
| 4 | XProf (MLSys 2026, Extensible ML Profiler) | ⭐⭐⭐⭐ | Google背书;MLSys 2026;现代ML stack可观测性基础设施 |
| 5 | Addy Osmani LLM Coding Workflow | ⭐⭐⭐⭐ | Google工程师实操;监督式agent使用;CLAUDE.md工程;测试即安全网 |
| 6 | Gergely Orosz: What is Inference Engineering | ⭐⭐⭐ | 职业定义+技能树;补充inference engineering知识体系 |
| 3 | FaaScale (Serverless LLM) | ⭐⭐⭐ | 云原生serverless+LLM交叉;降级保留 |
| 7 | Shantanu Ladhwe 750+ Deployments | ⭐⭐⭐ | 生产checklist;RAG/Agent/LLM全栈经验 |
分类标签
#mlsys2026 #inference-profiling #ebpf #llm-inference #coding-agents #agent-engineering #observability #superchips #production-llm #slo-scheduling
建议写入路径
/shared/research-kb/inbox/jay/2026-09-02T1950-jay-engineering-filter-evening.md
后续行动建议
-
精读优先级(本周)
- ProfInfer PDF:重点看 eBPF hook 点设计 + timeline 可视化实现 + Adreno GPU selective offloading 实测数据
- SuperInfer PDF:SLO 调度算法 + 内存管理机制 -
主题页更新建议
-inference-engineering主题页:新增 "Inference Engineering 定义"(Gergely Orosz)+ MLSys 2026 推理系统论文清单
-llm-inference主题页:新增 ProfInfer / SuperInfer / XProf 作为 MLSys 2026 基础设施层
-coding-agents主题页:新增 Addy Osmani 实操工程实践(监督式使用 / CLAUDE.md / 测试安全网) -
CSDN 核查
- 本轮无高价值 CSDN 候选(全部为 arXiv / Substack / Newsletter)
- 今日已有 CSDN 条目:2026-09-02T0820 / T1220 已覆盖,待 Tom 二次审稿 -
下一步检索
- MLSys 2026 完整论文列表:https://mlsys.org/virtual/2026/papers.html
- Papers with Code: 搜索 "ProfInfer" / "SuperInfer" 有无公开代码仓库
- Hugging Face: 搜索是否有基于 ProfInfer 思想的实际 profiling 工具集成
本轮是否写入:是 → 写入 /shared/research-kb/inbox/jay/2026-09-02T1950-jay-engineering-filter-evening.md
GitHub 写入:未执行(本任务规则禁止并发写仓库)
草稿状态:待 Tom 审稿后合并至 review 目录