工程筛选 · Addy Osmani LLM 工作流 + AI Engineer 职位技能图谱 · 2026-10-03
主题: 工程工作流实践 + 职位技能需求实证分析 检索范围: Substack(Addy Osmani、McKay Johns)、dataskew.io(职位数据分析) 时间戳: 2026-10-03 14:50 CST
一、Addy Osmani:LLM 编码工作流实战(⭐⭐⭐⭐)
来源
- 专栏: Addy Osmani(addyo.substack.com)
- 标题: My LLM coding workflow going into 2026
- 时间: 2025 年底(原文)
- 可信度: 高(Google Chrome & Web Platform 工程总监,工程实践极强)
核心工程洞察
1. 计划先行:Specs Before Code
传统模式:需求 → 直接写代码 → 修 bug
Osmani 模式:需求 → 写 SPEC(规格文档)→ 评审 SPEC → AI 辅助实现 → 测试验证
"Don't just throw wishes at the LLM — begin by defining the problem and planning a solution."
关键工程原则: AI 是放大器,不是起点。如果工程师本人缺乏系统设计能力,AI 会放大混乱而非生产力。
2. 明确职责边界:AI 负责什么,工程师负责什么
| 领域 | AI 擅长 | 工程师必须掌控 |
|---|---|---|
| Boilerplate 代码生成 | ✅ | ❌ |
| 重复模式展开 | ✅ | ❌ |
| 接口设计 | ❌ | ✅ 核心职责 |
| 系统架构决策 | ❌ | ✅ 核心职责 |
| 测试用例生成 | ✅ | ✅ 评审+补充 |
| 边界条件识别 | 部分 | ✅ 最终责任 |
3. 具体工作流模式
"Specs → AI 实现 → Code Review → 测试" 闭环:
Step 1: Human 写 SPEC(接口定义、边界条件、错误处理策略)
Step 2: AI 根据 SPEC 生成代码(结构化输出,减少幻觉)
Step 3: Human Code Review(重点:接口契约、错误处理、安全性)
Step 4: 补充 AI 遗漏的边界 case 测试
Step 5: 迭代
"Background Messages"注入模式(高价值工程细节):
// 在 system prompt 中注入上下文
const backgroundMessage = `
The user has asked this question: {question}
They uploaded this data: {data}
Use the context of the question and the data to create a spreadsheet...
`
// LLM 可直接使用注入的上下文执行复杂任务
4. Simon Willison 的补充洞察(Osmani 引用)
"LLMs reward existing best practices — things like writing clear specs, having good tests, doing code reviews, all become even more powerful when an AI is involved."
工程意义: 资深工程师的技能在 AI 时代不会被削弱,反而被放大;新人不具备这些技能时 AI 也帮不了他们。
评价
⭐⭐⭐⭐ 精选参考。 这是目前最具体的 AI 辅助编码工作流实践指南之一,不是泛泛而谈,而是具体到"谁做什么"和"哪个环节"。SPEC first 模式与 TDD 有异曲同工之妙,但针对 AI 辅助场景重新设计。适合作为团队 AI 工程实践规范的参考骨架。
不复制原文,只引用链接: https://addyo.substack.com/p/my-llm-coding-workflow-going-into
丢弃条目关联
丢弃:McKay Johns Substack "Top AI Engineering Skills for 2026" - 丢弃理由:内容覆盖面广但缺乏具体工程细节;上下文管理、API 层、Evaluation 等话题有提及但无命令、无源码、无实测数据;与 Osmani 这篇相比工程深度不足。适合入门图谱但不适合知识库精读条目。
二、AI Engineer 职位技能实证分析(⭐⭐⭐⭐)
来源
- 平台: dataskew.io/roadmaps/ai-engineering
- 标题: AI Engineer Roadmap 2026: From LLM APIs to Production (Step-by-Step)
- 数据来源: 真实职位描述(Job Descriptions)分析,非调查问卷
- 可信度: 中高(数据来自真实 JDs,方法论可查)
核心发现:招聘真正看重什么
职位描述中出现频率最高的技能(按优先级)
| 排名 | 技能 | 出现场景 |
|---|---|---|
| 🥇 最稀缺 | Evaluation:设计 eval pipeline、golden dataset、LLM-as-judge | 几乎所有 senior AI engineer JD |
| 🥈 | RAG 和 agents: 构建生产 RAG 系统;构建和评测 agentic 工作流(带工具调用) | 核心工程能力 |
| 🥉 | 可靠性和安全: 添加 guardrails、处理 prompt injection、生产质量监控 | 工程成熟度标志 |
| 4 | 系统思维: 判断 AI 是否是正确工具,先评估再构建 | 高阶职位要求 |
三个核心生产项目(直接对应 JD 要求)
"Build three end-to-end projects: a production RAG system with retrieval evaluation, an LLM agent with tool use and a failure-mode evaluation, and a reusable LLM evaluation pipeline with a golden dataset and LLM-as-judge."
项目 1:生产级 RAG 系统(含检索评测) - 要素:chunking 策略选择、embedding 模型对比、retrieval 评测(HitRate/NDCG)、端到端 latency 基准 - 对应 JD 关键词:retrieval evaluation、chunk size optimization、reranking
项目 2:LLM Agent(含工具调用和失败模式评测) - 要素:ReAct/MRP 模式、tool schema 设计、failure mode 分类(幻觉/工具调用错误/死循环)、cost 追踪 - 对应 JD 关键词:agentic workflows、tool use、failure-mode evaluation
项目 3:可复用 LLM 评测 pipeline(金标准数据集 + LLM-as-judge) - 要素:golden dataset 构建、LLM-as-judge prompt 设计、离线评测 + 在线监控、回归测试 - 对应 JD 关键词:LLM-as-judge、eval pipeline、regression
Evaluation 技能详细拆解(最高优先级)
传统 ML metrics( entropy / cross-entropy / perplexity)
↓
RAG-specific metrics:
- Faithfulness:输出是否仅依赖检索上下文?
- Instruction Following:模型是否遵守长度/语调/格式约束?
- Semantic Similarity:输出与参考答案的语义相似度
↓
LLM-as-Judge:用强模型评价便宜模型的输出
- 通常达到 80%+ 与人类评估相关性
- 成本是人工评估的一小部分
↓
生产监控:
- 嵌入漂移(vector space shift)
- GPU/内存利用率(P95 latency、GPU 饱和度)
- Batch vs 实时一致性
评价
⭐⭐⭐⭐ 精选。 这是目前最接近"真实 JD 数据"的 AI Engineer 学习路径分析,三个项目直接对应招聘需求。对于知识库来说,这个 roadmap 的价值在于:提供了"什么是可面试的 AI 工程能力"的实证锚点,可用于校验学习路径的完备性。
不复制原文,只引用链接: https://dataskew.io/roadmaps/ai-engineering
三、本轮筛选汇总
保留条目
| 条目 | 来源 | 理由 | 标签 |
|---|---|---|---|
| Addy Osmani LLM 编码工作流 | addyo.substack.com | 工程总监实践;SPEC first;AI/工程师职责边界;具体工作流模式 | workflow, engineering-practice, productivity |
| AI Engineer JD 实证技能图谱 | dataskew.io | 真实 JD 数据;Evaluation 最稀缺;三个核心生产项目 | career, skills, evaluation, job-market |
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| McKay Johns "Top AI Engineering Skills 2026" | 覆盖面广但无工程细节;上下文管理、API 层等主题提及但无命令/源码/实测 |
| Javarevisited Substack roadmap(付费 + 内容重复) | 付费墙;核心内容与 dataskew 条目重叠 |
建议写入路径
/shared/research-kb/inbox/jay/2026-10-03-1450-osmani-llm-workflow-dataskew-aieng-roadmap.md
后续行动建议
- Osmani 工作流 → 团队规范草案: 将 SPEC first + AI/工程师职责边界模式转化为团队 AI 工程规范参考文件。
- dataskew 三个项目 → 学习路径完善: 对照三个核心项目(生产 RAG / Agent 失败模式评测 / LLM-as-judge pipeline)检查现有知识库中对应内容的覆盖度。
- Evaluation 技能专项核验: 当前知识库中 RAG 评测、LLM-as-judge、金标准数据集构建的内容是否足够?建议专项补充。
本轮筛选完毕。 两条精选分别提供工程实践骨架(工作流方法论)和市场需求实证(技能优先级),形成从"怎么干"到"市场要什么"的完整闭环。与上午的 Agent Stack 架构层共同构成 AI Engineering 知识体系的核心锚点。