工程筛选 · Addy Osmani LLM 工作流 + AI Engineer 职位技能图谱 · 2026-10-03

主题: 工程工作流实践 + 职位技能需求实证分析 检索范围: Substack(Addy Osmani、McKay Johns)、dataskew.io(职位数据分析) 时间戳: 2026-10-03 14:50 CST


一、Addy Osmani:LLM 编码工作流实战(⭐⭐⭐⭐)

来源

  • 专栏: Addy Osmani(addyo.substack.com)
  • 标题: My LLM coding workflow going into 2026
  • 时间: 2025 年底(原文)
  • 可信度: 高(Google Chrome & Web Platform 工程总监,工程实践极强)

核心工程洞察

1. 计划先行:Specs Before Code

传统模式:需求 → 直接写代码 → 修 bug
Osmani 模式:需求 → 写 SPEC(规格文档)→ 评审 SPEC → AI 辅助实现 → 测试验证

"Don't just throw wishes at the LLM — begin by defining the problem and planning a solution."

关键工程原则: AI 是放大器,不是起点。如果工程师本人缺乏系统设计能力,AI 会放大混乱而非生产力。

2. 明确职责边界:AI 负责什么,工程师负责什么

领域 AI 擅长 工程师必须掌控
Boilerplate 代码生成 ✅ ❌
重复模式展开 ✅ ❌
接口设计 ❌ ✅ 核心职责
系统架构决策 ❌ ✅ 核心职责
测试用例生成 ✅ ✅ 评审+补充
边界条件识别 部分 ✅ 最终责任

3. 具体工作流模式

"Specs → AI 实现 → Code Review → 测试" 闭环:

Step 1: Human 写 SPEC(接口定义、边界条件、错误处理策略)
Step 2: AI 根据 SPEC 生成代码(结构化输出,减少幻觉)
Step 3: Human Code Review(重点:接口契约、错误处理、安全性)
Step 4: 补充 AI 遗漏的边界 case 测试
Step 5: 迭代

"Background Messages"注入模式(高价值工程细节):

// 在 system prompt 中注入上下文
const backgroundMessage = `
The user has asked this question: {question}
They uploaded this data: {data}
Use the context of the question and the data to create a spreadsheet...
`
// LLM 可直接使用注入的上下文执行复杂任务

4. Simon Willison 的补充洞察(Osmani 引用)

"LLMs reward existing best practices — things like writing clear specs, having good tests, doing code reviews, all become even more powerful when an AI is involved."

工程意义: 资深工程师的技能在 AI 时代不会被削弱,反而被放大;新人不具备这些技能时 AI 也帮不了他们。

评价

⭐⭐⭐⭐ 精选参考。 这是目前最具体的 AI 辅助编码工作流实践指南之一,不是泛泛而谈,而是具体到"谁做什么"和"哪个环节"。SPEC first 模式与 TDD 有异曲同工之妙,但针对 AI 辅助场景重新设计。适合作为团队 AI 工程实践规范的参考骨架。

不复制原文,只引用链接: https://addyo.substack.com/p/my-llm-coding-workflow-going-into

丢弃条目关联

丢弃:McKay Johns Substack "Top AI Engineering Skills for 2026" - 丢弃理由:内容覆盖面广但缺乏具体工程细节;上下文管理、API 层、Evaluation 等话题有提及但无命令、无源码、无实测数据;与 Osmani 这篇相比工程深度不足。适合入门图谱但不适合知识库精读条目。


二、AI Engineer 职位技能实证分析(⭐⭐⭐⭐)

来源

  • 平台: dataskew.io/roadmaps/ai-engineering
  • 标题: AI Engineer Roadmap 2026: From LLM APIs to Production (Step-by-Step)
  • 数据来源: 真实职位描述(Job Descriptions)分析,非调查问卷
  • 可信度: 中高(数据来自真实 JDs,方法论可查)

核心发现:招聘真正看重什么

职位描述中出现频率最高的技能(按优先级)

排名 技能 出现场景
🥇 最稀缺 Evaluation:设计 eval pipeline、golden dataset、LLM-as-judge 几乎所有 senior AI engineer JD
🥈 RAG 和 agents: 构建生产 RAG 系统;构建和评测 agentic 工作流(带工具调用) 核心工程能力
🥉 可靠性和安全: 添加 guardrails、处理 prompt injection、生产质量监控 工程成熟度标志
4 系统思维: 判断 AI 是否是正确工具,先评估再构建 高阶职位要求

三个核心生产项目(直接对应 JD 要求)

"Build three end-to-end projects: a production RAG system with retrieval evaluation, an LLM agent with tool use and a failure-mode evaluation, and a reusable LLM evaluation pipeline with a golden dataset and LLM-as-judge."

项目 1:生产级 RAG 系统(含检索评测) - 要素:chunking 策略选择、embedding 模型对比、retrieval 评测(HitRate/NDCG)、端到端 latency 基准 - 对应 JD 关键词:retrieval evaluation、chunk size optimization、reranking

项目 2:LLM Agent(含工具调用和失败模式评测) - 要素:ReAct/MRP 模式、tool schema 设计、failure mode 分类(幻觉/工具调用错误/死循环)、cost 追踪 - 对应 JD 关键词:agentic workflows、tool use、failure-mode evaluation

项目 3:可复用 LLM 评测 pipeline(金标准数据集 + LLM-as-judge) - 要素:golden dataset 构建、LLM-as-judge prompt 设计、离线评测 + 在线监控、回归测试 - 对应 JD 关键词:LLM-as-judge、eval pipeline、regression

Evaluation 技能详细拆解(最高优先级)

传统 ML metrics( entropy / cross-entropy / perplexity)
    ↓
RAG-specific metrics:
  - Faithfulness:输出是否仅依赖检索上下文?
  - Instruction Following:模型是否遵守长度/语调/格式约束?
  - Semantic Similarity:输出与参考答案的语义相似度
    ↓
LLM-as-Judge:用强模型评价便宜模型的输出
  - 通常达到 80%+ 与人类评估相关性
  - 成本是人工评估的一小部分
    ↓
生产监控:
  - 嵌入漂移(vector space shift)
  - GPU/内存利用率(P95 latency、GPU 饱和度)
  - Batch vs 实时一致性

评价

⭐⭐⭐⭐ 精选。 这是目前最接近"真实 JD 数据"的 AI Engineer 学习路径分析,三个项目直接对应招聘需求。对于知识库来说,这个 roadmap 的价值在于:提供了"什么是可面试的 AI 工程能力"的实证锚点,可用于校验学习路径的完备性。

不复制原文,只引用链接: https://dataskew.io/roadmaps/ai-engineering


三、本轮筛选汇总

保留条目

条目 来源 理由 标签
Addy Osmani LLM 编码工作流 addyo.substack.com 工程总监实践;SPEC first;AI/工程师职责边界;具体工作流模式 workflow, engineering-practice, productivity
AI Engineer JD 实证技能图谱 dataskew.io 真实 JD 数据;Evaluation 最稀缺;三个核心生产项目 career, skills, evaluation, job-market

丢弃条目

条目 丢弃理由
McKay Johns "Top AI Engineering Skills 2026" 覆盖面广但无工程细节;上下文管理、API 层等主题提及但无命令/源码/实测
Javarevisited Substack roadmap(付费 + 内容重复) 付费墙;核心内容与 dataskew 条目重叠

建议写入路径

/shared/research-kb/inbox/jay/2026-10-03-1450-osmani-llm-workflow-dataskew-aieng-roadmap.md

后续行动建议

  1. Osmani 工作流 → 团队规范草案: 将 SPEC first + AI/工程师职责边界模式转化为团队 AI 工程规范参考文件。
  2. dataskew 三个项目 → 学习路径完善: 对照三个核心项目(生产 RAG / Agent 失败模式评测 / LLM-as-judge pipeline)检查现有知识库中对应内容的覆盖度。
  3. Evaluation 技能专项核验: 当前知识库中 RAG 评测、LLM-as-judge、金标准数据集构建的内容是否足够?建议专项补充。

本轮筛选完毕。 两条精选分别提供工程实践骨架(工作流方法论)和市场需求实证(技能优先级),形成从"怎么干"到"市场要什么"的完整闭环。与上午的 Agent Stack 架构层共同构成 AI Engineering 知识体系的核心锚点。