LLM 工程实践筛选报告 · Jay · 2026-08-29
任务概述
- 筛选主题:LLM/AI Agent 工程实践(环境搭建、错误排查、性能 Benchmark、生产代码质量)
- 检索范围:arXiv、GitHub Issues、vLLM Forum、Substack(Addy Osmani/Sebastian Raschka/AI Engineer/Paolo Perrone)、Martin Fowler、llama.cpp 周报
- 本次权重:真实环境/命令/错误/源码/性能数据/可复现步骤
一、保留条目
✅ 条目 1:Addy Osmani — "My LLM coding workflow going into 2026"
来源:https://addyo.substack.com/p/my-llm-coding-workflow-going-into
作者:Addy Osmani(Google 工程师,Chrome team)
类型:Substack 工程笔记
可信度:⭐⭐⭐⭐⭐(一手工程经验,非 SEO 内容)
核心工程要点: 1. Spec-first 流程:先用推理模型生成项目计划,再让代码模型逐块实现,每块可独立验证 2. Context Packing:把所有约束、示例、禁止事项一次性塞入 context,而非让 LLM 猜测 3. 分块输出原则:禁止一次生成大段代码,逐功能/逐 ticket 小步迭代 4. TDD with LLMs:评论区有工程团队讨论 TDD 作为 LLM 输出质量控制手段的实践
保留理由:Google 工程师一线经验,包含明确的工作流原则,非泛泛而谈的 prompt 技巧。
后续行动:建议与 Sebastian Raschka 的文章交叉引用;可纳入 AI 原生开发流程规范。
✅ 条目 2:Martin Fowler — "Engineering Practices for LLM Application Development"
来源:https://martinfowler.com/articles/engineering-practices-llm.html
类型:技术博客(Martin Fowler)
可信度:⭐⭐⭐⭐⭐(知名软件工程作者,文章含真实代码结构)
核心工程要点:
1. "./go" 自动化开发环境:示例项目 check out && ./go 启动,说明 Dev 环境标准化的重要性
2. 自动化测试隔离推理:Inference 和 Testing 解耦,一次推理结果可跑多轮 property-based 测试
3. Auto-evaluator 可视化:测试运行应产出 visual artifacts(输入/输出/分数分布图),而非仅 pass/fail
4. Separation of Concerns:LLM 应用同样适用 OCP/SRP 等工程基础原则
5. Evaluate the Evaluator:需验证评分系统本身的 false positive/negative 率
保留理由:唯一找到的含真实 ./go 命令示例的工程文章;auto-evaluator 设计思路对 evals 工程化有直接价值。
后续行动:精读 "Evaluate the Evaluator" 部分,可作为 LLM 测试工程规范参考。
✅ 条目 3:llama.cpp Weekly GitHub Report(Jan 16–23, 2026)
来源:https://buttondown.com/weekly-project-news/archive/weekly-github-report-for-llamacpp-january-16-2026
类型:开源项目周报
可信度:⭐⭐⭐⭐(含真实 issue 原文链接、错误日志、命令参数)
核心 Bug 条目:
1. gpt-oss-120b OOM on RTX 4090:mmap → direct I/O 切换导致 RAM 使用量上升,--mmap flag 可恢复
2. GLM-4.7-Flash CUDA backend CPU 占用异常:"-fa on" flag 导致,关闭后恢复正常,已修
3. Vulkan AMD RX 5700 XT ErrorDeviceLost:特定 flag 组合触发,--mmap 可绕过
保留理由:真实错误日志 + 复现路径 + 命令参数,是工程排障的原始素材库。
后续行动:可归档为 "llama.cpp 2026 Q1 工程问题案例库";需核验相关 PR 是否已在主分支。
✅ 条目 4:arxiv 2604.22513 — "Benchmarking LLM-Driven Network Configuration Repair"
来源:https://arxiv.org/html/2604.22513v1
类型:arXiv 论文 + Benchmark
可信度:⭐⭐⭐⭐(学术 benchmark,含实验设置)
核心工程数据: - 测试 9 个模型:GPT-5.2、Gemini 3.0、Claude 4.5 Opus 等闭源 + GPT-OSS-20B 开源 - 修复率上限 25.5%(完全正确且无回退),说明当前 SOTA 模型仍需 Human-in-the-Loop - 影响因子分析:query 复杂度、domain specificity、模型尺寸交叉分析 - 提出 Cornetto 数据集,专门针对网络配置诊断场景
保留理由:提供了 LLM 在网络运维场景的量化性能上界,是部署决策的重要参考数据。
后续行动:核实该 benchmark 是否有开源代码仓库;考虑补充 2026 年中后期更新的模型数据。
✅ 条目 5:theaiengineer.substack — "The AI Agents Stack (2026 Edition)"
来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者:Paolo Perrone(AI Engineer,Letta 前员工)
类型:Substack 行业分析
可信度:⭐⭐⭐⭐(行业调研 + 真实数据)
核心数据: - LangChain Agent Engineering Survey:89% 团队有 observability,但仅 52% 有 evals——37 point gap - 新 Benchmark:Context-Bench(memory)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents) - 六层架构图:LLM → Tooling → Memory → Planning → Routing → Orchestration
保留理由:给出了当前 Agent 工程化成熟度的量化差距,是判断团队技术债务的有力参照。
后续行动:建议写入知识库 "AI Agent 工程成熟度" 主题页;核验 survey 样本量和置信区间。
✅ 条目 6:hugobowne.substack — "LLM Architecture in 2026: Agent Harnesses, Hybrid Models"
来源:https://hugobowne.substack.com/p/llm-architecture-in-2026-agent-harnesses
作者:Sebastian Raschka(PhD,AI 研究工程师,《Build a Large Language Model From Scratch》作者)
类型:Substack 深度技术
可信度:⭐⭐⭐⭐⭐
核心工程方法: - Implementation as verification:用参考模型的 intermediate tensors 对齐来暴露架构细节,论文/图示可能遗漏 - Fine-tuning 策略:通用模型 + 领域适应,强调训练数据顺序和灾难性遗忘问题 - Gated DeltaNet、Mamba 层等效率优化:金融压力下工程权衡的体现
保留理由:Raschka 是少数同时懂训练原理和工程实现的研究者,方法论有直接复现价值。
后续行动:结合 Addy Osmani 的工作流文章,交叉引用 "spec-first + 推理模型规划" 的实践路径。
✅ 条目 7:vLLM Forum — CUDA OOM 案例集(2026 年)
来源:https://discuss.vllm.ai/
类型:论坛工程讨论
可信度:⭐⭐⭐(多人经验,含具体参数)
案例摘要:
1. Llama 3.1-70B on 4×L40s:gpu_memory_utilization=0.82, tensor_parallel_size=4,推理完成后 rank 1-3 OOM → vLLM KV cache 释放时机问题
2. gpu_memory_utilization 调参:调低可缓解 OOM,需配合 max_model_len 共同优化
3. FlashInfer JIT OOM:2026 年 5 月新案例
保留理由:生产级 GPU 配置参数和错误模式,是部署 vLLM 的工程避坑参考。
后续行动:建议写入 "LLM Inference 部署排障手册";核实 vLLM 0.10+ 是否已修复制裁后 OOM 问题。
二、丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| RAG Tutorial 2026(aitoolranked.com) | 纯教程步骤,无源码/命令/错误/性能数据;pip install 命令无版本/环境说明 |
| Agentic RAG 2026 Complete Guide(workativ.com) | 企业指南级内容,缺少真实命令或排障细节;pattern 描述泛泛 |
| Code Generation Benchmark Field Guide(medium) | 偏 survey,不含实测数据;SWEBench 已有大量记录 |
| LLM Evaluation Tutorial(launchdarkly.com) | 产品 marketing 文,含代码片段但无实际 benchmark 数据对比 |
| "AI Prompt Engineering Best Practices 2026"(artjoker.net) | 通用提示工程,无工程环境、命令或错误处理 |
| Udemy / YouTube RAG 课程 | 课程广告,无排障/源码/性能数据 |
| Akva Newsletter LLMOps 101 | 入门 roadmap,无工程深度 |
| "LLM Engineering Full Course 2026"(YouTube 转写) | 无源码/排障,仅课程目录 |
三、Substack 高价值内容标注
| 专栏 | 作者 | 领域 | 值得追踪 |
|---|---|---|---|
| Addy Osmani(addyo.substack.com) | Google Chrome | LLM 工程工作流、AI 原生开发 | ✅ |
| Sebastian Raschka(hugobowne.substack.com) | AI 研究工程师 | LLM 架构、训练细节、源码分析 | ✅ |
| Paolo Perrone(theaiengineer.substack.com) | AI Engineer | Agent 工程、stack 分析 | ✅ |
| ESCOBYTE(escobyte.substack.com) | 独立开发者 | Claude Code CLI 生产代码实践 | ✅ |
| katanaquant(open.substack.com/pub/katanaquant) | 量化背景 | LLM 代码正确性分析 | 观察 |
四、分类标签
#LLM-Engineering #Benchmark #OOM-Troubleshooting #Agent-Stack #Substack #vLLM #llama.cpp #Eval-Practices #Context-Packing
五、建议写入路径
/shared/research-kb/inbox/jay/2026-08-29-llm-engineering-sieve.md ← 本草稿(主文件)
六、后续行动建议
- 精读:Martin Fowler 那篇的
./go示例源码(需访问原仓库) - 核验:llama.cpp Jan 2026 周报中的 3 个 bug 是否在后续版本已 fix
- 核验:vLLM 0.10+ 版本的 CUDA OOM after inference bug 修复状态
- 主题页更新:"AI Agent 工程成熟度评估" 建议新增,引用 Paolo Perrone 六层框架
- Substack 追踪:将 Addy Osmani + Sebastian Raschka + AI Engineer 三个专栏加入定期检索列表