LLM 工程实践筛选报告 · Jay · 2026-08-29

任务概述

  • 筛选主题:LLM/AI Agent 工程实践(环境搭建、错误排查、性能 Benchmark、生产代码质量)
  • 检索范围:arXiv、GitHub Issues、vLLM Forum、Substack(Addy Osmani/Sebastian Raschka/AI Engineer/Paolo Perrone)、Martin Fowler、llama.cpp 周报
  • 本次权重:真实环境/命令/错误/源码/性能数据/可复现步骤

一、保留条目

✅ 条目 1:Addy Osmani — "My LLM coding workflow going into 2026"

来源:https://addyo.substack.com/p/my-llm-coding-workflow-going-into
作者:Addy Osmani(Google 工程师,Chrome team)
类型:Substack 工程笔记
可信度:⭐⭐⭐⭐⭐(一手工程经验,非 SEO 内容)

核心工程要点: 1. Spec-first 流程:先用推理模型生成项目计划,再让代码模型逐块实现,每块可独立验证 2. Context Packing:把所有约束、示例、禁止事项一次性塞入 context,而非让 LLM 猜测 3. 分块输出原则:禁止一次生成大段代码,逐功能/逐 ticket 小步迭代 4. TDD with LLMs:评论区有工程团队讨论 TDD 作为 LLM 输出质量控制手段的实践

保留理由:Google 工程师一线经验,包含明确的工作流原则,非泛泛而谈的 prompt 技巧。

后续行动:建议与 Sebastian Raschka 的文章交叉引用;可纳入 AI 原生开发流程规范。


✅ 条目 2:Martin Fowler — "Engineering Practices for LLM Application Development"

来源:https://martinfowler.com/articles/engineering-practices-llm.html
类型:技术博客(Martin Fowler)
可信度:⭐⭐⭐⭐⭐(知名软件工程作者,文章含真实代码结构)

核心工程要点: 1. "./go" 自动化开发环境:示例项目 check out && ./go 启动,说明 Dev 环境标准化的重要性 2. 自动化测试隔离推理:Inference 和 Testing 解耦,一次推理结果可跑多轮 property-based 测试 3. Auto-evaluator 可视化:测试运行应产出 visual artifacts(输入/输出/分数分布图),而非仅 pass/fail 4. Separation of Concerns:LLM 应用同样适用 OCP/SRP 等工程基础原则 5. Evaluate the Evaluator:需验证评分系统本身的 false positive/negative 率

保留理由:唯一找到的含真实 ./go 命令示例的工程文章;auto-evaluator 设计思路对 evals 工程化有直接价值。

后续行动:精读 "Evaluate the Evaluator" 部分,可作为 LLM 测试工程规范参考。


✅ 条目 3:llama.cpp Weekly GitHub Report(Jan 16–23, 2026)

来源:https://buttondown.com/weekly-project-news/archive/weekly-github-report-for-llamacpp-january-16-2026
类型:开源项目周报
可信度:⭐⭐⭐⭐(含真实 issue 原文链接、错误日志、命令参数)

核心 Bug 条目: 1. gpt-oss-120b OOM on RTX 4090:mmap → direct I/O 切换导致 RAM 使用量上升,--mmap flag 可恢复 2. GLM-4.7-Flash CUDA backend CPU 占用异常"-fa on" flag 导致,关闭后恢复正常,已修 3. Vulkan AMD RX 5700 XT ErrorDeviceLost:特定 flag 组合触发,--mmap 可绕过

保留理由:真实错误日志 + 复现路径 + 命令参数,是工程排障的原始素材库。

后续行动:可归档为 "llama.cpp 2026 Q1 工程问题案例库";需核验相关 PR 是否已在主分支。


✅ 条目 4:arxiv 2604.22513 — "Benchmarking LLM-Driven Network Configuration Repair"

来源:https://arxiv.org/html/2604.22513v1
类型:arXiv 论文 + Benchmark
可信度:⭐⭐⭐⭐(学术 benchmark,含实验设置)

核心工程数据: - 测试 9 个模型:GPT-5.2、Gemini 3.0、Claude 4.5 Opus 等闭源 + GPT-OSS-20B 开源 - 修复率上限 25.5%(完全正确且无回退),说明当前 SOTA 模型仍需 Human-in-the-Loop - 影响因子分析:query 复杂度、domain specificity、模型尺寸交叉分析 - 提出 Cornetto 数据集,专门针对网络配置诊断场景

保留理由:提供了 LLM 在网络运维场景的量化性能上界,是部署决策的重要参考数据。

后续行动:核实该 benchmark 是否有开源代码仓库;考虑补充 2026 年中后期更新的模型数据。


✅ 条目 5:theaiengineer.substack — "The AI Agents Stack (2026 Edition)"

来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者:Paolo Perrone(AI Engineer,Letta 前员工)
类型:Substack 行业分析
可信度:⭐⭐⭐⭐(行业调研 + 真实数据)

核心数据: - LangChain Agent Engineering Survey:89% 团队有 observability,但仅 52% 有 evals——37 point gap - 新 Benchmark:Context-Bench(memory)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents) - 六层架构图:LLM → Tooling → Memory → Planning → Routing → Orchestration

保留理由:给出了当前 Agent 工程化成熟度的量化差距,是判断团队技术债务的有力参照。

后续行动:建议写入知识库 "AI Agent 工程成熟度" 主题页;核验 survey 样本量和置信区间。


✅ 条目 6:hugobowne.substack — "LLM Architecture in 2026: Agent Harnesses, Hybrid Models"

来源:https://hugobowne.substack.com/p/llm-architecture-in-2026-agent-harnesses
作者:Sebastian Raschka(PhD,AI 研究工程师,《Build a Large Language Model From Scratch》作者)
类型:Substack 深度技术
可信度:⭐⭐⭐⭐⭐

核心工程方法: - Implementation as verification:用参考模型的 intermediate tensors 对齐来暴露架构细节,论文/图示可能遗漏 - Fine-tuning 策略:通用模型 + 领域适应,强调训练数据顺序和灾难性遗忘问题 - Gated DeltaNet、Mamba 层等效率优化:金融压力下工程权衡的体现

保留理由:Raschka 是少数同时懂训练原理和工程实现的研究者,方法论有直接复现价值。

后续行动:结合 Addy Osmani 的工作流文章,交叉引用 "spec-first + 推理模型规划" 的实践路径。


✅ 条目 7:vLLM Forum — CUDA OOM 案例集(2026 年)

来源:https://discuss.vllm.ai/
类型:论坛工程讨论
可信度:⭐⭐⭐(多人经验,含具体参数)

案例摘要: 1. Llama 3.1-70B on 4×L40sgpu_memory_utilization=0.82, tensor_parallel_size=4,推理完成后 rank 1-3 OOM → vLLM KV cache 释放时机问题 2. gpu_memory_utilization 调参:调低可缓解 OOM,需配合 max_model_len 共同优化 3. FlashInfer JIT OOM:2026 年 5 月新案例

保留理由:生产级 GPU 配置参数和错误模式,是部署 vLLM 的工程避坑参考。

后续行动:建议写入 "LLM Inference 部署排障手册";核实 vLLM 0.10+ 是否已修复制裁后 OOM 问题。


二、丢弃条目

条目 丢弃理由
RAG Tutorial 2026(aitoolranked.com) 纯教程步骤,无源码/命令/错误/性能数据;pip install 命令无版本/环境说明
Agentic RAG 2026 Complete Guide(workativ.com) 企业指南级内容,缺少真实命令或排障细节;pattern 描述泛泛
Code Generation Benchmark Field Guide(medium) 偏 survey,不含实测数据;SWEBench 已有大量记录
LLM Evaluation Tutorial(launchdarkly.com) 产品 marketing 文,含代码片段但无实际 benchmark 数据对比
"AI Prompt Engineering Best Practices 2026"(artjoker.net) 通用提示工程,无工程环境、命令或错误处理
Udemy / YouTube RAG 课程 课程广告,无排障/源码/性能数据
Akva Newsletter LLMOps 101 入门 roadmap,无工程深度
"LLM Engineering Full Course 2026"(YouTube 转写) 无源码/排障,仅课程目录

三、Substack 高价值内容标注

专栏 作者 领域 值得追踪
Addy Osmani(addyo.substack.com) Google Chrome LLM 工程工作流、AI 原生开发
Sebastian Raschka(hugobowne.substack.com) AI 研究工程师 LLM 架构、训练细节、源码分析
Paolo Perrone(theaiengineer.substack.com) AI Engineer Agent 工程、stack 分析
ESCOBYTE(escobyte.substack.com) 独立开发者 Claude Code CLI 生产代码实践
katanaquant(open.substack.com/pub/katanaquant) 量化背景 LLM 代码正确性分析 观察

四、分类标签

#LLM-Engineering #Benchmark #OOM-Troubleshooting #Agent-Stack #Substack #vLLM #llama.cpp #Eval-Practices #Context-Packing


五、建议写入路径

/shared/research-kb/inbox/jay/2026-08-29-llm-engineering-sieve.md  ← 本草稿(主文件)

六、后续行动建议

  1. 精读:Martin Fowler 那篇的 ./go 示例源码(需访问原仓库)
  2. 核验:llama.cpp Jan 2026 周报中的 3 个 bug 是否在后续版本已 fix
  3. 核验:vLLM 0.10+ 版本的 CUDA OOM after inference bug 修复状态
  4. 主题页更新:"AI Agent 工程成熟度评估" 建议新增,引用 Paolo Perrone 六层框架
  5. Substack 追踪:将 Addy Osmani + Sebastian Raschka + AI Engineer 三个专栏加入定期检索列表