研究草稿 · 2026-08-21 下午版 · CSDN 高价值检索 · 推理工程 · 微调 · K8s · Agent · Substack

实例: Jay | 检索范围: CSDN Blog + Substack(AI Engineer / The AI Engineer / Pragmatic Engineer / Neural Maze)| 类型: 高频运营


一、CSDN 高价值条目

🔴 高价值:SITS 框架 — K8s 上 vLLM 部署四大反模式(2026实测)

  • 来源: CSDN Blog · PoliVein · "为什么92%的AI团队在K8s上卡在vLLM部署阶段?"
  • URL: https://blog.csdn.net/PoliVein/article/details/160974330
  • 更新时间:2026年(文章内含 SITS 2026 章节)
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 极高(企业落地实感高)
  • 核心观点:
  • SITS = Storage(存储)+ Inference(推理)+ Training(训练)+ Serving(服务)全栈框架
  • 四大反模式:① 裸 GPU Pod 直连无调度;② 混合调度导致 CUDA 竞争;③ 无状态推理无法横向扩缩容;④ 监控缺失无法定位瓶颈
  • 第一章:AI原生云原生融合实战;第二章:vLLM 在 K8s 上的四大部署反模式深度解构;第三章:面向 AI 工作负载的 K8s 控制平面增强
  • 后续章节涵盖 vLLM PagedAttention 与 K8s 调度器集成细节
  • 工程复现价值: 命令行配置示例、K8s YAML 资源声明,可直接参考
  • 建议分类: inference-engineering vllm kubernetes k8s production sits-framework
  • 审稿建议: 需核对 2026 年 K8s v1.36 DRA GA 后对 vLLM GPU 调度的实际改善程度

🟡 中高价值:K8s 2026 DRA + AI Native 平台演进(openEuler 社区)

  • 来源: openEuler 社区 · CSDN · "Kubernetes 2026:从容器编排到 AI 原生平台的技术演进与实战指南"
  • URL: https://openeuler.csdn.net/6a19431c10ee7a33f2764fdf.html
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 高(含完整 YAML + Bash 命令链)
  • 核心观点:
  • K8s v1.36 DRA(Dynamic Resource Allocation)正式 GA → GPU 显存/算力切片进入稳定版
  • 资源声明示例(ResourceClaim YAML):gpuMemory: 80GicomputeCapability: "8.0"multiInstanceGPU: true(MIG 分片)
  • 边缘 AI 推理优化:内核参数调优(sysctl 网络栈)+ Cilium eBPF 加速(helm install cilium 命令)+ LocalPV+SPDP 本地存储
  • 2026-2028 趋势:K8s 内置大模型能力(kubectl create deployment --llm-prompt="..."
  • 工程复现价值: YAML 资源声明、内核调优命令、Helm 部署命令均有参考价值
  • 建议分类: kubernetes k8s dra gpu-scheduling ai-native inference edge-ai
  • 后续行动: 建议与上方 SITS 条目合并,补充 K8s DRA + vLLM 集成最佳实践

🔴 高价值:LoRA 微调实战 — 从零完成、含报错记录(2026)

  • 来源: CSDN Blog · jiangfuofu555 · "AI大模型实战:从零完成LoRA轻量化微调"
  • URL: https://blog.csdn.net/jiangfuofu555/article/details/161804769
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 极高(含真实报错 + 精准解决方案,低配置可跑)
  • 核心观点:
  • 环境:Conda + Qwen2.5-0.5B(小模型)+ LoRA,专为低配置环境设计
  • 全流程实战:环境准备 → 数据构建 → 训练命令 → 效果验证
  • 亮点:记录所有真实报错和精准解决方案,这一点在 CSDN 极少见
  • 工程复现价值: 完整可复制命令链,低配置友好
  • 建议分类: fine-tuning lora qwen2.5 reproduction conda low-resource

🟡 中高价值:Qwen2.5-7B LoRA 微调 → Ollama API 完整链路

  • 来源: CSDN Blog · heian_99 · "Qwen2.5-7B 指令(LoRA)微调完整实战指南"
  • URL: https://blog.csdn.net/heian_99/article/details/159247140
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 高(端到端命令链)
  • 核心观点:
  • 流程:LoRA 训练 → 保存 Adapter → 合并权重 → 导入 Ollama → 提供 OpenAI 兼容 API
  • 每一步含实际运行命令 + 效果截图,可完整复现
  • 价值:覆盖推理服务化环节,填补大多数 LoRA 教程只到训练不管部署的空白
  • 工程复现价值: 命令链完整,端到端可复现
  • 建议分类: fine-tuning lora ollama qwen2.5-7b api-service reproduction

🟡 中高价值:A800 部署 SGLang + 8项参数调优(2026)

  • 来源: CSDN Blog · weixin_33761747 · "A800部署GLM-5实战:SGLang字节版+8项参数调优指南"
  • URL: https://blog.csdn.net/weixin_33707223/article/details/162052848
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 高(国产 GPU 场景,A800实际调优经验)
  • 核心观点:
  • 2026年2月 vLLM 主线 MLA(Multi-Layer Attention)和 Sparse Attention 核心 kernel 依赖 Hopper TMA
  • SGLang 字节版在 A800 上的参数调优:8项具体参数,覆盖显存、吞吐量、延迟权衡
  • MLA 和 TMA 对非 Hopper 架构的兼容性影响(AMD/MI 等替代路径)
  • 工程复现价值: 调优参数列表针对国产 GPU,有参考价值
  • 建议分类: inference-engineering sglang glm-5 a800 tuning china-gpu

🟡 中高价值:vLLM vs SGLang vs llama.cpp — 2026-08-17 最新更新

  • 来源: CSDN Blog · m0_59235245 · "谁才是LLM推理的真王?vLLM、SGLang与llama.cpp性能对比"
  • URL: https://blog.csdn.net/m0_59235245/article/details/158777723
  • 最新更新时间:2026-08-17
  • 可信度: ⭐⭐⭐ | 工程价值: 中高(有更新,值得追踪)
  • 核心观点:
  • SGLang:复杂 Agent 场景首选;vLLM:生产环境事实标准;Flash Attention 2 替代原生 Attention
  • 2026年 vLLM + SGLang 格局:两者不再是竞争关系,而是在不同场景互补
  • 建议分类: inference-engineering vllm sglang llama.cpp benchmark 2026

🟡 中高价值:PaddleOCR-VL + vLLM 部署(万字血泪史)

  • 来源: CSDN Blog · m0_63137469 · "全网首发PaddleOCR-VL的VLLM部署教程"
  • URL: https://blog.csdn.net/m0_63137469/article/details/153460610
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 高(多模态部署实操,含错误排查)
  • 核心观点:
  • Flash Attention 后端成功检测后加速推理、降低显存消耗
  • 多模态模型(OCR-VL)部署到 vLLM 的完整步骤,含避坑记录
  • 建议分类: multimodal vllm ocr deployment flash-attention

二、Substack 高价值条目

🔴 高价值:The AI Engineer — Agent Stack 2026 Edition

  • 来源: Substack · The AI Engineer · "The AI Agents Stack (2026 Edition)"
  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 可信度: ⭐⭐⭐⭐⭐ | 工程价值: 极高(行业权威地图)
  • 核心观点:
  • 三层重绘:MCP 标准化工具连接(整个 tools 层全新)、推理模型改变自主性(单调用替代多步链)、Memory 成为第一等架构原语(非向量库后加)
  • Agent ≠ LLM Stack:Agent 需要跨多步执行的状态管理、受协议管理的工具访问、跨 session 持久化的 memory、自主推理循环、实时 guardrails
  • Eval 现实:89% 的团队建了可观测性,只有 52% 建了正式 evals("37 分 eval 差距")
  • RAG 只是 Agent Stack 的一层(本文聚焦 Agent 全栈,RAG 详见 Issue #5)
  • 可引用观点: "The agent stack is not the LLM stack. A chatbot needs inference and maybe RAG. An agent needs state management across multi-step execution, tool access governed by protocols, memory that persists across sessions, autonomous reasoning loops, and guardrails that constrain behavior in real time."
  • 建议分类: agent mcp memory stack theaiengineer 2026 evaluation

🟡 中高价值:The Neural Maze — AI Systems Engineer Journey

  • 来源: Substack · The Neural Maze · "Welcome to The AI Systems Engineer Journey"
  • URL: https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 高(工程视角 RAG 深度分析)
  • 核心观点:
  • RAG 的真实挑战:Chunking策略、检索质量、hybrid search vs 纯语义、查询改写、重排、幻觉检测、引用强制、评估体系、延迟、成本、索引新鲜度
  • "naive RAG pipeline 是 LLM 应用的 hello world,真正的 RAG 系统是经得起用户接触的系统"
  • Feature Pipeline → Training Pipeline → Inference Pipeline 三段式 RAG 建模(chunk/embed → prompt engineering → guardrails + citation validation)
  • 建议分类: rag engineering production systems-thinking theneuralmaze

🟡 中高价值:Alex Chen · 2026 AI Engineer JD 分析(1000+岗位)

  • 来源: Substack · alexeyondata · "What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026"
  • URL: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
  • 可信度: ⭐⭐⭐⭐ | 工程价值: 中(行业趋势,非技术细节)
  • 核心观点:
  • AI-first roles(≈70%):直接做 LLM/GenAI 系统(RAG、agents、评估、生产部署)
  • AI-support roles(≈28.5%):AI 基础设施和平台(GPU/推理 infra、数据 pipeline、部署监控)
  • Traditional ML/DL roles(<2%):标准 ML/DL 但被贴"AI Engineer"标签
  • 核心职责:端到端 LLM 应用(RAG/Agent)、API 生产化、部署监控、评估 + guardrails
  • 建议分类: ai-engineer career job-market 2026 rag agent

🟡 中高价值:Pragmatic Engineer · 推理工程深度解析

  • 来源: Substack · Pragmatic Engineer · "What is inference engineering? Deepdive"
  • URL: https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • 可信度: ⭐⭐⭐⭐⭐ | 工程价值: 高(Philip Kiely《Inference Engineering》作者权威解读)
  • 核心观点:
  • 推理工程定义:将现有模型处理输入并逐 token 生成输出的工程学科
  • 推理工程 = 技能,也是职业机会:自建推理栈可以获得对模型运行和定价的控制
  • 推理优化路径:量化、批处理、KVCache 管理、Flash Attention、PagedAttention
  • 《Inference Engineering》新书覆盖:推理优化核心方法论
  • 建议分类: inference-engineering pragmaticengineer production book optimization

三、过滤掉的低价值条目

条目 过滤原因
"2026年RAG技术深度解析:从核心原理到企业落地" 低工程价值,概念堆砌,无命令/代码/版本信息
"2026年到底该学什么AI技能?6项必备技能" 通用趋势文,无技术细节
"创业方向指南:2026年AI Agent领域的黄金赛道" 创业视角,工程价值低
"2026 年值得构建的5 个AI Engineer 项目" 项目列表,无深度技术内容
"2025年值得关注的21个RAG开源项目" 2025年,已过时

四、分类标签汇总

  • inference-engineering vllm sglang kubernetes k8s dra gpu-scheduling
  • fine-tuning lora qwen2.5 ollama reproduction
  • rag agent mcp memory multimodal
  • production sits-framework ai-native evaluation
  • theaiengineer pragmaticengineer theneuralmaze substack
  • 2026 china-gpu a800

五、建议写入路径

主要路径: research-kb/review/(由合并任务串行处理)

建议按以下主题页组织: 1. 推理工程主题页/research-kb/published/inference-engineering/):合并 vLLM vs SGLang 对比、SITS K8s 部署反模式、K8s DRA GA、Pragmatic Engineer 推理工程解读 2. 微调工程主题页/research-kb/published/fine-tuning/):合并 LoRA 从零实战、Qwen2.5-7B→Ollama 链路、SGLang GLM-5 A800 调优 3. Agent Stack 主题页/research-kb/published/agent/):The AI Engineer 2026 Agent Stack 全图、MCP + Memory 新原语、Eval 差距数据


六、本次精读/审稿建议

优先级 条目 行动
P0 The AI Engineer Agent Stack 2026 精读,补充 MCP 协议栈细节
P0 SITS vLLM K8s 部署四反模式 审稿,验证 DRA 集成方案
P1 Pragmatic Engineer 推理工程 精读,结合《Inference Engineering》书评
P1 LoRA 从零实战(jiangfuofu555) 验证命令链,复现可行性评估
P2 K8s DRA AI Native 演进 作为 K8s 主题页补充材料
P2 A800 SGLang GLM-5 调优 作为中国 GPU 场景案例存档