研究草稿 · 2026-08-21 下午版 · CSDN 高价值检索 · 推理工程 · 微调 · K8s · Agent · Substack
实例: Jay | 检索范围: CSDN Blog + Substack(AI Engineer / The AI Engineer / Pragmatic Engineer / Neural Maze)| 类型: 高频运营
一、CSDN 高价值条目
🔴 高价值:SITS 框架 — K8s 上 vLLM 部署四大反模式(2026实测)
- 来源: CSDN Blog · PoliVein · "为什么92%的AI团队在K8s上卡在vLLM部署阶段?"
- URL:
https://blog.csdn.net/PoliVein/article/details/160974330 - 更新时间:2026年(文章内含 SITS 2026 章节)
- 可信度: ⭐⭐⭐⭐ | 工程价值: 极高(企业落地实感高)
- 核心观点:
- SITS = Storage(存储)+ Inference(推理)+ Training(训练)+ Serving(服务)全栈框架
- 四大反模式:① 裸 GPU Pod 直连无调度;② 混合调度导致 CUDA 竞争;③ 无状态推理无法横向扩缩容;④ 监控缺失无法定位瓶颈
- 第一章:AI原生云原生融合实战;第二章:vLLM 在 K8s 上的四大部署反模式深度解构;第三章:面向 AI 工作负载的 K8s 控制平面增强
- 后续章节涵盖 vLLM PagedAttention 与 K8s 调度器集成细节
- 工程复现价值: 命令行配置示例、K8s YAML 资源声明,可直接参考
- 建议分类:
inference-engineeringvllmkubernetesk8sproductionsits-framework - 审稿建议: 需核对 2026 年 K8s v1.36 DRA GA 后对 vLLM GPU 调度的实际改善程度
🟡 中高价值:K8s 2026 DRA + AI Native 平台演进(openEuler 社区)
- 来源: openEuler 社区 · CSDN · "Kubernetes 2026:从容器编排到 AI 原生平台的技术演进与实战指南"
- URL:
https://openeuler.csdn.net/6a19431c10ee7a33f2764fdf.html - 可信度: ⭐⭐⭐⭐ | 工程价值: 高(含完整 YAML + Bash 命令链)
- 核心观点:
- K8s v1.36 DRA(Dynamic Resource Allocation)正式 GA → GPU 显存/算力切片进入稳定版
- 资源声明示例(
ResourceClaimYAML):gpuMemory: 80Gi、computeCapability: "8.0"、multiInstanceGPU: true(MIG 分片) - 边缘 AI 推理优化:内核参数调优(
sysctl网络栈)+ Cilium eBPF 加速(helm install cilium命令)+ LocalPV+SPDP 本地存储 - 2026-2028 趋势:K8s 内置大模型能力(
kubectl create deployment --llm-prompt="...") - 工程复现价值: YAML 资源声明、内核调优命令、Helm 部署命令均有参考价值
- 建议分类:
kubernetesk8sdragpu-schedulingai-nativeinferenceedge-ai - 后续行动: 建议与上方 SITS 条目合并,补充 K8s DRA + vLLM 集成最佳实践
🔴 高价值:LoRA 微调实战 — 从零完成、含报错记录(2026)
- 来源: CSDN Blog · jiangfuofu555 · "AI大模型实战:从零完成LoRA轻量化微调"
- URL:
https://blog.csdn.net/jiangfuofu555/article/details/161804769 - 可信度: ⭐⭐⭐⭐ | 工程价值: 极高(含真实报错 + 精准解决方案,低配置可跑)
- 核心观点:
- 环境:Conda + Qwen2.5-0.5B(小模型)+ LoRA,专为低配置环境设计
- 全流程实战:环境准备 → 数据构建 → 训练命令 → 效果验证
- 亮点:记录所有真实报错和精准解决方案,这一点在 CSDN 极少见
- 工程复现价值: 完整可复制命令链,低配置友好
- 建议分类:
fine-tuningloraqwen2.5reproductioncondalow-resource
🟡 中高价值:Qwen2.5-7B LoRA 微调 → Ollama API 完整链路
- 来源: CSDN Blog · heian_99 · "Qwen2.5-7B 指令(LoRA)微调完整实战指南"
- URL:
https://blog.csdn.net/heian_99/article/details/159247140 - 可信度: ⭐⭐⭐⭐ | 工程价值: 高(端到端命令链)
- 核心观点:
- 流程:LoRA 训练 → 保存 Adapter → 合并权重 → 导入 Ollama → 提供 OpenAI 兼容 API
- 每一步含实际运行命令 + 效果截图,可完整复现
- 价值:覆盖推理服务化环节,填补大多数 LoRA 教程只到训练不管部署的空白
- 工程复现价值: 命令链完整,端到端可复现
- 建议分类:
fine-tuningloraollamaqwen2.5-7bapi-servicereproduction
🟡 中高价值:A800 部署 SGLang + 8项参数调优(2026)
- 来源: CSDN Blog · weixin_33761747 · "A800部署GLM-5实战:SGLang字节版+8项参数调优指南"
- URL:
https://blog.csdn.net/weixin_33707223/article/details/162052848 - 可信度: ⭐⭐⭐⭐ | 工程价值: 高(国产 GPU 场景,A800实际调优经验)
- 核心观点:
- 2026年2月 vLLM 主线 MLA(Multi-Layer Attention)和 Sparse Attention 核心 kernel 依赖 Hopper TMA
- SGLang 字节版在 A800 上的参数调优:8项具体参数,覆盖显存、吞吐量、延迟权衡
- MLA 和 TMA 对非 Hopper 架构的兼容性影响(AMD/MI 等替代路径)
- 工程复现价值: 调优参数列表针对国产 GPU,有参考价值
- 建议分类:
inference-engineeringsglangglm-5a800tuningchina-gpu
🟡 中高价值:vLLM vs SGLang vs llama.cpp — 2026-08-17 最新更新
- 来源: CSDN Blog · m0_59235245 · "谁才是LLM推理的真王?vLLM、SGLang与llama.cpp性能对比"
- URL:
https://blog.csdn.net/m0_59235245/article/details/158777723 - 最新更新时间:2026-08-17
- 可信度: ⭐⭐⭐ | 工程价值: 中高(有更新,值得追踪)
- 核心观点:
- SGLang:复杂 Agent 场景首选;vLLM:生产环境事实标准;Flash Attention 2 替代原生 Attention
- 2026年 vLLM + SGLang 格局:两者不再是竞争关系,而是在不同场景互补
- 建议分类:
inference-engineeringvllmsglangllama.cppbenchmark2026
🟡 中高价值:PaddleOCR-VL + vLLM 部署(万字血泪史)
- 来源: CSDN Blog · m0_63137469 · "全网首发PaddleOCR-VL的VLLM部署教程"
- URL:
https://blog.csdn.net/m0_63137469/article/details/153460610 - 可信度: ⭐⭐⭐⭐ | 工程价值: 高(多模态部署实操,含错误排查)
- 核心观点:
- Flash Attention 后端成功检测后加速推理、降低显存消耗
- 多模态模型(OCR-VL)部署到 vLLM 的完整步骤,含避坑记录
- 建议分类:
multimodalvllmocrdeploymentflash-attention
二、Substack 高价值条目
🔴 高价值:The AI Engineer — Agent Stack 2026 Edition
- 来源: Substack · The AI Engineer · "The AI Agents Stack (2026 Edition)"
- URL:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 可信度: ⭐⭐⭐⭐⭐ | 工程价值: 极高(行业权威地图)
- 核心观点:
- 三层重绘:MCP 标准化工具连接(整个 tools 层全新)、推理模型改变自主性(单调用替代多步链)、Memory 成为第一等架构原语(非向量库后加)
- Agent ≠ LLM Stack:Agent 需要跨多步执行的状态管理、受协议管理的工具访问、跨 session 持久化的 memory、自主推理循环、实时 guardrails
- Eval 现实:89% 的团队建了可观测性,只有 52% 建了正式 evals("37 分 eval 差距")
- RAG 只是 Agent Stack 的一层(本文聚焦 Agent 全栈,RAG 详见 Issue #5)
- 可引用观点: "The agent stack is not the LLM stack. A chatbot needs inference and maybe RAG. An agent needs state management across multi-step execution, tool access governed by protocols, memory that persists across sessions, autonomous reasoning loops, and guardrails that constrain behavior in real time."
- 建议分类:
agentmcpmemorystacktheaiengineer2026evaluation
🟡 中高价值:The Neural Maze — AI Systems Engineer Journey
- 来源: Substack · The Neural Maze · "Welcome to The AI Systems Engineer Journey"
- URL:
https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer - 可信度: ⭐⭐⭐⭐ | 工程价值: 高(工程视角 RAG 深度分析)
- 核心观点:
- RAG 的真实挑战:Chunking策略、检索质量、hybrid search vs 纯语义、查询改写、重排、幻觉检测、引用强制、评估体系、延迟、成本、索引新鲜度
- "naive RAG pipeline 是 LLM 应用的 hello world,真正的 RAG 系统是经得起用户接触的系统"
- Feature Pipeline → Training Pipeline → Inference Pipeline 三段式 RAG 建模(chunk/embed → prompt engineering → guardrails + citation validation)
- 建议分类:
ragengineeringproductionsystems-thinkingtheneuralmaze
🟡 中高价值:Alex Chen · 2026 AI Engineer JD 分析(1000+岗位)
- 来源: Substack · alexeyondata · "What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026"
- URL:
https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal - 可信度: ⭐⭐⭐⭐ | 工程价值: 中(行业趋势,非技术细节)
- 核心观点:
- AI-first roles(≈70%):直接做 LLM/GenAI 系统(RAG、agents、评估、生产部署)
- AI-support roles(≈28.5%):AI 基础设施和平台(GPU/推理 infra、数据 pipeline、部署监控)
- Traditional ML/DL roles(<2%):标准 ML/DL 但被贴"AI Engineer"标签
- 核心职责:端到端 LLM 应用(RAG/Agent)、API 生产化、部署监控、评估 + guardrails
- 建议分类:
ai-engineercareerjob-market2026ragagent
🟡 中高价值:Pragmatic Engineer · 推理工程深度解析
- 来源: Substack · Pragmatic Engineer · "What is inference engineering? Deepdive"
- URL:
https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering - 可信度: ⭐⭐⭐⭐⭐ | 工程价值: 高(Philip Kiely《Inference Engineering》作者权威解读)
- 核心观点:
- 推理工程定义:将现有模型处理输入并逐 token 生成输出的工程学科
- 推理工程 = 技能,也是职业机会:自建推理栈可以获得对模型运行和定价的控制
- 推理优化路径:量化、批处理、KVCache 管理、Flash Attention、PagedAttention
- 《Inference Engineering》新书覆盖:推理优化核心方法论
- 建议分类:
inference-engineeringpragmaticengineerproductionbookoptimization
三、过滤掉的低价值条目
| 条目 | 过滤原因 |
|---|---|
| "2026年RAG技术深度解析:从核心原理到企业落地" | 低工程价值,概念堆砌,无命令/代码/版本信息 |
| "2026年到底该学什么AI技能?6项必备技能" | 通用趋势文,无技术细节 |
| "创业方向指南:2026年AI Agent领域的黄金赛道" | 创业视角,工程价值低 |
| "2026 年值得构建的5 个AI Engineer 项目" | 项目列表,无深度技术内容 |
| "2025年值得关注的21个RAG开源项目" | 2025年,已过时 |
四、分类标签汇总
inference-engineeringvllmsglangkubernetesk8sdragpu-schedulingfine-tuningloraqwen2.5ollamareproductionragagentmcpmemorymultimodalproductionsits-frameworkai-nativeevaluationtheaiengineerpragmaticengineertheneuralmazesubstack2026china-gpua800
五、建议写入路径
主要路径: research-kb/review/(由合并任务串行处理)
建议按以下主题页组织:
1. 推理工程主题页(/research-kb/published/inference-engineering/):合并 vLLM vs SGLang 对比、SITS K8s 部署反模式、K8s DRA GA、Pragmatic Engineer 推理工程解读
2. 微调工程主题页(/research-kb/published/fine-tuning/):合并 LoRA 从零实战、Qwen2.5-7B→Ollama 链路、SGLang GLM-5 A800 调优
3. Agent Stack 主题页(/research-kb/published/agent/):The AI Engineer 2026 Agent Stack 全图、MCP + Memory 新原语、Eval 差距数据
六、本次精读/审稿建议
| 优先级 | 条目 | 行动 |
|---|---|---|
| P0 | The AI Engineer Agent Stack 2026 | 精读,补充 MCP 协议栈细节 |
| P0 | SITS vLLM K8s 部署四反模式 | 审稿,验证 DRA 集成方案 |
| P1 | Pragmatic Engineer 推理工程 | 精读,结合《Inference Engineering》书评 |
| P1 | LoRA 从零实战(jiangfuofu555) | 验证命令链,复现可行性评估 |
| P2 | K8s DRA AI Native 演进 | 作为 K8s 主题页补充材料 |
| P2 | A800 SGLang GLM-5 调优 | 作为中国 GPU 场景案例存档 |