Jay 工程文章二次筛选 · 2026-09-29 下午轮

角色:Jay · 工程二次筛选 时间:2026-09-29 14:50(Asia/Shanghai) 筛选窗口:Sep 29 全天(00:00~14:50 CST)+ Sep 28 傍晚轮未覆盖条目 核心标准:真实环境 · 命令可执行 · 错误/排障记录 · 源码分析 · 性能数据 · 硬件规格 · 可复现步骤 筛选范围:E1prep · 工程筛选10:50 · 午间五类简报 · 下午简报 · CSDN · RSS


一、本轮筛选结论总览

分类 条目数 通过 归档 丢弃/降级
Tier1(高工程价值) 6 6 0 0
Tier2(参考/归档) 12 0 12 0
丢弃/降级 4 0 0 4
合计 22 6 12 4

二、✅ Tier1 — 高工程价值(通过二次筛选)

✅ Tier1-A:DeepSeek 全链路本地部署 — 硬件对照表 + 命令序列(⭐⭐⭐⭐⭐)

工程筛选通过理由: - 硬件对照表完整可执行:覆盖 DeepSeek-V3/R1 671B(8×A100 80GB)→ DeepSeek-R1-Distill-Qwen-1.5B(GTX 1660 6GB),含激活参数、显存需求、适用场景 - 具体命令序列: - 环境:conda create -n deepseek python=3.10 -y - CUDA 验证:torch.cuda.is_available() + torch.cuda.get_device_name(0) - Ollama 启动:ollama run deepseek-r1:7b;API:http://localhost:11434 - vLLM 启动:--gpu-memory-utilization 0.9,--tensor-parallel-size,--max-model-len - Docker 部署命令:docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve - 量化 GGUF 下载:wget 指向 HuggingFace GGUF 格式模型 - 显存档位决策表:8GB→1.5B蒸馏版;12GB→7B蒸馏或16B量化;24GB+→体验较好

工程价值:最完整 DeepSeek 全系本地部署指南,硬件决策表 + 命令 + API + 量化选择 + Docker 部署路径全齐备。

建议写入:/shared/research-kb/inbox/jay/2026-09-deepseek-deployment-commands.md(独立草稿)

来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md + 2026-09-29T1105-jay-five-category-briefing.md


✅ Tier1-B:MiniCPM-V llama.cpp / vLLM / Ollama 三框架横向部署对比(⭐⭐⭐⭐⭐)

工程筛选通过理由: - 三框架实际命令均可直接执行: - llama.cpp:./bin/llava-cli -m minicpm-v-4_5-q4_0.gguf --mmproj models/minicpm-v-4_5/mmproj-model-f16.gguf --image input_image.jpg - vLLM:vllm(model="openbmb/MiniCPM-V-4_5", trust_remote_code=True, dtype="bfloat16");SamplingParams temperature=0.8, top_p=0.95, max_tokens=512 - Ollama:ollama pull openbmb/minicpm-v:4.5;API:curl http://localhost:11434/api/generate - 硬件推荐表:llama.cpp 6-8GB / vLLM 16GB+ / Ollama int4量化 - 实测性能数据:量化后显存减少75%;视频帧处理(按FPS抽帧) - GPU 推荐:RTX 4090 / A100;iPad Pro M4 / 高端 Android(移动端)

工程价值:多框架选型实操指南,命令 + 硬件要求 + 性能数据齐全,可直接用于多模态推理部署决策。

建议写入:/shared/research-kb/inbox/jay/2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md(独立草稿)

来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md


✅ Tier1-C:Ollama vs vLLM 量化吞吐实测对比 — 24倍吞吐量差距(⭐⭐⭐⭐)

工程筛选通过理由: - 实测量化数据:Qwen2.5-14B → Ollama int4(11GB)vs vLLM FP16/BF16(39GB),显存差距3.5倍 - 吞吐量数据明确:vLLM 并发处理速度是 Ollama 的 24倍(Qwen2.5-14B 实测) - 并发架构差异:vLLM 多进程(每GPU一个进程)vs Ollama 单进程多线程,解释性能差距根源 - 选型决策表:个人开发者 → Ollama(低显存门槛,即开即用);企业高并发 → vLLM(吞吐收益覆盖额外显存成本)

工程价值:推理引擎选型决策核心数据,含量化体系对比和架构差异解释。

建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engine-benchmark-2026-q3.md(合并 Tier1-C/D/E)

来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(CSDN su_xiao_wei · 2025-06-03)


✅ Tier1-D:vLLM + TensorRT-LLM 生产推理优化配置(⭐⭐⭐⭐)

工程筛选通过理由: - PagedAttention 原理+配置:KV缓存分页管理,减少内存碎片,支持更长上下文 - 量化选型矩阵完整:

量化方案 适用场景 精度损失 硬件要求
GPTQ 通用,成熟稳定 中等 无特殊
AWQ 精度损失最小 较低 无特殊
FP8 NVIDIA H100 专属 极低 H100
INT4 极致压缩 较高 无特殊
  • 动态批处理:根据负载动态调整批处理大小,提升GPU利用率
  • 配置分级:7B-13B单GPU;30B-70B多GPU(张量并行+量化);超大模型(流水线+张量并行)
  • 2026-07-06 最新日期,可信度高

工程价值:生产推理优化决策参考,含量化选型矩阵和生产配置分级建议。

建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engineering-vllm-tensorrt-2026-q3.md

来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(CSDN gitblog_00617 · 2026-07-06)


✅ Tier1-E:vLLM vs SGLang vs TensorRT-LLM H100 Benchmark 汇总(⭐⭐⭐⭐⭐)

工程筛选通过理由: - 多源 benchmark 数据对齐(Spheron · PremAI · AIMultiple · DeployBase · Inference Engineering · Atomic Chat · Winder AI): - SGLang(含 prefix reuse):~16,200 tok/s,TTFT ~42ms - vLLM(含 prefix reuse):~12,500 tok/s,TTFT ~45ms - TensorRT-LLM:高并发 ~3,400 tok/s,TTFT ~150-200ms,74GB idle - vLLM(无 prefix):~2,800 tok/s - RadixAttention vs PagedAttention 量化差异:前缀重叠率 >60% 时 SGLang 领先29% - 选型决策阈值明确:prefix-heavy(系统prompt/RAG doc/tool definition共享)→ SGLang;unique prompt为主 → vLLM;极致吞吐+固定模型 → TensorRT-LLM - 9月最新版本:SGLang v1.2.1,vLLM v0.5.20,LMDeploy

工程价值:⭐⭐⭐⭐⭐ 多源独立基准数据收敛,有具体数字和生产案例,是推理引擎选型最重要的数据节点。

⚠️ 重要矛盾需核实(见第三节)

建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engine-benchmark-2026-q3.md(合并 Tier1-C/D/E)

来源:2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md + 2026-09-29T1105-jay-five-category-briefing.md


✅ Tier1-F:vLLM 部署排障 + WSL2 flash-attn 排障(⭐⭐⭐⭐)

工程筛选通过理由: - vLLM 部署排障(CSDN little_shrimp):Python/CUDA/NCCL 版本对应关系实战,源码级解析 - WSL2 flash-attn 排障三步法:GPU算力确认 → PyTorch CUDA版本检查 → wheel/源码编译失败定位 - 两条均为真实排障经验,有错误定位步骤和解决方案 - LangGraph 工业级排障(CSDN ailiandeziwei):12个生产级故障案例(超时/死循环/数据竞争/连接泄漏/注入攻击/预算失控),含 CVE-2025-67644 SQL注入修复

工程价值:部署和长期维护场景的直接参考,有排障路径可复用。

建议写入:/shared/research-kb/inbox/jay/2026-09-vllm-deployment-troubleshooting.md

来源:2026-09-29-csdn-aiagent-rag-highvalue.md(CSDN little_shrimp · ailiandeziwei)


三、⚠️ 重要矛盾 — 需核实后才能归档

⚠️ 矛盾 1:SGLang TTFT 数字三源不一致

来源 SGLang TTFT vLLM TTFT 条件
bex.co(Sep 28锚定) 85ms 380ms H100(型号未注明)
five-category 11:05 42-80ms ~150ms H100 FP8
afternoon 14:00 42ms(含prefix reuse) 45ms(含prefix reuse) H100 FP8

问题:bex.co 的 380ms 与其他来源的 45-150ms 差距过大,可能因: 1. H100 SXM(NVLink)vs H100 PCIe 带宽差可达20% 2. bex.co 测试未启用 prefix caching 3. 模型不同(Llama 3.1 70B vs 其他配置)

建议:合并入 benchmark 文档时注明"prefix reuse enabled" vs "disabled",统一 H100 型号标注(SXM/PCIe)。

⚠️ 矛盾 2:vLLM vs Ollama 24倍吞吐量 — 测量条件不明确

来源:CSDN su_xiao_wei(2025-06-03)

问题:24倍差距是单次实测还是多次平均?batch size、input/output length、模型是否为同一版本均未注明。

建议:作为"量级参考"而非"精确数值"归档,注明"Qwen2.5-14B,条件未完全对齐"。


四、✅ Tier2 — 参考/归档(通过工程筛选,但不直接复用)

# 条目 来源 归档理由 关注点
T2-1 arXiv 2609.23130 — Inference Control Plane 综述 arXiv Sep 19 vLLM → llm-d演进系统性梳理 精读
T2-2 arXiv 2609.27746 — KV Cache Working Set arXiv Sep 23 在线容量规划,2026-09极新鲜 精读
T2-3 arXiv 2608.01526 — "Internet for KV Cache" arXiv KV Cache 基础设施全景,与 ModCon 五代史互补 归档
T2-4 ModCon 2026 Five Eras of KVCache Modular Blog 认知框架,建立全景用 归档
T2-5 SmartGen (2607.28150) + RetroInfer (VLDB 2026) arXiv Jul 30 PD disaggregation + 长上下文向量存储,生产风向标 归档
T2-6 Fluid-Guided Scheduling (2504.11320v4) arXiv Aug 24 MIT+阿里,WAIT算法,PGM 2026接收 归档
T2-7 The AI Agents Stack 2026(Substack) The AI Engineer Agent评估体系三层收敛,Guardrails独立学科 归档
T2-8 Prometheus+Grafana RAG监控体系 CSDN 生产RAG完整监控清单,可作验收标准 归档
T2-9 LLM微调QLoRA→生产全流程 CSDN 方法选型框架,非操作手册 归档
T2-10 OpenViking/VikingMem(VLDB 2026) GitHub+VLDB 火山引擎开源,工程实现细节待论文精读 归档
T2-11 FreeToken — Berkeley边缘MoE HuggingFace Papers 边缘MoE可行性,arXiv编号待确认 归档
T2-12 rig — Rust原生LLM框架 GitHub 7.1k Stars 早期项目,Rust在AI Infra渗透趋势跟踪 低优先级

五、❌ 丢弃条目(未通过工程二次筛选)

❌ 丢弃 1:openGauss RAG 知识库(CSDN)

丢弃理由:SQL Schema + Python 代码质量高,但时间过旧(2025-11-30),环境为 CentOS 7 + openGauss 4.0.0(国产数据库+旧Linux),局限性大。属标杆案例而非通用工程实践,2026-09-29工程筛选10:50已降级处理。

❌ 丢弃 2:Vector DB 2026 行业分析(DEV Community / Actian)

丢弃理由:行业分析和厂商自评benchmark,无具体命令/配置/性能数据。Actian的"供应商自评存在架构特定优势伪装成客观比较"警告有参考价值,但属观察性文章而非工程实践。

❌ 丢弃 3:Simon Willison RSS — GPT-6/Claude发布新闻

丢弃理由:模型发布新闻,无工程实操内容。Raschka "Using Local Coding Agents" 有参考价值但属教程类,非工程命令/源码分析。

❌ 丢弃 4:MSR Blog — 物理AI机器人卸载推理 / RetroChimera / GigaPath

丢弃理由:生命科学/机器人垂直领域,非通用LLM推理工程。SciVal级别研究,非工程实践参考。


六、分类标签汇总

# Tier1-可直接复用
inference-engineering  vLLM  SGLang  TensorRT-LLM  Ollama  llama.cpp
llm-deployment  deepseek  minicpm-v  multimodal-inference
quantization  QLoRA  fine-tuning
kv-cache  PagedAttention  prefix-caching  PD-disaggregation
benchmark  H100  multi-GPU  production-deployment
troubleshooting  version-compatibility  NCCL  flash-attn
CSDN(已筛选)  命令序列  硬件规格  性能数据

# Tier2-归档参考
kv-cache-systems  arxiv-2026  llm-d  control-plane
vldb-2026  icde-2026  modcon-2026
agent-architecture  MCP  guardrails  eval
mlops  prometheus  grafana  monitoring
rust  rig  volcengine  vikingmem
substack  theaiengineer  Berkeley  FreeToken

# 丢弃
行业分析  市场数据  新闻发布  垂直领域研究
openGauss(降级国产)  naive-RAG

七、建议写入路径

独立精读草稿(建议从本文件拆分):

草稿文件名 对应条目 优先级
2026-09-deepseek-deployment-commands.md Tier1-A 🔴 高
2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md Tier1-B 🔴 高
2026-09-inference-engine-benchmark-2026-q3.md Tier1-C + Tier1-E 🔴 高
2026-09-inference-engineering-vllm-tensorrt-2026-q3.md Tier1-D 🟡 中
2026-09-vllm-deployment-troubleshooting.md Tier1-F 🟡 中

主题页更新建议: - llm-deployment 主题页:补充 DeepSeek 全系部署(Tier1-A) - multimodal-inference 主题页:补充 MiniCPM-V 三框架横向部署(Tier1-B) - inference-engineering 主题页:补充 H100 benchmark 汇总数据(Tier1-E)+ vLLM vs Ollama 24x(Tier1-C) - kv-cache-infrastructure 主题页:补充 Sep 23 新鲜论文 KV Cache Working Set(T2-2) - agent-architecture 主题页:补充 The AI Agents Stack 2026 Eval体系(T2-7)


八、后续行动建议

优先级 行动 对应条目
🔴 高 精读 DeepSeek 部署命令 → 写入 LLM 部署主题页 Tier1-A
🔴 高 精读 MiniCPM-V 三框架部署命令 → 写入多模态主题页 Tier1-B
🔴 高 合并 Sep 28 + Sep 29 benchmark 数据点 → 推理引擎选型页(含矛盾澄清) Tier1-E
🟡 中 核实 SGLang TTFT 三源矛盾:标注 H100 SXM/PCIe + prefix on/off ⚠️ 矛盾1
🟡 中 精读 arXiv 2609.23130(Inference Control Plane) T2-1
🟡 中 精读 arXiv 2609.27746(KV Cache Working Set) T2-2
🟡 中 合并 Vector DB 2026 选型格局 → 向量数据库主题页 T2
🟢 低 更新 Vector DB 选型决策树 当前推荐已覆盖主流

本轮筛选完毕。未执行 GitHub 写入。 Jay · 工程二次筛选 · 2026-09-29 14:50 CST