Jay 工程文章二次筛选 · 2026-09-29 下午轮
角色:Jay · 工程二次筛选 时间:2026-09-29 14:50(Asia/Shanghai) 筛选窗口:Sep 29 全天(00:00~14:50 CST)+ Sep 28 傍晚轮未覆盖条目 核心标准:真实环境 · 命令可执行 · 错误/排障记录 · 源码分析 · 性能数据 · 硬件规格 · 可复现步骤 筛选范围:E1prep · 工程筛选10:50 · 午间五类简报 · 下午简报 · CSDN · RSS
一、本轮筛选结论总览
| 分类 | 条目数 | 通过 | 归档 | 丢弃/降级 |
|---|---|---|---|---|
| Tier1(高工程价值) | 6 | 6 | 0 | 0 |
| Tier2(参考/归档) | 12 | 0 | 12 | 0 |
| 丢弃/降级 | 4 | 0 | 0 | 4 |
| 合计 | 22 | 6 | 12 | 4 |
二、✅ Tier1 — 高工程价值(通过二次筛选)
✅ Tier1-A:DeepSeek 全链路本地部署 — 硬件对照表 + 命令序列(⭐⭐⭐⭐⭐)
工程筛选通过理由:
- 硬件对照表完整可执行:覆盖 DeepSeek-V3/R1 671B(8×A100 80GB)→ DeepSeek-R1-Distill-Qwen-1.5B(GTX 1660 6GB),含激活参数、显存需求、适用场景
- 具体命令序列:
- 环境:conda create -n deepseek python=3.10 -y
- CUDA 验证:torch.cuda.is_available() + torch.cuda.get_device_name(0)
- Ollama 启动:ollama run deepseek-r1:7b;API:http://localhost:11434
- vLLM 启动:--gpu-memory-utilization 0.9,--tensor-parallel-size,--max-model-len
- Docker 部署命令:docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
- 量化 GGUF 下载:wget 指向 HuggingFace GGUF 格式模型
- 显存档位决策表:8GB→1.5B蒸馏版;12GB→7B蒸馏或16B量化;24GB+→体验较好
工程价值:最完整 DeepSeek 全系本地部署指南,硬件决策表 + 命令 + API + 量化选择 + Docker 部署路径全齐备。
建议写入:/shared/research-kb/inbox/jay/2026-09-deepseek-deployment-commands.md(独立草稿)
来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md + 2026-09-29T1105-jay-five-category-briefing.md
✅ Tier1-B:MiniCPM-V llama.cpp / vLLM / Ollama 三框架横向部署对比(⭐⭐⭐⭐⭐)
工程筛选通过理由:
- 三框架实际命令均可直接执行:
- llama.cpp:./bin/llava-cli -m minicpm-v-4_5-q4_0.gguf --mmproj models/minicpm-v-4_5/mmproj-model-f16.gguf --image input_image.jpg
- vLLM:vllm(model="openbmb/MiniCPM-V-4_5", trust_remote_code=True, dtype="bfloat16");SamplingParams temperature=0.8, top_p=0.95, max_tokens=512
- Ollama:ollama pull openbmb/minicpm-v:4.5;API:curl http://localhost:11434/api/generate
- 硬件推荐表:llama.cpp 6-8GB / vLLM 16GB+ / Ollama int4量化
- 实测性能数据:量化后显存减少75%;视频帧处理(按FPS抽帧)
- GPU 推荐:RTX 4090 / A100;iPad Pro M4 / 高端 Android(移动端)
工程价值:多框架选型实操指南,命令 + 硬件要求 + 性能数据齐全,可直接用于多模态推理部署决策。
建议写入:/shared/research-kb/inbox/jay/2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md(独立草稿)
来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md
✅ Tier1-C:Ollama vs vLLM 量化吞吐实测对比 — 24倍吞吐量差距(⭐⭐⭐⭐)
工程筛选通过理由: - 实测量化数据:Qwen2.5-14B → Ollama int4(11GB)vs vLLM FP16/BF16(39GB),显存差距3.5倍 - 吞吐量数据明确:vLLM 并发处理速度是 Ollama 的 24倍(Qwen2.5-14B 实测) - 并发架构差异:vLLM 多进程(每GPU一个进程)vs Ollama 单进程多线程,解释性能差距根源 - 选型决策表:个人开发者 → Ollama(低显存门槛,即开即用);企业高并发 → vLLM(吞吐收益覆盖额外显存成本)
工程价值:推理引擎选型决策核心数据,含量化体系对比和架构差异解释。
建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engine-benchmark-2026-q3.md(合并 Tier1-C/D/E)
来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(CSDN su_xiao_wei · 2025-06-03)
✅ Tier1-D:vLLM + TensorRT-LLM 生产推理优化配置(⭐⭐⭐⭐)
工程筛选通过理由: - PagedAttention 原理+配置:KV缓存分页管理,减少内存碎片,支持更长上下文 - 量化选型矩阵完整:
| 量化方案 | 适用场景 | 精度损失 | 硬件要求 |
|---|---|---|---|
| GPTQ | 通用,成熟稳定 | 中等 | 无特殊 |
| AWQ | 精度损失最小 | 较低 | 无特殊 |
| FP8 | NVIDIA H100 专属 | 极低 | H100 |
| INT4 | 极致压缩 | 较高 | 无特殊 |
- 动态批处理:根据负载动态调整批处理大小,提升GPU利用率
- 配置分级:7B-13B单GPU;30B-70B多GPU(张量并行+量化);超大模型(流水线+张量并行)
- 2026-07-06 最新日期,可信度高
工程价值:生产推理优化决策参考,含量化选型矩阵和生产配置分级建议。
建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engineering-vllm-tensorrt-2026-q3.md
来源:2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(CSDN gitblog_00617 · 2026-07-06)
✅ Tier1-E:vLLM vs SGLang vs TensorRT-LLM H100 Benchmark 汇总(⭐⭐⭐⭐⭐)
工程筛选通过理由: - 多源 benchmark 数据对齐(Spheron · PremAI · AIMultiple · DeployBase · Inference Engineering · Atomic Chat · Winder AI): - SGLang(含 prefix reuse):~16,200 tok/s,TTFT ~42ms - vLLM(含 prefix reuse):~12,500 tok/s,TTFT ~45ms - TensorRT-LLM:高并发 ~3,400 tok/s,TTFT ~150-200ms,74GB idle - vLLM(无 prefix):~2,800 tok/s - RadixAttention vs PagedAttention 量化差异:前缀重叠率 >60% 时 SGLang 领先29% - 选型决策阈值明确:prefix-heavy(系统prompt/RAG doc/tool definition共享)→ SGLang;unique prompt为主 → vLLM;极致吞吐+固定模型 → TensorRT-LLM - 9月最新版本:SGLang v1.2.1,vLLM v0.5.20,LMDeploy
工程价值:⭐⭐⭐⭐⭐ 多源独立基准数据收敛,有具体数字和生产案例,是推理引擎选型最重要的数据节点。
⚠️ 重要矛盾需核实(见第三节)
建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engine-benchmark-2026-q3.md(合并 Tier1-C/D/E)
来源:2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md + 2026-09-29T1105-jay-five-category-briefing.md
✅ Tier1-F:vLLM 部署排障 + WSL2 flash-attn 排障(⭐⭐⭐⭐)
工程筛选通过理由:
- vLLM 部署排障(CSDN little_shrimp):Python/CUDA/NCCL 版本对应关系实战,源码级解析
- WSL2 flash-attn 排障三步法:GPU算力确认 → PyTorch CUDA版本检查 → wheel/源码编译失败定位
- 两条均为真实排障经验,有错误定位步骤和解决方案
- LangGraph 工业级排障(CSDN ailiandeziwei):12个生产级故障案例(超时/死循环/数据竞争/连接泄漏/注入攻击/预算失控),含 CVE-2025-67644 SQL注入修复
工程价值:部署和长期维护场景的直接参考,有排障路径可复用。
建议写入:/shared/research-kb/inbox/jay/2026-09-vllm-deployment-troubleshooting.md
来源:2026-09-29-csdn-aiagent-rag-highvalue.md(CSDN little_shrimp · ailiandeziwei)
三、⚠️ 重要矛盾 — 需核实后才能归档
⚠️ 矛盾 1:SGLang TTFT 数字三源不一致
| 来源 | SGLang TTFT | vLLM TTFT | 条件 |
|---|---|---|---|
| bex.co(Sep 28锚定) | 85ms | 380ms | H100(型号未注明) |
| five-category 11:05 | 42-80ms | ~150ms | H100 FP8 |
| afternoon 14:00 | 42ms(含prefix reuse) | 45ms(含prefix reuse) | H100 FP8 |
问题:bex.co 的 380ms 与其他来源的 45-150ms 差距过大,可能因: 1. H100 SXM(NVLink)vs H100 PCIe 带宽差可达20% 2. bex.co 测试未启用 prefix caching 3. 模型不同(Llama 3.1 70B vs 其他配置)
建议:合并入 benchmark 文档时注明"prefix reuse enabled" vs "disabled",统一 H100 型号标注(SXM/PCIe)。
⚠️ 矛盾 2:vLLM vs Ollama 24倍吞吐量 — 测量条件不明确
来源:CSDN su_xiao_wei(2025-06-03)
问题:24倍差距是单次实测还是多次平均?batch size、input/output length、模型是否为同一版本均未注明。
建议:作为"量级参考"而非"精确数值"归档,注明"Qwen2.5-14B,条件未完全对齐"。
四、✅ Tier2 — 参考/归档(通过工程筛选,但不直接复用)
| # | 条目 | 来源 | 归档理由 | 关注点 |
|---|---|---|---|---|
| T2-1 | arXiv 2609.23130 — Inference Control Plane 综述 | arXiv Sep 19 | vLLM → llm-d演进系统性梳理 | 精读 |
| T2-2 | arXiv 2609.27746 — KV Cache Working Set | arXiv Sep 23 | 在线容量规划,2026-09极新鲜 | 精读 |
| T2-3 | arXiv 2608.01526 — "Internet for KV Cache" | arXiv | KV Cache 基础设施全景,与 ModCon 五代史互补 | 归档 |
| T2-4 | ModCon 2026 Five Eras of KVCache | Modular Blog | 认知框架,建立全景用 | 归档 |
| T2-5 | SmartGen (2607.28150) + RetroInfer (VLDB 2026) | arXiv Jul 30 | PD disaggregation + 长上下文向量存储,生产风向标 | 归档 |
| T2-6 | Fluid-Guided Scheduling (2504.11320v4) | arXiv Aug 24 | MIT+阿里,WAIT算法,PGM 2026接收 | 归档 |
| T2-7 | The AI Agents Stack 2026(Substack) | The AI Engineer | Agent评估体系三层收敛,Guardrails独立学科 | 归档 |
| T2-8 | Prometheus+Grafana RAG监控体系 | CSDN | 生产RAG完整监控清单,可作验收标准 | 归档 |
| T2-9 | LLM微调QLoRA→生产全流程 | CSDN | 方法选型框架,非操作手册 | 归档 |
| T2-10 | OpenViking/VikingMem(VLDB 2026) | GitHub+VLDB | 火山引擎开源,工程实现细节待论文精读 | 归档 |
| T2-11 | FreeToken — Berkeley边缘MoE | HuggingFace Papers | 边缘MoE可行性,arXiv编号待确认 | 归档 |
| T2-12 | rig — Rust原生LLM框架 | GitHub 7.1k Stars | 早期项目,Rust在AI Infra渗透趋势跟踪 | 低优先级 |
五、❌ 丢弃条目(未通过工程二次筛选)
❌ 丢弃 1:openGauss RAG 知识库(CSDN)
丢弃理由:SQL Schema + Python 代码质量高,但时间过旧(2025-11-30),环境为 CentOS 7 + openGauss 4.0.0(国产数据库+旧Linux),局限性大。属标杆案例而非通用工程实践,2026-09-29工程筛选10:50已降级处理。
❌ 丢弃 2:Vector DB 2026 行业分析(DEV Community / Actian)
丢弃理由:行业分析和厂商自评benchmark,无具体命令/配置/性能数据。Actian的"供应商自评存在架构特定优势伪装成客观比较"警告有参考价值,但属观察性文章而非工程实践。
❌ 丢弃 3:Simon Willison RSS — GPT-6/Claude发布新闻
丢弃理由:模型发布新闻,无工程实操内容。Raschka "Using Local Coding Agents" 有参考价值但属教程类,非工程命令/源码分析。
❌ 丢弃 4:MSR Blog — 物理AI机器人卸载推理 / RetroChimera / GigaPath
丢弃理由:生命科学/机器人垂直领域,非通用LLM推理工程。SciVal级别研究,非工程实践参考。
六、分类标签汇总
# Tier1-可直接复用
inference-engineering vLLM SGLang TensorRT-LLM Ollama llama.cpp
llm-deployment deepseek minicpm-v multimodal-inference
quantization QLoRA fine-tuning
kv-cache PagedAttention prefix-caching PD-disaggregation
benchmark H100 multi-GPU production-deployment
troubleshooting version-compatibility NCCL flash-attn
CSDN(已筛选) 命令序列 硬件规格 性能数据
# Tier2-归档参考
kv-cache-systems arxiv-2026 llm-d control-plane
vldb-2026 icde-2026 modcon-2026
agent-architecture MCP guardrails eval
mlops prometheus grafana monitoring
rust rig volcengine vikingmem
substack theaiengineer Berkeley FreeToken
# 丢弃
行业分析 市场数据 新闻发布 垂直领域研究
openGauss(降级国产) naive-RAG
七、建议写入路径
独立精读草稿(建议从本文件拆分):
| 草稿文件名 | 对应条目 | 优先级 |
|---|---|---|
2026-09-deepseek-deployment-commands.md |
Tier1-A | 🔴 高 |
2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md |
Tier1-B | 🔴 高 |
2026-09-inference-engine-benchmark-2026-q3.md |
Tier1-C + Tier1-E | 🔴 高 |
2026-09-inference-engineering-vllm-tensorrt-2026-q3.md |
Tier1-D | 🟡 中 |
2026-09-vllm-deployment-troubleshooting.md |
Tier1-F | 🟡 中 |
主题页更新建议:
- llm-deployment 主题页:补充 DeepSeek 全系部署(Tier1-A)
- multimodal-inference 主题页:补充 MiniCPM-V 三框架横向部署(Tier1-B)
- inference-engineering 主题页:补充 H100 benchmark 汇总数据(Tier1-E)+ vLLM vs Ollama 24x(Tier1-C)
- kv-cache-infrastructure 主题页:补充 Sep 23 新鲜论文 KV Cache Working Set(T2-2)
- agent-architecture 主题页:补充 The AI Agents Stack 2026 Eval体系(T2-7)
八、后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| 🔴 高 | 精读 DeepSeek 部署命令 → 写入 LLM 部署主题页 | Tier1-A |
| 🔴 高 | 精读 MiniCPM-V 三框架部署命令 → 写入多模态主题页 | Tier1-B |
| 🔴 高 | 合并 Sep 28 + Sep 29 benchmark 数据点 → 推理引擎选型页(含矛盾澄清) | Tier1-E |
| 🟡 中 | 核实 SGLang TTFT 三源矛盾:标注 H100 SXM/PCIe + prefix on/off | ⚠️ 矛盾1 |
| 🟡 中 | 精读 arXiv 2609.23130(Inference Control Plane) | T2-1 |
| 🟡 中 | 精读 arXiv 2609.27746(KV Cache Working Set) | T2-2 |
| 🟡 中 | 合并 Vector DB 2026 选型格局 → 向量数据库主题页 | T2 |
| 🟢 低 | 更新 Vector DB 选型决策树 | 当前推荐已覆盖主流 |
本轮筛选完毕。未执行 GitHub 写入。 Jay · 工程二次筛选 · 2026-09-29 14:50 CST