Jay 工程筛选 · 2026-09-29 第 3 次轮次
筛选角色:Jay(工程二次筛选) 时间:2026-09-29 10:50(Asia/Shanghai) 筛选范围:Sep 28 傍晚轮 + Sep 29 新内容 核心标准:真实环境 · 命令可执行 · 错误/排障记录 · 源码分析 · 性能数据 · 硬件规格 · 可复现步骤
📊 本轮新增候选条目(Sep 29 新内容)
| # | 条目 | 来源 | 主题 |
|---|---|---|---|
| A | DeepSeek 本地部署完全方案 | CSDN | LLM部署 / 硬件规格表 / vLLM+Ollama命令 |
| B | MiniCPM-V llama.cpp/vLLM/Ollama 部署 | CSDN | 多模态推理 / 3框架横向对比 / 命令 |
| C | openGauss 企业级 RAG(SQL Schema+Python) | CSDN | 向量数据库 / 可复现建表+插入 |
| D | LLM微调 QLoRA→生产部署全流程 | CSDN | 微调工程 / 方法选型 |
| E | Ollama vs vLLM 推理框架对比 | CSDN | 推理引擎选型 / 性能量化数据 |
| F | 生产 RAG 监控体系(Prometheus/Grafana) | CSDN | MLOps / 生产检查清单 |
| G | vLLM+TensorRT-LLM 推理优化 | CSDN | 推理优化 / PagedAttention / 量化配置 |
| H | OpenViking(Volcengine/VikingMem) | GitHub+VLDB2026 | 记忆数据库 / Agent记忆 |
| I | FreeToken — Berkeley 边缘 MoE | HuggingFace Papers | 边缘推理 / 路由算法 |
| J | The AI Agents Stack 2026 Edition | Substack | Agent技术栈 / Eval体系 |
| K | arXiv 2609.27746 KV Cache Working Set | arXiv(Sep 23) | 在线容量规划 / LLM推理系统 |
| L | The Five Eras of KVCache(ModCon 2026) | Modular Blog | KVCache 演进 / 基础设施视角 |
| M | OpenViking(GitHub)/ rig(Rust) | GitHub | 工程框架 / 生态更新 |
✅ 保留条目(通过工程二次筛选)
✅ Tier1 — 高工程价值(可直接复用/复现)
✅ A:DeepSeek 本地部署完全方案
来源:CSDN · deepin20100 · 2026-06-25(最新推荐 2026-07-20)
URL:https://blog.csdn.net/deepin20100/article/details/162314523
工程筛选通过理由:
- 硬件对照表完整:覆盖 DeepSeek-V3 671B(8×A100 80GB)→ DeepSeek-R1-Distill-Qwen-1.5B(GTX 1660 6GB),含激活参数、显存需求、适用场景
- 具体部署命令序列:conda create -n deepseek python=3.10 -y;torch.cuda.is_available() + torch.cuda.get_device_name(0) 验证;Ollama ollama run deepseek-r1:7b;vLLM vllm serve ... Q5_K_M.gguf
- 量化文件下载命令:wget 指向 HuggingFace GGUF 格式模型
- Docker 部署:docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
- vLLM 关键参数:--gpu-memory-utilization 0.9,--tensor-parallel-size,--max-model-len
- 显存档位决策表:8GB/12GB/24GB+ 三档推荐方案
工程价值:⭐⭐⭐⭐⭐ 完整可复现部署路径,覆盖 1.3B-671B 全系,配硬件决策表
建议写入:LLM部署主题页 DeepSeek 章节;或独立 2026-09-deepseek-deployment-commands.md
✅ B:MiniCPM-V llama.cpp / vLLM / Ollama 横向部署对比
来源:CSDN · gitblog_01002 · 2025-11-16(最新推荐 2026-01-06)
URL:https://blog.csdn.net/gitblog_01002/article/details/154892380
工程筛选通过理由:
- 3框架实际命令:llama.cpp ./bin/llava-cli -m ... --mmproj ... --image ...;vLLM vllm(model="openbmb/MiniCPM-V-4_5", ...);Ollama ollama pull openbmb/minicpm-v:4.5 + curl API 调用
- 硬件推荐表:llama.cpp 6-8GB / vLLM 16GB+ / Ollama int4量化
- GPU推荐:RTX 4090 / A100;iPad Pro M4 / 高端Android(移动端)
- 性能对比:量化后显存减少75%;视频帧处理(按FPS抽帧)
- vLLM SamplingParams:temperature=0.8, top_p=0.95, max_tokens=512
工程价值:⭐⭐⭐⭐⭐ 多框架选型实操指南,命令+硬件要求+性能数据齐全
建议写入:多模态推理部署主题页;或独立 2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md
✅ E:Ollama vs vLLM 推理框架量化对比
来源:CSDN · su_xiao_wei · 2025-06-03
URL:https://blog.csdn.net/su_xiao_wei/article/details/145904984
工程筛选通过理由: - 量化数据具体:Qwen2.5-14B → Ollama 11GB vs vLLM 39GB(int4 vs FP16) - 吞吐量数据:vLLM 并发处理速度可达 Ollama 的 24倍 - 并发架构差异:vLLM 多进程(每GPU一个)vs Ollama 单进程多线程 - 选型决策表:个人开发者→Ollama;企业高并发→vLLM
工程价值:⭐⭐⭐⭐ 选型决策表清晰,含量化对比数字 建议写入:推理引擎选型主题页(benchmark 数据点)
✅ G:推理优化 vLLM+TensorRT-LLM(2026-07 最新)
来源:CSDN · gitblog_00617 · 2026-07-06
URL:https://blog.csdn.net/gitblog_00617/article/details/152877379
工程筛选通过理由: - PagedAttention 原理+配置:KV缓存分页管理,减少内存碎片 - 量化选型指南:GPTQ通用 / AWQ精度损失小 / FP8(NVIDIA H100专属) / INT4极致压缩 - 配置建议分级:7B-13B单GPU;30B-70B多GPU(张量并行+量化);超大模型(流水线+张量并行) - TensorRT-LLM 启动命令和 vLLM SamplingParams 具体参数说明 - 动态批处理:根据负载动态调整批处理大小
工程价值:⭐⭐⭐⭐ 2026年7月最新实战,含量化选型矩阵和生产配置建议 建议写入:推理优化主题页(2026-Q3更新)
✅ Tier2 — 中高工程价值(参考/归档)
✅ D:LLM微调 QLoRA→生产部署工程化全流程
通过理由:工程化视角强,QLoRA vs LoRA vs 全参数微调 vs 分布式训练 vs RLHF vs SFT 方法选型边界清晰。核心价值:降低GPU门槛同时保持专业能力。不是操作手册,但是方法论框架。 建议:归档留存,作为微调方法选型参考
✅ F:生产RAG监控体系(Prometheus/Grafana/ELK)
通过理由:服务化架构解耦、API通信描述;监控体系完整:性能监控(延迟/吞吐量/资源利用率)+ 效果监控(召回率@10 + BLEU + 人工)+ 日志监控;MLOps for RAG反馈循环;安全检查清单 建议:归档留存,作为 RAG 生产验收标准参考
✅ H:OpenViking / VikingMem(Volcengine,VLDB 2026)
通过理由:火山引擎开源 + VLDB 2026 同行评审。VikingMem:Stateful LLM应用的记忆基管理系统;VikingRAG:结构化文档高精度RAG;Directory-Aware Query(ICDE 2026)。工程价值待论文精读后确认。 建议:归档 Tier2,精读 VLDB 2026 论文后升级
✅ I:FreeToken — Berkeley 边缘原生 MoE
通过理由:UC Berkeley 学术团队,带宽自适应专家并行+设备间状态路由。HuggingFace Papers 精选。工程价值待论文精读确认(关注实际硬件适配列表和延迟数据) 建议:归档 Tier2,关注端侧 MoE 部署可行性
✅ J:The AI Agents Stack 2026 Edition(The AI Engineer Substack)
通过理由:Agent Guardrails 独立学科(授权工具调用/执行速率限制/行为验证);Eval as Infrastructure 三层收敛;新 Benchmark 涌现(Context-Bench/Recovery-Bench/Terminal-Bench)。比昨天 evening filter 收录内容更丰富,含协议落地分析(IBM ACP/Google A2A) 建议:归档留存,补充 Agent 评估体系文档
✅ K:arXiv 2609.27746 — The KV Cache Working Set(Sep 23, 2026)
通过理由:在线容量规划 for LLM Inference Systems,2026-09-23 极新鲜,作者含 Shuaishuai Wang / Zhao Ruan 等系统性研究团队。属于 LLM Serving 基础设施方向 建议:归档留存,关注其与 LMCache / KVServe / HotPrefix 的关联
✅ L:The Five Eras of KVCache(ModCon 2026 / Modular)
通过理由:ModCon 2026(2026年9月)演讲,总结 KVCache 从 temporary state 到 AI-native knowledge layer 的演进。基础设施视角,适合建立全景认知 建议:归档留存,与 "Internet for KV Cache" (arXiv 2608.01526) 合并阅读
✅ M:rig — Rust原生模块化LLM框架
通过理由:Rust原生模块化LLM框架,7.1k Stars,面向性能敏感部署。属早期新兴项目,需跟踪社区活跃度 建议:归档 Tier2,关注 Rust 在 AI Infra 渗透趋势
❌ 丢弃条目(未通过工程筛选)
❌ C(降级处理):openGauss RAG 知识库
原分级:CSDN Tier1 丢弃理由: - 内容质量高(SQL Schema + Python + 防火墙命令 + gs_ctl 工具链),但时间过旧(2025-11-30) - openGauss 4.0.0 企业版 + CentOS 7,环境局限性大(国产数据库+旧Linux) - 属标杆案例而非通用工程实践——更适合作为"RAG+国产向量数据库"专题案例,不宜作通用工程参考 - 若用户有 openGauss 需求可定向推荐,不进入通用工程知识库
决策:降为 Tier3 参考,不进入工程筛选核心推荐列表
❌ openGauss(降级),Vector DB 2026 趋势分析
来源:DEV Community / ai-engineering-trending Sep 29 丢弃理由:行业分析,无具体命令/配置/性能数据。独立向量数据库泡沫叙述有参考价值,但属观察性文章而非工程实践
❌ Hugging Face 300万模型里程碑
丢弃理由:市场数据,非工程内容。不涉及命令/源码/配置/性能
❌ 1000+ JD 分析(AI Engineer 职位研究)
丢弃理由:行业/职业研究,非工程实践
❌ Simon Willison RSS — Claude Sonnet 5.5 发布
丢弃理由:模型发布新闻,无工程实操内容
❌ Import AI — 各期摘要
丢弃理由:Jack Clark 的 Import AI 偏向 AI 政策/社会影响,本次 RSS 摘录中无直接工程命令或源码分析条目
📊 Sep 28 傍晚轮 + Sep 29 新内容综合筛选统计
| 指标 | Sep 28 傍晚轮 | Sep 29 新内容 | 合计 |
|---|---|---|---|
| 候选总数 | 16 | 13 | 29 |
| 保留 Tier1 | 5 | 4 | 9 |
| 保留 Tier2 | 8 | 7 | 15 |
| 丢弃/降级 | 3 | 2 | 5 |
🏷️ 分类标签汇总
inference-engineering vLLM SGLang Ollama llama.cpp
llm-deployment deepseek minicpm-v multimodal-inference
kv-cache LMCache prefix-caching PD-disaggregation
agentic-architecture MCP A2A ACP
production-deployment H100 multi-GPU benchmark
quantization QLoRA LoRA fine-tuning
mlops prometheus grafana monitoring
rust rig openviking vikingmem
arxiv-2026 sigcomm-2026 vldb-2026 icde-2026
substack theaiengineer Berkeley volcengine
CSDN(已筛选) openGauss(降级)
📁 建议写入路径
本次新增精读草稿(建议写入 jay/inbox/):
- 2026-09-29T1050-jay-engineering-filter.md(本文件)
- 建议从本文件拆分独立草稿:
- 2026-09-deepseek-deployment-commands.md(Tier1 A)
- 2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md(Tier1 B)
- 2026-09-inference-engine-benchmark-data.md(Tier1 E+G + Sep 28 benchmark条目)
主题页更新建议:
- llm-deployment 主题页:补充 DeepSeek 全系部署章节(Tier1 A)
- multimodal-inference 主题页:补充 MiniCPM-V 三框架横向部署(Tier1 B)
- inference-engineering 主题页:补充 vLLM vs Ollama 量化对比数据(Tier1 E)
- kv-cache-infrastructure 主题页:补充 Sep 23 新鲜论文 KV Cache Working Set(Tier2 K)
- agent-architecture 主题页:补充 The AI Agents Stack 2026 Eval体系(Tier2 J)
🔬 后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| 高 | 精读 DeepSeek 部署命令 → 写入 LLM 部署主题页 | Tier1 A |
| 高 | 精读 MiniCPM-V 三框架部署命令 → 写入多模态主题页 | Tier1 B |
| 高 | 合并 Sep 28 推理 benchmark 数据点(Prem AI/AIMultiple/Jarvis Labs)→ 推理引擎选型页 | Tier1 E+G |
| 中 | 精读 VLDB 2026 VikingMem 论文 → 确认工程实现细节 | Tier2 H |
| 中 | 精读 arXiv 2609.27746 KV Cache Working Set | Tier2 K |
| 中 | 精读 FreeToken 论文 → 确认边缘 MoE 硬件路由 | Tier2 I |
| 低 | 归档 rig (Rust LLM framework) → 跟踪社区活跃度 | Tier2 M |
本轮筛选完毕。未执行 GitHub 写入。