Jay 五类简报 · 2026-09-29 午间版

实例:Jay
时间:2026-09-29 11:05(Asia/Shanghai)
简报定位:第 3 次轮次(早间 CSDN 轮 + 工程筛选轮已覆盖,本轮整合 + 补充新鲜来源)
覆盖来源:CSDN RSS · arXiv (cs.CL/cs.IR) · ByteByteGo · Raschka · Lilian Weng · Simon Willison · GitHub Trending · Tavily 实时搜索 · Engineering Filter


📦 Database · 向量数据库与数据层

高价值条目

🔷 openGauss 企业级 RAG(SQL Schema + Python 可复现)

  • 来源:CSDN · m0_68089732 · 2025-11-30
  • URL:https://blog.csdn.net/m0_68089732/article/details/155428896
  • 核心价值:
  • 内置向量类型:VECTOR(768),CREATE INDEX ... USING GIN
  • 建表语句:rag_knowledge 含 content TEXT, embedding VECTOR(768), create_time
  • 批量插入:execute_batch(每批 10 条);余弦距离检索:embedding <=> %s AS similarity
  • 环境工具链:gs_ctl start/stop/restart/status,gsql 连接命令
  • Embedding:all-MiniLM-L6-v2(768 维);LangChain + Ollama 生成层
  • 工程评价:完整可复现企业级 RAG + 国产数据库标杆案例;SQL Schema + Python 代码 + 环境命令 + 验证输出齐全
  • 可信度:高(有完整命令输出验证)
  • 分类标签:向量数据库 RAG openGauss 国产数据库 可复现
  • 建议行动:对比 pgvector 方案,写入 RAG 数据库选型主题页;注意时间较旧(2025-11)

🔷 Vector DB 2026 选型格局(行业分析 + 生产验收标准)

  • 来源:Refonte Learning · Alpha Corp · GroovyWeb · Actian · Splunk · Braintrust · Tavily 实时搜索 2026-09-29
  • 核心结论:
  • Pinecone:零运维托管,适合不需要自建基础设施的团队
  • Qdrant:Rust 实现,开源高性能,强过滤能力
  • Weaviate:内置 reranker,原生 hybrid search,适合快速上线
  • Milvus / Zilliz Cloud:100M+ 向量规模首选
  • pgvector:已有 Postgres 团队的首选,无需引入新系统
  • CORE Systems 2026 Benchmark:Weaviate p50 ~4.2ms,p99 ~12ms(1M 向量 1536 维)
  • Blockify 数据优化层:IdeaBlocks 语义分块,78× RAG 准确率提升(营销声明,待核验)
  • Splunk:生产 RAG 四个关键转变:实时流量 filter selectivity、动态 hybrid search 参数调优、独立 recall 追踪、数据库健康与 LLM下游评估联动
  • Actian:Benchmark 测试静态,生产数据持续流入——"最好的向量数据库是你已经在用的那个"
  • 工程评价:2026-09 月最新行业综述,帮助建立选型框架,但非实操手册
  • 可信度:中高(行业分析为主,部分数据来自厂商/营销,需交叉验证)
  • 分类标签:向量数据库选型 Pinecone Qdrant Weaviate Milvus pgvector RAG架构
  • 建议行动:归档 Tier2;写入向量数据库主题页 2026-Q3 更新

🔷 OpenViking / VikingMem(Volcengine · VLDB 2026)

  • 来源:GitHub + VLDB 2026(待精读)
  • 核心价值:
  • VikingMem:Stateful LLM 应用的记忆基管理系统
  • VikingRAG:结构化文档高精度 RAG
  • Directory-Aware Query(ICDE 2026)
  • 工程评价:火山引擎开源 + VLDB 2026 同行评审,工程价值待论文精读后确认
  • 分类标签:向量数据库 VLDB2026 ICDE2026 agent-memory volcengine
  • 建议行动:归档 Tier2,精读 VLDB 2026 论文后升级

⚙️ Backend · 推理引擎与后端系统

高价值条目

🔷 vLLM vs SGLang vs TensorRT-LLM H100 Benchmark(2026 实时对比)

  • 来源:Spheron Blog · Prem AI · AIMultiple · DeployBase · Inference Engineering · Atomic Chat · Winder AI(2026-09)
  • Benchmark 数据汇总(Llama 3.1 70B,H100 80GB,FP8):
引擎 并发 吞吐量 TTFT 显存
TensorRT-LLM 高并发 ~3,400 tok/s ~150-200ms 74GB(idle)
SGLang 高并发 ~2,900 tok/s ~42-80ms 最低(KV cache 管理最优)
vLLM 高并发 ~2,800 tok/s ~150ms 71GB
vLLM(prefix reuse) 高并发 ~12,500 tok/s ~45ms —
SGLang(prefix reuse) 高并发 ~16,200 tok/s ~42ms —
  • SGLang prefix reuse 专项优势(RadixAttention):
  • 共享 system prompt / tool definition / conversation history 时,吞吐量比 vLLM 高 29%
  • 25 Sep 2026 发现:GLM-5.3-Flash 45 层中 34 层为线性注意力,长 prompt 产生大量 snapshots,Qwen3.8-Flash-Next 无此问题
  • 生产实操:8×RTX PRO 6000 Blackwell 上 Qwen3.8 + GLM-5.3-Flash 混部策略
  • SGLang vs vLLM 选型决策:
  • 多轮对话、prefix-heavy → SGLang(RadixAttention 优势明显)
  • 独特 prompt 为主 → vLLM(生态更大,92.7k vs 36.4k GitHub stars)
  • 极致吞吐 + 固定模型 → TensorRT-LLM(编译后最快)
  • 2026 年 9 月建议:先用 vLLM 起步,用真实流量测 SGLang,再决定
  • 工程评价:⭐⭐⭐⭐⭐ 多源基准数据对齐,有具体数字和生产案例
  • 可信度:高(多家独立基准来源数据吻合)
  • 分类标签:inference-engineering vLLM SGLang TensorRT-LLM benchmark H100 Blackwell
  • 建议行动:写入推理引擎选型主题页(2026-Q3 benchmark 数据节点)

🔷 DeepSeek 本地部署完全方案(Tier1 可复现)

  • 来源:CSDN · deepin20100 · 2026-06-25(最新推荐 2026-07-20)
  • URL:https://blog.csdn.net/deepin20100/article/details/162314523
  • 核心价值:
  • 硬件对照表(DeepSeek-V3 671B → R1-Distill-Qwen-1.5B 覆盖 8×A100 80GB 到 GTX 1660 6GB)
  • 环境命令:conda create -n deepseek python=3.10 -y;CUDA 验证:torch.cuda.is_available()
  • Ollama:ollama run deepseek-r1:7b;vLLM:--gpu-memory-utilization 0.9
  • Docker 部署:docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
  • 量化 GGUF 下载:wget 指向 HuggingFace GGUF 格式
  • 显存档位:8GB→1.5B蒸馏版;12GB→7B蒸馏或16B量化;24GB+→体验较好
  • 工程评价:⭐⭐⭐⭐⭐ 最完整 DeepSeek 本地部署指南,硬件决策表 + 命令 + API 调用 + 量化选择
  • 可信度:高(有完整命令序列和硬件规格表)
  • 分类标签:llm-deployment deepseek vLLM ollama quantization multi-GPU
  • 建议行动:精读 → 写入 LLM 部署主题页 DeepSeek 章节

🔷 MiniCPM-V llama.cpp / vLLM / Ollama 横向部署(Tier1 可复现)

  • 来源:CSDN · gitblog_01002 · 2025-11-16(最新推荐 2026-01-06)
  • URL:https://blog.csdn.net/gitblog_01002/article/details/154892380
  • 核心价值:
  • 3 框架实际命令:llama.cpp ./bin/llava-cli -m ... --mmproj ... --image ...;vLLM vLLM(model="openbmb/MiniCPM-V-4_5", ...);Ollama ollama pull openbmb/minicpm-v:4.5
  • 硬件推荐表:llama.cpp 6-8GB / vLLM 16GB+ / Ollama int4量化
  • 性能对比:量化后显存减少 75%;vLLM SamplingParams:temperature=0.8, top_p=0.95, max_tokens=512
  • 工程评价:⭐⭐⭐⭐⭐ 多框架选型实操指南,命令 + 硬件要求 + 性能数据齐全
  • 可信度:高(有命令输出和性能对比表)
  • 分类标签:multimodal-inference MiniCPM llama.cpp vLLM Ollama 端侧推理
  • 建议行动:精读 → 写入多模态推理部署主题页

🔷 vLLM + TensorRT-LLM 推理优化(2026-07 最新)

  • 来源:CSDN · gitblog_00617 · 2026-07-06
  • URL:https://blog.csdn.net/gitblog_00617/article/details/152877379
  • 核心价值:
  • PagedAttention 原理 + 配置(KV 缓存分页管理,减少内存碎片)
  • 量化选型矩阵:GPTQ(通用)/ AWQ(精度损失小)/ FP8(H100 专属)/ INT4(极致压缩)
  • 配置分级:7B-13B 单 GPU;30B-70B 多 GPU(张量并行+量化);超大模型(流水线+张量并行)
  • 动态批处理:根据负载动态调整批处理大小
  • 工程评价:⭐⭐⭐⭐ 2026-Q3 最新实战,含量化选型矩阵和生产配置建议
  • 可信度:高
  • 分类标签:inference-engineering vLLM TensorRT-LLM quantization PagedAttention
  • 建议行动:精读 → 写入推理优化主题页(2026-Q3 更新)

🔷 FreeToken — Berkeley 边缘原生 MoE

  • 来源:HuggingFace Papers · UC Berkeley
  • 核心价值:带宽自适应专家并行 + 设备间状态路由,面向边缘推理
  • 工程评价:待论文精读确认硬件适配列表和延迟数据
  • 分类标签:MoE 边缘推理 Berkeley arxiv-2026
  • 建议行动:归档 Tier2,关注端侧 MoE 部署可行性

🔷 rig — Rust 原生模块化 LLM 框架

  • 来源:GitHub · 7.1k Stars
  • 核心价值:Rust 原生,面向性能敏感部署;早期新兴项目
  • 分类标签:rust llm-framework inference-engineering
  • 建议行动:归档 Tier2,关注 Rust 在 AI Infra 渗透趋势

☁️ Cloud-Native · K8s 与云原生推理

高价值条目

🔷 PD Disaggregation + LMCache / Prefix Caching

  • 来源:arXiv · Engineering Filter Sep 28
  • 核心价值:Prefill-Decode 分离架构 + KV Cache 前缀缓存,是 2026 年生产推理优化的核心方向之一
  • 关键论文:arXiv 2609.27746 — The KV Cache Working Set(Sep 23, 2026),在线容量规划 for LLM Inference Systems
  • 关联:LMCache(开源 KV Cache 缓存库)、KVServe、HotPrefix、ModCon 2026 Five Eras of KVCache
  • 工程评价:⭐⭐⭐⭐ 基础设施方向,适合系统工程师深度了解
  • 分类标签:kv-cache PD-disaggregation LMCache prefix-caching inference-systems
  • 建议行动:精读 2609.27746,与 Five Eras of KVCache 合并阅读

🔷 Prometheus + Grafana 生产 RAG 监控体系

  • 来源:CSDN · Engineering Filter Sep 28
  • 核心价值:
  • 性能监控:延迟 / 吞吐量 / 资源利用率
  • 效果监控:召回率@10 + BLEU + 人工
  • 日志监控 + MLOps for RAG 反馈循环 + 安全检查清单
  • 工程评价:⭐⭐⭐⭐⭐ 生产 RAG 完整监控方案,可作为 RAG 生产验收标准参考
  • 分类标签:mlops prometheus grafana monitoring production-RAG
  • 建议行动:归档留存,作为 RAG 生产运维检查清单

🔷 The Five Eras of KVCache(ModCon 2026 / Modular)

  • 来源:Modular Blog · ModCon 2026(2026年9月)
  • 核心价值:总结 KVCache 从 temporary state 到 AI-native knowledge layer 的演进;基础设施全景视角
  • 关联:arXiv 2608.01526 "Internet for KV Cache"
  • 工程评价:⭐⭐⭐ 认知框架价值高,适合建立全景
  • 分类标签:kv-cache ModCon2026 inference-systems
  • 建议行动:归档 Tier2,与 "Internet for KV Cache" 合并阅读

💻 CSDN · 已筛选工程高价值文章

高价值条目(按主题聚合)

🔷 DeepSeek 本地部署完全方案(Tier1)

  • 见 Backend 部分,已完整记录
  • 写入建议:2026-09-deepseek-deployment-commands.md

🔷 MiniCPM-V 三框架横向部署(Tier1)

  • 见 Backend 部分,已完整记录
  • 写入建议:2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md

🔷 vLLM + TensorRT-LLM 推理优化(Tier1)

  • 见 Backend 部分,已完整记录

🔷 Ollama vs vLLM 量化对比(Tier1)

  • 来源:CSDN · su_xiao_wei · 2025-06-03
  • URL:https://blog.csdn.net/su_xiao_wei/article/details/145904984
  • 核心数据:
  • Qwen2.5-14B → Ollama 11GB vs vLLM 39GB(int4 vs FP16)
  • vLLM 并发处理速度可达 Ollama 的 24 倍
  • 选型:个人开发者→Ollama;企业高并发→vLLM
  • 工程评价:⭐⭐⭐⭐ 选型决策表清晰,含量化对比数字
  • 分类标签:inference-engineering vLLM Ollama quantization benchmark
  • 建议行动:写入推理引擎选型主题页(benchmark 数据点)

🔷 LLM 微调 QLoRA → 生产部署全流程(Tier2)

  • 来源:CSDN · Engineering Filter Sep 28
  • 核心价值:QLoRA vs LoRA vs 全参数微调 vs 分布式训练 vs RLHF vs SFT 方法选型边界清晰;降低 GPU 门槛同时保持专业能力
  • 分类标签:fine-tuning QLoRA LoRA RLHF SFT
  • 建议行动:归档留存,作为微调方法选型参考

🔬 Reproduction · 可复现工程条目

高价值可复现条目

🔷 DeepSeek 部署命令序列(可复现度最高)

conda create -n deepseek python=3.10 -y
torch.cuda.is_available() && torch.cuda.get_device_name(0)
ollama run deepseek-r1:7b
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B-Q5_K_M.gguf \
  --gpu-memory-utilization 0.9 \
  --tensor-parallel-size N \
  --max-model-len 8192
docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve

🔷 MiniCPM-V 三框架命令序列(可复现度最高)

# llama.cpp
./bin/llava-cli -m minicpm-v-4_5-q4_0.gguf \
  --mmproj models/minicpm-v-4_5/mmproj-model-f16.gguf \
  --image input_image.jpg

# vLLM
pip install vllm
vllm(model="openbmb/MiniCPM-V-4_5", trust_remote_code=True, dtype="bfloat16")
SamplingParams(temperature=0.8, top_p=0.95, max_tokens=512)

# Ollama
ollama pull openbmb/minicpm-v:4.5
curl http://localhost:11434/api/generate -d '{"model":"openbmb/minicpm-v:4.5",...}'

🔷 openGauss RAG 建表 + 检索命令序列

CREATE TABLE rag_knowledge (
  id SERIAL PRIMARY KEY,
  content TEXT NOT NULL,
  embedding VECTOR(768) NOT NULL,
  create_time TIMESTAMP DEFAULT NOW()
);
CREATE INDEX ON rag_knowledge USING GIN (embedding);

-- 余弦相似度检索
SELECT content, 1 - (embedding <=> '%s') AS similarity
FROM rag_knowledge
ORDER BY embedding <=> '%s'
LIMIT 5;
# Python 批量插入
from psycopg2 import execute_batch
execute_batch(cur,
  "INSERT INTO rag_knowledge (content, embedding) VALUES (%s, %s)",
  [(doc, vec) for doc, vec in zip(docs, embeddings)],
  page_size=10)

📋 本轮综合分类标签

# Database
openGauss  pgvector  pgvector-alternative
Pinecone  Qdrant  Weaviate  Milvus  ZillizCloud
vector-database  vector-DB-selection  VikingMem  VLDB2026

# Backend
inference-engineering  vLLM  SGLang  TensorRT-LLM  Ollama  llama.cpp
llm-deployment  deepseek  minicpm-v  multimodal-inference
kv-cache  LMCache  prefix-caching  PD-disaggregation
quantization  QLoRA  LoRA  fine-tuning  RLHF  SFT
FreeToken  MoE  Berkeley  rig  rust

# Cloud-Native
kubernetes  k8s  prometheus  grafana  monitoring  mlops
production-RAG  observability

# CSDN
CSDN(已筛选)  deepseek-deployment  minicpmv  vllm-optimization

# Reproduction
可复现  SQL-schema  Python  命令序列

📁 建议写入路径

类别 建议路径
Database 2026-09-vecdb-landscape-2026-q3.md(合并 Vector DB 选型格局)
Backend 2026-09-inference-engine-benchmark-2026-q3.md(合并 vLLM vs SGLang benchmark)
Backend 2026-09-deepseek-deployment-commands.md(Tier1 DeepSeek 部署)
Backend 2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md(Tier1 MiniCPM-V)
Backend 2026-09-inference-engineering-vllm-tensorrt-2026-q3.md(vLLM+TRT-LLM 优化)
Cloud-Native 2026-09-kvcache-infrastructure-2026.md(KVCache 工作集 + Five Eras)
Reproduction 2026-09-reproduction-commands-llm-deployment.md(可复现命令序列合集)

🔬 后续行动优先级

优先级 行动 对应条目
🔴 高 精读 DeepSeek 部署命令 → 写入 LLM 部署主题页 Backend Tier1
🔴 高 精读 MiniCPM-V 三框架部署命令 → 写入多模态主题页 Backend Tier1
🔴 高 合并 vLLM vs SGLang vs TRT-LLM benchmark 数据 → 推理引擎选型页 Backend Tier1
🟡 中 精读 arXiv 2609.27746 KV Cache Working Set Cloud-Native Tier2
🟡 中 精读 ModCon 2026 Five Eras of KVCache Cloud-Native Tier2
🟡 中 精读 VLDB 2026 VikingMem 论文 Database Tier2
🟡 中 合并 Vector DB 2026 选型格局 → 向量数据库主题页 Database Tier2
🟢 低 归档 rig (Rust LLM framework) → 跟踪社区活跃度 Backend Tier2

本简报基于 2026-09-29 已处理内容(CSDN RSS + arXiv + ByteByteGo + Raschka + Lilian Weng + Simon Willison + Engineering Filter + Tavily 实时搜索)整理。未执行 GitHub 写入。所有草稿写入 /shared/research-kb/inbox/jay/。