Jay 五类简报 · 2026-09-29 午间版
实例:Jay
时间:2026-09-29 11:05(Asia/Shanghai)
简报定位:第 3 次轮次(早间 CSDN 轮 + 工程筛选轮已覆盖,本轮整合 + 补充新鲜来源)
覆盖来源:CSDN RSS · arXiv (cs.CL/cs.IR) · ByteByteGo · Raschka · Lilian Weng · Simon Willison · GitHub Trending · Tavily 实时搜索 · Engineering Filter
📦 Database · 向量数据库与数据层
高价值条目
🔷 openGauss 企业级 RAG(SQL Schema + Python 可复现)
- 来源:CSDN ·
m0_68089732 · 2025-11-30
- URL:
https://blog.csdn.net/m0_68089732/article/details/155428896
- 核心价值:
- 内置向量类型:
VECTOR(768),CREATE INDEX ... USING GIN
- 建表语句:
rag_knowledge 含 content TEXT, embedding VECTOR(768), create_time
- 批量插入:
execute_batch(每批 10 条);余弦距离检索:embedding <=> %s AS similarity
- 环境工具链:
gs_ctl start/stop/restart/status,gsql 连接命令
- Embedding:
all-MiniLM-L6-v2(768 维);LangChain + Ollama 生成层
- 工程评价:完整可复现企业级 RAG + 国产数据库标杆案例;SQL Schema + Python 代码 + 环境命令 + 验证输出齐全
- 可信度:高(有完整命令输出验证)
- 分类标签:
向量数据库 RAG openGauss 国产数据库 可复现
- 建议行动:对比 pgvector 方案,写入 RAG 数据库选型主题页;注意时间较旧(2025-11)
🔷 Vector DB 2026 选型格局(行业分析 + 生产验收标准)
- 来源:Refonte Learning · Alpha Corp · GroovyWeb · Actian · Splunk · Braintrust · Tavily 实时搜索 2026-09-29
- 核心结论:
- Pinecone:零运维托管,适合不需要自建基础设施的团队
- Qdrant:Rust 实现,开源高性能,强过滤能力
- Weaviate:内置 reranker,原生 hybrid search,适合快速上线
- Milvus / Zilliz Cloud:100M+ 向量规模首选
- pgvector:已有 Postgres 团队的首选,无需引入新系统
- CORE Systems 2026 Benchmark:Weaviate p50 ~4.2ms,p99 ~12ms(1M 向量 1536 维)
- Blockify 数据优化层:IdeaBlocks 语义分块,78× RAG 准确率提升(营销声明,待核验)
- Splunk:生产 RAG 四个关键转变:实时流量 filter selectivity、动态 hybrid search 参数调优、独立 recall 追踪、数据库健康与 LLM下游评估联动
- Actian:Benchmark 测试静态,生产数据持续流入——"最好的向量数据库是你已经在用的那个"
- 工程评价:2026-09 月最新行业综述,帮助建立选型框架,但非实操手册
- 可信度:中高(行业分析为主,部分数据来自厂商/营销,需交叉验证)
- 分类标签:
向量数据库选型 Pinecone Qdrant Weaviate Milvus pgvector RAG架构
- 建议行动:归档 Tier2;写入向量数据库主题页 2026-Q3 更新
🔷 OpenViking / VikingMem(Volcengine · VLDB 2026)
- 来源:GitHub + VLDB 2026(待精读)
- 核心价值:
- VikingMem:Stateful LLM 应用的记忆基管理系统
- VikingRAG:结构化文档高精度 RAG
- Directory-Aware Query(ICDE 2026)
- 工程评价:火山引擎开源 + VLDB 2026 同行评审,工程价值待论文精读后确认
- 分类标签:
向量数据库 VLDB2026 ICDE2026 agent-memory volcengine
- 建议行动:归档 Tier2,精读 VLDB 2026 论文后升级
⚙️ Backend · 推理引擎与后端系统
高价值条目
🔷 vLLM vs SGLang vs TensorRT-LLM H100 Benchmark(2026 实时对比)
- 来源:Spheron Blog · Prem AI · AIMultiple · DeployBase · Inference Engineering · Atomic Chat · Winder AI(2026-09)
- Benchmark 数据汇总(Llama 3.1 70B,H100 80GB,FP8):
| 引擎 |
并发 |
吞吐量 |
TTFT |
显存 |
| TensorRT-LLM |
高并发 |
~3,400 tok/s |
~150-200ms |
74GB(idle) |
| SGLang |
高并发 |
~2,900 tok/s |
~42-80ms |
最低(KV cache 管理最优) |
| vLLM |
高并发 |
~2,800 tok/s |
~150ms |
71GB |
| vLLM(prefix reuse) |
高并发 |
~12,500 tok/s |
~45ms |
— |
| SGLang(prefix reuse) |
高并发 |
~16,200 tok/s |
~42ms |
— |
- SGLang prefix reuse 专项优势(RadixAttention):
- 共享 system prompt / tool definition / conversation history 时,吞吐量比 vLLM 高 29%
- 25 Sep 2026 发现:GLM-5.3-Flash 45 层中 34 层为线性注意力,长 prompt 产生大量 snapshots,Qwen3.8-Flash-Next 无此问题
- 生产实操:8×RTX PRO 6000 Blackwell 上 Qwen3.8 + GLM-5.3-Flash 混部策略
- SGLang vs vLLM 选型决策:
- 多轮对话、prefix-heavy → SGLang(RadixAttention 优势明显)
- 独特 prompt 为主 → vLLM(生态更大,92.7k vs 36.4k GitHub stars)
- 极致吞吐 + 固定模型 → TensorRT-LLM(编译后最快)
- 2026 年 9 月建议:先用 vLLM 起步,用真实流量测 SGLang,再决定
- 工程评价:⭐⭐⭐⭐⭐ 多源基准数据对齐,有具体数字和生产案例
- 可信度:高(多家独立基准来源数据吻合)
- 分类标签:
inference-engineering vLLM SGLang TensorRT-LLM benchmark H100 Blackwell
- 建议行动:写入推理引擎选型主题页(2026-Q3 benchmark 数据节点)
🔷 DeepSeek 本地部署完全方案(Tier1 可复现)
- 来源:CSDN ·
deepin20100 · 2026-06-25(最新推荐 2026-07-20)
- URL:
https://blog.csdn.net/deepin20100/article/details/162314523
- 核心价值:
- 硬件对照表(DeepSeek-V3 671B → R1-Distill-Qwen-1.5B 覆盖 8×A100 80GB 到 GTX 1660 6GB)
- 环境命令:
conda create -n deepseek python=3.10 -y;CUDA 验证:torch.cuda.is_available()
- Ollama:
ollama run deepseek-r1:7b;vLLM:--gpu-memory-utilization 0.9
- Docker 部署:
docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
- 量化 GGUF 下载:
wget 指向 HuggingFace GGUF 格式
- 显存档位:8GB→1.5B蒸馏版;12GB→7B蒸馏或16B量化;24GB+→体验较好
- 工程评价:⭐⭐⭐⭐⭐ 最完整 DeepSeek 本地部署指南,硬件决策表 + 命令 + API 调用 + 量化选择
- 可信度:高(有完整命令序列和硬件规格表)
- 分类标签:
llm-deployment deepseek vLLM ollama quantization multi-GPU
- 建议行动:精读 → 写入 LLM 部署主题页 DeepSeek 章节
🔷 MiniCPM-V llama.cpp / vLLM / Ollama 横向部署(Tier1 可复现)
- 来源:CSDN ·
gitblog_01002 · 2025-11-16(最新推荐 2026-01-06)
- URL:
https://blog.csdn.net/gitblog_01002/article/details/154892380
- 核心价值:
- 3 框架实际命令:llama.cpp
./bin/llava-cli -m ... --mmproj ... --image ...;vLLM vLLM(model="openbmb/MiniCPM-V-4_5", ...);Ollama ollama pull openbmb/minicpm-v:4.5
- 硬件推荐表:llama.cpp 6-8GB / vLLM 16GB+ / Ollama int4量化
- 性能对比:量化后显存减少 75%;vLLM SamplingParams:
temperature=0.8, top_p=0.95, max_tokens=512
- 工程评价:⭐⭐⭐⭐⭐ 多框架选型实操指南,命令 + 硬件要求 + 性能数据齐全
- 可信度:高(有命令输出和性能对比表)
- 分类标签:
multimodal-inference MiniCPM llama.cpp vLLM Ollama 端侧推理
- 建议行动:精读 → 写入多模态推理部署主题页
🔷 vLLM + TensorRT-LLM 推理优化(2026-07 最新)
- 来源:CSDN ·
gitblog_00617 · 2026-07-06
- URL:
https://blog.csdn.net/gitblog_00617/article/details/152877379
- 核心价值:
- PagedAttention 原理 + 配置(KV 缓存分页管理,减少内存碎片)
- 量化选型矩阵:GPTQ(通用)/ AWQ(精度损失小)/ FP8(H100 专属)/ INT4(极致压缩)
- 配置分级:7B-13B 单 GPU;30B-70B 多 GPU(张量并行+量化);超大模型(流水线+张量并行)
- 动态批处理:根据负载动态调整批处理大小
- 工程评价:⭐⭐⭐⭐ 2026-Q3 最新实战,含量化选型矩阵和生产配置建议
- 可信度:高
- 分类标签:
inference-engineering vLLM TensorRT-LLM quantization PagedAttention
- 建议行动:精读 → 写入推理优化主题页(2026-Q3 更新)
🔷 FreeToken — Berkeley 边缘原生 MoE
- 来源:HuggingFace Papers · UC Berkeley
- 核心价值:带宽自适应专家并行 + 设备间状态路由,面向边缘推理
- 工程评价:待论文精读确认硬件适配列表和延迟数据
- 分类标签:
MoE 边缘推理 Berkeley arxiv-2026
- 建议行动:归档 Tier2,关注端侧 MoE 部署可行性
🔷 rig — Rust 原生模块化 LLM 框架
- 来源:GitHub · 7.1k Stars
- 核心价值:Rust 原生,面向性能敏感部署;早期新兴项目
- 分类标签:
rust llm-framework inference-engineering
- 建议行动:归档 Tier2,关注 Rust 在 AI Infra 渗透趋势
☁️ Cloud-Native · K8s 与云原生推理
高价值条目
🔷 PD Disaggregation + LMCache / Prefix Caching
- 来源:arXiv · Engineering Filter Sep 28
- 核心价值:Prefill-Decode 分离架构 + KV Cache 前缀缓存,是 2026 年生产推理优化的核心方向之一
- 关键论文:arXiv 2609.27746 — The KV Cache Working Set(Sep 23, 2026),在线容量规划 for LLM Inference Systems
- 关联:LMCache(开源 KV Cache 缓存库)、KVServe、HotPrefix、ModCon 2026 Five Eras of KVCache
- 工程评价:⭐⭐⭐⭐ 基础设施方向,适合系统工程师深度了解
- 分类标签:
kv-cache PD-disaggregation LMCache prefix-caching inference-systems
- 建议行动:精读 2609.27746,与 Five Eras of KVCache 合并阅读
🔷 Prometheus + Grafana 生产 RAG 监控体系
- 来源:CSDN · Engineering Filter Sep 28
- 核心价值:
- 性能监控:延迟 / 吞吐量 / 资源利用率
- 效果监控:召回率@10 + BLEU + 人工
- 日志监控 + MLOps for RAG 反馈循环 + 安全检查清单
- 工程评价:⭐⭐⭐⭐⭐ 生产 RAG 完整监控方案,可作为 RAG 生产验收标准参考
- 分类标签:
mlops prometheus grafana monitoring production-RAG
- 建议行动:归档留存,作为 RAG 生产运维检查清单
🔷 The Five Eras of KVCache(ModCon 2026 / Modular)
- 来源:Modular Blog · ModCon 2026(2026年9月)
- 核心价值:总结 KVCache 从 temporary state 到 AI-native knowledge layer 的演进;基础设施全景视角
- 关联:arXiv 2608.01526 "Internet for KV Cache"
- 工程评价:⭐⭐⭐ 认知框架价值高,适合建立全景
- 分类标签:
kv-cache ModCon2026 inference-systems
- 建议行动:归档 Tier2,与 "Internet for KV Cache" 合并阅读
💻 CSDN · 已筛选工程高价值文章
高价值条目(按主题聚合)
🔷 DeepSeek 本地部署完全方案(Tier1)
- 见 Backend 部分,已完整记录
- 写入建议:
2026-09-deepseek-deployment-commands.md
🔷 MiniCPM-V 三框架横向部署(Tier1)
- 见 Backend 部分,已完整记录
- 写入建议:
2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md
🔷 vLLM + TensorRT-LLM 推理优化(Tier1)
🔷 Ollama vs vLLM 量化对比(Tier1)
- 来源:CSDN ·
su_xiao_wei · 2025-06-03
- URL:
https://blog.csdn.net/su_xiao_wei/article/details/145904984
- 核心数据:
- Qwen2.5-14B → Ollama 11GB vs vLLM 39GB(int4 vs FP16)
- vLLM 并发处理速度可达 Ollama 的 24 倍
- 选型:个人开发者→Ollama;企业高并发→vLLM
- 工程评价:⭐⭐⭐⭐ 选型决策表清晰,含量化对比数字
- 分类标签:
inference-engineering vLLM Ollama quantization benchmark
- 建议行动:写入推理引擎选型主题页(benchmark 数据点)
🔷 LLM 微调 QLoRA → 生产部署全流程(Tier2)
- 来源:CSDN · Engineering Filter Sep 28
- 核心价值:QLoRA vs LoRA vs 全参数微调 vs 分布式训练 vs RLHF vs SFT 方法选型边界清晰;降低 GPU 门槛同时保持专业能力
- 分类标签:
fine-tuning QLoRA LoRA RLHF SFT
- 建议行动:归档留存,作为微调方法选型参考
🔬 Reproduction · 可复现工程条目
高价值可复现条目
🔷 DeepSeek 部署命令序列(可复现度最高)
conda create -n deepseek python=3.10 -y
torch.cuda.is_available() && torch.cuda.get_device_name(0)
ollama run deepseek-r1:7b
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B-Q5_K_M.gguf \
--gpu-memory-utilization 0.9 \
--tensor-parallel-size N \
--max-model-len 8192
docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
🔷 MiniCPM-V 三框架命令序列(可复现度最高)
# llama.cpp
./bin/llava-cli -m minicpm-v-4_5-q4_0.gguf \
--mmproj models/minicpm-v-4_5/mmproj-model-f16.gguf \
--image input_image.jpg
# vLLM
pip install vllm
vllm(model="openbmb/MiniCPM-V-4_5", trust_remote_code=True, dtype="bfloat16")
SamplingParams(temperature=0.8, top_p=0.95, max_tokens=512)
# Ollama
ollama pull openbmb/minicpm-v:4.5
curl http://localhost:11434/api/generate -d '{"model":"openbmb/minicpm-v:4.5",...}'
🔷 openGauss RAG 建表 + 检索命令序列
CREATE TABLE rag_knowledge (
id SERIAL PRIMARY KEY,
content TEXT NOT NULL,
embedding VECTOR(768) NOT NULL,
create_time TIMESTAMP DEFAULT NOW()
);
CREATE INDEX ON rag_knowledge USING GIN (embedding);
-- 余弦相似度检索
SELECT content, 1 - (embedding <=> '%s') AS similarity
FROM rag_knowledge
ORDER BY embedding <=> '%s'
LIMIT 5;
# Python 批量插入
from psycopg2 import execute_batch
execute_batch(cur,
"INSERT INTO rag_knowledge (content, embedding) VALUES (%s, %s)",
[(doc, vec) for doc, vec in zip(docs, embeddings)],
page_size=10)
📋 本轮综合分类标签
# Database
openGauss pgvector pgvector-alternative
Pinecone Qdrant Weaviate Milvus ZillizCloud
vector-database vector-DB-selection VikingMem VLDB2026
# Backend
inference-engineering vLLM SGLang TensorRT-LLM Ollama llama.cpp
llm-deployment deepseek minicpm-v multimodal-inference
kv-cache LMCache prefix-caching PD-disaggregation
quantization QLoRA LoRA fine-tuning RLHF SFT
FreeToken MoE Berkeley rig rust
# Cloud-Native
kubernetes k8s prometheus grafana monitoring mlops
production-RAG observability
# CSDN
CSDN(已筛选) deepseek-deployment minicpmv vllm-optimization
# Reproduction
可复现 SQL-schema Python 命令序列
📁 建议写入路径
| 类别 |
建议路径 |
| Database |
2026-09-vecdb-landscape-2026-q3.md(合并 Vector DB 选型格局) |
| Backend |
2026-09-inference-engine-benchmark-2026-q3.md(合并 vLLM vs SGLang benchmark) |
| Backend |
2026-09-deepseek-deployment-commands.md(Tier1 DeepSeek 部署) |
| Backend |
2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md(Tier1 MiniCPM-V) |
| Backend |
2026-09-inference-engineering-vllm-tensorrt-2026-q3.md(vLLM+TRT-LLM 优化) |
| Cloud-Native |
2026-09-kvcache-infrastructure-2026.md(KVCache 工作集 + Five Eras) |
| Reproduction |
2026-09-reproduction-commands-llm-deployment.md(可复现命令序列合集) |
🔬 后续行动优先级
| 优先级 |
行动 |
对应条目 |
| 🔴 高 |
精读 DeepSeek 部署命令 → 写入 LLM 部署主题页 |
Backend Tier1 |
| 🔴 高 |
精读 MiniCPM-V 三框架部署命令 → 写入多模态主题页 |
Backend Tier1 |
| 🔴 高 |
合并 vLLM vs SGLang vs TRT-LLM benchmark 数据 → 推理引擎选型页 |
Backend Tier1 |
| 🟡 中 |
精读 arXiv 2609.27746 KV Cache Working Set |
Cloud-Native Tier2 |
| 🟡 中 |
精读 ModCon 2026 Five Eras of KVCache |
Cloud-Native Tier2 |
| 🟡 中 |
精读 VLDB 2026 VikingMem 论文 |
Database Tier2 |
| 🟡 中 |
合并 Vector DB 2026 选型格局 → 向量数据库主题页 |
Database Tier2 |
| 🟢 低 |
归档 rig (Rust LLM framework) → 跟踪社区活跃度 |
Backend Tier2 |
本简报基于 2026-09-29 已处理内容(CSDN RSS + arXiv + ByteByteGo + Raschka + Lilian Weng + Simon Willison + Engineering Filter + Tavily 实时搜索)整理。未执行 GitHub 写入。所有草稿写入 /shared/research-kb/inbox/jay/。