研究简报 · 2026-07-14 下午

本次主题

推理工程 · 高级 RAG 架构 · Vector DB 选型 · GitHub/HF Trending


一、推理工程(Inference Engineering)—— 2026 核心工程学科

来源Spheron · What Is Inference Engineering? The 2026 GPU Cloud Guide

核心定义

推理工程是将训练好的 ML 模型以高吞吐、低成本、高可靠方式服务给用户的工程学科。2026 年已独立为专门岗位,与 ML Engineering 和 MLOps 明确分界。

四项核心职责

职责 关键内容
硬件选型 GPU 型号 / 数量 / 内存层级的决策
Serving 框架配置 vLLM、SGLang、TensorRT-LLM、NVIDIA Dynamo
KV Cache 管理 PagedAttention、Prefix Caching、KV 量化
成本优化 throughput vs latency 权衡、Spot vs On-demand

关键技术细节

连续批处理(Continuous Batching) - 静态批处理:等批次所有请求完成才能接受新的,GPU 空闲等待 - 连续批处理:每步 decode 完成后立即替换已结束请求,吞吐量提升 3-5x

KV Cache 内存问题 - 70B FP16 模型,单个 4096 token 请求的 KV cache 约 4GB VRAM - 50 并发请求 → 200GB,超过任何单卡 VRAM - PagedAttention:以固定块而非连续空间分配 KV cache,消除碎片 - Prefix Caching:跨请求复用相同 system prompt,降低 20-40% 计算量 - KV Cache 量化(INT8/INT4):显存需求减少 2-4x,精度损失小

量化精度对照

精度 相对 FP16 显存 吞吐提升 精度损失
FP16 1x baseline
FP8 0.5x 1.5-2x <1%
INT4 AWQ 0.25x 2-3x 1-3%

FP8 是 H100/B200 默认选项;INT4 AWQ 适合 A100 等 VRAM 受限场景。

Serving 框架 - vLLM:PagedAttention 开创者,2025 年 V1 引擎引入 chunked prefill,默认选项 - SGLang:结构化生成友好,RadixBackend 支持 prefix caching - TensorRT-LLM:NVIDIA 官方,最高吞吐但灵活性最低 - NVIDIA Dynamo:新进入者,2026 年重点观察

评价

推理工程已成为 LLM 生产系统的关键角色。这篇指南是 2026 年度最佳入门材料之一,职责边界清晰,技术细节实用。适合作为团队内部培训和招聘参考。

可信度:高 | 建议:精读,可作为主题页更新素材


二、20 种高级 RAG 架构(2026)

来源Turing Post · 20 Advanced RAG Types to Know in 2026

分类体系

A. 长文档与记忆 RAG

架构 核心问题 arXiv
MiA-RAG 长文档需要全局视图指导检索,防止碎片化 2512.17220
HGMem 多跳推理需要超图结构化记忆 2512.23959
MegaRAG 多模态知识图谱,连接文本与视觉实体 2512.20626
Disco-RAG 话语结构感知的证据综合 2601.04377

B. 自适应与验证 RAG

架构 核心问题 arXiv
Agentic RAG 检索作为多步决策,LLM 可规划/记忆/调用工具 2603.07379
A-RAG 层次化检索接口,模型自行决定何时/如何检索 2602.03442
Predictive Prefetching 预测性预取,异步检索降低延迟 2605.17989
SURE-RAG 证据充分性判断 + 不确定时主动 abstention 2605.03534
QuCo-RAG 基于训练数据统计触发检索,减少幻觉 2512.19134
HiFi-RAG 多阶段过滤 + Gemini 2.5 Flash 精简上下文 2512.22442
Bidirectional RAG 受控写回知识库,NLI 验证 + 新颖性检测 2512.22199

C. 多模态与专业化 RAG

架构 核心问题 arXiv
MG²-RAG 多粒度多模态知识图谱,跨图像文本统一推理 2604.04969
FT-RAG 表格数据细粒度检索,entry 级语义单元 2605.01495
TV-RAG 视频时序感知检索,熵加权关键帧采样 2512.23483
AffordanceRAG 机器人具身 AI, affordance 评分指导动作选择 2512.18987
SignRAG 路牌零样本识别,VLM 描述 + 向量库比对 2512.12885

评价

这是 2026 年中 RAG 领域最系统的分类梳理。每个条目均附 arXiv 链接,实用性强。SURE-RAGQuCo-RAG 对生产系统最有直接指导价值(一个解决"检索到的是否能支撑答案",一个从训练统计入手减少幻觉)。

可信度:高 | 建议:精读,审稿,可纳入 RAG 主题页


三、多模态 RAG 工程指南(2026)

来源Big Data Boutique · Multimodal RAG in 2026: Retrieval Over Images, PDFs, and Text

核心问题

文本-only RAG 在企业文档上的根本局限:10-K 财务文件的答案在第 34 页的瀑布图里,没有任何句子包含这个数字。图表/表格/布局信息在 OCR 阶段被丢弃。

四种多模态架构对比

架构 工作方式 优势 劣势
Caption-and-Index VLM caption 图像,文本检索 简单,复用现有 RAG caption 幻觉污染索引
Unified Embeddings 文本+图像编码到同一向量空间 单索引,跨模态查询 API 依赖或 GPU 成本
Page-as-Image + Late Interaction ColPali/ColQwen2 渲染页面,多向量检索 最高召回率,无需解析管道 每页 100-1000x 更多向量
Hybrid Late-Fusion 并行双索引 + RRF 融合 + VLM reranker 最灵活,混合语料库召回最高 最复杂,评估困难

大多数团队最终选择架构 2 或 4。架构 3 只在答案真的在像素里、召回率是首要约束时才是正确的选择。

关键 Embedding 模型

模型 类型 特点
SigLIP 2 CLIP 改进版 多语言 + 宽高比支持,文本嵌入图像更强
Cohere Embed 4 统一嵌入 原生 PDF 处理,128K 上下文,Matryoshka 维度(256-1536)
voyage-multimodal-3.5 统一嵌入 视频帧支持,Matryoshka 维度,2026 年 1 月最新
Nomic Embed Multimodal 开源权重 Qwen2.5-VL 骨干,3B/7B 单向量和多向量版本,Hugging Face 可用

存储成本经济性

  • 单向量:1 向量/页
  • 多向量(ColPali 类):~1024 向量/页
  • 10M 页场景:单向量 = 几十 GB,多向量 = 数 TB
  • Matryoshka 截断(1024→256 维):召回率损失 <2%,存储减少 4x

ColPali 技术要点

  • 跳过解析管道,直接渲染 PDF 页面为高分辨率图像
  • VLM patch-level embedding,无需 OCR
  • GitHub: illuin-tech/colpali,Hugging Face: vidore
  • ICLR 2025 接收

评价

这是目前最完整的多模态 RAG 工程决策指南,成本/召回权衡清晰,架构选择框架实用。强烈推荐给正在构建文档 RAG 系统的团队。

可信度:高 | 建议:精读,纳入 RAG 主题页更新


四、Vector DB 选型:pgvector vs Pinecone 2026

来源Kunal Ganglani · pgvector vs Pinecone 2026: Full Comparison

关键结论

pgvector 已不再是"慢速选项"(2026 年修正)

  • Timescale pgvectorscale 加持下,PostgreSQL 在 50M 向量规模下达 471 QPS @ 99% recall
  • 这个成绩比 Qdrant 快 11.4x,与 Pinecone 持平

选型决策树

向量规模 < 10-50M
    已在用 PostgreSQL → pgvector(默认正确选择)
    偏好托管服务 → Pinecone
向量规模 > 50M / 需要水平扩展 / 需要 p99 SLA 保证 → Pinecone
需要 SQL 元数据过滤 + 向量检索 → pgvector(PostgreSQL 原生 JOIN)
需要超低延迟(p99 < 10ms)+ 百亿级向量 → Pinecone

pgvector 生产规模参考

  • HNSW 索引需要 RAM 常驻
  • 1536 维、10M 向量:需要 60-100GB RAM
  • 50M+ 向量仍可支持,但运维复杂度显著上升

Pinecone 成本参考

  • 10M 向量 + 中等查询负载:$100-400/月
  • 100M+ 向量 + 高 QPS:$1,000-3,000+/月
  • 相比之下 pgvector 仅有 PostgreSQL 实例成本

混合搜索

  • Pinecone:原生稀疏+密集混合搜索,API 直接支持
  • pgvector:PostgreSQL 原生 tsvector + 向量相似度组合 SQL 查询,更灵活但需更多工程工作

评价

来自有实测经验(llm-benchmarks 数据集)的工程师,结论有数据支撑。2026 年视角下 pgvector 已进入生产就绪区间,适用于大多数中小规模 RAG 场景。

可信度:高 | 建议:精读,可作为 Vector DB 主题页补充


项目 Stars 今日⭐ 分类 评价
Graphify-Labs/graphify 85.1k +1,095 AI coding assistant / knowledge graph 将代码库、SQL schema、文档转为可查询知识图谱,支持 Claude/Cursor/Codex
OpenCut-app/OpenCut 67.4k +1,229 视频编辑(CapCut 开源替代) 非 AI 工程重点,但 67k stars 说明开源视频工具需求旺盛
HKUDS/Vibe-Trading 22.1k +1,153 量化交易 Agent 个人交易 Agent 方向,值得关注量化 + Agent 交叉场景
moeru-ai/airi 42.1k +78 陪伴型 AI(Neuro-sama 类) 实时语音 + Minecraft + Factorio,多模态具身 AI 方向
Nutlope/hallmark 5.4k +794 AI 设计反垃圾 anti-AI-slop 设计技能,Claude Code/Cursor 集成,Designer+AI 交叉
Shubhamsaboo/awesome-llm-apps LLM 应用集合 100+ 可运行 AI Agent & RAG 应用,适合快速原型

重点关注:Graphify 代码→知识图谱的思路与 RAG 不同,是代码库理解的新范式。在 SWE-bench 类任务上有潜力。


模型 参数量 下载量 更新 备注
deepseek-ai/DeepSeek-V4-Flash 158B 2.68M 22天前 Flash 版本主打低延迟推理
deepseek-ai/DeepSeek-V4-Pro 862B 1.39M 22天前 Pro 版本高性能
deepseek-ai/DeepSeek-V4-Pro-DSpark 889B 38.7k 10天前 DSpark 版本,分布式推理?
deepreinforce-ai/Ornith-1.0-35B 35B 665k 19天前 35B 模型高下载量
tencent/Hy3 299B 9.16k 8天前 腾讯混元 3,299B 超大参数量
zai-org/GLM-5.2 753B 465k 12天前 智谱 GLM-5.2,753B 超大模型

DeepSeek V4 系列占据 HF 下载量榜首,Ornith-1.0 系列(9B/35B GGUF)持续保持高热度。


标签

推理工程 RAG 多模态RAG VectorDB pgvector Pinecone vLLM SGLang ColPali InferenceEngineering GitHub-Trending HuggingFace 2026-07


建议写入路径

/shared/research-kb/inbox/jay/2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md

是否需要精读/审稿/主题页更新

  • 精读:TuringPost 20 Advanced RAG + Spheron Inference Engineering Guide
  • 审稿:多模态 RAG 架构对比表(技术细节需二次核验)
  • 建议更新主题页:RAG 主题页(新增 20 种高级 RAG 分类)、VectorDB 主题页(pgvector 2026 新基准)、Inference Engineering 主题页(若存在)