研究简报 · 2026-07-14 下午
本次主题
推理工程 · 高级 RAG 架构 · Vector DB 选型 · GitHub/HF Trending
一、推理工程(Inference Engineering)—— 2026 核心工程学科
来源:Spheron · What Is Inference Engineering? The 2026 GPU Cloud Guide
核心定义
推理工程是将训练好的 ML 模型以高吞吐、低成本、高可靠方式服务给用户的工程学科。2026 年已独立为专门岗位,与 ML Engineering 和 MLOps 明确分界。
四项核心职责
| 职责 | 关键内容 |
|---|---|
| 硬件选型 | GPU 型号 / 数量 / 内存层级的决策 |
| Serving 框架配置 | vLLM、SGLang、TensorRT-LLM、NVIDIA Dynamo |
| KV Cache 管理 | PagedAttention、Prefix Caching、KV 量化 |
| 成本优化 | throughput vs latency 权衡、Spot vs On-demand |
关键技术细节
连续批处理(Continuous Batching) - 静态批处理:等批次所有请求完成才能接受新的,GPU 空闲等待 - 连续批处理:每步 decode 完成后立即替换已结束请求,吞吐量提升 3-5x
KV Cache 内存问题 - 70B FP16 模型,单个 4096 token 请求的 KV cache 约 4GB VRAM - 50 并发请求 → 200GB,超过任何单卡 VRAM - PagedAttention:以固定块而非连续空间分配 KV cache,消除碎片 - Prefix Caching:跨请求复用相同 system prompt,降低 20-40% 计算量 - KV Cache 量化(INT8/INT4):显存需求减少 2-4x,精度损失小
量化精度对照
| 精度 | 相对 FP16 显存 | 吞吐提升 | 精度损失 |
|---|---|---|---|
| FP16 | 1x | baseline | 无 |
| FP8 | 0.5x | 1.5-2x | <1% |
| INT4 AWQ | 0.25x | 2-3x | 1-3% |
FP8 是 H100/B200 默认选项;INT4 AWQ 适合 A100 等 VRAM 受限场景。
Serving 框架 - vLLM:PagedAttention 开创者,2025 年 V1 引擎引入 chunked prefill,默认选项 - SGLang:结构化生成友好,RadixBackend 支持 prefix caching - TensorRT-LLM:NVIDIA 官方,最高吞吐但灵活性最低 - NVIDIA Dynamo:新进入者,2026 年重点观察
评价
推理工程已成为 LLM 生产系统的关键角色。这篇指南是 2026 年度最佳入门材料之一,职责边界清晰,技术细节实用。适合作为团队内部培训和招聘参考。
可信度:高 | 建议:精读,可作为主题页更新素材
二、20 种高级 RAG 架构(2026)
来源:Turing Post · 20 Advanced RAG Types to Know in 2026
分类体系
A. 长文档与记忆 RAG
| 架构 | 核心问题 | arXiv |
|---|---|---|
| MiA-RAG | 长文档需要全局视图指导检索,防止碎片化 | 2512.17220 |
| HGMem | 多跳推理需要超图结构化记忆 | 2512.23959 |
| MegaRAG | 多模态知识图谱,连接文本与视觉实体 | 2512.20626 |
| Disco-RAG | 话语结构感知的证据综合 | 2601.04377 |
B. 自适应与验证 RAG
| 架构 | 核心问题 | arXiv |
|---|---|---|
| Agentic RAG | 检索作为多步决策,LLM 可规划/记忆/调用工具 | 2603.07379 |
| A-RAG | 层次化检索接口,模型自行决定何时/如何检索 | 2602.03442 |
| Predictive Prefetching | 预测性预取,异步检索降低延迟 | 2605.17989 |
| SURE-RAG | 证据充分性判断 + 不确定时主动 abstention | 2605.03534 |
| QuCo-RAG | 基于训练数据统计触发检索,减少幻觉 | 2512.19134 |
| HiFi-RAG | 多阶段过滤 + Gemini 2.5 Flash 精简上下文 | 2512.22442 |
| Bidirectional RAG | 受控写回知识库,NLI 验证 + 新颖性检测 | 2512.22199 |
C. 多模态与专业化 RAG
| 架构 | 核心问题 | arXiv |
|---|---|---|
| MG²-RAG | 多粒度多模态知识图谱,跨图像文本统一推理 | 2604.04969 |
| FT-RAG | 表格数据细粒度检索,entry 级语义单元 | 2605.01495 |
| TV-RAG | 视频时序感知检索,熵加权关键帧采样 | 2512.23483 |
| AffordanceRAG | 机器人具身 AI, affordance 评分指导动作选择 | 2512.18987 |
| SignRAG | 路牌零样本识别,VLM 描述 + 向量库比对 | 2512.12885 |
评价
这是 2026 年中 RAG 领域最系统的分类梳理。每个条目均附 arXiv 链接,实用性强。SURE-RAG 和 QuCo-RAG 对生产系统最有直接指导价值(一个解决"检索到的是否能支撑答案",一个从训练统计入手减少幻觉)。
可信度:高 | 建议:精读,审稿,可纳入 RAG 主题页
三、多模态 RAG 工程指南(2026)
来源:Big Data Boutique · Multimodal RAG in 2026: Retrieval Over Images, PDFs, and Text
核心问题
文本-only RAG 在企业文档上的根本局限:10-K 财务文件的答案在第 34 页的瀑布图里,没有任何句子包含这个数字。图表/表格/布局信息在 OCR 阶段被丢弃。
四种多模态架构对比
| 架构 | 工作方式 | 优势 | 劣势 |
|---|---|---|---|
| Caption-and-Index | VLM caption 图像,文本检索 | 简单,复用现有 RAG | caption 幻觉污染索引 |
| Unified Embeddings | 文本+图像编码到同一向量空间 | 单索引,跨模态查询 | API 依赖或 GPU 成本 |
| Page-as-Image + Late Interaction | ColPali/ColQwen2 渲染页面,多向量检索 | 最高召回率,无需解析管道 | 每页 100-1000x 更多向量 |
| Hybrid Late-Fusion | 并行双索引 + RRF 融合 + VLM reranker | 最灵活,混合语料库召回最高 | 最复杂,评估困难 |
大多数团队最终选择架构 2 或 4。架构 3 只在答案真的在像素里、召回率是首要约束时才是正确的选择。
关键 Embedding 模型
| 模型 | 类型 | 特点 |
|---|---|---|
| SigLIP 2 | CLIP 改进版 | 多语言 + 宽高比支持,文本嵌入图像更强 |
| Cohere Embed 4 | 统一嵌入 | 原生 PDF 处理,128K 上下文,Matryoshka 维度(256-1536) |
| voyage-multimodal-3.5 | 统一嵌入 | 视频帧支持,Matryoshka 维度,2026 年 1 月最新 |
| Nomic Embed Multimodal | 开源权重 | Qwen2.5-VL 骨干,3B/7B 单向量和多向量版本,Hugging Face 可用 |
存储成本经济性
- 单向量:1 向量/页
- 多向量(ColPali 类):~1024 向量/页
- 10M 页场景:单向量 = 几十 GB,多向量 = 数 TB
- Matryoshka 截断(1024→256 维):召回率损失 <2%,存储减少 4x
ColPali 技术要点
- 跳过解析管道,直接渲染 PDF 页面为高分辨率图像
- VLM patch-level embedding,无需 OCR
- GitHub: illuin-tech/colpali,Hugging Face: vidore
- ICLR 2025 接收
评价
这是目前最完整的多模态 RAG 工程决策指南,成本/召回权衡清晰,架构选择框架实用。强烈推荐给正在构建文档 RAG 系统的团队。
可信度:高 | 建议:精读,纳入 RAG 主题页更新
四、Vector DB 选型:pgvector vs Pinecone 2026
来源:Kunal Ganglani · pgvector vs Pinecone 2026: Full Comparison
关键结论
pgvector 已不再是"慢速选项"(2026 年修正)
- Timescale pgvectorscale 加持下,PostgreSQL 在 50M 向量规模下达 471 QPS @ 99% recall
- 这个成绩比 Qdrant 快 11.4x,与 Pinecone 持平
选型决策树
向量规模 < 10-50M
已在用 PostgreSQL → pgvector(默认正确选择)
偏好托管服务 → Pinecone
向量规模 > 50M / 需要水平扩展 / 需要 p99 SLA 保证 → Pinecone
需要 SQL 元数据过滤 + 向量检索 → pgvector(PostgreSQL 原生 JOIN)
需要超低延迟(p99 < 10ms)+ 百亿级向量 → Pinecone
pgvector 生产规模参考
- HNSW 索引需要 RAM 常驻
- 1536 维、10M 向量:需要 60-100GB RAM
- 50M+ 向量仍可支持,但运维复杂度显著上升
Pinecone 成本参考
- 10M 向量 + 中等查询负载:$100-400/月
- 100M+ 向量 + 高 QPS:$1,000-3,000+/月
- 相比之下 pgvector 仅有 PostgreSQL 实例成本
混合搜索
- Pinecone:原生稀疏+密集混合搜索,API 直接支持
- pgvector:PostgreSQL 原生
tsvector+ 向量相似度组合 SQL 查询,更灵活但需更多工程工作
评价
来自有实测经验(llm-benchmarks 数据集)的工程师,结论有数据支撑。2026 年视角下 pgvector 已进入生产就绪区间,适用于大多数中小规模 RAG 场景。
可信度:高 | 建议:精读,可作为 Vector DB 主题页补充
五、GitHub Trending 高价值项目(2026-07-14)
| 项目 | Stars | 今日⭐ | 分类 | 评价 |
|---|---|---|---|---|
| Graphify-Labs/graphify | 85.1k | +1,095 | AI coding assistant / knowledge graph | 将代码库、SQL schema、文档转为可查询知识图谱,支持 Claude/Cursor/Codex |
| OpenCut-app/OpenCut | 67.4k | +1,229 | 视频编辑(CapCut 开源替代) | 非 AI 工程重点,但 67k stars 说明开源视频工具需求旺盛 |
| HKUDS/Vibe-Trading | 22.1k | +1,153 | 量化交易 Agent | 个人交易 Agent 方向,值得关注量化 + Agent 交叉场景 |
| moeru-ai/airi | 42.1k | +78 | 陪伴型 AI(Neuro-sama 类) | 实时语音 + Minecraft + Factorio,多模态具身 AI 方向 |
| Nutlope/hallmark | 5.4k | +794 | AI 设计反垃圾 | anti-AI-slop 设计技能,Claude Code/Cursor 集成,Designer+AI 交叉 |
| Shubhamsaboo/awesome-llm-apps | — | — | LLM 应用集合 | 100+ 可运行 AI Agent & RAG 应用,适合快速原型 |
重点关注:Graphify 代码→知识图谱的思路与 RAG 不同,是代码库理解的新范式。在 SWE-bench 类任务上有潜力。
六、HuggingFace Trending 模型(2026-07-14)
| 模型 | 参数量 | 下载量 | 更新 | 备注 |
|---|---|---|---|---|
| deepseek-ai/DeepSeek-V4-Flash | 158B | 2.68M | 22天前 | Flash 版本主打低延迟推理 |
| deepseek-ai/DeepSeek-V4-Pro | 862B | 1.39M | 22天前 | Pro 版本高性能 |
| deepseek-ai/DeepSeek-V4-Pro-DSpark | 889B | 38.7k | 10天前 | DSpark 版本,分布式推理? |
| deepreinforce-ai/Ornith-1.0-35B | 35B | 665k | 19天前 | 35B 模型高下载量 |
| tencent/Hy3 | 299B | 9.16k | 8天前 | 腾讯混元 3,299B 超大参数量 |
| zai-org/GLM-5.2 | 753B | 465k | 12天前 | 智谱 GLM-5.2,753B 超大模型 |
DeepSeek V4 系列占据 HF 下载量榜首,Ornith-1.0 系列(9B/35B GGUF)持续保持高热度。
标签
推理工程 RAG 多模态RAG VectorDB pgvector Pinecone vLLM SGLang ColPali InferenceEngineering GitHub-Trending HuggingFace 2026-07
建议写入路径
/shared/research-kb/inbox/jay/2026-07-14-1335-inference-rag-vecdb-github-hf-trending-jul2026.md
是否需要精读/审稿/主题页更新
- 精读:TuringPost 20 Advanced RAG + Spheron Inference Engineering Guide
- 审稿:多模态 RAG 架构对比表(技术细节需二次核验)
- 建议更新主题页:RAG 主题页(新增 20 种高级 RAG 分类)、VectorDB 主题页(pgvector 2026 新基准)、Inference Engineering 主题页(若存在)