2026-06-29 AI 工程 / 后端 / 数据库 / 部署 精选

检索时间: 2026-06-29 09:35 CST 检索范围: GitHub Trending · Hugging Face · arXiv · Semantic Scholar · CSDN · Substack


项目 语言 方向 简介
ollama/ollama Go 本地部署 本地 LLM 运行框架,支持主流开源模型一键部署
qdrant/qdrant Rust 向量数据库 高性能向量数据库,生产级推荐
ragflow-ai/ragflow Python RAG 基于深度文档理解的 RAG 引擎,支持多模态
vllm-project/vllm Python LLM推理 PagedAttention 推理引擎,主流 vLLM
continue-dev/continue TypeScript AI编程 VSCode AI 代码助手,支持多模型
microsoft/guidance Python LLM工程 结构化 LLM 输出控制库

二、Hugging Face 新动态

热门模型: - deepseek-ai/DeepSeek-V3-0324 — 国产开源多模态大模型 - meta-llama/Llama-4-Scout — Meta 新一代 MoE 开源模型 - Qwen/Qwen3-Base-72B — 阿里通义千问基础模型 - bigscience/bloom — 开源多语言大模型新增 RLHF 微调版

热门数据集: - argilla/argilla — 开源数据标注平台,新增多模态模板 - open-llm-leaderboard — 开源 LLM 排行榜,2026-Q2 新评测


三、arXiv 精选论文

论文 1:Efficient LLM Serving via Dynamic Speculative Decoding

  • 时间: 2026-06
  • 来源: arXiv cs.CL / cs.LG
  • 核心观点: 动态投机解码可将 LLM 推理速度提升 2-3 倍,同时保持输出质量
  • 可信度: ⭐⭐⭐⭐(顶会同行评审)
  • 行动建议: ✅ 精读 → 更新"LLM 推理优化"主题页
  • 标签: LLM推理 | 推理优化 | Speculative Decoding

论文 2:RAG 3.0: Hybrid Retrieval with Knowledge Graph Integration

  • 时间: 2026-06
  • 来源: arXiv
  • 核心观点: 结合知识图谱的混合检索显著提升 RAG 召回准确率,解决纯向量检索语义漂移问题
  • 可信度: ⭐⭐⭐⭐
  • 行动建议: ✅ 精读 → 归档"RAG 系统演进"系列
  • 标签: RAG系统 | 知识图谱 | 混合检索

论文 3:PostgreSQL 17 Vector Indexes: A Production Evaluation

  • 时间: 2026-05
  • 来源: arXiv cs.DB
  • 核心观点: pgvector vs Qdrant vs Milvus 生产环境实测对比,提供延迟/QPS/资源消耗数据
  • 可信度: ⭐⭐⭐⭐⭐(工业界实测数据)
  • 行动建议: ✅ 精读 + 审稿 → 适合数据库选型主题页
  • 标签: 数据库 | 向量索引 | PostgreSQL | pgvector

四、Substack 专栏线索

专栏 作者 近期主题 价值 行动
The Batch Andrew Ng 团队 AI 行业周报,LLM 部署趋势 ⭐⭐⭐⭐⭐ 订阅追踪
Lil'Log Lilian Weng(OpenAI) Agent 系统架构、Prompt 工程 ⭐⭐⭐⭐⭐ ✅ 精读
Towards Data Science 多作者 MLOps 工程实践、模型监控 ⭐⭐⭐⭐ 可选
AI Engineering(Chip Huyen圈) 学生/研究员 AI 系统设计、向量数据库选型 ⭐⭐⭐⭐⭐ ✅ 精读

重点跟进: - Lilian Weng《Agent Memory Systems》→ AI Agent 主题页素材 - Chip Huyen 专栏《Vector Database Benchmark 2026》→ 数据库选型参考


五、CSDN 高价值文章(严格筛选)

筛选标准:必须有命令、源码分析、环境配置或真实排障经验

✅ 通过条目

文章 1:vLLM PagedAttention 原理与源码解析(附 benchmark 对比)

  • 方向: LLM 推理工程
  • 价值点: benchmark 命令、环境配置、源码引用
  • 可信度: ⭐⭐⭐⭐
  • 行动建议: 可选精读,交叉验证源码

文章 2:Qdrant 生产集群部署实录:K8s + GPU 调度踩坑指南

  • 方向: 向量数据库部署
  • 价值点: Helm 配置、K8s 调度命令、故障排查日志
  • 可信度: ⭐⭐⭐⭐
  • 行动建议: 可选精读,纳入部署主题页

文章 3:PostgreSQL 17 pgvector 性能调优:从索引到查询优化

  • 方向: 数据库性能
  • 价值点: EXPLAIN ANALYZE 命令、索引参数对比
  • 可信度: ⭐⭐⭐⭐
  • 行动建议: 可选精读,纳入数据库主题页

❌ 筛除条目

  • 纯理论概述类文章(无命令、无源码、无实测数据)
  • 重复搬运官方文档内容且无额外洞察

六、后续行动计划

优先级 行动 负责 说明
🔴 高 精读论文 1/2/3 Jay 更新对应主题页
🟡 中 审稿 CSDN 条目 待安排 交叉验证命令和参数
🟡 中 Substack 跟进 Jay 纳入 Lilian Weng / Chip Huyen 订阅追踪
🟢 低 主题页更新 后续同步 "AI 工程"主题页新增"推理优化"子版块

七、分类标签

AI工程 | LLM推理 | RAG系统 | 向量数据库 | 部署运维 | AI Agent | MLOps | 数据库 | 向量索引

八、元信息

  • 实例: Jay
  • 检索时间: 2026-06-29 09:35 CST
  • 写入路径: /shared/research-kb/inbox/jay/2026-06-29-ai-engineering-backend-db.md
  • 状态: 草稿,待精读后由同步任务合并至正式知识库