研究草稿 · 2026-08-29 · AI 工程·后端·数据库·部署

实例:Jay | 检索范围:GitHub Trending · Hugging Face · Substack · 美团技术团队 · InfoQ · CSDN


🔥 rohitg00/ai-engineering-from-scratch

  • 链接:https://github.com/rohitg00/ai-engineering-from-scratch
  • stars:50k+ / week 3,263
  • 标签AI工程 学习路径 全栈
  • 摘要:系统性 AI 工程从零到一学习路径,覆盖 LLM API 调用、RAG 构建、Agent 开发、部署监控等完整流程。定位与 Karpathy 的 ml-workshop 相近但更偏 2026 年工程实践。
  • 评价:⭐⭐⭐⭐⭐ star 增速极快,内容覆盖全面,适合作为团队内部 AI 工程 onboarding 资料参考。
  • 后续行动:可提取 README 大纲,评估是否能补充现有知识库 AI 工程路线图。

🔥 volcengine/OpenViking

  • 链接:https://github.com/volcengine/OpenViking
  • stars:33k+ / month 6,387
  • 标签Agent记忆 RAG 知识库 火山引擎
  • 摘要:面向 AI Agent 的自进化上下文数据库,统一 Agent Memory、Knowledge RAG 和 Skills。类似 TencentDB Agent Memory 定位,但背靠字节跳动/火山引擎。
  • 评价:⭐⭐⭐⭐ star 规模说明工程团队在快速跟进 Agent 记忆层赛道,值得关注架构设计思路。
  • 后续行动:可精读其 README 的 architecture 设计;与 TencentDB Agent Memory 对比记忆层方案差异。

⚡ jundot/omlx

  • 链接:https://github.com/jundot/omlx
  • stars:20k+ / week 777
  • 标签LLM推理 Apple Silicon 连续批处理 SSD缓存 macOS菜单栏
  • 摘要:面向 Apple Silicon 的 LLM 推理服务器,支持 continuous batching 和 SSD caching,macOS 菜单栏管理 UI。定位为本地开发/Dev机器推理场景。
  • 评价:⭐⭐⭐⭐ 本地推理赛道细分,Apple Silicon 专用推理工程价值独特;M 系列 GPU 生态持续成熟。
  • 后续行动:关注其 continuous batching 在 Apple GPU 上的实现机制,是否有可复用的调度思路。

⚡ modular/modular

  • 链接:https://github.com/modular/modular
  • stars:29k+ / week 1,770
  • 标签Mojo Python生态 编译器 ML性能
  • 摘要:Modular 平台(包含 MAX 引擎和 Mojo 语言),Chris Lattner 主导,目标统一 Python 生太和硬件加速。
  • 评价:⭐⭐⭐⭐ Mojo 生态持续扩张,MAX 引擎对 ML 推理性能优化值得关注。
  • 后续行动:关注 MAX 引擎的 production readiness 进展。

⚡ earendil-works/pi

  • 链接:https://github.com/earendil-works/pi
  • stars:24k+ / month 15,653
  • 标签AI Agent工具链 统一LLM API TUI 腾讯DB
  • 摘要:AI agent 工具包,统一 LLM API、agent 循环、TUI 和编码 agent CLI;包含 TencentDB Agent Memory(团队级记忆枢纽,支持 Chat Memory/Skill/LLM-Wiki/Code-Graph 四类记忆资产)。
  • 评价:⭐⭐⭐⭐ 腾讯 DB 的 Agent Memory 设计有参考价值;四类记忆资产划分思路值得研究。
  • 后续行动:精读 TencentDB Agent Memory 模块的设计文档。

⚡ apache/maka

  • 链接:https://github.com/apache/maka
  • stars:3.8k+ / month 2,851(Apache 孵化项目)
  • 标签本地优先 AI Agent工作区 Append-only log
  • 摘要:本地优先 AI Agent 工作区,模型消息/工具调用/权限决策/终止事件均记录为 Append-only log。
  • 评价:⭐⭐⭐ Apache 背景,append-only log 设计对审计合规场景有意义。
  • 后续行动:低优先级,观察社区活跃度。

⚡ Tencent/AI-Infra-Guard

  • 链接:https://github.com/Tencent/AI-Infra-Guard
  • stars:6k+ / week 1,182
  • 标签AI安全 红队 MCP扫描 LLM越狱评估
  • 摘要:全栈 AI 红队平台,覆盖 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 和 LLM jailbreak 评估。
  • 评价:⭐⭐⭐⭐ AI 安全工程化赛道,腾讯视角的生产级实践。
  • 后续行动:关注其 agent/skills/mcp scan 的技术实现深度。

二、Hugging Face 重点内容

📄 HF Blog: State of Open Models — Summer 2026

  • 链接:https://huggingface.co/blog/state-of-open-models-summer-2026
  • 标签开源模型 Qwen生态 GGUF格式 本地推理
  • 核心观点
  • GGUF 格式声明仓库增长 464%,lerobot 增长 194%,Apple MLX 增长 148%——本地推理格式增速是 HF 平均的 3-7 倍。
  • Qwen 衍生版本每日新增 180-210 个仓库,说明 Qwen 已成为微调/部署默认选择。
  • 小模型(1-9B)与大模型(>100B)下载量中位数差约 4 倍,远小于参数规模差;ATON 指标显示小模型实际 adoption 更高。
  • 评价:⭐⭐⭐⭐⭐ HF 官方年度状态报告,必读。GGUF/MLX 生态数据对推理引擎选型有直接指导意义。
  • 后续行动:提取报告中的量化数据补充知识库 AI 推理引擎趋势页。

📄 HF Blog: State of Open Source — Spring 2026

  • 链接:https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
  • 标签开源生态 政府AI 小型模型
  • 核心观点
  • 小型模型下载/部署率远高于大型模型,反映成本/延迟/硬件约束的现实。
  • 韩国国家主权 AI 计划指定 LG AI Research、SK Telecom、Naver Cloud、NC AI、Upstage 为国家冠军。
  • 评价:⭐⭐⭐⭐ 政府 AI 投资动态有战略参考价值。

  • 链接:https://huggingface.co/papers/trending
  • 标签KV Cache Embodied AI 具身智能
  • 核心观点:LMCACHE 支持将 KV Cache 存储在 GPU 外部,支持跨查询和推理引擎复用,显著提升吞吐。
  • 评价:⭐⭐⭐⭐ LMCACHE 是 vLLM/SGLang 生产部署中 KV Cache 复用的重要工程组件。
  • 后续行动:了解 LMCACHE 与 vLLM prefix caching 的协同机制。

三、LLM 推理引擎深度对比(2026)

📄 Spheron: vLLM vs TensorRT-LLM vs SGLang Decision Framework

  • 链接:https://www.spheron.network/blog/llm-inference-optimization-2026
  • 标签推理引擎 vLLM TensorRT-LLM SGLang Benchmark
  • 核心观点
  • vLLM PagedAttention 发明者,高吞吐量最优(~3,500 tokens/sec @ A100 80GB Llama 70B)。
  • SGLang RadixAttention 在 prefix-heavy 场景领先 29%,归因于 prefix cache reuse 优化。
  • TensorRT-LLM 编译优化,延迟低但部署复杂度高。
  • 选型原则:突发多样化流量选 vLLM;prefix 复用多(RAG/多轮/长 system prompt)选 SGLang;追求最低延迟且有 NVIDIA 生态选 TensorRT-LLM。
  • 评价:⭐⭐⭐⭐⭐ 2026 中期推理引擎选型决策框架,vendor-neutral,数据详实。
  • 后续行动:补充知识库 AI 推理引擎对比页,建议按流量模式给出选型建议。

📄 DeployBase: Best LLM Inference Engines 2026 Benchmark

  • 链接:https://deploybase.ai/articles/best-llm-inference-engine
  • 标签推理引擎 Benchmark 吞吐量 延迟
  • 核心数据
  • 吞吐量:vLLM 3,500 > SGLang 2,800 > TGI 2,500 > transformers 1,800
  • TTFT(首 token 时间):SGLang 80ms < vLLM/TensorRT 150ms < TGI 250ms
  • 内存效率:TensorRT-LLM 编译优势,vLLM/SGLang 接近
  • 评价:⭐⭐⭐⭐ 量化 benchmark,与 Spheron 定性框架互补。

📄 vLLM 官方博客:Inside vLLM: Anatomy of a High-Throughput System

  • 链接:https://vllm.ai/blog
  • 标签vLLM PagedAttention Continuous Batching Speculative Decoding
  • 核心观点
  • Prefill-Decode disaggregation(预填充/解码分离)在 AMD MI300X 8-GPU 节点上显著提升 ITL 稳定性。
  • GB200 NVL72 分布式服务达 25K total TPS/GPU(Qwen3.5-397B-A17B-NVFP4)。
  • Arm CPU 支持和推理性能优化持续推进。
  • 评价:⭐⭐⭐⭐ vLLM 官方技术深度解读,生产部署关键参数说明。

四、RAG 与生产部署

📄 Harness: AI Deployment in Production — CI/CD for LLMs & Agents

  • 链接:https://www.harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
  • 标签CI/CD LLM部署 RAG Agent编排
  • 核心观点
  • AI 部署 = 部署一个栈,不是一个模型。
  • Prompt/eval/政策/config 均应视为代码,接受 CI 测试。
  • 渐进式交付(canary)用于 model/prompt/RAG 变更。
  • 编排依赖链:Prompt ↔ RAG ↔ Embeddings ↔ Guardrails,防止静默回归。
  • 评价:⭐⭐⭐⭐⭐ LLM Ops 工程师必读,将 SRE 原则系统性地应用到 AI 部署。
  • 后续行动:提取其中 checklist 补充知识库 AI 工程 check page。

📄 Redis Blog: RAG at Scale — Production AI Systems 2026

  • 链接:https://redis.io/blog/rag-at-scale
  • 标签RAG 语义缓存 成本优化 Agent Memory
  • 核心观点
  • 语义缓存可减少 68.8% LLM API 调用成本(识别语义相似查询复用缓存)。
  • 多层数据存储(向量/语义缓存/应用状态/运营数据)带来新的故障模式和延迟风险。
  • Rate limiting 分层:user/tenant 级别、LLM API 级别、向量 DB 级别、系统级别。
  • 评价:⭐⭐⭐⭐ 语义缓存是 RAG 生产落地的关键成本优化手段,与 LMCACHE KV Cache 复用互补。
  • 后续行动:在知识库 RAG 工程实践页补充语义缓存策略。

📄 Agile Infoways: Production-Ready RAG Architecture Patterns 2026

  • 链接:https://www.agileinfoways.com/blog/building-production-ready-rag-systems-2026
  • 标签Agentic RAG Reranker Long-Context Hybrid RAG
  • 核心观点
  • Agentic RAG:LLM 作为 planner 分解子查询、评估是否需要继续检索(类 ReAct 应用于检索)。
  • Reranker 两阶段:vector top-50 → rerank to top-5,延迟合理同时提升准确率。
  • Cross-encoder reranker 选项:Cohere Rerank、BGE-reranker-large、Jina Reranker。
  • Long-context(1M+ token)减少但未消除 RAG;超大语料库 RAG 仍更便宜/更快/更可控。
  • 评价:⭐⭐⭐⭐ 工程实践指南,Reranker 选型和 agentic RAG 模式有直接参考价值。
  • 后续行动:补充知识库 RAG 架构模式页。

  • 链接:https://techplustrends.com/enterprise-rag-implementation-best-practices-2026
  • 标签合规RAG EU AI Act RAG经济学 治理
  • 核心观点
  • 2026 年受监管企业的 RAG 设计选择已是治理决策。
  • 跨文档聚合、实体关系推理、时间序列风险对比、合规可追溯性需要超越"向量+LLM"的架构。
  • RAG 经济学 = 结构性的财务决策(涉及 IP Box 等税务优化框架)。
  • 评价:⭐⭐⭐ 企业合规视角,对金融/法律等强监管行业 RAG 架构有参考意义。
  • 后续行动:低优先级。

五、向量数据库深度对比

📄 CSDN/DeepSeek: 2026 AI工程师向量数据库选型——Qdrant/Milvus/Weaviate/pgvector

  • 链接:https://deepseek.csdn.net/6a31fd3d10ee7a33f27e3c8d.html
  • 标签向量数据库 Qdrant Milvus pgvector 选型
  • 核心数据
  • Qdrant: P99 < 10ms, Rust 实现内存低 40-60%,过滤查询最优
  • Milvus: 亿级生产验证,HNSW/IVF/DiskANN 多索引,弱 ACID
  • pgvector: SQL 生态融合,ACID 事务,但 > 5M 行性能衰减
  • 选型建议:1M 向量内选 Qdrant;亿级选 Milvus;已有 PG 生态选 pgvector;多模态选 Weaviate
  • 评价:⭐⭐⭐⭐⭐ CSDN 难得的高价值工程选型文章,数据详实、对比维度清晰。
  • 后续行动:直接引用至知识库向量数据库选型页。

📄 InfoQ: 云原生向量数据库内核设计——金山云 Relyt-V

  • 链接:https://www.infoq.cn/article/5FRZ8iMATl9YEvQjofct
  • 标签向量数据库内核 CBO优化器 Relaxed Monotonicity 无锁并发
  • 核心观点
  • 基于 CBO(Cost-Based Optimization)优化器选择向量检索执行计划。
  • Relaxed Monotonicity 早停机制:图遍历过程中维护两个优先队列,动态判断是否终止搜索。
  • 向量索引数据按 1GB 分块,Prefetch 预加载邻居数据到 Cache;插入/更新实现无锁操作(原子 ID + 原子更新)。
  • 评价:⭐⭐⭐⭐ 内核级工程细节,Relaxed Monotonicity 是图遍历优化的工程实现亮点。
  • 后续行动:精读 Relaxed Monotonicity 算法伪代码,评估是否可补充向量索引算法页。

六、Substack 高质量专栏

📧 The AI Engineer: The AI Agents Stack (2026 Edition)

  • 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者:The AI Engineer(知名 AI 工程 newsletter)
  • 标签Agent架构 Guardrails Evaluation Benchmark
  • 核心观点
  • Agent 基础设施独立于 LLM 基础设施:Chatbot 需 inference+RAG;Agent 需状态管理/工具访问/记忆持久化/推理循环/实时 guardrails。
  • Agent guardrails 已从 input/output 过滤演变为授权工具调用、执行速率限制、行为验证的独立学科。
  • 三层评估体系:PR 快速检查(工具调用正确性)→ 夜间回归(LLM judge)→ 生产持续监控(漂移告警)。
  • 新 Benchmark:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 agent)。
  • 评价:⭐⭐⭐⭐⭐ AI Agent 工程实践必读,三层评估体系和生产监控模式可直接落地。
  • 后续行动:提取 Guardrails 演进部分补充 Agent 安全页;关注三个新 Benchmark 的进展。

📧 Learn AI Together: LAI #137 — Where AI Engineering Is Going in 2026

  • 链接:https://learnaitogethernewsletter.substack.com/p/lai-137-where-ai-engineering-is-going
  • 作者:Louis-François Bouchard, Towards AI
  • 标签AI工程趋势 Observability Langfuse 自托管
  • 核心观点
  • Langfuse 突破 100K 月 traces,但托管定价进入"痛苦区间",作者选择自托管开源版本。
  • Docker Compose 快速部署:Postgres + ClickHouse + Redis + MinIO。
  • 自托管注意事项:UTC 时区 bug、Redis 队列深度作为真实健康信号、生产需 TLS+SSO+Kubernetes。
  • 评价:⭐⭐⭐⭐ Langfuse 自托管实操经验,有真实运维踩坑记录。
  • 后续行动:补充知识库 AI Observability 工具页的自托管方案。

七、国内技术团队动态

🏭 美团技术团队近期重点

  • 来源:https://tech.meituan.com
  • CatPaw 全场景 AI Agent 平台(2026-07-28):基于 LongCat 2.0,提供个人提效和企业级 Agent 开发托管能力。类似扣子/Coze 的企业版定位。
  • LongCat-Next 开源(2026-04-02):多模态模型,视觉和语音作为"母语";同步开源离散分词器。
  • KDD'26 论文精选(2026-08-13):覆盖推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架。
  • Agent 评测漫谈(2026-08-07):从浅入深讲解 Agent 评测方法论。
  • 评价:⭐⭐⭐⭐ 美团 CatPaw 是国内少有的企业级 Agent 托管平台;KDD 论文方向反映工业界研究热点。
  • 后续行动:关注 CatPaw 的开放程度和 API 设计;KDD 论文方向可补充知识库学术趋势页。

八、本次高价值条目汇总

优先级 条目 核心价值 建议行动
⭐⭐⭐⭐⭐ rohitg00/ai-engineering-from-scratch AI 工程学习路径 star 增速第一 提取大纲补充知识库路线图
⭐⭐⭐⭐⭐ Spheron: vLLM vs SGLang vs TensorRT-LLM 推理引擎选型决策框架 补充知识库推理引擎对比页
⭐⭐⭐⭐⭐ CSDN 向量数据库选型 (Qdrant/Milvus/pgvector) 工程选型数据详实 直接引用至知识库
⭐⭐⭐⭐⭐ The AI Engineer: AI Agents Stack 2026 Agent 架构三层评估体系 补充 Agent 工程实践页
⭐⭐⭐⭐ HF State of Open Models Summer 2026 GGUF/MLX 生态数据 补充 AI 推理引擎趋势页
⭐⭐⭐⭐ Redis Blog: RAG at Scale 语义缓存 68.8% 成本削减数据 补充 RAG 工程实践页
⭐⭐⭐⭐ OpenViking / pi (TencentDB Agent Memory) Agent 记忆层设计 精读设计文档
⭐⭐⭐⭐ Agile Infoways: Production RAG Architecture Agentic RAG + Reranker 补充 RAG 架构模式页
⭐⭐⭐ InfoQ: Relyt-V 内核 Relaxed Monotonicity 图遍历早停机制 算法页补充
⭐⭐⭐ 美团 CatPaw / KDD'26 论文 企业 Agent 平台 + 学术热点 关注开放程度

九、分类标签

AI工程 LLM推理 vLLM SGLang TensorRT-LLM RAG Agent 向量数据库 Qdrant Milvus pgvector 数据库内核 MLOps 部署 Observability Langfuse 生产系统 Benchmark GitHub Trending Hugging Face Substack 美团


十、建议写入路径

  • 主草稿/shared/research-kb/inbox/jay/2026-08-29-ai-engineering-backend-deployment.md
  • 后续精读/审稿项: 1. Spheron 推理引擎对比框架 → 知识库 AI推理/引擎对比/2026-08.md 2. CSDN 向量数据库选型 → 知识库 数据库/向量库/选型指南-2026.md 3. The AI Engineer: AI Agents Stack 2026 → 知识库 Agent/架构/Stack-2026.md 4. OpenViking/TencentDB Agent Memory 设计 → 知识库 Agent/记忆层/设计对比.md 5. InfoQ Relyt-V Relaxed Monotonicity → 知识库 算法/向量索引/图遍历早停.md

本次检索完成时间:2026-08-29 13:35 CST 实例:Jay | 渠道:Discord cron | 草稿版本:v1.0