研究草稿 · 2026-08-29 · AI 工程·后端·数据库·部署
实例:Jay | 检索范围:GitHub Trending · Hugging Face · Substack · 美团技术团队 · InfoQ · CSDN
一、GitHub Trending 高价值项目
🔥 rohitg00/ai-engineering-from-scratch
- 链接:https://github.com/rohitg00/ai-engineering-from-scratch
- stars:50k+ / week 3,263
- 标签:
AI工程学习路径全栈 - 摘要:系统性 AI 工程从零到一学习路径,覆盖 LLM API 调用、RAG 构建、Agent 开发、部署监控等完整流程。定位与 Karpathy 的 ml-workshop 相近但更偏 2026 年工程实践。
- 评价:⭐⭐⭐⭐⭐ star 增速极快,内容覆盖全面,适合作为团队内部 AI 工程 onboarding 资料参考。
- 后续行动:可提取 README 大纲,评估是否能补充现有知识库 AI 工程路线图。
🔥 volcengine/OpenViking
- 链接:https://github.com/volcengine/OpenViking
- stars:33k+ / month 6,387
- 标签:
Agent记忆RAG知识库火山引擎 - 摘要:面向 AI Agent 的自进化上下文数据库,统一 Agent Memory、Knowledge RAG 和 Skills。类似 TencentDB Agent Memory 定位,但背靠字节跳动/火山引擎。
- 评价:⭐⭐⭐⭐ star 规模说明工程团队在快速跟进 Agent 记忆层赛道,值得关注架构设计思路。
- 后续行动:可精读其 README 的 architecture 设计;与 TencentDB Agent Memory 对比记忆层方案差异。
⚡ jundot/omlx
- 链接:https://github.com/jundot/omlx
- stars:20k+ / week 777
- 标签:
LLM推理Apple Silicon连续批处理SSD缓存macOS菜单栏 - 摘要:面向 Apple Silicon 的 LLM 推理服务器,支持 continuous batching 和 SSD caching,macOS 菜单栏管理 UI。定位为本地开发/Dev机器推理场景。
- 评价:⭐⭐⭐⭐ 本地推理赛道细分,Apple Silicon 专用推理工程价值独特;M 系列 GPU 生态持续成熟。
- 后续行动:关注其 continuous batching 在 Apple GPU 上的实现机制,是否有可复用的调度思路。
⚡ modular/modular
- 链接:https://github.com/modular/modular
- stars:29k+ / week 1,770
- 标签:
MojoPython生态编译器ML性能 - 摘要:Modular 平台(包含 MAX 引擎和 Mojo 语言),Chris Lattner 主导,目标统一 Python 生太和硬件加速。
- 评价:⭐⭐⭐⭐ Mojo 生态持续扩张,MAX 引擎对 ML 推理性能优化值得关注。
- 后续行动:关注 MAX 引擎的 production readiness 进展。
⚡ earendil-works/pi
- 链接:https://github.com/earendil-works/pi
- stars:24k+ / month 15,653
- 标签:
AI Agent工具链统一LLM APITUI腾讯DB - 摘要:AI agent 工具包,统一 LLM API、agent 循环、TUI 和编码 agent CLI;包含 TencentDB Agent Memory(团队级记忆枢纽,支持 Chat Memory/Skill/LLM-Wiki/Code-Graph 四类记忆资产)。
- 评价:⭐⭐⭐⭐ 腾讯 DB 的 Agent Memory 设计有参考价值;四类记忆资产划分思路值得研究。
- 后续行动:精读 TencentDB Agent Memory 模块的设计文档。
⚡ apache/maka
- 链接:https://github.com/apache/maka
- stars:3.8k+ / month 2,851(Apache 孵化项目)
- 标签:
本地优先AI Agent工作区Append-only log - 摘要:本地优先 AI Agent 工作区,模型消息/工具调用/权限决策/终止事件均记录为 Append-only log。
- 评价:⭐⭐⭐ Apache 背景,append-only log 设计对审计合规场景有意义。
- 后续行动:低优先级,观察社区活跃度。
⚡ Tencent/AI-Infra-Guard
- 链接:https://github.com/Tencent/AI-Infra-Guard
- stars:6k+ / week 1,182
- 标签:
AI安全红队MCP扫描LLM越狱评估 - 摘要:全栈 AI 红队平台,覆盖 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 和 LLM jailbreak 评估。
- 评价:⭐⭐⭐⭐ AI 安全工程化赛道,腾讯视角的生产级实践。
- 后续行动:关注其 agent/skills/mcp scan 的技术实现深度。
二、Hugging Face 重点内容
📄 HF Blog: State of Open Models — Summer 2026
- 链接:https://huggingface.co/blog/state-of-open-models-summer-2026
- 标签:
开源模型Qwen生态GGUF格式本地推理 - 核心观点:
- GGUF 格式声明仓库增长 464%,lerobot 增长 194%,Apple MLX 增长 148%——本地推理格式增速是 HF 平均的 3-7 倍。
- Qwen 衍生版本每日新增 180-210 个仓库,说明 Qwen 已成为微调/部署默认选择。
- 小模型(1-9B)与大模型(>100B)下载量中位数差约 4 倍,远小于参数规模差;ATON 指标显示小模型实际 adoption 更高。
- 评价:⭐⭐⭐⭐⭐ HF 官方年度状态报告,必读。GGUF/MLX 生态数据对推理引擎选型有直接指导意义。
- 后续行动:提取报告中的量化数据补充知识库 AI 推理引擎趋势页。
📄 HF Blog: State of Open Source — Spring 2026
- 链接:https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
- 标签:
开源生态政府AI小型模型 - 核心观点:
- 小型模型下载/部署率远高于大型模型,反映成本/延迟/硬件约束的现实。
- 韩国国家主权 AI 计划指定 LG AI Research、SK Telecom、Naver Cloud、NC AI、Upstage 为国家冠军。
- 评价:⭐⭐⭐⭐ 政府 AI 投资动态有战略参考价值。
📄 HF Papers: Trending — Zetta ζ / LMCACHE
- 链接:https://huggingface.co/papers/trending
- 标签:
KV CacheEmbodied AI具身智能 - 核心观点:LMCACHE 支持将 KV Cache 存储在 GPU 外部,支持跨查询和推理引擎复用,显著提升吞吐。
- 评价:⭐⭐⭐⭐ LMCACHE 是 vLLM/SGLang 生产部署中 KV Cache 复用的重要工程组件。
- 后续行动:了解 LMCACHE 与 vLLM prefix caching 的协同机制。
三、LLM 推理引擎深度对比(2026)
📄 Spheron: vLLM vs TensorRT-LLM vs SGLang Decision Framework
- 链接:https://www.spheron.network/blog/llm-inference-optimization-2026
- 标签:
推理引擎vLLMTensorRT-LLMSGLangBenchmark - 核心观点:
- vLLM PagedAttention 发明者,高吞吐量最优(~3,500 tokens/sec @ A100 80GB Llama 70B)。
- SGLang RadixAttention 在 prefix-heavy 场景领先 29%,归因于 prefix cache reuse 优化。
- TensorRT-LLM 编译优化,延迟低但部署复杂度高。
- 选型原则:突发多样化流量选 vLLM;prefix 复用多(RAG/多轮/长 system prompt)选 SGLang;追求最低延迟且有 NVIDIA 生态选 TensorRT-LLM。
- 评价:⭐⭐⭐⭐⭐ 2026 中期推理引擎选型决策框架,vendor-neutral,数据详实。
- 后续行动:补充知识库 AI 推理引擎对比页,建议按流量模式给出选型建议。
📄 DeployBase: Best LLM Inference Engines 2026 Benchmark
- 链接:https://deploybase.ai/articles/best-llm-inference-engine
- 标签:
推理引擎Benchmark吞吐量延迟 - 核心数据:
- 吞吐量:vLLM 3,500 > SGLang 2,800 > TGI 2,500 > transformers 1,800
- TTFT(首 token 时间):SGLang 80ms < vLLM/TensorRT 150ms < TGI 250ms
- 内存效率:TensorRT-LLM 编译优势,vLLM/SGLang 接近
- 评价:⭐⭐⭐⭐ 量化 benchmark,与 Spheron 定性框架互补。
📄 vLLM 官方博客:Inside vLLM: Anatomy of a High-Throughput System
- 链接:https://vllm.ai/blog
- 标签:
vLLMPagedAttentionContinuous BatchingSpeculative Decoding - 核心观点:
- Prefill-Decode disaggregation(预填充/解码分离)在 AMD MI300X 8-GPU 节点上显著提升 ITL 稳定性。
- GB200 NVL72 分布式服务达 25K total TPS/GPU(Qwen3.5-397B-A17B-NVFP4)。
- Arm CPU 支持和推理性能优化持续推进。
- 评价:⭐⭐⭐⭐ vLLM 官方技术深度解读,生产部署关键参数说明。
四、RAG 与生产部署
📄 Harness: AI Deployment in Production — CI/CD for LLMs & Agents
- 链接:https://www.harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
- 标签:
CI/CDLLM部署RAGAgent编排 - 核心观点:
- AI 部署 = 部署一个栈,不是一个模型。
- Prompt/eval/政策/config 均应视为代码,接受 CI 测试。
- 渐进式交付(canary)用于 model/prompt/RAG 变更。
- 编排依赖链:Prompt ↔ RAG ↔ Embeddings ↔ Guardrails,防止静默回归。
- 评价:⭐⭐⭐⭐⭐ LLM Ops 工程师必读,将 SRE 原则系统性地应用到 AI 部署。
- 后续行动:提取其中 checklist 补充知识库 AI 工程 check page。
📄 Redis Blog: RAG at Scale — Production AI Systems 2026
- 链接:https://redis.io/blog/rag-at-scale
- 标签:
RAG语义缓存成本优化Agent Memory - 核心观点:
- 语义缓存可减少 68.8% LLM API 调用成本(识别语义相似查询复用缓存)。
- 多层数据存储(向量/语义缓存/应用状态/运营数据)带来新的故障模式和延迟风险。
- Rate limiting 分层:user/tenant 级别、LLM API 级别、向量 DB 级别、系统级别。
- 评价:⭐⭐⭐⭐ 语义缓存是 RAG 生产落地的关键成本优化手段,与 LMCACHE KV Cache 复用互补。
- 后续行动:在知识库 RAG 工程实践页补充语义缓存策略。
📄 Agile Infoways: Production-Ready RAG Architecture Patterns 2026
- 链接:https://www.agileinfoways.com/blog/building-production-ready-rag-systems-2026
- 标签:
Agentic RAGRerankerLong-ContextHybrid RAG - 核心观点:
- Agentic RAG:LLM 作为 planner 分解子查询、评估是否需要继续检索(类 ReAct 应用于检索)。
- Reranker 两阶段:vector top-50 → rerank to top-5,延迟合理同时提升准确率。
- Cross-encoder reranker 选项:Cohere Rerank、BGE-reranker-large、Jina Reranker。
- Long-context(1M+ token)减少但未消除 RAG;超大语料库 RAG 仍更便宜/更快/更可控。
- 评价:⭐⭐⭐⭐ 工程实践指南,Reranker 选型和 agentic RAG 模式有直接参考价值。
- 后续行动:补充知识库 RAG 架构模式页。
📄 TechPlus Trends: Defensible RAG — Enterprise Implementation 2026
- 链接:https://techplustrends.com/enterprise-rag-implementation-best-practices-2026
- 标签:
合规RAGEU AI ActRAG经济学治理 - 核心观点:
- 2026 年受监管企业的 RAG 设计选择已是治理决策。
- 跨文档聚合、实体关系推理、时间序列风险对比、合规可追溯性需要超越"向量+LLM"的架构。
- RAG 经济学 = 结构性的财务决策(涉及 IP Box 等税务优化框架)。
- 评价:⭐⭐⭐ 企业合规视角,对金融/法律等强监管行业 RAG 架构有参考意义。
- 后续行动:低优先级。
五、向量数据库深度对比
📄 CSDN/DeepSeek: 2026 AI工程师向量数据库选型——Qdrant/Milvus/Weaviate/pgvector
- 链接:https://deepseek.csdn.net/6a31fd3d10ee7a33f27e3c8d.html
- 标签:
向量数据库QdrantMilvuspgvector选型 - 核心数据:
- Qdrant: P99 < 10ms, Rust 实现内存低 40-60%,过滤查询最优
- Milvus: 亿级生产验证,HNSW/IVF/DiskANN 多索引,弱 ACID
- pgvector: SQL 生态融合,ACID 事务,但 > 5M 行性能衰减
- 选型建议:1M 向量内选 Qdrant;亿级选 Milvus;已有 PG 生态选 pgvector;多模态选 Weaviate
- 评价:⭐⭐⭐⭐⭐ CSDN 难得的高价值工程选型文章,数据详实、对比维度清晰。
- 后续行动:直接引用至知识库向量数据库选型页。
📄 InfoQ: 云原生向量数据库内核设计——金山云 Relyt-V
- 链接:https://www.infoq.cn/article/5FRZ8iMATl9YEvQjofct
- 标签:
向量数据库内核CBO优化器Relaxed Monotonicity无锁并发 - 核心观点:
- 基于 CBO(Cost-Based Optimization)优化器选择向量检索执行计划。
- Relaxed Monotonicity 早停机制:图遍历过程中维护两个优先队列,动态判断是否终止搜索。
- 向量索引数据按 1GB 分块,Prefetch 预加载邻居数据到 Cache;插入/更新实现无锁操作(原子 ID + 原子更新)。
- 评价:⭐⭐⭐⭐ 内核级工程细节,Relaxed Monotonicity 是图遍历优化的工程实现亮点。
- 后续行动:精读 Relaxed Monotonicity 算法伪代码,评估是否可补充向量索引算法页。
六、Substack 高质量专栏
📧 The AI Engineer: The AI Agents Stack (2026 Edition)
- 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者:The AI Engineer(知名 AI 工程 newsletter)
- 标签:
Agent架构GuardrailsEvaluationBenchmark - 核心观点:
- Agent 基础设施独立于 LLM 基础设施:Chatbot 需 inference+RAG;Agent 需状态管理/工具访问/记忆持久化/推理循环/实时 guardrails。
- Agent guardrails 已从 input/output 过滤演变为授权工具调用、执行速率限制、行为验证的独立学科。
- 三层评估体系:PR 快速检查(工具调用正确性)→ 夜间回归(LLM judge)→ 生产持续监控(漂移告警)。
- 新 Benchmark:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 agent)。
- 评价:⭐⭐⭐⭐⭐ AI Agent 工程实践必读,三层评估体系和生产监控模式可直接落地。
- 后续行动:提取 Guardrails 演进部分补充 Agent 安全页;关注三个新 Benchmark 的进展。
📧 Learn AI Together: LAI #137 — Where AI Engineering Is Going in 2026
- 链接:https://learnaitogethernewsletter.substack.com/p/lai-137-where-ai-engineering-is-going
- 作者:Louis-François Bouchard, Towards AI
- 标签:
AI工程趋势ObservabilityLangfuse自托管 - 核心观点:
- Langfuse 突破 100K 月 traces,但托管定价进入"痛苦区间",作者选择自托管开源版本。
- Docker Compose 快速部署:Postgres + ClickHouse + Redis + MinIO。
- 自托管注意事项:UTC 时区 bug、Redis 队列深度作为真实健康信号、生产需 TLS+SSO+Kubernetes。
- 评价:⭐⭐⭐⭐ Langfuse 自托管实操经验,有真实运维踩坑记录。
- 后续行动:补充知识库 AI Observability 工具页的自托管方案。
七、国内技术团队动态
🏭 美团技术团队近期重点
- 来源:https://tech.meituan.com
- CatPaw 全场景 AI Agent 平台(2026-07-28):基于 LongCat 2.0,提供个人提效和企业级 Agent 开发托管能力。类似扣子/Coze 的企业版定位。
- LongCat-Next 开源(2026-04-02):多模态模型,视觉和语音作为"母语";同步开源离散分词器。
- KDD'26 论文精选(2026-08-13):覆盖推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架。
- Agent 评测漫谈(2026-08-07):从浅入深讲解 Agent 评测方法论。
- 评价:⭐⭐⭐⭐ 美团 CatPaw 是国内少有的企业级 Agent 托管平台;KDD 论文方向反映工业界研究热点。
- 后续行动:关注 CatPaw 的开放程度和 API 设计;KDD 论文方向可补充知识库学术趋势页。
八、本次高价值条目汇总
| 优先级 | 条目 | 核心价值 | 建议行动 |
|---|---|---|---|
| ⭐⭐⭐⭐⭐ | rohitg00/ai-engineering-from-scratch |
AI 工程学习路径 star 增速第一 | 提取大纲补充知识库路线图 |
| ⭐⭐⭐⭐⭐ | Spheron: vLLM vs SGLang vs TensorRT-LLM | 推理引擎选型决策框架 | 补充知识库推理引擎对比页 |
| ⭐⭐⭐⭐⭐ | CSDN 向量数据库选型 (Qdrant/Milvus/pgvector) | 工程选型数据详实 | 直接引用至知识库 |
| ⭐⭐⭐⭐⭐ | The AI Engineer: AI Agents Stack 2026 | Agent 架构三层评估体系 | 补充 Agent 工程实践页 |
| ⭐⭐⭐⭐ | HF State of Open Models Summer 2026 | GGUF/MLX 生态数据 | 补充 AI 推理引擎趋势页 |
| ⭐⭐⭐⭐ | Redis Blog: RAG at Scale 语义缓存 | 68.8% 成本削减数据 | 补充 RAG 工程实践页 |
| ⭐⭐⭐⭐ | OpenViking / pi (TencentDB Agent Memory) | Agent 记忆层设计 | 精读设计文档 |
| ⭐⭐⭐⭐ | Agile Infoways: Production RAG Architecture | Agentic RAG + Reranker | 补充 RAG 架构模式页 |
| ⭐⭐⭐ | InfoQ: Relyt-V 内核 Relaxed Monotonicity | 图遍历早停机制 | 算法页补充 |
| ⭐⭐⭐ | 美团 CatPaw / KDD'26 论文 | 企业 Agent 平台 + 学术热点 | 关注开放程度 |
九、分类标签
AI工程 LLM推理 vLLM SGLang TensorRT-LLM RAG Agent 向量数据库 Qdrant Milvus pgvector 数据库内核 MLOps 部署 Observability Langfuse 生产系统 Benchmark GitHub Trending Hugging Face Substack 美团
十、建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-08-29-ai-engineering-backend-deployment.md - 后续精读/审稿项:
1. Spheron 推理引擎对比框架 → 知识库
AI推理/引擎对比/2026-08.md2. CSDN 向量数据库选型 → 知识库数据库/向量库/选型指南-2026.md3. The AI Engineer: AI Agents Stack 2026 → 知识库Agent/架构/Stack-2026.md4. OpenViking/TencentDB Agent Memory 设计 → 知识库Agent/记忆层/设计对比.md5. InfoQ Relyt-V Relaxed Monotonicity → 知识库算法/向量索引/图遍历早停.md
本次检索完成时间:2026-08-29 13:35 CST 实例:Jay | 渠道:Discord cron | 草稿版本:v1.0