研究知识库草稿 · Jay · 2026-10-10
本次主题: AI 工程·后端·数据库·部署高价值条目 检索范围: GitHub Trending / Hugging Face / arXiv / Substack / CSDN / 技术博客 检索时间: 2026-10-10 17:35 UTC
📌 核心摘要
本期重点覆盖: 1. 推理引擎格局:vLLM / llama.cpp / TensorRT-LLM 势力划分清晰,Apple Silicon 和 Intel 推理成为新分支 2. RAG 工程成熟化:从"接向量库"走向系统设计,GPU 调度、向量索引、Agentic RAG 成为工程前沿 3. 多模态模型爆发:Qwen-Image-2.1、Kolibri-1(MoE + 100 万上下文)、YOLO26 4. AI 工程职业定位:95.6% 职位为生产级,AI 工程师本质是"有 AI 产品感的系统工程师" 5. BYOA 模式:Datafold 提出的 Bring-Your-Own-Agent 正在重塑数据工程平台
🔥 GitHub 高价值条目
1. thedotmack / claude-mem
类型: AI Agent 记忆层
链接: https://github.com/thedotmack/claude-mem
星数: 97,801 ⭐ | 578 stars/day
简介: 跨 AI Agent(Claude Code、OpenClaw、Codex、Gemini、Copilot 等)的持久化上下文系统,将 agent 会话记忆压缩后注入未来会话。解决 Agent 记忆碎片化问题。
评价: 工程化程度高,兼容主流 Agent 平台,适合搭建企业级多 Agent 记忆基础设施。⭐⭐⭐⭐⭐
标签: AI-Agent Memory Context-Management OpenClaw
行动: 可纳入主题页「Agent 开发工具链」
2. addyosmani / production-grade-engineering
类型: AI 工程技能路线图
链接: https://github.com/addyosmani/production-grade-engineering
星数: 102,891 ⭐ | 677 stars/day
简介: 面向 AI 编码 Agent 的生产级工程技能库,包含生产级 AI 编码 Agent 的工程规范、最佳实践和质量度量。
评价: Google 工程师维护,定位清晰,质量高。⭐⭐⭐⭐⭐
标签: AI-Engineering Best-Practices AI-Agent Developer-Productivity
行动: 适合纳入 AI 工程实践主题页
3. microsoft / Build26-* 系列(Microsoft Build 2026 资源库)
高价值子仓库:
| 仓库 | 主题 | Stars |
|---|---|---|
microsoft/Build26-BRK231-deploy-observe-learn-reinforcement-learning-for-production-agents |
AI Agent 生产部署、可观测性、人类监督 | 13 |
microsoft/Build26-BRK223-from-rows-to-reasoning-designing-databases-for-ai-apps-and-agents |
为 AI 应用和 Agent 设计数据库 | 14 |
microsoft/Build26-DEM331-turn-apis-tools-and-data-into-real-agent-velocity |
GitHub Copilot SDK 跨设备 Agent | 9 |
评价: Microsoft Build 2026 官方发布的 AI 工程前沿资源,数据库与 AI Agent 的交叉设计是亮点。⭐⭐⭐⭐
标签: AI-Agents Database Production Microsoft-Build Observability
行动: BRK223 数据库设计内容可精读
🤗 Hugging Face 高价值模型 / 论文
模型
| 模型 | 机构 | 特点 | 下载/热度 |
|---|---|---|---|
Aleph-Alpha/Kolibri-1 |
Aleph Alpha | MoE + 384 experts/layer + 100 万 token 上下文,德英双语,Apache 2.0,AIM 2025 96.9% | 高Trending |
Qwen/Qwen-Image-2.1 |
阿里巴巴 | 统一图像生成与编辑,7B 参数,多模态 | 高下载量 |
autotrust/JEV-27B-VL |
AutoTrust | 决策模型,Calibrated decisions + 完整推理能力 | 新上榜 |
ibm-granite/granite-4.0-1b-speech |
IBM | 企业多语言语音识别,7 天 51,600 下载(+119%),Apache 2.0 | 高增长 |
nvidia/canary-1b-v2 |
NVIDIA | 语音识别模型 | 新上榜 |
Ultralytics/YOLO26 |
Ultralytics | 统一实时视觉模型(检测/分割/姿态),NMS-free,多任务 | 持续热门 |
Kolibri-1 重点关注: MoE + 超长上下文 + Apache 2.0 的组合对企业本地部署有重要价值,值得跟进评测。
标签: Multimodal MoE Long-Context Speech Vision Open-Weight
Hugging Face 博客 / 论文
1. HF Blog: State of Open Models — Summer 2026 Observations
链接: https://huggingface.co/blog/state-of-open-models-summer-2026
核心观点:
- Qwen 是社区事实上的 base model(衍生数量最多)
- 小模型仍是实用层(实际部署量远超大模型)
- Agents 正在成为新用户层(machine-facing AI)
评价: HF 官方数据,权威性高。⭐⭐⭐⭐⭐
标签: Ecosystem Qwen Open-Weight Small-Models Agent
行动: 适合纳入「开源模型生态」主题页
2. HF Papers: Ultralytics YOLO26 — Unified Real-Time End-to-End Vision
链接: https://huggingface.co/papers/trending
核心观点: NMS-free + 多任务统一视觉模型,检测/分割/姿态估计一次forward,适合边缘部署。
评价: YOLO 家族持续演进,工程化程度极高。⭐⭐⭐⭐
标签: Computer-Vision Object-Detection Edge-AI YOLO
📄 学术论文(arXiv / PVLDB)
1. VikingRAG: Accurate and Token-efficient RAG over Structured Documents
链接: https://arxiv.org/html/2609.11390v1
作者/机构: Viking(推测为工业界团队)
核心贡献: 针对结构化文档(表格、图表)的 token 高效 RAG,实验覆盖 GPT-5.5、DeepSeek-V4-Pro Preview、Seed-2.0、GLM-4.7 等多个主流模型,结论跨模型一致。
评价: 结构化文档 RAG 是企业知识库的痛点,工程实用性强。⭐⭐⭐⭐
标签: RAG Structured-Documents LLM Enterprise-Knowledge
行动: 可精读,纳入 RAG 系统设计主题页引用
2. RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
链接: https://arxiv.org/pdf/2505.02922
发表于: PVLDB 2026(Volume 19, Issue 5)
作者: Microsoft Research(多位联合作者)
核心贡献: 长上下文 LLM 推理的向量存储引擎,优化 KV cache 管理与向量检索协同。与 RAG 正交(KV cache vs 外部知识检索)。
评价: PVLDB 2026 正式论文,工业界(Microsoft)背书,系统性强。⭐⭐⭐⭐⭐
标签: LLM-Inference Vector-Storage Long-Context Systems
行动: 纳入 LLM 推理工程主题页,需精读
3. VectorLiteRAG: Latency-Aware and Fine-Grained Resource Partitioning for Efficient RAG
链接: https://arxiv.org/html/2504.08930v3
核心贡献: GPU 感知 RAG serving,CPU 向量检索 vs GPU LLM 推理的资源竞争问题。提出动态资源分配策略,实测 CPU 检索可将 TTFT(首 token 时间)从 197ms 拖到 606ms(128M 向量规模)。
评价: RAG serving 系统设计必读,实验数据扎实。⭐⭐⭐⭐
标签: RAG GPU-Serving Inference-Optimization Systems
行动: 纳入 RAG 部署与性能优化主题页
4. Pancake: Hierarchical Memory System for Multi-Agent LLM Serving
链接: https://arxiv.org/html/2602.21477v1
核心贡献: 针对多 Agent 记忆场景的分层内存系统,替代传统静态向量数据库设计,支持增量更新而非全量重建。
评价: Agentic Memory 是新兴方向,与 claude-mem 等项目形成呼应。⭐⭐⭐⭐
标签: Multi-Agent Memory-System Vector-DB Agentic-AI
行动: 纳入 Agent 开发主题页
5. Agentic Retrieval-Augmented Generation: A Survey
链接: https://arxiv.org/html/2501.09136v4
核心贡献: Agentic RAG 全面综述,涵盖动态检索策略、多源融合、LLM 合成等,与传统静态 RAG 对比。
评价: 综述类文献,适合建立 Agentic RAG 认知框架。⭐⭐⭐⭐
标签: RAG Agentic-RAG Survey Multi-Agent
📧 Substack 高价值专栏
1. "What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026"
专栏: Alexey (alexeyondata.substack.com)
链接: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
发布时间: 2026(具体日期需访问)
核心数据:
- AI-first 角色占 70%,专注 RAG、Agent、评估和生产部署
- AI-support 角色占 28.5%,做 GPU 基础设施、数据管道、部署工具
- 传统 ML/DL 角色 < 2%
- 95.6% 职位面向生产环境
- 近 50% 以后端为主,20% 全栈
核心定义: "AI 工程师 = 拥有基础模型系统设计、评估和生产运营能力的工程师"
评价: 大样本数据,职业定位最有说服力的分析之一。⭐⭐⭐⭐⭐
标签: AI-Engineering Career Job-Market Production
行动: 纳入 AI 工程职业与技能体系主题页
2. "The 2026 AI Agent Stack, Drawn from Scratch"
专栏: Eric Roby (codingwithroby.substack.com)
链接: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
核心框架(六层 + 两轨):
1. Models & Inference(vLLM / Ollama / 自托管)
2. Agentic Framework(LangGraph / AutoGen / 自研)
3. Memory(向量 DB / 知识图谱 / KV store)
4. Tools & Integrations(MCP / API / 代码执行)
5. Evaluation(LLM-as-Judge / 基准测试)
6. Deployment & Ops(容器 / K8s / 监控)
关键区分: Agent Stack ≠ LLM Stack,前者管工具/记忆/编排,后者管 GPU/批处理/量化。
评价: 工程视角清晰,适合作为 Agent 技术栈速查。⭐⭐⭐⭐
标签: AI-Agent Stack Architecture RAG vLLM
3. "The AI Engineer's Guide to Inference Engines and Frameworks"
专栏: Multimodal AI (multimodalai.substack.com)
链接: https://multimodalai.substack.com/p/the-ai-engineers-guide-to-inference
核心推理引擎选型指南:
- OpenVINO → Intel CPU/GPU 部署
- CoreML / llama.cpp → Apple Silicon
- Ollama → 本地快速实验
- ONNX → 标准化格式、跨框架
- Mojo MAX Engine → 实验性,跨硬件
- vLLM → 大多数 LLM 部署首选
- llama.cpp → 需要更多控制权时
- TensorRT-LLM / NVIDIA Triton / NVIDIA Dynamo → 大规模生产部署
vLLM 定位: 高吞吐 + 内存高效,Python 为主(80%+),CUDA/C++ 优化注意力 kernel,UC Berkeley 研究背景,社区活跃。
评价: 推理引擎选型最实用的中文可参考指南(英文)。⭐⭐⭐⭐⭐
标签: LLM-Inference vLLM TensorRT llama.cpp Deployment
4. "The End of AI Magic Tricks: Why 2026 Is Agentic AI's Death Valley"
专栏: ModelCraft (modelcraft.substack.com)
链接: https://modelcraft.substack.com/p/the-end-of-ai-magic-tricks-why-2026
核心观点:
- Agent 工程能力 = 系统工程能力(可靠性、可观测性、成本控制)
- 7 大关键能力:架构设计、GPU/推理优化、可观测性、可靠性工程、成本优化、推理路由决策、集成与可操作性
- "能在 1/3 成本、5× 可用率、清晰故障模式、10× 扩展路径下跑 Agent 的人"才是稀缺人才
评价: 反炒作、强调工程落地的视角,与 Eric Roby 栈互补。⭐⭐⭐⭐
标签: AI-Agent Production Systems-Engineering Cost-Optimization Observability
5. "Don't Waste 2026 on the Wrong Career: ML vs AI Engineer"
专栏: Nidly (nidly.substack.com) — AI & Software Engineering at Production Scale
链接: https://nidly.substack.com/p/dont-waste-2026-on-the-wrong-career
核心观点:
- AI 工程师 = 集成工程师:LLM API + 向量库 + 检索层 + 编排逻辑
- 硬核工程能力(系统设计、可观测性、容错)= AI 工程师的结构性优势
- ML 路径需要数年积累,AI 工程路径只需数月
评价: 清晰区分两条路径,适合职业定位参考。⭐⭐⭐⭐
标签: AI-Engineering Career ML-Engineering Production
🗄️ 后端 / 数据库 / DevOps(2026 趋势)
1. Northflank: "What's the best deployment stack for AI apps in 2026?"
链接: https://northflank.com/blog/best-deployment-stack-for-ai-apps
核心架构分层:
- 应用状态层: PostgreSQL / MongoDB(对话历史、用户会话)
- 向量存储层: Pinecone / Weaviate / Qdrant 或 pgvector(内嵌 Postgres)
- 模型推理层: 自托管 GPU(H100/H200/A100/L40S)或云 API
- 后端 API 层: FastAPI / Node.js,长生命周期服务,流式响应
pgvector 趋势: 早期/中期 AI 应用推荐,Postgres 兼顾结构化查询和向量检索,减少数据系统复杂度。
评价: 工程视角扎实,pgvector 作为入门推荐实用。⭐⭐⭐⭐
标签: AI-Deployment PostgreSQL pgvector Stack
2. Datafold: "Data Engineering in 2026: 12 Predictions"
链接: https://www.datafold.com/blog/data-engineering-in-2026-predictions
关键预测:
- BYOA(Bring-Your-Own-Agent) 正在成为数据平台赢家模式:让用户自带 Agent 与平台 API/MCP 交互,而非平台内置"AI Agent"
- 数据工程重要性上升:AI Agent 依赖高质量数据管道
- 传统数据平台(Teradata、Talend)处境危险,缺乏创新动力
BYOA 逻辑: 平台 AI Agent 永远赶不上前沿模型;让用户自己选 Agent + 平台数据 = 更优。
评价: 数据平台战略视角前瞻性强,对理解 AI 与数据工程交叉有价值。⭐⭐⭐⭐
标签: Data-Engineering BYOA AI-Agent Data-Platform
Backend Stack 2026(综合多个来源)
| 领域 | 技术 |
|---|---|
| Runtime | Node.js 22 LTS, Python (FastAPI/Django 6) |
| 高性能 | Rust (Actix/Axum), Go (Gin/Fiber) |
| 企业 Java | Java 25 (Spring Boot 4) |
| 容器 | Docker & Podman |
| 编排 | Kubernetes (K8s) |
| IaC | Terraform / Pulumi |
| CI/CD | GitHub Actions / GitLab CI/CD |
| 可观测性 | Grafana + Prometheus + Loki/Tempo |
| 事件驱动 | RabbitMQ / Kafka |
Java AI 进展: Spring AI 和 LangChain4j 已达生产就绪,Semantic Caching 降低 LLM 成本 60-80%。
标签: Backend DevOps Kubernetes IaC Observability
🇨🇳 CSDN 高价值内容
1. 《我重新梳理了一遍 RAG,终于明白它不只是接个向量库》
链接: https://blog.csdn.net/xx_nm98/article/details/161121360
发布时间: 2026-10-02(最新推荐)
核心观点:
- RAG 本质是系统设计问题,不是单一模型能力问题
- 效果取决于整条链路质量:文档解析 → 切片策略 → 召回方式 → 重排机制 → 上下文组织
- 关键洞察:"RAG 的关键,不在于有没有搭起来,而在于每一个环节是否真正为最终回答质量服务"
评价: 工程反思性质,适合作为 RAG 认知深化的入口。⭐⭐⭐⭐
标签: RAG Engineering CSDN
2. CSDN 魔乐社区 RAG 标签页(持续高价值来源)
链接: https://modelers.csdn.net/tags/67a5830b911edf5f3b0e60e4
亮点文章:
- Anything-LLM:私有化 RAG,支持多模型切换和细粒度权限控制
- Clawdbot(OpenClaw)开源部署指南:Qwen3-32B + 可视化 AI 中台
- GraphRAG vs RAGFlow 对比:知识图谱推理 vs 深度文档理解
标签: RAG GraphRAG Enterprise OpenClaw
📋 分类标签总览
AI-Engineering, LLM-Inference, RAG, Vector-DB, AI-Agent,
Multi-Agent, Memory-System, Backend, DevOps, Kubernetes,
Database, pgvector, vLLM, llama.cpp, TensorRT, Multimodal,
Long-Context, MoE, Production, Observability, Career,
Ecosystem, Open-Weight, Small-Models, Computer-Vision,
Speech, BYOA, Data-Engineering
✅ 建议写入路径
| 条目 | 建议路径 | 优先级 |
|---|---|---|
| VikingRAG / RetroInfer / VectorLiteRAG | research-kb/papers/llm-systems/ |
高 |
| Hugging Face State of Open Models | research-kb/ecosystem/hf-trends/ |
高 |
| Substack: 1,000 JD 分析 | research-kb/career/ai-engineer-role/ |
高 |
| Substack: AI Agent Stack (Eric Roby) | research-kb/ai-agent/architecture/ |
中高 |
| Substack: Inference Engines Guide | research-kb/llm-inference/deployment/ |
高 |
| claude-mem / production-grade-engineering | research-kb/ai-agent/tools/ |
中高 |
| Kolibri-1 / Qwen-Image-2.1 / YOLO26 | research-kb/models/open-weight/ |
中 |
| Northflank deployment stack / Datafold BYOA | research-kb/ai-deployment/stack/ |
中高 |
| CSDN RAG 系统设计 | research-kb/rag/engineering/ |
中 |
🔎 后续行动建议
- 精读 RetroInfer(PVLDB 2026):Microsoft Research 长上下文推理系统论文,适合纳入 LLM 推理工程主题页
- 跟进 Kolibri-1:MoE + 1M 上下文 + Apache 2.0,潜在企业本地部署价值
- BYOA 趋势:Datafold 预测值得在数据平台主题页中体现
- Agentic RAG 综述:建立 Agentic RAG 与传统 RAG 的对比框架
- 精读 VectorLiteRAG:RAG serving GPU 资源调度工程必读
草稿生成时间:2026-10-10 17:35 CST | 实例:Jay | 不含 API Key / Token