Jay 工程筛选 · 2026-09-04 T1(10:50 UTC+8)

筛选范围

  • Substack:The AI Engineer、aiagentssimplified、javarevisited、aiamastery、codingwithroby、jamwithai
  • arXiv:cs.AI、cs.SE(2026年)、CAIN'26
  • GitHub Trending / Hugging Face
  • 技术博客:deploybase.ai、bizon-tech.com、Red Hat Developer、vllm.ai
  • Tavily 泛搜索:LLM inference、agent、RAG、MLOps、benchmark

第一轮候选(共12条)

# 来源 标题 类型
1 deploybase.ai Best LLM Inference Engines 2026: vLLM vs SGLang vs TGI vs llama.cpp 博客
2 The AI Engineer (Substack) The AI Agents Stack (2026 Edition) 专栏
3 The AI Engineer (Substack) The Open-Source Agent Toolkit in 2026 专栏
4 arXiv:2602.00751 Engineering AI Agents for Clinical Workflows (CAIN'26) 论文
5 arXiv:2604.16371 A Systematic Review of MLOps Tools (CAIN'26) 论文
6 vLLM.ai/blog vLLM Korea Meetup 2026 · Prefill-Decode Disaggregation 博客
7 Red Hat Developer llama.cpp vs. vLLM: Choosing the right local LLM inference engine 博客
8 github.com/louisfb01 start-ai-engineering: Build real AI systems 2026 代码库
9 github.com/dipakkr ai-engineering-guide 代码库
10 RapidClaw (rapidclaw.dev) RAG Architecture for AI Agents: Vectors, Chunking & Agentic Patterns (2026) 博客
11 AIMultiple RAG Benchmarks: Embedding Models, Vector DBs, Agentic RAG 基准
12 codingwithroby (Substack) The 2026 AI Agent Stack, Drawn from Scratch 专栏

工程筛选结果

✅ 保留(7条)


1. Best LLM Inference Engines 2026: vLLM vs SGLang vs TGI vs llama.cpp

来源:deploybase.ai
URL:https://deploybase.ai/articles/best-llm-inference-engine
保留理由真实 benchmark 数据 + 命令行 + 量化配置
- ✅ 吞吐量数据:A100 80GB 实测(vLLM 3,500 tok/s、SGLang 2,800、TGI 2,500、baseline 1,800、llama.cpp CPU 20) - ✅ H100/H200 实测数据(H200 场景 SGLang 16,215 tok/s、LMDeploy 16,132、vLLM 12,553) - ✅ 真实命令:docker run -e HF_MODEL_QUANTIZE=bfloat16 ... - ✅ llama.cpp GPU offload:./main -m model.gguf -ngl 80 -p "prompt" - ✅ 多线程 CPU:./main -m model.gguf -t 16 - ✅ GGUF 量化链路:python convert.py → ./quantize → ./llama-server - ⚠️ 第三方整合数据(需交叉验证),厂商自报数据已注明

分类标签LLM推理 · 基准测试 · vLLM · SGLang · llama.cpp · 量化 · 命令行
建议写入路径inference-engineering/llm-inference-benchmark-2026/
后续行动:对比 vLLM 官方 blog 数据,验证吞吐数字可信度;提炼 H100/H200 场景选型建议


2. Engineering AI Agents for Clinical Workflows: A Case Study in Architecture, MLOps, and Governance

来源:arXiv 2602.00751,CAIN'26(IEEE/ACM)
URL:https://arxiv.org/abs/2602.00751
保留理由学术工程案例,Clean Architecture + EDA 架构模式,Agent 粒度 MLOps 生命周期
- ✅ "Maria" 平台真实架构:Clean Architecture + EDA 解耦模式 - ✅ Agent-as-MLOps-unit 范式:每个 agent 有独立 MLOps 生命周期 - ✅ 模型无关性隔离:A/B 切换 OpenAI → Bedrock 为基础设施层变更,不改业务逻辑 - ✅ PHI 数据处理:数据最小化策略上游 - ✅ 模型漂移检测:集成 legacy IT 基础设施 - ✅ 分层架构:Core(稳定抽象)vs Infrastructure(可替换组件)

分类标签Agent架构 · MLOps · Clean Architecture · 医疗AI · CAIN'26 · 案例研究
建议写入路径agent-engineering/clinical-ai-agent-architecture-cain26/
后续行动:核验 arXiv HTML 版本中 Core/Infrastructure 层具体接口定义;对比生产部署经验


3. A Systematic Review of MLOps Tools: Tool Adoption, Lifecycle Coverage (CAIN'26)

来源:arXiv 2604.16371,CAIN'26
URL:https://arxiv.org/pdf/2604.16371
保留理由114篇文献系统综述,MLOps 工具全生命周期覆盖,工具矩阵对比
- ✅ 工具覆盖:Delta Lake、Databricks、Azure ML Studio、AWS Lake Formation、Kubeflow、AWS Sagemaker 等 - ✅ 工具能力矩阵:数据版本控制、模型部署(batch/online/managed endpoint)、质量保障、漂移监控 - ✅ 痛点归纳:环境不一致性、资源利用率、数据漂移、模型性能退化 - ✅ NVIDIA Triton Inference Server 应用案例 - ✅ MLOps-as-Unified-Engineering-Practice 定义

分类标签MLOps · 工具链 · 系统综述 · CAIN'26 · DevOps · 漂移监控
建议写入路径llmops/mlops-tools-systematic-review-cain26/
后续行动:提取工具矩阵关键对比表;补充 2026 年新增工具(如 SGLang、Arize Phoenix、Langfuse)


4. vLLM Korea Meetup 2026 · Prefill-Decode Disaggregation

来源:vllm.ai/blog
URL:https://vllm.ai/blog
保留理由vLLM 官方 blog,Prefill-Decode 分离工程实践,AMD MORI-IO 实现细节
- ✅ 8-GPU MI300X 节点 prefill/decode 分离架构 - ✅ AMD MORI-IO 协议:KV cache 高效传输、ITL 稳定性优化 - ✅ Goodput 提升 vs 原始吞吐量 - ✅ DeepLearning.AI vLLM 课程内容(LLM Compressor 量化、GuideLLM benchmark) - ✅ Blackwell FP4 kernels(SemiAnalysis InferenceMAX 合作) - ✅ DeepSeek-V3.2-Exp 细粒度稀疏注意力

分类标签vLLM · Prefill-Decode分离 · 推理系统 · AMD MI300X · Blackwell · KV缓存
建议写入路径inference-engineering/vllm-prefill-decode-disaggregation-2026/
后续行动:对比 vLLM 0.21.x release note;提炼单节点分离部署前置条件


5. llama.cpp vs. vLLM: Choosing the right local LLM inference engine

来源:Red Hat Developer
URL:https://developers.redhat.com/articles/2026/06/15/llamacpp-vs-vllm-choosing-right-local-llm-inference-engine
保留理由benchmark 方法论 + 场景区分 + llm-d split-serving 背景
- ✅ GuideLLM 工具链(benchmark 框架) - ✅ Llama 3.1 8B Full precision 单 H200 GPU 测试,并发 1-64 用户 - ✅ 场景区分:数据中心高并发(vLLM 优势)vs 本地单用户消费硬件(llama.cpp 优势) - ✅ llm-d 项目:prefill/decode 跨 Kubernetes 分离 - ✅ 生产 Serving 对比,非通用场景对比

分类标签vLLM · llama.cpp · Benchmark方法论 · H200 · 推理部署 · 场景选型
建议写入路径inference-engineering/llamacpp-vs-vllm-benchmark-methodology/
后续行动:提炼并发扩展性曲线关键节点;补充不同模型规模(1B/8B/70B)选型建议


6. start-ai-engineering (louisfb01)

来源:GitHub
URL:https://github.com/louisfb01/start-ai-engineering
保留理由真实项目代码结构 + 模块化 Agent 实现 + 环境配置
- ✅ Advanced AI Agent From Scratch:Modular architecture、Pydantic type-safe tool execution - ✅ Provider-agnostic LLM wrapper(可互换模型) - ✅ ReAct-based agent orchestrator - ✅ 免费资源清单:Together AI、Fireworks AI、Groq、Cerebras、Modal - ✅ 2026 AI Engineering 学习路径(context engineering、RAG、MCP、workflow、agent design、evals、observability)

分类标签AI工程 · Agent实现 · ReAct · Pydantic · 学习路径 · GitHub · 开源
建议写入路径agent-engineering/start-ai-engineering-code-analysis/
后续行动:提取代码片段关键类设计;对比 LangChain/LangGraph 实现差异


7. RAG Architecture for AI Agents: Vectors, Chunking & Agentic Patterns (2026)

来源:rapidclaw.dev
URL:https://rapidclaw.dev/blog/rag-architecture-ai-agents-guide-2026
保留理由Agentic RAG 5种模式 + Vector DB benchmark 数据 + 工程选型
- ✅ 5种 Agentic RAG 模式:iterative retrieval、query decomposition、HDE、cross-corpus triangulation、evidence-weighted - ✅ RAG 三阶段:retrieval → augmentation → generation - ✅ 2026 Vector DB benchmark 数据(p99 latency、RAM consumption、write throughput) - ✅ Chroma write-lock 5条迁移路径 - ✅ ColPali/VLM 多模态文档检索

分类标签Agentic RAG · 向量数据库 · Chunking · 多模态 · Benchmark · 架构模式
建议写入路径rag-engineering/agentic-rag-patterns-2026/
后续行动:抽取 Vector DB 横向对比表;补充 ColPali 工程落地条件


❌ 丢弃(5条)


丢弃1:The AI Agents Stack (2026 Edition) — The AI Engineer Substack

URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
丢弃理由路线图类总结,无新 benchmark 或工程命令,仅提供 6 层框架概述(与 2025 年内容高度重叠)。OWASP MCP Top 10 可引用但不作为工程细节记录。


丢弃2:The Open-Source Agent Toolkit in 2026 — The AI Engineer Substack

URL:https://theaiengineer.substack.com/p/the-open-source-agent-toolkit-in
丢弃理由工具枚举类,Langfuse、Arize Phoenix、Browser Use 等均为已知工具列表描述,无新命令、无源码、无 benchmark 数据。与已有知识库内容(2026-06/07 月刊)高度重叠。


丢弃3:ai-engineering-guide (dipakkr)

URL:https://github.com/dipakkr/ai-engineering-guide
丢弃理由学习路径汇总,非工程实现。9 chapters、75 lessons 均为导览式内容,无源码分析、无复现步骤、无真实环境命令。比 start-ai-engineering 浅。


丢弃4:The 2026 AI Agent Stack, Drawn from Scratch — codingwithroby

URL:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
丢弃理由哲学性/概念性文章,含"SSP (Spurious Stochastic Process)"等过度抽象术语拼凑,缺乏具体架构图、命令或性能数据。模型路由模式有价值但需核验来源(RouteLLM 引用)。


丢弃5:RAG Benchmarks: Embedding Models, Vector DBs, Rerankers — AIMultiple

URL:https://aimultiple.com/rag
丢弃理由Benchmark 结果缺乏测试条件描述。GPT-4.1-mini、BGE-small、Qdrant 等配置已知,但 BERG RAGBench、RAGAS、DeepEval 等工具侧描述未给出实际数值来源或可复现方法。更适合作为索引页而非工程参考。


本次汇总

分类 保留 丢弃
推理引擎(vLLM/llama.cpp/SGLang) 3 0
Agent 架构/实现 2 3
MLOps/工具链 1 0
RAG 工程 1 1
合计 7 4

建议写入文件

写入路径/shared/research-kb/inbox/jay/2026-09-04T1050-jay-engineering-filter.md(即本文)

是否需要精读: - ⭐⭐⭐ arXiv 2602.00751(CAIN'26):Clean Architecture + EDA + Agent-as-MLOps-unit 工程价值高 - ⭐⭐⭐ vllm.ai blog:Prefill-Decode Disaggregation 工程细节需深读 - ⭐⭐ deploybase.ai benchmark:作为推理引擎选型参考,需与 vLLM 官方数据交叉核验 - ⭐⭐ Red Hat Developer:benchmark 方法论完整,适合作为 SOP 参考

主题页更新建议: - inference-engineering/ → 新增 vLLM prefill-decode disaggregation 条目 - agent-engineering/ → 新增 clinical AI agent 案例(CAIN'26) - llmops/ → 新增 MLOps tools systematic review 工具矩阵