Jay 工程筛选 · 2026-09-04 T1(10:50 UTC+8)
筛选范围
- Substack:The AI Engineer、aiagentssimplified、javarevisited、aiamastery、codingwithroby、jamwithai
- arXiv:cs.AI、cs.SE(2026年)、CAIN'26
- GitHub Trending / Hugging Face
- 技术博客:deploybase.ai、bizon-tech.com、Red Hat Developer、vllm.ai
- Tavily 泛搜索:LLM inference、agent、RAG、MLOps、benchmark
第一轮候选(共12条)
| # | 来源 | 标题 | 类型 |
|---|---|---|---|
| 1 | deploybase.ai | Best LLM Inference Engines 2026: vLLM vs SGLang vs TGI vs llama.cpp | 博客 |
| 2 | The AI Engineer (Substack) | The AI Agents Stack (2026 Edition) | 专栏 |
| 3 | The AI Engineer (Substack) | The Open-Source Agent Toolkit in 2026 | 专栏 |
| 4 | arXiv:2602.00751 | Engineering AI Agents for Clinical Workflows (CAIN'26) | 论文 |
| 5 | arXiv:2604.16371 | A Systematic Review of MLOps Tools (CAIN'26) | 论文 |
| 6 | vLLM.ai/blog | vLLM Korea Meetup 2026 · Prefill-Decode Disaggregation | 博客 |
| 7 | Red Hat Developer | llama.cpp vs. vLLM: Choosing the right local LLM inference engine | 博客 |
| 8 | github.com/louisfb01 | start-ai-engineering: Build real AI systems 2026 | 代码库 |
| 9 | github.com/dipakkr | ai-engineering-guide | 代码库 |
| 10 | RapidClaw (rapidclaw.dev) | RAG Architecture for AI Agents: Vectors, Chunking & Agentic Patterns (2026) | 博客 |
| 11 | AIMultiple | RAG Benchmarks: Embedding Models, Vector DBs, Agentic RAG | 基准 |
| 12 | codingwithroby (Substack) | The 2026 AI Agent Stack, Drawn from Scratch | 专栏 |
工程筛选结果
✅ 保留(7条)
1. Best LLM Inference Engines 2026: vLLM vs SGLang vs TGI vs llama.cpp
来源:deploybase.ai
URL:https://deploybase.ai/articles/best-llm-inference-engine
保留理由:真实 benchmark 数据 + 命令行 + 量化配置
- ✅ 吞吐量数据:A100 80GB 实测(vLLM 3,500 tok/s、SGLang 2,800、TGI 2,500、baseline 1,800、llama.cpp CPU 20)
- ✅ H100/H200 实测数据(H200 场景 SGLang 16,215 tok/s、LMDeploy 16,132、vLLM 12,553)
- ✅ 真实命令:docker run -e HF_MODEL_QUANTIZE=bfloat16 ...
- ✅ llama.cpp GPU offload:./main -m model.gguf -ngl 80 -p "prompt"
- ✅ 多线程 CPU:./main -m model.gguf -t 16
- ✅ GGUF 量化链路:python convert.py → ./quantize → ./llama-server
- ⚠️ 第三方整合数据(需交叉验证),厂商自报数据已注明
分类标签:LLM推理 · 基准测试 · vLLM · SGLang · llama.cpp · 量化 · 命令行
建议写入路径:inference-engineering/llm-inference-benchmark-2026/
后续行动:对比 vLLM 官方 blog 数据,验证吞吐数字可信度;提炼 H100/H200 场景选型建议
2. Engineering AI Agents for Clinical Workflows: A Case Study in Architecture, MLOps, and Governance
来源:arXiv 2602.00751,CAIN'26(IEEE/ACM)
URL:https://arxiv.org/abs/2602.00751
保留理由:学术工程案例,Clean Architecture + EDA 架构模式,Agent 粒度 MLOps 生命周期
- ✅ "Maria" 平台真实架构:Clean Architecture + EDA 解耦模式
- ✅ Agent-as-MLOps-unit 范式:每个 agent 有独立 MLOps 生命周期
- ✅ 模型无关性隔离:A/B 切换 OpenAI → Bedrock 为基础设施层变更,不改业务逻辑
- ✅ PHI 数据处理:数据最小化策略上游
- ✅ 模型漂移检测:集成 legacy IT 基础设施
- ✅ 分层架构:Core(稳定抽象)vs Infrastructure(可替换组件)
分类标签:Agent架构 · MLOps · Clean Architecture · 医疗AI · CAIN'26 · 案例研究
建议写入路径:agent-engineering/clinical-ai-agent-architecture-cain26/
后续行动:核验 arXiv HTML 版本中 Core/Infrastructure 层具体接口定义;对比生产部署经验
3. A Systematic Review of MLOps Tools: Tool Adoption, Lifecycle Coverage (CAIN'26)
来源:arXiv 2604.16371,CAIN'26
URL:https://arxiv.org/pdf/2604.16371
保留理由:114篇文献系统综述,MLOps 工具全生命周期覆盖,工具矩阵对比
- ✅ 工具覆盖:Delta Lake、Databricks、Azure ML Studio、AWS Lake Formation、Kubeflow、AWS Sagemaker 等
- ✅ 工具能力矩阵:数据版本控制、模型部署(batch/online/managed endpoint)、质量保障、漂移监控
- ✅ 痛点归纳:环境不一致性、资源利用率、数据漂移、模型性能退化
- ✅ NVIDIA Triton Inference Server 应用案例
- ✅ MLOps-as-Unified-Engineering-Practice 定义
分类标签:MLOps · 工具链 · 系统综述 · CAIN'26 · DevOps · 漂移监控
建议写入路径:llmops/mlops-tools-systematic-review-cain26/
后续行动:提取工具矩阵关键对比表;补充 2026 年新增工具(如 SGLang、Arize Phoenix、Langfuse)
4. vLLM Korea Meetup 2026 · Prefill-Decode Disaggregation
来源:vllm.ai/blog
URL:https://vllm.ai/blog
保留理由:vLLM 官方 blog,Prefill-Decode 分离工程实践,AMD MORI-IO 实现细节
- ✅ 8-GPU MI300X 节点 prefill/decode 分离架构
- ✅ AMD MORI-IO 协议:KV cache 高效传输、ITL 稳定性优化
- ✅ Goodput 提升 vs 原始吞吐量
- ✅ DeepLearning.AI vLLM 课程内容(LLM Compressor 量化、GuideLLM benchmark)
- ✅ Blackwell FP4 kernels(SemiAnalysis InferenceMAX 合作)
- ✅ DeepSeek-V3.2-Exp 细粒度稀疏注意力
分类标签:vLLM · Prefill-Decode分离 · 推理系统 · AMD MI300X · Blackwell · KV缓存
建议写入路径:inference-engineering/vllm-prefill-decode-disaggregation-2026/
后续行动:对比 vLLM 0.21.x release note;提炼单节点分离部署前置条件
5. llama.cpp vs. vLLM: Choosing the right local LLM inference engine
来源:Red Hat Developer
URL:https://developers.redhat.com/articles/2026/06/15/llamacpp-vs-vllm-choosing-right-local-llm-inference-engine
保留理由:benchmark 方法论 + 场景区分 + llm-d split-serving 背景
- ✅ GuideLLM 工具链(benchmark 框架)
- ✅ Llama 3.1 8B Full precision 单 H200 GPU 测试,并发 1-64 用户
- ✅ 场景区分:数据中心高并发(vLLM 优势)vs 本地单用户消费硬件(llama.cpp 优势)
- ✅ llm-d 项目:prefill/decode 跨 Kubernetes 分离
- ✅ 生产 Serving 对比,非通用场景对比
分类标签:vLLM · llama.cpp · Benchmark方法论 · H200 · 推理部署 · 场景选型
建议写入路径:inference-engineering/llamacpp-vs-vllm-benchmark-methodology/
后续行动:提炼并发扩展性曲线关键节点;补充不同模型规模(1B/8B/70B)选型建议
6. start-ai-engineering (louisfb01)
来源:GitHub
URL:https://github.com/louisfb01/start-ai-engineering
保留理由:真实项目代码结构 + 模块化 Agent 实现 + 环境配置
- ✅ Advanced AI Agent From Scratch:Modular architecture、Pydantic type-safe tool execution
- ✅ Provider-agnostic LLM wrapper(可互换模型)
- ✅ ReAct-based agent orchestrator
- ✅ 免费资源清单:Together AI、Fireworks AI、Groq、Cerebras、Modal
- ✅ 2026 AI Engineering 学习路径(context engineering、RAG、MCP、workflow、agent design、evals、observability)
分类标签:AI工程 · Agent实现 · ReAct · Pydantic · 学习路径 · GitHub · 开源
建议写入路径:agent-engineering/start-ai-engineering-code-analysis/
后续行动:提取代码片段关键类设计;对比 LangChain/LangGraph 实现差异
7. RAG Architecture for AI Agents: Vectors, Chunking & Agentic Patterns (2026)
来源:rapidclaw.dev
URL:https://rapidclaw.dev/blog/rag-architecture-ai-agents-guide-2026
保留理由:Agentic RAG 5种模式 + Vector DB benchmark 数据 + 工程选型
- ✅ 5种 Agentic RAG 模式:iterative retrieval、query decomposition、HDE、cross-corpus triangulation、evidence-weighted
- ✅ RAG 三阶段:retrieval → augmentation → generation
- ✅ 2026 Vector DB benchmark 数据(p99 latency、RAM consumption、write throughput)
- ✅ Chroma write-lock 5条迁移路径
- ✅ ColPali/VLM 多模态文档检索
分类标签:Agentic RAG · 向量数据库 · Chunking · 多模态 · Benchmark · 架构模式
建议写入路径:rag-engineering/agentic-rag-patterns-2026/
后续行动:抽取 Vector DB 横向对比表;补充 ColPali 工程落地条件
❌ 丢弃(5条)
丢弃1:The AI Agents Stack (2026 Edition) — The AI Engineer Substack
URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
丢弃理由:路线图类总结,无新 benchmark 或工程命令,仅提供 6 层框架概述(与 2025 年内容高度重叠)。OWASP MCP Top 10 可引用但不作为工程细节记录。
丢弃2:The Open-Source Agent Toolkit in 2026 — The AI Engineer Substack
URL:https://theaiengineer.substack.com/p/the-open-source-agent-toolkit-in
丢弃理由:工具枚举类,Langfuse、Arize Phoenix、Browser Use 等均为已知工具列表描述,无新命令、无源码、无 benchmark 数据。与已有知识库内容(2026-06/07 月刊)高度重叠。
丢弃3:ai-engineering-guide (dipakkr)
URL:https://github.com/dipakkr/ai-engineering-guide
丢弃理由:学习路径汇总,非工程实现。9 chapters、75 lessons 均为导览式内容,无源码分析、无复现步骤、无真实环境命令。比 start-ai-engineering 浅。
丢弃4:The 2026 AI Agent Stack, Drawn from Scratch — codingwithroby
URL:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
丢弃理由:哲学性/概念性文章,含"SSP (Spurious Stochastic Process)"等过度抽象术语拼凑,缺乏具体架构图、命令或性能数据。模型路由模式有价值但需核验来源(RouteLLM 引用)。
丢弃5:RAG Benchmarks: Embedding Models, Vector DBs, Rerankers — AIMultiple
URL:https://aimultiple.com/rag
丢弃理由:Benchmark 结果缺乏测试条件描述。GPT-4.1-mini、BGE-small、Qdrant 等配置已知,但 BERG RAGBench、RAGAS、DeepEval 等工具侧描述未给出实际数值来源或可复现方法。更适合作为索引页而非工程参考。
本次汇总
| 分类 | 保留 | 丢弃 |
|---|---|---|
| 推理引擎(vLLM/llama.cpp/SGLang) | 3 | 0 |
| Agent 架构/实现 | 2 | 3 |
| MLOps/工具链 | 1 | 0 |
| RAG 工程 | 1 | 1 |
| 合计 | 7 | 4 |
建议写入文件
写入路径:/shared/research-kb/inbox/jay/2026-09-04T1050-jay-engineering-filter.md(即本文)
是否需要精读: - ⭐⭐⭐ arXiv 2602.00751(CAIN'26):Clean Architecture + EDA + Agent-as-MLOps-unit 工程价值高 - ⭐⭐⭐ vllm.ai blog:Prefill-Decode Disaggregation 工程细节需深读 - ⭐⭐ deploybase.ai benchmark:作为推理引擎选型参考,需与 vLLM 官方数据交叉核验 - ⭐⭐ Red Hat Developer:benchmark 方法论完整,适合作为 SOP 参考
主题页更新建议:
- inference-engineering/ → 新增 vLLM prefill-decode disaggregation 条目
- agent-engineering/ → 新增 clinical AI agent 案例(CAIN'26)
- llmops/ → 新增 MLOps tools systematic review 工具矩阵