Jay 工程文章筛选报告 · 2026-09-12

本次主题

AI/ML 工程实践高频筛选 · LLM 推理优化 · Agent Memory · RAG 生产评估 · MCP 协议

检索范围

arXiv / GitHub / Substack / 技术博客 / Hugging Face,2026 年 9 月近期条目


✅ 保留条目(高工程价值)

1. vLLM 推理优化 5 种实战方法

  • 来源JarvisLabs - vLLM Optimization Techniques(2026-02-06)
  • 筛选理由:包含 5 种具体优化技术的实战讲解,有明确分类(Prefix Caching / FP8 KV-Cache / CPU Offloading / P/D Disaggregation / Zero Reload Sleep Mode),非泛泛概述
  • 可信度:高 · 工程博客,数据明确
  • 标签vLLM 推理优化 PagedAttention KV-Cache
  • 后续行动:可精读原文,对照 vLLM 官方文档核验参数

2. LLM 推理三引擎决策框架(vLLM vs TensorRT-LLM vs SGLang)

  • 来源Spheron - LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026)(2026-08-19)
  • 筛选理由:三引擎横向对比框架,明确吞吐量/延迟/memory 的 trade-off 决策树,非 benchmark 跑分表,有生产选型逻辑
  • 可信度:高 · CTO 主笔,有量化指标
  • 标签推理引擎 vLLM TensorRT-LLM SGLang 生产架构
  • 后续行动:可作团队内部分享参考;后续需核验原文对 SGLang RadixAttention vs PagedAttention 的描述细节

3. Red Hat Developer: vLLM 性能调优实战策略

  • 来源Red Hat Developers - Practical strategies for vLLM performance tuning(2026-03-03)
  • 筛选理由:包含真实参数(--max-num-seqs--kv-cache-dtype=fp8)和系统性调优步骤,从 baseline 建立到 SLO 验证的闭环,有 Red Hat 工程背书
  • 可信度:高 · 明确命令行参数,有调优方法论
  • 标签vLLM 性能调优 生产运维 SLO
  • 后续行动:建议直接写入知识库「vLLM 生产运维」主题页

4. 生产 RAG 向量数据库 Benchmark(10M 向量,2026)

  • 来源Engineers Guide Substack - Best vector databases for production RAG in 2026(2026-02-06,作者 Joe Sack)
  • 筛选理由:严格按 10M 向量 / 1536-3072d / 过滤搜索 / 混合搜索 / P99 并发延迟评估,有方法论说明(不同于厂商优化过的通用数据集),给出了 pgvector / Pinecone / Milvus / Qdrant / Elasticsearch 的生产选型建议
  • Substack 规范记录
  • 专栏:Engineers Guide
  • 作者:Joe Sack
  • 链接:上见
  • 核心观点:pgvector 适合 <5-10M 向量 MVP;Pinecone 适合低运维 serverless 生产;Qdrant 适合复杂过滤/边缘部署
  • 可信度:高(方法论透明,非厂商赞助)
  • 标签向量数据库 RAG benchmark 生产评估
  • 后续行动:需进一步核验 benchmark 原始数据;可参考 Tensoria/AlphaCorp AI 同类对比做三角验证

5. 多智能体记忆的计算机架构视角(arXiv 2026)

  • 来源arXiv:2603.10062 - Multi-Agent Memory from a Computer Architecture Perspective
  • 筛选理由:将多智能体记忆问题类比计算机架构,提出三层记忆层次(I/O、Cache、Memory),识别出两个关键协议缺口(缓存共享和访问控制),是少见的高层次系统框架文章
  • 可信度:高 · arXiv 学术文章,有完整分类学
  • 标签多智能体 记忆架构 系统设计 论文
  • 后续行动:值得精读;建议对照 MemGPT / MAGMA 等实现系统做案例补充

6. ByteRover: Agent 原生记忆层级架构(arXiv 2026)

  • 来源arXiv:2604.01599 - ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context
  • 筛选理由:对现有记忆系统(Lightweight Semantic / Graph-structured / Hierarchical / Entity-centric)做分类梳理,基于 LongMemEval-S 基准提供量化对比,是当前较完整的 Agent 记忆分类学
  • 可信度:高 · arXiv,有评测基准
  • 标签Agent 记忆 层级架构 评测基准 论文
  • 后续行动:与第 5 条互补,建议合并阅读;后续核验 LongMemEval-S 基准的公开性

7. MCP 2026-07-28 规范 + 企业采用数据

  • 来源Model Context Protocol Blog - 2026-07-28 Specification + Synvestable - MCP Enterprise Adoption Guide(2026-04 更新)
  • 筛选理由:MCP 已成 agent 工具集成实施层面核心协议。2026-07-28 规范转向无状态模型,是重大架构变化;Fortune 500 28% 已部署,97M SDK 月下载量,有量化数据支撑
  • Substack 规范记录(Synvestable):
  • 专栏:Synvestable(技术咨询)
  • 作者:Synvestable Team
  • 核心观点:MCP 正成为企业级 agent 工具集成实施标准,28% Fortune 500 已部署,80% Fortune 500 在生产中运行 active AI agents
  • 可信度:中高(咨询公司,数据需交叉验证)
  • 标签MCP Agent 工具集成 企业落地 协议
  • 后续行动:建议对照 Anthropic 官方博客原始规范;核验 28% Fortune 500 数字来源

8. Agentic AI 框架生产对比 2026(LangGraph / CrewAI / OpenAI Agents SDK)

  • 来源Uvik Software - Agentic AI Frameworks 2026: Production Comparison(2026)
  • 筛选理由:提出框架选择可导致相同模型 + 相同任务相差 30 个百分点的性能差距(引用 Princeton HAL benchmark);明确 cost per successful task / reliability / protocol openness / orchestration overhead 四个选型维度;指出 benchmark 排名与生产排名存在 37% 差距
  • 可信度:高 · 工程团队实践,有引用来源
  • 标签Agent 框架 LangGraph CrewAI 生产评估 benchmark
  • 后续行动:可精读;对照 CLEAR 论文原文中 37% gap 的具体测量方法

9. Agentic RAG 生产指南 2026(8 阶段栈 + 评估指标)

  • 来源MarsDevs - Agentic RAG: The 2026 Production Guide(2026)
  • 筛选理由:给出 2026 默认栈(LangGraph + LlamaIndex Workflows + Ragas + Phoenix + Langfuse)和具体生产目标(faithfulness ≥0.9 / answer relevancy ≥0.85 / context precision ≥0.8);包含成本估算($8K-$50K 构建成本);指出 Agentic RAG 比传统 RAG 贵 3-10x tokens、延迟 2-5x
  • 可信度:中高 · 工程咨询,有量化数字
  • 标签Agentic RAG 生产栈 评估指标 LangGraph
  • 后续行动:数字需对方确认;可与 SyncSoft 的 7 指标体系对照(第 10 条)

10. Agentic RAG 评估 7 指标 2026(生产失败率 90%)

  • 来源SyncSoft AI - Agentic RAG Evaluation 2026: 7 Metrics(2026,作者 Vivia Do,Head of AI Engineering)
  • 筛选理由:提出 90% 企业 agentic RAG 项目在 2026 年生产失败这一警示性数据;给出 7 个核心评估指标体系;与 MarsDevs 指南互补形成完整的"栈+评估"图景
  • Substack 规范记录
  • 专栏:SyncSoft AI Blog(非 Substack,技术博客)
  • 作者:Vivia Do(Head of AI Engineering)
  • 核心观点:评估是暴露 retrieval / generation / tool-call drift 的持续测量层
  • 可信度:中(90% 失败率数字来源不明,需核验)
  • 标签Agentic RAG 评估指标 生产排障
  • 后续行动:90% 数字需核验;可对比 Arize/Phoenix 官方生产报告

❌ 丢弃条目及理由

条目 丢弃理由
Sarthakai Substack - What to Expect from AI Engineering World in 2026 年度预测型文章,无具体命令/代码/性能数据,仅趋势概述
Chip Huyen AI Engineering 书评 × 2 书评/笔记,无原创工程内容
AI Engineer Roadmap 2026(GitHub) 知识图谱/学习路径汇总,无可复现步骤
Shopify AI-First Engineering Culture(Substack) 组织文化案例,工程细节稀薄
End-to-End AI Engineering Bootcamp Notes(Substack) 课程笔记,缺乏原创验证数据
Agent Engineering Notes 欢迎帖(Substack) 元介绍,非具体技术内容
HR Tech and AI Work Notes #10 HR 垂直,非工程实现
多条 RAG/VectorDB 对比文章(AlphaCorp / Firecrawl / Medium) 主要为供应商功能对比表,无真实 benchmark 数据,与 Engineers Guide 条目重复
AI System Design Guide(GitHub) 面试准备框架,非生产工程细节
zero-to-ai / ai-platform-engineering-handbook(GitHub) 课程/笔记本合集,非单一可验证工程输出

分类标签汇总

#LLM-Inference #vLLM #TensorRT-LLM #SGLang #推理优化
#Agent-Memory #Multi-Agent #Memory-Architecture
#RAG #Vector-Database #Production-Eval #Agentic-RAG
#MCP #Model-Context-Protocol #Agent-Tool-Integration
#Agent-Frameworks #LangGraph #LlamaIndex
#Benchmark #Production-Engineering

建议写入路径

草稿 目标路径
vLLM 调优实战(含命令参数) /shared/research-kb/inbox/jay/2026-09-12-vllm-tuning-commands.md
LLM 推理引擎选型决策框架 /shared/research-kb/inbox/jay/2026-09-12-llm-inference-engine-comparison.md
VectorDB 生产 Benchmark 2026 汇总 /shared/research-kb/inbox/jay/2026-09-12-vectordb-benchmark-2026.md
Agent Memory 架构论文分类(Multi-Agent Memory + ByteRover) /shared/research-kb/inbox/jay/2026-09-12-agent-memory-taxonomy.md
MCP 企业落地数据卡 /shared/research-kb/inbox/jay/2026-09-12-mcp-enterprise-adoption.md
Agentic RAG 生产栈 + 评估指标体系 /shared/research-kb/inbox/jay/2026-09-12-agentic-rag-production-stack.md

后续优先级

  1. 精读:第 3 条(Red Hat vLLM 调参)+ 第 8 条(框架对比 37% gap 来源)
  2. 审稿:第 4 条向量数据库 benchmark 的方法论透明度;第 10 条 90% 失败率来源
  3. 主题页更新建议:「LLM 推理引擎选型」和「Agentic RAG 生产评估」两个主题页建议在知识库中置顶
  4. 三角核验:MCP 28% Fortune 500 部署数据建议对照 Gartner / Forrester 2026 报告

Jay · 2026-09-12 · 工程筛选第二轮 · 未执行任何 GitHub 写入