Jay 工程文章筛选报告 · 2026-09-12
本次主题
AI/ML 工程实践高频筛选 · LLM 推理优化 · Agent Memory · RAG 生产评估 · MCP 协议
检索范围
arXiv / GitHub / Substack / 技术博客 / Hugging Face,2026 年 9 月近期条目
✅ 保留条目(高工程价值)
1. vLLM 推理优化 5 种实战方法
- 来源:JarvisLabs - vLLM Optimization Techniques(2026-02-06)
- 筛选理由:包含 5 种具体优化技术的实战讲解,有明确分类(Prefix Caching / FP8 KV-Cache / CPU Offloading / P/D Disaggregation / Zero Reload Sleep Mode),非泛泛概述
- 可信度:高 · 工程博客,数据明确
- 标签:
vLLM推理优化PagedAttentionKV-Cache - 后续行动:可精读原文,对照 vLLM 官方文档核验参数
2. LLM 推理三引擎决策框架(vLLM vs TensorRT-LLM vs SGLang)
- 来源:Spheron - LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026)(2026-08-19)
- 筛选理由:三引擎横向对比框架,明确吞吐量/延迟/memory 的 trade-off 决策树,非 benchmark 跑分表,有生产选型逻辑
- 可信度:高 · CTO 主笔,有量化指标
- 标签:
推理引擎vLLMTensorRT-LLMSGLang生产架构 - 后续行动:可作团队内部分享参考;后续需核验原文对 SGLang RadixAttention vs PagedAttention 的描述细节
3. Red Hat Developer: vLLM 性能调优实战策略
- 来源:Red Hat Developers - Practical strategies for vLLM performance tuning(2026-03-03)
- 筛选理由:包含真实参数(
--max-num-seqs、--kv-cache-dtype=fp8)和系统性调优步骤,从 baseline 建立到 SLO 验证的闭环,有 Red Hat 工程背书 - 可信度:高 · 明确命令行参数,有调优方法论
- 标签:
vLLM性能调优生产运维SLO - 后续行动:建议直接写入知识库「vLLM 生产运维」主题页
4. 生产 RAG 向量数据库 Benchmark(10M 向量,2026)
- 来源:Engineers Guide Substack - Best vector databases for production RAG in 2026(2026-02-06,作者 Joe Sack)
- 筛选理由:严格按 10M 向量 / 1536-3072d / 过滤搜索 / 混合搜索 / P99 并发延迟评估,有方法论说明(不同于厂商优化过的通用数据集),给出了 pgvector / Pinecone / Milvus / Qdrant / Elasticsearch 的生产选型建议
- Substack 规范记录:
- 专栏:Engineers Guide
- 作者:Joe Sack
- 链接:上见
- 核心观点:pgvector 适合 <5-10M 向量 MVP;Pinecone 适合低运维 serverless 生产;Qdrant 适合复杂过滤/边缘部署
- 可信度:高(方法论透明,非厂商赞助)
- 标签:
向量数据库RAGbenchmark生产评估 - 后续行动:需进一步核验 benchmark 原始数据;可参考 Tensoria/AlphaCorp AI 同类对比做三角验证
5. 多智能体记忆的计算机架构视角(arXiv 2026)
- 来源:arXiv:2603.10062 - Multi-Agent Memory from a Computer Architecture Perspective
- 筛选理由:将多智能体记忆问题类比计算机架构,提出三层记忆层次(I/O、Cache、Memory),识别出两个关键协议缺口(缓存共享和访问控制),是少见的高层次系统框架文章
- 可信度:高 · arXiv 学术文章,有完整分类学
- 标签:
多智能体记忆架构系统设计论文 - 后续行动:值得精读;建议对照 MemGPT / MAGMA 等实现系统做案例补充
6. ByteRover: Agent 原生记忆层级架构(arXiv 2026)
- 来源:arXiv:2604.01599 - ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context
- 筛选理由:对现有记忆系统(Lightweight Semantic / Graph-structured / Hierarchical / Entity-centric)做分类梳理,基于 LongMemEval-S 基准提供量化对比,是当前较完整的 Agent 记忆分类学
- 可信度:高 · arXiv,有评测基准
- 标签:
Agent 记忆层级架构评测基准论文 - 后续行动:与第 5 条互补,建议合并阅读;后续核验 LongMemEval-S 基准的公开性
7. MCP 2026-07-28 规范 + 企业采用数据
- 来源:Model Context Protocol Blog - 2026-07-28 Specification + Synvestable - MCP Enterprise Adoption Guide(2026-04 更新)
- 筛选理由:MCP 已成 agent 工具集成实施层面核心协议。2026-07-28 规范转向无状态模型,是重大架构变化;Fortune 500 28% 已部署,97M SDK 月下载量,有量化数据支撑
- Substack 规范记录(Synvestable):
- 专栏:Synvestable(技术咨询)
- 作者:Synvestable Team
- 核心观点:MCP 正成为企业级 agent 工具集成实施标准,28% Fortune 500 已部署,80% Fortune 500 在生产中运行 active AI agents
- 可信度:中高(咨询公司,数据需交叉验证)
- 标签:
MCPAgent 工具集成企业落地协议 - 后续行动:建议对照 Anthropic 官方博客原始规范;核验 28% Fortune 500 数字来源
8. Agentic AI 框架生产对比 2026(LangGraph / CrewAI / OpenAI Agents SDK)
- 来源:Uvik Software - Agentic AI Frameworks 2026: Production Comparison(2026)
- 筛选理由:提出框架选择可导致相同模型 + 相同任务相差 30 个百分点的性能差距(引用 Princeton HAL benchmark);明确 cost per successful task / reliability / protocol openness / orchestration overhead 四个选型维度;指出 benchmark 排名与生产排名存在 37% 差距
- 可信度:高 · 工程团队实践,有引用来源
- 标签:
Agent 框架LangGraphCrewAI生产评估benchmark - 后续行动:可精读;对照 CLEAR 论文原文中 37% gap 的具体测量方法
9. Agentic RAG 生产指南 2026(8 阶段栈 + 评估指标)
- 来源:MarsDevs - Agentic RAG: The 2026 Production Guide(2026)
- 筛选理由:给出 2026 默认栈(LangGraph + LlamaIndex Workflows + Ragas + Phoenix + Langfuse)和具体生产目标(faithfulness ≥0.9 / answer relevancy ≥0.85 / context precision ≥0.8);包含成本估算($8K-$50K 构建成本);指出 Agentic RAG 比传统 RAG 贵 3-10x tokens、延迟 2-5x
- 可信度:中高 · 工程咨询,有量化数字
- 标签:
Agentic RAG生产栈评估指标LangGraph - 后续行动:数字需对方确认;可与 SyncSoft 的 7 指标体系对照(第 10 条)
10. Agentic RAG 评估 7 指标 2026(生产失败率 90%)
- 来源:SyncSoft AI - Agentic RAG Evaluation 2026: 7 Metrics(2026,作者 Vivia Do,Head of AI Engineering)
- 筛选理由:提出 90% 企业 agentic RAG 项目在 2026 年生产失败这一警示性数据;给出 7 个核心评估指标体系;与 MarsDevs 指南互补形成完整的"栈+评估"图景
- Substack 规范记录:
- 专栏:SyncSoft AI Blog(非 Substack,技术博客)
- 作者:Vivia Do(Head of AI Engineering)
- 核心观点:评估是暴露 retrieval / generation / tool-call drift 的持续测量层
- 可信度:中(90% 失败率数字来源不明,需核验)
- 标签:
Agentic RAG评估指标生产排障 - 后续行动:90% 数字需核验;可对比 Arize/Phoenix 官方生产报告
❌ 丢弃条目及理由
| 条目 | 丢弃理由 |
|---|---|
| Sarthakai Substack - What to Expect from AI Engineering World in 2026 | 年度预测型文章,无具体命令/代码/性能数据,仅趋势概述 |
| Chip Huyen AI Engineering 书评 × 2 | 书评/笔记,无原创工程内容 |
| AI Engineer Roadmap 2026(GitHub) | 知识图谱/学习路径汇总,无可复现步骤 |
| Shopify AI-First Engineering Culture(Substack) | 组织文化案例,工程细节稀薄 |
| End-to-End AI Engineering Bootcamp Notes(Substack) | 课程笔记,缺乏原创验证数据 |
| Agent Engineering Notes 欢迎帖(Substack) | 元介绍,非具体技术内容 |
| HR Tech and AI Work Notes #10 | HR 垂直,非工程实现 |
| 多条 RAG/VectorDB 对比文章(AlphaCorp / Firecrawl / Medium) | 主要为供应商功能对比表,无真实 benchmark 数据,与 Engineers Guide 条目重复 |
| AI System Design Guide(GitHub) | 面试准备框架,非生产工程细节 |
| zero-to-ai / ai-platform-engineering-handbook(GitHub) | 课程/笔记本合集,非单一可验证工程输出 |
分类标签汇总
#LLM-Inference #vLLM #TensorRT-LLM #SGLang #推理优化
#Agent-Memory #Multi-Agent #Memory-Architecture
#RAG #Vector-Database #Production-Eval #Agentic-RAG
#MCP #Model-Context-Protocol #Agent-Tool-Integration
#Agent-Frameworks #LangGraph #LlamaIndex
#Benchmark #Production-Engineering
建议写入路径
| 草稿 | 目标路径 |
|---|---|
| vLLM 调优实战(含命令参数) | /shared/research-kb/inbox/jay/2026-09-12-vllm-tuning-commands.md |
| LLM 推理引擎选型决策框架 | /shared/research-kb/inbox/jay/2026-09-12-llm-inference-engine-comparison.md |
| VectorDB 生产 Benchmark 2026 汇总 | /shared/research-kb/inbox/jay/2026-09-12-vectordb-benchmark-2026.md |
| Agent Memory 架构论文分类(Multi-Agent Memory + ByteRover) | /shared/research-kb/inbox/jay/2026-09-12-agent-memory-taxonomy.md |
| MCP 企业落地数据卡 | /shared/research-kb/inbox/jay/2026-09-12-mcp-enterprise-adoption.md |
| Agentic RAG 生产栈 + 评估指标体系 | /shared/research-kb/inbox/jay/2026-09-12-agentic-rag-production-stack.md |
后续优先级
- 精读:第 3 条(Red Hat vLLM 调参)+ 第 8 条(框架对比 37% gap 来源)
- 审稿:第 4 条向量数据库 benchmark 的方法论透明度;第 10 条 90% 失败率来源
- 主题页更新建议:「LLM 推理引擎选型」和「Agentic RAG 生产评估」两个主题页建议在知识库中置顶
- 三角核验:MCP 28% Fortune 500 部署数据建议对照 Gartner / Forrester 2026 报告
Jay · 2026-09-12 · 工程筛选第二轮 · 未执行任何 GitHub 写入