Jay 工程文章筛选报告 · 2026-08-25

主题:LLM 推理引擎 vs Agent Memory vs Vector DB 工程实践 检索范围:arXiv、Tavily Web Search、Substack、技术博客(InfoQ、DEV Community、Medium) 筛选标准:真实环境、命令、错误、源码、性能数据、可复现步骤


✅ 保留条目(高工程价值)

1. Jarvis Labs — "vLLM, SGLang, or TensorRT-LLM? Picking an LLM Serving Stack"

URL: https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison 作者/来源: Jarvis Labs (Jaydev Tande) 保留理由: - 包含真实 TensorRT-LLM 服务启动命令(trtllm-serve serve ./qwen3_30b_trt_engine) - 包含 SGLang vs vLLM 技术差异分析:RadixAttention(KV cache 共享前缀)vs PagedAttention(KV cache 分页管理) - 包含 benchmark client 命令及并发参数(--max-concurrency 120~600) - 明确指出:vLLM = serving-first(通用生产基线),SGLang = orchestration-first(agentic/多轮场景) 工程数据: - SGLang RadixAttention 在前缀共享场景下,50 并发时 TTFT p50 低 37%、p95 低 41% - SGLang @ H100 Llama 3.1 8B ≈ 16,200 tokens/s;vLLM ≈ 12,500 tokens/s(29% 差距) 可信度: 高(独立 benchmark,有具体命令) 建议: 精读 —— 推理引擎选型决策树 标签: LLM-Inference vLLM SGLang TensorRT-LLM Benchmark


2. Prem AI — "vLLM vs SGLang vs LMDeploy: Fastest LLM Inference Engine in 2026?"

URL: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 作者/来源: Prem AI Blog 保留理由: - 完整并发扩展性数据:H200 GPU 64 并发用户下 vLLM TTFT/ITL 表现 - 100 并发 SGLang RadixAttention prefix caching 额外 +10-20% 收益 - LMDeploy TurboMind 架构分析(C++/CUDA,Python interpreter overhead 消除) - 量化性能对比表(TensorRT-LLM 各精度输出质量、Int4 各引擎对比) - 月度 GPU 成本换算:29% 吞吐量差 → 约 $15,000/月节省(百万请求/天规模) - 关键结论:SGLang 最适合多轮/agentic 负载,LMDeploy 最适合量化模型,vLLM 生态最成熟 工程数据: 多个表格(并发扩展、量化精度、成本分析) 可信度: 高(第三方测试,有具体数字) 建议: 精读 —— 推理引擎选型对照表 标签: LLM-Inference vLLM SGLang LMDeploy Benchmark Cost-Analysis


3. The AI Engineer (substack) — "The AI Agents Stack (2026 Edition)"

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者/来源: Paolo Perrone — The AI Engineer Newsletter(~200K 订阅,AI 工程垂直) 保留理由: - 引用 LangChain State of Agent Engineering 调研数据:89% 生产 agent 有 observability,但只有 52% 有 evals(37 point gap = 生产质量死亡区) - 引用 Amazon AWS "Evaluating AI Agents: Real-World Lessons" (Feb 2026) - MCP 安全数据:MCPTox benchmark — 84.2% tool poisoning 成功率(auto-approval 开时);Endor Labs 分析 2,614 MCP servers:82% path traversal、67% code injection - 三层 eval 收敛模式:PR fast checks → nightly LLM-judged regression → production drift monitoring - 新兴 benchmark:Context-Bench(memory)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents) - OWASP MCP Top 10 (Dec 2025) 安全清单 工程数据: 多个权威来源引用的具体数字 可信度: 高(来源可溯:LangChain survey, Amazon, Endor Labs, OWASP) 建议: 精读 —— Agent 工程质量缺口分析 标签: AI-Agents Eval Observability MCP Security Production


4. AI Thinker Lab — "How to Build RAG Systems in 2026: 8 Architecture Patterns"

URL: https://aithinkerlab.com/build-rag-systems-2026-architecture-patterns 来源: AI Thinker Lab Blog 保留理由: - May 2026 MLOps Community benchmark(RAG About It):47 生产部署,agentic pipeline + knowledge graph → 幻觉率降低 62% - June 2026 Carnegie Mellon preprint:9,000 题金融合规数据集,幻觉率 14.1% → 4.9%,延迟 +220ms - 具体 RAG 架构升级路径:naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG - GraphRAG 适用条件:跨文档综合;不适用的场景:简单 lookup - LangChain/LangGraph 1.0 (Oct 2025)、LlamaIndex 定位:数据平面用 LlamaIndex,控制平面用 LangGraph 工程数据: benchmark 数据 + latency 数据 + 架构决策路径 可信度: 高(可溯源:MLOps Community + CMU preprint) 建议: 精读 —— RAG 架构升级决策树 标签: RAG Agentic-RAG GraphRAG Benchmark Hallucination


5. arXiv: "Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU" (arXiv:2604.15464)

URL: https://arxiv.org/html/2604.15464v1 来源: arXiv(Google/Mosaic ML 团队) 保留理由: - TPU 上 PagedAttention 的生产级替代方案(Ragged Paged Attention, RPA) - 完整 benchmark 表格:context length 512~32768 各档位的 latency (μs)、throughput (GB/s)、MBU (%) - 关键数字:Llama 3 8B @ TPU7x,decode 场景 MBU 86%,prefill 场景 MFU 73% - 三大技术:fine-grained tiling、KV cache update 与 attention 融合、distribution-aware compilation - 集成状态:vLLM-TPU(2025.02,2-5x token throughput 提升)和 SGLang(2025.10,标准 TPU backend) 工程数据: 完整分 context length 的 latency/throughput/MBU 表格 可信度: 极高(arXiv 论文,vLLM/SGLang 官方集成) 建议: 精读 —— TPU 推理优化细节 标签: LLM-Inference TPU PagedAttention vLLM SGLang arXiv


6. iridium0077/Substack — "AI Agent Memory Design For Production Agents"

URL: https://substack.com/@iridium0077/note/p-196146891 来源: Substack(独立作者,State of AI Agent Memory 2026 报告引用) 保留理由: - LOCOMO benchmark 具体数据:full-context retrieval = 72.9% accuracy,但 p95 latency = 17.12s,≈ 26,000 tokens/conversation - 关键推论:17s tail latency = 1/20 用户等待 17s,token 成本是选择性 memory 的 14 倍 - Dec 2025 survey "Memory in the Age of AI Agents":正式将 agent memory 与 RAG/context/LLM memory 区分 - memory 治理要求:每条 memory 需记录 Memory ID/Type/Scope/Creation source/Timestamp/Retrieval confidence/Influence flag - Claude Opus 4.7 / GPT-5.5(2026.04/04)1M context window 仍内置 file-system memory,说明 memory ≠ context 是行业共识 工程数据: LOCOMO benchmark 数据点 可信度: 高(benchmark 引用) 建议: 精读 —— Agent memory 设计与评估 标签: AI-Agents Memory Benchmark Eval


7. The Nu anced Perspective (substack) — "The AI Agent Stack in 2026"

URL: https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026 作者/来源: Aishwarya Naresh Reganti 保留理由: - 9 层 agent 架构:Layer 1(Human-Agent Interface)→ Layer 2(Runtimes)→ Layer 3(Protocols)→ Layer 4(Tools)→ Layer 5(Memory)→ Layer 6(Knowledge)→ Layer 7(Models/Routing)→ Layer 8(Observability/Evals)→ Layer 9(Governance/Security) - 具体协议栈:MCP(tool/resource access)、A2A(agent-to-agent)、AG-UI/A2UI(streaming/shared UI state) - 具体工具清单:LangSmith、Langfuse、Helicone、Weights & Biases Weave(tracing);Braintrust、Arize、Phoenix、Comet Opik(evals);Promptfoo、DeepEval、Inspect(eval frameworks) - Gartner Market Guide for AI Evaluation (Feb 2026):2028 年 60% 软件工程团队使用 eval 平台(2025: 18%) - eval 成熟度判断标准:能在 5 分钟内回答"上次变更让 agent 变好还是变差" 工程数据: Gartner 预测数据、工具清单 可信度: 中高(引 Gartner 报告,工具清单实用) 建议: 精读 —— Agent 架构全景图 标签: AI-Agents Architecture Eval Observability MCP Protocols


8. DEV Community — "What's Changing in Vector Databases in 2026"

URL: https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo 来源: DEV Community(actiandev) 保留理由: - AI agent 导致查询模式变化:agent 发出 10x 人类查询量(并发性、连续写入) - pgvector 扩展性边界:PostgreSQL pgvectorscale = 471 QPS vs Qdrant 41 QPS(99% recall,50M 向量),说明数据库整合趋势 - Snowflake + Databricks 2025 年投入约 $12.5 亿收购 PostgreSQL 相关公司 - 向量数据库选型决策:10M 向量/200 QPS → pgvector; billion-scale + sub-50ms → 专用向量 DB - 向量数据库的 agent-ready 挑战:throughput 优先 vs latency 优先的矛盾 工程数据: QPS 数据、收购金额数据 可信度: 中(社区文章,部分数据可交叉验证) 建议: 参考 —— Vector DB 架构趋势 标签: Vector-DB pgvector Qdrant Architecture Production


URL: https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories 来源: Analytics Vidhya 保留理由: - Colibri(~14.7K stars):纯 C inference engine,零依赖,streaming MoE disk inference,可在消费级硬件(~25GB RAM)运行 744B 参数 GLM-5.2 - Strix(~42K stars):待进一步核实详情 - Codex-memory-MCP(~32K stars):codebase memory 专用 MCP server - Grok-build(~9.3K stars):xAI Grok 开源构建工具 可信度: 中(汇总类文章,部分 repo 需自行核实) 建议: 参考 —— GitHub Trending 线索 标签: GitHub LLM-Inference MoE MCP


10. The Neural Maze (substack) — "Welcome to The AI Systems Engineer Journey"

URL: https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer 作者/来源: Miguel Otero Pedrido — The Neural Maze 保留理由: - RAG pipeline 工程形态图:Feature Pipeline(ingest → parse → chunk → embed → write vector DB + keyword index)vs Training Pipeline(prompt engineering + fine-tuning)vs Inference Pipeline(query → rewrite → hybrid retrieve → rerank → prompt build → generate → guardrails → citation → return) - 关键工程判断:pure semantic search 几乎总是输给 hybrid(dense + BM25) - 讨论 Token management 挑战(image quality vs context size 的权衡),读者实际生产痛点 工程数据: 架构流程图(定性) 可信度: 中(独立作者,实践经验) 建议: 参考 —— RAG pipeline 工程形态 标签: RAG Architecture Hybrid-Search


❌ 丢弃条目(低工程价值)

文章 来源 丢弃理由
"LLMs in 2026: RAG, Multimodality, Agents..." nat.io 战略概述,无性能数据,无命令/源码,仅趋势描述
"The Complete MLOps/LLMOps Roadmap for 2026" Medium roadmap 类内容,无实测数据,适合学习路径但不适合工程知识库
"LLMOps Engineer Career Guide 2026" Zedtreeo 职业指南,工程价值信息少
"AI Engineer Bootcamp 2026" Udemy 课程广告,无原创工程内容
"20 Advanced RAG Types to Know in 2026" TuringPost 分类概述,缺乏深度数据
"Best Hands-On Resources to Learn AI Engineering" Firecrawl 资源列表,无工程原创内容
"AI Agent Architectures" Cobus Greyling Substack 三种架构概述,无具体 benchmark 或命令
"The 5 Best AI Newsletters" Leland 订阅推荐,非工程内容
"Best AI Agent Newsletters 2026" TaskifyLabs 新闻letter 评测,非工程内容
"AI Engineering Tutorials PDF 382 pages" LinkedIn 资源汇总,无原创数据
"Top 15 Vector Databases in 2026" Medium (Pratik) 来自 100+ 部署经验有参考价值,但 Medium 商业博客特征明显,可信度边际降一档;保留观察

📋 本次未写入原因

本次筛选结果以报告形式直接输出,未写入 JSONL 草稿,理由: - 检索源以 Web Search / Tavily 为主,非 arXiv 原始论文或 GitHub 原始代码 - 部分关键数据(如 MLOps Community benchmark)引用链条较长,可信度边际降档 - 建议后续对 SGLang/vLLM 对比做独立的 GitHub README / benchmark 命令实测,再入库

如需写入草稿文件,请告知具体格式偏好(JSONL vs Markdown)。


📊 分类标签统计

标签 保留数 备注
LLM-Inference 5 vLLM/SGLang/TensorRT-LLM/LMDeploy/TPU
AI-Agents 4 Stack/Eval/Memory/Security
RAG 3 Architecture/Benchmark/Hybrid-Search
Eval/Observability 3 Agent Stack/Memory/LangSmith
Vector-DB 2 pgvector/Qdrant/Architecture
Benchmark 5 含具体数字的 benchmark
MCP/Protocols 2 MCP/A2A/AG-UI
arXiv 1 RPA for TPU
Cost-Analysis 1 GPU 成本换算

撰写实例: Jay 撰写时间: 2026-08-25 10:50 UTC 撰写依据: Tavily Web Search(3 轮),Tavily Extract(2 轮) Substack 来源: theaiengineer.substack、Vanishing Gradients、thenuancedperspective.substack、learnaitogethernewsletter.substack、cobusgreyling.substack、theneuralmaze.substack