Jay 工程文章筛选报告 · 2026-08-25
主题:LLM 推理引擎 vs Agent Memory vs Vector DB 工程实践 检索范围:arXiv、Tavily Web Search、Substack、技术博客(InfoQ、DEV Community、Medium) 筛选标准:真实环境、命令、错误、源码、性能数据、可复现步骤
✅ 保留条目(高工程价值)
1. Jarvis Labs — "vLLM, SGLang, or TensorRT-LLM? Picking an LLM Serving Stack"
URL: https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
作者/来源: Jarvis Labs (Jaydev Tande)
保留理由:
- 包含真实 TensorRT-LLM 服务启动命令(trtllm-serve serve ./qwen3_30b_trt_engine)
- 包含 SGLang vs vLLM 技术差异分析:RadixAttention(KV cache 共享前缀)vs PagedAttention(KV cache 分页管理)
- 包含 benchmark client 命令及并发参数(--max-concurrency 120~600)
- 明确指出:vLLM = serving-first(通用生产基线),SGLang = orchestration-first(agentic/多轮场景)
工程数据:
- SGLang RadixAttention 在前缀共享场景下,50 并发时 TTFT p50 低 37%、p95 低 41%
- SGLang @ H100 Llama 3.1 8B ≈ 16,200 tokens/s;vLLM ≈ 12,500 tokens/s(29% 差距)
可信度: 高(独立 benchmark,有具体命令)
建议: 精读 —— 推理引擎选型决策树
标签: LLM-Inference vLLM SGLang TensorRT-LLM Benchmark
2. Prem AI — "vLLM vs SGLang vs LMDeploy: Fastest LLM Inference Engine in 2026?"
URL: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
作者/来源: Prem AI Blog
保留理由:
- 完整并发扩展性数据:H200 GPU 64 并发用户下 vLLM TTFT/ITL 表现
- 100 并发 SGLang RadixAttention prefix caching 额外 +10-20% 收益
- LMDeploy TurboMind 架构分析(C++/CUDA,Python interpreter overhead 消除)
- 量化性能对比表(TensorRT-LLM 各精度输出质量、Int4 各引擎对比)
- 月度 GPU 成本换算:29% 吞吐量差 → 约 $15,000/月节省(百万请求/天规模)
- 关键结论:SGLang 最适合多轮/agentic 负载,LMDeploy 最适合量化模型,vLLM 生态最成熟
工程数据: 多个表格(并发扩展、量化精度、成本分析)
可信度: 高(第三方测试,有具体数字)
建议: 精读 —— 推理引擎选型对照表
标签: LLM-Inference vLLM SGLang LMDeploy Benchmark Cost-Analysis
3. The AI Engineer (substack) — "The AI Agents Stack (2026 Edition)"
URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者/来源: Paolo Perrone — The AI Engineer Newsletter(~200K 订阅,AI 工程垂直)
保留理由:
- 引用 LangChain State of Agent Engineering 调研数据:89% 生产 agent 有 observability,但只有 52% 有 evals(37 point gap = 生产质量死亡区)
- 引用 Amazon AWS "Evaluating AI Agents: Real-World Lessons" (Feb 2026)
- MCP 安全数据:MCPTox benchmark — 84.2% tool poisoning 成功率(auto-approval 开时);Endor Labs 分析 2,614 MCP servers:82% path traversal、67% code injection
- 三层 eval 收敛模式:PR fast checks → nightly LLM-judged regression → production drift monitoring
- 新兴 benchmark:Context-Bench(memory)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents)
- OWASP MCP Top 10 (Dec 2025) 安全清单
工程数据: 多个权威来源引用的具体数字
可信度: 高(来源可溯:LangChain survey, Amazon, Endor Labs, OWASP)
建议: 精读 —— Agent 工程质量缺口分析
标签: AI-Agents Eval Observability MCP Security Production
4. AI Thinker Lab — "How to Build RAG Systems in 2026: 8 Architecture Patterns"
URL: https://aithinkerlab.com/build-rag-systems-2026-architecture-patterns
来源: AI Thinker Lab Blog
保留理由:
- May 2026 MLOps Community benchmark(RAG About It):47 生产部署,agentic pipeline + knowledge graph → 幻觉率降低 62%
- June 2026 Carnegie Mellon preprint:9,000 题金融合规数据集,幻觉率 14.1% → 4.9%,延迟 +220ms
- 具体 RAG 架构升级路径:naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG
- GraphRAG 适用条件:跨文档综合;不适用的场景:简单 lookup
- LangChain/LangGraph 1.0 (Oct 2025)、LlamaIndex 定位:数据平面用 LlamaIndex,控制平面用 LangGraph
工程数据: benchmark 数据 + latency 数据 + 架构决策路径
可信度: 高(可溯源:MLOps Community + CMU preprint)
建议: 精读 —— RAG 架构升级决策树
标签: RAG Agentic-RAG GraphRAG Benchmark Hallucination
5. arXiv: "Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU" (arXiv:2604.15464)
URL: https://arxiv.org/html/2604.15464v1
来源: arXiv(Google/Mosaic ML 团队)
保留理由:
- TPU 上 PagedAttention 的生产级替代方案(Ragged Paged Attention, RPA)
- 完整 benchmark 表格:context length 512~32768 各档位的 latency (μs)、throughput (GB/s)、MBU (%)
- 关键数字:Llama 3 8B @ TPU7x,decode 场景 MBU 86%,prefill 场景 MFU 73%
- 三大技术:fine-grained tiling、KV cache update 与 attention 融合、distribution-aware compilation
- 集成状态:vLLM-TPU(2025.02,2-5x token throughput 提升)和 SGLang(2025.10,标准 TPU backend)
工程数据: 完整分 context length 的 latency/throughput/MBU 表格
可信度: 极高(arXiv 论文,vLLM/SGLang 官方集成)
建议: 精读 —— TPU 推理优化细节
标签: LLM-Inference TPU PagedAttention vLLM SGLang arXiv
6. iridium0077/Substack — "AI Agent Memory Design For Production Agents"
URL: https://substack.com/@iridium0077/note/p-196146891
来源: Substack(独立作者,State of AI Agent Memory 2026 报告引用)
保留理由:
- LOCOMO benchmark 具体数据:full-context retrieval = 72.9% accuracy,但 p95 latency = 17.12s,≈ 26,000 tokens/conversation
- 关键推论:17s tail latency = 1/20 用户等待 17s,token 成本是选择性 memory 的 14 倍
- Dec 2025 survey "Memory in the Age of AI Agents":正式将 agent memory 与 RAG/context/LLM memory 区分
- memory 治理要求:每条 memory 需记录 Memory ID/Type/Scope/Creation source/Timestamp/Retrieval confidence/Influence flag
- Claude Opus 4.7 / GPT-5.5(2026.04/04)1M context window 仍内置 file-system memory,说明 memory ≠ context 是行业共识
工程数据: LOCOMO benchmark 数据点
可信度: 高(benchmark 引用)
建议: 精读 —— Agent memory 设计与评估
标签: AI-Agents Memory Benchmark Eval
7. The Nu anced Perspective (substack) — "The AI Agent Stack in 2026"
URL: https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026
作者/来源: Aishwarya Naresh Reganti
保留理由:
- 9 层 agent 架构:Layer 1(Human-Agent Interface)→ Layer 2(Runtimes)→ Layer 3(Protocols)→ Layer 4(Tools)→ Layer 5(Memory)→ Layer 6(Knowledge)→ Layer 7(Models/Routing)→ Layer 8(Observability/Evals)→ Layer 9(Governance/Security)
- 具体协议栈:MCP(tool/resource access)、A2A(agent-to-agent)、AG-UI/A2UI(streaming/shared UI state)
- 具体工具清单:LangSmith、Langfuse、Helicone、Weights & Biases Weave(tracing);Braintrust、Arize、Phoenix、Comet Opik(evals);Promptfoo、DeepEval、Inspect(eval frameworks)
- Gartner Market Guide for AI Evaluation (Feb 2026):2028 年 60% 软件工程团队使用 eval 平台(2025: 18%)
- eval 成熟度判断标准:能在 5 分钟内回答"上次变更让 agent 变好还是变差"
工程数据: Gartner 预测数据、工具清单
可信度: 中高(引 Gartner 报告,工具清单实用)
建议: 精读 —— Agent 架构全景图
标签: AI-Agents Architecture Eval Observability MCP Protocols
8. DEV Community — "What's Changing in Vector Databases in 2026"
URL: https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo
来源: DEV Community(actiandev)
保留理由:
- AI agent 导致查询模式变化:agent 发出 10x 人类查询量(并发性、连续写入)
- pgvector 扩展性边界:PostgreSQL pgvectorscale = 471 QPS vs Qdrant 41 QPS(99% recall,50M 向量),说明数据库整合趋势
- Snowflake + Databricks 2025 年投入约 $12.5 亿收购 PostgreSQL 相关公司
- 向量数据库选型决策:10M 向量/200 QPS → pgvector; billion-scale + sub-50ms → 专用向量 DB
- 向量数据库的 agent-ready 挑战:throughput 优先 vs latency 优先的矛盾
工程数据: QPS 数据、收购金额数据
可信度: 中(社区文章,部分数据可交叉验证)
建议: 参考 —— Vector DB 架构趋势
标签: Vector-DB pgvector Qdrant Architecture Production
9. Analytics Vidhya — "Top 10 Trending AI GitHub Repositories in July 2026"
URL: https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories
来源: Analytics Vidhya
保留理由:
- Colibri(~14.7K stars):纯 C inference engine,零依赖,streaming MoE disk inference,可在消费级硬件(~25GB RAM)运行 744B 参数 GLM-5.2
- Strix(~42K stars):待进一步核实详情
- Codex-memory-MCP(~32K stars):codebase memory 专用 MCP server
- Grok-build(~9.3K stars):xAI Grok 开源构建工具
可信度: 中(汇总类文章,部分 repo 需自行核实)
建议: 参考 —— GitHub Trending 线索
标签: GitHub LLM-Inference MoE MCP
10. The Neural Maze (substack) — "Welcome to The AI Systems Engineer Journey"
URL: https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer
作者/来源: Miguel Otero Pedrido — The Neural Maze
保留理由:
- RAG pipeline 工程形态图:Feature Pipeline(ingest → parse → chunk → embed → write vector DB + keyword index)vs Training Pipeline(prompt engineering + fine-tuning)vs Inference Pipeline(query → rewrite → hybrid retrieve → rerank → prompt build → generate → guardrails → citation → return)
- 关键工程判断:pure semantic search 几乎总是输给 hybrid(dense + BM25)
- 讨论 Token management 挑战(image quality vs context size 的权衡),读者实际生产痛点
工程数据: 架构流程图(定性)
可信度: 中(独立作者,实践经验)
建议: 参考 —— RAG pipeline 工程形态
标签: RAG Architecture Hybrid-Search
❌ 丢弃条目(低工程价值)
| 文章 | 来源 | 丢弃理由 |
|---|---|---|
| "LLMs in 2026: RAG, Multimodality, Agents..." | nat.io | 战略概述,无性能数据,无命令/源码,仅趋势描述 |
| "The Complete MLOps/LLMOps Roadmap for 2026" | Medium | roadmap 类内容,无实测数据,适合学习路径但不适合工程知识库 |
| "LLMOps Engineer Career Guide 2026" | Zedtreeo | 职业指南,工程价值信息少 |
| "AI Engineer Bootcamp 2026" | Udemy | 课程广告,无原创工程内容 |
| "20 Advanced RAG Types to Know in 2026" | TuringPost | 分类概述,缺乏深度数据 |
| "Best Hands-On Resources to Learn AI Engineering" | Firecrawl | 资源列表,无工程原创内容 |
| "AI Agent Architectures" | Cobus Greyling Substack | 三种架构概述,无具体 benchmark 或命令 |
| "The 5 Best AI Newsletters" | Leland | 订阅推荐,非工程内容 |
| "Best AI Agent Newsletters 2026" | TaskifyLabs | 新闻letter 评测,非工程内容 |
| "AI Engineering Tutorials PDF 382 pages" | 资源汇总,无原创数据 | |
| "Top 15 Vector Databases in 2026" | Medium (Pratik) | 来自 100+ 部署经验有参考价值,但 Medium 商业博客特征明显,可信度边际降一档;保留观察 |
📋 本次未写入原因
本次筛选结果以报告形式直接输出,未写入 JSONL 草稿,理由: - 检索源以 Web Search / Tavily 为主,非 arXiv 原始论文或 GitHub 原始代码 - 部分关键数据(如 MLOps Community benchmark)引用链条较长,可信度边际降档 - 建议后续对 SGLang/vLLM 对比做独立的 GitHub README / benchmark 命令实测,再入库
如需写入草稿文件,请告知具体格式偏好(JSONL vs Markdown)。
📊 分类标签统计
| 标签 | 保留数 | 备注 |
|---|---|---|
| LLM-Inference | 5 | vLLM/SGLang/TensorRT-LLM/LMDeploy/TPU |
| AI-Agents | 4 | Stack/Eval/Memory/Security |
| RAG | 3 | Architecture/Benchmark/Hybrid-Search |
| Eval/Observability | 3 | Agent Stack/Memory/LangSmith |
| Vector-DB | 2 | pgvector/Qdrant/Architecture |
| Benchmark | 5 | 含具体数字的 benchmark |
| MCP/Protocols | 2 | MCP/A2A/AG-UI |
| arXiv | 1 | RPA for TPU |
| Cost-Analysis | 1 | GPU 成本换算 |
撰写实例: Jay 撰写时间: 2026-08-25 10:50 UTC 撰写依据: Tavily Web Search(3 轮),Tavily Extract(2 轮) Substack 来源: theaiengineer.substack、Vanishing Gradients、thenuancedperspective.substack、learnaitogethernewsletter.substack、cobusgreyling.substack、theneuralmaze.substack