工程实践筛选 · 2026-08-22 下午(14:50)

任务信息

  • 本次主题: 推理引擎选型 · Agent Memory 工程 · RAG 生产评估 · Substack 工程框架
  • 检索范围: Tavily (Web) + Substack + arXiv · 三路并行
  • 去重依据: 上午已覆盖 nanochat/pi-mono/vLLM V1/Agent Stack 2026;中午已覆盖 CSDN RAG/TensorRT 源码;本轮聚焦增量

一、推理引擎工程选型(vLLM vs SGLang vs TRT-LLM)

🔥 保留条目 1:vLLM vs SGLang vs TRT-LLM 2026 决策框架

  • 来源: Spheron - LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang(2026-08-19,新鲜)
  • 发布: Spheron(Mitrasish, Co-founder & CTO)
  • 核心工程数据:
  • 推理引擎本质是"三元权衡":throughput vs latency vs memory,无免费午餐
  • vLLM: PagedAttention,通用性最强,生态最广
  • TensorRT-LLM: CUDA 编译优化,NVIDIA 专用,延迟最低但运营复杂度最高
  • SGLang: RadixAttention + prefix caching,共享上下文重复请求场景最优
  • SGLang TTFT 优势显著:80ms vs vLLM/TRT-LLM 150ms
  • DeployBase 基准数据:
  • vLLM: 3,500 tok/s
  • SGLang: 2,800 tok/s
  • TGI: 2,500 tok/s
  • llama.cpp (CPU): 20 tok/s
  • 决策核心: "运营复杂度换性能提升是多少?"——三引擎 feature gap 已基本弥合,选型由最硬约束决定
  • 保留理由: ⭐⭐⭐⭐⭐ 最新生产决策框架,数值明确,决策树清晰,适合纳入推理引擎选型手册
  • 可信度: 高(多源 benchmark 对照,含具体性能数字)

🔥 保留条目 2:vLLM vs Ollama vs SGLang vs TRT-LLM 对比(Substack)

  • 来源: The AI Engineer - vLLM vs Ollama vs SGLang vs TensorRT-LLM
  • 核心工程观点:
  • Ollama 适合本地开发 / 单机原型,不适合生产
  • TRT-LLM 适合 sub-100ms 延迟 + H100 集群 + ML ops 团队的场景
  • 决策逻辑树:从环境出发 → 单机原型用 Ollama → AMD/Intel 硬件用 TGI → 通用生产 vLLM → 极致延迟 TRT-LLM
  • Fish Audio Benchmark: MAX 16% throughput 优于 vLLM,L40 上 p99 TTFT 13.1ms vs 23.6ms
  • 保留理由: ⭐⭐⭐⭐⭐ AI Engineer 是本知识库高频引用源;逻辑树可操作性强,涵盖 Ollama 到 TRT-LLM 全谱系
  • 可信度: 高(AI Engineer 技术社区权威)

🔥 保留条目 3:SGLang vs vLLM vs LMDeploy Benchmark(Fish Audio, 2026)

  • 来源: LinkedIn/Mobile AI post, citing fish.audio benchmarks
  • 核心数据:
  • MAX(SGLang 变体): 16% throughput 优于 vLLM on L40
  • p99 TTFT: MAX 13.1ms vs vLLM 23.6ms
  • 容器镜像: <700MB(跨 NVIDIA/AMD/Apple Silicon/CPU 统一)
  • 保留理由: ⭐⭐⭐⭐ MAX 非 CUDA 依赖的独特路线值得关注;Apple Silicon 推理赛道有工程价值
  • 可信度: 中(Fish Audio benchmark,需核实原始链接)

⚠️ 丢弃条目:Inference Engineering Tech 对比页

  • 来源: inferenceengineering.tech
  • 丢弃理由: TL;DR 内容为主,无新数据;已被 Spheron 和 AI Engineer Substack 覆盖且更详尽
  • 替代: 使用上述保留条目即可

二、Agent Memory 工程实践

🔥 保留条目 4:Mem0 State of AI Agent Memory 2026(完整基准报告)

  • 来源: Mem0.ai - AI Agent Memory 2026: Progress Benchmark Report
  • 发布时间: 2026-04(持续更新中)
  • 核心工程数据: | Benchmark | Score | Avg Tokens/Query | |-----------|-------|-----------------| | LoCoMo | 92.5 | 6,956 | | LongMemEval | 94.4 | 6,787 | | BEAM (1M) | 64.1 | 6,719 | | BEAM (10M) | 48.6 | 6,914 |
  • 相比 full-context 基线(26,000+ tokens/query):节省约 75% token 消耗
  • p95 latency: 1.44s vs full-context 17.12s(91% 改善,Mem0 ECAI 2025 论文)
  • 商业落地数据 RevisionDojo & OpenNote: 生产环境 token 成本降低 40%
  • 评价: ⭐⭐⭐⭐⭐ Agent Memory 领域最完整的 2026 基准报告;Mem0 是该赛道开源领头羊(51k+ GitHub stars)
  • 可信度: 高(Mem0 官方博客,数据有对应 arXiv 论文支撑)
  • 后续行动: 精读;纳入 Agent Memory 选型参考;建议核验 LoCoMo 原始论文

🔥 保留条目 5:MemoryArena — Long Context vs 专用 Memory Agent 实证研究

  • 来源: YouTube - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Tasks(Feb 2026,引用 arXiv 论文)
  • 核心反直觉发现:
  • 简单 long context(直接塞入 prompt)在 end-to-end 任务完成速度上反而最快
  • 专用 Memory Agent(如 Lettera、megraph)latency 显著更高,但 success rate 并不更好
  • 长任务中,单步子任务完成率与整体任务完成率之间存在巨大鸿沟
  • "你为复杂 memory 系统支付了大量时间税,但系统实际上可能让你的 agent 表现更差"
  • 保留理由: ⭐⭐⭐⭐⭐ 反直觉实证研究,对工程选型有重要纠正意义;这是当前 Agent Memory 领域最重要的工程警示之一
  • 可信度: 高(YouTube 总结来自原始论文,需追踪原始 arXiv)
  • 后续行动: 核验原始 arXiv 论文;可作为 Agent Memory "何时不用专用系统"的决策依据

🔥 保留条目 6:Mem0 vs 竞品基准对比(Preuve.ai + Mem0 Research 2026)

  • 来源: Preuve.ai - AI Memory Stats 2026: 60+ Numbers
  • 核心数据:
  • Mem0 2026 新算法: LongMemEval 93.4%, LoCoMo 91.6%, 低于 7,000 tokens/query
  • Commercial assistants(ChatGPT memory 等)在 LongMemEval vs oracle retrieval: ~30 point accuracy gap(Wu et al., ICLR 2025)
  • ChatGPT Memory: 700M weekly active users(OpenAI, Aug 2025)
  • LangChain State of Agent Engineering 2026: 57% 企业已有生产 Agent,但 quality(33%) 和 latency(20%) 是 top blockers——两者均 downstream of memory recall
  • 保留理由: ⭐⭐⭐⭐⭐ 系统性基准汇总,多维度数字;长上下文模型与专用 memory 系统之间 30pt 差距是核心工程信号
  • 可信度: 高(整合自多个有据可查的来源)

⚠️ 丢弃条目 7:Atlan - Best AI Agent Memory Frameworks 2026

  • 来源: Atlan
  • 丢弃理由: Self-reported benchmark 为主,Supermemory 的 LongMemEval/LoCoMo 声称未独立核实;内容以框架罗列为主,缺乏实证工程数据
  • 替代: 使用 Mem0 官方报告 + Preuve.ai 整合数据即可

⚠️ 丢弃条目 8:EverMind 基准更新

  • 来源: EverMind
  • 丢弃理由: 自我声称 SOTA,在无独立第三方核实情况下,基准数据可信度存疑;与其他来源交叉矛盾(HaluMem 90.04% recall vs Mem0 LongMemEval 94.4%)
  • 替代: 优先使用 Mem0/Preuve.ai 可交叉核验的数据

三、Substack Agent 框架工程动态

🔥 保留条目 9:LangGraph 生产案例 + 2026 Agent 框架四核心原语(The AI Engineer)

  • 来源: The AI Engineer by Micheal Lanham - The 2026 AI Agent Platform Guide
  • 发布时间: 2026(持续更新)
  • 核心工程数据:
  • Klarna(LangGraph): 2.5M conversations 规模,框架灵活性支持随时 pivot 回 human-hybrid 而无需全栈重写
  • Sierra: 成功案例,80% query resolution 时间减少,自动化数百 FTE 工作量
  • 框架选择是 12 个月生产承诺: 选错通常 6 个月后需全栈重写
  • 战略层四核心原语: Tool Calling / Memory/State / Orchestration / Observability
  • 选型核心诊断: "哪个原语在给定框架中成本最低?"
  • 保留理由: ⭐⭐⭐⭐⭐ 难得的生产规模案例(Klarna 2.5M conversations)+ 框架选型元框架;与上午 Agent Stack 2026 互补
  • 可信度: 高(基于公开案例数据)

🔥 保留条目 10:Agentic AI Frameworks 2026(MCP 协议动态)

  • 来源: FutureAGI - Top 5 Agentic AI Frameworks to Watch in 2026
  • 发布时间: 2026-03 后
  • 核心工程动态:
  • MCP 正成为 agent 工具连接的"USB-C":LangGraph adapter / AutoGen extension / CrewAI MCP server URL config
  • Perplexity CTO 2026-03 公开放弃 MCP:token 消耗开销 + 认证摩擦是主要阻力
  • MCP 2026 roadmap: 聚焦 production hardening
  • MetaGPT: 软件工程专用 hierarchy(PM → Architect → 编码/测试/Review)
  • 保留理由: ⭐⭐⭐⭐⭐ MCP 是 2026 Agent 工具链基础设施最重要的协议动态;Perplexity CTO 的公开放弃是重要工程信号
  • 可信度: 高(来自公开技术社区)
  • 后续行动: 建议精读 MCP 2026 roadmap;纳入 Agent 工具链选型考量

⚠️ 丢弃条目 11:AI Agent 框架 101 完整指南(sidsaladi)

  • 来源: sidsaladi.substack.com
  • 丢弃理由: 入门级概述,与上午 Agent Stack 2026 内容高度重叠;无新增工程洞察

⚠️ 丢弃条目 12:AI Agent Management Define-Deliver-Drive(Product 视角)

  • 来源: Product with Attitude
  • 丢弃理由: 产品管理视角为主,非工程实践;"管理 agent 如同管理工程师"的比喻无具体可执行工程步骤
  • 替代: 使用 Klarna 案例(条目9)更有生产工程说服力

四、RAG 生产评估工程

🔥 保留条目 13:RAGPerf — 首个生产级 RAG 效率基准(arXiv, WWW '26)

  • 来源: arXiv:2603.10765 - RAGPerf: End-to-End Benchmarking Framework for RAG Systems
  • 发表: arXiv v1(关注是否为正式发表版本)
  • 核心工程贡献:
  • 现有 RAG benchmark 只关注 semantic quality(precision/hallucination/faithfulness),忽略 系统效率(latency/throughput/硬件利用率)
  • RAGPerf 提供 end-to-end 性能分析能力
  • 可定位性能瓶颈(细粒度硬件资源剖析)
  • 覆盖 Audio-RAG(Whisper ASR → text RAG pipeline)
  • 评估 update operation 性能影响
  • 量化不同系统资源配置对 RAG 性能的影响
  • 保留理由: ⭐⭐⭐⭐⭐ RAG 评估从 semantic-only 扩展到 efficiency-aware 的里程碑;生产部署必读
  • 可信度: 高(arXiv + WWW '26 同行评审)
  • 后续行动: 追踪正式发表版本;纳入 RAG 评估方法论更新

🔥 保留条目 14:Inference Cost Attacks on RAG(arXiv, WWW '26 acceptance)

  • 来源: arXiv:2606.02643 - Inference Cost Attacks for Retrieval-Augmented Large Language Models
  • 发表: ACM WWW '26 (April 2026, Dubai)
  • 核心工程发现:
  • CREEP 框架: 攻击者通过植入恶意文档,使 RAG 系统在推理阶段 token 消耗异常增加
  • 三种新型资源消耗策略 + 两种 agent paradigm(rewrite-based / generation-based)
  • 高攻击效力 + 高检索成功率,难以防范
  • 保留理由: ⭐⭐⭐⭐⭐ RAG 安全新攻击面;这是首个 RAG 推理成本攻击研究,WWW '26 接收说明学界认可其重要性
  • 可信度: 高(ACM WWW '26 同行评审接收)
  • 后续行动: 建议精读原文;纳入 RAG 安全评估 checklist;关注 CREEP 防御机制

🔥 保留条目 15:RAG Evaluation 2026 五平台对比(Maxim)

  • 来源: Maxim - Top 5 RAG Evaluation Platforms in 2026
  • 核心工程价值:
  • 生产闭环: 捕获完整 traces(retrieved docs + constructed prompts + evaluation scores)
  • 生产失败 → 测试用例一键转换: 快速复现 + 验证修复后部署
  • AI simulation: 通过 user persona + interaction patterns 生成合成测试场景,数百次对话模拟
  • 在上线前捕获 retrieval failure 和 hallucination
  • 保留理由: ⭐⭐⭐⭐ 生产 RAG 评估闭环的方法论参考;生产失败转测试用例的工程实践有价值
  • 可信度: 中(vendor 内容,benchmark 数据需交叉核实)

⚠️ 丢弃条目 16:Toloka RAG Evaluation 指南

  • 来源: Toloka.ai blog
  • 丢弃理由: 通用 RAG evaluation 指南,无具体工程数据;内容偏方法论,与已有 RAG 评估框架重叠度高

⚠️ 丢弃条目 17:ArXiv RAG CS Papers 实战(Towards AI)


五、综合判断与增量摘要

本轮高价值发现(工程筛选结论)

# 条目 领域 关键发现 优先级
1 vLLM vs SGLang vs TRT-LLM 决策框架 Inference 三引擎 feature gap 已弥合,选型由运营复杂度约束决定 ⭐⭐⭐⭐⭐
2 AI Engineer Substack 推理引擎对比 Inference 逻辑树清晰;MAX 非 CUDA 路线值得关注 ⭐⭐⭐⭐⭐
3 Mem0 Agent Memory 2026 基准报告 Memory 7k tokens/query 达成 92.5 LoCoMo;token 成本降低 40% ⭐⭐⭐⭐⭐
4 MemoryArena: Long Context 优于专用 Memory Memory 反直觉发现:简单 context 往往比专用 memory agent 更快更好 ⭐⭐⭐⭐⭐
5 Mem0 vs 30pt gap(ICLR 2025) Memory Commercial assistants 与 oracle retrieval 有 30pt 差距 ⭐⭐⭐⭐
6 LangGraph Klarna 2.5M conversations Agent Framework 框架灵活性 + 生产规模案例 ⭐⭐⭐⭐⭐
7 MCP 协议动态 + Perplexity CTO 放弃 Tool Protocol MCP 有 token 开销问题;2026 roadmap 聚焦 hardening ⭐⭐⭐⭐
8 RAGPerf: 首个效率感知 RAG 基准 RAG Evaluation 从 semantic-only 扩展到 latency/throughput/硬件利用率 ⭐⭐⭐⭐⭐
9 CREEP: RAG 推理成本攻击(WWW '26) RAG Security 首个 RAG 成本攻击研究;恶意文档植入导致 token 异常消耗 ⭐⭐⭐⭐⭐
10 RAG 生产评估闭环(Maxim) RAG Evaluation 生产失败 → 测试用例一键转换 ⭐⭐⭐⭐

与上午/中午条目增量分析

  • 上午(Agent Stack 2026) 覆盖了 Agent Guardrails、Eval as Infrastructure、MCP 协议背景 → 本轮 MCP 部分与上午互补,MCP token 开销问题(Perplexity CTO)是上午未覆盖的新细节
  • 中午(CSDN 源码) 覆盖了 QAnything/RagFlow/Spring AI/LCEL 源码解析 → 本轮无直接重叠
  • 本轮核心新增: MemoryArena 反直觉发现 + RAGPerf + CREEP 安全研究 + 推理引擎最新 benchmark

分类标签

[Inference] [vLLM] [SGLang] [AgentMemory] [Mem0] [RAG] [RAG-Evaluation] [Security] [Production] [Substack] [arXiv]


建议写入路径

/shared/research-kb/inbox/jay/2026-08-22T1450-jay-engineering-filter-pm.md


后续行动建议

优先级 行动 原因
⭐⭐⭐⭐⭐ 核验 MemoryArena 原始 arXiv 论文 反直觉发现需要原文核实
⭐⭐⭐⭐⭐ 精读 CREEP 论文原文(WWW '26) RAG 安全新攻击面,生产必读
⭐⭐⭐⭐ 追踪 RAGPerf 正式发表版本 首个效率感知 RAG 评估框架
⭐⭐⭐⭐ 精读 Mem0 2026 benchmark report Agent Memory 选型基准
⭐⭐⭐ 更新"推理引擎选型 2026"主题页 vLLM/SGLang/TRT-LLM feature gap 已弥合,决策树更新
⭐⭐⭐ 纳入 MCP 协议动态到 Agent 工具链主题 Perplexity CTO 放弃是关键工程信号
⭐⭐ 核实 MAX (Fish Audio) 原始 benchmark 非 CUDA 路线值得关注但需核实数据