Jay 工程实践二次筛选草稿 | 2026-10-05

实例: Jay | 时间: 2026-10-05 14:50 CST
筛选范围: tavily 搜索(LLM inference serving / LangGraph CrewAI / RAG evaluation / MCP / LLM eval frameworks),月度范围内


一、本次检索概览

查询 来源类型 命中数
vLLM vs TGI benchmark, inference systems arXiv + 工程博客 15
LangGraph CrewAI multi-agent architecture 工程博客 + Substack 15
RAG reranking evaluation benchmark arXiv + Splunk blog 15
MCP Model Context Protocol 2026 工程博客 + ACM 10
LLM evaluation RAGAS DeepEval production 工程博客 10

二、高价值条目(含源码/性能数据/可复现步骤)


✅ 条目 1:vLLM vs TGI Benchmark — 具体吞吐量数字

来源: cloudai.pt (引用 arXiv:2511.17593, 2025年11月)
URL: https://cloudai.pt/vllm-vs-tgi-benchmarks-throughput-numbers-that-matter
类型: 工程博客 + 学术论文引用

保留理由:
- 性能数据具体: vLLM 在 LLaMA-2-7B 上,100并发请求时吞吐量是 TGI 的 3.67 倍,极端负载下扩大到 24 倍
- 工程结论清晰: "throughput-bound serving 选 vLLM;TGI 在 median TTFT 上仍有优势,适用于 chat 界面"
- 上游论文可查: arXiv:2511.17593,有原始实验设计

工程价值: 直接可用的推理引擎选型参考,有具体 benchmark 数字支撑

建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-inference-engine-benchmark-vllm-tgi.md

可信度判断: 高——引用可查的 arXiv 论文,非营销内容


✅ 条目 2:From Inference Engine to Inference Control Plane — arXiv:2609.23130

来源: arXiv (2026年9月19日提交)
URL: https://arxiv.org/html/2609.23130v1
类型: 系统综述论文

保留理由(具体数据):

实验 数据
llm-d vs K8s round-robin 14.2k vs 9.6k tokens/s;TTFT 6.8s vs 36.4s
vLLM-Mooncake Cache hit 1.7%→92.2%;throughput 3.8x;P50 TTFT 降低 46 倍
RaidServe 故障恢复 2x 吞吐,两数量级更快恢复
AWS P/D study (B200) 比标准 vLLM 基线高 70% tokens/s
  • 提出了 SLO-goodput 评估框架
  • 包含 benchmark atlas 和瓶颈迁移分类
  • 覆盖 vLLM、llm-d、vLLM-Mooncake 多系统对比

工程价值: 高——具体性能数字、部署建议、评估框架,可作为推理架构选型依据

建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-inference-control-plane-arxiv2609-23130.md

可信度判断: 高——arXiv 学术论文,数据翔实,有原始来源标注


✅ 条目 3:Token Latency Fairness — arXiv:2609.18112

来源: alphaXiv / arXiv (2026年9月16日提交, UC Berkeley)
URL: https://www.alphaxiv.org/abs/2609.18112
类型: 学术论文

保留理由(具体数据): - FairInference vs VTC vs SGLang:well-behaved 吞吐量 74-75 tokens/s(FairInference)vs 58(VTC)vs 53(DLPM)vs 44(SGLang) - 5秒延迟预算下:high-demand client 达到 1187 tokens/s vs 786(static partitioning) - 对齐 SLO 约束下 token-level 延迟隔离的工程问题

工程价值: 多租户 LLM serving 的性能隔离具体数字,适合 SRE/平台工程参考

可信度判断: 高——UC Berkeley 学术工作,具体数值可复现


✅ 条目 4:Re-ranking and Late Interaction — arXiv:2609.38473 (2026年9月29日)

来源: arXiv
URL: https://arxiv.org/html/2609.38473v1
类型: 受控实验论文(RAG 策略对比)

保留理由: - 6 种检索管道在受控环境下的对比 - 数据集: 从 arXiv 论文生成合成科学 QA 数据集,可复现 - 评估方法: LLM-as-judge + retrieval-oriented metrics(RAGAS 类指标) - 使用 Chroma 向量库,文档格式规范(Title/Abstract/Categories)

工程价值: 中高——具体 RAG 策略对比实验设计,适合 RAG pipeline 评估方法论参考

可信度判断: 高——学术论文,有代码/数据集说明


✅ 条目 5:RAG Distractor 与 Reranking 效果数据(Splunk Blog)

来源: Splunk Blog
URL: https://www.splunk.com/en_us/blog/artificial-intelligence/reranker-models.html
类型: 工程博客

保留理由(具体数据):

场景 数字
单个 distractor 段落影响 Llama-3.2-3B 准确率从 82.6 降至 71.5(-11.1pp)
DynamicRAG 完整系统 47.1 exact match vs 34.5 无 reranking(+12.6pp)
多轮对话 query rewrite BGE-base Recall@5 从 0.30 提升至 0.37
Oracle depth selection MS MARCO Dev 提升超 7%,同时减少 5 倍平均 depth
  • 明确指出 reranker 失败的常见原因和修复方法
  • 给出 Luna eval models 具体成本:$0.02/百万 tokens,152ms 延迟,0.95 F1

工程价值: 高——生产环境 RAG reranking 选型和调优的具体数据

可信度判断: 中高——Splunk 工程博客,数据有来源标注


✅ 条目 6:MCP July 2026 规范重大更新 — 无状态化

来源: 多篇工程博客(Descope、CodeLeap、ACM)
URL: https://www.descope.com/learn/post/mcp
类型: 技术规范解读

保留理由(具体变更):

变更项 具体内容
规范版本 2026-07-28,重大架构调整
核心变化 Streamable HTTP 改为无状态核心;session/handshake 被移除
请求格式 _meta 字段携带协议版本和客户端能力
新增必需接口 server/discover(可选预探测)
弃用功能 Sampling(→直接调用 LLM API)、Roots(→通过 tool 参数传递)、Logging(→OpenTelemetry)
认证 HTTP servers 支持 OAuth 2.1

工程价值: 高——MCP 生产部署规范变更直接影响 AI 工程架构

建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-mcp-2026-07-spec-stateless-update.md

可信度判断: 高——规范变更有明确日期和版本,多来源交叉验证


✅ 条目 7:Multi-Agent 框架生产对比 — LangGraph vs CrewAI vs AutoGen

来源: OriginsHq + Uvik + OpenLayer + Arize
URL: https://originshq.com/feeds/ai-agent-frameworks-for-production
类型: 工程博客综述

保留理由(工程判断):

  • AutoGen 状态: 2026 年进入维护模式;微软新项目转向 Microsoft Agent Framework 1.0(2026年4月 GA)
  • LangGraph vs CrewAI 决策树: "workflow 符合 role pattern 选 CrewAI,否则选 LangChain/LangGraph"
  • LangGraph checkpointing: 明确警告 in-memory saver 会丢失状态,必须用持久化 checkpointer
  • CrewAI 代码行数: 20-50 行 Python 即可构建多 agent 系统
  • 生产建议: "工具、prompts、业务状态、eval 数据必须放在框架外部"

工程价值: 高——生产 agent 架构选型决策建议,不是泛泛而谈

可信度判断: 中——综述类博客,但有具体版本号和决策逻辑


✅ 条目 8:LLM Eval 框架对比 — RAGAS vs TruLens vs DeepEval vs ARES

来源: Samuel Ochoa + DeepEval Blog + CloudRPS
URL: https://samuelochoa.com/expertise/rag/eval/ragas-and-frameworks
类型: 工程博客 + 实践指南

保留理由(生产 eval 模式):

生产 RAG 团队常见组合:
1. 自定义 eval harness(核心指标)
2. RAGAS 或类似框架(开箱即用指标)
3.  tracing/observability 工具(生产监控)
4.  人工 review(最难案例)

阶段推荐:
- Early stage → RAGAS(便宜、易上手)
- Production → TruLens 或 Phoenix(可观测 + eval)
- 监管/高风险 → 人工 review + 自动化
  • RAG Triad: context relevance、groundedness(faithfulness)、answer relevance
  • DeepEval 优势: Pytest 集成、CI/CD、trace-level + component-level evals
  • Phoenix( Arize): 视觉化生产 tracing
  • Braintrust: 生产监控,付费

工程价值: 高——真实生产 incident 引出(RAG faithfulness regression 导致金融客户账户余额错误),eval pipeline 建设实践

建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-rag-eval-frameworks-production-patterns.md

可信度判断: 中高——有真实生产案例,数据有来源


三、丢弃条目(营销/无工程细节)

条目 丢弃理由
LinkedIn: AI Engineer Roadmap 2026 营销性质,路线图式内容,无具体命令/代码/数字
daily.dev: Best Engineering Substack 推荐 资讯类汇总,无原始工程内容
AI Agent Frameworks Compared (arize.com) 泛泛对比,无具体性能数据或命令
Uvik: Python AI Agent Frameworks 2026 框架功能列表,无真实环境/错误/性能数字
各类 LinkedIn 帖子 多数为观点输出,缺少可复现步骤

四、分类标签汇总

标签 条目编号
inference-engine benchmark vLLM TGI ✅ 1, 2, 3
RAG reranking evaluation production ✅ 4, 5, 8
multi-agent LangGraph CrewAI AutoGen ✅ 7
MCP protocol stateless 2026-spec ✅ 6
LLM-eval RAGAS TruLens DeepEval observability ✅ 8

五、建议写入路径汇总

路径 内容 优先级
2026-10-05-inference-control-plane-arxiv2609-23130.md 推理控制平面综述 + 具体 benchmark 数字 P0
2026-10-05-inference-engine-benchmark-vllm-tgi.md vLLM vs TGI 具体吞吐量数据 P0
2026-10-05-mcp-2026-07-spec-stateless-update.md MCP 2026-07 无状态化规范变更 P1
2026-10-05-rag-eval-frameworks-production-patterns.md RAG 评估框架选型 + 生产 eval 模式 P1
2026-10-05-token-latency-fairness-arxiv2609-18112.md 多租户推理性能隔离 (UC Berkeley) P2

六、后续行动建议

  1. 精读优先级: - arXiv:2609.23130(推理控制平面)——建议详细阅读 benchmark atlas 部分 - arXiv:2609.38473(RAG reranking)——可作为 RAG 评估方法论补充

  2. Substack 来源核验: - 本次搜索未命中高质量 Substack 内容;建议下次加入 site:substack.com "inference" OR "benchmark" OR "RAG" 定向查询

  3. 去重检查: - vLLM/TGI benchmark:历史草稿中已有类似内容,需对比合并 - MCP spec 更新:需确认 2026-07-26 相关草稿是否已覆盖 July-28 变更


Jay 工程实践筛选草稿 | 2026-10-05 14:50 CST | 不执行 GitHub 写入