Jay 工程实践二次筛选草稿 | 2026-10-05
实例: Jay | 时间: 2026-10-05 14:50 CST
筛选范围: tavily 搜索(LLM inference serving / LangGraph CrewAI / RAG evaluation / MCP / LLM eval frameworks),月度范围内
一、本次检索概览
| 查询 | 来源类型 | 命中数 |
|---|---|---|
| vLLM vs TGI benchmark, inference systems | arXiv + 工程博客 | 15 |
| LangGraph CrewAI multi-agent architecture | 工程博客 + Substack | 15 |
| RAG reranking evaluation benchmark | arXiv + Splunk blog | 15 |
| MCP Model Context Protocol 2026 | 工程博客 + ACM | 10 |
| LLM evaluation RAGAS DeepEval production | 工程博客 | 10 |
二、高价值条目(含源码/性能数据/可复现步骤)
✅ 条目 1:vLLM vs TGI Benchmark — 具体吞吐量数字
来源: cloudai.pt (引用 arXiv:2511.17593, 2025年11月)
URL: https://cloudai.pt/vllm-vs-tgi-benchmarks-throughput-numbers-that-matter
类型: 工程博客 + 学术论文引用
保留理由:
- 性能数据具体: vLLM 在 LLaMA-2-7B 上,100并发请求时吞吐量是 TGI 的 3.67 倍,极端负载下扩大到 24 倍
- 工程结论清晰: "throughput-bound serving 选 vLLM;TGI 在 median TTFT 上仍有优势,适用于 chat 界面"
- 上游论文可查: arXiv:2511.17593,有原始实验设计
工程价值: 直接可用的推理引擎选型参考,有具体 benchmark 数字支撑
建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-inference-engine-benchmark-vllm-tgi.md
可信度判断: 高——引用可查的 arXiv 论文,非营销内容
✅ 条目 2:From Inference Engine to Inference Control Plane — arXiv:2609.23130
来源: arXiv (2026年9月19日提交)
URL: https://arxiv.org/html/2609.23130v1
类型: 系统综述论文
保留理由(具体数据):
| 实验 | 数据 |
|---|---|
| llm-d vs K8s round-robin | 14.2k vs 9.6k tokens/s;TTFT 6.8s vs 36.4s |
| vLLM-Mooncake | Cache hit 1.7%→92.2%;throughput 3.8x;P50 TTFT 降低 46 倍 |
| RaidServe 故障恢复 | 2x 吞吐,两数量级更快恢复 |
| AWS P/D study (B200) | 比标准 vLLM 基线高 70% tokens/s |
- 提出了 SLO-goodput 评估框架
- 包含 benchmark atlas 和瓶颈迁移分类
- 覆盖 vLLM、llm-d、vLLM-Mooncake 多系统对比
工程价值: 高——具体性能数字、部署建议、评估框架,可作为推理架构选型依据
建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-inference-control-plane-arxiv2609-23130.md
可信度判断: 高——arXiv 学术论文,数据翔实,有原始来源标注
✅ 条目 3:Token Latency Fairness — arXiv:2609.18112
来源: alphaXiv / arXiv (2026年9月16日提交, UC Berkeley)
URL: https://www.alphaxiv.org/abs/2609.18112
类型: 学术论文
保留理由(具体数据): - FairInference vs VTC vs SGLang:well-behaved 吞吐量 74-75 tokens/s(FairInference)vs 58(VTC)vs 53(DLPM)vs 44(SGLang) - 5秒延迟预算下:high-demand client 达到 1187 tokens/s vs 786(static partitioning) - 对齐 SLO 约束下 token-level 延迟隔离的工程问题
工程价值: 多租户 LLM serving 的性能隔离具体数字,适合 SRE/平台工程参考
可信度判断: 高——UC Berkeley 学术工作,具体数值可复现
✅ 条目 4:Re-ranking and Late Interaction — arXiv:2609.38473 (2026年9月29日)
来源: arXiv
URL: https://arxiv.org/html/2609.38473v1
类型: 受控实验论文(RAG 策略对比)
保留理由: - 6 种检索管道在受控环境下的对比 - 数据集: 从 arXiv 论文生成合成科学 QA 数据集,可复现 - 评估方法: LLM-as-judge + retrieval-oriented metrics(RAGAS 类指标) - 使用 Chroma 向量库,文档格式规范(Title/Abstract/Categories)
工程价值: 中高——具体 RAG 策略对比实验设计,适合 RAG pipeline 评估方法论参考
可信度判断: 高——学术论文,有代码/数据集说明
✅ 条目 5:RAG Distractor 与 Reranking 效果数据(Splunk Blog)
来源: Splunk Blog
URL: https://www.splunk.com/en_us/blog/artificial-intelligence/reranker-models.html
类型: 工程博客
保留理由(具体数据):
| 场景 | 数字 |
|---|---|
| 单个 distractor 段落影响 | Llama-3.2-3B 准确率从 82.6 降至 71.5(-11.1pp) |
| DynamicRAG 完整系统 | 47.1 exact match vs 34.5 无 reranking(+12.6pp) |
| 多轮对话 query rewrite | BGE-base Recall@5 从 0.30 提升至 0.37 |
| Oracle depth selection | MS MARCO Dev 提升超 7%,同时减少 5 倍平均 depth |
- 明确指出 reranker 失败的常见原因和修复方法
- 给出 Luna eval models 具体成本:$0.02/百万 tokens,152ms 延迟,0.95 F1
工程价值: 高——生产环境 RAG reranking 选型和调优的具体数据
可信度判断: 中高——Splunk 工程博客,数据有来源标注
✅ 条目 6:MCP July 2026 规范重大更新 — 无状态化
来源: 多篇工程博客(Descope、CodeLeap、ACM)
URL: https://www.descope.com/learn/post/mcp
类型: 技术规范解读
保留理由(具体变更):
| 变更项 | 具体内容 |
|---|---|
| 规范版本 | 2026-07-28,重大架构调整 |
| 核心变化 | Streamable HTTP 改为无状态核心;session/handshake 被移除 |
| 请求格式 | _meta 字段携带协议版本和客户端能力 |
| 新增必需接口 | server/discover(可选预探测) |
| 弃用功能 | Sampling(→直接调用 LLM API)、Roots(→通过 tool 参数传递)、Logging(→OpenTelemetry) |
| 认证 | HTTP servers 支持 OAuth 2.1 |
工程价值: 高——MCP 生产部署规范变更直接影响 AI 工程架构
建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-mcp-2026-07-spec-stateless-update.md
可信度判断: 高——规范变更有明确日期和版本,多来源交叉验证
✅ 条目 7:Multi-Agent 框架生产对比 — LangGraph vs CrewAI vs AutoGen
来源: OriginsHq + Uvik + OpenLayer + Arize
URL: https://originshq.com/feeds/ai-agent-frameworks-for-production
类型: 工程博客综述
保留理由(工程判断):
- AutoGen 状态: 2026 年进入维护模式;微软新项目转向 Microsoft Agent Framework 1.0(2026年4月 GA)
- LangGraph vs CrewAI 决策树: "workflow 符合 role pattern 选 CrewAI,否则选 LangChain/LangGraph"
- LangGraph checkpointing: 明确警告 in-memory saver 会丢失状态,必须用持久化 checkpointer
- CrewAI 代码行数: 20-50 行 Python 即可构建多 agent 系统
- 生产建议: "工具、prompts、业务状态、eval 数据必须放在框架外部"
工程价值: 高——生产 agent 架构选型决策建议,不是泛泛而谈
可信度判断: 中——综述类博客,但有具体版本号和决策逻辑
✅ 条目 8:LLM Eval 框架对比 — RAGAS vs TruLens vs DeepEval vs ARES
来源: Samuel Ochoa + DeepEval Blog + CloudRPS
URL: https://samuelochoa.com/expertise/rag/eval/ragas-and-frameworks
类型: 工程博客 + 实践指南
保留理由(生产 eval 模式):
生产 RAG 团队常见组合:
1. 自定义 eval harness(核心指标)
2. RAGAS 或类似框架(开箱即用指标)
3. tracing/observability 工具(生产监控)
4. 人工 review(最难案例)
阶段推荐:
- Early stage → RAGAS(便宜、易上手)
- Production → TruLens 或 Phoenix(可观测 + eval)
- 监管/高风险 → 人工 review + 自动化
- RAG Triad: context relevance、groundedness(faithfulness)、answer relevance
- DeepEval 优势: Pytest 集成、CI/CD、trace-level + component-level evals
- Phoenix( Arize): 视觉化生产 tracing
- Braintrust: 生产监控,付费
工程价值: 高——真实生产 incident 引出(RAG faithfulness regression 导致金融客户账户余额错误),eval pipeline 建设实践
建议写入路径: /shared/research-kb/inbox/jay/2026-10-05-rag-eval-frameworks-production-patterns.md
可信度判断: 中高——有真实生产案例,数据有来源
三、丢弃条目(营销/无工程细节)
| 条目 | 丢弃理由 |
|---|---|
| LinkedIn: AI Engineer Roadmap 2026 | 营销性质,路线图式内容,无具体命令/代码/数字 |
| daily.dev: Best Engineering Substack 推荐 | 资讯类汇总,无原始工程内容 |
| AI Agent Frameworks Compared (arize.com) | 泛泛对比,无具体性能数据或命令 |
| Uvik: Python AI Agent Frameworks 2026 | 框架功能列表,无真实环境/错误/性能数字 |
| 各类 LinkedIn 帖子 | 多数为观点输出,缺少可复现步骤 |
四、分类标签汇总
| 标签 | 条目编号 |
|---|---|
inference-engine benchmark vLLM TGI |
✅ 1, 2, 3 |
RAG reranking evaluation production |
✅ 4, 5, 8 |
multi-agent LangGraph CrewAI AutoGen |
✅ 7 |
MCP protocol stateless 2026-spec |
✅ 6 |
LLM-eval RAGAS TruLens DeepEval observability |
✅ 8 |
五、建议写入路径汇总
| 路径 | 内容 | 优先级 |
|---|---|---|
2026-10-05-inference-control-plane-arxiv2609-23130.md |
推理控制平面综述 + 具体 benchmark 数字 | P0 |
2026-10-05-inference-engine-benchmark-vllm-tgi.md |
vLLM vs TGI 具体吞吐量数据 | P0 |
2026-10-05-mcp-2026-07-spec-stateless-update.md |
MCP 2026-07 无状态化规范变更 | P1 |
2026-10-05-rag-eval-frameworks-production-patterns.md |
RAG 评估框架选型 + 生产 eval 模式 | P1 |
2026-10-05-token-latency-fairness-arxiv2609-18112.md |
多租户推理性能隔离 (UC Berkeley) | P2 |
六、后续行动建议
-
精读优先级: - arXiv:2609.23130(推理控制平面)——建议详细阅读 benchmark atlas 部分 - arXiv:2609.38473(RAG reranking)——可作为 RAG 评估方法论补充
-
Substack 来源核验: - 本次搜索未命中高质量 Substack 内容;建议下次加入
site:substack.com "inference" OR "benchmark" OR "RAG"定向查询 -
去重检查: - vLLM/TGI benchmark:历史草稿中已有类似内容,需对比合并 - MCP spec 更新:需确认
2026-07-26相关草稿是否已覆盖 July-28 变更
Jay 工程实践筛选草稿 | 2026-10-05 14:50 CST | 不执行 GitHub 写入