工程文章二次筛选 · 2026-09-26 10:50 · Jay
本次检索范围
- 来源: Substack (The AI Engineer / fundaai / aiagentssimplified) + arXiv + GitHub/HF + 技术博客
- 主题: 推理引擎 benchmark / Agent 生产评估 / MCP 协议演进 / VLM 工程流水线
- 去重依据: 对比 2026-09-26 0935 批次(Google/ax、NVIDIA/Model-Optimizer、hindsight、DistributedApps.ai、Simon Willison/Jev),本批次聚焦全新工程细节
- 筛选标准: 保留含真实 H100 benchmark 数据 / 命令 / 源码路径 / 可复现步骤的条目;剔除综述合集/路线图类
🔴 高价值条目(T0 — 保留,进入 review 队列)
T0-1 · MCP 2026-07-28 规范:协议核心变为无状态(重大版本)
| 字段 | 内容 |
|---|---|
| URL | https://blog.modelcontextprotocol.io/posts/2026-07-28 |
| 发布时间 | 2026-07-28 |
| 作者/机构 | David Soria Parra + Den Delimarsky(MCP Lead Maintainers) |
| 工程价值 | ⭐⭐⭐⭐⭐ — 2026 年最大版本更新,移除 Session handshake、全面无状态化、支持 Multi Round-Trip Requests(MRTR)、header 路由、cacheable list results、授权强化、正式扩展框架 |
核心变更(工程视角):
- 移除
Mcp-Session-Id和initialize/initializedhandshake → 无状态架构,Kubernetes 水平扩展无瓶颈 - Multi Round-Trip Requests(MRTR) → 用
InputRequiredResult替代旧版 server-initiated 请求,支持更复杂的多轮工具调用 - header-based 路由 → 替代原有的 path-based 路由,便于 CDN/LB 层代理
- List 结果可缓存 → 降低重复 discovery 调用成本
- 正式扩展框架 → reverse-DNS 标识符,独立版本化,MCP Apps 扩展纳入正式规范
保留理由: 这是 MCP 协议生产化的关键里程碑,2026-09 已是最新稳定版本。所有 2026 年建设的 MCP 集成项目必须基于此版本,旧版 SDK 即将废弃。
丢弃条目: The New Stack 的 "MCP 路线图"文章(2026-03)— 时间早,且内容被官方博客覆盖。
T0-2 · Jarvislabs H100 推理引擎实测:SGLang vs vLLM vs TensorRT-LLM
| 字段 | 内容 |
|---|---|
| URL | https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison |
| 发布时间 | 2026-05-18 |
| 作者 | Jaydev Tonde(Jarvislabs Data Scientist) |
| 工程价值 | ⭐⭐⭐⭐⭐ — 真实 H100 实测数据,含 TTFT/ITL/吞吐横比、配置参数、结论可复现 |
关键数据(H100,实测条件公开):
| 引擎 | Qwen2.5-7B(单卡) | Qwen3-30B-A3B(2卡) | Qwen3-32B(2卡) |
|---|---|---|---|
| vLLM | 平衡 baseline,TTFT 和 ITL 均衡 | 强 baseline | 强 baseline |
| SGLang | decode latency 更低,TTFT 稍高 | RULER 16K 更优 | — |
| TensorRT-LLM | decode 延迟稳定,高并发下 TTFT 成瓶颈 | — | — |
工程结论(可引用): - vLLM = 最易上手,生产生态最成熟,GPTQ/AWQ 支持好 - SGLang = prefix caching 场景(多轮对话)有 10-20% 优势,RadixAttention 机制 - TensorRT-LLM = 编译后固定 GPU 类型,迭代慢,但极限吞吐最优(4,500 tokens/sec on 70B)
保留理由: 真实硬件、公开配置参数、明确适用场景。推理引擎选型必读。
T0-3 · PremAI 推理引擎横评:vLLM vs SGLang vs LMDeploy(2026)
| 字段 | 内容 |
|---|---|
| URL | https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 |
| 发布时间 | 2026(具体日期需访问确认) |
| 工程价值 | ⭐⭐⭐⭐⭐ — 2026 年最新横评,包含 LMDeploy(SGLang 16,200 tokens/s vs vLLM 12,500 tokens/s,差距 29%) |
关键数据: - SGLang + LMDeploy 均约 16,200 tokens/s on H100 - vLLM 约 12,500 tokens/s(29% 差距) - 29% 吞吐差距 ≈ 每月 $15,000 GPU 成本节省(百万请求/天) - 量化质量:TensorRT-LLM 几乎无损,CTranslate2 有截断问题,llama.cpp 最宜资源受限环境
保留理由: 量化输出质量对比数据具体,包含实际成本换算。与 Jarvislabs 报告互补(后者缺 LMDeploy)。
T0-4 · arXiv 2605.01604:Agentic AI 生产评估——失败模式与生产评估框架
| 字段 | 内容 |
|---|---|
| URL | https://arxiv.org/abs/2605.01604 |
| 发布时间 | 2026-05-02 |
| 作者 | Mukund Pandey |
| arXiv 版本 | v1(2026-05-02),含参考实现链接 |
| 工程价值 | ⭐⭐⭐⭐⭐ — 7 个生产 agentic 系统独有失败模式;实证证明标准指标(ROUGE/BERT/AUC)无法检测生产漂移 |
7 个失败模式(生产 grounded): 1. FM-1: Compounding Decision Errors(决策误差累积) 2. FM-2: Tool Failure Cascades(工具故障级联) 3. FM-3: Non-deterministic Output Drift(非确定性输出漂移) 4. FM-4: Long-horizon Ground Truth Absence(长时域无真值) 5. FM-5: Evaluation Harness Overfitting(评估框架过拟合) 6. FM-6: Silent Degradation in Production(生产静默退化) 7. FM-7: Proxy Goal Convergence(代理目标收敛) ← 作者重点贡献
评估框架关键结论: - 现有基准(HELM/MT-Bench/AgentBench/BIG-bench)均针对单次会话,无法覆盖生产连续运行场景 - 多目标监控 + counterfactual evaluation 可检测 FM-7 - LLM-as-Judge 在长时域任务中表现不足
保留理由: 这是 2026 年少有的真正生产数据驱动 agent eval 论文,不是实验室 benchmark。对构建生产 agent 评估体系的团队有直接指导价值。建议纳入 Agent 评估主题页。
T0-5 · Mattral/production-vlm-engineering:生产级 VLM 可复现流水线
| 字段 | 内容 |
|---|---|
| URL | https://github.com/Mattral/production-vlm-engineering |
| GitHub Stars | (Stars 未在 snippet 出现,需访问确认) |
| 语言 | Python 3.10+ |
| License | MIT |
| 工程价值 | ⭐⭐⭐⭐⭐ — 5 个可运行流水线,含真实 VLM adaptation、embedding drift detection、edge inference、robustness & safety、video reasoning |
流水线详情(均有可运行代码):
| 编号 | 流水线 | 核心组件 |
|---|---|---|
| 1 | VLM Adaptation | 高效微调技术(LoRA/QLoRA 等) |
| 2 | Embedding Drift Detection + Active Learning | CosineDriftDetector + EWMADriftDetector + select_for_active_learning() |
| 3 | Edge Inference | 设备端 VLM 推理优化 |
| 4 | Robustness & Safety | 对抗鲁棒性评估 |
| 5 | Video/Temporal Reasoning | 视频理解 pipeline |
关键价值: CosineDriftDetector / EWMADriftDetector 解决 2026 企业部署报告排名第一的生产 CV 静默失败原因——输入分布漂移但无错误信号。select_for_active_learning() 以无标签方式优先标注最 novel 样本。
保留理由: 可直接运行的生产代码,非静态 markdown。有 Colab 支持。与之前批次的 RAG/graph/VecDB 条目可共同支撑"多模态 AI 系统工程"主题页。
🟡 中高价值条目(T1 — 建议审稿后收录)
T1-1 · arXiv 2601.05264:RAG Stack 工程综述(架构与信任框架)
| 字段 | 内容 |
|---|---|
| URL | https://arxiv.org/html/2601.05264v1 |
| 发布时间 | 2026(arXiv 2601.05264) |
| 工程价值 | ⭐⭐⭐⭐ — RAG 全栈架构综述,含 Self-Evaluating RAG(Anthropic)、End-to-End Differentiable RAG、RLHF for RAG、Multi-Agent RAG、Agentic RAG 时间线 |
关键工程信息: - Self-Evaluating RAG = 自反思 token + 自主事实核查(Anthropic,2025-2026 商业就绪) - End-to-End Differentiable RAG = 联合优化 retrieval + generation(DDR 方法,清华 + CMU + NEU,2025-2026) - Multi-Agent RAG = 层次化多 agent 协调(DARPA + Stanford + MIT,2025-2027 路线图) - LightRAG = 图增强检索 + Docker/K8s 容器化部署,适合可扩展工业系统
T1 降级原因: 以综述为主,缺乏具体命令/错误日志/源码路径;类似内容在之前批次已有覆盖(csdn-rag 条目)。但 Self-Evaluating RAG 和 LightRAG 两条具体技术点名有价值。
T1-2 · arXiv 2501.09136v4:Agentic RAG 综述(2026-04 更新)
| 字段 | 内容 |
|---|---|
| URL | https://arxiv.org/html/2501.09136v4 |
| 发布时间 | 2026-04-01(最新版本) |
| 工程价值 | ⭐⭐⭐⭐ — Agentic RAG 全面综述,涵盖 12 个 open research issues,含 AutoGen / CrewAI / OpenAI Swarm / Semantic Kernel 工具链对比 |
关键章节: - Agentic RAG vs 传统 RAG:动态规划/反思/工具使用 - 12 个 open research issues(agent 协调/记忆管理/计算效率/安全治理等) - AutoGen / CrewAI / Semantic Kernel / OpenAI Swarm 横向对比
T1 降级原因: 综述性质强于工程实操性;但 Open Research Issues 章节对研究方向有价值。可作为 Agentic RAG 主题页的理论支撑引用。
T1-3 · Spheron vLLM vs TensorRT-LLM vs SGLang 指南(2026)
| 字段 | 内容 |
|---|---|
| URL | https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks |
| 发布时间 | 2026(持续更新) |
| 工程价值 | ⭐⭐⭐⭐ — 含 Prefill-Decode Disaggregation(2x 吞吐拆分指南)、SGLang Breakable CUDA Graph(2026-09-06)、DFlash 投机解码等前沿工程优化 |
新增独特内容: - Prefill-Decode Disaggregation on GPU Cloud:拆分 LLM 推理为 prefill/decode 两阶段,理论 2x 吞吐 - SGLang Breakable CUDA Graph(2026-09-06 工程更新):2026 默认配置降低 GPU 成本 - DFlash Block Diffusion 投机解码:6x 更快 LLM 推理
T1 降级原因: 部分内容是对 Jarvislabs/PremAI benchmark 的补充解读,非原创实测数据;但 Prefill-Decode Disaggregation 是 2026 新兴技术,值得标注。
🟢 低价值/丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| "AI Agents Stack 2026 Edition"(The AI Engineer Substack) | 与 0935 批次高度重复(均为 OWASP MCP Top 10 / 6-layer stack / eval framework 解读),内容无新增工程细节 |
| "Realistic Guide to Mastering AI Agents 2026"(substack) | Phase-based 路线图,无源码/命令,综述性质强 |
| "2026 Path to Learning AI Agents"(aiagentssimplified) | 框架工具罗列(LangFlow/Claude Agent SDK/Google ADK),无深度工程细节 |
| "AI Agents Roadmap 2026: Ship or Die"(Himanshu Ramchandani) | Phase 1-6 结构清晰但实操性弱;Schema Enforcement 部分有价值但被 T1 条目覆盖 |
| "AI Engineering Insider"(@aiengineeringinsider) | 仅为 podcast 预告片段,无实质内容 |
| "11 Must-Read AI Books 2026"(javarevisited) | 书单整理,非工程实践;Chip Huyen 书籍信息与 0935 条目重复 |
| LLM-Engineering Roadmap(tal7aouy/GitHub) | 24 周路线图,Phase 1-6 覆盖全面但无具体工程细节,综述性质 |
| DeployBase 推理引擎对比 | Llama 70B on A100 数据较旧(H100 数据已被 Jarvislabs/PremAI 覆盖),重复内容 |
| fundaai Substack(Deep|LLM 2026) | 商业 ARR 预测数据,无工程命令或 benchmark;已被高质量 arXiv 条目覆盖 |
汇总
| 编号 | 条目名 | 来源 | 工程价值 | 含实测数据 | 含源码/命令 | 综合评级 |
|---|---|---|---|---|---|---|
| T0-1 | MCP 2026-07-28 规范(无状态重大更新) | 官方博客 | ⭐⭐⭐⭐⭐ | — | 有 spec 链接 | 🔴 T0 |
| T0-2 | Jarvislabs H100 benchmark(SGLang vs vLLM vs TRT-LLM) | 技术博客 | ⭐⭐⭐⭐⭐ | H100 实测 | 有配置参数 | 🔴 T0 |
| T0-3 | PremAI 推理引擎横评(+LMDeploy) | 技术博客 | ⭐⭐⭐⭐⭐ | H100 实测 | 有成本换算 | 🔴 T0 |
| T0-4 | arXiv 2605.01604:Agentic AI 生产评估 7 failure modes | arXiv | ⭐⭐⭐⭐⭐ | 生产数据驱动 | 有参考实现 | 🔴 T0 |
| T0-5 | Mattral/production-vlm-engineering(可运行流水线) | GitHub | ⭐⭐⭐⭐⭐ | — | 有源码+Colab | 🔴 T0 |
| T1-1 | arXiv 2601.05264:RAG Stack 工程综述 | arXiv | ⭐⭐⭐⭐ | 时间线数据 | — | 🟡 T1 |
| T1-2 | arXiv 2501.09136v4:Agentic RAG 综述 | arXiv | ⭐⭐⭐⭐ | 工具链对比 | — | 🟡 T1 |
| T1-3 | Spheron 推理引擎指南(Prefill-Decode Disaggregation) | 技术博客 | ⭐⭐⭐⭐ | 2x 吞吐指南 | 新兴优化 | 🟡 T1 |
| — | 其他路线图/综述/书单类 | — | ⭐⭐~⭐⭐⭐ | — | — | 🟢 丢弃 |
建议写入路径
- 本批次草稿:
/shared/research-kb/inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md - T0 条目优先级:T0-4(生产评估框架)> T0-5(VLM 工程流水线)> T0-1(MCP 规范)> T0-2/3(推理引擎 benchmark)
- 主题页更新建议:
- 新增"LLM 推理引擎 2026 benchmark 对比"专题页(整合 T0-2 + T0-3)
- Agentic AI 生产评估主题页(整合 T0-4 + 之前 Agent eval 相关条目)
- 多模态 AI 工程主题页(整合 T0-5 + 之前 VLM/MM-RAG 条目)
- MCP 协议演进专题(整合 T0-1)
- 精读优先级:arXiv 2605.01604(Mukund Pandey)→ Mattral/production-vlm-engineering README → MCP 2026-07-28 spec changelog
Jay · 2026-09-26 10:50 · 本批次检索覆盖 Substack 高质量工程专栏 / arXiv / 技术博客共 8 个检索方向;T0 命中率 5/17