Jay 工程实践筛选报告 · 2026-09-03 上午

检索范围

  • arXiv (LLM inference/agentic RAG/security)
  • GitHub Trending (agentic AI frameworks)
  • Substack (AI Agents Stack 2026, OWASP Agents)
  • 工程博客 (RunPod, Jarvislabs, Yotta Labs, inferenceengineering.tech)

✅ 保留条目

1. vLLM vs SGLang vs TensorRT-LLM 工程对比(多源)

来源: RunPod / Jarvislabs / Yotta Labs / inferenceengineering.tech
时间: 2026年5-8月(持续更新)
可信度: 高(多源实测 benchmark,数据交叉印证)

核心工程数据

维度 vLLM SGLang TensorRT-LLM
部署复杂度 ★ 最简,pip安装即用 中等,需 RadixAttention ★★ 需编译,GPU架构匹配
H100 70B FP8 吞吐 ~12,500 tok/s ~12,700 tok/s (unique) ~14,100 tok/s
Prefix-heavy 吞吐 ~12,500 tok/s ~16,200 tok/s (+29%)
延迟(p50) 最低
重编译代价 高(模型换版代价大)
适用场景 快速上线/多模型切换 共享系统提示词场景 长期单一模型高负载

关键部署命令(TensorRT-LLM + RunPod Serverless)

# 引擎构建(必须在目标GPU架构上执行)
trtllm-serve serve ./qwen3_32b_trt_engine_sharegpt \
  --backend tensorrt \
  --tokenizer /home/Qwen/Qwen3-32B \
  --max_batch_size 128 \
  --max_input_len 4096 \
  --max_seq_len 8192 \
  --host 0.0.0.0 \
  --port 8000 \
  --tp_size 2

# vLLM 快速部署
vllm serve Qwen/Qwen3-14B \
  --tensor-parallel-size 2 \
  --max-model-len 8192

# SGLang server
python -m sglang.launch_server \
  --model-path Qwen/Qwen3-14B \
  --port 30000 \
  --mem-fraction-static 0.9

决策框架(Yotta Labs)

  • 模型频繁更换(每几周) → vLLM(无编译税)
  • 长期单一高流量模型 → TensorRT-LLM(吞吐量优势摊薄编译成本)
  • 共享系统提示词+短用户轮次 → SGLang(RadixAttention prefix reuse优势明显)

保留理由: 多个独立来源实测数据一致,含部署命令、benchmark数值、决策树,是2026年LLM serving选型必读工程文献。与09-02的CSDN vLLM部署文章互补(本文侧重benchmark决策,09-02侧重CSDN实操)。

建议写入路径: research-kb/published/inference/vllm-sglang-trtllm-2026-benchmark.md


2. HERA: Multi-agent RAG with Evolving Orchestration (arXiv 2604.00901)

URL: https://arxiv.org/html/2604.00901v1
可信度: 高(arXiv peer-adjacent)

架构要点

三层分层架构(全局编排策略 + 局部 agent 行为联合演化): - Orchestrator: 集中式查询特定执行计划,一次性生成(holistic orchestration) - Core Agents: Query Decomposer, Retriever, Answer Generator, Query Rewriter, Evidence Selector, Context Validator, Reflect Agent, Conclude Agent - 经验驱动: 累积 experience 作为 compass,持续指导 orchestrator 协调策略改进

实现细节

  • Corpus: Wikipedia
  • Retriever: BGE(返回 top-5 passages 多步检索,top-10 单轮)
  • LLMs: Llama-3.1-8B / Qwen3-14B(orchestrator backbone,frozen)
  • GPT-4o-mini(各 agent backbone)
  • 训练策略: GPT-4o 标注查询(来自2WikiQA、HotpotQA、AmbigQA、MusiQue),reasoning type 分类(bridge/intersection/comparison/temporal/ambiguous)

保留理由: 三层 hierarchy + experience-driven evolution 是较新的编排范式,超越常见 sequential pipeline;实现细节具体(agent类型、retriever配置、数据集);适合作为 RAG 编排架构参考。

建议写入路径: research-kb/published/rag/multi-agent-rag/hera-2026-arxiv.md


3. OGX: Securing the Agent — Vendor-Neutral Multitenant Enterprise RAG (arXiv 2605.05287)

URL: https://arxiv.org/html/2605.05287v1
可信度: 高

核心价值

问题: 企业多租户 agent 系统中,tool use 和 retrieval 的 server-side 策略执行缺失。

方案: OGX 框架 + OpenAI-compatible API + server-side policy enforcement

详细延迟对比表(p50 / p99 / Mean, ms)

Config Orch/Retr p50 p99 Mean
A Client/Ungated 3,600 10,818 4,208
B Client/Gated 3,427 9,795 3,851
C Server/Ungated 7,507 16,462 7,620
D Server/Gated 6,431 14,623 6,934

Server-side gating 带来约2x延迟增加但实现多租户安全隔离。
实现: OGX Contributors 2026a,LangChain/LangGraph/CrewAI 均可接入(OpenAI-compatible API,无需改 agent 代码)。

保留理由: 有量化 latency 数据(p50/p99/Mean 分4种配置),是多租户 agent 安全工程的稀缺工程数据;OGX 开源实现可直接参考;与 OWASP Top 10 Agents 安全主题形成互补。

建议写入路径: research-kb/published/security/ogx-multitenant-agent-arxiv-2026.md


4. AI Agents Stack 2026 Edition (Substack: The AI Engineer)

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者: The AI Engineer
可信度: 中高(工程社区 newsletter,有调查数据支撑)

关键工程洞察

1. Agent Guardrails ≠ LLM Guardrails - 2024: guardrails = input/output 过滤器 - 2026: agent guardrails = tool call 授权 + rate limit 强制 + 执行结果验证

2. "Evaluation as Infrastructure" 三层收敛 - 每次 PR 的快速检查(agent 是否调用了正确工具?) - 夜间回归套件(LLM judge 评判输出质量) - 生产持续监控(agent 性能漂移告警)

3. 新型 Agent Benchmark - Context-Bench: memory management 评估 - Recovery-Bench: 错误恢复能力评估 - Terminal-Bench: 编程 agent 评估

4. 2026 Coding Agent Stack (案例: Cursor) - Layer 1: Models (Claude/GPT-4/自微调路由) - Layer 2: MCP servers (editor/terminal/filesystem/git) - Layer 3: Memory (codebase-aware retrieval + reranking) - Layer 4: Frameworks (RL loops 自研控制流,非 LangGraph)

保留理由: 明确区分 agent stack vs LLM stack;eval infrastructure 三层架构有工程指导价值;Cursor 案例具体展示了生产级 agent 系统的分层。

建议写入路径: research-kb/published/agents/ai-agents-stack-2026-substack.md


5. OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet (Substack)

URL: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
作者: Alex Ewerman
可信度: 中高(OWASP 社区项目,工程可操作)

核心工程原则

  1. Simplicity (Statelessness): LLM 调用尽量无状态;agent 需要长记忆必须严格验证
  2. Robustness (Sandboxing & Scoping): 将 LLM 视为 hostile user;agentic functions 置于 API Gateway/rate limiter/IAM 边界后

关键威胁 + 缓解(工程可操作)

  • LLM01 Prompt Injection: 语义防火墙隔离 system prompt;永不信任用户输入
  • LLM02 Sensitive Info Disclosure: 数据进入 LLM 前 mask/scrub;严格过滤输出
  • LLM03 Supply Chain: 要求 AI-BOM/SBOM;所有依赖按 hash pin
  • LLM06 Excessive Agency: 最小权限 tool access;限制可调用 API 范围
  • ASI02 Tool Misuse: tool call 审计日志;执行前强制 schema 验证
  • ASI03 Privilege Abuse: 每次 action 独立鉴权;不依赖单次全局认证

保留理由: 与 2605.05287 (OGX) 形成安全工程闭环;威胁模型 + 具体缓解措施可直接转化为工程 checklist;LLM06/ASI02/ASI03 是 2026 agent 特有的攻击面。

建议写入路径: research-kb/published/security/owasp-top10-agents-2026.md


6. DeerFlow 2.0 (ByteDance) — GitHub 66k+ stars

URL: https://github.com/bytedance/deer-flow
发布时间: 2026-02-27 v2.0(ground-up rewrite,无 v1 共享代码)
可信度: 高(头部公司开源,项目活跃)

核心架构

  • 定位: Open-source super agent harness
  • 核心组件: sub-agents + memory + sandboxes + extensible skills
  • 关键里程碑: 2026-02-28 GitHub Trending #1;2026-04 新增 TIAMAT cloud memory + BytePlus InfoQuest 智能搜索
  • 使用方式: HTTP Gateway API 或 DeerFlowClient(Python 库直连)
  • 依赖: Python 3.12+(注意:v1 是 3.11)
  • 注意事项: 版本迭代快,建议 pin 到特定 release tag,不要跟踪 main

工程价值

  • 多子 agent 协调的真实生产级实现
  • memory + sandboxed execution 的具体组合方式
  • DeerFlowClient 提供进程内访问,与 LangGraph 集成方式清晰

保留理由: GitHub 66k+ stars 说明工程社区高度认可;ByteDance 背书;有完整的多 agent + memory + sandbox 组合参考价值;生产部署建议 pin release 的工程实践值得记录。

建议写入路径: research-kb/published/agents/deerflow-2-bytedance-github.md


❌ 丢弃条目

条目 丢弃理由
A-RAG (arXiv 2602.03442) 分层检索架构有价值,但实验细节(如 progressive chunk reading 具体实现)需读完整 PDF;消融实验表格存在但未提取到命令/代码层面;可降级为"精读摘要"而非工程实践条目
TechGraphRAG (arXiv 2606.01613) Domain-specific(智能轮胎/车辆动力学),系统复杂度过高;"documented for reproduction" 但工程复现路径不清晰;更适合专业领域知识库而非通用工程实践
LLM Engineering Roadmap (GitHub tal7aouy) 知识结构梳理完整,但缺乏具体工程步骤/命令/错误日志;属于学习路径而非工程实践文献;内容在 2026-06-10 已有类似条目
awesome-ai-agents-2026 (caramaschiHG) 300+ 资源列表;工程深度不足;降级为资源导航而非工程实践条目
Top 20 AI Agent GitHub Repos (fungies.io) 概览性质,无具体实现细节;Dify/Langflow 已有更深度条目覆盖

📋 本轮摘要

类别 保留数 丢弃数
Inference Serving 1 0
Multi-Agent RAG 1 1
Agent Security 2 0
Agent Stack/Benchmarks 1 0
Agent Frameworks 1 2
合计 6 3

🏷️ 分类标签

inference-engineering multi-agent-rag agent-security benchmark production-stack deerflow ogx hera eval-infrastructure owasp


📁 建议写入路径(6个文件)

  1. published/inference/vllm-sglang-trtllm-2026-benchmark.md
  2. published/rag/multi-agent-rag/hera-2026-arxiv.md
  3. published/security/ogx-multitenant-agent-arxiv-2026.md
  4. published/agents/ai-agents-stack-2026-substack.md
  5. published/security/owasp-top10-agents-2026.md
  6. published/agents/deerflow-2-bytedance-github.md

🔬 后续行动

  • 精读: HERA (2604.00901) 全文(获取 agent RL 训练细节);DeerFlow GitHub README(获取 DeerFlowClient Python API 示例)
  • 审稿: vLLM vs TRT-LLM 对比(建议加入具体延迟数据来源链接)
  • 主题页更新: inference-engineeringagent-security 两个主题页需增补今日条目

Jay · 2026-09-03T10:50 · 工程实践筛选第三轮