Jay 工程实践筛选报告 · 2026-09-03 上午
检索范围
- arXiv (LLM inference/agentic RAG/security)
- GitHub Trending (agentic AI frameworks)
- Substack (AI Agents Stack 2026, OWASP Agents)
- 工程博客 (RunPod, Jarvislabs, Yotta Labs, inferenceengineering.tech)
✅ 保留条目
1. vLLM vs SGLang vs TensorRT-LLM 工程对比(多源)
来源: RunPod / Jarvislabs / Yotta Labs / inferenceengineering.tech
时间: 2026年5-8月(持续更新)
可信度: 高(多源实测 benchmark,数据交叉印证)
核心工程数据
| 维度 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| 部署复杂度 | ★ 最简,pip安装即用 | 中等,需 RadixAttention | ★★ 需编译,GPU架构匹配 |
| H100 70B FP8 吞吐 | ~12,500 tok/s | ~12,700 tok/s (unique) | ~14,100 tok/s |
| Prefix-heavy 吞吐 | ~12,500 tok/s | ~16,200 tok/s (+29%) | — |
| 延迟(p50) | 低 | 中 | 最低 |
| 重编译代价 | 无 | 无 | 高(模型换版代价大) |
| 适用场景 | 快速上线/多模型切换 | 共享系统提示词场景 | 长期单一模型高负载 |
关键部署命令(TensorRT-LLM + RunPod Serverless)
# 引擎构建(必须在目标GPU架构上执行)
trtllm-serve serve ./qwen3_32b_trt_engine_sharegpt \
--backend tensorrt \
--tokenizer /home/Qwen/Qwen3-32B \
--max_batch_size 128 \
--max_input_len 4096 \
--max_seq_len 8192 \
--host 0.0.0.0 \
--port 8000 \
--tp_size 2
# vLLM 快速部署
vllm serve Qwen/Qwen3-14B \
--tensor-parallel-size 2 \
--max-model-len 8192
# SGLang server
python -m sglang.launch_server \
--model-path Qwen/Qwen3-14B \
--port 30000 \
--mem-fraction-static 0.9
决策框架(Yotta Labs)
- 模型频繁更换(每几周) → vLLM(无编译税)
- 长期单一高流量模型 → TensorRT-LLM(吞吐量优势摊薄编译成本)
- 共享系统提示词+短用户轮次 → SGLang(RadixAttention prefix reuse优势明显)
保留理由: 多个独立来源实测数据一致,含部署命令、benchmark数值、决策树,是2026年LLM serving选型必读工程文献。与09-02的CSDN vLLM部署文章互补(本文侧重benchmark决策,09-02侧重CSDN实操)。
建议写入路径: research-kb/published/inference/vllm-sglang-trtllm-2026-benchmark.md
2. HERA: Multi-agent RAG with Evolving Orchestration (arXiv 2604.00901)
URL: https://arxiv.org/html/2604.00901v1
可信度: 高(arXiv peer-adjacent)
架构要点
三层分层架构(全局编排策略 + 局部 agent 行为联合演化): - Orchestrator: 集中式查询特定执行计划,一次性生成(holistic orchestration) - Core Agents: Query Decomposer, Retriever, Answer Generator, Query Rewriter, Evidence Selector, Context Validator, Reflect Agent, Conclude Agent - 经验驱动: 累积 experience 作为 compass,持续指导 orchestrator 协调策略改进
实现细节
- Corpus: Wikipedia
- Retriever: BGE(返回 top-5 passages 多步检索,top-10 单轮)
- LLMs: Llama-3.1-8B / Qwen3-14B(orchestrator backbone,frozen)
- GPT-4o-mini(各 agent backbone)
- 训练策略: GPT-4o 标注查询(来自2WikiQA、HotpotQA、AmbigQA、MusiQue),reasoning type 分类(bridge/intersection/comparison/temporal/ambiguous)
保留理由: 三层 hierarchy + experience-driven evolution 是较新的编排范式,超越常见 sequential pipeline;实现细节具体(agent类型、retriever配置、数据集);适合作为 RAG 编排架构参考。
建议写入路径: research-kb/published/rag/multi-agent-rag/hera-2026-arxiv.md
3. OGX: Securing the Agent — Vendor-Neutral Multitenant Enterprise RAG (arXiv 2605.05287)
URL: https://arxiv.org/html/2605.05287v1
可信度: 高
核心价值
问题: 企业多租户 agent 系统中,tool use 和 retrieval 的 server-side 策略执行缺失。
方案: OGX 框架 + OpenAI-compatible API + server-side policy enforcement
详细延迟对比表(p50 / p99 / Mean, ms)
| Config | Orch/Retr | p50 | p99 | Mean |
|---|---|---|---|---|
| A | Client/Ungated | 3,600 | 10,818 | 4,208 |
| B | Client/Gated | 3,427 | 9,795 | 3,851 |
| C | Server/Ungated | 7,507 | 16,462 | 7,620 |
| D | Server/Gated | 6,431 | 14,623 | 6,934 |
Server-side gating 带来约2x延迟增加但实现多租户安全隔离。
实现: OGX Contributors 2026a,LangChain/LangGraph/CrewAI 均可接入(OpenAI-compatible API,无需改 agent 代码)。
保留理由: 有量化 latency 数据(p50/p99/Mean 分4种配置),是多租户 agent 安全工程的稀缺工程数据;OGX 开源实现可直接参考;与 OWASP Top 10 Agents 安全主题形成互补。
建议写入路径: research-kb/published/security/ogx-multitenant-agent-arxiv-2026.md
4. AI Agents Stack 2026 Edition (Substack: The AI Engineer)
URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者: The AI Engineer
可信度: 中高(工程社区 newsletter,有调查数据支撑)
关键工程洞察
1. Agent Guardrails ≠ LLM Guardrails - 2024: guardrails = input/output 过滤器 - 2026: agent guardrails = tool call 授权 + rate limit 强制 + 执行结果验证
2. "Evaluation as Infrastructure" 三层收敛 - 每次 PR 的快速检查(agent 是否调用了正确工具?) - 夜间回归套件(LLM judge 评判输出质量) - 生产持续监控(agent 性能漂移告警)
3. 新型 Agent Benchmark - Context-Bench: memory management 评估 - Recovery-Bench: 错误恢复能力评估 - Terminal-Bench: 编程 agent 评估
4. 2026 Coding Agent Stack (案例: Cursor) - Layer 1: Models (Claude/GPT-4/自微调路由) - Layer 2: MCP servers (editor/terminal/filesystem/git) - Layer 3: Memory (codebase-aware retrieval + reranking) - Layer 4: Frameworks (RL loops 自研控制流,非 LangGraph)
保留理由: 明确区分 agent stack vs LLM stack;eval infrastructure 三层架构有工程指导价值;Cursor 案例具体展示了生产级 agent 系统的分层。
建议写入路径: research-kb/published/agents/ai-agents-stack-2026-substack.md
5. OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet (Substack)
URL: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
作者: Alex Ewerman
可信度: 中高(OWASP 社区项目,工程可操作)
核心工程原则
- Simplicity (Statelessness): LLM 调用尽量无状态;agent 需要长记忆必须严格验证
- Robustness (Sandboxing & Scoping): 将 LLM 视为 hostile user;agentic functions 置于 API Gateway/rate limiter/IAM 边界后
关键威胁 + 缓解(工程可操作)
- LLM01 Prompt Injection: 语义防火墙隔离 system prompt;永不信任用户输入
- LLM02 Sensitive Info Disclosure: 数据进入 LLM 前 mask/scrub;严格过滤输出
- LLM03 Supply Chain: 要求 AI-BOM/SBOM;所有依赖按 hash pin
- LLM06 Excessive Agency: 最小权限 tool access;限制可调用 API 范围
- ASI02 Tool Misuse: tool call 审计日志;执行前强制 schema 验证
- ASI03 Privilege Abuse: 每次 action 独立鉴权;不依赖单次全局认证
保留理由: 与 2605.05287 (OGX) 形成安全工程闭环;威胁模型 + 具体缓解措施可直接转化为工程 checklist;LLM06/ASI02/ASI03 是 2026 agent 特有的攻击面。
建议写入路径: research-kb/published/security/owasp-top10-agents-2026.md
6. DeerFlow 2.0 (ByteDance) — GitHub 66k+ stars
URL: https://github.com/bytedance/deer-flow
发布时间: 2026-02-27 v2.0(ground-up rewrite,无 v1 共享代码)
可信度: 高(头部公司开源,项目活跃)
核心架构
- 定位: Open-source super agent harness
- 核心组件: sub-agents + memory + sandboxes + extensible skills
- 关键里程碑: 2026-02-28 GitHub Trending #1;2026-04 新增 TIAMAT cloud memory + BytePlus InfoQuest 智能搜索
- 使用方式: HTTP Gateway API 或
DeerFlowClient(Python 库直连) - 依赖: Python 3.12+(注意:v1 是 3.11)
- 注意事项: 版本迭代快,建议 pin 到特定 release tag,不要跟踪 main
工程价值
- 多子 agent 协调的真实生产级实现
- memory + sandboxed execution 的具体组合方式
DeerFlowClient提供进程内访问,与 LangGraph 集成方式清晰
保留理由: GitHub 66k+ stars 说明工程社区高度认可;ByteDance 背书;有完整的多 agent + memory + sandbox 组合参考价值;生产部署建议 pin release 的工程实践值得记录。
建议写入路径: research-kb/published/agents/deerflow-2-bytedance-github.md
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| A-RAG (arXiv 2602.03442) | 分层检索架构有价值,但实验细节(如 progressive chunk reading 具体实现)需读完整 PDF;消融实验表格存在但未提取到命令/代码层面;可降级为"精读摘要"而非工程实践条目 |
| TechGraphRAG (arXiv 2606.01613) | Domain-specific(智能轮胎/车辆动力学),系统复杂度过高;"documented for reproduction" 但工程复现路径不清晰;更适合专业领域知识库而非通用工程实践 |
| LLM Engineering Roadmap (GitHub tal7aouy) | 知识结构梳理完整,但缺乏具体工程步骤/命令/错误日志;属于学习路径而非工程实践文献;内容在 2026-06-10 已有类似条目 |
| awesome-ai-agents-2026 (caramaschiHG) | 300+ 资源列表;工程深度不足;降级为资源导航而非工程实践条目 |
| Top 20 AI Agent GitHub Repos (fungies.io) | 概览性质,无具体实现细节;Dify/Langflow 已有更深度条目覆盖 |
📋 本轮摘要
| 类别 | 保留数 | 丢弃数 |
|---|---|---|
| Inference Serving | 1 | 0 |
| Multi-Agent RAG | 1 | 1 |
| Agent Security | 2 | 0 |
| Agent Stack/Benchmarks | 1 | 0 |
| Agent Frameworks | 1 | 2 |
| 合计 | 6 | 3 |
🏷️ 分类标签
inference-engineering multi-agent-rag agent-security benchmark production-stack deerflow ogx hera eval-infrastructure owasp
📁 建议写入路径(6个文件)
published/inference/vllm-sglang-trtllm-2026-benchmark.mdpublished/rag/multi-agent-rag/hera-2026-arxiv.mdpublished/security/ogx-multitenant-agent-arxiv-2026.mdpublished/agents/ai-agents-stack-2026-substack.mdpublished/security/owasp-top10-agents-2026.mdpublished/agents/deerflow-2-bytedance-github.md
🔬 后续行动
- 精读: HERA (2604.00901) 全文(获取 agent RL 训练细节);DeerFlow GitHub README(获取
DeerFlowClientPython API 示例) - 审稿: vLLM vs TRT-LLM 对比(建议加入具体延迟数据来源链接)
- 主题页更新:
inference-engineering和agent-security两个主题页需增补今日条目
Jay · 2026-09-03T10:50 · 工程实践筛选第三轮