Jay · 下午补充简报 · 2026-08-25 15:05
实例:Jay | 时间:2026-08-25 15:05 (Asia/Shanghai) | 本次检索覆盖:Tavily · Web Search · Substack · arXiv · HF Trending
本次主题
增量补充:针对上午简报(11:05)未覆盖领域 + noon 协调棒识别的高价值缺口(CSDN 生产部署、Substack 工程洞察),以及下午新发现条目。
🔴 高优先级 · MCP 安全专题(本次新增主轴)
今日上午简报对 MCP 侧重于协议栈和生态工具,未深入安全维度。2026年4月-8月 MCP 安全进入集中披露期,此专题应为 Agent 工程团队必读。
★ MCP 安全危机:系统性设计缺陷(2026.04-08 集中披露)
1. arXiv:2601.17549 · "Breaking the Protocol" · MCP 协议级安全分析
- 链接:https://arxiv.org/abs/2601.17549 | PDF: https://arxiv.org/pdf/2601.17549
- 作者:N. Maloyan & D. Namiot
- 发布时间:2026-01-24(24 Jan 2026)
- 核心发现(三项协议级漏洞): 1. 能力证明缺失(Absence of Capability Attestation):服务器可声明任意权限,客户端无法验证 2. 双向采样无源认证(Bidirectional Sampling without Origin Authentication):启用服务端提示注入 3. 多服务器配置隐式信任传播(Implicit Trust Propagation):单服务器被攻破可横向移动至其他服务器
- ProtoAmp 量化结论:MCP 架构使攻击成功率提升 23-41%(847 个攻击场景实验)
- AttestMCP 修复方案:向后兼容扩展,增加能力证明 + 消息认证,攻击成功率从 52.8% 降至 12.4%
- 可信度:⭐⭐⭐⭐⭐(arXiv 学术论文,完整实验设计,三个协议级漏洞可交叉验证)
- 标签:
MCP安全协议漏洞ProtoAmpAttestMCParXivAgent安全 - 操作建议:精读;对照 OWASP MCP Top 10 清单;评估企业内部 MCP 部署的暴露面
2. CSA · "MCP Security Crisis: Systemic Design Flaws"(2026-05-04)
- 链接:https://labs.cloudsecurityalliance.org/research/csa-research-note-mcp-security-crisis-20260504-csa-styled
- 来源:Cloud Security Alliance
- 核心数据:
- OX Security 2026年4月研究"Mother of All AI Supply Chains":Anthropic 官方 MCP SDK(Python/TypeScript/Java/Rust)存在命令执行漏洞,STDIO transport 直接将传入配置参数传递至 OS shell,无输入清理或验证
- 估计 200,000+ 受影响实例,跨越 1.5 亿+ 包下载量
- 截至 2026年5月,至少 7 个高危/严重 CVE 涉及 MCP Inspector、LiteLLM、Cursor IDE、LibreChat、Windsurf 等主流平台
- 可信度:⭐⭐⭐⭐⭐(CSA 研究机构,漏洞编号可查 NVD)
- 标签:
MCPCSACVE供应链安全Anthropic - 操作建议:查 NVD 确认具体 CVE 编号;立即审计企业内部 MCP SDK 版本
3. SecurityWall · MCP Security Testing Guide(2026)
- 链接:https://securitywall.co/blog/mcp-security-testing-guide
- 2026年1月-4月 MCP CVE 关键数据:
- CVE-2025-6514(mcp-remote):CVSS 9.6,OS 命令注入通过恶意服务器授权端点,437,000+ 下载量受影响,完整远程代码执行(RCE)
- CVE-2026-33032(nginx-ui MCP 端点):CVSS 9.8,认证失败导致命令执行,2,600+ 暴露实例,完整 nginx 服务接管
- CVE-2025-49596(MCP Inspector):CVSS 9.4,代理服务器认证缺失,本地任何进程可调用 MCP server 工具
- CVE-2026-26384~26390 系列:OAuth 动态客户端注册(DCR)重定向 URI 劫持,可获取受害者 MCP session 访问令牌
- 可信度:⭐⭐⭐⭐(CVE 编号可查,安全社区博客具体复现细节)
- 标签:
MCPCVECVSSRCE安全测试 - 操作建议:对照 NVD 核验 CVSS 评分;纳入 Agent 安全 checklist
4. NSA · CSI_MCP_SECURITY · MCP 安全设计考量(2026-06-02)
- 链接:https://media.defense.gov/2026/Jun/02/2003943289/-1/-1/0/CSI_MCP_SECURITY.PDF
- 来源:NSA(美国国家安全局)& CISA 联合发布
- 核心建议:扫描本地网络开放式 MCP 服务器;建立系统性漏洞追踪机制;MCP 规范明确"不在协议层强制安全"(实现方责任)
- 可信度:⭐⭐⭐⭐⭐(美国政府机构正式出版物,具权威性)
- 标签:
MCPNSACISA政府安全最佳实践 - 操作建议:可作为企业 MCP 安全评估框架参考;对照 NSA 清单自检
5. SentinelOne · MCP Security Complete Guide(2026)
- 链接:https://www.sentinelone.com/cybersecurity-101/cybersecurity/mcp-security
- 核心内容:OWASP MCP Top 10 安全框架;MCP05 命令注入类别;协议层无原生身份治理导致无摩擦权限升级
- 可信度:⭐⭐⭐⭐(安全厂商,OWASP 引用可溯源)
- 标签:
MCPOWASPSentinelOne安全框架 - 操作建议:对照 OWASP MCP Top 10 评估内部 MCP 部署成熟度
6. ProtoAmp 相关工作 · AttestMCP / MCP-Guard / SMCP / MCP-Secure
- 来源:arXiv 2026 年系列工作(arXiv:2508.10991 / arXiv:2602.01129 / IEEE Open Journal 等)
- 摘要:学术安全社区快速跟进 MCP 安全问题:
- MCP-Guard:多阶段纵深防御框架(arXiv:2508.10991)
- SMCP:安全版 MCP 协议(arXiv:2602.01129)
- MCP-Secure:运行时访问控制层,面向特权感知 LLM Agent 工具
- 可信度:⭐⭐⭐(学术预印本为主,需查同行评审状态)
- 标签:
MCP安全学术防御框架 - 操作建议:关注 SMCP 与 AttestMCP 的向后兼容性差异;判断企业级落地可行性
⚙️ 二、Backend(推理引擎 · 新 Benchmark 数据)
★ 高价值条目
1. LeetLLM · 推理引擎版本清单(2026-08-13 检查)
- 链接:https://leetllm.com/blog/llm-inference-engine-comparison-2026
- 2026年8月各引擎版本状态: | 引擎 | 版本 | 备注 | |------|------|------| | vLLM | v0.5.x(持续更新)| GPU + TPU + Intel Gaudi 多后端 | | SGLang | v0.5.17(2026-08-22 发布)| PyTorch 2.13 迁移,移除 torchao 集成 | | TensorRT-LLM | v1.2.1(NVIDIA 2026)| Blackwell 原生优化 | | Ollama | v0.32.9(2026)| 轻量本地推理 | | llama.cpp | b10375(2026)| 纯 C/C++ 实现 |
- 可信度:⭐⭐⭐⭐(独立监控平台,定期版本检查)
- 标签:
推理引擎vLLMSGLangTensorRT-LLMOllama版本 - 操作建议:生产环境锁定版本号;关注 SGLang v0.5.18 动向
2. InferenceEngineering.tech · vLLM vs SGLang vs TRT-LLM 详细 Benchmark
- 链接:https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
- Benchmark 核心数据(Llama-3.1 70B,TP=4,FP8):
| 引擎 | 配置 | 吞吐量 |
|---|---|---|
| vLLM | TP=4, FP8 | ~2,800 tok/s |
| TRT-LLM | TP=4, FP8, compiled | ~3,400 tok/s(+21%) |
| SGLang | TP=4, FP8 | ~2,900 tok/s |
- DeepSeek-R1 671B @ SGLang EP=8:~1,100 tok/s(8× H100)
- Llama-3.1 8B @ TRT-LLM:~14,500 tok/s(vs vLLM ~12,000 tok/s)
- 三者共有特性:Continuous Batching、Prefix Caching、Speculative Decoding、FlashAttention/PagedAttention
- 可信度:⭐⭐⭐⭐(专业技术博客,benchmark 数据完整)
- 标签:
推理引擎BenchmarkTensorRT-LLMvLLMSGLang - 操作建议:高吞吐批量推理优先 TRT-LLM;快速迭代 / Agent 场景优先 SGLang;需要易用性选 vLLM
3. Yotta Labs · vLLM vs TensorRT-LLM 选型(2026)
- 链接:https://www.yottalabs.ai/post/vllm-vs-tensorrt-llm-which-inference-engine-should-you-use-in-2026
- 关键结论:vLLM 是快速上线基线;TRT-LLM 适合 NVIDIA 规模化环境微秒级延迟,但需要专业 MLops 团队(年薪六位数);两者可共存(稳定大volume 场景用 TRT-LLM,变化场景用 vLLM)
- 可信度:⭐⭐⭐⭐(GPU 基础设施提供商,有实际部署经验)
- 标签:
推理引擎vLLMTensorRT-LLM选型生产 - 操作建议:作为团队内部选型文档补充
☁️ 三、Cloud-Native(NVIDIA Dynamo 更新 + llm-d 进展)
★ 高价值条目
1. NVIDIA Dynamo 1.4.1(2026-08-22 发布)
- 来源:Stephen noon 棒协调文件提及,GitHub 持续更新
- 定位:数据中心级分布式推理编排层(llm-d 的上游编排组件)
- 评价:⭐⭐⭐⭐⭐ 工程化层级二次升级,NVIDIA 官方持续背书
- 操作建议:关注 Star 增长;与 llm-d CNCF Sandbox 进度对照
2. llm-d CNCF Sandbox + KServe 集成(2026-03 起)
- 今日上午简报已收录:llm-d CNCF Blog、KServe + llm-d + vLLM 生产级组合
- 补充:Oracle OCI + llm-d 完整部署路径(裸金属 GPU + RDMA)
- 可信度:⭐⭐⭐⭐⭐(CNCF 官方 + Oracle 官方博客)
- 标签:
CNCFllm-dKServe分布式推理Kubernetes - 操作建议:生产团队评估 llm-d vs Dynamo 选型;关注 KubeCon EU 2026 记录
💻 四、CSDN(高价值 · noon 协调棒识别缺口)
noon 协调棒识别 CSDN 为当天覆盖最弱分类(仅 6 件命中)。本次聚焦推理引擎生产部署排障和版本配置实操。
★ 高价值条目
1. CSDN星图 · SGLang vs vLLM MCP对比(2026年)
- 链接:https://mcp.csdn.net/6a2e4df2662f9a54cb7eeb74.html
- 核心内容:
- SGLang 启动命令:
python3 -m sglang.launch_server --model-path /path --host 0.0.0.0 --port 30000 - vLLM 启动命令:
python -m vllm.entrypoints.api_server --model /path --host 0.0.0.0 --port 8000 - SGLang 版本验证:
import sglang; print(sglang.__version__)→ 应输出 0.5.6.post1 或以上 - GitHub Stars:SGLang ~5.8k(快速增长),vLLM ~18k(非常活跃)
- CSDN星图镜像广场已将 SGLang 推荐为 GLM-4.6V 等多模态模型首选后端引擎
- 可信度:⭐⭐⭐⭐(CSDN MCP技术社区,有实际命令,环境明确)
- 标签:
SGLangvLLMMCPCSDN版本验证多模态 - 操作建议:直接作为团队部署文档参考;对比上午简报 Jarvis Labs 数据交叉验证
2. DeepSeek CSDN · vLLM与SGLang DeepSeek-V4 高并发优化(2026年)
- 链接:https://deepseek.csdn.net/6a211c7910ee7a33f277840f.html
- 核心内容:
- 典型 OOM 排障:
CUDA out of memory→block_num→max_num_blocks公式:max_num_blocks = (显存GB×1024×0.8)/block_size - 吞吐骤降诊断脚本:
radix_hit_rate+analyze_template_variability(min_samples=100, variability_threshold=0.3) - 延迟毛刺预防:设置
gpu_memory_utilization监控告警(超过阈值易 OOM) -
关键参数对照表(vLLM vs SGLang):
参数 vLLM 最优值 SGLang 最优值 影响维度 max_num_seqs64(A100)/ 128(H100) N/A 并发容量 radix_cache_sizeN/A 1000 模板缓存命中 gpu_memory_utilization0.85 0.9 超限 OOM enforce_eagerTrue(安全验证)/ False(性能) - 计算图固化 chunk_size128 256 显存局部性 -
混合部署架构:短文本/高并发 → SGLang;长文档分析 → vLLM;分派逻辑:长度 >2k → vLLM;模板匹配度 >0.7 → SGLang
- 可信度:⭐⭐⭐⭐(DeepSeek 技术社区,生产排障经验,有公式和诊断命令)
- 标签:
vLLMSGLangDeepSeek-V4OOM排障参数调优CSDN - 操作建议:精读;纳入推理引擎运维 checklist;交叉验证
enforce_eager分阶段部署策略
3. DeepSeek CSDN · vLLM与SGLang 32K上下文深度对比(2026年)
- 链接:https://deepseek.csdn.net/6a04133a54b52172bc73ae00.html
- 核心数据(32K 上下文压力测试):
- vLLM:50+ 并发时平均吞吐 ~1,200 tok/s,GPU 显存利用率 90%+,P99 尾延迟 <800ms
- SGLang:8K 以下场景吞吐可达 1,800 tok/s,32K 文档时降至 900 tok/s,显存冗余缓存 15-20%
- SGLang 冷启动:约 90 秒(RadixTree 构建);vLLM 冷启动:约 30 秒
- SGLang 自适应窗口(5-50ms):P99 延迟降低 35-40%;vLLM 固定 10ms 窗口突发流量时 P99 增加 40-60ms
- 可信度:⭐⭐⭐⭐(DeepSeek 技术社区,具体 benchmark 数据)
- 标签:
vLLMSGLang长上下文BenchmarkCSDN - 操作建议:对照上午简报 Jarvis Labs 数据;判断长文档场景选型
4. 智能体开发者社区 · Qwen3.6-Heretic 三框架对比(2026年)
- 链接:https://adg.csdn.net/6a311ff410ee7a33f27df3dd.html
- 核心内容(vLLM / SGLang / KTransformers 三框架对比 Qwen3.6-Heretic):
| 特性 | vLLM | SGLang | KTransformers |
|---|---|---|---|
| 推理速度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 内存效率 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 部署复杂度 | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 多模态支持 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
| 工具调用 | ✅ | ✅ | ⚠️有限 |
| MTP 支持 | ✅ | ✅ | ❌ |
- vLLM 启动:
uv pip install vllm --torch-backend=auto - SGLang 安装:
uv pip install sglang[all] - SGLang 启动:
python3 -m sglang.launch_server --model-path Qwen/Qwen3.6-27B --port 30000 - 可信度:⭐⭐⭐(社区文章,部分数据需交叉验证)
- 标签:
QwenvLLMSGLangKTransformersCSDN - 操作建议:参考三框架特性对比;KTransformers 作为低配置备选
5. openEuler 社区 · vLLM与SGLang 性能横评
- 链接:https://openeuler.csdn.net/6a5f9f8310ee7a33f2911aa6.html
- 核心内容:
- vLLM = 规模化部署"基石";SGLang = 复杂应用"加速器"
- 建议:吞吐优先/简单提示 → vLLM;首 Token 延迟优先/复杂提示/大量前缀复用 → SGLang
- 开发者体验:vLLM 更简单直接;SGLang 需要理解执行图和优化思想
- 可信度:⭐⭐⭐(社区技术博客,选型建议有参考价值)
- 标签:
vLLMSGLang选型openEulerCSDN
6. 阿里云函数计算 · SGLang vs vLLM 单卡/多卡实测(Qwen 模型)
- 链接:https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm
- 核心数据:
- SGLang 启动速度比 vLLM 快约 30%
- 多卡性能提升与模型算力需求正相关:大模型双卡收益 20%~50%
- 显存利用率均接近 100%(推理期间 SM 利用率 100%,空闲时 0%)
- Qwen-QWQ-32B-AWQ 建议最大并发数 ≤5(单卡 ~35 tok/s,双卡 ~50 tok/s)
- Qwen-QWQ-32B(FP16):Ada 单卡显存不足,需双卡 ~20 tok/s
- 可信度:⭐⭐⭐⭐(阿里云官方文档,真实云环境实测,工具:魔搭 evalscope)
- 标签:
SGLangvLLM阿里云QwenBenchmark函数计算 - 操作建议:作为云上选型的官方数据参考
🔬 五、Reproduction(KV Cache 优化 · 新 eviction 策略)
★ 高价值条目
1. Awesome-KV-Cache-Optimization · 新增论文条目(2026年新增)
- 链接:https://github.com/jjiantong/Awesome-KV-Cache-Optimization
- 2026年新增 eviction 策略:
- ChunkKV:语义保留的 chunk 级 KV Cache 压缩(Xiang Liu et al.)
- OBCache:Hessian 引导的 token 重要性评分最优脑 KV Cache 剪枝(Yuzhe Gu et al.)
- LLM-AnDPro:锚方向投影的 KV Cache 精确 eviction(Zijie Geng et al.)
- 可信度:⭐⭐⭐⭐(ACL 2026 Findings 配套资源库,持续更新)
- 标签:
KV CacheEvictionChunkKVOBCacheACL2026 - 操作建议:按 eviction policy 分类复现对比;追踪 ChunkKV 源码
2. TurboQuant · ICLR 2026(Google Research)
- 来源:MarkTechPost + ICLR 2026
- 核心机制:两阶段管道: 1. PolarQuant(AISTATS 2026):随机正交旋转重新分布方差,再用标量量化器精确量化 KV 2. QJL(Quantized Johnson-Lindenstrauss):对量化残差应用 1-bit QJL 校正
- 无需训练或校准;解决 MSE 最优标量量化器在注意力计算中的系统性偏差累积问题
- 可信度:⭐⭐⭐⭐⭐(ICLR 2026 接收,Google Research 出品)
- 标签:
KV Cache量化TurboQuantICLR2026Google - 操作建议:追踪论文源码;评估与 PagedAttention 的集成方式
3. HCAttention · 12.5% GPU Cache 实现方案
- 来源:Neurocomputing / ScienceDirect(2026)
- 链接:https://www.sciencedirect.com/science/article/abs/pii/S0925231226016450
- 核心数据:
- GPU cache 压缩至 12.5%,同时与 full-attention 模型精度具有竞争力
- 动态可逆 eviction 算法:非永久性驱逐,热门信息保留在 GPU,GPU 满时将不常用数据临时移出而非永久删除
- 非对称 K-V 流水线:GPU 上 key 评分 + 延迟 CPU value 获取
- 可信度:⭐⭐⭐⭐(同行评审期刊论文)
- 标签:
KV CacheHCAttentionEviction压缩学术 - 操作建议:与 ChunkKV/OBCache 等 eviction 策略对比;评估硬件兼容性
4. IEEE TED · 3-D Ferroelectric-Based KV Cache(2026-05)
- 来源:IEEE Transactions on Electron Devices
- 核心内容:3-D 1T-nC-1T 铁电材料 KV Cache 硬件设计,面向高效长上下文 LLM 推理
- 可信度:⭐⭐⭐⭐(IEEE 期刊,同行评审)
- 标签:
KV Cache硬件IEEE长上下文 - 操作建议:作为硬件感知推理工程的前沿研究方向追踪
📦 六、Agent 框架 Substack(本次新增 · 选型决策视角)
★ 高价值条目
1. Sid Saladi · "Agent Frameworks 101: The Complete Guide"(substack 2026)
- 链接:https://sidsaladi.substack.com/p/agent-frameworks-101-the-complete
- 作者:Sid Saladi(运行 15-agent 自动化系统,内容管线每日运行)
- 核心框架覆盖:LangGraph、CrewAI、AutoGen、Anthropic Agent SDK、OpenAI Agents SDK、Smolagents、Mastra、Agno、Pydantic AI
- 方法论:非营销话术,基于生产经验的真实选型判断;每框架说明"什么场景有效,什么场景失效"
- 可信度:⭐⭐⭐⭐⭐(一线生产者视角,生产经验可验证)
- 标签:
Agent框架LangGraphCrewAIAutoGen选型Substack - 操作建议:精读;作为团队 Agent 框架选型的主要参考
2. AI Mastery · "Production AI Engineering: Building Enterprise-Grade AI Agents"(substack 2026-08-04)
- 链接:https://aiamastery.substack.com/p/production-ai-engineering-building
- 核心内容:
- Agent 1(安全客服):Layer 4 注入拦截 <5ms;Layer 3 RBAC 强制执行;Layer 2 语义缓存减少 token 成本 40%
- Agent 2(多智能体研究系统):SupervisorAgent 通过
asyncio.gather()分发三个并行 WorkerAgent,单个失败不影响整体 - 架构设计模式:Layered control(安全/控制/缓存/扫描)
- 可信度:⭐⭐⭐⭐(课程配套内容,工程细节具体)
- 标签:
Agent生产多Agent架构Substack - 操作建议:参考分层控制设计;
asyncio.gather()模式可纳入工程 checklist
3. Simon Willison · "Coding Agents for Data Journalists"(substack 2026)
- 链接:https://simonw.substack.com/p/fireside-chat-about-agentic-engineering
- 核心内容:数据新闻记者的 coding agent 实用教程;工具链:Claude Code + OpenAI Codex;工作流:数据探索→清洗→分析
- 可信度:⭐⭐⭐⭐(Simon Willison 知名独立博主,技术准确度高)
- 标签:
AgentCodingSimon WillisonSubstack - 操作建议:作为 Agent 工程入门材料参考;对比 The AI Engineer 系列
📋 分类标签总览
| 分类 | 核心标签 |
|---|---|
| MCP安全(新增主轴) | MCP CVE ProtoAmp AttestMCP NSA/CISA OWASP CSA RCE |
| Backend | 推理引擎 SGLang v0.5.17 TensorRT-LLM v1.2.1 vLLM Benchmark Ollama |
| Cloud-Native | NVIDIA Dynamo 1.4.1 llm-d CNCF KServe 分布式推理 |
| CSDN | vLLM SGLang OOM排障 参数调优 DeepSeek-V4 Qwen3.6 阿里云 |
| Reproduction | KV Cache ChunkKV OBCache TurboQuant HCAttention Eviction ICLR2026 |
| Agent框架 | LangGraph CrewAI AutoGen Anthropic SDK OpenAI SDK Smolagents 选型 |
✅ 操作建议汇总
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 精读 | arXiv:2601.17549 ProtoAmp MCP 安全分析 | MCP-1 |
| 🔴 精读 | Sid Saladi Agent Frameworks Complete Guide | Agent-1 |
| 🟠 精读 | DeepSeek CSDN vLLM vs SGLang OOM 排障参数对照表 | CSDN-2 |
| 🟠 精读 | CSA MCP Security Crisis + NSA CSI_MCP_SECURITY | MCP-2,4 |
| 🟠 精读 | LeetLLM 版本清单 + InferenceEngineering Benchmark | Backend-1,2 |
| 🟡 关注 | TurboQuant 源码(ICLR 2026 Google Research) | Reproduction-2 |
| 🟡 关注 | NVIDIA Dynamo 1.4.1 Star 趋势 | Cloud-Native-1 |
| 🟡 关注 | HCAttention 论文源码(12.5% GPU cache) | Reproduction-3 |
| 🟡 关注 | ChunkKV / OBCache / LLM-AnDPro | Reproduction-1 |
建议写入路径:/shared/research-kb/inbox/jay/2026-08-25T1505-jay-afternoon-supplement.md
本次新增主轴:MCP 安全专题(协议级漏洞 + 40+ CVE + AttestMCP 修复方案)
是否需要精读/审稿/主题页更新: - 精读:MCP 安全三条核心文献(arXiv:2601.17549、CSA、NSA PDF)+ Sid Saladi Agent 框架指南 + DeepSeek CSDN OOM 排障 - 主题页更新建议:Agent Security 主题页新增 MCP 安全专节(包含 CVE 清单 + AttestMCP 对比);Inference Engines 主题页补充 SGLang v0.5.17 / TRT-LLM v1.2.1 版本数据