inference · E1 预消化简报(2026-09-12)

状态摘要

  • 增量条数5 条主增量(在 3-8 目标区间内;性质属 v3.29→v3.30 升档棒后 ~18h 净窗口期,工程化落地与新 paper_card 入库双重贡献)
  • 性质:本棒属于 v3.30 落定后 18h 净窗口期,核心贡献 = ① NVIDIA Dynamo 1.0 正式生产落地(取代 Triton)+ ② SGLang v0.5.19 Beam Search 里程碑上线 + ③ vLLM v0.20.2 生产成熟度确认 + ④ vLLM 调优实战命令集 NET-new + ⑤ Detokenization Side-Channel 安全漏洞(邻接 inference 部署安全)
  • 涉及 arXiv 号arXiv:2609.11085(Beyond Solver Verdicts · Generative Reward Models · llm-infra paper_card 1328 · 本棒锚入预备级)+ arXiv:2609.06674(Detokenization Leaks · 侧信道隐私漏洞 · 安全邻接 inference 部署)+ arXiv:2609.07529(CoRL · Least Privilege on Tool Calls · 安全邻接 inference 部署 · ASR 25.8%→1.0%)+ arXiv:2609.10445(Building Multilingual Bridges · llm-infra paper_card 1330 · L2 reasoning 跨语言推理)+ arXiv:2608.15380(Adaptive Bridge · llm-infra paper_card 1334 · ROS2 DDS 反压缓解 · 邻接 inference 分布式调度)

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-12 22:00 自动生成)

  • 选题榜未成视频脚本 2 件:2609.11699(Negative Self-Distillation · jay 认领)+ 2609.10539(IdeaAMBIG · agent 主分类)
  • 待写攻略 3 件(bishop555/Solana-Drainer-Tool / LMDHQ-0420/ResearchPilot-Skills / moorcheh-ai/memanto)
  • 无 inference 专项主题缺货警告

1.2 inbox/tom 9-12 棒位

  • 2026-09-12T2040-agent-rag-longcontext-radar.md(20:40 CST · 第 3 次 radar · GenV arXiv:2609.11085 高价值 + Think Before You Link + ActReview + Substack AI Agents Stack 2026)
  • 2026-09-12T1440-agent-rag-longcontext-radar.md(14:40 CST · EBL-Core + MaP-WAM + Think Before You Link + IdeaAMBIG)
  • 2026-09-12T0840-agent-rag-longcontext-radar.md(08:40 CST · MaP-WAM + Think Before You Link + EBL-Core + IdeaAMBIG)
  • 2026-09-12-0900-hf-daily-2026-09-12.md(09:00 CST · 15 篇 · X-AuT 13▲ + PARSER 17▲ + SAEScientist-Bench 16▲ + Discovery Cert Protocol 16▲;无 inference 专属新条目)
  • 2026-09-12-rag-e1prep.md(08:53 CST · RAG 主轴 · 0 件 inference 主轴纯增量)
  • 2026-09-12-evaluation-e1prep.md(15:43 CST · Evaluation 主轴 · 0 件 inference 主轴纯增量)

1.3 inbox/jay 9-12 inference 相关工程文件

  • 2026-09-12T1505-jay-afternoon-briefing-inference-dynamo-sglang-vllm.md(15:05 CST · 本棒 inference 主轴核心源 = NVIDIA Dynamo 1.0 + SGLang v0.5.19 + vLLM v0.20.2 + SGLang × TPU + Miles + GLM5.2 NVFP4 500 TPS + GB300 25× + Dynamo Day 2026 · 7 件 NET-new 事件级/方法学
  • 2026-09-12-vllm-tuning-commands.md(14:52 CST · NET-new vLLM 调优实战命令锚入预备级
  • 2026-09-12T1950-jay-evening-engineering-filter.md(19:50 CST · 本棒 inference 主轴 = Detokenization Leaks 2609.06674(安全邻接)+ CoRL 2609.07529(安全邻接)+ NVIDIA OpenShell(GTC 2026)+ Φ-Bench 2609.10226 + DeepMind Swarm 安全发现
  • 2026-09-12T1050-jay-engineering-filter.md(10:53 CST · vLLM 推理优化 5 种 + LLM 三引擎决策框架)
  • 2026-09-12-1620-jay-csdn-llm-deploy-rag-agent.md(16:20 CST · 5 件 CSDN 工程化)
  • 2026-09-12T1335-jay-five-category-briefing.md(13:36 CST · OpenViking + State of Open Models + Quantization-Aware Healing)
  • 2026-09-12T0820-jay-csdn-inference-rag-multiagent-highvalue-sep12.md(08:20 CST · v2 精修版 · CSDN WAF 521 限制 · snippet-only ⭐⭐⭐ 上限)

1.4 inbox/spark 9-12 llm-infra e1prep(2026-09-12 18:40 CST)

  • 本棒 llm-infra 主轴核心 = 3 件 NET-new paper_card 主分类 llm-infra 入库:arXiv:2609.11085 Beyond Solver Verdicts(1328)+ arXiv:2609.10445 Building Multilingual Bridges(1330)+ arXiv:2608.15380 Adaptive Bridge(1334)
  • 2 件邻接级 llm-infra:EBL-Core(1314)+ MaP-WAM(1322)
  • Albireo + Helium + KVShareArena + PRVS Framework 等 6 件工程主轴锚入

1.5 inbox/stephen 9-12 llm-application e1prep(2026-09-12 10:36 CST)

  • NVIDIA × HF $129.3B 收购 7 源独立验证;无 inference 主轴净增

1.6 inbox/flyp 9-12 multimodal + risk e1prep(2026-09-12 09:43 + 16:37 CST)

  • WMRL 437▲ + SpatialBlock 68▲;无 inference 主轴纯增量

1.7 paper_cards 近 3 天 inference 相关新卡(Sep 10-12 入库)

编号 arXiv 标题 主分类 形态 与 inference 关系
1328-2609.11085 2609.11085 Beyond Solver Verdicts(Generative Reward Models) llm-infra method 🔥 NET-new paper_card 9-12 12:30 入库 · VPU 漏洞形式化 · 神经符号系统推理正确性边界
1330-2609.10445 2609.10445 Building Multilingual Bridges(L2 Reasoning) llm-infra method 🔥 NET-new paper_card 9-12 12:30 入库 · 模型在提示语言中一致推理
1334-2608.15380 2608.15380 Adaptive Bridge(ROS2 DDS) llm-infra method 🔥 NET-new paper_card 9-12 12:30 入库 · 分布式系统背压缓解 · 邻接推理调度
1318-2609.11808 2609.11808 Generative Late-Interaction Embeddings rag method 邻接(RAG 压缩)
1314-2609.11596 2609.11596 EBL-Core agent application 邻接(Agent 执行边界)
1322-2609.11561 2609.11561 MaP-WAM agent method 邻接(Agent 记忆规划)
1315-2609.11294 2609.11294 Memory Compression for Agents agent method 邻接(Agent 并发内存)
1317-2609.11412 2609.11412 X-AuT multimodal method 邻接(语音 LLM 压缩)
1320-2609.10745 2609.10745 Think Before You Link rag method 邻接(RAG 检索质量)
1319-2609.05903 2609.05903 EvoSafeHarness evaluation method 邻接(Agent 安全 Harness)

1.8 inference.md 活文档基线确认

  • inference.md v3.30(2026-09-12 04:00 升档)已覆盖:Negative Self-Distillation(2609.11699)+ Generative Reward Models(2609.11085 paper_card 1328)+ SGLang/LMDeploy 16.2k tok/s + DeepSeek MLA 3.1× + vLLM Blackwell 26.2k + MemoryAlloy 9.9× + SGLang 0.5.19 Beam Search + xgrammar + LMDeploy TTFT + 引→约 575
  • 沿用件套(v3.30 闭合级)= arXiv:2609.03430 + arXiv:2606.19746 + arXiv:2609.01316 + arXiv:2609.01777 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2508.08438 + arXiv:2609.06008 + arXiv:2609.07139 + arXiv:2609.04971 + arXiv:2509.01809 + arXiv:2609.11412 + arXiv:2609.11294

二、增量条目(5 条主增量)


增量 ① NVIDIA Dynamo 1.0 正式生产发布:推理编排层正式取代 Triton(NET-new 事件级 · ⭐⭐⭐⭐⭐)

  • 来源:jay 9-12 15:05 afternoon-briefing-inference-dynamo-sglang-vllm.md §1(NVIDIA 新闻稿 + 技术博客 + GTC)+ Dynamo Day 2026(16 场 Session)+ NVIDIA Developer Forum
  • 要点:Dynamo 1.0 是 NVIDIA 开源推理框架的正式生产版本,正式取代 Triton Inference Server 成为 NVIDIA 推荐推理编排层(2026-09 节点)。核心设计目标:分布式推理、多节点扩展、KV-Cache 感知的请求路由与智能调度。支持 SGLang、TensorRT-LLM、vLLM 作为后端引擎,Dynamo 作为编排层。关键数字:KV-aware Router + KV Cache Manager 实现 up to 4× lower TTFT + 1.5× higher throughputModelExpress 大 MoE 模型(DeepSeek V3 等)checkpoint 恢复和权重流式加载加速 up to 7×(结合 NIXL 和 NVLink)。与 NVIDIA NeMo Agent Toolkit 深度集成。
  • 与活文档现有脉络的关系:与 inference.md §1.(2) 推理调度子轴 + §1.(1) 推理引擎方法学子轴直接关联。Dynamo 1.0 正式取代 Triton 是 2026 年推理基础设施格局的里程碑事件——vLLM/SGLang/TensorRT-LLM 被统一在 Dynamo 分布式调度框架下,解决了 Agentic 推理多轮对话、跨节点 KV-Cache 复用等工程难题。Dynamo Day 2026(9 月)发布 16 场 Session,标志 NVIDIA 正式将推理编排纳入核心产品线。
  • 建议归入节:§1.(1) 推理引擎方法学(Dynamo 1.0 正式生产 · 取代 Triton)+ §1.(2) 推理调度子轴(KV-aware Router 4× TTFT 改善 · ModelExpress 7× checkpoint 恢复)
  • arXiv 号清单:无 direct arXiv(NVIDIA 产品发布);相关理论支撑 = arXiv:2609.10266 KVShareArena(跨节点 KV-Cache 复用边界)+ arXiv:2609.05565 Sustainable Distributed LLM Inference(调度+可持续性)
  • 可信度:★★★★★(NVIDIA 官方发布 + 技术博客 + GTC 背书 + 论坛多源)

增量 ② SGLang v0.5.19 + Beam Search 里程碑上线(NET-new 事件级 · ⭐⭐⭐⭐)

  • 来源:jay 9-12 15:05 + SGLang GitHub + X(@sgl_project) 2026-09-08
  • 要点:SGLang v0.5.19(2026-09-08)重大更新:① Beam Search 正式上线(里程碑功能,生产推理常用需求终于有官方支持);② 新增模型支持:Qwen3.8 + Qwen3.8-27B、Granite 4.2、Spark2.5、LongCat-Image-Edit(Diffusion)、Ling-3.0-flash/tiny、dots3.note 等 10+ 新模型;③ 786 PRs / 214 contributors / 51 新贡献者,生态持续高速增长。背景:v0.5.15(July 2026)Breakable CUDA Graph(BCG)已成为默认 prefill 计算后端,BCG 构建速度比 torch.compile piecewise backend 快 3.8–5.2×,重放速度快 17%
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 SGLang v0.5.19 Beam Search 直接更新(Beam Search 是 inference.md v3.30 新增内容);与 §1.(3) KV Cache 子轴邻接(BCG 降低 prefill graph 构建开销)。
  • 建议归入节:§1.(1) 推理引擎方法学(SGLang v0.5.19 Beam Search 里程碑上线 · 10+ 新模型)+ §1.(3) KV Cache 子轴(BCG 默认化降低 prefill 开销)
  • arXiv 号清单:无 direct arXiv(SGLang 开源发布);理论支撑 = arXiv:2609.06008 Cadence(BCG 基础)
  • 可信度:★★★★(SGLang GitHub + 官方 X 公告 + 多源验证)

增量 ③ vLLM v0.20.2 生产部署成熟度确认(NET-new 事件级 · ⭐⭐⭐⭐)

  • 来源:jay 9-12 15:05 + SitePoint/VRLA Tech/Lyceum/Spheron(2026年4-7月多源)+ vLLM 官方博客
  • 要点:vLLM v0.20.2(截至 2026-05)为当前稳定版本,生产默认配置逐渐标准化。vLLM V1 重架构确认(Near-zero-overhead scheduler + multiprocessing API Server 突破 GIL + near-zero-overhead prefix caching)。生产推荐硬件:NVIDIA RTX PRO 6000 Blackwell(96GB ECC GDDR7,带宽 1.8 TB/s);4× RTX PRO 6000 → 联合显存 384GB,聚合带宽 7.2 TB/s。vLLM Production Stack Helm Charthelm install vllm vllm/vllm-stack)生产就绪。Prefill-Decode Disaggregation 在 AMD 8-GPU MI300X 节点生产验证(韩国 Meetup 2026)。v0.29.0rc3 预发布版持续推进。
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 vLLM V1 架构(5 大核心变化)直接更新;与 §1.(2) 推理调度子轴邻接(PD Disaggregation 生产验证)。
  • 建议归入节:§1.(1) 推理引擎方法学(vLLM v0.20.2 生产成熟度确认 + V1 架构确认)+ §1.(2) 推理调度子轴(PD Disaggregation AMD MI300X 生产案例)
  • arXiv 号清单:无 direct arXiv(vLLM 版本发布);相关 = arXiv:2603.16104 Agentic Workflows(PD disaggregation 适用场景分析)
  • 可信度:★★★★(多源验证 + vLLM 官方博客 + Spheron/Lyceum 工程验证)

增量 ④ vLLM 性能调优实战命令集(NET-new 事件级 · ⭐⭐⭐⭐ · 工程落地)

  • 来源:jay 9-12 14:52 vllm-tuning-commands.md + Red Hat Developers 2026-03-03 原文
  • 要点:Red Hat Developers 发布的 vLLM 生产调优实战命令集,系统性调参步骤:
  • --max-num-seqs 256:从单并发基准测试开始,找到吞吐量和 TTFT 开始下降的拐点;持续监控 P95/P99 延迟确保 SLO 合规
  • --kv-cache-dtype=fp8:VRAM 减少约 50%,H100 上生成吞吐量提升至 1.6×;需确认 GPU 型号支持原生 FP8 tensor cores(H100 SXM)
  • 监控指标:吞吐量 / TTFT / P95/P99 延迟 / GPU 利用率;识别方法:逐步增加并发直到系统启动失败或过载,然后略微回退找到安全操作边界
  • JarvisLabs 5 种优化路径:Prefix Caching / FP8 KV-Cache / CPU Offloading / P/D Disaggregation / Zero Reload Sleep Mode
  • Spheron 选型框架:vLLM(突发 diverse 负载)vs TensorRT-LLM(低延迟敏感)vs SGLang(共享上下文重复负载)
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 vLLM 调优内容直接补充(将模糊方向落实为具体命令参数);与 §4.1 推理经济学子轴邻接(调优→成本优化)。
  • 建议归入节:§1.(1) 推理引擎方法学(vLLM 调优命令集 ⭐⭐⭐⭐)+ §4.1 推理经济学与生产工程(FP8 KV-cache 50% VRAM 节省 + 1.6× 吞吐量提升)
  • arXiv 号清单:无 direct arXiv(工程实践文档);相关 = arXiv:2504.19874 TurboQuant(FP8 KV cache 量化背景)
  • 可信度:★★★★(Red Hat Developers 原文 + 真实命令参数 + 多源 Spheron/JarvisLabs 印证)

增量 ⑤ Detokenization Leaks(arXiv:2609.06674):共享本地 LLM Backend 侧信道隐私漏洞(NET-new 安全邻接级 · ⭐⭐⭐⭐)

  • 来源:jay 9-12 19:50 evening engineering filter + arXiv:2609.06674(cs.CR · September 2026)
  • 要点:大多数本地部署采用 client-server 架构(Ollama / LM Studio),backend 暴露 localhost API。核心漏洞:多用户共享同一 backend 实例时,detokenization 时间可以作为侧信道(side-channel)泄露其他用户的 LLM 输出——即使用加密通信,token 生成时间的细微差异可被攻击者测量并用于重建他人输出。论文给出了具体泄露率数据:桌面端(Phi-3-mini on Llama.cpp)通过 cache traces 可部分重建输出;服务器端(4-bit 量化后)仍存在泄露风险。受影响系统:Ollama(月活高增长,本地 LLM 推理事实标准)、LM Studio、其他共享 backend 本地推理工具。
  • 与活文档现有脉络的关系:与 inference.md §3.5 KV Cache 安全子轴(Shadow in the Cache 明文存储 + MATS Encryption Attacks)直接互补——前者是 KV-cache 明文存储攻击,后者是 detokenization 时序侧信道攻击。共同构成 inference 部署安全的新安全维度。Ollama 安全性是 llama.cpp 安全警示(inference.md §1.1)的延伸,但攻击面从 GGUF parser 扩展到共享 backend 的时序侧信道。
  • 建议归入节:§3.5 KV Cache 安全新维度(Detokenization Side-Channel · 共享 backend 隐私泄露 · Ollama/LM Studio 受影响)+ §1.1 框架格局(补充 Ollama 共享 backend 安全边界警示)
  • arXiv 号清单arXiv:2609.06674 = 1 件 NET-new 安全邻接级 inference
  • 可信度:★★★★(arXiv cs.CR 安全论文,有具体量化泄露率数据)

三、矛盾/待核实条目

  • 问题描述:HF Daily paper_card 1329(2609.10745)TLDR 原文:"SOTA 准确率下降 15.4–39.9%",描述性能下降;但 Tom rag e1prep(2026-09-12 08:53)引用 "方向写反:实际原文是 +6.9% 整体 / +23.3% 罕见实体增益"。两条记录在同一知识库中对同一数字给出相反描述,需要原文核验。
  • 建议动作:精读 arXiv:2609.10745 原文,核实 rare entity 切片上 accuracy 究竟是下降还是提升
  • 来源:paper_card 1329 TLDR vs Tom rag e1prep §增量 ② 标注

待核实 ② CoRL(arXiv:2609.07529)Least Privilege 数字在 inference.md 的锚入位置

  • 问题描述:jay 9-12 19:50 披露 CoRL(Least Privilege on Tool Calls)ASR 从 25.8% 降至 1.0%,是 Agent 安全工程直接可操作建议。该数字与 inference 部署的关联在于:Ollama 共享 backend 安全漏洞(Detokenization Leaks)与 least-privilege on tool calls 是两个不同维度的安全建议,需要确认两者是否都在 inference.md §3.5 中锚入。
  • 建议动作:在 §3.5 补入 CoRL least privilege on tool calls(arXiv:2609.07529)作为 inference 部署安全的工程化建议

待核实 ③ NVIDIA Dynamo 1.0 KV-aware Router 4× TTFT claim 来源核实

  • 问题描述:jay 9-12 15:05 披露"Dynamo KV-aware Router + KV Cache Manager 实现 up to 4× lower TTFT + 1.5× higher throughput"。Dynamo Day 2026 Session 中是否有独立第三方实测数据?
  • 建议动作:查找 NVIDIA Dynamo 官方 benchmark 数据,确认 4× TTFT 是在什么条件下测得(模型/硬件/batch size)

待核实 ④ vLLM v0.20.2 版本真实性

  • 问题描述:多个来源(SitePoint / VRLA Tech / Lyceum / Spheron)引用 v0.20.2,但 inference.md v3.30 最新锚入的是 v0.28(2026-08)和 v0.29.0rc3(预发布)。v0.20.2 是否是 2026 年 5 月的旧版本被反复引用,还是有 v0.20.x 更新?
  • 建议动作:核实 vLLM GitHub releases 页面,v0.20.x 实际发布时间

四、可引用的 arXiv 号列表

arXiv 号 标题 主分类 形态 锚定位置
2609.11085 Beyond Solver Verdicts / Generative Reward Models llm-infra method paper_card 1328 · 9-12 12:30 入库 · NET-new 锚入预备级
2609.10445 Building Multilingual Bridges(L2 Reasoning) llm-infra method paper_card 1330 · 9-12 12:30 入库 · NET-new 锚入预备级
2608.15380 Adaptive Bridge(ROS2 DDS Backpressure) llm-infra method paper_card 1334 · 9-12 12:30 入库 · NET-new 锚入预备级
2609.06674 Detokenization Leaks(Side-Channel Privacy) security vulnerability NET-new 安全邻接级锚入 §3.5
2609.07529 CoRL(Least Privilege on Tool Calls) agent method NET-new 安全邻接级锚入 §3.5(待核实)
2609.10226 Φ-Bench(LLM 基础设施工程 benchmark) llm-infra benchmark 邻接级锚入预备级(Jay 9-12 evening)
2609.11596 EBL-Core agent application 邻接级(Agent 执行边界)
2609.11561 MaP-WAM agent method 邻接级(Agent 记忆规划)
2609.11808 Generative Late-Interaction Embeddings rag method 邻接级(RAG 压缩)
2609.10745 Think Before You Link rag method 邻接级(RAG 检索质量 · ⚠数字待核实)
2609.10266 KVShareArena systems benchmark 预备级锚入 §1.(3)
2609.05565 Sustainable Distributed LLM Inference llm-infra survey 预备级锚入 §1.(2)

五、给今晚活文档接力的建议

今晚 inference 活文档(knowledge/inference.md)接力方向建议:

  1. §1.(1) 推理引擎方法学 补入 Dynamo 1.0 + SGLang v0.5.19 + vLLM v0.20.2 三件套:Dynamo 1.0 正式取代 Triton(⭐⭐⭐⭐⭐);SGLang Beam Search 里程碑;vLLM V1 生产成熟度确认
  2. §1.(1) 推理引擎方法学 补入 vLLM 调优命令集--max-num-seqs 256 + --kv-cache-dtype=fp8 + 监控 SLO 方法论
  3. §4.1 推理经济学 补入 vLLM FP8 KV-cache 数字:50% VRAM 节省 + 1.6× 吞吐量提升(H100 实测)
  4. §3.5 KV Cache 安全 补入 Detokenization Leaks(arXiv:2609.06674):共享 backend 侧信道隐私漏洞 + Ollama/LM Studio 受影响
  5. §3.5 补入 CoRL Least Privilege on Tool Calls(arXiv:2609.07529):ASR 25.8%→1.0%,待核实后锚入
  6. 待核项目:Think Before You Link 数字方向矛盾(P0);Dynamo 1.0 4× TTFT 独立核实;vLLM v0.20.2 版本真实性

六、本棒检查过的来源完整清单

work-queue.md(2026-09-12 22:00)
inference.md(v3.30,2026-09-12 04:00 升档)
inbox/tom/2026-09-11-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-10-inference-e1prep.md(9-10 基准)
inbox/tom/2026-09-12T2040-agent-rag-longcontext-radar.md
inbox/tom/2026-09-12T1440-agent-rag-longcontext-radar.md
inbox/tom/2026-09-12T0840-agent-rag-longcontext-radar.md
inbox/tom/2026-09-12-0900-hf-daily-2026-09-12.md
inbox/tom/2026-09-12-rag-e1prep.md
inbox/tom/2026-09-12-evaluation-e1prep.md
inbox/jay/2026-09-12T1505-jay-afternoon-briefing-inference-dynamo-sglang-vllm.md
inbox/jay/2026-09-12-vllm-tuning-commands.md
inbox/jay/2026-09-12T1950-jay-evening-engineering-filter.md
inbox/jay/2026-09-12T1050-jay-engineering-filter.md
inbox/jay/2026-09-12T1335-jay-five-category-briefing.md
inbox/jay/2026-09-12T0820-jay-csdn-inference-rag-multiagent-highvalue-sep12.md
inbox/jay/2026-09-12T1050-jay-engineering-filter.md
inbox/spark/2026-09-12-llm-infra-e1prep.md(18:40 CST)
inbox/spark/2026-09-11-llm-infra-e1prep.md
inbox/stephen/2026-09-12-ai-industry-e1prep.md
inbox/stephen/2026-09-12-llm-application-e1prep.md
inbox/flyp/2026-09-12-multimodal-e1prep.md
inbox/flyp/2026-09-12-risk-e1prep.md
paper_cards/ Sep 10-12 入库卡:1314/1315/1317/1318/1319/1320/1322/1328/1329/1330/1331/1332/1333/1334(共 14 张)

Tom · 2026-09-12 22:20 CST · E1 预消化 · inference · 5 条主增量(1 件 NET-new 事件级 Dynamo 1.0 + 1 件 NET-new 事件级 SGLang v0.5.19 + 1 件 NET-new 事件级 vLLM v0.20.2 + 1 件 NET-new 事件级 vLLM 调优命令集 + 1 件 NET-new 安全邻接级 Detokenization Leaks)+ 6 件涉及 arXiv 号