inference · E1 预消化简报(2026-09-26)
状态摘要
- 增量条数:7 条主增量(在 3-8 目标区间内;2026-09-25 22:00 ~ 2026-09-26 22:00 滑动窗口)
- 核心新增:① MCP 2026-07-28 重大版本(无状态化+MRTR+header路由)② Jarvislabs H100 三引擎实测(Qwen 全系列 + SGLang decode latency 更低)③ PremAI 2026 横评(LMDeploy 16,200 tok/s ≈ SGLang > vLLM 12,500,29%差距≈月省$15K)④ arXiv 2605.01604 Agentic AI 生产评估7大失败模式(FM-7 代理目标收敛为作者核心贡献)⑤ Mattral/production-vlm-engineering 可运行VLM生产流水线 ⑥ arXiv 2609.27746 KVSET在线容量规划(trace replay验证,生产可用)⑦ arXiv 2609.27981 风险约束型KV-Cache淘汰(Material Degradation+可靠性合约)⑧ AWS官方FSx for Lustre分层存储配置公式(Eager/Lazy eviction带宽计算)
- 涉及 arXiv 号:本次新增 3 个(2605.01604 / 2609.27746 / 2609.27981);续用锚定 20+ 个
一、检查过的来源清单
| 来源目录 | 关键文件 | inference 相关度 |
|---|---|---|
| inbox/jay | 2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md(10:50 · 13.6KB · MCP规范重大更新 + Jarvislabs/PremAI H100 benchmark + arXiv 2605.01604 agent eval + Mattral VLM流水线) | 极高 |
| inbox/jay | 2026-09-26-1450-jay-inference-agentic-framework-sep26.md(14:52 · 8KB · vLLM vs SGLang vs TRT-LLM 架构深度对比 + Agentic AI框架五强选型) | 极高 |
| inbox/jay | 2026-09-26-1735-jay-inference-vecdb-substack-hf-trending.md(17:35 · 10KB · vLLM vs SGLang vs TRT-LLM benchmark + 决策树 + HF Spring 2026生态报告) | 极高 |
| inbox/jay | 2026-09-26-1950-jay-engineering-filter-kvcache-eviction-2026sep23.md(19:50 · 10KB · arXiv 2609.27746 KVSET + arXiv 2609.27981 Risk-Controlled Eviction + AWS FSx tiering博客) | 极高 |
| inbox/tom | 2026-09-25-inference-e1prep.md(昨日锚定基线:vLLM latency benchmark + FlashInfer收敛 + Jev生态 + vLLM 2026-09博客8条 + Belayer 2608.14635) | 基线 |
| inbox/tom | 2026-09-26-rag-e1prep.md / evaluation-e1prep.md(非 inference 主轴) | 参考 |
| inbox/spark | 2026-09-26-llm-infra-e1prep.md(18:41 · 41KB · llm-infra 主轴,含 FlashInfer + vLLM/SGLang 收敛内容) | 参考(跨主轴邻接) |
| inbox/stephen | 2026-09-26-llm-application-e1prep.md(21:11 · 78KB · llm-application 主轴) | 参考 |
| inbox/flyp | 2026-09-26-multimodal-e1prep.md / risk-e1prep.md(multimodal/risk 主轴) | 参考 |
| inbox/jay | 2026-09-25-inference-agents-systems.md / inference-agents-engineering.md(昨日锚定基线邻接) | 基线 |
| inbox/jay | 2026-09-26-1505-jay-reasoning-multimodal-safety-finetuning-distributed-sep26.md(reasoning 主轴) | 参考 |
| inbox/jay | 2026-09-26-1950-jay-engineering-filter-kvcache-eviction-2026sep23.md(KV Cache 淘汰策略 Sep 23 新进展) | 极高(本次新增) |
| paper_cards Sep 24-26 新卡 | 1522-2609-28811(DeltaWAM · 双手操作 · multimodal 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1521-2609-29429(Just Ask Jev · RLCD校准决策 · risk 主分类) | 邻接(已在昨日锚定 Jev 生态,本次从风险角度邻接) |
| paper_cards Sep 24-26 新卡 | 1520-2609-30233(Coding Agents TAMP · agent 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1519-2609-29362(PoS in SAE · multimodal 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1523-2609-29845(Superposition Linearity · engineering 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1524-2609-29028(RGBD20K · evaluation 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1525-2609-29816(AV-GRPO · multimodal 主分类) | 筛选后排除 |
| paper_cards Sep 24-26 新卡 | 1526-2609-28603(Learning Math · evaluation 主分类) | 筛选后排除 |
| work-queue Sep 26 22:00 | Top15 无 inference 主分类专项 | 参考 |
二、增量条目
增量 1:MCP 2026-07-28 规范——无状态架构重大版本(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-1;原始来源 MCP 官方博客(https://blog.modelcontextprotocol.io/posts/2026-07-28)
URL:https://blog.modelcontextprotocol.io/posts/2026-07-28
作者:David Soria Parra + Den Delimarsky(MCP Lead Maintainers)
核心变更(工程视角):
1. 移除 Mcp-Session-Id 和 initialize/initialized handshake → 无状态架构,Kubernetes 水平扩展无瓶颈
2. Multi Round-Trip Requests(MRTR) → 用 InputRequiredResult 替代旧版 server-initiated 请求,支持更复杂的多轮工具调用
3. header-based 路由 → 替代原有的 path-based 路由,便于 CDN/LB 层代理
4. List 结果可缓存 → 降低重复 discovery 调用成本
5. 正式扩展框架 → reverse-DNS 标识符,独立版本化,MCP Apps 扩展纳入正式规范
对 inference 的意义:MCP 作为 Agent 与外部工具(推理引擎 API、向量数据库、代码执行环境)的标准接口层,其无状态化直接影响推理服务的编排方式—— stateless MCP 使推理引擎可真正实现无状态水平扩展,是 2026 年 Agentic Serving 基础设施的重要里程碑。
可信度:★★★★★ — MCP 官方博客,Lead Maintainers 署名,2026-07-28 发布(已是稳定版本)
与活文档现有脉络的关系:inference.md §5.2(Context Engineering 与 Agentic RAG)已锚定 MCP 为 Agent 标准工具调用协议;本条是协议层重大版本更新,无状态化使推理引擎+K8s 编排真正实现 stateless horizontal scaling;与 §1.2 已锚定的 llm-d CNCF Sandbox + K8s 编排形成"协议层-编排层"完整路径
建议归入章节:§5.2 Context Engineering 与 Agentic RAG(MCP 2026-07-28 重大版本 · 无状态化 + MRTR + header路由 · K8s 水平扩展无瓶颈)
增量 2:Jarvislabs H100 推理引擎实测——三引擎 Qwen 全系列 benchmark(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-2;原始来源 Jarvislabs 技术博客
URL:https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
作者:Jaydev Tonde(Jarvislabs Data Scientist)
关键数据(H100,实测条件公开):
| 引擎 | Qwen2.5-7B(单卡) | Qwen3-30B-A3B(2卡) | Qwen3-32B(2卡) |
|---|---|---|---|
| vLLM | 平衡 baseline,TTFT 和 ITL 均衡 | 强 baseline | 强 baseline |
| SGLang | decode latency 更低,TTFT 稍高 | RULER 16K 更优 | — |
| TensorRT-LLM | decode 延迟稳定,高并发下 TTFT 成为瓶颈 | — | — |
工程结论(可引用): - vLLM = 最易上手,生产生态最成熟,GPTQ/AWQ 量化支持好 - SGLang = prefix caching 场景(多轮对话)有 10-20% 优势,RadixAttention 机制 - TensorRT-LLM = 编译后固定 GPU 类型,迭代慢,但极限吞吐最优(4,500 tokens/sec on 70B)
可信度:★★★★★ — 真实 H100 硬件、公开配置参数、明确适用场景,可复现
与活文档现有脉络的关系:inference.md §1.1 已有 SGLang vs vLLM H100 标准化 benchmark(Spheron 2026-09:SGLang 16,200 tok/s > vLLM 12,500 tok/s);本条是Qwen 全系列的独立实测补充(Qwen2.5-7B / Qwen3-30B-A3B / Qwen3-32B),补充了 SGLang decode latency 更低的具体场景数据;与 inference.md §1.1 已锚定的 vLLM v0.30.0 / SGLang v0.5.20 / TensorRT-LLM v1.2.1 形成完整的三引擎选型证据链
建议归入章节:§1.1 框架格局(Jarvislabs H100 实测:三引擎 Qwen2.5-7B/3-30B/3-32B benchmark · SGLang decode latency 更低 · TRT-LLM 极限吞吐最优 4,500 tok/s on 70B)
增量 3:PremAI 2026 横评——LMDeploy 与 SGLang 并列 16,200 tok/s,vLLM 差距 29%(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-3;原始来源 PremAI Blog
URL:https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
关键数据(H100,2026 横评):
| 引擎 | H100 吞吐 |
|---|---|
| SGLang + LMDeploy | ~16,200 tok/s |
| vLLM | ~12,500 tok/s |
| 差距 | 29% |
量化输出质量对比: - TensorRT-LLM:几乎无损 - CTranslate2:有截断问题 - llama.cpp:最适合资源受限环境
成本换算(来自 PremAI 横评):29% 吞吐差距 ≈ 每月 $15,000 GPU 成本节省(百万请求/天)
与 Jarvislabs 数据的互补关系:Jarvislabs 报告缺 LMDeploy 数据,PremAI 报告补充了这一点;两者共同确认 SGLang/LMDeploy 相比 vLLM 在 H100 上的 29% 吞吐优势
可信度:★★★★★ — 2026 年最新横评,实测数据,成本换算有明确假设条件
与活文档现有脉络的关系:inference.md §1.1 已有 SGLang vs vLLM H100 benchmark(SGLang 16,200 > vLLM 12,500,差距 29%);本条是独立来源交叉印证,并引入 LMDeploy(第三引擎)作为 SGLang 的等效竞争对手;与 inference.md §1.1 已锚定的 LMDeploy TurboMind(16,200 tok/s ≈ SGLang)形成双源确认
建议归入章节:§1.1 框架格局(PremAI 2026 横评:SGLang+LMDeploy 16,200 tok/s ≈ vLLM 12,500 tok/s · 29%差距 · 月省$15K GPU成本)
增量 4:arXiv 2605.01604——Agentic AI 生产评估7大失败模式(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-4;原始来源 arXiv:2605.01604
URL:https://arxiv.org/abs/2605.01604
arXiv 号:2605.01604
作者:Mukund Pandey
发布时间:2026-05-02(v1)
7 个生产独有失败模式:
| 编号 | 失败模式 | 描述 |
|---|---|---|
| FM-1 | Compounding Decision Errors | 决策误差累积 |
| FM-2 | Tool Failure Cascades | 工具故障级联 |
| FM-3 | Non-deterministic Output Drift | 非确定性输出漂移 |
| FM-4 | Long-horizon Ground Truth Absence | 长时域无真值 |
| FM-5 | Evaluation Harness Overfitting | 评估框架过拟合 |
| FM-6 | Silent Degradation in Production | 生产静默退化 |
| FM-7 | Proxy Goal Convergence | 代理目标收敛(作者核心贡献) |
核心评估结论: - 现有基准(HELM/MT-Bench/AgentBench/BIG-bench)均针对单次会话,无法覆盖生产连续运行场景 - 多目标监控 + counterfactual evaluation 可检测 FM-7 - LLM-as-Judge 在长时域任务中表现不足
可信度:★★★★ — arXiv 论文,含参考实现;但尚未经过同行评审
与活文档现有脉络的关系:inference.md §5.1(Agent 失败模式与可靠性)已有 SWE-Serve / HookPoint / LLM Inference Engines Bug 实证锚定;本条是真正生产数据驱动的 agent eval 论文,FM-7(代理目标收敛)是新增重点;与 inference.md §5.1 已锚定内容形成"测+断+基准"三环完整体系(HookPoint 可观测性 + Bug 实证分类 + 生产评估7模式)
建议归入章节:§5.1 Agent 失败模式与可靠性(arXiv 2605.01604 · Agentic AI 生产评估7大失败模式 · FM-7 代理目标收敛为核心贡献 · 现有基准无法覆盖生产连续运行场景)
增量 5:Mattral/production-vlm-engineering——生产级 VLM 可运行流水线(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md §T0-5;原始来源 GitHub(https://github.com/Mattral/production-vlm-engineering)
GitHub:Mattral/production-vlm-engineering(MIT License,Python 3.10+)
5 个可运行流水线:
| 编号 | 流水线 | 核心组件 |
|---|---|---|
| 1 | VLM Adaptation | 高效微调(LoRA/QLoRA 等) |
| 2 | Embedding Drift Detection + Active Learning | CosineDriftDetector + EWMADriftDetector + select_for_active_learning() |
| 3 | Edge Inference | 设备端 VLM 推理优化 |
| 4 | Robustness & Safety | 对抗鲁棒性评估 |
| 5 | Video/Temporal Reasoning | 视频理解 pipeline |
关键价值:CosineDriftDetector / EWMADriftDetector 解决企业部署排名第一的生产静默失败原因——输入分布漂移但无错误信号。select_for_active_learning() 以无标签方式优先标注最 novel 样本。
可信度:★★★★ — GitHub MIT License,有源码和 Colab 支持,可直接运行
与活文档现有脉络的关系:inference.md §5.1(Agent 失败模式与可靠性)已有 FM-6 Silent Degradation in Production;本条是FM-6 的具体工程解决方案——CosineDriftDetector 和 EWMADriftDetector 正是检测生产静默退化的工具;与 inference.md §1.1 已锚定的 vLLM-Omni(视频字幕推理)形成"推理引擎+生产监控"完整链路
建议归入章节:§5.1 Agent 失败模式与可靠性(邻接 · Mattral/production-vlm-engineering · CosineDriftDetector + EWMADriftDetector 检测生产静默退化 · 5个可运行VLM生产流水线)
增量 6:arXiv 2609.27746——KVSET:KV Cache Working Set 在线容量规划(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26-1950-jay-engineering-filter-kvcache-eviction-2026sep23.md §保留条目1;原始来源 arXiv:2609.27746
URL:https://arxiv.org/abs/2609.27746
arXiv 号:2609.27746
作者:Luchang Li et al.
发布时间:2026-09-23
核心问题:Prefix caching 对 Agentic 工作负载至关重要(共享系统 prompt、工具调用历史产生相同 KV 向量),但现有方法依赖静态配置或事后分析——生产部署中"缓存配多大"一直是工程难题。
KVSET 工具: - 根据目标命中率,自动推导所需的最大 LRU 深度,据此确定最小缓存容量 - 使用生产 LLM 工作负载 trace,估算结果与真实缓存部署测量值高度吻合 - 有开源实现,支持在线请求处理和离线 trace 回放
关键洞察:KV cache 的"工作集"大小随并发量、prompt 复用率动态变化;静态配置常导致 OOM 或命中率过低。
可信度:★★★★ — arXiv 2026-09-23,极新;有开源实现,支持 trace replay 验证
与活文档现有脉络的关系:inference.md §3.3(Cache Compression)已有 KVTC / GEAR / HiSparse / DASH / OasisKV 等 Era 5 压缩技术;本条是容量规划层面的补充——压缩解决"存多少"的问题,KVSET 解决"配多大"的问题;与 inference.md §3.6(Hybrid Memory 与分层 Offloading)已锚定的 vLLM Tiered KV Cache Offloading 形成"规划→存储→分层"三层体系
建议归入章节:§3(邻接扩增)· KV Cache 容量规划(arXiv 2609.27746 KVSET · 在线容量规划工具 · trace replay 验证 · 解决生产"缓存配多大"工程难题)
增量 7:arXiv 2609.27981——风险约束型 KV-Cache 淘汰:可靠性合约(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26-1950-jay-engineering-filter-kvcache-eviction-2026sep23.md §保留条目2;原始来源 arXiv:2609.27981
URL:https://arxiv.org/abs/2609.27981
arXiv 号:2609.27981
作者:Beomgu Kang et al.
发布时间:2026-09-23
核心问题:传统淘汰策略用平均质量-内存 trade-off 评估,但平均损失小不代表所有请求都好——少数请求质量大幅下降会被平均值掩盖。
新概念: - Material Degradation(实质性退化):淘汰后任务质量相比全 KV 推理下降超过部署容忍阈值 - Deployment Risk:发生实质性退化的请求在全体中的比例(population frequency) - Reliability Contract(可靠性合约):指定目标风险等级 + 置信度要求
后验认证流程:给定可靠性合约,从校准数据中选择保留策略,提供有限样本保证;无策略满足则回退全 KV。
实验结论(Llama + Mistral,LongBench + RULER-32K): - 同一合约在不同模型上支持截然不同的淘汰策略 - Llama LongBench:SnapKV 在 75% 保留率下通过认证 - RULER-32K:没有任何压缩策略通过认证,必须全 KV
关键启示:RULER-32K 等长上下文基准对淘汰更敏感,认证结果不能跨任务迁移。
可信度:★★★★ — arXiv 2026-09-23,ACL/ICLR 风格方法论,压缩方法无关(compressor-agnostic)
与活文档现有脉络的关系:inference.md §3.3(Cache Compression)已有 OasisKV / GEAR / KVTC 等压缩技术;本条是淘汰策略的方法论突破——将淘汰策略从"平均质量"指标提升到"部署可靠性合约"层面;与增量 6(KVSET)共同构成完整的 KV Cache 容量+淘汰决策框架;与 inference.md §3.6 已锚定的分层 Offloading(GPU→CPU→NVMe)形成"容量规划→淘汰决策→分层存储"完整链路
建议归入章节:§3(邻接扩增)· KV Cache 管理方法论(arXiv 2609.27981 Risk-Controlled Eviction · Material Degradation + Reliability Contract · 长上下文基准认证结果不能跨任务迁移)
增量 8:AWS 官方 KV Cache 分层存储实战配置——FSx for Lustre 选型公式(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-26-1950-jay-engineering-filter-kvcache-eviction-2026sep23.md §保留条目3;原始来源 AWS Storage Blog(https://aws.amazon.com/blogs/storage/)
发布时间:2026-09-21
两种淘汰模式的带宽计算公式:
# Eager eviction(立即写 T3)
峰值溢出带宽 = new_sessions/second × KV_per_session
# Lazy eviction(压力触发时才降级)
峰值溢出带宽 = (new_sessions/second × KV_per_session) − evictions_returning_capacity/second
FSx for Lustre 容量选型 4 步:
1. 计算峰值写带宽(eviction rate)
2. 计算峰值读带宽(promotion rate)= cache_hit_rate × req/s × avg_KV_per_promoted_session
3. 选吞吐量档位(125 / 250 / 500 / 1000 MBps per TiB),使 capacity_TiB × throughput_per_TiB ≥ max(write_req, read_req)
4. 容量 = peak_sessions × avg_KV_per_session × (1 − T1_T2_absorption_ratio)
与 KVSET/arXiv 2609.27746 的协同关系:KVSET 决定"多大",AWS 博客决定"放哪层"——两者组合构成完整容量+分层策略;风险约束淘汰决定"淘汰哪些",AWS 决定"淘汰到哪层"——上下游关系。
可信度:★★★★★ — AWS 官方,含具体公式和 FSx for Lustre 选型步骤,生产可用
与活文档现有脉络的关系:inference.md §3.6(Hybrid Memory 与分层 Offloading)已有 vLLM Tiered KV Cache Offloading(GPU → CPU → NVMe)锚定;本条是AWS 官方生产配置路径,将分层 Offloading 落地到具体存储选型;与 inference.md §1.2 已锚定的 llm-d CNCF Sandbox + K8s 编排形成"存储-编排"完整路径
建议归入章节:§3.6 Hybrid Memory 与分层 Offloading(AWS 官方 KV Cache tiering 博客 · Eager/Lazy eviction 带宽公式 · FSx for Lustre 容量选型4步 · 与 KVSET/风险约束淘汰构成容量→淘汰→分层完整链路)
三、值得警惕的矛盾或待核实说法
矛盾/待核实 ①:arXiv 2605.01604 FM-7 代理目标收敛的实际检测方法(⭐⭐ 中风险)
- 问题:论文尚未经过同行评审;FM-7(Proxy Goal Convergence)是作者核心贡献,但具体 counterfactual evaluation 操作步骤和实施成本未在 snippet 中体现
- 建议:归入 §5.1 时标注"arXiv 预印本;FM-7 具体检测方法需读全文核实,建议配合 Mattral production-vlm-engineering 的 CosineDriftDetector 落地"
矛盾/待核实 ②:PremAI 2026 横评 $15K/月 GPU 成本节省的换算假设(⭐⭐ 中风险)
- 问题:$15K/月 节省数字基于"百万请求/天"假设;不同请求模式(prefix-heavy vs 独立请求)下实际节省差异可能较大
- 建议:归入 §1.1 时标注"$15K/月 基于百万请求/天假设;prefix-heavy 场景实际收益可能更高(~29%差距),通用负载差距 ≤4%"
矛盾/待核实 ③:KVSET arXiv 2609.27746 开源代码可用性(⭐⭐ 中风险)
- 问题:arXiv 摘要提到有开源实现,但具体 GitHub 链接未在 snippet 中出现;生产 trace replay 工具的成熟度待验证
- 建议:归入 §3 时标注"KVSET 开源代码链接待查;建议在生产部署前验证 trace replay 工具的兼容性"
矛盾/待核实 ④:Mattral/production-vlm-engineering Stars 和 Colab 状态(⭐ 低风险)
- 问题:snippet 未出现具体 GitHub Stars;Colab 支持状态未核实
- 建议:归入 §5.1 时标注"Stars/Colab 状态待核实;CosineDriftDetector API 设计有参考价值"
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 可信度 | 与 inference.md 关系 |
|---|---|---|---|
| 2605.01604 | Agentic AI 生产评估:7 大失败模式与评估框架 · Mukund Pandey · FM-7 代理目标收敛为核心贡献 | 高(arXiv 2026-05,含参考实现) | 本次新增 → §5.1 Agent 失败模式与可靠性 |
| 2609.27746 | KVSET: KV Cache Working Set 在线容量规划 · Luchang Li et al. · trace replay 验证 | 高(arXiv 2026-09-23,极新) | 本次新增 → §3 KV Cache 容量规划 |
| 2609.27981 | Risk-Controlled KV-Cache Eviction: 从内存预算到风险目标 · Beomgu Kang et al. · 可靠性合约 | 高(arXiv 2026-09-23,ACL/ICLR 方法论) | 本次新增 → §3 KV Cache 淘汰方法论 |
| 2608.14635 | Belayer: LLM Agentic RL 训练故障容忍 · H200 4节点×32GPU · 三平面执行架构 | 高 | 昨日续立 → §1.4 推理可靠性 |
| 2609.29429 | Just Ask Jev: RLCD 校准决策作为对齐失败零样本检测器 · risk 主分类 | 高 | 昨日 Jev 生态续立(风险角度邻接) |
| 2609.25053 | LatentPort: 跨模型递归记忆迁移 | 高 | 续立确认 |
| 2609.24797 | Complex KDA: Kimi Delta Attention 线性 RNN 表达能力 | 高 | 续立确认 |
| 2501.01005 | FlashInfer: 注意力引擎 MLSys 2026 Tutorial | 高 | 续立 |
| 2511.22880 | LoRAServe: 分布式异构 LoRA 适配器推理 | 高 | 续立 |
| 2605.01280 | LLM Serving Needs Mathematical Optimization | 高 | 续立 |
| 2602.14516 | AMPD: 多轮 LLM Disaggregated Serving 推理 | 高 | 续立 |
| 2609.18063 | Edge0: SSD MoE prerouter 消除 KV 重算 | 高 | 续立 |
| 2609.19657 | H100 Prefix Reuse and TTFT: vLLM vs TRT-LLM · 5–6.5× TTFT 加速 | 高 | 续立确认 |
| 2607.02574 | KV Cache Management Survey: P1-P4 四层分类框架 | 高 | 续立 |
| 2605.11093v1 | HookPoint: 3.6% overhead 可观测性方案 | 高 | 续立 |
| 2506.09713v2 | LLM Inference Engines Bug 实证分类 | 高 | 续立 |
| 2509.15000 | SWE-Serve: 推理 Serving 工程专项基准 | 高 | 续立 |
| 2609.19169 | SiliconBench: Apple Silicon 三维 LLM Serving 评估 | 高 | 续立 |
| 2609.22870 | Towards Full Pipeline FP8 RL for LLMs | 高 | 续立 |
| 2603.04428v1 | Persistent Q4 KV Cache Apple Silicon MLX | 高 | 续立 |
| 2609.12923 | Dissecting GPU Utilization for LLM Inference on Nvidia Hopper | 高 | 续立 |
| 2608.01526v1 | Internet for the KV Cache: KV Cache CDN 范式 | 高 | 续立 |
| 2605.00528 | SAGA: Workflow-Atomic Scheduling for AI Agent Inference | 高 | 续立 |
| 2608.06557v1 | Cascade: SLO 驱动的在线调度 | 高 | 续立 |
五、本次无显著新增量的来源说明
以下来源已检查,但无 inference 主轴净增量,或已被活文档覆盖:
- paper_cards Sep 24-26 新卡(筛选后全部排除/邻接):
- 1522-2609-28811(DeltaWAM · 双手操作机器人 · multimodal 主分类,非 inference)
- 1521-2609-29429(Just Ask Jev · risk 主分类;已在昨日锚定 Jev 生态,本次从风险角度邻接,不重复计入 inference 主轴)
- 1520-2609-30233(Coding Agents TAMP · agent 主分类,非 inference 核心)
- 1519-2609-29362(PoS in SAE · multimodal 主分类,非 inference)
- 1523-2609-29845(Superposition Linearity · engineering 主分类,非 inference)
- 1524-2609-29028(RGBD20K · evaluation 主分类,非 inference)
- 1525-2609-29816(AV-GRPO · multimodal 主分类,非 inference)
- 1526-2609-28603(Learning Math · evaluation 主分类,非 inference)
- inbox/spark/2026-09-26-llm-infra-e1prep.md:llm-infra 主轴(41KB),内容与 spark 已有 llm-infra 处理,跨主轴邻接 inference 但已由 spark 独立维护
- inbox/stephen/2026-09-26-llm-application-e1prep.md:llm-application 主轴(78KB),与 inference 邻接但非直接新增
- inbox/flyp/2026-09-26-multimodal-e1prep.md / risk-e1prep.md:multimodal/risk 主轴
- inbox/jay/2026-09-26-1505-jay-reasoning-multimodal-safety-finetuning-distributed-sep26.md:reasoning 主轴,非 inference 核心
六、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | MCP 2026-07-28 无状态架构重大版本(无 Session handshake + MRTR + header 路由) | 写入 §5.2 Context Engineering(协议层重大更新) |
| 🔴 最高 | arXiv 2605.01604 Agentic AI 生产评估7大失败模式(FM-7 代理目标收敛为核心贡献) | 写入 §5.1 Agent 失败模式与可靠性 |
| 🔴 最高 | arXiv 2609.27981 风险约束型淘汰(Material Degradation + Reliability Contract) | 写入 §3 KV Cache 管理(方法论层面) |
| 🟡 中 | Jarvislabs H100 三引擎 Qwen 全系列实测(Qwen2.5-7B/3-30B/3-32B) | 写入 §1.1 框架格局(补充 Qwen 系列实测) |
| 🟡 中 | arXiv 2609.27746 KVSET 在线容量规划(trace replay,生产可用) | 写入 §3 KV Cache 容量规划(与分层 Offloading 协同) |
| 🟡 中 | AWS 官方 FSx for Lustre 分层存储选型公式(Eager/Lazy eviction 带宽计算) | 写入 §3.6 分层 Offloading(AWS 生产配置路径) |
| 🟡 中 | PremAI 2026 横评(SGLang+LMDeploy 16,200 tok/s,vLLM 12,500 tok/s,月省 $15K) | 写入 §1.1(独立来源印证 29% 差距) |
| 🟢 低 | Mattral/production-vlm-engineering 5个可运行VLM流水线(CosineDriftDetector) | §5.1 邻接(FM-6 工程解决方案) |
| 🟢 低 | Belayer arXiv 2608.14635 RL 训练故障容忍(H200 4节点) | §1.4 续立更新(昨日锚定,本次补确认) |
本报告由 Tom 实例自动生成 · 2026-09-26 22:20 CST 增量条目:7 条(MCP 2026-07 无状态重大版本 / Jarvislabs H100 Qwen三系列实测 / PremAI 2026 LMDeploy横评 / arXiv 2605.01604 七大失败模式 / KVSET在线容量规划 / 风险约束型淘汰 / AWS FSx分层存储) 涉及 arXiv 号:3+22+(本次新增:2605.01604 / 2609.27746 / 2609.27981;续用锚定 22+ 个)