llm-infra · E1 预消化简报(2026-10-03)

执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-03 18:40 CST(周六) 窗口:2026-10-02 18:40 CST → 2026-10-03 18:40 CST(§IX 109 evening v3.50 棒位预备候选) 基线:organized/knowledge/llm-infra.md v3.50 morning(2026-10-03 05:00 · §IX 109 morning · arXiv 440 / CVE 36 / DOI 15 / URL 573 精确闭合) 诚实度声明:本轮 llm-infra 主轴新增量密度为「低」——围绕 KV Cache 推理系统工程延续(pgvectorscale 量化、Vector DB 2026 Q4 双源基准、LLM 推理引擎第四方格局量化补强、自托管 VecDB+LLM GPU 共置实操路径、推理引擎实测四源、SGLang/vLLM RadixAttention / Unified Radix Cache 第四源数据精修、Agent Memory 三层架构 = L1/L2/L3 框架、HF State of Open Models Summer 2026 沿用稳态精修),共九条增量候选 + 二处矛盾/待核警示。无 net-new paper_card 入池(10-3 早棒 0 件),无 net-new arXiv ID,无 net-new CVE/DOI/URL;承接 2026-10-02 evening 至 2026-10-03 18:40 的 jay / tom / flyp / stephen 4 实例产出 = 主轴稳态精修 + 矛盾预备级锚定预备承接,无硬凑条目。


〇、检查过的来源清单(本窗口内 · 2026-10-02 18:40 → 2026-10-03 18:40)

来源 关键文件 llm-infra 相关度
organized/queue work-queue.md(2026-10-03 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2610.01428 Generalization Is Stability = 仍沿用) 中基线 ⚠
organized/knowledge llm-infra.md v3.50 morning(2026-10-03 05:00 §IX 109 morning · arXiv 440 / CVE 36 / DOI 15 / URL 573 精确闭合) + .llm-infra-candidate.md(同源) 极高 ⭐⭐⭐⭐⭐ 基线
organized/paper_cards 近 3 天 llm-infra 主分类新卡:1629-2609-38987 Smaller Models Better Rejects(主分类 llm-infra · 10-3 02:13 入池 · v3.50 evening 棒位候选承接) + 1627-2610-00544 Memorizon(主分类 engineering · 邻接 llm-infra) + 1646-2609-36435 MemFold(主分类 engineering) + 1647-2609-22753 Jev Decision Models(主分类 engineering) + 1601-2609-39982 Mid-Harness(主分类 evaluation · 邻接 llm-infra 沿用) + 1604-2609-40316 Loop Scaling Laws(主分类 engineering · v3.50 morning 已沿用 §1.(5)/(8)) + 1625-2610-01871 ImmRAG(主分类 rag · 多模态 RAG 邻接) + 1624-2610-01936 Mapping the RAG Landscape(主分类 rag) 极高 ⭐⭐⭐⭐⭐
organized/promo/surveys 2026-10-02-llm-infra.md(今日 survey 已生成) 高
inbox/jay 2026-10-03-1105-jay-morning-briefing-vecdb-agentic-rag-multimodal-oct2026.md(pgvectorscale 50M 471 QPS 11.4× 反超 Qdrant + VectorDBBench 2026 + Meta-Harness 10M token + 4 件 multi-agent 工程指南) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-03-1505-jay-afternoon-briefing-vecdb-inference-cloudnative-mcp-rageval.md(LLM 推理引擎生产对比 SGLang 16,215 vs vLLM 12,553 vs TGI 9,500 tok/s + MCP 生态 86K stars / 15,926 仓库 / 97M+ SDK 月下载 + RAG 评估体系 5 维) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-03-1735-jay-evening-supplement-memory-stack-hf-qwen-selfhost-gpu-vecdb.md(Agent Memory 三层架构 L1/L2/L3 + HF Open Models Summer 2026 Qwen 生态位 + 自托管 VecDB + LLM GPU 共置实操路径 + Qdrant 1.17+ HNSW GPU 索引 4× / Milvus 2.6 BM25 + CAGRA + Storage Format V2) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-03-1450-jay-engineering-filter-framework-benchmarks-moo-eval-cost.md(Agent 框架生产性能量化基准 + Agent 评测成本实测 + OptiLLM MCTS/MoA 推理优化代理) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-03-engineering-e1prep.md(22KB · 7 主增量 = Colibri v1.12.0 GLM-5.2 744B 25GB RAM 无 GPU + Uber MCP Gateway 800+ servers / 5000+ tools + pgvectorscale 471 QPS + Phi-Bench + Modal + SRAO + AETHER) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-03-1003-rss-lilian-weng.md(Harness Engineering for Self-Improvement · RSI 工程化) + 2026-10-03-1002-rss-cool-papers.md + 2026-10-03-1002-rss-cool-papers-ir.md + 2026-10-03-1003-rss-import-ai.md + 2026-10-03-1003-rss-msr-blog.md 高 ⭐⭐⭐⭐
inbox/jay 2026-10-03-csdn-llm-agent-rag-inference.md(H3 vLLM 推理优化实战 2026-09-15 PagedAttention 分块存储逻辑 + H5/H6 大模型微调实战 LoRA/QLoRA + M1 H100 上 vLLM 推理优化 + M2/M3 LoRA 微调实战) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-03-csdn-inference-embedding-agentic-rag-highvalue.md(H5+HyDE + GraphRAG + Self-RAG + CRAG + HippoRAG + Agentic + ColBERT + 多向量 RAG 等) 中 ⭐⭐⭐
inbox/jay 2026-10-03-ai-engineering-trending-oct.md(Colibri v1.12.0 + vLLM Production Stack 2026 Roadmap + Dify + 串行调度) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-03-jay-engineering-filter-agents-mcp-stack.md(10 候选 6✅保留 4⚠️降级 = Uber MCP Gateway + Modal + SRAO + AETHER + Jev + Phi-Bench + MDPI + 4⚠️降级) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-03-0900-hf-daily-2026-10-03.md(15 件立标 5 件 multimodal 直接命中 2 件邻接 = 7/15 = 46.7% 主轴信号 · 几乎免费地更好地解码循环 Transformer arXiv:2610.02185 19▲ #9 llm-infra 主轴直命中 + X-Tree arXiv:2609.32993 12▲ #14 agent 邻接 + GPT-6 Astra arXiv:2610.01939 24▲ #8 multimodal 邻接 + 几乎免费地更好解码 19▲ #9 llm-infra 主轴) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-03-rag-e1prep.md(RAG 主轴密度"低" + 3 主增量 = MatRAG arXiv:2610.01767v1 + Temporal Validity arXiv:2606.26511 + A-TMA arXiv:2607.01935 · 沿用 13 件 Oct 2 已锚) 中 ⭐⭐⭐
inbox/tom 2026-10-03-agent-rag-longcontext-radar.md(3 高价值 = X-Tree + Honeycomb + MatRAG + 3 候选 + Cobus Greyling "Please Stop Saying Long Context Windows Will Replace RAG" + RAG 单次查询 $0.00008 vs 长上下文 $0.10 ~1250× 差距 + 长上下文相关段落位于中间准确率下降 30%+ + 2026 主流模式 = 混合架构 + Agentic RAG 成为基线 + VentureBeat 预测 contextual memory 将超越传统 RAG ⚠⚬) 中 ⭐⭐⭐
inbox/tom 2026-10-03-evaluation-e1prep.md(沿用 R90 + 5 主增量 = MIST 36▲ + Endless Exam + MILO + SEAL + BiasReducer) 低 ⚬
inbox/flyp 2026-10-03-multimodal-e1prep.md(85KB v87+22 R44 · 5 主增量) + 2026-10-03-0950-flyP-critical-read-EgoTools-egocentric-tool-use.md(B+ 预备级) + 2026-10-03-0951-flyP-substack-cameron-wolfe-midtraining-notes.md(LLM 训练三段式 midtraining 独立工程阶段) 低 ⚬(multimodal 主棒位承接)
inbox/flyp 2026-10-03-sat-adversarial-review-LongHarness-Bench.md + 2026-10-03-sat-adversarial-review-SEAL.md + 2026-10-03-sat-structured-deep-read-SeKV.md + 2026-10-03-sat-weekly-deep-read-summary.md(SeKV + LongHarness + SEAL = "长上下文评测的协议 + 成本 + 系统路径"三位一体主题) 中 ⭐⭐⭐
inbox/flyp 2026-10-03-risk-e1prep.md(沿用 R90) + 2026-10-03-sat-adversarial-review-LongHarness-Bench.md + 2026-10-03-sat-adversarial-review-SEAL.md + 2026-10-03-sat-structured-deep-read-SeKV.md + 2026-10-03-sat-weekly-deep-read-summary.md(SeKV + LongHarness + SEAL = "长上下文评测的协议 + 成本 + 系统路径"三位一体主题) 低 ⚬
inbox/spark 2026-10-03-1002-rss-gradient-flow.md + 2026-10-03-1003-rss-chip-huyen.md(沿用 10-2) 低 ⚬
inbox/stephen 2026-10-03-1245-stephen-coordination-check-noon.md(6 实例对账 + 7 大类 + database + risk + ai-industry 全部覆盖稳态 + spark llm-infra 沿用) + 2026-10-03-1004-news-*(anthropic / openai / google-ai / hf-blog / bens-bites / tldr-ai) + 2026-10-03-ai-industry-e1prep.md(113KB v70 → v71 棒位承接 + 5 主增量) 中 ⭐⭐⭐
inbox/digests 2026-10-03-1125-spark-24h-digest.md(主题热度 agent + multimodal 并列第一 + systems + csdn + engineering 稳态) + 2026-10-03-1125-spark-24h-review.md(30 件文件 · 分类分布) 中 ⭐⭐⭐

合计:4 实例 ≈ 25+ 新增文件 ≈ 480KB 12h+ 净增 + 10-3 入池 0 件 llm-infra 主分类 NET-new paper_card(承接 paper_cards 10-3 02:13 = 1629 Smaller Models Better Rejects = 主分类 llm-infra = v3.50 evening 棒位候选承接预备级)+ 0 NET-new arXiv ID + 0 NET-new CVE/DOI/URL。


一、今日该主题最重要的增量(9 条 · 均承接稳态精修预备级)

增量 1:VectorDBBench / pgvectorscale 双源基准 · 与 v3.50 morning "Qdrant P99 6ms 50M" 形成底层反例冲击 · 量化 Vector DB 2026 Q4 完整版图

  • 来源:
  • jay 10-3 11:05 morning-briefing §database/1(pgvector + Timescale pgvectorscale 在 50M 向量 / 1536 维 / 99% 召回率下达 471 QPS · p95 延迟 28ms · 比 Qdrant 快 11.4 倍 · 与 Pinecone s1 持平但 p95 延迟低 28 倍 · DEV Community / Vecstore 评测 · 2026-04)
  • jay 10-3 11:05 morning-briefing §database/2(VectorDBBench 2026 综合评测 · Salt Technologies AI · Q1 2026 · Qdrant p50=4ms(开源最强) · Pinecone p50=8ms · Milvus p50=6ms · 1M 向量 1536 维 · 决策树 Postgres 团队 → pgvector / managed 云优先 → Pinecone / 自托管 + 混合搜索 → Weaviate / 延迟优先开源 → Qdrant / 十亿级混合 → Milvus/Vespa)
  • jay 10-3 15:05 afternoon-briefing §一(ranksquire.com / salttechno.ai / alphacorp.ai / dev.to 多源交叉验证 · 1M 向量 1536 dim cosine ~0.95 · Qdrant 4ms p50 / 25ms p99 / ~1,200 QPS · Redis 5ms p50 · Milvus GPU 6ms p50 / 20,000+ QPS · Pinecone 8ms p50 / managed · ChromaDB 12ms / Weaviate 12ms / pgvector 18ms / Elasticsearch 15ms)
  • jay 10-3 17:35 evening-supplement §三(Spheron Network · Self-Host Vector Databases on GPU Cloud · 2026 v1.17+ HNSW indexing AWS 实测索引构建速度 4× · 99.95% SLA · Milvus 2.6+ Storage Format V2 + nullable vector + 内置 BM25 吞吐量 ES 同硬件 4× + GPU 加速 CAGRA 算法 10M+ 向量场景)

  • 要点: 1. 双源基准冲突 v3.50 morning §0.5.1 §1.(10):v3.50 已锚入 "Qdrant P99 6ms 50M 向量实测"(第七源) + "1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200"。本次 jay 10-3 afternoon-briefing 第四源给出 1M 向量实测 = Qdrant 4ms p50 / 25ms p99 与 v3.50 morning 已锚入的 "1M p50 2.1ms / p99 6.3ms" 存在 ~4× 的 p50 差异 + ~4× 的 p99 差异,口径与硬件配置不同需要回溯评测条件(HNSW 调优 vs 默认 / recall ~0.95 vs 0.99 / 单分片 vs 集群)。⚠⚬⚬ 待核实评测条件 2. pgvectorscale 反例冲击:jay 10-3 morning-briefing §database/1 = pgvector + Timescale pgvectorscale 在 50M 向量 1536 维 99% 召回率下 471 QPS · p95 28ms · 比 Qdrant 快 11.4 倍 · 与 Pinecone s1 持平但 p95 延迟低 28 倍 = 与 v3.50 morning §0.5.1 §1.(10) "Qdrant P99 6ms 50M 向量实测" 形成直接反例冲击。关键前提 = 该数据基于 Timescale pgvectorscale 商业扩展(非纯开源 pgvector);纯开源 PostgreSQL 基础版 pgvector 性能仍低于 Qdrant 3. Milvus 2.6+ 内置 BM25 + CAGRA + Storage Format V2 + nullable vector = 完整 RAG 基础设施合并两系统栈(替代 ES)预备级补强 4. Qdrant 1.17+ HNSW indexing 4× 加速 + 99.95% SLA + Multi-AZ 集群 = 已支持企业级生产场景 5. 「嵌入模型对检索质量的影响往往超过数据库选择本身」 预备级补强 = DigitalApplied 2026-04 评测洞察

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(10) 已锚入 Vector DB 2026 选型决策框架 = Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快 + 混合搜索全面胜出 + 决策框架(零运维托管 → Pinecone / 性能成本 → Qdrant / Postgres 栈 <100M → pgvector / 混合搜索 → Weaviate / 亿级向量 → Milvus)。本增量是该选型框架的 2026 Q4 双源基准 + 第四方(Redis) + 第八方(Elasticsearch) + pgvectorscale 商业扩展反例 + Milvus 2.6+ 三件套补强 完整扩增预备级。

  • 建议归入节:§0.5.1 §1.(10) 顶会部署 · Vector DB 2026 选型决策框架 = 「2026 Q4 扩增补强」 = Qdrant 1M p50 4ms(p99 25ms)第四源数据 + Qdrant 50M p99 6ms 沿用 + pgvectorscale 商业扩展 50M 471 QPS 反例 ⚠⚬ + Milvus 2.6+ BM25/CAGRA/Storage Format V2 三件套 + Redis 5ms p50 15K-40K QPS + ChromaDB 12ms + Weaviate 12ms + Elasticsearch 15ms + pgvector 18ms = 10 数据点完整版图谱。

  • 可信度:⭐⭐⭐⭐(双源基准交叉验证 + pgvectorscale 商业扩展明示 + Milvus 2.6+ 三件套明确版本号 · pgvectorscale 商业许可证与开源 pgvector 实际性能上限需后续核实)


增量 2:LLM 推理引擎 2026 秋季快照第四方格局量化补强 · SGLang 16,215 / vLLM 12,553 / LMDeploy 16,132 / TGI 9,500 / TensorRT-LLM 10,000+ / llama.cpp 6,000 tok/s

  • 来源:
  • jay 10-3 15:05 afternoon-briefing §二(prem.io / yottalabs.ai / spheron.network · Llama 3.1 8B / H100-80GB / 1000 ShareGPT prompts · SGLang 16,215 tok/s · p50 4-21ms · 已部署 400,000+ GPU · LMDeploy 16,132 tok/s ~25ms · vLLM 12,553 tok/s 50-80ms · TensorRT-LLM 10,000+ tok/s 35-50ms 需编译 NVIDIA 最优 · TGI ~9,500 tok/s ~60ms 维护模式 2025-12 起 · llama.cpp ~6,000 tok/s ~80ms)
  • jay 10-3 17:35 evening-supplement §二·四(Spheron Network · HF State of Open Models Summer 2026 = llama.cpp 2026-02 加入 HF + Ollama v0.4.0 + LM Studio)

  • 要点: 1. v3.50 morning §0.5.1 §1.(1) 已锚入 "vLLM = 生产首选 + 峰值约 12,500 tok/s(月约 $15K GPU 节省 + 29% 差距)"(prem.io 2026 实测 H100)——本增量 jay 10-3 afternoon 给出 vLLM 12,553 tok/s 与 v3.50 已锚入数据完全对齐,口径精确闭合 2. SGLang 16,215 tok/s vs vLLM 12,553 tok/s ≈ 29.2% 吞吐优势(与 v3.50 morning "SGLang 29% 吞吐优势 ≈ 月省 $15K GPU" 数据完全一致) 3. TGI 9,500 tok/s + 「维护模式 2025-12 起」(jay 10-3) = 与 v3.50 morning §0.5.1 §1.(1) 已锚入的 D224 ⚠⚬⚬ "TGI 进入维护模式时间精度新矛盾(jay 10-2 = '2025.12' vs v3.49 evening = '2026-03-21 进入维护 + 2026-09-05 README 正式确认' = 4 个月差异)" 数据一致(同源 jay) ⚠⚬⚬ 时间精度仍待核实 HF 官方公告原文 4. LMDeploy 16,132 tok/s 首次承接稳态 = 与 v3.50 morning 已锚入的 vLLM/SGLang 双寡头格局形成 "三强(实际) + 一备(TGI 维护) + 一边缘(llama.cpp)" 5 方格局 5. vLLM v0.15.1(2026-02) 已锚入沿用 = PyTorch 2.10 + RTX Blackwell SM120 + H200 优化 + "极速模式"目标单卡 1,000 tok/s 6. TensorRT-LLM 胜出条件 = 工作负载稳定(不需要频繁换模型)/延迟吞吐敏感/有工程能力维护编译流程 = 编译一次后同 GPU 比 vLLM 高 20-40% 吞吐

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 已锚入 vLLM/SGLang/TGI/Mooncake 四方博弈 + SGLang 400,000+ GPU + TGI 维护模式 D224 精度矛盾 + Mooncake disaggregated KV pool。本增量是该格局的 2026 Q4 第四方(LMDeploy)量化补强 + 6 引擎完整 tok/s 数据矩阵 + vLLM 12,553 tok/s 数据精确闭合 预备级补强。

  • 建议归入节:§0.5.1 §1.(1) 推理引擎 · v3.50(增补 LMDeploy 16,132 tok/s + TensorRT-LLM 10,000+ tok/s + llama.cpp 6,000 tok/s + 6 引擎完整 tok/s 数据矩阵 + D224 沿用 + vLLM 12,553 tok/s 数据精确闭合)

  • 可信度:⭐⭐⭐⭐⭐(prem.io / yottalabs.ai / spheron.network 三源对齐 + Llama 3.1 8B / H100-80GB / 1000 ShareGPT prompts 评测条件明确 + 与 v3.50 morning 数据精确闭合)


增量 3:Agent Memory 三层架构 · L1 Context Window / L2 In-Context Memory / L3 Long-Term Memory · 超越"RAG = Memory"认知误区

  • 来源:jay 10-3 17:35 evening-supplement §一(The AI Engineer Substack · The AI Agents Stack: LLM to Production · 2026 Edition · AI 工程领域专业 newsletter · ⭐⭐⭐⭐⭐)

  • 要点: 1. 2024 年主流认知 = Memory = 选个向量数据库 + 做 RAG 2. 2026 年演进 = Memory 是独立三层架构原语,各层解决不同问题 3. L1 Context Window = 模型直接可见 · Token 预算内的高频最近状态 · 代表方案 Gemini 1M / Claude 200K 原生上下文 4. L2 In-Context Memory = Agent 运行时可见 · 多轮对话短期任务状态 · Agent prompt 内嵌 history 5. L3 Long-Term Memory = 跨 session 持久化 · 跨实例共享 / provider 切换后状态保留 · 代表方案 Mem0 / Zep / Letta 专用基础设施 6. 关键洞察 = Context windows got massive. Gemini hit 1M+ tokens, Claude 200K. Bigger windows didn't kill the need for memory. They changed the tradeoff: what do you stuff in-context vs. what do you retrieve on demand? 7. 量化参考 = Gemini 1M token context 可直接内嵌整本书 + 但超过 ~50K token 后推理成本和延迟显著上升 + L3 dedicated memory infrastructure 价值 = 跨 agent 实例共享 + 模型 provider 切换后状态保留 8. 框架与 SDK 层(Layer 4)选型判断 = LangChain/LangGraph 企业级复杂编排 / LlamaIndex 数据连接 RAG / Pydantic AI 类型安全 / AutoGen/ChatDev 多 agent 协作 / CrewAI 角色驱动

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(2) 已锚入 Harness Engineering 战略价值升级(Meta-Harness 6× + Lilian Weng RSI + Hermes 三模块 = 平台差异化核心战场)与 §1.(11) Harness Engineering 第七源预备扩增稳态。本增量是 Agent Memory 架构的"独立三层原语框架"补强 = 与 v3.50 morning §1.(11) "MCP Stateless + py-kvcache + Nereus + MCP 生产规模数据"形成 「Agent 系统架构 = Harness Engineering(决策)+ Memory 三层(状态)+ Tool 协议(MCP)+ KV Cache 共享 + 推理引擎(执行)」完整五栖体系 预备级补强。

  • 建议归入节:§0.5.1 §1.(2) 推理调度(增补 Agent Memory 三层架构框架 L1/L2/L3 = Memory 独立原语预备级补强)与 §1.(11) Harness Engineering(作为 Harness 工程化的 Memory 层补强)

  • 可信度:⭐⭐⭐⭐(The AI Engineer Substack 专业 newsletter · 2026 Edition 体系化框架 · 适合作为团队内部分享基准)


增量 4:HF State of Open Models Summer 2026 沿用稳态精修 · Qwen 社区事实 base model + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B

  • 来源:jay 10-3 17:35 evening-supplement §二(HF Blog · Adina Yakefu、Apolinário、Irene Solaiman · HF Policy 团队 · 平台官方非营销内容)

  • 要点: 1. 生态位定义 = 模型生态位不由自身 release 决定,而由 community derivative 数量定义 2. 排名 = Qwen(阿里)衍生模型数最高 → Mistral → DeepSeek → Llama(Meta) 3. Attention ≠ Adoption = 模型发布热度不等于实际生产采纳 4. Open weights 价值转移 = 权重开放后,价值向部署工具 / 推理优化 / fine-tune 框架转移 5. Small models remain the practical layer = 7B-13B 段是生产性价比最优区间 6. Agents are the new user = Agent 作为 LLM consumer,模型选择更看重 tool-calling 能力和 agent 兼容度 7. 推荐关注模型 = Qwen3.7(旗舰 HF 下载量前三)/ Gemma 4(31B Dense Google Apache 2.0)/ DeepSeek V4.1 Flash / BGE-M3 v2 / NV-Embed v3 8. v3.50 morning §0.5.1 §1.(1) 已锚入 = Qwen 社区事实标准底座 + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B = 2026 Q4 推理引擎生态上游预备新增

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 已锚入 HF State of Open Models Summer 2026 完整五条 + v3.50 §1.(11) "Harness Engineering 第七源预备扩增稳态" + v3.50 §1.(1) "推理引擎 2026 秋季快照 vLLM/SGLang/TGI/Mooncake 四方博弈"。本增量是该稳态的 精修承接预备级 = jay evening-supplement 整理后的 4 维补充(排名数字 + 推荐关注模型 + Agents are the new user 关键洞察 + 部署工具价值转移)

  • 建议归入节:§0.5.1 §1.(1) 推理引擎(增补 jay evening-supplement §二 4 维精修) + §1.(11) Harness Engineering(增补 Agents are the new user 关键洞察作为模型选择核心因素)

  • 可信度:⭐⭐⭐⭐⭐(HF 官方 Blog · 具名 Policy 团队 · 平台官方非营销内容 · 与 v3.50 morning 已锚入数据精确对齐)


增量 5:自托管 VecDB + LLM GPU 共置部署实操路径 · vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · Total round trip < 50ms(H100 SXM5)

  • 来源:jay 10-3 17:35 evening-supplement §三(Spheron Network Blog · Self-Host Vector Databases on GPU Cloud: Qdrant, Milvus, and Weaviate Production Deployment · 2026 · ⭐⭐⭐⭐)

  • 要点: 1. 托管 RAG 痛点 = Pinecone + OpenAI API = 每个 query 两次外部网络调用(VecDB 30-250ms + LLM 30-250ms)= 累积延迟高,跨 region 场景更严重 2. 共置方案 = vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · 所有调用走 shared memory 而非 network interface · 目标 Total round trip < 50ms(H100 SXM5) 3. 架构栈(三合一单节点) = 端口配置 vLLM 8000 / Milvus 19530 management + 19121 GPU search / TEI Embedder 8080 / Qdrant 6333 4. vLLM 启动(70B 模型 H100) = vllm/vllm-openai --model meta-llama/Llama-3.3-70B-Instruct --dtype fp8 --gpu-memory-utilization 0.85 5. Qdrant GPU 加速(HNSW indexing · 2026 v1.17+) = 索引构建速度提升 4× AWS 实测 · Multi-AZ 集群支持 99.95% SLA 6. Milvus 2.6+ 关键新能力 = Storage Format V2 + nullable vector support · 内置 BM25 全文本搜索(吞吐量是 ES 同硬件 4×) · GPU 加速 CAGRA 算法(10M+ 向量场景) 7. 选型建议 = 交互式 RAG(延迟 <10ms)→ Qdrant / 高吞吐分析(>20K QPS)→ Milvus GPU / 已有 PostgreSQL 栈 → pgvector / 已有 Elasticsearch 栈 → Weaviate / 快速原型 → Chroma

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) "Ollama 是入口,vLLM 是出口" + v3.50 §1.(10) Vector DB 2026 选型决策框架 + v3.50 §1.(11) MCP 生产规模数据(10,000+ servers / 97M+ SDK 月下载 / 450 万次 Salesforce 调用)。本增量是 "RAG 部署成本 → 共置方案"预备级补强 = 与 v3.50 §1.(10) Vector DB 选型决策框架形成 "选哪个库" → "怎么部署" 完整决策链预备级补强。

  • 建议归入节:§0.5.1 §1.(10) 顶会部署(增补自托管 VecDB + LLM GPU 共置部署实操路径作为部署成本预备级补强) + §1.(11) Harness Engineering(增补 vLLM v0.15.1 + Qdrant v1.17+ + Milvus 2.6+ 部署指南)

  • 可信度:⭐⭐⭐⭐(Spheron Network 工程部署指南 · 具体配置命令和延迟数据 · 工程团队可直接参考 Deployment Playbook)


增量 6:MCP Stateless 生态爆发数据 · 2026-09-30 MCP servers 仓库 86,148 stars · GitHub mcp-server topic 15,926 仓库 · 月 SDK 下载量 97M+

  • 来源:
  • jay 10-3 15:05 afternoon-briefing §四(digitalapplied.com MCP adoption statistics · GitHub modelcontextprotocol 官方仓库 · 2026-04 更新至 2026-05)
  • v3.50 morning §1.(11) 已锚入 MCP 2026-07-28 Stateless 三大变更 + 10,000+ servers / 97M+ SDK 月下载 / 450 万次 Salesforce 调用

  • 要点: 1. v3.50 morning 已锚入 MCP 生产规模数据 = 10,000+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用 2. jay 10-3 afternoon 给出 2026-09-30 更新数据 = MCP 官方 servers 仓库 86,148 stars + 10,799 forks · GitHub 上带 mcp-server topic 的仓库 15,926(2026-05-24 数据) · 每月 SDK 下载量 97M+ · 官方 TypeScript SDK 320 stars 2026-09-29 更新 · 官方 Python SDK 191 stars 2026-09-29 更新 3. 2026-09 最新更新(GitHub API 快照) = typescript-sdk 320 commits 过去一年 2026-09-29 更新 · python-sdk 191 commits 过去一年 2026-09-29 更新 · experimental-ext-interceptors SEP-2624 提议的多语言拦截器扩展实现实验状态 · IaC for MCP MCP 访问管理的 Infrastructure as Code 方案 · quickstart-resources tutorial 示例代码库 4. 推荐生产起步栈 = 开发者推荐 GitHub MCP + Context7(最新文档)+ Playwright MCP(浏览器自动化)/ 数据推荐 Supabase MCP / PostgreSQL MCP / 运营推荐 Kubernetes MCP + Sentry MCP + n8n MCP 5. LangChain vs LangGraph 关于 MCP 的争议(2026-03) = 核心争议 MCP 是"昙花一现"还是"未来标准" · 社区讨论 GitHub Discussion #174921 · 结论 MCP 生态已超 15K 仓库 97M 月下载 2026 年判断为"已成为事实标准"

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §1.(11) "MCP 2026-07-28 Stateless 三大变更 + py-kvcache + Nereus + MCP 生产规模数据"。本增量是 MCP 生态 2026-09 实时数据精修 + SDK 双语言活跃度确认 + LangChain/LangGraph 争议结论预备级补强。

  • 建议归入节:§0.5.1 §1.(11) Kernel/AI 自动化/Harness(增补 jay 10-3 afternoon §四 MCP 生态 2026-09 实时数据 + LangChain/LangGraph 争议结论预备级)

  • 可信度:⭐⭐⭐⭐(digitalapplied.com + GitHub API 快照 · 数据时间戳明确 · 与 v3.50 morning 沿用数据精确对齐 · 87K+ stars = 已成为事实标准证据)


增量 7:CSDN 工程实战高价值新增 · vLLM 推理优化实战 2026-09-15 PagedAttention + H100 上 vLLM + LoRA/QLoRA 全流程

  • 来源:
  • jay 10-3 08:22 csdn-llm-agent-rag-inference.md(H3 vLLM 推理优化实战 2026-09-15 PagedAttention 分块存储逻辑 + M1 H100 上 vLLM 推理优化)
  • jay 10-3 ai-engineering-trending-oct.md(vLLM Production Stack 2026 Roadmap GitHub Issue #855 P0 = 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal 模型部署支持(vLLM Omni)+ P1 Agent 负载智能路由 + vLLM V1 重构引擎 + FP8 KV-cache 验证 Hopper & Blackwell)

  • 要点: 1. H3 vLLM 推理优化实战 2026-09-15 = PagedAttention 分块存储逻辑 + 09-15 时间戳 · CSDN 工程实战级 2. M1 H100 上 vLLM 推理优化 = 具体到 GPU 型号的工程优化经验 3. vLLM Production Stack 2026 Roadmap(GitHub Issue #855) = P0 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal 模型部署支持(vLLM Omni)+ P1 Agent 负载智能路由 + vLLM V1 重构引擎 + FP8 KV-cache 验证(Hopper & Blackwell) 4. 与 v3.50 morning §0.5.1 §1.(1) 关系 = v3.50 morning 已锚入 "vLLM v0.15.1(2026-02)支持 PyTorch 2.10、RTX Blackwell (SM120)、H200 优化 · 极速模式目标单卡 1,000 tok/s" + "V1 重构引擎"沿用 5. 本增量是 vLLM 2026 Production Stack 路线图预备级 = GitHub Issue #855 路线图 = vLLM 工程师社区对 2026 Q4-2027 Q1 的明确投入方向

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 推理引擎 v3.50 沿用稳态。本增量是 vLLM 2026 Production Stack 路线图预备级 = 与 v3.50 morning §1.(1) "vLLM = 生产首选"形成 "已发布特性 + 路线图特性"完整双栖预备级补强。

  • 建议归入节:§0.5.1 §1.(1) 推理引擎(增补 vLLM Production Stack 2026 Roadmap GitHub Issue #855 P0/P1 路线图预备级补强) + §1.(4) 量化(增补 FP8 KV-cache 验证 Hopper & Blackwell 路线图)

  • 可信度:⭐⭐⭐⭐(CSDN 工程实战 2026-09-15 时间戳 + GitHub Issue #855 路线图 · 工程团队可直接参考)


增量 8:RAG 评估体系全貌 2026 · 5 维指标(检索 Precision@K/Recall@K/MRR/nDCG/Diversity + 生成 Faithfulness/Relevance/Citation Coverage/Hallucination Rate/Completeness) + 5 Benchmark(RAGBench/CRAG/LegalBench-RAG/WixQA/T²-RAGBench)

  • 来源:jay 10-3 15:05 afternoon-briefing §五(labelyourdata.com / braintrust.dev / evidentlyai.com / confident-ai.com · RAG Evaluation: 2026 Metrics and Benchmarks for Enterprise AI Systems / Best RAG Evaluation Tools 2026)

  • 要点: 1. Retrieval(检索)指标 = Precision@K / Recall@K / MRR / nDCG / Diversity 2. Generation(生成)指标 = Faithfulness ⭐⭐⭐⭐⭐ / Relevance ⭐⭐⭐⭐ / Citation Coverage / Hallucination Rate / Completeness 3. Benchmark 对比 = RAGBench 通用检索+生成最广泛 / CRAG 强调查上下文相关性和 groundedness / LegalBench-RAG 法律 QA / WixQA Web 规模开放域 QA / T²-RAGBench 多轮任务型 RAG 4. 失败根因定位方法(Confident AI) = Bad Retrieval + Faithful Generation → 修索引/chunk 策略 / Good Retrieval + Unfaithful Generation → 修 prompt / 换模型 5. 工具链 = Ragas 开源快速迭代 / Galileo 20+ 内建指标 / Braintrust 评估 + CI/CD / Evidently AI 生产监控 / DeepEvaluate 端到端

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(2) "ICML 2026 复现 2,226 篇 51% claim 验证 23% claim 证伪 = 评测方法学 AI Agent 驱动评测规模化预备扩位候选"。本增量是 RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链预备级 = 与 v3.50 morning §1.(2) ICML 2026 复现形成 "通用评测方法学 + RAG 专项评测"双栖预备级补强。

  • 建议归入节:§0.5.1 §1.(2) 推理调度(增补 RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链预备级补强) + §1.(11) Harness Engineering(作为 Harness 层评测方法学补强)

  • 可信度:⭐⭐⭐⭐(labelyourdata.com + braintrust.dev + evidentlyai.com + confident-ai.com 多源交叉 · 评估框架类内容一致性好)


增量 9:推理引擎第四方 LMDeploy 16,132 tok/s + HotPrefix/C2C/TokenDance/KVServe 完整 KV Cache 异构跨族传输链路预备级 + HF State of Open Models Qwen 社区事实标准底座

  • 来源:
  • jay 10-3 15:05 afternoon-briefing §二(LMDeploy 16,132 tok/s ~25ms 沿用稳态)
  • v3.50 morning §0.5.1 §1.(3) 已锚入 Prefill-Free Cross-Family KV Cache Transfer 异构推理传输 1630 arXiv:2609.32259 + HotPrefix + C2C + TokenDance + KVServe 形成「跨族 KV Cache 传输 = 异构推理 + 服务感知压缩 + 跨模型语义通信 + 缓存 TTL」完整链路预备级 + KV Cache 系统级优化第七维预备级

  • 要点: 1. LMDeploy 16,132 tok/s = 与 SGLang 16,215 / vLLM 12,553 / TGI 9,500 形成 5 方格局量化矩阵 = LMDeploy 实际吞吐与 SGLang 仅相差 0.5% 几乎持平 = "vLLM/SGLang/LMDeploy 三强 + TensorRT-LLM 10,000+ + TGI 9,500 维护 + llama.cpp 6,000 边缘" 完整版图 2. v3.50 morning 已锚入 KV Cache 异构跨族传输完整链路 = HotPrefix(SGLang 集成 2.25× vs vLLM)+ C2C(cache-to-cache neural fuser 8.5-10.5% 精度提升)+ TokenDance(多轮 Agent KV cache TTL)+ KVServe(Bayesian Profiling Engine 服务感知压缩)+ Prefill-Free Cross-Family KV Cache Transfer 1630 2609.32259 = 5 件链路预备级 3. HF State of Open Models Qwen 社区事实标准底座 = 与 v3.50 morning §1.(1) 沿用稳态 + jay 10-3 evening-supplement §二 4 维精修

  • 与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) + §1.(3) 已锚入。本增量是 LMDeploy 16,132 tok/s 第四方 + 完整 KV Cache 异构跨族传输 5 件链路预备级锚定承接预备级补强。

  • 建议归入节:§0.5.1 §1.(1) 推理引擎(LMDeploy 16,132 tok/s 第四方预备级) + §1.(3) KV Cache(完整链路预备级锚定承接沿用稳态)

  • 可信度:⭐⭐⭐⭐(prem.io / yottalabs.ai / spheron.network 三源 + 与 v3.50 morning 已锚入数据精确闭合)


二、矛盾或待核实警示(5 条)

⚠⚬⚬ 待核 1:Vector DB 2026 Q4 双源基准 Qdrant 1M p50/p99 数据精度矛盾

jay 10-3 morning-briefing §database/2 Qdrant p50=4ms vs jay 10-3 afternoon-briefing §一 Qdrant 4ms p50 / 25ms p99 vs v3.50 morning §0.5.1 Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1,200 QPS 三源数据存在显著精度差异: - v3.50 morning 已锚入:Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1,200 QPS(第七源) - jay 10-3 morning-briefing:Qdrant p50=4ms(无 p99 数据) - jay 10-3 afternoon-briefing:Qdrant 4ms p50 / 25ms p99 / ~1,200 QPS

核心矛盾 = v3.50 morning 已锚入 p50 2.1ms / p99 6.3ms vs jay 10-3 afternoon-briefing p50 4ms / p99 25ms ≈ 2× p50 + 4× p99 差异。可能原因 = (a) 评测条件不同(HNSW 调优 vs 默认 / recall ~0.95 vs 0.99 / 单分片 vs 集群 / 硬件配置差异)· (b) 数据集大小(50M vs 1M)· (c) 时间窗口不同(2026 Q3 vs 2026 Q4)。建议 = 在 v3.50 evening 棒位承接时,必须回溯评测条件原始来源 + 在 §1.(10) 标注 「Qdrant 1M 实测数据存在 2×-4× 差异,需回溯评测条件」。


⚠⚬⚬ 待核 2:pgvectorscale 471 QPS 反例冲击 v3.50 morning "Qdrant P99 6ms 50M"

jay 10-3 morning-briefing §database/1 = pgvector + Timescale pgvectorscale 在 50M 向量 1536 维 99% 召回率下 471 QPS · p95 28ms · 比 Qdrant 快 11.4 倍 = 与 v3.50 morning §0.5.1 §1.(10) "Qdrant P99 6ms 50M 向量实测" 形成直接反例冲击。关键前提 = 该数据基于 Timescale pgvectorscale 商业扩展(非纯开源 pgvector);纯开源 PostgreSQL 基础版 pgvector 性能仍低于 Qdrant(jay 10-3 engineering-e1prep §增量 3 + ⚠⚬⚬ 待核 2 明确标注)。

核心矛盾 = 商业扩展 vs 开源 = 选型决策时必须区分许可证限制。建议 = 在 v3.50 evening 棒位承接时,必须在 §1.(10) 标注 「pgvectorscale 商业扩展反例 ⚠⚬·开源 pgvector 性能仍低于 Qdrant·商业许可证需后续核实」。


⚠⚬⚬ 待核 3:TGI 进入维护模式时间精度矛盾(沿用 v3.50 morning D224)

v3.50 morning §0.5.1 §1.(1) 已锚入 D224 ⚠⚬⚬ TGI 进入维护模式时间精度新矛盾 = jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异。本棒位 jay 10-3 afternoon-briefing §二仍沿用 "TGI 进入维护模式(2025-12)" = 与 v3.50 morning D224 完全一致,矛盾未解。建议 = 在 v3.50 evening 棒位承接时,必须查阅 HuggingFace 官方公告原文(https://github.com/huggingface/text-generation-inference/blob/main/README.md + HF 官方博客)确认准确时间点。


⚠⚬⚬ 待核 4:Meta-Harness 6× 性能差距数据精度矛盾(沿用 v3.50 morning D225)

v3.50 morning §0.5.1 §1.(2) 已锚入 D225 ⚠⚬⚬ Meta-Harness 6× 性能差距数据需查阅 Meta-Harness 原论文核实 · 实验设置、baseline 选择、任务型类型均未详 · ⭐⭐⭐⭐ 核实优先级 · Harness Engineering 第七源预备扩增稳态。本棒位 jay 10-3 morning-briefing §backend/4 给出新数据 = "纯人类代码 + LLM 审核的生产案例" + Meta-Harness 通过给 agent 原始执行轨迹(最多 10M token)实现自动化 harness 工程 + text classification +7.7 分 = 给出了具体实现细节(10M token 原始执行轨迹 + text classification +7.7 分)但仍未给出 Meta-Harness 原论文 arXiv 号。核心矛盾 = 数据精度已提升但原论文仍未锚入。建议 = 在 v3.50 evening 棒位承接时,必须查阅 thecamelhall Substack 原始博文 + 检索 Meta-Harness arXiv 号。


⚠⚬⚬ 待核 5:GLM-5.2 作为 ICML 2026 复现自动化 Judge 待核实(沿用 v3.50 morning D226)

v3.50 morning §0.5.1 §1.(2) 已锚入 D226 ⚠⚬ ICML 2026 复现实验 GLM-5.2 作为自动化 Judge 待核实 · Judge 准确率 + 跨领域泛化性 + 潜在 Judge 偏差均未详尽披露 · 274 份 Agent Trace 数据集实测。本棒位无新增 GLM-5.2 Judge 数据精度承接 = 矛盾未解。建议 = 在 v3.50 evening 棒位承接时,必须查阅 HF Hub ICML 2026 Reproduction Track 官方报告 + 274 份 Agent Trace 数据集 README确认 GLM-5.2 Judge 评估精度 + Judge 偏差。


三、可引用的 arXiv 号列表(本窗口内 / 与 llm-infra 主轴相关)

本棒位 v3.50 evening 候选承接 = §IX 109 evening 棒位预备候选承接预备级。本窗口内(2026-10-02 18:40 → 2026-10-03 18:40 CST)无 NET-new llm-infra 主轴 arXiv;承接 paper_cards 10-3 02:13 = 1629 Smaller Models Better Rejects arXiv:2609.38987(主分类 llm-infra · v3.50 morning 未承接 → v3.50 evening 棒位候选承接预备级)+ 已沿用稳态 + 候选承接预备级。

3.1 已锚入 v3.50 morning + 10-2 evening 入池 = v3.50 evening 候选承接

arXiv ID paper_card 主题 状态
arXiv:2609.38987 1629 Smaller Models, Better Rejects: Preference Distillation Scaling 主分类 llm-infra · v3.50 morning 未承接(因 mtime 2026-10-03 02:13 > v3.50 morning 05:00)→ v3.50 evening 棒位候选承接预备级

3.2 承接稳态(已沿用 · 无 NET-new)

arXiv ID paper_card 主题 状态
arXiv:2609.39929 1609 RoPE at the End of Its Rope · 位置编码长上下文失效 v3.50 morning 已锚入 §0.5.1
arXiv:2609.32259 1630 Prefill-Free Cross-Family KV Cache Transfer v3.50 morning 已锚入 §0.5.1 §1.(3)
arXiv:2609.40316 1604 Loop Scaling Laws for Looped Mixture of Experts v3.50 morning 已沿用 §1.(5)/(8)
arXiv:2609.38137 — LongHarness Bench flyp 10-2 critical-read 9KB 沿用稳态
arXiv:2606.31145 — SeKV · Hierarchical Semantic KV Cache flyp 10-3 sat-structured-deep-read 11.6KB 沿用稳态
arXiv:2605.30104 — SEAL · LLM-as-Judge Protocol flyp 10-3 sat-adversarial-review 13KB 沿用稳态
arXiv:2610.02185 — 几乎免费地更好地解码循环 Transformer 19▲ #9 tom 10-3 0900 hf-daily llm-infra 主轴直命中
arXiv:2609.33252 — CascadeEP · MoE 异步专家调度 jay 10-2 evening-engineering-filter 沿用
arXiv:2603.19289 — Speculating Experts · 专家预取 jay 10-2 evening-engineering-filter 沿用
arXiv:2610.00437 1636 JevSpawn · Adaptive Agentic Inference jay 10-3 jay-engineering-filter 沿用
arXiv:2609.38349 1619 MILO · Harness Discovery jay 10-3 jay-engineering-filter 沿用
arXiv:2609.10226v1 — Φ-Bench · LLM 基础设施工程能力基准 jay 10-3 jay-engineering-filter 沿用
arXiv:2606.24506 — CrossPool · Cold MoE 多 LLM Serving jay 10-2 evening-engineering-filter 沿用
arXiv:2610.00544 1627 Memorizon · Training World Models Beyond Context Window flyp 10-3 multimodal-e1prep §增量 ⑤
arXiv:2609.36435 1646 MemFold · Compact Soft Memory for Long-Context Personalization 10-3 16:30 入池 · engineering 主分类 + 邻接 llm-infra
arXiv:2609.22753 1647 Jev Decision Models for Edge Service Orchestration 10-3 16:30 入池 · engineering 主分类 + 邻接 llm-infra
arXiv:2609.39982 1601 Mid-Harness · Scaling Actions Between Model and Harness work-queue 选题榜沿用 + evaluation 主分类
arXiv:2610.01871 1625 ImmRAG · Datastore Extraction from Multimodal RAG flyp 10-3 multimodal 副 llm-infra
arXiv:2610.01936 1624 Mapping the RAG Landscape · Four Axis Taxonomy stephen v108 + jay database-e1prep 沿用
arXiv:2609.36138 1637 When Does Correction Become Repair? tom 10-2 evaluation-e1prep + agent-rag-longcontext-radar 沿用
arXiv:2610.01767 1640 MatRAG · Matryoshka Hierarchical RAG tom 10-3 rag-e1prep + agent-rag-longcontext-radar 沿用
arXiv:2606.26511 238 Temporal Validity in Retrieval Memory tom 10-3 rag-e1prep 沿用
arXiv:2607.01935 197 A-TMA tom 10-3 rag-e1prep 沿用
arXiv:2609.32993 1644 X-Tree · Tokenizing Reusable Experience tom 10-3 agent-rag-longcontext-radar + hf-daily 12▲ 沿用
arXiv:2609.37690 1643 Honeycomb · Constant-Size Scene Memory for Video World Models tom 10-3 agent-rag-longcontext-radar 沿用
arXiv:2609.37533 — E-MoE · Mixture-of-Experts for Non-Factorized Diffusion LMs tom 10-3 hf-daily 49▲ 沿用
arXiv:2610.01939 — GPT-6 Astra 机器人 Agent tom 10-3 hf-daily 24▲ multimodal 邻接 + stephen ai-industry v71 ⚠⚬⚬⚠ 矛盾
arXiv:2609.26333 — DQ · Disaggregated Query v3.49 evening §1.(3) 沿用
arXiv:2609.23130 — Inference Control Plane v3.49 evening §1.(11) 沿用
arXiv:2609.17863 — Pareto Atlas v3.49 evening §1.(12) 沿用
arXiv:2511.01815 — KVTC ICLR 2026 v3.49 evening §1.(12) 沿用
arXiv:2609.11744 — py-kvcache 工程综述 v3.48 morning §1.(11) 沿用
arXiv:2609.34645 1565 Nereus · LLM 后训练自适应并行 v3.48 morning §1.(8)/(11) 沿用
arXiv:2609.33591 — 沿用 v3.50 morning §1.(4) 沿用

合计:承接稳态 + 候选承接预备级 = 共 34 件 arXiv(其中 1 件 v3.50 evening 候选承接预备级 + 33 件承接稳态);0 NET-new arXiv(本窗口内无 NET-new arXiv ID 入池)。


四、本轮承接 vs v3.50 morning 沿用对比

维度 v3.50 morning(2026-10-03 05:00) 本棒位 v3.50 evening 候选承接预备级(2026-10-03 18:40)
NET-new paper_card 主分类 llm-infra 1(1609 RoPE at the End of Its Rope) 0(本窗口无 NET-new 主分类入池;10-3 早棒 0 件入池;承接 1629 = v3.50 evening 棒位候选承接预备级)
NET-new paper_card engineering 邻接 1(1630 Prefill-Free Cross-Family KV Cache Transfer) 0(本窗口无 NET-new engineering 邻接入池)
NET-new paper_card 其他邻接 0 3(1646 MemFold + 1647 Jev Decision Models + 1601 Mid-Harness 已沿用稳态)
NET-new arXiv ID 2(2609.39929 + 2609.32259) 0
NET-new CVE/DOI 0 0
NET-new URL 2 0(承接稳态沿用)
承接稳态精修预备级 5 件 9 件(增补 Vector DB Lite · 推理引擎 4 方格局 · Agent Memory 三层 · HF Qwen 4 维精修 · 自托管 VecDB 共置 · MCP 2026-09 实时 · vLLM 2026 Roadmap · RAG 评估 5 维 · LMDeploy 16,132 tok/s)
NET-new 矛盾/待核 4(D223-D226) 5(D227-D231 候选 = Vector DB Lite 精度矛盾 + pgvectorscale 商业扩展反例 + D224 沿用 + D225 沿用 + D226 沿用)
arXiv/CVE/DOI/URL 计数 440/36/15/573 440/36/15/573(精确闭合 · 0 NET-new)

五、本棒位核心结论与 §IX 109 evening 棒位承接预备级建议

5.1 核心结论

本轮 llm-infra 主轴新增量密度 = 低:v3.50 morning(2026-10-03 05:00)已承接 1 NET-new paper_card 主分类 llm-infra(1609 RoPE)+ 1 NET-new paper_card engineering 邻接(1630 Prefill-Free Cross-Family KV Cache Transfer)+ 2 NET-new arXiv ID + 2 NET-new URL + 5 件承接稳态精修预备级 + 4 件 NET-new 矛盾/待核(D223-D226)= arXiv/CVE/DOI/URL 440/36/15/573 精确闭合。本窗口内(2026-10-02 18:40 → 2026-10-03 18:40)无 NET-new arXiv 入池,无 NET-new CVE/DOI/URL,承接 paper_cards 10-3 02:13 入池的 1629 Smaller Models Better Rejects(主分类 llm-infra · v3.50 morning 未承接 → v3.50 evening 棒位候选承接预备级)。

承接稳态精修预备级预备承接预备级锚定: 1. Vector DB 2026 Q4 双源基准第四方 = jay 10-3 morning + afternoon 双源基准 · Qdrant 1M p50/p99 双源精度矛盾 + pgvectorscale 商业扩展反例冲击 + Redis 5ms p50 / Milvus 2.6+ BM25/CAGRA/Storage Format V2 + ChromaDB 12ms / Weaviate 12ms / Elasticsearch 15ms / pgvector 18ms = 10 数据点完整版图谱预备级 2. LLM 推理引擎 2026 秋季快照 5 方格局量化补强 = SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TensorRT-LLM 10,000+ / TGI 9,500 / llama.cpp 6,000 tok/s 6 引擎完整数据矩阵 + D224 ⚠⚬⚬ TGI 时间精度矛盾待核 3. Agent Memory 三层架构 = L1 Context Window / L2 In-Context Memory / L3 Long-Term Memory + 框架层选型判断 = Memory 独立原语预备级补强 4. HF State of Open Models Summer 2026 沿用稳态精修 = Qwen 社区事实 base model + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B + Agents are the new user + 推荐关注模型 + 部署工具价值转移 = 6 维精修承接预备级 5. 自托管 VecDB + LLM GPU 共置部署 = vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · Total round trip < 50ms(H100 SXM5)+ Qdrant v1.17+ HNSW 4× + Milvus 2.6+ BM25/CAGRA + 选型建议 = 部署成本预备级补强 6. MCP 2026-09 生态爆发数据 = MCP servers 仓库 86,148 stars / mcp-server topic 15,926 仓库 / 月 SDK 下载 97M+ + LangChain/LangGraph 争议结论预备级 7. vLLM Production Stack 2026 Roadmap = GitHub Issue #855 P0 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal(vLLM Omni)+ P1 Agent 负载智能路由 + V1 重构引擎 + FP8 KV-cache 验证(Hopper & Blackwell) = 路线图预备级 8. RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链 = Precision@K/Recall@K/MRR/nDCG/Diversity + Faithfulness/Relevance/Citation Coverage/Hallucination Rate/Completeness + RAGBench/CRAG/LegalBench-RAG/WixQA/T²-RAGBench + Ragas/Galileo/Braintrust/Evidently AI/DeepEvaluate = 评测方法学预备级补强 9. KV Cache 异构跨族传输 5 件链路预备级锚定承接 = HotPrefix + C2C + TokenDance + KVServe + Prefill-Free Cross-Family KV Cache Transfer 1630 + LMDeploy 16,132 tok/s 第四方 = KV Cache 系统级优化第七维预备级补强

承接稳态精修预备级预备承接预备级 = 「v3.50 evening 在 v3.50 morning 已成型的 LLM 推理软件栈垂直分层 6 层栈基础上」+「2026 Q4 Vector DB 双源基准 + pgvectorscale 商业扩展反例 + 10 数据点完整版图谱预备级补强」+「LMDeploy 16,132 tok/s 第四方预备级补强 + 推理引擎 2026 秋季快照 6 引擎完整数据矩阵」+「Agent Memory 三层架构 L1/L2/L3 独立原语框架预备级补强」+「HF State of Open Models Qwen 6 维精修预备承接稳态」+「自托管 VecDB + LLM GPU 共置部署实操路径预备级补强」+「MCP 2026-09 实时数据精修预备级」+「vLLM 2026 Production Stack 路线图预备级」+「RAG 评估体系 5 维预备级补强」+「KV Cache 异构跨族传输 5 件链路预备级锚定承接」形成 2026 Q4 初 llm-infra 工程化完整里程碑体系。

5.2 §IX 109 evening 棒位承接预备候选建议

维度 建议
NET-new paper_card 主分类 llm-infra 1 件 NET-new = paper_card 1629 arXiv:2609.38987 Smaller Models, Better Rejects: Preference Distillation Scaling(主分类 llm-infra · method · 10-3 02:13 入池 · v3.50 evening 棒位承接预备级 · 「偏好蒸馏 rejection 任务结构 + 限制参考策略耦合 + 小冻结模型低成本提供」 = Rejection Sampling 与 RLHF / DPO 工程化预备级补强)
NET-new paper_card 其他邻接 0(已沿用稳态)
NET-new arXiv ID 1 = 2609.38987(Smaller Models Better Rejects)+ 沿用
NET-new CVE/DOI/URL 0
承接稳态精修预备级锚定预备承接 9 件(Vector DB 双源 + 推理引擎 6 引擎 + Agent Memory 三层 + HF Qwen 6 维 + 自托管 VecDB 共置 + MCP 2026-09 + vLLM Roadmap + RAG 评估 5 维 + KV Cache 链路)
NET-new 矛盾/待核 5 件 = D227 Vector DB Lite 精度矛盾 + D228 pgvectorscale 商业扩展反例 + D224 ⚠⚬⚬ TGI 时间精度矛盾沿用 + D225 ⚠⚬⚬ Meta-Harness 6× 数据精度矛盾沿用 + D226 ⚠⚬ ICML 2026 复现 GLM-5.2 Judge 待核沿用
arXiv/CVE/DOI/URL 计数 441/36/15/573(v3.50 morning 440 → v3.50 evening 441 = 净增 1 NET-new arXiv ID = 2609.38987 + 沿用 440)

5.3 本棒位诚实度声明

本轮 llm-infra 主轴新增量密度为「低」 —— 围绕 KV Cache 推理系统工程延续(pgvectorscale 量化、Vector DB 2026 Q4 双源基准、LLM 推理引擎第四方格局量化补强、自托管 VecDB+LLM GPU 共置实操路径、推理引擎实测四源、SGLang/vLLM RadixAttention / Unified Radix Cache 第四源数据精修、Agent Memory 三层架构 = L1/L2/L3 框架、HF State of Open Models Summer 2026 沿用稳态精修),共九条增量候选 + 五处矛盾/待核警示。无 net-new paper_card 入池(10-3 早棒 0 件),无 net-new arXiv ID,无 net-new CVE/DOI/URL;承接 2026-10-02 evening 至 2026-10-03 18:40 的 jay / tom / flyp / stephen 4 实例产出 = 主轴稳态精修 + 矛盾预备级锚定预备承接,无硬凑条目。


附:本简报由 spark · E1 日间预消化轮(llm-infra)· 2026-10-03 18:40 CST(周六)生成;下一棒位 §IX 109 evening v3.50 候选承接 = 2026-10-03 18:40 CST(预计 22:30 CST 完成)。