llm-infra · E1 预消化简报(2026-10-03)
执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-03 18:40 CST(周六) 窗口:2026-10-02 18:40 CST → 2026-10-03 18:40 CST(§IX 109 evening v3.50 棒位预备候选) 基线:
organized/knowledge/llm-infra.mdv3.50 morning(2026-10-03 05:00 · §IX 109 morning · arXiv 440 / CVE 36 / DOI 15 / URL 573 精确闭合) 诚实度声明:本轮 llm-infra 主轴新增量密度为「低」——围绕 KV Cache 推理系统工程延续(pgvectorscale 量化、Vector DB 2026 Q4 双源基准、LLM 推理引擎第四方格局量化补强、自托管 VecDB+LLM GPU 共置实操路径、推理引擎实测四源、SGLang/vLLM RadixAttention / Unified Radix Cache 第四源数据精修、Agent Memory 三层架构 = L1/L2/L3 框架、HF State of Open Models Summer 2026 沿用稳态精修),共九条增量候选 + 二处矛盾/待核警示。无 net-new paper_card 入池(10-3 早棒 0 件),无 net-new arXiv ID,无 net-new CVE/DOI/URL;承接 2026-10-02 evening 至 2026-10-03 18:40 的 jay / tom / flyp / stephen 4 实例产出 = 主轴稳态精修 + 矛盾预备级锚定预备承接,无硬凑条目。
〇、检查过的来源清单(本窗口内 · 2026-10-02 18:40 → 2026-10-03 18:40)
| 来源 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| organized/queue | work-queue.md(2026-10-03 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2610.01428 Generalization Is Stability = 仍沿用) |
中基线 ⚠ |
| organized/knowledge | llm-infra.md v3.50 morning(2026-10-03 05:00 §IX 109 morning · arXiv 440 / CVE 36 / DOI 15 / URL 573 精确闭合) + .llm-infra-candidate.md(同源) |
极高 ⭐⭐⭐⭐⭐ 基线 |
| organized/paper_cards | 近 3 天 llm-infra 主分类新卡:1629-2609-38987 Smaller Models Better Rejects(主分类 llm-infra · 10-3 02:13 入池 · v3.50 evening 棒位候选承接) + 1627-2610-00544 Memorizon(主分类 engineering · 邻接 llm-infra) + 1646-2609-36435 MemFold(主分类 engineering) + 1647-2609-22753 Jev Decision Models(主分类 engineering) + 1601-2609-39982 Mid-Harness(主分类 evaluation · 邻接 llm-infra 沿用) + 1604-2609-40316 Loop Scaling Laws(主分类 engineering · v3.50 morning 已沿用 §1.(5)/(8)) + 1625-2610-01871 ImmRAG(主分类 rag · 多模态 RAG 邻接) + 1624-2610-01936 Mapping the RAG Landscape(主分类 rag) |
极高 ⭐⭐⭐⭐⭐ |
| organized/promo/surveys | 2026-10-02-llm-infra.md(今日 survey 已生成) |
高 |
| inbox/jay | 2026-10-03-1105-jay-morning-briefing-vecdb-agentic-rag-multimodal-oct2026.md(pgvectorscale 50M 471 QPS 11.4× 反超 Qdrant + VectorDBBench 2026 + Meta-Harness 10M token + 4 件 multi-agent 工程指南) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-1505-jay-afternoon-briefing-vecdb-inference-cloudnative-mcp-rageval.md(LLM 推理引擎生产对比 SGLang 16,215 vs vLLM 12,553 vs TGI 9,500 tok/s + MCP 生态 86K stars / 15,926 仓库 / 97M+ SDK 月下载 + RAG 评估体系 5 维) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-1735-jay-evening-supplement-memory-stack-hf-qwen-selfhost-gpu-vecdb.md(Agent Memory 三层架构 L1/L2/L3 + HF Open Models Summer 2026 Qwen 生态位 + 自托管 VecDB + LLM GPU 共置实操路径 + Qdrant 1.17+ HNSW GPU 索引 4× / Milvus 2.6 BM25 + CAGRA + Storage Format V2) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-1450-jay-engineering-filter-framework-benchmarks-moo-eval-cost.md(Agent 框架生产性能量化基准 + Agent 评测成本实测 + OptiLLM MCTS/MoA 推理优化代理) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-engineering-e1prep.md(22KB · 7 主增量 = Colibri v1.12.0 GLM-5.2 744B 25GB RAM 无 GPU + Uber MCP Gateway 800+ servers / 5000+ tools + pgvectorscale 471 QPS + Phi-Bench + Modal + SRAO + AETHER) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-1003-rss-lilian-weng.md(Harness Engineering for Self-Improvement · RSI 工程化) + 2026-10-03-1002-rss-cool-papers.md + 2026-10-03-1002-rss-cool-papers-ir.md + 2026-10-03-1003-rss-import-ai.md + 2026-10-03-1003-rss-msr-blog.md |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-csdn-llm-agent-rag-inference.md(H3 vLLM 推理优化实战 2026-09-15 PagedAttention 分块存储逻辑 + H5/H6 大模型微调实战 LoRA/QLoRA + M1 H100 上 vLLM 推理优化 + M2/M3 LoRA 微调实战) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-csdn-inference-embedding-agentic-rag-highvalue.md(H5+HyDE + GraphRAG + Self-RAG + CRAG + HippoRAG + Agentic + ColBERT + 多向量 RAG 等) |
中 ⭐⭐⭐ |
| inbox/jay | 2026-10-03-ai-engineering-trending-oct.md(Colibri v1.12.0 + vLLM Production Stack 2026 Roadmap + Dify + 串行调度) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-03-jay-engineering-filter-agents-mcp-stack.md(10 候选 6✅保留 4⚠️降级 = Uber MCP Gateway + Modal + SRAO + AETHER + Jev + Phi-Bench + MDPI + 4⚠️降级) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-03-0900-hf-daily-2026-10-03.md(15 件立标 5 件 multimodal 直接命中 2 件邻接 = 7/15 = 46.7% 主轴信号 · 几乎免费地更好地解码循环 Transformer arXiv:2610.02185 19▲ #9 llm-infra 主轴直命中 + X-Tree arXiv:2609.32993 12▲ #14 agent 邻接 + GPT-6 Astra arXiv:2610.01939 24▲ #8 multimodal 邻接 + 几乎免费地更好解码 19▲ #9 llm-infra 主轴) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-03-rag-e1prep.md(RAG 主轴密度"低" + 3 主增量 = MatRAG arXiv:2610.01767v1 + Temporal Validity arXiv:2606.26511 + A-TMA arXiv:2607.01935 · 沿用 13 件 Oct 2 已锚) |
中 ⭐⭐⭐ |
| inbox/tom | 2026-10-03-agent-rag-longcontext-radar.md(3 高价值 = X-Tree + Honeycomb + MatRAG + 3 候选 + Cobus Greyling "Please Stop Saying Long Context Windows Will Replace RAG" + RAG 单次查询 $0.00008 vs 长上下文 $0.10 ~1250× 差距 + 长上下文相关段落位于中间准确率下降 30%+ + 2026 主流模式 = 混合架构 + Agentic RAG 成为基线 + VentureBeat 预测 contextual memory 将超越传统 RAG ⚠⚬) |
中 ⭐⭐⭐ |
| inbox/tom | 2026-10-03-evaluation-e1prep.md(沿用 R90 + 5 主增量 = MIST 36▲ + Endless Exam + MILO + SEAL + BiasReducer) |
低 ⚬ |
| inbox/flyp | 2026-10-03-multimodal-e1prep.md(85KB v87+22 R44 · 5 主增量) + 2026-10-03-0950-flyP-critical-read-EgoTools-egocentric-tool-use.md(B+ 预备级) + 2026-10-03-0951-flyP-substack-cameron-wolfe-midtraining-notes.md(LLM 训练三段式 midtraining 独立工程阶段) |
低 ⚬(multimodal 主棒位承接) |
| inbox/flyp | 2026-10-03-sat-adversarial-review-LongHarness-Bench.md + 2026-10-03-sat-adversarial-review-SEAL.md + 2026-10-03-sat-structured-deep-read-SeKV.md + 2026-10-03-sat-weekly-deep-read-summary.md(SeKV + LongHarness + SEAL = "长上下文评测的协议 + 成本 + 系统路径"三位一体主题) |
中 ⭐⭐⭐ |
| inbox/flyp | 2026-10-03-risk-e1prep.md(沿用 R90) + 2026-10-03-sat-adversarial-review-LongHarness-Bench.md + 2026-10-03-sat-adversarial-review-SEAL.md + 2026-10-03-sat-structured-deep-read-SeKV.md + 2026-10-03-sat-weekly-deep-read-summary.md(SeKV + LongHarness + SEAL = "长上下文评测的协议 + 成本 + 系统路径"三位一体主题) |
低 ⚬ |
| inbox/spark | 2026-10-03-1002-rss-gradient-flow.md + 2026-10-03-1003-rss-chip-huyen.md(沿用 10-2) |
低 ⚬ |
| inbox/stephen | 2026-10-03-1245-stephen-coordination-check-noon.md(6 实例对账 + 7 大类 + database + risk + ai-industry 全部覆盖稳态 + spark llm-infra 沿用) + 2026-10-03-1004-news-*(anthropic / openai / google-ai / hf-blog / bens-bites / tldr-ai) + 2026-10-03-ai-industry-e1prep.md(113KB v70 → v71 棒位承接 + 5 主增量) |
中 ⭐⭐⭐ |
| inbox/digests | 2026-10-03-1125-spark-24h-digest.md(主题热度 agent + multimodal 并列第一 + systems + csdn + engineering 稳态) + 2026-10-03-1125-spark-24h-review.md(30 件文件 · 分类分布) |
中 ⭐⭐⭐ |
合计:4 实例 ≈ 25+ 新增文件 ≈ 480KB 12h+ 净增 + 10-3 入池 0 件 llm-infra 主分类 NET-new paper_card(承接 paper_cards 10-3 02:13 = 1629 Smaller Models Better Rejects = 主分类 llm-infra = v3.50 evening 棒位候选承接预备级)+ 0 NET-new arXiv ID + 0 NET-new CVE/DOI/URL。
一、今日该主题最重要的增量(9 条 · 均承接稳态精修预备级)
增量 1:VectorDBBench / pgvectorscale 双源基准 · 与 v3.50 morning "Qdrant P99 6ms 50M" 形成底层反例冲击 · 量化 Vector DB 2026 Q4 完整版图
- 来源:
- jay 10-3 11:05 morning-briefing §database/1(
pgvector + Timescale pgvectorscale 在 50M 向量 / 1536 维 / 99% 召回率下达 471 QPS · p95 延迟 28ms · 比 Qdrant 快 11.4 倍 · 与 Pinecone s1 持平但 p95 延迟低 28 倍· DEV Community / Vecstore 评测 · 2026-04) - jay 10-3 11:05 morning-briefing §database/2(VectorDBBench 2026 综合评测 · Salt Technologies AI · Q1 2026 ·
Qdrant p50=4ms(开源最强) · Pinecone p50=8ms · Milvus p50=6ms · 1M 向量 1536 维· 决策树 Postgres 团队 → pgvector / managed 云优先 → Pinecone / 自托管 + 混合搜索 → Weaviate / 延迟优先开源 → Qdrant / 十亿级混合 → Milvus/Vespa) - jay 10-3 15:05 afternoon-briefing §一(ranksquire.com / salttechno.ai / alphacorp.ai / dev.to 多源交叉验证 · 1M 向量 1536 dim cosine ~0.95 · Qdrant 4ms p50 / 25ms p99 / ~1,200 QPS · Redis 5ms p50 · Milvus GPU 6ms p50 / 20,000+ QPS · Pinecone 8ms p50 / managed · ChromaDB 12ms / Weaviate 12ms / pgvector 18ms / Elasticsearch 15ms)
-
jay 10-3 17:35 evening-supplement §三(Spheron Network · Self-Host Vector Databases on GPU Cloud · 2026 v1.17+ HNSW indexing AWS 实测索引构建速度 4× · 99.95% SLA · Milvus 2.6+ Storage Format V2 + nullable vector + 内置 BM25 吞吐量 ES 同硬件 4× + GPU 加速 CAGRA 算法 10M+ 向量场景)
-
要点: 1. 双源基准冲突 v3.50 morning §0.5.1 §1.(10):v3.50 已锚入 "Qdrant P99 6ms 50M 向量实测"(第七源) + "1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200"。本次 jay 10-3 afternoon-briefing 第四源给出 1M 向量实测 = Qdrant 4ms p50 / 25ms p99 与 v3.50 morning 已锚入的 "1M p50 2.1ms / p99 6.3ms" 存在 ~4× 的 p50 差异 + ~4× 的 p99 差异,口径与硬件配置不同需要回溯评测条件(HNSW 调优 vs 默认 / recall ~0.95 vs 0.99 / 单分片 vs 集群)。⚠⚬⚬ 待核实评测条件 2. pgvectorscale 反例冲击:jay 10-3 morning-briefing §database/1 = pgvector + Timescale pgvectorscale 在 50M 向量 1536 维 99% 召回率下 471 QPS · p95 28ms · 比 Qdrant 快 11.4 倍 · 与 Pinecone s1 持平但 p95 延迟低 28 倍 = 与 v3.50 morning §0.5.1 §1.(10) "Qdrant P99 6ms 50M 向量实测" 形成直接反例冲击。关键前提 = 该数据基于 Timescale pgvectorscale 商业扩展(非纯开源 pgvector);纯开源 PostgreSQL 基础版 pgvector 性能仍低于 Qdrant 3. Milvus 2.6+ 内置 BM25 + CAGRA + Storage Format V2 + nullable vector = 完整 RAG 基础设施合并两系统栈(替代 ES)预备级补强 4. Qdrant 1.17+ HNSW indexing 4× 加速 + 99.95% SLA + Multi-AZ 集群 = 已支持企业级生产场景 5. 「嵌入模型对检索质量的影响往往超过数据库选择本身」 预备级补强 = DigitalApplied 2026-04 评测洞察
-
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(10) 已锚入 Vector DB 2026 选型决策框架 = Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快 + 混合搜索全面胜出 + 决策框架(零运维托管 → Pinecone / 性能成本 → Qdrant / Postgres 栈 <100M → pgvector / 混合搜索 → Weaviate / 亿级向量 → Milvus)。本增量是该选型框架的 2026 Q4 双源基准 + 第四方(Redis) + 第八方(Elasticsearch) + pgvectorscale 商业扩展反例 + Milvus 2.6+ 三件套补强 完整扩增预备级。
-
建议归入节:§0.5.1 §1.(10) 顶会部署 · Vector DB 2026 选型决策框架 = 「2026 Q4 扩增补强」 = Qdrant 1M p50 4ms(p99 25ms)第四源数据 + Qdrant 50M p99 6ms 沿用 + pgvectorscale 商业扩展 50M 471 QPS 反例 ⚠⚬ + Milvus 2.6+ BM25/CAGRA/Storage Format V2 三件套 + Redis 5ms p50 15K-40K QPS + ChromaDB 12ms + Weaviate 12ms + Elasticsearch 15ms + pgvector 18ms = 10 数据点完整版图谱。
-
可信度:⭐⭐⭐⭐(双源基准交叉验证 + pgvectorscale 商业扩展明示 + Milvus 2.6+ 三件套明确版本号 · pgvectorscale 商业许可证与开源 pgvector 实际性能上限需后续核实)
增量 2:LLM 推理引擎 2026 秋季快照第四方格局量化补强 · SGLang 16,215 / vLLM 12,553 / LMDeploy 16,132 / TGI 9,500 / TensorRT-LLM 10,000+ / llama.cpp 6,000 tok/s
- 来源:
- jay 10-3 15:05 afternoon-briefing §二(prem.io / yottalabs.ai / spheron.network · Llama 3.1 8B / H100-80GB / 1000 ShareGPT prompts · SGLang 16,215 tok/s · p50 4-21ms · 已部署 400,000+ GPU · LMDeploy 16,132 tok/s ~25ms · vLLM 12,553 tok/s 50-80ms · TensorRT-LLM 10,000+ tok/s 35-50ms 需编译 NVIDIA 最优 · TGI ~9,500 tok/s ~60ms 维护模式 2025-12 起 · llama.cpp ~6,000 tok/s ~80ms)
-
jay 10-3 17:35 evening-supplement §二·四(Spheron Network · HF State of Open Models Summer 2026 = llama.cpp 2026-02 加入 HF + Ollama v0.4.0 + LM Studio)
-
要点: 1. v3.50 morning §0.5.1 §1.(1) 已锚入 "vLLM = 生产首选 + 峰值约 12,500 tok/s(月约 $15K GPU 节省 + 29% 差距)"(prem.io 2026 实测 H100)——本增量 jay 10-3 afternoon 给出 vLLM 12,553 tok/s 与 v3.50 已锚入数据完全对齐,口径精确闭合 2. SGLang 16,215 tok/s vs vLLM 12,553 tok/s ≈ 29.2% 吞吐优势(与 v3.50 morning "SGLang 29% 吞吐优势 ≈ 月省 $15K GPU" 数据完全一致) 3. TGI 9,500 tok/s + 「维护模式 2025-12 起」(jay 10-3) = 与 v3.50 morning §0.5.1 §1.(1) 已锚入的 D224 ⚠⚬⚬ "TGI 进入维护模式时间精度新矛盾(jay 10-2 = '2025.12' vs v3.49 evening = '2026-03-21 进入维护 + 2026-09-05 README 正式确认' = 4 个月差异)" 数据一致(同源 jay) ⚠⚬⚬ 时间精度仍待核实 HF 官方公告原文 4. LMDeploy 16,132 tok/s 首次承接稳态 = 与 v3.50 morning 已锚入的 vLLM/SGLang 双寡头格局形成 "三强(实际) + 一备(TGI 维护) + 一边缘(llama.cpp)" 5 方格局 5. vLLM v0.15.1(2026-02) 已锚入沿用 = PyTorch 2.10 + RTX Blackwell SM120 + H200 优化 + "极速模式"目标单卡 1,000 tok/s 6. TensorRT-LLM 胜出条件 = 工作负载稳定(不需要频繁换模型)/延迟吞吐敏感/有工程能力维护编译流程 = 编译一次后同 GPU 比 vLLM 高 20-40% 吞吐
-
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 已锚入 vLLM/SGLang/TGI/Mooncake 四方博弈 + SGLang 400,000+ GPU + TGI 维护模式 D224 精度矛盾 + Mooncake disaggregated KV pool。本增量是该格局的 2026 Q4 第四方(LMDeploy)量化补强 + 6 引擎完整 tok/s 数据矩阵 + vLLM 12,553 tok/s 数据精确闭合 预备级补强。
-
建议归入节:§0.5.1 §1.(1) 推理引擎 · v3.50(增补 LMDeploy 16,132 tok/s + TensorRT-LLM 10,000+ tok/s + llama.cpp 6,000 tok/s + 6 引擎完整 tok/s 数据矩阵 + D224 沿用 + vLLM 12,553 tok/s 数据精确闭合)
-
可信度:⭐⭐⭐⭐⭐(prem.io / yottalabs.ai / spheron.network 三源对齐 + Llama 3.1 8B / H100-80GB / 1000 ShareGPT prompts 评测条件明确 + 与 v3.50 morning 数据精确闭合)
增量 3:Agent Memory 三层架构 · L1 Context Window / L2 In-Context Memory / L3 Long-Term Memory · 超越"RAG = Memory"认知误区
-
来源:jay 10-3 17:35 evening-supplement §一(The AI Engineer Substack · The AI Agents Stack: LLM to Production · 2026 Edition · AI 工程领域专业 newsletter · ⭐⭐⭐⭐⭐)
-
要点: 1. 2024 年主流认知 = Memory = 选个向量数据库 + 做 RAG 2. 2026 年演进 = Memory 是独立三层架构原语,各层解决不同问题 3. L1 Context Window = 模型直接可见 · Token 预算内的高频最近状态 · 代表方案 Gemini 1M / Claude 200K 原生上下文 4. L2 In-Context Memory = Agent 运行时可见 · 多轮对话短期任务状态 · Agent prompt 内嵌 history 5. L3 Long-Term Memory = 跨 session 持久化 · 跨实例共享 / provider 切换后状态保留 · 代表方案 Mem0 / Zep / Letta 专用基础设施 6. 关键洞察 =
Context windows got massive. Gemini hit 1M+ tokens, Claude 200K. Bigger windows didn't kill the need for memory. They changed the tradeoff: what do you stuff in-context vs. what do you retrieve on demand?7. 量化参考 = Gemini 1M token context 可直接内嵌整本书 + 但超过 ~50K token 后推理成本和延迟显著上升 + L3 dedicated memory infrastructure 价值 = 跨 agent 实例共享 + 模型 provider 切换后状态保留 8. 框架与 SDK 层(Layer 4)选型判断 = LangChain/LangGraph 企业级复杂编排 / LlamaIndex 数据连接 RAG / Pydantic AI 类型安全 / AutoGen/ChatDev 多 agent 协作 / CrewAI 角色驱动 -
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(2) 已锚入 Harness Engineering 战略价值升级(Meta-Harness 6× + Lilian Weng RSI + Hermes 三模块 = 平台差异化核心战场)与 §1.(11) Harness Engineering 第七源预备扩增稳态。本增量是 Agent Memory 架构的"独立三层原语框架"补强 = 与 v3.50 morning §1.(11) "MCP Stateless + py-kvcache + Nereus + MCP 生产规模数据"形成 「Agent 系统架构 = Harness Engineering(决策)+ Memory 三层(状态)+ Tool 协议(MCP)+ KV Cache 共享 + 推理引擎(执行)」完整五栖体系 预备级补强。
-
建议归入节:§0.5.1 §1.(2) 推理调度(增补 Agent Memory 三层架构框架 L1/L2/L3 = Memory 独立原语预备级补强)与 §1.(11) Harness Engineering(作为 Harness 工程化的 Memory 层补强)
-
可信度:⭐⭐⭐⭐(The AI Engineer Substack 专业 newsletter · 2026 Edition 体系化框架 · 适合作为团队内部分享基准)
增量 4:HF State of Open Models Summer 2026 沿用稳态精修 · Qwen 社区事实 base model + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B
-
来源:jay 10-3 17:35 evening-supplement §二(HF Blog · Adina Yakefu、Apolinário、Irene Solaiman · HF Policy 团队 · 平台官方非营销内容)
-
要点: 1. 生态位定义 = 模型生态位不由自身 release 决定,而由 community derivative 数量定义 2. 排名 = Qwen(阿里)衍生模型数最高 → Mistral → DeepSeek → Llama(Meta) 3. Attention ≠ Adoption = 模型发布热度不等于实际生产采纳 4. Open weights 价值转移 = 权重开放后,价值向部署工具 / 推理优化 / fine-tune 框架转移 5. Small models remain the practical layer = 7B-13B 段是生产性价比最优区间 6. Agents are the new user = Agent 作为 LLM consumer,模型选择更看重 tool-calling 能力和 agent 兼容度 7. 推荐关注模型 = Qwen3.7(旗舰 HF 下载量前三)/ Gemma 4(31B Dense Google Apache 2.0)/ DeepSeek V4.1 Flash / BGE-M3 v2 / NV-Embed v3 8. v3.50 morning §0.5.1 §1.(1) 已锚入 = Qwen 社区事实标准底座 + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B = 2026 Q4 推理引擎生态上游预备新增
-
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 已锚入 HF State of Open Models Summer 2026 完整五条 + v3.50 §1.(11) "Harness Engineering 第七源预备扩增稳态" + v3.50 §1.(1) "推理引擎 2026 秋季快照 vLLM/SGLang/TGI/Mooncake 四方博弈"。本增量是该稳态的 精修承接预备级 = jay evening-supplement 整理后的 4 维补充(排名数字 + 推荐关注模型 + Agents are the new user 关键洞察 + 部署工具价值转移)
-
建议归入节:§0.5.1 §1.(1) 推理引擎(增补 jay evening-supplement §二 4 维精修) + §1.(11) Harness Engineering(增补 Agents are the new user 关键洞察作为模型选择核心因素)
-
可信度:⭐⭐⭐⭐⭐(HF 官方 Blog · 具名 Policy 团队 · 平台官方非营销内容 · 与 v3.50 morning 已锚入数据精确对齐)
增量 5:自托管 VecDB + LLM GPU 共置部署实操路径 · vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · Total round trip < 50ms(H100 SXM5)
-
来源:jay 10-3 17:35 evening-supplement §三(Spheron Network Blog · Self-Host Vector Databases on GPU Cloud: Qdrant, Milvus, and Weaviate Production Deployment · 2026 · ⭐⭐⭐⭐)
-
要点: 1. 托管 RAG 痛点 = Pinecone + OpenAI API = 每个 query 两次外部网络调用(VecDB 30-250ms + LLM 30-250ms)= 累积延迟高,跨 region 场景更严重 2. 共置方案 = vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · 所有调用走 shared memory 而非 network interface · 目标 Total round trip < 50ms(H100 SXM5) 3. 架构栈(三合一单节点) = 端口配置 vLLM 8000 / Milvus 19530 management + 19121 GPU search / TEI Embedder 8080 / Qdrant 6333 4. vLLM 启动(70B 模型 H100) =
vllm/vllm-openai --model meta-llama/Llama-3.3-70B-Instruct --dtype fp8 --gpu-memory-utilization 0.855. Qdrant GPU 加速(HNSW indexing · 2026 v1.17+) = 索引构建速度提升 4× AWS 实测 · Multi-AZ 集群支持 99.95% SLA 6. Milvus 2.6+ 关键新能力 = Storage Format V2 + nullable vector support · 内置 BM25 全文本搜索(吞吐量是 ES 同硬件 4×) · GPU 加速 CAGRA 算法(10M+ 向量场景) 7. 选型建议 = 交互式 RAG(延迟 <10ms)→ Qdrant / 高吞吐分析(>20K QPS)→ Milvus GPU / 已有 PostgreSQL 栈 → pgvector / 已有 Elasticsearch 栈 → Weaviate / 快速原型 → Chroma -
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) "Ollama 是入口,vLLM 是出口" + v3.50 §1.(10) Vector DB 2026 选型决策框架 + v3.50 §1.(11) MCP 生产规模数据(10,000+ servers / 97M+ SDK 月下载 / 450 万次 Salesforce 调用)。本增量是 "RAG 部署成本 → 共置方案"预备级补强 = 与 v3.50 §1.(10) Vector DB 选型决策框架形成 "选哪个库" → "怎么部署" 完整决策链预备级补强。
-
建议归入节:§0.5.1 §1.(10) 顶会部署(增补自托管 VecDB + LLM GPU 共置部署实操路径作为部署成本预备级补强) + §1.(11) Harness Engineering(增补 vLLM v0.15.1 + Qdrant v1.17+ + Milvus 2.6+ 部署指南)
-
可信度:⭐⭐⭐⭐(Spheron Network 工程部署指南 · 具体配置命令和延迟数据 · 工程团队可直接参考 Deployment Playbook)
增量 6:MCP Stateless 生态爆发数据 · 2026-09-30 MCP servers 仓库 86,148 stars · GitHub mcp-server topic 15,926 仓库 · 月 SDK 下载量 97M+
- 来源:
- jay 10-3 15:05 afternoon-briefing §四(digitalapplied.com MCP adoption statistics · GitHub modelcontextprotocol 官方仓库 · 2026-04 更新至 2026-05)
-
v3.50 morning §1.(11) 已锚入 MCP 2026-07-28 Stateless 三大变更 + 10,000+ servers / 97M+ SDK 月下载 / 450 万次 Salesforce 调用
-
要点: 1. v3.50 morning 已锚入 MCP 生产规模数据 = 10,000+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用 2. jay 10-3 afternoon 给出 2026-09-30 更新数据 = MCP 官方 servers 仓库 86,148 stars + 10,799 forks · GitHub 上带 mcp-server topic 的仓库 15,926(2026-05-24 数据) · 每月 SDK 下载量 97M+ · 官方 TypeScript SDK 320 stars 2026-09-29 更新 · 官方 Python SDK 191 stars 2026-09-29 更新 3. 2026-09 最新更新(GitHub API 快照) =
typescript-sdk320 commits 过去一年 2026-09-29 更新 ·python-sdk191 commits 过去一年 2026-09-29 更新 ·experimental-ext-interceptorsSEP-2624 提议的多语言拦截器扩展实现实验状态 ·IaC for MCPMCP 访问管理的 Infrastructure as Code 方案 ·quickstart-resourcestutorial 示例代码库 4. 推荐生产起步栈 = 开发者推荐 GitHub MCP + Context7(最新文档)+ Playwright MCP(浏览器自动化)/ 数据推荐 Supabase MCP / PostgreSQL MCP / 运营推荐 Kubernetes MCP + Sentry MCP + n8n MCP 5. LangChain vs LangGraph 关于 MCP 的争议(2026-03) = 核心争议 MCP 是"昙花一现"还是"未来标准" · 社区讨论 GitHub Discussion #174921 · 结论 MCP 生态已超 15K 仓库 97M 月下载 2026 年判断为"已成为事实标准" -
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §1.(11) "MCP 2026-07-28 Stateless 三大变更 + py-kvcache + Nereus + MCP 生产规模数据"。本增量是 MCP 生态 2026-09 实时数据精修 + SDK 双语言活跃度确认 + LangChain/LangGraph 争议结论预备级补强。
-
建议归入节:§0.5.1 §1.(11) Kernel/AI 自动化/Harness(增补 jay 10-3 afternoon §四 MCP 生态 2026-09 实时数据 + LangChain/LangGraph 争议结论预备级)
-
可信度:⭐⭐⭐⭐(digitalapplied.com + GitHub API 快照 · 数据时间戳明确 · 与 v3.50 morning 沿用数据精确对齐 · 87K+ stars = 已成为事实标准证据)
增量 7:CSDN 工程实战高价值新增 · vLLM 推理优化实战 2026-09-15 PagedAttention + H100 上 vLLM + LoRA/QLoRA 全流程
- 来源:
- jay 10-3 08:22 csdn-llm-agent-rag-inference.md(H3 vLLM 推理优化实战 2026-09-15 PagedAttention 分块存储逻辑 + M1 H100 上 vLLM 推理优化)
-
jay 10-3 ai-engineering-trending-oct.md(vLLM Production Stack 2026 Roadmap GitHub Issue #855 P0 = 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal 模型部署支持(vLLM Omni)+ P1 Agent 负载智能路由 + vLLM V1 重构引擎 + FP8 KV-cache 验证 Hopper & Blackwell)
-
要点: 1. H3 vLLM 推理优化实战 2026-09-15 = PagedAttention 分块存储逻辑 + 09-15 时间戳 · CSDN 工程实战级 2. M1 H100 上 vLLM 推理优化 = 具体到 GPU 型号的工程优化经验 3. vLLM Production Stack 2026 Roadmap(GitHub Issue #855) = P0 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal 模型部署支持(vLLM Omni)+ P1 Agent 负载智能路由 + vLLM V1 重构引擎 + FP8 KV-cache 验证(Hopper & Blackwell) 4. 与 v3.50 morning §0.5.1 §1.(1) 关系 = v3.50 morning 已锚入 "vLLM v0.15.1(2026-02)支持 PyTorch 2.10、RTX Blackwell (SM120)、H200 优化 · 极速模式目标单卡 1,000 tok/s" + "V1 重构引擎"沿用 5. 本增量是 vLLM 2026 Production Stack 路线图预备级 = GitHub Issue #855 路线图 = vLLM 工程师社区对 2026 Q4-2027 Q1 的明确投入方向
-
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) 推理引擎 v3.50 沿用稳态。本增量是 vLLM 2026 Production Stack 路线图预备级 = 与 v3.50 morning §1.(1) "vLLM = 生产首选"形成 "已发布特性 + 路线图特性"完整双栖预备级补强。
-
建议归入节:§0.5.1 §1.(1) 推理引擎(增补 vLLM Production Stack 2026 Roadmap GitHub Issue #855 P0/P1 路线图预备级补强) + §1.(4) 量化(增补 FP8 KV-cache 验证 Hopper & Blackwell 路线图)
-
可信度:⭐⭐⭐⭐(CSDN 工程实战 2026-09-15 时间戳 + GitHub Issue #855 路线图 · 工程团队可直接参考)
增量 8:RAG 评估体系全貌 2026 · 5 维指标(检索 Precision@K/Recall@K/MRR/nDCG/Diversity + 生成 Faithfulness/Relevance/Citation Coverage/Hallucination Rate/Completeness) + 5 Benchmark(RAGBench/CRAG/LegalBench-RAG/WixQA/T²-RAGBench)
-
来源:jay 10-3 15:05 afternoon-briefing §五(labelyourdata.com / braintrust.dev / evidentlyai.com / confident-ai.com · RAG Evaluation: 2026 Metrics and Benchmarks for Enterprise AI Systems / Best RAG Evaluation Tools 2026)
-
要点: 1. Retrieval(检索)指标 = Precision@K / Recall@K / MRR / nDCG / Diversity 2. Generation(生成)指标 = Faithfulness ⭐⭐⭐⭐⭐ / Relevance ⭐⭐⭐⭐ / Citation Coverage / Hallucination Rate / Completeness 3. Benchmark 对比 = RAGBench 通用检索+生成最广泛 / CRAG 强调查上下文相关性和 groundedness / LegalBench-RAG 法律 QA / WixQA Web 规模开放域 QA / T²-RAGBench 多轮任务型 RAG 4. 失败根因定位方法(Confident AI) =
Bad Retrieval + Faithful Generation → 修索引/chunk 策略/Good Retrieval + Unfaithful Generation → 修 prompt / 换模型5. 工具链 = Ragas 开源快速迭代 / Galileo 20+ 内建指标 / Braintrust 评估 + CI/CD / Evidently AI 生产监控 / DeepEvaluate 端到端 -
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(2) "ICML 2026 复现 2,226 篇 51% claim 验证 23% claim 证伪 = 评测方法学 AI Agent 驱动评测规模化预备扩位候选"。本增量是 RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链预备级 = 与 v3.50 morning §1.(2) ICML 2026 复现形成 "通用评测方法学 + RAG 专项评测"双栖预备级补强。
-
建议归入节:§0.5.1 §1.(2) 推理调度(增补 RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链预备级补强) + §1.(11) Harness Engineering(作为 Harness 层评测方法学补强)
-
可信度:⭐⭐⭐⭐(labelyourdata.com + braintrust.dev + evidentlyai.com + confident-ai.com 多源交叉 · 评估框架类内容一致性好)
增量 9:推理引擎第四方 LMDeploy 16,132 tok/s + HotPrefix/C2C/TokenDance/KVServe 完整 KV Cache 异构跨族传输链路预备级 + HF State of Open Models Qwen 社区事实标准底座
- 来源:
- jay 10-3 15:05 afternoon-briefing §二(LMDeploy 16,132 tok/s ~25ms 沿用稳态)
-
v3.50 morning §0.5.1 §1.(3) 已锚入 Prefill-Free Cross-Family KV Cache Transfer 异构推理传输 1630 arXiv:2609.32259 + HotPrefix + C2C + TokenDance + KVServe 形成「跨族 KV Cache 传输 = 异构推理 + 服务感知压缩 + 跨模型语义通信 + 缓存 TTL」完整链路预备级 + KV Cache 系统级优化第七维预备级
-
要点: 1. LMDeploy 16,132 tok/s = 与 SGLang 16,215 / vLLM 12,553 / TGI 9,500 形成 5 方格局量化矩阵 = LMDeploy 实际吞吐与 SGLang 仅相差 0.5% 几乎持平 = "vLLM/SGLang/LMDeploy 三强 + TensorRT-LLM 10,000+ + TGI 9,500 维护 + llama.cpp 6,000 边缘" 完整版图 2. v3.50 morning 已锚入 KV Cache 异构跨族传输完整链路 = HotPrefix(SGLang 集成 2.25× vs vLLM)+ C2C(cache-to-cache neural fuser 8.5-10.5% 精度提升)+ TokenDance(多轮 Agent KV cache TTL)+ KVServe(Bayesian Profiling Engine 服务感知压缩)+ Prefill-Free Cross-Family KV Cache Transfer 1630 2609.32259 = 5 件链路预备级 3. HF State of Open Models Qwen 社区事实标准底座 = 与 v3.50 morning §1.(1) 沿用稳态 + jay 10-3 evening-supplement §二 4 维精修
-
与活文档 llm-infra.md 现有脉络的关系:v3.50 morning §0.5.1 §1.(1) + §1.(3) 已锚入。本增量是 LMDeploy 16,132 tok/s 第四方 + 完整 KV Cache 异构跨族传输 5 件链路预备级锚定承接预备级补强。
-
建议归入节:§0.5.1 §1.(1) 推理引擎(LMDeploy 16,132 tok/s 第四方预备级) + §1.(3) KV Cache(完整链路预备级锚定承接沿用稳态)
-
可信度:⭐⭐⭐⭐(prem.io / yottalabs.ai / spheron.network 三源 + 与 v3.50 morning 已锚入数据精确闭合)
二、矛盾或待核实警示(5 条)
⚠⚬⚬ 待核 1:Vector DB 2026 Q4 双源基准 Qdrant 1M p50/p99 数据精度矛盾
jay 10-3 morning-briefing §database/2 Qdrant p50=4ms vs jay 10-3 afternoon-briefing §一 Qdrant 4ms p50 / 25ms p99 vs v3.50 morning §0.5.1 Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1,200 QPS 三源数据存在显著精度差异:
- v3.50 morning 已锚入:Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1,200 QPS(第七源)
- jay 10-3 morning-briefing:Qdrant p50=4ms(无 p99 数据)
- jay 10-3 afternoon-briefing:Qdrant 4ms p50 / 25ms p99 / ~1,200 QPS
核心矛盾 = v3.50 morning 已锚入 p50 2.1ms / p99 6.3ms vs jay 10-3 afternoon-briefing p50 4ms / p99 25ms ≈ 2× p50 + 4× p99 差异。可能原因 = (a) 评测条件不同(HNSW 调优 vs 默认 / recall ~0.95 vs 0.99 / 单分片 vs 集群 / 硬件配置差异)· (b) 数据集大小(50M vs 1M)· (c) 时间窗口不同(2026 Q3 vs 2026 Q4)。建议 = 在 v3.50 evening 棒位承接时,必须回溯评测条件原始来源 + 在 §1.(10) 标注 「Qdrant 1M 实测数据存在 2×-4× 差异,需回溯评测条件」。
⚠⚬⚬ 待核 2:pgvectorscale 471 QPS 反例冲击 v3.50 morning "Qdrant P99 6ms 50M"
jay 10-3 morning-briefing §database/1 = pgvector + Timescale pgvectorscale 在 50M 向量 1536 维 99% 召回率下 471 QPS · p95 28ms · 比 Qdrant 快 11.4 倍 = 与 v3.50 morning §0.5.1 §1.(10) "Qdrant P99 6ms 50M 向量实测" 形成直接反例冲击。关键前提 = 该数据基于 Timescale pgvectorscale 商业扩展(非纯开源 pgvector);纯开源 PostgreSQL 基础版 pgvector 性能仍低于 Qdrant(jay 10-3 engineering-e1prep §增量 3 + ⚠⚬⚬ 待核 2 明确标注)。
核心矛盾 = 商业扩展 vs 开源 = 选型决策时必须区分许可证限制。建议 = 在 v3.50 evening 棒位承接时,必须在 §1.(10) 标注 「pgvectorscale 商业扩展反例 ⚠⚬·开源 pgvector 性能仍低于 Qdrant·商业许可证需后续核实」。
⚠⚬⚬ 待核 3:TGI 进入维护模式时间精度矛盾(沿用 v3.50 morning D224)
v3.50 morning §0.5.1 §1.(1) 已锚入 D224 ⚠⚬⚬ TGI 进入维护模式时间精度新矛盾 = jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异。本棒位 jay 10-3 afternoon-briefing §二仍沿用 "TGI 进入维护模式(2025-12)" = 与 v3.50 morning D224 完全一致,矛盾未解。建议 = 在 v3.50 evening 棒位承接时,必须查阅 HuggingFace 官方公告原文(https://github.com/huggingface/text-generation-inference/blob/main/README.md + HF 官方博客)确认准确时间点。
⚠⚬⚬ 待核 4:Meta-Harness 6× 性能差距数据精度矛盾(沿用 v3.50 morning D225)
v3.50 morning §0.5.1 §1.(2) 已锚入 D225 ⚠⚬⚬ Meta-Harness 6× 性能差距数据需查阅 Meta-Harness 原论文核实 · 实验设置、baseline 选择、任务型类型均未详 · ⭐⭐⭐⭐ 核实优先级 · Harness Engineering 第七源预备扩增稳态。本棒位 jay 10-3 morning-briefing §backend/4 给出新数据 = "纯人类代码 + LLM 审核的生产案例" + Meta-Harness 通过给 agent 原始执行轨迹(最多 10M token)实现自动化 harness 工程 + text classification +7.7 分 = 给出了具体实现细节(10M token 原始执行轨迹 + text classification +7.7 分)但仍未给出 Meta-Harness 原论文 arXiv 号。核心矛盾 = 数据精度已提升但原论文仍未锚入。建议 = 在 v3.50 evening 棒位承接时,必须查阅 thecamelhall Substack 原始博文 + 检索 Meta-Harness arXiv 号。
⚠⚬⚬ 待核 5:GLM-5.2 作为 ICML 2026 复现自动化 Judge 待核实(沿用 v3.50 morning D226)
v3.50 morning §0.5.1 §1.(2) 已锚入 D226 ⚠⚬ ICML 2026 复现实验 GLM-5.2 作为自动化 Judge 待核实 · Judge 准确率 + 跨领域泛化性 + 潜在 Judge 偏差均未详尽披露 · 274 份 Agent Trace 数据集实测。本棒位无新增 GLM-5.2 Judge 数据精度承接 = 矛盾未解。建议 = 在 v3.50 evening 棒位承接时,必须查阅 HF Hub ICML 2026 Reproduction Track 官方报告 + 274 份 Agent Trace 数据集 README确认 GLM-5.2 Judge 评估精度 + Judge 偏差。
三、可引用的 arXiv 号列表(本窗口内 / 与 llm-infra 主轴相关)
本棒位 v3.50 evening 候选承接 = §IX 109 evening 棒位预备候选承接预备级。本窗口内(2026-10-02 18:40 → 2026-10-03 18:40 CST)无 NET-new llm-infra 主轴 arXiv;承接 paper_cards 10-3 02:13 = 1629 Smaller Models Better Rejects arXiv:2609.38987(主分类 llm-infra · v3.50 morning 未承接 → v3.50 evening 棒位候选承接预备级)+ 已沿用稳态 + 候选承接预备级。
3.1 已锚入 v3.50 morning + 10-2 evening 入池 = v3.50 evening 候选承接
| arXiv ID | paper_card | 主题 | 状态 |
|---|---|---|---|
| arXiv:2609.38987 | 1629 | Smaller Models, Better Rejects: Preference Distillation Scaling | 主分类 llm-infra · v3.50 morning 未承接(因 mtime 2026-10-03 02:13 > v3.50 morning 05:00)→ v3.50 evening 棒位候选承接预备级 |
3.2 承接稳态(已沿用 · 无 NET-new)
| arXiv ID | paper_card | 主题 | 状态 |
|---|---|---|---|
| arXiv:2609.39929 | 1609 | RoPE at the End of Its Rope · 位置编码长上下文失效 | v3.50 morning 已锚入 §0.5.1 |
| arXiv:2609.32259 | 1630 | Prefill-Free Cross-Family KV Cache Transfer | v3.50 morning 已锚入 §0.5.1 §1.(3) |
| arXiv:2609.40316 | 1604 | Loop Scaling Laws for Looped Mixture of Experts | v3.50 morning 已沿用 §1.(5)/(8) |
| arXiv:2609.38137 | — | LongHarness Bench | flyp 10-2 critical-read 9KB 沿用稳态 |
| arXiv:2606.31145 | — | SeKV · Hierarchical Semantic KV Cache | flyp 10-3 sat-structured-deep-read 11.6KB 沿用稳态 |
| arXiv:2605.30104 | — | SEAL · LLM-as-Judge Protocol | flyp 10-3 sat-adversarial-review 13KB 沿用稳态 |
| arXiv:2610.02185 | — | 几乎免费地更好地解码循环 Transformer 19▲ #9 | tom 10-3 0900 hf-daily llm-infra 主轴直命中 |
| arXiv:2609.33252 | — | CascadeEP · MoE 异步专家调度 | jay 10-2 evening-engineering-filter 沿用 |
| arXiv:2603.19289 | — | Speculating Experts · 专家预取 | jay 10-2 evening-engineering-filter 沿用 |
| arXiv:2610.00437 | 1636 | JevSpawn · Adaptive Agentic Inference | jay 10-3 jay-engineering-filter 沿用 |
| arXiv:2609.38349 | 1619 | MILO · Harness Discovery | jay 10-3 jay-engineering-filter 沿用 |
| arXiv:2609.10226v1 | — | Φ-Bench · LLM 基础设施工程能力基准 | jay 10-3 jay-engineering-filter 沿用 |
| arXiv:2606.24506 | — | CrossPool · Cold MoE 多 LLM Serving | jay 10-2 evening-engineering-filter 沿用 |
| arXiv:2610.00544 | 1627 | Memorizon · Training World Models Beyond Context Window | flyp 10-3 multimodal-e1prep §增量 ⑤ |
| arXiv:2609.36435 | 1646 | MemFold · Compact Soft Memory for Long-Context Personalization | 10-3 16:30 入池 · engineering 主分类 + 邻接 llm-infra |
| arXiv:2609.22753 | 1647 | Jev Decision Models for Edge Service Orchestration | 10-3 16:30 入池 · engineering 主分类 + 邻接 llm-infra |
| arXiv:2609.39982 | 1601 | Mid-Harness · Scaling Actions Between Model and Harness | work-queue 选题榜沿用 + evaluation 主分类 |
| arXiv:2610.01871 | 1625 | ImmRAG · Datastore Extraction from Multimodal RAG | flyp 10-3 multimodal 副 llm-infra |
| arXiv:2610.01936 | 1624 | Mapping the RAG Landscape · Four Axis Taxonomy | stephen v108 + jay database-e1prep 沿用 |
| arXiv:2609.36138 | 1637 | When Does Correction Become Repair? | tom 10-2 evaluation-e1prep + agent-rag-longcontext-radar 沿用 |
| arXiv:2610.01767 | 1640 | MatRAG · Matryoshka Hierarchical RAG | tom 10-3 rag-e1prep + agent-rag-longcontext-radar 沿用 |
| arXiv:2606.26511 | 238 | Temporal Validity in Retrieval Memory | tom 10-3 rag-e1prep 沿用 |
| arXiv:2607.01935 | 197 | A-TMA | tom 10-3 rag-e1prep 沿用 |
| arXiv:2609.32993 | 1644 | X-Tree · Tokenizing Reusable Experience | tom 10-3 agent-rag-longcontext-radar + hf-daily 12▲ 沿用 |
| arXiv:2609.37690 | 1643 | Honeycomb · Constant-Size Scene Memory for Video World Models | tom 10-3 agent-rag-longcontext-radar 沿用 |
| arXiv:2609.37533 | — | E-MoE · Mixture-of-Experts for Non-Factorized Diffusion LMs | tom 10-3 hf-daily 49▲ 沿用 |
| arXiv:2610.01939 | — | GPT-6 Astra 机器人 Agent | tom 10-3 hf-daily 24▲ multimodal 邻接 + stephen ai-industry v71 ⚠⚬⚬⚠ 矛盾 |
| arXiv:2609.26333 | — | DQ · Disaggregated Query | v3.49 evening §1.(3) 沿用 |
| arXiv:2609.23130 | — | Inference Control Plane | v3.49 evening §1.(11) 沿用 |
| arXiv:2609.17863 | — | Pareto Atlas | v3.49 evening §1.(12) 沿用 |
| arXiv:2511.01815 | — | KVTC ICLR 2026 | v3.49 evening §1.(12) 沿用 |
| arXiv:2609.11744 | — | py-kvcache 工程综述 | v3.48 morning §1.(11) 沿用 |
| arXiv:2609.34645 | 1565 | Nereus · LLM 后训练自适应并行 | v3.48 morning §1.(8)/(11) 沿用 |
| arXiv:2609.33591 | — | 沿用 | v3.50 morning §1.(4) 沿用 |
合计:承接稳态 + 候选承接预备级 = 共 34 件 arXiv(其中 1 件 v3.50 evening 候选承接预备级 + 33 件承接稳态);0 NET-new arXiv(本窗口内无 NET-new arXiv ID 入池)。
四、本轮承接 vs v3.50 morning 沿用对比
| 维度 | v3.50 morning(2026-10-03 05:00) | 本棒位 v3.50 evening 候选承接预备级(2026-10-03 18:40) |
|---|---|---|
| NET-new paper_card 主分类 llm-infra | 1(1609 RoPE at the End of Its Rope) | 0(本窗口无 NET-new 主分类入池;10-3 早棒 0 件入池;承接 1629 = v3.50 evening 棒位候选承接预备级) |
| NET-new paper_card engineering 邻接 | 1(1630 Prefill-Free Cross-Family KV Cache Transfer) | 0(本窗口无 NET-new engineering 邻接入池) |
| NET-new paper_card 其他邻接 | 0 | 3(1646 MemFold + 1647 Jev Decision Models + 1601 Mid-Harness 已沿用稳态) |
| NET-new arXiv ID | 2(2609.39929 + 2609.32259) | 0 |
| NET-new CVE/DOI | 0 | 0 |
| NET-new URL | 2 | 0(承接稳态沿用) |
| 承接稳态精修预备级 | 5 件 | 9 件(增补 Vector DB Lite · 推理引擎 4 方格局 · Agent Memory 三层 · HF Qwen 4 维精修 · 自托管 VecDB 共置 · MCP 2026-09 实时 · vLLM 2026 Roadmap · RAG 评估 5 维 · LMDeploy 16,132 tok/s) |
| NET-new 矛盾/待核 | 4(D223-D226) | 5(D227-D231 候选 = Vector DB Lite 精度矛盾 + pgvectorscale 商业扩展反例 + D224 沿用 + D225 沿用 + D226 沿用) |
| arXiv/CVE/DOI/URL 计数 | 440/36/15/573 | 440/36/15/573(精确闭合 · 0 NET-new) |
五、本棒位核心结论与 §IX 109 evening 棒位承接预备级建议
5.1 核心结论
本轮 llm-infra 主轴新增量密度 = 低:v3.50 morning(2026-10-03 05:00)已承接 1 NET-new paper_card 主分类 llm-infra(1609 RoPE)+ 1 NET-new paper_card engineering 邻接(1630 Prefill-Free Cross-Family KV Cache Transfer)+ 2 NET-new arXiv ID + 2 NET-new URL + 5 件承接稳态精修预备级 + 4 件 NET-new 矛盾/待核(D223-D226)= arXiv/CVE/DOI/URL 440/36/15/573 精确闭合。本窗口内(2026-10-02 18:40 → 2026-10-03 18:40)无 NET-new arXiv 入池,无 NET-new CVE/DOI/URL,承接 paper_cards 10-3 02:13 入池的 1629 Smaller Models Better Rejects(主分类 llm-infra · v3.50 morning 未承接 → v3.50 evening 棒位候选承接预备级)。
承接稳态精修预备级预备承接预备级锚定: 1. Vector DB 2026 Q4 双源基准第四方 = jay 10-3 morning + afternoon 双源基准 · Qdrant 1M p50/p99 双源精度矛盾 + pgvectorscale 商业扩展反例冲击 + Redis 5ms p50 / Milvus 2.6+ BM25/CAGRA/Storage Format V2 + ChromaDB 12ms / Weaviate 12ms / Elasticsearch 15ms / pgvector 18ms = 10 数据点完整版图谱预备级 2. LLM 推理引擎 2026 秋季快照 5 方格局量化补强 = SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TensorRT-LLM 10,000+ / TGI 9,500 / llama.cpp 6,000 tok/s 6 引擎完整数据矩阵 + D224 ⚠⚬⚬ TGI 时间精度矛盾待核 3. Agent Memory 三层架构 = L1 Context Window / L2 In-Context Memory / L3 Long-Term Memory + 框架层选型判断 = Memory 独立原语预备级补强 4. HF State of Open Models Summer 2026 沿用稳态精修 = Qwen 社区事实 base model + Attention ≠ Adoption + 中国模型规模 754B-2.78T vs 美国 <130B + Agents are the new user + 推荐关注模型 + 部署工具价值转移 = 6 维精修承接预备级 5. 自托管 VecDB + LLM GPU 共置部署 = vLLM + Milvus/Qdrant + TEI embedding 同 GPU 实例 · Total round trip < 50ms(H100 SXM5)+ Qdrant v1.17+ HNSW 4× + Milvus 2.6+ BM25/CAGRA + 选型建议 = 部署成本预备级补强 6. MCP 2026-09 生态爆发数据 = MCP servers 仓库 86,148 stars / mcp-server topic 15,926 仓库 / 月 SDK 下载 97M+ + LangChain/LangGraph 争议结论预备级 7. vLLM Production Stack 2026 Roadmap = GitHub Issue #855 P0 高级自动扩缩容 + P0 KV-cache 感知路由 + P0 PD Disaggregation 支持 + P0 KEDA 集成 + P0 故障请求迁移 + P1 multimodal(vLLM Omni)+ P1 Agent 负载智能路由 + V1 重构引擎 + FP8 KV-cache 验证(Hopper & Blackwell) = 路线图预备级 8. RAG 评估体系 5 维指标 + 5 Benchmark + 5 工具链 = Precision@K/Recall@K/MRR/nDCG/Diversity + Faithfulness/Relevance/Citation Coverage/Hallucination Rate/Completeness + RAGBench/CRAG/LegalBench-RAG/WixQA/T²-RAGBench + Ragas/Galileo/Braintrust/Evidently AI/DeepEvaluate = 评测方法学预备级补强 9. KV Cache 异构跨族传输 5 件链路预备级锚定承接 = HotPrefix + C2C + TokenDance + KVServe + Prefill-Free Cross-Family KV Cache Transfer 1630 + LMDeploy 16,132 tok/s 第四方 = KV Cache 系统级优化第七维预备级补强
承接稳态精修预备级预备承接预备级 = 「v3.50 evening 在 v3.50 morning 已成型的 LLM 推理软件栈垂直分层 6 层栈基础上」+「2026 Q4 Vector DB 双源基准 + pgvectorscale 商业扩展反例 + 10 数据点完整版图谱预备级补强」+「LMDeploy 16,132 tok/s 第四方预备级补强 + 推理引擎 2026 秋季快照 6 引擎完整数据矩阵」+「Agent Memory 三层架构 L1/L2/L3 独立原语框架预备级补强」+「HF State of Open Models Qwen 6 维精修预备承接稳态」+「自托管 VecDB + LLM GPU 共置部署实操路径预备级补强」+「MCP 2026-09 实时数据精修预备级」+「vLLM 2026 Production Stack 路线图预备级」+「RAG 评估体系 5 维预备级补强」+「KV Cache 异构跨族传输 5 件链路预备级锚定承接」形成 2026 Q4 初 llm-infra 工程化完整里程碑体系。
5.2 §IX 109 evening 棒位承接预备候选建议
| 维度 | 建议 |
|---|---|
| NET-new paper_card 主分类 llm-infra | 1 件 NET-new = paper_card 1629 arXiv:2609.38987 Smaller Models, Better Rejects: Preference Distillation Scaling(主分类 llm-infra · method · 10-3 02:13 入池 · v3.50 evening 棒位承接预备级 · 「偏好蒸馏 rejection 任务结构 + 限制参考策略耦合 + 小冻结模型低成本提供」 = Rejection Sampling 与 RLHF / DPO 工程化预备级补强) |
| NET-new paper_card 其他邻接 | 0(已沿用稳态) |
| NET-new arXiv ID | 1 = 2609.38987(Smaller Models Better Rejects)+ 沿用 |
| NET-new CVE/DOI/URL | 0 |
| 承接稳态精修预备级锚定预备承接 | 9 件(Vector DB 双源 + 推理引擎 6 引擎 + Agent Memory 三层 + HF Qwen 6 维 + 自托管 VecDB 共置 + MCP 2026-09 + vLLM Roadmap + RAG 评估 5 维 + KV Cache 链路) |
| NET-new 矛盾/待核 | 5 件 = D227 Vector DB Lite 精度矛盾 + D228 pgvectorscale 商业扩展反例 + D224 ⚠⚬⚬ TGI 时间精度矛盾沿用 + D225 ⚠⚬⚬ Meta-Harness 6× 数据精度矛盾沿用 + D226 ⚠⚬ ICML 2026 复现 GLM-5.2 Judge 待核沿用 |
| arXiv/CVE/DOI/URL 计数 | 441/36/15/573(v3.50 morning 440 → v3.50 evening 441 = 净增 1 NET-new arXiv ID = 2609.38987 + 沿用 440) |
5.3 本棒位诚实度声明
本轮 llm-infra 主轴新增量密度为「低」 —— 围绕 KV Cache 推理系统工程延续(pgvectorscale 量化、Vector DB 2026 Q4 双源基准、LLM 推理引擎第四方格局量化补强、自托管 VecDB+LLM GPU 共置实操路径、推理引擎实测四源、SGLang/vLLM RadixAttention / Unified Radix Cache 第四源数据精修、Agent Memory 三层架构 = L1/L2/L3 框架、HF State of Open Models Summer 2026 沿用稳态精修),共九条增量候选 + 五处矛盾/待核警示。无 net-new paper_card 入池(10-3 早棒 0 件),无 net-new arXiv ID,无 net-new CVE/DOI/URL;承接 2026-10-02 evening 至 2026-10-03 18:40 的 jay / tom / flyp / stephen 4 实例产出 = 主轴稳态精修 + 矛盾预备级锚定预备承接,无硬凑条目。
附:本简报由 spark · E1 日间预消化轮(llm-infra)· 2026-10-03 18:40 CST(周六)生成;下一棒位 §IX 109 evening v3.50 候选承接 = 2026-10-03 18:40 CST(预计 22:30 CST 完成)。