llm-infra · E1 预消化简报(2026-10-02)

执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-10-02 18:40 CST 窗口定义:2026-10-01 18:40 CST(v3.49 §IX 108 evening 升档棒闭合)→ 2026-10-02 18:40 CST(本棒位)≈ 24h 滑动窗口 底本:organized/knowledge/llm-infra.md v3.49(2026-10-02 05:00 CST · §IX 108 evening 升档棒 · 438 arXiv / 36 CVE / 15 DOI / 571 URL · 0 NET-new arXiv/CVE/DOI/URL)+ organized/paper_cards/ 10-2 上午入库 8 件(其中 1609 RoPE at the End of Its Rope = 1 件 llm-infra 主分类 NET-new · 1610-1616 + 1624-1631 = 工程/多模态/Agent/评估/RAG 邻接 7+ 件)+ inbox/{jay, tom, flyp, spark, stephen} 近 2 天 llm-infra 相关产出 棒位背景:v3.49(2026-10-01 18:40)刚刚于凌晨 05:00 升档,本棒位 = §IX 109 morning 棒位预备候选。stephen 10-2 12:45 noon 协调棒位 §〇「spark llm-infra 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬」,spark 主棒位 10-2 13:30 agent-e1prep 已闭合 agent 主轴,本棒位承接延续 v3.49 + 为今晚 v3.50 升档棒备料。


状态摘要

  • 增量条数:5 条主增量 + 1 条承接稳态精修预备级锚定(落在 3-8 目标区间;v3.49 evening 升档棒闭合之后;24h 滑动窗口)
  • 核心新增(NET-new since v3.49 evening 10-1 18:40 CST):
  • ① arXiv 2609.39929 · RoPE at the End of Its Rope · RoPE 位置编码长上下文失效的理论、诊断与缓解(paper_card 1609 10-2 入库 · 主分类 llm-infra · method · HF Daily 10-2 早棒无独立立标)⭐⭐⭐(与 v3.49 Periodic Weak Spots 1609 形成"KV cache 压缩相位敏感性 + 位置编码长上下文失效根因"双栖预备级补强)
  • ② 推理引擎格局 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache(jay 10-2 engineering-e1prep 增量 3 + jay 10-2 csdn-rag-agent-harness)⭐⭐⭐(v3.49 已锚定 NVIDIA Dynamo + SGLang/vLLM/TRT-LLM + Mooncake PyTorch Ecosystem,本棒位承接 + 增量:① TGI 进入维护模式(2025.12)明确标志推理框架洗牌期 ② Mooncake disaggregated KV pool 跨 vLLM 实例共享 KV cache = Agent 场景下一代基础设施方向 ③ vLLM 是生产首选,SGLang RadixAttention 在 Agent 长 KV 场景差异化 ④ 已在 400,000+ GPU 上部署 SGLang)
  • ③ Vector DB 基准格局 2026 + 混合搜索全面胜出 + Qdrant p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快(jay 10-2 engineering-e1prep 增量 4)⭐⭐(与 v3.49 Qdrant P99 6ms 50M 向量实测预备级补强 + 混合搜索 = Agent 记忆/多租户生产场景的必选路径)
  • ④ Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化(jay 10-2 engineering-e1prep 增量 5 + 增量 7 + Nathan Benaich Substack)⭐⭐⭐(v3.49 已锚定 MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus,本棒位承接 + Harness Engineering 从工程实践升级到平台差异化核心战场 + Meta-Harness 论文给出 6× 性能差距实测证据)
  • ⑤ ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构(jay 10-2 engineering-e1prep 增量 2 + HF 官方)⭐⭐(评测方法学第九元组"AI Agent 驱动评测规模化"预备扩位候选 · 与 v3.49 立标 13 "Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式"形成双栖承接)
  • 承接稳态精修预备级锚定(1 件):⑥ HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B(jay 10-2 engineering-e1prep 增量 1)⭐⭐(v3.49 已锚定 Qwen 国产模型 + v3.49 morning 已锚定 vLLM/SGLang 双寡头,本棒位承接 + Attention vs Adoption 指标体系)
  • 矛盾/警示(2 条新增 + 沿用):① ⚠⚬⚬ RoPE at the End of Its Rope 的 mitigation 缓解方案 TLDR 截断后几乎完全缺失——理论诊断清晰但工程化缓解措施未在 TLDR 披露 ② ⚠⚬⚬ Meta-Harness 6× 性能差距数据(Nathan Benaich Substack 引用)需查阅原论文核实——实验设置、baseline 选择、任务类型均未详 ③ 沿用 D1-D222 v3.49 evening 全部稳态(含 D219-D222 v3.49 evening 新增 4 件:Periodic Weak Spots phase sensitivity + Dynamo SLA-Based Planner + HotInfra CXL OpEx + MCP 生产规模数据)
  • 涉及 arXiv 号:本次 NET-new 1 个 llm-infra 主分类(2609.39929 RoPE at the End of Its Rope)+ 0 个 llm-infra 邻接 paper_card 净增(Loop Scaling Laws 2609.40316 在 v3.49 evening 已锚入 1604)+ 承接稳态精修预备级锚定 0 个新 arXiv(MCP Stateless v3.49 evening 已锚入)+ 沿用锚定约 438+ 个(v3.49 evening 438 件全量)
  • 诚实度声明:本轮 llm-infra 主轴新增量密度为「中低」——24h 窗口内 NET-new 1 件 llm-infra 主分类 paper_card(RoPE at the End of Its Rope 1609)+ 0 件 llm-infra 邻接 NET-new paper_card + 5 件工程主轴信号(推理引擎 2026 秋季快照 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 2026 混合搜索 + Harness Engineering 战略价值升级 + ICML 2026 复现 + HF State of Open Models),显著低于 v3.49 evening 棒位的「4 件 llm-infra 主分类 + 1 engineering 邻接 NET-new paper_card」(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607 副 + Loop Scaling Laws 1604)。本棒位的真实任务是承接 v3.49 evening 沿用稳态 + 锚定 v3.49 evening 之后 NET-new llm-infra 主轴内容(RoPE 1609 唯一一件)+ 整合 jay 10-2 工程主轴产出承接延续(jay engineering-e1prep + csdn-rag-agent-harness + hf-state-open-models-icml-repro-inference-vecdb-substack)+ stephen 10-2 12:45 noon 协调棒位 §〇「spark llm-infra 第 10 日缺口已闭合」沿用。无硬凑字数。

一、检查过的来源清单

来源目录 关键文件 llm-infra 相关度
inbox/jay 2026-10-02-engineering-e1prep.md(11:23 · 22KB · 7 主增量 ⚠⚬⚬⚠ = HF State of Open Models Summer 2026 Qwen 社区标准底座 + Attention ≠ Adoption 指标体系 + ICML 2026 复现实验 51% claim 验证 23% claim 证伪 + LLM 推理引擎 2026 秋季 vLLM/SGLang/TGI/Mooncake + Vector DB 2026 Qdrant 2.1ms + Substack Meta-Harness 6× 性能差距 + CSDN RAG 四代架构 + Lilian Weng Recursive Self-Improvement Harness) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 5 件:推理引擎 2026 秋季 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 混合搜索 + Meta-Harness 6× + ICML 2026 复现 + HF State of Open Models)
inbox/jay 2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md(10:40 · 详细 Substack 线索) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 5 件同前 + Meta-Harness 6× + Nathan Benaich State of AI April 2026 + HF State of Open Models Qwen 社区标准底座 + ICML 2026 复现 + AI Agent 改变科研验证成本结构 + TTT-Discover 推理时学习 + A2A 协议生态 + Simon Willison worm-like agent payload 警示)
inbox/jay 2026-10-02-csdn-rag-agent-harness.md(08:20 · CSDN RAG/Agent/Harness 工程综述 10 条 = Harness Engineering 生产级指南 + AI Agent 演进减少 LLM 思考次数 + RAG 四代架构 Naive→Advanced→Modular→Agentic + Hermes Agent Harness 三模块 + Agentic RAG 3.0 动态决策 + LLM/RAG/Agent 架构详细剖析 + awesome-llm-apps 100+ 开源资源 + Agent Memory 综述) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:RAG 四代架构演进 = Agent 主轴底层架构演进完整链路 + Hermes Agent Harness 三模块 = harness 工程化案例 + AI Agent 演进减少 LLM 思考次数 = Agent 架构演进的本质驱动力 = "用结构化约束减少 LLM 自主思考次数")
inbox/jay 2026-10-02-jay-five-category-briefing.md(11:05 · 9.3KB · 5 类目 = Database pgvector + Backend/Agent Memory 多层架构 + K8s 2026 AI 原生 + GitHub 工具链 + Substack TheSequence #904 AI 工程时代) 高 ⭐⭐⭐⭐(Agent Memory 多层架构成熟 = Memory 第十一栖"分层 Memory"预备级 = 4 篇 arXiv:Beyond RAG Decoupling/Aggregation 2602.02007 + MemoryArena 2602.16313 + Agentic Memory Unified 2601.01885 + Graph-based Agent Memory 2602.05665 + SoK Agentic RAG 2603.07379v1)
inbox/jay 2026-10-02T1140-news-x-tech-radar.md(11:42 · 5.5KB · 8 干货 = GPT-6 Astra 循环 Transformer + ExtractBench + Microsoft 小模型无蒸馏构建编码 Agent + LLM 大脑上机器人 + LFM2.5-2.6B 编程避坑 + CPT 资源 + Claude Code MCP + SWE-bench 2026.02) 高 ⭐⭐⭐⭐(Microsoft 小模型无需蒸馏即可构建竞争力编程 Agent = frontier lab Agent 路径预备级 + SWE-bench 2026.02 评测设计局限 = 评测方法学"基准高分 ≠ 真实 agent 能力"警示 + ExtractBench 严格 word-level box IoU 0.5 双重打分 = 文档 AI 评测新基准)
inbox/jay 2026-10-02T1220-csdn-substack-inference-rag-highvalue.md(12:20 · 10.8KB · 5 S 级 CSDN + 4 Substack S 级) 高 ⭐⭐⭐⭐(Substack Rogue AI Agents + Boosting Agentic Coding with LLM Retries + NVIDIA Nemotron = Agent 安全 + Agent 编码 retry 范式)
inbox/jay 2026-10-02 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/yt-karpathy 10 件) 低-中(沿用稳态 + Meta-Harness 6× + Lilian Weng Harness RSI 重点)
inbox/tom 2026-10-02-agent-rag-longcontext-radar.md(08:40 · 2.6KB · 8 候选 + 4 高价值 = RAGScope arXiv:2609.39075 8 票 + MILO arXiv:2609.38349 15 票 + DAGent arXiv:2609.39154 3 票 + Training LLM Judges arXiv:2609.38792 5 票 + 4 候选 = BIABench + Tacit-TTS + PixelUMM + RWTD) 极高 ⭐⭐⭐⭐⭐(4 件 NET-new paper_card 10-2 morning 入库 agent 主分类/邻接 = DAGent 1618 + MILO 1619 + Training LLM Judges 1617 engineering + RAGScope 1608 rag 主分类 · 本棒位承接续:RoPE 1609 llm-infra 主分类 = 1 件 = 实际上 tom radar 10-2 早棒未直接命中 llm-infra 主分类,但承接续的 RoPE 1609 是 v3.49 evening 之后 NET-new 唯一一件 llm-infra 主分类)
inbox/tom 2026-10-02-rag-e1prep.md(08:50 · R108 · 9.7KB · 2 主增量 = RAGScope arXiv:2609.39075 RAG 主分类 net-new + RoPE at the End of Its Rope arXiv:2609.39929 llm-infra 强邻接) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:RoPE at the End of Its Rope = 长上下文失效诊断与缓解 = 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位 = llm-infra 主轴 NET-new 唯一一件)
inbox/tom 2026-10-02-0900-hf-daily-2026-10-02.md(09:00 · 1.6KB · 15 立标 · ReaLVR 206▲ #1 顶置新立 ⚠⚬⚬ + False Frontiers 190▲ #2 + Mid-Harness 102▲ #3 + EVOKE 64▲ #4 + LANTERN 41▲ #5 + Unmask the State 41▲ #6 + MIST 36▲ #7 + TERRA 32▲ #8 + DyRAD 32▲ #9 + OSWorld-Science 25▲ #10 + LoopVL 24▲ #11 + BiasReducer 18▲ #12 + 循环 MoE 规模定律 17▲ #13 + MILO 15▲ #14 + CUA-SWE 13▲ #15 + 物体永久性无 → 第 8 日跌出 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 4 日预备级 ⚠⚬⚬⚠) 极高 ⭐⭐⭐⭐⭐(立标池结构性回稳期第 2 日 + multimodal 主轴密度 40% → 46.7% marginal 回升 + agent 主轴 4 件直接命中 10-2 早棒 = False Frontiers + EVOKE + MILO + CUA-SWE + 5 件邻接 = 9 件 agent 主轴信号 24h 滑动 · llm-infra 主轴直接命中 0 件(循环 MoE 规模定律 2609.40316 在 v3.49 evening 已锚入 1604 + LoopVL 2609.38426 多模态主分类))
inbox/tom 2026-10-01T2040-agent-rag-longcontext-radar.md(20:40 · 3 条高价值 = RAGScope + RoPE + Org-Agent 沿用) 高 ⭐⭐⭐⭐(RAGScope + RoPE 入库预备级)
inbox/flyp 2026-10-02-0950-flyP-critical-read-ReaLVR-grounding-latent-visual-reasoning.md(09:50 · 11.4KB · ReaLVR arXiv:2609.34563 206▲ #1 顶置新立 B+ 预备级候选 · 把潜在视觉推理锚定于视觉证据 · 13 人协作 · 235B frontier scale · Qwen2.5-VL-7B 五任务平均 63.7% · latent evidence-credit gap 诊断) 高 ⭐⭐⭐⭐(多模态 Agent 反思级接驳 + Latent Reasoning 三部曲(InftyThink → VaLR → ReaLVR))
inbox/flyp 2026-10-02-multimodal-e1prep.md(09:46 · 79KB · v87+21 R43 · 7 主增量 = HF Daily 立标池回稳期第 2 日 + paper_card 10-02 morning 真入库 5 件 multimodal 主分类 + LongHarness Bench + Visual regrounding in MoE VLMs + How Local Mixing + STEPQuant + 物体永久性第 8 日跌出 + PixelUMM/MILO/DAGent 邻接) 极高 ⭐⭐⭐⭐⭐(DAGent + MILO + AutoRef arXiv:2609.35530 multimodal 主分类 副 agent = "Agent + multimodal harness"主题双栖位预备扩增)
inbox/flyp 2026-10-02-1000-rss-cameron-wolfe.md + 2026-10-02-1002-rss-interconnects.md + 2026-10-02-1005-rss-yt-ai-explained.md(3 RSS 沿用稳态) 低(沿用)
inbox/stephen 2026-10-02-1245-stephen-coordination-check-noon.md(12:45 · 43KB · noon 协调棒位对账 · flyp multimodal 第 1 日缺口闭合 ⚠⚬⚬ → ⚬ + spark llm-infra 第 10 日缺口闭合 ⚠⚬⚬⚠ → ⚬ + stephen ai-industry v70 87KB 5 主增量 = OpenAI DevDay 完整公告包 + TLDR AI 24h 2 头条级净变 + NVIDIA Open Agent Safety Platform + HF Daily 立标池第 14 次确认 + Anthropic Claude ART 酶系统 950 个 Agent 21 小时 + work-queue 10-2 08:00 = Top 15 = 4 件 ai-industry 主轴命中 = Endless Exam + RoPE + DyRAD + RAGScope + 8 项 P0/P1 待人工确认) 极高 ⭐⭐⭐⭐⭐(承接棒位 + spark 主棒位第 10 日缺口已闭合 + work-queue 10-2 4 件 ai-industry 主轴命中 = Endless Exam + RoPE + DyRAD + RAGScope)
inbox/stephen 2026-10-02-ai-industry-e1prep.md(10:20 · 87KB · v70 · 5 主增量) 极高 ⭐⭐⭐⭐⭐(OpenAI Dots 常驻个人 Agent + NVIDIA Open Agent Safety Platform + Anthropic Claude ART 950 Agent 21h 自主科学发现)
inbox/stephen 2026-10-02-0910-news-x-vip-radar.md(09:10 · 5.3KB · OpenAI DevDay 完整公告包 + GPT-6.1 Sol 1/5 价格 + NVIDIA Open Agent Safety Platform + Anthropic Claude ART 酶 950 Agent + Gemini 4 Argon + GLM-5.3) 极高 ⭐⭐⭐⭐⭐(frontier lab 三连击 + Microsoft 小模型无需蒸馏 Agent + Anthropic ART 950 Agent 21h + LangChain State of AI Agents 2026 71.5% tracing 协同)
inbox/stephen 2026-10-02 1004-1006 news + yt-anthropic + yt-openai(7-9 件 news/yt + 6 件 RSS 沿用) 高 ⭐⭐⭐(Anthropic ART 950 Agent 21h + Microsoft 小模型 Agent 路径 + GLM-5.3 网络能力扩散 12% 沿用)
inbox/spark 2026-10-01-agent-e1prep.md(13:35 · 55KB · 6 主增量 = Org-Agent + LibraryDesignBench + Periodic Weak Spots + Salesforce harness + flyp coding-agents 9-30 闭合 + 立标池顶部重排第 4 日 · 已锚定 v107) 极高 ⭐⭐⭐⭐⭐(v107 已锚定,本棒位 v107 承接基线)
inbox/spark 2026-10-01-llm-infra-e1prep.md(18:45 · 61KB · 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬ · 6 主增量 = vLLM 官方博客三篇 + Dynamo 1.0 GA + HelixML 缓解 + Particula Tech + TGI 2026-03-21 + MCP Stateless) 极高 ⭐⭐⭐⭐⭐(v3.49 evening 升档棒承接基线 · frontier lab 推理基础设施范式转换预备级第 1 例承接延续)
inbox/spark 2026-10-02-agent-e1prep.md(13:30 · 65KB · 8 主增量 = False Frontiers + EVOKE + Safety of Latent Communication + DAGent + MILO + Training LLM Judges + Meta-Harness 6× + frontier lab 三连击) 极高 ⭐⭐⭐⭐⭐(v3.49 evening 升档棒承接基线 · agent 主轴 51h 8 主增量 = 7 件 agent 主分类 NET-new paper_card + 2 件邻接 evaluation/engineering 主 + 3 件 frontier lab Agent 信号 + 1 件 Meta-Harness 6×)
inbox/spark 2026-10-02 1001-1005 RSS(3 RSS 速记 = gradient-flow + chip-huyen + yt-3blue1brown) 低(沿用)
paper_cards 10-2 morning 1609-2609-39929 RoPE at the End of Its Rope · ✓ 主分类 llm-infra · method NET-new ⭐⭐⭐(本次承接新增唯一 llm-infra 主分类:RoPE 位置编码长上下文失效诊断 = 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位)
paper_cards 10-2 morning 1601-2609-39982 Mid-Harness · ✓ 主分类 evaluation · method 承接(v107 已锚定)
paper_cards 10-2 morning 1602-2609-39102 False Frontiers · ✓ 主分类 agent · method 承接(agent-e1prep 已锚定)
paper_cards 10-2 morning 1603-2609-39903 OSWorld-Science · ✓ 主分类 evaluation · benchmark · 副 agent 承接
paper_cards 10-2 morning 1604-2609-40316 循环 MoE 规模定律 · ✓ 主分类 engineering · method · 邻接 llm-infra 承接(v3.49 evening 已锚入 1604)
paper_cards 10-2 morning 1605-2609-38660 Breaking Babel · ✓ 主分类 agent · method 承接
paper_cards 10-2 morning 1606-2609-38334 EVOKE · ✓ 主分类 agent · application 承接
paper_cards 10-2 morning 1607-2609-33355 Unmask the State · ✓ 主分类 multimodal · position · 副 llm-infra 承接(v3.49 evening 已锚入 1607)
paper_cards 10-2 morning 1608-2609-39075 RAGScope · ✓ 主分类 rag · application 承接(tom 10-2 rag-e1prep R108 已锚入)
paper_cards 10-2 morning 1610-2609-39841 DyRAD · ✓ 主分类 evaluation · benchmark · 副 multimodal 承接
paper_cards 10-2 morning 1611-2609-39788 Safety of Latent Communication · ✓ 主分类 agent · method 承接
paper_cards 10-2 morning 1612-2609-36333 ATLAS · ✓ 主分类 agent · method 承接
paper_cards 10-2 morning 1613-2609-37863 MIST · ✓ 主分类 multimodal · method 承接
paper_cards 10-2 morning 1614-2609-24555 The Endless Exam · ✓ 主分类 evaluation · position 承接
paper_cards 10-2 morning 1615-2609-32600 CUA-SWE · ✓ 主分类 agent · benchmark 承接
paper_cards 10-2 morning 1616-1502-02761 沿用(v3.45 已锚入) 承接
paper_cards 10-2 morning 1617-2609-38792 Training LLM Judges from Language Feedback · ✓ 主分类 engineering · position 承接
paper_cards 10-2 morning 1618-2609-39154 DAGent · ✓ 主分类 agent · method 承接
paper_cards 10-2 morning 1619-2609-38349 MILO · ✓ 主分类 evaluation · method · 副 agent 承接
paper_cards 10-2 morning 1620-2609-38658 Tacit-TTS · multimodal 承接
paper_cards 10-2 morning 1621-2609-38597 PixelUMM · multimodal 承接
paper_cards 10-2 morning 1622-2609-34274 BIABench · agent · benchmark 承接
paper_cards 10-2 morning 1623-2609-30840 RWTD · benchmark 承接
paper_cards 10-2 16:30 1624-2610-01936 Mapping the RAG Landscape · rag · survey 承接(work-queue Top 15)
paper_cards 10-2 16:30 1625-2610-01871 Walking the Embedding Space · rag · method 承接
paper_cards 10-2 16:30 1626-2610-02196 InterEvolve · engineering · method 承接
paper_cards 10-2 16:30 1627-2610-00544 Memorizon · engineering · method · 副 multimodal 承接
paper_cards 10-2 1628-2609-38886 Benchmarking Skill-Level Memory · agent 承接
paper_cards 10-2 1629-2609-38987 Smaller Models Better Rejects · engineering 承接
paper_cards 10-2 1630-2609-32259 Prefill-Free Cross-Family KV Cache Transfer · engineering 承接(注意:work-queue Top 15 #2 · arXiv:2609.32259 "Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous" = 与 v3.49 evening §1.(3) KV Cache 14 件完整图谱邻接级承接)
paper_cards 10-2 1631-2609-33403 DataMagic · engineering 承接
work-queue 10-2 08:00 Top 15 / 共 8 件 = 2609.33403 DataMagic + 2609.32259 Prefill-Free Cross-Family KV Cache Transfer + 2609.38987 Smaller Models Better Rejects + 2609.38886 Benchmarking Skill-Level Memory + 2610.00544 Memorizon + 2610.02196 InterEvolve + 2610.01871 Walking the Embedding Space + 2610.01936 Mapping the RAG Landscape · 选题榜未成视频脚本 1 件 = 2609.39982 Mid-Harness · 1 件与 llm-infra 强邻接:2609.32259 Prefill-Free Cross-Family KV Cache Transfer(已入库 1630) 高(1 件 llm-infra 强邻接:Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference = 跨族 KV Cache 异构推理传输 = v3.49 evening §1.(3) KV Cache 14 件完整图谱邻接级承接 = v3.50 morning 候选预备新增)

已检查但未发现 llm-infra 主分类 paper_card 净增(除 RoPE at the End of Its Rope 1609 = 1 件 NET-new)+ Prefill-Free Cross-Family KV Cache Transfer 1630 = 1 件 engineering 邻接 NET-new):tom 10-2 0840 radar 高价值 #1-#4(RAGScope 1608 + MILO 1619 + DAGent 1618 + Training LLM Judges 1617 + BIABench 1622 + Tacit-TTS 1620 + PixelUMM 1621 + RWTD 1623 8 候选)+ jay 10-2 1220 csdn-substack(Rogue AI Agents + Boosting Agentic Coding with LLM Retries 邻接)+ jay 10-2 1140 news-x-tech-radar(Microsoft 小模型无蒸馏 Agent + SWE-bench 2026.02 评测设计局限 + ExtractBench + Agentic Retrieval Harness LlamaIndex)+ jay 10-2 engineering 7 主增量(推理引擎 2026 秋季 + Vector DB 2026 + Meta-Harness 6× + HF State of Open Models + ICML 2026 复现 + Harness Engineering + Lilian Weng Harness RSI)+ jay 10-2 csdn-rag-agent-harness(Harness Engineering + Hermes Agent 三模块 + RAG 四代 + Agentic RAG 3.0 动态决策 + Agent 演进减少 LLM 思考次数)+ flyp 10-2 multimodal-e1prep(MILO + DAGent 邻接承接延续 + AutoRef multimodal 副 agent)+ flyp 10-2 critical-read-ReaLVR(多模态 Agent 反思级接驳)+ stephen 10-2 noon 协调棒位(frontier lab Agent 信号三连击)+ stephen 10-2 ai-industry v70(OpenAI Dots + NVIDIA Safety Platform + Anthropic ART)+ spark 10-2 agent-e1prep 65KB v3.49 evening 承接基线 + spark 10-1 llm-infra-e1prep(llm-infra 主棒位承接)+ inbox/spark 10-2 三件 RSS(全部沿用第 7 日 ⚠⚬)+ paper_cards 10-2 morning 28 件入库清单(含 1628-1631 4 件 evening 入库 + 1630 Prefill-Free Cross-Family KV Cache Transfer = work-queue Top 15 #2 与 llm-infra 强邻接)+ work-queue 10-2 08:00 Top 15 共 8 件(其中 1 件 Prefill-Free Cross-Family KV Cache Transfer 2609.32259 + 1 件 Memorizon 2610.00544 + 1 件 InterEvolve 2610.02196 = llm-infra 邻接 3 件)。


二、增量条目(5 主增量 + 1 承接稳态精修预备级锚定)

增量 1:arXiv 2609.39929 · RoPE at the End of Its Rope · RoPE 位置编码长上下文失效的理论、诊断与缓解(⭐⭐⭐)

来源: - organized/paper_cards/1609-2609-39929.md(入库时间 2026-10-02 morning CST · 主分类 llm-infra · method · 来源 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json) - inbox/tom/2026-10-02-rag-e1prep.md §增量 2(R108 强邻接 = §2.6 运行时 RoPE 位置编码失效 + §2.5 评测 长上下文 RAG 检索稳定性维度) - inbox/tom/2026-10-01T2040-agent-rag-longcontext-radar.md 高价值条目 #2 - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md(承接,work-queue Top 15 #2)

URL:http://arxiv.org/abs/2609.39929v1

要点:

核心问题

RoPE 内在 trade-off——维持稳定 token 偏好(stable token preferences)vs 区分相近位置(distinguishing nearby positions);prior theory 假设各频率下 query-key scale 相等 = 与实际不符。

核心方案

  • 放宽 prior theory 假设:允许 RoPE 各频率下 query-key scale 不一致 → 与实际经验观测高度吻合
  • 理论使得上述脆弱性对单个注意力头与输入可测量
  • 量化高频分量 vs 低频分量的不同作用:高频分量支持位置敏感性,低频分量支持远程依赖——二者不可兼得是 RoPE 长上下文失效的根因

工程意义

  • 与 v3.49 evening Periodic Weak Spots(1609-2609-36322)形成"位置编码 + KV cache 压缩"双栖位预备级补强
  • 对 RAG 长上下文检索质量的风险诊断:RoPE 位置编码失效意味着长上下文窗口的检索质量不稳定——在特定上下文长度(phase boundary)会出现检索退化
  • 对 RAG chunk 策略的警示:chunk 边界若落在 RoPE 失效区间,会系统性丢失检索信号
  • RAG 检索质量在依赖向量匹配的同时,底层 LLM 的位置编码能力直接影响检索质量——长上下文 RAG 的上限受 RoPE 限制

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + §1.(6) 长上下文沿用稳态(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607)→ RoPE 位置编码失效 = KV Cache 系统级优化第六维警示预备级补强 = 与 Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位 - 承接 v3.48 morning §1.(6) 长上下文沿用稳态(v3.42 vLLM 分层 KV Cache Offloading + v3.44 vLLM AgentX Mooncake Store + v3.45 morning Fluid-Guided arXiv 2504.11320v4 + v3.46 morning KVSET 2609.27746 + v3.47 morning DISCO 2609.33485 + Pareto Atlas 2609.17863)→ RoPE 位置编码理论深化 v3.49 evening 已锚定的 Periodic Weak Spots phase sensitivity(2609.36322 = "Chunked KV-Cache 压缩相位敏感性")理论根因 - 承接 v3.47 morning §1.(3) KV Cache Reuse 精度损失被系统性低估(2609.31415 · D198/D200/D202 实证补强)→ RoPE 理论进一步补强「KV Cache 优化系统性风险」

建议归入哪一节: - §1.(6) 长上下文 → 新增子条目「RoPE at the End of Its Rope · RoPE 位置编码长上下文失效理论、诊断与缓解 arXiv:2609.39929 = 长上下文位置编码失效理论根因预备级补强」 - §1.(3) KV Cache → 补充「Periodic Weak Spots 2609.36322 + RoPE 位置编码 2609.39929 = KV Cache 系统级优化第六维警示双栖位预备级补强」 - §3 争议 → D223 v3.50 候选 ⚠⚬:RoPE at the End of Its Rope 的 mitigation 缓解方案效果未在 TLDR 披露(理论诊断清晰,工程化缓解措施未在 TLDR 中体现 = 是否已有可行的 RoPE 失效缓解措施,还是仍在理论阶段 = 待原文核实) - §4 开放问题 → O541 v3.50 候选:RoPE 位置编码失效是否在 v3.47 morning 已锚定的 Chunked KV-cache 压缩相位敏感性之外,影响长上下文检索质量?

增量 2:推理引擎格局 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache(⭐⭐⭐)

来源: - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §三(11:40) - inbox/jay/2026-10-02-engineering-e1prep.md §增量 3(11:23) - inbox/jay/2026-10-02-csdn-rag-agent-harness.md(08:20 · 沿用 CSDN RAG/Agent/Harness 工程综述) - inbox/spark/2026-10-01-llm-infra-e1prep.md(18:45 · v3.49 evening 承接基线)

要点:

A. vLLM/SGLang/TGI/Mooncake 四方博弈 2026 秋季快照

引擎 定位 关键数据
vLLM 生产首选 · PagedAttention · 极高并发(continuous batching) · OpenAI 兼容 · 生产适用性最高 vLLM v0.15.1(2026 年 2 月):支持 PyTorch 2.10、RTX Blackwell (SM120)、H200 优化
SGLang Agent 场景差异化 · RadixAttention 的 prefix caching 机制 · 多 Agent 共享长 prompt prefix 时吞吐远高于 vLLM 已在 400,000+ GPU 上部署(v3.49 evening 已锚入 v3.48 morning 沿用稳态)
TGI 进入维护模式(2025.12) · 不再接受新功能 标志推理框架进入洗牌期(v3.49 evening §1.(1) 推理引擎已锚入 v3.47 morning TGI 2026-03-21 进入维护 + 2026-09-05 README 正式确认;本棒位承接 + jay 10-2 标定 TGI 进入维护模式时间精度为 2025.12——与 v3.49 evening 沿用的 2026-03-21 存在 4 个月精度差异,需核实 v3.49 evening 表述是否需更新)
Mooncake 解绑 KV Cache · disaggregated KV pool 架构 · 跨 vLLM 实例共享 KV cache · 解决多副本重复 prefix 问题 Agent 场景的下一代基础设施方向(v3.49 evening §1.(3) KV Cache 已锚入 Mooncake 2026-02 加入 PyTorch Ecosystem + Transfer Engine 进入 TensorRT-LLM + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector;本棒位承接 + 新增 Mooncake disaggregated KV pool 跨 vLLM 实例共享 = Agent 场景下一代基础设施方向)

B. 引擎定位框架(jay 10-2 engineering 增量 3)

  • 「Ollama 是入口,vLLM 是出口」
  • 并发请求超过个位数、P99 延迟敏感时,必须迁移 vLLM

C. H200/B200 可用性

  • 主流云厂商均已上线
  • 带宽是 H100 的 2 倍
  • 适合大批量推理

D. ⚠ 关键警示:TGI 进入维护模式时间精度矛盾

  • jay 10-2 engineering §增量 3 标定 TGI 进入维护模式(2025.12)
  • v3.49 evening §1.(1) 沿用 TGI maintenance mode 2026-03-21 + 2026-09-05 README 正式确认(jay 9-30 0935 + daily-brief + llm-inference-vector-db 三源交叉验证)
  • D212 v3.50 候选 ⚠⚬⚬:TGI 进入维护模式时间精度新矛盾(jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异)

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(vLLM 官方博客三篇 + Dynamo 1.0 GA + SGLang HelixML + SGLang PR #36513 + Particula Tech + VRLA Tech + TGI maintenance mode 2026-03-21 锚定)→ v3.50 候选承接预备:推理引擎 2026 秋季快照 + TGI 退出明确化(2025.12 vs 2026-03-21 精度矛盾)+ SGLang 400,000+ GPU 部署规模 + Mooncake disaggregated KV pool 跨 vLLM 实例共享 = Agent 场景下一代基础设施方向 - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱沿用稳态(CDB 2608.09444 + KV-Reuse 2609.31415 + KVSET 2609.27746 + Continnum 2511.02230 + TokenDance 2604.03143 + PolyKV 2604.24971 + Edge Q4 KV 2603.04428 + C2C 2510.03215 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + Internet for KV Cache 2608.01526 + Cache Replacement 2609.28870 + PAGE Eviction 2609.22157 + Dynamic Flow Static Graph 2609.34727 + Who Pays for KV Cache 2609.24991 + VeriCache 2605.17613 + ECHO OSDI 2026 + KVTC 2511.01815 ICLR 2026 + Periodic Weak Spots 2609.36322 + HotInfra 2026 CXL + Qdrant P99 6ms 50M)第 7 维预备级补强 = Mooncake disaggregated KV pool 跨 vLLM 实例共享 + arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference(work-queue Top 15 #2 · paper_card 1630 已入库)= 跨族 KV Cache 异构推理传输 = 2026 Q4 KV Cache 异构跨族传输预备新增 - 承接 v3.49 evening §1.(10) 顶会部署沿用稳态(SGLang/vLLM/TRT-LLM H100 Benchmark 2026 + Particula Tech + VRLA Tech + jay 9-30 三源)→ v3.50 候选承接预备:vLLM/SGLang/TGI/Mooncake 四方博弈 2026 秋季快照 + SGLang 已在 400,000+ GPU 部署 = 顶会部署六源数据完整对齐第七源 - 承接 v3.49 evening §1.(11) Kernel/AI 自动化/Harness(MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus + Meta-Harness 6×)→ v3.50 候选承接预备:Harness Engineering 战略价值升级 = v3.49 evening §1.(11) 第四源预备新增

建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「推理引擎 2026 秋季快照 · vLLM 生产首选 + SGLang Agent 场景差异化(400,000+ GPU) + TGI 退出明确化(2025.12 vs 2026-03-21 精度矛盾)+ Mooncake 解绑 KV Cache = 四方博弈完整格局」 - §1.(3) KV Cache → 新增「Mooncake disaggregated KV pool 跨 vLLM 实例共享 KV cache + arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference = 2026 Q4 KV Cache 异构跨族传输预备新增」 - §3 争议 → D224 v3.50 候选 ⚠⚬⚬:TGI 进入维护模式时间精度新矛盾(jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异 · 需查阅 HuggingFace 官方公告原文核实)

增量 3:Vector DB 基准格局 2026 + 混合搜索全面胜出 + Qdrant p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快(⭐⭐)

来源: - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §四(11:40) - inbox/jay/2026-10-02-engineering-e1prep.md §增量 4(11:23)

要点:

A. 基准数据(1M 向量,HNSW 调优后)

数据库 p50 p99 QPS 备注
Qdrant ~2.1ms ~6.3ms ~1,200 开源最快(v3.49 evening 已锚入 Qdrant P99 6ms 50M 向量实测;本棒位承接 + 1M 向量 p50 2.1ms 第七源数据对齐)
Pinecone ~10ms — — 托管体验最佳
Weaviate ~16ms — — 混合搜索最成熟
Milvus ~18ms — — 亿级向量
pgvector ~25-40ms — — Postgres 集成
Chroma ~30ms — — DX 好,非低延迟优化

B. 2026 年生产关键结论

  • 纯向量搜索在生产中表现不如混合搜索(向量 + BM25 + 元数据过滤器)
  • 因为 Agent 需要精确匹配专有名词、版本号、ID 等场景,纯语义检索不够用
  • 混合搜索是必选项(纯向量搜索不够用)

C. 选型决策框架(jay 10-2 engineering 增量 4)

  • 零运维托管 → Pinecone
  • 追求开源性能和成本控制 → Qdrant
  • 已有 PostgreSQL 栈且向量 <100M → pgvector + pgvectorscale
  • 必须混合搜索 → Weaviate 或 Qdrant(native hybrid)+ Vespa
  • 亿级向量且需要低成本 → Milvus / Zilliz Cloud

D. Agent 记忆 + 多租户

  • 混合搜索是必选项,纯向量搜索不够用

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱沿用稳态(Qdrant P99 6ms 50M 向量实测 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + KVTC ICLR 2026 + Periodic Weak Spots + py-kvcache 5 项关键技术 + py-kvcache 6 关键技术列表)→ v3.50 候选承接预备:Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 第七源数据对齐 + 混合搜索全面胜出 - 承接 v3.48 §1.(10) 顶会部署沿用稳态(SGLang/vLLM/TRT-LLM H100 Benchmark 2026 + Particula Tech + VRLA Tech + jay 9-30 三源)→ v3.50 候选承接预备:Vector DB 2026 选型决策框架 + 混合搜索必胜结论 = Vector DB 选型预备新增 - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + py-kvcache 5 项关键技术 + vLLM 分层 KV Cache Offloading + LMCache + Mooncake + HotPrefix 形成「KV Cache 系统级优化第六维卸载层级」 → v3.50 候选承接预备:Vector DB 2026 选型决策框架 + 混合搜索 = v3.49 evening §1.(11) Kernel/AI 自动化/Harness 第五源预备新增锚定

建议归入哪一节: - §1.(3) KV Cache → 新增「Vector DB 2026 选型决策框架 · Qdrant 开源最快(1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200)+ 混合搜索全面胜出 = Agent 记忆/多租户生产场景的必选路径」 - §1.(11) Kernel/AI 自动化/Harness → 新增「Vector DB 2026 选型决策框架 = v3.49 evening §1.(11) Kernel/AI 自动化/Harness 第五源预备新增」 - §1.(10) 顶会部署 → 新增「Vector DB 2026 选型决策框架 = v3.49 evening §1.(10) 顶会部署 Vector DB 维度预备新增」

增量 4:Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化(⭐⭐⭐)

来源: - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §五(11:40 · 来源 Nathan Benaich Substack State of AI: April 2026) - inbox/jay/2026-10-02-engineering-e1prep.md §增量 5 + §增量 7(11:23) - inbox/jay/2026-10-02-csdn-rag-agent-harness.md(08:20 · Hermes Agent Harness 三模块) - inbox/spark/2026-10-02-agent-e1prep.md §增量 7(13:30 · Harness Engineering 八栖位预备扩增稳态)

要点:

A. Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)

  • 核心发现:同一 LLM 固定,只改变 harness(决定模型每步看到什么信息、如何存储和检索)可以产生 6 倍性能差距
  • Meta-Harness 实现路径:给 Agent 提供原始执行迹(最多 10M token 诊断信息)而非压缩摘要,实现 text classification +7.7 分
  • 战略价值:Agent 系统性能瓶颈不在模型本身,而在 harness 的设计 → 2026 年 Agent 平台(Dify、LangGraph、AutoGen)差异化的核心战场

B. Lilian Weng Harness 自我改进(RSI)工程化

  • 递归自我改进(RSI) 概念追溯到 I. J. Good(1965)
  • Harness 工程使 Agent 的自改进从理论走向系统化工程实践
  • 文章覆盖 test-time compute 分配、self-verification 机制、RSI 的工程可行性

C. Hermes Agent Harness 三模块

  • Prompt Harness + Context Harness + Tool Harness
  • 含自进化机制(Self-Evolution)和 RAG 功能集成
  • 传统 Prompt Engineering 的生产局限性:稳定性不足、可维护性差、缺乏自进化能力
  • Harness Engineering 将 Agent 组件标准化和配置化管理

D. Sebastian Raschka 控制 LLM 推理力度

  • LLM 如何学习低、中、高推理力度模式
  • 与 Mid-Harness(test-time compute 分配动作可靠性)在主题上高度相关

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(11) Kernel/AI 自动化/Harness 沿用稳态(MCP 2026-07-28 Stateless 三大变更 + 包体积 -83% 速度 +25% + 已部署 10,000+ MCP servers + 月 SDK 下载 97M+ + Salesforce Headless 360 处理 450 万次调用 + py-kvcache 5 项关键技术 + Nereus arXiv 2609.34645)→ v3.50 候选承接预备:Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 + Harness Engineering 战略价值从工程实践升级到平台差异化核心战场 - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + 包体积 -83% 速度 +25% Manufact Cloud 实测 → v3.50 候选承接预备:Meta-Harness 6× 性能差距 = MCP Stateless 协议层三大变更落地证据 + Harness Engineering 战略价值跃升预备新增 - 承接 v3.49 evening §1.(11) Harness Engineering 5 项 P0 风险 + Project Swap + Claude N=4 SYM + Gemini 4 post-training + Linear Superposition 评测对照 + LRH Needs Group Action 双锚预备级 + Multi-Agent Harness 5 件 net-new + Rufus-Air 8 阶段 vs MOPD vs WHALE 联合优化 vs Yoonho Lee custom harness 实现差异对照 + frontier lab 模型权重 SBOM 范式迁移的具体实施细节争议 → v3.50 候选承接预备:Meta-Harness 6× + Lilian Weng Harness RSI + Hermes Agent Harness 三模块 = Harness Engineering 第六源预备新增锚定预备级

建议归入哪一节: - §1.(11) Kernel/AI 自动化/Harness → 新增子条目「Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)+ Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 = Harness Engineering 战略价值从工程实践升级到平台差异化核心战场」 - §3 争议 → D225 v3.50 候选 ⚠⚬⚬:Meta-Harness 6× 性能差距数据(Nathan Benaich Substack 引用)需查阅原论文核实——实验设置、baseline 选择、任务类型均未详——标注 ⭐⭐⭐⭐ 核实优先级 - §4 开放问题 → O542 v3.50 候选:Harness Engineering 战略价值升级是否影响 v3.48 morning §1.(11) 已锚定的 MCP Stateless 三大变更 + 已部署 10,000+ MCP servers 的工程化推进节奏?

增量 5:ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构(⭐⭐)

来源: - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §二(11:40 · 来源 HF 官方) - inbox/jay/2026-10-02-engineering-e1prep.md §增量 2(11:23)

要点:

A. 实验规模

  • 1,221 名社区成员
  • 2026 年 7 月 15 日至 8 月 2 日
  • 6,816 份 Trackio 复现日志
  • 涵盖 2,226 篇论文(占 ICML 2026 全部 6,352 篇的 34%)
  • GLM-5.2 作为自动化 Judge 判定

B. 核心数据

  • 51%(1,103 篇)至少一条 claim 被验证
  • 23%(496 篇)至少一条 claim 被证伪
  • 242 篇出现独立团队相互否定(adversarial disagreement)
  • 266 篇完全复现

C. 关键洞察

  • 可复现性是对抗性的而非二元的:完全可复现与完全不可复现之间存在大量灰色地带
  • 审稿人没有时间验证证明:官方 spotlight 论文审稿意见明确承认"My low confidence score is because I did not check all the proofs carefully",该论文最终被证伪
  • AI Agent 正在改变科研验证的成本结构:过去一名审稿人花一个周末仔细检查一篇论文;AI Agent 可以并行地、同时检查数千篇,审查速度第一次被规模化
  • 自引用问题:参与者倾向于验证与自己立场一致的论文,需要对抗性验证机制(adversarial re-verification)来平衡

D. 数据集

  • 274 份完整 Agent Trace 数据集 发布于 HF,供复现使用

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(v3.42 Inference Control Plane + v3.45 InferenceBench + v3.46 Continnum + v3.47 morning DISCO 2609.33485 + v3.47 morning G²PTQ 2609.31009 + v3.47 morning Pareto Atlas 2609.17863)→ v3.50 候选承接预备:ICML 2026 复现实验 2,226 篇论文 + 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 = v3.49 evening §1.(1) 推理引擎方法学第十元组预备新增 - 承接 v3.47 morning §1.(1) Inference Control Plane 4 条设计原则(arXiv 2609.23130)→ v3.50 候选承接预备:ICML 2026 复现实验 = Inference Control Plane + AI Agent 驱动评测规模化 = 评测方法学第九元组预备扩位候选 - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + 包体积 -83% 速度 +25% + 已部署 10,000+ MCP servers → v3.50 候选承接预备:ICML 2026 复现实验 = AI Agent 改变科研验证成本结构 + Harness Engineering 战略价值跃升双栖预备新增锚定预备级

建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 = 评测方法学第九元组预备扩位候选」 - §1.(11) Kernel/AI 自动化/Harness → 新增「ICML 2026 复现实验 + Harness Engineering 战略价值跃升双栖预备新增锚定预备级」 - §3 共识 → C329 v3.50 候选:ICML 2026 复现实验 = 评测方法学"AI Agent 驱动评测规模化"预备扩位候选 = 与 v3.48 morning 立标 13 "Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式"形成双栖承接

增量 6:HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B(承接稳态精修预备级锚定 ⭐⭐)

来源: - inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §一(11:40 · 来源 HF 官方年度生态系统报告) - inbox/jay/2026-10-02-engineering-e1prep.md §增量 1(11:23)

要点:

A. Hub 规模里程碑

  • 模型仓库 243 万→296 万
  • 数据集 71.1 万→100 万
  • Spaces 100 万→144 万

B. 极端长尾分布

  • 85.6% 的模型累计下载量 <200 次
  • 1.5% 的仓库贡献 99.2% 的下载量

C. Qwen 已成为社区事实标准底座

  • 2026 年前 7 个月,Qwen 衍生模型以每天 180–210 个新仓库的速度增长
  • 开发者已将 Qwen 作为微调和部署的默认选择

D. Attention ≠ Adoption(关注度≠使用量)

  • 2026 年发布的模型无一进入下载量 Top 25
  • Top 25 下载量中有 13 个是 2022 年发布的模型
  • all-MiniLM-L6-v2 在 7 个月内被下载 15.5 亿次

E. 中国模型规模远超美国

  • 中国实验室月度最大模型参数 754B–2.78T
  • 美国除 NVIDIA Nemotron 3 Ultra 561B 外均 <130B

F. Agent 是新的用户

  • 多模态、工具调用、长记忆等能力需求激增
  • Agent 场景成为模型能力主要驱动力

与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(Qwen 国产模型 + v3.49 morning 已锚定 vLLM/SGLang 双寡头 + 国产 MoE + 国产硬件 + 推理引擎混合部署架构)→ v3.50 候选承接预备:HF State of Open Models Summer 2026 + Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus → v3.50 候选承接预备:Qwen 社区事实标准底座 + Agent 是新的用户 = 2026 Q4 推理引擎生态上游预备新增

建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B = 2026 Q4 推理引擎生态上游预备新增」 - §1.(11) Kernel/AI 自动化/Harness → 新增「Qwen 社区事实标准底座 + Agent 是新的用户 = 2026 Q4 推理引擎生态上游预备新增」


三、值得警惕的矛盾或待核实说法

⚠⚬ D223 · RoPE at the End of Its Rope 的 mitigation 缓解方案效果未在 TLDR 披露

矛盾描述:RoPE at the End of Its Rope(2609.39929)声称"理论、诊断与缓解"(Theory, Diagnosis, and Mitigation),但 TLDR 截断后缓解方案(mitigation)内容几乎完全缺失——是否已有可行的 RoPE 失效缓解措施,还是仍在理论阶段?

风险等级:低-中

处置建议:仅引用"理论诊断"部分(RoPE trade-off 是长上下文检索不稳定的根因);不引用"缓解"相关内容;v3.50 morning 候选承接时建议独立第三方复现测试 + 查阅原文 mitigation 章节。

⚠⚬⚬ D224 · TGI 进入维护模式时间精度新矛盾(jay 10-2 vs v3.49 evening)

矛盾描述:jay 10-2 engineering §增量 3 标定 TGI 进入维护模式(2025.12);v3.49 evening §1.(1) 沿用 TGI maintenance mode 2026-03-21 + 2026-09-05 README 正式确认(jay 9-30 0935 + daily-brief + llm-inference-vector-db 三源交叉验证)——4 个月差异。

风险等级:中

处置建议:v3.50 morning 候选承接时建议查阅 HuggingFace 官方公告原文核实 TGI maintenance mode 起始时间;两种可能:① jay 10-2 标定错误("2025.12" 应为 "2026-03-21");② v3.49 evening 沿用时间精度错误("2026-03-21" 应为 "2025.12");③ 真实存在两个不同时间节点(2025.12 进入 deprecation 公告 + 2026-03-21 进入实际 maintenance + 2026-09-05 README 正式确认)。

⚠⚬⚬ D225 · Meta-Harness 6× 性能差距数据需查阅原论文核实

矛盾描述:Nathan Benaich Substack 引用 Meta-Harness 论文称"同一 LLM 固定,只改变 harness 产生 6× 性能差距,text classification +7.7 分,10M token 诊断信息"——该数据需查阅 Meta-Harness 原论文核实,包括实验设置、baseline 选择、任务类型等细节。标注 ⭐⭐⭐⭐ 核实优先级。

风险等级:中

处置建议:v3.50 morning 候选承接时建议查阅 Meta-Harness 原论文 + 6× 性能差距实测 + 10M token 诊断信息可行性 + 与 v3.48 morning §1.(11) 已锚定的 Multi-Agent Harness 5 件 net-new 形成"Harness Engineering 第七源预备扩增稳态"。

⚠⚬ D226 · ICML 2026 复现实验 51% claim 验证 23% claim 证伪 · GLM-5.2 作为自动化 Judge 待核实

矛盾描述:ICML 2026 复现实验使用 GLM-5.2 作为自动化 Judge 判定 6,816 份 Trackio 复现日志——GLM-5.2 Judge 准确率、跨领域泛化性、潜在 Judge 偏差均未在 HF 官方报告中详尽披露。

风险等级:低-中

处置建议:v3.50 morning 候选承接时建议查阅 HF 官方报告原文 + GLM-5.2 Judge 评估方法学 + 274 份 Agent Trace 数据集实测。

沿用 D1-D222 v3.49 evening 全部稳态(含 D219-D222 v3.49 evening 新增 4 件)

  • D219 ⚠⚬ Periodic Weak Spots phase sensitivity 实证数据是否在生产环境可重现
  • D220 ⚠⚬⚬ NVIDIA Dynamo SLA-Based Planner 实际效果待核实
  • D221 ⚠⚬⚬ HotInfra 2026 CXL vs GPU HBM CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证
  • D222 ⚠⚬⚬ MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / Salesforce 450 万次调用)需溯源到 Anthropic / Manufact 官方报告原文
  • 沿用闭合 = D1-D226(含 D223-D226 v3.50 候选新增 4 件)

沿用 D212 v3.48 morning 警示:TGI 退场时间精度矛盾(本棒位 D224 新增承接)

  • D224 v3.50 候选 = D212 v3.48 morning 矛盾 + jay 10-2 engineering 增量 3 新数据点的矛盾升级版本

四、可引用 arXiv 号列表

arXiv 论文 与 llm-infra 主题关系 成熟度
2609.39929 RoPE at the End of Its Rope? Theory, Diagnosis, and Mitigation of Long-Context Failures ⭐⭐⭐ 主分类 llm-infra · method · 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位预备级补强 新(2026-09,paper_card 1609 10-2 入库)
2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference ⭐⭐ 主分类 engineering · method · 邻接 llm-infra · work-queue Top 15 #2 · paper_card 1630 已入库 · 跨族 KV Cache 异构推理传输 = 2026 Q4 KV Cache 异构跨族传输预备新增 新(2026-09,paper_card 1630 10-2 evening 入库)
2609.33697 TTT-Discover · Learning to Discover at Test Time 工程主轴承接 · RL 训练 LLM 解决单一测试问题 = 推理时学习 新
2609.40316 Loop Scaling Laws v3.49 evening §1.(1) 推理引擎 + §1.(8) 训练 = Loop transformer + MoE 联合稀疏缩放律 已锚入 v3.49 evening
2609.36636 LoopLMs v3.49 evening §1.(5) 投机解码 = LoopLM 推理计算深度扩展路径 已锚入 v3.49 evening
2609.36322 Periodic Weak Spots v3.49 evening §1.(3) KV Cache = Chunked KV-cache 压缩相位敏感性 已锚入 v3.49 evening
2609.36314 FRAC v3.49 evening §1.(6) 长上下文 = 分数阶动力学 power-law 长记忆 SSM 新路径 已锚入 v3.49 evening
2609.33355 Unmask the State v3.49 evening §1.(7) 多模态 + §1.(1) 推理 = MDM 推理策略五维度(副 llm-infra) 已锚入 v3.49 evening
2609.34645 Nereus v3.48 morning §1.(11) Kernel/AI 自动化/Harness + §1.(8) 训练 = LLM RL 后训练自适应并行 已锚入 v3.48 morning
2609.39102 False Frontiers agent 主轴邻接 = 自演化搜索 Agent 共谋作弊诊断 新(agent-e1prep 已锚入)
2609.38334 EVOKE agent 主轴邻接 = 激发 Agent 世界知识以实现可迁移决策 新(agent-e1prep 已锚入)
2609.39788 Safety of Latent Communication agent 主轴邻接 = 多 Agent 潜在通信安全攻击 新(agent-e1prep 已锚入)
2609.39154 DAGent agent 主轴邻接 = Evaluate-then-Grow 深度研究 Agent 规划 新(agent-e1prep 已锚入)
2609.38349 MILO agent 主轴邻接 = Agent Harness 自动发现框架(主分类 evaluation · 副 agent) 新(agent-e1prep 已锚入)
2609.38792 Training LLM Judges from Language Feedback agent 主轴邻接 = Position-Selective Self-Distillation(主分类 engineering) 新(agent-e1prep 已锚入)
2609.39982 Mid-Harness evaluation 主 · 副 agent = Scaling Actions Between Model and Harness 已锚入 v107
2609.39075 RAGScope rag 主分类 = RAG 幻觉分诊证据门控协议 新(tom rag-e1prep 已锚入)
2609.37863 MIST multimodal 主分类 = VLM Judges 评估压力测试 新(agent-e1prep 已锚入)
2610.00544 Memorizon engineering 主分类 · 副 multimodal = Streaming world models 长跨度训练(工作流 memory 系统级) 新(work-queue Top 15)
2610.02196 InterEvolve engineering 主分类 = Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation 新(work-queue Top 15)
2610.01871 Walking the Embedding Space rag 主分类 = Multimodal RAG 数据提取攻击 新(work-queue Top 15)
2610.01936 Mapping the RAG Landscape rag 主分类 = Four Axis Taxonomy of Efficiency, Defense, Interactivity, and Reasoning 新(work-queue Top 15)
2608.09444 Continuous Depth Batching (CDB) v3.47 morning §1.(1) 推理引擎 已锚入 v3.47 morning
2609.31415 KV Cache Reuse v3.47 morning §1.(3) KV Cache = 精度损失被系统性低估 已锚入 v3.47 morning
2609.23130 Inference Control Plane v3.47 morning §1.(1) 推理引擎 = 4 条设计原则 已锚入 v3.47 morning
2609.17863 Pareto Atlas v3.47 morning §1.(1) 推理引擎 = 54 锚点 · $18 已锚入 v3.47 morning
2609.33485 DISCO v3.47 morning §1.(6) 长上下文 = 分布式长上下文扩展从 context rot 困境突破 已锚入 v3.47 morning
2609.31009 G²PTQ v3.47 morning §1.(4) 量化 = GPTQ-based 量化统一框架 已锚入 v3.47 morning
2609.26333 DQ v3.47 morning §1.(1) 推理引擎 = 首个量化层面 Prefill-Decode 解耦 已锚入 v3.47 morning
2609.31397 Intent2Tc v3.47 morning §1.(2) 推理调度 = LLM 跨域网络流量控制 已锚入 v3.47 morning
2511.01815 KVTC v3.49 evening §1.(3) KV Cache = ICLR 2026 录用 · 变换编码 已锚入 v3.49 evening
2609.27746 KVSET v3.46 morning §1.(3) KV Cache 已锚入 v3.46 morning
2609.28870 Cache Replacement v3.47 morning §1.(3) KV Cache = Rethinking Cache Replacement For LLM Prefix Reuse 已锚入 v3.47 morning
2609.22157 PAGE Eviction v3.47 morning §1.(3) KV Cache = Partition-Aware Gated KV-Cache Eviction 已锚入 v3.47 morning
2609.24991 Who Pays for KV Cache v3.47 morning §1.(3) KV Cache = KV Cache 成本分析 已锚入 v3.47 morning
2609.34727 Dynamic Flow Static Graph v3.47 morning §1.(3) KV Cache = Mobile NPU KV Cache Reuse 已锚入 v3.47 morning
2605.13734 KVServe v3.46 morning §1.(3) KV Cache = SIGCOMM 2026 已锚入 v3.46 morning
2510.03215 C2C v3.46 morning §1.(3) KV Cache = ICLR 2026 已锚入 v3.46 morning
2608.01526 Internet for KV Cache v3.45 morning §1.(3) KV Cache 已锚入 v3.45 morning
10.1145/3749168 HotPrefix v3.46 morning §1.(3) KV Cache = SIGCOMM 2026 已锚入 v3.46 morning
2609.11744 py-kvcache 工程综述 v3.48 morning §1.(11) Kernel/AI 自动化/Harness = 5 项关键技术 + 6 关键技术列表(沿用) 已锚入 v3.48 morning

本轮 llm-infra 主题涉及 arXiv 号共 41 个(其中 1 件 llm-infra 主分类 NET-new:2609.39929 RoPE at the End of Its Rope · 1 件 engineering 邻接 NET-new:2609.32259 Prefill-Free Cross-Family KV Cache Transfer + 39 件其他主分类邻接/承接/沿用)。


五、相比 v3.49 基线的增量差异

v3.49 基线(2026-10-02 05:00 CST · §IX 108 evening 升档棒)已锚定 4 NET-new paper_card 主分类 llm-infra(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607 副)+ 1 NET-new paper_card engineering 邻接(Loop Scaling Laws 1604)+ 0 NET-new arXiv/CVE/DOI/URL(精确闭合 438→438/36/15/571→571)+ 6 件承接稳态精修预备级锚定(NVIDIA Dynamo 5 大特性 + Dynamo 1.0 GA + NVIDIA Grove + FlashInfer Blackwell + llm-d CNCF GAIE EPP + KVTC ICLR 2026 + HotInfra 2026 CXL + Qdrant P99 6ms 50M + MCP 生产规模数据)+ 4 NET-new 矛盾/待核(D219-D222)。本轮在此基础上新增:

本轮新增 对应上下文
arXiv 2609.39929 RoPE at the End of Its Rope(paper_card 1609 主分类 llm-infra) 补充 v3.49 evening §1.(6) 长上下文 + §1.(3) KV Cache 14 件完整图谱 = "位置编码 + KV cache 压缩"双栖位预备级补强
arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer(paper_card 1630 engineering 邻接 llm-infra) 补充 v3.49 evening §1.(3) KV Cache 14 件完整图谱 = 跨族 KV Cache 异构推理传输预备新增
推理引擎 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 = 推理框架洗牌期明确化 + SGLang 400,000+ GPU 部署规模 + Mooncake disaggregated KV pool 跨 vLLM 实例共享
Vector DB 2026 选型决策框架 + Qdrant 1M p50 2.1ms / p99 6.3ms / QPS ~1,200 补充 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + §1.(10) 顶会部署 = Qdrant 第七源数据对齐 + 混合搜索全面胜出
Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 补充 v3.49 evening §1.(11) Kernel/AI 自动化/Harness = Harness Engineering 战略价值从工程实践升级到平台差异化核心战场
ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 = 评测方法学第九元组预备扩位候选 + Harness Engineering 双栖预备新增
HF State of Open Models Summer 2026 + Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 + §1.(11) Kernel/AI 自动化/Harness = 2026 Q4 推理引擎生态上游预备新增

v3.49 evening 核心脉络(LLM 推理软件栈垂直分层 2026 版完整形成 6 层栈 + Chunked KV-cache 压缩相位敏感性 KV Cache 系统级优化第六维警示 + SSM 架构新路径 = 指数衰减 → 幂律长记忆 FRAC 双栖 + Loop transformer 缩放律 = LoopLM + Loop Scaling Laws 双栖 + MDM 推理策略五维度 + KVTC ICLR 2026 加入 py-kvcache 完整 6 关键技术列表 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + Qdrant P99 6ms 50M 向量 + vLLM/SGLang/TRT-LLM + Dynamo 编排层 + llm-d GAIE = 六源数据完整对齐 + MCP Stateless 三大变更 + 生产规模数据补充 + Nereus 自适应执行计划)在本次 24h 窗口无重大更新,本简报不重复立条目;新增承接延续 + 5 NET-new 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D223-D226)。


六、趋势信号

信号 1:LLM 推理软件栈垂直分层 2026 版进入"引擎选型收口期"

jay 10-2 engineering §增量 3 给出推理引擎 2026 秋季快照:vLLM 是生产首选 + SGLang Agent 长 KV 场景差异化(400,000+ GPU) + TGI 退出明确化 + Mooncake 解绑 KV Cache。「Ollama 是入口,vLLM 是出口」 框架明确化,叠加引擎定位决策树:并发请求超过个位数、P99 延迟敏感时,必须迁移 vLLM。这与 v3.49 evening §0.5 SOTA v3.49 「2026 Q4 初 LLM 推理软件栈垂直分层 2026 版完整形成(6 层栈)」形成"引擎选型收口期 + 协议层 MCP Stateless 三大变更 + Harness Engineering 战略价值跃升" 三栖预备扩增稳态。

信号 2:SSM 架构新路径 + 位置编码 + KV Cache 系统级优化第六维警示

FRAC(2609.36314)引入分数阶动力学,用幂律长记忆取代指数衰减——为 SSM 架构选型开辟新维度。RoPE at the End of Its Rope(2609.39929)从位置编码理论层面为 v3.49 evening 已锚定的 Periodic Weak Spots phase sensitivity(2609.36322)提供理论根因——高频分量支持位置敏感性,低频分量支持远程依赖,二者不可兼得是 RoPE 长上下文失效的根因。与 Mamba 系列 + FRAC 形成「指数衰减 vs 幂律长记忆 + 位置编码 trade-off + KV cache 压缩相位敏感性」三栖预备扩增稳态。

信号 3:Loop transformer 缩放律 + Harness Engineering 战略价值跃升

LoopLMs(2609.36636)+ Loop Scaling Laws(2609.40316)形成Loop 系完整图谱预备级——推理计算深度扩展 + Loop + MoE 联合稀疏缩放律的双栖。Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)+ Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 + MILO(2609.38349)= Harness Engineering 战略价值从工程实践升级到平台差异化核心战场 + harness 设计空间自动化第 1 例。Harness Engineering 战略价值跃升 = 2026 Q4 Agent 平台差异化核心战场。

信号 4:Vector DB 2026 选型决策框架 + 混合搜索全面胜出

Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快 + 混合搜索(向量 + BM25 + 元数据过滤器)全面胜出纯向量搜索 + Agent 记忆 + 多租户 生产场景 = 混合搜索必选项。「The best vector database is the one you already have」(Simon Frey 2026 生态转向信号,v3.49 evening 已锚入)+ Qdrant 第七源数据对齐 = Vector DB 2026 选型决策框架预备扩增稳态。

信号 5:AI Agent 改变科研验证成本结构 = 评测方法学第九元组预备扩位

ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 可以并行地、同时检查数千篇 + 审查速度第一次被规模化 + 274 份完整 Agent Trace 数据集发布于 HF = 「AI Agent 驱动评测规模化」 预备扩位候选 + v3.49 evening 立标 13 「Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式」 + ICML 2026 复现实验 = 评测方法学第九元组预备扩位候选 = 2026 Q4 评测方法学范式转换预备新增。


七、诚实度声明

本轮 llm-infra 主轴增量密度为「中低」——24h 窗口内发现 5 条显著增量 + 1 条承接稳态精修预备级锚定(在 3-8 条目标区间内),其中 1 件 llm-infra 主分类 paper_card NET-new(RoPE at the End of Its Rope 1609)+ 1 件 engineering 邻接 paper_card NET-new(Prefill-Free Cross-Family KV Cache Transfer 1630)+ 5 件工程主轴信号(推理引擎 2026 秋季快照 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 2026 混合搜索 + Harness Engineering 战略价值升级 + ICML 2026 复现 + HF State of Open Models),均来自 jay 10-2 工程全天棒位产出(jay engineering-e1prep + csdn-rag-agent-harness + hf-state-open-models-icml-repro-inference-vecdb-substack)+ paper_cards 10-2 morning 28 件入库清单 + work-queue 10-2 08:00 Top 15 8 件 + spark 10-2 agent-e1prep 65KB(v3.49 evening 承接基线)。v3.49 evening 已锚定的主脉络(LLM 推理软件栈垂直分层 2026 版完整形成 6 层栈 + Chunked KV-cache 压缩相位敏感性 KV Cache 系统级优化第六维警示 + SSM 架构新路径 = 指数衰减 → 幂律长记忆 FRAC 双栖 + Loop transformer 缩放律 = LoopLM + Loop Scaling Laws 双栖 + MDM 推理策略五维度 + KVTC ICLR 2026 加入 py-kvcache 完整 6 关键技术列表 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + Qdrant P99 6ms 50M 向量 + vLLM/SGLang/TRT-LLM + Dynamo 编排层 + llm-d GAIE = 六源数据完整对齐 + MCP Stateless 三大变更 + 生产规模数据补充 + Nereus 自适应执行计划)在本次 24h 窗口承接延续稳态,无重大更新;本棒位的真实任务是承接 v3.49 evening 沿用稳态 + 锚定 v3.49 evening 之后 NET-new llm-infra 主轴内容(RoPE 1609 唯一一件 llm-infra 主分类 NET-new)+ 整合 jay 10-2 工程主轴产出承接延续 + 闭合 stephen 10-2 12:45 noon §〇「spark llm-infra 第 10 日缺口已闭合」沿用;无硬凑字数。


八、检查过的来源清单(可审计)

# inbox/jay(10-2 全天工程主轴产出 ≈ 70KB)
2026-10-02-engineering-e1prep.md                     11:23 · 22KB · 7 主增量 = HF State of Open Models + ICML 2026 复现 + 推理引擎格局 + Vector DB 基准 + Substack Meta-Harness + CSDN RAG 四代 + Lilian Weng Harness RSI
2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md  10:40 · 详细 Substack 线索
2026-10-02-csdn-rag-agent-harness.md                 08:20 · CSDN RAG/Agent/Harness 工程综述 10 条
2026-10-02-jay-five-category-briefing.md             11:05 · 9.3KB · 5 类目 = Database pgvector + Backend/Agent Memory + K8s 2026 + GitHub + Substack
2026-10-02-1140-news-x-tech-radar.md                 11:42 · 5.5KB · 8 干货 = GPT-6 Astra + ExtractBench + Microsoft 小模型无蒸馏 Agent + LFM2.5 + Claude Code MCP + SWE-bench 2026.02
2026-10-02-1220-csdn-substack-inference-rag-highvalue.md  12:20 · 10.8KB · 5 S 级 CSDN + 4 Substack S 级
2026-10-02 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/yt-karpathy 10 件)

# inbox/tom
2026-10-02-agent-rag-longcontext-radar.md            08:40 · 2.6KB · 8 候选 + 4 高价值 = RAGScope + MILO + DAGent + Training LLM Judges
2026-10-02-rag-e1prep.md                             08:50 · R108 · 9.7KB · 2 主增量 = RAGScope + RoPE at the End of Its Rope(强邻接 llm-infra)
2026-10-02-0900-hf-daily-2026-10-02.md               09:00 · 1.6KB · 15 立标 · ReaLVR 206▲ #1 + False Frontiers 190▲ #2 + Mid-Harness 102▲ #3 + EVOKE 64▲ + 物体永久性第 8 日跌出
2026-10-01T2040-agent-rag-longcontext-radar.md       20:40 · 3 高价值 = RAGScope + RoPE + Org-Agent 沿用

# inbox/flyp
2026-10-02-0950-flyP-critical-read-ReaLVR-grounding-latent-visual-reasoning.md  09:50 · 11.4KB · ReaLVR 206▲ #1 顶置新立 B+ 预备级候选
2026-10-02-multimodal-e1prep.md                      09:46 · 79KB · v87+21 R43 · 7 主增量
2026-10-02-1000-rss-cameron-wolfe.md + 2026-10-02-1002-rss-interconnects.md + 2026-10-02-1005-rss-yt-ai-explained.md(3 RSS 沿用稳态)

# inbox/stephen
2026-10-02-1245-stephen-coordination-check-noon.md   12:45 · 43KB · noon 协调棒位对账 · spark llm-infra 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬
2026-10-02-ai-industry-e1prep.md                     10:20 · 87KB · v70 · 5 主增量 = OpenAI DevDay + TLDR AI + NVIDIA Safety Platform + HF Daily 第 14 次 + Anthropic ART 950 Agent 21h
2026-10-02-0910-news-x-vip-radar.md                  09:10 · 5.3KB · frontier lab 三连击
2026-10-02 1004-1006 news + yt-anthropic + yt-openai(7-9 件 news/yt + 6 件 RSS 沿用)

# inbox/spark
2026-10-02-agent-e1prep.md                           13:30 · 65KB · 8 主增量 = False Frontiers + EVOKE + Safety of Latent Communication + DAGent + MILO + Training LLM Judges + Meta-Harness 6× + frontier lab 三连击 · v3.49 evening 承接基线
2026-10-01-llm-infra-e1prep.md                       18:45 · 61KB · 6 主增量(第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬)
2026-10-01-agent-e1prep.md                           13:35 · 55KB · 6 主增量(v107 已锚定)
2026-10-02-1001-rss-gradient-flow.md + 2026-10-02-1003-rss-chip-huyen.md + 2026-10-02-1005-rss-yt-3blue1brown.md(3 RSS 速记 · 全部沿用第 7 日 ⚠⚬)

# organized/paper_cards(10-2 morning / evening 入库 · llm-infra 主分类 + 邻接)
1609-2609-39929.md  RoPE at the End of Its Rope · 主分类 llm-infra · method ← NET-new ⭐⭐⭐(本次承接新增 llm-infra 主分类唯一一件)
1630-2609-32259.md  Prefill-Free Cross-Family KV Cache Transfer · 主分类 engineering · method · 邻接 llm-infra ← NET-new ⭐⭐(work-queue Top 15 #2 · paper_card 1630 已入库)
1601-2609-39982.md  Mid-Harness · 主分类 evaluation · method(承接 · v107 已锚定)
1602-2609-39102.md  False Frontiers · 主分类 agent · method(承接 · agent-e1prep 已锚定)
1603-2609-39903.md  OSWorld-Science · 主分类 evaluation · benchmark · 副 agent(承接)
1604-2609-40316.md  Loop Scaling Laws · 主分类 engineering · method · 邻接 llm-infra(承接 · v3.49 evening 已锚入 1604)
1605-2609-38660.md  Breaking Babel · 主分类 agent · method(承接)
1606-2609-38334.md  EVOKE · 主分类 agent · application(承接 · agent-e1prep 已锚定)
1607-2609-33355.md  Unmask the State · 主分类 multimodal · position · 副 llm-infra(承接 · v3.49 evening 已锚入 1607)
1608-2609-39075.md  RAGScope · 主分类 rag · application(承接 · tom 10-2 rag-e1prep R108 已锚入)
1610-2609-39841.md  DyRAD · 主分类 evaluation · benchmark · 副 multimodal(承接)
1611-2609-39788.md  Safety of Latent Communication · 主分类 agent · method(承接 · agent-e1prep 已锚定)
1612-2609-36333.md  ATLAS · 主分类 agent · method(承接)
1613-2609-37863.md  MIST · 主分类 multimodal · method(承接 · agent-e1prep 已锚定)
1614-2609-24555.md  The Endless Exam · 主分类 evaluation · position(承接 · work-queue Top 15)
1615-2609-32600.md  CUA-SWE · 主分类 agent · benchmark(承接 · agent-e1prep 已锚定)
1616-1502-02761.md  沿用(v3.45 已锚入)
1617-2609-38792.md  Training LLM Judges from Language Feedback · 主分类 engineering · position · 副 Agent 评测强邻接(承接 · agent-e1prep 已锚定)
1618-2609-39154.md  DAGent · 主分类 agent · method · 副 evaluation(承接 · agent-e1prep 已锚定)
1619-2609-38349.md  MILO · 主分类 evaluation · method · 副 agent(承接 · agent-e1prep 已锚定)
1620-2609-38658.md  Tacit-TTS · multimodal(承接)
1621-2609-38597.md  PixelUMM · multimodal(承接)
1622-2609-34274.md  BIABench · agent · benchmark · 副 evaluation(承接 · agent-e1prep 已锚定)
1623-2609-30840.md  RWTD · benchmark(承接)
1624-2610-01936.md  Mapping the RAG Landscape · rag · survey(承接 · work-queue Top 15)
1625-2610-01871.md  Walking the Embedding Space · rag · method · 副 multimodal(承接)
1626-2610-02196.md  InterEvolve · engineering · method(承接 · work-queue Top 15)
1627-2610-00544.md  Memorizon · engineering · method · 副 multimodal(承接 · work-queue Top 15)
1628-2609-38886.md  Benchmarking Skill-Level Memory · agent(承接)
1629-2609-38987.md  Smaller Models Better Rejects · engineering(承接)
1631-2609-33403.md  DataMagic · engineering(承接)

# organized/queue/work-queue.md(10-2 08:00 · Top 15 高价值待深度解读共 8 件)
2609.33403 DataMagic · 2609.32259 Prefill-Free Cross-Family KV Cache Transfer · 2609.38987 Smaller Models Better Rejects · 2609.38886 Benchmarking Skill-Level Memory · 2610.00544 Memorizon · 2610.02196 InterEvolve · 2610.01871 Walking the Embedding Space · 2610.01936 Mapping the RAG Landscape
1 件与 llm-infra 强邻接:2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference(paper_card 1630 已入库)

# inbox/spark/2026-10-01-llm-infra-e1prep.md(v3.49 evening 升档棒承接基线 · 第 10 日缺口已闭合)
# inbox/spark/2026-09-30-llm-infra-e1prep.md(v3.47 morning 沿用稳态承接基线 · 第 9 日缺口已闭合)

spark · 2026-10-02 18:40 CST · llm-infra E1 预消化轮 · 24h 滑动窗口承接延续 · 5 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D223-D226)+ 41 arXiv 号(1 NET-new llm-infra 主分类 + 1 engineering 邻接 + 39 邻接/承接/沿用)· 无硬凑字数