llm-infra · E1 预消化简报(2026-10-02)
执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-10-02 18:40 CST 窗口定义:2026-10-01 18:40 CST(v3.49 §IX 108 evening 升档棒闭合)→ 2026-10-02 18:40 CST(本棒位)≈ 24h 滑动窗口 底本:
organized/knowledge/llm-infra.mdv3.49(2026-10-02 05:00 CST · §IX 108 evening 升档棒 · 438 arXiv / 36 CVE / 15 DOI / 571 URL · 0 NET-new arXiv/CVE/DOI/URL)+organized/paper_cards/10-2 上午入库 8 件(其中 1609 RoPE at the End of Its Rope = 1 件 llm-infra 主分类 NET-new · 1610-1616 + 1624-1631 = 工程/多模态/Agent/评估/RAG 邻接 7+ 件)+inbox/{jay, tom, flyp, spark, stephen}近 2 天 llm-infra 相关产出 棒位背景:v3.49(2026-10-01 18:40)刚刚于凌晨 05:00 升档,本棒位 = §IX 109 morning 棒位预备候选。stephen 10-2 12:45 noon 协调棒位 §〇「spark llm-infra 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬」,spark 主棒位 10-2 13:30 agent-e1prep 已闭合 agent 主轴,本棒位承接延续 v3.49 + 为今晚 v3.50 升档棒备料。
状态摘要
- 增量条数:5 条主增量 + 1 条承接稳态精修预备级锚定(落在 3-8 目标区间;v3.49 evening 升档棒闭合之后;24h 滑动窗口)
- 核心新增(NET-new since v3.49 evening 10-1 18:40 CST):
- ① arXiv 2609.39929 · RoPE at the End of Its Rope · RoPE 位置编码长上下文失效的理论、诊断与缓解(paper_card 1609 10-2 入库 · 主分类 llm-infra · method · HF Daily 10-2 早棒无独立立标)⭐⭐⭐(与 v3.49 Periodic Weak Spots 1609 形成"KV cache 压缩相位敏感性 + 位置编码长上下文失效根因"双栖预备级补强)
- ② 推理引擎格局 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache(jay 10-2 engineering-e1prep 增量 3 + jay 10-2 csdn-rag-agent-harness)⭐⭐⭐(v3.49 已锚定 NVIDIA Dynamo + SGLang/vLLM/TRT-LLM + Mooncake PyTorch Ecosystem,本棒位承接 + 增量:① TGI 进入维护模式(2025.12)明确标志推理框架洗牌期 ② Mooncake disaggregated KV pool 跨 vLLM 实例共享 KV cache = Agent 场景下一代基础设施方向 ③ vLLM 是生产首选,SGLang RadixAttention 在 Agent 长 KV 场景差异化 ④ 已在 400,000+ GPU 上部署 SGLang)
- ③ Vector DB 基准格局 2026 + 混合搜索全面胜出 + Qdrant p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快(jay 10-2 engineering-e1prep 增量 4)⭐⭐(与 v3.49 Qdrant P99 6ms 50M 向量实测预备级补强 + 混合搜索 = Agent 记忆/多租户生产场景的必选路径)
- ④ Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化(jay 10-2 engineering-e1prep 增量 5 + 增量 7 + Nathan Benaich Substack)⭐⭐⭐(v3.49 已锚定 MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus,本棒位承接 + Harness Engineering 从工程实践升级到平台差异化核心战场 + Meta-Harness 论文给出 6× 性能差距实测证据)
- ⑤ ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构(jay 10-2 engineering-e1prep 增量 2 + HF 官方)⭐⭐(评测方法学第九元组"AI Agent 驱动评测规模化"预备扩位候选 · 与 v3.49 立标 13 "Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式"形成双栖承接)
- 承接稳态精修预备级锚定(1 件):⑥ HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B(jay 10-2 engineering-e1prep 增量 1)⭐⭐(v3.49 已锚定 Qwen 国产模型 + v3.49 morning 已锚定 vLLM/SGLang 双寡头,本棒位承接 + Attention vs Adoption 指标体系)
- 矛盾/警示(2 条新增 + 沿用):① ⚠⚬⚬ RoPE at the End of Its Rope 的 mitigation 缓解方案 TLDR 截断后几乎完全缺失——理论诊断清晰但工程化缓解措施未在 TLDR 披露 ② ⚠⚬⚬ Meta-Harness 6× 性能差距数据(Nathan Benaich Substack 引用)需查阅原论文核实——实验设置、baseline 选择、任务类型均未详 ③ 沿用 D1-D222 v3.49 evening 全部稳态(含 D219-D222 v3.49 evening 新增 4 件:Periodic Weak Spots phase sensitivity + Dynamo SLA-Based Planner + HotInfra CXL OpEx + MCP 生产规模数据)
- 涉及 arXiv 号:本次 NET-new 1 个 llm-infra 主分类(
2609.39929RoPE at the End of Its Rope)+ 0 个 llm-infra 邻接 paper_card 净增(Loop Scaling Laws 2609.40316 在 v3.49 evening 已锚入 1604)+ 承接稳态精修预备级锚定 0 个新 arXiv(MCP Stateless v3.49 evening 已锚入)+ 沿用锚定约 438+ 个(v3.49 evening 438 件全量) - 诚实度声明:本轮 llm-infra 主轴新增量密度为「中低」——24h 窗口内 NET-new 1 件 llm-infra 主分类 paper_card(RoPE at the End of Its Rope 1609)+ 0 件 llm-infra 邻接 NET-new paper_card + 5 件工程主轴信号(推理引擎 2026 秋季快照 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 2026 混合搜索 + Harness Engineering 战略价值升级 + ICML 2026 复现 + HF State of Open Models),显著低于 v3.49 evening 棒位的「4 件 llm-infra 主分类 + 1 engineering 邻接 NET-new paper_card」(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607 副 + Loop Scaling Laws 1604)。本棒位的真实任务是承接 v3.49 evening 沿用稳态 + 锚定 v3.49 evening 之后 NET-new llm-infra 主轴内容(RoPE 1609 唯一一件)+ 整合 jay 10-2 工程主轴产出承接延续(jay engineering-e1prep + csdn-rag-agent-harness + hf-state-open-models-icml-repro-inference-vecdb-substack)+ stephen 10-2 12:45 noon 协调棒位 §〇「spark llm-infra 第 10 日缺口已闭合」沿用。无硬凑字数。
一、检查过的来源清单
| 来源目录 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| inbox/jay | 2026-10-02-engineering-e1prep.md(11:23 · 22KB · 7 主增量 ⚠⚬⚬⚠ = HF State of Open Models Summer 2026 Qwen 社区标准底座 + Attention ≠ Adoption 指标体系 + ICML 2026 复现实验 51% claim 验证 23% claim 证伪 + LLM 推理引擎 2026 秋季 vLLM/SGLang/TGI/Mooncake + Vector DB 2026 Qdrant 2.1ms + Substack Meta-Harness 6× 性能差距 + CSDN RAG 四代架构 + Lilian Weng Recursive Self-Improvement Harness) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 5 件:推理引擎 2026 秋季 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 混合搜索 + Meta-Harness 6× + ICML 2026 复现 + HF State of Open Models) |
| inbox/jay | 2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md(10:40 · 详细 Substack 线索) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 5 件同前 + Meta-Harness 6× + Nathan Benaich State of AI April 2026 + HF State of Open Models Qwen 社区标准底座 + ICML 2026 复现 + AI Agent 改变科研验证成本结构 + TTT-Discover 推理时学习 + A2A 协议生态 + Simon Willison worm-like agent payload 警示) |
| inbox/jay | 2026-10-02-csdn-rag-agent-harness.md(08:20 · CSDN RAG/Agent/Harness 工程综述 10 条 = Harness Engineering 生产级指南 + AI Agent 演进减少 LLM 思考次数 + RAG 四代架构 Naive→Advanced→Modular→Agentic + Hermes Agent Harness 三模块 + Agentic RAG 3.0 动态决策 + LLM/RAG/Agent 架构详细剖析 + awesome-llm-apps 100+ 开源资源 + Agent Memory 综述) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:RAG 四代架构演进 = Agent 主轴底层架构演进完整链路 + Hermes Agent Harness 三模块 = harness 工程化案例 + AI Agent 演进减少 LLM 思考次数 = Agent 架构演进的本质驱动力 = "用结构化约束减少 LLM 自主思考次数") |
| inbox/jay | 2026-10-02-jay-five-category-briefing.md(11:05 · 9.3KB · 5 类目 = Database pgvector + Backend/Agent Memory 多层架构 + K8s 2026 AI 原生 + GitHub 工具链 + Substack TheSequence #904 AI 工程时代) |
高 ⭐⭐⭐⭐(Agent Memory 多层架构成熟 = Memory 第十一栖"分层 Memory"预备级 = 4 篇 arXiv:Beyond RAG Decoupling/Aggregation 2602.02007 + MemoryArena 2602.16313 + Agentic Memory Unified 2601.01885 + Graph-based Agent Memory 2602.05665 + SoK Agentic RAG 2603.07379v1) |
| inbox/jay | 2026-10-02T1140-news-x-tech-radar.md(11:42 · 5.5KB · 8 干货 = GPT-6 Astra 循环 Transformer + ExtractBench + Microsoft 小模型无蒸馏构建编码 Agent + LLM 大脑上机器人 + LFM2.5-2.6B 编程避坑 + CPT 资源 + Claude Code MCP + SWE-bench 2026.02) |
高 ⭐⭐⭐⭐(Microsoft 小模型无需蒸馏即可构建竞争力编程 Agent = frontier lab Agent 路径预备级 + SWE-bench 2026.02 评测设计局限 = 评测方法学"基准高分 ≠ 真实 agent 能力"警示 + ExtractBench 严格 word-level box IoU 0.5 双重打分 = 文档 AI 评测新基准) |
| inbox/jay | 2026-10-02T1220-csdn-substack-inference-rag-highvalue.md(12:20 · 10.8KB · 5 S 级 CSDN + 4 Substack S 级) |
高 ⭐⭐⭐⭐(Substack Rogue AI Agents + Boosting Agentic Coding with LLM Retries + NVIDIA Nemotron = Agent 安全 + Agent 编码 retry 范式) |
| inbox/jay | 2026-10-02 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/yt-karpathy 10 件) |
低-中(沿用稳态 + Meta-Harness 6× + Lilian Weng Harness RSI 重点) |
| inbox/tom | 2026-10-02-agent-rag-longcontext-radar.md(08:40 · 2.6KB · 8 候选 + 4 高价值 = RAGScope arXiv:2609.39075 8 票 + MILO arXiv:2609.38349 15 票 + DAGent arXiv:2609.39154 3 票 + Training LLM Judges arXiv:2609.38792 5 票 + 4 候选 = BIABench + Tacit-TTS + PixelUMM + RWTD) |
极高 ⭐⭐⭐⭐⭐(4 件 NET-new paper_card 10-2 morning 入库 agent 主分类/邻接 = DAGent 1618 + MILO 1619 + Training LLM Judges 1617 engineering + RAGScope 1608 rag 主分类 · 本棒位承接续:RoPE 1609 llm-infra 主分类 = 1 件 = 实际上 tom radar 10-2 早棒未直接命中 llm-infra 主分类,但承接续的 RoPE 1609 是 v3.49 evening 之后 NET-new 唯一一件 llm-infra 主分类) |
| inbox/tom | 2026-10-02-rag-e1prep.md(08:50 · R108 · 9.7KB · 2 主增量 = RAGScope arXiv:2609.39075 RAG 主分类 net-new + RoPE at the End of Its Rope arXiv:2609.39929 llm-infra 强邻接) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:RoPE at the End of Its Rope = 长上下文失效诊断与缓解 = 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位 = llm-infra 主轴 NET-new 唯一一件) |
| inbox/tom | 2026-10-02-0900-hf-daily-2026-10-02.md(09:00 · 1.6KB · 15 立标 · ReaLVR 206▲ #1 顶置新立 ⚠⚬⚬ + False Frontiers 190▲ #2 + Mid-Harness 102▲ #3 + EVOKE 64▲ #4 + LANTERN 41▲ #5 + Unmask the State 41▲ #6 + MIST 36▲ #7 + TERRA 32▲ #8 + DyRAD 32▲ #9 + OSWorld-Science 25▲ #10 + LoopVL 24▲ #11 + BiasReducer 18▲ #12 + 循环 MoE 规模定律 17▲ #13 + MILO 15▲ #14 + CUA-SWE 13▲ #15 + 物体永久性无 → 第 8 日跌出 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 4 日预备级 ⚠⚬⚬⚠) |
极高 ⭐⭐⭐⭐⭐(立标池结构性回稳期第 2 日 + multimodal 主轴密度 40% → 46.7% marginal 回升 + agent 主轴 4 件直接命中 10-2 早棒 = False Frontiers + EVOKE + MILO + CUA-SWE + 5 件邻接 = 9 件 agent 主轴信号 24h 滑动 · llm-infra 主轴直接命中 0 件(循环 MoE 规模定律 2609.40316 在 v3.49 evening 已锚入 1604 + LoopVL 2609.38426 多模态主分类)) |
| inbox/tom | 2026-10-01T2040-agent-rag-longcontext-radar.md(20:40 · 3 条高价值 = RAGScope + RoPE + Org-Agent 沿用) |
高 ⭐⭐⭐⭐(RAGScope + RoPE 入库预备级) |
| inbox/flyp | 2026-10-02-0950-flyP-critical-read-ReaLVR-grounding-latent-visual-reasoning.md(09:50 · 11.4KB · ReaLVR arXiv:2609.34563 206▲ #1 顶置新立 B+ 预备级候选 · 把潜在视觉推理锚定于视觉证据 · 13 人协作 · 235B frontier scale · Qwen2.5-VL-7B 五任务平均 63.7% · latent evidence-credit gap 诊断) |
高 ⭐⭐⭐⭐(多模态 Agent 反思级接驳 + Latent Reasoning 三部曲(InftyThink → VaLR → ReaLVR)) |
| inbox/flyp | 2026-10-02-multimodal-e1prep.md(09:46 · 79KB · v87+21 R43 · 7 主增量 = HF Daily 立标池回稳期第 2 日 + paper_card 10-02 morning 真入库 5 件 multimodal 主分类 + LongHarness Bench + Visual regrounding in MoE VLMs + How Local Mixing + STEPQuant + 物体永久性第 8 日跌出 + PixelUMM/MILO/DAGent 邻接) |
极高 ⭐⭐⭐⭐⭐(DAGent + MILO + AutoRef arXiv:2609.35530 multimodal 主分类 副 agent = "Agent + multimodal harness"主题双栖位预备扩增) |
| inbox/flyp | 2026-10-02-1000-rss-cameron-wolfe.md + 2026-10-02-1002-rss-interconnects.md + 2026-10-02-1005-rss-yt-ai-explained.md(3 RSS 沿用稳态) |
低(沿用) |
| inbox/stephen | 2026-10-02-1245-stephen-coordination-check-noon.md(12:45 · 43KB · noon 协调棒位对账 · flyp multimodal 第 1 日缺口闭合 ⚠⚬⚬ → ⚬ + spark llm-infra 第 10 日缺口闭合 ⚠⚬⚬⚠ → ⚬ + stephen ai-industry v70 87KB 5 主增量 = OpenAI DevDay 完整公告包 + TLDR AI 24h 2 头条级净变 + NVIDIA Open Agent Safety Platform + HF Daily 立标池第 14 次确认 + Anthropic Claude ART 酶系统 950 个 Agent 21 小时 + work-queue 10-2 08:00 = Top 15 = 4 件 ai-industry 主轴命中 = Endless Exam + RoPE + DyRAD + RAGScope + 8 项 P0/P1 待人工确认) |
极高 ⭐⭐⭐⭐⭐(承接棒位 + spark 主棒位第 10 日缺口已闭合 + work-queue 10-2 4 件 ai-industry 主轴命中 = Endless Exam + RoPE + DyRAD + RAGScope) |
| inbox/stephen | 2026-10-02-ai-industry-e1prep.md(10:20 · 87KB · v70 · 5 主增量) |
极高 ⭐⭐⭐⭐⭐(OpenAI Dots 常驻个人 Agent + NVIDIA Open Agent Safety Platform + Anthropic Claude ART 950 Agent 21h 自主科学发现) |
| inbox/stephen | 2026-10-02-0910-news-x-vip-radar.md(09:10 · 5.3KB · OpenAI DevDay 完整公告包 + GPT-6.1 Sol 1/5 价格 + NVIDIA Open Agent Safety Platform + Anthropic Claude ART 酶 950 Agent + Gemini 4 Argon + GLM-5.3) |
极高 ⭐⭐⭐⭐⭐(frontier lab 三连击 + Microsoft 小模型无需蒸馏 Agent + Anthropic ART 950 Agent 21h + LangChain State of AI Agents 2026 71.5% tracing 协同) |
| inbox/stephen | 2026-10-02 1004-1006 news + yt-anthropic + yt-openai(7-9 件 news/yt + 6 件 RSS 沿用) |
高 ⭐⭐⭐(Anthropic ART 950 Agent 21h + Microsoft 小模型 Agent 路径 + GLM-5.3 网络能力扩散 12% 沿用) |
| inbox/spark | 2026-10-01-agent-e1prep.md(13:35 · 55KB · 6 主增量 = Org-Agent + LibraryDesignBench + Periodic Weak Spots + Salesforce harness + flyp coding-agents 9-30 闭合 + 立标池顶部重排第 4 日 · 已锚定 v107) |
极高 ⭐⭐⭐⭐⭐(v107 已锚定,本棒位 v107 承接基线) |
| inbox/spark | 2026-10-01-llm-infra-e1prep.md(18:45 · 61KB · 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬ · 6 主增量 = vLLM 官方博客三篇 + Dynamo 1.0 GA + HelixML 缓解 + Particula Tech + TGI 2026-03-21 + MCP Stateless) |
极高 ⭐⭐⭐⭐⭐(v3.49 evening 升档棒承接基线 · frontier lab 推理基础设施范式转换预备级第 1 例承接延续) |
| inbox/spark | 2026-10-02-agent-e1prep.md(13:30 · 65KB · 8 主增量 = False Frontiers + EVOKE + Safety of Latent Communication + DAGent + MILO + Training LLM Judges + Meta-Harness 6× + frontier lab 三连击) |
极高 ⭐⭐⭐⭐⭐(v3.49 evening 升档棒承接基线 · agent 主轴 51h 8 主增量 = 7 件 agent 主分类 NET-new paper_card + 2 件邻接 evaluation/engineering 主 + 3 件 frontier lab Agent 信号 + 1 件 Meta-Harness 6×) |
| inbox/spark | 2026-10-02 1001-1005 RSS(3 RSS 速记 = gradient-flow + chip-huyen + yt-3blue1brown) |
低(沿用) |
| paper_cards 10-2 morning | 1609-2609-39929 RoPE at the End of Its Rope · ✓ 主分类 llm-infra · method |
NET-new ⭐⭐⭐(本次承接新增唯一 llm-infra 主分类:RoPE 位置编码长上下文失效诊断 = 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位) |
| paper_cards 10-2 morning | 1601-2609-39982 Mid-Harness · ✓ 主分类 evaluation · method |
承接(v107 已锚定) |
| paper_cards 10-2 morning | 1602-2609-39102 False Frontiers · ✓ 主分类 agent · method |
承接(agent-e1prep 已锚定) |
| paper_cards 10-2 morning | 1603-2609-39903 OSWorld-Science · ✓ 主分类 evaluation · benchmark · 副 agent |
承接 |
| paper_cards 10-2 morning | 1604-2609-40316 循环 MoE 规模定律 · ✓ 主分类 engineering · method · 邻接 llm-infra |
承接(v3.49 evening 已锚入 1604) |
| paper_cards 10-2 morning | 1605-2609-38660 Breaking Babel · ✓ 主分类 agent · method |
承接 |
| paper_cards 10-2 morning | 1606-2609-38334 EVOKE · ✓ 主分类 agent · application |
承接 |
| paper_cards 10-2 morning | 1607-2609-33355 Unmask the State · ✓ 主分类 multimodal · position · 副 llm-infra |
承接(v3.49 evening 已锚入 1607) |
| paper_cards 10-2 morning | 1608-2609-39075 RAGScope · ✓ 主分类 rag · application |
承接(tom 10-2 rag-e1prep R108 已锚入) |
| paper_cards 10-2 morning | 1610-2609-39841 DyRAD · ✓ 主分类 evaluation · benchmark · 副 multimodal |
承接 |
| paper_cards 10-2 morning | 1611-2609-39788 Safety of Latent Communication · ✓ 主分类 agent · method |
承接 |
| paper_cards 10-2 morning | 1612-2609-36333 ATLAS · ✓ 主分类 agent · method |
承接 |
| paper_cards 10-2 morning | 1613-2609-37863 MIST · ✓ 主分类 multimodal · method |
承接 |
| paper_cards 10-2 morning | 1614-2609-24555 The Endless Exam · ✓ 主分类 evaluation · position |
承接 |
| paper_cards 10-2 morning | 1615-2609-32600 CUA-SWE · ✓ 主分类 agent · benchmark |
承接 |
| paper_cards 10-2 morning | 1616-1502-02761 沿用(v3.45 已锚入) |
承接 |
| paper_cards 10-2 morning | 1617-2609-38792 Training LLM Judges from Language Feedback · ✓ 主分类 engineering · position |
承接 |
| paper_cards 10-2 morning | 1618-2609-39154 DAGent · ✓ 主分类 agent · method |
承接 |
| paper_cards 10-2 morning | 1619-2609-38349 MILO · ✓ 主分类 evaluation · method · 副 agent |
承接 |
| paper_cards 10-2 morning | 1620-2609-38658 Tacit-TTS · multimodal |
承接 |
| paper_cards 10-2 morning | 1621-2609-38597 PixelUMM · multimodal |
承接 |
| paper_cards 10-2 morning | 1622-2609-34274 BIABench · agent · benchmark |
承接 |
| paper_cards 10-2 morning | 1623-2609-30840 RWTD · benchmark |
承接 |
| paper_cards 10-2 16:30 | 1624-2610-01936 Mapping the RAG Landscape · rag · survey |
承接(work-queue Top 15) |
| paper_cards 10-2 16:30 | 1625-2610-01871 Walking the Embedding Space · rag · method |
承接 |
| paper_cards 10-2 16:30 | 1626-2610-02196 InterEvolve · engineering · method |
承接 |
| paper_cards 10-2 16:30 | 1627-2610-00544 Memorizon · engineering · method · 副 multimodal |
承接 |
| paper_cards 10-2 | 1628-2609-38886 Benchmarking Skill-Level Memory · agent |
承接 |
| paper_cards 10-2 | 1629-2609-38987 Smaller Models Better Rejects · engineering |
承接 |
| paper_cards 10-2 | 1630-2609-32259 Prefill-Free Cross-Family KV Cache Transfer · engineering |
承接(注意:work-queue Top 15 #2 · arXiv:2609.32259 "Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous" = 与 v3.49 evening §1.(3) KV Cache 14 件完整图谱邻接级承接) |
| paper_cards 10-2 | 1631-2609-33403 DataMagic · engineering |
承接 |
| work-queue 10-2 08:00 | Top 15 / 共 8 件 = 2609.33403 DataMagic + 2609.32259 Prefill-Free Cross-Family KV Cache Transfer + 2609.38987 Smaller Models Better Rejects + 2609.38886 Benchmarking Skill-Level Memory + 2610.00544 Memorizon + 2610.02196 InterEvolve + 2610.01871 Walking the Embedding Space + 2610.01936 Mapping the RAG Landscape · 选题榜未成视频脚本 1 件 = 2609.39982 Mid-Harness · 1 件与 llm-infra 强邻接:2609.32259 Prefill-Free Cross-Family KV Cache Transfer(已入库 1630) |
高(1 件 llm-infra 强邻接:Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference = 跨族 KV Cache 异构推理传输 = v3.49 evening §1.(3) KV Cache 14 件完整图谱邻接级承接 = v3.50 morning 候选预备新增) |
已检查但未发现 llm-infra 主分类 paper_card 净增(除 RoPE at the End of Its Rope 1609 = 1 件 NET-new)+ Prefill-Free Cross-Family KV Cache Transfer 1630 = 1 件 engineering 邻接 NET-new):tom 10-2 0840 radar 高价值 #1-#4(RAGScope 1608 + MILO 1619 + DAGent 1618 + Training LLM Judges 1617 + BIABench 1622 + Tacit-TTS 1620 + PixelUMM 1621 + RWTD 1623 8 候选)+ jay 10-2 1220 csdn-substack(Rogue AI Agents + Boosting Agentic Coding with LLM Retries 邻接)+ jay 10-2 1140 news-x-tech-radar(Microsoft 小模型无蒸馏 Agent + SWE-bench 2026.02 评测设计局限 + ExtractBench + Agentic Retrieval Harness LlamaIndex)+ jay 10-2 engineering 7 主增量(推理引擎 2026 秋季 + Vector DB 2026 + Meta-Harness 6× + HF State of Open Models + ICML 2026 复现 + Harness Engineering + Lilian Weng Harness RSI)+ jay 10-2 csdn-rag-agent-harness(Harness Engineering + Hermes Agent 三模块 + RAG 四代 + Agentic RAG 3.0 动态决策 + Agent 演进减少 LLM 思考次数)+ flyp 10-2 multimodal-e1prep(MILO + DAGent 邻接承接延续 + AutoRef multimodal 副 agent)+ flyp 10-2 critical-read-ReaLVR(多模态 Agent 反思级接驳)+ stephen 10-2 noon 协调棒位(frontier lab Agent 信号三连击)+ stephen 10-2 ai-industry v70(OpenAI Dots + NVIDIA Safety Platform + Anthropic ART)+ spark 10-2 agent-e1prep 65KB v3.49 evening 承接基线 + spark 10-1 llm-infra-e1prep(llm-infra 主棒位承接)+ inbox/spark 10-2 三件 RSS(全部沿用第 7 日 ⚠⚬)+ paper_cards 10-2 morning 28 件入库清单(含 1628-1631 4 件 evening 入库 + 1630 Prefill-Free Cross-Family KV Cache Transfer = work-queue Top 15 #2 与 llm-infra 强邻接)+ work-queue 10-2 08:00 Top 15 共 8 件(其中 1 件 Prefill-Free Cross-Family KV Cache Transfer 2609.32259 + 1 件 Memorizon 2610.00544 + 1 件 InterEvolve 2610.02196 = llm-infra 邻接 3 件)。
二、增量条目(5 主增量 + 1 承接稳态精修预备级锚定)
增量 1:arXiv 2609.39929 · RoPE at the End of Its Rope · RoPE 位置编码长上下文失效的理论、诊断与缓解(⭐⭐⭐)
来源:
- organized/paper_cards/1609-2609-39929.md(入库时间 2026-10-02 morning CST · 主分类 llm-infra · method · 来源 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json)
- inbox/tom/2026-10-02-rag-e1prep.md §增量 2(R108 强邻接 = §2.6 运行时 RoPE 位置编码失效 + §2.5 评测 长上下文 RAG 检索稳定性维度)
- inbox/tom/2026-10-01T2040-agent-rag-longcontext-radar.md 高价值条目 #2
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md(承接,work-queue Top 15 #2)
URL:http://arxiv.org/abs/2609.39929v1
要点:
核心问题
RoPE 内在 trade-off——维持稳定 token 偏好(stable token preferences)vs 区分相近位置(distinguishing nearby positions);prior theory 假设各频率下 query-key scale 相等 = 与实际不符。
核心方案
- 放宽 prior theory 假设:允许 RoPE 各频率下 query-key scale 不一致 → 与实际经验观测高度吻合
- 理论使得上述脆弱性对单个注意力头与输入可测量
- 量化高频分量 vs 低频分量的不同作用:高频分量支持位置敏感性,低频分量支持远程依赖——二者不可兼得是 RoPE 长上下文失效的根因
工程意义
- 与 v3.49 evening Periodic Weak Spots(1609-2609-36322)形成"位置编码 + KV cache 压缩"双栖位预备级补强
- 对 RAG 长上下文检索质量的风险诊断:RoPE 位置编码失效意味着长上下文窗口的检索质量不稳定——在特定上下文长度(phase boundary)会出现检索退化
- 对 RAG chunk 策略的警示:chunk 边界若落在 RoPE 失效区间,会系统性丢失检索信号
- RAG 检索质量在依赖向量匹配的同时,底层 LLM 的位置编码能力直接影响检索质量——长上下文 RAG 的上限受 RoPE 限制
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + §1.(6) 长上下文沿用稳态(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607)→ RoPE 位置编码失效 = KV Cache 系统级优化第六维警示预备级补强 = 与 Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位 - 承接 v3.48 morning §1.(6) 长上下文沿用稳态(v3.42 vLLM 分层 KV Cache Offloading + v3.44 vLLM AgentX Mooncake Store + v3.45 morning Fluid-Guided arXiv 2504.11320v4 + v3.46 morning KVSET 2609.27746 + v3.47 morning DISCO 2609.33485 + Pareto Atlas 2609.17863)→ RoPE 位置编码理论深化 v3.49 evening 已锚定的 Periodic Weak Spots phase sensitivity(2609.36322 = "Chunked KV-Cache 压缩相位敏感性")理论根因 - 承接 v3.47 morning §1.(3) KV Cache Reuse 精度损失被系统性低估(2609.31415 · D198/D200/D202 实证补强)→ RoPE 理论进一步补强「KV Cache 优化系统性风险」
建议归入哪一节: - §1.(6) 长上下文 → 新增子条目「RoPE at the End of Its Rope · RoPE 位置编码长上下文失效理论、诊断与缓解 arXiv:2609.39929 = 长上下文位置编码失效理论根因预备级补强」 - §1.(3) KV Cache → 补充「Periodic Weak Spots 2609.36322 + RoPE 位置编码 2609.39929 = KV Cache 系统级优化第六维警示双栖位预备级补强」 - §3 争议 → D223 v3.50 候选 ⚠⚬:RoPE at the End of Its Rope 的 mitigation 缓解方案效果未在 TLDR 披露(理论诊断清晰,工程化缓解措施未在 TLDR 中体现 = 是否已有可行的 RoPE 失效缓解措施,还是仍在理论阶段 = 待原文核实) - §4 开放问题 → O541 v3.50 候选:RoPE 位置编码失效是否在 v3.47 morning 已锚定的 Chunked KV-cache 压缩相位敏感性之外,影响长上下文检索质量?
增量 2:推理引擎格局 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache(⭐⭐⭐)
来源:
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §三(11:40)
- inbox/jay/2026-10-02-engineering-e1prep.md §增量 3(11:23)
- inbox/jay/2026-10-02-csdn-rag-agent-harness.md(08:20 · 沿用 CSDN RAG/Agent/Harness 工程综述)
- inbox/spark/2026-10-01-llm-infra-e1prep.md(18:45 · v3.49 evening 承接基线)
要点:
A. vLLM/SGLang/TGI/Mooncake 四方博弈 2026 秋季快照
| 引擎 | 定位 | 关键数据 |
|---|---|---|
| vLLM | 生产首选 · PagedAttention · 极高并发(continuous batching) · OpenAI 兼容 · 生产适用性最高 | vLLM v0.15.1(2026 年 2 月):支持 PyTorch 2.10、RTX Blackwell (SM120)、H200 优化 |
| SGLang | Agent 场景差异化 · RadixAttention 的 prefix caching 机制 · 多 Agent 共享长 prompt prefix 时吞吐远高于 vLLM | 已在 400,000+ GPU 上部署(v3.49 evening 已锚入 v3.48 morning 沿用稳态) |
| TGI | 进入维护模式(2025.12) · 不再接受新功能 | 标志推理框架进入洗牌期(v3.49 evening §1.(1) 推理引擎已锚入 v3.47 morning TGI 2026-03-21 进入维护 + 2026-09-05 README 正式确认;本棒位承接 + jay 10-2 标定 TGI 进入维护模式时间精度为 2025.12——与 v3.49 evening 沿用的 2026-03-21 存在 4 个月精度差异,需核实 v3.49 evening 表述是否需更新) |
| Mooncake | 解绑 KV Cache · disaggregated KV pool 架构 · 跨 vLLM 实例共享 KV cache · 解决多副本重复 prefix 问题 | Agent 场景的下一代基础设施方向(v3.49 evening §1.(3) KV Cache 已锚入 Mooncake 2026-02 加入 PyTorch Ecosystem + Transfer Engine 进入 TensorRT-LLM + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector;本棒位承接 + 新增 Mooncake disaggregated KV pool 跨 vLLM 实例共享 = Agent 场景下一代基础设施方向) |
B. 引擎定位框架(jay 10-2 engineering 增量 3)
- 「Ollama 是入口,vLLM 是出口」
- 并发请求超过个位数、P99 延迟敏感时,必须迁移 vLLM
C. H200/B200 可用性
- 主流云厂商均已上线
- 带宽是 H100 的 2 倍
- 适合大批量推理
D. ⚠ 关键警示:TGI 进入维护模式时间精度矛盾
- jay 10-2 engineering §增量 3 标定 TGI 进入维护模式(2025.12)
- v3.49 evening §1.(1) 沿用 TGI maintenance mode 2026-03-21 + 2026-09-05 README 正式确认(jay 9-30 0935 + daily-brief + llm-inference-vector-db 三源交叉验证)
- D212 v3.50 候选 ⚠⚬⚬:TGI 进入维护模式时间精度新矛盾(jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异)
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(vLLM 官方博客三篇 + Dynamo 1.0 GA + SGLang HelixML + SGLang PR #36513 + Particula Tech + VRLA Tech + TGI maintenance mode 2026-03-21 锚定)→ v3.50 候选承接预备:推理引擎 2026 秋季快照 + TGI 退出明确化(2025.12 vs 2026-03-21 精度矛盾)+ SGLang 400,000+ GPU 部署规模 + Mooncake disaggregated KV pool 跨 vLLM 实例共享 = Agent 场景下一代基础设施方向 - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱沿用稳态(CDB 2608.09444 + KV-Reuse 2609.31415 + KVSET 2609.27746 + Continnum 2511.02230 + TokenDance 2604.03143 + PolyKV 2604.24971 + Edge Q4 KV 2603.04428 + C2C 2510.03215 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + Internet for KV Cache 2608.01526 + Cache Replacement 2609.28870 + PAGE Eviction 2609.22157 + Dynamic Flow Static Graph 2609.34727 + Who Pays for KV Cache 2609.24991 + VeriCache 2605.17613 + ECHO OSDI 2026 + KVTC 2511.01815 ICLR 2026 + Periodic Weak Spots 2609.36322 + HotInfra 2026 CXL + Qdrant P99 6ms 50M)第 7 维预备级补强 = Mooncake disaggregated KV pool 跨 vLLM 实例共享 + arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference(work-queue Top 15 #2 · paper_card 1630 已入库)= 跨族 KV Cache 异构推理传输 = 2026 Q4 KV Cache 异构跨族传输预备新增 - 承接 v3.49 evening §1.(10) 顶会部署沿用稳态(SGLang/vLLM/TRT-LLM H100 Benchmark 2026 + Particula Tech + VRLA Tech + jay 9-30 三源)→ v3.50 候选承接预备:vLLM/SGLang/TGI/Mooncake 四方博弈 2026 秋季快照 + SGLang 已在 400,000+ GPU 部署 = 顶会部署六源数据完整对齐第七源 - 承接 v3.49 evening §1.(11) Kernel/AI 自动化/Harness(MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus + Meta-Harness 6×)→ v3.50 候选承接预备:Harness Engineering 战略价值升级 = v3.49 evening §1.(11) 第四源预备新增
建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「推理引擎 2026 秋季快照 · vLLM 生产首选 + SGLang Agent 场景差异化(400,000+ GPU) + TGI 退出明确化(2025.12 vs 2026-03-21 精度矛盾)+ Mooncake 解绑 KV Cache = 四方博弈完整格局」 - §1.(3) KV Cache → 新增「Mooncake disaggregated KV pool 跨 vLLM 实例共享 KV cache + arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference = 2026 Q4 KV Cache 异构跨族传输预备新增」 - §3 争议 → D224 v3.50 候选 ⚠⚬⚬:TGI 进入维护模式时间精度新矛盾(jay 10-2 = "2025.12" vs v3.49 evening = "2026-03-21 进入维护 + 2026-09-05 README 正式确认" = 4 个月差异 · 需查阅 HuggingFace 官方公告原文核实)
增量 3:Vector DB 基准格局 2026 + 混合搜索全面胜出 + Qdrant p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快(⭐⭐)
来源:
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §四(11:40)
- inbox/jay/2026-10-02-engineering-e1prep.md §增量 4(11:23)
要点:
A. 基准数据(1M 向量,HNSW 调优后)
| 数据库 | p50 | p99 | QPS | 备注 |
|---|---|---|---|---|
| Qdrant | ~2.1ms | ~6.3ms | ~1,200 | 开源最快(v3.49 evening 已锚入 Qdrant P99 6ms 50M 向量实测;本棒位承接 + 1M 向量 p50 2.1ms 第七源数据对齐) |
| Pinecone | ~10ms | — | — | 托管体验最佳 |
| Weaviate | ~16ms | — | — | 混合搜索最成熟 |
| Milvus | ~18ms | — | — | 亿级向量 |
| pgvector | ~25-40ms | — | — | Postgres 集成 |
| Chroma | ~30ms | — | — | DX 好,非低延迟优化 |
B. 2026 年生产关键结论
- 纯向量搜索在生产中表现不如混合搜索(向量 + BM25 + 元数据过滤器)
- 因为 Agent 需要精确匹配专有名词、版本号、ID 等场景,纯语义检索不够用
- 混合搜索是必选项(纯向量搜索不够用)
C. 选型决策框架(jay 10-2 engineering 增量 4)
- 零运维托管 → Pinecone
- 追求开源性能和成本控制 → Qdrant
- 已有 PostgreSQL 栈且向量 <100M → pgvector + pgvectorscale
- 必须混合搜索 → Weaviate 或 Qdrant(native hybrid)+ Vespa
- 亿级向量且需要低成本 → Milvus / Zilliz Cloud
D. Agent 记忆 + 多租户
- 混合搜索是必选项,纯向量搜索不够用
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱沿用稳态(Qdrant P99 6ms 50M 向量实测 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + KVTC ICLR 2026 + Periodic Weak Spots + py-kvcache 5 项关键技术 + py-kvcache 6 关键技术列表)→ v3.50 候选承接预备:Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 第七源数据对齐 + 混合搜索全面胜出 - 承接 v3.48 §1.(10) 顶会部署沿用稳态(SGLang/vLLM/TRT-LLM H100 Benchmark 2026 + Particula Tech + VRLA Tech + jay 9-30 三源)→ v3.50 候选承接预备:Vector DB 2026 选型决策框架 + 混合搜索必胜结论 = Vector DB 选型预备新增 - 承接 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + py-kvcache 5 项关键技术 + vLLM 分层 KV Cache Offloading + LMCache + Mooncake + HotPrefix 形成「KV Cache 系统级优化第六维卸载层级」 → v3.50 候选承接预备:Vector DB 2026 选型决策框架 + 混合搜索 = v3.49 evening §1.(11) Kernel/AI 自动化/Harness 第五源预备新增锚定
建议归入哪一节: - §1.(3) KV Cache → 新增「Vector DB 2026 选型决策框架 · Qdrant 开源最快(1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200)+ 混合搜索全面胜出 = Agent 记忆/多租户生产场景的必选路径」 - §1.(11) Kernel/AI 自动化/Harness → 新增「Vector DB 2026 选型决策框架 = v3.49 evening §1.(11) Kernel/AI 自动化/Harness 第五源预备新增」 - §1.(10) 顶会部署 → 新增「Vector DB 2026 选型决策框架 = v3.49 evening §1.(10) 顶会部署 Vector DB 维度预备新增」
增量 4:Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化(⭐⭐⭐)
来源:
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §五(11:40 · 来源 Nathan Benaich Substack State of AI: April 2026)
- inbox/jay/2026-10-02-engineering-e1prep.md §增量 5 + §增量 7(11:23)
- inbox/jay/2026-10-02-csdn-rag-agent-harness.md(08:20 · Hermes Agent Harness 三模块)
- inbox/spark/2026-10-02-agent-e1prep.md §增量 7(13:30 · Harness Engineering 八栖位预备扩增稳态)
要点:
A. Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)
- 核心发现:同一 LLM 固定,只改变 harness(决定模型每步看到什么信息、如何存储和检索)可以产生 6 倍性能差距
- Meta-Harness 实现路径:给 Agent 提供原始执行迹(最多 10M token 诊断信息)而非压缩摘要,实现 text classification +7.7 分
- 战略价值:Agent 系统性能瓶颈不在模型本身,而在 harness 的设计 → 2026 年 Agent 平台(Dify、LangGraph、AutoGen)差异化的核心战场
B. Lilian Weng Harness 自我改进(RSI)工程化
- 递归自我改进(RSI) 概念追溯到 I. J. Good(1965)
- Harness 工程使 Agent 的自改进从理论走向系统化工程实践
- 文章覆盖 test-time compute 分配、self-verification 机制、RSI 的工程可行性
C. Hermes Agent Harness 三模块
- Prompt Harness + Context Harness + Tool Harness
- 含自进化机制(Self-Evolution)和 RAG 功能集成
- 传统 Prompt Engineering 的生产局限性:稳定性不足、可维护性差、缺乏自进化能力
- Harness Engineering 将 Agent 组件标准化和配置化管理
D. Sebastian Raschka 控制 LLM 推理力度
- LLM 如何学习低、中、高推理力度模式
- 与 Mid-Harness(test-time compute 分配动作可靠性)在主题上高度相关
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(11) Kernel/AI 自动化/Harness 沿用稳态(MCP 2026-07-28 Stateless 三大变更 + 包体积 -83% 速度 +25% + 已部署 10,000+ MCP servers + 月 SDK 下载 97M+ + Salesforce Headless 360 处理 450 万次调用 + py-kvcache 5 项关键技术 + Nereus arXiv 2609.34645)→ v3.50 候选承接预备:Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 + Harness Engineering 战略价值从工程实践升级到平台差异化核心战场 - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + 包体积 -83% 速度 +25% Manufact Cloud 实测 → v3.50 候选承接预备:Meta-Harness 6× 性能差距 = MCP Stateless 协议层三大变更落地证据 + Harness Engineering 战略价值跃升预备新增 - 承接 v3.49 evening §1.(11) Harness Engineering 5 项 P0 风险 + Project Swap + Claude N=4 SYM + Gemini 4 post-training + Linear Superposition 评测对照 + LRH Needs Group Action 双锚预备级 + Multi-Agent Harness 5 件 net-new + Rufus-Air 8 阶段 vs MOPD vs WHALE 联合优化 vs Yoonho Lee custom harness 实现差异对照 + frontier lab 模型权重 SBOM 范式迁移的具体实施细节争议 → v3.50 候选承接预备:Meta-Harness 6× + Lilian Weng Harness RSI + Hermes Agent Harness 三模块 = Harness Engineering 第六源预备新增锚定预备级
建议归入哪一节: - §1.(11) Kernel/AI 自动化/Harness → 新增子条目「Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)+ Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 = Harness Engineering 战略价值从工程实践升级到平台差异化核心战场」 - §3 争议 → D225 v3.50 候选 ⚠⚬⚬:Meta-Harness 6× 性能差距数据(Nathan Benaich Substack 引用)需查阅原论文核实——实验设置、baseline 选择、任务类型均未详——标注 ⭐⭐⭐⭐ 核实优先级 - §4 开放问题 → O542 v3.50 候选:Harness Engineering 战略价值升级是否影响 v3.48 morning §1.(11) 已锚定的 MCP Stateless 三大变更 + 已部署 10,000+ MCP servers 的工程化推进节奏?
增量 5:ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构(⭐⭐)
来源:
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §二(11:40 · 来源 HF 官方)
- inbox/jay/2026-10-02-engineering-e1prep.md §增量 2(11:23)
要点:
A. 实验规模
- 1,221 名社区成员
- 2026 年 7 月 15 日至 8 月 2 日
- 6,816 份 Trackio 复现日志
- 涵盖 2,226 篇论文(占 ICML 2026 全部 6,352 篇的 34%)
- GLM-5.2 作为自动化 Judge 判定
B. 核心数据
- 51%(1,103 篇)至少一条 claim 被验证
- 23%(496 篇)至少一条 claim 被证伪
- 242 篇出现独立团队相互否定(adversarial disagreement)
- 266 篇完全复现
C. 关键洞察
- 可复现性是对抗性的而非二元的:完全可复现与完全不可复现之间存在大量灰色地带
- 审稿人没有时间验证证明:官方 spotlight 论文审稿意见明确承认"My low confidence score is because I did not check all the proofs carefully",该论文最终被证伪
- AI Agent 正在改变科研验证的成本结构:过去一名审稿人花一个周末仔细检查一篇论文;AI Agent 可以并行地、同时检查数千篇,审查速度第一次被规模化
- 自引用问题:参与者倾向于验证与自己立场一致的论文,需要对抗性验证机制(adversarial re-verification)来平衡
D. 数据集
- 274 份完整 Agent Trace 数据集 发布于 HF,供复现使用
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(v3.42 Inference Control Plane + v3.45 InferenceBench + v3.46 Continnum + v3.47 morning DISCO 2609.33485 + v3.47 morning G²PTQ 2609.31009 + v3.47 morning Pareto Atlas 2609.17863)→ v3.50 候选承接预备:ICML 2026 复现实验 2,226 篇论文 + 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 = v3.49 evening §1.(1) 推理引擎方法学第十元组预备新增 - 承接 v3.47 morning §1.(1) Inference Control Plane 4 条设计原则(arXiv 2609.23130)→ v3.50 候选承接预备:ICML 2026 复现实验 = Inference Control Plane + AI Agent 驱动评测规模化 = 评测方法学第九元组预备扩位候选 - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + 包体积 -83% 速度 +25% + 已部署 10,000+ MCP servers → v3.50 候选承接预备:ICML 2026 复现实验 = AI Agent 改变科研验证成本结构 + Harness Engineering 战略价值跃升双栖预备新增锚定预备级
建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 = 评测方法学第九元组预备扩位候选」 - §1.(11) Kernel/AI 自动化/Harness → 新增「ICML 2026 复现实验 + Harness Engineering 战略价值跃升双栖预备新增锚定预备级」 - §3 共识 → C329 v3.50 候选:ICML 2026 复现实验 = 评测方法学"AI Agent 驱动评测规模化"预备扩位候选 = 与 v3.48 morning 立标 13 "Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式"形成双栖承接
增量 6:HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B(承接稳态精修预备级锚定 ⭐⭐)
来源:
- inbox/jay/2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md §一(11:40 · 来源 HF 官方年度生态系统报告)
- inbox/jay/2026-10-02-engineering-e1prep.md §增量 1(11:23)
要点:
A. Hub 规模里程碑
- 模型仓库 243 万→296 万
- 数据集 71.1 万→100 万
- Spaces 100 万→144 万
B. 极端长尾分布
- 85.6% 的模型累计下载量 <200 次
- 1.5% 的仓库贡献 99.2% 的下载量
C. Qwen 已成为社区事实标准底座
- 2026 年前 7 个月,Qwen 衍生模型以每天 180–210 个新仓库的速度增长
- 开发者已将 Qwen 作为微调和部署的默认选择
D. Attention ≠ Adoption(关注度≠使用量)
- 2026 年发布的模型无一进入下载量 Top 25
- Top 25 下载量中有 13 个是 2022 年发布的模型
- all-MiniLM-L6-v2 在 7 个月内被下载 15.5 亿次
E. 中国模型规模远超美国
- 中国实验室月度最大模型参数 754B–2.78T
- 美国除 NVIDIA Nemotron 3 Ultra 561B 外均 <130B
F. Agent 是新的用户
- 多模态、工具调用、长记忆等能力需求激增
- Agent 场景成为模型能力主要驱动力
与活文档 knowledge/llm-infra.md v3.49 evening 现有脉络的关系: - 承接 v3.49 evening §1.(1) 推理引擎沿用稳态(Qwen 国产模型 + v3.49 morning 已锚定 vLLM/SGLang 双寡头 + 国产 MoE + 国产硬件 + 推理引擎混合部署架构)→ v3.50 候选承接预备:HF State of Open Models Summer 2026 + Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B - 承接 v3.48 morning §1.(11) MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus → v3.50 候选承接预备:Qwen 社区事实标准底座 + Agent 是新的用户 = 2026 Q4 推理引擎生态上游预备新增
建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「HF State of Open Models Summer 2026 · Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 + 中国模型规模 754B-2.78T vs 美国 <130B = 2026 Q4 推理引擎生态上游预备新增」 - §1.(11) Kernel/AI 自动化/Harness → 新增「Qwen 社区事实标准底座 + Agent 是新的用户 = 2026 Q4 推理引擎生态上游预备新增」
三、值得警惕的矛盾或待核实说法
⚠⚬ D223 · RoPE at the End of Its Rope 的 mitigation 缓解方案效果未在 TLDR 披露
矛盾描述:RoPE at the End of Its Rope(2609.39929)声称"理论、诊断与缓解"(Theory, Diagnosis, and Mitigation),但 TLDR 截断后缓解方案(mitigation)内容几乎完全缺失——是否已有可行的 RoPE 失效缓解措施,还是仍在理论阶段?
风险等级:低-中
处置建议:仅引用"理论诊断"部分(RoPE trade-off 是长上下文检索不稳定的根因);不引用"缓解"相关内容;v3.50 morning 候选承接时建议独立第三方复现测试 + 查阅原文 mitigation 章节。
⚠⚬⚬ D224 · TGI 进入维护模式时间精度新矛盾(jay 10-2 vs v3.49 evening)
矛盾描述:jay 10-2 engineering §增量 3 标定 TGI 进入维护模式(2025.12);v3.49 evening §1.(1) 沿用 TGI maintenance mode 2026-03-21 + 2026-09-05 README 正式确认(jay 9-30 0935 + daily-brief + llm-inference-vector-db 三源交叉验证)——4 个月差异。
风险等级:中
处置建议:v3.50 morning 候选承接时建议查阅 HuggingFace 官方公告原文核实 TGI maintenance mode 起始时间;两种可能:① jay 10-2 标定错误("2025.12" 应为 "2026-03-21");② v3.49 evening 沿用时间精度错误("2026-03-21" 应为 "2025.12");③ 真实存在两个不同时间节点(2025.12 进入 deprecation 公告 + 2026-03-21 进入实际 maintenance + 2026-09-05 README 正式确认)。
⚠⚬⚬ D225 · Meta-Harness 6× 性能差距数据需查阅原论文核实
矛盾描述:Nathan Benaich Substack 引用 Meta-Harness 论文称"同一 LLM 固定,只改变 harness 产生 6× 性能差距,text classification +7.7 分,10M token 诊断信息"——该数据需查阅 Meta-Harness 原论文核实,包括实验设置、baseline 选择、任务类型等细节。标注 ⭐⭐⭐⭐ 核实优先级。
风险等级:中
处置建议:v3.50 morning 候选承接时建议查阅 Meta-Harness 原论文 + 6× 性能差距实测 + 10M token 诊断信息可行性 + 与 v3.48 morning §1.(11) 已锚定的 Multi-Agent Harness 5 件 net-new 形成"Harness Engineering 第七源预备扩增稳态"。
⚠⚬ D226 · ICML 2026 复现实验 51% claim 验证 23% claim 证伪 · GLM-5.2 作为自动化 Judge 待核实
矛盾描述:ICML 2026 复现实验使用 GLM-5.2 作为自动化 Judge 判定 6,816 份 Trackio 复现日志——GLM-5.2 Judge 准确率、跨领域泛化性、潜在 Judge 偏差均未在 HF 官方报告中详尽披露。
风险等级:低-中
处置建议:v3.50 morning 候选承接时建议查阅 HF 官方报告原文 + GLM-5.2 Judge 评估方法学 + 274 份 Agent Trace 数据集实测。
沿用 D1-D222 v3.49 evening 全部稳态(含 D219-D222 v3.49 evening 新增 4 件)
- D219 ⚠⚬ Periodic Weak Spots phase sensitivity 实证数据是否在生产环境可重现
- D220 ⚠⚬⚬ NVIDIA Dynamo SLA-Based Planner 实际效果待核实
- D221 ⚠⚬⚬ HotInfra 2026 CXL vs GPU HBM CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证
- D222 ⚠⚬⚬ MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / Salesforce 450 万次调用)需溯源到 Anthropic / Manufact 官方报告原文
- 沿用闭合 = D1-D226(含 D223-D226 v3.50 候选新增 4 件)
沿用 D212 v3.48 morning 警示:TGI 退场时间精度矛盾(本棒位 D224 新增承接)
- D224 v3.50 候选 = D212 v3.48 morning 矛盾 + jay 10-2 engineering 增量 3 新数据点的矛盾升级版本
四、可引用 arXiv 号列表
| arXiv | 论文 | 与 llm-infra 主题关系 | 成熟度 |
|---|---|---|---|
| 2609.39929 | RoPE at the End of Its Rope? Theory, Diagnosis, and Mitigation of Long-Context Failures | ⭐⭐⭐ 主分类 llm-infra · method · 与 v3.49 evening Periodic Weak Spots 形成"位置编码 + KV cache 压缩"双栖位预备级补强 | 新(2026-09,paper_card 1609 10-2 入库) |
| 2609.32259 | Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference | ⭐⭐ 主分类 engineering · method · 邻接 llm-infra · work-queue Top 15 #2 · paper_card 1630 已入库 · 跨族 KV Cache 异构推理传输 = 2026 Q4 KV Cache 异构跨族传输预备新增 | 新(2026-09,paper_card 1630 10-2 evening 入库) |
| 2609.33697 | TTT-Discover · Learning to Discover at Test Time | 工程主轴承接 · RL 训练 LLM 解决单一测试问题 = 推理时学习 | 新 |
| 2609.40316 | Loop Scaling Laws | v3.49 evening §1.(1) 推理引擎 + §1.(8) 训练 = Loop transformer + MoE 联合稀疏缩放律 | 已锚入 v3.49 evening |
| 2609.36636 | LoopLMs | v3.49 evening §1.(5) 投机解码 = LoopLM 推理计算深度扩展路径 | 已锚入 v3.49 evening |
| 2609.36322 | Periodic Weak Spots | v3.49 evening §1.(3) KV Cache = Chunked KV-cache 压缩相位敏感性 | 已锚入 v3.49 evening |
| 2609.36314 | FRAC | v3.49 evening §1.(6) 长上下文 = 分数阶动力学 power-law 长记忆 SSM 新路径 | 已锚入 v3.49 evening |
| 2609.33355 | Unmask the State | v3.49 evening §1.(7) 多模态 + §1.(1) 推理 = MDM 推理策略五维度(副 llm-infra) | 已锚入 v3.49 evening |
| 2609.34645 | Nereus | v3.48 morning §1.(11) Kernel/AI 自动化/Harness + §1.(8) 训练 = LLM RL 后训练自适应并行 | 已锚入 v3.48 morning |
| 2609.39102 | False Frontiers | agent 主轴邻接 = 自演化搜索 Agent 共谋作弊诊断 | 新(agent-e1prep 已锚入) |
| 2609.38334 | EVOKE | agent 主轴邻接 = 激发 Agent 世界知识以实现可迁移决策 | 新(agent-e1prep 已锚入) |
| 2609.39788 | Safety of Latent Communication | agent 主轴邻接 = 多 Agent 潜在通信安全攻击 | 新(agent-e1prep 已锚入) |
| 2609.39154 | DAGent | agent 主轴邻接 = Evaluate-then-Grow 深度研究 Agent 规划 | 新(agent-e1prep 已锚入) |
| 2609.38349 | MILO | agent 主轴邻接 = Agent Harness 自动发现框架(主分类 evaluation · 副 agent) | 新(agent-e1prep 已锚入) |
| 2609.38792 | Training LLM Judges from Language Feedback | agent 主轴邻接 = Position-Selective Self-Distillation(主分类 engineering) | 新(agent-e1prep 已锚入) |
| 2609.39982 | Mid-Harness | evaluation 主 · 副 agent = Scaling Actions Between Model and Harness | 已锚入 v107 |
| 2609.39075 | RAGScope | rag 主分类 = RAG 幻觉分诊证据门控协议 | 新(tom rag-e1prep 已锚入) |
| 2609.37863 | MIST | multimodal 主分类 = VLM Judges 评估压力测试 | 新(agent-e1prep 已锚入) |
| 2610.00544 | Memorizon | engineering 主分类 · 副 multimodal = Streaming world models 长跨度训练(工作流 memory 系统级) | 新(work-queue Top 15) |
| 2610.02196 | InterEvolve | engineering 主分类 = Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation | 新(work-queue Top 15) |
| 2610.01871 | Walking the Embedding Space | rag 主分类 = Multimodal RAG 数据提取攻击 | 新(work-queue Top 15) |
| 2610.01936 | Mapping the RAG Landscape | rag 主分类 = Four Axis Taxonomy of Efficiency, Defense, Interactivity, and Reasoning | 新(work-queue Top 15) |
| 2608.09444 | Continuous Depth Batching (CDB) | v3.47 morning §1.(1) 推理引擎 | 已锚入 v3.47 morning |
| 2609.31415 | KV Cache Reuse | v3.47 morning §1.(3) KV Cache = 精度损失被系统性低估 | 已锚入 v3.47 morning |
| 2609.23130 | Inference Control Plane | v3.47 morning §1.(1) 推理引擎 = 4 条设计原则 | 已锚入 v3.47 morning |
| 2609.17863 | Pareto Atlas | v3.47 morning §1.(1) 推理引擎 = 54 锚点 · $18 | 已锚入 v3.47 morning |
| 2609.33485 | DISCO | v3.47 morning §1.(6) 长上下文 = 分布式长上下文扩展从 context rot 困境突破 | 已锚入 v3.47 morning |
| 2609.31009 | G²PTQ | v3.47 morning §1.(4) 量化 = GPTQ-based 量化统一框架 | 已锚入 v3.47 morning |
| 2609.26333 | DQ | v3.47 morning §1.(1) 推理引擎 = 首个量化层面 Prefill-Decode 解耦 | 已锚入 v3.47 morning |
| 2609.31397 | Intent2Tc | v3.47 morning §1.(2) 推理调度 = LLM 跨域网络流量控制 | 已锚入 v3.47 morning |
| 2511.01815 | KVTC | v3.49 evening §1.(3) KV Cache = ICLR 2026 录用 · 变换编码 | 已锚入 v3.49 evening |
| 2609.27746 | KVSET | v3.46 morning §1.(3) KV Cache | 已锚入 v3.46 morning |
| 2609.28870 | Cache Replacement | v3.47 morning §1.(3) KV Cache = Rethinking Cache Replacement For LLM Prefix Reuse | 已锚入 v3.47 morning |
| 2609.22157 | PAGE Eviction | v3.47 morning §1.(3) KV Cache = Partition-Aware Gated KV-Cache Eviction | 已锚入 v3.47 morning |
| 2609.24991 | Who Pays for KV Cache | v3.47 morning §1.(3) KV Cache = KV Cache 成本分析 | 已锚入 v3.47 morning |
| 2609.34727 | Dynamic Flow Static Graph | v3.47 morning §1.(3) KV Cache = Mobile NPU KV Cache Reuse | 已锚入 v3.47 morning |
| 2605.13734 | KVServe | v3.46 morning §1.(3) KV Cache = SIGCOMM 2026 | 已锚入 v3.46 morning |
| 2510.03215 | C2C | v3.46 morning §1.(3) KV Cache = ICLR 2026 | 已锚入 v3.46 morning |
| 2608.01526 | Internet for KV Cache | v3.45 morning §1.(3) KV Cache | 已锚入 v3.45 morning |
| 10.1145/3749168 | HotPrefix | v3.46 morning §1.(3) KV Cache = SIGCOMM 2026 | 已锚入 v3.46 morning |
| 2609.11744 | py-kvcache 工程综述 | v3.48 morning §1.(11) Kernel/AI 自动化/Harness = 5 项关键技术 + 6 关键技术列表(沿用) | 已锚入 v3.48 morning |
本轮 llm-infra 主题涉及 arXiv 号共 41 个(其中 1 件 llm-infra 主分类 NET-new:2609.39929 RoPE at the End of Its Rope · 1 件 engineering 邻接 NET-new:2609.32259 Prefill-Free Cross-Family KV Cache Transfer + 39 件其他主分类邻接/承接/沿用)。
五、相比 v3.49 基线的增量差异
v3.49 基线(2026-10-02 05:00 CST · §IX 108 evening 升档棒)已锚定 4 NET-new paper_card 主分类 llm-infra(Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607 副)+ 1 NET-new paper_card engineering 邻接(Loop Scaling Laws 1604)+ 0 NET-new arXiv/CVE/DOI/URL(精确闭合 438→438/36/15/571→571)+ 6 件承接稳态精修预备级锚定(NVIDIA Dynamo 5 大特性 + Dynamo 1.0 GA + NVIDIA Grove + FlashInfer Blackwell + llm-d CNCF GAIE EPP + KVTC ICLR 2026 + HotInfra 2026 CXL + Qdrant P99 6ms 50M + MCP 生产规模数据)+ 4 NET-new 矛盾/待核(D219-D222)。本轮在此基础上新增:
| 本轮新增 | 对应上下文 |
|---|---|
| arXiv 2609.39929 RoPE at the End of Its Rope(paper_card 1609 主分类 llm-infra) | 补充 v3.49 evening §1.(6) 长上下文 + §1.(3) KV Cache 14 件完整图谱 = "位置编码 + KV cache 压缩"双栖位预备级补强 |
| arXiv 2609.32259 Prefill-Free Cross-Family KV Cache Transfer(paper_card 1630 engineering 邻接 llm-infra) | 补充 v3.49 evening §1.(3) KV Cache 14 件完整图谱 = 跨族 KV Cache 异构推理传输预备新增 |
| 推理引擎 2026 秋季快照 + TGI 退出明确化 + Mooncake 解绑 KV Cache | 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 = 推理框架洗牌期明确化 + SGLang 400,000+ GPU 部署规模 + Mooncake disaggregated KV pool 跨 vLLM 实例共享 |
| Vector DB 2026 选型决策框架 + Qdrant 1M p50 2.1ms / p99 6.3ms / QPS ~1,200 | 补充 v3.49 evening §1.(3) KV Cache 14 件完整图谱 + §1.(10) 顶会部署 = Qdrant 第七源数据对齐 + 混合搜索全面胜出 |
| Harness Engineering 战略价值升级 · Meta-Harness 6× 性能差距 + Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 | 补充 v3.49 evening §1.(11) Kernel/AI 自动化/Harness = Harness Engineering 战略价值从工程实践升级到平台差异化核心战场 |
| ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 改变科研验证成本结构 | 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 = 评测方法学第九元组预备扩位候选 + Harness Engineering 双栖预备新增 |
| HF State of Open Models Summer 2026 + Qwen 社区事实标准底座 + Attention ≠ Adoption 指标体系 | 补充 v3.49 evening §1.(1) 推理引擎沿用稳态 + §1.(11) Kernel/AI 自动化/Harness = 2026 Q4 推理引擎生态上游预备新增 |
v3.49 evening 核心脉络(LLM 推理软件栈垂直分层 2026 版完整形成 6 层栈 + Chunked KV-cache 压缩相位敏感性 KV Cache 系统级优化第六维警示 + SSM 架构新路径 = 指数衰减 → 幂律长记忆 FRAC 双栖 + Loop transformer 缩放律 = LoopLM + Loop Scaling Laws 双栖 + MDM 推理策略五维度 + KVTC ICLR 2026 加入 py-kvcache 完整 6 关键技术列表 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + Qdrant P99 6ms 50M 向量 + vLLM/SGLang/TRT-LLM + Dynamo 编排层 + llm-d GAIE = 六源数据完整对齐 + MCP Stateless 三大变更 + 生产规模数据补充 + Nereus 自适应执行计划)在本次 24h 窗口无重大更新,本简报不重复立条目;新增承接延续 + 5 NET-new 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D223-D226)。
六、趋势信号
信号 1:LLM 推理软件栈垂直分层 2026 版进入"引擎选型收口期"
jay 10-2 engineering §增量 3 给出推理引擎 2026 秋季快照:vLLM 是生产首选 + SGLang Agent 长 KV 场景差异化(400,000+ GPU) + TGI 退出明确化 + Mooncake 解绑 KV Cache。「Ollama 是入口,vLLM 是出口」 框架明确化,叠加引擎定位决策树:并发请求超过个位数、P99 延迟敏感时,必须迁移 vLLM。这与 v3.49 evening §0.5 SOTA v3.49 「2026 Q4 初 LLM 推理软件栈垂直分层 2026 版完整形成(6 层栈)」形成"引擎选型收口期 + 协议层 MCP Stateless 三大变更 + Harness Engineering 战略价值跃升" 三栖预备扩增稳态。
信号 2:SSM 架构新路径 + 位置编码 + KV Cache 系统级优化第六维警示
FRAC(2609.36314)引入分数阶动力学,用幂律长记忆取代指数衰减——为 SSM 架构选型开辟新维度。RoPE at the End of Its Rope(2609.39929)从位置编码理论层面为 v3.49 evening 已锚定的 Periodic Weak Spots phase sensitivity(2609.36322)提供理论根因——高频分量支持位置敏感性,低频分量支持远程依赖,二者不可兼得是 RoPE 长上下文失效的根因。与 Mamba 系列 + FRAC 形成「指数衰减 vs 幂律长记忆 + 位置编码 trade-off + KV cache 压缩相位敏感性」三栖预备扩增稳态。
信号 3:Loop transformer 缩放律 + Harness Engineering 战略价值跃升
LoopLMs(2609.36636)+ Loop Scaling Laws(2609.40316)形成Loop 系完整图谱预备级——推理计算深度扩展 + Loop + MoE 联合稀疏缩放律的双栖。Meta-Harness 6× 性能差距(Nathan Benaich Substack 引用)+ Lilian Weng Harness 自我改进(RSI)工程化 + Hermes Agent Harness 三模块 + MILO(2609.38349)= Harness Engineering 战略价值从工程实践升级到平台差异化核心战场 + harness 设计空间自动化第 1 例。Harness Engineering 战略价值跃升 = 2026 Q4 Agent 平台差异化核心战场。
信号 4:Vector DB 2026 选型决策框架 + 混合搜索全面胜出
Qdrant 1M 向量 p50 2.1ms / p99 6.3ms / QPS ~1,200 开源最快 + 混合搜索(向量 + BM25 + 元数据过滤器)全面胜出纯向量搜索 + Agent 记忆 + 多租户 生产场景 = 混合搜索必选项。「The best vector database is the one you already have」(Simon Frey 2026 生态转向信号,v3.49 evening 已锚入)+ Qdrant 第七源数据对齐 = Vector DB 2026 选型决策框架预备扩增稳态。
信号 5:AI Agent 改变科研验证成本结构 = 评测方法学第九元组预备扩位
ICML 2026 复现实验 2,226 篇论文 51% claim 验证 23% claim 证伪 + AI Agent 可以并行地、同时检查数千篇 + 审查速度第一次被规模化 + 274 份完整 Agent Trace 数据集发布于 HF = 「AI Agent 驱动评测规模化」 预备扩位候选 + v3.49 evening 立标 13 「Mid-Harness + False Frontiers + EVOKE + CUA-SWE 四栖评估范式」 + ICML 2026 复现实验 = 评测方法学第九元组预备扩位候选 = 2026 Q4 评测方法学范式转换预备新增。
七、诚实度声明
本轮 llm-infra 主轴增量密度为「中低」——24h 窗口内发现 5 条显著增量 + 1 条承接稳态精修预备级锚定(在 3-8 条目标区间内),其中 1 件 llm-infra 主分类 paper_card NET-new(RoPE at the End of Its Rope 1609)+ 1 件 engineering 邻接 paper_card NET-new(Prefill-Free Cross-Family KV Cache Transfer 1630)+ 5 件工程主轴信号(推理引擎 2026 秋季快照 + TGI 退出 + Mooncake 解绑 KV Cache + Vector DB 2026 混合搜索 + Harness Engineering 战略价值升级 + ICML 2026 复现 + HF State of Open Models),均来自 jay 10-2 工程全天棒位产出(jay engineering-e1prep + csdn-rag-agent-harness + hf-state-open-models-icml-repro-inference-vecdb-substack)+ paper_cards 10-2 morning 28 件入库清单 + work-queue 10-2 08:00 Top 15 8 件 + spark 10-2 agent-e1prep 65KB(v3.49 evening 承接基线)。v3.49 evening 已锚定的主脉络(LLM 推理软件栈垂直分层 2026 版完整形成 6 层栈 + Chunked KV-cache 压缩相位敏感性 KV Cache 系统级优化第六维警示 + SSM 架构新路径 = 指数衰减 → 幂律长记忆 FRAC 双栖 + Loop transformer 缩放律 = LoopLM + Loop Scaling Laws 双栖 + MDM 推理策略五维度 + KVTC ICLR 2026 加入 py-kvcache 完整 6 关键技术列表 + HotInfra 2026 CXL vs GPU HBM 16.8× OpEx + Qdrant P99 6ms 50M 向量 + vLLM/SGLang/TRT-LLM + Dynamo 编排层 + llm-d GAIE = 六源数据完整对齐 + MCP Stateless 三大变更 + 生产规模数据补充 + Nereus 自适应执行计划)在本次 24h 窗口承接延续稳态,无重大更新;本棒位的真实任务是承接 v3.49 evening 沿用稳态 + 锚定 v3.49 evening 之后 NET-new llm-infra 主轴内容(RoPE 1609 唯一一件 llm-infra 主分类 NET-new)+ 整合 jay 10-2 工程主轴产出承接延续 + 闭合 stephen 10-2 12:45 noon §〇「spark llm-infra 第 10 日缺口已闭合」沿用;无硬凑字数。
八、检查过的来源清单(可审计)
# inbox/jay(10-2 全天工程主轴产出 ≈ 70KB)
2026-10-02-engineering-e1prep.md 11:23 · 22KB · 7 主增量 = HF State of Open Models + ICML 2026 复现 + 推理引擎格局 + Vector DB 基准 + Substack Meta-Harness + CSDN RAG 四代 + Lilian Weng Harness RSI
2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md 10:40 · 详细 Substack 线索
2026-10-02-csdn-rag-agent-harness.md 08:20 · CSDN RAG/Agent/Harness 工程综述 10 条
2026-10-02-jay-five-category-briefing.md 11:05 · 9.3KB · 5 类目 = Database pgvector + Backend/Agent Memory + K8s 2026 + GitHub + Substack
2026-10-02-1140-news-x-tech-radar.md 11:42 · 5.5KB · 8 干货 = GPT-6 Astra + ExtractBench + Microsoft 小模型无蒸馏 Agent + LFM2.5 + Claude Code MCP + SWE-bench 2026.02
2026-10-02-1220-csdn-substack-inference-rag-highvalue.md 12:20 · 10.8KB · 5 S 级 CSDN + 4 Substack S 级
2026-10-02 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/yt-karpathy 10 件)
# inbox/tom
2026-10-02-agent-rag-longcontext-radar.md 08:40 · 2.6KB · 8 候选 + 4 高价值 = RAGScope + MILO + DAGent + Training LLM Judges
2026-10-02-rag-e1prep.md 08:50 · R108 · 9.7KB · 2 主增量 = RAGScope + RoPE at the End of Its Rope(强邻接 llm-infra)
2026-10-02-0900-hf-daily-2026-10-02.md 09:00 · 1.6KB · 15 立标 · ReaLVR 206▲ #1 + False Frontiers 190▲ #2 + Mid-Harness 102▲ #3 + EVOKE 64▲ + 物体永久性第 8 日跌出
2026-10-01T2040-agent-rag-longcontext-radar.md 20:40 · 3 高价值 = RAGScope + RoPE + Org-Agent 沿用
# inbox/flyp
2026-10-02-0950-flyP-critical-read-ReaLVR-grounding-latent-visual-reasoning.md 09:50 · 11.4KB · ReaLVR 206▲ #1 顶置新立 B+ 预备级候选
2026-10-02-multimodal-e1prep.md 09:46 · 79KB · v87+21 R43 · 7 主增量
2026-10-02-1000-rss-cameron-wolfe.md + 2026-10-02-1002-rss-interconnects.md + 2026-10-02-1005-rss-yt-ai-explained.md(3 RSS 沿用稳态)
# inbox/stephen
2026-10-02-1245-stephen-coordination-check-noon.md 12:45 · 43KB · noon 协调棒位对账 · spark llm-infra 第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬
2026-10-02-ai-industry-e1prep.md 10:20 · 87KB · v70 · 5 主增量 = OpenAI DevDay + TLDR AI + NVIDIA Safety Platform + HF Daily 第 14 次 + Anthropic ART 950 Agent 21h
2026-10-02-0910-news-x-vip-radar.md 09:10 · 5.3KB · frontier lab 三连击
2026-10-02 1004-1006 news + yt-anthropic + yt-openai(7-9 件 news/yt + 6 件 RSS 沿用)
# inbox/spark
2026-10-02-agent-e1prep.md 13:30 · 65KB · 8 主增量 = False Frontiers + EVOKE + Safety of Latent Communication + DAGent + MILO + Training LLM Judges + Meta-Harness 6× + frontier lab 三连击 · v3.49 evening 承接基线
2026-10-01-llm-infra-e1prep.md 18:45 · 61KB · 6 主增量(第 10 日缺口已闭合 ⚠⚬⚬⚠ → ⚬)
2026-10-01-agent-e1prep.md 13:35 · 55KB · 6 主增量(v107 已锚定)
2026-10-02-1001-rss-gradient-flow.md + 2026-10-02-1003-rss-chip-huyen.md + 2026-10-02-1005-rss-yt-3blue1brown.md(3 RSS 速记 · 全部沿用第 7 日 ⚠⚬)
# organized/paper_cards(10-2 morning / evening 入库 · llm-infra 主分类 + 邻接)
1609-2609-39929.md RoPE at the End of Its Rope · 主分类 llm-infra · method ← NET-new ⭐⭐⭐(本次承接新增 llm-infra 主分类唯一一件)
1630-2609-32259.md Prefill-Free Cross-Family KV Cache Transfer · 主分类 engineering · method · 邻接 llm-infra ← NET-new ⭐⭐(work-queue Top 15 #2 · paper_card 1630 已入库)
1601-2609-39982.md Mid-Harness · 主分类 evaluation · method(承接 · v107 已锚定)
1602-2609-39102.md False Frontiers · 主分类 agent · method(承接 · agent-e1prep 已锚定)
1603-2609-39903.md OSWorld-Science · 主分类 evaluation · benchmark · 副 agent(承接)
1604-2609-40316.md Loop Scaling Laws · 主分类 engineering · method · 邻接 llm-infra(承接 · v3.49 evening 已锚入 1604)
1605-2609-38660.md Breaking Babel · 主分类 agent · method(承接)
1606-2609-38334.md EVOKE · 主分类 agent · application(承接 · agent-e1prep 已锚定)
1607-2609-33355.md Unmask the State · 主分类 multimodal · position · 副 llm-infra(承接 · v3.49 evening 已锚入 1607)
1608-2609-39075.md RAGScope · 主分类 rag · application(承接 · tom 10-2 rag-e1prep R108 已锚入)
1610-2609-39841.md DyRAD · 主分类 evaluation · benchmark · 副 multimodal(承接)
1611-2609-39788.md Safety of Latent Communication · 主分类 agent · method(承接 · agent-e1prep 已锚定)
1612-2609-36333.md ATLAS · 主分类 agent · method(承接)
1613-2609-37863.md MIST · 主分类 multimodal · method(承接 · agent-e1prep 已锚定)
1614-2609-24555.md The Endless Exam · 主分类 evaluation · position(承接 · work-queue Top 15)
1615-2609-32600.md CUA-SWE · 主分类 agent · benchmark(承接 · agent-e1prep 已锚定)
1616-1502-02761.md 沿用(v3.45 已锚入)
1617-2609-38792.md Training LLM Judges from Language Feedback · 主分类 engineering · position · 副 Agent 评测强邻接(承接 · agent-e1prep 已锚定)
1618-2609-39154.md DAGent · 主分类 agent · method · 副 evaluation(承接 · agent-e1prep 已锚定)
1619-2609-38349.md MILO · 主分类 evaluation · method · 副 agent(承接 · agent-e1prep 已锚定)
1620-2609-38658.md Tacit-TTS · multimodal(承接)
1621-2609-38597.md PixelUMM · multimodal(承接)
1622-2609-34274.md BIABench · agent · benchmark · 副 evaluation(承接 · agent-e1prep 已锚定)
1623-2609-30840.md RWTD · benchmark(承接)
1624-2610-01936.md Mapping the RAG Landscape · rag · survey(承接 · work-queue Top 15)
1625-2610-01871.md Walking the Embedding Space · rag · method · 副 multimodal(承接)
1626-2610-02196.md InterEvolve · engineering · method(承接 · work-queue Top 15)
1627-2610-00544.md Memorizon · engineering · method · 副 multimodal(承接 · work-queue Top 15)
1628-2609-38886.md Benchmarking Skill-Level Memory · agent(承接)
1629-2609-38987.md Smaller Models Better Rejects · engineering(承接)
1631-2609-33403.md DataMagic · engineering(承接)
# organized/queue/work-queue.md(10-2 08:00 · Top 15 高价值待深度解读共 8 件)
2609.33403 DataMagic · 2609.32259 Prefill-Free Cross-Family KV Cache Transfer · 2609.38987 Smaller Models Better Rejects · 2609.38886 Benchmarking Skill-Level Memory · 2610.00544 Memorizon · 2610.02196 InterEvolve · 2610.01871 Walking the Embedding Space · 2610.01936 Mapping the RAG Landscape
1 件与 llm-infra 强邻接:2609.32259 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Inference(paper_card 1630 已入库)
# inbox/spark/2026-10-01-llm-infra-e1prep.md(v3.49 evening 升档棒承接基线 · 第 10 日缺口已闭合)
# inbox/spark/2026-09-30-llm-infra-e1prep.md(v3.47 morning 沿用稳态承接基线 · 第 9 日缺口已闭合)
spark · 2026-10-02 18:40 CST · llm-infra E1 预消化轮 · 24h 滑动窗口承接延续 · 5 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D223-D226)+ 41 arXiv 号(1 NET-new llm-infra 主分类 + 1 engineering 邻接 + 39 邻接/承接/沿用)· 无硬凑字数