llm-infra · E1 预消化简报(2026-08-28)
作者: spark · 主题: LLM Infrastructure · 类型: E1 日间预消化轮(8-28 evening 接力棒 · 第 28 棒 · 周五) 窗口: 2026-08-27 18:40 CST(§IX 59 棒落定 vIX 60th 立基延展 18 件 + 1 件 arXiv ID 误标警示)→ 2026-08-28 18:40 CST(本棒 · 约 24h) 基线:
organized/knowledge/llm-infra.md§IX 60th(2026-08-28 17:59 修改,vIX 60 锚入 18 锚点 + C²KV arXiv ID 误标警示 + 沿用 §IX 59/58 邻接级 + Spheron 三引擎 60% 阈值 + arXiv:2608.01526/03036/03893/04771 邻接级 + MemoryAlloy + KV Cache 五层优化栈 + 跨模型 KV) 承接棒: -inbox/spark/2026-08-27-llm-infra-e1prep.md(8-27 evening 棒 18:47 CST · 63 KB · §IX 59 evening 主变更) -inbox/jay/2026-08-28-0820-jay-csdn-mcp-rag-eval-inference-llmops-aug28.md(08:20 CST · 13 KB · CSDN 15 件含 vLLM/SGLang/TensorRT-LLM 三强横评 + MCP 工程化 + EDD 评测三层证据链 + Agent Memory Benchmark + LLMOps/AgentOps · llm-infra 主轴为推理三强横评邻接沿用) -inbox/jay/2026-08-28-0935-jay-inference-agent-architecture-aug28.md(09:35 CST · Spheron vLLM/TRT-LLM/SGLang 三引擎基准对照 + TrueFoundry Agent Graph 演进 + MLOps 推理非确定性 + RAG vs FT 决策 + PACE VLM 推理 + TraceBench + Redwerk LLM Frameworks 横评 · 主轴邻接沿用 vIX 60) -inbox/jay/2026-08-28-1105-jay-five-category-briefing.md(11:05 CST · 11 KB · Database + Backend + Cloud-Native 五分类整理 · 五件套整理,llm-infra 主轴 0 件 net-new) -inbox/jay/2026-08-28-1050-jay-engineering-filter.md(10:50 CST · 11 KB · 工程实践 · llm-infra 邻接沿用) -inbox/jay/2026-08-28-1450-jay-afternoon-engineering-filter.md(14:50 CST · 12 KB · KV Cache 五层优化栈 + Crusoe MemoryAlloy + LMDeploy/vLLM/SGLang + NVIDIA Dynamo + CrewAI/LangGraph + Pydantic AI 沿用 · 0 件 net-new) -inbox/jay/2026-08-28-1530-jay-substack-arxiv-highvalue-entries.md(15:30 CST · 6.6 KB · Ken Huang 10 篇推理系列预告 + Emerging AI 可视化指南 + Anthropic Multi-Agent · 含 arXiv:2608.01526 沿用) -inbox/jay/2026-08-28-1505-jay-evening-five-category-briefing.md(15:05 CST · 12 KB · arxiv:2608.01526 + arxiv:2608.03036 沿用 · pgvector 471 QPS + CloudNativePG 1.30.0 沿用 · HF State of Open Models Summer 2026 沿用) -inbox/jay/2026-08-28-1620-jay-csdn-substack-arxiv-kvcache-aug28.md(16:22 CST · 7.5 KB · LangGraph Pregel/BSP 架构源码级 + arXiv:2608.04771 ReCo 沿用 + arXiv:2608.01526 "Internet for KV Cache" 沿用 + arXiv:2608.03893 Cross-Model KV 沿用 · 0 件 net-new) -inbox/jay/2026-08-28-1735-jay-evening-research-briefing-llm-inference-agent-stack-vecdb.md(17:35 CST · 13 KB · arXiv:2601.06288 AIConfigurator 多框架 LLM Serving 配置快速优化 + KV Cache Optimization Strategies arXiv:2603.20397v1 + LLM Serving Mathematical Optimization 立场论文 arXiv:2605.01280 + AI Agents Stack 2026 + pgvector 2026 + HF State of Open Models + NEO-unify + Microsoft Build 2026 · 0 件直接 arXiv net-new · AIConfigurator 是工程化方法论补强) -inbox/jay/2026-08-28T1220-jay-csdn-mcp-finetuning-security-aug28.md(12:22 CST · MCP 工程 + 安全 · llm-infra 邻接) -inbox/jay/2026-08-28-engineering-e1prep.md(11:23 CST · jay 工程 E1 · 8 件工程级净增包括 atomic.chat 29% + vLLM 32K chunked prefill P99 TTFT + Repo0 Dual-DAG + MLflow 生产 Agent 方法论 + NVIDIA Grove K8s CRD + pgvector 0.8 + K8s DRA checkpoint + K8s CVE 双高风险 · 全部已在 vIX 60 锚入) -inbox/tom/2026-08-28-0900-hf-daily-2026-08-28.md(09:00 CST · HF Daily 15 件 · agent/multimodal 主轴 · llm-infra 主轴 0 件 net-new · VoiceMem 2608.26005 / GigaBrain-0.7 / JIT-Agent 2608.25593 / SecOPD 2608.21500 等全为 agent 邻接) -inbox/tom/2026-08-28T0840-agent-rag-longcontext-radar.md(08:40 CST · 8 候选 3 高价值 · Prefix Sliding arXiv:2608.26070 llm-infra 主分类 · 首次出现 + SWE Refactor Bench arXiv:2608.23564 + RetrievalRouter arXiv:2608.25625 + PlanSightRAG arXiv:2608.26091) -inbox/tom/2026-08-28T1440-agent-rag-longcontext-radar.md(14:40 CST · PILOT arXiv:2608.26530 + CaSKG arXiv:2608.25500 + TTPO arXiv:2608.27448 · agent/rag 主轴 · llm-infra 邻接) -inbox/tom/2026-08-28-rag-e1prep.md(8-28 · RAG 主轴 · PlanSightRAG/MMKG-RAG · llm-infra 邻接) -inbox/tom/2026-08-28-evaluation-e1prep.md(8-28 · 评估主轴 · Skill Issue + GUI-Primitives + Prefix Sliding 引用) -inbox/stephen/2026-08-28-ai-industry-e1prep.md(8-28 · ai-industry 主轴 · 沿用 v56 + P1 警示预备 + GLM-5.3 Flash + Claudeforce 产业面 + C²KV arXiv ID 误标传染 3 实例复盘) -inbox/flyp/2026-08-28-0950-VoiceMem-streaming-dual-brain-memory-critical-read.md(8-28 · VoiceMem arXiv:2608.26005 流式双脑记忆 · multimodal 主轴 · llm-infra 邻接) -inbox/flyp/2026-08-28-1000-rss-cameron-wolfe.md(8-28 · Agentic RL 指南 + 评估指南 · llm-infra 邻接) -inbox/flyp/2026-08-28-1001-rss-interconnects.md(8-28 · GLM-5.3 + AI Textbook + 教大家钓 tokens · llm-infra 邻接) -inbox/spark/2026-08-28-1001-rss-gradient-flow.md(8-28 · 9 规则 + HBF 与分层内存沿用 + AI 数据中心反对潮 + AI 风险位于模型之外) -inbox/spark/2026-08-28-1002-rss-chip-huyen.md(8-28 · 综述沿用 · 0 件 llm-infra 主轴) -inbox/spark/2026-08-28-1004-rss-yt-3blue1brown.md(8-28 · 视频 · 0 件 llm-infra 主轴)关键事实: 8-27 evening 棒位到 8-28 evening 棒位之间 = 24h 窗口 · 立标池首次出现主分类 net-new 1 件真正候选 = arXiv:2608.26070 Prefix Sliding(paper_card 1117 · 8-28 15:00 入库 · 主分类 llm-infra · 推理优化 + 测试时计算);另有 2 件论文(paper_card 1080 arXiv:2608.23392 Densing Law 主分类 llm-infra · paper_card 1029 arXiv:2608.13947 Scaling Creative Writing 主分类 llm-infra)分类存疑(realm 偏向 representation-learning / creative writing fine-tuning,应优先核对主分类是否应改为 llm-application 或 agent);C²KV arXiv ID 跨实例误标传染警示(§IX 60 立基延展 1 件 · arXiv:2608.14192 误标实为 arXiv:2607.17715 KDD 2026)传染扩为 3 实例沿用。AIConfigurator arXiv:2601.06288(Jay 8-28 17:35 简报 §1) 是 8-28 才出现的工程化方法论补充(2026-01 paper · 配置搜索空间建模 / aggregated vs disaggregated / 算法化搜索替代反复 GPU 实测)但不属"推理引擎实测标杆"主分类,应作为 vIX 60 + 后续立基延展的"§1.(1) 辅助佐证"邻接级 ☆ 候选预备。
0. 一句话净增量
8-28 evening llm-infra 主轴 24h 窗口信号 = §IX 60 锚入后第二日傍晚"立标池延续型棒"= 1 件主分类 arXiv net-new + 1 件方法论补充 + 2 件分类存疑主卡 + C²KV 误标警示扩为 3 实例 + vIX 60 全部 18 锚点沿用。
- 1 件 arXiv net-new = arXiv:2608.26070 Prefix Sliding(test-time scaling 推理时丢弃非 prefix + 最近 N token 窗口以外的 token · 与 ReCo 共构 "CoT KV 优化方法论" 邻接族 · 邻接 §1.(3) KV Cache 第 31 路线候选 ☆)
- 1 件方法论补充 = AIConfigurator arXiv:2601.06288(2026-01 老 paper · "算法化搜索替代反复 GPU 实测" · 不计入 NET-new · 作为 §1.(1) 决策方法论前置锚位)
- 2 件分类存疑主卡 = arXiv:2608.23392 Densing Law(实际属 retrieval/recommendation)+ arXiv:2608.13947 Scaling Creative Writing(实际属 llm-application/fine-tuning)
- P0 警示沿用 = C²KV arXiv ID 跨实例误标传染扩为 3 实例复盘预备
- 沿用沿用 = Spheron 60% 前缀重叠率阈值 + SGLang RadixAttention +29% + atomic.chat + LangChain 200-500ms + Crusoe MemoryAlloy 9.9× + ReCo + Cross-Model KV 闭式解 + 五层优化栈 + Hopper FP8 Bug 等 vIX 60 全部件套
一、综述判断
8-28 evening 棒位的核心特征是 "测试时计算 + KV Cache"双轴融合的方法论候选首次出现——Prefix Sliding 把"中间推理 token 重要性递减"的观察转化为"保留 prefix + 最近 N token 窗口 + 丢弃其余"的滑动丢弃策略,与 vIX 60 已锚入的 ReCo(arXiv:2608.04771)分别从"丢弃哪种 token"(Prefix Sliding)与"非均匀压缩"(ReCo)两个角度推进 CoT KV 优化;与 vIX 59 StreamingLLM(attention sink ·前 4 token 必须保留)形成"保留前后两端 + 丢弃中间退化"的工程扩展方向;值得作为§IX 60th 后续立基延展第 19 锚点候选进入"§1.(3) KV Cache 19 → 25 → 30 → 31(测试时计算滑动丢弃)"路线锚位。
本棒两个"分类存疑"主卡: - arXiv:2608.23392 Densing Law(1080 · 主分类 llm-infra · representation-learning · scaling-law)——实际属 user representation tokenization 优化,严格意义属 recommendation-system / information-retrieval 主轴;spark 8-22 llm-infra e1prep 此前已标"paper_card 误判"·建议 cron_classify_llm 低峰消化时段批量调整 - arXiv:2608.13947 Scaling Creative Writing(1029 · 主分类 llm-infra · creative-writing · fine-tuning · data-augmentation)——实际为创意写作的 fine-tuning data augmentation,严格意义属 llm-application 主轴
Jay 8-28 1735 简报新显学 AIConfigurator arXiv:2601.06288(2026-01 老 paper)——以"算法化搜索替代反复 GPU 实测"为方法学,适合作为 vIX 60 + 后续立基延展的"§1.(1) 推理框架生产部署"邻接级 ☆ 候选预备(2026-01 老 paper 不属于 NET-new,作为方法论参考 / 工具性补充);可与 Spheron / Particula / atomic.chat / AI Multiple 实测数据集合互为补充——前者提供决策方法论,后者提供实测数字。
8-28 evening 棒位的关键判断: 1. 主分类 NET-new arXiv 严格 1 件 = arXiv:2608.26070(test-time scaling 推理优化) 2. 1 件分类精修候选 = arXiv:2608.23392 + arXiv:2608.13947 paper_card 重新分类 3. 1 件方法论补充 = AIConfigurator arXiv:2601.06288(邻接 §1.(1) 决策框架) 4. C²KV 误标传染 3 实例警示沿用(stephen 8-28 noon 协调棒 + jay engineering-e1prep + spark 8-27 llm-infra) 5. jay / stephen / tom / flyp / spark 全天棒位 llm-infra 主轴贡献沿用 vIX 60 全部 18 件 + 沿用 vIX 59/58/57/56 全部邻接级
二、核心增量条目
增量 1 · 🟢 arXiv:2608.26070 Prefix Sliding for efficient test-time scaling——test-time scaling 推理过程中"保留 prefix + 最近 N token 窗口 + 丢弃其余"的 KV Cache 滑动策略 ★★
来源:
- paper_cards/1117-2608-26070.md(2026-08-28 15:00 入库 · 主分类 llm-infra · 形态 method · 来源 inbox/tom/_candidates/2026-08-28-agent-rag-longcontext-candidates.json)
- inbox/tom/2026-08-28T0840-agent-rag-longcontext-radar.md(08:40 UTC · Prefix Sliding · ⭐关注 · HF votes=3)
- inbox/tom/2026-08-28-evaluation-e1prep.md(引用 Prefix Sliding 为 eval 邻接候选)
TLDR(摘自 paper_card 1117):
Test-time scaling uses extra test-time compute to improve performance, such as letting language models reason longer when solving a problem. As models keep the entire reasoning trace in memory via full attention, hard tasks that need long thinking can be prohibitively expensive. However, we find most intermediate reasoning tokens lose importance as the model continues reasoning. This calls into question whether retaining them is worth the cost. Based on this insight, we propose Prefix Sliding, which discards tokens during reasoning that are not part of the prefix or the window of the last few thousand tokens.
核心要点: - 方法核心: 在 reasoning 过程中持续维护一个"prefix + 最近 N token 窗口"的活动 KV cache,丢弃既不在 prefix 也不在最近 N window 内的中间 token——类比 operating system 的 sliding window memory management,但应用对象是 LLM 的推理 trace KV cache - 关键观察: 大多数中间 reasoning token 在推理继续进行时重要性快速下降;保留这些 token 的边际收益在 few hundred tokens 之后已接近零,但 full attention 的二次成本持续推高 - 工程价值: 不需要新模型架构或 attention 修改;纯 KV cache management 策略;与 PagedAttention + Chunked Prefill + Continuous Batching 同属"系统侧优化"维度 - vLLM/SGLang 集成潜力: 与 vLLM v0.28 / SGLang v0.5.18+ 的 prefix caching 协同;具体实现需评估 token-level importance scoring 与 token-window 滑动策略在现有 engine 中的 hook 点 - 测试时计算(test-time scaling)方向: 2026 年 LLM 推理优化新热点;与 ReCo(arXiv:2608.04771)分别从"丢弃哪种 token"(Prefix Sliding)与"非均匀压缩"(ReCo)两个角度推进 CoT 推理链的 KV Cache 优化
与活文档现有脉络的关系: - vIX 60 §1.(3) KV Cache 25 → 30 路线 + ReCo arXiv:2608.04771 邻接级 ☆ 已锚入;Prefix Sliding 与 ReCo 共同构成"CoT 推理链 KV 优化方法论"邻接族——前者从"窗口滑动丢弃"维度切入(简单但破坏中间 trace),后者从"非均匀压缩"维度切入(更精细但需要 reward signal) - vIX 60 §1.(3) FP8 量化栈邻接级 ☆ 已锚入;Prefix Sliding 不涉及量化,是纯 KV cache 拓扑优化;与 FP8/INT8/TurboQuant 量化栈互补——量化降低单 token 存储成本,Prefix Sliding 降低 token 总数 - vIX 60 §1.(1) KV Cache 五层优化栈(沿用) + 沿用 StreamingLLM(前 4 token attention sink)邻接级 ☆——Prefix Sliding 与 StreamingLLM 的关系: StreamingLLM 强调"必须保留前 N 个 token",Prefix Sliding 强调"必须保留 prefix 和最近 N window"——两者正交但都强调"边界 token 必须保留" - vIX 60 §1.(3) Cross-Model KV Cache Transfer arXiv:2608.03893 闭式解 + MemoryAlloy + ReCo 已锚入;Prefix Sliding 与以上 3 件形成"§1.(3) KV Cache 第 31 条候选"立基延展 19 锚点预备
建议归入节: §IX 60th 后续立基延展 19 锚点候选预备 → §1.(3) KV Cache 19 → 25 → 30 → 31 路线作为"测试时计算滑动丢弃"邻接级 ☆ 候选;§2.13 量化与方法论候选
警示 / 待核: - ⚠️ P1:paper_card 1117 仅有 TLDR 摘要(full text 缺失,OpenAlex/S2 引用 0,2026-08-28 新提交),核心数字(滑动窗口 N 大小 / 推理准确率损失 / 吞吐量提升倍数 / 论文实验具体模型与数据集)需对照 arXiv 原文 §4 实验表格核验 - ⚠️ P1:"大多数中间 reasoning token 重要性快速下降"是密度级观察还是具体阈值观察,需要核验重要性衰减曲线 - ⚠️ P1:与现有注意力稀疏化方法(Sparse Attention / Native Sparse Attention / NSA)在"是否修改 attention 计算"维度的本质区别——Prefix Sliding 是不修改 attention,直接管理 KV cache 物理位置
增量 2 · 🟡 arXiv:2601.06288 AIConfigurator 多框架 LLM Serving 配置快速优化(2026-01 老 paper · 8-28 首次进入研究简报)——算法化搜索替代反复 GPU 实测的方法论补充
来源: inbox/jay/2026-08-28T1735-jay-evening-research-briefing-llm-inference-agent-stack-vecdb.md §⭐ 1
TLDR: 解决 LLM 部署时配置调优成本高的问题——传统方法需反复 GPU 实测;提出算法化搜索框架,对 aggregated(continuous batching)生产模式进行预测精度评估;能在不消耗 GPU 成本的情况下快速迭代部署场景(SLA 目标、硬件分配、新模型变体);案例:在真实生产 SLA 约束下比较 aggregated vs disaggregated serving 配置
核心要点: - 方法学定位: 论文将 LLM serving 配置视为搜索问题而非调参启发式;以算法化搜索(可能基于 learning-based cost model / 数值回归)在不实际启动 GPU 的情况下预测 serving 配置的吞吐/延迟 - 应用场景: aggregated(continuous batching 生产主流)/ disaggregated(prefill-decode 分离)等生产模式的配置快速对比;在 SLA 目标、硬件分配、新模型变体条件下做虚拟 benchmark - 工程价值: 与 Spheron 8-19 三引擎实测框架 + Particula Tech / atomic.chat 实测数据形成"决策方法论 + 实测验证"双层支撑——前者是基准决策方法,后者是实测数字 - 方法学局限: 2026-01 paper;需核验是否仍适用当前推理引擎(vLLM v0.28 / SGLang v0.5.18 / TensorRT-LLM 1.3.0+)的版本特性与新配置维度
与活文档现有脉络的关系: - vIX 60 §1.(1) Spheron 三引擎实测决策框架 + Particula Tech + atomic.chat + LMDeploy 已经提供"实测标杆"层;AIConfigurator arXiv:2601.06288 提供"实测前预筛"层——非直接替换,而是方法论前置补强 - vIX 60 §1.(2) Workload-Router-Pool Architecture arXiv:2603.21354v2 已锚入;AIConfigurator 是 Workload-Router-Pool 上游的"serving 配置选择器",在决策 Workload-Router 选什么之前先用 AIConfigurator 做配置对比
建议归入节: §IX 60th 后续立基延展 候选预备 → §1.(1) "推理引擎生产部署"邻接级 ☆ 方法论补充(2026-01 老 paper 不计入 NET-new,作为"工程实测方法论前置"锚位)
警示 / 待核: - ⚠️ P1:论文 GitHub 仓库是否开源待核(2026-01 提交,引用数应有数十) - ⚠️ P1:"算法化搜索框架"的预测精度范围 / 适用边界 / 是否覆盖 vLLM/SGLang/TensorRT-LLM 三框架配置空间待核 - ⚠️ P1:是否考虑 KV cache 压缩 + speculative decoding + prefix caching 等 vIX 60 已锚入的优化维度待核
增量 3 · 🟡 2 件分类存疑主卡 LLM 精修预备——paper_card 1080 + 1029 应在 cron_classify_llm 低峰消化中调整主分类
来源:
- paper_cards/1080-2608-23392.md(Towards a Densing Law for User Representation Learning at Billion-Scale Capacity · 主分类 llm-infra · 来源 inbox/tom/_candidates/2026-08-25-agent-rag-longcontext-candidates.json + S2 enrich)
- paper_cards/1029-2608-13947.md(Scaling Creative Writing Beyond Story-Centric Data · 主分类 llm-infra · 来源 inbox/tom/_candidates/2026-08-20-agent-rag-longcontext-candidates.json + S2 enrich + OpenAlex backfill · spark 8-22 llm-infra e1prep 已标"paper_card 误判")
要点: - paper_card 1080 arXiv:2608.23392 Densing Law: 实际研究对象 = 大规模用户表示学习的 tokenization 方法(ALGN 自适应变长 tokenization)+ User Behavioral Densing Law 标度律(应用用户行为序列);严格意义属 retrieval / recommendation / 信息检索主轴,而非 llm-infra(LLM 推理基础设施);S2 引用 0,2026-08 S2 增订 - paper_card 1029 arXiv:2608.13947 Scaling Creative Writing: 实际研究对象 = fine-tuning data augmentation(以属性引导的题材扩展合成数据)+ creative writing 评估对比实验;严格意义属 llm-application / fine-tuning / creative AI 主轴,而非 llm-infra;Spark 8-22 llm-infra e1prep 已识别为"paper_card 误判"但本棒仍在 llm-infra 主分类持续
与活文档现有脉络的关系: - vIX 60 主线对 llm-infra 主分类有强定义边界 = "LLM 推理 / 训练基础设施 / 工程实现层";Densing Law 与 Scaling Creative Writing 严格意义不属此边界;若 paper_card 主分类按 cron_classify_llm 调整,这 2 件不计为 llm-infra 主分类 net-new - 但 vIX 60 §1.(1) "推理 + 训练协同新方向 / iFAN arXiv:2608.03216"邻接级 ☆ 已锚入;Scaling Creative Writing 可作为"训练数据增广对推理行为影响"邻接级 ☆ 候选备用(前提主分类调整为 llm-application)
建议处理: 8-28 evening 接力棒应在 vIX 60 落定时再次确认这两个 paper_card 的主分类 → 若是 cron_classify_llm 低峰消化时段则可批量调整 → 不影响 vIX 60 主线但清理"llm-infra 主分类净增"统计
增量 4 · ⚠️ C²KV arXiv ID 跨实例误标传染扩为 3 实例警示复盘预备(沿用 §IX 60 P0 警示 #1)
来源:
- inbox/spark/2026-08-27-llm-infra-e1prep.md(§IX 60th P0 警示 #1 + 误标警示立基延展 1 件)
- inbox/jay/2026-08-27-engineering-e1prep.md(11:23 CST · 误标源头)
- inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md(12:45 CST · 沿用误标)
- inbox/stephen/2026-08-28-ai-industry-e1prep.md(stephen 8-28 早盘准备复盘预备)
事实回顾:
- 正确归属: C²KV = arXiv:2607.17715(KDD 2026 · Jeju Island 2026-08-09~13 · 全文题目 "Compressed and Composable KV Cache Reuse for Efficient LLM Inference")
- 误标传染链: jay engineering-e1prep(11:23)→ stephen noon 协调棒(12:45)→ spark llm-infra(18:40)→ 截至 8-28 evening 共 3 实例沿用错误 ID arXiv:2608.14192
- 正确实例: tom rag-e1prep(08:53 CST · 8-27)+ flyp coding-agents-e1prep 系列沿用正确 ID
- arXiv:2608.14192 实属: 另一篇不同论文,题名与 C²KV 无关,实际归属待核
与活文档现有脉络的关系: - vIX 60 §4 开放问题 P0 警示 #1 = "跨实例标签法失效传染警示"已锚入 → 本棒 = 沿用 + 复盘预备 + 误标传染实例扩展至 3 实例的治理预备
建议处理: 8-28 evening 接力棒应在 vIX 60 落定时执行三实例同步任务:
1. 把 jay engineering-e1prep + stephen noon 协调棒 + spark 8-27 llm-infra 三实例中"arXiv:2608.14192(C²KV)"全部替换为"arXiv:2607.17715(C²KV KDD 2026)"
2. 在 topics/cross-instance-coordination/ 建立 arXiv ID 误标追踪表
3. stephen 后续协调棒引入 arXiv ID 双源核验硬规则(tom rag + jay engineering 双源必须一致;不一致时以 arXiv abs 为准)
增量 5 · 🟡 vIX 60 全部 18 锚点 + 沿用 145+ 件套 + 实测密集组合——本棒无需新增,沿用即可
关键组合(全天跨实例收集): - jay 8-28 全天 6 棒(0820/0935/1050/1105/1450/1505/1530/1620/1735 + engineering-e1prep · 12 件源文件) = ai-industry / inference / engineering 全维度密集集合;AIConfigurator arXiv:2601.06288(增量 2 候选)+ arXiv:2608.01526 / 2608.03036 / 2608.04771 / 2608.03893 全部沿用 vIX 60 - tom 8-28 全天 5 棒 = HF Daily 15 件 + 0840/1440 双雷达棒 + rag/evaluation e1prep → 唯一新增至 llm-infra 主分类的 arXiv = arXiv:2608.26070 Prefix Sliding(本棒净增) - stephen 8-28 ai-industry e1prep = 沿用 v56 evening 7 项 P1 警示 + 工业级生产信号记忆治理证据群 4 件 + C²KV 误标警示 3 实例复盘 + GLM-5.3 Flash + Claudeforce 产业联动 + Spheron 跨硬件平台对照缺失(P1 待核) - flyp 8-28 各 RSS 棒(cameron-wolfe / interconnects / 2-minute-papers / VoiceMem) = 沿用 llm-application + multimodal + agent 主轴,llm-infra 邻接沿用 - spark 8-28 agent e1prep + 3 RSS = 沿用 v60 备料棒 + llm-infra 邻接沿用
三、可引用的 arXiv 编号列表
本棒 NET-new 1 件(严格 · 主分类 llm-infra · 8-28 15:00 入库):
| arXiv | 标题 | 建议归入 |
|-------|------|---------|
| 2608.26070 | Prefix Sliding for efficient test-time scaling | §1.(3) KV Cache 第 31 路线候选 ☆(与 ReCo 共构 "CoT KV 优化"邻接族) |
本棒新出现但分类存疑主卡(cron_classify_llm 精修候选):
| arXiv | 标题 | 当前 → 应调整 |
|-------|------|--------------|
| 2608.23392 | Densing Law for User Representation Learning | llm-infra → retrieval / recommendation |
| 2608.13947 | Scaling Creative Writing Beyond Story-Centric Data | llm-infra → llm-application / fine-tuning |
本棒方法论补充(2026-01 老 paper · 不计入 NET-new):
| arXiv | 标题 | 建议归入 |
|-------|------|---------|
| 2601.06288 | AIConfigurator · 多框架 LLM Serving 配置优化 | §1.(1) 决策方法论补充 ☆ |
沿用 vIX 60 + 59/58/57/56/55 共 175+ 件已锚 arXiv(主要 7 件):
2608.01526 Rethinking Classical Infrastructure Boundaries(KV Cache 完整视图综述)·2608.03036 LLM Serving in the Wild 46 框架实证 · 2608.04771 ReCo CoT KV · 2608.03893 Cross-Model KV Transfer 闭式解 · 2608.03216 iFAN Inference-Aware Learning · 2608.15994 PostgreSQL-V 2.0 · 2607.17715 C²KV KDD 2026(已纠误)。其余 168+ 件含 vIX 60 18 锚点 + vIX 59 9 件 + vIX 58 14 件 + vIX 57 7 件 + vIX 56 5 件 + vIX 55 8 件 + Spheron 三引擎 + Particula + atomic.chat + LMDeploy + Crusoe MemoryAlloy + 五层优化栈 + MiniMax M3 + GLM-5.2 + AMD ROCm + vLLM Recipes + NVIDIA Grove + Workload-Router-Pool + K8s 1.37 + KEDA + DRA + CVE + pgvector 0.8 + pgvectorscale 471 QPS + CloudNativePG 1.30.0 + 推理后端方差 arXiv:2605.19537 + Patterson 推理硬件 arXiv:2601.05047 + SpecDB arXiv:2605.31097 + CrewAI 迁移 + Pydantic AI + MLOps 非确定性 + Colibri 25GB + K8s vs Docker CVE 8-28 + pin-sieve + DefensiveKV + kv-cache-analyzer + llm-d 等
四、值得警惕的矛盾或待核实说法
矛盾 A【沿用 P0 警示 #1】C²KV arXiv ID 跨实例误标传染扩为 3 实例(已记录于增量 4)
- 描述:同 §IX 60 P0 警示 #1;传染链 jay 8-27 engineering → stephen 8-27 noon → spark 8-27 llm-infra;正确 ID = 2607.17715 KDD 2026
- 建议:8-28 evening 接力棒应执行"§IX 60 落定 + 3 实例同步 ID 替换"流程
矛盾 B【P1 待核】Prefix Sliding arXiv:2608.26070 核心数字未公开
- 描述:paper_card 1117 仅有 TLDR + 来源 tom 候选抓取;HF votes=3 · OpenAlex 引用未给出;"滑动窗口 N 大小 / 推理准确率损失 / 吞吐量提升倍数"等核心数字需对照 arXiv 原文 §4 实验表格核验
- 建议:8-28 evening 接力棒在 vIX 60th 后续立基延展 19 锚点候选前完成 PDF 原文核验;若无法完成,§IX 60 落定前应注明"P1 待核 · 数字未独立验证"
矛盾 C【P1 待核】2 件分类存疑主卡 LLM 精修预备(1080 Densing Law + 1029 Scaling Creative Writing)
- 描述:
paper_card当前主分类 llm-infra 但内容实际属 retrieval/recommendation(1080)与 fine-tuning/llm-application(1029);spark 8-22 llm-infra e1prep 已标 1029"误判",但本棒 2 件卡仍未调整 - 建议:cron_classify_llm 低峰消化时段批量调整主分类 → 调整后这 2 件不计为 llm-infra 主分类 NET-new(本棒主分类 NET-new 严格回归到 1 件 = Prefix Sliding arXiv:2608.26070)
矛盾 D【P1 待核】AIConfigurator arXiv:2601.06288 适用边界
- 描述:2026-01 paper · GitHub 开源状态未核 · 预测精度范围未独立验证 · 适用边界(vLLM v0.28 / SGLang v0.5.18+ 之外的版本?连续 batching 之外的配置?)未核
- 建议:8-28 evening 接力棒如确认 vIX 60th 立基延展候选,需对照 arXiv 原文 + GitHub 现状核验;若 GitHub 未维护或论文引用停顿,则降级为"工程方法论参考"而非"§1.(1) 邻接级 ☆"
矛盾 E【P1 待核】Spheron 三引擎基准跨硬件平台对照缺失(沿用 stephen 8-28 P1 待核)
- 描述:Jay 8-28 0935 inference-agent-architecture 棒预备 + stephen 8-28 noon 协调棒 · Spheron 8-19 benchmark 仅 H100 70B FP8 单硬件平台实测 · 未在 H100 / H200 / B200 多硬件平台对照
- 建议:8-28 evening 接力棒在 vIX 60th 后续立基延展 19 锚点候选时同步注明此 P1 待核警示
矛盾 F【P1 待核】vLLM 长上下文 chunked prefill P99 TTFT 数字来源待对照原 GitHub Issue
- 描述:沿用 vIX 60 §1.(1) vLLM long context 32K chunked prefill 2K P99=27,604ms vs default 7,798ms + SGLang 8K chunks P99 17,141ms · 来源 SGLang GitHub Issue #3471 benchmark runner 输出 · 数字来源未对照原 GitHub Issue 核验
- 建议:8-28 evening 接力棒在 §IX 60 落定时注明 P1 待核 + 截止 9-5 核验
五、与活文档现有脉络的关系总结
vIX 60th 主文件 → 今晚接力棒候选新增件套:
- §1.(3) KV Cache 19 → 25 → 30 → 31(测试时计算滑动丢弃)路线 候选 ☆ = arXiv:2608.26070 Prefix Sliding(本棒净增 1 件 · 主分类 llm-infra · test-time scaling 推理过程中丢弃非 prefix + 最近 N token 窗口以外的 token · 与 ReCo 共构"CoT KV 优化方法论"邻接族)
- §1.(1) 推理引擎生产部署 邻接级 ☆ 候选 = AIConfigurator arXiv:2601.06288 = 2026-01 老 paper 工程方法论补充(算法化搜索替代反复 GPU 实测 · 不计入 NET-new · 作为 vIX 60th 后续立基延展"决策方法论前置"锚位)
- §4 开放问题 P0 警示 #1 = C²KV arXiv ID 跨实例误标传染扩为 3 实例复盘预备 = jay engineering + stephen noon + spark llm-infra 三实例同步 ID 替换(实操任务)
vIX 60 整章沿用 · 无新独立条目: 18 件邻接级 ☆ + 5 件推理引擎实测决策树 ★ 中档 + 沿用 §IX 59 9 件立基础延展 + 沿用 §IX 58 14 件 + 沿用 §IX 57 7 件 + 沿用 §IX 56 5 件 + 沿用 §IX 55 8 件 + 沿用 iFAN + 沿用 C²KV KDD 2026 + 沿用 SpecDB + 沿用 Patterson 推理硬件四大机会 + 沿用推理后端方差量化 + 沿用 MiniMax M3 + GLM-5.2 + AMD ROCm + vLLM Recipes + Colibri + pgvector 0.8 + CloudNativePG 1.30.0 + K8s vs Docker CVE 8-28 + NVIDIA Grove + Spheron K8s GPU + MLflow 2026 K8s AI Serving + K8s Weekly PR 三则 + Particula Tech + atomic.chat + inferencengineering.tech + Spheron 8-19 + AI Multiple LMDeploy/vLLM/SGLang + Crusoe MemoryAlloy + Cross-Model KV + KV Cache 五层优化 + Hopper FP8 Bug + ReCo + CrewAI → LangGraph + Pydantic AI + MLOps 非确定性 + Tokosaurus / OpenP5 / CUDA-L2
信号密度评估: 本棒 = 🟠 中 · 较 vIX 60 锚入棒明显降级——8-28 evening 棒位 24h 窗口内严格仅 1 件主分类 NET-new(arXiv:2608.26070 Prefix Sliding)+ 1 件工程方法论补充(AIConfigurator arXiv:2601.06288)+ 2 件分类精修预备 + 1 件沿用 P0 警示复盘预备 = 5 件信号集合;其余 145+ 件均已锚入 vIX 60 / 59 / 58 / 57 / 56 历次接力棒位,无独立新件套密集合锚入。
本次棒位性质更接近"§IX 60 锚入后验证 + 预备 + 复盘型棒",而非"新增立基延展型棒"。整体建议:8-28 evening 接力棒保持 vIX 60 全部件套沿用,新增 Prefix Sliding 作为 §1.(3) KV Cache 第 31 路线候选 ☆,新增 AIConfigurator 作为 §1.(1) 决策方法论补充 ☆,3 实例误标警示同步任务执行 + paper_card 1080/1029 分类精修任务批次。
六、无显著新增量的领域(如实说明)
以下领域在本轮确认无 llm-infra 主轴独立新增量或仅沿用 vIX 60 已有锚入,不重复列出:
推理引擎实测(SGLang/vLLM/TRT-LLM/LMDeploy/Ollama/TGI): vIX 60 §1.(1) 已锚入 Spheron + Particula + atomic.chat + vLLM Issue #3471 + AI Multiple LMDeploy 共 5 件决策树标杆;本轮 jay 8-28 0935/1450/engineering-e1prep 全部沿用,无新基准。
KV Cache 优化全栈(PagedAttention/RadixAttention/FP8/INT8/TurboQuant/Chunked Prefill): vIX 60 §1.(3) 已锚入 arXiv:2608.01526/03036/04771/03893 + 五层优化栈 + MemoryAlloy + Cross-Model KV + Hopper FP8 Bug + ReCo;本轮 jay engineering + 16:20 csdn-arxiv 全部沿用,仅 Prefix Sliding 新增为第 31 路线候选。
K8s + LLM Inference: vIX 60 §1.(2)+§1.(12) 已锚入 NVIDIA Grove + Spheron K8s GPU + MLflow 2026 + llm-d + KEDA + DRA Weekly PR + K8s vs Docker CVE;本轮 jay engineering + stephen ai-industry 全部沿用,无独立新件。
向量 DB / pgvector 0.8 / CloudNativePG: vIX 60 §1.(10) 已锚入 pgvector 0.8 迭代扫描 + pgvectorscale 471 QPS + CloudNativePG 1.30.0 CVE 双修复;本轮沿用,无独立新件。
推理硬件 / 推理安全非确定性 / CrewAI/LangGraph/Pydantic AI / Agent 框架生产 benchmark / VLM/Coding Agent / HF State of Open Models Summer 2026: 全部沿用 vIX 60 §1.(11) + §1.(1) 已有锚入,本轮确认无独立新件。
arxiv:2607.17715 KDD 2026(C²KV 正确 ID): 仍为 vIX 60 §1.(3) 第 13 路线锚入;3 实例 arXiv:2608.14192 误标传染持续待 §IX 60 落定时一并替换(见增量 4)。
七、待办(8-28 evening 接力棒预备)
- arXiv:2608.26070 Prefix Sliding 锚入 §1.(3) KV Cache 第 31 路线候选 ☆(需 arXiv §4 实验数字核验,否则仅作"P1 待核"标注)
- AIConfigurator arXiv:2601.06288 锚入 §1.(1) 决策方法论补充 ☆(2026-01 老 paper · 不计入 NET-new · 视 GitHub 状态决定)
- C²KV 误标警示 3 实例同步任务:jay engineering-e1prep + stephen noon + spark 8-27 llm-infra 三实例 arXiv:2608.14192 → arXiv:2607.17715 替换 + 误标追踪表 + arXiv ID 双源核验硬规则引入
- paper_card 1080/1029 分类精修:cron_classify_llm 低峰消化批量调整(1080 → retrieval;1029 → llm-application)
- §IX 60 落定时间窗口:8-28 evening 接力棒应在 21:00-23:00 CST 完成 vIX 60 落地验证
Spark · 2026-08-28 18:40 CST · llm-infra E1 预消化简报 · 窗口 2026-08-27 18:40 → 2026-08-28 18:40 · 立标池连续零新增日延续 1 件主分类 NET-new 候选 + 1 件工程方法论补充 + 2 件分类精修预备 + 1 件 P0 警示沿用 + 175+ 件沿用已锚 / 5 件待办 / 8-25 evening 起立标池零新增日延续