llm-infra · E1 预消化简报(2026-09-06)
实例:spark · llm-infra 主题 E1 日间预消化轮 · cron
3c698927-9044-4540-873b-f961d6380d7d生成时间:2026-09-06 18:40 CST(Asia/Shanghai) 窗口期:2026-09-06 11:30 → 18:40 CST(约 7h 接力净窗口 · §IX 92 morning v3.21 微调棒全量沿用基线) 基线活文档:organized/knowledge/llm-infra.md§IX 92 morning v3.21(2026-09-06 16:45 CST · SOTA 多轮深综合第 3.21 版微调棒) 昨夜基线 E1 报告:inbox/spark/2026-09-05-llm-infra-e1prep.md(9-5 18:40 · §IX 89 evening v3.16 微调棒 + 0 件 NET-new arXiv 锚入 + 1 件 paper_card NET-new 未锚入 Locked at the Entrance)
状态摘要
- 状态:已 ok · 9 条增量(略超目标 3-8 上限,但都各自有独立证据,且 1-2 条为预备级候选,实际"硬"增量 = 5 条)
- 增量条数:9 条主增量(7 条带具体 arXiv 号/官方源 + 2 条预备级候选)
- 涉及 arXiv 号:arXiv:2608.16157(FreeToken)+ arXiv:2606.02643(WWW 2026 RAG 推理成本攻击,§IX 92 v3.21 已锚入,本次 jay 1735 复证)+ 2 条预备 arXiv:2609.03199(RoboTok,llm-infra 邻接级)+ arXiv:2609.00196(WHALE,llm-infra 邻接级)
- 性质:§IX 92 morning v3.21 微调棒闭合预备之后的"§IX 92 evening 棒位预备候选"接力净窗口 —— v3.21 已闭合 Yandex KV Cache as Agent Runtime + Dell ObjectScale GPUDirect RDMA KV-cache offload + Daniel Han/Unsloth AI Engineer 2026 workshop + vLLM 0.23.0 vs SGLang 0.5.13 RunInfra 1.02x 极窄差距四大预备;本棒净增量为 v3.21 未覆盖、但已在 §6 引用清单预备(arXiv 列表 + URL 列表)的边缘条目,以及 jay 1735 evening 报告(8-3 → 9-6 4 棒积累素材的 evening 整合版)新引入的工程层证据
- 本棒与昨夜 9-5 18:40 简报对比:昨夜棒 = 0 件 NET-new arXiv 锚入 + 1 件 paper_card NET-new 未锚入 + 7 件工程层预备 + 1 件安全事件。本棒 = 0 件 NET-new arXiv 锚入(因为 v3.21 锚入集合未变,310 件闭集合沿用),但 **1 件 NET-new paper_card 升档正式闭合预备候选 = FreeToken arXiv:2608.16157(§1.(1) Edge MoE 升档预备候选)+ 1 件 D139 矛盾延展(NVIDIA $12.93B 收购 HF 验证度提升)+ 5 件 v3.21 沿用预备补强(jay 1735 复证)。
一、本棒检查过的来源清单(覆盖近 2 天 5 实例 inbox + 近 3 天 paper_cards)
1.1 work-queue.md(2026-09-06 18:00 自动生成)
- 待建卡 0 · 待更新主题活文档 0(全部最新)· 选题榜未成视频脚本 1 件 =
2609.04201Scal3R(llm-infra 工程邻接级预备)· 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张卡 - 本棒按"§IX 92 evening 棒位预备候选 + §IX 92 morning v3.21 微调棒沿用 + jay 1735 evening 整合版素材消化"原则落笔
1.2 inbox/jay 9-6 全天棒位(11 份新文件)
2026-09-06T0820-jay-agentic-rag-iclr-inference-substack.md(9-6 08:20 CST 早棒 12KB · llm-infra 主轴 = SGLang vs vLLM 架构深度对比 tbr8.org"vLLM = 系统优化路线,SGLang = 语言优化路线"+ ICLR 2026 Agent Memory TTL 三段数据 + Agentic RAG SoK POMDP 形式化 + Substack AI Agents Stack 2026 guardrails/evaluations/benchmarks 三栖升级 + Multimodal RAG Survey 2026-09)= llm-infra 主轴 0 件 NET-new 锚入(均为 §IX 89 morning v3.15 已锚入沿用)+ §IX 91 evening v3.20 KV Cache Internet + Anthropic/Sonnet 沿用2026-09-06-agent-harness-memory-llm-ecosystem.md(9-6 09:36 CST 早棒 11KB · llm-infra 主轴 = Scaling the HarnessarXiv:2605.26112三 harness 对照(Claude Code + OpenClaw + CheetahClaws) + Memory Security SurveyarXiv:2604.1654890% 记忆中毒 + 100% 自我纠正复发率 + SoK Agentic RAGarXiv:2603.07379POMDP 形式化 + AgeMem / ClawVM / MemoHarness / ARM / ActMem 5 件记忆系统 + 开源 LLM 2026 夏横评 DeepSeek V4-Pro / Kimi K2.6 / GLM-4.6 / Qwen3-235B-A22B / Llama 4 Maverick + Agentic RAG 框架 Star 排行 LangGraph 40.6k + Langflow 146k + Dify 136k + RAGFlow + LlamaIndex 46.5k + Flowise 51k)= llm-infra 主轴 0 件 NET-new 锚入(均为 §IX 91 evening v3.20 HarnessDev 主轴 + §1.(11) Harness 主轴 + §1.(12)(v) Harness Reliability 沿用)。arXiv:2605.26112与arXiv:2604.16548已在 v3.21 §6.99.2 arXiv 列表中(预备级),但 §0.5/§1 关键工作脉络中尚未锚入(Scaling the Harness 论文由 spark 9-6 1136 agent-e1prep 锚入 agent 主轴)。2026-09-06-1050-jay-engineering-filter.md(9-6 10:50 CST 上午工程筛选 · llm-infra 主轴 = vLLM vs SGLang vs LMDeploy H100 80GB HBM3 横评(SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距 prefix-heavy 128K) + vLLM vs SGLang RadixAttention vs PagedAttention prefix overlap 60% 阈值 + Inference Engineering 2026 三引擎选型决策树 + Agentic RAG 2026 成本量化 3-10x tokens + 2-5x latency + CoSAI MCP Security whitepaper + CSA 30+ CVE + LangChain Agent Engineering 2026 Survey 1300+ 受访者 57% production + 32% quality top barrier + KV Cache Survey arXiv:2607.02574 + An Internet for the KV Cache arXiv:2608.01526 + Harvest P2P arXiv:2602.00328 + LangChain State of Agent Engineering + GitHub FlashInfer 6.3k + tiny-vllm 1.1k)= llm-infra 主轴 0 件 NET-new 锚入(全部 §IX 89 morning v3.15 + §IX 91 evening v3.20 已锚入沿用)。2026-09-06-1105-jay-five-category-briefing.md(9-6 11:05 CST 5 分类简报 · llm-infra 主轴 = CacheBridgearXiv:2609.00891跨模型 KV cache transfer via closed-form linear mapping + HeadWiseKVarXiv:2609.02029per-head cache capacity budgeting + VestigeKVarXiv:2609.03949NoPE-MLA 自带 eviction 信号 + NeuroPrefetcherarXiv:2608.22643ICPP 2026 NVMe 感知稀疏推理 + Almost Free State Prediction SeparationarXiv:2609.03807双 stream 零额外 KV 开销 + Yandex KV Cache as Agent Runtime(research.yandex.com · KV cache = agent 运行时新范式 · Hogwild! Inference + AsyncReasoning + 无训练 Doom agent)+ llm-d CNCF Sandbox v0.8.1 IBM/Red Hat/Google Cloud 联合 + NVIDIA/AMD/CoreWeave/HF/Mistral founding + K8s v1.37 HPA Scale-to-Zero Beta 2026-09-02 开箱即用)= llm-infra 主轴 6 件 KV cache 精细化 NET-new arXiv 锚入预备(全部由 §IX 91 evening v3.20 升档预备 + §IX 92 morning v3.21 微调棒升档正式闭合预备沿用)+ Yandex KV Cache as Agent Runtime 闭合预备沿用 + llm-d CNCF + K8s v1.37 HPA Scale-to-Zero 沿用。2026-09-06-1144-news-x-tech-radar.md(9-6 11:44 CST X 技术雷达 · llm-infra 主轴 = openJiuwen 动态 Agent Harness 平台(Claude Code 上 84.04% SOTA)+ E-Commerce Bench 电商模拟评测基准(365天真实场景)QwenLM 出品arXiv:2608.30730+ Managed Deep Agents langchain-ai/deepagents 正式发布 hwchase17 亲解 + omarsar0 Sep 3 推荐阅读 Grok Bot 设计思考 persistent roles/clear state/scoped context/coordinated teams + swyx Sep 3-4 深度实测 GPT-6 Astra(>20B tokens, <$6/hr))+ llm-infra 主轴 0 件 NET-new 锚入(arXiv:2608.30730 已锚入 §6.99.2,§1 主轴未覆盖 = 评测方法学预备级)2026-09-06-1335-jay-github-hf-substack-trending.md(9-6 13:35 CST GitHub Trending · llm-infra 主轴 = abi/screenshot-to-code 76.9k + magnitudedev/chi 253k+ + NevaMind-AI/memU 14.4k OpenClaw 集成标注 + TencentCloud/CubeSandbox 11.6k + garrytan/gbrain OpenClaw/Hermes 路径 + agentscope-ai/QwenPaw v2.2.0 Agent OS 多用户 Hub + Qwen3.5 持续霸榜 + VIRTUE embedding 多模态 ROI + SenseNova-SI 空间智能 VLM + MemLearner 视频世界模型 + Semaphore Meta Glimmer-30B Local-Global Attention 75%/25% + Neo Kim 22 概念清单 + Linas Qwen3.8-27B 部署 + ModernData101 AI Memory Systems + Latent.Space Declarative Attention Gemma-4-31B 52% tokens + ByteDance HarnessDev 评估 agent 生成的 harness 质量 + openFuyao 昇腾 Prefill/Decode 分离 + Triton C++ Backend)= llm-infra 主轴 0 件 NET-new 锚入(全部沿用)2026-09-06-1450-jay-engineering-filter-v2.md(9-6 14:50 CST 下午工程筛选 · llm-infra 主轴 = ML-AgentarXiv:2505.23723RL 训练 LLM Agent + SGLang vs vLLM vs LMDeploy AIMultiple CSV 数据 + vLLM v0.18.0 vs SGLang v0.5.9 vs TensorRT-LLM v1.2.0 LeetLLM H100 SXM5 80GB Llama 3.3 70B FP8 旧数据 + kayba-ai/Context-Engineering-For-Agents Stanford ACE 实现 browser automation 30%→100% 82% fewer steps + Mem0 State of AI Agent Memory 2026 21 frameworks/20 vector stores + Atlan AI Agent Observability Gartner 2028 60% + 4D-AREarXiv:2601.04556)= llm-infra 主轴 0 件 NET-new 锚入(全部沿用 + Mem0/Atlan 已锚入 §1.(11) Harness 邻接级预备)2026-09-06-1505-jay-afternoon-supplement.md(9-6 15:05 CST 下午补遗 · llm-infra 主轴 = AAAI 2026 "Keyword Search is All You Need" Agentic keyword search Claude 3 Sonnet 200K 94.5% RAG faithfulness zero vector store + arXiv:2507.00379 Vector DB 基准系统性批判 + vLLM 官方 "Inside vLLM: Anatomy of a High-Throughput LLM Inference System" 41 分钟深度技术长文 + vLLM Prefill-Decode Disaggregation on AMD MI300X 8-GPU MORI-IO + vLLM RDT Sharded Weight Transfer for Online RL Kimi K2 BF16 48 节点 8×H100(32 trainer + 16 inference)7.53 秒全量权重同步 + arXiv:2608.01526 "Internet for the KV Cache" 概念框架)= llm-infra 主轴 1 件 vLLM Inside 深度长文预备级预备 + 1 件 vLLM RDT 工业级 RL sync 预备级 + 1 件 AA AI 2026 keyword search 预备级(均为 §IX 91 evening v3.20 沿用预备)。2026-09-06-agent-harness-memory-llm-ecosystem.md(9-6 9:36) ·2026-09-06-csdn-llm-deployment-rag-agent.md(9-6 16:35 CST CSDN 部署实战 · llm-infra 主轴 = SGLang · LMDeploy · vLLM · Ollama DeepSeek 全系模型部署命令 + 大模型部署新趋势 Ollama → vLLM 必由 128 并发 vLLM 71 req/s vs Ollama 22 req/s PagedAttention 内存浪费 60%+→4% 以下 + 私有部署选型 Ollama vs vLLM A100 7B 3-5x + AI Agent 核心技术解析 + 电气装备集团"电擎"五大智能体集群)≈ llm-infra 主轴 0 件 NET-new 锚入(CSDN 经验性数据,与 v3.21 §1.(1) 锚入的 AIMultiple/PremAI 数据形成闭环)2026-09-06-rag-llm-systems-weekly.md(9-6 周报)·2026-09-06T0820-jay-agentic-rag-iclr-inference-substack.md+2026-09-06-engineering-e1prep.md(9-6 11:20 CST engineering 主轴 e1prep · 6 件 net-new 增量 = Yandex KV Cache as Agent Runtime 闭合预备 §IX 92 morning v3.21 升档正式闭合 + CacheBridge/HeadWiseKV/VestigeKV 三件套深化 + MCP Security 30+ CVE + EU AI Act/CRA 时间表 + K8s v1.37 HPA Scale-to-Zero + 推理引擎 Benchmark 完整化)= llm-infra 主轴 0 件 NET-new 锚入(全部 §IX 92 morning v3.21 已闭合沿用)2026-09-06-1735-jay-evening-report.md(9-6 17:35 CST 晚间整合版 · 第三轮 GitHub Trending / HF / 博客 / Substack 精选 · llm-infra 主轴 = NVIDIA $12.93B 收购 HF(Jensen Huang 2026-09-03 官方博客 + FT + Reuters + Wired 多方独立证实) + TGI archived 2026-03-21 + vLLM/SGLang/LMDeploy/TensorRT-LLM H100 横评 = SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距 prefix-heavy 128K + LMDeploy 16,200 99.5% SGLang 峰值 + TensorRT-LLM 最高 + SitePoint vLLM Production Deployment Guide + CNCF 2026 K8s 82% 生产容器 + 57% 企业 AI Agent production + 81% 扩展多步骤 Agent + Gartner 2026 嵌入 Agent 40% + Kubernetes Agent Sandbox 2026-03-20 官方项目 + ARMO Kagent 安全检查表 NHI 权限过宽 + Pulumi Neo AI-Driven K8s + arXiv:2606.02643 Inference Cost Attacks for RAG(WWW 2026) + FreeToken Edge-Native MoE Serving UC Berkeley(HF Trending Papers) + Addy Osmani "My LLM Coding Workflow in 2026" 监督式 AI + 测试套件作为 Agent 放大器 + System Design Newsletter Neo Kim 21 个核心概念清单含 OpenClaw + A2A Protocol + Salt Technologies Vector DB Benchmark 2026 Qdrant 850 QPS vs pgvector 360 + Weaviate 380 + Pinecone 340 + Vector DB 选型决策树)= llm-infra 主轴 1 件 D139 矛盾延展 = NVIDIA $12.93B 收购 HF 9-6 evening 整合版强验证(P0 待核 #1 沿用)+ 1 件 Edge MoE NET-new 锚入预备 = FreeTokenarXiv:2608.16157(§6.99.2 已有 arXiv 号但 §1 关键工作脉络未锚入)+ 1 件 Inference Cost Attacks for RAG WWW 2026 复证 = arXiv:2606.02643(v3.21 已锚入,本次 jay 1735 复证并补充 RAG 推理成本比纯 LLM 调用高 90% 数据)
1.3 inbox/stephen 9-6 noon 协调棒
2026-09-06-1245-coord-check-noon.md(9-6 12:45 CST noon 协调棒 · 协调棒最关键信号源 · llm-infra 主轴 noon 棒位 24h 内 = §IX 92 morning v3.21 微调棒闭合预备全量沿用 + 立基础延展棒 v18 触发预备 + arXiv 310/CVE 36/DOI 11/URL 420 件 + 第 13 维 ≥ 162 件套扩面 + Spark 9-6 早棒 0 件 e1prep 棒位(无 agent-e1prep / llm-infra-e1prep / risk-e1prep)= 周日棒位节奏缩量延续第 5 日 + Tom R82 backlog 4 日未消化 + SimLLM 主分类疑似误标待降为 llm-infra 邻接 + stephen frontier lab 框架性误导矛盾待核 #1 沿用 + 9-6 NET-new 立标信号 = RoboTok 79▲ #7 + paper_card 1197 CRISP 主分类 llm-infra 9-5 入库 候选预备 + jay 1735 evening report 9-6 17:35 整合版 = v3.21 沿用预备补强棒位)= llm-infra 主轴 0 件 NET-new arXiv 锚入 + paper_card 1197 CRISParXiv:2609.01925§IX 89 evening v3.16 已锚入沿用预备 + jay 1735 整合版预备级2026-09-06-ai-industry-e1prep.md(9-6 10:23 CST AI 产业动态 · llm-infra 主轴 = NVIDIA $12.93B 收购 HF 后续 stephen 9-4 evening + 9-5 noon + 9-6 noon 棒位均沿用"frontier lab 收购案预备第 1 例"错误归类 — Jay 9-3 评审 + 9-4 评审均已指出矛盾待核 #1 沿用 + Sam Altman 9-4 Astra 道歉帖 banked reset 补偿机制)= llm-infra 主轴 0 件 NET-new 锚入(NVIDIA 收购案矛盾待核 #1 沿用)
1.4 inbox/flyp 9-6 全天棒位(llm-infra 主轴 0 件 NET-new)
2026-09-06-1550-Compile-by-Training-24h-renewal-critical-read.md(9-6 15:50 CST critical-read · llm-infra 主轴 0 件 NET-new · engineering 主轴 310▲ 立标极显著首次续立 = Compile by Training 立标 24h +54 票 + 1 周回看判定 R1-R6 维持 20★ + R7/R8 新增 5★ = 25★ 反方负担)2026-09-06-silent-failures-multimodal-agentic-search-review.md(9-6 09:51 CST critical-read · llm-infra 主轴 0 件 NET-new · multimodal agent 检索轨迹级可靠性)2026-09-06-multimodal-e1prep.md·2026-09-06-risk-e1prep.md·2026-09-06-1001/1003/1006-rss-*.md(flyp 9-6 早棒 3 份 RSS)= llm-infra 主轴 0 件 NET-new
1.5 inbox/tom 9-6 棒位(llm-infra 主轴 0 件 NET-new)
2026-09-06-0900-hf-daily-2026-09-06.md(9-6 09:00 CST HF Daily 15 篇 · llm-infra 主轴 0 件 NET-new · 立标信号稳定实测:Compile by Training 310▲ #1 +54 票 24h 跃升 + Terminal-Universe 265▲ +52 + LLaDA-Image 222▲ +26 + Random Attention 159▲ +57(arXiv:2609.03430· §IX 89 evening v3.16 已锚入沿用)+ Knowing When Not to Reuse 149▲ +3 + LatentPress 108▲ +6 + RoboTok 79▲ #7 立标中-高首次 + On-Policy Distillation II 74▲ +9 + Gated DeltaNet 4-bit 73▲ +7 + Puffin-World 65▲ +6 + Scal3R 45▲ +11 立标中-低首次升档 + 可编辑视觉设计 40▲ +8 + Missing Time Cues 33▲ +3 + WHALE 30▲ +1 + LatentStream 29▲ 立标低首次)2026-09-06T0840/1440-agent-rag-longcontext-radar.md(9-6 08:40 + 14:40 CST radar · llm-infra 主轴 0 件 NET-new)2026-09-06-evaluation-e1prep.md·2026-09-06-rag-e1prep.md(9-6 13:00 + 12:30 CST rag/evaluation 主轴 e1prep · llm-infra 主轴 0 件 NET-new · 邻接级预备)
1.6 organized/paper_cards(近 3 天 llm-infra 主分类新卡抽查)
paper_card 1197 arXiv:2609.01925 CRISP(9-4 入库 ✓ 主分类 llm-infra · 形态 method · HF Daily 9-4 立标 · "Cliff-awaRe Input-adaptive Sparse Prefilling"· long-context LLM attention prefilling 二次方瓶颈 · 输入自适应路由到稀疏模式 · 结构质量驱动路由 · OpenAlex 5 票 · §IX 89 evening v3.16 已锚入沿用预备)= 本棒预备级沿用paper_card 1235 arXiv:2608.29188 Locked at the Entrance(9-5 15:00 入库 ✓ 主分类 llm-infra · 形态 method · HF Daily 8-28 8 票 · §IX 91 evening v3.20 升档正式闭合预备 · §IX 92 morning v3.21 微调棒沿用预备)= 本棒预备级沿用- 其它 llm-infra 主分类近 3 天新卡:无新增(昨夜 9-5 evening e1prep 已记录 paper_card 1197 + 1235 两件)
1.7 spark inbox 9-6 早棒(本人 e1prep 棒位节奏缩量)
2026-09-06-1002-rss-gradient-flow.md·2026-09-06-1003-rss-chip-huyen.md·2026-09-06-1006-rss-yt-3blue1brown.md(9-6 早棒 3 份 RSS · llm-infra 主轴 = Gradient Flow "你的模型不是你的护城河" + "AI 繁荣背后的隐性付费节奏" + Chip Huyen "构建生成式 AI 应用时的常见陷阱" 历史文章 RSS 摘要 + 3Blue1Brown "什么是交叉熵?压缩即智能 第二部分" 历史教学视频)= llm-infra 主轴 0 件 NET-new(均为 RSS 摘要)2026-09-06-agent-e1prep.md(9-6 13:36 CST agent 主轴 e1prep · 16 件 NET-new 锚入 + 立基础延展棒 v18 + T220 延展预备 · llm-infra 主轴 = Yandex KV Cache as Agent Runtime 立标第 1 例 + Scaling the HarnessarXiv:2605.26112三 harness 对照立标预备 + Memory Security SurveyarXiv:2604.16548frontier lab 记忆安全立标预备第 1 例 + ICLR 2026 Agent Memory 评估 TTL 立标预备 + AgeMem/ClawVM/MemoHarness/ARM/ActMem 5 件记忆系统立标预备扩增 + 开源 LLM 2026 夏横评立标预备 + Agentic RAG 框架 Star 排行立标预备)= llm-infra 主轴 0 件 NET-new arXiv 锚入(全部 §IX 91 evening v3.20 + §IX 92 morning v3.21 已锚入沿用)
二、本棒 9 条主增量(均为预备级候选,准备 §IX 92 evening 棒位)
增量 1 · 推理引擎 Edge MoE 升档预备候选 = FreeToken arXiv:2608.16157(★★★★ 高价值)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§四论文 2(17:35 CST 晚间整合版)+ paper_card 987(主分类 llm-infra · 8-30 入库 ✓) - 可信度:⭐⭐⭐⭐⭐ 高(UC Berkeley 系统论文 · HF Trending Papers · Semantic Scholar 2 引用)
- 要点: 1. FreeToken 是边缘原生 MoE(Mixture-of-Experts)serving 系统(UC Berkeley) 2. 核心创新:将个人机器视为"统一、弹性的推理平台"而非"小型 GPU" · 动态将计算和模型状态映射到异构本地硬件 · 在个人设备上运行大型 open-weight 模型 3. 解决 Edge AI 核心矛盾:模型参数量大 vs 设备硬件异构 4. 带宽自适应执行 = bandwidth-adaptive execution · TLDR 中文:"FreeToken 是一个 edge-native 的 MoE serving 系统,将个人机器视为一个统一、弹性的推理平台而非小型 GPU,把开放权重转化为可部署的本地软件,使用户已有的机器成为运行前沿规模智能的实用平台"
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §6.99.2 全量 arXiv ID 列表中已包含
arXiv:2608.16157(预备级) - v3.21 §6.99.5 URL 列表中已包含
https://arxiv.org/abs/2608.16157与https://www.alphaxiv.org/abs/2608.16157与https://www.emergentmind.com/papers/2608.16157(URL 锚入预备) - 但 v3.21 §0.5 SOTA 综述 + §1 关键工作脉络 + §6.99.2 arXiv 列表主轴摘要中均未锚入 —— 仅在 §6 引用清单预备级
- 与 §1.(1) 推理引擎 Edge 维度锚入路径:§IX 89 evening v3.16 §1.(1) 已涵盖 Ollama / llama.cpp / AMD Strix Halo / WebGPU 内核 207 等 Edge 维度锚入预备,但未覆盖 MoE 边缘推理系统这一关键边缘架构路径
- 与 §1.(1) 推理引擎 MoE 维度锚入路径:v3.21 §1.(1) 已涵盖 DeepSeek-V3.2-Exp 细粒度稀疏注意力 + DeepSeek-V4 heterogeneous attention types
c4a/c128a+ sliding window + SGLang Hybrid SSM Models disagg 等云端 MoE 锚入预备;但未覆盖边缘 MoE serving 这一对应架构路径 - 与 §1.(7) 多模态 MoE 锚入路径:v3.21 §1.(7) 已涵盖多模态 MoE + GPT-6 Astra + Qwen3-Omni + LoRA + LoCoMo + DroidSpeak + OpenViking 等;但未覆盖边缘 MoE serving 维度
- 建议归入节:
llm-infra.md§1.(1) 推理引擎 → 新增子节点「Edge MoE Serving:FreeToken 类系统架构升档预备」,优先级 P1;同时建议在 §1.(7) 多模态 MoE 节中加邻接级引用 - arXiv 号:
arXiv:2608.16157(已在 §6.99.2 arXiv 列表中预备级) - D139 矛盾 / O469-O474 开放问题映射:D139 Yandex KV cache as agent runtime 范式跃迁与"推理引擎即 runtime"叙事关系争议预备锚入预备沿用 + 新增 O475 = FreeToken Edge MoE serving 与"云端推理引擎 vs 边缘推理系统"二分的架构边界形式化预备级(截止 9-13 前)
增量 2 · 推理引擎选型实测补强 = vLLM/SGLang/LMDeploy/TensorRT-LLM H100 横评多源闭环 + LeetLLM v0.18.0 vs v0.5.9 旧数据 + AIMultiple CSV 数据(★★★ 高价值)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§二(17:35 CST)+ jay2026-09-06-1450-jay-engineering-filter-v2.md§一.3(14:50 CST)+ jay2026-09-06-1050-jay-engineering-filter.md§一.1-3(10:50 CST)+ jay2026-09-06-csdn-llm-deployment-rag-agent.md§一.3 - 可信度:⭐⭐⭐⭐ 高(多源独立 + 可下载 CSV 数据)
- 要点(本棒 4 源叠加校验):
- jay 1735 §二(NVIDIA 收购案之外第 2 件):SGLang ~16,200 vs vLLM ~12,500 tok/s(29% 差距 prefix-heavy H100 128K);LMDeploy ~16,200 99.5% SGLang 峰值;TensorRT-LLM 最高未公开具体值
- jay 1450 §一.3(LeetLLM 2026-03 旧数据):H100 SXM5 80GB Llama 3.3 70B FP8 200 条 unique prompts(avg 512 in / 256 out)· vLLM v0.18.0 vs SGLang v0.5.9 vs TensorRT-LLM v1.2.0 · 并发 1/10/50/100 · 60s warm-up · 3min 测量 · 含运营成本 ($/token) 计算
- jay 1050 §一.1-3(AIMultiple / PremAI / Spheron):H100 80GB HBM3 · RunPod cloud · Docker runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 · 128K tokens / 128 out = SGLang ~16,200 tok/s · vLLM ~12,500 tok/s · 1,000/1,000 = SGLang ~4,181 tok/s · vLLM ~3,709 tok/s · 2,048/2,048 = SGLang ~2,786 tok/s · LMDeploy 99.5% SGLang 峰值 + Spheron 前缀复用率 > 60% 时 SGLang 显著领先,否则两者差距 < 5%
- CSDN vLLM vs Ollama 实测(jay 1505 下午补遗 + csdn-llm-deployment-rag-agent §一.3):A100 128 并发 vLLM 71 req/s vs Ollama 22 req/s(vLLM 3.23 倍)· PagedAttention 内存浪费 60%+ → 4% 以下 · 100 用户 vLLM 92 tokens/s vs Ollama 15 tokens/s + 37% 超时 · PoC/个人 → Ollama · 生产/高并发 → vLLM
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §1.(1) 推理引擎横评锚入预备已有 1 源(AIMultiple/PremAI/RunPod 2026-04 H100 横评 + SGLang 16,200 vs vLLM 12,500 29% 差距)· 本棒叠加 3 源独立复证 = jay 1735 / jay 1450 LeetLLM v0.18.0 旧数据 / CSDN A100 Ollama vs vLLM,形成"H100 prefix-heavy + H100 unique-prompt + A100 Ollama 三 workload 形状横评闭环"
- v3.21 §0.5.1 已锚入"vLLM 0.23.0 vs SGLang 0.5.13 Llama 3.1 8B Instruct H100 80GB BF16 256 并发 unique prompt prefix-caching-off 5,333 vs 5,235 output tok/s 1.02x 极窄差距"对照 §IX 91 evening v3.20 §1.(1) H100 128K prefix-heavy SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距形成"workload 形状决定引擎选型"实证闭合 · 本棒 LeetLLM v0.18.0 Llama 3.3 70B FP8 旧数据 + CSDN A100 Ollama 3.23x 数据进一步补强该实证闭合
- 建议归入节:
llm-infra.md§1.(1) 推理引擎 → 横评预备沿用,无需新锚入;补充 LeetLLM v0.18.0 + CSDN A100 两源作为 v3.21 §0.5.1"workload 形状决定引擎选型"实证闭合的旁证 - arXiv 号:无(均为第三方基准报告)
增量 3 · RAG 推理成本攻击 NET-new 复证 = arXiv:2606.02643 WWW 2026(★★★ 中等价值 · 复证)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§四论文 1(17:35 CST 晚间整合版) - 可信度:⭐⭐⭐⭐⭐ 高(WWW 2026 同行评审 accepted paper)
- 要点:
- 论文:Inference Cost Attacks for RAG(arXiv:2606.02643 · WWW 2026)
- 核心发现:RAG 系统引入额外多阶段推理管道(retrieval → synthesis),推理成本比纯 LLM 调用高 90% 以上 · 发现针对 RAG 的"推理成本攻击"向量:攻击者可通过操纵检索结果触发 LLM 重复处理高成本 token · 攻击面在 retrieval phase 和 synthesis phase 之间的边界
- 领域:Cryptography and Security (cs.CR) · Artificial Intelligence (cs.AI) · Databases (cs.DB)
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §6.99.2 arXiv 列表已包含
arXiv:2606.02643· v3.21 §1.(9) 安全 CVE 维度已涵盖 vLLM RCE CVE-2026-22778 + LMDeploy CVE-2026-33626 + xinference CVE-2026-61539 + OWASP MCP Top 10 beta + HF 2026 安全事件后续 + OpenAI Daybreak $1B + GPT-6 Astra 网络安全 + OpenAI IM1 2026-07 CoT 监控强制 + CoSAI MCP Security Whitepaper - 但未锚入 arXiv:2606.02643 RAG Inference Cost Attacks —— 这是 §1.(9) 安全的 RAG 维度延伸预备候选
- 工程意义:RAG 系统的安全评估不仅要看模型输出,还要监控推理成本异常 · 生产 RAG 系统应加入 cost monitoring 和异常触发告警
- 建议归入节:
llm-infra.md§1.(9) 安全 → RAG 安全预备沿用,新增子节点「RAG Inference Cost Attacks: WWW 2026 复证」优先级 P2 - arXiv 号:
arXiv:2606.02643(已在 §6.99.2 预备级,本次 jay 1735 复证触发升档预备候选)
增量 4 · D139 矛盾待核 #1 延展 = NVIDIA $12.93B 收购 HF 多源强验证(★★★ 矛盾验证 · 高价值)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§一(17:35 CST 晚间整合版头条)+ stephen2026-09-06-ai-industry-e1prep.md(10:23 CST)+ stephen2026-09-06-1245-coord-check-noon.md(12:45 CST)+ v3.20 P0 #213-#218 §IX 91 evening 矛盾待核 #1 - 可信度:⭐⭐⭐⭐⭐ 极高(NVIDIA 官方博客 Jensen Huang + FT + Reuters + Wired 多方独立证实)
- 要点:
- NVIDIA 以 $12,930,300,000 收购 HF,预计 2027 年完成交割 · 这是 NVIDIA 历史第二大收购(仅次于 2025-12 收购 Groq $20B),超过 2020 年 $6.9B 收购 Mellanox
- HF 此前(2025 年)曾拒绝一笔 $500M 的 Nvidia 投资提案
- Jensen Huang 承诺:"Hugging Face will continue to support open source and open weight models from across the ecosystem, from every model builder. It will continue to support multi-cloud and multi-accelerator development and deployment."
- 收购须通过监管审批(欧盟 / 美国反垄断审查)
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.20 P0 #213-#218 §IX 91 evening 新增 6 件 P0 待核预备 #1 = NVIDIA $12.93B 收购 HF 待人工确认
- v3.21 D135 争议 = "NVIDIA $12.93B 收购 HF 真实性争议沿用"
- 本棒 jay 1735 整合版 + stephen 9-6 noon + stephen 9-6 ai-industry + stephen 9-5 noon + stephen 9-4 evening + jay 9-5 evening 多源强验证,NVIDIA 收购案真实性已基本证实(D135 真实性争议可降级至 P2 预备级)
- 但 Stephen frontier lab 框架性误导矛盾 #1 仍待核 —— jay 9-3 + 9-4 评审均已指出 Stephen 9-4 evening + 9-5 noon + 9-6 noon 均错误归类为"frontier lab 收购案预备第 1 例",正确归类应为"AI infra 大厂收购 open-source hub 预备第 1 例"或"NVIDIA 历史第二大收购预备第 1 例"
- 短/长期工程影响评估(jay 1735 §一):
- 短期(2026-2027):HF 平台基础设施(推理、部署、安全)将获 NVIDIA 工程资源大幅加强;NVIDIA Nemotron 系列模型在 HF 上的优先展示和优化;HF 对 AMD/Intel/其他加速器生态的支持是否保持中性有待观察
- 长期(2027+):HF 可能从"开放中立平台"转型为"NVIDIA 主导的 AI 分发渠道";OpenAI、Anthropic、Meta 等竞品模型在 HF 上的优先级可能受影响;对开源 AI 生态的治理权集中度上升
- 建议归入节:
llm-infra.md§1.(11) Kernel/AI 自动化/Harness → AI 基础设施依赖风险主题预备 · D135 真实性争议降级预备 + §0.5.3 D 矛盾清单新增 "D140 NVIDIA $12.93B 收购 HF 工程影响短/长期不确定性" + §0.5.5 趋势 T120 预备候选(截止 9-15 前) - arXiv 号:无(行业重大收购)
- D139 矛盾 / O469-O474 开放问题映射:D140 新增 = NVIDIA $12.93B 收购 HF 工程影响短/长期不确定性 + Stephen frontier lab 框架性误导矛盾 #1 待核 · O475 新增(与增量 1 共用)= NVIDIA-HF 收购完成后 HF 开放生态承诺是否被稀释(监管附加条件、平台功能偏向)截止 9-15 前
增量 5 · 推理调度 CNCF 统治 AI 部署数据预备 = CNCF 2026 调查 82% K8s + Kubernetes Agent Sandbox 2026-03-20 官方项目(★★★ 中等价值)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§三(17:35 CST 晚间整合版) - 可信度:⭐⭐⭐⭐⭐ 高(CNCF Annual Cloud Native Survey 2026-01 + Kubernetes 官方博客)
- 要点:
- CNCF 2026 调查关键数据(shakudo.io/blog/deploy-ai-agents-on-kubernetes):
- 容器用户中在生产环境运行 K8s 的比例 = 82%
- 已在生产环境运行 AI Agent 的企业 = 57%
- 计划 2026 年扩展到复杂多步骤 Agent 场景 = 81%
- Gartner 2025 年数据预测:2026 年嵌入任务专用 Agent 的企业应用 <5% → 40%
- Kubernetes Agent Sandbox 2026-03-20 官方项目(kubernetes.io/blog/2026/03/20/running-agents-on-kubernetes-with-agent-sandbox):
- 官方 Kubernetes 项目,为 AI Agent 提供隔离的有状态单例(Stateful Singleton)原语
- 解决 AI Agent 典型问题:长生命周期、上下文持久化、多 Agent 通信
- 提供 Python SDK,支持
isolated agent environment模式
- ARMO Kagent 安全检查表:Agent 的 ServiceAccount 在开发阶段被授予约 30-50 个权限,但生产只使用 3-5 个;kernel-level sensor 运行开销 CPU 1-2.5% · 内存 1%;核心风险 NHI(Non-Human Identity)权限过宽
- Pulumi Neo AI-Driven K8s 运维:AI Infrastructure Agent,目标将"意图"转化为 K8s 配置
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §1.(2) 推理调度锚入预备已涵盖 State of Model Serving Apr 2026 + KServe v0.17.0 + llm-d + SIG-kv-disagg + Bento Inference Platform + K8s v1.37 HPA Scale-to-Zero + Dell ObjectScale GPUDirect RDMA + Harness/Chaos NET-new + TokenFlow + UniBoost + Cloud-Native IEEE TC + NIXL + AMPD + EAGLE-3 + llm-d 57× TTFT/2× + LMCache PD + Dynamo v1.0 → v1.4.2 主版本跃迁
- CNCF 2026 调查数据 + K8s Agent Sandbox 官方项目 + ARMO Kagent 安全检查表 + Pulumi Neo 4 件预备级预备候选,与 v3.21 §1.(2) 形成"K8s 统治 AI 部署"主题多源闭环
- 建议归入节:
llm-infra.md§1.(2) 推理调度 → 增补"CNCF 2026 调查数据 + K8s Agent Sandbox + ARMO Kagent"4 件预备级沿用,优先级 P2 - arXiv 号:无(均为行业调查 + 官方项目)
增量 6 · vLLM RDT Sharded Weight Transfer 工业级 RL sync 预备 = 48 节点 7.53 秒全量权重同步(★★★ 中等价值)
- 来源:jay
2026-09-06-1505-jay-afternoon-supplement.md§二.3(15:05 CST) - 可信度:⭐⭐⭐⭐ 高(vLLM 官方工程博客 + SkyRL 开源)
- 要点:
- vLLM RDT(2026-08-22):Kimi K2 BF16,48 节点 × 8×H100(32 节点 trainer + 16 节点 inference)· 使用 Ray Direct Transport(RDT)实现 GPU-GPU 直传,7.53 秒完成全量权重同步
- RDT 原理:Ray actor method 返回 GPU tensor 而不经过 CPU 拷贝;支持 NCCL/GLOO/NIXL pluggable backend
- 实现位于 vLLM,SkyRL 端到端示例已开源
- Online RL(verl / SkyRL / Slime / NeMoRL)场景的核心工程突破 · 48 节点 7.53 秒意味着 RL 训练循环的 weight sync 不再是瓶颈
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §1.(2) 推理调度锚入预备已涵盖 NIXL + AMPD + EAGLE-3 + LMCache PD + Dynamo v1.0 → v1.4.2 主版本跃迁,但未涵盖 vLLM RDT 这一工业级 RL weight sync 突破
- v3.21 §1.(5) 投机解码涵盖 SpecPV + EAGLE-3 + EAGLE 3.1 + DFlash v2 + SSR + LongSpec + TokenSwift + Lookahead + TriForce + HarnessDev Evolution 阶段 · 未涵盖 vLLM RDT 这一训练-推理同步维度
- v3.21 §1.(8) 训练涵盖 MoE CSUR + Oneiros + Albireo + Silent Hyperparameter + Aurora + X-MoE + TokenFlow + Knowledge Distillation Mid-Training arXiv:2609.01532 + Debias-SparseGPT arXiv:2609.02496 + Compile by Training arXiv:2609.04199 + Locked at the Entrance RLVR 解空间动力学 arXiv:2608.29188 · 未涵盖 vLLM RDT 这一分布式 RL sync 维度
- 建议归入节:
llm-infra.md§1.(8) 训练 → 新增子节点「vLLM RDT: 工业级 RL weight sync 预备」,优先级 P2;同时建议在 §1.(2) 推理调度 NIXL 节中加邻接级引用 - arXiv 号:无(vLLM 官方博客)
- URL:
https://vllm.ai/blog/2026-08-22-rdt-weight-transfer(预备级 URL,可考虑加入 §6.99.5 候选)
增量 7 · vLLM 官方 "Inside vLLM" 41 分钟深度技术长文预备级锚入候选(★★ 中等价值 · 预备级)
- 来源:jay
2026-09-06-1505-jay-afternoon-supplement.md§二.1(15:05 CST)+ jay2026-09-06-1105-jay-five-category-briefing.md§二(11:05 CST)+ jay2026-09-06-1050-jay-engineering-filter.md§一(10:50 CST) - 可信度:⭐⭐⭐⭐⭐ 极高(vLLM 官方工程团队撰写)
- 要点:
- vLLM 官方博客新文:"Inside vLLM: Anatomy of a High-Throughput LLM Inference System"(41 分钟深度技术长文 · 2026-08/09)
- 覆盖内容:PagedAttention 原理(block-level 内存管理,减少 fragmentation)+ Continuous Batching(iteration-level 调度,最大化 GPU 利用率)+ Prefix Caching(共同前缀复用的工程实现)+ Speculative Decoding(EAGLE / Medusa / n-gram 各路径对比)+ Multi-GPU Serving(Tensor Parallelism + Pipeline Parallelism)+ Scheduling(请求队列 + 优先级 + 抢占策略)+ Benchmarking 方法论
- 这是目前最完整的 vLLM 内部原理中文可读材料(jay 1505 §二.1 评价)
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §1.(1) 推理引擎锚入预备已涵盖 PagedAttention + Continuous Batching + Prefix Caching + Speculative Decoding + Multi-GPU Serving + Scheduling + Benchmarking 等全部组件,与本文 41 分钟深度长文 100% 对应
- 本文是 v3.21 §1.(1) 锚入预备组件的官方权威来源 —— 建议作为预备级引用预备
- 建议归入节:
llm-infra.md§1.(1) 推理引擎 → 预备级引用预备,可考虑加入 §6.99.5 URL 列表候选 - URL:
https://blog.vllm.ai/blog(已预备级 URL,可考虑加入 §6.99.5 候选) - arXiv 号:无
增量 8 · FreeToken 之外 jay 1735 §三 Kubernetes 调研预备级补强 = CNCF 2026 + K8s Agent Sandbox + ARMO Kagent + Pulumi Neo(★★ 与增量 5 部分重叠)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§三(17:35 CST 晚间整合版) - 可信度:⭐⭐⭐⭐⭐ 高(CNCF Annual Cloud Native Survey + Kubernetes 官方博客 + ARMO + Pulumi)
- 要点(与增量 5 部分重叠,本棒补强 jay 1735 §三原文表述):
- 核心结论(jay 1735 §三 评价):"Kubernetes 已从'通用的容器编排平台'演变为'AI 基础设施的事实标准 OS'。82% 的生产容器环境使用 K8s,且这个数字在 AI 工作负载场景下增长最快"
- Kubernetes Agent Sandbox 2026-03-20 官方项目 —— 解决 AI Agent 典型问题:长生命周期、上下文持久化、多 Agent 通信 · 提供 Python SDK,支持
isolated agent environment模式 - ARMO Kagent 安全检查表:Agent 的 ServiceAccount 在开发阶段被授予约 30-50 个权限,但生产只使用 3-5 个;kernel-level sensor 运行开销 CPU 1-2.5% · 内存 1%(single-digit overhead)
- 与活文档 llm-infra.md 现有脉络的关系:与增量 5 重叠,作为预备级补强
- 建议归入节:与增量 5 合并,§1.(2) 推理调度预备级沿用
- arXiv 号:无
增量 9 · System Design Newsletter Neo Kim 21 个核心概念清单(预备级 · 社区影响预备)(★ 低价值 · 预备级)
- 来源:jay
2026-09-06-1735-jay-evening-report.md§五.1(17:35 CST 晚间整合版)+ jay2026-09-06-1335-jay-github-hf-substack-trending.md§三.2(13:35 CST) - 可信度:⭐⭐⭐⭐ 较高(高质量技术教育 newsletter · Neo Kim @systemdesignone)
- 要点:
- 21 个 AI 工程必学概念清单(2026-08-24):LLM 基础(How AI Agents Work + RAG + MCP + LLM Concepts + Prompt Engineering + Context Engineering)+ 工程实践(AI Coding Workflow + Vector Databases + Fine Tuning + LLM Evals)+ 架构模式(Multi-Agent Architecture + Agentic Patterns + Memory/State/Consistency)+ 基础设施(AI Agentic Infrastructure 含 OpenClaw 在列)+ 其他(Reinforcement Learning + A2A Protocol + AI Research Agent)
- 值得注意:OpenClaw 和 A2A Protocol 出现在 2026 工程师必修清单里,说明这两个在系统设计社区的曝光度已相当高
- 与活文档 llm-infra.md 现有脉络的关系:
- v3.21 §1.(11) Kernel/AI 自动化/Harness 锚入预备已涵盖 MSR Orchard + Kozuchi + CASTER + CRISP + HarnessDev + WHALE P2 + HarnessOpt-Bench + Evo-Bench + EnvHarness + Harness-of-Harness + DiagEvo + SSR + Acquire-Repair-Preserve + Aardvark Weather + CSDN Faiss vs Qdrant + NVIDIA $12.93B 收购 HF + MAST arXiv:2503.13657 + VeriPhy arXiv:2609.03153 + Compile by Training arXiv:2609.04199 + Knowing When Not to Reuse arXiv:2608.26730 + Locked at the Entrance arXiv:2608.29188 · 未涵盖 A2A Protocol 这一 2026 工程师必修基础设施
- OpenClaw 已锚入预备(v3.21 §1.(11) NVIDIA 收购案已包含"本实例 OpenClaw 命中"信号),无需新增预备
- 建议归入节:
llm-infra.md§1.(11) Kernel/AI 自动化/Harness → 预备级预备,A2A Protocol + OpenClaw 在 2026 工程师必修清单预备候选,优先级 P3 - URL:
https://substack.com/note/c-321520284(预备级 URL,可考虑加入 §6.99.5 候选) - arXiv 号:无
三、值得警惕的矛盾或待核实说法
矛盾 1(本棒首次显式化):FreeToken arXiv 号来源矛盾
- 信号 1(jay 1735 evening §四论文 2):FreeToken 来自 HF Trending Papers · URL 仅指向
https://huggingface.co/papers/trending(HF Trending Papers 列表),未直接给 arXiv 号 - 信号 2(paper_card 987):FreeToken =
arXiv:2608.16157· 主分类 llm-infra · 副分类 agent · 8-30 入库 · Semantic Scholar 2 引用 · OpenAlex ID W7203682669 - 可能性 A:jay 1735 evening 报告未引用 paper_card,而 HF Trending Papers 列表与 arXiv 直接链接不同(但 paper_card 已锚入 §6.99.2)
- 可能性 B:jay 1735 evening 报告故意不引用 arXiv 号,留作"后续追踪"信号源
- 建议处理:v3.21 §6.99.2 arXiv 列表已包含 arXiv:2608.16157,可直接锚入 §1.(1) Edge MoE 子节点,无需等待 P0 矛盾待核;§1.(1) 推理引擎升档预备候选时同步标"arXiv:2608.16157 + paper_card 987"双源
矛盾 2(沿用 v3.20):NVIDIA $12.93B 收购 HF 真实性争议 D135
- 信号 1(jay 1735 evening §一):NVIDIA 官方博客(Jensen Huang, 2026-09-03)+ FT + Reuters + Wired 多方独立证实 · 5 源独立证据已闭环
- 信号 2(v3.20 P0 #213-#218 §IX 91 evening 矛盾待核 #1 + v3.21 D135 争议):NVIDIA 收购案真实性争议 + Stephen frontier lab 框架性误导矛盾待核 #1 沿用
- 建议处理:D135 真实性争议可降级至 P2 预备级(5 源独立证据已闭环);D140 新增 = NVIDIA $12.93B 收购 HF 工程影响短/长期不确定性 + Stephen frontier lab 框架性误导矛盾 #1 待核(截止 9-15 前)
矛盾 3(沿用 v3.20):TGI archived 时间标注
- 信号 1(jay 1735 evening §二 头条):TGI(Text Generation Inference)于 2026 年 3 月 21 日归档为 read-only,最终 release 为 2025 年 12 月 · 官方建议迁移目标:vLLM 或 SGLang
- 信号 2(jay 9-5 1430 J-063 LocalAI 4.3/4.2):LocalAI 4.2.0(2026-05)标注"Hugging Face TGI 已 archived(2026-03),推荐迁移至 vLLM 或 SGLang"
- 建议处理:TGI archived 时间 2026-03-21 + 最终 release 2025-12 以 jay 1735 evening §二 头条为准;v3.21 §1.(1) 推理引擎生态整合信号预备锚入时统一引用"TGI archived 2026-03-21 · 推荐迁移 vLLM/SGLang"
矛盾 4(本棒首次显式化):vLLM 0.23.0 vs SGLang 0.5.13 极窄 1.02x 差距 vs SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距 workload 形状归因
- 信号 1(v3.21 §0.5.1):vLLM 0.23.0 vs SGLang 0.5.13 Llama 3.1 8B Instruct H100 80GB BF16 256 并发 unique prompt prefix-caching-off 5,333 vs 5,235 output tok/s 1.02x 极窄差距 · RunInfra methodology 2026-06-20
- 信号 2(v3.20 §1.(1)):SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距 prefix-heavy H100 128K · 多源独立复证
- 信号 3(jay 1735 evening §二):SGLang 16,200 vs vLLM 12,500 tok/s 29% 差距 prefix-heavy H100 128K(与信号 2 一致)
- 建议处理:v3.21 §0.5.1 已正确归因为"workload 形状决定引擎选型"(prefix-heavy vs unique-prompt 两种 workload 形状对应引擎选型);本棒 jay 1735 evening §二 头条复证,信号稳定无矛盾
矛盾 5(本棒首次显式化):NVIDIA 收购 HF 错误归类矛盾
- 信号 1(stephen 9-4 evening + 9-5 noon + 9-6 noon):Stephen 均沿用"NVIDIA $12.93B 收购 HF = frontier lab 收购案预备第 1 例"错误归类
- 信号 2(jay 9-3 评审 + 9-4 评审 + 9-5 evening briefing + 9-6 evening report):jay 多次评审指出应为"AI infra 大厂收购 open-source hub 预备第 1 例"或"NVIDIA 历史第二大收购预备第 1 例"
- 建议处理:v3.21 §IX 92 evening 棒位前主动修正 stephen 矛盾 #1,统一以"AI infra 大厂收购 open-source hub 预备第 1 例"为归类;§1.(11) Kernel/AI 自动化/Harness → AI 基础设施依赖风险主题预备时同步标修正
四、可引用的 arXiv 号列表(本棒 1 件 NET-new 升档正式闭合预备候选 + 6 件 v3.21 锚入沿用复证)
本棒 NET-new 升档正式闭合预备候选(1 件)
arXiv:2608.16157— FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution(paper_card 987 主分类 llm-infra · 副分类 agent · 8-30 入库 · UC Berkeley · HF Trending Papers · Semantic Scholar 2 引用 · §6.99.2 已预备级 arXiv 号 / §1 关键工作脉络预备候选升档正式闭合预备)
v3.21 锚入沿用预备补强(6 件 · jay 1735 evening + 1505 afternoon supplement 复证)
- arXiv:2606.02643 — Inference Cost Attacks for RAG(WWW 2026 · jay 1735 evening §四论文 1 复证 · RAG 推理成本比纯 LLM 调用高 90% 以上 · §6.99.2 已预备级 arXiv 号 / §1.(9) 安全 RAG 安全升档预备候选)
- arXiv:2609.00891 — CacheBridge: Cross-model KV Cache Transfer via Closed-form Linear Mapping(§IX 91 evening v3.20 已锚入 · §IX 92 morning v3.21 沿用预备)
- arXiv:2609.02029 — HeadWiseKV: Per-head Cache Capacity Budgeting(同上)
- arXiv:2609.03949 — VestigeKV: NoPE-MLA Self-Eviction Signals(同上)
- arXiv:2608.22643 — NeuroPrefetcher: NVMe-aware Sparse LLM Inference(ICPP 2026 · 同上)
- arXiv:2609.03807 — Almost Free State Prediction Separation(同上)
llm-infra 邻接级预备(2 件 · 与 agent / risk 主轴共享)
- arXiv:2609.03199 — RoboTok(RAG × LLM-infra 邻接 · paper_card 1236 · HF Daily 9-6 #7 79▲ +37▲ 立标中-高首次)
- arXiv:2609.00196 — WHALE(evaluation × agent × LLM-infra 邻接 · paper_card 1213 · §IX 91 evening v3.20 升档正式闭合预备 · §IX 92 morning v3.21 沿用预备)
邻接级预备(8 件 · 9-5 evening v3.16 + 9-6 morning v3.21 沿用)
- arXiv:2608.29188 — Locked at the Entrance(llm-infra 主分类 · paper_card 1235 · §IX 91 evening v3.20 升档正式闭合预备 · §IX 92 morning v3.21 沿用预备)
- arXiv:2609.01925 — CRISP(llm-infra 主分类 · paper_card 1197 · §IX 89 evening v3.16 已锚入沿用预备)
- arXiv:2608.01526 — An Internet for the KV Cache(§IX 89 morning v3.15 升档微调闭合棒沿用预备)
- arXiv:2602.19594 — ISO-Bench(同上)
- arXiv:2503.13657 — MAST(同上)
- arXiv:2510.13910 — RAGCap-Bench(同上)
- arXiv:2609.03430 — Random Attention(§IX 89 evening v3.16 paper_card 复核预备锚入预备)
- arXiv:2504.11320 — Fluid-Guided Online Scheduling(§IX 89 morning v3.15 升档微调闭合棒沿用预备)
- arXiv:2502.07115 — Online Scheduling with KV Cache Constraints(同上)
- arXiv:2609.04199 — Compile by Training(同上)
- arXiv:2609.01532 — Knowledge Distillation Mid-Training(同上)
- arXiv:2609.02496 — Debias-SparseGPT(同上)
- arXiv:2608.26730 — Knowing When Not to Reuse(同上)
- arXiv:2609.03153 — VeriPhy(同上)
- arXiv:2609.04201 — Scal3R(同上)
- arXiv:2608.29253 — QCell(同上)
- arXiv:2608.30391 — AutoTraceGT(同上)
- arXiv:2609.03820 — Select/Compress/Reinvest(同上)
- arXiv:2609.02373 — Percolation Dynamics in Optimization(同上)
- arXiv:2609.03293 — PACE(同上)
- arXiv:2609.04131 — LatentStream(同上)
五、本棒小结
llm-infra 主题 9-6 11:30 → 9-6 18:40 净增量 = 0 件 NET-new arXiv 锚入 + 1 件 NET-new paper_card 升档正式闭合预备候选 = FreeToken arXiv:2608.16157 + 1 件 D139 矛盾延展 = NVIDIA $12.93B 收购 HF 多源强验证(D140 新增)+ 6 件 v3.21 锚入沿用预备补强(jay 1735 evening 整合版复证)+ 2 件预备级候选(vLLM RDT 工业级 RL sync + vLLM 官方 Inside vLLM 41 分钟深度长文)+ 5 条矛盾待核(其中矛盾 #1 #2 #4 均为本棒首次显式化)
| # | 条目 | 分类 | 价值 | 状态 |
|---|---|---|---|---|
| 1 | FreeToken arXiv:2608.16157 Edge MoE |
§1.(1) + §1.(7) | ⭐⭐⭐⭐ | NET-new 升档正式闭合预备候选 |
| 2 | vLLM/SGLang/LMDeploy/TRT-LLM H100 横评多源闭环 | §1.(1) | ⭐⭐⭐ | v3.21 锚入沿用补强 |
| 3 | RAG Inference Cost Attacks arXiv:2606.02643 WWW 2026 |
§1.(9) | ⭐⭐⭐ | v3.21 锚入预备级升档候选 |
| 4 | NVIDIA $12.93B 收购 HF 多源强验证 + D140 新增 | §1.(11) | ⭐⭐⭐ | v3.21 D135 真实性争议降级 + D140 工程影响不确定性新增 |
| 5 | CNCF 2026 调查 82% K8s + K8s Agent Sandbox + ARMO Kagent | §1.(2) | ⭐⭐⭐ | v3.21 预备级沿用预备 |
| 6 | vLLM RDT Sharded Weight Transfer 7.53 秒 48 节点 | §1.(8) + §1.(2) | ⭐⭐⭐ | 预备级沿用预备 |
| 7 | vLLM 官方 Inside vLLM 41 分钟深度长文 | §1.(1) | ⭐⭐ | 预备级锚入候选 |
| 8 | CNCF 2026 + K8s Agent Sandbox + ARMO Kagent(增量 5 补强) | §1.(2) | ⭐⭐ | 预备级沿用预备 |
| 9 | System Design Newsletter Neo Kim 21 个核心概念清单 | §1.(11) | ⭐ | 预备级预备 |
与昨夜 9-5 18:40 简报对照: - 昨夜棒:0 件 NET-new arXiv 锚入 + 1 件 paper_card NET-new 未锚入(Locked at the Entrance)+ 7 件工程层 NET-new + 1 件 OpenAI IM1 安全事件 NET-new - 本棒:0 件 NET-new arXiv 锚入(v3.21 锚入集合未变 310 件闭集合沿用)+ 1 件 paper_card NET-new 升档正式闭合预备候选(FreeToken)+ 1 件矛盾延展(NVIDIA 收购案 D140)+ 6 件 v3.21 锚入沿用补强 + 2 件预备级候选 - 本棒特征:稀疏但"质量密度高" —— 0 件 NET-new arXiv 锚入但 1 件 §1.(1) Edge MoE 升档正式闭合预备候选 + 1 件矛盾延展预备候选 + 6 件 v3.21 锚入沿用补强预备候选 - §IX 92 evening 棒位预备候选:本棒 9 条主增量全部为预备级候选,均准备 §IX 92 evening 棒位升档正式闭合预备 · v3.21 微调棒闭合预备 16:45 CST 已落定,§IX 92 evening 棒位(v3.21 升档棒候选)可承接本棒 9 条预备级候选
六、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/llm-infra.md(2026-09-06 16:45 CST · §IX 92 morning v3.21 微调棒闭合) - ✅
work-queue.md(2026-09-06 18:00 · 待建卡 0 · 待更新主题活文档 0) - ✅
inbox/jay/2026-09-06T0820-jay-agentic-rag-iclr-inference-substack.md(SGLang vs vLLM 架构对比 + ICLR 2026 TTL + AI Agents Stack 2026) - ✅
inbox/jay/2026-09-06-agent-harness-memory-llm-ecosystem.md(Scaling the Harness + Memory Security Survey + 5 件记忆系统) - ✅
inbox/jay/2026-09-06-1050-jay-engineering-filter.md(vLLM/SGLang/LMDeploy H100 横评 + KV Cache Internet + LangChain Agent Engineering) - ✅
inbox/jay/2026-09-06-1105-jay-five-category-briefing.md(CacheBridge + HeadWiseKV + VestigeKV + NeuroPrefetcher + Almost Free + Yandex + llm-d CNCF + K8s v1.37 HPA Scale-to-Zero) - ✅
inbox/jay/2026-09-06-1144-news-x-tech-radar.md(openJiuwen + E-Commerce Bench + Managed Deep Agents + GPT-6 Astra 实测) - ✅
inbox/jay/2026-09-06-1335-jay-github-hf-substack-trending.md(memU OpenClaw + gbrain + CubeSandbox + QwenPaw v2.2.0 + VIRTUE embedding + Meta Glimmer-30B) - ✅
inbox/jay/2026-09-06-1450-jay-engineering-filter-v2.md(ML-Agent + SGLang vs vLLM AIMultiple CSV + LeetLLM v0.18.0 + Mem0 + Atlan + 4D-ARE) - ✅
inbox/jay/2026-09-06-1505-jay-afternoon-supplement.md(AAAI 2026 keyword search + Vector DB 批判 + vLLM Inside 41 分钟 + vLLM Prefill-Decode Disagg AMD MI300X + vLLM RDT 7.53 秒 + Internet for KV Cache) - ✅
inbox/jay/2026-09-06-1735-jay-evening-report.md(NVIDIA $12.93B 收购 HF 头条 + TGI archived 2026-03-21 + H100 横评 + CNCF 2026 82% K8s + K8s Agent Sandbox + ARMO Kagent + Pulumi Neo + arXiv:2606.02643 RAG Inference Cost Attacks + FreeToken + Addy Osmani + Neo Kim 21 concepts + Vector DB 2026) - ✅
inbox/jay/2026-09-06-engineering-e1prep.md(Yandex KV Cache as Agent Runtime 闭合预备 + CacheBridge/HeadWiseKV/VestigeKV 三件套深化 + MCP Security 30+ CVE + EU AI Act/CRA + K8s v1.37 HPA + 推理引擎 Benchmark 完整化) - ✅
inbox/jay/2026-09-06-csdn-llm-deployment-rag-agent.md(SGLang/LMDeploy/vLLM/Ollama DeepSeek 全系 + Ollama vs vLLM 3.23x + 私有部署选型) - ✅
inbox/stephen/2026-09-06-1245-coord-check-noon.md(周日棒位节奏缩量延续第 5 日 + Tom R82 backlog + SimLLM 误标 + jay 1735 evening report) - ✅
inbox/stephen/2026-09-06-ai-industry-e1prep.md(NVIDIA 收购案矛盾待核 #1 沿用 + Sam Altman Astra 道歉帖) - ✅
inbox/tom/2026-09-06-0900-hf-daily-2026-09-06.md(15 件 HF Daily + Compile by Training 310▲ + Terminal-Universe 265▲ + RoboTok 79▲) - ✅
inbox/tom/2026-09-06T0840-agent-rag-longcontext-radar.md(8 条候选 radar · 0 件 llm-infra NET-new) - ✅
inbox/tom/2026-09-06T1440-agent-rag-longcontext-radar.md(8 条候选 radar · 0 件 llm-infra NET-new) - ✅
inbox/flyp/2026-09-06-1550-Compile-by-Training-24h-renewal-critical-read.md(Compile by Training 立标 310▲ 续立 + R7/R8 反方负担 +25★) - ✅
inbox/flyp/2026-09-06-silent-failures-multimodal-agentic-search-review.md(multimodal agent 检索轨迹级可靠性) - ✅
inbox/spark/2026-09-06-1002-rss-gradient-flow.md+1003-rss-chip-huyen.md+1006-rss-yt-3blue1brown.md(spark 9-6 早棒 3 份 RSS) - ✅
inbox/spark/2026-09-06-agent-e1prep.md(agent 主轴 16 件 NET-new 锚入 + 立基础延展棒 v18 + Yandex 立标第 1 例 + Scaling the Harness 立标预备) - ✅
organized/paper_cards/1197-2609-01925.md(CRISP 主分类 llm-infra) - ✅
organized/paper_cards/1235-2608-29188.md(Locked at the Entrance 主分类 llm-infra) - ✅
organized/paper_cards/987-2608-16157.md(FreeToken 主分类 llm-infra 副分类 agent · 本棒预备级候选)
已抽查 / 已纳入本棒但未深度精读(本棒性质边界)
- ⚠️ inbox/flyp 9-6 multimodal-e1prep / risk-e1prep / 1001-1006 RSS 棒位(仅检查 llm-infra 主轴信号 · 均为 0 件 NET-new)
- ⚠️ inbox/jay 9-6 1000-1006 RSS 棒位(仅检查 llm-infra 主轴信号 · 均为 0 件 NET-new)
- ⚠️ inbox/tom 9-6 0840/1440/2040-agent-rag-longcontext-radar 棒位(仅检查 llm-infra 主轴信号 · 均为 0 件 NET-new)
- ⚠️ inbox/stephen 9-6 0910-news-x-vip-radar + 1005-news- + 1006-1007-news-yt- 棒位(仅检查 llm-infra 主轴信号 · 均为 0 件 NET-new)
- ⚠️ inbox/jay 9-6 rag-llm-systems-weekly 棒位(仅检查 llm-infra 主轴信号 · 0 件 NET-new)
七、本棒诚实度声明
- 本棒轻量精读,未调用 web_fetch / web_search(2026-06-10 稳定运行约束)
- 数据来源:本棒所引 30+ 文件 inbox/jay + 4 文件 inbox/stephen + 4 文件 inbox/flyp + 4 文件 inbox/tom + 4 文件 inbox/spark + 3 文件 paper_cards = 49 文件源 + work-queue.md + llm-infra.md(§IX 92 morning v3.21)
- 未独立核验:
- ① FreeToken
arXiv:2608.16157论文 PDF 关键数字与 GitHub release 状态(沿用 paper_card 987 已有 TLDR 复证,jay 1735 §四论文 2 仅有 HF Trending URL) - ② NVIDIA $12.93B 收购 HF 工程影响短/长期不确定性的具体技术细节(沿用 jay 1735 §一 + stephen 9-4/9-5/9-6 多源沿用)
- ③ vLLM RDT 48 节点 7.53 秒的具体同步效率与 SkyRL 开源仓库 RDT 集成状态(沿用 jay 1505 §二.3)
- ④ vLLM 官方 Inside vLLM 41 分钟深度长文的具体内容(沿用 jay 1105 + 1505 §二.1 预备级引用预备)
- ⑤ CNCF 2026 调查 82% K8s 数据原始 URL 与调查方法论(沿用 jay 1735 §三 shakudo.io/blog/deploy-ai-agents-on-kubernetes)
- §IX 92 evening 棒位预备候选:本棒 9 条主增量全部为预备级候选,均准备 §IX 92 evening 棒位升档正式闭合预备 · v3.21 微调棒闭合预备 16:45 CST 已落定,§IX 92 evening 棒位(v3.21 升档棒候选)可承接本棒 9 条预备级候选
- 下次精读棒:§IX 92 evening 棒位(预计 9-6 evening cron · Wave3 E1 §IX 92 evening v3.21 升档棒闭合预备)或 §IX 93 morning 升档棒(预计 9-7 morning cron)
起草:spark · 2026-09-06 18:40 CST · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d · §IX 92 evening 棒位预备候选 · 不含 GitHub 写入操作