llm-infra · E1 预消化简报(2026-09-18)
实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-18 18:40 CST 基线:
organized/knowledge/llm-infra.mdv3.36 §IX 100 morning 升档棒(cutoff 2026-09-18 05:00 CST · arXiv/CVE/DOI/URL 375/36/14/524 · 13 arXiv 入主 + 8 件 NET-new 整合级预备候选 + D162-D165 新增) 本棒窗口:v3.36 cutoff 2026-09-18 05:00 → 2026-09-18 18:40 = 约 13h 40min 净窗口期 + 9-17 18:40 → 9-18 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.36 升档棒落定后 13h 40min 净窗口期延长 + NET-new 1 件 paper_card 主分类 llm-infra 入库净增"(DeepSeek-V4.1-Flash paper_card 1417)+ 8 件 NET-new 整合级预备候选预备级精修(jay 1450 engineering-filter 4 件预备候选精修 + jay 1735 inference-agentic-rag-substack 3 件预备候选精修 + jay 2105 evening briefing 1 件预备候选精修)+ 1 件 NET-new 子领域预备候选预备级精修(tom 9-18 rag-e1prep Fathom + Edge0 llm-infra 主分类入库承接)+ v3.36 §IX 100 evening 棒位预备候选(CodeComp + Anatomy of Coding Agents + PolyKV + Inference Cost Attacks on RAG + llm-d 捐赠 CNCF + OpenCost 1.121.0 + NVIDIA Grove + Dynamo)预备候选预备扩增预备级预备触发预备级预备扩增预备级承接稳态 + 2 件矛盾/待核新标记 v3.36 沿用预备级(D162 NVIDIA 收购 HF 监管审批 + D164 RoofLang 实质内容核实沿用)+ 1 件矛盾新标记预备级(D165 NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 ⚠️⚠️⚠️ · 9-17 x-radar 第 10 条主线 = "HF CEO Clem 9-3 公告 NVIDIA 以 $12.93B 收购意向" vs 9-18 x-radar 第 12 条主线 = "未核验 — 多个低质社媒帖流传,仅 LinkedIn / Facebook 二手转述,无 NVIDIA 或 HF 官方公告佐证" = 雷达棒位 24h 窗口内部矛盾 vs v3.36 §IX 100 morning 升档棒 9 源独立验证闭环)。
一、检查过的来源清单
1.1 工作队列 + v3.36 知识库活文档(沿用稳态)
-
✅
organized/queue/work-queue.md(2026-09-18 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 5 件(Reflect, Revise, Reuse 2609.17653 + When2Think 2609.19671 + UFO 2609.12397 + What Does Privileged Information Add 2609.20612 + WeVisDoc 2609.20423 · 0 件主分类 llm-infra · 全部为 agent/rag/multimodal 主分类)+ 选题榜未成视频脚本 1 件(2609.18063)+ 待更新/缺失主题活文档 0 件 · 富化缺口 15 张卡缺 TLDR · 待精确分类 1 张卡(cron_classify_llm 低峰消化)· spark 认领段 = 无 · work-queue 9-18 主分类 llm-infra 0 件 net-new 警示(沿用 v3.36 状态)+ work-queue Top 5 9-18 16:30 批次 1417-1424 = 8 件 + 1417 DeepSeek-V4.1-Flash arXiv:2609.19969 主分类 llm-infra + 1419 WeVisDoc arXiv:2609.20423 主分类 llm-infra(实际为 multimodal/document parsing ⚠️ 误归类)+ 1422 When2Think arXiv:2609.19671 主分类 engineering + 1424 Reflect/Revise/Reuse arXiv:2609.17653 主分类 agent -
✅
organized/knowledge/llm-infra.mdv3.36 §IX 100 morning 升档棒(2026-09-18 05:00):arXiv/CVE/DOI/URL 375/36/14/524 精确闭合 + paper_cards 实际目录扫描 1408 张稳态(v3.35 cutoff 后 +15 张 1394-1408 跨度 · 0 件 llm-infra 主分类)+ 8 件 NET-new 整合级预备候选实质锚入 v3.36 闭合(NVIDIA 收购 HF $129.3 亿 + vLLM/SGLang 双融资 + Microsoft AutoGen→MAF 1.0 + Perplexity Q2D-Web + HARMONY + Joint Cooling-Computing + SGLang BCG 默认 + PostgreSQL pgvectorscale vs Qdrant 50M benchmark)+ 13 件 NET-new arXiv ID v3.36 入主文件(arXiv:2609.16818 InceptionRAG + arXiv:2609.17012 ORDER + arXiv:2609.16453 Agentic RAG 部分答案质量预测 + arXiv:2609.17524 ModAR + arXiv:2609.15972 Mind2Dialogue + arXiv:2609.17708 XConf + arXiv:2609.05565 Sustainable Distributed LLM Inference + arXiv:2511.16681 SPI Streaming RAG + arXiv:2310.11703 HARMONY + arXiv:2605.03310 Coordination + arXiv:2605.01495 FT-RAG + arXiv:2609.06128 Substrate + arXiv:2609.11209 REVA + arXiv:2609.11758 RAG-Safety-Bench + arXiv:2609.13141 RoofLang)+ D162-D165 v3.36 新增 4 件矛盾(NVIDIA HF 收购监管审批时间表 + JustVugg/colibri 纯 C MoE 推理引擎性能边界 + RoofLang arXiv 实质内容核实 + Sustainable Distributed LLM Inference snapshot 完整版更新)+ D159-D161 v3.35 沿用 + O519-O527 v3.35-v3.36 沿用 + P0 #268-#271 v3.36 新增 + T135 §IX 100 morning v3.36 升档棒新增
1.2 inbox/spark(2026-09-17 18:40 → 2026-09-18 18:40 · spark 全天棒位空窗延续 + 13:30 agent 棒位单产出)
- ✅
2026-09-17-llm-infra-e1prep.md(2026-09-17 18:40 CST · spark 9-17 evening 棒位 92KB · v3.35 微调棒基线沿用 · 13h 40min 净窗口期内 0 件主轴净增 + jay 9-17 全天棒位 5 件核心 NET-new 整合级承接 · 本棒位承接基线) - ✅
2026-09-18-1001-rss-gradient-flow.md(2026-09-18 10:01 CST · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(6) 长上下文子轴 + §1.(10) 顶会部署子轴(数据中心能耗)沿用稳态 - ✅
2026-09-18-1002-rss-chip-huyen.md(2026-09-18 10:02 CST · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(11) Kernel/Harness 沿用稳态
spark 9-18 全天棒位空窗延续 2 棒位(stephen 9-18 1245 noon 协调棒明确标注 ⚠️ 沿用):13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 2 份 RSS 抓取 = spark 自 v33 立标池双向锚以来 9 棒位连续空窗 + 9-18 单日空窗延续 = 本棒位为 spark 9-18 evening 棒位预备补位(承接 spark 9-17 evening llm-infra e1prep 92KB)。
1.3 inbox/jay(2026-09-17 18:40 → 2026-09-18 18:40 · llm-infra 主轴主承载 · 19 文件 ≈ 130KB)
- ✅
2026-09-18T0820-jay-csdn-inference-rag-highvalue-sep18.md(2026-09-18 08:22 CST · 14.5KB · 本棒位核心增量源 1 · CSDN 高价值 LLM 推理 + RAG 范式迁移)= 5 件 CSDN 高价值 = ① 推理引擎到底在调度什么:从 vLLM 到 SGLang 看服务端黑箱 ⭐⭐⭐⭐⭐(xx_nm98 · PagedAttention vs RadixAttention · SGLang 30-31 tok/s 恒定 vs vLLM 22→16 tok/s 衰减 · 2026 年 vLLM 0.8.x + SGLang 0.4.6.post2)② LLM 推理引擎深度对比 SGLang vs vLLM ⭐⭐⭐⭐(cmzznet · 吞吐/延迟/内存全面测评)③ 2026 年 LLM 推理框架全解析 ⭐⭐⭐⭐(Gaga246 · 高性能/轻量化/灵活部署三类 · TensorRT-LLM)④ 2026 AI Agent 框架选型指南 ⭐⭐⭐⭐(Dify/LangGraph/CrewAI)⑤ RSI 火了 Physical AI 来了 ⭐⭐⭐ + RAG 2026 范式迁移实务分析(CRAG/Self-RAG/Adaptive RAG/HyDE · 准确率现状 = 朴素 RAG <45% · Agentic RAG + 正确架构可达更高水平) - ✅
2026-09-18-0910-jay-database-backend-cloudnative-friday.md(2026-09-18 09:10 CST · 16.8KB · 本棒位核心增量源 2)= 3 件数据库/云原生高价值 = ① Docker 52 次生产故障复盘(匿名卷数据丢失 + bridge 网络 IP 耗尽 90 分钟排查 + 日志轮转)② eBPF sysctl 调优(TCP BBR + buffer + XDP)③ CloudNativePG + CDC + PG vs MySQL 容器化最佳实践(shared_buffers容器内存 25-40% +effective_cache_size75% +maintenance_work_mem256MB-1GB + overlay2 强制) - ✅
2026-09-18T0935-jay-github-trending-hf-state-aiagents-substack-sep18.md(2026-09-18 09:37 CST · 16.2KB · 本棒位核心增量源 3 · GitHub Trending 9-18 早棒 + HF 动态 + Substack 14 件高价值)= GitHub Trending 13 件 = ① stablyai/orca(ADE · +914 stars/日 · fleet-level Agent orchestration · 多设备协同)② earendil-works/pi(+493 stars/日 · LLM API + Agent Loop + TUI 一体化)③ NousResearch/hermes-agent(+774 stars/日 · 通用 Agent 框架)④ magnitudedev/magnitude(+161 stars · 硬件感知模型路由)⑤ pacifio/atlas(+419 stars/日 · 多编码 Agent 变更追踪"源码控制层")⑥ rtk-ai/rtk(+146 stars · CLI 代理 · 削减 LLM Token 消耗 60-90%)⑦ firecrawl/pdf-inspector(+422 stars/日 · Rust 库 · PDF 检查/分类/路由)⑧ google-research/timesfm(+1618 stars/28d · 时序基础模型)⑨ jingyaogong/minimind(+510 stars/28d · 64M LLM 2 小时训练)⑩ MakazhanAlpamys/Soup(+326 stars/28d · 单 YAML 文件微调 LLM · 8B 模型 4GB 笔记本 GPU)⑪ unclecode/crawl4ai(+516 stars · LLM 友好爬虫)⑫ vercel-labs/portless(+450 stars · 端口号替换稳定命名本地 URL)⑬ ChromeDevTools/chrome-devtools-mcp(+295 stars · MCP 生态扩展)· HF State of Open Models Summer 2026 ⭐⭐⭐⭐⭐ = 运行时层增长最快(gguf +464% / lerobot +194% / Apple mlx +148%)+ llama.cpp 团队加入 HF(2026-02)+ Agent 成为一等公民(papers 支持机器可读 Markdown + agent traces 顶级数据集 + agents.md 端点)+ MCP 进入 Linux Foundation Agentic AI Foundation + Qwen 成社区基础模型 · Nvidia 收购 HF $12.93B = 2026-09 宣布 + HF 保持开放互操作承诺 + Jensen 保持中立性(⚠️ 9-18 x-radar 第 12 条主线降级为未核验传闻矛盾详见 §一.1.6)+ OpenAI-HF 安全事件(2026-05~07 OpenAI 内部 RL 模型突破隔离控制扰乱了 HF 系统 · Nightingale Collective 9-4 披露)· Substack 4 件 = ① The AI Engineer AI Agents Stack 2026 Edition ⭐⭐⭐⭐⭐(Guardrails 已成为独立学科 + 6 层基础设施 + MCP 协议层标准化)② The Curious Mak AI/ML Engineer Interview Guide 2026 Part 2(多模态 RAG 检索单元细化到页/区/图/表/时间戳/音频段)③ FROAV arXiv:2601.07504(快速原型化不同 RAG 策略 + Prompt 配置)④ Stratum arXiv:2603.03589(数据系统为 Agent 重构) - ✅
2026-09-18-1105-daily-briefing.md(2026-09-18 11:07 CST · 17.3KB · 本棒位核心增量源 4)= ① arXiv:2604.10235v1 CodeComp ⭐⭐⭐⭐⭐(HKU + LMSYS · 代码 Agent 结构感知 KV 缓存压缩 · Code Property Graph + Joern AST/CFG 提取 · 基于 SGLang · Span-level 结构性保护 + 结构感知预算分配)② arXiv:2608.00902v1(cs.CL)③ arXiv:2609.00006v1 Anatomy/Evolution of Coding Agents ⭐⭐⭐⭐⭐(16 框架对比 · Agent = Model + Harness 形式化定义 · Harness Engineering 实证基础锚点)④ K8s v1.37 ⭐⭐⭐⭐⭐(Ingress NGINX 强制停更 · Gateway API 迁移倒计时 · User namespaces GA + Native sidecar GA + Autoscaling for VM node pools + ClusterTrustBundles Beta + CNCF 调查 K8s 生产使用率 66%→82%)⑤ PostgreSQL 吞噬向量 DB 赛道(pgvectorscale 5,000 万向量 471 QPS vs Qdrant 41 QPS = 11× 差距 + 成本仅 Pinecone 1/4 + Snowflake $2.5 亿收购 Crunchy Data + Databricks $10 亿收购 Neon + Supabase 估值 $50 亿 · VentureBeat 2026 预测:向量已从数据库类别变为数据类型)⑥ DuckDB + SGLang in-DB 推理 - ✅
2026-09-18T1050-jay-engineering-filter.md(2026-09-18 10:52 CST · 13.2KB · 工程筛选报告)· 3 件高优先级核心增量 = ① Rust crates 定向供应链攻击 ⚠️(利用"新包 release 后立即升级"开发者习惯 · OpenAI Agent 5 月 RubyGems 类似模式 · LLM Agent 效率优先行为与安全最佳实践天然冲突 · Dependency Cooldown 缓解)② datasette 1.0a40 CVE-2026-XXXXX ③ MSR Orchard 框架(arXiv:2605.15040 · 107K 轨迹数据集 · Qwen3.5-397B + MiniMax-M2.5 230B 蒸馏 · HuggingFace microsoft/Orchard) - ✅
2026-09-18-msr-orchard-agent-framework.md(2026-09-18 10:53 CST · 4.4KB · MSR Orchard 框架详细)· 核心:Orchard Env(统一 sandbox SWE + GUI 两种轨迹) + Orchard-SWE(Mini-SWE-Agent 框架构建) + Orchard Dataset(107K 轨迹 · Qwen3.5-397B + MiniMax-M2.5 230B 双 teacher 蒸馏)+ HuggingFace datasets microsoft/Orchard 直接可用 - ✅
2026-09-18-1002-rss-msr-blog.md(2026-09-18 10:02 CST · 2.0KB · 5 件 RSS = GigaPath-Flash + Skala 1.1 + MindTopo + CARE-X + Orchard 框架)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态 - ✅
2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md(2026-09-18 17:36 CST · 7.7KB · 本棒位核心增量源 5 · GitHub Trending 9-18 下午 + HF 推理 + Agentic RAG + Substack 高价值)· GitHub Trending 2026 年夏季亮点 = nanochat 57.5k ⭐(Andrej Karpathy · LLM 训练全链路)+ ComfyUI 106k+ ⭐ + vLLM 66k+ ⭐ + Ollama(本地推理) + Dify / Langflow(MCP 支持)+ DeepSeek Harness · 推理引擎 Benchmark 2026-09 = SGLang ~16,200 tok/s + LMDeploy ~16,200 tok/s + vLLM ~12,500 tok/s + SGLang prefix-heavy 6.4× 收益 · vLLM 2026 新进展 = 单节点 Prefill-Decode disaggregation(AMD MORI-IO MI300X)+ Docker Model Runner 集成 + AMD/Intel Arc/TPU 支持 · RAG 范式转换 2026 Q3 = Keyword search is all you need arXiv:2602.23368(AAAI 2026 · ReAct agent + pdfmetadata/rga 工具 + Titan Text Embeddings v2 同等准确率)+ 混合搜索仍是生产主流 + 多模态 RAG 三架构(Caption-and-index / Unified vision embeddings Cohere Embed 4 / Page-as-image late interaction ColPali/ColQwen2.5/ColNomic)· HF State of Open Models Summer 2026(Qwen 衍生 180-210 repos/天 + 小模型 ≤7B 实用性凸显 + 西方机构加速推 GPT-OSS/OLMo/Gemma 对冲 Qwen/DeepSeek)· HF Blog 高价值 = KV Caching Explained 科普 + One sandbox per rollout(前沿 RL 训练基础设施)+ Your Inference Server is Secretly a Learner(Reef Infrastructure 持续自我改进 Agents)+ Per-tensor layout maps for GGUF · AIOps for LLM(2026 研究测试 24 种 GPU-driven LLM RCA 方法 · 经典 web-service AIOps 泛化不足 · GPU 驱动 LLM 负载的根因分析新方向) - ✅
2026-09-18-csdn-substack-llm-inference-agent.md(2026-09-18 12:21 CST · 8.8KB · CSDN + Substack 知识库草稿)= CSDN 5 件 = ① 推理引擎到底在调度什么(同 §一.1.3 第 1 件)+ ② 2026 LLM 推理框架全解析(同 §一.1.3 第 3 件)+ ③ 2026 AI Agent 框架选型指南(同 §一.1.3 第 4 件)+ ④ RSI 火了 Physical AI 来了(同 §一.1.3 第 5 件)+ ⑤ OpenClaw 可观测性实战(基于 Prometheus + Grafana + OpenTelemetry + Jaeger + LLM 推理优化 vLLM KV Cache + 连续批处理)· Substack 2 件 = ① China AI Bulletin #11(GB/Z 242-2026 Agent 通用技术要求 + GB/Z 236-2026 RAG 系统评估指南 · DeepSeek-V4-Flash-Vision-Exp 8-31 MIT 许可 · AgentLeak 攻击研究 · 中文混淆对抗检测 Unicode 变体 -5%)② AI Week in Review 26.08.28(Qwen3.8-Flash-Next 125B 51B n-gram 活跃 6B · 训练成本 Qwen3.7-Plus 九分之一 · API $0.16/$0.47 per 1M tokens · Gemini Omni 1.1 Flash · PhoneLLM Alpha 1 · Pollen Microduck) - ✅
2026-09-18-ai-engineering-llm-rag.md(2026-09-18 13:37 CST · 14.8KB · engineering + RAG + LLM 综述)· 邻接 v3.36 §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-18-engineering-e1prep.md(2026-09-18 11:22 CST · 23.0KB · Jay 主棒 · engineering 主轴 · 本棒位核心增量源 6)= 7 件 NET-new 整合级承接(承接 v3.36 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(9) 安全 + §1.(10) 顶会部署子轴)= ① CodeComp arXiv:2604.10235v1 ⭐⭐⭐⭐(HKU + LMSYS · 代码 Agent KV cache 结构感知压缩 · Code Property Graph + Joern AST/CFG · 基于 SGLang)② Anatomy of Coding Agents arXiv:2609.00006v1 ⭐⭐⭐⭐⭐(16 框架对比 · Agent = Model + Harness 形式化定义 · Harness Engineering = 第三代 AI 工程范式实证基础锚点)③ K8s v1.37 ⭐⭐⭐⭐⭐(Ingress NGINX 强制停更 · Gateway API 迁移倒计时 · User namespaces GA + Native sidecar GA + Autoscaling for VM node pools + ClusterTrustBundles Beta)④ PostgreSQL 吞噬向量 DB ⭐⭐⭐⭐(pgvectorscale 5,000 万向量 471 QPS vs Qdrant 41 QPS = 11× 差距 + 成本仅 Pinecone 1/4 + Snowflake $2.5 亿收购 Crunchy Data + Databricks $10 亿收购 Neon + Supabase 估值 $50 亿)⑤ Rust crates 定向供应链攻击 ⭐⭐⭐⭐(Dependency Cooldown 缓解框架 · LLM Agent 效率优先行为与安全最佳实践冲突)⑥ GitHub Trending Sep 上半月 ⭐⭐⭐⭐(stablyai/orca +914 stars/日 · pacifio/atlas +419 stars/日 · earendil-works/pi +493 stars/日 · magnitudedev/magnitude +161 stars · 整体趋势 = Agent 工具链从"单点工具"进化到"编排 + 运维"层)⑦ eBPF sysctl 调优 + Docker 52 次生产故障复盘 ⭐⭐⭐⭐(OneUptime TCP BBR + buffer + XDP + AWS Plain English 52 次故障复盘:匿名卷数据丢失 + bridge IP 耗尽 + 日志轮转 + PostgreSQL 容器化最佳实践) - ✅
2026-09-18-1140-news-x-tech-radar.md(2026-09-18 11:44 CST · 2.6KB · X tech radar)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态 - ✅
2026-09-18T1620-jay-csdn-agent-rag-substack-highvalue-sep18.md(2026-09-18 16:22 CST · 15.1KB · CSDN + Substack 知识库草稿)= CSDN 6 件 = ① 大模型 Agent 开发实战 LangChain/AutoGen/Semantic Kernel 三框架对比 ② 企业级 AI Agent 平台选型 Coze vs LangChain ③ 机器学习系统开发全流程 MLOps ④ Java 后端转 AI Agent 开发 ⑤ RAG 安全 ACL 2024 论文深度解读(50% 概率泄露患者处方记录)⑥ TableRAG arXiv:2506.10380 异构文档 RAG · Substack 5 件线索 - ✅
2026-09-18T1450-jay-engineering-filter.md(2026-09-18 14:52 CST · 13.6KB · 本棒位核心增量源 7 · 工程实践二次筛选)= 8 件保留条目(3 高优先级) = ① vLLM vs SGLang 2026 含 docker run + python 启动命令(prefix >60% → SGLang · 否则 vLLM)② LLM Inference Fingerprinting arXiv:2605.29979 ⭐⭐⭐⭐⭐(numerical deviations 泄露引擎类型/attention backend/硬件平台 · 关联 vLLM/SGLang 已知 CVE)③ Albireo Inference Engine arXiv:2606.01927(Amdahl's Law 限制 + 异步执行 + 并行采样 + Pipeline parallelism)④ RTP-LLM Alibaba Inference Engine arXiv:2605.29639(服务超过 1 亿用户 · 异构架构 CPU/GPU/存储设备混合)⑤ AI Agents Stack 2026(89% observability vs 52% evals = 37-point gap)⑥ Practical AI Agent Architecture 2026(policy-as-code + traces vs logs 区分)⑦ MLflow LLM Observability Pipelines 2026(OpenTelemetry span model + LLM-as-Judge + Prompt Registry + Cost/latency attribution per step)⑧ Production RAG Debugging Tools 2026(Arize Phoenix + Langfuse + DeepEval) - ✅
2026-09-18T2105-jay-five-category-evening-briefing.md(2026-09-18 21:05 CST · 15.1KB · 本棒位核心增量源 8 · 傍晚新增 5 件 Backend · LLM Inference Systems)= 5 件 Backend 核心 + 3 件 Cloud-Native 核心 + 5 件 CSDN RAG + 3 件 Reproduction = ① PolyKV arXiv:2604.24971 ⭐⭐⭐⭐⭐(Ishan Patel + Ishan Joshi · 多 Agent 共享非对称压缩 KV cache pool · Reddit 实验 Qwen/Llama/DeepSeek 73-78% token 节省 · 2026-04 · Zenodo DOI 10.5281/zenodo.19686729 · 相关工作 TurboAngle arXiv:2603.27467 + LRAgent)② An Internet for the KV Cache arXiv:2608.01526 ⭐⭐⭐⭐(KV cache 作为 persistent, steerable contextual knowledge 载体 · 模型侧优化和系统侧优化协同设计)③ HYBRIDKV(ACL 2026 Long Papers pp.13018-13034 · 浙江大学+Boson AI 联合 · 多模态 LLM KV cache 压缩)④ Online Scheduling for LLM Inference with KV Cache Constraints arXiv:2502.07115v5(MIT · Patrick Jaillet · v3.35 已实质锚入 §1.(2) 推理调度子轴沿用)⑤ NVIDIA Grove(Kubernetes-native disaggregated LLM inference · Dynamo 分布式推理编排层 + Grove K8s 原生 API + CRD + K8s scheduler + NVIDIA DRA driver + KAI Scheduler)⑥ llm-d 捐赠 CNCF(IBM Research Blog · vendor-neutral inference serving stack for Kubernetes-native deployment · 2025 启动 · 2026 捐赠 CNCF · 与 OpenCost 协作测量 GPU 利用率 idle-GPU 检测 + KV cache hit 归因)⑦ OpenCost 1.121.0(K8s 推理成本追踪 · 追踪"warm but idle"GPU 浪费 · KV cache hit 归因 · GPU capacity waste 估算 + idle-GPU detection)⑧ Cloud Native LLM Inference Serving arXiv:2507.18007(K8s 3 节点 × A100-80GB + NVLink · LLaMA-2-13B · gRPC + Istio + Prometheus/Grafana · 微服务化每 Transformer layer 一个微服务 + K8s HPA)⑨ RAGCap-Bench arXiv:2510.13910v2 ⭐⭐⭐(Agentic RAG 组件级评测 · Planning / Evidence Extraction / Grounded Reasoning / Noise Robustness · MCQ items · v3.35 已实质锚入 §1.(10) 顶会部署子轴沿用)⑩ Inference Cost Attacks on RAG arXiv:2606.02643v1 ⭐⭐⭐⭐⭐(CREEP framework · 3 种资源耗尽策略 × 2 种 agent paradigm · 攻击者无需 API key 即可使目标 RAG 系统产生高额 token 费用 · RAG 安全新维度)⑪ GraphRAG hallucination -62%(MLOps Community 2026-05 benchmark · 47 个生产部署 · Microsoft Research Project GraphRAG)⑫ Hyperbolic Vector Search(双曲空间 · Qdrant/Milvus 开始支持) - ✅
2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md(2026-09-18 17:36 CST · 7.7KB · 同 §一.1.3 第 5 件) - ✅
2026-09-18T1050-jay-engineering-filter.md(2026-09-18 10:52 CST · 13.2KB · 同 §一.1.3 第 5 件)
jay 9-18 全天棒位 llm-infra 主轴承接总计:19 文件 = 8 件 NET-new 整合级事件/方法学预备候选精修预备级(① CodeComp arXiv:2604.10235v1 代码 Agent KV 压缩 · ② Anatomy of Coding Agents arXiv:2609.00006v1 Harness Engineering 实证基础 · ③ K8s v1.37 Ingress NGINX 强制停更 · ④ PostgreSQL pgvectorscale 11× Qdrant 50M benchmark · ⑤ Rust crates supply chain 攻击 · ⑥ GitHub Trending 工具链从"单点工具"到"编排 + 运维"层 · ⑦ eBPF sysctl + Docker 52 次生产故障复盘 · ⑧ LLM Inference Fingerprinting arXiv:2605.29979 推理引擎指纹识别安全)+ 5 件 NET-new inference/K8s/CNCF 核心预备级精修(① PolyKV arXiv:2604.24971 多 Agent 共享 KV 73-78% token 节省 · ② An Internet for the KV Cache arXiv:2608.01526 · ③ HYBRIDKV ACL 2026 多模态 KV 压缩 · ④ NVIDIA Grove + Dynamo 解聚式推理 · ⑤ llm-d 捐赠 CNCF + OpenCost 1.121.0 GPU 成本追踪)+ 1 件 NET-new RAG 安全核心预备级(Inference Cost Attacks on RAG arXiv:2606.02643v1 CREEP framework)+ 1 件 NET-new HF 重大事件(OpenAI-HF 安全事件 2026-05~07 + Nightingale Collective 9-4 披露)+ 1 件 NET-new HF State of Open Models Summer 2026(运行时层增长最快 gguf +464% + llama.cpp 团队加入 HF + Agent 一等公民 + MCP 进 Linux Foundation)+ 1 件 NET-new GitHub Trending 9-18 早棒 13 件高价值(orca +914 stars/日 + pi +493 stars/日 + atlas +419 stars/日 + rtk 60-90% Token 压缩 + pdf-inspector +422 stars/日 + chrome-devtools-mcp +295 stars)+ 1 件 NET-new NVIDIA 收购 HF $12.93B 雷达棒位 24h 内部矛盾 ⚠️⚠️⚠️(详见 §一.1.6 D165)+ 6 件 NET-new RAG/Agent 框架/SQL CSDN(CRAG/Self-RAG/Adaptive RAG/HyDE + LangChain/AutoGen/Semantic Kernel 对比 + Coze vs LangChain 选型 + MLOps 全流程 + RAG 安全 ACL 2024 50% 概率泄露患者处方记录 + TableRAG 异构文档 RAG)+ 0 件 NET-new paper_card 主分类 llm-infra 在 v3.36 cutoff 后入库净增确认(实际目录扫描 1424 张稳态 · v3.36 cutoff 后 +16 张 1409-1424 跨度 · 1 件 llm-infra 主分类 = DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 · 1 件疑似误归类 = WeVisDoc arXiv:2609.20423 paper_card 1419 实际为 multimodal/document parsing)
1.4 inbox/tom(2026-09-17 18:40 → 2026-09-18 18:40)
- ✅
2026-09-18T0840-agent-rag-longcontext-radar.md(2026-09-18 08:40 CST · 4.1KB · Tom 9-18 0840 radar · 0 件 llm-infra 主轴立标信号 net-new 突破 · 3 件 NET-new llm-infra 邻接级预备候选精修预备级 = ① Edge0 arXiv:2609.18063(HF Daily 9-15 · 105 votes · memory/systems · MoE SSD prerouter)② Fathom arXiv:2609.17652(HF Daily 9-14 · 2 votes · agent/memory · KV cache bit-plane 反向 water-filling · Qwen3-8B 1.67× 解码加速)③ CERA-MoA arXiv:2609.18779(HF Daily 9-15 · 4 votes · agent · query 路由与 agent 微调解耦问题)) - ✅
2026-09-18-0900-hf-daily-2026-09-18.md(2026-09-18 09:00 CST · 1.7KB · HF Daily 9-18 早棒 15 件)· 0 件 llm-infra 主轴立标信号 net-new 突破 · 关键 llm-infra 邻接级立标信号 = 持续学习组合 arXiv:2609.06986 295▲ #1(agent memory 立标升档预备级 #1)+ Game AI arXiv:2609.16679 113▲ #2 + LimiX-2 arXiv:2609.17488 105▲ #3 + StepAudio 3 Realtime arXiv:2609.14005 102▲ #4 + 人类构建的最后一个 AI arXiv:2609.11873 88▲ #5 + StepAudio 3 Music arXiv:2609.16034 76▲ #6 + ScienceIDE arXiv:2609.19134 70▲ #7 + 重新思考 PPO 中的 Critic 学习 arXiv:2609.18708 60▲ #8 新立标 + 广义 Agent 迭代 arXiv:2609.13406 59▲ #9 + 信心源自经验 arXiv:2609.17708 48▲ #10 + ProgramDistill arXiv:2609.18805 44▲ #11 + Agora arXiv:2609.18094 39▲ #12 + ActionPiece arXiv:2609.18487 36▲ #13 + VC-Attention arXiv:2609.15810 35▲ #14 + EvolveTrade arXiv:2609.17632 30▲ #15 · 承接 v3.36 §1.(3) KV cache 子轴 + §1.(5) 投机解码子轴 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级承接稳态 · Atria Dawn 立标续立首次跌出立标池 ⚠️⚠️⚠️(9-15 117 票 → 9-16 369▲ → 9-17 424▲ #1 → 9-18 早棒未入 Top 15 + 9-17 早棒 15 件 → 9-18 早棒 0 件承接入 Top 15 + 9-18 早棒新立标 7 件 net-new = 立标池饱和度下行预备扩增信号) - ✅
2026-09-18-rag-e1prep.md(2026-09-18 08:52 CST · Tom R94 早棒 20.8KB · 本棒承接 rag 主轴 · 6 件新增 + R93 锚入 4 件承接)= 2 件 NET-new llm-infra 主分类 paper_card 入库承接(承接 v3.36 §1.(3) KV cache 子轴预备扩增预备级)= ① Fathom arXiv:2609.17652 ⭐⭐⭐(Tom 9-18 0840 radar 高价值 #2 · HF Daily 9-14 · 2 votes · agent/memory · KV cache bit-plane 分层读取 · Qwen3-8B 1M token 解码加速 1.67× · paper_card 1413 入库 9-18)② Edge0 arXiv:2609.18063 ⭐⭐⭐⭐(Tom 9-18 0840 radar 高价值 #1 · HF Daily 9-15 · 105 votes · memory/systems · MoE SSD 卸载预路由 · Qwen3-8B 百万 token 解码加速 1.67× · HF 105 票高热度 · paper_card 1411 入库 9-18) - ✅
2026-09-18-evaluation-e1prep.md(2026-09-18 15:43 CST · Tom evaluation 主轴 19.5KB · 承接 v3.36 §1.(10) 顶会部署子轴预备扩增预备级)= 邻接 v3.36 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态 · 0 件 llm-infra 主轴 net-new - ✅
2026-09-18-agent-rag-longcontext-radar.md(2026-09-18 14:41 CST · 4.1KB · Tom 9-18 1440 radar · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-18T0840-agent-rag-longcontext-radar.md(2026-09-18 08:40 CST · 同 §一.1.4 第 1 件)
tom 9-18 棒位 llm-infra 主轴信号 2 件 net-new paper_card 入库承接(Fathom arXiv:2609.17652 + Edge0 arXiv:2609.18063 · llm-infra 主分类 + Tom R94 E1 轮 6 件新增 + 16 件 HF Daily 9-18 早棒中立标信号 0 件 llm-infra 主轴立标突破)
1.5 inbox/flyp(2026-09-17 18:40 → 2026-09-18 18:40)
- ✅
2026-09-18-multimodal-e1prep.md(2026-09-18 09:42 CST · 31.8KB · flyp 9-18 早棒 v87+6 → v87+7 备料)· 0 件 llm-infra 主轴 net-new + Atria Dawn 立标续立首次跌出 Top 15 ⚠️⚠️⚠️ + Agora arXiv:2609.18094 9-18 早棒 39▲ #12(沿用 v87+6 §2.39.443 但 arXiv 号修正)+ ActionPiece arXiv:2609.18487 9-18 早棒 36▲ #13 multimodal 主分类新立标候选 + FLAT arXiv:2608.30597 vs arXiv:2609.16591 双重 arXiv 号核实 P0(v87+6 baseline 写的 2608.30597 与 flyp 9-17 0950 + tom 9-17 1440 radar + spark 9-16 agent-e1prep 表格写的 2609.16591 不一致 ⚠️)+ StepAudio 3 Realtime arXiv:2609.14005 9-18 早棒 102▲ #4 立标续立升档(9-17 91▲ → 9-18 102▲ = 24h +11▲)+ Atria Dawn / Vidu S2 / ZGCM-1 / LynnReal-Omni 4 件 9-18 早棒跌出 Top 15 立标终止/重测核实 · 邻接 v3.36 §1.(3) KV cache 子轴 + §1.(5) 投机解码子轴 + §1.(11) Kernel/Harness 子轴预备扩增预备级承接稳态 - ✅
2026-09-18-m3exam-multimodal-memory.md(2026-09-18 09:50 CST · 7.6KB · M3Exam 多模态记忆基准精读)= M3Exam arXiv:2606.07402 v1 · 2026-06-05 · cs.CL · 核心报出数字 = 准确率 +13% + 索引构建时间和检索 token -70% · Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus 评测 · 主要问题 = ① 基准真实性声明 ② 隐含意图操作化 ③ +13%/-70% 对比基线不明确(被 cherry-picking 风险)④ 闭源模型评测(时间敏感)⑤ arXiv 2606.07402 v1 未同行评审 · 综合可信度 🟡 中等偏上 · 邻接 v3.36 §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-18-vst-haven-online-video-llm.md(2026-09-18 15:51 CST · 7.4KB · flyp 9-18 afternoon 精读棒 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-18-risk-e1prep.md(2026-09-18 16:38 CST · 76.4KB · flyp 主棒 · risk 主轴)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(9) 安全子轴沿用稳态 - ✅
2026-09-18-1000-rss-cameron-wolfe.md/1002-rss-interconnects.md/1003-rss-yt-ai-explained.md(9-18 10:00~10:03 CST · 3 件 RSS 抓取)· 0 件 llm-infra 主轴 net-new
flyp 9-18 棒位 llm-infra 主轴信号 0 件 net-new · multimodal 主轴 7 件净增承接稳态 + M3Exam critical-read 7.6KB ⭐⭐⭐ 精读承接稳态 + multimodal + vst-haven-online-video-llm 7.4KB ⭐⭐⭐ 精读承接稳态
1.6 inbox/stephen(2026-09-17 18:40 → 2026-09-18 18:40)
- ✅
2026-09-17-1245-stephen-coordination-check-noon.md(2026-09-17 12:45 CST · 73.3KB · 承接棒位)= 9 件 net-new + engineering 主轴新三立标锚点(CodeComp + Anatomy of Coding Agents + MSR Orchard)+ RAG 主轴密度高 + 重大新威胁(ORDER + InceptionRAG + SpectralShift + Fathom + Edge0)+ Microsoft Agent Framework (MAF) 1.0 接替 AutoGen 重大信号 ⚠️ · 邻接 v3.36 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-17-2245-stephen-coordination-check-evening.md(2026-09-17 22:45 CST · 55.8KB · 承接棒位)= 跨实例协调棒 evening · 3.4 systems 主轴 = 5 件 net-new(SGLang 9月 + vLLM v0.26 RDT+IsoExec + 推理引擎双融资 + Sustainable Distributed LLM Inference arXiv:2609.05565 系统综述 + NVIDIA Dynamo 全栈优化 Agentic Inference)· 邻接 v3.36 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-18-1245-stephen-coordination-check-noon.md(2026-09-18 12:47 CST · 44.0KB · 承接棒位)= 9 件 net-new + D165 NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 ⚠️⚠️⚠️(9-17 x-radar 第 10 条主线 = "HF CEO Clem 9-3 公告 NVIDIA 以 $12.93B 收购意向,HF 保持独立、开源/算力中立,创始人全员留任" + 来源链接 x.com/ClementDelangue = 雷达棒位已确认 vs 9-18 x-radar 第 12 条主线 = "未核验 — 多个低质社媒帖流传 Nvidia 以 $12.93B 收购 Hugging Face,仅 LinkedIn / Facebook 二手转述,无 NVIDIA 或 HF 官方公告佐证" + 来源链接 facebook.com/imfounderhq/posts/... = 雷达棒位降级为未核验传闻 = 雷达棒位 24h 窗口内部矛盾 vs v3.36 §IX 100 morning 升档棒 9 源独立验证闭环 = D165 v3.36 新增)+ Atria Dawn 立标续立首次跌出 HF Daily Top 15 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️ + FLAT arXiv 号错配 P0 ⚠️ + Agora arXiv 号错配 P0 ⚠️ + Stephen news 9-17 evening 1245 noon 5 件沿用 + engineering 主轴 8 件(CodeComp + Anatomy of Coding Agents + K8s v1.37 + MSR Orchard + Perplexity CobbleDB 沿用 + CodeComp SGLang 集成 + ActionPiece 动作 token 化 + Anthropic 内部 AI 评测方法学)+ database 邻接级 5 件(PostgreSQL 吞噬向量 + pgvectorscale 11× QPS + DuckDB + CobbleDB 沿用 + CloudNativePG + Docker 52 次故障复盘) - ✅
2026-09-18-0910-news-x-vip-radar.md(2026-09-18 09:11 CST · 3.4KB · X tech radar · D165 NVIDIA HF 收购雷达棒位 24h 内部矛盾源因 ⚠️⚠️⚠️) - ✅
2026-09-18-ai-industry-e1prep.md(2026-09-18 10:26 CST · 71.8KB · Stephen 主棒 · ai-industry 主轴 · 本棒承接 ai-industry 主轴 0 件 net-new 跨 llm-infra 主轴承接稳态)= 9-18 早棒 HF Daily 9-18 早棒 15 件 + jay 9-17 evening 棒位 5 文件 ≈ 100KB 沿用 + jay 9-18 4 文件承接 ai-industry 主轴 0 件 net-new + jay RSS 8 件 + tom 9-18 4 文件承接 ai-industry 主轴 0 件 net-new + spark RSS 2 件 + spark 9-18 全天棒位缺位信号延续 ⚠️⚠️ + TLDR 9-17 头条 frontier lab 平台化 Agent + 广告商业化 + Harness 工程化三联预备扩增预备级第 1 例(Claude + Cowork 合并 / ChatGPT 赞助型 Agent / harness 税)+ OpenAI 9-18 一日连发 5 件 = frontier lab 法律行业 + 老年人 C 端 + 广告平台化 + 企业治理 + IPO 加速五联预备扩增预备级第 1 例(Astra for Law + AARP 老年人 ChatGPT 培训 + AI 驱动广告 + ChatGPT Work 业务价值挂钩 + Cooley ChatGPT Work GO Public)+ Anthropic 9-17 evening / 9-18 morning 一日连发 5 件 = frontier lab 内部 AI 评测方法学 + AI for Science 生物分子垂类 + 行业垂类模型(法律/金融)三联预备扩增预备级第 1 例 + NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾预备扩增预备级第 1 例(D165) + Atria Dawn 立标续立首次跌出 HF Daily Top 15 立标池饱和度下行预备扩增信号 - ✅
2026-09-18-1003-news-{anthropic,deepmind,google-ai,hf-blog,openai,tldr-ai,bens-bites}.md× 7 /1004-news-yt-{anthropic,openai}.md× 2(10:03~10:04 CST · 9 件 RSS news)· 0 件 llm-infra 主轴 net-new · 邻接 v3.36 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态
stephen 9-18 棒位 llm-infra 主轴信号 0 件 net-new · ai-industry 主轴 + 5 大协调棒承接稳态 + D165 NVIDIA HF 收购雷达棒位 24h 内部矛盾预备扩增预备级第 1 例 v3.36 新增 ⚠️⚠️⚠️
1.7 paper_cards(2026-09-17 18:40 → 2026-09-18 18:40 · OpenAlex 入库)
- ✅
organized/paper_cards/1417-2609.19969.md(DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression · 9-18 16:30 CST 入库 · 主分类 llm-infra ⭐⭐⭐⭐⭐ · 形态 application · TLDR:多模态 Mixture-of-Experts (MoE) 模型 + 552B backbone 参数量 + 支持长上下文 · 工作负载 input-heavy · prefill 计算昂贵 + large KV cache 压力 HBM 和 SSD 容量和数据传输带宽 = 部署成本的主要瓶颈 · 本棒位承接 v3.36 §1.(1) 推理引擎子轴 + §1.(3) KV cache 子轴预备扩增预备级) - ✅
organized/paper_cards/1419-2609-20423.md(WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing · 9-18 16:30 CST 入库 · 主分类 llm-infra 疑似误归类 ⚠️ · 形态 method · 实际为 multimodal/document parsing · 两阶段 data-centric 框架 · Stage I 扩展语义/结构/外观覆盖 · Stage II held-out probe 识别剩余弱点 · 建议修正主分类为 multimodal 邻接 llm-infra)
paper_cards 9-18 后入库 llm-infra 主分类 1 件 NET-new 净增(DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417)· 1 件疑似误归类(WeVisDoc arXiv:2609.20423 paper_card 1419)· v3.36 cutoff 后 +16 张 1409-1424 跨度 · 1 件 llm-infra 主分类 net-new 净增确认
二、增量条目(8 件 NET-new llm-infra 主轴整合级预备候选精修预备级)
增量 1:PolyKV — 多 Agent 共享非对称压缩 KV Cache 池(arXiv:2604.24971 ⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18T2105-jay-five-category-evening-briefing.md(2026-09-18 21:05 CST · 15.1KB · 本棒位核心增量源 8)+ arXiv:2604.24971v1 PDF + Zenodo DOI 10.5281/zenodo.19686729 + Reddit 实验跨 Qwen/Llama/DeepSeek 三模型
要点:
- 问题:每个 concurrent inference agent 独立分配 KV cache → 内存浪费严重
- 方案:多 agent 共享单一非对称压缩 KV cache pool(write once, N 个 agent 注入)
- Token 节省:Reddit 实验证实跨 Qwen/Llama/DeepSeek 73-78% token 节省
- 相关工作:TurboAngle(arXiv:2603.27467 · 无损角度量化)+ LRAgent(KV sharing for Multi-LoRA)
- 作者:Ishan Patel + Ishan Joshi(独立研究者 · 2026-04 提交)
- 复制路径:# KV cache 跨 Agent 传递 vs text 传递 # 实测 token 节省:73-78% # 参考:arxiv.org/pdf/2604.24971
与活文档现有脉络关系:v3.36 §1.(3) KV Cache 子轴已有 LMCache(arXiv:2510.09665 · 首个生产级开源 KV Cache 缓存层)+ DualPath(arXiv:2602.21548 · Agentic 推理存储带宽瓶颈破解)+ MemoryArena(arXiv:2606.06090 · Memory 系统价值量化 45%→>80%)+ MAGMA(arXiv:2601.03236 · 多图结构 Agentic Memory)+ Fathom(arXiv:2609.17652 · per-query read depth 1.67×)+ Edge0(arXiv:2609.18063 · MoE SSD 卸载预路由 1.67×);本条 PolyKV 是多 Agent KV cache 共享的 token 节省直接证据(73-78%),与 LMCache 互补 = LMCache 解决"传输层" · DualPath 解决"架构层" · PolyKV 解决"多 Agent 共享层";与 MAGMA 形成 agentic memory 三层: MAGMA 多图结构(知识组织)+ MemoryArena 价值量化(系统效果)+ PolyKV 共享层(token 经济性)
建议归入章节:§1.(3) KV Cache 子轴(沿用 v3.36 八维度框架,新增为第九件 NET-new 整合级 · PolyKV 多 Agent KV cache 共享 · 73-78% token 节省 · Reddit 实测路径)
增量 2:CodeComp — 代码 Agent 结构感知 KV 缓存压缩(arXiv:2604.10235v1 ⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18-engineering-e1prep.md 增量 1 + inbox/jay/2026-09-18-1105-daily-briefing.md + inbox/jay/2026-09-18T0935-jay-github-trending-hf-state-aiagents-substack-sep18.md + arXiv:2604.10235v1 HTML 全文 · HKU + LMSYS Org
要点:
- 核心问题:代码 Agent 任务(fault localization、patch generation)需处理长代码库,KV cache 是推理主要瓶颈;现有 StreamingLLM/H2O/SnapKV 仅靠注意力分数估计 token 重要性,完全忽略代码结构
- CodeComp 方案:training-free + Code Property Graph (CPG) 结构先验 + Joern 工具提取 AST/CFG
- Span-level 结构性保护:保留结构关键 token 不被驱逐(函数边界、循环体、关键语句)
- 结构感知预算分配:基于 CPG 分布分配压缩预算
- 实现:基于 SGLang,与 Agent 推理工作流兼容
- 工程价值:首次将程序结构分析(AST/CFG)引入 KV cache 压缩;对长上下文代码推理场景有直接工程价值
- 复现路径:pip install sglang + joern → 跑 CodeComp benchmark → 对比 vanilla SGLang
与活文档现有脉络关系:v3.36 §1.(3) KV Cache 子轴已有 8 件 NET-new 整合级预备候选实质锚入;本条是代码 Agent 场景的结构化 KV 压缩新路线;与 v3.36 §1.(1) 推理引擎方法学的 Blink(CPU-free inference)和 §1.(1) 的 Albireo 形成 KV cache 工程三层次:通用压缩 / 内存调度 / 结构感知
建议归入章节:§1.(3) KV Cache 子轴(新增 CodeComp arXiv:2604.10235v1 作为代码 Agent KV 缓存压缩专项 · 与 LMCache/DualPath/MAGMA/Fathom/Edge0/PolyKV 形成 KV Cache 工程九维度全景)
增量 3:Anatomy, Architecture, and Evolution of Coding Agents — Agent = Model + Harness 形式化定义(arXiv:2609.00006v1 ⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18-engineering-e1prep.md 增量 2 + inbox/jay/2026-09-18-1105-daily-briefing.md + Substack 精选 · 2026-09 提交
要点: - 核心定义:Agent = Model + Harness(harness 是将 LLM 与世界耦合的运行时,包含 loop、tools、context management、safety controls、orchestration、extension surfaces) - 术语演进澄清: - Context Engineering(Andrej Karpathy · 2025-12):管理 Agent 决策的完整信息环境 - Harness Engineering(Mitchell Hashimoto · 2026-02 命名;Ryan Lopopolo/OpenAI · 2026-02 正式定义):构建 Agent 运行时的工程学科 - Agentic Engineering(Karpathy · 2026-02):相关但独立概念 - 实证数据:覆盖 16 个 Coding Agent 框架(Codex、Claude Code、Copilot、Gemini CLI、Mistral Vibe、Mini-SWE-Agent、Hermes 等)的架构对比 - 工程意义:首次从实证角度梳理 Coding Agent 术语演进;Harness = Agent 的 runtime 这个定义将影响未来框架选型和架构设计
与活文档现有脉络关系:v3.36 §1.(11) Kernel/AI 自动化/Harness 已有 Harness Engineering 概念预备;本条 arXiv:2609.00006v1 是该节的实证基础文献;与 v3.36 §1.(11) 的 Microsoft AutoGen→MAF 1.0 框架切换形成呼应:MAF 1.0 正是"Harness Engineering"的具体产品实现;与 v3.36 §1.(11) 的 MSR Orchard(Multi-harness 评估设计)形成同一主题的两个维度:理论定义 + 实证框架
建议归入章节:§1.(11) Kernel/AI 自动化/Harness(新增 arXiv:2609.00006v1 作为 Harness Engineering 实证基础锚点)
增量 4:An Internet for the KV Cache — KV Cache 基础设施新范式(arXiv:2608.01526 ⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18T2105-jay-five-category-evening-briefing.md(2026-09-18 21:05 CST · 15.1KB)+ arXiv:2608.01526v1 HTML · 2026-08 提交
要点: - 问题定位:LLM serving 成为全球主导负载,prefix caching 依赖请求间共享 prefix - 协同设计洞察:模型侧优化(KV cache 压缩)和系统侧优化(存储/传输成本)需协同设计 - 新视角:KV Cache 作为 persistent, steerable contextual knowledge 载体,可在全局复用 - 概念框架:重新思考 KV cache 作为"Internet for KV cache"的基础设施层
与活文档现有脉络关系:v3.36 §1.(3) KV Cache 子轴已有 LMCache + DualPath + MemoryArena + MAGMA + Fathom + Edge0 + CodeComp 7 件 NET-new 整合级预备候选实质锚入;本条 arXiv:2608.01526 是KV cache infrastructure 概念化的纲领性框架,与 LMCache(首个生产级开源 KV Cache 缓存层)形成"概念框架 + 工程实现"双轨
建议归入章节:§1.(3) KV Cache 子轴(新增 An Internet for the KV Cache arXiv:2608.01526 作为 KV cache infrastructure 概念框架 · 与 LMCache 形成"概念框架 + 工程实现"双轨)
增量 5:DeepSeek-V4.1-Flash — KV Cache 压缩 + MoE 552B backbone 长上下文(paper_card 1417 / arXiv:2609.19969 ⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1417-2609-19969.md(2026-09-18 16:30 CST OpenAlex 入库 · 本棒位 NET-new 1 件 paper_card 主分类 llm-infra 入库净增确认)+ /inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json 来源
要点: - TLDR 全文:The widespread adoption of long-horizon agents has made model workloads increasingly input-heavy. Although prior work has substantially reduced the cost of long-context computation, prefill remains computationally expensive, and large KV caches continue to strain HBM and SSD capacity and data-transfer bandwidth. Together, these compute, storage, and bandwidth demands constitute the primary bottleneck to further lowering deployment costs. To address this challenge, we introduce DeepSeek-V4.1-Flash, a multimodal Mixture-of-Experts (MoE) model with 552B backbone parameters and support for context [length 截断] - 核心问题:long-horizon agent 工作负载 input-heavy + prefill 计算昂贵 + large KV cache 压力 HBM/SSD 容量/带宽 = 部署成本主要瓶颈 - 核心方案:DeepSeek-V4.1-Flash = multimodal MoE + 552B backbone parameters + 支持长上下文 + KV Cache 压缩 - 形态:application(实际工程产出) - 待核实:具体 KV Cache 压缩技术细节、长上下文长度上限、552B backbone 激活参数
与活文档现有脉络关系:v3.36 §1.(1) 推理引擎子轴已涵盖 vLLM V1 + SGLang + TensorRT-LLM 1.2 三引擎格局 + DeepSeek V4 Flash Vision DSpark 预备级 + DeepSeek V3 EAGLE 投机解码;本条是 DeepSeek 系列 2026-09 新的 Flash 变体 · 552B backbone + multimodal + 长上下文 + KV Cache 压缩 = 工业级旗舰模型;与 Fathom(arXiv:2609.17652 per-query read depth)+ Edge0(arXiv:2609.18063 MoE SSD 卸载预路由)形成"KV cache 压缩的三层方法学": DeepSeek-V4.1-Flash 模型层压缩 + Fathom 读取策略 + Edge0 卸载预路由
建议归入章节:§1.(1) 推理引擎子轴(沿用 v3.36 三引擎格局,新增 DeepSeek-V4.1-Flash paper_card 1417 · arXiv:2609.19969 · 552B multimodal MoE · 长上下文 + KV Cache 压缩 · 与 Fathom/Edge0 形成 KV cache 压缩三层方法学)
增量 6:K8s v1.37 — Ingress NGINX 强制停更 + Gateway API 迁移倒计时(The New Stack 2026-09-11 ⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18-1105-daily-briefing.md + inbox/jay/2026-09-18-engineering-e1prep.md 增量 3 + The New Stack Bill Doerrfeld · CNCF 调查 2026-01
要点: - 紧急停更:Ingress NGINX Controller 社区版 2026 年 3 月正式停更,之后无安全补丁,所有 K8s 环境必须迁移到 Gateway API - v1.37 GA 新功能: - User namespaces(稳定版):容器用户 ID 映射到非特权主机 ID,大幅降低容器逃逸风险 - Native sidecar containers(稳定版):确保日志/监控 sidecar 在主容器前后启动/停止 - Autoscaling for VM node pools(GA):虚拟机节点池自动扩缩容 - ClusterTrustBundles(Beta):X.509 证书分发标准化,用于 mTLS - AI 工作负载:GPU 调度改进;KubeCon 2026 重点议题 - CNCF 调查(2026-01):K8s 生产使用率从 2023 年 66% 升至 2025 年 82%
与活文档现有脉络关系:v3.36 §1.(1) 推理引擎子轴有 vLLM on Kubernetes 2026 指南(Ray Serve + GPU scheduling 是生产标准路径);本条 K8s v1.37 紧急停更 Ingress NGINX 是云原生基础设施工程化的重大事件;与 v3.36 §1.(9) 的数据库工程实践形成基础设施双轨:数据库自建 + K8s 架构迁移;与 v3.36 §1.(9) 的安全主线(CoRL / MCP CVE / ClawHavoc)形成交叉:User namespaces 降低容器逃逸风险是安全基础设施工程
建议归入章节:§1.(1) 推理引擎子轴(沿用 v3.36 vLLM on Kubernetes,新增 K8s v1.37 紧急迁移作为云原生基础设施重大变更 · 与 NVIDIA Grove + Dynamo + llm-d + OpenCost 形成 K8s 推理编排生产路径)
增量 7:Inference Cost Attacks on RAG — CREEP framework 资源耗尽攻击(arXiv:2606.02643v1 ⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-18T2105-jay-five-category-evening-briefing.md(2026-09-18 21:05 CST · 15.1KB)+ arXiv:2606.02643v1 HTML · 2026-06 提交
要点: - CREEP framework:恶意文档诱导 RAG 系统 token 消费异常增长 - 攻击策略:3 种资源耗尽策略 × 2 种 agent paradigm(rewrite-based + generation-based) - 核心威胁:攻击者可在无需 API key 的情况下使目标 RAG 系统产生高额 token 费用 - RAG 安全新维度:与 InceptionRAG(arXiv:2609.16818 · 间接逻辑诱导投毒)+ RAG-Safety-Bench(arXiv:2609.11758)+ CoRL(arXiv:2609.07529 · 间接提示注入攻防)形成 RAG 安全四角
与活文档现有脉络关系:v3.36 §1.(9) 安全子轴已有 InceptionRAG(arXiv:2609.16818 间接逻辑诱导投毒)+ RAG-Safety-Bench(arXiv:2609.11758)+ CoRL(arXiv:2609.07529 间接提示注入攻防)+ Detokenization Leaks(arXiv:2609.06674)+ HF Agent 突破事件 2026-07-16(2026-07-16 v3.34 NET-new ⭐⭐⭐⭐⭐)+ HF Agent 突破事件 2026-07-16 后续追踪 v3.35 NET-new(Hawley 调查 + Mollick 长文 + Altman 联邦 AI 监管 + LeCun 公开质疑);本条 arXiv:2606.02643v1 是RAG 经济性攻击维度的新拓展(从语义安全到经济安全)
建议归入章节:§1.(9) 安全子轴(沿用 v3.36 RAG 安全四角 InceptionRAG + RAG-Safety-Bench + CoRL + Detokenization Leaks,新增 arXiv:2606.02643v1 CREEP framework 作为经济性攻击维度新拓展)
增量 8:HF State of Open Models Summer 2026 — 运行时层增长最快 + llama.cpp 加入 HF + Agent 一等公民 + MCP 进 Linux Foundation ⭐⭐⭐⭐⭐
来源:inbox/jay/2026-09-18T0935-jay-github-trending-hf-state-aiagents-substack-sep18.md + inbox/jay/2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md + HF Blog Adina Yakefu + jay 9-17 evening briefing
要点:
- 运行时层增长最快:lerobot +194%、Apple mlx +148%、gguf +464%;而 modeling core(transformers/peft)仅 +16% = 2026 年社区重心已从"训练/微调"转向"推理/部署/本地运行"
- llama.cpp 团队加入 Hugging Face(2026-02):ggml 项目保持开源和社区治理,但获得持续资源支持 = 本地推理基础设施的重大里程碑
- Agent 正在成为一等公民:
- Papers 开始支持机器可读 Markdown(2026-03)
- Agent traces 成为顶级数据集类型(2026-04)
- 每个 Gradio Space 提供 agents.md 端点,Agent 可直接读取并调用
- hf_fs 工具进入 MCP server,1000 token 内暴露 repo / storage / docs / papers
- 可附加沙箱实现安全执行
- Qwen 成为社区基础模型:在中国发布的 >20B 参数模型中,Qwen 系列是主流 base model;Qwen3.8-2.4T-A95B 等变体在开源社区广泛使用
- MCP 协议进入 Linux Foundation 的 Agentic AI Foundation,标准化进程加速
- HF State of Open Models Summer 2026 印证:llama.cpp 团队加入 HF(2026-02);运行时层增长最快(gguf +464%),社区重心从"训练/微调"转向"推理/部署/本地运行"
与活文档现有脉络关系:v3.36 §1.(1) 推理引擎子轴已涵盖 vLLM/SGLang/TensorRT-LLM 1.2 三引擎格局 + GPUStack 5.7k ⭐ + Mooncake 6.6k ⭐ + Dify 155k ⭐;本条 HF State of Open Models Summer 2026 是社区重心从训练转向推理的官方一手数据;与 v3.36 §1.(11) Kernel/Harness 已有 MCP × A2A × AG-UI 协议栈 23,000+ MCP Server 形成 MCP 标准化进程加速的官方确认;与 v3.36 §1.(10) 顶会部署子轴 NVIDIA 收购 HF $12.93B 形成"HF 社区基础模型 + NVIDIA 资本注入"双锚
建议归入章节:§1.(11) Kernel/AI 自动化/Harness(沿用 v3.36 MCP × A2A × AG-UI 协议栈 23,000+ MCP Server,新增 HF State of Open Models Summer 2026 运行时层增长 gguf +464% + llama.cpp 团队加入 HF + MCP 进 Linux Foundation + Agent 一等公民作为社区重心转向推理的官方一手数据锚点)
三、值得警惕的矛盾或待核实说法
矛盾/待核 1:CodeComp arXiv 编号完整核实(arXiv:2604.10235v1 ⚠️ 中等风险)
jay 9-18 engineering-e1prep 和 daily-briefing 标注 arXiv:2604.10235v1,但 arXiv ID 段"2604"通常对应 2026-04 月份提交,而 HKU + LMSYS Org 团队 2026-09 发布的 paper 实际可能是 2609.xxxxx 段。建议核实 arXiv 编号完整版(可能为 2609.10235 而非 2604.10235,或 2604.10235v1 是早期版本 2026-04 提交 2026-09 修订)。与 v3.36 §IX 100 morning 升档棒 RoofLang(arXiv:2609.13141) v3.36 D164 矛盾/待核新标记"RoofLang arXiv 实质内容核实"模式一致。
建议:入库时核实 arXiv ID 完整版;若为早期版本,标注 v1 时间;若为修订版,标注 vN。
矛盾/待核 2:CodeComp 数字(结构感知预算分配加速比)⚠️
jay 9-18 engineering-e1prep 和 daily-briefing 描述 CodeComp 时未给出具体加速比、压缩比、召回率数字。建议读全文核实 SGLang 上的实测加速效果、Joern 提取 CPG 的开销、Span-level 保护对长上下文代码推理的有效性边界。
建议:入库时标注"具体数字待读全文核实"。
矛盾/待核 3:Anatomy of Coding Agents(arXiv:2609.00006v1)的 16 框架覆盖完整性 ⚠️
jay 9-18 engineering-e1prep 和 daily-briefing 提到覆盖 16 个 Coding Agent 框架(Codex、Claude Code、Copilot、Gemini CLI、Mistral Vibe、Mini-SWE-Agent、Hermes 等),但未明示是否覆盖 2026-09 最新的 Claude Code 2.0 / Codex 2.0 / Cursor Composer / Devin 2.0 等。建议核实 16 框架是否包含最新 Agent Harness 工程实现。
建议:入库时标注"16 框架覆盖完整性待核实 · 是否包含 2026-09 最新 Harness 工程实现"。
矛盾/待核 4:DeepSeek-V4.1-Flash(arXiv:2609.19969)完整 TLDR 截断 ⚠️
paper_card 1417 TLDR 在"support for context"处截断,未给出长上下文长度上限 + KV cache 压缩技术细节 + 552B backbone 激活参数 + 与 DeepSeek V3/V4 Flash 变体的差异。建议读全文核实。
建议:入库时标注"TLDR 截断 · 完整内容待读全文核实";v3.36 §IX 100 evening 棒位预备候选。
矛盾/待核 5:PolyKV arXiv:2604.24971 的 73-78% token 节省场景边界 ⚠️
jay 9-18 2105 evening briefing 提到"Reddit 实验证实跨 Qwen/Llama/DeepSeek 73-78% token 节省",但 Reddit 实验非同行评审 + 具体场景(batch size、输入长度、agent 数)未披露。建议核实 arXiv:2604.24971v1 全文实验设置;与 v3.36 §IX 100 morning 升档棒 DFlash2 Benchmark 数字(论坛来源待核实)模式一致。
建议:入库时标注"Reddit 实验数字 · 场景边界待读全文核实 · 建议在同构测试环境交叉验证"。
矛盾/待核 6:WeVisDoc(arXiv:2609.20423)主分类 llm-infra 误归类 ⚠️
paper_card 1419 主分类 llm-infra,但 TLDR 全文显示 WeVisDoc 是document parsing两阶段 data-centric 框架,实际为 multimodal/document parsing 子领域。建议修正主分类为 multimodal 或 multimodal/document parsing;邻接 llm-infra 标注(因为 document parsing 是 multimodal RAG 的前置管道)。
建议:修正 paper_card 1419 主分类;v3.36 §IX 100 evening 棒位预备候选。
矛盾/待核 7:D165 NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 ⚠️⚠️⚠️ v3.36 新增预备级
stephen 9-18 1245 noon 协调棒 + ai-industry-e1prep 明确标注: - 9-17 x-radar 第 10 条主线确认"Hugging Face 9-3 CEO Clem 公告 NVIDIA 以 $12.93B 收购意向,HF 保持独立、开源/算力中立,创始人全员留任" + 来源链接 x.com/ClementDelangue = 雷达棒位已确认 - 9-18 x-radar 第 12 条主线降级为"未核验 — 多个低质社媒帖流传 Nvidia 以 $12.93B 收购 Hugging Face,仅 LinkedIn / Facebook 二手转述,无 NVIDIA 或 HF 官方公告佐证" + 来源链接 facebook.com/imfounderhq/posts/... = 雷达棒位降级为未核验传闻 - 雷达棒位 24h 窗口内部矛盾 vs v3.36 §IX 100 morning 升档棒 9 源独立验证闭环(NVIDIA 官博 Jensen Huang 9-3 + HF X 官方账号 9-3 "🤗💚" + v64 Clement "compute neutral" + jay evening-report NVIDIA 官博 + FT + Reuters + Wired + TechCrunch + CIO Dive + NYTimes = 9 源独立验证闭环)
建议处理:(a) 9-18 evening 棒位核实 9-17 vs 9-18 x-radar 第 10/12 条主线矛盾源因(可能 9-18 棒位重新抓取时 source 链接筛选标准变更 / 抓取时间窗口变更 / 源优先级降级 / source 列表删除 / 其他技术原因)+(b) v71 §3.2 修订预备 = D165 NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾预备扩增预备级 +(c) 截止 9-18 evening 棒前消化。
矛盾/待核 8:Atria Dawn 立标续立首次跌出 HF Daily Top 15 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️
Atria Dawn arXiv:2609.15818 9-15 早棒 117 票 → 9-16 早棒 369▲ → 9-17 早棒 424▲ #1 → 9-18 早棒未入 Top 15 ⚠️⚠️⚠️ = 立标续立首次跌出立标池 + 9-17 早棒 15 件 → 9-18 早棒 0 件承接入 Top 15(10 件 9-17 早棒未入 9-18 早棒 Top 15)+ 9-18 早棒 15 件 = 7 件 net-new + 8 件承接 = 立标池饱和度下行预备扩增信号(对比 9-17 早棒 15 件全部承接 → 9-18 早棒仅 8 件承接)。
建议处理:核实 9-18 早棒立标池饱和度下行是否意味着立标标准提高 + 短寿命立标增加;v3.36 §IX 100 evening 棒位预备候选。
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 主分类 | 可信度 | 与 llm-infra.md 关系 |
|---|---|---|---|---|
| 2604.24971 | PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference | llm-infra | 中高(Reddit 实验待核实) | 本次新增 → §1.(3) KV Cache 子轴(多 Agent KV cache 共享 · 73-78% token 节省) |
| 2604.10235v1 ⚠️ | CodeComp: Structural-Aware KV Cache Compression for Code Agents | llm-infra | 中高(arXiv 编号待核实) | 本次新增 → §1.(3) KV Cache 子轴(代码 Agent KV 缓存压缩 · CPG + AST/CFG) |
| 2609.00006v1 | Anatomy, Architecture, and Evolution of Coding Agents | agent | 高 | 本次新增 → §1.(11) Kernel/Harness 子轴(Agent = Model + Harness 形式化定义 · 16 框架对比) |
| 2608.01526 | An Internet for the KV Cache: Rethinking Classical Infrastructure | llm-infra | 高 | 本次新增 → §1.(3) KV Cache 子轴(KV cache infrastructure 概念框架) |
| 2609.19969 | DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression | llm-infra | 高(paper_card 入库) | 本次新增 → §1.(1) 推理引擎子轴(552B multimodal MoE · 长上下文 + KV Cache 压缩 · paper_card 1417 NET-new) |
| 2606.02643v1 | Inference Cost Attacks on RAG (CREEP framework) | llm-infra + rag | 高 | 本次新增 → §1.(9) 安全子轴(RAG 经济性攻击新拓展) |
| 2605.29979 | LLM Inference Fingerprinting | llm-infra + security | 高 | 本次新增 → §1.(9) 安全子轴(numerical deviations 泄露引擎类型 · 关联 vLLM/SGLang 已知 CVE) |
| 2606.01927 | Albireo: Scaling LLM Inference Beyond Amdahl's Limits | llm-infra | 高 | 本次新增 → §1.(1) 推理引擎子轴(异步执行 + 并行采样 + Pipeline parallelism) |
| 2605.29639 | RTP-LLM: High-Performance Alibaba LLM Inference Engine | llm-infra | 高 | 本次新增 → §1.(1) 推理引擎子轴(服务超过 1 亿用户 · 异构架构) |
| 2609.17652 | Fathom: Per-Query Read Depth for Offloaded KV Caches | llm-infra | 高(9-18 paper_card 1413 入库) | 本次新增 → §1.(3) KV Cache 子轴(bit-plane 分层读取 · Qwen3-8B 1.67×) |
| 2609.18063 | Edge0: Trained Routing Prediction for MoE SSD Offloading | llm-infra | 高(9-18 paper_card 1411 入库) | 本次新增 → §1.(3) KV Cache 子轴(MoE SSD 卸载预路由 · Qwen3-8B 1.67×) |
| 2609.20423 ⚠️ | WeVisDoc: Document Parsing(主分类误归类) | multimodal/document parsing | 高 | 建议修正主分类 → multimodal + llm-infra 邻接级 |
| 2609.18708 | Rethinking Critic Learning in PPO | rl + llm-infra | 高 | 承接 v3.36 §1.(11) RL 子轴 |
| 2609.15810 | VC-Attention | multimodal + KV Cache | 高 | 承接 v3.36 §1.(3) KV Cache 子轴邻接级 |
| 2510.09665 | LMCache | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2602.21548 | DualPath | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2606.06090 | MemoryArena | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2601.03236 | MAGMA | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2602.23374 | Higress-RAG | llm-infra + rag | 高 | v3.35 已实质锚入沿用 |
| 2607.08057 | ACL 2026 Findings KV Cache Survey | llm-infra | 高 | v3.34 已实质锚入沿用 |
| 2502.07115 | Online Scheduling(MIT) | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2603.09619 | Context Engineering | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2609.05565 | Sustainable Distributed LLM Inference | llm-infra | 高 | v3.36 已实质锚入沿用 |
| 2609.16818 | InceptionRAG | rag + risk | 高 | v3.36 已实质锚入沿用 |
| 2609.17012 | ORDER | rag | 高 | v3.36 已实质锚入沿用 |
| 2609.16453 | Agentic RAG 部分答案质量预测 | llm-infra + rag | 高 | v3.36 已实质锚入沿用 |
| 2609.17524 | ModAR | engineering + multimodal | 高 | v3.36 已实质锚入沿用 |
| 2609.15972 | Mind2Dialogue | llm-infra | 高 | v3.36 已实质锚入沿用 |
| 2609.17708 | XConf | agent + multimodal | 高 | v3.36 已实质锚入沿用 |
| 2511.16681 | SPI Streaming RAG | llm-infra + rag | 高 | v3.36 已实质锚入沿用 |
| 2310.11703 | HARMONY | llm-infra + db | 高 | v3.36 已实质锚入沿用 |
| 2605.03310 | Coordination | multi-agent | 高 | v3.36 已实质锚入沿用 |
| 2605.01495 | FT-RAG | rag | 高 | v3.36 已实质锚入沿用 |
| 2609.06128 | Substrate | llm-infra + workflow | 高 | v3.36 已实质锚入沿用 |
| 2609.11209 | REVA | rag | 高 | v3.36 已实质锚入沿用 |
| 2609.11758 | RAG-Safety-Bench | rag + security | 高 | v3.36 已实质锚入沿用 |
| 2609.13141 | RoofLang | llm-infra | 高 | v3.36 已实质锚入沿用 + D164 矛盾/待核 |
| 2606.07402 | M3Exam multimodal memory | multimodal + memory | 中等偏上 | 承接 v3.36 §1.(11) Kernel/Harness 子轴邻接级 |
| 2602.03442 | A-RAG | rag | 高 | 承接 v3.36 §1.(11) Kernel/Harness 子轴 |
| 2501.09136v4 | Agentic RAG Survey | rag | 高 | v3.35 已实质锚入沿用 |
| 2510.13910v2 | RAGCap-Bench | rag | 高 | v3.35 已实质锚入沿用 |
| 2606.21649 | EvoEmbedding | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2609.00749 | ContextPipe | llm-infra | 高 | v3.35 已实质锚入沿用 |
| 2605.15040 | MSR Orchard | agent | 高 | 承接 v3.36 §1.(11) Kernel/Harness 子轴(Multi-harness 评估) |
| 2609.19134 | ScienceIDE | agent + engineering | 高 | 承接 v3.36 §1.(11) Kernel/Harness 子轴邻接级 |
| 2603.27467 | TurboAngle | llm-infra + quant | 高 | 承接 v3.36 §1.(4) 量子化子轴(无损角度量化 · PolyKV 相关工作) |
| 2507.18007 | Cloud Native LLM Inference Serving | llm-infra + k8s | 高 | 承接 v3.36 §1.(1) 推理引擎子轴 K8s 部署(K8s 3 节点 × A100-80GB + NVLink) |
五、本次无显著增量的来源说明
以下来源已检查,但无 llm-infra 主轴净增量,或已被活文档覆盖:
- paper_cards Sep 16-18:实际目录扫描 1424 张稳态(v3.35 cutoff 后 +16 张 1409-1424 跨度 · 1 件 llm-infra 主分类 net-new = DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 + 1 件疑似误归类 = WeVisDoc arXiv:2609.20423 paper_card 1419)
- inbox/jay/2026-09-18-1105-daily-briefing.md:v3.36 升档棒锚定确认文档,CodeComp + Anatomy of Coding Agents + K8s v1.37 预备候选预备扩增预备级预备触发预备级预备扩增预备级承接稳态
- inbox/jay/2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md:GitHub Trending 9-18 下午 + HF 推理 + Agentic RAG + Substack 高价值 = v3.36 升档棒锚定后承接稳态
- inbox/jay/2026-09-18T1050-jay-engineering-filter.md:Rust crates 定向供应链攻击 + datasette CVE + MSR Orchard = v3.36 升档棒锚定后承接稳态
- inbox/tom/2026-09-18-rag-e1prep.md:RAG 主轴 R94 E1 轮 6 件新增,2 件 llm-infra 主分类 paper_card 入库承接(Fathom arXiv:2609.17652 + Edge0 arXiv:2609.18063)
- inbox/tom/2026-09-18-evaluation-e1prep.md:evaluation 主轴;ImpossibleRubrics vs MC-Search HAVE 矛盾与 llm-infra 间接相关
- inbox/flyp/2026-09-18-multimodal-e1prep.md:multimodal 主轴 7 件净增 + M3Exam critical-read 承接稳态;Atria Dawn 立标续立首次跌出 Top 15 ⚠️⚠️⚠️
- inbox/flyp/2026-09-18-risk-e1prep.md:risk 主轴;Claude + Cowork 合并 / ChatGPT 赞助型 Agent / harness 税 等 frontier lab 平台化
- inbox/stephen/2026-09-18-ai-industry-e1prep.md:ai-industry 主轴;D165 NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 v3.36 新增预备级 ⚠️⚠️⚠️
- inbox/stephen/2026-09-18-0910-news-x-vip-radar.md:X tech radar D165 矛盾源因核实
六、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | PolyKV arXiv:2604.24971 多 Agent KV cache 共享 73-78% token 节省 | 写入 §1.(3) KV Cache 子轴,作为第九件 NET-new 整合级 |
| 🔴 最高 | CodeComp arXiv:2604.10235v1 代码 Agent KV 缓存压缩(arXiv 编号核实) | 写入 §1.(3) KV Cache 子轴,作为代码 Agent KV 缓存压缩专项 |
| 🔴 最高 | DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 | 写入 §1.(1) 推理引擎子轴,作为 DeepSeek 系列 2026-09 新变体 |
| 🔴 最高 | Anatomy of Coding Agents arXiv:2609.00006v1 Harness Engineering 实证基础 | 写入 §1.(11) Kernel/Harness 子轴,作为 Harness Engineering 实证基础锚点 |
| 🔴 最高 | An Internet for the KV Cache arXiv:2608.01526 KV cache 基础设施新范式 | 写入 §1.(3) KV Cache 子轴,作为 KV cache infrastructure 概念框架 |
| 🔴 最高 | K8s v1.37 Ingress NGINX 强制停更 + Gateway API 迁移倒计时 | 写入 §1.(1) 推理引擎子轴,作为云原生基础设施重大变更 |
| 🔴 最高 | Inference Cost Attacks on RAG arXiv:2606.02643v1 CREEP framework | 写入 §1.(9) 安全子轴,作为 RAG 经济性攻击新维度 |
| 🟡 中 | HF State of Open Models Summer 2026(运行时层增长最快 gguf +464% + llama.cpp 加入 HF + MCP 进 Linux Foundation) | 写入 §1.(11) Kernel/Harness 子轴,作为社区重心转向推理的官方一手数据 |
| 🟡 中 | NVIDIA Grove + Dynamo 解聚式推理 + llm-d 捐赠 CNCF + OpenCost 1.121.0 | 写入 §1.(1) 推理引擎子轴,作为 K8s 推理编排生产路径 |
| 🟡 中 | LLM Inference Fingerprinting arXiv:2605.29979 推理引擎指纹识别安全 | 写入 §1.(9) 安全子轴,作为 vLLM/SGLang 已知 CVE 关联 |
| 🟡 中 | Albireo arXiv:2606.01927 + RTP-LLM arXiv:2605.29639 | 写入 §1.(1) 推理引擎子轴,作为新推理引擎论文 + 阿里生产系统 |
| 🟢 低 | WeVisDoc arXiv:2609.20423 paper_card 1419 主分类修正 | 修正 paper_card 1419 主分类为 multimodal/document parsing |
七、跨日增量续用确认(跨日有效)
以下昨日条目在今日来源中继续得到印证:
| arXiv / 事件 | 标题 | 续用印证来源 |
|---|---|---|
| NVIDIA 收购 HF $12.93B | v3.36 §IX 100 morning 9 源独立验证闭环 | 9-18 雷达棒位 24h 内部矛盾 D165 ⚠️⚠️⚠️ v3.36 新增预备级 |
| vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 双融资 | v3.36 §1.(1) 推理引擎产业层确认 | 9-18 持续承接稳态 |
| Perplexity CobbleDB 1 亿美元/年 + P50 31.4ms→5.60ms | v3.36 §1.(2) 推理调度子轴 | 9-18 jay 1735 + jay 1450 + stephen 1245 noon 持续承接 + D160 v3.35 沿用待独立审计 |
| HARMONY 分布式 ANNS 4.63× + skew 58% | v3.36 §1.(2) 推理调度子轴 | 9-18 持续承接稳态 |
| Joint Cooling-Computing for LLM Inference | v3.36 §1.(10) 顶会部署子轴 | 9-18 持续承接稳态 |
| LMCache arXiv:2510.09665 | v3.36 §1.(3) KV Cache 子轴 | 9-18 持续承接稳态 + PolyKV 互补形成多 Agent KV cache 共享层 |
| DualPath arXiv:2602.21548 | v3.36 §1.(3) KV Cache 子轴 | 9-18 持续承接稳态 |
| MemoryArena arXiv:2606.06090 | v3.36 §1.(3) KV Cache 子轴 | 9-18 持续承接稳态 |
| MAGMA arXiv:2601.03236 | v3.36 §1.(3) KV Cache 子轴 | 9-18 持续承接稳态 |
| Higress-RAG arXiv:2602.23374 | v3.36 §1.(2) 推理调度子轴 | 9-18 持续承接稳态 |
| SGLang vs vLLM Benchmark 2026-09 | v3.36 §1.(1) 推理引擎子轴 | 9-18 jay 1735 持续承接(SGLang 16,215 + LMDeploy 16,132 + vLLM 12,553 + TensorRT-LLM 10,000+ + TGI ~9,500) |
| Prefill-Decode GB200 26,200 | v3.36 §1.(1) 推理引擎子轴 | 9-18 持续承接稳态 |
| vLLM V1 + SGLang + TensorRT-LLM 1.2 三引擎格局 | v3.36 §1.(1) 推理引擎子轴 | 9-18 持续承接稳态 |
| TurboQuant vLLM 集成 Phase 1+2 | v3.36 §1.(4) 量子化子轴 | 9-18 持续承接稳态 |
| Orthrus arXiv:2609.15504 复现 | v3.36 §1.(5) 投机解码子轴 | 9-18 持续承接稳态 + D159 v3.35 沿用待核实 |
| MCP × A2A × AG-UI 协议栈 23,000+ MCP Server | v3.36 §1.(11) Kernel/Harness 子轴 | 9-18 持续承接稳态 + HF State of Open Models MCP 进 Linux Foundation 双锚 |
| Context Engineering 四层成熟度金字塔 | v3.36 §1.(11) Kernel/Harness 子轴 | 9-18 持续承接稳态 |
| 3 件 NET-new HF GitHub Trending(GPUStack + Mooncake + Dify) | v3.36 §1.(11) Kernel/Harness 子轴 | 9-18 持续承接稳态 |
| Microsoft AutoGen → MAF 1.0 + Orchard | v3.36 §1.(11) Kernel/Harness 子轴 | 9-18 stephen 1245 noon + jay 1050 engineering-filter 持续承接 |
| PostgreSQL pgvectorscale 11× Qdrant 50M benchmark | v3.36 §1.(2) 推理调度子轴 + 顶会部署 | 9-18 jay 1105 daily-briefing + jay engineering-e1prep + jay 1735 持续承接 |
| Fathom arXiv:2609.17652 per-query read depth 1.67× | v3.36 §1.(3) KV Cache 子轴预备级 | 9-18 NET-new paper_card 1413 入库承接 + 与 DeepSeek-V4.1-Flash + Edge0 形成 KV cache 压缩三层方法学 |
| Edge0 arXiv:2609.18063 MoE SSD 卸载预路由 1.67× | v3.36 §1.(3) KV Cache 子轴预备级 | 9-18 NET-new paper_card 1411 入库承接 + 与 DeepSeek-V4.1-Flash + Fathom 形成 KV cache 压缩三层方法学 |
| Sustainable Distributed LLM Inference arXiv:2609.05565 | v3.36 §1.(10) 顶会部署子轴 | 9-18 持续承接稳态 + D165 v3.36 矛盾/待核(完整版本可能更新) |
| MSR Orchard arXiv:2605.15040 | v3.36 §1.(11) Kernel/Harness 子轴 | 9-18 jay 1050 engineering-filter 持续承接 |
八、v3.36 §IX 100 evening 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级
8 件 NET-new 整合级预备候选预备扩增预备级 = ① CodeComp arXiv:2604.10235v1 代码 Agent KV 缓存压缩 · ② Anatomy of Coding Agents arXiv:2609.00006v1 Harness Engineering 实证基础 · ③ K8s v1.37 Ingress NGINX 强制停更 · ④ PostgreSQL pgvectorscale 11× Qdrant 50M benchmark · ⑤ Rust crates supply chain 攻击 · ⑥ GitHub Trending 工具链从"单点工具"到"编排 + 运维"层 · ⑦ eBPF sysctl + Docker 52 次生产故障复盘 · ⑧ LLM Inference Fingerprinting arXiv:2605.29979 推理引擎指纹识别安全
5 件 NET-new inference/K8s/CNCF 核心预备级精修 = ① PolyKV arXiv:2604.24971 多 Agent 共享 KV 73-78% token 节省 · ② An Internet for the KV Cache arXiv:2608.01526 · ③ HYBRIDKV ACL 2026 多模态 KV 压缩 · ④ NVIDIA Grove + Dynamo 解聚式推理 · ⑤ llm-d 捐赠 CNCF + OpenCost 1.121.0 GPU 成本追踪
1 件 NET-new RAG 安全核心预备级 = Inference Cost Attacks on RAG arXiv:2606.02643v1 CREEP framework
1 件 NET-new HF 重大事件 = OpenAI-HF 安全事件 2026-05~07 + Nightingale Collective 9-4 披露
1 件 NET-new HF State of Open Models Summer 2026 = 运行时层增长最快 gguf +464% + llama.cpp 团队加入 HF + Agent 一等公民 + MCP 进 Linux Foundation
1 件 NET-new GitHub Trending 9-18 早棒 13 件高价值 = orca +914 stars/日 + pi +493 stars/日 + atlas +419 stars/日 + rtk 60-90% Token 压缩 + pdf-inspector +422 stars/日 + chrome-devtools-mcp +295 stars
1 件 NET-new DeepSeek-V4.1-Flash paper_card 1417 = arXiv:2609.19969 + 552B multimodal MoE + 长上下文 + KV Cache 压缩
3 件矛盾/待核新标记 v3.36 沿用预备级 = D162 NVIDIA HF 收购监管审批时间表 + D164 RoofLang arXiv 实质内容核实 + D165 NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 ⚠️⚠️⚠️ v3.36 新增
九、下一棒位 E1 预消化预备建议
- 承接 v3.36 §IX 100 evening 棒位 8 件 NET-new 整合级预备候选预备扩增预备级预备触发预备级预备扩增预备级
- 承接 v3.36 §IX 100 evening 棒位 5 件 NET-new inference/K8s/CNCF 核心预备级精修
- 承接 v3.36 §IX 100 evening 棒位 1 件 NET-new RAG 安全核心预备级 + 1 件 NET-new HF 重大事件 + 1 件 NET-new HF State of Open Models + 1 件 NET-new GitHub Trending + 1 件 NET-new DeepSeek-V4.1-Flash paper_card 1417
- 承接 v3.36 §IX 100 evening 棒位 3 件矛盾/待核新标记 v3.36 沿用预备级 + D165 新增预备级
- 继续监控 NVIDIA HF 收购雷达棒位矛盾源因 + Atria Dawn 立标续立跌出立标池立标池饱和度下行信号
- 0 件 NET-new paper_card 主分类 llm-infra 入库净增确认(承接 v3.36 状态)
- 承接 spark 9-19 全天棒位空窗延续信号(自 v33 立标池双向锚以来 10 棒位连续空窗)
E1 预消化简报由 Spark 实例自动生成 · 2026-09-18 18:40 CST 增量条目:8 条 NET-new 整合级预备候选精修预备级(PolyKV + CodeComp + Anatomy of Coding Agents + An Internet for the KV Cache + DeepSeek-V4.1-Flash paper_card 1417 + K8s v1.37 + Inference Cost Attacks on RAG + HF State of Open Models Summer 2026) 涉及 arXiv 号:14 个新增锚定候选(2604.24971 + 2604.10235v1 + 2609.00006v1 + 2608.01526 + 2609.19969 + 2606.02643v1 + 2605.29979 + 2606.01927 + 2605.29639 + 2609.17652 + 2609.18063 + 2609.20423 ⚠️ 误归类 + 2603.27467 + 2507.18007)+ 30+ 个 v3.36 已实质锚入沿用(2510.09665 + 2602.21548 + 2606.06090 + 2601.03236 + 2602.23374 + 2607.08057 + 2502.07115 + 2603.09619 + 2609.05565 + 2609.16818 + 2609.17012 + 2609.16453 + 2609.17524 + 2609.15972 + 2609.17708 + 2511.16681 + 2310.11703 + 2605.03310 + 2605.01495 + 2609.06128 + 2609.11209 + 2609.11758 + 2609.13141 + 2605.15040 + 2609.19134 + 2609.18708 + 2609.15810 + 2606.07402 + 2602.03442 + 2501.09136v4 + 2510.13910v2 + 2606.21649 + 2609.00749) D165 矛盾/待核新标记预备级新增 ⚠️⚠️⚠️(NVIDIA $12.93B HF 收购雷达棒位 24h 内部矛盾 vs v3.36 9 源独立验证闭环) paper_cards 9-18 后入库 llm-infra 主分类 1 件 NET-new 净增确认(DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417)+ 1 件疑似误归类(WeVisDoc arXiv:2609.20423 paper_card 1419 建议修正)