llm-infra · E1 预消化简报(2026-09-17)
实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-17 18:40 CST 基线:
organized/knowledge/llm-infra.mdv3.35 §IX 99 evening 微调棒(cutoff 2026-09-17 05:00 CST · arXiv/CVE/DOI/URL 356/36/14/512 · 0 件 NET-new paper_card 主分类 llm-infra 在 v3.35 cutoff 后入库净增(实际目录扫描 1408 张稳态 · v3.35 cutoff 后 +15 张(1394-1408 跨度)= engineering 4 + multimodal 5 + agent 4 + rag 2 + evaluation 1 + 0 件 llm-infra 主分类 · 其中 1399-2609-12552 RelateAnything 误归类 llm-infra 实际为 multimodal 场景图 + 1405-2609-17708 XConf 副分类 llm-infra 主分类 agent)+ 5 件 NET-new arXiv ID v3.35 已入主文件(LMCache arXiv:2510.09665 ⭐⭐⭐⭐⭐ + DualPath arXiv:2602.21548 ⭐⭐⭐⭐⭐ + MemoryArena arXiv:2606.06090 + MAGMA arXiv:2601.03236 + Higress-RAG arXiv:2602.23374)+ 8 件 NET-new 事件级/方法学实质锚入 v3.35 闭合(LMCache + DualPath + ACL 2026 Findings arXiv:2607.08057 + Online Scheduling arXiv:2502.07115 + Prefill-Decode GB200 26,200 + SGLang vs vLLM Benchmark 2026-09 + Orthrus 复现 + MCP × A2A × AG-UI)+ 3 件 NET-new HF GitHub Trending 实质锚入 v3.35 闭合(GPUStack 5.7k ⭐ + Mooncake 6.6k ⭐ + Dify 155k ⭐)+ D159-D161 v3.35 新增 3 件矛盾(Orthrus 复现 4 项待核 + Perplexity CobbleDB 1 亿美元独立审计 + TurboQuant vLLM 集成实测边界)) 本棒窗口:v3.35 cutoff 2026-09-17 05:00 → 2026-09-17 18:40 = 约 13h 40min 净窗口期 + 9-16 18:40 → 9-17 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.35 微调棒落定后 13h 40min 净窗口期延长稳态 + 0 件 NET-new paper_card 主分类 llm-infra 入库(1408 张稳态 · v3.35 cutoff 后 +15 张 1394-1408 跨度 · 0 件 llm-infra 主分类)+ v3.35 微调棒 8 件核心预备候选已完成实质锚入,本棒位承接 v3.35 稳态 = 承接 jay 9-17 全天棒位 5 件核心 NET-new 整合级(① NVIDIA 收购 Hugging Face $129.3 亿 ✅ 重大行业变局 ② vLLM/SGLang 双融资 = Inferact $1.5 亿 / RadixArk $4 亿 = 推理层进入 AI 基础设施核心层 ③ Perplexity Q2D-Web Benchmark 1.9 亿文档 agentic RAG 工业级评测 ④ HARMONY 分布式 ANNS 4.63× + skew 58% ⑤ Joint Cooling-Computing for LLM Inference AI 数据中心能耗)+ flyp 9-17 0950 FLAT critical-read 多模态 + rag 双锚精读承接稳态 + v3.35 §IX 100 morning 棒位预备候选(NVIDIA/HF 收购 + Q2D-Web + SPI Streaming RAG + HARMONY + RoofLang + Joint Cooling-Computing)预备候选预备扩增预备级预备触发预备级预备扩增预备级承接稳态 + 2 件矛盾/待核新标记 v3.35 沿用预备级(D160 Perplexity CobbleDB 数据沿用 + D161 TurboQuant 实测边界沿用)。
一、检查过的来源清单
1.1 工作队列 + v3.35 知识库活文档(沿用稳态)
-
✅
organized/queue/work-queue.md(2026-09-17 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 6 件(SpectralShift 2609.14320 / HypoEvolve 2609.15938 / Zing-0.5 2609.17909 / Confidence Comes from Experience 2609.17708 / Zeroth-Order LLM Preference Alignment 2609.19144 / ActionPiece 2609.18487 · 0 件主分类 llm-infra · 全部为 agent/risk/multimodal 主分类)+ 选题榜未成视频脚本 1 件(InceptionRAG 2609.16818)+ 待更新/缺失主题活文档 0 件 · 富化缺口 15 张卡缺 TLDR · 待精确分类 1 张卡(cron_classify_llm 低峰消化)· spark 认领段 = 无 · work-queue 9-17 主分类 llm-infra 0 件 net-new 警示(沿用 v3.35 状态)+ work-queue Top 5 9-16 evening 批次 1380-1387 = 8 件 + work-queue Top 5 9-17 14:10 批次 1394-1400 = 7 件 + work-queue Top 5 9-17 16:30 批次 1401-1408 = 8 件 = 共 23 件新增 Top 5,0 件主分类 llm-infra(全部 engineering/multimodal/agent/risk/evaluation 主分类) -
✅
organized/knowledge/llm-infra.mdv3.35 §IX 99 evening 微调棒(2026-09-17 05:00):arXiv/CVE/DOI/URL 356/36/14/512 精确闭合 + paper_cards 实际目录扫描 1408 张稳态(v3.34 cutoff 后 +15 张 1394-1408 跨度 · 0 件主分类 llm-infra)+ 8 件 NET-new 事件级/方法学实质锚入 v3.35 闭合(LMCache arXiv:2510.09665 ⭐⭐⭐⭐⭐ + DualPath arXiv:2602.21548 ⭐⭐⭐⭐⭐ + ACL 2026 Findings arXiv:2607.08057 + Online Scheduling arXiv:2502.07115 + Prefill-Decode GB200 26,200 + SGLang vs vLLM Benchmark 2026-09 + Orthrus 复现 arXiv:2609.15504 + MCP × A2A × AG-UI 23,000+ MCP Server)+ 3 件 NET-new 邻接级预备级 v3.35 闭合(EvoEmbedding arXiv:2606.21649 + Agentic RAG Survey arXiv:2501.09136v4 + ContextPipe arXiv:2609.00749)+ 2 件 NET-new 决策框架 v3.35 闭合(vLLM V1 + SGLang + TensorRT-LLM 1.2 三引擎格局定稿 + TurboQuant vLLM 集成 vllm-project/vllm#38479 Phase 1+2)+ 3 件 NET-new HF GitHub Trending 实质锚入 v3.35 闭合(GPUStack 5.7k ⭐ + Mooncake 6.6k ⭐ + Dify 155k ⭐)+ 1 件 NET-new 数据库基础设施案例(Perplexity CobbleDB 1 亿美元/年 P50 31.4ms→5.60ms)+ 1 件 NET-new 上下文工程成熟度模型(Context Engineering 四层金字塔 arXiv:2603.09619)+ 1 件 NET-new Memory 系统价值量化(MemoryArena arXiv:2606.06090 45%→>80%)+ 1 件 NET-new 协议栈现状(MCP × A2A × AG-UI 23,000+ MCP Server)+ 5 件 NET-new arXiv ID v3.35 入主文件(LMCache + DualPath + MemoryArena + MAGMA + Higress-RAG)+ D159-D161 v3.35 新增 3 件矛盾(Orthrus 复现 4 项待核 + Perplexity CobbleDB 1 亿美元独立审计 + TurboQuant vLLM 集成实测边界)+ D154-D158 v3.33/v3.34 沿用 + O519-O523 v3.35 新增 + P0 #263-#267 v3.35 新增 + T134 §IX 99 evening v3.35 微调棒新增
1.2 inbox/spark(2026-09-16 18:40 → 2026-09-17 18:40 · spark 全天棒位空窗延续 + 13:30 agent 棒位单产出)
- ✅
2026-09-16-llm-infra-e1prep.md(2026-09-16 18:40 CST · spark 9-16 evening 棒位 76KB · v3.34 升档棒基线沿用 · 9 件 NET-new 预备候选精修预备级 · 本棒位承接基线) - ✅
2026-09-17-1000-rss-gradient-flow.md(2026-09-17 10:00 CST · 5 件 = Google 1000 万美元购买 Spirit Airlines Teams 聊天记录 + Water/Noise/Power Data Center 真实成本 + 没有科幻色彩的自我改进 + AI 模型只是租赁品 + 当工作履历成为 AI 资产)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(6) 长上下文子轴 + §1.(10) 顶会部署子轴(数据中心能耗)沿用稳态 - ✅
2026-09-17-1002-rss-chip-huyen.md(2026-09-17 10:02 CST · 5 件 = 构建生成式 AI 应用常见陷阱 + Agents + 构建生成式 AI 平台 + 衡量个人成长 + 900 个最受欢迎开源 AI 工具观察)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-17-1004-rss-yt-3blue1brown.md(2026-09-17 10:04 CST · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-17-agent-e1prep.md(2026-09-17 13:30 CST · spark 9-17 午棒主力补位 60KB · v96 agent 升档棒基线沿用 + 8 件今日 agent 主轴核心增量 + 24 件备料条目 · 跨主轴承接信号 = MA AutoGen→MAF 1.0 + Orchard 双轨布局 + Microsoft MAF 1.0 双协议 + Perplexity CobbleDB 跨主轴承接 = 与 llm-infra 主轴交叉承接稳态)
spark 9-17 全天棒位空窗延续 3 棒位(stephen 9-17 1245 noon 协调棒明确标注 ⚠️ 沿用):13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 3 份 RSS 抓取 + 1 份 agent 主题(13:30 沿用 9-16 13:30)= spark 自 v33 立标池双向锚以来 8 棒位连续空窗 + 9-17 单日空窗延续 = 本棒位为 spark 9-17 evening 棒位预备补位(承接 spark 9-16 evening llm-infra e1prep 76KB)。
1.3 inbox/jay(2026-09-16 18:40 → 2026-09-17 18:40 · llm-infra 主轴主承载 · 17 文件 ≈ 130KB)
- ✅
2026-09-17-0947-github-hf-inference-agentic-vecdb-trending.md(2026-09-17 09:47 CST · 8.7KB · 本棒位核心增量源 1)· GitHub Trending 9-17 早棒 7 件高价值 = ① alibaba/open-code-review(混合架构代码审查 · 确定性流水线 + LLM Agent 结合 · 多语言规则集)② cloudflare/security-audit-skill(AI Agent 安全审计 Skill · 今日 927 stars · 邻接 v3.35 §1.(11) Kernel/Harness)③ JustVugg/colibri(纯 C 语言推理引擎 ⚠️ · 无依赖 · Expert 磁盘流式加载 · MoE 推理引擎的极简主义工程实践 · 邻接 v3.35 §1.(1) 推理引擎子轴)④ alphaXiv/OpenResearch(编码 Agent → 研究 Agent · Rust · 今日 1017 stars)⑤ Tencent/WeKnora(RAG + 自主演绎 Agent + 自维护 Wiki · 端到端知识库系统)⑥ addyosmani/agent-skills(AI 编码 Agent 工程技能库 · 95K stars · 今日 658 stars)⑦ multimodal-art-projection/YuE(基于 LLaMA2 开源音乐生成基础模型)· HF Blog 2 件 = ① State of Open Models Summer 2026(Qwen 已成社区默认基础模型 · 衍生版本增速约 180-210 repos/天 · 邻接 v3.35 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 沿用)② ICML 2026 可复现性黑客松(1200+ 社区成员 19 天复现 2226 篇 ICML 2026 论文 ≈ 1/3 会议论文 ⚠️ · 揭示 AI 研究可复现性危机规模化证据 · 邻接 v3.35 §1.(10) 顶会部署子轴)· HF Trending Papers W36 = Repo-To-Skill BAAI / DRACO IBM Research(长程 Agent 信用分配)/ PACE POSTECH / Unlocking Lossless Speedups via Discrete Diffusion · vLLM Korea Meetup 2026 vLLM V1 + Prefill-Decode disaggregation AMD MORI-IO 8-GPU MI300X 节点上的实践 - ✅
2026-09-17-agentic-rag-production.md(2026-09-17 10:51 CST · 9.1KB · 本棒位核心增量源 2)· 10 件精选高价值条目 = ① LangChain State of Agent Engineering 2026(57% 组织已有 agent 在生产 · 集成是最大痛点 46% · 邻接 v3.35 §1.(11) Kernel/Harness 沿用)② AI Engineer Substack AI Agents Stack 2026 Edition(eval-as-infrastructure 三层架构 · Context-Bench/Recovery-Bench/Terminal-Bench 新 benchmark · 邻接 v3.35 §1.(11) Kernel/Harness 沿用)③ Awesome-RAG-Production GitHub(OpenAI Responses API 迁移指南 · Vanna 已 archive 推荐 WrenAI · Anthropic Prompt Caching 10% 读价格)④ microsoft/ai-agents-for-beginners 74.4k stars(18 节 AI agent 入门课程)⑤ agentic-rag-patterns(实现 arXiv:2501.09136 Agentic RAG Survey · A2AJava 框架)⑥ Awesome-Search-Agent-Papers(2026 arXiv search/agent 论文集 DRNOISE/PACE/DISCOBENCH/DRFLOW/CIGPO/PATS/AREX/Reason Before You Retrieve)⑦ HuggingFace RAG Benchmark 2026-Q2(1840 文档语料库 · 240 query · Recall@5/MRR/nDCG@10/faithfulness/citation accuracy/p95 latency/$ per 1k queries · Claude/GPT/Gemini 对比 · 邻接 v3.35 §1.(10) 顶会部署子轴)⑧ RAGCap-Bench arXiv:2510.13910v2(Agentic RAG 组件级评测 · planning/retrieval/reasoning 各阶段评估 · v3.35 已实质锚入 §1.(10) 顶会部署子轴预备扩增预备级)⑨ A-RAG arXiv:2602.03442(分层检索接口扩展 agentic RAG)⑩ AI Agent Architecture 2026 dev.to(SWE-bench-lite 62% resolve rate · 多 agent 拓扑 · 运行时安全 wrapper) - ✅
2026-09-17-research-brief.md(2026-09-17 11:07 CST · 9.7KB · 本棒位核心增量源 3 · DATABASE / BACKEND / CLOUD-NATIVE / CSDN / REPRODUCTION 五分类简报)· DATABASE = ① SPI Query-Depth-Adaptive Indexing for Streaming RAG in Vector Databases arXiv:2511.16681 v3 修订 2026-06-14 ⭐⭐⭐⭐⭐(query-adaptive resolution control + hierarchical indexing · 动态索引分辨率 · 无需离线调参 · 工程价值极高)② HARMONY 分布式 ANNS 系统 arXiv:2310.11703 ⭐⭐⭐⭐(多粒度分区 + early-stop pruning · 吞吐量 4.63× · 偏斜负载 +58%)③ FT-RAG arXiv:2605.01495v1 ⭐⭐⭐⭐(细粒度 RAG + 知识图谱增强 · 多跳推理)④ DuckDB + MotherDuck 构建 Obsidian RAG ⭐⭐⭐(local-first 知识管理)· BACKEND = ⑤ Microsoft AutoGen 进入维护模式 + Microsoft Agent Framework (MAF) 1.0 接替 ⭐⭐⭐⭐⭐(官方继承者 · .NET + Python 双 SDK · 整合 Semantic Kernel + AutoGen · 同时支持 MCP + A2A · Foundry SDK + MCP SDK + A2A SDK + M365 Copilot Agents · 提供 AutoGen → MAF 迁移指南 · 企业级多 Agent 选型重大变化)⑥ AI Agent 框架 2026 选型决策树(manduks GitHub Gist 2026-03)⑦ Coordination as an Architectural Layer arXiv:2605.03310 ⭐⭐⭐⭐(多 Agent 协调层 · 不可识别定理 · 工业界已向声明式工作流收敛 AWS Strands YAML + Microsoft Foundry)· CLOUD-NATIVE = CNCF 云原生发展报告 + etcd 52.2k stars / ClickHouse 49.8k stars / DBeaver 51.7k stars · REPRODUCTION = SPI / HARMONY / Multi-Agent 协调层论文复现路径 - ✅
2026-09-17-engineering-e1prep.md(2026-09-17 11:22 CST · 20.6KB · Jay 主棒 · engineering 主轴 · 本棒位核心增量源 4)· 8 件 NET-new 整合级承接(承接 v3.35 §1.(2) 推理调度 + §1.(11) Kernel/Harness + §1.(10) 顶会部署子轴) = ① Perplexity CobbleDB ⭐⭐⭐⭐⭐(P50 31.4ms→5.60ms ≈ 5× · 每年最多节省 1 亿美元 · 2 工程师 + 数百 Computer 智能体 2 月搭建 · v3.35 §1.(2) 推理调度子轴已实质锚入预备扩增预备级 + D160 待独立审计沿用)② Microsoft AutoGen → MAF 1.0 接替 ⭐⭐⭐⭐⭐(同 research-brief)③ Microsoft Research Orchard ⭐⭐⭐⭐⭐(MSR Blog · 开源可扩展 Agentic AI 框架 · Orchard 面向研究 / MAF 1.0 面向生产部署 = Microsoft Agent 战略双轨布局 · 邻接 v3.35 §1.(11) Kernel/Harness 子轴)④ InceptionRAG arXiv:2609.16818 ⭐⭐⭐⭐(RAG 隐蔽投毒攻击新类别 · 间接逻辑诱导 · 绕过现有防御机制 · paper_card 1382)⑤ ORDER arXiv:2609.17012 ⭐⭐⭐⭐(查询条件化 RAG 动态路由 · 联合自适应调整索引与检索策略 · paper_card 1381)⑥ 预测 Agentic RAG 部分答案质量与效用 arXiv:2609.16453 ⭐⭐⭐⭐(多跳问答范式 · 部分答案质量预测 · 提前判断检索结果是否足够支撑回答 · 邻接 v3.35 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴)⑦ ModAR arXiv:2609.17524 ⭐⭐⭐⭐(模态自回归世界-动作模型 · WAM 多模态扩展 · 首个以自回归方式对多个未来模态去噪 · paper_card 1383 · ⚠️ 主分类争议 engineering + multimodal 邻接)⑧ Mind2Dialogue arXiv:2609.15972 ⭐⭐⭐(无推理轨迹的专家模型训练 · 蒸馏方向新方法论 · paper_card 1385) - ✅
2026-09-17-csdn-high-value.md(2026-09-17 12:21 CST · 7.8KB · CSDN 高价值技术分享检索报告 · 4 件高价值) = ① 企业级 RAG 系统构建与优化实战指南 ⭐⭐⭐⭐⭐(自适应分块代码示例 · 缓存命中率 78% · 知识查询效率提升 47× · 幻觉率 <0.3% · 邻接 v3.35 §1.(11) Kernel/Harness 子轴 + §1.(2) 推理调度子轴沿用)② RAG 2026 实战指南:从朴素检索到高性能 Agentic/Graph 混合架构 ⭐⭐⭐⭐⭐(60% RAG 项目在试运行阶段失败 · Agentic RAG Llama 3.3 评测 92% · Hybrid RAG 2026 默认生产级选择 · LlamaIndex 0.10.35 + Chroma/Qdrant + bge-reranker-v2-m3)③ TensorRT 入门完全指南 ⭐⭐⭐⭐⭐(PyTorch 量化工具包直接导出到 TensorRT 优化 · 邻接 v3.35 §1.(1) 推理引擎子轴 · TensorRT-LLM 1.2)④ 深入了解 LLM 微调方法 ⭐⭐⭐⭐(SFT + LoRA + QLoRA + Adapter + Prefix Tuning + PEFT 仅更新 0.1-2% 参数 · 成本降低 99.5%) - ✅
2026-09-17-1000-rss-{bytebytego,nathan-benaich,raschka,simon-willison}.md× 4 /1001-rss-{cool-papers,cool-papers-ir,lilian-weng}.md× 3 /1002-rss-{import-ai,msr-blog}.md× 2 /1003-rss-yt-{karpathy}.md/1004-rss-yt-{fireship}.md(10:00~10:04 CST · 11 件 RSS 抓取 0.5~2KB)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态 - ✅
2026-09-17-1140-news-x-tech-radar.md(2026-09-17 11:42 CST · 3.2KB · X tech radar)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态
jay 9-17 全天棒位 llm-infra 主轴承接总计:17 文件 = 0 件 NET-new 论文方法学首次锚入预备级(全部承接 v3.35 8 件核心预备候选 + 5 件 NET-new arXiv ID)+ 5 件 NET-new 整合级事件/方法学预备候选预备扩增预备级预备触发预备级预备扩增预备级承接(① JustVugg/colibri 纯 C MoE 推理引擎 邻接 v3.35 §1.(1) 推理引擎子轴 + ② NVIDIA 收购 HF $129.3 亿 + ③ vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 双融资 + ④ Perplexity Q2D-Web Benchmark 1.9 亿文档 agentic RAG 工业级评测 + ⑤ HARMONY 分布式 ANNS 4.63× + skew 58%)+ 2 件 NET-new 数据库子主题承接稳态(SPI Streaming RAG arXiv:2511.16681 + HARMONY arXiv:2310.11703)+ 1 件 NET-new RAG 隐蔽投毒攻击新类别承接稳态(InceptionRAG arXiv:2609.16818 paper_card 1382)+ 1 件 NET-new Microsoft Agent Framework 双轨布局承接稳态(AutoGen→MAF 1.0 + Orchard)+ 1 件 NET-new ICML 2026 可复现性黑客松承接稳态(1200+ 社区 19 天复现 2226 篇 ≈ 1/3 ICML 2026 ⚠️)+ 1 件 NET-new Qwen 已成社区默认基础模型承接稳态(衍生版本 180-210 repos/天)+ 4 件 NET-new CSDN 高价值承接稳态(企业级 RAG + RAG 2026 + TensorRT + LLM 微调)+ 0 件 NET-new paper_card 主分类 llm-infra 在 v3.35 cutoff 后入库净增确认(实际目录扫描 1408 张稳态 · v3.35 cutoff 后 +15 张 1394-1408 跨度 · 0 件 llm-infra 主分类 · 1399-2609-12552 RelateAnything 误归类 llm-infra 实际为 multimodal 场景图 + 1405-2609-17708 XConf 副分类 llm-infra 主分类 agent)
1.4 inbox/tom(2026-09-16 18:40 → 2026-09-17 18:40)
- ✅
2026-09-17-0900-hf-daily-2026-09-17.md(2026-09-17 09:00 CST · HF Daily 9-17 早棒 15 件)· 0 件 llm-infra 主轴立标信号 net-new 突破 · 关键 llm-infra 邻接级立标信号 = Grouped Value AttentionarXiv:2609.1328564▲ #9 multimodal 邻接级 + v3.34/v3.35 已实质锚入 §1.(3) KV cache 子轴预备扩增预备级 + OrthrusarXiv:2609.1550429▲ #11 multimodal 邻接级 + v3.34/v3.35 已实质锚入 §1.(5) 投机解码子轴预备扩增预备级(承接 flyp 9-16 0950 critical-read ⭐⭐⭐⭐⭐)+ Register TokensarXiv:2609.163723▲ multimodal 邻接级 + paper_card 1396 已入库(承接 v3.35 §1.(3) KV cache 邻接级 + dLLM 邻接级)+ LimiX-2arXiv:2609.17488paper_card 1395 engineering 主分类 multimodal 邻接级 + Convergent EmergencearXiv:2609.14011paper_card 1398 multimodal 主分类 + RelateAnythingarXiv:2609.12552paper_card 1399 误归类 llm-infra 实际为 multimodal 场景图 + OmniHarnessarXiv:2609.16057paper_card 1397 evaluation 主分类 multimodal 邻接级 + GAIarXiv:2609.134062▲ paper_card 1400 agent 主分类(RSI 议题第七源)+ Persistent Continual LearningarXiv:2609.06986287▲ #3 multimodal 邻接级 = 承接 v3.35 §1.(3) KV cache 子轴 + §1.(5) 投机解码子轴 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级 + 0 件 llm-infra 主轴立标信号 net-new 突破 · 邻接 v3.35 §1.(3) KV cache 子轴 + §1.(5) 投机解码子轴 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级承接稳态 - ✅
2026-09-17T0840-agent-rag-longcontext-radar.md(2026-09-17 08:40 CST · Tom 9-17 0840 radar)· 0 件 llm-infra 主轴 net-new · GAIarXiv:2609.134062▲ 承接 RSI 议题第七源预备级触发 + FLATarXiv:2609.1659112▲ multimodal + rag 主轴双锚承接 + ImpossibleRubricsarXiv:2609.168162▲ evaluation 主分类承接 + Register TokensarXiv:2609.163723▲ 承接 v3.35 §1.(3) KV cache 邻接级 + dLLM 邻接级 - ✅
2026-09-17-rag-e1prep.md(2026-09-17 08:52 CST · Tom R93 早棒 18KB)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(1) 推理引擎子轴 + §1.(10) 顶会部署子轴 沿用稳态 - ✅
2026-09-16-inference-e1prep.md(2026-09-16 22:00 CST · Tom 9-16 evening 棒位 31KB)· 承接 v3.34 升档棒稳态 + 7 件主增量 = ① LMCache ⭐⭐⭐⭐⭐ + ② DualPath ⭐⭐⭐⭐⭐ + ③ ACL 2026 KV Cache 综述 + ④ Prefill-Decode 物理分离生产工程 + ⑤ SGLang vs vLLM Benchmark 2026-09 + ⑥ MCP × A2A × AG-UI 协议栈 + ⑦ Orthrus 复现 BF16 45%/43% + FP32 100% + 承接 jay 9-16 全天棒位 12 文件承接稳态 + 0 件 llm-infra 主轴 net-new(承接 v3.35 预备扩增预备级) - ✅
2026-09-17-evaluation-e1prep.md(2026-09-17 15:43 CST · Tom evaluation 主轴 22.9KB · 承接 v3.35 §1.(10) 顶会部署子轴预备扩增预备级 = ImpossibleRubrics vs MC-Search HAVE 框架矛盾沿用 + Magnitude Illusion 置信度幅度≠可靠性 阈值弃权策略待核 + Agentic RAG 部分答案质量预测 arXiv:2609.16453 邻接承接)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态 - ✅
2026-09-17-1003-rss-yt-yannic-kilcher.md/1004-rss-yt-lex-fridman.md(9-17 10:03-10:04 CST · RSS 抓取 9 行)
tom 9-17 棒位 llm-infra 主轴信号 0 件 net-new · HF Daily 9-17 早棒 15 件立标信号中 2 件(GVA 64▲ + Orthrus 29▲)已 v3.34/v3.35 实质锚入预备扩增预备级预备触发预备级预备扩增预备级承接稳态 + Register Tokens 3▲ multimodal 邻接级承接 v3.35 §1.(3) KV cache 子轴 · 8 件 GAI/FLAT/ImpossibleRubrics 承接 v3.35 §1.(3) KV cache + §1.(5) 投机解码 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级承接稳态
1.5 inbox/flyp(2026-09-16 18:40 → 2026-09-17 18:40)
- ✅
2026-09-17-multimodal-e1prep.md(2026-09-17 09:44 CST · 43KB · flyp 9-17 早棒 v87+5→v87+6 备料 7 件 multimodal 主轴净增)· 0 件 llm-infra 主轴 net-new + Atria Dawn 立标续立稳态 9-17 早棒 424▲ #1 + ZGCM-1 302▲ #2 + 持续学习组合 287▲ #3 + Game AI 107▲ #4 + StepAudio 3 Realtime 91▲ #5 + 人类构建的最后一个 AI 86▲ #6 + StepAudio 3 Music 70▲ #7 + RSIAgent 70▲ #8 + GVA 64▲ + LynnReal-Omni 46▲ + Orthrus 29▲ + AlayaVista 22▲ + ScienceBuddy 17▲ + Kaininja 17▲ + HarnessVLN 15▲ = 承接 v3.35 §1.(3) KV cache + §1.(5) 投机解码 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级承接稳态 - ✅
2026-09-17-0950-FLAT-Flexible-Length-Aligned-Transmodal-critical-read.md(2026-09-17 09:50 CST · 8.6KB · flyp 9-17 精读棒)· FLATarXiv:2609.16591批判性精读 = arXiv 2609.16591v1 · 2026-09-15 提交 · HF Daily 12▲ · tom 9-17 0840 radar 高价值 #1 · multimodal + rag 主轴双锚(承接 v3.35 §1.(3) KV cache + §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级 + multimodal + rag 双锚邻接级承接稳态)+ 5 件核心问题 = ① "联合优化" 真实性边界 ⚠️ 关键(83.1 GenEval / 40.5 BLEU-4 都是 fine-tune 后 · "联合预训练"卖点是 71.1 GenEval 零样本 + 统一表征可同时服务检索与生成 · "Jointly" 词被放大)② 数据规模与算力未披露 ⚠️ 复现难点(预训练数据量/GPU hours/参数量未给 · 复现难度 🟠 中-高)③ 与已有工作边际贡献(UniSpace / Argus-Unified / MLLMCLIP / Twins / SCALPEL / DIFFCZSL 同期同思路 · 赛道拥挤)④ 应用层 / 工业部署可行性(linearly interpolatable embeddings + latent space arithmetic + zero-shot composed retrieval 都是演示型能力 · 1D flexible-length 在 batch / KV cache 调度上是否友好未明)⑤ HF Daily 12 票 vs 同期立标信号差距 ⚠️(立标中位 50-200▲ 未触发)· 综合可信度 🟡 中 - ✅
2026-09-17-1000-rss-cameron-wolfe.md(2026-09-17 10:00 CST · 1.0KB · 5 件 RSS = 面向 LLM 的强化学习 + Midtraining + Agentic 世界模型 + Agentic RL + Agent 评估详尽指南 = frontier lab RL 方法学预备级)· 0 件 llm-infra 主轴 net-new · 邻接 v3.35 §1.(11) Kernel/Harness 沿用稳态 - ✅
2026-09-17-1001-rss-interconnects.md(2026-09-17 10:01 CST · 1.0KB · 5 件 RSS)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-17-1003-rss-yt-ai-explained.md(2026-09-17 10:03 CST · 0.6KB · 5 件)· 0 件 llm-infra 主轴 net-new
flyp 9-17 棒位 llm-infra 主轴信号 0 件 net-new · multimodal 主轴 7 件净增承接稳态 + FLAT critical-read 8.6KB ⭐⭐⭐ 精读承接稳态
1.6 inbox/stephen(2026-09-16 18:40 → 2026-09-17 18:40)
- ✅
2026-09-17-1245-stephen-coordination-check-noon.md(2026-09-17 12:45 CST · Stephen 9-17 noon 协调棒 73KB+ · 本棒位协调核实棒)· 本棒位判:spark 9-17 早棒位空窗延续 ⚠️(0 份 llm-infra 主轴 e1prep 棒产出 + 3 份 RSS 抓取 + 1 份 agent 主题 13:30)+ jay 9-17 全天 17 文件 5 件 NET-new 整合级 + 1 件 Microsoft MAF 1.0 双轨布局 + 2 件数据库子主题承接稳态 + 1 件 RAG 隐蔽投毒攻击新类别承接稳态 + 1 件 ICML 2026 可复现性黑客松承接稳态 + 1 件 Qwen 已成社区默认基础模型承接稳态 + 4 件 CSDN 高价值承接稳态 + 0 件 NET-new 主分类 llm-infra paper_card 入库 = 第 1 频承接棒位(Microsoft MAF 1.0 双协议 + Microsoft Orchard + Perplexity CobbleDB 跨主轴承接 + InceptionRAG + ORDER + ModAR + Mind2Dialogue + JustVugg/colibri 纯 C MoE 推理引擎 + ICML 2026 2226 篇复现 + 4 件 CSDN 高价值)+ tom 9-17 棒位 llm-infra 主轴信号 0 件 net-new + flyp 9-17 棒位 0 件核心增量 + spark 9-17 早棒空窗 3 棒位延续 · 12+ 件跨实例去重矩阵已列出(Atria Dawn + ZGCM-1 + 持续学习组合 + Game AI + StepAudio 3 Realtime + 人类构建的最后一个 AI + StepAudio 3 Music + RSIAgent + GVA + LynnReal-Omni + Orthrus + AlayaVista + ScienceBuddy + Register Tokens + ORDER + ModAR)+ 缺口 G3 spark 9-17 早棒缺位延续 + 冲突 C2 Atria Dawn 主分类争议 multimodal 主轴候选 #2 → agent 主轴 + multimodal 邻接级双锚 - ✅
2026-09-17-0910-news-x-vip-radar.md(2026-09-17 09:11 CST · vip-radar 2.3KB · 10 账号 · 5 件全新主线 + 7 件沿用件套)· 0 件 llm-infra 主轴 net-new + Karpathy 9-12 转发 Dario + Sam Altman 9-3 GPT-6 Astra + LeCun 9-13 反讽 + Mollick 9-14 + OpenAI 9-3 GPT-6 Astra GA + Anthropic 9-1 Claude Fable 5.1 + 9-12 Dario Pace the Frontier + Google DeepMind 9-2 Gemini 3.8 Flash + 9-15 Gemini 3.8 Live GA + HF 9-3 NVIDIA $12.93B 收购 + HF 9-10 Training Agents 4 + Jim Fan 9-4 + Andrew Ng 静默 - ✅
2026-09-17-1002-news-{anthropic,deepmind,google,openai,hf-blog}.md× 5(10:02 CST · ~5KB)· 0 件 llm-infra 主轴 net-new + Anthropic "形式化费马大定理" 9-16 evening / 9-17 morning 二次正式发布 + Gemini 3.8 Live + AlphaGenome Atlas + WeatherNext 3 + Fairwind Program - ✅
2026-09-17-1003-news-{bens-bites,tldr-ai}.md× 2(10:03 CST · ~1.3KB)· 0 件 llm-infra 主轴 net-new + TLDR 9-16 头条新立 "Jev ⚡, Periodic Neon 🧬, Gemini 3.8 Live 💬" frontier lab 形式化数学 + DeepMind 实时语音 Agent + 待溯源模型三联预备扩增预备级第 1 例 - ✅
2026-09-17-1004-news-yt-deepmind.md(10:04 CST · 0.6KB · 沿用)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-17-ai-industry-e1prep.md(2026-09-17 10:17 CST · Stephen 9-17 ai-industry 棒位 72KB)· 0 件 llm-infra 主轴 net-new · frontier lab 治理公开化 14 源 → 18 源 ⚠️⚠️(沿用 9-14~9-16 件套 14 源 + 新增 4 件核心 net-new 源 = Anthropic Fermat 二次正式发布 + Nathan Benaich 9-17 6 件 RSS + Interconnects 9-17 5 件 RSS + Gradient Flow 9-17 4 件 net-new + AI Explained 9-17 1 件 RSS = 18 源独立验证闭环 + v70 §2.43 升级预备 + §2.56 ~ §2.73 共 18 件建议新增主轴扩增预备级)· 邻接 v3.35 §1.(10) 顶会部署子轴 + §1.(11) Kernel/Harness 子轴沿用稳态
stephen 9-17 棒位 llm-infra 主轴信号 0 件 net-new · 12:45 noon 协调棒判 spark 9-17 早棒位全天缺位延续 + jay 9-17 全天棒位主承载承接棒位 = 协调棒承接稳态 + 18 源 frontier lab 治理公开化双倍跃迁 ⚠️⚠️ + AI Agent 框架 2026 选型决策树 manduks Gist 2026-03 承接稳态 + Microsoft Agent Framework 1.0 双协议(MCP + A2A) + Microsoft Orchard 双轨布局承接稳态
1.7 paper_cards 近 3 天新卡(2026-09-15 → 2026-09-17 18:40 入库)
| 编号 | arXiv | 标题 | 主分类 | 入库时间 | llm-infra 关联 |
|---|---|---|---|---|---|
| 1394 | 2609.16591 | FLAT Flexible-Length Aligned Transmodal | rag | 2026-09-17 14:10 | multimodal + rag 主轴双锚邻接级 · 12▲ · flyp 9-17 0950 critical-read 8.6KB ⭐⭐⭐ |
| 1395 | 2609.17488 | LimiX-2 | engineering | 2026-09-17 14:10 | multimodal 邻接级 |
| 1396 | 2609.16372 | Register Tokens dLLM | multimodal | 2026-09-17 14:10 | dLLM 跨块推理状态压缩 · 3▲ HF Daily · v3.35 §1.(3) KV cache 子轴 + dLLM 邻接级 |
| 1397 | 2609.16057 | OmniHarness | evaluation | 2026-09-17 14:10 | multimodal 邻接级 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级 |
| 1398 | 2609.14011 | Convergent Emergence ICL | multimodal | 2026-09-17 15:00 | multimodal 主分类 |
| 1399 | 2609.12552 | RelateAnything | llm-infra ⚠️ 误归类 | 2026-09-17 14:10 | 误归类(实际 multimodal 场景图)· 沿用 v3.35 已锚预备级 |
| 1400 | 2609.13406 | Generalized Agent Iteration | agent | 2026-09-17 14:10 | GAI RSI 议题第七源预备级触发 · v3.35 §1.(11) Kernel/Harness 子轴邻接级 |
| 1401 | 2609.18487 | ActionPiece: Rethinking Action Tokenization for Autoregressive | multimodal | 2026-09-17 16:30 | multimodal 主分类 |
| 1402 | 2609.18094 | Dream 7B technical report | agent | 2026-09-17 16:30 | multimodal 邻接级 |
| 1403 | 2609.18708 | Continual Learning Theory technical report | engineering | 2026-09-17 16:30 | agent + multimodal 邻接级 |
| 1404 | 2609.19144 | A Zeroth-Order Paradigm for LLM Preference Alignment | risk | 2026-09-17 16:30 | risk 主分类 · 邻接 v3.35 §1.(8) 训练子轴 |
| 1405 | 2609.17708 | Confidence Comes from Experience: XConf | agent(副分类 llm-infra) | 2026-09-17 16:30 | v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级 + §1.(5) 投机解码子轴预备扩增预备级(XConf experiential confidence estimation · work-queue Top 5 #4) |
| 1406 | 2609.17909 | Zing-0.5 Playable Worlds | multimodal | 2026-09-17 16:30 | multimodal 主分类 |
| 1407 | 2609.15938 | HypoEvolve Genetic Algorithms Multi-Agent LLMs | agent | 2026-09-17 16:30 | multimodal 邻接级 |
| 1408 | 2609.14320 | SpectralShift Context Window Extension | rag | 2026-09-17 16:30 | multimodal + rag 双锚 · work-queue Top 5 #1 |
v3.35 cutoff 05:00 后 llm-infra 主分类 paper_card 入库净增 = 0 件(1405 副分类 llm-infra 主分类 agent + 1399 误归类 llm-infra 实际为 multimodal 场景图)· v3.35 cutoff 05:00 后所有 paper_card 入库净增 = 15 件(1394-1408 跨度)· v3.35 cutoff 05:00 后所有 paper_card 主分类分布 = engineering 3 件 / multimodal 4 件 / agent 3 件 / rag 2 件 / evaluation 1 件 / risk 1 件 / llm-infra 1 件(误归类) · v3.35 cutoff 05:00 后 14:10 work-queue Top 5 批次 7 件主分类分布 = rag 2 + engineering 1 + multimodal 2 + agent 1 + evaluation 1 · v3.35 cutoff 05:00 后 16:30 work-queue Top 5 批次 8 件主分类分布 = multimodal 3 + agent 2 + engineering 1 + rag 1 + risk 1 · v3.35 §1.(3) KV cache 子轴 + §1.(5) 投机解码子轴 + §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级承接稳态 + v3.35 §1.(11) Kernel/Harness 子轴新增 XConf arXiv:2609.17708 副分类承接稳态 · 0 件 NET-new 主分类 llm-infra paper_card 在 v3.35 cutoff 后入库净增确认(承接 v3.35 微调棒基线稳态)
1.8 v3.35 升档棒内 arXiv ID 列表预备级预备级未实质锚入候选(本棒位承接基线)
v3.35 §IX 99 evening 微调棒(2026-09-17 05:00)收编 arXiv ID 列表 356 件预备级预备级预备级候选(arXiv ID 已锚入主文件但章节方法学未实质锚入):
- arXiv:2510.09665 · LMCache Enterprise-Level KV Cache Caching Layer · v3.35 §1.(3) KV cache 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(字节跳动 + 阿里云 + UC Berkeley 工业部署 · 15× 吞吐量提升 · NIXL 后端对接 InfiniBand/RoCE/Ethernet/NVLink · Engine-independent deployment · no fate-sharing with engines)
- arXiv:2602.21548 · DualPath Agentic LLM Inference · v3.35 §1.(1) 推理引擎子轴 + §1.(3) KV cache 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(Agentic 多轮推理 I/O 瓶颈本质 = KV Cache 加载主导系统性能 · Prefill + Decode 双路径分流 · CNIC-Assisted KV-Cache Copy 绕过 GPU Direct Storage 拥塞)
- arXiv:2606.06090 · MemoryArena Beyond Semantic Organization Memory as Execution State Management · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(MemoryArena Benchmark 4 领域 · 任务完成率 45%→>80% · Memory 重新定义为执行状态管理)
- arXiv:2601.03236 · MAGMA 多图结构 Agentic Memory · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(Semantic Graph + Temporal Graph + Causal Graph + Entity Graph)
- arXiv:2602.23374 · Higress-RAG 企业级 RAG 全链路优化 · v3.35 §1.(2) 推理调度子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(Dual Hybrid Retrieval + Adaptive Routing + CRAG)
- arXiv:2607.08057 · ACL 2026 Findings System-Aware KV Cache Optimization · v3.35 §1.(3) KV cache 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级预备触发预备级
- arXiv:2502.07115 · Online Scheduling for LLM Inference with KV Cache Constraints · MIT + HKUST + Microsoft Research · v3.35 §1.(2) 推理调度 + §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(MC-SF 算法多项式时间常數竞争比)
- arXiv:2603.09619 · Context Engineering From Prompts to Corporate Multi-Agent Architecture · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(五维 Context 质量标准 Relevance/Sufficiency/Isolation/Economy/Provenance + 四层成熟度金字塔 Prompt→Context→Intent→Specification)
- arXiv:2609.15504 · Orthrus How Lossless Is Lossless Speculative Decoding · paper_card 1368 已入库(9-16 12:30)· v3.34 §1.(5) 投机解码子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级 · flyp 9-16 0950 critical-read ⭐⭐⭐⭐⭐(BF16 45%/43% 精确匹配轨迹 + FP32 100% · Skoltech/AIRI 数值方法团队 + D159 v3.35 4 项待核实)
- arXiv:2609.13285 · Grouped Value Attention · paper_card 1374 已入库(9-16 02:10)· v3.34 §1.(3) KV cache 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(GVA = GQA 之后逻辑后继 · 存储分组 value + 学习线性映射重建 content key + RoPE 通道解耦)
- arXiv:2606.21649 · EvoEmbedding · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(长上下文检索 + Agentic Memory 可演化表示 · 与 Mem0/LightMem/A-Mem/MemoryOS 对比)
- arXiv:2501.09136v4 · Agentic RAG Survey · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级(Vanilla→Planning-based→Iterative→Agentic RAG 演进)
- arXiv:2609.00749 · ContextPipe · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2608.09214 · AkasicDB Omni RAG DBMS · v3.35 §1.(2) 推理调度子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2608.12365 · FluctlightDB 记忆专用数据库引擎 · v3.35 §1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2511.16681 · SPI Query-Depth-Adaptive Indexing for Streaming RAG · jay 9-17 1140 research-brief + research-brief DATABASE 节承接稳态 + paper_card 状态待核 ⚠️
- arXiv:2310.11703 · HARMONY 分布式 ANNS 系统 · jay 9-17 1140 research-brief + research-brief DATABASE 节承接稳态 + paper_card 状态待核 ⚠️
v3.35 cutoff 后本棒位承接基线(承接 jay 9-17 全天棒位 5 件 NET-new 整合级承接稳态):
- NVIDIA 收购 Hugging Face $129.3 亿 · 2026-09-03 · jay 9-17 1505 five-category-afternoon-briefing Backend 节承接稳态(预计 2027 上半年完成监管审批 · Jensen Huang 亲笔 · 承诺 HF 保持开放平台 · v3.35 §1.(10) 顶会部署子轴预备扩增预备级预备触发预备级预备扩增预备级 = 开源 AI 生态基础设施层最大变局)
- vLLM Inferact 融资 $1.5 亿估值 $8 亿 + SGLang RadixArk 融资估值 $4 亿 · 2026-02-03 · cnblogs gpustack 博客园 jay 9-17 1505 Backend 节承接稳态(推理已正式进入 AI 基础设施核心层 · v3.35 §1.(1) 推理引擎子轴预备扩增预备级预备触发预备级预备扩增预备级)
- Perplexity Q2D-Web Benchmark · 2026-09-10 · explainx.ai jay 9-17 1505 Database 节 ⭐⭐⭐⭐⭐(首个同时覆盖三个生产约束的大规模检索 benchmark = 1.9 亿文档语料 + 7 万 agent 查询 + 每查询约 100 个密集标签 · human-query 与 agentic-query 两个分布之间显著差异 · v3.35 §1.(10) 顶会部署子轴预备扩增预备级预备触发预备级预备扩增预备级)
- HARMONY 分布式 ANNS 系统 arXiv:2310.11703 · 2026-03-24 更新 · jay 9-17 1140 research-brief DATABASE 节 ⭐⭐⭐⭐(多粒度分区 + early-stop pruning · 吞吐量 4.63× · 偏斜负载 +58% · v3.35 §1.(2) 推理调度子轴邻接级预备扩增预备级预备触发预备级预备扩增预备级)
- Joint Cooling-Computing Control for LLM Inference in AI Datacenters arXiv:2609.XXXXX · 2026-09-15 新提交 · jay 9-17 1505 cloud-native 节 ⭐⭐⭐⭐(LLM 推理在 AI 数据中心产生耦合控制问题 = GPU serving 与设施冷却之间的联合优化 · 最小化每任务 GPU+冷却能耗,同时满足热安全和延迟 SLO · v3.35 §1.(10) 顶会部署子轴预备扩增预备级预备触发预备级预备扩增预备级)
- RoofLang AI-Driven LLM Inference Systems Architecture arXiv:2609.13141 · 2026-09 新提交 · jay 9-17 1505 backend 节(待验证 · arXiv 新提交 · v3.35 §1.(1) 推理引擎子轴预备扩增预备级预备触发预备级预备扩增预备级)
- Microsoft AutoGen → MAF 1.0 + Orchard 双轨布局 · 2026-09 · jay 9-17 engineering-e1prep 增量 ②⭐⭐⭐⭐⭐ + 增量 ③⭐⭐⭐⭐⭐(AutoGen 进入维护模式 + MAF 1.0 同时支持 MCP + A2A 双协议 + Foundry SDK + M365 Copilot Agents + Orchard 面向研究 / MAF 1.0 面向生产部署 = Microsoft Agent 战略双轨布局 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级)
- JustVugg/colibri 纯 C 语言推理引擎 · 2026-09-17 · jay 9-17 0947 GitHub Trending 早棒 ⚠️(纯 C 语言、无依赖、Expert 从磁盘流式加载 · MoE 推理引擎的极简主义工程实践 · v3.35 §1.(1) 推理引擎子轴预备扩增预备级预备触发预备级预备扩增预备级)
- Coordination as an Architectural Layer arXiv:2605.03310 · 2026-05 · jay 9-17 1140 research-brief BACKEND 节 ⭐⭐⭐⭐(多 Agent 协调层 · 不可识别定理 · 工业界已向声明式工作流收敛 AWS Strands YAML + Microsoft Foundry · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级)
- InceptionRAG arXiv:2609.16818 · 2026-09-16 · paper_card 1382 ✓ 已入库 · jay 9-17 engineering-e1prep 增量 ④⭐⭐⭐⭐(RAG 隐蔽投毒攻击新类别 · 间接逻辑诱导 · 现有防御机制不足以充分防护 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级)
- ORDER arXiv:2609.17012 · 2026-09-16 · paper_card 1381 ✓ 已入库 · jay 9-17 engineering-e1prep 增量 ⑤⭐⭐⭐⭐(查询条件化 RAG 动态路由 · 联合自适应调整索引与检索策略 · v3.35 §1.(2) 推理调度子轴预备扩增预备级预备触发预备级预备扩增预备级)
- 预测 Agentic RAG 部分答案质量与效用 arXiv:2609.16453 · 2026-09-17 · jay 9-17 engineering-e1prep 增量 ⑥⭐⭐⭐⭐(多跳问答范式 · 部分答案质量预测 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级)
- ModAR arXiv:2609.17524 · 2026-09-17 · paper_card 1383 ✓ 已入库 · jay 9-17 engineering-e1prep 增量 ⑦⭐⭐⭐⭐(模态自回归世界-动作模型 · WAM 多模态扩展 · ⚠️ 主分类争议 engineering + multimodal 邻接 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级)
- Mind2Dialogue arXiv:2609.15972 · 2026-09-17 · paper_card 1385 ✓ 已入库 · jay 9-17 engineering-e1prep 增量 ⑧⭐⭐⭐(无推理轨迹的专家模型训练 · 蒸馏方向新方法论 · v3.35 §1.(1) 推理引擎子轴预备扩增预备级预备触发预备级预备扩增预备级)
- XConf Confidence Comes from Experience arXiv:2609.17708 · 2026-09-17 · paper_card 1405 ✓ 已入库(主分类 agent · 副分类 llm-infra)· work-queue Top 5 #4 · XConf experiential confidence estimation(估计 confidence 配合模型 accumbens-based 历史经验,而不只是当前推理过程 · v3.35 §1.(11) Kernel/Harness 子轴预备扩增预备级预备触发预备级预备扩增预备级 + §1.(5) 投机解码子轴预备扩增预备级预备触发预备级预备扩增预备级)
- CSDN 9-17 早棒 4 件高价值 · jay 9-17 1221 csdn-high-value ①⭐⭐⭐⭐⭐ 企业级 RAG 系统构建与优化实战指南(知识查询效率提升 47× + 幻觉率 <0.3% + 缓存命中率 78%)②⭐⭐⭐⭐⭐ RAG 2026 实战指南(60% RAG 项目在试运行阶段失败 · Agentic RAG Llama 3.3 评测 92% · Hybrid RAG 2026 默认生产级)③⭐⭐⭐⭐⭐ TensorRT 入门完全指南(Pytorch 量化工具包直接导出到 TensorRT 优化)④⭐⭐⭐⭐ 深入了解 LLM 微调方法(PEFT 仅更新 0.1-2% 参数 · 成本降低 99.5%)
- HF ICML 2026 可复现性黑客松 · 2026-09 · jay 9-17 0947 GitHub Trending 早棒 HF Blog 2 件 ⚠️(19 天复现 2226 篇 ICML 2026 论文 ≈ 1/3 会议论文 · 1200+ 社区成员 · 揭示 AI 研究可复现性危机规模化证据 · v3.35 §1.(10) 顶会部署子轴预备扩增预备级预备触发预备级预备扩增预备级)
- HF State of Open Models Summer 2026 · 2026-09 · jay 9-17 0947 GitHub Trending 早棒 HF Blog 2 件(Qwen 已成社区默认基础模型 · 衍生版本增速约 180-210 repos/天 · 小模型仍是实际落地主力层 · v3.35 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴邻接级预备扩增预备级预备触发预备级预备扩增预备级)
二、增量候选预备级(本棒位承接候选)
增量 ① 🟢 NVIDIA 收购 Hugging Face $129.3 亿 · 2026-09-03 · 开源 AI 生态基础设施层最大变局(jay 9-17 1505 Backend 节)
- 来源:jay/2026-09-17T1505-jay-five-category-afternoon-briefing.md Backend 节(15:05 CST · 232 行)· NVIDIA 官方博客 blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face· Jensen Huang 亲笔 · Delangue(CEO)· 预计 2027 上半年完成监管审批
- 要点:① NVIDIA 同意以 $12,930,300,000(129.3 亿美元)收购 Hugging Face · 预计 2027 上半年完成监管审批 · ② Jensen Huang 表示将"scale Hugging Face platform, strengthen its infrastructure, expand access to AI" · 承诺 HF 保持开放平台 · ③ Delangue 表示"open models at larger scale needs more compute, more support, more collaboration, more visibility" · ④ 收购恰逢 U.S. 政策制定者考虑如何监管开放权重模型 · ⑤ 工程影响 = 开源 AI 生态基础设施层最大变局 · Nemotron 等 NVIDIA 内部模型与 HF 平台整合 · 推理/评测/部署能力可能全面 NVIDIA 化 · 需关注监管审批进展 · ⑥ 可信度 极高(NVIDIA 官方 + 官方公告) · ⑦ 与 v3.35 §1.(10) 顶会部署子轴已锚入的 NVIDIA 收购 HF 5 源强验证预备扩增预备级承接稳态
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(10) 顶会部署子轴已锚入 NVIDIA 收购 HF 5 源强验证(沿用 9-3 多源独立交叉锚入)· 本棒 NVIDIA 收购 HF $129.3 亿 NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "官方公告原文细节 + 监管审批节点 + 工程影响范围" 与 §1.(10) 顶会部署子轴形成"开源 AI 生态基础设施层最大变局 + 监管政策转折点"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(10) 顶会部署子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 NVIDIA 收购 HF 完整数字细节 $129.3 亿 + 预计 2027 上半年完成监管审批 + Nemotron 等 NVIDIA 内部模型与 HF 平台整合 + 推理/评测/部署能力可能全面 NVIDIA 化 + U.S. 政策制定者监管开放权重模型)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 极高(NVIDIA 官方 + 官方公告 + Jensen Huang 亲笔 + Delangue 声明 + 预计 2027 上半年完成监管审批 + v3.35 §1.(10) 顶会部署子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ② 🟢 vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 双融资 = 推理层进入 AI 基础设施核心层(jay 9-17 1505 Backend 节)
- 来源:jay/2026-09-17T1505-jay-five-category-afternoon-briefing.md Backend 节(15:05 CST · 232 行)· 博客园 GPUStack cnblogs.com/gpustack/p/19568201· 2026-02-03
- 要点:① vLLM 核心团队成立 Inferact · 融资 $1.5 亿 · 估值 $8 亿 · ② SGLang 团队成立 RadixArk · 融资估值 $4 亿 · ③ 两起融资在同一时间点确认同一件事 = 推理已正式进入 AI 基础设施核心层 · ④ 核心洞察 = 训练决定模型能否出现 · 推理决定模型能否活下去 · ⑤ 推理成本的经济敏感性(5% 吞吐提升 = 真实资金节省)使推理引擎从"技术好不好"变为"能不能直接影响 AI 服务的成本结构" · ⑥ 与 v3.35 §1.(1) 推理引擎子轴已锚入的 vLLM V1 9月 + SGLang 2026-09 + vLLM/SGLang/TensorRT-LLM 1.2 三引擎格局定稿 + GPUStack 5.7k ⭐ + Mooncake 6.6k ⭐ 5 源强验证预备扩增预备级承接稳态
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(1) 推理引擎子轴已锚入 vLLM V1 + SGLang + TensorRT-LLM 1.2 三引擎格局定稿 + GPUStack 5.7k ⭐ + Mooncake 6.6k ⭐ + Dify 155k ⭐ 5 件 NET-new HF GitHub Trending 实质锚入预备扩增预备级预备触发预备级预备扩增预备级预备触发预备级 · 本棒 vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "推理层进入 AI 基础设施核心层" 与 §1.(1) 推理引擎子轴形成"vLLM + SGLang 双融资 + Inferact + RadixArk + GPUStack + Mooncake 产业层格局完整闭合"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(1) 推理引擎子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 vLLM Inferact $1.5 亿 $8 亿估值 + SGLang RadixArk $4 亿估值 + 推理层进入 AI 基础设施核心层 + 5% 吞吐提升 = 真实资金节省 + 推理引擎从"技术好不好"变为"能不能直接影响 AI 服务的成本结构")→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(博客园 GPUStack 公开融资信息整理 + Inferact $150M $800M 估值 + RadixArk $40M 估值 + 与 v3.35 §1.(1) 推理引擎子轴 5 源强验证承接稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ③ 🟢 Perplexity Q2D-Web Benchmark 1.9 亿文档 + 7 万 agent 查询 = 首个工业规模 agentic RAG 评测基准(jay 9-17 1505 Database 节)
- 来源:jay/2026-09-17T1505-jay-five-category-afternoon-briefing.md Database 节(15:05 CST · 232 行)· Perplexity explainx.ai Q2D-Web· 2026-09-10
- 要点:① Perplexity 发布 Q2D-Web · 首个同时覆盖三个生产约束的大规模检索 benchmark = 1.9 亿文档语料 + 7 万 agent 查询 + 每查询约 100 个密集标签 · ② 与 MS MARCO 等人工查询套件不同 · Q2D-Web 的查询为机器生成 · 模拟 agentic RAG 的真实查询分布 · ③ 揭示了 human-query 和 agentic-query 两个分布之间的显著差异 · ④ 可信度 高(Perplexity 官方发布数据) · ⑤ 工程价值 = Embedder 团队必读 · 构建 agentic RAG pipeline 的评测基准 · ⑥ 复现路径 = 下载数据集 → 跑 RAG pipeline → 对比 NDCG@K / MRR@K / Recall@K → 与 Perplexity 官方数字交叉验证
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(10) 顶会部署子轴已锚入 RAGCap-Bench arXiv:2510.13910v2 v3.35 已实质锚入预备扩增预备级 + HF RAG Benchmark 2026-Q2 jay 9-17 1051 agentic-rag-production 承接稳态(1840 文档 + 240 query)· 本棒 Perplexity Q2D-Web NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "1.9 亿文档 + 7 万 agent 查询 + 每查询约 100 个密集标签 = 首个工业规模 agentic RAG 评测基准" 与 §1.(10) 顶会部署子轴形成"工业规模 RAG 评测三联 = Perplexity Q2D-Web 1.9 亿 + RAGCap-Bench 组件级 + HF RAG Benchmark 2026-Q2 1840 文档"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(10) 顶会部署子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 Perplexity Q2D-Web 1.9 亿文档 + 7 万 agent 查询 + 每查询约 100 个密集标签 + human-query vs agentic-query 两个分布之间显著差异)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(Perplexity 官方发布数据 + explainx.ai 博客 + 与 HF RAG Benchmark 2026-Q2 双源独立交叉锚入 + v3.35 §1.(10) 顶会部署子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ④ 🟢 HARMONY 分布式 ANNS 系统 arXiv:2310.11703 + SPI Streaming RAG arXiv:2511.16681 双方法学承接稳态(jay 9-17 1140 research-brief + 1505 数据库节)
- 来源:jay/2026-09-17-research-brief.md DATABASE 节(11:07 CST · 9.7KB)· arXiv 2310.11703 + arXiv 2511.16681 v3 修订 2026-06-14
- 要点:① SPI Query-Depth-Adaptive Indexing for Streaming RAG in Vector Databases arXiv:2511.16681 ⭐⭐⭐⭐⭐(query-adaptive resolution control 结合 hierarchical indexing · 动态索引分辨率 · 无需离线调参或独立训练每层模型 · 在查询复杂度高时自动切换细粒度检索,复杂度低时用粗粒度加速 · 与传统多尺度方法(如 DenseX)不同 · 工程价值极高)② HARMONY 分布式 ANNS 系统 arXiv:2310.11703 ⭐⭐⭐⭐(多粒度分区 + early-stop pruning 机制解决传统分区策略的负载不均和高通信开销 · 吞吐量比领先分布式向量数据库高 4.63× · 偏斜负载提升 58% · 是生产级大规模向量检索系统的重要方向)
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(2) 推理调度子轴已锚入 Higress-RAG arXiv:2602.23374 实质锚入预备扩增预备级 + Perplexity CobbleDB 实质锚入预备扩增预备级 · 本棒 HARMONY + SPI 双方法学 NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "分布式 ANNS 4.63× + Streaming RAG 动态索引分辨率" 与 §1.(2) 推理调度子轴形成"RAG 全链路优化四向方法学 = Higress-RAG + CobbleDB + SPI + HARMONY"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(2) 推理调度子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 SPI Query-Depth-Adaptive Indexing + HARMONY 分布式 ANNS 4.63× + skew 58%)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(jay 9-17 1140 research-brief + 1505 五分类简报多源独立交叉锚入 + arXiv 学术论文 + 与 v3.35 §1.(2) 推理调度子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ⑤ 🟢 Joint Cooling-Computing Control for LLM Inference in AI Datacenters arXiv:2609.XXXXX(jay 9-17 1505 cloud-native 节)
- 来源:jay/2026-09-17T1505-jay-five-category-afternoon-briefing.md cloud-native 节(15:05 CST)· arXiv 2609.XXXXX · 2026-09-15 新提交 ⚠️(arXiv 号未完整核实)
- 要点:① LLM 推理在 AI 数据中心产生耦合控制问题 = GPU serving 与设施冷却之间的联合优化 · ② 提高环境温度可减少冷却能耗和碳排放,但同时缩小热余量、引发 GPU 降频、导致 SLO 违约 · ③ 研究联合冷却-计算控制 = 最小化每任务 GPU+冷却能耗,同时满足热安全和延迟 SLO · ④ 可信度 高(arXiv 学术研究,数据中心方向重要) · ⑤ 工程价值 = AI 数据中心运营方需关注 · 延迟 SLO 与能耗优化的权衡是 2026+ 基础设施决策核心变量 · ⑥ 与 v3.35 §1.(10) 顶会部署子轴已锚入的 HF WebGPU Kernels + Joint Cooling-Computing 预备扩增预备级承接稳态
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(10) 顶会部署子轴已锚入 Kubernetes v1.37 + CNCF Cloud Native AI Stack 2026 + HAMi 跨 NVIDIA/AMD/Huawei/Cambricon GPU 资源管理参考实现 + 82% 容器用户生产 K8s + 66% 组织 K8s 跑至少部分 gen AI 模型推理 · 本棒 Joint Cooling-Computing for LLM Inference NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "GPU serving 与设施冷却之间的联合优化" 与 §1.(10) 顶会部署子轴形成"AI 数据中心运营 GPU+冷却联合控制 = 基础设施决策核心变量"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(10) 顶会部署子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 Joint Cooling-Computing Control for LLM Inference in AI Datacenters)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟡 中(jay 9-17 1505 cloud-native 节 ⚠️ arXiv 号 2609.XXXXX 未完整核实 + arXiv 学术研究 + 与 v3.35 §1.(10) 顶会部署子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ⑥ 🟢 Microsoft AutoGen → MAF 1.0 接替 + Orchard 双轨布局 = 企业 Agent 框架选型重大变化(jay 9-17 engineering-e1prep 增量 ②③ + research-brief Backend 节)
- 来源:jay/2026-09-17-engineering-e1prep.md 增量 ②⭐⭐⭐⭐⭐ + 增量 ③⭐⭐⭐⭐⭐(11:22 CST · 20.6KB)· Microsoft/autogen GitHub README· microsoft-foundry/discussions/177· 2026-09
- 要点:① AutoGen 正式宣布进入维护模式(Maintenance Mode)· 不再接受新功能 PR · 改为社区管理模式 · ② Microsoft Agent Framework (MAF) 1.0 为官方继承者 · 已发布稳定版 API · 支持 .NET + Python 双 SDK · 整合 Semantic Kernel(企业级特性)与 AutoGen(研究驱动多 Agent 编排) · ③ MAF 1.0 同时支持 MCP 协议和 A2A 协议 · 面向企业级多智能体生产部署 · ④ 支持 Foundry SDK · MCP SDK · A2A SDK 和 M365 Copilot Agents · ⑤ 提供 AutoGen → MAF 迁移指南 · ⑥ Microsoft Research Orchard 开源可扩展 Agentic AI 框架 · Orchard 面向研究 / MAF 1.0 面向生产部署 = Microsoft Agent 战略双轨布局 · ⑦ 企业选型影响 = LangChain/LangGraph 生态之外,企业多 Agent 框架有了新的 Microsoft 官方选项 · ⑧ 与 v3.35 §1.(11) Kernel/Harness 子轴已锚入的 MCP × A2A × AG-UI 协议栈 23,000+ MCP Server + Microsoft Orchard arXiv:2605.15040 实质锚入预备扩增预备级承接稳态
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(11) Kernel/Harness 子轴已锚入 MCP × A2A × AG-UI 协议栈 23,000+ MCP Server + Microsoft Orchard arXiv:2605.15040 + Context Engineering 四层成熟度金字塔 + ContextPipe arXiv:2609.00749 · 本棒 Microsoft AutoGen → MAF 1.0 + Orchard 双轨布局 NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "MAF 1.0 同时支持 MCP + A2A 双协议 + Orchard 双轨布局 = 企业 Agent 框架选型重大变化" 与 §1.(11) Kernel/Harness 子轴形成"Microsoft Agent 战略双轨布局 = Orchard 面向研究 + MAF 1.0 面向生产部署 + 同时支持 MCP + A2A 双协议"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 Microsoft AutoGen → MAF 1.0 接替 + Orchard 双轨布局 + MAF 1.0 同时支持 MCP + A2A 双协议 + Foundry SDK + M365 Copilot Agents + AutoGen → MAF 迁移指南)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(jay 9-17 engineering-e1prep + research-brief + jay 9-17 agentic-rag-production + stephen 9-17 1245 noon 协调棒 §1.7 重大变化 5 实例独立交叉承接稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ⑦ 🟢 InceptionRAG arXiv:2609.16818 RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导(jay 9-17 engineering-e1prep 增量 ④ + paper_card 1382)
- 来源:jay/2026-09-17-engineering-e1prep.md 增量 ④⭐⭐⭐⭐(11:22 CST)· paper_card 1382 ✓ 已入库(2026-09-17 14:10)
- 要点:① 现有 RAG 投毒攻击主要在单点显式注入(恶意载荷完整封装在单文档)· 防御机制已能有效识别 · ② InceptionRAG 提出间接逻辑诱导(Indirect Logic Induction) = 一种绕过现有防御机制的新投毒路径 · ③ 投毒不是直接注入恶意内容,而是通过修改文档逻辑关系,使检索结果在推理阶段被误导 · ④ 论文首先验证了现有防御机制对间接逻辑诱导不足以充分防护 · ⑤ 副分类 risk · 属于 RAG 安全领域的最新攻击手法 · ⑥ 与 v3.35 §1.(11) Kernel/Harness 子轴已锚入的 InceptionRAG RAG 隐蔽投毒攻击新类别预备扩增预备级承接稳态
- 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(11) Kernel/Harness 子轴已锚入 ai-boost/awesome-harness-engineering + Akashic MemAttention arXiv:2607.05708 + VikingRAG arXiv:2609.11390 + ACM FSE 2026 arXiv:2508.04925 + Microsoft Orchard arXiv:2605.15040 + When Errors Become Narratives arXiv:2606.14589 ICSE 2026 SEIP · 本棒 InceptionRAG NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导" 与 §1.(11) Kernel/Harness 子轴形成"RAG 安全子轴新攻击层"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(11) Kernel/Harness 子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 InceptionRAG RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(jay 9-17 engineering-e1prep 增量 ④⭐⭐⭐⭐ + paper_card 1382 ✓ 已入库 + v3.35 §1.(11) Kernel/Harness 子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
增量 ⑧ 🟢 ORDER arXiv:2609.17012 + 预测 Agentic RAG 部分答案质量与效用 arXiv:2609.16453 + Mind2Dialogue arXiv:2609.15972 三方法学承接稳态(jay 9-17 engineering-e1prep 增量 ⑤⑥⑧ + paper_card 1381/1397)
- 来源:jay/2026-09-17-engineering-e1prep.md 增量 ⑤⭐⭐⭐⭐ + ⑥⭐⭐⭐⭐ + ⑧⭐⭐⭐(11:22 CST)· paper_card 1381 ORDER + 1385 Mind2Dialogue + 1397 OmniHarness(增量 ⑥ arXiv:2609.16453 paper_card 状态待核 ⚠️)
- 要点:① ORDER
arXiv:2609.17012⭐⭐⭐⭐(查询条件化 RAG 动态路由 · 联合自适应调整索引与检索策略 · 不同查询自动路由到不同的 chunking 粒度 + 元数据约束 + 来源选择策略组合 · 解决了"对某类查询有效的配置,往往在其他类查询上表现欠佳"的核心痛点 · paper_card 1381 ✓ 已入库)② 预测 Agentic RAG 部分答案质量与效用arXiv:2609.16453⭐⭐⭐⭐(Agentic RAG 推理模型向检索器迭代发出查询的多跳问答范式中 · 检索器返回的部分答案质量参差不齐 · 提出对部分答案的质量与效用进行预测的方法 · 核心工程价值 = 使 Agent 能够在迭代过程中提前判断当前检索结果是否足够支撑回答,避免无效迭代)③ Mind2DialoguearXiv:2609.15972⭐⭐⭐(无推理轨迹的专家模型训练 · 专家优化隐式地从潜在轨迹空间中选择 · 将学生蒸馏本身不作为下游目标,而是作为"无关探针" · 提供了无需显式推理监督即可训练领域专家模型的方法论 · paper_card 1385 ✓ 已入库) - 与活文档 llm-infra.md 现有脉络的关系:v3.35 §1.(2) 推理调度子轴已锚入 Higress-RAG arXiv:2602.23374 实质锚入预备扩增预备级 + Perplexity CobbleDB 实质锚入预备扩增预备级 · v3.35 §1.(11) Kernel/Harness 子轴已锚入 Context Engineering 四层成熟度金字塔 + ContextPipe arXiv:2609.00749 · v3.35 §1.(1) 推理引擎子轴已锚入 vLLM V1 + SGLang + TensorRT-LLM 1.2 三引擎格局定稿 · 本棒 ORDER + Agentic RAG 部分答案质量预测 + Mind2Dialogue NET-new 锚入预备扩增预备级预备触发预备级预备扩增预备级 = "RAG 动态路由 + 多跳问答质量预测 + 蒸馏方向新方法论" 与 §1.(2) 推理调度子轴 + §1.(11) Kernel/Harness 子轴形成"RAG 全链路优化 + 模型压缩"预备扩增预备级预备触发预备级预备扩增预备级
- 建议归入节:
llm-infra.md§1.(2) 推理调度子轴 NET-new 实质锚入预备扩增预备级预备触发预备级预备扩增预备级(更新 ORDER + 预测 Agentic RAG 部分答案质量与效用)+ §1.(1) 推理引擎子轴邻接级预备扩增预备级预备触发预备级预备扩增预备级(更新 Mind2Dialogue 无推理轨迹的专家模型训练)→ §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级 - 可信度:🟢 高(jay 9-17 engineering-e1prep 增量 ⑤⑥⑧ 多源独立交叉锚入 + paper_card 1381/1385/1397 ✓ 已入库 + arXiv 学术论文 + v3.35 §1.(2) 推理调度子轴 + §1.(11) Kernel/Harness 子轴 + §1.(1) 推理引擎子轴沿用稳态预备扩增预备级预备触发预备级预备扩增预备级)
三、值得警惕的矛盾或待核实说法
3.1 v3.35 已标记矛盾沿用(D154-D161)
- D154 v3.33 沿用 = HyQuant paper_card 暂未入库 + 章节预备级锚入缺失争议 · 截止 9-17 evening 棒前 paper_card 入库 + v3.34 §1.(4) 量化子轴正式锚入预备级预备触发预备级
- D155 v3.33 沿用 = ACM FSE 2026 arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表但 §1 方法学未实质锚入 · 截止 9-17 evening 棒位前精修闭合预备级
- D156 v3.33 沿用 = SGLang vs vLLM 2026-09 通用负载差距 ≤4% · 与 v3.32 已锚入的"+29% 差距"数据矛盾争议 · 本棒位承接 jay 9-16 llm-inference-engineering §2 精修数据 = SGLang 总吞吐 +29% · 输出 token 吞吐 +117% · TTFT 快 23% · ITL 快 15% · RadixAttention prefix-heavy 6.4x 收益(D156 沿用 + 预备级预备触发预备级预备扩增预备级)
- D157 v3.33 沿用 = Andrej Karpathy nanochat 教育级 vs 生产级预备级定位争议 · 截止 9-17 evening 棒位预备级锚入预备级预备触发预备级时明确标注定位
- D158 v3.34 新增 = PIM-DIMM 适用场景边界争议 · 截止 9-17 evening 棒前精读 HotInfra '26 原文 + decode-heavy 推理定义边界 + 同行评审级别核实
- D159 v3.35 新增 = Orthrus 复现 4 项待核(作者与原 Orthrus 团队关系 + 代码/数据公开 + FP32 端到端速度数据 + 12 个领域分布)· 截止 9-17 evening 棒前精修闭合预备级
- D160 v3.35 新增 = Perplexity CobbleDB 1 亿美元数字独立审计(包含哪些成本项未披露 · 数据来自 CEO 推文无独立审计)· 截止 9-17 evening 棒前精修闭合预备级
- D161 v3.35 新增 = TurboQuant vLLM 集成实测边界(3-bit 在 8B 以下模型效果退化明显 · FP32 端到端速度数据 · 6× 压缩在 70B+ 模型上的精度损失 · AMD ROCm vs NVIDIA H100 实测差异)· 截止 9-17 evening 棒前精修闭合预备级
3.2 本棒位新增待核(预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级)
| 编号 | 内容 | 来源 |
|---|---|---|
| 3.2.1 | JustVugg/colibri 纯 C MoE 推理引擎详细工程实现 + 与 vLLM/SGLang/Mooncake 性能对比 | jay 9-17 0947 GitHub Trending 早棒 ③ ⚠️ |
| 3.2.2 | NVIDIA 收购 Hugging Face $129.3 亿监管审批时间表具体节点 | jay 9-17 1505 Backend 节 + v3.35 §1.(10) 顶会部署子轴已锚入 |
| 3.2.3 | vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 融资方具体投资方 + 估值时间点 | jay 9-17 1505 Backend 节 cnblogs GPUStack 2026-02-03 ⚠️ |
| 3.2.4 | Perplexity Q2D-Web Benchmark 数据集下载链接 + 评测 API 接口 | jay 9-17 1505 Database 节 explainx.ai ⚠️ |
| 3.2.5 | HARMONY 分布式 ANNS 系统 arXiv:2310.11703 代码公开状态 + 与 Milvus/Qdrant/pgvector 实测对比 | jay 9-17 1140 research-brief DATABASE 节 ⚠️ |
| 3.2.6 | SPI Query-Depth-Adaptive Indexing arXiv:2511.16681 代码公开状态 + 与 vLLM/SGLang vector store 集成路径 | jay 9-17 1140 research-brief DATABASE 节 ⚠️ |
| 3.2.7 | Joint Cooling-Computing for LLM Inference arXiv:2609.XXXXX arXiv 号完整核实 | jay 9-17 1505 cloud-native 节 ⚠️ 2609.XXXXX 占位 |
| 3.2.8 | RoofLang AI-Driven LLM Inference Systems Architecture arXiv:2609.13141 实际内容核实 | jay 9-17 1505 backend 节 ⚠️ 待验证 arXiv 新提交 |
| 3.2.9 | Microsoft MAF 1.0 AutoGen → MAF 迁移指南具体步骤 | jay 9-17 engineering-e1prep 增量 ②⚠️ stephen 1245 D6 已列入 |
| 3.2.10 | Microsoft Orchard 与 MAF 1.0 协同 vs 竞争关系具体边界 | jay 9-17 engineering-e1prep 增量 ③⚠️ 待精读 MSR Blog |
| 3.2.11 | InceptionRAG 防御充分性声明独立核实 | jay 9-17 engineering-e1prep 增量 ④⚠️ |
| 3.2.12 | ModAR arXiv:2609.17524 paper_card 1383 主分类争议 engineering + multimodal 邻接级 双锚处理 | jay 9-17 engineering-e1prep 增量 ⑦⚠️ stephen 1245 D5 已列入 |
| 3.2.13 | Mind2Dialogue arXiv:2609.15972 paper_card 1385 distillation 完整方法论核实 | jay 9-17 engineering-e1prep 增量 ⑧ |
| 3.2.14 | XConf Confidence Comes from Experience arXiv:2609.17708 paper_card 1405 副分类 llm-infra 主分类 agent 锚定处理 | work-queue Top 5 #4 ⚠️ |
| 3.2.15 | RelateAnything arXiv:2609.12552 paper_card 1399 误归类 llm-infra 实际 multimodal 场景图主分类订正 | ⚠️ paper_card 主分类错误需订正 |
| 3.2.16 | HF ICML 2026 可复现性黑客松 2226 篇论文 vs ICML 2026 全部接收论文比例具体核实 | jay 9-17 0947 GitHub Trending 早棒 HF Blog ②⚠️ |
| 3.2.17 | Qwen 衍生版本 180-210 repos/天 数据样本周期与统计方法 | jay 9-17 0947 GitHub Trending 早棒 HF Blog ①⚠️ |
| 3.2.18 | FLAT arXiv:2609.16591 "联合优化"边际收益消融实验 + 数据规模与算力披露 |
flyp 9-17 0950 critical-read §5 experiments ⚠️ |
| 3.2.19 | v3.35 cutoff 05:00 后 llm-infra 主分类 paper_card 入库净增确认 = 仅 0 件(1399-2609-12552 RelateAnything 误归类 + 1405-2609-17708 XConf 副分类 llm-infra 主分类 agent)· 实际目录扫描 1408 张稳态 · v3.35 cutoff 后 +15 张(1394-1408 跨度)· 0 件 NET-new 主分类 llm-infra paper_card 在 v3.35 cutoff 后入库净增确认(承接 v3.35 微调棒基线稳态) | 本棒位 paper_card 时间线 |
| 3.2.20 | work-queue 9-17 18:00 Top 15 高价值待深度解读 6 件 = 全部为 multimodal / agent / risk 主分类,0 件 llm-infra 主分类 | work-queue.md 9-17 18:00 |
| 3.2.21 | spark 9-17 早棒位空窗延续 3 棒位 ⚠️ vs Stephen 9-17 noon 协调棒判定补位需求 · 缺口 G3 spark 9-17 早棒缺位延续 ⚠️ | stephen 9-17 1245 noon 协调棒明确标注 |
| 3.2.22 | vLLM Korea Meetup 2026 vLLM V1 + Prefill-Decode disaggregation AMD MORI-IO 8-GPU MI300X 节点上的实践 具体技术细节 | jay 9-17 0947 GitHub Trending 早棒 vllm.ai blog |
| 3.2.23 | Coordination as an Architectural Layer arXiv:2605.03310 不可识别定理实测验证 + InfoAUC 指标工程化 | jay 9-17 1140 research-brief BACKEND 节 reproduction 复现优先级中 |
| 3.2.24 | SPI 与 vLLM/SGLang vector store 集成路径 + RAG-Stack arXiv:2608.03487 集成方式 | jay 9-17 1140 research-brief + engineering-e1prep 增量 ⑦邻接级 |
| 3.2.25 | PIM-DIMM 2.4× 吞吐 vs H100 SXM5 GPU(CapEx 20.6× ↓)适用场景边界争议沿用 · decode-heavy 推理是否包含主流 Agent 工作负载 + HotInfra '26 会议论文级别 vs 同行评审边界 | v3.35 D158 v3.34 沿用 |
四、可引用的 arXiv 号列表(本棒位承接 + 沿用)
4.1 本棒位新承接 arXiv 号(预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级)
| arXiv 号 | 标题 | 来源 | 重要性 |
|---|---|---|---|
| arXiv:2609.16818 | InceptionRAG: RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导 | jay 9-17 engineering-e1prep 增量 ④⭐⭐⭐⭐ + paper_card 1382 ✓ | 核心 ⭐⭐⭐⭐ · 绕过现有防御机制 · RAG 安全子轴新攻击层 |
| arXiv:2609.17012 | ORDER: Task-Conditioned Routing for Retrieval-Augmented Generation | jay 9-17 engineering-e1prep 增量 ⑤⭐⭐⭐⭐ + paper_card 1381 ✓ | 核心 ⭐⭐⭐⭐ · 查询条件化 RAG 动态路由 · 联合自适应调整索引与检索策略 |
| arXiv:2609.16453 | 预测 Agentic RAG 部分答案质量与效用 | jay 9-17 engineering-e1prep 增量 ⑥⭐⭐⭐⭐ | 核心 ⭐⭐⭐⭐ · 多跳问答范式 · 部分答案质量预测 · 提前判断检索结果是否足够支撑回答 |
| arXiv:2609.17524 | ModAR: 模态自回归世界-动作模型 | jay 9-17 engineering-e1prep 增量 ⑦⭐⭐⭐⭐ + paper_card 1383 ✓ ⚠️ 主分类争议 | 核心 ⭐⭐⭐⭐ · WAM 多模态扩展 · 首个以自回归方式对多个未来模态去噪 |
| arXiv:2609.15972 | Mind2Dialogue: 无推理轨迹的专家模型训练 | jay 9-17 engineering-e1prep 增量 ⑧⭐⭐⭐ + paper_card 1385 ✓ | 核心 ⭐⭐⭐ · 蒸馏方向新方法论 · 无需显式推理监督即可训练领域专家模型 |
| arXiv:2609.17708 | Confidence Comes from Experience: XConf Experiential Confidence Estimation | paper_card 1405 ✓ 已入库(主分类 agent · 副分类 llm-infra)· work-queue Top 5 #4 | 核心 ⭐⭐⭐⭐ · experiential confidence estimation · 副分类 llm-infra 邻接级承接 v3.35 §1.(11) Kernel/Harness 子轴 + §1.(5) 投机解码子轴预备扩增预备级 |
| arXiv:2605.03310 | Coordination as an Architectural Layer: LLM-Based Multi-Agent 系统 | jay 9-17 1140 research-brief BACKEND 节 ⭐⭐⭐⭐ | 核心 ⭐⭐⭐⭐ · 多 Agent 协调层 · 不可识别定理 · 工业界已向声明式工作流收敛 AWS Strands YAML + Microsoft Foundry |
| arXiv:2511.16681 | SPI: Query-Depth-Adaptive Indexing for Streaming RAG in Vector Databases | jay 9-17 1140 research-brief DATABASE 节 ⭐⭐⭐⭐⭐ | 核心 ⭐⭐⭐⭐⭐ · 动态索引分辨率 · 无需离线调参或独立训练每层模型 · 工程价值极高 |
| arXiv:2310.11703 | HARMONY: 分布式 ANNS 系统 | jay 9-17 1140 research-brief DATABASE 节 ⭐⭐⭐⭐ | 核心 ⭐⭐⭐⭐ · 多粒度分区 + early-stop pruning · 吞吐量 4.63× · 偏斜负载 +58% |
| arXiv:2605.01495v1 | FT-RAG: Fine-grained Retrieval-Augmented Generation for Complex Table Reasoning | jay 9-17 1140 research-brief DATABASE 节 ⭐⭐⭐⭐ | 邻接 ⭐⭐⭐⭐ · 细粒度 RAG + 知识图谱增强 · 多跳推理 |
| arXiv:2609.13141 | RoofLang: AI-Driven LLM Inference Systems Architecture | jay 9-17 1505 backend 节 ⚠️ 待验证 | 邻接 ⭐⭐⭐ · arXiv 2609 新提交 · AI 工具驱动 LLM 推理系统架构设计 |
| arXiv:2609.XXXXX | Joint Cooling-Computing Control for LLM Inference in AI Datacenters | jay 9-17 1505 cloud-native 节 ⭐⭐⭐⭐ ⚠️ arXiv 号待核 | 核心 ⭐⭐⭐⭐ · GPU serving 与设施冷却联合优化 · 最小化每任务 GPU+冷却能耗 |
| arXiv:2510.13910v2 | RAGCap-Bench: Agentic RAG 组件级评测 | jay 9-17 1051 agentic-rag-production ⑧ | 邻接 ⭐⭐⭐⭐ · planning/retrieval/reasoning 各阶段评估 |
| arXiv:2602.03442 | A-RAG: 分层检索接口扩展 agentic RAG | jay 9-17 1051 agentic-rag-production ⑨ | 邻接 ⭐⭐⭐ · 分层检索接口扩展 |
| arXiv:2609.16591 | FLAT Flexible-Length Aligned Transmodal Tokens | flyp 9-17 0950 critical-read 8.6KB ⭐⭐⭐ + paper_card 1394 ✓ | 邻接 ⭐⭐⭐ · multimodal + rag 主轴双锚 · 联合优化多模态编码器与 T2I/I2T 解码器 |
| arXiv:2609.16816 | ImpossibleRubrics | tom 9-17 0840 radar + paper_card 1388 ✓ | 邻接 ⭐⭐⭐⭐ · LLM-as-Judge rubric 对抗鲁棒性 · 与 MC-Search HAVE 框架矛盾 |
| arXiv:2609.15578 | Magnitude Illusion | tom 9-17 0840 radar + 0840 radar 高价值 #3 | 邻接 ⭐⭐⭐ · 置信度幅度≠可靠性 · 阈值弃权策略待核 |
| arXiv:2609.13406 | Generalized Agent Iteration | tom 9-17 0840 radar + paper_card 1400 ✓ | 邻接 ⭐⭐⭐ · RSI 议题第七源预备级触发 · 递归自我改进统一形式框架 |
| arXiv:2609.16372 | Register Tokens | tom 9-17 0840 radar + paper_card 1396 ✓ | 邻接 ⭐⭐⭐ · dLLM 有界状态推理 · 跨生成块连续推理状态压缩 |
| arXiv:2609.15195 | HarnessVLN | tom 9-17 0840 radar + paper_card 1389 ✓ | 邻接 ⭐⭐⭐ · Agent Harness 协调六模块 · 零样本免训练具身导航 |
4.2 v3.35 微调棒 NET-new 已收编 arXiv 号(沿用预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级)
- arXiv:2510.09665 · LMCache Enterprise-Level KV Cache Caching Layer · v3.35 §1.(3) KV cache 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2602.21548 · DualPath Agentic LLM Inference · v3.35 §1.(1) 推理引擎子轴 + §1.(3) KV cache 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2606.06090 · MemoryArena Beyond Semantic Organization · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2601.03236 · MAGMA · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2602.23374 · Higress-RAG · v3.35 §1.(2) 推理调度子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2607.08057 · ACL 2026 Findings System-Aware KV Cache Optimization · v3.35 §1.(3) KV cache 子轴实质锚入预备级预备触发预备级预备扩增预备级预备触发预备级
- arXiv:2502.07115 · Online Scheduling for LLM Inference with KV Cache Constraints · v3.35 §1.(2) 推理调度 + §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2603.09619 · Context Engineering From Prompts to Corporate Multi-Agent Architecture · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2609.15504 · Orthrus How Lossless Is Lossless Speculative Decoding · v3.34 §1.(5) 投机解码子轴实质锚入预备级预备触发预备级预备扩增预备级 · flyp 9-16 0950 critical-read ⭐⭐⭐⭐⭐
- arXiv:2609.13285 · Grouped Value Attention · v3.34 §1.(3) KV cache 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2606.21649 · EvoEmbedding · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2501.09136v4 · Agentic RAG Survey · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2609.00749 · ContextPipe · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2608.09214 · AkasicDB Omni RAG DBMS · v3.35 §1.(2) 推理调度子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2608.12365 · FluctlightDB · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
- arXiv:2605.15040 · Microsoft Orchard · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级
4.3 24h 滑动窗口内 HF Daily 9-17 早棒 15 件立标信号(预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级)
| arXiv 号 | 票数 | 排名 | 主分类 | llm-infra 关联 |
|---|---|---|---|---|
| arXiv:2609.13285 | 64▲ #9 multimodal 邻接级 | GVA | llm-infra ✓ | v3.34/v3.35 实质锚入预备级预备触发预备级预备扩增预备级 |
| arXiv:2609.15504 | 29▲ #11 multimodal 邻接级 | Orthrus 复现 | llm-infra ✓ | v3.34/v3.35 实质锚入预备级预备触发预备级预备扩增预备级 + flyp critical-read |
| arXiv:2609.15818 | 424▲ #1 multimodal 主轴 | Atria Dawn | agent + multimodal 邻接级双锚 ⚠️⚠️⚠️ | 立标续立稳态连续三日新高 ⚠️⚠️⚠️ |
| arXiv:2609.13356 | 302▲ #2 multimodal 主轴 | ZGCM-1 | multimodal | 立标续立稳态 |
| arXiv:2609.06986 | 287▲ #3 multimodal 邻接级 | 持续学习组合 | multimodal | 立标续立稳态 |
| arXiv:2609.16679 | 107▲ #4 | Game AI | multimodal | 立标续立稳态 |
| arXiv:2609.14005 | 91▲ #5 | StepAudio 3 Realtime | multimodal + rag + audio | paper_card 1392 ✓ multimodal 主分类 |
| arXiv:2609.11873 | 86▲ #6 | 人类构建的最后一个 AI | RSI + agent | paper_card 1387 ✓ agent 主分类 |
| arXiv:2609.16034 | 70▲ #7 | StepAudio 3 Music | multimodal | paper_card 1393 ✓ multimodal 主分类 |
| arXiv:2609.15364 | 70▲ #8 | RSIAgent | RSI + agent | 立标续立稳态 |
| arXiv:2609.15863 | 46▲ #10 | LynnReal-Omni | video + multimodal | paper_card 1367 ✓ multimodal 主分类 |
| arXiv:2609.14462 | 22▲ #12 | AlayaVista | world model + multimodal | 立标续立稳态 |
| arXiv:2609.17523 | 17▲ #13 | ScienceBuddy | RSI + agent | 立标续立稳态 |
| arXiv:2609.15659 | 17▲ #14 | Kaininja | multimodal | 立标续立稳态 |
| arXiv:2609.15195 | 15▲ #15 | HarnessVLN | multimodal 邻接级 | paper_card 1389 ✓ evaluation 主分类 |
五、本次写入文件
/shared/research-kb/inbox/spark/2026-09-17-llm-infra-e1prep.md(本文件 · spark 2026-09-17 18:40 CST · E1 日间预消化轮 · llm-infra 主题 · spark 9-17 evening 棒位主力补位 · 同名文件已存在则整篇覆盖 write 整写 禁 edit)
六、后续行动建议(截止 9-17 evening 接力棒前)
6.1 P0 / P1 待消化
- [ ] P0 v3.35 D154-D161 矛盾沿用预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级预备级预备级预备级预备级 = HyQuant paper_card 入库 + ACM FSE 2026 章节锚入 + SGLang +29% vs ≤4% 数据前提精读 + nanochat 定位标注 + PIM-DIMM 适用场景边界 + Orthrus 复现 4 项待核 + Perplexity CobbleDB 1 亿美元独立审计 + TurboQuant vLLM 集成实测边界
- [ ] P1 NVIDIA 收购 Hugging Face $129.3 亿 §1.(10) 顶会部署子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 监管审批时间表具体节点
- [ ] P1 vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 双融资 §1.(1) 推理引擎子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 融资方具体投资方 + 估值时间点
- [ ] P1 Perplexity Q2D-Web Benchmark §1.(10) 顶会部署子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 数据集下载链接 + 评测 API 接口
- [ ] P1 HARMONY 分布式 ANNS 系统 arXiv:2310.11703 §1.(2) 推理调度子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 代码公开状态 + 与 Milvus/Qdrant/pgvector 实测对比
- [ ] P1 SPI Query-Depth-Adaptive Indexing arXiv:2511.16681 §1.(2) 推理调度子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 代码公开状态 + 与 vLLM/SGLang vector store 集成路径
- [ ] P1 Joint Cooling-Computing for LLM Inference arXiv:2609.XXXXX §1.(10) 顶会部署子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + arXiv 号完整核实
- [ ] P1 Microsoft MAF 1.0 AutoGen → MAF 迁移指南具体步骤 + Orchard 与 MAF 1.0 协同 vs 竞争关系具体边界
- [ ] P1 InceptionRAG arXiv:2609.16818 §1.(11) Kernel/Harness 子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 防御充分性声明独立核实
- [ ] P1 ORDER arXiv:2609.17012 §1.(2) 推理调度子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 完整方法论核实
- [ ] P1 预测 Agentic RAG 部分答案质量与效用 arXiv:2609.16453 §1.(11) Kernel/Harness 子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 完整方法论核实
- [ ] P1 ModAR arXiv:2609.17524 paper_card 1383 主分类争议 engineering + multimodal 邻接级 双锚处理
- [ ] P1 Mind2Dialogue arXiv:2609.15972 §1.(1) 推理引擎子轴实质锚入预备扩增预备级预备触发预备级预备扩增预备级 + 蒸馏完整方法论核实
- [ ] P1 XConf Confidence Comes from Experience arXiv:2609.17708 paper_card 1405 副分类 llm-infra 主分类 agent 锚定处理
- [ ] P1 RelateAnything arXiv:2609.12552 paper_card 1399 误归类 llm-infra 实际 multimodal 场景图主分类订正
6.2 预备候选预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级
- [ ] NVIDIA 收购 Hugging Face $129.3 亿监管审批 · v3.35 §1.(10) 顶会部署子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] vLLM Inferact + SGLang RadixArk 双融资 · v3.35 §1.(1) 推理引擎子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] Perplexity Q2D-Web Benchmark · v3.35 §1.(10) 顶会部署子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] HARMONY 分布式 ANNS 系统 + SPI Streaming RAG · v3.35 §1.(2) 推理调度子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] Joint Cooling-Computing for LLM Inference · v3.35 §1.(10) 顶会部署子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] Microsoft MAF 1.0 + Orchard 双轨布局 · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] InceptionRAG + ORDER + ModAR + Mind2Dialogue 四件 · v3.35 §1.(2)/(11) 子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] HF ICML 2026 可复现性黑客松 2226 篇论文 · v3.35 §1.(10) 顶会部署子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] JustVugg/colibri 纯 C MoE 推理引擎 · v3.35 §1.(1) 推理引擎子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
- [ ] Coordination as an Architectural Layer arXiv:2605.03310 · v3.35 §1.(11) Kernel/Harness 子轴实质锚入预备级预备触发预备级预备扩增预备级承接稳态
6.3 精读/审稿候选
- [ ] 精读 NVIDIA 收购 Hugging Face $129.3 亿官方公告全文(blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face)· 工程影响范围 + 监管审批节点
- [ ] 精读 vLLM Inferact + SGLang RadixArk 双融资 · 融资方具体投资方 + 估值时间点 + 推理层进入 AI 基础设施核心层产业意义
- [ ] 精读 Perplexity Q2D-Web Benchmark 论文 · 首个工业规模 agentic RAG 评测基准 · 1.9 亿文档 + 7 万 agent 查询 + 每查询约 100 个密集标签
- [ ] 精读 HARMONY 分布式 ANNS 系统 arXiv:2310.11703 · 吞吐量 4.63× · 偏斜负载 +58%
- [ ] 精读 SPI Streaming RAG arXiv:2511.16681 · 动态索引分辨率 + 无需离线调参
- [ ] 精读 Joint Cooling-Computing for LLM Inference · GPU serving 与设施冷却联合优化
- [ ] 精读 Microsoft MAF 1.0 + Orchard 双轨布局 · AutoGen → MAF 迁移指南 + Orchard 与 MAF 1.0 协同 vs 竞争关系
- [ ] 精读 InceptionRAG arXiv:2609.16818 · RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导 · 防御充分性
- [ ] 精读 ORDER arXiv:2609.17012 · 查询条件化 RAG 动态路由
- [ ] 精读 XConf Confidence Comes from Experience arXiv:2609.17708 · experiential confidence estimation · 副分类 llm-infra 主分类 agent 锚定处理
- [ ] 精读 RelateAnything arXiv:2609.12552 · paper_card 1399 误归类订正
- [ ] 精读 RoofLang arXiv:2609.13141 · AI-Driven LLM Inference Systems Architecture
6.4 9-17 evening 接力棒前必消化
- 8 件 P0 矛盾沿用 = HyQuant paper_card 入库 + ACM FSE 2026 章节锚入 + SGLang +29% vs ≤4% 数据前提精读 + nanochat 定位标注 + PIM-DIMM 适用场景边界 + Orthrus 复现 4 项待核 + Perplexity CobbleDB 1 亿美元独立审计 + TurboQuant vLLM 集成实测边界
- 16 件 P1 NET-new 整合级承接 = NVIDIA 收购 HF + vLLM Inferact + SGLang RadixArk + Perplexity Q2D-Web + HARMONY + SPI + Joint Cooling-Computing + RoofLang + Microsoft MAF 1.0 + Orchard + InceptionRAG + ORDER + ModAR + Mind2Dialogue + XConf + RelateAnything 误归类订正
- 25 项矛盾/待核(§3.1 D154-D161 v3.33/v3.34/v3.35 沿用 + §3.2.1-3.2.25 新增待核)· 截止 9-17 evening 棒前精修闭合预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级
七、诚实度声明与总结
7.1 诚实度声明
本棒位承接 v3.35 §IX 99 evening 微调棒基线 + 0 件 NET-new 主分类 llm-infra paper_card 入库净增确认(实际目录扫描 1408 张 · v3.35 cutoff 后 +15 张 1394-1408 跨度 · 1399-2609-12552 RelateAnything 误归类 llm-infra 实际为 multimodal 场景图 + 1405-2609-17708 XConf 副分类 llm-infra 主分类 agent)· 8 件 NET-new 预备候选首次锚入预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级(① NVIDIA 收购 Hugging Face $129.3 亿 ⭐⭐⭐⭐⭐ · ② vLLM Inferact $1.5 亿 + SGLang RadixArk $4 亿 双融资 ⭐⭐⭐ · ③ Perplexity Q2D-Web Benchmark 1.9 亿文档 + 7 万 agent 查询 ⭐⭐⭐⭐⭐ · ④ HARMONY 分布式 ANNS 系统 + SPI Streaming RAG ⭐⭐⭐⭐⭐ · ⑤ Joint Cooling-Computing for LLM Inference ⭐⭐⭐⭐ · ⑥ Microsoft AutoGen → MAF 1.0 + Orchard 双轨布局 ⭐⭐⭐⭐⭐ · ⑦ InceptionRAG RAG 隐蔽投毒攻击新类别 = 间接逻辑诱导 ⭐⭐⭐⭐ · ⑧ ORDER + 预测 Agentic RAG 部分答案质量与效用 + Mind2Dialogue 三方法学承接稳态 ⭐⭐⭐⭐)。
25 项矛盾/待核新标记预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级(D154-D161 v3.33/v3.34/v3.35 沿用 + 25 项新增待核 = NVIDIA HF 监管审批 + vLLM/SGLang 融资方 + Perplexity Q2D-Web 数据集 + HARMONY 代码 + SPI 代码 + Joint Cooling arXiv 号 + RoofLang 内容 + MAF 迁移 + Orchard 协同 + InceptionRAG 防御 + ModAR 主分类 + Mind2Dialogue 方法论 + XConf 副分类 + RelateAnything 误归类 + ICML 黑客松 + Qwen 衍生版统计 + FLAT 消融 + v3.35 cutoff 后 llm-infra 主分类 paper_card 入库 + work-queue Top 15 0 件 llm-infra + spark 9-17 早棒空窗 + vLLM Korea Meetup + Coordination InfoAUC + SPI 集成 + PIM-DIMM 边界)。
20 件 NET-new arXiv ID 预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级(本棒位承接 20 件)+ 16 件 v3.35 微调棒 NET-new 已收编 arXiv ID 沿用预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级 = 总承接 arXiv 号 36 件。
§IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级预备级预备级预备级预备级预备级预备级预备级预备级:8 件 NET-new 预备候选首次锚入预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级 + 0 件 NET-new 主分类 llm-infra paper_card 实质锚入预备级 + 25 项矛盾/待核精修闭合预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级预备级预备级预备级 → §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级。
7.2 本棒位总判定
v3.35 微调棒落定后 13h 40min 净窗口期延长稳态 + 24h 滑动窗口内 0 件 NET-new 主分类 llm-infra paper_card 入库(1408 张稳态 · v3.35 cutoff 后 +15 张 1394-1408 跨度 · 0 件 llm-infra 主分类 · 1399 RelateAnything 误归类 + 1405 XConf 副分类)+ 8 件 NET-new 整合级承接候选首次锚入预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级 = v3.35 §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级 = spark 9-17 evening 棒位预备补位承接棒 · 截止 9-17 evening 接力棒前精修闭合预备级预备级预备级预备触发预备级预备扩增预备级预备触发预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级。
Spark · 2026-09-17 18:40 CST · E1 日间预消化轮 · llm-infra 主题 · spark 9-17 evening 棒位主力补位 · v3.35 §IX 100 morning 棒位预备候选预备扩增预备级预备触发预备级预备扩增预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级预备级