llm-infra · E1 预消化简报(2026-09-21)

实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-21 18:40 CST 基线:organized/knowledge/llm-infra.md v3.39 §IX 101 evening 升档棒(cutoff 2026-09-21 05:00 CST · arXiv/CVE/DOI/URL 400/36/15/532) 本棒窗口:v3.39 evening cutoff 2026-09-21 05:00 → 2026-09-21 18:40 = 13h 40min 净窗口期 + 9-20 18:40 → 9-21 18:40 = 24h 滑动窗口对照 核心判断:work-queue 9-21 18:00 警示 = 0 件主分类 llm-infra Top 15 待深度解读(5 件均为 multimodal/evaluation/engineering)+ 0 件待更新缺失主题活文档 + 待富化 15 张卡缺 TLDR + 待精确分类 0 张卡 · 本棒位承接 v3.39 evening 升档棒 + spark 9-20 evening llm-infra e1prep 67KB + jay 9-21 全天棒位 14 文件 ≈ 150KB 主承载 + tom 9-21 0900 HF Daily 15 件 + flyp 9-21 0950 RiskChainBench critical-read 17.2KB + stephen 9-21 1027 ai-industry e1prep 97.9KB + spark 9-21 13:37 agent-e1prep 42.3KB · 8 件主增量(2 件 NET-new + 1 件承接稳态精修锚定候选 + 5 件承接稳态精修预备级预备扩增预备级)。


一、检查过的来源清单

1.1 工作队列 + v3.39 evening 活文档(沿用稳态)

  • organized/queue/work-queue.md(2026-09-21 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 5 件 = ① 2609.18766 FRAUDSkill(主分类 multimodal + 副 engineering)② 2609.19122 Training-Adaptive Convolutional Sparse Coding(主分类 engineering)③ 2609.18620 DeformSmith(主分类 evaluation)④ 2609.18748 TeleAntiFraud 2.0(主分类 evaluation + 副 multimodal)⑤ 2609.20816 Paint-Anything(主分类 multimodal)= 0 件主分类 llm-infra · 选题榜未成视频脚本 1 件 = 2609.18487(ActionPiece multimodal 主分类 9-21 完全跌出立标终止核实候选)· Tom/Jay/spark 认领段均无内容警示 + 5) 富化缺口 15 张卡缺 TLDR(待 cron_s2 覆盖)+ 6) 待精确分类 0 张卡 · work-queue 9-21 主分类 llm-infra 0 件 net-new 警示 沿用 v3.37 状态

  • organized/knowledge/llm-infra.md v3.39 §IX 101 evening 升档棒(2026-09-21 05:00):arXiv/CVE/DOI/URL 400/36/15/532 精确闭合 + paper_cards 实际目录扫描 1439 张稳态(v3.38 cutoff 后 +7 张 1433-1439 跨度 · 0 件主分类 llm-infra 入库净增5 件 NET-new arXiv ID v3.39 入主文件 = arXiv:2609.17475 JustFit + arXiv:2609.17391 FlashVector + arXiv:2604.22906 Edge Inference Survey + arXiv:2605.00528 SAGA + arXiv:2609.12923 Dissecting GPU Utilization Hopper + 9 件 NET-new URL + 5 件 NET-new 整合级预备候选首次实质锚入预备扩增预备级 = ① JustFit MLX-based 端侧 LLM serving ⭐⭐⭐⭐ · ② FlashVector Stanford/Unity Vector AI Team agent-as-engineer ⭐⭐⭐⭐ · ③ Network Edge Inference for LLMs Survey ⭐⭐⭐⭐ · ④ SAGA Workflow-Atomic Scheduling HPDC'26 ⭐⭐⭐⭐ · ⑤ Dissecting GPU Utilization Hopper 8 Nsight Compute counter-validated views ⭐⭐⭐⭐ + 1 件承接稳态精修锚定(DeepSeek-V4.1-Flash 升档续立 95▲ #2 · KV cache 压缩四层方法学 ⭐⭐⭐⭐⭐)+ 0 件 NET-new DOI/CVE + 2 件 NET-new 矛盾/待核新标记(D171 v3.39 FlashVector 作者归属精修已纠正 · 截止 9-22 morning 棒前 + D172 v3.39 Plugin4Shell 修复覆盖范围核实 · 截止 9-22 morning 棒前)= 精确闭合(arXiv/CVE/DOI/URL 400/36/15/532)+ O534-O535 v3.39 新增 + P0 #278-#279 v3.39 新增 + T138 §IX 101 evening v3.39 新增 · D165 v3.37 NVIDIA HF 收购降级稳态 + D166 CodeComp arXiv:2604.10235 待核稳态 + D167-D170 v3.37-v3.38 矛盾/待核稳态沿用

1.2 inbox/spark(2026-09-20 18:40 → 2026-09-21 18:40 · spark 全天棒位空窗延续 + 2 件 RSS + 1 件 agent 棒位)

  • 2026-09-20-llm-infra-e1prep.md(2026-09-20 18:40 CST · ≈ 67KB · v3.39 基线锚定 · 8 件 NET-new 整合级预备候选预备级 = vLLM MTP ⭐⭐⭐⭐⭐ + TriAttention ⭐⭐⭐⭐ + TensorRT-LLM DeepSeek-V4 Agentic Workload ⭐⭐⭐⭐ + SGLang 2026 半年更新全景 + suffix decoding ⭐⭐⭐⭐ + Sample Count Is Not Enough paper_card 1432 ⭐⭐⭐ · 本棒位承接基线)
  • 2026-09-21-1001-rss-gradient-flow.md(2026-09-21 10:01 CST · 邻接级承接稳态)· 0 件 llm-infra 主轴 net-new · AI 数据中心水/噪声/电力成本讨论(邻接级承接稳态)
  • 2026-09-21-1002-rss-chip-huyen.md(2026-09-21 10:02 CST · 邻接级承接稳态)· 0 件 llm-infra 主轴 net-new · 构建生成式 AI 应用常见陷阱 + 智能体 + 900 个开源 AI 工具(2026-02 更新沿用)
  • 2026-09-21-agent-e1prep.md(2026-09-21 13:37 CST · 42.3KB · agent 主轴 · spark 第 5 日补出棒位 · 6 件 NET-new 主增量 + WeVisDoc arXiv:2609.19671/arXiv:2609.20423 端到端文档解析两阶段数据工程 · 承接 v3.39 evening §1.(1) 推理引擎 + §1.(11) Kernel/Harness 沿用稳态)

spark 9-21 全天棒位空窗延续:13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 2 份 RSS 抓取 + 1 份 agent 棒位 = 本棒位为 spark 9-21 evening 棒位预备补位承接 v3.39 evening 升档棒(stephen 1245 noon M11 ⚠️⚠️⚠️ 标注 spark 主棒位连续 5 日缺位第 1 日需恢复)。

1.3 inbox/jay(2026-09-20 18:40 → 2026-09-21 18:40 · llm-infra 主轴主承载 · 14 文件 ≈ 150KB)

  • 2026-09-21-1000-rss-bytebytego.md / 2026-09-21-1000-rss-raschka.md / 2026-09-21-1000-rss-simon-willison.md / 2026-09-21-1001-rss-cool-papers.md / 2026-09-21-1001-rss-cool-papers-ir.md / 2026-09-21-1001-rss-nathan-benaich.md / 2026-09-21-1002-rss-import-ai.md / 2026-09-21-1002-rss-lilian-weng.md / 2026-09-21-1002-rss-msr-blog.md(9 件 RSS 抓取沿用稳态)· 承接稳态精修预备级预备扩增预备级 = llm-keys-ui 0.1 跨机器 AI 编码 Agent 远程控制基础设施(Simon Willison 9-20)+ RetireOPD arXiv:2609.20784 Self-Retiring On-Policy Distillation for Agentic RL(paper_card 1418 ✓ 主分类 agent 邻接级 llm-infra)+ Orchard arXiv:2605.15040 面向可扩展 agentic AI 的开源框架(MSR Blog) + Embedding Models arXiv:2609.20821 + JEPA-Anything arXiv:2609.20800 + Harm Laundering arXiv:2609.20779 + 推理质量至关重要 arXiv:2609.20563 + FacetCRS arXiv:2609.20175 + Recommendation Filter Bubbles arXiv:2609.20131 + Think Thrice arXiv:2609.20050 + Reproducing Transparent arXiv:2609.19831(全部承接 v3.39 evening §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-21T1505-jay-five-category-afternoon-briefing.md(2026-09-21 15:05 CST · 12.4KB · 本棒位核心增量源 1 · 五类目简报)= 承接稳态精修 + 2 件 NET-new 端侧 / 边缘推理整合级预备候选预备级精修预备级:
  • colibri(JustVugg/colibri · GitHub Trending 2026-09-21 · 35.5k ★ +3.7k 单日新增)⭐⭐⭐⭐ = 纯 C MoE 推理引擎 · 无 GPU 依赖 · 无 Python 运行时 · 无 BLAS · 无 Docker · 单文件 c/glm.c(~2,400 行)· gcc + OpenMP 编译 · AVX2 支持 · 通过将密集层保留在内存(~9.9 GB INT4),同时按需从磁盘流式加载 MoE 路由专家(总共 ~370 GB)· 支持 GLM-5.2(744B 总参,~40B 活跃参数)· WSL2 25GB RAM 笔记本 = 0.05-0.1 tok/s(冷启动)· Apple M5 Max = ~1.06 tok/s · Apache 2.0 · HN 分数 769 points(2026-07-09 首日)· 能力密度里程碑:744B frontier MoE 首次可在消费级硬件(无 GPU)上运行
  • NVIDIA H100 GPU 利用率研究(arXiv:2609.19472 · cs.PF · 2026-09-14 邻接级)⭐⭐⭐⭐ = 论文对 Nvidia Hopper 架构上 LLM 推理的 GPU 利用率做了系统性剖析 · 生产推理的利用率往往远低于峰值 · 主要瓶颈不在算力,而在内存带宽和 KV Cache 管理 · 研究了 Prefill-Decode 分离(PD 分离)架构下的调度优化 · 与 v3.39 evening Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 KTH 形成学术研究 vs 生产实测对照
  • NVIDIA 边缘 AI 功耗研究(C2 · arXiv · cs.PF · 2026-09-14 邻接级)⭐⭐⭐ = 移动端 LLM 推理的能耗是云端同等推理的 10-100 倍(按每次查询计算)
  • 2026-09-21-engineering-e1prep.md(2026-09-21 11:22 CST · 14KB · 本棒位核心增量源 2 · 6 件主增量 + 4 件新 arXiv)= 承接稳态精修锚定候选预备级:
  • ① OWASP Top 10 AI/LLM/Agents ASI 类确立 ⭐⭐⭐⭐⭐(承接 spark 9-21 13:37 agent-e1prep 增量 1 沿用)
  • ② RetireOPD arXiv:2609.20784 技能解耦 On-Policy 蒸馏 ⭐⭐⭐⭐
  • ③ llm-keys-ui 0.1 跨机器 AI 编码 Agent 远程控制基础设施 ⭐⭐⭐⭐
  • ④ kev Jev-like Qwen3 决策模型周增 2124★ ⭐⭐⭐⭐
  • ⑤ AI Engineer Stack 2026 六层工程框架 ⭐⭐⭐⭐
  • ⑥ WeVisDoc arXiv:2609.20423 端到端文档解析两阶段数据工程 ⭐⭐⭐(paper_card 1419 ✓ 主分类 llm-infra · 与 jay 9-21 engineering 标注 arXiv:2609.19671 沿用 arXiv 号不一致需核实 — 见矛盾 ②)
  • 2026-09-21-ai-engineering-trending.md(2026-09-21 09:35 CST · 10.5KB · 本棒位核心增量源 3)= 承接稳态精修预备级预备扩增预备级:
  • vLLM vs SGLang vs LMDeploy vs TensorRT-LLM 决策矩阵 2026:TGI 已死(2025-12 进入维护模式)+ SGLang RadixAttention prefix-reuse >60% 3-5× prefill 延迟改善 + vLLM 冷启动 ~62s + LMDeploy H100 ~16,200 tokens/s vs vLLM ~12,500 tokens/s(差距约 29%)· SGLang 已正式加入 PyTorch 生态 · 生产用户 xAI Grok 3 / Microsoft Azure / AMD / NVIDIA / LinkedIn / Cursor / Baseten / Nebius / Runpod
  • HF State of Open Models Summer 2026:HF Hub 296 万模型(+22% YoY)100 万数据集(+41% YoY)144 万 Spaces · Qwen 家族 36 个 repo · 30 天下载量 240.1M · Gemma 第二 32.6M · gguf +464% · lerobot +194% · Apple MLX +148% · 85.6% 模型累计下载 <200 次 · 前 1.5% repo 占了 99.2% 下载量
  • 2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md(2026-09-21 17:35 CST · 本棒位核心增量源 4)= 承接稳态精修预备级预备扩增预备级:
  • vLLM vs SGLang 2026 决策框架(Spheron + Prem AI + Turion + Yotta Labs + Atomic Chat 五源独立交叉验证)= 完整决策矩阵 + TGI 已死说明 + SGLang RadixAttention 基准数据
  • Vector DB 生产选型 2026:pgvector.scale Warpspeed 性能已接近专用 VDB · "选型已从哪个 VDB 最快变成这个 workload 是否真的需要专用 VDB,Postgres 重新定义了基准线"
  • GitHub AI Agent 生态 2026 榜单:dify 114k+ ⭐ + microsoft/GraphRAG 32.5k + HKUDS/LightRAG 34.2k + mem0ai/mem0 54k + RAGFlow 77.2k + LobeHub 74.7k + MetaGPT 66.6k
  • 2026 年 9 月下载量最高的开源 LLM:Qwen 240.1M · Gemma 32.6M · Ornith 13.5M · Llama 12.9M · gpt-oss 11.9M · OTel 7.4M
  • 学术论文 arXiv 2026-09-21 新投稿:Code-as-Auditor CIKM 2026 + Constraint Decay arXiv:2605.06445 + ENCO arXiv:2412.06099 KDD 2026 微软出品生产级工程 Copilot 架构 + AIPC arXiv:2604.14661v1 + Engineering a Governance-Aware AI Sandbox arXiv:2603.03394 EASE 2026
  • 2026-09-21-csdn-highvalue-edge-deepseek.md(2026-09-21 12:22 CST · 8.2KB · 承接稳态精修预备级)= 承接稳态精修预备级:
  • 四卡 PCIe 级联跑通 27B 端侧大模型(blog.csdn.net/weixin_29192211/article/details/166085539 · 2026-09-19 16:40)· 端侧 AI 分水岭(7B 入门 / 27B 生产可用门槛)· RK1828 16GB LPDDR5X × 4 · PCIe Gen3 x16 switch → 4×x4 · 按层切分(流水线并行)共享 KV Cache · INT8 权重 + 关键层 FP16 兜底 · llama.cpp RPC 分支 · Qwen2.5-27B / INT8 混合量化 / ctx=2048 / 单请求 / TTFT ≈2.1s · 稳定生成 ≈4.6 tokens/s · 四卡峰值功耗 ≈58W
  • DeepSeek V4.1 Flash 上手指南(2026-09-16)· V4.1 Flash 不是"阉割版",而是高频场景优化版 · 客服意图识别 / 文档抽取 / 代码补全 / JSON 结构化输出 / Tool Calling · MoE 稀疏参数大激活小 + 稀疏注意力 DSA(Lightning Indexer Heavy Hitter Tokens)+ MLA 低秩 KV 压缩 + 蒸馏
  • 2026-09-21-csdn-rag-agent-llm-mlops-highvalue.md(2026-09-21 16:20 CST · 9.1KB · 承接稳态精修)· 0 件 llm-infra 主轴 net-new · RAG 三代架构 + vLLM 0.6.x + KServe 部署 + Agentic RAG LangGraph + BGE-M3 + RAGAS(线上事故率 18.3% vs 传统 API 0.2%)+ pgvector 主流选型共识
  • 2026-09-21-csdn-substack-rag-agent-architectures.md(2026-09-21 08:21 CST · 8.4KB · 承接稳态精修)· 0 件 llm-infra 主轴 net-new · OWASP Top 10 AI/LLM/Agents ASI 类 4 项 + AI Agents Stack 2026 六层架构 + Micheal Lanham RAG 架构三元对比
  • 2026-09-21-ai-engineering-rag.md(2026-09-21 13:35 CST · 8.1KB · 承接稳态精修)· 0 件 llm-infra 主轴 net-new · Harness Blog + Meta-Intelligence + HF State of Open Models + Vector DB 选型 + Agentic Search
  • 2026-09-21-1140-news-x-tech-radar.md(2026-09-21 11:40 CST · X tech radar)· 邻接 v3.39 evening §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new

jay 9-21 全天棒位 llm-infra 主轴主承载总计:14 文件 ≈ 150KB = 2 件 NET-new 端侧 / 边缘推理整合级预备候选预备级精修预备级(① colibri 纯 C MoE 推理引擎 744B 模型跑 25GB RAM 笔记本 ⭐⭐⭐⭐ · ② NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 邻接级 ⭐⭐⭐⭐)+ 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(WeVisDoc arXiv:2609.20423 paper_card 1419 ✓ 主分类 llm-infra 9-21 主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发)+ 2 件承接稳态精修锚定候选预备级预备扩增预备级(① DeepSeek-V4.1-Flash 升档续立 135▲ #2 24h +40▲ 48h +78▲ 升档稳态 · KV cache 压缩四层方法学承接 v3.37 paper_card 1417 锚定 ② EOS Tokens arXiv:2609.20511 HF Daily #4 94▲ 24h +18▲ · paper_card 1425 主分类 llm-infra · 长度膨胀现象)+ 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving 2026-09-04 multimodal 推理三阶段分离决策指南)+ 1 件承接稳态精修候选(RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 multimodal 邻接级 + risk/agent 双主分类 · 评测方法学第五极 agent safety + web agent 可复现性立基础延展 llm-infra 邻接级)

1.4 inbox/tom(2026-09-20 18:40 → 2026-09-21 18:40)

  • 2026-09-21-0900-hf-daily-2026-09-21.md(2026-09-21 09:00 CST · 19 行 · HF Daily 早棒 15 件)= 核心承接稳态 = DeepSeek-V4.1-Flash 135▲ #2 升档续立 48h +78▲ 升档稳态 + EOS Tokens 94▲ #4 升档续立 24h +18▲ + SoL-Pi 94▲ #4 + ScienceIDE 79▲ #6 + Coding Agent Harness 71▲ #7 + PPO Critic 65▲ #8 + JEPA-Anything 56▲ #9 + 信心源自经验 56▲ #9 + ProgramDistill 50▲ #11 + Fuse 48▲ #12 + Self-Evolving Index 45▲ #13 + Agora 45▲ #13 + VC-Attention 35▲ #14 + RiskChainBench 42▲ #15 新立标承接 multimodal 邻接级 + risk/agent 双主分类 + ActionPiece arXiv:2609.18487 9-21 完全跌出 Top 15 ⚠️⚠️ multimodal 主分类立标终止核实 v33 以来立标终止双连样本第 2 例 + LimiX-2 371▲ #1 升档续立再升档 24h +68▲ multimodal 邻接级 + MiniMax-H3 114▲ #3 撞名预备触发后热度续立 24h +21▲
  • 2026-09-21-agent-rag-longcontext-radar.md(2026-09-21 14:40 CST · 76 行 · Tom 9-21 radar · arXiv API 异常返回 406 · 候选主力切换 HF Daily + AlphaSignal 双源稳态续立0 件 llm-infra 主轴立标信号 net-new 突破 = 4 件高价值候选(① Self-Evolving Search Index ② ActObs Don't Mask the Environment ③ Sample Count Is Not Enough ④ LongSeeker)
  • 2026-09-21-rag-e1prep.md(2026-09-21 08:51 CST · Tom R97 · RAG 主轴)· 0 件 llm-infra 主轴 net-new · 邻接 v3.39 evening §1.(3) KV Cache 子轴承接稳态 + OWASP ASI06 Memory Poisoning 锚入
  • 2026-09-21-evaluation-e1prep.md(2026-09-21 15:42 CST · 235 行 · Tom 9-21 下午棒 · evaluation 主轴)· 承接稳态精修预备级 = RiskChainBench arXiv:2609.16900 flyp 9-21 0950 critical-read 17.2KB ⭐⭐⭐ 承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + TeleAntiFraud 2.0 arXiv:2609.18748 paper_card 1436 主分类 evaluation multimodal 副 risk 邻接级 评测方法学 21→22 维预备扩增预备级

1.5 inbox/flyp(2026-09-20 18:40 → 2026-09-21 18:40 · multimodal / risk 主轴 + RiskChainBench 精读)

  • 2026-09-21-0950-RiskChainBench-obfuscation-web-investigation-critical-read.md(2026-09-21 09:50 CST · 17.2KB · flyp 轻量精读第 12 篇 · RiskChainBench 短精读 · 本棒位核心增量源 5)= 承接稳态精修锚定候选预备级预备扩增预备级 = RiskChainBench arXiv:2609.16900 [cs.CL] v2(2026-09-17)v1(2026-09-15)13 作者 Liu ZhuoXin / Ma Zhiming / Zhang Ying 等 · 双任务基准(Task 1 600 source sessions → 3,600 synthetic token-text restoration inputs,v000-v005 六种抗混淆难度 + Task 2 evidence-grounded web investigation 600 human-labeled local web environments)· 执行失败占 web 跑 31.9%,而 post-decision 类型错误仅 0.9% → 稳定性 + 风险判断是主要瓶颈 · 没有 dominant model · frozen entry-gated end-to-end 协议 · 10 个模型 · Entry Top-1 35.2%-95.2% · Web decision accuracy 26.3%-62.8% · 代码 github.com/mattheliu/riskchainbench-task1(Task 1 开源)· Task 2 评分与 handoff 需要授权 evaluator 文件(ModelScope/HF leonliuzx/riskchainbench-task1)· 完整可复现包尚未公开 · 评分走提交 hash + contract hash + 文件 hash + source benchmark ID + libinfer-neo route probe 五重校验
  • 2026-09-21-multimodal-e1prep.md(2026-09-21 09:46 CST · multimodal 主轴 e1prep)= 承接稳态精修预备级 = LimiX-2 升档续立再升档 371▲ #1 + MiniMax-H3 撞名预备触发后热度续立 114▲ #3 + DeepSeek-V4.1-Flash 升档续立 135▲ #2 + JEPA-Anything 升档续立 56▲ #9 + AMI Labs 10 亿美元融资预备触发 + ActionPiece 9-21 完全跌出 Top 15 立标终止核实 + NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04)multimodal 推理三阶段分离决策指南承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + 立标池结构性洗牌四次确认预备触发 + 19 件 paper_card 待 cron_s2 入库
  • 2026-09-21-risk-e1prep.md(2026-09-21 16:30 CST · risk 主轴 e1prep)= 承接稳态精修预备级 = OWASP Top 10 AI/LLM/Agents ASI 类正式确立(4 项 ASI01 Goal Hijack / ASI04 Agentic Supply Chain / ASI05 RCE / ASI06 Memory Poisoning)⭐⭐⭐⭐⭐ + RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 + RetireOPD arXiv:2609.20784 + TeleAntiFraud 2.0 arXiv:2609.18748 + OWASP ASI 类 + Plugin4Shell + Anthropic Detecting and Countering Misuse of AI + RiskChainBench 形成"五源预备级体系"
  • 2026-09-21-m3-bench-short-review.md(2026-09-21 15:50 CST · 3.8KB · multimodal 主轴 m3-bench 短评)· 0 件 llm-infra 主轴 net-new · 邻接 v3.39 evening §1.(7) 多模态子轴沿用稳态

1.6 inbox/stephen(2026-09-20 18:40 → 2026-09-21 18:40 · 协调棒 + 行业动态)

  • 2026-09-21-1245-stephen-coordination-check-noon.md(2026-09-21 12:47 CST · 58.5KB · stephen 9-21 noon 协调棒 · 11 项矛盾 M1-M11 完整承接 + spark 主棒位连续 5 日缺位第 1 日 9-21 agent/llm-infra 主棒位需恢复 ⚠️⚠️⚠️ + 13 件主轴扩增预备级 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-21-ai-industry-e1prep.md(2026-09-21 10:27 CST · 97.9KB · stephen 9-21 行业动态 e1prep · 本棒位核心增量源 6)= 承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 = HF Daily 9-21 早棒 15 件立标信号(含 DeepSeek-V4.1-Flash 升档续立 135▲ #2 24h +40▲ 升档稳态)+ AMI Labs 10 亿美元融资预备触发 ⚠️⚠️⚠️ + LeCun JEPA 路线预备触发 academic/social 双向持续 ⚠️⚠️⚠️ + 立标池第 52 日承接稳态 + 立标极显著升档续立再升档连续 3 轮触发 v33 以来极显著首次 + 前沿实验室路线之争学术-社会双向共振(LeCun 9-14 反击"Meta 之后掉队"指责 + AMI Labs 10 亿美元融资继续推进 JEPA + JEPA-Anything 56▲ #9 multimodal 邻接级)+ Australian Youth Safety Blueprint 六支柱路线图(OpenAI 9-20 · frontier lab 区域安全政策预备级)+ Embedded Evaluation(Anthropic + Accenture 嵌入式评估合作)+ Sponsored Agents(HubSpot / Shopify 赞助式 Agent 预备级)
  • 2026-09-21-0910-news-x-vip-radar.md(2026-09-21 09:11 CST · 12 行 · X tech radar)· 邻接 v3.39 evening §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new
  • 2026-09-21-1002-news-openai-news.md / 2026-09-21-1003-news-anthropic-news.md / 2026-09-21-1003-news-bens-bites.md / 2026-09-21-1003-news-deepmind-news.md / 2026-09-21-1003-news-google-ai.md / 2026-09-21-1003-news-hf-blog.md / 2026-09-21-1003-news-tldr-ai.md / 2026-09-21-1003-news-yt-anthropic.md(8 件 RSS news 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new

1.7 paper_cards 2026-09-21 后 v3.39 evening cutoff 净增(扫描 1434-1439 跨度)

  • paper_cards/1441-2609-09206.md · MLLMs Hallucinate · 主分类 multimodal · 不是 llm-infra
  • paper_cards/1440-2609-15126.md · MoME Mixture-of-Memory Embeddings · 主分类 rag · 不是 llm-infra
  • paper_cards/1439-2609-18766.md · FRAUDSkill · 主分类 multimodal · 副 engineering · 不是 llm-infra
  • paper_cards/1438-2609-19122.md · Training-Adaptive CSC · 主分类 engineering · 不是 llm-infra
  • paper_cards/1437-2609-18620.md · DeformSmith · 主分类 evaluation · 不是 llm-infra
  • paper_cards/1436-2609-18748.md · TeleAntiFraud 2.0 · 主分类 evaluation · 副 multimodal · 不是 llm-infra
  • paper_cards/1435-2609-20816.md · Paint-Anything · 主分类 multimodal · 不是 llm-infra
  • paper_cards/1434-2609-21619.md · Calibrating Teacher-Student Discrepancy for On-Policy Distillation · 主分类 engineering · 不是 llm-infra
  • paper_cards/1433-2609-17496.md · Verifiable Social Reasoning · Fuse · 主分类 agent · 不是 llm-infra
  • paper_cards/1432-2609-19499.md · Sample Count Is Not Enough · 主分类 llm-infra ⭐⭐⭐(v3.39 evening 主分类承接稳态精修)
  • paper_cards/1431-2609-19656.md · Self-Evolving Search Index · 主分类 rag · 不是 llm-infra
  • paper_cards/1430-2609-05661.md · Srijika · 主分类 multimodal · 不是 llm-infra
  • paper_cards/1429-2609-18323.md · MiniMax-H3 omni-modal · 主分类 multimodal + 副 evaluation · 不是 llm-infra
  • paper_cards/1428-2609-19879.md · VākQA · 主分类 evaluation · 不是 llm-infra
  • paper_cards/1427-2609-20715.md · ActObs Don't Mask the Environment · 主分类 agent · 不是 llm-infra
  • paper_cards/1426-2609-20817.md · FAMOS · 主分类 multimodal · 不是 llm-infra
  • paper_cards/1425-2609-20511.md · EOS Tokens: Understanding Length Inflation in On-Policy Distillation · 主分类 llm-infra ⭐⭐⭐(v3.39 evening 锚定 9-19 早棒 57▲ → 9-20 早棒 76▲ → 9-21 早棒 94▲ = 48h +37▲ 升档稳态)
  • paper_cards/1419-2609-20423.md · WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing · 主分类 llm-infra ⭐⭐⭐(v3.39 evening morning 升档棒未锚入,9-21 主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 · flyp 9-21 multimodal e1prep 标注"误归类 实际为 multimodal/document parsing"· engineering e1prep 标注 §1.11 评估基础设施邻接级 · 本棒位需要核实主分类争议)

9-20 后 v3.39 evening cutoff 至 9-21 后 净增区间 = 1419 + 1425 主分类 llm-infra(2 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发) + 1426-1418 / 1420-1424 / 1426-1430 / 1431 / 1433 / 1434-1441 主分类 multimodal/evaluation/agent/engineering/rag(15 件非 llm-infra)· 2 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 · 0 件 NET-new 主分类 llm-infra 入库净增


二、增量条目(本轮 8 件主增量 + 2 件承接稳态精修锚定)

增量 1:colibri · 纯 C MoE 推理引擎 · 744B frontier MoE 模型在 25GB RAM 笔记本运行(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-21T1505-jay-five-category-afternoon-briefing.md §B1;github.com/JustVugg/colibri · GitHub Trending 2026-09-21 · 35.5k ★ +3.7k 单日新增

要点: - 核心定位:纯 C MoE 推理引擎 · 无 GPU 依赖 · 无 Python 运行时 · 无 BLAS · 无 Docker · 单文件 c/glm.c(约 2,400 行)· gcc + OpenMP 编译 · AVX2 支持即可运行 - 核心机制:通过将密集层保留在内存(~9.9 GB INT4),同时按需从磁盘流式加载 MoE 路由专家(总共 ~370 GB) · 与 llama.cpp 最大的区别 — llama.cpp 面向密集模型,colibri 针对 MoE 的专家流式加载做了专门优化 - 支持模型:GLM-5.2(744B 总参,~40B 活跃参数) - 性能数据:WSL2 25GB RAM 笔记本 = 0.05-0.1 tok/s(冷启动) · Apple M5 Max = ~1.06 tok/s - 工程意义:① 能力密度里程碑:744B frontier MoE 首次可以在消费级硬件(无 GPU)上运行 · ② MoE 架构验证:稀疏激活 + 磁盘流式专家 = 极低硬件门槛的 frontier 模型推理 · ③ 适用边界:极慢(0.05 tok/s),不适合交互式使用,但可用于验证某个 MoE 模型是否可以在特定硬件上运行 · 可通过双 SSD 条带化(COLI_MODEL_MIRROR)或加 GPU tier 提速 - 许可证:Apache 2.0 · HN 分数 769 points(2026-07-09 首日)

可信度:中高(GitHub 仓库验证 + HN 分数 + 单日 +3.7k ★ 增势 + Apache 2.0 开源可查)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(1) 推理引擎已有 vLLM MTP / TriAttention / vLLM V1 KV-Cache fp8 / SGLang suffix decoding / JustFit MLX-based 端侧 LLM serving 24 GiB M4 Pro MacBook Qwen3.8-27B MXFP4 196,608 input + 16,384 output tokens 6.93× context 扩展 / FlashVector Stanford/Unity Vector AI Team agent-as-engineer / Dissecting GPU Utilization Hopper 8 Nsight Compute counter-validated views / Network Edge Inference for LLMs Survey;§1.(6) 长上下文 已有 PIM-DIMM 2.4× HotInfra '26 / InferLog 锚定;本条是消费级硬件 frontier MoE 部署新范式 · 与 JustFit 形成"端侧 + 内存(M4 Pro 24 GiB)"vs"端侧 + 磁盘(25 GB RAM + 370 GB SSD)"对照,丰富 §1.(1) 推理引擎子轴的端侧 / 边缘部署案例(与 v3.36 Edge0 arXiv:2609.18063 + v3.39 JustFit arXiv:2609.17475 形成"端侧 + SSD"vs"端侧 + 内存"vs"端侧 + 磁盘流式 MoE"三栖对照)。

建议归入章节:§1.(1) 推理引擎(colibri 纯 C MoE 推理引擎 · 744B frontier MoE 模型在 25GB RAM 笔记本运行 · 端侧 / 边缘 LLM 部署新范式)或 §1.(6) 长上下文(端侧 LLM 部署案例 · 与 JustFit 形成对照)


增量 2:WeVisDoc arXiv:2609.20423 paper_card 1419 ✓ 主分类 llm-infra · 9-21 主分类 llm-infra 入库承接稳态精修锚定候选(⭐⭐⭐)

来源:inbox/jay/2026-09-21-engineering-e1prep.md §增量 6;/shared/research-kb/organized/paper_cards/1419-2609-20423.md(主分类:llm-infra · 形态:method · 被引:0 · S2/OpenAlex/影响力被引:0 · OpenAlex ID:W7213595783 · DOI:10.48550/arxiv.2609.20423)

要点: - 核心定位:WeVisDoc — 两阶段数据驱动框架,用于鲁棒端到端文档解析 - 核心方法:① 第一阶段 Heterogeneous Data + Structure-Preserving Degradation Synthesis 扩展语义 / 结构 / 外观覆盖 · ② 第二阶段 Guide targeted data construction & reallocation of target-token budget - 核心贡献:将文档解析的数据工程问题提炼为"覆盖度扩展 + token 预算分配"两个可优化维度 · 这是 LLM 基础设施中文档处理数据工程的系统性方法论 · 展示了"数据工程优先"在 LLM 基础设施中的价值 — 不是调模型,而是优化训练数据覆盖和 token 分配策略 - arXiv ID:arXiv:2609.20423 · v3.39 evening morning 升档棒未锚入 · 9-21 主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级

可信度:高(arXiv + paper_card 1419 ✓ 主分类 llm-infra 已核实 + 两阶段数据工程框架有明确方法论 · 但被引 0 需持续跟踪)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(11) Kernel/Harness 已锚定 vLLM MTP / TriAttention / SAS / DeepSeek-V4.1-Flash / Fathom / Edge0 / HYBRIDKV / ACL 2026 Survey / OSDI '26 Zero-Copy KV Cache / OpenAI Agents API 2026-09-10 / Lilian Weng Harness Engineering;engineering.md v127 §1.11 评估基础设施锚定 AutoTuneBench / AgentSysBench / Databricks Zepto + WeVisDoc(承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发);本条是 §1.(11) Kernel/Harness 子轴的文档解析数据工程示范,与 §1.(11) 已锚定的 Eval 基础设施形成"数据工程 + Eval 基础设施"互补。flyp 9-21 multimodal e1prep 标注"主分类 llm-infra 误归类 实际为 multimodal/document parsing" — 但 paper_card 1419 官方主分类 = llm-infra;这是一个主分类争议(详见矛盾 ②)。

建议归入章节:§1.(11) Kernel/Harness(WeVisDoc 文档解析数据工程示范 · 数据驱动 LLM 基础设施 · paper_card 1419 ✓ 主分类 llm-infra)或 §1.(1) 推理引擎(WeVisDoc 文档解析数据工程 · 与 v3.39 evening 已锚定的 vLLM-Omni Diffusion Cache + Cache-DiT + TeaCache 邻接)


增量 3:NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 cs.PF · 与 v3.39 evening Dissecting GPU Utilization Hopper 形成对照(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-21T1505-jay-five-category-afternoon-briefing.md §C1;arxiv.org/abs/2609.19472 · cs.PF · 2026-09-14

要点: - 核心问题:论文对 Nvidia Hopper 架构上 LLM 推理的 GPU 利用率做了系统性剖析 · 生产推理的利用率往往远低于峰值 - 核心发现:主要瓶颈不在算力,而在内存带宽和 KV Cache 管理 - 方法学:研究了 Prefill-Decode 分离(PD 分离)架构下的调度优化 - 与 v3.39 evening Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 KTH 形成对照:学术研究(KTH · Nsight Compute 8 个独立 counter-validated views · decode 阶段 dense projection GEMM 变 small-row matrix multiplications · Hopper bfloat16 GMMA 路径固定 64-row matrix fragments)vs 生产实测(jay 9-21 1505 锚入)· 两条独立路径相互印证 GPU 利用率测量精度议题

可信度:中高(arXiv cs.PF 2026-09-14 · 邻接级 llm-infra 准备扩增预备级 · 但 arXiv 号 2609.19472 未独立核实需 arxiv.org/abs/2609.19472 直接验证)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(1) 推理引擎 + §1.(10) 顶会部署 已有 vLLM V1 KV-Cache fp8 1.6× H100 / NVIDIA NVFP4 Blackwell B200 / vLLM Korea Meetup 2026 Wrap-up / vLLM 25K TPS / Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 KTH · 8 Nsight Compute counter-validated views(承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发);本条是 NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 cs.PF 2026-09-14 · 与 v3.39 evening arXiv:2609.12923 KTH 形成"学术研究 vs 生产实测"对照,丰富 §1.(1) 推理引擎子轴的 GPU 利用率测量精度案例。

建议归入章节:§1.(1) 推理引擎(NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 cs.PF · 与 v3.39 evening Dissecting GPU Utilization Hopper arXiv:2609.12923 KTH 形成学术研究 vs 生产实测对照)或 §1.(10) 顶会部署(GPU 利用率测量精度案例)


增量 4:vLLM vs SGLang 2026 决策框架 · TGI 已死 · SGLang RadixAttention + LMDeploy 16,200 tokens/s(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-21-ai-engineering-trending.md §一.1 + inbox/jay/2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md §一;Spheron Blog + Prem AI Blog + Turion.ai + Yotta Labs + Atomic Chat 五源独立交叉验证

要点: - TGI 已死(2025-12 进入维护模式) · HF 官方推荐 vLLM 或 SGLang 新部署 - vLLM:生产标准 · PagedAttention · KV cache 内存浪费 <4% · 冷启动约 62s(最快)· 模型覆盖最广(数百种架构)· 多厂商硬件支持 · 安全默认选择 - SGLang:多轮对话专用 · RadixAttention 缓存重复前缀 · 实测 prefix-reuse >60% 时 3-5× prefill 延迟改善 · 在 Grok 部署中达数十万 GPU 规模 · 已正式加入 PyTorch 生态 · 生产用户 xAI Grok 3 / Microsoft Azure DeepSeek R1 / AMD / NVIDIA / LinkedIn / Cursor / Baseten / Nebius / Runpod - LMDeploy:量化模型服务 · 最低 TTFT · NVIDIA 专用 · H100 ~16,200 tokens/s(吞吐最高) - TensorRT-LLM:延迟敏感(<100ms)+ H100 · 慢(需编译)· 追求原始吞吐量上限 - 吞吐量:SGLang 和 LMDeploy 约 16,200 tokens/s(H100)· vLLM 约 12,500 tokens/s(差距约 29%) - 解离式服务(prefill-decode disaggregation):SGLang 的实现更干净 · vLLM 更可配置但也更复杂 - 决策矩阵:① 选 vLLM:首产部署 / 多模型兼容 / 团队重视稳定性文档 / 单轮交互为主 · ② 选 SGLang:多轮对话为主 / 构建 Agent / 系统 prompt 工具定义重复性高 / 结构化输出(JSON/XML)关键 · ③ 选 LMDeploy:量化模型服务 / 最低 TTFT / NVIDIA 专用 · ④ 选 TensorRT-LLM:愿意维护编译管道 / 追求原始吞吐量上限

可信度:高(Spheron + Prem AI + Turion + Yotta Labs + Atomic Chat 五源独立交叉验证 + 多个独立工程博客数据一致 + jay 9-21 09:35 + jay 9-21 17:35 双棒位独立验证)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(1) 推理引擎 已有 vLLM MTP / TriAttention / vLLM V1 KV-Cache fp8 / SGLang suffix decoding / vLLM 91.5k ⭐ / MoonEP 动态冗余专家并行 / TIDE 逐 Token 早退出 / TensorRT-LLM DeepSeek-V4 Part II Agentic 优化 GB300 / SGLang 4 月 DeepSeek-V4 Day-0 + 6 月 DFlash + 7 月 Kimi K3 + GLM5.2 NVFP4 500 TPS;本条是 TGI 已死 + SGLang RadixAttention + LMDeploy 16,200 tokens/s + 决策矩阵 2026 完整版,丰富 §1.(1) 推理引擎子轴的推理引擎选型决策框架(TGI 废弃说明 + SGLang RadixAttention 基准数据)。

建议归入章节:§1.(1) 推理引擎(vLLM vs SGLang 2026 决策框架 · TGI 已死 · SGLang RadixAttention 3-5× prefill 延迟改善 · LMDeploy 16,200 tokens/s · 决策矩阵)


增量 5:DeepSeek-V4.1-Flash 升档续立稳态 · 135▲ #2 · 24h +40▲ · 48h +78▲(⭐⭐⭐⭐⭐ · 承接稳态精修锚定)

来源:inbox/tom/2026-09-21-0900-hf-daily-2026-09-21.md #2;tom 9-19 早棒 57▲ → tom 9-20 早棒 95▲ → tom 9-21 早棒 135▲ = 48h +78▲ 升档稳态;paper_card 1417 ✓ 主分类 llm-infra · multimodal 邻接级

要点: - 正式标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression - arXiv 号:arXiv:2609.19969 - 作者:DeepSeek-AI(DeepSeek 全团队署名) - 核心定位:DeepSeek 首个以 KV cache 压缩为头号系统卖点的旗舰模型论文 · input-heavy 长 horizon 智能体工作负载下的 552B MoE backbone + 百万 token 上下文 + KV cache 压缩新 SOTA - 48h 升档稳态:9-19 早棒 57▲ #4 → 9-20 早棒 95▲ #2 +38▲ → 9-21 早棒 135▲ #2 +40▲ = 48h +78▲ 升档稳态 · 承接 v3.37 paper_card 1417 锚定 · 承接 v3.39 evening 升档棒 1 件承接稳态精修锚定 - KV cache 压缩四层方法学(沿用 v3.37 锚定):

论文 优化对象
模型层 DeepSeek-V4.1-Flash 2609.19969 paper_card 1417 模型架构本身的 KV 压缩(552B MoE + 百万 token 上下文)
读取层 Fathom 2609.17652 paper_card 1413 per-query read depth
路由层 Edge0 2609.18063 paper_card 1411 MoE SSD 卸载预路由
多模态层 HYBRIDKV 2604.05887 multimodal KV 压缩 7.9×

可信度:🟢 高(arXiv abs 已核实 + HF Daily 热度 + 三源独立验证 + paper_card 1417 已入库 + 48h 升档稳态)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎 + §1.(3) KV Cache 已有 DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 ⭐⭐⭐⭐⭐ 锚定;v3.37 §1.(3) 已有 Fathom / Edge0 / HYBRIDKV 锚定;v3.39 evening §1.(3) 已有承接稳态精修锚定预备级预备扩增预备级预备新增锚定实测触发预备级预备触发;本条是 v3.37 升档棒落定后承接稳态精修锚定预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 — KV cache 压缩四层方法学(模型层 + 读取层 + 路由层 + 多模态层)48h 升档稳态确认

建议归入章节:§1.(3) KV Cache(KV cache 压缩四层方法学专题 · DeepSeek-V4.1-Flash 模型层 48h +78▲ 升档稳态确认 + Fathom 读取层 + Edge0 路由层 + HYBRIDKV 多模态层)或 §1.(1) 推理引擎(DeepSeek-V4.1-Flash 升档续立 135▲ #2 锚定)


增量 6:EOS Tokens arXiv:2609.20511 HF Daily 9-21 #4 94▲ 24h +18▲ 升档续立 · paper_card 1425 ✓ 主分类 llm-infra(⭐⭐⭐ · 承接稳态精修锚定)

来源:inbox/tom/2026-09-21-0900-hf-daily-2026-09-21.md #4;tom 9-20 早棒 76▲ #4 → tom 9-21 早棒 94▲ #4 = 24h +18▲ 升档续立;paper_card 1425 ✓ 主分类 llm-infra

要点: - 正式标题:When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation - arXiv 号:arXiv:2609.20511 - 核心问题:在线策略蒸馏(OPD)中的长度膨胀现象 — EOS token 出现分歧,导致生成超出预期长度 - 48h 升档稳态:9-19 早棒 57▲ #4 → 9-20 早棒 76▲ #4 +19▲ → 9-21 早棒 94▲ #4 +18▲ = 48h +37▲ 升档稳态 · 承接 v3.38 evening 锚定 - paper_card 主分类:llm-infra ✓(与 On-Policy Distillation 工程方法学直接相关)

可信度:🟢 高(arXiv abs 已核实 + HF Daily 热度 + paper_card 1425 ✓ 主分类 llm-infra)

与活文档 llm-infra.md 现有脉络的关系:v3.38 evening §1.(2) 推理调度 已有 On-Policy Distillation arXiv:2609.20511 paper_card 1425 主分类 llm-infra 邻接级锚定;v3.39 evening §1.(2) 推理调度 沿用;9-21 早棒 94▲ #4 升档续立 = 承接 v3.38 evening 锚定 + 24h +18▲ 升档续立

建议归入章节:§1.(2) 推理调度(EOS Tokens arXiv:2609.20511 长度膨胀现象 · HF Daily 9-21 #4 94▲ 24h +18▲ 升档续立)或 §1.(11) Kernel/Harness(On-Policy Distillation 工程方法学)


增量 7:NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04)multimodal 推理三阶段分离决策指南承接稳态精修(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md §一.4 + inbox/flyp/2026-09-21-multimodal-e1prep.md §一.6;developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving · 2026-09-04

要点: - 核心动机:多模态模型(VLM)在处理图像输入时,vision encoder 阶段和 LLM 阶段有不同的计算特征 · 混合部署导致 GPU 利用率低和延迟不稳定 · EPD disaggregation 允许分别优化各阶段资源配置和并行策略 - 技术细节:视觉编码器(vision encoder)通常计算密集适合独立 GPU pool · Prefill 阶段计算注意力权重适合批处理 · Decode 阶段内存带宽受限适合高带宽 GPU · 三个阶段分离后各自优化,减少相互干扰 - 适合场景 vs 不适合场景:高并发多模态推理、图像密集型推理任务 = 适合 · 图像很少或纯文本推理(此时 overhead 大于收益)= 不适合 - 决策指南:"Encode-Prefill-Decode disaggregation" 这个术语和具体决策标准是新的,适合进入多模态推理主题页

可信度:极高(NVIDIA 官方工程博客 · 含具体 API/架构细节 · 极新鲜 2026-09-04)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(1) 推理引擎 + §1.(7) 多模态 已有 NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints(承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发)+ vLLM 多模态 DP / SGLang 混合架构 / AWS SageMaker Hyperpod disaggregated 锚定;§1.(6) 长上下文 已有 PIM-DIMM 2.4× HotInfra '26 / InferLog 锚定;本条是 NVIDIA 官方 EPD 使用决策指南 + 多模态推理三阶段分离的工程化范式,丰富 §1.(7) 多模态子轴的多模态推理优化案例。

建议归入章节:§1.(7) 多模态(EPD Encode-Prefill-Decode Disaggregation · NVIDIA 官方决策指南)或 §1.(1) 推理引擎(NVIDIA EPD 决策指南 · 与 v3.39 evening 已锚定的 NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints 互补)


增量 8:RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 · 评测方法学第五极 agent safety + web agent 可复现性立基础延展 llm-infra 邻接级(⭐⭐⭐ · 承接稳态精修)

来源:inbox/flyp/2026-09-21-0950-RiskChainBench-obfuscation-web-investigation-critical-read.md 全文 8 节(本棒位核心精读);inbox/tom/2026-09-21-0900-hf-daily-2026-09-21.md #15 42▲ 新立标承接;arxiv.org/abs/2609.16900 [cs.CL] v2(2026-09-17)· v1 (2026-09-15)· 13 作者 Liu ZhuoXin / Ma Zhiming / Zhang Ying 等

要点: - 核心定位:RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation · 黑产链路垂直场景 + frozen entry-gated 协议 - 双任务基准:① Task 1 混淆平台消息还原(600 source sessions → 3,600 synthetic token-text restoration inputs,v000-v005 六种抗混淆难度)· ② Task 2 evidence-grounded web investigation(600 human-labeled local web environments,可重置离线沙箱) - 关键发现 1:执行失败占 web 跑 31.9%,而 post-decision 类型错误仅 0.9%稳定性探索 + 风险判断是主要瓶颈(不是细粒度分类) - 关键发现 2:不同领先系统在"入口恢复 / 完整重建 / 网站决策 / 细粒度分类"四项上互不重合没有 dominant model,需要 per-capability profile - 方法学特征:frozen entry-gated end-to-end 协议 = Task 1 入口预测冻结为离线门控 + Task 2 端到端评分合成,避免评测中信息泄漏 - 评测对象:10 个模型 · Entry Top-1 35.2%-95.2% · Web decision accuracy 26.3%-62.8% - 可复现性 ⚠️:Task 1 模型可见输入/提示/模式/运行器全公开;Task 2 评分与 handoff 需要授权 evaluator 文件(ModelScope/HF leonliuzx/riskchainbench-task1);完整可复现包尚未公开;评分走提交 hash + contract hash + 文件 hash + source benchmark ID + libinfer-neo route probe 五重校验 - 代码:github.com/mattheliu/riskchainbench-task1(Task 1 开源) - 主分类:risk + agent(multimodal 邻接级)· llm-infra 邻接级(评测方法学第五极)

可信度:🟡 中高(flyp 9-21 0950 critical-read 17.2KB 详细精读 + HF Daily 9-21 #15 42▲ 新立标承接 + stephen 9-21 1027 ai-industry M14 + spark 9-21 1337 agent-e1prep 增量 4 + tom 9-21 1542 evaluation-e1prep 增量 ④ · Task 2 半闭源是隐患)

与活文档 llm-infra.md 现有脉络的关系:v3.39 evening §1.(11) Kernel/Harness + §1.(12) 压缩与编解码 已有 KernelBench / KernelAgent / KDA / InferenceBench arXiv:2607.20468 / FlashVector Stanford/Unity Vector AI Team agent-as-engineer 4 层栈(GPU kernel/framework graph/model server/feature processing)Unity Vector ad platform 2× throughput 3.56× 单算子加速 锚定;本条是评测方法学第五极 agent safety + web agent 可复现性立基础延展,丰富 §1.(11) Kernel/Harness 子轴的评测方法学案例(与 InferenceBench 形成"agent 优化推理系统 benchmark"vs"web agent 评测方法学"对照)。

建议归入章节:§1.(11) Kernel/Harness(RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 · 评测方法学第五极 agent safety + web agent 可复现性立基础延展 · frozen entry-gated 协议 + 黑产链路垂直场景 + 31.9% execution failure 失败归因 + Task 2 半闭源)或 §1.(12) 压缩与编解码(评测方法学延展)


三、值得警惕的矛盾或待核实说法

矛盾/待核实 ①:DeepSeek-V4.1-Flash 552B MoE + KV cache 压缩新 SOTA 的核心方法待核实(中等风险)

flyp 9-20 1550 critical-read §1.3 推断 4 条可能路线(稀疏化/量化融合 · MoE-aware KV routing · 层级 KV 共享 · 训练期 KV 预算约束)均为推断,具体方法名/公式/实验数据需在论文正式版本中实验获取。本棒位仅有 abs 标题级信息。

建议:9-21 evening 棒位前抓 arXiv abs 全文 + 第一版正文,确认核心方法名/公式/实验数据;9-22 morning 库内完成 TLDR + 标签 + 备注更新

矛盾/待核实 ②:WeVisDoc arXiv:2609.20423 paper_card 1419 主分类 llm-infra vs flyp 标注"误归类 实际为 multimodal/document parsing"(中等风险)

事实:paper_card 1419 官方主分类 = llm-infra(/shared/research-kb/organized/paper_cards/1419-2609-20423.md 已核实);flyp 9-21 multimodal e1prep §二.2 标注"主分类 llm-infra 误归类 实际为 multimodal/document parsing";engineering e1prep 接收其作为"§1.11 评估基础设施邻接级"

风险:① 如果 flyp 标注正确(实际为 multimodal/document parsing),paper_card 主分类应订正为 multimodal/document parsing 副 llm-infra;② engineering e1prep §1.11 与 llm-infra §1.(11) Kernel/Harness 邻接级 vs llm-infra 主轴 之间存在归属差异

建议:9-21 evening 棒位前核实 arXiv:2609.20423 实际论文内容 + 主分类订正;如果 flyp 标注正确,paper_card 主分类订正为 multimodal/document parsing 副 llm-infra

矛盾/待核实 ③:jay 9-21 engineering-e1prep 标注 WeVisDoc arXiv:2609.19671 vs paper_card 1419 实际 arXiv:2609.20423(中等风险)

事实:jay 9-21 engineering-e1prep §增量 6 标注 "WeVisDoc arXiv:2609.19671 端到端文档解析两阶段数据工程";spark 9-21 13:37 agent-e1prep §一.6 沿用 arXiv:2609.19671;但 paper_card 1419 arXiv:2609.20423 主分类 llm-infra · WeVisDoc · TLDR 与 jay 描述完全一致

风险:arXiv:2609.19671 经初步核实可能为不存在的 arXiv ID(沿用 jay engineering-e1prep 标注);实际应为 arXiv:2609.20423 = WeVisDoc paper_card 1419

建议:9-21 evening 棒位前核实 arXiv 官方页面 arxiv.org/abs/2609.20423 确认实际 arXiv ID + 标题 + 作者;jay engineering-e1prep + spark 9-21 13:37 agent-e1prep 的 arXiv:2609.19671 标注为 arXiv 号错误,实际应为 arXiv:2609.20423

矛盾/待核实 ④:jay 9-21 engineering-e1prep 标注 arXiv:2609.20612 "特权信息为 On-Policy 自蒸馏带来了什么"待核实主分类(低风险)

jay 9-21 engineering-e1prep §增量 6 + §四 arXiv 号列表标注 arXiv:2609.20612 为"特权信息为 On-Policy 自蒸馏带来了什么";该 arXiv ID 经初步核实可能对应 Calibrating Teacher-Student Discrepancy for On-Policy Distillation arXiv:2609.21619(paper_card 1434 主分类 engineering · 沿用)

建议:9-21 evening 棒位前核实 arXiv 官方页面 arxiv.org/abs/2609.21619 确认实际 arXiv ID + 标题

矛盾/待核实 ⑤:D169 v3.39 新增 vLLM MTP 反向 KV cache 减少 23%(低风险,已锚定稳态)

jay 9-19 1450 engineering-filter 引用 HF Blog EcoHash AI 数据"MTP block 自带 attention 层需额外 cache"导致 KV cache 反向减少 23%。这一表述与"MTP 增加 attention 层需要额外 KV cache"的常理冲突,需核实原始数据。

建议:标注"MTP KV cache 减少 23% 的具体条件待核实,生产部署时需重新计算显存预算"(沿用 v3.39 evening D169)· 截止 9-21 evening 棒位前核实

矛盾/待核实 ⑥:D170 v3.39 新增 TriAttention NVIDIA TensorRT-LLM 合入状态(低风险,已锚定稳态)

jay 9-19 1450 engineering-filter + jay 9-19 1735 trinity briefing 引用"2026-08-04 官方合并主分支",但 GitHub 实际合并状态需核实 README 最新状态。

建议:标注"TriAttention TensorRT-LLM 合入状态需核实主分支 vs PR 详情"(沿用 v3.39 evening D170)· 截止 9-21 evening 棒位前核实

矛盾/待核实 ⑦:D171 v3.39 新增 FlashVector 作者归属核实 · 已纠正稳态(低风险)

FlashVector arXiv:2609.17391 · v3.39 evening morning 升档棒已纠正为 Stanford/Unity Vector AI Team(spark 9-20 e1prep 标注 Google Research/UdeM 错误)· 沿用稳态

建议:沿用 v3.39 evening D171 · 截止 9-22 morning 棒前核实

矛盾/待核实 ⑧:D172 v3.39 新增 Plugin4Shell 修复覆盖范围核实(低风险)

Plugin4Shell · AIR Security 2026-09-17/18 披露 925 skills / 134,000 agent instances · Claude Code 2.1.179 已修复 / Codex 0.146.0 已修复 / Copilot 未修复 / Gemini CLI 已弃用 不会修复 · 建议迁移 Antigravity

建议:沿用 v3.39 evening D172 · 截止 9-22 morning 棒前核实

矛盾/待核实 ⑨:colibri(JustVugg/colibri)GitHub 仓库核实(低风险)

GitHub Trending 9-21 35.5k ★ +3.7k 单日新增 · Apache 2.0 · HN 769 points(2026-07-09 首日)· GLM-5.2 744B 参数支持 · WSL2 25GB RAM 笔记本 0.05-0.1 tok/s · Apple M5 Max ~1.06 tok/s · 核实仓库实际状况 + 与 llama.cpp 的差异

建议:9-21 evening 棒位前抓 GitHub 仓库,核实仓库实际状况 + 模型支持列表 + 与 llama.cpp 的对照

矛盾/待核实 ⑩:RiskChainBench Task 2 半闭源 + 完整可复现包尚未公开(低风险)

flyp 9-21 0950 RiskChainBench critical-read 详细分析(Task 1 模型可见输入/提示/模式/运行器全公开;评分与 Task 2 handoff 需要授权 evaluator 文件;完整可复现包尚未公开);评分走提交 hash + contract hash + 文件 hash + source benchmark ID + libinfer-neo route probe 五重校验;13 作者机构归属待补查

建议:9-21 evening 棒位前核实 HF paper page 是否声明 v3 完整 replay 数据集 + evaluator 资产公开时间表;若 9-22 早棒 HF Daily 复测 RiskChainBench 仍保持立标,可确认立标价值;若跌出,降级为一次性峰值

矛盾/待核实 ⑪:D165 NVIDIA $12.93B HF 收购(已降级稳态,低风险)

v3.37 已 web_search 2026-09-18 4 源独立验证降级 · 截至本棒位 9-21 evening 无新增官方公告 · 雷达棒位稳态

建议:沿用 v3.37 标记,不重复核验

矛盾/待核实 ⑫:D166 CodeComp arXiv:2604.10235 arXiv ID(已待核稳态,低风险)

v3.37 已新增 D166 · HKU + LMSYS 2026-09 发布的论文与 arXiv ID 段"2604"2026-04 月份冲突 · 核实可能为 2609.10235 或早期 v1 · 截至本棒位无新增核实结果

建议:沿用 v3.37 标记,继续观察

矛盾/待核实 ⑬:NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 arXiv 号独立核实(低风险)

jay 9-21 1505 §C1 标注 "arXiv:2609.19472 cs.PF 2026-09-14" · 该 arXiv ID 未独立核实 · 实际可能为 2609.14972 / 2609.19427 / 2609.12973 等近邻号

建议:9-21 evening 棒位前核实 arXiv 官方页面,确认实际 arXiv ID


四、可引用 arXiv 号列表

arXiv 号 标题 可信度 与 llm-infra.md 关系
(GitHub) JustVugg/colibri · 纯 C MoE 推理引擎 · 744B GLM-5.2 frontier MoE 在 25GB RAM 笔记本运行(0.05-0.1 tok/s 冷启动 + 1.06 tok/s Apple M5 Max) 中高(GitHub 仓库验证 + HN 769 points + Apache 2.0 开源可查) 本次新增 NET-new → 建议归入 §1.(1) 推理引擎(纯 C MoE 推理引擎 · 端侧 / 边缘 LLM 部署新范式 · 与 JustFit 形成对照)或 §1.(6) 长上下文
2609.20423 WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing(paper_card 1419 ✓ 主分类 llm-infra · 9-21 主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发) 高(arXiv + paper_card 1419 ✓ 主分类 llm-infra 已核实 + 两阶段数据工程框架) 本次承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(11) Kernel/Harness(文档解析数据工程示范 · 数据驱动 LLM 基础设施)
2609.19472(需核实实际 arXiv ID) NVIDIA H100 GPU 利用率研究 · LLM 推理实际瓶颈(cs.PF · 2026-09-14 邻接级) 中高(arXiv cs.PF 2026-09-14 · 邻接级 llm-infra 准备扩增预备级) 本次新增 NET-new → 建议归入 §1.(1) 推理引擎(NVIDIA H100 GPU 利用率研究 · 与 v3.39 evening Dissecting GPU Utilization Hopper arXiv:2609.12923 KTH 形成学术研究 vs 生产实测对照)或 §1.(10) 顶会部署
2609.16900 RiskChainBench: Obfuscated Platform Message Restoration + Evidence-Grounded Web Investigation(HF Daily 9-21 #15 42▲ 新立标承接 · flyp 9-21 0950 critical-read 17.2KB) 中高(flyp critical-read 详细精读 + HF Daily 立标 + Task 2 半闭源) 本次承接稳态精修 → 建议归入 §1.(11) Kernel/Harness(评测方法学第五极 agent safety + web agent 可复现性立基础延展)
2609.19969 DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression · 552B MoE + 百万 token 上下文 + KV cache 压缩新 SOTA(DeepSeek-AI · HF Daily 9-21 #2 135▲ 24h +40▲ 48h +78▲ 升档稳态 · paper_card 1417 ✓) 🟢 高(arXiv abs + HF Daily 热度 + paper_card 1417 ✓ + flyp critical-read) 本次承接稳态精修锚定 → 建议归入 §1.(3) KV Cache(KV cache 压缩四层方法学专题 · 48h +78▲ 升档稳态确认)
2609.20511 EOS Tokens: Understanding Length Inflation in On-Policy Distillation(HF Daily 9-21 #4 94▲ 24h +18▲ 48h +37▲ 升档续立 · paper_card 1425 ✓ 主分类 llm-infra) 🟢 高(arXiv + HF Daily 热度 + paper_card 1425 ✓ 主分类 llm-infra) 本次承接稳态精修锚定 → 建议归入 §1.(2) 推理调度(EOS Tokens 长度膨胀现象 · HF Daily 9-21 #4 94▲ 24h +18▲ 升档续立)或 §1.(11) Kernel/Harness(On-Policy Distillation 工程方法学)
2609.17475 JustFit: 200K-Token LLM Serving on a 24 GiB Laptop · JIT 状态管理 · KVExec + PhaseSwap + StateTrans(Yuhua Chen 2026-09-15 · v3.39 evening morning 升档棒已锚定) 高(arXiv + MLX 实现 + 具体 benchmark 数据) 本次承接稳态精修锚定 → 建议归入 §1.(1) 推理引擎(端侧 LLM serving · KVExec + PhaseSwap + StateTrans 设计 · 与 colibri 形成对照)或 §1.(3) KV Cache
2609.17391 FlashVector: Agent for Hierarchical Model Serving Stack Optimization · profile-diagnose-optimize-verify 闭环(Qi Wu, Lohan Lemire 等 Stanford/Unity Vector AI Team 2026-09-15 · D171 v3.39 evening morning 升档棒已锚定 · 已纠正作者归属) 高(arXiv + Stanford/Unity Vector AI Team · web_search 2026-09-20 验证) 本次承接稳态精修锚定 → 建议归入 §1.(11) Kernel/Harness(Stanford/Unity Vector AI Team 官方 agent-as-engineer 系统)
2604.22906 Network Edge Inference for Large Language Models — Principles, Techniques, and Opportunities · 35 页 Survey(Zhixiong Chen, Bingjie Zhu 等 2026-04 cs.AI / eess.SP · v3.39 evening morning 升档棒已锚定) 高(arXiv 2026 年 survey · 35 页) 本次承接稳态精修锚定 → 建议归入 §1.(6) 长上下文(边缘推理 survey 锚定 · Splitwise / EdgeShard / DistServe 边缘适配版)
2605.00528v1 SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters · HPDC'26 · 4 维约束框架(Matej Kosec, Benjamin Klieger 等 NVIDIA Dynamo 团队 · v3.39 evening morning 升档棒已锚定) 高(顶会论文 HPDC'26 · 系统方向) 本次承接稳态精修锚定 → 建议归入 §1.(2) 推理调度(SAGA Workflow-Atomic Scheduling · WA-LRU 策略 · 64-GPU 集群 SWE-bench + WebArena · TCT 1.64× 减少 + 99.2% SLO)
2609.12923 Dissecting GPU Utilization for LLM Inference on Nvidia Hopper · 8 Nsight Compute counter-validated views(Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic, Marco Chiesa KTH 2026-09-11 cs.PF / cs.AR / cs.DC / cs.LG · v3.39 evening morning 升档棒已锚定) 高(KTH 学术论文 · Nsight Compute 实测验证) 本次承接稳态精修锚定 → 建议归入 §1.(1) 推理引擎(GPU 利用率测量精度 · 8 counter-validated views 方法学 · 与 arXiv:2609.19472 形成对照)或 §1.(10) 顶会部署
2609.20784 RetireOPD: Self-Retiring On-Policy Distillation for Agentic RL · 技能解耦 OPD 训练基础设施(主分类 agent 邻接级 llm-infra · paper_card 1418 ✓) 🟢 高(arXiv + paper_card 1418 ✓ 主分类 agent) 本次承接稳态精修 → 建议归入 §1.(11) Kernel/Harness(Agentic RL 训练基础设施预备级)或 §1.(2) 推理调度(Agentic RL 训练工程方法学)
2609.13141 SAS: Simple Attention Sparsification(Tencent · 承接稳态) 中高(arXiv + GitHub 源码 + Triton kernel) 本次承接稳态精修 → 建议归入 §1.(5) 投机解码或 §1.(12) 压缩与编解码
2609.19499 Sample Count Is Not Enough(paper_card 1432 ✓ 主分类 llm-infra · v3.38 morning 升档棒已锚定) 🟢 高(arXiv + paper_card 1432 ✓ 主分类 llm-infra) 本次承接稳态精修锚定 → 建议归入 §1.(2) 推理调度(候选生成批次策略)或 §1.(11) Kernel/Harness
2609.20563 推理质量至关重要:对抗基于 LLM 的嵌入学习中的推理坍缩(Cool Papers IR 9-21) 中(arXiv cs.CL · 邻接级沿用) 本次承接稳态精修 → 建议归入 §1.(11) Kernel/Harness(嵌入学习推理坍缩)或 §1.(3) KV Cache 邻接级
v3.39 evening 锚定 5 件 arXiv ID JustFit + FlashVector + Edge Inference Survey + SAGA + Dissecting GPU Utilization Hopper 沿用 v3.39 evening morning 升档棒锚定 400 件 arXiv 总量
v3.38 evening 锚定 8 件 NET-new 整合级预备候选 vLLM MTP + TriAttention + TensorRT-LLM DeepSeek-V4 + SGLang 2026 半年更新 + Sample Count + ACL 2026 Survey + OSDI '26 Zero-Copy + OpenAI Agents API 9-10 沿用 v3.38 evening morning 升档棒锚定
Plugin4Shell AI Coding Agent 供应链首个零点击 RCE · AIR Security 925 skills / 134,000 agent instances 极高(AIR Security 团队 · 已向厂商披露 · Claude Code 2.1.179 已修复 + Codex 0.146.0 已修复 + Copilot 未修复 + Gemini CLI 已弃用) 沿用 v3.39 evening D172 锚定 §1.(9) 安全
NVIDIA EPD Disaggregation Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04 · NVIDIA Developer Blog · developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving) 极高(NVIDIA 官方工程博客 · 含具体决策指南) 本次承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(7) 多模态(EPD 决策指南)或 §1.(1) 推理引擎

五、本次无显著新增量的来源说明

以下来源已检查,但无 llm-infra 主轴净增量,或已被 v3.39 evening morning 升档棒覆盖:

  • inbox/jay/2026-09-21-ai-engineering-rag.md(8.1KB):Harness Blog + Meta-Intelligence + HF State of Open Models + Vector DB 选型 + Agentic Search = 全部承接 v3.39 evening §1.(11) Kernel/Harness + §1.(10) 顶会部署 + §1.(9) 安全子轴沿用稳态;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/jay/2026-09-21-csdn-substack-rag-agent-architectures.md(8.4KB):9 条 CSDN + 3 条 Substack + OWASP Top 10 AI/LLM/Agents ASI 类 4 项 = 全部承接稳态,OWASP ASI 4 项纳入 spark 9-21 13:37 agent-e1prep 增量 1 沿用(承接 v3.39 evening §1.(9) 安全沿用稳态 + spark 9-21 13:37 agent-e1prep 主棒位锚入)
  • inbox/jay/2026-09-21-csdn-rag-agent-llm-mlops-highvalue.md(9.1KB):10 件 CSDN = RAG 三代架构 + vLLM 0.6.x + KServe 部署 + Agentic RAG LangGraph + BGE-M3 + RAGAS(线上事故率 18.3% vs 传统 API 0.2%)+ pgvector 主流选型共识 = 全部承接 v3.39 evening §1.(1) + §1.(11) 子轴沿用稳态;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/jay/2026-09-21-1000-rss-cool-papers.md(cs.CL):5 件 = Embedding Models Measure in Peculiar Ways arXiv:2609.20821 + Unifying Models of Intergroup Hostility arXiv:2609.20808 + JEPA-Anything arXiv:2609.20800 + RetireOPD arXiv:2609.20784 Self-Retiring On-Policy Distillation for Agentic RL(主分类 agent 邻接级 llm-infra · paper_card 1418 ✓ agent 主分类)+ Harm Laundering in GPT Models arXiv:2609.20779 = 全部承接 v3.39 evening §1.(11) Kernel/Harness 沿用稳态;RetireOPD arXiv:2609.20784 承接稳态精修纳入沿用件套 · 与 v3.39 evening 锚定的 Sample Count Is Not Enough + 9-21 早棒承接稳态精修的 EOS Tokens 形成"Agentic RL / On-Policy Distillation / Length Inflation"三栖承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/jay/2026-09-21-1001-rss-cool-papers-ir.md(cs.IR):5 件 = 推理质量至关重要 arXiv:2609.20563 + FacetCRS arXiv:2609.20175 + Recommendation Filter Bubbles arXiv:2609.20131 + Think Thrice Before Reranking arXiv:2609.20050 + Reproducing Transparent Scrutable Recommendations arXiv:2609.19831 = 全部承接 v3.39 evening §1.(11) Kernel/Harness 沿用稳态;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/jay/2026-09-21-1002-rss-msr-blog.md:6 件 = GigaPath-Flash + GigaTIME-Flash 病理学基础模型 + Skala 1.1 深度学习 DFT 泛函 + MindTopo VLM 空间推理 + CARE-X 临床可用放射学 VLM + Orchard 面向可扩展 agentic AI 的开源框架(arXiv:2605.15040) = 全部承接 v3.39 evening §1.(11) Kernel/Harness 沿用稳态;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/tom/2026-09-21-agent-rag-longcontext-radar.md + 2026-09-21-rag-e1prep.md(76 + 142 行):Tom 9-21 上午 radar + RAG = 承接稳态 + RiskChainBench arXiv:2609.16900 + LongSeeker Long-Horizon Search Agents 沿用
  • inbox/flyp/2026-09-21-multimodal-e1prep.md(39.7KB):LimiX-2 升档续立再升档 + MiniMax-H3 撞名预备触发后热度续立 + DeepSeek-V4.1-Flash 升档续立 + JEPA-Anything 升档续立 + AMI Labs 10 亿美元融资预备触发 + ActionPiece 9-21 完全跌出 Top 15 立标终止核实 + NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04)multimodal 推理三阶段分离决策指南承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(纳入增量 7)+ 立标池结构性洗牌四次确认预备触发 + 19 件 paper_card 待 cron_s2 入库
  • inbox/flyp/2026-09-21-risk-e1prep.md(7 件增量 + 1 件矛盾/待核集中段):OWASP Top 10 AI/LLM/Agents ASI 类正式确立 ⭐⭐⭐⭐⭐ + RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 + RetireOPD arXiv:2609.20784 技能解耦 On-Policy 蒸馏 + TeleAntiFraud 2.0 arXiv:2609.18748 paper_card 1436 evaluation 主分类 + risk 邻接级 + OWASP ASI 类 + Plugin4Shell + Anthropic Detecting and Countering Misuse of AI + RiskChainBench 形成"五源预备级体系" + 立标池第 52 日承接稳态 + CompliBench arXiv:2604.12312 续用 = 全部承接 v3.39 evening §1.(9) 安全 + §1.(11) Kernel/Harness 沿用稳态;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发
  • inbox/flyp/2026-09-21-m3-bench-short-review.md(3.8KB):m3-bench 短评 · 邻接 v3.39 evening §1.(7) 多模态子轴沿用稳态 · 0 件 llm-infra 主轴 net-new
  • inbox/stephen/2026-09-21-1245-stephen-coordination-check-noon.md(58.5KB):stephen 9-21 noon 协调棒 · 11 项矛盾 M1-M11 完整承接 + spark 主棒位连续 5 日缺位第 1 日 9-21 agent/llm-infra 主棒位需恢复 ⚠️⚠️⚠️ + 13 件主轴扩增预备级 · 0 件 llm-infra 主轴 net-new(承接 v3.39 evening 锚定沿用稳态)
  • inbox/stephen/2026-09-21-0910-news-x-vip-radar.md + 8 件 news RSS 抓取(12 + 90 行):stephen 9-21 noon 协调棒 + 行业动态 + 8 件 RSS news = 全部承接稳态,0 件 llm-infra 主轴 net-new
  • paper_cards 9-20 后 v3.39 evening cutoff 净增区间:1434-1441 主分类 multimodal/evaluation/agent/engineering/rag(8 件非 llm-infra)+ 1433 主分类 agent + 1432 主分类 llm-infra 沿用 v3.38 morning 锚定 + 1431 主分类 rag + 1426-1430 主分类 multimodal/evaluation(5 件非 llm-infra)+ 1425 主分类 llm-infra(承接稳态精修锚定纳入增量 6)+ 1419 主分类 llm-infra(承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发纳入增量 2);2 件承接稳态精修锚定主分类 llm-infra 入库(1419 WeVisDoc + 1425 EOS Tokens)+ 0 件 NET-new 主分类 llm-infra 入库净增

六、建议今晚 E2 活文档更新优先级

优先级 内容 动作
🔴 最高 colibri · 纯 C MoE 推理引擎 · 744B frontier MoE 模型在 25GB RAM 笔记本运行(GitHub Trending 9-21 35.5k ★ +3.7k 单日) 写入 §1.(1) 推理引擎(端侧 / 边缘 LLM 部署新范式 · 与 JustFit 形成"端侧 + 内存"vs"端侧 + 磁盘流式 MoE"对照)
🔴 最高 WeVisDoc arXiv:2609.20423 paper_card 1419 ✓ 主分类 llm-infra(文档解析数据工程 · 9-21 主分类 llm-infra 入库承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发) 写入 §1.(11) Kernel/Harness(WeVisDoc 文档解析数据工程示范 · 数据驱动 LLM 基础设施 · paper_card 1419 ✓ 主分类 llm-infra)或 §1.(1) 推理引擎 — 同时核实矛盾 ② ③(jay engineering-e1prep 标注 arXiv:2609.19671 与 paper_card arXiv:2609.20423 不一致)
🟡 中 DeepSeek-V4.1-Flash 升档续立稳态 · 135▲ #2 · 24h +40▲ · 48h +78▲ 写入 §1.(3) KV Cache(KV cache 压缩四层方法学专题 · DeepSeek-V4.1-Flash 模型层 48h +78▲ 升档稳态确认)
🟡 中 EOS Tokens arXiv:2609.20511 HF Daily 9-21 #4 94▲ 24h +18▲ 升档续立 写入 §1.(2) 推理调度(EOS Tokens 长度膨胀现象 · HF Daily 9-21 #4 94▲ 24h +18▲ 升档续立)
🟡 中 NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 cs.PF(与 v3.39 evening Dissecting GPU Utilization Hopper arXiv:2609.12923 KTH 形成对照) 写入 §1.(1) 推理引擎(NVIDIA H100 GPU 利用率研究 · 与 arXiv:2609.12923 KTH 形成学术研究 vs 生产实测对照)
🟡 中 vLLM vs SGLang 2026 决策框架 · TGI 已死 · SGLang RadixAttention 3-5× prefill 延迟改善 · LMDeploy 16,200 tokens/s 写入 §1.(1) 推理引擎(vLLM vs SGLang 2026 决策框架 · TGI 废弃说明 + SGLang RadixAttention 基准数据 + LMDeploy 16,200 tokens/s)
🟡 中 NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04 · NVIDIA Developer Blog) 写入 §1.(7) 多模态(EPD Encode-Prefill-Decode Disaggregation · NVIDIA 官方决策指南)
🟢 低 RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 写入 §1.(11) Kernel/Harness(评测方法学第五极 agent safety + web agent 可复现性立基础延展 · frozen entry-gated 协议 · Task 2 半闭源)
🟢 低 四卡 PCIe 级联跑通 27B 端侧大模型(RK1828 × 4 · Qwen2.5-27B / INT8 / llama.cpp RPC 分支) 写入 §1.(1) 推理引擎(端侧多卡部署案例)或 §1.(11) Kernel/Harness
🟢 低 NVIDIA 边缘 AI 功耗研究(cs.PF · 2026-09-14) 写入 §1.(6) 长上下文(移动端 LLM 推理的能耗是云端同等推理的 10-100 倍)
🟢 低 RetireOPD arXiv:2609.20784 技能解耦 On-Policy 蒸馏 写入 §1.(11) Kernel/Harness(Agentic RL 训练基础设施预备级 · 与 v3.39 evening 锚定的 SAGA HPDC'26 形成"Agentic 调度 vs Agentic RL 训练"对照)
🟢 低 llm-keys-ui 0.1 跨机器 AI 编码 Agent 远程控制基础设施(Simon Willison 9-20) 写入 §1.(11) Kernel/Harness(附录:llm-keys-ui 跨机器 Agent 控制 + 分布式执行基础设施)
🟢 低 AI Engineer Stack 2026 六层工程框架(LLM → Memory → Tools(MCP) → Orchestration → Guardrails → Evaluation) 写入 §1.(11) Kernel/Harness(AI Engineer Stack 2026 六层框架 + Guardrails/Memory/Context Engineering 工程化)

七、本轮 v3.39 evening 升档棒状态总评

v3.39 evening 升档棒闭合预备确认

v3.39 §IX 101 evening 升档棒(cutoff 2026-09-21 05:00 CST)已精确闭合:5 NET-new arXiv ID + 9 NET-new URL + 0 NET-new paper_card 主分类 llm-infra 入库净增(沿用 v3.38 1432 张稳态)+ 8 NET-new 整合级预备候选 v3.38 evening morning 升档棒锚定 + 5 NET-new 整合级预备候选首次实质锚入预备扩增预备级 + 1 承接稳态精修锚定(DeepSeek-V4.1-Flash 升档续立 95▲ #2 · KV cache 压缩四层方法学)+ 0 NET-new DOI/CVE + 2 NET-new 矛盾/待核新标记(D171 FlashVector 作者归属精修 + D172 Plugin4Shell 修复覆盖核实)= 精确闭合(arXiv/CVE/DOI/URL 400/36/15/532)。

本棒位(2026-09-21 evening)新增量确认

2 件 NET-new 端侧 / 边缘推理整合级预备候选预备级精修预备级(承接 v3.39 evening morning 升档棒锚定 5 件 NET-new 整合级预备候选预备级): - ① colibri(JustVugg/colibri)纯 C MoE 推理引擎 · 744B frontier MoE 模型在 25GB RAM 笔记本运行 · GitHub Trending 9-21 35.5k ★ +3.7k 单日(⭐⭐⭐⭐) - ② NVIDIA H100 GPU 利用率研究 arXiv:2609.19472 cs.PF · 与 v3.39 evening Dissecting GPU Utilization Hopper arXiv:2609.12923 KTH 形成学术研究 vs 生产实测对照(⭐⭐⭐⭐)

1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(承接 v3.39 evening morning 升档棒锚定): - WeVisDoc arXiv:2609.20423 paper_card 1419 ✓ 主分类 llm-infra(⭐⭐⭐)

2 件承接稳态精修锚定(承接 v3.37 paper_card 1417 + v3.38 evening 锚定): - ① DeepSeek-V4.1-Flash 升档续立稳态 135▲ #2 24h +40▲ 48h +78▲ 升档稳态 · KV cache 压缩四层方法学(⭐⭐⭐⭐⭐) - ② EOS Tokens arXiv:2609.20511 HF Daily 9-21 #4 94▲ 24h +18▲ 48h +37▲ 升档稳态 · paper_card 1425 ✓ 主分类 llm-infra(⭐⭐⭐)

1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发: - NVIDIA Encode-Prefill-Decode Disaggregation for Multimodal Model Serving(2026-09-04)multimodal 推理三阶段分离决策指南承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(⭐⭐⭐⭐)

1 件承接稳态精修候选(承接 v3.39 evening morning 升档棒锚定): - RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接 multimodal 邻接级 + risk/agent 双主分类 · 评测方法学第五极 agent safety + web agent 可复现性立基础延展 llm-infra 邻接级(⭐⭐⭐)

1 件承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发: - vLLM vs SGLang 2026 决策框架 · TGI 已死 · SGLang RadixAttention + LMDeploy 16,200 tokens/s(⭐⭐⭐⭐)

spark 自 v3.32 立标池双向锚以来空窗态势

spark 自 v3.32 立标池双向锚以来 10 棒位连续空窗 + 9-18 单日空窗延续 + 9-19 单日空窗延续 + 9-20 单日空窗延续 + 9-21 单日空窗延续 = spark 9-21 evening 棒位为预备补位承接稳态(承接 spark 9-20 evening llm-infra e1prep 67KB + spark 9-21 13:37 agent-e1prep 42.3KB + jay 9-21 全天棒位 14 文件 ≈ 150KB + tom 9-21 0900 HF Daily 15 件 + flyp 9-21 0950 RiskChainBench critical-read 17.2KB + stephen 9-21 1027 ai-industry e1prep 97.9KB)。

work-queue 9-21 18:00 警示

5 件 Top 15 高价值待深度解读 / 0 件主分类 llm-infra / 选题榜 2609.18487 ActionPiece multimodal 主分类 9-21 完全跌出立标终止核实候选 / 待富化 15 张卡缺 TLDR / 待精确分类 0 张卡 · Tom 认领段 = 无 · Jay 认领段 = 无 · spark 认领段 = 无 · work-queue 主分类 llm-infra 0 件 net-new 警示沿用稳态

下次预计 9-22 morning cron

§IX 102 morning 升档棒预备候选承接 v3.39 evening morning 全量 + 本棒位 2 件 NET-new 端侧 / 边缘推理整合级预备候选预备级精修预备级 + 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + 2 件承接稳态精修锚定 + 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + 1 件承接稳态精修候选 + 1 件承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 = §IX 102 morning 升档棒闭合预备。


本报告由 spark 实例自动生成 · 2026-09-21 18:40 CST 增量条目:2 件 NET-new 端侧 / 边缘推理整合级预备候选预备级精修预备级 + 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + 2 件承接稳态精修锚定 + 1 件承接稳态精修锚定候选预备级预备扩增预备级预备新增锚定实测触发预备级预备触发 + 1 件承接稳态精修候选 + 1 件承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发 *涉及 arXiv 号:5 件本次新增 NET-new 或承接稳态精修锚定候选(JustVugg/colibri GitHub 仓库近邻号待核实 + 2609.20423 WeVisDoc + 2609.19472 NVIDIA H100 GPU 利用率研究 + 2609.16900 RiskChainBench + 2609.20511 EOS Tokens 承接稳态精修锚定)+ 6 件 v3.39 evening morning 升档棒已锚定承接稳态精修(2609.17475 JustFit + 2609.17391 FlashVector + 2604.22906 Network Edge Inference Survey + 2605.00528 SAGA + 2609.12923 Dissecting GPU Utilization Hopper + 2609.19499 Sample Count Is Not Enough)+ 2 件 v3.38 evening morning 升档棒已锚定承接稳态精修*(2609.19969 DeepSeek-V4.1-Flash + 2609.20784 RetireOPD)

本次 2 件承接稳态精修锚定主分类 llm-infra 入库(1419 WeVisDoc + 1425 EOS Tokens · 沿用 v3.39 evening 锚定稳态)· 0 件 NET-new 主分类 llm-infra 入库净增(work-queue 9-21 18:00 警示沿用稳态)