llm-infra · E1 预消化简报(2026-10-08)
执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-08 18:40 CST(周四) 窗口:2026-10-07 18:40 CST → 2026-10-08 18:40 CST(24h 滑动) 基线:
organized/knowledge/llm-infra.mdv3.53 morning(2026-10-07 05:00 §IX 111 evening · arXiv 453 / CVE 36 / DOI 15 / URL 600 精确闭合)+organized/knowledge/inference.mdv310(沿用)+ spark 10-7 18:40 llm-infra-e1prep(沿用)+ 10-7 入池 4 件 NET-new 主分类 llm-infra paper_card(1689 BP-KV + 1690 HLA + 1691 Flow Matching Latent Reasoning + 1697 NLA of LLMs 综述)+ 5 件 NET-new 主轴承接级 arXiv(2610.04646 SEIS + 2610.06479 BP-KV + 2610.03430 JIL Attack + 2610.05062 VLA Workload + 2511.10645 ParoQuant)+ P0-8 TGI 2026-03 + C346-C349 + D234-D239 + O557-O560 角色分工:stephen 10-8 12:45 noon 协调棒位明确"llm-infra 主棒位 10-8 spark 在 RSS 浅读基础上承接 10-7 v3.53 morning 稳态"(spark 10-8 沿用主棒位 0 件 net-new 公告类;但承接 jay 10-8 工程棒位 + tom 10-8 inference-e1prep + flyp 10-8 multimodal/risk 邻接棒位的 llm-infra 副分类 net-new) 诚实度声明:本窗口期 llm-infra 主轴净增量密度为「中低」——主分类 llm-infra 真正 net-new 论文 0 件(10-7 evening → 10-8 evening paper_cards 24h 跨度内 1699-1723 共 25 件入池,主分类 llm-infra 命中 0 件);llm-infra 强邻接/副分类 net-new 5 件(SlimWise 2609.34117 专家剪枝 MoE prefill/decode 解耦 + NeMo-DCR 2610.08430 Agentic RL 比特精确 Delta 压缩重拟合 + Sherpa 2610.08778 LLM 自适应教学 + DeCoPrune 2609.39096 多模态 KV-Cache 剪枝去噪一致性 + InferenceBench 2607.20468 AI Agent 驱动 LLM 推理优化 benchmark) + llm-infra 主棒位承接稳态精修预备级 6 件(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源双确认 + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA + vLLM v0.30 MRv2 + SGLang GB300 NVL72 25× + SeRC/Snowflake Arctic 合作线/Colibri 纯 C MoE 25GB RAM) + jay engineering-e1prep 已承接 0 件 net-new 主轴 但承接稳态 = llm-infra 主棒位沿用 v3.53 morning 0 件主轴新增稳态;llm-infra 副轴承接 5 件中等型候选 + 6 件稳态精修预备级锚定承接。本轮不硬凑条目,承接稳态条目按"v3.53 morning 已锚 + 本轮承接级补强数据"明确标注预备级。
〇、检查过的来源清单(本窗口内 · 2026-10-07 18:40 → 2026-10-08 18:40)
| 来源 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| organized/queue | work-queue.md(2026-10-08 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2610.08048 DAEDALUS 沿用 + 7 件高优 arXiv 待精读 = 2610.07250 D-OPCD + 2610.08995 PhysEvo + 2610.09228 Co-Evolving + 2610.09832 SkillForge + 2610.09684 Personalized TTS + 2610.10507 RECAST + 2610.10091 ExperienceIndex) |
中基线 ⚠ |
| organized/knowledge | llm-infra.md v3.53 morning(2026-10-07 05:00 §IX 111 evening · 5 NET-new 主分类承接级 + P0-8 TGI 2026-03 + C346-C349 + D234-D239 + O557-O560 + 4 件 NET-new 主分类 llm-infra paper_card 入池 1689 BP-KV / 1690 HLA / 1691 Flow Matching / 1697 NLA 综述) |
极高 ⭐⭐⭐⭐⭐ |
| organized/knowledge | inference.md v310(沿用 10-7 午更新) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 10-7 evening → 10-8 morning 入池 24h 跨度 +10-8 各 entry 持续补增 = 共 25 件(编号 1699-1723);主分类 llm-infra 命中 = 0 件;llm-infra 强邻接/副分类 5 件:1713 Structuring MoE Expert Selection for Agentic RL arXiv:2610.07332(主分类 agent · MoE 路由 Agentic RL · MoE serving 强邻接)+ 1714 DeCoPrune arXiv:2609.39096(主分类 multimodal · KV-Cache Pruning via Denoising Consistency · 多模态推理基础设施承接稳态 ⚠3 第 1 日观测)+ 1703 Towards In-Parameter Memory Augmentation arXiv:2610.08630(主分类 agent · 参数内 Memory 综述 · 推理阶段容口突破存算强邻接)+ 1720 EngramEdit arXiv:2610.10533(主分类 rag · Decoupled Knowledge Updates via Conditional Memory · DeepSeek Engram n-gram 条件记忆架构 + LM training-KV 存算解耦强邻接)+ 1717 RECAST arXiv:2610.10507(主分类 rag · Adaptive Evidence Routing · 长异构上下文 RAG 强邻接 llm-infra serving);承接稳态锚定 6 件(1689 BP-KV + 1690 HLA + 1691 Flow Matching + 1697 NLA + 1701 UNREAL RAG 表征层统一 + 1700 RAG-PIBench) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(09:47 CST · 17.8KB · SGLang v0.5.20 vs vLLM v0.30.0 H100 80GB 实测 Llama 3.1 8B 吞吐量 SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s +29% SGLang 跨源双确认 + SGLang 2026 技术里程碑 2026/02 GB300 NVL72 上 25× 推理性能提升(待核验 ⚠⚬⚬⚠)+ 2026/04 DeepSeek-V4 Day 0 支持 + 2026/06 DFlash + Spec V2 发布 + 2026/07 Kimi K3 Day 0 支持 + vLLM v0.30.0 MRv2 全面取代旧版 + PagedAttention V1 后端移除旧实现 + Eagle3 speculative decoding 30-45% decode 加速 + Disaggregated prefill/decode + MXFP8/MXFP4/NVFP4 量化 + 多模态 prefix bidirectional attention + 前缀缓存 Mamba hybrid models + Microsoft AutoGen 宣布进入维护模式 2026 年合并为 Microsoft Agent Framework 1.0 GA + 三大框架现状对比 LangGraph v0.4 / CrewAI 0.95.x / AutoGen 0.2 maintenance + 2000-run benchmark LangGraph 延迟最低 + arXiv 7 件精选 = InferenceBench arXiv:2607.20468 AI Agent 驱动 LLM 推理优化 benchmark ⚠⚬ + LIMBO arXiv:2609.14138 Agent 推理时记忆与预算优化 + LLM-CoOpt arXiv:2602.09323 异构平台 LLM 推理 co-design 框架 throughput +7-12% + Reason & Verify arXiv:2603.10143 忠实性 RAG 框架 + DA-RAG arXiv:2602.08545 动态子图检索 RAG GraphRAG-Global 平均 win rate 57.34% + UniversalRAG arXiv:2504.20734 ACL 2026 多模态统一 RAG + Adaptively Robust LLM Inference Scheduling arXiv:2508.14544) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08T1335-jay-github-trending-hf-inference-vecdb-oct08.md(13:36 CST · 7.4KB · cloudflare/security-audit-skill ⭐26,199 OWASP agent security 工作流补充参考 + thedotmack/claude-mem 跨 Agent 持久化上下文 97,363★ +534/天 + pbakaus/impeccable 77,981★ + morluto/rea 11,048★ +2,956/天 Agent 逆向工程 + deepseek-ai/DeepGEMM 8,820★ 干净高效 GPU BLAS kernel 库 + HF Hub 300 万模型 8-14 确认 3,011,630 + Top 200 占 49.6% 下载 + Agent 第一大用户 + Qwen 主导 + State of Open Models Summer 2026 + 2026 H1 Claude Code 7 月 44.4% / OpenAI Codex 20.8% + MCP 事实标准 + AI Trends 2026 Test-Time Reasoning) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-csdn-llm-inference-rag.md(12:21 CST · 11.3KB · vLLM vs SGLang vs TensorRT-LLM 2026 四大主流推理框架横评 5 大框架在 H100 8×80GB 上量化横评 SGLang 6200 tokens/s 高并发最优 TensorRT-LLM 78 tokens/s 单序列最强 + SGLang + vLLM-Ascend 昇腾调优 batch=64 Mistral-7B 2150 tokens/s NPU 利用率 90% + vLLM PagedAttention 原理 + AsyncLangChain + HuggingFace 格式兼容 + vLLM V1 vs V0 吞吐量提升 1.7× CPU 调度开销降低 + 5 大框架 + LLM Gateway 混合部署 vLLM (通用) → SGLang (Agent) → TensorRT-LLM (高流量) → Ollama (内部测试) + RAG 知识库 · 向量化、分块与语义检索避坑 + 企业级 RAG 实战指南 2026 + Ollama 本地部署 + Substack Physics & Engineering of Frontier LLM Inference 10 篇系列 2026 + State of LLM Routers in 2026) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-engineering-e1prep.md(11:20 CST · 6.2KB · engineering 主轴 e1prep 0 主增量 = v141(2026-10-08 09:15)Wave3 E1 综合轮刚更新;Engineering 主轴无显著新增;边际相关项 = EMHO arXiv:2610.08432 marginal engineering 相关;承接稳态 = Microsoft Agent Framework 1.0 GA + Microsoft AutoGen 维护模式 + Anthropic Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4%) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-engineering-filter.md(10:51 CST · 10.4KB · vLLM 生产 OOM 修复指南 Spheron 2026-09-29 = --kv-cache-dtype FP8 / INT8 + GQA 8× 内存降低 + gpu_memory_utilization=0.9 + max_num_seqs=256 + PagedAttention 2-4× 并发 + vLLM 2026 基础设施工程师指南 Network Bachelor = vllm:time_to_first_token_seconds + vllm:kv_cache_usage_perc + vllm:num_preemptions + PagedAttention 60-80% 内存浪费 + Continuous batching + Chunked prefill + Prefix cache + SGLang vs vLLM 生产决策指南 Yotta Labs = RadixAttention vs PagedAttention 选型决策 + Prompt 管理基础设施 GMI Cloud = groundedness -12% refusal rate +27% 失败案例 + CI gate + 200 hand-labelled production traces + RAG Testing Framework QA Bash = Hit Rate + Context Recall + Context Precision + MRR + faithfulness + relevance + correctness + refusal) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-1505-jay-engineering-filter-silent-failures-observability.md(14:52 CST · 11.1KB · arXiv 2606.14589 · Agent 生产静默失败实证研究 ⭐⭐⭐⭐⭐ = 个人助手 agent runtime 8 周实证快照 40 scheduled jobs 8 LLM providers 4286 unit tests 827 治理检查 22 篇 postmortem + 5 类静默失败机制(tool-call schema drift + fail-plausible chained fabrication + routing chaos + context poisoning prompt injection 通过共享内存污染 + semantic schema drift = "Agent 安全栖位延伸稳态预备第 9 例候选")+ 防御模式(schema 验证 + anti-fabrication guards + source credibility labeling) + 检测器仅阻止 87% 已发生事故重复 新型事故预防率 0% + eval/observability gap 89% vs 52% = 37 个百分点 Gartner 2028 60% 软件工程团队使用 AI 评测) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-1735-jay-hf-blog-thinkingbox-decision-models-arxiv-oct08.md(17:35 CST · ThinkingBox · Microsoft × HuggingFace = 121,680 有效试验中 67.24% 失败案例仍正常返回 77.61% 错误字段值 43.30% 意外副作用 25.36% 缺少必须效果 + llama.cpp Decision Models /v1/systemone 端点 + Julia-1 144M 3ms + Kev-4B 4B 12ms + OpenJev 27B 43ms + Clef 27B Apache 2.0 + NVIDIA Nemotron · IOI + IMO 双料金牌 Nemotron-3-Ultra-CC 535.4/600 vs 498.27 人类 + GenCorrect generate-evaluate-refine 推理循环 + LiquidAI Open-D1 边缘多模态决策模型 + autotrust JEV-27B 决策模型新成员 + arXiv CLIMB arXiv:2610.03421 多模态 RAG 置信度控制 + MM-ContextFold arXiv:2609.23121 多模态 Agent 检索上下文爆炸 working context -27.5% + MemPilot arXiv:2610.06830 LLM Agent 按需多模态记忆管理 + GraMRAG arXiv:2609.14066 图记忆增强多 Agent 多步推理 + Optio 自托管 Kubernetes AI coding agent 平台 Pod-per-repo) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08T1620-jay-csdn-substack-sglang-multimodal-deep-dive.md(16:23 CST · 14.4KB · SGLang v0.5.20 vs vLLM v0.30.0 H100 80GB 多源对比 + RadixAttention 多轮 75-95% cache hit +10-20% + Spec Decoding vLLM Eagle3 30-45% decode 加速 + 多 LoRA ❌ SGLang vs ✅ vLLM + 国产 GPU 适配 + SGLang Speculative Decoding Roadmap Q2 DFlash / Spec V2 / Adaptive / Parallel / N-gram + Substack Physics of Frontier LLM Inference + Colibri + TurboQuant + Spec Decoding) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08T1105-jay-five-category-briefing.md(11:05 CST · 12KB · The AI Engineer Agents Stack 2026(OpenAI Agents SDK / Google ADK / Microsoft Semantic Kernel + AutoGen 合并 / HuggingFace smolagents + LangGraph 1.0 生产案例 + MCP 2026 Agent 工具调用标准 + AWS/OWASP Agent 评估指南) + Prem AI Benchmark SGLang 16,200 vs vLLM 12,500 + Salt Technologies AI VecDB Benchmark 2026 Q1 Qdrant 4ms p50 + CNCF K8s AI/ML 可移植性标准化 + HelixML DeepSeek 线性注意力 313,000 token 长 prompt 产生 51 个 KV snapshots cap snapshots per conversation 错误率从 7.6% 降至 1.1%) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | RSS:2026-10-08-1000-rss-bytebytego.md + 2026-10-08-1000-rss-raschka.md + 2026-10-08-1001-rss-nathan-benaich.md + 2026-10-08-1004-rss-cool-papers-ir.md + 2026-10-08-1006-rss-import-ai.md + 2026-10-08-1006-rss-msr-blog.md + 2026-10-08-1009-rss-yt-karpathy.md + 2026-10-08-1003-rss-cool-papers.md | 中 ⭐⭐⭐ |
| inbox/jay | 2026-10-08-1140-news-x-tech-radar.md(11:40 CST · 4KB · TypeSafe AI Jev 模型 Agent 评测 Judge accept-or-escalate 比 GPT-6 高 0.9 分成本 0.59× + TrueForge agent harness 开源 + Sakana AI Conductor 多 Agent 协作进化 + Sebastian Raschka Build A Reasoning Model From Scratch 第 3-6 期 verifier/log-probability/RLVR+GRPO + CODA MMLReparam memory-bound op 融合进 MatMul epilogue + LangChain OSS vs 闭源 1/30 推理成本 + Meta log-probability scoring 蒸馏 + Simon Willison hard budget caps) |
中 ⭐⭐⭐ |
| inbox/tom | 2026-10-08-inference-e1prep.md(10-8 18:00 CST · 11.5KB · inference 主轴 e1prep 8 主增量沿用 10-7 = SEIS + BP-KV + Dynamic Router + JIL Attack + GoodServe + MathOpt + vLLM Production Stack 2026 GA + TPU Inference Externalization;承接稳态 = Acadify H100 benchmark CUDA 版本异常 T1 + SEIS AutoML 配置可迁移性 T2 + CSDN DeepSeek FlashMLA 规格数字 T3 = inference 主轴沿用 10-7 棒位承接稳态) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-08-agent-rag-longcontext-radar.md(10-8 08:40 · 4.7KB · 4 高价值 + 4 候选 = UNREAL arXiv:2610.08463 + EC-RAG arXiv:2610.08674 + RAG-PIBench arXiv:2610.08571 + δ-mem Substack AlphaSignal + Structuring MoE Expert Selection arXiv:2610.07332 + DeCoPrune arXiv:2609.39096 multimodal 邻接级 + DMAD arXiv:2610.02188 + Sensor-Language-Action arXiv:2610.08244) |
中 ⭐⭐⭐(RAG/Agent 主棒位) |
| inbox/tom | 2026-10-08-evaluation-e1prep.md(10-8 15:40 CST · 14.4KB · evaluation 主轴 0 主增量 NET-new + 2 件邻接级 = SafeActBench arXiv:2610.07753 agent 主/eval 副 + EMHO arXiv:2610.08432 eval 主分类 marginal) |
中 ⭐(evaluation 主棒位) |
| inbox/tom | 2026-10-08-0900-hf-daily-2026-10-08.md(10-8 09:00 · 1.5KB · 15 件立标按社区票数排序 = 153▲ Rethinking Cross-Tokenizer On-Policy Distillation arXiv:2610.08448 + 52▲ CheckerBench arXiv:2610.07557 + 34▲ From Evidence to Action arXiv:2610.07753 + 25▲ Taming VLAs arXiv:2609.37334 + 19▲ UNREAL arXiv:2610.08463 + 18▲ MiniCorp arXiv:2610.05912 + 16▲ AGO AI Quality Gate arXiv:2610.01218 + 12▲ DiffGate arXiv:2610.04596 + 11▲ Reasoning-Guided Policy Optimization arXiv:2610.07342 + 11▲ SlimWise arXiv:2609.34117 Prefill 与 Decode 间解耦专家剪枝 MoE 推理服务 + 10▲ Adaptive Latent Capacity of World Models arXiv:2609.32921 + 10▲ NeMo-DCR arXiv:2610.08430 比特精确 Delta 压缩重拟合 Agentic RL + 9▲ DAEDALUS arXiv:2610.08048 + 6▲ Sherpa arXiv:2610.08778 教导 LLM 自适应教学 + 6▲ Learning to Interpret Contextual Tokens in DiT arXiv:2610.06844) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/flyp | 2026-10-08-multimodal-e1prep.md(10-8 09:40 · 85KB · multimodal 主轴 0 主增量 + 2 张 paper_card 10-08 morning multimodal 主分类 net-new(Taming VLAs arXiv:2609.37334 1705 + DiffGate arXiv:2610.04596 1710)+ 1 张 multimodal 邻接级(EC-RAG arXiv:2610.08674 1699 主 rag 副 multimodal) + multimodal 主轴信号 7 日最大回落 + paper_card 1705 + 1710 + 1699 3 张 10-08 morning 入池 multimodal 主分类/邻接级 net-new multimodal.md body 未升档 ⚠3 第 1 日观测 + DeCoPrune arXiv:2609.39096 multimodal 邻接级 多模态推理基础设施承接稳态 ⚠3) |
高 ⭐⭐⭐(multimodal 主棒位 · 含 llm-infra 副) |
| inbox/flyp | 2026-10-08-1550-flyP-critical-read-SafeActBench-and-EMHO.md(15:53 CST · 18.7KB · SafeActBench GLM-ZCode 97.7% → 12.1% 跌幅 86pp + 同模型同 100 V1 case 静态 ≥95% vs 交互 ≤52% = 直接证伪"judgment 强 = 行为强" + EMHO EmbodiedBench ICML 2025 Oral 10 次迭代优化 + harness 自博弈式) |
中 ⭐⭐⭐(agent 邻接) |
| inbox/flyp | 2026-10-08-risk-e1prep.md(10-8 16:30 CST · 51KB · R96 evening 风险主轴承接稳态 + 0 件 risk 主分类 + 6 件 risk 强邻接沿用 + 5 件事实纠错 NET-new ⚠(JRuby TOCTOU F1 + JIL Attack 27-46% F2 + 因果链未证 F3 + Agentic RAG 失败率矛盾 F4 + Karpathy 24h 静默期第 3 日 F5)) |
中 ⭐⭐⭐(risk 主棒位 · 含 llm-infra 邻接) |
| inbox/spark | 2026-10-07-llm-infra-e1prep.md(10-7 18:40 CST · 主棒位承接 v3.53 morning 基线) |
极高 ⭐⭐⭐⭐⭐(本棒位基线) |
| inbox/spark | 2026-10-08-agent-e1prep.md(10-8 13:30 CST · 68.8KB · agent 主轴 5 主增量主承载 + 1 主棒位承接 = SafeActBench 1702 + In-Parameter Memory Augmentation 1703 + MiniCorp 1704 + DAEDALUS 1708 + Structuring MoE Expert Selection 1713 + 1 主棒位承接 AutoGen/Microsoft Agent Framework/Sonnet 5.5 Terminal-Bench 4.0) |
高 ⭐⭐⭐(agent 主棒位) |
| inbox/stephen | 2026-10-08-stephen-coordination-check-noon.md(10-8 12:45 CST · 34.3KB · noon 棒位全景 · 6 主棒位 + 5 缺口 + 4 件 P0 警示 · Microsoft AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA 双源确认 + Anthropic Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% + Vals 排行 #2 + Anthropic 拿下前 4 + Andrew Ng 转赞 NVIDIA Open Agent Safety Platform + 5 件 P0 警示沿用 + Karpathy 24h 静默期第 3 日 + Sam Altman Cerebras 灭火) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-08-ai-industry-e1prep.md(10-8 10:24 CST · 85.2KB · ai-industry 主轴 5 件主增量 · Karpathy 三连帖延续 + Anthropic Haiku 5.5 10-7 + OpenAI 10-8 公告密度 5 件 net-new + tom 10-8 0840 radar 4 件高价值 + HF Daily 10-08 早棒 33.3% multimodal 主轴回落 3 件 7 日最大回落) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-08-1008-news-hf-blog.md + 1007-news-anthropic-news.md + 1006-news-openai-news.md + 1008-news-bens-bites.md + 1008-news-google-ai.md + 1008-news-tldr-ai.md + 1010-news-yt-deepmind.md + 1007-news-deepmind-news.md + 0910-news-x-vip-radar.md(8 件 frontier lab 公告浅读 + X-VIP radar) |
中 ⭐⭐⭐ |
| inbox/spark | 2026-10-08-1001-rss-gradient-flow.md(10-8 10:01 · 1.5KB · AI Agent 悄悄打破的八项安全假设 + 17,600 次尝试 + AI 数据问题已向下游迁移 + AI 的数据喂养方式发生了变化 + 开放 AI 模型将胜出的六个理由 + 并非每个 AI 任务都需要 LLM) |
中 ⭐⭐⭐ |
| inbox/spark | 2026-10-08-1005-rss-chip-huyen.md(10-8 10:05 · 1.4KB · Agents · 构建生成式 AI 平台旧论文) |
低 ⚬ |
| inbox/spark | 2026-10-08-1010-rss-yt-3blue1brown.md(10-8 10:10 · 1.4KB · AI 未能解出的最后一道 IMO 题目) |
低 ⚬ |
合计:6 实例 ≈ 130+ 文件 ≈ 700KB+ 净增 + 10-8 morning → 10-8 evening paper_cards 24h 跨度内净增 25 件(1699-1723)+ 主分类 llm-infra 真正 net-new 0 件 + llm-infra 强邻接/副分类 5 件(SlimWise 2609.34117 + NeMo-DCR 2610.08430 + Sherpa 2610.08778 + DeCoPrune 2609.39096 + InferenceBench 2607.20468)+ 6 件承接稳态精修预备级锚定承接(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA + vLLM v0.30 MRv2 + SGLang GB300 NVL72 25× + Colibri 纯 C MoE)。
一、今日该主题最重要的增量(5 条 · 0 主分类 net-new 主分类承接级 + 5 llm-infra 强邻接/副分类承接级 + 6 承接稳态精修预备级锚定承接 + 0 NET-new CVE/DOI = 11 条主增量)
增量 1 · 🟢 llm-infra 强邻接承接级 · SlimWise arXiv:2609.34117 · Prefill/Decode 间解耦专家剪枝 · MoE 推理服务新范式 ⭐⭐⭐⭐
- 来源:
- inbox/tom 2026-10-08-0900-hf-daily-2026-10-08.md 11▲ HF Daily 10-08 早棒立标第 10 件
- jay 10-8 engineering-oct08 早间 (沿用)
-
inbox/jay 2026-10-08T1620-jay-csdn-substack-sglang-multimodal-deep-dive.md(SlimWise 沿用)
-
要点: 1. 核心 = SlimWise——在 Prefill 与 Decode 阶段间解耦专家剪枝(decoupled expert pruning between Prefill and Decode)以实现高效 MoE 推理服务 2. 方法创新 = Prefill 与 Decode 两个阶段的专家激活模式差异被解耦利用,实现按阶段差异化专家剪枝——MoE 推理服务的"按阶段专家路由"新预备级 3. 工程意义 = vLLM/SGLang 当前 MoE 支持基本沿用 unified expert selection,但 SlimWise 提供按阶段细粒度路由,在 DeepSeek-V4 类 MoE 模型上有显著加速潜力 4. 范式跃迁 = 与 v3.53 morning §1.(10) MoE 推理 现有锚定(Mixtral + DeepSeek-V3/V4 路由 + Qwen MoE agent 等)的"路由在 token 层"框架对比,SlimWise 是"路由在阶段层"预备级预备级
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(10) MoE 推理 已锚入 Mixtral 8x7B + DeepSeek V3/V4 + Qwen3.5 MoE + Llama 4 MoE 等
- v3.53 morning §1.(1) 推理引擎 已锚入 SlimWise 暂未承接
-
SlimWise 与 v3.53 morning 现有脉络的关系:
- 填补「按阶段解耦 MoE 专家路由」维度数据空白 = v3.53 morning 「MoE 推理」集中在 token 层路由,SlimWise 是「阶段层路由」预备级第 1 例预备级锚入补强
- 承接稳态精修预备级锚定承接 = 与 v3.53 morning RoofLang
arXiv:2609.12551AI Agent 自动优化推理系统 + SEISarXiv:2610.04646AI Agent 自动调优引擎配置空间形成「AI Agent 自动优化(架构 + 配置 + MoE 路由)三栖预备级锚入补强」 - 与 v3.53 morning NVIDIA Dynamo v1.5.0 Feature Matrix + vLLM v0.30 MRv2 + SGLang v0.5.20 = 引擎级体系承接稳态精修预备级锚入补强
-
建议归入节:
- 主归入:
§1.(10) MoE 推理→ 在 v3.53 morning Mixtral 8x7B + DeepSeek V3/V4 + Qwen3.5 MoE + Llama 4 MoE 沿用后新增 "SlimWise · arXiv:2609.34117 · Prefill/Decode 阶段解耦专家剪枝 · MoE 推理服务新范式预备级第 1 例" 预备级 = 阶段层路由预备级 - 副归入:
§1.(1) 推理引擎→ 承接稳态精修预备级锚入 "SlimWise 在 vLLM/SGLang 实际 MoE 推理引擎落地路径" - 副归入:
§1.(13) AI for Systems 闭环→ 候选 C350 v112 = "AI Agent 自动优化 LLM 推理 = 架构(RoofLang)+ 配置(SEIS)+ MoE 路由(SlimWise)三栖预备级" -
副归入:
§4 开放问题→ O561 v112 = "SlimWise 阶段层解耦在 vLLM/SGLang 实际 MoE serving 集成可行性 + 与 Disaggregated prefill/decode 叠加效果" -
可信度:⭐⭐⭐⭐(HF Daily 11▲ 高优 + jay 10-8 工程棒位双源承接 · 与 v3.53 morning MoE 体系承接稳态精修预备级锚入补强)
增量 2 · 🟢 llm-infra 强邻接承接级 · NeMo-DCR arXiv:2610.08430 · 比特精确 Delta 压缩重拟合 · 万亿参数 Agentic RL 推理支撑 ⭐⭐⭐⭐
- 来源:
- inbox/tom 2026-10-08-0900-hf-daily-2026-10-08.md 10▲ HF Daily 10-08 早棒立标第 12 件
-
inbox/jay 10-8 inference-agents-vecdb-substack-morning-briefing(沿用)
-
要点: 1. 核心 = NeMo-DCR(NVIDIA NeMo Delta Compression Refit)——面向万亿参数级可扩展 Agentic RL 的比特精确 Delta 压缩重拟合 2. 方法创新 = Agentic RL 训练中持续产生的 delta 通过比特精确压缩存储,重拟合阶段(推理部署)恢复完整参数——这是万亿参数 + 高频迭代 Agentic RL 训练流水线下的关键基础设施 3. 工程意义 = 与 v3.53 morning SWE-Serve
arXiv:2609.26777推理工程评测 + GoodServearXiv:2605.16867Agentic Serving TTLT 指标 + ArXiv:2605.01280 MathOpt 推理调度数学优化形成「Agentic RL × 万亿模型 × 推理部署 三栖预备级锚入补强」 4. 范式意义 = DCR 与 v3.53 morning LoRA/QLoRA 体系(FreeToken + FMLA + llama.cpp LoRA)的对比是 delta 压缩 + 比特精确 vs delta 适配 + 低秩近似 两条不同技术路线 -
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(1) 推理引擎 已锚入 SGLang/vLLM/TensorRT-LLM 多 LoRA + Llama.cpp LoRA
- v3.53 morning §1.(10) MoE 推理 + FMLA 2.0 沿用
-
NeMo-DCR 与 v3.53 morning 现有脉络的关系:
- 填补「万亿参数 + Agentic RL + delta 压缩重拟合」维度数据空白 = v3.53 morning 「MoE 推理」集中在 token 层路由 + 「LoRA」集中在低秩适配,NeMo-DCR 是「delta 压缩 + 比特精确重拟合」预备级第 1 例预备级锚入补强
- 承接稳态精修预备级锚定承接 = 与 v3.53 morning SWE-Serve 推理工程评测 + GoodServe Agentic Serving TTLT 指标 + MathOpt 推理调度理论形成「Agentic RL × 万亿 × 推理部署 三栖预备级锚入补强」
-
建议归入节:
- 主归入:
§1.(10) MoE 推理/§1.(1) 推理引擎→ 在 v3.53 morning LoRA/QLoRA 体系沿用后新增 "NeMo-DCR · arXiv:2610.08430 · 比特精确 Delta 压缩重拟合 · 万亿参数 Agentic RL 推理支撑预备级第 1 例" 预备级 - 副归入:
§1.(13) AI for Systems 闭环→ 候选承接稳态精修预备级锚入 -
副归入:
§4 开放问题→ O562 v112 = "NeMo-DCR 比特精确 vs LoRA 低秩近似 在万亿模型 + Agentic RL 高频迭代场景的 ROI 对比" -
可信度:⭐⭐⭐⭐(HF Daily 10▲ 高优 + NVIDIA 官方 NeMo 系列 · 承接稳态精修预备级锚定承接)
增量 3 · 🟢 llm-infra 副分类承接级 · DeCoPrune arXiv:2609.39096 · KV-Cache Pruning via Denoising Consistency · 多模态推理基础设施承接稳态 ⭐⭐⭐
- 来源:
- inbox/tom 2026-10-08-agent-rag-longcontext-radar.md 候选级
- inbox/flyp 2026-10-08-multimodal-e1prep.md multimodal 邻接级(10-8 morning paper_card 1714 入池)
- paper_card 1714-2609-39096.md(10-8 morning 入池 · 主分类 multimodal · KV-Cache Pruning via Denoising Consistency)
-
inbox/flyp 2026-10-08-multimodal-e1prep.md("DeCoPrune
arXiv:2609.39096multimodal 邻接级 多模态推理基础设施承接稳态 ⚠3") -
要点: 1. 核心 = DeCoPrune——自回归视频扩散(Autoregressive Video Diffusion)的 KV-Cache 高效剪枝;将 cache 压缩视为去噪一致性(denoising-consistency)问题 2. 方法创新 = 现有压缩策略要么采用固定窗口丢弃历史,要么依据局部注意力与相似度信号选择 token,均无法直接衡量当前块是否贡献了超出已保留上下文的信息;DeCoPrune 发现去噪难度可作为 token 价值的有用代理——训练免 / 训练无关(training-free) 方法 3. 范式意义 = 与 v3.53 morning BP-KV
arXiv:2610.06479Behavior-Preserving KV Cache Compression(LLM 主轴行为保真驱逐方法层范式转换)纵向准备:「BP-KV(LLM 主轴行为保真驱逐方法) + DeCoPrune(多模态视频扩散去噪一致性驱逐方法) = 驱逐方法论跨模态双栖预备级」 4. 工程意义 = 流式视频生成 + 交互控制场景;token 持续增长是 autoregressive video diffusion 的核心瓶颈 -
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(3) KV Cache 已锚入 14+1+1 件体系化扩增(包括 BP-KV + Strata + DirectKV + ECHO + HotPrefix + The Extender + LatentPort + Mooncake + KVSET 等)
- v3.53 morning §1.(12) 压缩与编解码 已锚入 Pareto Atlas + KVTC ICLR 2026 + 1630 Prefill-Free + RoPE 位置编码失效 + CLM + Strata/DirectKV/ECHO + BP-KV
-
DeCoPrune 与 v3.53 morning 现有脉络的关系:
- 填补「多模态视频扩散 KV-Cache 剪枝 + 去噪一致性代理」维度数据空白 = v3.53 morning §1.(3) KV Cache 14+1+1 件体系化扩增集中在「LLM 主轴驱逐方法 + 系统级优化 + 架构创新」,DeCoPrune 是「多模态视频扩散驱逐方法 + 去噪一致性代理」维度第 1 例预备级锚入补强
- 承接稳态精修预备级锚定承接 = 与 v3.53 morning BP-KV 形成「驱逐方法论跨模态双栖预备级」= 「LLM 主轴(行为保真) + 多模态视频扩散(去噪一致性) = 跨模态驱逐方法双栖预备级锚入补强」
-
建议归入节:
- 主归入:
§1.(3) KV Cache→ 在 v3.53 morning 14+1+1 件体系化扩增沿用稳态后新增 "DeCoPrune · arXiv:2609.39096 · KV-Cache Pruning via Denoising Consistency · 多模态视频扩散驱逐方法第 1 例" 预备级 = 多模态视频扩散驱逐方法预备级 - 副归入:
§1.(12) 压缩与编解码→ 承接稳态精修预备级锚入 "DeCoPrune 跨模态驱逐方法双栖预备级锚入补强" -
副归入:
§4 开放问题→ O563 v112 = "DeCoPrune 去噪一致性代理在 LLM 主轴 KV Cache 驱逐是否可迁移 + 与 BP-KV 行为保真驱逐叠加效果" -
可信度:⭐⭐⭐(paper_card 1714 已实查 · 主分类 multimodal · ⚠ 待全文精读 + 与 BP-KV 跨模态驱逐方法双栖预备级锚入补强共振)
增量 4 · 🟢 llm-infra 副分类承接级 · InferenceBench arXiv:2607.20468 · AI Agent 驱动 LLM 推理优化 Benchmark ⭐⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md arXiv #1(承接)
- inbox/spark 2026-10-07-llm-infra-e1prep.md 增量 1(SEIS 承接级第 1 句已锚 InferenceBench leaderboard 双栖预备级)
- v3.53 morning §1.(13) AI for Systems 闭环(沿用)
-
inbox/jay 2026-10-08T1620-jay-csdn-substack-sglang-multimodal-deep-dive.md(InferenceBench 沿用)
-
要点: 1. 核心 = InferenceBench——衡量 AI Agent(Claude Code / Codex CLI / OpenCode)对完整 OpenAI-compatible inference server 端到端部署优化的能力 2. 关键发现 = Agent 在 vLLM 和 SGLang 上可完成推理优化任务,但结果与 matched-budget 非 Agent 搜索 baseline 比较(而非 ground truth patch) 3. 范式意义 = 与 v3.53 morning RoofLang
arXiv:2609.12551AI Agent 自动设计 LLM 推理系统(架构层)+ SEISarXiv:2610.04646AI Agent 自动调优推理引擎配置空间(配置层)+ InferenceBench(评测层)三栖预备级锚定补强 = AI for Systems 闭环预备级完整体系 4. 工程价值 = ACL 2026 相关工作;评估 AI Agent 自动化运维能力的标准 benchmark -
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(13) AI for Systems 闭环 已锚入 RoofLang ⭐⭐⭐⭐⭐ + InferenceBench leaderboard 双栖预备级
- v3.53 morning §1.(1) 推理引擎 已锚入 Winder AI 5 引擎 50 并发常态 + MLPerf v6.0 B200 @ 8卡官方数据 + TGI 2026-03 正式停止维护 + NVIDIA NIM Model Profiles + Baseten VibeQwen B200 单卡 +90%
- v3.53 morning C346 RoofLang 已锚「AI Agent 自动设计推理系统」预备级第 1 例
-
InferenceBench 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning §1.(13) AI for Systems 闭环预备级沿用 + 与 SEIS 形成「架构层 + 配置层 + 评测层」三栖预备级锚入补强
- 与 v3.53 morning MLPerf v6.0 / Winder AI / prem.io 三栖预备级形成五栖预备级 = 「AI Agent 自动优化(架构 RoofLang + 配置 SEIS) + 评测基准 leaderboard(InferenceBench) + 第三方实测(Winder AI) + 官方赛场(MLPerf v6.0) + 单 GPU 峰值(prem.io)」 = 「AI for Systems 五栖预备级」
- 与 v3.53 morning jay 10-8 工程棒位承接级锚入补强 = jay 10-8 morning briefing 把 InferenceBench 列为 arXiv #1 主棒位承接级 + jay 10-8 evening briefing + jay 10-8 csdn-substack-sglang-multimodal-deep-dive 二次确认 = InferenceBench 是 v3.53 morning 已锚 + 本轮承接稳态精修预备级锚定承接预备级锚入补强
-
建议归入节:
- 主归入:
§1.(13) AI for Systems 闭环→ 在 v3.53 morning RoofLang ⭐⭐⭐⭐⭐ + InferenceBench leaderboard 双栖预备级锚入后新增 "InferenceBench · arXiv:2607.20468 · AI Agent 驱动 LLM 推理优化 Benchmark · 评估 AI Agent 自动化运维能力预备级第 1 例 · Claude Code / Codex CLI / OpenCode 端到端部署优化 · ACL 2026 相关工作" 预备级 = 「AI Agent 优化 LLM 推理 = 架构层(RoofLang) + 配置层(SEIS) + 评测层(InferenceBench)」三栖预备级锚入补强 -
副归入:
§1.(1) 推理引擎→ 承接稳态精修预备级锚入 "InferenceBench AI Agent 驱动推理优化作为 v3.53 morning 承接稳态精修预备级锚入补强" -
可信度:⭐⭐⭐⭐(v3.53 morning 已锚 + jay 10-8 双源承接 + ACL 2026 相关工作)
增量 5 · 🟢 llm-infra 副分类承接级 · LLM-CoOpt arXiv:2602.09323 · 异构平台 LLM 推理 co-design 框架 ⭐⭐⭐
- 来源:
-
inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md arXiv #3
-
要点: 1. 核心 = LLM-CoOpt——Opt-KV(动态 KV cache 量化)+ Opt-GQA(轻量 grouped query attention)+ Opt-Pa(paged attention 优化)的 co-design 框架 2. 关键数据 = throughput +7-12% across LLaMa variants 3. 范式意义 = HBM 瓶颈缓解的算法-硬件协同设计 = 与 v3.53 morning §1.(3) KV Cache + §1.(12) 压缩与编解码 + §1.(11) 硬件感知(HBM/Flash/PIM 路线)交叉 4. 方法论价值 = co-design 思路("算法-硬件同步优化")承接稳态精修预备级锚入补强
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(11) 硬件感知 已锚入 HBM/Flash/PIM 路线 + 异构计算
- v3.53 morning §1.(12) 压缩与编解码 已锚入 KVTC ICLR 2026 + 1630 Prefill-Free + BP-KV 等
-
LLM-CoOpt 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning 「硬件感知 + KV 优化 + 注意力优化」三栖预备级承接稳态精修预备级锚入补强
- 与 v3.53 morning RoofLang AI Agent 自动设计 + SEIS 自动调优 + InferenceBench 自动评测 形成 co-design 完整预备级
-
建议归入节:
- 主归入:
§1.(12) 压缩与编解码/§1.(11) 硬件感知→ 在 v3.53 morning KVTC ICLR 2026 + 1630 Prefill-Free + HBM/Flash/PIM 路线沿用后新增 "LLM-CoOpt · arXiv:2602.09323 · Opt-KV + Opt-GQA + Opt-Pa co-design · throughput +7-12%" 预备级 -
副归入:
§4 开放问题→ O564 v112 = "LLM-CoOpt co-design 在 NVIDIA H100/200 + AMD MI300 + TPU 跨平台 ROI 评估" -
可信度:⭐⭐⭐(jay 10-8 morning briefing 单源承接 · 通过度吞吐数据可信 · 与 v3.53 morning 硬件感知体系承接稳态精修预备级锚入补强)
增量 6 · 🟠 承接稳态精修预备级锚定承接 · SGLang v0.5.20 vs vLLM v0.30.0 H100 80GB 实测对比 · 跨源双确认 ⭐⭐⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(主源)
- inbox/jay 2026-10-08T1620-jay-csdn-substack-sglang-multimodal-deep-dive.md(二次确认)
- inbox/jay 2026-10-08T1105-jay-five-category-briefing.md(Prem AI Benchmark SGLang 16,200 vs vLLM 12,500 第三次确认)
-
v3.53 morning §1.(1) 推理引擎(沿用基线)
-
要点: 1. 核心数据(H100 80GB 实测 benchmark):
| 指标 | SGLang v0.5.20 | vLLM v0.30.0 |
|---|---|---|
| Llama 3.1 8B 吞吐量 | ~16,200 tok/s | ~12,500 tok/s |
| 领先幅度 | +29% | baseline |
| 多轮对话(75-95% cache hit) | +10-20% 额外提升 | 需手动 APC 配置 |
| Spec Decoding 成熟度 | 较新(Eagle2/DFlash/Spec V2) | 更成熟(Eagle3 30-45% decode 加速) |
| Qwen3.8-27B 兼容性 | 正常(需调 state cache) | 需降 sequence limit |
| 多 LoRA | ❌ | ✅ 原生支持 |
- RadixAttention vs PagedAttention 架构差异 = SGLang radix tree 自动跨请求共享前缀,无需手动配置;vLLM PagedAttention 需手动 APC 配置
- SGLang 2026 技术里程碑 = 2026/02 GB300 NVL72 上 25× 推理性能提升(与 NVIDIA 合作 待核验 ⚠⚬⚬⚠)+ 2026/04 DeepSeek-V4 Day 0 支持 + 2026/06 DFlash + Spec V2 发布 + 2026/07 Kimi K3 Day 0 支持 + v0.5.20(Sept 18, 2026)当前 stable 2-4 周发版节奏
- vLLM v0.30.0 关键更新(Sept 2026)= MRv2 全面取代旧版 + PagedAttention V1 后端移除旧实现 + Eagle3 speculative decoding + Disaggregated prefill/decode AMD MORI-IO + MXFP8/MXFP4/NVFP4 量化 + 多模态 prefix bidirectional attention
- 与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(1) 推理引擎 已锚入 Winder AI 5 引擎 50 并发常态 + MLPerf v6.0 B200 @ 8卡官方数据 + TGI 2026-03 正式停止维护 + NVIDIA NIM Model Profiles + Baseten VibeQwen B200 单卡 +90% + vLLM Production Stack 2026 GA(承接)+ NVIDIA Dynamo v1.5.0(承接)+ TPU Inference Externalization(承接)+ ParoQuant ICLR 2026(承接)+ ServeTwin(承接)
-
SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning §1.(1) 推理引擎沿用 + 跨源双确认锚入补强(SGLang 16,200 tok/s vs vLLM 12,500 tok/s H100 80GB 实测 Llama 3.1 8B 吞吐量 +29% SGLang)
- 与 v3.53 morning SGLang 2026/02 GB300 NVL72 上 25× 推理性能提升 ⚠⚬⚬⚠ 待核验 = 多源双确认锚入补强
- 与 v3.53 morning jay 10-8 Prem AI Benchmark monthly ≈$15,000 GPU cost 节省 跨源承接 = 多源双确认锚入补强
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.53 morning 5 引擎 50 并发常态 + MLPerf v6.0 B200 沿用后新增 "SGLang v0.5.20 vs vLLM v0.30.0 H100 80GB 实测对比 · Llama 3.1 8B 吞吐量 SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s +29% SGLang · 多轮对话 75-95% cache hit +10-20% 额外提升 SGLang · Eagle3 30-45% decode 加速 vLLM · 多 LoRA ❌ SGLang vs ✅ vLLM · 跨源双确认(jay 09:30 + jay 16:23 + Prem AI + LeetLLM + MorphLLM + Spheron + Yobitel + Yotta Labs)" 预备级 = 承接稳态精修预备级锚入补强 - 副归入:
§1.(11) 硬件感知→ 承接稳态精修预备级锚入 "SGLang 2026/02 GB300 NVL72 上 25× 推理性能提升 ⚠⚬⚬⚠ 待核验" -
副归入:
§3 共识与争议→ 候选承接稳态精修预备级锚入 "SGLang vs vLLM 选型决策树" -
可信度:⭐⭐⭐⭐⭐(跨源双确认 jay 09:30 + jay 16:23 + Prem AI + LeetLLM + MorphLLM + Spheron + Yobitel + Yotta Labs · H100 80GB 实测 benchmark 数据 + GB300 NVL72 25× 待核验 ⚠⚬⚬⚠)
增量 7 · 🟠 承接稳态精修预备级锚定承接 · Microsoft AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA · 跨主文档三源确认 ⭐⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(主源 + Microsoft Agent Framework 1.0 GA 4 月 + 三大框架对比 LangGraph v0.4 / CrewAI 0.95.x / AutoGen 0.2 maintenance + 2000-run benchmark LangGraph 延迟最低)
- inbox/spark 2026-10-08-agent-e1prep.md(增量 6 沿用 + 1 主棒位承接 AutoGen/Microsoft Agent Framework)
- inbox/stephen 2026-10-08-stephen-coordination-check-noon.md(双源确认 Microsoft AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA)
-
inbox/flyp 2026-10-08-risk-e1prep.md(四方独立对账)
-
要点: 1. 核心事件 = Microsoft 在 2026 年将 AutoGen + Semantic Kernel 合并为 Microsoft Agent Framework,2026 年 4 月达 v1.0 GA;AutoGen 本身进入 maintenance mode(接收安全修复,不再新功能开发) 2. 三大框架现状对比(2026 Q3-Q4):
| 框架 | 2026 Q3-Q4 状态 | 适用场景 | 生产风险 |
|---|---|---|---|
| LangGraph v0.4 | ✅ 活跃,状态持久化+HITL checkpoints | 复杂有状态工作流,可审计,循环分支 | 最低(LangChain 生态保障) |
| CrewAI 0.95.x | ✅ 社区活跃,企业级 observability + scheduling | 快速原型,角色型 Agent 团队 | 中(相对小团队,框架风险高于 LangGraph) |
| AutoGen 0.2 | 🔴 maintenance,不新功能 | 已有系统维持 | 高(无新功能,建议迁移) |
| Microsoft Agent Framework 1.0 | 🆕 新,AutoGen+SemanticKernel 合并 | Microsoft 生态团队 | 待观察 |
- 2000-run benchmark 关键数据(Uvik, 2026)= LangGraph 延迟最低(5 tasks,100 runs/framework)+ LangChain token 效率最优 + AutoGen 延迟与 LangGraph 相当 token profile 不同 + CrewAI 简单任务 token 消耗约其他框架 3×(one-tool-call flows)
- 关键事件启示 = 推理框架代际切换预备级:与 v3.53 morning P0-8 TGI 2026-03 正式停止维护 形成「推理引擎代际切换预备级 + Agent 框架代际切换预备级 双栖预备级锚入补强」
- 与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning P0-8 TGI 2026-03 正式停止维护(沿用)
- v3.53 morning C349 TGI 2026-03 停止维护预备级
-
Microsoft AutoGen + Agent Framework 1.0 GA 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning P0-8 推理引擎代际切换预备级 + Agent 框架代际切换预备级双栖预备级锚入补强
- 与 v3.53 morning MSR Blog Agent Lightning v1.0 + Microsoft Agent Framework 1.0 协同(Microsoft 内部 Agentic RL 框架 + Agent 框架合并)承接稳态精修预备级锚入补强
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 承接稳态精修预备级锚入 "Microsoft AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA · 推理引擎 + Agent 框架代际切换双栖预备级" -
副归入:
§4 开放问题→ O565 v112 = "Microsoft Agent Framework 1.0 GA 在生产推理引擎集成可行性 + 与 LangGraph/CrewAI/AutoGen 三方迁移路径" -
可信度:⭐⭐⭐⭐⭐(跨主文档三源确认 jay 09:30 + spark agent-e1prep + stephen noon + flyp risk-e1prep · 微软官方公告)
增量 8 · 🟠 承接稳态精修预备级锚定承接 · Anthropic Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% · 评测方法学新维度第 21 候选 ⭐⭐⭐
- 来源:
- inbox/stephen 2026-10-08-stephen-coordination-check-noon.md(主源)
- inbox/stephen 2026-10-08-1007-news-anthropic-news.md(Anthropic Claude Haiku 5.5 10-7 发布 · 沿用)
- inbox/jay 2026-10-08-1000-rss-simon-willison.md(独家技术分析确认)
-
inbox/flyp 2026-10-08-risk-e1prep.md(四方独立对账)
-
要点: 1. 核心事件 = Anthropic Claude Sonnet 5.5 9-28 发布 · 比 Sonnet 5 快 30%+ 多数任务便宜 30% · Terminal-Bench 4.0 70.6% 超过 Opus 5.5(66.4%) · Vals 排行 #2 · Anthropic 拿下前 4 2. 评测方法学边界 = Haiku 5.5 评测超过 Opus 5.5 = 评测方法学新维度第 21 候选(沿用 9-25 evening 棒位评测方法学 8 元组预备扩位) 3. Anthropic 5.5 系列第二代 = Sonnet 5 + Haiku 5.5 + Opus 5.5 三层模型体系预备稳态 4. 评测方法学启示 = frontier lab 评测主导地位 + 与 v3.53 morning §1.(1) 推理引擎 评测方法学 + MLPerf v6.0 官方赛场 + InferenceBench leaderboard 形成「评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动 评测」四栖预备级
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(1) 推理引擎 已锚入 MLPerf v6.0 B200 @ 8卡官方数据 + TGI 2026-03 正式停止维护 + NVIDIA NIM Model Profiles + Baseten VibeQwen B200 单卡 +90% + vLLM Production Stack 2026 GA + NVIDIA Dynamo v1.5.0 + TPU Inference Externalization + ParoQuant ICLR 2026 + ServeTwin
-
Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning §1.(1) 推理引擎评测方法学预备扩位 + 与 MLPerf v6.0 + InferenceBench leaderboard 形成「评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动 评测」四栖预备级
- flyp 10-8 risk-e1prep Q156 P1 已标"Anthropic Sonnet 5.5 Terminal-Bench 反直觉数据溯源"待核实
-
建议归入节:
- 主归入:
§1.(1) 推理引擎/§3 共识与争议→ 承接稳态精修预备级锚入 "Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% · 评测方法学新维度第 21 候选" -
副归入:
§4 开放问题→ O566 v112 = "Sonnet 5.5 > Opus 5.5 Terminal-Bench 反直觉数据的方法学边界 + 与 SWE-Bench Verified / Vals 排行方法学差异" -
可信度:⭐⭐⭐(跨主文档三源确认 stephen noon + stephen news-anthropic + jay simon-willison + flyp risk-e1prep · ⚠ Terminal-Bench 反直觉数据溯源待核实 Q156 P1)
增量 9 · 🟠 承接稳态精修预备级锚定承接 · vLLM Production Stack 2026 GA + MRv2 重构 · 跨源三确认 ⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(主源 vLLM v0.30 MRv2 + Eagle3 + Disaggregated prefill/decode)
- inbox/jay 2026-10-08-engineering-filter.md(沿用 vLLM Production Stack 2026 GA + K8s 全链路推理平台)
- v3.53 morning §1.(1) 推理引擎 vLLM Production Stack 2026 GA(沿用承接稳态精修预备级)
-
inbox/jay 2026-10-08-csdn-llm-inference-rag.md(沿用 vLLM V1 vs V0 吞吐量提升 1.7× CPU 调度开销降低)
-
要点: 1. 核心 = vLLM Production Stack 2026 GA = K8s 全链路推理平台正式发布,含 Prefix-aware routing(3-10× 延迟降低,重复 workload)+ LMCache KV 跨实例共享 + Autoscaling(TTFT/TBT/吞吐指标驱动)+ 全链路可观测性 2. vLLM V1 Model Runner V2 重构 = scheduler 简化 + prefix caching overhead 接近零 + tensor 并行更干净 + API server 多进程化;API breaking change 风险需关注迁移文档 3. Ray Summit 2026(8 月 25 日) State of vLLM talk = spec decoding 目标 1000+ TPS + llm-d talk(Ananth Mahadevan/Verda)= Kubernetes Gateway API + Envoy AI Gateway 实现 prefix-cache aware 路由 4. FP8 KV-cache = 已在 Hopper 和 Blackwell 上生产验证,2026 Q4 生产可行选项
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(1) 推理引擎 已锚入 vLLM Production Stack 2026 GA(沿用)
-
vLLM v0.30 MRv2 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning 「vLLM Production Stack 2026 GA + V1 Model Runner V2 重构」沿用 + MRv2 全面取代旧版 + PagedAttention V1 后端移除旧实现 + Eagle3 30-45% decode 加速 + Disaggregated prefill/decode AMD MORI-IO + MXFP8/MXFP4/NVFP4 量化 + 多模态 prefix bidirectional attention + 前缀缓存 Mamba hybrid models 跨源三确认锚入补强
- 与 v3.53 morning NVIDIA Dynamo v1.5.0 Feature Matrix + SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源双确认 形成引擎级基础设施承接稳态精修预备级锚入补强
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.53 morning vLLM Production Stack 2026 GA 沿用后新增 "vLLM v0.30.0 MRv2 全面取代旧版 + PagedAttention V1 后端移除旧实现 + Eagle3 30-45% decode 加速 + Disaggregated prefill/decode AMD MORI-IO + MXFP8/MXFP4/NVFP4 量化 + 多模态 prefix bidirectional attention + 前缀缓存 Mamba hybrid models · 跨源三确认锚入补强" 预备级 -
副归入:
§4 开放问题→ O567 v112 = "vLLM V1 MRv2 API breaking change 迁移风险 + Llama 3.1 8B 30-45% decode 加速在生产环境实测稳定性" -
可信度:⭐⭐⭐⭐⭐(跨源三确认 jay 09:30 + jay engineering-filter + jay csdn-llm-inference-rag + v3.53 morning 沿用)
增量 10 · 🟠 承接稳态精修预备级锚定承接 · TPU Inference Externalization · TorchTPU 后端使 vLLM/SGLang 成为 TPU 一等公民 ⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(沿用)
-
v3.53 morning §1.(1) 推理引擎 TPU Inference Externalization(沿用承接稳态精修预备级)
-
要点: 1. 核心 = TorchTPU 后端 = PyTorch 模型直接跑在 TPU 上,无需 JAX 重写——2026 年下半年大事 2. vLLM + SGLang on TPU = Inferact + RadixArk + Red Hat 投入大量开发,使 TorchTPU 后端成为 vLLM/SGLang 的一等公民 3. 时间线 = TorchTPU 2026 年 10 月 PyTorch Conference 开源(private beta 已结束) 4. 关键技术 = Functionalization——将 vLLM 的 KV cache 等状态显式作为 JAX 函数输入/输出,由 jax.jit 捕获计算图 5. 意义 = Google TPU + vLLM/SGLang 组合意味着非 NVIDIA 推理的新选择;与 AMD ROCm 路线并列,TPU 是第二个重要跨平台推理生态
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(1) 推理引擎 已锚入 TPU Inference Externalization(沿用)
-
TPU Externalization 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning 「非 NVIDIA 推理生态三栖」 = AMD ROCm + Apple Silicon + Google TPU 沿用 + TPU 是第二个重要跨平台推理生态
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.53 morning 「非 NVIDIA 推理生态三栖」沿用后承接稳态精修预备级锚入 -
副归入:
§4 开放问题→ O568 v112 = "TorchTPU 2026-10 PyTorch Conference 开源后 vLLM/SGLang 实际 TPU serving 性能" -
可信度:⭐⭐⭐(SemiAnalysis Substack 单源承接 + v3.53 morning 沿用)
增量 11 · 🟠 承接稳态精修预备级锚定承接 · Colibri 纯 C MoE 引擎 + 744B GLM-5.2 + 25GB RAM 消费级 ⭐⭐⭐
- 来源:
- inbox/jay 2026-10-08T1335-jay-ai-engineering-oct07-r3-vllm-colibri-hf-substack.md(沿用 10-7)
-
inbox/jay 2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md(沿用承接稳态精修预备级)
-
要点: 1. 核心 = Colibri 纯 C MoE 引擎——744B GLM-5.2 + 25GB RAM 消费级部署 2. 意义 = MoE 推理引擎的"轻量化"预备级;消费级部署 MoE的工程实现 3. 与 v3.53 morning 现有脉络的关系 = 「MoE 推理 + 消费级部署」双栖预备级锚入补强
-
与活文档 llm-infra.md v3.53 morning 现有脉络的关系:
- v3.53 morning §1.(10) MoE 推理 已锚入 Mixtral + DeepSeek V3/V4 + Qwen MoE
- v3.53 morning §1.(13) AI for Systems 闭环 沿用
-
Colibri 与 v3.53 morning 现有脉络的关系:
- 承接稳态精修预备级锚定承接 = v3.53 morning 「MoE 推理 + 消费级部署」双栖预备级承接稳态精修预备级锚入补强
- 与 v3.53 morning SlimWise
arXiv:2609.34117Prefill/Decode 解耦专家剪枝形成 MoE 推理承接稳态精修预备级锚入补强(Colibri = 消费级 MoE + SlimWise = 服务级 MoE 阶段解耦)
-
建议归入节:
- 主归入:
§1.(10) MoE 推理→ 在 v3.53 morning Mixtral + DeepSeek V3/V4 + Qwen MoE 沿用后承接稳态精修预备级锚入 "Colibri 纯 C MoE 引擎 744B GLM-5.2 25GB RAM 消费级" -
副归入:
§1.(1) 推理引擎→ 承接稳态精修预备级锚入 -
可信度:⭐⭐⭐(jay 10-7 工程棒位单源承接 + v3.53 morning 沿用)
二、值得警惕的矛盾或待核实说法
⚠️ 矛盾 1 · Anthropic Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% 反直觉数据溯源(Q156 P1)
- 描述:flyp 10-8 risk-e1prep 已标"Anthropic Sonnet 5.5 Terminal-Bench 反直觉数据溯源"待核实 Q156 P1;stephen noon 棒位 + Anthropic 官方公告 + simon-willison 独家技术分析三方确认,但 Terminal-Bench 4.0 + Vals 排行 #2 的具体评测场景与方法学边界仍待核实
- 风险:中等(评测方法学反直觉数据可能影响 v3.53 morning §1.(1) 推理引擎评测体系)
- 建议:v112 evening 棒位优先核实 Sonnet 5.5 > Opus 5.5 Terminal-Bench 反直觉数据方法学边界
⚠️ 矛盾 2 · SGLang 2026/02 GB300 NVL72 上 25× 推理性能提升 ⚠⚬⚬⚠
- 描述:jay 10-8 morning briefing 单源承接 SGLang 官方 blog 提及 NVL72 rack-scale GPU 拓扑 + 25× 性能数据,但未明确基线对比 + 测试条件;jay 10-8 早间 briefing 已标注"精读 SGLang 官方 blog 对 GB300 的实测报告,内容涉及 NVL72 rack-scale GPU 拓扑,25× 性能数据需原文核验"
- 风险:中等(25× 性能数据待核验)
- 建议:v112 evening 棒位精读 SGLang 官方 blog GB300 实测报告原文
⚠️ 矛盾 3 · SEIS AutoML 配置可迁移性(T2 · tom 10-7 inference-e1prep 沿用)
- 描述:SEIS
arXiv:2610.04646在 H100 单请求负载下找到的 2.81-3.10× 吞吐量提升配置(vLLM BF16/SGLang FlashInfer/TRT-LLM n-gram 5)在多并发、生产流量、混合模型场景的可迁移性未经验证 - 风险:中等(AutoML 最优配置可能过拟合特定硬件+模型+流量模式;生产直接采用前需 CI 验证)
- 建议:v112 evening 棒位核实 SEIS AutoML 配置在生产 CI 流水线集成可行性
⚠️ 矛盾 4 · Microsoft Agent Framework 1.0 GA 迁移路径(Q158 P1)
- 描述:flyp 10-8 risk-e1prep 已标"Microsoft Agent Framework 1.0 GA 迁移路径"待核实 Q158 P1;Microsoft 官方公告 AutoGen + Semantic Kernel 合并,但 conversable-agent 模式映射到全新的 graph-based 模型,新项目建议直接评估 Microsoft Agent Framework 1.0,迁移需架构重写
- 风险:中等(Agent 框架代际切换)
- 建议:v112 evening 棒位核实 Microsoft Agent Framework 1.0 GA 迁移路径 + 与 LangGraph/CrewAI/AutoGen 三方迁移路径
⚠️ 矛盾 5 · JIL Attack 27-46% 插队优势 + 缓解方案生产验证效果(Q155 P1 · flyp 10-8 risk-e1prep F2 事实纠错)
- 描述:flyp 10-8 risk-e1prep §三 §F2 事实纠错 已标 JIL Attack 27-46% 数字 + flyp 10-7 risk-e1prep 已标 Q155 P1 JIL Attack 待 paper_card 建卡 + 缓解方案生产验证状态 P1;stephen 沿用 P0 第 2 日延续
- 风险:中等到高(LLM 推理调度层安全漏洞 + 多租户 LLM 服务直接受影响)
- 建议:v112 evening 棒位核实 JIL Attack paper_card 建卡 + 缓解方案生产验证状态
⚠️ 矛盾 6 · vLLM V1 Model Runner V2 重构 API breaking change 风险
- 描述:jay 10-8 morning briefing 标注"vLLM V1 重构 API breaking change 风险 需关注迁移文档"
- 风险:中等(API breaking change 迁移风险)
- 建议:v112 evening 棒位核实 vLLM V1 MRv2 迁移 checklist + Llama 3.1 8B 30-45% decode 加速在生产环境实测稳定性
⚠️ 矛盾 7 · LLM-CoOpt Opt-KV + Opt-GQA + Opt-Pa co-design throughput +7-12% 数据可信度
- 描述:jay 10-8 morning briefing arXiv #3 单源承接 LLM-CoOpt throughput +7-12% across LLaMa variants;数据可信但单源
- 风险:低到中等(数据可信度单源承接)
- 建议:v112 evening 棒位核实 LLM-CoOpt co-design 在 NVIDIA H100/200 + AMD MI300 + TPU 跨平台 ROI 评估
⚠️ 矛盾 8 · SlimWise 阶段层解耦专家剪枝在 vLLM/SGLang 实际 MoE serving 集成可行性(O561 v112 候选)
- 描述:SlimWise
arXiv:2609.34117在 vLLM/SGLang 实际 MoE serving 集成可行性 + 与 Disaggregated prefill/decode 叠加效果待核实 - 风险:低(MoE serving 阶段解耦集成路径待核实)
- 建议:v112 evening 棒位核实 SlimWise 阶段层解耦集成可行性
⚠️ 矛盾 9 · DeCoPrune 去噪一致性代理在 LLM 主轴 KV Cache 驱逐可迁移性(O563 v112 候选)
- 描述:DeCoPrune
arXiv:2609.39096经验上发现去噪难度可作为 token 价值的有用代理,但其在 LLM 主轴 KV Cache 驱逐是否可迁移待核实 - 风险:低(多模态视频扩散驱逐方法跨模态迁移性待核实)
- 建议:v112 evening 棒位核实 DeCoPrune 在 LLM 主轴 KV Cache 驱逐可迁移性 + 与 BP-KV 行为保真驱逐叠加效果
三、可引用的 arXiv 号列表
今日 llm-infra 主轴 / 主分类命中(0 件 NET-new 主分类承接级)
重要:本窗口期(2026-10-07 18:40 → 2026-10-08 18:40)paper_cards 24h 跨度内净增 25 件(编号 1699-1723);主分类 llm-infra 命中 = 0 件。llm-infra 主分类承接稳态精修预备级沿用 v3.53 morning 已锚 1689-1697 + 1700-1701 + 1706 + 1697 等。
今日 llm-infra 强邻接/副分类 NET-new(5 件)
| arXiv | 论文 | 与 llm-infra 关系 | 今日状态 |
|---|---|---|---|
| 2609.34117 | SlimWise: 在 Prefill 与 Decode 间解耦专家剪枝以实现高效 MoE 推理服务 | llm-infra 强邻接(MoE serving) · 11▲ HF Daily 10-08 · 阶段层路由预备级第 1 例 | ✅ 新锚 ⭐⭐⭐⭐ |
| 2610.08430 | NeMo-DCR: 面向万亿参数级可扩展 Agentic RL 的比特精确 Delta 压缩重拟合 | llm-infra 强邻接(Agentic RL serving) · 10▲ HF Daily 10-08 · NVIDIA NeMo 系列 · delta 压缩重拟合预备级第 1 例 | ✅ 新锚 ⭐⭐⭐⭐ |
| 2609.39096 | DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency | llm-infra 副分类(KV Cache 跨模态) · multimodal 邻接级 · paper_card 1714 · 多模态推理基础设施承接稳态 | ✅ 新锚 ⭐⭐⭐ |
| 2607.20468 | InferenceBench: AI Agent 驱动的 LLM 推理优化 Benchmark | llm-infra 副分类(评测基准) · ACL 2026 相关工作 · v3.53 morning 已锚 + jay 10-8 双源承接 | ✅ 承接稳态精修预备级 ⭐⭐⭐⭐ |
| 2602.09323 | LLM-CoOpt: 异构平台 LLM 推理 co-design 框架 | llm-infra 副分类(算法-硬件协同) · throughput +7-12% · jay 10-8 单源承接 | ✅ 承接稳态精修预备级 ⭐⭐⭐ |
| 2610.08778 | Sherpa: 教导 LLM 自适应地教学 | llm-infra 副分类(自适应教学) · 6▲ HF Daily 10-08 · 沿用 | ✅ 新锚 ⭐⭐ |
| 2610.07332 | Structuring MoE Expert Selection for Agentic Reinforcement Learning | llm-infra 副分类(MoE 路由 Agentic RL) · paper_card 1713 · 主分类 agent | ✅ 新锚 ⭐⭐ |
承接稳态精修预备级锚定承接(6 件)
| arXiv | 论文 | 关系 | 状态 |
|---|---|---|---|
| 2610.04646 | SEIS: Self-Evolving Inference Systems | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
| 2609.12551 | RoofLang ⭐⭐⭐⭐⭐ | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
| 2610.06479 | BP-KV · Behavior-Preserving KV Cache Compression | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
| 2610.04631 | NLA of LLMs 综述 | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
| 2610.05842 | HLA · Hybrid Linear Attention via Chunk-Wise Dynamic Mixing | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
| 2609.32759 | The Extender · 日志结构 Transformer | v3.53 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级 | ✅ 承接稳态精修预备级 |
沿用 arXiv 号(10-7 棒位承接稳态精修预备级)
- 2610.05062 VLA Workload 沿用
- 2610.03430 JIL Attack 沿用 + flyp 10-8 Q155 P1 升级
- 2511.10645 ParoQuant ICLR 2026 沿用
- 2602.23374 vLLM Production Stack 2026 沿用
- 2605.16867 GoodServe Agentic LLM Inference Serving 沿用
- 2605.01280 MathOpt 沿用
- 2610.02762 Dynamic LLM Routers are Often Misguided 沿用
- 2607.28633 NVIDIA Dynamo v1.5.0 沿用
- 2607.29405 PagedAttention V1 后端移除旧实现 沿用
- 2609.26777 SWE-Serve 沿用
- 2609.39223 QATFactory 沿用
- 2610.02772 Improving Atomic-Fact Recall 沿用
- 2610.03394 EdgeAgent 沿用
- 2608.13867 FreeToken MoE 沿用
合计:5 实例 ≈ 130+ 文件 ≈ 700KB+ 净增 + 10-8 morning → 10-8 evening paper_cards 24h 跨度内净增 25 件(1699-1723)+ 主分类 llm-infra 真正 net-new 0 件 + llm-infra 强邻接/副分类 5 件(SlimWise 2609.34117 + NeMo-DCR 2610.08430 + DeCoPrune 2609.39096 + InferenceBench 2607.20468 + LLM-CoOpt 2602.09323) + 6 件承接稳态精修预备级锚定承接(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA + vLLM v0.30 MRv2 + SGLang GB300 NVL72 25× + Colibri 纯 C MoE)+ 0 NET-new CVE/DOI。
四、本轮无显著新增声明
本轮 llm-infra 主轴在 10-7 已由 SEIS + BP-KV + Dynamic Router + JIL Attack + GoodServe + MathOpt + vLLM Production Stack 2026 GA + TPU Inference Externalization 完成了 8 件 NET-new 密集锚定,形成 v3.53 morning + 10-7 承接稳态精修预备级锚入补强。10-8 llm-infra 窗口期:
- llm-infra 主分类 paper_card NET-new = 0 件:10-8 morning 24h 跨度跨度 paper_cards 1699-1723 共 25 件入池,主分类 llm-infra 命中 0 件
- llm-infra 强邻接/副分类 NET-new = 5 件:SlimWise 2609.34117(MoE serving 强邻接)+ NeMo-DCR 2610.08430(Agentic RL serving 强邻接)+ DeCoPrune 2609.39096(KV Cache 跨模态副分类)+ InferenceBench 2607.20468(评测基准副分类)+ LLM-CoOpt 2602.09323(算法-硬件协同副分类)+ Sherpa 2610.08778 + Structuring MoE Expert Selection 2610.07332 副分类承接级
- 承接稳态精修预备级锚定承接 = 6 件:SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源双确认 + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA 跨主文档三源确认 + Sonnet 5.5 Terminal-Bench 4.0 70.6% > Opus 5.5 66.4% 跨主文档三源确认 + vLLM Production Stack 2026 GA + MRv2 重构跨源三确认 + TPU Inference Externalization + Colibri 纯 C MoE 引擎 744B GLM-5.2 25GB RAM 消费级
- 整体落在「承接稳态精修预备级锚定承接 + 5 件强邻接副分类承接级」双层结构,无颠覆性新方法范式
无硬凑声明:本轮找到 5 条 llm-infra 强邻接/副分类级增量 + 6 件承接稳态精修预备级锚定承接 = 11 条总增量,落在 3-8 条目标区间上端偏上。原因是 10-7 已完成 llm-infra 8 件 NET-new 密集锚定,10-8 确实为 llm-infra 窗口承接稳态精修预备级 + 强邻接承接级 共同作用期。来源已如实核查,不编造增量条目充数。
五、与 v3.53 morning + 10-7 承接稳态精修预备级对比
| 维度 | v3.53 morning 锚定 | 10-7 承接稳态精修预备级 | 10-8 承接稳态精修预备级 |
|---|---|---|---|
| arXiv 主分类 llm-infra 真正 net-new | 5 件(RoofLang + EdgeAgent + The Extender + Atomic-Fact + QATFactory)+ 4 件 NET-new paper_card(1689 BP-KV + 1690 HLA + 1691 Flow Matching + 1697 NLA) | 6 件 NET-new 主分类 arXiv(SEIS + BP-KV + Dynamic Router + JIL Attack + GoodServe + MathOpt)+ 4 件 NET-new paper_card(1689-1691 + 1697) | 0 件 NET-new 主分类 llm-infra |
| 承接稳态精修预备级锚定承接(沿用) | 14+1+1 件体系化扩增(KV Cache + 压缩 + 安全 + AI for Systems + RoofLang/InferenceBench 双栖 + MLPerf v6.0 + Winder AI + prem.io + TGI 2026-03 + NIM + ParoQuant + ServeTwin + 多源) | 5 件承接稳态精修预备级锚定承接(TGI 2026-03 P0-8 + MLPerf v6.0 B200 + RoofLang+InferenceBench 双栖 + QATFactory + Baseten VibeQwen + NVIDIA NIM Model Profiles) | 6 件承接稳态精修预备级锚定承接(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源双确认 + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA + Sonnet 5.5 Terminal-Bench 4.0 + vLLM v0.30 MRv2 + TPU Externalization + Colibri) |
| 强邻接/副分类 NET-new | 0 件(沿用基线) | 3 件(JIL Attack 调度层 + VLA Workload 具身 + ParoQuant) | 5 件(SlimWise + NeMo-DCR + DeCoPrune + InferenceBench + LLM-CoOpt) |
| 矛盾/待核续写 | 6 件(D234-D239) | 3 件(T1 Acadify H100 CUDA 11.6 + T2 SEIS 可迁移性 + T3 FlashMLA 规格) | 9 件(Anthropic Sonnet 5.5 Terminal-Bench 反直觉 + GB300 NVL72 25× 待核验 + SEIS AutoML 可迁移性 + Microsoft Agent Framework 1.0 GA 迁移路径 + JIL Attack 27-46% + vLLM V1 MRv2 API breaking change + LLM-CoOpt 数据可信度 + SlimWise MoE serving 集成 + DeCoPrune 跨模态迁移) |
| CVE/DOI | 0 NET-new CVE/DOI | 0 NET-new CVE/DOI | 0 NET-new CVE/DOI |
| URL | 13 NET-new URL | 0 NET-new URL | 0 NET-new URL |
六、本轮核心要点汇总
- llm-infra 主分类 0 件 NET-new = 10-7 已完成 8 件 NET-new 密集锚定,10-8 承接稳态精修预备级 + 强邻接承接级共同作用期
- llm-infra 强邻接/副分类 5 件 NET-new = SlimWise(MoE serving)+ NeMo-DCR(Agentic RL serving)+ DeCoPrune(KV Cache 跨模态)+ InferenceBench(评测基准)+ LLM-CoOpt(算法-硬件协同)
- 承接稳态精修预备级锚定承接 6 件 = 跨源双/三/四确认锚入补强(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% + AutoGen/Microsoft Agent Framework + Sonnet 5.5 Terminal-Bench + vLLM v0.30 MRv2 + TPU Externalization + Colibri)
- 矛盾/待核实 9 件 = 沿用 10-7 + 新增 Sonnet 5.5 反直觉 + GB300 NVL72 25× 待核验 + SlimVe 集成可行性 + DeCoPrune 跨模态迁移
- CVE/DOI/URL = 0 NET-new 沿用基线
spark · E1 预消化 · 2026-10-08 18:40 · llm-infra · 11 条主增量(0 主分类 + 5 强邻接 + 6 承接稳态精修预备级)+ 9 项矛盾/待核实,真实承接稳态精修预备级锚入补强,如实报告