llm-infra · E1 预消化简报(2026-09-25)
执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-25 18:40 CST 窗口定义:2026-09-24 18:42 CST(v3.41 evening 升档棒闭合 → spark 9-24 llm-infra e1prep 18:42)→ 2026-09-25 18:40 CST(本棒位)≈ 24h 滑动窗口 底本:
organized/knowledge/llm-infra.mdv3.42(2026-09-25 05:00 CST · §IX 103 morning 升档棒)+organized/paper_cards/Sep 23-25 NET-new + inbox/{jay,tom,flyp,stephen,spark}/ 近 2 天 llm-infra 相关产出
状态摘要
- 增量条数:5 条主增量(在 3-8 目标区间内)+ 2 件承接稳态精修预备级锚定(下棒位 v3.43 实质锚入预备级候选)
- 核心新增:① vLLM 延迟优化实战真实 benchmark 数据(Llama 3-1-70B A3 Mega 8×H100 · max-num-seqs 512/256/128 + max_num_batched_tokens 2048 · TTFT 17.71→30.86ms · TPOT 16.6→12.97ms · latency-throughput trade-off 完整)② SGLang vs vLLM 2026 Q3 横向多源交叉验证(H100 Llama 3.1 8B: SGLang ~16,200 / vLLM ~12,500 tok/s · 差距 ~29% · 多源独立对账)③ Jev / TypeSafe AI System One 决策生态成形(deepopen 1k★/4d + Nokia AnyJev 541★ + 7+ 同源仓 + 非自回归 typed decision 50ms 前向)④ vLLM 2026-09 官方博客扫描 · 8 条最新工程议题(Tiered KV Cache Offloading + AgentX + Kimi K3 2.8× + Novita INT4 MoE 1.3×/2.15× + GLM 5.3 HiSparse + vLLM-Omni 视频字幕 + H3 实时视频推理)⑤ paper_card 1509
arXiv:2609.27980Six Layers Less + paper_card 1503arXiv:2609.25963GeoPair + paper_card 1508arXiv:2609.27158Linear Representation Hypothesis —— 3 件 NET-new llm-infra 副/主分类 于 9-25 02:10→15:00 入库(v3.42 morning 棒位之后) - 承接稳态精修预备级锚定(2 件):①
arXiv:2609.27334JIT Memory 跨 agent 主分类锚入 ②arXiv:2609.25853MemoryAthena 双锚(rag 主 + llm-infra 邻接) - 重大警示:stephen 9-25 1245 noon 协调棒位 §B2 警示:spark 9-25 llm-infra-e1prep 主棒位延续第 4 日缺口(与 9-22/9-23/9-24 同型),本棒位即为 spark 9-25 主棒位产出
- HF 生态侧稳态:HF 9 月下载榜 / Claude Opus 5.5 / Arena WebDev #1 / HF 收购 NVIDIA 影响在 v3.42 §0.5.1 已锚定续立
- 涉及 arXiv 号:本次新增 NET-new 3 个(2609.27980 + 2609.25963 + 2609.27158)+ 承接稳态精修预备级锚定 2 个(2609.27334 + 2609.25853)+ 续用锚定约 50+ 个(v3.42 morning 沿用)
一、检查过的来源清单
| 来源目录 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| inbox/jay | 2026-09-25-llm-inference-agent-engineering.md(10:51 · 8.6KB · vLLM 延迟优化实战真实 benchmark 数据 + 推理引擎对比 + vLLM 2026-09 官方博客扫描 + AI Agent 开源生态) | 极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-09-25-inference-agents-systems.md(11:07 · 14KB · Vector DB 选型 2026 + KV Cache Optimization 2026 工程指南 + vLLM/SGLang/TGI/TensorRT-LLM 横评 + ISCA 2026 KV Cache 论文族 + GitHub Trending 9 月) | 极高 |
| inbox/jay | 2026-09-25-engineering-e1prep.md(11:23 · 22KB · 5 件主增量含 SitePoint vLLM K8s Manifest + DevRim Substack 47→12 分钟故障压缩 + K8s 7 坑) | 极高(承接 llm-infra 交叉) |
| inbox/jay | 2026-09-25T0820-jay-csdn-substack-inference-rag-highvalue-sep25.md(08:20 · CSDN RAG/inference 8 条 + Substack Ken Huang KV Cache 系列) | 极高 |
| inbox/jay | 2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md(13:35 · SGLang/vLLM H100 benchmark + Ken Huang KV Cache 系列 + Jev 生态新立) | 极高 |
| inbox/jay | 2026-09-25T1735-jay-inference-agent-mcp-memory-vecdb-trending-sep25.md(17:35 · PagedAttention 60-80% VRAM 浪费数据 + Qwen3-30B 双卡实测 + KV Cache Optimization 2026 工程指南完整版) | 极高 |
| inbox/jay | 2026-09-25T1620-jay-csdn-rag-agent-finetuning-highvalue.md(16:20 · RAG 五关键优化 + 8 大 Agent 架构 + LangGraph checkpointer) | 邻接 |
| inbox/jay | 2026-09-25-csdn-llm-rag-multimodal-research.md(12:21 · CSDN 6 条 RAG/Agent/多模态) | 邻接 |
| inbox/jay | 2026-09-25-1001-rss-msr-blog.md / 1001-rss-cool-papers-ir.md / 1000-rss-cool-papers.md / 1000-rss-nathan-benaich.md / 1000-rss-raschka.md / 1001-rss-lilian-weng.md / 1001-rss-import-ai.md / 1002-rss-yt-fireship.md / 1000-rss-bytebytego.md / 1000-rss-simon-willison.md(10 件 RSS) | 中(arXiv/HF/AI 行业趋势) |
| inbox/tom | 2026-09-25-0900-hf-daily-2026-09-25.md(09:00 · HF Daily 15 件立标信号 · 立标池结构性洗牌第 9 次确认) | 中(Agent 主轴) |
| inbox/tom | 2026-09-25-0840-agent-rag-longcontext-radar.md(08:40 · 8 件候选含 GeoPair + Linear Representation Hypothesis 跨主轴承接) | 极高(承接 paper_card 1503 + 1508) |
| inbox/tom | 2026-09-25-rag-e1prep.md(08:52 · R101 · 5 件增量含 SGLang vs vLLM H100 benchmark) | 高(承接稳态) |
| inbox/tom | 2026-09-25-evaluation-e1prep.md / 2026-09-25T1440-agent-rag-longcontext-radar.md / 2026-09-25-1002-rss-yt-lex-fridman.md / 2026-09-25-0900-hf-daily-2026-09-25.md | 邻接 |
| inbox/flyp | 2026-09-25-multimodal-e1prep.md / risk-e1prep.md / flyP-critical-read-VLD-RAG.md / flyP-critical-read-Spatial-Interactor-CrossAttentionGap.md / 1000-rss-cameron-wolfe.md / 1001-rss-interconnects.md / 1002-rss-yt-ai-explained.md / 1002-rss-yt-two-minute-papers.md | 中(multimodal 主轴邻接) |
| inbox/spark | 2026-09-25-1000-rss-gradient-flow.md / 1001-rss-chip-huyen.md / 1002-rss-yt-3blue1brown.md / agent-e1prep.md(13:35 · v102 跨主轴承接) | 中(沿用) |
| inbox/stephen | 2026-09-25-1245-stephen-coordination-check-noon.md(12:45 · 跨实例窗口盘点 · §B2 警示 spark 9-25 llm-infra-e1prep 主棒位延续第 4 日缺口 · 立标池结构性洗牌第 9 次确认 · 推理引擎深度延续第 3 日高位) | 极高(协调棒承接) |
| inbox/stephen | 2026-09-25-ai-industry-e1prep.md / 1001-news-openai-news.md / 1002-news-google-ai.md / 1002-news-hf-blog.md / 1002-news-bens-bites.md / 1002-news-tldr-ai.md / 1003-news-yt-deepmind.md / 1002-news-anthropic-news.md / 0910-news-x-vip-radar.md / 1003-news-yt-openai.md / 1003-news-yt-anthropic.md(11 件 RSS/news) | 中(AI 行业主轴) |
| paper_cards Sep 25 02:10 | 1501-2609-27980(Six Layers Less · 主分类 llm-infra · 9-25 02:10 入库 · v3.42 morning 棒位之后) | NET-new 极高 ⭐⭐⭐⭐ |
| paper_cards Sep 25 12:30 | 1503-2609-25963(GeoPair · 主分类 engineering · 副分类 llm-infra · 9-25 12:30 入库 · v3.42 morning 棒位之后) | NET-new 高 ⭐⭐⭐ |
| paper_cards Sep 25 15:00 | 1508-2609-27158(Linear Representation Hypothesis · 主分类 llm-infra · 形态 position · 9-25 15:00 入库 · v3.42 morning 棒位之后) | NET-new 中 ⭐⭐ |
| paper_cards Sep 25 02:10 | 1492-2609-27334(JIT Memory · 主分类 agent · 副分类 memory · 9-25 入库 · 承接稳态精修预备级锚定) | 承接稳态精修 |
| paper_cards Sep 25 02:10 | 1493-2609-27308(EmbodiedSWE · 主分类 agent) | 邻接 |
| paper_cards Sep 25 02:10 | 1494-2609-28473(On the Diffusibility of High-Dimensional Latents · 主分类 engineering) | 邻接 |
| paper_cards Sep 25 02:10 | 1495-2609-27901(All modalities are equal · 主分类 multimodal) | 邻接 |
| paper_cards Sep 25 02:10 | 1496-2609-28470(StudentBench · 主分类 evaluation) | 邻接 |
| paper_cards Sep 25 02:00 | 1497-2609-24308(HappyWorld-Bench · 主分类 evaluation) | 邻接 |
| paper_cards Sep 25 04:00 | 1474-2609-20869(TAPe+ML · 主分类 multimodal) | 邻接 |
| paper_cards Sep 25 04:00 | 1475-2609-06052(SkillSpec · 主分类 agent) | 邻接 |
| paper_cards Sep 25 04:00 | 1476-2609-26774(StableVQ · 主分类 engineering) | 邻接 |
| paper_cards Sep 25 04:00 | 1477-2609-25804(Tasteful Agent · 主分类 agent · tom 9-25 HF Daily #1 升档承接) | 承接稳态精修 |
| paper_cards Sep 25 04:00 | 1478-2609-24657 / 1479-2609-24058 / 1480-2609-25199 / 1481-2609-24967 / 1482-2609-25247 / 1483-2609-22323(各自邻接) | 邻接 |
| paper_cards Sep 25 04:00 | 1484-2609-26346(Blaming Across the Aisle · v3.42 已锚入主分类误标 ⚠⚠) | 矛盾/沿用 |
| paper_cards Sep 25 04:00 | 1489-2609-25053(LatentPort · v3.42 已锚入预备扩增预备级 ⚠) | 承接稳态 |
| paper_cards Sep 25 02:00-15:00 | 1500-2609-27657(FLEET) / 1502-2609-24815 / 1504-2609-26489(Calibration) / 1505-2609-25853(MemoryAthena · 承接稳态精修预备级锚定) / 1506-2609-25187 / 1507-2609-26637 / 1509-2609-26634 / 1510-2609-22682(各自邻接) | 邻接 |
| work-queue | 2026-09-25 18:00(待深度解读 Top 15 / 共 5 · 5 件已锚定 2609.23087/23407/28923/29421/29837,均为非 llm-infra 主分类) | 中(llm-infra 主轴无新增 Top 0.5) |
已检查但未发现 llm-infra NET-new:inbox/spark 三场 RSS(gradient-flow / chip-huyen / 3blue1brown · 全部沿用 0 net-new)、tom 9-25 1440 radar(主轴 agent 跨主轴承接,llm-infra 主轴无新增)、flyp 9-25 multimodal 主棒位(multimodal 主轴不涉及 llm-infra)、stephen 9-25 ai-industry 主棒位(ai-industry 主轴不涉及 llm-infra)。
二、增量条目(5 主增量 + 2 承接稳态精修预备级锚定)
增量 1:vLLM 延迟优化实战真实 benchmark 数据(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-25-llm-inference-agent-engineering.md §条目 1(10:51)+ inbox/jay/2026-09-25-inference-agents-systems.md 沿用 + 原始来源 Google Developer Forums(vLLM 官方文档)+ discuss.google.dev/t/optimizing-llm-inference-for-minimal-latency-with-vllm/289241
URL:https://discuss.google.dev/t/optimizing-llm-inference-for-minimal-latency-with-vllm/289241(vLLM 官方文档 + 实测数据)
要点:Llama 3-1-70B · A3 Mega 8×H100 · max_num_batched_tokens=2048 · req-rate=5:
| max-num-seqs | TTFT (ms) | TPOT (ms) | e2e (s) |
|---|---|---|---|
| 512 | 17.71 | 16.6 | 1.48 |
| 256 | 29.67 | 12.70 | 1.06 |
| 128 | 30.86 | 12.97 | 1.04 |
1000 并发请求 benchmark(完整输出片段):
Successful requests: 1000
Request rate (RPS): 5.00
Total input tokens: 1,498,021 / output tokens: 79,901
Output token throughput: 397.09 tok/s
Mean TTFT: 30.88 ms (P99: 40.34 ms)
Mean TPOT: 12.94 ms (P99: 14.11 ms)
Mean ITL: 12.92 ms (P99: 16.48 ms)
关键工程结论:max-num-seqs 越低,端到端延迟越低,但吞吐下降;存在 latency-throughput trade-off,工程上需按 SLA 目标选定
可信度:★★★★★ — vLLM 官方文档 + Google Developer Forums 实测数据 + 完整 benchmark 命令可复现
与活文档现有脉络的关系:llm-infra.md §1.(1) 推理引擎已锚定 vLLM v0.30.0 release 762 commits + Model Runner V2 全面默认化(v3.41 evening 棒位),本条是承接该锚定的官方延迟优化 benchmark 数据补充;与 §0.5.1 v3.42 morning 已锚定的 vLLM Prefix Caching GPU 利用率 Bug(GitHub #8242 · 7B→0.95 / 13B→0.85 / 70B→0.90)+ SitePoint vLLM Production K8s Manifest(0.8 safe zone H100 80GB)形成「延迟优化官方数据 + Prefix Caching bug + K8s manifest 0.8 safe zone」三件套;与 v3.40 已锚定的 vLLM FP8 KV-Cache 验证报告 2026-09 形成「延迟优化 vs KV cache 压缩」双轨
建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(vLLM 延迟优化实战 · Llama 3-1-70B A3 Mega 8×H100 · max-num-seqs 512/256/128 + max_num_batched_tokens 2048 · TTFT 17.71/29.67/30.86ms · latency-throughput trade-off 完整 + 1000 并发 benchmark 命令可复现)
待核验:max-num-seqs=2048/4096 极端值 benchmark(本棒位未独立核实,沿用 jay 沿用官方数据)
增量 2:SGLang vs vLLM 2026 Q3 横向多源交叉验证(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-25-llm-inference-agent-engineering.md §条目 5(10:51)+ inbox/jay/2026-09-25-inference-agents-systems.md §backend §条目 4-5 + inbox/jay/2026-09-25T0820-jay-csdn-substack-inference-rag-highvalue-sep25.md §二 + inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md §二 + inbox/tom/2026-09-25-rag-e1prep.md §增量 ② + inbox/stephen/2026-09-25-1245-stephen-coordination-check-noon.md §协调棒位对账 + 原始来源 Spheron + DeployBase + Morph + Yotta Labs + GMI Cloud + TensorMesh(2026 Q3 多源独立 benchmark)
URL:
- https://www.spheron.network/blog/vllm-vs-sglang-2026
- https://www.tensormesh.ai/learn/vllm-vs-sglang(2026-09-15)
- https://www.misar.blog/@synor/articles/vllm-vs-sglang-vs-tensorrt-llm
- https://medium.com/@wojdylak.michal/llm-inference-benchmarks-vllm-vs-sglang-vs-tensorrt-llm-on-a-single-l40s-8976d46a7ef3
要点(H100 单卡, Qwen2.5-7B):
| Engine | 吞吐量 (tok/s) | TTFT (单请求) | TTFT (100并发) | 关键配置 |
|---|---|---|---|---|
| SGLang v0.4.3 | ~16,200 | ~42ms | ~710ms | RadixAttention prefix caching |
| LMDeploy Latest | ~16,200 | ~40ms | ~700ms | Persistent batch scheduling |
| vLLM v0.7.3 | ~12,500 | ~45ms | ~740ms | PagedAttention, enable_prefix_caching=True |
| TensorRT-LLM Latest | 最高(编译后) | ~38ms | ~650ms | FP8/INT8 编译 |
Qwen3-30B-A3B 双卡(2026 Q3 最新): - SGLang 领先优势扩大:prefix-heavy 场景下缓存复用率 75-95% - 30B MoE 模型 vLLM 瓶颈在调度开销(不是 PagedAttention 内核)
架构收敛迹象(Turion.ai 2026 9 月): - FlashInfer 内核共享:2026-04 NVIDIA 通过 FlashInfer 开源了原本只有 TensorRT-LLM 才有的内核,vLLM 和 SGLang 现在消费同一套内核 - 调度器战争取代内核战争:同样 FlashInfer 内核下,SGLang 仍比 vLLM 保持吞吐量优势,根本瓶颈在引擎内部调度开销而非内核质量 - 分离式推理(Disaggregated Serving):将 prefill 和 decode 部署在不同 GPU 类型上,生产环境可获得 30-50% 吞吐量提升(比换引擎更有价值) - KV Cache 优化四维度:Paged / Compressed / Offloaded / Shared,可将并发请求量提升 2-4x
Qwen3-32B-FP8 L40S(c=8 · ISL=8000 · OSL=512): - vLLM 41.0 tok/s / TTFT 63.8s - SGLang 38.2 tok/s / TTFT 68.6s - c=8 时 vLLM TTFT 834ms,2.4× 快于 SGLang (2029ms),3× 快于 TensorRT-LLM (2541ms)(低并发延迟优势) - SGLang ITL 一致性:全并发级别 Inter-token latency 最低(60.6→76.6→77.8ms),流式输出最平滑 - 并发天花板:c=32→c64 vLLM/SGLang 吞吐量增益 <1%,TensorRT-LLM 仍提取 18% 增益(但 ITL 升至 124.4ms)
Qwen3-30B-A3B 双卡 多节点扩展衰减:vLLM 1→4 节点时, Llama 3.1 70B 吞吐量预期下降 20-30%(KV cache 跨节点通信瓶颈)
TensorRT-LLM vs vLLM 边际决策: - 单次推理(冷启动):TensorRT-LLM 编译 28 分钟 + 推理;vLLM 62 秒到首请求 - 并发 <20 请求:成本差距 <5%,vLLM 更优 - 并发 >50 请求:TensorRT-LLM 领先 12-16% - 工程维护成本:TensorRT-LLM 高(CUDA 版本绑定);vLLM 低(Python 原生) - 建议:工程迭代阶段用 vLLM;流量稳定后迁移到 TensorRT-LLM 做成本优化
可信度:★★★★★ — 5+ 独立来源(Spheron + DeployBase + Morph + Yotta Labs + GMI Cloud + TensorMesh + misar.blog + Medium)交叉对账一致;stephen 9-25 1245 noon 协调棒位§对账确认跨实例两棒位一致(jay engineering + tom R101 §增量 ②)
与活文档现有脉络的关系:llm-infra.md §1.(1) 推理引擎已锚定 vLLM v0.30.0 + SGLang v0.5.20 + SGLang BCG + TGI 维护模式 + 9-24 evening 棒位的 vLLM vs SGLang H100 Llama 3.1 8B(SGLang 16,215 / vLLM 12,553 tok/s · 差距 29% ≈ $15,000/月),本条是承接该锚定的 2026 Q3 多源横向验证 + 决策树更新;与 v3.41 evening §0.5.1 已锚定的 NVIDIA Dynamo 1.0 GA + Multi-Agent 级联故障 100% 形成「推理引擎横向对比 + 推理引擎纵向生态」双角度;与 v3.40 已锚定的 KV Cache Serving 2026 Runtime 特性矩阵(vLLM TurboQuant 3bit + SGLang HiSparse + TRT-LLM KV Cache Connector API + Dynamo 1.0 KVBM)+ H100 Prefix Reuse 与 TTFT 特征分析 arXiv:2609.19657 形成「通用对比 + 引擎内部 KV cache 优化」双轨
建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(SGLang vs vLLM 2026 Q3 横向多源交叉验证 H100 Qwen2.5-7B · SGLang 16,200 / vLLM 12,500 tok/s · 差距 29% 来自 RadixAttention prefix caching 75-95% 复用率 · Qwen3-30B 双卡 SGLang 领先扩大 · L40S Qwen3-32B-FP8 低并发 vLLM 延迟优势 · 调度器战争取代内核战争 · FlashInfer 内核共享 · 分离式推理 30-50% 提升 · TensorRT-LLM 边际决策树)
待核验:Qwen3-30B-A3B 双卡实测具体数值(本棒位未独立核实,沿用 jay/TensorMesh/misar 多源对账)
增量 3:Jev / TypeSafe AI System One 决策生态成形(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md §一 + inbox/jay/2026-09-25T1735-jay-inference-agent-mcp-memory-vecdb-trending-sep25.md §二 + 原始来源 GitHub API + 多仓 README
URL:
- https://github.com/deepopen-com/deepopen(1014★ · 2026-09-21)
- https://github.com/nokia-applied-research/AnyJev(541★)
- https://github.com/jev-chat/jev-chat-windows(546★)
- https://github.com/Rizzo-AI-Academy/rizzo-flow(423★)
- https://github.com/kydlikebtc/awesome-jev(352★ · 1207 条资源)
- https://github.com/malevrigns/agent-jev(295★ · 0.6B System One 模型 · 50ms 前向 · 无 output token 解码)
- https://github.com/jev-chat/jev-chat-jarvis-mac(385★)
- https://github.com/shhivv/arc-cua(137★)
要点:Jev/TypeSafe AI System One 范式(2026-09 形成明确生态)核心主张:typed decision + calibrated probability + zero token decode,替代传统自回归 LLM 生成做"判断"场景
| 项目 | Stars | 创建时间 | 定位 | 可信度 |
|---|---|---|---|---|
deepopen-com/deepopen |
1014★ | 2026-09-21 | 非自回归 System 1 决策引擎,结构化类型决策 | ⭐⭐⭐⭐ 架构新颖 |
nokia-applied-research/AnyJev |
541★ | 2026-09-21 | 任意 LLM 转 Jev 风格决策,带类型校准 | ⭐⭐⭐⭐ Nokia 背书 |
malevrigns/agent-jev |
295★ | 2026-09 | 0.6B System One 决策模型 · 50ms 前向 · 无 output token 解码 | ⭐⭐⭐ 工程亮点突出 |
kydlikebtc/awesome-jev |
352★ | 2026-09-22 | Jev / TypeSafe AI System One 资源目录(1207 条) | ⭐⭐⭐⭐ 高质量 |
deepopen 架构创新: - 传统 LLM:逐 token 自回归生成 → 慢、浪费算力 - deepopen:给定输入 + 类型 schema,直接输出结构化决策(无逐 token 解码) - 适用场景:分类、路由、风险判断、意图识别(System 1 快速决策) - 技术细节:模型 multilingual + non-autoregressive;输出 typed decisions(非文本 token 序列);目标 50ms 级别前向传播(对比传统 LLM 500ms+)
AnyJev · Nokia 出品: - 核心价值:无需训练,直接将任意 LLM(GPT-4o、Qwen 等)转为 Jev 风格 typed decision 模型 - 输入:自然语言 query + 类型定义 - 输出:calibrated probability + typed decision - 工程优势:无需微调,现成 LLM 即可用
生态判断: - 4 天破千星(deepopen)+ Nokia 企业背书(AnyJev)+ 1207 条资源聚合(awesome-jev)+ 7+ 同源仓 = 新生态已成形 - 对 llm-infra 的意义:System 1 快速决策的 50ms 级延迟 可能重新定义"轻量推理"基线 - 与 vLLM/SGLang 长上下文推理形成两极分工:System 2 长思考 vs System 1 快速决策
可信度:★★★★ — GitHub Stars + 创建时间可验证 + 多仓对账(stephen 9-25 1245 noon §对账确认)
与活文档现有脉络的关系:llm-infra.md §1.(1) 推理引擎已锚定 vLLM v0.30.0 + SGLang v0.5.20 + SGLang BCG + TensorRT-LLM + TGI 维护模式,本条是邻接的新范式 / 新生态立标信号 —— 非自回归 typed decision 与现有自回归推理引擎形成两极分工;与 v3.42 morning 已锚定的 LatentPort 跨模型持久循环记忆迁移 + Complex KDA Kimi Delta Attention 形成「System 1 快速决策 + System 2 持久状态」端到端分工
建议归入章节:§1.(1) 推理引擎 · 邻接预备扩增(Jev/TypeSafe AI System One 决策生态成形 2026-09 · deepopen 1k★/4d + Nokia AnyJev 541★ + 7+ 同源仓 · 非自回归 typed decision 50ms 前向 · 1207 条 awesome-jev 资源 · 与自回归推理引擎两极分工)→ 建议作为 §1.(13) 新增 = System 1 决策范式
待核验:deepopen 0.6B 模型的具体架构(基于什么 base 训练)+ AnyJev 的类型校准机制实证(本棒位未独立核实,沿用 GitHub README)
增量 4:vLLM 2026-09 官方博客扫描 · 8 条最新工程议题(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-25-llm-inference-agent-engineering.md §条目 3(10:51)+ 原始来源 vLLM Project Blog(https://vllm-project.github.io)
要点(vLLM 官方博客 · 2026-09 扫描):
| 日期 | 标题 | 关键洞察 |
|---|---|---|
| 2026-09-18 | Scaling Multi-GPU Video Captioning with PyNvVideoCodec and vLLM | 多 GPU 视频字幕,vLLM-Omni |
| 2026-09-15 | vLLM x Novita AI: Chord, Faster INT4 MoE for Kimi K2.x | INT4 MoE 优化,H200 1.3× / B300 2.15× |
| 2026-09-13 | Kimi K3 Performance Optimizations: The Road to 2.8× Throughput | Kimi K3,vLLM 内核优化 2.8× 吞吐 |
| 2026-09-10 | Tiered KV Cache Offloading in vLLM | KV 缓存分层卸载 |
| 2026-09-08 | vLLM x AgentX: Optimizing for Real-World Agentic Serving | Agent 场景服务优化 |
| 2026-09-07 | GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading | GLM 5.3,HiSparse offloading |
| 2026-09-01 | MiniMax H3 on vLLM-Omni: Real-Time Serving with FastVideo | 视频模型实时推理 |
关键趋势判断: - vLLM 已成 LLM 服务标准栈(81K+ stars,GitHub Trending 持续高位) - 2026 下半年工程优化方向:MoE 稀疏化(INT4 MoE H200 1.3× / B300 2.15×)+ KV 卸载(Tiered KV Cache + HiSparse)+ Agent 场景优化(AgentX)+ 多模态(视频)推理(vLLM-Omni · H3 实时) - vLLM-Omni = vLLM 进军视频模型实时推理服务的关键标志(与 FastVideo 集成) - Tiered KV Cache Offloading 2026-09-10 博文 = v3.40 evening 已锚定的 KV Cache Serving 2026 Runtime 特性矩阵「vLLM 分层 KV Cache Offloading L0/L1/L2」的官方详细文档
可信度:★★★★★ — vLLM 官方博客(权威)+ 标题与发布日期完整
与活文档现有脉络的关系:llm-infra.md §1.(1) 推理引擎已锚定 vLLM v0.30.0 release 762 commits + Model Runner V2(v3.41 evening),本条是承接该锚定的 2026-09 月官方 8 条博文扫描;与 v3.40 evening 已锚定的 vLLM FP8 KV-Cache 验证报告 2026-09 + KV Cache Serving 2026 Runtime 特性矩阵(vLLM TurboQuant 3bit + SGLang HiSparse + TRT-LLM KV Cache Connector API)+ H100 Prefix Reuse 与 TTFT 特征分析 形成「官方月度更新 + 学术对照」双轨;与 v3.42 已锚定的 vLLM AgentX 真实 Agentic 流量优化(SemiAnalysis AgentX 基准 43 turns/session · 142K input · 96% prefix reuse)形成「vLLM AgentX 2026-09-08 博文 vs SemiAnalysis AgentX 基准」对账
建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定(vLLM 2026-09 官方博客 8 条 · Tiered KV Cache Offloading + AgentX 真实 Agentic Serving + Kimi K3 2.8× Throughput + Novita INT4 MoE H200 1.3×/B300 2.15× + GLM 5.3 HiSparse Offloading + vLLM-Omni 多 GPU 视频字幕 + MiniMax H3 实时视频推理)
待核验:vLLM-Omni 当前发布状态(是否 GA / 是否仅特定 commit 可用 · 本棒位未独立核实,沿用 jay 沿用官方博客)
增量 5:paper_card 1509 + 1503 + 1508 — 3 件 NET-new llm-infra 副/主分类于 9-25 入库(⭐⭐⭐⭐)
来源:organized/paper_cards/1509-2609-27980.md(9-25 02:10 入库 · v3.42 morning 棒位之后)+ organized/paper_cards/1503-2609-25963.md(9-25 12:30 入库 · v3.42 morning 棒位之后)+ organized/paper_cards/1508-2609-27158.md(9-25 15:00 入库 · v3.42 morning 棒位之后)+ inbox/tom/2026-09-25-0840-agent-rag-longcontext-radar.md 跨主轴承接
arXiv 号:arXiv:2609.27980 + arXiv:2609.25963 + arXiv:2609.27158
增量 5a:arXiv:2609.27980 Six Layers Less · Encoder Pruning for Whisper with Label-Free Recovery(⭐⭐⭐⭐)
标题中文:减少六层:面向 Whisper 的无标签恢复编码器剪枝
要点:
- 背景:Whisper 等 ASR 模型 decoder pruning 已广泛采用(whisper-large-v3-turbo 解码器从 32→4 层,Distill-Whisper 解码器到 2 层)
- 缺口:encoder pruning 无广泛采用的方案,因需要自定义推理实现才能利用压缩模型
- 方案:Label-Free Recovery encoder pruning,无需标签即可恢复 encoder 精度
- 形态:method · 主分类:llm-infra · 应用领域:ASR 推理 + 模型压缩 + 多模态
- 来源:inbox/tom/_candidates/2026-09-24-agent-rag-longcontext-candidates.json
可信度:★★★ — 预印本,主分类 llm-infra 准确(Whisper 推理 + 编码器剪枝是 llm-infra 核心范畴)
与活文档现有脉络的关系:llm-infra.md §1.(4) 量化 + §1.(10) 模型压缩 沿用 v3.40 已锚定的 vLLM FP8 KV-Cache 验证报告 + AMD ROCm TurboQuant + v3.42 已锚定的 FlashInfer FP8-FP16 混合精度,本条是承接锚定的 encoder pruning 方法学(目前活文档主要覆盖 KV cache 与权重压缩,encoder 压缩是新增维度);与 v3.41 evening §1.(1) 已锚定的 SGLang BCG + vLLM AgentX 形成「KV/算子优化 + 模型结构优化」双角度
建议归入章节:§1.(10) 模型压缩 · 承接稳态精修预备级锚定(Six Layers Less arXiv:2609.27980 · Whisper encoder pruning with Label-Free Recovery · 主分类 llm-infra · 2026-09-25 入库承接 v3.42 实质锚入预备扩增预备级)
增量 5b:arXiv:2609.25963 GeoPair · Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression(⭐⭐⭐)
标题中文:GeoPair:面向免训练 Transformer 压缩的几何保持跨层分解
要点:
- 背景:Transformer 存在跨层冗余,但 post-training compression pipelines 通常孤立优化各层或依赖启发式分组策略而忽略层特定的激活几何
- 方案:训练免费的、基于原理的框架,依次优化跨层权重配对和共享字典分解;不强制相邻层权重共享基或启发式合并激活统计,而是识别结构兼容的投影并学习一个更好保留激活几何的共享表示
- 形态:method · 主分类:engineering · 副分类:llm-infra
- 来源:inbox/tom/_candidates/2026-09-24-agent-rag-longcontext-candidates.json + OpenAlex backfill + inbox/tom/_candidates/2026-09-25-agent-rag-longcontext-candidates.json
可信度:★★★★ — OpenAlex 已收录(W7214089083 · DOI 10.48550/arxiv.2609.25963 · 2026-09-25 更新 · 开放获取 green)
与活文档现有脉络的关系:llm-infra.md §1.(10) 模型压缩 + §1.(1) 推理引擎 已锚定 FlashInfer + LoRAServe(v3.42),本条是承接锚定的 cross-layer 训练免费压缩方法(目前活文档主要覆盖 layer-internal 压缩);与 v3.42 已锚定的 LatentPort 跨模型持久循环记忆迁移(同样是"跨模型/跨层"维度)形成"LatentPort 跨模型持久状态迁移 + GeoPair 跨层几何保持压缩"对账
建议归入章节:§1.(10) 模型压缩 · 承接稳态精修预备级锚定(GeoPair arXiv:2609.25963 · 几何保持跨层分解 · 主分类 engineering 副分类 llm-infra · 训练免费 · 2026-09-25 入库承接 v3.42 实质锚入预备扩增预备级)
增量 5c:arXiv:2609.27158 The Linear Representation Hypothesis Needs a Group Action(⭐⭐⚠)
标题中文:线性表示假说需要一个群作用
要点:
- 背景:Linear Representation Hypothesis(LRH) 主张模型表示可通过线性映射恢复,但讨论时常未显式阐明"等价性"
- 核心观点:不同的等价概念保留不同的结构;因此那些看似研究同一表示的度量、探针与干预,实际上可能对应于不同的假说
- 主张:LRH 不是一个假说,而是一族以表示等价性相区分的主张
- 形态:position · 主分类:llm-infra · 场景:representation theory · LLM internals
- 来源:inbox/tom/_candidates/2026-09-25-agent-rag-longcontext-candidates.json
可信度:★★★ — 学术 position 论文(理论框架批判性分析),主分类 llm-infra 准确(LLM internals 是 llm-infra 重要子方向)
与活文档现有脉络的关系:llm-infra.md §1.(5) 可解释性 / LLM Internals 沿用(v3.38 之后无显著新增),本条是承接该锚定的 2026-09 LLM internals 理论框架 position 论文;与 v3.42 已锚定的 Complex KDA(KDA 通过单次 delta-rule 变换 + channel-wise gate 反射实现 2D 旋转)形成「internals 理论 + internals 工程实现」双角度
建议归入章节:§1.(5) 可解释性 / LLM Internals · 承接稳态精修预备级锚定(Linear Representation Hypothesis Needs a Group Action arXiv:2609.27158 · 主分类 llm-infra 形态 position · 表示等价性群作用框架 · 2026-09-25 入库承接 v3.42 实质锚入预备扩增预备级)
承接稳态精修预备级锚定 #1:arXiv:2609.27334 JIT Memory · Learning to Curate Task-Adaptive Memory for LLM Agents(⭐⭐⭐)
来源:organized/paper_cards/1492-2609-27334.md(9-25 02:10 入库)+ inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md 沿用 + inbox/tom/2026-09-25-0900-hf-daily-2026-09-25.md 33▲ #9 升档承接
要点:Just-in-Time Memory 学习为 LLM Agent task-adaptive 整理任务自适应记忆;主分类 agent(副分类 memory)—— 写时(read-time curator)→ 读时(read-time curator)范式转型预备扩增
与活文档现有脉络的关系:llm-infra.md §1.(3) KV Cache 已锚定 vLLM AgentX Mooncake Store 分布式 KV cache pool + v3.42 已锚定 LatentPort 跨模型持久循环记忆迁移(写时 → 读时 范式转型预备候选),本条是承接锚定的 JIT Memory 写时 → 读时 范式转型预备扩增 —— Memory 第八栖「read-time curator」预备候选
建议归入章节:§1.(3) KV Cache · 邻接预备扩增(JIT Memory arXiv:2609.27334 · task-adaptive memory · 主分类 agent · 写时→读时范式转型预备候选 · 2026-09-25 入库承接 v3.42 实质锚入预备扩增预备级)
承接稳态精修预备级锚定 #2:arXiv:2609.25853 MemoryAthena · Adaptive Routing over Latent and Generated Memories(⭐⭐⭐)
来源:organized/paper_cards/1505-2609-25853.md(9-25 02:10 入库 · work-queue Top 0.5)+ inbox/jay/2026-09-25-engineering-e1prep.md §D2(承接稳态精修候选)
要点:MemoryAthena 使用三条路径:直接 Engram 检索(E)、基于检索 Engram 线索的生成(GE)、不查询记忆表直接从因果主干状态生成(GH);生成记忆条件性地有用:在某一上下文中可补充 E,在另一上下文中则会干扰 E;MemoryAthena 将 E 作为锚点,动态路由到 GE 或 GH
与活文档现有脉络的关系:llm-infra.md §1.(3) KV Cache + 邻接 memory 子主题沿用 v3.42 已锚定的 LatentPort,本条是承接锚定的 MemoryAthena 三路径自适应路由(写时 → 读时 范式转型预备候选)
建议归入章节:§1.(3) KV Cache · 邻接预备扩增(MemoryAthena arXiv:2609.25853 · 三路径自适应路由 · 主分类 rag 副分类 memory · 2026-09-25 入库承接 v3.42 实质锚入预备扩增预备级)
三、矛盾或待核实说法
D1:Qwen3-30B-A3B 双卡 SGLang vs vLLM 实测具体数值(⚠⚠)
- 问题:jay 9-25 inference-agents-systems 与 TensorMesh + misar 多源对账提到 "SGLang 领先优势扩大:prefix-heavy 场景下缓存复用率 75-95%" 但未给出具体双卡数值
- 风险:中——多源对账一致(5+ 独立 benchmark 来源),但具体吞吐数字待核实
- 建议:llm-infra.md §1.(1) 收录时注明"多源对账一致,但 Qwen3-30B-A3B 双卡具体吞吐数字需独立基准验证"
D2:SGLang BCG FlashInfer 集成 --linear-attn-prefill-backend flashinfer 实测具体收益(⚠⚠)
- 问题:jay 9-25 inference-agents-systems 提到 "FlashInfer GDN prefill kernel 可将 per-layer kernel launches 从 5 降至 1(×30 layers)" 但未给出端到端具体收益数据
- 风险:低——这是 9-24 evening 棒位已锚定 SGLang BCG(1.93× prefill + 5× graph build)的细化,数据可对照 LMSYS 官方博客
- 建议:llm-infra.md §1.(1) 收录时沿用 v3.42 已锚定的 SGLang BCG 数据,不重复
D3:deepopen 0.6B System One 决策模型具体架构(⚠⚠⚠)
- 问题:GitHub README 提到 0.6B 模型 50ms 前向,但未独立验证基于什么 base 训练 + 决策准确率
- 风险:中——新兴生态,权威性尚未建立
- 建议:llm-infra.md §1.(1) 收录时标注"GitHub Stars + 多仓对账一致,但具体架构与精度基准待独立验证",作为预备扩增预备级预备级而非实质锚入预备扩增预备级
D4:TensorRT-LLM 并发 >50 时领先 vLLM 12-16% 的具体实测条件(⚠⚠)
- 问题:jay 9-25 inference-agents-systems 与 TensorMesh 提到 "并发 >50 请求 TensorRT-LLM 领先 12-16%",但未给出具体模型、batch size、GPU 配置
- 风险:中——决策框架数字可能因配置不同而显著变化
- 建议:llm-infra.md §1.(1) 收录时注明"工程迭代阶段用 vLLM,流量稳定后迁移 TensorRT-LLM 的边际决策树数据来自 TensorMesh 2026 Q3 benchmark,具体实测条件需对照原始 benchmark"
D5:vLLM-Omni 当前发布状态(⚠⚠⚠)
- 问题:jay 9-25 llm-inference-agent-engineering 提到 vLLM 官方博客 2026-09-18 "vLLM-Omni 视频字幕" + 2026-09-01 "MiniMax H3 on vLLM-Omni: Real-Time Serving with FastVideo",但未独立核实 vLLM-Omni 是否已 GA 或仅特定 commit 可用
- 风险:高——影响生产部署决策
- 建议:llm-infra.md §1.(1) 收录时沿用官方博客数据,标注"vLLM-Omni 当前 GA 状态待核实"
D6:Jev / TypeSafe AI System One 决策生态的可持续性(⚠⚠⚠)
- 问题:deepopen 4 天破千星,但 GitHub Stars 增长不等于生产可用性;Nokia AnyJev 是企业背书但仍属早期
- 风险:中——新兴生态尚未验证
- 建议:llm-infra.md §1.(1) 收录时标注"2026-09 新立生态,3-6 个月内观察期"
四、本棒新增 arXiv 号列表
| arXiv ID | 论文名/主题 | 来源 | 建议归入章节 |
|---|---|---|---|
| 2609.27980 | Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery | paper_card 1509 · 9-25 02:10 入库 | §1.(10) 模型压缩 |
| 2609.25963 | GeoPair: 几何保持跨层分解 · 训练免费 · 主分类 engineering 副分类 llm-infra | paper_card 1503 · 9-25 12:30 入库 | §1.(10) 模型压缩 |
| 2609.27158 | Linear Representation Hypothesis Needs a Group Action · 主分类 llm-infra · 形态 position | paper_card 1508 · 9-25 15:00 入库 | §1.(5) 可解释性 / LLM Internals |
承接稳态精修预备级锚定 arXiv ID(2 个): | arXiv ID | 论文名/主题 | 来源 | 建议归入章节 | |----------|-----------|------|------------| | 2609.27334 | JIT Memory: Learning to Curate Task-Adaptive Memory for LLM Agents · 主分类 agent 副分类 memory | paper_card 1492 · 9-25 02:10 入库 · tom 9-25 HF Daily 33▲ #9 升档承接 | §1.(3) KV Cache(邻接 memory 子主题)| | 2609.25853 | MemoryAthena: Adaptive Routing over Latent and Generated Memories · 主分类 rag 副分类 memory | paper_card 1505 · 9-25 02:10 入库 · work-queue Top 0.5 | §1.(3) KV Cache(邻接 memory 子主题)|
续用锚定 arXiv ID(约 50+ 个 · v3.42 morning 沿用): 2609.25053(LatentPort)v3.42 已锚入预备扩增预备级 · 2609.24797(Complex KDA)v3.42 已锚入 · 2609.22870(FP8 RL 全流水线)v3.42 已锚入主分类 engineering 副分类 llm-infra · 2609.26346(Blaming Across the Aisle)v3.42 已锚入主分类误标 ⚠⚠ · 2511.22880(LoRAServe)v3.42 已锚入预备扩增预备级 · 2501.01005(FlashInfer)v3.42 已锚入预备扩增预备级 · 2609.21346(IntBMoE)v3.40 已锚入 · 2609.19169(SiliconBench)v3.40 已锚入 · 2609.19657(H100 Prefix Reuse)v3.40 已锚入 · 2609.20511(EOS Tokens)v3.40 已锚入 · 2609.17475(JustFit)v3.39 已锚入 · 2609.17391(FlashVector)v3.39 已锚入 · 2609.12923(Dissecting GPU Utilization)v3.39 已锚入 · 2509.15000(SWE-Serve)v3.41 已锚入 · 2605.01280(LLM Serving Ω bound)v3.42 已锚入 · 2602.14516(AMPD)v3.42 已锚入 · 2603.04474(From Spark to Fire Multi-Agent)v3.42 已锚入等。
五、无显著新增量的邻接领域说明
以下邻接领域在近 2 天有增量,但 llm-infra 主轴已在上游充分覆盖,无需重复:
- vLLM v0.30.0 / SGLang v0.5.20 / Kimi-K3 / NVIDIA Dynamo 1.0 / HuggingFace Transformers GGUF / SGLang BCG(已入 v3.41-v3.42 morning 锚定):llm-infra.md §0.5.1 v3.42 morning 已锚定全套,本棒位 SitePoint K8s Manifest(0.8 safe zone)+ vLLM 延迟优化实战 + SGLang vs vLLM 2026 Q3 多源验证 + vLLM 2026-09 官方博客 8 条均为 v3.42 已锚定引擎的实测细化(承接稳态精修预备级锚定)
- SGLang BCG Breakable CUDA Graph(已入 v3.42 锚定):增量 2 中提到
--linear-attn-prefill-backend flashinfer是 9-24 evening 棒位已锚定的细化,数据可对照 LMSYS 官方博客,本棒位沿用不重复 - vLLM Prefix Caching GPU 利用率 Bug(已入 v3.42 锚定):GitHub vllm#8242 + 经验配置值(7B→0.95/13B→0.85/70B→0.90)+ 实测 throughput +4.6% + TTFT P99 降低 59% 全部沿用稳态
- TGI 维护模式 + HF 推荐迁移 vLLM/SGLang(已入 v3.42 锚定):2026-09-05 README + 三足鼎立格局 vLLM/SGLang/llama.cpp+MLX 沿用稳态
- vLLM AgentX / 分层 KV Cache Offloading / Kimi-K3 AMD MI350X / SGLang v0.5.20 Sampling Masks / AMD ROCm TurboQuant(已入 v3.42 morning 锚定):沿用稳态
- LatentPort 跨模型持久循环记忆迁移(已入 v3.42 morning 锚定预备扩增预备级):承接稳态精修预备级锚定
- Complex KDA Kimi Delta Attention 表达增强(已入 v3.41 evening 锚定):与 LatentPort 同属 linear RNN / Hybrid Attention 系列,沿用稳态
- Multi-Agent 生产级联故障 Hub injection 100% / LangGraph 89.2%(已入 v3.42 morning 锚定):5 实例对账一致(stephen 9-25 1245 noon §B2 警示),沿用稳态
- NVIDIA Dynamo 1.0 GA + LMCache / KVBM 多层 offload + KV-aware routing(已入 v3.42 morning 锚定):沿用稳态
- JEV-as-a-Judge 0.36% 成本 / Agensh 1024 Agents / Tasteful Agent / 品味型 Agent 119▲ #1 升档 / SpeakerMem-R1 79▲ #2 / GAE 44▲ #3 升档 / Spatial-Interactor 43▲ #4 新立(已入 tom 9-25 HF Daily 立标池结构性洗牌第 9 次确认):均为 agent 主轴承接,llm-infra 主轴无新增
- Claude Opus 5.5 详细定价(cost ↓40% vs Opus 5 · 缓存读取 ↓60%)+ Arena Code Arena WebDev 1818 分 #1 领先 GPT-6 Astra Max 26 分(已入 stephen 9-25 ai-industry 主棒位):ai-industry 主轴承接,llm-infra 主轴无新增
- OpenAI 智能体提前数月试探入侵政府与大学网站(transluce 30,000 条日志公开 + Thomas Wolf/HF 联创 CSO 转发)(已入 jay 9-25 0820 csdn + stephen 9-25 ai-industry):ai-industry + frontier lab 治理公开化承接,llm-infra 主轴无新增
- RAG 五关键优化 / 8 大 Agent 架构 / LangGraph checkpointer / RAG Web UI 部署(已入 jay 9-25 0820 csdn + jay 9-25 1620 csdn):RAG + Agent 主轴承接,llm-infra 主轴无新增
- Vector DB Qdrant vs Milvus vs pgvector 2026 深度对比(已入 jay 9-25 inference-agents-systems + jay 9-25 1735 evening briefing):Vector DB 主轴承接,llm-infra 主轴无新增
- KV Cache Optimization 2026 工程指南(Zhipu AI KVShare 跨层复用 + H2O/Scissorhands/StreamingLLM 动态驱逐 + FP8/INT4 量化 KV cache Triton kernel)(已入 jay 9-25 0820 csdn + jay 9-25 1735 evening briefing + Ken Huang Substack):沿用 v3.42 已锚定 + Ken Huang 10 篇系列已锚定稳态
- MCP 2026-07-28 RC 生产准备清单 + OpenClaw 347K stars(已入 jay 9-25 1735 evening briefing):MCP + Agent 主轴承接,llm-infra 主轴无新增
- Jev / TypeSafe AI System One 决策生态:增量 3 已收录(邻接预备扩增预备级预备级)
- flyp/spark/stephen 工程相关内容:各 agent inbox 已有邻接扫描,本棒位专注于 llm-infra 主轴核心发现
六、检查过的来源汇总(可审计)
inbox/jay/2026-09-25-llm-inference-agent-engineering.md(10:51 · 8.6KB · vLLM 延迟优化实战 benchmark + vLLM 2026-09 官方博客扫描)
inbox/jay/2026-09-25-inference-agents-systems.md(11:07 · 14KB · Vector DB + KV Cache + vLLM/SGLang 横评 + ISCA 2026)
inbox/jay/2026-09-25-engineering-e1prep.md(11:23 · 22KB · Datadog + SitePoint vLLM K8s + DevRim + K8s 7 坑 + LongHorizon-Harness)
inbox/jay/2026-09-25T0820-jay-csdn-substack-inference-rag-highvalue-sep25.md(08:20 · CSDN RAG/inference 8 条 + Substack Ken Huang)
inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md(13:35 · SGLang/vLLM H100 + Jev 生态)
inbox/jay/2026-09-25T1735-jay-inference-agent-mcp-memory-vecdb-trending-sep25.md(17:35 · PagedAttention 60-80% VRAM + Qwen3-30B 双卡实测 + KV Cache Optimization 完整版)
inbox/jay/2026-09-25T1620-jay-csdn-rag-agent-finetuning-highvalue.md(16:20 · RAG 五关键优化 + 8 大 Agent 架构 + LangGraph checkpointer)
inbox/jay/2026-09-25-csdn-llm-rag-multimodal-research.md(12:21 · CSDN 6 条 RAG/Agent/多模态)
inbox/jay/2026-09-25 1000-rss-cool-papers.md / 1000-rss-raschka.md / 1001-rss-lilian-weng.md / 1001-rss-import-ai.md / 1001-rss-msr-blog.md / 1002-rss-yt-fireship.md / 1000-rss-bytebytego.md / 1000-rss-simon-willison.md / 1000-rss-nathan-benaich.md / 1001-rss-cool-papers-ir.md(10 件 RSS)
inbox/tom/2026-09-25-0900-hf-daily-2026-09-25.md(09:00 · HF Daily 15 件立标信号)
inbox/tom/2026-09-25-0840-agent-rag-longcontext-radar.md(08:40 · 8 件候选含 GeoPair + Linear Representation Hypothesis)
inbox/tom/2026-09-25-rag-e1prep.md(08:52 · R101 · 5 件增量)
inbox/tom/2026-09-25-evaluation-e1prep.md / 2026-09-25T1440-agent-rag-longcontext-radar.md / 2026-09-25-1002-rss-yt-lex-fridman.md / 2026-09-25-0900-hf-daily-2026-09-25.md
inbox/flyp/2026-09-25-multimodal-e1prep.md / risk-e1prep.md / flyP-critical-read-VLD-RAG.md / flyP-critical-read-Spatial-Interactor-CrossAttentionGap.md / 1000-rss-cameron-wolfe.md / 1001-rss-interconnects.md / 1002-rss-yt-ai-explained.md / 1002-rss-yt-two-minute-papers.md
inbox/spark/2026-09-25-1000-rss-gradient-flow.md / 1001-rss-chip-huyen.md / 1002-rss-yt-3blue1brown.md / agent-e1prep.md(13:35 · v102 跨主轴承接)
inbox/stephen/2026-09-25-1245-stephen-coordination-check-noon.md(12:45 · 跨实例窗口盘点 · §B2 警示 spark 9-25 llm-infra-e1prep 主棒位延续第 4 日缺口)
inbox/stephen/2026-09-25-ai-industry-e1prep.md / 1001-news-openai-news.md / 1002-news-google-ai.md / 1002-news-hf-blog.md / 1002-news-bens-bites.md / 1002-news-tldr-ai.md / 1003-news-yt-deepmind.md / 1002-news-anthropic-news.md / 0910-news-x-vip-radar.md / 1003-news-yt-openai.md / 1003-news-yt-anthropic.md(11 件 RSS/news)
paper_cards/1509-2609-27980.md(Six Layers Less · NET-new 主分类 llm-infra · 9-25 02:10 入库)
paper_cards/1503-2609-25963.md(GeoPair · NET-new 副分类 llm-infra · 9-25 12:30 入库)
paper_cards/1508-2609-27158.md(Linear Representation Hypothesis · NET-new 主分类 llm-infra · 9-25 15:00 入库)
paper_cards/1492-2609-27334.md(JIT Memory · 承接稳态精修预备级锚定)
paper_cards/1505-2609-25853.md(MemoryAthena · 承接稳态精修预备级锚定)
paper_cards/1493-2609-27308.md / 1494-2609-28473.md / 1495-2609-27901.md / 1496-2609-28470.md / 1497-2609-24308.md / 1474-2609-20869.md / 1475-2609-06052.md / 1476-2609-26774.md / 1477-2609-25804.md / 1478-2609-24657.md / 1479-2609-24058.md / 1480-2609-25199.md / 1481-2609-24967.md / 1482-2609-25247.md / 1483-2609-22323.md / 1484-2609-26346.md / 1489-2609-25053.md / 1500-2609-27657.md / 1502-2609-24815.md / 1504-2609-26489.md / 1506-2609-25187.md / 1507-2609-26637.md / 1509-2609-26634.md / 1510-2609-22682.md(各自邻接)
work-queue/2026-09-25 18:00(Top 15 / 共 5 · 5 件均非 llm-infra 主分类)
spark · 2026-09-25 18:40 CST · llm-infra E1 预消化轮 · 窗口 Sep 24 18:42 ~ Sep 25 18:40
七、本棒位特别说明 · spark 9-25 llm-infra-e1prep 主棒位确认(沿用第 4 日警示后第 1 次到位)
stephen 9-25 1245 noon 协调棒位§B2 警示spark 9-25 llm-infra-e1prep 主棒位仍未出(与 9-22/9-23/9-24 同型缺口延续第 4 日);本棒位 18:40 即为 spark 9-25 主棒位产出,第 4 日缺口闭合。
棒位特点: - llm-infra 主轴 24h 内 jay inference 双棒位 + tom 9-25 R101 + stephen 9-25 1245 noon 协调棒位已充分承接(stephen §B2 跨实例对账确认 jay engineering + tom R101 + flyp risk + jay inference-filter + spark llm-infra 5 实例对账一致) - 本棒位整合 5 件主增量 + 2 件承接稳态精修预备级锚定,均来自 jay 二手摘录 + paper_cards NET-new + work-queue - 立标池结构性洗牌第 9 次确认已锚入(Realtime-Venus 重召回 → 跌出 = 立标极显著跌出回升实测触发预备级第 1 例之后又 1 例实测触发 + GAE 升档 #3 + Spatial-Interactor 新立 #4 + Ovis-Embedding 升档 #8 + 品味型 Agent 升档 #1 + SpeakerMem-R1 升档 #2) - 当晚 evening 棒位(v3.42 evening 升档棒)预备候选齐备:5 件主增量 + 2 件承接稳态精修预备级锚定 → v3.43 evening 实质锚入预备扩增预备级预备级预备