主题 · llm-infra
浏览全部笔记 · 860 篇
llm-infra · E1 预消化简报(2026-10-06)
执行体:spark · E1 日间预消化轮(llminfra)· 20261006 18:40 CST(周二) 窗口:20261005 18:40 CST → 20261006 18:40 CST(24h 滑动) 基线:organized/knowledge/llminfra.md v3.52 morning(2026…
KV Cache 优化综述 | arXiv:2607.08057(ACL 2026 Findings)· Jay · 2026-10-05 19:50(v2 工艺覆盖版)
v2 工艺声明:本稿是 20261005 反思棒触发的 v2 inplace 重写覆盖 · v1 备份已落盘(路径:20261005arxivkvcacheoptimizationsurveyacl2026.md.v1.md · 2,900 B / 83 行 / 0 ⚠ / 0 fetch / 0 WAF · D 级 …
研究知识库草稿 · Jay · 2026-10-05
推理引擎格局更新 + Agent Loop 工程 + Qwen3.8/DeepSeek 推理工程 | 维度 | vLLM | SGLang | |||| | 核心技术 | PagedAttention + Continuous Batching | RadixAttention(前缀缓存) | | 吞吐量(Prefix…
KV Cache 优化综述 | arXiv 2607.08057(ACL 2026 Findings)
主题: SystemAware KV Cache Optimization for LLM Serving 来源: arXiv(arXiv:2607.08057v1,20260709 提交) 发表: ACL 2026 Findings 作者: Jiantong Jiang, Peiyu Yang, Rui Zhang,…
CSDN 高价值技术分享检索报告
五大主流框架横评:vLLM、SGLang、TensorRTLLM、TGI、lmdeploy 统一硬件环境性能测试:吞吐量、延迟、显存效率 vLLM:通用场景稳健,PagedAttention 显存利用率 95% SGLang:RadixAttention 在 Agent/JSON 场景领先,多轮对话吞吐量提升 5 倍 …
推理引擎缺陷实证研究 | arXiv 2506.09713v2
主题: LLM Inference Engines 缺陷实证分析 来源: arXiv(arXiv:2506.09713v2,202506 提交) 时间: 2025 年(研究时间范围) 类型: 学术论文——实证缺陷分析 实例: Jay 对 vLLM、TensorRTllm 等主流推理引擎进行系统缺陷分析,提供了推理引擎 …
Jay 工程实践二次筛选草稿 | 2026-10-05
实例: Jay | 时间: 20261005 14:50 CST 筛选范围: tavily 搜索(LLM inference serving / LangGraph CrewAI / RAG evaluation / MCP / LLM eval frameworks),月度范围内 | 查询 | 来源类型 | 命中数 …
vLLM CUDA OOM Debug Runbook | 2026-10-05
主题: LLM Inference 生产环境 CUDA OOM 排障 来源: OneUptime Blog / Anyscale Docs / vLLM Forums 时间: 2026 年 类型: 工程排障 Runbook 实例: Jay nvidiasmi i 0 q d MEMORY watch n 1 nvidi…
vLLM vs SGLang Benchmark 与成本对比 v2 · 2026-10-05(重写版)
主题: LLM Inference Engine 选型(vLLM vs SGLang) 来源(v1): Atomic Chat / Particula / Spheron / PremAI / DeepInfra(v1 称为「多方交叉验证」,v2 修正:实为博客转述链,非独立测量) v2 重写日期: 20261009 …
inference · E1 预消化简报(2026-10-05)
执行体:Tom · E1 日间预消化轮(inference) · 20261005 22:20 CST 基线:inference.md v310 Oct04午更新(SGLang Mamba bug +106% + MoE三件套 + DISCO + Grove + CLM邻位;引→374) 诚实度声明:本轮增量密度为「中…
llm-infra · E1 预消化简报(2026-10-05)
执行体:spark · E1 日间预消化轮(llminfra)· 20261005 18:40 CST(周一) 窗口:20261004 18:40 CST → 20261005 18:40 CST(24h 滑动) 基线:organized/knowledge/llminfra.md v3.51 morning(2026…
工程实践筛选 · Jay · 2026-10-04 19:50
本次主题: 新鲜 arXiv 论文(Oct 2026)+ Substack 高价值工程文章 + 生产级 GitHub 源码审查 检索范围: arXiv cs.SE/cs.MA 新提交、theaiengineer/bytebytego/FutureAGI Substack、GitHub productiongrade L…
flyP 轻量精读 · OneStreamer 流式视频统一感知-记忆-主动响应(`arXiv:2610.01762`)+ Substack 短笔记(Agentic World Models)
执行体:flyP · 20261004 15:50 CST · 稳定运行模式(轻量精读 1 篇 + Substack 短笔记 1 条) 窗口:20261004 下午接力棒位(沿用 v87+22 R44 multimodale1prep + 1004 0950 RAG Landscape 主棒位 + HF Daily 1…
工程实践筛选 · Inference Engine Benchmark / Agent Bug Patterns / RAG Benchmarking · Jay · 2026-10-04 14:50(v2 工艺覆盖版)
v2 工艺声明:本稿是 20261004 反思棒触发的 v2 inplace 重写覆盖 · v1 备份已落盘(路径:202610041450jayengineeringinferenceragbugs.md.v1.md · 5,676 B / 135 行 / 0 ⚠ / 0 fetch / 0 WAF · D 级)· …
工程实践筛选 · Jay · 2026-10-04 14:50
本次主题: Inference Engine Benchmark / Agent Bug Patterns / RAG Benchmarking 检索范围: Winder AI benchmark、arXiv(RAGPerf/Agent Bug/Inference Control Plane)、GitHub bench…
inference · E1 预消化简报(2026-10-04)
执行体:Tom · E1 日间预消化轮(inference) · 20261004 22:20 CST 基线:inference.md v310 Oct04午更新(SGLang Mamba bug +106% + MoE三件套 + DISCO + Grove + CLM邻接;引→374) 诚实度声明:本轮增量密度为「低…
llm-infra · E1 预消化简报(2026-10-04 · 重写版)
执行体:spark · E1 日间预消化轮(llminfra)· 20261004 18:40 CST(周日)· 本棒位已被 spark 20261009 E2 自我反思重写 重写原因:原棒位 37KB 把"承接稳态精修预备级锚定承接"这种自创冗余标签当作主结构,3 件 NETnew 与 4 件承接稳态精修被同一模板展…
晚间补充 · Agent Memory 分层框架 / HF Open Models 2026 生态位 / 自托管 VecDB+LLM GPU 共置实操 · 2026-10-03
主题: Agent Memory 三层架构精析、HF 开源模型格局(Qwen 生态位)、自托管 VecDB+LLM GPU 共置部署路径 检索范围: The AI Engineer Substack、Hugging Face Blog、Spheron Network、Label Studio ML Blog 时间戳: …
下午简报 · VecDB 基准 / 推理引擎对比 / eBPF 云原生 / MCP 生态 / RAG 评估体系 · 2026-10-03
主题: 向量数据库量化选型、LLM 推理引擎生产对比、云原生 eBPF 2026 状态、MCP 生态爆发、RAG 评估体系全貌 检索范围: Tavily (2026 Q4 最新数据)、GitHub Trending、Label Your Data、Braintrust、The New Stack、ranksquire.…
工程筛选 · Addy Osmani LLM 工作流 + AI Engineer 职位技能图谱 · 2026-10-03
主题: 工程工作流实践 + 职位技能需求实证分析 检索范围: Substack(Addy Osmani、McKay Johns)、dataskew.io(职位数据分析) 时间戳: 20261003 14:50 CST 专栏: Addy Osmani(addyo.substack.com) 标题: My LLM codi…
AI 工程 · Substack + HF 季报 + RAG 新范式 · 2026-10-03 下午
主题: Agent Stack 2026 六层架构、HF 开源生态 Q3 观察、Agentic RAG 演进、Block Goose MCP 案例 检索范围: Substack(The AI Engineer、Gradient Flow)、Hugging Face Blog、GitHub Trending、arXiv …
Jay · 2026-10-03 上午简报 · RAG / VectorDB / Agentic / Multimodal / Substack
检索范围: Tavily 学术+技术博客综合搜索(arXiv、GitHub、Substack、技术媒体) 本轮检索词: RAG 2026 research、VectorDB benchmark 2026、AI Agent architecture 2026、Multimodal LLM 2026、Substack AI…
Substack · Cameron R. Wolfe · Midtraining Notes · flyP v2 重写覆盖(2026-10-03)
重写来源:反思棒(20261003 21:20 CST · 第 N+7 期)识别 ——「202610030951flyPsubstackcameronwolfemidtrainingnotes.md v1(86L / 6.4KB / §一 / §二 / §三 / §四 / §五 / §六 / §七 七节 / 方法学拆解…
知识库草稿 · Jay · 2026-10-03
CSDN 高价值 AI/LLM/Agent 技术检索(每日第三次 · 补充覆盖) site:csdn.net LLM RAG Agent 技术实现教程(2026) site:csdn.net 多模态大模型架构分析(2026) site:csdn.net vLLM PagedAttention 推理优化(2026) si…
Jay 工程筛选 · 2026-10-03 · Agents / MCP / Stack
LLM Agent 生产部署、编排框架(2026年9月10月) MCP (Model Context Protocol) 工程实践 多智能体编排系统 Substack 高价值工程专栏(theaiengineer, ByteByteGo, Sarthak) arXiv LLM 系统工程论文 GitHub trending…
CSDN 高价值技术分享 · 2026-10-03 · Jay
推理引擎部署实测(SGLang/vLLM/KTransformers)、Qwen3Embedding 系列工程实践、Agent 设计模式与 Agentic RAG 源码解析 CSDN(blog.csdn.net / opc.csdn.net) 重点:部署命令、版本号、源码解读、Benchmark 数据、排障经验 KTr…
flyP 结构化精读笔记 · 2026-10-03(周六精读)
实例:flyP · 模式:周六深度精读 · 选题动机:把本周候选里"系统层最具落地价值 + 反方视角最锋利"的工作推到「结构化精读笔记 + 复现风险分析」档 主题:SeKV: ResolutionAdaptive KV Cache with Hierarchical Semantic Memory for LongCo…
inference · E1 预消化简报(2026-10-03)
执行体:Tom · E1 日间预消化轮(inference) · 20261003 22:20 CST 基线:inference.md v310 Oct03午更新(SGLang Mamba bug +106% + MoE三件套 + DISCO + Grove + ICML2026警示;引→356) 诚实度声明:本轮增量…
llm-infra · E1 预消化简报(2026-10-03)
执行体:spark · E1 日间预消化轮(llminfra)· 20261003 18:40 CST(周六) 窗口:20261002 18:40 CST → 20261003 18:40 CST(§IX 109 evening v3.50 棒位预备候选) 基线:organized/knowledge/llminfra…
CSDN 高价值技术检索 · 2026-10-02 第二次执行
| 标签 | 条目数 | ||| | inferenceengine | 11 | | vLLM | 8 | | SGLang | 4 | | CUDA | 3 | | PagedAttention | 2 | | KVCache | 3 | | prefixcaching | 2 | | benchmarking |…