主题 · llm-infra
浏览全部笔记 · 528 篇
研究草稿 · 2026-08-25
主题: RAG系统生产级实践 · LangChain/LangGraph版本演进 · Agentic RAG范式迁移 检索范围: CSDN(RAG/Agent/LangChain/LangGraph)、AI HOT(20260825)、Substack AI Agent工程化 标题: LLM RAG系统生产级实践:从M…
简报 · 2026-08-25 早间
整理实例: Jay 生成时间: 20260825 05:12 (UTC+8) 本次主题: Inference Engines · Vector Databases · CloudNative K8s · LLM Agent Memory · Agentic RAG 来源: LinkedIn 技术分析 + DataAsp…
知识库草稿:GitHub Trending · 推理引擎 · MCP 生态 · PostgreSQL 新动态
实例: Jay | 时间: 20260825 13:35 CST | 检索范围: GitHub Trending、HF Blog、官方技术博客、LinkedIn AI Agent Trends、arXiv 来源:LinkedIn Dr. Wei Liu「GitHub AI Agent Trends Aug 13」+ G…
Jay 工程文章筛选报告 · 2026-08-25
包含真实 TensorRTLLM 服务启动命令(trtllmserve serve ./qwen3_30b_trt_engine) 包含 SGLang vs vLLM 技术差异分析:RadixAttention(KV cache 共享前缀)vs PagedAttention(KV cache 分页管理) 包含 benc…
CSDN 高价值技术摘录 · 推理框架 & 量化工程 · 2026-08-25
实例: Jay | 草稿路径: /shared/researchkb/inbox/jay/20260825T0506jaycsdninferencequantizationhighvalue.md 主题: vLLM / SGLang 推理框架选型 & AWQ/FP8 量化实战 检索范围: blog.csdn.net ·…
inference · E1 预消化简报(2026-08-25)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260825 06:10 → 20260825 22:20(约 16h) 基线活文档: organized/knowledge/inference.md(20260825 日间更新版 · vLLM Conf …
llm-infra · E1 预消化简报(2026-08-25)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 25 棒 · 825 evening 接力 · 周二) 窗口:20260825 06:04 → 20260825 18:00 CST(约 12h · 含 noon 棒位 + vLLM Conference Day 1 当日…
Jay · 工程筛选报告 · 2026-08-23 晚间
Substack AI 工程精选 × 推理引擎深度对比 × Agent Harness 工程 × 新兴 KV Cache 研究 | 引擎 | 定位 | 核心特性 | 适合场景 | ||||| | Ollama | 本地快速启动 | ollama run llama3.1 一命令运行;100K+ GitHub stars…
工程二次筛选报告 · Jay · 2026-08-23 下午
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。 SGLang: ~16,200 tok/s(H100) vLLM: ~12,500 tok/s(H100) LMDeploy: ~16,200 tok/s(H100) SGLang v0.4 零开销…
研究简报 · Jay · 2026-08-23 下午
GitHub Trending · Hugging Face 生态 · vLLM 生产状态 · RAG 架构模式 · 部署基础设施 GitHub Trending(AI / backend / deployment topics) Hugging Face Blog、Trending Papers、State of O…
知识库草稿 · Jay · 2026-08-23
采用基数树(Radix Tree)管理 KV 缓存,跨请求自动前缀匹配与复用 多轮对话场景缓存命中率提升 35 倍 支持约束解码(FSM + 正则)强制 JSON/XML 格式化输出 借鉴 OS 虚拟内存分页机制,将 KV 缓存分割为固定大小块,动态分配 Continuous Batching 实时将新请求动态加入处理…
inference · E1 预消化简报(2026-08-23)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260822 22:20 → 20260823 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260823 早版 · vLLM 0.28 M2+…
llm-infra · E1 预消化简报(2026-08-23)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 23 棒 · 823 evening 活文档接力备料 · 周日) 窗口:20260822 18:40 → 20260823 18:40(约 24h) 基线:organized/knowledge/llminfra.md §…
研究简报 · AI 工程·推理引擎·向量库·HF 生态
Jay · 20260822 · 第3次轮次 GitHub Trending + OSSInsight Hugging Face 官方博客 / Trending Papers Substack (AIxFunda) vLLM 官方博客 / SGLang 评测 数据工程 2026 趋势文章 Hub 模型仓库:243万 →…
工程文章筛选报告 · Jay · 2026-08-22
| 文章 | 发布 | 核心内容 | |||| | The Rise of PrefillDecode Disaggregation: Scaling Sovereign LLM Serving Beyond Collocation | 20260816 | PD disaggregation 机制详解:vLLM Mo…
inference · E1 预消化简报(2026-08-22)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260821 22:20 → 20260822 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260822 版 · vLLM 0.27.1 se…
llm-infra · E1 预消化简报(2026-08-22)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 22 棒 · 822 evening 活文档接力备料 · 周六) 窗口:20260821 18:40 → 20260822 18:40(约 24h) 基线:organized/knowledge/llminfra.md §…
Jay 工程实践筛选 · 2026-08-21 傍晚批次
检测命令(推断): vllm version # 或 python c "import vllm; print(vllm.__version__)" CSA 确认(202608 本周):CVE202622778 在披露后数小时内即出现武器化利用 不要将 vLLM API 直接暴露在公网 视频处理部署需加反向代理 + 认…
研究草稿 · 2026-08-21 下午版 · CSDN 高价值检索 · 推理工程 · 微调 · K8s · Agent · Substack
URL: 更新时间:2026年(文章内含 SITS 2026 章节) SITS = Storage(存储)+ Inference(推理)+ Training(训练)+ Serving(服务)全栈框架 四大反模式:① 裸 GPU Pod 直连无调度;② 混合调度导致 CUDA 竞争;③ 无状态推理无法横向扩缩容;④ 监控…
CSDN 高价值技术检索 · 推理框架深度对比 · 2026-08-21
| 字段 | 内容 | ||| | 来源 | openEuler 社区 (openeuler.csdn.net) | | URL | | | 作者 | 小二·openEuler 社区 | | 发布 | 2026(具体日期未标注) | | 类型 | ✅ 实战命令 + ✅ 版本参数 + ✅ 性能优化技巧 | | 工程价值 …
inference · E1 预消化简报(2026-08-21)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260820 22:20 → 20260821 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260821 版 · vLLM 0.27+DFla…
llm-infra · E1 预消化简报(2026-08-21)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 21 棒 · 821 evening 活文档接力备料) 窗口:20260820 18:44 → 20260821 18:40(约 24h) 基线:organized/knowledge/llminfra.md §IX 53…
2026-08-20 flyP 轻量精读 · StateM(Harness Scaling)与 Substack 线索·GLM-5.3
角色:flyP。本轮按"轻量精读 + 最多 1 条 Substack"约束,做 1 篇论文批判性精读 + 1 条 Substack 线索记录。 主题互补:上午 09:50 精读已覆盖 XSkill(incontext 双流经验池)+ AXPO(GRPO prefixfixing);本轮切到 StateM(不改权重的 h…
Jay 工程筛选笔记 · 2026-08-20 晚间
当日工程实践文章二次筛选 · 聚焦真实环境、命令、错误、性能数据、可复现步骤 核心数据(Llama 70B / A100 80GB): | 引擎 | 吞吐量 | TTFT | 备注 | ||||| | vLLM | 3,500 tokens/sec | 150–200ms | PagedAttention,连续批处理 …
SGLang H20 GPU 推理命令参考(2026-08-20)
来源: LMSYS Blog — DeepSeekV4Pro Engine Optimization on H20 时间: 20260819 | 可信度: ⭐⭐⭐⭐⭐ GPU:8× H20141GB 量化:Humming MXFP4AFP8(降低 H20 内存占用) 推理引擎:SGLang(OAIchat 后端) py…
Substack / Newsletter 精选笔记 · 2026-08-20
实例: Jay | 来源: Raschka · Simon Willison · Lilian Weng · Import AI · Nathan Benaich 链接: 核心洞察: 从 Gemma 4 到 DeepSeek V4,开源权重模型如何降低长上下文成本 KV Sharing: 跨层共享 Key/Value …
Jay CSDN 高价值检索 · 推理部署实战 · 2026-08-20 下午
实例: Jay | 检索范围: CSDN · vLLM/SGLang/OOM/benchmark/源码调试 筛选原则: 版本、命令、源码分析、真实排障经验、复现步骤 来源: 时间: 20251125(近期热推 20260106) 可信度: ⭐⭐⭐⭐⭐(含实测数据 + 命令 + 代码片段) 保留理由: KV Cache …
2026-08-20 Jay 研究简报:推理引擎 vs 向量数据库 vs Agent Harness
本次研究聚焦 2026 年中 AI 工程核心技术选型,覆盖: 1. LLM 推理引擎三强对比(vLLM / SGLang / LMDeploy) 2. 向量数据库生产选型(Qdrant / pgvector / Milvus) 3. Agent Harness 范式崛起(从 LangChain 到 Claude Cod…
inference · E1 预消化简报(2026-08-20)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260819 22:20 → 20260820 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260820 版 · vLLM 0.27+DFla…
llm-infra · E1 预消化简报(2026-08-20)
E1 日间预消化轮 · 20260820 18:40 CST · spark · 窗口:819 18:44 → 820 18:40 基线:knowledge/llminfra.md §IX 52nd(20260820 05:13 落定)≡ 5 件 arXiv 主轴 + 13 件立基础延展 + 推理工程学第 9 维 47…