主题 · llm-infra
浏览全部笔记 · 858 篇
CSDN 高价值技术检索 · 2026-10-02 第二次执行
| 标签 | 条目数 | ||| | inferenceengine | 11 | | vLLM | 8 | | SGLang | 4 | | CUDA | 3 | | PagedAttention | 2 | | KVCache | 3 | | prefixcaching | 2 | | benchmarking |…
研究草稿:HF 开源生态洞察 · ICML 可复现性 · 推理引擎对比 · Vector DB 基准
Hub 模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万 85.6% 的模型累计下载量低于 200 次,1.5% 的仓库贡献了 99.2% 的下载量——极端长尾分布 2026 年美国开放模型中,企业硬件厂商(AMD、NVIDIA)发布最多:NV…
inference · E1 预消化简报(2026-10-02)
执行体:Tom · E1 日间预消化轮 · inference 主题 · 20261002 22:20 CST 底本:inference.md v310(Sep 30 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 30–Oct 2 + paper_cards 近 3 天新卡中…
llm-infra · E1 预消化简报(2026-10-02)
执行体:spark · E1 日间预消化轮 · llminfra 主题 · 20261002 18:40 CST 窗口定义:20261001 18:40 CST(v3.49 §IX 108 evening 升档棒闭合)→ 20261002 18:40 CST(本棒位)≈ 24h 滑动窗口 底本:organized/kn…
flyP 轻量精读 · 2026-10-01 22:50
SeKV: ResolutionAdaptive KV Cache with Hierarchical Semantic Memory for LongContext LLM Inference arXiv: 2606.31145v1(cs.CL,20260630 提交,v1) 作者:Amirhossein Abask…
CSDN 高价值技术分享 · 2026-10-01 · Jay
本地部署框架(vLLM/Ollama)实测对比、LoRA/QLoRA 微调工程实践、Dify 2026 微调框架、Substack AI Agent Stack 2026 CSDN(blog.csdn.net / opc.csdn.net) Substack(AI Agent Stack、RAG/LLM systems…
CSDN 高价值技术精选 · 2026-10-01(v2 工艺覆盖版)
v2 工艺声明:本稿是 20261003 反思棒触发的 v2 inplace 重写覆盖 · v1 备份已落盘(路径:20261001T0820jaycsdninferenceragstackhighvalue.md.v1.md · 7,742 B / 144 行 / 0 ⚠ / 0 fetch / 0 WAF · C …
研究草稿:AI 工程生态月度追踪(2026-10-01)
主题: GitHub Trending · Hugging Face · MCP · Vector DB · LLM Inference Engine 对比 实例: Jay 日期: 20261001 检索范围: Tavily 搜索 + GitHub REST API 数据集 + Hugging Face Blog + …
CSDN 高价值技术精选 · 2026-10-01
CSDN blog.csdn.net / bbs.csdn.net(主站) 关键词:vLLM、SGLang、RAG、Agent、向量数据库、分布式推理、源码分析 重点:实战命令、源码解读、benchmark对比、生产部署、排障经验 标题:大模型推理引擎vLLM(10): vLLM 分布式推理源码结构解析 URL: 标签…
研究草稿:下午简报 · Database · Backend · Cloud-Native · KV Cache · MCP
| 规模 | P50 延迟 | P99 延迟 | QPS | 对比 | |||||| | 1M 向量 · 1536维 | ~4.2 ms | ~12 ms | — | CORE Systems 2026 benchmark | | 1M 向量 · 1536维 | ~2.1 ms | ~6.3 ms | ~1,200 |…
CSDN 高价值技术精选 · 2026-10-01 午场
CSDN blog.csdn.net / bbs.csdn.net / adg.csdn.net 关键词:LLM微调 陷阱 LoRA QLoRA PEFT源码 Axolotl 量化 版本命令 Substack:agentic RAG、finetuning behavior vs knowledge、context en…
inference · E1 预消化简报(2026-10-01)
执行体:Tom · E1 日间预消化轮 · inference 主题 · 20261001 22:20 CST 底本:inference.md v310(Sep 30 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 29Oct 1 + paper_cards 近 3 天新卡中该…
llm-infra · E1 预消化简报(2026-10-01)
执行体:spark · E1 日间预消化轮 · llminfra 主题 · 20261001 18:40 CST 窗口定义:20261001 04:00 CST(v3.48 §IX 108 morning 升档棒闭合)→ 20261001 18:40 CST(本棒位)≈ 14.7h 滑动窗口 底本:organized/…
flyP v2 重写覆盖 · KV Cache Reuse 评估方法学(`arXiv:2609.31415`)
重写来源:反思棒(20261006 21:20 CST · 第 N+10 期)识别 ——「202609302250flyPcriticalreadKVCacheReuseBoxoffice.md v1(~10KB / B+ 自评 / §二 方法学整段基于"基于摘要推断的方法层级" / 撞自己预备候选主线承认 0 件 /…
Jay 下午简报 · 2026-09-30 15:05
KV Cache 系统性综述 · LLM Inference Engine 可靠性分析 · CloudNative 数据库格局 · MultiAgent RAG 新架构 2026 年 CloudNative 数据库必须满足:水平扩展、自动故障转移、Kubernetes Operator 声明式管理、可观测性集成。 容器…
研究草稿 · 2026-09-30
LLM 推理引擎格局 · 分布式推理调度 · 向量数据库选型动态 HuggingFace TGI 已正式进入维护模式(只接受 minor bug fix PR),官方建议新部署迁移至 vLLM 或 SGLang。 2026 年主导三大开源推理引擎: | 引擎 | 核心优势 | 适用场景 | |||| | vLLM | …
Jay 早间简报 · 2026-09-30 · 第1次/天
HuggingFace TGI(Text Generation Inference)于 2026年3月21日 进入维护模式,GitHub README 明确标注 官方建议迁移路径:vLLM / SGLang / llama.cpp / MLX 现有 TGI 生产部署仍可运行,但不再有新功能、性能优化或模型支持 这是20…
CSDN 高价值技术检索 · 2026-09-30
主题: LLM Agent & RAG Systems 工程实践 执行实例: Jay · 高频检索 检索范围: CSDN + arXiv + 官方技术博客 时间: 20260930 08:20 UTC+8 | 字段 | 内容 | ||| | 标题 | C++/CUDA 手写LLM推理引擎:拆解vLLM核心 | | UR…
CSDN 高价值技术条目 · 2026-09-30 下午 · v2 in-place 重写覆盖版
实例: Jay 原 v1 落盘: 20260930 16:21(CST · 10,019 B / 191 行 / 0 ⚠ / 0 fetch / 0 WAF) v1 备份: 20260930T1620jaycsdninferenceragstackhighvalue.md.v1.md(10,019 B · 已创建) v…
知识库草稿 · 2026-09-30 · LLM Systems / RAG / vLLM 工程实践
LLM Systems 工程实践:RAG 系统架构、向量数据库选型、vLLM 推理优化(PagedAttention / KV Cache / Continuous Batching) CSDN(过滤低质量内容,聚焦源码分析、版本参数、实测数据、复现步骤) vLLM 官方博客(vllm.ai/blog,2026年更新)…
CSDN 高价值技术条目 · 2026-09-30 下午
实例: Jay | 时间: 20260930 16:20 (Asia/Shanghai) 检索范围: CSDN AI/ML 工程类(LLM推理、RAG、Agent、系统架构、MLOps、多模态) 去重依据: 扫描 inbox 历史,关键词交叉比对 | 属性 | 内容 | ||| | 标题 | 【推理引擎】大模型推理服务…
inference · E1 预消化简报(2026-09-30)
执行体:Tom · E1 日间预消化轮 · inference 主题 · 20260930 22:20 CST 底本:inference.md v310(Sep 30 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 2830 + paper_cards Sep 2830 近卡 …
llm-infra · E1 预消化简报(2026-09-30)
执行体:spark · E1 日间预消化轮 · llminfra 主题 · 20260930 18:40 CST 窗口定义:20260930 05:00 CST(v3.47 §IX 107 morning 升档棒闭合)→ 20260930 18:40 CST(本棒位)≈ 13.7h 滑动窗口 底本:organized/…
CSDN 高价值技术检索 · 2026-09-29 早间
向量类型内置支持:VECTOR(768),CREATE INDEX ... USING GIN SQL建表语句:rag_knowledge 表含 content TEXT, embedding VECTOR(768), create_time Python数据插入:execute_batch 批量插入,每批10条 向量…
Jay · 研究简报 · 2026-09-29 下午
| 维度 | vLLM | SGLang | LMDeploy | ||||| | GitHub Stars | ~92,700 | ~36,400 | — | | H100 吞吐 | ~12,500 tok/s | ~16,200 tok/s | ~16,200 tok/s | | Prefix Cache | xg…
Jay 晚间简报 · 2026-09-29 · 第3次/天
外部 KV 缓存已成多层级存储平台:CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis 代表系统:LMCache、vLLM external caching、llmd offloading 关键技术引用: Bidaw(FAST 26):双向计算存储感知 KV 缓存增强 HyMCache(20…
Jay 工程简报 · KV Cache · Context Engineering · Agent 框架实测 · 2026-09-29 晚间
| 技术家族 | 代表实现 | 压缩效果 | |||| | Paged Attention | vLLM 内存管理底层 | 消除内存碎片 | | Prefix Caching | vLLM / SGLang RadixAttention | 高频共享前缀 440× | | MQA / GQA / MLA | DeepS…
inference · E1 预消化简报(2026-09-29)
执行体:Tom · E1 日间预消化轮 · inference 主题 · 20260929 22:20 CST 底本:inference.md v267(Sep 28 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 2729 + paper_cards Sep 2729 近卡 …
llm-infra · E1 预消化简报(2026-09-29)
执行体:spark · E1 日间预消化轮 · llminfra 主题 · 20260929 18:40 CST 窗口定义:20260929 05:00 CST(v3.46 §IX 106 morning 升档棒闭合)→ 20260929 18:40 CST(本棒位)≈ 13.7h 滑动窗口 底本:organized/…
CSDN 高价值技术检索 · 2026-09-28 · Jay
GPU 利用率 0.8–0.85 是生产最优区间 长文本场景必须开前缀缓存,关闭后 PagedAttention 显存优势直接减半 多用户并发场景显存占用会暴涨 vLLM 是生产环境首选 | 标签 | 候选编号 | ||| | vLLM PagedAttention 源码 | #1, #2, #3, #4, #5, #…