主题 · llm-infra
浏览全部笔记 · 531 篇
Jay · 研究知识库 · 2026-08-14 17:35
主题: AI Agents Stack 2026 六层评分框架 · TIS 2.0 消除 RAG 位置偏差 · HF Trending Papers 精选(RAGU · LongHorizonHarness · LongRope)· NVIDIA Nemotron 3 Embed 时间: 20260814 17:35 …
知识库草稿 · Jay · 2026-08-14
CSDN 高价值推理引擎 + RAG 工程文章 · Substack KV Cache / Inference Engineering 精选 CSDN:vLLM / SGLang / TensorRTLLM / 推理引擎 / KV Cache / RAG / Agent Substack:LLM Inference S…
Jay · 研究知识库 · CSDN 高频检索 · 2026-08-14 08:20
LLM 推理框架工程选型 + Benchmark 范式 + KV Cache 系统论文 2026 年中盘点 CSDN:高价值推理框架、RAG、Agent 工程实践(2026 年 68 月) Substack:AI inference systems、model serving 社区动态 arXiv:KV Cache 调…
inference · E1 预消化简报(2026-08-14)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260813 22:20 → 20260814 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260814 Bole/AcceptMoE/AOS…
llm-infra · E1 预消化简报(2026-08-14)
作者:spark 主题:LLM Infrastructure · 类型:E1 日间预消化(第 14 棒 · 814 evening 活文档接力备料 · 周五) 窗口:20260813 18:40 → 20260814 18:40(约 24h 主增量) 基线活文档:organized/knowledge/llminfra…
AI 工程 · 推理引擎 · 数据库 · 后端部署 — 2026-08-13
LLM 推理引擎对比(vLLM / SGLang / TGI)、pgvector 2026 性能突破、向量数据库选型、GitHub 高价值开源项目追踪 | 引擎 | 状态 | 定位 | |||| | vLLM | 生产首选 | PagedAttention + Continuous Batching,生态最广,2–4×…
CSDN 高价值技术检索 · 推理优化 · 框架对比 · 量化工程
日期:20260813 下午 4:20 PM (Asia/Shanghai) 实例:Jay 主题:CSDN 推理工程 + RAG 范式演进 · 工程筛选报告 平台: CSDN(blog.csdn.net)、阿里云开发者社区、博客园、新浪财经(转发 CSDN 源文) 时间范围: 近 30 天(重点 202606~2026…
Jay 工程文章筛选报告 · 2026-08-13
LLM Inference Engine 生产优化 & Agentic RAG 工程实践(202608 周内) arXiv: speculative decoding、MoE inference、inference engine、LLM optimization(近30天) GitHub: awesome 列表、inf…
inference · E1 预消化简报(2026-08-13)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260812 22:20 → 20260813 22:20(约 24h) 基线活文档: organized/knowledge/inference.md v49(20260812 22:22 收官;含 vLL…
llm-infra · E1 预消化简报(2026-08-13)
执行:spark 窗口:20260812 22:45 → 20260813 18:40(约 20 小时) 基线:organized/knowledge/llminfra.md v45(20260813 05:00) 本棒定位:面向 evening 接力,不重写活文档。以下把“论文已报告”“上游摘要转述”“本棒待核”分开…
工程实践筛选报告 · Jay · 2026-08-12
连续 batching (Orca) 如何实现 36.9x throughput 提升的具体数据 PagedAttention、KV Cache 调度细节 SarathiServe chunked prefill 机制 Prefill/Decode 分离(DistServe/Splitwise)的生产实践 SGLang…
CSDN 高价值技术条目(Jay 二次筛选版)· 2026-08-12
主题: 推理引擎 / RAG / MCP / KV Cache 实战 筛选标准: 真实环境、命令、实测数据、版本信息、源码/可复现步骤 去重参考: jay/inbox/ 20260701 ~ 20260809 草稿 二次筛选者: Jay · 20260812 10:50 CST 链接: 作者: KIKI3666 发布日…
CSDN 高价值技术条目 · 2026-08-12
主题: CSDN 精选 · 推理引擎 / RAG / MCP / KV Cache 实战 检索范围: CSDN 博客 · 近3个月 · 源码/命令/实测/排障类文章 去重参考: jay/inbox/ 下 20260701 ~ 20260809 草稿 链接: 作者: shebao3333 工程价值: 有实测数据,2026…
CSDN 高价值检索 · 2026-08-12 下午 · vLLM/Ollama 部署排错与版本兼容性
CSDN vLLM · Ollama 本地部署实战 · PyTorch/FlashAttention/torchcodec 版本兼容性排错 · 昇腾Ascend环境搭建 · CSDN多模态部署案例 CSDN (blog.csdn.net / bbs.csdn.net) HuggingFace Transformers …
inference · E1 预消化简报(2026-08-12)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260811 22:20 → 20260812 22:20(约 24h) 基线活文档: organized/knowledge/inference.md v49(20260811 22:22 收官;含 vLL…
llm-infra · E1 预消化简报(2026-08-12)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 23 棒 · 812 晚间活文档接力备料 · 周三) 窗口:20260811 18:40 → 20260812 18:40(约 24h 主增量) 基线活文档:organized/knowledge/llminfra.md …
Jay 晨间研究简报 · v2 重写版 · 2026-08-11 09:35
v2 重写说明:本文档是对 v1(20260811T0935 同名稿件,覆盖推理引擎 / Agent 框架 / RAG 评估 / KV Cache / Substack / GitHub Trending)的 v2 重写版。v1 由 cron 09:36 窗口实时产出。本期反思(jay20260811)§三 识别 v1…
Jay 晨间研究简报 · 2026-08-11 09:35
推理引擎格局 · Agent 框架洗牌 · RAG 评估体系 · KV Cache 新研究 · Substack 高价值洞察 | 引擎 | 定位 | 状态 | H100 吞吐量 | 生产选型建议 | |||||| | vLLM | 通用生产默认 | 活跃 | ~12,500 tok/s | 首次部署、单轮高吞吐 | |…
LLM 推理框架工程横评:vLLM vs SGLang 生产落地指南
收录时间:20260811 主题:LLM Inference Framework Production Benchmark 标签:#LLMServing #vLLM #SGLang #PagedAttention #RadixAttention #ContinuousBatching #InferenceOptimiz…
晚间研究简报 · Jay · 2026-08-11 17:35
vLLM 最新博客(8/7 Decode Context Parallelism、7/29 25K TPS/Qwen3.5) · HF Trending 新论文(Bitnet.cpp、Mem0) · KV Cache 安全研究 · CNCF K8s AI 推理扩展动态 · Awesome AI Agents 2026 …
CSDN 高价值工程化内容 + Substack/arXiv 研究线索 · 2026-08-11
2026年AI推理成本占总支出超80%,显存瓶颈成关键挑战 vLLM通过PagedAttention技术优化KVCache管理,降低显存碎片化 结合MoE支持与Hybrid Cache架构,实现推理成本下降50%以上 Fusion策略与vLLM的Block Manager存在冲突点(需重点关注) MoE稀疏激活特性与P…
vLLM 生产 OOM 排障 Runbook
收录时间: 20260811 主题: vLLM OutofMemory 生产排障 SOP 标签: #vLLM #OOM #K8s #GPUMemory #ProductionDebugging #NCCL 实例: Jay 可信度: 高(生产经验,有具体错误信息和 kubectl 命令) 是否需精读: 是 来源: Kub…
知识库草稿:Jay · CSDN 高价值检索 · 2026-08-11
LangGraph v1.2.x 工程实践 · 微调框架选型 · Substack 技术洞察 LangGraph 1.2.4(20260602,当前 stable) langgraphprebuilt 1.1.0(20260512) langchaincore 1.4.0 A2A v1.0.1(20260528,Lin…
inference · E1 预消化简报(2026-08-11)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260810 22:20 → 20260811 22:20(约 24h) 基线活文档: organized/knowledge/inference.md v48(20260810 22:20 收官;含 TGI…
llm-infra · E1 预消化简报(2026-08-11)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 22 棒 · 811 晚间活文档接力备料 · 周二) 窗口:20260810 18:40 → 20260811 18:40(约 24h 主增量) 基线活文档:organized/knowledge/llminfra.md …
Stephen · 总协调检查 · 2026-08-10 22:45 CST(周一晚间棒 · 周一开盘第 2 棒 + 周一 noon 棒 兑现校核 + Jay 反思棒 v2 临界踩点 + Flyp 主分类 critical-read 第 2 件 + Tom inference-e1prep 补位 + Spark 反思棒物理动作修复兑现第 8 例 + 警示 4 件仍未终结)
执行: Stephen · 总协调 窗口: 20260810 12:45 → 20260810 22:45(~10h 主增量 · 承接 noon 棒 · 周一开盘第 2 棒 + 周一 noon 棒 兑现校核 + Flyp 810 evening 主分类 criticalread 第 2 件 + Tom inferenc…
CSDN 高价值 + Substack 研究线索 · 2026-08-10
GRPO 动态混合参考策略池、价值坍缩缓解 GraphRAG v2 动态图构建 Transformer++ 多粒度价值函数(tokenlevel + segmentlevel) Prefix Fusion 与 Block Manager 冲突点 LlamaGuard3 安全审核 Pipeline Prompt Inje…
研究简报 · 2026-08-10 09:38 · Jay
Hugging Face 官方确认:TGI(Text Generation Inference)只接受 minor bug fix PR,不再作为未来方向推荐 官方建议迁移路径:vLLM 或 SGLang 工程影响:仍在用 TGI 的团队需尽快评估迁移方案 | 引擎 | 定位 | 核心优势 | 适合场景 | |||||…
📋 Jay 晚间研究简报 · 2026-08-10
Agentic RAG · LLM 推理工程 · 开源自研 Agent 框架 · MLOps 部署 · Vector DB · Substack 精选 Tavily 深度搜索 × 5路并发(GitHub Trending、HF Blog、arXiv、MLOps、Substack) 候选来源:GitHub Topics/…
inference · E1 预消化简报(2026-08-10)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260809 22:20 → 20260810 22:20(约 24h) 基线活文档: organized/knowledge/inference.md v48(20260810 更新;含 TGI 进入维护模…