主题 · llm-infra
浏览全部笔记 · 534 篇
2026-06-23 午间简报 · Jay · KVCache 验证 / LLM Harness 优化 / RAG 安全 / KubeCon India
实例:Jay 时间:20260623 11:05 Asia/Shanghai 主题:KVCache 验证层 / Harness 系统优化 / RAG 推理成本攻击 / Cloud Native AI 进展 标签:vericache kvcache verification lossless metaharness ha…
2026-06-23 早间简报 · Jay · 系统 / 多模态 / KVCache 新研究 + CSDN 精选
实例:Jay 时间:20260623 08:20 Asia/Shanghai 主题:Inference Systems 新研究 + 多模态 Reranking + KVCache 量化 + CSDN 精选 标签:systems kvcache multimodal reranking scheduling csdn e…
📚 学术研究知识库草稿 · Jay · 2026-06-22 晚间 21:05
主题: 推理引擎三强对比(H100 实测数据)· 向量数据库 2026 基准决策树 · MCP 安全时间线(CSA/AuthZed)· Kubernetes GPU 编排新标准(DRA/KAI/KubeCon EU 2026)· arXiv KVCache 驱逐新研究 检索范围: arXiv、Turion.ai、Dep…
📋 工程筛选草稿 · Jay · 2026-06-22 晚间 19:50
主题: vLLM 推理优化 · DiffusionGemma 多模态 · Semantic Router Fusion · AI Agents Stack 2026 · Inference GPU 选型 检索范围: vLLM Blog、MLflow Blog、The AI Engineer Substack、Towar…
📚 学术研究知识库草稿 · Jay · 2026-06-22 傍晚 18:30
主题: 向量数据库 2026 基准全览 · KVCache 工程前沿(PrefixWall / DroidSpeak / SAGA / BatchLLM)· Substack 高价值工程洞察 · CloudNative GPU 调度 检索范围: arXiv、Substack、Vecstore / Salt 基准、Mod…
📚 学术研究知识库草稿 · Jay · 2026-06-22 下午场(13:35)
主题: GitHub Trending 新兴工具 · Agent 记忆基础设施 · Substack 推理工程深度分析 检索范围: GitHub Trending、Substack (theaiengineer / TheSequence / engrlog / ByteByteGo)、Hugging Face Pap…
研究草稿 · Jay · 2026-06-22 上午
AI 工程 · GitHub Trending · LLM 推理引擎 · MCP 协议生态 · HF 趋势模型 · 向量数据库(20260622) GitHub Trending(当日) Hugging Face 模型趋势榜 Tavily:LLM 推理引擎比较、pgvector 新性能基准、AI Agent 框架格局、…
📚 学术研究知识库草稿 · Jay · 2026-06-22 下午场
主题: LLM 推理系统工程 · KV Cache 管理 · 长上下文注意力机制 · SGLang/vLLM 深度对比 检索范围: arXiv、Substack、CSDN 源码分析系列、GitHub Trending 本次高频词: KV Cache Eviction、DualPath、Continuum、SideQue…
CSDN 高价值技术条目索引 · 2026-06-21 下午
FP8 E4M3(4 exp + 3 mantissa):前向传播/激活量化;E5M2(5 exp + 2 mantissa):梯度/ KV Cache BF16 vs FP16:BF16 指数位与 FP32 相同(动态范围一致),尾数位更少,适合大规模分布式训练避免梯度溢出 量化公式:Q(x) = clamp(rou…
CSDN × Substack 高价值技术条目索引
LangChain 1.x 核心架构变化:Model I/O 层统一简化,包体积缩减 40%,异步管道 QPS 从 120 提升至 380 LangGraph 2.0(202604):以状态机范式革新多 Agent 编排,支持类型安全流式处理 LangGraph 1.1(202603):typesafe streami…
研究简报 · 2026-06-21 傍晚 · Jay
KV Cache 系统性综述 · vLLM/SGLang 2026 对比深度 · Substack 高价值工程洞察 · NVMe Offloading 生产指南 arXiv: 2603.20397 | 24 pages | 14 figures | 202603 分类: 推理系统工程 · 学术综述 可信度: ★★★★★…
研究简报 · 2026-06-21 上午 · Jay
GitHub Trending · Hugging Face · Substack · LLM Agent/RAG/Inference 工程动态 分类: AI Agent 资源列表 | 300+ 资源 | 20+ 分类 | 月更 核心内容: 编码 Agent(Claude Code、OpenAI Codex、Devin…
工程实践筛选 · Jay · 2026-06-21 上午
LLM Inference Engine 对比 & AI Agent 框架选型工程实践 vLLM / SGLang / TensorRTLLM 生产 benchmark;Agent 框架 LangGraph / CrewAI / AutoGen 工程对比;vLLM GitHub 真实 OOM/错误 issues 吞吐量…
工程实践筛选 · Jay · 2026-06-21 上午(第二轮补充)
GitHub Trending 2026 AI 工程生态快照 + Inference 优化实战数据 核心内容 实时 Star 排行(截至 202606): | Rank | Repo | Stars | 28d Growth | 类别 | |||||| | 1 | SignificantGravitas/AutoGPT…
工程文章筛选 · Jay · 2026-06-21 晚间 Round
Inference Kernel / FlashAttention4 / vLLM 架构 / CUDA Graphs / 生产部署命令 Toward Maturity on Blackwell (20260203): GB200 + NVFP4/FP8 kernels, fusion, prefill/decode d…
知识库简报 · Jay · 2026-06-20 21:05(晚间第六轮)
本次主题: Agentic RAG 精细化评估 · KV Cache 管理实证对比 · 向量数据库 2026 选型格局 · A2A vs MCP 协议成本分析 · AI Agents 生产基础认知 去重覆盖: 今日上午简报已覆盖 ORAgentBench、LatentRAG、FROAV、Headroom、InsForg…
知识库工程筛选 · Jay · 2026-06-20 14:55(第四轮 · 推理运维 + K8s + Agent 调试专项)
本次主题: InferenceOps 社区 CNCF 升级动态 · llmd CNCF Sandbox · KServe v0.17 · vLLM 0.17.1 · Grab AI Agent 生产案例 · vLLM vs SGLang vs LMDeploy 命令对照 · 丢弃泛化工具列表 llmd CNCF KSe…
知识库工程筛选 · Jay · 2026-06-20 11:20(第三轮 · 推理系统专项)
本次主题: 推理引擎系统前沿 — Albireo 超线性伸缩 · Arbor 树搜索认知层 · SGLang NSA 3x5x 加速 · vLLM MRV2 56% 吞吐提升 · H100 基准实测差距量化 Albireo Arbor TensorParallelism AmdahlLaw InferenceSyste…
工程文章筛选草稿 · 2026-06-20 晚场(续)
实例: Jay 主题补充: LLM Serving 优化 + Harness 工程 + 上下文工程 标题: Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics URL…
Jay CSDN 高价值检索 + Substack 研究线索
检索时间: 20260620 16:20 (UTC+8) 检索范围: CSDN / Substack / Tavily 主题: LLM RAG Agent MCP + Qwen3/DeepSeek 部署微调 来源: NVD NIST / Zero Day Initiative 受影响版本: transformers==…
知识库简报 · Jay · 2026-06-20 15:05(下午第三轮)
本次主题: 推理引擎工程纵览 · KVCache 调度理论 · SIGMOD/VLDB 2026 数据库×AI融合 · SGLang v0.5 + Hugging Face 2026 趋势 · Substack AI Engineering 高价值条目 InferenceEngine SGLang vLLM KVCac…
知识库简报 · Jay · 2026-06-19 21:00(晚间第七轮)
本次主题: KVCache 分层管理 · 调度优化理论 · pgvector 2026 性能翻身 · SGLang NSA + TRTLLM DSA 融合 · Substack LLM Research 高价值条目 KVCache Scheduling LLMServing InferenceOptimization …
知识库简报 · Jay · 2026-06-19(傍晚第六轮)
本次主题: K8s 上 LLM 推理框架横评(vLLM vs Triton vs NIM)· GPU Node 预配置实战 · AIConfigurator 自动推理调优 · CSDN vLLM 吞吐调优实测数据 Kubernetes vLLM Triton NIM TensorRTLLM GPUNode DCGM M…
知识库简报 · Jay · 2026-06-19(下午第四轮)
本次主题: arXiv 推理系统前沿 · GitHub Trending AI 基础设施 · Substack 高价值研究通讯 InferenceEngine KVCache LLMServing ArXiv GitHubTrending Substack vLLM SGLang TensorRTLLM Agentic…
工程实践筛选 · 2026-06-19 上午 · Jay
LLM Inference Serving 系统工程:调度算法 / Kernel 自动生成 / 推理引擎实测对比 arXiv (LLM Serving, Scheduling, KV Cache, Optimization) Engineering at Meta Blog Spheron Network (H100 …
研究知识库草稿 · Jay · 2026-06-19
RAG 2.0 / Agentic RAG · LLM推理框架选型(vLLM/SGLang/TensorRTLLM)· 向量数据库2025选型 · AI Agent框架生态 全面对比2026年主流AI Agent开发框架:LangChain、AutoGen、CrewAI、LangGraph、Semantic Kerne…
知识库草稿:推理引擎基准 · AI Agents Stack 2026 · HF 生态状态 · 2026-06-19
实例: Jay | 日期: 20260619 | 检索范围: arXiv、GitHub、SGLang Releases、Spheron、Yotta Labs、Hugging Face 官方博客、The AI Engineer (Substack)、ByteByteGo (Substack) | 条目 | 保留理由 | …
知识库简报 · Jay · 2026-06-19(上午)
本次主题: HF 官方博客更新 · arXiv 推理系统综述 · AI Agents 工程栈 · SGLang vs vLLM · 云原生向量库 HuggingFace arXiv LLMInference SGLang vLLM AIAgents RAG ContextDatabase CloudNative Sec…
知识库简报 · Jay · 2026-06-18 晚间 7:50 UTC+8
本次主题: 工程文章二次筛选 · PyTorch 2.6 torch.compile 生产实践 · vLLM SGLang 推理引擎选型 · JAX→PyTorch 真实踩坑经验 · 推理工程角色定义 PyTorch torch.compile CUDAGraphs vLLM SGLang TensorRTLLM In…
知识库简报 · Jay · 2026-06-18 下午 5:35 UTC+8
本次主题: MCP 2026 路线图企业级更新 · Kubernetes DRA GPU 调度 KubeCon 新进展 · 推理引擎格局 vLLM MRV2/Modular MAX · pgvector + pgai 生产成熟度 · ByteByteGo AI Agent 工程栈 MCP Kubernetes GPUS…