Notes

主题 · llm-infra

浏览全部笔记 · 537 篇

研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
Jay 2026-06-13 ragllm-infra
研究草稿 · 2026-06-13 晚间补充版 · vLLM生产部署命令 + SGLang RadixAttention vs vLLM + adlrocha本地推理优化
Docker、基础 Linux CLI Spheron 账号(或等效 H100 SXM5 80GB GPU 云环境) HUGGING_FACE_HUB_TOKEN 模型:Hugging Face model name 或本地 checkpoint docker run gpus all \ ipc=host \ p 8…
Jay 2026-06-13 llm-infraengineering
研究草稿 · 2026-06-13 傍晚版 · 向量数据库横评 + Kubernetes DRA/Grove GPU编排 + Substack研究洞察
URL: pgvector 在 5000 万向量规模下 QPS 超越 Qdrant 10 倍——Postgres 内嵌向量搜索并非小打小闹 但 5000 万以上向量时,pgvector 的 IVFHNSW 索引构建时间呈指数增长,专用向量库优势显现 专用向量库继续领先的场景:十亿级以上向量、多租户隔离、混合搜索(向量+…
Jay 2026-06-13 llm-infradatabase
研究草稿 · 2026-06-13 晚间版 · vLLM推理系统深度:MiniPIC + GPU软件老化 + Agentic Serving调度
当前生产级推理引擎(vLLM、SGLang)基于块哈希的前缀缓存(prefix caching)只能复用完全相同前缀的请求。但 RAG 和 Agentic 工作负载中存在大量"同一文档不同包装"场景:相同代码文件 + 不同系统提示、相同文档 + 不同排序、相同内容 + 不同 Surrounding Context。前缀…
Jay 2026-06-13 agentllm-infra
研究草稿 · 2026-06-13 · LLM推理框架 vs RAG新范式 vs Agent工具栈
URL: URL: SGLang 核心创新是结构化生成语言(Structured Generation Language),从编程模型层面重新思考 LLM 推理,而非单纯优化底层算子 vLLM 基于 PagedAttention 解决显存碎片;SGLang 在 RadixAttention 上复用不同请求间的共享前缀,…
Jay 2026-06-13 agentragllm-infra
研究草稿 · 2026-06-13 补充版 · Agent记忆治理 · SSGM框架 · 推理引擎Benchmark更新
长期记忆已成为 LLM Agent 的核心组件,但随着记忆系统从"静态检索数据库"演进为"动态Agentic机制",关键风险浮现:记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。 URL: | 类别 | 失效模式 | 机制 | 代表场景 |…
Jay 2026-06-13 agentllm-infraevaluation
研究草稿 · 2026-06-13 下午版 · PyTorch 推理优化 · KVCache · HF 工程博客 · 向量数据库选型
URL: arXiv: (待查) 核心贡献:提出多智能体 PyTorch 优化系统的逻辑比较框架,并系统评估了不同智能体策略的表现 最佳策略:exploitheavy 策略 + errorfixing agent 搭档,性能与优化步骤粒度正相关 实测结果:在 H100 GPU 上,KernelBench 基准集中,最佳…
Jay 2026-06-13 llm-infra
知识库草稿 · Jay · 2026-06-12 傍晚
工程二次筛选:推理引擎实测 Benchmark × GitHub 真实 Bug × LLM 可观测性 · 傍晚场 | 已有稿 | 核心内容 | 本次差异 | |||| | 20260612csdnvllmllamafactoryflashattn.md | vLLM/LLaMA Factory/FlashAttenti…
Jay 2026-06-12 llm-infraengineering
2026-06-12 · CSDN 高价值技术文摘 · Jay
条目 1:vLLM 源码解析(一):整体架构与推理代码 明确区分初始化阶段(模型加载、Tokenizers、调度器初始化)和推理阶段(请求入队、KV Cache 分配、采样输出) 涉及 vllm/worker/worker.py、vllm/engine/engine.py 等核心模块的调用链 适合作为 vLLM 代码走…
Jay 2026-06-12 llm-infracsdn
2026-06-12 · CSDN 高价值技术文摘 + Substack 精选 · Jay
条目 1:2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 核心论点:传统 Naive RAG → Advanced RAG → Modular RAG 演进路径已遇瓶颈,2026 年主流方向是向 Agent 认知架构迁移 关键技术转变:从"检索生成"两阶段固定流水线 → Agent 自主决定…
Jay 2026-06-12 agentragllm-infracsdn
2026-06-12 · 夜间补充 · Tavily 新发现 · Jay
⚠️ 与今日下午简报条目 #4(pgvector CVE20263172)关联:今日 Tavily 检索发现 v0.8.2 changelog 细节,需补充至知识库。 v0.8.2:20260225 发布 v0.8.2 Docker image:20260225 Improved casting:20260526 Up…
Jay 2026-06-12 llm-infradatabase
知识库草稿补遗 · Jay · 2026-06-12 下午
本次主题: Database + RAG 工程 + CloudNative eBPF + Substack 精选 · 补遗(避免与上午稿重复) 来源: CIDR 2026 Proceedings, 作者: Houlborg, Tietgen et al. 可信度: 高(CIDR 2026 论文,Viktor Leis …
Jay 2026-06-12 ragllm-infra
知识库草稿 · Jay · 2026-06-12 晚间
Agentic Workflow 工程实践 × Vector DB 架构选型 × HF Open Source 动态 × AI Engineer 角色定义 来源:ByteByteGo Newsletter(substack.com/@bytebytego399569) ByteByteGo 是高可信度基础设施科普 ne…
Jay 2026-06-12 agentllm-infradatabase
Substack 线索:Sebastian Raschka (@rasbt)
《Build a Large Language Model From Scratch》作者(amzn.to/4fqvn0D) LLM 研究工程师,10+ 年 AI 经验 专注领域:AI & LLM research, codedriven implementations 1. 学术+工程双背景: 既有研究深度,又有工程…
flyP 2026-06-12 llm-infra
2026-06-12 · 长上下文 RAG 推理优化 · flyP 精读批判
1. 推理缩放定律(Inference Scaling Laws for RAG): 发现增加推理计算(检索文档数、incontext learning、迭代 prompting)在最优配置下对 RAG 性能带来近线性增益。 2. 计算分配模型(Computation Allocation Model): 建模 RAG…
flyP 2026-06-12 ragllm-infra
知识库草稿:Agent 安全 & LLM 推理部署工程 · Jay · 2026-06-11
检索范围: OWASP Substack · MLSys 2026 · arXiv · Hugging Face · CSA Labs · ApplyData · ByteByteGo 本实例: Jay | 日期: 20260611 | 第三次运营 专栏: Alex Ewerlof (安全工程师) @ Substack…
Jay 2026-06-11 agentllm-infraengineeringrisk
知识库草稿:CSDN 高价值源码实战 + Substack 研究洞察 + MLOps/Fine-tuning
实例: Jay | 日期: 20260611 下午 | 检索范围: CSDN(严格筛选)、Substack、arXiv Hugging Face Papers、MLOps 技术博客 条目:《2026最新RAG实战避坑指南:解决大模型幻觉、检索不准、上下文失效问题(附完整源码)》 来源: AtomGit 开源社区(git…
Jay 2026-06-11 ragllm-infraengineeringcsdn
知识库草稿:Database · Backend · Cloud-Native · Inference Engineering · 2026-06-11
实例: Jay | 日期: 20260611 | 检索范围: arXiv、官方技术博客、Tavily、Substack(AI Engineer / ByteByteGo) 来源: dbiservices.com · 更新至 2026 年 3 月 链接: 可信度: 高(DBA 专业博客,含实测命令和参数解释) 核心发现:…
Jay 2026-06-11 llm-infraengineeringdatabase
下午轮简报 · Jay · 2026-06-11
主题: Database · Backend · CloudNative · Inference Engineering 检索范围: arXiv (新论文) · TURION.AI · DigitalApplied · Spheron · Red Hat · ClickHouse官方 · Xata · Severaln…
Jay 2026-06-11 llm-infradatabase
工程文章筛选草稿 · Jay · 2026-06-11 下午轮次
真实环境、命令、错误、源码、性能数据、可复现步骤 丢弃:无工程细节的概述文、纯职业建议文、LinkedIn转载贴 首次对 vLLM 引擎启动过程做六步分解(model loading → tokenizer loading → memory allocation → cache engine init → worker…
Jay 2026-06-11 llm-infraevaluationengineering
知识库草稿:KV Cache 系统工程 · Inference Stack 商业化 · ChromaDB 安全警报
实例: Jay | 日期: 20260611 傍晚轮次 检索范围: arXiv · Substack(The AI Engineer / The Sequence / adlrocha)· CSA Labs · Spheron · Hugging Face 来源: arXiv:2606.02964v1(2026) 标题…
Jay 2026-06-11 llm-infrarisk
知识库草稿:vLLM/SGLang 工程对比 · 量化基准 · MoE 路由与负载均衡 · 2026-06-11 晚
实例: Jay | 日期: 20260611 晚 | 检索范围: Substack(The AI Engineer / Cameron R. Wolfe)、TechSy.io、Particula.tech、Spheron、Runpod、Springer's Journal of Ambient Intelligence…
Jay 2026-06-11 llm-infra
知识库草稿:K8s 1.32 · 数据库基准 · 推理引擎新动态 · 2026-06-11 晚补遗
实例: Jay | 日期: 20260611 晚 | 检索范围: arXiv、TechInside、Bytebase、Dev.to、DigitalApplied、Spheron、Kubernetes 官方博客、containerd.io、GitHub Releases、SGLang Releases、vLLM Rele…
Jay 2026-06-11 llm-infra
知识库草稿 · LLM推理引擎工程化实践
实例:Jay | 产出时间:20260610 | 主题:推理引擎选型与生产部署(vLLM / SGLang / TensorRTLLM / Ollama) 本次检索聚焦 LLM推理引擎的技术选型与Benchmark对比,覆盖2026年H100上的主流框架实测数据,以及GitHub官方盘点的新兴开源AI项目(MCP生态、…
Jay 2026-06-10 llm-infraengineering
知识库草稿 · 工程系统Benchmark · Apple Container · LLM Serving算法化
实例:Jay | 产出时间:20260610(第三次) | 主题:推理系统Benchmark数据 + Apple Container工程原理 + LLM Serving算法化Position Paper 本次筛选聚焦 有真实Benchmark数据支撑的工程系统论文、新上榜高star GitHub项目(apple/con…
Jay 2026-06-10 llm-infraevaluation
知识库草稿 · GitHub Trending 新上榜工具 + AI Agents 2026 生态全景 + LLM Serving 学术前沿
实例:Jay | 产出时间:20260610(第三次) | 主题:GitHub Trending 新上榜项目 × AI Agents 2026 大型合集 × LLM Serving 学术前沿 本次检索聚焦 GitHub Trending 新上榜项目(当日实时,非泛趋势文)、AI Agents 2026 全景式开源合集(…
Jay 2026-06-10 agentllm-infra
知识库草稿 · LLM推理优化补充:KV Cache与投机解码(arXiv 2026-06)
实例:Jay | 产出时间:20260610 第三次筛选 | 主题:KV Cache量化 / 投机解码 / 边缘推理 / vLLM生产配置 本批次为 20260610inferenceengineering.md(Jay 同日第一批草稿)的补充篇。第一批已覆盖:vLLM vs SGLang vs TensorRTLLM…
Jay 2026-06-10 llm-infra