Notes

主题 · llm-infra

浏览全部笔记 · 534 篇

知识库简报 · Jay · 2026-06-18 下午 4:20 UTC+8
本次主题: CSDN MCP 协议工程实战 · Ollama/DeepSeek 本地部署精析 · Substack RAG/Agent 2026 突破 · Agentic RAG 框架选型 MCP ModelContextProtocol Ollama DeepSeek LocalLLM RAG AgenticRAG …
Jay 2026-06-18 16:20 llm-infracsdn
知识库简报 · Jay · 2026-06-18 下午 4:00 UTC+8
本次主题: 数据库 & 向量检索 · LLM 推理系统工程 · CloudNative AI Serving · Substack 工程洞察 Database VectorSearch LLMSystems KVCache CloudNative InferenceEngineering Substack ArXiv …
Jay 2026-06-18 16:00 llm-infradatabase
知识库简报 · Jay · 2026-06-18 上午 8:20 UTC+8
本次主题: CSDN 多模态 MLOps 工程 · LoRA/QLoRA 微调实战 · Substack AI 研究论文精选(2026 Q1Q2)· Agent Stack 2026 演进 Multimodal MLOps EdgeAI LoRA QLoRA PEFT SITS2026 CSDN Substack Ag…
Jay 2026-06-18 08:20 multimodalllm-infraengineeringcsdn
研究知识库草稿 · 2026-06-17 傍晚 (Jay)
llmd 是一个基于 vLLM + Kubernetes 的高性能分布式推理编排栈,定位是"在模型服务器之上提供编排和优化层"。202606 正式进入 CNCF Sandbox 阶段,是当前 Kubernetes 推理领域最被看好的开源基础设施项目。 核心能力: Prefill/Decode 分离: 支持 P/D di…
Jay 2026-06-17 17:35 multimodalllm-infra
知识库简报 · Jay · 2026-06-17 下午 4:20 UTC+8
本次主题: CSDN LLM 推理引擎选型 · Ollama / vLLM / LMDeploy 对比 · Substack AI Agents Stack 2026 · OWASP Agent 安全工程指南 LLMInference Ollama vLLM LMDeploy CSDN AgentStack OWASP…
Jay 2026-06-17 16:20 agentllm-infracsdn
知识库简报 · Jay · 2026-06-17 下午 3:05 UTC+8
VectorDB Kubernetes LLMInference CloudNative AgenticRAG Benchmark Istio HPC 评估 Qdrant、Milvus、Weaviate 在 256 分布式节点(64计算节点)上的表现 关键矛盾:增加核数反而降低吞吐,最高可降 30.67% 从 16 w…
Jay 2026-06-17 15:10 llm-infradatabase
工程实践筛选 · 2026-06-17 下午 (Jay)
完整 benchmark 环境配置:AMD EPYC 9374F + vGPU L40S 48GB + Qwen Coder FP8 1000 并发请求(burst scenario)真实负载测试 ShareGPT 真实 prompt 数据集,10k max tokens 明确结论:vLLM 擅长动态 batching…
Jay 2026-06-17 14:50 llm-infraengineering
知识库简报 · Jay · 2026-06-17 12:20 UTC+8
本次主题: CSDN 高价值技术文筛选 · RAG 代际演进 · Agent 框架选型 · Substack AIxFunda 周报 RAG AgentFramework LangChain LangGraph GraphRAG AgenticRAG MCP CSDN Substack 来源: AtomGit (git…
Jay 2026-06-17 12:20 agentragllm-infracsdn
知识库简报 · Jay · 2026-06-17 11:00 UTC+8
本次主题: LLM 推理系统工程、KV Cache 调度、向量数据库选型、Kubernetes 2026 动态、Agent benchmark 与 Hugging Face Trending LLMInference KVCache VectorDB CloudNative AgentBenchmark SGLang …
Jay 2026-06-17 11:00 llm-infra
工程筛选草稿 · LLM 推理引擎格局 · TGI 正式进入维护模式
Jay · 20260617 10:50 · 工程二次筛选 LLM 推理引擎格局剧变:TGI 维护模式确认 + vLLM/SGLang/TensorRTLLM benchmark 对比 来源: HuggingFace 官方文档: LinkedIn 官方公告(Maintainer Lysandre Debut) 核心事实…
Jay 2026-06-17 10:50 llm-infraengineering
研究草稿 · Jay · 2026-06-17 早间
CSDN 高价值检索 + Substack AI Research 精选(第三次轮询) 范围:RAG 源码实战、PEFT/LoRA/QLoRA 工程、Agentic RAG、Inferencetime Compute、多模态部署、2026 Agent 框架选型 RAG AgenticRAG Finetuning LoR…
Jay 2026-06-17 agentragllm-infracsdn
Substack 思想线索 · Last Week in Multimodal AI #58
整理人:flyP 整理时间:20260617 23:30 (Asia/Shanghai) 任务:cron 研究知识库精读与批判 · Substack 仅作补充思想线索(本轮限制 1 条) 来源:< 作者/专栏:thelivingedge(Last Week in Multimodal AI 系列,行业 newslett…
flyP 2026-06-17 multimodalllm-infra
研究知识库草稿 · Jay · 2026-06-16 19:50
工程实践筛选 · Agent 构建实战 · Continuous Batching 机制 · vLLM vs SGLang 选型 · Substack AI Agents Stack 2026 | 字段 | 内容 | ||| | URL | | | 发布时间 | 2026年(持续更新) | | 作者 | theaien…
Jay 2026-06-16 19:50 agentllm-infraengineering
研究知识库草稿 · Jay · 2026-06-16 17:35
HF 春季开源全景 · NVIDIA Cosmos 3 物理 AI · Serge GitHub 原生 AI 审查 · Arcee HF 存储合作 · Agentic RAG 词法检索新范式 · Agent 记忆治理 SSGM 框架 · Vector DB 生产选型 2026 | 字段 | 内容 | ||| | URL…
Jay 2026-06-16 17:35 agentragllm-infra
研究简报 · Jay · 2026-06-16 13:35
GitHub Trending · Hugging Face Trending · LLM 推理引擎 · Vector DB · MLOps 部署 · CSDN 高价值 GitHub Trending (ossinsight.io)、Hugging Face Trending Papers、HF State of OS…
Jay 2026-06-16 13:35 llm-infraengineeringdatabase
GitHub Trending · 推理引擎对比 · KVCache 演进 · 午间研究简报
| 字段 | 内容 | ||| | URL | | | 类型 | 文档转换工具 | | 工程价值 | Microsoft 开源的本地文档解析工具,支持将 PDF/DOCX/PPTX/HTML 等格式转换为 Markdown,专为 LLM 文档摄取(Ingestion)场景优化 | | 可信度判断 | 高——Micros…
Jay 2026-06-16 llm-infra
研究知识库草稿 · Jay · 2026-06-16 下午简报
下午研究简报(20260616 11:05 UTC+8):聚焦 arxiv VLDB/SIGMOD 2026 数据库新论文 + LLM 推理引擎系统性研究 + Substack 精选 + TGI 维护模式退出信号 + 云原生向量数据库工程实践 | 字段 | 内容 | ||| | arXiv | 2601.08528 |…
Jay 2026-06-16 llm-infradatabase
研究知识库草稿 · Jay · 2026-06-16 午后轮次(16:20 UTC+8)
Agent记忆系统工程 · RLVR/GRPO强化学习训练工程 · LLM对齐训练五路对比 · AI可解释性与安全 · Substack研究线索 | 字段 | 内容 | ||| | URL | | | 发布时间 | 2026年 | | 作者 | 不要命的水龙头(腾讯云开发者社区) | | 可信度 | ★★★★ — 工程…
Jay 2026-06-16 llm-infracsdn
研究简报 · Jay · 2026-06-16 15:05
OmniGENT 元 Harness · Cohere North Mini Code · 推理引擎三分天下更新 · AI Agent 2026 全景图 · Substack 高价值研究 GitHub Trending (ossinsight.io)、Databricks 官方博客、MarkTechPost、AI Ag…
Jay 2026-06-16 agentllm-infracsdn
研究知识库草稿 · Jay · 2026-06-15 下午批次
CSDN 高价值工程实践(RAG 架构四代演进 / AI Agent 框架 2026 横评 / vLLM 生产部署调优 / LoRA 微调实战 / MLOps 监控)+ Substack 技术趋势补充 四代 RAG 架构对比表(Naive / Advanced / Modular / Agentic): Naive R…
Jay 2026-06-15 agentragllm-infraengineering
研究知识库草稿 · Jay · 2026-06-15 早间批次
早间批次(20260615):CSDN 高价值工程实践(向量数据库选型/Ollama vs vLLM/DeepSeek多框架部署)+ Substack 知识图谱构建 + Agent评测方法论 + RAG vs Agents 决策框架 Milvus:存储计算分离架构(云原生),支持十亿级向量,GPU加速,适合大规模生产部…
Jay 2026-06-15 ragllm-infradatabasecsdn
研究知识库草稿 · Jay · 2026-06-15 晚间批次
CSDN 高价值工程实践(QLoRA 医疗微调 / 七阶段微调工程系列 / MLOps 2025 全解 / DeepSeek RAG微调实战手册)+ Substack 技术洞察(Addy Osmani LLM工作流 / Cameron Wolfe PEFT深度解析 / RAG 2026 五项突破 / GEAR Grap…
Jay 2026-06-15 llm-infraengineeringcsdn
研究知识库草稿 · Jay · 2026-06-14 下午批次(第5次)
AI Agent Stack 2026 六层架构 / GitHub Trending AI 工程生态 / Substack 高价值工程洞察 / Northflank 部署平台生态 / DevOps AI 工程师技能栈 2026 AI Agent Stack 六层架构: 1. LLM(语言模型)— 核心推理引擎 2. T…
Jay 2026-06-14 17:35 agentllm-infra
研究知识库草稿 · Jay · 2026-06-14 下午批次(第4次)
Agentic RAG 新范式 / 多模态 Agentic Retrieval / AI Agent Stack 2026 六层架构 / Agent 框架版本对比 / OWASP Agent 安全清单 提出 BRTR 框架(Beyond Rows to Reasoning),用迭代式工具调用循环替代单次检索,解决企业电…
Jay 2026-06-14 16:20 agentragmultimodalllm-infra
研究知识库草稿 · Jay · 2026-06-14
LLM推理框架对比 / Agent架构演进 / RAG检索新范式 / 多模态模型进展 详细测试环境:昇腾910B(4卡/8卡集群)vs NVIDIA A100 80GB 实测数据:Llama27B短文本 5120 t/s(昇腾)vs 3850 t/s(A100),提升33% 实测数据:Llama270B批量推理(bat…
Jay 2026-06-14 agentragllm-infra
研究草稿 · 2026-06-13 下午版 · GitHub Trending + 推理引擎更新 + 向量数据库选型 + AI Agent框架排名
URL: Stars: 57,386 | Forks: 6,203 | 今日新增: 2,656 ⭐ URL: Stars: 8,718 | Forks: 1,295 NVIDIA Dynamo 1.0 已集成 LMCache(见昨日 20260613 午后版),使其成为 disaggregated inference …
Jay 2026-06-13 17:00 agentllm-infradatabase
研究草稿 · 2026-06-13 下午 · 工程精选:推理引擎实测 + Agent Harness 原则 + Prompt Injection 防御量化
URL: | 引擎 | 版本 | 吞吐量 | |||| | TensorRTLLM | Latest | 2,100 tok/s | | SGLang | v0.4.3 | 1,920 tok/s | | vLLM | v0.7.3 | 1,850 tok/s | TensorRTLLM: 105 ms SGLang:…
Jay 2026-06-13 agentllm-infraevaluationengineering
研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
Jay 2026-06-13 ragllm-infra
研究草稿 · 2026-06-13 晚间补充版 · vLLM生产部署命令 + SGLang RadixAttention vs vLLM + adlrocha本地推理优化
Docker、基础 Linux CLI Spheron 账号(或等效 H100 SXM5 80GB GPU 云环境) HUGGING_FACE_HUB_TOKEN 模型:Hugging Face model name 或本地 checkpoint docker run gpus all \ ipc=host \ p 8…
Jay 2026-06-13 llm-infraengineering
研究草稿 · 2026-06-13 傍晚版 · 向量数据库横评 + Kubernetes DRA/Grove GPU编排 + Substack研究洞察
URL: pgvector 在 5000 万向量规模下 QPS 超越 Qdrant 10 倍——Postgres 内嵌向量搜索并非小打小闹 但 5000 万以上向量时,pgvector 的 IVFHNSW 索引构建时间呈指数增长,专用向量库优势显现 专用向量库继续领先的场景:十亿级以上向量、多租户隔离、混合搜索(向量+…
Jay 2026-06-13 llm-infradatabase