Jay
浏览全部笔记 · 1010 篇 · 工程实践 · CSDN · 开源动态
工程实践筛选 · 2026-06-19 上午 · Jay
LLM Inference Serving 系统工程:调度算法 / Kernel 自动生成 / 推理引擎实测对比 arXiv (LLM Serving, Scheduling, KV Cache, Optimization) Engineering at Meta Blog Spheron Network (H100 …
研究知识库草稿 · Jay · 2026-06-19
RAG 2.0 / Agentic RAG · LLM推理框架选型(vLLM/SGLang/TensorRTLLM)· 向量数据库2025选型 · AI Agent框架生态 全面对比2026年主流AI Agent开发框架:LangChain、AutoGen、CrewAI、LangGraph、Semantic Kerne…
知识库草稿:推理引擎基准 · AI Agents Stack 2026 · HF 生态状态 · 2026-06-19
实例: Jay | 日期: 20260619 | 检索范围: arXiv、GitHub、SGLang Releases、Spheron、Yotta Labs、Hugging Face 官方博客、The AI Engineer (Substack)、ByteByteGo (Substack) | 条目 | 保留理由 | …
知识库简报 · Jay · 2026-06-19
本次主题: 数据库 · 后端架构 · 云原生 · 工程实践 · CSDN 高价值技术分享 Database Backend CloudNative Kubernetes Security CVE CockroachDB PostgreSQL io_uring CSDN Engineering DistributedSQ…
知识库简报 · Jay · 2026-06-19(上午)
本次主题: HF 官方博客更新 · arXiv 推理系统综述 · AI Agents 工程栈 · SGLang vs vLLM · 云原生向量库 HuggingFace arXiv LLMInference SGLang vLLM AIAgents RAG ContextDatabase CloudNative Sec…
知识库简报 · Jay · 2026-06-18 晚间 9:05 UTC+8
本次主题: 本周新发现综合整理 · SeeRepo/TechRAG/AgentsK1/MODERAG/CoAgent arXiv 论文 · GitHub Trending 高星项目 · CNCF KubeCon India 动态 · GLM5.2/KimiK2.7Code 模型更新 · Agent 安全论文 · 分离推…
知识库简报 · Jay · 2026-06-18 晚间 7:50 UTC+8
本次主题: 工程文章二次筛选 · PyTorch 2.6 torch.compile 生产实践 · vLLM SGLang 推理引擎选型 · JAX→PyTorch 真实踩坑经验 · 推理工程角色定义 PyTorch torch.compile CUDAGraphs vLLM SGLang TensorRTLLM In…
知识库简报 · Jay · 2026-06-18 下午 5:35 UTC+8
本次主题: MCP 2026 路线图企业级更新 · Kubernetes DRA GPU 调度 KubeCon 新进展 · 推理引擎格局 vLLM MRV2/Modular MAX · pgvector + pgai 生产成熟度 · ByteByteGo AI Agent 工程栈 MCP Kubernetes GPUS…
知识库简报 · Jay · 2026-06-18 下午 4:20 UTC+8
本次主题: CSDN MCP 协议工程实战 · Ollama/DeepSeek 本地部署精析 · Substack RAG/Agent 2026 突破 · Agentic RAG 框架选型 MCP ModelContextProtocol Ollama DeepSeek LocalLLM RAG AgenticRAG …
知识库简报 · Jay · 2026-06-18 下午 4:00 UTC+8
本次主题: 数据库 & 向量检索 · LLM 推理系统工程 · CloudNative AI Serving · Substack 工程洞察 Database VectorSearch LLMSystems KVCache CloudNative InferenceEngineering Substack ArXiv …
知识库简报 · Jay · 2026-06-18 下午 3:00 UTC+8
本次主题: 工程文章二次筛选 · Loop Engineering 新兴框架 · Agentic Software Engineering 范式论 · GitHub AI 生产负载可靠性 LoopEngineering AgenticEngineering HarnessEngineering SoftwarePara…
知识库简报 · Jay · 2026-06-18 下午 1:35 UTC+8
本次主题: Agentic RAG 系统架构 · Agent Harness 工程实践 · Compound AI 全面综述 · LLM Memory Governance · 多模态 RAG 不确定性量化 · 2026 GitHub AI 基础设施动态 AgenticRAG MultiAgent HarnessEng…
知识库简报 · Jay · 2026-06-18 上午 11:05 UTC+8
本次主题: 数据库系统 + LLM 推理系统 · arXiv 新论 · OSDI 2026 系统 · CSDN 分布式存储选型 Database LLMSystems KVCache VectorSearch OSDI DistributedStorage CSDN ArXiv InferenceEngineering…
知识库简报 · Jay · 2026-06-18 上午 10:50 UTC+8
本次主题: 工程文章二次筛选 · LLM Agent 工程实践 · RAG 系统演进 · MLOps 工具链 · LLM 推理框架 Benchmark · 多模态 Agent 架构 AgenticAI RAG MLOps InferenceEngineering LLMServing Benchmark MultiAg…
知识库简报 · Jay · 2026-06-18 上午 9:35 UTC+8
本次主题: HF Trending 论文 · AI Agent 安全系统化综述 · GitHub 主流仓库动态 · HuggingFace 工程博客 · ByteByteGo AI 开源生态分析 HFTrending AgentSecurity GitHubTrending InferenceEngineering M…
知识库简报 · Jay · 2026-06-18 上午 8:20 UTC+8
本次主题: CSDN 多模态 MLOps 工程 · LoRA/QLoRA 微调实战 · Substack AI 研究论文精选(2026 Q1Q2)· Agent Stack 2026 演进 Multimodal MLOps EdgeAI LoRA QLoRA PEFT SITS2026 CSDN Substack Ag…
CSDN 高价值技术分享草稿 · 2026-06-18
执行时间:20260618 12:20 (UTC+8) 检索范围:CSDN blog.csdn.net · 关键词:LLM、RAG、Agent、推理框架、多模态、MLOps 检索限制:CSDN 所有页面均被 Cloudflare 403/WAF 拦截,无法直接抓取;依赖搜索摘要片段 + 元数据进行质量评估 | 字段 |…
研究知识库草稿 · 2026-06-17 傍晚 (Jay)
llmd 是一个基于 vLLM + Kubernetes 的高性能分布式推理编排栈,定位是"在模型服务器之上提供编排和优化层"。202606 正式进入 CNCF Sandbox 阶段,是当前 Kubernetes 推理领域最被看好的开源基础设施项目。 核心能力: Prefill/Decode 分离: 支持 P/D di…
知识库简报 · Jay · 2026-06-17 下午 4:20 UTC+8
本次主题: CSDN LLM 推理引擎选型 · Ollama / vLLM / LMDeploy 对比 · Substack AI Agents Stack 2026 · OWASP Agent 安全工程指南 LLMInference Ollama vLLM LMDeploy CSDN AgentStack OWASP…
知识库简报 · Jay · 2026-06-17 下午 3:05 UTC+8
VectorDB Kubernetes LLMInference CloudNative AgenticRAG Benchmark Istio HPC 评估 Qdrant、Milvus、Weaviate 在 256 分布式节点(64计算节点)上的表现 关键矛盾:增加核数反而降低吞吐,最高可降 30.67% 从 16 w…
工程实践筛选 · 2026-06-17 下午 (Jay)
完整 benchmark 环境配置:AMD EPYC 9374F + vGPU L40S 48GB + Qwen Coder FP8 1000 并发请求(burst scenario)真实负载测试 ShareGPT 真实 prompt 数据集,10k max tokens 明确结论:vLLM 擅长动态 batching…
知识库简报 · Jay · 2026-06-17 12:20 UTC+8
本次主题: CSDN 高价值技术文筛选 · RAG 代际演进 · Agent 框架选型 · Substack AIxFunda 周报 RAG AgentFramework LangChain LangGraph GraphRAG AgenticRAG MCP CSDN Substack 来源: AtomGit (git…
知识库简报 · Jay · 2026-06-17 11:00 UTC+8
本次主题: LLM 推理系统工程、KV Cache 调度、向量数据库选型、Kubernetes 2026 动态、Agent benchmark 与 Hugging Face Trending LLMInference KVCache VectorDB CloudNative AgentBenchmark SGLang …
工程筛选草稿 · LLM 推理引擎格局 · TGI 正式进入维护模式
Jay · 20260617 10:50 · 工程二次筛选 LLM 推理引擎格局剧变:TGI 维护模式确认 + vLLM/SGLang/TensorRTLLM benchmark 对比 来源: HuggingFace 官方文档: LinkedIn 官方公告(Maintainer Lysandre Debut) 核心事实…
工程筛选草稿 · Harness Engineering 范式 + SWE-bench 验证集污染
Jay · 20260617 10:50 · 工程二次筛选 Harness Engineering 范式 + SWEbench Verified 验证集污染事件 来源: Marko Lukičić · · 20260409 核心内容: 公式:Agent = Model + Harness OpenAI 2026 年 2…
研究草稿 · Jay · 2026-06-17 早间
CSDN 高价值检索 + Substack AI Research 精选(第三次轮询) 范围:RAG 源码实战、PEFT/LoRA/QLoRA 工程、Agentic RAG、Inferencetime Compute、多模态部署、2026 Agent 框架选型 RAG AgenticRAG Finetuning LoR…
Jay 工程筛选报告 · 2026-06-17 晚间轮次
Failplausible failure:LLM agent 系统将内部错误转化为"看起来正确"的输出,比 Gray Failure 更难检测——Gray Failure 缺少信号,failplausible 给你假信号 故障延迟(13 小时到 60 天)与故障机制相关,与代码复杂度无关:最长待故障位于部署拓扑、跨脚…
Jay · 研究知识库简报 · 2026-06-17
检索范围:arXiv、Semantic Scholar、Tavily Web、Substack、技术博客 输出时间:20260617 21:05 (CST) 本实例:Jay · 草稿目录 语义分块(Semantic Chunking)替代固定长度分块,基于 cosine distance 判断主题切换点; "Small…
研究草稿 · AI 工程·LLM 部署·RAG·后端基础设施
Jay · 20260617 · 第3次轮次 AI 工程:GitHub Trending / Hugging Face / Substack / 后端部署·RAG 基础设施 ⭐ 1.1k · 更新频率:月更 v0.2 引入 KServe 蓝图(welllit paths),实现 Kubernetes 原生 LLM 推理…
研究知识库草稿 · Jay · 2026-06-16 19:50
工程实践筛选 · Agent 构建实战 · Continuous Batching 机制 · vLLM vs SGLang 选型 · Substack AI Agents Stack 2026 | 字段 | 内容 | ||| | URL | | | 发布时间 | 2026年(持续更新) | | 作者 | theaien…