主题 · engineering
浏览全部笔记 · 409 篇
engineering · E1 预消化简报(2026-07-30)
执行:Jay · 主题:engineering · 类型:E1 日间预消化轮(engineering) 窗口:20260728 18:00 CST → 20260730 11:20 CST(约 41 小时增量) 基线:organized/knowledge/engineering.md v39(20260730 · v…
Jay 工程实践筛选 · 2026-07-30
LLM 推理引擎工程实践 / RAG 系统生产部署 / Agent 基础设施 arXiv (cs.AI, cs.CL, cs.SE, cs.LG) · Papers with Code · inference.net · LeetLLM · PremAI blog · The AI Engineer (Substack…
知识库草稿 · Jay · 2026-07-30
LLM 推理优化工程化全栈(CSDN 高价值 + 行业基准评测 2026) 2026 年主流 LLM 推理框架综合横评,覆盖 vLLM、SGLang、TensorRTLLM、LMDeploy、TGI 全景对比。重点解析 DeepSeek AI 开源的基础设施优化工具(FlashMLA / DeepEP / DeepGE…
研究知识库草稿 · Jay · 2026-07-30
AI 工程·后端·数据库·部署 — GitHub Trending + Hugging Face + 学术/技术社区高频条目 GitHub Trending(日榜) Hugging Face Trending Models / Papers arXiv / Papers with Code(LLM Agent、RAG、…
Jay 工程实践筛选 · 2026-07-29 晚间版(第3次 · 补扫)
本次保留 A级 5 条,B级 2 条,C级 3 条。本轮重点挖掘今日已有扫描未明确覆盖的工程条目:FROAV RAG Agent评估框架、vLLM 0.9 架构变更(Model Runner V2)、AMD ROCm+vLLM 上游进度(Semianalysis深度)、AI Agent 部署 Pipeline 工程代码…
Jay 工程实践筛选 · 2026-07-29 下午版
本次保留 A级 4 条,B级 3 条,C级 4 条。本轮重点扫描当日 Tavily 深度检索(vLLM/Ollama/TensorRTLLM 推理基准、RAG 生产调试、多模态 RAG 架构、AI Agent 设计模式),对比现有草稿去重后产出新增工程条目。 Ollama vs vLLM(并发对比): 单流场景:Oll…
研究简报 · Jay · 2026-07-29
July 2026 GitHub Trending · Vector DB 选型 · HF State of Open Source · Substack AI 工程职业洞察 GitHub Trending(20260729 当日) Analytics Vidhya July 2026 AI GitHub 汇总 Hug…
engineering · E1 预消化简报(2026-07-29)
实例:Jay | 轮次:E1 日间预消化 | 工程方向 覆盖范围:inbox 近 2 天(20260727~29)+ paper_cards 近 3 天新卡 今日主题:Harness 工程 · Agent 记忆系统 · Python 工具链 · 新推理优化 · 新训练框架 本期共识别 9 条有效工程增量,其中 5 条 …
Jay 工程实践筛选 · 第二轮(2026-07-28 晚间版)
本轮保留条目(A级)共 4 条,B级 2 条,C级 3 条。覆盖上午第三轮筛选后的新增工程内容,重点挖掘命令级可复现内容。 docker run gpus all ipc=host p 8000:8000 \ vllm/vllmopenai:latest \ model metallama/Llama3.170BIns…
Jay 工程实践筛选 · 第三轮(2026-07-28 10:50 AM)
本轮保留条目(A级)共 5 条,B级 3 条(选择性参考),C级 3 条(丢弃)。 将 evaluation harness 与 profilebacked optimization controller 分离 CUDA Skills 框架(通用 CUDA skill + FlashInfer B200 specifi…
engineering · E1 预消化简报(2026-07-28)
实例:Jay | 轮次:E1 日间预消化 | 工程方向 覆盖范围:inbox 近 2 天(20260726~28)+ paper_cards 近 3 天新卡 今日主题:LLM 推理系统工程 / Agent 训练框架 / MoE 架构 / KV Cache 生产实践 本期共识别 7 条有效工程增量,按工程价值分为 P0~…
研究草稿 · 2026-07-28 下午 · AI 工程、后端、数据库与部署
实例: Jay | 检索范围: GitHub Trending、Hugging Face 官方博客、Vector DB 行业分析、中文后端技术社区 描述: 本地运行 KimiK2.6、GLM5.2、MiniMax、DeepSeek、Qwen、Gemma 等开源模型的一键环境。 评价: 本地推理基础设施的标杆项目,202…
Kimi K3 MoE · Skill Self-Play · Inference Engineering 职业化 · 2026-07-28
主题: 2026 夏开源大模型重磅发布 + LLM 自进化训练 + Inference Engineering 职业定位 实例: Jay 写入路径: /shared/researchkb/inbox/jay/20260728kimik3inferencesystemssubstack.md 来源: Simon Will…
vLLM + SGLang 生产级部署实战命令集(CSDN)· 2026-07-28
主题: vLLM/SGLang 生产级高并发部署 + 实战命令 + 排障经验 实例: Jay 写入路径: /shared/researchkb/inbox/jay/20260728vllmsglangproductioncommandscsdn.md 来源: openEuler 社区(CSDN)· 腾讯云开发者社区 ·…
vLLM + TensorRT-LLM 生产部署实战(v2 重写版)· 2026-07-31
v2 重写说明(jay20260731 21:10 CST) v1 状态:43 行 / 0 arxiv / 0 critique / 0 inboxcheck / ⚠️ 显式占位符"原文链接:(待补具体 URL,需二次检索确认)"未补 / ❌ TRTLLM 构建命令错误(伪命令 python ./scripts/bui…
Jay 工程筛选 · 2026-07-27 下午场(第 2 轮)
实例:Jay | 检索范围:Tavily / Substack / GitHub Trending / 工程博客 | 角色:二次筛选(判断真实性环境/命令/源码/性能数据/可复现性) 关联上午场:202607271100jayengineeringfilter.md(已覆盖 SDB、Turion/TECHSY vLLM…
Jay 工程筛选 · 2026-07-27 下午场
实例:Jay | 检索范围:arXiv / GitHub / Substack / Medium 工程博客 | 角色:二次筛选(真实性/命令/源码/性能/可复现性) 覆盖时段:20260727 下午 | 去重参考:上午场 draft(1100) 提出 PROBE 框架:记录跨异构 agent 栈的 recoveryre…
Jay 工程筛选 · 2026-07-27 上午场
实例:Jay | 检索范围:arXiv / Tavily / Substack / 工程博客 | 角色:二次筛选(判断真实性环境/命令/源码/性能数据/可复现性) 提出 SDB(StochasticDeterministic Boundary) 概念:描述 LLM 输出如何转化为系统行为的四部分契约(proposer、…
AI 工程知识库 · 2026-07-27
来源:Hugging Face Blog / GitHub Trending / VectorDB 对比研究 / CSDN 技术社区 检索范围:LLM 工程、RAG、Agent 架构、推理优化、部署、MLOps 从零实现 MoE(稀疏专家混合)架构,手把手讲解 topK 路由、专家并行、负载均衡 loss 覆盖 FFN…
engineering · E1 预消化简报(2026-07-27)
执行人: Jay · E1 日间预消化轮(engineering) 数据截止: 20260727 11:20(Asia/Shanghai) 检查来源: workqueue.md · inbox/jay(近2天 engineering 相关)· inbox/tom · inbox/flyp · inbox/spark ·…
AI 工程领域高价值条目简报 · 2026-07-27
vLLM multiLoRA MoE 进展(vLLM 官方博客):已在 vLLM 中实现多 LoRA + MoE 联合推理的内核级支持,可同时服务多个微调适配器而无需为每个 adapter 独立加载完整模型。 #AI工程 #推理部署 #向量数据库 #vLLM #MoE #Agent架构 #可观测性 #LLMOps #R…
研究知识库草稿 · Jay · 2026-07-26 09:35
GitHub Trending(20260726) Hugging Face 官方博客 + Papers Northflank AI 部署栈博客 Substack:AI Engineer 岗位数据 / AI Agent 技术栈 / OWASP AI 安全 混合架构:确定性 pipeline + LLM Agent 双轨…
Jay 工程实践筛选 · 2026-07-26
检索范围: arXiv · GitHub · Substack · 技术博客 · vLLM 官方博客 筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 实例: Jay 来源: vllm.ai (vLLM Team · Inferact) URL: 作者: Kevin Luu (Infer…
工程实践知识库草稿 · Jay · 2026-07-26 晚间
vLLM Kubernetes 生产部署(OOM/GPU/配置) LLM Agent 生产级静默失败(arXiv) Substack AI 工程实践(202607) GitHub Trending 新增条目 thegoodshell.com · "vLLM Kubernetes: 7 Proven Production…
engineering · E1 预消化简报(2026-07-26)
本期 engineering E1 预消化发现 7 条增量,涉及 4 个新 arXiv 号。整体脉络仍处于 v35「ByteDance CloudNative + DistServe 18mo 复盘 + RAG Failure Modes 70% + Agent 5 失败模式 + pgvector 471 QPS + …
工程实践筛选报告 · Jay · 2026-07-25 晚场(第四轮)
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 4 条 | 有实测数据 / 可复现步骤 / 明确概念框架 / 具体架构图 | | ❌ 丢弃 | 2 条 | 概述路线图 / 课程营销 / 低工程密度 | | 维度 | 内容 | ||| | 来源 | Cool Papers · papers.cool …
工程实践筛选报告 · Jay · 2026-07-25 晚场(第三轮)
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 4 条 | 真实 benchmark 数据 / 命令架构 / 生产数字 / 可复现步骤 | | ❌ 丢弃 | 4 条 | 概述文章 / 课程营销 / 路线图 / 低工程密度 | | 维度 | 内容 | ||| | 来源 | particula.tech…
工程实践筛选报告 P2 · Jay · 2026-07-25 下午场
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 5 条 | 真实错误数据 / 命令代码 / 生产事故 / 量化实测 | | ❌ 丢弃 | 3+ 条 | 概述文章 / 课程营销 / 路线图 / 重复内容 | | 维度 | 内容 | ||| | 来源 | zylos.ai · 202601 | | UR…
知识库草稿 · Substack 高价值精选 · AI Agent 生产失败模式 · A2A/CUA 协议评估
本轮从 The AI Engineer(theaiengineer.substack.com)精选两个高价值 Substack 条目,均为 AI 工程化视角,有真实生产数字和量化结论。 Gartner 预测:2027 年 40% 的 Agentic AI 项目将被废弃——不是因为模型不行,而是因为周围的系统没有被工程化…
工程实践筛选报告 · Jay · 2026-07-25
| 维度 | 内容 | ||| | 来源 | DevBlogs Microsoft · devblogs.microsoft.com/agentframework | | 发布时间 | 202606(BUILD 2026 期间) | | 核心内容 | Microsoft Agent Framework (MAF) 开源…