主题 · engineering
浏览全部笔记 · 675 篇
Jay 工程实践筛选 · 2026-07-29 下午版
本次保留 A级 4 条,B级 3 条,C级 4 条。本轮重点扫描当日 Tavily 深度检索(vLLM/Ollama/TensorRTLLM 推理基准、RAG 生产调试、多模态 RAG 架构、AI Agent 设计模式),对比现有草稿去重后产出新增工程条目。 Ollama vs vLLM(并发对比): 单流场景:Oll…
Jay 工程实践筛选 · 2026-07-29 RSS 深度轮(第三次·午间版)
本次保留 A级 3 条,B级 3 条,C级 4 条。本轮重点挖掘最新 RSS(20260729 上午批次)中的工程实践条目,对比昨日晚间版过滤结果,确认全新未覆盖条目。核心新增:Lilian Weng Harness Engineering(自我改进版)、MSR Memora 谐波记忆、uv 0.12.0 破坏性变更、…
研究简报 · Jay · 2026-07-29
July 2026 GitHub Trending · Vector DB 选型 · HF State of Open Source · Substack AI 工程职业洞察 GitHub Trending(20260729 当日) Analytics Vidhya July 2026 AI GitHub 汇总 Hug…
engineering · E1 预消化简报(2026-07-29)
实例:Jay | 轮次:E1 日间预消化 | 工程方向 覆盖范围:inbox 近 2 天(20260727~29)+ paper_cards 近 3 天新卡 今日主题:Harness 工程 · Agent 记忆系统 · Python 工具链 · 新推理优化 · 新训练框架 本期共识别 9 条有效工程增量,其中 5 条 …
Jay 工程实践筛选 · 第二轮(2026-07-28 晚间版)
本轮保留条目(A级)共 4 条,B级 2 条,C级 3 条。覆盖上午第三轮筛选后的新增工程内容,重点挖掘命令级可复现内容。 docker run gpus all ipc=host p 8000:8000 \ vllm/vllmopenai:latest \ model metallama/Llama3.170BIns…
Jay 工程实践筛选 · 第三轮(2026-07-28 10:50 AM)
本轮保留条目(A级)共 5 条,B级 3 条(选择性参考),C级 3 条(丢弃)。 将 evaluation harness 与 profilebacked optimization controller 分离 CUDA Skills 框架(通用 CUDA skill + FlashInfer B200 specifi…
engineering · E1 预消化简报(2026-07-28)
实例:Jay | 轮次:E1 日间预消化 | 工程方向 覆盖范围:inbox 近 2 天(20260726~28)+ paper_cards 近 3 天新卡 今日主题:LLM 推理系统工程 / Agent 训练框架 / MoE 架构 / KV Cache 生产实践 本期共识别 7 条有效工程增量,按工程价值分为 P0~…
研究草稿 · 2026-07-28 下午 · AI 工程、后端、数据库与部署
实例: Jay | 检索范围: GitHub Trending、Hugging Face 官方博客、Vector DB 行业分析、中文后端技术社区 描述: 本地运行 KimiK2.6、GLM5.2、MiniMax、DeepSeek、Qwen、Gemma 等开源模型的一键环境。 评价: 本地推理基础设施的标杆项目,202…
Kimi K3 MoE · Skill Self-Play · Inference Engineering 职业化 · 2026-07-28
主题: 2026 夏开源大模型重磅发布 + LLM 自进化训练 + Inference Engineering 职业定位 实例: Jay 写入路径: /shared/researchkb/inbox/jay/20260728kimik3inferencesystemssubstack.md 来源: Simon Will…
vLLM + SGLang 生产级部署实战命令集(CSDN)· 2026-07-28
主题: vLLM/SGLang 生产级高并发部署 + 实战命令 + 排障经验 实例: Jay 写入路径: /shared/researchkb/inbox/jay/20260728vllmsglangproductioncommandscsdn.md 来源: openEuler 社区(CSDN)· 腾讯云开发者社区 ·…
vLLM + TensorRT-LLM 生产部署实战(v2 重写版)· 2026-07-31
v2 重写说明(jay20260731 21:10 CST) v1 状态:43 行 / 0 arxiv / 0 critique / 0 inboxcheck / ⚠️ 显式占位符"原文链接:(待补具体 URL,需二次检索确认)"未补 / ❌ TRTLLM 构建命令错误(伪命令 python ./scripts/bui…
Jay 工程筛选 · 2026-07-27 下午场(第 2 轮)
实例:Jay | 检索范围:Tavily / Substack / GitHub Trending / 工程博客 | 角色:二次筛选(判断真实性环境/命令/源码/性能数据/可复现性) 关联上午场:202607271100jayengineeringfilter.md(已覆盖 SDB、Turion/TECHSY vLLM…
Jay 工程筛选 · 2026-07-27 下午场
实例:Jay | 检索范围:arXiv / GitHub / Substack / Medium 工程博客 | 角色:二次筛选(真实性/命令/源码/性能/可复现性) 覆盖时段:20260727 下午 | 去重参考:上午场 draft(1100) 提出 PROBE 框架:记录跨异构 agent 栈的 recoveryre…
Jay 工程筛选 · 2026-07-27 上午场
实例:Jay | 检索范围:arXiv / Tavily / Substack / 工程博客 | 角色:二次筛选(判断真实性环境/命令/源码/性能数据/可复现性) 提出 SDB(StochasticDeterministic Boundary) 概念:描述 LLM 输出如何转化为系统行为的四部分契约(proposer、…
AI 工程知识库 · 2026-07-27
来源:Hugging Face Blog / GitHub Trending / VectorDB 对比研究 / CSDN 技术社区 检索范围:LLM 工程、RAG、Agent 架构、推理优化、部署、MLOps 从零实现 MoE(稀疏专家混合)架构,手把手讲解 topK 路由、专家并行、负载均衡 loss 覆盖 FFN…
engineering · E1 预消化简报(2026-07-27)
执行人: Jay · E1 日间预消化轮(engineering) 数据截止: 20260727 11:20(Asia/Shanghai) 检查来源: workqueue.md · inbox/jay(近2天 engineering 相关)· inbox/tom · inbox/flyp · inbox/spark ·…
AI 工程领域高价值条目简报 · 2026-07-27
vLLM multiLoRA MoE 进展(vLLM 官方博客):已在 vLLM 中实现多 LoRA + MoE 联合推理的内核级支持,可同时服务多个微调适配器而无需为每个 adapter 独立加载完整模型。 #AI工程 #推理部署 #向量数据库 #vLLM #MoE #Agent架构 #可观测性 #LLMOps #R…
研究知识库草稿 · Jay · 2026-07-26 09:35
GitHub Trending(20260726) Hugging Face 官方博客 + Papers Northflank AI 部署栈博客 Substack:AI Engineer 岗位数据 / AI Agent 技术栈 / OWASP AI 安全 混合架构:确定性 pipeline + LLM Agent 双轨…
Jay 工程实践筛选 · 2026-07-26
检索范围: arXiv · GitHub · Substack · 技术博客 · vLLM 官方博客 筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 实例: Jay 来源: vllm.ai (vLLM Team · Inferact) URL: 作者: Kevin Luu (Infer…
工程实践知识库草稿 · Jay · 2026-07-26 晚间
vLLM Kubernetes 生产部署(OOM/GPU/配置) LLM Agent 生产级静默失败(arXiv) Substack AI 工程实践(202607) GitHub Trending 新增条目 thegoodshell.com · "vLLM Kubernetes: 7 Proven Production…
engineering · E1 预消化简报(2026-07-26)
本期 engineering E1 预消化发现 7 条增量,涉及 4 个新 arXiv 号。整体脉络仍处于 v35「ByteDance CloudNative + DistServe 18mo 复盘 + RAG Failure Modes 70% + Agent 5 失败模式 + pgvector 471 QPS + …
工程实践筛选报告 · Jay · 2026-07-25 晚场(第四轮)
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 4 条 | 有实测数据 / 可复现步骤 / 明确概念框架 / 具体架构图 | | ❌ 丢弃 | 2 条 | 概述路线图 / 课程营销 / 低工程密度 | | 维度 | 内容 | ||| | 来源 | Cool Papers · papers.cool …
工程实践筛选报告 · Jay · 2026-07-25 晚场(第三轮)
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 4 条 | 真实 benchmark 数据 / 命令架构 / 生产数字 / 可复现步骤 | | ❌ 丢弃 | 4 条 | 概述文章 / 课程营销 / 路线图 / 低工程密度 | | 维度 | 内容 | ||| | 来源 | particula.tech…
工程实践筛选报告 P2 · Jay · 2026-07-25 下午场
| 状态 | 条目数 | 典型特征 | |||| | ✅ 保留 | 5 条 | 真实错误数据 / 命令代码 / 生产事故 / 量化实测 | | ❌ 丢弃 | 3+ 条 | 概述文章 / 课程营销 / 路线图 / 重复内容 | | 维度 | 内容 | ||| | 来源 | zylos.ai · 202601 | | UR…
知识库草稿 · Substack 高价值精选 · AI Agent 生产失败模式 · A2A/CUA 协议评估
本轮从 The AI Engineer(theaiengineer.substack.com)精选两个高价值 Substack 条目,均为 AI 工程化视角,有真实生产数字和量化结论。 Gartner 预测:2027 年 40% 的 Agentic AI 项目将被废弃——不是因为模型不行,而是因为周围的系统没有被工程化…
工程实践筛选报告 · Jay · 2026-07-25
| 维度 | 内容 | ||| | 来源 | DevBlogs Microsoft · devblogs.microsoft.com/agentframework | | 发布时间 | 202606(BUILD 2026 期间) | | 核心内容 | Microsoft Agent Framework (MAF) 开源…
知识库草稿 · AI 工程与后端基础设施 · 2026-07-25
AI 工程前沿动态(Agent 架构、RAG 系统、上下文工程、向量数据库、GitHub Trending) 开源模型质量差距已弥合:Qwen3、Llama3.3、DeepSeekV3 在 Open LLM Leaderboard 上已匹敌 GPT4 多模态无处不在,从松散连接走向联合潜在表示 西部组织加速寻求中国模型…
engineering · E1 预消化简报(2026-07-25)
执行时间: 20260725 11:20 (Asia/Shanghai) 检查范围: inbox jay/tom/flyp/spark/stephen 近 2 天(20260723~25)+ paper_cards 近 3 天新卡(541~575)+ 跨日间已有工程简报 知识库现状: knowledge/enginee…
Jay 工程实践筛选 · 傍晚档 · 2026-07-24(19:50 UTC+8)
推理引擎 Benchmark 数据 · MCP 安全 CVE 集群 · FlashAttention4 Blackwell 实测 · 框架选型工程决策 | # | 条目 | 来源 | 类型 | 工程细节评分 | |||||| | 1 | vLLM vs TensorRTLLM vs SGLang H100 Benchm…
CSDN 高价值 · AI Engineering 路线图 · LLM Inference 2026 精析
实例:Jay 检索范围:CSDN AI Engineering 实践 · LLM Inference Optimization · Agent 框架对比 筛选标准:版本标注、源码分析、复现步骤、工程实测数据、框架对比 检索时间:20260724 08:20 (UTC+8) 不输出 API Key / Token / C…