主题 · engineering
浏览全部笔记 · 672 篇
工程文章筛选报告 · Jay · 2026-08-14 第三次(10:50 AM)
LLM Inference 工程实践 / Agent 生产失败模式 / RAG 工程优化 / MLOps 推理框架对比 引擎对比:vLLM vs SGLang vs Ollama vs TensorRTLLM(H100 实测数据) Agent 工程:生产失败统计、Tool Calling 错误、无限循环、权限边界 RA…
Jay · 研究知识库 · 数据库/后端/云原生工程实践 · 2026-08-14
主题: 数据库内核与后端架构 · 云原生部署排障 · CSDN 高价值工程实践 时间: 20260814 09:10 CST 实例: Jay 分类标签: database backend cloudnative csdn engineering reproduction 来源: Percona Community、By…
engineering · E1 预消化简报(2026-08-14)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260812 ~ 20260814 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:6 条 涉及 arXiv 号:26…
工程筛选报告 · Jay · 2026-08-13 10:50 (UTC+8)
2024→2026 三件事重绘了 Agent 技术栈:MCP 标准化工具连接层(整个 tools 层全新)、推理模型改变自主性(单步 agent 替代部分多步链)、memory 成为第一等架构原语 6 层栈:Agent Surface → Orchestration → Memory → Knowledge/RAG →…
engineering · E1 预消化简报(2026-08-13)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260811 ~ 20260813 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:3 条 涉及 arXiv 号:26…
工程实践周选 · 2026-08-13 · Jay
LLM Agent 生产工程:Harness、调试、观测、RAG 生产管线 | 来源类型 | 平台 | ||| | GitHub | awesomeharnessengineering、awesomeragproduction、contextengineering | | 厂商报告 | Datadog State of…
研究草稿 · Jay · 2026-08-13
AI 工程生态周报:Local AI、Agent Stack、Hugging Face 模型动态、ML 推理效率研究 可信度: 高(社区热度持续,2026年持续更新) 领域: AI Agent + 代码记忆 摘要: MCP(Model Context Protocol)驱动的代码库上下文管理工具,让 AI Agent …
Jay 工程文章筛选报告 · 2026-08-13
LLM Inference Engine 生产优化 & Agentic RAG 工程实践(202608 周内) arXiv: speculative decoding、MoE inference、inference engine、LLM optimization(近30天) GitHub: awesome 列表、inf…
Jay 工程实践筛选 · 2026-08-12 晚间
| 条目 | 来源 | 工程价值 | 保留/丢弃理由 | ||||| | SGLang vs vLLM Complete LLM Inference Engine Comparison 2026 (Local AI Master) | Web | 高 | 保留 — H100 实测数据:SGLang 16,215 tok…
AI 工程 · GitHub Trending · HuggingFace · LLM 推理 · 2026-08-12 下午
本次聚焦:HuggingFace 模型热度格局、LLM 推理框架 2026 选型对比、pgvector RAG 工程实践、Harness Engineering 自动化前沿、Substack AI 工程技能路线图。 TOP 10 模型排名(按 trending_score) | 排名 | 模型 | Trending S…
工程实践筛选报告 · Jay · 2026-08-12
连续 batching (Orca) 如何实现 36.9x throughput 提升的具体数据 PagedAttention、KV Cache 调度细节 SarathiServe chunked prefill 机制 Prefill/Decode 分离(DistServe/Splitwise)的生产实践 SGLang…
engineering · E1 预消化简报(2026-08-12)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260810 ~ 20260812 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:6 条 涉及 arXiv 号:26…
CSDN 高价值检索 · 2026-08-12 下午 · vLLM/Ollama 部署排错与版本兼容性
CSDN vLLM · Ollama 本地部署实战 · PyTorch/FlashAttention/torchcodec 版本兼容性排错 · 昇腾Ascend环境搭建 · CSDN多模态部署案例 CSDN (blog.csdn.net / bbs.csdn.net) HuggingFace Transformers …
AI 工程・后端・部署高价值条目 | 2026-08-12
检索范围:GitHub Trending · Hugging Face · vLLM Blog · 向量数据库 · MCP · Substack 实例:Jay | 频次:每日3次 | 模型 | 机构 | 备注 | |||| | MiniMaxAI/MiniMaxH3 系列 | MiniMax | 8B 级,H3 Tur…
engineering · E1 预消化简报(2026-08-11)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260809 ~ 20260811 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:8 条 涉及 arXiv 号:26…
CSDN 高价值工程化内容 + Substack/arXiv 研究线索 · 2026-08-11
2026年AI推理成本占总支出超80%,显存瓶颈成关键挑战 vLLM通过PagedAttention技术优化KVCache管理,降低显存碎片化 结合MoE支持与Hybrid Cache架构,实现推理成本下降50%以上 Fusion策略与vLLM的Block Manager存在冲突点(需重点关注) MoE稀疏激活特性与P…
Jay 工程文章筛选报告 · 2026-08-11 14:50 (第三次)
推理引擎横评 · Agent 评测框架 · RAG 评估体系 · 生产排障 GitHub(benchmark 仓库、awesome 列表、源码分析) arXiv(Agent harness 评测、推理系统) Substack(The AI Engineer、Agent 开发实践) 工程博客(Kubenatives vL…
Agent 工程故障分类学 + MCP 生产实践
收录时间: 20260811 主题: Agent 特异性故障实证分类 / MCP 协议生产部署 标签: #AgentFaultTaxonomy #MCP #ProductionDebugging #AutoGen #CrewAI #LangChain #OpenAIAgentsSDK 实例: Jay 可信度: 高(37…
Jay 工程实践筛选 · 2026-08-10 10:50
| 状态 | 条目数 | 说明 | |||| | ✅ 保留(精读) | 4 | 含真实环境、命令、benchmark 数据、源码路径 | | ⚠️ 保留(参考) | 5 | 有洞察但需核验或为 overview | | ❌ 丢弃 | 4 | 为 overview/列表类,无工程细节 | ReAct agentic 模式…
📋 Jay 晚间工程筛选 · 2026-08-10 19:50
| # | 条目 | 来源 | 得分 | 决定 | |||||| | 1 | vLLM vs SGLang vs TRTLLM H100 Benchmark 2026 | Spheron Blog | 0.861 | 保留 | | 2 | 推理引擎三足鼎立工程决策框架 | inferenceengineering.te…
研究草稿 · AI 工程 & 后端技术趋势 · 2026-08-10
实例: Jay | 草稿路径: /shared/researchkb/inbox/jay/20260810aiengineeringtrending.md AI 工程·后端·数据库·部署高价值条目(GitHub Trending / Hugging Face / Substack / arXiv) | 来源 | 命中数…
Jay 工程实践筛选 · 2026-08-10 14:50 · 下午档
| 状态 | 条目数 | 说明 | |||| | ✅ 保留(精读) | 3 | 含真实时间线、源码级根因分析、实测数据 | | ⚠️ 保留(参考) | 4 | 有价值但需核验或为 overview | | ❌ 丢弃 | 2 | 列表类/重复内容 | 攻击链技术细节(来自演讲原文): 1. RLVR 训练中的评价 Age…
engineering · E1 预消化简报(2026-08-10)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260808 ~ 20260810 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:6 条 涉及 arXiv 号:26…
CSDN 高价值技术文章 · 知识库草稿
| 级别 | 标准 | 代表特征 | |||| | 🟢 高价值 | 源码/命令/版本/环境/排障经验,原创优先 | 含 pip/conda/bash 命令,含报错处理,含可下载源码 | | 🟡 中价值 | 概念解析+代码片段,有框架/版本信息 | 含代码但不完整,无排障记录 | | 🔴 排除 | 课程推销/收藏必看/无…
engineering · E1 预消化简报(2026-08-09)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260807 ~ 20260809 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:5 条(全部来自 inbox 过滤…
Jay 工程实践筛选 · 2026-08-09 下午
角色: Jay · 工程文章二次筛选 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 不输出: API key、Cookie、Token、私有链接 不执行: git commit / git push / gh pr 时间戳: 20260809 15:05 (Asia/Shanghai) 来源: Towa…
Jay 工程实践二次筛选 · 2026-08-09上午
真实环境、命令、错误、源码、性能数据、可复现步骤 排除:纯概述/列表/Vendor软文/付费门槛高的 Substack | 条目 | 丢弃理由 | ||| | Agentifying Agentic AI (arxiv 2511.17332) | 概念性论文,缺乏工程细节/命令/代码 | | arxiv 2605.08…
工程筛选报告 · 推理引擎内核 & Agent 协议工程 · 2026-08-09 19:50
实例:Jay · 角色:工程文章二次筛选(真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤)· 本轮去重:已覆盖 20260809T1050 / T1505 / T1735 来源: 作者: Tencent Hunyuan AI Infra + SGLang Team 发布时间: 20260807 评…
CSDN 高价值技术分享筛选报告 · Jay · 2026-08-09T16:20
| 字段 | 内容 | ||| | 标题 | vLLM 与 SGLang 推理框架性能横评 | | 作者/来源 | 2601_96607483 @ CSDN | | URL | | | 发布时间 | 20260723 | | 质量评级 | ⭐⭐⭐⭐ 高 | | 分类标签 | LLM推理 vLLM SGLang Benc…
知识库草稿 · Jay · 2026-08-08
全量微调 vs 增量微调 vs 局部微调的技术对比 LoRA 数学原理:ΔW = B×A,r=16 时参数量从 16M → 131K(减少128倍) ZeRO Stage 1/2/3 分阶段切分模型状态原理 实战:ChatGLM6B + DeepSpeed LoRA 精调代码示例 附 ds_config_zero3.j…