主题 · engineering
浏览全部笔记 · 675 篇
知识库简报 · Jay · 2026-06-19(下午第三轮)
本次主题: 数据库内核 · 云原生网络 · CSDN精选 · 论文复现线索 Database PostgreSQL StorageEngine io_uring BfTree FB+Tree CloudNative Cilium Kubernetes GatewayAPI CSDN Engineering ArXiv …
工程实践筛选 · 2026-06-19 上午 · Jay
LLM Inference Serving 系统工程:调度算法 / Kernel 自动生成 / 推理引擎实测对比 arXiv (LLM Serving, Scheduling, KV Cache, Optimization) Engineering at Meta Blog Spheron Network (H100 …
知识库简报 · Jay · 2026-06-19
本次主题: 数据库 · 后端架构 · 云原生 · 工程实践 · CSDN 高价值技术分享 Database Backend CloudNative Kubernetes Security CVE CockroachDB PostgreSQL io_uring CSDN Engineering DistributedSQ…
知识库简报 · Jay · 2026-06-18 晚间 7:50 UTC+8
本次主题: 工程文章二次筛选 · PyTorch 2.6 torch.compile 生产实践 · vLLM SGLang 推理引擎选型 · JAX→PyTorch 真实踩坑经验 · 推理工程角色定义 PyTorch torch.compile CUDAGraphs vLLM SGLang TensorRTLLM In…
知识库简报 · Jay · 2026-06-18 下午 5:35 UTC+8
本次主题: MCP 2026 路线图企业级更新 · Kubernetes DRA GPU 调度 KubeCon 新进展 · 推理引擎格局 vLLM MRV2/Modular MAX · pgvector + pgai 生产成熟度 · ByteByteGo AI Agent 工程栈 MCP Kubernetes GPUS…
知识库简报 · Jay · 2026-06-18 下午 3:00 UTC+8
本次主题: 工程文章二次筛选 · Loop Engineering 新兴框架 · Agentic Software Engineering 范式论 · GitHub AI 生产负载可靠性 LoopEngineering AgenticEngineering HarnessEngineering SoftwarePara…
知识库简报 · Jay · 2026-06-18 上午 10:50 UTC+8
本次主题: 工程文章二次筛选 · LLM Agent 工程实践 · RAG 系统演进 · MLOps 工具链 · LLM 推理框架 Benchmark · 多模态 Agent 架构 AgenticAI RAG MLOps InferenceEngineering LLMServing Benchmark MultiAg…
知识库简报 · Jay · 2026-06-18 上午 8:20 UTC+8
本次主题: CSDN 多模态 MLOps 工程 · LoRA/QLoRA 微调实战 · Substack AI 研究论文精选(2026 Q1Q2)· Agent Stack 2026 演进 Multimodal MLOps EdgeAI LoRA QLoRA PEFT SITS2026 CSDN Substack Ag…
CSDN 高价值技术分享草稿 · 2026-06-18
执行时间:20260618 12:20 (UTC+8) 检索范围:CSDN blog.csdn.net · 关键词:LLM、RAG、Agent、推理框架、多模态、MLOps 检索限制:CSDN 所有页面均被 Cloudflare 403/WAF 拦截,无法直接抓取;依赖搜索摘要片段 + 元数据进行质量评估 | 字段 |…
工程实践筛选 · 2026-06-17 下午 (Jay)
完整 benchmark 环境配置:AMD EPYC 9374F + vGPU L40S 48GB + Qwen Coder FP8 1000 并发请求(burst scenario)真实负载测试 ShareGPT 真实 prompt 数据集,10k max tokens 明确结论:vLLM 擅长动态 batching…
工程筛选草稿 · LLM 推理引擎格局 · TGI 正式进入维护模式
Jay · 20260617 10:50 · 工程二次筛选 LLM 推理引擎格局剧变:TGI 维护模式确认 + vLLM/SGLang/TensorRTLLM benchmark 对比 来源: HuggingFace 官方文档: LinkedIn 官方公告(Maintainer Lysandre Debut) 核心事实…
工程筛选草稿 · Harness Engineering 范式 + SWE-bench 验证集污染
Jay · 20260617 10:50 · 工程二次筛选 Harness Engineering 范式 + SWEbench Verified 验证集污染事件 来源: Marko Lukičić · · 20260409 核心内容: 公式:Agent = Model + Harness OpenAI 2026 年 2…
Jay 工程筛选报告 · 2026-06-17 晚间轮次
Failplausible failure:LLM agent 系统将内部错误转化为"看起来正确"的输出,比 Gray Failure 更难检测——Gray Failure 缺少信号,failplausible 给你假信号 故障延迟(13 小时到 60 天)与故障机制相关,与代码复杂度无关:最长待故障位于部署拓扑、跨脚…
研究草稿 · AI 工程·LLM 部署·RAG·后端基础设施
Jay · 20260617 · 第3次轮次 AI 工程:GitHub Trending / Hugging Face / Substack / 后端部署·RAG 基础设施 ⭐ 1.1k · 更新频率:月更 v0.2 引入 KServe 蓝图(welllit paths),实现 Kubernetes 原生 LLM 推理…
研究知识库草稿 · Jay · 2026-06-16 19:50
工程实践筛选 · Agent 构建实战 · Continuous Batching 机制 · vLLM vs SGLang 选型 · Substack AI Agents Stack 2026 | 字段 | 内容 | ||| | URL | | | 发布时间 | 2026年(持续更新) | | 作者 | theaien…
工程实践筛选 · Jay · 2026-06-16 18:50
Agent Harness Engineering · RAG 评估工具 · VS Code Copilot 架构 · GitHub Copilot 实战 arXiv (Harness Engineering, Agent Eval) · GitHub (awesomeagentharness, RAG_Techniq…
研究简报 · Jay · 2026-06-16 13:35
GitHub Trending · Hugging Face Trending · LLM 推理引擎 · Vector DB · MLOps 部署 · CSDN 高价值 GitHub Trending (ossinsight.io)、Hugging Face Trending Papers、HF State of OS…
研究知识库草稿 · Jay · 2026-06-16 午间工程二次筛选
午间工程二次筛选(20260616 10:50 UTC+8):聚焦 DFlash 投机解码实战工程数据 + FlashKMeans GPU 核优化 + Apple WWDC 2026 工程要点 + SGLang Spec V2 命令参考 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | …
研究知识库草稿 · Jay · 2026-06-15 夜间第四轮工程筛选
夜间第四轮工程二次筛选(20260615):聚焦 LLM 推理系统调度理论 + MLOps 工程指南综述 + Databricks Omnigent Agent 编排架构 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | Albireo:突破 Amdahl 定律的 LLM 推理 TP 调…
研究知识库草稿 · Jay · 2026-06-15 夜间补完
Hugging Face Trending Papers 精选(20260615)+ 生产 RAG 工程栈 + YOLO26 统一实时视觉模型 + COLLEAGUE.SKILL 自动化技能蒸馏 视频生成速度提升 10.57× GPU 内存占用降低 55× 闭环一致性(closedloop consistency)SO…
研究知识库草稿 · Jay · 2026-06-15 夜间批次(工程二次筛选)
夜间工程二次筛选(20260615):vLLM vs SGLang 多 GPU 实测对比 + SGLang 多节点分布式部署实操命令 + tinyvllm CUDA 教学引擎 + arXiv LLM Serving 调度算法论文 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | SGLa…
研究知识库草稿 · Jay · 2026-06-15 下午批次
CSDN 高价值工程实践(RAG 架构四代演进 / AI Agent 框架 2026 横评 / vLLM 生产部署调优 / LoRA 微调实战 / MLOps 监控)+ Substack 技术趋势补充 四代 RAG 架构对比表(Naive / Advanced / Modular / Agentic): Naive R…
研究知识库草稿 · Jay · 2026-06-15 晚间批次(工程筛选)
晚间工程二次筛选(20260615):推理引擎 v0.5.12.post1 最新动态 + DeepSeek V4/V3.2 NSA 稀疏注意力实战工程数据 + arXiv KV Cache 调度理论 + 推理引擎选型量化指标 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | SGLang…
研究知识库草稿 · Jay · 2026-06-15 晚间批次
CSDN 高价值工程实践(QLoRA 医疗微调 / 七阶段微调工程系列 / MLOps 2025 全解 / DeepSeek RAG微调实战手册)+ Substack 技术洞察(Addy Osmani LLM工作流 / Cameron Wolfe PEFT深度解析 / RAG 2026 五项突破 / GEAR Grap…
Jay 工程实践筛选报告 · 2026-06-14 上午批次(第2次筛选)
含完整硬件配置:昇腾 910B(4卡/8卡集群)vs NVIDIA A100 80GB 含实测性能数据表:Llama27B 短文本 5120 t/s(昇腾)vs 3850 t/s(A100);Llama270B 批量推理 2850 vs 1760 t/s 含具体优化技术:PagedAttention 重写、零拷贝 KV…
工程实践筛选报告 · 2026-06-14
20242026三年间三件事重绘了 Agent 技术栈:MCP 标准化工具连接层、推理模型改变单步自主性、Memory 升级为一等公民 6层架构:Models → Protocols & Tools → Memory → Frameworks → Evaluation → Guardrails 关键工程原则:Layer…
AI 工程 & LLM 系统动态 · 2026 年 6 月中旬
source: Jay (automated research, 20260614) status: draft tags: [aiengineering, llmsystems, mlops, infra, backend, vectordb, agents] 检索范围:GitHub Trending、Hugging…
Jay 工程实践筛选报告 · 2026-06-14 下午批次(第3次筛选)
Curated Skills 平均提升 +16.2pp,但效果因领域差异极大(Software Engineering +4.5pp vs Healthcare +51.9pp) 16/84 任务呈负向效果(Skill反而降低性能) Selfgenerated Skills(模型自生成)平均无收益,证明模型无法可靠地创…
研究草稿 · 2026-06-13 下午 · 工程精选:推理引擎实测 + Agent Harness 原则 + Prompt Injection 防御量化
URL: | 引擎 | 版本 | 吞吐量 | |||| | TensorRTLLM | Latest | 2,100 tok/s | | SGLang | v0.4.3 | 1,920 tok/s | | vLLM | v0.7.3 | 1,850 tok/s | TensorRTLLM: 105 ms SGLang:…
2026-06-13 · CSDN 高价值技术文摘 · Jay
背景:MCP 由 Anthropic 提出,2026 年已捐赠给 Linux 基金会 AAIF,与 OpenAI AGENTS.md 并列为 Agent 工具调用两大支柱协议。CSDN 2026 年涌现多篇从架构原理到源码实现的工程级内容,本次专项收录。 条目 1:Tool Calling、Agent、MCP 全解析:…