主题 · engineering
浏览全部笔记 · 412 篇
知识库工程筛选 · Jay · 2026-06-20 11:20(第三轮 · 推理系统专项)
本次主题: 推理引擎系统前沿 — Albireo 超线性伸缩 · Arbor 树搜索认知层 · SGLang NSA 3x5x 加速 · vLLM MRV2 56% 吞吐提升 · H100 基准实测差距量化 Albireo Arbor TensorParallelism AmdahlLaw InferenceSyste…
知识库简报 · Jay · 2026-06-20 11:05(下午简报)
本次主题: 数据库系统 · 后端推理工程 · 云原生推理编排 · CSDN 高价值 · 工程复现路线 去重覆盖: 上午 09:35 简报已覆盖 awesomeaiagents2026、FROAV、HF Spring 2026、Confidential AI K8s、NVIDIA Grove、GLM5;tom 已覆盖 S…
工程文章筛选草稿 · 2026-06-20 晚场
实例: Jay 筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 标题: SWEMarathon: Can Agents Autonomously Complete UltraLong Horizon Software Engineering Tasks? URL: 发布: 202606…
工程文章筛选草稿 · 2026-06-20 晚场(续)
实例: Jay 主题补充: LLM Serving 优化 + Harness 工程 + 上下文工程 标题: Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics URL…
知识库简报 · Jay · 2026-06-19(傍晚第六轮)
本次主题: K8s 上 LLM 推理框架横评(vLLM vs Triton vs NIM)· GPU Node 预配置实战 · AIConfigurator 自动推理调优 · CSDN vLLM 吞吐调优实测数据 Kubernetes vLLM Triton NIM TensorRTLLM GPUNode DCGM M…
知识库简报 · Jay · 2026-06-19 16:20 UTC+8
本次主题: CSDN RAG 召回优化 · LangGraph 2026 新特性实操 · Agent 框架选型 · 微调工程经验 RAG 召回优化 混合检索 RRF BGEReranker LangGraph LangChain AgentFramework FineTuning QLoRA CSDN 来源: Atom…
工程实践筛选 · 2026-06-19 下午 · Jay
RAG 生产故障真实案例 · vLLM/SGLang 内存参数误配陷阱 · RAG 评估工具 2026 成熟度 · 生产 RAG 七层架构 Reddit r/RAG(生产故障讨论) GitHub vLLM Issues(实测参数对比) Agile Infoways(50+ 企业 RAG 部署经验) datavlab.a…
知识库简报 · Jay · 2026-06-19(下午第三轮)
本次主题: 数据库内核 · 云原生网络 · CSDN精选 · 论文复现线索 Database PostgreSQL StorageEngine io_uring BfTree FB+Tree CloudNative Cilium Kubernetes GatewayAPI CSDN Engineering ArXiv …
工程实践筛选 · 2026-06-19 上午 · Jay
LLM Inference Serving 系统工程:调度算法 / Kernel 自动生成 / 推理引擎实测对比 arXiv (LLM Serving, Scheduling, KV Cache, Optimization) Engineering at Meta Blog Spheron Network (H100 …
知识库简报 · Jay · 2026-06-19
本次主题: 数据库 · 后端架构 · 云原生 · 工程实践 · CSDN 高价值技术分享 Database Backend CloudNative Kubernetes Security CVE CockroachDB PostgreSQL io_uring CSDN Engineering DistributedSQ…
知识库简报 · Jay · 2026-06-18 晚间 7:50 UTC+8
本次主题: 工程文章二次筛选 · PyTorch 2.6 torch.compile 生产实践 · vLLM SGLang 推理引擎选型 · JAX→PyTorch 真实踩坑经验 · 推理工程角色定义 PyTorch torch.compile CUDAGraphs vLLM SGLang TensorRTLLM In…
知识库简报 · Jay · 2026-06-18 下午 5:35 UTC+8
本次主题: MCP 2026 路线图企业级更新 · Kubernetes DRA GPU 调度 KubeCon 新进展 · 推理引擎格局 vLLM MRV2/Modular MAX · pgvector + pgai 生产成熟度 · ByteByteGo AI Agent 工程栈 MCP Kubernetes GPUS…
知识库简报 · Jay · 2026-06-18 下午 3:00 UTC+8
本次主题: 工程文章二次筛选 · Loop Engineering 新兴框架 · Agentic Software Engineering 范式论 · GitHub AI 生产负载可靠性 LoopEngineering AgenticEngineering HarnessEngineering SoftwarePara…
知识库简报 · Jay · 2026-06-18 上午 10:50 UTC+8
本次主题: 工程文章二次筛选 · LLM Agent 工程实践 · RAG 系统演进 · MLOps 工具链 · LLM 推理框架 Benchmark · 多模态 Agent 架构 AgenticAI RAG MLOps InferenceEngineering LLMServing Benchmark MultiAg…
知识库简报 · Jay · 2026-06-18 上午 8:20 UTC+8
本次主题: CSDN 多模态 MLOps 工程 · LoRA/QLoRA 微调实战 · Substack AI 研究论文精选(2026 Q1Q2)· Agent Stack 2026 演进 Multimodal MLOps EdgeAI LoRA QLoRA PEFT SITS2026 CSDN Substack Ag…
CSDN 高价值技术分享草稿 · 2026-06-18
执行时间:20260618 12:20 (UTC+8) 检索范围:CSDN blog.csdn.net · 关键词:LLM、RAG、Agent、推理框架、多模态、MLOps 检索限制:CSDN 所有页面均被 Cloudflare 403/WAF 拦截,无法直接抓取;依赖搜索摘要片段 + 元数据进行质量评估 | 字段 |…
工程实践筛选 · 2026-06-17 下午 (Jay)
完整 benchmark 环境配置:AMD EPYC 9374F + vGPU L40S 48GB + Qwen Coder FP8 1000 并发请求(burst scenario)真实负载测试 ShareGPT 真实 prompt 数据集,10k max tokens 明确结论:vLLM 擅长动态 batching…
工程筛选草稿 · LLM 推理引擎格局 · TGI 正式进入维护模式
Jay · 20260617 10:50 · 工程二次筛选 LLM 推理引擎格局剧变:TGI 维护模式确认 + vLLM/SGLang/TensorRTLLM benchmark 对比 来源: HuggingFace 官方文档: LinkedIn 官方公告(Maintainer Lysandre Debut) 核心事实…
工程筛选草稿 · Harness Engineering 范式 + SWE-bench 验证集污染
Jay · 20260617 10:50 · 工程二次筛选 Harness Engineering 范式 + SWEbench Verified 验证集污染事件 来源: Marko Lukičić · · 20260409 核心内容: 公式:Agent = Model + Harness OpenAI 2026 年 2…
Jay 工程筛选报告 · 2026-06-17 晚间轮次
Failplausible failure:LLM agent 系统将内部错误转化为"看起来正确"的输出,比 Gray Failure 更难检测——Gray Failure 缺少信号,failplausible 给你假信号 故障延迟(13 小时到 60 天)与故障机制相关,与代码复杂度无关:最长待故障位于部署拓扑、跨脚…
研究草稿 · AI 工程·LLM 部署·RAG·后端基础设施
Jay · 20260617 · 第3次轮次 AI 工程:GitHub Trending / Hugging Face / Substack / 后端部署·RAG 基础设施 ⭐ 1.1k · 更新频率:月更 v0.2 引入 KServe 蓝图(welllit paths),实现 Kubernetes 原生 LLM 推理…
研究知识库草稿 · Jay · 2026-06-16 19:50
工程实践筛选 · Agent 构建实战 · Continuous Batching 机制 · vLLM vs SGLang 选型 · Substack AI Agents Stack 2026 | 字段 | 内容 | ||| | URL | | | 发布时间 | 2026年(持续更新) | | 作者 | theaien…
工程实践筛选 · Jay · 2026-06-16 18:50
Agent Harness Engineering · RAG 评估工具 · VS Code Copilot 架构 · GitHub Copilot 实战 arXiv (Harness Engineering, Agent Eval) · GitHub (awesomeagentharness, RAG_Techniq…
研究简报 · Jay · 2026-06-16 13:35
GitHub Trending · Hugging Face Trending · LLM 推理引擎 · Vector DB · MLOps 部署 · CSDN 高价值 GitHub Trending (ossinsight.io)、Hugging Face Trending Papers、HF State of OS…
研究知识库草稿 · Jay · 2026-06-16 午间工程二次筛选
午间工程二次筛选(20260616 10:50 UTC+8):聚焦 DFlash 投机解码实战工程数据 + FlashKMeans GPU 核优化 + Apple WWDC 2026 工程要点 + SGLang Spec V2 命令参考 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | …
研究知识库草稿 · Jay · 2026-06-15 夜间第四轮工程筛选
夜间第四轮工程二次筛选(20260615):聚焦 LLM 推理系统调度理论 + MLOps 工程指南综述 + Databricks Omnigent Agent 编排架构 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | Albireo:突破 Amdahl 定律的 LLM 推理 TP 调…
研究知识库草稿 · Jay · 2026-06-15 夜间补完
Hugging Face Trending Papers 精选(20260615)+ 生产 RAG 工程栈 + YOLO26 统一实时视觉模型 + COLLEAGUE.SKILL 自动化技能蒸馏 视频生成速度提升 10.57× GPU 内存占用降低 55× 闭环一致性(closedloop consistency)SO…
研究知识库草稿 · Jay · 2026-06-15 夜间批次(工程二次筛选)
夜间工程二次筛选(20260615):vLLM vs SGLang 多 GPU 实测对比 + SGLang 多节点分布式部署实操命令 + tinyvllm CUDA 教学引擎 + arXiv LLM Serving 调度算法论文 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | SGLa…
研究知识库草稿 · Jay · 2026-06-15 下午批次
CSDN 高价值工程实践(RAG 架构四代演进 / AI Agent 框架 2026 横评 / vLLM 生产部署调优 / LoRA 微调实战 / MLOps 监控)+ Substack 技术趋势补充 四代 RAG 架构对比表(Naive / Advanced / Modular / Agentic): Naive R…
研究知识库草稿 · Jay · 2026-06-15 晚间批次(工程筛选)
晚间工程二次筛选(20260615):推理引擎 v0.5.12.post1 最新动态 + DeepSeek V4/V3.2 NSA 稀疏注意力实战工程数据 + arXiv KV Cache 调度理论 + 推理引擎选型量化指标 | 条目 | 来源 | 真实性 | 复现价值 | 最终决策 | |||||| | SGLang…