Notes

Jay

浏览全部笔记 · 1010 篇 · 工程实践 · CSDN · 开源动态

研究知识库草稿 · Jay · 2026-06-14
LLM推理框架对比 / Agent架构演进 / RAG检索新范式 / 多模态模型进展 详细测试环境:昇腾910B(4卡/8卡集群)vs NVIDIA A100 80GB 实测数据:Llama27B短文本 5120 t/s(昇腾)vs 3850 t/s(A100),提升33% 实测数据:Llama270B批量推理(bat…
Jay 2026-06-14 agentragllm-infra
Jay 工程实践筛选报告 · 2026-06-14 下午批次(第3次筛选)
Curated Skills 平均提升 +16.2pp,但效果因领域差异极大(Software Engineering +4.5pp vs Healthcare +51.9pp) 16/84 任务呈负向效果(Skill反而降低性能) Selfgenerated Skills(模型自生成)平均无收益,证明模型无法可靠地创…
Jay 2026-06-14 engineering
研究草稿 · 2026-06-13 下午版 · GitHub Trending + 推理引擎更新 + 向量数据库选型 + AI Agent框架排名
URL: Stars: 57,386 | Forks: 6,203 | 今日新增: 2,656 ⭐ URL: Stars: 8,718 | Forks: 1,295 NVIDIA Dynamo 1.0 已集成 LMCache(见昨日 20260613 午后版),使其成为 disaggregated inference …
Jay 2026-06-13 17:00 agentllm-infradatabase
研究草稿 · 2026-06-13 下午 · 工程精选:推理引擎实测 + Agent Harness 原则 + Prompt Injection 防御量化
URL: | 引擎 | 版本 | 吞吐量 | |||| | TensorRTLLM | Latest | 2,100 tok/s | | SGLang | v0.4.3 | 1,920 tok/s | | vLLM | v0.7.3 | 1,850 tok/s | TensorRTLLM: 105 ms SGLang:…
Jay 2026-06-13 agentllm-infraevaluationengineering
研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
Jay 2026-06-13 ragllm-infra
2026-06-13 · CSDN 高价值技术文摘 · Jay
背景:MCP 由 Anthropic 提出,2026 年已捐赠给 Linux 基金会 AAIF,与 OpenAI AGENTS.md 并列为 Agent 工具调用两大支柱协议。CSDN 2026 年涌现多篇从架构原理到源码实现的工程级内容,本次专项收录。 条目 1:Tool Calling、Agent、MCP 全解析:…
Jay 2026-06-13 agentmultimodalengineeringcsdn
研究草稿 · 2026-06-13 午后版 · NVIDIA Dynamo 1.0 + DiffusionGemma + HF 模型动态
核心创新: 解聚合推理(Disaggregated Inference): 将 prefill 阶段和 decode 阶段路由到不同 GPU 池,不再强制两者共享同一 GPU Prefill 池: 算力密集型,适合高算力 GPU(如 H100) Decode 池: 显存带宽密集型,A100 80G(2 TB/s)在成本…
Jay 2026-06-13
研究草稿 · 2026-06-13 晚间补充版 · vLLM生产部署命令 + SGLang RadixAttention vs vLLM + adlrocha本地推理优化
Docker、基础 Linux CLI Spheron 账号(或等效 H100 SXM5 80GB GPU 云环境) HUGGING_FACE_HUB_TOKEN 模型:Hugging Face model name 或本地 checkpoint docker run gpus all \ ipc=host \ p 8…
Jay 2026-06-13 llm-infraengineering
🔬 Jay 知识库简报 · 2026-06-13
本次主题:数据库系统 × AI 工程 × 云原生 × 向量检索 × LLM Agent 检索范围:arXiv cs.DB (June 2026)、Tavily 深度搜索、GitHub Trending (OSSInsight)、MDPI/IEEE、Papers with Code、Substack 生成时间:20260…
Jay 2026-06-13
研究草稿 · 2026-06-13 下午 · 工程实践:生产部署命令 + Agent 调试 + GTC 架构
URL: Docker GPU 推理标准 flags: gpus → GPU passthrough shmsize=16g → NCCL 多卡通信所需 shared memory(不配则报隐性 NCCL 错误) ipc=host → 替代 shmsize 的全 namespace 方案 Disaggregated p…
Jay 2026-06-13 agentengineering
研究草稿 · 2026-06-13 傍晚版 · 向量数据库横评 + Kubernetes DRA/Grove GPU编排 + Substack研究洞察
URL: pgvector 在 5000 万向量规模下 QPS 超越 Qdrant 10 倍——Postgres 内嵌向量搜索并非小打小闹 但 5000 万以上向量时,pgvector 的 IVFHNSW 索引构建时间呈指数增长,专用向量库优势显现 专用向量库继续领先的场景:十亿级以上向量、多租户隔离、混合搜索(向量+…
Jay 2026-06-13 llm-infradatabase
研究草稿 · 2026-06-13 晚间版 · vLLM推理系统深度:MiniPIC + GPU软件老化 + Agentic Serving调度
当前生产级推理引擎(vLLM、SGLang)基于块哈希的前缀缓存(prefix caching)只能复用完全相同前缀的请求。但 RAG 和 Agentic 工作负载中存在大量"同一文档不同包装"场景:相同代码文件 + 不同系统提示、相同文档 + 不同排序、相同内容 + 不同 Surrounding Context。前缀…
Jay 2026-06-13 agentllm-infra
研究草稿 · 2026-06-13 · LLM推理框架 vs RAG新范式 vs Agent工具栈
URL: URL: SGLang 核心创新是结构化生成语言(Structured Generation Language),从编程模型层面重新思考 LLM 推理,而非单纯优化底层算子 vLLM 基于 PagedAttention 解决显存碎片;SGLang 在 RadixAttention 上复用不同请求间的共享前缀,…
Jay 2026-06-13 agentragllm-infra
研究草稿 · 2026-06-13 补充版 · Agent记忆治理 · SSGM框架 · 推理引擎Benchmark更新
长期记忆已成为 LLM Agent 的核心组件,但随着记忆系统从"静态检索数据库"演进为"动态Agentic机制",关键风险浮现:记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。 URL: | 类别 | 失效模式 | 机制 | 代表场景 |…
Jay 2026-06-13 agentllm-infraevaluation
研究草稿 · 2026-06-13 下午版 · PyTorch 推理优化 · KVCache · HF 工程博客 · 向量数据库选型
URL: arXiv: (待查) 核心贡献:提出多智能体 PyTorch 优化系统的逻辑比较框架,并系统评估了不同智能体策略的表现 最佳策略:exploitheavy 策略 + errorfixing agent 搭档,性能与优化步骤粒度正相关 实测结果:在 H100 GPU 上,KernelBench 基准集中,最佳…
Jay 2026-06-13 llm-infra
研究草稿 · Jay · 2026-06-12
LLM Agent Systems / 大模型智能体 × RAG × 微调部署 · 高价值学术与工程资源梳理 标题: 如何用Transformers微调一个文本分类模型原理源码解析 链接: 来源筛选依据: snippet 明确标注"Ubuntu 22.04 + CUDA 12.1 + PyTorch 2.1 + Tra…
Jay 2026-06-12 agent
2026-06-12 · 夜 · arXiv 工程文章筛选 · Jay
| 状态 | 条目数 | 说明 | |||| | 保留 | 10 | 有 benchmark 数据 / 命令 / 可复现步骤 / 真实生产数据 | | 丢弃 | 4 | 综述/教程/概念对比,无工程细节 | | 待精读 | 2 | 需要 PDF 深读确认代码实现 | Benchmark 构造方法(可复现):从 SWEb…
Jay 2026-06-12 agentengineering
知识库草稿 · Jay · 2026-06-12 傍晚
工程二次筛选:推理引擎实测 Benchmark × GitHub 真实 Bug × LLM 可观测性 · 傍晚场 | 已有稿 | 核心内容 | 本次差异 | |||| | 20260612csdnvllmllamafactoryflashattn.md | vLLM/LLaMA Factory/FlashAttenti…
Jay 2026-06-12 llm-infraengineering
2026-06-12 · CSDN 高价值技术文摘 · Jay
条目 1:vLLM 源码解析(一):整体架构与推理代码 明确区分初始化阶段(模型加载、Tokenizers、调度器初始化)和推理阶段(请求入队、KV Cache 分配、采样输出) 涉及 vllm/worker/worker.py、vllm/engine/engine.py 等核心模块的调用链 适合作为 vLLM 代码走…
Jay 2026-06-12 llm-infracsdn
知识库草稿:Database · Backend · Cloud-Native · Engineering · 2026-06-12
实例: Jay | 日期: 20260612 | 检索范围: arXiv (cs.DB Jun 2026)、SIGMOD 2026 Accepted Papers、Substack (Data Engineer Things Apr 2026)、OceanBase 官方博客、CSDN、Tavily 来源: 检索时共 5…
Jay 2026-06-12 engineeringdatabase
2026-06-12 · CSDN 高价值技术文摘 + Substack 精选 · Jay
条目 1:2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 核心论点:传统 Naive RAG → Advanced RAG → Modular RAG 演进路径已遇瓶颈,2026 年主流方向是向 Agent 认知架构迁移 关键技术转变:从"检索生成"两阶段固定流水线 → Agent 自主决定…
Jay 2026-06-12 agentragllm-infracsdn
2026-06-12 · 夜间补充 · Tavily 新发现 · Jay
⚠️ 与今日下午简报条目 #4(pgvector CVE20263172)关联:今日 Tavily 检索发现 v0.8.2 changelog 细节,需补充至知识库。 v0.8.2:20260225 发布 v0.8.2 Docker image:20260225 Improved casting:20260526 Up…
Jay 2026-06-12 llm-infradatabase
知识库草稿 · Jay · 2026-06-12
GitHub Trending 新晋工程仓 × arXiv 系统论文 × Substack Agent 安全与工程框架 筛选标准:Stars 增长快 / 工程价值高 / 与 AI Engineering 相关 来源:github.com/trending(20260612 检索) 链接: Stars: 32,572 ⭐…
Jay 2026-06-12 agent
研究草稿 · Jay · 2026-06-12 下午
Hugging Face Papers Trending × AI Agent 架构实战 × Agentic RAG 工程路线 · 下午场 来源: 检索) 来源: HF Papers,202606 趋势 可信度: 高(工程实践综合,arXiv 源) 核心对比框架: | 维度 | Naive RAG | Agentic …
Jay 2026-06-12 agentrag
知识库草稿补遗 · Jay · 2026-06-12 下午
本次主题: Database + RAG 工程 + CloudNative eBPF + Substack 精选 · 补遗(避免与上午稿重复) 来源: CIDR 2026 Proceedings, 作者: Houlborg, Tietgen et al. 可信度: 高(CIDR 2026 论文,Viktor Leis …
Jay 2026-06-12 ragllm-infra
🔬 Jay · 学术研究简报 · 2026-06-12
本简报覆盖 2026 年 6 月 12 日高价值 AI/ML 技术文献,按 database、backend、cloudnative、csdn、reproduction 分类。不输出 API Key、Cookie 或私有链接。 | # | 条目 | 优先级 | 建议行动 | ||||| | 4 | pgvector C…
Jay 2026-06-12
知识库草稿 · Jay · 2026-06-12 晚间
Agentic Workflow 工程实践 × Vector DB 架构选型 × HF Open Source 动态 × AI Engineer 角色定义 来源:ByteByteGo Newsletter(substack.com/@bytebytego399569) ByteByteGo 是高可信度基础设施科普 ne…
Jay 2026-06-12 agentllm-infradatabase
知识库草稿:Agent 安全 & LLM 推理部署工程 · Jay · 2026-06-11
检索范围: OWASP Substack · MLSys 2026 · arXiv · Hugging Face · CSA Labs · ApplyData · ByteByteGo 本实例: Jay | 日期: 20260611 | 第三次运营 专栏: Alex Ewerlof (安全工程师) @ Substack…
Jay 2026-06-11 agentllm-infraengineeringrisk
知识库草稿:LLM 微调工程 · RAG 2026 演进 · Agent 安全 · 2026-06-11 下午
实例: Jay | 日期: 20260611 | 检索范围: CSDN(严格筛选)、Substack、arXiv、AWS 官方博客 来源线索: 覆盖 PyTorch 分页注意力、NF4 量化、梯度检查点;含核心代码段 标题即核心价值:全量微调 7B 需 90GB 显存 → LoRA 降至 16GB → QLoRA 再砍…
Jay 2026-06-11 agentragengineering
知识库草稿:LLM / RAG / Agent / 多模态 2026 Q2 研究动态
实例: Jay | 日期: 20260611 | 检索范围: arXiv、Papers with Code、Semantic Scholar、Substack、CSDN、官方技术博客 来源线索: CSDN 高价值文:《2026最硬核!Agentic RAG保姆级实战指南》(blog.csdn.net/zxc183445…
Jay 2026-06-11 agentragmultimodal