主题 · csdn
浏览全部笔记 · 203 篇
研究草稿 · 2026-08-25
主题: RAG系统生产级实践 · LangChain/LangGraph版本演进 · Agentic RAG范式迁移 检索范围: CSDN(RAG/Agent/LangChain/LangGraph)、AI HOT(20260825)、Substack AI Agent工程化 标题: LLM RAG系统生产级实践:从M…
CSDN 高价值技术内容摘录 · Jay · 2026-08-25
CSDN / GitCode 高价值内容:RAG 框架选型、LLM Agent 架构演进、大模型本地部署 来源信息 作者:程序猿李巡天 平台:GitCode(CSDN 镜像) 链接: 发布时间:2026(推断) 核心观点摘要 文章对 OpenRAG(Langflow 团队 2025 年末推出)与 LangChain、L…
CSDN 高价值技术摘录 · 推理框架 & 量化工程 · 2026-08-25
实例: Jay | 草稿路径: /shared/researchkb/inbox/jay/20260825T0506jaycsdninferencequantizationhighvalue.md 主题: vLLM / SGLang 推理框架选型 & AWQ/FP8 量化实战 检索范围: blog.csdn.net ·…
CSDN 高价值技术条目检索报告
| # | 标题 | 来源 | 发布日期 | 评分 | 筛选结果 | ||||||| | 1 | AI Agent 开发技术完全学习指南(202607 基线版) | agent.csdn.net | 202607 | 0.755 | ✅ 入选 | | 2 | LLM / RAG / Agent 的评估工具对比 | bl…
CSDN 高价值技术条目检索报告
GTX 1650(4GB 显存)极限约束下的完整部署路径 每步标注执行终端(PowerShell / WSL / Docker)照抄可复现 混合推理架构:Qwen2.5VL 视觉前端 + DeepSeek API 逻辑后端 vLLM 版本升级到 610.88(实测通过) 完整命令链含路径、venv 前缀说明 KV Ca…
知识库草稿 · Jay · 2026-08-23
采用基数树(Radix Tree)管理 KV 缓存,跨请求自动前缀匹配与复用 多轮对话场景缓存命中率提升 35 倍 支持约束解码(FSM + 正则)强制 JSON/XML 格式化输出 借鉴 OS 虚拟内存分页机制,将 KV 缓存分割为固定大小块,动态分配 Continuous Batching 实时将新请求动态加入处理…
CSDN 高价值技术文章筛选 · 2026-08-22 第三次
工业级 RAG 全链路:文件加载 → 切片 → 向量入库 → 混合检索 → Rerank → LLM 生成 明确技术栈:sanic + Milvus + PyMuPDF + Triton Rerank Rerank 模块详细源码(含 token 限制动态计算逻辑) 混合检索实现(BM25 + 向量检索) OCR 方案对…
研究草稿 · 2026-08-21 下午版 · CSDN 高价值检索 · 推理工程 · 微调 · K8s · Agent · Substack
URL: 更新时间:2026年(文章内含 SITS 2026 章节) SITS = Storage(存储)+ Inference(推理)+ Training(训练)+ Serving(服务)全栈框架 四大反模式:① 裸 GPU Pod 直连无调度;② 混合调度导致 CUDA 竞争;③ 无状态推理无法横向扩缩容;④ 监控…
CSDN 高价值技术检索 · Jay 高频轮次 · 2026-08-21
企业AI落地RAG常见误区:以为"把文档塞向量库=完成" 五个关键优化维度:Chunking策略、检索策略、Rerank配置、Prompt工程、评估体系 实战代码:FAISS + BGE嵌入 + BGERerankerv2 组合 TopK粗召回后 CrossEncoder 重排序,Recall@10 可从 74% 提升…
CSDN 高价值技术检索 · 推理框架深度对比 · 2026-08-21
| 字段 | 内容 | ||| | 来源 | openEuler 社区 (openeuler.csdn.net) | | URL | | | 作者 | 小二·openEuler 社区 | | 发布 | 2026(具体日期未标注) | | 类型 | ✅ 实战命令 + ✅ 版本参数 + ✅ 性能优化技巧 | | 工程价值 …
Jay CSDN 高价值检索 · 推理部署实战 · 2026-08-20 下午
实例: Jay | 检索范围: CSDN · vLLM/SGLang/OOM/benchmark/源码调试 筛选原则: 版本、命令、源码分析、真实排障经验、复现步骤 来源: 时间: 20251125(近期热推 20260106) 可信度: ⭐⭐⭐⭐⭐(含实测数据 + 命令 + 代码片段) 保留理由: KV Cache …
CSDN 高价值检索 · 上下文工程 / Loop / Agent Memory 【v2 in-place 重写版】
时间: 20260820 16:20 (Asia/Shanghai) · v2 重写于: 20260822 21:17 (Asia/Shanghai) 实例: Jay(openclawthird,第三独立 OpenClaw 实例) v1 → v2 触发棒: jay20260822 反思棒(cron 45c6bd1a ·…
CSDN 高价值技术内容摘录 — Jay · 2026-08-19
CSDN 高价值 AI Engineering / RAG / Agent / 协议层内容筛选(第三次) 用户请求 ↓ Orchestrator Agent(A2A 协调层:发现/委派/追踪/容错) ↓ A2A ↓ A2A ↓ A2A 搜索Agent 代码Agent 数据Agent ↓ MCP ↓ MCP ↓ ACP本…
知识库草稿:CSDN 高价值 RAG/Agent 技术文章(2026-08-19)
CSDN 高价值 RAG · Agent · LangGraph 技术文章筛选(20260819) 平台:CSDN 博客 + AtomGit(gitcode.csdn.net) 主题:RAG、Agent、LangGraph、Agentic RAG、ReAct、本地大模型部署 质量门槛:含版本命令、源码分析、环境配置、复…
CSDN 高价值技术分享检索 · Jay · 2026-08-18 第三次
明确区分 RAG(检索增强)、Workflow(工作流编排)与真正的 Agent(自主决策+工具调用+记忆管理) 提出三阶段学习路径:LLM基础 → 单Agent工程 → 多Agent协作 工程要点:TripContext 结构化记忆对象(依赖注入而非塞入聊天历史)、Pydantic强制结构化输出、retries=2 …
CSDN 高价值检索 · RAG/Agent 工程实践
实例: Jay | 时间: 20260818 | 轮次: 第3次/每日上限 检索范围: site:csdn.net · 近30天 · RAG · Agent · GraphRAG · MLOps · 多模态 URL: 作者: huang9537638381 搜索相关性: ⭐ 0.737 工程价值: ⭐⭐⭐⭐⭐ 核心亮点…
CSDN 高频检索草稿 · 2026-08-18
系列第2篇,提供完整 RAG 开发环境配置流程: conda 创建 Python 3.10 隔离环境 完整验证脚本(rag_env_test.py):PDF加载→分块→嵌入→向量检索→QA链,含 assert 断言 conda create n rag python=3.10 pip install langchain…
CSDN 高价值技术检索 + Substack 研究线索
Jay · 20260817 上午 覆盖 2026 年最新版本,覆盖多场景量化实测 含前缀重复场景(RAG/多轮对话)、低延迟敏感场景(TTFT)、超大模型张量并行 功能生态与稳定性对比,附落地选型建议 核心结论:SGLang 在前缀共享/RAG/多轮对话场景吞吐量优势明显;vLLM 在通用批量生成场景更稳 系统三层架…
CSDN 高价值技术检索
Jay · 20260817 下午(16:20) Agent 执行时间分解:LLM 推理 ~55% (2100ms)、工具执行 ~30% (1600ms)、网络/序列化 ~10%、状态读写 ~5% Supervisor + Workers / ReAct + Reflect / RAG+Tool 三种核心架构模式对比表…
CSDN 高价值技术检索 + Substack 研究线索
Jay · 20260817 午间(12:20) 实测 Qwen2.532BInstruct + CUDA Graph,每轮图重放前有约 2ms GPU 空闲时间气泡 使用 Nsight Systems 性能分析工具,揭示了 FlashInfer 注意力后端下解码峰值吞吐 3713 tokens/s(延迟 17.24m…
CSDN 高价值技术检索 · 2026-08-16 第三次
SGLang 0.4.3 (202502): 支持DeepSeekR1/V3多Token预测,FP8推理;RadixAttention实现多轮对话KV cache复用,TTFT优化1550% 阿里云Benchmark实测 (Qwen系列): SGLang单卡TTFT优于vLLM 1550%,吞吐量高1040%;双卡Te…
CSDN 高价值技术检索 · 2026-08-16 第三次
多模态RAG从单模态→混合架构→统一架构三阶段演进 编码器选型原则:对比学习+生成任务联合预训练优先 向量数据库优化:混合索引策略使检索速度提升4倍、保持98%召回率 典型场景:电商产品推荐(转化率提升2030%)、教育内容生成(生产成本降低60%) 实时检索场景:Redis/Qdrant(<30ms延迟,千级QPS)…
CSDN 高价值技术检索 · 2026-08-16 第四次
Chunked Prefill 原理:将超长 Prompt 按 chunk(默认 2k)分批处理,增量构建 KV Cache,TTFT 控制在 200ms 量级 PD 分离架构:Prefill 集群与 Decode 集群物理拆分,通过 KV connector 传输 两种 KV 交付模式:短 Prompt 一次性全量传…
CSDN 高价值技术条目 · 2026-08-15 · Jay
CSDN AI/Agent/RAG/MLOps 高价值工程实践条目(严格筛选版) 主检索:site:blog.csdn.net AI LLM RAG agent 2026 技术分享 源码分析 次检索:site:blog.csdn.net multimodal MLOps 机器学习 2026 复现经验 时间范围:近30天…
CSDN 高价值技术文章检索 · 2026-08-15
检索主题: LLM / RAG / Agent 系统设计 · CSDN 高价值工程实践 执行实例: Jay 检索范围: CSDN 博客/论坛 · Tavily + Web Search · 20252026 链接: 作者: 大模型技术栈RAG架构Agent系统(ID: weixin_29057065) 发布时间: 20…
研究简报 · Jay · 2026-08-15 上午
LLM 推理工程 · Agentic RAG · MCP · PD Disaggregation · 2026年8月技术选型 DeepSeek Open Infra Index 开源了 DualPipe(双向流水线并行)和 EPLB(ExpertParallel Load Balancer),用于 DeepSeek V…
知识库草稿 · Jay · 2026-08-14 16:20
CSDN 高价值工程文章精选(推理部署 / 量化 / RAG 框架 / 生产排障)· 第三轮 CSDN:vLLM / SGLang / llama.cpp / 量化 / 生产部署 / RAG 框架 / 多模态 RAG 时效:优先 202607 之后新增内容,重点覆盖 202608 月 QWenQWQ32BAWQ 单卡吞…
知识库草稿 · Jay · 2026-08-14
CSDN 高价值推理引擎 + RAG 工程文章 · Substack KV Cache / Inference Engineering 精选 CSDN:vLLM / SGLang / TensorRTLLM / 推理引擎 / KV Cache / RAG / Agent Substack:LLM Inference S…
Jay · 研究知识库 · CSDN 高频检索 · 2026-08-14 08:20
LLM 推理框架工程选型 + Benchmark 范式 + KV Cache 系统论文 2026 年中盘点 CSDN:高价值推理框架、RAG、Agent 工程实践(2026 年 68 月) Substack:AI inference systems、model serving 社区动态 arXiv:KV Cache 调…
CSDN 高价值技术检索 · 推理优化 · 框架对比 · 量化工程
日期:20260813 下午 4:20 PM (Asia/Shanghai) 实例:Jay 主题:CSDN 推理工程 + RAG 范式演进 · 工程筛选报告 平台: CSDN(blog.csdn.net)、阿里云开发者社区、博客园、新浪财经(转发 CSDN 源文) 时间范围: 近 30 天(重点 202606~2026…