知识库草稿 · Jay · 2026-10-03
主题
CSDN 高价值 AI/LLM/Agent 技术检索(每日第三次 · 补充覆盖)
检索范围
site:csdn.netLLM RAG Agent 技术实现教程(2026)site:csdn.net多模态大模型架构分析(2026)site:csdn.netvLLM PagedAttention 推理优化(2026)site:csdn.netLoRA QLoRA 微调实战(2026)
高价值条目
H1 · AI Agent 开发技术完全学习指南(2026-07 基线版)
- URL: https://agent.csdn.net/6a52fd2f662f9a54cb8e8279.html
- 作者: jasonma1210(AI Agent技术社区)
- 可信度: 高 · AI Agent技术社区认证专栏,含版本标注"2026-07 基线版"
- 核心内容:
- GraphRAG 完整流程:Chunking(600 tokens) → Entity抽取 → KG构建 → Leiden社区检测 → Community Summary → DRIFT推理
- 真实成本对比表:传统RAG $0.01/1K docs vs 全GraphRAG $5-10 vs LazyGraphRAG $0.005-0.05
- 反馈埋点采集配置(telemetry.yaml),含显式/隐式信号分离、合规去标识化
- LLM记忆抽取坑点:haiku做抽取(不用opus)、事件触发+定时兜底避免全量写入
- 实战复盘(MJ Nexus OS项目):全量写记忆导致+800ms延迟,改事件触发后写入成本降70%
- 工程价值: ⭐⭐⭐⭐⭐ · 含生产级配置示例、成本对比表、真实排障案例
- 版本/环境: 标注基线版2026-07,含LLaMA-Factory/LangGraph工具链
- 标签: #GraphRAG #Agent记忆体系 #LazyGraphRAG #生产工程 #反馈飞轮
- 建议: 精读·重点参考GraphRAG成本选型与记忆写入触发器设计
H2 · 多模态大模型技术演进全解析(2026)
- URL: https://damodev.csdn.net/699fbc7954b52172bc5db645.html
- 作者: datian1234(DAMO开发者矩阵)
- 可信度: 高 · DAMO开发者矩阵机构号,系统性综述文章
- 核心内容:
- ViT→CLIP→LLaVA/BLIP-2架构演进路径
- OpenVLA双视觉编码器设计:DINOv2(低层次几何)+ SigLIP(高层次语义)融合
- 动作表示:7维机器人动作→256区间离散化→Next Token Prediction
- LLaMA系列作为MLLM骨干的生态分析(LLaMA→LLaMA2→LLaMA3)
- 2026年主流开源MLLM架构路线图
- 工程价值: ⭐⭐⭐⭐ · 架构演进梳理完整,模块职责清晰
- 版本/环境: 2026年版本,含LLaMA/LLaVA/Janus/VITA-1.5等具体模型
- 标签: #多模态架构 #OpenVLA #LLaMA生态 #视觉编码器 #具身智能
- 建议: 审稿·适合作为多模态架构综述存档
H3 · vLLM推理优化实战(2026-09-15)
- URL: https://blog.csdn.net/shuijing55hi/article/details/165098970
- 作者: shuijing55hi
- 可信度: 中高 · 2026-09-15发布,较新;标题含"实战"
- 核心内容:
- PagedAttention分块存储逻辑(固定大小块+虚拟映射+页表)
- 从PagedAttention到量化部署全链路
- 显存利用率从40%→80%+的优化路径
- 工程价值: ⭐⭐⭐⭐ · 时效性强(2026-09),主题明确
- 版本/环境: 含vLLM版本上下文
- 标签: #vLLM #PagedAttention #推理优化 #量化部署
- 建议: 精读·vLLM量化实战参考
H4 · vLLM:大模型推理加速的核心技术与实践
- URL: https://bbs.csdn.net/weixin_31062533/article/details/100229010
- 可信度: 高 · CC 4.0 BY-SA协议,结构完整,含代码示例
- 核心内容:
- PagedAttention三要素:分块存储+按需加载+虚拟映射
- 显存利用率提升至80%+,支持超显存模型运行
- 代码示例:PagedAttention核心实现逻辑(Python类)
- 连续批次处理(Continuous Batching)提升吞吐
- 工程价值: ⭐⭐⭐⭐ · 含代码、可视化原理说明、量化数据
- 版本/环境: 2026-07版本,含PyTorch/FastAPI生态
- 标签: #vLLM #PagedAttention #ContinuousBatching #推理引擎
- 建议: 精读·代码级理解PagedAttention机制
H5 · 大模型微调实战:从LoRA原理到生产级工作流
- URL: https://bbs.csdn.net/weixin_32487557/article/details/100264626
- 可信度: 高 · CC 4.0 BY-SA协议,知乎/Andrew Ng课程体系背书
- 核心内容:
- LoRA原理深度解析:Why+When而非仅How
- 与DeepLearning.AI《大语言模型微调》专项课程体系对齐
- 生产级工作流:数据质量验证→超参设计→评估体系
- 三流派对比表:LoRA-X / QLoRA / GSOP
- 工程价值: ⭐⭐⭐⭐ · 方法论层面扎实,避免"工具党"通病
- 版本/环境: 2026-08,含Qwen/LLaMA/LlamaIndex
- 标签: #LoRA #QLoRA #微调方法论 #生产工作流 #PEFT
- 建议: 精读·微调方法论参考,避免唯工具论
H6 · LoRA / QLoRA:低秩更新、量化和显存预算
- URL: https://blog.csdn.net/weixin_44369324/article/details/164099020
- 系列: 开源AI论文复现实验与代码解读
- 可信度: 高 · 明确标注"论文复现实验与代码解读"系列,2026-08-26发布
- 核心内容:
- LoRA低秩更新原理解析
- QLoRA量化与显存预算关联分析
- 代码级解读
- 工程价值: ⭐⭐⭐⭐ · 论文复现系列,有代码、可复现
- 版本/环境: 2026-08,系列第某期
- 标签: #LoRA #QLoRA #论文复现 #显存优化
- 建议: 精读·适合LoRA/QLoRA代码级理解
H7 · 多模态大模型架构设计与视频生成技术解析
- URL: https://bbs.csdn.net/weixin_33525298/article/details/100229696
- 可信度: 高 · CC 4.0,2026-07-26,模块化系统架构详解
- 核心内容:
- 模块化系统设计:剧本生成→视觉设计→动画生成→音频合成→后期合成
- 跨模态注意力机制、共享表征空间、联合训练目标
- 视频生成技术演进:Stable Diffusion→可控生成→多模态统一建模
- GPT-5/DeepSeek V3.1/Grok-4架构推测(统一多模态Transformer+专用适配器)
- NeRF/3D Gaussian Splatting三维内容生成
- 工程价值: ⭐⭐⭐⭐ · 跨模态系统架构有价值,附前沿模型架构推测
- 标签: #多模态系统 #视频生成 #NeRF #架构设计
- 建议: 审稿·多模态生成系统架构参考
H8 · 2026年AI Agent实用指南(别再把RAG和Workflow叫成Agent)
- URL: https://adg.csdn.net/6a60d3d410ee7a33f29173b2.html
- 可信度: 中高 · 智能体开发者社区,定义论证严谨
- 核心内容:
- AI Agent严格四标准定义:①维护显式结构化状态 ②基于状态选择行动 ③预算约束 ④安全恢复/降级
- 批判"工具增强聊天应用"冒充Agent的混淆现象
- Structured Output + Pydantic AI校验实践
- max_steps/预算约束生产级示例
- 工程价值: ⭐⭐⭐⭐ · 定义边界清晰,适合技术决策者区分真Agent vs 假Agent
- 标签: #Agent定义 #生产工程 #StructuredOutput #PydanticAI
- 建议: 精读·Agent选型判断标准
次高价值条目(MEDIUM)
M1 · H100上vLLM推理优化:p95延迟降低Serving配置实战
- URL: https://bbs.csdn.net/weixin_34116482/article/details/100271120
- 可信度: 中 · 硬件特定调优,含PagedAttention/连续批处理机制解析
- 内容: vLLM性能评估体系、vLLM后端级深度集成路径
- 工程价值: ⭐⭐⭐ · H100专项调优参考
M2 · LoRA微调实战:从原理到Qwen3.5全流程部署
- URL: https://blog.csdn.net/Lvyizhuo/article/details/163922791
- 可信度: 中 · 含RoPE重置、LoRA合并避坑、QLoRA生产妥协方案
- 工程价值: ⭐⭐⭐ · Qwen3.5全流程,可复现路径
M3 · LoRA/QLoRA微调实战:单卡显存优化与问题排查
- URL: https://bbs.csdn.net/weixin_29173777/article/details/100286051
- 可信度: 中 · QLoRA核心参数(r值/lora_alpha/target_modules)配置方法
- 工程价值: ⭐⭐⭐ · 显存优化实战参考
过滤条目(LOW · 不建议入库)
- ❌ 2026年AI Agent开发完整学习路线(llwszx版):纯学习路线概述,无代码/无版本/无工程细节
- ❌ AI Agent开发关键点解析(xxue345678版):概览性质,无深度
- ❌ 2026年视觉大模型技术发展分析(SaturnCloud版):内容极少,仅标题占位
- ❌ 最新125种多模态大模型技术全面综述(m0_59164520版):2025年旧文,综述类不适合知识库
分类标签汇总
- #RAG(H1): GraphRAG / LazyGraphRAG / Agentic RAG / CAG对比
- #Agent(H1,H8): 严格定义 / 记忆体系 / 反馈飞轮 / 多Agent
- #多模态(H2,H7): 架构演进 / OpenVLA / 视频生成 / NeRF
- #推理优化(H3,H4,M1): vLLM / PagedAttention / 连续批处理 / 量化
- #微调(H5,H6,M2,M3): LoRA / QLoRA / PEFT / 显存优化
- #生产工程(H1,H5,H8): 成本选型 / 评估体系 / 预算约束 / 安全恢复
建议写入路径
/shared/research-kb/inbox/jay/2026-10-03-csdn-llm-agent-rag-inference.md
后续行动
- 精读优先:H1(GraphRAG成本对比+记忆写入设计)、H5(LoRA方法论)、H8(Agent严格定义)
- 审稿建议:H2(多模态架构综述)、H7(跨模态系统架构)
- 代码核验:H4(vLLM PagedAttention代码)、H6(LoRA论文复现代码)——建议比对原论文验证
- 时效追踪:H3(2026-09最新)vLLM文章需确认与上游版本一致性