知识库草稿 · Jay · 2026-07-01
主题
CSDN 高价值 AI/ML 技术分享 + Substack 精选(本周第 1 次检索)
一、CSDN 高价值条目
🔴 高价值(可直接入库)
1. vLLM vs Ollama 选型与 A10 卡实测对比
- URL: https://agent.csdn.net/6a3a4fd810ee7a33f281302c.html
- 标签:
vLLMOllama推理部署量化A10实测数据 - 作者: 煎饼果子寻秦记
- 发布时间: 2026-06(最新检索)
- 核心内容:
- 三框架实测 benchmark 表(含启动时间、首 Token 延迟、QPS、显存占用、热更新支持)
- 关键实测数据:
- Ollama: 首 Token 320±45ms, QPS 3.2, 显存 6.8GB
- vLLM: 首 Token 142±22ms, QPS 28.7, 显存 9.1GB
- TGI: 首 Token 168±31ms, QPS 24.3, 显存 10.2GB
- A10 卡关键调参:
--enforce-eager: A10 上 CUDA Graph 失败率>60%,关闭后延迟波动降 85%--max-num-seqs 128: A10 临界值,设 140 会导致 PagedAttention 内存池碎片化,QPS 反而降 12%--enable-chunked-prefill: A10 建议禁用
- Windows Docker + Ollama + Dify 路径问题:
http://host.docker.internal:11434在 WSL2 下需改为http://172.17.0.1:11434 - Ollama 必须监听
0.0.0.0而非127.0.0.1才能被 Docker 访问 - 工程价值: ⭐⭐⭐⭐⭐
- 复现价值: 高(真实硬件环境、参数对照表、避坑细节)
- 可信度: 高(具体命令+数值,有实测过程)
- 建议分类:
LLM推理部署vLLMOllamaBenchmark - 后续行动: 建议审稿入库,适合作为推理部署选型参考页的核心条目
2. AutoDL + LLaMA Factory 微调大模型完整记录(2026-05)
- URL: https://openeuler.csdn.net/6a1065fa662f9a54cb76692a.html
- 标签:
LLaMA-FactoryAutoDLLoRA微调API部署云GPU - 作者: cooldream2009
- 发布时间: 2026-05-22
- 核心内容:
- AutoDL 实例申请 → git clone --depth 1 → conda 环境 → 依赖安装全流程
- WebUI 启动:
python src/webui.py --server-name 0.0.0.0 --server-port 6006 - 浏览器访问
http://<服务器IP>:6006打开 LLaMA Factory WebUI - 模型选择: Qwen/Qwen2.5-0.5B-Instruct(含 HuggingFace URL)
- 数据集准备: JSONL 格式(instruction-input-output 三元组)
- 训练参数配置: 学习率、LoRA 秩值等核心超参
- API 服务部署:
vllm或 HuggingFace backend - 工程价值: ⭐⭐⭐⭐⭐
- 复现价值: 高(步骤完整,含真实 IP 和端口配置命令)
- 可信度: 高(有操作记录日期和版本)
- 建议分类:
LLM微调LLaMA-Factory云GPULoRA - 后续行动: 建议审稿入库,作为微调实战的命令参考
3. AI Agent Memory 全解析:十大框架拆解与性能实测(2026 新版)
- URL: https://opc.csdn.net/6a35e99f10ee7a33f28015c5.html
- 标签:
Agent MemoryMemGPTMem0MemTreeGraphRAGA-MEM - 作者: 耿直学编程
- 发布时间: 2026-05
- 核心内容:
- 核心问题: Claude Code 等工具"失忆"痛点,Mem0 GitHub 52.5k Stars 印证需求
- 十大框架横评: A-MEM、Zep(Graphiti)、MemoryBank、MemGPT、Mem0、MemoChat、MemoryOS、MemTree
- 统一框架: 用户消息→信息提取→记忆管理→记忆存储→信息检索→LLM 生成回复
- 关键性能结论:
- MemTree、MemOS(树状)、MemoryOS(分层)性能最优
- 保留原始消息 > 纯图三元组提取(Mem0 > Mem0ᵍ)
- 模型从 7B→72B,时间推理任务性能翻倍(MemoryOS、MemoChat)
- 现有方法普遍缺乏专门的时空信息处理组件
- MCP 记忆协议: MemSearch 已实现 Claude Code ↔ OpenClaw ↔ Codex CLI 跨客户端记忆共享
- 2027 预测: MCP 将成为 Agent Memory 互操作事实标准
- 工程价值: ⭐⭐⭐⭐⭐
- 复现价值: 高(有性能横评数据、框架对比表)
- 可信度: 高(技术社区,有代码框架拆解)
- 建议分类:
AgentMemoryMemGPTMem0GraphRAGMCP - 后续行动: 建议精读入库,适合作为 Agent Memory 主题页核心参考文献
4. 从 Dify、Coze、飞书、Obsidian 看 RAG 架构
- URL: https://gitcode.csdn.net/6a2e7fe3662f9a54cb7efce6.html
- 标签:
RAGDifyCoze飞书GraphRAGHybrid SearchRerankMultimodal RAG - 作者: Markland_l
- 发布时间: 2026-06-14(极新)
- 核心内容:
- Knowledge Pipeline: 文档解析→切片→Embedding→存入 Vector DB
- Hybrid Search: BM25 + Vector Search + Graph Search 混合
- Rerank: 重排序层
- Multimodal RAG: 文本+图像+音频跨模态检索
- Coze Agent Runtime 架构: User → Planner → Workflow → Tool → Knowledge → Memory → LLM
- GraphRAG 流程图: Documents → Knowledge Pipeline → Metadata Layer → Embedding Layer → Vector DB → Hybrid Retrieval → Rerank → ACL Layer → Agent Runtime
- 含简化混合检索代码示例
- ACL 权限模型(飞书/企业场景)
- 工程价值: ⭐⭐⭐⭐⭐
- 复现价值: 高(有代码示例和架构图)
- 可信度: 高(平台最新内容,对比维度全面)
- 建议分类:
RAGGraphRAGDifyCozeMultimodal架构 - 后续行动: 建议精读入库,RAG 架构主题页可引用
5. 2026 版 RAG 技术全解析(小白易懂+程序员复用)
- URL: https://gitcode.csdn.net/69f413b054b52172bc7117e0.html
- 标签:
RAGNaive RAGAdvanced RAGGraphRAGModular RAG向量数据库 - 作者: 学网安的喵桑
- 发布时间: 2026-05-01
- 核心内容:
- RAG 四代演进: Naive RAG → Advanced RAG → GraphRAG → Modular RAG
- 核心原理: 检索→生成,检索器+生成器协同
- 向量数据库选型: FAISS、Chroma、Milvus、Pinecone、Weaviate
- Embedding 模型、检索引擎(BM25/DPR/ANCE)、提示生成器
- 挑战与解决方案: 检索相关性、计算资源、知识库质量、信息冗余、复杂查询
- 2026 趋势: 多模态 RAG、自适应检索、端到端训练、个性化生成
- 宝兰德 AI 智慧助手内置 RAG 实战案例
- 工程价值: ⭐⭐⭐⭐
- 复现价值: 中(框架概述,但含工具选型表)
- 可信度: 中(偏综合概述,非源码或实测)
- 建议分类:
RAG向量数据库GraphRAGModular RAG - 后续行动: 可入库作为 RAG 综述参考,但建议搭配上述 Dify/Coze 实战文一起归档
6. 小白程序员入门大模型:LLM→Agent 完整解析(RAG 与 MCP 协议)
- URL: https://mcp.csdn.net/6a2e38e9662f9a54cb7ece8d.html
- 标签:
LLMRAGMCPAgentPrompt EngineeringLangChainHuggingFace - 作者: 耿直学编程
- 发布时间: 2026(最新)
- 核心内容:
- Transformer 架构详解(自注意力、多头注意力、位置编码、FFN、残差连接)
- LLM 能力与局限性分析
- RAG 流程: 数据索引(离线)+ 检索生成(在线)
- LangChain、LlamaIndex、FAISS、ChromaDB 工具链
- MCP(Model Context Protocol): Anthropic 推出的模型与外部工具/数据统一通信协议
- AI Agent 四步闭环: 感知→推理规划→行动→观察反思
- 开发环境搭建命令:
python -m venv ai_env、pip install langchain/chromadb/faiss-cpu - Prompt 工程最佳实践
- 工程价值: ⭐⭐⭐⭐
- 复现价值: 高(有命令、有代码框架)
- 可信度: 中高(技术博客,结构完整)
- 建议分类:
LLMRAGMCPAgentLangChainHuggingFace - 后续行动: 可入库,适合作为 MCP/Agent 入门参考页
🟡 中等价值(参考性入库)
7. 2026 年大模型微调框架全景指南
- URL: https://gitcode.csdn.net/69c0a6ab0a2f6a37c5997e34.html
- 标签:
微调框架LLaMA-FactoryUnslothAxolotlTRLPEFTTorchTune - 核心内容: 框架全景对比表,含加速技术(FlashAttention-2、Unsloth、Liger Kernel)、适用场景对照
- 评价: 工具选型参考价值高,但缺少实测数据;适合作为框架调研索引
- 工程价值: ⭐⭐⭐
- 建议分类:
LLM微调框架选型 - 后续行动: 参考性入库
二、Substack 精选
🔴 高价值(研究洞察来源)
1. AIX Fun Da - Top LLM/RAG/Agent Updates (April Week 1, 2026)
- URL: https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2
- 作者: AIX Fun Da Newsletter
- 发布时间: 2026-04(第 1 周)
- 核心观点:
- Qwen3.5-Omni: 阿里发布原生多模态模型,擅长实时交互和音视频任务
- LFM2.5-350M (LiquidAI): 350M 参数,专为 Agentic Loop、数据提取、工具调用优化,在 28T tokens 上训练
- PrismML Bonsai 8B: 1-bit 量化语言模型(bonsai 架构)
- Qwen3.6-Plus: 1M token 上下文窗口,原生多模态理解
- 可信度: 高(行业 newsletter,有具体模型规格)
- 建议: 关注 Qwen3.5-Omni 和 Qwen3.6-Plus 发布动态,需进一步核验论文
2. AIX Fun Da - Top LLM/RAG/Agent Updates (March Week 3, 2026)
- URL: https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-192
- 发布时间: 2026-03(第 3 周)
- 核心观点:
- Ollama 成为 OpenClaw 官方 Provider(本任务相关)
- Moonshot AI Attention Residuals: 高效训练新方法
- Mistral Small 4: 首个统一推理+多模态+代码的单一模型(Magi→Mistral Small 4)
- GPT-5.4 Mini & Nano: OpenAI 针对快速任务优化
- Claude Code Channels: Anthropic 发布 Telegram 和 Discord 集成
- Colab Enterprise Runtimes: 企业级运行时进入 Colab
- 可信度: 高
- 建议: OpenClaw+Ollama 集成值得进一步核验官方文档
3. Future AGI - LLM Evaluation Tools 2026 Comparison
- URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
- 作者: Future AGI
- 发布时间: 2026-01/06
- 核心观点:
- Top 5 评估平台: Future AGI、Galileo、Arize、MLflow、Patronus AI
- Future AGI: 全流程评估,支持多模态评估(文本+图像+音频+视频)
- Galileo Evaluate: GenAI Studio 模块,提供质量/准确性/安全性指标
- 评估维度: 幻觉检测、回答相关性、F1/BLEU、毒性、安全性
- RAG 评估: 上下文相关性、答案准确性、答案相关性、忠诚度
- 可信度: 中(平台官方 newsletter,有商业倾向)
- 建议: 适合作为 Agent/LLM 评估工具选型参考;建议交叉核验第三方评测
4. Gradient Flow - RAG Reimagined: 5 Breakthroughs
- URL: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
- 作者: Ben Lorica(Gradient Flow)
- 核心观点:
- 推理模型+推理时计算 将 RAG 从静态管道变为动态自适应系统
- LanceDB v2: 高效处理 AI/ML 工作负载,支持向量嵌入和多模态数据,改善多模态 RAG 检索速度
- Snowflake AI Research: 即使专用模型在模糊/不充分检索上下文时仍面临挑战
- RAG 可靠性提升方向: 推理时计算 + 自适应检索
- 可信度: 高(Ben Lorica 是知名 ML/AI 评论人)
- 建议: 值得精读,关注 LanceDB v2 与多模态 RAG 的结合
三、检索元数据
- 检索时间: 2026-07-01 08:20 (UTC+8)
- 检索范围: CSDN (csdn.net/gitcode.csdn.net/opc.csdn.net/agent.csdn.net/mcp.csdn.net/openeuler.csdn.net/devpress.csdn.net) + Substack (aixfunda, futureagi, gradientflow, jamwithai, packtdatapro1)
- CSDN 命中数: ~40 条(去重后保留 7 条)
- Substack 命中数: ~8 条(保留 4 条)
- 过滤掉: AtomGit/openEuler 泛化学习路线文(无实测数据/无源码/无命令)
四、分类标签
vLLM Ollama LLaMA-Factory LoRA QLoRA 微调 推理部署 A10 Agent Memory MemGPT Mem0 MemTree MCP RAG GraphRAG Multimodal RAG Dify Coze Agent LLM Rerank Hybrid Search Benchmark
五、建议写入路径
主草稿: /shared/research-kb/inbox/jay/2026-07-01-csdn-vllm-llamafactory-agent-memory-substack.md
六、优先级建议
| 条目 | 建议操作 |
|---|---|
| vLLM vs Ollama A10 实测 (条目1) | 精读入库 → 推理部署主题页核心参考 |
| AutoDL + LLaMA Factory 完整记录 (条目2) | 精读入库 → 微调实战命令参考 |
| AI Agent Memory 全解析 (条目3) | 精读入库 → Agent Memory 主题页核心文献 |
| Dify/Coze RAG 架构对比 (条目4) | 精读入库 → RAG 架构主题页 |
| RAG 技术全解析 (条目5) | 参考性入库 → RAG 综述 |
| LLM→Agent 完整解析 (条目6) | 参考性入库 → MCP/Agent 入门参考 |
| 微调框架全景 (条目7) | 参考性入库 → 框架选型索引 |
| AIX Fun Da Substack | 关注 Qwen3.5-Omni/Qwen3.6-Plus 论文 |
| Gradient Flow RAG Reimagined | 精读 → RAG 演进趋势研判 |
| Future AGI LLM Evaluation | 参考性 → 评估工具选型 |
七、主题页更新建议
- 推理部署主题页: 纳入条目 1(vLLM vs Ollama A10 实测数据表),更新工具选型表
- Agent Memory 主题页: 纳入条目 3(十大框架横评表),作为 2026 年年中更新
- RAG 主题页: 纳入条目 4(Dify/Coze 架构对比图),更新 GraphRAG 流程图
- 微调主题页: 纳入条目 2(LLaMA Factory + AutoDL 完整命令链)