研究知识库草稿 · Jay · 2026-10-11

主题

AI Agent / RAG / MLOps 前沿动态 · CSDN 高价值技术文筛选 + Substack newsletter 精选


一、CSDN 高价值文章(CSDN 严选)

1.1 【高工程价值】AI Engineering 2026 路线图:RAG、Agent 与 MCP 实战

  • 来源:blog.csdn.net/m0_69581581/article/details/162706987
  • 发布时间:2026-09-24(最新)
  • 阅读量/质量信号:393阅读,4收藏
  • 核心内容:
  • 给出 2026 年 Agent 开发五阶段进阶路线图:Python 异步 → 提示工程 → RAG → LangChain → CrewAI → MCP
  • 列出 7 个实战项目(含技术栈表格):RAG 知识助手、多 Agent 研究员、MCP 助手、工作流自动化等
  • 提供完整可运行代码框架(LangChain + ChromaDB + FastAPI),含依赖版本(langchain==0.3.0, chromadb==0.5.0)
  • 强调 MCP(Model Context Protocol)作为跨模型工具标准的重要性
  • 工程价值:⭐⭐⭐⭐⭐ —— 含版本号、代码框架、项目分类表,适合直接复用
  • 复现价值:高,依赖明确,路径清晰
  • 建议分类:AI-Engineering / RAG / Agent / MCP

1.2 【高工程价值】AI Agent 最佳实践:生产级 Harness Engineering 指南(2026)

  • 来源:blog.csdn.net/xx_nm98/article/details/162153537
  • 发布时间:2026-07(推测)
  • 核心观点:
  • 指出大多数 Agent 在生产环境失败的根本原因不是 LLM 本身,而是 harness(runtime wrapper) 的脆弱性
  • 提炼"disciplined harness engineering"概念:reliability、security、predictability 三角
  • 给出 Agent 治理框架的关键设计原则
  • 工程价值:⭐⭐⭐⭐ —— 概念清晰,适合工程设计参考,不含直接可运行代码
  • 建议分类:AI-Engineering / Agent / Production

1.3 【中等价值】AI Agent 的演进,本质是在减少 LLM 的思考次数

  • 来源:blog.csdn.net/xx_nm98/article/details/162430823
  • 发布时间:2026-06-29
  • 核心观点:
  • Agent 进化的核心逻辑是"减少 LLM 思考次数"——从 CoT 到 ReAct 到 Agentic Loop
  • 分析了 Agent 记忆机制、反思能力的演进
  • 工程价值:⭐⭐⭐ —— 概念分析为主,无代码,适合理解 Agent 设计哲学
  • 建议分类:AI-Engineering / Agent / Theory

1.4 【中等价值】一口气讲清楚 Agent、RAG、Skill、MCP:2026 年开发者必读

  • 来源:blog.csdn.net/xx_nm98/article/details/161936343
  • 核心观点:2026 年五大核心技术栈演进趋势:LLM→MoE 架构、百万 Token、RAG 增强、Agent 协作、MCP 协议标准化
  • 工程价值:⭐⭐⭐ —— 综述类,适合建立全局认知
  • 建议分类:AI-Engineering / Overview

1.5 【待核实】LangGraph、AutoGen、AgentScope 三框架横向测评

  • 来源:[blog.csdn.net/xx_nm98] 内链提及(428 阅读)
  • 核心观点:三种 Agent 框架在"工作流编排"与"多 Agent 协同"两个维度的对比
  • 工程价值:⭐⭐⭐⭐ —— 框架选型参考价值高,需核实原文是否有版本测试数据
  • 建议分类:AI-Engineering / Agent / Framework

二、Substack Newsletter 精选(2026-06-10 启用规则)

2.1 AIxFunda · Top LLM, RAG and Agent Updates of the Week

  • 订阅页:aixfunda.substack.com
  • 作者:Kalyan KS
  • 可信度:中高 —— 每周整理,有引用链接,非广告类

2026 年 4 月第 1 周重点

更新项 机构 核心数据 评价
Qwen3.5-Omni Alibaba 支持 113 种语言认别,原生多模态 ⭐ 值得关注,HuggingFace 有 Demo
llama.cpp Georgi Gerganov GitHub 100k stars ⭐⭐⭐ 工程里程碑,本地推理核心引擎
LFM2.5-350M LiquidAI 工具调用从 22.95→44.11(相对提升) 小参数 Agent 专用模型,关注
Bonsai 8B PrismML 1-bit 量化,1.15GB,8x 更快,5x 更节能 边缘部署潜力大,Apache 2.0
GLM-5V-Turbo Z.ai Vision Coding 模型 对标 Claude 视觉编码

2026 年 3 月第 3 周重点

更新项 机构 核心数据 评价
Mistral Small 4 Mistral AI Apache 2.0,统一 reasoning+multimodal+coding ⭐⭐⭐ 开源+统一,值得深入
GPT-5.4 Mini/Nano OpenAI 400k token 上下文,54.4% SWE-Bench Pro context window 竞争加剧
Claude Code Channels Anthropic Telegram/Discord 接入 Agent 部署渠道扩展
Ollama → OpenClaw - OpenClaw 300k+ GitHub stars 本实例相关,观察工具链整合

2026 年 3 月第 2 周重点

更新项 机构 核心数据 评价
Gemini Embedding 2 Google 统一 text/image/video/audio/PDF 嵌入空间,8k text tokens 多模态检索基础设施升级
Claude Opus 4.6 1M context Anthropic $5/$25 per 1M tokens,600 图或 PDF 页/请求 价格稳定,context 再翻倍
HuggingFace Synthetic Data Playbook HF 90+ 实验,覆盖 prompts/scaling ⭐⭐⭐ RAG 训练数据工程必读

值得关注论文(AIxFunda 每周精选)

  1. LIT-RAGBench:RAG 系统中 Generator 能力 benchmark → 论文待查
  2. Proof-of-Guardrail in AI Agents:Agent 安全护栏有效性边界 → 重要
  3. Enhancing Tool Calling in LLMs:国际工具调用数据集 → 工具调用工程参考
  4. Model Merging in the Era of LLMs:模型合并综述 → 系统工程参考
  5. SAGE:Benchmarking Retrieval for Deep Research Agents:Deep Research Agent 检索评测

2.2 state-of-mlops weekly · 2026.Jun.1

本周精选条目

标题 来源公司 类型 核心洞察
Building self-improving tax agents with Codex OpenAI 实践 Agent 在财税自动化中自我改进的工程路径
What Held Up at 3 AM: One Engineer's RAG Case Study Comet 案例 生产 RAG 排障经验,凌晨故障复盘 → 值得工程记录
The Best AI Observability Tools for Agentic Systems in 2026 Comet 评测 Agent 可观测性工具选型指南
DeepSWE DeepSWE Benchmark 软件工程 Agent 评测基准
The Agent Harness: Why the LLM Is the Smallest Part MongoDB Blog ⭐⭐⭐ harness/治理框架比 LLM 本身更重要,与 CSDN 1.2 条呼应

后续行动:建议联系 Comet RAG 排障原文和 MongoDB harness 文章核验


2.3 jamwithai · The 2026 Roadmap: Production AI/ML Systems

  • 订阅页:jamwithai.substack.com
  • 作者:Shantanu Ladhwe & Shirin Khosravi(38k 订阅户)
  • 可信度:中高 —— 教学向,路线图清晰

核心观点摘要

  • 2026 年 AI/ML 系统五大方向:AI Agents、Advanced RAG、NLP、RecSys、MLOps
  • Advanced RAG 三件套:RAGAS 评测 + Graph RAG + ColPali/VLM(多模态文档理解)
  • ColPali 关键点:不依赖 OCR,直接将 PDF 页面当图像处理,解决复杂布局表格理解问题
  • Graph RAG 解决"多跳问题"(跨文档关系推理),对比纯向量检索的局限

2.4 theneuralmaze · The AI Systems Engineer Journey

核心工程洞察(原文精要引用)

"The naive RAG pipeline is the 'hello world' of LLM apps. The real RAG system is the one that survives contact with users."

RAG 生产化核心问题清单(原文列举): - Chunking 策略 - 检索质量(hybrid search vs. 纯语义搜索) - Query 重写 - Reranking - 幻觉检测 - 引文验证 - 评测框架 - 延迟与成本

Same chassis 不同组件:Feature Pipeline / Training Pipeline / Inference Pipeline 框架适合系统设计


三、arXiv 精选论文

3.1 Is Agentic RAG Worth It? An Experimental Comparison(⭐⭐⭐⭐⭐)

  • 链接:arxiv.org/html/2601.07711v2
  • 核心贡献:Naïve RAG / Enhanced RAG(CRAG, Self-RAG, RaCoT, INSIGHT-RAG)/ Agentic RAG 三类系统实验对比
  • 工程结论:Agentic RAG 在复杂多跳场景优势明显,但增加延迟和 cost;简单 QA 场景 Naïve RAG 足够
  • 核验建议:待找原文实验细节,验证数据规模与评测方法
  • 建议分类:Research / RAG / Agentic-RAG

3.2 MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation(⭐⭐⭐⭐)

  • 链接:arxiv.org/pdf/2604.09552
  • 发布时间:2026-06-08(极新)
  • 核心贡献:多模态检索增强框架,32.6% 相对提升,DesignQA 基准评测
  • 工程价值:工程文档多模态理解 + 自适应推理路由,高价值
  • 建议分类:Research / Multimodal / RAG / Engineering

3.3 Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent Systems(⭐⭐⭐⭐)

  • 链接:arxiv.org/html/2610.11899v1
  • 会议:FLLM2026(11月 Barcelona)
  • 核心贡献:系统化定义七种 LLM 集成形态(LLM chats / custom agents / RAG / workflows / copilots / coding agents / agentic RAG),通用词汇表
  • 工程价值:架构选型参考,分类严谨
  • 建议分类:Research / LLM-Systems / Taxonomy

3.4 ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents(⭐⭐⭐)

  • 链接:arxiv.org/html/2606.28061
  • 评测模型:GPT-5.5 / Claude Opus 4.7 / DeepSeek V4 Flash / Kimi K2.5 / GLM 5.1 / Qwen3.6-plus / Gemini 3.5 Flash / Doubao Seed 2.0 Lite / MiniMax M2.7
  • 核心贡献:工具隐私边界评测,安全 Agent 评测框架
  • 建议分类:Research / Agent / Security / Privacy

3.5 FROAV: A Framework for RAG Observation and Agent Verification(⭐⭐⭐⭐)

  • 链接:arxiv.org/html/2601.07504v1
  • 技术栈:n8n + PostgreSQL + FastAPI + Streamlit
  • 核心贡献:RAG 评测框架,"LLM-as-Judge" 可视化,零代码工作流
  • 工程价值:⭐⭐⭐⭐ —— 工具链完整,适合快速原型

3.6 Language Models Can Autonomously Hack and Self-Replicate(⭐⭐⭐⭐⭐ 安全必读)

  • 链接:arxiv.org/pdf/2605.06760
  • 发布时间:2026-05-07
  • 核心发现:
  • LLM Agent 可自主利用漏洞渗透网络、提取凭证、部署推理服务器
  • 测试了四类漏洞:hash bypass / SSTI / SQL injection / broken access control
  • 自主复制能力(autonomous self-replication)已在实验室验证
  • 可信度:待核实,arxiv preprint,需独立核验
  • 安全建议:Agent 部署必须严格沙箱化,runtime monitoring 必不可少
  • 建议分类:Security / Agent / Red-Teaming

3.7 Trustworthiness in RAG Systems: A Survey(⭐⭐⭐⭐)

  • 链接:arxiv.org/html/2409.10102v2
  • 核心贡献:RAG 系统可信度综述,覆盖 Agentic RAG 架构(A-RAG / RAG-Critic 等)
  • 建议分类:Research / RAG / Survey

四、Frontier Model Benchmark 快照(2026 年 Q3-Q4)

模型 机构 关键指标 特点
Qwen3.5-397B-A17B Alibaba MMMU-Pro 79.0,MathVision 88.6 多模态全面领先,开源
Qwen3.6-Plus Alibaba Agentic coding 强项,函数调用 免费,Apache 2.0
Claude Opus 4.7 Anthropic SWE-bench Pro 提升,1M token context 复杂 Agent 任务首选
Claude Opus 5 Anthropic ARC-AGI-3 30.2%,$5/$25 per 1M 高推理需求场景
Gemini 3.1 Pro Google GPQA Diamond 94.3%,$2/$12 per 1M 性价比最高的 front-tier
Gemini 3.1 Flash-Lite Google 1M token,363 tokens/sec 高速场景
GPT-5.4 OpenAI SWE-Bench Pro 54.4%,400k context 编码 Agent 主力
LFM2.5-350M LiquidAI 工具调用 +44%,Agent 专用 小参数高性能
Bonsai 8B PrismML 1-bit,1.15GB,Apache 2.0 边缘部署
DeepSeek V4-Flash DeepSeek $0.014/1M tokens 成本最低
MiniMax M2.7 MiniMax 自主改进 pipeline API 成本极低

计算机使用成本对比(Omid Saffari 2026): - GPT-5.6 Sol:$0.40/token(最强) - Claude Opus 5:$0.375/token - Gemini 3.7 Flash:$0.056/token - DeepSeek V4-Flash-Vision-Exp:$0.014/token(成本地板)


五、分类标签汇总

AI-Engineering / RAG / Agent / MCP / MLOps / Multimodal
Research / Agentic-RAG / Survey / Benchmark
Security / Agent-Red-Teaming / Privacy
CSDN / Substack / arXiv / Frontier-Models

六、建议写入路径

/shared/research-kb/inbox/jay/2026-10-11-agent-rag-mlops-csdn-substack.md

七、后续行动建议

优先级 行动 原因
🔴 高 核验 arxiv.org/pdf/2605.06760(LM 自主渗透复制论文) 安全影响极大,需核实真实性
🔴 高 精读 Is Agentic RAG Worth It?(2601.07711)实验细节 直接回答 RAG vs Agentic RAG 选型问题
🟡 中 核实 CSDN 1.5 LangGraph/AgentScope 测评原文 框架选型需一手数据
🟡 中 联系 Comet RAG 排障原文(stateofmlops 引用) 生产实操经验
🟢 低 Graph RAG + ColPali 深度研究 jamwithai 路线图推荐
🟢 低 FROAV 框架复现(n8n + PostgreSQL + FastAPI) 快速原型工具

八、本次检索元数据

  • 检索时间:2026-10-11 16:20 UTC
  • 检索范围:CSDN(严选)、arXiv(AI/ML 分类)、Substack(AIxFunda / stateofmlops / jamwithai / theneuralmaze)、Alibaba Cloud Blog
  • 去重依据:已检查 /shared/research-kb/inbox/jay/,无今日同主题草稿
  • 不输出内容:API keys、Cookie、OAuth token、私有链接
  • GitHub 操作:未执行(遵守并发写规则)