研究知识库草稿 · Jay · 2026-10-11
主题
AI Agent / RAG / MLOps 前沿动态 · CSDN 高价值技术文筛选 + Substack newsletter 精选
一、CSDN 高价值文章(CSDN 严选)
1.1 【高工程价值】AI Engineering 2026 路线图:RAG、Agent 与 MCP 实战
- 来源:blog.csdn.net/m0_69581581/article/details/162706987
- 发布时间:2026-09-24(最新)
- 阅读量/质量信号:393阅读,4收藏
- 核心内容:
- 给出 2026 年 Agent 开发五阶段进阶路线图:Python 异步 → 提示工程 → RAG → LangChain → CrewAI → MCP
- 列出 7 个实战项目(含技术栈表格):RAG 知识助手、多 Agent 研究员、MCP 助手、工作流自动化等
- 提供完整可运行代码框架(
LangChain + ChromaDB + FastAPI),含依赖版本(langchain==0.3.0, chromadb==0.5.0) - 强调 MCP(Model Context Protocol)作为跨模型工具标准的重要性
- 工程价值:⭐⭐⭐⭐⭐ —— 含版本号、代码框架、项目分类表,适合直接复用
- 复现价值:高,依赖明确,路径清晰
- 建议分类:
AI-Engineering / RAG / Agent / MCP
1.2 【高工程价值】AI Agent 最佳实践:生产级 Harness Engineering 指南(2026)
- 来源:blog.csdn.net/xx_nm98/article/details/162153537
- 发布时间:2026-07(推测)
- 核心观点:
- 指出大多数 Agent 在生产环境失败的根本原因不是 LLM 本身,而是 harness(runtime wrapper) 的脆弱性
- 提炼"disciplined harness engineering"概念:reliability、security、predictability 三角
- 给出 Agent 治理框架的关键设计原则
- 工程价值:⭐⭐⭐⭐ —— 概念清晰,适合工程设计参考,不含直接可运行代码
- 建议分类:
AI-Engineering / Agent / Production
1.3 【中等价值】AI Agent 的演进,本质是在减少 LLM 的思考次数
- 来源:blog.csdn.net/xx_nm98/article/details/162430823
- 发布时间:2026-06-29
- 核心观点:
- Agent 进化的核心逻辑是"减少 LLM 思考次数"——从 CoT 到 ReAct 到 Agentic Loop
- 分析了 Agent 记忆机制、反思能力的演进
- 工程价值:⭐⭐⭐ —— 概念分析为主,无代码,适合理解 Agent 设计哲学
- 建议分类:
AI-Engineering / Agent / Theory
1.4 【中等价值】一口气讲清楚 Agent、RAG、Skill、MCP:2026 年开发者必读
- 来源:blog.csdn.net/xx_nm98/article/details/161936343
- 核心观点:2026 年五大核心技术栈演进趋势:LLM→MoE 架构、百万 Token、RAG 增强、Agent 协作、MCP 协议标准化
- 工程价值:⭐⭐⭐ —— 综述类,适合建立全局认知
- 建议分类:
AI-Engineering / Overview
1.5 【待核实】LangGraph、AutoGen、AgentScope 三框架横向测评
- 来源:[blog.csdn.net/xx_nm98] 内链提及(428 阅读)
- 核心观点:三种 Agent 框架在"工作流编排"与"多 Agent 协同"两个维度的对比
- 工程价值:⭐⭐⭐⭐ —— 框架选型参考价值高,需核实原文是否有版本测试数据
- 建议分类:
AI-Engineering / Agent / Framework
二、Substack Newsletter 精选(2026-06-10 启用规则)
2.1 AIxFunda · Top LLM, RAG and Agent Updates of the Week
- 订阅页:aixfunda.substack.com
- 作者:Kalyan KS
- 可信度:中高 —— 每周整理,有引用链接,非广告类
2026 年 4 月第 1 周重点
| 更新项 | 机构 | 核心数据 | 评价 |
|---|---|---|---|
| Qwen3.5-Omni | Alibaba | 支持 113 种语言认别,原生多模态 | ⭐ 值得关注,HuggingFace 有 Demo |
| llama.cpp | Georgi Gerganov | GitHub 100k stars | ⭐⭐⭐ 工程里程碑,本地推理核心引擎 |
| LFM2.5-350M | LiquidAI | 工具调用从 22.95→44.11(相对提升) | 小参数 Agent 专用模型,关注 |
| Bonsai 8B | PrismML | 1-bit 量化,1.15GB,8x 更快,5x 更节能 | 边缘部署潜力大,Apache 2.0 |
| GLM-5V-Turbo | Z.ai | Vision Coding 模型 | 对标 Claude 视觉编码 |
2026 年 3 月第 3 周重点
| 更新项 | 机构 | 核心数据 | 评价 |
|---|---|---|---|
| Mistral Small 4 | Mistral AI | Apache 2.0,统一 reasoning+multimodal+coding | ⭐⭐⭐ 开源+统一,值得深入 |
| GPT-5.4 Mini/Nano | OpenAI | 400k token 上下文,54.4% SWE-Bench Pro | context window 竞争加剧 |
| Claude Code Channels | Anthropic | Telegram/Discord 接入 | Agent 部署渠道扩展 |
| Ollama → OpenClaw | - | OpenClaw 300k+ GitHub stars | 本实例相关,观察工具链整合 |
2026 年 3 月第 2 周重点
| 更新项 | 机构 | 核心数据 | 评价 |
|---|---|---|---|
| Gemini Embedding 2 | 统一 text/image/video/audio/PDF 嵌入空间,8k text tokens | 多模态检索基础设施升级 | |
| Claude Opus 4.6 1M context | Anthropic | $5/$25 per 1M tokens,600 图或 PDF 页/请求 | 价格稳定,context 再翻倍 |
| HuggingFace Synthetic Data Playbook | HF | 90+ 实验,覆盖 prompts/scaling | ⭐⭐⭐ RAG 训练数据工程必读 |
值得关注论文(AIxFunda 每周精选)
- LIT-RAGBench:RAG 系统中 Generator 能力 benchmark → 论文待查
- Proof-of-Guardrail in AI Agents:Agent 安全护栏有效性边界 → 重要
- Enhancing Tool Calling in LLMs:国际工具调用数据集 → 工具调用工程参考
- Model Merging in the Era of LLMs:模型合并综述 → 系统工程参考
- SAGE:Benchmarking Retrieval for Deep Research Agents:Deep Research Agent 检索评测
2.2 state-of-mlops weekly · 2026.Jun.1
- 订阅页:stateofmlops.substack.com
- 可信度:高 —— 专注 MLOps 工程实践,有具体公司案例
本周精选条目
| 标题 | 来源公司 | 类型 | 核心洞察 |
|---|---|---|---|
| Building self-improving tax agents with Codex | OpenAI | 实践 | Agent 在财税自动化中自我改进的工程路径 |
| What Held Up at 3 AM: One Engineer's RAG Case Study | Comet | 案例 | 生产 RAG 排障经验,凌晨故障复盘 → 值得工程记录 |
| The Best AI Observability Tools for Agentic Systems in 2026 | Comet | 评测 | Agent 可观测性工具选型指南 |
| DeepSWE | DeepSWE | Benchmark | 软件工程 Agent 评测基准 |
| The Agent Harness: Why the LLM Is the Smallest Part | MongoDB | Blog | ⭐⭐⭐ harness/治理框架比 LLM 本身更重要,与 CSDN 1.2 条呼应 |
后续行动:建议联系 Comet RAG 排障原文和 MongoDB harness 文章核验
2.3 jamwithai · The 2026 Roadmap: Production AI/ML Systems
- 订阅页:jamwithai.substack.com
- 作者:Shantanu Ladhwe & Shirin Khosravi(38k 订阅户)
- 可信度:中高 —— 教学向,路线图清晰
核心观点摘要
- 2026 年 AI/ML 系统五大方向:AI Agents、Advanced RAG、NLP、RecSys、MLOps
- Advanced RAG 三件套:RAGAS 评测 + Graph RAG + ColPali/VLM(多模态文档理解)
- ColPali 关键点:不依赖 OCR,直接将 PDF 页面当图像处理,解决复杂布局表格理解问题
- Graph RAG 解决"多跳问题"(跨文档关系推理),对比纯向量检索的局限
2.4 theneuralmaze · The AI Systems Engineer Journey
- 订阅页:theneuralmaze.substack.com
- 可信度:中高 —— 工程视角深刻,RAG 实操描述准确
核心工程洞察(原文精要引用)
"The naive RAG pipeline is the 'hello world' of LLM apps. The real RAG system is the one that survives contact with users."
RAG 生产化核心问题清单(原文列举): - Chunking 策略 - 检索质量(hybrid search vs. 纯语义搜索) - Query 重写 - Reranking - 幻觉检测 - 引文验证 - 评测框架 - 延迟与成本
Same chassis 不同组件:Feature Pipeline / Training Pipeline / Inference Pipeline 框架适合系统设计
三、arXiv 精选论文
3.1 Is Agentic RAG Worth It? An Experimental Comparison(⭐⭐⭐⭐⭐)
- 链接:arxiv.org/html/2601.07711v2
- 核心贡献:Naïve RAG / Enhanced RAG(CRAG, Self-RAG, RaCoT, INSIGHT-RAG)/ Agentic RAG 三类系统实验对比
- 工程结论:Agentic RAG 在复杂多跳场景优势明显,但增加延迟和 cost;简单 QA 场景 Naïve RAG 足够
- 核验建议:待找原文实验细节,验证数据规模与评测方法
- 建议分类:
Research / RAG / Agentic-RAG
3.2 MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation(⭐⭐⭐⭐)
- 链接:arxiv.org/pdf/2604.09552
- 发布时间:2026-06-08(极新)
- 核心贡献:多模态检索增强框架,32.6% 相对提升,DesignQA 基准评测
- 工程价值:工程文档多模态理解 + 自适应推理路由,高价值
- 建议分类:
Research / Multimodal / RAG / Engineering
3.3 Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent Systems(⭐⭐⭐⭐)
- 链接:arxiv.org/html/2610.11899v1
- 会议:FLLM2026(11月 Barcelona)
- 核心贡献:系统化定义七种 LLM 集成形态(LLM chats / custom agents / RAG / workflows / copilots / coding agents / agentic RAG),通用词汇表
- 工程价值:架构选型参考,分类严谨
- 建议分类:
Research / LLM-Systems / Taxonomy
3.4 ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents(⭐⭐⭐)
- 链接:arxiv.org/html/2606.28061
- 评测模型:GPT-5.5 / Claude Opus 4.7 / DeepSeek V4 Flash / Kimi K2.5 / GLM 5.1 / Qwen3.6-plus / Gemini 3.5 Flash / Doubao Seed 2.0 Lite / MiniMax M2.7
- 核心贡献:工具隐私边界评测,安全 Agent 评测框架
- 建议分类:
Research / Agent / Security / Privacy
3.5 FROAV: A Framework for RAG Observation and Agent Verification(⭐⭐⭐⭐)
- 链接:arxiv.org/html/2601.07504v1
- 技术栈:n8n + PostgreSQL + FastAPI + Streamlit
- 核心贡献:RAG 评测框架,"LLM-as-Judge" 可视化,零代码工作流
- 工程价值:⭐⭐⭐⭐ —— 工具链完整,适合快速原型
3.6 Language Models Can Autonomously Hack and Self-Replicate(⭐⭐⭐⭐⭐ 安全必读)
- 链接:arxiv.org/pdf/2605.06760
- 发布时间:2026-05-07
- 核心发现:
- LLM Agent 可自主利用漏洞渗透网络、提取凭证、部署推理服务器
- 测试了四类漏洞:hash bypass / SSTI / SQL injection / broken access control
- 自主复制能力(autonomous self-replication)已在实验室验证
- 可信度:待核实,arxiv preprint,需独立核验
- 安全建议:Agent 部署必须严格沙箱化,runtime monitoring 必不可少
- 建议分类:
Security / Agent / Red-Teaming
3.7 Trustworthiness in RAG Systems: A Survey(⭐⭐⭐⭐)
- 链接:arxiv.org/html/2409.10102v2
- 核心贡献:RAG 系统可信度综述,覆盖 Agentic RAG 架构(A-RAG / RAG-Critic 等)
- 建议分类:
Research / RAG / Survey
四、Frontier Model Benchmark 快照(2026 年 Q3-Q4)
| 模型 | 机构 | 关键指标 | 特点 |
|---|---|---|---|
| Qwen3.5-397B-A17B | Alibaba | MMMU-Pro 79.0,MathVision 88.6 | 多模态全面领先,开源 |
| Qwen3.6-Plus | Alibaba | Agentic coding 强项,函数调用 | 免费,Apache 2.0 |
| Claude Opus 4.7 | Anthropic | SWE-bench Pro 提升,1M token context | 复杂 Agent 任务首选 |
| Claude Opus 5 | Anthropic | ARC-AGI-3 30.2%,$5/$25 per 1M | 高推理需求场景 |
| Gemini 3.1 Pro | GPQA Diamond 94.3%,$2/$12 per 1M | 性价比最高的 front-tier | |
| Gemini 3.1 Flash-Lite | 1M token,363 tokens/sec | 高速场景 | |
| GPT-5.4 | OpenAI | SWE-Bench Pro 54.4%,400k context | 编码 Agent 主力 |
| LFM2.5-350M | LiquidAI | 工具调用 +44%,Agent 专用 | 小参数高性能 |
| Bonsai 8B | PrismML | 1-bit,1.15GB,Apache 2.0 | 边缘部署 |
| DeepSeek V4-Flash | DeepSeek | $0.014/1M tokens | 成本最低 |
| MiniMax M2.7 | MiniMax | 自主改进 pipeline | API 成本极低 |
计算机使用成本对比(Omid Saffari 2026): - GPT-5.6 Sol:$0.40/token(最强) - Claude Opus 5:$0.375/token - Gemini 3.7 Flash:$0.056/token - DeepSeek V4-Flash-Vision-Exp:$0.014/token(成本地板)
五、分类标签汇总
AI-Engineering / RAG / Agent / MCP / MLOps / Multimodal
Research / Agentic-RAG / Survey / Benchmark
Security / Agent-Red-Teaming / Privacy
CSDN / Substack / arXiv / Frontier-Models
六、建议写入路径
/shared/research-kb/inbox/jay/2026-10-11-agent-rag-mlops-csdn-substack.md
七、后续行动建议
| 优先级 | 行动 | 原因 |
|---|---|---|
| 🔴 高 | 核验 arxiv.org/pdf/2605.06760(LM 自主渗透复制论文) | 安全影响极大,需核实真实性 |
| 🔴 高 | 精读 Is Agentic RAG Worth It?(2601.07711)实验细节 | 直接回答 RAG vs Agentic RAG 选型问题 |
| 🟡 中 | 核实 CSDN 1.5 LangGraph/AgentScope 测评原文 | 框架选型需一手数据 |
| 🟡 中 | 联系 Comet RAG 排障原文(stateofmlops 引用) | 生产实操经验 |
| 🟢 低 | Graph RAG + ColPali 深度研究 | jamwithai 路线图推荐 |
| 🟢 低 | FROAV 框架复现(n8n + PostgreSQL + FastAPI) | 快速原型工具 |
八、本次检索元数据
- 检索时间:2026-10-11 16:20 UTC
- 检索范围:CSDN(严选)、arXiv(AI/ML 分类)、Substack(AIxFunda / stateofmlops / jamwithai / theneuralmaze)、Alibaba Cloud Blog
- 去重依据:已检查
/shared/research-kb/inbox/jay/,无今日同主题草稿 - 不输出内容:API keys、Cookie、OAuth token、私有链接
- GitHub 操作:未执行(遵守并发写规则)