研究草稿 · Jay · 2026-07-27 早间

主题

LLM Fine-tuning / RAG / Agent 系统近期技术动态(CSDN + Substack + arXiv)

检索范围

  • CSDN: LLM微调、RLHF实战、RAG架构、Agentic RAG、多模态部署(近30天)
  • Substack: AIxFunda、FutureAGI、Outcome School(2026年3月-7月)
  • arXiv: cs.CL/AI/LG(2026年7月最新)

CSDN 高价值条目

1. LLM微调 / RLHF

条目1:大模型微调实战:bitsandbytes GPU支持缺失的排查与修复指南 - URL: https://blog.csdn.net/weixin_29061465/article/details/162388769 - 标签: LLM微调 bitsandbytes GPU排查 复现 - 评价: 聚焦LoRA与RLHF生产级实践,覆盖环境锁定、数据构造、秩(r)选型。bitsandbytes GPU支持问题排查具有工程复现价值。 - 精读建议: ⭐⭐⭐(工程排障参考)

条目2:RLHF实战:PPO调参与分布式训练优化技巧 - URL: https://blog.csdn.net/weixin_29035147/article/details/163124751 - 标签: RLHF PPO调参 分布式训练 生产级 - 评价: 模拟面试形式覆盖PPO算法调参、分布式训练陷阱、奖励模型设计等工业级挑战。有源码分析和真实踩坑经验。 - 精读建议: ⭐⭐⭐(RLHF工程落地参考)

条目3:NEFTune技术解析:噪声增强微调提升大模型泛化能力 - URL: https://blog.csdn.net/weixin_32487557/article/details/163146093 - 标签: NEFTune 指令微调 泛化 微调技巧 - 评价: 噪声增强微调技术解析,训练数据表现优异但真实场景泛化困境的解决方案。学术+工程结合。 - 精读建议: ⭐⭐(技术原理参考)

条目4:大模型微调实战:从LoRA到RLHF的工业级策略指南 - URL: https://blog.csdn.net/weixin_29088655/article/details/163150183 - 标签: LoRA RLHF 工业级策略 SFT - 评价: 围绕业务语义的工业级微调策略,非简单调参。适合垂直领域LLM应用开发者。 - 精读建议: ⭐⭐(策略框架参考)

2. RAG 系统

条目5:RAG 在线工作流:从用户提问到可信答案的完整工程链路 - URL: https://blog.csdn.net/m0_59164520/article/details/162464873 - 时间: 2026-06-30 - 标签: RAG 工程链路 数据层 检索层 生成层 - 评价: 完整工程链路解析,数据层(知识库预处理)、检索层、生成层三层架构。含实战代码及技术对比。 - 精读建议: ⭐⭐⭐(RAG系统设计参考)

条目6:企业级LLM应用数据防篡改实战:从RAG架构到离线部署安全 - URL: https://blog.csdn.net/lishuai05251986/article/details/83907941 - 标签: RAG 数据安全 防篡改 离线部署 - 评价: 结合文档解析、向量化、RAG的完整应用,数据安全视角。含源码链接。 - 精读建议: ⭐⭐⭐(企业RAG安全架构参考)

条目7:RAG技术解析:大语言模型与知识检索的融合应用 - URL: https://blog.csdn.net/weixin_31458015/article/details/163093526 - 时间: 2026-07-08 - 标签: Agentic RAG 智能体化检索 多源信息整合 - 评价: Agentic RAG(智能体化检索增强)是当前最前沿演进方向,系统能主动判断何时检索、检索什么、如何整合多源信息。与传统机械式检索形成对比。 - 精读建议: ⭐⭐⭐(Agentic RAG趋势参考)

条目8:RAG系统架构解析与实战:从原理到生产部署 - URL: https://blog.csdn.net/weixin_29043895/article/details/163093832 - 标签: RAG架构 生产部署 原理 - 评价: RAG系统架构解析与生产部署实战,结合多篇白皮书(如寻汇与万事达卡2026年白皮书)的分析框架。 - 精读建议: ⭐⭐(架构参考)

3. 多模态与部署

条目9:多模态大模型实战18 - 全栈开发流程 - URL: https://blog.csdn.net/samsung_samsung/article/details/163149225 - 标签: 多模态 全栈开发 VLM 图像生成 RAG Agent 部署 - 评价: 完整多模态智能助手项目全栈开发流程:需求→架构→实现→部署,整合VLM、图像生成、语音处理、RAG、Agent。 - 精读建议: ⭐⭐⭐(多模态全栈项目参考)

条目10:NVIDIA AI加速实战营 - TensorRT-LLM应用部署和最佳实践 - URL: https://blog.csdn.net/Black_Rock_br/article/details/144102876 - 标签: TensorRT-LLM NVIDIA 推理部署 量化 多卡部署 - 评价: TensorRT-LLM全流程:模型转换(bf.convert_checkpoint.py/quantize.py) → trtlm-build生成TensorRT引擎 → C++/Python API二次开发。多卡部署、量化方法均有覆盖。 - 精读建议: ⭐⭐⭐(推理部署工程参考)

条目11:whichllm:用真实Benchmark而非参数量找硬件适配模型 - URL: https://blog.csdn.net/design1985/article/details/163158926 - 标签: LLM选择 Benchmark 本地部署 硬件适配 - 评价: 本地部署LLM的思维定势破除:显存装得下的最大模型≠最好选择。评分来源包括LiveBench、Artificial Analysis、Aider、Multimodal/Vision。 - 精读建议: ⭐⭐(LLM部署选型参考)


Substack 高价值条目

1. AIxFunda - Top LLM, RAG and Agent Updates(2026年3月-6月,每周更新)

2026年6月(最新)

日期 核心条目 标签 值得精读
Jun W3 Ollama成为OpenClaw官方Provider;Attention Residuals(Moonshot AI);Mistral Small 4(统一Magistral+Pixtral+Devstral);GPT-5.4 Mini/Nano Ollama Attention Residuals Mistral GPT-5.4 ⭐⭐⭐
Jun W2 Hugging Face Synthetic Data Playbook(90+实验);Gemini Embedding 2(多模态统一向量空间);Claude 100万token上下文 HuggingFace SyntheticData Gemini Claude ⭐⭐⭐
Jun W1 Qwen3.5 Small Models(0.8B~9B,手机端运行);GPT-5.3 Instant(幻觉率降低26.8%);Gemini 3.1 Flash-Lite(100万token,$0.25/M);Ai2 Olmo Hybrid 7B Qwen3.5 GPT-5.3 Gemini Olmo ⭐⭐⭐
May W4 Mistral Voxtral TTS(4B参数,<100ms延迟,9语言);Cohere Transcribe(14语言,525分钟/分钟GPU);GLM-5.1编程接近Claude Opus TTS ASR Cohere GLM-5.1 ⭐⭐⭐
May W3 Google Lyria 3 Pro(音乐生成,3分钟结构感知);Ai2 MolmoWeb(视觉Web Agent,4B/8B);Z.ai GLM-5V-Turbo(Design2Code 94.8%) 音乐生成 WebAgent VisionCoding ⭐⭐⭐
May W1 llama.cpp达10万GitHub星;LiquidAI LFM2.5-350M(350M参数,强化学习);PrismML Bonsai 8B(1-bit,1.15GB,8x快);Qwen3.6-Plus(1M token) llama.cpp LiquidAI Bonsai Qwen3.6 ⭐⭐⭐

评价: AIxFunda是高质量LLM/RAG/Agent周更Newsletter,覆盖模型发布、benchmark更新、开源工具。内容精炼,每条附原始链接。适合快速跟踪LLM生态进展。

原文链接示例: - https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-c14 (Mar W2) - https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2 (Apr W1)

2. FutureAGI - LLM Evaluation Tools Guide(2026)

The Complete Guide to LLM Evaluation Tools in 2026 - URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation - 标签: LLM评估 RAG评估 Agent评估 Benchmark - 核心观点: - Future AGI: 全模态评估(文本/图像/音频/视频),无ground truth自动评估,生产一致性确定性评估 - Galileo: 模块化平台,内置guardrails,实时安全监控,RAG/Agent工作流自定义指标 - Arize AI: 企业平台,专精幻觉检测、QA、相关性评估,强可观测性 - MLflow: 开源统一评估,覆盖RAG指标,多指标跟踪,社区活跃 - Agent as a Judge: 多步AI Agent + CoT推理做输出评估 - Deterministic Eval: 规则驱动,严格格式和标准遵循 - 多模态评估(文本/图像/音频/视频),AI评AI无需ground truth,实时Guardrailing支持动态标准更新 - 评价: 系统梳理2026年主流LLM评估工具链,适合MLOps工程师选型参考。 - 可信度: 中高(行业工具对比,非学术论文) - 精读建议: ⭐⭐⭐(评估工具选型参考)

3. Outcome School - AI Agent, Memory, ReAct, RAG, Multi-Agent

URL: https://outcomeschool.substack.com/p/ai-agent-memory-react-rag-multi-agent - 标签: AI Agent Memory ReAct RAG Multi-Agent - 核心观点: - RAG硬问题失效的诊断和替代方案 - Multi-Agent三要素:专业Agent + 通信方式 + 协调机制 - 常见角色:Orchestrator、Worker、Router、Planner、Critic、Tool Specialist - 3种通信模式、5种协调模式 - 诚实评估:大多数"multi-agent"场景实际不需要multi-agent,始于单一Agent - 评价: 实践导向的Agent系统去魅文章,对multi-agent的过度炒作有清醒认识。 - 可信度: 中(实践总结,非严格评估) - 精读建议: ⭐⭐(Agent架构决策参考)


arXiv 近期论文(2026年7月)

1. Isolation as a First-Class Principle for LLM-Agent System Security

  • arXiv: https://arxiv.org/html/2607.12406v1
  • 时间: 2026-07
  • 标签: LLM Agent 安全 隔离 权限分离
  • 核心观点:
  • LLM Agent从研究原型走向真实系统(Codex、Claude Code、OpenClaw等)
  • 核心安全思路:解耦大脑与手(decouple the brain from the hands)
  • 相关工作:Managed agents、AgentVisor、CaMeL-style设计、Parallax、Privilege separation
  • 新防御方向:FATH、Spotlighting、Task Shield、AgentSentry(时序因果诊断)、AttriGuard(因果归因)、TrustRAG(可信证据选择)
  • 系统环境边界安全:未来依赖更强通用拒绝 → 更好因果溯源
  • 评价: LLM-Agent安全领域重要综述,梳理隔离作为一等公民的安全设计原则。
  • 可信度: 高(arXiv预印本,引用大量2025-2026年工作)
  • 精读建议: ⭐⭐⭐(Agent安全必读)

2. Skills That Don't Exist: A Large-Scale Study of Hallucinated Tool Attacks

  • arXiv: https://arxiv.org/html/2607.12340v1
  • 时间: 2026-07
  • 标签: Agent安全 工具幻觉 攻击 Skill推荐
  • 核心观点:
  • Agent Skills生态系统的独特攻击面:恶意逻辑可嵌入skill文档操控Agent行为
  • 攻击模型:武器化LLM的持久幻觉,主动引导受害者下载恶意skills
  • 相关工作:Skill文档注入(Qu et al.)、已安装恶意module风险(数据泄露、伪装)
  • 防御方向:结构化查询分离、偏好优化、执行隔离
  • 评价: 揭示Agent生态系统的幻觉驱动攻击新向量,与传统prompt injection不同。
  • 可信度: 高(arXiv,有系统性攻击评估)
  • 精读建议: ⭐⭐⭐(Agent安全必读)

3. End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

  • arXiv: https://arxiv.org/html/2607.06964v1
  • 时间: 2026-07
  • 标签: RAG Agent 多模态 垂直领域 eVTOL
  • 核心观点:
  • FRAMe系统:基于自然语言偏好的eVTOL飞行计划生成
  • 多模态Coach Agent + RAG-based Memory
  • 四模型消融:o3-mini、o4-mini、GPT-5.4、DeepSeek-R1
  • Coach提供的非冗余有效性提升:RAG+Coach > 仅RAG
  • 评价: RAG在垂直领域(航空)实际部署的案例研究,工程细节丰富。
  • 可信度: 高(arXiv,有benchmark对比)
  • 精读建议: ⭐⭐⭐(RAG垂直应用参考)

4. Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

  • arXiv: https://arxiv.org/html/2607.13370v1
  • 时间: 2026-07
  • 标签: RAG 教育 Agentic RAG 跨课程扩展
  • 核心观点:
  • LEA系统:RAG+知识组件(KC)模型的AI辅导Agent(Chat/Tutor/Quiz三种模式)
  • 首次真实课堂部署(n=8,CMP511)+ 跨三课程扩展性验证
  • 发现模拟与真实学生表现的差异(模拟预测与实际分歧)
  • RAG架构比传统静态导师在课程特定内容 grounding 上更优
  • 评价: RAG+Agent在教育领域少有的真实课堂验证研究,有别于纯模拟。
  • 可信度: 高(arXiv,有真实部署数据)
  • 精读建议: ⭐⭐⭐(RAG教育应用参考)

5. FinanceComplexQA: Benchmarking Agentic Reasoning on Finance

  • arXiv: https://arxiv.org/html/2607.19238v1
  • 时间: 2026-07
  • 标签: Agentic Reasoning 金融 Benchmark RAG MCP
  • 核心观点:
  • 评估Agentic AI在真实金融场景中的表现
  • 现有金融QA基准仅覆盖窄任务(表格QA、数值提取、短上下文检索)
  • 相关工具:RAG系统、Model Context Protocol (MCP)工具、Agentic Reasoning工具
  • 评价: 金融领域Agentic AI评估基准,填补长程推理+工具调用评估空白。
  • 可信度: 高(arXiv,Benchmark论文)
  • 精读建议: ⭐⭐(金融AI应用参考)

6. Agents in the Wild: Where Research Meets Deployment

  • arXiv: https://arxiv.org/html/2607.19336v1
  • 时间: 2026-07
  • 标签: Agent系统 安全评估 Benchmark 科学Agent
  • 核心观点:
  • AI Agent从研究到部署的完整survey
  • 生命科学领域:FutureHouse ether0、Robin(超人类分子设计);Moderna与OpenAI合作750+ Agent应用
  • 新评估方向:动态行为中心评估框架(可靠性+安全性)
  • Benchmark:AgentSafetyBench、ST-WebAgentBench、DeepTrace、Agent Security Bench
  • 定向攻击与防御评估
  • 评价: Agent系统的全面survey,涵盖research与deployment差距、安全评估框架。
  • 可信度: 高(arXiv,综合性survey)
  • 精读建议: ⭐⭐⭐(Agent全景参考)

7. Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

  • arXiv: https://arxiv.org/html/2607.18826v1
  • 时间: 2026-07
  • 标签: Agent安全 跨Agent攻击 Prompt Injection
  • 核心观点:
  • 大多数Agent安全研究假设本地决策或显式交互结构
  • 新攻击面:跨独立Agent的异步攻击链接(latent adversary)
  • 防御评估:DataSentinel、PromptShield、AgentSentry、WASP、DRIFT、AgentAuditor等
  • A2FV方法在所有5个攻击维度上表现最优
  • 评价: 跨Agent攻击链接的前沿研究,超越单Agent安全评估。
  • 可信度: 高(arXiv,有系统性攻防评估)
  • 精读建议: ⭐⭐⭐(Agent安全进阶)

分类标签汇总

类别 标签
微调 LLM微调 LoRA RLHF QLoRA AWQ NEFTune SFT
RAG RAG Agentic RAG 知识库 多模态检索 Rerank
Agent AI Agent Multi-Agent ReAct MCP A2A
推理部署 TensorRT-LLM vLLM SGLang Ollama 量化 投机解码
安全 Agent安全 Prompt Injection 工具幻觉 权限分离
评估 LLM评估 RAG评估 Benchmark Agent as a Judge
多模态 VLM 视觉Agent TTS ASR 音乐生成
垂直应用 金融 教育 航空 科学发现

建议写入路径

/shared/research-kb/inbox/jay/2026-07-27-csdn-substack-rag-finetuning-llm-jul2026.md


后续行动建议

  1. 精读优先级: - AIxFunda newsletter 持续跟踪(每周更新) - arXiv: 2607.12406(Agent隔离安全)和 2607.12340(工具幻觉攻击)优先 - CSDN: bitsandbytes GPU排查 + RLHF PPO调参 工程价值高

  2. 主题页更新建议: - 新增 Agentic RAG 标签页(已有内容积累) - 新增 LLM安全/Agent安全 标签页(arXiv条目增加) - 更新 RAG垂直应用 页面(航空+教育案例)

  3. 待核验项: - Substack AIxFunda 的具体模型benchmark数据需核验官方发布 - GLM-5.1编程接近Claude Opus(45.3 vs 47.9)需核验论文