研究草稿 · Jay · 2026-07-27 早间
主题
LLM Fine-tuning / RAG / Agent 系统近期技术动态(CSDN + Substack + arXiv)
检索范围
- CSDN: LLM微调、RLHF实战、RAG架构、Agentic RAG、多模态部署(近30天)
- Substack: AIxFunda、FutureAGI、Outcome School(2026年3月-7月)
- arXiv: cs.CL/AI/LG(2026年7月最新)
CSDN 高价值条目
1. LLM微调 / RLHF
条目1:大模型微调实战:bitsandbytes GPU支持缺失的排查与修复指南
- URL: https://blog.csdn.net/weixin_29061465/article/details/162388769
- 标签: LLM微调 bitsandbytes GPU排查 复现
- 评价: 聚焦LoRA与RLHF生产级实践,覆盖环境锁定、数据构造、秩(r)选型。bitsandbytes GPU支持问题排查具有工程复现价值。
- 精读建议: ⭐⭐⭐(工程排障参考)
条目2:RLHF实战:PPO调参与分布式训练优化技巧
- URL: https://blog.csdn.net/weixin_29035147/article/details/163124751
- 标签: RLHF PPO调参 分布式训练 生产级
- 评价: 模拟面试形式覆盖PPO算法调参、分布式训练陷阱、奖励模型设计等工业级挑战。有源码分析和真实踩坑经验。
- 精读建议: ⭐⭐⭐(RLHF工程落地参考)
条目3:NEFTune技术解析:噪声增强微调提升大模型泛化能力
- URL: https://blog.csdn.net/weixin_32487557/article/details/163146093
- 标签: NEFTune 指令微调 泛化 微调技巧
- 评价: 噪声增强微调技术解析,训练数据表现优异但真实场景泛化困境的解决方案。学术+工程结合。
- 精读建议: ⭐⭐(技术原理参考)
条目4:大模型微调实战:从LoRA到RLHF的工业级策略指南
- URL: https://blog.csdn.net/weixin_29088655/article/details/163150183
- 标签: LoRA RLHF 工业级策略 SFT
- 评价: 围绕业务语义的工业级微调策略,非简单调参。适合垂直领域LLM应用开发者。
- 精读建议: ⭐⭐(策略框架参考)
2. RAG 系统
条目5:RAG 在线工作流:从用户提问到可信答案的完整工程链路
- URL: https://blog.csdn.net/m0_59164520/article/details/162464873
- 时间: 2026-06-30
- 标签: RAG 工程链路 数据层 检索层 生成层
- 评价: 完整工程链路解析,数据层(知识库预处理)、检索层、生成层三层架构。含实战代码及技术对比。
- 精读建议: ⭐⭐⭐(RAG系统设计参考)
条目6:企业级LLM应用数据防篡改实战:从RAG架构到离线部署安全
- URL: https://blog.csdn.net/lishuai05251986/article/details/83907941
- 标签: RAG 数据安全 防篡改 离线部署
- 评价: 结合文档解析、向量化、RAG的完整应用,数据安全视角。含源码链接。
- 精读建议: ⭐⭐⭐(企业RAG安全架构参考)
条目7:RAG技术解析:大语言模型与知识检索的融合应用
- URL: https://blog.csdn.net/weixin_31458015/article/details/163093526
- 时间: 2026-07-08
- 标签: Agentic RAG 智能体化检索 多源信息整合
- 评价: Agentic RAG(智能体化检索增强)是当前最前沿演进方向,系统能主动判断何时检索、检索什么、如何整合多源信息。与传统机械式检索形成对比。
- 精读建议: ⭐⭐⭐(Agentic RAG趋势参考)
条目8:RAG系统架构解析与实战:从原理到生产部署
- URL: https://blog.csdn.net/weixin_29043895/article/details/163093832
- 标签: RAG架构 生产部署 原理
- 评价: RAG系统架构解析与生产部署实战,结合多篇白皮书(如寻汇与万事达卡2026年白皮书)的分析框架。
- 精读建议: ⭐⭐(架构参考)
3. 多模态与部署
条目9:多模态大模型实战18 - 全栈开发流程
- URL: https://blog.csdn.net/samsung_samsung/article/details/163149225
- 标签: 多模态 全栈开发 VLM 图像生成 RAG Agent 部署
- 评价: 完整多模态智能助手项目全栈开发流程:需求→架构→实现→部署,整合VLM、图像生成、语音处理、RAG、Agent。
- 精读建议: ⭐⭐⭐(多模态全栈项目参考)
条目10:NVIDIA AI加速实战营 - TensorRT-LLM应用部署和最佳实践
- URL: https://blog.csdn.net/Black_Rock_br/article/details/144102876
- 标签: TensorRT-LLM NVIDIA 推理部署 量化 多卡部署
- 评价: TensorRT-LLM全流程:模型转换(bf.convert_checkpoint.py/quantize.py) → trtlm-build生成TensorRT引擎 → C++/Python API二次开发。多卡部署、量化方法均有覆盖。
- 精读建议: ⭐⭐⭐(推理部署工程参考)
条目11:whichllm:用真实Benchmark而非参数量找硬件适配模型
- URL: https://blog.csdn.net/design1985/article/details/163158926
- 标签: LLM选择 Benchmark 本地部署 硬件适配
- 评价: 本地部署LLM的思维定势破除:显存装得下的最大模型≠最好选择。评分来源包括LiveBench、Artificial Analysis、Aider、Multimodal/Vision。
- 精读建议: ⭐⭐(LLM部署选型参考)
Substack 高价值条目
1. AIxFunda - Top LLM, RAG and Agent Updates(2026年3月-6月,每周更新)
2026年6月(最新)
| 日期 | 核心条目 | 标签 | 值得精读 |
|---|---|---|---|
| Jun W3 | Ollama成为OpenClaw官方Provider;Attention Residuals(Moonshot AI);Mistral Small 4(统一Magistral+Pixtral+Devstral);GPT-5.4 Mini/Nano | Ollama Attention Residuals Mistral GPT-5.4 |
⭐⭐⭐ |
| Jun W2 | Hugging Face Synthetic Data Playbook(90+实验);Gemini Embedding 2(多模态统一向量空间);Claude 100万token上下文 | HuggingFace SyntheticData Gemini Claude |
⭐⭐⭐ |
| Jun W1 | Qwen3.5 Small Models(0.8B~9B,手机端运行);GPT-5.3 Instant(幻觉率降低26.8%);Gemini 3.1 Flash-Lite(100万token,$0.25/M);Ai2 Olmo Hybrid 7B | Qwen3.5 GPT-5.3 Gemini Olmo |
⭐⭐⭐ |
| May W4 | Mistral Voxtral TTS(4B参数,<100ms延迟,9语言);Cohere Transcribe(14语言,525分钟/分钟GPU);GLM-5.1编程接近Claude Opus | TTS ASR Cohere GLM-5.1 |
⭐⭐⭐ |
| May W3 | Google Lyria 3 Pro(音乐生成,3分钟结构感知);Ai2 MolmoWeb(视觉Web Agent,4B/8B);Z.ai GLM-5V-Turbo(Design2Code 94.8%) | 音乐生成 WebAgent VisionCoding |
⭐⭐⭐ |
| May W1 | llama.cpp达10万GitHub星;LiquidAI LFM2.5-350M(350M参数,强化学习);PrismML Bonsai 8B(1-bit,1.15GB,8x快);Qwen3.6-Plus(1M token) | llama.cpp LiquidAI Bonsai Qwen3.6 |
⭐⭐⭐ |
评价: AIxFunda是高质量LLM/RAG/Agent周更Newsletter,覆盖模型发布、benchmark更新、开源工具。内容精炼,每条附原始链接。适合快速跟踪LLM生态进展。
原文链接示例: - https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-c14 (Mar W2) - https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2 (Apr W1)
2. FutureAGI - LLM Evaluation Tools Guide(2026)
The Complete Guide to LLM Evaluation Tools in 2026
- URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
- 标签: LLM评估 RAG评估 Agent评估 Benchmark
- 核心观点:
- Future AGI: 全模态评估(文本/图像/音频/视频),无ground truth自动评估,生产一致性确定性评估
- Galileo: 模块化平台,内置guardrails,实时安全监控,RAG/Agent工作流自定义指标
- Arize AI: 企业平台,专精幻觉检测、QA、相关性评估,强可观测性
- MLflow: 开源统一评估,覆盖RAG指标,多指标跟踪,社区活跃
- Agent as a Judge: 多步AI Agent + CoT推理做输出评估
- Deterministic Eval: 规则驱动,严格格式和标准遵循
- 多模态评估(文本/图像/音频/视频),AI评AI无需ground truth,实时Guardrailing支持动态标准更新
- 评价: 系统梳理2026年主流LLM评估工具链,适合MLOps工程师选型参考。
- 可信度: 中高(行业工具对比,非学术论文)
- 精读建议: ⭐⭐⭐(评估工具选型参考)
3. Outcome School - AI Agent, Memory, ReAct, RAG, Multi-Agent
URL: https://outcomeschool.substack.com/p/ai-agent-memory-react-rag-multi-agent
- 标签: AI Agent Memory ReAct RAG Multi-Agent
- 核心观点:
- RAG硬问题失效的诊断和替代方案
- Multi-Agent三要素:专业Agent + 通信方式 + 协调机制
- 常见角色:Orchestrator、Worker、Router、Planner、Critic、Tool Specialist
- 3种通信模式、5种协调模式
- 诚实评估:大多数"multi-agent"场景实际不需要multi-agent,始于单一Agent
- 评价: 实践导向的Agent系统去魅文章,对multi-agent的过度炒作有清醒认识。
- 可信度: 中(实践总结,非严格评估)
- 精读建议: ⭐⭐(Agent架构决策参考)
arXiv 近期论文(2026年7月)
1. Isolation as a First-Class Principle for LLM-Agent System Security
- arXiv: https://arxiv.org/html/2607.12406v1
- 时间: 2026-07
- 标签:
LLM Agent安全隔离权限分离 - 核心观点:
- LLM Agent从研究原型走向真实系统(Codex、Claude Code、OpenClaw等)
- 核心安全思路:解耦大脑与手(decouple the brain from the hands)
- 相关工作:Managed agents、AgentVisor、CaMeL-style设计、Parallax、Privilege separation
- 新防御方向:FATH、Spotlighting、Task Shield、AgentSentry(时序因果诊断)、AttriGuard(因果归因)、TrustRAG(可信证据选择)
- 系统环境边界安全:未来依赖更强通用拒绝 → 更好因果溯源
- 评价: LLM-Agent安全领域重要综述,梳理隔离作为一等公民的安全设计原则。
- 可信度: 高(arXiv预印本,引用大量2025-2026年工作)
- 精读建议: ⭐⭐⭐(Agent安全必读)
2. Skills That Don't Exist: A Large-Scale Study of Hallucinated Tool Attacks
- arXiv: https://arxiv.org/html/2607.12340v1
- 时间: 2026-07
- 标签:
Agent安全工具幻觉攻击Skill推荐 - 核心观点:
- Agent Skills生态系统的独特攻击面:恶意逻辑可嵌入skill文档操控Agent行为
- 攻击模型:武器化LLM的持久幻觉,主动引导受害者下载恶意skills
- 相关工作:Skill文档注入(Qu et al.)、已安装恶意module风险(数据泄露、伪装)
- 防御方向:结构化查询分离、偏好优化、执行隔离
- 评价: 揭示Agent生态系统的幻觉驱动攻击新向量,与传统prompt injection不同。
- 可信度: 高(arXiv,有系统性攻击评估)
- 精读建议: ⭐⭐⭐(Agent安全必读)
3. End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent
- arXiv: https://arxiv.org/html/2607.06964v1
- 时间: 2026-07
- 标签:
RAGAgent多模态垂直领域eVTOL - 核心观点:
- FRAMe系统:基于自然语言偏好的eVTOL飞行计划生成
- 多模态Coach Agent + RAG-based Memory
- 四模型消融:o3-mini、o4-mini、GPT-5.4、DeepSeek-R1
- Coach提供的非冗余有效性提升:RAG+Coach > 仅RAG
- 评价: RAG在垂直领域(航空)实际部署的案例研究,工程细节丰富。
- 可信度: 高(arXiv,有benchmark对比)
- 精读建议: ⭐⭐⭐(RAG垂直应用参考)
4. Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System
- arXiv: https://arxiv.org/html/2607.13370v1
- 时间: 2026-07
- 标签:
RAG教育Agentic RAG跨课程扩展 - 核心观点:
- LEA系统:RAG+知识组件(KC)模型的AI辅导Agent(Chat/Tutor/Quiz三种模式)
- 首次真实课堂部署(n=8,CMP511)+ 跨三课程扩展性验证
- 发现模拟与真实学生表现的差异(模拟预测与实际分歧)
- RAG架构比传统静态导师在课程特定内容 grounding 上更优
- 评价: RAG+Agent在教育领域少有的真实课堂验证研究,有别于纯模拟。
- 可信度: 高(arXiv,有真实部署数据)
- 精读建议: ⭐⭐⭐(RAG教育应用参考)
5. FinanceComplexQA: Benchmarking Agentic Reasoning on Finance
- arXiv: https://arxiv.org/html/2607.19238v1
- 时间: 2026-07
- 标签:
Agentic Reasoning金融BenchmarkRAGMCP - 核心观点:
- 评估Agentic AI在真实金融场景中的表现
- 现有金融QA基准仅覆盖窄任务(表格QA、数值提取、短上下文检索)
- 相关工具:RAG系统、Model Context Protocol (MCP)工具、Agentic Reasoning工具
- 评价: 金融领域Agentic AI评估基准,填补长程推理+工具调用评估空白。
- 可信度: 高(arXiv,Benchmark论文)
- 精读建议: ⭐⭐(金融AI应用参考)
6. Agents in the Wild: Where Research Meets Deployment
- arXiv: https://arxiv.org/html/2607.19336v1
- 时间: 2026-07
- 标签:
Agent系统安全评估Benchmark科学Agent - 核心观点:
- AI Agent从研究到部署的完整survey
- 生命科学领域:FutureHouse ether0、Robin(超人类分子设计);Moderna与OpenAI合作750+ Agent应用
- 新评估方向:动态行为中心评估框架(可靠性+安全性)
- Benchmark:AgentSafetyBench、ST-WebAgentBench、DeepTrace、Agent Security Bench
- 定向攻击与防御评估
- 评价: Agent系统的全面survey,涵盖research与deployment差距、安全评估框架。
- 可信度: 高(arXiv,综合性survey)
- 精读建议: ⭐⭐⭐(Agent全景参考)
7. Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- arXiv: https://arxiv.org/html/2607.18826v1
- 时间: 2026-07
- 标签:
Agent安全跨Agent攻击Prompt Injection - 核心观点:
- 大多数Agent安全研究假设本地决策或显式交互结构
- 新攻击面:跨独立Agent的异步攻击链接(latent adversary)
- 防御评估:DataSentinel、PromptShield、AgentSentry、WASP、DRIFT、AgentAuditor等
- A2FV方法在所有5个攻击维度上表现最优
- 评价: 跨Agent攻击链接的前沿研究,超越单Agent安全评估。
- 可信度: 高(arXiv,有系统性攻防评估)
- 精读建议: ⭐⭐⭐(Agent安全进阶)
分类标签汇总
| 类别 | 标签 |
|---|---|
| 微调 | LLM微调 LoRA RLHF QLoRA AWQ NEFTune SFT |
| RAG | RAG Agentic RAG 知识库 多模态检索 Rerank |
| Agent | AI Agent Multi-Agent ReAct MCP A2A |
| 推理部署 | TensorRT-LLM vLLM SGLang Ollama 量化 投机解码 |
| 安全 | Agent安全 Prompt Injection 工具幻觉 权限分离 |
| 评估 | LLM评估 RAG评估 Benchmark Agent as a Judge |
| 多模态 | VLM 视觉Agent TTS ASR 音乐生成 |
| 垂直应用 | 金融 教育 航空 科学发现 |
建议写入路径
/shared/research-kb/inbox/jay/2026-07-27-csdn-substack-rag-finetuning-llm-jul2026.md
后续行动建议
-
精读优先级: - AIxFunda newsletter 持续跟踪(每周更新) - arXiv:
2607.12406(Agent隔离安全)和2607.12340(工具幻觉攻击)优先 - CSDN: bitsandbytes GPU排查 + RLHF PPO调参 工程价值高 -
主题页更新建议: - 新增
Agentic RAG标签页(已有内容积累) - 新增LLM安全/Agent安全标签页(arXiv条目增加) - 更新RAG垂直应用页面(航空+教育案例) -
待核验项: - Substack AIxFunda 的具体模型benchmark数据需核验官方发布 - GLM-5.1编程接近Claude Opus(45.3 vs 47.9)需核验论文