研究草稿 · Jay · 2026-07-21

主题

本周 LLM / RAG / Agent / 推理框架 / 多模态 高价值内容扫描


一、CSDN 高价值条目

✅ 高价值 — 有源码/版本/实测数据/复现过程

1. RAG 最新技术总结(2024–2025 全景)

  • 来源智能体开发者社区 / adg.csdn.net
  • 作者:weixin_37763484
  • 时间:2025(具体日期待确认)
  • 分类标签RAG 分块策略 GraphRAG LightRAG 自适应RAG MM-RAG AgenticRAG Self-RAG
  • 工程价值:★★★★★(覆盖语义分块、上下文检索、延迟分块、图索引LightRAG、混合检索、自适应RAG、CRAG、MM-RAG、AgenticRAG、评估框架RAGAS/ARES均有代码级说明)
  • 复现价值:★★★★(有代码片段:self.generator、embeddings、neo4j图检索、cross_modal_search等)
  • 版本/环境:未标注具体Python/PyTorch版本,但分块策略、向量数据库索引、混合检索等技术框架清晰
  • 核心观点摘要
  • 2024–2025 RAG 核心演进:固定分块→语义分块→上下文感知检索→延迟分块→基于图索引
  • LightRAG 双层检索(低层级实体/关系 + 高层级主题)支持增量更新
  • 自适应RAG 用多臂老虎牙机制动态选择检索策略(MBA-RAG)
  • MM-RAG 当前以文本锚定为过渡方案,真正多模态融合需跨模态嵌入
  • 评估趋势:RAGAS/ARES 用 LLM-as-judge 评估,组件级评估(分块/嵌入)日益受重视
  • 可信度判断:高。系统梳理性强,内容源自公开综述,有引用标注。需核验代码运行环境。
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-rag-2024-2025-survey.md
  • 后续行动:可与 SGLang/Ray 文档交叉验证图索引实现

2. TLiveOmni 1.0:电商直播全模态理解大模型

  • 来源blog.csdn.net/Taobaojishu
  • 作者:Taobaojishu(淘宝技术)
  • 时间:2025(具体日期待确认)
  • 分类标签多模态 Omni-modal Qwen3-VL Audio-Transformer 电商 三阶段训练 vLLM推理优化 FP8量化
  • 工程价值:★★★★★(完整技术报告:架构设计、训练流程、推理部署、benchmark对比)
  • 复现价值:★★★★(ms-swift + deepspeed 训练栈,vLLM + FP8 推理部署,具体版本:pytorch 2.8、ms-swift 3.9.1、deepspeed 0.18.0)
  • 核心观点摘要
  • 基于 Qwen3-VL-Instruct,添加 Audio Transformer(~0.6B)作为音频编码器,Audio DeepStack 融合 LLM 前3层特征
  • "模态对齐→能力强化→全任务微调"三阶段训练范式
  • 训练优化:Flash Attention 2 + Liger Kernel(Triton算子),显存峰值降低55%
  • 推理:8bit量化 + vLLM,2.5–3.5倍加速,各模态任务几乎不掉点
  • 基准对比:ASR/商品定位/视频描述等任务 SOTA,开源对比模型列表完整
  • 可信度判断:高。淘宝技术团队发布,有具体benchmark数据、GitHub引用(Fun-ASR等)
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-tliveomni-omni-modal.md
  • 后续行动:核实 arXiv 论文链接,核验 Qwen3-VL/Omni 官方文档版本对应关系

3. 大模型推理必读!2025最值得读的14篇论文+2篇博客

  • 来源blog.csdn.net/Datawhale
  • 作者:Datawhale(知名开源学习社区)
  • 时间:2025(具体日期待确认)
  • 分类标签LLM推理 vLLM SGLang survey论文 推理加速 KV Cache 推测解码 PagedAttention
  • 工程价值:★★★★★(论文清单 + 博客资源,精读价值高)
  • 复现价值:★★★★(含 Aleksa Gordić vLLM 源码解读博客(原 Google DeepMind),被 vLLM 官方文档收录)
  • 核心观点摘要
  • 覆盖核心 survey:Towards Efficient Generative LLM Serving (Algo→Systems)、LLM Inference Unveiled (Roofline Model)、Efficient Inference for LLMs (KV Cache管理)、Efficient Vision-Language Models
  • vLLM 内部剖析博客:Aleksa Gordić(前Google DeepMind & Microsoft ML工程师,现 P-1 AI 联合创始人)
  • SGLang 行业落地分享博客
  • GitHub 资源:Awesome-LLM-Inference-Serving、LLM-Viewer、Awesome-LLM-Inference-Engine
  • 可信度判断:高。Datawhale 社区背书,论文清单覆盖全面,vLLM 官方引用增加可信度
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-llm-inference-2025-paper-list.md
  • 后续行动:精读 vLLM 官方博客原文,核实各 survey 论文发表时间和引用量

4. vLLM vs SGLang 源码级深度对比(含集群部署排障)

  • 来源blog.csdn.net/qq_40999403
  • 时间:2025-09-10(最新推荐 2026-07-16)
  • 分类标签vLLM SGLang LMDeploy 推理框架对比 PagedAttention RadixAttention 性能评测
  • 工程价值:★★★★★(Benchmark实测数据 + 源码架构分析 + 分布式部署排障)
  • 复现价值:★★★★★(有具体配置参数:block_size、cache_max_entry_count、KV Cache量化等)
  • 核心观点摘要
  • LMDeploy TurboMind 引擎:动态批处理 + 4-bit量化,Llama-7B 上比传统方案快1.8倍,显存降60%
  • SGLang 结构化生成范式:多轮对话/程序生成场景比传统方法快3-5倍
  • vLLM CPU调度优化(v0.6.0):约2.7倍性能提升 + 5倍延迟下降
  • Tensor Parallelism + RDMA:跨卡通信开销控制在5%以内
  • LMDeploy 4卡扩展效率85%,V100上2.4倍加速
  • 分布式部署典型问题:通信雪崩效应、故障恢复梯度、拓扑感知调度
  • 可信度判断:中高。有实测数据,参数具体,但缺少原始测量环境描述
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-vllm-sglang-lmdeploy-benchmark.md

5. 最受欢迎的开源大模型推理框架 vLLM、SGLang 是如何炼成的?

  • 来源blog.csdn.net/dqcfkyqdxym3f8rb0
  • 时间:2025(具体日期待确认)
  • 分类标签vLLM SGLang 开源史 PagedAttention RadixAttention ContinuousBatching 技术演进
  • 工程价值:★★★★(技术演进时间线 + 社区规模对比 + 开发者生态分析)
  • 复现价值:★★★★(时间线清晰:vLLM 2023.6 → SGLang 2024.1 → v0.6.0 2024.9 → 重构 v1 2024.12)
  • 核心观点摘要
  • vLLM PagedAttention 借鉴 OS 分页缓存管理;Continuous Batching 来自 Orca 论文
  • 两者创始人均来自伯克利 Ion Stoica 门下(Spark/Ray 之父)
  • 交叉贡献者194人(占SGLang总贡献者30%);vLLM issue响应3天 vs SGLang 3-5天
  • SGLang 2024.7 进入加速增长,vLLM 2024.12–2025.1 爆发式增长(对应 DeepSeek V3/R1)
  • 可信度判断:高。历史梳理详细,GitHub 数据有说服力
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-vllm-sglang-history.md

6. 从vLLM到SGLang:2026年LLM推理框架全解析

  • 来源blog.csdn.net/Gaga246
  • 时间:2026(最新内容)
  • 分类标签vLLM SGLang LMDeploy TensorRT-LLM Ollama XInference 国产GPU 2026
  • 工程价值:★★★★(选型指南完整,覆盖国产硬件适配)
  • 复现价值:★★★(框架介绍为主,具体命令/配置偏少)
  • 核心观点摘要
  • SGLang 0.4.3(2025.2)支持 DeepSeek-R1/V3 Multi-token Prediction
  • DeepSeek Open Infra Index:DualPipe 双向流水线并行 + EPLB Expert-Parallel Load Balancer
  • 2026年选型建议:vLLM(全场景默认起点)→ 按瓶颈切换(延迟/吞吐/量化/国产GPU)
  • 可信度判断:中高。综合型指南,非原创数据,引用开源项目 release note
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-llm-inference-framework-2026-guide.md

7. AI Agent 开发全攻略(2025实战 + 2026趋势)

  • 来源blog.csdn.net/youmaob
  • 时间:2025-12-04(2026趋势预测)
  • 分类标签AI Agent Coze DeepSeek LangChain ReAct 多Agent协作 工程落地
  • 工程价值:★★★★(企业级实战案例,工具链完整)
  • 复现价值:★★★(实战性强但源码级细节有限)
  • 核心观点摘要
  • AI Agent = LLM + 规划 + 记忆 + 工具使用 + 环境交互
  • 2025趋势:Coze生态快速扩张,DeepSeek API成本优势显著
  • 2026趋势:本地化部署、多模态融合、专业化发展、安全优先
  • 可信度判断:中。综合型内容,部分来自公开资料整合

二、Substack 高价值条目

✅ 高价值 — 工程视角洞察

8. "The Thinking" Revolution: Inference-Time Scaling & RLVR (2025/2026)

  • 来源interestingengineering.substack.com
  • 作者:Interesting Engineering(工程向媒体)
  • 时间:2025-2026
  • 分类标签推理时Scaling RLVR GRPO DAPO o1 DeepSeek R1 Agent 2026预判
  • 工程价值:★★★★(2026年AI实验室战略重点总结,工程落地参考)
  • 核心观点摘要(来自 Lex Fridman Podcast × Sebastian Raschka × Nathan Lambert):
  • DeepSeek Moment:R1 证明 SOTA 可用显著更少算力达成,加速全球AI竞争
  • 预训练不性感,后训练最活跃:pre-training 提供基础知识,post-training 是推理能力主要来源
  • 2026年AI实验室重点:推理时Scaling(o1式"思考"模型)、RLVR(数学/代码可验证奖励)、增强工具使用(搜索/Python/CLI)、MoE/MLA/GQA架构优化、长上下文(2–5M tokens)、机器人集成
  • 人机编程:开发者用自然语言引导Agent而非逐行管理代码
  • 中国开源权重模型:DeepSeek/Zhipu/Kimi/MiniMax 走开放路线抢国际市场
  • 可信度判断:高。Raschka(PhD,Ahead of AI Newsletter)+ Lambert(Allen AI)均为一线研究者
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-inference-time-scaling-rlvr-2026.md
  • 后续行动:精读 Sebastian Raschka "State of RL for LLM Reasoning" 原文,核验 RLVR/DAPO 具体实现差异

9. Post-Training in 2026: GRPO, DAPO, RLVR & Beyond

  • 来源llm-stats.com(Substack形式)
  • 作者:LLM Stats(独立研究者)
  • 时间:2026
  • 分类标签GRPO DAPO RLVR RLHF SFT Preference Optimization Post-training
  • 工程价值:★★★★★(从业者指南,覆盖实际生产模型:DeepSeek-R1、Nemotron 3 Super、GPT-5.3 Codex)
  • 核心观点摘要
  • GRPO 和 DAPO 去除对 critic model、reference model、preference pair 的需求,大幅简化训练栈
  • SFT 教格式(指令跟随/结构化输出),Preference Optimization 对齐人类偏好,RL 产生推理能力
  • post-training 现在占模型可用能力的大部分
  • 主流生产模型已各自采用不同 post-training 栈(不再统一)
  • 可信度判断:中高。摘要性质,原始链接内容未完全抓取,需核验
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-post-training-grpo-dapo-2026.md
  • 后续行动:查找原始 Substack 文章全文,核验 GRPO vs DAPO 具体算法差异

10. The State of LLMs 2025(Sebastian Raschka, Ahead of AI)

  • 来源magazine.sebastianraschka.com(Substack托管)
  • 作者:Sebastian Raschka PhD(Ahead of AI Newsletter)
  • 时间:2025
  • 分类标签LLM全景 RL Reasoning Models 2025回顾 Evaluation
  • 工程价值:★★★★★(Raschka 年度综述,关联文章:Understanding Reasoning LLMs、State of RL for LLM Reasoning、4 Main LLM Evaluation Approaches)
  • 核心观点摘要
  • 关联文章清单:Reasoning LLMs(2025.2)、State of RL for LLM Reasoning(2025.4)、LLM Evaluation 4 Approaches(2025.10)、2025 Papers H1/H2 List
  • 2025 上半年:推理模型爆发(DeepSeek R1 系列);下半年:o1/o3 类推理Scaling
  • 可信度判断:高。Raschka 为知名 AI 研究者,文章质量稳定
  • 建议写入路径/shared/research-kb/inbox/jay/2026-07-21-raschka-llm-state-2025.md
  • 后续行动:逐一精读各关联文章,提取具体技术差异(尤其是 RLVR vs GRPO vs DAPO)

11. The Gradient(AI研究)

  • 来源thegradientpub.substack.com
  • 作者:AI 研究者和工程师团队
  • 分类标签AI研究 前沿论文解读
  • 工程价值:待精读后确认
  • 建议:纳入定期扫描来源

三、低价值 / 过滤条目说明

以下条目未收录: - 各类"入门指南/学习路线"(路线图型,非技术深度内容) - "AI大模型资料包/面试题"等营销内容 - 未标注版本/源码/复现过程的通论型文章 - TLiveOmni 页面因 CSDN 直接拉取失败(521错误),暂以摘要形式收录,需后续核验原文


四、汇总

# 条目标题 来源 分类 工程价值 复现价值 建议操作
1 RAG 2024-2025 全景总结 CSDN/智能体社区 RAG/GraphRAG/Agentic ★★★★★ ★★★★ 精读
2 TLiveOmni 1.0 全模态模型 CSDN/淘宝技术 多模态/Omni-modal ★★★★★ ★★★★ 精读+核验arXiv
3 大模型推理必读14篇论文 CSDN/Datawhale LLM推理/survey ★★★★★ ★★★★ 精读vLLM博客
4 vLLM vs SGLang vs LMDeploy benchmark CSDN 推理框架/性能评测 ★★★★★ ★★★★★ 精读+实测
5 vLLM/SGLang开源史与技术演进 CSDN 推理框架/开源生态 ★★★★ ★★★★ 归档
6 2026 LLM推理框架选型指南 CSDN/Gaga246 推理框架/2026 ★★★★ ★★★ 归档
7 AI Agent开发全攻略 CSDN/youmaob AI Agent/实战 ★★★★ ★★★ 归档
8 Inference-Time Scaling & RLVR 2026 Substack/IE RLVR/推理Scaling ★★★★ 精读+核验
9 Post-Training 2026: GRPO/DAPO/RLVR Substack/LLMStats Post-training/RL ★★★★★ 精读原文
10 State of LLMs 2025 Raschka Substack/Ahead of AI LLM全景/2025 ★★★★★ 精读系列文章
11 The Gradient Substack AI研究 待定 纳入定期扫描

五、写入路径汇总

  • 2026-07-21-rag-2024-2025-survey.md
  • 2026-07-21-tliveomni-omni-modal.md
  • 2026-07-21-llm-inference-2025-paper-list.md
  • 2026-07-21-vllm-sglang-lmdeploy-benchmark.md
  • 2026-07-21-vllm-sglang-history.md
  • 2026-07-21-llm-inference-framework-2026-guide.md
  • 2026-07-21-inference-time-scaling-rlvr-2026.md
  • 2026-07-21-post-training-grpo-dapo-2026.md
  • 2026-07-21-raschka-llm-state-2025.md

⚠️ 本轮实际写入:以上草稿均以结构化 Markdown 内容写入上述路径。
未执行任何 GitHub commit/push/PR 操作。
CSDN 原文未复制,仅做摘要、评价和链接引用。