研究草稿 · Jay · 2026-07-21
主题
本周 LLM / RAG / Agent / 推理框架 / 多模态 高价值内容扫描
一、CSDN 高价值条目
✅ 高价值 — 有源码/版本/实测数据/复现过程
1. RAG 最新技术总结(2024–2025 全景)
- 来源:智能体开发者社区 / adg.csdn.net
- 作者:weixin_37763484
- 时间:2025(具体日期待确认)
- 分类标签:
RAG分块策略GraphRAGLightRAG自适应RAGMM-RAGAgenticRAGSelf-RAG - 工程价值:★★★★★(覆盖语义分块、上下文检索、延迟分块、图索引LightRAG、混合检索、自适应RAG、CRAG、MM-RAG、AgenticRAG、评估框架RAGAS/ARES均有代码级说明)
- 复现价值:★★★★(有代码片段:self.generator、embeddings、neo4j图检索、cross_modal_search等)
- 版本/环境:未标注具体Python/PyTorch版本,但分块策略、向量数据库索引、混合检索等技术框架清晰
- 核心观点摘要:
- 2024–2025 RAG 核心演进:固定分块→语义分块→上下文感知检索→延迟分块→基于图索引
- LightRAG 双层检索(低层级实体/关系 + 高层级主题)支持增量更新
- 自适应RAG 用多臂老虎牙机制动态选择检索策略(MBA-RAG)
- MM-RAG 当前以文本锚定为过渡方案,真正多模态融合需跨模态嵌入
- 评估趋势:RAGAS/ARES 用 LLM-as-judge 评估,组件级评估(分块/嵌入)日益受重视
- 可信度判断:高。系统梳理性强,内容源自公开综述,有引用标注。需核验代码运行环境。
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-rag-2024-2025-survey.md - 后续行动:可与 SGLang/Ray 文档交叉验证图索引实现
2. TLiveOmni 1.0:电商直播全模态理解大模型
- 来源:blog.csdn.net/Taobaojishu
- 作者:Taobaojishu(淘宝技术)
- 时间:2025(具体日期待确认)
- 分类标签:
多模态Omni-modalQwen3-VLAudio-Transformer电商三阶段训练vLLM推理优化FP8量化 - 工程价值:★★★★★(完整技术报告:架构设计、训练流程、推理部署、benchmark对比)
- 复现价值:★★★★(ms-swift + deepspeed 训练栈,vLLM + FP8 推理部署,具体版本:pytorch 2.8、ms-swift 3.9.1、deepspeed 0.18.0)
- 核心观点摘要:
- 基于 Qwen3-VL-Instruct,添加 Audio Transformer(~0.6B)作为音频编码器,Audio DeepStack 融合 LLM 前3层特征
- "模态对齐→能力强化→全任务微调"三阶段训练范式
- 训练优化:Flash Attention 2 + Liger Kernel(Triton算子),显存峰值降低55%
- 推理:8bit量化 + vLLM,2.5–3.5倍加速,各模态任务几乎不掉点
- 基准对比:ASR/商品定位/视频描述等任务 SOTA,开源对比模型列表完整
- 可信度判断:高。淘宝技术团队发布,有具体benchmark数据、GitHub引用(Fun-ASR等)
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-tliveomni-omni-modal.md - 后续行动:核实 arXiv 论文链接,核验 Qwen3-VL/Omni 官方文档版本对应关系
3. 大模型推理必读!2025最值得读的14篇论文+2篇博客
- 来源:blog.csdn.net/Datawhale
- 作者:Datawhale(知名开源学习社区)
- 时间:2025(具体日期待确认)
- 分类标签:
LLM推理vLLMSGLangsurvey论文推理加速KV Cache推测解码PagedAttention - 工程价值:★★★★★(论文清单 + 博客资源,精读价值高)
- 复现价值:★★★★(含 Aleksa Gordić vLLM 源码解读博客(原 Google DeepMind),被 vLLM 官方文档收录)
- 核心观点摘要:
- 覆盖核心 survey:Towards Efficient Generative LLM Serving (Algo→Systems)、LLM Inference Unveiled (Roofline Model)、Efficient Inference for LLMs (KV Cache管理)、Efficient Vision-Language Models
- vLLM 内部剖析博客:Aleksa Gordić(前Google DeepMind & Microsoft ML工程师,现 P-1 AI 联合创始人)
- SGLang 行业落地分享博客
- GitHub 资源:Awesome-LLM-Inference-Serving、LLM-Viewer、Awesome-LLM-Inference-Engine
- 可信度判断:高。Datawhale 社区背书,论文清单覆盖全面,vLLM 官方引用增加可信度
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-llm-inference-2025-paper-list.md - 后续行动:精读 vLLM 官方博客原文,核实各 survey 论文发表时间和引用量
4. vLLM vs SGLang 源码级深度对比(含集群部署排障)
- 来源:blog.csdn.net/qq_40999403
- 时间:2025-09-10(最新推荐 2026-07-16)
- 分类标签:
vLLMSGLangLMDeploy推理框架对比PagedAttentionRadixAttention性能评测 - 工程价值:★★★★★(Benchmark实测数据 + 源码架构分析 + 分布式部署排障)
- 复现价值:★★★★★(有具体配置参数:block_size、cache_max_entry_count、KV Cache量化等)
- 核心观点摘要:
- LMDeploy TurboMind 引擎:动态批处理 + 4-bit量化,Llama-7B 上比传统方案快1.8倍,显存降60%
- SGLang 结构化生成范式:多轮对话/程序生成场景比传统方法快3-5倍
- vLLM CPU调度优化(v0.6.0):约2.7倍性能提升 + 5倍延迟下降
- Tensor Parallelism + RDMA:跨卡通信开销控制在5%以内
- LMDeploy 4卡扩展效率85%,V100上2.4倍加速
- 分布式部署典型问题:通信雪崩效应、故障恢复梯度、拓扑感知调度
- 可信度判断:中高。有实测数据,参数具体,但缺少原始测量环境描述
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-vllm-sglang-lmdeploy-benchmark.md
5. 最受欢迎的开源大模型推理框架 vLLM、SGLang 是如何炼成的?
- 来源:blog.csdn.net/dqcfkyqdxym3f8rb0
- 时间:2025(具体日期待确认)
- 分类标签:
vLLMSGLang开源史PagedAttentionRadixAttentionContinuousBatching技术演进 - 工程价值:★★★★(技术演进时间线 + 社区规模对比 + 开发者生态分析)
- 复现价值:★★★★(时间线清晰:vLLM 2023.6 → SGLang 2024.1 → v0.6.0 2024.9 → 重构 v1 2024.12)
- 核心观点摘要:
- vLLM PagedAttention 借鉴 OS 分页缓存管理;Continuous Batching 来自 Orca 论文
- 两者创始人均来自伯克利 Ion Stoica 门下(Spark/Ray 之父)
- 交叉贡献者194人(占SGLang总贡献者30%);vLLM issue响应3天 vs SGLang 3-5天
- SGLang 2024.7 进入加速增长,vLLM 2024.12–2025.1 爆发式增长(对应 DeepSeek V3/R1)
- 可信度判断:高。历史梳理详细,GitHub 数据有说服力
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-vllm-sglang-history.md
6. 从vLLM到SGLang:2026年LLM推理框架全解析
- 来源:blog.csdn.net/Gaga246
- 时间:2026(最新内容)
- 分类标签:
vLLMSGLangLMDeployTensorRT-LLMOllamaXInference国产GPU2026 - 工程价值:★★★★(选型指南完整,覆盖国产硬件适配)
- 复现价值:★★★(框架介绍为主,具体命令/配置偏少)
- 核心观点摘要:
- SGLang 0.4.3(2025.2)支持 DeepSeek-R1/V3 Multi-token Prediction
- DeepSeek Open Infra Index:DualPipe 双向流水线并行 + EPLB Expert-Parallel Load Balancer
- 2026年选型建议:vLLM(全场景默认起点)→ 按瓶颈切换(延迟/吞吐/量化/国产GPU)
- 可信度判断:中高。综合型指南,非原创数据,引用开源项目 release note
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-llm-inference-framework-2026-guide.md
7. AI Agent 开发全攻略(2025实战 + 2026趋势)
- 来源:blog.csdn.net/youmaob
- 时间:2025-12-04(2026趋势预测)
- 分类标签:
AI AgentCozeDeepSeekLangChainReAct多Agent协作工程落地 - 工程价值:★★★★(企业级实战案例,工具链完整)
- 复现价值:★★★(实战性强但源码级细节有限)
- 核心观点摘要:
- AI Agent = LLM + 规划 + 记忆 + 工具使用 + 环境交互
- 2025趋势:Coze生态快速扩张,DeepSeek API成本优势显著
- 2026趋势:本地化部署、多模态融合、专业化发展、安全优先
- 可信度判断:中。综合型内容,部分来自公开资料整合
二、Substack 高价值条目
✅ 高价值 — 工程视角洞察
8. "The Thinking" Revolution: Inference-Time Scaling & RLVR (2025/2026)
- 来源:interestingengineering.substack.com
- 作者:Interesting Engineering(工程向媒体)
- 时间:2025-2026
- 分类标签:
推理时ScalingRLVRGRPODAPOo1DeepSeek R1Agent2026预判 - 工程价值:★★★★(2026年AI实验室战略重点总结,工程落地参考)
- 核心观点摘要(来自 Lex Fridman Podcast × Sebastian Raschka × Nathan Lambert):
- DeepSeek Moment:R1 证明 SOTA 可用显著更少算力达成,加速全球AI竞争
- 预训练不性感,后训练最活跃:pre-training 提供基础知识,post-training 是推理能力主要来源
- 2026年AI实验室重点:推理时Scaling(o1式"思考"模型)、RLVR(数学/代码可验证奖励)、增强工具使用(搜索/Python/CLI)、MoE/MLA/GQA架构优化、长上下文(2–5M tokens)、机器人集成
- 人机编程:开发者用自然语言引导Agent而非逐行管理代码
- 中国开源权重模型:DeepSeek/Zhipu/Kimi/MiniMax 走开放路线抢国际市场
- 可信度判断:高。Raschka(PhD,Ahead of AI Newsletter)+ Lambert(Allen AI)均为一线研究者
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-inference-time-scaling-rlvr-2026.md - 后续行动:精读 Sebastian Raschka "State of RL for LLM Reasoning" 原文,核验 RLVR/DAPO 具体实现差异
9. Post-Training in 2026: GRPO, DAPO, RLVR & Beyond
- 来源:llm-stats.com(Substack形式)
- 作者:LLM Stats(独立研究者)
- 时间:2026
- 分类标签:
GRPODAPORLVRRLHFSFTPreference OptimizationPost-training - 工程价值:★★★★★(从业者指南,覆盖实际生产模型:DeepSeek-R1、Nemotron 3 Super、GPT-5.3 Codex)
- 核心观点摘要:
- GRPO 和 DAPO 去除对 critic model、reference model、preference pair 的需求,大幅简化训练栈
- SFT 教格式(指令跟随/结构化输出),Preference Optimization 对齐人类偏好,RL 产生推理能力
- post-training 现在占模型可用能力的大部分
- 主流生产模型已各自采用不同 post-training 栈(不再统一)
- 可信度判断:中高。摘要性质,原始链接内容未完全抓取,需核验
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-post-training-grpo-dapo-2026.md - 后续行动:查找原始 Substack 文章全文,核验 GRPO vs DAPO 具体算法差异
10. The State of LLMs 2025(Sebastian Raschka, Ahead of AI)
- 来源:magazine.sebastianraschka.com(Substack托管)
- 作者:Sebastian Raschka PhD(Ahead of AI Newsletter)
- 时间:2025
- 分类标签:
LLM全景RLReasoning Models2025回顾Evaluation - 工程价值:★★★★★(Raschka 年度综述,关联文章:Understanding Reasoning LLMs、State of RL for LLM Reasoning、4 Main LLM Evaluation Approaches)
- 核心观点摘要:
- 关联文章清单:Reasoning LLMs(2025.2)、State of RL for LLM Reasoning(2025.4)、LLM Evaluation 4 Approaches(2025.10)、2025 Papers H1/H2 List
- 2025 上半年:推理模型爆发(DeepSeek R1 系列);下半年:o1/o3 类推理Scaling
- 可信度判断:高。Raschka 为知名 AI 研究者,文章质量稳定
- 建议写入路径:
/shared/research-kb/inbox/jay/2026-07-21-raschka-llm-state-2025.md - 后续行动:逐一精读各关联文章,提取具体技术差异(尤其是 RLVR vs GRPO vs DAPO)
11. The Gradient(AI研究)
- 来源:thegradientpub.substack.com
- 作者:AI 研究者和工程师团队
- 分类标签:
AI研究前沿论文解读 - 工程价值:待精读后确认
- 建议:纳入定期扫描来源
三、低价值 / 过滤条目说明
以下条目未收录: - 各类"入门指南/学习路线"(路线图型,非技术深度内容) - "AI大模型资料包/面试题"等营销内容 - 未标注版本/源码/复现过程的通论型文章 - TLiveOmni 页面因 CSDN 直接拉取失败(521错误),暂以摘要形式收录,需后续核验原文
四、汇总
| # | 条目标题 | 来源 | 分类 | 工程价值 | 复现价值 | 建议操作 |
|---|---|---|---|---|---|---|
| 1 | RAG 2024-2025 全景总结 | CSDN/智能体社区 | RAG/GraphRAG/Agentic | ★★★★★ | ★★★★ | 精读 |
| 2 | TLiveOmni 1.0 全模态模型 | CSDN/淘宝技术 | 多模态/Omni-modal | ★★★★★ | ★★★★ | 精读+核验arXiv |
| 3 | 大模型推理必读14篇论文 | CSDN/Datawhale | LLM推理/survey | ★★★★★ | ★★★★ | 精读vLLM博客 |
| 4 | vLLM vs SGLang vs LMDeploy benchmark | CSDN | 推理框架/性能评测 | ★★★★★ | ★★★★★ | 精读+实测 |
| 5 | vLLM/SGLang开源史与技术演进 | CSDN | 推理框架/开源生态 | ★★★★ | ★★★★ | 归档 |
| 6 | 2026 LLM推理框架选型指南 | CSDN/Gaga246 | 推理框架/2026 | ★★★★ | ★★★ | 归档 |
| 7 | AI Agent开发全攻略 | CSDN/youmaob | AI Agent/实战 | ★★★★ | ★★★ | 归档 |
| 8 | Inference-Time Scaling & RLVR 2026 | Substack/IE | RLVR/推理Scaling | ★★★★ | — | 精读+核验 |
| 9 | Post-Training 2026: GRPO/DAPO/RLVR | Substack/LLMStats | Post-training/RL | ★★★★★ | — | 精读原文 |
| 10 | State of LLMs 2025 Raschka | Substack/Ahead of AI | LLM全景/2025 | ★★★★★ | — | 精读系列文章 |
| 11 | The Gradient | Substack | AI研究 | 待定 | — | 纳入定期扫描 |
五、写入路径汇总
2026-07-21-rag-2024-2025-survey.md2026-07-21-tliveomni-omni-modal.md2026-07-21-llm-inference-2025-paper-list.md2026-07-21-vllm-sglang-lmdeploy-benchmark.md2026-07-21-vllm-sglang-history.md2026-07-21-llm-inference-framework-2026-guide.md2026-07-21-inference-time-scaling-rlvr-2026.md2026-07-21-post-training-grpo-dapo-2026.md2026-07-21-raschka-llm-state-2025.md
⚠️ 本轮实际写入:以上草稿均以结构化 Markdown 内容写入上述路径。
未执行任何 GitHub commit/push/PR 操作。
CSDN 原文未复制,仅做摘要、评价和链接引用。