知识库草稿 · Jay · 2026-07-17

主题

CSDN 高价值技术分享 + Substack 研究线索 · LLM 推理/Agent/微调/RAG/MLOps 综合

检索范围

  • CSDN:vLLM 推理优化、LangChain/AutoGen/LlamaIndex 工程实战、Function Calling/MCP/Agent 架构、向量数据库/RAG、微调/MLOps
  • Substack:Sebastian Raschka (LLM reasoning/inference scaling)、Hugo Bowne-Anderson (Agent harness)、MorphLLM (practical inference optimization)

CSDN 高价值条目

1. vLLM 2026 推理引擎:EAGLE3 推测解码 + 分离式 Prefill

链接:https://blog.csdn.net/qq_31142761/article/details/162108087 作者:qq_31142761(原创,2026-06) 可信度:⭐⭐⭐⭐ 中高 标签:LLM推理 | vLLM | 推测解码 | 推理优化 | 工程实践

核心观点摘要: - 2026 年 vLLM 推理引擎四大核心技术:推测解码(Speculative Decoding)分离式 Prefill(Disaggregated Prefill)前缀缓存(Prefix Caching)FP4 量化 - EAGLE3:草稿模型最优解,用于推测解码;另有 DAS(RL 场景专用)和 P-EAGLE(并行推测解码) - 分离式 Prefill:将 Prefill 和 Decode 阶段分配到不同 GPU,解决 Prefill 阶段计算密集与 Decode 阶段访存密集的资源争用问题 - 前缀缓存:跨请求共享相同 system prompt 前缀的 KV Cache,显著降低重复计算 - 文章给出了 70B 模型在 2×A100-80G 上的部署建议,含硬件选型表和关键参数调优说明

工程价值: - ✅ 有具体命令(--speculative-model eagle3-llama4-70b) - ✅ 有硬件选型对照表 - ✅ 有监控指标说明 - ⚠️ 无完整可运行源码,但核心参数明确

建议分类LLM推理 | 工程实践 | 复现价值中高


2. AI 工程师必备技能:从 Agent 框架到 RAG 工程实践

链接:https://blog.csdn.net/m0_69581581/article/details/162315741 作者:m0_69581581(原创,2026-06-25) 可信度:⭐⭐⭐⭐ 中高 标签:AI工程师 | LangChain | AutoGen | LlamaIndex | RAG | 多Agent | 生产部署

核心观点摘要: - 基于 LangChain v0.3、AutoGen v0.8、LlamaIndex v0.12 三大框架,展示完整 RAG + 多 Agent 问答系统案例 - 给出版本锁定的依赖安装命令bash pip install pyautogen==0.8.2 langchain==0.3.1 \ langchain-community==0.3.0 chromadb==0.5.3 \ openai==1.45.0 tiktoken==0.7.0 - 完整 RAG + AutoGen Agent 协作代码示例(LangChain + Chroma 向量库) - 包含框架横向对比表(LangChain v0.3 / AutoGen v0.8 / LlamaIndex v0.12 / CrewAI v0.9) - 涵盖可观测性(LangSmith、OpenTelemetry、MLflow)部署策略

工程价值: - ✅ ✅ 完整 pip 版本锁定 + 可运行代码片段 - ✅ 框架横向对比表 - ✅ 生产级部署考量 - ✅ 发布时间新(2026-06-25)

建议分类Agent | RAG | 工程实践 | 复现价值高 | 优先收录


3. LlamaIndex 2026 技术全景:从简易 RAG 到企业级自治 Agent

链接:https://blog.csdn.net/yanxilou/article/details/162178538 作者:yanxilou(原创) 可信度:⭐⭐⭐⭐ 中高 标签:LlamaIndex | Agent | RAG | 事件驱动 | 企业级

核心观点摘要: - LlamaIndex 2026 实现从 RAG 框架到企业级自治智能体架构的跨越式升级 - 核心变革:事件驱动 Workflow 替代静态 DAG,支持长周期自治 Agent - 关键词:事件驱动、长周期记忆、自治编排

工程价值: - ✅ 架构演进梳理清晰 - ⚠️ 无具体代码,偏向架构分析

建议分类LlamaIndex | Agent | 架构分析 | 建议与 vLLM 那篇配合收录


4. Agent 工具调用架构:从 Function Calling 到动态工具编排

链接:https://blog.csdn.net/2401_87746054/article/details/162272636 作者:2401_87746054(原创) 可信度:⭐⭐⭐⭐ 中高 标签:Function Calling | MCP | Skill | Agent | 工具编排 | Claude Code

核心观点摘要: - 2026 年 Claude Code 源码揭示 Function Calling 与 Agent Skills 的本质差异 - Function Calling:原子化工具执行框架,通过结构化接口(Tool)调用外部能力 - Skill:能力封装,把"怎么做某类活"打包成可复用单元 - MCP 协议:标准化工具连接协议(L3) - 技术栈三层:L1 原语(tool use / function calling)→ L2 能力封装(plugin / Skill)→ L3 工具连接协议(MCP)

工程价值: - ✅ 概念边界厘清 - ✅ 有源码级洞察(Claude Code) - ⚠️ 无完整可运行代码

建议分类Agent | Function Calling | 概念厘清 | 源码级洞察 | 建议收录


5. 2026 版大模型 Function Calling 详解

链接:https://blog.csdn.net/m0_57081622/article/details/160923321 作者:m0_57081622(原创) 可信度:⭐⭐⭐⭐ 中高 标签:Function Calling | JSON Schema | 工具调用 | 工程实践

核心观点摘要: - 深度拆解 LLM 工具调用 Function Calling 核心机制 - 结构化 JSON 完成功能参数定义,真实代码落地执行全流程 - 涵盖 ReAct Agent 模式与 Function Calling 的关系

工程价值: - ✅ 有代码示例 - ✅ 完整流程覆盖 - ⚠️ 标题有"小白也能吃透",深度可能受限

建议分类Function Calling | 工程实践 | 入门到中级


6. RAG 实战:从向量数据库到 GraphRAG

链接:https://blog.csdn.net/weixin_37647148/article/details/162175188 作者:weixin_37647148(原创) 可信度:⭐⭐⭐ 中 标签:RAG | GraphRAG | 向量数据库 | Embedding | Milvus | Chroma

核心观点摘要: - 2026 中主流 Embedding 模型选型表(维度、指标对比) - 从 Naive RAG → Advanced RAG → Modular RAG → GraphRAG 的演进路径 - 向量数据库对比(Milvus、Chroma、Qdrant 等)

工程价值: - ✅ Embedding 模型选型表有参考价值 - ✅ 演进路径梳理清晰 - ⚠️ 无具体环境搭建命令

建议分类RAG | GraphRAG | 向量数据库 | 综述类 | 中等价值


7. AI 原生 MLOps 不是工具链,是认知革命(2026 奇点大会)

链接:https://blog.csdn.net/ProceNest/article/details/160956302 作者:ProceNest(原创) 可信度:⭐⭐⭐ 中 标签:MLOps | AI原生 | 模型生命周期 | 2026奇点大会

核心观点摘要: - 2026 奇点智能技术大会确立 AI 原生 MLOps 为下一代模型生命周期管理核心范式 - 核心转变:从"模型部署工具"到"模型开发—训练—评测—微调全周期管理" - 轻量级强化学习策略用于模型微调

工程价值: - ⚠️ 偏向会议总结,无具体技术实现 - ✅ 概念框架有参考价值

建议分类MLOps | 概念综述 | 低优先级


Substack 研究线索

1. The State of LLM Reasoning Model Inference

链接:https://magazine.sebastianraschka.com/p/state-of-llm-reasoning-and-inference-scaling 作者:Sebastian Raschka, PhD 可信度:⭐⭐⭐⭐⭐ 高(学术型 newsletter) 标签:LLM推理 | Reasoning Model | Inference Scaling | RL | SFT

核心观点摘要: - DeepSeek R1 发布后,推理模型研究激增,重点转向 Inference-Time Compute Scaling - 两条主要路径:训练时计算扩展(大规模 RL/SFT)和推理时计算扩展(允许模型"想更久") - 两大策略结合:训练侧重知识注入,推理侧重复杂任务自适应计算 - 涵盖新策略:强化学习、蒸馏、监督微调等改进 reasoning 的方法

后续行动建议: - 🔍 需核验是否有关于具体推理优化技术(如 tree-of-thought、beam search 变体)的最新论文 - 📄 建议在 Semantic Scholar 检索 "inference-time scaling reasoning 2026" 跟进


2. LLM Architecture in 2026: What You Need to Know

链接:https://hugobowne.substack.com/p/llm-architecture-in-2026-what-you 作者:Hugo Bowne-Anderson(Vanishing Gradients newsletter) 可信度:⭐⭐⭐⭐⭐ 高 标签:LLM架构 | Agent | Context Engineering | LLM应用

核心观点摘要: - 嘉宾包括 DeepMind、Anthropic、Delphina 等机构专家 - 关键议题:AI Agent Harness 构建、Context Engineering 三原则、后编程时代 AI 写系统 - 技术覆盖:多 Agent 协作、长上下文管理、Context 压缩

后续行动建议: - 📄 建议跟进该 newsletter 的 episode 系列,特别是 durable agents 和 agent harness 相关内容


3. LLM Inference Optimization: Cut Cost & Latency at Every Layer

链接:https://www.morphllm.com/llm-inference-optimization 作者:MorphLLM(技术型 newsletter) 可信度:⭐⭐⭐⭐ 高 标签:LLM推理 | 推理优化 | 成本优化 | 延迟优化 | 三层框架

核心观点摘要: - 平均 LLM API 调用 40-60% 的输入 token 是模型不需要的上下文,浪费在 padding 上 - 三层优化框架: - Model-level:量化、剪枝、蒸馏 - System-level:连续批处理、PagedAttention、推测解码 - Application-level:上下文压缩、提示缓存 - Agent 工作流每次任务 50-200 次 LLM 调用,需特别关注 per-task 成本而非 per-token 成本 - Verbatim context compaction 用于长周期 Agent

后续行动建议: - ✅ 与 CSDN vLLM 那篇互相印证,建议合并成"推理优化"主题页


去重说明

本轮候选条目与 2026-06-11 已有草稿对比: - vLLM/SGLang/量化/MoE(2026-06-11 傍晚):侧重 SGLang 和量化技术路线对比;本轮 vLLM 篇侧重 EAGLE3 推测解码和 Disaggregated Prefill,内容新增,不重复 - Agent 评估/生产工程(2026-06-11):侧重 Agent 评估框架;本轮 4、5 两篇侧重 Function Calling/MCP 内部实现,角度不同,不重复 - RAG/微调/工程(2026-06-11):侧重微调实战;本轮 2 号 RAG 篇(weixin_37647148)有 GraphRAG 新内容,部分新增


建议写入路径

优先写入(高工程价值): - LLM推理/2026-07-17-vllm-eagle3-speculative-decoding-rag-multitenant.md - Agent/2026-07-17-langchain-autogen-multitenant-agent-function-calling-mcp.md

次优先(中等工程价值): - RAG/2026-07-17-rag-graphrag-vector-db-embedding-2026mid.md - Substack/2026-07-17-substack-llm-reasoning-inference-scaling-raschka.md


分类标签汇总

条目 主标签 副标签 复现价值 建议优先级
vLLM EAGLE3/Disagg Prefill LLM推理 vLLM, 推测解码, 推理优化 中高 P1
LangChain/AutoGen/LlamaIndex 工程 Agent RAG, 多Agent, 生产部署 P1
LlamaIndex 2026 自治Agent Agent LlamaIndex, 事件驱动 P2
Function Calling/MCP/Claude Code Agent Function Calling, MCP, 源码 中高 P1
Function Calling 详解 Function Calling JSON Schema, 工具调用 P2
RAG→GraphRAG 向量库 RAG GraphRAG, 向量数据库 P2
MLOps 认知革命 MLOps 概念综述 P3
Sub: Sebastian Raschka reasoning Substack LLM推理, RL, 论文线索 P1(线索)
Sub: Hugo Bowne-Agent harness Substack Agent, Context Eng. P1(线索)
Sub: MorphLLM inference opt Substack 推理优化, 成本, 延迟 P1(线索)

后续行动建议

  1. 精读:本轮 P1 条目(vLLM EAGLE3 那篇 + LangChain 工程那篇)建议直接入库
  2. 审稿:Function Calling/MCP 架构那篇与 06-11 的 agent-security 篇是否有关联,建议合并审稿
  3. 主题页更新LLM推理 主题页建议增加"推测解码 2026 最新进展(EAGLE3/DAS/P-EAGLE)"章节
  4. 论文跟进:Substack Raschka 那篇提到的 inference-time scaling reasoning,建议在 Semantic Scholar 检索最新论文补充进推理主题页