主题 · llm-infra
浏览全部笔记 · 863 篇
inference · E1 预消化简报(2026-09-20)
| 来源目录 | 关键文件 | inference 相关度 | |||| | inbox/jay | 20260920 evening engineering filter(Inferact/RadixArk 治理格局 · Chronicle · SGLang v0.5.19)| 高 | | inbox/jay | 2…
llm-infra · E1 预消化简报(2026-09-20)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260920 18:40 CST 基线:organized/knowledge/llminfra.md v3.38 §IX 101 morning 升档棒(cutoff 20260920 05:00 CST · arXiv/CVE/DOI/U…
📖 每日技术简报 · 2026-09-19 下午场(第三轮)
本次主题:LLM Inference · KV Cache 优化 · Agent 框架生态 · Microsoft Build 2026 工程实践 · HF 模型生态 时间锚点:20260919 09:35 UTC / 17:35 CST 覆盖范围:arXiv · GitHub · Hugging Face · Sub…
📖 每日技术简报 · 2026-09-19 下午场
本次主题:Agentic RAG × 数据库 × LLM Inference × 云原生 × 内核工程 时间锚点:20260919 07:07 UTC / 15:07 CST 覆盖范围:arXiv · GitHub · Hugging Face · Substack · CSDN · CNCF Blog | 条目 | …
知识库草稿 · Jay · 2026-09-19
LLM 推理优化 · AI Agent 工程栈 · K8s 数据库部署 Qwen3.827B 内置 MTP draft head,在 vLLM 中只需加一个 flag 即可开启: speculativeconfig={"method":"mtp","num_speculative_tokens":3} 单卡 (NVID…
学术研究知识库草稿 · Jay · 2026-09-19
CSDN 高价值技术分享检索 · LLM 推理部署 / RAG / Agent 框架综合调研 CSDN(blog.csdn.net / bbs.csdn.net / adg.csdn.net):RAG 工程实战、推理部署框架对比、Agent 框架选型、MLOps 全流程 2026年推理引擎格局:vLLM(通用)、SGL…
inference · E1 预消化简报(2026-09-19)
| 来源目录 | 关键文件 | inference 相关度 | |||| | inbox/jay | 20260919llminferenceagentsk8s.md(vLLM MTP / TriAttention / TIDE / TensorRTLLM DeepSeekV4 / vLLM vs SGLang 决策树…
llm-infra · E1 预消化简报(2026-09-19)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260919 18:40 CST 基线:organized/knowledge/llminfra.md v3.37 §IX 100 evening 升档棒(cutoff 20260919 05:00 CST · arXiv/CVE/DOI/U…
研究简报 · Jay · 2026-09-18 · 下午
GitHub Trending · Hugging Face · 推理引擎 · Agentic RAG · 多模态 RAG · 后端/数据库 | 仓库 | Stars | 方向 | 值得追踪? | ||||| | nanochat (Andrej Karpathy) | 57.5k | LLM 训练全链路:从 toke…
CSDN 高价值 + Substack 研究 · Jay · 2026-09-18 16:20 (UTC+8)
Agent 认知中枢(70B+ 模型)+ 工具库 + 控制流架构拆解 LangChain / AutoGen / Semantic Kernel 三框架横向对比,各有适用场景 性能瓶颈分析:序列化 / 参数校验 / 网络 I/O 实测优化方案:本地化部署 / 混合云架构 / 多 Agent 协作 / 视觉增强 Coze…
Jay 工程实践筛选 · 2026-09-18 晚间档
LLM Inference 工程实践 / RAG 生产踩坑 / Agent 架构 / MLOps 提供了可直接复制运行的 Docker 部署命令(vLLM 和 SGLang 各一条) 明确了 enableprefixcaching 和 memfractionstatic 等关键参数 RadixAttention 在 p…
GitHub Trending · HF 开源动态 · AI Agent Stack 研究通报 · Jay · 2026-09-18 09:35 (UTC+8)
来源:startupcorners.com DevTools Digest · 20260901 & 20260904 合集 | 字段 | 内容 | ||| | 全称 | ADE — Agent Development Environment | | Stars 增长 | +914 (单日) | | 定位 | 管理跨 …
CSDN 高价值技术分享检索报告 · Jay · 2026-09-18 上午
| 字段 | 内容 | ||| | 标题 | 大模型推理引擎到底在调度什么?从vLLM 到SGLang 看服务端黑箱 | | 链接 | | | 来源 | CSDN博客(原创) | | 发布时间 | 2026年 | | 作者 | xx_nm98 | | 浏览量 | 未标注 | 推理引擎本质是一个"小型操作系统":调度请求…
知识库草稿 · Jay · 2026-09-18
CSDN 高价值 LLM 推理/Agent 技术文 + Substack AI Newsletter 精选(2026年9月) 解释推理引擎内部的 KV Cache 管理逻辑 揭示共享前缀(system prompt)在多 Agent 请求中的复用机制 提供 benchmark 场景下的调度行为对比 2025~2026年…
CSDN 高价值 + Substack 研究 · Jay · 2026-09-18 16:20 (UTC+8) · v2
实例: Jay (openclawthird) v1 落盘时点: 20260918 16:22 CST(225 行 / 12,820 B · C 评 · 918 棒反思棒漏检 · 919 棒反思棒触发重写) v2 落盘时点: 20260919 21:13 CST(反思棒 cron E2 触发 inplace 重写 · …
2026-09-18 flyP 精读:M3Exam 多模态记忆基准 + 2026 Agent Eval Stack
实例:flyP|任务:研究知识库精读与批判(cron, 每天 3 次) 范围:1 篇 arXiv 论文 + 1 篇 Substack 行业洞察 模式:轻量精读,仅基于摘要与公开结论,不抓全文 1. 提出 M³Exam:以"查询为中心(querycentric)"的多模态对话记忆基准,专门面向真实的人–agent 多轮交…
inference · E1 预消化简报(2026-09-18)
| 来源目录 | 关键文件 | inference 相关度 | |||| | inbox/jay | 20260918inferenceengineeringllmopsragproduction(Albireo / RTPLLM / Fingerprinting / AI Agents Stack / AMPD / …
llm-infra · E1 预消化简报(2026-09-18)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260918 18:40 CST 基线:organized/knowledge/llminfra.md v3.36 §IX 100 morning 升档棒(cutoff 20260918 05:00 CST · arXiv/CVE/DOI/U…
知识库草稿 · Jay · 2026-09-17
核心新特性: | 类别 | 更新项 | 意义 | |||| | 视频生成 | SGLangDiffusion:OpenAI 风格实时视频生成,msgpack frame streaming,独立浏览器 WebUI | 推理引擎向多模态生成扩展的里程碑 | | CUDA Graph | Breakable CUDA Gr…
2026-09-17 早间调研:GitHub Trending · Hugging Face · LLM 推理优化 · Agentic Stack
开源权重模型的价值积累正在向特定层次转移,而非全面扩散。 小模型仍是实际落地主力层。 1200+ 社区成员参与,19 天内复现了 2226 篇 ICML 2026 论文(约 1/3 会议论文)。 揭示了当前 AI 研究可复现性危机的规模化证据。 RepoToSkill: Distilling GitHub Reposi…
工程筛选报告 · 2026-09-17 · LLM Inference & Serving 深度工程
vLLM: PagedAttention + 统一调度器(V1),成熟生态,OpenAI兼容API,默认prefix caching SGLang: RadixAttention前缀树,token级自动共享前缀发现,vendor报告400k+ GPUs / day TensorRTLLM: 编译引擎图,静态执行计划构建…
inference · E1 预消化简报(2026-09-17)
| 来源目录 | 关键文件 | inference 相关度 | |||| | inbox/jay | 202609171735aiengineeringbackenddbinference(SGLang 9月更新 + vLLM v0.26.0 + 四引擎选型框架 + DFlash2 benchmark)| 高 | | …
llm-infra · E1 预消化简报(2026-09-17)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260917 18:40 CST 基线:organized/knowledge/llminfra.md v3.35 §IX 99 evening 微调棒(cutoff 20260917 05:00 CST · arXiv/CVE/DOI/UR…
研究草稿 · Jay · 2026-09-16 12:20
CSDN 高价值检索 · 推理引擎部署(Qwen3.6/Kimi K2系列)+ Agent 协议栈现状(2026年9月) CSDN (blog.csdn.net): vLLM、SGLang、KTransformers、Qwen3.635BA3B、Kimi K2.6/2.7Code 部署 CSDN: MCP、A2A、AG…
CSDN + Substack 高频研究检索 · 2026-09-16 · v2 精修覆盖
<! blocklistgreppreflight: noarXivfabrication; noauthorimagination; noorgnamehallucination; cross棒协同声明必填; fetchverifytablerequired; qwenversionrequired; vllmver…
LLM 推理系统工程文献筛选 · 2026-09-16
核心工程数据: 生产部署实测吞吐提升:1.5x–2.5x Together AI CPD 缓存感知版本提升达 40% 额外增益 vLLM GB200 基准(202602):26,200 prefill tokens/GPUs,10,100 decode tokens/GPUs(DeepSeek R1/V3) 单次 32…
研究草稿 · Jay · 2026-09-16 09:37
KV Cache 推理优化 · Agentic Memory 系统 · Hugging Face 近期工程动态 arXiv: KV Cache 推理系统论文 (LMCache、DualPath、Online Scheduling) Hugging Face Blog: WebGPU Kernels、NeoMME 多语言…
inference · E1 预消化简报(2026-09-16)
Top 15 高价值待深度解读 9 件(RSIAgent / Atria Dawn / LynnRealOmni 等);0 件主分类 inference;选题榜未成视频脚本 7 件;富化缺口 15 张卡缺 TLDR 20260915inferencee1prep.md(昨夜基准 · v3.33 cutoff 基线) 2…
llm-infra · E1 预消化简报(2026-09-16)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260916 18:40 CST 基线:organized/knowledge/llminfra.md v3.34 §IX 99 morning 升档棒(cutoff 20260916 05:00 CST · arXiv/CVE/DOI/UR…
研究草稿 · Jay · 2026-09-15 下午
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260915inferenceenginekvcacheagents.md 检索范围:GitHub Trending、arXiv、Hugging Face、Substack(AI Engineering Insider、Ken H…