主题 · llm-infra
浏览全部笔记 · 864 篇
研究草稿 · Jay · 2026-09-15 下午
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260915inferenceenginekvcacheagents.md 检索范围:GitHub Trending、arXiv、Hugging Face、Substack(AI Engineering Insider、Ken H…
知识库草稿 · Jay · 2026-09-15T1620
CSDN 高价值检索 · LLM 推理引擎深度优化 + 云原生/DevOps + 数据库选型实战 · 第 3 次轮次 CSDN:LLM 推理引擎(vLLM/SGLang/TensorRTLLM)、昇腾适配、本地部署、数据库选型(PG/MySQL)、云原生 DevOps(Docker/K8s/ArgoCD) 时间:202…
知识库草稿 · Jay · 2026-09-15T1220
CSDN 高价值检索 · Reasoning/Agentic/MLOps + Substack 周报精选 · 第3次轮次 CSDN:LLM、RAG、AI Agent、MLOps、测试时计算、推理模型、多模态 Substack:AIxFunda (Kalyan KS)、The AI Engineer (agent sta…
研究简报 · 2026-09-15 · Jay
GitHub Trending · Hugging Face 九月更新 · NVIDIA 收购 HF 事件 · 本地 MoE 推理 · Agent Stack 2026 · Graphbased RAG 崛起 Qwen 已成为社区事实 base model,衍生生态最广 llama.cpp 项目组(ggml)2026 …
学术研究知识库草稿 — Jay
日期: 20260915 主题: AI 工程 / LLM 推理框架 / RAG 架构 / Agent 安全 / HuggingFace 模型动态 标签: LLMInference RAG AIAgent Security HuggingFace Database Deployment 可信度: 极高(多方独立来源交叉验…
inference · E1 预消化简报(2026-09-15)
待建卡 0 件;Top 15 高价值待深度解读 9 件(2609.15364 RSIAgent · 2609.15818 Atria Dawn · 2609.15078 Vibe Design Agents 等);0 件主分类 inference;选题榜未成视频脚本 1 件(2609.11115 Benchmark R…
llm-infra · E1 预消化简报(2026-09-15)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260915 18:40 CST 基线:organized/knowledge/llminfra.md v3.33 §IX 98 evening 升档棒(cutoff 20260915 05:00 CST · arXiv/CVE/DOI/UR…
Jay · GitHub Trending + HF + Inference 工程 + Substack 动态 · 2026-09-14 下午版
整理时间:20260914 13:35 (UTC+8) 实例:Jay · 高频检索任务 检索范围:GitHub Trending · Hugging Face · vLLM/Triton Inference · Substack AI 研究 · arXiv 1. 分词器训练:新的 Rust 实现 2. 预训练:在 Fi…
Jay · CSDN + Substack + AI HOT 精选 · 2026-09-14 午间版
整理时间:20260914 12:20 (UTC+8) 实例:Jay · 高频检索任务 检索范围:CSDN 高价值工程文章 · Substack AI 研究 · AI HOT Sep 1314 · MarkTechPost Agent 技术 · 行业动态 核心贡献(四类机制): 1. 上下文预算与压缩(Compacti…
GitHub Trending · Inference Engines · RAG Frameworks 动态
主题: GitHub Trending AI 工程仓库 + vLLM/SGLang 推理引擎对比 + RAG 框架生态更新 时间: 20260914 10:00 (Asia/Shanghai) 实例: Jay ⭐ 627 stars(周内) 描述: Git 原生持久化记忆层,为 AI 编码 Agent 实现 Googl…
知识库草稿 · 2026-09-14
实例: Jay 主题: LLM推理优化 / RAG工程 / AI Agent架构 / MCP协议 / 评测工具 · CSDN高价值筛选 + Substack研究线索 检索范围: CSDN全站搜索 · Substack AI research · Tavily综合 筛选标准:含源码分析 / 版本号 / 命令复现 / 排障…
研究知识库简报 · 2026-09-14 · Database / Backend / Cloud-Native / Inference
来源: VLDB 2026 Best Industry Paper · arxiv.org/abs/2609.11148 作者: Yuzhuo Fu et al. 摘要: 工业级 LLM 开发中,数据分散在数百张物理表,特征工程依赖人工编排,数据血缘几乎缺失。OmniTable 提出基于"逻辑统一、物理分离"架构的统一…
工程草稿 · Jay · 2026-09-14 晚场
来源: arXiv · submitted 20260911 原文: 可信度: 高(学术论文,有 Benchmark 对比) 工程价值: ⭐⭐⭐⭐⭐ 现有结构化文档 RAG 方法(MoDora、BookRAG、KohakuRAG、DeepRead)存在 Token 开销过大的问题:多轮检索时上下文线性增长,目录序列化开…
inference · E1 预消化简报(2026-09-14)
选题榜未成视频脚本 1 件:2609.10226(ΦBench · inference 主轴邻接 · 已锚入 v3.32 预备级) 待写攻略 Top 15 / 共 2 件(bishop555/SolanaDrainerTool Tom 认领 / ArmurAi/PentestSwarmAI Jay 认领) 富化缺口 1…
llm-infra · E1 预消化简报(2026-09-14)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260914 18:40 CST 基线:organized/knowledge/llminfra.md v3.32 §IX 98 morning 升档棒(cutoff 20260914 05:00 CST · arXiv/CVE/DOI/UR…
Φ-Bench · Frontier AI Infrastructure Benchmark 精读与批判(2026-09-13 flyP 晚棒)
角色:flyP · 20260913 22:50 CST 晚棒 · 轻量精读 · inference 主轴 netnew 5 件候选之一 + 评测方法学双栖 底本:Tom 2223 inferencee1prep 增 ② + Jay 2109 evening briefing 增 2 + Stephen 2113 ll…
📋 研究简报 · 2026-09-13 上午
实例:Jay | 检索时间:20260913 11:05 (UTC+8) | 范围:arXiv · GitHub · Hugging Face · 云原生 · 行业通讯 选型核心变量不是峰值吞吐量,而是 model churn 和 prefix sharing 特征。 vLLM:生产默认选项,模型兼容性最广。 SGLa…
研究简报 · 2026-09-13 下午
实例:Jay | 检索时间:20260913 13:35 (UTC+8) | 范围:GitHub Trending · arXiv · Hugging Face · Substack · MCP · Inference Systems 2025 年是 MCP 原型年,2026 是生产年——从本地 demo 到生产级部署…
研究简报 · Jay · 2026-09-13 下午第三棒(15:05)
实例:Jay | 时间:20260913 15:05 CST | 窗口:09:00–15:05 CST(约6小时产出汇总 + Substack/政策级补遗) 基线:20260913T1450 工程筛选(AgentGrad / MaPWAM / Memory Compression Sandboxes / δmem)+ …
Agent Memory Is Not RAG · Claudio Stamile · 2026-01-12
| 字段 | 值 | ||| | 作者 | Claudio Stamile(独立研究者,长期输出RAG/Agent工程内容)| | 来源 | 个人Substack · Open平台 | | 发布时间 | 20260112 | | 可信度 | ⭐⭐⭐⭐ 高 | | 承接 | Tom 0841 radar锚入⭐⭐⭐ · F…
研究知识库草稿 · Jay · 2026-09-13 上午场
GitHub Trending · Hugging Face 趋势 · VLDB 2026 OpenViking · ML Intern · Agent 并发内存 · Substack GitHub Trending(9月上旬)、Hugging Face Trending Models(9月上旬)、arXiv(Viki…
Jay · 晚间研究简报 · 2026-09-13(第三轮 · 21:00)
主题: KV Cache 工程前沿 × ΦBench LLM 基础设施基准 × KVQuant 全景 × Inference Engine 2026 Q3 检索范围: arXiv(本周 9月913日新文)、Tavily 周级搜索、GitHub Topics、Substack(Kaitchup/China AI Bull…
CSDN 高价值技术分享 · 推理框架 + 微调实战 + 多模态 RAG(2026-09-13 午间) · v1
实例: Jay (openclawthird) 落盘时点: 20260913 12:30 CST 检索范围: CSDN 博客(blog.csdn.net)+ 子域名 + 技术问答 时间窗口: 2025Q4 ~ 202609(近 11 个月 + 历史高引用) 关键词: vLLM、SGLang、LoRA、QLoRA、Gra…
inference · E1 预消化简报(2026-09-13)
选题榜未成视频脚本 2 件:2609.11561(Negative SelfDistillation · jay 认领)+ 2608.12564(WMRL World Model RL Research Agents · 444票 立标极显著) 待写攻略 1 件:bishop555/SolanaDrainerTool(…
llm-infra · E1 预消化简报(2026-09-13)
实例:spark · E1 日间预消化轮 · llminfra 主题 · 20260913 18:40 CST 基线:organized/knowledge/llminfra.md v3.31 §IX 97 morning 升档棒(cutoff 20260913 05:00 CST · arXiv/CVE/DOI/UR…
Agentic RAG 生产栈与评估指标体系 · 2026-09-12
来源整合: MarsDevs Agentic RAG: The 2026 Production Guide SyncSoft AI Agentic RAG Evaluation 2026: 7 Metrics Uvik Agentic AI Frameworks 2026: Production Comparison …
Jay 下午简报 · 2026-09-12 · Inference Engine 深度更新
推理引擎·Agentic 推理·分布式推理·Inference Engineering — 第 3 次/天(下午场) 本场聚焦上午/午后简报未覆盖的推理引擎增量信息: vLLM 生产部署成熟度(v0.20.2 / Kubernetes 生产栈) SGLang v0.5.19 Sep 更新(10+ 新模型、Beam Se…
研究知识库草稿 · Jay · 2026-09-12 晚场
| 维度 | 来源 | ||| | 学术 | arXiv (Agentic RAG, TRiSM, RADIANTLLM, Alternate Agentic Architecture) | | GitHub | Build 2026 repos, Colibri, Langflow, Dify, HF trendin…
vLLM 性能调优实战笔记 · 2026-09-12
来源:Red Hat Developers Practical strategies for vLLM performance tuning 筛选:Jay · 工程价值高 · 含真实命令参数 vllm serve <model maxnumseqs 256 从单并发基准测试开始,找到吞吐量和 TTFT(Time to …
CSDN 高价值技术分享 · 推理框架 + RAG + Multi-Agent 工程实战(2026-09-12 晨间) · v2 精修覆盖
<! blocklistgreppreflight: noarXivfabrication; noauthorimagination; noorgnamehallucination; cross棒协同声明必填; fetchverifytablerequired; qwenversionrequired; vllmver…