dshourfreemodel 是一个 DeepSeek Harness(dsh)插件,装上之后不需要登录、不需要注册、不需要填任何 API Key,就能直接使用包括 Muse Spark 1.3、MiMo V2.6 在内的前沿大模型——完全免费,不限量。 它的工作原理是在 dsh 的插件系统里挂载一个模型转发层,所有请求经过 OpenCode 的 Zen …
仓库攻略
43 篇 · 43 个项目 · LLM 基础设施 · jay
DeepSeekV4.1Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseekv4pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 AP…
Sebastian Raschka(@rasbt)在 2026 年 9 月 6 日发布的视频与博客文章,属于其「从零手写推理模型(Reasoning from Scratch)」系列第 2 期。核心内容是从零用 PyTorch 实现 KV Cache(KeyValue 缓存),让 LLM 在逐 token 自回归生成时跳过重复计算,从而大幅提升推理速度。 这…
Sebastian Raschka(@rasbt)在 X 上分享的 LLM Memory Calculator,是一个基于 his LLM Architecture Gallery 构建的在线交互计算器。 它的核心价值在于:把 LLM 推理时的内存估算拆成两个互不相关的部分——模型权重内存和 KV Cache 增长——让你可以独立调节上下文长度或批量大小,观…
LLMAPIKeyProxy 是一个自托管的统一 LLM 网关,通过单个 OpenAI / Anthropic 兼容端点,接入所有主流 LLM 提供商(Gemini / OpenAI / Anthropic / OpenRouter / Groq / Mistral / NVIDIA / Cohere 等)。所有请求通过模型的 provider/model_…
OpenInference 是一个基于 OpenTelemetry 标准的 AI 应用追踪(tracing)工具集,由 Arize 团队维护。它定义了 LLM 调用、向量检索、工具使用等场景的语义约定(semantic conventions),并提供各主流 AI 框架的插桩(instrumentation)库,让 AI 应用能像传统微服务一样输出标准化的 …
一个在 2× NVIDIA GB10(DGX Sparks) 上通过 vLLM 以 EXL3 4bit 量化Serving zaiorg/GLM5.3Flash 的开源配方。核心目标是用 ~164 GiB 的量化权重在消费级双 GB10 机器上跑起百万 token 上下文的 GLM5.3Flash,并附带 DFlash2 投机解码(k=7)加速。 简单说:让…
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
nvidia_gpu_exporter 是一个用 Go 编写的 Prometheus GPU 指标导出器,底层调用 nvidiasmi(NVIDIA 系统管理接口)采集显卡实时状态——包括 GPU 利用率、显存占用、温度、功率、风扇转速、时钟频率等——并以 Prometheus 标准格式(/metrics 端点)暴露出来,可直接对接 Grafana 渲染监控…
AgentENV(简称 AENV)是 Kimi K3 模型背后用于大规模运行 Agent 执行环境的分布式平台,由 kvcacheai 团队开源。它的核心职责是:在大规模集群上同时调度成千上万个轻量级隔离沙盒(基于 Firecracker microVM),按需加载 OCI 镜像,让每个 Agent 任务在独立、可快启、可快停的环境中运行。 类比来说:如果 …
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
llmaction 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员…
cubestudio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。 它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持…
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
内容待复核
PlexPt/awesome-chatgpt-prompts-zh · 上手攻略
awesomechatgptpromptszh(ChatGPT 中文调教指南)是一个开源的中文 Prompt 收藏仓库,由作者 PlexPt 从 2023 年初开始维护。它收集了数百个精炼的中文提示词模板,涵盖学术写作、翻译、代码、面试、生活娱乐等数十个场景,用户将提示词粘贴进 ChatGPT 即可获得高质量输出。 本质上是场景化 Prompt 最佳实践的精…
nanovllm 是一个从零实现的高效 vLLM 复刻项目,作者希望用约 1200 行干净可读的 Python 代码展示 vLLM 的核心原理。它不是 vLLM 的分支或包装,而是一个独立的精简实现,API 设计与 vLLM 保持高度兼容,同时内置了 Prefix Caching、Tensor Parallelism、Torch Compilation、CU…
HappyLLM 是 Datawhale 团队推出的系统性大模型学习教程,定位介于"科普"和"科研"之间,目标是授之以鱼,更授之以渔。它从 NLP 基本研究方法讲起,沿着 LLM 的思路和原理逐层深入,最终带领读者用 PyTorch 从零实现一个 LLaMA2 模型,并完成预训练、有监督微调(SFT)和 LoRA/QLoRA 高效微调的全流程。 与其姐妹项目…
LMCache 是一个KV Cache 管理中间件层,专为 LLM 推理场景设计。它的核心思路是把 GPU VRAM 中转瞬即逝的 KV Cache 变成可持久化、可复用、可监控的 AI 原生存储,从而显著降低 TTFT(Time To First Token,首 token 延迟),提升多轮对话和 Agentic Workload 的吞吐量。 典型工作场景…
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
Colibrì(意大利语"蜂鸟")是一个纯 C 语言编写的轻量推理引擎,可以在只有约 25 GB 内存的消费级机器上运行 GLM5.2——一个 7440 亿参数的混合专家(MoE)大模型。它完全不使用 Python 运行时,不依赖 BLAS 或 GPU,通过磁盘流式加载专家权重将不可能变为可能:仅 9.9 GB 常驻内存,让一台普通电脑跑上前沿级大模型。 项…
Mooncake 是月之暗面(Moonshot AI)为旗下 Kimi 大模型服务开发的生产级 LLM Serving 平台,核心创新是 KVCache 中心化的 PrefillDecode 分离架构(PD 分离),将 LLM 推理的预填充(Prefill)和解码(Decode)阶段拆分到不同集群,并通过利用 GPU 集群中闲置的 CPU DRAM 和 SS…
ColossalAI 是 HPCAI Tech 开源的分布式深度学习训练框架,核心目标是让大模型训练更便宜、更快、更普惠。它整合了多维并行(数据并行、流水线并行、张量并行)、ZeRO 优化、异构训练、FP8 低精度等技术,支持从单卡到大规模 GPU 集群的各类场景。 ColossalAI 最著名的成就是支撑了开源视频生成项目 OpenSora 的训练——让研…
DeepSpeed 是微软开源的深度学习优化库,专为大规模分布式训练和推理而设计。它让训练千亿、万亿参数模型不再是巨头的专利,普通研究团队也能在有限硬件上跑起来。 DeepSpeed 的核心创新是 ZeRO(Zero Redundancy Optimizer) 系列技术,通过分片优化器状态、梯度、参数,大幅降低单 GPU 显存占用。此外还支持 3D 并行(数…