tspattern 是一个 TypeScript 的穷举式模式匹配(Pattern Matching)库,由 Gabriel Vergnaud 开发,当前版本 5.9.0(2025年10月发布),npm 周下载量超过 400 万次,GitHub 星标 15k+。 它用用户态(userland)实现的方式,为 TypeScript 带来了类似 Rust、Swi…
仓库攻略
71 篇 · 71 个项目 · LLM 基础设施 · tom
KVPress 是 NVIDIA 出品的 KV Cache 压缩工具包,通过在 prefilling 阶段对注意力层的 KeyValue 缓存做选择性剪枝,把大上下文模型的显存占用压到原来的几分之一。全程无需训练、即装即用,支持 14+ 种压缩算法统一评测 pipeline。核心价值:让 128K~1M token 的长上下文推理在消费级 / 单卡服务器上变…
ODS(Osmantic Deployment System)将 Ollama、Open WebUI、n8n、ComfyUI 等多个开源 AI 组件一键打包成本地 AI 服务器。一条命令把 PC / Mac / Linux 变成私有 AI 工作站:本地推理、聊天界面、控制面板、语音 / Agent / 工作流、RAG 本地搜索、图片生成,全部无需云端、不用订…
jevchatjarvismac 是一个macOS 悬浮窗助手,专门为聊天场景设计:当聊天应用(微信 / QQ)收到消息时,它立刻读取屏幕内容,用本地模型判断发送者的真实意图和风险等级,再生成候选回复供你一键复制或填入输入框。整套流程纯本地运行,不截图、不 OCR 解密数据库、不注入任何内容——只是"看屏幕 + 本地模型判断"。 核心定位:把"对方这句话到底…
yibie/awesomejev 是 Jev 生态的社区精选实战案例合集,由个人维护(owner 为 yibie),聚焦「谁在生产里真的用 Jev 做了决策」这个问题。它不是 SDK,也不是工具库,而是一份按应用域分类的场景索引——把散落在 GitHub Issues、Twitter/X 讨论、博客、工程帖里的 Jev 实战案例收拢成册,供开发者快速扫描「别…
awesometypesafe 是一个关于 TypeSafe AI(System One / Jev 模型)生态的精选资源列表,由社区维护(与 TypeSafe 公司无附属关系)。 TypeSafe 的核心产品是 Jev——一个专门做「结构化决策」的模型:不给自由文本,而是返回类型化的概率决策(Choice 多选一、Score 打分、Noul 二选一)。这个…
Kev 是一个小尺寸的决策模型(Decision Model)家族,基于 Qwen3.5 基座构建,架构思路来自 Jev(见 Jev's Architecture Unmasked)。它用 LoRA adapter + pointer head 的方式,让你可以在自己的机器上训练和运行私有化决策模型,返回的不是自由文本,而是类型化的概率决策——支持二选一(n…
SemIf(Semantic Ifs)是一个用开源 LLM 直接读取 typed option logits做运行时决策的开源工具。它让模型在单次前向传播内直接输出选项概率,而无需生成文本再解析——"不要 token,只要 logits"。 原名 OpenJev,后改名 SemIf,是独立研究项目,非 Jev / TypeSafe 官方。Jev 是 Type…
OpenJev 是一个开源项目,试图在消费级 GPU(RTX 3090)上复现 TypeSafe 的 Jev 服务——一种语义决策操作符(semantic decision operator)。它的核心思路是:不让模型生成文本,而是直接读取模型在固定 answer token 上的 logits,经过一次 softmax 得到每个选项的概率。 ⚠️ 本仓库复…
这是一个在 34 台 NVIDIA DGX Spark 节点上通过 SGLang 部署 DeepSeekV4.1Flash 模型的生产级推理方案。模型以 MXFP4 稀疏专家 + FP8 密集权重运行,KV Cache 由 NVMe + 统一内存共同支撑,提供 OpenAI 兼容的 /v1/chat/completions 接口,支持 Tool Callin…
Rubric 是一个 Schemafirst 结构化提取库:你定义一个 Zod schema,它把这个 schema 挂到 LLM 请求上,从回复中抽出 JSON,校验其是否符合 schema,不符合就自动 reask(重问),直到返回合规结果或重试次数耗尽。 核心能力:定义 schema → 提取 JSON → 校验 → reask 循环(最多 3 次),…
workbuddy2apipanel 是 Sliverkiss/workbuddy2api(腾讯 CodeBuddy 反向代理网关)的增强分支,在上游基础上新增了 Web 管理面板、浏览器内 OAuth 添加账号、在线配置热编辑、完整的积分任务体系(17/18 任务一键完成)等能力,同时同步了上游全部功能更新。 本质上,它是一个自托管的 OpenAI 兼容反…
TokenPrint 是一个交互式 3D 可视化平台,用于实时探索 Transformer 架构内部运作机制:注意力头、RoPE 旋转、残差流、SwiGLU 前馈等组件在真实推理过程中以 WebGL 3D 形式动态呈现。核心理念:其他 LLM 可视化工具只提供静态架构图,或运行在假数据上;TokenPrint 则直接挂钩真实模型的前向传播(forward p…
一个开箱即用的部署配方(recipe),用于在单台 NVIDIA DGX Spark(GB10,121 GiB 统一内存)上通过 vLLM 服务 Qwen3.8FlashNextNVFP4 大模型。 核心工程挑战:Qwen3.8FlashNext 原版 FP8 权重约 135 GB,单台 Spark 只有 128 GB 统一内存,直接跑会 OOM。这个配方通…
slotstream 是一个让 125B 参数的 Qwen3.8FlashNext(MoE 架构,4bit 量化后 105 GB)在内存不足的 Mac 上运行的工具。它通过 SSD 顺序流式读取专家权重,配合固定大小的专家槽位池,实现"内存要多少就给多少"的弹性运行。 核心逻辑:模型权重分段存在 SSD,只把当前需要的专家加载进内存,其余躺在磁盘上按需调度。…
AwesomeAIGCTutorials 是一个人工策划的 AIGC 学习资源合集,按主题分为 Large Language Models(LLM)、AI Painting、AI Audio、Multimodal、Deep Learning、AI System 等大类,收录大学课程(Stanford CS324、CMU 11667 等)、行业培训(DeepL…
AwesomeAGI 是一个中文 AGI(通用人工智能)学习资源汇总仓库,持续更新,收录大语言模型(LLM)、AIGC(AI 生成内容)相关的论文、教程、工具、项目和数据集。按内容形态分为五大模块: 本质上这是一个用 README.md 维护的中文 AI 学习地图,按主题分类整理了社区主流资源,适合作为"遇到某个方向不知道看什么"时的第一站。 AGI / L…
NoteGen 是一款本地优先的 Markdown AI 笔记应用,核心理念是"先捕获,后整理"——把灵感、语音、图片、链接等各种碎片先一股脑存下来,回头再挑选素材组织成结构化笔记。它不是要替代你的 Markdown 编辑器,而是给普通 Markdown 文件加上 AI 聚合、智能搜索和知识库的能力。 GitHub Stars:12685(数据截至 2026…
tensai(天才)是 mattn(Go 社区知名贡献者)用纯 Go 实现的一个微型神经网络框架,核心亮点是全部用 Go 原生 SIMD/AVX2 指令加速矩阵运算,无需 cgo、无需汇编文件、无需外部依赖(开启 wgpu 标签时仅额外引入一个纯 Go 绑定)。它是目前少数可以在纯 Go 生态内完成从训练到模型导出完整流程的 ML 框架。 不想引入 Pyth…
h3.c 是 MiniMax H3 视频/音频生成模型的原生 Metal 推理引擎,专为 Apple Silicon 设计。由 antirez(Redis 作者)手写 C + Metal 实现,不依赖 Python 或 PyTorch,直接跑在 Mac 的 GPU 上。 H3 是 MiniMax 开源的多模态生成模型,支持文生视频、文生音频、首帧/尾帧条件化…
MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
dshroutingsuite 是一个聚合套装,由两个独立维护的组件构成,专门解决「DSH 运行时缺乏任务感知思维模式路由」的问题。它不是一个独立的 AI Agent,而是 DSH(DeepSeek Host)生态的运行时增强层。 核心组成: | 组件 | 仓库 | 版本 | 职能 | ||||| | injector/ | dshsuperinjector…
beta9 是 Beam 公司的开源 serverless GPU 运行时引擎,为 AI 工作负载提供极速冷启动(<1 秒)的容器化部署能力。它支持 GPU 推理、沙箱隔离执行和后台任务队列,底层通过自定义容器运行时(非标准 Docker)和分布式缓存实现亚秒级冷启动。 Beam 官方提供托管云服务(beam.cloud),同时 beta9 完全开源,支持自…
Intel Neural Compressor 是 Intel 开源的模型压缩库,专注于 LLM/VLM 的低比特量化(Lowbit Quantization),覆盖 INT8、FP8、MXFP8、MXFP4、INT4、NVFP4 等多种低精度数据类型,支持 PyTorch、TensorFlow、JAX 三大框架。 其核心定位是:Intel 官方大模型推理优…
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
everychatgptgui 是一个持续更新的开源 AI 客户端清单,由开发者 billmei 维护,专门收集整理全球所有可对接 ChatGPT API(以及 Claude、Gemini 等主流 LLM)的图形界面客户端。仓库本身不是客户端,而是一个精选导航列表,按平台分为 Web、浏览器扩展、Obsidian 插件、桌面应用、自托管方案等大类,每个条目包…
GPT4All 是由 Nomic AI 开发的开源本地大模型运行工具,核心目标是让任何人在不需要 GPU、不需要 API key、不需要云服务的情况下,在自己的电脑(笔记本、台式机)上跑大语言模型(LLM)。 本质上是基于 llama.cpp 的工程封装,提供三件套: 桌面应用(GPT4All Desktop):图形界面聊天,支持 LocalDocs(本地文…
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
freebuffproxy 是一个本地网关,把 FreeBuff/Codebuff 的免费 AI 编程模型(deepseekv4flash 等)以 OpenAI 兼容接口(/v1/chat/completions)暴露给任意工具——OpenCode、pi、9router、LiteLLM 或自己的脚本。 它的核心价值是"翻译 + 池化 + 隐匿": FreeB…
MaxText 是 Google AIHypercomputer 团队开源的高性能、高可扩展 LLM 训练与后训练库,全部用纯 Python/JAX 编写,目标是 TPU 和 NVIDIA GPU 上的高效分布式训练与微调。官方于 20250915 发布 PyPI 包,当前稳定版本 0.2.3(2026 年初)。 MaxText 的定位是"LLM 项目发射台…