tspattern 是一个 TypeScript 的穷举式模式匹配(Pattern Matching)库,由 Gabriel Vergnaud 开发,当前版本 5.9.0(2025年10月发布),npm 周下载量超过 400 万次,GitHub 星标 15k+。 它用用户态(userland)实现的方式,为 TypeScript 带来了类似 Rust、Swi…
仓库攻略
137 篇 · 137 个项目 · LLM 基础设施
KVPress 是 NVIDIA 出品的 KV Cache 压缩工具包,通过在 prefilling 阶段对注意力层的 KeyValue 缓存做选择性剪枝,把大上下文模型的显存占用压到原来的几分之一。全程无需训练、即装即用,支持 14+ 种压缩算法统一评测 pipeline。核心价值:让 128K~1M token 的长上下文推理在消费级 / 单卡服务器上变…
dshourfreemodel 是一个 DeepSeek Harness(dsh)插件,装上之后不需要登录、不需要注册、不需要填任何 API Key,就能直接使用包括 Muse Spark 1.3、MiMo V2.6 在内的前沿大模型——完全免费,不限量。 它的工作原理是在 dsh 的插件系统里挂载一个模型转发层,所有请求经过 OpenCode 的 Zen …
诚实标注 ⚠️:以下内容在本次抓取时未独立跑通——所有速度数字(93/74/2,170 tok/s 等)来自 README 自家基准;Coder "SWEbench Verified 91% / LiveCodeBench 99%" 来自 ISTADASLab 模型卡声称;AMD RDNA4 实验性标记来自 setup backend hip;"Experi…
| 维度 | 实测 | ||| | 字数 CJK | ~2,500(正文)| | ⚠️ 密度 | ≥1.0/1K 字符 | | §1 三段式(机制 / 数据 / 截止日证伪)| 已落地 | | 诚实标注局限性段 | ≥1 处(§六)| | §八 工程节坑点数 | 6 处 | | 反方 v2 三段式 ≥4 主线 | ≥4 | | 立标池 4 件套(GitHub…
ODS(Osmantic Deployment System)将 Ollama、Open WebUI、n8n、ComfyUI 等多个开源 AI 组件一键打包成本地 AI 服务器。一条命令把 PC / Mac / Linux 变成私有 AI 工作站:本地推理、聊天界面、控制面板、语音 / Agent / 工作流、RAG 本地搜索、图片生成,全部无需云端、不用订…
jevchatjarvismac 是一个macOS 悬浮窗助手,专门为聊天场景设计:当聊天应用(微信 / QQ)收到消息时,它立刻读取屏幕内容,用本地模型判断发送者的真实意图和风险等级,再生成候选回复供你一键复制或填入输入框。整套流程纯本地运行,不截图、不 OCR 解密数据库、不注入任何内容——只是"看屏幕 + 本地模型判断"。 核心定位:把"对方这句话到底…
Laya 是一个非自回归的 System 1 决策引擎:给定一段文本(邮件、工单、对话、JSON 文档),在一次前向传播内输出强类型的判断结果,而不是让 LLM 自由生成文本再做解析。 它支持三种「类型化决策」输出: 仓库自带三个 Hub checkpoint + 一个自动路由的 Router: | Checkpoint | 编码器 | 参数量 | 上下文 …
DeepSeekV4.1Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseekv4pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 AP…
yibie/awesomejev 是 Jev 生态的社区精选实战案例合集,由个人维护(owner 为 yibie),聚焦「谁在生产里真的用 Jev 做了决策」这个问题。它不是 SDK,也不是工具库,而是一份按应用域分类的场景索引——把散落在 GitHub Issues、Twitter/X 讨论、博客、工程帖里的 Jev 实战案例收拢成册,供开发者快速扫描「别…
⚠️ 本文所有命令与版本基于公开 README 与 NVIDIA 技术博客 20260709 复现表(PyPI 包名 datadesigner,复现版本 0.1.5),未经本机实跑;任何对 config_builder / ModelConfig API 的引用若与 README 冲突,以官方 docs.nvidia.com/nemo/datadesigne…
awesometypesafe 是一个关于 TypeSafe AI(System One / Jev 模型)生态的精选资源列表,由社区维护(与 TypeSafe 公司无附属关系)。 TypeSafe 的核心产品是 Jev——一个专门做「结构化决策」的模型:不给自由文本,而是返回类型化的概率决策(Choice 多选一、Score 打分、Noul 二选一)。这个…
Kev 是一个小尺寸的决策模型(Decision Model)家族,基于 Qwen3.5 基座构建,架构思路来自 Jev(见 Jev's Architecture Unmasked)。它用 LoRA adapter + pointer head 的方式,让你可以在自己的机器上训练和运行私有化决策模型,返回的不是自由文本,而是类型化的概率决策——支持二选一(n…
SemIf(Semantic Ifs)是一个用开源 LLM 直接读取 typed option logits做运行时决策的开源工具。它让模型在单次前向传播内直接输出选项概率,而无需生成文本再解析——"不要 token,只要 logits"。 原名 OpenJev,后改名 SemIf,是独立研究项目,非 Jev / TypeSafe 官方。Jev 是 Type…
OpenJev 是一个开源项目,试图在消费级 GPU(RTX 3090)上复现 TypeSafe 的 Jev 服务——一种语义决策操作符(semantic decision operator)。它的核心思路是:不让模型生成文本,而是直接读取模型在固定 answer token 上的 logits,经过一次 softmax 得到每个选项的概率。 ⚠️ 本仓库复…
workbuddymanager 是一套给「腾讯 CodeBuddy 账号池」做 Web 可视化与运营的配套控制台。它不替代上游 workbuddy2api(Go 写的 OpenAI 兼容反代,负责账号轮询 / 并发调度 / 熔断 / 令牌刷新),而是在它前面再加一层"看得见、管得动"的面板:扫码批量纳管账号、自动签到、多密钥分发、IP 管控、调用日志、用量…
OmniStudio 是一个本地优先的大模型一体化桌面工作台,由「鲲鹏Talk」开发并以 MIT 协议开源。它把"模型从哪里来、用什么引擎跑、怎么用起来"三件事收进一个 Electronlike 桌面应用(基于 Electrobun + Bun),把"模型市集下载、推理引擎管理、对话、语音、图片、视频、OCR、翻译、本地 RAG、共享记忆、MCP、Skill…
这是一个在 34 台 NVIDIA DGX Spark 节点上通过 SGLang 部署 DeepSeekV4.1Flash 模型的生产级推理方案。模型以 MXFP4 稀疏专家 + FP8 密集权重运行,KV Cache 由 NVMe + 统一内存共同支撑,提供 OpenAI 兼容的 /v1/chat/completions 接口,支持 Tool Callin…
Rubric 是一个 Schemafirst 结构化提取库:你定义一个 Zod schema,它把这个 schema 挂到 LLM 请求上,从回复中抽出 JSON,校验其是否符合 schema,不符合就自动 reask(重问),直到返回合规结果或重试次数耗尽。 核心能力:定义 schema → 提取 JSON → 校验 → reask 循环(最多 3 次),…
workbuddy2apipanel 是 Sliverkiss/workbuddy2api(腾讯 CodeBuddy 反向代理网关)的增强分支,在上游基础上新增了 Web 管理面板、浏览器内 OAuth 添加账号、在线配置热编辑、完整的积分任务体系(17/18 任务一键完成)等能力,同时同步了上游全部功能更新。 本质上,它是一个自托管的 OpenAI 兼容反…
TokenPrint 是一个交互式 3D 可视化平台,用于实时探索 Transformer 架构内部运作机制:注意力头、RoPE 旋转、残差流、SwiGLU 前馈等组件在真实推理过程中以 WebGL 3D 形式动态呈现。核心理念:其他 LLM 可视化工具只提供静态架构图,或运行在假数据上;TokenPrint 则直接挂钩真实模型的前向传播(forward p…
Sebastian Raschka(@rasbt)在 2026 年 9 月 6 日发布的视频与博客文章,属于其「从零手写推理模型(Reasoning from Scratch)」系列第 2 期。核心内容是从零用 PyTorch 实现 KV Cache(KeyValue 缓存),让 LLM 在逐 token 自回归生成时跳过重复计算,从而大幅提升推理速度。 这…
Sebastian Raschka(@rasbt)在 X 上分享的 LLM Memory Calculator,是一个基于 his LLM Architecture Gallery 构建的在线交互计算器。 它的核心价值在于:把 LLM 推理时的内存估算拆成两个互不相关的部分——模型权重内存和 KV Cache 增长——让你可以独立调节上下文长度或批量大小,观…
一个开箱即用的部署配方(recipe),用于在单台 NVIDIA DGX Spark(GB10,121 GiB 统一内存)上通过 vLLM 服务 Qwen3.8FlashNextNVFP4 大模型。 核心工程挑战:Qwen3.8FlashNext 原版 FP8 权重约 135 GB,单台 Spark 只有 128 GB 统一内存,直接跑会 OOM。这个配方通…
LLMAPIKeyProxy 是一个自托管的统一 LLM 网关,通过单个 OpenAI / Anthropic 兼容端点,接入所有主流 LLM 提供商(Gemini / OpenAI / Anthropic / OpenRouter / Groq / Mistral / NVIDIA / Cohere 等)。所有请求通过模型的 provider/model_…
OpenInference 是一个基于 OpenTelemetry 标准的 AI 应用追踪(tracing)工具集,由 Arize 团队维护。它定义了 LLM 调用、向量检索、工具使用等场景的语义约定(semantic conventions),并提供各主流 AI 框架的插桩(instrumentation)库,让 AI 应用能像传统微服务一样输出标准化的 …
slotstream 是一个让 125B 参数的 Qwen3.8FlashNext(MoE 架构,4bit 量化后 105 GB)在内存不足的 Mac 上运行的工具。它通过 SSD 顺序流式读取专家权重,配合固定大小的专家槽位池,实现"内存要多少就给多少"的弹性运行。 核心逻辑:模型权重分段存在 SSD,只把当前需要的专家加载进内存,其余躺在磁盘上按需调度。…
一个在 2× NVIDIA GB10(DGX Sparks) 上通过 vLLM 以 EXL3 4bit 量化Serving zaiorg/GLM5.3Flash 的开源配方。核心目标是用 ~164 GiB 的量化权重在消费级双 GB10 机器上跑起百万 token 上下文的 GLM5.3Flash,并附带 DFlash2 投机解码(k=7)加速。 简单说:让…
AwesomeAIGCTutorials 是一个人工策划的 AIGC 学习资源合集,按主题分为 Large Language Models(LLM)、AI Painting、AI Audio、Multimodal、Deep Learning、AI System 等大类,收录大学课程(Stanford CS324、CMU 11667 等)、行业培训(DeepL…
AwesomeAGI 是一个中文 AGI(通用人工智能)学习资源汇总仓库,持续更新,收录大语言模型(LLM)、AIGC(AI 生成内容)相关的论文、教程、工具、项目和数据集。按内容形态分为五大模块: 本质上这是一个用 README.md 维护的中文 AI 学习地图,按主题分类整理了社区主流资源,适合作为"遇到某个方向不知道看什么"时的第一站。 AGI / L…