PipesHub 是一个开源的「企业知识 + AI Agent」统一上下文层,目标是把分散在 Slack、Google Drive、GitHub、Microsoft 365、Notion 等 50+ 业务系统里的企业数据,汇聚成带权限感知的可检索知识库,再把这套上下文同时开放给两类使用者:(a) 终端员工的对话式搜索与带引用的问答;(b) 自建 AI Age…
仓库攻略
317 篇 · 311 个项目 · 多模态
DeepSeekV4.1Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseekv4pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 AP…
screenpipe 是一款本地优先的 24/7 屏幕与音频录制工具,核心理念是"给 AI 装上眼睛和耳朵"。它持续捕获你的屏幕内容(通过 macOS/Windows 辅助功能 API,OCR 兜底)和系统音频(Whisper 本地转录),全部存在本地 SQLite 数据库中,让 AI 助手可以随时查询你"过去 5 分钟看了什么""今天和谁开过会"。 技术栈…
⚠️ 本文所有命令与版本基于公开 README 与 NVIDIA 技术博客 20260709 复现表(PyPI 包名 datadesigner,复现版本 0.1.5),未经本机实跑;任何对 config_builder / ModelConfig API 的引用若与 README 冲突,以官方 docs.nvidia.com/nemo/datadesigne…
Kev 是一个小尺寸的决策模型(Decision Model)家族,基于 Qwen3.5 基座构建,架构思路来自 Jev(见 Jev's Architecture Unmasked)。它用 LoRA adapter + pointer head 的方式,让你可以在自己的机器上训练和运行私有化决策模型,返回的不是自由文本,而是类型化的概率决策——支持二选一(n…
SoLPi(Scaling of Language — Pi)是 NVIDIA NVlabs 开源的一个 Pi Agent 引擎扩展包,通过四个可插拔的 Token 节省机制,在保持原有任务完成质量的前提下,大幅削减长时运行编码 Agent 的 token 流量和 API 成本。 它不是一个独立的 Agent,而是以插件形式叠加在 Pi(@earendilw…
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
SemIf(Semantic Ifs)是一个用开源 LLM 直接读取 typed option logits做运行时决策的开源工具。它让模型在单次前向传播内直接输出选项概率,而无需生成文本再解析——"不要 token,只要 logits"。 原名 OpenJev,后改名 SemIf,是独立研究项目,非 Jev / TypeSafe 官方。Jev 是 Type…
OpenJev 是一个开源项目,试图在消费级 GPU(RTX 3090)上复现 TypeSafe 的 Jev 服务——一种语义决策操作符(semantic decision operator)。它的核心思路是:不让模型生成文本,而是直接读取模型在固定 answer token 上的 logits,经过一次 softmax 得到每个选项的概率。 ⚠️ 本仓库复…
Pax(Parallel AXis)是 Google 基于 JAX 构建的大规模神经网络训练框架,专门针对需要跨多个 TPU 加速器切片(slice)或 Pod 扩展的超大规模模型设计。Pax 的核心理念是最大化 ML 研究与部署的效率,尤其在超大规模分布式训练场景下表现突出,官方称其达到了业界领先的 Model FLOPs Utilization(MFU)…
academicwritingskills 是面向 Claude Code / ChatGPT / Codex / OpenCode / Hermes Agent 等 Agent Skills 兼容客户端的论文写作 skill 套件(MIT 协议,Star ~49、周增 +16)。它把"研究定位 → 论点架构 → 扩展大纲 → 证据驱动的写作 → 双向对齐 …
OmniStudio 是一个本地优先的大模型一体化桌面工作台,由「鲲鹏Talk」开发并以 MIT 协议开源。它把"模型从哪里来、用什么引擎跑、怎么用起来"三件事收进一个 Electronlike 桌面应用(基于 Electrobun + Bun),把"模型市集下载、推理引擎管理、对话、语音、图片、视频、OCR、翻译、本地 RAG、共享记忆、MCP、Skill…
这是一个在 34 台 NVIDIA DGX Spark 节点上通过 SGLang 部署 DeepSeekV4.1Flash 模型的生产级推理方案。模型以 MXFP4 稀疏专家 + FP8 密集权重运行,KV Cache 由 NVMe + 统一内存共同支撑,提供 OpenAI 兼容的 /v1/chat/completions 接口,支持 Tool Callin…
Rubric 是一个 Schemafirst 结构化提取库:你定义一个 Zod schema,它把这个 schema 挂到 LLM 请求上,从回复中抽出 JSON,校验其是否符合 schema,不符合就自动 reask(重问),直到返回合规结果或重试次数耗尽。 核心能力:定义 schema → 提取 JSON → 校验 → reask 循环(最多 3 次),…
⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 20260913 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。 …
⚠️ 数据来源:GitHub README 与 docs/MCP.md(截至 20260913 抓取)。本文不下载、不安装运行,只整理公开文档可验证的事实;版本号 / 文件名以 Releases 页为最终准绳,写前请再 grep 一次 docs/RELEASE.md。 ⚠️ 标注:≥10 处(见各节) 反方 v2 三段式:每条主线各一段(机制 / 数据 / …
fastembedrs 是 Qdrant/fastembed(Python 版)的 Rust 实现,本地生成向量嵌入(vector embeddings)和重排序(reranking)的纯 Rust 库。无需网络请求、无 Python 依赖、无 Tokio 异步运行时,所有模型在本地通过 ONNX Runtime(via @pykeio/ort)执行。 ⚠️…
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
一个开箱即用的部署配方(recipe),用于在单台 NVIDIA DGX Spark(GB10,121 GiB 统一内存)上通过 vLLM 服务 Qwen3.8FlashNextNVFP4 大模型。 核心工程挑战:Qwen3.8FlashNext 原版 FP8 权重约 135 GB,单台 Spark 只有 128 GB 统一内存,直接跑会 OOM。这个配方通…
OpenWAM 是一个开放的世界动作模型(WorldAction Model, WAM)模块化研究栈,用于系统性地开发和比较世界模型 + 动作预测的联合方案。简单说:它把训练一个机器人策略(给定视频观测 → 输出动作)需要做的所有耦合决策(骨干网络、表示方式、训练策略、推理部署、评测基准)全部拆成可插拔的 Hydra 配置模块,让你可以在同一套代码下换着玩、…
本攻略面向已经把 Claude Code / Codex / Cursor 等"会读 SKILL.md 的编码代理"装进日常开发流的人——你想让代理真的会用 NVIDIA 那套 CUDAX、AI Blueprint、DOCA、NeMo 工具链,而不是写一段看起来像、实际跑不起来的伪代码。NVIDIA/skills 这个仓库就是 NVIDIA 自己写好、扫描过…
⚠️ 读前必看:本文所有命令、版本号、文件名均直接来自仓库 README(main 分支,20260908 commit 可见)与仓库卡片元数据。⚠️ 个别点已在文末「坑与注意」逐条标出:Go 版本号(README 声称 go.mod 要求 1.25.5,与已知 Go 发行版序列不一致,待核)、适配器清单中出现的 MiniMax、Mimo(未在公开生态中检索…
AIKit 是 KAITO 项目(Kubernetes AI Toolchain Operator)下的子项目,定位 「把开源 LLM 用一条 docker run / 一个 YAML 跑起来」:把模型推理、LoRA 微调、模型打包成 OCI artifact 三件事打包成一个工具链,底层推理引擎用 LocalAI + llama.cpp / llamagg…
Sa2VA 是字节跳动 Seed 团队联合 UC Merced / WHU / PKU 在 2026 年开源的 Pixel LLM 系列旗舰仓库,核心论文《Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos》已被 IEEE TPAMI 202…
pierrenade/shortvideogeneratorAI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。 它的核心链路是:输入 YouTube 链接(或本地视频)→ fasterwhisper 字幕提取 → LLM 识…
⚠️ 本文写作日期 20260907。MCP server 功能自 StackQL 0.9.250 起可用(来源:StackQL 官方博客 "StackQL MCP Server Now Available")。所有命令与字段以本文抓取时(20260907 07:33 UTC)的 README 与官方文档为准;版本细节请以 为准。 StackQL 是一个 G…
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…