OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
仓库攻略
316 篇 · 310 个项目 · 多模态
NaturePaperSkills 是一套面向 Codex(ChatGPT)和 Claude Code 的 AI 科研写作技能集,27 个 skill 将论文全生命周期串成一条连续工作流:从立项定位、结构论证、图表设计,到科学写作、引用核验、审稿回复,覆盖 Nature 系列生命科学、计算生物学与方法学论文的写作与修订。 核心理念:论证先于语言——先明确科学…
代表攻略
Raschka《从零搭推理模型》第3-6期:数学 Verifier + RLVR + GRPO 完整解读 · 干货攻略
这是一条关于 Raschka《Build a Reasoning Model (From Scratch)》第 3–6 期系列的实战解读。 该系列第 3 期(20260913 发布)聚焦如何从零实现一个数学 Verifier,用于: 第 6 期(20261003 发布)则把这个 Verifier 复用为 RLVR 训练的奖励信号,驱动 GRPO(Group …
同类项目 3展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
rasbt/reasoning-from-scratch
Stars 4,951
代表
rasbt/reasoning-from-scratch
Stars 4,951
rasbt/reasoning-from-scratch
Stars 4,951
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
Hermes Gadget SDK 是一个为 Hermes Agent 配套的设备端开发包,让你把 ESP32S3 开发板、Raspberry Pi 4/5,或者纯桌面模拟器,变成一个可以按住说话、放开发送、听到 AI 回答的实体对话设备。 它的核心设计哲学是设备保持轻薄:语音识别、语音合成、LLM 推理全部跑在主机侧(树莓派或电脑),设备只负责音频采集、屏…
PhotoCraft 是用纯 Rust 从零实现的开源 Adobe Photoshop 替代品,隶属于 ArtCraft 社区。与依赖 Electron/WebView 的方案不同,它使用 wgpu 作为 GPU 渲染后端,支持 Metal、Vulkan、DX12 和 WebGPU,覆盖 macOS、Windows、Linux、FreeBSD,并可通过 We…
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
这是一篇由独立开发者 Giles Thomas 撰写的实操复盘(2026年9月10日发布),记录了如何从 Sebastian Raschka 的书《Build a Large Language Model (from Scratch)》中的 GPT2 代码出发,添加 MoE(MixtureofExperts,稀疏专家混合)支持,并在单张 RTX 3090(2…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
FastEmbed 是一个轻量、快速的 Python 向量嵌入生成库,由 Qdrant 团队开发和维护。它使用 ONNX Runtime 替代 PyTorch 作为推理后端,主打「无需 GPU、不下载 GB 级 PyTorch 依赖」就能跑 StateoftheArt 嵌入模型。 核心能力覆盖:稠密文本嵌入、稀疏嵌入(SPLADE++)、晚交互嵌入(ColB…
premierepromcp 是一个基于 MCP(Model Context Protocol) 的本地优先服务器,让 AI 助手(Claude、Codex、Cursor 等)通过 Adobe Premiere Pro 原生 CEP/ExtendScript 接口直接控制 Premiere Pro。它不是 Premiere 的 AI 生成功能,而是给 AI …
诚实标注 ⚠️:以下内容在本次抓取时未独立跑通——所有速度数字(93/74/2,170 tok/s 等)来自 README 自家基准;Coder "SWEbench Verified 91% / LiveCodeBench 99%" 来自 ISTADASLab 模型卡声称;AMD RDNA4 实验性标记来自 setup backend hip;"Experi…
HushFacebook 是一个面向 Android 的 Morphe 补丁包合集,针对 Facebook(包名 com.facebook.katana)提供 51 项功能级补丁,涵盖去广告/推荐内容、媒体下载、隐私追踪阻断、播放控制等实用功能。⚠️ 它不是修改版 APK,而是通过 Morphe 补丁框架对原始 Facebook APK 进行差异化修补(MO…
辞达(Cida,取自《论语》"辞达而已矣")是一个 macOS 菜单栏应用,用你选择的大模型在 Mac 的任何地方翻译和润色文字。它不是一个独立的翻译引擎,而是一个调用层——支持 OpenAI Chat Completions、Responses API、Anthropic Messages 三种接口,以及任何兼容 OpenAI 协议的本机模型(如 核心定位…
BeefTV 是一款本地优先的轻量级 AI 原生视频创作工作台。它在一个自由画布上连接创意、模型与素材,支持从提示词或参考素材直接生成文字、图片、视频与音频,并允许用户对生成结果继续裁切、标注、局部重绘、拆分和组合迭代。 核心理念:AI 不是附加按钮,而是工作流的一部分。生成、参考与工具能力都长在画布上,结果写回后可继续编辑、可复用、可继续生成。 技术栈:桌…
OmaPhoto 是 macOS 上的专业图层图像编辑软件 Compositor 的 Linux 移植版,优先面向 Omarchy 桌面环境。采用 Qt 6.4+ / C++20 构建,支持完整的图层、蒙版、选区、滤镜体系,可读写 Compositor 的 .comp 项目文件,设计师可以在 macOS 和 Linux 之间无缝迁移工作流。 Composit…
PolymarketPerpetualBot 是一个面向 Polymarket 预测市场的终端交易机器人,基于 Polymarket 的 Polygon CLOB(Central Limit Order Book)API 构建。它以键盘驱动的 TUI(终端用户界面)呈现,集成了行情浏览、实时订单簿查看、策略引擎和持仓追踪四大模块,支持模拟交易(paper t…
BridgeClip 是一款开源 AI 视频剪辑桌面应用,由 BridgeMind 开发,核心场景是将播客、直播、YouTube/Twitch 录播自动剪辑成带字幕的短视频片段。它本质上是一条本地 AI 流水线:用 ytdlp 下载源视频或解析链接 → 调用 OpenRouter 上的转录模型生成时间轴字幕 → 调度 LLM 找出"最有传播力的时刻" → 用…
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) Android/iOS 构建命令均来自 README ✓ · 4) 许可证 PolyForm Noncommercial 1.0.0(README 显式标注)✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类:移动端本地多模态…
Helix 是一个私有 AI 编程 Agent 编队平台,让团队在自有的 GPU 基础设施上运行多个并行的 AI 编程 Agent——每个 Agent 有自己独立的 GPU 加速 Linux 桌面(内置 IDE、终端、浏览器、文件系统),通过 Spec 驱动的 Kanban 看板组织任务,从需求描述到 PR 合并形成完整流程。 核心定位:不再让所有 Agen…
jevchatjarvismac 是一个macOS 悬浮窗助手,专门为聊天场景设计:当聊天应用(微信 / QQ)收到消息时,它立刻读取屏幕内容,用本地模型判断发送者的真实意图和风险等级,再生成候选回复供你一键复制或填入输入框。整套流程纯本地运行,不截图、不 OCR 解密数据库、不注入任何内容——只是"看屏幕 + 本地模型判断"。 核心定位:把"对方这句话到底…
这是一个生产级论文分类流水线,使用 Jev(TypeSafe AI 出品的 System One 模型)对 DAIRAI 维护的 ~2.3K 篇 AI 论文进行重新打标。总成本仅 $0.14,耗时约 83 秒。 核心思路:用便宜的 DeepSeek V4 Flash 先生成初稿标签,再用 Jev 做高质量核验与修正——这是 System One(快思考)+ …
Nimble 是一个本地运行的决策模型,基于 Qwen3.59B 微调而来,主打「给一段文字 + 一个 schema,立刻返回一个带概率的typed decision」——不做推理过程、不生成文本,直接从 logits 读出各候选答案的概率,返回确定类型的结构化结果。 核心灵感来自 TypeSafe 的商业产品 Jev(System One 决策路径),但 …
PipesHub 是一个开源的「企业知识 + AI Agent」统一上下文层,目标是把分散在 Slack、Google Drive、GitHub、Microsoft 365、Notion 等 50+ 业务系统里的企业数据,汇聚成带权限感知的可检索知识库,再把这套上下文同时开放给两类使用者:(a) 终端员工的对话式搜索与带引用的问答;(b) 自建 AI Age…