OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
仓库攻略
110 篇 · 108 个项目 · jay · 多模态
代表攻略
Raschka《从零搭推理模型》第3-6期:数学 Verifier + RLVR + GRPO 完整解读 · 干货攻略
这是一条关于 Raschka《Build a Reasoning Model (From Scratch)》第 3–6 期系列的实战解读。 该系列第 3 期(20260913 发布)聚焦如何从零实现一个数学 Verifier,用于: 第 6 期(20261003 发布)则把这个 Verifier 复用为 RLVR 训练的奖励信号,驱动 GRPO(Group …
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
rasbt/reasoning-from-scratch
Stars 4,951
代表
rasbt/reasoning-from-scratch
Stars 4,951
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
这是一篇由独立开发者 Giles Thomas 撰写的实操复盘(2026年9月10日发布),记录了如何从 Sebastian Raschka 的书《Build a Large Language Model (from Scratch)》中的 GPT2 代码出发,添加 MoE(MixtureofExperts,稀疏专家混合)支持,并在单张 RTX 3090(2…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
premierepromcp 是一个基于 MCP(Model Context Protocol) 的本地优先服务器,让 AI 助手(Claude、Codex、Cursor 等)通过 Adobe Premiere Pro 原生 CEP/ExtendScript 接口直接控制 Premiere Pro。它不是 Premiere 的 AI 生成功能,而是给 AI …
HushFacebook 是一个面向 Android 的 Morphe 补丁包合集,针对 Facebook(包名 com.facebook.katana)提供 51 项功能级补丁,涵盖去广告/推荐内容、媒体下载、隐私追踪阻断、播放控制等实用功能。⚠️ 它不是修改版 APK,而是通过 Morphe 补丁框架对原始 Facebook APK 进行差异化修补(MO…
这是一个生产级论文分类流水线,使用 Jev(TypeSafe AI 出品的 System One 模型)对 DAIRAI 维护的 ~2.3K 篇 AI 论文进行重新打标。总成本仅 $0.14,耗时约 83 秒。 核心思路:用便宜的 DeepSeek V4 Flash 先生成初稿标签,再用 Jev 做高质量核验与修正——这是 System One(快思考)+ …
Nimble 是一个本地运行的决策模型,基于 Qwen3.59B 微调而来,主打「给一段文字 + 一个 schema,立刻返回一个带概率的typed decision」——不做推理过程、不生成文本,直接从 logits 读出各候选答案的概率,返回确定类型的结构化结果。 核心灵感来自 TypeSafe 的商业产品 Jev(System One 决策路径),但 …
DeepSeekV4.1Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseekv4pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 AP…
SoLPi(Scaling of Language — Pi)是 NVIDIA NVlabs 开源的一个 Pi Agent 引擎扩展包,通过四个可插拔的 Token 节省机制,在保持原有任务完成质量的前提下,大幅削减长时运行编码 Agent 的 token 流量和 API 成本。 它不是一个独立的 Agent,而是以插件形式叠加在 Pi(@earendilw…
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…
academicwritingskills 是一个面向学术写作后期的 AI 辅助工具集,基于 Agent Skills 协议 安装,专为已存在初稿的论文提供「审稿人视角」的诊断与精修。不是从零写论文,而是对已有稿件做格式校验、文献核查、语法抛光、去 AI 味编辑和同行评议式审查。 覆盖 LaTeX(英文 / 中文学位论文)、Typst 和 PDF 三种格式。…
2026年9月1日,开发者 Simon Willison 在整理磁盘空间时(使用 OmniDiskSweeper 扫描 ~/.cache/)偶然发现:OpenAI 的桌面版 ChatGPT(由原 Codex 桌面应用 rebranding 而来)在用户本地静默捆绑了约 1.7GB 的完整运行时环境,位于: ~/.cache/codexruntimes/cod…
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…
TexLite 是西南财经大学 DB 研究组开源的轻量级自托管协作 LaTeX 编辑器,旨在为小型可信研究团队提供 Overleaf 的本地替代方案。核心技术栈:React 前端 + CodeMirror 编辑器 + Fastify API + SQLite 本地持久化 + Yjs 实时协作 + PM2 进程管理。默认配置仅需 Node.js 进程、SQLi…
BTL3(Bad Theory Labs 3)是 Bad Theory Labs 发布的一个后训练 PEFT LoRA 适配器,基座为 Qwen/Qwen3.627B,定位于编程 Agent、仓库级工具调用、长程多轮执行场景。 核心规格(均来自 Hugging Face 官方模型卡与 GitHub README): | 项目 | 规格 | ||| | 基座模…
Luxas 是一个开源的多 Agent 自主科研系统,输入一个研究主题(Research.md),它能自动完成:文献爬取(OpenAlex、arXiv、CrossRef,含反检测浏览器绕过付费墙)→ 阅读论文 → 设计并运行实验(多个 Agent 盲写代码和测试)→ 产出可发表级别的图表 → 撰写 LaTeX 报告 → 对抗性内容+图表+排版审查 → 最终输…