RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
仓库攻略
1112 篇 · 1098 个项目
2026 年 7 月 13 日上传至 arXiv(2607.11886)的一篇论文,来自香港大学、字节跳动 Seed 和北京大学联合团队。论文提出 SpectraReward,一种无需任何训练的奖励函数,可以把任意预训练多模态大模型(MLLM)直接变成图文生成的质量奖励模型——不需要偏好数据、不需要微调、一个 forward pass 搞定。 核心思想用一个…
Ultralytics YOLOv5 是 YOLO(You Only Look Once)目标检测算法的第五代官方 PyTorch 实现,由 Ultralytics 公司维护。它在原始 YOLOv4 的基础上完全重写,以「极致简洁」为设计核心,集目标检测、实例分割、图像分类三大任务于一体,并在 v7.0(2022年)引入了实时实例分割模型,成为当时全球最快最…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
Claude Scholar 是一个半自动化 AI 学术研究助手,面向计算机科学和 AI 研究者设计,核心功能覆盖文献调研、代码实验、报告撰写、论文写作和项目知识管理。它并非一个独立的 AI 模型或应用,而是一套 Claude Code / Codex / Kimi Code CLI / OpenCode 的技能(Skills)和工作流配置层,通过向这些编码…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
AOS Community Edition(简称 AOSCE)是 Unicity 公司推出的开源 Agent 操作系统,专为希望拥有可审查、可组合 AI Agent 运行环境的开发者设计。它的核心定位是:Agent 的执行环境(类似容器的隔离运行时)+ 配套的工具链,让 Agent 在其中既能安全运行,又能自我扩展能力。 关键概念拆解: MetaHarnes…
Science Context Protocol(SCP)是一个开源协议标准,由上海人工智能实验室(Yankai Jiang 等)提出,发表在 arXiv(2512.24189),GitHub 仓库为 InternScience/scp。 它的核心目标:为 AI 科研 Agent 提供一个全球性的协议层,让工具、模型、数据集乃至实验仪器能够跨平台、跨机构互联…
codereviewgraph(简称 CRG)是一个本地优先的代码智能图谱工具,为 MCP(Model Context Protocol)兼容的 AI 编程助手和 CLI 环境设计。它的核心思路是:先把你的代码库解析成一张结构化的知识图谱(节点 = 函数/类/导入,边 = 调用/继承/测试覆盖),然后在 AI 做代码审查时只喂给它真正相关的文件,而不是把整个…
Codex 认证助手(Codex Auth Helper)是一款专为 Codex 开发者设计的 Chrome 浏览器扩展程序。它的核心功能只有一个:把你已经登录在 ChatGPT 网页版中的会话凭证,安全地导出为一份符合 Codex 规范的 auth.json 本地配置文件。 Codex 是 OpenAI 推出的 AI 编程助手,需要有效的认证令牌才能调用 …
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
FastDeploy 是百度飞桨(PaddlePaddle)团队推出的"LLM + VLM 推理部署工具包",主打工业级一键部署和国产芯片广覆盖。它的目标不是要替代 vLLM,而是站在 vLLM 接口的肩膀上,把 ERNIE、Qwen3、DeepSeekV3、PaddleOCRVL 等模型在 NVIDIA、昆仑芯 XPU、海光 DCU、天数 GPU、燧原 G…
FastVideo 是 MBZUAI Hao Zhang 实验室主导的"统一视频生成推理 + 后训练(蒸馏/微调)框架"。它不是某个视频生成模型本身,而是一套面向 DiT 类视频扩散模型(Wan、Mochi、Hunyuan、CausalWan 等)的训练蒸馏推理一站式底座,目标是让视频生成既能微调,又能跑得快、跑得便宜。 仓库内同时包含 4 个层次的产出: …
CSGHub 是 OpenCSG 团队开源的"LLM 资产管理平台",定位对标 Hugging Face:把模型(LLM/VLM)、数据集、Space 应用、代码片段当作一等资产,统一在一个平台上做上传、下载、版本管理、权限分发、推理部署和数据处理。整套系统由 Go(Gin)+ Rails 旧版迁移中的 Vue3 前端、PostgreSQL 元数据、Apac…
Sebastian Raschka(AI 研究者、前威斯康星大学麦迪逊分校教授)在 2026 年 7 月 18 日发表了一篇深度技术博文,系统解释了 LLM 如何在推理时切换低/中/高三种「精力」(effort)推理模式,以及这些能力在训练阶段是如何被注入的。 这不是一篇泛泛的科普文,而是从 RLVR 训练机制、思维链格式的真正作用,到 Qwen3 的「思维…
利用 X MCP(Model Context Protocol)工具让 AI 代理自动抓取指定高信噪比账号的 X 帖子,生成一份自包含的 HTML Artifact(或存为知识库),构建属于你自己的个性化 AI 资讯日报。 核心思路是:把 X 变成一个结构化的 AI 新闻 API,由代理自动完成「筛选账号 → 抓取内容 → 渲染输出」的全流程,每天早上打开浏…
wigolo 是一个本地优先的 AI Agent 网页智能服务器,为 AI 编程 Agent 提供一站式网页能力:搜索、抓取、爬取、提取、缓存、相似页面查找和自主研究。所有数据默认存储在本地 ~/.wigolo/,核心搜索/抓取功能无需任何 API Key,完全免费。 它的定位是替代需要付费的网页搜索 API(如 Google SerpAPI、Bing Se…
Direct OnPolicy Distillation(DirectOPD)是清华大学与字节跳动Seed团队提出的一种弱到强泛化方法,核心思路是: 在小模型上跑强化学习(RL),然后只把小模型 RL 产生的"策略方向"迁移给大模型,而不是让大模型直接模仿小模型的最终输出。 官方仓库:BytedTsinghuaSIA/DirectOPD(GitHub)+ H…
Apache Burr(incubating)是一个 Python 状态机框架,用来构建"会做决策的应用"——chatbot、agent、simulation、人机协作工具。它把应用建模成一张 state machine(状态机/流程图): Burr 的关键设计哲学是 "框架无关":它不规定你必须用哪个 LLM SDK、哪个 vector DB、哪个 age…
Apache Hamilton(incubating)是一个轻量的 Python 库,用"Python 函数即节点"的方式构建数据转换 DAG。它的核心思路是:你写普通的 Python 函数,函数参数的名字 = 它依赖的上游节点名,Hamilton 自动把这些函数拼成 DAG、并按依赖顺序执行。 举例: import pandas as pd def sig…
OpenLIT 是一个开源的 AI Engineering 平台,定位是"一站式把 LLM 应用从实验推到生产"。它把 OpenTelemetry 当作统一底座,向上提供 6 类核心能力: 1. 可观测性 SDK(Python / TypeScript / Go):对 50+ LLM provider、VectorDB、Agent 框架、GPU 做自动埋点(…
IFStruct 是 Liquid AI 发布的一个结构化输出合规性评测基准(benchmark),专门测试 LLM 能否在真实用户指令的混乱表达下,生成符合目标 schema 的有效 JSON 或 YAML。官方 Repo:Liquid4All/ifstruct;数据集同步发布于 HuggingFace。 核心理念(来自官方博客):现有结构化输出评测通常将…
2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimprovingagent/awesomeSelfImprovingAgents 提…
iPolloWork 是 Codex 和 Claude Code 的下一代源码开放替代品,定位是"不只是帮你写代码,而是真正完成工作"。 核心特点: 源码可用(SourceAvailable,非 OSI 认可的开源):允许个人免费使用,3 人及以上使用需书面授权 Claude Code 和 Github Copilot workspace 这类产品,本质上还…
awesomezhuijufree 是一个免费无广告追剧资源导航仓库,由社区人工精选、每天自动检测资源有效性。收录范围涵盖在线影视、影视 APP、网盘搜索、磁力 BT、字幕、TVBox 配置地址、IPTV 直播源、会员拼团等,是一个影视资源的聚合索引。 核心特点: 完全免费,无广告(普通导航站的痛点就是广告满天飞) 人工精选,不是爬虫抓取的垃圾站堆砌 每日自…
《深入理解 AI Agent:设计原理与工程实践》(作者李博杰)是一本系统性阐述 AI Agent 的技术书籍,全书围绕核心公式展开: Agent = LLM + 上下文 + 工具 这个公式是全书的骨架,意思是:一个能用的 Agent,离不开大语言模型(LLM)、对上下文的精细管理、以及可调用的外部工具。三者缺一不可。 十章内容覆盖: | 章节 | 主题 |…
LangChain 于 2026 年 7 月 18 日在 X 宣布将其内部「软件工程 Agent 全链路工具栈」完全开源,CEO Harrison Chase 表示:「我们已经在内部建好了一整套软件工程 Agent 工厂,并把每个组件都开源了。」 这套体系由四个独立但可协同的工具组成: | 组件 | 定位 | 入口 | |||| | Dcode (Deep …
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
Canvas Editor 是一个基于 HTML <canvas API 构建的富文本编辑器(WYSIWYG),与传统的 contenteditable 方案完全不同。它完全接管渲染管线,在 Canvas 画布上绘制文字、表格、图片、公式等所有内容,从而实现跨浏览器像素级一致的排版输出。 核心技术特点: 渲染引擎基于 Canvas Draw,不依赖浏览器内置…