VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
仓库攻略
1530 篇 · 1501 个项目
oilui 是一个 AI 原生 UI 设计方法论框架,本质上是一套结构化设计流程(不是 Figma 插件,也不是代码库),通过一套明确的步骤让 AI Agent 生成高质量、可交付的网页或 App 界面设计。 它以 Claude Code Skill(或兼容 npx skills 的 Agent)的形式分发,安装后直接把设计任务交给 Agent,Agent …
VectorCraft 是一个用纯 Rust 从零实现的 Adobe Illustrator 替代品,由 ArtCraft 团队开发。团队称之为"清洁室实现"(cleanroom)——完全独立重写,不依赖 Adobe 任何代码。它的目标不是简单复刻 UI,而是完整还原 Illustrator 的工作流程和渲染能力,同时让 AI Agent 可以像人一样驱动这…
RE:Dox 是卡普空技术研发部开源的高性能 .NET 结构化数据引擎,核心是一个 64 位 Token DOM,将 JSON/CBOR/MessagePack 等多种格式统一解析为紧凑的 Token 中间表示,再驱动序列化、反序列化、原地编辑和格式转换——比 System.Text.Json 最高快 2.8 倍并行反序列化,内存分配仅后者的约 1/3。 R…
哈佛团队(Aayush Karan、Sitan Chen、Yilun Du)提出 Projection Sampling(投影采样):在 SFT 训练前,用 MCMC(MetropolisHastings)把离策略(offpolicy)的专家轨迹逐步重写为贴近基础模型分布的轨迹,再送进标准 SFT。论文标题开宗明义——SFT Learns Better Th…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
| 维度 | 实测 | ||| | 项目类型 | 每日中文 AI 安全日报 + 论文清单 + Agent 接入(Skill + MCP)| | 出刊时间 | 北京时间每日 08:00(README 标注;UTC 00:00)| | 接入方式 | npx skills add / claude mcp add / HTTP API / RSS | | 论文导出…
2026 年 10 月 3 日,Simon Willison(Django 联合创始人、DataSette 作者)在 simonwillison.net 发文,系统阐述了 LLM API 与 AI Agent 必须在服务层面默认开启硬性预算上限 这一工程原则。 核心主张:一切按量付费的 API 和云服务,都应该让用户能设置"月度消费超 $X 后直接返回错误、…
Paxeer X 是一个分布式超状态机(Distributed HyperState Machine),用于支付、代码执行和意图路由,专为自主 AI Agent 设计。它通过一条仅追加的 Activity 日志作为唯一权威来源,实现可验证的确定性执行。 整个系统分为两层: 架构核心哲学:一致性执行必须排除一切非确定性因素——不允许浮点数运算、本地时钟决定、数…
StashBase 是一个本地优先的 AI 写作工作区,核心理念是「像 IDE 一样写作,但由 AI 驱动」。它允许你用自己的知识库(文件、笔记、过往写作)作为上下文,让 Claude 或 Codex 帮你起草、修改、审查文章,而不必把私有内容交给第三方。 关键差异化在于文档 Diff 视图:AI 对 Markdown 文档的修改不是行级别的代码 Diff,…
2026 年 10 月 1 日,Hugging Face 与 Liquid AI 联合发布了 OpenEnv 多 Harness 同步 RL 训练栈,核心方法论见"The ultimate guide to multiharness RL"(Adithya S Kolavi 等 8 位作者)。该工作的核心洞察是: 同一个模型权重,在不同 Agent Harn…
FPF(First Principles Framework)是一套 AI 原生的声明式模式语言(pattern language)体系,面向系统工程、研究和管理的知识框架。 FPF 的核心思想是:为工程师和 AI Agent 提供一套共享、精确的语言,用来描述系统(System)、方法(Method)、工作(Work)、证据(Evidence)、决策(De…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
⚠️ 数据来源声明:本攻略基于 README.md(20261004 fetch · 200 OK)、FEATURES.md、官方站点 excelmcpserver.dev/installation/、SkillsLLM 安全报告及仓库 metadata。所有命令、版本号均经官方页面核验;如无独立三方核对处,会在文中标注「官方自述」。 ⚠️ 操作数偏差:仓库…
这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。 在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是: 用现有开源模型,…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
DSH Desktop(Bundle Edition)是一个社区维护的 DeepSeek Harness 桌面发行版。它直接运行官方 DeepSeek Harness npm 运行时与官方 dshwebapp,并预装一组经过固定和验证的社区 Bundle。用户无需手动安装 Node.js、配置插件或维护多套插件状态,打开应用即可从同一个 DSH Profil…
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5(模型 ID:claudesonnet55),这是 Claude 5.5 系列的第二款模型,第一款是同年 9 月 22 日的旗舰款 Opus 5.5。Sonnet 5.5 定位于「高质量日常任务」,定位在 Opus 5.5 之下,但在多项编码评测中超越了 Opus 5…
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
MCP(Model Context Protocol)是 Anthropic 于 2024 年末开源的 AI Agent 工具调用协议,旨在标准化"大模型如何调用外部工具"这件事。2026 年 7 月 28 日,MCP 发布重大版本(规范代号 20260728),核心变化是彻底移除会话层,将协议改造为纯请求/响应无状态架构。 这次变化直接影响:使用 MCP …
PraisonAI 是一个开源的多智能体(MultiAgent)开发与部署框架,定位在 AutoGen / CrewAI 之上,主打"五层架构 + 五行代码即可上线"的低门槛路线。截至 2026 年中,Stars 约 9118,支持 100+ LLM 提供方,核心包装为 praisonaiagents Python 包。 它不只是另一个"给 Agent 装工…
FastEmbed 是一个轻量、快速的 Python 向量嵌入生成库,由 Qdrant 团队开发和维护。它使用 ONNX Runtime 替代 PyTorch 作为推理后端,主打「无需 GPU、不下载 GB 级 PyTorch 依赖」就能跑 StateoftheArt 嵌入模型。 核心能力覆盖:稠密文本嵌入、稀疏嵌入(SPLADE++)、晚交互嵌入(ColB…
agentoffice 是一个共享 3D 虚拟办公室,把你的代码团队(包括 Claude Code、Codex、OpenCode、Grok、Muse、DeepSeek Harness、Pi、Cursor 等 AI 编程 Agent)放进一个卡通风格的 3D 世界里。每个 GitHub 仓库对应一栋楼的一层,AI Worker 坐在工位上,实时显示各自的终端—…
Looped Transformer(循环 Transformer)是一种通过复用同一组层权重、多次遍历来增加有效计算深度的架构设计。与传统 Transformer 堆叠 N 层独立权重不同,Looped Transformer 将同一组权重作用于输入多次,等效于用更少参数实现更深网络。 典型案例: OuroThinking 2.6B:全部层循环 4 次,产…
ufocore 是一个开源的 AI Agent 运行时(runtime),让团队成员在聊天中给 AI Agent 分配任务,Agent 可以读取文件和执行命令来完成工作。它是 UFO 托管服务(ufo.ai)的开源实现,支持自托管,用自己的模型 API key 在自己的基础设施上运行 AI Agent。 核心设计哲学:一个进程,多种部署规模。SQLite +…
SAG(SQLRetrieval Augmented Generation)是 ZleapAI 提出的一种全新检索架构,不是对传统 dense RAG 和 GraphRAG 的缝合,而是用事件实体索引 + 查询时动态超边(hyperedge)的原生设计,在语义检索和关系推理上合二为一。 SAG 同时也是一个完整的知识库应用(桌面 + Docker 部署),支…
premierepromcp 是一个基于 MCP(Model Context Protocol) 的本地优先服务器,让 AI 助手(Claude、Codex、Cursor 等)通过 Adobe Premiere Pro 原生 CEP/ExtendScript 接口直接控制 Premiere Pro。它不是 Premiere 的 AI 生成功能,而是给 AI …