CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
仓库攻略
1018 篇 · 995 个项目 · Agent 智能体
⚠️ 本文为公开 README 与官方 docs 的二次整理,版本与数字以下方 fetch 到的内容为准,后续以仓库 release 为准。 Archestra 是一个面向企业的一体化 AI Agent 平台,把 LLM 代理、网关、Guardrails、MCP 注册表、Agent Runtime 全部塞进同一个控制平面。它的核心目标用户画像是「工程师 + …
内容待复核
punkpeye/awesome-remote-mcp-servers · 上手攻略
Remote MCP Server(远程 MCP 服务器)是一种由第三方运维、仅通过 URL 对外暴露的 Model Context Protocol 端点。与传统的本地 MCP 服务器(需要 npm、PyPI、Docker 或二进制安装,并在本地以 stdio 进程运行)不同,远程 MCP 服务器由服务提供方托管,用户只需在 AI 客户端中配置一个 URL…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
MobileCode 是一个基于 opencode 的开源 AI 编程助手 fork,专注于移动端项目(iOS + Android)的实时预览与构建。它让 AI 编程助手能够直接感知、移动、运行你的 iOS 和 Android 项目,并在编程界面旁边内嵌实时模拟器/模拟器画面——一个 Play 按钮同时驱动 React Native 的 iOS 和 Andr…
realapipricing 是一个开放数据项目,核心目标是回答一个简单但长期被回避的问题:订阅制 AI API 的真实单价到底是多少? 厂商宣传的往往是「月费 × 额度」,但不同厂商的 token 计量方式、额度刷新规则、缓存计费方式差异巨大,直接比较毫无意义。该项目用统一的标准工作负载(97.5% 缓存读取 + 2.15% 普通输入 + 0.35% 输出…
论文 "Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses"(arXiv:2609.05736,EMNLP 2026)来自 Airbnb 团队,核心贡献有两层: 第一层:量化评估协议。 论文指出,对 harness(围绕固定模型的运行时控制层)的优化效果不能只看均值提升,必须在预算…
EdgeEver 是一个开源、面向 AI Agent 时代重做的个人/团队知识库。它致敬 Evernote 经典的三栏布局(笔记本树 + 笔记列表 + 大编辑器),同时用现代化的 Web 技术栈(Bun workspace + Vite/React + TipTap/ProseMirror + Tailwind/shadcn/ui + Dexie + PWA…
Open Science Desktop(简称 OSD,原名"Open Science",v0.5.2 为当前最新版)是一个本地优先、模型无关的 AI 科研工作台,面向 macOS、Windows 和 Linux。它用 Tauri 构建桌面外壳,内嵌 OpenCode 运行时,通过 MCP 协议连接科学数据库和 agent 技能,可以完成从文献调研、实验设计…
Webcmd 是一个面向 AI 编程 agent 的自学习浏览器基础设施。它的核心思路很直接:让 agent 在真实浏览器中完成任务,同时把网站的结构知识(sitemap、action space、pitfalls)留在本地,下次同类任务不再重复探测,直接从记忆启动。据 README 描述,理论上可将浏览器 agent 的 token 消耗降低 90%。 它…
okfagentmemory 是一个面向 AI 编码代理(Claude Code、Cursor、Codex、Gemini CLI 等)的 Git 原生持久化记忆层。它把项目里的"长期知识"以符合 Google Open Knowledge Format(OKF)v0.2 规范的 Markdown + YAML frontmatter 文件形式,存在仓库的 k…
gentlepi 是一个 Pi Coding Agent 的操作治理层(harness),将 Pi 从一个强大的自由式编码助手,转变为受 SpecDriven Development(SDD) 规范约束的开发环境。 核心理念:大多数 AI coding agent 失败的原因不是模型能力不足,而是工作流缺乏纪律——需求不清就动手、架构决策消失在聊天记录里、测…
一个开箱即用的部署配方(recipe),用于在单台 NVIDIA DGX Spark(GB10,121 GiB 统一内存)上通过 vLLM 服务 Qwen3.8FlashNextNVFP4 大模型。 核心工程挑战:Qwen3.8FlashNext 原版 FP8 权重约 135 GB,单台 Spark 只有 128 GB 统一内存,直接跑会 OOM。这个配方通…
yjh051108/dshagiharness 是一套 DSH(DeepSeek Harness)插件组合,运行于 DeepSeek 官方开源的 DSH 运行时之上(MIT 协议,v0.1+)。它的核心定位是给 LLM 一个「可托付的身体」——把模型训练改不出来的三种能力:诚实(说到做到)、索取(缺料主动要)、经验沉淀与唤醒(学过的记下、下次会用),变成机器…
ChromaFs 是 Mintlify 在 2026 年 3 月发布的一种虚拟文件系统(Virtual Filesystem)实现,它把 Chroma 向量数据库包装成 Agent 可用 ls、cat、grep、find、cd 等 UNIX 命令操作的"文件系统",从而替代传统的 naive RAG 方案。 核心洞察来自 Mintlify 工程师 Dens …
Kitter 是一个用 Rust + GPUI 构建的轻量级 AI Agent Skills 桌面管理器,附带独立的 CLI。它解决的是"同一套 Skill 在多个项目里各自维护一份副本"这个常见痛点——在项目之间共享链接(managed links)而不是独立副本,一处更新,所有项目同步生效。 概念简单:Library(技能库) → Projects(项目…
本攻略面向已经把 Claude Code / Codex / Cursor 等"会读 SKILL.md 的编码代理"装进日常开发流的人——你想让代理真的会用 NVIDIA 那套 CUDAX、AI Blueprint、DOCA、NeMo 工具链,而不是写一段看起来像、实际跑不起来的伪代码。NVIDIA/skills 这个仓库就是 NVIDIA 自己写好、扫描过…
⚠️ 读前必看:本文所有命令、版本号、文件名均直接来自仓库 README(main 分支,20260908 commit 可见)与仓库卡片元数据。⚠️ 个别点已在文末「坑与注意」逐条标出:Go 版本号(README 声称 go.mod 要求 1.25.5,与已知 Go 发行版序列不一致,待核)、适配器清单中出现的 MiniMax、Mimo(未在公开生态中检索…
agentty 是一个用 C++26 编写的终端 AI 结对编程工具,以单文件静态二进制分发(16.7 MB),冷启动约 3 ms,号称是 Claude Code 的平替。核心特点:零运行时依赖(无 Node/Python/npm)、智能代码检索(Hybrid BM25 + Embeddings + GraphRAG)、支持任意 LLM 提供者(Anthro…
Neo.mjs 是一个自演进软件有机体——一支专业端到端 AI 工程团队,跨模型(Claude / Gemini / GPT 等) swarm 协同,通过 Neural Link(神经链接)进驻实际应用,在内存核心(Memory Core)、知识库(Knowledge Base)、Native Edge Graph、A2A 协调层上自主完成从构思到构建到交叉…
Sa2VA 是字节跳动 Seed 团队联合 UC Merced / WHU / PKU 在 2026 年开源的 Pixel LLM 系列旗舰仓库,核心论文《Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos》已被 IEEE TPAMI 202…
AI Research Preference Models(RPMs)是 Meta FAIR 团队(联合牛津大学、UCL)提出的一种新方法,核心问题是:AI 研究 Agent 能提出远多于能跑实验的候选方案,但 GPU 预算有限,如何在跑之前就知道哪个最值得跑? RPM 的思路是:不预测绝对分数(论文发现 LLM 在预测具体指标上不可靠),而是用预训练冻结的…
Paper Workbench 是一个纯 Python 标准库驱动的学术论文全流程流水线引擎,本地运行,零外部依赖(核心仅用 Python 标准库)。它的核心理念是: AI 干体力活,机器把守验证,关键判断留给人。 工作台覆盖从文献调研 → 定期刊 → 搭框架 → 写作 → 八步审查 → 投稿六大阶段,每一阶段的推进都必须过机器门禁——检查点没有真实证据凭据…
HarnessRouter Community Edition 是一个 Apache2.0 自托管的 agent harness 统一网关,把市面上几款主流的 AI 编程 / Agent CLI(Codex、Claude Code、Hermes、Pi、DeepSeek Harness / DSH)封装成同一套 HTTP API。开发者不再为每个 harnes…
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
⚠️ 本文写作日期 20260907。仓库当前最新 release 为 v3.27.0(发布日期 20260826,来源: 首页 README 段落 "purple v3.27.0 20260826")。README 头条:"7300+ tests, MIT licensed, single binary"。所有命令均经 README 抓取确认(202609…
⚠️ 本文写作日期 20260907。MCP server 功能自 StackQL 0.9.250 起可用(来源:StackQL 官方博客 "StackQL MCP Server Now Available")。所有命令与字段以本文抓取时(20260907 07:33 UTC)的 README 与官方文档为准;版本细节请以 为准。 StackQL 是一个 G…
⚠️ 本文写作日期为 20260907。文中命令、快捷键与安装文件名均来自 GitHub 仓库 README 与 AGENTS.md 的 fetch 结果(20260907 07:33 UTC)。仓库未打 release tag 的具体版本号未能从公开 README 拿到,以下"版本"相关表述以"latest"或 commit 级说明代替,使用前请以 页面为…
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…
Claude Fable 5.1 使用的是与 Claude Fable 5 相同的 tokenizer(该 tokenizer 首次随 Claude Opus 4.7 引入)。相比 Opus 4.7 之前的模型(如 Fable 4、Sonnet 4.6 等),相同文本会多产生约 30% 的 token。 这不是 API 接口的变化——请求格式、流式事件结构完…