Apodex 1.1 是 2026 年 8 月 24 日发布的一篇 70+ 作者论文(arXiv:2608.23283),全称 Scaling Agentic Intelligence for Complex Work。论文提出了一个通用 agent 执行系统,核心目标是把语言模型的「推理能力」转化为「可持续完成可验收工作」的能力——作者称之为 Workin…
仓库攻略
137 篇 · 137 个项目 · Agent 智能体 · 评测基准
ClaudeSkills 是13 个精选 Agent Skills 的合集,以开放的 SKILL.md 格式 打包。每一个 Skill 都是一个完整的任务方法包:步骤、模板、脚本、示例、验收标准全部文件化,安装到任何支持 Agent Skills 格式的客户端即可使用。 核心区别:Prompt 用一次就没了,Skill 把方法留下来,可复用、可检查、可改进。…
AthenaPublic 是一个本地优先的 agentic PKM(个人知识管理)系统,定位是"任何 LLM 的记忆层与治理层"。核心理念是: Own the state. Rent the intelligence. Platforms forget. Athena doesn't. 把记忆搬到本地 Markdown 文件,换模型不丢记忆,记忆会随 ses…
secondbrain 是一个个人 agentic OS(操作系统级框架),核心理念是"把 AI 助手做成你机器的操作系统"。通过本地文件智能 + 工作流自动化 + 多模态消息平台通信,完成从文件处理、代码执行、邮件管理到网页搜索的全套任务。 核心架构分 10 个模块: 1. Attachment Parsing — 解析各类附件(图片/文档/音频等) 2.…
FrontierAgent 是 ApodexAI 开源的一个agent 运行时 + 终端产品 + 评测套件三位一体项目,定位是"长程研究代理和基于文件工作的完整解决方案"。核心由三层组成: 配套 Apodex 商业平台(API Key 接入),也支持自托管 SGLang 模型。 长程 agent 任务长期面临几个痛点: 1. 缺乏结构化并行:传统 ReAct…
SmolVM(smolmachines/smolvm)是一个开源的轻量级 microVM 运行时,专门解决 AI Agent 执行 LLM 生成代码时的隔离问题。由 Aniket Maurya 与 Celesto AI 团队开发,Apache 2.0 开源协议,2026 年 4 月 21 日正式发布,GitHub 发布首日即获得 482 个 HN 点。 官方…
这是 Victor Dibia(Microsoft Research 首席研究软件工程师、AutoGen 与 AutoGen Studio 作者)所著《Designing MultiAgent Systems: Principles, Patterns, and Implementation for AI Agents》(2025)的官方配套代码仓库。仓库核…
DARE(Declarative Autonomous Research Engine)是一个 AI 原生科研编排系统,宣称"不是帮你做研究的工具,而是研究者本身"。900+ 纯 Markdown 格式 skill 组成 10 个可自由组合的研究包,按 4 层指挥链架构(Campaign → Strategy → Tactic → SOP)组织,配有 6 个…
CAID(Centralized Asynchronous Isolated Delegation)是一个面向长程软件工程任务的多 Agent 协调范式,由卡内基梅隆大学(CMU)研究团队提出,发表在 arXiv 2603.21489。核心思路是:将人类软件工程中的成熟协作基础设施(git worktree、branchandmerge、测试验证)直接映射到…
x64dbgMCPServer 是一个将 x64dbg 调试器通过 MCP(Model Context Protocol) 协议暴露为 HTTP 服务的原生插件。使用 Zig 语言编写,零外部依赖,一个插件文件同时支持 x32 和 x64 架构。连接任何 MCP 兼容的 AI 助手(如 Claude Code),即可通过自然语言控制 x64dbg:设置断点、…
自检:双轨 ✓(机制 + 工程路径)/ ⚠️ 数字核验 3 处(85 crate / ~340K 行 / 368 组测试 / 4.61s 响应均来自仓库自述,未独立复测)/ 私域污染 SUM=0 / CJK 估算 ~1700 / verifiability:核心 URL 已 fetch,LLM 端到端实测数据仅仓库自报。 Apeireth 自称 "AGI o…
CORAL 是一个面向「自动研究 / 自动进化」场景的多智能体基础设施。它不是某个具体模型,而是把"让多个 coding agent 持续跑实验、共享笔记、互相学习、迭代解法"这件事做成一套可以一键拉起的运行时:把现有代码库喂给它,再配一个打分器(grader),CORAL 就接管剩下的活——隔离工作区、跑评估、维护共享状态、调度多 agent 协作。 原生…
SynaLinks/synalinksskills 是一套面向 AI 编程 Agent 的 SKILL.md 技能包,专门教 Claude Code、Codex、OpenCode、pi 等主流 coding agent 如何写出符合 SynaLinks 框架规范的代码。技能本身是一个标准化的 SKILL.md 文件,基于 Anthropic 主导的 Agen…
WISP(Workspace for Intelligent Scientific Practice)是一个开源、本地优先的桌面 AI 科研工作台,将文献检索、Python/R 执行、~80 个科学数据库查询、AI 模型调用集成在一个项目中,支持 SSH/WSL/本地 GPU 多种计算后端,数据和凭证保留在本地不传云端。 AI 辅助科研工具普遍存在两个问题:…
AwesomeLLMsforVulnerabilityDetection 是一个社区维护的精选论文 / 项目 / Agent Skill 索引,专注于"用大语言模型做软件漏洞检测"这个交叉方向。仓库由 huhusmang 维护,README 主表只展示 2025 年及之后的论文,2024 年及之前的单独归档在 docs/papers_archive.md,分…
Code Mode(@utcp/codemode)是让 AI Agent 通过执行代码而非传统 JSON toolcalling 来调用工具的库。核心思路:给 Agent 一个能写 TypeScript 代码的沙盒执行环境,Agent 在代码里直接调用 MCP/UTCP 工具,一行代码替代传统方案的 15+ 次工具调用轮次。 Apple ML、Cloudfl…
Artificial Analysis Search Index(搜索 API 指数)是一个专门针对 AI Agent 搜索工具 的评测基准,由 AI 数据分析平台 Artificial Analysis(AA)于 2026 年 8 月 18 日正式发布。它的核心思路非常干净——用同一个 Agent 环境(模型、工具调用上限、评测任务完全相同),只替换底层的…
potholereporter 是一个纯客户端 Android 应用,用 AI 视觉检测班加罗尔(Bengaluru)道路坑洞,自动关联公共采购记录找到负责官员和承包商,生成一份可编辑的投诉邮件草稿,由你审核后手动发送。 核心特点:没有服务端、不需要账号、不自动发邮件——一切都在本地完成,你掌控每一步。App 扫描约 2,900 份政府合同记录用于关联,检测…
Ante(读作「anti」)是 Antigma Labs 开源的一个自包含(selfcontained)终端编程智能体,核心定位是"Harness(工具架)优先,而非模型绑定"。作者观点鲜明:好用的 Agent 依赖的不只是模型,更是一套经过精细调校的执行框架(harness),而这套框架应该与模型解耦、可以自由替换。 一句话类比:Ante ≈ Claude…
TrueForge 是 TrueFoundry 于 2026 年 8 月开源的 MIT 许可证 Agent Harness——运行在 LLM 周围的运行时层,把一个语言模型变成可真正跑在生产环境里的 Agent。它不挑模型、不绑云、不锁供应商,可以本地单进程(SQLite)运行,也可以 Docker Compose / Kubernetes 部署高可用集群。…
WFGY(万法归一 / WanFaGuiYi)是一个面向 AI 推理、RAG 与 Agent 工作流的开源协议与工具生态系统。它的核心主张是:在嵌入空间(embedding space)中构建语义场定律(semantic field laws),让 LLM 能够自我收敛推理路径,减少 RAG 漂移、幻觉和"幽灵匹配"问题。 当前公开的最新版本为 WFGY 5…
MisakaNet 是一个面向 AI 编程 Agent 的"失败记忆"知识库。它本身不是 Agent 框架、不是向量数据库、不是云服务,它的定位非常窄:让 Agent 在跑代码撞墙时,能搜到一条"别人已经踩过、且给出可复制修复路径"的经验。 仓库以纯 Git + Markdown + Python 标准库的形式存在(misakanetcore 是独立 PyP…
Cumora(cumora.ai)是一个AI Agent 团队协作平台,定位为"多 Agent team chat"——AI Agent 和人类共同出现在同一个通讯录、同一组对话里,Agent 不只是被动的问答机器,而是有身份(persona)、有记忆、能认领任务、相互协调而不打架的存在。 核心特点: ⚠️ 截至 202608,Cumora 处于 invit…
Ax 是 TypeScript 版的 DSPy——一个为 LLM 构建的编程模型和训练框架,但用 TypeScript 实现,号称"几乎就是 TypeScript 的官方 DSPy"。它同一个语义核心还编译到 Python、Java、C++、Go 和 Rust,让你写一次 LLM 程序,跨多个语言生态运行。 核心特点: 签名驱动的结构化生成(typed st…
本攻略核验了所有数字与说法:准确率来自 ExtractBench 官方论文(arXiv:2607.29677)及 GitHub README;FTX 矩阵案例来自 Jerry Liu 原文;各 tier 定价来自 ExtractBench GitHub 页;与原帖说法一致处直接引用,与官方文档冲突处以官方为准并注明。 LlamaExtract Agentic…
UltraRAG 是由清华大学 THUNLP、东北大学 NEUIR、OpenBMB、AI9stars 联合推出的低代码 RAG 开发框架,基于 MCP(Model Context Protocol)架构设计。它将 RAG 的核心组件(检索器 Retriever、生成器 Generation、语料处理 Corpus、评估 Evaluation)拆解为独立的 M…
Genkit 是 Google Firebase 团队开源的全栈 AI 应用开发框架,支持 JavaScript/TypeScript(生产就绪)、Go(生产就绪)、Python(Beta)、Dart(Preview)四种语言,可对接 Google Gemini、OpenAI、Anthropic、Ollama 等主流模型厂商。 核心理念:一套 API 走天下…
Agent Governance Toolkit (AGT) 是微软在 20252026 年推出的开源 agent runtime governance 工具箱。它不重做 agent 框架,而是在 LangChain / CrewAI / OpenAI Agents / AutoGen / Google ADK 等任意框架外,套一层"policy enfor…
NVIDIA NemoClaw 是一个 alpha 阶段的参考实现栈(reference stack),把"已经在市面上流通的 AI 智能体 CLI"包进 NVIDIA OpenShell 沙箱里跑。它的目标不是再造一个 agent,而是给"agent 已经能跑了、但我想让它跑得可控、可审计、可回滚"的场景,提供一整套安装、生命周期、网络策略、托管推理、快照…
Open Science 是一个开源、localfirst、modelagnostic 的 AI 科研工作台,由专用的 AI Agent 驱动,帮助研究者完成从文献调研、假设生成到代码执行、数据分析、可视化、报告产出的全流程,所有结果都可追溯到产生它的完整活动记录。 它的核心定位是:把大模型 Agent 变成一个可信赖的科研搭档,而非一个聊天玩具。运行在研究…