PilotDeck 是一个以 WorkSpace 为核心单元的 AI Agent 操作系统,由清华大学 THUNLP、ModelBest、OpenBMB 和 AI9Stars 联合开发,2026 年 5 月 28 日正式开源。定位是"面向长时间、多项目并行 AI 生产力工作"的 Agent 平台,核心理念是把 AI Agent 从"你问我答"的单轮工具,变成…
仓库攻略
244 篇 · 241 个项目 · Agent 智能体 · jay
claudeskills(v0.4.16)是面向 Claude Code 的专业技能包,内含 67 个专业化 Skill 和 9 个项目工作流,覆盖 12 个分类:语言(Python/TypeScript/Go/Rust等)、前端框架、后端框架、基础设施、云、API与架构、质量测试、DevOps、安全、数据与ML、平台专家、工作流命令。 它的核心价值是把"大…
代表攻略
VoltAgent/awesome-agent-skills · 上手攻略
VoltAgent/awesomeagentskills 是一个人工精选的 Agent Skill 合集,收录了 1000+ 来自官方开发团队与社区的高质量 Agent Skills,兼容 Claude Code、Codex、Gemini CLI、Cursor、GitHub Copilot、OpenCode、Windsurf 等主流 AI 编程工具。与批量 …
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
VoltAgent/awesome-agent-skills
Stars 29,971
代表
heilcheng/awesome-agent-skills
Stars 6,081
ICMArchitect 是一个 Claude Code 技能(Skill),用于将任何流程、想法或问题设计成 ICM 工作区——即一套文件夹结构作为 Agent 架构。它也可以把一个已有文件夹/代码库重新组织成 ICM 格式。 ICM 全称 Interpretable Context Methodology(可解释的上下文方法论),源自论文 Interpr…
本攻略核验了论文摘要、arXiv HTML 全文(2607.24280)、GitHub 仓库(README)、AI Weekly 报道及 Qwen3 官方博客中的所有关键数字与模型名称。JSON 协议字段描述、三个教师模型名称(ClaudeOpus4.6、GPT5.5、Gemini3.1Pro)及七项基准名称来自论文原文;Qwen31.7B/4B 架构参数来…
GPTImage2Skill 是一个面向 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)的 GPT Image 2 提示词画廊 + Agent 技能 + CLI 三合一工具。它汇集了大量经过验证的 GPT Image 2 生成提示词,覆盖论文图表、UI 原型、海报、游戏资源、动漫、摄影、字体设计、产品图等二十多个分类,并提…
jakubkrehel/skills 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的界面工程技能集合。作者 jakubkrehel 同时维护了 interfaces.dev 网站和 skills.sh 平台,该仓库将专业界面设计知识拆解为 8 个可独立或组合调用的 Agent Skill,让 AI 在生成代码时能像专业设计师一…
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…
QwenPaw 是基于 AgentScope 2.0 构建的本地优先 AI 个人助手,定位为"Agent OS"——每个 Agent 拥有独立的 Resources(磁盘文件)、Governance(权限策略)、Sandbox(运行时隔离)三层结构。它既可以完全离线运行(不依赖任何云端),也可以接入 14+ 云端模型提供商。 v2.0 于 20260710 …
本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlangai/OSWorldV2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。 OS…
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
guizangpptskill 是「歸藏」开源的一个 Agent PPT 生成技能,专为 Claude Code / Codex 等 Agent 环境设计,可以将文章、观点、方法论自动生成精美的单文件 HTML 横向翻页 PPT,配图、封面、多平台封面也能一并生成。 内置两套视觉系统:Style A(电子杂志风)适合叙事和观点表达,Style B(瑞士国际主…
cangjieskill 是一个将书籍、长视频、播客、访谈等高价值内容蒸馏成可执行 Agent Skills 的方法论工具包。输入原始文本(书/视频字幕/播客文字稿),输出一个多文件 skill 仓库:包含独立的 SKILL.md 模块、触发条件、适用边界、使用方式和关联关系——而不是一篇总结文章。 作者 Kangarooking 的核心主张:知识看过/收藏…
khazixskills 是「数字生命卡兹克」作者开源的一套 AI Agent Skills 合集,遵循 Agent Skills 开放标准,可直接被 Claude Code、Codex、Qoder、Kimi Code、iFlow、CodeBuddy、Cursor 等 40+ 支持该标准的 Agent 安装加载。每个 Skill 都是一段结构化指令集,让 A…
mattpocock/skills 是 Matt Pocock(TypeScript 教学者、 前 Vercel 工程师)将自己的 .agents 目录公开的仓库,收录他在日常真实工程中使用的 Agent 技能。这些技能面向真实软件开发,而非 vibe coding,核心理念是:小型、易适配、可组合;基于数十年工程经验,适用于任何模型。 仓库规模极大(Sta…
davidondrej/skills 是一个面向 AI 编程 Agent、研究 Agent 和工作流 Agent 的可复用技能包。每个技能(skill)将一类重复性工作流打包成指令集,Agent 在任务需要时直接加载使用。与纯粹的理论框架不同,这里的技能来自 David Ondrej 本人的实际工作栈,经过真实场景验证。 仓库规模不大(Stars 3250,…
本攻略核验了 Jerry Liu 原帖中每项工程主张的来源与背景。Loop Engineering 作为 2026 年 AI 工程领域的核心实践,已有多篇高质量一手博客覆盖,以下内容以这些来源为主、原文为辅,冲突处以官方文档为准。 Loop Engineering(循环工程) 是 2026 年 AI Agent 工程领域崛起的一种新实践范式:与其让人一步步 …
StateAct 是 Salesforce AI Research(2026 年 7 月 24 日)发表的一篇 arXiv 论文提出的代码优先(codefirst)多智能体架构,核心洞察是:不要教 Agent 看截图,要让它直接读写程序状态。 传统 computeruse agent 路线是:截图 → 模型"看懂"像素 → 决定点击/输入 → 执行 → 再截…
FAEA(Frontier Agent as Embodied Agent)是一种无需任何演示数据、无需微调的机器人操控新范式——直接把现成的 LLM Agent SDK(如 Claude Agent SDK)当作机器人的"大脑",让 Agent 自己写代码、调试、再尝试,直到任务成功。 核心思路一句话:机器人策略(π)负责动,LLM Agent 负责想,各…
LongHorizonTerminalBench(LHTB)是一个评测 Agent 在长时序终端任务上持续工作能力的基准测试,2026 年 7 月由来自腾讯(Tencent HY LLM Frontier)、Lehigh University、University of Maryland、University of Georgia、University of…
ECHO(Environment Crossentropy Hybrid Objective)是一个让 CLI Agent 在 RL 训练过程中同时学习预测环境响应(terminal 输出)的混合目标函数,来自论文 arXiv:2605.24517(2026 年 5 月),由 Microsoft Research AI Frontiers 和 Prime I…
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
LlamaParse Retrieval Harness(发布于 2026 年 6 月 29 日)是 LlamaIndex 在 LlamaParse Index v2 中推出的一套面向 Agent 的文档检索工具集。它不再把文档库当成一个静态向量数据库让 Agent 做一次语义搜索,而是把整个索引暴露为一组类文件系统接口——Agent 可以主动 list、g…
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Claude Code 动态工作流(Dynamic Workflows)是 Anthropic 于 2026 年 5 月 28 日(随 Opus 4.8 发布)推出的研究预览功能,核心解决一个长期难题:LLM Agent 的编排逻辑(即"谁在什么时机调用谁")本质上是硬编码的,无法动态适应任务规模。 动态工作流的解法是:让 Claude 自己写一个 Java…
一个多角色 Agent 团队研究工作流:用不同角色的 Agent(侦察员、批评员、总结员)组成研究小队,让它们像真实团队一样协作——各司其职、互相review、自动输出结论——而不是把问题扔给一个 LLM 然后祈祷它答对。 核心洞察来自 @omarsar0(Elvis,DAIR.AI 研究员):同一个 LLM 既写答案又评答案,本身就是盲点。解决方案不是换更…
koreanlawmcp 是一个基于韩国法制处(법제처)Open API 的 MCP(Model Context Protocol)服务器,同时附带 CLI 工具。它将韩国 42 个官方法律 API 压缩为 10 个核心工具,让 AI 助手(Claude Desktop、Cursor、Windsurf、Zed 等)能够实时查询、验证和分析韩国成文法和判例。 …
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
run-llama/llama_index
Stars 51,547
代表
run-llama/llama_index
Stars 51,547