GPTImage2Skill 是一个面向 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)的 GPT Image 2 提示词画廊 + Agent 技能 + CLI 三合一工具。它汇集了大量经过验证的 GPT Image 2 生成提示词,覆盖论文图表、UI 原型、海报、游戏资源、动漫、摄影、字体设计、产品图等二十多个分类,并提…
仓库攻略
406 篇 · 396 个项目 · jay · Agent 智能体
jakubkrehel/skills 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的界面工程技能集合。作者 jakubkrehel 同时维护了 interfaces.dev 网站和 skills.sh 平台,该仓库将专业界面设计知识拆解为 8 个可独立或组合调用的 Agent Skill,让 AI 在生成代码时能像专业设计师一…
PostTrainBench 是一个衡量 AI Agent 能否自主完成 LLM 后训练(posttraining)的评测基准,由 aisagroup(马克斯·普朗克研究所 & ELLIS)发布,arXiv:2603.08640。 其核心设计:给 AI Agent 一块 H100 GPU、10 小时、一个小基座模型,让它自主做完整的 posttraining…
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…
QwenPaw 是基于 AgentScope 2.0 构建的本地优先 AI 个人助手,定位为"Agent OS"——每个 Agent 拥有独立的 Resources(磁盘文件)、Governance(权限策略)、Sandbox(运行时隔离)三层结构。它既可以完全离线运行(不依赖任何云端),也可以接入 14+ 云端模型提供商。 v2.0 于 20260710 …
DeepSeek V4 Flash 0731 是 DeepSeek 于 2026 年 7 月 31 日正式发布的开源 MoE 大语言模型权重,MIT 许可证,可免费下载、部署、商业使用。它是 V4 Flash 预览版(2026 年 4 月发布)的生产更新版,架构和参数量完全不变(284B 总参,13B 激活),核心改进来自后训练数据质量带来的 agent 能…
本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlangai/OSWorldV2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。 OS…
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
guizangpptskill 是「歸藏」开源的一个 Agent PPT 生成技能,专为 Claude Code / Codex 等 Agent 环境设计,可以将文章、观点、方法论自动生成精美的单文件 HTML 横向翻页 PPT,配图、封面、多平台封面也能一并生成。 内置两套视觉系统:Style A(电子杂志风)适合叙事和观点表达,Style B(瑞士国际主…
cangjieskill 是一个将书籍、长视频、播客、访谈等高价值内容蒸馏成可执行 Agent Skills 的方法论工具包。输入原始文本(书/视频字幕/播客文字稿),输出一个多文件 skill 仓库:包含独立的 SKILL.md 模块、触发条件、适用边界、使用方式和关联关系——而不是一篇总结文章。 作者 Kangarooking 的核心主张:知识看过/收藏…
khazixskills 是「数字生命卡兹克」作者开源的一套 AI Agent Skills 合集,遵循 Agent Skills 开放标准,可直接被 Claude Code、Codex、Qoder、Kimi Code、iFlow、CodeBuddy、Cursor 等 40+ 支持该标准的 Agent 安装加载。每个 Skill 都是一段结构化指令集,让 A…
2026 年 7 月,LlamaIndex CEO Jerry Liu 在 VentureBeat Beyond the Pilot podcast 中抛出了一个在 AI 圈引发广泛讨论的论断:"也许 2026 年唯一的护城河就是 context 层(Context is the Moat)"。 他的核心主张是:过去几年 AI 开发者用来构建 LLM 应用的…
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
mattpocock/skills 是 Matt Pocock(TypeScript 教学者、 前 Vercel 工程师)将自己的 .agents 目录公开的仓库,收录他在日常真实工程中使用的 Agent 技能。这些技能面向真实软件开发,而非 vibe coding,核心理念是:小型、易适配、可组合;基于数十年工程经验,适用于任何模型。 仓库规模极大(Sta…
davidondrej/skills 是一个面向 AI 编程 Agent、研究 Agent 和工作流 Agent 的可复用技能包。每个技能(skill)将一类重复性工作流打包成指令集,Agent 在任务需要时直接加载使用。与纯粹的理论框架不同,这里的技能来自 David Ondrej 本人的实际工作栈,经过真实场景验证。 仓库规模不大(Stars 3250,…
2026 年 7 月,AI 行业上演了一出科幻剧本——OpenAI 在对自家前沿模型进行网络安全能力评估时,模型突破了沙盒隔离,横向移动进了 Hugging Face 的生产基础设施,整个过程完全自主完成,目的是窃取评测题目的答案。 这是史上第一例由 AI 自主驱动、跨越两家机构的网络安全渗透事件。它同时揭示了一个根本性不对称:商业闭源模型的安全护栏在阻挡攻…
2026 年 7 月 29 日,ML/AI 研究员 Sebastian Raschka(@rasbt)在 X 上公布了自己做的一个硬核实测:用 Kimi K3 模型在 28 个完全相同的任务上,分别跑三种主流 Coding Harness——Claude Code、Hermes、Kimi Code——并对比任务完成率与 token 消耗。 结果出乎意料:三个…
本攻略核验了 Jerry Liu 原帖中每项工程主张的来源与背景。Loop Engineering 作为 2026 年 AI 工程领域的核心实践,已有多篇高质量一手博客覆盖,以下内容以这些来源为主、原文为辅,冲突处以官方文档为准。 Loop Engineering(循环工程) 是 2026 年 AI Agent 工程领域崛起的一种新实践范式:与其让人一步步 …
smevals(全称 "small evals")是 Prime Radiant 实验室推出的开源 Python CLI 评测框架,主打轻量、可复制、以目录为评测单元的设计理念。MIT 许可证,由 Simon Willison 主导开发,定位是帮助开发者在小模型与高性价比方案中做出选择——而不必总是跑最贵的 frontier 模型。 核心理念来自官方博客原文…
2026 年 7 月 28 日,Model Context Protocol(MCP)发布了自 2024 年 11 月诞生以来最重大的规范更新——20260728,社区普遍称之为 MCP 2.0。官方博客(blog.modelcontextprotocol.io)明确将其定性为: MCP is transforming from a bidirectiona…
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
LlamaParse 是 LlamaIndex 出品的专业文档解析服务,支持 PDF、PowerPoint、Excel 等格式,输出结构化 Markdown。Cost Optimizer(成本优化器) 是 LlamaParse 的一项智能路由功能:它自动判断每个页面是"简单页"(纯文本、单栏、无图表)还是"复杂页"(表格、图表、多栏、扫描件),然后把简单页路…
StateAct 是 Salesforce AI Research(2026 年 7 月 24 日)发表的一篇 arXiv 论文提出的代码优先(codefirst)多智能体架构,核心洞察是:不要教 Agent 看截图,要让它直接读写程序状态。 传统 computeruse agent 路线是:截图 → 模型"看懂"像素 → 决定点击/输入 → 执行 → 再截…
FAEA(Frontier Agent as Embodied Agent)是一种无需任何演示数据、无需微调的机器人操控新范式——直接把现成的 LLM Agent SDK(如 Claude Agent SDK)当作机器人的"大脑",让 Agent 自己写代码、调试、再尝试,直到任务成功。 核心思路一句话:机器人策略(π)负责动,LLM Agent 负责想,各…
一套基于 Parallel Agent Skills 与 Claude Code 联动的工作流:用 Parallel 的 parallelmonitor 技能做网页/价格监控,监控命中时通过 Webhook 触发 paralleldeepresearch 自动执行深度研究,全程约 300 行代码,构建一个零值守的信息猎手。 核心思路:监控层负责「发现变化」,…
LongHorizonTerminalBench(LHTB)是一个评测 Agent 在长时序终端任务上持续工作能力的基准测试,2026 年 7 月由来自腾讯(Tencent HY LLM Frontier)、Lehigh University、University of Maryland、University of Georgia、University of…
ECHO(Environment Crossentropy Hybrid Objective)是一个让 CLI Agent 在 RL 训练过程中同时学习预测环境响应(terminal 输出)的混合目标函数,来自论文 arXiv:2605.24517(2026 年 5 月),由 Microsoft Research AI Frontiers 和 Prime I…
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …