MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
仓库攻略
137 篇 · 137 个项目 · Agent 智能体 · 评测基准
Codex CLI 是 OpenAI 官方推出的轻量级终端编程智能体(coding agent),于 2025 年 4 月开源发布。与面向 IDE 插件的 Codex(Codex for IDE)不同,Codex CLI 是完全运行在终端的独立工具,支持 macOS、Linux、Windows 全平台。它由 OpenAI 的编码专用模型驱动,能理解代码库、读…
PaperOrchestra 是 Google 研究团队(Song et al., 2026)提出的一种多智能体学术论文写作框架(arXiv:2604.05018),其核心思路是用 5 个专责 Agent 流水线协作,把零散的研究材料(想法、实验记录、图表)转化为可直接投稿的 LaTeX 论文。 Ar9av/PaperOrchestra 则是将这篇论文的实现…
Nerve(The Simple Agent Development Kit)是一个用 YAML + CLI 构建、运行、评测和编排 LLM Agent 的轻量框架。它的核心理念是声明式 Agent:用 YAML 定义 system prompt、task、tools 和 variables,一个文件搞定一个 Agent,再通过 nerve CLI 驱动执行…
IntellAgent 是一个多智能体(multiagent)框架,专注于对话式 AI Agent 的系统性评测与诊断。 传统 agent 评测依赖人工构造测试用例,数量有限且难以覆盖真实世界的长尾边界情况。IntellAgent 的思路是:给定你的 agent 描述(prompt、工具定义、数据库 schema),自动生成数千种真实感强的边缘场景(edge…
DeepSeek Harness(dsh) 是 DeepSeek 官方于 20260813 开源的 Agent 运行时框架,MIT 许可证,用 TypeScript 开发。其核心理念是"一切皆插件"(everything is a plugin)——整个系统由一个可插拔的 profile 骨架和 60+ 官方能力包组成,模型无关,支持 Claude、GPT、…
MedSci Skills 是面向临床研究与医学人工智能的开源 Agent Skills 合集(MIT 许可证),由韩国首尔峨山医疗中心放射科医生兼研究员 Yoojin Nam, MD 构建,在真实出版物上测试通过。截至 v5.0 版本共包含 59 项技能,覆盖从文献检索、统计图表、报告指南合规审查到 AI 模型工程的全链路。 它并非通用 AI 科学家平台,…
RSIBenchData(Evolvent AI × 新加坡国立大学,arXiv:2607.25886,cs.SE,2026 年 7 月 28 日)是首个专门评测 LLM Agent 作为数据研究员(datacentric researcher)进行递归自我改进的受控基准。 它的核心问题:给一个固定的模型和训练基础设施,LLM Agent 能否自主诊断能力短…
Meta Muse Glimmer 是 Meta 超级智能实验室(Meta Superintelligence Lab)于 2026 年 8 月 开源发布的 ~29.6B 参数多模态推理模型,权重基于 Apache 2.0 许可证,完全开放商用。它是 Meta 自 Llama 时代之后首次重新发布开源权重,被 @rasbt 形容为「Llama 时代以来 Me…
Moli 是一个用 Rust 从零构建的浏览器引擎,专为 AI Agent 场景设计。它不依赖 Chromium,却又完整实现了 V8 JavaScript 引擎、原生 DOM、CSS 渲染、网络请求(Fetch/XHR/WebSocket)、Cookie、localStorage/IndexedDB/OPFS 等 Web 运行时。与传统浏览器自动化工具最大…
2026 年,AI 社区出现了一个重要认知转向:Agent 的表现瓶颈不在模型本身,而在包裹模型的那层工程结构——Harness(驾驭层)。Harness 由 @omarsar0(Elvis,研究机构 DAIR.AI 联合创始人)提出,核心主张是:Agent 的工具调用行为由 Harness 决定,而非工具数量;Harness 的核心能力是决定何时不调用工具…
Agent Research Copilot (ARC) 是一套面向理论物理研究的 LLMAgent 工作流,由 Yanjiao Ma、Yi Wang、Xingkai Zhang 三人署名,已发布 ChinaXiv:202606.00234(v1,202606)。它本身不是单一 CLI,而是「7 个可独立复用的 Python 包 + 一层对 coding a…
Future AGI 是一个开源 AI Agent 全生命周期管理平台,将评估(Evaluation)、追踪(Tracing)、防护(Guardrails)、仿真(Simulation)、网关路由(Gateway)、提示优化(Optimization)六大能力整合在同一个反馈闭环中,支持自托管(Docker Compose)和云端两种部署方式,核心定位是"让…
AssetOpsBench 是 IBM 研究院推出的工业资产运维 AI Agent 基准测试框架,已正式接收为 KDD 2026 Datasets & Benchmarks Track 论文。它模拟真实工业环境(工厂、车间设施),覆盖 9 大资产类别、141+ 运维场景、5 类领域专家 Agent(IoT/FMSR/TSFM/WO/Vibration),提供…
Prime Agent 是 Prime Intellect(2026 年 8 月 5 日开源)的自改进 Agent 编程框架,围绕两个核心抽象构建: RLM(Recursive Language Model):将上下文视为变量,把子 Agent 调用变成 REPL 内的函数调用(rlm(...)),替代传统的固定工具 schema + 上下文压缩方案。 Co…
devbrowser 是一个让 AI Agent(如 Claude Code、Codex)直接控制浏览器的 Claude Skill。它通过在 QuickJS WASM 沙箱中执行 JavaScript 脚本,实现浏览器自动化操作,同时保证宿主系统安全——脚本没有文件系统或网络访问权限。 核心定位:在 AI Coding 场景下,提供比传统 Playwrig…
⚠️ commit 时戳:本攻略基于 main 分支 SHA c2fe93deedfd0d1bd9fe7ef0601ea1b9c20ea24a(20260505 03:23 UTC,commit message "Make serenity output example more concrete")。仓库卡片显示「最近提交 20260505」,与 API …
⚠️ commit 时戳:本攻略基于 main 分支 SHA 89f82b3a96fb3e25a357a24bfd13b16e7fe4bf4e(20260805 15:41 UTC,commit message "Merge pull request #119 … 更新特别致谢与 Star History 图片")。仓库卡片显示「Stars 4939 / 周…
tRPCAgentGo 是一个 Go 原生的生产级 AI Agent 开发框架,GitHub 星标约 1647(截至 20260809,周增 +21),Apache2.0 许可证,最近一次提交 20260808(高度活跃)。 核心定位:让 AI Agent 应用符合 Go 服务的要求——并发安全、可观测、易部署,同时支持 A2A、AGUI、MCP 等主流协议…
《三年面试五年模拟》是一份中文开源 AIGC / 大模型 / AI Agent 算法工程师面试百科全书,由 AIGCmagic 社区维护,GitHub 星标 4276(截至 20260809,周增 +21)。内容分为算法岗和开发岗两大方向:算法岗覆盖 AIGC、LLM 大模型、AI Agent、具身智能、传统深度学习、计算机视觉、自然语言处理、强化学习、自动…
一个专注于 Context Engineering(上下文工程) 的 Agent Skills 合集,共 17 个 skills,涵盖上下文基础、注意力退化机制、多智能体架构、记忆系统、工具设计、评测框架、自优化循环等核心主题。这套 skills 的核心理念是:上下文窗口的限制不是靠"增加 Token 数"就能解决的,而是需要系统性地管理信息流入的质量和结构…
xixume/awesomepersonadistillskills 是一个围绕人格蒸馏(Persona Distillation)的 Agent Skills 精选列表。它不直接提供某个具体的 skill,而是收录了 GitHub 上所有"将人物、关系、纪念性场景或方法论蒸馏为 Agent Skill"的项目,形成一个人格 Skill 的 awesome …
一个 Agent Skill 集合,把"在终端里讲不清的复杂图表/表格/对比"从 ASCII art / monospace 字符画升级为自包含 HTML 页面或幻灯片,直接在浏览器中打开阅读。支持架构图、Mermaid 流程图、数据表、幻灯片、diff 评审、plan 对比、project recap 等多种形态。 与单一 harness 锁定不同,它同时…
academichumanizer 是一个针对学术论文和基金申请书的 AI 写作风格修订 skill,专为 Claude Code、Codex、MorphMind 等 AI coding/prose agent 设计。它的核心目标不是"检测 AI 生成内容",而是消除 AI 辅助写作中的机械腔、模板腔,让文字回到作者自己的声音,同时严格保持学术严谨性。 与市…
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…
本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlangai/OSWorldV2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。 OS…
literaturereviewagent 是一个基于 LangGraph 的可审计、可恢复多 Agent 文献综述工作流,包含两个独立可用的 Agent: Literature Search Agent:负责文献检索、去重、引文扩展,输出 literature.csv Literature Review Agent:负责从用户批准提纲和本地文献生成带证据的…
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
claudecode 是 Anthropic 官方出品的 agentic coding tool——一个常驻终端、读懂整个代码库的编程助手。它不是单纯的代码补全(LSP/IDE inline),而是一个能自主完成多文件修改、跑命令、做 git workflow 的 agent: 一句话定位:Anthropic 的 "终端 agent 编程助手"——和 Ope…
anthropics/skills 是 Anthropic 官方维护的 Agent Skills 示例与规范仓库。所谓 "Skill"(在 Anthropic 体系里),是一个带 YAML frontmatter 的 Markdown 指令包:一个文件夹 + 一份 SKILL.md + 一组可选脚本/资源,Claude 在识别到任务匹配时会动态加载并执行它。…