Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
仓库攻略
239 篇 · 235 个项目 · Agent 智能体 · LLM 基础设施
khazixskills 是「数字生命卡兹克」作者开源的一套 AI Agent Skills 合集,遵循 Agent Skills 开放标准,可直接被 Claude Code、Codex、Qoder、Kimi Code、iFlow、CodeBuddy、Cursor 等 40+ 支持该标准的 Agent 安装加载。每个 Skill 都是一段结构化指令集,让 A…
mcpcontextforge(README 自称 ContextForge)是一个由 IBM 开源的 AI Gateway / Registry / Proxy:它把任意数量的 MCP(Model Context Protocol)服务器、A2A(AgenttoAgent)服务器、REST/gRPC 后端统一汇聚到一个端点后面,对 AI 客户端(Claud…
TradingAgents 是一个多 Agent LLM 金融交易研究框架,模拟真实交易公司的组织架构:基本面分析师、舆情分析师、技术分析师、交易员、风险管理团队和投资组合经理,各自运作后通过结构化辩论达成交易决策。它基于 LangGraph 构建,支持 OpenAI GPT、Claude、Gemini、DeepSeek、Qwen、MiniMax、Grok …
andrejkarpathyskills 是一个单一 CLAUDE.md 文件,将 Andrej Karpathy 关于大模型编程陷阱的观察,凝练成四条核心原则,直接注入 Claude Code(或任何兼容 CLAUDE.md 的 Agent)的行为指导。这不是工具,不是代码库,是一套让 AI Coding Agent 减少"自作主张、过度工程、误改无关代码…
clawcode 是 UltraWorkers 工具链中的 Rust 版 CLI Agent 运行框架(claw CLI)的 canonical 实现。它是 LazyCodex 和 GajaeCode 的底层基础设施,提供一个本地运行的 AI 编码 Agent,支持 Anthropic API(Claude 系列)等多 Provider,可通过 REPL 交…
QM 是一个多人 AI 编程智能体平台,设计目标是让一个 AI 编程智能体服务于整个公司,而非仅限于个人助手。与传统单人 Copilot 不同,QM 通过「scope(作用域)」机制实现多用户隔离与协作: 核心:TypeScript / Node.js,HTTP 层用 Fastify Slack 插件:Scaffolded with Bolt Web UI:…
ECHO(Environment Crossentropy Hybrid Objective)是一个让 CLI Agent 在 RL 训练过程中同时学习预测环境响应(terminal 输出)的混合目标函数,来自论文 arXiv:2605.24517(2026 年 5 月),由 Microsoft Research AI Frontiers 和 Prime I…
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
Better Agents 是由 LangWatch 团队开源的 CLI 工具 + 一套工程规范,旨在让 AI 编码助手(Claude Code、Cursor、Kilocode 等)成为真正的"Agent 专家",能按照行业最佳实践构建、测试和评估 AI Agent 项目。 它不替换已有的 Agent 框架(Agno、Mastra、LangGraph 等),…
UnityMCP(Unity Model Context Protocol)是一个将 Unity Editor 和 Runtime 接入 AI Agent(MCP 协议)的插件生态。装好后,AI Agent(如 Claude Code、Cursor、Copilot)能直接操作 Unity 场景、创建 GameObject、读写脚本、运行测试、截屏返回画面,实…
Agently(pip install agently)是一个 Python GenAI 应用开发框架,主打"让模型输出稳定可控、让 AI 服务像后端服务一样可观测、可恢复"。它的核心抽象是 AgentExecution:把一次推理涉及的 prompt、策略、Actions、Skill 绑定、process 流、TaskContext 证据、结果视图统一收口…
LlamaParse Retrieval Harness(发布于 2026 年 6 月 29 日)是 LlamaIndex 在 LlamaParse Index v2 中推出的一套面向 Agent 的文档检索工具集。它不再把文档库当成一个静态向量数据库让 Agent 做一次语义搜索,而是把整个索引暴露为一组类文件系统接口——Agent 可以主动 list、g…
PocketFlow 是一个仅用 100 行 Python 代码实现的轻量级 LLM 框架,核心思想是将 LLM 应用建模为有向图(Graph)。框架本身零依赖(仅需 asyncio),安装包仅 56KB,却能表达 Agent、Workflow、RAG、MultiAgent 等常见设计模式。 作者的核心论点是:市面上的主流 LLM 框架(LangChain、…
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Claude Code 动态工作流(Dynamic Workflows)是 Anthropic 于 2026 年 5 月 28 日(随 Opus 4.8 发布)推出的研究预览功能,核心解决一个长期难题:LLM Agent 的编排逻辑(即"谁在什么时机调用谁")本质上是硬编码的,无法动态适应任务规模。 动态工作流的解法是:让 Claude 自己写一个 Java…
MCP Router 是一个桌面端(Desktop)的 MCP 服务器统一管理应用,自定位为 "Unified MCP Server Management App / MCP Manager"。Model Context Protocol(MCP)是 Anthropic 推出的"让 LLM 调用外部工具/数据源"的开放协议,过去一年 MCP 服务器数量爆炸—…
envd(ɪnˈvdɪ,读作 "invideo")是 TensorChord 开源的一个面向 AI/ML 的容器化开发环境构建工具。它用一个声明式的 build.envd 文件描述你的训练/推理环境,然后用一个 envd up 命令把它打包成 OCI 兼容的镜像,并在本地(或远端 K8s 集群)跑起来。 它不是 Dockerfile 的替代品那种简单封装——…
koreanlawmcp 是一个基于韩国法制处(법제처)Open API 的 MCP(Model Context Protocol)服务器,同时附带 CLI 工具。它将韩国 42 个官方法律 API 压缩为 10 个核心工具,让 AI 助手(Claude Desktop、Cursor、Windsurf、Zed 等)能够实时查询、验证和分析韩国成文法和判例。 …
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…
jCodeMunch 是一个基于 treesitter AST 解析的 MCP 服务器,专门解决 AI Agent 在代码库探索时「读整个文件找一句话」的 token 浪费问题。它对仓库做一次索引,之后每次检索只返回精确的函数、类、方法、常量符号——实测平均减少 95%+ 的 token 消耗(官方 live benchmark 20260723:15 项任…
NitroStack 是一个用 TypeScript 构建的生产级 MCP(Model Context Protocol)服务器全栈框架。它包含核心 SDK(@nitrostack/core)、脚手架 CLI(@nitrostack/cli)、React UI 组件库(@nitrostack/widgets)以及配套桌面 IDE(NitroStudio),覆…
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
run-llama/llama_index
Stars 51,547
代表
run-llama/llama_index
Stars 51,547
OmniRoute 是一个自托管 AI 网关,用单一端点聚合 278+ 提供商(含 90+ 免费层)的 500+ 模型,替开发者省去逐一对接每个 AI 提供商的麻烦。它支持自动 fallback 组合、Token 压缩、多策略路由、MCP 服务器、A2A 代理协议、内存持久化、Guardrails 安全过滤、TLS 指纹伪装等企业级特性,同时提供 Web 界…
VibeTrading 是香港大学数据智能实验室(HKUDS)开源的个人量化交易智能体框架,定位为"让任何 AI Agent 都具备完整交易研究能力"的一条命令式工具链。装好后,你的 Agent 可以做市场研究、策略编写、回测、因子分析、Shadow Account 行为诊断、券商账户审计,最终生成可交付的研究报告——覆盖 A 股、港股、美股、加密货币、期货…
codereviewgraph(简称 CRG)是一个本地优先的代码智能图谱工具,为 MCP(Model Context Protocol)兼容的 AI 编程助手和 CLI 环境设计。它的核心思路是:先把你的代码库解析成一张结构化的知识图谱(节点 = 函数/类/导入,边 = 调用/继承/测试覆盖),然后在 AI 做代码审查时只喂给它真正相关的文件,而不是把整个…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
CSGHub 是 OpenCSG 团队开源的"LLM 资产管理平台",定位对标 Hugging Face:把模型(LLM/VLM)、数据集、Space 应用、代码片段当作一等资产,统一在一个平台上做上传、下载、版本管理、权限分发、推理部署和数据处理。整套系统由 Go(Gin)+ Rails 旧版迁移中的 Vue3 前端、PostgreSQL 元数据、Apac…
Apache Burr(incubating)是一个 Python 状态机框架,用来构建"会做决策的应用"——chatbot、agent、simulation、人机协作工具。它把应用建模成一张 state machine(状态机/流程图): Burr 的关键设计哲学是 "框架无关":它不规定你必须用哪个 LLM SDK、哪个 vector DB、哪个 age…
OpenLIT 是一个开源的 AI Engineering 平台,定位是"一站式把 LLM 应用从实验推到生产"。它把 OpenTelemetry 当作统一底座,向上提供 6 类核心能力: 1. 可观测性 SDK(Python / TypeScript / Go):对 50+ LLM provider、VectorDB、Agent 框架、GPU 做自动埋点(…