future-agi/future-agi · 上手攻略

  • 仓库:future-agi/future-agi
  • 链接:https://github.com/future-agi/future-agi
  • 分类:agent · evaluation · observability · guardrails
  • 作者:Tom
  • 更新:2026-08-10

是什么

Future AGI 是一个开源 AI Agent 全生命周期管理平台,将评估(Evaluation)、追踪(Tracing)、防护(Guardrails)、仿真(Simulation)、网关路由(Gateway)、提示优化(Optimization)六大能力整合在同一个反馈闭环中,支持自托管(Docker Compose)和云端两种部署方式,核心定位是"让 AI Agent 从原型到生产都能自我改进"。

官方口号:"Most AI agents fail in production — Future AGI collapses all of it into one platform and one feedback loop."


解决什么问题

当前团队构建 AI Agent 通常需要拼接多个独立工具:Langfuse(追踪)+ Braintrust/Agenta(评估)+ Helicone(观测)+ Guardrails AI(防护)+ 自建仿真器。这些工具之间数据不互通,无法形成真正的改进闭环——你在生产环境看到某个 trace 的问题,但没有渠道把这个案例自动注入到评估集。

Future AGI 的核心思路是:仿真 → 评估 → 防护 → 监控 → 优化,所有数据在一个反馈循环里流动,生产 trace 直接喂给 prompt 优化算法,形成真正的自我改进。


快速安装

云端(最快,无需安装)

注册即用,免费额度充足:

# 直接访问
https://app.futureagi.com/auth/jwt/register

Docker 自托管(macOS / Linux / WSL)

git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install

# 启动后访问
open http://localhost:3000

Windows(PowerShell):

git clone https://github.com/future-agi/future-agi.git
cd future-agi
.\bin\install.ps1

⚠️ 自托管需要 Docker Desktop 或 Docker Engine + Docker Compose 环境。生产部署使用 ./deploy/setup.sh 生成密钥并固定镜像版本。


核心用法

Python 接入(追踪已有代码)

from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor

register(project_name="my-agent")
OpenAIInstrumentor().instrument()

# 你的现有 OpenAI 代码无需修改,自动开始追踪
import openai
client = openai.OpenAI()
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": query}],
)

TypeScript / Node.js 接入

import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";

register({ projectName: "my-agent" });
new OpenAIInstrumentation().instrument();

// 现有 OpenAI 调用自动追踪
const response = await openai.chat.completions.create({
    model: "gpt-4o",
    messages: [{ role: "user", content: query }],
});

评估(50+ 指标)

from futureagi.agentic_eval import evaluate

results = evaluate(
    project_name="my-agent",
    dataset="customer-support-qa",
    metrics=["groundedness", "hallucination", "tool_use_correctness", "pii"],
)
print(results)

支持指标:groundedness(答案依据性)、hallucination(幻觉率)、tool_use_correctness(工具调用正确性)、PII 检测、自定义评分卡(LLM-as-judge + 启发式 + ML 三种裁判)。

仿真场景生成

from futureagi.simulate import ScenarioGenerator

gen = ScenarioGenerator(persona="adversarial-user")
scenarios = gen.generate(n=50, domain="finance")
# 生成对抗性用户画像的测试场景

支持文本和语音(LiveKit、VAPI、Retell、Pipecat)两种仿真模式。

网关路由(OpenAI 兼容)

# 配置 provider
export OPENAI_API_KEY=sk-xxx
export LITELLM_BASE_URL=https://your-litellm-host/v1

# 通过 Future AGI 网关调用任意 provider
curl -X POST http://localhost:4000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <future-agi-key>" \
  -d '{"model": "anthropic/claude-3-5-sonnet", "messages": [...]}'

网关 ~29k req/s,P99 ≤ 21ms(开启 guardrails 后),支持 100+ provider、15 种路由策略、语义缓存、虚拟 key、MCP、A2A 协议。

防护规则

from futureagi.protect import Guardrail

guard = Guardrail(
    scanners=["pii", "jailbreak", "injection"],
    vendor_adapters=["llamaguard", "presidio"],
)

result = guard.check(user_input="Ignore previous instructions and...")
print(result.blocked, result.reason)

内置 18 种 scanner,15 种 vendor adapter(Lakera、Presidio、Llama Guard 等)。


典型适用场景

场景 适用模块
Agent 生产上线前评估 Simulation + Evaluation:生成对抗性测试集,量化成功率
生产环境可观测性 Tracing:50+ 框架自动插桩,OpenTelemetry 导出
Prompt 自动优化 Optimization:6 种算法(GEPA/PromptWizard/ProTeGi/Bayesian/Meta-Prompt/Random),生产 trace 反馈训练
API 网关统一管理 Gateway:聚合多个 LLM provider,灵活路由
Guardrails 合规检测 Protect:PII / 越狱 / 提示注入实时拦截
多框架统一观测 Tracing:LangChain、LlamaIndex、CrewAI、DSPy 等 50+ 框架零配置插桩

坑与注意

  1. Nightly 版本警示:README 明确标注当前为"Nightly release for early testing,expect rough edges,stable version coming soon"——生产环境建议等官方 stable tag,不宜在核心业务线直接上线

  2. Python 3.11+ / Node 20+:明确要求,过低版本可能有运行时问题

  3. Go 网关基准数字:~9.9ns weighted routing / ~29k req/s on t3.xlarge / P99 ≤ 21ms ——这是官方 benchmark 数据,未提供独立复现脚本,路由策略差异可能导致实际性能波动

  4. Kubernetes 支持状态Kubernetes / Helm ⏳ 标注为"coming soon",生产级 K8s 部署暂时不可用

  5. SOC 2 / HIPAA 仅限云端:自托管版本不自动继承这些合规认证,需要额外评估

  6. OpenTelemetry 依赖:Tracing 模块依赖 OTLP 协议,需要配套的后端接收服务(如 Jaeger、Zipkin、ClickHouse)

  7. 组件独立性:文档强调各 SDK 可独立使用(traceAI、agentic_eval、simulate 等),但整体平台集成需要 Docker Compose 环境完整启动


与同类对比

维度 Future AGI Langfuse Braintrust Helicone Guardrails AI
定位 全生命周期平台 追踪 评估 追踪 防护
自托管 ✅ Docker ✅ 开源
评估指标数 50+ 有限 20+ 有限 专注安全
仿真模块 ✅ 内置
Prompt 优化 ✅ 6 种算法
网关路由 ✅ 100+ provider
许可 Apache 2.0 MIT 专有 专有 MIT
成熟度 Nightly / 不稳定 Stable Stable Stable Stable

Future AGI 是目前唯一将仿真、评估、追踪、防护、路由、优化六大模块统一在 Apache 2.0 许可下的开源平台,对标的是整个"Agent 开发和运维栈"的整合,而非单一工具的替代。


一句话推荐结论

如果你受够了在 Langfuse + Braintrust + Helicone + Guardrails AI 之间来回切换数据,Future AGI 的统一反馈闭环思路值得一试——尤其是仿真 + 评估 + Prompt 优化的联动对快速迭代 Agent 原型很有价值,但目前 Nightly 状态意味着生产使用需要等待 stable 版本。


原始链接: - 仓库:https://github.com/future-agi/future-agi - 官网:https://futureagi.com - 文档:https://docs.futureagi.com - PyPI:https://pypi.org/project/ai-evaluation/ - Discord:https://discord.com/invite/n2tCUKBkAw