Sakana Fugu:用 RL Conductor 调度多模型军团 · 干货攻略

  • 链接: https://x.com/omarsar0/status/2051306659021242635
  • 分类: x-tips
  • 来源: X @omarsar0
  • 作者: Jay
  • 更新: 2026-07-18
  • 仓库: SakanaAI/fugu

这是什么

Sakana Fugu 是 Sakana AI 在 2026 年发布的多智能体编排系统,其核心是一个 7B 参数的 Conductor 模型。该模型不自己解题,而是像"管理者"一样动态决定:

  • 调用哪些专家模型(worker pool 包含 GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8 等)
  • 每个 worker 分配什么任务
  • worker 之间如何通信(谁能看到谁的输出)
  • 最终如何合成结果

用户只需调用一个 API,Fugu 内部自动组装最优 agent 团队、编排工作流、返回统一结果。Sakana AI 官方将其定位为"collective intelligence"——集体智能,用编排而非更大的单模型来扩展能力边界。

产品层面有两个版本: - Fugu:单 worker 路径,低延迟,适合日常使用 - Fugu-Ultra:多 worker 组合,高质量,面向最难的任务


为什么值得关注

谁在分享: @omarsar0(Sakana AI 合作研究者),帖子引用了 ICLR 2026 论文,并附上了 Beta 产品链接。

解决什么问题: 当前多 agent 系统多数依赖人工设计的工作流(如固定 pipeline、MoE 路由),这些方案在垂直场景有效,但在面对多样化用户需求时成为瓶颈(原文:"an inherent bottleneck arises when targeting domains with large user bases with very heterogeneous demands"——VentureBeat 采访)。Fugu 用 RL 让编排策略本身学会适应每个问题,而不是靠人工预设。

核心理念: 不再靠训更大的单模型来突破能力边界,而是通过学习最优模型协作策略来释放现有模型的全部潜力。这是一种新的 scaling 轴:test-time orchestration scaling


核验过程

官方来源

来源 读取内容 关键数字/结论
GitHub README 安装方式(curl 一键安装)、API 接入方式、基础架构说明 curl -fsSL https://sakana.ai/fugu/install \| bash;Codex 启动 codex-fugu
Conductor 论文(ICLR 2026) 7B Conductor 训练方法、benchmark 原始数字 GPQA-Diamond 87.5%、LiveCodeBench 83.9%(论文发表时);超越 pool 内所有 worker 模型
Technical Report(arXiv 2606.21228) 2026年6月更新的完整系统描述、Fugu vs Fugu-Ultra 两个版本 Fugu-Ultra GPQA 95.5%、SWE-Bench Pro 73.7%;Claude Opus 4.8 69.2%、GPT-5.5 58.6%、Gemini 3.1 Pro 54.2%
Sakana 官网 产品定位、API 兼容性(OpenAI-compatible)、GDPR 限制说明 两个版本 Fugu / Fugu-Ultra;不支持 EU/EEA
Sakana AI 官方 X 论文发布公告 确认 87.5% GPQA-D、83.9% LiveCodeBench;worker pool 含 GPT-5、Gemini、Claude 及开源模型

交叉验证

  • BenchLM GPQA Diamond 排行榜(benchlm.ai):截至 2026 年 7 月 13 日,Fugu-Ultra 以 95.5% 排名第一,高于 GPT-5.6 Sol(94.6%)。这与 Technical Report 数字吻合。
  • DataCamp 报道(datacamp.com):确认 SWE-Bench Pro 73.7%、Claude Opus 4.8 69.2% 等具体数字。
  • Explainx 评测(explainx.ai):Ethan Mollick 实际测试发现 Shader 类任务运行 30 分钟、结果未达 Fable 5 水平——这是值得关注的 gap,详见"坑"章节。
  • VentureBeat 采访:确认了 hard-coded pipeline 瓶颈问题,以及 Conductor 不生成最终答案而是输出工作流步骤(natural language 格式)这一关键设计细节。

⚠️ 数字说明

X 帖中引用的 87.5% / 83.9%Conductor 论文(2025年12月提交/ICLR 2026) 的原始数字,对应的是早期实验版本。2026年6月发布的 Technical Report 中 Fugu-Ultra 的数字已更新:GPQA 95.5%(比早期提升约 8 个百分点)。本攻略以 官方最新数字(Technical Report / benchlm.ai 实时榜单)为准。


上手步骤

方式一:Codex 集成(推荐快速试用)

# 一键安装
curl -fsSL https://sakana.ai/fugu/install | bash

# 启动
codex-fugu

支持 Ubuntu 和 macOS。Windows 或安装失败时参考手动配置指南

方式二:API 调用(生产使用)

Fugu 提供 OpenAI 兼容 API,支持 Chat Completions 和 Responses 两种接口:

# OpenAI Python SDK 即可直连 Sakana API
from openai import OpenAI

client = OpenAI(
    api_key="your-sakana-api-key",
    base_url="https://api.sakana.ai/v1"  # 需在 console.sakana.ai/get-started 获取
)

# 方式1: Chat Completions
response = client.chat.completions.create(
    model="fugu",          # 或 "fugu-ultra"
    messages=[{"role": "user", "content": "Solve this LeetCode hard problem..."}]
)

# 方式2: Responses(适合 agent 场景)
response = client.responses.create(
    model="fugu-ultra",
    input="Explain why this code has a race condition..."
)

方式三:模型池配置(自定义)

可排除特定 provider 或模型以满足合规要求:

# 在 API 请求中配置 agent pool 偏好(需查阅 console.sakana.ai 文档)
# 示例思路:
pool_config = {
    "exclude_providers": ["some-provider"],
    "preferred_models": ["claude-opus", "gpt-5.5"]
}

获取 API Key

访问 console.sakana.ai/get-started,注册后获取 key。


坑与适用边界

1. 延迟:复杂任务可能很慢

Ethan Mollick 在实际评测中报告 shader 任务运行约 30 分钟。Fugu-Ultra 多 worker 组合路径延迟显著高于单次模型调用。如果追求低延迟,Fugu(非 Ultra)更合适。

2. 数字 gap:论文数字 vs 实际表现

原帖声称 Conductor 7B 超越所有 worker 模型、GPQA-D 87.5%。 但需注意: - 这是 2025 年 12 月论文数字,非当前商用 Fugu 版本 - 当前 Fugu-Ultra 已是 95.5%,但 Explainx 等第三方实测在某些任务上仍不及 Fable 5 - 结论:论文数字可靠,但实际任务表现取决于任务类型;对标竞品应以 Technical Report 的公开评测为准

3. EU/EEA 不可用

官方明确表示目前不支持欧盟/EEA 区域(GDPR 合规中)。有欧盟数据合规需求的项目暂不可用。

4. Worker Pool 动态更新

官方说明 Fugu 的 agent pool 和 coordinator 会随新 frontier 模型发布持续更新。因此不同时间点的评测结果可能不完全可复现。

5. 可控性有限

虽然支持排除特定 provider,但编排策略本身由 RL 学习得到,对具体调用哪个模型、如何组合的透明度有限,不适合需要 deterministic 执行路径的场景。

适用边界总结

场景 推荐版本 说明
日常编码 / 代码审查 Fugu 低延迟,单 worker 路由
复杂推理 / 高难任务 Fugu-Ultra 多 worker 组合,高质量
严格延迟要求(<5s) 不适合 多 agent 编排固有延迟
EU 合规项目 不适合 暂不支持
需要 deterministic 追踪 有限制 编排策略不透明
竞品调研 / 基准对比 可用但参考最新 Tech Report 论文数字已过时

一句话结论

Sakana Fugu 证明了"用 RL 学习多模型编排策略"是一条可行的 test-time scaling 路径——7B Conductor 确实能超越 pool 内更大的 worker 模型;当前 Fugu-Ultra 已达 GPQA 95.5% SOTA,适合高难度的 coding/推理任务,但 EU 不可用、实测延迟较高、对标论文数字需注意版本时效,适合作为前沿探索工具而非通用主力模型。