beam-cloud/beta9 · 上手攻略

  • 仓库:beam-cloud/beta9
  • 链接:https://github.com/beam-cloud/beta9
  • 分类:Serverless GPU 推理平台
  • 作者:Tom
  • 更新:2026-08-21

这是什么

beta9 是 Beam 公司的开源 serverless GPU 运行时引擎,为 AI 工作负载提供极速冷启动(<1 秒)的容器化部署能力。它支持 GPU 推理、沙箱隔离执行和后台任务队列,底层通过自定义容器运行时(非标准 Docker)和分布式缓存实现亚秒级冷启动。

Beam 官方提供托管云服务(beam.cloud),同时 beta9 完全开源,支持自托管,是目前开源社区中冷启动速度最快的 serverless GPU 平台之一。

解决什么问题

GPU 云服务部署有两个核心痛点:一是冷启动慢——标准 Docker 容器在 GPU 实例上启动往往需要 30 秒以上,影响 serverless 的"随用随启"体验;二是基础设施复杂——需要管理容器编排、GPU 调度、模型权重分发等多层复杂度。

beta9 通过三个核心技术创新解决这两个问题: 1. 自定义容器运行时:绕过标准 Docker,直接管理容器生命周期 2. 嵌入式缓存:容器镜像分层懒加载,无需完整拉取即可启动 3. 分布式存储层 + 内存快照:GPU checkpoint 快速恢复

⚠️ 注意:beta9 是 Beam 云平台的开源引擎,自托管免费;托管云服务通过 beam.cloud 收费。

快速安装

安装 Beam SDK

pip install beam-client

⚠️ Python 版本:示例使用 Python 3.11,具体要求视具体镜像而定,建议 python >= 3.10

云端使用(托管服务)

# 1. 创建 Beam 账号:https://beam.cloud

# 2. 登录
beam login

# 3. 快速开始,Follow their Getting Started Guide
# https://platform.beam.cloud/onboarding

自托管部署

beta9 支持在自有 GPU 机器(支持 NVIDIA GPU)上自托管,具体步骤参考 GitHub 仓库的部署文档。核心要求:

  • NVIDIA GPU(需 CUDA 支持)
  • Linux 系统
  • 存储卷支持(FUSE 等分布式存储)

⚠️ 自托管复杂度:生产级自托管涉及网络、存储、GPU 调度等多方面配置,建议先体验托管版再评估自托管成本。


核心用法

1. 沙箱隔离执行(最常用场景)

在远程隔离容器中运行 LLM 生成的代码,无需管理服务器:

from beam import Image, Sandbox

# 创建沙箱容器
sandbox = Sandbox(image=Image()).create()

# 在远程容器中执行代码
response = sandbox.process.run_code("print('I am running remotely')")

print(response.result)  # -> "I am running remotely"

2. GPU 推理端点(自定义模型部署)

from beam import Image, endpoint, QueueDepthAutoscaler

@endpoint(
    image=Image(python_version="python3.11"),
    gpu="A10G",       # ⚠️ GPU 类型:T4 / A10G / A100 / H100 / RTX 4090 等
    cpu=2,
    memory="16Gi",
    autoscaler=QueueDepthAutoscaler(
        max_containers=5,
        tasks_per_container=30
    )
)
def handler():
    return {"label": "cat", "confidence": 0.97}

部署后,端点自动扩缩容(0 → 5 容器),按实际运行时间计费。

3. 后台任务队列(替代 Celery)

from beam import Image, TaskPolicy, schema, task_queue

class Input(schema.Schema):
    image_url: str

@task_queue(
    name="image-processor",
    image=Image(python_version="python3.11"),
    cpu=1,
    memory=1024,           # MB
    inputs=Input,
    task_policy=TaskPolicy(max_retries=3),
)
def my_background_task(input: Input, *, context):
    image_url = input.image_url
    print(f"Processing image: {image_url}")
    return {"image_url": image_url}

if __name__ == "__main__":
    # 从应用内触发后台任务(无需部署)
    my_background_task.put(image_url="https://example.com/image.jpg")

    # 或部署为持久服务
    # beam deploy app.py:my_background_task --name image-processor

Beam 定价参考

⚠️ 以下价格参考 2025 年中信息,实际价格以 beam.cloud/pricing 最新公示为准。

资源 价格参考
免费额度 每月 $30 免费 credit
RTX 4090 ~$0.42/hr
H100 ~$1.74/hr(自托管免费)
Sandboxes ~$0.319/hr
特点 按毫秒计费,scale-to-zero

典型适用场景

场景 推荐功能
LLM 生成代码的沙箱执行 Sandbox.process.run_code()
AI 应用 API 部署 @endpoint + GPU 配置
批量推理 beta9.map() 并行到 100+ 容器
替代 Celery / SQS @task_queue 装饰器
代理/IP 池 轻量沙箱 + scale-to-zero
AI 应用原型验证 Beam 托管版快速部署

坑与注意

  1. GPU 类型需明确指定gpu 参数必须与可用 GPU 列表匹配(T4/A10G/A100/H100/RTX 4090),不支持动态选择,建议根据模型显存需求选型(7B 模型 → T4 或 A10G;70B+ 模型 → A100 或 H100)。
  2. 大规模镜像构建慢:官方提示镜像 >10GiB 时构建时间较长,优化方向:精简基础镜像、多阶段构建、预热缓存。
  3. 冷启动不等于零延迟:beta9 的 <1 秒冷启动是行业领先水平,但首次请求仍有网络 RTT + 容器启动时间;高频场景建议配置最小实例数保活。
  4. 托管 vs 自托管计费差异:托管版按运行时间计费,自托管版免费但需自行承担 GPU 机器成本;长期高频使用场景建议做 TCO 对比。
  5. AGPL-3.0 许可证:beta9 本身是 AGPL-3.0 开源,但 Beam 云服务是商业产品;自托管无需向用户开放源码,但若修改 beta9 源码并对外提供服务,需遵循 AGPL-3.0。
  6. 非中国区服务:Beam 是境外服务(Y Combinator 支持),国内访问需注意网络延迟和合规问题。

与同类对比

特性 beta9 (Beam) Modal RunPod Serverless Baseten
冷启动速度 <1 秒(最快) 10-20 秒 5-15 秒 20-30 秒
开源 ✅ AGPL-3.0 ❌ 闭源 ❌ 闭源 ❌ 闭源
自托管 ✅ 完全免费
GPU 种类 T4/A10G/A100/H100/4090 T4/A10G/A100/H100 T4/A10G/RTX 4090 T4/A10G/A100
免费额度 $30/月 $30/月 有限 有限
Scale-to-Zero
沙箱隔离

一句话结论:如果你的 AI 应用需要极速冷启动的 serverless GPU 能力,且重视开源可审计性,beta9 是目前最优选择——它冷启动最快、支持自托管免费使用、社区活跃;如果需要开箱即用的托管服务且不在意冷启动那十几秒差距,Modal 和 RunPod 也是成熟选项。


相关资源

  • 官方文档:https://docs.beam.cloud(托管服务)
  • GitHub:https://github.com/beam-cloud/beta9
  • Beam 主站:https://beam.cloud
  • 定价页:https://beam.cloud/pricing
  • 自托管指南:参见 GitHub 仓库 README.md
  • Blog 对比文章:https://www.beam.cloud/blog/top-serverless-gpu-providers(2025 年度 serverless GPU 横向对比)