facebookresearch/vggt-omega · 上手攻略
- 仓库:facebookresearch/vggt-omega
- 链接:https://github.com/facebookresearch/vggt-omega
- 分类:3D 重建 / 计算机视觉 / feed-forward 模型
- 作者:Tom
- 更新:2026-08-06
这是什么
VGGT-Omega(VGGT-Ω)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 2025 Best Paper)的大幅升级版。
核心定位:用 transformer 吸收传统几何管线的全部工作,更快、更准、可扩展。
解决什么问题
此前做 3D 重建,标准流程是 COLMAP(Structure-from-Motion)+ Multi-View Stereo(MVS),这是一套需要迭代优化、耗时数分钟到数小时的管线。VGGT(2025)证明了前向网络已经可以在部分场景逼近 COLMAP,但内存占用大、泛化有限。VGGT-Ω 在此基础上解决了三个问题:
- 精度随规模可预测增长:作者证明 3D 重建质量随模型参数和数据规模线性可扩展,而非碰运气
- 动态场景支持:前作主要针对静态场景,VGGT-Ω 扩展到含运动物体的视频输入
- 训练效率大幅提升:相较 VGGT,内存降至 30%,推理速度提升 1.6×
典型输出包括:
- extrinsics / intrinsics:每张图的相机位姿(外参)和焦距等(内参)
- depth / depth_conf:每个像素的深度值与置信度
- camera_tokens / registers:场景级 token,可供下游 VLA 模型使用
快速安装
# 克隆仓库(不支持 HTTPS,请配 SSH key 或用 --depth=1)
git clone git@github.com:facebookresearch/vggt-omega.git
cd vggt-omega
# 安装依赖
pip install -r requirements.txt
pip install -e .
# 安装 Demo 依赖(如需 Gradio 可视化)
pip install -r requirements_demo.txt
硬件要求:模型推理在 单张 NVIDIA A100(40GB) 上验证通过(见下方显存基准)。HuggingFace 下载模型需单独申请权限,审核由自动化系统完成。
核心用法
最小可跑代码(Python)
⚠️ 模型权重需先向 HuggingFace 申请:https://huggingface.co/facebook/VGGT-Omega 审核通过后手动下载
.pt文件,路径填入checkpoint_path。
import torch
from vggt_omega.models import VGGTOmega
from vggt_omega.utils.load_fn import load_and_preprocess_images
from vggt_omega.utils.pose_enc import encoding_to_camera
# 路径替换为实际下载的权重文件
checkpoint_path = "path/to/vggt_omega_1b_512.pt"
image_names = ["path/to/imageA.png", "path/to/imageB.png", "path/to/imageC.png"]
# 加载模型(1B 参数,512px 分辨率版)
model = VGGTOmega().to("cuda").eval()
model.load_state_dict(torch.load(checkpoint_path, map_location="cpu"))
# 图片预处理
images = load_and_preprocess_images(
image_names,
image_resolution=512 # 512 或 256
).to("cuda")
# 前向推理
with torch.inference_mode():
predictions = model(images)
# 解析相机参数
extrinsics, intrinsics = encoding_to_camera(
predictions["pose_enc"],
predictions["images"].shape[-2:],
)
depth = predictions["depth"] # (B, N, H, W)
depth_conf = predictions["depth_conf"] # 置信度
camera_and_register_tokens = predictions["camera_and_register_tokens"]
含文本对齐版本(需单独 checkpoint):
model = VGGTOmega(enable_alignment=True) # 分辨率=256
# 读取 predictions["text_alignment_embedding"]
Gradio 可视化 Demo
python demo_gradio.py \
--checkpoint checkpoints/VGGT-Omega-1B-512/model.pt \
--image-resolution 512
上传图像或视频,输出深度展开的点云 + 预测相机位姿的 GLB 场景文件。
GPU 显存基准(官方测试,单 A100 40GB)
| 输入帧数 | 峰值显存 |
|---|---|
| 1 帧 | 6.02 GB |
| 10 帧 | 6.67 GB |
| 25 帧 | 7.80 GB |
| 50 帧 | 9.66 GB |
| 100 帧 | 13.37 GB |
| 200 帧 | 20.82 GB |
| 300 帧 | 28.26 GB |
| 400 帧 | 35.71 GB |
| 500 帧 | 43.15 GB |
测试条件:NVIDIA A100,624×416 输入(约 3:2 横版图),
mode="balanced"预处理。若图片更长边 resize 到 512(mode="max_size"),显存会更低。注意:未量化版本。
典型适用场景
- 快速 3D 场景感知:给 VLA(视觉-语言-动作)模型提供空间推理基础,camera tokens 可直接作为下游输入
- 大规模图像集重建:数百张产品图、文物扫描,无需手动调 COLMAP 参数
- 视频 3D 理解:输入视频帧序列,还原相机轨迹 + 稠密深度
- 多视角 3D 预标注:替代人工 SfM 预处理,提供即开即用的初始重建
坑与注意
| 风险 | 说明 |
|---|---|
| HuggingFace 权限需单独申请 | 权重不在公开下载,需主动申请,审核全自动但非即时 |
| 动态场景质量有限 | 官方对动态物体做了优化,但复杂遮挡场景仍可能失败 |
| 精度依赖图像质量 | 纹理缺乏、白墙、重复图案等场景,depth_conf 会偏低 |
| 无量化官方保障 | 官方只给 FP32 模型,INT8/INT4 量化效果未验证 |
| 不支持 360° 极端视角 | 输入帧间重叠不足时,camera 估计误差会急剧上升 |
与同类对比
| 方案 | 类型 | 速度 | 精度 | 动态场景 | 显存(100帧) |
|---|---|---|---|---|---|
| VGGT-Ω(1B) | 前向神经网络 | 快(~1.6× VGGT) | SOTA(77%↑ Camera Acc on Sintel) | ✅ 支持 | ~13 GB |
| VGGT(2025) | 前向神经网络 | 中 | 高 | ❌ 限静态 | ~20 GB(估算) |
| COLMAP + MVS | 传统优化 | 慢(分钟级) | 高(稠密) | ❌ | N/A(CPU+GPU) |
| DUSt3R | 前向网络 | 快 | 中 | ❌ | ~8 GB(估算) |
| D4RT(CVPR 2026) | 前向+时序 | 快 | SOTA for 4D | ✅ 原生时序 | 未公开 |
VGGT-Ω 的核心优势是在静态场景精度最高、显存更低、速度快,但 D4RT 在 4D(时间维度)任务上更完整。如需纯 3D 静态重建,VGGT-Ω 是当前最优开源选择。
一句话推荐结论
VGGT-Ω 将 3D 重建从分钟级优化管线压缩到秒级前向推理,内存效率 3 倍提升,适合作为 VLA 机器人的空间感知底座或大规模图像集的快速 3D 预处理——只要你能接受 HuggingFace 申请权限这个摩擦点。
原始链接
- GitHub: https://github.com/facebookresearch/vggt-omega
- HuggingFace: https://huggingface.co/facebook/VGGT-Omega
- Gradio Demo: https://huggingface.co/spaces/facebook/vggt-omega
- arXiv: https://arxiv.org/abs/2605.15195(CVPR 2026)