facebookresearch
facebookresearch

vggt-omega

[CVPR 2026 Oral] VGGT Omega

Analisi AI · Italiano

openai · gpt-4o-mini

Sintesi

VGGT-Omega è un modello di deep learning innovativo per la visione artificiale che stima la posa della telecamera (intrinsics ed extrinsics) e la profondità (depth extraction) da una o più immagini. Il framework è progettato per compiti di ricostruzione 3D e comprensione della scena, consentendo di generare nuvole di punti 3D. Sono disponibili modelli pre-addestrati e un'interfaccia demo interattiva basata su Gradio per testare rapidamente le sue capacità.

Casi d'uso

  • Ricostruzione 3D di scene e oggetti a partire da una o più immagini monoscopiche.
  • Creazione di ambienti virtuali e modelli 3D per giochi, simulazioni o applicazioni di realtà aumentata/virtuale.
  • Ispezione di qualità e analisi dimensionale in contesti industriali, ricostruendo forme 3D da immagini 2D.
  • Preparazione di dati per robotica, consentendo la percezione della profondità e la localizzazione nello spazio basata su input visivo.
  • Generazione di nuvole di punti utilizzabili per la pianificazione del percorso in veicoli autonomi o droni.

Idee SaaS / Business

Service di Ricostruzione 3D 'Image-to-Model'

Una piattaforma web che permette agli utenti di caricare una o più immagini di un oggetto o una scena e ricevere in output un modello 3D dettagliato (nuvola di punti, mesh, etc.) con stima della profondità e posa della telecamera. Utile per designer, architetti e sviluppatori AR/VR.

API per la Computer Vision 3D in Tempo Reale

Un'API cloud che offre stima della posa della telecamera e della profondità da stream video o sequenze di immagini. Ideale per aziende che sviluppano applicazioni di robotica, ispezione automatizzata o sistemi di navigazione che necessitano di comprensione spaziale istantanea.

Analisi Spaziale per E-commerce (Virtual Try-on / Misurazione)

Un servizio che integra VGGT-Omega per permettere ai clienti di e-commerce di ottenere misurazioni accurate di prodotti (es. vestiti, mobili) o di 'provare' virtualmente oggetti nel proprio ambiente tramite la fotocamera del telefono, migliorando l'esperienza d'acquisto e riducendo i resi.

Target utenti
Ricercatori in computer vision, sviluppatori di intelligenza artificiale, ingegneri robotici, professionisti della realtà aumentata/virtuale, designer 3D e sviluppatori di applicazioni di simulazione.
Categoria
Python, PyTorch, CUDA
Monetizzazione
Il progetto è open source e non prevede monetizzazione diretta. Tuttavia, i modelli e la tecnologia possono essere la base per servizi SaaS a pagamento, consulenze specialistiche o licenze enterprise per applicazioni commerciali avanzate.
Licenza
Other
Trend: La ricostruzione 3D da immagini 2D e la comprensione della profondità sono campi di ricerca e applicazione in forte crescita, trainati da AR/VR, robotica e veicoli autonomi.

README · tradotto in italiano

Modelli Pre-addestrati

ModelloRisoluzioneAllineamento TestualeDownload
VGGT-Omega-1B-512512NoLink
VGGT-Omega-1B-256-Text-Alignment256Link

Avvio Rapido

Per prima cosa, clona questo repository e installa le dipendenze:

git clone git@github.com:facebookresearch/vggt-omega.git
cd vggt-omega
pip install -r requirements.txt
pip install -e .

Ora, prova il modello con poche righe di codice:

import torch

from vggt_omega.models import VGGTOmega
from vggt_omega.utils.load_fn import load_and_preprocess_images
from vggt_omega.utils.pose_enc import encoding_to_camera

checkpoint_path = "path/to/vggt_omega_1b_512.pt"
image_names = ["path/to/imageA.png", "path/to/imageB.png", "path/to/imageC.png"]

model = VGGTOmega().to("cuda").eval()
model.load_state_dict(torch.load(checkpoint_path, map_location="cpu"))

images = load_and_preprocess_images(image_names, image_resolution=512).to("cuda")

with torch.inference_mode():
    predictions = model(images)

extrinsics, intrinsics = encoding_to_camera(
    predictions["pose_enc"],
    predictions["images"].shape[-2:],
)

depth = predictions["depth"]
depth_conf = predictions["depth_conf"]
camera_and_register_tokens = predictions["camera_and_register_tokens"]
camera_tokens = camera_and_register_tokens[:, :, :1]
registers = camera_and_register_tokens[:, :, 1:]

Per il checkpoint allineato al testo, usa VGGTOmega(enable_alignment=True) con image_resolution=256 e leggi predictions["text_alignment_embedding"].

Demo Interattiva

Installa le dipendenze della demo:

pip install -r requirements_demo.txt

Avvia la demo Gradio con un percorso di checkpoint locale:

python demo_gradio.py \
  --checkpoint checkpoints/VGGT-Omega-1B-512/model.pt \
  --image-resolution 512

La demo accetta immagini caricate o un video, esegue l'inferenza della telecamera e della profondità e visualizza la nuvola di punti non proiettata dalla profondità e le telecamere predette come scena GLB.

Licenza

Consulta il file LICENSE per i dettagli sulla licenza con cui questo codice è reso disponibile.

@inproceedings{wang2026vggtomega,
  title={VGGT-{$\Omega$}},
  author={Wang, Jianyuan and Chen, Minghao and Zhang, Shangzhan and Karaev, Nikita and Sch{\"o}nberger, Johannes and Labatut, Patrick and Bojanowski, Piotr and Novotny, David and Vedaldi, Andrea and Rupprecht, Christian},
  booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
  year={2026}
}

Attività commit · ultime 26 settimane

stima

Approfondimenti AI

L'AI sta preparando gli approfondimenti…

Chiedi al repo

AI · contesto README + issue

Fai una domanda sul progetto. L'AI legge README e issue recenti.

Sponsor · Sconto esclusivo RepoRadar AI

Hai bisogno di un server per far girare facebookresearch/vggt-omega?

Abbiamo testato decine di provider e Hostinger VPS è il miglior rapporto qualità/prezzo per self-hostare le repo che trovi qui. Setup in 1 click, pannello semplice e supporto 24/7.

Deploy in 1 click
2 vCPU · 8 GB RAM · NVMe
Backup + DDoS inclusi
Attiva sconto Hostinger VPSLink affiliato — supporti RepoRadar senza costi extra per te.

Questo progetto esiste grazie a voi

RepoRadar AI è gratis e senza pubblicità. Le donazioni coprono server, API e modelli AI.

Ogni analisi tradotta che leggi costa qualche centesimo di chiamate al modello. Se RepoRadar ti ha fatto risparmiare tempo, considera una piccola donazione cripto — anche pochi euro aiutano a mantenere il servizio libero per tutti.

Ethereum
ETH
0x86ECDF546d8dFc0739d44c066A6110F11cdB7773
Bitcoin
BTC
bc1qqe0wcmhnt78enk8ql0lxvey4z8hquxsxjtyz8r
Solana
SOL
EtTK61Lz7kfdDM8543TMMiAUUTbFVpzX5tvPEcBtZ3aj

Grazie di cuore — ogni contributo conta.