Analisi AI · Italiano
openai · gpt-4o-miniSintesi
VGGT-Omega è un modello di deep learning innovativo per la visione artificiale che stima la posa della telecamera (intrinsics ed extrinsics) e la profondità (depth extraction) da una o più immagini. Il framework è progettato per compiti di ricostruzione 3D e comprensione della scena, consentendo di generare nuvole di punti 3D. Sono disponibili modelli pre-addestrati e un'interfaccia demo interattiva basata su Gradio per testare rapidamente le sue capacità.
Casi d'uso
- →Ricostruzione 3D di scene e oggetti a partire da una o più immagini monoscopiche.
- →Creazione di ambienti virtuali e modelli 3D per giochi, simulazioni o applicazioni di realtà aumentata/virtuale.
- →Ispezione di qualità e analisi dimensionale in contesti industriali, ricostruendo forme 3D da immagini 2D.
- →Preparazione di dati per robotica, consentendo la percezione della profondità e la localizzazione nello spazio basata su input visivo.
- →Generazione di nuvole di punti utilizzabili per la pianificazione del percorso in veicoli autonomi o droni.
Idee SaaS / Business
Una piattaforma web che permette agli utenti di caricare una o più immagini di un oggetto o una scena e ricevere in output un modello 3D dettagliato (nuvola di punti, mesh, etc.) con stima della profondità e posa della telecamera. Utile per designer, architetti e sviluppatori AR/VR.
Un'API cloud che offre stima della posa della telecamera e della profondità da stream video o sequenze di immagini. Ideale per aziende che sviluppano applicazioni di robotica, ispezione automatizzata o sistemi di navigazione che necessitano di comprensione spaziale istantanea.
Un servizio che integra VGGT-Omega per permettere ai clienti di e-commerce di ottenere misurazioni accurate di prodotti (es. vestiti, mobili) o di 'provare' virtualmente oggetti nel proprio ambiente tramite la fotocamera del telefono, migliorando l'esperienza d'acquisto e riducendo i resi.
README · tradotto in italiano
Modelli Pre-addestrati
| Modello | Risoluzione | Allineamento Testuale | Download |
|---|---|---|---|
VGGT-Omega-1B-512 | 512 | No | Link |
VGGT-Omega-1B-256-Text-Alignment | 256 | Sì | Link |
Avvio Rapido
Per prima cosa, clona questo repository e installa le dipendenze:
git clone git@github.com:facebookresearch/vggt-omega.git
cd vggt-omega
pip install -r requirements.txt
pip install -e .
Ora, prova il modello con poche righe di codice:
import torch
from vggt_omega.models import VGGTOmega
from vggt_omega.utils.load_fn import load_and_preprocess_images
from vggt_omega.utils.pose_enc import encoding_to_camera
checkpoint_path = "path/to/vggt_omega_1b_512.pt"
image_names = ["path/to/imageA.png", "path/to/imageB.png", "path/to/imageC.png"]
model = VGGTOmega().to("cuda").eval()
model.load_state_dict(torch.load(checkpoint_path, map_location="cpu"))
images = load_and_preprocess_images(image_names, image_resolution=512).to("cuda")
with torch.inference_mode():
predictions = model(images)
extrinsics, intrinsics = encoding_to_camera(
predictions["pose_enc"],
predictions["images"].shape[-2:],
)
depth = predictions["depth"]
depth_conf = predictions["depth_conf"]
camera_and_register_tokens = predictions["camera_and_register_tokens"]
camera_tokens = camera_and_register_tokens[:, :, :1]
registers = camera_and_register_tokens[:, :, 1:]
Per il checkpoint allineato al testo, usa VGGTOmega(enable_alignment=True) con image_resolution=256 e leggi predictions["text_alignment_embedding"].
Demo Interattiva
Installa le dipendenze della demo:
pip install -r requirements_demo.txt
Avvia la demo Gradio con un percorso di checkpoint locale:
python demo_gradio.py \
--checkpoint checkpoints/VGGT-Omega-1B-512/model.pt \
--image-resolution 512
La demo accetta immagini caricate o un video, esegue l'inferenza della telecamera e della profondità e visualizza la nuvola di punti non proiettata dalla profondità e le telecamere predette come scena GLB.
Licenza
Consulta il file LICENSE per i dettagli sulla licenza con cui questo codice è reso disponibile.
@inproceedings{wang2026vggtomega,
title={VGGT-{$\Omega$}},
author={Wang, Jianyuan and Chen, Minghao and Zhang, Shangzhan and Karaev, Nikita and Sch{\"o}nberger, Johannes and Labatut, Patrick and Bojanowski, Piotr and Novotny, David and Vedaldi, Andrea and Rupprecht, Christian},
booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
year={2026}
}
Attività commit · ultime 26 settimane
stimaApprofondimenti AI
Chiedi al repo
AI · contesto README + issueFai una domanda sul progetto. L'AI legge README e issue recenti.
Hai bisogno di un server per far girare facebookresearch/vggt-omega?
Abbiamo testato decine di provider e Hostinger VPS è il miglior rapporto qualità/prezzo per self-hostare le repo che trovi qui. Setup in 1 click, pannello semplice e supporto 24/7.
Questo progetto esiste grazie a voi
RepoRadar AI è gratis e senza pubblicità. Le donazioni coprono server, API e modelli AI.
Ogni analisi tradotta che leggi costa qualche centesimo di chiamate al modello. Se RepoRadar ti ha fatto risparmiare tempo, considera una piccola donazione cripto — anche pochi euro aiutano a mantenere il servizio libero per tutti.
0x86ECDF546d8dFc0739d44c066A6110F11cdB7773bc1qqe0wcmhnt78enk8ql0lxvey4z8hquxsxjtyz8rEtTK61Lz7kfdDM8543TMMiAUUTbFVpzX5tvPEcBtZ3ajGrazie di cuore — ogni contributo conta.