Imatge convertida en espai 3D
Una imatge esdevé espai tridimensional i respon al moviment de les mans en temps real.
Depth Cloud és un prototip d’experimentació audiovisual desenvolupat al laboratori d’Artefacto Films que transforma imatges fixes en núvols de punts tridimensionals interactius. El projecte sorgeix com a exploració estètica dins d’una investigació més àmplia sobre la percepció espacial al cinema i la pregunta de què passa quan una fotografia o un fotograma fílmic adquireix profunditat, volum i capacitat de resposta física. La imatge deixa de ser una superfície plana i es converteix en matèria navegable, en una estructura que el cos pot manipular amb les mans davant d’una pantalla.

El sistema funciona en tres etapes encadenades. A la primera, l’usuari carrega una imatge i el model de llenguatge multimodal Gemini de Google genera un mapa de profunditat, una representació a escala de grisos on cada valor de píxel codifica la distància estimada al pla de la càmera. A la segona etapa, un procés de conversió transforma aquest mapa en un núvol de punts tridimensional renderitzat en temps real mitjançant shaders WebGL dins d’un component React. A la tercera, MediaPipe Hands analitza el senyal de la càmera de l’usuari i tradueix els gestos de les mans en transformacions espacials sobre el núvol, la rotació, l’escala, la dispersió explosiva de partícules. El sistema opera també en una manera alternativa on Gemini Nano genera escenes voxelitzades a partir de la mateixa imatge d’entrada, produint una representació volumètrica discreta de l’espai fotogràfic.

Durant més d’un segle el cinema va organitzar la mirada des d’un punt fix; l’espectador immòbil davant d’una projecció plana. Depth Cloud sotmet aquesta convenció a una tensió directa. En convertir el fotograma en un núvol de punts manipulable amb el cos, el projecte proposa que la imatge cinematogràfica té una espacialitat latent que els models de visió artificial poden fer visible. Alhora, obre una reflexió sobre la naturalesa de la profunditat generada per intel·ligència artificial, l’estimació de profunditat que produeix Gemini és una inferència estadística, una interpretació de l’espai que el model construeix a partir de patrons apresos en milions d’imatges.

El prototip permet explorar com una sola eina pot ser alhora un instrument danàlisi darxiu fílmic, un dispositiu dinstal·lació interactiva i una plataforma dexperimentació estètica amb núvols de punts.