Blog Blog .RAW
Cómo hice un vídeo inmobiliario sin grabar la casa, solo con IA
Colaboración: Artlist (patrocinador del vídeo).
En dos días hice el vídeo de una casa sin haberla grabado. Guion, imágenes, movimiento y voz, todo con herramientas de inteligencia artificial y a partir de las fotos del anuncio.
Es un vídeo de 30 segundos de una vivienda de lujo en Nueva York, cerca de Central Park. Visto en el móvil, cuesta saber si está grabado, si es un render o si es IA.
Este es el proceso, paso a paso.
Las herramientas que usé
- ChatGPT, para el guion y para escribir todos los prompts.
- Nano Banana Pro, para regenerar cada foto en 16:9.
- Kling 2.6 Pro, para darle movimiento a cada imagen.
- El modelo v3 de ElevenLabs, para la voz en off.
- Premiere, para montar.
Los modelos de imagen, vídeo y voz los lancé desde el AI Toolkit de Artlist, que patrocina el vídeo.
Hay muchos más motores. Probé también Grok, y existen Veo 3 y 3.1 de Google, otros modelos de Kling o Sora. Me quedé con Kling porque me gustaba más cómo quedaba.
Paso 1. Darle contexto a ChatGPT
Descargué unas 30 fotos de la vivienda y algo de información del piso. El mismo ejercicio se podría hacer con renders 3D.
Se lo pasé todo a ChatGPT para que entendiera de qué iba el proyecto. Es lo más importante al principio.
Un detalle: empezó a contestarme antes de tiempo, así que le pedí que esperara a tener todas las imágenes.
Paso 2. El guion de la voz en off
Le pedí un guion cortito, inspiracional, con frases algo cliché que llamaran la atención, para una voz muy calmada y elegante.
Me propuso un texto y me dijo qué imágenes enseñar en cada parte. Algunas frases me encajaban y otras no. Es cuestión de ir peloteando con la herramienta hasta afinar el guion.
Paso 3. De foto a imagen generada
Cada foto pasa por ChatGPT antes que por el generador. Le paso la imagen (en un caso, una captura de un vídeo de YouTube de la propia vivienda) y le pido una descripción para recrearla con Nano Banana en 16:9.
Me devuelve un prompt muy detallado, con lo que debe aparecer y lo que no.
¿Por qué ChatGPT? Porque estos prompts funcionan mejor en inglés, y aunque yo hablo inglés, no llego a ese nivel de detalle ni sé estructurarlos igual.
Después, en el generador de imagen, subo la foto original como referencia, pego el prompt y elijo el motor. Usé Nano Banana Pro porque para fotografía es el que mejor me funciona. Lo hice con todas las imágenes.
Iterar hasta que haya coherencia
La vista exterior me llevó muchas pruebas. Primero le faltaban edificios alrededor, así que pedí un prompt para añadirlos.
Luego la torre central no coincidía con el edificio real que salía en otros vídeos, y eso rompía la coherencia del vídeo.
Subí la imagen generada junto con una captura del edificio real y le pedí que cambiara solo la torre central por la de la referencia. Lo hizo, y es de lo más interesante que ya se puede hacer con estos motores.
Cuando estaba contento con el resultado, escalé la imagen al tamaño final.
Paso 4. De imagen a vídeo
Con la imagen final hago otra captura, se la paso a ChatGPT y le pido un prompt para Kling.
Aquí me centro en el movimiento de cámara. Por ejemplo, en el baño: un dolly hacia delante, lento, muy suave y tranquilo. Me devuelve el prompt completo y me ahorro redactar con una precisión que yo no alcanzo.
En el generador convierto la imagen en vídeo, elijo el modelo y la duración.
Kling 3.0 Pro funciona muy bien, pero consume muchísimos más créditos, y yo tenía que hacer muchas pruebas. Por eso usé el 2.6, que me dejaba elegir entre 5 y 10 segundos según la toma.
Grok Imagine consume muchos menos créditos y permite clips más largos. Si todavía no tienes muchos, es buena opción.
Paso 5. Una transición hecha por la propia IA
Hay un momento en que la cámara avanza desde el mostrador hacia la ventana, la atraviesa y aparece en Central Park. En el programa de edición no toqué nada: la hizo la IA.
Kling 2.6 te deja poner dos imágenes de referencia, un frame de inicio y otro final. Usé el último frame del plano del mostrador y la primera imagen del parque.
En ChatGPT pedí un prompt para un dolly que atraviesa la ventana y aparece en el parque, y lo pegué en el generador.
Si no usas ChatGPT, la plataforma tiene una función de autoprompt: describes lo que quieres y te escribe el prompt. Yo prefiero ChatGPT porque puedo revisar el prompt y pedirle cambios.
Paso 6. La voz en off
En la sección de voiceover hay muchísimas voces, de hombre y de mujer y en varios idiomas. Puedes filtrar por temática, por ejemplo anuncios.
Probé dos y me quedé con una de acento británico. Como modelo usé el v3 de ElevenLabs.
Pegas el texto y generas. Hay ajustes como la estabilidad, que cambia cómo aguanta la voz.
A veces funcionaba mejor pegando la frase completa. Cuando quería alargar las pausas, partía la frase en fragmentos a mano.
Descargo las voces, las llevo a Premiere con las tomas y la canción, y el montaje es muy sencillo porque el movimiento ya viene en cada plano.
Lo que pienso de todo esto
Sé que la IA es un debate recurrente en la comunidad, y que genera polémica. Yo la veo como una tecnología que ya está aquí y que va a seguir avanzando, con modelos más realistas y más accesibles.
Creo que la idea va a pesar cada vez más. Cuanto antes entendamos y dominemos estas herramientas, antes veremos qué podemos crear con ellas.
Y hay cosas que no se pueden recrear. Un evento pasa una vez, en un momento concreto, con personas reales. Esa parte presencial va a cobrar mucha más importancia.
¿Tú cómo lo ves? Cuéntamelo en los comentarios del vídeo.
