Respuesta corta: Convertir una foto en vídeo son dos trabajos distintos. Hacer una presentación o un clip con varias fotos es montaje; basta con la galería o una aplicación de edición del teléfono. Animar una sola foto con IA, en cambio, es imagen a vídeo: la foto se convierte en el primer fotograma, usted escribe el movimiento de cámara y del sujeto, y el modelo genera un clip de 4 a 10 segundos.

Un vídeo corto de recuerdos a partir de un álbum de boda, un plano de escaparate giratorio a partir de la foto de un producto o una sonrisa que aparece en el viejo retrato de su abuelo: las tres cosas se escriben en el buscador como «convertir foto en vídeo», pero no son el mismo trabajo. Si empieza por el camino equivocado, o gasta tokens sin necesidad o nunca consigue el movimiento que esperaba. Este artículo separa los dos trabajos y explica cómo elegir la foto para animarla, cómo escribir el prompt y cuánto cuesta cada cosa.

¿Qué significa convertir una foto en vídeo?

Esta búsqueda abarca dos trabajos distintos. El primero es montaje: varias fotos se colocan en orden y se les añaden transiciones, acercamientos lentos, música y texto; nada dentro de las fotos se mueve. El segundo es imagen a vídeo: una sola foto se convierte en el primer fotograma y un modelo de IA genera el ondear del pelo, el giro de la cabeza o el avance de la cámara.

Presentación de vídeo con fotos (montaje)Animar una sola foto (imagen a vídeo)
EntradaVarias fotosUna sola foto, primer fotograma del clip
Movimiento dentro de la fotoNo hay; solo se desplaza el encuadreSí; el sujeto y la cámara se mueven
Qué se ve en pantallaSolo sus fotosLos fotogramas que no están en la foto los deduce el modelo
DuraciónDepende del número de fotos; puede durar minutosDe 4 a 10 segundos por clip
HerramientaLa galería o una aplicación de edición del teléfonoUn estudio de IA compatible con imagen a vídeo
CosteCasi siempre gratisTokens por clip
Para quiénVídeo de recuerdos, resumen de un evento, recorrido inmobiliarioPlano de producto, retrato animado, apertura de escena

Las dos cosas pueden combinarse: animar varias fotos una a una y luego encadenarlas en el montaje aporta a la vez la autenticidad de las fotos y el movimiento. Explicamos la diferencia entre imagen a vídeo y texto a vídeo en el artículo de comparación detallada.

¿Cómo hacer un vídeo con fotos desde el teléfono?

Para hacer un vídeo con las fotos del teléfono no hace falta IA. La función de recuerdos o de película de la galería, o cualquier aplicación de edición, ordena las fotos, da a cada una unos segundos y añade música y transiciones. Este camino es gratuito y, como no añade nada a la imagen, es la opción más honesta para vídeos de recuerdos y trabajos de carácter documental.

  1. Elija las fotos según el orden de la historia; de tres fotos parecidas del mismo momento, quédese solo con la mejor.
  2. Fije la proporción de destino desde el principio. Las cámaras de los teléfonos suelen tomar las fotos en 4:3 para aprovechar todo el sensor; como el vídeo vertical es 9:16, se recortan los bordes. Mantenga las caras importantes en el centro del encuadre.
  3. Dé a cada foto una duración acorde con el tempo de la música: corta con música rápida, larga con música tranquila.
  4. Añada un acercamiento lento o un desplazamiento horizontal. Este efecto, conocido por los documentales, da sensación de movimiento a una foto estática.
  5. Añada el texto y las fechas en la aplicación de edición; así se mantienen legibles y los caracteres especiales se ven correctamente.

¿Cómo funciona la animación de fotos con IA?

En un modelo de imagen a vídeo, su foto es el primer fotograma del clip y permanece fija. El modelo genera los fotogramas siguientes a partir de su predicción de cómo se movería la escena de la foto; su prompt orienta esa predicción. Como la composición sale de la foto, la cara y el producto siguen siendo reconocibles; el movimiento, en cambio, queda limitado por los bordes del fotograma.

Este método tiene una consecuencia: todo lo que no se ve en la foto se inventa. Si la cabeza gira, la parte de detrás de la oreja; si la cámara retrocede, la habitación fuera del encuadre; si la mano se abre, la palma: todo es suposición del modelo. Cuanto más se alarga el clip, más se acumulan las suposiciones; en muchos modelos, pasados cinco o seis segundos, la cara empieza a cambiar poco a poco. Por eso, un clip corto y un movimiento limitado dan el resultado más fiable. Explicamos cómo usamos este mismo principio en nuestra cadena de películas en el artículo sobre el fotograma clave primero.

¿Qué fotos dan buen resultado al animarlas?

La foto que da buen resultado es nítida, está bien iluminada, tiene un solo sujeto y un fondo sencillo. La cara se ve de frente o ligeramente de lado, las manos están o completamente en el encuadre o fuera de él, y no hay texto que deba leerse. Como el modelo amplifica con el movimiento cada defecto de la foto, elegir la fuente marca más diferencia que escribir el prompt.

  • Resolución: que la foto no sea más pequeña que el vídeo de destino. Un vídeo 1080p son 1920 × 1080 píxeles; una foto cuyo lado corto se quede muy por debajo se suaviza al ampliarse.
  • Proporción: recorte usted mismo la foto a la proporción del vídeo de antemano. Si deja el recorte al modelo, un detalle importante puede quedar fuera del encuadre.
  • Ángulo de la cara: de frente o en tres cuartos, con los ojos abiertos y visibles. Girar hacia la cámara una cara fotografiada de perfil significa inventar la mitad de la cara.
  • Fondo: lo mejor es un fondo sencillo y desenfocado. Las caras y los objetos de un fondo abarrotado se derriten durante el movimiento.
  • Manos: que las manos se vean enteras o queden fuera del encuadre. Los dedos cortados por la mitad son el detalle que más se deforma.
  • Texto, logotipo, marco: letreros, etiquetas y logotipos se deforman al moverse. Las fotos con marco o con texto superpuesto se interpretan como un cartel y se reinterpretan.
  • Fotos antiguas: elimine primero arañazos, manchas y roturas en un paso de restauración; el modelo puede tomar la mancha por parte de la escena y moverla.

¿Cómo se escribe un prompt de movimiento?

Un prompt de movimiento se construye con tres piezas: movimiento de cámara, movimiento del sujeto y tempo. No vuelva a describir el sujeto que ya se ve en la foto; escriba solo lo que va a cambiar. Una sola frase como «la cámara se acerca despacio, la mujer sonríe levemente y gira la cabeza a la izquierda, el viento le mueve el pelo, tempo tranquilo» suele bastar.

Prompt débilPor qué es débilMejor prompt
«Anima la foto»No define el movimiento; el modelo elige al azar«La cámara se acerca despacio, el hombre parpadea y sonríe levemente»
«Una mujer joven con vestido amarillo en la playa»Vuelve a describir el sujeto de la foto«La falda ondea al viento, las olas rompen en la orilla, cámara fija»
«Corre, abraza a su amigo y baila»Tres acciones en un solo clip«Da dos pasos hacia la cámara»
«Que gire el producto, brille el logotipo y aparezca el texto»El texto y el logotipo se deforman«El frasco gira despacio un cuarto de vuelta sobre su eje, la luz de estudio se desliza por la superficie»

Para el movimiento de cámara bastan unos pocos patrones: acercamiento lento, retroceso, desplazamiento a derecha o izquierda, ligera elevación y cámara fija. Que la cámara y el sujeto se muevan rápido a la vez es la causa más frecuente de deformación; si mueve uno, mantenga tranquilo el otro.

¿Dónde falla la animación de fotos?

La deformación empieza donde el modelo se ve obligado a inventar información que no está en la foto. Hay cinco casos frecuentes: giro rápido, manos, texto, multitudes y duración larga. Prevenirlos con la elección de la foto y con clips cortos, en lugar de forzarlos con el prompt, significa menos regeneraciones y menos tokens.

  • Giro rápido: un giro amplio de la cabeza o del cuerpo obliga a inventar la cara oculta; la persona puede convertirse en alguien que no se le parece.
  • Manos y objetos sujetos: la mano que levanta un vaso puede cambiar el número y la forma de los dedos.
  • Texto: el texto de un letrero o de una camiseta se convierte en letras sin sentido en pocos fotogramas.
  • Multitudes: en una foto de grupo, las caras de la fila de atrás se mezclan; el modelo no sabe quién es el sujeto.
  • Clip largo: a medida que aumenta la duración, la cara y la ropa se desvían. Si necesita un momento largo, genere dos clips cortos y únalos en el montaje.

¿Está bien animar la foto de un ser querido fallecido o de otra persona?

Técnicamente es posible, pero la pregunta del consentimiento y del contexto va antes que la técnica. Animar la foto de un ser querido fallecido como recuerdo dentro de la familia y difundir esa misma imagen públicamente son cosas distintas. Animar o hacer hablar la cara de otra persona sin su permiso conlleva riesgos éticos y legales.

En Turquía, la Ley n.º 6698 de Protección de Datos Personales considera dato personal la foto de una persona identificada o identificable. El artículo 50 del Reglamento de Inteligencia Artificial de la Unión Europea exige además, desde el 2 de agosto de 2026, indicar claramente que son artificiales las imágenes generadas que se parecen a personas, lugares o hechos reales y que podrían tomarse por auténticas. Esto no es asesoramiento jurídico; para un uso comercial o público, consulte a un profesional del derecho.

  • Incluso para un recuerdo familiar, pregunte a los allegados de la persona de la foto; no todo el mundo recibe con la misma emoción una cara animada.
  • No anime fotos de niños para compartirlas públicamente; tenga en cuenta que no pueden dar su consentimiento.
  • En el vídeo que comparta, indique que se ha animado con IA y no presente la imagen como si fuera una grabación real.
  • No use sin permiso escrito fotos de personas conocidas, de sus clientes o de sus empleados.

Explicamos cómo funcionan las etiquetas visibles e invisibles en los medios generativos en el artículo sobre marcas de agua e información de procedencia.

¿Cuántos tokens cuesta convertir una foto en vídeo en Yeşilçam?

En Yeşilçam Studio sube su foto como recurso; el fotograma que aporta se convierte en el primer fotograma del clip y se anima en el nivel de calidad que elija. El precio depende del nivel y de la duración, se muestra en pantalla antes de cada generación y las generaciones fallidas se reembolsan automáticamente. A octubre de 2026, la línea de referencia de imagen de la tabla de precios cuesta 2.626 tokens.

NivelDuraciónClip (tokens)Total con referencia de imagen≈ $ a la tarifa Basic
Borrador5 s122.501125.1270,75
Estándar5 s166.251168.8771,01
Cinema6 s262.501265.1271,59
Cinema Pro6 s700.001702.6274,22

La columna en dólares se calcula a la tarifa del plan Basic: 5 millones de tokens por $30, es decir, 1 millón de tokens ≈ $6. En el plan Free se aplica un multiplicador ×1,3; un clip Borrador de 5 segundos con referencia de imagen cuesta 125.127 × 1,3 = 162.665 tokens y cabe una vez en la asignación mensual de 250.000 tokens. La salida Free lleva marca de agua, y los niveles Cinema se desbloquean con el plan Basic. En el plan Pro, la misma operación descuenta 100.102 tokens con el ×0,8.

Un vídeo de recuerdos de 30 segundos con seis fotos

Animar seis fotos en nivel Estándar, cinco segundos cada una, y unirlas cuesta 6 × 168.877 = 1.013.262 tokens; a eso se suman 5.834 tokens por unir la película y 202 por el render en 1080p. En total, 1.019.298 tokens, unos $6,12 a la tarifa Basic. Colocar esas mismas seis fotos como diapositivas estáticas en una aplicación de edición es gratis; la diferencia es el precio del movimiento dentro de las fotos.

La regla para el nivel es sencilla: compruebe primero en Borrador si el movimiento es correcto, si funciona produzca en Estándar y reserve los niveles Cinema para la única foto en la que la luz y el movimiento importan de verdad. Encontrará las diferencias en el artículo borrador, estándar, cinema y los precios vigentes en la página de precios. Si quiere animar la foto no de forma realista sino como dibujo, puede subirla como referencia de personaje en el estudio Animation (JPG, PNG o WebP, hasta 25 MB); el estilo que elija, por ejemplo Claymation, traduce la foto a su propio lenguaje. Si va a pasar a un trabajo con varias escenas y narración, la guía sobre cómo hacer vídeos con IA explica toda la cadena.

¿Qué no resuelve la animación de fotos?

La animación crea un momento; no registra un recuerdo. El clip resultante no muestra cómo se movió de verdad aquel día la persona de la foto, sino un movimiento que el modelo considera plausible. En trabajos con valor documental, por ejemplo un documental de historia familiar o una noticia, la foto estática y el montaje son una elección más honesta.

  • No enfoca una foto borrosa o muy pequeña; la restauración y la ampliación son otro trabajo.
  • Hacer hablar a la persona de la foto requiere voz, texto y sincronía labial, y además el permiso de la persona o de sus allegados.
  • No genera una escena larga; los clips de 4 a 10 segundos se unen en el montaje.
  • En la foto de un producto no demuestra la caída de la tela ni la textura real del material; para el detalle que influye en la decisión de compra hace falta un rodaje real.

Preguntas frecuentes

¿Convertir una foto en vídeo es gratis? Hacer una presentación con fotos es gratis con la galería o una aplicación de edición del teléfono. Animar una sola foto con IA, en cambio, consume tokens por clip; el plan Free de Yeşilçam da una asignación mensual suficiente para un clip Borrador de 5 segundos, y la salida lleva marca de agua.

¿Cuántos segundos dura una foto animada? Un clip dura entre 4 y 10 segundos según el nivel: Borrador y Estándar, 5 o 10; los niveles Cinema, 4, 6 u 8 segundos. Para un vídeo más largo, generar varios clips cortos y unirlos en el montaje da un resultado más coherente que un solo clip largo.

¿Se pueden animar fotos antiguas en blanco y negro? Sí, pero elimine primero arañazos, manchas y roturas; el modelo puede tomarlos por parte de la escena. El color es una decisión aparte: si no escribe en el prompt que debe seguir en blanco y negro, el modelo puede añadir color, y eso puede romper el ambiente de época de la foto.

¿Puedo hacer hablar a la persona de la foto? Técnicamente es posible con voz, texto y un paso de sincronía labial; en Yeşilçam la sincronía labial cuesta desde 29.167 tokens. Pero hacer decir a alguien palabras que no ha dicho es el uso más delicado. No lo haga sin el permiso explícito de la persona o de sus allegados, e indique en el vídeo que es artificial.

¿En qué formato se descarga el vídeo animado? En Yeşilçam, la película unida se renderiza en 720p, 1080p o 4K y se descarga como MP4, WebP o GIF. Para entregar y compartir conviene MP4; para una vista previa dentro de una página, WebP o GIF. Elija la proporción desde el principio según dónde vaya a compartirlo.