Respuesta corta: Hay tres formas de hacer vídeo con IA: texto a vídeo (usted escribe un prompt y el modelo inventa la escena), imagen a vídeo (anima un fotograma) y la cadena de historia a película (guion, personajes, storyboard, clips y sonido se producen en orden). Para piezas cortas de un solo plano bastan las dos primeras; en trabajos con personajes, sonido y varias escenas, la cadena se rompe mucho menos.
El primer intento de casi todo el mundo se atasca en el mismo punto: escribe una frase y recibe un clip de cinco segundos impresionante; en el segundo clip, la cara del protagonista ha cambiado, el texto del letrero se ha convertido en letras sin sentido y no hay sonido por ninguna parte. El problema rara vez es la herramienta; suele ser el camino elegido. Esta guía explica los tres caminos, cuál conviene a cada trabajo, los pasos de un primer vídeo de 30 segundos y el coste en tokens y en dólares. Para una comparación detallada entre texto a vídeo e imagen a vídeo, consulte el artículo sobre texto a vídeo e imagen a vídeo; aquí no repetimos ese detalle.
¿Cuántas formas hay de crear vídeo con IA?
Hay tres, y cada una parte de una entrada distinta. En texto a vídeo solo escribe un prompt; el modelo inventa por su cuenta el decorado, la luz, el sujeto y el movimiento. En imagen a vídeo aporta un fotograma inicial y el modelo lo anima. En la cadena de historia a película, el texto se convierte en guion, y el guion en personajes, cuadros de storyboard, clips y sonido; cada etapa se aprueba por separado.
- Texto a vídeo: El arranque más rápido. Sirve para planos sin personajes recurrentes: planos de apertura, paisajes, fenómenos meteorológicos, movimiento abstracto. Su punto débil es la falta de memoria: si ejecuta el mismo prompt dos veces, obtiene dos mundos distintos.
- Imagen a vídeo: La composición y el sujeto quedan fijados desde el principio; el modelo solo añade movimiento y cámara. Es la puerta correcta para cualquier plano en el que deba verse un producto, una persona o un dibujo concretos. El movimiento, eso sí, queda limitado por los bordes del fotograma.
- Cadena de historia a película: Para trabajos con varias escenas, personajes y narración. Los clips se generan uno a uno con imagen a vídeo, pero todos se alimentan de la misma biblia de personaje y de la misma descripción de estilo, de modo que las caras no se desvían de una escena a otra.
Los tres caminos no se excluyen. Un cortometraje bien planteado suele generar la apertura a partir de texto y las escenas con personajes a partir de imágenes, y luego lo une todo en una sola cadena. El artículo qué hace realmente un estudio de cine con IA explica por qué este orden reduce el desperdicio.
¿Qué camino conviene a cada trabajo?
Para decidir bastan tres preguntas: ¿aparece en pantalla un personaje o producto recurrente?, ¿cuántos segundos durará el vídeo?, ¿hace falta sonido o diálogo? Si no hay sujeto recurrente y la pieza dura menos de 10 segundos, texto a vídeo es suficiente. Si el sujeto está definido, elija imagen a vídeo. Si hay varias escenas, personajes y sonido, use la cadena de historia a película.
| Lo que necesita | Camino recomendado | Por qué | Atención |
|---|---|---|---|
| Un plano atmosférico de 5 segundos para redes sociales | Texto a vídeo | No requiere preparación | Cada intento da un resultado distinto |
| Hacer girar o acercar la foto de su producto | Imagen a vídeo | El producto no sale del encuadre y conserva su forma | El texto sobre el producto puede deformarse |
| Animar una foto familiar o un dibujo | Imagen a vídeo | La cara y la composición salen de su propio fotograma | Consentimiento y etiquetado |
| Una historia con personajes de entre 30 y 90 segundos | Cadena de historia a película | La biblia de personaje enlaza las escenas | Lea primero el guion |
| Vídeo formativo o promocional con narración | Los pasos de narración y música de la cadena | El sonido se ajusta a la duración de la película | Añada los textos en pantalla durante el montaje |
| El vídeo promocional de su sitio web | Website Promo, a partir de la dirección del sitio | Se usan las imágenes reales del sitio | Los planos cinematográficos adicionales se cobran aparte |
¿Cómo hacer su primer vídeo de 30 segundos paso a paso?
Treinta segundos son seis escenas de cinco segundos. Escriba primero el texto escena por escena, compruebe cada escena con un fotograma borrador barato, anime los fotogramas que le convenzan y, al final, añada voz y música y únalo todo. Este orden envía al costoso paso de vídeo solo fotogramas aprobados, con lo que reduce las regeneraciones y los tokens desperdiciados.
- Escriba el objetivo en una frase. Algo como «mostrar la apertura matinal de nuestra cafetería con un ambiente cálido». Sin un objetivo claro, la elección de escenas se vuelve aleatoria.
- Divida el texto en seis escenas. Cada escena debe tener un lugar, una acción y una imagen. «Estaba feliz» no se puede filmar; «sostiene la taza con las dos manos y sonríe», sí.
- Describa al personaje una sola vez, con detalles concretos. Una descripción como «barista de pelo castaño corto con delantal verde» es el punto de anclaje de todas las escenas siguientes.
- Genere los cuadros de storyboard en el nivel Borrador. La composición, el encuadre y la luz se deciden aquí, donde equivocarse sale barato. Corrija el texto de los cuadros que salgan mal.
- Anime los fotogramas que le convenzan. Para escenas cortas y con poco movimiento, el nivel Estándar suele bastar; suba a un nivel superior solo la apertura o el plano en el que gira la emoción.
- Añada voz y música. Mantenga cortas las frases de narración. Si hay un personaje que habla, la sincronía labial es un paso aparte.
- Una y exporte. Elija 9:16 para plataformas de vídeo vertical y 16:9 horizontal para un sitio web; 1080p basta para la mayoría de usos.
Este flujo se explica pantalla por pantalla en la guía de su primera película. Un apunte de cálculo: a 24 fotogramas por segundo, el estándar del cine desde finales de la década de 1920, 30 segundos son 720 fotogramas. Como cada segundo tiene un precio, ajustar la duración a lo que la historia realmente necesita es el ahorro más directo.
¿Cómo se escribe un buen prompt de vídeo?
Un buen prompt describe la toma como lo haría un director de fotografía: sujeto, acción, cámara, luz y estilo, en ese orden. En imagen a vídeo, en cambio, no vuelve a describir al sujeto; solo escribe lo que cambia: el movimiento, el movimiento de cámara, la expresión. Describir de nuevo al sujeto invita al modelo a redibujarlo, y el personaje se desvía.
Un ejemplo para texto a vídeo: «Pequeña cafetería con luz de mañana, una barista con delantal verde llena una taza en el mostrador, la cámara se desliza despacio de derecha a izquierda, poca profundidad de campo, tono documental, sin texto en pantalla.» El prompt de imagen a vídeo para ese mismo plano describe solo el movimiento: «La barista levanta la taza y la acerca hacia la cámara, la cámara se aproxima ligeramente, sube el vapor.»

- Ponga la frase de estilo al principio; los modelos dan más peso al comienzo del prompt.
- Pida una sola acción por plano. «Corre, se cae, se levanta y se ríe» son cuatro escenas distintas.
- Use indicaciones de dirección como «a la izquierda» o «al fondo» cuando haga falta, pero no las dé por garantizadas; los modelos ignoran a menudo las instrucciones espaciales.
- Escriba las instrucciones negativas («sin texto, sin marco, sin logotipo») al final.
- No intente generar con el prompt el texto que debe leerse en pantalla; añádalo como capa de texto en el montaje.
¿Cuánto cuesta hacer un vídeo con IA?
La mayor parte del coste la determinan los clips de vídeo; el guion, el storyboard y la música son pequeños a su lado. El precio de un clip depende de dos cosas: el nivel de calidad y los segundos. A octubre de 2026, en la tabla de precios de Yeşilçam un clip Borrador de 5 segundos cuesta 122.501 tokens, y un clip Estándar de la misma duración, 166.251 tokens.
| Nivel | Duraciones disponibles | Precio del clip (tokens) | ≈ $ a la tarifa Basic | Tokens por segundo |
|---|---|---|---|---|
| Borrador | 5 o 10 s | 122.501 / 245.001 | 0,74 / 1,47 | 24.500 |
| Estándar | 5 o 10 s | 166.251 / 329.584 | 1,00 / 1,98 | unos 33.000 |
| Cinema | 4, 6 u 8 s | 175.001 / 262.501 / 350.001 | 1,05 / 1,58 / 2,10 | 43.750 |
| Cinema Pro | 4, 6 u 8 s | 466.668 / 700.001 / 933.335 | 2,80 / 4,20 / 5,60 | unos 116.667 |
La columna en dólares se calcula a partir de la asignación mensual del plan Basic: 5 millones de tokens por $30, es decir, 1 millón de tokens ≈ $6. Sin plan, con el paquete puntual Starter, 1 millón de tokens cuesta $9. En el plan Pro, cada operación descuenta un 20 % menos de tokens gracias al multiplicador ×0,8.
Presupuesto de ejemplo para 30 segundos
Para un vídeo de 30 segundos con seis escenas, en nivel Estándar, sin narración y con música, las partidas de la tabla suman así según el flujo predeterminado de la cadena:
- Seis cuadros de storyboard: 6 × 4.376 = 26.256 tokens
- Seis fotogramas clave: 6 × 11.667 = 70.002 tokens
- Seis clips Estándar de 5 segundos: 6 × 166.251 = 997.506 tokens
- Una pista de música: 29.167 tokens
- Unir la película, 5.834 tokens; render en 1080p, 202 tokens
En total, 1.128.967 tokens, unos $6,77 a la tarifa Basic. La asignación mensual de 5 millones de tokens del plan Basic cubre cuatro vídeos con esta estructura, pero no alcanza para un quinto. Si genera los clips en nivel Borrador, el total baja a 866.467 tokens (unos $5,20); en el plan Pro, la versión Estándar descuenta 903.174 tokens. Si añade una biblia de personaje (núcleo: 160.417 tokens) o sincronía labial para un personaje que habla (29.167 tokens por réplica), el coste aumenta. Encontrará el presupuesto de una película larga en la guía de duración y coste, y la estructura de costes del sector en el artículo sobre la anatomía del coste.
¿Se puede hacer un vídeo con IA gratis?
En parte. Los planes gratuitos existen para probar, no para producir con regularidad. A octubre de 2026, el plan Free de Yeşilçam da 250.000 tokens al mes, pero cada operación se cobra con un multiplicador ×1,3. Un clip Borrador de 5 segundos cuesta en este plan 122.501 × 1,3 = 159.251 tokens. Es decir, la asignación mensual alcanza para un clip de 5 segundos, pero no para un segundo.
En el plan Free están disponibles los niveles Borrador y Estándar; los niveles Cinema están cerrados, y las salidas de vídeo e imagen llevan una pequeña marca de agua en la esquina inferior derecha. Tres imágenes borrador al mes son gratuitas, espacio suficiente para probar composición y estilo. Lo más limpio es usar el plan gratuito para asentar el estilo y la historia, y producir la versión final con una suscripción; encontrará las diferencias en la guía de planes y marca de agua. Ante un servicio que prometa algo «totalmente gratis e ilimitado», lea aparte el límite de calidad, la marca de agua y las condiciones de uso comercial.
¿Dónde fallan los modelos de vídeo?
Los puntos débiles conocidos de los modelos de vídeo se concentran en unos pocos lugares: el texto en pantalla, las manos, la continuidad del personaje entre escenas, el límite de duración corta y el movimiento rápido o complejo. La mayoría se debe a que el modelo genera cada clip mediante un cálculo de probabilidad independiente. Por eso, la solución suele estar en el flujo de trabajo y no en el prompt.
| Problema | Cómo se ve | Qué hacer |
|---|---|---|
| Texto en pantalla | Letras sin sentido en carteles y etiquetas; más frecuente con caracteres especiales como los del turco (ğ, ş, İ) | Añada el texto como capa en el montaje y escriba «sin texto» en el prompt |
| Manos y dedos | Dedos de más o fusionados, la mano que sujeta un objeto se derrite | Mantenga las manos quietas o fuera de cuadro y elija clips cortos |
| Continuidad del personaje | Cara, pelo y ropa cambian de una escena a otra | Biblia de personaje e imagen a vídeo desde un fotograma clave |
| Límite de duración | Los clips duran entre 4 y 10 segundos; hacia el final de los clips largos la cara empieza a desviarse | Divida la historia en planos cortos y deje que la narración sostenga los cortes |
| Movimiento rápido y física | Deformaciones en peleas, carreras, líquidos que se derraman y multitudes | Divida la acción en partes y mantenga la multitud al fondo |
| Sincronía labial | En réplicas largas, boca y voz se desacoplan | Mantenga las réplicas por debajo de doce palabras |
Explicamos en detalle por qué es difícil la continuidad del personaje y qué técnicas funcionan en el artículo sobre personajes coherentes.
¿Cómo elegir entre los sitios para crear vídeos con IA?
Primero, defina en qué categoría busca: los generadores de vídeo que producen un solo clip, los que crean vídeos con presentador (avatar), las herramientas de montaje con plantillas y las cadenas de historia a película hacen trabajos distintos. Después, compruebe si el precio se muestra antes de generar, si las generaciones fallidas se reembolsan y si hay soporte de voz en su idioma.
- ¿Ve el precio antes de generar, o se entera a fin de mes?
- ¿Las generaciones fallidas se reembolsan automáticamente?
- ¿Elige el nivel de calidad por escena o por proyecto?
- ¿Hay alguna herramienta que mantenga al personaje entre escenas (hoja de referencia, biblia de personaje)?
- ¿Hay interfaz y narración en su idioma? ¿Ha probado la pronunciación con un ejemplo?
- ¿Qué marca de agua y qué límite de uso comercial tiene el plan gratuito?
- ¿Los formatos y proporciones de salida (MP4, 9:16, 16:9) se ajustan a su trabajo?
Algunos asistentes de chat pueden conectarse a un modelo de vídeo y generar clips cortos; la mayoría, sin embargo, rinde más escribiendo prompts, guiones y desgloses de escenas. Escribir el guion con un asistente y producir en un estudio de vídeo es un reparto de tareas habitual y razonable.
¿Cómo funciona la cadena de historia a película en Yeşilçam Studio?
Yeşilçam Studio convierte una historia escrita en película etapa por etapa y le muestra el precio en tokens de cada etapa antes de que usted la apruebe. Usted pega la historia; después llegan el guion con desglose de escenas, la biblia de personaje, el storyboard por escena, la imagen y el vídeo y, al final, la locución, la sincronía labial, la música y el montaje.
- Se pega la historia o el texto; el paso de guion lo divide en escenas con resumen y pistas de diálogo. Esta etapa es texto: leerla y corregirla sale barato.
- Se abre la biblia de personaje: cara, vestuario y voz coherentes. La biblia núcleo cuesta 160.417 tokens; la completa, 291.667.
- Cada escena recibe un cuadro de storyboard (4.376 tokens por escena). Cambiar aquí un cuadro equivocado es mucho más barato que cambiarlo en el clip terminado.
- Los cuadros que le convenzan se convierten en fotogramas clave (11.667 tokens) y pasan a clip en el nivel que elija: Borrador, Estándar, Cinema o Cinema Pro.
- Las réplicas se leen con la voz del personaje; se añaden sincronía labial (29.167 tokens) y una pista de música ajustada a la duración de la película (29.167 tokens).
- La película se une (5.834 tokens) y se renderiza en 720p, 1080p o 4K (100, 202 o 601 tokens); se descarga como MP4, WebP o GIF.
El nivel no se elige para la película, sino para cada escena. A octubre de 2026, un clip Cinema de 8 segundos cuesta 350.001 tokens, y un clip Cinema Pro de la misma duración, 933.335 tokens. Por eso, reservar el nivel caro para la apertura y para uno o dos planos en los que gira la emoción protege el presupuesto; explicamos cómo elegir el nivel en el artículo borrador, estándar, cinema. Las generaciones fallidas se reembolsan automáticamente y la tabla vigente está siempre en la página de precios. Si quiere una historia corta y animada para redes sociales, Inkmation, en el mismo estudio, produce en las proporciones de 11 plataformas.
¿Qué no resuelve el vídeo con IA?
El vídeo con IA es fuerte mostrando algo que no existe y débil documentando algo que sí existe. Si necesita mostrar su fábrica real, su equipo, la textura real de su producto o un evento, la cámara y un equipo de rodaje siguen siendo el camino correcto; la imagen generada solo puede imitarlos.
- Valor documental: Noticias, entrevistas, casos de clientes, el uso real del producto. Aquí la imagen generada resta confianza.
- Personas reales y conocidas: Generar la cara o la voz de una persona sin su permiso es un riesgo legal y ético. Según dónde publique, también puede ser obligatorio indicar claramente que el contenido se ha generado con IA.
- Interpretación larga y sutil: Un plano secuencia largo, una expresión facial matizada o un diálogo extenso entre dos personajes llevan al límite a los modelos actuales.
- Especificaciones de emisión: La emisión en televisión o la proyección en cine exigen normas de color, sonido y entrega; ese trabajo requiere un equipo de postproducción.
- El sentimiento de una película de marca: En una película de marca que se usará durante años, la experiencia del director, del actor y del director de fotografía marca la diferencia.
Incluso en estos casos merece la pena usar la IA en la fase de ideas: con un storyboard y una animática aproximada llevará a la agencia o al equipo un brief mucho más claro. El artículo sobre por qué el storyboard sigue importando describe este paso intermedio.
Preguntas frecuentes
¿Cuántas escenas tiene un vídeo con IA de un minuto? Normalmente entre 6 y 8. Como los clips Borrador y Estándar duran 5 o 10 segundos y los clips Cinema 4, 6 u 8 segundos, un objetivo de 60 segundos cae en ese intervalo. Una historia de cuatro minutos se convierte en unas 30 escenas.
¿Cuánto tarda en generarse un clip de vídeo? En los niveles rápidos, un clip de 5 o 10 segundos suele estar listo en unos minutos; los niveles cinematográficos son más lentos. La duración de toda la película depende del número de escenas. Mientras se generan los clips, puede seguir la cola de trabajos y continuar con otras escenas.
¿Puedo usar comercialmente un vídeo hecho con IA? En los planes Basic y Pro las salidas no llevan marca de agua y pueden usarse en trabajos para clientes, anuncios y publicaciones; en el plan Free hay una pequeña marca de agua. Para contenido que recuerde a una persona real, a otra marca o a un personaje protegido por derechos de autor hace falta un permiso aparte; los detalles están en las condiciones de uso.
¿Se puede hacer un vídeo con IA con locución en turco? Sí. Yeşilçam funciona en seis idiomas; pone voz a la narración en turco y a las réplicas de los personajes, y en los personajes que hablan la sincronía labial se añade como paso aparte. Escribir los números, las siglas y los nombres propios extranjeros tal como se leen mejora notablemente la pronunciación.
¿Debo empezar desde texto o desde imagen? Si en pantalla debe aparecer una persona, un producto o un dibujo concretos, empiece desde una imagen, porque la composición sale de su propio fotograma. Si no hay un sujeto recurrente, por ejemplo un paisaje o un plano de apertura, texto a vídeo es más rápido y no requiere preparación.

