Videos IA más largos (30 s+) con fotograma inicial y final
2026/09/18

Videos IA más largos (30 s+) con fotograma inicial y final

¿Atascado en 5–10 segundos? Aprende la Last-Frame Chain: extrae el último fotograma, úsalo como inicio del siguiente clip y une un video IA de 30 s.

Cómo hacer videos IA más largos: encadena clips con fotograma inicial y final

Todos los generadores de video IA chocan con el mismo muro. Escribes un buen prompt, el clip queda bien y se acaba a los cinco o diez segundos. No hay un botón de "que dure 30 segundos", y cuando una plataforma ofrece una función de "extender", suele ser un solo modelo, un solo segmento extra y una cola de espera.

La buena noticia es que no necesitas un botón de extender para hacer videos IA más largos. Necesitas una técnica que funciona en cualquier modelo: toma el último fotograma del clip que ya tienes, úsalo como fotograma inicial del siguiente clip, conserva el esqueleto del prompt, cambia solo la acción y une las piezas. La llamamos The Last-Frame Chain (la cadena del último fotograma). Seis segmentos de 5 segundos se convierten en un plano de 30 segundos; tres segmentos de 10 segundos logran lo mismo con menos uniones.

Este tutorial recorre el método paso a paso, muestra lo que cuesta de verdad un video de 30 segundos en cada nivel y cubre las cuatro formas en que una cadena falla y cómo arreglar cada una. Los precios son las cifras de créditos que el Studio muestra en vivo a septiembre de 2026.

Por qué los clips de video IA son tan cortos

Entender el límite hace que la solución resulte obvia.

El cómputo crece con cada segundo

Los modelos de video generan todos los fotogramas de un clip a la vez, y el costo de mantenerlos coherentes sube de forma pronunciada con la duración. Por eso casi todos los modelos cobran por segundo y limitan una sola generación a entre 5 y 10 segundos: pasado ese punto, la calidad cae y el precio sube más rápido de lo que nadie quiere pagar.

La deriva crece con la duración

Incluso cuando un modelo permite un plano único más largo, los últimos segundos son los más débiles. Las caras se ablandan, los fondos se deslizan, el movimiento pierde intención. Una cadena de segmentos cortos y bien anclados suele quedar más limpia que una sola generación larga, porque cada segmento arranca desde un fotograma nítido y deliberado.

Cuáles son los límites hoy

En Imgveo, la generación única máxima por nivel, comprobada en septiembre de 2026:

NivelClip único máx.Modo de fotograma inicial y final
Kling 3 (std / pro / 4K)10 sSí, hasta 5 s
Wan 2.710 sSí, hasta 5 s
Seedance 2 / Seedance 2 Fast10 sSí, hasta 5 s
Basic10 sSí, hasta 5 s
Hailuo6 s o 10 sSí, hasta 5 s
Veo 3.18 s (fijo)Usa imagen a video en su lugar
Kling 2.610 sNo

De aquí salen dos conclusiones. El modo de fotograma inicial y final, la forma más precisa de encadenar, tope en 5 segundos por segmento. El modo simple de imagen a video, que solo necesita un fotograma inicial, llega a 10 segundos en la mayoría de los niveles. La cadena funciona con cualquiera de los dos; la elección es precisión frente a menos uniones.

Tres formas de conseguir un video IA más largo

Tres formas de superar el muro de los 5–10 segundos: un nivel más largo, encadenar con fotograma inicial y final, o montar planos independientes

Vía 1: elige el nivel más largo y genera una sola vez

Si con 10 segundos te basta, detente aquí. Kling 3, Wan 2.7, Seedance 2 y Basic generan un solo clip de 10 segundos sin costuras y con un único prompt. Hailuo también hace 10 segundos en su modo estándar. El costo es simplemente el doble de un clip de 5 segundos en los niveles por segundo, y la calidad suele aguantar bien todo el recorrido en planos simples con un solo movimiento.

Vía 2: encadena clips con fotograma inicial y final

Para cualquier cosa que pase de 10 segundos, o para un plano de 10 segundos que necesita dos beats distintos, encadena. Cada segmento arranca desde el fotograma exacto en el que terminó el anterior, así que la unión es invisible cuando el movimiento es continuo. No hay límite superior: 30, 60, 90 segundos, mientras tus beats se sostengan.

Vía 3: monta planos independientes

Si el video es una secuencia de ángulos distintos y no un solo plano continuo, no necesitas continuidad de fotogramas en absoluto. Genera cada plano desde la misma imagen de referencia y el mismo esqueleto de prompt, córtalos juntos con música, y el montaje esconde cualquier deriva que exista. Así se hacen la mayoría de los anuncios y tráileres con IA, y es la vía más rápida.

La mayoría de los proyectos reales mezclan la Vía 2 para el plano principal y la Vía 3 para el b-roll que lo rodea.

La cadena del último fotograma, paso a paso

La cadena del último fotograma: genera, extrae el último fotograma, úsalo como siguiente fotograma inicial, repite, monta

Paso 1: planifica los beats

Escribe qué pasa en cada segmento antes de generar nada. Un beat por cada 5 segundos. Para un plano de producto de 30 segundos podría ser:

  1. Botella sobre una encimera de mármol, lento acercamiento, luz de mañana.
  2. La cámara sigue acercándose, las gotas de condensación captan la luz.
  3. Entra una mano y levanta la botella.
  4. La botella gira para revelar la etiqueta.
  5. La mano la deja en su sitio, la cámara empieza a retroceder.
  6. El retroceso termina, plano general de la encimera.

Cada beat es un movimiento de cámara y una acción del sujeto. Si te descubres escribiendo dos movimientos en un beat, divídelo en dos beats.

Paso 2: genera el clip 1

Usa imagen a video con tu imagen de referencia como fotograma inicial, o texto a video si partes de cero. Escribe el prompt completo: sujeto, entorno, iluminación, movimiento de cámara, atmósfera. Este es el esqueleto que reutilizará cada segmento posterior. Genera a una resolución de borrador (480p en Basic son 20 créditos) hasta que el movimiento esté bien, y luego vuelve a ejecutar el clip definitivo en el nivel y la resolución que vas a publicar.

Paso 3: extrae el último fotograma

Descarga el clip 1 y captura su fotograma final como PNG. Cualquiera de estas opciones sirve:

  • En la mayoría de los reproductores de escritorio, pausa en el último fotograma y usa la captura integrada o el comando de exportar fotograma.
  • En la línea de comandos, una sola llamada a ffmpeg salta al final y escribe un único fotograma:
ffmpeg -sseof -0.1 -i clip1.mp4 -frames:v 1 -update 1 last-frame.png

Captura el verdadero último fotograma, no uno de un segundo antes. Un fotograma de la mitad de un movimiento crea un salto visible cuando el siguiente clip arranca desde él.

Paso 4: úsalo como el siguiente fotograma inicial

Abre el modo de fotograma inicial y final o imagen a video y sube last-frame.png como fotograma inicial. En el modo de fotograma inicial y final también puedes subir un fotograma final si sabes dónde debe terminar el beat 2; si no lo sabes, déjalo vacío y deja que el modelo continúe el movimiento.

Paso 5: reescribe solo la acción

Conserva el esqueleto palabra por palabra: sujeto, entorno, iluminación, atmósfera. Cambia solo la línea de acción y de cámara para el nuevo beat. Un prompt que cambia la redacción en todas partes invita al modelo a reinterpretar la iluminación o el sujeto, y de ahí vienen los cambios de color y la deriva de identidad.

Paso 6: repite

Genera el clip 2, extrae su último fotograma, úsalo en el clip 3, y así sucesivamente. Guarda el prompt de cada segmento en un archivo de texto junto al clip; cuando un segmento falle, lo volverás a ejecutar con las mismas palabras en lugar de reinventarlo.

Paso 7: monta

Coloca los clips en una línea de tiempo en orden y únelos a tope, sin transiciones. Si una unión da un tirón, recorta dos o tres fotogramas del final del clip anterior, ya que los últimos fotogramas de una generación a veces son casi duplicados. Exporta una sola vez a tu resolución de publicación.

Cómo mantenerlo sin costuras

Cuatro hábitos que hacen desaparecer las uniones.

El mismo esqueleto de prompt en cada segmento

La mayor causa de uniones visibles es la deriva del prompt. Copia el prompt anterior, edita una frase, genera. No lo reescribas de memoria.

Un movimiento de cámara por segmento

Un acercamiento que continúa a lo largo de dos segmentos se lee como un solo plano. Un acercamiento que se convierte en paneo a mitad de un segmento se lee como un corte aunque los fotogramas coincidan. Deja que cada segmento complete un movimiento, y empieza el siguiente en la unión si lo necesitas.

Usa exactamente las mismas palabras de iluminación

"Luz de mañana" en el clip 1 y "luz de día suave" en el clip 2 son instrucciones distintas para el modelo, y las obedecerá. El vocabulario de iluminación es la parte del esqueleto que hay que cuidar con más celo.

Usa el fotograma final cuando conozcas el destino

Si el beat 4 debe terminar en una composición concreta, como la etiqueta de frente a la cámara, genera primero esa composición como imagen fija y súbela como fotograma final. El modo de fotograma inicial y final interpolará el movimiento entre ambos, algo mucho más fiable que describir el destino con palabras.

Lo que cuesta un video de 30 segundos

El costo de la cadena es simplemente el costo del segmento multiplicado por el número de segmentos. Aquí van seis segmentos de 5 segundos en cada nivel, sin audio, en el plan Starter de $19.90 por 1,500 créditos.

Lo que cuesta un video encadenado de 30 segundos en cada nivel de Imgveo

NivelPor segmento de 5 s6 segmentos (30 s)≈ $ (Starter)
Basic 480p20 créditos120$1.60
Kling 3 estándar 1080p50 créditos300$3.98
Wan 2.7 720p50 créditos300$3.98
Kling 3 profesional 1080p65 créditos390$5.17
Seedance 2 720p125 créditos750$9.95
Kling 3 4K225 créditos1,350$17.91

Tres formas de gastar menos:

  • Haz el borrador de toda la cadena en Basic 480p por $1.60, corrige los beats y luego regenera solo los segmentos que te quedas en el nivel definitivo.
  • Usa segmentos de imagen a video de 10 segundos donde la precisión lo permita. En los niveles por segundo el total es el mismo, pero tienes tres uniones en vez de cinco. En Basic, donde un clip cuesta 20 créditos fijos sin importar la duración, tres segmentos de 10 segundos cuestan 60 créditos en lugar de 120.
  • Desactiva el audio mientras encadenas. El audio generado no continúa a través de las uniones de todos modos, así que pagarías el recargo por un sonido que vas a reemplazar. Añade una sola pista continua en el montaje.

Las generaciones fallidas se reembolsan automáticamente en Imgveo, así que un segmento con error cuesta tiempo, no créditos. El método completo de costos, incluido el cálculo de la tasa de fallos para plataformas que no reembolsan, está en Créditos de video IA explicados.

Problemas comunes y soluciones

Cambios de color entre clips

Causa: el modelo reinterpretó la iluminación o el balance de blancos porque cambió la redacción del prompt, o el fotograma extraído estaba comprimido.

Solución: restaura exactamente las palabras de iluminación del prompt anterior y exporta el último fotograma como PNG en lugar de JPEG. Si queda algún cambio, un solo ajuste de igualación de color en el clip posterior dentro de tu editor cierra la diferencia.

El movimiento "se reinicia" en la unión

Causa: el nuevo segmento arranca desde una imagen fija, así que el modelo empieza en reposo antes de retomar el movimiento.

Solución: describe el movimiento como ya en curso ("la cámara continúa su lento acercamiento") en lugar de como algo que empieza ("la cámara se acerca"). Recortar los dos o tres primeros fotogramas del nuevo clip también elimina la pausa visible.

Deriva de cara o de personaje

Causa: pequeños errores de identidad se acumulan a lo largo de los segmentos; para el clip 4 la cara ya es otra persona.

Solución: aporta la imagen de referencia original junto con el último fotograma en los niveles que aceptan referencias, y mantén la descripción de identidad en todos los prompts. Para secuencias con un solo personaje, Seedance 2 es el que mejor conserva la identidad en cadenas largas. Nuestra guía de consistencia de personajes cubre las técnicas válidas para todos los modelos.

El audio no continúa

Causa: cada segmento genera su propio sonido, y nada los alinea.

Solución: genera sin audio y añade una sola base sonora continua en el montaje. Si un segmento necesita diálogo nativo, genera ese segmento con audio en un nivel que lo haga bien y corta el resto en silencio; nuestra comparativa de audio nativo explica qué niveles elegir.

Qué nivel usar para encadenar

  • Kling 3 estándar es la opción por defecto: 1080p, 50 créditos por 5 segundos, gran fidelidad en imagen a video, así que cada segmento respeta su fotograma inicial. La página de Kling 3 muestra los tres modos.
  • Basic es el nivel de borrador: 20 créditos fijos por clip a 480p, ideal para probar los beats antes de gastar en la versión final.
  • Seedance 2 cuando un personaje tiene que sobrevivir a toda la cadena; cuesta más por segundo pero ahorra repeticiones.
  • Wan 2.7 para movimiento estilizado o ilustrado a 720p, 50 créditos por 5 segundos.
  • Veo 3.1 resulta incómodo para encadenar porque cada clip está fijado en 8 segundos y no acepta fotograma final; úsalo para el segmento con diálogo, no para la cadena.
  • Kling 2.6 no admite el modo de fotograma inicial y final en absoluto; usa imagen a video con él, o elige Kling 3.

Elijas el nivel que elijas, recuerda que los segmentos de fotograma inicial y final tienen tope en 5 segundos y los de imagen a video en 10.

Preguntas frecuentes

¿Cuánto pueden durar los videos IA?

Una sola generación suele durar entre 5 y 10 segundos en los modelos actuales; en Imgveo el clip único más largo es de 10 segundos, y Veo 3.1 está fijado en 8. No hay límite en la duración encadenada: usando el último fotograma de cada clip como fotograma inicial del siguiente, los creadores construyen de forma habitual planos continuos de 30 segundos, 60 segundos y más.

¿Puede la IA generar un video de 1 minuto?

No en una sola pasada en los modelos alojados de hoy, pero sí encadenando. Un plano continuo de 60 segundos son doce segmentos de 5 segundos o seis de 10 segundos. En Kling 3 estándar son 600 créditos, unos $8 en el plan Starter; en Basic 480p para un borrador, unos $2.40.

¿Cómo extiendo un video IA?

Extrae el fotograma final del clip como PNG, súbelo como fotograma inicial de una nueva generación, reutiliza el prompt original cambiando solo la acción y une los dos clips sin transición. Esa es la cadena del último fotograma, y funciona en cualquier modelo que acepte una imagen inicial, que son casi todos.

¿Qué es el fotograma inicial y final en video IA?

Un modo de generación en el que aportas el primer fotograma y, opcionalmente, el último como imágenes, y el modelo crea el movimiento entre ambos. Es la forma más precisa de controlar dónde empieza y termina un clip, lo que lo hace ideal para encadenar segmentos y para terminar en una composición final exacta.

¿Encadenar clips pierde calidad?

No por sí mismo. Cada segmento arranca desde un fotograma nítido, así que una cadena suele verse más limpia que una sola generación larga. Los problemas de calidad vienen de la deriva del prompt, de fotogramas extraídos con compresión y de la deriva de identidad a lo largo de muchos segmentos, y las soluciones de arriba resuelven todos ellos. Exporta el último fotograma como PNG y mantén constante el esqueleto del prompt.

¿Cuál es la forma más barata de hacer un video IA de 30 segundos?

Haz el borrador en el nivel Basic a 480p, donde cada clip cuesta 20 créditos fijos, por un total de 60 a 120 créditos ($0.80 a $1.60 en Starter). Luego regenera solo los segmentos aprobados en Kling 3 estándar a 1080p por 300 créditos, unos $4. Mantén el audio apagado durante la cadena y añade una sola pista en el montaje.

En resumen

Los videos IA más largos no son una función que esperas; son una técnica que aplicas. Planifica un beat por segmento, extrae el último fotograma como PNG, pásalo al siguiente, cambia solo la acción y une los resultados a tope. Haz el borrador barato, finaliza una sola vez y trata las uniones con las cuatro soluciones de arriba. Prueba ahora el primer segmento en el modo de fotograma inicial y final, o parte de tu propia imagen en la página de imagen a video; el precio en créditos de cada nivel se muestra antes de generar.


Lecturas relacionadas: Consistencia de personajes en video con IA: guía para todos los modelos, Créditos de video IA explicados y ¿Cuánto cuestan de verdad los videos con IA?.