ES
BIBLIOTECA SEEDANCE / MÁS GUÍAS
Equipo ByteDance Seed Visual 2026-07-31

Creación en una toma y referencias flexibles:
presentamos Seedance 2.5

Hoy presentamos oficialmente Seedance 2.5, el modelo de nueva generación para crear vídeos. Desde el lanzamiento de Seedance 2.0, hemos observado un cambio en las expectativas de los usuarios: buscan pasar de generar un clip a completar una obra creativa. A partir de la arquitectura multimodal unificada de generación conjunta de audio y vídeo de Seedance 2.0, Seedance 2.5 se centra en la generación básica y la generación guiada por referencias, con avances importantes en narración de larga duración, referencias multimodales y edición.

Novedades principales

  • Hasta 30 segundos por generación, con extensiones sucesivas: Clips de audio y vídeo de alta calidad de 30 segundos en una sola generación. Las transiciones entre planos y los cambios de escena mejoran para reforzar la continuidad. Los usuarios pueden producir contenidos de varios minutos con un lenguaje audiovisual coherente.
  • Referencias multimodales mejoradas: Hasta 30 imágenes, 10 clips de vídeo y 10 clips de audio como referencias en una sola generación. Se refuerzan las referencias mediante modelos 3D de arcilla, movimiento y recursos creativos.
  • Edición más precisa y estable: Control mediante marcas de tiempo para editar partes concretas del audio y el vídeo. Mejoras en pantalla verde, perspectiva de cámara y edición basada en referencias.

Acceso a Seedance 2.5

Disponible progresivamente en Jimeng AI, Doubao Pro y otras plataformas. Acceso a la API mediante BytePlus ModelArk.

Narraciones de 30 segundos con extensiones sucesivas

Seedance 2.5 amplía la duración de una sola generación de vídeo de 15 a 30 segundos y refuerza la narración en vídeos más largos. En 30 segundos, el modelo puede organizar varios planos conectados de forma lógica para que una historia avance por su planteamiento, desarrollo, giros y desenlace, en lugar de limitarse a prolongar un único instante.

Por ejemplo, en un clip de una cantante filmado en una sola toma, el modelo representa toda la historia: la cantante interactúa con el equipo en el camerino, recorre el pasillo entre bastidores, se reúne con los bailarines y sale al escenario para actuar con ellos, en lugar de mostrar únicamente su entrada en escena.

Prompt de texto a vídeo · Actuación de una cantante (30 s)
Plano secuencia de seguimiento con cámara en mano estabilizada mediante un gimbal. La cámara avanza lentamente por una abertura de un pesado telón rojo y entra en un camerino de tonos cálidos. Una joven cantante, de espaldas a la cámara, ajusta su auricular mientras un miembro del equipo le recuerda que es hora de salir. Se gira hacia la cámara y empieza a cantar city pop. La cámara retrocede y la sigue cuando atraviesa el telón hacia un pasillo tenue entre bastidores; interactúa con naturalidad con sus bailarines y un miembro del equipo le entrega un micrófono. Ella y los bailarines salen al escenario, y la cámara describe un arco hacia su espalda, revelando poco a poco el diseño del escenario en rojo y negro, las pantallas LED, los focos, la neblina y el suelo reflectante. Finalmente, la cámara se aleja hasta mostrar un plano general del recinto, con el público abarrotándolo, carteles luminosos, barras de luz y una multitud que aclama, capturando el clímax juvenil y desenfadado del concierto.
Actuación de una cantante · Plano secuencia de 30 s (resultado)
Ejemplo de extensiones sucesivas

Referencias multimodales mejoradas

Los usuarios pueden introducir hasta 30 imágenes, 10 clips de vídeo y 10 clips de audio como referencias en una sola generación. El modelo refuerza sus capacidades de referencia, incluidos los renders de modelos 3D de arcilla, el movimiento y los recursos creativos, para comprender mejor la intención del creador y materializar ideas complejas con múltiples sujetos, escenas y cambios de plano.

Referencia mediante un render de arcilla

Esta capacidad permite utilizar renders de escenas 3D simplificadas como referencias visuales para generar vídeo. El modelo conserva la composición, la cámara y la estructura de la escena del render de arcilla mientras genera un resultado fotorrealista o estilizado.

Referencia con render de arcilla · Entrada
Render de arcilla · Resultado

Referencia de movimiento

El modelo extrae patrones de movimiento de los vídeos de referencia y los aplica a nuevos sujetos o escenas, conservando los tiempos, el ritmo y la lógica espacial.

Referencia de movimiento · Entrada
Referencia de movimiento · Resultado

Edición más precisa y estable

Seedance 2.5 ofrece control mediante marcas de tiempo para editar partes concretas del audio y el vídeo, mejorando la eficiencia y el control. También amplía funciones avanzadas, como pantalla verde, perspectiva de cámara y edición basada en referencias, para responder a las exigencias de ámbitos profesionales complejos como el cine y la publicidad.

Pantalla verde y composición

Edición de pantalla verde · Ejemplo
Edición de la perspectiva de cámara
Edición basada en referencias
Edición de audio mediante marcas de tiempo

Con los avances en narración de larga duración, referencias multimodales y edición, Seedance 2.5 ofrece más que generaciones individuales más largas. El modelo comprende mejor la intención creativa y permite recorrer el camino desde la idea hasta la obra terminada con mayor control.