ES
BIBLIOTECA SEEDANCE / 02
ModelArkSeedance 2.5Tutorial / API

Dreamina Seedance 2.5
Tutorial y referencia de la API

Identificador del modelo: dreamina-seedance-2-5-260628 · Fuentes en inglés y chino · Referencia local sin conexión

Introducción

Dreamina Seedance 2.5 es un modelo de creación de vídeo de próxima generación con mejoras importantes en narración de formato largo, soporte de referencia multimodal y edición.

Antes de activar Seedance 2.5: saldo de BytePlus superior a 30 USD, un plan AI Savings Plan de al menos 30 USD o un paquete de recursos comprado con cuota disponible.

Tipos de tarea y restricciones

Seedance 2.5 determina el tipo de tarea según los recursos de entrada y el intención del prompt.

Tipo de tareaCondición de activaciónRestricciones especiales
De texto a vídeo Solo se proporciona un prompt de texto. Sin restricciones especiales en ratio o duration.
Generación desde el primer fotograma o desde el primero y el último content.role = first_frame o last_frame. ratio debe ser adaptive. El modelo mantiene la relación de aspecto consistente con la imagen del primer fotograma especificada por first_frame.
Generación de vídeo con referencias multimodales De referencias a vídeo: content contiene al menos un recurso con role = reference_image, reference_video, o reference_audio. Sin restricciones especiales en ratio o duration.
Edición de vídeo: content contiene al menos un vídeo con role = reference_video, y el prompt expresa intención de edición. ratio debe ser adaptive; duration debe ser -1. El modelo selecciona el vídeo a editar según el intención del prompt. El vídeo de referencia debe tener 4–30 s de duración.
Extensión de vídeo: content contiene al menos un vídeo con role = reference_video, y el prompt expresa intención de extensión. ratio debe ser adaptive. El modelo selecciona el vídeo a extender según el intención del prompt.

Métodos de configuración: omni_reference_task_type

Referencia multimodal sin especificar subtarea (auto)

{
  "omni_reference_task_type": "auto",
  "ratio": "adaptive",
  "duration": -1
}
Con auto, el modelo puede clasificar la tarea como generación a partir de referencias, edición de vídeo o extensión de vídeo según el prompt. La configuración recomendada satisface las restricciones de cada tipo.

Edición de vídeo (explícita)

{
  "omni_reference_task_type": "edit",
  "ratio": "adaptive",
  "duration": -1
  // Vídeo de referencia: 4–30 s
  // Palabras clave del prompt: editar vídeo, añadir, eliminar/quitar, modificar/reemplazar/cambiar
}

Ejemplos de prompt: «Añade algunos animales pequeños a @Video 1». / «Sustituye el personaje de @Video 1 por @Image 1». / «Elimina la música de fondo de @Video 1».

Extensión de vídeo (explícita)

{
  "omni_reference_task_type": "extend",
  "ratio": "adaptive"
  // Palabras clave del prompt: extender hacia adelante/atrás, continuar, continuar la historia
}

Ejemplos de prompt: «Extiende @Video 1 hacia atrás y haz que el personaje de @Image 1 descienda del cielo».

Manejo de errores

Seedance 2.5 valida parámetros al enviar la tarea Y después de que la tarea arranca.
  • Validación síncrona (al enviar): Cuando omni_reference_task_type = edit o extend, la API valida las restricciones inmediatamente. Si no se cumplen → error inmediato.
  • Validación asíncrona (después de arrancar): Cuando omni_reference_task_type = auto o no se proporciona, el modelo determina el tipo real primero, luego valida. Si no se cumplen → error asíncrono.

Código de error por incompatibilidad: InvalidParameter.TaskTypeConstraint
Código de error por discrepancia de tipo: InvalidParameter.TaskTypeMismatch

Primeros pasos con Python

Sin experiencia en programación: utiliza la consola de ModelArk con plantillas sin código.
Para una prueba rápida: utiliza API Explorer con plantillas predefinidas.

Instalación del SDK

python -m pip install --upgrade arkruntime

Ejemplo básico: crear y consultar el estado de una tarea

# python/demo_standard.py
import os, time
from arkruntime import ArkRuntime

client = ArkRuntime(api_key=os.environ.get("ARK_API_KEY"))

# ----- Crear solicitud -----
print("----- Crear solicitud -----")
create_result = client.content_generation.tasks.create(
    model="dreamina-seedance-2-5-260628",
    content=[
        {
            "type": "text",
            "text": "TU PROMPT AQUÍ"
        },
        {
            "type": "image_url",
            "image_url": {"url": "https://your-image-url.com/image.png"},
            "role": "reference_image"
        }
    ],
    generate_audio=True,
    ratio="16:9",
    duration=10
)
print(create_result)

# ----- Consultar periódicamente el estado de la tarea -----
print("----- Consultar estado de la tarea -----")
task_id = create_result.id

while True:
    get_result = client.content_generation.tasks.get(task_id=task_id)
    status = get_result.status
    if status == "succeeded":
        print("----- Tarea completada -----")
        print(get_result)
        break
    elif status == "failed":
        print("La tarea ha fallado")
        break
    else:
        print(f"Estado: {status}, esperando…")
        time.sleep(30)

Punto de acceso de la API

POST https://ark.ap-southeast.bytepluses.com/api/v3/contents/generations/tasks
Authorization: Bearer $ARK_API_KEY

Variables modificables en demo_standard.py

Capacidades clave con ejemplos

Generar vídeo coherente de 30 segundos

El límite de duración aumentó de 15 s (Seedance 2.0) a 30 segundos.

Entrada: texto + imagen de referencia
Imagen de referencia: lagarto cornudo del desierto
Generar vídeo coherente de 30 segundos

Prompt (resumen): Anuncio de pomelo con un lagarto cornudo del desierto: 0–3 s, calor del desierto; 3–6 s, el lagarto descubre el pomelo; 6–8 s, lo agarra; 8–11 s, la cáscara se abre y brota el zumo; 11–16 s, el zumo inunda el desierto; 20–23 s, nombre de la marca y eslogan; 23–29 s, el lagarto está de vacaciones en un mar de zumo. Duración total: 30 s.

Resultado
curl -X POST https://ark.ap-southeast.bytepluses.com/api/v3/contents/generations/tasks \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $ARK_API_KEY" \
  -d '{
    "model": "dreamina-seedance-2-5-260628",
    "content": [
        {"type": "text", "text": "Estilo publicitario de animación 3D… [PROMPT COMPLETO]"},
        {
            "type": "image_url",
            "image_url": {"url": "https://arkdocs-en.tos-ap-southeast-1.volces.com/images/video-generation/sd-25-30s-input.png"},
            "role": "reference_image"
        }
    ],
    "generate_audio": true,
    "ratio": "16:9",
    "duration": 30
}'

Hasta 50 recursos de referencia multimodal

Límite aumentado a 50 (30 imágenes + 10 vídeos + 10 audios). Soporta generación con solo referencias de audio (sin necesitar imagen/vídeo).

Entrada: texto + 1 imagen + 6 vídeos de referencia
Imagen 1 · Referencia del sujeto: galleta de fresa
Hasta 50 recursos de referencia multimodal
Vídeo 1 · Referencia de movimiento: composición de fruta
Vídeo 2 · Referencia de movimiento: primer plano de la galleta
Vídeo 3 · Referencia de movimiento: rotura y cámara lenta
Vídeo 4 · Referencia de movimiento: disposición horizontal
Vídeo 5 · Referencia de movimiento: ritmo del texto
Vídeo 6 · Referencia de movimiento: dispersión final
Resultado: anuncio de galletas
curl -X POST https://ark.ap-southeast.bytepluses.com/api/v3/contents/generations/tasks \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $ARK_API_KEY" \
  -d '{
    "model": "dreamina-seedance-2-5-260628",
    "content": [
        {"type": "text", "text": "Estilo de anuncio luminoso y colorido con galletas de sabores frutales… [PROMPT COMPLETO]"},
        {"type": "image_url", "image_url": {"url": "...seedance2.5_reference1.png"}, "role": "reference_image"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference2.mp4"}, "role": "reference_video"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference3.mp4"}, "role": "reference_video"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference4.mp4"}, "role": "reference_video"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference5.mp4"}, "role": "reference_video"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference6.mp4"}, "role": "reference_video"},
        {"type": "video_url", "video_url": {"url": "...seedance2.5_reference7.mp4"}, "role": "reference_video"}
    ],
    "generate_audio": true,
    "ratio": "16:9",
    "duration": 15,
    "omni_reference_task_type": "reference",
    "output_format": "mov"
}'

Edición de vídeo con control inteligente de relación de aspecto/duración

En las tareas de edición, Seedance 2.5 selecciona el vídeo según la intención del prompt y conserva automáticamente su relación de aspecto y su duración.

Diferencia máxima de duración: ~0.4 segundos. ratio = adaptive y duration = -1 obligatorios.
Entrada: Vídeo (relación de aspecto 5:4, 16 segundos)

Prompt: «Edición de vídeo: elimina a todas las personas de @Video 1 excepto al protagonista».

Resultado (relación de aspecto 5:4, ~16 segundos)
{
  "model": "dreamina-seedance-2-5-260628",
  "content": [
    {"type": "text", "text": "Edición de vídeo: elimina a todas las personas de @Video1 excepto al protagonista."},
    {"type": "video_url", "video_url": {"url": "...seedance2.5_edit_input.mov"}, "role": "reference_video"}
  ],
  "generate_audio": true,
  "ratio": "adaptive",
  "duration": -1,
  "output_format": "mov"
}

Extensión de vídeo

Selecciona el vídeo a extender según el intención del prompt y mantiene la relación de aspecto consistente. Duración de salida: configurable [4,30] o -1.

Vídeo 1 – a extender (7:5), + Vídeo 2 y Vídeo 3 de referencia (16:9)
Vídeo 1 (7:5 — se extiende)
Vídeo 2 · Referencia del interior de la galería de arte
Vídeo 3 · Referencia del cuadro

Prompt: «Extiende @Video 1. Después de que se abra la ventana, entra en el interior de la galería de arte de @Video 2. Por último, introduce la cámara en el cuadro de @Video 3».

Resultado (7:5 — relación de aspecto conservado del vídeo extendido)
{
  "model": "dreamina-seedance-2-5-260628",
  "content": [
    {"type": "text", "text": "Extiende @Video 1. Después de que se abra la ventana, entra en el interior de la galería de arte de @Video 2. Por último, introduce la cámara en el cuadro de @Video 3."},
    {"type": "video_url", "video_url": {"url": "...r2v_extend_video1_75.mov"}, "role": "reference_video"},
    {"type": "video_url", "video_url": {"url": "...r2v_extend_video2.mp4"}, "role": "reference_video"},
    {"type": "video_url", "video_url": {"url": "...r2v_extend_video3.mp4"}, "role": "reference_video"}
  ],
  "generate_audio": true,
  "ratio": "adaptive",
  "duration": 11,
  "output_format": "mov"
}

Generación desde el primer fotograma o desde el primero y el último

Mantiene automáticamente la relación de aspecto consistente con la imagen del primer fotograma especificada por first_frame.

Entrada: texto + primer fotograma (1:1) + último fotograma
Primer fotograma
Generación desde el primer fotograma o desde el primero y el último
Último fotograma
Generación desde el primer fotograma o desde el primero y el último

Prompt: «La chica de la imagen dice “patata” a la cámara, con un movimiento de cámara orbital de 360 grados».

Resultado (relación de aspecto 1:1 conservado del primer fotograma)
{
  "model": "dreamina-seedance-2-5-260628",
  "content": [
    {"type": "text", "text": "la chica de la imagen dice \"patata\" a la cámara, con un movimiento de cámara orbital de 360 grados"},
    {"type": "image_url", "image_url": {"url": "..."}, "role": "first_frame"},
    {"type": "image_url", "image_url": {"url": "..."}, "role": "last_frame"}
  ],
  "generate_audio": true,
  "ratio": "adaptive",
  "duration": 5
}

Generación multilingüe nativa

Soporta prompt e entrada en: Chino, Inglés, Español, Indonesio, Malayo, Tailandés, Árabe, Portugués, Vietnamita, Japonés, Coreano.

Entrada: texto + imagen de referencia (banda en la playa)
Imagen de referencia
Generación multilingüe nativa

Prompt (resumen): Vídeo musical cinematográfico de hiphop y rap. El vocalista principal lleva un chándal rojo y está en una playa. El rapero dice «Hola» en ocho idiomas, en este orden: inglés → chino → japonés → coreano → portugués → tailandés → español → árabe. Ocho planos con cortes directos y sincronización labial precisa. Sin subtítulos. Duración: 20 segundos.

Resultado

Comparativa de modelos

Característica Seedance 2.5Seedance 2.0Seedance 2.0 fastSeedance 2.0 mini
Identificador del modelodreamina-seedance-2-5-260628dreamina-seedance-2-0-260128dreamina-seedance-2-0-fast-260128dreamina-seedance-2-0-mini-260615
De texto a vídeo
De primer fotograma a vídeo
De primer y último fotograma a vídeo
Referencia multimodalReferencia de imagen
Referencia de vídeo
Referencia de audio (sin otros recursos)✗ (requiere imagen o vídeo)✗ (requiere imagen o vídeo)✗ (requiere imagen o vídeo)
Referencias combinadas
Editar vídeo
Extender vídeo
Vídeo con audio
Máximo de recursos de referencia50 (30 imágenes + 10 vídeos + 10 audios)15 (9+3+3)15 (9+3+3)15 (9+3+3)
Especificaciones de salidaResolución480p / 720p / 1080p (10 bits)480p / 720p / 1080p / 4K (10 bits)480p / 720p480p / 720p
Relación de aspecto21:9, 16:9, 4:3, 1:1, 3:4, 9:16, adaptiveigualigualigual
Duración4–30 s o -14–15 s o -14–15 s o -14–15 s o -1
Formato salidamp4, movmp4mp4mp4

Especificaciones de salida

Resolución

Parámetro resolution. Valor predeterminado: 720p

  • 480p — profundidad de color de 8 bits
  • 720p — profundidad de color de 8 bits
  • 1080pprofundidad de color de 10 bits, H.265/HEVC (puede requerir VLC, mpv o QuickTime para reproducir)

Relación de aspecto

Parámetro ratio. Valor predeterminado: adaptive

Valores: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9, adaptive

En edición de vídeo, extensión de vídeo y generación desde el primer fotograma o desde el primero y el último, solo se puede usar adaptive.
ResoluciónRelación de aspectoDimensiones (px)
480p16:9854×480
4:3752×560
1:1640×640
3:4560×752
9:16480×854
21:9992×432
720p16:91280×720
4:31112×834
1:1960×960
3:4834×1112
9:16720×1280
21:91470×630
1080p16:91920×1080
4:31664×1248
1:11440×1440
3:41248×1664
9:161080×1920
21:92206×946

Duración

Parámetro duration. Valor predeterminado: -1. Rango: [4, 30] o -1

  • -1 en edición: mantiene la duración del vídeo a editar (diferencia máx. 0.4 s)
  • -1 en otros: el modelo elige una duración entre [4, 30]
En edición de vídeo, duration solo soporta -1. El vídeo entrada debe tener [4, 30] s.

Formato de salida (mov)

Parámetro output_format. Valores: mp4 (predeterminado) o mov

  • mp4: Formato de uso general, máxima compatibilidad
  • mov: Alta precisión de color para entornos profesionales. Utiliza vídeo H.264, muestreo de crominancia yuv444p y audio PCM. Recomendado para edición y extensión de vídeo
ReproductormacOSWindows
IINA
VLC
mpv
ffplay

Consejos para prompts (resumen)

Límites de uso

Imágenes

Vídeos

Audio

Retención

Límites de solicitudes

DimensiónEmpresaIndividual
Máximo de solicitudes por minuto600180
Máximo de tareas simultáneas103

Versión china (ZH) · Tutorial de Doubao Seedance 2.5

La versión china es funcionalmente idéntica, pero utiliza una red de distribución de contenido diferente (ark-project.tos-cn-beijing.volces.com) y se llama "Doubao Seedance 2.5" en el mercado chino.
Acceder en: docs.volcengine.com/docs/82379/2607688?lang=zh

Diferencias clave entre las versiones china e inglesa