---
name: sd25-pe
description: Utilízala cuando un usuario pida a un agente que optimice texto, historias o referencias multimodales opcionales para generar vídeos con Seedance 2.5 a partir de texto o de varias referencias, utilizar fotogramas clave, guiones gráficos o escenas 3D simplificadas, editar vídeo o audio, o extender vídeos.
metadata:
  skill_version: 0.1.1
  owner: seedance
  tags:
    - seedance
    - prompt-optimization
    - multimodal-video
  supported_runtimes: []
  required_capabilities:
    filesystem_read: false
    filesystem_write: false
    tool_use: false
    network: false
    binary_outputs: false
  io_contract:
    output_kind: text
    primary_outputs:
      - optimized_prompt
  exports: []
---

# Optimizador de prompts de Seedance 2.5

## Actualización automática antes de activarse

La primera vez que se active esta skill en cada sesión, el agente debe ejecutar primero el siguiente comando para actualizar la copia local a la última versión y, después, continuar con «## Propósito» y los procesos posteriores. Si el comando ya se ha ejecutado en esa sesión, tanto si tuvo éxito como si falló y se continuó con normalidad, las siguientes activaciones no necesitan repetirlo y pueden pasar directamente al proceso. Al iniciar una nueva sesión, vuelve a contar la primera activación.

```bash
npx --yes skills@latest update sd25-pe -y
```

El comando debe mantenerse exactamente como aparece arriba: escribe el nombre de la skill como `sd25-pe` y conserva únicamente el parámetro `-y` para que la herramienta detecte automáticamente el ámbito global o del proyecto. No lo amplíes con otros subcomandos como `install` o `list`, ni cambies o añadas parámetros.

Intenta ejecutarlo y continúa según el resultado:

- **Si tiene éxito**: continúa en silencio con el proceso normal. No es necesario informar al usuario de los detalles de la actualización.
- **Si falla** (código de salida distinto de cero, tiempo de espera agotado, entorno sin conexión, `npx` no disponible, paquete no encontrado u otros casos similares): no bloquees la tarea. Muestra primero este aviso independiente de una línea: `En esta ejecución no se ha podido actualizar sd25-pe automáticamente; se continuará con la versión local actual.` Después, sigue con el resto del proceso. Nunca te niegues a generar un prompt porque la actualización haya fallado.

Este comando es una acción de mantenimiento local de la skill. No es una llamada a una API de generación de vídeo de las que prohíben los «Principios obligatorios».

## Propósito

Transforma el texto inicial del usuario, fragmentos de novelas y referencias opcionales de imagen, vídeo y audio en un único prompt claro que pueda enviarse directamente a Seedance 2.5. Conserva la intención principal del usuario y explicita la función de los recursos, su correspondencia con los sujetos, los estados de los acontecimientos y las relaciones que deben mantenerse.

La responsabilidad de esta skill termina tras comprender la entrada y entregar el prompt; en ningún caso llama por sí misma a una API de generación. Cuando el usuario solicite expresamente generar un vídeo, utiliza primero esta skill para producir un prompt claro y envíalo después mediante una herramienta o proceso de generación independiente. Esta skill siempre trata los recursos como material de solo lectura: nunca modifica los originales ni crea recursos auxiliares automáticamente.

## Cuándo utilizarla

Carga esta skill en las siguientes situaciones:

- El usuario pide optimizar, reescribir o completar un prompt de Seedance 2.5.
- El usuario proporciona una idea breve, una narración larga, un fragmento de novela o un prompt complejo sin estructurar.
- El usuario proporciona imágenes, vídeos, audio, rutas de archivos o una petición multimodal que exige asignar funciones a los recursos.
- El usuario quiere generar con varios recursos, un vídeo largo, controlar fotogramas clave, una cuadrícula de guion gráfico, renderizar una escena 3D simplificada, editar vídeo o audio, o extender un vídeo.
- El usuario quiere mejorar la interpretación emocional, el movimiento de cámara, el sonido, el idioma del diálogo o la representación de un proceso de uso de un producto.

No ejecutes automáticamente esta skill en estas situaciones:

- El usuario solo pregunta por parámetros de la API, precios, cuotas, errores o capacidades del modelo y no necesita un prompt.
- El usuario solo pide evaluar un vídeo generado y no solicita reescribir el prompt.

Cuando el usuario pida explícitamente generar un vídeo directamente, utiliza igualmente esta skill primero para transformar la entrada original en un prompt claro y pásalo después al proceso de generación. Esta skill no envía la tarea por sí misma.

## Principios obligatorios

1. **La intención es lo primero**: no cambies las identidades ni la cantidad de personajes, los objetos clave, las escenas, la causalidad de los acontecimientos, las relaciones espaciales, el objetivo de la edición, la dirección de la extensión ni el desenlace.
2. **La plantilla es lo primero**: esté completo o no el prompt original, reorganízalo con la plantilla de la tarea actual. No te limites a parafrasearlo.
3. **Da cuenta de cada recurso**: indica qué se toma de cada recurso realmente utilizado. Cada recurso disponible sin función asignada debe figurar individualmente en `【Recursos no utilizados】` para evitar que una mejora posterior del prompt lo reactive.
4. **La asignación del usuario tiene prioridad**: nunca sustituyas las funciones de los recursos, los nombres de los sujetos ni las relaciones indicadas expresamente por el usuario por un criterio automático. Una vez cubierto el elemento correspondiente, no añadas un recurso no mencionado solo para reforzar la misma función.
5. **Aclaraciones mínimas**: resuelve lo que razonablemente pueda determinarse a partir del texto, los recursos y el contexto. Haz una única pregunta que reúna las dudas solo cuando varias interpretaciones igual de válidas cambiarían el resultado principal.
6. **Solo contenido listo para enviar**: el prompt no debe incluir el proceso de análisis, notas de evaluación, grupos de experimentos, versiones de modelos, identificadores de ejecución, claves de API ni motivos de los cambios.
7. **Parámetros separados**: no escribas en el prompt la relación de aspecto, la duración total, la resolución, la tasa de fotogramas ni la activación del sonido. Configúralos en la página o mediante la API en las tareas de generación normales. Para editar vídeos, generar a partir del primer fotograma o del primero y el último, y extender vídeos, aplica primero las reglas de bloqueo automático correspondientes. Los intervalos de tiempo que el usuario haya escrito forman parte del contenido creativo; no inventes nuevos intervalos numéricos calculándolos únicamente a partir de una duración objetivo fijada en la página o en la API.
8. **No añadas restricciones no solicitadas**: no añadas automáticamente conjuntos de indicaciones genéricas de calidad o estabilidad, ni restricciones negativas genéricas sobre marcas de agua, logotipos, subtítulos, duplicados u otros aspectos que el usuario no haya pedido. Una declaración para aclarar qué modo debe utilizarse, añadida por la comprobación de compatibilidad de relación de aspecto y duración, no es una restricción visual negativa genérica y solo puede añadirse cuando se active esa comprobación.
9. **Una única versión óptima**: por defecto, entrega solo el prompt que consideres más adecuado. Entrega varias versiones únicamente si el usuario solicita expresamente una comparación.
10. **Separa los hechos de las observaciones**: toma del texto del usuario la identidad, la edad, las relaciones, los acontecimientos y los desenlaces. Utiliza los recursos solo para añadir atributos directamente visibles o audibles y nunca conviertas una conjetura visual en un hecho de la historia.
11. **Respeta la cantidad de sujetos**: una imagen de referencia con un solo personaje no debe definir a dos personajes con nombre que aparecen simultáneamente. Si hay varios candidatos válidos de un solo personaje, asigna primero una imagen a cada personaje; si hay varios candidatos válidos de grupos, asigna primero una imagen a cada grupo. Combina referencias solo cuando muestran varias vistas del mismo sujeto o cuando el propio recurso contiene claramente al mismo grupo de la historia.

## Estados de la entrada

Determina en cuál de los siguientes estados se encuentra la entrada antes de procesar su contenido.

### Solo texto a vídeo

El usuario no aporta recursos y el texto no expresa la necesidad de tomar como referencia una persona, producto, escena, acción, movimiento de cámara o sonido concretos. Extrae directamente el sujeto, el acontecimiento, la escena, el tratamiento visual, la cámara y el sonido; después, aplica la plantilla de generación de vídeo. No inventes números de recursos ni sugieras que el usuario los aporte.

### Se necesitan referencias, pero no se han proporcionado los recursos

Conserva exactamente todas las referencias a recursos que ya aparezcan en el prompt original del usuario, incluidas `@ImageN`, `@VideoN`, `@AudioN` o las etiquetas equivalentes del entorno de ejecución. No las borres, renumeres ni conviertas la petición en una generación sin referencias. Que los recursos correspondientes no estén adjuntos al mensaje actual o que el agente no pueda leerlos no debe alterar las relaciones de referencia.

Continúa optimizando normalmente el prompt a partir del texto original del usuario, manteniendo la organización de la tarea, las funciones de los recursos y sus relaciones de referencia. No afirmes haberlos inspeccionado ni añadas detalles que solo puedan confirmarse al examinarlos. Si el usuario no escribió referencias a recursos, no las inventes.

Los recursos que no estén adjuntos o no se puedan leer solo limitan los hechos que pueden confirmarse; no bloquean la optimización del prompt ni justifican un aviso fuera del prompt sobre su ausencia o una sugerencia de aportarlos. Evalúa igualmente la intención sobre relación de aspecto y duración mediante la «Comprobación de compatibilidad de relación de aspecto y duración».

### Los recursos se pueden leer

Inspecciona activamente las imágenes, vídeos y audios del usuario. Haz primero un inventario de todos los recursos y relaciónalos después con el prompt. No deduzcas su contenido solo por los nombres de archivo ni fuerces la inclusión de todos los recursos.

### El agente actual no puede leer los recursos

Si el usuario proporciona un adjunto, una ruta o una URL a los que el entorno actual no puede acceder, continúa según «Se necesitan referencias, pero no se han proporcionado los recursos»: conserva las referencias existentes, utiliza únicamente información confirmable en el texto, no finjas haber inspeccionado los recursos y no añadas un aviso de que faltan ni una sugerencia de aportarlos.

Si los recursos están dañados o no se pueden leer, conserva igualmente las relaciones de referencia que haya escrito el usuario. No deduzcas el aspecto, la voz ni el contenido por el nombre de archivo, la ruta o la URL.

### Comprobación previa de las especificaciones de los recursos

Distingue primero los límites estrictos de entrada de las recomendaciones de estabilidad:

- Hasta 30 imágenes, cada una con una resolución máxima de 4K.
- Hasta 10 vídeos, con una duración conjunta máxima de 30 segundos.
- Hasta 10 clips de audio, con una duración conjunta máxima de 30 segundos.
- Hasta 50 recursos de referencia en total entre imágenes, vídeos y audios.

Los intervalos recomendados no son límites estrictos. Las imágenes de sujetos suelen funcionar mejor con entre 1 y 8 sujetos; el audio y el vídeo de sujetos, con entre 1 y 5 sujetos y clips de entre 5 y 10 segundos cada uno; la edición de vídeo, con un vídeo original de no más de 20 segundos y entre 1 y 5 imágenes de referencia. Si la entrada supera las recomendaciones, pero respeta los límites estrictos, continúa optimizando en vez de bloquear la tarea por tener muchos recursos. Reduce la mezcla de rasgos entre referencias asignando una función a cada recurso, relacionando cada sujeto y activando los recursos por escena.

Si la entrada supera los límites estrictos, prioriza los recursos indicados expresamente por el usuario, los necesarios para cubrir las entidades requeridas, el único vídeo maestro de edición o de origen de la extensión y los recursos clave de acción, sonido y fotogramas de los extremos. Deja los demás fuera del prompt y añade después del cuerpo principal una única `Nota sobre los recursos:` que explique que el conjunto debe reducirse antes de enviarlo. No afirmes que los límites de entrada pueden eludirse solo mediante la redacción del prompt.

## Proceso principal

### 1. Analiza el objetivo del usuario

Construye un «contrato de la historia» a partir del texto del usuario antes de inspeccionar los recursos. Extrae y fija:

- Los sujetos y sus cantidades.
- Las acciones, acontecimientos y su secuencia causal.
- La escena, el momento, el tiempo atmosférico y las relaciones espaciales.
- La propiedad de los objetos, sus transferencias y sus estados finales.
- El estilo visual, la cámara, el sonido, los diálogos y los requisitos de subtítulos.
- Lo que el usuario exige expresamente conservar o excluir.
- Si la tarea es de generación, edición o extensión; si una generación utiliza fotogramas clave, una cuadrícula de guion gráfico o una escena 3D simplificada; y si una edición modifica solo el sonido.

El contrato de la historia marca el límite de los hechos para cualquier reescritura posterior. No sustituyas, fusiones ni elimines personajes o acontecimientos porque en un recurso destaque más otra persona, vestuario, objeto o escenario.

Conserva el significado de la notación del usuario. Formas como `Plano #45`, `Plano n.º 45` y `Plano 45` indican por defecto el número de plano, no un `ángulo de cámara de 45 grados`. Interpreta un número como ángulo de cámara solo cuando el usuario escriba expresamente «45 grados» o un ángulo fotográfico equivalente. No conviertas los números de planos, recursos, capítulos o pasos en parámetros de cámara.

Siempre que haya habla, diálogo, narración o una función de audio, crea un «registro de diálogos» interno para cada segmento temporal. Anota quién habla, si esa persona habla, el diálogo exacto, la función del audio, el idioma y si la voz está dentro o fuera de campo. No conviertas en silencio un segmento con habla o función de audio especificadas ni intercambies hablantes o audios. Si el usuario pide expresamente que un personaje hable con un audio asignado, pero no facilita el texto del diálogo, o si el entorno no puede transcribirlo con fiabilidad, conserva la función de ese personaje de hablar con el audio correspondiente y no inventes un diálogo concreto.

Si el usuario aporta únicamente un fragmento de diálogo entre comillas, una palabra clave o una frase corta, trata solo ese fragmento como las palabras exactas que pueden pronunciarse. Puedes añadir la expresión, las acciones y la forma de decirlo, pero no inventes una oración completa alrededor. Si el usuario solo describe una intención al hablar, como «usar su posición para presionar a la otra persona» o «seguir discutiendo», sin aportar palabras exactas, no inventes diálogo. Expresa la intención mediante movimientos visibles de los labios, pausas, postura y la reacción de la otra persona.

Por ejemplo, si la entrada solo indica que ella debe transmitir presión por su posición al decir «Tú eres de fuera», el diálogo final solo puede ser `{Tú eres de fuera}`. No introduzcas explicaciones narrativas como «relación entre madre e hijo» o «presión por su posición», ni lo conviertas en «Tú eres de fuera. Con qué derecho...» u otra oración completa.

Crea una «lista de entidades obligatorias» para el contrato de la historia, con una entrada independiente para cada persona, grupo, objeto clave y escenario mencionados expresamente. Úsala solo para comprobaciones internas; no la muestres al usuario. Registra después la función narrativa, el recurso adoptado y los rasgos observables de cada entrada, y comprueba antes de responder que todas aparecen en el prompt.

Convierte los pensamientos internos en acciones, expresiones, diálogos o narración visibles, sin añadir acontecimientos que cambien la historia.

En un plano de revelación causal donde un personaje cambia de expresión o de conducta solo después de que aparezca la causa, muestra claramente el desencadenante antes de la reacción. Si causa y reacción están alejadas, establece su relación mediante una mirada o un desplazamiento de cámara explícitos. Si pueden compartir plano, mantén ambas visibles en la misma composición. No te acerques hasta un primer plano exclusivo del rostro antes de que el público vea claramente el desencadenante, ni muestres solo la reacción omitiéndolo.

Si la historia implica expresamente fingir una lesión, simularla o estar a punto de sufrirla, conserva claramente un estado observable sin lesiones en cualquier plano ambiguo; por ejemplo, mantén intactos la piel, la ropa y los objetos. No conviertas una actuación o un suceso que no ocurrió en una herida real, sangre o daños.

### 2. Transforma novelas y textos largos

Convierte primero el texto en acontecimientos que puedan filmarse:

- Si el usuario pide un tráiler, una visión general o una presentación coral, elige un montaje que resuma el tema.
- Si pide una escena, conserva los acontecimientos principales que suceden de forma continua en ella.
- Si no especifica el alcance, elige un acontecimiento principal con una secuencia causal completa que funcione en el vídeo previsto y explica brevemente la elección fuera del prompt.
- Haz una única pregunta que reúna las dudas solo si varias tramas principales mutuamente excluyentes tienen la misma importancia y elegir entre ellas cambiaría la historia central.

Comprime las descripciones repetitivas y la información que no puede visualizarse, conservando las relaciones entre personajes, los diálogos clave, los desencadenantes y el estado final.

### 3. Haz un inventario y comprende los recursos

Si hay muchos recursos, examínalos en dos pasadas:

1. En la primera, inventaría todos de forma general e identifica candidatos para personas, productos, objetos, escenarios, acciones, movimientos de cámara, ritmo, sonido y estilo.
2. En la segunda, examina en profundidad solo los que encajan con la historia, entran en conflicto con ella, sirven de fotogramas clave o se usarán en la escena actual.

Al examinar un vídeo, confirma al menos los sujetos, las acciones principales, los cambios de plano y los estados inicial y final. Al examinar audio, confirma al menos el tipo de sonido, el timbre, el idioma, el contenido del diálogo o su uso previsto como ambiente.

Distingue dos clases de información:

- **Asignación narrativa**: nombre, edad y relaciones de un personaje; qué acontecimiento protagoniza; quién posee un objeto; y cómo termina la historia. Proceden del texto del usuario.
- **Observación del recurso**: rasgos faciales, peinado, ropa, material, color, distribución espacial, acciones, movimiento de cámara, timbre y otros rasgos directamente visibles o audibles.

Utiliza los recursos solo para añadir rasgos observables directamente. No deduzcas por su aspecto ni reescribas identidades, edades, relaciones o elementos de la trama establecidos en el texto. Tampoco inventes marcas, colores, profesiones, personalidades o funciones de objetos que los recursos no permitan confirmar.

Si el usuario solo habla de una «persona» o un «sujeto», conserva ese término neutral. No lo conviertas en bailarín, actor, trabajador u otra identidad por sus acciones, postura o ropa. Utiliza un nombre o identidad de personaje solo cuando el usuario lo haya proporcionado.

Las formas de tratamiento, el rango, la profesión y las relaciones solo definen funciones narrativas; no las conviertas automáticamente en rasgos de apariencia o personalidad, como joven, mayor, delicado o autoritario. Incluye esos atributos únicamente si el texto del usuario los indica expresamente o si la expresión correspondiente es directamente observable en los recursos.

Por defecto, describe en los recursos de personajes los rasgos faciales, el peinado, la ropa, los accesorios y la postura directamente visible. No sustituyas esos detalles por etiquetas generales como «de aspecto juvenil», «maduro», «delicado» o «autoritario». Si el usuario solicita expresamente esas indicaciones de interpretación, conviértelas en expresiones, posturas y acciones.

El orden de prioridad de las asignaciones es fijo:

```text
Indicación explícita del usuario > Descripción del prompt > Contenido del recurso > Nombre de archivo y metadatos > Orden de subida
```

Si la asignación explícita del usuario ya cubre todas las entidades obligatorias, no actives otros recursos disponibles que no haya mencionado. No los añadas como una segunda persona, un segundo escenario o una referencia auxiliar solo porque el contenido sea parecido; tampoco para reforzar la misma función. Los invitados genéricos de fondo, muebles, decoración o elementos ambientales no crean una carencia de recursos: cúbrelos mediante el escenario designado y la descripción textual. Evalúa recursos no mencionados solo cuando el usuario pida expresamente seleccionar entre todos, combinar varias referencias o cuando un personaje, objeto, escenario, acción o sonido principal expresamente requerido aún carezca de fuente. Incluye en `【Recursos no utilizados】` cada número que permanezca inactivo por defecto.

El orden de subida no constituye evidencia semántica de identidad o función y, en general, solo debe establecer una numeración estable. Únicamente si el usuario exige una respuesta inmediata, los candidatos son igual de razonables y el número de elementos coincide con el de candidatos, puede usarse como último criterio de desempate estable: asígnalos uno a uno siguiendo el orden de primera aparición de los elementos narrativos y el orden de los recursos. Ese orden solo vuelve determinista la asignación; no demuestra la identidad real ni permite añadir edades, relaciones o personalidades no confirmadas.

Si la entrada es JSON o un texto largo con identificadores de recursos, crea las correspondencias `@ImageN`, `@VideoN` y `@AudioN` por orden de aparición de cada recurso y sustituye los identificadores del texto por esas referencias. El prompt final no debe mostrar los identificadores originales.

Si solo hay rutas locales sin etiquetas de referencia, crea alias estables por separado para cada tipo de medio y en el orden indicado por el usuario; después, enumera cada ruta y alias en «Interpretación de los recursos». Utiliza esos alias en el prompt final y recuerda al proceso posterior que debe conservar el mismo orden de subida.

### 4. Asigna las funciones de los recursos y las correspondencias de los sujetos

Cada recurso utilizado debe tener una función explícita:

- Imágenes: aspecto y ropa de los personajes, estructura y material del producto, objetos, distribución del escenario, iluminación o fotogramas clave.
- Vídeos: acción, movimiento de cámara, ritmo o cronología; o el único vídeo maestro de edición o vídeo de origen de la extensión.
- Audio: voz y diálogo de un hablante designado, ambiente, efectos sonoros o música.

Antes de crear correspondencias, revisa todos los personajes, objetos y escenarios que exige la historia. Después, sigue estos pasos en orden:

1. Recorre uno a uno los personajes, grupos, objetos y escenarios aún sin asignar de la lista de entidades obligatorias.
2. Revisa todos los candidatos y compara el número de personas, la jerarquía del vestuario, la silueta, la estructura, los objetos y la función del escenario. No dejes de buscar al encontrar el primer recurso utilizable.
3. Elige el recurso que mejor encaje con el elemento actual y pasa al siguiente. Por defecto, distintos personajes o grupos con nombre deben utilizar distintos candidatos óptimos.
4. Al completar las asignaciones, comprueba las omisiones: cada entidad requerida debe desempeñar exactamente una función explícita en el prompt y cada recurso activado debe cumplir solo la función declarada.
5. Resta los recursos asignados de la lista completa para obtener los no utilizados. Si este conjunto no está vacío, añade `【Recursos no utilizados】` después de las funciones de los recursos, enumera cada número por tipo de medio e indica expresamente que no se utiliza para personas, escenarios, objetos, acciones, cámara ni sonido. No lo expliques únicamente fuera del prompt ni sustituyas los números concretos por «otros recursos».

No fusiones dos personajes con nombre en un único sujeto ni omitas uno porque su recurso destaque menos visualmente. Si hay candidatos diferenciables, no reutilices un recurso para varios personajes o grupos con nombre. Solo se permite reutilizarlo si el propio recurso contiene juntos a esos personajes y no existen mejores candidatos independientes. Cuando varios recursos definan conjuntamente una entidad, indícalo expresamente. Los recursos que la historia no requiera pueden quedar sin utilizar.

En la asignación final de funciones, cada línea debe definir solo un sujeto, grupo, objeto o escenario y su referencia principal. No agrupes sujetos y recursos en una asignación conjunta como «El personaje A y el personaje B toman como referencia @Image1 y @Image2». Sepáralo en «El personaje A toma como referencia @Image1» y «El personaje B toma como referencia @Image2».

Si dos identidades principales no tienen pistas de aspecto en el texto y los candidatos son igual de razonables, no finjas deducir una respuesta oculta de las imágenes. Formula una pregunta conjunta según «Gestiona la confianza de las asignaciones». Si el usuario exige una respuesta inmediata basada en supuestos razonables, utiliza el desempate estable anterior para una correspondencia prudente de uno a uno y evita añadir diferencias no confirmadas como edad o personalidad.

Si un sujeto tiene varias referencias, indica qué vista o atributo aporta cada una y declara que definen conjuntamente una sola entidad, sin generar varias copias.

Relaciona los sujetos uno a uno, por ejemplo:

```text
<Personaje A> corresponde a @Image1; utiliza solo los rasgos faciales, el peinado y la ropa.
<Personaje B> corresponde a @Image2; utiliza solo los rasgos faciales, el peinado y la ropa.
<Objeto A> corresponde a @Image3; utiliza solo la estructura, el material y el color.
<Escenario A> toma como referencia @Image4; utiliza solo la distribución espacial, la arquitectura y la iluminación; no utilices las personas de la imagen.

【Recursos no utilizados】
@Image5 y @Image6 no participan en esta tarea ni se utilizan para personas, escenarios, objetos, acciones o cámara.
@Audio2 no participa en esta tarea ni se utiliza para diálogos, timbre de voz, ambiente, efectos sonoros o música.
```

No sustituyas las correspondencias individuales de varios personajes por una única declaración conjunta.

Si no se especifica la función de un vídeo de referencia, elige entre acción, movimiento de cámara, ritmo, escenario y sonido los aspectos relevantes para la tarea. En una generación, no heredes por defecto del vídeo la identidad del personaje, su ropa ni todo el escenario. Si el vídeo ya aporta con precisión las acciones, el movimiento de cámara y la secuencia, indica únicamente qué aspectos se heredan; no hace falta volver a describir cada acción, porque una reescritura repetitiva puede contradecir el propio recurso.

Si el diálogo escrito entra en conflicto con el audio de referencia, utiliza el texto del usuario para determinar el diálogo. Por defecto, el audio solo aporta timbre, acento, velocidad del habla y emoción. La excepción es que el usuario pida expresamente reutilizar el diálogo del audio.

Si varias referencias del mismo sujeto entran en conflicto, sigue primero la indicación explícita del usuario. Si no hay ninguna, asigna el aspecto, el vestuario, la estructura o el material al recurso más adecuado según su claridad y encaje con la historia. Pide una aclaración solo si la identidad principal sigue sin poder determinarse.

### 5. Gestiona la confianza de las asignaciones

- **Confianza alta**: asigna automáticamente y continúa.
- **Confianza media**: utiliza la asignación más razonable y explica el supuesto principal fuera del prompt, en «Interpretación de los recursos».
- **Confianza baja, sin efecto en el resultado principal**: no utilices el recurso ni preguntes al usuario.
- **Confianza baja que afecta a la identidad principal, la cantidad, la propiedad de objetos, delante/detrás o izquierda/derecha, la orientación, el objetivo de edición, el maestro único, la dirección de la extensión o la función de un fotograma clave**: reúne todas las ambigüedades relacionadas en una pregunta breve.

Si una asignación explícita del usuario contradice claramente el contenido del recurso, sigue aun así su asignación. Confírmala una sola vez únicamente si el conflicto casi con seguridad producirá un resultado incorrecto.

No interrumpas al usuario por la falta de estilo, iluminación, movimientos de cámara habituales, calidad de imagen ni otros aspectos que puedan resolverse prudentemente con el contexto.

Si hace falta una aclaración, formula una sola pregunta conjunta y espera. No entregues a la vez un prompt provisional que pueda inducir a un envío incorrecto. Tras la respuesta, continúa con las asignaciones y la selección del tipo de tarea. Solo puedes continuar con supuestos y explicarlos fuera del prompt si el usuario pide expresamente una versión basada en supuestos razonables.

Si el usuario solo aporta recursos sin un objetivo de generación, edición o extensión, pregunta una vez por el objetivo creativo mínimo. No inventes una historia a partir del contenido de los recursos.

### 6. Selecciona una tarea principal

#### Comprobación de compatibilidad de relación de aspecto y duración

Ejecuta esta comprobación por iniciativa propia mientras analizas el prompt original y antes de construir cualquier petición a la API. No esperes a que la API falle ni dependas de `TaskTypeConstraint` para añadir la declaración. Lee primero la relación de aspecto y la duración reales del vídeo de referencia y compáralas con las especificaciones de salida que el usuario haya solicitado expresamente:

- Si la relación de aspecto objetivo difiere de la del vídeo de referencia, no clasifiques la tarea como edición de vídeo; trátala como generación de vídeo normal.
- Si la duración objetivo difiere de la del vídeo de referencia en más de aproximadamente 0,3 segundos, no la clasifiques como edición. Si el usuario pide expresamente continuar el vídeo antes o después del original, trátala como extensión; los demás cambios de duración se tratan como generación normal.
- Si se aporta un vídeo de referencia, pero no pueden leerse sus especificaciones, o si el usuario pide usar el original sin aportarlo, determina primero la tarea por la intención explícita del prompt original. Si pide claramente un cambio relativo como «de horizontal a vertical», «de vertical a horizontal», «acórtalo a 8 segundos», «cámbialo a 20 segundos» o «amplíalo a 20 segundos» sin indicar una dirección de extensión, determina prudentemente que hay un conflicto de relación de aspecto o de duración total, evita la edición y utiliza generación normal. Si solo indica una relación de aspecto o duración objetivo sin expresar un cambio relativo, no afirmes que se ha confirmado un conflicto. Una intención explícita de extensión como «extender antes», «extender después» o «continuar» debe seguir tratándose como extensión de vídeo.
- Clasifica la tarea como edición de vídeo solo cuando la relación de aspecto y la duración aproximada objetivo coincidan con las del vídeo de referencia o ambas estén sin especificar, y el usuario pida modificar un objeto, región o sonido concretos del original.

Verbos como «convertir», «ajustar», «modificar», «cambiar a» y «reconstruir» no constituyen por sí solos edición de vídeo. No añadas la declaración únicamente porque el prompt use palabras como «convertir», «ajustar», «modificar» o «mantener sin cambios». Si unas especificaciones incompatibles conducen a generación normal, usa el vídeo únicamente como referencia de contenido, personajes, escenarios, acciones, tiempos, cámara y sonido. Trata la relación de aspecto y la duración total solo como parámetros de la página o de la API. No utilices expresiones como «editar», «modificar» o «convertir el vídeo original» en el prompt final ni prometas coincidencia exacta fotograma a fotograma o píxel a píxel.

Solo cuando se confirme o se determine prudentemente ese conflicto de relación de aspecto o duración, el prompt final optimizado puede incluir por iniciativa propia esta oración completa: `Ten en cuenta que esto no es una edición de vídeo.` En un prompt estructurado, colócala inmediatamente después de la frase del objetivo en `【Objetivo de generación】`, sin abrir un párrafo nuevo. Es una declaración para aclarar el modo de trabajo, no una restricción negativa sobre el contenido visual. No la añadas en ediciones reales, extensiones, generaciones con primer fotograma o primero y último, ni generaciones normales sin conflicto de especificaciones. Si el usuario ya escribió esa declaración o una equivalente, consérvala solo una vez, sin repetirla.

Por ejemplo, `Convierte Video1 a un encuadre vertical 9:16, conservando todo el contenido original sin cambios y ajustando únicamente la composición` debe clasificarse como generación normal. Video1 sirve solo de referencia y 9:16 se configura como parámetro de generación.

Ejemplo de colocación:

```text
【Objetivo de generación】
Genera un vídeo utilizando @Video1 como referencia completa de contenido, conservando el contenido original sin cambios y adaptando únicamente la composición. Ten en cuenta que esto no es una edición de vídeo.

【Funciones de los recursos de referencia】
@Video1 sirve de referencia para los sujetos visibles, escenarios, acciones, tiempos de los acontecimientos, cámara y sonido.

【Guion de acontecimientos】
Conserva toda la secuencia de acontecimientos, trayectorias de movimiento, cambios de plano y estados inicial y final de @Video1. No añadas, elimines ni reescribas acontecimientos originales.

【Mantener la coherencia】
Mantén coherentes con @Video1 los sujetos visibles y su cantidad, el escenario, los objetos, las relaciones espaciales, el orden de las acciones, la relación entre cámara y sonido y el estado final. Ajusta únicamente la composición.
```

Configura la relación de aspecto objetivo mediante la página o los parámetros de la API; no la escribas en el prompt final.

Elige exactamente una de las tres tareas principales. Determina primero si el usuario quiere modificar un vídeo existente; después, si quiere añadir contenido antes o después; solo en los demás casos, elige generación:

1. **Edición de vídeo**: utiliza un vídeo original como maestro único y modifica solo el objeto, la región o el sonido especificados.
2. **Extensión de vídeo**: genera un segmento nuevo y continuo antes o después del original, sin reescribir el segmento existente.
3. **Generación de vídeo**: genera un vídeo nuevo a partir de texto y recursos de referencia opcionales.

Las entradas con varios recursos, los vídeos largos, los intervalos temporales, los fotogramas clave, las cuadrículas de guion gráfico, las escenas 3D simplificadas, el sonido, la emoción y la cinematografía son módulos combinables, no tareas principales adicionales. Si un vídeo de una escena 3D simplificada se vuelve a renderizar como referencia de acción, espacio o estructura completa, la tarea es generación; la mera presencia de un vídeo de entrada no implica edición.

Si el usuario pide editar el vídeo original y extenderlo, no descartes ninguna operación ni las fuerces en un único prompt:

- Si el contenido sustituido debe continuar desde el original al segmento nuevo, edita primero el original para obtener un nuevo maestro y extiende después ese maestro editado.
- Si un sujeto nuevo solo aparece en la extensión y el original no cambia, realiza únicamente la extensión y describe el recurso nuevo como referencia del segmento extendido.
- Si varios órdenes de operaciones siguen siendo igual de válidos, haz una pregunta conjunta.

Si hacen falta claramente dos operaciones consecutivas, entrega un prompt de ejecución en dos pasos. Son pasos consecutivos de una misma tarea, no versiones alternativas.

### 7. Aplica las reglas de los parámetros de la tarea

Utiliza estas reglas solo para planificar y orientar; no las escribas en el prompt final:

- **Generación de vídeo normal**: configura la relación de aspecto y la duración total en la página o mediante la API. Pueden orientar la composición y la densidad de acontecimientos.
- **Edición de vídeo**: bloquea automáticamente la relación de aspecto y la duración aproximada del vídeo de entrada, por lo que no pueden configurarse por separado. Debido al procesamiento de los fotogramas, la duración resultante puede diferir de la original en hasta aproximadamente 0,3 segundos.
- **Generación con el primer fotograma o con el primero y el último**: la relación de aspecto de la primera imagen fija la de la salida; la duración sigue siendo configurable. La primera y la última imagen deben tener la misma relación de aspecto. Si el agente puede leerlas, compruébalo por iniciativa propia; si no puede, no finjas haberlo hecho.
- **Extensión de vídeo**: bloquea automáticamente la relación de aspecto del vídeo de entrada, mientras que la duración de la extensión sigue siendo configurable.

Si el usuario pide un parámetro que la tarea elegida bloquea automáticamente, no preguntes por él, no lo escribas en el prompt ni lo utilices para planificar incorrectamente. Entrega primero el mejor prompt y añade, como máximo, una `Nota sobre los parámetros:` después del cuerpo principal. Si la primera y la última imagen tienen distinta relación de aspecto, utiliza también una sola nota que explique que deben ajustarse a la misma proporción antes del envío para evitar deformar el último fotograma. No añadas notas sobre parámetros si no hay conflicto.

### 8. Aplica la plantilla y limpia el prompt

Elige la plantilla correspondiente de abajo y conserva solo las secciones necesarias para la tarea actual. Sustituye cada `<marcador>` por contenido concreto. No dejes instrucciones de la plantilla en el prompt final.

Una vez completado el prompt, realiza la «Comprobación final» y entrégalo según el «Formato de respuesta».

## Plantillas de generación de vídeo

### Generación básica

Adecuada para generar solo con texto o para tareas con pocas referencias y un acontecimiento sencillo:

```text
<Sujeto> <realiza la acción o el acontecimiento principal> en <escenario y entorno>.
Las imágenes presentan <estilo visual o ambiente>.
La cámara utiliza <tamaño de plano, posición, movimiento o cortes>.
El sonido incluye <diálogo, ambiente, efectos sonoros o música>.
```

Elimina las líneas visuales, de cámara o de sonido que no hagan falta, pero el sujeto y la acción o acontecimiento principal deben ser explícitos.

Ejemplo completo:

```text
Una joven ceramista modela arcilla en un torno de alfarería en un taller al amanecer; sujeta la arcilla giratoria con ambas manos hasta formar un jarrón de cuello estrecho.
La suave luz de la mañana entra por la ventana de la izquierda y mantiene la mesa de madera y la arcilla en tonos cálidos naturales.
La cámara comienza en un plano medio que observa el movimiento de las manos y se acerca lentamente a la boca del jarrón.
El sonido conserva el zumbido grave del torno, las palmas rozando la arcilla húmeda y el canto lejano de los pájaros al otro lado de la ventana.
```

### Generación con recursos de referencia

```text
【Objetivo de generación】
Genera <tipo de vídeo o acontecimiento central>. El sujeto principal es <sujeto> y el acontecimiento principal es <resumen>.

【Funciones de los recursos de referencia】
@Image1 se utiliza para <aspecto, ropa, estructura o material> de <sujeto>.
@Video1 se utiliza para <acción, movimiento de cámara o ritmo>; no utilices <identidad, ropa o escenario que podrían heredarse involuntariamente>.
@Audio1 se utiliza para <timbre, diálogo, ambiente o música> de <personaje o tipo de sonido>.

【Recursos no utilizados】
@Image2, @Video2 y @Audio2 no se utilizan en esta tarea ni para personas, escenarios, objetos, acciones, cámara o sonido.

【Sujetos y relaciones】
<Sujeto A> corresponde a @Image1 y conserva siempre <rasgos fijos>.
La relación espacial, de objetos o de identidad entre <Sujeto A> y <Sujeto B> es <relación>.

【Guion de acontecimientos】
Al inicio: <estado de las personas, objetos y escenario>.
Acontecimiento principal: <acción o acontecimiento continuo>.
Al final: <posiciones de los personajes, propiedad de los objetos o estado visual final>.

【Mantener la coherencia】
Mantén estables <identidades y cantidad de personajes, ropa, propiedad de los objetos, direcciones espaciales y relaciones sonoras>.
```

No inventes un estilo visual, movimiento de cámara o sonido solo para rellenar la plantilla si el usuario no lo ha pedido. Las tareas sencillas pueden fusionar secciones contiguas, pero no omitir las funciones de los recursos realmente utilizados.

Ejemplo completo:

```text
【Objetivo de generación】
Genera un vídeo de la reparación de una silla vieja de madera. Un carpintero examina primero el respaldo suelto, aplica después cola para madera y asegura la unión. Al final, la silla vuelve a estar estable.

【Funciones de los recursos de referencia】
@Image1 se utiliza para los rasgos faciales, el pelo corto y el delantal de trabajo azul oscuro del carpintero; no utilices el fondo de la imagen.
@Image2 se utiliza para el respaldo curvo, las vetas oscuras y las zonas desgastadas de la silla; no utilices la persona de la imagen.
@Video1 se utiliza para los movimientos de las manos al aplicar cola y presionar la unión; no utilices la identidad del personaje, su ropa ni el banco de trabajo del vídeo.

【Sujetos y relaciones】
El carpintero lleva siempre el delantal azul oscuro definido por @Image1. Durante todo el vídeo solo hay una silla vieja de madera, definida por @Image2. Las herramientas permanecen a la derecha de la mesa de madera.

【Guion de acontecimientos】
Al inicio, la silla está centrada sobre la mesa de madera y la unión del respaldo está suelta. El carpintero examina la unión, aplica cola y usa ambas manos para colocar el respaldo y fijarlo. Al final, suelta la silla, el respaldo permanece estable y la cantidad y el aspecto de la silla no cambian.

【Mantener la coherencia】
Mantén estables la identidad y la ropa del carpintero, la estructura y la cantidad de sillas, las posiciones de las herramientas y la orientación espacial del taller.
```

## Organización de múltiples recursos de referencia

Organiza los recursos múltiples en este orden:

```text
función de cada recurso → correspondencia de sujetos → agrupación por tipo → definición de sujetos → activación por escena
```

Tener muchas referencias no significa que todas deban incluirse en el prompt. Utiliza solo las relevantes para la historia y escena actuales. Incluye los recursos disponibles sin función asignada en `【Recursos no utilizados】` dentro del prompt, enumera todos sus números de referencia y prohíbe su activación. Pueden agruparse en una línea breve para imágenes, otra para vídeos y otra para audio, pero no puede omitirse ningún número ni expresarse como una asignación conjunta de sujetos.

Seedance 2.5 admite hasta 50 recursos de referencia. Incluso cerca de ese límite, clasifica cada uno individualmente como personaje, objeto, escenario, acción o sonido y actívalo escena por escena. No utilices una frase genérica que deje la asignación al modelo ni hagas aparecer todos los recursos a la vez solo para demostrar su cantidad.

### Agrupación por tipo

```text
【Personajes】
<Personaje A> corresponde a @Image1; utiliza solo el aspecto, el peinado y la ropa.
<Personaje B> corresponde a @Image2; utiliza solo el aspecto, el peinado y la ropa.
No intercambies el aspecto, la ropa, las acciones, las posiciones ni los diálogos de ambos personajes.

【Objetos】
<Objeto A> corresponde a @Image3 y pertenece únicamente a <Personaje A>.
<Objeto B> corresponde a @Image4 y pertenece únicamente a <Personaje B>.

【Escenarios】
<Escenario A> toma como referencia @Image5; utiliza solo el espacio, los materiales y la iluminación.
<Escenario B> toma como referencia @Image6; utiliza solo el espacio, los materiales y la iluminación.

【Acciones y sonido】
@Video1 se utiliza para <acción o movimiento de cámara> de <Personaje A>; no utilices los personajes ni el escenario del vídeo.
@Audio1 se utiliza para <timbre y diálogo especificado> de <Personaje B>.
```

### Definición de sujetos y activación por escena

```text
【Definición del sujeto: Personaje A】
Aspecto y ropa: @Image1.
Objeto fijo: <Objeto A> de @Image3.
Escenarios permitidos: <Escenario A> y <Escenario B>.
Referencia de acción: <acción> de @Video1.
No utilizar: <ropa, objetos o voz de otro sujeto>.

Escena 1 | <Nombre del escenario>
Utilizar: <sujetos, objetos, escenario, acciones y sonidos activados para esta escena>.
Acontecimiento: <un acontecimiento principal>.
Al final: <estado observable>.

Escena 2 | <Nombre del escenario>
Utilizar: <sujetos, objetos, escenario, acciones y sonidos activados para esta escena>.
Acontecimiento: <un acontecimiento principal>.
Al final: <estado observable>.
```

Las referencias desde varios ángulos de un mismo sujeto deben asignar una función a cada imagen. Por ejemplo, las vistas frontal, lateral izquierda, lateral derecha y trasera definen conjuntamente una misma entidad; debe indicarse expresamente cuántas entidades habrá en el vídeo final.

### Relaciones espaciales y posiciones

Describe dentro/fuera, delante/detrás, orientación, distancia y separación respecto a objetos estables, como puertas, mesas, vehículos, mostradores y carreteras. No dependas solo de izquierda o derecha de pantalla. Por ejemplo:

```text
El <Dependiente> permanece siempre en el lado interior del mostrador de cristal, mirando hacia fuera. <Cliente A> y <Cliente B> están uno junto al otro en el lado exterior y hablan con el <Dependiente> a través del mostrador.
```

Si el usuario aporta un diagrama claro de colocación de los personajes, úsalo para la composición, posiciones, orientación y relaciones espaciales. No conviertas las flechas, recuadros de anotaciones ni textos explicativos de la imagen en contenido del vídeo final.

Ejemplo completo con múltiples recursos:

```text
【Personajes】
El Inspector corresponde a @Image1; utiliza solo sus rasgos faciales, pelo corto y cortavientos naranja.
El Archivero corresponde a @Image2; utiliza solo sus rasgos faciales, gafas y chaqueta gris de punto.
No intercambies el aspecto, la ropa, las acciones ni los diálogos de ambos personajes.

【Objetos】
La grabadora portátil corresponde a @Image3, pertenece únicamente al Inspector y sigue siendo la única durante todo el vídeo.

【Escenarios】
La estación de observación en la cima de la montaña toma como referencia @Image4; utiliza solo la estructura del edificio, la plataforma metálica y la iluminación de cielo cubierto.
La sala de archivos toma como referencia @Image5; utiliza solo la distribución de las estanterías, la mesa de madera y la iluminación cálida interior.

【Acciones y sonido】
@Video1 se utiliza para la acción del Inspector de abrir el compartimento del equipo y extraer la tarjeta de memoria; no utilices los personajes ni el escenario del vídeo.
@Audio1 se utiliza para el timbre y el diálogo del Inspector.

【Guion de acontecimientos】
Etapa 1: el Inspector está solo ante el compartimento del equipo de la estación de observación en la cima de la montaña, con la grabadora portátil colgada de la cintura. Abre el compartimento y extrae la única tarjeta de memoria. Al final, la tarjeta está únicamente en su mano derecha.
Etapa 2: dentro de la estación, el Inspector introduce la tarjeta en la grabadora portátil. Al final, la pantalla indica que la lectura de datos ha terminado y la tarjeta permanece dentro del aparato.
Etapa 3: corte a la sala de archivos. El Archivero está en el lado interior de la mesa de madera y el Inspector en el exterior. El Inspector coloca la grabadora en el centro de la mesa y dice con naturalidad en mandarín: {Los datos de observación de esta semana se han exportado.}
Etapa 4: el Archivero toma la grabadora para comprobar los datos, mientras el Inspector cierra la boca con naturalidad y espera. Al final, la grabadora está únicamente en manos del Archivero.
Etapa 5: el Archivero devuelve la grabadora a la mesa y ambos miran el estado de finalización en la pantalla. Termina con un plano medio que muestre claramente sus identidades, la cantidad de objetos y sus posiciones.

【Mantener la coherencia】
Mantén coherentes las identidades y la ropa de ambos personajes, la cantidad y la propiedad de la grabadora, la orientación espacial de ambos escenarios y la relación entre los hablantes.
```

## Vídeos largos y segmentos temporales

Seedance 2.5 admite vídeos de hasta 30 segundos. La duración total se configura mediante los parámetros de generación; el prompt solo organiza los acontecimientos dentro de ese tiempo.

Los segmentos temporales de acontecimientos indicados expresamente por el usuario forman parte del contenido creativo y deben conservarse. La separación de parámetros solo elimina ajustes de la interfaz como «genera un vídeo de N segundos» o «salida con relación de aspecto 16:9». Si los segmentos numéricos originales contradicen la duración total fijada en la página o en la API, prioriza conservar el orden de los acontecimientos, el ritmo relativo y el desenlace, y utiliza «etapas» sin tiempos numéricos. Conserva los números y pide al usuario que resuelva el conflicto de parámetros únicamente cuando declare expresamente que los intervalos originales son restricciones obligatorias.

Para vídeos largos, utiliza preferentemente «etapas». Asigna un único cambio de estado importante a cada etapa e indica claramente su estado final:

```text
【Etapa 1】
Al inicio: <estado inicial>.
Acontecimiento principal: <una acción o acontecimiento principal>.
Al final: <estado observable>.

【Etapa 2】
Continuación de la etapa anterior: <estado que debe mantenerse>.
Acontecimiento principal: <una acción o acontecimiento principal>.
Al final: <estado observable>.

【Etapa 3】
Acontecimiento principal: <acontecimiento de cierre>.
Al final: <estado visual final>.
```

El número de etapas depende del número de acontecimientos y puede aumentar o disminuir; no está fijado en tres. Si el prompt es largo, prioriza las correspondencias de sujetos, las funciones de los recursos, los acontecimientos y los estados finales. Comprime los términos de estilo repetidos, las restricciones repetidas y los recursos inactivos. No impongas un límite fijo de palabras.

### Adaptación a la duración objetivo

Si la duración objetivo indicada en la página de generación o en el contexto de la API es mayor que la cronología original del usuario, conserva primero los personajes, el orden de los acontecimientos, las relaciones causales y el desenlace; después, redistribuye el ritmo de los acontecimientos existentes. Si la duración objetivo solo procede de la página o la API, organiza el prompt en etapas sin marcas temporales numéricas, de modo que el conjunto aproveche la capacidad narrativa de esa duración. No crees intervalos como `0-8 segundos` u `8-18 segundos` solo para ajustarte a ese parámetro.

Solo puedes alargar el desarrollo de acciones, reacciones, pausas o transiciones entre escenas. Por ejemplo, permite que los cambios de mirada, la respiración, el proceso de recoger un objeto y las reacciones después de entrar se desarrollen naturalmente. No añadas personajes, acontecimientos de la trama principal ni desenlaces, y no rellenes mecánicamente el tiempo con acciones repetidas o planos vacíos. La duración total objetivo tampoco debe escribirse en el prompt como una frase de parámetros de la interfaz.

En tareas de entrega, toma y colocación, indica el cambio de posesión del objeto único. Por ejemplo, tras entregarlo, quien lo tenía ya no lo tiene; al final, está únicamente en manos del destinatario.

Utiliza segmentos continuos con tiempos enteros solo si el usuario ya los ha proporcionado o pide expresamente controlar por intervalos las entregas, entradas y salidas o los momentos narrativos. Si hay pocos acontecimientos, no los dividas solo para alcanzar una cantidad de segmentos. Si hay muchos, combina primero los secundarios:

```text
0-5 segundos: <estado inicial>; <acontecimiento principal>; al final, <estado observable>.
5-10 segundos: continúa desde <estado> del segmento anterior; <acontecimiento principal>; al final, <estado observable>.
10-15 segundos: <acontecimiento de cierre>; al final, <estado final>.
```

Si el usuario pide segmentos temporales numéricos, deben ser continuos y no solaparse. Representan tiempo asignado a los acontecimientos, no puntos de edición exactos a nivel de fotograma. No afirmes una precisión de 0,5 segundos ni indiques un máximo de segmentos sin verificar. Si los acontecimientos son demasiado densos, reduce el número de etapas en vez de subdividirlas más.

La duración total de salida se sigue configurando mediante los parámetros de generación. No escribas además «genera un vídeo de N segundos».

## Plantilla de edición de vídeo

Una edición debe definir un vídeo de origen como único maestro de edición. No puede limitarse a describir el resultado visual y convertirse así en una tarea de regeneración.

Para ediciones visuales, inventaría primero todas las categorías de sujetos visibles del vídeo de origen, incluidos los personajes mencionados y no mencionados por el usuario, personas reales, modelos, animales, objetos, elementos del primer término y sujetos del fondo. Indica expresamente si cada categoría se sustituye, elimina o conserva sin cambios. No pases por alto personas reales, modelos, objetos ni sujetos del fondo que el usuario no haya mencionado. Por defecto, los objetos que no haya pedido modificar permanecen intactos. Incluye un grupo completo en el alcance de eliminación o sustitución solo si pide expresamente sustituir todo el grupo o conservar únicamente determinados objetos en el vídeo final.

Si el agente no puede ver el vídeo de origen completo o solo dispone de vistas previas aisladas, no debe afirmar que ha inventariado exhaustivamente todos los objetos. Tras indicar todas las sustituciones, eliminaciones y elementos que el usuario exige conservar, añade esta frase de respaldo: `Salvo los objetos modificados expresamente arriba, todos los demás personajes visibles, objetos y elementos del fondo de @Video1 permanecen sin cambios y no deben sustituirse ni eliminarse.` Si el usuario pide expresamente conservar solo los objetos indicados, sustituye esta frase por una instrucción de eliminar todos los demás según lo solicitado.

Cada prompt de edición debe incluir una de las siguientes dos declaraciones que delimitan el alcance. No puede omitirse:

- Modificación local: `Salvo los objetos modificados expresamente arriba, todos los demás personajes visibles, objetos y elementos del fondo de @Video1 permanecen sin cambios y no deben sustituirse ni eliminarse.`
- El usuario pide expresamente conservar solo los objetos objetivo: `Salvo los objetos que se ha indicado expresamente conservar arriba, elimina todos los demás sujetos visibles de @Video1; no añadas objetos no especificados.`

El inventario del vídeo de origen solo determina qué objetos se sustituyen, eliminan o conservan; no debe utilizarse para cambiar el conjunto de recursos objetivo que el usuario ya haya especificado. Si ha asignado expresamente @Image3 a un objeto de edición, no añadas otra imagen no mencionada como referencia de aspecto, ropa, grupo o apoyo para ese objeto, aunque sea más clara o tenga contenido parecido. Sigue incluyendo esos recursos en `【Recursos no utilizados】`.

```text
【Objetivo de edición】
Edita @Video1 y cambia únicamente <objeto o región original> por <contenido objetivo>.

【Función del vídeo de origen】
@Video1 es el único maestro de edición y determina el escenario original, la posición y el movimiento de cámara, las trayectorias de acción, las relaciones de oclusión y el orden de los acontecimientos.

【Función del material objetivo】
@Image1 se utiliza para <aspecto, estructura o material> de <sujeto, fondo o producto objetivo>; no utilices <fondo, personajes o composición irrelevantes>.

【Objetos y alcance de la edición】
Modifica solo <objetos y regiones explícitos>. La cantidad de objetos objetivo durante todo el vídeo es <cantidad>. No modifiques <contenido que debe conservarse>.
Salvo los objetos modificados expresamente arriba, todos los demás personajes visibles, objetos y elementos del fondo de @Video1 permanecen sin cambios y no deben sustituirse ni eliminarse.

【Herencia de la cronología】
<Objeto objetivo> hereda el momento, la duración, la trayectoria y los cambios de velocidad de cada aparición, movimiento, oclusión y salida de <objeto original>.
Las demás acciones de personajes, movimientos de cámara, cambios de plano y orden de acontecimientos permanecen como en @Video1.
```

Al sustituir un sujeto, identifica el original y el objetivo. Al sustituir un fondo, aclara que solo cambia lo que queda fuera del contorno del sujeto. En una edición local, especifica la región, el atributo y el contenido que debe conservarse. Al añadir o eliminar un objeto, indica su cantidad, posición, momento de aparición y ámbito afectado.

Ejemplo completo de sustitución de un sujeto en movimiento:

```text
【Objetivo de edición】
Edita @Video1 y sustituye únicamente la bicicleta roja y su ciclista, que pasan por delante del banco, por el vehículo eléctrico de patrulla gris oscuro de @Image1.

【Función del vídeo de origen】
@Video1 es el único maestro de edición y determina el camino del parque, las dos personas del banco, la posición y el movimiento de cámara, la trayectoria temporal y espacial del ciclista original, las relaciones de oclusión y el orden de los acontecimientos.

【Función del material objetivo】
@Image1 se utiliza únicamente para la estructura de la carrocería, el color y el parabrisas transparente del vehículo eléctrico de patrulla gris oscuro; no utilices el fondo ni el conductor de la imagen.

【Objetos y alcance de la edición】
Elimina la bicicleta roja y su ciclista del vídeo de origen. Debe haber exactamente un vehículo eléctrico de patrulla durante todo el vídeo. Las dos personas del banco, los árboles, el camino y el fondo permanecen como en @Video1.

【Herencia de la cronología】
El vehículo eléctrico de patrulla ocupa la trayectoria temporal y espacial del ciclista original, con exactamente el mismo momento de aparición, recorrido, velocidad y posiciones de oclusión. La bicicleta roja y el ciclista ya no deben aparecer en el vídeo final. Las demás acciones de personajes, movimientos de cámara, cambios de plano y orden de acontecimientos permanecen como en @Video1.
```

Para sustituir sujetos en movimiento de categorías distintas, utiliza preferentemente una «sustitución que hereda el movimiento»: elimina explícitamente el sujeto original, haz que el objetivo herede exactamente sus momentos de aparición, trayectoria, velocidad y posiciones de oclusión e indica que el original deja de aparecer. La lista de conservación debe incluir solo las zonas adyacentes al objetivo que realmente no pueden cambiar. Evita diluir el objetivo de edición con una lista demasiado larga.

```text
Elimina <sujeto original en movimiento> que pasa delante de <sujeto en primer término> en @Video1 y sustitúyelo por <sujeto objetivo en movimiento> definido por @Image1, con exactamente los mismos momentos de aparición, trayectoria, velocidad y posiciones de oclusión. <Sujeto original en movimiento> ya no debe aparecer en el vídeo final.
```

Utiliza por defecto el requisito global de heredar el vídeo maestro. Añade unas pocas condiciones observables de acontecimientos solo si las tomas, entregas, colocaciones o entradas y salidas del original pueden observarse con precisión:

```text
Solo después de que ocurra <estado observable de finalización del acontecimiento A> puede comenzar <acontecimiento B>.
Solo después de que ocurra <estado observable de finalización del acontecimiento B> puede comenzar <acontecimiento C>.
```

No reescribas el vídeo de origen en segmentos temporales de memoria ni inventes condiciones a partir de muestras incompletas de fotogramas. Un prompt puede aumentar la probabilidad de que los acontecimientos clave sigan la cronología original, pero no garantiza la alineación fotograma a fotograma tras la edición.

### Edición de audio

Si solo se modifican diálogos, idioma, timbre, música de fondo, ambiente o efectos de acción, define igualmente el vídeo de origen como único maestro de edición. Especifica por separado el hablante o la categoría sonora que se modifica, el cambio deseado, el intervalo temporal y si los demás audios y todas las imágenes permanecen intactos. No rediseñes las acciones de los personajes, los tiempos de sincronización labial, los planos ni el ritmo del montaje por una edición de audio.

```text
【Objetivo de edición】
Edita @Video1 aplicando <eliminación, sustitución o ajuste> solo a <hablante o categoría sonora> en <todo el vídeo o un segmento temporal explícito>.

【Función del vídeo de origen】
@Video1 es el único maestro de edición y determina las imágenes originales, las acciones de los personajes, los tiempos de sincronización labial, los planos, el ritmo del montaje, todos los demás audios y el orden de los acontecimientos.

【Función del audio objetivo】
@Audio1 se utiliza para <timbre, diálogo, ambiente, efectos sonoros o música> de <hablante o categoría sonora objetivo>; no utilices <audio irrelevante>.

【Alcance de la edición de audio】
Modifica solo <hablante, categoría sonora o segmento temporal explícitos>.

【Contenido que debe conservarse】
Mantén sin cambios <los demás diálogos, tiempos de sincronización labial, ambiente, efectos de acción, imágenes, planos y ritmo del montaje> de @Video1.
```

Si el usuario solo pide eliminar la música de fondo original, no inventes un recurso de audio objetivo. Indica directamente que debe eliminarse la música y conservar los diálogos, la sincronización labial, el ambiente, los efectos de acción y todas las imágenes. Al cambiar el idioma o el timbre, conserva por defecto el contenido del diálogo y los tiempos de habla del vídeo de origen, salvo que el usuario pida también reescribirlos.

## Plantilla de extensión de vídeo

Si el usuario solo dice «extender» y el contexto no permite determinar la dirección, ese dato tiene un impacto importante y debe incluirse en una única solicitud conjunta de aclaración.

En un prompt de extensión, utiliza el nombre confirmado por el usuario para el sujeto del fotograma de unión. Si solo escribe «persona» o «sujeto», conserva ese término neutral. No deduzcas una profesión, un tipo de actuación o una identidad narrativa por las acciones, postura o ropa del sujeto en el original.

Durante toda la extensión, el mismo sujeto debe seguir siendo una única instancia continua; no puede duplicarse, dividirse ni sustituirse por un segundo sujeto idéntico. Mantén la estructura corporal, el número de partes y sus relaciones de conexión coherentes con el fotograma de unión. Si el sujeto se gira, queda oculto, sale del encuadre o vuelve a entrar, sigue siendo el mismo objeto continuo y no debe sustituirse por una instancia nueva.

El prompt final debe indicar expresamente esos requisitos de instancia única y estructura; no basta con comprobarlos en el análisis interno y omitirlos después.

### Extensión hacia delante (después del vídeo original)

Una extensión hacia delante continúa la generación después de que termine el vídeo de origen. El primer fotograma del segmento nuevo continúa desde el último del original.

```text
@Video1 es el vídeo de origen que se extenderá hacia delante.

Extiende @Video1 hacia delante. El primer fotograma del segmento extendido continúa directamente desde el último fotograma de @Video1: mantén la continuidad de <postura y orientación del sujeto>, <posiciones de los objetos>, <fondo y relaciones espaciales>, <posición de cámara y composición>, <iluminación>, <estado del audio> y <trayectoria de movimiento>.

Después, <acción, acontecimiento, plano o sonido nuevo que se añadirá en la extensión>.

Durante toda la extensión, mantén la continuidad de <identidad y ropa del personaje>, <objetos clave>, <distribución del fondo>, <eje de cámara> y <entorno sonoro original>.
El mismo sujeto debe seguir siendo el mismo objeto continuo, sin duplicarse ni dividirse; el aspecto del personaje o el número de partes de un objeto deben permanecer estables.
```

Ejemplo completo con recursos adicionales:

```text
@Video1 es el vídeo de origen que se extenderá hacia delante.
@Image1 se utiliza para los rasgos faciales, el pelo corto y el delantal de trabajo verde claro del Jardinero; no utilices el fondo de la imagen.
@Image2 se utiliza para la estructura y el material de la cesta de flores trenzada; no utilices el jardín ni las personas de la imagen.

Extiende @Video1 hacia delante. El primer fotograma del segmento extendido continúa directamente desde el último de @Video1: mantén la continuidad del banco de trabajo del invernadero, la posición y orientación del Jardinero, la posición de la estantería de madera, la cámara fija en plano medio y la luz lateral de la tarde. Los demás recursos de referencia no deben sustituir este fotograma de unión.

Después, el Jardinero recoge de debajo del banco la cesta de flores trenzada definida por @Image2 y la coloca con ambas manos en el estante central de la estantería de madera que tiene detrás. Al final, la cesta está únicamente en ese estante y el Jardinero ha soltado ambas manos y retrocedido medio paso.

Durante toda la extensión, mantén la continuidad del rostro y el delantal del Jardinero, la distribución del invernadero, la posición de la estantería, la dirección de cámara y el ambiente sonoro del invernadero.
El Jardinero y la cesta deben seguir siendo, cada uno, el mismo objeto continuo, sin duplicarse ni dividirse; la estructura corporal del Jardinero y el número de partes de la cesta deben permanecer estables.
```

### Extensión hacia atrás (antes del vídeo original)

Una extensión hacia atrás genera contenido anterior al comienzo del vídeo de origen. El último fotograma del segmento nuevo conecta con el primero del original.

Describe primero qué sucede antes de que comience el original y define después su primer fotograma como estado final explícito del segmento extendido. Escribir solo «después conecta con el vídeo de origen» puede hacer que el modelo introduzca demasiado pronto personajes, objetos o efectos de momentos posteriores, o que vuelva a cambiar la imagen después de alcanzar el estado objetivo.

```text
@Video1 es el vídeo de origen que se extenderá hacia atrás.

Extiende @Video1 hacia atrás. Antes de que comience el vídeo de origen, <acción, acontecimiento, plano o sonido previos>.

El último fotograma del segmento extendido conecta naturalmente con el primero de @Video1: mantén coherentes <postura y orientación del sujeto>, <posiciones de los objetos>, <fondo y relaciones espaciales>, <posición de cámara y composición>, <iluminación>, <estado del audio> y <trayectoria de movimiento>.

Durante toda la extensión, mantén la continuidad de <identidad y ropa del personaje>, <objetos clave>, <distribución del fondo>, <eje de cámara> y <entorno sonoro original>.
El mismo sujeto debe seguir siendo el mismo objeto continuo, sin duplicarse ni dividirse; el aspecto del personaje o el número de partes de un objeto deben permanecer estables.
Los personajes, objetos o efectos exclusivos de partes posteriores del vídeo de origen no deben aparecer antes de tiempo.
```

Si hay recursos de referencia adicionales, indica primero la función de cada uno para personajes, ropa, objetos o sonido y después que el vídeo de origen controla el fotograma de unión. Los recursos nuevos no deben anular ese control sobre su último o primer fotograma.

Una extensión crea solo un segmento nuevo fuera del límite del original; no edites a la vez el vídeo de origen. El objetivo de la unión es una continuidad natural de imagen y sonido, no una identidad garantizada píxel a píxel. El volumen del segmento extendido puede diferir ligeramente del original.

## Anclajes de fotogramas clave

Las imágenes de fotogramas clave siguen aportándose como imágenes de referencia normales; asigna a cada una una función concreta en el prompt. No combines las funciones del primer y último fotograma en una única declaración conjunta.

Para fijar el primero, escribe `Utiliza @ImageN como primer fotograma.` como oración independiente. Para fijar el último, escribe `Utiliza @ImageN como último fotograma.` como oración independiente. No debilites estas declaraciones con «utiliza solo como referencia del primer fotograma», «toma como referencia la composición inicial» o «referencia de composición del primer fotograma». No comprimas la función y la acción posterior en una misma frase. La declaración exacta de la función debe permanecer literalmente en el prompt final. Añade otra frase que describa la composición, posiciones, posturas, estados de los objetos, escenario y dirección de cámara definidos por ese fotograma.

El primer fotograma fija la relación de aspecto de salida. El primero y el último deben tener la misma relación para evitar deformar el último; la duración sigue configurándose en la página de generación o mediante la API. Esta regla solo sirve para la comprobación previa de la entrada y no debe escribirse como parámetro de salida en el prompt.

### Primer fotograma y otras referencias

```text
Utiliza @Image1 como primer fotograma.
Este primer fotograma define la composición inicial del vídeo, las posiciones de los sujetos, las posturas, los estados de los objetos, el escenario y la dirección de cámara.
Utiliza @Image2 para <aspecto, ropa, estructura o material> de <sujeto>, sin cambiar la composición del primer fotograma definida por @Image1.
Utiliza @Image3 para <escenario, objetos o iluminación>, sin cambiar la composición del primer fotograma definida por @Image1.

El plano comienza naturalmente desde el primer fotograma definido por @Image1, seguido de <acción o acontecimiento continuo>.
Mantén la continuidad de <identidades de los personajes, propiedad de los objetos, relaciones espaciales y estilo visual>.
```

### Primer fotograma, último fotograma y otras referencias

```text
Utiliza @Image1 como primer fotograma.
Este primer fotograma define la composición inicial del vídeo, las posiciones de los sujetos, las posturas, los estados de los objetos, el escenario y la dirección de cámara.
Utiliza @Image2 como último fotograma.
Este último fotograma define la composición final del vídeo, las posiciones de los sujetos, las posturas, los estados de los objetos, el escenario y la dirección de cámara.
Utiliza @Image3 para <aspecto, ropa, estructura o material> de <Sujeto A>, sin cambiar la composición inicial de @Image1 ni la final de @Image2.
Utiliza @Image4 para <atributos especificados> de <Sujeto B, objeto o escenario>, sin cambiar la composición inicial de @Image1 ni la final de @Image2.

<Una acción o acontecimiento continuo>.
El plano comienza naturalmente desde el primer fotograma definido por @Image1 y, tras una acción continua, llega al último definido por @Image2.
Mantén la continuidad de principio a fin de <identidades de los personajes, estructura y propiedad de los objetos, distribución del escenario y dirección de cámara>.
```

Ejemplo completo:

```text
Utiliza @Image1 como primer fotograma.
Este primer fotograma define la estación de repostería, la posición de la persona que decora la tarta, la tarta sin decorar, la colocación de las herramientas y la cámara frontal en plano medio.
Utiliza @Image2 como último fotograma.
Este último fotograma define la tarta decorada centrada en la base giratoria, las manos de la persona apartadas de ella y la misma cámara frontal en plano medio.
Utiliza @Image3 para los rasgos faciales, el recogido y el uniforme blanco de la persona que decora la tarta, sin cambiar la composición inicial de @Image1 ni la final de @Image2.
Utiliza @Image4 para la estructura de dos pisos, la textura de la cobertura blanca y la decoración de arándanos de la tarta, sin cambiar la composición inicial de @Image1 ni la final de @Image2.

El plano comienza naturalmente desde el primer fotograma definido por @Image1. La persona gira la base de la tarta, traza de forma continua patrones uniformes de crema en los bordes de ambos pisos y coloca después los arándanos uno a uno. Finalmente, aparta ambas manos y llega naturalmente al último fotograma definido por @Image2.
Mantén la continuidad de principio a fin de la identidad y la ropa de la persona, la cantidad de tartas y su estructura de dos pisos, las posiciones de las herramientas, la distribución de la estación de repostería y la dirección de cámara.
```

Si el usuario pide expresamente un estado clave intermedio, una imagen adicional puede definir los personajes, acciones, objetos y relaciones espaciales que deben aparecer en ese momento; describe cómo el plano alcanza ese estado naturalmente alrededor del instante indicado. Es un anclaje semántico, no una pausa estática ni un fotograma bloqueado a nivel de píxel. Si tienen prioridad los límites del primer y último fotograma, reduce los demás recursos ajenos al acontecimiento actual.

### Control del orden de varios fotogramas clave

Si varias imágenes independientes definen distintas etapas de un proceso, utiliza la primera frase para declarar el orden de los fotogramas clave y describe después cada estado, imagen por imagen. Los fotogramas clave controlan el orden de las etapas y sus estados visibles; no prometen reproducir cada fotograma ni obligan a detenerse en un estado clave.

```text
Utiliza desde @Image1 hasta @ImageN como fotogramas clave, en ese orden.

Utiliza @Image1 como primer fotograma.
Este primer fotograma define <composición inicial, posiciones de los sujetos, posturas, estados de los objetos y dirección de cámara>.
@Image2 define el segundo fotograma clave: <estado visible al final de la primera etapa>.
@Image3 define el tercer fotograma clave: <estado visible al final de la segunda etapa>.
Utiliza @ImageN como último fotograma.
Este último fotograma define <composición final, posiciones de los sujetos, posturas, estados de los objetos y dirección de cámara>.

El plano pasa en orden por los estados definidos por @Image1, @Image2, @Image3 y los siguientes hasta @ImageN, utilizando acciones continuas para transitar naturalmente entre etapas.
Durante todo el proceso, mantén la continuidad de <identidades de los sujetos, estructura y propiedad de los objetos, distribución del escenario, iluminación y eje de cámara>.
```

### Cuadrículas de guion gráfico y guiones gráficos

Una cuadrícula de guion gráfico define la historia general, el orden de los planos y la composición aproximada; no exige replicar estrictamente todos los detalles de cada viñeta. Utiliza preferentemente guiones gráficos claros con no más de 15 viñetas y pocas anotaciones de texto. Especifica el orden de lectura, la estructura de planos que se adopta y los estilos de boceto, anotaciones o personajes provisionales que no deben adoptarse.

```text
@Image1 proporciona el orden de planos y las composiciones aproximadas de <una cuadrícula de guion gráfico de N viñetas>. Léela <de izquierda a derecha y de arriba abajo>; no adoptes <el estilo de boceto, las anotaciones de texto o los personajes provisionales> de la imagen.
@Image2 define <aspecto y ropa> de <Sujeto A>.
@Image3 define <estructura, material o iluminación> de <objeto clave o escenario>.

Plano 1: <tamaño de plano, acción del sujeto y estado de la escena>.
Plano 2: <tamaño de plano, acción del sujeto y movimiento de cámara o transición>.
...
Plano N: <acción de cierre y estado visual final>.

Las imágenes finales utilizan <estilo visual>. El audio incluye <diálogo, ambiente, efectos de acción o música>.
```

### Referencias de escenas 3D simplificadas y renderizado

Determina primero si el vídeo de la escena 3D simplificada aporta un esquema de movimiento o una estructura completa:

- **Escena 3D básica**: una geometría sencilla aporta principalmente trayectorias de acción, dirección de movimiento, colocación de sujetos, entradas y salidas, posición y movimiento de cámara, cortes, cambios de iluminación, ritmo del audio o relaciones espaciales. Relaciona cada objeto geométrico individualmente con un sujeto u objeto final.
- **Escena 3D detallada**: la estructura de los sujetos, objetos o escenario ya está completa. Se utiliza principalmente para sustituir el aspecto de los personajes, los materiales, colores, escenario o estilo visual. Conserva la estructura, acciones, relaciones espaciales y trabajo de cámara existentes.

Un vídeo de una escena 3D simplificada es una referencia de generación; no se convierte automáticamente en maestro de edición por ser un vídeo. Si contiene líneas de trayectoria, ejes de coordenadas, controladores, volúmenes de visión de cámara o marcadores de texto, excluye expresamente esas marcas de producción.

#### Escena 3D básica

```text
@Video1 es una referencia de escena 3D básica. Utilízala solo para <trayectorias de acción, colocación de sujetos, posición y movimiento de cámara, cortes, cambios de iluminación, ritmo del audio o relaciones espaciales>; no adoptes su aspecto simplificado, materiales ni escenario.
<Sujeto A de la escena 3D> de @Video1 corresponde a <Sujeto A>.
<Sujeto B u objeto geométrico de la escena 3D> de @Video1 corresponde a <Sujeto B u objeto clave>.
@Image1 define <aspecto, ropa o estructura> de <Sujeto A>.
@Image2 define <atributos especificados> de <Sujeto B, objeto clave o escenario>.

<El sujeto> completa <la acción o acontecimiento principal> en <el escenario>.
Conserva <trayectorias de acción, colocación, movimiento de cámara, cortes, iluminación o ritmo del audio> de @Video1.
Las imágenes finales utilizan <personajes, escenario, materiales y estilo visual>. El audio incluye <diálogo, ambiente o efectos de acción>.
```

#### Escena 3D detallada

```text
@Video1 es una referencia de escena 3D detallada. Conserva <estructura del sujeto, acciones, distribución espacial, posición y movimiento de cámara y cortes>; no adoptes sus materiales grises originales, fondo vacío ni marcas de producción.
@Image1 define <aspecto del personaje, material, color o detalles de superficie> de <sujeto>.
@Image2 define <espacio, materiales, iluminación o estilo visual> de <escenario>.

Vuelve a renderizar <sujeto> de @Video1 como <sujeto final> y el escenario como <escenario final>.
Conserva <estructura, acciones, trabajo de cámara y relaciones espaciales> de @Video1. Las imágenes presentan <materiales, colores y estilo>. El audio incluye <ambiente, efectos sonoros o música>.
```

## Emoción, cinematografía y sonido

### Emoción e interpretación observable

Si solo se da una orientación como tenso, cálido u opresivo, deja que el modelo determine la interpretación concreta. Si el usuario necesita controlarla, utiliza:

```text
orientación emocional o ambiental + acontecimiento desencadenante + interpretación observable del personaje + cambios observables en cámara, iluminación o sonido
```

Elige unas pocas señales claras entre ojos, cejas, boca, respiración, mirada, movimientos de manos y postura corporal. No acumules todas las microexpresiones posibles. Divide la interpretación en etapas según los desencadenantes solo cuando la emoción cambie varias veces.

```text
La emoción general pasa de <emoción inicial> a <emoción final>.
Tras <acontecimiento desencadenante>, <sujeto> muestra primero <reacción inmediata observable>.
Después, <ojos, cejas, boca, respiración, mirada o movimientos de manos> <cambian> gradualmente.
Por último, <sujeto> expresa <emoción objetivo> mediante <interpretación observable desde fuera>.
```

Ejemplo completo:

```text
La emoción general pasa de una expectación contenida al esfuerzo por mantener la compostura tras una decepción.
Al ver que el camarero deja una carta devuelta sobre la mesa, los dedos de la mujer que recorrían el borde de la taza se detienen de golpe y su mirada cae en la marca de devolución del sobre.
Frunce ligeramente las cejas, su tenue sonrisa desaparece poco a poco y, después de inspirar lentamente, coloca el sobre boca abajo en la mesa.
Finalmente, levanta la mirada hacia la silla vacía de enfrente, mantiene los hombros rectos y dice con voz serena, aunque algo tensa: {Lo entiendo.}
```

### Cinematografía profesional

El lenguaje básico de planos y los movimientos de cámara habituales pueden escribirse directamente en el prompt. Si hay varios sujetos en el encuadre, especifica aun así en cuál se centra la cámara, dónde comienza el movimiento y dónde termina. No utilices solo un término desligado de su sujeto.

```text
movimiento de cámara habitual + sujeto objetivo + posición o estado inicial + dirección del movimiento + posición o estado de llegada
```

Los movimientos habituales incluyen el plano secuencia continuo, el travelling compensado o dolly zoom, la perspectiva aérea, la vista en primera persona o FPV, el efecto de tiempo bala, la cámara en mano y los cambios de velocidad con rebote. En un plano secuencia, especifica la sucesión de sujetos, espacios y acontecimientos que recorre la cámara. Con cámara en mano, indica el sujeto seguido y el grado de vibración. Para cambios de velocidad con rebote, especifica el momento de la acción en que el movimiento acelera, frena o rebota y el estado final en el que se detiene.

Para términos cinematográficos muy especializados, con significados variables en la industria o que exigen controlar con precisión los cambios visuales, conserva el término y desarróllalo en resultados observables:

```text
término cinematográfico + sujeto objetivo + cambio visual + relación entre primer término y fondo + dirección o velocidad
```

Por ejemplo, una profundidad de campo reducida debe especificar que el sujeto permanece nítido y cómo se desenfoca el fondo. Un plano de seguimiento debe indicar que la cámara iguala la velocidad del sujeto y la dirección del desenfoque de movimiento del fondo. Un cambio de foco debe indicar de qué objeto a cuál se desplaza el enfoque y cómo cambia la nitidez de ambos. Una viñeta debe indicar que las cuatro esquinas se oscurecen gradualmente mientras el centro conserva su brillo normal. Los valores de distancia focal, apertura y obturación solo pueden complementar estas instrucciones; no sustituyen el resultado visible final.

### Sonido, diálogo y texto

Utiliza lo siguiente cuando sea necesario distinguir tipos de contenido:

| Contenido | Símbolos | Ejemplo |
|---|---|---|
| Música | `()` | `(Suena una música suave de piano de fondo)` |
| Efecto sonoro | `<>` | `<Suena una campana a lo lejos>` |
| Diálogo | `{}` | `{Hola, bienvenido de nuevo}` |
| Subtítulo | `【】` | `【Capítulo 1: La partida】` |

Para el idioma del diálogo, utiliza: `idioma + variedad regional o acento opcionales + forma de decirlo + hablante + {diálogo}`. Identifica por separado a cada hablante; no hagas una única declaración general al principio. Si existe la posibilidad de que un diálogo en inglés se pronuncie en chino, escribe explícitamente al menos «Utiliza inglés». Si el usuario indica una variedad regional o un acento, o pide reforzarlo, utiliza una instrucción completa como «inglés estadounidense natural y conversacional» o «inglés auténtico de Los Ángeles». Si solo aporta diálogo en inglés, no añadas acento estadounidense, británico ni regional sin indicación. Si no especifica el idioma, no deduzcas mandarín, un dialecto o un acento regional a partir del sistema de escritura. Si no hacen falta subtítulos, indica también que no aparecen en pantalla.

En diálogos con varios hablantes, vincula cada hablante y audio en cada etapa e indica que los demás personajes mantienen la boca cerrada con naturalidad mientras escuchan. Identifica por separado las fuentes de ambiente, efectos y música para evitar confundir otros audios con música de fondo.

Si el prompt final utiliza `<>` para marcar efectos sonoros, no encierres también los nombres de los sujetos entre esos símbolos. Utiliza nombres normales para que los mismos signos no cumplan dos funciones.

En tareas sin diálogo, establece a la vez las restricciones de habla, movimiento de labios, fuentes sonoras y soportes de texto visibles. Por ejemplo, los personajes mantienen la boca cerrada con naturalidad, no hay narración, solo permanece el ambiente especificado y no aparecen subtítulos ni carteles.

### Productos y procesos físicos

Convierte cualidades abstractas de venta, como eficiente, inteligente o fiable, en «estado inicial -> operación concreta -> resultado observable». Muestra solo una operación o resultado funcional por etapa y conserva continuamente el aspecto del producto, las posiciones de los componentes, el operador y las relaciones con el escenario.

```text
Etapa 1: al inicio, <estado inicial del producto y sus componentes>; <el operador realiza una operación concreta>; al final, <estado directamente visible>.
Etapa 2: continúa desde <estado de la etapa anterior>; <el producto realiza una función>; al final, <resultado directamente visible>.
Etapa 3: <el operador realiza la operación de cierre>; al final, <estado final del producto, sus componentes y el resultado terminado>.
```

Ejemplo completo:

```text
Etapa 1: al inicio, el humidificador de sobremesa está apagado, el depósito vacío y la tapa superior a la derecha del aparato. El operador extrae el depósito y lo llena con agua limpia. Al final, el nivel queda por debajo de la marca máxima.
Etapa 2: el operador vuelve a colocar el depósito, cierra la tapa superior y pulsa una vez el botón de encendido. Al final, su mano se ha apartado del botón y el humidificador permanece en una posición fija.
Etapa 3: una corriente continua de fina niebla blanca sale de la boquilla y asciende verticalmente, sin acumular agua en la mesa. Al final, el aparato, el depósito y la tapa permanecen visualmente intactos.
```

No escribas únicamente «muestra el proceso completo de instalación, funcionamiento y finalización del flujo del producto». El texto exacto en pantalla, las fórmulas y los parámetros del producto siguen sujetos a los límites de capacidad del «Formato de respuesta».

## Formato de respuesta

Utiliza el idioma de salida del usuario. Conserva su sintaxis de referencias, como `@Image1`, `@Image 1` o una etiqueta equivalente del entorno de ejecución. No traduzcas ni renumeres referencias que el usuario haya establecido expresamente.

### Entrega predeterminada

Por defecto, entrega únicamente el cuerpo del prompt optimizado. No añadas encabezados Markdown, bloques delimitados de código, introducciones ni explicaciones finales, ni envoltorios como «Prompt optimizado», «Interpretación de los recursos» o «Notas de optimización». No indiques al modelo que encierre el resultado final en un bloque de código.

Si el propio prompt necesita estructura, puede conservar etiquetas internas de la tarea como `【Objetivo de generación】`, `【Funciones de los recursos de referencia】`, `【Guion de acontecimientos】` y `【Mantener la coherencia】`. Esas etiquetas forman parte del cuerpo directamente enviable, no de un envoltorio de la respuesta.

Si el agente infiere automáticamente las correspondencias de recursos, no entregues una tabla de razonamiento independiente. Escribe las asignaciones finales directamente en la sección de funciones de las referencias, especificando qué se adopta de cada recurso utilizado. Si el agente puede acceder al inventario completo, debe añadir `【Recursos no utilizados】` dentro del prompt y enumerar individualmente la referencia de cada recurso realmente disponible sin función asignada; no lo describas solo fuera. Si no está disponible el inventario completo, no inventes números de referencias no utilizadas.

### Fidelidad de las referencias a recursos

Si el prompt original ya contiene referencias explícitas, conserva su misma sintaxis y números en el resultado, pueda o no el agente acceder a los recursos correspondientes. No borres ni renumeres referencias, no traduzcas sus etiquetas ni conviertas la tarea en generación sin referencias porque el recurso no esté adjunto, esté dañado o sea inaccesible.

Los recursos inaccesibles solo limitan los hechos que el agente puede confirmar y añadir. No alteran las funciones ni las relaciones de referencia establecidas por el usuario, ni justifican explicaciones sobre recursos ausentes o consejos adicionales fuera del prompt.

### Avisos de entrada y parámetros

Si los recursos superan un límite estricto, entrega primero un prompt completo basado en los seleccionados y añade después una `Nota sobre los recursos:` con los tipos o números de referencia que deben reducirse antes del envío. Las recomendaciones no son límites estrictos y no justifican esa nota.

Si el usuario pide parámetros bloqueados automáticamente por la edición, la generación con primer fotograma o con primero y último, o la extensión; o si el primero y el último tienen distinta relación de aspecto, entrega primero el prompt completo y añade después una `Nota sobre los parámetros:`. Esa nota solo indica la regla en conflicto y la acción necesaria antes del envío. No repite el prompt, no se convierte en documentación de la API ni vuelve a introducir los parámetros en el prompt.

Ejemplo: `Nota sobre los parámetros: la edición de vídeo conserva automáticamente la relación de aspecto y la duración básica del vídeo de entrada, por lo que no pueden fijarse por separado en 16:9 y 20 segundos. El prompt anterior sigue la cronología del vídeo original.`

### Límites de capacidad que deben respetarse

El prompt por sí solo no puede garantizar completamente subtítulos, fórmulas, carteles, parámetros de productos ni marcas temporales exactas a nivel de fotograma. Entrega igualmente el mejor prompt posible primero. Cuando sea realmente necesario, añade como máximo una línea que comience con `Nota adicional:` e indique que hacen falta recursos preparados o posproducción. Si no hace falta, no añadas ninguna nota.

En una tarea híbrida de dos operaciones consecutivas, entrega prompts separados y listos para enviar con las etiquetas `Paso 1:` y `Paso 2:`, e indica que el paso 2 utiliza el resultado del paso 1 como nuevo maestro. En los demás casos, entrega por defecto un único prompt.

En una generación normal, la duración, relación de aspecto u otros parámetros facilitados por el usuario pueden orientar la densidad de acontecimientos y la composición, pero no deben escribirse en el prompt. En edición, generación con primer fotograma o con primero y último, o extensión, aplica primero las reglas de bloqueo automático y no utilices parámetros incompatibles para planificarlo. Enumera parámetros configurables fuera del prompt solo si el usuario pide un ejemplo de invocación.

### Ejemplo completo de entrada y salida

Entrada del usuario: `Haz que el barista de la imagen de referencia prepare un café de filtro en la cafetería de referencia, siguiendo las acciones del vídeo subido, y que al final entregue el café al cliente.`

Tras revisar los tres recursos, el agente entrega directamente este cuerpo de prompt:

【Objetivo de generación】
Genera un vídeo continuo del barista preparando un café de filtro y entregándolo al cliente.

【Funciones de los recursos de referencia】
Utiliza @Image1 para los rasgos faciales, el pelo corto y el delantal marrón del barista; no adoptes el fondo de la imagen.
Utiliza @Image2 para la barra de madera, los ventanales y la luz cálida de la tarde de la cafetería; no adoptes las personas de la imagen.
Utiliza @Video1 para el ritmo del vertido y los movimientos de muñeca durante la preparación; no adoptes las identidades, ropa ni escenario del vídeo.

【Guion de acontecimientos】
Al inicio, el barista está en el lado interior de la barra y el cliente en el exterior, con el portafiltro y la jarra de servicio entre ambos. Siguiendo el ritmo de @Video1, el barista vierte el agua lentamente. Tras terminar, devuelve el portafiltro a su soporte y utiliza ambas manos para entregar la única taza de café al cliente. Al final, solo el cliente sostiene el café y ambas manos del barista se han apartado de la taza.

【Mantener la coherencia】
Mantén la identidad y el delantal del barista, la distribución de la cafetería, las posiciones a ambos lados de la barra y la cantidad de tazas de café.

## Comprobación final

Antes de responder, confirma cada punto:

- Cada prompt tiene exactamente una tarea principal: generación, edición o extensión. Una tarea híbrida explícita se ha dividido en dos prompts consecutivos, cada uno con una sola tarea principal.
- No han cambiado los sujetos, cantidades, identidades, escenario, propiedad de los objetos, relaciones espaciales ni desenlace.
- Están cubiertos todos los personajes, objetos y escenarios obligatorios del contrato de la historia. No se han fusionado dos personajes con nombre ni convertido inferencias de recursos en hechos sobre identidad, edad, relaciones o trama.
- Cada recurso utilizado tiene una función única y explícita.
- Las referencias presentes en el prompt original permanecen exactamente iguales. Ninguna se ha borrado, renumerado, traducido ni convertido en generación sin referencias porque los recursos no estuvieran adjuntos o accesibles; no se han inventado referencias ausentes de la entrada del usuario.
- Si faltan recursos, están dañados o son inaccesibles, el agente no ha afirmado revisarlos ni añadido detalles de aspecto, voz, acción o escenario que solo pudieran confirmarse al examinarlos.
- No se han forzado recursos irrelevantes en la salida. Si el inventario completo está disponible, cada recurso realmente disponible sin función asignada figura individualmente en `【Recursos no utilizados】`.
- Los recursos inaccesibles no se han tratado como comprendidos.
- Los distintos personajes, productos y objetos se relacionan individualmente, sin sustituir esas correspondencias por una declaración conjunta.
- No se ha utilizado una imagen de diseño de un solo personaje para definir a dos personajes en pantalla. Si hay varios candidatos individuales o grupales, primero se ha asignado una imagen por persona y una por grupo.
- Cada etapa de un vídeo largo tiene un único cambio de estado principal y un estado final claro.
- No se han eliminado sin autorización los intervalos temporales solicitados expresamente. Si solo existe una duración objetivo externa, los acontecimientos se han redistribuido en etapas sin marcas numéricas y el parámetro no se ha convertido en nuevos intervalos de tiempo.
- Una edición incluye un maestro único, alcance, cantidad de objetivos, contenido que debe conservarse y herencia de cronología. La edición de audio también especifica el audio que cambia, el que se conserva, los tiempos de sincronización labial y todas las imágenes.
- Se han respetado las reglas de bloqueo automático de relación de aspecto y duración de la tarea actual. Si existe un conflicto, solo se añade una nota sobre parámetros fuera del prompt.
- La dirección de la extensión y la función del fotograma de unión son correctas, y no se reescribe a la vez el original. Se cubren la imagen en la unión, el estado del audio, la tendencia del movimiento y los sujetos que continúan.
- El primer fotograma, el último y las demás imágenes de referencia se definen individualmente sin anular sus funciones. Un fotograma fijo utiliza la declaración exacta e independiente `Utiliza @ImageN como primer fotograma.` o `Utiliza @ImageN como último fotograma.`, sin debilitarla a una referencia de composición. Se han comprobado las relaciones de aspecto del primero y el último, o se han tratado conforme al límite de medios inaccesibles.
- Los fotogramas clave múltiples definen los estados imagen por imagen y en orden, sin prometer una réplica de cada fotograma ni una pausa estática.
- Una cuadrícula de guion gráfico indica el orden de lectura, la función de plano de cada viñeta y los bocetos, anotaciones o elementos provisionales que no deben adoptarse.
- Se ha identificado la escena 3D simplificada como básica o detallada y especificado en consecuencia las correspondencias de sujetos, la información heredada y el contenido excluido.
- Los términos abstractos de emoción y cinematografía se traducen en resultados observables cuando hace falta control.
- En cada etapa con habla, coinciden con la entrada el hablante, si habla o no, el diálogo, la función del audio, el idioma y su posición dentro o fuera de campo. No se ha convertido habla en silencio ni añadido mandarín, un dialecto o un acento regional sin indicación.
- Los números de plano, referencias, capítulos y pasos siguen siendo identificadores; no se han interpretado erróneamente como ángulos de cámara u otros parámetros cinematográficos.
- El prompt no contiene parámetros de salida, análisis interno, metadatos de evaluación, claves, direcciones de acceso a la API ni motivos de modificación.
- Se incluye exactamente una vez `Ten en cuenta que esto no es una edición de vídeo.` solo cuando la comprobación de compatibilidad se activa en una generación con referencias. No se añade automáticamente a ediciones reales, extensiones, generaciones con primer fotograma o con primero y último, ni generaciones normales sin conflicto de especificaciones.
- Si no se pueden consultar las especificaciones del vídeo de referencia, la decisión de compatibilidad sigue la intención explícita sobre relación de aspecto o duración del prompt original. Las referencias existentes permanecen intactas y el agente no afirma haber leído ni comprobado esas especificaciones.
- No se han añadido automáticamente restricciones negativas ajenas a la petición del usuario.
- Se han sustituido todos los marcadores. Por defecto, la salida contiene solo un cuerpo de prompt completo, sin encabezados Markdown, bloques delimitados de código ni explicaciones alrededor.

## Compatibilidad y notas de ejecución

- **Agente solo de texto**: procesa texto y etiquetas de referencia explícitas; no debe afirmar que ha visto adjuntos o el contenido de rutas de archivos.
- **Agente multimodal**: lee imágenes, vídeos y audios dentro de los permisos del entorno, y después realiza la interpretación de recursos en dos pasadas y la asignación automática.
- **Sin acceso al sistema de archivos**: conserva las etiquetas existentes del usuario; para rutas inaccesibles, aplica la alternativa de `El agente actual no puede leer los recursos` sin afirmar que las ha inspeccionado.
- **Sin acceso a la red**: no intentes examinar el contenido de URL remotas ni deducir el contenido de los recursos por sus nombres.
- **Solo salida**: esta skill entrega texto y no requiere escribir archivos, acceder a la red, llamar herramientas ni generar archivos binarios.
