

Cómo empezar con Wan 2.5 Preview
Guía rápida de Wan 2.5 Preview para desarrolladores: configura la API, escribe prompts cinematográficos T2V e I2V, añade audio sincronizado y gestiona el coste del vídeo 1080p.
Wan 2.5 Preview es una herramienta de generación de vídeo de Alibaba que transforma descripciones de texto o imágenes en clips cinematográficos cortos con audio sincronizado. Admite dos modos: texto a vídeo (T2V) e imagen a vídeo (I2V). Otros modelos de alto rendimiento como Kling V3 ofrecen capacidades cinematográficas similares. Entre sus funciones clave están la creación audiovisual en una sola pasada, la sincronización labial precisa y salidas de hasta 1080p a 24fps para vídeos de 5 o 10 segundos. La integración resulta sencilla a través de APIMart, una plataforma que ofrece una API unificada para un acceso fluido. Los precios comienzan en 0,0336 $/segundo para 480p. Esto es lo que necesitas saber para empezar:
- Modos: T2V para crear vídeos a partir de prompts de texto, I2V para añadir movimiento a las imágenes.
- Calidad: Salidas en 480p, 720p o 1080p con audio estéreo de 48kHz.
- Precios: Pago por uso, facturado por segundo de vídeo generado.
- Configuración: Funciona con Python o Node.js mediante una API REST. Requiere una clave de API de APIMart.
- Flujo de trabajo: Envía una solicitud, obtén un task ID y consulta el resultado.
Empieza con un clip de 480p de 5 segundos para probar tu configuración. Una vez que te sientas cómodo, escala a 1080p para los renders finales. Usa prompts detallados para obtener mejores resultados e incorpora instrucciones de audio para lograr sonido sincronizado.
Esta guía cubre todo, desde la configuración de tu entorno hasta la creación de prompts y la gestión eficaz de los costes.
Configuración de tu entorno
Requisitos previos para desarrolladores
Antes de sumergirte en el código, es crucial familiarizarse con algunos conceptos básicos. Debes tener un buen dominio de las API REST y del formato JSON, ya que todas las interacciones con Wan 2.5 se basan en estos estándares. Tanto si prefieres Python 3.x como Node.js (v14+), cualquiera de los dos funcionará para esta configuración.
Otro concepto clave que debes entender son los flujos de trabajo asíncronos. Wan 2.5 no entrega un vídeo terminado de inmediato. En su lugar, proporciona un task_id que tendrás que monitorizar. Deberás crear un bucle de consulta para comprobar el estado de la tarea hasta que se actualice a "completed". Cuando estés listo, dirígete a APIMart para crear una cuenta y obtener tu clave de API.
Crear una cuenta de APIMart y una clave de API

Empieza visitando apimart.ai para configurar una cuenta gratuita. Después de iniciar sesión, ve a la sección API Key Management de tu Console Dashboard para generar tu clave de API. Asegúrate de copiar y almacenar tu clave de forma segura de inmediato: solo se muestra una vez.
APIMart utiliza un modelo de pago por uso, así que tendrás que añadir fondos a tu cuenta antes de realizar solicitudes. Si te encuentras con un error 402, significa que el saldo de tu cuenta es demasiado bajo. Un error 401, por otro lado, indica un problema con tu clave de API. Revisa dos veces tus credenciales y asegúrate de que tu cuenta tiene fondos suficientes.
Configurar tu entorno de desarrollo
Con tu clave de API lista, configurar tu entorno es sencillo. APIMart es compatible con el OpenAI SDK. Para empezar:
- Para Python: Ejecuta
pip install openai - Para Node.js: Ejecuta
npm install openai
El único ajuste respecto a una configuración estándar de OpenAI es la base URL. Configúrala así:
https://api.apimart.ai/v1
Autentica tus solicitudes incluyendo tu clave de API como un token Bearer en la cabecera, de esta manera:
Authorization: Bearer YOUR_API_KEY
Para mayor seguridad, evita codificar tu clave de API directamente en tus scripts. En su lugar, guárdala en una variable de entorno. Usar un archivo .env durante el desarrollo local es una buena práctica para mantener tus credenciales seguras y fuera del control de versiones. Una vez configurado tu entorno, puedes pasar a realizar tus primeras solicitudes a la API.
Realizar tus primeras solicitudes a la API
Ejemplo de solicitud de texto a vídeo
Una vez configurado, ¡puedes lanzarte a tu primera solicitud a la API! Como se mencionó antes, estas solicitudes son asíncronas, lo que significa que tendrás que esperar a que la tarea se complete antes de obtener los resultados.
Aquí tienes un ejemplo sencillo en Python para empezar a generar una salida de texto a vídeo:
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
El único campo obligatorio aquí es prompt, que describe la escena que quieres crear. Otros parámetros, como negative_prompt y size, ayudan a refinar la salida. Si tu prompt es corto, establecer prompt_extend en true permite que el modelo lo amplíe hasta convertirlo en una descripción más detallada y cinematográfica. Recuerda usar dimensiones exactas, como 1280*720, en lugar de relaciones de aspecto.
Después de enviar tu solicitud, recibirás un task_id. Usa este ID para consultar el endpoint de estado hasta que tu tarea se marque como SUCCEEDED:
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
La generación de vídeo suele tardar entre 1 y 5 minutos. Una vez que tu vídeo esté listo, descárgalo dentro de las 24 horas, ya que la URL expirará después de ese plazo.
A continuación, veamos cómo generar vídeos a partir de imágenes con un enfoque similar. También puedes explorar otros modelos como Grok Imagine Video para diferentes estilos cinematográficos.
Ejemplo de solicitud de imagen a vídeo
El proceso de imagen a vídeo (I2V) sigue el mismo flujo de trabajo asíncrono, pero incluye dos diferencias clave: necesitas especificar el modelo wan2.5-i2v-preview y proporcionar una image_url que apunte a la imagen de origen.
Aquí tienes un ejemplo:
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
Para I2V, el prompt debe describir el movimiento o los cambios respecto a la imagen inicial, como movimientos del personaje o acciones de cámara. La relación de aspecto coincidirá con tu imagen de origen, así que asegúrate de recortarla a la proporción deseada (p. ej., 16:9, 9:16, 1:1) antes de enviarla. Las imágenes de origen deben tener entre 360 y 2.000 píxeles por cada lado y no superar los 10 MB.
Al igual que con el texto a vídeo, captura el task_id de la respuesta y usa la misma lógica de consulta para rastrear el estado de la tarea hasta que se complete.
Ahora, desglosemos la estructura de las respuestas de la API para entender qué significa cada campo.
Entender las respuestas de la API
Cuando realizas una solicitud POST correcta, la API devuelve un objeto JSON que contiene un task_id que puedes usar para comprobar el progreso de la tarea. Una vez que la tarea finaliza, recibirás los siguientes campos:
| Campo | Tipo | Descripción |
|---|---|---|
task_id / id | String | Un identificador único para la tarea. |
task_status | Enum | Estado actual de la tarea: PENDING, RUNNING, SUCCEEDED o FAILED. |
video_url | String | Enlace directo al vídeo MP4 generado. |
meta.usage | Object | Detalles sobre el uso de recursos, como credits_used. |
error | Object | Si la tarea falla, contiene name y message con los detalles del error. |
Un código de estado HTTP 200 y un task_id válido significan que tu solicitud fue aceptada. Si la tarea acaba fallando, revisa el campo error.message para obtener detalles, como formatos de resolución no admitidos o un prompt demasiado largo.
Wan 2.5 (el asesino de Veo 3) YA está en n8n (tutorial completo y plantilla)
Optimizar prompts y configuraciones
Una vez configurado tu entorno y realizadas las primeras solicitudes a la API (o explorada la más reciente WAN 2.6 API), afinar tus prompts puede mejorar enormemente la calidad de tus salidas de vídeo.
Escribir buenos prompts de texto e imagen
Los resultados que obtienes dependen en gran medida de lo bien que elabores tus prompts. Para Wan 2.5, los prompts de entre 80 y 120 palabras funcionan mejor: lo suficientemente largos para ofrecer una guía clara, pero no tanto como para confundir al modelo.
Aquí tienes una estructura útil que puedes seguir: empieza con el sujeto o la escena, luego añade movimientos de cámara, detalles de movimiento y estilo visual. Por ejemplo, en lugar de decir "una mujer caminando por una ciudad", podrías escribir: "Una mujer con abrigo rojo camina a paso ligero por una calle de Manhattan empapada por la lluvia al anochecer. Dolly in lento. Los charcos reflejan letreros de neón. Gradación de color teal y naranja, bokeh anamórfico, iluminación volumétrica del atardecer." Este nivel de detalle da al modelo instrucciones claras sobre atmósfera, composición y movimiento.
Para controlar la cámara, usa términos estándar de cinematografía como Pan left/right, Tilt up/down, Dolly in/out, Orbital arc o Crane up/down. Añade profundidad describiendo efectos de paralaje: "la hierba en primer plano se mece mientras las montañas permanecen inmóviles al fondo". También puedes ajustar el ritmo con términos como "cámara lenta" o "whip-pan (un barrido rápido de cámara)".
Para las tareas de imagen a vídeo, céntrate en describir los cambios de movimiento o expresión, ya que el modelo usa la imagen proporcionada como referencia base.
Una vez que tu prompt visual esté fijado, puedes ir un paso más allá incorporando audio y diálogo sincronizados.
Añadir audio y diálogo
Una de las funciones más destacadas de Wan 2.5 es su capacidad para generar vídeo y audio simultáneamente, creando una experiencia totalmente sincronizada con voz, sonidos ambientales y efectos.
"Lo que realmente distingue a Wan 2.5 es su capacidad para generar no solo vídeos silenciosos, sino experiencias audiovisuales completas en una sola pasada." - Scenario Knowledge Base [9]
Para el diálogo con sincronización labial, incluye el habla del personaje entre comillas, así: "Un científico mira a la cámara y dice: 'Los resultados son extraordinarios.'" Para los sonidos ambientales, sé específico: "la lluvia golpea una ventana, el tráfico lejano zumba". El modelo integra estos detalles en la salida final automáticamente.
Si quieres usar tu propio audio, puedes proporcionar una audio_url personalizada en formato .wav o .mp3 (tamaño máximo: 15 MB). Sin embargo, el archivo de audio debe coincidir con la duración del vídeo; si es más corto, los fotogramas restantes quedarán en silencio. Ten cuidado al combinar audio_url con varias URL de imagen o vídeo en una sola solicitud, ya que esto puede provocar conflictos [4].
El modelo hace coincidir automáticamente el idioma del audio con tu prompt, así que si tu prompt está en inglés, el audio también estará en inglés, sin pasos adicionales [10].
Este nivel de sincronización garantiza que el audio y las imágenes trabajen juntos sin fisuras para un resultado final pulido.
Elegir resolución y duración
Al trabajar con solicitudes a la API, seleccionar la resolución y la duración adecuadas es clave para equilibrar calidad y coste.
Wan 2.5 Preview ofrece dos duraciones fijas —5 segundos o 10 segundos— y resoluciones de 480p, 720p y 1080p a 24 fps. Empieza con un borrador de 5 segundos a 480p para probar tu concepto y luego escala a 1080p para tu render final.
Aquí tienes una referencia rápida para casos de uso comunes:
| Caso de uso | Relación de aspecto | Resolución recomendada | Duración |
|---|---|---|---|
| YouTube / Presentaciones | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Feed de Instagram / Anuncios cuadrados | 1:1 (1440×1440) | 1080p | 5s |
| Prototipado / Pruebas | Cualquiera | 480p | 5s |
| Tablet / Pantalla clásica | 4:3 (1632×1248) | 720p | 5–10s |
Todas las resoluciones incluyen audio estéreo de 48kHz, así que incluso un borrador de baja resolución te dará una buena idea de cómo sonará el audio antes de comprometerte con un render de mayor calidad.
Integrar Wan 2.5 en flujos de trabajo multimodales

Una vez que hayas experimentado con la API, es hora de integrar Wan 2.5 en tu pipeline de producción. Con APIMart, obtienes acceso a más de 500 modelos de IA a través de una sola API. Esta configuración te permite combinar sin problemas modelos de lenguaje, imagen y vídeo sin necesidad de configuraciones adicionales.
Construir un pipeline de guion a vídeo
Aquí tienes un flujo de trabajo habitual: empieza con un modelo de lenguaje para redactar un guion y dividirlo en escenas. A continuación, usa un modelo de generación de imágenes para crear un storyboard de cada escena. A partir de ahí, entra Wan 2.5, que toma el storyboard y las descripciones de escena para producir un clip de vídeo. Incluso sincroniza el audio de una sola vez, simplificando el proceso [2][5].
Al mantener todo dentro de APIMart, optimizas tu flujo de trabajo. Solo tendrás que gestionar una estructura de API, una clave de autenticación y un único panel de facturación. Con esta configuración, puedes centrarte en afinar el equilibrio entre rendimiento y coste.
Gestionar costes y rendimiento
Para gestionar los gastos de forma eficaz, adapta el modelo y la resolución a la fase actual de tu proyecto. Para los primeros borradores, usa resolución 480p en clips de 5 segundos, que cuesta 43 créditos por clip. Una vez aprobado tu borrador, sube a 720p a 85 créditos por 5 segundos o 170 créditos por 10 segundos. Para los renders finales, súbelo a 1080p a 128 créditos por 5 segundos o 255 créditos por 10 segundos [1].
¿Necesitas iteraciones más rápidas? La variante wan-2.5-fast ofrece una opción más rentable para 1080p, reduciendo el coste de un clip de 10 segundos a 174 créditos en lugar de 255 créditos [11]. Si abordas tareas de imagen a vídeo a gran escala, el modelo wan2.6-i2v-flash es una opción económica, cobrando 0,0168 $ por segundo a 720p frente a los 0,05 $ por segundo del Wan 2.6 estándar [7].
Ejemplo de flujo de trabajo: del concepto al vídeo final
Una vez optimizados los costes y el rendimiento, sigue este proceso paso a paso para dar vida a tu concepto:
- Escribe el guion: Usa un modelo de lenguaje como GPT-5 (disponible a través de APIMart) para elaborar descripciones de escena detalladas. Incluye señales de audio específicas, como "entra suavemente música de piano" o "zumba el tráfico lejano de la ciudad".
- Genera storyboards y borradores de escenas a 480p: Introduce las descripciones de escena en un modelo de imagen para crear guías visuales. Luego, prueba cada escena con Wan 2.5 a 480p durante 5 segundos para evaluar el movimiento, el ritmo y la sincronización del audio.
- Render final a 1080p: Una vez satisfecho con los borradores, vuelve a renderizar las escenas a 1080p para obtener una salida MP4 pulida de 10 segundos, con audio estéreo nativo de 48kHz [8].
"¡La consistencia de WAN 2.6 es asombrosa! Las imágenes de los personajes se mantienen estables en varios clips, algo que antes era difícil de lograr." - Wei Zhang, animador independiente [7]
Para un impulso adicional durante el render final, usa el parámetro enable_prompt_expansion. Esta función enriquece automáticamente tus prompts con detalles cinematográficos, elevando la calidad de tu salida sin requerir ajustes manuales adicionales [12][3].
Conclusión y próximos pasos
Ahora estás equipado con las herramientas para lanzarte a crear tu primer vídeo con Wan 2.5. Con su sincronización audio-vídeo integrada en una sola pasada, su compatibilidad con resoluciones de hasta 1080p y sus versátiles modos de entrada como texto a vídeo e imagen a vídeo, este modelo está listo para un trabajo de producción serio, no solo para pruebas casuales.
Antes de lanzarte, asegúrate de que tu configuración está totalmente preparada. Empieza poco a poco probando un clip de 480p para afinar tus prompts. Una vez que domines el proceso, escala a 1080p para tus renders finales. Este enfoque te permite experimentar y refinar sin comprometer demasiados recursos de entrada.
Para tu primer proyecto, intenta centrarte en una sola escena. Escribe un prompt detallado que incluya instrucciones de audio claras y genera un clip corto de 5 segundos. Los tiempos de procesamiento son rápidos —normalmente entre 1 y 5 minutos— y el coste es manejable, empezando en tan solo 0,0336 $ por segundo para clips de 480p [6]. Es una forma asequible de explorar y familiarizarte con la herramienta.
Cuando estés listo para expandirte, aprovecha la biblioteca de más de 500 modelos de IA de APIMart. Con una sola clave de API y un panel de facturación, puedes optimizar tu flujo de trabajo y crear con facilidad un pipeline completo de guion a vídeo, o explorar alternativas como MiniMax-Hailuo 2.3 para una consistencia de alta calidad.
Preguntas frecuentes
¿Cómo gestiono las consultas de estado y los tiempos de espera en tareas de vídeo de larga duración?
Para los flujos de trabajo de producción, es eficiente usar el parámetro callbackUrl al crear una tarea. De este modo, recibirás automáticamente una solicitud POST una vez que la tarea se complete.
Si prefieres consultar el estado, así es como funciona: envía tu tarea para obtener un taskId, luego espera 50 segundos antes de consultar el endpoint de estado. Después de eso, comprueba el estado cada 5 segundos. Para evitar sobrecargar el sistema, asegúrate de gestionar los errores 429 pausando y reintentando tras un retardo.
¿Cuál es la mejor manera de estimar el coste antes de generar un clip de 5s o 10s?
Para calcular el coste de un clip de vídeo de 5 o 10 segundos, simplemente multiplica la duración del clip (en segundos) por la tarifa por segundo del proveedor. Asegúrate de comprobar la tarifa para la resolución que quieres —ya sea 480p, 720p o 1080p— ya que una mayor calidad suele conllevar un precio más alto. Por ejemplo, si estás calculando para un clip de 5 segundos, multiplica la tarifa por segundo por 5. Para un clip de 10 segundos, multiplícala por 10.
¿Cómo puedo mejorar la sincronización labial y la calidad del diálogo con mis prompts?
Para obtener la mejor sincronización labial y calidad de diálogo en Wan 2.5 Preview, usa prompts estructurados. Estos deben especificar claramente las frases del personaje, junto con detalles como emoción, tono, velocidad y timbre. Este nivel de detalle ayuda al modelo a ofrecer resultados más precisos y naturales.
Para una precisión aún mayor, puedes subir un archivo de audio personalizado en formato WAV o MP3. Este archivo actuará como guía para que el modelo alinee las expresiones faciales y los movimientos de la boca con el audio a la perfección.
Asegúrate de que tu imagen de entrada sea nítida y esté bien iluminada. Una imagen de alta calidad garantiza que el modelo pueda interpretar y replicar las expresiones de forma eficaz. Además, aprovecha la función de extensión de prompts, que te permite incluir descripciones detalladas para una mejor interpretación por parte del modelo.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.
