

Comment démarrer avec Wan 2.5 Preview
Un guide rapide de Wan 2.5 Preview pour développeurs — configurez l'API, rédigez des prompts T2V et I2V cinématiques, ajoutez un audio synchronisé et maîtrisez le coût de la vidéo 1080p.
Wan 2.5 Preview est un outil de génération vidéo signé Alibaba qui transforme des descriptions textuelles ou des images en courts clips cinématiques avec audio synchronisé. Il prend en charge deux modes : texte-vers-vidéo (T2V) et image-vers-vidéo (I2V). D'autres modèles hautes performances comme Kling V3 offrent des capacités cinématiques similaires. Parmi ses fonctionnalités clés : la création audiovisuelle en une seule passe, une synchronisation labiale précise et des sorties jusqu'à 1080p à 24 fps pour des vidéos de 5 ou 10 secondes. L'intégration est facilitée par APIMart, une plateforme offrant une API unifiée pour un accès fluide. Les tarifs démarrent à 0,0336 $/seconde en 480p. Voici ce qu'il faut savoir pour démarrer :
- Modes : T2V pour créer des vidéos à partir de prompts textuels, I2V pour ajouter du mouvement à des images.
- Qualité : sorties en 480p, 720p ou 1080p avec audio stéréo 48 kHz.
- Tarification : paiement à l'usage, facturé à la seconde de vidéo générée.
- Configuration : fonctionne avec Python ou Node.js via une API REST. Nécessite une clé API d'APIMart.
- Flux de travail : envoyez une requête, obtenez un task ID et interrogez le statut pour récupérer le résultat.
Commencez par un clip de 5 secondes en 480p pour tester votre configuration. Une fois à l'aise, montez en 1080p pour les rendus finaux. Utilisez des prompts détaillés pour de meilleurs résultats et intégrez des instructions audio pour un son synchronisé.
Ce guide couvre tout, de la mise en place de votre environnement à la rédaction des prompts, en passant par une gestion efficace des coûts.
Mettre en place votre environnement
Prérequis pour les développeurs
Avant de plonger dans le code, il est essentiel de maîtriser quelques bases. Vous devez bien comprendre les API REST et le format JSON, car toutes les interactions avec Wan 2.5 reposent sur ces standards. Que vous préfériez Python 3.x ou Node.js (v14+), l'un comme l'autre conviendra à cette configuration.
Un autre concept clé à assimiler est celui des flux de travail asynchrones. Wan 2.5 ne renvoie pas une vidéo terminée immédiatement. Il fournit plutôt un task_id que vous devrez surveiller. Vous devrez créer une boucle d'interrogation pour vérifier le statut de la tâche jusqu'à ce qu'il passe à « completed ». Une fois prêt, rendez-vous sur APIMart pour créer un compte et obtenir votre clé API.
Créer un compte APIMart et une clé API

Commencez par vous rendre sur apimart.ai pour créer un compte gratuit. Après connexion, allez dans la section API Key Management de votre tableau de bord Console pour générer votre clé API. Veillez à copier et à stocker votre clé en lieu sûr immédiatement — elle ne s'affiche qu'une seule fois.
APIMart fonctionne selon un modèle de paiement à l'usage : vous devez donc approvisionner votre compte avant d'effectuer des requêtes. Si vous rencontrez une erreur 402, cela signifie que le solde de votre compte est trop faible. Une erreur 401, en revanche, indique un problème avec votre clé API. Vérifiez vos identifiants et assurez-vous que votre compte dispose de fonds suffisants.
Configurer votre environnement de développement
Une fois votre clé API prête, la configuration de votre environnement est simple. APIMart est compatible avec le SDK OpenAI. Pour démarrer :
- Pour Python : exécutez
pip install openai - Pour Node.js : exécutez
npm install openai
Le seul ajustement par rapport à une configuration OpenAI standard concerne l'URL de base. Définissez-la sur :
https://api.apimart.ai/v1
Authentifiez vos requêtes en incluant votre clé API sous forme de jeton Bearer dans l'en-tête, comme ceci :
Authorization: Bearer YOUR_API_KEY
Pour plus de sécurité, évitez de coder en dur votre clé API directement dans vos scripts. Stockez-la plutôt dans une variable d'environnement. Utiliser un fichier .env en développement local est une bonne pratique pour garder vos identifiants à l'abri et hors du contrôle de version. Une fois votre environnement configuré, vous pouvez passer à vos premières requêtes API.
Effectuer vos premières requêtes API
Exemple de requête texte-vers-vidéo
Une fois configuré, vous pouvez vous lancer dans votre première requête API ! Comme mentionné plus haut, ces requêtes sont asynchrones, ce qui signifie que vous devrez attendre la fin de la tâche avant d'obtenir vos résultats.
Voici un exemple Python simple pour commencer à générer une sortie texte-vers-vidéo :
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
Le seul champ obligatoire ici est prompt, qui décrit la scène que vous souhaitez créer. Les autres paramètres, comme negative_prompt et size, aident à affiner le résultat. Si votre prompt est court, définir prompt_extend sur true permet au modèle de l'enrichir en une description plus détaillée et cinématique. Pensez à utiliser des dimensions exactes, comme 1280*720, plutôt que des ratios d'aspect.
Après l'envoi de votre requête, vous recevrez un task_id. Utilisez cet ID pour interroger le point de terminaison de statut jusqu'à ce que votre tâche soit marquée SUCCEEDED :
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
La génération vidéo prend généralement de 1 à 5 minutes. Une fois votre vidéo prête, téléchargez-la dans les 24 heures, car l'URL expirera ensuite.
Voyons maintenant comment générer des vidéos à partir d'images selon une approche similaire. Vous pouvez aussi explorer d'autres modèles comme Grok Imagine Video pour des styles cinématiques différents.
Exemple de requête image-vers-vidéo
Le processus image-vers-vidéo (I2V) suit le même flux de travail asynchrone, mais avec deux différences clés : vous devez spécifier le modèle wan2.5-i2v-preview et fournir une image_url pointant vers l'image source.
Voici un exemple :
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
Pour l'I2V, le prompt doit décrire le mouvement ou les changements par rapport à l'image de départ — comme des mouvements de personnage ou des actions de caméra. Le ratio d'aspect correspondra à votre image source : veillez donc à la recadrer au ratio souhaité (par exemple 16:9, 9:16, 1:1) avant l'envoi. Les images sources doivent mesurer entre 360 et 2 000 pixels de chaque côté et ne pas dépasser 10 Mo.
Comme pour le texte-vers-vidéo, récupérez le task_id de la réponse et utilisez la même logique d'interrogation pour suivre le statut de la tâche jusqu'à son achèvement.
Décomposons maintenant la structure des réponses de l'API pour comprendre la signification de chaque champ.
Comprendre les réponses de l'API
Lorsque vous effectuez une requête POST réussie, l'API renvoie un objet JSON contenant un task_id que vous pouvez utiliser pour vérifier la progression de la tâche. Une fois la tâche terminée, vous recevrez les champs suivants :
| Champ | Type | Description |
|---|---|---|
task_id / id | String | Un identifiant unique pour la tâche. |
task_status | Enum | Statut actuel de la tâche : PENDING, RUNNING, SUCCEEDED ou FAILED. |
video_url | String | Lien direct vers la vidéo MP4 générée. |
meta.usage | Object | Détails sur l'utilisation des ressources, comme credits_used. |
error | Object | En cas d'échec de la tâche, contient name et message avec les détails de l'erreur. |
Un code de statut HTTP 200 et un task_id valide signifient que votre requête a été acceptée. Si la tâche finit par échouer, consultez le champ error.message pour en connaître les détails, comme des formats de résolution non pris en charge ou un prompt trop long.
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
Optimiser les prompts et les configurations
Une fois votre environnement en place et vos premières requêtes API effectuées (ou après avoir exploré la plus récente API WAN 2.6), affiner vos prompts peut considérablement améliorer la qualité de vos sorties vidéo.
Rédiger de bons prompts texte et image
Les résultats obtenus dépendent grandement de la qualité de rédaction de vos prompts. Pour Wan 2.5, les prompts de 80 à 120 mots fonctionnent le mieux — assez longs pour fournir des directives claires, mais pas au point de perturber le modèle.
Voici une structure utile à suivre : commencez par le sujet ou la scène, puis ajoutez les mouvements de caméra, les détails de mouvement et le style visuel. Par exemple, au lieu de dire « une femme marchant dans une ville », vous pourriez écrire : « Une femme en manteau rouge marche d'un pas vif dans une rue de Manhattan détrempée par la pluie au crépuscule. Travelling avant lent. Les flaques reflètent des enseignes au néon. Étalonnage bleu-orange, bokeh anamorphique, éclairage volumétrique crépusculaire. » Ce niveau de détail donne au modèle des instructions claires pour l'ambiance, la composition et le mouvement.
Pour contrôler la caméra, utilisez des termes cinématographiques standard comme panoramique gauche/droite, inclinaison haut/bas, travelling avant/arrière, arc orbital ou grue haut/bas. Ajoutez de la profondeur en décrivant des effets de parallaxe — « l'herbe au premier plan ondule tandis que les montagnes restent immobiles à l'arrière-plan ». Vous pouvez aussi ajuster le rythme avec des termes comme « ralenti » ou « whip-pan (panoramique rapide de la caméra) ».
Pour les tâches image-vers-vidéo, concentrez-vous sur la description du mouvement ou des changements d'expression, puisque le modèle utilise l'image fournie comme référence de base.
Une fois votre prompt visuel verrouillé, vous pouvez aller plus loin en intégrant un audio et des dialogues synchronisés.
Ajouter de l'audio et des dialogues
L'une des fonctionnalités phares de Wan 2.5 est sa capacité à générer simultanément la vidéo et l'audio, créant une expérience entièrement synchronisée avec voix, sons d'ambiance et effets.
« Ce qui distingue vraiment Wan 2.5, c'est sa capacité à générer non pas de simples vidéos silencieuses, mais des expériences audiovisuelles complètes en une seule passe. » - Scenario Knowledge Base [9]
Pour un dialogue avec synchronisation labiale, incluez les répliques du personnage entre guillemets, comme ceci : « Un scientifique regarde la caméra et dit : 'Les résultats sont extraordinaires.' » Pour les sons d'ambiance, soyez précis : « la pluie tape contre une fenêtre, le trafic bourdonne au loin. » Le modèle intègre automatiquement ces détails dans la sortie finale.
Si vous souhaitez utiliser votre propre audio, vous pouvez fournir une audio_url personnalisée au format .wav ou .mp3 (taille max : 15 Mo). Cependant, le fichier audio doit correspondre à la durée de la vidéo ; s'il est plus court, les images restantes seront muettes. Soyez prudent lorsque vous combinez audio_url avec plusieurs URL d'image ou de vidéo dans une seule requête, car cela peut entraîner des conflits [4].
Le modèle fait automatiquement correspondre la langue de l'audio à votre prompt : ainsi, si votre prompt est en anglais, l'audio sera également en anglais — aucune étape supplémentaire requise [10].
Ce niveau de synchronisation garantit que l'audio et l'image s'accordent parfaitement pour un résultat final soigné.
Choisir la résolution et la durée
Lorsque vous travaillez avec des requêtes API, choisir la bonne résolution et la bonne durée est essentiel pour équilibrer qualité et coût.
Wan 2.5 Preview propose deux durées fixes — 5 secondes ou 10 secondes — et des résolutions de 480p, 720p et 1080p à 24 fps. Commencez par un brouillon de 5 secondes en 480p pour tester votre concept, puis montez en 1080p pour votre rendu final.
Voici un guide rapide pour les cas d'usage courants :
| Cas d'usage | Ratio d'aspect | Résolution recommandée | Durée |
|---|---|---|---|
| YouTube / Présentations | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Fil Instagram / Publicités carrées | 1:1 (1440×1440) | 1080p | 5s |
| Prototypage / Tests | Quelconque | 480p | 5s |
| Tablette / Affichage classique | 4:3 (1632×1248) | 720p | 5–10s |
Toutes les résolutions incluent un audio stéréo 48 kHz : même un brouillon en basse résolution vous donnera donc une bonne idée du rendu sonore avant de vous engager dans un rendu de plus haute qualité.
Intégrer Wan 2.5 dans des flux de travail multimodaux

Une fois que vous avez expérimenté avec l'API, il est temps d'intégrer Wan 2.5 dans votre pipeline de production. Avec APIMart, vous accédez à plus de 500 modèles d'IA via une seule API. Cette configuration vous permet de combiner sans effort des modèles de langage, d'image et de vidéo sans configurations supplémentaires.
Construire un pipeline scénario-vers-vidéo
Voici un flux de travail courant : commencez par un modèle de langage pour rédiger un scénario et le découper en scènes. Ensuite, utilisez un modèle de génération d'images pour créer un storyboard de chaque scène. À partir de là, Wan 2.5 entre en jeu, prenant le storyboard et les descriptions de scènes pour produire un clip vidéo. Il synchronise même l'audio en une seule fois, ce qui simplifie le processus [2][5].
En gardant tout au sein d'APIMart, vous rationalisez votre flux de travail. Vous n'aurez à gérer qu'une seule structure d'API, une seule clé d'authentification et un unique tableau de bord de facturation. Avec cette configuration, vous pouvez vous concentrer sur l'ajustement fin de l'équilibre entre performance et coût.
Gérer les coûts et les performances
Pour maîtriser efficacement les dépenses, adaptez le modèle et la résolution à l'étape actuelle de votre projet. Pour les premiers brouillons, utilisez une résolution de 480p pour des clips de 5 secondes, ce qui coûte 43 crédits par clip. Une fois votre brouillon approuvé, passez au 720p à 85 crédits pour 5 secondes ou 170 crédits pour 10 secondes. Pour les rendus finaux, montez en 1080p à 128 crédits pour 5 secondes ou 255 crédits pour 10 secondes [1].
Besoin d'itérations plus rapides ? La variante wan-2.5-fast offre une option plus économique pour le 1080p, réduisant le coût d'un clip de 10 secondes à 174 crédits au lieu de 255 crédits [11]. Si vous traitez des tâches image-vers-vidéo à grande échelle, le modèle wan2.6-i2v-flash est un choix économique, facturant 0,0168 $ par seconde en 720p contre 0,05 $ par seconde pour le Wan 2.6 standard [7].
Exemple de flux de travail : du concept à la vidéo finale
Une fois vos coûts et performances optimisés, suivez ce processus étape par étape pour donner vie à votre concept :
- Rédigez le scénario : utilisez un modèle de langage comme GPT-5 (disponible via APIMart) pour élaborer des descriptions de scènes détaillées. Incluez des indications audio précises, comme « une douce musique de piano entre en fondu » ou « le trafic lointain d'une ville bourdonne ».
- Générez les storyboards et les brouillons de scènes en 480p : injectez les descriptions de scènes dans un modèle d'image pour créer des guides visuels. Testez ensuite chaque scène avec Wan 2.5 en 480p pendant 5 secondes pour évaluer le mouvement, le rythme et la synchronisation audio.
- Rendu final en 1080p : une fois satisfait des brouillons, effectuez à nouveau le rendu des scènes en 1080p pour une sortie MP4 soignée de 10 secondes, avec un audio stéréo 48 kHz natif [8].
« La cohérence de WAN 2.6 est incroyable ! Les images de personnages restent stables sur plusieurs clips, ce qui était auparavant difficile à obtenir. » - Wei Zhang, animateur indépendant [7]
Pour un coup de pouce supplémentaire lors du rendu final, utilisez le paramètre enable_prompt_expansion. Cette fonctionnalité enrichit automatiquement vos prompts avec des détails cinématiques, rehaussant la qualité de votre sortie sans nécessiter d'ajustements manuels supplémentaires [12][3].
Conclusion et prochaines étapes
Vous disposez désormais des outils pour vous lancer dans la création de votre première vidéo Wan 2.5. Avec sa synchronisation audio-vidéo intégrée en une seule passe, sa prise en charge de résolutions jusqu'à 1080p et ses modes d'entrée polyvalents comme le texte-vers-vidéo et l'image-vers-vidéo, ce modèle est prêt pour un vrai travail de production — pas seulement pour des essais occasionnels.
Avant de vous lancer, assurez-vous que votre configuration est entièrement prête. Commencez modestement en testant un clip en 480p pour affiner vos prompts. Une fois le processus maîtrisé, montez en 1080p pour vos rendus finaux. Cette approche vous permet d'expérimenter et de peaufiner sans mobiliser trop de ressources en amont.
Pour votre premier projet, essayez de vous concentrer sur une seule scène. Rédigez un prompt détaillé incluant des instructions audio claires et générez un court clip de 5 secondes. Les temps de traitement sont rapides — généralement entre 1 et 5 minutes — et le coût est maîtrisable, à partir de seulement 0,0336 $ par seconde pour les clips en 480p [6]. C'est un moyen abordable d'explorer l'outil et de vous familiariser avec lui.
Lorsque vous serez prêt à passer à l'échelle, profitez de la bibliothèque de plus de 500 modèles d'IA d'APIMart. Avec une seule clé API et un unique tableau de bord de facturation, vous pouvez rationaliser votre flux de travail et créer facilement un pipeline complet scénario-vers-vidéo, ou explorer des alternatives comme MiniMax-Hailuo 2.3 pour une cohérence de haute qualité.
FAQ
Comment gérer l'interrogation et les délais d'expiration pour les tâches vidéo de longue durée ?
Pour les flux de travail de production, il est efficace d'utiliser le paramètre callbackUrl lors de la création d'une tâche. Ainsi, vous recevrez automatiquement une requête POST une fois la tâche terminée.
Si vous préférez l'interrogation, voici comment cela fonctionne : envoyez votre tâche pour obtenir un taskId, puis attendez 50 secondes avant d'interroger le point de terminaison de statut. Après cela, vérifiez le statut toutes les 5 secondes. Pour éviter de surcharger le système, veillez à gérer les erreurs 429 en faisant une pause et en réessayant après un délai.
Quelle est la meilleure façon d'estimer le coût avant de générer un clip de 5 ou 10 secondes ?
Pour calculer le coût d'un clip vidéo de 5 ou 10 secondes, il suffit de multiplier la durée du clip (en secondes) par le tarif à la seconde du fournisseur. Pensez à vérifier le tarif de la résolution souhaitée — qu'il s'agisse de 480p, 720p ou 1080p — car une qualité supérieure s'accompagne généralement d'un prix plus élevé. Par exemple, pour un clip de 5 secondes, multipliez le tarif à la seconde par 5. Pour un clip de 10 secondes, multipliez-le par 10.
Comment améliorer la synchronisation labiale et la qualité des dialogues avec mes prompts ?
Pour obtenir la meilleure synchronisation labiale et la meilleure qualité de dialogue dans Wan 2.5 Preview, utilisez des prompts structurés. Ils doivent préciser clairement les répliques du personnage, ainsi que des détails comme l'émotion, le ton, la vitesse et le timbre. Ce niveau de détail aide le modèle à produire des résultats plus précis et naturels.
Pour une précision encore accrue, vous pouvez téléverser un fichier audio personnalisé au format WAV ou MP3. Ce fichier servira de guide au modèle pour aligner parfaitement les expressions faciales et les mouvements de la bouche sur l'audio.
Veillez à ce que votre image d'entrée soit nette et bien éclairée. Une image de haute qualité garantit que le modèle peut interpréter et reproduire efficacement les expressions. Profitez également de la fonctionnalité d'extension de prompt, qui vous permet d'inclure des descriptions détaillées pour une meilleure interprétation par le modèle.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.
