
L'IA multimodale au service des récits de personnages
Découvrez comment l'IA multimodale combine des modèles de texte, d'image et de vidéo pour créer des personnages cohérents, planifier des scènes et produire du contenu narratif personnalisé.
L'IA multimodale transforme la narration en combinant texte, visuels, audio et vidéo pour créer des personnages réalistes et des récits cohérents. Elle simplifie la création de contenu, réduit les coûts et garantit la cohérence entre les formats. Voici ce qu'il faut savoir :
- Ce qu'elle fait : L'IA multimodale gère plusieurs types de contenu, comme le texte-vers-vidéo, pour développer des personnages dotés de visuels, d'une voix et d'un comportement cohérents.
- Pourquoi c'est important : Elle réduit les coûts de production (à peine 5 $ par récit) et le temps (moins d'une heure) par rapport aux méthodes traditionnelles, qui peuvent coûter jusqu'à 500 000 $ par épisode.
- Comment ça marche : Des outils comme APIMart unifient plus de 500 modèles d'IA, permettant des flux de travail fluides pour créer et gérer des récits de personnages.
- Techniques clés : Utilisez des « documents d'ADN de personnage » pour des profils détaillés, des visuels d'ancrage pour la cohérence, et des outils avancés comme les LoRA et les IP-Adapters pour préserver la précision.
Ce guide explique comment utiliser efficacement l'IA multimodale - de l'écriture des récits à la production de vidéos - tout en gardant des personnages cohérents et captivants pour des publics variés.
Concepts fondamentaux du développement de personnages piloté par l'IA
Construire des profils de personnages cohérents
Lorsque vous utilisez l'IA multimodale pour la narration, il est essentiel de créer une base solide pour vos personnages. Avant de générer des visuels ou des dialogues, commencez par un « document d'ADN de personnage » - une référence détaillée qui définit tout ce qui concerne votre personnage. Ce document doit inclure des détails physiques (par exemple, « des yeux vert émeraude en amande légèrement relevés » plutôt que simplement « yeux verts »), des traits de personnalité, des limites comportementales et des règles narratives que l'IA doit suivre de manière cohérente sur toutes les sorties [3].
Le niveau de détail que vous incluez dans ce document est crucial. Des descriptions vagues peuvent conduire à des résultats incohérents, rendant votre personnage moins reconnaissable. Un profil précis donne à l'IA des limites claires, garantissant que votre personnage reste cohérent en apparence, en ton et en comportement tout au long du récit.
« La cohérence d'un personnage dans le contenu généré par IA signifie que le personnage reste identique sur chaque sortie. Sa personnalité, son ton, son comportement, son apparence et son histoire ne changent pas et ne contredisent pas les détails antérieurs. » - Aisha Imtiaz, Editor, AllAboutAI [3]
Une méthode efficace pour maintenir la cohérence visuelle consiste à enregistrer le numéro de seed des générations de personnage réussies. Réutiliser ce seed dans les scènes futures garantit que l'identité visuelle du personnage reste ancrée, évitant les changements subtils au fil du temps [3].
Comment les modèles multimodaux fonctionnent ensemble
Les modèles d'IA spécialisés dans le texte, l'image et la vidéo abordent chacun différents aspects de la création de personnage. Utilisés ensemble, ces modèles donnent vie aux personnages de manière cohérente. Par exemple :
- Un modèle de langage comme GPT-5 façonne la voix, l'histoire et la profondeur émotionnelle du personnage.
- Un modèle d'image comme Flux Kontext traduit les descriptions écrites en un design visuel cohérent.
- Un modèle vidéo comme Kling V3 anime le personnage, préservant son apparence à travers des scènes dynamiques.
Des outils avancés comme les LoRA affinent des couches spécifiques du modèle pour verrouiller des détails clés - comme la structure faciale, les textures des vêtements ou le teint de la peau - atteignant un taux de précision de 85 à 92 % par rapport à l'utilisation de prompts seuls [3]. Par ailleurs, les IP-Adapters permettent une injection d'identité « zero-shot ». Cela signifie que vous pouvez téléverser un portrait de référence, et le modèle extrait les traits du visage sans nécessiter d'entraînement supplémentaire [6]. Grâce à ces méthodes, les API vidéo d'IA modernes peuvent atteindre jusqu'à 95 % de continuité visuelle, maintenant la dérive du personnage en dessous de 5 % de variance entre les scènes [6].
Le passage de l'ancienne approche « prompter et prier » à des flux de production structurés a révolutionné le secteur. Comme l'explique le blog Atlas Cloud :
« Le secteur est passé du "prompter et prier" à la production structurée. » [6]
Cette approche structurée garantit que les personnages restent cohérents, même en passant d'un outil d'IA à un autre.
Le rôle d'APIMart dans la narration de personnages

Gérer plusieurs modèles d'IA nécessitait autrefois des configurations compliquées, mais des plateformes comme APIMart simplifient le processus. APIMart connecte plus de 500 modèles d'IA - dont GPT-5, Claude, Flux Kontext, Kling V3 et Sora - via une seule API compatible OpenAI, rationalisant l'ensemble du pipeline de création de personnage.
Pour le développement de personnages, APIMart inclut des fonctionnalités comme la syntaxe de référence <<<image_N>>> pour des modèles comme Kling V3 Omni. Cette syntaxe indique explicitement au modèle quelle image de référence suivre, garantissant la cohérence visuelle [4]. De plus, son endpoint create-character vous permet d'extraire l'identité d'un personnage à partir d'un horodatage précis dans une vidéo existante et de réutiliser cette identité dans de nouvelles scènes [5]. Ces outils offrent un contrôle précis, garantissant que vos personnages restent visuellement et narrativement cohérents tout au long du processus de narration.
Créer des récits d'IA cohérents à plusieurs personnages
Planifier un flux de travail narratif multimodal de personnage

Définir la portée du récit et choisir les modalités
Avant de vous plonger dans les outils d'IA, il est crucial de cartographier la structure et la durée de votre projet. Par exemple, un court arc émotionnel de 30 secondes pourrait se décomposer en 6 à 8 micro-clips, chacun durant environ 5 secondes, tandis qu'une vidéo explicative de 2 minutes pourrait présenter des segments plus longs avec des cartons de titre entre eux. Poser ces bases en amont permet d'éviter des reprises supplémentaires par la suite.
Décomposez votre scénario en scènes qui détaillent le sujet, l'action, l'environnement, le mouvement de caméra et le ton. Considérez ces scènes comme votre storyboard, que vous les écriviez en texte brut ou au format JSON. Cette étape de planification garantit la cohérence avec l'identité de personnage que vous avez déjà établie.
Pour les moments abstraits ou atmosphériques où des visuels précis ne sont pas essentiels, les scènes uniquement textuelles conviennent bien. Cependant, lorsque vous introduisez un personnage récurrent, combiner texte et images aide à verrouiller son identité visuelle et évite les incohérences entre les scènes. Pour les moments nécessitant une synchronisation étroite - comme un dialogue associé à des effets sonores - un mélange de texte, de visuels et d'audio est la meilleure approche.
Une fois vos scènes esquissées, l'étape suivante consiste à sélectionner les bons modèles pour chaque modalité.
Choisir les bons modèles avec APIMart
La modalité de chaque scène doit s'aligner sur le modèle d'IA le plus adapté. APIMart simplifie ce processus en offrant un accès à plus de 500 modèles d'IA via une seule API, éliminant la corvée de jongler entre plusieurs comptes ou intégrations.
Pour la génération de texte, GPT-5 est un choix solide pour créer de la profondeur et du contexte pour le personnage. Sur APIMart, GPT-5 est fourni avec des outils comme Web Search et File Search pour ancrer les personnages dans des détails du monde réel [7].
Pour la génération d'image, APIMart fournit des modèles avancés capables de transformer des descriptions écrites de personnages en visuels cohérents.
En ce qui concerne la vidéo, votre choix dépendra de votre budget et de vos exigences de qualité. Voici un aperçu rapide de quelques options :
| Modèle | Idéal pour | Prix APIMart |
|---|---|---|
| Kling V3 Omni | Scènes de personnages cinématographiques avec entrées multimodales | 0,0672 $/sec (720p) |
| MiniMax Hailuo 2.3 | Clips courts rapides et à faible coût | 0,025 $/sec |
| Sora 2 Preview | Qualité équilibrée pour la plupart des scénarios créatifs | 0,08 $/sec |
| Vidu Q3 Pro | Scènes complexes et hautes performances | 0,12 $/sec |
Voici une astuce : utilisez un premier passage avec un modèle de langage comme GPT-5 pour extraire les traits physiques de votre personnage dans un format JSON structuré (par exemple, nom, âge, couleur de cheveux, tenue, description de la voix). Attacher cette fiche d'identité à chaque prompt de scène garantit que votre personnage reste cohérent sur toutes les sorties des modèles [1].
Grâce à l'API unifiée d'APIMart, le processus de sélection et de gestion des modèles devient beaucoup plus simple.
Comparaison des modalités pour la narration
Chaque approche de modalité a ses forces et ses compromis. Voici une comparaison rapide pour vous aider à décider laquelle correspond à vos besoins :
| Approche | Précision | Cohérence | Rentabilité | Meilleur cas d'usage |
|---|---|---|---|---|
| Texte seul | Faible | Faible (dérive du personnage) | Élevée | Scènes abstraites, nature, paysages urbains |
| Texte + Image | Élevée | Élevée (persistance de l'identité) | Moyenne | Contenu de marque, récits de personnages |
| Texte + Visuel + Audio | Très élevée | Élevée (synchro audio-visuelle) | Moyenne-faible | Scènes de dialogue, timing précis |
| Pipelines unifiés | Maximale | Très élevée | Minimale | Productions à grande échelle |
Investir dans une précision plus élevée dès le départ peut vous faire gagner du temps et des efforts par la suite. Bien que les flux uniquement textuels puissent sembler moins chers au départ, la dérive du personnage entre les scènes peut entraîner des révisions supplémentaires, annulant ces économies initiales.
Créer et affiner des récits de personnages multimodaux
Écrire des récits basés sur le texte
Au cœur de la narration multimodale se trouve un cadre narratif solide. Pour y parvenir, exploitez GPT-5 en deux étapes distinctes. Premièrement, extrayez l'identité visuelle du personnage sous forme de fichier JSON structuré, détaillant des caractéristiques comme la couleur des cheveux, la structure faciale, la tenue et la voix. Deuxièmement, décomposez le récit en scènes, chacune se concentrant sur un seul verbe principal (par exemple, court, se cache, rit) [1]. Cette approche garantit que le récit s'aligne de manière cohérente avec les éléments visuels et vidéo décrits plus loin, permettant à la fiche d'identité JSON du personnage de rester cohérente sur toutes les modalités.
Lorsque vous créez des scènes, tenez-vous-en à un seul verbe principal par carte. Surcharger les prompts de plusieurs actions peut troubler les modèles, conduisant souvent à des sorties incohérentes ou chaotiques [8].
Transformer les descriptions de personnages en visuels
Une fois la base narrative de votre personnage établie, l'étape suivante consiste à lui donner vie visuellement. Commencez par convertir la fiche d'identité JSON en un ensemble d'images de référence. Visez au moins trois vues d'ancrage : de face, de profil et de trois quarts. Ces images d'ancrage servent de guide visuel pour votre personnage, garantissant que son apparence reste cohérente tout au long du récit [9].
Pour éviter la « dérive d'identité », maintenez une bible de personnage qui inclut des détails clés comme la forme du visage, la palette de couleurs, la garde-robe, les préférences d'éclairage et les expressions par défaut. Chaque prompt d'image doit intégrer ce bloc d'identité, seuls l'action ou l'environnement propres à la scène changeant [9]. Des outils tels que la fonctionnalité Subject de Grok Imagine sur APIMart vous permettent de téléverser directement une image de référence, garantissant que l'apparence de votre personnage reste cohérente même dans des décors variés [10].
Produire des scènes vidéo centrées sur le personnage
Une fois vos visuels d'ancrage prêts, vous pouvez passer à la génération de vidéos. Utilisez ces images de référence comme base plutôt que de vous fier uniquement aux prompts textuels pour garantir des résultats soignés.
Différents modèles disponibles sur APIMart répondent à des besoins uniques de production vidéo. Voici une comparaison rapide :
| Modèle | Durée max | Fonctionnalité phare |
|---|---|---|
| Sora 2 Pro | 25 secondes | Contrôles cinématographiques étendus et audio synchronisé |
| Hailuo 03 | 30 secondes | Director Mode et Global Identity VAE |
| Kling V3 | 30 secondes | Transitions par images clés multiples (2 à 7 frames) |
| Google Veo 3 | 8 secondes | Audio natif d'ambiance, bruitage et dialogue |
Pour garantir des transitions fluides entre les clips, utilisez la méthode de la « dernière image » : prenez la frame finale d'une vidéo et utilisez-la comme image d'ouverture de la scène suivante [10]. Cette méthode préserve la continuité de la position, de l'éclairage et de l'expression de votre personnage sans avoir à repartir de zéro. Kling V3 Omni simplifie ce processus avec sa syntaxe <<<image_N>>>, vous permettant de référencer directement des frames spécifiques dans le tableau de prompts [4].
Garder des personnages cohérents et des récits personnalisés
Méthodes pour maintenir la cohérence des personnages
L'un des plus grands défis de la narration multimodale est d'éviter la « dérive du personnage ». Cela se produit lorsque de petits changements involontaires entre les scènes rendent un personnage incohérent ou méconnaissable. La clé pour éviter cela est d'établir une base solide pour votre personnage avant de générer le moindre contenu.
Commencez par créer une bible de personnage. Elle doit inclure des détails essentiels comme la forme du visage, la couleur des yeux, la texture des cheveux, le teint de la peau, les signes distinctifs et la tenue par défaut. Considérez-la comme un outil de mémoire externe pour vos modèles d'IA, qui n'ont pas la capacité de conserver le contexte d'une session à l'autre [3][11]. Parallèlement, compilez un pack de référence de 8 à 10 images d'ancrage montrant le personnage sous plusieurs angles (de face, de profil, de trois quarts et en pied) dans des conditions d'éclairage neutres [9][11].
Côté technique, l'entraînement LoRA peut intégrer des éléments spécifiques - comme la structure faciale ou les motifs vestimentaires - directement dans les paramètres du modèle, atteignant des taux de précision du personnage de 85 à 92 %, contre seulement 23 % en s'appuyant sur des prompts seuls [3]. Pour les détails plus fins, des outils comme les IP-Adapters assurent un contrôle précis des traits du visage, tandis que ControlNet aide à maintenir des poses et un positionnement spatial cohérents [6][13]. L'entraînement LoRA est également abordable, coûtant généralement entre 5 et 15 $ par modèle de personnage [13]. Des plateformes comme APIMart simplifient encore ce processus avec des outils comme le Global Identity VAE de Hailuo 03 et le paramètre character_url de Sora 2, qui éliminent le besoin d'entraînement personnalisé.
Deux habitudes de travail peuvent faire une grande différence pour maintenir la cohérence :
- Placez les descripteurs de personnage au début de chaque prompt. Les modèles d'IA priorisent les tokens selon leur ordre, donc enterrer les détails d'identité plus loin dans le prompt affaiblit leur impact [11].
- Révisez la continuité toutes les 5 à 8 scènes. Cela aide à repérer et corriger la dérive tôt, avant qu'elle ne devienne un problème plus important [12].
« L'écart entre le "contenu généré par IA" et le "film IA", c'est la cohérence. Comblez cet écart, et vous ne générez plus seulement des images - vous racontez des histoires. » - Sofia Chen, Growth & Marketing Lead, CinemaDrop [11]
En suivant ces étapes, vous pouvez garantir à la fois la cohérence visuelle et narrative, préparant vos personnages à une adaptation fluide à différents publics.
Adapter les récits pour différents publics
Une fois l'identité de votre personnage verrouillée, vous pouvez adapter son récit à divers publics tout en préservant ses traits fondamentaux. La cohérence ne signifie pas la rigidité - votre personnage peut rester attachant dans plusieurs contextes, qu'il s'adresse à une salle de classe ou qu'il fasse une présentation dans une salle de conseil. Le secret réside dans la préservation du noyau visuel et comportemental du personnage tout en adaptant des éléments comme la langue, le ton, le décor et les références culturelles.
Des plateformes comme APIMart rendent ce processus évolutif. Des embeddings de personnage centralisés permettent à un porte-parole virtuel de conserver la même apparence sur tous les marchés tout en s'adaptant à différentes langues ou environnements localisés [6]. C'est similaire au fonctionnement des influenceurs virtuels. Début 2026, ces influenceurs ont capté une part de marché de 4,2 % et atteint des taux d'engagement de 5,67 % - près de trois fois plus que leurs homologues humains [6].
| Approche | Cohérence | Flexibilité du public | Idéal pour |
|---|---|---|---|
| Texte seul | Faible | Élevée | Scènes abstraites ou générales |
| Texte + Image | Élevée | Moyenne | Contenu de marque, récits de personnages |
| Pipelines unifiés | Très élevée | Élevée | Séries épisodiques, campagnes multi-marchés |
Pour le contenu éducatif, ajustez le ton pour le rendre plus accessible, simplifiez le vocabulaire et adaptez le décor au sujet - tout en préservant intacte l'identité fondamentale du personnage. Pour le divertissement, le même personnage peut endosser des rôles cinématographiques à fort enjeu en changeant simplement le contexte de la scène. La bible de personnage reste la même ; seuls les éléments environnants changent.
Conclusion et points clés à retenir
Principaux avantages de l'IA multimodale pour la narration
L'IA multimodale a redéfini ce que les créateurs peuvent accomplir. Des tâches qui nécessitaient autrefois de grandes équipes, des budgets conséquents et des mois d'efforts peuvent désormais être réalisées en moins d'une heure - et pour une fraction du coût [2]. Ce changement bouleverse la narration centrée sur les personnages, réduisant considérablement le temps de production tout en maintenant la fluidité narrative.
Mais il ne s'agit pas seulement de vitesse et de coût. L'IA multimodale apporte un nouveau niveau de profondeur et de cohérence à la narration. Elle gère de manière transparente des éléments comme les arcs de personnages, les dynamiques de cause à effet et la cohérence thématique - des tâches avec lesquelles les outils déconnectés peinent souvent. Par exemple, une enquête de 2026 a révélé que 63 % des auteurs passaient plus de temps à éditer du contenu généré par IA qu'à créer du matériel original lorsqu'ils s'appuyaient sur des outils fragmentés [14]. Une approche unifiée et multimodale élimine une grande partie de cette inefficacité.
« Les simples chatbots conviennent pour les e-mails, mais ils échouent lorsque vous avez besoin d'un récit cohérent. » - SidekickWriter [14]
En rationalisant le processus créatif, l'IA multimodale rend non seulement la narration plus pratique, mais elle relève aussi la barre en matière de qualité et de cohérence. Ces outils permettent aux créateurs de façonner des récits plus riches et plus captivants avec moins de friction.
Prochaines étapes avec APIMart
Si vous êtes prêt à mettre ces avancées en pratique, APIMart propose une solution simple. Elle offre un accès à plus de 500 modèles d'IA - couvrant le texte, l'image et la vidéo - via un seul endpoint d'API compatible OpenAI (api.apimart.ai/v1). Ce système unifié élimine la corvée de gérer plusieurs clés d'API, comptes de facturation ou de basculer entre fournisseurs.
Pour commencer, envisagez d'utiliser un modèle économique pour les brouillons et les révisions internes. Une fois votre récit affiné, passez à un modèle premium pour la sortie finale soignée. Pour des apparences de personnage cohérentes, réutilisez le paramètre seed. Et pour maîtriser les coûts, validez votre sortie en 720p avant de passer à l'échelle supérieure en 1080p ou 4K. Cette approche vous permet d'équilibrer efficacement qualité et budget.
FAQ
Quel est le moyen le plus rapide de stopper la dérive du personnage entre les scènes ?
Le moyen le plus rapide d'éviter la dérive du personnage est d'utiliser une image de référence comme guide visuel. Une fiche de personnage montrant plusieurs angles peut aider le modèle à maintenir la géométrie faciale, les proportions et les vêtements cohérents. Des outils comme APIMart facilitent l'intégration de ces entrées multimodales dans votre flux de travail. Combiner des ancres visuelles avec des modèles de prompts cohérents et des seeds fixes garantit la stabilité, réduisant le besoin d'ajustements manuels constants.
Ai-je besoin d'un entraînement LoRA, ou les images de référence suffisent-elles ?
Pour décider s'il faut utiliser l'entraînement LoRA, tout dépend du niveau de cohérence requis pour l'apparence de votre personnage. Pour les clips courts ou les scènes uniques, les images de référence font généralement l'affaire. Vous pouvez simplement téléverser une image ou vous appuyer sur les frames précédentes pour préserver l'identité du personnage.
Cependant, si votre projet s'étend sur plusieurs scènes - comme une web-série - l'entraînement LoRA devient une meilleure option. Il offre une fidélité supérieure mais demande un effort supplémentaire. Vous aurez besoin de 15 à 30 images de haute qualité et d'un peu plus de savoir-faire technique pour bien le réussir.
Comment dois-je découper un scénario en scènes pour la vidéo IA ?
Sujet : Alex, un jeune artiste d'environ 25 ans avec des cheveux ébouriffés et une salopette éclaboussée de peinture, est assis à un bureau en bois encombré dans un petit studio.
Action : Alex dessine avec intensité dans un grand carnet, s'arrêtant de temps à autre pour jeter un coup d'œil à une photo de référence épinglée au mur. Il mordille le bout d'un crayon, perdu dans ses pensées.
Environnement : La pièce est faiblement éclairée par une seule lampe de bureau, avec des étagères de fournitures artistiques et des toiles inachevées éparpillées çà et là. Une fenêtre en arrière-plan montre un paysage urbain animé au crépuscule.
Direction de caméra : La caméra commence par un gros plan de l'expression concentrée d'Alex, puis effectue lentement un zoom arrière pour révéler l'espace désordonné mais créatif.
Ton : L'ambiance est intime et réflexive, mettant en valeur le dévouement d'Alex et l'énergie tranquille de son espace de travail.
Audio : Un doux morceau de piano instrumental joue en arrière-plan, mêlé à de légers bruits de ville comme des klaxons lointains et des voix étouffées.
Scene 2
Sujet : Alex sort de son immeuble, portant désormais un sweat à capuche foncé et un jean, un carnet de croquis sous le bras.
Action : Il marche d'un pas vif sur un trottoir bondé, esquivant les piétons et levant occasionnellement les yeux vers les gratte-ciel imposants au-dessus de lui.
Environnement : La rue grouille d'activité - des enseignes au néon clignotent, des vendeurs de rue interpellent les passants et des voitures klaxonnent de frustration.
Direction de caméra : La caméra suit Alex de dos à distance moyenne, capturant son mouvement à travers la foule animée. Occasionnellement, elle coupe vers un plan en contre-plongée des immeubles imposants, soulignant l'échelle écrasante de la ville.
Ton : La scène semble vibrante et vivante, contrastant la solitude de la scène précédente avec le chaos de la ville.
Audio : Le paysage sonore est rempli de bruits urbains qui se chevauchent - pas, bavardages, voitures qui klaxonnent - créant une sensation d'urgence et d'énergie.
Scene 3
Sujet : Alex arrive dans un parc tranquille, trouvant un banc isolé près d'un petit étang. Il s'assoit, ouvre son carnet de croquis et commence à dessiner.
Action : Pendant qu'Alex dessine, il regarde de temps à autre l'eau sereine, où des canards glissent. Une légère brise ébouriffe ses cheveux.
Environnement : Le parc est paisible, avec de grands arbres projetant de longues ombres dans la lumière de fin d'après-midi. L'étang reflète les teintes dorées du soleil couchant.
Direction de caméra : La caméra commence par un plan large du parc, puis passe à un plan moyen d'Alex en train de dessiner. Elle s'attarde sur les détails de sa main se déplaçant sur la page, capturant la fluidité de son art.
Ton : L'atmosphère est calme et contemplative, offrant un moment de tranquillité en contraste avec le chaos précédent.
Audio : De doux bruits de feuilles bruissantes et d'oiseaux gazouillants accompagnent la scène, avec le faible ruissellement de l'eau d'une fontaine voisine.
Scene 4
Sujet : Un inconnu, un homme plus âgé en veste de tweed et chapeau, s'approche d'Alex et regarde son carnet de croquis avec curiosité.
Action : L'homme commente le dessin d'Alex, déclenchant une brève conversation. Alex sourit timidement, visiblement flatté par le compliment.
Environnement : Le décor reste le même, le parc baigné dans la lueur chaleureuse du coucher de soleil.
Direction de caméra : La caméra alterne entre des plans moyens d'Alex et de l'homme, capturant leurs expressions et leur langage corporel. Un gros plan met en valeur le sourire d'Alex tandis qu'il tourne le carnet pour montrer davantage de son travail.
Ton : L'interaction est chaleureuse et réconfortante, laissant entrevoir une connexion entre deux inconnus réunis par l'art.
Audio : Les sons ambiants du parc se poursuivent, avec le faible murmure de leur conversation qui se superpose.
Scene 5
Sujet : Alex rentre chez lui à la tombée de la nuit, la ville désormais illuminée par les lampadaires et les fenêtres éclairées.
Action : Il s'arrête à un stand de nourriture, achète un hot-dog et s'assoit sur un banc voisin pour manger. Entre deux bouchées, il feuillette son carnet de croquis, souriant devant ses progrès.
Environnement : La rue est plus calme maintenant, avec moins de monde et une ambiance plus fraîche et détendue. De la vapeur s'élève du stand de nourriture, et l'air semble vif.
Direction de caméra : La caméra capture Alex dans un plan moyen, encadré par la lumière chaleureuse du stand de nourriture. Un gros plan montre sa main tournant les pages du carnet de croquis, révélant des dessins détaillés.
Ton : L'ambiance est sereine et réflexive, clôturant le périple de la journée avec un sentiment d'accomplissement.
Audio : Un air de jazz doux joue en sourdine en arrière-plan, se mêlant au bourdonnement occasionnel des voitures qui passent et aux grésillements du stand de nourriture.
Articles de blog connexes
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.