APIMart
APIMart

Intégration de Datasets Multimodaux Expliquée

Intégrer des datasets multimodaux : alignement texte, image, audio et vidéo, prétraitement par modalité, gouvernance des données et API unifiées pour l'IA.

Tutoriel

L'IA évolue pour traiter simultanément plusieurs types de données — texte, images, audio et vidéo. C'est ce qu'on appelle l'intégration de datasets multimodaux. Contrairement aux modèles mono-modaux qui traitent un seul type de données à la fois, les systèmes multimodaux combinent et alignent des formats variés pour mieux comprendre des scénarios complexes, comme un cas de support client impliquant des captures d'écran, des messages vocaux et des transcriptions de chat. Voici l'essentiel à retenir :

  • Datasets multimodaux : Combinent différents types de données (texte, images, audio) en groupes alignés, comme une légende, un son océanique, une photo de plage et une vidéo de marée décrivant tous la même scène.
  • Pourquoi c'est important : Les modèles entraînés sur des données multimodales surpassent les modèles mono-modaux, améliorant des tâches comme la réponse aux questions vidéo de plus de 20 %.
  • Défis : Gestion de formats de données variés, alignement sémantique entre modalités et traitement des datasets incomplets.
  • Solutions : Des techniques comme le data remixing, le masquage de modalité et les API unifiées simplifient l'intégration et améliorent les performances. Des outils comme APIMart facilitent l'accès aux modèles multimodaux.

En résumé : Les datasets multimodaux débloquent des capacités avancées d'IA en permettant un meilleur raisonnement inter-modal. Le succès repose sur un alignement de données de haute qualité, un prétraitement soigné et une gouvernance rigoureuse.

From Text to Video: A Unified Multimodal Data Lake for Next-Generation AI

Défis de l'intégration de datasets multimodaux

Intégrer des datasets multimodaux ne se résume pas à fusionner des fichiers provenant de sources diverses. Le vrai défi consiste à faire fonctionner ces sources hétérogènes ensemble de manière efficace. Trois obstacles récurrents se distinguent : la gestion de formats de données variés, la garantie de l'alignement inter-modal, et la prise en charge des modalités manquantes ou incomplètes.

Gestion de l'hétérogénéité des données

Saviez-vous que plus de 80 % des données d'entreprise existent dans des formats non structurés comme l'audio, les images et la vidéo ? Pourtant, moins de 1 % de ces données sont traitées ou analysées [9]. Cela illustre à quel point il est difficile de transformer ces données en quelque chose d'exploitable par les modèles.

Chaque type de données — ou modalité — présente ses propres complexités. Par exemple, les fichiers vidéo ont souvent des fréquences d'images incohérentes, les clips audio peuvent être corrompus ou encodés différemment, et les résolutions d'images peuvent varier considérablement. Même les données textuelles vont du propre au bruité. Pour donner du sens à ce chaos, les entrées brutes doivent être converties dans un format unifié à l'aide d'outils comme l'ASR pour l'audio, l'OCR pour les images, et les modèles de langage visuel (VLMs) pour la vidéo [9].

ModalitéStratégie de conversion principaleFormat de sortie
AudioReconnaissance automatique de la paroleTexte / Transcriptions
ImagesOCR / Modèles de langage visuelTexte / Descriptions
VidéoModèles de langage visuel (VLMs)Descriptions de scènes horodatées
ToutesModèles d'embedding vectorielVecteurs haute dimension

Garantir l'alignement inter-modal

Même après avoir converti les données dans des formats compatibles, aligner sémantiquement les informations entre les modalités représente un défi à part entière. Ce problème, connu sous le nom de fossé sémantique, survient parce que les caractéristiques de différentes modalités ne s'alignent pas naturellement.

« Le fossé sémantique entre les modalités reste insuffisamment traité. Lorsque ce fossé n'est pas correctement géré, il peut engendrer... des générations erronées, notamment des hallucinations. » - Shezheng Song et al., Survey on Multimodal Large Language Models [4]

Un autre problème est la paresse et le conflit de modalité. Lors de l'entraînement conjoint, les modèles privilégient souvent la modalité qui s'optimise le plus vite, laissant les autres modalités sous-entraînées. Les chercheurs Xiaoyu Ma, Hao Chen et Yongjian Deng expliquent :

« Les différentes modalités présentent des écarts considérables dans leurs trajectoires d'optimisation, en termes de vitesse et de chemin, ce qui entraîne une paresse et un conflit de modalité lors de l'entraînement conjoint de modèles multimodaux. » [3]

Pour y remédier, des techniques comme le « Data Remixing » ont été utilisées pour aligner les directions de gradient, augmentant la précision de 6,50 % sur le dataset CREMAD et de 3,41 % sur Kinetic-Sounds — sans coûts de calcul supplémentaires [3].

Gestion des modalités manquantes ou partielles

Dans des scénarios réels, les datasets sont rarement complets. Par exemple, un dataset peut inclure du texte et des images pour la plupart des échantillons mais manquer d'audio pour une partie significative. Si un modèle n'est pas conçu pour gérer cela, il peut échouer ou s'appuyer excessivement sur la modalité la plus forte.

Une solution est le masquage de modalité, où les modalités manquantes sont mises à zéro pendant l'entraînement, permettant au modèle d'apprendre à partir des données disponibles. Lorsque les modalités ont des dimensions d'embedding différentes, des couches de projection entraînables peuvent les mapper vers un espace vectoriel partagé, permettant la fusion même avec des données incomplètes [5][7]. Des architectures modernes comme Qwen2.5-Omni sont conçues pour ce type de flexibilité, gérant sans difficulté des combinaisons comme « texte + audio » ou « vidéo + texte » [6].

Construire un dataset multimodal robuste n'est pas une mince affaire. Par exemple, lorsqu'Encord a développé son dataset de 100 millions d'échantillons en octobre 2025, la validation des correspondances inter-modales automatisées a nécessité 976 863 évaluations humaines et plus de 6 000 heures de travail [1]. Cela démontre pourquoi l'automatisation seule ne suffit pas — la validation humaine reste une étape critique du processus.

Ces défis constituent le socle des bonnes pratiques présentées dans la section suivante.

Bonnes pratiques pour l'intégration de datasets multimodaux

APIMart
Multi-Modal Dataset Integration: Preprocessing by Modality

Collecte de données et conception de schéma

Avant de collecter des données, il est essentiel d'établir des normes de schéma uniformes. Cela inclut l'utilisation cohérente d'identifiants, d'horodatages et de conventions de nommage pour maintenir l'ordre et la compatibilité entre les datasets [10].

Une approche efficace consiste à adopter un format entrelacé avec des tokens spéciaux (par ex. <|__dj__eoc|>) et des espaces réservés spécifiques à chaque modalité (par ex. <__dj__image>). Ces marqueurs aident à organiser les chemins médias dans des champs dédiés [8]. En implémentant un mappage de champs — où des espaces réservés de template comme {image_uris} sont liés à des colonnes spécifiques du dataset — vous pouvez vous assurer que le schéma reste flexible et applicable à différents types de tâches sans nécessiter un reformatage constant [11].

L'intégration de métadonnées spécifiques à chaque modalité, comme image_widths pour les images ou audio_duration pour les fichiers audio, sert un double objectif. Cela facilite les contrôles de qualité et simplifie le prétraitement entre modalités. Les fichiers de configuration YAML sont particulièrement utiles pour définir ces paramètres, car ils permettent le contrôle de version et garantissent la reproductibilité de la logique de prétraitement [8][12]. Une mauvaise qualité des données dans les prompts multimodaux peut réduire la précision du modèle jusqu'à 8,2 % [12]. Les contrôles de qualité précoces représentent donc un investissement rentable.

Une fois un schéma uniforme en place, le prétraitement peut être adapté à chaque modalité tout en maintenant une cohérence globale.

Prétraitement par modalité

Chaque modalité exige des étapes de prétraitement spécifiques avant l'intégration. Voici un aperçu rapide :

ModalitéÉtapes de prétraitement principalesFormat de sortie courant
TexteNettoyage, lemmatisation, tokenisation (BPE/WordPiece)IDs de tokens et masques d'attention
ImageRedimensionnement (ex. 224×224), conversion RGB, normalisation des pixels (0–1)Tenseurs 3D (C, H, W)
AudioRééchantillonnage à 16 kHz, conversion mono, conversion en spectrogramme MelTenseurs de spectrogramme 2D
VidéoÉchantillonnage de frames (ex. 30 frames/clip), alignement temporel, redimensionnementTenseurs 4D (F, C, H, W)

Pour l'audio, standardisez à 16 kHz mono. Pour les images, normalisez les valeurs de pixels de la plage brute 0–255 en divisant par 255,0, les ramenant à la plage 0–1 que les réseaux de neurones peuvent traiter efficacement. Pour la vidéo, assurez-vous que les séquences de frames sont complétées ou tronquées à une longueur fixe, ce qui simplifie le traitement par lots. Le traitement des données manquantes avec des méthodes comme KNN a montré une amélioration de la précision du modèle de 72 % à 80 % dans les applications industrielles [12].

« Des données propres garantissent que le modèle travaille avec des informations fiables et cohérentes, aidant nos modèles à inférer à partir de données précises. » - Latitude Blog [12]

Ces étapes de prétraitement créent des sorties standardisées, préparant le terrain pour un alignement efficace entre les modalités.

Techniques d'alignement inter-modal

Les grands modèles de langage (LLMs) peuvent servir d'interface universelle pour relier les modalités. En exploitant des données appairées avec le langage — comme des combinaisons image-texte ou audio-texte — vous pouvez éviter de dépendre de rares échantillons appariés en plusieurs voies comme des triplets vidéo-audio-texte [2].

« Le langage peut agir comme une interface universelle pour un assistant polyvalent, où différentes tâches peuvent être explicitement représentées et traitées en langage. » - Zijia Zhao et al., Institute of Automation, Chinese Academy of Sciences [2]

Pour l'alignement temporel, l'entrelacement de tokens audio-visuels (AVTI) est une méthode utile. Elle combine les embeddings vidéo et audio en une seule séquence entrelacée tout en préservant leur ordre interne. Cela permet au LLM de traiter les deux modalités comme un contexte unifié sans perdre la synchronie temporelle [13]. Face aux désalignements géométriques entre les embeddings de modalités, la stratégie ReAlign peut aider. Cette méthode sans entraînement ajuste les statistiques de premier ordre et corrige la dérive du centroïde sans nécessiter d'entraînement supplémentaire [14]. Ensemble, ces techniques fournissent un workflow d'alignement évolutif adapté aux datasets de tailles variées.

Techniques et cas d'usage alimentés par les datasets multimodaux

Des données multimodales bien alignées et préparées ouvrent la voie à des techniques d'IA avancées et à des applications pratiques.

Embedding conjoint et apprentissage contrastif

Lorsque les datasets sont alignés et prétraités, ils permettent des techniques comme l'embedding conjoint, qui mappe du texte, des images, de l'audio et d'autres formats dans un espace vectoriel unifié. Dans cet espace, les contenus sémantiquement liés se regroupent, quel que soit leur format d'origine.

Une méthode clé ici est l'apprentissage contrastif, qui utilise la perte InfoNCE pour rapprocher les paires correspondantes tout en éloignant les paires non correspondantes. Cette approche bénéficie des négatifs en batch, générant O(N²) signaux d'entraînement par batch. Le modèle CLIP d'OpenAI tire pleinement parti de cela en utilisant des tailles de batch allant jusqu'à 32 768 paires, maximisant l'exposition aux « négatifs difficiles » — contenu similaire en contexte mais distinct en sens [15].

Cependant, un écart de modalité peut survenir, où les embeddings de différents formats se regroupent séparément. La technique GR-CLIP y remédie en soustrayant les embeddings moyens pour recentrer les clusters, améliorant significativement les performances de récupération (NDCG@10) jusqu'à 26 points de pourcentage par rapport au CLIP standard. Remarquablement, elle y parvient en utilisant 75× moins de calcul que les méthodes d'embedding génératif [16].

Ces stratégies d'embedding établissent les bases de connexions plus profondes entre les modalités.

Mécanismes d'attention inter-modal

L'attention inter-modale relie différentes modalités, comme les images et le texte, en associant des régions d'image à des mots spécifiques. Les architectures basées sur les transformers y parviennent en convertissant différents formats dans un espace sémantique partagé où les distances reflètent le sens de manière cohérente.

Le module Perceiver illustre cela en utilisant l'attention croisée pour condenser des embeddings de longueur variable provenant de plusieurs encodeurs en un ensemble fixe de tokens de requête. Cette approche réduit les coûts de calcul pour les grands modèles multimodaux. Pendant ce temps, les architectures décodeur uniquement comme Emu3 traitent toutes les modalités comme une séquence unique de tokens, excellant dans des tâches comme la génération d'images et la reconstruction vidéo. Par exemple, Emu3 atteint une reconstruction vidéo supérieure (rFVD : 27,893 vs. 139,930) tout en utilisant quatre fois moins de tokens que les tokeniseurs d'images autonomes [18]. L'instruction-tuning sur des datasets diversifiés a encore amélioré la précision sur des benchmarks de questions-réponses vidéo comme MSVDQA de 21,8 % [2].

Applications spécifiques à l'industrie

Ces techniques avancées entraînent des transformations dans divers secteurs.

Dans le domaine de la santé, la combinaison de données comme les radiographies, les notes de radiologues et les descriptions vocales des patients dans des datasets unifiés améliore la précision diagnostique. Les plateformes de télémédecine utilisent désormais ces données pour créer des résumés pré-consultation automatisés intégrant vidéo, audio et dossiers médicaux [17].

Dans le commerce électronique, les embeddings inter-modaux permettent des expériences d'achat innovantes. Par exemple, les acheteurs peuvent rechercher en utilisant une photo plutôt que du texte. L'image est encodée dans le même espace vectoriel que les descriptions de produits et les démos vidéo, permettant de récupérer les résultats via la similarité cosinus [15]. Des plateformes comme APIMart simplifient ce processus en offrant une API unique connectée à plus de 500 modèles couvrant image, vidéo et langage, rendant la recherche inter-modale et la génération de contenu accessibles.

Dans le domaine de l'éducation, la combinaison de cours vidéo avec des transcriptions auto-générées et des métadonnées structurées permet des systèmes de tutorat intelligent, des bibliothèques vidéo consultables et des recommandations de contenu personnalisées. Le domaine s'étend des systèmes bi-modaux (image + texte) à des configurations multimodales à cinq voies incluant l'audio et les nuages de points 3D. Un dataset de 100 millions d'échantillons construit à partir de 5-tuples permet déjà aux modèles d'« entendre » et de « voir » simultanément [1].

« Imaginez ce qui serait possible s'il existait un modèle, comme CLIP, capable d'assimiler plus que du texte et de la vision ? Et s'il pouvait aussi entendre l'audio et percevoir son environnement ? » - Frederik Hvilshøj, ML Lead, Encord [1]

Gouvernance et opérations pour les datasets multimodaux

La gestion de datasets multimodaux en production va bien au-delà de la simple intégration technique. Elle nécessite une gouvernance stricte pour garantir la reproductibilité et la conformité aux normes légales. Une fois vos modèles opérationnels, vous avez besoin de systèmes pour suivre l'utilisation des données, protéger les informations sensibles et maintenir l'auditabilité.

Versioning et traçabilité des datasets

À mesure que les datasets multimodaux deviennent plus complexes, le suivi de leur origine devient essentiel. Un défi majeur est la reproductibilité — savoir exactement quelles données ont été utilisées pour l'entraînement est critique pour le débogage.

Pour y remédier, utilisez des hachages SHA-256 pour chaque échantillon d'entraînement stocké dans un manifeste versionné. En suivant les dépendances au niveau de la modalité, vous pouvez limiter les mises à jour à des zones spécifiques. Par exemple, une modification du pipeline audio ne devrait pas nécessiter un retraitement de l'ensemble du dataset si l'étape de reconnaissance faciale ne dépend que des frames vidéo. Des outils comme Metaxy (mis à jour en mai 2026) supportent ce suivi ciblé des dépendances, réduisant les efforts de réentraînement inutiles [21].

Lier les instantanés de datasets aux exécutions d'entraînement de modèles est une autre pratique essentielle. Des outils comme Weights & Biases ou MLflow peuvent aider à établir le lien entre données et résultats. Comme l'explique Eren Hukumdar, co-fondateur d'Entrapeer :

« Chaque exécution d'entraînement de modèle est désormais liée à un identifiant d'instantané unique, donc nous savons toujours quelles données ont produit quels résultats. Le débogage qui prenait des semaines prend maintenant des heures car il n'y a aucune ambiguïté sur les versions du dataset. » - Eren Hukumdar, co-fondateur, Entrapeer [20]

Voici une comparaison rapide des pratiques de gouvernance selon la taille des équipes :

Niveau de gouvernanceIdéal pourOutils clésCompromis
LégerPetites équipes (<5 personnes, <100K échantillons)Manifestes CSV, SHA-256Scalabilité limitée, pas d'application [19]
MoyenÉquipes moyennes (5–30 personnes, 100K–10M échantillons)DVC, lakeFSEffort de configuration élevé, peut ralentir les processus [19][20]
EntrepriseGrandes équipes (30+ personnes, industries réglementées)Pistes d'audit immuables, RBACConfiguration complexe, déploiement en 6–12 semaines [19]

Confidentialité, sécurité et conformité

Les datasets multimodaux contiennent souvent des informations sensibles, comme des visages dans des vidéos, des voix dans des enregistrements audio, ou des données personnelles dans des documents. Une mauvaise gestion de ces données peut entraîner des problèmes juridiques et réglementaires, d'autant plus que les normes mondiales se durcissent.

Pour atténuer ces risques, mettez en place des contrôles en couches qui garantissent une collecte légale des données, confirment les droits d'utilisation appropriés, et maintiennent des preuves de conformité via des journaux de suppression et des événements signés [26]. Pour chaque travail d'ingestion de données, émettez un événement signé avec des identifiants sources et des sommes de contrôle. Si les données entrantes manquent d'une base juridique valide ou d'une entrée de manifeste, arrêtez immédiatement le pipeline pour éviter que des données non vérifiées n'entrent dans le pool d'entraînement [23][25].

Un audit de 44 datasets de fine-tuning majeurs a révélé que plus de 70 % manquaient de licences claires, et les erreurs dans la catégorisation des licences dépassaient 50 % [22]. Cela représente un risque sérieux de conformité, notamment avec des réglementations comme le Règlement européen sur l'IA (en vigueur depuis août 2024, avec application à partir d'août 2025), qui impose une gouvernance documentée pour les données d'entraînement dans les systèmes d'IA à usage général [22].

« Un dataset parfaitement formaté peut toujours être inutilisable si sa base juridique est invalide ou si sa provenance ne peut être démontrée. » - Daniel Mercer, Senior AI Governance Editor [23]

Pour les datasets multimodaux, les graphes de traçabilité sont particulièrement utiles. Une seule source vidéo peut générer des transcriptions, des frames individuelles et des embeddings — chacun traité comme un dérivé. Les graphes de traçabilité suivent ces relations, permettant la suppression efficace de tous les dérivés lorsqu'une ressource source est effacée [24].

Une fois les pratiques de gouvernance bien établies, l'attention se porte sur la fluidité des performances opérationnelles.

Exécuter des modèles multimodaux avec des API unifiées

Une bonne gouvernance soutient des workflows évolutifs et fiables. Les systèmes de production doivent gérer les limites de débit, la disponibilité des modèles et la gestion des coûts entre plusieurs modalités sans nécessiter d'intégrations séparées pour chacune.

Des plateformes comme APIMart simplifient ce processus en offrant une API unique connectée à plus de 500 modèles, couvrant le langage, l'image et la vidéo. Grâce à un système de crédits unifié, les équipes peuvent facilement prévoir les coûts et éviter de gérer des relations de facturation séparées avec plusieurs fournisseurs. Des modèles comme GPT-5, Claude, Sora et Kling V3 sont accessibles via le même endpoint, vous évitant de reconstruire votre pipeline multimodal chaque fois que vous changez ou ajoutez un modèle. Pour les équipes gérant des charges de production complexes, cette cohérence opérationnelle réduit la charge d'ingénierie et minimise le risque de problèmes d'intégration.

Conclusion

Intégrer des datasets multimodaux n'est pas une mince affaire, mais les récompenses valent bien l'effort. Plus de 40 % des entreprises les plus performantes utilisent désormais des systèmes multimodaux [17], rapportant des temps de résolution des tickets de support jusqu'à 35 % plus rapides [17]. Ces résultats établissent un solide point de référence pour les équipes cherchant à affiner leurs modèles avec des données multimodales réelles. Il est intéressant de noter qu'un dataset bien préparé peut même surpasser des modèles quatre fois plus grands en nombre brut de paramètres [1].

Le message est on ne peut plus clair : la qualité et l'alignement des données sont plus importants que la simple échelle. Comme le souligne Nature Machine Intelligence :

« Le goulot d'étranglement pour l'IA multimodale n'est pas la taille du modèle, mais la qualité et l'alignement des données sous-jacentes. » [17]

Atteindre cela nécessite une approche disciplinée : une conception de schéma réfléchie, un prétraitement adapté à chaque modalité, un alignement inter-modal efficace et une gouvernance stricte. Une première étape pratique ? Adoptez une stratégie de fusion intermédiaire — combinant les données de modalités à une couche intermédiaire. Cela maintient des pipelines modulaires, les rendant plus faciles à déboguer et à adapter selon les besoins [27].

De plus, le traitement parallèle asynchrone peut réduire significativement les temps d'attente d'ingestion de données de 40 %–60 %, tandis qu'une passerelle unifiée peut réduire les coûts d'API de 60 %–80 % grâce à des techniques comme la compression d'images et la mise en cache des caractéristiques [27]. Des outils comme APIMart simplifient ce processus en offrant une API unique supportant plus de 500 modèles — dont GPT-5, Sora, Claude et Kling V3 — permettant aux équipes de maintenir une interface cohérente sans remanier les pipelines à chaque mise à jour des modèles.

FAQ

Comment puis-je m'assurer que mes modalités sont alignées ?

Pour s'assurer que vos modalités fonctionnent ensemble efficacement, il est crucial qu'elles partagent un espace sémantique commun. En termes simples, cela signifie qu'elles doivent représenter les concepts de manière cohérente, quel que soit le format ou le support.

Voici comment maintenir l'alignement :

  • Contrôles de qualité structurés : Utilisez des processus comme les auto-évaluations des annotateurs, les revues par les pairs pour assurer la cohérence inter-modale, et les audits seniors pour une dernière couche de supervision.
  • Métriques quantitatives : Des outils comme l'Alignement Kernel Centré (CKA) peuvent mesurer les relations entre les ensembles de caractéristiques, vous aidant à évaluer la qualité de l'alignement de vos modalités.
  • Plateformes d'intégration : Des solutions comme APIMart peuvent gérer des entrées multimodales, facilitant l'intégration et le travail avec des types de données diverses dans vos projets.

En vous concentrant sur ces étapes, vous pouvez créer une expérience fluide et cohérente entre différentes modalités.

Que faire lorsqu'une modalité est manquante ?

Pour traiter efficacement les types de données manquants (modalités), il est crucial de construire un système capable de s'adapter et de maintenir ses fonctionnalités. Des stratégies comme la dégradation gracieuse ou le transfert de connaissances peuvent aider à assurer la fiabilité du système lorsque certaines entrées sont indisponibles.

Pendant l'entraînement, des techniques comme le dropout de modalité peuvent préparer le modèle à gérer des données incomplètes en simulant des entrées manquantes. Alternativement, un framework enseignant-étudiant peut être utilisé pour entraîner le système à gérer ces lacunes efficacement.

En production, vous pouvez mettre en place des mécanismes de secours comme l'interpolation ou le fenêtrage pour compléter les données manquantes ou ajuster les workflows dynamiquement. APIMart est équipé pour gérer des entrées multimodales, permettant de concevoir des workflows capables de gérer différents scénarios de données avec cohérence et fiabilité.

Quelle gouvernance est requise pour les données d'entraînement multimodales ?

Une gouvernance efficace des données d'entraînement multimodales exige une attention particulière à la provenance des données. Cela inclut la documentation de la manière dont les données ont été collectées, la confirmation du statut de consentement et l'identification de toute condition pouvant nécessiter leur suppression.

Les pratiques clés comprennent la garantie d'un alignement inter-modal, comme s'assurer que les images sont correctement appairées avec le texte ou l'audio correspondant. De plus, la gestion de la conformité des licences est cruciale pour éviter les complications juridiques.

Les organisations doivent prioriser l'assurance qualité et maintenir des pistes d'audit approfondies. Ces mesures aident à traiter des défis comme les demandes d'effacement RGPD, les litiges de droits d'auteur et les audits de sécurité. Ce faisant, elles peuvent maintenir la transparence et assurer la précision tout au long du cycle de vie complet du modèle.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace