APIMart
APIMart

Qwen 3.8 Preview : nouvelles fonctionnalités et accès API

Qwen 3.8 Preview unifie texte, image et vidéo avec jusqu'à 1M tokens de contexte. Nouveautés, limites de sortie et accès API compatible OpenAI sur APIMart.

Perspectives sur les modèles

Si je devais le résumer en une phrase : Qwen 3.8 Preview est un modèle de test pour les équipes qui ont besoin d'une seule API pour le texte, les images et la vidéo, avec jusqu'à 262,144 jetons natifs et jusqu'à 1,010,000 jetons grâce au RoPE scaling.

Si vous voulez la réponse courte, la voici :

  • Je l'envisagerais pour le travail multimodal : texte, image et vidéo dans un seul flux de requêtes

  • Je le testerais pour les tâches à entrée longue : grands ensembles de documents, longues conversations, bases de code et vidéos d'une heure

  • Je l'utiliserais via l'API compatible OpenAI d'APIMart

  • Je ne considérerais pas l'accès en preview comme un feu vert pour la production sans avoir d'abord testé la latence, la qualité des sorties et la stabilité en contexte long

Voici ce qui compte le plus :

  • Entrées : texte, images et vidéo

  • Sorties : texte, JSON, code, diagrammes, appels d'outils et synthèse vocale

  • Fenêtre de contexte : 262K natifs, jusqu'à 1.01M avec mise à l'échelle

  • Limites de sortie : jusqu'à 32,768 jetons pour le texte et 16,384 pour les tâches vision-langage

  • Point de terminaison API : https://api.apimart.ai/v1/chat/completions

  • Authentification : jeton Bearer

  • Format de requête : style OpenAI, avec des tableaux content multimodaux typés

  • Cas d'usage les plus adaptés : OCR, analyse de documents, UI-to-code, indexation vidéo et transferts vers l'automatisation

DomaineCe que je garderais à l'esprit
AccèsAPI unifiée APIMart avec des requêtes de style OpenAI
Statut du modèlePreview, donc les sorties et paramètres peuvent encore évoluer
Contexte longSuffisamment large pour des tâches lourdes de documents et de vidéo
Support multimodalUn seul modèle peut traiter des médias mixtes dans le même flux
Adéquation au workflowUtilisé au mieux comme étape d'analyse avant la génération ou l'automatisation en aval
Vérification avant productionTestez avec vos propres PDF, images, clips et niveaux de trafic

En d'autres termes : cela ressemble à une solide option pilote pour les charges de travail multimodales et à contexte long, mais je le validerais avec mes propres fichiers avant de m'y fier.

APIMart
Qwen 3.8 Preview : capacités, limites de contexte et spécifications API en un coup d'œil

Qwen 3.8 Preview : entrées multimodales, contexte long et capacités de sortie

Modes pris en charge : texte, image et vidéo

Les changements de cette preview se voient le mieux dans ce que Qwen 3.8 peut accepter et produire.

Qwen 3.8 Preview prend en charge le texte, l'image et la vidéo dans un seul modèle multimodal. Cela signifie que vous pouvez travailler avec des entrées mixtes dans le même prompt au lieu de basculer entre systèmes distincts. Il gère les prompts multi-images, l'analyse de documents par OCR dans 32 langues, et la compréhension vidéo image par image avec une indexation au niveau des horodatages pour une localisation précise des événements [4][5].

Côté sortie, il peut générer du HTML/CSS/JS ou des diagrammes Draw.io à partir d'images ou de vidéos, produire du JSON structuré et prendre en charge les appels d'outils [4][5]. Il prend également en charge la synthèse vocale native avec des voix personnalisables [4]. Pour l'automatisation, Visual Agent peut reconnaître les éléments d'interface PC et mobile et appeler des outils pour accomplir des tâches [5].

En clair, c'est le genre de configuration utile lorsqu'une équipe veut qu'un seul modèle lise un document, examine une capture d'écran, regarde un extrait vidéo, puis renvoie du code ou des données structurées sans changer d'outil en cours de route.

Fenêtre de contexte et limites de sortie : ce qu'elles signifient en pratique

La fenêtre de contexte native est de 262,144 jetons, extensible à 1,010,000 avec le RoPE scaling [3]. Les tâches textuelles peuvent produire jusqu'à 32,768 jetons ; les tâches vision-langage, jusqu'à 16,384 [1].

CapacitéSpécificationUsage pratique
Fenêtre de contexte native262K jetons [3]Analyse multi-documents, bases de code longues
Contexte étendu1M jetons [3]Documents très longs, grandes bases de code
Limite de sortie texte32,768 jetons [1]Conversation étendue, génération de contenu détaillé
Limite de sortie VL16,384 jetons [1]Codage visuel, analyse de documents

En pratique, ces limites comptent surtout lorsque vous traitez beaucoup de matière source à la fois. Une fenêtre de contexte plus large vous laisse plus de marge pour conserver de longs documents, de longues conversations ou de gros fichiers de code dans une seule requête. Et avec des limites de sortie plus élevées, le modèle dispose de plus d'espace pour renvoyer des réponses longues, du code ou des résultats analysés sans être coupé prématurément.

Pour les longs documents ou vidéos, conserver davantage de matière source dans une seule requête réduit le besoin de découper les entrées en plus petits morceaux. C'est souvent ce qui fait la différence entre un workflow fluide et un autre qui se transforme en corvée de copier-coller.

Ce qui est nouveau par rapport aux versions précédentes de Qwen

Le principal changement concerne la façon dont Qwen 3.8 entraîne et traite les données multimodales ensemble. Le plus grand changement dans la gamme Qwen 3 est l'entraînement par fusion précoce (early fusion), où les jetons multimodaux sont entraînés ensemble dès le départ plutôt que traités par des encodeurs séparés [3]. L'échelle du pré-entraînement a également augmenté, atteignant environ 36 000 milliards de jetons [2].

En clair, le modèle est conçu pour traiter les signaux texte, image et vidéo comme faisant partie du même système dès le départ. Cela compte si vous voulez qu'un seul modèle passe du chat au raisonnement puis aux tâches visuelles dans le même workflow, plutôt que d'assembler ces tâches entre différents modèles [3].

Comme la version est encore en preview, certains paramètres d'échantillonnage peuvent encore nécessiter des ajustements [3].

Qwen 3.8 Max (entièrement testé) : UN VÉRITABLE CONCURRENT OPEN FABLE !

Accès à l'API : disponibilité, authentification, points de terminaison, tarification et quotas

Une fois que vous savez ce que Qwen 3.8 Preview peut faire, l'étape suivante est simple : l'intégrer dans un flux API que vous pouvez utiliser.

Où Qwen 3.8 Preview est disponible

Qwen 3.8 Preview est disponible via l'API unifiée d'APIMart et un format de requête compatible OpenAI.

Configuration de l'authentification et du point de terminaison

Utilisez un jeton Bearer dans l'en-tête Authorization et envoyez les requêtes vers le point de terminaison de complétion de chat d'APIMart : https://api.apimart.ai/v1/chat/completions [6].

Pendant la phase de preview, il est plus judicieux de figer un snapshot de modèle spécifique plutôt que de s'appuyer sur un alias -latest. Pourquoi ? Parce qu'un alias mouvant peut changer sous vos pieds. Un identifiant versionné comme qwen3-vl-plus-2025-12-19 est un choix plus sûr qu'une cible changeante [6].

Pour les requêtes multimodales, le champ content devient un tableau d'objets typés. Le texte utilise {"type": "text", "text": "..."}, et l'entrée image utilise {"type": "image_url", "image_url": {"url": "..."}}. L'entrée image prend en charge les URL HTTPS et les URL de données base64. Vous pouvez aussi utiliser detail (auto, low ou high) pour équilibrer la qualité de sortie et le coût en jetons.

Ce format partagé compte plus qu'il n'y paraît au premier abord. Il vous permet de gérer les flux texte, image et vidéo avec la même structure de requête, sans avoir besoin de code de liaison supplémentaire juste pour changer de type d'entrée.

Une fois votre clé et votre point de terminaison configurés, l'étape suivante consiste à décider comment structurer les requêtes multimodales sans rendre le payload confus.

Tarification, quotas et comparaison des voies d'accès

Une fois l'accès en place, la prochaine chose à vérifier est le comportement des coûts et des quotas par rapport à votre volume de requêtes attendu.

La tarification est basée sur les jetons et varie selon le niveau de modèle. Consultez la page du modèle actuelle sur APIMart pour les tarifs en direct et les limites de quotas. Si vous envoyez beaucoup de requêtes, ajoutez un backoff exponentiel pour gérer la limitation de débit [6].

C'est cette structure d'API qui rend pratique l'association du raisonnement de Qwen 3.8 avec les workflows de génération propulsés par APIMart.

Utiliser Qwen 3.8 via APIMart pour les workflows multimodaux et d'automatisation

APIMart

Comment Qwen 3.8 s'intègre dans l'API unifiée d'APIMart

Une fois l'accès configuré, l'étape suivante consiste à déterminer où Qwen 3.8 s'intègre dans votre flux multimodal. Dans la plupart des cas, il fonctionne mieux comme couche d'analyse au sein d'un pipeline plus large. Cette configuration vous donne une sortie structurée que vous pouvez transmettre aux étapes de génération suivantes sans trop de friction.

Pointez le base_url de votre SDK vers https://api.apimart.ai/v1 et utilisez votre clé API APIMart. Votre code SDK existant peut rester tel quel, car la structure de la requête n'a pas besoin de changer.

Modèles de workflow : raisonner avec Qwen 3.8, puis créer avec les modèles APIMart

Le schéma central est simple : Qwen 3.8 fait la réflexion, et les modèles image ou vidéo d'APIMart produisent la sortie finale.

Cela fonctionne bien pour différentes équipes. Par exemple :

  • Les équipes média peuvent transformer une vidéo en plans de scène structurés, puis utiliser ces plans pour générer des clips.

  • Les équipes e-commerce peuvent examiner des images de produits, rédiger des descriptions, puis générer des visuels soignés.

Pour les tâches média plus importantes, ce même pipeline peut s'exécuter de manière asynchrone avec des rappels de statut. APIMart prend en charge la gestion des tâches asynchrones avec suivi de statut et notifications webhook, de sorte que votre pipeline ne reste pas bloqué à attendre des étapes de génération plus lentes.

Choix de conception d'intégration et tableau de correspondance des capacités

Le grand choix de conception ici est appel unique versus workflows enchaînés. Un appel unique convient bien aux tâches directes comme le sous-titrage d'images ou les questions-réponses sur documents. Les workflows enchaînés sont plus pertinents lorsque Qwen 3.8 doit transmettre sa sortie à un modèle de génération, surtout si vous voulez des transferts JSON propres entre les étapes.

Voici comment Qwen 3.8 correspond aux catégories de modèles APIMart pour l'étape suivante du workflow :

Capacité de Qwen 3.8Catégorie de modèle APIMartTypes d'entréeSortie typiqueRôle idéal dans le workflow
Raisonnement et planificationComplétion de chat (Qwen 3.8)Texte, image, vidéoJSON structuré, expansion de promptAnalyse, résumé, expansion de prompt
Analyse visuelleComplétion de chat (Qwen 3.8)Image, vidéoDescriptions, découpages de scènesE-commerce, revue média
Création vidéoCréation vidéo (Kling V3, Sora 2)Texte, imageMP4 720p/1080pPublicités sociales, clips explicatifs
Génération d'imagesCréation d'images (Qwen Image 2.0 Pro)Texte, image de référencePNG/JPG 2KRessources marketing, visuels produits
Transfert vers l'automatisationComplétion de chat (Qwen 3.8)Texte, imageJSON structuré, appels d'outilsAutomatisation, orchestration d'outils

Cas d'usage les plus adaptés et conclusions finales

Cas d'usage qui fonctionnent bien dès maintenant

Maintenant que les détails d'accès et les modèles de workflow sont vus, l'étape suivante est simple : où Qwen 3.8 Preview a-t-il du sens aujourd'hui ?

Un cas d'adéquation clair est le travail de connaissance à contexte long. Il peut traiter des livres ou des vidéos de plusieurs heures en un seul passage, ce qui réduit le découpage pour la revue juridique, la conformité et les revues d'entreprise.

Il performe également bien pour l'analyse de documents et l'OCR, en particulier avec les factures, les formulaires et les fichiers numérisés.

Côté développeur, il peut transformer des maquettes en code front-end avec moins d'allers-retours.

Et pour les opérations de contenu, son indexation vidéo au niveau des horodatages est utile pour les séquences de plusieurs heures et d'autres workflows sensibles à la vidéo.

Comment évaluer l'adéquation de l'API avant la mise en production

Avant de déployer quoi que ce soit, testez ces atouts avec vos propres fichiers, clips et objectifs de latence.

Commencez par la précision multimodale. Envoyez les images de produits, PDF numérisés et clips vidéo que vous prévoyez d'utiliser en production, puis comparez les sorties à vos critères d'acceptation.

Ensuite, vérifiez la latence dans les modes réflexion (thinking) et non-réflexion. Mesurez le temps de réponse et la qualité des sorties dans chaque mode en utilisant les paramètres adaptés à la tâche.

Vous devriez aussi tester la fiabilité en longueur de contexte avec vos documents ou vidéos les plus longs. Même si le modèle prend en charge des entrées très longues, les charges ultra-longues nécessitent tout de même une validation à vos tailles réelles [5].

Catégorie de cas d'usageModalité principaleModèle d'intégrationAvantage clé de Qwen 3.8
Opérations de contenuVidéoTâche asynchrone + WebhooksIndexation au niveau des horodatages pour des vidéos de plusieurs heures [5]
Assistance au développementImage/CodeCodage visuelGénère du code front-end directement à partir d'images d'UI [5]
Travail de connaissanceTexteRAG à contexte longContexte natif de 256K, extensible à 1M de jetons [5]
Automatisation/SaaSGUI/VisionVisual AgentOpère directement les interfaces PC/mobile [5]

Conclusion : points clés à retenir sur Qwen 3.8 Preview

Qwen 3.8 Preview a le plus de sens en tant que modèle pilote pour les workflows à contexte long, multimodaux et à forte composante vidéo. Comme il s'agit encore d'un modèle en preview, validez-le sur vos propres charges de travail avant de passer en production.

FAQ

En quoi Qwen 3.8 Preview diffère-t-il des modèles Qwen précédents ?

Qwen 3.8 Preview s'appuie sur la série Qwen 3 et inclut la réflexion hybride. Cela signifie qu'il peut basculer entre un raisonnement étape par étape pour les tâches difficiles et des réponses plus rapides pour les tâches plus simples.

Par rapport aux modèles précédents, il ajoute un scaling MoE plus fort, une gestion de contexte plus longue et une intégration multimodale plus profonde entre le texte, l'image et la vidéo.

Quand dois-je utiliser toute la fenêtre de contexte long ?

Utilisez toute la fenêtre de contexte long lorsque vous avez besoin d'une analyse approfondie sur de grandes quantités de données, comme des livres entiers, des heures de vidéo ou une compréhension de code à l'échelle d'un dépôt entier.

Le modèle prend en charge une fenêtre de contexte native de 256K, que vous pouvez étendre à 1M de jetons. Si vous rencontrez des erreurs de mémoire insuffisante, réduisez le contexte à 32,768 jetons. Pour la plupart des instructions standard, 65,536 jetons de sortie suffisent généralement.

Que dois-je tester avant de l'utiliser en production ?

Avant de déployer Qwen 3.8 en production, comparez-le à votre trafic réel à l'aide d'un jeu d'évaluation représentatif. Cela vous donne une image beaucoup plus claire du comportement du modèle une fois en production, plutôt que de vous fier à des prompts de test dans le meilleur des cas.

Vous voudrez aussi vérifier les dépenses attendues en jetons, images et tentatives (retries). Les coûts peuvent grimper rapidement lorsque les tentatives s'accumulent sur des requêtes chargées en images ou à contexte long, donc mieux vaut faire le calcul en amont.

Testez aussi votre point de terminaison unifié compatible OpenAI, en particulier pour la gestion du contexte et la gestion des limites de débit. Sur le papier, tout peut sembler correct. En pratique, c'est souvent l'état de session, la taille des prompts et la logique de reprise qui posent problème.

Utilisez un essai à blanc (dry run) pour valider la configuration avant d'y envoyer du trafic réel. C'est une étape simple, mais elle peut vous éviter de courir après des erreurs évitables plus tard.

Quelques habitudes de base comptent ici :

  • Faites tourner les clés API selon un calendrier régulier

  • Gardez les clés de dev et de staging séparées

  • Ne journalisez que le task_id

Ce dernier point est facile à négliger, mais il aide à réduire le risque d'exposer des données de prompt ou d'utilisateur dans les logs.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace