
MAI-Thinking-1 : Guide des spécifications et données clés
Découvrez les spécifications de MAI-Thinking-1, ses données d'entraînement, son architecture MoE clairsemée, son contexte de 256K, ses résultats de benchmarks, l'accès en avant-première privée, la configuration de l'API et les usages en entreprise.
MAI-Thinking-1 est le modèle d'IA avancé de Microsoft conçu pour des tâches telles que les mathématiques, le codage et les applications d'entreprise. Il s'appuie sur une architecture clairsemée Mixture-of-Experts (MoE) dotée de 35 milliards de paramètres actifs et d'une immense fenêtre de contexte de 256 000 tokens (environ 600 pages). Entraîné sur 33,55 billions de tokens de données propres et sous licence, il garantit la sécurité et la fiabilité des données pour des secteurs comme la santé, la finance et le juridique.
Caractéristiques clés :
- Architecture : MoE clairsemée avec 35 milliards de paramètres actifs (~1 billion au total).
- Données d'entraînement : 33,55 billions de tokens, tous sous licence commerciale et générés par des humains.
- Fenêtre de contexte : 256 000 tokens pour gérer des flux de travail étendus.
- Performance : Scores parmi les meilleurs en mathématiques (97 % à l'AIME 2025) et sur les benchmarks de codage.
- Intégration multimodale : Fonctionne avec des outils comme MAI-Image-2.5 (images) et MAI-Voice-2 (clonage vocal).
- Accès API : Compatible OpenAI avec un appel de fonctions avancé.
Actuellement en avant-première privée, MAI-Thinking-1 est optimisé pour les tâches à l'échelle de l'entreprise, offrant de puissantes capacités de raisonnement tout en maintenant la conformité réglementaire. Son intégration avec d'autres outils MAI prend en charge des flux de travail complexes dans tous les secteurs.
MAI-Thinking-1 : la construction d'une machine d'escalade
Spécifications principales de MAI-Thinking-1
Le socle technique de MAI-Thinking-1 fournit les capacités nécessaires pour produire des sorties multimodales avancées, ce qui en fait un outil puissant pour la génération vidéo et les flux de travail d'API LLM unifiée.
Architecture du modèle et paramètres
MAI-Thinking-1 est conçu à partir d'une architecture clairsemée Mixture-of-Experts (MoE) combinée à une configuration de Transformer decoder-only. Sa configuration « LatentMoE » garantit que seuls les experts nécessaires sont activés - généralement 8 sur 512 par token - permettant un traitement efficace et évolutif[2][6]. Le modèle fonctionne avec 35 milliards de paramètres actifs et environ 1 billion de paramètres au total. Sa fenêtre de contexte s'étend sur 256 000 tokens, ce qui équivaut à environ 600 pages de contenu, permettant un traitement étendu des données au sein d'une seule session[6].
L'architecture intègre une attention de style Gemma-3, avec cinq couches locales par couche globale, une fenêtre glissante de 512 tokens et une Grouped-Query Attention (GQA) avec 8 têtes KV. Son tokenizer, o200k_base, prend en charge un vocabulaire d'environ 200 000 tokens, renforçant encore ses capacités de traitement.
MAI-Thinking-1 a été co-développé avec le silicium Maia 200 de Microsoft, offrant un gain de performance par watt de 1,4x par rapport aux configurations matérielles standard. L'entraînement a utilisé 8 000 GPU NVIDIA GB200, garantissant les performances robustes du modèle grâce à l'accès à des ressources de calcul de haute qualité[6].
Source d'entraînement et compatibilité des données
Le modèle a été entraîné sur un total de 33,55 billions de tokens de contenu propre, sous licence commerciale et généré par des humains. Cela comprend 30 billions de tokens lors de la phase principale de pré-entraînement et 3,55 billions supplémentaires lors du mid-training[6]. Le jeu de données englobe un large éventail de sources, telles que du texte web, du code GitHub accessible au public, des livres, des articles universitaires, des actualités, du contenu multilingue et des documents adaptés à des domaines spécifiques.
« MAI-Thinking-1 a été entraîné à partir de zéro à l'aide de 33,55 billions de tokens de données méticuleusement sourcées et sous licence commerciale, garantissant un pipeline d'entraînement entièrement auditable. »
Cette provenance transparente des données fait du modèle un choix fiable pour des secteurs comme la santé, la finance et le juridique, où la sécurité de la propriété intellectuelle et la conformité réglementaire sont essentielles[4].
Fonctionnalités d'API et d'intégration
MAI-Thinking-1 s'intègre de manière transparente à l'API Chat Completions, ce qui le rend compatible avec les flux de travail de style OpenAI. Il prend également en charge des fonctionnalités avancées comme l'appel de fonctions et les instructions développeur en couches, ce qui le rend parfaitement adapté aux tâches multimodales complexes, y compris la génération vidéo et les applications d'entreprise.
| Fonctionnalité | Spécification |
|---|---|
| Architecture | MoE clairsemée / Transformer decoder-only |
| Paramètres actifs | 35 milliards |
| Paramètres totaux | ~1 billion |
| Fenêtre de contexte | 256 000 tokens (~600 pages) |
| Données d'entraînement | 33,55 billions de tokens (propres, générés par des humains, sous licence) |
| Compatibilité API | Chat Completions API, appel de fonctions, instructions développeur |
| Tokenizer | o200k_base (~200k de vocabulaire) |
| Silicium principal | Microsoft Maia 200 |
Données clés de performance et de capacités

MAI-Thinking-1 fournit des résultats mesurables dans des domaines critiques comme les mathématiques, le codage et le raisonnement scientifique. Ces métriques reflètent ses performances sur des ensembles de problèmes standardisés qui correspondent aux besoins des entreprises.
Raisonnement et optimisation des flux de travail
Avec une fenêtre de contexte de 256 000 tokens, MAI-Thinking-1 peut gérer des flux de travail complexes en plusieurs étapes. Cela inclut des tâches comme l'analyse de longs contrats, le traitement de traces d'agents détaillées ou la révision de documents de recherche complexes - le tout en un seul passage. Son architecture clairsemée Mixture-of-Experts (MoE) garantit l'évolutivité sans augmentation proportionnelle de la demande de calcul, ce qui signifie des coûts plus faibles pour les tâches à fort volume.
Par exemple, en juin 2026, Microsoft a présenté un modèle MAI affiné pour des tâches Excel automatisées. Le modèle a atteint une parité de performance avec GPT-5.4 sur des benchmarks publics et privés [6].
« MAI-Thinking-1 est spécialement conçu pour les charges de travail que les entreprises exécutent à grande échelle... à un point de rapport prix-performance qui rend les charges de travail d'IA à fort volume et toujours actives économiquement viables. » - Naomi Moneypenny, Microsoft [3]
Ces capacités de raisonnement en font un candidat solide pour les tâches exigeant des performances avancées en code et en mathématiques.
Performance en code et en mathématiques
MAI-Thinking-1 a obtenu certains des scores de benchmarks les plus élevés de sa catégorie. Les résultats notables comprennent :
- 97,0 % à l'AIME 2025
- 94,5 % à l'AIME 2026
- 52,8 % à SWE-Bench Pro
- 73,5 % à SWE-Bench Verified
- 84,2 % à GPQA Diamond
- 87,7 % à LiveCodeBench v6 [6]
Ces scores reflètent la priorité accordée par Microsoft à l'entraînement du modèle dans des environnements déterministes, garantissant que ses performances sont à la fois fiables et pilotables. Une telle constance le rend idéal pour les applications d'entreprise exigeantes.
Caractéristiques de déploiement en entreprise
MAI-Thinking-1 est conçu avec l'évolutivité et la sécurité des données au cœur de sa conception. Construit exclusivement sur des données propriétaires de haute qualité, il garantit l'auditabilité et la protection de la propriété intellectuelle (PI) - particulièrement crucial pour les secteurs réglementés comme la santé, la finance et le juridique. En juin 2026, Microsoft s'est associé à la Mayo Clinic pour développer un modèle clinique spécialisé à l'aide du framework MAI, adapté au raisonnement clinique à enjeux élevés [6].
| Capacité | Spécification | Avantage pour l'entreprise |
|---|---|---|
| Paramètres actifs | 35 milliards (MoE) | Hautes performances à des coûts d'inférence réduits |
| Fenêtre de contexte | 256 000 tokens | Gère des documents de plus de 600 pages sans découpage |
| Score AIME 2025 | 97,0 % | Raisonnement mathématique exceptionnel |
| Score SWE-Bench Pro | 52,8 % | Génération de code fiable, de qualité production |
| Score GPQA Diamond | 84,2 % | Raisonnement scientifique et technique avancé |
| Standards de données | Propres, sous licence commerciale | Garantit la sécurité de la PI pour les secteurs sensibles |
| Personnalisation | Frontier Tuning / RLEs | Permet des checkpoints et des flux de travail détenus par l'utilisateur |
Ces performances robustes, associées à l'intégration multimodale, y compris des modèles multimodaux avancés, prennent en charge des applications comme la génération vidéo et l'optimisation des API.
Les entreprises peuvent personnaliser davantage MAI-Thinking-1 à l'aide d'environnements d'apprentissage par renforcement (RLEs). Microsoft a indiqué en juin 2026 que l'affinage du modèle aux besoins spécifiques de McKinsey a abouti à une meilleure qualité que GPT-5.5, tout en fonctionnant à un coût 10x inférieur [6].
Pipeline d'entraînement et exigences en matière de données
Vue d'ensemble du pipeline d'entraînement
MAI-Thinking-1 est conçu pour évoluer en continu, grâce à un pipeline soigneusement conçu où chaque élément - données, puissance de calcul et signaux de récompense - peut être affiné et optimisé au fil du temps [2][6].
« L'objectif est un système reproductible capable d'absorber de meilleures données, des récompenses plus fortes, des environnements plus performants et davantage de puissance de calcul. » - Microsoft AI [2]
Le processus commence par MAI-Base-1, créé grâce à une approche d'entraînement de tokens en plusieurs phases [6][7]. À partir de là, Microsoft développe trois modèles spécialisés en parallèle. Ceux-ci se concentrent sur :
- Les STEM et le codage de niveau compétition.
- Le codage agentique et l'utilisation d'outils.
- L'utilité et la sécurité.
Ces modèles sont ensuite fusionnés à l'aide d'un apprentissage supervisé. L'étape finale implique un apprentissage par renforcement (RL) pour affiner le modèle combiné, aboutissant à MAI-Thinking-1. L'ensemble du processus d'entraînement a été propulsé par 8 000 GPU NVIDIA GB200, fonctionnant sur un cluster Azure exploité par Microsoft [6].
Microsoft adopte une position unique sur le développement des modèles : l'intelligence se construit par l'apprentissage, elle ne s'hérite pas. Plutôt que de distiller des connaissances à partir de modèles tiers, MAI-Thinking-1 est entraîné à développer des capacités de raisonnement de manière indépendante [2][7].
« Les capacités devraient être apprises, et non héritées. Bien que plus rapide à acquérir, l'intelligence héritée manque de la pilotabilité essentielle à un usage réel. » - Microsoft AI [2]
Cette approche fondamentale garantit que le système est non seulement performant, mais aussi adaptable aux applications du monde réel, ouvrant la voie à une gouvernance et une intégration rigoureuses des données.
Standards de qualité et de gouvernance des données
Les données d'entraînement sont soigneusement sélectionnées et se composent exclusivement de contenu écrit par des humains et sous licence commerciale [2][6]. Cela garantit une lignée de données propre, ce qui est essentiel pour des secteurs comme la santé et la finance, où la conformité réglementaire repose sur des données traçables et auditables [2][5].
Pour maintenir l'intégrité, Microsoft évite d'utiliser les benchmarks d'apprentissage automatique standard pendant l'entraînement. Cela empêche le modèle de mémoriser les données de test, garantissant que les scores des benchmarks reflètent un véritable raisonnement plutôt qu'un apprentissage par cœur [6].
« Si nous ne pouvons pas rendre compte de ce qui a façonné un modèle, nous ne pouvons pas pleinement comprendre son comportement ni l'améliorer de manière crédible. » - Microsoft AI Superintelligence Team [2]
Intégration des données multimodales
Le processus d'entraînement va au-delà des données textuelles traditionnelles, en incorporant divers formats multimodaux pour renforcer sa pertinence dans des scénarios pratiques. Le corpus comprend du texte web, du code GitHub public, des livres, des articles universitaires, des articles d'actualité et du contenu multilingue [6]. Pour les tâches de codage et agentiques, Microsoft emploie des environnements déterministes et exécutables pour valider les données [2][6].
En plus du texte et du code, les modèles MAI intègrent des données audio et visuelles. Par exemple :
- MAI-Transcribe-1.5 utilise une reconnaissance d'entités avancée pour traiter avec précision le vocabulaire propre à un domaine.
- MAI-Voice-2 propose une préservation de l'identité pour une sortie vocale cohérente [3].
- MAI-Image-2.5 permet une édition image-à-image précise tout en maintenant la cohérence de la marque et des personnages [3].
Cette intégration multimodale équipe MAI-Thinking-1 pour un large éventail d'applications, de la génération de texte aux tâches visuelles et audio complexes, garantissant qu'il est suffisamment polyvalent pour les besoins du monde réel.
Exigences d'intégration de l'API dans APIMart

Cette section décrit les étapes pour s'intégrer à l'API d'APIMart afin d'accéder à MAI-Thinking-1, conçu pour les flux de travail multimodaux avancés.
Configuration de l'accès à l'API
Pour accéder à MAI-Thinking-1, vous utiliserez la passerelle compatible OpenAI d'APIMart. Commencez par configurer votre SDK OpenAI (Python ou Node.js) pour qu'il pointe vers le endpoint :
https://api.apimart.ai/v1
Remplacez votre clé API OpenAI par votre clé API APIMart. Assurez-vous de spécifier "mai-thinking-1" comme identifiant de modèle.
Pour l'authentification, utilisez un token Bearer dans l'en-tête de la requête :
Authorization: Bearer YOUR_API_KEY
Il est essentiel de stocker votre clé API en toute sécurité, soit dans une variable d'environnement, soit dans un gestionnaire de secrets. Notez que l'accès est actuellement limité à l'avant-première privée. L'accès en production peut être demandé via Microsoft Foundry [2][3].
Appel de fonctions et outils pour développeurs
MAI-Thinking-1 va au-delà des chat completions standard en proposant des outils d'exécution qui améliorent les fonctionnalités. Le processus d'intégration est simple :
- Le modèle traite votre entrée et identifie une demande d'appel d'outil.
- Votre client exécute l'appel d'outil et renvoie le résultat au modèle.
- Le modèle utilise le résultat pour générer une réponse finale [8].
Voici une présentation des outils pris en charge et de leurs cas d'usage :
| Type d'outil | Description | Exemple de cas d'usage |
|---|---|---|
| Appel de fonctions | Exécute des fonctions personnalisées via un schéma JSON | Déclencher des requêtes de base de données ou de la logique métier |
| Recherche web | Récupère des données en temps réel depuis Internet | Récupérer des cours boursiers ou de la documentation technique |
| Recherche de fichiers | Effectue des recherches dans les documents téléversés | Analyser des manuels internes ou des fichiers de conformité |
| MCP distant | Se connecte aux services Model Context Protocol | Accéder à des données protégées ou à des modèles propres à un domaine |
Ces outils permettent aux développeurs d'étendre les capacités du modèle pour un large éventail d'applications.
Prérequis opérationnels
Pour optimiser votre intégration avec MAI-Thinking-1, assurez-vous que les exigences opérationnelles suivantes sont remplies :
- Prise en charge d'une fenêtre de contexte de 256 000 tokens, qui nécessite une gestion efficace de la mémoire et de la latence pour traiter de grands jeux de données en contexte [2].
- Gestion appropriée des principaux codes d'erreur :
401: Échec d'authentification402: Solde insuffisant429: Limite de débit dépassée
Voici un résumé rapide des exigences techniques :
| Exigence | Détail |
|---|---|
| Identifiant de modèle | mai-thinking-1 |
| Méthode d'authentification | Token Bearer |
| Fenêtre de contexte | 256 000 tokens |
| Architecture | Mixture-of-Experts clairsemée (35 milliards actifs / 1 billion de paramètres au total) |
| Compatibilité API | OpenAI Chat Completions |
Contraintes de déploiement pratiques
Statut de déploiement actuel
À partir de juin 2026, MAI-Thinking-1 est disponible exclusivement via une avant-première privée sur Microsoft Foundry. L'accès nécessite la soumission d'une demande via le portail Foundry. Une avant-première publique plus large est attendue « prochainement » sur le MAI Playground, avec une disponibilité générale s'étendant progressivement à plusieurs régions Foundry dans le monde entier [1][2]. Ce déploiement par phases souligne l'importance du modèle dans la gestion de flux de travail d'IA multimodaux complexes.
Une limitation majeure à ce stade est l'absence de tarification par token divulguée. Cela complique la budgétisation précise de l'intégration par les équipes. Cependant, à titre indicatif, d'autres modèles de la série MAI sur Foundry sont tarifés à 5 $ par million de tokens d'entrée (MAI-Image-2.5) et à 0,36 $ par heure (MAI-Transcribe-1.5), offrant une idée générale de la structure tarifaire [3].
Compromis d'inférence et de performance
MAI-Thinking-1 emploie une architecture Mixture-of-Experts clairsemée, qui n'active que 35 milliards de ses ~1 billion de paramètres au total lors d'un passage d'inférence. Cette conception établit un équilibre entre la réduction des coûts de calcul et le maintien de capacités de raisonnement de haut niveau :
« MAI-Thinking-1 est spécialement conçu pour les charges de travail que les entreprises exécutent à grande échelle... à un point de rapport prix-performance qui rend les charges de travail d'IA à fort volume et toujours actives économiquement viables. » [3]
Cela dit, le modèle est limité aux tâches de texte et de raisonnement. Il ne prend pas en charge les tâches basées sur la vision ni la compréhension de documents multimodaux. Pour les flux de travail nécessitant une analyse d'images ou une analyse syntaxique de documents visuels, des modèles supplémentaires seront nécessaires. Ces limitations peuvent considérablement façonner les stratégies de déploiement, selon le secteur et les cas d'usage spécifiques.
Cas d'usage spécifiques à un secteur
Ces contraintes influencent directement la manière dont le modèle est appliqué dans les différents secteurs. Par exemple, la Mayo Clinic a collaboré avec Microsoft pour intégrer MAI-Thinking-1 dans les flux de travail cliniques et de recherche. Ce partenariat démontre comment les contrôles d'accès et les exigences de fiabilité jouent un rôle crucial dans les secteurs réglementés comme la santé [6][9].
Dans l'ensemble, MAI-Thinking-1 est le mieux adapté aux tâches de raisonnement à fort volume dans des domaines tels que l'analyse juridique, la modélisation financière, la recherche médicale et le développement de logiciels d'entreprise. Ces secteurs exigent des solutions d'intelligence évolutives et économiques, et l'architecture axée sur le texte du modèle, combinée à sa disponibilité contrôlée, s'aligne bien avec les besoins de conformité et opérationnels de ces secteurs.
Conclusion et points clés à retenir
MAI-Thinking-1 se distingue par son architecture puissante et son intégration fluide, ce qui en fait un choix de premier ordre pour les applications multimodales. Ses performances dans les tâches de raisonnement placent la barre haut, alliant efficacité et résultats impressionnants aux benchmarks. L'utilisation de données d'entraînement propres et sous licence commerciale, ainsi qu'une approche sans distillation, lui confèrent un avantage net, en particulier pour des secteurs comme la santé, le juridique et la finance, où la transparence et la lignée des données sont cruciales.
Les développeurs peuvent facilement accéder à MAI-Thinking-1 via APIMart, qui offre un endpoint unifié pour plus de 500 modèles d'IA, dont MAI-Image-2.5, Sora 2 et Kling V3. Cette configuration simplifie la création de pipelines multimodaux - par exemple, en utilisant MAI-Thinking-1 pour le raisonnement, MAI-Image-2.5 pour les tâches visuelles, et Sora 2 ou Kling V3 pour la sortie vidéo. Tout cela est soutenu par un SLA de disponibilité fiable de 99,9 %.
Pour optimiser les coûts et les performances, les entreprises peuvent mettre en œuvre un routage hiérarchisé en attribuant les tâches de raisonnement complexes à MAI-Thinking-1 tout en déléguant les tâches plus simples à des modèles plus légers. Une intégration précoce est recommandée, donnant aux entreprises le temps de tester, d'affiner et de faire évoluer leurs systèmes avant que la demande n'augmente. En adoptant MAI-Thinking-1, les organisations peuvent atteindre des performances techniques exceptionnelles tout en débloquant des gains d'efficacité opérationnelle dans divers secteurs.
FAQ
À quoi devrais-je utiliser la fenêtre de contexte de 256 000 tokens ?
La fenêtre de contexte de 256 000 tokens est parfaite pour gérer des tâches impliquant le traitement de grandes quantités de données. Par exemple, elle peut examiner des documents volumineux - jusqu'à 600 pages - ou gérer avec aisance des flux de travail de codage complexes. Cette capacité est particulièrement utile pour les opérations à l'échelle de l'entreprise, comme l'analyse de dépôts de code entiers pour repérer des erreurs, résoudre des bugs ou exécuter des instructions complexes et en couches.
Elle brille également dans les scénarios asynchrones à fort volume. Des tâches comme l'évaluation de la cohérence architecturale ou l'identification de motifs dans de vastes jeux de données deviennent beaucoup plus gérables, surtout lorsque des réponses immédiates ne sont pas nécessaires.
Comment obtenir l'accès si MAI-Thinking-1 est en avant-première privée ?
Pour essayer MAI-Thinking-1 pendant son avant-première privée, vous devrez soumettre une demande d'accès anticipé via le formulaire d'intérêt officiel sur Azure AI Foundry. Vous pouvez également tester le modèle sur des plateformes comme Baseten, Fireworks AI et Open Router. Recherchez les liens d'inscription dans la fiche du modèle ou le catalogue sur Azure AI Foundry. Les détails sur la disponibilité publique et la tarification seront communiqués après la phase d'avant-première.
Que dois-je modifier pour appeler MAI-Thinking-1 depuis mon SDK OpenAI ?
Pour utiliser MAI-Thinking-1 avec le SDK OpenAI, vous devrez ajuster à la fois la configuration de votre client et la structure de vos requêtes. Voici ce qu'il faut faire :
- Utilisez l'URL de base de l'API spécifique à MAI-Thinking-1.
- Définissez le paramètre de modèle sur
mai-thinking-1. - Incluez des prompts système conçus pour guider un raisonnement étape par étape.
- Ajustez le paramètre
extra_bodypour contrôler l'effort de raisonnement. Gardez à l'esprit que cela influencera à la fois le temps de calcul et les coûts associés.
Assurez-vous que votre intégration est équipée pour traiter correctement les sorties de type raisonnement afin d'obtenir les meilleurs résultats.
Articles de blog connexes
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.