APIMart
Guide du modèle IA open source Inkling-Small

Guide du modèle IA open source Inkling-Small

Découvrez Inkling-Small, le MoE multimodal 276B de Thinking Machines avec 12B de paramètres actifs, un contexte de 1M tokens, des poids ouverts et un déploiement flexible.

Perspectives sur les modèles

Si vous recherchez un modèle ouvert capable de gérer de longues entrées sans atteindre le coût de nombreux systèmes de pointe, Inkling-Small mérite votre attention. Le 30 juillet 2026, Thinking Machines a publié un modèle MoE multimodal de 276-billion-parameter qui n’utilise que 12 billion de paramètres actifs par requête, avec une fenêtre de contexte de 1 million-token et une licence Apache 2.0.

Voici l’essentiel :

  • Il accepte des entrées texte, image et audio.
  • Il produit des résultats en texte, code et JSON.
  • Il permet de régler l’effort de réflexion de 0.2 à 0.99 pour équilibrer le coût et la profondeur du raisonnement.
  • Il peut être auto-hébergé pour profiter de la fenêtre de contexte complète de 1,000,000-token.
  • Tinker fournit un accès hébergé, avec une limite de contexte de 256,000-token.
  • Les poids ouverts sont téléchargeables sur Hugging Face.
  • Une version 4-bit NVFP4 est disponible sur les GPU NVIDIA.
  • Il peut être affiné sur des données privées et exécuté dans votre propre environnement.

Plusieurs chiffres se démarquent. Inkling-Small a obtenu 77.6% sur SWE-bench Verified, a égalé Nemotron 3 Ultra sur Terminal Bench 2.1 pour environ un tiers du coût en tokens, et a atteint 98.6% sur StrongREJECT. Malgré le mot Small dans son nom, ce modèle vise donc des tâches exigeantes de programmation, de traitement documentaire, d’assistance et d’agents.

Inkling-Small n’a rien de petit : test du modèle 276B

Comparaison rapide

DomaineInkling-SmallAccès Tinker
Type d’accèsPoids ouverts auto-hébergésAPI hébergée
LicenceApache 2.0Service géré
Contexte maximal1,000,000 tokens256,000 tokens
EntréesTexte, images, audioTexte, images, audio
SortiesTexte, code, JSONTexte, code, JSON
ContrôleContrôle total de l’infrastructure et du modèleMoins de configuration
AffinageOuiOui

Notre conclusion : cette version offre aux équipes américaines une option claire pour un déploiement moins coûteux, une configuration privée et des tâches multimodales à contexte long sans dépendre d’une API fermée.

Présentation d’Inkling-Small : architecture, taille et capacités

Inkling-Small est un transformer Mixture-of-Experts (MoE) à décodeur seul, avec 276 billion de paramètres au total et environ 12 billion de paramètres actifs par token. À titre de comparaison, le modèle phare possède 975 billion de paramètres au total et 41 billion de paramètres actifs par token [2][1][3]. Cet écart est important. Il explique pourquoi Inkling-Small peut sembler plus léger à utiliser tout en gérant des tâches exigeantes. Sa prise en charge des entrées multimodales et sa longue fenêtre de contexte l’illustrent particulièrement bien.

Entrées multimodales, sorties texte et contexte long

Inkling-Small accepte du texte, des images et de l’audio en entrée et renvoie des sorties texte, notamment du langage naturel, du code et du JSON [2][1]. Il a été préentraîné sur 45 trillion tokens de données multimodales couvrant le texte, l’image, l’audio et la vidéo [1][3].

Il prend aussi en charge une fenêtre de contexte allant jusqu’à 1 million tokens [1]. Cette capacité est déterminante pour les équipes qui travaillent sur de grandes bases de code, de longs documents ou des transcriptions étendues. Au lieu de découper le contenu en petits fragments en espérant ne rien perdre, elles peuvent transmettre au modèle une vue bien plus complète en une seule fois. Cela devient particulièrement utile lors du choix entre l’auto-hébergement, l’affinage ou l’utilisation du modèle par l’intermédiaire d’outils.

Performances de référence et sens réel de « Small »

Les résultats de référence permettent de remettre le nom Small en perspective.

Sur SWE-bench Verified, Inkling-Small a atteint 77.6%, devant les 71.9% de Nemotron 3 de Nvidia [2]. Sur Terminal Bench 2.1, il a égalé Nemotron 3 Ultra pour environ un tiers du coût en tokens [1][3]. Il a également obtenu 98.6% sur StrongREJECT, ce qui indique une gestion solide des refus [2].

En bref, Small ne signifie pas faible. En pratique, l’architecture MoE et le contexte long se révèlent dans des tâches importantes pour les équipes : revue de code, analyse documentaire et flux d’agents.

Accéder à Inkling-Small : poids, outils et options d’intégration

Comparaison entre l’auto-hébergement d’Inkling-Small et l’API gérée Tinker
Comparaison entre l’auto-hébergement d’Inkling-Small et l’API gérée Tinker

Poids ouverts, fiche du modèle et fichiers téléchargeables

Les poids d’Inkling-Small sont publiquement disponibles sur Hugging Face au sein de l’organisation thinkingmachines [2][6].

La version comprend les fichiers essentiels attendus par la plupart des équipes : poids, fiche du modèle, tokenizer, fichiers de configuration et encodeurs de modalités [4][2]. Vous ne partez donc pas de zéro et n’avez pas à tout assembler manuellement.

Pour un déploiement sur des GPU NVIDIA, une version quantifiée 4-bit appelée Inkling-Small-NVFP4 améliore aussi les performances dans cet environnement [4][5]. Si votre équipe souhaite tester le modèle avant de prendre en charge l’auto-hébergement, Tinker constitue le moyen le plus rapide de commencer.

Comparaison de l’auto-hébergement, des API hébergées et de l’affinage

Thinking Machines propose Tinker, une API de test et d’affinage qui permet aux développeurs d’essayer le modèle, de limiter la longueur des réponses, d’activer la recherche Web et d’effectuer un affinage de niveau entreprise [2][1].

Tinker prend aussi en charge dès le premier jour les intégrations avec les principaux outils d’inférence et de déploiement [6][1]. C’est important, car le modèle lui-même ne représente qu’une partie du travail. Il faut aussi pouvoir l’intégrer à une pile opérationnelle sans multiplier les étapes de configuration.

Le compromis est assez simple :

  • L’auto-hébergement offre un contrôle total et l’accès à la fenêtre de contexte de 1 million-token [6][1].
  • Tinker réduit le travail opérationnel, mais limite le contexte à 256,000 tokens [6][1].

Le choix oppose donc rapidité et contrôle. Pour un accès géré avec moins de travail d’infrastructure, Tinker est la solution la plus simple. Si vous avez besoin de la fenêtre de contexte complète et d’un contrôle plus précis du déploiement, l’auto-hébergement est préférable.

Place d’APIMart dans les flux multimodaux de production

Intégration des API multimodales APIMart

Après le choix d’un mode d’accès, il reste un aspect pratique de la production : faire circuler les requêtes multimodales dans un seul flux cohérent.

Pour les équipes qui doivent combiner analyse et génération dans un même processus, APIMart fournit une couche d’intégration unique pour les API multimodales.

Cas d’usage et déploiement économique pour les équipes américaines

Assistants de programmation, agents, outils d’assistance et analyse documentaire

Une fois l’accès clarifié, la question suivante est simple : dans quels domaines Inkling-Small est-il le plus performant ? Son architecture MoE réduit la charge d’inférence pour les tâches de production à haut volume [1].

Pour les équipes logicielles, il convient bien aux corrections de bogues à l’échelle d’un dépôt, aux revues de PR et aux agents de programmation en plusieurs étapes qui doivent parcourir de grandes bases de code [2].

La même configuration fonctionne aussi pour les tâches qui demandent une classification rapide et la lecture de longs contextes. Il peut s’agir de copilotes d’assistance qui trient les tickets, répondent aux questions de politique interne et transmettent les escalades au bon interlocuteur. À grande échelle, les petits gains de latence et de calcul s’additionnent rapidement.

Il convient également à l’analyse de documents volumineux, notamment les contrats, les politiques internes et les manuels techniques [1]. Si votre équipe traite quotidiennement des documents denses, c’est le type de charge où la lecture d’un contexte long devient vraiment utile.

Dans les plateformes éducatives, Inkling-Small peut assurer un tutorat en mathématiques et en logique avec un effort de réflexion réglable [2]. Les équipes peuvent ainsi adapter l’effort du modèle à la tâche au lieu de payer le même coût de calcul à chaque requête.

Les utilisations typiques comprennent :

  • Agents de programmation
  • Copilotes d’assistance
  • Analyse documentaire
  • Tutorat
  • Étiquetage multimodal

Coût, latence et planification budgétaire pour les équipes américaines

Le principal levier de coût est l’architecture MoE. Elle réduit le coût d’inférence et la latence pour les requêtes répétées [1].

Les développeurs peuvent également ajuster l’effort de réflexion dans le code, de 0.2 pour les tâches simples à 0.99 pour les raisonnements plus difficiles [2]. En clair, les équipes peuvent consacrer moins de calcul aux tâches simples et volumineuses, puis réserver davantage de temps de réflexion aux situations qui en ont réellement besoin.

Ce contrôle est important pour planifier les dépenses d’une équipe américaine. Un flux d’assistance qui traite chaque jour des milliers de demandes courantes n’a pas besoin du même réglage qu’un agent de programmation confronté à des cas limites complexes. Un modèle, plusieurs niveaux d’effort et une méthode plus claire pour gérer le budget.

Le modèle étant publié sous licence Apache 2.0, les équipes américaines peuvent aussi l’exécuter sur site ou dans des VPC lorsque le contrôle des données est prioritaire [2][1].

Ces options de déploiement introduisent les conclusions de recherche de la section suivante.

Conclusions de recherche et résumé final

Importance des poids ouverts pour les tests et la personnalisation

Après l’accès et le déploiement, l’enjeu principal pour la recherche réside dans ce que les poids ouverts permettent réellement aux équipes de faire.

Puisque les poids sont ouverts, les chercheurs peuvent examiner directement l’architecture et les contrôles de raisonnement. Ils peuvent aussi tester le modèle sur des données internes sans les envoyer à une API externe. Cette visibilité facilite également les tests de sécurité. Au lieu d’accepter les affirmations publiées telles quelles, les organisations peuvent vérifier les résultats sur leur propre infrastructure.

L’adaptation à un domaine constitue un autre avantage majeur. Les équipes spécialisées dans l’analyse financière ou le génie logiciel peuvent affiner le modèle sur leurs données propriétaires au lieu de dépendre d’un système généraliste [2]. Cette ouverture favorise aussi le déploiement local et l’adaptation à un domaine précis, afin que les équipes puissent mener des audits indépendants selon leurs propres conditions.

Points essentiels à retenir

Voici les points les plus importants :

  • Les poids ouverts permettent aux équipes de tester, d’affiner et de comparer le modèle sur leur propre infrastructure.
  • Les poids sont disponibles sur Hugging Face, tandis que Tinker permet de tester intensivement les réglages avant le passage en production [2][1].
  • Inkling-Small est conçu pour les déploiements contrôlés et sensibles aux coûts, avec des poids ouverts qui facilitent les tests, l’affinage et les évaluations indépendantes.

Pour les équipes qui ont besoin de contrôle, de personnalisation et de validation indépendante, cette configuration fait d’Inkling-Small une option pratique.

FAQ

Quel matériel faut-il pour auto-héberger Inkling-Small ?

Inkling-Small repose sur une architecture de 276-billion-parameter et utilise des points de contrôle quantifiés NVFP4 natifs pour les systèmes NVIDIA Blackwell.

Votre configuration doit aussi prendre en charge des bibliothèques d’inférence open source telles que SGLang, vLLM, TokenSpeed ou llama.cpp. Thinking Machines a utilisé des systèmes GB300 NVL72 pendant le développement, mais la variante Small est conçue comme une option plus économique et à plus faible latence pour le déploiement local.

Quand faut-il préférer l’auto-hébergement à Tinker ?

Choisissez l’auto-hébergement lorsque votre organisation a besoin d’un contrôle total sur ses charges de travail d’IA agentique. Cela peut impliquer l’exécution des modèles sur site ou dans un cloud privé virtuel, avec une équipe responsable de la configuration et des opérations quotidiennes.

C’est également un bon choix pour les équipes qui souhaitent gérer leur propre infrastructure, réduire les coûts récurrents en tokens ou répondre à des exigences précises de confidentialité des données.

Tinker est préférable si vous recherchez une configuration pratique et simple pour la recherche et l’affinage. L’auto-hébergement offre davantage de liberté pour adapter les performances et les coûts à votre propre matériel.

Comment l’effort de réflexion affecte-t-il le coût et la qualité des réponses ?

L’effort de réflexion contrôlable d’Inkling permet aux développeurs de régler facilement le budget de raisonnement du modèle de 0.2 à 0.99. Les valeurs élevées consacrent plus de calcul aux raisonnements complexes en plusieurs étapes. Les valeurs faibles réduisent l’utilisation de tokens et la latence pour les tâches simples.

Comme Inkling condense le raisonnement en chaîne de pensée, il peut souvent obtenir des résultats précis avec moins de tokens. Les utilisateurs contrôlent ainsi plus finement le coût et les performances selon les besoins de leur déploiement.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace