APIMart
APIMart

Workflow FLUX.2 Klein 9B : installation locale

Lancer FLUX.2 Klein 9B dans ComfyUI : fichiers du modèle, VRAM, réglages en 4 étapes, génération et retouche, erreurs courantes et quand préférer FLUX.2 hébergé.

Tutoriel

En bref : le moyen le plus rapide de faire tourner FLUX.2 Klein 9B en local est ComfyUI avec trois fichiers : le modèle de diffusion FP8 de Black Forest Labs, l'encodeur de texte Qwen3 8B et le VAE de FLUX.2. Utilisez le checkpoint distillé à 4 étapes et CFG 1.0 pour la vitesse, ou le checkpoint Base à 20–50 étapes et un CFG autour de 4 à 5 si vous cherchez plus de variété ou comptez entraîner des LoRA. Les poids 9B sont publiés sous FLUX Non-Commercial License : vérifiez les conditions avant d'intégrer le modèle lui-même dans un produit payant.

Si vous ne voulez pas gérer un GPU, des pilotes et des fichiers de modèles, les modèles hébergés FLUX.2 Pro, Flex et Max sur APIMart couvrent les mêmes usages (texte vers image et retouche à partir de références) via une seule API. APIMart n'héberge pas Klein : ce guide porte sur l'exécution de Klein sur votre propre machine et indique dans quels cas un modèle FLUX.2 hébergé est plus simple.

Points clés

  • Black Forest Labs a publié FLUX.2 Klein le 15 janvier 2026 en tailles 4B et 9B, chacune déclinée en modèle distillé à 4 étapes et en modèle Base non distillé (annonce BFL).
  • Klein 9B associe un flow transformer de 9 milliards de paramètres à un encodeur de texte Qwen3 8B et demande environ 29 Go de VRAM en pleine précision, selon la fiche du modèle sur Hugging Face.
  • Le 9B distillé tourne à 4 étapes avec un guidance de 1.0 ; l'exemple de la fiche Base 9B utilise 50 étapes et un guidance de 4.0, et le template ComfyUI texte vers image 9B utilise 20 étapes et un CFG de 5.
  • Les deux checkpoints 9B sont sous FLUX Non-Commercial License, les deux checkpoints 4B sous Apache 2.0.
  • D'après BFL, les poids FP8 réduisent la VRAM jusqu'à 40 % et le NVFP4 jusqu'à 55 % sur les GPU RTX.
  • Un seul modèle Klein gère le texte vers image, la retouche à partir d'une référence et la retouche multi-références ; dans ComfyUI, le workflow de retouche ajoute des nœuds ReferenceLatent au même graphe.

FLUX.2 Klein en un coup d'œil

Klein 9B (distillé)Klein Base 9BKlein 4B (distillé)Klein Base 4B
DéveloppeurBlack Forest LabsBlack Forest LabsBlack Forest LabsBlack Forest Labs
Sortie15 janvier 202615 janvier 202615 janvier 202615 janvier 2026
Étapes d'échantillonnage420 à 50 (non distillé)4Plus de 4 (non distillé)
Guidance / CFG1.04.0 (exemple de la fiche)1.0Non confirmé officiellement
Encodeur de texteQwen3 8BQwen3 8BQwen3 4B (fichier ComfyUI)Qwen3 4B (fichier ComfyUI)
VRAM (pleine précision)Environ 29 GoEnviron 29 GoEnviron 13 GoEnviron 13 Go
LicenceFLUX Non-CommercialFLUX Non-CommercialApache 2.0Apache 2.0
Idéal pourGénération et retouche locales rapidesFine-tuning, LoRA, rechercheGPU grand public, edgeFine-tuning sur petits GPU
TâchesTexte vers image, retouche mono et multi-référencesIdemIdemIdem

Sources : annonce BFL, fiche Klein 9B, fiche Klein Base 9B, fiche Klein 4B et le tutoriel ComfyUI sur Klein.

Quelle variante de Klein télécharger ?

Distillé ou Base

Les checkpoints distillés sont ramenés à 4 étapes d'échantillonnage. C'est ce qui rend Klein si rapide : selon BFL, la famille génère ou retouche une image en moins de 0,5 seconde sur du matériel récent, et l'équipe ComfyUI a mesuré environ 1,2 seconde de bout en bout pour le 4B distillé sur une RTX 5090.

Les checkpoints Base ne sont pas distillés. Ils demandent beaucoup plus d'étapes, mais BFL leur attribue une plus grande diversité de résultats, et ce sont eux qu'il faut utiliser pour le fine-tuning et l'entraînement de LoRA. La fiche Base 9B le présente comme idéal « pour le fine-tuning, l'entraînement de LoRA, la recherche et les pipelines sur mesure où le contrôle compte plus que la vitesse ».

4B ou 9B

Le 9B est le modèle phare de Klein ; BFL affirme qu'il égale ou dépasse des modèles cinq fois plus gros. Le 4B est l'option accessible : il tient dans environ 13 Go de VRAM, ce qui correspond selon BFL à une RTX 3090 ou 4070 et au-delà. Si votre GPU a moins de 24 Go, commencez par le workflow 4B ou par les poids 9B en FP8 avec les conseils basse VRAM plus bas.

Licence : ce qui est permis ou non

C'est le point que la plupart des guides locaux oublient. Klein 4B et Base 4B sont sous Apache 2.0, qui autorise l'usage commercial. Klein 9B et Base 9B relèvent de la FLUX Non-Commercial License. Selon cette licence, le modèle et ses dérivés ne peuvent servir qu'à des fins non commerciales, et l'usage commercial ou en production du modèle est explicitement exclu. La même licence précise que BFL ne revendique aucun droit sur les sorties et que vous pouvez les utiliser à toute fin, y compris commerciale, sauf interdiction expresse, comme entraîner un modèle concurrent avec ces sorties.

En pratique : expérimentation, recherche et projets personnels sur le 9B ne posent pas de problème. Faire tourner le 9B dans un produit payant ou un pipeline de production exige une licence commerciale de BFL (bfl.ai/licensing) ; sinon, passez au 4B sous Apache ou à un modèle FLUX.2 hébergé. Ceci n'est pas un conseil juridique : lisez vous-même le texte de la licence.

Votre cas d'usageOption conseillée
Apprentissage, recherche, création personnelleKlein 9B ou Base 9B en local
Produit commercial auto-hébergéKlein 4B (Apache 2.0), ou licence commerciale BFL pour le 9B
Produit commercial sans GPU à gérerFLUX.2 Pro ou Flex hébergés via une API
Entraînement de LoRAKlein Base 9B ou Base 4B

Prérequis : matériel, logiciel et accès

GPU et mémoire

ConfigurationÀ quoi s'attendre
9B en BF16Environ 29 Go de VRAM selon la fiche ; RTX 4090 et plus avec déchargement
9B en FP8Jusqu'à 40 % de VRAM en moins qu'en BF16 selon BFL ; chiffre exact pour le 9B non confirmé officiellement
9B en NVFP4Jusqu'à 55 % de VRAM en moins selon BFL ; nécessite un GPU NVIDIA RTX récent
4B distillé, FP8 dans ComfyUI8,4 Go de VRAM mesurés par ComfyUI sur RTX 5090
4B Base, FP8 dans ComfyUI9,2 Go de VRAM mesurés par ComfyUI sur RTX 5090

BFL indique aussi que le FP8 est jusqu'à 1,6x plus rapide et le NVFP4 jusqu'à 2,7x plus rapide, mesures faites sur RTX 5080 et 5090 en 1024x1024.

Version de ComfyUI

Klein s'appuie sur de nouveaux nœuds FLUX.2 comme Flux2Scheduler et EmptyFlux2LatentImage. La documentation ComfyUI précise que si les templates Klein n'apparaissent pas ou si des nœuds ne se chargent pas, votre installation est obsolète, et recommande la dernière version (Nightly). L'application Desktop peut avoir du retard sur la version principale : mettez à jour avant tout autre dépannage.

Accès Hugging Face

Les dépôts 9B sont protégés (gated). Connectez-vous à Hugging Face, ouvrez le dépôt Klein 9B FP8, acceptez la licence et l'Acceptable Use Policy, puis créez un jeton en lecture pour les téléchargements en ligne de commande.

Étape 1 : télécharger les fichiers du modèle

Le tutoriel ComfyUI liste ces fichiers pour le workflow 9B :

FichierSourceDossier ComfyUI
flux-2-klein-9b-fp8.safetensors (distillé)black-forest-labs/FLUX.2-klein-9b-fp8models/diffusion_models/
flux-2-klein-base-9b-fp8.safetensors (Base)black-forest-labs/FLUX.2-klein-base-9b-fp8models/diffusion_models/
qwen_3_8b_fp8mixed.safetensorsComfy-Org/flux2-klein-9Bmodels/text_encoders/
flux2-vae.safetensorsComfy-Org/flux2-devmodels/vae/

Un seul modèle de diffusion suffit pour démarrer : le fichier distillé pour la vitesse, ou le fichier Base si vous prévoyez d'entraîner des LoRA.


export HF_TOKEN=hf_xxx

curl -L -H "Authorization: Bearer $HF_TOKEN" \
  -o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
  https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors

curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
  https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors

curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
  https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors

L'arborescence obtenue doit ressembler à ceci :

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── flux-2-klein-9b-fp8.safetensors
    ├── text_encoders/
    │   └── qwen_3_8b_fp8mixed.safetensors
    └── vae/
        └── flux2-vae.safetensors

Ne mélangez pas les encodeurs entre tailles : le workflow 4B utilise qwen_3_4b.safetensors, le workflow 9B l'encodeur Qwen3 8B.

Étape 2 : construire le workflow texte vers image

Le plus simple est de partir du template intégré. Dans ComfyUI, ouvrez le navigateur de templates et chargez Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). Le JSON du template est public dans le dépôt Comfy-Org workflow_templates : vous pouvez l'inspecter avant de le lancer.

Les nœuds du graphe

NœudRôleRéglage clé
UNETLoader (Load Diffusion Model)Charge le transformer Kleinflux-2-klein-9b-fp8.safetensors
CLIPLoaderCharge l'encodeur Qwen3type flux2
VAELoaderCharge le VAE de FLUX.2flux2-vae.safetensors
CLIPTextEncodeEncode le prompt positifVotre prompt
EmptyFlux2LatentImageCrée le latent videLargeur et hauteur, p. ex. 1024x1024
Flux2SchedulerConstruit le planning des sigmasÉtapes, largeur, hauteur
CFGGuiderApplique le guidanceValeur de CFG
KSamplerSelectChoisit le samplereuler
RandomNoiseFixe la graineGraine fixe pour la reproductibilité
SamplerCustomAdvancedLance la boucle d'échantillonnageEntrées uniquement
VAEDecode puis SaveImageDécode et enregistrePréfixe du nom de fichier

Le template 9B fourni charge le checkpoint Base avec 20 étapes et un CFG de 5. Si vous basculez UNETLoader sur le fichier distillé, passez Flux2Scheduler à 4 étapes et CFGGuider à 1.0, comme dans la fiche du modèle distillé et le template de retouche distillé de ComfyUI. Garder des réglages de Base sur le modèle distillé fait perdre du temps et peut « brûler » l'image.

Des réglages qui fonctionnent

Réglage9B distilléBase 9B
Étapes420 (template ComfyUI) à 50 (exemple de la fiche)
CFG / guidance1.04.0 à 5.0
Samplereulereuler
Résolution1024x1024 pour commencer1024x1024 pour commencer
GraineFixez-la pendant l'ajustement des promptsFixez-la pendant l'ajustement des prompts

Gardez la largeur et la hauteur de Flux2Scheduler alignées sur la taille du latent. Les templates officiels alimentent les deux à partir des mêmes valeurs ; reprenez ce schéma dans votre propre graphe ou si vous passez à un format non carré.

Un prompt pour tester le pipeline

Klein comprend bien le langage naturel : rédigez vos prompts en phrases complètes, avec sujet, décor, lumière et le texte à afficher :

A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field

Si la première image sort en quelques secondes et que le texte de l'enseigne est lisible, l'installation fonctionne. Pour d'autres idées de structure de prompt valables pour les modèles FLUX en général, consultez notre guide des prompts FLUX 3.

Étape 3 : construire le workflow de retouche

Klein utilise le même modèle pour la retouche : pas besoin d'un checkpoint séparé façon Kontext. ComfyUI propose deux templates de retouche 9B : image_flux2_klein_image_edit_9b_distilled et image_flux2_klein_image_edit_9b_base.

Ce qui change dans le graphe de retouche

Nœud ajoutéCe qu'il fait
LoadImageCharge l'image source ou de référence
ImageScaleToTotalPixelsRedimensionne l'image à environ 1 mégapixel
GetImageSizeTransmet la taille obtenue au latent et au scheduler
VAEEncodeTransforme l'image de référence en latent
ReferenceLatentAttache le latent de référence au conditionnement
ConditioningZeroOutCrée le conditionnement négatif vide

Le latent de référence est attaché à la fois au prompt positif et au conditionnement négatif mis à zéro, et les deux entrent dans CFGGuider. Comme GetImageSize pilote EmptyFlux2LatentImage et Flux2Scheduler, la sortie conserve le ratio de votre première image de référence.

Retouche avec une seule référence

Chargez une image et décrivez la modification, pas toute la scène. Le template de retouche distillé utilise 4 étapes et un CFG de 1 : ce sont aussi les bons réglages de départ pour vos propres retouches.

Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged

Retouche multi-références

Avec deux images ou plus, le template enchaîne un ReferenceLatent par image sur les branches positive et négative. Dans le prompt, désignez les images par leur ordre :

Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1

La documentation de BFL indique jusqu'à 4 images de référence pour Klein via son API (présentation de FLUX.2) ; en local, chaque référence supplémentaire consomme aussi plus de mémoire et ralentit le rendu.

Dépannage et optimisation pour faible VRAM

Erreurs courantes et solutions

SymptômeCause probableSolution
Template absent ou cadres rouges « missing node »ComfyUI trop ancien pour les nœuds FLUX.2Mettez à jour ComfyUI, en Nightly si besoin
401 ou 403 au téléchargement du fichier 9BDépôt protégé, licence non acceptée ou pas de jetonAcceptez la licence sur Hugging Face et fournissez un jeton en lecture
Erreur de shape ou de taille au chargement de l'encodeurEncodeur 4B utilisé avec le modèle 9B, ou mauvais type CLIPUtilisez l'encodeur Qwen3 8B et le type flux2 dans CLIPLoader
CUDA out of memoryPoids BF16 ou résolution trop élevéePassez en FP8, commencez à 1024x1024, fermez les autres applis GPU
Images floues ou brûlées avec le modèle distilléRéglages de Base (20+ étapes, CFG 4 à 5)Réglez 4 étapes et CFG 1.0
Images bruitées et inachevées avec BaseTrop peu d'étapesUtilisez 20 à 50 étapes
La retouche ignore la référenceReferenceLatent non relié au conditionnementReliez-le sur les branches positive et négative

Check-list faible VRAM

  • Commencez par les checkpoints FP8 : BFL annonce jusqu'à 40 % de VRAM en moins. Le NVFP4 va plus loin sur les RTX compatibles.
  • Prenez l'encodeur de texte fp8mixed plutôt qu'une version pleine précision.
  • Lancez ComfyUI avec --lowvram pour décharger des parties du modèle en RAM quand le GPU est plein.
  • Générez en 1024x1024 ou moins puis agrandissez, au lieu d'échantillonner en très grande taille.
  • Gardez un batch de 1 et limitez le nombre d'images de référence dans les graphes de retouche.
  • Si le 9B ne tient toujours pas, le 4B distillé a tourné avec 8,4 Go selon la mesure de ComfyUI.

python main.py --lowvram

Exécuter Klein 9B avec Diffusers

Si vous préférez Python à un graphe de nœuds, la fiche du modèle fournit un exemple Diffusers. Il nécessite la version de développement de Diffusers :

pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline

pipe = Flux2KleinPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()  # offloads idle parts to CPU to save VRAM

image = pipe(
    prompt="A cat holding a sign that says hello world",
    height=1024,
    width=1024,
    guidance_scale=1.0,
    num_inference_steps=4,
    generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")

Pour Base 9B, remplacez le dépôt par black-forest-labs/FLUX.2-klein-base-9B et utilisez guidance_scale=4.0 avec num_inference_steps=50, comme dans l'exemple de sa fiche.

Quand FLUX.2 Pro ou Flex hébergés sont un meilleur choix

Klein en local est excellent pour itérer vite, expérimenter en privé et travailler sur des LoRA. Il devient moins pratique quand il vous faut des droits commerciaux sur le modèle 9B, une disponibilité garantie ou plus de capacité qu'un seul GPU.

Klein 9B en local ou FLUX.2 hébergé

BesoinKlein 9B en localFLUX.2 hébergé sur APIMart
MatérielVotre GPU, environ 29 Go en BF16Aucun
Usage commercial du modèleLicence commerciale BFL nécessaireRégi par les conditions de l'API, pas par la licence des poids ouverts
Mise en placeComfyUI, fichiers de modèles, mises à jourUne clé API
Images de référenceBFL indique jusqu'à 4 pour KleinJusqu'à 8 par requête
Contrôle des étapes et du guidanceCompletFlex uniquement (steps de 1 à 50, guidance de 1.5 à 10)
Taille de sortieLimite de votre GPUJusqu'à 4 MP
LoRA personnalisésOui, avec BaseNon
Modèle de coûtVotre matériel et votre électricitéÀ l'image ; consultez la page du modèle pour les tarifs actuels

Choisir un modèle hébergé

APIMart expose trois identifiants FLUX.2 sur l'endpoint /v1/images/generations : flux-2-pro pour la production courante et équilibrée, flux-2-flex quand vous voulez régler les étapes et le guidance (par exemple pour des affiches riches en typographie), et flux-2-max pour la qualité maximale au prix d'une vitesse moindre. Le prix dépend du palier de résolution de sortie et du nombre d'images de référence ; consultez la page du modèle FLUX.2 avant d'établir votre budget.

curl --request POST \
  --url https://api.apimart.ai/v1/images/generations \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "flux-2-flex",
    "prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
    "resolution": "2K",
    "size": "3:4",
    "steps": 50,
    "guidance": 6.5
  }'

L'appel est asynchrone et renvoie data[0].task_id. Interrogez GET https://api.apimart.ai/v1/tasks/{task_id} jusqu'à ce que status vaille completed, puis lisez l'URL de l'image dans result.images. Pour retoucher avec des références, passez jusqu'à 8 URL publiques dans image_urls. Pour un schéma de production avec relances et stockage, voyez notre guide des workflows d'image FLUX pour développeurs, et pour une comparaison vitesse et VRAM avec un autre modèle ouvert rapide, lisez Z-Image Turbo vs Flux.

Une approche hybride pragmatique

Beaucoup d'équipes mettent au point prompts et LoRA sur Klein en local, puis envoient les rendus finaux ou destinés aux clients à un modèle FLUX.2 hébergé. Les prompts rédigés en phrases descriptives simples passent bien de l'un à l'autre, il est donc rarement nécessaire de les réécrire.

Questions fréquentes

Quelle différence entre FLUX.2 Klein 9B et Klein Base 9B ?

Klein 9B est distillé pour tourner en 4 étapes avec un guidance de 1.0, ce qui le rend assez rapide pour une génération quasi temps réel. Klein Base 9B est le modèle de fondation non distillé : il demande 20 à 50 étapes mais offre plus de diversité et constitue le point de départ recommandé pour le fine-tuning et l'entraînement de LoRA.

Peut-on utiliser FLUX.2 Klein 9B commercialement ?

Pas le modèle lui-même sans accord distinct. Les deux checkpoints 9B relèvent de la FLUX Non-Commercial License, qui limite l'usage du modèle à des fins non commerciales ; BFL propose des licences commerciales sur bfl.ai/licensing. La licence indique que les sorties peuvent être utilisées à toute fin, y compris commerciale, avec quelques exceptions : lisez-la en entier. Klein 4B est sous Apache 2.0 si vous avez besoin d'une option commerciale auto-hébergée.

Combien de VRAM faut-il pour FLUX.2 Klein 9B ?

La fiche du modèle indique environ 29 Go en pleine précision, soit une RTX 4090 ou mieux avec déchargement CPU. D'après BFL, les poids FP8 réduisent la mémoire jusqu'à 40 % et le NVFP4 jusqu'à 55 % ; aucun chiffre exact de VRAM pour le 9B en FP8 n'est confirmé officiellement. Sur une carte de 16 Go ou moins, le 4B est le choix le plus sûr.

Quelles étapes et quel CFG utiliser dans ComfyUI ?

Pour le 9B distillé, 4 étapes et CFG 1.0 avec le sampler euler. Pour Base 9B, le template ComfyUI utilise 20 étapes et CFG 5, et l'exemple Hugging Face 50 étapes et un guidance de 4.0. Dans les deux cas, commencez en 1024x1024.

Klein a-t-il besoin d'un modèle séparé pour la retouche ?

Non. Un seul checkpoint Klein gère le texte vers image, la retouche avec une référence et la retouche multi-références. Dans ComfyUI, ajoutez des nœuds LoadImage, VAEEncode et ReferenceLatent au graphe texte vers image, ou chargez le template de retouche officiel.

FLUX.2 Klein est-il disponible sur APIMart ?

Non. APIMart propose les modèles hébergés FLUX.2 Pro, Flex et Max, pas Klein. Ils sont une bonne alternative si vous préférez appeler une API plutôt que gérer une licence de poids ouverts, si vous avez besoin de jusqu'à 8 images de référence ou si vous n'avez pas de GPU local adapté.

À suivre

Klein évolue vite dans la communauté, avec déjà de nombreux adaptateurs, fine-tunes et quantifications listés sur sa page Hugging Face. Surveillez les mises à jour des templates ComfyUI, les nouveaux poids quantifiés et les évolutions de licence chez BFL : chacun peut changer ce qui tient sur votre GPU et ce que vous pouvez livrer. Si votre charge dépasse une seule machine ou exige des conditions commerciales claires, testez les mêmes prompts sur FLUX.2 Pro ou Flex hébergés avant de passer à l'échelle.

Tags#FLUX.2 Klein#FLUX.2#ComfyUI#local AI image generation#image editing#open-weight models

À propos de l'équipe APIMart

L'équipe APIMart rédige des guides de modèles, des comparatifs et des analyses de prix pour les développeurs qui construisent avec l'IA. APIMart propose une seule API pour plus de 500 modèles de chat, d'image et de vidéo : vous pouvez comparer les modèles présentés ici avant la mise en production.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace