

FLUX.2 Klein 9B Workflow: Lokales Setup in ComfyUI
FLUX.2 Klein 9B in ComfyUI: Modelldateien, VRAM-Bedarf, 4-Schritt-Settings, Text-to-Image und Bildbearbeitung, Fehlerbehebung und wann gehostetes FLUX.2 passt.
Kurz gesagt: Am schnellsten läuft FLUX.2 Klein 9B lokal in ComfyUI, und dafür brauchen Sie drei Dateien: das FP8-Diffusionsmodell von Black Forest Labs, den Text-Encoder Qwen3 8B und das FLUX.2-VAE. Nutzen Sie den destillierten Checkpoint mit 4 Schritten und CFG 1.0 für maximale Geschwindigkeit, oder den Base-Checkpoint mit 20 bis 50 Schritten und CFG um 4 bis 5, wenn Sie mehr Vielfalt wollen oder LoRAs trainieren möchten. Die 9B-Gewichte stehen unter der FLUX Non-Commercial License – prüfen Sie die Lizenzbedingungen, bevor Sie das Modell selbst in ein kostenpflichtiges Produkt einbauen.
Wenn Sie sich nicht um GPU, Treiber und Modelldateien kümmern wollen, decken die gehosteten FLUX.2-Modelle Pro, Flex und Max auf APIMart dieselben Aufgaben ab – Text-to-Image und Bearbeitung mit Referenzbildern – über eine einzige API. Klein selbst bietet APIMart nicht an: Dieser Leitfaden behandelt Klein auf Ihrem eigenen Rechner und zeigt, wann ein gehostetes FLUX.2-Modell die einfachere Wahl ist.
Das Wichtigste in Kürze
- Black Forest Labs hat FLUX.2 Klein am 15. Januar 2026 in den Größen 4B und 9B veröffentlicht, jeweils als destilliertes 4-Schritt-Modell und als nicht destilliertes Base-Modell (BFL-Ankündigung).
- Klein 9B kombiniert einen Flow-Transformer mit 9 Mrd. Parametern mit dem Text-Encoder Qwen3 8B und braucht laut Hugging-Face-Modellkarte in voller Präzision rund 29 GB VRAM.
- Das destillierte 9B-Modell läuft mit 4 Schritten und Guidance 1.0; das Beispiel der Base-9B-Karte nutzt 50 Schritte und Guidance 4.0, die ComfyUI-Vorlage für 9B Text-to-Image 20 Schritte und CFG 5.
- Beide 9B-Checkpoints stehen unter der FLUX Non-Commercial License, beide 4B-Checkpoints unter Apache 2.0.
- Laut BFL senken FP8-Gewichte den VRAM-Bedarf auf RTX-GPUs um bis zu 40 %, NVFP4 um bis zu 55 %.
- Ein einziges Klein-Modell beherrscht Text-to-Image, Bearbeitung mit einer Referenz und mit mehreren Referenzen; in ComfyUI ergänzt der Edit-Workflow denselben Graphen um
ReferenceLatent-Knoten.
FLUX.2 Klein im Überblick
| Klein 9B (destilliert) | Klein Base 9B | Klein 4B (destilliert) | Klein Base 4B | |
|---|---|---|---|---|
| Entwickler | Black Forest Labs | Black Forest Labs | Black Forest Labs | Black Forest Labs |
| Veröffentlichung | 15. Januar 2026 | 15. Januar 2026 | 15. Januar 2026 | 15. Januar 2026 |
| Sampling-Schritte | 4 | 20 bis 50 (nicht destilliert) | 4 | Mehr als 4 (nicht destilliert) |
| Guidance / CFG | 1.0 | 4.0 (Beispiel der Karte) | 1.0 | Nicht offiziell bestätigt |
| Text-Encoder | Qwen3 8B | Qwen3 8B | Qwen3 4B (ComfyUI-Datei) | Qwen3 4B (ComfyUI-Datei) |
| VRAM (volle Präzision) | Rund 29 GB | Rund 29 GB | Rund 13 GB | Rund 13 GB |
| Lizenz | FLUX Non-Commercial | FLUX Non-Commercial | Apache 2.0 | Apache 2.0 |
| Ideal für | Schnelle lokale Generierung und Bearbeitung | Fine-Tuning, LoRA, Forschung | Consumer-GPUs, Edge | Fine-Tuning auf kleineren GPUs |
| Aufgaben | Text-to-Image, Bearbeitung mit einer und mehreren Referenzen | Gleich | Gleich | Gleich |
Quellen: BFL-Ankündigung, Karte Klein 9B, Karte Klein Base 9B, Karte Klein 4B und das ComfyUI-Tutorial zu Klein.
Welche Klein-Variante sollten Sie herunterladen?
Destilliert oder Base
Die destillierten Checkpoints sind auf 4 Sampling-Schritte destilliert. Genau das macht Klein so schnell: Laut BFL erzeugt oder bearbeitet die Modellfamilie ein Bild auf aktueller Hardware in unter 0,5 Sekunden, und das ComfyUI-Team hat für das destillierte 4B-Modell auf einer RTX 5090 rund 1,2 Sekunden End-to-End gemessen.
Die Base-Checkpoints sind nicht destilliert. Sie brauchen deutlich mehr Schritte, liefern laut BFL aber eine größere Vielfalt und sind die richtige Wahl für Fine-Tuning und LoRA-Training. Die Karte von Base 9B beschreibt das Modell als ideal „für Fine-Tuning, LoRA-Training, Forschung und eigene Pipelines, bei denen Kontrolle wichtiger ist als Geschwindigkeit“.
4B oder 9B
9B ist das Flaggschiff der Klein-Reihe; BFL zufolge erreicht oder übertrifft es Modelle, die fünfmal so groß sind. 4B ist die zugängliche Option: Es passt in rund 13 GB VRAM, was BFL einer RTX 3090 oder 4070 und aufwärts zuordnet. Hat Ihre GPU weniger als 24 GB, beginnen Sie mit dem 4B-Workflow oder mit FP8-Gewichten für 9B und den Low-VRAM-Tipps weiter unten.
Lizenz: Was erlaubt ist und was nicht
Diesen Punkt übergehen die meisten Anleitungen für lokale Setups. Klein 4B und Base 4B stehen unter Apache 2.0, die kommerzielle Nutzung erlaubt. Klein 9B und Base 9B nutzen die FLUX Non-Commercial License. Danach dürfen das Modell und seine Ableitungen nur zu nicht kommerziellen Zwecken verwendet werden, und kommerzielle oder produktive Nutzung des Modells ist ausdrücklich ausgeschlossen. Dieselbe Lizenz hält fest, dass BFL keine Rechte an den Ausgaben beansprucht und Sie diese für jeden Zweck nutzen dürfen, auch kommerziell – außer wo die Lizenz es verbietet, etwa beim Training eines konkurrierenden Modells mit diesen Ausgaben.
In der Praxis heißt das: Experimente, Forschung und private Projekte mit 9B sind unproblematisch. Wer 9B in einem kostenpflichtigen Produkt oder einer Produktions-Pipeline betreibt, braucht eine kommerzielle Lizenz von BFL (bfl.ai/licensing) – oder wechselt zum Apache-lizenzierten 4B-Modell bzw. zu einem gehosteten FLUX.2-Modell. Dies ist keine Rechtsberatung; lesen Sie den Lizenztext selbst.
| Ihr Anwendungsfall | Empfohlene Option |
|---|---|
| Lernen, Forschung, private Kunst | Klein 9B oder Base 9B lokal |
| Kommerzielles Produkt, selbst gehostet | Klein 4B (Apache 2.0) oder eine kommerzielle BFL-Lizenz für 9B |
| Kommerzielles Produkt ohne eigene GPU | Gehostetes FLUX.2 Pro oder Flex per API |
| LoRA-Training | Klein Base 9B oder Base 4B |
Voraussetzungen: Hardware, Software und Zugang
GPU und Speicher
| Konfiguration | Was Sie erwarten können |
|---|---|
| 9B in BF16 | Rund 29 GB VRAM laut Modellkarte; RTX 4090 und höher mit Offloading |
| 9B in FP8 | Laut BFL bis zu 40 % weniger VRAM als BF16; genauer Wert für 9B nicht offiziell bestätigt |
| 9B in NVFP4 | Laut BFL bis zu 55 % weniger VRAM; erfordert eine aktuelle NVIDIA-RTX-GPU |
| 4B destilliert, FP8 in ComfyUI | 8,4 GB VRAM, von ComfyUI auf einer RTX 5090 gemessen |
| 4B Base, FP8 in ComfyUI | 9,2 GB VRAM, von ComfyUI auf einer RTX 5090 gemessen |
BFL gibt außerdem an, dass FP8 bis zu 1,6-mal und NVFP4 bis zu 2,7-mal schneller ist, gemessen auf RTX 5080 und 5090 bei 1024x1024.
ComfyUI-Version
Klein nutzt neuere FLUX.2-Knoten wie Flux2Scheduler und EmptyFlux2LatentImage. Laut ComfyUI-Dokumentation ist Ihre Installation veraltet, wenn die Klein-Vorlagen fehlen oder Knoten nicht laden; empfohlen wird dann der neueste (Nightly-)Build. Die Desktop-App kann dem Haupt-Release hinterherhinken – aktualisieren Sie also zuerst, bevor Sie anderswo nach Fehlern suchen.
Zugang zu Hugging Face
Die 9B-Repositories sind zugangsbeschränkt (gated). Melden Sie sich bei Hugging Face an, öffnen Sie das Klein-9B-FP8-Repository, akzeptieren Sie Lizenz und Acceptable Use Policy und erstellen Sie dann ein Lese-Token für Downloads über die Kommandozeile.
Schritt 1: Modelldateien herunterladen
Das ComfyUI-Tutorial nennt für den 9B-Workflow diese Dateien:
| Datei | Quelle | ComfyUI-Ordner |
|---|---|---|
flux-2-klein-9b-fp8.safetensors (destilliert) | black-forest-labs/FLUX.2-klein-9b-fp8 | models/diffusion_models/ |
flux-2-klein-base-9b-fp8.safetensors (Base) | black-forest-labs/FLUX.2-klein-base-9b-fp8 | models/diffusion_models/ |
qwen_3_8b_fp8mixed.safetensors | Comfy-Org/flux2-klein-9B | models/text_encoders/ |
flux2-vae.safetensors | Comfy-Org/flux2-dev | models/vae/ |
Für den Einstieg genügt ein Diffusionsmodell: die destillierte Datei für Tempo oder die Base-Datei, wenn Sie LoRAs trainieren wollen.
export HF_TOKEN=hf_xxx
curl -L -H "Authorization: Bearer $HF_TOKEN" \
-o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors
curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors
curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors
Die Ordnerstruktur sollte danach so aussehen:
ComfyUI/
└── models/
├── diffusion_models/
│ └── flux-2-klein-9b-fp8.safetensors
├── text_encoders/
│ └── qwen_3_8b_fp8mixed.safetensors
└── vae/
└── flux2-vae.safetensors
Mischen Sie keine Encoder unterschiedlicher Größen: Der 4B-Workflow nutzt qwen_3_4b.safetensors, der 9B-Workflow den Encoder Qwen3 8B.
Schritt 2: Den Text-to-Image-Workflow aufbauen
Am einfachsten starten Sie mit der eingebauten Vorlage. Öffnen Sie in ComfyUI den Vorlagen-Browser und laden Sie Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). Das Vorlagen-JSON liegt öffentlich im Repository Comfy-Org workflow_templates, sodass Sie es vor dem Start prüfen können.
Die Knoten im Graphen
| Knoten | Aufgabe | Wichtige Einstellung |
|---|---|---|
UNETLoader (Load Diffusion Model) | Lädt den Klein-Transformer | flux-2-klein-9b-fp8.safetensors |
CLIPLoader | Lädt den Qwen3-Encoder | type flux2 |
VAELoader | Lädt das FLUX.2-VAE | flux2-vae.safetensors |
CLIPTextEncode | Kodiert den positiven Prompt | Ihr Prompt |
EmptyFlux2LatentImage | Erzeugt das leere Latent | Breite und Höhe, z. B. 1024x1024 |
Flux2Scheduler | Erstellt den Sigma-Zeitplan | Schritte, Breite, Höhe |
CFGGuider | Wendet Guidance an | CFG-Wert |
KSamplerSelect | Wählt den Sampler | euler |
RandomNoise | Setzt den Seed | Fester Seed für Reproduzierbarkeit |
SamplerCustomAdvanced | Führt die Sampling-Schleife aus | Nur Eingänge |
VAEDecode, dann SaveImage | Dekodiert und speichert | Dateinamen-Präfix |
Die mitgelieferte 9B-Vorlage lädt den Base-Checkpoint mit 20 Schritten und CFG 5. Stellen Sie UNETLoader auf die destillierte Datei um, setzen Sie Flux2Scheduler auf 4 Schritte und CFGGuider auf 1.0 – so steht es in der Karte des destillierten Modells und in der destillierten Edit-Vorlage von ComfyUI. Base-Einstellungen auf dem destillierten Modell kosten nur Zeit und können das Bild „verbrennen“.
Bewährte Einstellungen
| Einstellung | 9B destilliert | Base 9B |
|---|---|---|
| Schritte | 4 | 20 (ComfyUI-Vorlage) bis 50 (Beispiel der Karte) |
| CFG / Guidance | 1.0 | 4.0 bis 5.0 |
| Sampler | euler | euler |
| Auflösung | Zum Start 1024x1024 | Zum Start 1024x1024 |
| Seed | Beim Prompt-Tuning fixieren | Beim Prompt-Tuning fixieren |
Halten Sie Breite und Höhe in Flux2Scheduler synchron mit der Latent-Größe. Die offiziellen Vorlagen speisen beide aus denselben Breiten- und Höhenwerten – übernehmen Sie dieses Muster in Ihrem eigenen Graphen oder beim Wechsel auf ein nicht quadratisches Format.
Ein Prompt zum Testen der Pipeline
Klein versteht natürliche Sprache gut. Schreiben Sie Prompts daher in ganzen Sätzen mit Motiv, Umgebung, Licht und dem Text, der im Bild erscheinen soll:
A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field
Kommt das erste Bild nach wenigen Sekunden und ist der Schildtext lesbar, funktioniert die Installation. Weitere Ideen zum Prompt-Aufbau, die für FLUX-Modelle allgemein gelten, finden Sie in unserem FLUX-3-Prompting-Guide.
Schritt 3: Den Workflow für Bildbearbeitung aufbauen
Klein nutzt für die Bearbeitung dasselbe Modell, Sie brauchen also keinen separaten Checkpoint im Stil von Kontext. ComfyUI liefert zwei 9B-Edit-Vorlagen: image_flux2_klein_image_edit_9b_distilled und image_flux2_klein_image_edit_9b_base.
Was sich im Edit-Graphen ändert
| Zusätzlicher Knoten | Funktion |
|---|---|
LoadImage | Lädt Ihr Ausgangs- oder Referenzbild |
ImageScaleToTotalPixels | Skaliert das Bild auf etwa 1 Megapixel |
GetImageSize | Gibt die skalierte Größe an Latent und Scheduler weiter |
VAEEncode | Wandelt das Referenzbild in ein Latent um |
ReferenceLatent | Hängt das Referenz-Latent an das Conditioning |
ConditioningZeroOut | Erzeugt das leere negative Conditioning |
Das Referenz-Latent wird sowohl an den positiven Prompt als auch an das genullte negative Conditioning gehängt; beide gehen in CFGGuider. Da GetImageSize EmptyFlux2LatentImage und Flux2Scheduler steuert, übernimmt das Ergebnis das Seitenverhältnis Ihres ersten Referenzbilds.
Bearbeitung mit einer Referenz
Laden Sie ein Bild und beschreiben Sie die Änderung, nicht die ganze Szene. Die destillierte Edit-Vorlage nutzt 4 Schritte und CFG 1 – das sind auch für eigene Bearbeitungen die richtigen Startwerte.
Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged
Bearbeitung mit mehreren Referenzen
Bei zwei oder mehr Bildern verkettet die Vorlage pro Bild einen ReferenceLatent-Knoten auf dem positiven und dem negativen Pfad. Verweisen Sie im Prompt über die Reihenfolge auf die Bilder:
Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1
Die BFL-Dokumentation nennt für Klein über die eigene API bis zu 4 Referenzbilder (FLUX.2-Überblick); im lokalen Graphen bedeutet jede weitere Referenz zudem mehr Speicherbedarf und längere Laufzeiten.
Fehlerbehebung und Optimierung für wenig VRAM
Häufige Fehler und Lösungen
| Symptom | Wahrscheinliche Ursache | Lösung |
|---|---|---|
| Vorlage fehlt oder rote „missing node“-Kästen | ComfyUI zu alt für FLUX.2-Knoten | ComfyUI aktualisieren, bei Bedarf auf Nightly |
| 401 oder 403 beim Download der 9B-Datei | Gated Repo, Lizenz nicht akzeptiert oder kein Token | Lizenz auf Hugging Face akzeptieren und Lese-Token mitgeben |
| Shape- oder Size-Mismatch beim Laden des Text-Encoders | 4B-Encoder mit 9B-Modell oder falscher CLIP-Typ | Encoder Qwen3 8B nutzen und in CLIPLoader den Typ flux2 wählen |
| CUDA out of memory | BF16-Gewichte oder zu hohe Auflösung | FP8-Gewichte nutzen, mit 1024x1024 beginnen, andere GPU-Apps schließen |
| Unscharfe oder verbrannte Bilder beim destillierten Modell | Base-Einstellungen (20+ Schritte, CFG 4 bis 5) | 4 Schritte und CFG 1.0 einstellen |
| Verrauschte, unfertige Bilder bei Base | Zu wenige Schritte | 20 bis 50 Schritte verwenden |
| Bearbeitung ignoriert die Referenz | ReferenceLatent nicht mit dem Conditioning verbunden | Auf positivem und negativem Pfad verbinden |
Checkliste für wenig VRAM
- Starten Sie mit den FP8-Checkpoints; BFL nennt bis zu 40 % weniger VRAM. NVFP4 spart auf unterstützten RTX-Karten noch mehr.
- Nutzen Sie den Text-Encoder
fp8mixedstatt einer Variante in voller Präzision. - Starten Sie ComfyUI mit
--lowvram, damit Modellteile in den Arbeitsspeicher ausgelagert werden, wenn die GPU voll ist. - Generieren Sie in 1024x1024 oder kleiner und skalieren Sie danach hoch, statt direkt in sehr großen Formaten zu samplen.
- Halten Sie die Batch-Größe bei 1 und reduzieren Sie die Zahl der Referenzbilder in Edit-Graphen.
- Passt 9B trotzdem nicht: Das destillierte 4B-Modell lief in der ComfyUI-Messung mit 8,4 GB.
python main.py --lowvram
Klein 9B alternativ mit Diffusers ausführen
Wenn Ihnen Python lieber ist als ein Knotengraph, enthält die Modellkarte ein Diffusers-Beispiel. Dafür brauchen Sie die Entwicklungsversion von Diffusers:
pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline
pipe = Flux2KleinPipeline.from_pretrained(
"black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload() # offloads idle parts to CPU to save VRAM
image = pipe(
prompt="A cat holding a sign that says hello world",
height=1024,
width=1024,
guidance_scale=1.0,
num_inference_steps=4,
generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")
Für Base 9B ändern Sie das Repository auf black-forest-labs/FLUX.2-klein-base-9B und nutzen guidance_scale=4.0 mit num_inference_steps=50, wie im Beispiel der zugehörigen Karte.
Wann gehostetes FLUX.2 Pro oder Flex die bessere Wahl ist
Lokales Klein eignet sich hervorragend für schnelle Iterationen, private Experimente und LoRA-Arbeit. Weniger praktisch ist es, wenn Sie kommerzielle Rechte am 9B-Modell, garantierte Verfügbarkeit oder mehr Kapazität als eine einzelne GPU benötigen.
Lokales Klein 9B vs. gehostetes FLUX.2
| Anforderung | Klein 9B lokal | Gehostetes FLUX.2 auf APIMart |
|---|---|---|
| Hardware | Eigene GPU, rund 29 GB in BF16 | Keine |
| Kommerzielle Nutzung des Modells | Kommerzielle BFL-Lizenz nötig | Geregelt durch die API-Bedingungen, nicht durch die Open-Weight-Lizenz |
| Einrichtung | ComfyUI, Modelldateien, Updates | Ein API-Schlüssel |
| Referenzbilder | BFL nennt bis zu 4 für Klein | Bis zu 8 pro Anfrage |
| Kontrolle über Schritte und Guidance | Vollständig | Nur Flex (steps 1 bis 50, guidance 1.5 bis 10) |
| Ausgabegröße | Grenze Ihrer GPU | Bis zu 4 MP |
| Eigene LoRAs | Ja, mit Base | Nein |
| Kostenmodell | Eigene Hardware und Strom | Pro Bild; aktuelle Preise auf der Modellseite |
Das passende gehostete Modell wählen
APIMart stellt am Endpoint /v1/images/generations drei FLUX.2-Modell-IDs bereit: flux-2-pro für ausgewogene Alltagsproduktion, flux-2-flex, wenn Sie Schritte und Guidance feinjustieren wollen (etwa für typografielastige Poster), und flux-2-max für höchste Qualität bei geringerer Geschwindigkeit. Der Preis hängt von der Auflösungsstufe und der Zahl der Referenzbilder ab; prüfen Sie vor der Budgetplanung die FLUX.2-Modellseite.
curl --request POST \
--url https://api.apimart.ai/v1/images/generations \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '{
"model": "flux-2-flex",
"prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
"resolution": "2K",
"size": "3:4",
"steps": 50,
"guidance": 6.5
}'
Der Aufruf ist asynchron und liefert data[0].task_id. Fragen Sie GET https://api.apimart.ai/v1/tasks/{task_id} ab, bis status den Wert completed hat, und lesen Sie dann die Bild-URL aus result.images. Für Bearbeitungen mit Referenzen übergeben Sie bis zu 8 öffentliche URLs in image_urls. Ein Produktionsmuster mit Retries und Speicherung beschreibt unser Leitfaden zu FLUX-Bild-Workflows für Entwickler; einen Vergleich von Tempo und VRAM mit einem weiteren schnellen offenen Modell lesen Sie in Z-Image Turbo vs Flux.
Ein praxistaugliches Hybridmodell
Viele Teams entwickeln Prompts und LoRAs mit lokalem Klein und schicken finale oder kundenrelevante Renderings an ein gehostetes FLUX.2-Modell. Prompts in schlichten, beschreibenden Sätzen lassen sich gut zwischen beiden übertragen, sodass Sie sie selten umschreiben müssen.
Häufige Fragen
Was ist der Unterschied zwischen FLUX.2 Klein 9B und Klein Base 9B?
Klein 9B ist auf 4 Schritte mit Guidance 1.0 destilliert und damit schnell genug für Generierung nahezu in Echtzeit. Klein Base 9B ist das nicht destillierte Grundmodell: Es braucht 20 bis 50 Schritte, bietet aber mehr Vielfalt und ist der empfohlene Ausgangspunkt für Fine-Tuning und LoRA-Training.
Darf ich FLUX.2 Klein 9B kommerziell nutzen?
Das Modell selbst nur mit separater Vereinbarung. Beide 9B-Checkpoints stehen unter der FLUX Non-Commercial License, die die Nutzung des Modells auf nicht kommerzielle Zwecke beschränkt; kommerzielle Lizenzen bietet BFL unter bfl.ai/licensing an. Laut Lizenz dürfen Ausgaben mit einigen Ausnahmen für jeden Zweck genutzt werden, auch kommerziell – lesen Sie den Text vollständig. Brauchen Sie eine selbst gehostete kommerzielle Option, steht Klein 4B unter Apache 2.0.
Wie viel VRAM braucht FLUX.2 Klein 9B?
Laut Modellkarte rund 29 GB in voller Präzision, also eine RTX 4090 oder besser mit CPU-Offloading. FP8-Gewichte senken den Speicherbedarf laut BFL um bis zu 40 %, NVFP4 um bis zu 55 %; ein genauer VRAM-Wert für 9B in FP8 ist nicht offiziell bestätigt. Auf Karten mit 16 GB oder weniger ist 4B die sicherere Wahl.
Welche Schritte und welchen CFG sollte ich in ComfyUI nutzen?
Für das destillierte 9B-Modell 4 Schritte und CFG 1.0 mit dem Sampler euler. Für Base 9B nutzt die ComfyUI-Vorlage 20 Schritte und CFG 5, das Hugging-Face-Beispiel 50 Schritte und Guidance 4.0. Beginnen Sie in beiden Fällen mit 1024x1024.
Braucht Klein ein eigenes Modell für die Bildbearbeitung?
Nein. Ein Klein-Checkpoint beherrscht Text-to-Image sowie Bearbeitung mit einer und mit mehreren Referenzen. In ComfyUI ergänzen Sie den Text-to-Image-Graphen um die Knoten LoadImage, VAEEncode und ReferenceLatent oder laden die offizielle Edit-Vorlage.
Ist FLUX.2 Klein auf APIMart verfügbar?
Nein. APIMart bietet die gehosteten Modelle FLUX.2 Pro, Flex und Max an, nicht Klein. Sie sind eine gute Alternative, wenn Sie lieber eine API aufrufen als eine Open-Weight-Lizenz zu verwalten, bis zu 8 Referenzbilder brauchen oder keine passende lokale GPU haben.
Ausblick
Klein entwickelt sich in der Community schnell weiter; auf der Hugging-Face-Seite sind bereits zahlreiche Adapter, Fine-Tunes und Quantisierungen gelistet. Behalten Sie Updates der ComfyUI-Vorlagen, neue quantisierte Gewichte und Lizenzänderungen bei BFL im Blick – all das kann ändern, was auf Ihre GPU passt und was Sie ausliefern dürfen. Wächst Ihre Last über eine Maschine hinaus oder brauchen Sie klare kommerzielle Bedingungen, testen Sie dieselben Prompts mit gehostetem FLUX.2 Pro oder Flex, bevor Sie skalieren.
Über das APIMart Team
Das APIMart Team schreibt Modell-Guides, Vergleiche und Preisanalysen für Entwickler, die mit KI bauen. APIMart bietet eine API für über 500 Chat-, Bild- und Videomodelle, sodass Sie die hier vorgestellten Modelle vor dem Launch direkt miteinander vergleichen können.
Wählen Sie Ihr gewünschtes Modell im Marktplatz
Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.