

Workflow do FLUX.2 Klein 9B: guia de instalação local
Rode o FLUX.2 Klein 9B no ComfyUI: arquivos, VRAM, ajustes de 4 passos, workflows de texto para imagem e edição, soluções de erros e quando usar o FLUX.2 hospedado.
Resposta curta: o jeito mais rápido de rodar o FLUX.2 Klein 9B localmente é o ComfyUI com três arquivos: o modelo de difusão FP8 da Black Forest Labs, o codificador de texto Qwen3 8B e o VAE do FLUX.2. Use o checkpoint destilado com 4 passos e CFG 1.0 para ter velocidade, ou o checkpoint Base com 20 a 50 passos e CFG entre 4 e 5 quando quiser mais variedade ou pretender treinar LoRAs. Os pesos 9B são distribuídos sob a FLUX Non-Commercial License, então confira os termos da licença antes de colocar o próprio modelo em um produto pago.
Se você não quer cuidar de GPU, drivers e arquivos de modelo, os modelos hospedados FLUX.2 Pro, Flex e Max na APIMart fazem as mesmas tarefas de texto para imagem e edição com referências por meio de uma única API. A APIMart não hospeda o Klein; este guia mostra como rodar o Klein na sua própria máquina e indica quando um modelo FLUX.2 hospedado é a opção mais simples.
Principais pontos
- O FLUX.2 Klein foi lançado pela Black Forest Labs em 15 de janeiro de 2026, nos tamanhos 4B e 9B, cada um como modelo destilado de 4 passos e como modelo Base não destilado (anúncio da BFL).
- O Klein 9B combina um flow transformer de 9B com um codificador de texto Qwen3 8B e precisa de cerca de 29GB de VRAM em precisão total, segundo o model card no Hugging Face.
- O 9B destilado roda com 4 passos e guidance 1.0; o exemplo do card do Base 9B usa 50 passos com guidance 4.0, e o template de texto para imagem 9B do ComfyUI usa 20 passos com CFG 5.
- Os dois checkpoints 9B usam a FLUX Non-Commercial License, enquanto os dois checkpoints 4B são Apache 2.0.
- Pesos FP8 reduzem o uso de VRAM em até 40% e NVFP4 em até 55%, segundo os números da BFL para GPUs RTX.
- Um único modelo Klein faz texto para imagem, edição com uma referência e edição com várias referências; no ComfyUI, o workflow de edição apenas adiciona nós
ReferenceLatentao mesmo grafo.
FLUX.2 Klein em resumo
| Klein 9B (destilado) | Klein Base 9B | Klein 4B (destilado) | Klein Base 4B | |
|---|---|---|---|---|
| Desenvolvedor | Black Forest Labs | Black Forest Labs | Black Forest Labs | Black Forest Labs |
| Lançamento | 15 de janeiro de 2026 | 15 de janeiro de 2026 | 15 de janeiro de 2026 | 15 de janeiro de 2026 |
| Passos de amostragem | 4 | 20 a 50 (não destilado) | 4 | Mais de 4 (não destilado) |
| Guidance / CFG | 1.0 | 4.0 (exemplo do card) | 1.0 | Não confirmado oficialmente |
| Codificador de texto | Qwen3 8B | Qwen3 8B | Qwen3 4B (arquivo do ComfyUI) | Qwen3 4B (arquivo do ComfyUI) |
| VRAM (precisão total) | Cerca de 29GB | Cerca de 29GB | Cerca de 13GB | Cerca de 13GB |
| Licença | FLUX Non-Commercial | FLUX Non-Commercial | Apache 2.0 | Apache 2.0 |
| Ideal para | Geração e edição local rápidas | Fine-tuning, LoRA, pesquisa | GPUs de consumo, edge | Fine-tuning em GPUs menores |
| Tarefas | Texto para imagem, edição com uma ou várias referências | Igual | Igual | Igual |
Fontes: anúncio da BFL, card do Klein 9B, card do Klein Base 9B, card do Klein 4B e o tutorial do Klein no ComfyUI.
Qual variante do Klein baixar?
Destilado vs Base
Os checkpoints destilados foram destilados para 4 passos de amostragem. É isso que deixa o Klein rápido: a BFL afirma que a família gera ou edita imagens em menos de 0,5 segundo em hardware moderno, e a equipe do ComfyUI mediu cerca de 1,2 segundo de ponta a ponta para o 4B destilado em uma RTX 5090.
Os checkpoints Base não são destilados. Precisam de muito mais passos, mas a BFL descreve que eles têm maior diversidade de saída, e são os indicados para fine-tuning e treinamento de LoRA. O model card do Base 9B o define como "ideal for fine-tuning, LoRA training, research, and custom pipelines where control matters more than speed."
4B vs 9B
O 9B é o modelo Klein principal da BFL; segundo a empresa, ele iguala ou supera modelos cinco vezes maiores. O 4B é a opção mais acessível: cabe em cerca de 13GB de VRAM, o que a BFL associa a uma RTX 3090 ou 4070 ou superior. Se sua GPU tem menos de 24GB, comece pelo workflow 4B ou pelos pesos 9B em FP8 junto com as dicas de pouca VRAM abaixo.
Licença: o que pode e o que não pode
Esta é a parte que a maioria dos guias locais ignora. O Klein 4B e o Base 4B são Apache 2.0, que permite uso comercial. O Klein 9B e o Base 9B usam a FLUX Non-Commercial License. Por essa licença, o modelo e seus derivados só podem ser usados para fins não comerciais, e a licença exclui explicitamente o uso do modelo para fins comerciais ou de produção. A mesma licença diz que a BFL não reivindica a propriedade das saídas e que você pode usar as saídas para qualquer finalidade, inclusive comercial, exceto onde a licença proíbe, como usar as saídas para treinar um modelo concorrente.
Na prática: experimentos, pesquisa e projetos pessoais com o 9B estão liberados. Rodar o 9B dentro de um produto pago ou de um pipeline de produção exige uma licença comercial da BFL (bfl.ai/licensing), ou você pode migrar para o 4B com licença Apache ou para um modelo FLUX.2 hospedado. Isto não é aconselhamento jurídico, então leia o texto da licença.
| Seu caso de uso | Opção sugerida |
|---|---|
| Estudo, pesquisa, arte pessoal | Klein 9B ou Base 9B localmente |
| Produto comercial, auto-hospedado | Klein 4B (Apache 2.0), ou licença comercial da BFL para o 9B |
| Produto comercial, sem GPU para gerenciar | FLUX.2 Pro ou Flex hospedado via API |
| Treinamento de LoRA | Klein Base 9B ou Base 4B |
Pré-requisitos: hardware, software e acesso
GPU e memória
| Configuração | O que esperar |
|---|---|
| 9B em BF16 | Cerca de 29GB de VRAM segundo o model card; RTX 4090 ou superior com offloading |
| 9B em FP8 | Até 40% menos VRAM que BF16 segundo a BFL; número exato para o 9B não confirmado oficialmente |
| 9B em NVFP4 | Até 55% menos VRAM segundo a BFL; requer GPU NVIDIA RTX recente |
| 4B destilado, FP8 no ComfyUI | 8,4GB de VRAM medidos pelo ComfyUI em uma RTX 5090 |
| 4B Base, FP8 no ComfyUI | 9,2GB de VRAM medidos pelo ComfyUI em uma RTX 5090 |
A BFL também informa que o FP8 é até 1,6x mais rápido e o NVFP4 até 2,7x mais rápido, em testes com RTX 5080 e 5090 a 1024x1024.
Versão do ComfyUI
O Klein usa nós mais recentes do FLUX.2, como Flux2Scheduler e EmptyFlux2LatentImage. A documentação do ComfyUI diz que, se os templates do Klein não aparecem ou os nós não carregam, sua instalação está desatualizada, e recomenda a versão mais recente (Nightly). O app Desktop pode ficar atrás da versão principal, então atualize antes de investigar qualquer outra coisa.
Acesso ao Hugging Face
Os repositórios 9B são restritos (gated). Entre no Hugging Face, abra o repositório Klein 9B FP8, aceite a licença e a Acceptable Use Policy e crie um token de leitura para baixar pela linha de comando.
Passo 1: baixe os arquivos do modelo
O tutorial do ComfyUI lista estes arquivos para o workflow 9B:
| Arquivo | Origem | Pasta do ComfyUI |
|---|---|---|
flux-2-klein-9b-fp8.safetensors (destilado) | black-forest-labs/FLUX.2-klein-9b-fp8 | models/diffusion_models/ |
flux-2-klein-base-9b-fp8.safetensors (Base) | black-forest-labs/FLUX.2-klein-base-9b-fp8 | models/diffusion_models/ |
qwen_3_8b_fp8mixed.safetensors | Comfy-Org/flux2-klein-9B | models/text_encoders/ |
flux2-vae.safetensors | Comfy-Org/flux2-dev | models/vae/ |
Para começar, basta um modelo de difusão. Escolha o arquivo destilado para velocidade, ou o Base se pretende treinar LoRAs.
export HF_TOKEN=hf_xxx
curl -L -H "Authorization: Bearer $HF_TOKEN" \
-o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors
curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors
curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors
A estrutura final deve ficar assim:
ComfyUI/
└── models/
├── diffusion_models/
│ └── flux-2-klein-9b-fp8.safetensors
├── text_encoders/
│ └── qwen_3_8b_fp8mixed.safetensors
└── vae/
└── flux2-vae.safetensors
Não misture codificadores entre tamanhos. O workflow 4B usa qwen_3_4b.safetensors, e o workflow 9B usa o codificador Qwen3 8B.
Passo 2: monte o workflow de texto para imagem
O caminho mais fácil é o template embutido. No ComfyUI, abra o navegador de templates e carregue Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). O JSON do template é público no repositório Comfy-Org workflow_templates, então você pode inspecioná-lo antes de rodar.
Os nós do grafo
| Nó | Função | Ajuste principal |
|---|---|---|
UNETLoader (Load Diffusion Model) | Carrega o transformer do Klein | flux-2-klein-9b-fp8.safetensors |
CLIPLoader | Carrega o codificador Qwen3 | type flux2 |
VAELoader | Carrega o VAE do FLUX.2 | flux2-vae.safetensors |
CLIPTextEncode | Codifica o prompt positivo | Seu prompt |
EmptyFlux2LatentImage | Cria o latente vazio | Largura e altura, ex. 1024x1024 |
Flux2Scheduler | Monta a agenda de sigmas | Passos, largura, altura |
CFGGuider | Aplica o guidance | Valor de CFG |
KSamplerSelect | Escolhe o sampler | euler |
RandomNoise | Define a seed | Seed fixa para reprodutibilidade |
SamplerCustomAdvanced | Executa o loop de amostragem | Apenas entradas |
VAEDecode e depois SaveImage | Decodifica e salva | Prefixo do nome do arquivo |
O template 9B oficial carrega o checkpoint Base com 20 passos e CFG 5. Se trocar o UNETLoader para o arquivo destilado, mude o Flux2Scheduler para 4 passos e o CFGGuider para 1.0, como indicam o model card destilado e o template de edição destilado do ComfyUI. Manter os ajustes do Base no modelo destilado desperdiça tempo e pode "queimar" a imagem.
Ajustes que funcionam
| Ajuste | 9B destilado | 9B Base |
|---|---|---|
| Passos | 4 | 20 (template do ComfyUI) a 50 (exemplo do model card) |
| CFG / guidance | 1.0 | 4.0 a 5.0 |
| Sampler | euler | euler |
| Resolução | Comece em 1024x1024 | Comece em 1024x1024 |
| Seed | Fixe enquanto ajusta prompts | Fixe enquanto ajusta prompts |
Mantenha largura e altura do Flux2Scheduler iguais ao tamanho do latente. Os templates oficiais ligam os dois aos mesmos valores de largura e altura, então copie esse padrão ao montar seu próprio grafo ou mudar para um formato não quadrado.
Um prompt para testar o pipeline
O Klein entende bem descrições em linguagem natural, então escreva prompts como frases completas com sujeito, cenário, iluminação e qualquer texto que deva aparecer na imagem:
A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field
Se a primeira imagem sair em poucos segundos e o texto da placa estiver legível, a instalação está funcionando. Para mais ideias de estrutura de prompt que valem para modelos FLUX em geral, veja nosso guia de prompts do FLUX 3.
Passo 3: monte o workflow de edição de imagem
O Klein usa o mesmo modelo para edição, então você não precisa de um checkpoint separado no estilo Kontext. O ComfyUI traz dois templates de edição 9B: image_flux2_klein_image_edit_9b_distilled e image_flux2_klein_image_edit_9b_base.
O que muda no grafo de edição
| Nó adicional | O que faz |
|---|---|
LoadImage | Carrega a imagem de origem ou de referência |
ImageScaleToTotalPixels | Redimensiona a imagem para cerca de 1 megapixel |
GetImageSize | Passa o tamanho redimensionado ao latente e ao scheduler |
VAEEncode | Converte a imagem de referência em latente |
ReferenceLatent | Anexa o latente de referência ao conditioning |
ConditioningZeroOut | Cria o conditioning negativo vazio |
O latente de referência é anexado tanto ao prompt positivo quanto ao conditioning negativo zerado, e ambos entram no CFGGuider. Como o GetImageSize controla o EmptyFlux2LatentImage e o Flux2Scheduler, a saída mantém a proporção da primeira imagem de referência.
Edição com uma referência
Carregue uma imagem e descreva a mudança, não a cena inteira. O template de edição destilado usa 4 passos e CFG 1, e esses mesmos ajustes são o ponto de partida certo para as suas edições.
Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged
Edição com várias referências
Para duas ou mais imagens, o template encadeia um ReferenceLatent por imagem nos caminhos positivo e negativo. No prompt, refira-se às imagens pela ordem:
Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1
A documentação da BFL indica suporte a até 4 imagens de referência para o Klein na API dela (visão geral do FLUX.2); em um grafo local, mais referências também significam mais memória e execuções mais lentas.
Solução de problemas e otimização para pouca VRAM
Erros comuns e correções
| Sintoma | Causa provável | Correção |
|---|---|---|
| Template ausente ou caixas vermelhas de "missing node" | ComfyUI antigo demais para os nós do FLUX.2 | Atualize o ComfyUI; use a versão Nightly se necessário |
| 401 ou 403 ao baixar o arquivo 9B | Repositório restrito, licença não aceita ou sem token | Aceite a licença no Hugging Face e envie um token de leitura |
| Shape ou size mismatch ao carregar o codificador de texto | Codificador 4B usado com o modelo 9B, ou tipo de CLIP errado | Use o codificador Qwen3 8B e defina o tipo do CLIPLoader como flux2 |
| CUDA out of memory | Pesos BF16 ou resolução alta | Use pesos FP8, comece em 1024x1024, feche outros apps que usam a GPU |
| Imagens borradas ou "queimadas" no modelo destilado | Ajustes do Base (20+ passos, CFG 4 a 5) | Defina 4 passos e CFG 1.0 |
| Imagens ruidosas e inacabadas no Base | Poucos passos | Use 20 a 50 passos |
| A edição ignora a referência | ReferenceLatent não ligado ao conditioning | Ligue-o nos caminhos positivo e negativo |
Checklist para pouca VRAM
- Use primeiro os checkpoints FP8; a BFL cita até 40% menos VRAM. O NVFP4 economiza ainda mais em placas RTX compatíveis.
- Use o codificador de texto
fp8mixedem vez de uma versão de precisão total. - Inicie o ComfyUI com
--lowvrampara que partes do modelo sejam descarregadas para a RAM do sistema quando a GPU encher. - Gere em 1024x1024 ou menos e faça upscale depois, em vez de amostrar em tamanhos muito grandes.
- Mantenha o batch size em 1 e reduza o número de imagens de referência nos grafos de edição.
- Se o 9B ainda não couber, o 4B destilado rodou com 8,4GB na medição do ComfyUI.
python main.py --lowvram
Rodando o Klein 9B com Diffusers
Se você prefere Python a um grafo de nós, o model card traz um exemplo com Diffusers. Ele exige a versão de desenvolvimento do Diffusers:
pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline
pipe = Flux2KleinPipeline.from_pretrained(
"black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload() # offloads idle parts to CPU to save VRAM
image = pipe(
prompt="A cat holding a sign that says hello world",
height=1024,
width=1024,
guidance_scale=1.0,
num_inference_steps=4,
generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")
Para o Base 9B, troque o repositório para black-forest-labs/FLUX.2-klein-base-9B e use guidance_scale=4.0 com num_inference_steps=50, como no exemplo desse card.
Quando o FLUX.2 Pro ou Flex hospedado é a melhor escolha
O Klein local é excelente para iteração rápida, experimentos privados e trabalho com LoRA. Ele é menos prático quando você precisa de direitos comerciais sobre o modelo 9B, disponibilidade garantida ou mais capacidade do que uma GPU oferece.
Klein 9B local vs FLUX.2 hospedado
| Necessidade | Klein 9B local | FLUX.2 hospedado na APIMart |
|---|---|---|
| Hardware | Sua GPU, cerca de 29GB em BF16 | Nenhum |
| Uso comercial do modelo | Exige licença comercial da BFL | Regido pelos termos da API, não pela licença open-weight |
| Configuração | ComfyUI, arquivos de modelo, atualizações | Uma chave de API |
| Imagens de referência | A BFL indica até 4 para o Klein | Até 8 por requisição |
| Controle de passos e guidance | Total | Só no Flex (steps de 1 a 50, guidance de 1.5 a 10) |
| Tamanho de saída | Limite da sua GPU | Até 4MP |
| LoRAs personalizados | Sim, com o Base | Não |
| Modelo de custo | Seu hardware e energia | Por imagem; veja a página do modelo para preços atuais |
Escolhendo um modelo hospedado
A APIMart oferece três IDs de modelo FLUX.2 no endpoint /v1/images/generations: flux-2-pro para produção do dia a dia com equilíbrio, flux-2-flex quando você quer ajustar passos e guidance (por exemplo, pôsteres com muita tipografia) e flux-2-max para a máxima qualidade, com velocidade menor. O preço depende da faixa de resolução de saída e do número de imagens de referência; consulte a página do modelo FLUX.2 antes de orçar.
curl --request POST \
--url https://api.apimart.ai/v1/images/generations \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '{
"model": "flux-2-flex",
"prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
"resolution": "2K",
"size": "3:4",
"steps": 50,
"guidance": 6.5
}'
A chamada é assíncrona e retorna data[0].task_id. Consulte GET https://api.apimart.ai/v1/tasks/{task_id} até o status ser completed e então leia a URL da imagem em result.images. Para editar com referências, envie até 8 URLs públicas em image_urls. Para um padrão de produção com retentativas e armazenamento, veja nosso guia de workflows de imagem FLUX para desenvolvedores e, para uma comparação de velocidade e VRAM com outro modelo aberto rápido, leia Z-Image Turbo vs Flux.
Um modelo híbrido na prática
Muitas equipes criam protótipos de prompts e LoRAs no Klein local e depois enviam as renderizações finais ou para clientes a um modelo FLUX.2 hospedado. Prompts escritos como frases descritivas simples funcionam bem nos dois, então raramente é preciso reescrevê-los.
Perguntas frequentes
Qual a diferença entre o FLUX.2 Klein 9B e o Klein Base 9B?
O Klein 9B foi destilado para rodar em 4 passos com guidance 1.0, o que o torna rápido o bastante para geração quase em tempo real. O Klein Base 9B é o modelo de fundação não destilado; precisa de 20 a 50 passos, mas oferece mais diversidade de saída e é o ponto de partida recomendado para fine-tuning e treinamento de LoRA.
Posso usar o FLUX.2 Klein 9B comercialmente?
O modelo em si, não, sem um acordo separado. Os dois checkpoints 9B usam a FLUX Non-Commercial License, que limita o uso do modelo a fins não comerciais; a BFL oferece licenças comerciais em bfl.ai/licensing. A licença diz que as saídas podem ser usadas para qualquer finalidade, inclusive comercial, com algumas exceções, então leia-a por inteiro. O Klein 4B é Apache 2.0 se você precisa de uma opção comercial auto-hospedada.
Quanta VRAM o FLUX.2 Klein 9B precisa?
O model card fala em cerca de 29GB em precisão total, o que aponta para uma RTX 4090 ou superior com offloading para CPU. Pesos FP8 reduzem o uso de memória em até 40% e NVFP4 em até 55%, segundo a BFL; um número exato de VRAM para o 9B em FP8 não foi confirmado oficialmente. Em placas com 16GB ou menos, o 4B é a escolha mais segura.
Quantos passos e qual CFG usar no ComfyUI?
Para o 9B destilado, use 4 passos e CFG 1.0 com o sampler euler. Para o Base 9B, o template do ComfyUI usa 20 passos e CFG 5, e o exemplo do Hugging Face usa 50 passos e guidance 4.0. Comece em 1024x1024 nos dois casos.
O Klein precisa de um modelo separado para edição de imagens?
Não. Um único checkpoint do Klein faz texto para imagem, edição com uma referência e edição com várias referências. No ComfyUI, basta adicionar os nós LoadImage, VAEEncode e ReferenceLatent ao grafo de texto para imagem, ou carregar o template oficial de edição.
O FLUX.2 Klein está disponível na APIMart?
Não. A APIMart oferece os modelos hospedados FLUX.2 Pro, Flex e Max, não o Klein. Eles são uma boa alternativa quando você prefere chamar uma API a gerenciar uma licença open-weight, precisa de até 8 imagens de referência ou não tem uma GPU local adequada.
O que acompanhar daqui em diante
O Klein evolui rápido na comunidade, com muitos adapters, fine-tunes e quantizações já listados na página dele no Hugging Face. Fique de olho em atualizações dos templates do ComfyUI, novos pesos quantizados e mudanças de licença da BFL, porque cada uma pode mudar o que cabe na sua GPU e o que você pode lançar. Se sua carga de trabalho passar de uma máquina ou exigir termos comerciais claros, teste os mesmos prompts no FLUX.2 Pro ou Flex hospedado antes de escalar.
Sobre a equipe APIMart
A equipe APIMart escreve guias de modelos, comparativos e análises de preço para desenvolvedores que constroem com IA. A APIMart oferece uma única API para mais de 500 modelos de chat, imagem e vídeo, para que você compare os modelos citados aqui antes de lançar.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.