APIMart
APIMart

Workflow do FLUX.2 Klein 9B: guia de instalação local

Rode o FLUX.2 Klein 9B no ComfyUI: arquivos, VRAM, ajustes de 4 passos, workflows de texto para imagem e edição, soluções de erros e quando usar o FLUX.2 hospedado.

Tutorial

Resposta curta: o jeito mais rápido de rodar o FLUX.2 Klein 9B localmente é o ComfyUI com três arquivos: o modelo de difusão FP8 da Black Forest Labs, o codificador de texto Qwen3 8B e o VAE do FLUX.2. Use o checkpoint destilado com 4 passos e CFG 1.0 para ter velocidade, ou o checkpoint Base com 20 a 50 passos e CFG entre 4 e 5 quando quiser mais variedade ou pretender treinar LoRAs. Os pesos 9B são distribuídos sob a FLUX Non-Commercial License, então confira os termos da licença antes de colocar o próprio modelo em um produto pago.

Se você não quer cuidar de GPU, drivers e arquivos de modelo, os modelos hospedados FLUX.2 Pro, Flex e Max na APIMart fazem as mesmas tarefas de texto para imagem e edição com referências por meio de uma única API. A APIMart não hospeda o Klein; este guia mostra como rodar o Klein na sua própria máquina e indica quando um modelo FLUX.2 hospedado é a opção mais simples.

Principais pontos

  • O FLUX.2 Klein foi lançado pela Black Forest Labs em 15 de janeiro de 2026, nos tamanhos 4B e 9B, cada um como modelo destilado de 4 passos e como modelo Base não destilado (anúncio da BFL).
  • O Klein 9B combina um flow transformer de 9B com um codificador de texto Qwen3 8B e precisa de cerca de 29GB de VRAM em precisão total, segundo o model card no Hugging Face.
  • O 9B destilado roda com 4 passos e guidance 1.0; o exemplo do card do Base 9B usa 50 passos com guidance 4.0, e o template de texto para imagem 9B do ComfyUI usa 20 passos com CFG 5.
  • Os dois checkpoints 9B usam a FLUX Non-Commercial License, enquanto os dois checkpoints 4B são Apache 2.0.
  • Pesos FP8 reduzem o uso de VRAM em até 40% e NVFP4 em até 55%, segundo os números da BFL para GPUs RTX.
  • Um único modelo Klein faz texto para imagem, edição com uma referência e edição com várias referências; no ComfyUI, o workflow de edição apenas adiciona nós ReferenceLatent ao mesmo grafo.

FLUX.2 Klein em resumo

Klein 9B (destilado)Klein Base 9BKlein 4B (destilado)Klein Base 4B
DesenvolvedorBlack Forest LabsBlack Forest LabsBlack Forest LabsBlack Forest Labs
Lançamento15 de janeiro de 202615 de janeiro de 202615 de janeiro de 202615 de janeiro de 2026
Passos de amostragem420 a 50 (não destilado)4Mais de 4 (não destilado)
Guidance / CFG1.04.0 (exemplo do card)1.0Não confirmado oficialmente
Codificador de textoQwen3 8BQwen3 8BQwen3 4B (arquivo do ComfyUI)Qwen3 4B (arquivo do ComfyUI)
VRAM (precisão total)Cerca de 29GBCerca de 29GBCerca de 13GBCerca de 13GB
LicençaFLUX Non-CommercialFLUX Non-CommercialApache 2.0Apache 2.0
Ideal paraGeração e edição local rápidasFine-tuning, LoRA, pesquisaGPUs de consumo, edgeFine-tuning em GPUs menores
TarefasTexto para imagem, edição com uma ou várias referênciasIgualIgualIgual

Fontes: anúncio da BFL, card do Klein 9B, card do Klein Base 9B, card do Klein 4B e o tutorial do Klein no ComfyUI.

Qual variante do Klein baixar?

Destilado vs Base

Os checkpoints destilados foram destilados para 4 passos de amostragem. É isso que deixa o Klein rápido: a BFL afirma que a família gera ou edita imagens em menos de 0,5 segundo em hardware moderno, e a equipe do ComfyUI mediu cerca de 1,2 segundo de ponta a ponta para o 4B destilado em uma RTX 5090.

Os checkpoints Base não são destilados. Precisam de muito mais passos, mas a BFL descreve que eles têm maior diversidade de saída, e são os indicados para fine-tuning e treinamento de LoRA. O model card do Base 9B o define como "ideal for fine-tuning, LoRA training, research, and custom pipelines where control matters more than speed."

4B vs 9B

O 9B é o modelo Klein principal da BFL; segundo a empresa, ele iguala ou supera modelos cinco vezes maiores. O 4B é a opção mais acessível: cabe em cerca de 13GB de VRAM, o que a BFL associa a uma RTX 3090 ou 4070 ou superior. Se sua GPU tem menos de 24GB, comece pelo workflow 4B ou pelos pesos 9B em FP8 junto com as dicas de pouca VRAM abaixo.

Licença: o que pode e o que não pode

Esta é a parte que a maioria dos guias locais ignora. O Klein 4B e o Base 4B são Apache 2.0, que permite uso comercial. O Klein 9B e o Base 9B usam a FLUX Non-Commercial License. Por essa licença, o modelo e seus derivados só podem ser usados para fins não comerciais, e a licença exclui explicitamente o uso do modelo para fins comerciais ou de produção. A mesma licença diz que a BFL não reivindica a propriedade das saídas e que você pode usar as saídas para qualquer finalidade, inclusive comercial, exceto onde a licença proíbe, como usar as saídas para treinar um modelo concorrente.

Na prática: experimentos, pesquisa e projetos pessoais com o 9B estão liberados. Rodar o 9B dentro de um produto pago ou de um pipeline de produção exige uma licença comercial da BFL (bfl.ai/licensing), ou você pode migrar para o 4B com licença Apache ou para um modelo FLUX.2 hospedado. Isto não é aconselhamento jurídico, então leia o texto da licença.

Seu caso de usoOpção sugerida
Estudo, pesquisa, arte pessoalKlein 9B ou Base 9B localmente
Produto comercial, auto-hospedadoKlein 4B (Apache 2.0), ou licença comercial da BFL para o 9B
Produto comercial, sem GPU para gerenciarFLUX.2 Pro ou Flex hospedado via API
Treinamento de LoRAKlein Base 9B ou Base 4B

Pré-requisitos: hardware, software e acesso

GPU e memória

ConfiguraçãoO que esperar
9B em BF16Cerca de 29GB de VRAM segundo o model card; RTX 4090 ou superior com offloading
9B em FP8Até 40% menos VRAM que BF16 segundo a BFL; número exato para o 9B não confirmado oficialmente
9B em NVFP4Até 55% menos VRAM segundo a BFL; requer GPU NVIDIA RTX recente
4B destilado, FP8 no ComfyUI8,4GB de VRAM medidos pelo ComfyUI em uma RTX 5090
4B Base, FP8 no ComfyUI9,2GB de VRAM medidos pelo ComfyUI em uma RTX 5090

A BFL também informa que o FP8 é até 1,6x mais rápido e o NVFP4 até 2,7x mais rápido, em testes com RTX 5080 e 5090 a 1024x1024.

Versão do ComfyUI

O Klein usa nós mais recentes do FLUX.2, como Flux2Scheduler e EmptyFlux2LatentImage. A documentação do ComfyUI diz que, se os templates do Klein não aparecem ou os nós não carregam, sua instalação está desatualizada, e recomenda a versão mais recente (Nightly). O app Desktop pode ficar atrás da versão principal, então atualize antes de investigar qualquer outra coisa.

Acesso ao Hugging Face

Os repositórios 9B são restritos (gated). Entre no Hugging Face, abra o repositório Klein 9B FP8, aceite a licença e a Acceptable Use Policy e crie um token de leitura para baixar pela linha de comando.

Passo 1: baixe os arquivos do modelo

O tutorial do ComfyUI lista estes arquivos para o workflow 9B:

ArquivoOrigemPasta do ComfyUI
flux-2-klein-9b-fp8.safetensors (destilado)black-forest-labs/FLUX.2-klein-9b-fp8models/diffusion_models/
flux-2-klein-base-9b-fp8.safetensors (Base)black-forest-labs/FLUX.2-klein-base-9b-fp8models/diffusion_models/
qwen_3_8b_fp8mixed.safetensorsComfy-Org/flux2-klein-9Bmodels/text_encoders/
flux2-vae.safetensorsComfy-Org/flux2-devmodels/vae/

Para começar, basta um modelo de difusão. Escolha o arquivo destilado para velocidade, ou o Base se pretende treinar LoRAs.


export HF_TOKEN=hf_xxx

curl -L -H "Authorization: Bearer $HF_TOKEN" \
  -o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
  https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors

curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
  https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors

curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
  https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors

A estrutura final deve ficar assim:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── flux-2-klein-9b-fp8.safetensors
    ├── text_encoders/
    │   └── qwen_3_8b_fp8mixed.safetensors
    └── vae/
        └── flux2-vae.safetensors

Não misture codificadores entre tamanhos. O workflow 4B usa qwen_3_4b.safetensors, e o workflow 9B usa o codificador Qwen3 8B.

Passo 2: monte o workflow de texto para imagem

O caminho mais fácil é o template embutido. No ComfyUI, abra o navegador de templates e carregue Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). O JSON do template é público no repositório Comfy-Org workflow_templates, então você pode inspecioná-lo antes de rodar.

Os nós do grafo

NóFunçãoAjuste principal
UNETLoader (Load Diffusion Model)Carrega o transformer do Kleinflux-2-klein-9b-fp8.safetensors
CLIPLoaderCarrega o codificador Qwen3type flux2
VAELoaderCarrega o VAE do FLUX.2flux2-vae.safetensors
CLIPTextEncodeCodifica o prompt positivoSeu prompt
EmptyFlux2LatentImageCria o latente vazioLargura e altura, ex. 1024x1024
Flux2SchedulerMonta a agenda de sigmasPassos, largura, altura
CFGGuiderAplica o guidanceValor de CFG
KSamplerSelectEscolhe o samplereuler
RandomNoiseDefine a seedSeed fixa para reprodutibilidade
SamplerCustomAdvancedExecuta o loop de amostragemApenas entradas
VAEDecode e depois SaveImageDecodifica e salvaPrefixo do nome do arquivo

O template 9B oficial carrega o checkpoint Base com 20 passos e CFG 5. Se trocar o UNETLoader para o arquivo destilado, mude o Flux2Scheduler para 4 passos e o CFGGuider para 1.0, como indicam o model card destilado e o template de edição destilado do ComfyUI. Manter os ajustes do Base no modelo destilado desperdiça tempo e pode "queimar" a imagem.

Ajustes que funcionam

Ajuste9B destilado9B Base
Passos420 (template do ComfyUI) a 50 (exemplo do model card)
CFG / guidance1.04.0 a 5.0
Samplereulereuler
ResoluçãoComece em 1024x1024Comece em 1024x1024
SeedFixe enquanto ajusta promptsFixe enquanto ajusta prompts

Mantenha largura e altura do Flux2Scheduler iguais ao tamanho do latente. Os templates oficiais ligam os dois aos mesmos valores de largura e altura, então copie esse padrão ao montar seu próprio grafo ou mudar para um formato não quadrado.

Um prompt para testar o pipeline

O Klein entende bem descrições em linguagem natural, então escreva prompts como frases completas com sujeito, cenário, iluminação e qualquer texto que deva aparecer na imagem:

A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field

Se a primeira imagem sair em poucos segundos e o texto da placa estiver legível, a instalação está funcionando. Para mais ideias de estrutura de prompt que valem para modelos FLUX em geral, veja nosso guia de prompts do FLUX 3.

Passo 3: monte o workflow de edição de imagem

O Klein usa o mesmo modelo para edição, então você não precisa de um checkpoint separado no estilo Kontext. O ComfyUI traz dois templates de edição 9B: image_flux2_klein_image_edit_9b_distilled e image_flux2_klein_image_edit_9b_base.

O que muda no grafo de edição

Nó adicionalO que faz
LoadImageCarrega a imagem de origem ou de referência
ImageScaleToTotalPixelsRedimensiona a imagem para cerca de 1 megapixel
GetImageSizePassa o tamanho redimensionado ao latente e ao scheduler
VAEEncodeConverte a imagem de referência em latente
ReferenceLatentAnexa o latente de referência ao conditioning
ConditioningZeroOutCria o conditioning negativo vazio

O latente de referência é anexado tanto ao prompt positivo quanto ao conditioning negativo zerado, e ambos entram no CFGGuider. Como o GetImageSize controla o EmptyFlux2LatentImage e o Flux2Scheduler, a saída mantém a proporção da primeira imagem de referência.

Edição com uma referência

Carregue uma imagem e descreva a mudança, não a cena inteira. O template de edição destilado usa 4 passos e CFG 1, e esses mesmos ajustes são o ponto de partida certo para as suas edições.

Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged

Edição com várias referências

Para duas ou mais imagens, o template encadeia um ReferenceLatent por imagem nos caminhos positivo e negativo. No prompt, refira-se às imagens pela ordem:

Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1

A documentação da BFL indica suporte a até 4 imagens de referência para o Klein na API dela (visão geral do FLUX.2); em um grafo local, mais referências também significam mais memória e execuções mais lentas.

Solução de problemas e otimização para pouca VRAM

Erros comuns e correções

SintomaCausa provávelCorreção
Template ausente ou caixas vermelhas de "missing node"ComfyUI antigo demais para os nós do FLUX.2Atualize o ComfyUI; use a versão Nightly se necessário
401 ou 403 ao baixar o arquivo 9BRepositório restrito, licença não aceita ou sem tokenAceite a licença no Hugging Face e envie um token de leitura
Shape ou size mismatch ao carregar o codificador de textoCodificador 4B usado com o modelo 9B, ou tipo de CLIP erradoUse o codificador Qwen3 8B e defina o tipo do CLIPLoader como flux2
CUDA out of memoryPesos BF16 ou resolução altaUse pesos FP8, comece em 1024x1024, feche outros apps que usam a GPU
Imagens borradas ou "queimadas" no modelo destiladoAjustes do Base (20+ passos, CFG 4 a 5)Defina 4 passos e CFG 1.0
Imagens ruidosas e inacabadas no BasePoucos passosUse 20 a 50 passos
A edição ignora a referênciaReferenceLatent não ligado ao conditioningLigue-o nos caminhos positivo e negativo

Checklist para pouca VRAM

  • Use primeiro os checkpoints FP8; a BFL cita até 40% menos VRAM. O NVFP4 economiza ainda mais em placas RTX compatíveis.
  • Use o codificador de texto fp8mixed em vez de uma versão de precisão total.
  • Inicie o ComfyUI com --lowvram para que partes do modelo sejam descarregadas para a RAM do sistema quando a GPU encher.
  • Gere em 1024x1024 ou menos e faça upscale depois, em vez de amostrar em tamanhos muito grandes.
  • Mantenha o batch size em 1 e reduza o número de imagens de referência nos grafos de edição.
  • Se o 9B ainda não couber, o 4B destilado rodou com 8,4GB na medição do ComfyUI.

python main.py --lowvram

Rodando o Klein 9B com Diffusers

Se você prefere Python a um grafo de nós, o model card traz um exemplo com Diffusers. Ele exige a versão de desenvolvimento do Diffusers:

pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline

pipe = Flux2KleinPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()  # offloads idle parts to CPU to save VRAM

image = pipe(
    prompt="A cat holding a sign that says hello world",
    height=1024,
    width=1024,
    guidance_scale=1.0,
    num_inference_steps=4,
    generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")

Para o Base 9B, troque o repositório para black-forest-labs/FLUX.2-klein-base-9B e use guidance_scale=4.0 com num_inference_steps=50, como no exemplo desse card.

Quando o FLUX.2 Pro ou Flex hospedado é a melhor escolha

O Klein local é excelente para iteração rápida, experimentos privados e trabalho com LoRA. Ele é menos prático quando você precisa de direitos comerciais sobre o modelo 9B, disponibilidade garantida ou mais capacidade do que uma GPU oferece.

Klein 9B local vs FLUX.2 hospedado

NecessidadeKlein 9B localFLUX.2 hospedado na APIMart
HardwareSua GPU, cerca de 29GB em BF16Nenhum
Uso comercial do modeloExige licença comercial da BFLRegido pelos termos da API, não pela licença open-weight
ConfiguraçãoComfyUI, arquivos de modelo, atualizaçõesUma chave de API
Imagens de referênciaA BFL indica até 4 para o KleinAté 8 por requisição
Controle de passos e guidanceTotalSó no Flex (steps de 1 a 50, guidance de 1.5 a 10)
Tamanho de saídaLimite da sua GPUAté 4MP
LoRAs personalizadosSim, com o BaseNão
Modelo de custoSeu hardware e energiaPor imagem; veja a página do modelo para preços atuais

Escolhendo um modelo hospedado

A APIMart oferece três IDs de modelo FLUX.2 no endpoint /v1/images/generations: flux-2-pro para produção do dia a dia com equilíbrio, flux-2-flex quando você quer ajustar passos e guidance (por exemplo, pôsteres com muita tipografia) e flux-2-max para a máxima qualidade, com velocidade menor. O preço depende da faixa de resolução de saída e do número de imagens de referência; consulte a página do modelo FLUX.2 antes de orçar.

curl --request POST \
  --url https://api.apimart.ai/v1/images/generations \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "flux-2-flex",
    "prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
    "resolution": "2K",
    "size": "3:4",
    "steps": 50,
    "guidance": 6.5
  }'

A chamada é assíncrona e retorna data[0].task_id. Consulte GET https://api.apimart.ai/v1/tasks/{task_id} até o status ser completed e então leia a URL da imagem em result.images. Para editar com referências, envie até 8 URLs públicas em image_urls. Para um padrão de produção com retentativas e armazenamento, veja nosso guia de workflows de imagem FLUX para desenvolvedores e, para uma comparação de velocidade e VRAM com outro modelo aberto rápido, leia Z-Image Turbo vs Flux.

Um modelo híbrido na prática

Muitas equipes criam protótipos de prompts e LoRAs no Klein local e depois enviam as renderizações finais ou para clientes a um modelo FLUX.2 hospedado. Prompts escritos como frases descritivas simples funcionam bem nos dois, então raramente é preciso reescrevê-los.

Perguntas frequentes

Qual a diferença entre o FLUX.2 Klein 9B e o Klein Base 9B?

O Klein 9B foi destilado para rodar em 4 passos com guidance 1.0, o que o torna rápido o bastante para geração quase em tempo real. O Klein Base 9B é o modelo de fundação não destilado; precisa de 20 a 50 passos, mas oferece mais diversidade de saída e é o ponto de partida recomendado para fine-tuning e treinamento de LoRA.

Posso usar o FLUX.2 Klein 9B comercialmente?

O modelo em si, não, sem um acordo separado. Os dois checkpoints 9B usam a FLUX Non-Commercial License, que limita o uso do modelo a fins não comerciais; a BFL oferece licenças comerciais em bfl.ai/licensing. A licença diz que as saídas podem ser usadas para qualquer finalidade, inclusive comercial, com algumas exceções, então leia-a por inteiro. O Klein 4B é Apache 2.0 se você precisa de uma opção comercial auto-hospedada.

Quanta VRAM o FLUX.2 Klein 9B precisa?

O model card fala em cerca de 29GB em precisão total, o que aponta para uma RTX 4090 ou superior com offloading para CPU. Pesos FP8 reduzem o uso de memória em até 40% e NVFP4 em até 55%, segundo a BFL; um número exato de VRAM para o 9B em FP8 não foi confirmado oficialmente. Em placas com 16GB ou menos, o 4B é a escolha mais segura.

Quantos passos e qual CFG usar no ComfyUI?

Para o 9B destilado, use 4 passos e CFG 1.0 com o sampler euler. Para o Base 9B, o template do ComfyUI usa 20 passos e CFG 5, e o exemplo do Hugging Face usa 50 passos e guidance 4.0. Comece em 1024x1024 nos dois casos.

O Klein precisa de um modelo separado para edição de imagens?

Não. Um único checkpoint do Klein faz texto para imagem, edição com uma referência e edição com várias referências. No ComfyUI, basta adicionar os nós LoadImage, VAEEncode e ReferenceLatent ao grafo de texto para imagem, ou carregar o template oficial de edição.

O FLUX.2 Klein está disponível na APIMart?

Não. A APIMart oferece os modelos hospedados FLUX.2 Pro, Flex e Max, não o Klein. Eles são uma boa alternativa quando você prefere chamar uma API a gerenciar uma licença open-weight, precisa de até 8 imagens de referência ou não tem uma GPU local adequada.

O que acompanhar daqui em diante

O Klein evolui rápido na comunidade, com muitos adapters, fine-tunes e quantizações já listados na página dele no Hugging Face. Fique de olho em atualizações dos templates do ComfyUI, novos pesos quantizados e mudanças de licença da BFL, porque cada uma pode mudar o que cabe na sua GPU e o que você pode lançar. Se sua carga de trabalho passar de uma máquina ou exigir termos comerciais claros, teste os mesmos prompts no FLUX.2 Pro ou Flex hospedado antes de escalar.

Tags#FLUX.2 Klein#FLUX.2#ComfyUI#local AI image generation#image editing#open-weight models

Sobre a equipe APIMart

A equipe APIMart escreve guias de modelos, comparativos e análises de preço para desenvolvedores que constroem com IA. A APIMart oferece uma única API para mais de 500 modelos de chat, imagem e vídeo, para que você compare os modelos citados aqui antes de lançar.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace