APIMart
APIMart

Workflow de FLUX.2 Klein 9B: guía de instalación local

Ejecuta FLUX.2 Klein 9B en ComfyUI: archivos, VRAM, ajustes de 4 pasos, flujos de texto a imagen y edición, soluciones a errores y cuándo conviene FLUX.2 alojado.

Tutorial

Respuesta corta: la forma más rápida de ejecutar FLUX.2 Klein 9B en local es ComfyUI con tres archivos: el modelo de difusión FP8 de Black Forest Labs, el codificador de texto Qwen3 8B y el VAE de FLUX.2. Usa el checkpoint destilado con 4 pasos y CFG 1.0 si buscas velocidad, o el checkpoint Base con 20 a 50 pasos y un CFG de 4 a 5 si quieres más variedad o piensas entrenar LoRAs. Los pesos 9B se publican bajo la FLUX Non-Commercial License, así que revisa los términos de la licencia antes de integrar el modelo en un producto de pago.

Si no quieres gestionar GPU, drivers ni archivos de modelo, los modelos alojados FLUX.2 Pro, Flex y Max de APIMart cubren las mismas tareas de texto a imagen y edición con referencias a través de una sola API. APIMart no aloja Klein; esta guía explica cómo ejecutar Klein en tu propia máquina y en qué casos un modelo FLUX.2 alojado es la opción más sencilla.

Puntos clave

  • Black Forest Labs lanzó FLUX.2 Klein el 15 de enero de 2026 en tamaños 4B y 9B, cada uno como modelo destilado de 4 pasos y como modelo Base sin destilar (anuncio de BFL).
  • Klein 9B combina un flow transformer de 9B con un codificador de texto Qwen3 8B y necesita unos 29GB de VRAM a precisión completa, según la model card de Hugging Face.
  • El 9B destilado funciona con 4 pasos y guidance 1.0; el ejemplo de la card de Base 9B usa 50 pasos con guidance 4.0, y la plantilla de texto a imagen 9B de ComfyUI usa 20 pasos con CFG 5.
  • Los dos checkpoints 9B usan la FLUX Non-Commercial License, mientras que los dos checkpoints 4B son Apache 2.0.
  • Los pesos FP8 reducen el uso de VRAM hasta un 40% y NVFP4 hasta un 55%, según las cifras de BFL para GPU RTX.
  • Un solo modelo Klein hace texto a imagen, edición con una referencia y edición con varias referencias; en ComfyUI, el flujo de edición solo añade nodos ReferenceLatent al mismo grafo.

FLUX.2 Klein de un vistazo

Klein 9B (destilado)Klein Base 9BKlein 4B (destilado)Klein Base 4B
DesarrolladorBlack Forest LabsBlack Forest LabsBlack Forest LabsBlack Forest Labs
Lanzamiento15 de enero de 202615 de enero de 202615 de enero de 202615 de enero de 2026
Pasos de muestreo420 a 50 (sin destilar)4Más de 4 (sin destilar)
Guidance / CFG1.04.0 (ejemplo de la card)1.0Sin confirmación oficial
Codificador de textoQwen3 8BQwen3 8BQwen3 4B (archivo de ComfyUI)Qwen3 4B (archivo de ComfyUI)
VRAM (precisión completa)Unos 29GBUnos 29GBUnos 13GBUnos 13GB
LicenciaFLUX Non-CommercialFLUX Non-CommercialApache 2.0Apache 2.0
Ideal paraGeneración y edición local rápidasFine-tuning, LoRA, investigaciónGPU de consumo, edgeFine-tuning en GPU pequeñas
TareasTexto a imagen, edición con una o varias referenciasIgualIgualIgual

Fuentes: anuncio de BFL, card de Klein 9B, card de Klein Base 9B, card de Klein 4B y el tutorial de Klein en ComfyUI.

¿Qué variante de Klein descargar?

Destilado vs Base

Los checkpoints destilados se han destilado a 4 pasos de muestreo. Eso es lo que hace rápido a Klein: BFL afirma que la familia genera o edita imágenes en menos de 0,5 segundos en hardware moderno, y el equipo de ComfyUI midió unos 1,2 segundos de principio a fin con el 4B destilado en una RTX 5090.

Los checkpoints Base no están destilados. Necesitan muchos más pasos, pero BFL indica que ofrecen mayor diversidad de resultados, y son los adecuados para fine-tuning y entrenamiento de LoRA. La model card de Base 9B lo describe como "ideal for fine-tuning, LoRA training, research, and custom pipelines where control matters more than speed."

4B vs 9B

El 9B es el modelo Klein insignia de BFL; según la empresa, iguala o supera a modelos cinco veces más grandes. El 4B es la opción accesible: cabe en unos 13GB de VRAM, lo que BFL asocia a una RTX 3090 o 4070 en adelante. Si tu GPU tiene menos de 24GB, empieza con el flujo 4B o con los pesos 9B en FP8 y los consejos para poca VRAM que verás más abajo.

Licencia: qué puedes hacer y qué no

Esta es la parte que la mayoría de guías locales se salta. Klein 4B y Base 4B son Apache 2.0, que permite el uso comercial. Klein 9B y Base 9B usan la FLUX Non-Commercial License. Según esa licencia, el modelo y sus derivados solo pueden usarse con fines no comerciales, y la licencia excluye expresamente el uso del modelo con fines comerciales o de producción. La misma licencia indica que BFL no reclama la propiedad de los resultados y que puedes usarlos para cualquier fin, incluido el comercial, salvo lo que la licencia prohíbe, como usarlos para entrenar un modelo competidor.

En la práctica: experimentar, investigar y hacer proyectos personales con el 9B está permitido. Ejecutar el 9B dentro de un producto de pago o de un pipeline de producción requiere una licencia comercial de BFL (bfl.ai/licensing), o puedes pasarte al 4B con licencia Apache o a un modelo FLUX.2 alojado. Esto no es asesoramiento legal, así que lee el texto de la licencia.

Tu caso de usoOpción recomendada
Aprendizaje, investigación, arte personalKlein 9B o Base 9B en local
Producto comercial, autoalojadoKlein 4B (Apache 2.0), o licencia comercial de BFL para el 9B
Producto comercial, sin GPU que gestionarFLUX.2 Pro o Flex alojado mediante API
Entrenamiento de LoRAKlein Base 9B o Base 4B

Requisitos previos: hardware, software y acceso

GPU y memoria

ConfiguraciónQué esperar
9B en BF16Unos 29GB de VRAM según la model card; RTX 4090 o superior con offloading
9B en FP8Hasta un 40% menos de VRAM que BF16 según BFL; cifra exacta para el 9B sin confirmación oficial
9B en NVFP4Hasta un 55% menos de VRAM según BFL; requiere una GPU NVIDIA RTX reciente
4B destilado, FP8 en ComfyUI8,4GB de VRAM medidos por ComfyUI en una RTX 5090
4B Base, FP8 en ComfyUI9,2GB de VRAM medidos por ComfyUI en una RTX 5090

BFL también indica que FP8 es hasta 1,6 veces más rápido y NVFP4 hasta 2,7 veces más rápido, en pruebas con RTX 5080 y 5090 a 1024x1024.

Versión de ComfyUI

Klein usa nodos nuevos de FLUX.2 como Flux2Scheduler y EmptyFlux2LatentImage. La documentación de ComfyUI dice que, si no aparecen las plantillas de Klein o los nodos no cargan, tu instalación está desactualizada, y recomienda la versión más reciente (Nightly). La app Desktop puede ir por detrás de la versión principal, así que actualiza antes de investigar cualquier otro problema.

Acceso a Hugging Face

Los repositorios 9B son restringidos (gated). Inicia sesión en Hugging Face, abre el repositorio Klein 9B FP8, acepta la licencia y la Acceptable Use Policy y crea un token de lectura para descargar desde la línea de comandos.

Paso 1: descarga los archivos del modelo

El tutorial de ComfyUI enumera estos archivos para el flujo 9B:

ArchivoOrigenCarpeta de ComfyUI
flux-2-klein-9b-fp8.safetensors (destilado)black-forest-labs/FLUX.2-klein-9b-fp8models/diffusion_models/
flux-2-klein-base-9b-fp8.safetensors (Base)black-forest-labs/FLUX.2-klein-base-9b-fp8models/diffusion_models/
qwen_3_8b_fp8mixed.safetensorsComfy-Org/flux2-klein-9Bmodels/text_encoders/
flux2-vae.safetensorsComfy-Org/flux2-devmodels/vae/

Para empezar solo necesitas un modelo de difusión. Elige el archivo destilado si buscas velocidad, o el Base si vas a entrenar LoRAs.


export HF_TOKEN=hf_xxx

curl -L -H "Authorization: Bearer $HF_TOKEN" \
  -o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
  https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors

curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
  https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors

curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
  https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors

La estructura resultante debería verse así:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── flux-2-klein-9b-fp8.safetensors
    ├── text_encoders/
    │   └── qwen_3_8b_fp8mixed.safetensors
    └── vae/
        └── flux2-vae.safetensors

No mezcles codificadores entre tamaños. El flujo 4B usa qwen_3_4b.safetensors y el flujo 9B usa el codificador Qwen3 8B.

Paso 2: crea el flujo de texto a imagen

Lo más fácil es partir de la plantilla integrada. En ComfyUI, abre el explorador de plantillas y carga Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). El JSON de la plantilla es público en el repositorio Comfy-Org workflow_templates, así que puedes revisarlo antes de ejecutarlo.

Los nodos del grafo

NodoFunciónAjuste clave
UNETLoader (Load Diffusion Model)Carga el transformer de Kleinflux-2-klein-9b-fp8.safetensors
CLIPLoaderCarga el codificador Qwen3type flux2
VAELoaderCarga el VAE de FLUX.2flux2-vae.safetensors
CLIPTextEncodeCodifica el prompt positivoTu prompt
EmptyFlux2LatentImageCrea el latente vacíoAncho y alto, p. ej. 1024x1024
Flux2SchedulerGenera la planificación de sigmasPasos, ancho, alto
CFGGuiderAplica el guidanceValor de CFG
KSamplerSelectElige el samplereuler
RandomNoiseFija la semillaSemilla fija para reproducibilidad
SamplerCustomAdvancedEjecuta el bucle de muestreoSolo entradas
VAEDecode y luego SaveImageDecodifica y guardaPrefijo del nombre de archivo

La plantilla 9B oficial carga el checkpoint Base con 20 pasos y CFG 5. Si cambias el UNETLoader al archivo destilado, pon el Flux2Scheduler en 4 pasos y el CFGGuider en 1.0, como indican la model card del destilado y la plantilla de edición destilada de ComfyUI. Dejar los ajustes del Base en el modelo destilado desperdicia tiempo y puede "quemar" la imagen.

Ajustes que funcionan

Ajuste9B destilado9B Base
Pasos420 (plantilla de ComfyUI) a 50 (ejemplo de la model card)
CFG / guidance1.04.0 a 5.0
Samplereulereuler
ResoluciónEmpieza en 1024x1024Empieza en 1024x1024
SemillaFíjala mientras ajustas promptsFíjala mientras ajustas prompts

Mantén el ancho y el alto del Flux2Scheduler iguales al tamaño del latente. Las plantillas oficiales conectan ambos a los mismos valores de ancho y alto, así que copia ese patrón al construir tu propio grafo o al pasar a un formato no cuadrado.

Un prompt para probar el pipeline

Klein entiende bien las descripciones en lenguaje natural, así que escribe los prompts como frases completas con sujeto, escenario, iluminación y cualquier texto que deba aparecer:

A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field

Si la primera imagen sale en pocos segundos y el texto del letrero se lee bien, la instalación funciona. Para más ideas de estructura de prompts aplicables a los modelos FLUX en general, consulta nuestra guía de prompts de FLUX 3.

Paso 3: crea el flujo de edición de imágenes

Klein usa el mismo modelo para editar, así que no necesitas un checkpoint aparte al estilo de Kontext. ComfyUI incluye dos plantillas de edición 9B: image_flux2_klein_image_edit_9b_distilled y image_flux2_klein_image_edit_9b_base.

Qué cambia en el grafo de edición

Nodo añadidoQué hace
LoadImageCarga la imagen de origen o de referencia
ImageScaleToTotalPixelsReescala la imagen a aproximadamente 1 megapíxel
GetImageSizePasa el tamaño reescalado al latente y al scheduler
VAEEncodeConvierte la imagen de referencia en latente
ReferenceLatentAñade el latente de referencia al conditioning
ConditioningZeroOutCrea el conditioning negativo vacío

El latente de referencia se añade tanto al prompt positivo como al conditioning negativo puesto a cero, y ambos entran en CFGGuider. Como GetImageSize controla EmptyFlux2LatentImage y Flux2Scheduler, la salida conserva la relación de aspecto de tu primera imagen de referencia.

Edición con una referencia

Carga una imagen y describe el cambio, no la escena completa. La plantilla de edición destilada usa 4 pasos y CFG 1, y esos mismos ajustes son el punto de partida adecuado para tus ediciones.

Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged

Edición con varias referencias

Con dos o más imágenes, la plantilla encadena un ReferenceLatent por imagen en los caminos positivo y negativo. En el prompt, menciona las imágenes por orden:

Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1

La documentación de BFL indica compatibilidad con hasta 4 imágenes de referencia para Klein en su API (resumen de FLUX.2); en un grafo local, más referencias también implican más memoria y ejecuciones más lentas.

Solución de problemas y optimización para poca VRAM

Errores comunes y soluciones

SíntomaCausa probableSolución
Falta la plantilla o aparecen cajas rojas de "missing node"ComfyUI demasiado antiguo para los nodos de FLUX.2Actualiza ComfyUI; usa la versión Nightly si hace falta
401 o 403 al descargar el archivo 9BRepositorio restringido, licencia sin aceptar o sin tokenAcepta la licencia en Hugging Face y envía un token de lectura
Shape o size mismatch al cargar el codificador de textoCodificador 4B con el modelo 9B, o tipo de CLIP incorrectoUsa el codificador Qwen3 8B y pon el tipo de CLIPLoader en flux2
CUDA out of memoryPesos BF16 o resolución altaUsa pesos FP8, empieza en 1024x1024 y cierra otras apps que usen la GPU
Imágenes borrosas o "quemadas" con el modelo destiladoAjustes del Base (20+ pasos, CFG 4 a 5)Pon 4 pasos y CFG 1.0
Imágenes ruidosas y sin terminar con el BaseMuy pocos pasosUsa de 20 a 50 pasos
La edición ignora la referenciaReferenceLatent sin conectar al conditioningConéctalo en los caminos positivo y negativo

Lista de comprobación para poca VRAM

  • Prueba primero los checkpoints FP8; BFL habla de hasta un 40% menos de VRAM. NVFP4 ahorra aún más en tarjetas RTX compatibles.
  • Usa el codificador de texto fp8mixed en lugar de uno de precisión completa.
  • Inicia ComfyUI con --lowvram para que partes del modelo se descarguen a la RAM del sistema cuando la GPU se llene.
  • Genera a 1024x1024 o menos y escala después, en lugar de muestrear a tamaños muy grandes.
  • Mantén el batch size en 1 y reduce el número de imágenes de referencia en los grafos de edición.
  • Si el 9B sigue sin caber, el 4B destilado funcionó con 8,4GB en la medición de ComfyUI.

python main.py --lowvram

Ejecutar Klein 9B con Diffusers

Si prefieres Python a un grafo de nodos, la model card incluye un ejemplo con Diffusers. Requiere la versión de desarrollo de Diffusers:

pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline

pipe = Flux2KleinPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()  # offloads idle parts to CPU to save VRAM

image = pipe(
    prompt="A cat holding a sign that says hello world",
    height=1024,
    width=1024,
    guidance_scale=1.0,
    num_inference_steps=4,
    generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")

Para Base 9B, cambia el repositorio a black-forest-labs/FLUX.2-klein-base-9B y usa guidance_scale=4.0 con num_inference_steps=50, como en el ejemplo de esa card.

Cuándo conviene más FLUX.2 Pro o Flex alojado

Klein en local es excelente para iterar rápido, hacer experimentos privados y trabajar con LoRA. Resulta menos práctico cuando necesitas derechos comerciales sobre el modelo 9B, disponibilidad garantizada o más capacidad de la que ofrece una GPU.

Klein 9B en local vs FLUX.2 alojado

NecesidadKlein 9B en localFLUX.2 alojado en APIMart
HardwareTu GPU, unos 29GB en BF16Ninguno
Uso comercial del modeloRequiere licencia comercial de BFLSe rige por los términos de la API, no por la licencia open-weight
ConfiguraciónComfyUI, archivos de modelo, actualizacionesUna clave de API
Imágenes de referenciaBFL indica hasta 4 para KleinHasta 8 por solicitud
Control de pasos y guidanceTotalSolo Flex (steps de 1 a 50, guidance de 1.5 a 10)
Tamaño de salidaEl límite de tu GPUHasta 4MP
LoRAs personalizadosSí, con el BaseNo
Modelo de costeTu hardware y electricidadPor imagen; consulta la página del modelo para ver precios actuales

Cómo elegir un modelo alojado

APIMart ofrece tres ID de modelo FLUX.2 en el endpoint /v1/images/generations: flux-2-pro para producción diaria equilibrada, flux-2-flex cuando quieres ajustar pasos y guidance (por ejemplo, carteles con mucha tipografía) y flux-2-max para la máxima calidad a menor velocidad. El precio depende del nivel de resolución de salida y del número de imágenes de referencia; consulta la página del modelo FLUX.2 antes de presupuestar.

curl --request POST \
  --url https://api.apimart.ai/v1/images/generations \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "flux-2-flex",
    "prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
    "resolution": "2K",
    "size": "3:4",
    "steps": 50,
    "guidance": 6.5
  }'

La llamada es asíncrona y devuelve data[0].task_id. Consulta GET https://api.apimart.ai/v1/tasks/{task_id} hasta que status sea completed y lee la URL de la imagen en result.images. Para editar con referencias, envía hasta 8 URL públicas en image_urls. Para un patrón de producción con reintentos y almacenamiento, consulta nuestra guía de flujos de imagen con FLUX para desarrolladores y, para una comparación de velocidad y VRAM con otro modelo abierto rápido, lee Z-Image Turbo vs Flux.

Un enfoque híbrido práctico

Muchos equipos prototipan prompts y LoRAs con Klein en local y luego envían los renders finales o de cara al cliente a un modelo FLUX.2 alojado. Los prompts escritos como frases descriptivas sencillas funcionan bien en ambos, así que rara vez hay que reescribirlos.

Preguntas frecuentes

¿Qué diferencia hay entre FLUX.2 Klein 9B y Klein Base 9B?

Klein 9B está destilado para funcionar en 4 pasos con guidance 1.0, lo que lo hace lo bastante rápido para generar casi en tiempo real. Klein Base 9B es el modelo fundacional sin destilar; necesita de 20 a 50 pasos, pero ofrece más diversidad de resultados y es el punto de partida recomendado para fine-tuning y entrenamiento de LoRA.

¿Puedo usar FLUX.2 Klein 9B con fines comerciales?

El modelo en sí, no, sin un acuerdo aparte. Los dos checkpoints 9B usan la FLUX Non-Commercial License, que limita el uso del modelo a fines no comerciales; BFL ofrece licencias comerciales en bfl.ai/licensing. La licencia dice que los resultados pueden usarse para cualquier fin, incluido el comercial, con algunas excepciones, así que léela completa. Klein 4B es Apache 2.0 si necesitas una opción comercial autoalojada.

¿Cuánta VRAM necesita FLUX.2 Klein 9B?

La model card habla de unos 29GB a precisión completa, lo que apunta a una RTX 4090 o superior con offloading a CPU. Los pesos FP8 reducen el uso de memoria hasta un 40% y NVFP4 hasta un 55%, según BFL; no hay una cifra oficial confirmada de VRAM para el 9B en FP8. Con tarjetas de 16GB o menos, el 4B es la opción más segura.

¿Qué pasos y CFG debo usar en ComfyUI?

Para el 9B destilado, usa 4 pasos y CFG 1.0 con el sampler euler. Para Base 9B, la plantilla de ComfyUI usa 20 pasos y CFG 5, y el ejemplo de Hugging Face usa 50 pasos y guidance 4.0. En ambos casos, empieza a 1024x1024.

¿Klein necesita un modelo aparte para editar imágenes?

No. Un solo checkpoint de Klein hace texto a imagen, edición con una referencia y edición con varias referencias. En ComfyUI basta con añadir los nodos LoadImage, VAEEncode y ReferenceLatent al grafo de texto a imagen, o cargar la plantilla oficial de edición.

¿Está FLUX.2 Klein disponible en APIMart?

No. APIMart ofrece los modelos alojados FLUX.2 Pro, Flex y Max, no Klein. Son una buena alternativa si prefieres llamar a una API antes que gestionar una licencia open-weight, necesitas hasta 8 imágenes de referencia o no tienes una GPU local adecuada.

Qué seguir de cerca

Klein avanza rápido en la comunidad, con muchos adapters, fine-tunes y cuantizaciones ya listados en su página de Hugging Face. Sigue de cerca las actualizaciones de plantillas de ComfyUI, los nuevos pesos cuantizados y los cambios de licencia de BFL, porque cada uno puede cambiar lo que cabe en tu GPU y lo que puedes lanzar. Si tu carga de trabajo supera una sola máquina o necesita términos comerciales claros, prueba los mismos prompts en FLUX.2 Pro o Flex alojado antes de escalar.

Etiquetas#FLUX.2 Klein#FLUX.2#ComfyUI#local AI image generation#image editing#open-weight models

Sobre el equipo de APIMart

El equipo de APIMart escribe guías de modelos, comparativas y análisis de precios para desarrolladores que construyen con IA. APIMart ofrece una sola API para más de 500 modelos de chat, imagen y vídeo, así que puedes comparar los modelos de este artículo antes de lanzar.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace