

Workflow de FLUX.2 Klein 9B: guía de instalación local
Ejecuta FLUX.2 Klein 9B en ComfyUI: archivos, VRAM, ajustes de 4 pasos, flujos de texto a imagen y edición, soluciones a errores y cuándo conviene FLUX.2 alojado.
Respuesta corta: la forma más rápida de ejecutar FLUX.2 Klein 9B en local es ComfyUI con tres archivos: el modelo de difusión FP8 de Black Forest Labs, el codificador de texto Qwen3 8B y el VAE de FLUX.2. Usa el checkpoint destilado con 4 pasos y CFG 1.0 si buscas velocidad, o el checkpoint Base con 20 a 50 pasos y un CFG de 4 a 5 si quieres más variedad o piensas entrenar LoRAs. Los pesos 9B se publican bajo la FLUX Non-Commercial License, así que revisa los términos de la licencia antes de integrar el modelo en un producto de pago.
Si no quieres gestionar GPU, drivers ni archivos de modelo, los modelos alojados FLUX.2 Pro, Flex y Max de APIMart cubren las mismas tareas de texto a imagen y edición con referencias a través de una sola API. APIMart no aloja Klein; esta guía explica cómo ejecutar Klein en tu propia máquina y en qué casos un modelo FLUX.2 alojado es la opción más sencilla.
Puntos clave
- Black Forest Labs lanzó FLUX.2 Klein el 15 de enero de 2026 en tamaños 4B y 9B, cada uno como modelo destilado de 4 pasos y como modelo Base sin destilar (anuncio de BFL).
- Klein 9B combina un flow transformer de 9B con un codificador de texto Qwen3 8B y necesita unos 29GB de VRAM a precisión completa, según la model card de Hugging Face.
- El 9B destilado funciona con 4 pasos y guidance 1.0; el ejemplo de la card de Base 9B usa 50 pasos con guidance 4.0, y la plantilla de texto a imagen 9B de ComfyUI usa 20 pasos con CFG 5.
- Los dos checkpoints 9B usan la FLUX Non-Commercial License, mientras que los dos checkpoints 4B son Apache 2.0.
- Los pesos FP8 reducen el uso de VRAM hasta un 40% y NVFP4 hasta un 55%, según las cifras de BFL para GPU RTX.
- Un solo modelo Klein hace texto a imagen, edición con una referencia y edición con varias referencias; en ComfyUI, el flujo de edición solo añade nodos
ReferenceLatental mismo grafo.
FLUX.2 Klein de un vistazo
| Klein 9B (destilado) | Klein Base 9B | Klein 4B (destilado) | Klein Base 4B | |
|---|---|---|---|---|
| Desarrollador | Black Forest Labs | Black Forest Labs | Black Forest Labs | Black Forest Labs |
| Lanzamiento | 15 de enero de 2026 | 15 de enero de 2026 | 15 de enero de 2026 | 15 de enero de 2026 |
| Pasos de muestreo | 4 | 20 a 50 (sin destilar) | 4 | Más de 4 (sin destilar) |
| Guidance / CFG | 1.0 | 4.0 (ejemplo de la card) | 1.0 | Sin confirmación oficial |
| Codificador de texto | Qwen3 8B | Qwen3 8B | Qwen3 4B (archivo de ComfyUI) | Qwen3 4B (archivo de ComfyUI) |
| VRAM (precisión completa) | Unos 29GB | Unos 29GB | Unos 13GB | Unos 13GB |
| Licencia | FLUX Non-Commercial | FLUX Non-Commercial | Apache 2.0 | Apache 2.0 |
| Ideal para | Generación y edición local rápidas | Fine-tuning, LoRA, investigación | GPU de consumo, edge | Fine-tuning en GPU pequeñas |
| Tareas | Texto a imagen, edición con una o varias referencias | Igual | Igual | Igual |
Fuentes: anuncio de BFL, card de Klein 9B, card de Klein Base 9B, card de Klein 4B y el tutorial de Klein en ComfyUI.
¿Qué variante de Klein descargar?
Destilado vs Base
Los checkpoints destilados se han destilado a 4 pasos de muestreo. Eso es lo que hace rápido a Klein: BFL afirma que la familia genera o edita imágenes en menos de 0,5 segundos en hardware moderno, y el equipo de ComfyUI midió unos 1,2 segundos de principio a fin con el 4B destilado en una RTX 5090.
Los checkpoints Base no están destilados. Necesitan muchos más pasos, pero BFL indica que ofrecen mayor diversidad de resultados, y son los adecuados para fine-tuning y entrenamiento de LoRA. La model card de Base 9B lo describe como "ideal for fine-tuning, LoRA training, research, and custom pipelines where control matters more than speed."
4B vs 9B
El 9B es el modelo Klein insignia de BFL; según la empresa, iguala o supera a modelos cinco veces más grandes. El 4B es la opción accesible: cabe en unos 13GB de VRAM, lo que BFL asocia a una RTX 3090 o 4070 en adelante. Si tu GPU tiene menos de 24GB, empieza con el flujo 4B o con los pesos 9B en FP8 y los consejos para poca VRAM que verás más abajo.
Licencia: qué puedes hacer y qué no
Esta es la parte que la mayoría de guías locales se salta. Klein 4B y Base 4B son Apache 2.0, que permite el uso comercial. Klein 9B y Base 9B usan la FLUX Non-Commercial License. Según esa licencia, el modelo y sus derivados solo pueden usarse con fines no comerciales, y la licencia excluye expresamente el uso del modelo con fines comerciales o de producción. La misma licencia indica que BFL no reclama la propiedad de los resultados y que puedes usarlos para cualquier fin, incluido el comercial, salvo lo que la licencia prohíbe, como usarlos para entrenar un modelo competidor.
En la práctica: experimentar, investigar y hacer proyectos personales con el 9B está permitido. Ejecutar el 9B dentro de un producto de pago o de un pipeline de producción requiere una licencia comercial de BFL (bfl.ai/licensing), o puedes pasarte al 4B con licencia Apache o a un modelo FLUX.2 alojado. Esto no es asesoramiento legal, así que lee el texto de la licencia.
| Tu caso de uso | Opción recomendada |
|---|---|
| Aprendizaje, investigación, arte personal | Klein 9B o Base 9B en local |
| Producto comercial, autoalojado | Klein 4B (Apache 2.0), o licencia comercial de BFL para el 9B |
| Producto comercial, sin GPU que gestionar | FLUX.2 Pro o Flex alojado mediante API |
| Entrenamiento de LoRA | Klein Base 9B o Base 4B |
Requisitos previos: hardware, software y acceso
GPU y memoria
| Configuración | Qué esperar |
|---|---|
| 9B en BF16 | Unos 29GB de VRAM según la model card; RTX 4090 o superior con offloading |
| 9B en FP8 | Hasta un 40% menos de VRAM que BF16 según BFL; cifra exacta para el 9B sin confirmación oficial |
| 9B en NVFP4 | Hasta un 55% menos de VRAM según BFL; requiere una GPU NVIDIA RTX reciente |
| 4B destilado, FP8 en ComfyUI | 8,4GB de VRAM medidos por ComfyUI en una RTX 5090 |
| 4B Base, FP8 en ComfyUI | 9,2GB de VRAM medidos por ComfyUI en una RTX 5090 |
BFL también indica que FP8 es hasta 1,6 veces más rápido y NVFP4 hasta 2,7 veces más rápido, en pruebas con RTX 5080 y 5090 a 1024x1024.
Versión de ComfyUI
Klein usa nodos nuevos de FLUX.2 como Flux2Scheduler y EmptyFlux2LatentImage. La documentación de ComfyUI dice que, si no aparecen las plantillas de Klein o los nodos no cargan, tu instalación está desactualizada, y recomienda la versión más reciente (Nightly). La app Desktop puede ir por detrás de la versión principal, así que actualiza antes de investigar cualquier otro problema.
Acceso a Hugging Face
Los repositorios 9B son restringidos (gated). Inicia sesión en Hugging Face, abre el repositorio Klein 9B FP8, acepta la licencia y la Acceptable Use Policy y crea un token de lectura para descargar desde la línea de comandos.
Paso 1: descarga los archivos del modelo
El tutorial de ComfyUI enumera estos archivos para el flujo 9B:
| Archivo | Origen | Carpeta de ComfyUI |
|---|---|---|
flux-2-klein-9b-fp8.safetensors (destilado) | black-forest-labs/FLUX.2-klein-9b-fp8 | models/diffusion_models/ |
flux-2-klein-base-9b-fp8.safetensors (Base) | black-forest-labs/FLUX.2-klein-base-9b-fp8 | models/diffusion_models/ |
qwen_3_8b_fp8mixed.safetensors | Comfy-Org/flux2-klein-9B | models/text_encoders/ |
flux2-vae.safetensors | Comfy-Org/flux2-dev | models/vae/ |
Para empezar solo necesitas un modelo de difusión. Elige el archivo destilado si buscas velocidad, o el Base si vas a entrenar LoRAs.
export HF_TOKEN=hf_xxx
curl -L -H "Authorization: Bearer $HF_TOKEN" \
-o ComfyUI/models/diffusion_models/flux-2-klein-9b-fp8.safetensors \
https://huggingface.co/black-forest-labs/FLUX.2-klein-9b-fp8/resolve/main/flux-2-klein-9b-fp8.safetensors
curl -L -o ComfyUI/models/text_encoders/qwen_3_8b_fp8mixed.safetensors \
https://huggingface.co/Comfy-Org/flux2-klein-9B/resolve/main/split_files/text_encoders/qwen_3_8b_fp8mixed.safetensors
curl -L -o ComfyUI/models/vae/flux2-vae.safetensors \
https://huggingface.co/Comfy-Org/flux2-dev/resolve/main/split_files/vae/flux2-vae.safetensors
La estructura resultante debería verse así:
ComfyUI/
└── models/
├── diffusion_models/
│ └── flux-2-klein-9b-fp8.safetensors
├── text_encoders/
│ └── qwen_3_8b_fp8mixed.safetensors
└── vae/
└── flux2-vae.safetensors
No mezcles codificadores entre tamaños. El flujo 4B usa qwen_3_4b.safetensors y el flujo 9B usa el codificador Qwen3 8B.
Paso 2: crea el flujo de texto a imagen
Lo más fácil es partir de la plantilla integrada. En ComfyUI, abre el explorador de plantillas y carga Flux.2 Klein 9B Text to Image (image_flux2_text_to_image_9b). El JSON de la plantilla es público en el repositorio Comfy-Org workflow_templates, así que puedes revisarlo antes de ejecutarlo.
Los nodos del grafo
| Nodo | Función | Ajuste clave |
|---|---|---|
UNETLoader (Load Diffusion Model) | Carga el transformer de Klein | flux-2-klein-9b-fp8.safetensors |
CLIPLoader | Carga el codificador Qwen3 | type flux2 |
VAELoader | Carga el VAE de FLUX.2 | flux2-vae.safetensors |
CLIPTextEncode | Codifica el prompt positivo | Tu prompt |
EmptyFlux2LatentImage | Crea el latente vacío | Ancho y alto, p. ej. 1024x1024 |
Flux2Scheduler | Genera la planificación de sigmas | Pasos, ancho, alto |
CFGGuider | Aplica el guidance | Valor de CFG |
KSamplerSelect | Elige el sampler | euler |
RandomNoise | Fija la semilla | Semilla fija para reproducibilidad |
SamplerCustomAdvanced | Ejecuta el bucle de muestreo | Solo entradas |
VAEDecode y luego SaveImage | Decodifica y guarda | Prefijo del nombre de archivo |
La plantilla 9B oficial carga el checkpoint Base con 20 pasos y CFG 5. Si cambias el UNETLoader al archivo destilado, pon el Flux2Scheduler en 4 pasos y el CFGGuider en 1.0, como indican la model card del destilado y la plantilla de edición destilada de ComfyUI. Dejar los ajustes del Base en el modelo destilado desperdicia tiempo y puede "quemar" la imagen.
Ajustes que funcionan
| Ajuste | 9B destilado | 9B Base |
|---|---|---|
| Pasos | 4 | 20 (plantilla de ComfyUI) a 50 (ejemplo de la model card) |
| CFG / guidance | 1.0 | 4.0 a 5.0 |
| Sampler | euler | euler |
| Resolución | Empieza en 1024x1024 | Empieza en 1024x1024 |
| Semilla | Fíjala mientras ajustas prompts | Fíjala mientras ajustas prompts |
Mantén el ancho y el alto del Flux2Scheduler iguales al tamaño del latente. Las plantillas oficiales conectan ambos a los mismos valores de ancho y alto, así que copia ese patrón al construir tu propio grafo o al pasar a un formato no cuadrado.
Un prompt para probar el pipeline
Klein entiende bien las descripciones en lenguaje natural, así que escribe los prompts como frases completas con sujeto, escenario, iluminación y cualquier texto que deba aparecer:
A vintage motorcycle parked outside a 1950s roadside diner at dusk, neon sign reading "OPEN LATE", wet asphalt reflecting pink and teal light, 35mm photo, shallow depth of field
Si la primera imagen sale en pocos segundos y el texto del letrero se lee bien, la instalación funciona. Para más ideas de estructura de prompts aplicables a los modelos FLUX en general, consulta nuestra guía de prompts de FLUX 3.
Paso 3: crea el flujo de edición de imágenes
Klein usa el mismo modelo para editar, así que no necesitas un checkpoint aparte al estilo de Kontext. ComfyUI incluye dos plantillas de edición 9B: image_flux2_klein_image_edit_9b_distilled y image_flux2_klein_image_edit_9b_base.
Qué cambia en el grafo de edición
| Nodo añadido | Qué hace |
|---|---|
LoadImage | Carga la imagen de origen o de referencia |
ImageScaleToTotalPixels | Reescala la imagen a aproximadamente 1 megapíxel |
GetImageSize | Pasa el tamaño reescalado al latente y al scheduler |
VAEEncode | Convierte la imagen de referencia en latente |
ReferenceLatent | Añade el latente de referencia al conditioning |
ConditioningZeroOut | Crea el conditioning negativo vacío |
El latente de referencia se añade tanto al prompt positivo como al conditioning negativo puesto a cero, y ambos entran en CFGGuider. Como GetImageSize controla EmptyFlux2LatentImage y Flux2Scheduler, la salida conserva la relación de aspecto de tu primera imagen de referencia.
Edición con una referencia
Carga una imagen y describe el cambio, no la escena completa. La plantilla de edición destilada usa 4 pasos y CFG 1, y esos mismos ajustes son el punto de partida adecuado para tus ediciones.
Change the jacket to deep red leather, keep the face, pose, background and lighting unchanged
Edición con varias referencias
Con dos o más imágenes, la plantilla encadena un ReferenceLatent por imagen en los caminos positivo y negativo. En el prompt, menciona las imágenes por orden:
Place the white handbag from image 2 on the woman's shoulder in image 1, match the soft window light of image 1
La documentación de BFL indica compatibilidad con hasta 4 imágenes de referencia para Klein en su API (resumen de FLUX.2); en un grafo local, más referencias también implican más memoria y ejecuciones más lentas.
Solución de problemas y optimización para poca VRAM
Errores comunes y soluciones
| Síntoma | Causa probable | Solución |
|---|---|---|
| Falta la plantilla o aparecen cajas rojas de "missing node" | ComfyUI demasiado antiguo para los nodos de FLUX.2 | Actualiza ComfyUI; usa la versión Nightly si hace falta |
| 401 o 403 al descargar el archivo 9B | Repositorio restringido, licencia sin aceptar o sin token | Acepta la licencia en Hugging Face y envía un token de lectura |
| Shape o size mismatch al cargar el codificador de texto | Codificador 4B con el modelo 9B, o tipo de CLIP incorrecto | Usa el codificador Qwen3 8B y pon el tipo de CLIPLoader en flux2 |
| CUDA out of memory | Pesos BF16 o resolución alta | Usa pesos FP8, empieza en 1024x1024 y cierra otras apps que usen la GPU |
| Imágenes borrosas o "quemadas" con el modelo destilado | Ajustes del Base (20+ pasos, CFG 4 a 5) | Pon 4 pasos y CFG 1.0 |
| Imágenes ruidosas y sin terminar con el Base | Muy pocos pasos | Usa de 20 a 50 pasos |
| La edición ignora la referencia | ReferenceLatent sin conectar al conditioning | Conéctalo en los caminos positivo y negativo |
Lista de comprobación para poca VRAM
- Prueba primero los checkpoints FP8; BFL habla de hasta un 40% menos de VRAM. NVFP4 ahorra aún más en tarjetas RTX compatibles.
- Usa el codificador de texto
fp8mixeden lugar de uno de precisión completa. - Inicia ComfyUI con
--lowvrampara que partes del modelo se descarguen a la RAM del sistema cuando la GPU se llene. - Genera a 1024x1024 o menos y escala después, en lugar de muestrear a tamaños muy grandes.
- Mantén el batch size en 1 y reduce el número de imágenes de referencia en los grafos de edición.
- Si el 9B sigue sin caber, el 4B destilado funcionó con 8,4GB en la medición de ComfyUI.
python main.py --lowvram
Ejecutar Klein 9B con Diffusers
Si prefieres Python a un grafo de nodos, la model card incluye un ejemplo con Diffusers. Requiere la versión de desarrollo de Diffusers:
pip install git+https://github.com/huggingface/diffusers.git
import torch
from diffusers import Flux2KleinPipeline
pipe = Flux2KleinPipeline.from_pretrained(
"black-forest-labs/FLUX.2-klein-9B", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload() # offloads idle parts to CPU to save VRAM
image = pipe(
prompt="A cat holding a sign that says hello world",
height=1024,
width=1024,
guidance_scale=1.0,
num_inference_steps=4,
generator=torch.Generator("cuda").manual_seed(0),
).images[0]
image.save("flux-klein.png")
Para Base 9B, cambia el repositorio a black-forest-labs/FLUX.2-klein-base-9B y usa guidance_scale=4.0 con num_inference_steps=50, como en el ejemplo de esa card.
Cuándo conviene más FLUX.2 Pro o Flex alojado
Klein en local es excelente para iterar rápido, hacer experimentos privados y trabajar con LoRA. Resulta menos práctico cuando necesitas derechos comerciales sobre el modelo 9B, disponibilidad garantizada o más capacidad de la que ofrece una GPU.
Klein 9B en local vs FLUX.2 alojado
| Necesidad | Klein 9B en local | FLUX.2 alojado en APIMart |
|---|---|---|
| Hardware | Tu GPU, unos 29GB en BF16 | Ninguno |
| Uso comercial del modelo | Requiere licencia comercial de BFL | Se rige por los términos de la API, no por la licencia open-weight |
| Configuración | ComfyUI, archivos de modelo, actualizaciones | Una clave de API |
| Imágenes de referencia | BFL indica hasta 4 para Klein | Hasta 8 por solicitud |
| Control de pasos y guidance | Total | Solo Flex (steps de 1 a 50, guidance de 1.5 a 10) |
| Tamaño de salida | El límite de tu GPU | Hasta 4MP |
| LoRAs personalizados | Sí, con el Base | No |
| Modelo de coste | Tu hardware y electricidad | Por imagen; consulta la página del modelo para ver precios actuales |
Cómo elegir un modelo alojado
APIMart ofrece tres ID de modelo FLUX.2 en el endpoint /v1/images/generations: flux-2-pro para producción diaria equilibrada, flux-2-flex cuando quieres ajustar pasos y guidance (por ejemplo, carteles con mucha tipografía) y flux-2-max para la máxima calidad a menor velocidad. El precio depende del nivel de resolución de salida y del número de imágenes de referencia; consulta la página del modelo FLUX.2 antes de presupuestar.
curl --request POST \
--url https://api.apimart.ai/v1/images/generations \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '{
"model": "flux-2-flex",
"prompt": "Minimal poster with the headline SUMMER SALE and a small line reading 50% OFF",
"resolution": "2K",
"size": "3:4",
"steps": 50,
"guidance": 6.5
}'
La llamada es asíncrona y devuelve data[0].task_id. Consulta GET https://api.apimart.ai/v1/tasks/{task_id} hasta que status sea completed y lee la URL de la imagen en result.images. Para editar con referencias, envía hasta 8 URL públicas en image_urls. Para un patrón de producción con reintentos y almacenamiento, consulta nuestra guía de flujos de imagen con FLUX para desarrolladores y, para una comparación de velocidad y VRAM con otro modelo abierto rápido, lee Z-Image Turbo vs Flux.
Un enfoque híbrido práctico
Muchos equipos prototipan prompts y LoRAs con Klein en local y luego envían los renders finales o de cara al cliente a un modelo FLUX.2 alojado. Los prompts escritos como frases descriptivas sencillas funcionan bien en ambos, así que rara vez hay que reescribirlos.
Preguntas frecuentes
¿Qué diferencia hay entre FLUX.2 Klein 9B y Klein Base 9B?
Klein 9B está destilado para funcionar en 4 pasos con guidance 1.0, lo que lo hace lo bastante rápido para generar casi en tiempo real. Klein Base 9B es el modelo fundacional sin destilar; necesita de 20 a 50 pasos, pero ofrece más diversidad de resultados y es el punto de partida recomendado para fine-tuning y entrenamiento de LoRA.
¿Puedo usar FLUX.2 Klein 9B con fines comerciales?
El modelo en sí, no, sin un acuerdo aparte. Los dos checkpoints 9B usan la FLUX Non-Commercial License, que limita el uso del modelo a fines no comerciales; BFL ofrece licencias comerciales en bfl.ai/licensing. La licencia dice que los resultados pueden usarse para cualquier fin, incluido el comercial, con algunas excepciones, así que léela completa. Klein 4B es Apache 2.0 si necesitas una opción comercial autoalojada.
¿Cuánta VRAM necesita FLUX.2 Klein 9B?
La model card habla de unos 29GB a precisión completa, lo que apunta a una RTX 4090 o superior con offloading a CPU. Los pesos FP8 reducen el uso de memoria hasta un 40% y NVFP4 hasta un 55%, según BFL; no hay una cifra oficial confirmada de VRAM para el 9B en FP8. Con tarjetas de 16GB o menos, el 4B es la opción más segura.
¿Qué pasos y CFG debo usar en ComfyUI?
Para el 9B destilado, usa 4 pasos y CFG 1.0 con el sampler euler. Para Base 9B, la plantilla de ComfyUI usa 20 pasos y CFG 5, y el ejemplo de Hugging Face usa 50 pasos y guidance 4.0. En ambos casos, empieza a 1024x1024.
¿Klein necesita un modelo aparte para editar imágenes?
No. Un solo checkpoint de Klein hace texto a imagen, edición con una referencia y edición con varias referencias. En ComfyUI basta con añadir los nodos LoadImage, VAEEncode y ReferenceLatent al grafo de texto a imagen, o cargar la plantilla oficial de edición.
¿Está FLUX.2 Klein disponible en APIMart?
No. APIMart ofrece los modelos alojados FLUX.2 Pro, Flex y Max, no Klein. Son una buena alternativa si prefieres llamar a una API antes que gestionar una licencia open-weight, necesitas hasta 8 imágenes de referencia o no tienes una GPU local adecuada.
Qué seguir de cerca
Klein avanza rápido en la comunidad, con muchos adapters, fine-tunes y cuantizaciones ya listados en su página de Hugging Face. Sigue de cerca las actualizaciones de plantillas de ComfyUI, los nuevos pesos cuantizados y los cambios de licencia de BFL, porque cada uno puede cambiar lo que cabe en tu GPU y lo que puedes lanzar. Si tu carga de trabajo supera una sola máquina o necesita términos comerciales claros, prueba los mismos prompts en FLUX.2 Pro o Flex alojado antes de escalar.
Sobre el equipo de APIMart
El equipo de APIMart escribe guías de modelos, comparativas y análisis de precios para desarrolladores que construyen con IA. APIMart ofrece una sola API para más de 500 modelos de chat, imagen y vídeo, así que puedes comparar los modelos de este artículo antes de lanzar.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.