APIMart
Guía de precios de LLM: compara más de 500 modelos de IA

Guía de precios de LLM: compara más de 500 modelos de IA

Compara precios de API de LLM y multimedia en más de 500 modelos de OpenAI, Anthropic, Google, Meta, xAI, Mistral y más, por coste de token, imagen y vídeo.

Análisis de modelos

El gasto en IA puede dispararse rápido: las empresas estadounidenses gastan ahora una media de $85,500 al mes en IA. Mi conclusión principal es sencilla: el modelo más barato sobre el papel no siempre es la opción de menor coste una vez que tienes en cuenta la longitud de la salida, el tamaño del contexto, los reintentos, las tarifas de herramientas y los límites del plan.

Si tuviera que elegir a partir de esta guía, me fijaría primero en cuatro cosas:

  • Precio unitario: tokens, imágenes o segundos de vídeo
  • Límites: RPM, TPM, ventanas de contexto y topes del plan
  • Modalidad: compatibilidad con texto, imagen, audio, vídeo y visión
  • Coste por salida terminada: no solo el precio de lista

El artículo compara APIMart, OpenAI, Anthropic, Google AI, Meta, xAI, Mistral, Cohere, Runway, Stability AI, Black Forest Labs, y Kling AI.

Destacan algunos patrones claros:

  • Los precios del texto varían mucho. OpenAI va desde $0.05 hasta $30.00 por 1M de tokens de entrada.
  • La salida suele ser mucho más cara que la entrada. En algunos casos, la salida cuesta de 4x a 6x más.
  • El contexto largo puede cambiar la factura. OpenAI aplica precios más altos a partir de 270,000 tokens, y Google cambia las tarifas por encima de 200,000 tokens.
  • Los trabajos por lotes pueden reducir costes. OpenAI, Anthropic y Mistral ofrecen descuentos del 50% para el procesamiento asíncrono.
  • Los costes de vídeo se acumulan con los reintentos. Una tarifa barata por segundo puede acabar convirtiéndose en un coste mucho mayor por clip terminado.
  • La facturación unificada importa para los equipos que usan muchos formatos. La propuesta de APIMart es una sola API y una sola factura para más de 500 modelos.

Si quieres la versión corta:
usa modelos económicos para texto de alto volumen, modelos de gama media para aplicaciones en producción, modelos premium solo cuando la calidad de la salida cambie los resultados del negocio, y haz borradores de vídeo en baja resolución antes de pagar por los renders finales.

¿Qué son los tokens de LLM y los precios de API? (Apto para principiantes)

Comparación rápida

Comparación de precios de modelos de IA: coste por 1M de tokens por proveedor (2026)
Comparación de precios de modelos de IA: coste por 1M de tokens por proveedor (2026)
ProveedorFortaleza principalA tener en cuentaMejor encaje
APIMartUna API para más de 500 modelos de texto, imagen, vídeo y audioLos costes de uso siguen escalando con el volumenEquipos que quieren una única configuración de facturación
OpenAIAmplia gama de modelos y precios por token claros y consejos de costeLos mejores modelos se encarecen rápidoTexto, imagen, audio y vídeo en general
AnthropicFuerte para programación y contexto largoLas tarifas de salida son altasAgentes, programación, prompts largos
Google AIOpciones Flash de bajo coste y contexto grandeTarifas más altas por encima de 200K tokensAplicaciones de texto de alto volumen y multimodales
MetaPrecios muy bajos de Llama alojado o autoalojadoLos precios y límites dependen del hostEquipos centrados en el coste con opciones de alojamiento
xAIMenor diferencia entre precios de entrada y salidaLas llamadas a herramientas añaden tarifas extraAplicaciones de respuesta larga y uso de herramientas
MistralPrecios bajos por token y descuentos por lotesAlgunas herramientas cuestan másTexto de utilidad, programación, uso con base en la UE
CohereBuen encaje para RAG, embeddings y rerankMenos adecuado para generación multimediaBúsqueda, recuperación, bases de conocimiento
RunwayPlataforma centrada en vídeo con cálculo de créditos claroLos reintentos pueden disparar el coste finalCreación y edición de vídeo
Stability AIPrecios bajos de imagen y herramientas de ediciónAlcance más estrecho que los proveedores de textoTrabajo de imagen y audio de alto volumen
Black Forest LabsPrecios de imagen detallados por tamañoLos costes suben con reintentos y referenciasGeneración y edición de imágenes
Kling AIGeneración de vídeo corto de bajo costeLímites de duración de clip y concurrenciaVídeo de formato corto

Así que antes de comparar precios línea por línea, empezaría con una pregunta: ¿Por qué estoy pagando más: tokens, imágenes, segundos o reintentos?

1. APIMart

APIMart

APIMart usa facturación de pago por uso con sin mínimos mensuales y sin tarifas ocultas. Los precios cambian según la modalidad, por lo que texto, imagen, vídeo y audio no se facturan de la misma forma.

Precios unitarios

Los precios varían según la modalidad, como muestra la tabla siguiente.

ModalidadUnidad de facturaciónModelo de ejemploPrecio de APIMart
TextoPor 1M de tokensQwen2.5-VL-72B$20.00
ImagenPor llamadaGPT Image 2$0.006
ImagenPor llamadaWan 2.7 Image$0.0216
VídeoPor segundoSora 2$0.08
VídeoPor segundoKling V3 (720p)$0.0672

Los costes de generación de imágenes pueden variar mucho según el nivel de calidad. Por ejemplo, una llamada a GPT-Image-2-Official de 1024×1024 cuesta unos $0.00488 en calidad baja, $0.04232 en media y $0.16872 en alta. Esa diferencia se acumula rápido. Si no se requiere una salida de gama alta, usar un nivel inferior puede reducir el gasto por llamada.

Límites incluidos

Las cuentas por defecto vienen con límites de RPM y TPM. Las cuentas empresariales pueden solicitar canales de mayor rendimiento.

Cobertura de modelos

APIMart admite modelos de texto, imagen, vídeo y audio a través de una sola API. Eso incluye modelos como GPT-5, Claude, Sora 2, Midjourney y Kling V3.

Coste por salida

La principal ventaja aquí es la facturación consolidada entre modalidades. En lugar de manejar facturas separadas para texto, imagen y vídeo, obtienes una sola configuración que facilita el control del gasto.

A continuación, la guía compara cómo los principales proveedores estructuran sus precios en modelos de texto, imagen y vídeo.

2. OpenAI

OpenAI

OpenAI usa un modelo de precios de pago por token para el texto. Y la diferencia entre modelos es enorme.

A junio de 2026, los precios empiezan en $0.05 por 1M de tokens de entrada para GPT-5 nano y llegan hasta $30.00 por 1M de tokens de entrada para GPT-5.5 Pro [3][5]. La forma más fácil de leer los precios de OpenAI es por nivel de modelo, porque las tarifas de entrada, salida y tokens en caché pueden ser muy diferentes de un modelo a otro.

Precios unitarios

ModeloEntrada (por 1M)Entrada en cachéSalida (por 1M)
GPT-5.5 Pro$30.00-$180.00
GPT-5.5 (Standard)$5.00$0.50$30.00
GPT-5.4$2.50$0.25$15.00
GPT-5.4 mini$0.75$0.075$4.50
GPT-5.4 nano$0.20$0.02$1.25
GPT-5 nano$0.05$0.005$0.40

En todos los modelos de OpenAI, los tokens de salida cuestan de 4 a 6 veces más que los de entrada [6]. Eso importa mucho cuando tu aplicación produce respuestas largas, resúmenes o respuestas de estilo agente. OpenAI también ofrece niveles Batch y Flex con un descuento fijo del 50% en todos los modelos, por lo que la entrada de GPT-5.5 baja de $5.00 a $2.50 por 1M de tokens [5].

Los costes pueden volver a subir cuando el uso de contexto largo alcanza los precios con recargo.

Límites incluidos

OpenAI duplica las tarifas tanto de entrada como de salida una vez que el contexto total supera los 270,000 tokens [3][5]. Si trabajas con revisión de documentos largos o bucles de agente de varios turnos, el resumen progresivo es una de las formas más sencillas de mantenerte por debajo de esa línea.

OpenAI usa esta misma configuración de precios también en modelos de imagen, audio y vídeo.

Cobertura de modelos

OpenAI cobra por separado la generación de imagen, audio y vídeo. Sora-2 cuesta $0.10 por segundo para vídeo 720p, mientras que Sora-2-pro a 1080p cuesta $0.70 por segundo a la tarifa estándar [5].

Para otros formatos multimedia:

  • Los precios de imagen van de $2.50 a $8.00 por 1M de tokens
  • La transcripción con Whisper cuesta $0.006 por minuto
  • TTS (tts-1) cuesta $0.015 por 1,000 caracteres [3][4]

Coste por salida

Una de las formas más rápidas de recortar el gasto es sencilla: envía el trabajo de menor valor a modelos más baratos. Procesar 10,000 tickets de soporte cuesta unos $16 con GPT-4.1, $3.20 con GPT-4.1 mini y $0.80 con GPT-4.1 nano [4].

3. Anthropic

Anthropic

Anthropic divide su línea de API de Claude en cuatro niveles de precios: Frontier/Research (Claude Fable 5 / Mythos 5), Flagship (Claude Opus 4.5–4.8), Gama media (Claude Sonnet 4.5–4.6) y Económico (Claude Haiku 4.5) [9][10]. El patrón es bastante claro. A medida que subes de nivel, obtienes más profundidad de razonamiento y mejor salida, pero la factura también sube rápido. Para la mayoría de los compradores, la elección se reduce a esto: Haiku es la opción de bajo coste, Sonnet es el término medio, y Opus/Fable están hechos para trabajos más pesados.

Precios unitarios

Anthropic cobra los tokens de salida a 5x la tarifa de entrada en toda la línea escalonada actual [7][6]. Los precios de abajo están en USD por 1 millón de tokens [13][15].

ModeloEntrada (por 1M)Lectura de caché (por 1M)Salida (por 1M)
Claude Fable 5 / Mythos 5$10.00$1.00$50.00
Claude Opus 4.8$5.00$0.50$25.00
Claude Sonnet 4.6$3.00$0.30$15.00
Claude Haiku 4.5$1.00$0.10$5.00

El almacenamiento en caché de prompts puede recortar costes cuando reutilizas el mismo prefijo una y otra vez. Las escrituras en caché cuestan 1.25x la tarifa de entrada base para un TTL de 5 minutos, o 2x para un TTL de 1 hora. Las lecturas de caché cuestan el 10% de la entrada estándar. En la práctica, el almacenamiento en caché empieza a tener sentido después de cuatro o más usos del mismo prefijo [3][9][12].

Límites incluidos

La mayoría de los modelos actuales flagship y de gama media de Anthropic —incluidos Fable 5, Mythos 5, Opus 4.6–4.8 y Sonnet 4.6— vienen con una ventana de contexto de 1M de tokens a precio estándar [9][11]. Claude Haiku 4.5 llega hasta 200,000 tokens. Los límites de tasa siguen una configuración escalonada, desde Tier 1 hasta Enterprise, con topes de RPM y TPM fijados por plan [13][15].

Cobertura de modelos

Los modelos de Anthropic manejan entradas de texto y visión, y Computer Use añade una sobrecarga extra de tokens. Algunos complementos se facturan por separado:

  • La búsqueda web cuesta $10 por 1,000 búsquedas
  • Los Managed Agents cuestan $0.08 por hora de sesión activa, más los cargos por tokens

La Batch API reduce los costes de tokens en un 50% para trabajos asíncronos con un plazo de entrega de 24 horas [8][9][11].

Coste por salida

Aquí es donde los precios se vuelven prácticos: ¿qué nivel se mantiene rentable para tareas repetidas, trabajo de contexto largo y flujos de agentes?

Una sesión de programación de una hora en Claude Opus 4.8, usando 50,000 tokens de entrada con 40,000 como lecturas de caché y 15,000 tokens de salida, cuesta unos $0.525, incluida la tarifa de sesión de agente de $0.08 [9][12]. Eso te da una imagen bastante buena de cómo se comportan los precios de Anthropic en el uso real, no solo en una tabla de precios.

Para trabajos de producción como asistentes de programación y agentes de varios pasos, Claude Sonnet 4.6 tiende a ofrecer el mejor equilibrio entre coste y capacidad [6][3].

A continuación, compara los precios de Google AI en sus modelos de texto y multimodales de Gemini.

4. Google AI

Google AI

Google fija los precios de sus modelos en función del modelo que elijas y del tamaño de la ventana de contexto. Una regla de precios importa desde el principio: mantén los prompts por debajo de 200,000 tokens si quieres evitar la tarifa más alta [14][3].

Precios unitarios

ModeloEntrada (por 1M)Salida (por 1M)Ventana de contexto
Gemini 3.1 Pro (≤200K)$2.00$12.001M–2M
Gemini 3.1 Pro (>200K)$4.00$18.001M–2M
Gemini 2.5 Pro (≤200K)$1.25$10.002M
Gemini 3.5 Flash$1.50$9.001M
Gemini 3 Flash$0.50$3.001M
Gemini 2.5 Flash$0.30$2.501M
Gemini 3.1 Flash-Lite$0.25$1.501M
Gemini 2.5 Flash-Lite$0.10$0.401M
Gemini 3 4B$0.04$0.08131K

Para la generación de imágenes, Imagen 4 Fast empieza en $0.01–$0.02 por imagen, mientras que Imagen 4 Ultra cuesta $0.06 por imagen. El vídeo de Veo 3.1 se factura por segundo. El estándar cuesta $0.40 por segundo para 720p y 1080p, y Light cuesta $0.05–$0.08 por segundo [17].

Límites incluidos

El precio del modelo es solo parte de la historia. Los límites de rendimiento y la configuración de datos pueden cambiar tu gasto total de manera importante.

El principal compromiso de Google es bastante claro: precios bajos de modelo por un lado, y límites de rendimiento más restricciones de datos por el otro. En Google AI Studio, el nivel gratuito te da unos 15 RPM, tokens gratuitos y uso de datos para mejorar el producto. El nivel de pago salta a unos 1,000–2,000 RPM, desactiva el uso de datos para mejorar el producto, y añade caché de contexto más Batch API. Los planes empresariales añaden rendimiento aprovisionado, descuentos por volumen y funciones de cumplimiento [17][18].

La caché de contexto es una de las mayores palancas de coste aquí. Escribir en la caché es gratis, y leer de ella cuesta el 25% de la tarifa de entrada estándar [18].

Cobertura de modelos

La línea de Google abarca modelos de texto, multimodales, de imagen y de vídeo. También admite entrada de imagen, a partir de $0.0025 por imagen [3].

Coste por salida

Para chatbots, resúmenes y clasificación, Gemini 2.5 Flash o Gemini 3.1 Flash-Lite suelen ser lo más sensato. Son más baratos y encajan bien con muchas cargas de trabajo del día a día. Reserva Gemini 3.1 Pro para casos en los que necesites la ventana de contexto más grande, y usa el resumen progresivo para mantenerte por debajo del límite de 200,000 tokens [3][6].

Hay también un ángulo de precio simple que vale la pena señalar. A $2.00 por 1M de tokens de entrada, Gemini 3.1 Pro es más barato que modelos flagship como GPT-5.5 ($5.00) y Claude Opus 4.8 ($5.00) para prompts de longitud estándar [2].

A continuación, compara los precios y la cobertura de modelos de Meta.

5. Meta

Meta funciona un poco distinto de los proveedores de modelos cerrados anteriores. Sus modelos Llama son de peso abierto, por lo que tu coste depende de dónde los alojes o accedas a ellos. En la práctica, eso significa que exactamente el mismo modelo puede tener precios muy diferentes de un proveedor a otro. Por ejemplo, Llama 3.3 70B se ha listado por tan solo $0.10 por 1M de tokens de entrada. Meta tampoco publica una hoja de precios de API propia, razón por la cual los precios pueden variar tanto entre hosts [1][19][20].

Precios unitarios

Los precios actuales se centran en Llama 4 Scout y Llama 4 Maverick [21][22].

ModeloEntrada (por 1M)Salida (por 1M)Ventana de contexto
Llama 4 Scout$0.08 – $0.17$0.15 – $0.66Hasta 10,000,000 tokens
Llama 4 Maverick$0.15 – $0.24$0.60 – $0.971,000,000 tokens
Llama 3.3 70B$0.10 – $0.72$0.32 – $0.72128K – 131K tokens
Llama 3.2 1B Instruct$0.01 – $0.02$0.01 – $0.0260K – 131K tokens
Llama 3.1 405B Instruct$0.90 – $3.00$0.90 – $3.00128K – 131K tokens

Ese precio de lista bajo se ve genial sobre el papel. Pero solo ayuda si los límites de contexto y los topes de rendimiento del host coinciden con tu carga de trabajo.

Límites incluidos

No hay un único plan estándar de Meta con límites de tasa compartidos o un nivel gratuito integrado. Los hosts fijan sus propios límites de rendimiento, topes de contexto y reglas de caché. Así que si planeas trabajo de contexto largo con Llama 4 Scout, comprueba primero el techo de contexto del host en lugar de asumir que obtendrás todo el rango anunciado.

Cobertura de modelos

Llama 4 Scout y Llama 4 Maverick admiten ambos entrada de texto y visión, además de llamadas a herramientas y modo JSON en los principales proveedores [21][22]. Las opciones más antiguas también tienen su lugar. Llama 3.2 11B Vision todavía puede manejar trabajos intensivos en visión, mientras que Llama 3.2 1B Instruct está orientado a despliegues en el borde donde la baja latencia y el uso de cómputo ajustado importan más [21][22].

Coste por salida

Si ejecutas trabajos de alto volumen con prompts largos, Scout destaca. Una tarea de programación con 40K de entrada y 8K tokens de salida cuesta unos $0.005 por tarea, lo que se traduce en aproximadamente 200 tareas por $1. Esa misma tarea en GPT-5.5 cuesta unos $0.44, o solo 2.3 tareas por $1 [6].

Para uso de cara al cliente o trabajo multimodal, Llama 4 Maverick suele ser la mejor opción. Supera a GPT-4o en benchmarks mientras cuesta mucho menos en precios de entrada: $0.15/M de entrada frente a $2.50/M de entrada [6]. Su menor diferencia entre precios de entrada y salida también lo hace un buen encaje cuando esperas respuestas más largas.

A continuación, compara los precios y la cobertura de modelos de xAI.

6. xAI

xAI

xAI mantiene bajos los precios de entrada y salida, lo que ayuda cuando las respuestas se alargan. Grok 4.3 cobra $1.25 por 1 millón de tokens de entrada y $2.50 por 1 millón de tokens de salida. Esa diferencia de 2x importa cuando un modelo te escribe mucho de vuelta [6][24].

Precios unitarios

ModeloEntrada (por 1M)Entrada en cachéSalida (por 1M)Ventana de contexto
Grok 4.3 (Flagship)$1.25$0.20$2.501M tokens
Grok 4.20 (Reasoning)$1.25$0.20$2.502M tokens
Grok Build 0.1 (Coding)$1.00$0.20$2.00256K tokens
Grok 4.1 Fast (Budget)$0.20$0.05$0.502M tokens

Para trabajo de imagen, Grok Imagine 1.5 Edit cuesta $0.01875 por llamada [23]. La generación de vídeo a través de la Imagine API va de $0.08 a $0.25 por segundo, según la resolución [24].

Límites incluidos

xAI usa facturación de pago por uso con límites de tasa basados en el uso. Los planes empresariales pueden añadir límites de tasa personalizados e infraestructura dedicada [25][26].

Hay algo que vigilar: el uso de herramientas puede sumar rápido. La búsqueda y la ejecución de código se facturan por separado, por lo que un precio bajo por token no siempre significa una factura final baja. Web Search, X Search y Code Execution cuestan cada uno $5.00 por 1,000 llamadas [24].

Si tus trabajos no son urgentes, la Batch API puede recortar costes en un 20% a 50% para tareas procesadas dentro de 24 horas [24].

Cobertura de modelos

xAI cubre casos de uso de texto, imagen y vídeo [24][16]. Grok 4.20 está hecho para un uso de herramientas más rápido, mientras que Grok Build 0.1 está orientado al trabajo intensivo en programación [6][2].

Coste por salida

Para una tarea de programación estándar con 40K tokens de entrada y 8K tokens de salida, Grok 4.3 cuesta unos $0.07 por tarea. Eso se traduce en aproximadamente 14 tareas por $1 [6].

A continuación, la guía compara la estructura de precios de otro proveedor, o puedes usar una API unificada de LLM para acceder a estos modelos a través de una única integración.

7. Mistral AI

Mistral AI

Mistral Large 3 cuesta $0.50 por 1M de tokens de entrada y $1.50 por 1M de tokens de salida. Eso lo coloca en el grupo de flagship de bajo precio. Las tarifas principales parecen sólidas, pero la factura final puede cambiar una vez que tienes en cuenta los cargos por herramientas y los niveles de facturación de Mistral.

Aquí está la línea actual.

Precios unitarios

ModeloEntrada (por 1M)Entrada en cachéSalida (por 1M)
Mistral Large 3 (Flagship)$0.50$0.05$1.50
Mistral Medium 3.5 (Balanced)$1.50-$7.50
Mistral Small 4 (Efficient)$0.10$0.01$0.30
Magistral Medium (Reasoning)$2.00-$5.00
Codestral (Coding)$0.30$0.03$0.90
Devstral 2 (Coding)$0.40$0.04$2.00
Pixtral Large (Multimodal)$2.00-$6.00

Mistral también cobra por separado por OCR a $4.00 por 1,000 páginas, embeddings a $0.10 por 1M de tokens, y búsqueda web más ejecución de código a $30 por 1,000 llamadas [27].

Límites incluidos

Mistral usa facturación de pago por uso, con cuatro niveles de límite de tasa que se abren a $20, $100 y $500 de gasto acumulado [31]. El plan Team viene con un compromiso mínimo de $50 al mes [27].

Hay dos palancas aquí que pueden recortar costes rápido:

  • La Batch API reduce todos los precios de los modelos en un 50% para trabajos asíncronos [27][31].
  • El almacenamiento en caché de prompts puede reducir los costes de tokens en caché hasta un 90% cuando el prefijo compartido tiene al menos 64 tokens de longitud [31].

Estas reglas de precios importan más cuando ejecutas cargas de trabajo de alto volumen o asíncronas.

Cobertura de modelos

Mistral cubre casos de uso de texto, razonamiento, programación, multimodal y en el borde. Codestral admite fill-in-the-middle (FIM), lo que lo hace un buen encaje para los flujos de trabajo de IDE. La serie Ministral —3B, 8B y 14B— está orientada a despliegues de bajo coste o en el dispositivo [30][32].

Mistral también ofrece endpoints alojados en la UE y procesamiento de datos compatible con el RGPD sin cargo extra [29][31].

Coste por salida

Para trabajo de utilidad de alto volumen como extracción de entidades, clasificación y resúmenes, Mistral Small 4 es el encaje más fuerte [28][31]. Si necesitas más potencia de razonamiento pero aún quieres precios bajos por token, Mistral Large 3 tiene más sentido [28][31].

Para tareas intensivas en razonamiento, Magistral Medium cuesta $5.00 por 1M de tokens de salida y es un 37% más barato en salida que o3 de OpenAI [29].

A continuación, compara los precios de Cohere para cargas de trabajo empresariales de texto y recuperación.

8. Cohere

Cohere

Cohere está construido principalmente para recuperación y búsqueda empresarial. Sus precios lo reflejan: opciones de menor coste para trabajo de recuperación intensivo en texto, y modelos de mayor precio para trabajos multimodales o más exigentes.

Precios unitarios

Cohere divide su línea en tres grupos: modelos de recuperación de bajo coste, modelos multimodales empresariales, y herramientas separadas para embeddings y reranking.

ModeloEntrada (por 1M)Salida (por 1M)Ventana de contexto
Command R7B$0.0375$0.15128K
Command R$0.15$0.60128K
Command R+$2.50$10.00128K
Command A (Multimodal)$2.50$10.00256K
Aya Expanse (8B/32B)$0.50$1.50128K
Embed v3$0.10--
Rerank v3$2.00--

Rerank se factura usando unidades de búsqueda: una consulta más hasta 100 documentos. Si los fragmentos superan los 500 tokens, cuentan por separado [33][35].

Límites incluidos

Cohere te da claves de prueba gratuitas para testear, limitadas a 1,000 llamadas al mes y 20 RPM [37]. Las claves de producción usan precios de pago por uso, con hasta 500 RPM para modelos estándar. La facturación ocurre a fin de mes o cuando tu saldo alcanza los $250 [33][37].

Algunos de los modelos de gama alta de Cohere necesitan aprobación de ventas antes del uso completo en producción. Eso incluye Command A+, A Reasoning y A Vision. Hasta que ocurre esa aprobación, el acceso de autoservicio se mantiene en límites de estilo prueba [37].

Si tu equipo necesita rendimiento dedicado, Cohere también ofrece Model Vault. Los precios empiezan en $2,500 al mes para una instancia Embed 4 Small [33].

Cobertura de modelos

Cohere encaja en flujos de trabajo empresariales centrados en texto, no en generación multimedia.

La empresa centra su línea en torno a texto, recuperación y búsqueda empresarial en lugar de generación de imagen o vídeo. La principal excepción es Command A, que admite entradas de imagen y tareas multimodales. También viene con una ventana de contexto de 256,000 tokens, la más grande en la línea de Cohere [34][36].

Aya Expanse admite 49 idiomas, lo que lo hace una opción sólida para despliegues globales [37].

Coste por salida

Si estás construyendo pipelines de RAG, los precios bajos de entrada de Cohere son el gran atractivo. Estos flujos de trabajo suelen consumir muchos más tokens de entrada que de salida, por lo que Command R a $0.15 por 1M de tokens de entrada ayuda a evitar que los prompts intensivos en documentos se vuelvan demasiado caros.

Un ejemplo simple deja clara la diferencia: ejecutar 100,000 interacciones de chatbot de soporte en Command R cuesta unos $123 al mes, mientras que el mismo volumen en Command R+ sale a aproximadamente $2,050 al mes [39].

Para pura clasificación y resúmenes a escala, Command R7B es la opción de menor coste en la línea [34][38].

Una forma práctica de pensarlo:

  • Usa Command R7B para clasificación y resúmenes de alto volumen.
  • Usa Command R para RAG y chatbots.
  • Usa Command R+ solo cuando necesites la fuerza extra del modelo.

A continuación, compara los precios de Runway o explora alternativas de generación de vídeo con IA cinematográfica.

9. Runway

Runway

Runway está construido en torno al vídeo, por lo que sus precios están ligados a segundos generados o editados. Usa un sistema de créditos para el trabajo de vídeo e imagen. Obtienes créditos a través de una suscripción o comprando packs de recarga a $0.01 por crédito, con un mínimo de $10. Los créditos de API se facturan por su cuenta. Lo principal que hay que vigilar es cómo cambia el consumo de créditos de un modelo a otro.

Precios unitarios

ModeloTarifa de API (créditos/seg)Coste en USD/seg
Gen-4.5 (Flagship)12 /seg$0.12
Gen-4 Video12 /seg$0.12
Gen-4 Turbo5 /seg$0.05
Aleph 2.0 (Video Editing)28 /seg$0.28
Act-Two (Animation)5 /seg$0.05
Gen-4 Image (1080p)8 /img$0.08

Límites incluidos

En los planes anuales [40][43], Runway incluye los siguientes topes mensuales de créditos:

PlanCoste mensual (anual)Créditos/mesArrastre
Free$0125 (una vez)Ninguno
Standard$12625Ninguno
Pro$282,250Ninguno
Max$769,5001 mes

El plan Free incluye marcas de agua y no permite uso comercial. Los planes de pago eliminan ambos límites [40][44]. Los créditos de Standard y Pro no se arrastran, y los créditos sin usar caducan dentro de las 24 horas de la siguiente fecha de facturación [40][43][46]. Solo Max te da un mes de arrastre [40][43][46].

Cobertura de modelos

Runway cubre texto-a-vídeo, imagen-a-vídeo, edición de vídeo, texto-a-imagen, imagen-a-imagen, más herramientas de audio y posprocesamiento [42]. Ese rango le da más alcance que una herramienta que solo genera. Pero el precio por sí solo no cuenta toda la historia. La calidad de la salida cambia lo que acabas pagando en la práctica.

Coste por salida

Aquí es donde las cosas se vuelven más caras de lo que parecen al principio. Los reintentos suman rápido. La mayoría de los clips terminados requieren de 3 a 5 generaciones, lo que empuja Gen-4.5 a unos $0.50 a $0.80 por segundo terminado [43][44][47].

Una forma común de mantener el gasto bajo control es usar Gen-4 Turbo a $0.05/seg para borradores y pruebas de concepto, y luego pasar a Gen-4.5 a $0.12/seg para los renders finales [41][45]. Esa configuración tiene sentido si no quieres quemar créditos premium mientras aún estás definiendo el movimiento, el encuadre o el ritmo.

También hay un techo duro en los planes de nivel inferior. Los 625 créditos de Standard cubren solo unos 52 segundos de vídeo Gen-4.5 al mes [40][44]. Eso es suficiente para un puñado de clips pulidos, pero no sostendrá un flujo de trabajo de producción constante.

Alternativamente, puedes explorar MiniMax Hailuo 2.3 para una generación de vídeo de alta consistencia. A continuación, compara los precios de imagen y vídeo de Stability AI.

10. Stability AI

Stability AI

Stability AI destaca en flujos de trabajo de imagen y audio, donde los precios por activo a menudo importan más que un plan mensual. Usa un sistema de créditos, y 1 crédito = $0.01. Los nuevos usuarios obtienen 25 créditos gratis, lo que alcanza para unas 3 generaciones flagship u 8 imágenes SD 3.5 Large. El acceso a la API también incluye derechos de uso comercial [48].

Aquí están los precios por servicio.

Precios unitarios

ServicioCréditosUSD
Stable Image Ultra8$0.08
Stable Diffusion 3.5 Large6.5$0.065
Stable Diffusion 3.5 Large Turbo4$0.04
Stable Image Core3$0.03
Stable Diffusion 3.5 Flash2.5$0.025
SDXL 1.0Desde 0.9Desde $0.009
Replace Background & Relight8$0.08
Erase / Inpaint / Remove Background5$0.05
Creative Upscaler (a 4K)60$0.60
Fast Upscaler2$0.02
Stable Fast 3D10$0.10
Stable Audio 3.0 (hasta 6 min)26$0.26

Límites incluidos

Los precios de la API son de pago por uso, con precios personalizados y descuentos por volumen para equipos de alto volumen [49].

Cobertura de modelos

Stability AI cubre texto-a-imagen, edición de imágenes, generación de activos 3D y generación de audio [48]. En pocas palabras, está hecho para trabajo de producción. Puedes generar imágenes, editarlas, convertir activos en salidas 3D y crear clips de audio sin saltar entre un montón de herramientas.

La suite de edición incluye outpainting, reemplazo de fondo, reiluminación y transferencia de estilo [48]. Stable Fast 3D maneja la generación de activos 3D, mientras que Stable Audio 3.0 admite clips de audio de hasta seis minutos [48]. Así que esto va menos de chat y más de sacar adelante el trabajo multimedia.

Esa diferencia de precios se nota más cuando trabajas a escala, especialmente con trabajos de edición y upscaling.

Coste por salida

El Creative Upscaler cuesta 60 créditos ($0.60) por imagen. Eso es 30x el precio del Fast Upscaler, que cuesta 2 créditos ($0.02). Así que si tu objetivo principal son simples aumentos de resolución, Fast Upscaler es la opción de menor coste [48].

Stable Image Core sale a unos $30/mes por 1,000 imágenes [48]. Y si escalas a 10,000 imágenes/mes con SD 3.5 Large, el coste ronda los $650 [48].

También puedes generar y editar imágenes usando otros modelos de alto rendimiento. A continuación, compara los precios de imagen de Black Forest Labs.

11. Black Forest Labs

Black Forest Labs

Black Forest Labs es un útil punto de referencia de precios para la generación de imágenes porque la factura cambia con el tamaño de salida y con si usas imágenes de referencia. Su sistema se basa en créditos, con 1 crédito = $0.01. Los precios de FLUX.2 están ligados a los megapíxeles, y las imágenes de referencia se cobran aparte. Algo que hay que vigilar: cada imagen y cada imagen de referencia se redondea hacia arriba al siguiente megapíxel, basándose en 1,024 × 1,024 px.

Precios unitarios

La línea FLUX.2 viene en cuatro niveles: Max, Pro, Klein y Flex. Cada uno hace un compromiso distinto entre calidad de imagen, velocidad y precio.

Modelo1er MP (base)MP adicionalImagen ref. (por MP)Modo de generación
FLUX.2 [max]$0.07$0.03$0.03Text-to-Image / Edit
FLUX.2 [pro] (Text-to-Image)$0.03$0.015$0.015Text-to-Image
FLUX.2 [pro] (Edit)$0.045$0.015$0.015Image Editing
FLUX.2 [klein] 9B$0.015$0.002$0.002Text-to-Image / Edit
FLUX.2 [klein] 4B$0.014$0.001$0.001Text-to-Image / Edit
FLUX.2 [flex]$0.05$0.05$0.05Text-to-Image / Edit

Los modelos más antiguos FLUX1.1 y FLUX.1 usan en su lugar precios planos por imagen.

ModeloPrecio por imagenDescripción
FLUX1.1 [pro]$0.04Generación estándar de alta velocidad
FLUX1.1 [pro] Ultra$0.06Ultra alta resolución
FLUX1.1 [pro] Raw$0.06Estética de fotografía espontánea
FLUX.1 Kontext [max]$0.08Edición en contexto de máxima calidad
FLUX.1 Kontext [pro]$0.04Edición en contexto lista para uso comercial
FLUX.1 Fill [pro]$0.05Inpainting de imagen dirigido
FLUX.1 [schnell]$0.003Destilado para máxima velocidad

Límites incluidos

El acceso a la API es de pago por uso, pero Black Forest Labs también tiene niveles de suscripción con topes mensuales de imágenes [50].

PlanLímite mensualFunciones clave
Builder10,000 imágenes/mesModelos Klein, 10 usuarios, derechos de ajuste fino
Platform100,000 imágenes/mesModelos Klein 9B + Dev, 10 usuarios
Professional100,000 imágenes/mesModelos Dev, 3 dominios, 10 usuarios
EnterprisePersonalizadoTodos los modelos, volumen personalizado, acceso a API y pesos

Cobertura de modelos

Black Forest Labs se centra en la generación y edición de imágenes. Los modelos FLUX.2 admiten tamaños de salida de hasta 4 MP, y cualquier cosa por encima de eso se redimensiona automáticamente [50]. Si la velocidad importa más, FLUX.2 [klein] 4B destaca con inferencia por debajo del segundo, lo que lo hace un buen encaje para casos de uso casi en tiempo real [52].

Para trabajo de edición, la línea también tiene un par de opciones claras. FLUX.1 Fill [pro] maneja inpainting dirigido a $0.05 por imagen, mientras que FLUX.1 Kontext [pro] tiene un precio de $0.04 por imagen para edición en contexto lista para uso comercial [51].

Coste por salida

Una imagen FLUX.2 [max] terminada de 4 MP cuesta unos $0.30, una vez que tienes en cuenta la generación, el upscaling y dos reintentos. Las imágenes de referencia se facturan por separado a la misma tarifa por megapíxel [50][51]. Si haces arte conceptual o prototipado en fase temprana, FLUX.2 [klein] 4B a $0.014 por imagen es la forma de bajo coste de probar ideas antes de pasar a los renders finales [50].

A continuación: precios de vídeo de Kling AI.

12. Kling AI

Kling AI

Kling AI divide sus precios en dos vías: la aplicación web usa créditos, mientras que la API cobra por segundo. Del lado de la API, el coste cambia según la duración del clip, la resolución y si activas el audio sincronizado.

Precios unitarios

Para vídeo silencioso estándar, los precios empiezan en $0.0672/seg a 720p y suben hasta $0.0896/seg a 1080p. Kling V3 Omni, que maneja entradas de texto más imagen y flujos de trabajo de vídeo-a-vídeo, cuesta $0.1792/seg a 1080p.

ConfiguraciónResoluciónPrecio/segCoste est. de clip de 10s
Kling V3 – Silent720p$0.0672$0.67
Kling V3 – Silent1080p$0.0896$0.90
Kling V3 – With Audio1080p$0.1120$1.12
Kling V3 Omni (Ref)1080p$0.1792$1.79
Kling V3 – Silent4K$0.4286$4.29

Así que sí, Kling se sitúa en el lado de menor precio para las API de vídeo.

Límites incluidos

Kling mantiene separados los precios de la aplicación web y de la API, lo que significa que necesitas revisar ambos antes de elegir un plan. La tarifa de la API es solo una pieza del cálculo. Los créditos y la concurrencia tienen un gran efecto en cuánto trabajo puedes empujar.

El nivel gratuito viene con 66 créditos al día, y esos créditos se restablecen cada 24 horas sin arrastre. Los planes de pago empiezan en $6.99/mes por 660 créditos en Standard y suben hasta $180/mes por 26,000 créditos en Ultra. Si pagas anualmente por Ultra, la tarifa efectiva baja un 34% [54].

Para usuarios de API, la concurrencia estándar está limitada a 10 trabajos en paralelo. Las cuentas de nivel de prueba obtienen solo 3. Esa diferencia puede importar mucho si intentas procesar renders por lotes en lugar de esperar los clips uno por uno.

Cobertura de modelos

Kling V3 y Kling V3 Omni admiten clips de hasta 15 segundos, lo que los hace adecuados para trabajo cinematográfico y narrativo. V2.6 limita la duración del clip a 10 segundos y añade audio sincronizado. V2.5 Turbo es aproximadamente 30% más barato que el nivel Master.

Coste por salida

Una forma común de mantener el gasto bajo control es hacer borradores en modo silencioso 720p y subir a 1080p o 4K solo para los renders finales. Ese enfoque ayuda porque muchos usuarios necesitan 2–4 intentos de generación para obtener un clip usable, y eso empuja hacia arriba el coste del vídeo terminado [53].

Los Prepaid Resource Packages pueden recortar el precio unitario efectivo en un 10% a 30%, según el tamaño del paquete [53].

A continuación, compara estos modelos por precio unitario, límites de plan, cobertura de modalidad y coste por salida.

Desglose de precios por criterio de comparación

Las tablas siguientes condensan los detalles anteriores proveedor por proveedor en cuatro filtros de compra: precio unitario, límites de plan, cobertura de modalidad y coste de salida.

Precios unitarios en APIs de texto, imagen y vídeo

ModeloProveedorEntrada ($/1M tokens)Salida ($/1M tokens)Nivel
GPT-5 NanoOpenAI$0.05$0.40Económico
Gemini 2.5 ProGoogle$1.25$10.00Gama media
GPT-5.5OpenAI$5.00$30.00Premium

Para la generación de imágenes, FLUX.1 [schnell] es la referencia de bajo coste a $0.003 por imagen, mientras que Stable Image Ultra se sitúa en la gama alta a $0.08 por imagen. Para vídeo, Kling V3 cuesta $0.0672/seg a 720p en la gama baja, y Veo 3.1 entra a $0.40/seg en la gama alta.

Las tarifas brutas importan. Pero en la práctica, los límites de plan a menudo deciden lo que realmente gastas.

Límites incluidos en suscripciones y planes de plataforma

Por debajo de unos 5 millones de tokens de entrada al mes, los planes de chat de $20 pueden superar la facturación por API para uso ocasional.

ProveedorPlanPrecio mensualUso incluidoLímites clavePlan de equipo
OpenAIChatGPT Plus$20Limitado (dinámico)Topes de mensajes dinámicos; sin acceso a API
AnthropicClaude Pro$20Limitado (dinámico)Los límites de uso varían según la demanda; sin acceso a API
GoogleGemini Advanced$20Limitado (dinámico)Ligado a Google One; sin acceso a APISí (Workspace)

Los modelos de razonamiento también añaden un matiz: los tokens de razonamiento ocultos se facturan a las tarifas de salida, lo que puede empujar el coste total hacia arriba de 2x a 7x.[3]

Cobertura de modelos por modalidad

Los precios solo importan una vez que la modalidad del modelo encaja con el trabajo.

ProveedorTextoEntrada multimodalGen. imagenVisiónGen. vídeoAcceso a API
APIMart-API unificada
OpenAIDirecto
GoogleDirecto
AnthropicDirecto
MetaUnificado/Alojado
Mistral AIDirecto
Stability AIDirecto

Un modelo barato no es ninguna ganga si no puede manejar el formato que necesitas. Los proveedores de solo texto, por ejemplo, no ayudarán mucho si tu flujo de trabajo depende de salida de imagen o vídeo.

Coste por salida por caso de uso común

Estos son los costes que los equipos tienden a sentir una vez que las cosas llegan a producción.

Cargas de trabajo de texto (por 1M de tokens de salida):

Caso de usoModeloCoste de salidaNivelCompromiso clave
Chatbot de alto volumenGPT-5 Nano$0.40EconómicoMenor profundidad de razonamiento
Extracción de documentosGemini Flash Lite$0.30EconómicoEscritura creativa limitada
Generación de códigoGemini 2.5 Pro$10.00Gama mediaRecargo por encima de 200K de contexto [3]
Flujos de trabajo con agentesClaude Sonnet 4.6$15.00Gama mediaNecesita caché de prompts para el ROI [3]
Razonamiento complejoClaude Opus 4.8$25.00PremiumAlto coste; mayor latencia

Cargas de trabajo de vídeo (por clip de 10 segundos):

Caso de usoModeloCoste de salidaNivelCompromiso clave
Vídeo de formato corto (borrador)Kling V3~$0.67Económico720p; limitado a clips de 15 segundos
Vídeo de formato corto (final)Sora 2$1.00Gama mediaCalidad y coste equilibrados
Vídeo cinematográficoVeo 3.1$4.00PremiumMáxima calidad; máximo gasto

Aquí está la versión simple: el precio por token o por segundo es solo parte de la historia. El factor más grande suele ser cómo usas el modelo. Un chatbot funcionando todo el día, un pipeline de documentos y un estudio de vídeo pueden parecer baratos sobre el papel y volverse caros rápido una vez que entra en juego el volumen de salida.

Una regla práctica: el procesamiento por lotes recorta costes en un 50% en OpenAI, Anthropic y Mistral para cargas de trabajo que pueden tolerar un plazo de 24 horas.[3] Para vídeo, hacer borradores en menor resolución y mejorar solo los renders finales es la forma más fiable de controlar el gasto por salida.

Pros y contras

La tabla siguiente reduce los compromisos a lo que suele impulsar la decisión: coste, modalidad y encaje de carga de trabajo. Si estás eligiendo entre proveedores, esto te da la versión corta sin hacerte volver a revisar cada sección de precios.

SujetoProsContrasMejor para
APIMartMás de 500 modelos bajo una API; una factura para texto, imagen y vídeoLos precios basados en el uso significan que los costes suben con el volumen de salidaEquipos que quieren acceso multimodal unificado
OpenAIFacturación por token claraLos modelos flagship son carosCargas de trabajo de texto de uso general
AnthropicEl caché de prompts reduce los costes de trabajo repetidoLos modelos de gama alta cargan altas tarifas de salidaProgramación y flujos de trabajo de contexto largo
Google AIFlash-Lite es baratoPro se encarece por encima de 200K tokensCargas de trabajo de texto de alto volumen y contexto largo
Meta (Llama)Bajo coste si puedes autoalojarSin API propia, tú te encargas del alojamiento y la disponibilidadCargas de trabajo sensibles al coste con capacidad de autoalojamiento
xAI (Grok)Precios de gama media competitivosLínea de modelos más pequeñaAplicaciones de datos web y sociales en tiempo real
Mistral AIModelos pequeños de bajo coste y cobertura multilingüeMenos funciones multimodalesAplicaciones de texto multilingües
CohereEmbed, Rerank y Command R7B encajan con RAGCommand R+ es caro para su nivelGeneración aumentada por recuperación y bases de conocimiento
Stability AIPrecios de generación de imágenes muy bajosEl alcance solo de imagen limita flujos de trabajo más ampliosGeneración de imágenes de alto volumen
Kling AIVídeo de formato corto de bajo costeLimitado a vídeos de 15 segundos con el precio baseGeneración de vídeo de formato corto

Una forma simple de leer esto:

  • Si quieres una API para muchos tipos de modelos, APIMart destaca.
  • Si te importa más el uso de texto plano y la facturación sencilla, OpenAI o Google AI pueden ser el encaje más fácil.
  • Si tu trabajo se inclina hacia programación, prompts largos o contexto repetido, Anthropic puede tener sentido.
  • Si estás manteniendo bajos los costes y puedes ejecutar las cosas tú mismo, Meta (Llama) es difícil de ignorar.
  • Si tu stack está construido en torno a RAG, Cohere tiene herramientas que encajan bien con esa configuración.

Para uso intensivo en imágenes, Stability AI es la opción de bajo coste. Para clips de vídeo cortos, Kling AI mantiene bajos los costes de entrada, aunque el plan base sigue ligado a salidas de 15 segundos.

Conclusión

Mirando el desglose de precios anterior, el mejor modelo no es el más caro ni el más barato. Es el que encaja con tu carga de trabajo, modalidad y volumen.

Las tareas de alto volumen y baja complejidad deberían ejecutarse en los modelos de menor coste con los que puedas arreglártelas.

A medida que sube la complejidad, el gasto debería subir solo cuando la salida lo merezca. Los modelos de gama media son un buen encaje para aplicaciones en producción que necesitan un rendimiento constante sin la etiqueta de precio de gama alta.

Una vez que entras en razonamiento premium o generación multimedia, el coste por salida empieza a importar más que los precios brutos por token. Los modelos premium tienen sentido cuando la calidad tiene un efecto directo en los resultados. Y para vídeo, los precios funcionan de forma distinta: APIs como WAN 2.7, Sora 2 ($0.08/seg) y Kling V3 ($0.0672/seg a 720p) cobran por segundo, no por token.

Para equipos que usan modelos de texto, imagen y vídeo juntos, APIMart da acceso a más de 500 modelos a través de una única API. Eso significa que el trabajo multimodal puede estar bajo una sola API y una sola factura.

Preguntas frecuentes

¿Cómo estimo el coste total por salida?

Estima el coste total según cómo se factura el modelo.

Para modelos de texto, los precios suelen dividirse en tokens de entrada y tokens de salida por 1 millón de tokens. Los tokens de salida a menudo cuestan más, por lo que la longitud esperada de tu respuesta tiene el mayor efecto en el gasto total.

Para casos de uso que no son de texto, los modelos de imagen a menudo tienen precios por llamada, mientras que los modelos de vídeo tienen precios por segundo generado.

Una forma simple de estimar el coste es:

  • usar un contador de tokens para medir el volumen del prompt
  • comprobar la tarifa del modelo para cada unidad de facturación
  • aplicar esa tarifa a tu uso esperado

Eso te da una estimación de coste práctica antes de escalar nada.

¿Cuándo ahorra dinero el caché de prompts?

El caché de prompts recorta costes cuando tu aplicación envía el mismo prefijo de prompt una y otra vez. Eso suele significar instrucciones de sistema largas, grandes conjuntos de documentos o historial de conversación compartido reutilizado en muchas solicitudes.

En lugar de pagar el precio completo de tokens de entrada cada vez, pagas menos por la parte repetida. En muchos casos, eso puede reducir los costes de entrada en un 50% a 90%.

Esto funciona mejor cuando el volumen es alto y el contexto se mantiene mayormente igual. Un chatbot de soporte al cliente es un buen ejemplo: el bot puede reutilizar las mismas reglas, información de marca y documentos de ayuda a través de miles de chats.

Es un mal encaje cuando el contexto cambia todo el tiempo. Si tu aplicación sigue reescribiendo el prompt desde cero en cada solicitud, hay menos texto repetido que cachear, por lo que los ahorros bajan rápido.

¿Debería usar suscripciones o precios de API?

Para la mayoría de los desarrolladores y empresas, los precios de API tienen más sentido. Con la facturación de pago por uso, pagas por los tokens que usas: sin mínimos mensuales, sin tarifas sorpresa y sin cargos fijos pendiendo sobre ti cuando el tráfico es bajo. Tus costes se mueven con el uso, lo que a menudo es un encaje mucho mejor que una factura recurrente fija.

APIMart te da una API que conecta con más de 500 modelos de IA, con precios claros por token y descuentos automáticos por volumen a medida que tu uso sube.

Publicaciones de blog relacionadas

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace