
Guía de precios de LLM: compara más de 500 modelos de IA
Compara precios de API de LLM y multimedia en más de 500 modelos de OpenAI, Anthropic, Google, Meta, xAI, Mistral y más, por coste de token, imagen y vídeo.
El gasto en IA puede dispararse rápido: las empresas estadounidenses gastan ahora una media de $85,500 al mes en IA. Mi conclusión principal es sencilla: el modelo más barato sobre el papel no siempre es la opción de menor coste una vez que tienes en cuenta la longitud de la salida, el tamaño del contexto, los reintentos, las tarifas de herramientas y los límites del plan.
Si tuviera que elegir a partir de esta guía, me fijaría primero en cuatro cosas:
- Precio unitario: tokens, imágenes o segundos de vídeo
- Límites: RPM, TPM, ventanas de contexto y topes del plan
- Modalidad: compatibilidad con texto, imagen, audio, vídeo y visión
- Coste por salida terminada: no solo el precio de lista
El artículo compara APIMart, OpenAI, Anthropic, Google AI, Meta, xAI, Mistral, Cohere, Runway, Stability AI, Black Forest Labs, y Kling AI.
Destacan algunos patrones claros:
- Los precios del texto varían mucho. OpenAI va desde $0.05 hasta $30.00 por 1M de tokens de entrada.
- La salida suele ser mucho más cara que la entrada. En algunos casos, la salida cuesta de 4x a 6x más.
- El contexto largo puede cambiar la factura. OpenAI aplica precios más altos a partir de 270,000 tokens, y Google cambia las tarifas por encima de 200,000 tokens.
- Los trabajos por lotes pueden reducir costes. OpenAI, Anthropic y Mistral ofrecen descuentos del 50% para el procesamiento asíncrono.
- Los costes de vídeo se acumulan con los reintentos. Una tarifa barata por segundo puede acabar convirtiéndose en un coste mucho mayor por clip terminado.
- La facturación unificada importa para los equipos que usan muchos formatos. La propuesta de APIMart es una sola API y una sola factura para más de 500 modelos.
Si quieres la versión corta:
usa modelos económicos para texto de alto volumen, modelos de gama media para aplicaciones en producción, modelos premium solo cuando la calidad de la salida cambie los resultados del negocio, y haz borradores de vídeo en baja resolución antes de pagar por los renders finales.
¿Qué son los tokens de LLM y los precios de API? (Apto para principiantes)
Comparación rápida

| Proveedor | Fortaleza principal | A tener en cuenta | Mejor encaje |
|---|---|---|---|
| APIMart | Una API para más de 500 modelos de texto, imagen, vídeo y audio | Los costes de uso siguen escalando con el volumen | Equipos que quieren una única configuración de facturación |
| OpenAI | Amplia gama de modelos y precios por token claros y consejos de coste | Los mejores modelos se encarecen rápido | Texto, imagen, audio y vídeo en general |
| Anthropic | Fuerte para programación y contexto largo | Las tarifas de salida son altas | Agentes, programación, prompts largos |
| Google AI | Opciones Flash de bajo coste y contexto grande | Tarifas más altas por encima de 200K tokens | Aplicaciones de texto de alto volumen y multimodales |
| Meta | Precios muy bajos de Llama alojado o autoalojado | Los precios y límites dependen del host | Equipos centrados en el coste con opciones de alojamiento |
| xAI | Menor diferencia entre precios de entrada y salida | Las llamadas a herramientas añaden tarifas extra | Aplicaciones de respuesta larga y uso de herramientas |
| Mistral | Precios bajos por token y descuentos por lotes | Algunas herramientas cuestan más | Texto de utilidad, programación, uso con base en la UE |
| Cohere | Buen encaje para RAG, embeddings y rerank | Menos adecuado para generación multimedia | Búsqueda, recuperación, bases de conocimiento |
| Runway | Plataforma centrada en vídeo con cálculo de créditos claro | Los reintentos pueden disparar el coste final | Creación y edición de vídeo |
| Stability AI | Precios bajos de imagen y herramientas de edición | Alcance más estrecho que los proveedores de texto | Trabajo de imagen y audio de alto volumen |
| Black Forest Labs | Precios de imagen detallados por tamaño | Los costes suben con reintentos y referencias | Generación y edición de imágenes |
| Kling AI | Generación de vídeo corto de bajo coste | Límites de duración de clip y concurrencia | Vídeo de formato corto |
Así que antes de comparar precios línea por línea, empezaría con una pregunta: ¿Por qué estoy pagando más: tokens, imágenes, segundos o reintentos?
1. APIMart

APIMart usa facturación de pago por uso con sin mínimos mensuales y sin tarifas ocultas. Los precios cambian según la modalidad, por lo que texto, imagen, vídeo y audio no se facturan de la misma forma.
Precios unitarios
Los precios varían según la modalidad, como muestra la tabla siguiente.
| Modalidad | Unidad de facturación | Modelo de ejemplo | Precio de APIMart |
|---|---|---|---|
| Texto | Por 1M de tokens | Qwen2.5-VL-72B | $20.00 |
| Imagen | Por llamada | GPT Image 2 | $0.006 |
| Imagen | Por llamada | Wan 2.7 Image | $0.0216 |
| Vídeo | Por segundo | Sora 2 | $0.08 |
| Vídeo | Por segundo | Kling V3 (720p) | $0.0672 |
Los costes de generación de imágenes pueden variar mucho según el nivel de calidad. Por ejemplo, una llamada a GPT-Image-2-Official de 1024×1024 cuesta unos $0.00488 en calidad baja, $0.04232 en media y $0.16872 en alta. Esa diferencia se acumula rápido. Si no se requiere una salida de gama alta, usar un nivel inferior puede reducir el gasto por llamada.
Límites incluidos
Las cuentas por defecto vienen con límites de RPM y TPM. Las cuentas empresariales pueden solicitar canales de mayor rendimiento.
Cobertura de modelos
APIMart admite modelos de texto, imagen, vídeo y audio a través de una sola API. Eso incluye modelos como GPT-5, Claude, Sora 2, Midjourney y Kling V3.
Coste por salida
La principal ventaja aquí es la facturación consolidada entre modalidades. En lugar de manejar facturas separadas para texto, imagen y vídeo, obtienes una sola configuración que facilita el control del gasto.
A continuación, la guía compara cómo los principales proveedores estructuran sus precios en modelos de texto, imagen y vídeo.
2. OpenAI

OpenAI usa un modelo de precios de pago por token para el texto. Y la diferencia entre modelos es enorme.
A junio de 2026, los precios empiezan en $0.05 por 1M de tokens de entrada para GPT-5 nano y llegan hasta $30.00 por 1M de tokens de entrada para GPT-5.5 Pro [3][5]. La forma más fácil de leer los precios de OpenAI es por nivel de modelo, porque las tarifas de entrada, salida y tokens en caché pueden ser muy diferentes de un modelo a otro.
Precios unitarios
| Modelo | Entrada (por 1M) | Entrada en caché | Salida (por 1M) |
|---|---|---|---|
| GPT-5.5 Pro | $30.00 | - | $180.00 |
| GPT-5.5 (Standard) | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 mini | $0.75 | $0.075 | $4.50 |
| GPT-5.4 nano | $0.20 | $0.02 | $1.25 |
| GPT-5 nano | $0.05 | $0.005 | $0.40 |
En todos los modelos de OpenAI, los tokens de salida cuestan de 4 a 6 veces más que los de entrada [6]. Eso importa mucho cuando tu aplicación produce respuestas largas, resúmenes o respuestas de estilo agente. OpenAI también ofrece niveles Batch y Flex con un descuento fijo del 50% en todos los modelos, por lo que la entrada de GPT-5.5 baja de $5.00 a $2.50 por 1M de tokens [5].
Los costes pueden volver a subir cuando el uso de contexto largo alcanza los precios con recargo.
Límites incluidos
OpenAI duplica las tarifas tanto de entrada como de salida una vez que el contexto total supera los 270,000 tokens [3][5]. Si trabajas con revisión de documentos largos o bucles de agente de varios turnos, el resumen progresivo es una de las formas más sencillas de mantenerte por debajo de esa línea.
OpenAI usa esta misma configuración de precios también en modelos de imagen, audio y vídeo.
Cobertura de modelos
OpenAI cobra por separado la generación de imagen, audio y vídeo. Sora-2 cuesta $0.10 por segundo para vídeo 720p, mientras que Sora-2-pro a 1080p cuesta $0.70 por segundo a la tarifa estándar [5].
Para otros formatos multimedia:
- Los precios de imagen van de $2.50 a $8.00 por 1M de tokens
- La transcripción con Whisper cuesta $0.006 por minuto
- TTS (tts-1) cuesta $0.015 por 1,000 caracteres [3][4]
Coste por salida
Una de las formas más rápidas de recortar el gasto es sencilla: envía el trabajo de menor valor a modelos más baratos. Procesar 10,000 tickets de soporte cuesta unos $16 con GPT-4.1, $3.20 con GPT-4.1 mini y $0.80 con GPT-4.1 nano [4].
3. Anthropic

Anthropic divide su línea de API de Claude en cuatro niveles de precios: Frontier/Research (Claude Fable 5 / Mythos 5), Flagship (Claude Opus 4.5–4.8), Gama media (Claude Sonnet 4.5–4.6) y Económico (Claude Haiku 4.5) [9][10]. El patrón es bastante claro. A medida que subes de nivel, obtienes más profundidad de razonamiento y mejor salida, pero la factura también sube rápido. Para la mayoría de los compradores, la elección se reduce a esto: Haiku es la opción de bajo coste, Sonnet es el término medio, y Opus/Fable están hechos para trabajos más pesados.
Precios unitarios
Anthropic cobra los tokens de salida a 5x la tarifa de entrada en toda la línea escalonada actual [7][6]. Los precios de abajo están en USD por 1 millón de tokens [13][15].
| Modelo | Entrada (por 1M) | Lectura de caché (por 1M) | Salida (por 1M) |
|---|---|---|---|
| Claude Fable 5 / Mythos 5 | $10.00 | $1.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $0.50 | $25.00 |
| Claude Sonnet 4.6 | $3.00 | $0.30 | $15.00 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
El almacenamiento en caché de prompts puede recortar costes cuando reutilizas el mismo prefijo una y otra vez. Las escrituras en caché cuestan 1.25x la tarifa de entrada base para un TTL de 5 minutos, o 2x para un TTL de 1 hora. Las lecturas de caché cuestan el 10% de la entrada estándar. En la práctica, el almacenamiento en caché empieza a tener sentido después de cuatro o más usos del mismo prefijo [3][9][12].
Límites incluidos
La mayoría de los modelos actuales flagship y de gama media de Anthropic —incluidos Fable 5, Mythos 5, Opus 4.6–4.8 y Sonnet 4.6— vienen con una ventana de contexto de 1M de tokens a precio estándar [9][11]. Claude Haiku 4.5 llega hasta 200,000 tokens. Los límites de tasa siguen una configuración escalonada, desde Tier 1 hasta Enterprise, con topes de RPM y TPM fijados por plan [13][15].
Cobertura de modelos
Los modelos de Anthropic manejan entradas de texto y visión, y Computer Use añade una sobrecarga extra de tokens. Algunos complementos se facturan por separado:
- La búsqueda web cuesta $10 por 1,000 búsquedas
- Los Managed Agents cuestan $0.08 por hora de sesión activa, más los cargos por tokens
La Batch API reduce los costes de tokens en un 50% para trabajos asíncronos con un plazo de entrega de 24 horas [8][9][11].
Coste por salida
Aquí es donde los precios se vuelven prácticos: ¿qué nivel se mantiene rentable para tareas repetidas, trabajo de contexto largo y flujos de agentes?
Una sesión de programación de una hora en Claude Opus 4.8, usando 50,000 tokens de entrada con 40,000 como lecturas de caché y 15,000 tokens de salida, cuesta unos $0.525, incluida la tarifa de sesión de agente de $0.08 [9][12]. Eso te da una imagen bastante buena de cómo se comportan los precios de Anthropic en el uso real, no solo en una tabla de precios.
Para trabajos de producción como asistentes de programación y agentes de varios pasos, Claude Sonnet 4.6 tiende a ofrecer el mejor equilibrio entre coste y capacidad [6][3].
A continuación, compara los precios de Google AI en sus modelos de texto y multimodales de Gemini.
4. Google AI

Google fija los precios de sus modelos en función del modelo que elijas y del tamaño de la ventana de contexto. Una regla de precios importa desde el principio: mantén los prompts por debajo de 200,000 tokens si quieres evitar la tarifa más alta [14][3].
Precios unitarios
| Modelo | Entrada (por 1M) | Salida (por 1M) | Ventana de contexto |
|---|---|---|---|
| Gemini 3.1 Pro (≤200K) | $2.00 | $12.00 | 1M–2M |
| Gemini 3.1 Pro (>200K) | $4.00 | $18.00 | 1M–2M |
| Gemini 2.5 Pro (≤200K) | $1.25 | $10.00 | 2M |
| Gemini 3.5 Flash | $1.50 | $9.00 | 1M |
| Gemini 3 Flash | $0.50 | $3.00 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 1M |
| Gemini 3 4B | $0.04 | $0.08 | 131K |
Para la generación de imágenes, Imagen 4 Fast empieza en $0.01–$0.02 por imagen, mientras que Imagen 4 Ultra cuesta $0.06 por imagen. El vídeo de Veo 3.1 se factura por segundo. El estándar cuesta $0.40 por segundo para 720p y 1080p, y Light cuesta $0.05–$0.08 por segundo [17].
Límites incluidos
El precio del modelo es solo parte de la historia. Los límites de rendimiento y la configuración de datos pueden cambiar tu gasto total de manera importante.
El principal compromiso de Google es bastante claro: precios bajos de modelo por un lado, y límites de rendimiento más restricciones de datos por el otro. En Google AI Studio, el nivel gratuito te da unos 15 RPM, tokens gratuitos y uso de datos para mejorar el producto. El nivel de pago salta a unos 1,000–2,000 RPM, desactiva el uso de datos para mejorar el producto, y añade caché de contexto más Batch API. Los planes empresariales añaden rendimiento aprovisionado, descuentos por volumen y funciones de cumplimiento [17][18].
La caché de contexto es una de las mayores palancas de coste aquí. Escribir en la caché es gratis, y leer de ella cuesta el 25% de la tarifa de entrada estándar [18].
Cobertura de modelos
La línea de Google abarca modelos de texto, multimodales, de imagen y de vídeo. También admite entrada de imagen, a partir de $0.0025 por imagen [3].
Coste por salida
Para chatbots, resúmenes y clasificación, Gemini 2.5 Flash o Gemini 3.1 Flash-Lite suelen ser lo más sensato. Son más baratos y encajan bien con muchas cargas de trabajo del día a día. Reserva Gemini 3.1 Pro para casos en los que necesites la ventana de contexto más grande, y usa el resumen progresivo para mantenerte por debajo del límite de 200,000 tokens [3][6].
Hay también un ángulo de precio simple que vale la pena señalar. A $2.00 por 1M de tokens de entrada, Gemini 3.1 Pro es más barato que modelos flagship como GPT-5.5 ($5.00) y Claude Opus 4.8 ($5.00) para prompts de longitud estándar [2].
A continuación, compara los precios y la cobertura de modelos de Meta.
5. Meta
Meta funciona un poco distinto de los proveedores de modelos cerrados anteriores. Sus modelos Llama son de peso abierto, por lo que tu coste depende de dónde los alojes o accedas a ellos. En la práctica, eso significa que exactamente el mismo modelo puede tener precios muy diferentes de un proveedor a otro. Por ejemplo, Llama 3.3 70B se ha listado por tan solo $0.10 por 1M de tokens de entrada. Meta tampoco publica una hoja de precios de API propia, razón por la cual los precios pueden variar tanto entre hosts [1][19][20].
Precios unitarios
Los precios actuales se centran en Llama 4 Scout y Llama 4 Maverick [21][22].
| Modelo | Entrada (por 1M) | Salida (por 1M) | Ventana de contexto |
|---|---|---|---|
| Llama 4 Scout | $0.08 – $0.17 | $0.15 – $0.66 | Hasta 10,000,000 tokens |
| Llama 4 Maverick | $0.15 – $0.24 | $0.60 – $0.97 | 1,000,000 tokens |
| Llama 3.3 70B | $0.10 – $0.72 | $0.32 – $0.72 | 128K – 131K tokens |
| Llama 3.2 1B Instruct | $0.01 – $0.02 | $0.01 – $0.02 | 60K – 131K tokens |
| Llama 3.1 405B Instruct | $0.90 – $3.00 | $0.90 – $3.00 | 128K – 131K tokens |
Ese precio de lista bajo se ve genial sobre el papel. Pero solo ayuda si los límites de contexto y los topes de rendimiento del host coinciden con tu carga de trabajo.
Límites incluidos
No hay un único plan estándar de Meta con límites de tasa compartidos o un nivel gratuito integrado. Los hosts fijan sus propios límites de rendimiento, topes de contexto y reglas de caché. Así que si planeas trabajo de contexto largo con Llama 4 Scout, comprueba primero el techo de contexto del host en lugar de asumir que obtendrás todo el rango anunciado.
Cobertura de modelos
Llama 4 Scout y Llama 4 Maverick admiten ambos entrada de texto y visión, además de llamadas a herramientas y modo JSON en los principales proveedores [21][22]. Las opciones más antiguas también tienen su lugar. Llama 3.2 11B Vision todavía puede manejar trabajos intensivos en visión, mientras que Llama 3.2 1B Instruct está orientado a despliegues en el borde donde la baja latencia y el uso de cómputo ajustado importan más [21][22].
Coste por salida
Si ejecutas trabajos de alto volumen con prompts largos, Scout destaca. Una tarea de programación con 40K de entrada y 8K tokens de salida cuesta unos $0.005 por tarea, lo que se traduce en aproximadamente 200 tareas por $1. Esa misma tarea en GPT-5.5 cuesta unos $0.44, o solo 2.3 tareas por $1 [6].
Para uso de cara al cliente o trabajo multimodal, Llama 4 Maverick suele ser la mejor opción. Supera a GPT-4o en benchmarks mientras cuesta mucho menos en precios de entrada: $0.15/M de entrada frente a $2.50/M de entrada [6]. Su menor diferencia entre precios de entrada y salida también lo hace un buen encaje cuando esperas respuestas más largas.
A continuación, compara los precios y la cobertura de modelos de xAI.
6. xAI

xAI mantiene bajos los precios de entrada y salida, lo que ayuda cuando las respuestas se alargan. Grok 4.3 cobra $1.25 por 1 millón de tokens de entrada y $2.50 por 1 millón de tokens de salida. Esa diferencia de 2x importa cuando un modelo te escribe mucho de vuelta [6][24].
Precios unitarios
| Modelo | Entrada (por 1M) | Entrada en caché | Salida (por 1M) | Ventana de contexto |
|---|---|---|---|---|
| Grok 4.3 (Flagship) | $1.25 | $0.20 | $2.50 | 1M tokens |
| Grok 4.20 (Reasoning) | $1.25 | $0.20 | $2.50 | 2M tokens |
| Grok Build 0.1 (Coding) | $1.00 | $0.20 | $2.00 | 256K tokens |
| Grok 4.1 Fast (Budget) | $0.20 | $0.05 | $0.50 | 2M tokens |
Para trabajo de imagen, Grok Imagine 1.5 Edit cuesta $0.01875 por llamada [23]. La generación de vídeo a través de la Imagine API va de $0.08 a $0.25 por segundo, según la resolución [24].
Límites incluidos
xAI usa facturación de pago por uso con límites de tasa basados en el uso. Los planes empresariales pueden añadir límites de tasa personalizados e infraestructura dedicada [25][26].
Hay algo que vigilar: el uso de herramientas puede sumar rápido. La búsqueda y la ejecución de código se facturan por separado, por lo que un precio bajo por token no siempre significa una factura final baja. Web Search, X Search y Code Execution cuestan cada uno $5.00 por 1,000 llamadas [24].
Si tus trabajos no son urgentes, la Batch API puede recortar costes en un 20% a 50% para tareas procesadas dentro de 24 horas [24].
Cobertura de modelos
xAI cubre casos de uso de texto, imagen y vídeo [24][16]. Grok 4.20 está hecho para un uso de herramientas más rápido, mientras que Grok Build 0.1 está orientado al trabajo intensivo en programación [6][2].
Coste por salida
Para una tarea de programación estándar con 40K tokens de entrada y 8K tokens de salida, Grok 4.3 cuesta unos $0.07 por tarea. Eso se traduce en aproximadamente 14 tareas por $1 [6].
A continuación, la guía compara la estructura de precios de otro proveedor, o puedes usar una API unificada de LLM para acceder a estos modelos a través de una única integración.
7. Mistral AI

Mistral Large 3 cuesta $0.50 por 1M de tokens de entrada y $1.50 por 1M de tokens de salida. Eso lo coloca en el grupo de flagship de bajo precio. Las tarifas principales parecen sólidas, pero la factura final puede cambiar una vez que tienes en cuenta los cargos por herramientas y los niveles de facturación de Mistral.
Aquí está la línea actual.
Precios unitarios
| Modelo | Entrada (por 1M) | Entrada en caché | Salida (por 1M) |
|---|---|---|---|
| Mistral Large 3 (Flagship) | $0.50 | $0.05 | $1.50 |
| Mistral Medium 3.5 (Balanced) | $1.50 | - | $7.50 |
| Mistral Small 4 (Efficient) | $0.10 | $0.01 | $0.30 |
| Magistral Medium (Reasoning) | $2.00 | - | $5.00 |
| Codestral (Coding) | $0.30 | $0.03 | $0.90 |
| Devstral 2 (Coding) | $0.40 | $0.04 | $2.00 |
| Pixtral Large (Multimodal) | $2.00 | - | $6.00 |
Mistral también cobra por separado por OCR a $4.00 por 1,000 páginas, embeddings a $0.10 por 1M de tokens, y búsqueda web más ejecución de código a $30 por 1,000 llamadas [27].
Límites incluidos
Mistral usa facturación de pago por uso, con cuatro niveles de límite de tasa que se abren a $20, $100 y $500 de gasto acumulado [31]. El plan Team viene con un compromiso mínimo de $50 al mes [27].
Hay dos palancas aquí que pueden recortar costes rápido:
- La Batch API reduce todos los precios de los modelos en un 50% para trabajos asíncronos [27][31].
- El almacenamiento en caché de prompts puede reducir los costes de tokens en caché hasta un 90% cuando el prefijo compartido tiene al menos 64 tokens de longitud [31].
Estas reglas de precios importan más cuando ejecutas cargas de trabajo de alto volumen o asíncronas.
Cobertura de modelos
Mistral cubre casos de uso de texto, razonamiento, programación, multimodal y en el borde. Codestral admite fill-in-the-middle (FIM), lo que lo hace un buen encaje para los flujos de trabajo de IDE. La serie Ministral —3B, 8B y 14B— está orientada a despliegues de bajo coste o en el dispositivo [30][32].
Mistral también ofrece endpoints alojados en la UE y procesamiento de datos compatible con el RGPD sin cargo extra [29][31].
Coste por salida
Para trabajo de utilidad de alto volumen como extracción de entidades, clasificación y resúmenes, Mistral Small 4 es el encaje más fuerte [28][31]. Si necesitas más potencia de razonamiento pero aún quieres precios bajos por token, Mistral Large 3 tiene más sentido [28][31].
Para tareas intensivas en razonamiento, Magistral Medium cuesta $5.00 por 1M de tokens de salida y es un 37% más barato en salida que o3 de OpenAI [29].
A continuación, compara los precios de Cohere para cargas de trabajo empresariales de texto y recuperación.
8. Cohere

Cohere está construido principalmente para recuperación y búsqueda empresarial. Sus precios lo reflejan: opciones de menor coste para trabajo de recuperación intensivo en texto, y modelos de mayor precio para trabajos multimodales o más exigentes.
Precios unitarios
Cohere divide su línea en tres grupos: modelos de recuperación de bajo coste, modelos multimodales empresariales, y herramientas separadas para embeddings y reranking.
| Modelo | Entrada (por 1M) | Salida (por 1M) | Ventana de contexto |
|---|---|---|---|
| Command R7B | $0.0375 | $0.15 | 128K |
| Command R | $0.15 | $0.60 | 128K |
| Command R+ | $2.50 | $10.00 | 128K |
| Command A (Multimodal) | $2.50 | $10.00 | 256K |
| Aya Expanse (8B/32B) | $0.50 | $1.50 | 128K |
| Embed v3 | $0.10 | - | - |
| Rerank v3 | $2.00 | - | - |
Rerank se factura usando unidades de búsqueda: una consulta más hasta 100 documentos. Si los fragmentos superan los 500 tokens, cuentan por separado [33][35].
Límites incluidos
Cohere te da claves de prueba gratuitas para testear, limitadas a 1,000 llamadas al mes y 20 RPM [37]. Las claves de producción usan precios de pago por uso, con hasta 500 RPM para modelos estándar. La facturación ocurre a fin de mes o cuando tu saldo alcanza los $250 [33][37].
Algunos de los modelos de gama alta de Cohere necesitan aprobación de ventas antes del uso completo en producción. Eso incluye Command A+, A Reasoning y A Vision. Hasta que ocurre esa aprobación, el acceso de autoservicio se mantiene en límites de estilo prueba [37].
Si tu equipo necesita rendimiento dedicado, Cohere también ofrece Model Vault. Los precios empiezan en $2,500 al mes para una instancia Embed 4 Small [33].
Cobertura de modelos
Cohere encaja en flujos de trabajo empresariales centrados en texto, no en generación multimedia.
La empresa centra su línea en torno a texto, recuperación y búsqueda empresarial en lugar de generación de imagen o vídeo. La principal excepción es Command A, que admite entradas de imagen y tareas multimodales. También viene con una ventana de contexto de 256,000 tokens, la más grande en la línea de Cohere [34][36].
Aya Expanse admite 49 idiomas, lo que lo hace una opción sólida para despliegues globales [37].
Coste por salida
Si estás construyendo pipelines de RAG, los precios bajos de entrada de Cohere son el gran atractivo. Estos flujos de trabajo suelen consumir muchos más tokens de entrada que de salida, por lo que Command R a $0.15 por 1M de tokens de entrada ayuda a evitar que los prompts intensivos en documentos se vuelvan demasiado caros.
Un ejemplo simple deja clara la diferencia: ejecutar 100,000 interacciones de chatbot de soporte en Command R cuesta unos $123 al mes, mientras que el mismo volumen en Command R+ sale a aproximadamente $2,050 al mes [39].
Para pura clasificación y resúmenes a escala, Command R7B es la opción de menor coste en la línea [34][38].
Una forma práctica de pensarlo:
- Usa Command R7B para clasificación y resúmenes de alto volumen.
- Usa Command R para RAG y chatbots.
- Usa Command R+ solo cuando necesites la fuerza extra del modelo.
A continuación, compara los precios de Runway o explora alternativas de generación de vídeo con IA cinematográfica.
9. Runway

Runway está construido en torno al vídeo, por lo que sus precios están ligados a segundos generados o editados. Usa un sistema de créditos para el trabajo de vídeo e imagen. Obtienes créditos a través de una suscripción o comprando packs de recarga a $0.01 por crédito, con un mínimo de $10. Los créditos de API se facturan por su cuenta. Lo principal que hay que vigilar es cómo cambia el consumo de créditos de un modelo a otro.
Precios unitarios
| Modelo | Tarifa de API (créditos/seg) | Coste en USD/seg |
|---|---|---|
| Gen-4.5 (Flagship) | 12 /seg | $0.12 |
| Gen-4 Video | 12 /seg | $0.12 |
| Gen-4 Turbo | 5 /seg | $0.05 |
| Aleph 2.0 (Video Editing) | 28 /seg | $0.28 |
| Act-Two (Animation) | 5 /seg | $0.05 |
| Gen-4 Image (1080p) | 8 /img | $0.08 |
Límites incluidos
En los planes anuales [40][43], Runway incluye los siguientes topes mensuales de créditos:
| Plan | Coste mensual (anual) | Créditos/mes | Arrastre |
|---|---|---|---|
| Free | $0 | 125 (una vez) | Ninguno |
| Standard | $12 | 625 | Ninguno |
| Pro | $28 | 2,250 | Ninguno |
| Max | $76 | 9,500 | 1 mes |
El plan Free incluye marcas de agua y no permite uso comercial. Los planes de pago eliminan ambos límites [40][44]. Los créditos de Standard y Pro no se arrastran, y los créditos sin usar caducan dentro de las 24 horas de la siguiente fecha de facturación [40][43][46]. Solo Max te da un mes de arrastre [40][43][46].
Cobertura de modelos
Runway cubre texto-a-vídeo, imagen-a-vídeo, edición de vídeo, texto-a-imagen, imagen-a-imagen, más herramientas de audio y posprocesamiento [42]. Ese rango le da más alcance que una herramienta que solo genera. Pero el precio por sí solo no cuenta toda la historia. La calidad de la salida cambia lo que acabas pagando en la práctica.
Coste por salida
Aquí es donde las cosas se vuelven más caras de lo que parecen al principio. Los reintentos suman rápido. La mayoría de los clips terminados requieren de 3 a 5 generaciones, lo que empuja Gen-4.5 a unos $0.50 a $0.80 por segundo terminado [43][44][47].
Una forma común de mantener el gasto bajo control es usar Gen-4 Turbo a $0.05/seg para borradores y pruebas de concepto, y luego pasar a Gen-4.5 a $0.12/seg para los renders finales [41][45]. Esa configuración tiene sentido si no quieres quemar créditos premium mientras aún estás definiendo el movimiento, el encuadre o el ritmo.
También hay un techo duro en los planes de nivel inferior. Los 625 créditos de Standard cubren solo unos 52 segundos de vídeo Gen-4.5 al mes [40][44]. Eso es suficiente para un puñado de clips pulidos, pero no sostendrá un flujo de trabajo de producción constante.
Alternativamente, puedes explorar MiniMax Hailuo 2.3 para una generación de vídeo de alta consistencia. A continuación, compara los precios de imagen y vídeo de Stability AI.
10. Stability AI

Stability AI destaca en flujos de trabajo de imagen y audio, donde los precios por activo a menudo importan más que un plan mensual. Usa un sistema de créditos, y 1 crédito = $0.01. Los nuevos usuarios obtienen 25 créditos gratis, lo que alcanza para unas 3 generaciones flagship u 8 imágenes SD 3.5 Large. El acceso a la API también incluye derechos de uso comercial [48].
Aquí están los precios por servicio.
Precios unitarios
| Servicio | Créditos | USD |
|---|---|---|
| Stable Image Ultra | 8 | $0.08 |
| Stable Diffusion 3.5 Large | 6.5 | $0.065 |
| Stable Diffusion 3.5 Large Turbo | 4 | $0.04 |
| Stable Image Core | 3 | $0.03 |
| Stable Diffusion 3.5 Flash | 2.5 | $0.025 |
| SDXL 1.0 | Desde 0.9 | Desde $0.009 |
| Replace Background & Relight | 8 | $0.08 |
| Erase / Inpaint / Remove Background | 5 | $0.05 |
| Creative Upscaler (a 4K) | 60 | $0.60 |
| Fast Upscaler | 2 | $0.02 |
| Stable Fast 3D | 10 | $0.10 |
| Stable Audio 3.0 (hasta 6 min) | 26 | $0.26 |
Límites incluidos
Los precios de la API son de pago por uso, con precios personalizados y descuentos por volumen para equipos de alto volumen [49].
Cobertura de modelos
Stability AI cubre texto-a-imagen, edición de imágenes, generación de activos 3D y generación de audio [48]. En pocas palabras, está hecho para trabajo de producción. Puedes generar imágenes, editarlas, convertir activos en salidas 3D y crear clips de audio sin saltar entre un montón de herramientas.
La suite de edición incluye outpainting, reemplazo de fondo, reiluminación y transferencia de estilo [48]. Stable Fast 3D maneja la generación de activos 3D, mientras que Stable Audio 3.0 admite clips de audio de hasta seis minutos [48]. Así que esto va menos de chat y más de sacar adelante el trabajo multimedia.
Esa diferencia de precios se nota más cuando trabajas a escala, especialmente con trabajos de edición y upscaling.
Coste por salida
El Creative Upscaler cuesta 60 créditos ($0.60) por imagen. Eso es 30x el precio del Fast Upscaler, que cuesta 2 créditos ($0.02). Así que si tu objetivo principal son simples aumentos de resolución, Fast Upscaler es la opción de menor coste [48].
Stable Image Core sale a unos $30/mes por 1,000 imágenes [48]. Y si escalas a 10,000 imágenes/mes con SD 3.5 Large, el coste ronda los $650 [48].
También puedes generar y editar imágenes usando otros modelos de alto rendimiento. A continuación, compara los precios de imagen de Black Forest Labs.
11. Black Forest Labs

Black Forest Labs es un útil punto de referencia de precios para la generación de imágenes porque la factura cambia con el tamaño de salida y con si usas imágenes de referencia. Su sistema se basa en créditos, con 1 crédito = $0.01. Los precios de FLUX.2 están ligados a los megapíxeles, y las imágenes de referencia se cobran aparte. Algo que hay que vigilar: cada imagen y cada imagen de referencia se redondea hacia arriba al siguiente megapíxel, basándose en 1,024 × 1,024 px.
Precios unitarios
La línea FLUX.2 viene en cuatro niveles: Max, Pro, Klein y Flex. Cada uno hace un compromiso distinto entre calidad de imagen, velocidad y precio.
| Modelo | 1er MP (base) | MP adicional | Imagen ref. (por MP) | Modo de generación |
|---|---|---|---|---|
| FLUX.2 [max] | $0.07 | $0.03 | $0.03 | Text-to-Image / Edit |
| FLUX.2 [pro] (Text-to-Image) | $0.03 | $0.015 | $0.015 | Text-to-Image |
| FLUX.2 [pro] (Edit) | $0.045 | $0.015 | $0.015 | Image Editing |
| FLUX.2 [klein] 9B | $0.015 | $0.002 | $0.002 | Text-to-Image / Edit |
| FLUX.2 [klein] 4B | $0.014 | $0.001 | $0.001 | Text-to-Image / Edit |
| FLUX.2 [flex] | $0.05 | $0.05 | $0.05 | Text-to-Image / Edit |
Los modelos más antiguos FLUX1.1 y FLUX.1 usan en su lugar precios planos por imagen.
| Modelo | Precio por imagen | Descripción |
|---|---|---|
| FLUX1.1 [pro] | $0.04 | Generación estándar de alta velocidad |
| FLUX1.1 [pro] Ultra | $0.06 | Ultra alta resolución |
| FLUX1.1 [pro] Raw | $0.06 | Estética de fotografía espontánea |
| FLUX.1 Kontext [max] | $0.08 | Edición en contexto de máxima calidad |
| FLUX.1 Kontext [pro] | $0.04 | Edición en contexto lista para uso comercial |
| FLUX.1 Fill [pro] | $0.05 | Inpainting de imagen dirigido |
| FLUX.1 [schnell] | $0.003 | Destilado para máxima velocidad |
Límites incluidos
El acceso a la API es de pago por uso, pero Black Forest Labs también tiene niveles de suscripción con topes mensuales de imágenes [50].
| Plan | Límite mensual | Funciones clave |
|---|---|---|
| Builder | 10,000 imágenes/mes | Modelos Klein, 10 usuarios, derechos de ajuste fino |
| Platform | 100,000 imágenes/mes | Modelos Klein 9B + Dev, 10 usuarios |
| Professional | 100,000 imágenes/mes | Modelos Dev, 3 dominios, 10 usuarios |
| Enterprise | Personalizado | Todos los modelos, volumen personalizado, acceso a API y pesos |
Cobertura de modelos
Black Forest Labs se centra en la generación y edición de imágenes. Los modelos FLUX.2 admiten tamaños de salida de hasta 4 MP, y cualquier cosa por encima de eso se redimensiona automáticamente [50]. Si la velocidad importa más, FLUX.2 [klein] 4B destaca con inferencia por debajo del segundo, lo que lo hace un buen encaje para casos de uso casi en tiempo real [52].
Para trabajo de edición, la línea también tiene un par de opciones claras. FLUX.1 Fill [pro] maneja inpainting dirigido a $0.05 por imagen, mientras que FLUX.1 Kontext [pro] tiene un precio de $0.04 por imagen para edición en contexto lista para uso comercial [51].
Coste por salida
Una imagen FLUX.2 [max] terminada de 4 MP cuesta unos $0.30, una vez que tienes en cuenta la generación, el upscaling y dos reintentos. Las imágenes de referencia se facturan por separado a la misma tarifa por megapíxel [50][51]. Si haces arte conceptual o prototipado en fase temprana, FLUX.2 [klein] 4B a $0.014 por imagen es la forma de bajo coste de probar ideas antes de pasar a los renders finales [50].
A continuación: precios de vídeo de Kling AI.
12. Kling AI

Kling AI divide sus precios en dos vías: la aplicación web usa créditos, mientras que la API cobra por segundo. Del lado de la API, el coste cambia según la duración del clip, la resolución y si activas el audio sincronizado.
Precios unitarios
Para vídeo silencioso estándar, los precios empiezan en $0.0672/seg a 720p y suben hasta $0.0896/seg a 1080p. Kling V3 Omni, que maneja entradas de texto más imagen y flujos de trabajo de vídeo-a-vídeo, cuesta $0.1792/seg a 1080p.
| Configuración | Resolución | Precio/seg | Coste est. de clip de 10s |
|---|---|---|---|
| Kling V3 – Silent | 720p | $0.0672 | $0.67 |
| Kling V3 – Silent | 1080p | $0.0896 | $0.90 |
| Kling V3 – With Audio | 1080p | $0.1120 | $1.12 |
| Kling V3 Omni (Ref) | 1080p | $0.1792 | $1.79 |
| Kling V3 – Silent | 4K | $0.4286 | $4.29 |
Así que sí, Kling se sitúa en el lado de menor precio para las API de vídeo.
Límites incluidos
Kling mantiene separados los precios de la aplicación web y de la API, lo que significa que necesitas revisar ambos antes de elegir un plan. La tarifa de la API es solo una pieza del cálculo. Los créditos y la concurrencia tienen un gran efecto en cuánto trabajo puedes empujar.
El nivel gratuito viene con 66 créditos al día, y esos créditos se restablecen cada 24 horas sin arrastre. Los planes de pago empiezan en $6.99/mes por 660 créditos en Standard y suben hasta $180/mes por 26,000 créditos en Ultra. Si pagas anualmente por Ultra, la tarifa efectiva baja un 34% [54].
Para usuarios de API, la concurrencia estándar está limitada a 10 trabajos en paralelo. Las cuentas de nivel de prueba obtienen solo 3. Esa diferencia puede importar mucho si intentas procesar renders por lotes en lugar de esperar los clips uno por uno.
Cobertura de modelos
Kling V3 y Kling V3 Omni admiten clips de hasta 15 segundos, lo que los hace adecuados para trabajo cinematográfico y narrativo. V2.6 limita la duración del clip a 10 segundos y añade audio sincronizado. V2.5 Turbo es aproximadamente 30% más barato que el nivel Master.
Coste por salida
Una forma común de mantener el gasto bajo control es hacer borradores en modo silencioso 720p y subir a 1080p o 4K solo para los renders finales. Ese enfoque ayuda porque muchos usuarios necesitan 2–4 intentos de generación para obtener un clip usable, y eso empuja hacia arriba el coste del vídeo terminado [53].
Los Prepaid Resource Packages pueden recortar el precio unitario efectivo en un 10% a 30%, según el tamaño del paquete [53].
A continuación, compara estos modelos por precio unitario, límites de plan, cobertura de modalidad y coste por salida.
Desglose de precios por criterio de comparación
Las tablas siguientes condensan los detalles anteriores proveedor por proveedor en cuatro filtros de compra: precio unitario, límites de plan, cobertura de modalidad y coste de salida.
Precios unitarios en APIs de texto, imagen y vídeo
| Modelo | Proveedor | Entrada ($/1M tokens) | Salida ($/1M tokens) | Nivel |
|---|---|---|---|---|
| GPT-5 Nano | OpenAI | $0.05 | $0.40 | Económico |
| Gemini 2.5 Pro | $1.25 | $10.00 | Gama media | |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | Premium |
Para la generación de imágenes, FLUX.1 [schnell] es la referencia de bajo coste a $0.003 por imagen, mientras que Stable Image Ultra se sitúa en la gama alta a $0.08 por imagen. Para vídeo, Kling V3 cuesta $0.0672/seg a 720p en la gama baja, y Veo 3.1 entra a $0.40/seg en la gama alta.
Las tarifas brutas importan. Pero en la práctica, los límites de plan a menudo deciden lo que realmente gastas.
Límites incluidos en suscripciones y planes de plataforma
Por debajo de unos 5 millones de tokens de entrada al mes, los planes de chat de $20 pueden superar la facturación por API para uso ocasional.
| Proveedor | Plan | Precio mensual | Uso incluido | Límites clave | Plan de equipo |
|---|---|---|---|---|---|
| OpenAI | ChatGPT Plus | $20 | Limitado (dinámico) | Topes de mensajes dinámicos; sin acceso a API | Sí |
| Anthropic | Claude Pro | $20 | Limitado (dinámico) | Los límites de uso varían según la demanda; sin acceso a API | Sí |
| Gemini Advanced | $20 | Limitado (dinámico) | Ligado a Google One; sin acceso a API | Sí (Workspace) |
Los modelos de razonamiento también añaden un matiz: los tokens de razonamiento ocultos se facturan a las tarifas de salida, lo que puede empujar el coste total hacia arriba de 2x a 7x.[3]
Cobertura de modelos por modalidad
Los precios solo importan una vez que la modalidad del modelo encaja con el trabajo.
| Proveedor | Texto | Entrada multimodal | Gen. imagen | Visión | Gen. vídeo | Acceso a API |
|---|---|---|---|---|---|---|
| APIMart | ✓ | ✓ | ✓ | - | ✓ | API unificada |
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | Directo |
| ✓ | ✓ | ✓ | ✓ | ✓ | Directo | |
| Anthropic | ✓ | ✓ | ✗ | ✓ | ✗ | Directo |
| Meta | ✓ | ✓ | ✗ | ✓ | ✗ | Unificado/Alojado |
| Mistral AI | ✓ | ✓ | ✗ | ✓ | ✗ | Directo |
| Stability AI | ✗ | ✗ | ✓ | ✗ | ✓ | Directo |
Un modelo barato no es ninguna ganga si no puede manejar el formato que necesitas. Los proveedores de solo texto, por ejemplo, no ayudarán mucho si tu flujo de trabajo depende de salida de imagen o vídeo.
Coste por salida por caso de uso común
Estos son los costes que los equipos tienden a sentir una vez que las cosas llegan a producción.
Cargas de trabajo de texto (por 1M de tokens de salida):
| Caso de uso | Modelo | Coste de salida | Nivel | Compromiso clave |
|---|---|---|---|---|
| Chatbot de alto volumen | GPT-5 Nano | $0.40 | Económico | Menor profundidad de razonamiento |
| Extracción de documentos | Gemini Flash Lite | $0.30 | Económico | Escritura creativa limitada |
| Generación de código | Gemini 2.5 Pro | $10.00 | Gama media | Recargo por encima de 200K de contexto [3] |
| Flujos de trabajo con agentes | Claude Sonnet 4.6 | $15.00 | Gama media | Necesita caché de prompts para el ROI [3] |
| Razonamiento complejo | Claude Opus 4.8 | $25.00 | Premium | Alto coste; mayor latencia |
Cargas de trabajo de vídeo (por clip de 10 segundos):
| Caso de uso | Modelo | Coste de salida | Nivel | Compromiso clave |
|---|---|---|---|---|
| Vídeo de formato corto (borrador) | Kling V3 | ~$0.67 | Económico | 720p; limitado a clips de 15 segundos |
| Vídeo de formato corto (final) | Sora 2 | $1.00 | Gama media | Calidad y coste equilibrados |
| Vídeo cinematográfico | Veo 3.1 | $4.00 | Premium | Máxima calidad; máximo gasto |
Aquí está la versión simple: el precio por token o por segundo es solo parte de la historia. El factor más grande suele ser cómo usas el modelo. Un chatbot funcionando todo el día, un pipeline de documentos y un estudio de vídeo pueden parecer baratos sobre el papel y volverse caros rápido una vez que entra en juego el volumen de salida.
Una regla práctica: el procesamiento por lotes recorta costes en un 50% en OpenAI, Anthropic y Mistral para cargas de trabajo que pueden tolerar un plazo de 24 horas.[3] Para vídeo, hacer borradores en menor resolución y mejorar solo los renders finales es la forma más fiable de controlar el gasto por salida.
Pros y contras
La tabla siguiente reduce los compromisos a lo que suele impulsar la decisión: coste, modalidad y encaje de carga de trabajo. Si estás eligiendo entre proveedores, esto te da la versión corta sin hacerte volver a revisar cada sección de precios.
| Sujeto | Pros | Contras | Mejor para |
|---|---|---|---|
| APIMart | Más de 500 modelos bajo una API; una factura para texto, imagen y vídeo | Los precios basados en el uso significan que los costes suben con el volumen de salida | Equipos que quieren acceso multimodal unificado |
| OpenAI | Facturación por token clara | Los modelos flagship son caros | Cargas de trabajo de texto de uso general |
| Anthropic | El caché de prompts reduce los costes de trabajo repetido | Los modelos de gama alta cargan altas tarifas de salida | Programación y flujos de trabajo de contexto largo |
| Google AI | Flash-Lite es barato | Pro se encarece por encima de 200K tokens | Cargas de trabajo de texto de alto volumen y contexto largo |
| Meta (Llama) | Bajo coste si puedes autoalojar | Sin API propia, tú te encargas del alojamiento y la disponibilidad | Cargas de trabajo sensibles al coste con capacidad de autoalojamiento |
| xAI (Grok) | Precios de gama media competitivos | Línea de modelos más pequeña | Aplicaciones de datos web y sociales en tiempo real |
| Mistral AI | Modelos pequeños de bajo coste y cobertura multilingüe | Menos funciones multimodales | Aplicaciones de texto multilingües |
| Cohere | Embed, Rerank y Command R7B encajan con RAG | Command R+ es caro para su nivel | Generación aumentada por recuperación y bases de conocimiento |
| Stability AI | Precios de generación de imágenes muy bajos | El alcance solo de imagen limita flujos de trabajo más amplios | Generación de imágenes de alto volumen |
| Kling AI | Vídeo de formato corto de bajo coste | Limitado a vídeos de 15 segundos con el precio base | Generación de vídeo de formato corto |
Una forma simple de leer esto:
- Si quieres una API para muchos tipos de modelos, APIMart destaca.
- Si te importa más el uso de texto plano y la facturación sencilla, OpenAI o Google AI pueden ser el encaje más fácil.
- Si tu trabajo se inclina hacia programación, prompts largos o contexto repetido, Anthropic puede tener sentido.
- Si estás manteniendo bajos los costes y puedes ejecutar las cosas tú mismo, Meta (Llama) es difícil de ignorar.
- Si tu stack está construido en torno a RAG, Cohere tiene herramientas que encajan bien con esa configuración.
Para uso intensivo en imágenes, Stability AI es la opción de bajo coste. Para clips de vídeo cortos, Kling AI mantiene bajos los costes de entrada, aunque el plan base sigue ligado a salidas de 15 segundos.
Conclusión
Mirando el desglose de precios anterior, el mejor modelo no es el más caro ni el más barato. Es el que encaja con tu carga de trabajo, modalidad y volumen.
Las tareas de alto volumen y baja complejidad deberían ejecutarse en los modelos de menor coste con los que puedas arreglártelas.
A medida que sube la complejidad, el gasto debería subir solo cuando la salida lo merezca. Los modelos de gama media son un buen encaje para aplicaciones en producción que necesitan un rendimiento constante sin la etiqueta de precio de gama alta.
Una vez que entras en razonamiento premium o generación multimedia, el coste por salida empieza a importar más que los precios brutos por token. Los modelos premium tienen sentido cuando la calidad tiene un efecto directo en los resultados. Y para vídeo, los precios funcionan de forma distinta: APIs como WAN 2.7, Sora 2 ($0.08/seg) y Kling V3 ($0.0672/seg a 720p) cobran por segundo, no por token.
Para equipos que usan modelos de texto, imagen y vídeo juntos, APIMart da acceso a más de 500 modelos a través de una única API. Eso significa que el trabajo multimodal puede estar bajo una sola API y una sola factura.
Preguntas frecuentes
¿Cómo estimo el coste total por salida?
Estima el coste total según cómo se factura el modelo.
Para modelos de texto, los precios suelen dividirse en tokens de entrada y tokens de salida por 1 millón de tokens. Los tokens de salida a menudo cuestan más, por lo que la longitud esperada de tu respuesta tiene el mayor efecto en el gasto total.
Para casos de uso que no son de texto, los modelos de imagen a menudo tienen precios por llamada, mientras que los modelos de vídeo tienen precios por segundo generado.
Una forma simple de estimar el coste es:
- usar un contador de tokens para medir el volumen del prompt
- comprobar la tarifa del modelo para cada unidad de facturación
- aplicar esa tarifa a tu uso esperado
Eso te da una estimación de coste práctica antes de escalar nada.
¿Cuándo ahorra dinero el caché de prompts?
El caché de prompts recorta costes cuando tu aplicación envía el mismo prefijo de prompt una y otra vez. Eso suele significar instrucciones de sistema largas, grandes conjuntos de documentos o historial de conversación compartido reutilizado en muchas solicitudes.
En lugar de pagar el precio completo de tokens de entrada cada vez, pagas menos por la parte repetida. En muchos casos, eso puede reducir los costes de entrada en un 50% a 90%.
Esto funciona mejor cuando el volumen es alto y el contexto se mantiene mayormente igual. Un chatbot de soporte al cliente es un buen ejemplo: el bot puede reutilizar las mismas reglas, información de marca y documentos de ayuda a través de miles de chats.
Es un mal encaje cuando el contexto cambia todo el tiempo. Si tu aplicación sigue reescribiendo el prompt desde cero en cada solicitud, hay menos texto repetido que cachear, por lo que los ahorros bajan rápido.
¿Debería usar suscripciones o precios de API?
Para la mayoría de los desarrolladores y empresas, los precios de API tienen más sentido. Con la facturación de pago por uso, pagas por los tokens que usas: sin mínimos mensuales, sin tarifas sorpresa y sin cargos fijos pendiendo sobre ti cuando el tráfico es bajo. Tus costes se mueven con el uso, lo que a menudo es un encaje mucho mejor que una factura recurrente fija.
APIMart te da una API que conecta con más de 500 modelos de IA, con precios claros por token y descuentos automáticos por volumen a medida que tu uso sube.
Publicaciones de blog relacionadas
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.