APIMart
Guia de Preços de LLM — Compare mais de 500 Modelos de IA

Guia de Preços de LLM — Compare mais de 500 Modelos de IA

Compare preços de APIs de LLM e mídia em mais de 500 modelos da OpenAI, Anthropic, Google, Meta, xAI, Mistral e outras — por custo de token, imagem e vídeo.

Insights de Modelos

Os gastos com IA podem ficar caros rapidamente: empresas dos EUA agora gastam em média $85.500 por mês com IA. Minha principal conclusão é simples: o modelo mais barato no papel nem sempre é a opção de menor custo depois que você leva em conta o comprimento da saída, o tamanho do contexto, as retentativas, as taxas de ferramentas e os limites do plano.

Se eu estivesse escolhendo a partir deste guia, olharia para quatro coisas primeiro:

  • Preço unitário: tokens, imagens ou segundos de vídeo
  • Limites: RPM, TPM, janelas de contexto e tetos do plano
  • Modalidade: suporte a texto, imagem, áudio, vídeo e visão
  • Custo por saída finalizada: não apenas o preço de tabela

O artigo compara APIMart, OpenAI, Anthropic, Google AI, Meta, xAI, Mistral, Cohere, Runway, Stability AI, Black Forest Labs, e Kling AI.

Alguns padrões claros se destacam:

  • O preço do texto varia muito. A OpenAI vai de $0.05 a $30.00 por 1M de tokens de entrada.
  • A saída costuma ser muito mais cara que a entrada. Em alguns casos, a saída chega a ser 4x a 6x mais cara.
  • O contexto longo pode mudar a conta. A OpenAI adiciona preços mais altos após 270.000 tokens, e o Google altera as tarifas acima de 200.000 tokens.
  • Trabalhos em lote podem reduzir custos. OpenAI, Anthropic e Mistral listam descontos de 50% para processamento assíncrono.
  • Os custos de vídeo se acumulam com as retentativas. Uma tarifa barata por segundo ainda pode se transformar em um custo muito mais alto por clipe finalizado.
  • A cobrança unificada importa para equipes que usam muitos formatos. A proposta da APIMart é uma API e uma fatura para mais de 500 modelos.

Se você quer a versão curta:
use modelos econômicos para texto de alto volume, modelos intermediários para aplicativos em produção, modelos premium apenas quando a qualidade da saída muda os resultados do negócio, e rascunhe vídeo em baixa resolução antes de pagar pelas renderizações finais.

O que são Tokens de LLM e Preços de API? (Amigável para Iniciantes)

Comparação Rápida

Comparação de Preços de Modelos de IA: Custo por 1M de Tokens por Provedor (2026)
Comparação de Preços de Modelos de IA: Custo por 1M de Tokens por Provedor (2026)
ProvedorPrincipal ForçaFique Atento aMelhor Para
APIMartUma API para mais de 500 modelos em texto, imagem, vídeo e áudioOs custos de uso ainda crescem com o volumeEquipes que querem uma única configuração de cobrança
OpenAIAmpla gama de modelos e preços de token claros e dicas de custoOs melhores modelos ficam caros rápidoTexto, imagem, áudio e vídeo em geral
AnthropicForte para programação e contexto longoAs tarifas de saída são altasAgentes, programação, prompts longos
Google AIOpções Flash de baixo custo e grande contextoTarifas mais altas acima de 200K tokensAplicativos de texto e multimodais de alto volume
MetaPreços muito baixos de Llama hospedado ou auto-hospedadoPreços e limites dependem do hostEquipes focadas em custo com opções de hospedagem
xAIMenor diferença entre preços de entrada e saídaChamadas de ferramentas adicionam taxas extrasAplicativos de resposta longa e uso de ferramentas
MistralPreços baixos de token e descontos em loteAlgumas ferramentas custam extraTexto utilitário, programação, uso baseado na UE
CohereBoa opção para RAG, embeddings e rerankMenos adequado para geração de mídiaBusca, recuperação, bases de conhecimento
RunwayPlataforma focada em vídeo com cálculo de créditos claroRetentativas podem elevar o custo finalizadoCriação e edição de vídeo
Stability AIPreços baixos de imagem e ferramentas de ediçãoEscopo mais estreito que fornecedores de textoTrabalho de imagem e áudio de alto volume
Black Forest LabsPreços de imagem detalhados por tamanhoCustos sobem com retentativas e referênciasGeração e edição de imagem
Kling AIGeração de vídeo curto de baixo custoLimites de duração de clipe e concorrênciaVídeo de formato curto

Então, antes de comparar preços linha por linha, eu começaria com uma pergunta: Pelo que estou pagando mais - tokens, imagens, segundos ou retentativas?

1. APIMart

APIMart

A APIMart usa cobrança pay-as-you-go com nenhum mínimo mensal e nenhuma taxa oculta. Os preços mudam conforme a modalidade, então texto, imagem, vídeo e áudio não são cobrados da mesma forma.

Preço Unitário

Os preços variam por modalidade, como mostra a tabela abaixo.

ModalidadeUnidade de CobrançaModelo de ExemploPreço APIMart
TextoPor 1M de tokensQwen2.5-VL-72B$20.00
ImagemPor chamadaGPT Image 2$0.006
ImagemPor chamadaWan 2.7 Image$0.0216
VídeoPor segundoSora 2$0.08
VídeoPor segundoKling V3 (720p)$0.0672

Os custos de geração de imagem podem variar bastante dependendo do nível de qualidade. Por exemplo, uma chamada GPT-Image-2-Official de 1024×1024 custa cerca de $0.00488 em qualidade Baixa, $0.04232 em Média e $0.16872 em Alta. Essa diferença se acumula rápido. Se a saída de topo de linha não for necessária, usar um nível mais baixo pode reduzir o gasto por chamada.

Limites Incluídos

Contas padrão vêm com limites de RPM e TPM. Contas Enterprise podem solicitar canais de maior throughput.

Cobertura de Modelos

A APIMart suporta modelos de texto, imagem, vídeo e áudio por meio de uma única API. Isso inclui modelos como GPT-5, Claude, Sora 2, Midjourney e Kling V3.

Custo por Saída

A principal vantagem aqui é a cobrança consolidada entre modalidades. Em vez de fazer malabarismos com faturas separadas para texto, imagem e vídeo, você tem uma configuração única que facilita o controle de gastos.

Em seguida, o guia compara como os principais provedores estruturam os preços em modelos de texto, imagem e vídeo.

2. OpenAI

OpenAI

A OpenAI usa um modelo de preços pay-per-token para texto. E a diferença entre os modelos é enorme.

Em junho de 2026, os preços começam em $0.05 por 1M de tokens de entrada para o GPT-5 nano e vão até $30.00 por 1M de tokens de entrada para o GPT-5.5 Pro [3][5]. A maneira mais fácil de ler os preços da OpenAI é por nível de modelo, porque as tarifas de entrada, saída e tokens em cache podem ser muito diferentes de um modelo para outro.

Preço Unitário

ModeloEntrada (por 1M)Entrada em CacheSaída (por 1M)
GPT-5.5 Pro$30.00-$180.00
GPT-5.5 (Standard)$5.00$0.50$30.00
GPT-5.4$2.50$0.25$15.00
GPT-5.4 mini$0.75$0.075$4.50
GPT-5.4 nano$0.20$0.02$1.25
GPT-5 nano$0.05$0.005$0.40

Em todos os modelos da OpenAI, os tokens de saída custam 4 a 6 vezes mais que os tokens de entrada [6]. Isso importa muito quando seu aplicativo produz respostas longas, resumos ou respostas no estilo de agente. A OpenAI também oferece os níveis Batch e Flex com um desconto fixo de 50% em todos os modelos, então a entrada do GPT-5.5 cai de $5.00 para $2.50 por 1M de tokens [5].

Os custos podem subir novamente quando o uso de contexto longo atinge o preço de sobretaxa.

Limites Incluídos

A OpenAI dobra as tarifas de entrada e saída assim que o contexto total ultrapassa 270.000 tokens [3][5]. Se você está trabalhando com revisão de documentos longos ou loops de agente de múltiplas rodadas, a sumarização contínua é uma das maneiras mais simples de ficar abaixo dessa linha.

A OpenAI usa essa mesma configuração de preços também em modelos de imagem, áudio e vídeo.

Cobertura de Modelos

A OpenAI cobra a geração de imagem, áudio e vídeo separadamente. O Sora-2 custa $0.10 por segundo para vídeo 720p, enquanto o Sora-2-pro em 1080p custa $0.70 por segundo na tarifa padrão [5].

Para outras mídias:

  • Os preços de imagem vão de $2.50 a $8.00 por 1M de tokens
  • A transcrição do Whisper custa $0.006 por minuto
  • TTS (tts-1) custa $0.015 por 1.000 caracteres [3][4]

Custo por Saída

Uma das maneiras mais rápidas de cortar gastos é simples: envie trabalho de menor valor para modelos mais baratos. Processar 10.000 tickets de suporte custa cerca de $16 com o GPT-4.1, $3.20 com o GPT-4.1 mini e $0.80 com o GPT-4.1 nano [4].

3. Anthropic

Anthropic

A Anthropic divide sua linha de API Claude em quatro níveis de preços: Frontier/Research (Claude Fable 5 / Mythos 5), Flagship (Claude Opus 4.5–4.8), Mid-tier (Claude Sonnet 4.5–4.6) e Budget (Claude Haiku 4.5) [9][10]. O padrão é bem claro. À medida que você sobe de nível, ganha mais profundidade de raciocínio e melhor saída, mas a conta também sobe rápido. Para a maioria dos compradores, a escolha se resume a isto: o Haiku é a opção de baixo custo, o Sonnet é o meio-termo, e o Opus/Fable são feitos para trabalhos mais pesados.

Preço Unitário

A Anthropic cobra os tokens de saída a 5x a tarifa de entrada em toda a linha atual de níveis [7][6]. Os preços abaixo estão em USD por 1 milhão de tokens [13][15].

ModeloEntrada (por 1M)Leitura de Cache (por 1M)Saída (por 1M)
Claude Fable 5 / Mythos 5$10.00$1.00$50.00
Claude Opus 4.8$5.00$0.50$25.00
Claude Sonnet 4.6$3.00$0.30$15.00
Claude Haiku 4.5$1.00$0.10$5.00

O cache de prompt pode reduzir custos quando você reutiliza o mesmo prefixo repetidamente. As gravações de cache custam 1.25x a tarifa de entrada base para um TTL de 5 minutos, ou 2x para um TTL de 1 hora. As leituras de cache custam 10% da entrada padrão. Na prática, o cache começa a fazer sentido após quatro ou mais usos do mesmo prefixo [3][9][12].

Limites Incluídos

A maioria dos modelos flagship e mid-tier atuais da Anthropic - incluindo Fable 5, Mythos 5, Opus 4.6–4.8 e Sonnet 4.6 - vem com uma janela de contexto de 1M de tokens no preço padrão [9][11]. O Claude Haiku 4.5 chega a 200.000 tokens. Os limites de tarifa seguem uma configuração em níveis, do Tier 1 até Enterprise, com tetos de RPM e TPM definidos por plano [13][15].

Cobertura de Modelos

Os modelos da Anthropic lidam com entradas de texto e visão, e o Computer Use adiciona sobrecarga extra de tokens. Alguns complementos são cobrados separadamente:

  • A busca na web custa $10 por 1.000 buscas
  • Os Managed Agents custam $0.08 por hora de sessão ativa, mais cobranças de token

A Batch API corta os custos de token em 50% para trabalhos assíncronos com um prazo de 24 horas [8][9][11].

Custo por Saída

É aqui que o preço fica prático: qual nível permanece custo-efetivo para tarefas repetidas, trabalho de contexto longo e fluxos de agente?

Uma sessão de programação de uma hora no Claude Opus 4.8, usando 50.000 tokens de entrada com 40.000 como leituras de cache e 15.000 tokens de saída, custa cerca de $0.525, incluindo a taxa de sessão de agente de $0.08 [9][12]. Isso dá uma boa ideia de como os preços da Anthropic se comportam no uso real, não apenas em uma tabela de preços.

Para trabalhos em produção como assistentes de programação e agentes de múltiplas etapas, o Claude Sonnet 4.6 tende a oferecer o melhor equilíbrio entre custo e capacidade [6][3].

Em seguida, compare os preços do Google AI nos modelos de texto e multimodais Gemini.

4. Google AI

Google AI

O Google cobra seus modelos com base no modelo que você escolhe e no tamanho da janela de contexto. Uma regra de preço importa imediatamente: mantenha os prompts abaixo de 200.000 tokens se quiser evitar a tarifa mais alta [14][3].

Preço Unitário

ModeloEntrada (por 1M)Saída (por 1M)Janela de Contexto
Gemini 3.1 Pro (≤200K)$2.00$12.001M–2M
Gemini 3.1 Pro (>200K)$4.00$18.001M–2M
Gemini 2.5 Pro (≤200K)$1.25$10.002M
Gemini 3.5 Flash$1.50$9.001M
Gemini 3 Flash$0.50$3.001M
Gemini 2.5 Flash$0.30$2.501M
Gemini 3.1 Flash-Lite$0.25$1.501M
Gemini 2.5 Flash-Lite$0.10$0.401M
Gemini 3 4B$0.04$0.08131K

Para geração de imagem, o Imagen 4 Fast começa em $0.01–$0.02 por imagem, enquanto o Imagen 4 Ultra custa $0.06 por imagem. O vídeo Veo 3.1 é cobrado por segundo. O Standard fica em $0.40 por segundo para 720p e 1080p, e o Light fica em $0.05–$0.08 por segundo [17].

Limites Incluídos

O preço do modelo é apenas parte da história. Limites de throughput e configurações de dados podem alterar seu gasto total de forma significativa.

O principal trade-off do Google é bem claro: preço baixo de modelo de um lado, e limites de throughput mais restrições de dados do outro. No Google AI Studio, o nível gratuito oferece cerca de 15 RPM, tokens gratuitos e uso de dados para melhoria de produto. O nível pago salta para cerca de 1.000–2.000 RPM, desativa o uso de dados para melhoria de produto e adiciona cache de contexto mais a Batch API. Planos Enterprise adicionam throughput provisionado, descontos por volume e recursos de conformidade [17][18].

O cache de contexto é uma das maiores alavancas de custo aqui. Gravar no cache é gratuito, e ler dele custa 25% da tarifa de entrada padrão [18].

Cobertura de Modelos

A linha do Google abrange modelos de texto, multimodais, imagem e vídeo. Também suporta entrada de imagem, começando em $0.0025 por imagem [3].

Custo por Saída

Para chatbots, sumarização e classificação, o Gemini 2.5 Flash ou o Gemini 3.1 Flash-Lite geralmente farão mais sentido. Eles são mais baratos e se encaixam bem em muitas cargas de trabalho do dia a dia. Reserve o Gemini 3.1 Pro para casos em que você precisa da janela de contexto maior, e use a sumarização contínua para ficar abaixo do corte de 200.000 tokens [3][6].

Há também um ângulo de preço simples que vale a pena notar. A $2.00 por 1M de tokens de entrada, o Gemini 3.1 Pro é mais barato que modelos flagship como o GPT-5.5 ($5.00) e o Claude Opus 4.8 ($5.00) para prompts de comprimento padrão [2].

Em seguida, compare os preços e a cobertura de modelos da Meta.

5. Meta

A Meta funciona um pouco diferente dos provedores de modelo fechado acima. Seus modelos Llama são de peso aberto, então seu custo depende de onde você os hospeda ou acessa. Na prática, isso significa que exatamente o mesmo modelo pode ter preços muito diferentes de um provedor para outro. Por exemplo, o Llama 3.3 70B já foi listado por até $0.10 por 1M de tokens de entrada. A Meta também não publica uma tabela de preços de API própria, e é por isso que os preços podem variar tanto entre os hosts [1][19][20].

Preço Unitário

O preço atual está centrado no Llama 4 Scout e no Llama 4 Maverick [21][22].

ModeloEntrada (por 1M)Saída (por 1M)Janela de Contexto
Llama 4 Scout$0.08 – $0.17$0.15 – $0.66Até 10.000.000 tokens
Llama 4 Maverick$0.15 – $0.24$0.60 – $0.971.000.000 tokens
Llama 3.3 70B$0.10 – $0.72$0.32 – $0.72128K – 131K tokens
Llama 3.2 1B Instruct$0.01 – $0.02$0.01 – $0.0260K – 131K tokens
Llama 3.1 405B Instruct$0.90 – $3.00$0.90 – $3.00128K – 131K tokens

Esse preço de tabela baixo parece ótimo no papel. Mas só ajuda se os limites de contexto e os tetos de throughput do host corresponderem à sua carga de trabalho.

Limites Incluídos

Não existe um plano padrão único da Meta com limites de tarifa compartilhados ou um nível gratuito integrado. Os hosts definem seus próprios limites de throughput, tetos de contexto e regras de cache. Então, se você está planejando trabalho de contexto longo com o Llama 4 Scout, verifique primeiro o teto de contexto do host em vez de assumir que terá toda a faixa anunciada.

Cobertura de Modelos

O Llama 4 Scout e o Llama 4 Maverick suportam entrada de texto e visão, além de chamada de ferramentas e modo JSON nos principais provedores [21][22]. Opções mais antigas ainda têm seu lugar também. O Llama 3.2 11B Vision ainda pode lidar com trabalhos com muita visão, enquanto o Llama 3.2 1B Instruct é voltado para implantações de borda, onde baixa latência e uso enxuto de computação importam mais [21][22].

Custo por Saída

Se você está executando trabalhos de alto volume com prompts longos, o Scout se destaca. Uma tarefa de programação com 40K de entrada e 8K de tokens de saída custa cerca de $0.005 por tarefa, o que dá aproximadamente 200 tarefas por $1. Essa mesma tarefa no GPT-5.5 custa cerca de $0.44, ou apenas 2.3 tarefas por $1 [6].

Para uso voltado ao cliente ou trabalho multimodal, o Llama 4 Maverick costuma ser a melhor escolha. Ele supera o GPT-4o em benchmarks enquanto custa muito menos no preço de entrada: $0.15/M de entrada contra $2.50/M de entrada [6]. Sua menor diferença entre preços de entrada e saída também o torna uma boa opção quando você espera respostas mais longas.

Em seguida, compare os preços e a cobertura de modelos da xAI.

6. xAI

xAI

A xAI mantém baixos os preços de entrada e saída, o que ajuda quando as respostas ficam longas. O Grok 4.3 cobra $1.25 por 1 milhão de tokens de entrada e $2.50 por 1 milhão de tokens de saída. Essa diferença de 2x importa quando um modelo escreve muito de volta para você [6][24].

Preço Unitário

ModeloEntrada (por 1M)Entrada em CacheSaída (por 1M)Janela de Contexto
Grok 4.3 (Flagship)$1.25$0.20$2.501M tokens
Grok 4.20 (Reasoning)$1.25$0.20$2.502M tokens
Grok Build 0.1 (Coding)$1.00$0.20$2.00256K tokens
Grok 4.1 Fast (Budget)$0.20$0.05$0.502M tokens

Para trabalho com imagem, o Grok Imagine 1.5 Edit custa $0.01875 por chamada [23]. A geração de vídeo pela Imagine API vai de $0.08 a $0.25 por segundo, com base na resolução [24].

Limites Incluídos

A xAI usa cobrança pay-as-you-go com limites de tarifa baseados em uso. Planos Enterprise podem adicionar limites de tarifa personalizados e infraestrutura dedicada [25][26].

Há uma coisa a observar: o uso de ferramentas pode se acumular rápido. Busca e execução de código são cobradas separadamente, então um preço baixo de token nem sempre significa uma conta final baixa. Web Search, X Search e Code Execution custam $5.00 por 1.000 chamadas cada [24].

Se seus trabalhos não forem urgentes, a Batch API pode reduzir custos em 20% a 50% para tarefas processadas dentro de 24 horas [24].

Cobertura de Modelos

A xAI cobre casos de uso de texto, imagem e vídeo [24][16]. O Grok 4.20 é construído para uso de ferramentas mais rápido, enquanto o Grok Build 0.1 é voltado para trabalho com muita programação [6][2].

Custo por Saída

Para uma tarefa padrão de programação com 40K tokens de entrada e 8K tokens de saída, o Grok 4.3 custa cerca de $0.07 por tarefa. Isso dá aproximadamente 14 tarefas por $1 [6].

Em seguida, o guia compara a estrutura de preços de outro provedor, ou você pode usar uma API de LLM unificada para acessar esses modelos por meio de uma única integração.

7. Mistral AI

Mistral AI

O Mistral Large 3 custa $0.50 por 1M de tokens de entrada e $1.50 por 1M de tokens de saída. Isso o coloca no grupo dos flagships de baixo preço. As tarifas de destaque parecem fortes, mas a conta final pode mudar quando você considera as cobranças de ferramentas e os níveis de cobrança da Mistral.

Aqui está a linha atual.

Preço Unitário

ModeloEntrada (por 1M)Entrada em CacheSaída (por 1M)
Mistral Large 3 (Flagship)$0.50$0.05$1.50
Mistral Medium 3.5 (Balanced)$1.50-$7.50
Mistral Small 4 (Efficient)$0.10$0.01$0.30
Magistral Medium (Reasoning)$2.00-$5.00
Codestral (Coding)$0.30$0.03$0.90
Devstral 2 (Coding)$0.40$0.04$2.00
Pixtral Large (Multimodal)$2.00-$6.00

A Mistral também cobra separadamente por OCR a $4.00 por 1.000 páginas, embeddings a $0.10 por 1M de tokens, e busca na web mais execução de código a $30 por 1.000 chamadas [27].

Limites Incluídos

A Mistral usa cobrança pay-as-you-go, com quatro níveis de limite de tarifa que se abrem a $20, $100 e $500 em gasto acumulado [31]. O plano Team vem com um compromisso mínimo de $50 por mês [27].

Há duas alavancas aqui que podem cortar custos rápido:

  • A Batch API reduz todos os preços de modelo em 50% para trabalhos assíncronos [27][31].
  • O cache de prompt pode reduzir os custos de tokens em cache em até 90% quando o prefixo compartilhado tem pelo menos 64 tokens de comprimento [31].

Essas regras de preço importam mais quando você está executando cargas de trabalho de alto volume ou assíncronas.

Cobertura de Modelos

A Mistral cobre casos de uso de texto, raciocínio, programação, multimodal e borda. O Codestral suporta fill-in-the-middle (FIM), o que o torna uma boa escolha para fluxos de trabalho em IDE. A série Ministral - 3B, 8B e 14B - é voltada para implantações de baixo custo ou no dispositivo [30][32].

A Mistral também oferece endpoints hospedados na UE e processamento de dados compatível com o GDPR sem custo extra [29][31].

Custo por Saída

Para trabalho utilitário de alto volume como extração de entidades, classificação e sumarização, o Mistral Small 4 é a opção mais forte [28][31]. Se você precisa de mais poder de raciocínio mas ainda quer preços baixos de token, o Mistral Large 3 faz mais sentido [28][31].

Para tarefas com muito raciocínio, o Magistral Medium custa $5.00 por 1M de tokens de saída e é 37% mais barato na saída que o o3 da OpenAI [29].

Em seguida, compare os preços da Cohere para cargas de trabalho de texto empresarial e recuperação.

8. Cohere

Cohere

A Cohere é construída principalmente para recuperação e busca empresarial. Seus preços refletem isso: opções de baixo custo para trabalho de recuperação com muito texto, e modelos de preço mais alto para trabalhos multimodais ou mais exigentes.

Preço Unitário

A Cohere divide sua linha em três grupos: modelos de recuperação de baixo custo, modelos multimodais empresariais e ferramentas separadas para embeddings e reranking.

ModeloEntrada (por 1M)Saída (por 1M)Janela de Contexto
Command R7B$0.0375$0.15128K
Command R$0.15$0.60128K
Command R+$2.50$10.00128K
Command A (Multimodal)$2.50$10.00256K
Aya Expanse (8B/32B)$0.50$1.50128K
Embed v3$0.10--
Rerank v3$2.00--

O Rerank é cobrado usando unidades de busca: uma consulta mais até 100 documentos. Se os trechos passarem de 500 tokens, eles contam separadamente [33][35].

Limites Incluídos

A Cohere oferece chaves de teste gratuitas para testes, limitadas a 1.000 chamadas por mês e 20 RPM [37]. As chaves de produção usam preços pay-as-you-go, com até 500 RPM para modelos padrão. A cobrança acontece no fim do mês ou quando seu saldo atinge $250 [33][37].

Alguns dos modelos de topo de linha da Cohere precisam de aprovação de vendas antes do uso completo em produção. Isso inclui Command A+, A Reasoning e A Vision. Até que essa aprovação aconteça, o acesso self-serve permanece nos limites do estilo de teste [37].

Se sua equipe precisa de throughput dedicado, a Cohere também oferece o Model Vault. Os preços começam em $2.500 por mês para uma instância Embed 4 Small [33].

Cobertura de Modelos

A Cohere se encaixa em fluxos de trabalho empresariais focados em texto, não em geração de mídia.

A empresa centra sua linha em torno de texto, recuperação e busca empresarial em vez de geração de imagem ou vídeo. A principal exceção é o Command A, que suporta entradas de imagem e tarefas multimodais. Ele também vem com uma janela de contexto de 256.000 tokens, a maior da linha da Cohere [34][36].

O Aya Expanse suporta 49 idiomas, o que o torna uma escolha sólida para implantações globais [37].

Custo por Saída

Se você está construindo pipelines de RAG, o baixo preço de entrada da Cohere é o grande atrativo. Esses fluxos de trabalho geralmente consomem muito mais tokens de entrada que de saída, então o Command R a $0.15 por 1M de tokens de entrada ajuda a evitar que prompts com muitos documentos fiquem caros demais.

Um exemplo simples deixa a diferença clara: executar 100.000 interações de chatbot de suporte no Command R custa cerca de $123 por mês, enquanto o mesmo volume no Command R+ chega a aproximadamente $2.050 por mês [39].

Para classificação e sumarização puras em escala, o Command R7B é a opção de menor custo da linha [34][38].

Uma maneira prática de pensar sobre isso:

  • Use o Command R7B para classificação e sumarização de alto volume.
  • Use o Command R para RAG e chatbots.
  • Use o Command R+ apenas quando você precisar da força extra do modelo.

Em seguida, compare os preços da Runway ou explore alternativas de geração de vídeo de IA cinematográfico.

9. Runway

Runway

A Runway é construída em torno de vídeo, então seus preços estão ligados a segundos gerados ou editados. Ela usa um sistema de créditos para trabalho de vídeo e imagem. Você obtém créditos por meio de uma assinatura ou comprando pacotes de recarga a $0.01 por crédito, com um mínimo de $10. Os créditos de API são cobrados separadamente. A principal coisa a observar é como o consumo de créditos muda de um modelo para outro.

Preço Unitário

ModeloTarifa API (Créditos/seg)Custo USD/seg
Gen-4.5 (Flagship)12 /seg$0.12
Gen-4 Video12 /seg$0.12
Gen-4 Turbo5 /seg$0.05
Aleph 2.0 (Edição de Vídeo)28 /seg$0.28
Act-Two (Animação)5 /seg$0.05
Gen-4 Image (1080p)8 /img$0.08

Limites Incluídos

Em planos anuais [40][43], a Runway inclui os seguintes tetos mensais de créditos:

PlanoCusto Mensal (Anual)Créditos/MêsRollover
Free$0125 (uma vez)Nenhum
Standard$12625Nenhum
Pro$282.250Nenhum
Max$769.5001 mês

O plano Free inclui marcas d'água e não permite uso comercial. Os planos pagos removem ambas as limitações [40][44]. Os créditos do Standard e do Pro não acumulam, e os créditos não utilizados expiram dentro de 24 horas após a próxima data de cobrança [40][43][46]. Apenas o Max oferece um mês de rollover [40][43][46].

Cobertura de Modelos

A Runway cobre texto-para-vídeo, imagem-para-vídeo, edição de vídeo, texto-para-imagem, imagem-para-imagem, além de ferramentas de áudio e pós-processamento [42]. Essa amplitude lhe dá mais alcance que uma ferramenta que só faz geração. Mas o preço sozinho não conta a história toda. A qualidade da saída muda o que você acaba pagando na prática.

Custo por Saída

É aqui que as coisas ficam mais caras do que parecem à primeira vista. As retentativas se acumulam rápido. A maioria dos clipes finalizados leva 3 a 5 gerações, o que empurra o Gen-4.5 para cerca de $0.50 a $0.80 por segundo finalizado [43][44][47].

Uma maneira comum de manter os gastos sob controle é usar o Gen-4 Turbo a $0.05/seg para rascunhos e testes de conceito, e depois passar para o Gen-4.5 a $0.12/seg para as renderizações finais [41][45]. Essa configuração faz sentido se você não quer queimar créditos premium enquanto ainda está definindo movimento, enquadramento ou timing.

Há também um teto rígido nos planos de nível mais baixo. Os 625 créditos do Standard cobrem apenas cerca de 52 segundos de vídeo Gen-4.5 por mês [40][44]. Isso é suficiente para alguns clipes polidos, mas não sustentará um fluxo de trabalho de produção constante.

Como alternativa, você pode explorar o MiniMax Hailuo 2.3 para geração de vídeo de alta consistência. Em seguida, compare os preços de imagem e vídeo da Stability AI.

10. Stability AI

Stability AI

A Stability AI se destaca em fluxos de trabalho de imagem e áudio, onde o preço por ativo geralmente importa mais que um plano mensal. Ela usa um sistema de créditos, e 1 crédito = $0.01. Novos usuários recebem 25 créditos gratuitos, o que é suficiente para cerca de 3 gerações flagship ou 8 imagens SD 3.5 Large. O acesso à API também inclui direitos de uso comercial [48].

Aqui está o preço por serviço.

Preço Unitário

ServiçoCréditosUSD
Stable Image Ultra8$0.08
Stable Diffusion 3.5 Large6.5$0.065
Stable Diffusion 3.5 Large Turbo4$0.04
Stable Image Core3$0.03
Stable Diffusion 3.5 Flash2.5$0.025
SDXL 1.0A partir de 0.9A partir de $0.009
Replace Background & Relight8$0.08
Erase / Inpaint / Remove Background5$0.05
Creative Upscaler (para 4K)60$0.60
Fast Upscaler2$0.02
Stable Fast 3D10$0.10
Stable Audio 3.0 (até 6 min)26$0.26

Limites Incluídos

Os preços de API são pay-as-you-go, com preços personalizados e descontos em massa para equipes de alto volume [49].

Cobertura de Modelos

A Stability AI cobre texto-para-imagem, edição de imagem, geração de ativos 3D e geração de áudio [48]. Em bom português, é construída para trabalho de produção. Você pode gerar imagens, editá-las, transformar ativos em saídas 3D e criar clipes de áudio sem pular entre um monte de ferramentas.

O conjunto de edição inclui outpainting, substituição de fundo, reiluminação e transferência de estilo [48]. O Stable Fast 3D lida com geração de ativos 3D, enquanto o Stable Audio 3.0 suporta clipes de áudio de até seis minutos [48]. Então, isso é menos sobre chat e mais sobre concluir trabalho de mídia.

Essa diferença de preços aparece mais quando você está trabalhando em escala, especialmente com trabalhos de edição e upscaling.

Custo por Saída

O Creative Upscaler custa 60 créditos ($0.60) por imagem. Isso é 30x o preço do Fast Upscaler, que custa 2 créditos ($0.02). Então, se seu objetivo principal são simples aumentos de resolução, o Fast Upscaler é a escolha de menor custo [48].

O Stable Image Core dá cerca de $30/mês para 1.000 imagens [48]. E se você escalar para 10.000 imagens/mês com o SD 3.5 Large, o custo fica em cerca de $650 [48].

Você também pode gerar e editar imagens usando outros modelos de alto desempenho. Em seguida, compare os preços de imagem da Black Forest Labs.

11. Black Forest Labs

Black Forest Labs

A Black Forest Labs é um benchmark de preço prático para geração de imagem, porque a conta muda com o tamanho da saída e com o uso ou não de imagens de referência. Seu sistema é baseado em créditos, com 1 crédito = $0.01. O preço do FLUX.2 está ligado a megapixels, e as imagens de referência são cobradas à parte. Uma coisa a observar: cada imagem e cada imagem de referência é arredondada para cima para o próximo megapixel, com base em 1.024 × 1.024 px.

Preço Unitário

A linha FLUX.2 vem em quatro níveis: Max, Pro, Klein e Flex. Cada um faz um trade-off diferente entre qualidade de imagem, velocidade e preço.

Modelo1º MP (Base)MP Adic.Img. de Ref. (por MP)Modo de Geração
FLUX.2 [max]$0.07$0.03$0.03Texto-para-Imagem / Edição
FLUX.2 [pro] (Text-to-Image)$0.03$0.015$0.015Texto-para-Imagem
FLUX.2 [pro] (Edit)$0.045$0.015$0.015Edição de Imagem
FLUX.2 [klein] 9B$0.015$0.002$0.002Texto-para-Imagem / Edição
FLUX.2 [klein] 4B$0.014$0.001$0.001Texto-para-Imagem / Edição
FLUX.2 [flex]$0.05$0.05$0.05Texto-para-Imagem / Edição

Os modelos mais antigos FLUX1.1 e FLUX.1 usam preços fixos por imagem em vez disso.

ModeloPreço por ImagemDescrição
FLUX1.1 [pro]$0.04Geração padrão de alta velocidade
FLUX1.1 [pro] Ultra$0.06Resolução ultra-alta
FLUX1.1 [pro] Raw$0.06Estética de fotografia espontânea
FLUX.1 Kontext [max]$0.08Edição em contexto de qualidade máxima
FLUX.1 Kontext [pro]$0.04Edição em contexto pronta para uso comercial
FLUX.1 Fill [pro]$0.05Inpainting de imagem direcionado
FLUX.1 [schnell]$0.003Destilado para velocidade máxima

Limites Incluídos

O acesso à API é pay-as-you-go, mas a Black Forest Labs também tem níveis de assinatura com tetos mensais de imagem [50].

PlanoLimite MensalPrincipais Recursos
Builder10.000 imagens/mêsModelos Klein, 10 usuários, direitos de fine-tuning
Platform100.000 imagens/mêsModelos Klein 9B + Dev, 10 usuários
Professional100.000 imagens/mêsModelos Dev, 3 domínios, 10 usuários
EnterprisePersonalizadoTodos os modelos, volume personalizado, acesso a API e pesos

Cobertura de Modelos

A Black Forest Labs é centrada em geração e edição de imagem. Os modelos FLUX.2 suportam tamanhos de saída de até 4 MP, e qualquer coisa acima disso é redimensionada automaticamente [50]. Se a velocidade importa mais, o FLUX.2 [klein] 4B se destaca com inferência abaixo de um segundo, o que o torna uma boa opção para casos de uso quase em tempo real [52].

Para trabalho de edição, a linha também tem algumas opções claras. O FLUX.1 Fill [pro] lida com inpainting direcionado a $0.05 por imagem, enquanto o FLUX.1 Kontext [pro] custa $0.04 por imagem para edição em contexto pronta para uso comercial [51].

Custo por Saída

Uma imagem finalizada FLUX.2 [max] de 4 MP custa cerca de $0.30, considerando geração, upscaling e duas retentativas. As imagens de referência são cobradas separadamente à mesma tarifa por megapixel [50][51]. Se você está fazendo concept art ou prototipagem em estágio inicial, o FLUX.2 [klein] 4B a $0.014 por imagem é a maneira de baixo custo de testar ideias antes de passar para as renderizações finais [50].

Em seguida: preços de vídeo da Kling AI.

12. Kling AI

Kling AI

A Kling AI divide os preços em duas vias: o aplicativo web usa créditos, enquanto a API cobra por segundo. No lado da API, o custo muda com base no comprimento do clipe, na resolução e em ativar ou não o áudio sincronizado.

Preço Unitário

Para vídeo silencioso padrão, os preços começam em $0.0672/seg em 720p e vão até $0.0896/seg em 1080p. O Kling V3 Omni, que lida com entradas de texto-mais-imagem e fluxos de vídeo-para-vídeo, custa $0.1792/seg em 1080p.

ConfiguraçãoResoluçãoPreço/SegCusto Est. Clipe 10s
Kling V3 – Silent720p$0.0672$0.67
Kling V3 – Silent1080p$0.0896$0.90
Kling V3 – With Audio1080p$0.1120$1.12
Kling V3 Omni (Ref)1080p$0.1792$1.79
Kling V3 – Silent4K$0.4286$4.29

Então, sim, a Kling fica no lado de menor preço para APIs de vídeo.

Limites Incluídos

A Kling mantém os preços do aplicativo web e da API separados, o que significa que você precisa verificar ambos antes de escolher um plano. A tarifa da API é apenas uma parte da conta. Créditos e concorrência têm um grande efeito sobre quanto trabalho você consegue empurrar.

O nível gratuito vem com 66 créditos por dia, e esses créditos reiniciam a cada 24 horas sem rollover. Os planos pagos começam em $6.99/mês para 660 créditos no Standard e vão até $180/mês para 26.000 créditos no Ultra. Se você pagar anualmente pelo Ultra, a tarifa efetiva cai 34% [54].

Para usuários de API, a concorrência padrão é limitada a 10 trabalhos paralelos. Contas de nível de teste recebem apenas 3. Essa diferença pode importar muito se você está tentando fazer renderizações em lote em vez de esperar os clipes um por um.

Cobertura de Modelos

O Kling V3 e o Kling V3 Omni suportam clipes de até 15 segundos, o que os torna adequados para trabalho cinematográfico e narrativo. O V2.6 limita o comprimento do clipe a 10 segundos e adiciona áudio sincronizado. O V2.5 Turbo é cerca de 30% mais barato que o nível Master.

Custo por Saída

Uma maneira comum de manter os gastos sob controle é rascunhar em modo silencioso 720p e passar para 1080p ou 4K apenas para as renderizações finais. Essa abordagem ajuda porque muitos usuários precisam de 2–4 tentativas de geração para obter um clipe utilizável, e isso eleva o custo do vídeo finalizado [53].

Os Prepaid Resource Packages podem reduzir o preço unitário efetivo em 10% a 30%, dependendo do tamanho do pacote [53].

Em seguida, compare esses modelos por preço unitário, limites de plano, cobertura de modalidade e custo por saída.

Detalhamento de Preços por Critério de Comparação

As tabelas abaixo condensam os detalhes anteriores provedor por provedor em quatro filtros de compra: preço unitário, limites de plano, cobertura de modalidade e custo de saída.

Preço Unitário em APIs de Texto, Imagem e Vídeo

ModeloProvedorEntrada ($/1M tokens)Saída ($/1M tokens)Nível
GPT-5 NanoOpenAI$0.05$0.40Budget
Gemini 2.5 ProGoogle$1.25$10.00Mid-range
GPT-5.5OpenAI$5.00$30.00Premium

Para geração de imagem, o FLUX.1 [schnell] é a referência de baixo custo a $0.003 por imagem, enquanto o Stable Image Ultra fica no topo a $0.08 por imagem. Para vídeo, o Kling V3 custa $0.0672/seg em 720p no extremo inferior, e o Veo 3.1 fica em $0.40/seg no extremo superior.

As tarifas brutas importam. Mas, na prática, os limites de plano muitas vezes decidem o que você realmente gasta.

Limites Incluídos em Assinaturas e Planos de Plataforma

Abaixo de cerca de 5 milhões de tokens de entrada por mês, planos de chat de $20 podem superar a cobrança por API para uso casual.

ProvedorPlanoPreço MensalUso IncluídoPrincipais LimitesPlano de Equipe
OpenAIChatGPT Plus$20Limitado (dinâmico)Tetos de mensagem dinâmicos; sem acesso à APISim
AnthropicClaude Pro$20Limitado (dinâmico)Limites de uso variam por demanda; sem acesso à APISim
GoogleGemini Advanced$20Limitado (dinâmico)Vinculado ao Google One; sem acesso à APISim (Workspace)

Os modelos de raciocínio também adicionam uma complicação: tokens de raciocínio ocultos são cobrados às tarifas de saída, o que pode elevar o custo total em 2x a 7x.[3]

Cobertura de Modelos por Modalidade

O preço só importa depois que a modalidade do modelo se encaixa no trabalho.

ProvedorTextoEntrada MultimodalGeração de ImagemVisãoGeração de VídeoAcesso à API
APIMart-API Unificada
OpenAIDireto
GoogleDireto
AnthropicDireto
MetaUnificado/Hospedado
Mistral AIDireto
Stability AIDireto

Um modelo barato não é vantagem se não consegue lidar com o formato de que você precisa. Fornecedores só de texto, por exemplo, não ajudarão muito se seu fluxo de trabalho depende de saída de imagem ou vídeo.

Custo por Saída por Caso de Uso Comum

Estes são os custos que as equipes tendem a sentir quando as coisas chegam à produção.

Cargas de trabalho de texto (por 1M de tokens de saída):

Caso de UsoModeloCusto de SaídaNívelPrincipal Trade-off
Chatbot de alto volumeGPT-5 Nano$0.40BudgetMenor profundidade de raciocínio
Extração de documentosGemini Flash Lite$0.30BudgetEscrita criativa limitada
Geração de códigoGemini 2.5 Pro$10.00Mid-rangeSobretaxa acima de 200K de contexto [3]
Fluxos de trabalho agênticosClaude Sonnet 4.6$15.00Mid-rangePrecisa de cache de prompt para ROI [3]
Raciocínio complexoClaude Opus 4.8$25.00PremiumAlto custo; latência mais lenta

Cargas de trabalho de vídeo (por clipe de 10 segundos):

Caso de UsoModeloCusto de SaídaNívelPrincipal Trade-off
Vídeo de formato curto (rascunho)Kling V3~$0.67Budget720p; limitado a clipes de 15 segundos
Vídeo de formato curto (final)Sora 2$1.00Mid-rangeQualidade e custo equilibrados
Vídeo cinematográficoVeo 3.1$4.00PremiumMaior qualidade; maior gasto

Aqui está a versão simples: o preço por token ou por segundo é apenas parte da história. O fator maior costuma ser como você usa o modelo. Um chatbot rodando o dia todo, um pipeline de documentos e um estúdio de vídeo podem parecer baratos no papel e ficar caros rápido quando o volume de saída entra em cena.

Uma regra prática: o processamento em lote corta custos em 50% na OpenAI, Anthropic e Mistral para cargas de trabalho que toleram um prazo de 24 horas.[3] Para vídeo, rascunhar em resolução mais baixa e melhorar apenas as renderizações finais é a maneira mais confiável de controlar o gasto por saída.

Prós e Contras

A tabela abaixo reduz os trade-offs ao que geralmente orienta a decisão: custo, modalidade e adequação à carga de trabalho. Se você está escolhendo entre provedores, isso lhe dá a versão curta sem precisar vasculhar cada seção de preços.

SujeitoPrósContrasMelhor Para
APIMartMais de 500 modelos sob uma API; uma fatura para texto, imagem e vídeoPreços baseados em uso significam que os custos sobem com o volume de saídaEquipes que querem acesso multimodal unificado
OpenAICobrança de token claraModelos flagship são carosCargas de trabalho de texto de uso geral
AnthropicCache de prompt reduz custos de trabalho repetidoModelos de topo carregam altas tarifas de saídaFluxos de trabalho de programação e contexto longo
Google AIFlash-Lite é baratoPro fica caro acima de 200K tokensCargas de trabalho de texto de alto volume e contexto longo
Meta (Llama)Baixo custo se você puder auto-hospedarSem API própria significa que você cuida da hospedagem e do uptimeCargas de trabalho sensíveis a custo com capacidade de auto-hospedagem
xAI (Grok)Preços intermediários competitivosLinha de modelos menorAplicativos de dados da web e sociais em tempo real
Mistral AIModelos pequenos de baixo custo e cobertura multilíngueMenos recursos multimodaisAplicativos de texto multilíngue
CohereEmbed, Rerank e Command R7B se encaixam em RAGCommand R+ é caro para seu nívelGeração aumentada por recuperação e bases de conhecimento
Stability AIPreços muito baixos de geração de imagemEscopo só de imagem limita fluxos de trabalho mais amplosGeração de imagem de alto volume
Kling AIVídeo de formato curto de baixo custoLimitado a vídeos de 15 segundos no preço baseGeração de vídeo de formato curto

Uma maneira simples de ler isso:

  • Se você quer uma API para muitos tipos de modelo, a APIMart se destaca.
  • Se você se importa mais com uso de texto simples e cobrança direta, a OpenAI ou o Google AI podem ser a opção mais fácil.
  • Se seu trabalho tende a programação, prompts longos ou contexto repetido, a Anthropic pode fazer sentido.
  • Se você está mantendo custos baixos e pode rodar as coisas você mesmo, a Meta (Llama) é difícil de ignorar.
  • Se sua stack é construída em torno de RAG, a Cohere tem ferramentas que se alinham bem com essa configuração.

Para uso com muitas imagens, a Stability AI é a escolha de baixo custo. Para clipes de vídeo curtos, a Kling AI mantém os custos de entrada baixos, embora o plano base permaneça vinculado a saídas de 15 segundos.

Conclusão

Olhando para o detalhamento de preços acima, o melhor modelo não é o mais caro nem o mais barato. É aquele que se encaixa na sua carga de trabalho, modalidade e volume.

Tarefas de alto volume e baixa complexidade devem rodar nos modelos de menor custo que você conseguir.

À medida que a complexidade aumenta, o gasto deve aumentar apenas quando a saída justificar. Modelos intermediários são uma boa opção para aplicativos em produção que precisam de desempenho estável sem o preço de topo de linha.

Depois que você entra em raciocínio premium ou geração de mídia, o custo por saída começa a importar mais que o preço bruto de token. Modelos premium fazem sentido quando a qualidade tem efeito direto nos resultados. E para vídeo, os preços funcionam de forma diferente: APIs como WAN 2.7, Sora 2 ($0.08/seg) e Kling V3 ($0.0672/seg em 720p) cobram por segundo, não por token.

Para equipes que usam modelos de texto, imagem e vídeo juntos, a APIMart dá acesso a mais de 500 modelos por meio de uma única API. Isso significa que o trabalho multimodal pode ficar sob uma API e uma fatura.

Perguntas Frequentes

Como estimo o custo total por saída?

Estime o custo total com base em como o modelo é cobrado.

Para modelos de texto, o preço geralmente é dividido em tokens de entrada e tokens de saída por 1 milhão de tokens. Os tokens de saída costumam custar mais, então o comprimento esperado da sua resposta tem o maior efeito sobre o gasto total.

Para casos de uso não textuais, os modelos de imagem geralmente são cobrados por chamada, enquanto os modelos de vídeo são cobrados por segundo gerado.

Uma maneira simples de estimar o custo é:

  • usar um contador de tokens para medir o volume do prompt
  • verificar a tarifa do modelo para cada unidade de cobrança
  • aplicar essa tarifa ao seu uso esperado

Isso lhe dá uma estimativa de custo prática antes de escalar qualquer coisa.

Quando o cache de prompt economiza dinheiro?

O cache de prompt corta custos quando seu aplicativo envia o mesmo prefixo de prompt repetidamente. Isso geralmente significa instruções de sistema longas, grandes conjuntos de documentos ou histórico de conversa compartilhado reutilizado em muitas requisições.

Em vez de pagar o preço total do token de entrada toda vez, você paga menos pela parte repetida. Em muitos casos, isso pode reduzir os custos de entrada em 50% a 90%.

Isso funciona melhor quando o volume é alto e o contexto permanece praticamente o mesmo. Um chatbot de suporte ao cliente é um bom exemplo: o bot pode reutilizar as mesmas regras, informações de marca e documentos de ajuda em milhares de conversas.

É uma escolha ruim quando o contexto muda o tempo todo. Se seu aplicativo fica reescrevendo o prompt do zero a cada requisição, há menos texto repetido para armazenar em cache, então a economia cai rápido.

Devo usar assinaturas ou preços de API?

Para a maioria dos desenvolvedores e empresas, os preços de API fazem mais sentido. Com a cobrança pay-as-you-go, você paga pelos tokens que usa - sem mínimos mensais, sem taxas surpresa e sem cobranças fixas pairando sobre você quando o tráfego está baixo. Seus custos acompanham o uso, o que muitas vezes é uma opção muito melhor que uma conta recorrente fixa.

A APIMart lhe dá uma API que se conecta a mais de 500 modelos de IA, com preços claros por token e descontos automáticos por volume conforme seu uso aumenta.

Publicações Relacionadas no Blog

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace