
Guia de Preços de LLM — Compare mais de 500 Modelos de IA
Compare preços de APIs de LLM e mídia em mais de 500 modelos da OpenAI, Anthropic, Google, Meta, xAI, Mistral e outras — por custo de token, imagem e vídeo.
Os gastos com IA podem ficar caros rapidamente: empresas dos EUA agora gastam em média $85.500 por mês com IA. Minha principal conclusão é simples: o modelo mais barato no papel nem sempre é a opção de menor custo depois que você leva em conta o comprimento da saída, o tamanho do contexto, as retentativas, as taxas de ferramentas e os limites do plano.
Se eu estivesse escolhendo a partir deste guia, olharia para quatro coisas primeiro:
- Preço unitário: tokens, imagens ou segundos de vídeo
- Limites: RPM, TPM, janelas de contexto e tetos do plano
- Modalidade: suporte a texto, imagem, áudio, vídeo e visão
- Custo por saída finalizada: não apenas o preço de tabela
O artigo compara APIMart, OpenAI, Anthropic, Google AI, Meta, xAI, Mistral, Cohere, Runway, Stability AI, Black Forest Labs, e Kling AI.
Alguns padrões claros se destacam:
- O preço do texto varia muito. A OpenAI vai de $0.05 a $30.00 por 1M de tokens de entrada.
- A saída costuma ser muito mais cara que a entrada. Em alguns casos, a saída chega a ser 4x a 6x mais cara.
- O contexto longo pode mudar a conta. A OpenAI adiciona preços mais altos após 270.000 tokens, e o Google altera as tarifas acima de 200.000 tokens.
- Trabalhos em lote podem reduzir custos. OpenAI, Anthropic e Mistral listam descontos de 50% para processamento assíncrono.
- Os custos de vídeo se acumulam com as retentativas. Uma tarifa barata por segundo ainda pode se transformar em um custo muito mais alto por clipe finalizado.
- A cobrança unificada importa para equipes que usam muitos formatos. A proposta da APIMart é uma API e uma fatura para mais de 500 modelos.
Se você quer a versão curta:
use modelos econômicos para texto de alto volume, modelos intermediários para aplicativos em produção, modelos premium apenas quando a qualidade da saída muda os resultados do negócio, e rascunhe vídeo em baixa resolução antes de pagar pelas renderizações finais.
O que são Tokens de LLM e Preços de API? (Amigável para Iniciantes)
Comparação Rápida

| Provedor | Principal Força | Fique Atento a | Melhor Para |
|---|---|---|---|
| APIMart | Uma API para mais de 500 modelos em texto, imagem, vídeo e áudio | Os custos de uso ainda crescem com o volume | Equipes que querem uma única configuração de cobrança |
| OpenAI | Ampla gama de modelos e preços de token claros e dicas de custo | Os melhores modelos ficam caros rápido | Texto, imagem, áudio e vídeo em geral |
| Anthropic | Forte para programação e contexto longo | As tarifas de saída são altas | Agentes, programação, prompts longos |
| Google AI | Opções Flash de baixo custo e grande contexto | Tarifas mais altas acima de 200K tokens | Aplicativos de texto e multimodais de alto volume |
| Meta | Preços muito baixos de Llama hospedado ou auto-hospedado | Preços e limites dependem do host | Equipes focadas em custo com opções de hospedagem |
| xAI | Menor diferença entre preços de entrada e saída | Chamadas de ferramentas adicionam taxas extras | Aplicativos de resposta longa e uso de ferramentas |
| Mistral | Preços baixos de token e descontos em lote | Algumas ferramentas custam extra | Texto utilitário, programação, uso baseado na UE |
| Cohere | Boa opção para RAG, embeddings e rerank | Menos adequado para geração de mídia | Busca, recuperação, bases de conhecimento |
| Runway | Plataforma focada em vídeo com cálculo de créditos claro | Retentativas podem elevar o custo finalizado | Criação e edição de vídeo |
| Stability AI | Preços baixos de imagem e ferramentas de edição | Escopo mais estreito que fornecedores de texto | Trabalho de imagem e áudio de alto volume |
| Black Forest Labs | Preços de imagem detalhados por tamanho | Custos sobem com retentativas e referências | Geração e edição de imagem |
| Kling AI | Geração de vídeo curto de baixo custo | Limites de duração de clipe e concorrência | Vídeo de formato curto |
Então, antes de comparar preços linha por linha, eu começaria com uma pergunta: Pelo que estou pagando mais - tokens, imagens, segundos ou retentativas?
1. APIMart

A APIMart usa cobrança pay-as-you-go com nenhum mínimo mensal e nenhuma taxa oculta. Os preços mudam conforme a modalidade, então texto, imagem, vídeo e áudio não são cobrados da mesma forma.
Preço Unitário
Os preços variam por modalidade, como mostra a tabela abaixo.
| Modalidade | Unidade de Cobrança | Modelo de Exemplo | Preço APIMart |
|---|---|---|---|
| Texto | Por 1M de tokens | Qwen2.5-VL-72B | $20.00 |
| Imagem | Por chamada | GPT Image 2 | $0.006 |
| Imagem | Por chamada | Wan 2.7 Image | $0.0216 |
| Vídeo | Por segundo | Sora 2 | $0.08 |
| Vídeo | Por segundo | Kling V3 (720p) | $0.0672 |
Os custos de geração de imagem podem variar bastante dependendo do nível de qualidade. Por exemplo, uma chamada GPT-Image-2-Official de 1024×1024 custa cerca de $0.00488 em qualidade Baixa, $0.04232 em Média e $0.16872 em Alta. Essa diferença se acumula rápido. Se a saída de topo de linha não for necessária, usar um nível mais baixo pode reduzir o gasto por chamada.
Limites Incluídos
Contas padrão vêm com limites de RPM e TPM. Contas Enterprise podem solicitar canais de maior throughput.
Cobertura de Modelos
A APIMart suporta modelos de texto, imagem, vídeo e áudio por meio de uma única API. Isso inclui modelos como GPT-5, Claude, Sora 2, Midjourney e Kling V3.
Custo por Saída
A principal vantagem aqui é a cobrança consolidada entre modalidades. Em vez de fazer malabarismos com faturas separadas para texto, imagem e vídeo, você tem uma configuração única que facilita o controle de gastos.
Em seguida, o guia compara como os principais provedores estruturam os preços em modelos de texto, imagem e vídeo.
2. OpenAI

A OpenAI usa um modelo de preços pay-per-token para texto. E a diferença entre os modelos é enorme.
Em junho de 2026, os preços começam em $0.05 por 1M de tokens de entrada para o GPT-5 nano e vão até $30.00 por 1M de tokens de entrada para o GPT-5.5 Pro [3][5]. A maneira mais fácil de ler os preços da OpenAI é por nível de modelo, porque as tarifas de entrada, saída e tokens em cache podem ser muito diferentes de um modelo para outro.
Preço Unitário
| Modelo | Entrada (por 1M) | Entrada em Cache | Saída (por 1M) |
|---|---|---|---|
| GPT-5.5 Pro | $30.00 | - | $180.00 |
| GPT-5.5 (Standard) | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 mini | $0.75 | $0.075 | $4.50 |
| GPT-5.4 nano | $0.20 | $0.02 | $1.25 |
| GPT-5 nano | $0.05 | $0.005 | $0.40 |
Em todos os modelos da OpenAI, os tokens de saída custam 4 a 6 vezes mais que os tokens de entrada [6]. Isso importa muito quando seu aplicativo produz respostas longas, resumos ou respostas no estilo de agente. A OpenAI também oferece os níveis Batch e Flex com um desconto fixo de 50% em todos os modelos, então a entrada do GPT-5.5 cai de $5.00 para $2.50 por 1M de tokens [5].
Os custos podem subir novamente quando o uso de contexto longo atinge o preço de sobretaxa.
Limites Incluídos
A OpenAI dobra as tarifas de entrada e saída assim que o contexto total ultrapassa 270.000 tokens [3][5]. Se você está trabalhando com revisão de documentos longos ou loops de agente de múltiplas rodadas, a sumarização contínua é uma das maneiras mais simples de ficar abaixo dessa linha.
A OpenAI usa essa mesma configuração de preços também em modelos de imagem, áudio e vídeo.
Cobertura de Modelos
A OpenAI cobra a geração de imagem, áudio e vídeo separadamente. O Sora-2 custa $0.10 por segundo para vídeo 720p, enquanto o Sora-2-pro em 1080p custa $0.70 por segundo na tarifa padrão [5].
Para outras mídias:
- Os preços de imagem vão de $2.50 a $8.00 por 1M de tokens
- A transcrição do Whisper custa $0.006 por minuto
- TTS (tts-1) custa $0.015 por 1.000 caracteres [3][4]
Custo por Saída
Uma das maneiras mais rápidas de cortar gastos é simples: envie trabalho de menor valor para modelos mais baratos. Processar 10.000 tickets de suporte custa cerca de $16 com o GPT-4.1, $3.20 com o GPT-4.1 mini e $0.80 com o GPT-4.1 nano [4].
3. Anthropic

A Anthropic divide sua linha de API Claude em quatro níveis de preços: Frontier/Research (Claude Fable 5 / Mythos 5), Flagship (Claude Opus 4.5–4.8), Mid-tier (Claude Sonnet 4.5–4.6) e Budget (Claude Haiku 4.5) [9][10]. O padrão é bem claro. À medida que você sobe de nível, ganha mais profundidade de raciocínio e melhor saída, mas a conta também sobe rápido. Para a maioria dos compradores, a escolha se resume a isto: o Haiku é a opção de baixo custo, o Sonnet é o meio-termo, e o Opus/Fable são feitos para trabalhos mais pesados.
Preço Unitário
A Anthropic cobra os tokens de saída a 5x a tarifa de entrada em toda a linha atual de níveis [7][6]. Os preços abaixo estão em USD por 1 milhão de tokens [13][15].
| Modelo | Entrada (por 1M) | Leitura de Cache (por 1M) | Saída (por 1M) |
|---|---|---|---|
| Claude Fable 5 / Mythos 5 | $10.00 | $1.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $0.50 | $25.00 |
| Claude Sonnet 4.6 | $3.00 | $0.30 | $15.00 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
O cache de prompt pode reduzir custos quando você reutiliza o mesmo prefixo repetidamente. As gravações de cache custam 1.25x a tarifa de entrada base para um TTL de 5 minutos, ou 2x para um TTL de 1 hora. As leituras de cache custam 10% da entrada padrão. Na prática, o cache começa a fazer sentido após quatro ou mais usos do mesmo prefixo [3][9][12].
Limites Incluídos
A maioria dos modelos flagship e mid-tier atuais da Anthropic - incluindo Fable 5, Mythos 5, Opus 4.6–4.8 e Sonnet 4.6 - vem com uma janela de contexto de 1M de tokens no preço padrão [9][11]. O Claude Haiku 4.5 chega a 200.000 tokens. Os limites de tarifa seguem uma configuração em níveis, do Tier 1 até Enterprise, com tetos de RPM e TPM definidos por plano [13][15].
Cobertura de Modelos
Os modelos da Anthropic lidam com entradas de texto e visão, e o Computer Use adiciona sobrecarga extra de tokens. Alguns complementos são cobrados separadamente:
- A busca na web custa $10 por 1.000 buscas
- Os Managed Agents custam $0.08 por hora de sessão ativa, mais cobranças de token
A Batch API corta os custos de token em 50% para trabalhos assíncronos com um prazo de 24 horas [8][9][11].
Custo por Saída
É aqui que o preço fica prático: qual nível permanece custo-efetivo para tarefas repetidas, trabalho de contexto longo e fluxos de agente?
Uma sessão de programação de uma hora no Claude Opus 4.8, usando 50.000 tokens de entrada com 40.000 como leituras de cache e 15.000 tokens de saída, custa cerca de $0.525, incluindo a taxa de sessão de agente de $0.08 [9][12]. Isso dá uma boa ideia de como os preços da Anthropic se comportam no uso real, não apenas em uma tabela de preços.
Para trabalhos em produção como assistentes de programação e agentes de múltiplas etapas, o Claude Sonnet 4.6 tende a oferecer o melhor equilíbrio entre custo e capacidade [6][3].
Em seguida, compare os preços do Google AI nos modelos de texto e multimodais Gemini.
4. Google AI

O Google cobra seus modelos com base no modelo que você escolhe e no tamanho da janela de contexto. Uma regra de preço importa imediatamente: mantenha os prompts abaixo de 200.000 tokens se quiser evitar a tarifa mais alta [14][3].
Preço Unitário
| Modelo | Entrada (por 1M) | Saída (por 1M) | Janela de Contexto |
|---|---|---|---|
| Gemini 3.1 Pro (≤200K) | $2.00 | $12.00 | 1M–2M |
| Gemini 3.1 Pro (>200K) | $4.00 | $18.00 | 1M–2M |
| Gemini 2.5 Pro (≤200K) | $1.25 | $10.00 | 2M |
| Gemini 3.5 Flash | $1.50 | $9.00 | 1M |
| Gemini 3 Flash | $0.50 | $3.00 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 1M |
| Gemini 3 4B | $0.04 | $0.08 | 131K |
Para geração de imagem, o Imagen 4 Fast começa em $0.01–$0.02 por imagem, enquanto o Imagen 4 Ultra custa $0.06 por imagem. O vídeo Veo 3.1 é cobrado por segundo. O Standard fica em $0.40 por segundo para 720p e 1080p, e o Light fica em $0.05–$0.08 por segundo [17].
Limites Incluídos
O preço do modelo é apenas parte da história. Limites de throughput e configurações de dados podem alterar seu gasto total de forma significativa.
O principal trade-off do Google é bem claro: preço baixo de modelo de um lado, e limites de throughput mais restrições de dados do outro. No Google AI Studio, o nível gratuito oferece cerca de 15 RPM, tokens gratuitos e uso de dados para melhoria de produto. O nível pago salta para cerca de 1.000–2.000 RPM, desativa o uso de dados para melhoria de produto e adiciona cache de contexto mais a Batch API. Planos Enterprise adicionam throughput provisionado, descontos por volume e recursos de conformidade [17][18].
O cache de contexto é uma das maiores alavancas de custo aqui. Gravar no cache é gratuito, e ler dele custa 25% da tarifa de entrada padrão [18].
Cobertura de Modelos
A linha do Google abrange modelos de texto, multimodais, imagem e vídeo. Também suporta entrada de imagem, começando em $0.0025 por imagem [3].
Custo por Saída
Para chatbots, sumarização e classificação, o Gemini 2.5 Flash ou o Gemini 3.1 Flash-Lite geralmente farão mais sentido. Eles são mais baratos e se encaixam bem em muitas cargas de trabalho do dia a dia. Reserve o Gemini 3.1 Pro para casos em que você precisa da janela de contexto maior, e use a sumarização contínua para ficar abaixo do corte de 200.000 tokens [3][6].
Há também um ângulo de preço simples que vale a pena notar. A $2.00 por 1M de tokens de entrada, o Gemini 3.1 Pro é mais barato que modelos flagship como o GPT-5.5 ($5.00) e o Claude Opus 4.8 ($5.00) para prompts de comprimento padrão [2].
Em seguida, compare os preços e a cobertura de modelos da Meta.
5. Meta
A Meta funciona um pouco diferente dos provedores de modelo fechado acima. Seus modelos Llama são de peso aberto, então seu custo depende de onde você os hospeda ou acessa. Na prática, isso significa que exatamente o mesmo modelo pode ter preços muito diferentes de um provedor para outro. Por exemplo, o Llama 3.3 70B já foi listado por até $0.10 por 1M de tokens de entrada. A Meta também não publica uma tabela de preços de API própria, e é por isso que os preços podem variar tanto entre os hosts [1][19][20].
Preço Unitário
O preço atual está centrado no Llama 4 Scout e no Llama 4 Maverick [21][22].
| Modelo | Entrada (por 1M) | Saída (por 1M) | Janela de Contexto |
|---|---|---|---|
| Llama 4 Scout | $0.08 – $0.17 | $0.15 – $0.66 | Até 10.000.000 tokens |
| Llama 4 Maverick | $0.15 – $0.24 | $0.60 – $0.97 | 1.000.000 tokens |
| Llama 3.3 70B | $0.10 – $0.72 | $0.32 – $0.72 | 128K – 131K tokens |
| Llama 3.2 1B Instruct | $0.01 – $0.02 | $0.01 – $0.02 | 60K – 131K tokens |
| Llama 3.1 405B Instruct | $0.90 – $3.00 | $0.90 – $3.00 | 128K – 131K tokens |
Esse preço de tabela baixo parece ótimo no papel. Mas só ajuda se os limites de contexto e os tetos de throughput do host corresponderem à sua carga de trabalho.
Limites Incluídos
Não existe um plano padrão único da Meta com limites de tarifa compartilhados ou um nível gratuito integrado. Os hosts definem seus próprios limites de throughput, tetos de contexto e regras de cache. Então, se você está planejando trabalho de contexto longo com o Llama 4 Scout, verifique primeiro o teto de contexto do host em vez de assumir que terá toda a faixa anunciada.
Cobertura de Modelos
O Llama 4 Scout e o Llama 4 Maverick suportam entrada de texto e visão, além de chamada de ferramentas e modo JSON nos principais provedores [21][22]. Opções mais antigas ainda têm seu lugar também. O Llama 3.2 11B Vision ainda pode lidar com trabalhos com muita visão, enquanto o Llama 3.2 1B Instruct é voltado para implantações de borda, onde baixa latência e uso enxuto de computação importam mais [21][22].
Custo por Saída
Se você está executando trabalhos de alto volume com prompts longos, o Scout se destaca. Uma tarefa de programação com 40K de entrada e 8K de tokens de saída custa cerca de $0.005 por tarefa, o que dá aproximadamente 200 tarefas por $1. Essa mesma tarefa no GPT-5.5 custa cerca de $0.44, ou apenas 2.3 tarefas por $1 [6].
Para uso voltado ao cliente ou trabalho multimodal, o Llama 4 Maverick costuma ser a melhor escolha. Ele supera o GPT-4o em benchmarks enquanto custa muito menos no preço de entrada: $0.15/M de entrada contra $2.50/M de entrada [6]. Sua menor diferença entre preços de entrada e saída também o torna uma boa opção quando você espera respostas mais longas.
Em seguida, compare os preços e a cobertura de modelos da xAI.
6. xAI

A xAI mantém baixos os preços de entrada e saída, o que ajuda quando as respostas ficam longas. O Grok 4.3 cobra $1.25 por 1 milhão de tokens de entrada e $2.50 por 1 milhão de tokens de saída. Essa diferença de 2x importa quando um modelo escreve muito de volta para você [6][24].
Preço Unitário
| Modelo | Entrada (por 1M) | Entrada em Cache | Saída (por 1M) | Janela de Contexto |
|---|---|---|---|---|
| Grok 4.3 (Flagship) | $1.25 | $0.20 | $2.50 | 1M tokens |
| Grok 4.20 (Reasoning) | $1.25 | $0.20 | $2.50 | 2M tokens |
| Grok Build 0.1 (Coding) | $1.00 | $0.20 | $2.00 | 256K tokens |
| Grok 4.1 Fast (Budget) | $0.20 | $0.05 | $0.50 | 2M tokens |
Para trabalho com imagem, o Grok Imagine 1.5 Edit custa $0.01875 por chamada [23]. A geração de vídeo pela Imagine API vai de $0.08 a $0.25 por segundo, com base na resolução [24].
Limites Incluídos
A xAI usa cobrança pay-as-you-go com limites de tarifa baseados em uso. Planos Enterprise podem adicionar limites de tarifa personalizados e infraestrutura dedicada [25][26].
Há uma coisa a observar: o uso de ferramentas pode se acumular rápido. Busca e execução de código são cobradas separadamente, então um preço baixo de token nem sempre significa uma conta final baixa. Web Search, X Search e Code Execution custam $5.00 por 1.000 chamadas cada [24].
Se seus trabalhos não forem urgentes, a Batch API pode reduzir custos em 20% a 50% para tarefas processadas dentro de 24 horas [24].
Cobertura de Modelos
A xAI cobre casos de uso de texto, imagem e vídeo [24][16]. O Grok 4.20 é construído para uso de ferramentas mais rápido, enquanto o Grok Build 0.1 é voltado para trabalho com muita programação [6][2].
Custo por Saída
Para uma tarefa padrão de programação com 40K tokens de entrada e 8K tokens de saída, o Grok 4.3 custa cerca de $0.07 por tarefa. Isso dá aproximadamente 14 tarefas por $1 [6].
Em seguida, o guia compara a estrutura de preços de outro provedor, ou você pode usar uma API de LLM unificada para acessar esses modelos por meio de uma única integração.
7. Mistral AI

O Mistral Large 3 custa $0.50 por 1M de tokens de entrada e $1.50 por 1M de tokens de saída. Isso o coloca no grupo dos flagships de baixo preço. As tarifas de destaque parecem fortes, mas a conta final pode mudar quando você considera as cobranças de ferramentas e os níveis de cobrança da Mistral.
Aqui está a linha atual.
Preço Unitário
| Modelo | Entrada (por 1M) | Entrada em Cache | Saída (por 1M) |
|---|---|---|---|
| Mistral Large 3 (Flagship) | $0.50 | $0.05 | $1.50 |
| Mistral Medium 3.5 (Balanced) | $1.50 | - | $7.50 |
| Mistral Small 4 (Efficient) | $0.10 | $0.01 | $0.30 |
| Magistral Medium (Reasoning) | $2.00 | - | $5.00 |
| Codestral (Coding) | $0.30 | $0.03 | $0.90 |
| Devstral 2 (Coding) | $0.40 | $0.04 | $2.00 |
| Pixtral Large (Multimodal) | $2.00 | - | $6.00 |
A Mistral também cobra separadamente por OCR a $4.00 por 1.000 páginas, embeddings a $0.10 por 1M de tokens, e busca na web mais execução de código a $30 por 1.000 chamadas [27].
Limites Incluídos
A Mistral usa cobrança pay-as-you-go, com quatro níveis de limite de tarifa que se abrem a $20, $100 e $500 em gasto acumulado [31]. O plano Team vem com um compromisso mínimo de $50 por mês [27].
Há duas alavancas aqui que podem cortar custos rápido:
- A Batch API reduz todos os preços de modelo em 50% para trabalhos assíncronos [27][31].
- O cache de prompt pode reduzir os custos de tokens em cache em até 90% quando o prefixo compartilhado tem pelo menos 64 tokens de comprimento [31].
Essas regras de preço importam mais quando você está executando cargas de trabalho de alto volume ou assíncronas.
Cobertura de Modelos
A Mistral cobre casos de uso de texto, raciocínio, programação, multimodal e borda. O Codestral suporta fill-in-the-middle (FIM), o que o torna uma boa escolha para fluxos de trabalho em IDE. A série Ministral - 3B, 8B e 14B - é voltada para implantações de baixo custo ou no dispositivo [30][32].
A Mistral também oferece endpoints hospedados na UE e processamento de dados compatível com o GDPR sem custo extra [29][31].
Custo por Saída
Para trabalho utilitário de alto volume como extração de entidades, classificação e sumarização, o Mistral Small 4 é a opção mais forte [28][31]. Se você precisa de mais poder de raciocínio mas ainda quer preços baixos de token, o Mistral Large 3 faz mais sentido [28][31].
Para tarefas com muito raciocínio, o Magistral Medium custa $5.00 por 1M de tokens de saída e é 37% mais barato na saída que o o3 da OpenAI [29].
Em seguida, compare os preços da Cohere para cargas de trabalho de texto empresarial e recuperação.
8. Cohere

A Cohere é construída principalmente para recuperação e busca empresarial. Seus preços refletem isso: opções de baixo custo para trabalho de recuperação com muito texto, e modelos de preço mais alto para trabalhos multimodais ou mais exigentes.
Preço Unitário
A Cohere divide sua linha em três grupos: modelos de recuperação de baixo custo, modelos multimodais empresariais e ferramentas separadas para embeddings e reranking.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Janela de Contexto |
|---|---|---|---|
| Command R7B | $0.0375 | $0.15 | 128K |
| Command R | $0.15 | $0.60 | 128K |
| Command R+ | $2.50 | $10.00 | 128K |
| Command A (Multimodal) | $2.50 | $10.00 | 256K |
| Aya Expanse (8B/32B) | $0.50 | $1.50 | 128K |
| Embed v3 | $0.10 | - | - |
| Rerank v3 | $2.00 | - | - |
O Rerank é cobrado usando unidades de busca: uma consulta mais até 100 documentos. Se os trechos passarem de 500 tokens, eles contam separadamente [33][35].
Limites Incluídos
A Cohere oferece chaves de teste gratuitas para testes, limitadas a 1.000 chamadas por mês e 20 RPM [37]. As chaves de produção usam preços pay-as-you-go, com até 500 RPM para modelos padrão. A cobrança acontece no fim do mês ou quando seu saldo atinge $250 [33][37].
Alguns dos modelos de topo de linha da Cohere precisam de aprovação de vendas antes do uso completo em produção. Isso inclui Command A+, A Reasoning e A Vision. Até que essa aprovação aconteça, o acesso self-serve permanece nos limites do estilo de teste [37].
Se sua equipe precisa de throughput dedicado, a Cohere também oferece o Model Vault. Os preços começam em $2.500 por mês para uma instância Embed 4 Small [33].
Cobertura de Modelos
A Cohere se encaixa em fluxos de trabalho empresariais focados em texto, não em geração de mídia.
A empresa centra sua linha em torno de texto, recuperação e busca empresarial em vez de geração de imagem ou vídeo. A principal exceção é o Command A, que suporta entradas de imagem e tarefas multimodais. Ele também vem com uma janela de contexto de 256.000 tokens, a maior da linha da Cohere [34][36].
O Aya Expanse suporta 49 idiomas, o que o torna uma escolha sólida para implantações globais [37].
Custo por Saída
Se você está construindo pipelines de RAG, o baixo preço de entrada da Cohere é o grande atrativo. Esses fluxos de trabalho geralmente consomem muito mais tokens de entrada que de saída, então o Command R a $0.15 por 1M de tokens de entrada ajuda a evitar que prompts com muitos documentos fiquem caros demais.
Um exemplo simples deixa a diferença clara: executar 100.000 interações de chatbot de suporte no Command R custa cerca de $123 por mês, enquanto o mesmo volume no Command R+ chega a aproximadamente $2.050 por mês [39].
Para classificação e sumarização puras em escala, o Command R7B é a opção de menor custo da linha [34][38].
Uma maneira prática de pensar sobre isso:
- Use o Command R7B para classificação e sumarização de alto volume.
- Use o Command R para RAG e chatbots.
- Use o Command R+ apenas quando você precisar da força extra do modelo.
Em seguida, compare os preços da Runway ou explore alternativas de geração de vídeo de IA cinematográfico.
9. Runway

A Runway é construída em torno de vídeo, então seus preços estão ligados a segundos gerados ou editados. Ela usa um sistema de créditos para trabalho de vídeo e imagem. Você obtém créditos por meio de uma assinatura ou comprando pacotes de recarga a $0.01 por crédito, com um mínimo de $10. Os créditos de API são cobrados separadamente. A principal coisa a observar é como o consumo de créditos muda de um modelo para outro.
Preço Unitário
| Modelo | Tarifa API (Créditos/seg) | Custo USD/seg |
|---|---|---|
| Gen-4.5 (Flagship) | 12 /seg | $0.12 |
| Gen-4 Video | 12 /seg | $0.12 |
| Gen-4 Turbo | 5 /seg | $0.05 |
| Aleph 2.0 (Edição de Vídeo) | 28 /seg | $0.28 |
| Act-Two (Animação) | 5 /seg | $0.05 |
| Gen-4 Image (1080p) | 8 /img | $0.08 |
Limites Incluídos
Em planos anuais [40][43], a Runway inclui os seguintes tetos mensais de créditos:
| Plano | Custo Mensal (Anual) | Créditos/Mês | Rollover |
|---|---|---|---|
| Free | $0 | 125 (uma vez) | Nenhum |
| Standard | $12 | 625 | Nenhum |
| Pro | $28 | 2.250 | Nenhum |
| Max | $76 | 9.500 | 1 mês |
O plano Free inclui marcas d'água e não permite uso comercial. Os planos pagos removem ambas as limitações [40][44]. Os créditos do Standard e do Pro não acumulam, e os créditos não utilizados expiram dentro de 24 horas após a próxima data de cobrança [40][43][46]. Apenas o Max oferece um mês de rollover [40][43][46].
Cobertura de Modelos
A Runway cobre texto-para-vídeo, imagem-para-vídeo, edição de vídeo, texto-para-imagem, imagem-para-imagem, além de ferramentas de áudio e pós-processamento [42]. Essa amplitude lhe dá mais alcance que uma ferramenta que só faz geração. Mas o preço sozinho não conta a história toda. A qualidade da saída muda o que você acaba pagando na prática.
Custo por Saída
É aqui que as coisas ficam mais caras do que parecem à primeira vista. As retentativas se acumulam rápido. A maioria dos clipes finalizados leva 3 a 5 gerações, o que empurra o Gen-4.5 para cerca de $0.50 a $0.80 por segundo finalizado [43][44][47].
Uma maneira comum de manter os gastos sob controle é usar o Gen-4 Turbo a $0.05/seg para rascunhos e testes de conceito, e depois passar para o Gen-4.5 a $0.12/seg para as renderizações finais [41][45]. Essa configuração faz sentido se você não quer queimar créditos premium enquanto ainda está definindo movimento, enquadramento ou timing.
Há também um teto rígido nos planos de nível mais baixo. Os 625 créditos do Standard cobrem apenas cerca de 52 segundos de vídeo Gen-4.5 por mês [40][44]. Isso é suficiente para alguns clipes polidos, mas não sustentará um fluxo de trabalho de produção constante.
Como alternativa, você pode explorar o MiniMax Hailuo 2.3 para geração de vídeo de alta consistência. Em seguida, compare os preços de imagem e vídeo da Stability AI.
10. Stability AI

A Stability AI se destaca em fluxos de trabalho de imagem e áudio, onde o preço por ativo geralmente importa mais que um plano mensal. Ela usa um sistema de créditos, e 1 crédito = $0.01. Novos usuários recebem 25 créditos gratuitos, o que é suficiente para cerca de 3 gerações flagship ou 8 imagens SD 3.5 Large. O acesso à API também inclui direitos de uso comercial [48].
Aqui está o preço por serviço.
Preço Unitário
| Serviço | Créditos | USD |
|---|---|---|
| Stable Image Ultra | 8 | $0.08 |
| Stable Diffusion 3.5 Large | 6.5 | $0.065 |
| Stable Diffusion 3.5 Large Turbo | 4 | $0.04 |
| Stable Image Core | 3 | $0.03 |
| Stable Diffusion 3.5 Flash | 2.5 | $0.025 |
| SDXL 1.0 | A partir de 0.9 | A partir de $0.009 |
| Replace Background & Relight | 8 | $0.08 |
| Erase / Inpaint / Remove Background | 5 | $0.05 |
| Creative Upscaler (para 4K) | 60 | $0.60 |
| Fast Upscaler | 2 | $0.02 |
| Stable Fast 3D | 10 | $0.10 |
| Stable Audio 3.0 (até 6 min) | 26 | $0.26 |
Limites Incluídos
Os preços de API são pay-as-you-go, com preços personalizados e descontos em massa para equipes de alto volume [49].
Cobertura de Modelos
A Stability AI cobre texto-para-imagem, edição de imagem, geração de ativos 3D e geração de áudio [48]. Em bom português, é construída para trabalho de produção. Você pode gerar imagens, editá-las, transformar ativos em saídas 3D e criar clipes de áudio sem pular entre um monte de ferramentas.
O conjunto de edição inclui outpainting, substituição de fundo, reiluminação e transferência de estilo [48]. O Stable Fast 3D lida com geração de ativos 3D, enquanto o Stable Audio 3.0 suporta clipes de áudio de até seis minutos [48]. Então, isso é menos sobre chat e mais sobre concluir trabalho de mídia.
Essa diferença de preços aparece mais quando você está trabalhando em escala, especialmente com trabalhos de edição e upscaling.
Custo por Saída
O Creative Upscaler custa 60 créditos ($0.60) por imagem. Isso é 30x o preço do Fast Upscaler, que custa 2 créditos ($0.02). Então, se seu objetivo principal são simples aumentos de resolução, o Fast Upscaler é a escolha de menor custo [48].
O Stable Image Core dá cerca de $30/mês para 1.000 imagens [48]. E se você escalar para 10.000 imagens/mês com o SD 3.5 Large, o custo fica em cerca de $650 [48].
Você também pode gerar e editar imagens usando outros modelos de alto desempenho. Em seguida, compare os preços de imagem da Black Forest Labs.
11. Black Forest Labs

A Black Forest Labs é um benchmark de preço prático para geração de imagem, porque a conta muda com o tamanho da saída e com o uso ou não de imagens de referência. Seu sistema é baseado em créditos, com 1 crédito = $0.01. O preço do FLUX.2 está ligado a megapixels, e as imagens de referência são cobradas à parte. Uma coisa a observar: cada imagem e cada imagem de referência é arredondada para cima para o próximo megapixel, com base em 1.024 × 1.024 px.
Preço Unitário
A linha FLUX.2 vem em quatro níveis: Max, Pro, Klein e Flex. Cada um faz um trade-off diferente entre qualidade de imagem, velocidade e preço.
| Modelo | 1º MP (Base) | MP Adic. | Img. de Ref. (por MP) | Modo de Geração |
|---|---|---|---|---|
| FLUX.2 [max] | $0.07 | $0.03 | $0.03 | Texto-para-Imagem / Edição |
| FLUX.2 [pro] (Text-to-Image) | $0.03 | $0.015 | $0.015 | Texto-para-Imagem |
| FLUX.2 [pro] (Edit) | $0.045 | $0.015 | $0.015 | Edição de Imagem |
| FLUX.2 [klein] 9B | $0.015 | $0.002 | $0.002 | Texto-para-Imagem / Edição |
| FLUX.2 [klein] 4B | $0.014 | $0.001 | $0.001 | Texto-para-Imagem / Edição |
| FLUX.2 [flex] | $0.05 | $0.05 | $0.05 | Texto-para-Imagem / Edição |
Os modelos mais antigos FLUX1.1 e FLUX.1 usam preços fixos por imagem em vez disso.
| Modelo | Preço por Imagem | Descrição |
|---|---|---|
| FLUX1.1 [pro] | $0.04 | Geração padrão de alta velocidade |
| FLUX1.1 [pro] Ultra | $0.06 | Resolução ultra-alta |
| FLUX1.1 [pro] Raw | $0.06 | Estética de fotografia espontânea |
| FLUX.1 Kontext [max] | $0.08 | Edição em contexto de qualidade máxima |
| FLUX.1 Kontext [pro] | $0.04 | Edição em contexto pronta para uso comercial |
| FLUX.1 Fill [pro] | $0.05 | Inpainting de imagem direcionado |
| FLUX.1 [schnell] | $0.003 | Destilado para velocidade máxima |
Limites Incluídos
O acesso à API é pay-as-you-go, mas a Black Forest Labs também tem níveis de assinatura com tetos mensais de imagem [50].
| Plano | Limite Mensal | Principais Recursos |
|---|---|---|
| Builder | 10.000 imagens/mês | Modelos Klein, 10 usuários, direitos de fine-tuning |
| Platform | 100.000 imagens/mês | Modelos Klein 9B + Dev, 10 usuários |
| Professional | 100.000 imagens/mês | Modelos Dev, 3 domínios, 10 usuários |
| Enterprise | Personalizado | Todos os modelos, volume personalizado, acesso a API e pesos |
Cobertura de Modelos
A Black Forest Labs é centrada em geração e edição de imagem. Os modelos FLUX.2 suportam tamanhos de saída de até 4 MP, e qualquer coisa acima disso é redimensionada automaticamente [50]. Se a velocidade importa mais, o FLUX.2 [klein] 4B se destaca com inferência abaixo de um segundo, o que o torna uma boa opção para casos de uso quase em tempo real [52].
Para trabalho de edição, a linha também tem algumas opções claras. O FLUX.1 Fill [pro] lida com inpainting direcionado a $0.05 por imagem, enquanto o FLUX.1 Kontext [pro] custa $0.04 por imagem para edição em contexto pronta para uso comercial [51].
Custo por Saída
Uma imagem finalizada FLUX.2 [max] de 4 MP custa cerca de $0.30, considerando geração, upscaling e duas retentativas. As imagens de referência são cobradas separadamente à mesma tarifa por megapixel [50][51]. Se você está fazendo concept art ou prototipagem em estágio inicial, o FLUX.2 [klein] 4B a $0.014 por imagem é a maneira de baixo custo de testar ideias antes de passar para as renderizações finais [50].
Em seguida: preços de vídeo da Kling AI.
12. Kling AI

A Kling AI divide os preços em duas vias: o aplicativo web usa créditos, enquanto a API cobra por segundo. No lado da API, o custo muda com base no comprimento do clipe, na resolução e em ativar ou não o áudio sincronizado.
Preço Unitário
Para vídeo silencioso padrão, os preços começam em $0.0672/seg em 720p e vão até $0.0896/seg em 1080p. O Kling V3 Omni, que lida com entradas de texto-mais-imagem e fluxos de vídeo-para-vídeo, custa $0.1792/seg em 1080p.
| Configuração | Resolução | Preço/Seg | Custo Est. Clipe 10s |
|---|---|---|---|
| Kling V3 – Silent | 720p | $0.0672 | $0.67 |
| Kling V3 – Silent | 1080p | $0.0896 | $0.90 |
| Kling V3 – With Audio | 1080p | $0.1120 | $1.12 |
| Kling V3 Omni (Ref) | 1080p | $0.1792 | $1.79 |
| Kling V3 – Silent | 4K | $0.4286 | $4.29 |
Então, sim, a Kling fica no lado de menor preço para APIs de vídeo.
Limites Incluídos
A Kling mantém os preços do aplicativo web e da API separados, o que significa que você precisa verificar ambos antes de escolher um plano. A tarifa da API é apenas uma parte da conta. Créditos e concorrência têm um grande efeito sobre quanto trabalho você consegue empurrar.
O nível gratuito vem com 66 créditos por dia, e esses créditos reiniciam a cada 24 horas sem rollover. Os planos pagos começam em $6.99/mês para 660 créditos no Standard e vão até $180/mês para 26.000 créditos no Ultra. Se você pagar anualmente pelo Ultra, a tarifa efetiva cai 34% [54].
Para usuários de API, a concorrência padrão é limitada a 10 trabalhos paralelos. Contas de nível de teste recebem apenas 3. Essa diferença pode importar muito se você está tentando fazer renderizações em lote em vez de esperar os clipes um por um.
Cobertura de Modelos
O Kling V3 e o Kling V3 Omni suportam clipes de até 15 segundos, o que os torna adequados para trabalho cinematográfico e narrativo. O V2.6 limita o comprimento do clipe a 10 segundos e adiciona áudio sincronizado. O V2.5 Turbo é cerca de 30% mais barato que o nível Master.
Custo por Saída
Uma maneira comum de manter os gastos sob controle é rascunhar em modo silencioso 720p e passar para 1080p ou 4K apenas para as renderizações finais. Essa abordagem ajuda porque muitos usuários precisam de 2–4 tentativas de geração para obter um clipe utilizável, e isso eleva o custo do vídeo finalizado [53].
Os Prepaid Resource Packages podem reduzir o preço unitário efetivo em 10% a 30%, dependendo do tamanho do pacote [53].
Em seguida, compare esses modelos por preço unitário, limites de plano, cobertura de modalidade e custo por saída.
Detalhamento de Preços por Critério de Comparação
As tabelas abaixo condensam os detalhes anteriores provedor por provedor em quatro filtros de compra: preço unitário, limites de plano, cobertura de modalidade e custo de saída.
Preço Unitário em APIs de Texto, Imagem e Vídeo
| Modelo | Provedor | Entrada ($/1M tokens) | Saída ($/1M tokens) | Nível |
|---|---|---|---|---|
| GPT-5 Nano | OpenAI | $0.05 | $0.40 | Budget |
| Gemini 2.5 Pro | $1.25 | $10.00 | Mid-range | |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | Premium |
Para geração de imagem, o FLUX.1 [schnell] é a referência de baixo custo a $0.003 por imagem, enquanto o Stable Image Ultra fica no topo a $0.08 por imagem. Para vídeo, o Kling V3 custa $0.0672/seg em 720p no extremo inferior, e o Veo 3.1 fica em $0.40/seg no extremo superior.
As tarifas brutas importam. Mas, na prática, os limites de plano muitas vezes decidem o que você realmente gasta.
Limites Incluídos em Assinaturas e Planos de Plataforma
Abaixo de cerca de 5 milhões de tokens de entrada por mês, planos de chat de $20 podem superar a cobrança por API para uso casual.
| Provedor | Plano | Preço Mensal | Uso Incluído | Principais Limites | Plano de Equipe |
|---|---|---|---|---|---|
| OpenAI | ChatGPT Plus | $20 | Limitado (dinâmico) | Tetos de mensagem dinâmicos; sem acesso à API | Sim |
| Anthropic | Claude Pro | $20 | Limitado (dinâmico) | Limites de uso variam por demanda; sem acesso à API | Sim |
| Gemini Advanced | $20 | Limitado (dinâmico) | Vinculado ao Google One; sem acesso à API | Sim (Workspace) |
Os modelos de raciocínio também adicionam uma complicação: tokens de raciocínio ocultos são cobrados às tarifas de saída, o que pode elevar o custo total em 2x a 7x.[3]
Cobertura de Modelos por Modalidade
O preço só importa depois que a modalidade do modelo se encaixa no trabalho.
| Provedor | Texto | Entrada Multimodal | Geração de Imagem | Visão | Geração de Vídeo | Acesso à API |
|---|---|---|---|---|---|---|
| APIMart | ✓ | ✓ | ✓ | - | ✓ | API Unificada |
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | Direto |
| ✓ | ✓ | ✓ | ✓ | ✓ | Direto | |
| Anthropic | ✓ | ✓ | ✗ | ✓ | ✗ | Direto |
| Meta | ✓ | ✓ | ✗ | ✓ | ✗ | Unificado/Hospedado |
| Mistral AI | ✓ | ✓ | ✗ | ✓ | ✗ | Direto |
| Stability AI | ✗ | ✗ | ✓ | ✗ | ✓ | Direto |
Um modelo barato não é vantagem se não consegue lidar com o formato de que você precisa. Fornecedores só de texto, por exemplo, não ajudarão muito se seu fluxo de trabalho depende de saída de imagem ou vídeo.
Custo por Saída por Caso de Uso Comum
Estes são os custos que as equipes tendem a sentir quando as coisas chegam à produção.
Cargas de trabalho de texto (por 1M de tokens de saída):
| Caso de Uso | Modelo | Custo de Saída | Nível | Principal Trade-off |
|---|---|---|---|---|
| Chatbot de alto volume | GPT-5 Nano | $0.40 | Budget | Menor profundidade de raciocínio |
| Extração de documentos | Gemini Flash Lite | $0.30 | Budget | Escrita criativa limitada |
| Geração de código | Gemini 2.5 Pro | $10.00 | Mid-range | Sobretaxa acima de 200K de contexto [3] |
| Fluxos de trabalho agênticos | Claude Sonnet 4.6 | $15.00 | Mid-range | Precisa de cache de prompt para ROI [3] |
| Raciocínio complexo | Claude Opus 4.8 | $25.00 | Premium | Alto custo; latência mais lenta |
Cargas de trabalho de vídeo (por clipe de 10 segundos):
| Caso de Uso | Modelo | Custo de Saída | Nível | Principal Trade-off |
|---|---|---|---|---|
| Vídeo de formato curto (rascunho) | Kling V3 | ~$0.67 | Budget | 720p; limitado a clipes de 15 segundos |
| Vídeo de formato curto (final) | Sora 2 | $1.00 | Mid-range | Qualidade e custo equilibrados |
| Vídeo cinematográfico | Veo 3.1 | $4.00 | Premium | Maior qualidade; maior gasto |
Aqui está a versão simples: o preço por token ou por segundo é apenas parte da história. O fator maior costuma ser como você usa o modelo. Um chatbot rodando o dia todo, um pipeline de documentos e um estúdio de vídeo podem parecer baratos no papel e ficar caros rápido quando o volume de saída entra em cena.
Uma regra prática: o processamento em lote corta custos em 50% na OpenAI, Anthropic e Mistral para cargas de trabalho que toleram um prazo de 24 horas.[3] Para vídeo, rascunhar em resolução mais baixa e melhorar apenas as renderizações finais é a maneira mais confiável de controlar o gasto por saída.
Prós e Contras
A tabela abaixo reduz os trade-offs ao que geralmente orienta a decisão: custo, modalidade e adequação à carga de trabalho. Se você está escolhendo entre provedores, isso lhe dá a versão curta sem precisar vasculhar cada seção de preços.
| Sujeito | Prós | Contras | Melhor Para |
|---|---|---|---|
| APIMart | Mais de 500 modelos sob uma API; uma fatura para texto, imagem e vídeo | Preços baseados em uso significam que os custos sobem com o volume de saída | Equipes que querem acesso multimodal unificado |
| OpenAI | Cobrança de token clara | Modelos flagship são caros | Cargas de trabalho de texto de uso geral |
| Anthropic | Cache de prompt reduz custos de trabalho repetido | Modelos de topo carregam altas tarifas de saída | Fluxos de trabalho de programação e contexto longo |
| Google AI | Flash-Lite é barato | Pro fica caro acima de 200K tokens | Cargas de trabalho de texto de alto volume e contexto longo |
| Meta (Llama) | Baixo custo se você puder auto-hospedar | Sem API própria significa que você cuida da hospedagem e do uptime | Cargas de trabalho sensíveis a custo com capacidade de auto-hospedagem |
| xAI (Grok) | Preços intermediários competitivos | Linha de modelos menor | Aplicativos de dados da web e sociais em tempo real |
| Mistral AI | Modelos pequenos de baixo custo e cobertura multilíngue | Menos recursos multimodais | Aplicativos de texto multilíngue |
| Cohere | Embed, Rerank e Command R7B se encaixam em RAG | Command R+ é caro para seu nível | Geração aumentada por recuperação e bases de conhecimento |
| Stability AI | Preços muito baixos de geração de imagem | Escopo só de imagem limita fluxos de trabalho mais amplos | Geração de imagem de alto volume |
| Kling AI | Vídeo de formato curto de baixo custo | Limitado a vídeos de 15 segundos no preço base | Geração de vídeo de formato curto |
Uma maneira simples de ler isso:
- Se você quer uma API para muitos tipos de modelo, a APIMart se destaca.
- Se você se importa mais com uso de texto simples e cobrança direta, a OpenAI ou o Google AI podem ser a opção mais fácil.
- Se seu trabalho tende a programação, prompts longos ou contexto repetido, a Anthropic pode fazer sentido.
- Se você está mantendo custos baixos e pode rodar as coisas você mesmo, a Meta (Llama) é difícil de ignorar.
- Se sua stack é construída em torno de RAG, a Cohere tem ferramentas que se alinham bem com essa configuração.
Para uso com muitas imagens, a Stability AI é a escolha de baixo custo. Para clipes de vídeo curtos, a Kling AI mantém os custos de entrada baixos, embora o plano base permaneça vinculado a saídas de 15 segundos.
Conclusão
Olhando para o detalhamento de preços acima, o melhor modelo não é o mais caro nem o mais barato. É aquele que se encaixa na sua carga de trabalho, modalidade e volume.
Tarefas de alto volume e baixa complexidade devem rodar nos modelos de menor custo que você conseguir.
À medida que a complexidade aumenta, o gasto deve aumentar apenas quando a saída justificar. Modelos intermediários são uma boa opção para aplicativos em produção que precisam de desempenho estável sem o preço de topo de linha.
Depois que você entra em raciocínio premium ou geração de mídia, o custo por saída começa a importar mais que o preço bruto de token. Modelos premium fazem sentido quando a qualidade tem efeito direto nos resultados. E para vídeo, os preços funcionam de forma diferente: APIs como WAN 2.7, Sora 2 ($0.08/seg) e Kling V3 ($0.0672/seg em 720p) cobram por segundo, não por token.
Para equipes que usam modelos de texto, imagem e vídeo juntos, a APIMart dá acesso a mais de 500 modelos por meio de uma única API. Isso significa que o trabalho multimodal pode ficar sob uma API e uma fatura.
Perguntas Frequentes
Como estimo o custo total por saída?
Estime o custo total com base em como o modelo é cobrado.
Para modelos de texto, o preço geralmente é dividido em tokens de entrada e tokens de saída por 1 milhão de tokens. Os tokens de saída costumam custar mais, então o comprimento esperado da sua resposta tem o maior efeito sobre o gasto total.
Para casos de uso não textuais, os modelos de imagem geralmente são cobrados por chamada, enquanto os modelos de vídeo são cobrados por segundo gerado.
Uma maneira simples de estimar o custo é:
- usar um contador de tokens para medir o volume do prompt
- verificar a tarifa do modelo para cada unidade de cobrança
- aplicar essa tarifa ao seu uso esperado
Isso lhe dá uma estimativa de custo prática antes de escalar qualquer coisa.
Quando o cache de prompt economiza dinheiro?
O cache de prompt corta custos quando seu aplicativo envia o mesmo prefixo de prompt repetidamente. Isso geralmente significa instruções de sistema longas, grandes conjuntos de documentos ou histórico de conversa compartilhado reutilizado em muitas requisições.
Em vez de pagar o preço total do token de entrada toda vez, você paga menos pela parte repetida. Em muitos casos, isso pode reduzir os custos de entrada em 50% a 90%.
Isso funciona melhor quando o volume é alto e o contexto permanece praticamente o mesmo. Um chatbot de suporte ao cliente é um bom exemplo: o bot pode reutilizar as mesmas regras, informações de marca e documentos de ajuda em milhares de conversas.
É uma escolha ruim quando o contexto muda o tempo todo. Se seu aplicativo fica reescrevendo o prompt do zero a cada requisição, há menos texto repetido para armazenar em cache, então a economia cai rápido.
Devo usar assinaturas ou preços de API?
Para a maioria dos desenvolvedores e empresas, os preços de API fazem mais sentido. Com a cobrança pay-as-you-go, você paga pelos tokens que usa - sem mínimos mensais, sem taxas surpresa e sem cobranças fixas pairando sobre você quando o tráfego está baixo. Seus custos acompanham o uso, o que muitas vezes é uma opção muito melhor que uma conta recorrente fixa.
A APIMart lhe dá uma API que se conecta a mais de 500 modelos de IA, com preços claros por token e descontos automáticos por volume conforme seu uso aumenta.
Publicações Relacionadas no Blog
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.