Crie novos conceitos visuais, aplique edição imagem em áreas selecionadas, preserve sujeitos recorrentes e use contexto visual externo em um fluxo criativo com várias etapas.
Prévia de um modelo multimodal em que edição imagem apoia geração visual, revisões precisas, conceitos fundamentados por pesquisa e design iterativo.
A APIMart está preparando a integração da API do Gemini Nano Banana 2.1. Quando a integração estiver pronta, esta página publicará os IDs de modelo compatíveis, os formatos de solicitação, os limites, os preços e os detalhes de acesso.
Geração, edição imagem, pesquisa, consistência e controles criativos
Fluxos visuais para equipes criativas, comerciais, de produto e conteúdo
Recursos, entradas, edição, controles e acesso pela APIMart
É um modelo multimodal do Google para geração de imagem, edição imagem, criação de imagem fundamentada por pesquisa e refinamento iterativo.
O modelo aceita texto e imagens e pode usar vídeo como contexto de entrada, permitindo combinar instruções com uma imagem de referência e outros materiais visuais.
A edição imagem pode continuar por várias rodadas, incluindo revisões baseadas em máscaras que concentram mudanças em áreas selecionadas de uma imagem.
A consistência de sujeitos é um foco declarado e atende fluxos que reutilizam uma pessoa, um produto ou um objeto na imagem e em variações relacionadas.
Google Search e pesquisa de imagens fornecem contexto externo quando a criação de uma imagem depende de informações atuais ou referências visuais reais.
A documentação inclui saídas 1K, 2K e 4K e várias proporções para cada imagem quadrada, vertical, horizontal ou panorâmica.
O parâmetro temperature não é compatível. A mesma restrição vale para topP e topK, além de seed e logprobs; os aplicativos não devem enviá-los.
A APIMart prepara a integração da API Gemini Nano Banana 2.1. Quando estiver pronta, esta página publicará IDs, formatos de solicitação, limites, preços e detalhes de acesso.
Explore mais modelos da mesma categoria.

Nano banana
Nano Banana (gemini-2.5-flash-image-preview) is Google DeepMind's fast, conversational image generation and editing model. It delivers natural-language text-to-image, precise multi-turn edits, strong character consistency, and multi-image fusion at low latency.

Seedream 5.0 Pro
Seedream 5.0 Pro (seedream-5-0-pro) is quality-first text-to-image model. It produces cinematic 1K and 2K images with best-in-class text rendering, supports up to 10 reference images for style and character consistency, and unifies generation and editing in a single API call.

Midjourney
Midjourney is a leading text-to-image AI model renowned for its painterly aesthetics, strong composition, and cinematic lighting. Generate high-quality images from text prompts or reference images, with fine-grained control over style, aspect ratio, and creative parameters — accessible programmatically through APIMart's unified API, no Discord required.

Wan 2.7 Image
wan‑2‑7‑image is an advanced image generation model in Alibaba’s Wan 2.7 series designed to create high‑quality visuals from text prompts. It excels at generating detailed, realistic images with accurate object representation and rich composition. The model supports multimodal input (e.g., combining text with reference images) to influence style and structure, and it’s well‑suited for creative workflows such as marketing assets, product visuals, social media graphics, and artistic content production. With strong semantic understanding and prompt adherence, wan‑2‑7‑image delivers both fidelity and expressive visual output.