El modelo de vídeo multimodal lanzado oficialmente por Google admite generación, edición mediante lenguaje natural, interpolación de fotogramas y extensión de vídeo. APIMart lo ofrece a través de un canal oficial dedicado con seguimiento asíncrono y facturación según la resolución.
Prefer automatic inference unless the intended behavior is ambiguous.
Video link valid for 72 hours
Genera desde texto, anima imágenes de referencia, interpola entre los fotogramas inicial y final o edita un clip existente. Elige 360p, 720p, 1080p o 4K y gestiona cada tarea mediante el flujo asíncrono de APIMart.
50K+
Usuarios Activos
99.9%
Tiempo Activo
2x
Más Rápido
70%
Ahorro de Costos
Controles documentados para generación, interpolación, edición y extensión
Usa los modos de entrada documentados para una producción y automatización controladas
Crea una clave, envía una solicitud asíncrona válida y recupera el vídeo terminado
Inicia sesión en APIMart, crea una clave API y envíala como token Bearer en el encabezado Authorization. Guarda la clave en el servidor y no la expongas en código cliente público.
Define model como gemini-omni-1.1-flash y proporciona un prompt o al menos una imagen o vídeo compatible. Si se omiten, resolution usa 720p y aspect_ratio usa 16:9.
Envía la solicitud y consulta el task_id devuelto hasta que termine. Obtén la URL de result.videos[0].url y descarga los resultados que necesites conservar a largo plazo.
Entradas, parámetros, límites, facturación y procesamiento de tareas en APIMart
Es el modelo de vídeo multimodal lanzado oficialmente por Google para texto a vídeo, imagen a vídeo, interpolación de los fotogramas inicial y final, edición y extensión conversacional. En APIMart, usa el ID específico gemini-omni-1.1-flash con la API de vídeo unificada.
La solicitud admite model, prompt, resolution, aspect_ratio, image_urls, first_frame_image, last_frame_image, image_with_roles, video_urls, metadata.task y extend_from_task_id. Se requiere un prompt o al menos una imagen o vídeo.
No. Los clips generados duran aproximadamente entre 3 y 10 segundos, pero esta API no ofrece el parámetro duration. La salida se genera a 24 fps e incluye audio.
Usa first_frame_image solo para imagen a vídeo o envíalo junto con last_frame_image para la interpolación. Enviar únicamente last_frame_image produce el error 400 invalid_frame_images. Ambas imágenes deben tener las mismas proporciones y coincidir con aspect_ratio.
Puedes proporcionar hasta 10 imágenes en total, incluidos los fotogramas inicial y final, y como máximo un vídeo de referencia o para editar de hasta 10 segundos. Se aceptan URL HTTP(S) públicas y data URL base64 compatibles. No se admiten entradas de audio ni enlaces de YouTube.
Envía POST /v1/videos/generations y guarda el task_id. Consulta GET /v1/tasks/{task_id} cada 5–10 segundos hasta que el estado sea completed o failed. Configura un tiempo de espera de hasta 10 minutos para tareas 4K o con entrada de vídeo.
Para editar directamente, envía un clip en video_urls con un prompt concreto. Para continuar un resultado sin volver a subirlo, indica el ID de una tarea correcta de APIMart en extend_from_task_id. La tarea debe pertenecer al usuario actual y haberse creado con un modelo Omni.
La resolución elegida establece la tarifa de los tokens de salida. APIMart reserva primero créditos para un resultado máximo de 10 segundos y ajusta el coste al uso real tras completarse. Una tarea fallida no se cobra y un saldo insuficiente devuelve HTTP 402.
El endpoint no acepta system prompt, temperature, un campo específico de negative prompt, entrada de audio ni el parámetro duration. Escribe las exclusiones y las indicaciones de sonido directamente en prompt.
Puedes contactarnos a través del chat en vivo en la esquina inferior derecha de la página, enviarnos un correo a [email protected] o unirte a nuestra comunidad de Discord. Nuestro equipo te responderá lo antes posible.
Explora más modelos de la misma categoría.

Gemini Omni Flash Preview
gemini-omni-flash-preview is a multimodal video generation and editing model launched by Google.

Kling 3.0 Turbo
Kling-3.0-Turbo: A high-speed, high-quality AI video generation model ideal for quickly creating short videos.

Pixverse V6
pixverse-v6 is PixVerse's sixth-generation AI video generation model, primarily used for text-to-video and image-to-video generation.

Gemini Omni 1.1 Flash Ext
Omni-Flash-Ext is an extended video generation model in version 4.6.4 of Google's Gemini series.