
Guía de la API de Vidu MoE: vídeo Mixture-of-Experts
Guía dev de la API de vídeo Vidu MoE (Vidu Q3): niveles del modelo, estructura de la solicitud, parámetros, precios y flujo asíncrono en APIMart.
Si tuviera que resumir esto en una línea: Vidu MoE es una API de vídeo de formato corto para equipos que necesitan clips de 1 a 16 segundos, hasta 1080p, 24 fps, entrega asíncrona y audio opcional en una sola solicitud.
Si estás evaluando el encaje para producción, aquí va la respuesta corta: funciona mejor cuando puedes manejar trabajos asíncronos, presupuestar para reintentos y elegir el nivel de modelo adecuado para cada etapa. Yo usaría viduq3-turbo para vistas previas y viduq3-pro para la salida final. La mayoría de los trabajos terminan en unos 60 a 120 segundos en 720p y 90 a 180 segundos en 1080p, con tiempos de espera pico que alcanzan unos 4 minutos.
Esto es lo que más importa:
- Modos de entrada: texto a vídeo, animación de una imagen, alternativas a Grok Imagine Video, vídeo de dos fotogramas inicio/fin y entrada de referencia multiimagen
- Límites de clip: 1 a 16 segundos
- Salida: hasta 1080p a 24 fps
- Audio: se puede activar en la misma solicitud
- Referencias de imagen: hasta 7 imágenes en el conjunto de funciones más amplio del modelo
- Regla principal de la API: si envías URLs de imagen, no envíes
aspect_ratio - Entrega: asíncrona con
task_id, sondeo o callback - Ejemplo de precio: Pro cuesta unos $0.60 por 5 segundos y $1.44 por 12 segundos
- Realidad presupuestaria: planifica 2 a 3 intentos por clip aprobado
Algunos detalles destacan. La API usa una solicitud JSON simple con model, prompt y entradas de medios opcionales. La elección de modelo es sencilla: turbo para pruebas de menor coste, pro para renders de gama más alta. El control de seed ayuda a mantener las salidas en una dirección similar entre reintentos, aunque no como coincidencias exactas.
Si yo evaluara esto para un equipo de producto, me centraría en tres preguntas:
- ¿Puede mi app manejar el procesamiento asíncrono de forma limpia?
- ¿Necesito generación solo con prompt, control guiado por imagen o control de fotograma inicial/final?
- ¿Mi presupuesto sigue funcionando tras los reintentos, no solo el coste de la primera pasada?
Comparación rápida
| Elemento | Qué saber |
|---|---|
| Mejor para | Clips de marketing, vídeos de producto, explicadores, variantes de anuncios |
| Opciones de modelo | viduq3-turbo, viduq3-pro, viduq3 |
| Control de entrada | Solo prompt, 1 imagen, 2 imágenes o generación guiada por referencia |
| Latencia | Normalmente 1 a 3 minutos, a veces más en pico |
| Resolución | 540p, 720p, 1080p |
| Audio | Compatible en la misma solicitud |
| Encaje de flujo de trabajo | Equipos que pueden esperar unos minutos y guardar archivos tras la finalización |
| Cosas a vigilar | URLs de salida que expiran, costes de reintento y errores de solicitud por combinaciones de parámetros incorrectas |
Así que antes de leer la guía completa, la conclusión es simple: Vidu MoE encaja bien para generación de vídeo corta basada en API cuando quieres varios modos de entrada, audio integrado y control de coste cambiando entre turbo y pro. El resto se reduce a la configuración de la solicitud, la gestión del estado y elegir el método de entrada que encaja con tu flujo de trabajo.
Resumen de la API de Vidu MoE y capacidades principales

A nivel de API, Vidu MoE se mapea a un pequeño conjunto de nombres de modelo, flujos de trabajo y campos de salida.
Vidu MoE aparece en la API como viduq3-mix, el modelo Q3 equilibrado. viduq3-turbo se inclina hacia la velocidad, mientras que viduq3-pro se inclina hacia más detalle.
Qué significa Mixture-of-Experts en la generación de vídeo
Mixture-of-experts envía diferentes partes del proceso de generación a componentes especializados. En la práctica, eso ayuda con el movimiento, la composición de escena y el apego al prompt.
La serie Q3 también admite cambio inteligente de escena y cambio inteligente de cámara [2][4]. Eso importa más en secuencias multitoma, donde la continuidad puede desmoronarse rápido si el modelo pierde el rastro de la escena.
Flujos de trabajo compatibles: texto a vídeo, imagen a vídeo y generación guiada por referencia
A partir de ahí, la diferencia principal se reduce al tipo de entrada que envías.
viduq3-mix admite cuatro flujos de trabajo:
- Texto a vídeo solo a partir de un prompt
- Imagen a vídeo a partir de una imagen inicial
- Referencia a vídeo a partir de 1 a 7 imágenes para consistencia de apariencia y estilo
- Inicio-fin a vídeo a partir de dos fotogramas que definen la transición
Los prompts admiten hasta 5.000 caracteres [3][4]. viduq3-mix no admite la biblioteca de entidades Subjects.
Entradas y salidas de un vistazo
| Flujo de trabajo | Campos de entrada típicos | Campos devueltos |
|---|---|---|
| Texto a vídeo | model, prompt, duration, aspect_ratio, audio | task_id, state, credits, video_url |
| Imagen a vídeo | model, images (1 fotograma inicial), prompt, audio | task_id, state, credits, video_url |
| Referencia a vídeo | model, images (1–7), prompt, audio | task_id, state, credits, video_url |
| Inicio-fin a vídeo | model, images (2 fotogramas), prompt, resolution | task_id, state, credits, video_url |
Cada trabajo devuelve un task_id y un state, y el video_url final queda disponible tras el procesamiento.
Los vídeos Q3 se ejecutan a 24 fps, admiten duraciones de 1 a 16 segundos (comparable a las capacidades de Sora 2), y ofrecen salida en 540p, 720p o 1080p [2]. Las entradas de imagen están limitadas a 50 MB por archivo [4][1].
Estas opciones de flujo de trabajo dan forma a la carga útil que envías a continuación, que la siguiente sección desglosa en autenticación y formato de solicitud.
Autenticación, estructura de la solicitud y configuración de APIMart

Para generar vídeos con Vidu MoE, necesitas enviar una solicitud JSON autenticada. El cuerpo de la solicitud depende del modo de entrada: solo texto, una imagen o múltiples imágenes.
Obtener credenciales de API y configurar las cabeceras de la solicitud
Genera tu clave de API desde la Página de Gestión de claves de API de APIMart [6]. Guárdala como APIMART_API_KEY, y luego cárgala en tiempo de ejecución con os.environ.get("APIMART_API_KEY") en Python o process.env.APIMART_API_KEY en Node.js.
Incluye estas cabeceras en cada solicitud:
Authorization: Bearer YOUR_API_KEYContent-Type: application/json
Carga útil mínima de la solicitud para un trabajo de generación de vídeo
El endpoint estándar de APIMart para generaciones de Vidu Q3 (MoE) es https://api.apimart.ai/v1/videos/generations [6]. La API deduce el modo a partir de image_urls:
0URLs = texto a vídeo1URL = imagen a vídeo2URLs = primer a último fotograma
Aquí están los campos principales y cuándo usarlos [6]:
| Parámetro | Requerido | Predeterminado | Notas |
|---|---|---|---|
model | Sí | - | viduq3-pro, viduq3-turbo o viduq3 |
prompt | Condicional | - | Requerido para texto a vídeo; máx. 2.000 caracteres |
image_urls | Condicional | - | Requerido para imagen a vídeo (1 URL) o primer a último fotograma (2 URLs) |
duration | No | 5 seg | Rango: 1–16 segundos |
resolution | No | 720p | Opciones: 540p, 720p, 1080p |
aspect_ratio | No | 16:9 | Solo texto a vídeo; omite cuando proporciones image_urls |
audio | No | true | Establecer en false para un vídeo silencioso |
seed | No | - | Entero de -1 a 2^32-1 para reproducibilidad |
Un error fácil aquí: no envíes aspect_ratio junto con image_urls. Cuando incluyes imágenes, la API toma la relación de aspecto de la imagen de origen. Si envías aspect_ratio de todos modos, la solicitud devuelve un error 400.
Una vez configurada la carga útil, puedes enviar el trabajo y empezar a sondear el resultado.
Ejemplo de llamada a la API y patrón de respuesta
Ejemplo de solicitud de texto a vídeo:
curl -X POST https://api.apimart.ai/v1/videos/generations \
-H "Authorization: Bearer $APIMART_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "viduq3-turbo",
"prompt": "A product shot of a glass perfume bottle on a marble surface, camera slowly zooms in, soft studio lighting",
"duration": 5,
"resolution": "720p",
"aspect_ratio": "16:9",
"audio": false
}'
Un envío exitoso devuelve un task_id y un estado submitted [6]:
{
"code": 200,
"data": [{
"status": "submitted",
"task_id": "task_xxxxxxxxxx"
}]
}
La API se ejecuta de forma asíncrona. Eso significa que la primera respuesta solo te dice que el trabajo fue aceptado. Usa el task_id para sondear el endpoint "Get Task Status". Cuando el trabajo termina, la respuesta incluye enlace(s) MP4, normalmente válidos durante 7 días [6].
Un ritmo de sondeo simple funciona bien:
- Sondea cada 5 segundos durante los primeros 5 minutos
- Después de eso, sondea una vez por minuto
- Sigue sondeando hasta que el estado sea
completed
En ese punto, descarga y guarda el enlace o enlaces de vídeo devueltos.
A continuación, ajusta la duración, la resolución, la relación de aspecto y las entradas de referencia para controlar el vídeo final. Para proyectos que requieren diferentes estilos cinematográficos, también puedes comparar las capacidades de Kling V3 para generación de vídeo de gama alta.
Flujo de generación, parámetros y control de salida
Flujo de principio a fin: enviar, monitorizar, recuperar y guardar resultados
Después de enviar un trabajo, la gran decisión de producción es simple: usar un callback o sondear el estado. En la mayoría de los casos, callback_url es la mejor opción para producción. El sondeo funciona, pero debería ser tu plan de respaldo. Cuando usas un callback, la API envía el estado final a tu endpoint. Si la entrega falla, reintenta hasta tres veces [3].
El trabajo luego avanza por una ruta de estado fija: created → queueing → processing → success o failed [3][4]. Si una tarea termina en failed, la respuesta incluye un código de error. Registra ese código y manéjalo en tu flujo de trabajo para que tu equipo pueda detectar patrones y arreglar problemas más rápido.
Cuando el estado llega a success, descarga la salida de inmediato y guárdala en almacenamiento duradero. Ese paso importa porque las URLs alojadas en la API pueden expirar [9].
Parámetros clave que afectan a la composición, el movimiento, la duración y la consistencia
Una vez que un trabajo está en marcha, unos pocos parámetros dan forma a cómo se ve el resultado, cuán estable se mantiene de pasada a pasada y cuántos créditos gastas.
| Parámetro | Qué controla | Efecto visual / de calidad | Impacto en el coste |
|---|---|---|---|
seed | Aleatorización | Reutiliza el mismo seed con el mismo prompt para reproducir un movimiento y una composición similares | Sin impacto directo en el coste [3][6] |
off_peak | Programación de trabajos | Sin impacto visual; enruta trabajos de baja prioridad a procesamiento fuera de pico | Puede reducir el consumo de créditos; puede retrasar la finalización hasta 48 horas [11] |
audio_type | Capa de sonido | Elige Speech_only, Sound-effect_only o All (similar al soporte de audio en kling-v2-6) | Sin cargo extra por las opciones de audio estándar [1][4] |
is_rec | Mejora de prompt con IA | Mejora la alineación prompt-imagen cuando el prompting manual produce resultados inconsistentes | Cuesta 10 créditos extra por tarea [1] |
Un parámetro vale la pena rastrear desde el principio: seed. Si obtienes un patrón de movimiento que te gusta, anota ese entero y guárdalo. Luego, cuando ajustes el prompt más adelante, puedes reutilizar el mismo seed para conservar una composición general similar en lugar de empezar desde cero.
Cuándo usar solo prompts, referencias de imagen o ambos
Estos modos de entrada te dejan cambiar velocidad por control. Elige el que coincida con cuán fija esté tu dirección visual.
- Solo prompt (texto a vídeo): Mejor para ideación temprana, pruebas de estilo y experimentos de escena antes de que los activos visuales estén finalizados. Usa
viduq3-turboen 540p o 720p para mantener bajos los costes de iteración, o compáralo con WAN 2.6 para alternativas de alta consistencia [7]. - Una imagen (imagen a vídeo): Mejor cuando quieres animar algo específico, como una foto de producto, una ilustración de personaje o un visual de marca. Es una buena opción para comercio electrónico y trabajo de marketing.
- Dos imágenes (primer a último fotograma): Mejor cuando la transición necesita aterrizar en un resultado fijo, como un producto girando a un ángulo determinado o un personaje moviéndose a una pose definida [5].
Si el prompting manual te da resultados desiguales, activa is_rec: true. La API generará un prompt optimizado a partir de tu imagen, lo que puede ayudar a la alineación imagen-prompt, pero añade 10 créditos por tarea [1].
Rendimiento, precios y escenarios reales de integración

Cómo evaluar la latencia, la fiabilidad y el coste por vídeo
Después de fijar el formato de la solicitud, lo siguiente que hay que mirar es la velocidad, el precio y la tasa de éxito de los trabajos. Este es un flujo asíncrono, así que tu app debería enviar el trabajo, guardar el task_id y recuperar el MP4 final más tarde mediante sondeo o un callback [3][6].
Los trabajos suelen avanzar por una ruta simple: en cola, completado o fallido. Cuando un trabajo falla, los créditos a menudo se reembolsan automáticamente [3][10]. Eso importa en producción, porque los reintentos son parte del proceso, no un caso extremo.
En cuanto al tiempo de respuesta, las generaciones en 720p suelen terminar en 60 a 120 segundos. Para 1080p, espera más bien 90 a 180 segundos. El tiempo de cola suele ser de 15 a 30 segundos durante las horas fuera de pico, mientras que la latencia p95 en pico puede estirarse a unos 4 minutos [7]. Así que sí, puede funcionar bien en producción, pero solo si tu sistema está construido para manejar la finalización asíncrona de forma limpia.
En cuanto a precios, la tarifa Pro pone un clip de 5 segundos en $0.60 y un clip de 12 segundos en $1.44 [10]. En la práctica, la mayoría de los equipos deberían presupuestar 2 a 3 intentos por activo aprobado. Eso sitúa el coste final de un clip utilizable en el rango de $1.20 a $4.32, según la duración [10]. Si estás en modo de pruebas, viduq3-turbo cuesta alrededor de la mitad que Pro y tiene más sentido para la iteración rápida. Pro conviene reservarlo para los renders finales [10].
| Nivel de volumen | Vídeos mensuales | Duración media | Coste mensual base (USD) |
|---|---|---|---|
| Ligero | 50 | 12s | $72.00 |
| Medio | 200 | 12s | $288.00 |
| Pesado | 500 | 12s | $720.00 |
Estas cifras cubren solo la generación base. No incluyen reintentos. Si tu equipo espera múltiples pasadas - y la mayoría las espera - multiplica los totales por 2 a 3 para un presupuesto más cercano a la producción del día a día.
Casos de uso: vídeos de marketing, clips educativos y visuales de producto de comercio electrónico
Una vez que el coste y el tiempo de espera están claros, el siguiente paso es elegir el modo de entrada adecuado para el activo que necesitas entregar. La mejor opción se reduce sobre todo a una cosa: cuánto control visual ya tienes.
| Escenario | Tipo de entrada recomendado | Expectativas de salida | Notas operativas |
|---|---|---|---|
| Creatividades de marketing | Referencia a vídeo | Avatares o mascotas de marca consistentes entre clips | Pasa juntas las referencias de personaje y de fondo para consistencia visual. |
| Visuales de comercio electrónico | Imagen a vídeo | Apariencia de producto consistente | Empieza con una sola imagen de catálogo de alta calidad; la calidad de salida sigue al fotograma de entrada. |
| Clips educativos | Primer-último fotograma | Transiciones suaves entre estados | Proporciona una imagen inicial y una imagen final para guiar el movimiento. |
| Anuncios para redes sociales | Texto a vídeo | Clips verticales (9:16) o cuadrados (1:1) | Usa prompts cortos verticales o cuadrados para variantes de anuncios rápidas. |
Una forma sencilla de pensarlo:
- Si la consistencia de marca importa, usa Referencia a vídeo
- Si la imagen de origen ya se ve bien, usa Imagen a vídeo
- Si necesitas movimiento entre dos estados, usa Primer-último fotograma
- Si quieres muchas variantes de anuncios rápido, usa Texto a vídeo o considera MiniMax Hailuo 2.3 para salidas profesionales de alta consistencia.
Para equipos que intentan recortar tiempo de edición, el audio nativo es lo que más cambia el flujo de trabajo. El audio nativo elimina el trabajo separado de búsqueda y edición [8], lo que puede eliminar pasos extra de posproducción para equipos que quieren un clip terminado a partir de una sola pasada de generación. Ahí es donde el modelo se vuelve más útil: cuando el objetivo es acercarse a un activo listo para entregar sin pasar el archivo por una larga cadena de traspasos.
Conclusión: cómo decidir si Vidu MoE encaja en tu flujo de producción
Vidu MoE tiene sentido cuando necesitas clips cortos de hasta 12 a 16 segundos, varios modos de entrada y audio nativo en una configuración de API asíncrona. El parámetro seed puede ayudar a mantener trabajos repetidos avanzando en aproximadamente la misma dirección, pero no deberías esperar que entradas idénticas produzcan salidas que coincidan bit a bit [6][10]. Los trabajos fallidos también tienden a disparar reembolsos automáticos de créditos [3][10].
Esto encaja con equipos que producen vídeo de formato corto a escala, pueden esperar unos minutos por los resultados y tienen margen en el presupuesto para reintentos. Si eso suena como tu flujo de trabajo, APIMart te da una forma limpia de ejecutar creatividades de marketing, visuales de producto y contenido explicativo a través de una sola superficie de API.
Preguntas frecuentes
¿Qué modelo de Vidu MoE debería usar primero?
Para la mayoría de los desarrolladores, viduq3-turbo es el mejor lugar para empezar. Te da las velocidades de generación más rápidas, una fuerte relación precio-rendimiento y funciones avanzadas como sincronización audiovisual y cambio inteligente de escena.
Ve con viduq3-pro si quieres el conjunto de funciones más completo. Incluye generación de storyboard y la alineación audiovisual de mayor calidad. Ambos modelos admiten vídeos de 1 a 16 segundos y resoluciones de hasta 1080p.
¿Cómo debería manejar los trabajos de vídeo fallidos o retrasados?
Usa el ID de tarea en tu flujo asíncrono.
Para trabajos que tardan más, o bien sondea la API de estado de vez en cuando o establece una URL de callback para que te notifiquen cuando la tarea alcance un estado terminal.
Si un trabajo falla, comprueba el callback o la respuesta de estado para ver los detalles del error.
Para estabilidad en producción, usa retroceso exponencial al sondear para no toparte con límites de tasa.
Las tareas fuera de pico que se ejecutan más de 48 horas se cancelan automáticamente, y los puntos se reembolsan.
¿Qué modo de entrada ofrece más control?
La Generación Multifotograma te da el mayor control sobre cómo un vídeo se mueve de un momento al siguiente. En lugar de depender de un solo prompt o una configuración de dos fotogramas, puedes trazar una secuencia de hasta 9 fotogramas clave.
Ese control extra importa. Para cada transición, puedes añadir una imagen específica y un prompt personalizado, de modo que la historia visual siga el camino que quieres, fotograma a fotograma.
Para usarlo, envía tus imágenes y prompts al endpoint multifotograma en el array image_settings.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.