
Lyria 3.5 añade voces expresivas y canciones más largas
Descubre Lyria 3.5 en Google Flow Music, con voces expresivas, letras más claras, pistas de 184 segundos, prompts estructurados, acceso por API y límites del flujo de trabajo.
Si tuviera que resumirlo en una frase: Lyria 3.5 resulta especialmente útil cuando necesito un canto más claro, una mejor interpretación de las letras y canciones que mantengan la coherencia durante un máximo de 184 segundos.
Esta es la versión breve:
- Las voces parecen ser la principal actualización. Comprobaría el timbre, la emoción, el control de la respiración y si la voz se mantiene estable de principio a fin.
- Ahora la duración importa más. El modelo admite pistas de hasta 3 minutos y 4 segundos, así que probaría el desarrollo completo de la canción, no solo unos primeros 20 segundos impactantes.
- La estructura se dirige mediante el prompt. Etiquetas como
[Verse],[Chorus]y[Bridge], junto con marcas de tiempo, ayudan a dar forma a la canción. - La compatibilidad lingüística es amplia. La pronunciación está optimizada para 8 idiomas: inglés, alemán, español, francés, hindi, japonés, coreano y portugués.
- Los límites del flujo de trabajo están claros. No hay edición multivuelta, por lo que cada resultado se genera de una sola vez. Si quiero una versión mejor, vuelvo a ejecutar el prompt.
- Los mejores casos de uso son fáciles de identificar. Los anuncios necesitan estribillos claros, los juegos necesitan secciones repetibles estables, la educación requiere palabras comprensibles y los equipos creativos necesitan pasar rápidamente del borrador al resultado final.
Si estás decidiendo si usarlo, mantendría la prueba sencilla: ¿Las voces permanecen naturales? ¿La canción mantiene el rumbo durante 184 segundos? ¿Puede mi equipo usar el resultado sin una larga fase de limpieza?

Google DeepMind lanza Lyria 3.5 en Flow Music

Comparación rápida
| Modelo | Duración máxima | Uso principal | Control de estructura | Ideal para |
|---|---|---|---|---|
| Lyria 3 Clip | 30 segundos | Ideas musicales breves | Básico | Clips sociales, sintonías publicitarias, pruebas iniciales de prompts |
| Lyria 3.5 / Pro | 184 segundos | Resultados con duración de canción | Etiquetas de sección + marcas de tiempo | Anuncios, juegos, educación, pistas más largas para creadores |
Veo Lyria 3.5 menos como un conjunto de «funciones nuevas» y más como una respuesta a una pregunta sencilla: ¿ahorra tiempo cuando paso de demostraciones breves a pistas que puedo publicar o entregar?
Voces expresivas: qué ha cambiado y cómo evaluar la diferencia
Google DeepMind afirma que Lyria 3.5 mejora la musicalidad, las letras y la calidad vocal [1]. En la práctica, lo importante es más sencillo: qué puedes oír realmente y qué puedes comprobar por tu cuenta.
Realismo vocal, dinámica y fraseo emocional
Empieza escuchando la pista completa, no solo las primeras líneas. La prueba principal consiste en comprobar si la voz se mantiene natural de una frase a otra. Lyria 3.5 admite una interpretación más matizada, con estrofas susurradas, estribillos fluidos y armonías ligeras [1]. Estos detalles pueden hacer que una canción resulte expresiva en lugar de plana y mecánica.
Una buena forma de probarlo consiste en usar prompts directos de timbre como «breathy», «raspy», «airy» o «deep baritone» [4]. Después, escucha con atención. ¿Se mantiene esa textura vocal durante toda la canción? ¿Los finales de frase suenan naturales o parecen recortados y extraños? A continuación, prueba un arreglo más largo para comprobar si las mejoras vocales siguen presentes.
Pronunciación y claridad de las letras en las canciones generadas
En sintonías publicitarias y contenido de marca, la inteligibilidad de las letras no es opcional. Si el público no entiende las palabras, el mensaje se pierde. Lyria 3.5 pretende mejorar este aspecto con una separación clara entre la voz y los instrumentos, incluso en arreglos densos [1].
La pronunciación está optimizada para ocho idiomas: inglés, alemán, español, francés, hindi, japonés, coreano y portugués [5]. Si estás creando música para una campaña internacional, escribe el prompt en el idioma de destino.
Después, somételo a una prueba exigente. Usa una mezcla densa y comprueba si la voz sigue siendo inteligible de principio a fin. A continuación, amplía la canción hasta convertirla en una pista de varios minutos y vuelve a escucharla. No basta con que las palabras sean claras al principio; esa claridad debe mantenerse a medida que crece el arreglo.
Contexto más largo: cómo gestiona Lyria 3.5 la estructura de una canción
De clips breves a estructuras de canciones de varios minutos
El salto de un clip de 30 segundos a una pista de 3 minutos cambia algo más que la duración. Cambia toda la forma de la música.
Los clips breves suelen funcionar como bucles o avances de una sola sección. En cambio, Lyria 3.5 puede gestionar en una sola generación una estructura completa con introducción, estrofas, estribillos, puentes y cierre, hasta un máximo de 184 segundos [5]. Por tanto, la prueba principal no consiste únicamente en comprobar que el modelo pueda continuar, sino en saber si la canción sigue pareciendo planificada después de terminar la primera sección.
Google afirma que el modelo planifica la estructura de la canción antes de generar el audio, lo que ayuda a mantener la coherencia de las transiciones [2].
Puedes guiar esa estructura en el prompt con etiquetas de sección como [Verse], [Chorus], [Bridge], [Intro] y [Outro]. También puedes añadir marcas de tiempo entre corchetes, como [0:50 - 1:10] Chorus. Estas indicaciones ayudan a fijar los cambios de sección a lo largo de una pista completa.
| Modelo | Duración máxima aproximada | Gestión de secciones | Puntos fuertes de continuidad | Tipos de flujo de trabajo más adecuados |
|---|---|---|---|---|
| Lyria 3 Clip | 30 segundos [5] | Básica (bucles/vistas previas) | Iteración rápida, ritmo consistente a corto plazo | Clips para redes sociales, sintonías publicitarias, efectos de sonido de UI |
| Lyria 3.5 / Pro | 184 segundos (3 minutos) [5] | Avanzada (estrofa, estribillo, puente, cierre) | Razonamiento estructural, transiciones con marcas de tiempo, instrumentación estable | Producción de canciones completas, bandas sonoras de juegos, educación |
Lo siguiente que debes comprobar es sencillo: ¿se mantienen esas indicaciones estructurales cuando el arreglo comienza a evolucionar?
Cómo se manifiesta la continuidad en un resultado real
Una pista más larga no es automáticamente coherente. La prueba real consiste en saber si el modelo puede mantener estables el tempo y la tonalidad, recuperar motivos de forma lógica y pasar de una sección a otra sin parecer aleatorio.
Lyria 3.5 ayuda en este aspecto porque permite establecer el tempo y la tonalidad al principio. Así, una introducción de piano solo puede crecer hasta convertirse en un arreglo más amplio con cuerdas, manteniendo la misma idea melódica en lugar de desviarse hacia otra cosa a mitad de la canción.
Cuando uses Lyria 3.5 con un prompt estructurado que incluya etiquetas de sección, marcas de tiempo, tempo y tonalidad, presta atención a varios puntos concretos:
- ¿El arreglo se desarrolla de forma lógica?
- ¿Las transiciones encajan con limpieza?
- ¿La pista evita repeticiones que no has solicitado?
Un contexto más largo solo importa si los motivos, el tempo y las transiciones se mantienen estables durante toda la canción. Si la estructura permanece intacta, el modelo encaja en casos de producción que requieren audio de mayor duración.
Flujos de trabajo, herramientas y límites de integración
Casos de uso: publicidad, juegos, educación y producción para creadores
Cuando las voces y la estructura de la canción parecen estables, el siguiente paso es sencillo: ¿puede Lyria 3.5 adaptarse a la forma de trabajar de tu equipo? La respuesta depende mucho de la tarea. Los anuncios necesitan tiempos precisos, los juegos requieren continuidad, la educación necesita un discurso claro y los equipos creativos suelen tener que avanzar rápidamente.
Las sintonías publicitarias ponen a prueba especialmente la expresión vocal y la estructura. En un anuncio breve no hay espacio para un estribillo que llegue tarde o encaje de forma torpe. La prueba principal es comprobar que el estribillo aparezca con claridad dentro de la duración del anuncio.
Las bandas sonoras de juegos necesitan bucles fluidos y un tono estable durante periodos más largos. Si una sección se repite, no puede desviarse ni sonar diferente en la segunda o tercera reproducción. Una buena configuración del prompt ayuda. Fijar el BPM, la tonalidad y la lista de instrumentos facilita mantener la misma sensación entre distintas variaciones [6].
El audio educativo aprovecha especialmente la mejora de Lyria 3.5 en claridad vocal. En este caso, una dicción clara importa más que un arreglo elaborado. Si cuesta entender la letra, la lección deja de funcionar. Prueba primero la inteligibilidad y ocúpate después de la música que la acompaña.
Los flujos de trabajo para creadores de contenido social suelen valorar más la velocidad que el acabado. Un enfoque práctico es comenzar con borradores rápidos para probar el género y el ambiente, y pasar a una versión más larga y de mayor calidad cuando la idea ya esté definida [3][2].
Puntos de acceso actuales y lo que significan para tu equipo
Lyria 3.5 está disponible mediante Google Flow Music, la aplicación Gemini, YouTube Shorts a través de Dream Track, Google Vids y, para desarrolladores, mediante Google AI Studio y la Gemini API con la Interactions API [1][4][3].
Conviene señalar pronto una limitación: Lyria 3.5 no admite edición multivuelta. Cada resultado se genera de una sola vez a partir del primer prompt [3][2]. Por tanto, si un clip no cumple el objetivo, no puedes perfeccionar ese mismo clip paso a paso. Debes volver a escribir el prompt y generar uno nuevo.
Esto cambia la forma en que los equipos deben crear su canal de producción. En lugar de planificar un ciclo de edición de ida y vuelta, tiene más sentido generar varias variaciones de cada prompt y elegir la mejor. Se parece menos a editar una sesión en un DAW y más a grabar varias tomas para seleccionar después la adecuada.
Para el acceso por API, se recomienda la Interactions API en lugar del método estándar generateContent. Admite entradas multimodales, como texto y hasta 10 imágenes, y está diseñada para tareas de generación musical de mayor duración en entornos de producción [6][2].
Cómo encaja APIMart en canales de producción con varios modelos

En este punto, el diseño de integración importa tanto como el resultado del modelo.
La generación musical casi nunca es la única tarea de un flujo de producción. Un anuncio de 60 segundos puede necesitar al mismo tiempo un guion, una voz en off, elementos visuales y una pista musical que después se combinan. APIMart ofrece acceso a 500+ modelos de IA mediante una única API compatible con OpenAI. Así, los equipos pueden ejecutar Lyria 3.5 junto con tareas de lenguaje, imagen y vídeo sin mantener integraciones separadas [website].
Esto puede simplificar la facturación y reducir la fricción de cambiar entre herramientas. La prueba más directa consiste en saber si una sola API ahorra tiempo en el enrutamiento, la revisión y las entregas.
Conclusión: un marco práctico para evaluar Lyria 3.5
Lyria 3.5 se reduce a dos comprobaciones sencillas: si las voces suenan más naturales y emocionalmente expresivas, y si el contexto más largo produce música estable y coherente durante un máximo de 184 segundos. Si la respuesta es afirmativa, el siguiente paso es práctico: comprobar el ajuste al flujo de trabajo, el acceso y la gestión de exportaciones.
Para probar el timbre, usa prompts como «Airy Female Soprano», «Deep Male Baritone» o «Raspy Rocker» y evalúa después la claridad de las letras en los idiomas necesarios para tu proyecto [4][5].
Usa etiquetas de sección y marcas de tiempo para confirmar que la estructura se mantiene durante los 184 segundos completos [2]. Si falla en ese punto, el modelo no está preparado para producción. Una pista que cambia de ambiente o pierde el tempo a mitad de una ejecución completa de 184 segundos no está lista para producción, por muy sólidos que suenen los primeros 30 segundos.
Puntos clave para las pruebas internas
Prueba Lyria 3.5 en tres áreas:
- Voces: Es especialmente importante cuando la letra y la emoción transmiten el mensaje, como en anuncios, audio educativo y contenido narrativo para creadores.
- Continuidad: Es especialmente importante cuando una pista debe mantener la estructura sin desviarse, como en bandas sonoras de juegos, sintonías publicitarias y otros trabajos musicales de mayor duración.
- Adaptación al flujo de trabajo: Se reduce a tres comprobaciones prácticas: si necesitas acceso por API, si necesitas exportar MP3 o WAV y con qué facilidad entra el resultado en tu canal de medios.
Usa Lyria 3 Clip para perfeccionar los prompts antes de ejecutar una generación completa con Lyria 3.5 Pro.
Preguntas frecuentes
¿Cómo debo probar la calidad vocal?
Define características vocales claras en los prompts, como el género, la textura o el rango. Por ejemplo, puedes pedir una soprano femenina etérea o una voz de rock rasgada. Sigue ajustando esos detalles hasta que la voz coincida con el sonido deseado.
Conviene empezar primero con el modelo de vista previa más rápido. Así puedes probar distintos prompts vocales sin perder tiempo y pasar a composiciones completas cuando encuentres una voz adecuada.
¿Puede Lyria 3.5 crear canciones completas?
Sí. Lyria 3.5 puede generar canciones completas con el modelo Pro. Crea pistas de hasta 3 minutos con partes como estrofas, estribillos y puentes.
El modelo Clip está limitado a segmentos de 30 segundos. Pro ofrece más control sobre la duración y el desarrollo musical, tanto si lo guías con prompts de texto como con etiquetas estructurales.
¿Cuáles son los principales límites del flujo de trabajo?
Lyria 3.5 tiene algunos límites que conviene tener en cuenta:
- Solo admite generación de un único turno. No puedes seguir perfeccionando el mismo clip mediante una cadena de prompts de ida y vuelta.
- Obtienes un clip de audio por prompt, con una duración máxima de 184 segundos.
- Los filtros de seguridad bloquean las solicitudes de voces de artistas concretos o letras protegidas por derechos de autor.
También existe un límite de API: 10 solicitudes regionales de predicción en línea por minuto y por modelo base.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.