
Lyria 3.5 ajoute des voix expressives et des chansons plus longues
Découvrez Lyria 3.5 dans Google Flow Music, avec ses voix expressives, ses paroles plus claires, ses pistes de 184 secondes, ses prompts structurés et ses limites.
En une phrase, Lyria 3.5 semble surtout utile lorsque j’ai besoin d’un chant plus clair, d’une meilleure interprétation des paroles et de chansons qui restent cohérentes pendant jusqu’à 184 secondes.
Voici la version courte :
- Les voix semblent être la principale nouveauté. Je vérifierais le timbre, l’émotion, la maîtrise du souffle et la stabilité du chanteur du début à la fin.
- La durée compte davantage désormais. Le modèle peut gérer des pistes allant jusqu’à 3 minutes et 4 secondes ; je testerais donc le déroulement complet de la chanson, et pas seulement l’impact des 20 premières secondes.
- La structure est guidée par le prompt. Des balises comme
[Verse],[Chorus]et[Bridge], associées à des horodatages, aident à façonner la chanson. - La prise en charge linguistique est étendue. La prononciation est optimisée pour 8 langues : anglais, allemand, espagnol, français, hindi, japonais, coréen et portugais.
- Les limites du workflow sont claires. Il n’existe aucune édition multi-tour : chaque résultat est généré en une seule fois. Pour obtenir une meilleure prise, il faut relancer le prompt.
- Les meilleurs cas d’usage sont faciles à identifier. Les publicités exigent des accroches nettes, les jeux des sections répétées stables, l’éducation des paroles intelligibles et les équipes créatives un passage rapide du brouillon au résultat final.
Si vous envisagez de l’utiliser, je garderais le test simple : les voix restent-elles naturelles ? La chanson reste-t-elle cohérente pendant 184 secondes ? Mon équipe peut-elle exploiter le résultat sans une longue phase de nettoyage ?

Google DeepMind lance Lyria 3.5 dans Flow Music

Comparaison rapide
| Modèle | Durée maximale | Usage principal | Contrôle de la structure | Idéal pour |
|---|---|---|---|---|
| Lyria 3 Clip | 30 secondes | Idées musicales courtes | Basique | Clips sociaux, jingles publicitaires, premiers tests de prompts |
| Lyria 3.5 / Pro | 184 secondes | Sorties de la durée d’une chanson | Balises de section + horodatages | Publicités, jeux, éducation, pistes créatives plus longues |
À mes yeux, Lyria 3.5 pose moins la question des « nouvelles fonctionnalités » qu’une question très simple : fait-il gagner du temps lorsque je passe de courtes démos à des pistes que je peux publier ou livrer ?
Voix expressives : ce qui change et comment évaluer la différence
Google DeepMind indique que Lyria 3.5 améliore la musicalité, les paroles et la qualité vocale [1]. Dans la pratique, l’essentiel est plus simple : qu’entendez-vous réellement, et que pouvez-vous vérifier par vous-même ?
Réalisme vocal, dynamique et phrasé émotionnel
Commencez par écouter la piste dans son intégralité, et pas seulement les premières lignes. Le test essentiel consiste à déterminer si la voix reste naturelle d’une phrase à l’autre. Lyria 3.5 prend en charge une interprétation plus nuancée, avec notamment des couplets soufflés, des refrains fluides et de légères harmonies [1]. Ces détails peuvent donner à une chanson une véritable expressivité, au lieu d’un rendu plat et mécanique.
Une bonne méthode consiste à utiliser des prompts de timbre directs comme « breathy », « raspy », « airy » ou « deep baritone » [4]. Écoutez ensuite attentivement. Cette texture vocale reste-t-elle stable pendant toute la chanson ? Les fins de phrase tombent-elles naturellement, ou paraissent-elles coupées ou étranges ? Poussez ensuite le test avec un arrangement plus long afin de vérifier si les progrès vocaux se maintiennent.
Prononciation et clarté des paroles dans les chansons générées
Pour les jingles publicitaires et les contenus de marque, l’intelligibilité des paroles n’est pas facultative. Si le public ne comprend pas les mots, le message se perd. Lyria 3.5 cherche à améliorer ce point grâce à une séparation claire entre la voix et l’instrumental, même dans des arrangements denses [1].
La prononciation est optimisée pour huit langues : anglais, allemand, espagnol, français, hindi, japonais, coréen et portugais [5]. Si vous créez de la musique pour une campagne internationale, rédigez le prompt dans la langue cible.
Soumettez ensuite le modèle à un test exigeant. Utilisez un mixage dense et vérifiez si la voix reste intelligible du début à la fin. Prolongez ensuite la chanson sur plusieurs minutes et réécoutez-la. Il ne s’agit pas seulement de savoir si les mots sont clairs au début, mais si cette clarté perdure à mesure que l’arrangement s’enrichit.
Contexte étendu : comment Lyria 3.5 gère la structure d’une chanson complète
Des clips courts aux chansons de plusieurs minutes
Le passage d’un clip de 30 secondes à une piste de 3 minutes ne change pas seulement la durée. Il transforme toute la forme musicale.
Les clips courts fonctionnent généralement comme des boucles ou des aperçus limités à une section. À l’inverse, Lyria 3.5 peut gérer une structure complète — intros, couplets, refrains, ponts et outros — en une seule génération allant jusqu’à 184 secondes [5]. Le principal test ne consiste donc pas uniquement à voir si le modèle peut continuer. Il faut vérifier si la chanson semble toujours planifiée une fois la première section terminée.
Google explique que le modèle planifie la structure de la chanson avant de générer l’audio, ce qui contribue à préserver la cohérence des transitions [2].
Vous pouvez guider cette structure dans le prompt avec des balises de section comme [Verse], [Chorus], [Bridge], [Intro] et [Outro]. Vous pouvez également ajouter des horodatages entre crochets, par exemple [0:50 - 1:10] Chorus. Ces indications aident à définir précisément les changements de section sur l’ensemble de la piste.
| Modèle | Durée maximale approximative | Gestion des sections | Points forts de la continuité | Workflows les plus adaptés |
|---|---|---|---|---|
| Lyria 3 Clip | 30 secondes [5] | Basique (boucles/aperçus) | Itération rapide, rythme cohérent à court terme | Clips pour les réseaux sociaux, jingles publicitaires, effets sonores d’interface |
| Lyria 3.5 / Pro | 184 secondes (3 min) [5] | Avancée (couplet, refrain, pont, outro) | Raisonnement structurel, transitions horodatées, instrumentation stable | Production de chansons complètes, bandes-son de jeux, éducation |
La question suivante est simple : ces indications structurelles tiennent-elles encore lorsque l’arrangement commence à évoluer ?
À quoi ressemble la continuité dans une sortie réelle
Une piste plus longue n’est pas automatiquement cohérente. Le véritable test consiste à vérifier si le modèle maintient le tempo et la tonalité, réintroduit les motifs de manière logique et passe d’une section à l’autre sans donner une impression aléatoire.
Lyria 3.5 permet de définir le tempo et la tonalité dès le départ. Une introduction au piano solo peut ainsi évoluer vers un arrangement plus ample avec des cordes tout en conservant la même idée mélodique, au lieu de partir dans une autre direction à mi-parcours.
Lorsque vous passez à Lyria 3.5 et utilisez un prompt structuré — avec balises de section, horodatages, tempo et tonalité — écoutez quelques éléments précis :
- L’arrangement se développe-t-il de manière logique ?
- Les transitions sont-elles propres ?
- La piste évite-t-elle les répétitions non demandées ?
Un contexte plus long n’a d’intérêt que si les motifs, le tempo et les transitions restent stables pendant toute la chanson. Si cette structure tient, le modèle convient aux usages de production qui nécessitent un format audio plus long.
Workflows, outils et contraintes d’intégration
Cas d’usage : publicité, jeux, éducation et production créative
Une fois les voix et la structure stabilisées, l’étape suivante est simple : Lyria 3.5 s’intègre-t-il à la manière dont votre équipe travaille déjà ? La réponse dépend fortement du besoin. Les publicités exigent un timing précis, les jeux de la continuité, l’éducation une diction claire, tandis que les équipes créatives cherchent souvent avant tout à avancer vite.
Les jingles publicitaires sollicitent le plus fortement l’expression vocale et la structure. Dans un spot court, une accroche qui arrive tard ou tombe maladroitement n’a aucune place. Le test principal consiste à vérifier si l’accroche fonctionne parfaitement dans la durée de la publicité.
Les bandes-son de jeux nécessitent des boucles fluides et une tonalité stable sur de longues périodes. Lorsqu’une section se répète, elle ne doit ni dériver ni sembler incorrecte au deuxième ou au troisième passage. Un bon réglage du prompt aide ici. La définition d’un BPM, d’une tonalité et d’une liste d’instruments fixes facilite la conservation de la même ambiance dans plusieurs variantes [6].
L’audio éducatif profite au maximum des progrès de Lyria 3.5 en matière de clarté vocale. Ici, une diction nette compte davantage qu’un arrangement sophistiqué. Si les paroles sont difficiles à comprendre, la leçon ne fonctionne plus. Testez d’abord l’intelligibilité, puis occupez-vous de la musique qui l’accompagne.
Les workflows de créateurs destinés aux réseaux sociaux privilégient souvent la vitesse plutôt que la finition. Une méthode pratique consiste à commencer par des brouillons rapides pour tester le genre et l’ambiance, puis à passer à une version plus longue et de meilleure qualité une fois l’idée validée [3][2].
Points d’accès actuels et conséquences pour votre équipe
Lyria 3.5 est disponible dans Google Flow Music, l’application Gemini, YouTube Shorts via Dream Track, ainsi que Google Vids. Les développeurs peuvent y accéder depuis Google AI Studio et la Gemini API avec l’Interactions API [1][4][3].
Une limite mérite d’être signalée rapidement : Lyria 3.5 ne prend pas en charge l’édition multi-tour. Chaque sortie est générée en une seule fois à partir du premier prompt [3][2]. Si le clip ne convient pas, vous ne pouvez donc pas affiner progressivement ce même clip. Il faut saisir un nouveau prompt et générer une nouvelle version.
Cette contrainte change la manière dont les équipes doivent construire leur pipeline. Au lieu de prévoir une boucle d’édition par échanges successifs, il est plus logique de générer plusieurs variantes pour chaque prompt, puis de choisir la meilleure. L’expérience ressemble moins à l’édition d’une session dans une station audionumérique qu’à l’enregistrement de plusieurs prises avant de sélectionner celle qui fonctionne.
Pour l’accès par API, l’Interactions API est recommandée à la place de la méthode standard generateContent. Elle prend en charge les entrées multimodales, notamment du texte et jusqu’à 10 images, et elle est conçue pour les tâches de génération musicale longues dans les environnements de production [6][2].
La place d’APIMart dans les pipelines de production multimodèles

À ce stade, la conception de l’intégration devient aussi importante que la sortie du modèle.
La génération musicale est rarement la seule tâche d’un workflow de production. Une publicité de 60 secondes peut nécessiter un script, une voix off, des visuels et une piste musicale, tous produits en parallèle puis assemblés. APIMart donne accès à plus de 500+ modèles d’IA via une API unique compatible avec OpenAI, ce qui permet aux équipes d’exécuter Lyria 3.5 aux côtés de tâches de langage, d’image et de vidéo sans multiplier les intégrations [website].
Cette approche peut simplifier la facturation et réduire les frictions liées au changement d’outil. Le test concret consiste à déterminer si une seule API fait gagner du temps sur le routage, la validation et les transmissions entre équipes.
Conclusion : un cadre pratique pour évaluer Lyria 3.5
L’évaluation de Lyria 3.5 repose sur deux questions simples : les voix paraissent-elles plus réalistes et plus expressives, et le contexte étendu produit-il une musique stable et cohérente pendant jusqu’à 184 secondes ? Si la réponse est positive, l’étape suivante consiste à vérifier l’adéquation au workflow, les modalités d’accès et la gestion des exports.
Pour tester le timbre, essayez des prompts comme « Airy Female Soprano », « Deep Male Baritone » ou « Raspy Rocker », puis vérifiez la clarté des paroles dans les langues nécessaires à votre projet [4][5].
Utilisez les balises de section et les horodatages pour confirmer que la structure tient pendant les 184 secondes complètes [2]. Si elle se désagrège, le modèle n’est pas prêt pour la production. Une piste qui change d’ambiance ou perd son tempo au milieu d’une exécution de 184 secondes n’est pas exploitable en production, même si ses 30 premières secondes sont excellentes.
Points clés à intégrer aux tests internes
Testez Lyria 3.5 dans trois domaines :
- Voix : ce point compte surtout lorsque les paroles et l’émotion portent l’essentiel du contenu, comme dans les publicités, l’audio éducatif et les créations narratives.
- Continuité : ce point compte surtout lorsqu’une piste doit conserver sa structure sans dériver, comme dans les bandes-son de jeux, les jingles publicitaires et les autres formats musicaux longs.
- Adéquation au workflow : elle repose sur trois vérifications pratiques — avez-vous besoin d’un accès API, d’un export MP3 ou WAV, et la sortie s’insère-t-elle proprement dans votre pipeline multimédia ?
Utilisez Lyria 3 Clip pour affiner les prompts avant de lancer une génération complète avec Lyria 3.5 Pro.
FAQ
Comment tester la qualité vocale ?
Définissez des caractéristiques vocales claires dans vos prompts, comme le genre, la texture ou l’étendue. Vous pouvez par exemple demander an airy female soprano ou a raspy rocker. Affinez ensuite ces détails jusqu’à ce que les voix correspondent au son recherché.
Il est judicieux de commencer par le modèle d’aperçu plus rapide. Vous pouvez ainsi tester différents prompts vocaux sans perdre de temps, puis passer à des compositions complètes une fois la voix adaptée trouvée.
Lyria 3.5 peut-il créer des chansons complètes ?
Oui. Lyria 3.5 peut générer des chansons complètes avec le modèle Pro. Il peut créer des pistes allant jusqu’à 3 minutes, avec des parties comme des couplets, des refrains et des ponts.
Le modèle Clip est limité à des segments de 30 secondes. Pro offre davantage de contrôle sur la durée et le déroulement musical, que vous le guidiez avec des prompts textuels ou des balises structurelles.
Quelles sont les principales limites du workflow ?
Lyria 3.5 présente plusieurs limites de workflow à prendre en compte :
- Génération en un seul tour uniquement. Vous ne pouvez donc pas continuer à affiner le même clip dans une chaîne de prompts successifs.
- Vous obtenez un clip audio par prompt, d’une durée maximale de 184 secondes.
- Les filtres de sécurité bloquent les demandes portant sur la voix d’artistes précis ou des paroles protégées par le droit d’auteur.
L’API impose également une limite : 10 requêtes de prédiction en ligne régionales par minute et par modèle de base.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.