
Lyria 3.5が表現豊かなボーカルと長尺楽曲に対応
Google Flow MusicのLyria 3.5を詳しく解説します。表現豊かなボーカル、明瞭な歌詞、184秒の楽曲、構造化プロンプト、APIアクセス、ワークフロー上の制約を確認できます。
一言でまとめるなら、Lyria 3.5が最も役立つのは、より明瞭な歌声、優れた歌詞表現、そして最大_184秒_にわたって一貫性を保つ楽曲が必要なときです。
要点を短くまとめると、次のとおりです。
- ボーカルが主なアップデートに聞こえます。 音色、感情、息づかいの制御、そして歌手が最初から最後まで安定しているかを確認したいところです。
- 長さがこれまで以上に重要です。 このモデルは最大3分4秒のトラックに対応するため、最初の20秒のインパクトだけでなく、楽曲全体の流れをテストする必要があります。
- 構成はプロンプトで導きます。
[Verse]、[Chorus]、**[Bridge]**などのタグとタイムスタンプが、楽曲の形を整えるのに役立ちます。 - 幅広い言語に対応しています。 発音は8言語、英語、ドイツ語、スペイン語、フランス語、ヒンディー語、日本語、韓国語、ポルトガル語向けに調整されています。
- ワークフロー上の制約は明確です。 マルチターン編集には対応していないため、各結果は一回限りの生成です。より良いテイクが欲しければ、プロンプトを再実行します。
- 最適な用途も見分けやすいです。 広告には明瞭なフック、ゲームには安定した反復セクション、教育には聞き取りやすい言葉、クリエイターチームには下書きから完成までの速い流れが必要です。
採用を検討しているなら、テストはシンプルに保ちます。ボーカルは自然さを維持できるか。楽曲は184秒にわたって狙いどおり進むか。長い修正工程なしでチームが出力を使えるか。

Google DeepMindがFlow MusicでLyria 3.5を公開

クイック比較
| モデル | 最大長 | 主な用途 | 構成制御 | 最適な用途 |
|---|---|---|---|---|
| Lyria 3 Clip | 30秒 | 短い音楽アイデア | 基本 | ソーシャルクリップ、広告用ジングル、プロンプトのラフテスト |
| Lyria 3.5 / Pro | 184秒 | 楽曲サイズの出力 | セクションタグ+タイムスタンプ | 広告、ゲーム、教育、長尺のクリエイター向けトラック |
Lyria 3.5は「新機能」というより、一つの率直な問いで評価すべきだと考えます。短いデモから公開・納品できるトラックへ移行したとき、本当に時間を節約できるかという問いです。
表現豊かなボーカル:何が変わり、違いをどう判断するか
Google DeepMindによると、Lyria 3.5では音楽性、歌詞、ボーカル品質が向上しています[1]。実用上重要なのは、もっとシンプルです。実際に何が聞こえるのか、そして自分で何を確認できるのかです。
ボーカルのリアリティ、ダイナミクス、感情表現
最初の数行だけでなく、_トラック全体_を通して聴くことから始めましょう。重要なテストは、フレーズから次のフレーズへ移る間も声が自然さを保つかどうかです。Lyria 3.5は、息づかいのあるヴァース、滑らかなコーラス、軽いハーモニーなど、より繊細な表現に対応します[1]。こうした細部によって、楽曲は平板で機械的ではなく、表情豊かに感じられます。
テストには、**「breathy」「raspy」「airy」「deep baritone」**のように音色を直接指定するプロンプトが有効です[4]。そのうえで注意深く聴きます。その声質は楽曲全体で安定しているでしょうか。フレーズの終わりは自然に着地するでしょうか、それとも途切れたり不自然に感じたりするでしょうか。次に、より長いアレンジへ広げ、ボーカルの改善がそこでも維持されるか確認します。
生成楽曲における発音と歌詞の明瞭さ
広告用ジングルやブランドコンテンツでは、歌詞の聞き取りやすさは必須です。言葉を聞き取れなければ、メッセージは伝わりません。Lyria 3.5は、密度の高いアレンジでもボーカルを伴奏から明瞭に分離することで、この点の改善を目指しています[1]。
発音は八言語、英語、ドイツ語、スペイン語、フランス語、ヒンディー語、日本語、韓国語、ポルトガル語向けに最適化されています[5]。国際キャンペーン向けの音楽を作るなら、対象言語でプロンプトを書きましょう。
次にストレステストを行います。密度の高いミックスを使い、最初から最後までボーカルを聞き取れるか確認してください。その後、楽曲を数分のトラックに伸ばしてもう一度聴きます。重要なのは冒頭で言葉が明瞭かだけではなく、アレンジが発展してもその明瞭さが続くかどうかです。
長いコンテキスト:Lyria 3.5による楽曲サイズの構成処理
短いクリップから数分の楽曲構成へ
30秒のクリップから3分のトラックへの拡張は、単に長さが変わるだけではありません。音楽全体の形が変わります。
短いクリップは通常、ループや単一セクションのプレビューとして機能します。対してLyria 3.5は、イントロ、ヴァース、コーラス、ブリッジ、アウトロを含む完全な楽曲構成を、最大184秒の一回の生成で処理できます[5]。したがって主なテストは、モデルが単に生成を続けられるかではありません。最初のセクションが終わった後も、楽曲が計画されたものに感じられるかです。
Googleによると、このモデルは音声を生成する前に楽曲構成を計画し、それによって遷移の一貫性を保ちやすくしています[2]。
プロンプトでは、[Verse]、[Chorus]、[Bridge]、[Intro]、[Outro]などのセクションタグを使って構成を導けます。[0:50 - 1:10] Chorusのように、角括弧付きのタイムスタンプも追加できます。これらの指示は、トラック全体にわたってセクションの切り替わりを明確にするのに役立ちます。
| モデル | おおよその最大時間 | セクション処理 | 一貫性の強み | 最適なワークフロー |
|---|---|---|---|---|
| Lyria 3 Clip | 30秒 [5] | 基本(ループ/プレビュー) | 高速な反復、一貫した短期リズム | ソーシャルメディア用クリップ、広告用ジングル、UI効果音 |
| Lyria 3.5 / Pro | 184秒(3分)[5] | 高度(ヴァース、コーラス、ブリッジ、アウトロ) | 構造的推論、タイムスタンプ付き遷移、安定した楽器構成 | フル楽曲制作、ゲームサウンドトラック、教育 |
次に確認すべきことはシンプルです。アレンジが動き始めても、これらの構成指示が維持されるでしょうか。
実際の出力における一貫性とは
長いトラックだからといって、自動的に一貫性が生まれるわけではありません。本当のテストは、モデルがテンポとキーを安定させ、意味のある形でモチーフを再登場させ、ランダムに聞こえることなくセクション間を移動できるかです。
Lyria 3.5では、開始時にテンポとキーを設定できます。そのため、ソロピアノのイントロから弦楽器を加えた大きなアレンジへ成長させても、途中で別の方向へさまようことなく、同じメロディーのアイデアを維持できます。
Lyria 3.5へ切り替え、セクションタグ、タイムスタンプ、テンポ、キーを含む構造化プロンプトを使うときは、次の点を確認してください。
- アレンジは論理的に発展しているか。
- 遷移はきれいに決まっているか。
- 求めていない反復を避けられているか。
長いコンテキストに価値があるのは、楽曲全体でモチーフ、テンポ、遷移が安定している場合だけです。その構成が維持されれば、このモデルは長尺音声を必要とする本番用途に適しています。
ワークフロー、ツール、統合上の制約
用途:広告、ゲーム、教育、クリエイター制作
ボーカルと楽曲構成が安定していると感じられたら、次の問いはシンプルです。Lyria 3.5は、チームの既存の作業方法に合うでしょうか。 答えは用途によって大きく変わります。広告には厳密なタイミング、ゲームには一貫性、教育には明瞭な言葉が必要です。クリエイターチームは、何より速度を求めることもあります。
広告用ジングルでは、ボーカル表現と構成が最も厳しく試されます。短い広告には、フックの登場が遅れたり不自然に着地したりする余地がありません。主なテストは、広告尺の中でフックがきれいに決まるかどうかです。
ゲームサウンドトラックには、滑らかなループと長時間にわたる安定したトーンが必要です。セクションが繰り返される場合、二回目や三回目でずれたり違和感が出たりしてはいけません。適切なプロンプト設定が役立ちます。固定したBPM、キー、楽器リストを設定すると、複数のバリエーションでも同じ雰囲気を保ちやすくなります[6]。
教育用音声では、Lyria 3.5のボーカル明瞭度向上を最大限に活用できます。この用途では、凝ったアレンジより明瞭な発音が重要です。歌詞を理解しにくければ、レッスンは成立しません。まず聞き取りやすさをテストし、その後で周囲の音楽を検討してください。
ソーシャルコンテンツ向けのクリエイターワークフローでは、仕上がりより速度が重視されることがよくあります。実用的な方法は、高速な下書きでジャンルと雰囲気を試し、アイデアが固まってから、より長く高品質なバージョンへ移ることです[3][2]。
現在のアクセスポイントとチームへの意味
Lyria 3.5は、Google Flow Music、Geminiアプリ、Dream Track経由のYouTube Shorts、Google Vidsで利用できます。開発者は、Interactions APIを備えたGoogle AI StudioとGemini APIから利用できます[1][4][3]。
早い段階で押さえるべき制約が一つあります。Lyria 3.5はマルチターン編集に対応していません。各出力は最初のプロンプトから一回で生成されます[3][2]。そのためクリップが期待どおりでなくても、同じクリップを段階的に調整することはできません。もう一度プロンプトを入力し、新しいものを生成します。
これは、チームがパイプラインを構築する方法を変えます。往復型の編集ループを前提にする代わりに、各プロンプトから複数のバリエーションを生成し、最良の候補を選ぶ方が合理的です。DAWでセッションを編集するというより、複数のテイクを収録してから使えるものを選ぶ感覚に近いでしょう。
APIアクセスには、標準のgenerateContentメソッドではなくInteractions APIが推奨されます。テキストと最大10枚の画像を含むマルチモーダル入力に対応し、本番環境で長時間実行される音楽生成ジョブ向けに構築されています[6][2]。
マルチモデル制作パイプラインにおけるAPIMartの役割

この段階では、統合設計がモデル出力と同じくらい重要になります。
制作ワークフローで、音楽生成だけが唯一の作業になることはほとんどありません。60秒の広告には、台本、ナレーション、映像、音楽トラックが必要になり、それらを同時に進めて後から結合することがあります。APIMartは、単一のOpenAI互換APIを通じて500+のAIモデルへアクセスできるため、別々の統合をいくつも管理せずに、Lyria 3.5を言語、画像、動画のタスクと並行して利用できます[website]。
これにより請求を簡素化し、ツール切り替えの負担を減らせる可能性があります。率直な確認ポイントは、一つのAPIでルーティング、レビュー、引き継ぎの時間を節約できるかどうかです。
まとめ:Lyria 3.5を評価する実践的な枠組み
Lyria 3.5の評価は、二つのシンプルな確認に集約されます。ボーカルはより生き生きと感情豊かに聞こえるか、そして長いコンテキストによって、最大184秒にわたり安定して一貫した音楽を作れるかです。答えが「はい」なら、次は実務面として、ワークフローとの適合性、アクセス、エクスポート処理を確認します。
音色テストでは、「Airy Female Soprano」「Deep Male Baritone」「Raspy Rocker」などのプロンプトを試し、プロジェクトで必要な言語の歌詞が明瞭か確認してください[4][5]。
セクションタグとタイムスタンプを使い、184秒の全体にわたって構成が維持されるか確認します[2]。そこで崩れるなら、このモデルは本番投入の準備ができていません。最初の30秒がどれほど優れていても、184秒の途中でムードが漂流したりテンポが外れたりするトラックは、本番に対応できません。
社内テストで押さえるべき要点
Lyria 3.5は、三つの領域でテストしてください。
- ボーカル:広告、教育用音声、物語主導のクリエイターコンテンツなど、歌詞と感情が中心となる用途で特に重要です。
- 一貫性:ゲームサウンドトラック、広告用ジングル、その他の長尺音楽など、トラックが迷走せず構成を維持する必要がある用途で特に重要です。
- ワークフロー適合性:APIアクセスが必要か、MP3またはWAVのエクスポートが必要か、出力をメディアパイプラインへどれだけスムーズに組み込めるかという、三つの実務的な確認に集約されます。
Lyria 3.5 Proでフル生成を実行する前に、Lyria 3 Clipでプロンプトを調整しましょう。
よくある質問
ボーカル品質はどのようにテストすべきですか?
性別、質感、音域など、明確なボーカル特性をプロンプトで指定します。たとえば、_airy female soprano_や_raspy rocker_を求めることができます。その後、希望するサウンドにボーカルが合うまで、細部を調整し続けます。
まず高速なプレビューモデルから始めるのが賢明です。時間を無駄にせず異なるボーカルプロンプトを試せるため、合う声を見つけてからフルサイズの楽曲制作へ進めます。
Lyria 3.5はフル楽曲を作れますか?
はい。Lyria 3.5はProモデルでフルサイズの楽曲を生成できます。ヴァース、コーラス、ブリッジなどのパートを持つ、最大3分の完全なトラックを作成できます。
Clipモデルは30秒のセグメントに制限されます。テキストプロンプトと構成タグのどちらで指示する場合でも、Proなら楽曲の長さと音楽的な流れをより細かく制御できます。
主なワークフロー上の制約は何ですか?
Lyria 3.5には、計画に含めるべきワークフロー上の制約がいくつかあります。
- シングルターン生成のみです。つまり、往復するプロンプトチェーンで同じクリップを繰り返し調整することはできません。
- 一つのプロンプトにつき一つの音声クリップが生成され、最大長は184秒です。
- 安全フィルターにより、特定アーティストの声や著作権で保護された歌詞を求めるリクエストはブロックされます。
APIの上限も考慮してください。ベースモデルごとに、一分当たり10件のリージョナルオンライン予測リクエストです。
モデルマーケットで使いたいモデルを選ぶ
APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。