AI

Suno、音声生成機能「Speech」を公開ベータで提供開始

Sunoがスクリプトやプロンプトから話し声を生成する新機能「Speech」を公開ベータで提供開始。ナレーションとBGMを1トラックで生成できる。

Sunoは、スクリプトやプロンプトによる描写から話し声を生成する新機能「Speech」を公開ベータとして提供開始した。ウェブとモバイルの両プラットフォームで利用できる。

「Speech」はナレーションとBGMを1つのトラックとしてまとめて生成できるのが特徴だ。従来のように音声と音楽を別々に用意する必要はない。

モードはSimpleとAdvancedの2種類。Advancedではカスタムスクリプトのほか、声の性別、話し方のスタイル、バリエーションを調整できる。最大長は約8分とされている。

Sunoは、ユーザーのフィードバックをもとに機能を改善していくとしている。

音声生成をめぐる競争

テキスト読み上げの分野では、DeepMindが10年にわたり深層学習による音声合成を研究してきたほか、Adobeもテキスト読み上げツールを持つ。ElevenLabsは2023年の登場以降、最も知られたテキスト読み上げプラットフォームの1つとなっている。

Sunoの音楽生成ツールは、これまで多くの訴訟を引き起こしてきた。今回の音声生成機能の投入で、同社は音楽とナレーションの両方を含む音声制作の領域に踏み込むことになる。theverge.comが報じた。

よくある質問

Sunoの「Speech」はどこで使えますか?

Sunoのウェブとモバイルの両プラットフォームで、公開ベータとして利用できます。

「Speech」で音楽も一緒に作れますか?

はい。ナレーションとBGMを1つのトラックとしてまとめて生成できます。

生成できる音声の長さはどのくらいですか?

最大で約8分です。

出典