AI

ElevenLabs、音声モデルv4とv4 Turboを発表 90言語対応

ElevenLabsが新しい音声モデルv4とv4 Turboを発表。10秒の音声でクローン可能になり、対応言語は70から90に拡大。音声エージェント向けに低遅延化も実現した。

ElevenLabsは、新しい音声モデル「ElevenLabs v4」と「v4 Turbo」を発表した。表現の制御性向上、音声エージェント向けの低遅延化、90以上の言語対応が特徴となる。前バージョンのv3は昨年リリースされ、v4は今年初めにワルシャワで開催されたイベントで予告されていた。

v4世代は新しいアーキテクチャを採用し、制御性とクローン速度を高めた。ユーザーはわずか10秒の音声で声をクローンできる。長いテキストでも声の同一性を保ちやすくなり、文脈を踏まえて表現を変えられる。v3で導入したインラインタグはv4で拡張され、複数のタグを重ねて指定できる。

対応言語は前バージョンの70から90に増えた。品質の向上が最も大きかったのは日本語、ブラジルポルトガル語、北京語、広東語だという。低遅延化により、基盤となるLLMが回答を生成し始めた時点で音声生成を開始できるため、音声エージェントに適する。対立やエスカレーション、保留の状況を異なる形で処理し、問題解決を支援する。

ElevenLabsの事業の55%以上は大企業から得ている。同社は今年初めにSequoiaから5億ドルを調達し、企業価値は110億ドルとなった。続く調達ラウンドでは220億ドル評価との噂もある。年換算収益は年初の約3億3000万ドルから6億ドル超に増加。従業員は800人を超え、インド、欧州、ブラジルで積極的に採用している。

音声モデル市場ではCartesia、Deepgram、Fish Audio、Boson、WellSaid Labs、Google、OpenAIなどが競合する。CEOのMati Staniszewski氏は今後数年以内のIPOを目指すと述べたが、時期は明言しなかった。TechCrunchが報じた。

よくある質問

ElevenLabs v4は何秒の音声で声をクローンできますか?

10秒の音声でクローンできます。

ElevenLabs v4は何言語に対応していますか?

90以上の言語に対応しています。前バージョンは70言語でした。

ElevenLabsのCEOはIPOについて何と言っていますか?

Mati Staniszewski氏は今後数年以内のIPOを目指すと述べましたが、時期は明言していません。

出典