AI

일레븐랩스, 90개 이상 언어 지원하는 v4 음성 모델 출시

일레븐랩스가 v4와 v4 터보를 공개했다. 10초 분량의 오디오로 음성을 복제할 수 있으며 지연 시간이 낮아져 음성 에이전트에 적합하다.

일레븐랩스가 90개 이상의 언어를 지원하는 두 가지 새로운 음성 모델인 일레븐랩스 v4와 v4 터보를 출시했다고 테크크런치가 보도했다.

새 모델은 표현 제어력을 높이고 음성 에이전트의 지연 시간을 낮췄다. v4 세대는 새로운 아키텍처를 적용해 제어와 음성 복제 속도를 개선했으며, 사용자는 10초 분량의 오디오만으로 음성을 복제할 수 있다. 모델은 긴 텍스트에서도 화자의 정체성을 더 잘 유지하고 문맥을 고려해 표현을 바꾼다.

일레븐랩스는 v3에서 인라인 태그를 도입했고, v4에서는 여러 태그를 중첩할 수 있도록 확장했다. 이전 버전이 70개 언어를 지원했던 것과 비교해 v4는 90개 언어를 지원하며, 일본어와 브라질 포르투갈어, 중국어(만다린), 광둥어에서 품질 향상 폭이 가장 컸다.

낮아진 지연 시간 덕분에 v4는 음성 에이전트에 적합하다. 기반 LLM이 답변을 생성하기 시작하자마자 오디오 생성을 시작할 수 있으며, 대립과 에스컬레이션, 대기 상황을 다르게 처리해 문제 해결에 도움을 준다.

경쟁사로는 카테시아, 딥그램, 피시아우디오, 보손, 웰세드랩스, 구글, 오픈AI 등이 있다. 일레븐랩스는 올해 초 세쿼이아로부터 5억 달러를 유치하며 기업가치 110억 달러를 인정받았다. 220억 달러 가치의 후속 투자 라운드에 대한 소문도 돌고 있다. 회사의 연간 환산 매출은 올해 초 약 3억 3,000만 달러에서 6억 달러 이상으로 증가했고, 직원은 800명을 넘는다.

마티 스타니셰프스키 CEO는 향후 몇 년 안에 IPO를 목표로 한다고 밝혔지만 구체적인 일정은 제시하지 않았다.

한눈에 보기

일레븐랩스 v4는 몇 개 언어를 지원하나?

90개 이상의 언어를 지원한다.

음성 복제에 필요한 오디오 길이는?

v4에서는 10초 분량의 오디오로 음성을 복제할 수 있다.

v4가 음성 에이전트에 적합한 이유는?

지연 시간이 낮아 기반 LLM이 답변을 생성하기 시작하자마자 오디오 생성을 시작할 수 있기 때문이다.

출처