人工智能

ElevenLabs发布v4与v4 Turbo语音模型,支持90种语言

ElevenLabs推出v4和v4 Turbo两款语音模型,支持90种语言、10秒克隆声音,并降低语音代理延迟。

语音人工智能公司ElevenLabs发布了名为ElevenLabs v4和v4 Turbo的两款新语音模型。据techcrunch.com报道,新模型在表达控制、语音代理延迟以及语言支持方面均有提升,支持超过90种语言,而上一代v3支持70种语言。

v4采用全新架构,能够实现更好的控制与更快的克隆。用户只需10秒音频即可克隆声音。该模型在较长文本中能更好地保持声音身份,并会结合上下文调整表达方式。ElevenLabs在v3中引入了内联标签,v4进一步扩展了这一功能,允许用户叠加多个标签。

ElevenLabs表示,质量提升最明显的语言是日语、巴西葡萄牙语、普通话和粤语。由于延迟更低,新模型适合用于语音代理,可以在底层大语言模型开始生成答案时就开始生成音频。该模型还能以不同方式处理对抗、升级和等待等场景,从而更好地解决问题。

ElevenLabs去年发布了v3模型,并在今年早些时候于华沙举行的一场活动上预告了v4模型。语音模型领域的竞争对手包括Cartesia、Deepgram、Fish Audio、Boson、WellSaid Labs、谷歌和OpenAI。

该公司今年早些时候从红杉资本融资5亿美元,估值达110亿美元。有传闻称后续融资轮可能使公司估值达到220亿美元。ElevenLabs的年化收入运行率已从今年年初的约3.3亿美元攀升至超过6亿美元。公司拥有800多名员工,并在印度、欧洲和巴西积极招聘。超过55%的业务来自大型企业。CEO Mati Staniszewski表示,公司目标是在未来几年内IPO,但没有承诺具体时间表。

快速问答

ElevenLabs v4支持多少种语言?

支持超过90种语言,上一代v3支持70种语言。

用v4克隆声音需要多少音频?

只需10秒音频即可克隆声音。

ElevenLabs v4适合用于什么场景?

由于延迟更低,适合用于语音代理,可在底层大语言模型开始生成答案时就开始生成音频。

来源