ChatTTS 对比 VALL-E
在 ChatTTS 和 VALL-E 的对决中,哪个 AI Audio Generation 工具脱颖而出?我们比较评论、定价、替代品、赞成票、功能等等。
ChatTTS 和 VALL-E,哪一个更优?
当我们比较ChatTTS和VALL-E时,这两个都是AI驱动的audio generation工具, 用户已经明确表示了他们的偏好,ChatTTS在赞成票中领先。 ChatTTS已经获得了 6 个赞成票,而 VALL-E 已经获得了 5 个赞成票。
认为我们错了?投票并向我们展示谁才是老大!
ChatTTS

什么是 ChatTTS?
ChatTTS 是一个为对话而构建的开源文本到语音模型。2Noise 团队在超过 10 万小时的中文和英文语音数据上进行了训练,因此它在双向对话中听起来自然流畅,而不仅仅是预设的旁白。
其区别在于在细节层面进行韵律控制。该模型可以加入笑声、暂停和插入语,并能在一次会话中处理多个发声者。这使它非常适合用于大型语言模型助手、对话音频以及对话密集的多媒体内容。
开发者可以通过 pip 安装或克隆 GitHub 仓库。在 Hugging Face 上的开源版本是一个基于 4 万小时数据的基础模型,遵循 AGPLv3+ 协议。团队将其定位为研究和对话用途,若有路线图方面的问题,可以通过 [email protected] 联系。
VALL-E

什么是 VALL-E?
VALL-E 是微软研究院开发的文本转语音模型,能够从一段简短的音频片段克隆说话者的声音,并根据文本生成新的语音。它属于音频生成类别,因为它合成自然语音,而非编辑现有录音。项目页面提供了原始 VALL-E 模型及同一研究系列后续变体的示例音频。
大多数 TTS 系统直接回归连续波形或梅尔频谱图。VALL-E 则将语音视为基于神经音频编解码器离散编码的条件语言建模任务。微软使用约 60,000 小时的英语语音进行训练,远超典型 TTS 数据集。仅需一段 3 秒的未见说话者录音即可实现零样本合成,且模型能保持提示中存在的情感和环境音。
VALL-E 系列超越了首篇论文。VALL-E X 支持跨语言零样本 TTS,VALL-E R 增加了音素单调对齐以实现更稳定的语音生成,VALL-E 2 结合重复感知采样与分组编码建模,在 LibriSpeech 和 VCTK 基准测试中达到人类水平。相关系列如 MELLE、FELLE 和 PALLE 探索连续梅尔令牌及混合自回归加并行解码。
研究人员、语音工程师和好奇的听众使用 VALL-E 来体验大规模编解码器语言模型的能力,作为构建自身流程前的参考。公开示例为研究演示,不是可直接接入产品的托管 API,使用需另行许可和伦理审查。
ChatTTS 赞同数
VALL-E 赞同数
ChatTTS 顶级功能
将笑声、停顿和插话整合到合成语音中
通过一次推理调用运行多说话人对话
在超过100,000小时的中英文音频上训练
音频输出流式传输,实现实时播放
通过 pip 安装或从 Hugging Face 获取权重
VALL-E 顶级功能
从3秒注册音频提示中克隆未见过的说话人
预训练于约60000小时的英语语音数据
VALL-E 2在LibriSpeech和VCTK零样本基准测试中报告达到人类水平
保持说话人的情感和声学环境
VALL-E X将零样本合成扩展到跨语言场景
示例页面涵盖包括MELLE、FELLE和PALLE在内的七个模型系列
ChatTTS 类别
- Audio Generation
VALL-E 类别
- Audio Generation
ChatTTS 定价类型
- Free
VALL-E 定价类型
- Free
