Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning
TL;DR · AI 摘要
Hugging Face 推出 Open TTS Leaderboard,通过客观指标解决 TTS 模型评估碎片化问题,评估时间从数周缩短至数小时。
核心要点
- Open TTS Leaderboard 使用 WER/CER、RTFx、TTFA、SIM 等指标,评估时间从数周缩短至数小时
- 现有 arena 评估方法因扩展性差导致开源模型代表性不足(仅 16/92 模型开放权重)
- 新框架不替代人工偏好排名,但可作为补充指标用于模型筛选
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Open TTS Leaderboard
- 解决现有评估问题
- Arena 方法局限性
- 开源模型代表性不足
- 评估指标体系
- 可理解性(WER/CER)
- 速度(RTFx/TTFA)
- 说话人相似度(SIM)
- 优势与局限
- 评估效率提升
- 无法衡量自然度等主观指标
金句 / Highlights
值得收藏与分享的关键句。
现有 arena 评估方法因扩展性差导致开源模型代表性不足(仅 16/92 模型开放权重)
Open TTS Leaderboard 使用 WER/CER、RTFx、TTFA、SIM 等指标,评估时间从数周缩短至数小时
新框架不替代人工偏好排名,但可作为补充指标用于模型筛选
Open TTS 排行榜:面向多语言文本到语音与语音克隆的可扩展评估
返回文章列表
[-1
]
[0
2026年9月30日发布
GitHub 上的更新
点赞
28
[
- +22
Eric Bezzam
bezzam
关注
Steven Zheng
Steveeeeeeen
Eustache Le Bihan
eustlb
mrfakename
[1
guest
TLDR 👉 专注于开源与多语言的新 TTS 排行榜
开源文本到语音(TTS)模型的发布速度令人惊叹。截至 2026 年 9 月 30 日,Hugging Face Hub 上已有超过 8,000 个 TTS 模型 🚀
然而,评估方法尚未跟上步伐:目前仍处于碎片化和非标准化状态。黄金标准是基于人类偏好的评分,如 MOS 或 MUSHRA(更多指标信息)。为此,几个基于竞技场的排行榜已成为社区的重要参考:
这些竞技场通过向用户展示两个模型的 TTS 输出,并要求他们选择其一进行比较。在收集足够投票后,会使用 Elo 评分(通常基于 Bradley–Terry 模型,参见 Voice Arena 方法论)对模型进行排名。
尽管人类偏好是最终决定因素,但竞技场无法扩展以匹配 TTS 发布的节奏。这可能部分解释了为什么开源模型在竞技场风格的排行榜中代表性不足:截至 2026 年 9 月 30 日,Artificial Analysis 上 92 个模型中仅有 16 个是开源权重,Voice Arena 上也存在类似偏差。这可能反映了实际因素:添加一个 API 模型只需一个 API 密钥,而开源模型需要由竞技场运营商托管和提供服务,商业提供商比开源作者更有动力寻求排名。竞技场式评估的另一个限制是投票者的一致性:没有任何竞技场能确保相同标准的投票者能随时间一致评估模型。即使单个人的偏好也会随时间变化(正如赫拉克利特所说:“人不能两次踏入同一条河流”)。
为此,我们推出了 Open TTS 排行榜,通过客观指标评估模型在性能不同方面的表现:
- 可理解性:使用 Qwen3 ASR(Open ASR 排行榜上排名第一的开源模型)计算提示与生成音频转录之间的词/字符错误率(WER 和 CER)。
- 速度:在 H200 GPU 上批量离线推理的实时因子倒数(RTFx),以及在 H200 GPU 和 CPU 上量化流式批量大小 1 延迟的时间到首个音频(TTFA)。
- 说话人相似性:通过计算生成音频与参考片段的 WavLM 说话人嵌入之间的余弦相似度(SIM)。
依赖客观指标评估模型,时间从数周(收集投票)缩短至数小时 ⚡
重要的是,Open TTS 排行榜不会取代人类偏好排名。基于 ASR 的 WER 为可理解性提供了一个代理指标,而说话人相似性估计了语音身份的保留程度。两者均无法直接衡量自然性、表现力或听众偏好。然而,它们甚至可以为基于投票的排行榜提供参考,告知其应包含哪些模型进行评估。
我们设计这个排行榜的初衷是让它由社区共同塑造;我们希望听到您的反馈,以确保评估结果始终保持相关性和洞察力。接下来的几个部分将概述 Open TTS 排行榜的主要功能。
多语言 + 语音克隆评估
从排行榜的默认视图来看,模型按照 Seed TTS Eval(论文)和 CV3 Eval(零样本)(论文)的英文数据集的宏平均 WER 进行排名。
在英文 WER 上,hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 表现最佳,而帕累托图则可视化了哪些模型在 WER、批量推理(RTFx)和模型大小之间取得了良好的平衡。
英文性能并不一定适用于其他语言。可以通过切换多种语言来根据多语言性能对模型进行排名。Seed TTS Eval 仅包含英文和中文的音频,因此其他语言的得分仅基于 CV3 Eval(零样本)的分数。请注意,中文、日文和韩文是基于字符的语言,因此报告的是字符错误率(CER),而“跨语言平均 WER”是各语言的宏平均值。
k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 是表现优异的多语言模型。
通过切换“语音克隆”选项,可以比较支持该功能(在所选语言中)的模型。
此外,表格中现在新增了 SIM 列(说话人相似度),并新增了两张帕累托图,用于可视化 SIM、批量推理和模型大小之间的权衡。
一些模型(如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2)在语音克隆(即提供参考音频时)的平均 WER 有所提升。
对 TTS 输出进行比较和投票
数字只能讲述部分故事,如前所述,人类偏好才是最终决定因素。通过“Listen”标签页,您可以比较生成输出背后的实际表现,从而找到您更偏好的模型!
选择您感兴趣的语言/数据集,选择是否比较语音克隆功能,并可选地选择特定模型或随机播放输出。
“Listen”标签页填补了现有 TTS 排行榜的重要空白:一个探索各种模型输出的交互空间。
您甚至可以对生成的输出进行反馈。随着我们收集到更多社区投票,这些数据可能会被纳入排行榜。所以请投票!但请注意,您需要使用 HF 账号登录,以帮助我们过滤掉垃圾信息和机器人。
流式传输性能
“Streaming”标签页比较流式传输能力。模型按照 TTFA(首次音频时间)进行排名,该指标量化了用户探测模型后需要等待多久才能获取可播放音频。这对于语音代理和其他交互式应用非常重要。
对于支持流式传输的模型(“Streaming API”下有✅标志),TTFA 是第一个音频块到达的时间。对于非流式传输模型,TTFA 是整个语音生成完成的时间,因为播放无法更早开始。每个模型依次处理一个音频(批量大小为 1),使用 CV3-Eval 中相同的 50 个英文提示,在相同硬件和默认语音下运行。我们丢弃前 3 次运行作为预热,并报告其余运行的中位数 TTFA。
默认视图比较的是 H200 GPU 上的性能。对于一小部分(但正在增长)模型,也提供了 CPU 上的测试结果!
kyutai/pocket-tts 是一款在 GPU 和 CPU 上都表现优异的流式传输模型!
结论
Open TTS 排行榜的目标不仅是跟上 TTS 模型发布的惊人速度,更重要的是由社区共同塑造;我们希望听到您的反馈,以确保评估始终保持相关性和洞察力。请告诉我们您希望看到哪些数据集、模型和指标!
目前,我们重点关注:
- 开源模型,以推动许多在竞技类评估中被忽视的优秀模型。
- 多语言支持,因为英语性能不能作为其他语言的合适替代指标。
我们很快将开源评估脚本,类似于 Open ASR 排行榜仓库,这样您可以通过 GitHub Issues 和 PRs 直接提供反馈和建议!让我们一起塑造 TTS 评估 🤗
本文提到的模型 10
本文提到的 Spaces 3
本文提到的论文 2
更多博客文章
音频
语音
排行榜
Open ASR 排行榜新增首个全球南方语言
- +6
60
2026年8月28日
基准测试
介绍 Real World VoiceEQ:衡量语音 AI 的人类质量
- +9
34
2026年7月15日
社区
EducitoEc
1天前
[2
非常有趣
回复
Nomad-link-id
很高兴这个排行榜将多语言 TTS 质量与语音克隆身份区分开,而不是合并成一个整体的绿色指标。
我持续关注的检查点:当固定语言/领域时排名是否仍然有效,与将克隆作为轴心时的排名是否一致。否则团队可能会优化更容易的子指标,但仍称结果为“SOTA TTS”。
查看翻译
eltonwilliams
约15小时前
英语性能不一定能转化为其他语言的表现。可以切换多种语言来根据多语言性能对模型进行排名。Seed TTS 评估仅包含英语和中文的电影音轨音频,因此其他语言的评分仅基于 CV3 评估(零样本)。请注意,中文、日文和韩文是基于字符的语言,因此报告的是字符错误率(CER),而各语言的“平均词错误率(WER)”是各语言的宏平均值。
Open TTS 排行榜是一个开放评估平台,旨在使多语言文本到语音和语音克隆模型更容易进行大规模比较。传统的 TTS 竞技场通常让用户聆听两个模型的输出并选择更喜欢的模型。这些投票可用于计算类似 Elo 的评分,通常通过 Bradley–Terry 模型等方法实现,为用户提供了一种简单的方式,根据人类偏好理解不同系统的性能。
人类反馈仍然是评估语音质量的重要组成部分,但仅依赖竞技场式投票可能具有挑战性,因为新 TTS 模型的发布速度非常快。开源模型还可能面临实际障碍,因为它们通常需要由评估平台托管和提供服务,而基于 API 的商业模型则更容易添加。这可能导致开源模型在公共排行榜上可见度较低。另一个挑战是一致性:人们的偏好和聆听标准可能会随时间变化,这意味着几个月前收集的投票可能并不总是代表完全相同的标准。
开放TTS排行榜旨在通过提供可扩展且透明的评估空间来应对这些挑战,用于评估多语言TTS和语音克隆系统。目标是使比较结果更易于复现、扩大开源模型的覆盖范围,并在人类偏好数据之外提供有用的评估信号。通过整合可扩展的测试和社区反馈,该项目可以帮助研究人员、开发者和用户更好地理解语音模型在不同语言、声音和使用场景中的表现。
编辑
预览
通过在文本输入框中拖拽、粘贴或点击此处上传图片、音频和视频。
轻点或粘贴此处以上传图片
评论
· 注册或登录以发表评论
- +16