The Open ASR Leaderboard Adds Its First Global South Language
TL;DR · AI 摘要
Hugging Face推出全球首个覆盖印度语的开放ASR评估基准,通过多维度数据设计解决语音识别模型的系统性偏差问题。
核心要点
- Monsoon评估集包含4,888名说话者,记录12个属性确保多样性
- 新基准设计覆盖地理/设备/声学环境等9个维度,提升评估全面性
- 印度语成为首个加入Open ASR Leaderboard的非欧洲语言
结构提纲
按章节快速跳转。
- §引言
介绍Open ASR Leaderboard在评估多样性方面的不足及改进需求。
现有测试集未记录说话者属性,导致种族/性别偏差不可见。
Monsoon en-IN和hi-IN覆盖九个维度,确保评估全面性。
通过400多个地区招募,使用真实设备和环境采集数据。
- ·技术影响
推动ASR模型开发向更公平的方向演进。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Open ASR Leaderboard新增全球南方语言
- 现有问题
- 未记录说话者属性
- 新评估集设计
- 九个维度覆盖
- 4,888说话者数据
- 技术影响
- 推动公平性改进
金句 / Highlights
值得收藏与分享的关键句。
现有测试集未记录说话者属性,导致偏差不可见。
Monsoon评估集包含4,888名说话者,12个属性记录。
设计覆盖地理/设备/声学环境等9个维度,提升评估全面性。
开放ASR排行榜新增首个全球南方语言
返回文章列表
[-1
]
[0
2026年8月28日发布
GitHub更新
点赞
52
[
- +46
Eric Bezzam
bezzam
关注
Shobhit Banga
Shobhitbanga
Manas Dhir
manasdhir04
Bhaskar Singh
bhaskarJT
Manmeet Kaur
manmeet-voicearena
Aaditya Pareek
pareek-voicearena
Walecha
Amritansh8675
Sagar Jain
sagarjain268380
Hanuman Sidh
hanuman44420
Vanshika Chhabra
vanshikachhabra-voicearena
Voice Arena与Hugging Face合作推出印地语和印度英语的开放ASR评估
基准测试决定了技术发展方向。在开放ASR排行榜上表现优异的模型会得到采用并持续优化,而排行榜未衡量的能力往往难以提升。近期排行榜的工作重点在于提升评估指标的可信度:
- 保留的私有数据集分割
- 通过基准适配分析量化模型是重复参考文本还是基于音频进行转录的程度
- 优化归一化器以确保正确预测/变体不会被惩罚
这些改进使单一指标(词错误率WER)更难被操控。它仍然是单一指标。大量研究表明,ASR错误率在不同用户群体间分布不均。自动语音识别中的种族差异发现商业系统对黑人说话者的识别效果约为白人说话者的两倍差,而《自动语音识别中的偏差量化》进一步发现了性别、年龄和口音的差异。这些差异在排行榜上无法体现,并非排行榜刻意隐藏,而是其测试集仅记录了说话内容,几乎不记录说话者身份信息。
为弥补这一缺陷,我们向开放ASR排行榜新增两个评估集:Monsoon en-IN和Monsoon hi-IN。印地语(全球超5亿人使用)成为首个登上目前仅涵盖欧洲语言的多语言榜单的印度语言。每个数据集包含公开分割(可用于自评)和保留的私有分割(用于限制基准特定优化)。四个分割相互独立,涵盖4888位说话者,每位说话者记录了12项属性信息。
数据集设计
测试集只能暴露其变量维度的失效模式。大多数基准测试基于随手可得的音频构建。Monsoon数据集则专门设计了九个变量维度:地理区域、年龄、性别、词汇量、设备类型、声学环境、语音类型、语速,以及同一音频存在多个有效转录文本的可能性。每个维度都可能导致整体WER平均正确但特定群体错误。
数据采集方法由此衍生:
- 地理分布通过覆盖数百个行政区而非在少数地点录制长时音频实现
- 设备和声学条件来自贡献者使用自己的手机和网络连接(室内外环境),而非在安静房间使用指定设备
- 词汇量、语音类型和语速通过日常话题提示获取,这些话题促使贡献者表达观点、产生分歧、进行叙述和回忆,从而自然出现专有名词、数字和即兴表达
- 年龄和性别按说话者记录并验证
- 多个有效转录文本是参考文本的属性而非音频属性,相关内容将在后续章节详细说明
数据集构成
Four splits, two languages, collected through one pipeline.
数据集
语言
持续时间
说话人数量
片段长度(均值 / 中位数)
性别比例
地区数量
州/联邦属地数量
设备型号
风格
转录方式
Monsoon en-IN public
印度英语
5.62 小时
1,444
9.6秒 / 10.4秒
50/50
428
24/6
556
自然对话、自发性
标准化、保留口误
Monsoon en-IN private
5.58 小时
1,405
45/55
420
560
Monsoon hi-IN public
印地语
1.33 小时
468
6.4秒 / 5.0秒
54/46
202
11/3
315
格子结构(接受正字法变体)
Monsoon hi-IN private
4.47 小时
1,571
6.6秒 / 5.3秒
55/45
295
12/3
582
数据来源于未经脚本的双通道自发对话,通过从单通道中分割片段,使每个片段仅包含一个说话人。除表格中列出的字段外,每个片段还记录了职业、教育程度、婚姻状况、收入区间、手机品牌、所在城市和在当前地区居住年数。
来自公共印度英语数据集的五个片段及其元数据:
29岁女性,来自特里普拉邦西特里普拉,学生,使用三星 SM-G781B。
32岁女性,来自中央邦萨特纳,失业,使用三星 SM-E146B。
22岁男性,来自比哈尔邦罗哈斯,学生,使用摩托罗拉 moto g54 5G。
27岁女性,来自特伦甘纳邦瓦朗加尔,失业,使用维沃 V2247。
57岁男性,来自本地治里,从事私营业务,使用小米 M2006C3LI。
英语数据集使用标准字符串引用,其中排行榜的标准化器会合并大部分拼写变体。印地语的拼写变体数量远多于英语,且没有标准化器能够解决,因为这些变体并非两种惯例之间的固定映射。因此,印地语数据集提供了格子结构:对于转录文本中的每个片段,都列出了被接受为正确的拼写方式。
说话人覆盖范围
Monsoon 数据集在小时数上较小,但在说话人数量上较大。这是其设计特点,也是其价值所在。
除上述字段外,说话人的集中度和多样性:
每位说话人的片段数量(均值)
1.61
1.56
1.46
1.48
仅含一个片段的说话人数量
261
994
956
924
每位说话人的音频时长(中位数)
8.34 秒
8.28 秒
12.36 秒
12.39 秒
前十大说话人占比
6.8%
3.1%
2.8%
2.9%
所在城市数量
289
814
641
584
设备制造商数量
18
25
23
20
以下三个特性表明,数据集的特性更多体现在差异性而非总量上。
- 无单一声音主导:前十大的贡献者仅占总时长的2.8%至6.8%,且超过一半的说话人仅出现一次。Monsoon上的结果是对数百种不同声音的平均表现,而非少数被长时间记录的说话人。通常,其他数据集会以相反方式构建,即通过少量说话人长时间录音来构建。
- 无单一地区或设备主导:印度英语公共数据集覆盖了30个州和联邦属地的428个原生地区;印地语数据集作为印地语带语言,集中度更高,但仍覆盖了202和295个地区。录音来自315至582种不同的设备型号,任何子集中都没有单一型号的占比超过2.1%。在标准化硬件上收集的语料库会过度拟合到单一麦克风响应;而本数据集则无法做到这一点。
- 印度英语并非一种口音:这是印度全国范围内使用的英语,而非某一地区的英语。六个区域均有体现:在公开数据集中,35%的语音片段由南部口音贡献,18%来自东部,18%来自中部,16%来自北部,11%来自西部。由此产生的口音差异被记录在元数据中,而非直接声明。
元数据字段
Monsoon 每个片段传输18列数据,其中12列为元数据,而大多数公开的ASR测试集通常包含标识符、转录文本和持续时间。人口统计数据字段完整或接近完整;贡献者已同意此类用途。
| 分组 | 字段 | |------|------| | 片段 | id, audio, audio_length_s, language | | 参考 | lattice(印地语)或 text(印度英语) | | 说话人 | speaker_id, gender, date_of_birth | | 背景 | occupation, educational_background, marital_status, income | | 地理 | native_district, native_state, current_city, years_spent_in_current_district | | 录音设备 | device_manufacturer, device_model |
两种语言具有不同的地理分布特征,且这种分布具有信息价值。印地语数据集集中在印地语带,其中北方邦约占说话人总数的40%,这与按人口抽样的印地语语料库应呈现的特征一致。印度英语数据集则分布更为均衡:没有任何一个州的占比超过13%,三分之一的说话人来自八大州以外地区。公开数据集与私有数据集在两个语言上均高度匹配。
印度各州的边界是根据语言划分的,因此区和州的信息携带真实的口音信号,这也是这些字段被公开而非汇总的原因。印度ASR领域已有多项大规模研究分析此类数据:区级错误率范围约4%至44%,代表性不足的地区远落后于印地语带和大都市,且按音频质量、语速、语句时长、性别、年龄和设备进行了细分。这些分析基于封闭测试基准。Monsoon 使同类分析在公开排行榜测试集上成为可能。
收集与质量控制
广泛的地理覆盖需要在数百个区县进行招募,而非从少数说话人那里获取更长的录音。这种规模的分布式招募会引入小型数据集不会遇到的失败模式:贡献者玩游戏、提交回放音频作为实时语音、以及粗心的标注。每种问题都通过明确的检查机制进行处理。
- 招募与录音:贡献者通过Voice Arena社区招募,这是一个覆盖全球数字平台,其影响力延伸至语音语料库极少涉及的农村和半城市地区。参与者通过点对点界面进行双通道录音,围绕指定的日常话题进行两人对话。贡献者使用自己的手机和网络连接。其中许多设备属于低端设备且网络带宽不稳定,因此这些条件保留在发布的音频中而非被过滤掉。潜在贡献者在获得录音权限前需完成语言能力筛查,并获得补偿且提供知情同意书,涵盖训练和分发的使用授权。针对每位说话人设置的时长上限根据语言的人口规模和地理分布进行校准,防止少数高产贡献者主导某种语言或地区;这些数据集中超过一半的说话人仅贡献了一个片段。
- 语音引导:在大规模获取自发性语音时面临独特挑战,因为贡献者倾向于在缺乏结构化引导时产生简短且稀疏的回应。因此,每场对话均以开放式叙事提示作为开端,并逐步揭示后续问题,涵盖旅行、医疗保健、农业、教育和数字服务等多个领域,引导对话向详细描述发展而不进行脚本化。候选话题由大型语言模型生成,随后由母语者语言学家进行审核和本地化处理。
- 质量控制:每段录音在转录前需通过一系列筛选检查。通过使用在30多种语言的人工标注数据上训练的语言识别模型,验证语音语言与指定语言是否匹配。说话人性别通过专用分类器与自报标签进行核对,该分类器作为对自报信息的补充而非替代。另一模型可区分真实自发对话与预录或回放音频。信噪比估计移除了无法辨识的录音,同时刻意保留自然环境背景噪声以维持真实场景下的语音声学真实感。通过这些检查的录音通过语音活动检测进行分段,在连续两秒静音或十五秒软性上限(在下一个检测到的静音处关闭)处分割。分段过程独立应用于每个通道,因此每个片段均为单人说话且单通道。随后所有片段均通过DNSMOS P.808检查。
- 转录:参考转录文本由人工完成。初始草稿由内部ASR模型生成,这些模型基于领域内数据进行训练,且这些数据未出现在任何公开排行榜上,因此没有系统在这些数据集上进行过评估,从而不会影响参考文本的评分。后续所有阶段均由母语语言学家在五级协议下完成,该协议严格分离劳动分工,每轮修正后均由不同标注员进行独立验证,确保没有语言学家审核自己的输出。语言学家首先根据音频信号逐段修正草稿;第二轮重新验证并标记剩余分歧。后续层级由新标注员重复此循环,逐步解决模糊的发音实现、语言切换边界、命名实体以及拼写变体的正字一致性。数字以文字形式书写,使转录文本与实际语音内容直接对应。最终层级仍被标记的片段在录入前需重新转录。整个过程中自动监控标注员行为,标记包含目标脚本外字符、不自然的字符或单词重复,以及编辑次数异常低或高的提交内容。
区域差异
以下是一个示例,基于公开的印度英语数据集运行,展示元数据使何种评估成为可能。这并非数据集存在的目的,而是说明一旦每个片段都带有说话者信息,哪些问题将变得可回答。
排行榜上的八款模型在该数据集上的词错误率(WER)介于4.81至4.99之间。最佳与最差模型之间相差0.18分,这在五小时内即可解决。按语料库排序时,它们是同一模型。
按地区分组说话者则呈现不同结论。每位说话者的母语地区被汇总到区域委员会(印度内政部对各邦的划分),形成五个样本充足的区域。openai/whisper-large-v3-turbo在不同区域间的差异达0.46分。mistralai/Voxtral-Mini-3B-2507在语料库中仅落后0.014分,但在不同区域间的差异达1.68分,在中央区域得分为4.38,而在东部区域则高达6.06。在排行榜上无法区分的两个系统,其准确性对说话者来源地的依赖程度差异接近四倍。
最难转录的区域也并非固定。ibm-granite/granite-speech-3.3-2b在北方表现最差,microsoft/VibeVoice-ASR-HF在南方表现最差,mistralai/Voxtral-Mini-3B-2507在东部表现最差。如果某个区域单纯更难转录,所有模型都会以相同方式对区域进行排序。但事实并非如此,这说明问题出在模型本身而非音频数据。
地区是记录的十二个属性之一,上述区域是428个行政区的粗略汇总。相同的分析也适用于年龄、教育程度、职业和手机类型,已发布的文件包含所有必要信息以复现分析。但测试集仅记录说话内容,这些信息在测试集中均不可用。
印地语的正字变体
正字法差异具有边界性。英式与美式拼写、标点、大小写、数字与单词的使用:规范化器可以将大部分差异映射为单一形式,排行榜也是如此。印地语则不具备这种边界性。日常口语中存在大量语言混合现象,源自英语的词汇没有固定的天城文拼写,复合词形式根据个人偏好可能连写或分写。一个短语可能有十种或更多有效书写形式,且无法通过固定映射进行统一,因为不存在权威的参照形式。
使用单一参考标准进行评分时,词错误率(WER)会奖励系统生成与标注者所选拼写一致的结果。两个音频识别效果相同的系统,仅因正字法差异就可能在评分上相差数分。
因此,印地语数据集附带了候选词格:针对转录文本的每个片段,列出了所有被接受为正确形式的书写形式。构建词格需要人工操作。候选变体从同一音频的多个ASR转录中提取,并通过语言模型扩展,随后由母语语言学家判断哪些形式适用于该语句并剔除其他形式,仅保留与实际发音一致的写法。
因此,我们报告由AI4Bharat引入的正字法信息词错误率(OIWER),而非传统WER。每个片段的假设需与被接受的集合对齐,因此任何被接受的形式均视为正确,仅对真正的识别错误进行计分。
为量化影响,相同假设被评分两次。将每个词格按片段折叠为首个变体,可生成类似传统基准测试提供的单一字符串参考;任何被接受的变体均可作为参考,不同选择将产生不同参考。以折叠后的参考进行评分时,所有系统的错误率均会上升,且上升幅度不一致。因此排名会发生变化。下图展示了两组系统在两种参考之间排名反转的情况:单一参考下系统因复现标注者的正字法而获得部分奖励,而词格评分仅针对识别准确性。
我们还开源了实现代码voi-oiwer,因此所有数据集上的结果均可直接复现。
获取评估结果
对于私有数据集划分,将你的模型上传至Open ASR Leaderboard,Hugging Face团队将运行评估。与之前相同,将模型添加至排行榜的流程在Open ASR Leaderboard GitHub上进行:
- 提交拉取请求,系统将显示模型检查表。与之前一样,你需要报告在公开数据集上的结果。
- 我们将验证公开数据集上的结果,并在私有数据集上计算指标。
- 确认我们获得的结果。
印度英语以"Voice Arena Monsoon"的名称加入主排行榜,在默认列集而非可选切换项中显示,因此对每个模型的平均WER headline产生贡献。私有划分与Appen和DataoceanAI数据一起构成"Private (conversational)"聚合列。公开和私有印地语数据出现在"Multilingual"标签页中,只有同时支持所有选定语言的模型才会被排名,使该列成为同类对比。另选"Language dataset breakdown"下拉菜单中的"Hindi"。
后续计划
印地语是这一普遍问题的一个典型案例。任何一种被不同方式书写、未被基准测试采样人群使用的语言,都会同时存在文中描述的两种失败情况。这些数据集并未解决这些问题,但它们提供了一种观察问题的方式:在领域内已关注的排行榜上使用测试集,保留每位说话人和每个参考文本的足够信息,使得两个系统之间的差异可以追溯到说话人身份和书写方式,而非消失在单一数字中。
这四个数据集属于季风计划,是Voice Arena为全球南方地区推出的更广泛的数据集倡议的一部分。
本文提到的模型 4
本文提到的数据集 2
本文提到的空间 1
本文提到的论文 2
更多来自我们博客的文章
音频
语音
基准测试
语音识别中的基准测试优化衡量
- +3
62
2026年8月21日
介绍Real World VoiceEQ:衡量语音AI的人类质量
- +9
33
2026年7月15日
社区
deleted
4天前
•
4天前编辑
未提供描述。
回复
编辑
通过拖拽到文本输入框、粘贴或
点击此处
上传图片、音频和视频。
轻点或粘贴此处上传图片
评论
· 注册或登录以发表评论
- +40