为什么重要

该测试集为印度英语和印地语语音识别提供了更细粒度的评估基准,有助于推动全球南方语言ASR技术的进步。

关键事实

事实 1

Monsoon 测试集包含 4,888 位说话人,且四个分割之间说话人不重叠。

来源与依据

单一来源

The four splits are speaker-disjoint, comprising 4,888 speakers

Hugging Face · 第一方证据 · 支持

查看 Hugging Face 原文

事实 2

印度英语公开集覆盖 30 个邦和联邦属地的 428 个原生区县。

来源与依据

单一来源

draws on 428 native districts across 30 states and union territories

Hugging Face · 第一方证据 · 支持

查看 Hugging Face 原文

事实 3

在公开的印度英语分割上,八个模型在排行榜的 WER 介于 4.81 到 4.99 之间。

来源与依据

单一来源

Eight models on the leaderboard land between 4.81 and 4.99 WER

Hugging Face · 第一方证据 · 支持

查看 Hugging Face 原文