Research · Products and Tools
Monsoon en-IN 与 hi-IN:为 Open ASR 排行榜引入按说话人与拼写差异评估的测试集
Hugging Face发布Monsoon测试集,包含4,888位说话人且分割间不重叠,覆盖印度30个邦的428个区县,用于Open ASR排行榜评估,八个模型WER在4.81-4.99之间。
阅读 Hugging Face 原文为什么重要
该测试集为印度英语和印地语语音识别提供了更细粒度的评估基准,有助于推动全球南方语言ASR技术的进步。
关键事实
事实 1
Monsoon 测试集包含 4,888 位说话人,且四个分割之间说话人不重叠。
来源与依据
The four splits are speaker-disjoint, comprising 4,888 speakers
事实 2
印度英语公开集覆盖 30 个邦和联邦属地的 428 个原生区县。
来源与依据
draws on 428 native districts across 30 states and union territories
事实 3
在公开的印度英语分割上,八个模型在排行榜的 WER 介于 4.81 到 4.99 之间。
来源与依据
Eight models on the leaderboard land between 4.81 and 4.99 WER