Datasets
Dataset
common_voice
by legacy-datasets
Common Voice is Mozilla's initiative to help teach machines how real people speak. The dataset currently consists of 7,335 validated hours of speech in 60 languages, but we’re always adding more voices and languages.
CC0-1.0automatic-speech-recognition 41451 148100K < n < 1M rows
published 2 Mar 2022
Preview
Not supported: dataset viewer is disabled in legacy-datasets/common_voice configuration.
Cite this
CC0-1.0Cite
Tags
task_categories:automatic-speech-recognitionannotations_creators:crowdsourcedlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:extended|common_voicelanguage:ablanguage:arlanguage:aslanguage:brlanguage:calanguage:cnhlanguage:cslanguage:cvlanguage:cylanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:galanguage:hilanguage:hsblanguage:hulanguage:ialanguage:idlanguage:itlanguage:jalanguage:kalanguage:kablanguage:kylanguage:lglanguage:ltlanguage:lv