Datasets

Dataset

common_voice

by legacy-datasets

Common Voice is Mozilla's initiative to help teach machines how real people speak. The dataset currently consists of 7,335 validated hours of speech in 60 languages, but we’re always adding more voices and languages.

CC0-1.0automatic-speech-recognition 41451 148100K < n < 1M rows

published 2 Mar 2022

Preview

Not supported: dataset viewer is disabled in legacy-datasets/common_voice configuration.

Cite this

CC0-1.0Cite

Tags

task_categories:automatic-speech-recognitionannotations_creators:crowdsourcedlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:extended|common_voicelanguage:ablanguage:arlanguage:aslanguage:brlanguage:calanguage:cnhlanguage:cslanguage:cvlanguage:cylanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:galanguage:hilanguage:hsblanguage:hulanguage:ialanguage:idlanguage:itlanguage:jalanguage:kalanguage:kablanguage:kylanguage:lglanguage:ltlanguage:lv