Datasets
Dataset
oscar-mini
by nthngdy
The Open Super-large Crawled ALMAnaCH coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the goclassy architecture.
CC0-1.0text-generation 1126 6
published 9 Mar 2022
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary python code. Please open a discussion in the discussion tab if you think this is an error and tag @lhoestq and @severo.
Cite this
CC0-1.0Cite
Tags
task_categories:text-generationtask_ids:language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:oscarlanguage:aflanguage:amlanguage:arlanguage:arzlanguage:aslanguage:azlanguage:azblanguage:balanguage:belanguage:bglanguage:bnlanguage:bolanguage:brlanguage:calanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:dalanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:ga