Datasets

Dataset

oscar-mini

by nthngdy

The Open Super-large Crawled ALMAnaCH coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the goclassy architecture.

CC0-1.0text-generation 1126 6

published 9 Mar 2022

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary python code. Please open a discussion in the discussion tab if you think this is an error and tag @lhoestq and @severo.

Cite this

CC0-1.0Cite

Tags

task_categories:text-generationtask_ids:language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:oscarlanguage:aflanguage:amlanguage:arlanguage:arzlanguage:aslanguage:azlanguage:azblanguage:balanguage:belanguage:bglanguage:bnlanguage:bolanguage:brlanguage:calanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:dalanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:ga