Datasets
Dataset
OSCAR-2201
by oscar-corpus
The Open Super-large Crawled Aggregated coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the Ungoliant architecture.
CC0-1.0fill-mask 799 131
published 14 Mar 2022
Preview
The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.
Cite this
CC0-1.0Cite
Tags
task_categories:fill-masktask_categories:text-generationtask_ids:language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:sqlanguage:amlanguage:arlanguage:anlanguage:hylanguage:aslanguage:astlanguage:avlanguage:azlanguage:bnlanguage:balanguage:eulanguage:belanguage:bhlanguage:bpylanguage:bslanguage:brlanguage:bglanguage:mylanguage:calanguage:ceblanguage:ckblanguage:celanguage:zhlanguage:cvlanguage:kwlanguage:hrlanguage:cslanguage:dalanguage:diqlanguage:dvlanguage:nl