Datasets

Dataset

OSCAR-2201

by oscar-corpus

The Open Super-large Crawled Aggregated coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the Ungoliant architecture.

CC0-1.0fill-mask 799 131

published 14 Mar 2022

Preview

The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.

Cite this

CC0-1.0Cite

Tags

task_categories:fill-masktask_categories:text-generationtask_ids:language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:sqlanguage:amlanguage:arlanguage:anlanguage:hylanguage:aslanguage:astlanguage:avlanguage:azlanguage:bnlanguage:balanguage:eulanguage:belanguage:bhlanguage:bpylanguage:bslanguage:brlanguage:bglanguage:mylanguage:calanguage:ceblanguage:ckblanguage:celanguage:zhlanguage:cvlanguage:kwlanguage:hrlanguage:cslanguage:dalanguage:diqlanguage:dvlanguage:nl