Datasets

Dataset

oscar

by oscar-corpus

The Open Super-large Crawled ALMAnaCH coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the goclassy architecture.

CC0-1.0text-generation 524 208100K < n < 1M rows

published 2 Mar 2022

Preview

The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.

Cite this

CC0-1.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:alslanguage:amlanguage:anlanguage:arlanguage:arzlanguage:aslanguage:astlanguage:avlanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bnlanguage:bolanguage:bpylanguage:brlanguage:bslanguage:bxrlanguage:calanguage:cbklanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:da