Datasets
Dataset
oscar
by oscar-corpus
The Open Super-large Crawled ALMAnaCH coRpus is a huge multilingual corpus obtained by language classification and filtering of the Common Crawl corpus using the goclassy architecture.
CC0-1.0text-generation 524 208100K < n < 1M rows
published 2 Mar 2022
Preview
The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.
Cite this
CC0-1.0Cite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:alslanguage:amlanguage:anlanguage:arlanguage:arzlanguage:aslanguage:astlanguage:avlanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bnlanguage:bolanguage:bpylanguage:brlanguage:bslanguage:bxrlanguage:calanguage:cbklanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:da