Datasets
Dataset
wikipedia
by olm
Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.
CC-BY-SA-3.0text-generation 243 37n < 1K rows
published 4 Oct 2022
Preview
Cannot get the config names for the dataset.
Cite this
CC-BY-SA-3.0Cite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:aalanguage:ablanguage:acelanguage:aflanguage:aklanguage:alslanguage:amlanguage:anlanguage:anglanguage:arlanguage:arclanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:aylanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:bmlanguage:bnlanguage:bolanguage:bpylanguage:br