Datasets

Dataset

wikipedia

by olm

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.

CC-BY-SA-3.0text-generation 243 37n < 1K rows

published 4 Oct 2022

Preview

Cannot get the config names for the dataset.

Cite this

CC-BY-SA-3.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:aalanguage:ablanguage:acelanguage:aflanguage:aklanguage:alslanguage:amlanguage:anlanguage:anglanguage:arlanguage:arclanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:aylanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:bmlanguage:bnlanguage:bolanguage:bpylanguage:br