Datasets

Dataset

wikipedia

by NeuML

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.

CC-BY-SA-3.0text-generation 131 6n < 1K rows

published 11 Jan 2024

Preview

Cannot get the config names for the dataset.

Cite this

CC-BY-SA-3.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:aalanguage:ablanguage:acelanguage:aflanguage:aklanguage:alslanguage:amlanguage:anlanguage:anglanguage:arlanguage:arclanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:aylanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:bmlanguage:bnlanguage:bolanguage:bpylanguage:br