Datasets
Dataset
wikipedia
by PrinceZaman
Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps with one subset per language, each containing a single train split.
CC-BY-SA-3.0text-generation 0 0n < 1K rows
published 20 Sept 2026
Preview
The Hugging Face dataset viewer has no preview for this one.
Cite this
CC-BY-SA-3.0Cite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelinglanguage:ablanguage:acelanguage:adylanguage:aflanguage:altlanguage:amlanguage:amilanguage:anlanguage:anglanguage:anplanguage:arlanguage:arclanguage:arylanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:avklanguage:awalanguage:aylanguage:azlanguage:azblanguage:balanguage:banlanguage:barlanguage:bbclanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:blklanguage:bmlanguage:bn