Datasets

Dataset

wikipedia

by PrinceZaman

Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps with one subset per language, each containing a single train split.

CC-BY-SA-3.0text-generation 0 0n < 1K rows

published 20 Sept 2026

Preview

The Hugging Face dataset viewer has no preview for this one.

Cite this

CC-BY-SA-3.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelinglanguage:ablanguage:acelanguage:adylanguage:aflanguage:altlanguage:amlanguage:amilanguage:anlanguage:anglanguage:anplanguage:arlanguage:arclanguage:arylanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:avklanguage:awalanguage:aylanguage:azlanguage:azblanguage:balanguage:banlanguage:barlanguage:bbclanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:blklanguage:bmlanguage:bn