Datasets
Dataset
wikipedia2
by AiHazz
Dataset Card for Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.
CC-BY-SA-3.0text-generation 141 0n < 1K rows
published 8 May 2026
Preview
Not supported: dataset viewer is disabled in AiHazz/wikipedia2 configuration.
Cite this
CC-BY-SA-3.0Cite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:aalanguage:ablanguage:acelanguage:aflanguage:aklanguage:alslanguage:amlanguage:anlanguage:anglanguage:arlanguage:arclanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:aylanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:bmlanguage:bnlanguage:bolanguage:bpylanguage:br