Datasets

Dataset

Tilya

by Tilya203

Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps with one subset per language, each containing a single train split.

CC-BY-SA-3.0text-generation 91 010M < n < 100M rows

published 19 Jan 2026

Preview

The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.

Cite this

CC-BY-SA-3.0textCite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelinglanguage:ablanguage:acelanguage:adylanguage:aflanguage:altlanguage:amlanguage:amilanguage:anlanguage:anglanguage:anplanguage:arlanguage:arclanguage:arylanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:avklanguage:awalanguage:aylanguage:azlanguage:azblanguage:balanguage:banlanguage:barlanguage:bbclanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bilanguage:bjnlanguage:blklanguage:bmlanguage:bn