Datasets
Dataset
banglawiki
by khulnasoft
Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.
CC-BY-SA-3.0text-generation 167 0n < 1K rows
published 7 Jul 2024
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet
Cite this
CC-BY-SA-3.0Cite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:ablanguage:acelanguage:adylanguage:aflanguage:aklanguage:alslanguage:altlanguage:amlanguage:amilanguage:anlanguage:anglanguage:anplanguage:arlanguage:arclanguage:arylanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:avklanguage:awalanguage:aylanguage:azlanguage:azblanguage:balanguage:banlanguage:barlanguage:bcllanguage:belanguage:bglanguage:bh