Datasets

Dataset

banglawiki

by khulnasoft

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump with one split per language.

CC-BY-SA-3.0text-generation 167 0n < 1K rows

published 7 Jul 2024

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

CC-BY-SA-3.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:crowdsourcedmultilinguality:multilingualsource_datasets:originallanguage:ablanguage:acelanguage:adylanguage:aflanguage:aklanguage:alslanguage:altlanguage:amlanguage:amilanguage:anlanguage:anglanguage:anplanguage:arlanguage:arclanguage:arylanguage:arzlanguage:aslanguage:astlanguage:atjlanguage:avlanguage:avklanguage:awalanguage:aylanguage:azlanguage:azblanguage:balanguage:banlanguage:barlanguage:bcllanguage:belanguage:bglanguage:bh