Datasets

Dataset

guanaco-llama2-200

by baoanhtran

CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages \

No licensetext-generation 109 4n < 1K rows

published 26 Aug 2023

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

No licenseCite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:alslanguage:amlanguage:anlanguage:arlanguage:arzlanguage:aslanguage:astlanguage:avlanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bnlanguage:bolanguage:bpylanguage:brlanguage:bslanguage:bxrlanguage:calanguage:cbklanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:da