Datasets
Dataset
guanaco-llama2-200
by baoanhtran
CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages \
No licensetext-generation 109 4n < 1K rows
published 26 Aug 2023
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet
Cite this
No licenseCite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aflanguage:alslanguage:amlanguage:anlanguage:arlanguage:arzlanguage:aslanguage:astlanguage:avlanguage:azlanguage:azblanguage:balanguage:barlanguage:bcllanguage:belanguage:bglanguage:bhlanguage:bnlanguage:bolanguage:bpylanguage:brlanguage:bslanguage:bxrlanguage:calanguage:cbklanguage:celanguage:ceblanguage:ckblanguage:cslanguage:cvlanguage:cylanguage:da