Datasets

Dataset

ccaligned_multilingual

by ahelk

CCAligned consists of parallel or comparable web-document pairs in 137 languages aligned with English. These web-document pairs were constructed by performing language identification on raw web-documents, and ensuring corresponding language codes were corre…

No licenseother 318 8n < 1K rows

published 2 Mar 2022

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

No licenseCite

Tags

task_categories:otherannotations_creators:no-annotationlanguage_creators:foundmultilinguality:translationsource_datasets:originallanguage:aflanguage:aklanguage:amlanguage:arlanguage:aslanguage:aylanguage:azlanguage:belanguage:bglanguage:bmlanguage:bnlanguage:brlanguage:bslanguage:calanguage:ceblanguage:ckblanguage:cslanguage:cylanguage:delanguage:dvlanguage:ellanguage:eolanguage:eslanguage:falanguage:fflanguage:filanguage:folanguage:frlanguage:fylanguage:galanguage:gllanguage:gnlanguage:gulanguage:helanguage:hi