Datasets

Dataset

qed_amara

by Helsinki-NLP

The QCRI Educational Domain Corpus (formerly QCRI AMARA Corpus) is an open multilingual collection of subtitles for educational videos and lectures collaboratively transcribed and translated over the AMARA web-based platform. Developed by: Qatar Computing R…

No licensetranslation 261 5100K < n < 1M rows

published 2 Mar 2022

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

No licenseCite

Tags

task_categories:translationannotations_creators:foundlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:aalanguage:ablanguage:aelanguage:aeblanguage:aflanguage:aklanguage:amlanguage:anlanguage:arlanguage:arqlanguage:arzlanguage:aslanguage:aselanguage:astlanguage:avlanguage:aylanguage:azlanguage:balanguage:belanguage:berlanguage:bglanguage:bhlanguage:bilanguage:bmlanguage:bnlanguage:bntlanguage:bolanguage:brlanguage:bslanguage:buglanguage:calanguage:celanguage:ceblanguage:chlanguage:cho