Datasets

Dataset

tatoeba

by Helsinki-NLP

This is a collection of translated sentences from Tatoeba 359 languages, 3,403 bitexts total number of files: 750 total number of tokens: 65. 54M total number of sentence fragments: 8.

CC-BY-2.0translation 950 5510K < n < 100K rows

published 2 Mar 2022

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

CC-BY-2.0Cite

Tags

task_categories:translationannotations_creators:foundlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:ablanguage:acmlanguage:adylanguage:aflanguage:afblanguage:afhlanguage:aiilanguage:ainlanguage:ajplanguage:akllanguage:alnlanguage:amlanguage:anlanguage:anglanguage:aozlanguage:apclanguage:arlanguage:arqlanguage:arylanguage:arzlanguage:aslanguage:astlanguage:avklanguage:awalanguage:ayllanguage:azlanguage:balanguage:ballanguage:barlanguage:belanguage:berlanguage:bglanguage:bholanguage:bjnlanguage:bm