Datasets

Dataset

opus-100

by hfxunlp

Dataset Card for OPUS-100 Dataset Summary OPUS-100 is an English-centric multilingual corpus covering 100 languages. OPUS-100 is English-centric, meaning that all training pairs include English on either the source or target side.

No licensetranslation 59 010M < n < 100M rows

published 25 Feb 2026

Preview

The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.

Cite this

No licensetextCite

Tags

task_categories:translationannotations_creators:no-annotationlanguage_creators:foundmultilinguality:translationsource_datasets:extendedlanguage:aflanguage:amlanguage:anlanguage:arlanguage:aslanguage:azlanguage:belanguage:bglanguage:bnlanguage:brlanguage:bslanguage:calanguage:cslanguage:cylanguage:dalanguage:delanguage:dzlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:galanguage:gdlanguage:gllanguage:gulanguage:halanguage:helanguage:hilanguage:hr