Datasets
Dataset
opus-100
by hfxunlp
Dataset Card for OPUS-100 Dataset Summary OPUS-100 is an English-centric multilingual corpus covering 100 languages. OPUS-100 is English-centric, meaning that all training pairs include English on either the source or target side.
No licensetranslation 59 010M < n < 100M rows
published 25 Feb 2026
Preview
The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.
Cite this
No licensetextCite
Tags
task_categories:translationannotations_creators:no-annotationlanguage_creators:foundmultilinguality:translationsource_datasets:extendedlanguage:aflanguage:amlanguage:anlanguage:arlanguage:aslanguage:azlanguage:belanguage:bglanguage:bnlanguage:brlanguage:bslanguage:calanguage:cslanguage:cylanguage:dalanguage:delanguage:dzlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:frlanguage:fylanguage:galanguage:gdlanguage:gllanguage:gulanguage:halanguage:helanguage:hilanguage:hr