Datasets
Dataset
pib
by jerin
Sentence aligned parallel corpus between 11 Indian Languages, crawled and extracted from the press information bureau website.
CC-BY-4.0translation 262 3100K < n < 1M rows
published 2 Mar 2022
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet
Cite this
CC-BY-4.0Cite
Tags
task_categories:translationtask_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelingannotations_creators:no-annotationlanguage_creators:othermultilinguality:translationsource_datasets:originallanguage:bnlanguage:enlanguage:gulanguage:hilanguage:mllanguage:mrlanguage:orlanguage:palanguage:talanguage:telanguage:urlicense:cc-by-4.0size_categories:100K<n<1Marxiv:2008.04860region:us