Datasets

Dataset

indicCorpv2

by satpalsr

IndicCORPV2 is the largest collection of texts for Indic langauges consisting of 20. 9 Billion tokens of which 14.

CC0-1.0text-generation 139 3

published 31 Jul 2023

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary python code. Please open a discussion in the discussion tab if you think this is an error and tag @lhoestq and @severo.

Cite this

CC0-1.0Cite

Tags

task_categories:text-generationlanguage:aslanguage:brxlanguage:bnlanguage:doilanguage:enlanguage:gomlanguage:gulanguage:hilanguage:khalanguage:knlanguage:kslanguage:mailanguage:mllanguage:mnilanguage:mrlanguage:nelanguage:orlanguage:palanguage:salanguage:satlanguage:sdlanguage:talanguage:telanguage:urlicense:cc0-1.0arxiv:2212.05409region:us