Datasets
Dataset
indicCorpv2
by satpalsr
IndicCORPV2 is the largest collection of texts for Indic langauges consisting of 20. 9 Billion tokens of which 14.
CC0-1.0text-generation 139 3
published 31 Jul 2023
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary python code. Please open a discussion in the discussion tab if you think this is an error and tag @lhoestq and @severo.
Cite this
CC0-1.0Cite
Tags
task_categories:text-generationlanguage:aslanguage:brxlanguage:bnlanguage:doilanguage:enlanguage:gomlanguage:gulanguage:hilanguage:khalanguage:knlanguage:kslanguage:mailanguage:mllanguage:mnilanguage:mrlanguage:nelanguage:orlanguage:palanguage:salanguage:satlanguage:sdlanguage:talanguage:telanguage:urlicense:cc0-1.0arxiv:2212.05409region:us