Datasets

Dataset

multilingual-tinystories

by deeponh

Multilingual TinyStories Dataset A collection of children's stories in multiple Indian languages, generated for language model training.

CC-BY-4.0text-generation 154 110K < n < 100K rows

published 17 Mar 2026

Preview

The Hugging Face dataset viewer has no preview for this one.

Cite this

CC-BY-4.0Cite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingmultilinguality:multilinguallanguage:aslanguage:brxlanguage:doilanguage:gomlanguage:gulanguage:knlanguage:koklanguage:kslanguage:mailanguage:mllanguage:mnilanguage:nelanguage:orlanguage:palanguage:salanguage:satlanguage:sdlanguage:talanguage:telanguage:urlicense:cc-by-4.0size_categories:10K<n<100Karxiv:2603.14563region:usstorieschildrenindian-languagesindiclow-resource