Datasets
Dataset
lid_all_scripts_finetuning_subset
by blue-machines
blue-machines/lidallscriptsfinetuningsubset Finetuning subset for sentence-level language identification (trainstage2dataset. csv).
No licensetext-classification 28 010K < n < 100K rows
published 27 Jul 2026
Preview
The Hugging Face dataset viewer has no preview for this one.
Cite this
No licenseCite
Tags
task_categories:text-classificationlanguage:enlanguage:hilanguage:bnlanguage:gulanguage:knlanguage:mllanguage:mrlanguage:orlanguage:talanguage:telicense:othersize_categories:10K<n<100Kregion:uslanguage-identificationindicfinetuningcode-mixedromanized