Datasets

Dataset

lid_all_scripts_finetuning_subset

by blue-machines

blue-machines/lidallscriptsfinetuningsubset Finetuning subset for sentence-level language identification (trainstage2dataset. csv).

No licensetext-classification 28 010K < n < 100K rows

published 27 Jul 2026

Preview

The Hugging Face dataset viewer has no preview for this one.

Cite this

No licenseCite

Tags

task_categories:text-classificationlanguage:enlanguage:hilanguage:bnlanguage:gulanguage:knlanguage:mllanguage:mrlanguage:orlanguage:talanguage:telicense:othersize_categories:10K<n<100Kregion:uslanguage-identificationindicfinetuningcode-mixedromanized