Datasets

Dataset

lsd_all_scripts_finetuning_subset

by blue-machines

blue-machines/lsdallscriptsfinetuningsubset Language-switch detection finetuning subset (lsddatawithlanguage. csv).

No licensetext-classification 30 0100K < n < 1M rows

published 27 Jul 2026

Preview

First 5 rows of default / train, from the Hugging Face dataset viewer.

language_switchtextscript_typelanguage
BengaliBengali তে উত্তর দাও.mixedBengali
BengaliBengali তে কথা বলা যায়?mixedBengali
BengaliBengali তে কথা বলুন.mixedBengali
BengaliBengali তে কথোপকথন করুন.mixedBengali
BengaliBengali তে বলো না.mixedBengali

Cite this

No licensetextCite

Tags

task_categories:text-classificationlanguage:enlanguage:hilanguage:bnlanguage:gulanguage:knlanguage:mllanguage:mrlanguage:orlanguage:talanguage:telicense:othersize_categories:100K<n<1Mformat:parquetmodality:textlibrary:datasetslibrary:pandaslibrary:polarslibrary:mlcroissantregion:uslanguage-switch-detectionlanguage-identificationindicfinetuningcode-mixedromanized