Datasets

Dataset

Language_Identification_v1

by Process-Venue

Dataset Card for Language Identification Dataset Dataset Summary A comprehensive dataset for Indian language identification and text classification. The dataset contains text samples across 10 major Indian languages, making it suitable for developing langua…

CC-BY-SA-4.0text-classification 61 11K < n < 10K rows

published 18 Feb 2025

Preview

First 5 rows of default / train, from the Hugging Face dataset viewer.

HeadlineLanguage
سلیم خان نے کہا : خدا بھی نہیں جانتا کب شادی کریں گے سلمانUrdu
PHOTOS: ટીવીની સૌથી હોટ હસીના નિયા શર્મા ફરી શેર કરી બોલ્ડ તસવીરોGujarati
ਕਨ੍ਹਈਆ ਦੇ ਮੁਸਲਮਾਨ ਬਣਨ ਬਾਰੇ ਵਾਇਰਲ ਵੀਡੀਓ ਦਾ ਸੱਚ ਜਾਣੋ 23 ਜਨਵਰੀ 2019 ਈਮੇਲ ਸਾਂਝਾ ਕਰੋ ਈਮੇਲ ਈਮੇਲ ਲਿੰਕ ਨੂੰ ਕਾਪੀ ਕਰੋ https://www.bbc.com/punjabi/india-46961…Punjabi
ویرے دی ویڈنگ نے پہلے ہی دن کر لی کروڑوں کی کمائیUrdu
ପାକିସ୍ତାନର ଲଗାତାର ସପ୍ତମ ଶୃଙ୍ଖଳା ବିଜୟ Odia

Cite this

CC-BY-SA-4.0textCite

Tags

task_categories:text-classificationtask_categories:text-generationlanguage:hilanguage:urlanguage:bnlanguage:gulanguage:knlanguage:mllanguage:mrlanguage:orlanguage:palanguage:talicense:cc-by-sa-4.0size_categories:1K<n<10Kformat:parquetmodality:textlibrary:datasetslibrary:pandaslibrary:mlcroissantlibrary:polarsregion:uslanguage-identificationmultilingualindic-languagestext-classificationIndia