Datasets
Dataset
SampurNER
by prachuryyaIITG
SampurNER: Fine-grained Named Entity Recognition dataset for 22 Indian Languages We introduce SampurNER, a fine-grained named entity recognition (FgNER) dataset encompassing all 22 scheduled Indian languages spoken by more than two billion people across var…
MITtoken-classification 824 010M < n < 100M rows
published 8 Nov 2025
Preview
First 5 rows of default / train, from the Hugging Face dataset viewer.
| text |
|---|
| পল O |
| আন্তঃৰাষ্ট্ৰীয় O |
| বিমানবন্দৰ O |
| . O |
Cite this
MITtextCite
Tags
task_categories:token-classificationtask_categories:otherlanguage:aslanguage:bnlanguage:brxlanguage:doilanguage:gulanguage:hilanguage:knlanguage:kslanguage:gomlanguage:mailanguage:mllanguage:mnilanguage:mrlanguage:nelanguage:orlanguage:palanguage:salanguage:satlanguage:sdlanguage:talanguage:telanguage:urlicense:mitsize_categories:10M<n<100Mformat:textmodality:textlibrary:datasetslibrary:mlcroissantarxiv:2601.10161region:us