Datasets
Dataset
Agri_STT_Benchmarking_Dataset
by DigiGreen
Agri STT Benchmarking Dataset 10,808 farmer voice queries in Hindi, Telugu and Odia, with reference transcripts, for benchmarking automatic speech recognition in agricultural contexts. The audio is included in this repository.
CC-BY-4.0automatic-speech-recognition 1053 110K < n < 100K rows
published 5 Feb 2026
Preview
First 5 rows of default / train, from the Hugging Face dataset viewer.
| Filename | Language | reference |
|---|---|---|
| audio/000/00001.ogg | hi | सरसों में प्रथम सिंचाई कब करना चाहिए? |
| audio/000/00002.ogg | hi | अभी गेहूं के लिए सबसे अच्छा बीच का किस्म कौन सा है? |
| audio/000/00003.ogg | hi | धनिया की खेती सोनपुर प्रखंड में हो सकता है क्या? |
| audio/000/00005.ogg | hi | क्या गेहूं को पहले पानी पे यूरिया खाद छिट कर ही पटाना चाहिए या नहीं? |
| audio/000/00006.ogg | hi | श्री विधि से गेहूं लगाने के लिए क्या उपाय पहले किया जाता है? |
Cite this
CC-BY-4.0audiotextCite
Tags
task_categories:automatic-speech-recognitiontask_categories:audio-classificationlanguage:hilanguage:telanguage:orlicense:cc-by-4.0size_categories:10K<n<100Kformat:parquetmodality:audiomodality:textlibrary:datasetslibrary:pandaslibrary:polarslibrary:mlcroissantarxiv:2602.03868region:us