Datasets

Dataset

Agri_STT_Benchmarking_Dataset

by DigiGreen

Agri STT Benchmarking Dataset 10,808 farmer voice queries in Hindi, Telugu and Odia, with reference transcripts, for benchmarking automatic speech recognition in agricultural contexts. The audio is included in this repository.

CC-BY-4.0automatic-speech-recognition 1053 110K < n < 100K rows

published 5 Feb 2026

Preview

First 5 rows of default / train, from the Hugging Face dataset viewer.

FilenameLanguagereference
audio/000/00001.ogghiसरसों में प्रथम सिंचाई कब करना चाहिए?
audio/000/00002.ogghiअभी गेहूं के लिए सबसे अच्छा बीच का किस्म कौन सा है?
audio/000/00003.ogghiधनिया की खेती सोनपुर प्रखंड में हो सकता है क्या?
audio/000/00005.ogghiक्या गेहूं को पहले पानी पे यूरिया खाद छिट कर ही पटाना चाहिए या नहीं?
audio/000/00006.ogghiश्री विधि से गेहूं लगाने के लिए क्या उपाय पहले किया जाता है?

Cite this

CC-BY-4.0audiotextCite

Tags

task_categories:automatic-speech-recognitiontask_categories:audio-classificationlanguage:hilanguage:telanguage:orlicense:cc-by-4.0size_categories:10K<n<100Kformat:parquetmodality:audiomodality:textlibrary:datasetslibrary:pandaslibrary:polarslibrary:mlcroissantarxiv:2602.03868region:us