Datasets

Dataset

verbalyze-stt-bench

by ansh-rohilla

Verbalyze: Indic Speech & ITN Benchmark (12 Languages) Verbalyze is a scenario-weighted benchmark dataset designed to evaluate and train Speech-to-Text (ASR) and Inverse Text Normalization (ITN) models on real-world Indic speech phenomena. It covers 12 majo…

MITautomatic-speech-recognition 0 0100K < n < 1M rows

published 13 Sept 2026

Preview

First 5 rows of default / train, from the Hugging Face dataset viewer.

idlanguagelanguage_namescenariotranscriptnormalized_transcriptnative_textromanized_textcode_mixed_textduration_seconds
as_07894asAssameseenglish_word_retentionএই document-ৰ সবিশেষ গোপনীয় ৰাখক, কুণাল।এই document-ৰ সবিশেষ গোপনীয় ৰাখক, কুণাল।এই document-ৰ সবিশেষ গোপনীয় ৰাখক, কুণাল।ei document- sabishesha gopaneeya aakhaka, kunaalaএই document-ৰ সবিশেষ গোপনীয় ৰাখক, কুণাল।0
as_04292asAssamesenormal_native_speechৰেলখন 6 নম্বৰ প্লেটফৰ্মৰ পৰা বেংগালুৰু-লৈ এৰিব।ৰেলখন 6 নম্বৰ প্লেটফৰ্মৰ পৰা বেংগালুৰু-লৈ এৰিব।ৰেলখন 6 নম্বৰ প্লেটফৰ্মৰ পৰা বেংগালুৰু-লৈ এৰিব।elakhana 6 namba pletaphama paaa bengaaluu-lai eibaৰেলখন 6 নম্বৰ প্লেটফৰ্মৰ পৰা বেংগালুৰু-লৈ এৰিব।0
as_06102asAssamesecode_mixed_speechমই Facebook-ত এটা trending video চাব বিচাৰোঁ।মই Facebook-ত এটা trending video চাব বিচাৰোঁ।মই Facebook-ত এটা trending video চাব বিচাৰোঁ।mai Facebook-ta etaa trending video chaaba bichaaonমই Facebook-ত এটা trending video চাব বিচাৰোঁ।0
as_01461asAssameselanguage_script_consistencyঅমৃতসৰ-ৰ ট্ৰান্সক্ৰিপ্ট স্ক্ৰিপ্টটো শুদ্ধ হোৱাটো নিশ্চিত কৰক।অমৃতসৰ-ৰ ট্ৰান্সক্ৰিপ্ট স্ক্ৰিপ্টটো শুদ্ধ হোৱাটো নিশ্চিত কৰক।অমৃতসৰ-ৰ ট্ৰান্সক্ৰিপ্ট স্ক্ৰিপ্টটো শুদ্ধ হোৱাটো নিশ্চিত কৰক।amritasa- taansakipta skiptato shuddha hoaato nishchita kakaঅমৃতসৰ-ৰ ট্ৰান্সক্ৰিপ্ট স্ক্ৰিপ্টটো শুদ্ধ হোৱাটো নিশ্চিত কৰক।0
as_01380asAssameseenglish_word_retentionকালি Amazon-ৰ system database ক্ৰেচ হৈছিল।কালি Amazon-ৰ system database ক্ৰেচ হৈছিল।কালি Amazon-ৰ system database ক্ৰেচ হৈছিল।kaali Amazon- system database kecha haichhilaকালি Amazon-ৰ system database ক্ৰেচ হৈছিল।0

Cite this

MITtextCite

Tags

task_categories:automatic-speech-recognitionlanguage:aslanguage:bnlanguage:enlanguage:gulanguage:hilanguage:knlanguage:mllanguage:mrlanguage:orlanguage:palanguage:talanguage:telicense:mitsize_categories:100K<n<1Mformat:jsonmodality:textlibrary:datasetslibrary:pandaslibrary:polarslibrary:mlcroissantregion:usspeechindicasr-benchmarkcode-switchinginverse-text-normalizationtelephony