Datasets

Dataset

wikisource

by wikimedia

Dataset Card for Wikimedia Wikisource Dataset Summary Wikisource dataset containing cleaned articles of all languages. The dataset is built from the Wikisource dumps with one subset per language, each containing a single train split.

CC-BY-SA-3.0text-generation 4539 841M < n < 10M rows

published 2 Mar 2022

Preview

First 5 rows of 20231201.or / train, from the Hugging Face dataset viewer.

idurltitletext
71"https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%Eଓଡ଼ିଆ ଭାଗବତ/୪"ନାରାୟଣଂ ନମସ୍କୃତ୍ୟ ନରଂ ଚୈବ ନରୋତ୍ତମ‌ମ
72"https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%Eଓଡ଼ିଆ ଭାଗବତ/୧"\n\nପ୍ରଥମ ଅଧ୍ୟାୟ\nଓଁ ନମୋ ଭଗବତେ ବାସୁଦେବା
73"https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%Eଓଡ଼ିଆ ଭାଗବତ/୫"\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nମୈତ୍ରେୟ ଉବାଚ\nପରମ-ପୁରୁ
74"https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%Eଓଡ଼ିଆ ଭାଗବତ/୬"\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nନମଇଁ ନୃସିଂହ ଚରଣ । ଅନାଦ
75"https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%Eଓଡ଼ିଆ ଭାଗବତ/୭"\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nନମଇଁ ନୃସିଂହ ଚରଣ । ଅନାଦ

Cite this

CC-BY-SA-3.0textCite

Tags

task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelinglanguage:arlanguage:aslanguage:azlanguage:banlanguage:belanguage:bglanguage:bnlanguage:brlanguage:bslanguage:calanguage:cslanguage:cylanguage:dalanguage:delanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:folanguage:frlanguage:gllanguage:gulanguage:helanguage:hilanguage:hrlanguage:hulanguage:hylanguage:idlanguage:islanguage:itlanguage:jalanguage:jv