Datasets
Dataset
wikisource
by wikimedia
Dataset Card for Wikimedia Wikisource Dataset Summary Wikisource dataset containing cleaned articles of all languages. The dataset is built from the Wikisource dumps with one subset per language, each containing a single train split.
CC-BY-SA-3.0text-generation 4539 841M < n < 10M rows
published 2 Mar 2022
Preview
First 5 rows of 20231201.or / train, from the Hugging Face dataset viewer.
| id | url | title | text |
|---|---|---|---|
| 71 | "https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%E | ଓଡ଼ିଆ ଭାଗବତ/୪ | "ନାରାୟଣଂ ନମସ୍କୃତ୍ୟ ନରଂ ଚୈବ ନରୋତ୍ତମମ |
| 72 | "https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%E | ଓଡ଼ିଆ ଭାଗବତ/୧ | "\n\nପ୍ରଥମ ଅଧ୍ୟାୟ\nଓଁ ନମୋ ଭଗବତେ ବାସୁଦେବା |
| 73 | "https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%E | ଓଡ଼ିଆ ଭାଗବତ/୫ | "\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nମୈତ୍ରେୟ ଉବାଚ\nପରମ-ପୁରୁ |
| 74 | "https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%E | ଓଡ଼ିଆ ଭାଗବତ/୬ | "\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nନମଇଁ ନୃସିଂହ ଚରଣ । ଅନାଦ |
| 75 | "https://or.wikisource.org/wiki/%E0%AC%93%E0%AC%A1%E0%AC%BC%E0%AC%BF%E0%AC%86%20%E0%AC%AD%E0%AC%BE%E | ଓଡ଼ିଆ ଭାଗବତ/୭ | "\n\nପ୍ରଥମ ଅଧ୍ୟାୟ \nନମଇଁ ନୃସିଂହ ଚରଣ । ଅନାଦ |
Cite this
CC-BY-SA-3.0textCite
Tags
task_categories:text-generationtask_categories:fill-masktask_ids:language-modelingtask_ids:masked-language-modelinglanguage:arlanguage:aslanguage:azlanguage:banlanguage:belanguage:bglanguage:bnlanguage:brlanguage:bslanguage:calanguage:cslanguage:cylanguage:dalanguage:delanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:filanguage:folanguage:frlanguage:gllanguage:gulanguage:helanguage:hilanguage:hrlanguage:hulanguage:hylanguage:idlanguage:islanguage:itlanguage:jalanguage:jv