Datasets
Dataset
NayanaOCR_Corpus_2025
by 1DuBu1
🪷 NayanaOCR Corpus 2025 A 1M-page, 22-language fully-parallel synthetic OCR + VQA corpus for document-centric vision-language models — every page rendered in every language. NayanaOCR Corpus 2025 is one of the largest open-source multilingual, multi-task d…
CC-BY-NC-4.0image-to-text 17 01M < n < 10M rows
published 24 Jun 2026
Preview
The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.
Cite this
CC-BY-NC-4.0Cite
Tags
task_categories:image-to-texttask_categories:visual-question-answeringtask_categories:image-text-to-texttask_ids:multiple-choice-qatask_ids:closed-domain-qaannotations_creators:machine-generatedlanguage_creators:machine-generatedmultilinguality:multilingualsource_datasets:originallanguage:arlanguage:bnlanguage:delanguage:enlanguage:eslanguage:frlanguage:gulanguage:hilanguage:itlanguage:jalanguage:knlanguage:kolanguage:mllanguage:mrlanguage:orlanguage:palanguage:rulanguage:salanguage:talanguage:telanguage:thlanguage:zhlicense:cc-by-nc-4.0size_categories:1M<n<10Marxiv:2512.03514region:usocrparallel-corpusmultilingual-parallelcross-lingualdocument-ai