Datasets

Dataset

NayanaOCR_Corpus_2025

by 1DuBu1

🪷 NayanaOCR Corpus 2025 A 1M-page, 22-language fully-parallel synthetic OCR + VQA corpus for document-centric vision-language models — every page rendered in every language. NayanaOCR Corpus 2025 is one of the largest open-source multilingual, multi-task d…

CC-BY-NC-4.0image-to-text 17 01M < n < 10M rows

published 24 Jun 2026

Preview

The dataset does not exist, or is not accessible without authentication (private or gated). Please check the spelling of the dataset name or retry with authentication.

Cite this

CC-BY-NC-4.0Cite

Tags

task_categories:image-to-texttask_categories:visual-question-answeringtask_categories:image-text-to-texttask_ids:multiple-choice-qatask_ids:closed-domain-qaannotations_creators:machine-generatedlanguage_creators:machine-generatedmultilinguality:multilingualsource_datasets:originallanguage:arlanguage:bnlanguage:delanguage:enlanguage:eslanguage:frlanguage:gulanguage:hilanguage:itlanguage:jalanguage:knlanguage:kolanguage:mllanguage:mrlanguage:orlanguage:palanguage:rulanguage:salanguage:talanguage:telanguage:thlanguage:zhlicense:cc-by-nc-4.0size_categories:1M<n<10Marxiv:2512.03514region:usocrparallel-corpusmultilingual-parallelcross-lingualdocument-ai