Datasets
Dataset
bernice-pretrain-data
by jhu-clsp
Tweet IDs for the 2. 5 billion multilingual tweets used to train Bernice, a Twitter encoder.
MITother 105 51B < n < 10B rows
published 3 Jan 2023
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary python code. Please open a discussion in the discussion tab if you think this is an error and tag @lhoestq and @severo.
Cite this
MITCite
Tags
task_categories:otherannotations_creators:no-annotationlanguage_creators:foundmultilinguality:multilingualsource_datasets:originallanguage:enlanguage:eslanguage:ptlanguage:jalanguage:arlanguage:inlanguage:kolanguage:trlanguage:frlanguage:tllanguage:rulanguage:itlanguage:thlanguage:delanguage:hilanguage:pllanguage:nllanguage:falanguage:etlanguage:htlanguage:urlanguage:svlanguage:calanguage:ellanguage:filanguage:cslanguage:iwlanguage:dalanguage:vilanguage:zhlanguage:talanguage:rolanguage:nolanguage:uklanguage:cy