{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/eva-clip-18b-scaling-clip-to-18-billion","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","arxiv_id":"2402.04252","date":"2024-02-06","proceeding":null,"authors":["Quan Sun","Jinsheng Wang","Qiying Yu","Yufeng Cui","Fan Zhang","Xiaosong Zhang","Xinlong Wang"],"abstract":"Scaling up contrastive language-image pretraining (CLIP) is critical for empowering both vision and multimodal models. We present EVA-CLIP-18B, the largest and most powerful open-source CLIP model to date, with 18-billion parameters. With only 6-billion training samples seen, EVA-CLIP-18B achieves an exceptional 80.7% zero-shot top-1 accuracy averaged across 27 widely recognized image classification benchmarks, outperforming its forerunner EVA-CLIP (5-billion parameters) and other open-source CLIP models by a large margin. Remarkably, we observe a consistent performance improvement with the model size scaling of EVA-CLIP, despite maintaining a constant training dataset of 2-billion image-text pairs from LAION-2B and COYO-700M. This dataset is openly available and much smaller than the in-house datasets (e.g., DFN-5B, WebLI-10B) employed in other state-of-the-art CLIP models. EVA-CLIP-18B demonstrates the potential of EVA-style weak-to-strong visual model scaling. With our model weights made publicly available, we hope to facilitate future research in vision and multimodal foundation models.","url_abs":"https://arxiv.org/abs/2402.04252v1","url_pdf":"https://arxiv.org/pdf/2402.04252v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"eva-clip-18b-scaling-clip-to-18-billion","repo_url":"https://github.com/baaivision/eva","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"eva-clip-18b-scaling-clip-to-18-billion","repo_url":"https://github.com/baaivision/EVA/tree/master/EVA-CLIP-18B","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"zero-shot-transfer-image-classification","task_name":"Zero-Shot Transfer Image Classification"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[{"method_slug":"clip","method_name":"CLIP"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-17","task":"Zero-Shot Transfer Image Classification","dataset":"Food-101","model":"EVA-CLIP-18B","rank_in_archive_order":2,"of":5,"metrics":{"Top 1 Accuracy":"95.8"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-1","task":"Zero-Shot Transfer Image Classification","dataset":"ImageNet","model":"EVA-CLIP-18B","rank_in_archive_order":9,"of":23,"metrics":{"Accuracy (Private)":"83.8"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-3","task":"Zero-Shot Transfer Image Classification","dataset":"ImageNet V2","model":"EVA-CLIP-18B","rank_in_archive_order":7,"of":13,"metrics":{"Accuracy (Private)":"77.9"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-5","task":"Zero-Shot Transfer Image Classification","dataset":"ImageNet-A","model":"EVA-CLIP-18B","rank_in_archive_order":4,"of":13,"metrics":{"Accuracy (Private)":"87.3"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-4","task":"Zero-Shot Transfer Image Classification","dataset":"ImageNet-R","model":"EVA-CLIP-18B","rank_in_archive_order":6,"of":12,"metrics":{"Accuracy":"95.7"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-8","task":"Zero-Shot Transfer Image Classification","dataset":"ImageNet-Sketch","model":"EVA-CLIP-18B","rank_in_archive_order":4,"of":7,"metrics":{"Accuracy (Private)":"74.7"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-6","task":"Zero-Shot Transfer Image Classification","dataset":"ObjectNet","model":"EVA-CLIP-18B","rank_in_archive_order":4,"of":9,"metrics":{"Accuracy (Private)":"82.2"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-2","task":"Zero-Shot Transfer Image Classification","dataset":"SUN","model":"EVA-CLIP-18B","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"77.7"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2402.04252","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.04252"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/baaivision/eva","reach":{"status":"ok","spdx":"MIT"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/baaivision/EVA/tree/master/EVA-CLIP-18B","reach":null}],"summary":{"ran":1,"unverified":5},"by_repo_kind":{"official":{"samples":6,"ran":1,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"39be51ada5136386","entry":"get_loss_scale_for_deepspeed","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/eva/engine_for_finetuning.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/engine_for_finetuning.py","link_basis":"first_harvest_node","language":"python","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"39be51ada5136386"}},{"code_sha256_prefix":"88e56e4d0c6044f2","entry":"build_model","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/clip/model.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/clip/model.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"88e56e4d0c6044f2"}},{"code_sha256_prefix":"12035a2f77d8016c","entry":"get_1d_sincos_pos_embed_from_grid","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/eva/modeling_mae_pretrain.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/modeling_mae_pretrain.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"12035a2f77d8016c"}},{"code_sha256_prefix":"3185afc3e87293ed","entry":"get_2d_sincos_pos_embed","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/eva/modeling_mae_pretrain.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/modeling_mae_pretrain.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"code_sha256_prefix":"f10004e059714d42","entry":"get_2d_sincos_pos_embed_from_grid","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/eva/modeling_mae_pretrain.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/modeling_mae_pretrain.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"code_sha256_prefix":"c7976ea27edc377a","entry":"train_class_batch","repo":"baaivision/EVA","repo_kind":"official","path":"EVA-01/eva/engine_for_finetuning.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/engine_for_finetuning.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"c7976ea27edc377a"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}