{"url":"/task/zero-shot-transfer-image-classification","name":"Zero-Shot Transfer Image Classification","slug":"zero-shot-transfer-image-classification","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":19,"papers_with_code":16,"benchmarks":16,"benchmark_tables_in_archive":16,"benchmark_tables_shown":16,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":8,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-1","slug":"zero-shot-transfer-image-classification-on-1","dataset":"ImageNet","dataset_url":"/dataset/imagenet","rows_in_archive":23,"metrics":["Param","Accuracy (Private)","Accuracy (Public)"],"first_row_in_archive_order":{"model":"M2-Encoder","paper_title":"M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining","paper_url":"/paper/boldsymbol-m-2-encoder-advancing-bilingual","paper_date":"2024-01-29","arxiv_id":"2401.15896","code_links":[{"title":"alipay/Ant-Multi-Modal-Framework","url":"https://github.com/alipay/Ant-Multi-Modal-Framework/tree/main/prj/M2_Encoder"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-3","slug":"zero-shot-transfer-image-classification-on-3","dataset":"ImageNet V2","dataset_url":"/dataset/imagenet","rows_in_archive":13,"metrics":["Accuracy (Private)","Accuracy (Public)"],"first_row_in_archive_order":{"model":"BASIC (Lion)","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-5","slug":"zero-shot-transfer-image-classification-on-5","dataset":"ImageNet-A","dataset_url":"/dataset/imagenet-a","rows_in_archive":13,"metrics":["Accuracy (Private)","Accuracy (Public)"],"first_row_in_archive_order":{"model":"CoCa","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","paper_url":"/paper/coca-contrastive-captioners-are-image-text","paper_date":"2022-05-04","arxiv_id":"2205.01917","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"lucidrains/CoCa-pytorch","url":"https://github.com/lucidrains/CoCa-pytorch"},{"title":"amitakamath/whatsup_vlms","url":"https://github.com/amitakamath/whatsup_vlms"},{"title":"amitakamath/hard_positives","url":"https://github.com/amitakamath/hard_positives"},{"title":"Chaolei98/FreeZAD","url":"https://github.com/Chaolei98/FreeZAD"}],"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-4","slug":"zero-shot-transfer-image-classification-on-4","dataset":"ImageNet-R","dataset_url":"/dataset/imagenet-r","rows_in_archive":12,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BASIC (Lion)","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-6","slug":"zero-shot-transfer-image-classification-on-6","dataset":"ObjectNet","dataset_url":"/dataset/objectnet","rows_in_archive":9,"metrics":["Accuracy (Private)","Accuracy (Public)","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"LiT-22B","paper_title":"Scaling Vision Transformers to 22 Billion Parameters","paper_url":"/paper/scaling-vision-transformers-to-22-billion","paper_date":"2023-02-10","arxiv_id":"2302.05442","code_links":[{"title":"lucidrains/flash-cosine-sim-attention","url":"https://github.com/lucidrains/flash-cosine-sim-attention"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-8","slug":"zero-shot-transfer-image-classification-on-8","dataset":"ImageNet-Sketch","dataset_url":"/dataset/imagenet-sketch","rows_in_archive":7,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"CoCa","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","paper_url":"/paper/coca-contrastive-captioners-are-image-text","paper_date":"2022-05-04","arxiv_id":"2205.01917","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"lucidrains/CoCa-pytorch","url":"https://github.com/lucidrains/CoCa-pytorch"},{"title":"amitakamath/whatsup_vlms","url":"https://github.com/amitakamath/whatsup_vlms"},{"title":"amitakamath/hard_positives","url":"https://github.com/amitakamath/hard_positives"},{"title":"Chaolei98/FreeZAD","url":"https://github.com/Chaolei98/FreeZAD"}],"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-17","slug":"zero-shot-transfer-image-classification-on-17","dataset":"Food-101","dataset_url":"/dataset/food-101","rows_in_archive":5,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"MAWS (ViT-2B)","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_url":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_date":"2023-03-23","arxiv_id":"2303.13496","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-2","slug":"zero-shot-transfer-image-classification-on-2","dataset":"SUN","dataset_url":"/dataset/sun","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"EVA-CLIP-18B","paper_title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","paper_url":"/paper/eva-clip-18b-scaling-clip-to-18-billion","paper_date":"2024-02-06","arxiv_id":"2402.04252","code_links":[{"title":"baaivision/EVA","url":"https://github.com/baaivision/EVA/tree/master/EVA-CLIP-18B"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"}],"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on","slug":"zero-shot-transfer-image-classification-on","dataset":"aYahoo","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP","paper_title":"Learning Transferable Visual Models From Natural Language Supervision","paper_url":"/paper/learning-transferable-visual-models-from","paper_date":"2021-02-26","arxiv_id":"2103.00020","code_links":[{"title":"openai/CLIP","url":"https://github.com/openai/CLIP"},{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"},{"title":"alibaba/EasyNLP","url":"https://github.com/alibaba/EasyNLP"},{"title":"apple/ml-mobileclip","url":"https://github.com/apple/ml-mobileclip"},{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"FreddeFrallan/Multilingual-CLIP","url":"https://github.com/FreddeFrallan/Multilingual-CLIP"},{"title":"eps696/aphantasia","url":"https://github.com/eps696/aphantasia"},{"title":"muzairkhattak/multimodal-prompt-learning","url":"https://github.com/muzairkhattak/multimodal-prompt-learning"},{"title":"moein-shariatnia/OpenAI-CLIP","url":"https://github.com/moein-shariatnia/OpenAI-CLIP"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"PaddlePaddle/PASSL","url":"https://github.com/PaddlePaddle/PASSL/blob/main/docs/Train_CLIP_model.md"},{"title":"taited/clip-score","url":"https://github.com/taited/clip-score"},{"title":"azshue/TPT","url":"https://github.com/azshue/TPT"},{"title":"clip-italian/clip-italian","url":"https://github.com/clip-italian/clip-italian"},{"title":"dhansmair/flamingo-mini","url":"https://github.com/dhansmair/flamingo-mini"},{"title":"ylqi/count-anything","url":"https://github.com/ylqi/count-anything"},{"title":"ml-jku/cloob","url":"https://github.com/ml-jku/cloob"},{"title":"sberbank-ai/ru-clip","url":"https://github.com/sberbank-ai/ru-clip"},{"title":"ai-forever/ru-clip","url":"https://github.com/ai-forever/ru-clip"},{"title":"Kaushalya/medclip","url":"https://github.com/Kaushalya/medclip"},{"title":"ajayjain/vectorascent","url":"https://github.com/ajayjain/vectorascent"},{"title":"linjieli222/hero_video_feature_extractor","url":"https://github.com/linjieli222/hero_video_feature_extractor"},{"title":"borisdayma/clip-jax","url":"https://github.com/borisdayma/clip-jax"},{"title":"sajjjadayobi/CLIPfa","url":"https://github.com/sajjjadayobi/CLIPfa"},{"title":"mertyg/post-hoc-cbm","url":"https://github.com/mertyg/post-hoc-cbm"},{"title":"mlbio-epfl/turtle","url":"https://github.com/mlbio-epfl/turtle"},{"title":"rinnakk/japanese-clip","url":"https://github.com/rinnakk/japanese-clip"},{"title":"salesforce/pb-ovd","url":"https://github.com/salesforce/pb-ovd"},{"title":"facebookresearch/clip-rocket","url":"https://github.com/facebookresearch/clip-rocket"},{"title":"sincerass/mvlpt","url":"https://github.com/sincerass/mvlpt"},{"title":"ericyinyzy/vlattack","url":"https://github.com/ericyinyzy/vlattack"},{"title":"redcaps-dataset/redcaps-downloader","url":"https://github.com/redcaps-dataset/redcaps-downloader"},{"title":"bespontaneous/proteus-pytorch","url":"https://github.com/bespontaneous/proteus-pytorch"},{"title":"shunk031/simple-aesthetics-predictor","url":"https://github.com/shunk031/simple-aesthetics-predictor"},{"title":"giantseaweed/decree","url":"https://github.com/giantseaweed/decree"},{"title":"sithu31296/simple-object-tracking","url":"https://github.com/sithu31296/simple-object-tracking"},{"title":"Gahyeonkim09/AAPL","url":"https://github.com/Gahyeonkim09/AAPL"},{"title":"filipbasara0/simple-clip","url":"https://github.com/filipbasara0/simple-clip"},{"title":"michi-3000/eyeclip","url":"https://github.com/michi-3000/eyeclip"},{"title":"baskargroup/Arboretum","url":"https://github.com/baskargroup/Arboretum"},{"title":"baskargroup/biotrove","url":"https://github.com/baskargroup/biotrove"},{"title":"kynkaat/role-of-imagenet-classes-in-fid","url":"https://github.com/kynkaat/role-of-imagenet-classes-in-fid"},{"title":"SforAiDl/CountCLIP","url":"https://github.com/SforAiDl/CountCLIP"},{"title":"mainaksingha01/applenet","url":"https://github.com/mainaksingha01/applenet"},{"title":"zhangxu0963/npc","url":"https://github.com/zhangxu0963/npc"},{"title":"mainaksingha01/odg-clip","url":"https://github.com/mainaksingha01/odg-clip"},{"title":"jhaprince/multibully","url":"https://github.com/jhaprince/multibully"},{"title":"klemens-floege/oneprot","url":"https://github.com/klemens-floege/oneprot"},{"title":"leolee99/CLIP_ITM","url":"https://github.com/leolee99/CLIP_ITM"},{"title":"madrylab/pretraining-distribution-shift-robustness","url":"https://github.com/madrylab/pretraining-distribution-shift-robustness"},{"title":"AndresPMD/Clip_CMR","url":"https://github.com/AndresPMD/Clip_CMR"},{"title":"fastscience-ai/medflamingo","url":"https://github.com/fastscience-ai/medflamingo"},{"title":"buyeah1109/KEN","url":"https://github.com/buyeah1109/KEN"},{"title":"pseulki/rococo","url":"https://github.com/pseulki/rococo"},{"title":"shkarupa-alex/tfclip","url":"https://github.com/shkarupa-alex/tfclip"},{"title":"IMvision12/keras-vision-models","url":"https://github.com/IMvision12/keras-vision-models"},{"title":"brown-palm/ObjectPrompt","url":"https://github.com/brown-palm/ObjectPrompt"},{"title":"YvanG/VQGAN-CLIP","url":"https://github.com/YvanG/VQGAN-CLIP"},{"title":"ramanakshay/clip","url":"https://github.com/ramanakshay/clip"},{"title":"NYU-DICE-Lab/open_clip","url":"https://github.com/NYU-DICE-Lab/open_clip"},{"title":"shivammehta25/clip","url":"https://github.com/shivammehta25/clip"},{"title":"minhanh151/respro","url":"https://github.com/minhanh151/respro"},{"title":"nopperl/clip_arxiv_pmc","url":"https://github.com/nopperl/clip_arxiv_pmc"},{"title":"s-a-malik/multi-few","url":"https://github.com/s-a-malik/multi-few"},{"title":"prabhupad26/100daysofML","url":"https://github.com/prabhupad26/100daysofML"},{"title":"armaank/archlectures","url":"https://github.com/armaank/archlectures"},{"title":"minhanh151/pre","url":"https://github.com/minhanh151/pre"},{"title":"yuuun/clip_pytorch","url":"https://github.com/yuuun/clip_pytorch"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/clip"},{"title":"lunaproject22/rpa","url":"https://github.com/lunaproject22/rpa"},{"title":"fiabdu/Commonly-Interesting-Images","url":"https://github.com/fiabdu/Commonly-Interesting-Images"},{"title":"iejMac/ScriptWriter","url":"https://github.com/iejMac/ScriptWriter"},{"title":"ZackPashkin/text2cartoon-pytorch-CLIP","url":"https://github.com/ZackPashkin/text2cartoon-pytorch-CLIP"},{"title":"bruthyu/bpt-vlm","url":"https://github.com/bruthyu/bpt-vlm"},{"title":"buyeah1109/finc","url":"https://github.com/buyeah1109/finc"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/clip"},{"title":"eify/open_clip","url":"https://github.com/eify/open_clip"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/clip"},{"title":"a736875071/clip-vit-large-patch14","url":"https://github.com/a736875071/clip-vit-large-patch14"},{"title":"nahidalam/open_clip","url":"https://github.com/nahidalam/open_clip"}],"syntology":{"n":20,"n_ran":16,"n_unverified":4,"n_pointer_only":16}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-cn","slug":"zero-shot-transfer-image-classification-on-cn","dataset":"CN-ImageNet","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"InternVL-C","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_url":"/paper/internvl-scaling-up-vision-foundation-models","paper_date":"2023-12-21","arxiv_id":"2312.14238","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-7","slug":"zero-shot-transfer-image-classification-on-7","dataset":"ImageNet ReaL","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (Private)","Accuracy (Public)"],"first_row_in_archive_order":{"model":"LiT-tuning","paper_title":"LiT: Zero-Shot Transfer with Locked-image text Tuning","paper_url":"/paper/lit-zero-shot-transfer-with-locked-image-text","paper_date":"2021-11-15","arxiv_id":"2111.07991","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"google-research/vision_transformer","url":"https://github.com/google-research/vision_transformer"},{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"},{"title":"laion-ai/clip_benchmark","url":"https://github.com/laion-ai/clip_benchmark"},{"title":"eify/clip_benchmark","url":"https://github.com/eify/clip_benchmark"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-9","slug":"zero-shot-transfer-image-classification-on-9","dataset":"ImageNet-S","dataset_url":"/dataset/imagenet-s","rows_in_archive":1,"metrics":["Accuracy (Private)","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-cn-1","slug":"zero-shot-transfer-image-classification-on-cn-1","dataset":"CN-ImageNet-Sketch","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"AltCLIP","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","paper_url":"/paper/altclip-altering-the-language-encoder-in-clip","paper_date":"2022-11-12","arxiv_id":"2211.06679","code_links":[{"title":"flagai-open/flagai","url":"https://github.com/flagai-open/flagai"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/altclip"}],"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-cn-2","slug":"zero-shot-transfer-image-classification-on-cn-2","dataset":"CN-ImageNet-A","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"AltCLIP","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","paper_url":"/paper/altclip-altering-the-language-encoder-in-clip","paper_date":"2022-11-12","arxiv_id":"2211.06679","code_links":[{"title":"flagai-open/flagai","url":"https://github.com/flagai-open/flagai"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/altclip"}],"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-cn-3","slug":"zero-shot-transfer-image-classification-on-cn-3","dataset":"CN-ImageNet-R","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"AltCLIP","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","paper_url":"/paper/altclip-altering-the-language-encoder-in-clip","paper_date":"2022-11-12","arxiv_id":"2211.06679","code_links":[{"title":"flagai-open/flagai","url":"https://github.com/flagai-open/flagai"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/altclip"}],"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-transfer-image-classification-on-cn-4","slug":"zero-shot-transfer-image-classification-on-cn-4","dataset":"CN-ImageNet V2","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (Private)"],"first_row_in_archive_order":{"model":"AltCLIP","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","paper_url":"/paper/altclip-altering-the-language-encoder-in-clip","paper_date":"2022-11-12","arxiv_id":"2211.06679","code_links":[{"title":"flagai-open/flagai","url":"https://github.com/flagai-open/flagai"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/altclip"}],"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/imagenet","name":"ImageNet","full_name":"","num_papers_in_archive":15430},{"url":"/dataset/food-101","name":"Food-101","full_name":"","num_papers_in_archive":805},{"url":"/dataset/imagenet-r","name":"ImageNet-R","full_name":"ImageNet-Rendition","num_papers_in_archive":481},{"url":"/dataset/imagenet-a","name":"ImageNet-A","full_name":"","num_papers_in_archive":431},{"url":"/dataset/imagenet-sketch","name":"ImageNet-Sketch","full_name":"","num_papers_in_archive":268},{"url":"/dataset/objectnet","name":"ObjectNet","full_name":"","num_papers_in_archive":155},{"url":"/dataset/imagenet-s","name":"ImageNet-S","full_name":"ImageNet Semantic Segmentation","num_papers_in_archive":43},{"url":"/dataset/sun","name":"SUN","full_name":"SUN Database","num_papers_in_archive":31}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":16,"of":16,"tagged_in_all":19,"items":[{"url":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","arxiv_id":"2103.00020","repositories_listed":82,"syntology":{"n":20,"n_ran":16,"n_unverified":4,"n_pointer_only":16}},{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/lit-zero-shot-transfer-with-locked-image-text","title":"LiT: Zero-Shot Transfer with Locked-image text Tuning","date":"2021-11-15","arxiv_id":"2111.07991","repositories_listed":5,"syntology":null},{"url":"/paper/scaling-up-visual-and-vision-language","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","date":"2021-02-11","arxiv_id":"2102.05918","repositories_listed":5,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":9}},{"url":"/paper/your-diffusion-model-is-secretly-a-zero-shot","title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","date":"2023-03-28","arxiv_id":"2303.16203","repositories_listed":4,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/eva-clip-improved-training-techniques-for","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","date":"2023-03-27","arxiv_id":"2303.15389","repositories_listed":4,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/eva-clip-18b-scaling-clip-to-18-billion","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","date":"2024-02-06","arxiv_id":"2402.04252","repositories_listed":2,"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/internvl-scaling-up-vision-foundation-models","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","date":"2023-12-21","arxiv_id":"2312.14238","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/altclip-altering-the-language-encoder-in-clip","title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","date":"2022-11-12","arxiv_id":"2211.06679","repositories_listed":2,"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/florence-a-new-foundation-model-for-computer","title":"Florence: A New Foundation Model for Computer Vision","date":"2021-11-22","arxiv_id":"2111.11432","repositories_listed":2,"syntology":null},{"url":"/paper/boldsymbol-m-2-encoder-advancing-bilingual","title":"M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining","date":"2024-01-29","arxiv_id":"2401.15896","repositories_listed":1,"syntology":null},{"url":"/paper/distilling-large-vision-language-model-with","title":"Distilling Large Vision-Language Model with Out-of-Distribution Generalizability","date":"2023-07-06","arxiv_id":"2307.03135","repositories_listed":1,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/the-effectiveness-of-mae-pre-pretraining-for","title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","date":"2023-03-23","arxiv_id":"2303.13496","repositories_listed":1,"syntology":null},{"url":"/paper/scaling-vision-transformers-to-22-billion","title":"Scaling Vision Transformers to 22 Billion Parameters","date":"2023-02-10","arxiv_id":"2302.05442","repositories_listed":1,"syntology":null},{"url":"/paper/learning-customized-visual-models-with","title":"Learning Customized Visual Models with Retrieval-Augmented Knowledge","date":"2023-01-17","arxiv_id":"2301.07094","repositories_listed":1,"syntology":{"n":17,"n_ran":6,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/pali-a-jointly-scaled-multilingual-language","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","date":"2022-09-14","arxiv_id":"2209.06794","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}],"syntology_records":11,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}