{"url":"/sota/zero-shot-transfer-image-classification-on-3","task":{"name":"Zero-Shot Transfer Image Classification","url":"/task/zero-shot-transfer-image-classification","note":null},"dataset":{"name":"ImageNet V2","url":"/dataset/imagenet"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Accuracy (Private)","Accuracy (Public)"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Accuracy (Private)":"higher","Accuracy (Public)":"higher"}},"counts":{"rows":13,"rows_with_code":11,"rows_with_paper_page":12,"rows_dated":12,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"BASIC (Lion)","metrics":{"Accuracy (Private)":"81.2"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"LiT-22B","metrics":{"Accuracy (Private)":"80.9"},"uses_additional_data":false,"paper_date":"2023-02-10","paper":"/paper/scaling-vision-transformers-to-22-billion","paper_url":"https://arxiv.org/abs/2302.05442v1","paper_title":"Scaling Vision Transformers to 22 Billion Parameters","code":"https://github.com/lucidrains/flash-cosine-sim-attention","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"CoCa","metrics":{"Accuracy (Private)":"80.7"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"BASIC","metrics":{"Accuracy (Private)":"80.6"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/combined-scaling-for-zero-shot-transfer","paper_url":"https://arxiv.org/abs/2111.10050v3","paper_title":"Combined Scaling for Zero-shot Transfer Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"LiT ViT-e","metrics":{"Accuracy (Private)":"80.6"},"uses_additional_data":false,"paper_date":"2022-09-14","paper":"/paper/pali-a-jointly-scaled-multilingual-language","paper_url":"https://arxiv.org/abs/2209.06794v4","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"LiT-tuning","metrics":{"Accuracy (Private)":"78.7","Accuracy (Public)":" 66.6"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/lit-zero-shot-transfer-with-locked-image-text","paper_url":"https://arxiv.org/abs/2111.07991v3","paper_title":"LiT: Zero-Shot Transfer with Locked-image text Tuning","code":"https://github.com/mlfoundations/open_clip","n_code_links":5,"syntology":null},{"rank_in_archive_order":7,"model":"EVA-CLIP-18B","metrics":{"Accuracy (Private)":"77.9"},"uses_additional_data":false,"paper_date":"2024-02-06","paper":"/paper/eva-clip-18b-scaling-clip-to-18-billion","paper_url":"https://arxiv.org/abs/2402.04252v1","paper_title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","code":"https://github.com/baaivision/EVA/tree/master/EVA-CLIP-18B","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"InternVL-C","metrics":{"Accuracy (Private)":"77.3"},"uses_additional_data":false,"paper_date":"2023-12-21","paper":"/paper/internvl-scaling-up-vision-foundation-models","paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","code":"https://github.com/opengvlab/internvl","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":9,"model":"EVA-CLIP-E/14+","metrics":{"Accuracy (Private)":"75.7"},"uses_additional_data":false,"paper_date":"2023-03-27","paper":"/paper/eva-clip-improved-training-techniques-for","paper_url":"https://arxiv.org/abs/2303.15389v1","paper_title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","code":"https://github.com/baaivision/eva","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ALIGN","metrics":{"Accuracy (Private)":" 70.1","Accuracy (Public)":"-"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/scaling-up-visual-and-vision-language","paper_url":"https://arxiv.org/abs/2102.05918v2","paper_title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","code":"https://github.com/facebookresearch/metaclip","n_code_links":5,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":9}},{"rank_in_archive_order":11,"model":"CLIP","metrics":{"Accuracy (Private)":"70.1","Accuracy (Public)":"-"},"uses_additional_data":false,"paper_date":"2021-02-26","paper":"/paper/learning-transferable-visual-models-from","paper_url":"https://arxiv.org/abs/2103.00020v1","paper_title":"Learning Transferable Visual Models From Natural Language Supervision","code":"https://github.com/openai/CLIP","n_code_links":82,"syntology":{"n_ran":16,"n_unverified":4,"n_samples":20,"n_pointer_only_licence":16}},{"rank_in_archive_order":12,"model":"AltCLIP","metrics":{"Accuracy (Private)":"68.1"},"uses_additional_data":false,"paper_date":"2022-11-12","paper":"/paper/altclip-altering-the-language-encoder-in-clip","paper_url":"https://arxiv.org/abs/2211.06679v2","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","code":"https://github.com/flagai-open/flagai","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"PaLI","metrics":{"Accuracy (Private)":"64.46"},"uses_additional_data":false,"paper_date":"2022-09-14","paper":"/paper/pali-a-jointly-scaled-multilingual-language","paper_url":"https://arxiv.org/abs/2209.06794v4","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":9,"rows_with_any_sample_ran":8,"distinct_papers_with_graph_line":8,"distinct_papers_with_any_sample_ran":7,"samples_over_distinct_papers":{"n_ran":40,"n_unverified":34,"n_samples":74,"n_pointer_only_licence":27,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":42,"n_unverified":36,"n_samples":78,"n_pointer_only_licence":27,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}