{"url":"/dataset/oxford-iiit-pets","name":"Oxford-IIIT Pet Dataset","full_name":"Oxford-IIIT Pet Dataset","description_markdown":"The Oxford-IIIT Pet Dataset has 37 categories with roughly 200 images for each class. The images have a large variations in scale, pose and lighting. All images have an associated ground truth annotation of breed, head ROI, and pixel level trimap segmentation.\r\n\r\nAlso available on Academic torrent, Link is [here](https://academictorrents.com/details/b18bbd9ba03d50b0f7f479acc9f4228a408cecc1)\r\n\r\nSource: [https://www.robots.ox.ac.uk/~vgg/data/pets/](https://www.robots.ox.ac.uk/~vgg/data/pets/)\r\nImage Source: [https://www.robots.ox.ac.uk/~vgg/data/pets/](https://www.robots.ox.ac.uk/~vgg/data/pets/)","description_withheld":null,"homepage":"https://www.robots.ox.ac.uk/~vgg/data/pets/","introduced_date":"2022-06-19","introduced_date_note":null,"introduced_by":{"paper":null,"title":"Cats and dogs","first_author":null,"url":"https://doi.org/10.1109/CVPR.2012.6248092"},"license":{"name":"CC BY-SA 4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/"},"modalities":[{"name":"Images","url":"/datasets/modality/images"}],"tasks":[{"name":"Image Classification","url":"/task/image-classification","datasets_with_task":"/datasets/task/image-classification"},{"name":"Fine-Grained Image Classification","url":"/task/fine-grained-image-classification","datasets_with_task":"/datasets/task/fine-grained-image-classification"},{"name":"Neural Architecture Search","url":"/task/architecture-search","datasets_with_task":"/datasets/task/architecture-search"},{"name":"Prompt Engineering","url":"/task/prompt-engineering","datasets_with_task":"/datasets/task/prompt-engineering"},{"name":"Image Compression","url":"/task/image-compression","datasets_with_task":"/datasets/task/image-compression"}],"languages":[],"variants":["Oxford-IIIT Pet Dataset"],"data_loaders":[{"repo":"https://github.com/pytorch/vision","url":"https://pytorch.org/vision/stable/generated/torchvision.datasets.OxfordIIITPet.html","frameworks":["pytorch"]},{"repo":"https://github.com/tensorflow/datasets","url":"https://www.tensorflow.org/datasets/catalog/oxford_iiit_pet","frameworks":["tf","jax"]}],"num_papers_in_archive":90,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-1","task":"Fine-Grained Image Classification","dataset_variant":"Oxford-IIIT Pet Dataset","rows":15,"metrics":["Accuracy","Top-1 Error Rate","FLOPS","PARAMS"],"first_row_in_archive_order":{"model":"OmniVec2","paper":"/paper/omnivec2-a-novel-transformer-based-network","metrics":{"Accuracy":"99.6"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/prompt-engineering-on-oxford-iiit-pet-dataset","task":"Prompt Engineering","dataset_variant":"Oxford-IIIT Pet Dataset","rows":14,"metrics":["Harmonic mean"],"first_row_in_archive_order":{"model":"PromptKD","paper":"/paper/promptkd-unsupervised-prompt-distillation-for","metrics":{"Harmonic mean":"97.15"},"code_links":[{"title":"zhengli97/promptkd","url":"https://github.com/zhengli97/promptkd"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/image-classification-on-oxford-iiit-pets","task":"Image Classification","dataset_variant":"Oxford-IIIT Pet Dataset","rows":5,"metrics":["Accuracy","PARAMS","FLOPS"],"first_row_in_archive_order":{"model":"TWIST (ResNet-50)","paper":"/paper/self-supervised-learning-by-estimating-twin-1","metrics":{"Accuracy":"94.5"},"code_links":[{"title":"bytedance/TWIST","url":"https://github.com/bytedance/TWIST"},{"title":"beresandras/contrastive-classification-keras","url":"https://github.com/beresandras/contrastive-classification-keras"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/neural-architecture-search-on-oxford-iiit","task":"Neural Architecture Search","dataset_variant":"Oxford-IIIT Pet Dataset","rows":4,"metrics":["Accuracy (%)","FLOPS","PARAMS"],"first_row_in_archive_order":{"model":"NAT-M4","paper":"/paper/neural-architecture-transfer","metrics":{"Accuracy (%)":"94.3","FLOPS":"744M","PARAMS":"8.5M"},"code_links":[{"title":"human-analysis/neural-architecture-transfer","url":"https://github.com/human-analysis/neural-architecture-transfer"},{"title":"awesomelemon/encas","url":"https://github.com/awesomelemon/encas"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/image-compression-on-oxford-iiit-pets","task":"Image Compression","dataset_variant":"Oxford-IIIT Pet Dataset","rows":1,"metrics":["Bit rate"],"first_row_in_archive_order":{"model":"Lossyless Compressor","paper":"/paper/lossy-compression-for-lossless-prediction","metrics":{"Bit rate":"1210"},"code_links":[{"title":"YannDubs/lossyless","url":"https://github.com/YannDubs/lossyless"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/linear-attention-with-global-context-a-1","title":"Linear Attention with Global Context: A Multipole Attention Mechanism for Vision and Physics","date":"2025-07-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mmrl-parameter-efficient-and-interaction","title":"MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models","date":"2025-05-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mmrl-multi-modal-representation-learning-for","title":"MMRL: Multi-Modal Representation Learning for Vision-Language Models","date":"2025-03-11","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hpt-hierarchically-prompting-vision-language","title":"HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling","date":"2024-08-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/prompt-learning-via-meta-regularization","title":"Prompt Learning via Meta-Regularization","date":"2024-04-01","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/promptkd-unsupervised-prompt-distillation-for","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","date":"2024-03-05","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/omnivec2-a-novel-transformer-based-network","title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","date":"2024-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/learning-hierarchical-prompt-with-structured","title":"Learning Hierarchical Prompt with Structured Linguistic Knowledge for Vision-Language Models","date":"2023-12-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omnivec-learning-robust-representations-with","title":"OmniVec: Learning robust representations with cross modal sharing","date":"2023-11-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dept-decoupled-prompt-tuning","title":"DePT: Decoupled Prompt Tuning","date":"2023-09-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":4,"samples_unverified":4,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/read-only-prompt-optimization-for-vision","title":"Read-only Prompt Optimization for Vision-Language Few-shot Learning","date":"2023-08-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-regulating-prompts-foundational-model","title":"Self-regulating Prompts: Foundational Model Adaptation without Forgetting","date":"2023-07-13","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":7,"samples_unverified":14,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/consistency-guided-prompt-learning-for-vision","title":"Consistency-guided Prompt Learning for Vision-Language Models","date":"2023-06-01","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dinov2-learning-robust-visual-features","title":"DINOv2: Learning Robust Visual Features without Supervision","date":"2023-04-14","rows_on_this_dataset":1,"code_links":26,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":46,"samples_ran":21,"samples_unverified":25,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/fine-grained-visual-classification-via-2","title":"Fine-Grained Visual Classification via Internal Ensemble Learning Transformer","date":"2023-02-13","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-domain-invariant-prompt-for-vision","title":"Learning Domain Invariant Prompt for Vision-Language Models","date":"2022-12-08","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/maple-multi-modal-prompt-learning","title":"MaPLe: Multi-modal Prompt Learning","date":"2022-10-06","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/grouped-pointwise-convolutions-reduce","title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","date":"2022-06-30","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/bamboo-building-mega-scale-vision-dataset","title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","date":"2022-03-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/conditional-prompt-learning-for-vision","title":"Conditional Prompt Learning for Vision-Language Models","date":"2022-03-10","rows_on_this_dataset":1,"code_links":12,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vision-models-are-more-robust-and-fair-when","title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","date":"2022-02-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-learning-by-estimating-twin-1","title":"Self-Supervised Learning by Estimating Twin Class Distributions","date":"2021-10-14","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":5,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/grouped-pointwise-convolutions-significantly","title":"Grouped Pointwise Convolutions Significantly Reduces Parameters in EfficientNet","date":"2021-10-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/towards-fine-grained-image-classification","title":"Towards Fine-grained Image Classification with Generative Adversarial Networks and Facial Landmark Detection","date":"2021-08-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/autoformer-searching-transformers-for-visual","title":"AutoFormer: Searching Transformers for Visual Recognition","date":"2021-07-01","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/lossy-compression-for-lossless-prediction","title":"Lossy Compression for Lossless Prediction","date":"2021-06-21","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":2,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/effect-of-large-scale-pre-training-on-full","title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","date":"2021-05-31","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/with-a-little-help-from-my-friends-nearest","title":"With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations","date":"2021-04-29","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/transformer-in-transformer","title":"Transformer in Transformer","date":"2021-02-27","rows_on_this_dataset":1,"code_links":12,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":24,"samples_ran":16,"samples_unverified":8,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","rows_on_this_dataset":1,"code_links":82,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":16,"samples_unverified":4,"pointer_only_for_licence":16,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/scaling-up-visual-and-vision-language","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","date":"2021-02-11","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":8,"samples_unverified":2,"pointer_only_for_licence":9,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/neural-architecture-transfer","title":"Neural Architecture Transfer","date":"2020-05-12","rows_on_this_dataset":5,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/fixing-the-train-test-resolution-discrepancy","title":"Fixing the train-test resolution discrepancy","date":"2019-06-14","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/efficientnet-rethinking-model-scaling-for","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","date":"2019-05-28","rows_on_this_dataset":1,"code_links":144,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":302,"samples_ran":171,"samples_unverified":131,"pointer_only_for_licence":112,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/autoaugment-learning-augmentation-policies","title":"AutoAugment: Learning Augmentation Policies from Data","date":"2018-05-24","rows_on_this_dataset":1,"code_links":33,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":43,"samples_ran":6,"samples_unverified":37,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":21,"samples_harvested":551,"samples_ran":285,"samples_unverified":266,"pointer_only_for_licence":170,"papers_with_no_sample_that_ran":3,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}