{"url":"/task/image-retrieval","name":"Image Retrieval","slug":"image-retrieval","description_markdown":"**Image Retrieval** is a fundamental and long-standing computer vision task that involves finding images similar to a given query from a large database. It is often considered a form of fine-grained, instance-level classification. The task is integral to image recognition alongside [classification](/task/image-classification) and [cross-modal retrieval](/task/cross-modal-retrieva). By leveraging visual similarity and other criteria, image retrieval enables users to efficiently discover relevant images, making it a crucial tool in applications such as search and recommendation.\r\n\r\n<span class=\"description-source\">[Extending CLIP for Category-to-image Retrieval in E-commerce](https://arxiv.org/abs/2112.11294)</span>\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [DELF](https://github.com/tensorflow/models/tree/master/research/delf) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2239,"papers_with_code":835,"benchmarks":56,"benchmark_tables_in_archive":56,"benchmark_tables_shown":56,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":87,"subtasks":10,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/image-retrieval-on-roxford-hard","slug":"image-retrieval-on-roxford-hard","dataset":"ROxford (Hard)","dataset_url":"/dataset/roxford","rows_in_archive":23,"metrics":["mAP"],"first_row_in_archive_order":{"model":"SuperGlobal","paper_title":"Global Features are All You Need for Image Retrieval and Reranking","paper_url":"/paper/global-features-are-all-you-need-for-image","paper_date":"2023-08-14","arxiv_id":"2308.06954","code_links":[{"title":"shihaoshao-gh/superglobal","url":"https://github.com/shihaoshao-gh/superglobal"},{"title":"edwardguil/CVNet","url":"https://github.com/edwardguil/CVNet"}],"syntology":{"n":18,"n_ran":13,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-roxford-medium","slug":"image-retrieval-on-roxford-medium","dataset":"ROxford (Medium)","dataset_url":"/dataset/roxford","rows_in_archive":23,"metrics":["mAP"],"first_row_in_archive_order":{"model":"AMES","paper_title":"AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level Retrieval","paper_url":"/paper/2408-03282","paper_date":"2024-08-06","arxiv_id":"2408.03282","code_links":[{"title":"pavelsuma/ames","url":"https://github.com/pavelsuma/ames"}],"syntology":{"n":13,"n_ran":13,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-rparis-hard","slug":"image-retrieval-on-rparis-hard","dataset":"RParis (Hard)","dataset_url":null,"rows_in_archive":23,"metrics":["mAP"],"first_row_in_archive_order":{"model":"AMES","paper_title":"AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level Retrieval","paper_url":"/paper/2408-03282","paper_date":"2024-08-06","arxiv_id":"2408.03282","code_links":[{"title":"pavelsuma/ames","url":"https://github.com/pavelsuma/ames"}],"syntology":{"n":13,"n_ran":13,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-rparis-medium","slug":"image-retrieval-on-rparis-medium","dataset":"RParis (Medium)","dataset_url":null,"rows_in_archive":23,"metrics":["mAP"],"first_row_in_archive_order":{"model":"AMES","paper_title":"AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level Retrieval","paper_url":"/paper/2408-03282","paper_date":"2024-08-06","arxiv_id":"2408.03282","code_links":[{"title":"pavelsuma/ames","url":"https://github.com/pavelsuma/ames"}],"syntology":{"n":13,"n_ran":13,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-crepe-vision-language","slug":"image-retrieval-on-crepe-vision-language","dataset":"CREPE (Compositional REPresentation Evaluation)","dataset_url":"/dataset/crepe-vision-language","rows_in_archive":22,"metrics":["Recall@1 (HN-Atom + HN-Comp, SC)","Recall@1 (HN-Atom + HN-Comp, UC)","Recall@1 (HN-Atom, UC)","Recall@1 (HN-Comp, UC)"],"first_row_in_archive_order":{"model":"ViT-L-14 (LAION400M)","paper_title":"CREPE: Can Vision-Language Foundation Models Reason Compositionally?","paper_url":"/paper/crepe-can-vision-language-foundation-models","paper_date":"2022-12-13","arxiv_id":"2212.07796","code_links":[{"title":"raivnlab/crepe","url":"https://github.com/raivnlab/crepe"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/image-retrieval-on-fashion-iq","slug":"image-retrieval-on-fashion-iq","dataset":"Fashion IQ","dataset_url":"/dataset/fashion-iq","rows_in_archive":22,"metrics":["(Recall@10+Recall@50)/2","Recall@10"],"first_row_in_archive_order":{"model":"DQU-CIR","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-flickr30k-1k-test","slug":"image-retrieval-on-flickr30k-1k-test","dataset":"Flickr30K 1K test","dataset_url":"/dataset/flickr30k","rows_in_archive":18,"metrics":["R@1","R@5","R@10"],"first_row_in_archive_order":{"model":"X-VLM (base)","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","paper_url":"/paper/multi-grained-vision-language-pre-training","paper_date":"2021-11-16","arxiv_id":"2111.08276","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-cirr","slug":"image-retrieval-on-cirr","dataset":"CIRR","dataset_url":"/dataset/cirr","rows_in_archive":17,"metrics":["(Recall@5+Recall_subset@1)/2","Recall@10"],"first_row_in_archive_order":{"model":"TMCIR","paper_title":"TMCIR: Token Merge Benefits Composed Image Retrieval","paper_url":"/paper/tmcir-token-merge-benefits-composed-image","paper_date":"2025-04-15","arxiv_id":"2504.10995","code_links":[],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-sop","slug":"image-retrieval-on-sop","dataset":"SOP","dataset_url":"/dataset/stanford-online-products","rows_in_archive":14,"metrics":["R@1"],"first_row_in_archive_order":{"model":"Unicom+ViT-L@336px","paper_title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","paper_url":"/paper/unicom-universal-and-compact-representation","paper_date":"2023-04-12","arxiv_id":"2304.05884","code_links":[{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"},{"title":"RocketFlash/easy_metric_learning","url":"https://github.com/RocketFlash/easy_metric_learning/tree/master/tools"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":6}}},{"leaderboard":"/sota/image-retrieval-on-flickr30k-cn","slug":"image-retrieval-on-flickr30k-cn","dataset":"Flickr30k-CN","dataset_url":"/dataset/flickr30k-cna","rows_in_archive":11,"metrics":["R@1","R@10","R@5"],"first_row_in_archive_order":{"model":"InternVL-G-FT","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_url":"/paper/internvl-scaling-up-vision-foundation-models","paper_date":"2023-12-21","arxiv_id":"2312.14238","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/image-retrieval-on-oxf5k","slug":"image-retrieval-on-oxf5k","dataset":"Oxf5k","dataset_url":null,"rows_in_archive":11,"metrics":["MAP"],"first_row_in_archive_order":{"model":"Offline Diffusion","paper_title":"Efficient Image Retrieval via Decoupling Diffusion into Online and Offline Processing","paper_url":"/paper/efficient-image-retrieval-via-decoupling","paper_date":"2018-11-27","arxiv_id":"1811.10907","code_links":[{"title":"fyang93/diffusion","url":"https://github.com/fyang93/diffusion"},{"title":"chjort/diffusion","url":"https://github.com/chjort/diffusion"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-inaturalist","slug":"image-retrieval-on-inaturalist","dataset":"iNaturalist","dataset_url":"/dataset/inaturalist","rows_in_archive":10,"metrics":["R@1","R@16","R@32","R@5"],"first_row_in_archive_order":{"model":"Unicom+ViT-L@336px","paper_title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","paper_url":"/paper/unicom-universal-and-compact-representation","paper_date":"2023-04-12","arxiv_id":"2304.05884","code_links":[{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"},{"title":"RocketFlash/easy_metric_learning","url":"https://github.com/RocketFlash/easy_metric_learning/tree/master/tools"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":6}}},{"leaderboard":"/sota/image-retrieval-on-coco-cn","slug":"image-retrieval-on-coco-cn","dataset":"COCO-CN","dataset_url":"/dataset/coco-cn","rows_in_archive":9,"metrics":["R@1","R@10","R@5"],"first_row_in_archive_order":{"model":"CN-CLIP (ViT-H/14)","paper_title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","paper_url":"/paper/chinese-clip-contrastive-vision-language","paper_date":"2022-11-02","arxiv_id":"2211.01335","code_links":[{"title":"ofa-sys/chinese-clip","url":"https://github.com/ofa-sys/chinese-clip"}],"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-flickr30k","slug":"image-retrieval-on-flickr30k","dataset":"Flickr30k","dataset_url":"/dataset/flickr30k","rows_in_archive":9,"metrics":["Recall@10","Recall@5","Recall@1","Recall@Sum","Image-to-text R@1","Image-to-text R@10","Image-to-text R@5","QPS"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G (zero-shot, 1K test set)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-retrieval-on-muge-retrieval","slug":"image-retrieval-on-muge-retrieval","dataset":"MUGE Retrieval","dataset_url":null,"rows_in_archive":9,"metrics":["Mean Recall","R@1","R@10","R@5"],"first_row_in_archive_order":{"model":"CN-CLIP (ViT-H/14)","paper_title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","paper_url":"/paper/chinese-clip-contrastive-vision-language","paper_date":"2022-11-02","arxiv_id":"2211.01335","code_links":[{"title":"ofa-sys/chinese-clip","url":"https://github.com/ofa-sys/chinese-clip"}],"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-oxf105k","slug":"image-retrieval-on-oxf105k","dataset":"Oxf105k","dataset_url":null,"rows_in_archive":9,"metrics":["MAP"],"first_row_in_archive_order":{"model":"Offline Diffusion","paper_title":"Efficient Image Retrieval via Decoupling Diffusion into Online and Offline Processing","paper_url":"/paper/efficient-image-retrieval-via-decoupling","paper_date":"2018-11-27","arxiv_id":"1811.10907","code_links":[{"title":"fyang93/diffusion","url":"https://github.com/fyang93/diffusion"},{"title":"chjort/diffusion","url":"https://github.com/chjort/diffusion"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-cars196","slug":"image-retrieval-on-cars196","dataset":"CARS196","dataset_url":"/dataset/cars196","rows_in_archive":8,"metrics":["R@1","R@8"],"first_row_in_archive_order":{"model":"CGD (MG/SG)","paper_title":"Combination of Multiple Global Descriptors for Image Retrieval","paper_url":"/paper/combination-of-multiple-global-descriptors","paper_date":"2019-03-26","arxiv_id":"1903.10663","code_links":[{"title":"naver/cgd","url":"https://github.com/naver/cgd"},{"title":"leftthomas/CGD","url":"https://github.com/leftthomas/CGD"},{"title":"clovaai/embedding-expansion","url":"https://github.com/clovaai/embedding-expansion"},{"title":"flyingsheepbin/pet-biometrics","url":"https://github.com/flyingsheepbin/pet-biometrics"},{"title":"puneesh00/loop","url":"https://github.com/puneesh00/loop"},{"title":"PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval","url":"https://github.com/PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval"},{"title":"Samjoel3101/Self-Supervised-Learning-fastai2","url":"https://github.com/Samjoel3101/Self-Supervised-Learning-fastai2"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-cub-200-2011","slug":"image-retrieval-on-cub-200-2011","dataset":"CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":8,"metrics":["R@1","R@2","R@4","R@8"],"first_row_in_archive_order":{"model":"CGD (MG/SG)","paper_title":"Combination of Multiple Global Descriptors for Image Retrieval","paper_url":"/paper/combination-of-multiple-global-descriptors","paper_date":"2019-03-26","arxiv_id":"1903.10663","code_links":[{"title":"naver/cgd","url":"https://github.com/naver/cgd"},{"title":"leftthomas/CGD","url":"https://github.com/leftthomas/CGD"},{"title":"clovaai/embedding-expansion","url":"https://github.com/clovaai/embedding-expansion"},{"title":"flyingsheepbin/pet-biometrics","url":"https://github.com/flyingsheepbin/pet-biometrics"},{"title":"puneesh00/loop","url":"https://github.com/puneesh00/loop"},{"title":"PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval","url":"https://github.com/PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval"},{"title":"Samjoel3101/Self-Supervised-Learning-fastai2","url":"https://github.com/Samjoel3101/Self-Supervised-Learning-fastai2"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-in-shop","slug":"image-retrieval-on-in-shop","dataset":"In-Shop","dataset_url":"/dataset/in-shop","rows_in_archive":7,"metrics":["R@1"],"first_row_in_archive_order":{"model":"CGD (SG/GS)","paper_title":"Combination of Multiple Global Descriptors for Image Retrieval","paper_url":"/paper/combination-of-multiple-global-descriptors","paper_date":"2019-03-26","arxiv_id":"1903.10663","code_links":[{"title":"naver/cgd","url":"https://github.com/naver/cgd"},{"title":"leftthomas/CGD","url":"https://github.com/leftthomas/CGD"},{"title":"clovaai/embedding-expansion","url":"https://github.com/clovaai/embedding-expansion"},{"title":"flyingsheepbin/pet-biometrics","url":"https://github.com/flyingsheepbin/pet-biometrics"},{"title":"puneesh00/loop","url":"https://github.com/puneesh00/loop"},{"title":"PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval","url":"https://github.com/PuchatekwSzortach/combination_of_multiple_global_descriptors_for_image_retrieval"},{"title":"Samjoel3101/Self-Supervised-Learning-fastai2","url":"https://github.com/Samjoel3101/Self-Supervised-Learning-fastai2"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-par106k","slug":"image-retrieval-on-par106k","dataset":"Par106k","dataset_url":null,"rows_in_archive":7,"metrics":["mAP"],"first_row_in_archive_order":{"model":"Offline Diffusion","paper_title":"Efficient Image Retrieval via Decoupling Diffusion into Online and Offline Processing","paper_url":"/paper/efficient-image-retrieval-via-decoupling","paper_date":"2018-11-27","arxiv_id":"1811.10907","code_links":[{"title":"fyang93/diffusion","url":"https://github.com/fyang93/diffusion"},{"title":"chjort/diffusion","url":"https://github.com/chjort/diffusion"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-par6k","slug":"image-retrieval-on-par6k","dataset":"Par6k","dataset_url":null,"rows_in_archive":7,"metrics":["mAP"],"first_row_in_archive_order":{"model":"Offline Diffusion","paper_title":"Efficient Image Retrieval via Decoupling Diffusion into Online and Offline Processing","paper_url":"/paper/efficient-image-retrieval-via-decoupling","paper_date":"2018-11-27","arxiv_id":"1811.10907","code_links":[{"title":"fyang93/diffusion","url":"https://github.com/fyang93/diffusion"},{"title":"chjort/diffusion","url":"https://github.com/chjort/diffusion"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-coco","slug":"image-retrieval-on-coco","dataset":"COCO (Common Objects in Context)","dataset_url":"/dataset/coco","rows_in_archive":6,"metrics":["recall@1","recall@5","Recall@10","QPS"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G (fine-tuned)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-retrieval-on-amstertime","slug":"image-retrieval-on-amstertime","dataset":"AmsterTime","dataset_url":"/dataset/amstertime","rows_in_archive":5,"metrics":["mAP"],"first_row_in_archive_order":{"model":"DINOv2 distilled (ViT-L/14 frozen)","paper_title":"DINOv2: Learning Robust Visual Features without Supervision","paper_url":"/paper/dinov2-learning-robust-visual-features","paper_date":"2023-04-14","arxiv_id":"2304.07193","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"facebookresearch/dinov2","url":"https://github.com/facebookresearch/dinov2"},{"title":"roboflow/rf-detr","url":"https://github.com/roboflow/rf-detr"},{"title":"open-edge-platform/training_extensions","url":"https://github.com/open-edge-platform/training_extensions"},{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"leondgarse/keras_cv_attention_models","url":"https://github.com/leondgarse/keras_cv_attention_models/tree/main/keras_cv_attention_models/beit"},{"title":"fabio-sim/Depth-Anything-ONNX","url":"https://github.com/fabio-sim/Depth-Anything-ONNX"},{"title":"open-edge-platform/geti","url":"https://github.com/open-edge-platform/geti"},{"title":"facebookresearch/highrescanopyheight","url":"https://github.com/facebookresearch/highrescanopyheight"},{"title":"PaddlePaddle/PASSL","url":"https://github.com/PaddlePaddle/PASSL"},{"title":"beneroth13/dinov2","url":"https://github.com/beneroth13/dinov2"},{"title":"mohammedsb/dinov2formedical","url":"https://github.com/mohammedsb/dinov2formedical"},{"title":"marrlab/dinobloom","url":"https://github.com/marrlab/dinobloom"},{"title":"bespontaneous/proteus-pytorch","url":"https://github.com/bespontaneous/proteus-pytorch"},{"title":"ByungKwanLee/Causal-Unsupervised-Segmentation","url":"https://github.com/ByungKwanLee/Causal-Unsupervised-Segmentation"},{"title":"zhu-xlab/softcon","url":"https://github.com/zhu-xlab/softcon"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"gorkaydemir/DINOSAUR","url":"https://github.com/gorkaydemir/DINOSAUR"},{"title":"seatizendoi/dinovdeau","url":"https://github.com/seatizendoi/dinovdeau"},{"title":"BurguerJohn/global_perceptual_similarity_loss","url":"https://github.com/BurguerJohn/global_perceptual_similarity_loss"},{"title":"buyeah1109/KEN","url":"https://github.com/buyeah1109/KEN"},{"title":"JHKim-snu/PGA","url":"https://github.com/JHKim-snu/PGA"},{"title":"BurguerJohn/torch-felix","url":"https://github.com/BurguerJohn/torch-felix"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/dinov2"},{"title":"buyeah1109/finc","url":"https://github.com/buyeah1109/finc"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/dinov2"}],"syntology":{"n":46,"n_ran":21,"n_unverified":25,"n_pointer_only":12}}},{"leaderboard":"/sota/image-retrieval-on-conqa-conceptual","slug":"image-retrieval-on-conqa-conceptual","dataset":"ConQA Conceptual","dataset_url":"/dataset/conqa","rows_in_archive":5,"metrics":["Recall@1","Recall@5","Recall@10","R-precision"],"first_row_in_archive_order":{"model":"CLIP","paper_title":"Does the Performance of Text-to-Image Retrieval Models Generalize Beyond Captions-as-a-Query?","paper_url":"/paper/does-the-performance-of-text-to-image","paper_date":"2024-03-15","arxiv_id":null,"code_links":[{"title":"AU-DIS/ConQA","url":"https://github.com/AU-DIS/ConQA"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-conqa-descriptive","slug":"image-retrieval-on-conqa-descriptive","dataset":"ConQA Descriptive","dataset_url":"/dataset/conqa","rows_in_archive":5,"metrics":["Recall@1","Recall@5","Recall@10","R-precision"],"first_row_in_archive_order":{"model":"CLIP","paper_title":"Does the Performance of Text-to-Image Retrieval Models Generalize Beyond Captions-as-a-Query?","paper_url":"/paper/does-the-performance-of-text-to-image","paper_date":"2024-03-15","arxiv_id":null,"code_links":[{"title":"AU-DIS/ConQA","url":"https://github.com/AU-DIS/ConQA"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-photochat","slug":"image-retrieval-on-photochat","dataset":"PhotoChat","dataset_url":"/dataset/photochat","rows_in_archive":5,"metrics":["R1","R@10","R@5","Sum(R@1,5,10)"],"first_row_in_archive_order":{"model":"PaCE","paper_title":"PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts","paper_url":"/paper/pace-unified-multi-modal-dialogue-pre","paper_date":"2023-05-24","arxiv_id":"2305.14839","code_links":[{"title":"AlibabaResearch/DAMO-ConvAI","url":"https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/pace"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-deepfashion-consumer-to","slug":"image-retrieval-on-deepfashion-consumer-to","dataset":"DeepFashion - Consumer-to-shop","dataset_url":null,"rows_in_archive":4,"metrics":["mAP","Rank-1","Rank-10","Rank-20","Rank-50"],"first_row_in_archive_order":{"model":"CTL Model (ResNet50-IBN-A, 320x320)","paper_title":"On the Unreasonable Effectiveness of Centroids in Image Retrieval","paper_url":"/paper/on-the-unreasonable-effectiveness-of-1","paper_date":"2021-04-28","arxiv_id":"2104.13643","code_links":[{"title":"mikwieczorek/centroids-reid","url":"https://github.com/mikwieczorek/centroids-reid"},{"title":"lannguyen0910/deep-efficient-reid","url":"https://github.com/lannguyen0910/deep-efficient-reid"},{"title":"lannguyen0910/deep-efficient-person-reid","url":"https://github.com/lannguyen0910/deep-efficient-person-reid"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-deeppatent","slug":"image-retrieval-on-deeppatent","dataset":"DeepPatent","dataset_url":"/dataset/deeppatent","rows_in_archive":4,"metrics":["mean average precision"],"first_row_in_archive_order":{"model":"SwinV2","paper_title":"Patent image retrieval using transformer-based deep metric learning","paper_url":"/paper/patent-image-retrieval-using-transformer","paper_date":"2023-09-01","arxiv_id":null,"code_links":[{"title":"L4Clippers/Patent-Image-Retrieval-Transformer-DML","url":"https://github.com/L4Clippers/Patent-Image-Retrieval-Transformer-DML"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-google-landmarks-dataset","slug":"image-retrieval-on-google-landmarks-dataset","dataset":"Google Landmarks Dataset v2 (retrieval, testing)","dataset_url":"/dataset/google-landmarks-dataset-v2","rows_in_archive":4,"metrics":["mAP@100"],"first_row_in_archive_order":{"model":"AMES","paper_title":"AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level Retrieval","paper_url":"/paper/2408-03282","paper_date":"2024-08-06","arxiv_id":"2408.03282","code_links":[{"title":"pavelsuma/ames","url":"https://github.com/pavelsuma/ames"}],"syntology":{"n":13,"n_ran":13,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-24-7-tokyo","slug":"image-retrieval-on-24-7-tokyo","dataset":"24/7 Tokyo","dataset_url":null,"rows_in_archive":3,"metrics":["mAP"],"first_row_in_archive_order":{"model":"HED-N-GAN","paper_title":"Dark Side Augmentation: Generating Diverse Night Examples for Metric Learning","paper_url":"/paper/dark-side-augmentation-generating-diverse-1","paper_date":"2023-09-28","arxiv_id":"2309.16351","code_links":[{"title":"mohwald/gandtr","url":"https://github.com/mohwald/gandtr"}],"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-exact-street2shop","slug":"image-retrieval-on-exact-street2shop","dataset":"Exact Street2Shop","dataset_url":"/dataset/exact-street2shop","rows_in_archive":3,"metrics":["Rank-1","Rank-10","Rank-20","mAP","Rank-50"],"first_row_in_archive_order":{"model":"CTL Model (ResNet50-IBN-A, 320x320)","paper_title":"On the Unreasonable Effectiveness of Centroids in Image Retrieval","paper_url":"/paper/on-the-unreasonable-effectiveness-of-1","paper_date":"2021-04-28","arxiv_id":"2104.13643","code_links":[{"title":"mikwieczorek/centroids-reid","url":"https://github.com/mikwieczorek/centroids-reid"},{"title":"lannguyen0910/deep-efficient-reid","url":"https://github.com/lannguyen0910/deep-efficient-reid"},{"title":"lannguyen0910/deep-efficient-person-reid","url":"https://github.com/lannguyen0910/deep-efficient-person-reid"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-google-landmarks-dataset-1","slug":"image-retrieval-on-google-landmarks-dataset-1","dataset":"Google Landmarks Dataset v2 (retrieval, validation)","dataset_url":"/dataset/google-landmarks-dataset-v2","rows_in_archive":3,"metrics":["mAP@100"],"first_row_in_archive_order":{"model":"UNICOM-ViT-L-14-512px","paper_title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","paper_url":"/paper/unicom-universal-and-compact-representation","paper_date":"2023-04-12","arxiv_id":"2304.05884","code_links":[{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"},{"title":"RocketFlash/easy_metric_learning","url":"https://github.com/RocketFlash/easy_metric_learning/tree/master/tools"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":6}}},{"leaderboard":"/sota/image-retrieval-on-lasco","slug":"image-retrieval-on-lasco","dataset":"LaSCo","dataset_url":"/dataset/lasco","rows_in_archive":3,"metrics":["Recall@1 (%)"],"first_row_in_archive_order":{"model":"CASE","paper_title":"Data Roaming and Quality Assessment for Composed Image Retrieval","paper_url":"/paper/data-roaming-and-early-fusion-for-composed","paper_date":"2023-03-16","arxiv_id":"2303.09429","code_links":[{"title":"levymsn/LaSCo","url":"https://github.com/levymsn/LaSCo"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-mscoco","slug":"image-retrieval-on-mscoco","dataset":"MSCOCO","dataset_url":"/dataset/mscoco","rows_in_archive":3,"metrics":["Recall@1","Recall@10","Recall@5"],"first_row_in_archive_order":{"model":"HADA","paper_title":"HADA: A Graph-based Amalgamation Framework in Image-text Retrieval","paper_url":"/paper/hada-a-graph-based-amalgamation-framework-in","paper_date":"2023-01-11","arxiv_id":"2301.04742","code_links":[{"title":"m2man/hada","url":"https://github.com/m2man/hada"},{"title":"m2man/HADA-LAVIS","url":"https://github.com/m2man/HADA-LAVIS"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-aic-icc","slug":"image-retrieval-on-aic-icc","dataset":"AIC-ICC","dataset_url":null,"rows_in_archive":2,"metrics":["Recall@1","Recall@10","Recall@5"],"first_row_in_archive_order":{"model":"ERNIE-ViL2.0","paper_title":"ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training","paper_url":"/paper/ernie-vil-2-0-multi-view-contrastive-learning","paper_date":"2022-09-30","arxiv_id":"2209.15270","code_links":[{"title":"PaddlePaddle/ERNIE","url":"https://github.com/PaddlePaddle/ERNIE"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-cbvs","slug":"image-retrieval-on-cbvs","dataset":"CBVS","dataset_url":"/dataset/cbvs","rows_in_archive":2,"metrics":["PNR","Recall@1"],"first_row_in_archive_order":{"model":"UniCLP","paper_title":"CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios","paper_url":"/paper/cbvs-a-large-scale-chinese-image-text","paper_date":"2024-01-19","arxiv_id":"2401.10475","code_links":[{"title":"QQBrowserVideoSearch/CBVS-UniCLIP","url":"https://github.com/QQBrowserVideoSearch/CBVS-UniCLIP"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-inria-holidays","slug":"image-retrieval-on-inria-holidays","dataset":"INRIA Holidays","dataset_url":null,"rows_in_archive":2,"metrics":["Mean mAP"],"first_row_in_archive_order":{"model":"MultiGrain R50 @ 800","paper_title":"MultiGrain: a unified image embedding for classes and instances","paper_url":"/paper/multigrain-a-unified-image-embedding-for","paper_date":"2019-02-14","arxiv_id":"1902.05509","code_links":[{"title":"facebookresearch/multigrain","url":"https://github.com/facebookresearch/multigrain"},{"title":"2023-MindSpore-1/ms-code-62","url":"https://github.com/2023-MindSpore-1/ms-code-62"},{"title":"leehangyu/MultiGrain_Application","url":"https://github.com/leehangyu/MultiGrain_Application"}],"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-oxford5k","slug":"image-retrieval-on-oxford5k","dataset":"Oxford5k","dataset_url":"/dataset/oxford5k","rows_in_archive":2,"metrics":["mAP"],"first_row_in_archive_order":{"model":"GNN-Reranking","paper_title":"Understanding Image Retrieval Re-Ranking: A Graph Neural Network Perspective","paper_url":"/paper/understanding-image-retrieval-re-ranking-a","paper_date":"2020-12-14","arxiv_id":"2012.07620","code_links":[{"title":"Xuanmeng-Zhang/gnn-re-ranking","url":"https://github.com/Xuanmeng-Zhang/gnn-re-ranking"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-paris6k","slug":"image-retrieval-on-paris6k","dataset":"Paris6k","dataset_url":"/dataset/paris6k","rows_in_archive":2,"metrics":["mAP"],"first_row_in_archive_order":{"model":"IME layer","paper_title":"Iterative Manifold Embedding Layer Learned by Incomplete Data for Large-scale Image Retrieval","paper_url":"/paper/iterative-manifold-embedding-layer-learned-by","paper_date":"2017-07-14","arxiv_id":"1707.09862","code_links":[{"title":"XJhaoren/IME_layer","url":"https://github.com/XJhaoren/IME_layer"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-street2shop-topwear","slug":"image-retrieval-on-street2shop-topwear","dataset":"street2shop - topwear","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Ranknet","paper_title":"Retrieving Similar E-Commerce Images Using Deep Learning","paper_url":"/paper/retrieving-similar-e-commerce-images-using","paper_date":"2019-01-11","arxiv_id":"1901.03546","code_links":[{"title":"gofynd/mildnet","url":"https://github.com/gofynd/mildnet"},{"title":"khatria/Retrieving-Similar-E-Commerce-Images-Using-Deep-Learning","url":"https://github.com/khatria/Retrieving-Similar-E-Commerce-Images-Using-Deep-Learning"},{"title":"Ducvoccer/mildnet","url":"https://github.com/Ducvoccer/mildnet"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-wit","slug":"image-retrieval-on-wit","dataset":"WIT","dataset_url":"/dataset/wit","rows_in_archive":2,"metrics":["R@1","R@5"],"first_row_in_archive_order":{"model":"WIT-ALL","paper_title":"WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine Learning","paper_url":"/paper/wit-wikipedia-based-image-text-dataset-for","paper_date":"2021-03-02","arxiv_id":"2103.01913","code_links":[{"title":"google-research-datasets/wit","url":"https://github.com/google-research-datasets/wit"},{"title":"clip-italian/clip-italian","url":"https://github.com/clip-italian/clip-italian"},{"title":"paullerner/viquae","url":"https://github.com/paullerner/viquae"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-cifar-10","slug":"image-retrieval-on-cifar-10","dataset":"CIFAR-10","dataset_url":"/dataset/cifar-10","rows_in_archive":1,"metrics":["Average-mAP"],"first_row_in_archive_order":{"model":"Custom: 3 conv + 2 fcn","paper_title":"Deep Supervised Hashing for Fast Image Retrieval","paper_url":"/paper/deep-supervised-hashing-for-fast-image","paper_date":"2016-06-01","arxiv_id":null,"code_links":[{"title":"bgswaroop/deep-hashing","url":"https://github.com/bgswaroop/deep-hashing"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-cofar","slug":"image-retrieval-on-cofar","dataset":"COFAR","dataset_url":"/dataset/cofar","rows_in_archive":1,"metrics":["Recall@1","Recall@5"],"first_row_in_archive_order":{"model":"KRAMT","paper_title":"COFAR: Commonsense and Factual Reasoning in Image Search","paper_url":"/paper/cofar-commonsense-and-factual-reasoning-in","paper_date":"2022-10-16","arxiv_id":"2210.08554","code_links":[{"title":"vl2g/cofar","url":"https://github.com/vl2g/cofar"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-deepfashion","slug":"image-retrieval-on-deepfashion","dataset":"DeepFashion","dataset_url":"/dataset/deepfashion","rows_in_archive":1,"metrics":["Recall@20"],"first_row_in_archive_order":{"model":"RCCapsNet","paper_title":"Fashion Image Retrieval with Capsule Networks","paper_url":"/paper/fashion-image-retrieval-with-capsule-networks","paper_date":"2019-08-26","arxiv_id":"1908.09943","code_links":[{"title":"birdortyedi/image-retrieval-with-capsules","url":"https://github.com/birdortyedi/image-retrieval-with-capsules"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-feta-car-manuals","slug":"image-retrieval-on-feta-car-manuals","dataset":"FETA Car-Manuals","dataset_url":"/dataset/feta-car-manuals","rows_in_archive":1,"metrics":["R@1","R@10","R@5"],"first_row_in_archive_order":{"model":"FETA's CLIP-MIL (Many-Shot Image-to-text)","paper_title":"FETA: Towards Specializing Foundation Models for Expert Task Applications","paper_url":"/paper/feta-towards-specializing-foundation-models","paper_date":"2022-09-08","arxiv_id":"2209.03648","code_links":[{"title":"alfassy/FETA","url":"https://github.com/alfassy/FETA"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-foodi-ml-global","slug":"image-retrieval-on-foodi-ml-global","dataset":"FooDI-ML (Global)","dataset_url":"/dataset/foodi-ml","rows_in_archive":1,"metrics":["A-R@1","A-R@10","A-R@5","Re-R@1","Re-R@10","Re-R@5"],"first_row_in_archive_order":{"model":"ADAPT-I2T","paper_title":"FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptions","paper_url":"/paper/foodi-ml-a-large-multi-language-dataset-of","paper_date":"2021-10-05","arxiv_id":"2110.02035","code_links":[{"title":"glovo/foodi-ml-dataset","url":"https://github.com/glovo/foodi-ml-dataset"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-foodi-ml-spain","slug":"image-retrieval-on-foodi-ml-spain","dataset":"FooDI-ML (Spain)","dataset_url":"/dataset/foodi-ml","rows_in_archive":1,"metrics":["A-R@1","A-R@10","A-R@5","Re-R@1","Re-R@10","Re-R@5"],"first_row_in_archive_order":{"model":"ADAPT-I2T","paper_title":"FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptions","paper_url":"/paper/foodi-ml-a-large-multi-language-dataset-of","paper_date":"2021-10-05","arxiv_id":"2110.02035","code_links":[{"title":"glovo/foodi-ml-dataset","url":"https://github.com/glovo/foodi-ml-dataset"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-icfg-pedes","slug":"image-retrieval-on-icfg-pedes","dataset":"ICFG-PEDES","dataset_url":"/dataset/icfg-pedes","rows_in_archive":1,"metrics":["rank-1"],"first_row_in_archive_order":{"model":"SSAN","paper_title":"Semantically Self-Aligned Network for Text-to-Image Part-aware Person Re-identification","paper_url":"/paper/semantically-self-aligned-network-for-text-to","paper_date":"2021-07-27","arxiv_id":"2107.12666","code_links":[{"title":"zifyloo/SSAN","url":"https://github.com/zifyloo/SSAN"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-imagecode","slug":"image-retrieval-on-imagecode","dataset":"ImageCoDe","dataset_url":"/dataset/imagecode","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ContextualCLIP","paper_title":"Image Retrieval from Contextual Descriptions","paper_url":"/paper/image-retrieval-from-contextual-descriptions-1","paper_date":"2022-03-29","arxiv_id":"2203.15867","code_links":[{"title":"mcgill-nlp/imagecode","url":"https://github.com/mcgill-nlp/imagecode"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-instre","slug":"image-retrieval-on-instre","dataset":"INSTRE","dataset_url":"/dataset/instre","rows_in_archive":1,"metrics":["MAP"],"first_row_in_archive_order":{"model":"IME layer","paper_title":"Iterative Manifold Embedding Layer Learned by Incomplete Data for Large-scale Image Retrieval","paper_url":"/paper/iterative-manifold-embedding-layer-learned-by","paper_date":"2017-07-14","arxiv_id":"1707.09862","code_links":[{"title":"XJhaoren/IME_layer","url":"https://github.com/XJhaoren/IME_layer"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-localized-narratives","slug":"image-retrieval-on-localized-narratives","dataset":"Localized Narratives","dataset_url":"/dataset/localized-narratives","rows_in_archive":1,"metrics":["Text-to-image R@1","Text-to-image R@10","Text-to-image R@5"],"first_row_in_archive_order":{"model":"OPT","paper_title":"OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation","paper_url":"/paper/opt-omni-perception-pre-trainer-for-cross","paper_date":"2021-07-01","arxiv_id":"2107.00249","code_links":[{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/research/mm/opt"},{"title":"2023-MindSpore-1/ms-code-161","url":"https://github.com/2023-MindSpore-1/ms-code-161"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-nus-wide","slug":"image-retrieval-on-nus-wide","dataset":"NUS-WIDE","dataset_url":"/dataset/nus-wide","rows_in_archive":1,"metrics":["MAP"],"first_row_in_archive_order":{"model":"DTQ","paper_title":"Deep Triplet Quantization","paper_url":"/paper/deep-triplet-quantization","paper_date":"2019-02-01","arxiv_id":"1902.00153","code_links":[{"title":"thulab/DeepHash","url":"https://github.com/thulab/DeepHash"}],"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/image-retrieval-on-pku-reid","slug":"image-retrieval-on-pku-reid","dataset":"PKU-Reid","dataset_url":"/dataset/pku-reid","rows_in_archive":1,"metrics":["R1"],"first_row_in_archive_order":{"model":"IHDA","paper_title":"Instance-level Heterogeneous Domain Adaptation for Limited-labeled Sketch-to-Photo Retrieval","paper_url":"/paper/instance-level-heterogeneous-domain-1","paper_date":"2022-11-26","arxiv_id":"2211.14515","code_links":[{"title":"fandulu/IHDA","url":"https://github.com/fandulu/IHDA"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-pku-sketchre-id-dataset","slug":"image-retrieval-on-pku-sketchre-id-dataset","dataset":"PKU SketchRe-ID Dataset","dataset_url":"/dataset/pku-sketchre-id-dataset","rows_in_archive":1,"metrics":["R1"],"first_row_in_archive_order":{"model":"IHDA","paper_title":"Instance-level Heterogeneous Domain Adaptation for Limited-labeled Sketch-to-Photo Retrieval","paper_url":"/paper/instance-level-heterogeneous-domain-1","paper_date":"2022-11-26","arxiv_id":"2211.14515","code_links":[{"title":"fandulu/IHDA","url":"https://github.com/fandulu/IHDA"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-roxford-medium-without","slug":"image-retrieval-on-roxford-medium-without","dataset":"ROxford Medium without fine-tuning","dataset_url":"/dataset/roxford","rows_in_archive":1,"metrics":["Average mAP"],"first_row_in_archive_order":{"model":"HesAff–rSIFT–VLAD","paper_title":"Revisiting Oxford and Paris: Large-Scale Image Retrieval Benchmarking","paper_url":"/paper/revisiting-oxford-and-paris-large-scale-image","paper_date":"2018-03-29","arxiv_id":"1803.11285","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/research/delf"},{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"}],"syntology":null}},{"leaderboard":"/sota/image-retrieval-on-ruc-cas-wenlan","slug":"image-retrieval-on-ruc-cas-wenlan","dataset":"RUC-CAS-WenLan","dataset_url":null,"rows_in_archive":1,"metrics":["Recall@1","Recall@10","Recall@5"],"first_row_in_archive_order":{"model":"CMCL","paper_title":"WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training","paper_url":"/paper/wenlan-bridging-vision-and-language-by-large","paper_date":"2021-03-11","arxiv_id":"2103.06561","code_links":[{"title":"BAAI-WuDao/BriVl","url":"https://github.com/BAAI-WuDao/BriVl"},{"title":"Aman-4-Real/MMTG","url":"https://github.com/Aman-4-Real/MMTG"}],"syntology":null}}],"datasets":[{"url":"/dataset/cifar-10","name":"CIFAR-10","full_name":"CIFAR-10","num_papers_in_archive":16145},{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/cub-200-2011","name":"CUB-200-2011","full_name":"Caltech-UCSD Birds-200-2011","num_papers_in_archive":2235},{"url":"/dataset/flickr30k","name":"Flickr30k","full_name":"Flickr30k","num_papers_in_archive":880},{"url":"/dataset/inaturalist","name":"iNaturalist","full_name":"","num_papers_in_archive":603},{"url":"/dataset/deepfashion","name":"DeepFashion","full_name":"","num_papers_in_archive":397},{"url":"/dataset/nus-wide","name":"NUS-WIDE","full_name":"","num_papers_in_archive":348},{"url":"/dataset/yfcc100m","name":"YFCC100M","full_name":"","num_papers_in_archive":243},{"url":"/dataset/stanford-online-products","name":"Stanford Online Products","full_name":"Stanford Online Products","num_papers_in_archive":231},{"url":"/dataset/in-shop","name":"In-Shop","full_name":"In-shop Clothes Retrieval Benchmark","num_papers_in_archive":154},{"url":"/dataset/oxford5k","name":"Oxford5k","full_name":"Oxford Buildings","num_papers_in_archive":137},{"url":"/dataset/tiny-images","name":"Tiny Images","full_name":"","num_papers_in_archive":103},{"url":"/dataset/fashion-iq","name":"Fashion IQ","full_name":"","num_papers_in_archive":102},{"url":"/dataset/mscoco","name":"MSCOCO","full_name":"","num_papers_in_archive":90},{"url":"/dataset/wit","name":"WIT","full_name":"Wikipedia-based Image Text","num_papers_in_archive":79},{"url":"/dataset/roxford","name":"ROxford","full_name":"","num_papers_in_archive":73},{"url":"/dataset/inloc","name":"InLoc","full_name":"","num_papers_in_archive":67},{"url":"/dataset/localized-narratives","name":"Localized Narratives","full_name":"","num_papers_in_archive":63},{"url":"/dataset/cirr","name":"CIRR","full_name":"Compose Image Retrieval on Real-life images","num_papers_in_archive":61},{"url":"/dataset/quick-draw-dataset","name":"Quick, Draw! Dataset","full_name":"","num_papers_in_archive":50},{"url":"/dataset/oxford105k","name":"Oxford105k","full_name":"","num_papers_in_archive":44},{"url":"/dataset/cars196","name":"CARS196","full_name":"","num_papers_in_archive":43},{"url":"/dataset/fashion-gen","name":"Fashion-Gen","full_name":"","num_papers_in_archive":36},{"url":"/dataset/circo","name":"CIRCO","full_name":"Composed Image Retrieval on Common Objects in context","num_papers_in_archive":35},{"url":"/dataset/google-landmarks-dataset-v2","name":"Google Landmarks Dataset v2","full_name":null,"num_papers_in_archive":35},{"url":"/dataset/spot-the-diff","name":"Spot-the-diff","full_name":"","num_papers_in_archive":35},{"url":"/dataset/deepfashion2","name":"DeepFashion2","full_name":"","num_papers_in_archive":30},{"url":"/dataset/sketch-me-that-shoe","name":"ShoeV2","full_name":"ShoeV2","num_papers_in_archive":30},{"url":"/dataset/google-landmarks","name":"Google Landmarks","full_name":"","num_papers_in_archive":24},{"url":"/dataset/coco-cn","name":"COCO-CN","full_name":"","num_papers_in_archive":21},{"url":"/dataset/photochat","name":"PhotoChat","full_name":"","num_papers_in_archive":20},{"url":"/dataset/oven","name":"OVEN","full_name":"Open-domain Visual Entity Recognition","num_papers_in_archive":19},{"url":"/dataset/icfg-pedes","name":"ICFG-PEDES","full_name":"Identity-Centric and Fine-Grained Person Description Dataset","num_papers_in_archive":16},{"url":"/dataset/exact-street2shop","name":"Exact Street2Shop","full_name":"","num_papers_in_archive":15},{"url":"/dataset/vegfru","name":"VegFru","full_name":null,"num_papers_in_archive":14},{"url":"/dataset/visual-madlibs","name":"Visual Madlibs","full_name":"","num_papers_in_archive":13},{"url":"/dataset/imagecode","name":"ImageCoDe","full_name":"Image Retrieval from Contextual Descriptions","num_papers_in_archive":11},{"url":"/dataset/amstertime","name":"AmsterTime","full_name":"AmsterTime: A Visual Place Recognition Benchmark Dataset for Severe Domain Shift","num_papers_in_archive":9},{"url":"/dataset/quickdraw-extended","name":"QuickDraw-Extended","full_name":"","num_papers_in_archive":9},{"url":"/dataset/sketchyscene","name":"SketchyScene","full_name":"","num_papers_in_archive":9},{"url":"/dataset/eth-sfm","name":"ETH SfM","full_name":"ETH Structure-from-Motion","num_papers_in_archive":8},{"url":"/dataset/flickr30k-cna","name":"Flickr30k-CNA","full_name":"Flickr30k-Chinese All","num_papers_in_archive":7},{"url":"/dataset/hotels-50k","name":"Hotels-50K","full_name":"","num_papers_in_archive":7},{"url":"/dataset/lasco","name":"LaSCo","full_name":"","num_papers_in_archive":7},{"url":"/dataset/oxford-affine","name":"Oxford-Affine","full_name":"","num_papers_in_archive":7},{"url":"/dataset/retrieval-sfm","name":"Retrieval-SfM","full_name":null,"num_papers_in_archive":7},{"url":"/dataset/paris6k","name":"Paris6k","full_name":"","num_papers_in_archive":6},{"url":"/dataset/pku-reid","name":"PKU-Reid","full_name":null,"num_papers_in_archive":5},{"url":"/dataset/deeppatent","name":"DeepPatent","full_name":"","num_papers_in_archive":4},{"url":"/dataset/kitchen-scenes","name":"Kitchen Scenes","full_name":"","num_papers_in_archive":4},{"url":"/dataset/retvqa","name":"RetVQA","full_name":"Retrieval-Based Visual Question Answering","num_papers_in_archive":4},{"url":"/dataset/stair-captions","name":"STAIR Captions","full_name":"STAIR Captions","num_papers_in_archive":4},{"url":"/dataset/verse","name":"Verse","full_name":"","num_papers_in_archive":4},{"url":"/dataset/cv-cities","name":"CV-Cities","full_name":"","num_papers_in_archive":3},{"url":"/dataset/gpr1200","name":"GPR1200","full_name":"","num_papers_in_archive":3},{"url":"/dataset/large-time-lags-location-ltll","name":"Large Time Lags Location (LTLL)","full_name":"","num_papers_in_archive":3},{"url":"/dataset/mmid","name":"MMID","full_name":"Massively Multilingual Image Dataset","num_papers_in_archive":3},{"url":"/dataset/gpscap","name":"SCapRepo","full_name":"Google Play Screenshot Caption","num_papers_in_archive":3},{"url":"/dataset/spagbol","name":"SpaGBOL","full_name":"Spatial-Graph-Based Orientated Cross-View Geo-Localisation","num_papers_in_archive":3},{"url":"/dataset/cofar","name":"COFAR","full_name":"Commonsense and Factual Reasoning in Image Search","num_papers_in_archive":2},{"url":"/dataset/crepe-vision-language","name":"CREPE (Compositional REPresentation Evaluation)","full_name":"","num_papers_in_archive":2},{"url":"/dataset/cross-view-time-dataset","name":"Cross-View Time Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/dyml-animal","name":"DyML-Animal","full_name":"Dynamic Metric Learning Animal","num_papers_in_archive":2},{"url":"/dataset/dyml-product","name":"DyML-Product","full_name":"Dynamic Metric Learning Product","num_papers_in_archive":2},{"url":"/dataset/dyml-vehicle","name":"DyML-Vehicle","full_name":"Dynamic Metric Learning Vehicle","num_papers_in_archive":2},{"url":"/dataset/european-flood-2013-dataset","name":"European Flood 2013 Dataset","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/instre","name":"INSTRE","full_name":"","num_papers_in_archive":2},{"url":"/dataset/salient-object-subitizing-dataset","name":"Salient Object Subitizing Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/cbvs","name":"CBVS","full_name":"","num_papers_in_archive":1},{"url":"/dataset/conqa","name":"ConQA","full_name":"Conceptual Query Answering","num_papers_in_archive":1},{"url":"/dataset/cross-view-time-dataset-cross-camera-split","name":"Cross-View Time Dataset (Cross-Camera Split)","full_name":"","num_papers_in_archive":1},{"url":"/dataset/dataset-of-structured-queries-and-spatial","name":"Dataset of Structured Queries and Spatial Relations","full_name":"","num_papers_in_archive":1},{"url":"/dataset/dialogcc","name":"DialogCC","full_name":"","num_papers_in_archive":1},{"url":"/dataset/feta-car-manuals","name":"FETA Car-Manuals","full_name":"FETA Car-Manuals dataset, image-text retrieval for foundation models' expert data performance.","num_papers_in_archive":1},{"url":"/dataset/foodi-ml","name":"FooDI-ML","full_name":"Food Drinks and groceries Images Multi Lingual","num_papers_in_archive":1},{"url":"/dataset/fruit-salad","name":"fruit-SALAD","full_name":"","num_papers_in_archive":1},{"url":"/dataset/iapr-tc-12","name":"IAPR TC-12","full_name":"IAPR TC-12 Benchmark","num_papers_in_archive":1},{"url":"/dataset/ikea-assembly-in-the-wild-dataset","name":"IAW Dataset","full_name":"Ikea Assembly In The Wild Dataset","num_papers_in_archive":1},{"url":"/dataset/ilias","name":"ILIAS","full_name":"ILIAS: Instance-Level Image retrieval At Scale","num_papers_in_archive":1},{"url":"/dataset/impact-patent","name":"IMPACT Patent","full_name":"A Large-scale Integrated Multimodal Patent Analysis and Creation Dataset for Design Patents","num_papers_in_archive":1},{"url":"/dataset/instacities1m","name":"InstaCities1M","full_name":"","num_papers_in_archive":1},{"url":"/dataset/large-labelled-logo-dataset-l3d","name":"Large Labelled Logo Dataset (L3D)","full_name":"","num_papers_in_archive":1},{"url":"/dataset/melon","name":"MELON","full_name":"Melodic Design","num_papers_in_archive":1},{"url":"/dataset/naver-labs-localization-datasets","name":"NAVER LABS Localization Datasets","full_name":"","num_papers_in_archive":1},{"url":"/dataset/pku-sketchre-id-dataset","name":"PKU SketchRe-ID Dataset","full_name":"PKU SketchRe-ID Dataset","num_papers_in_archive":1},{"url":"/dataset/visual-haystacks-vhs","name":"Visual Haystacks (VHs)","full_name":"","num_papers_in_archive":1},{"url":"/dataset/webli","name":"WebLI","full_name":"Web Language Image","num_papers_in_archive":1}],"subtasks":[{"url":"/task/chat-based-image-retrieval","name":"Chat-based Image Retrieval"},{"url":"/task/composed-image-retrieval","name":"Composed Image Retrieval (CoIR)"},{"url":"/task/content-based-image-retrieval","name":"Content-Based Image Retrieval"},{"url":"/task/face-image-retrieval","name":"Face Image Retrieval"},{"url":"/task/image-instance-retrieval","name":"Image Instance Retrieval"},{"url":"/task/medical-image-retrieval","name":"Medical Image Retrieval"},{"url":"/task/multi-label-image-retrieval","name":"Multi-Label Image Retrieval"},{"url":"/task/semi-supervised-sketch-based-image-retrieval","name":"Semi-Supervised Sketch Based Image Retrieval"},{"url":"/task/sketch-based-image-retrieval","name":"Sketch-Based Image Retrieval"},{"url":"/task/video-to-shop","name":"Video-to-Shop"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":835,"tagged_in_all":2239,"items":[{"url":"/paper/emerging-properties-in-self-supervised-vision","title":"Emerging Properties in Self-Supervised Vision Transformers","date":"2021-04-29","arxiv_id":"2104.14294","repositories_listed":32,"syntology":{"n":20,"n_ran":5,"n_unverified":15,"n_pointer_only":2}},{"url":"/paper/dinov2-learning-robust-visual-features","title":"DINOv2: Learning Robust Visual Features without Supervision","date":"2023-04-14","arxiv_id":"2304.07193","repositories_listed":26,"syntology":{"n":46,"n_ran":21,"n_unverified":25,"n_pointer_only":12}},{"url":"/paper/vggface2-a-dataset-for-recognising-faces","title":"VGGFace2: A dataset for recognising faces across pose and age","date":"2017-10-23","arxiv_id":"1710.08092","repositories_listed":24,"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":5}},{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/circle-loss-a-unified-perspective-of-pair","title":"Circle Loss: A Unified Perspective of Pair Similarity Optimization","date":"2020-02-25","arxiv_id":"2002.10857","repositories_listed":16,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/fine-tuning-cnn-image-retrieval-with-no-human","title":"Fine-tuning CNN Image Retrieval with No Human Annotation","date":"2017-11-03","arxiv_id":"1711.02512","repositories_listed":14,"syntology":{"n":24,"n_ran":3,"n_unverified":21,"n_pointer_only":2}},{"url":"/paper/netvlad-cnn-architecture-for-weakly","title":"NetVLAD: CNN architecture for weakly supervised place recognition","date":"2015-11-23","arxiv_id":"1511.07247","repositories_listed":14,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","arxiv_id":"2304.08485","repositories_listed":13,"syntology":{"n":51,"n_ran":16,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/large-scale-image-retrieval-with-attentive","title":"Large-Scale Image Retrieval with Attentive Deep Local Features","date":"2016-12-19","arxiv_id":"1612.06321","repositories_listed":13,"syntology":{"n":12,"n_ran":3,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/gpt-4-technical-report-1","title":"GPT-4 Technical Report","date":"2023-03-15","arxiv_id":"2303.08774","repositories_listed":11,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/vilbert-pretraining-task-agnostic","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","date":"2019-08-06","arxiv_id":"1908.02265","repositories_listed":11,"syntology":{"n":34,"n_ran":10,"n_unverified":24,"n_pointer_only":34}},{"url":"/paper/vse-improving-visual-semantic-embeddings-with","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","date":"2017-07-18","arxiv_id":"1707.05612","repositories_listed":10,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/looking-at-outfit-to-parse-clothing","title":"Looking at Outfit to Parse Clothing","date":"2017-03-04","arxiv_id":"1703.01386","repositories_listed":9,"syntology":null},{"url":"/paper/learning-deep-representations-of-fine-grained","title":"Learning Deep Representations of Fine-grained Visual Descriptions","date":"2016-05-17","arxiv_id":"1605.05395","repositories_listed":9,"syntology":null},{"url":"/paper/combination-of-multiple-global-descriptors","title":"Combination of Multiple Global Descriptors for Image Retrieval","date":"2019-03-26","arxiv_id":"1903.10663","repositories_listed":7,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/vilt-vision-and-language-transformer-without","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","date":"2021-02-05","arxiv_id":"2102.03334","repositories_listed":6,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/stacked-cross-attention-for-image-text","title":"Stacked Cross Attention for Image-Text Matching","date":"2018-03-21","arxiv_id":"1803.08024","repositories_listed":6,"syntology":{"n":16,"n_ran":7,"n_unverified":9,"n_pointer_only":1}},{"url":"/paper/sampling-matters-in-deep-embedding-learning","title":"Sampling Matters in Deep Embedding Learning","date":"2017-06-23","arxiv_id":"1706.07567","repositories_listed":6,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/particular-object-retrieval-with-integral-max","title":"Particular object retrieval with integral max-pooling of CNN activations","date":"2015-11-18","arxiv_id":"1511.05879","repositories_listed":6,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/dolg-single-stage-image-retrieval-with-deep","title":"DOLG: Single-Stage Image Retrieval with Deep Orthogonal Fusion of Local and Global Features","date":"2021-08-06","arxiv_id":"2108.02927","repositories_listed":5,"syntology":{"n":23,"n_ran":10,"n_unverified":13,"n_pointer_only":0}},{"url":"/paper/google-landmarks-dataset-v2-a-large-scale","title":"Google Landmarks Dataset v2 -- A Large-Scale Benchmark for Instance-Level Recognition and Retrieval","date":"2020-04-03","arxiv_id":"2004.01804","repositories_listed":5,"syntology":null},{"url":"/paper/deepemd-few-shot-image-classification-with","title":"DeepEMD: Differentiable Earth Mover's Distance for Few-Shot Learning","date":"2020-03-15","arxiv_id":"2003.06777","repositories_listed":5,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/unifying-deep-local-and-global-features-for","title":"Unifying Deep Local and Global Features for Image Search","date":"2020-01-14","arxiv_id":"2001.05027","repositories_listed":5,"syntology":null},{"url":"/paper/cross-batch-memory-for-embedding-learning","title":"Cross-Batch Memory for Embedding Learning","date":"2019-12-14","arxiv_id":"1912.06798","repositories_listed":5,"syntology":null},{"url":"/paper/12-in-1-multi-task-vision-and-language","title":"12-in-1: Multi-Task Vision and Language Representation Learning","date":"2019-12-05","arxiv_id":"1912.02315","repositories_listed":5,"syntology":{"n":20,"n_ran":4,"n_unverified":16,"n_pointer_only":20}},{"url":"/paper/kornia-an-open-source-differentiable-computer","title":"Kornia: an Open Source Differentiable Computer Vision Library for PyTorch","date":"2019-10-05","arxiv_id":"1910.02190","repositories_listed":5,"syntology":{"n":20,"n_ran":0,"n_unverified":20,"n_pointer_only":0}},{"url":"/paper/softtriple-loss-deep-metric-learning-without","title":"SoftTriple Loss: Deep Metric Learning Without Triplet Sampling","date":"2019-09-11","arxiv_id":"1909.05235","repositories_listed":5,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":2}},{"url":"/paper/batch-feature-erasing-for-person-re","title":"Batch DropBlock Network for Person Re-identification and Beyond","date":"2018-11-17","arxiv_id":"1811.07130","repositories_listed":5,"syntology":{"n":12,"n_ran":3,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/cnn-image-retrieval-learns-from-bow","title":"CNN Image Retrieval Learns from BoW: Unsupervised Fine-Tuning with Hard Examples","date":"2016-04-08","arxiv_id":"1604.02426","repositories_listed":5,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":2}},{"url":"/paper/improving-zero-shot-learning-by-mitigating","title":"Improving zero-shot learning by mitigating the hubness problem","date":"2014-12-20","arxiv_id":"1412.6568","repositories_listed":5,"syntology":null}],"syntology_records":24,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":1,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}