{"url":"/sota/multi-label-classification-on-ms-coco","task":{"name":"Multi-Label Classification","url":"/task/multi-label-classification","note":null},"dataset":{"name":"MS-COCO","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision","Medical","Methodology","Reasoning"],"category_note":null,"description":"**Multi-Label Classification** is the supervised learning problem where an instance may be associated with multiple labels. This is an extension of single-label classification (i.e., multi-class, or binary) where each instance is only associated with a single class label.\r\n\r\n\r\n<span class=\"description-source\">Source: [Deep Learning for Multi-label Classification ](https://arxiv.org/abs/1502.05988)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mAP"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mAP":"higher"}},"counts":{"rows":34,"rows_with_code":29,"rows_with_paper_page":34,"rows_dated":34,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"ADDS(ViT-L-336, resolution 1344)","metrics":{"mAP":"93.54"},"uses_additional_data":false,"paper_date":"2022-08-19","paper":"/paper/a-dual-modality-approach-for-zero-shot-multi","paper_url":"https://arxiv.org/abs/2208.09562v2","paper_title":"Open Vocabulary Multi-Label Classification with Dual-Modal Decoder on Aligned Visual-Textual Features","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"ADDS(ViT-L-336, resolution 640)","metrics":{"mAP":"93.41"},"uses_additional_data":false,"paper_date":"2022-08-19","paper":"/paper/a-dual-modality-approach-for-zero-shot-multi","paper_url":"https://arxiv.org/abs/2208.09562v2","paper_title":"Open Vocabulary Multi-Label Classification with Dual-Modal Decoder on Aligned Visual-Textual Features","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"ADDS(ViT-L-336, resolution 336)","metrics":{"mAP":"91.76"},"uses_additional_data":false,"paper_date":"2022-08-19","paper":"/paper/a-dual-modality-approach-for-zero-shot-multi","paper_url":"https://arxiv.org/abs/2208.09562v2","paper_title":"Open Vocabulary Multi-Label Classification with Dual-Modal Decoder on Aligned Visual-Textual Features","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"ML-Decoder(TResNet-XL, resolution 640)","metrics":{"mAP":"91.4"},"uses_additional_data":false,"paper_date":"2021-11-25","paper":"/paper/ml-decoder-scalable-and-versatile","paper_url":"https://arxiv.org/abs/2111.12933v2","paper_title":"ML-Decoder: Scalable and Versatile Classification Head","code":"https://github.com/alibaba-miil/ml_decoder","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"Q2L-CvT(ImageNet-21K pretraining, resolution 384)","metrics":{"mAP":"91.3"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/query2label-a-simple-transformer-way-to-multi","paper_url":"https://arxiv.org/abs/2107.10834v1","paper_title":"Query2Label: A Simple Transformer Way to Multi-Label Classification","code":"https://github.com/SlongLiu/query2labels","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"MLD-TResNet-L-AAM[640x640]","metrics":{"mAP":"91.30"},"uses_additional_data":false,"paper_date":"2022-09-14","paper":"/paper/combining-metric-learning-and-attention-heads","paper_url":"https://arxiv.org/abs/2209.06585v2","paper_title":"Combining Metric Learning and Attention Heads For Accurate and Efficient Multilabel Image Classification","code":"https://github.com/openvinotoolkit/deep-object-reid","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"ML-Decoder(TResNet-L, resolution 640)","metrics":{"mAP":"91.1"},"uses_additional_data":false,"paper_date":"2021-11-25","paper":"/paper/ml-decoder-scalable-and-versatile","paper_url":"https://arxiv.org/abs/2111.12933v2","paper_title":"ML-Decoder: Scalable and Versatile Classification Head","code":"https://github.com/alibaba-miil/ml_decoder","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"Q2L-SwinL(ImageNet-21K pretraining, resolution 384)","metrics":{"mAP":"90.5"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/query2label-a-simple-transformer-way-to-multi","paper_url":"https://arxiv.org/abs/2107.10834v1","paper_title":"Query2Label: A Simple Transformer Way to Multi-Label Classification","code":"https://github.com/SlongLiu/query2labels","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"Q2L-TResL(ImageNet-21K pretraining, resolution 640)","metrics":{"mAP":"90.3"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/query2label-a-simple-transformer-way-to-multi","paper_url":"https://arxiv.org/abs/2107.10834v1","paper_title":"Query2Label: A Simple Transformer Way to Multi-Label Classification","code":"https://github.com/SlongLiu/query2labels","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"IDA-SwinL","metrics":{"mAP":"90.3"},"uses_additional_data":false,"paper_date":"2023-02-25","paper":"/paper/causality-compensated-attention-for","paper_url":"https://openreview.net/forum?id=8XqDnrmZQNF","paper_title":"Causality Compensated Attention for Contextual Biased Visual Recognition","code":"https://github.com/yu-gi-oh-leilei/IDA_2023ICLR","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"CCD-SwinL","metrics":{"mAP":"90.3"},"uses_additional_data":false,"paper_date":"2022-01-01","paper":"/paper/contextual-debiasing-for-visual-recognition","paper_url":"http://openaccess.thecvf.com//content/CVPR2022/html/Liu_Contextual_Debiasing_for_Visual_Recognition_With_Causal_Mechanisms_CVPR_2022_paper.html","paper_title":"Contextual Debiasing for Visual Recognition With Causal Mechanisms","code":"https://github.com/farewellthree/Causal-Context-Debiasing","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"MlTr-XL(ImageNet-21K pretraining, resolution 384)","metrics":{"mAP":"90.0"},"uses_additional_data":false,"paper_date":"2021-06-11","paper":"/paper/mltr-multi-label-classification-with","paper_url":"https://arxiv.org/abs/2106.06195v1","paper_title":"MlTr: Multi-label Classification with Transformer","code":"https://github.com/starmemda/MlTr","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"TResNet-L-V2, (ImageNet-21K-P pretraining, resolution 640)","metrics":{"mAP":"89.8"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/imagenet-21k-pretraining-for-the-masses","paper_url":"https://arxiv.org/abs/2104.10972v4","paper_title":"ImageNet-21K Pretraining for the Masses","code":"https://github.com/Alibaba-MIIL/ImageNet21K","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"MlTr-L(ImageNet-21K pretraining, resolution 384)","metrics":{"mAP":"88.5"},"uses_additional_data":false,"paper_date":"2021-06-11","paper":"/paper/mltr-multi-label-classification-with","paper_url":"https://arxiv.org/abs/2106.06195v1","paper_title":"MlTr: Multi-label Classification with Transformer","code":"https://github.com/starmemda/MlTr","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"TResNet-XL (resolution 640)","metrics":{"mAP":"88.4"},"uses_additional_data":false,"paper_date":"2020-09-29","paper":"/paper/asymmetric-loss-for-multi-label","paper_url":"https://arxiv.org/abs/2009.14119v4","paper_title":"Asymmetric Loss For Multi-Label Classification","code":"https://github.com/Alibaba-MIIL/ASL","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":7}},{"rank_in_archive_order":16,"model":"TResNet-L-V2, (ImageNet-21K-P pretraining, resolution 448)","metrics":{"mAP":"88.4"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/imagenet-21k-pretraining-for-the-masses","paper_url":"https://arxiv.org/abs/2104.10972v4","paper_title":"ImageNet-21K Pretraining for the Masses","code":"https://github.com/Alibaba-MIIL/ImageNet21K","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"GKGNet(resolution 576)","metrics":{"mAP":"87.7"},"uses_additional_data":false,"paper_date":"2023-08-28","paper":"/paper/gkgnet-group-k-nearest-neighbor-based-graph","paper_url":"https://arxiv.org/abs/2308.14378v3","paper_title":"GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition","code":"https://github.com/jin-s13/gkgnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"M3TR(ImageNet-21K-P pretraining, resolution 448)","metrics":{"mAP":"87.5"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/m3tr-multi-modal-multi-label-recognition-with","paper_url":"https://dl.acm.org/doi/10.1145/3474085.3475191","paper_title":"M3TR: Multi-modal Multi-label Recognition with Transformer","code":"https://github.com/iCVTEAM/M3TR","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"GKGNet(resolution 448)","metrics":{"mAP":"86.7"},"uses_additional_data":false,"paper_date":"2023-08-28","paper":"/paper/gkgnet-group-k-nearest-neighbor-based-graph","paper_url":"https://arxiv.org/abs/2308.14378v3","paper_title":"GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition","code":"https://github.com/jin-s13/gkgnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"TResNet-L (resolution 448)","metrics":{"mAP":"86.6"},"uses_additional_data":false,"paper_date":"2020-09-29","paper":"/paper/asymmetric-loss-for-multi-label","paper_url":"https://arxiv.org/abs/2009.14119v4","paper_title":"Asymmetric Loss For Multi-Label Classification","code":"https://github.com/Alibaba-MIIL/ASL","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":7}},{"rank_in_archive_order":21,"model":"IDA-R101","metrics":{"mAP":"86.3"},"uses_additional_data":false,"paper_date":"2023-02-25","paper":"/paper/causality-compensated-attention-for","paper_url":"https://openreview.net/forum?id=8XqDnrmZQNF","paper_title":"Causality Compensated Attention for Contextual Biased Visual Recognition","code":"https://github.com/yu-gi-oh-leilei/IDA_2023ICLR","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"TDRG-R101(576×576)","metrics":{"mAP":"86.0"},"uses_additional_data":false,"paper_date":"2021-10-10","paper":"/paper/transformer-based-dual-relation-graph-for-1","paper_url":"https://arxiv.org/abs/2110.04722v2","paper_title":"Transformer-based Dual Relation Graph for Multi-label Image Recognition","code":"https://github.com/iCVTEAM/TDRG","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":3,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"CCD-R101","metrics":{"mAP":"85.3"},"uses_additional_data":false,"paper_date":"2022-01-01","paper":"/paper/contextual-debiasing-for-visual-recognition","paper_url":"http://openaccess.thecvf.com//content/CVPR2022/html/Liu_Contextual_Debiasing_for_Visual_Recognition_With_Causal_Mechanisms_CVPR_2022_paper.html","paper_title":"Contextual Debiasing for Visual Recognition With Causal Mechanisms","code":"https://github.com/farewellthree/Causal-Context-Debiasing","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"ADD-GCN","metrics":{"mAP":"85.2"},"uses_additional_data":false,"paper_date":"2020-12-05","paper":"/paper/attention-driven-dynamic-graph-convolutional-1","paper_url":"https://arxiv.org/abs/2012.02994v1","paper_title":"Attention-Driven Dynamic Graph Convolutional Network for Multi-Label Image Recognition","code":"https://github.com/Yejin0111/ADD-GCN","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"Q2L-R101(resolution 448)","metrics":{"mAP":"84.9"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/query2label-a-simple-transformer-way-to-multi","paper_url":"https://arxiv.org/abs/2107.10834v1","paper_title":"Query2Label: A Simple Transformer Way to Multi-Label Classification","code":"https://github.com/SlongLiu/query2labels","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"TDRG-R101(448×448)","metrics":{"mAP":"84.6"},"uses_additional_data":false,"paper_date":"2021-10-10","paper":"/paper/transformer-based-dual-relation-graph-for-1","paper_url":"https://arxiv.org/abs/2110.04722v2","paper_title":"Transformer-based Dual Relation Graph for Multi-label Image Recognition","code":"https://github.com/iCVTEAM/TDRG","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":3,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"MCAR (ResNet101, 576x576)","metrics":{"mAP":"84.5"},"uses_additional_data":false,"paper_date":"2020-07-03","paper":"/paper/multi-label-image-recognition-with-multi","paper_url":"https://arxiv.org/abs/2007.01755v3","paper_title":"Learning to Discover Multi-Class Attentional Regions for Multi-Label Image Recognition","code":"https://github.com/gaobb/MCAR","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"MS-CMA","metrics":{"mAP":"83.8"},"uses_additional_data":false,"paper_date":"2019-12-17","paper":"/paper/cross-modality-attention-with-semantic-graph","paper_url":"https://arxiv.org/abs/1912.07872v2","paper_title":"Cross-Modality Attention with Semantic Graph Embedding for Multi-Label Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"MCAR (ResNet101, 448x448)","metrics":{"mAP":"83.8"},"uses_additional_data":false,"paper_date":"2020-07-03","paper":"/paper/multi-label-image-recognition-with-multi","paper_url":"https://arxiv.org/abs/2007.01755v3","paper_title":"Learning to Discover Multi-Class Attentional Regions for Multi-Label Image Recognition","code":"https://github.com/gaobb/MCAR","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"KSSNet","metrics":{"mAP":"83.7"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/multi-label-classification-with-label-graph","paper_url":"https://arxiv.org/abs/1911.09243v1","paper_title":"Multi-Label Classification with Label Graph Superimposing","code":"https://github.com/Alibaba-MIIL/TResNet","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":31,"model":"MSRN","metrics":{"mAP":"83.4"},"uses_additional_data":false,"paper_date":"2021-06-22","paper":"/paper/multi-layered-semantic-representation-network","paper_url":"https://arxiv.org/abs/2106.11596v1","paper_title":"Multi-layered Semantic Representation Network for Multi-label Image Classification","code":"https://github.com/chehao2628/MSRN","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"ML-GCN","metrics":{"mAP":"83.0"},"uses_additional_data":false,"paper_date":"2019-12-26","paper":"/paper/multi-label-graph-convolutional-network","paper_url":"https://arxiv.org/abs/1912.11757v1","paper_title":"Multi-Label Graph Convolutional Network Representation Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"GKGNet(resolution 224)","metrics":{"mAP":"82"},"uses_additional_data":false,"paper_date":"2023-08-28","paper":"/paper/gkgnet-group-k-nearest-neighbor-based-graph","paper_url":"https://arxiv.org/abs/2308.14378v3","paper_title":"GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition","code":"https://github.com/jin-s13/gkgnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"ResNet-SRN","metrics":{"mAP":"77.1"},"uses_additional_data":false,"paper_date":"2017-02-20","paper":"/paper/learning-spatial-regularization-with-image","paper_url":"http://arxiv.org/abs/1702.05891v2","paper_title":"Learning Spatial Regularization with Image-level Supervisions for Multi-label Image Classification","code":"https://github.com/zhufengx/SRN_multilabel","n_code_links":2,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":13,"rows_with_any_sample_ran":13,"distinct_papers_with_graph_line":6,"distinct_papers_with_any_sample_ran":6,"samples_over_distinct_papers":{"n_ran":20,"n_unverified":15,"n_samples":35,"n_pointer_only_licence":9,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":42,"n_unverified":30,"n_samples":72,"n_pointer_only_licence":16,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}