{"url":"/task/object-recognition","name":"Object Recognition","slug":"object-recognition","description_markdown":"Object recognition is a computer vision technique for detecting + classifying objects in images or videos. Since this is a combined task of object detection plus image classification, the state-of-the-art tables are recorded for each component task [here](https://www.paperswithcode.com/task/object-detection) and  [here](https://www.paperswithcode.com/task/image-classification2).\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Tensorflow Object Detection API\r\n](https://github.com/tensorflow/models/tree/master/research/object_detection) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2042,"papers_with_code":577,"benchmarks":9,"benchmark_tables_in_archive":9,"benchmark_tables_shown":9,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":45,"subtasks":3,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/object-recognition-on-shape-bias","slug":"object-recognition-on-shape-bias","dataset":"shape bias","dataset_url":"/dataset/shape-bias","rows_in_archive":18,"metrics":["shape bias"],"first_row_in_archive_order":{"model":"Imagen","paper_title":"Intriguing properties of generative classifiers","paper_url":"/paper/intriguing-properties-of-generative","paper_date":"2023-09-28","arxiv_id":"2309.16779","code_links":[{"title":"SamsungSAILMontreal/ForestDiffusion","url":"https://github.com/SamsungSAILMontreal/ForestDiffusion"}],"syntology":{"n":12,"n_ran":10,"n_unverified":2,"n_pointer_only":12}}},{"leaderboard":"/sota/object-recognition-on-cifar10-dvs","slug":"object-recognition-on-cifar10-dvs","dataset":"CIFAR10-DVS","dataset_url":"/dataset/cifar10-dvs","rows_in_archive":2,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Spike-VGG11","paper_title":"EventRPG: Event Data Augmentation with Relevance Propagation Guidance","paper_url":"/paper/eventrpg-event-data-augmentation-with","paper_date":"2024-03-14","arxiv_id":"2403.09274","code_links":[{"title":"myuansun/eventrpg","url":"https://github.com/myuansun/eventrpg"}],"syntology":{"n":16,"n_ran":5,"n_unverified":11,"n_pointer_only":0}}},{"leaderboard":"/sota/object-recognition-on-n-caltech-101","slug":"object-recognition-on-n-caltech-101","dataset":"N-Caltech 101","dataset_url":"/dataset/n-caltech-101","rows_in_archive":2,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Spike-VGG11","paper_title":"EventRPG: Event Data Augmentation with Relevance Propagation Guidance","paper_url":"/paper/eventrpg-event-data-augmentation-with","paper_date":"2024-03-14","arxiv_id":"2403.09274","code_links":[{"title":"myuansun/eventrpg","url":"https://github.com/myuansun/eventrpg"}],"syntology":{"n":16,"n_ran":5,"n_unverified":11,"n_pointer_only":0}}},{"leaderboard":"/sota/object-recognition-on-objectnet-all-classes-198","slug":"object-recognition-on-objectnet-all-classes-198","dataset":"ObjectNet (All classes)","dataset_url":null,"rows_in_archive":2,"metrics":["Top 5 Accuracy","Top 1 Accuracy"],"first_row_in_archive_order":{"model":"ObjectNet-Baseline","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/object-recognition-on-objectnet-imagenet-397","slug":"object-recognition-on-objectnet-imagenet-397","dataset":"ObjectNet (ImageNet classes, trained on ImageNet)","dataset_url":null,"rows_in_archive":2,"metrics":["Top 5 Accuracy","Top 1 Accuracy"],"first_row_in_archive_order":{"model":"ObjectNet-Baseline","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/object-recognition-on-objectnet-imagenet-398","slug":"object-recognition-on-objectnet-imagenet-398","dataset":"ObjectNet (ImageNet classes)","dataset_url":null,"rows_in_archive":2,"metrics":["Top 5 Accuracy","Top 1 Accuracy"],"first_row_in_archive_order":{"model":"ObjectNet-Baseline","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/object-recognition-on-dvs128-gesture","slug":"object-recognition-on-dvs128-gesture","dataset":"DVS128 Gesture","dataset_url":"/dataset/dvs128-gesture-dataset","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"SSNN","paper_title":"Shrinking Your TimeStep: Towards Low-Latency Neuromorphic Object Recognition with Spiking Neural Network","paper_url":"/paper/shrinking-your-timestep-towards-low-latency","paper_date":"2024-01-02","arxiv_id":"2401.01912","code_links":[],"syntology":null}},{"leaderboard":"/sota/object-recognition-on-meccano","slug":"object-recognition-on-meccano","dataset":"MECCANO","dataset_url":"/dataset/meccano","rows_in_archive":1,"metrics":["mAP"],"first_row_in_archive_order":{"model":"Faster-RCNN","paper_title":"The MECCANO Dataset: Understanding Human-Object Interactions from Egocentric Videos in an Industrial-like Domain","paper_url":"/paper/the-meccano-dataset-understanding-human","paper_date":"2020-10-12","arxiv_id":"2010.05654","code_links":[{"title":"fpv-iplab/MECCANO","url":"https://github.com/fpv-iplab/MECCANO"}],"syntology":null}},{"leaderboard":"/sota/object-recognition-on-n-cars","slug":"object-recognition-on-n-cars","dataset":"N-CARS","dataset_url":"/dataset/n-cars","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Spike-VGG11","paper_title":"EventRPG: Event Data Augmentation with Relevance Propagation Guidance","paper_url":"/paper/eventrpg-event-data-augmentation-with","paper_date":"2024-03-14","arxiv_id":"2403.09274","code_links":[{"title":"myuansun/eventrpg","url":"https://github.com/myuansun/eventrpg"}],"syntology":{"n":16,"n_ran":5,"n_unverified":11,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/cifar-10","name":"CIFAR-10","full_name":"CIFAR-10","num_papers_in_archive":16145},{"url":"/dataset/imagenet","name":"ImageNet","full_name":"","num_papers_in_archive":15430},{"url":"/dataset/core50","name":"CORe50","full_name":"","num_papers_in_archive":132},{"url":"/dataset/shape-bias","name":"shape bias","full_name":"","num_papers_in_archive":120},{"url":"/dataset/n-caltech-101","name":"N-Caltech 101","full_name":"Neuromorphic-Caltech101","num_papers_in_archive":110},{"url":"/dataset/dvs128-gesture-dataset","name":"DVS128 Gesture","full_name":"","num_papers_in_archive":103},{"url":"/dataset/n-cars","name":"N-CARS","full_name":"","num_papers_in_archive":56},{"url":"/dataset/sun-attribute","name":"SUN Attribute","full_name":"SUN Attribute","num_papers_in_archive":38},{"url":"/dataset/ocid","name":"OCID","full_name":"Object Clutter Indoor Dataset","num_papers_in_archive":29},{"url":"/dataset/cifar10-dvs","name":"CIFAR10-DVS","full_name":"CIFAR10-DVS","num_papers_in_archive":23},{"url":"/dataset/ev-imo","name":"EV-IMO","full_name":"","num_papers_in_archive":22},{"url":"/dataset/meccano","name":"MECCANO","full_name":"","num_papers_in_archive":19},{"url":"/dataset/n-imagenet","name":"N-ImageNet","full_name":"Large-Scale Dataset for Event-Based Object Recognition","num_papers_in_archive":15},{"url":"/dataset/washington-rgb-d","name":"Washington RGB-D","full_name":"Washington RGB-D","num_papers_in_archive":15},{"url":"/dataset/deepscores","name":"DeepScores","full_name":"","num_papers_in_archive":10},{"url":"/dataset/tum-gaid","name":"TUM-GAID","full_name":"TUM-GAID","num_papers_in_archive":9},{"url":"/dataset/apricot","name":"APRICOT","full_name":"","num_papers_in_archive":8},{"url":"/dataset/rit-18","name":"RIT-18","full_name":"","num_papers_in_archive":8},{"url":"/dataset/freiburg-groceries","name":"Freiburg Groceries","full_name":"Freiburg Groceries","num_papers_in_archive":7},{"url":"/dataset/icubworld","name":"ICubWorld","full_name":"","num_papers_in_archive":6},{"url":"/dataset/mor-uav","name":"MOR-UAV","full_name":"","num_papers_in_archive":6},{"url":"/dataset/arid","name":"ARID","full_name":"Autonomous Robot Indoor Dataset","num_papers_in_archive":5},{"url":"/dataset/cure-or","name":"CURE-OR","full_name":"Challenging Unreal and Real Environments for Object Recognition","num_papers_in_archive":5},{"url":"/dataset/nyu-symmetry-database","name":"NYU Symmetry Database","full_name":"","num_papers_in_archive":5},{"url":"/dataset/fewsol","name":"FewSOL","full_name":"A Dataset for Few-Shot Object Learning in Robotic Environments","num_papers_in_archive":4},{"url":"/dataset/hasy","name":"HASY","full_name":"","num_papers_in_archive":3},{"url":"/dataset/rp2k","name":"RP2K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/egoshots","name":"EgoShots","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/uw-indoor-scenes-uw-is-occluded-dataset","name":"UW Indoor Scenes (UW-IS) Occluded dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/uw-is","name":"UW-IS","full_name":"UW Indoor Scenes","num_papers_in_archive":2},{"url":"/dataset/arc-100","name":"ARC-100","full_name":"","num_papers_in_archive":1},{"url":"/dataset/au-dataset-for-visuo-haptic-object","name":"AU Dataset for Visuo-Haptic Object Recognition for Robots","full_name":"","num_papers_in_archive":1},{"url":"/dataset/baxter-ur5-95-objects","name":"Baxter-UR5_95-Objects","full_name":"Baxter-UR5_95-Objects","num_papers_in_archive":1},{"url":"/dataset/chessred","name":"ChessReD","full_name":"Chess Recognition Dataset","num_papers_in_archive":1},{"url":"/dataset/chessred2k","name":"ChessReD2K","full_name":"Chess Recognition Dataset 2K","num_papers_in_archive":1},{"url":"/dataset/ego-ch","name":"EGO-CH","full_name":"EGOcentric-Cultural Heritage","num_papers_in_archive":1},{"url":"/dataset/fine-grained-3d-pose","name":"Fine-grained 3D Pose","full_name":"","num_papers_in_archive":1},{"url":"/dataset/goz","name":"GOZ","full_name":"Generic Object ZSL Dataset","num_papers_in_archive":1},{"url":"/dataset/open-mic","name":"Open MIC","full_name":"Open Museum Identification Challenge","num_papers_in_archive":1},{"url":"/dataset/processed-twitter","name":"Processed Twitter","full_name":"","num_papers_in_archive":1},{"url":"/dataset/rf-signal","name":"RF signal","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/plad","name":"STN PLAD","full_name":"STN Power Line Assets Dataset","num_papers_in_archive":1},{"url":"/dataset/turath-150k","name":"Turath-150K","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ur5-tool-dataset","name":"UR5 Tool Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/visual-3d-shape-matching-dataset","name":"Visual 3D shape matching dataset","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/3d-object-recognition","name":"3D Object Recognition"},{"url":"/task/continuous-object-recognition","name":"Continuous Object Recognition"},{"url":"/task/depiction-invariant-object-recognition","name":"Depiction Invariant Object Recognition"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":577,"tagged_in_all":2042,"items":[{"url":"/paper/densely-connected-convolutional-networks","title":"Densely Connected Convolutional Networks","date":"2016-08-25","arxiv_id":"1608.06993","repositories_listed":146,"syntology":{"n":71,"n_ran":18,"n_unverified":53,"n_pointer_only":7}},{"url":"/paper/a-simple-framework-for-contrastive-learning","title":"A Simple Framework for Contrastive Learning of Visual Representations","date":"2020-02-13","arxiv_id":"2002.05709","repositories_listed":96,"syntology":{"n":137,"n_ran":79,"n_unverified":58,"n_pointer_only":52}},{"url":"/paper/going-deeper-with-convolutions","title":"Going Deeper with Convolutions","date":"2014-09-17","arxiv_id":"1409.4842","repositories_listed":83,"syntology":{"n":42,"n_ran":27,"n_unverified":15,"n_pointer_only":20}},{"url":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","arxiv_id":"2103.00020","repositories_listed":82,"syntology":{"n":20,"n_ran":16,"n_unverified":4,"n_pointer_only":16}},{"url":"/paper/microsoft-coco-common-objects-in-context","title":"Microsoft COCO: Common Objects in Context","date":"2014-05-01","arxiv_id":"1405.0312","repositories_listed":38,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/striving-for-simplicity-the-all-convolutional","title":"Striving for Simplicity: The All Convolutional Net","date":"2014-12-21","arxiv_id":"1412.6806","repositories_listed":37,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/imagenet-classification-with-deep","title":"ImageNet Classification with Deep Convolutional Neural Networks","date":"2012-12-01","arxiv_id":null,"repositories_listed":23,"syntology":null},{"url":"/paper/finding-tiny-faces","title":"Finding Tiny Faces","date":"2016-12-13","arxiv_id":"1612.04402","repositories_listed":20,"syntology":{"n":14,"n_ran":0,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/residual-attention-network-for-image","title":"Residual Attention Network for Image Classification","date":"2017-04-23","arxiv_id":"1704.06904","repositories_listed":19,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/deep-predictive-coding-networks-for-video","title":"Deep Predictive Coding Networks for Video Prediction and Unsupervised Learning","date":"2016-05-25","arxiv_id":"1605.08104","repositories_listed":17,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":2}},{"url":"/paper/texture-synthesis-using-convolutional-neural","title":"Texture Synthesis Using Convolutional Neural Networks","date":"2015-05-27","arxiv_id":"1505.07376","repositories_listed":16,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/rtmdet-an-empirical-study-of-designing-real","title":"RTMDet: An Empirical Study of Designing Real-Time Object Detectors","date":"2022-12-14","arxiv_id":"2212.07784","repositories_listed":14,"syntology":{"n":20,"n_ran":3,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/factorized-attention-self-attention-with","title":"Efficient Attention: Attention with Linear Complexities","date":"2018-12-04","arxiv_id":"1812.01243","repositories_listed":14,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/imagenet-large-scale-visual-recognition","title":"ImageNet Large Scale Visual Recognition Challenge","date":"2014-09-01","arxiv_id":"1409.0575","repositories_listed":14,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/spatial-pyramid-pooling-in-deep-convolutional","title":"Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition","date":"2014-06-18","arxiv_id":"1406.4729","repositories_listed":14,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/describing-textures-in-the-wild","title":"Describing Textures in the Wild","date":"2013-11-14","arxiv_id":"1311.3618","repositories_listed":14,"syntology":null},{"url":"/paper/improving-neural-networks-by-preventing-co","title":"Improving neural networks by preventing co-adaptation of feature detectors","date":"2012-07-03","arxiv_id":"1207.0580","repositories_listed":11,"syntology":null},{"url":"/paper/gcnet-non-local-networks-meet-squeeze","title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","date":"2019-04-25","arxiv_id":"1904.11492","repositories_listed":9,"syntology":null},{"url":"/paper/deepid3-face-recognition-with-very-deep","title":"DeepID3: Face Recognition with Very Deep Neural Networks","date":"2015-02-03","arxiv_id":"1502.00873","repositories_listed":9,"syntology":null},{"url":"/paper/decaf-a-deep-convolutional-activation-feature","title":"DeCAF: A Deep Convolutional Activation Feature for Generic Visual Recognition","date":"2013-10-06","arxiv_id":"1310.1531","repositories_listed":8,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":1}},{"url":"/paper/imagenet-trained-cnns-are-biased-towards","title":"ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness","date":"2018-11-29","arxiv_id":"1811.12231","repositories_listed":7,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/chessboard-and-chess-piece-recognition-with","title":"Chessboard and chess piece recognition with the support of neural networks","date":"2017-08-13","arxiv_id":"1708.03898","repositories_listed":7,"syntology":null},{"url":"/paper/sparse-r-cnn-end-to-end-object-detection-with","title":"Sparse R-CNN: End-to-End Object Detection with Learnable Proposals","date":"2020-11-25","arxiv_id":"2011.12450","repositories_listed":6,"syntology":null},{"url":"/paper/three-branch-and-mutil-scale-learning-for","title":"Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization","date":"2020-03-20","arxiv_id":"2003.09150","repositories_listed":6,"syntology":null},{"url":"/paper/relation-networks-for-object-detection","title":"Relation Networks for Object Detection","date":"2017-11-30","arxiv_id":"1711.11575","repositories_listed":6,"syntology":null},{"url":"/paper/scalable-object-detection-using-deep-neural","title":"Scalable Object Detection using Deep Neural Networks","date":"2013-12-08","arxiv_id":"1312.2249","repositories_listed":6,"syntology":null},{"url":"/paper/fine-grained-continual-learning","title":"Rehearsal-Free Continual Learning over Small Non-I.I.D. Batches","date":"2019-07-08","arxiv_id":"1907.03799","repositories_listed":5,"syntology":null},{"url":"/paper/cutting-the-error-by-half-investigation-of","title":"Cutting the Error by Half: Investigation of Very Deep CNN and Advanced Training Strategies for Document Image Classification","date":"2017-04-11","arxiv_id":"1704.03557","repositories_listed":5,"syntology":null},{"url":"/paper/adapting-deep-network-features-to-capture","title":"Adapting Deep Network Features to Capture Psychological Representations","date":"2016-08-06","arxiv_id":"1608.02164","repositories_listed":5,"syntology":null},{"url":"/paper/multiple-object-recognition-with-visual","title":"Multiple Object Recognition with Visual Attention","date":"2014-12-24","arxiv_id":"1412.7755","repositories_listed":5,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":1,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}