{"url":"/task/scene-recognition","name":"Scene Recognition","slug":"scene-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":207,"papers_with_code":68,"benchmarks":8,"benchmark_tables_in_archive":8,"benchmark_tables_shown":8,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":16,"subtasks":0,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/scene-recognition-on-yup","slug":"scene-recognition-on-yup","dataset":"YUP++","dataset_url":"/dataset/yup","rows_in_archive":5,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"DEEP-HAL with ODF+SDF (I3D)","paper_title":"Self-supervising Action Recognition by Statistical Moment and Subspace Descriptors","paper_url":"/paper/hallucinating-statistical-moment-and-subspace","paper_date":"2020-01-14","arxiv_id":"2001.04627","code_links":[],"syntology":null}},{"leaderboard":"/sota/scene-recognition-on-aid","slug":"scene-recognition-on-aid","dataset":"AID","dataset_url":"/dataset/aid","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"AGOS","paper_title":"All Grains, One Scheme (AGOS): Learning Multi-grain Instance Representation for Aerial Scene Classification","paper_url":"/paper/all-grains-one-scheme-agos-learning-multi","paper_date":"2022-05-06","arxiv_id":"2205.03371","code_links":[{"title":"biqiwhu/agos","url":"https://github.com/biqiwhu/agos"}],"syntology":null}},{"leaderboard":"/sota/scene-recognition-on-mit-indoors-scenes","slug":"scene-recognition-on-mit-indoors-scenes","dataset":"MIT Indoor Scenes","dataset_url":"/dataset/mit-indoors-scenes","rows_in_archive":3,"metrics":["Accuracy","10-stage average accuracy"],"first_row_in_archive_order":{"model":"FOSNet","paper_title":"FOSNet: An End-to-End Trainable Deep Neural Network for Scene Recognition","paper_url":"/paper/fosnet-an-end-to-end-trainable-deep-neural","paper_date":"2019-07-17","arxiv_id":"1907.07570","code_links":[],"syntology":null}},{"leaderboard":"/sota/scene-recognition-on-places365","slug":"scene-recognition-on-places365","dataset":"Places365","dataset_url":"/dataset/places365","rows_in_archive":2,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"FOSNet","paper_title":"FOSNet: An End-to-End Trainable Deep Neural Network for Scene Recognition","paper_url":"/paper/fosnet-an-end-to-end-trainable-deep-neural","paper_date":"2019-07-17","arxiv_id":"1907.07570","code_links":[],"syntology":null}},{"leaderboard":"/sota/scene-recognition-on-sun-rgbd","slug":"scene-recognition-on-sun-rgbd","dataset":"SUN-RGBD","dataset_url":"/dataset/sun-rgb-d","rows_in_archive":2,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"OMNIVORE (Swin-B)","paper_title":"Omnivore: A Single Model for Many Visual Modalities","paper_url":"/paper/omnivore-a-single-model-for-many-visual","paper_date":"2022-01-20","arxiv_id":"2201.08377","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/omnivore","url":"https://github.com/facebookresearch/omnivore"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/scene-recognition-on-sun397","slug":"scene-recognition-on-sun397","dataset":"SUN397","dataset_url":"/dataset/sun397","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"FOSNet","paper_title":"FOSNet: An End-to-End Trainable Deep Neural Network for Scene Recognition","paper_url":"/paper/fosnet-an-end-to-end-trainable-deep-neural","paper_date":"2019-07-17","arxiv_id":"1907.07570","code_links":[],"syntology":null}},{"leaderboard":"/sota/scene-recognition-on-ade20k","slug":"scene-recognition-on-ade20k","dataset":"ADE20K","dataset_url":"/dataset/ade20k","rows_in_archive":1,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"Semantic-Aware Scene Recogniton (ResNet-18)","paper_title":"Semantic-Aware Scene Recognition","paper_url":"/paper/semantic-aware-scene-recognition","paper_date":"2019-09-05","arxiv_id":"1909.02410","code_links":[{"title":"vpulab/Semantic-Aware-Scene-Recognition","url":"https://github.com/vpulab/Semantic-Aware-Scene-Recognition"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-recognition-on-scannet","slug":"scene-recognition-on-scannet","dataset":"ScanNet","dataset_url":"/dataset/scannet","rows_in_archive":1,"metrics":["Average Recall"],"first_row_in_archive_order":{"model":"SSMA","paper_title":"Self-Supervised Model Adaptation for Multimodal Semantic Segmentation","paper_url":"/paper/self-supervised-model-adaptation-for","paper_date":"2018-08-11","arxiv_id":"1808.03833","code_links":[{"title":"DeepSceneSeg/SSMA","url":"https://github.com/DeepSceneSeg/SSMA"}],"syntology":null}}],"datasets":[{"url":"/dataset/scannet","name":"ScanNet","full_name":"","num_papers_in_archive":1595},{"url":"/dataset/ade20k","name":"ADE20K","full_name":"","num_papers_in_archive":1213},{"url":"/dataset/places205","name":"Places205","full_name":"","num_papers_in_archive":525},{"url":"/dataset/sun-rgb-d","name":"SUN RGB-D","full_name":"SUN RGB-D","num_papers_in_archive":477},{"url":"/dataset/places365","name":"Places365","full_name":"","num_papers_in_archive":65},{"url":"/dataset/sun397","name":"SUN397","full_name":"SUN397","num_papers_in_archive":52},{"url":"/dataset/aid","name":"AID","full_name":"Aerial Image Dataset","num_papers_in_archive":40},{"url":"/dataset/yup","name":"YUP++","full_name":"YUP++ Dynamic Scenes dataset","num_papers_in_archive":13},{"url":"/dataset/mit-indoors-scenes","name":"MIT Indoor Scenes","full_name":"","num_papers_in_archive":9},{"url":"/dataset/advance","name":"ADVANCE","full_name":"AuDio Visual Aerial sceNe reCognition datasEt","num_papers_in_archive":6},{"url":"/dataset/hsd","name":"HSD","full_name":"Honda Scenes Dataset","num_papers_in_archive":3},{"url":"/dataset/hows","name":"HOWS","full_name":"HOWS-CL-25","num_papers_in_archive":1},{"url":"/dataset/mai","name":"MAI","full_name":"Multi-scene Aerial Image","num_papers_in_archive":1},{"url":"/dataset/indian-food-image-dataset","name":"Indian Food Image Dataset","full_name":"datacluster.ai","num_papers_in_archive":0},{"url":"/dataset/kitti-360-sr","name":"KITTI-360-SR","full_name":"KITTI-360 modification for Scene Recognition task","num_papers_in_archive":0},{"url":"/dataset/stairs-image-dataset-parts-of-house-indoor","name":"Stairs Image Dataset | Parts of House | Indoor","full_name":"datacluster.ai","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[{"url":"/task/3d-character-animation-from-a-single-photo","name":"3D Character Animation From A Single Photo"},{"url":"/task/scene-parsing","name":"Scene Parsing"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":68,"tagged_in_all":207,"items":[{"url":"/paper/csrnet-dilated-convolutional-neural-networks","title":"CSRNet: Dilated Convolutional Neural Networks for Understanding the Highly Congested Scenes","date":"2018-02-27","arxiv_id":"1802.10062","repositories_listed":11,"syntology":{"n":15,"n_ran":5,"n_unverified":10,"n_pointer_only":5}},{"url":"/paper/decaf-a-deep-convolutional-activation-feature","title":"DeCAF: A Deep Convolutional Activation Feature for Generic Visual Recognition","date":"2013-10-06","arxiv_id":"1310.1531","repositories_listed":8,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":1}},{"url":"/paper/bilinear-cnns-for-fine-grained-visual","title":"Bilinear CNNs for Fine-grained Visual Recognition","date":"2015-04-29","arxiv_id":"1504.07889","repositories_listed":4,"syntology":null},{"url":"/paper/cnn-features-off-the-shelf-an-astounding","title":"CNN Features off-the-shelf: an Astounding Baseline for Recognition","date":"2014-03-23","arxiv_id":"1403.6382","repositories_listed":4,"syntology":null},{"url":"/paper/visual-memorability-for-robotic","title":"Visual Memorability for Robotic Interestingness via Unsupervised Online Learning","date":"2020-05-18","arxiv_id":"2005.08829","repositories_listed":3,"syntology":null},{"url":"/paper/an-empirical-study-of-remote-sensing","title":"An Empirical Study of Remote Sensing Pretraining","date":"2022-04-06","arxiv_id":"2204.02825","repositories_listed":2,"syntology":null},{"url":"/paper/omnivore-a-single-model-for-many-visual","title":"Omnivore: A Single Model for Many Visual Modalities","date":"2022-01-20","arxiv_id":"2201.08377","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/self-supervised-video-representation-learning-5","title":"Self-supervised Video Representation Learning by Uncovering Spatio-temporal Statistics","date":"2020-08-31","arxiv_id":"2008.13426","repositories_listed":2,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/indoor-scene-recognition-in-3d","title":"Indoor Scene Recognition in 3D","date":"2020-02-28","arxiv_id":"2002.12819","repositories_listed":2,"syntology":null},{"url":"/paper/hallucinet-ing-spatiotemporal-representations","title":"HalluciNet-ing Spatiotemporal Representations Using a 2D-CNN","date":"2019-12-10","arxiv_id":"1912.04430","repositories_listed":2,"syntology":null},{"url":"/paper/learning-from-less-data-a-unified-data-subset","title":"Learning From Less Data: A Unified Data Subset Selection and Active Learning Framework for Computer Vision","date":"2019-01-03","arxiv_id":"1901.01151","repositories_listed":2,"syntology":null},{"url":"/paper/knowledge-guided-disambiguation-for-large","title":"Knowledge Guided Disambiguation for Large-Scale Scene Classification with Multi-Resolution CNNs","date":"2016-10-04","arxiv_id":"1610.01119","repositories_listed":2,"syntology":null},{"url":"/paper/places205-vggnet-models-for-scene-recognition","title":"Places205-VGGNet Models for Scene Recognition","date":"2015-08-07","arxiv_id":"1508.01667","repositories_listed":2,"syntology":null},{"url":"/paper/advancing-als-applications-with-large-scale","title":"Advancing ALS Applications with Large-Scale Pre-training: Dataset Development and Downstream Assessment","date":"2025-01-09","arxiv_id":"2501.05095","repositories_listed":1,"syntology":null},{"url":"/paper/sound-bridge-associating-egocentric-and","title":"Sound Bridge: Associating Egocentric and Exocentric Videos via Audio Cues","date":"2025-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/model-developmental-safety-a-safety-centric","title":"A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety","date":"2024-10-04","arxiv_id":"2410.03955","repositories_listed":1,"syntology":{"n":9,"n_ran":5,"n_unverified":4,"n_pointer_only":9}},{"url":"/paper/pir-remote-sensing-image-text-retrieval-with","title":"PIR: Remote Sensing Image-Text Retrieval with Prior Instruction Representation Learning","date":"2024-05-16","arxiv_id":"2405.10160","repositories_listed":1,"syntology":null},{"url":"/paper/nuscenes-mqa-integrated-evaluation-of","title":"NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous Driving Datasets using Markup Annotations","date":"2023-12-11","arxiv_id":"2312.06352","repositories_listed":1,"syntology":null},{"url":"/paper/on-the-road-with-gpt-4v-ision-early","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","date":"2023-11-09","arxiv_id":"2311.05332","repositories_listed":1,"syntology":null},{"url":"/paper/counting-manatee-aggregations-using-deep","title":"Counting Manatee Aggregations using Deep Neural Networks and Anisotropic Gaussian Kernel","date":"2023-11-04","arxiv_id":"2311.02315","repositories_listed":1,"syntology":null},{"url":"/paper/a-prior-instruction-representation-framework","title":"A Prior Instruction Representation Framework for Remote Sensing Image-text Retrieval","date":"2023-10-27","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/disasternets-embedding-machine-learning-in","title":"DisasterNets: Embedding Machine Learning in Disaster Mapping","date":"2023-06-16","arxiv_id":"2306.09815","repositories_listed":1,"syntology":null},{"url":"/paper/narrative-xl-a-large-scale-dataset-for-long","title":"NarrativeXL: A Large-scale Dataset For Long-Term Memory Models","date":"2023-05-23","arxiv_id":"2305.13877","repositories_listed":1,"syntology":null},{"url":"/paper/srrm-semantic-region-relation-model-for","title":"SRRM: Semantic Region Relation Model for Indoor Scene Recognition","date":"2023-05-15","arxiv_id":"2305.08540","repositories_listed":1,"syntology":null},{"url":"/paper/designing-deep-networks-for-scene-recognition","title":"Designing Deep Networks for Scene Recognition","date":"2023-03-13","arxiv_id":"2303.07402","repositories_listed":1,"syntology":null},{"url":"/paper/comae-single-model-hybrid-pre-training-on","title":"CoMAE: Single Model Hybrid Pre-training on Small-Scale RGB-D Datasets","date":"2023-02-13","arxiv_id":"2302.06148","repositories_listed":1,"syntology":null},{"url":"/paper/nevis-22-a-stream-of-100-tasks-sampled-from","title":"NEVIS'22: A Stream of 100 Tasks Sampled from 30 Years of Computer Vision Research","date":"2022-11-15","arxiv_id":"2211.11747","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/movieclip-visual-scene-recognition-in-movies","title":"MovieCLIP: Visual Scene Recognition in Movies","date":"2022-10-20","arxiv_id":"2210.11065","repositories_listed":1,"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/capsule-networks-as-generative-models","title":"Capsule Networks as Generative Models","date":"2022-09-06","arxiv_id":"2209.02567","repositories_listed":1,"syntology":null},{"url":"/paper/all-grains-one-scheme-agos-learning-multi","title":"All Grains, One Scheme (AGOS): Learning Multi-grain Instance Representation for Aerial Scene Classification","date":"2022-05-06","arxiv_id":"2205.03371","repositories_listed":1,"syntology":null}],"syntology_records":7,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}