{"url":"/task/acoustic-scene-classification","name":"Acoustic Scene Classification","slug":"acoustic-scene-classification","description_markdown":"The goal of acoustic scene classification is to classify a test recording into one of the provided predefined classes that characterizes the environment in which it was recorded.\r\n\r\nSource: [DCASE 2019](http://dcase.community/challenge2019/task-acoustic-scene-classification)\r\nSource: [DCASE 2018](https://dcase.community/challenge2018/task-acoustic-scene-classification)","categories":[{"name":"Audio","url":"/area/audio"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":132,"papers_with_code":42,"benchmarks":5,"benchmark_tables_in_archive":5,"benchmark_tables_shown":5,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":10,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/acoustic-scene-classification-on-cochlscene","slug":"acoustic-scene-classification-on-cochlscene","dataset":"CochlScene","dataset_url":"/dataset/cochlscene","rows_in_archive":2,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Audio Flamingo","paper_title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","paper_url":"/paper/audio-flamingo-a-novel-audio-language-model","paper_date":"2024-02-02","arxiv_id":"2402.01831","code_links":[{"title":"NVIDIA/audio-flamingo","url":"https://github.com/NVIDIA/audio-flamingo"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/acoustic-scene-classification-on-dcase-2019","slug":"acoustic-scene-classification-on-dcase-2019","dataset":"DCASE 2019 Mobile","dataset_url":"/dataset/dcase-2019-mobile","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Basic + Spectrum Correction","paper_title":"Spectrum Correction: Acoustic Scene Classification with Mismatched Recording Devices","paper_url":"/paper/spectrum-correction-acoustic-scene","paper_date":"2021-05-25","arxiv_id":"2105.11856","code_links":[{"title":"SRPOL-AUI/spectrum-correction","url":"https://github.com/SRPOL-AUI/spectrum-correction"}],"syntology":null}},{"leaderboard":"/sota/acoustic-scene-classification-on-tau-urban","slug":"acoustic-scene-classification-on-tau-urban","dataset":"TAU Urban Acoustic Scenes 2019","dataset_url":"/dataset/tau-urban-acoustic-scenes-2019","rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Two-stage ensemble system","paper_title":"A Two-Stage Approach to Device-Robust Acoustic Scene Classification","paper_url":"/paper/a-two-stage-approach-to-device-robust","paper_date":"2020-11-03","arxiv_id":"2011.01447","code_links":[{"title":"MihawkHu/DCASE2020_task1","url":"https://github.com/MihawkHu/DCASE2020_task1"}],"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/acoustic-scene-classification-on-tut-acoustic","slug":"acoustic-scene-classification-on-tut-acoustic","dataset":"TUT Acoustic Scenes 2017","dataset_url":"/dataset/tut-acoustic-scenes-2017","rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Qwen-Audio","paper_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","paper_url":"/paper/qwen-audio-advancing-universal-audio","paper_date":"2023-11-14","arxiv_id":"2311.07919","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"},{"title":"qwenlm/qwen-audio","url":"https://github.com/qwenlm/qwen-audio"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}}},{"leaderboard":"/sota/acoustic-scene-classification-on-tut-urban","slug":"acoustic-scene-classification-on-tut-urban","dataset":"TUT Urban Acoustic Scenes 2018","dataset_url":"/dataset/dcase-2018-task-1a","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"ERGL: event relational graph representation learning","paper_title":"Multi-dimensional Edge-based Audio Event Relational Graph Representation Learning for Acoustic Scene Classification","paper_url":"/paper/multi-dimensional-edge-based-audio-event","paper_date":"2022-10-27","arxiv_id":"2210.15366","code_links":[{"title":"yuanbo2020/ergl","url":"https://github.com/yuanbo2020/ergl"}],"syntology":null}}],"datasets":[{"url":"/dataset/mtg-jamendo","name":"MTG-Jamendo","full_name":null,"num_papers_in_archive":39},{"url":"/dataset/dcase-2016","name":"DCASE 2016","full_name":"DCASE 2016","num_papers_in_archive":31},{"url":"/dataset/tau-urban-acoustic-scenes-2019","name":"TAU Urban Acoustic Scenes 2019","full_name":"TAU Urban Acoustic Scenes 2019","num_papers_in_archive":14},{"url":"/dataset/tut-acoustic-scenes-2017","name":"TUT Acoustic Scenes 2017","full_name":"TUT Acoustic Scenes 2017","num_papers_in_archive":13},{"url":"/dataset/dcase-2013","name":"DCASE 2013","full_name":"DCASE 2013","num_papers_in_archive":11},{"url":"/dataset/cochlscene","name":"CochlScene","full_name":"","num_papers_in_archive":7},{"url":"/dataset/dcase-2019-mobile","name":"DCASE 2019 Mobile","full_name":"TAU Urban Acoustic Scenes 2019 Mobile","num_papers_in_archive":5},{"url":"/dataset/litis-rouen","name":"LITIS Rouen","full_name":"LITIS Rouen","num_papers_in_archive":3},{"url":"/dataset/dcase-2018-task-1a","name":"TUT Urban Acoustic Scenes 2018","full_name":"","num_papers_in_archive":2},{"url":"/dataset/tut-sound-events-2018","name":"TUT Sound Events 2018","full_name":"TUT Sound Events 2018","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":42,"tagged_in_all":132,"items":[{"url":"/paper/the-receptive-field-as-a-regularizer-in-deep","title":"The Receptive Field as a Regularizer in Deep Convolutional Neural Networks for Acoustic Scene Classification","date":"2019-07-03","arxiv_id":"1907.01803","repositories_listed":3,"syntology":null},{"url":"/paper/qwen-audio-advancing-universal-audio","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","date":"2023-11-14","arxiv_id":"2311.07919","repositories_listed":2,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}},{"url":"/paper/efficient-training-of-audio-transformers-with","title":"Efficient Training of Audio Transformers with Patchout","date":"2021-10-11","arxiv_id":"2110.05069","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/seld-tcn-sound-event-localization-detection","title":"SELD-TCN: Sound Event Localization & Detection via Temporal Convolutional Networks","date":"2020-03-03","arxiv_id":"2003.01609","repositories_listed":2,"syntology":null},{"url":"/paper/receptive-field-regularized-cnn-variants-for","title":"Receptive-field-regularized CNN variants for acoustic scene classification","date":"2019-09-05","arxiv_id":"1909.02859","repositories_listed":2,"syntology":null},{"url":"/paper/training-neural-audio-classifiers-with-few","title":"Training neural audio classifiers with few data","date":"2018-10-24","arxiv_id":"1810.10274","repositories_listed":2,"syntology":null},{"url":"/paper/a-multi-device-dataset-for-urban-acoustic","title":"A multi-device dataset for urban acoustic scene classification","date":"2018-07-25","arxiv_id":"1807.09840","repositories_listed":2,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/a-simple-fusion-of-deep-and-shallow-learning","title":"A Simple Fusion of Deep and Shallow Learning for Acoustic Scene Classification","date":"2018-06-19","arxiv_id":"1806.07506","repositories_listed":2,"syntology":null},{"url":"/paper/low-complexity-acoustic-scene-classification-4","title":"Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge","date":"2025-05-03","arxiv_id":"2505.01747","repositories_listed":1,"syntology":null},{"url":"/paper/low-complexity-acoustic-scene-classification-3","title":"Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network","date":"2024-06-12","arxiv_id":"2406.08119","repositories_listed":1,"syntology":null},{"url":"/paper/data-efficient-low-complexity-acoustic-scene","title":"Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge","date":"2024-05-16","arxiv_id":"2405.10018","repositories_listed":1,"syntology":null},{"url":"/paper/description-on-ieee-icme-2024-grand-challenge","title":"Description on IEEE ICME 2024 Grand Challenge: Semi-supervised Acoustic Scene Classification under Domain Shift","date":"2024-02-05","arxiv_id":"2402.02694","repositories_listed":1,"syntology":null},{"url":"/paper/audio-flamingo-a-novel-audio-language-model","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","date":"2024-02-02","arxiv_id":"2402.01831","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/audiolog-llms-powered-long-audio-logging-with","title":"AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning","date":"2023-11-21","arxiv_id":"2311.12371","repositories_listed":1,"syntology":null},{"url":"/paper/audio-event-relational-graph-representation","title":"Audio Event-Relational Graph Representation Learning for Acoustic Scene Classification","date":"2023-10-05","arxiv_id":"2310.03889","repositories_listed":1,"syntology":null},{"url":"/paper/bringing-the-discussion-of-minima-sharpness","title":"Bringing the Discussion of Minima Sharpness to the Audio Domain: a Filter-Normalised Evaluation for Acoustic Scene Classification","date":"2023-09-28","arxiv_id":"2309.16369","repositories_listed":1,"syntology":null},{"url":"/paper/domain-information-control-at-inference-time","title":"Domain Information Control at Inference Time for Acoustic Scene Classification","date":"2023-06-13","arxiv_id":"2306.08010","repositories_listed":1,"syntology":null},{"url":"/paper/device-robust-acoustic-scene-classification-1","title":"Device-Robust Acoustic Scene Classification via Impulse Response Augmentation","date":"2023-05-12","arxiv_id":"2305.07499","repositories_listed":1,"syntology":null},{"url":"/paper/unsupervised-improvement-of-audio-text-cross","title":"Unsupervised Improvement of Audio-Text Cross-Modal Representations","date":"2023-05-03","arxiv_id":"2305.01864","repositories_listed":1,"syntology":null},{"url":"/paper/cochlscene-acquisition-of-acoustic-scene-data","title":"CochlScene: Acquisition of acoustic scene data using crowdsourcing","date":"2022-11-04","arxiv_id":"2211.02289","repositories_listed":1,"syntology":null},{"url":"/paper/multi-dimensional-edge-based-audio-event","title":"Multi-dimensional Edge-based Audio Event Relational Graph Representation Learning for Acoustic Scene Classification","date":"2022-10-27","arxiv_id":"2210.15366","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-similarity-based-passive-filter","title":"Efficient Similarity-based Passive Filter Pruning for Compressing CNNs","date":"2022-10-27","arxiv_id":"2210.17416","repositories_listed":1,"syntology":null},{"url":"/paper/a-passive-similarity-based-cnn-filter-pruning","title":"A Passive Similarity based CNN Filter Pruning for Efficient Acoustic Scene Classification","date":"2022-03-29","arxiv_id":"2203.15751","repositories_listed":1,"syntology":null},{"url":"/paper/acoustic-scene-classification-using-auditory","title":"Acoustic scene classification using auditory datasets","date":"2021-12-26","arxiv_id":"2112.13450","repositories_listed":1,"syntology":null},{"url":"/paper/towards-audio-domain-adaptation-for-acoustic","title":"Towards Audio Domain Adaptation for Acoustic Scene Classification using Disentanglement Learning","date":"2021-10-26","arxiv_id":"2110.13586","repositories_listed":1,"syntology":null},{"url":"/paper/a-variational-bayesian-approach-to-learning","title":"A Variational Bayesian Approach to Learning Latent Variables for Acoustic Knowledge Transfer","date":"2021-10-16","arxiv_id":"2110.08598","repositories_listed":1,"syntology":null},{"url":"/paper/low-complexity-acoustic-scene-classification","title":"Low-complexity acoustic scene classification for multi-device audio: analysis of DCASE 2021 Challenge systems","date":"2021-05-28","arxiv_id":"2105.13734","repositories_listed":1,"syntology":null},{"url":"/paper/receptive-field-regularization-techniques-for","title":"Receptive Field Regularization Techniques for Audio Classification and Tagging with Deep Convolutional Neural Networks","date":"2021-05-26","arxiv_id":"2105.12395","repositories_listed":1,"syntology":null},{"url":"/paper/spectrum-correction-acoustic-scene","title":"Spectrum Correction: Acoustic Scene Classification with Mismatched Recording Devices","date":"2021-05-25","arxiv_id":"2105.11856","repositories_listed":1,"syntology":null},{"url":"/paper/low-complexity-models-for-acoustic-scene","title":"Low-Complexity Models for Acoustic Scene Classification Based on Receptive Field Regularization and Frequency Damping","date":"2020-11-05","arxiv_id":"2011.02955","repositories_listed":1,"syntology":null}],"syntology_records":4,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}