{"url":"/task/environmental-sound-classification","name":"Environmental Sound Classification","slug":"environmental-sound-classification","description_markdown":"Classification of Environmental Sounds. Most often sounds found in Urban environments. Task related to noise monitoring.","categories":[{"name":"Audio","url":"/area/audio"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":46,"papers_with_code":27,"benchmarks":3,"benchmark_tables_in_archive":3,"benchmark_tables_shown":3,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":6,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/environmental-sound-classification-on","slug":"environmental-sound-classification-on","dataset":"UrbanSound8K","dataset_url":"/dataset/urbansound8k-1","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"AudioCLIP","paper_title":"AudioCLIP: Extending CLIP to Image, Text and Audio","paper_url":"/paper/audioclip-extending-clip-to-image-text-and","paper_date":"2021-06-24","arxiv_id":"2106.13043","code_links":[{"title":"iver56/audiomentations","url":"https://github.com/iver56/audiomentations"},{"title":"asteroid-team/torch-audiomentations","url":"https://github.com/asteroid-team/torch-audiomentations"},{"title":"AndreyGuzhov/AudioCLIP","url":"https://github.com/AndreyGuzhov/AudioCLIP"},{"title":"julirao/whisper_audio_classification","url":"https://github.com/julirao/whisper_audio_classification"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/environmental-sound-classification-on-esc-50","slug":"environmental-sound-classification-on-esc-50","dataset":"ESC-50","dataset_url":"/dataset/esc-50","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"AudioCLIP","paper_title":"AudioCLIP: Extending CLIP to Image, Text and Audio","paper_url":"/paper/audioclip-extending-clip-to-image-text-and","paper_date":"2021-06-24","arxiv_id":"2106.13043","code_links":[{"title":"iver56/audiomentations","url":"https://github.com/iver56/audiomentations"},{"title":"asteroid-team/torch-audiomentations","url":"https://github.com/asteroid-team/torch-audiomentations"},{"title":"AndreyGuzhov/AudioCLIP","url":"https://github.com/AndreyGuzhov/AudioCLIP"},{"title":"julirao/whisper_audio_classification","url":"https://github.com/julirao/whisper_audio_classification"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/environmental-sound-classification-on-fsd50k","slug":"environmental-sound-classification-on-fsd50k","dataset":"FSD50K","dataset_url":"/dataset/fsd50k","rows_in_archive":1,"metrics":["mAP"],"first_row_in_archive_order":{"model":"[ABT] AudioNTT","paper_title":"Audio Barlow Twins: Self-Supervised Audio Representation Learning","paper_url":"/paper/audio-barlow-twins-self-supervised-audio","paper_date":"2022-09-28","arxiv_id":"2209.14345","code_links":[{"title":"jonahanton/ssl_audio","url":"https://github.com/jonahanton/ssl_audio"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}}],"datasets":[{"url":"/dataset/esc-50","name":"ESC-50","full_name":"ESC-50","num_papers_in_archive":387},{"url":"/dataset/fsd50k","name":"FSD50K","full_name":"Freesound Database 50K","num_papers_in_archive":155},{"url":"/dataset/urbansound8k-1","name":"UrbanSound8K","full_name":"UrbanSound8K","num_papers_in_archive":147},{"url":"/dataset/esc50","name":"ESC50","full_name":"ESC: Dataset for Environmental Sound Classification","num_papers_in_archive":5},{"url":"/dataset/sonyc-ust-v2","name":"SONYC-UST-V2","full_name":"","num_papers_in_archive":4},{"url":"/dataset/singa-pura","name":"SINGA:PURA","full_name":"SINGApore: Polyphonic URban Audio","num_papers_in_archive":2}],"subtasks":[{"url":"/task/self-supervised-sound-classification","name":"Self-Supervised Sound Classification"}],"parent_tasks":[{"url":"/task/audio-classification","name":"Audio Classification"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":27,"of":27,"tagged_in_all":46,"items":[{"url":"/paper/deep-convolutional-neural-networks-and-data-1","title":"Deep Convolutional Neural Networks and Data Augmentation for Environmental Sound Classification","date":"2016-08-15","arxiv_id":"1608.04363","repositories_listed":5,"syntology":null},{"url":"/paper/audioclip-extending-clip-to-image-text-and","title":"AudioCLIP: Extending CLIP to Image, Text and Audio","date":"2021-06-24","arxiv_id":"2106.13043","repositories_listed":4,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/rethinking-cnn-models-for-audio","title":"Rethinking CNN Models for Audio Classification","date":"2020-07-22","arxiv_id":"2007.11154","repositories_listed":3,"syntology":null},{"url":"/paper/paddlespeech-an-easy-to-use-all-in-one-speech-1","title":"PaddleSpeech: An Easy-to-Use All-in-One Speech Toolkit","date":"2022-05-20","arxiv_id":"2205.12007","repositories_listed":2,"syntology":null},{"url":"/paper/crnns-for-urban-sound-tagging-with","title":"CRNNs for Urban Sound Tagging with spatiotemporal context","date":"2020-08-24","arxiv_id":"2008.10413","repositories_listed":2,"syntology":null},{"url":"/paper/end-to-end-environmental-sound-classification","title":"End-to-End Environmental Sound Classification using a 1D Convolutional Neural Network","date":"2019-04-18","arxiv_id":"1904.08990","repositories_listed":2,"syntology":null},{"url":"/paper/masked-conditional-neural-networks-for-1","title":"Masked Conditional Neural Networks for Environmental Sound Classification","date":"2018-05-25","arxiv_id":"1805.10004","repositories_listed":2,"syntology":null},{"url":"/paper/domain-adaptation-method-and-modality-gap","title":"Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification","date":"2025-06-04","arxiv_id":"2506.04376","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-convolutional-dictionary","title":"Weakly Supervised Convolutional Dictionary Learning for Multi-Label Classification","date":"2025-03-11","arxiv_id":"2503.08573","repositories_listed":1,"syntology":null},{"url":"/paper/masked-latent-prediction-and-classification","title":"Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning","date":"2025-02-17","arxiv_id":"2502.12031","repositories_listed":1,"syntology":null},{"url":"/paper/face-fast-accurate-and-context-aware-audio","title":"Face: Fast, Accurate and Context-Aware Audio Annotation and Classification","date":"2023-03-07","arxiv_id":"2303.03666","repositories_listed":1,"syntology":null},{"url":"/paper/effective-audio-classification-network-based","title":"Effective Audio Classification Network Based on Paired Inverse Pyramid Structure and Dense MLP Block","date":"2022-11-05","arxiv_id":"2211.02940","repositories_listed":1,"syntology":null},{"url":"/paper/audio-barlow-twins-self-supervised-audio","title":"Audio Barlow Twins: Self-Supervised Audio Representation Learning","date":"2022-09-28","arxiv_id":"2209.14345","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/continual-learning-for-on-device","title":"Continual Learning For On-Device Environmental Sound Classification","date":"2022-07-15","arxiv_id":"2207.07429","repositories_listed":1,"syntology":null},{"url":"/paper/end-to-end-audio-strikes-back-boosting","title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","date":"2022-04-25","arxiv_id":"2204.11479","repositories_listed":1,"syntology":null},{"url":"/paper/auco-resnet-an-end-to-end-network-for-covid","title":"AUCO ResNet: an end-to-end network for Covid-19 pre-screening from cough and breath","date":"2022-03-15","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/tiny-transformers-for-environmental-sound","title":"Tiny Transformers for Environmental Sound Classification at the Edge","date":"2021-03-22","arxiv_id":"2103.12157","repositories_listed":1,"syntology":null},{"url":"/paper/environmental-sound-classification-on-the","title":"Environmental Sound Classification on the Edge: A Pipeline for Deep Acoustic Networks on Extremely Resource-Constrained Devices","date":"2021-03-05","arxiv_id":"2103.03483","repositories_listed":1,"syntology":null},{"url":"/paper/soundclr-contrastive-learning-of","title":"SoundCLR: Contrastive Learning of Representations For Improved Environmental Sound Classification","date":"2021-03-02","arxiv_id":"2103.01929","repositories_listed":1,"syntology":null},{"url":"/paper/improving-deep-learning-based-semi-supervised","title":"Comparison of semi-supervised deep learning algorithms for audio classification","date":"2021-02-16","arxiv_id":"2102.08183","repositories_listed":1,"syntology":null},{"url":"/paper/urban-sound-classification-striving-towards-a","title":"Urban Sound Classification : striving towards a fair comparison","date":"2020-10-22","arxiv_id":"2010.11805","repositories_listed":1,"syntology":null},{"url":"/paper/esresnet-environmental-sound-classification","title":"ESResNet: Environmental Sound Classification Based on Visual Domain Models","date":"2020-04-15","arxiv_id":"2004.07301","repositories_listed":1,"syntology":null},{"url":"/paper/urban-sound-tagging-using-convolutional","title":"Urban Sound Tagging using Convolutional Neural Networks","date":"2019-09-27","arxiv_id":"1909.12699","repositories_listed":1,"syntology":null},{"url":"/paper/environmental-sound-classification-on","title":"Environmental Sound Classification on Microcontrollers using Convolutional Neural Networks","date":"2019-05-15","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/ubicoustics-plug-and-play-acoustic-activity","title":"Ubicoustics: Plug-and-Play Acoustic Activity Recognition","date":"2018-10-14","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/utilizing-domain-knowledge-in-end-to-end","title":"Utilizing Domain Knowledge in End-to-End Audio Processing","date":"2017-12-01","arxiv_id":"1712.00254","repositories_listed":1,"syntology":null},{"url":"/paper/deep-convolutional-neural-networks-and-data-2","title":"Deep Convolutional Neural Networks and Data Augmentation for Environmental Sound Classification","date":"2017-01-23","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":2,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}