{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/efficientleaf-a-faster-learnable-audio","title":"EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use","arxiv_id":"2207.05508","date":"2022-07-12","proceeding":null,"authors":["Jan Schlüter","Gerald Gutenbrunner"],"abstract":"In audio classification, differentiable auditory filterbanks with few parameters cover the middle ground between hard-coded spectrograms and raw audio. LEAF (arXiv:2101.08596), a Gabor-based filterbank combined with Per-Channel Energy Normalization (PCEN), has shown promising results, but is computationally expensive. With inhomogeneous convolution kernel sizes and strides, and by replacing PCEN with better parallelizable operations, we can reach similar results more efficiently. In experiments on six audio classification tasks, our frontend matches the accuracy of LEAF at 3% of the cost, but both fail to consistently outperform a fixed mel filterbank. The quest for learnable audio frontends is not solved.","url_abs":"https://arxiv.org/abs/2207.05508v1","url_pdf":"https://arxiv.org/pdf/2207.05508v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"efficientleaf-a-faster-learnable-audio","repo_url":"https://github.com/cpjku/efficientleaf","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"instrument-recognition","task_name":"Instrument Recognition"},{"task_slug":"pitch-classification","task_name":"Pitch Classification"},{"task_slug":"spoken-language-identification","task_name":"Spoken language identification"}],"methods":[{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"efficientnet","method_name":"EfficientNet"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-classification-on-birdclef-2021","task":"Audio Classification","dataset":"BirdCLEF 2021","model":"EfficientLEAF (8s)","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"72.2"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-birdclef-2021","task":"Audio Classification","dataset":"BirdCLEF 2021","model":"EfficientLEAF","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"42.9"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-birdclef-2021","task":"Audio Classification","dataset":"BirdCLEF 2021","model":"LEAF","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"42.3"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-birdclef-2021","task":"Audio Classification","dataset":"BirdCLEF 2021","model":"melspect","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"39.9"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-crema-d","task":"Audio Classification","dataset":"CREMA-D","model":"EfficientLEAF","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"60.2"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-crema-d","task":"Audio Classification","dataset":"CREMA-D","model":"melspect","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"58.8"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-crema-d","task":"Audio Classification","dataset":"CREMA-D","model":"LEAF","rank_in_archive_order":3,"of":3,"metrics":{"Accuracy":"50.2"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-speech-commands-1","task":"Audio Classification","dataset":"Speech Commands","model":"EfficientLEAF","rank_in_archive_order":5,"of":7,"metrics":{"Accuracy":"95.2"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-speech-commands-1","task":"Audio Classification","dataset":"Speech Commands","model":"LEAF","rank_in_archive_order":6,"of":7,"metrics":{"Accuracy":"95.1"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-speech-commands-1","task":"Audio Classification","dataset":"Speech Commands","model":"melspect","rank_in_archive_order":7,"of":7,"metrics":{"Accuracy":"95.1"},"uses_additional_data":false},{"leaderboard":"/sota/instrument-recognition-on-nsynth","task":"Instrument Recognition","dataset":"NSynth","model":"melspect","rank_in_archive_order":5,"of":7,"metrics":{"Accuracy":"72.1"},"uses_additional_data":false},{"leaderboard":"/sota/instrument-recognition-on-nsynth","task":"Instrument Recognition","dataset":"NSynth","model":"EfficientLEAF","rank_in_archive_order":6,"of":7,"metrics":{"Accuracy":"71.7"},"uses_additional_data":false},{"leaderboard":"/sota/instrument-recognition-on-nsynth","task":"Instrument Recognition","dataset":"NSynth","model":"LEAF","rank_in_archive_order":7,"of":7,"metrics":{"Accuracy":"69.2"},"uses_additional_data":false},{"leaderboard":"/sota/spoken-language-identification-on-voxforge-2","task":"Spoken language identification","dataset":"VoxForge","model":"LEAF","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"91.5"},"uses_additional_data":false},{"leaderboard":"/sota/spoken-language-identification-on-voxforge-2","task":"Spoken language identification","dataset":"VoxForge","model":"EfficientLEAF","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"86.6"},"uses_additional_data":false},{"leaderboard":"/sota/spoken-language-identification-on-voxforge-2","task":"Spoken language identification","dataset":"VoxForge","model":"melspect","rank_in_archive_order":3,"of":3,"metrics":{"Accuracy":"85.6"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}