{"url":"/task/music-auto-tagging","name":"Music Auto-Tagging","slug":"music-auto-tagging","description_markdown":null,"categories":[{"name":"Music","url":"/area/music"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":22,"papers_with_code":15,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":4,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/music-auto-tagging-on-magnatagatune","slug":"music-auto-tagging-on-magnatagatune","dataset":"MagnaTagATune","dataset_url":"/dataset/magnatagatune","rows_in_archive":3,"metrics":["PR-AUC","ROC AUC"],"first_row_in_archive_order":{"model":"M2D2 AS+","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_url":"/paper/m2d2-exploring-general-purpose-audio-language","paper_date":"2025-03-28","arxiv_id":"2503.22104","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"syntology":null}},{"leaderboard":"/sota/music-auto-tagging-on-magnatagatune-clean","slug":"music-auto-tagging-on-magnatagatune-clean","dataset":"MagnaTagATune (clean)","dataset_url":"/dataset/magnatagatune","rows_in_archive":3,"metrics":["PR-AUC","ROC-AUC"],"first_row_in_archive_order":{"model":"Short-chunk CNN + Res","paper_title":"Evaluation of CNN-based Automatic Music Tagging Models","paper_url":"/paper/evaluation-of-cnn-based-automatic-music","paper_date":"2020-06-01","arxiv_id":"2006.00751","code_links":[{"title":"minzwon/sota-music-tagging-models","url":"https://github.com/minzwon/sota-music-tagging-models"},{"title":"minzwon/tag-based-music-retrieval","url":"https://github.com/minzwon/tag-based-music-retrieval"},{"title":"pxaris/ccml","url":"https://github.com/pxaris/ccml"},{"title":"cgaroufis/msspt","url":"https://github.com/cgaroufis/msspt"},{"title":"jaehwlee/tf2-music-tagging-models","url":"https://github.com/jaehwlee/tf2-music-tagging-models"},{"title":"Dohppak/Music_DeepEmbedding_Extractor","url":"https://github.com/Dohppak/Music_DeepEmbedding_Extractor"},{"title":"HephaestusProject/pytorch-FCN","url":"https://github.com/HephaestusProject/pytorch-FCN"}],"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/music-auto-tagging-on-million-song-dataset","slug":"music-auto-tagging-on-million-song-dataset","dataset":"Million Song Dataset","dataset_url":"/dataset/msd","rows_in_archive":2,"metrics":["PR-AUC","ROC-AUC"],"first_row_in_archive_order":{"model":"CLMR","paper_title":"Contrastive Learning of Musical Representations","paper_url":"/paper/contrastive-learning-of-musical","paper_date":"2021-03-17","arxiv_id":"2103.09410","code_links":[{"title":"spijkervet/CLMR","url":"https://github.com/spijkervet/CLMR"}],"syntology":null}},{"leaderboard":"/sota/music-auto-tagging-on-timetravel","slug":"music-auto-tagging-on-timetravel","dataset":"TimeTravel","dataset_url":"/dataset/timetravel","rows_in_archive":1,"metrics":["0..5sec"],"first_row_in_archive_order":{"model":"Fellini","paper_title":"TräumerAI: Dreaming Music with StyleGAN","paper_url":"/paper/traumerai-dreaming-music-with-stylegan","paper_date":"2021-02-09","arxiv_id":"2102.04680","code_links":[{"title":"jdasam/traeumerAI","url":"https://github.com/jdasam/traeumerAI"}],"syntology":null}}],"datasets":[{"url":"/dataset/magnatagatune","name":"MagnaTagATune","full_name":"","num_papers_in_archive":65},{"url":"/dataset/timetravel","name":"TimeTravel","full_name":"","num_papers_in_archive":14},{"url":"/dataset/msd","name":"MSD","full_name":"Million Song Dataset","num_papers_in_archive":11},{"url":"/dataset/piast","name":"PIAST","full_name":"PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":15,"of":15,"tagged_in_all":22,"items":[{"url":"/paper/sample-level-deep-convolutional-neural","title":"Sample-level Deep Convolutional Neural Networks for Music Auto-tagging Using Raw Waveforms","date":"2017-03-06","arxiv_id":"1703.01789","repositories_listed":3,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/m2d2-exploring-general-purpose-audio-language","title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","date":"2025-03-28","arxiv_id":"2503.22104","repositories_listed":2,"syntology":null},{"url":"/paper/pre-training-music-classification-models-via","title":"Pre-training Music Classification Models via Music Source Separation","date":"2023-10-24","arxiv_id":"2310.15845","repositories_listed":2,"syntology":null},{"url":"/paper/deep-learning-based-edm-subgenre","title":"Deep Learning Based EDM Subgenre Classification using Mel-Spectrogram and Tempogram Features","date":"2021-10-17","arxiv_id":"2110.08862","repositories_listed":2,"syntology":null},{"url":"/paper/deep-content-user-embedding-model-for-music","title":"Deep Content-User Embedding Model for Music Recommendation","date":"2018-07-18","arxiv_id":"1807.06786","repositories_listed":2,"syntology":null},{"url":"/paper/sample-level-cnn-architectures-for-music-auto","title":"Sample-level CNN Architectures for Music Auto-tagging Using Raw Waveforms","date":"2017-10-28","arxiv_id":"1710.10451","repositories_listed":2,"syntology":null},{"url":"/paper/semantic-aware-interpretable-multimodal-music","title":"Semantic-Aware Interpretable Multimodal Music Auto-Tagging","date":"2025-05-22","arxiv_id":"2505.17233","repositories_listed":1,"syntology":null},{"url":"/paper/masked-latent-prediction-and-classification","title":"Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning","date":"2025-02-17","arxiv_id":"2502.12031","repositories_listed":1,"syntology":null},{"url":"/paper/parameter-efficient-transfer-learning-for-3","title":"Parameter-Efficient Transfer Learning for Music Foundation Models","date":"2024-11-28","arxiv_id":"2411.19371","repositories_listed":1,"syntology":null},{"url":"/paper/audio-embeddings-as-teachers-for-music","title":"Audio Embeddings as Teachers for Music Classification","date":"2023-06-30","arxiv_id":"2306.17424","repositories_listed":1,"syntology":null},{"url":"/paper/multi-source-contrastive-learning-from","title":"Multi-Source Contrastive Learning from Musical Audio","date":"2023-02-14","arxiv_id":"2302.07077","repositories_listed":1,"syntology":null},{"url":"/paper/contrastive-learning-of-musical","title":"Contrastive Learning of Musical Representations","date":"2021-03-17","arxiv_id":"2103.09410","repositories_listed":1,"syntology":null},{"url":"/paper/traumerai-dreaming-music-with-stylegan","title":"TräumerAI: Dreaming Music with StyleGAN","date":"2021-02-09","arxiv_id":"2102.04680","repositories_listed":1,"syntology":null},{"url":"/paper/multi-level-and-multi-scale-feature","title":"Multi-Level and Multi-Scale Feature Aggregation Using Pre-trained Convolutional Neural Networks for Music Auto-tagging","date":"2017-03-06","arxiv_id":"1703.01793","repositories_listed":1,"syntology":null},{"url":"/paper/a-deep-bag-of-features-model-for-music-auto","title":"A Deep Bag-of-Features Model for Music Auto-Tagging","date":"2015-08-20","arxiv_id":"1508.04999","repositories_listed":1,"syntology":null}],"syntology_records":1,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}