{"url":"/task/instrument-recognition","name":"Instrument Recognition","slug":"instrument-recognition","description_markdown":null,"categories":[{"name":"Audio","url":"/area/audio"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":39,"papers_with_code":26,"benchmarks":3,"benchmark_tables_in_archive":3,"benchmark_tables_shown":3,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":4,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/instrument-recognition-on-nsynth","slug":"instrument-recognition-on-nsynth","dataset":"NSynth","dataset_url":"/dataset/nsynth","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"M2D-CLAP","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_url":"/paper/m2d2-exploring-general-purpose-audio-language","paper_date":"2025-03-28","arxiv_id":"2503.22104","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"syntology":null}},{"leaderboard":"/sota/instrument-recognition-on-openmic-2018","slug":"instrument-recognition-on-openmic-2018","dataset":"OpenMIC-2018","dataset_url":"/dataset/openmic-2018","rows_in_archive":5,"metrics":["mean average precision"],"first_row_in_archive_order":{"model":"DyMN-L","paper_title":"Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models","paper_url":"/paper/dynamic-convolutional-neural-networks-as","paper_date":"2023-10-24","arxiv_id":"2310.15648","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"}],"syntology":null}},{"leaderboard":"/sota/instrument-recognition-on-irmas","slug":"instrument-recognition-on-irmas","dataset":"IRMAS","dataset_url":null,"rows_in_archive":1,"metrics":["F1-score","Precision","Recall"],"first_row_in_archive_order":{"model":"SVM","paper_title":"Predominant Musical Instrument Classification based on Spectral Features","paper_url":"/paper/predominant-musical-instrument-classification","paper_date":"2019-11-30","arxiv_id":"1912.02606","code_links":[{"title":"vntkumar8/musical-instrument-classification","url":"https://github.com/vntkumar8/musical-instrument-classification"}],"syntology":null}}],"datasets":[{"url":"/dataset/nsynth","name":"NSynth","full_name":"NSynth","num_papers_in_archive":138},{"url":"/dataset/kvasir-instrument","name":"Kvasir-Instrument","full_name":"","num_papers_in_archive":19},{"url":"/dataset/openmic-2018","name":"OpenMIC-2018","full_name":null,"num_papers_in_archive":8},{"url":"/dataset/youtube-100m","name":"YouTube-100M","full_name":"YouTube-100m","num_papers_in_archive":8}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":26,"of":26,"tagged_in_all":39,"items":[{"url":"/paper/atst-audio-representation-learning-with","title":"ATST: Audio Representation Learning with Teacher-Student Transformer","date":"2022-04-26","arxiv_id":"2204.12076","repositories_listed":4,"syntology":null},{"url":"/paper/nanonet-real-time-polyp-segmentation-in-video","title":"NanoNet: Real-Time Polyp Segmentation in Video Capsule Endoscopy and Colonoscopy","date":"2021-04-22","arxiv_id":"2104.11138","repositories_listed":3,"syntology":null},{"url":"/paper/m2d2-exploring-general-purpose-audio-language","title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","date":"2025-03-28","arxiv_id":"2503.22104","repositories_listed":2,"syntology":null},{"url":"/paper/self-supervised-audio-teacher-student","title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","date":"2023-06-07","arxiv_id":"2306.04186","repositories_listed":2,"syntology":null},{"url":"/paper/efficient-training-of-audio-transformers-with","title":"Efficient Training of Audio Transformers with Patchout","date":"2021-10-11","arxiv_id":"2110.05069","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/a-hierarchical-deep-learning-approach-for","title":"A Hierarchical Deep Learning Approach for Minority Instrument Detection","date":"2025-06-26","arxiv_id":"2506.21167","repositories_listed":1,"syntology":null},{"url":"/paper/masked-latent-prediction-and-classification","title":"Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning","date":"2025-02-17","arxiv_id":"2502.12031","repositories_listed":1,"syntology":null},{"url":"/paper/mirflex-music-information-retrieval-feature","title":"MIRFLEX: Music Information Retrieval Feature Library for Extraction","date":"2024-11-01","arxiv_id":"2411.00469","repositories_listed":1,"syntology":null},{"url":"/paper/i-can-listen-but-cannot-read-an-evaluation-of","title":"I can listen but cannot read: An evaluation of two-tower multimodal systems for instrument recognition","date":"2024-07-25","arxiv_id":"2407.18058","repositories_listed":1,"syntology":null},{"url":"/paper/a-stem-agnostic-single-decoder-system-for","title":"A Stem-Agnostic Single-Decoder System for Music Source Separation Beyond Four Stems","date":"2024-06-26","arxiv_id":"2406.18747","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/dynamic-convolutional-neural-networks-as","title":"Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models","date":"2023-10-24","arxiv_id":"2310.15648","repositories_listed":1,"syntology":null},{"url":"/paper/transfer-learning-and-bias-correction-with","title":"Transfer Learning and Bias Correction with Pre-trained Audio Embeddings","date":"2023-07-20","arxiv_id":"2307.10834","repositories_listed":1,"syntology":null},{"url":"/paper/audio-embeddings-as-teachers-for-music","title":"Audio Embeddings as Teachers for Music Classification","date":"2023-06-30","arxiv_id":"2306.17424","repositories_listed":1,"syntology":null},{"url":"/paper/surgical-phase-and-instrument-recognition-how","title":"Surgical Phase and Instrument Recognition: How to identify appropriate Dataset Splits","date":"2023-06-29","arxiv_id":"2306.16879","repositories_listed":1,"syntology":null},{"url":"/paper/efficientleaf-a-faster-learnable-audio","title":"EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use","date":"2022-07-12","arxiv_id":"2207.05508","repositories_listed":1,"syntology":null},{"url":"/paper/chmusic-a-traditional-chinese-music-dataset","title":"ChMusic: A Traditional Chinese Music Dataset for Evaluation of Instrument Recognition","date":"2021-08-19","arxiv_id":"2108.08470","repositories_listed":1,"syntology":null},{"url":"/paper/use-of-speaker-recognition-approaches-for","title":"Use of speaker recognition approaches for learning and evaluating embedding representations of musical instrument sounds","date":"2021-07-24","arxiv_id":"2107.11506","repositories_listed":1,"syntology":null},{"url":"/paper/leveraging-hierarchical-structures-for-few","title":"Leveraging Hierarchical Structures for Few-Shot Musical Instrument Recognition","date":"2021-07-14","arxiv_id":"2107.07029","repositories_listed":1,"syntology":null},{"url":"/paper/receptive-field-regularization-techniques-for","title":"Receptive Field Regularization Techniques for Audio Classification and Tagging with Deep Convolutional Neural Networks","date":"2021-05-26","arxiv_id":"2105.12395","repositories_listed":1,"syntology":null},{"url":"/paper/kvasir-instrument-diagnostic-and-therapeutic","title":"Kvasir-Instrument: Diagnostic and therapeutic tool segmentation dataset in gastrointestinal endoscopy","date":"2020-10-23","arxiv_id":"2011.08065","repositories_listed":1,"syntology":null},{"url":"/paper/predominant-musical-instrument-classification","title":"Predominant Musical Instrument Classification based on Spectral Features","date":"2019-11-30","arxiv_id":"1912.02606","repositories_listed":1,"syntology":null},{"url":"/paper/augmentation-methods-on-monophonic-audio-for","title":"Augmentation Methods on Monophonic Audio for Instrument Classification in Polyphonic Music","date":"2019-11-28","arxiv_id":"1911.12505","repositories_listed":1,"syntology":null},{"url":"/paper/an-attention-mechanism-for-musical-instrument","title":"An Attention Mechanism for Musical Instrument Recognition","date":"2019-07-09","arxiv_id":"1907.04294","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-convolutional-lstm-approach","title":"Weakly Supervised Convolutional LSTM Approach for Tool Tracking in Laparoscopic Videos","date":"2018-12-04","arxiv_id":"1812.01366","repositories_listed":1,"syntology":null},{"url":"/paper/deep-convolutional-neural-networks-for-6","title":"Deep convolutional neural networks for predominant instrument recognition in polyphonic music","date":"2016-05-31","arxiv_id":"1605.09507","repositories_listed":1,"syntology":null},{"url":"/paper/automatic-instrument-recognition-in","title":"Automatic Instrument Recognition in Polyphonic Music Using Convolutional Neural Networks","date":"2015-11-17","arxiv_id":"1511.05520","repositories_listed":1,"syntology":null}],"syntology_records":2,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}