{"url":"/task/music-transcription","name":"Music Transcription","slug":"music-transcription","description_markdown":"Music transcription is the task of converting an acoustic musical signal into some form of music notation.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [ISMIR 2015 Tutorial - Automatic Music Transcription](http://c4dm.eecs.qmul.ac.uk/ismir15-amt-tutorial/AMT_tutorial_ISMIR_2015.pdf) )</span>","categories":[{"name":"Music","url":"/area/music"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":96,"papers_with_code":47,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":14,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/music-transcription-on-maestro","slug":"music-transcription-on-maestro","dataset":"MAESTRO","dataset_url":"/dataset/maestro","rows_in_archive":9,"metrics":["Onset F1"],"first_row_in_archive_order":{"model":"Transkun V2 (SemiCRF)","paper_title":"Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano Transcription","paper_url":"/paper/scoring-intervals-using-non-hierarchical","paper_date":"2024-04-15","arxiv_id":"2404.09466","code_links":[{"title":"yujia-yan/transkun","url":"https://github.com/yujia-yan/transkun"},{"title":"yujia-yan/skipping-the-frame-level","url":"https://github.com/yujia-yan/skipping-the-frame-level"}],"syntology":null}},{"leaderboard":"/sota/music-transcription-on-maps","slug":"music-transcription-on-maps","dataset":"MAPS","dataset_url":"/dataset/maps","rows_in_archive":6,"metrics":["Onset F1"],"first_row_in_archive_order":{"model":"Transkun V2 (SemiCRF) with Data Augmentation","paper_title":"Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano Transcription","paper_url":"/paper/scoring-intervals-using-non-hierarchical","paper_date":"2024-04-15","arxiv_id":"2404.09466","code_links":[{"title":"yujia-yan/transkun","url":"https://github.com/yujia-yan/transkun"},{"title":"yujia-yan/skipping-the-frame-level","url":"https://github.com/yujia-yan/skipping-the-frame-level"}],"syntology":null}},{"leaderboard":"/sota/music-transcription-on-musicnet","slug":"music-transcription-on-musicnet","dataset":"MusicNet","dataset_url":"/dataset/musicnet","rows_in_archive":6,"metrics":["APS","Number of params"],"first_row_in_archive_order":{"model":"Residual Shuffle-Exchange network","paper_title":"Residual Shuffle-Exchange Networks for Fast Processing of Long Sequences","paper_url":"/paper/residual-shuffle-exchange-networks-for-fast","paper_date":"2020-04-06","arxiv_id":"2004.04662","code_links":[{"title":"LUMII-Syslab/RSE","url":"https://github.com/LUMII-Syslab/RSE"},{"title":"Aroksak/RSE","url":"https://github.com/Aroksak/RSE"}],"syntology":null}},{"leaderboard":"/sota/music-transcription-on-slakh2100","slug":"music-transcription-on-slakh2100","dataset":"Slakh2100","dataset_url":"/dataset/slakh2100","rows_in_archive":6,"metrics":["note-level F-measure-no-offset (Fno)","Onset F1"],"first_row_in_archive_order":{"model":"YourMT3+ (YPTF.MoE+M)","paper_title":"YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation","paper_url":"/paper/yourmt3-multi-instrument-music-transcription","paper_date":"2024-07-05","arxiv_id":"2407.04822","code_links":[{"title":"mimbres/yourmt3","url":"https://github.com/mimbres/yourmt3"}],"syntology":null}},{"leaderboard":"/sota/music-transcription-on-urmp","slug":"music-transcription-on-urmp","dataset":"URMP","dataset_url":"/dataset/urmp","rows_in_archive":3,"metrics":["Onset F1"],"first_row_in_archive_order":{"model":"YourMT3+ (YPTF.MoE+M)","paper_title":"YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation","paper_url":"/paper/yourmt3-multi-instrument-music-transcription","paper_date":"2024-07-05","arxiv_id":"2407.04822","code_links":[{"title":"mimbres/yourmt3","url":"https://github.com/mimbres/yourmt3"}],"syntology":null}},{"leaderboard":"/sota/music-transcription-on-smd-piano","slug":"music-transcription-on-smd-piano","dataset":"SMD Piano","dataset_url":null,"rows_in_archive":1,"metrics":["Onset F1"],"first_row_in_archive_order":{"model":"Transkun V2 (SemiCRF) with Data Augmentation","paper_title":"Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano Transcription","paper_url":"/paper/scoring-intervals-using-non-hierarchical","paper_date":"2024-04-15","arxiv_id":"2404.09466","code_links":[{"title":"yujia-yan/transkun","url":"https://github.com/yujia-yan/transkun"},{"title":"yujia-yan/skipping-the-frame-level","url":"https://github.com/yujia-yan/skipping-the-frame-level"}],"syntology":null}}],"datasets":[{"url":"/dataset/maestro","name":"MAESTRO","full_name":"MAESTRO","num_papers_in_archive":118},{"url":"/dataset/musicnet","name":"MusicNet","full_name":"","num_papers_in_archive":43},{"url":"/dataset/slakh2100","name":"Slakh2100","full_name":"Synthesized Lakh Dataset","num_papers_in_archive":38},{"url":"/dataset/urmp","name":"URMP","full_name":"University of Rochester Multi-Modal Musical Performance","num_papers_in_archive":38},{"url":"/dataset/music21","name":"Music21","full_name":"Music21","num_papers_in_archive":33},{"url":"/dataset/asap-aligned-scores-and-performances","name":"ASAP","full_name":"Aligned Scores and Performances","num_papers_in_archive":13},{"url":"/dataset/cocochorales","name":"CocoChorales","full_name":"","num_papers_in_archive":7},{"url":"/dataset/maps","name":"MAPS","full_name":"Midi Aligned Piano Dataset","num_papers_in_archive":7},{"url":"/dataset/js-fake-chorales","name":"JS Fake Chorales","full_name":"JS Fake Chorales","num_papers_in_archive":3},{"url":"/dataset/egdb","name":"EGDB","full_name":"","num_papers_in_archive":1},{"url":"/dataset/erhupt","name":"ErhuPT","full_name":"Erhu Playing Technique Dataset","num_papers_in_archive":1},{"url":"/dataset/guitar-techs","name":"Guitar-TECHS","full_name":"Guitar Tones/Techniques, Excerpts & Chords Dataset","num_papers_in_archive":1},{"url":"/dataset/yourmt3-dataset","name":"YourMT3 Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/cadenza-woodwind","name":"Cadenza Woodwind","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/multi-instrument-music-transcription","name":"Multi-instrument Music Transcription"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":47,"tagged_in_all":96,"items":[{"url":"/paper/deep-complex-networks","title":"Deep Complex Networks","date":"2017-05-27","arxiv_id":"1705.09792","repositories_listed":9,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/enabling-factorized-piano-music-modeling-and","title":"Enabling Factorized Piano Music Modeling and Generation with the MAESTRO Dataset","date":"2018-10-29","arxiv_id":"1810.12247","repositories_listed":4,"syntology":null},{"url":"/paper/mt3-multi-task-multitrack-music-transcription-1","title":"MT3: Multi-Task Multitrack Music Transcription","date":"2021-11-04","arxiv_id":"2111.03017","repositories_listed":3,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/music-transcription-modelling-and-composition","title":"Music transcription modelling and composition using deep learning","date":"2016-04-29","arxiv_id":"1604.08723","repositories_listed":3,"syntology":null},{"url":"/paper/scoring-intervals-using-non-hierarchical","title":"Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano Transcription","date":"2024-04-15","arxiv_id":"2404.09466","repositories_listed":2,"syntology":null},{"url":"/paper/sequence-to-sequence-piano-transcription-with","title":"Sequence-to-Sequence Piano Transcription with Transformers","date":"2021-07-19","arxiv_id":"2107.09142","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/the-effect-of-spectrogram-reconstruction-on","title":"The Effect of Spectrogram Reconstruction on Automatic Music Transcription: An Alternative Approach to Improve Transcription Accuracy","date":"2020-10-20","arxiv_id":"2010.09969","repositories_listed":2,"syntology":null},{"url":"/paper/residual-shuffle-exchange-networks-for-fast","title":"Residual Shuffle-Exchange Networks for Fast Processing of Long Sequences","date":"2020-04-06","arxiv_id":"2004.04662","repositories_listed":2,"syntology":null},{"url":"/paper/onsets-and-frames-dual-objective-piano","title":"Onsets and Frames: Dual-Objective Piano Transcription","date":"2017-10-30","arxiv_id":"1710.11153","repositories_listed":2,"syntology":null},{"url":"/paper/learning-features-of-music-from-scratch","title":"Learning Features of Music from Scratch","date":"2016-11-29","arxiv_id":"1611.09827","repositories_listed":2,"syntology":null},{"url":"/paper/an-end-to-end-neural-network-for-polyphonic","title":"An End-to-End Neural Network for Polyphonic Piano Music Transcription","date":"2015-08-07","arxiv_id":"1508.01774","repositories_listed":2,"syntology":null},{"url":"/paper/scalable-approximate-algorithms-for-optimal","title":"Scalable Approximate Algorithms for Optimal Transport Linear Models","date":"2025-04-06","arxiv_id":"2504.04609","repositories_listed":1,"syntology":null},{"url":"/paper/d3rm-a-discrete-denoising-diffusion","title":"D3RM: A Discrete Denoising Diffusion Refinement Model for Piano Transcription","date":"2025-01-09","arxiv_id":"2501.05068","repositories_listed":1,"syntology":null},{"url":"/paper/source-separation-automatic-transcription-for","title":"Source Separation & Automatic Transcription for Music","date":"2024-12-09","arxiv_id":"2412.06703","repositories_listed":1,"syntology":null},{"url":"/paper/just-label-the-repeats-for-in-the-wild-audio","title":"Just Label the Repeats for In-The-Wild Audio-to-Score Alignment","date":"2024-11-11","arxiv_id":"2411.07428","repositories_listed":1,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/quantifying-the-corpus-bias-problem-in","title":"Quantifying the Corpus Bias Problem in Automatic Music Transcription Systems","date":"2024-08-08","arxiv_id":"2408.04737","repositories_listed":1,"syntology":null},{"url":"/paper/yourmt3-multi-instrument-music-transcription","title":"YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation","date":"2024-07-05","arxiv_id":"2407.04822","repositories_listed":1,"syntology":null},{"url":"/paper/end-to-end-real-world-polyphonic-piano-audio","title":"End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding","date":"2024-05-22","arxiv_id":"2405.13527","repositories_listed":1,"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/mr-mt3-memory-retaining-multi-track-music","title":"MR-MT3: Memory Retaining Multi-Track Music Transcription to Mitigate Instrument Leakage","date":"2024-03-15","arxiv_id":"2403.10024","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/automatic-piano-transcription-with","title":"Automatic Piano Transcription with Hierarchical Frequency-Time Transformer","date":"2023-07-10","arxiv_id":"2307.04305","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/cross-domain-neural-pitch-and-periodicity","title":"Cross-domain Neural Pitch and Periodicity Estimation","date":"2023-01-28","arxiv_id":"2301.12258","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/m4singer-a-multi-style-multi-singer-and","title":"M4Singer: a Multi-Style, Multi-Singer and Musical Score Provided Mandarin Singing Corpus","date":"2022-12-29","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/fretnet-continuous-valued-pitch-contour","title":"FretNet: Continuous-Valued Pitch Contour Streaming for Polyphonic Guitar Tablature Transcription","date":"2022-12-06","arxiv_id":"2212.03023","repositories_listed":1,"syntology":null},{"url":"/paper/the-chamber-ensemble-generator-limitless-high","title":"The Chamber Ensemble Generator: Limitless High-Quality MIR Data via Generative Modeling","date":"2022-09-28","arxiv_id":"2209.14458","repositories_listed":1,"syntology":{"n":9,"n_ran":8,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/unaligned-supervision-for-automatic-music","title":"Unaligned Supervision For Automatic Music Transcription in The Wild","date":"2022-04-28","arxiv_id":"2204.13668","repositories_listed":1,"syntology":null},{"url":"/paper/context-aware-automatic-music-transcription","title":"Acoustics-specific Piano Velocity Estimation","date":"2022-03-30","arxiv_id":"2203.16294","repositories_listed":1,"syntology":null},{"url":"/paper/a-lightweight-instrument-agnostic-model-for","title":"A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation","date":"2022-03-18","arxiv_id":"2203.09893","repositories_listed":1,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/a-perceptual-measure-for-evaluating-the","title":"A Perceptual Measure for Evaluating the Resynthesis of Automatic Music Transcriptions","date":"2022-02-24","arxiv_id":"2202.12257","repositories_listed":1,"syntology":null},{"url":"/paper/semi-supervised-convolutive-nmf-for-automatic","title":"Semi-Supervised Convolutive NMF for Automatic Piano Transcription","date":"2022-02-10","arxiv_id":"2202.04989","repositories_listed":1,"syntology":null},{"url":"/paper/skipping-the-frame-level-event-based-piano","title":"Skipping the Frame-Level: Event-Based Piano Transcription With Neural Semi-CRFs","date":"2021-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":10,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}