{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/piano-skills-assessment","title":"Piano Skills Assessment","arxiv_id":"2101.04884","date":"2021-01-13","proceeding":null,"authors":["Paritosh Parmar","Jaiden Reddy","Brendan Morris"],"abstract":"Can a computer determine a piano player's skill level? Is it preferable to base this assessment on visual analysis of the player's performance or should we trust our ears over our eyes? Since current CNNs have difficulty processing long video videos, how can shorter clips be sampled to best reflect the players skill level? In this work, we collect and release a first-of-its-kind dataset for multimodal skill assessment focusing on assessing piano player's skill level, answer the asked questions, initiate work in automated evaluation of piano playing skills and provide baselines for future work. Dataset is available from: https://github.com/ParitoshParmar/Piano-Skills-Assessment.","url_abs":"https://arxiv.org/abs/2101.04884v2","url_pdf":"https://arxiv.org/pdf/2101.04884v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"piano-skills-assessment","repo_url":"https://github.com/ParitoshParmar/Piano-Skills-Assessment","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"action-quality-assessment","task_name":"Action Quality Assessment"},{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"multimodal-deep-learning","task_name":"Multimodal Deep Learning"},{"task_slug":"skills-assessment","task_name":"Skills Assessment"},{"task_slug":"skills-evaluation","task_name":"Skills Evaluation"},{"task_slug":"video-classification","task_name":"Video Classification"},{"task_slug":"video-recognition","task_name":"Video Recognition"}],"methods":[],"datasets_introduced":[{"slug":"multimodal-pisa","name":"Multimodal PISA","full_name":"Multimodal Piano Skills Assessment"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-classification-on-multimodal-pisa","task":"Audio Classification","dataset":"Multimodal PISA","model":"Audio","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy (%)":"64.50"},"uses_additional_data":false},{"leaderboard":"/sota/skills-assessment-on-multimodal-pisa","task":"Skills Assessment","dataset":"Multimodal PISA","model":"MMDL","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy (%)":"74.60"},"uses_additional_data":false},{"leaderboard":"/sota/video-classification-on-multimodal-pisa","task":"Video Classification","dataset":"Multimodal PISA","model":"Video","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy (%)":"73.95"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2101.04884","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}