{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/pacs-a-dataset-for-physical-audiovisual","title":"PACS: A Dataset for Physical Audiovisual CommonSense Reasoning","arxiv_id":"2203.11130","date":"2022-03-21","proceeding":null,"authors":["Samuel Yu","Peter Wu","Paul Pu Liang","Ruslan Salakhutdinov","Louis-Philippe Morency"],"abstract":"In order for AI to be safely deployed in real-world scenarios such as hospitals, schools, and the workplace, it must be able to robustly reason about the physical world. Fundamental to this reasoning is physical common sense: understanding the physical properties and affordances of available objects, how they can be manipulated, and how they interact with other objects. Physical commonsense reasoning is fundamentally a multi-sensory task, since physical properties are manifested through multiple modalities - two of them being vision and acoustics. Our paper takes a step towards real-world physical commonsense reasoning by contributing PACS: the first audiovisual benchmark annotated for physical commonsense attributes. PACS contains 13,400 question-answer pairs, involving 1,377 unique physical commonsense questions and 1,526 videos. Our dataset provides new opportunities to advance the research field of physical reasoning by bringing audio as a core component of this multimodal problem. Using PACS, we evaluate multiple state-of-the-art models on our new challenging task. While some models show promising results (70% accuracy), they all fall short of human performance (95% accuracy). We conclude the paper by demonstrating the importance of multimodal reasoning and providing possible avenues for future research.","url_abs":"https://arxiv.org/abs/2203.11130v3","url_pdf":"https://arxiv.org/pdf/2203.11130v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"pacs-a-dataset-for-physical-audiovisual","repo_url":"https://github.com/samuelyu2002/pacs","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"jax","reach":null}],"tasks":[{"task_slug":"common-sense-reasoning","task_name":"Common Sense Reasoning"},{"task_slug":"multimodal-reasoning","task_name":"Multimodal Reasoning"},{"task_slug":"physical-commonsense-reasoning","task_name":"Physical Commonsense Reasoning"}],"methods":[],"datasets_introduced":[{"slug":"pacs-commonsense","name":"Physical Audiovisual CommonSense","full_name":""}],"methods_introduced":[],"results":[{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"Human","rank_in_archive_order":1,"of":6,"metrics":{"With Audio (Acc %)":"96.3 ± 2.1","Without Audio (Acc %)":"90.5 ± 3.1"},"uses_additional_data":false},{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"Merlot Reserve (Large)","rank_in_archive_order":2,"of":6,"metrics":{"With Audio (Acc %)":"70.1 ± 1.0","Without Audio (Acc %)":" 68.4 ± 0.7"},"uses_additional_data":false},{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"CLIP/AudioCLIP","rank_in_archive_order":3,"of":6,"metrics":{"With Audio (Acc %)":"60.0 ± 0.9","Without Audio (Acc %)":"56.3 ± 0.7"},"uses_additional_data":false},{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"Late Fusion","rank_in_archive_order":4,"of":6,"metrics":{"With Audio (Acc %)":"55.0 ± 1.1","Without Audio (Acc %)":" 52.5 ± 1.6"},"uses_additional_data":false},{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"Majority","rank_in_archive_order":5,"of":6,"metrics":{"With Audio (Acc %)":"50.4","Without Audio (Acc %)":"50.4"},"uses_additional_data":false},{"leaderboard":"/sota/physical-commonsense-reasoning-on-physical","task":"Physical Commonsense Reasoning","dataset":"Physical Audiovisual CommonSense","model":"UNITER (Large)","rank_in_archive_order":6,"of":6,"metrics":{"Without Audio (Acc %)":"60.6 ± 2.2"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2203.11130","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}