{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/msqnet-actor-agnostic-action-recognition-with","title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","arxiv_id":"2307.10763","date":"2023-07-20","proceeding":null,"authors":["Anindya Mondal","Sauradip Nag","Joaquin M Prada","Xiatian Zhu","Anjan Dutta"],"abstract":"Existing action recognition methods are typically actor-specific due to the intrinsic topological and apparent differences among the actors. This requires actor-specific pose estimation (e.g., humans vs. animals), leading to cumbersome model design complexity and high maintenance costs. Moreover, they often focus on learning the visual modality alone and single-label classification whilst neglecting other available information sources (e.g., class name text) and the concurrent occurrence of multiple actions. To overcome these limitations, we propose a new approach called 'actor-agnostic multi-modal multi-label action recognition,' which offers a unified solution for various types of actors, including humans and animals. We further formulate a novel Multi-modal Semantic Query Network (MSQNet) model in a transformer-based object detection framework (e.g., DETR), characterized by leveraging visual and textual modalities to represent the action classes better. The elimination of actor-specific model designs is a key advantage, as it removes the need for actor pose estimation altogether. Extensive experiments on five publicly available benchmarks show that our MSQNet consistently outperforms the prior arts of actor-specific alternatives on human and animal single- and multi-label action recognition tasks by up to 50%. Code is made available at https://github.com/mondalanindya/MSQNet.","url_abs":"https://arxiv.org/abs/2307.10763v3","url_pdf":"https://arxiv.org/pdf/2307.10763v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"msqnet-actor-agnostic-action-recognition-with","repo_url":"https://github.com/mondalanindya/msqnet","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"action-recognition-in-videos-2","task_name":"Action Recognition In Videos"},{"task_slug":null,"task_name":"Action Recognition on HMDB-51"},{"task_slug":"animal-action-recognition","task_name":"Animal Action Recognition"},{"task_slug":"zero-shot-action-recognition","task_name":"Zero-Shot Action Recognition"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"focus","method_name":"Focus"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-recognition-on-animal-kingdom","task":"Action Recognition","dataset":"Animal Kingdom","model":"MSQNet","rank_in_archive_order":3,"of":4,"metrics":{"mAP":"73.1"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-charades","task":"Action Recognition","dataset":"Charades","model":"MSQNet","rank_in_archive_order":1,"of":1,"metrics":{"MAP":"47.57"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-hmdb51","task":"Action Recognition","dataset":"HMDB51","model":"MSQNet","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"93.25"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-on-hockey","task":"Action Recognition","dataset":"Hockey","model":"MSQNet","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"3.05"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-on-thumos14","task":"Action Recognition","dataset":"THUMOS14","model":"MSQNet","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"83.16"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-charades-1","task":"Zero-Shot Action Recognition","dataset":"Charades","model":"MSQNet","rank_in_archive_order":1,"of":4,"metrics":{"mAP":"35.59"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-hmdb51","task":"Zero-Shot Action Recognition","dataset":"HMDB51","model":"MSQNet","rank_in_archive_order":29,"of":29,"metrics":{"Accuracy":"69.43"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-thumos-14","task":"Zero-Shot Action Recognition","dataset":"THUMOS' 14","model":"MSQNet","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"75.33"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}