{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/multi-task-zero-shot-action-recognition-with","title":"Multi-Task Zero-Shot Action Recognition with Prioritised Data Augmentation","arxiv_id":"1611.08663","date":"2016-11-26","proceeding":null,"authors":["Xun Xu","Timothy M. Hospedales","Shaogang Gong"],"abstract":"Zero-Shot Learning (ZSL) promises to scale visual recognition by bypassing\nthe conventional model training requirement of annotated examples for every\ncategory. This is achieved by establishing a mapping connecting low-level\nfeatures and a semantic description of the label space, referred as\nvisual-semantic mapping, on auxiliary data. Reusing the learned mapping to\nproject target videos into an embedding space thus allows novel-classes to be\nrecognised by nearest neighbour inference. However, existing ZSL methods suffer\nfrom auxiliary-target domain shift intrinsically induced by assuming the same\nmapping for the disjoint auxiliary and target classes. This compromises the\ngeneralisation accuracy of ZSL recognition on the target data. In this work, we\nimprove the ability of ZSL to generalise across this domain shift in both\nmodel- and data-centric ways by formulating a visual-semantic mapping with\nbetter generalisation properties and a dynamic data re-weighting method to\nprioritise auxiliary data that are relevant to the target classes.\nSpecifically: (1) We introduce a multi-task visual-semantic mapping to improve\ngeneralisation by constraining the semantic mapping parameters to lie on a\nlow-dimensional manifold, (2) We explore prioritised data augmentation by\nexpanding the pool of auxiliary data with additional instances weighted by\nrelevance to the target domain. The proposed new model is applied to the\nchallenging zero-shot action recognition problem to demonstrate its advantages\nover existing ZSL models.","url_abs":"http://arxiv.org/abs/1611.08663v1","url_pdf":"http://arxiv.org/pdf/1611.08663v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"data-augmentation","task_name":"Data Augmentation"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"},{"task_slug":"zero-shot-action-recognition","task_name":"Zero-Shot Action Recognition"},{"task_slug":"zero-shot-learning","task_name":"Zero-Shot Learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/zero-shot-action-recognition-on-hmdb51","task":"Zero-Shot Action Recognition","dataset":"HMDB51","model":"MTE","rank_in_archive_order":25,"of":29,"metrics":{"Top-1 Accuracy":"19.7"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-olympics","task":"Zero-Shot Action Recognition","dataset":"Olympics","model":"MTE","rank_in_archive_order":7,"of":9,"metrics":{"Top-1 Accuracy":"44.3"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","task":"Zero-Shot Action Recognition","dataset":"UCF101","model":"MTE","rank_in_archive_order":29,"of":35,"metrics":{"Top-1 Accuracy":"15.8"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1611.08663","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}