{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/omnivec-learning-robust-representations-with","title":"OmniVec: Learning robust representations with cross modal sharing","arxiv_id":"2311.05709","date":"2023-11-07","proceeding":null,"authors":["Siddharth Srivastava","Gaurav Sharma"],"abstract":"Majority of research in learning based methods has been towards designing and training networks for specific tasks. However, many of the learning based tasks, across modalities, share commonalities and could be potentially tackled in a joint framework. We present an approach in such direction, to learn multiple tasks, in multiple modalities, with a unified architecture. The proposed network is composed of task specific encoders, a common trunk in the middle, followed by task specific prediction heads. We first pre-train it by self-supervised masked training, followed by sequential training for the different tasks. We train the network on all major modalities, e.g.\\ visual, audio, text and 3D, and report results on $22$ diverse and challenging public benchmarks. We demonstrate empirically that, using a joint network to train across modalities leads to meaningful information sharing and this allows us to achieve state-of-the-art results on most of the benchmarks. We also show generalization of the trained network on cross-modal tasks as well as unseen datasets and tasks.","url_abs":"https://arxiv.org/abs/2311.05709v1","url_pdf":"https://arxiv.org/pdf/2311.05709v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"3d-point-cloud-classification","task_name":"3D Point Cloud Classification"},{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"fine-grained-image-classification","task_name":"Fine-Grained Image Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"text-summarization","task_name":"Text Summarization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/3d-point-cloud-classification-on-modelnet40-c","task":"3D Point Cloud Classification","dataset":"ModelNet40-C","model":"OmniVec","rank_in_archive_order":2,"of":13,"metrics":{"Error Rate":"0.156"},"uses_additional_data":true},{"leaderboard":"/sota/3d-point-cloud-classification-on-scanobjectnn","task":"3D Point Cloud Classification","dataset":"ScanObjectNN","model":"OmniVec","rank_in_archive_order":3,"of":77,"metrics":{"Overall Accuracy":"96.1"},"uses_additional_data":true},{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"OmniVec","rank_in_archive_order":6,"of":207,"metrics":{"Acc@1":"91.1"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-mit","task":"Action Classification","dataset":"MIT","model":"OmniVec","rank_in_archive_order":2,"of":2,"metrics":{"Top 1 Accuracy":"49.8"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-moments-in-time-2","task":"Action Classification","dataset":"Moments in Time","model":"OmniVec","rank_in_archive_order":2,"of":4,"metrics":{"Top 1 Accuracy":"49.8"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101","task":"Action Recognition","dataset":"UCF101","model":"OmniVec","rank_in_archive_order":3,"of":91,"metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true},{"leaderboard":"/sota/audio-classification-on-audioset","task":"Audio Classification","dataset":"AudioSet","model":"OmniVec","rank_in_archive_order":2,"of":51,"metrics":{"Test mAP":"0.548"},"uses_additional_data":true},{"leaderboard":"/sota/audio-classification-on-esc-50","task":"Audio Classification","dataset":"ESC-50","model":"OmniVec","rank_in_archive_order":4,"of":29,"metrics":{"Accuracy (5-fold)":"98.4","PRE-TRAINING DATASET":"Multiple","Top-1 Accuracy":"98.4"},"uses_additional_data":true},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-1","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pet Dataset","model":"OmniVec","rank_in_archive_order":2,"of":15,"metrics":{"Accuracy":"99.2"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-places365","task":"Image Classification","dataset":"Places365","model":"OmniVec(ViT)","rank_in_archive_order":2,"of":7,"metrics":{"Top 1 Accuracy":"63.5"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-inaturalist-2018","task":"Image Classification","dataset":"iNaturalist 2018","model":"OmniVec","rank_in_archive_order":2,"of":60,"metrics":{"Top-1 Accuracy":"93.8"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-segmentation-on-nyu-depth-v2","task":"Semantic Segmentation","dataset":"NYU Depth v2","model":"OmniVec","rank_in_archive_order":5,"of":121,"metrics":{"Mean IoU":"60.8"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-segmentation-on-s3dis-area5","task":"Semantic Segmentation","dataset":"S3DIS Area5","model":"OmniVec","rank_in_archive_order":2,"of":61,"metrics":{"mIoU":"75.9"},"uses_additional_data":true},{"leaderboard":"/sota/text-summarization-on-dialogsum","task":"Text Summarization","dataset":"DialogSum","model":"OmniVec","rank_in_archive_order":3,"of":4,"metrics":{"BertScore":"71.91","Rouge1":"46.91","Rouge2":"21.22","RougeL":"40.19"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-msr-vtt-1ka","task":"Video Retrieval","dataset":"MSR-VTT-1kA","model":"OmniVec","rank_in_archive_order":60,"of":63,"metrics":{"text-to-video R@10":"89.4"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-msr-vtt-1ka","task":"Video Retrieval","dataset":"MSR-VTT-1kA","model":"OmniVec (pretrained)","rank_in_archive_order":62,"of":63,"metrics":{"text-to-video R@10":"78.6"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-youcook2","task":"Video Retrieval","dataset":"YouCook2","model":"OmniVec","rank_in_archive_order":15,"of":16,"metrics":{"text-to-video R@10":"70.8"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-youcook2","task":"Video Retrieval","dataset":"YouCook2","model":"OmniVec (pretrained)","rank_in_archive_order":16,"of":16,"metrics":{"text-to-video R@10":"64.2"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2311.05709","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}