{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/omnivec2-a-novel-transformer-based-network","title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","arxiv_id":null,"date":"2024-01-01","proceeding":"CVPR 2024 1","authors":["Siddharth Srivastava","Gaurav Sharma"],"abstract":"    We present a novel multimodal multitask network and associated training algorithm. The method is capable of ingesting data from approximately 12 different modalities namely image video audio text depth point cloud time series tabular graph X-ray infrared IMU and hyperspectral. The proposed approach utilizes modality specialized tokenizers a shared transformer architecture and cross-attention mechanisms to project the data from different modalities into a unified embedding space. It addresses multimodal and multitask scenarios by incorporating modality-specific task heads for different tasks in respective modalities. We propose a novel pretraining strategy with iterative modality switching to initialize the network and a training algorithm which trades off fully joint training over all modalities with training on pairs of modalities at a time. We provide comprehensive evaluation across 25 datasets from 12 modalities and show state of the art performances demonstrating the effectiveness of the proposed architecture pretraining strategy and adapted multitask training.    ","url_abs":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","url_pdf":"http://openaccess.thecvf.com//content/CVPR2024/papers/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"3d-point-cloud-classification","task_name":"3D Point Cloud Classification"},{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"fine-grained-image-classification","task_name":"Fine-Grained Image Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"text-summarization","task_name":"Text Summarization"},{"task_slug":"time-series-1","task_name":"Time Series"},{"task_slug":"zero-shot-video-retrieval","task_name":"Zero-Shot Video Retrieval"}],"methods":[{"method_slug":"i3dr-net","method_name":"I3DR-Net"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/3d-point-cloud-classification-on-modelnet40-c","task":"3D Point Cloud Classification","dataset":"ModelNet40-C","model":"OmniVec2","rank_in_archive_order":1,"of":13,"metrics":{"Error Rate":"0.142"},"uses_additional_data":true},{"leaderboard":"/sota/3d-point-cloud-classification-on-scanobjectnn","task":"3D Point Cloud Classification","dataset":"ScanObjectNN","model":"OmniVec2","rank_in_archive_order":1,"of":77,"metrics":{"Overall Accuracy":"97.2"},"uses_additional_data":true},{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"OmniVec2","rank_in_archive_order":1,"of":207,"metrics":{"Acc@1":"93.6"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-moments-in-time","task":"Action Classification","dataset":"MiT","model":"OmniVec2","rank_in_archive_order":1,"of":29,"metrics":{"Top 1 Accuracy":"53.1"},"uses_additional_data":true},{"leaderboard":"/sota/action-classification-on-moments-in-time-2","task":"Action Classification","dataset":"Moments in Time","model":"OmniVec2","rank_in_archive_order":1,"of":4,"metrics":{"Top 1 Accuracy":"53.1"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101","task":"Action Recognition","dataset":"UCF101","model":"OmniVec2","rank_in_archive_order":4,"of":91,"metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true},{"leaderboard":"/sota/audio-classification-on-audioset","task":"Audio Classification","dataset":"AudioSet","model":"OmniVec2","rank_in_archive_order":1,"of":51,"metrics":{"Test mAP":"0.558"},"uses_additional_data":true},{"leaderboard":"/sota/audio-classification-on-esc-50","task":"Audio Classification","dataset":"ESC-50","model":"OmniVec2","rank_in_archive_order":1,"of":29,"metrics":{"Accuracy (5-fold)":"99.1","PRE-TRAINING DATASET":"Multiple","Top-1 Accuracy":"99.1"},"uses_additional_data":true},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-1","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pet Dataset","model":"OmniVec2","rank_in_archive_order":1,"of":15,"metrics":{"Accuracy":"99.6"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"OmniVec2","rank_in_archive_order":22,"of":1060,"metrics":{"Top 1 Accuracy":"89.3%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-places365","task":"Image Classification","dataset":"Places365","model":"OmniVec2","rank_in_archive_order":1,"of":7,"metrics":{"Top 1 Accuracy":"65.1"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-inaturalist-2018","task":"Image Classification","dataset":"iNaturalist 2018","model":"OmniVec2","rank_in_archive_order":1,"of":60,"metrics":{"Top-1 Accuracy":"94.6"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-segmentation-on-nyu-depth-v2","task":"Semantic Segmentation","dataset":"NYU Depth v2","model":"OmniVec2","rank_in_archive_order":1,"of":121,"metrics":{"Mean IoU":"63.6"},"uses_additional_data":true},{"leaderboard":"/sota/text-summarization-on-dialogsum","task":"Text Summarization","dataset":"DialogSum","model":"OmniVec2","rank_in_archive_order":2,"of":4,"metrics":{"BertScore":"72.8","Rouge1":"47.6","Rouge2":"22.1","RougeL":"41.4"},"uses_additional_data":true},{"leaderboard":"/sota/text-summarization-on-samsum-corpus","task":"Text Summarization","dataset":"SAMSum","model":"OmniVec2","rank_in_archive_order":1,"of":12,"metrics":{"BertScoreF1":"65.1","ROUGE-1":"59.1","ROUGE-2":"34.1","ROUGE-L":"63.7"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-youcook2","task":"Zero-Shot Video Retrieval","dataset":"YouCook2","model":"OmniVec2","rank_in_archive_order":1,"of":9,"metrics":{"text-to-video R@1":"26.1","text-to-video R@10":"70.8","text-to-video R@5":"54.1"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}