{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/convnet-architecture-search-for","title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","arxiv_id":"1708.05038","date":"2017-08-16","proceeding":null,"authors":["Du Tran","Jamie Ray","Zheng Shou","Shih-Fu Chang","Manohar Paluri"],"abstract":"Learning image representations with ConvNets by pre-training on ImageNet has\nproven useful across many visual understanding tasks including object\ndetection, semantic segmentation, and image captioning. Although any image\nrepresentation can be applied to video frames, a dedicated spatiotemporal\nrepresentation is still vital in order to incorporate motion patterns that\ncannot be captured by appearance based models alone. This paper presents an\nempirical ConvNet architecture search for spatiotemporal feature learning,\nculminating in a deep 3-dimensional (3D) Residual ConvNet. Our proposed\narchitecture outperforms C3D by a good margin on Sports-1M, UCF101, HMDB51,\nTHUMOS14, and ASLAN while being 2 times faster at inference time, 2 times\nsmaller in model size, and having a more compact representation.","url_abs":"http://arxiv.org/abs/1708.05038v1","url_pdf":"http://arxiv.org/pdf/1708.05038v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"convnet-architecture-search-for","repo_url":"https://github.com/farazahmeds/Classification-of-brain-tumor-using-Spatiotemporal-models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"image-captioning","task_name":"Image Captioning"},{"task_slug":"architecture-search","task_name":"Neural Architecture Search"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"object-detection-1","task_name":"object-detection"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"TSN","rank_in_archive_order":166,"of":207,"metrics":{"Acc@1":"73.9"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-hmdb-51","task":"Action Recognition","dataset":"HMDB-51","model":"Res3D","rank_in_archive_order":71,"of":77,"metrics":{"Average accuracy of 3 splits":"54.9"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101","task":"Action Recognition","dataset":"UCF101","model":"Res3D","rank_in_archive_order":79,"of":91,"metrics":{"3-fold Accuracy":"85.8"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1708.05038","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}