{"url":"/method/2-1-d-convolution","slug":"2-1-d-convolution","name":"(2+1)D Convolution","full_name":"(2+1)D Convolution","full_name_withheld":false,"description_markdown":"A **(2+1)D Convolution** is a type of [convolution](https://paperswithcode.com/method/convolution) used for action recognition convolutional neural networks, with a spatiotemporal volume. As opposed to applying a [3D Convolution](https://paperswithcode.com/method/3d-convolution) over the entire volume, which can be computationally expensive and lead to overfitting, a (2+1)D convolution splits computation into two convolutions: a spatial 2D convolution followed by a temporal 1D convolution.","description_state":"present","introduced_year":null,"introduced_by":{"title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","first_author":"Du Tran","n_authors":6,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/a-closer-look-at-spatiotemporal-convolutions"},"source":{"url":"http://arxiv.org/abs/1711.11248v3","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/pytorch/vision/blob/9e474c3c46c0871838c021093c67a9c7eb1863ea/torchvision/models/video/resnet.py#L36","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Convolutions","url":"/methods/category/convolutions","pwc_aliases":[]}],"n_papers_tagged":17,"archive_num_papers":17,"papers_newest_first":[{"paper":null,"title":"Multi-Microphone and Multi-Modal Emotion Recognition in Reverberant Environment","date":"2024-09-14","arxiv_id":"2409.09545","n_code_links":0,"syntology":null},{"paper":null,"title":"Use of a Multiscale Vision Transformer to predict Nursing Activities Score from Low Resolution Thermal Videos in an Intensive Care Unit","date":"2024-05-30","arxiv_id":"2406.04364","n_code_links":0,"syntology":null},{"paper":null,"title":"Temporal Contrastive Learning with Curriculum","date":"2022-09-02","arxiv_id":"2209.00760","n_code_links":0,"syntology":null},{"paper":"/paper/motion-focused-contrastive-learning-of-video-1","title":"Motion-Focused Contrastive Learning of Video Representations","date":"2022-01-11","arxiv_id":"2201.04029","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":"/paper/bytetrack-multi-object-tracking-by-1","title":"ByteTrack: Multi-Object Tracking by Associating Every Detection Box","date":"2021-10-13","arxiv_id":"2110.06864","n_code_links":10,"syntology":{"ran":1,"of":12,"unverified":11,"pointer_only":0}},{"paper":"/paper/self-supervised-video-representation-learning-8","title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","date":"2021-08-19","arxiv_id":"2108.08426","n_code_links":0,"syntology":null},{"paper":null,"title":"Spatiotemporal Contrastive Learning of Facial Expressions in Videos","date":"2021-08-06","arxiv_id":"2108.03064","n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-7","title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","date":"2021-06-18","arxiv_id":"2106.10137","n_code_links":1,"syntology":null},{"paper":"/paper/you-only-learn-one-representation-unified","title":"You Only Learn One Representation: Unified Network for Multiple Tasks","date":"2021-05-10","arxiv_id":"2105.04206","n_code_links":9,"syntology":null},{"paper":null,"title":"The 3TConv: An Intrinsic Approach to Explainable 3D CNNs","date":"2021-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-5","title":"Self-supervised Video Representation Learning by Uncovering Spatio-temporal Statistics","date":"2020-08-31","arxiv_id":"2008.13426","n_code_links":2,"syntology":{"ran":3,"of":5,"unverified":2,"pointer_only":3}},{"paper":"/paper/late-temporal-modeling-in-3d-cnn","title":"Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition","date":"2020-08-03","arxiv_id":"2008.01232","n_code_links":2,"syntology":null},{"paper":null,"title":"RT3D: Achieving Real-Time Execution of 3D Convolutional Neural Networks on Mobile Devices","date":"2020-07-20","arxiv_id":"2007.09835","n_code_links":0,"syntology":null},{"paper":"/paper/neural-graph-collaborative-filtering","title":"Neural Graph Collaborative Filtering","date":"2019-05-20","arxiv_id":"1905.08108","n_code_links":21,"syntology":{"ran":6,"of":7,"unverified":1,"pointer_only":0}},{"paper":"/paper/spatiotemporal-cnns-for-pornography-detection","title":"Spatiotemporal CNNs for Pornography Detection in Videos","date":"2018-10-24","arxiv_id":"1810.10519","n_code_links":1,"syntology":null},{"paper":"/paper/multi-fiber-networks-for-video-recognition","title":"Multi-Fiber Networks for Video Recognition","date":"2018-07-30","arxiv_id":"1807.11195","n_code_links":0,"syntology":null},{"paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","arxiv_id":"1711.11248","n_code_links":24,"syntology":{"ran":1,"of":4,"unverified":3,"pointer_only":4}}],"papers_shown":17,"tasks":[{"task":"/task/action-recognition-in-videos","name":"Action Recognition","papers":8},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":5},{"task":"/task/representation-learning","name":"Representation Learning","papers":5},{"task":"/task/retrieval","name":"Retrieval","papers":4},{"task":"/task/video-retrieval","name":"Video Retrieval","papers":4},{"task":"/task/action-recognition","name":"Temporal Action Localization","papers":3},{"task":"/task/action-classification","name":"Action Classification","papers":2},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":2},{"task":"/task/optical-flow-estimation","name":"Optical Flow Estimation","papers":2},{"task":"/task/self-supervised-action-recognition","name":"Self-Supervised Action Recognition","papers":2},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":2},{"task":"/task/video-recognition","name":"Video Recognition","papers":2},{"task":"/task/action-recognition-in-videos-2","name":"Action Recognition In Videos","papers":1},{"task":"/task/code-generation","name":"Code Generation","papers":1},{"task":"/task/collaborative-filtering","name":"Collaborative Filtering","papers":1},{"task":"/task/emotion-recognition","name":"Emotion Recognition","papers":1},{"task":"/task/facial-expression-recognition-1","name":"Facial Expression Recognition","papers":1},{"task":"/task/facial-expression-recognition","name":"Facial Expression Recognition (FER)","papers":1},{"task":null,"name":"GPU","papers":1},{"task":"/task/link-prediction","name":"Link Prediction","papers":1}],"tasks_shown":20,"n_tasks":35,"usage_by_year":[{"year":"2017","papers":1},{"year":"2018","papers":2},{"year":"2019","papers":1},{"year":"2020","papers":3},{"year":"2021","papers":6},{"year":"2022","papers":2},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/2-1-d-convolution"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}