{"url":"/method/r-2-1-d","slug":"r-2-1-d","name":"R(2+1)D","full_name":"R(2+1)D","full_name_withheld":false,"description_markdown":"A **R(2+1)D** convolutional neural network is a network for action recognition that employs [R(2+1)D](https://paperswithcode.com/method/2-1-d-convolution) convolutions in a [ResNet](https://paperswithcode.com/method/resnet) inspired architecture. The use of these convolutions over regular [3D Convolutions](https://paperswithcode.com/method/3d-convolution) reduces computational complexity, prevents overfitting, and introduces more non-linearities that allow for a better functional relationship to be modeled.","description_state":"present","introduced_year":null,"introduced_by":{"title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","first_author":"Du Tran","n_authors":6,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/a-closer-look-at-spatiotemporal-convolutions"},"source":{"url":"http://arxiv.org/abs/1711.11248v3","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/pytorch/vision/blob/9e474c3c46c0871838c021093c67a9c7eb1863ea/torchvision/models/video/resnet.py#L324","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Convolutional Neural Networks","url":"/methods/category/convolutional-neural-networks","pwc_aliases":[]}],"n_papers_tagged":14,"archive_num_papers":14,"papers_newest_first":[{"paper":null,"title":"Multi-Microphone and Multi-Modal Emotion Recognition in Reverberant Environment","date":"2024-09-14","arxiv_id":"2409.09545","n_code_links":0,"syntology":null},{"paper":null,"title":"Use of a Multiscale Vision Transformer to predict Nursing Activities Score from Low Resolution Thermal Videos in an Intensive Care Unit","date":"2024-05-30","arxiv_id":"2406.04364","n_code_links":0,"syntology":null},{"paper":null,"title":"Temporal Contrastive Learning with Curriculum","date":"2022-09-02","arxiv_id":"2209.00760","n_code_links":0,"syntology":null},{"paper":"/paper/motion-focused-contrastive-learning-of-video-1","title":"Motion-Focused Contrastive Learning of Video Representations","date":"2022-01-11","arxiv_id":"2201.04029","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":"/paper/self-supervised-video-representation-learning-8","title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","date":"2021-08-19","arxiv_id":"2108.08426","n_code_links":0,"syntology":null},{"paper":null,"title":"Spatiotemporal Contrastive Learning of Facial Expressions in Videos","date":"2021-08-06","arxiv_id":"2108.03064","n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-7","title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","date":"2021-06-18","arxiv_id":"2106.10137","n_code_links":1,"syntology":null},{"paper":null,"title":"The 3TConv: An Intrinsic Approach to Explainable 3D CNNs","date":"2021-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-5","title":"Self-supervised Video Representation Learning by Uncovering Spatio-temporal Statistics","date":"2020-08-31","arxiv_id":"2008.13426","n_code_links":2,"syntology":{"ran":3,"of":5,"unverified":2,"pointer_only":3}},{"paper":"/paper/late-temporal-modeling-in-3d-cnn","title":"Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition","date":"2020-08-03","arxiv_id":"2008.01232","n_code_links":2,"syntology":null},{"paper":null,"title":"RT3D: Achieving Real-Time Execution of 3D Convolutional Neural Networks on Mobile Devices","date":"2020-07-20","arxiv_id":"2007.09835","n_code_links":0,"syntology":null},{"paper":"/paper/spatiotemporal-cnns-for-pornography-detection","title":"Spatiotemporal CNNs for Pornography Detection in Videos","date":"2018-10-24","arxiv_id":"1810.10519","n_code_links":1,"syntology":null},{"paper":"/paper/multi-fiber-networks-for-video-recognition","title":"Multi-Fiber Networks for Video Recognition","date":"2018-07-30","arxiv_id":"1807.11195","n_code_links":0,"syntology":null},{"paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","arxiv_id":"1711.11248","n_code_links":24,"syntology":{"ran":1,"of":4,"unverified":3,"pointer_only":4}}],"papers_shown":14,"tasks":[{"task":"/task/action-recognition-in-videos","name":"Action Recognition","papers":8},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":5},{"task":"/task/representation-learning","name":"Representation Learning","papers":5},{"task":"/task/retrieval","name":"Retrieval","papers":4},{"task":"/task/video-retrieval","name":"Video Retrieval","papers":4},{"task":"/task/action-recognition","name":"Temporal Action Localization","papers":3},{"task":"/task/action-classification","name":"Action Classification","papers":2},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":2},{"task":"/task/optical-flow-estimation","name":"Optical Flow Estimation","papers":2},{"task":"/task/self-supervised-action-recognition","name":"Self-Supervised Action Recognition","papers":2},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":2},{"task":"/task/video-recognition","name":"Video Recognition","papers":2},{"task":"/task/action-recognition-in-videos-2","name":"Action Recognition In Videos","papers":1},{"task":"/task/code-generation","name":"Code Generation","papers":1},{"task":"/task/emotion-recognition","name":"Emotion Recognition","papers":1},{"task":"/task/facial-expression-recognition-1","name":"Facial Expression Recognition","papers":1},{"task":"/task/facial-expression-recognition","name":"Facial Expression Recognition (FER)","papers":1},{"task":"/task/meta-learning","name":"Meta-Learning","papers":1},{"task":"/task/model-compression","name":"Model Compression","papers":1},{"task":"/task/pornography-detection","name":"Pornography Detection","papers":1}],"tasks_shown":20,"n_tasks":23,"usage_by_year":[{"year":"2017","papers":1},{"year":"2018","papers":2},{"year":"2020","papers":3},{"year":"2021","papers":4},{"year":"2022","papers":2},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/r-2-1-d"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}