{"url":"/method/3d-convolution","slug":"3d-convolution","name":"3D Convolution","full_name":"3D Convolution","full_name_withheld":false,"description_markdown":"A **3D Convolution** is a type of [convolution](https://paperswithcode.com/method/convolution) where the kernel slides in 3 dimensions as opposed to 2 dimensions with 2D convolutions. One example use case is medical imaging where a model is constructed using 3D image slices. Additionally video based data has an additional temporal dimension over images making it suitable for this module. \r\n\r\nImage: Lung nodule detection based on 3D convolutional neural networks, Fan et al","description_state":"present","introduced_year":2015,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":"https://github.com/pytorch/pytorch/blob/73642d9425a358b51a683cf6f95852d06cba1096/torch/nn/modules/conv.py#L421","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Convolutions","url":"/methods/category/convolutions","pwc_aliases":[]}],"n_papers_tagged":208,"archive_num_papers":208,"papers_newest_first":[{"paper":null,"title":"Manipulating Elasto-Plastic Objects With 3D Occupancy and Learning-Based Predictive Control","date":"2025-05-22","arxiv_id":"2505.16249","n_code_links":0,"syntology":null},{"paper":"/paper/handreader-advanced-techniques-for-efficient","title":"HandReader: Advanced Techniques for Efficient Fingerspelling Recognition","date":"2025-05-15","arxiv_id":"2505.10267","n_code_links":1,"syntology":null},{"paper":null,"title":"UniMamba: Unified Spatial-Channel Representation Learning with Group-Efficient Mamba for LiDAR-based 3D Object Detection","date":"2025-03-15","arxiv_id":"2503.12009","n_code_links":0,"syntology":null},{"paper":null,"title":"BILLNET: A Binarized Conv3D-LSTM Network with Logic-gated residual architecture for hardware-efficient video inference","date":"2025-01-24","arxiv_id":"2501.14495","n_code_links":0,"syntology":null},{"paper":null,"title":"Swin-X2S: Reconstructing 3D Shape from 2D Biplanar X-ray with Swin Transformers","date":"2025-01-10","arxiv_id":"2501.05961","n_code_links":0,"syntology":null},{"paper":null,"title":"SuperLightNet: Lightweight Parameter Aggregation Network for Multimodal Brain Tumor Segmentation","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/asdnb-merging-face-with-body-cues-for-robust","title":"ASDnB: Merging Face with Body Cues For Robust Active Speaker Detection","date":"2024-12-11","arxiv_id":"2412.08594","n_code_links":1,"syntology":null},{"paper":null,"title":"Lightweight Spatial Embedding for Vision-based 3D Occupancy Prediction","date":"2024-12-08","arxiv_id":"2412.05976","n_code_links":0,"syntology":null},{"paper":"/paper/intensity-spatial-dual-masked-autoencoder-for","title":"Intensity-Spatial Dual Masked Autoencoder for Multi-Scale Feature Learning in Chest CT Segmentation","date":"2024-11-20","arxiv_id":"2411.13198","n_code_links":1,"syntology":null},{"paper":null,"title":"Optical Flow Representation Alignment Mamba Diffusion Model for Medical Video Generation","date":"2024-11-03","arxiv_id":"2411.01647","n_code_links":0,"syntology":null},{"paper":"/paper/cross-d-conv-cross-dimensional-transferable","title":"Cross-D Conv: Cross-Dimensional Transferable Knowledge Base via Fourier Shifting Operation","date":"2024-11-02","arxiv_id":"2411.02441","n_code_links":1,"syntology":null},{"paper":null,"title":"Preserving Cardiac Integrity: A Topology-Infused Approach to Whole Heart Segmentation","date":"2024-10-14","arxiv_id":"2410.10551","n_code_links":0,"syntology":null},{"paper":"/paper/reconstruction-of-particle-flow-energy","title":"Lightweight Deep Learning Framework for Accurate Particle Flow Energy Reconstruction","date":"2024-10-08","arxiv_id":"2410.07250","n_code_links":1,"syntology":null},{"paper":null,"title":"Real-Time 3D Occupancy Prediction via Geometric-Semantic Disentanglement","date":"2024-07-18","arxiv_id":"2407.13155","n_code_links":0,"syntology":null},{"paper":"/paper/bidirectional-stereo-image-compression-with","title":"Bidirectional Stereo Image Compression with Cross-Dimensional Entropy Model","date":"2024-07-15","arxiv_id":"2407.10632","n_code_links":1,"syntology":null},{"paper":null,"title":"3D Adaptive Structural Convolution Network for Domain-Invariant Point Cloud Recognition","date":"2024-07-05","arxiv_id":"2407.04833","n_code_links":0,"syntology":null},{"paper":"/paper/arch2s-dataset-benchmark-and-challenges-for","title":"ARCH2S: Dataset, Benchmark and Challenges for Learning Exterior Architectural Structures from Point Clouds","date":"2024-06-03","arxiv_id":"2406.01337","n_code_links":1,"syntology":null},{"paper":"/paper/towards-automating-the-retrospective","title":"Towards Automating the Retrospective Generation of BIM Models: A Unified Framework for 3D Semantic Reconstruction of the Built Environment","date":"2024-06-03","arxiv_id":"2406.01480","n_code_links":1,"syntology":null},{"paper":null,"title":"Ghost-Stereo: GhostNet-based Cost Volume Enhancement and Aggregation for Stereo Matching Networks","date":"2024-05-23","arxiv_id":"2405.14520","n_code_links":0,"syntology":null},{"paper":"/paper/lsk3dnet-towards-effective-and-efficient-3d","title":"LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels","date":"2024-03-22","arxiv_id":"2403.15173","n_code_links":1,"syntology":null},{"paper":"/paper/videomamba-state-space-model-for-efficient","title":"VideoMamba: State Space Model for Efficient Video Understanding","date":"2024-03-11","arxiv_id":"2403.06977","n_code_links":2,"syntology":{"ran":9,"of":15,"unverified":6,"pointer_only":0}},{"paper":null,"title":"Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models","date":"2024-03-08","arxiv_id":"2403.05141","n_code_links":0,"syntology":null},{"paper":null,"title":"FastOcc: Accelerating 3D Occupancy Prediction by Fusing the 2D Bird's-Eye View and Perspective View","date":"2024-03-05","arxiv_id":"2403.02710","n_code_links":0,"syntology":null},{"paper":null,"title":"Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet Representation","date":"2024-02-21","arxiv_id":"2402.13729","n_code_links":0,"syntology":null},{"paper":"/paper/improving-robustness-for-joint-optimization","title":"Improving Robustness for Joint Optimization of Camera Poses and Decomposed Low-Rank Tensorial Radiance Fields","date":"2024-02-20","arxiv_id":"2402.13252","n_code_links":1,"syntology":null},{"paper":null,"title":"HJE: Joint Convolutional Representation Learning for Knowledge Hypergraph Completion","date":"2024-02-13","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"Multiple Instance Learning for Cheating Detection and Localization in Online Examinations","date":"2024-02-09","arxiv_id":"2402.06107","n_code_links":0,"syntology":null},{"paper":"/paper/sage-icp-semantic-information-assisted-icp","title":"SAGE-ICP: Semantic Information-Assisted ICP","date":"2023-10-11","arxiv_id":"2310.07237","n_code_links":1,"syntology":null},{"paper":"/paper/ndc-scene-boost-monocular-3d-semantic-scene","title":"NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized Device Coordinates Space","date":"2023-09-26","arxiv_id":"2309.14616","n_code_links":1,"syntology":{"ran":5,"of":7,"unverified":2,"pointer_only":7}},{"paper":null,"title":"A Dynamic Domain Adaptation Deep Learning Network for EEG-based Motor Imagery Classification","date":"2023-09-21","arxiv_id":"2309.11714","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/action-recognition-in-videos","name":"Action Recognition","papers":30},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":21},{"task":"/task/segmentation","name":"Segmentation","papers":15},{"task":"/task/action-recognition","name":"Temporal Action Localization","papers":15},{"task":"/task/object-detection","name":"Object Detection","papers":14},{"task":"/task/object-detection-1","name":"object-detection","papers":13},{"task":"/task/image-classification","name":"Image Classification","papers":12},{"task":"/task/image-classification","name":"image-classification","papers":12},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":10},{"task":"/task/deep-learning","name":"Deep Learning","papers":9},{"task":"/task/representation-learning","name":"Representation Learning","papers":9},{"task":"/task/super-resolution","name":"Super-Resolution","papers":9},{"task":"/task/depth-estimation","name":"Depth Estimation","papers":8},{"task":"/task/3d-semantic-segmentation","name":"3D Semantic Segmentation","papers":7},{"task":"/task/decoder","name":"Decoder","papers":7},{"task":"/task/denoising","name":"Denoising","papers":7},{"task":"/task/stereo-matching-1","name":"Stereo Matching","papers":7},{"task":"/task/video-understanding","name":"Video Understanding","papers":7},{"task":"/task/3d-object-detection","name":"3D Object Detection","papers":6},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":6}],"tasks_shown":20,"n_tasks":263,"usage_by_year":[{"year":"1994","papers":1},{"year":"2015","papers":2},{"year":"2016","papers":3},{"year":"2017","papers":8},{"year":"2018","papers":18},{"year":"2019","papers":34},{"year":"2020","papers":39},{"year":"2021","papers":33},{"year":"2022","papers":24},{"year":"2023","papers":19},{"year":"2024","papers":21},{"year":"2025","papers":6}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/3d-convolution"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}