{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/3dmv-joint-3d-multi-view-prediction-for-3d","title":"3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation","arxiv_id":"1803.10409","date":"2018-03-28","proceeding":"ECCV 2018 9","authors":["Angela Dai","Matthias Nießner"],"abstract":"We present 3DMV, a novel method for 3D semantic scene segmentation of RGB-D\nscans in indoor environments using a joint 3D-multi-view prediction network. In\ncontrast to existing methods that either use geometry or RGB data as input for\nthis task, we combine both data modalities in a joint, end-to-end network\narchitecture. Rather than simply projecting color data into a volumetric grid\nand operating solely in 3D -- which would result in insufficient detail -- we\nfirst extract feature maps from associated RGB images. These features are then\nmapped into the volumetric feature grid of a 3D network using a differentiable\nbackprojection layer. Since our target is 3D scanning scenarios with possibly\nmany frames, we use a multi-view pooling approach in order to handle a varying\nnumber of RGB input views. This learned combination of RGB and geometric\nfeatures with our joint 2D-3D architecture achieves significantly better\nresults than existing baselines. For instance, our final result on the ScanNet\n3D segmentation benchmark increases from 52.8\\% to 75\\% accuracy compared to\nexisting volumetric architectures.","url_abs":"http://arxiv.org/abs/1803.10409v1","url_pdf":"http://arxiv.org/pdf/1803.10409v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"3dmv-joint-3d-multi-view-prediction-for-3d","repo_url":"https://github.com/angeladai/3DMV","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}}],"tasks":[{"task_slug":"3d-architecture","task_name":"3D Architecture"},{"task_slug":"scene-segmentation","task_name":"Scene Segmentation"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/scene-segmentation-on-scannet","task":"Scene Segmentation","dataset":"ScanNet","model":"3DMV","rank_in_archive_order":1,"of":3,"metrics":{"Average Accuracy":"75.0%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-scannet","task":"Semantic Segmentation","dataset":"ScanNet","model":"3DMV","rank_in_archive_order":39,"of":45,"metrics":{"test mIoU":"48.4"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-scannetv2","task":"Semantic Segmentation","dataset":"ScanNetV2","model":"3DMV (2d proj)","rank_in_archive_order":7,"of":12,"metrics":{"Mean IoU":"49.8%"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1803.10409","atlas_url":"https://app.syntology.ai/?focus=1803.10409","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}