{"url":"/task/monocular-3d-object-detection","name":"Monocular 3D Object Detection","slug":"monocular-3d-object-detection","description_markdown":"Monocular 3D Object Detection is the task to draw 3D bounding box around objects in a single 2D RGB image. It is localization task but without any extra information like depth or other sensors or multiple-images.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":187,"papers_with_code":87,"benchmarks":16,"benchmark_tables_in_archive":16,"benchmark_tables_shown":16,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":7,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-cars","slug":"monocular-3d-object-detection-on-kitti-cars","dataset":"KITTI Cars Moderate","dataset_url":"/dataset/kitti","rows_in_archive":29,"metrics":["AP Medium","AP"],"first_row_in_archive_order":{"model":"CIE","paper_title":"Consistency of Implicit and Explicit Features Matters for Monocular 3D Object Detection","paper_url":"/paper/consistency-of-implicit-and-explicit-features","paper_date":"2022-07-16","arxiv_id":"2207.07933","code_links":[],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-cars-1","slug":"monocular-3d-object-detection-on-kitti-cars-1","dataset":"KITTI Cars Hard","dataset_url":"/dataset/kitti","rows_in_archive":7,"metrics":["AP Hard"],"first_row_in_archive_order":{"model":"CIE","paper_title":"Consistency of Implicit and Explicit Features Matters for Monocular 3D Object Detection","paper_url":"/paper/consistency-of-implicit-and-explicit-features","paper_date":"2022-07-16","arxiv_id":"2207.07933","code_links":[],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-sun-rgb-d","slug":"monocular-3d-object-detection-on-sun-rgb-d","dataset":"SUN RGB-D","dataset_url":"/dataset/sun-rgb-d","rows_in_archive":7,"metrics":["AP@0.15 (NYU-37)","AP@0.15 (10 / NYU-37)","AP@0.15 (10 / PNet-30)"],"first_row_in_archive_order":{"model":"IM3D","paper_title":"Holistic 3D Scene Understanding from a Single Image with Implicit Representation","paper_url":"/paper/holistic-3d-scene-understanding-from-a-single-1","paper_date":"2021-03-11","arxiv_id":"2103.06422","code_links":[{"title":"chengzhag/Implicit3DUnderstanding","url":"https://github.com/chengzhag/Implicit3DUnderstanding"}],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-cars-2","slug":"monocular-3d-object-detection-on-kitti-cars-2","dataset":"KITTI Cars Easy","dataset_url":"/dataset/kitti","rows_in_archive":5,"metrics":["AP Easy"],"first_row_in_archive_order":{"model":"CIE","paper_title":"Consistency of Implicit and Explicit Features Matters for Monocular 3D Object Detection","paper_url":"/paper/consistency-of-implicit-and-explicit-features","paper_date":"2022-07-16","arxiv_id":"2207.07933","code_links":[],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-1","slug":"monocular-3d-object-detection-on-kitti-1","dataset":"KITTI Pedestrian Hard","dataset_url":"/dataset/kitti","rows_in_archive":4,"metrics":["AP Hard"],"first_row_in_archive_order":{"model":"DD3D","paper_title":"Is Pseudo-Lidar needed for Monocular 3D Object detection?","paper_url":"/paper/is-pseudo-lidar-needed-for-monocular-3d","paper_date":"2021-08-13","arxiv_id":"2108.06417","code_links":[{"title":"tri-ml/dd3d","url":"https://github.com/tri-ml/dd3d"},{"title":"tri-ml/vedet","url":"https://github.com/tri-ml/vedet"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-google","slug":"monocular-3d-object-detection-on-google","dataset":"Google Objectron","dataset_url":null,"rows_in_archive":3,"metrics":["Average Precision at 0.5 3D IoU","MPE","AP at 15' Azimuth error","AP at 10' Elevation error"],"first_row_in_archive_order":{"model":"Lin2021","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-3","slug":"monocular-3d-object-detection-on-kitti-3","dataset":"KITTI Pedestrian Easy","dataset_url":"/dataset/kitti","rows_in_archive":3,"metrics":["AP Easy"],"first_row_in_archive_order":{"model":"CMKD","paper_title":"Cross-Modality Knowledge Distillation Network for Monocular 3D Object Detection","paper_url":"/paper/cross-modality-knowledge-distillation-network","paper_date":"2022-11-14","arxiv_id":"2211.07171","code_links":[{"title":"Cc-Hy/CMKD","url":"https://github.com/Cc-Hy/CMKD"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-4","slug":"monocular-3d-object-detection-on-kitti-4","dataset":"KITTI Pedestrian Moderate","dataset_url":"/dataset/kitti","rows_in_archive":3,"metrics":["AP Medium"],"first_row_in_archive_order":{"model":"DD3D","paper_title":"Is Pseudo-Lidar needed for Monocular 3D Object detection?","paper_url":"/paper/is-pseudo-lidar-needed-for-monocular-3d","paper_date":"2021-08-13","arxiv_id":"2108.06417","code_links":[{"title":"tri-ml/dd3d","url":"https://github.com/tri-ml/dd3d"},{"title":"tri-ml/vedet","url":"https://github.com/tri-ml/vedet"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-5","slug":"monocular-3d-object-detection-on-kitti-5","dataset":"KITTI Cyclist Easy","dataset_url":"/dataset/kitti","rows_in_archive":2,"metrics":["AP Easy"],"first_row_in_archive_order":{"model":"CMKD","paper_title":"Cross-Modality Knowledge Distillation Network for Monocular 3D Object Detection","paper_url":"/paper/cross-modality-knowledge-distillation-network","paper_date":"2022-11-14","arxiv_id":"2211.07171","code_links":[{"title":"Cc-Hy/CMKD","url":"https://github.com/Cc-Hy/CMKD"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-6","slug":"monocular-3d-object-detection-on-kitti-6","dataset":"KITTI Cyclist Moderate","dataset_url":"/dataset/kitti","rows_in_archive":2,"metrics":["AP Medium"],"first_row_in_archive_order":{"model":"CMKD","paper_title":"Cross-Modality Knowledge Distillation Network for Monocular 3D Object Detection","paper_url":"/paper/cross-modality-knowledge-distillation-network","paper_date":"2022-11-14","arxiv_id":"2211.07171","code_links":[{"title":"Cc-Hy/CMKD","url":"https://github.com/Cc-Hy/CMKD"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti-7","slug":"monocular-3d-object-detection-on-kitti-7","dataset":"KITTI Cyclist Hard","dataset_url":"/dataset/kitti","rows_in_archive":2,"metrics":["AP Hard"],"first_row_in_archive_order":{"model":"CMKD","paper_title":"Cross-Modality Knowledge Distillation Network for Monocular 3D Object Detection","paper_url":"/paper/cross-modality-knowledge-distillation-network","paper_date":"2022-11-14","arxiv_id":"2211.07171","code_links":[{"title":"Cc-Hy/CMKD","url":"https://github.com/Cc-Hy/CMKD"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-coperception","slug":"monocular-3d-object-detection-on-coperception","dataset":"CoPerception-UAVs","dataset_url":null,"rows_in_archive":1,"metrics":["AP50"],"first_row_in_archive_order":{"model":"Where2comm","paper_title":"Where2comm: Communication-Efficient Collaborative Perception via Spatial Confidence Maps","paper_url":"/paper/where2comm-communication-efficient","paper_date":"2022-09-26","arxiv_id":"2209.12836","code_links":[{"title":"mediabrain-sjtu/where2comm","url":"https://github.com/mediabrain-sjtu/where2comm"}],"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":6}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-kitti","slug":"monocular-3d-object-detection-on-kitti","dataset":"KITTI Pedestrians Moderate val","dataset_url":"/dataset/kitti","rows_in_archive":1,"metrics":["AP Medium"],"first_row_in_archive_order":{"model":"CubifAE-3D","paper_title":"CubifAE-3D: Monocular Camera Space Cubification for Auto-Encoder based 3D Object Detection","paper_url":"/paper/cubifae-3d-monocular-camera-space","paper_date":"2020-06-07","arxiv_id":"2006.04080","code_links":[],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-nuscenes","slug":"monocular-3d-object-detection-on-nuscenes","dataset":"nuScenes","dataset_url":"/dataset/nuscenes","rows_in_archive":1,"metrics":["NDS","mAP"],"first_row_in_archive_order":{"model":"LabelDistill","paper_title":"LabelDistill: Label-guided Cross-modal Knowledge Distillation for Camera-based 3D Object Detection","paper_url":"/paper/labeldistill-label-guided-cross-modal","paper_date":"2024-07-14","arxiv_id":"2407.10164","code_links":[{"title":"sanmin0312/labeldistill","url":"https://github.com/sanmin0312/labeldistill"}],"syntology":null}},{"leaderboard":"/sota/monocular-3d-object-detection-on-opv2v","slug":"monocular-3d-object-detection-on-opv2v","dataset":"OPV2V","dataset_url":"/dataset/opv2v","rows_in_archive":1,"metrics":["AP50"],"first_row_in_archive_order":{"model":"Where2comm","paper_title":"Where2comm: Communication-Efficient Collaborative Perception via Spatial Confidence Maps","paper_url":"/paper/where2comm-communication-efficient","paper_date":"2022-09-26","arxiv_id":"2209.12836","code_links":[{"title":"mediabrain-sjtu/where2comm","url":"https://github.com/mediabrain-sjtu/where2comm"}],"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":6}}},{"leaderboard":"/sota/monocular-3d-object-detection-on-virtual","slug":"monocular-3d-object-detection-on-virtual","dataset":"Virtual KITTI 2","dataset_url":"/dataset/virtual-kitti-2","rows_in_archive":1,"metrics":["mAP@0.3","mAP@0.5"],"first_row_in_archive_order":{"model":"CubifAE-3D","paper_title":"CubifAE-3D: Monocular Camera Space Cubification for Auto-Encoder based 3D Object Detection","paper_url":"/paper/cubifae-3d-monocular-camera-space","paper_date":"2020-06-07","arxiv_id":"2006.04080","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/kitti","name":"KITTI","full_name":"","num_papers_in_archive":3661},{"url":"/dataset/nuscenes","name":"nuScenes","full_name":"","num_papers_in_archive":2139},{"url":"/dataset/sun-rgb-d","name":"SUN RGB-D","full_name":"SUN RGB-D","num_papers_in_archive":477},{"url":"/dataset/virtual-kitti","name":"Virtual KITTI","full_name":"","num_papers_in_archive":133},{"url":"/dataset/opv2v","name":"OPV2V","full_name":"","num_papers_in_archive":78},{"url":"/dataset/virtual-kitti-2","name":"Virtual KITTI 2","full_name":"","num_papers_in_archive":53},{"url":"/dataset/mono3drefer","name":"Mono3DRefer","full_name":"","num_papers_in_archive":3}],"subtasks":[],"parent_tasks":[{"url":"/task/3d-object-detection","name":"3D Object Detection"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":87,"tagged_in_all":187,"items":[{"url":"/paper/fcos3d-fully-convolutional-one-stage","title":"FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection","date":"2021-04-22","arxiv_id":"2104.10956","repositories_listed":9,"syntology":{"n":22,"n_ran":7,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/m3d-rpn-monocular-3d-region-proposal-network","title":"M3D-RPN: Monocular 3D Region Proposal Network for Object Detection","date":"2019-07-13","arxiv_id":"1907.06038","repositories_listed":4,"syntology":{"n":21,"n_ran":1,"n_unverified":20,"n_pointer_only":0}},{"url":"/paper/objects-are-different-flexible-monocular-3d","title":"Objects are Different: Flexible Monocular 3D Object Detection","date":"2021-04-06","arxiv_id":"2104.02323","repositories_listed":3,"syntology":{"n":20,"n_ran":11,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/smoke-single-stage-monocular-3d-object","title":"SMOKE: Single-Stage Monocular 3D Object Detection via Keypoint Estimation","date":"2020-02-24","arxiv_id":"2002.10111","repositories_listed":3,"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/deviant-depth-equivariant-network-for","title":"DEVIANT: Depth EquiVarIAnt NeTwork for Monocular 3D Object Detection","date":"2022-07-21","arxiv_id":"2207.10758","repositories_listed":2,"syntology":{"n":15,"n_ran":9,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/learning-auxiliary-monocular-contexts-helps","title":"Learning Auxiliary Monocular Contexts Helps Monocular 3D Object Detection","date":"2021-12-09","arxiv_id":"2112.04628","repositories_listed":2,"syntology":{"n":15,"n_ran":11,"n_unverified":4,"n_pointer_only":12}},{"url":"/paper/advancing-self-supervised-monocular-depth","title":"Advancing Self-supervised Monocular Depth Learning with Sparse LiDAR","date":"2021-09-20","arxiv_id":"2109.09628","repositories_listed":2,"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/is-pseudo-lidar-needed-for-monocular-3d","title":"Is Pseudo-Lidar needed for Monocular 3D Object detection?","date":"2021-08-13","arxiv_id":"2108.06417","repositories_listed":2,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/imvoxelnet-image-to-voxels-projection-for","title":"ImVoxelNet: Image to Voxels Projection for Monocular and Multi-View General-Purpose 3D Object Detection","date":"2021-06-02","arxiv_id":"2106.01178","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/categorical-depth-distribution-network-for","title":"Categorical Depth Distribution Network for Monocular 3D Object Detection","date":"2021-03-01","arxiv_id":"2103.01100","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/kinematic-3d-object-detection-in-monocular","title":"Kinematic 3D Object Detection in Monocular Video","date":"2020-07-19","arxiv_id":"2007.09548","repositories_listed":2,"syntology":{"n":20,"n_ran":3,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/learning-depth-guided-convolutions-for","title":"Learning Depth-Guided Convolutions for Monocular 3D Object Detection","date":"2019-12-10","arxiv_id":"1912.04799","repositories_listed":2,"syntology":{"n":16,"n_ran":2,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/open-vocabulary-monocular-3d-object-detection","title":"Open Vocabulary Monocular 3D Object Detection","date":"2024-11-25","arxiv_id":"2411.16833","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-feature-aggregation-and-scale-aware","title":"Efficient Feature Aggregation and Scale-Aware Regression for Monocular 3D Object Detection","date":"2024-11-05","arxiv_id":"2411.02747","repositories_listed":1,"syntology":null},{"url":"/paper/monodgp-monocular-3d-object-detection-with","title":"MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors","date":"2024-10-25","arxiv_id":"2410.19590","repositories_listed":1,"syntology":null},{"url":"/paper/warm-3d-a-weakly-supervised-sim2real-domain","title":"WARM-3D: A Weakly-Supervised Sim2Real Domain Adaptation Framework for Roadside Monocular 3D Object Detection","date":"2024-07-30","arxiv_id":"2407.20818","repositories_listed":1,"syntology":null},{"url":"/paper/monowad-weather-adaptive-diffusion-model-for","title":"MonoWAD: Weather-Adaptive Diffusion Model for Robust Monocular 3D Object Detection","date":"2024-07-23","arxiv_id":"2407.16448","repositories_listed":1,"syntology":{"n":26,"n_ran":15,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/labeldistill-label-guided-cross-modal","title":"LabelDistill: Label-guided Cross-modal Knowledge Distillation for Camera-based 3D Object Detection","date":"2024-07-14","arxiv_id":"2407.10164","repositories_listed":1,"syntology":null},{"url":"/paper/fully-test-time-adaptation-for-monocular-3d","title":"Fully Test-Time Adaptation for Monocular 3D Object Detection","date":"2024-05-30","arxiv_id":"2405.19682","repositories_listed":1,"syntology":null},{"url":"/paper/monotakd-teaching-assistant-knowledge","title":"MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object Detection","date":"2024-04-07","arxiv_id":"2404.04910","repositories_listed":1,"syntology":null},{"url":"/paper/monocd-monocular-3d-object-detection-with","title":"MonoCD: Monocular 3D Object Detection with Complementary Depths","date":"2024-04-04","arxiv_id":"2404.03181","repositories_listed":1,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/vsrd-instance-aware-volumetric-silhouette-1","title":"VSRD: Instance-Aware Volumetric Silhouette Rendering for Weakly Supervised 3D Object Detection","date":"2024-03-29","arxiv_id":"2404.00149","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/monolss-learnable-sample-selection-for","title":"MonoLSS: Learnable Sample Selection For Monocular 3D Detection","date":"2023-12-22","arxiv_id":"2312.14474","repositories_listed":1,"syntology":null},{"url":"/paper/mono3dvg-3d-visual-grounding-in-monocular","title":"Mono3DVG: 3D Visual Grounding in Monocular Images","date":"2023-12-13","arxiv_id":"2312.08022","repositories_listed":1,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}},{"url":"/paper/3d-copy-paste-physically-plausible-object-1","title":"3D Copy-Paste: Physically Plausible Object Insertion for Monocular 3D Detection","date":"2023-12-08","arxiv_id":"2312.05277","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/odm3d-alleviating-foreground-sparsity-for","title":"ODM3D: Alleviating Foreground Sparsity for Semi-Supervised Monocular 3D Object Detection","date":"2023-10-28","arxiv_id":"2310.18620","repositories_listed":1,"syntology":null},{"url":"/paper/gupnet-geometry-uncertainty-propagation","title":"GUPNet++: Geometry Uncertainty Propagation Network for Monocular 3D Object Detection","date":"2023-10-24","arxiv_id":"2310.15624","repositories_listed":1,"syntology":null},{"url":"/paper/monoskd-general-distillation-framework-for","title":"MonoSKD: General Distillation Framework for Monocular 3D Object Detection via Spearman Correlation Coefficient","date":"2023-10-17","arxiv_id":"2310.11316","repositories_listed":1,"syntology":null},{"url":"/paper/cobev-elevating-roadside-3d-object-detection","title":"CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity","date":"2023-10-04","arxiv_id":"2310.02815","repositories_listed":1,"syntology":null},{"url":"/paper/monouni-a-unified-vehicle-and-infrastructure","title":"MonoUNI: A Unified Vehicle and Infrastructure-side Monocular 3D Object Detection Network with Sufficient Depth Clues","date":"2023-09-21","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}