{"url":"/method/yolox","slug":"yolox","name":"YOLOX","full_name":"YOLOX","full_name_withheld":false,"description_markdown":"**YOLOX** is a single-stage object detector that makes several modifications to [YOLOv3](https://paperswithcode.com/method/yolov3) with a  [DarkNet53](https://www.paperswithcode.com/method/darknet53) backbone. Specifically, YOLO’s head is replaced with a decoupled one. For each level of [FPN](https://paperswithcode.com/method/fpn) feature, we first adopt a 1 × 1 conv layer to reduce the feature channel to 256 and then add two parallel branches with two 3 × 3 conv layers each for classification and regression tasks respectively.\r\n\r\nAdditional changes include adding Mosaic and [MixUp](https://paperswithcode.com/method/mixup) into the augmentation strategies to boost YOLOX’s performance. The anchor mechanism is also removed so YOLOX is anchor-free. Lastly, SimOTA for label assignment  -- where label assignment is formulated as an optimal transport problem via a top-k strategy.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/2107.08430v2","title":"YOLOX: Exceeding YOLO Series in 2021","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/Megvii-BaseDetection/YOLOX","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"One-Stage Object Detection Models","url":"/methods/category/one-stage-object-detection-models","pwc_aliases":[]}],"n_papers_tagged":33,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/walnutdata-a-uav-remote-sensing-dataset-of","title":"WalnutData: A UAV Remote Sensing Dataset of Green Walnuts and Model Evaluation","date":"2025-02-27","arxiv_id":"2502.20092","n_code_links":1,"syntology":null},{"paper":null,"title":"Enhancing Transparent Object Pose Estimation: A Fusion of GDR-Net and Edge Detection","date":"2025-02-17","arxiv_id":"2502.12027","n_code_links":0,"syntology":null},{"paper":null,"title":"Beyond Boxes: Mask-Guided Spatio-Temporal Feature Aggregation for Video Object Detection","date":"2024-12-06","arxiv_id":"2412.04915","n_code_links":0,"syntology":null},{"paper":null,"title":"MapVision: CVPR 2024 Autonomous Grand Challenge Mapless Driving Tech Report","date":"2024-06-14","arxiv_id":"2406.10125","n_code_links":0,"syntology":null},{"paper":"/paper/real-time-object-detection-and-tracking-using","title":"Real-time object detection and tracking using flash LiDAR imagery","date":"2024-06-07","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/replication-study-and-benchmarking-of-real","title":"Replication Study and Benchmarking of Real-Time Object Detection Models","date":"2024-05-11","arxiv_id":"2405.06911","n_code_links":1,"syntology":null},{"paper":"/paper/efficient-and-concise-explanations-for-object","title":"Efficient and Concise Explanations for Object Detection with Gaussian-Class Activation Mapping Explainer","date":"2024-04-20","arxiv_id":"2404.13417","n_code_links":1,"syntology":null},{"paper":"/paper/flightscope-a-deep-comprehensive-assessment","title":"FlightScope: An Experimental Comparative Review of Aircraft Detection Algorithms in Satellite Imagery","date":"2024-04-03","arxiv_id":"2404.02877","n_code_links":1,"syntology":null},{"paper":"/paper/knowledge-distillation-in-yolox-vit-for-side","title":"Knowledge Distillation in YOLOX-ViT for Side-Scan Sonar Object Detection","date":"2024-03-14","arxiv_id":"2403.09313","n_code_links":1,"syntology":null},{"paper":"/paper/fusionvision-a-comprehensive-approach-of-3d","title":"FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anything","date":"2024-02-29","arxiv_id":"2403.00175","n_code_links":1,"syntology":null},{"paper":"/paper/detection-of-micromobility-vehicles-in-urban","title":"Detection of Micromobility Vehicles in Urban Traffic Videos","date":"2024-02-28","arxiv_id":"2402.18503","n_code_links":1,"syntology":null},{"paper":"/paper/beyond-kalman-filters-deep-learning-based","title":"Beyond Kalman Filters: Deep Learning-Based Filters for Improved Object Tracking","date":"2024-02-15","arxiv_id":"2402.09865","n_code_links":1,"syntology":null},{"paper":null,"title":"MuraNet: Multi-task Floor Plan Recognition with Relation Attention","date":"2023-09-01","arxiv_id":"2309.00348","n_code_links":0,"syntology":null},{"paper":null,"title":"Object Detection for Caries or Pit and Fissure Sealing Requirement in Children's First Permanent Molars","date":"2023-08-31","arxiv_id":"2308.16551","n_code_links":0,"syntology":null},{"paper":"/paper/g-came-gaussian-class-activation-mapping","title":"G-CAME: Gaussian-Class Activation Mapping Explainer for Object Detectors","date":"2023-06-06","arxiv_id":"2306.03400","n_code_links":1,"syntology":null},{"paper":"/paper/towards-better-explanations-for-object","title":"Towards Better Explanations for Object Detection","date":"2023-06-05","arxiv_id":"2306.02744","n_code_links":1,"syntology":null},{"paper":null,"title":"Long Range Object-Level Monocular Depth Estimation for UAVs","date":"2023-02-17","arxiv_id":"2302.08943","n_code_links":0,"syntology":null},{"paper":null,"title":"Research on road object detection algorithm based on improved YOLOX","date":"2023-02-16","arxiv_id":"2302.08156","n_code_links":0,"syntology":null},{"paper":"/paper/cholectriplet2022-show-me-a-tool-and-tell-me","title":"CholecTriplet2022: Show me a tool and tell me the triplet -- an endoscopic vision challenge for surgical action triplet detection","date":"2023-02-13","arxiv_id":"2302.06294","n_code_links":2,"syntology":null},{"paper":null,"title":"Towards Edge-Cloud Architectures for Personal Protective Equipment Detection","date":"2023-01-04","arxiv_id":"2301.01501","n_code_links":0,"syntology":null},{"paper":"/paper/comparison-of-deep-object-detectors-on-a-new","title":"Comparison Of Deep Object Detectors On A New Vulnerable Pedestrian Dataset","date":"2022-12-12","arxiv_id":"2212.06218","n_code_links":2,"syntology":null},{"paper":"/paper/multiple-object-tracking-challenge-technical","title":"Multiple Object Tracking Challenge Technical Report for Team MT_IoT","date":"2022-12-07","arxiv_id":"2212.03586","n_code_links":1,"syntology":null},{"paper":"/paper/the-1st-place-solution-for-eccv-2022-multiple","title":"The 1st-place Solution for ECCV 2022 Multiple People Tracking in Group Dance Challenge","date":"2022-10-27","arxiv_id":"2210.15281","n_code_links":3,"syntology":null},{"paper":null,"title":"PredNAS: A Universal and Sample Efficient Neural Architecture Search Framework","date":"2022-10-26","arxiv_id":"2210.14460","n_code_links":0,"syntology":null},{"paper":"/paper/centralized-feature-pyramid-for-object","title":"Centralized Feature Pyramid for Object Detection","date":"2022-10-05","arxiv_id":"2210.02093","n_code_links":1,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":null,"title":"FasterX: Real-Time Object Detection Based on Edge GPUs for UAV Applications","date":"2022-09-07","arxiv_id":"2209.03157","n_code_links":0,"syntology":null},{"paper":"/paper/yolox-pai-an-improved-yolox-version-by-pai","title":"YOLOX-PAI: An Improved YOLOX, Stronger and Faster than YOLOv6","date":"2022-08-27","arxiv_id":"2208.13040","n_code_links":3,"syntology":null},{"paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","date":"2022-07-06","arxiv_id":"2207.02696","n_code_links":21,"syntology":{"ran":1,"of":11,"unverified":10,"pointer_only":0}},{"paper":"/paper/pp-yoloe-an-evolved-version-of-yolo","title":"PP-YOLOE: An evolved version of YOLO","date":"2022-03-30","arxiv_id":"2203.16250","n_code_links":8,"syntology":{"ran":5,"of":27,"unverified":22,"pointer_only":0}},{"paper":null,"title":"Evaluation of YOLO Models with Sliced Inference for Small Object Detection","date":"2022-03-09","arxiv_id":"2203.04799","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/object-detection","name":"Object Detection","papers":25},{"task":"/task/object-detection-1","name":"object-detection","papers":21},{"task":"/task/object","name":"Object","papers":17},{"task":"/task/real-time-object-detection","name":"Real-Time Object Detection","papers":8},{"task":"/task/2d-object-detection","name":"2D Object Detection","papers":5},{"task":"/task/multi-object-tracking","name":"Multi-Object Tracking","papers":5},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":4},{"task":null,"name":"GPU","papers":4},{"task":"/task/object-tracking","name":"Object Tracking","papers":4},{"task":"/task/multiple-object-tracking","name":"Multiple Object Tracking","papers":3},{"task":"/task/pedestrian-detection","name":"Pedestrian Detection","papers":2},{"task":"/task/scene-understanding","name":"Scene Understanding","papers":2},{"task":"/task/segmentation","name":"Segmentation","papers":2},{"task":"/task/video-object-detection","name":"Video Object Detection","papers":2},{"task":"/task/3d-object-classification","name":"3D Object Classification","papers":1},{"task":"/task/3d-object-reconstruction","name":"3D Object Reconstruction","papers":1},{"task":"/task/6d-pose-estimation","name":"6D Pose Estimation using RGB","papers":1},{"task":"/task/action-triplet-detection","name":"Action Triplet Detection","papers":1},{"task":"/task/action-triplet-recognition","name":"Action Triplet Recognition","papers":1},{"task":"/task/benchmarking","name":"Benchmarking","papers":1}],"tasks_shown":20,"n_tasks":52,"usage_by_year":[{"year":"2021","papers":3},{"year":"2022","papers":10},{"year":"2023","papers":8},{"year":"2024","papers":10},{"year":"2025","papers":2}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/yolox"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}