{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/revisiting-unreasonable-effectiveness-of-data","title":"Revisiting Unreasonable Effectiveness of Data in Deep Learning Era","arxiv_id":"1707.02968","date":"2017-07-10","proceeding":"ICCV 2017 10","authors":["Chen Sun","Abhinav Shrivastava","Saurabh Singh","Abhinav Gupta"],"abstract":"The success of deep learning in vision can be attributed to: (a) models with\nhigh capacity; (b) increased computational power; and (c) availability of\nlarge-scale labeled data. Since 2012, there have been significant advances in\nrepresentation capabilities of the models and computational capabilities of\nGPUs. But the size of the biggest dataset has surprisingly remained constant.\nWhat will happen if we increase the dataset size by 10x or 100x? This paper\ntakes a step towards clearing the clouds of mystery surrounding the\nrelationship between `enormous data' and visual deep learning. By exploiting\nthe JFT-300M dataset which has more than 375M noisy labels for 300M images, we\ninvestigate how the performance of current vision tasks would change if this\ndata was used for representation learning. Our paper delivers some surprising\n(and some expected) findings. First, we find that the performance on vision\ntasks increases logarithmically based on volume of training data size. Second,\nwe show that representation learning (or pre-training) still holds a lot of\npromise. One can improve performance on many vision tasks by just training a\nbetter base model. Finally, as expected, we present new state-of-the-art\nresults for different vision tasks including image classification, object\ndetection, semantic segmentation and human pose estimation. Our sincere hope is\nthat this inspires vision community to not undervalue the data and develop\ncollective efforts in building larger datasets.","url_abs":"http://arxiv.org/abs/1707.02968v2","url_pdf":"http://arxiv.org/pdf/1707.02968v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"revisiting-unreasonable-effectiveness-of-data","repo_url":"https://github.com/Ranja-S/sensitivity","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"revisiting-unreasonable-effectiveness-of-data","repo_url":"https://github.com/Tencent/tencent-ml-images","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}}],"tasks":[{"task_slug":"deep-learning","task_name":"Deep Learning"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"pose-estimation","task_name":"Pose Estimation"},{"task_slug":"representation-learning","task_name":"Representation Learning"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"image-classification","task_name":"image-classification"},{"task_slug":"object-detection-1","task_name":"object-detection"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"faster-r-cnn","method_name":"Faster R-CNN"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"rmsprop","method_name":"RMSProp"},{"method_slug":"rpn","method_name":"RPN"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"roipool","method_name":"RoIPool"},{"method_slug":"sgd-with-momentum","method_name":"SGD with Momentum"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"step-decay","method_name":"Step Decay"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"xavier-initialization","method_name":"Xavier Initialization"}],"datasets_introduced":[{"slug":"jft-300m","name":"JFT-300M","full_name":"JFT-300M"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"ResNet-101 (JFT-300M Finetuning)","rank_in_archive_order":769,"of":1060,"metrics":{"Top 1 Accuracy":"79.2%"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco","task":"Object Detection","dataset":"COCO test-dev","model":"Faster R-CNN (ImageNet+300M)","rank_in_archive_order":219,"of":225,"metrics":{"AP50":"58","AP75":"40.1","APL":"51.2","APM":"41.1","APS":"17.5","box mAP":"37.4"},"uses_additional_data":false},{"leaderboard":"/sota/pose-estimation-on-coco-test-dev","task":"Pose Estimation","dataset":"COCO test-dev","model":"Faster R-CNN (ImageNet+300M)","rank_in_archive_order":39,"of":47,"metrics":{"AP":"64.4","AP50":"85.7","AP75":"70.7","APL":"69.8","APM":"61.8"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-segmentation-on-pascal-voc-2007","task":"Semantic Segmentation","dataset":"PASCAL VOC 2007","model":"DeepLabv3 (ImageNet+300M)","rank_in_archive_order":2,"of":2,"metrics":{"Mean IoU":"81.3"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-pascal-voc-2012-val","task":"Semantic Segmentation","dataset":"PASCAL VOC 2012 val","model":"DeepLabv3 (ImageNet+300M)","rank_in_archive_order":19,"of":29,"metrics":{"mIoU":"76.5%"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1707.02968","atlas_url":"https://app.syntology.ai/?focus=1707.02968","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}