{"url":"/task/data-augmentation","name":"Data Augmentation","slug":"data-augmentation","description_markdown":"Data augmentation involves techniques used for increasing the amount of data, based on different modifications, to expand the amount of examples in the original dataset. Data augmentation not only helps to grow the dataset but it also increases the diversity of the dataset. When training machine learning models, data augmentation acts as a regularizer and helps to avoid overfitting. \r\n\r\nData augmentation techniques have been found useful in domains like NLP and computer vision. In computer vision, transformations like cropping, flipping, and rotation are used. In NLP, data augmentation techniques can include swapping, deletion, random insertion, among others. \r\n\r\nFurther readings:\r\n\r\n- [A Survey of Data Augmentation Approaches for NLP](https://paperswithcode.com/paper/a-survey-of-data-augmentation-approaches-for)\r\n- [A survey on Image Data Augmentation for Deep Learning](https://journalofbigdata.springeropen.com/articles/10.1186/s40537-019-0197-0)\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Albumentations](https://github.com/albumentations-team/albumentations) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Methodology","url":"/area/methodology"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":8378,"papers_with_code":3225,"benchmarks":3,"benchmark_tables_in_archive":3,"benchmark_tables_shown":3,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":63,"subtasks":2,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/data-augmentation-on-imagenet","slug":"data-augmentation-on-imagenet","dataset":"ImageNet","dataset_url":"/dataset/imagenet","rows_in_archive":17,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"DeiT-B (+MixPro)","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","paper_url":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_date":"2023-04-24","arxiv_id":"2304.12043","code_links":[{"title":"fistyee/mixpro","url":"https://github.com/fistyee/mixpro"}],"syntology":{"n":18,"n_ran":10,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/data-augmentation-on-cifar-10","slug":"data-augmentation-on-cifar-10","dataset":"CIFAR-10","dataset_url":"/dataset/cifar-10","rows_in_archive":5,"metrics":["Percentage error"],"first_row_in_archive_order":{"model":"Shake-Shake (26 2×96d) (Faster AA)","paper_title":"Faster AutoAugment: Learning Augmentation Strategies using Backpropagation","paper_url":"/paper/faster-autoaugment-learning-augmentation","paper_date":"2019-11-16","arxiv_id":"1911.06987","code_links":[{"title":"moskomule/dda","url":"https://github.com/moskomule/dda"}],"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/data-augmentation-on-ga1457","slug":"data-augmentation-on-ga1457","dataset":"GA1457","dataset_url":null,"rows_in_archive":4,"metrics":["Classification Accuracy"],"first_row_in_archive_order":{"model":"DiffAug","paper_title":"DiffAug: Enhance Unsupervised Contrastive Learning with Domain-Knowledge-Free Diffusion-based Data Augmentation","paper_url":"/paper/boosting-unsupervised-contrastive-learning","paper_date":"2023-09-10","arxiv_id":"2309.07909","code_links":[{"title":"zangzelin/code_diffaug","url":"https://github.com/zangzelin/code_diffaug"}],"syntology":null}}],"datasets":[{"url":"/dataset/cifar-10","name":"CIFAR-10","full_name":"CIFAR-10","num_papers_in_archive":16145},{"url":"/dataset/imagenet","name":"ImageNet","full_name":"","num_papers_in_archive":15430},{"url":"/dataset/esc-50","name":"ESC-50","full_name":"ESC-50","num_papers_in_archive":387},{"url":"/dataset/imagenet-sketch","name":"ImageNet-Sketch","full_name":"","num_papers_in_archive":268},{"url":"/dataset/must-c","name":"MuST-C","full_name":"","num_papers_in_archive":216},{"url":"/dataset/clotho","name":"Clotho","full_name":"Clotho","num_papers_in_archive":202},{"url":"/dataset/iam","name":"IAM","full_name":"IAM Handwriting","num_papers_in_archive":198},{"url":"/dataset/mathqa","name":"MathQA","full_name":"","num_papers_in_archive":159},{"url":"/dataset/paws","name":"PAWS","full_name":"Paraphrase Adversaries from Word Scrambling","num_papers_in_archive":159},{"url":"/dataset/urbansound8k-1","name":"UrbanSound8K","full_name":"UrbanSound8K","num_papers_in_archive":147},{"url":"/dataset/gap-coreference-dataset","name":"GAP Coreference Dataset","full_name":"","num_papers_in_archive":104},{"url":"/dataset/promise12","name":"PROMISE12","full_name":"PROMISE12","num_papers_in_archive":84},{"url":"/dataset/sparc","name":"SParC","full_name":"Semantic Parsing in Context","num_papers_in_archive":59},{"url":"/dataset/europarl-st","name":"Europarl-ST","full_name":"","num_papers_in_archive":57},{"url":"/dataset/xbd","name":"xBD","full_name":"","num_papers_in_archive":51},{"url":"/dataset/slakh2100","name":"Slakh2100","full_name":"Synthesized Lakh Dataset","num_papers_in_archive":38},{"url":"/dataset/covid-19-image-data-collection","name":"COVID-19 Image Data Collection","full_name":"","num_papers_in_archive":35},{"url":"/dataset/meqsum","name":"MeQSum","full_name":null,"num_papers_in_archive":33},{"url":"/dataset/medquad","name":"MedQuAD","full_name":"Medical Question Answering Dataset","num_papers_in_archive":32},{"url":"/dataset/help","name":"HELP","full_name":"","num_papers_in_archive":30},{"url":"/dataset/mrnet","name":"MRNet","full_name":"","num_papers_in_archive":29},{"url":"/dataset/conan","name":"CONAN","full_name":"COunter NArratives through Nichesourcing","num_papers_in_archive":27},{"url":"/dataset/evidence-inference","name":"Evidence Inference","full_name":"","num_papers_in_archive":27},{"url":"/dataset/ccpd","name":"CCPD","full_name":"Chinese City Parking Dataset","num_papers_in_archive":24},{"url":"/dataset/kdconv","name":"KdConv","full_name":"Knowledge-driven Conversation","num_papers_in_archive":22},{"url":"/dataset/ethos","name":"ETHOS","full_name":"multi-labEl haTe speecH detectiOn dataSet","num_papers_in_archive":20},{"url":"/dataset/george-washington","name":"George Washington","full_name":"George Washington","num_papers_in_archive":20},{"url":"/dataset/infotabs","name":"InfoTabS","full_name":"","num_papers_in_archive":18},{"url":"/dataset/med","name":"MED","full_name":"Monotonicity Entailment Dataset","num_papers_in_archive":18},{"url":"/dataset/orcas","name":"ORCAS","full_name":"","num_papers_in_archive":18},{"url":"/dataset/rpc","name":"RPC","full_name":"Retail Product Checkout","num_papers_in_archive":17},{"url":"/dataset/vehiclex","name":"VehicleX","full_name":null,"num_papers_in_archive":16},{"url":"/dataset/brats-2016","name":"BraTS 2016","full_name":"BraTS 2016","num_papers_in_archive":13},{"url":"/dataset/logo-2k","name":"Logo-2K+","full_name":null,"num_papers_in_archive":13},{"url":"/dataset/crd3","name":"CRD3","full_name":"Critical Role Dungeons and Dragons Dataset","num_papers_in_archive":9},{"url":"/dataset/egohos","name":"EgoHOS","full_name":"Fine-Grained Egocentric Hand-Object Segmentation Dataset","num_papers_in_archive":9},{"url":"/dataset/europarl-asr","name":"Europarl-ASR","full_name":"","num_papers_in_archive":8},{"url":"/dataset/incidents","name":"Incidents","full_name":"","num_papers_in_archive":8},{"url":"/dataset/hotels-50k","name":"Hotels-50K","full_name":"","num_papers_in_archive":7},{"url":"/dataset/m2caiseg","name":"m2caiSeg","full_name":"","num_papers_in_archive":5},{"url":"/dataset/word2word","name":"word2word","full_name":"word2word","num_papers_in_archive":5},{"url":"/dataset/amazon-fine-foods","name":"Amazon Fine Foods","full_name":"","num_papers_in_archive":4},{"url":"/dataset/bentham","name":"Bentham","full_name":"Bentham project","num_papers_in_archive":4},{"url":"/dataset/birdvox-full-night","name":"BirdVox-full-night","full_name":"BirdVox-full-night","num_papers_in_archive":3},{"url":"/dataset/konzil","name":"Konzil","full_name":"Konzilsprotokolle_C","num_papers_in_archive":3},{"url":"/dataset/litis-rouen","name":"LITIS Rouen","full_name":"LITIS Rouen","num_papers_in_archive":3},{"url":"/dataset/patzig","name":"Patzig","full_name":"","num_papers_in_archive":3},{"url":"/dataset/ricordi","name":"Ricordi","full_name":"","num_papers_in_archive":3},{"url":"/dataset/shiller","name":"Schiller","full_name":"Shiller","num_papers_in_archive":3},{"url":"/dataset/schwerin","name":"Schwerin","full_name":"","num_papers_in_archive":3},{"url":"/dataset/vocalfolds","name":"VocalFolds","full_name":null,"num_papers_in_archive":3},{"url":"/dataset/elfw","name":"ELFW","full_name":"Extended Labeled Faces in-the-Wild","num_papers_in_archive":2},{"url":"/dataset/mvtec-d2s","name":"MVTec D2S","full_name":"MVTec Densely Segmented Supermarket","num_papers_in_archive":2},{"url":"/dataset/saint-gall","name":"Saint Gall","full_name":"","num_papers_in_archive":2},{"url":"/dataset/ufpr-amr-dataset","name":"UFPR-AMR","full_name":"","num_papers_in_archive":2},{"url":"/dataset/cecw","name":"CECW","full_name":"Colorful Extended Cleanup World","num_papers_in_archive":1},{"url":"/dataset/coco-earthquake","name":"COCO Earthquake","full_name":"","num_papers_in_archive":1},{"url":"/dataset/gutenberg-poem-dataset","name":"Gutenberg Poem Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/imagifilter","name":"ImagiFilter","full_name":"","num_papers_in_archive":1},{"url":"/dataset/radiotalk","name":"RadioTalk","full_name":"","num_papers_in_archive":1},{"url":"/dataset/synthetic-covid-19-cxr-dataset","name":"Synthetic COVID-19 CXR Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/tilt-rgbd","name":"Tilt-RGBD","full_name":"","num_papers_in_archive":1},{"url":"/dataset/medleydb-2-0","name":"MedleyDB 2.0","full_name":null,"num_papers_in_archive":0}],"subtasks":[{"url":"/task/image-augmentation","name":"Image Augmentation"},{"url":"/task/text-augmentation","name":"Text Augmentation"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":3225,"tagged_in_all":8378,"items":[{"url":"/paper/yolov4-optimal-speed-and-accuracy-of-object","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","date":"2020-04-23","arxiv_id":"2004.10934","repositories_listed":223,"syntology":{"n":184,"n_ran":24,"n_unverified":160,"n_pointer_only":8}},{"url":"/paper/improved-baselines-with-momentum-contrastive","title":"Improved Baselines with Momentum Contrastive Learning","date":"2020-03-09","arxiv_id":"2003.04297","repositories_listed":36,"syntology":{"n":43,"n_ran":8,"n_unverified":35,"n_pointer_only":10}},{"url":"/paper/autoaugment-learning-augmentation-policies","title":"AutoAugment: Learning Augmentation Policies from Data","date":"2018-05-24","arxiv_id":"1805.09501","repositories_listed":33,"syntology":{"n":43,"n_ran":6,"n_unverified":37,"n_pointer_only":2}},{"url":"/paper/specaugment-a-simple-data-augmentation-method","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","date":"2019-04-18","arxiv_id":"1904.08779","repositories_listed":30,"syntology":{"n":18,"n_ran":1,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/improved-regularization-of-convolutional","title":"Improved Regularization of Convolutional Neural Networks with Cutout","date":"2017-08-15","arxiv_id":"1708.04552","repositories_listed":28,"syntology":{"n":24,"n_ran":21,"n_unverified":3,"n_pointer_only":5}},{"url":"/paper/3d-u-net-learning-dense-volumetric","title":"3D U-Net: Learning Dense Volumetric Segmentation from Sparse Annotation","date":"2016-06-21","arxiv_id":"1606.06650","repositories_listed":27,"syntology":{"n":76,"n_ran":53,"n_unverified":23,"n_pointer_only":20}},{"url":"/paper/efficientnetv2-smaller-models-and-faster","title":"EfficientNetV2: Smaller Models and Faster Training","date":"2021-04-01","arxiv_id":"2104.00298","repositories_listed":26,"syntology":{"n":79,"n_ran":41,"n_unverified":38,"n_pointer_only":10}},{"url":"/paper/supervised-contrastive-learning","title":"Supervised Contrastive Learning","date":"2020-04-23","arxiv_id":"2004.11362","repositories_listed":26,"syntology":{"n":23,"n_ran":6,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/simcse-simple-contrastive-learning-of","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","date":"2021-04-18","arxiv_id":"2104.08821","repositories_listed":23,"syntology":{"n":30,"n_ran":17,"n_unverified":13,"n_pointer_only":19}},{"url":"/paper/unsupervised-data-augmentation-1","title":"Unsupervised Data Augmentation for Consistency Training","date":"2019-04-29","arxiv_id":"1904.12848","repositories_listed":20,"syntology":{"n":52,"n_ran":15,"n_unverified":37,"n_pointer_only":9}},{"url":"/paper/resmlp-feedforward-networks-for-image","title":"ResMLP: Feedforward networks for image classification with data-efficient training","date":"2021-05-07","arxiv_id":"2105.03404","repositories_listed":19,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/randaugment-practical-data-augmentation-with","title":"RandAugment: Practical automated data augmentation with a reduced search space","date":"2019-09-30","arxiv_id":"1909.13719","repositories_listed":19,"syntology":{"n":65,"n_ran":58,"n_unverified":7,"n_pointer_only":17}},{"url":"/paper/unsupervised-learning-of-visual-features-by","title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments","date":"2020-06-17","arxiv_id":"2006.09882","repositories_listed":18,"syntology":{"n":17,"n_ran":13,"n_unverified":4,"n_pointer_only":6}},{"url":"/paper/random-erasing-data-augmentation","title":"Random Erasing Data Augmentation","date":"2017-08-16","arxiv_id":"1708.04896","repositories_listed":18,"syntology":null},{"url":"/paper/denser-deep-evolutionary-network-structured","title":"DENSER: Deep Evolutionary Network Structured Representation","date":"2018-01-04","arxiv_id":"1801.01563","repositories_listed":17,"syntology":null},{"url":"/paper/how-to-train-your-vit-data-augmentation-and","title":"How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers","date":"2021-06-18","arxiv_id":"2106.10270","repositories_listed":16,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/eda-easy-data-augmentation-techniques-for","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","date":"2019-01-31","arxiv_id":"1901.11196","repositories_listed":16,"syntology":{"n":13,"n_ran":2,"n_unverified":11,"n_pointer_only":1}},{"url":"/paper/resnet-strikes-back-an-improved-training","title":"ResNet strikes back: An improved training procedure in timm","date":"2021-10-01","arxiv_id":"2110.00476","repositories_listed":14,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/self-training-with-noisy-student-improves","title":"Self-training with Noisy Student improves ImageNet classification","date":"2019-11-11","arxiv_id":"1911.04252","repositories_listed":13,"syntology":{"n":24,"n_ran":5,"n_unverified":19,"n_pointer_only":0}},{"url":"/paper/sampling-generative-networks","title":"Sampling Generative Networks","date":"2016-09-14","arxiv_id":"1609.04468","repositories_listed":13,"syntology":{"n":15,"n_ran":1,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/deit-iii-revenge-of-the-vit","title":"DeiT III: Revenge of the ViT","date":"2022-04-14","arxiv_id":"2204.07118","repositories_listed":12,"syntology":null},{"url":"/paper/recurrent-neural-networks-with-top-k-gains","title":"Recurrent Neural Networks with Top-k Gains for Session-based Recommendations","date":"2017-06-12","arxiv_id":"1706.03847","repositories_listed":12,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/fast-autoaugment","title":"Fast AutoAugment","date":"2019-05-01","arxiv_id":"1905.00397","repositories_listed":11,"syntology":{"n":40,"n_ran":22,"n_unverified":18,"n_pointer_only":3}},{"url":"/paper/ecg-arrhythmia-classification-using-a-2-d","title":"ECG arrhythmia classification using a 2-D convolutional neural network","date":"2018-04-18","arxiv_id":"1804.06812","repositories_listed":11,"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}},{"url":"/paper/transgan-two-transformers-can-make-one-strong","title":"TransGAN: Two Pure Transformers Can Make One Strong GAN, and That Can Scale Up","date":"2021-02-14","arxiv_id":"2102.07074","repositories_listed":10,"syntology":{"n":8,"n_ran":8,"n_unverified":0,"n_pointer_only":7}},{"url":"/paper/camera-style-adaptation-for-person-re","title":"Camera Style Adaptation for Person Re-identification","date":"2017-11-28","arxiv_id":"1711.10295","repositories_listed":10,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/niftynet-a-deep-learning-platform-for-medical","title":"NiftyNet: a deep-learning platform for medical imaging","date":"2017-09-11","arxiv_id":"1709.03485","repositories_listed":10,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/multi-modality-cut-and-paste-for-3d-object","title":"Exploring Data Augmentation for Multi-Modality 3D Object Detection","date":"2020-12-23","arxiv_id":"2012.12741","repositories_listed":9,"syntology":null},{"url":"/paper/graph-random-neural-network","title":"Graph Random Neural Network for Semi-Supervised Learning on Graphs","date":"2020-05-22","arxiv_id":"2005.11079","repositories_listed":9,"syntology":{"n":22,"n_ran":8,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/optimizing-millions-of-hyperparameters-by","title":"Optimizing Millions of Hyperparameters by Implicit Differentiation","date":"2019-11-06","arxiv_id":"1911.02590","repositories_listed":9,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}}],"syntology_records":26,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":1,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}