{"url":"/method/gradual-self-training","slug":"gradual-self-training","name":"Gradual Self-Training","full_name":"Gradual Self-Training","full_name_withheld":false,"description_markdown":"Gradual self-training is a method for semi-supervised domain adaptation. The goal is to adapt an initial classifier trained on a source domain given only unlabeled data that shifts gradually in distribution towards a target domain. \r\n\r\nThis comes up for example in applications ranging from sensor networks and self-driving car perception modules to brain-machine interfaces, where machine learning systems must adapt to data distributions that evolve over time.\r\n\r\nThe gradual self-training algorithm begins with a classifier $w_0$ trained on labeled examples from the source domain (Figure a). For each successive domain $P_t$, the algorithm generates pseudolabels for unlabeled examples from that domain, and then trains a regularized supervised classifier on the pseudolabeled examples. The intuition, visualized in the Figure, is that after a single gradual shift, most examples are pseudolabeled correctly so self-training learns a good classifier on the shifted data, but the shift from the source to the target can be too large for self-training to correct.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Understanding Self-Training for Gradual Domain Adaptation","paper":"/paper/understanding-self-training-for-gradual","first_author":"Ananya Kumar","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/understanding-self-training-for-gradual"},"source":{"url":"https://arxiv.org/abs/2002.11361v1","title":"Understanding Self-Training for Gradual Domain Adaptation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Semi-Supervised Learning Methods","url":"/methods/category/semi-supervised-learning-methods","pwc_aliases":[]}],"n_papers_tagged":8,"archive_num_papers":8,"papers_newest_first":[{"paper":"/paper/gradual-domain-adaptation-theory-and","title":"Gradual Domain Adaptation: Theory and Algorithms","date":"2023-10-20","arxiv_id":"2310.13852","n_code_links":2,"syntology":{"ran":10,"of":15,"unverified":5,"pointer_only":0}},{"paper":"/paper/adversarial-self-training-improves-robustness","title":"Adversarial Self-Training Improves Robustness and Generalization for Gradual Domain Adaptation","date":"2023-09-21","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/gradual-domain-adaptation-via-normalizing","title":"Gradual Domain Adaptation via Normalizing Flows","date":"2022-06-23","arxiv_id":"2206.11492","n_code_links":1,"syntology":{"ran":0,"of":9,"unverified":9,"pointer_only":0}},{"paper":"/paper/understanding-gradual-domain-adaptation","title":"Understanding Gradual Domain Adaptation: Improved Analysis, Optimal Path and Beyond","date":"2022-04-18","arxiv_id":"2204.08200","n_code_links":3,"syntology":{"ran":3,"of":4,"unverified":1,"pointer_only":0}},{"paper":"/paper/improving-word-translation-via-two-stage-1","title":"Improving Word Translation via Two-Stage Contrastive Learning","date":"2022-03-15","arxiv_id":"2203.08307","n_code_links":1,"syntology":{"ran":5,"of":6,"unverified":1,"pointer_only":4}},{"paper":"/paper/improving-word-translation-via-two-stage","title":"Improving Word Translation via Two-Stage Contrastive Learning","date":"2021-11-16","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/umberto-mtsa-accompl-it-improving-complexity","title":"UmBERTo-MTSA @ AcCompl-It: Improving Complexity and Acceptability Prediction with Multi-task Learning on Self-Supervised Annotations","date":"2020-11-10","arxiv_id":"2011.05197","n_code_links":1,"syntology":null},{"paper":"/paper/understanding-self-training-for-gradual","title":"Understanding Self-Training for Gradual Domain Adaptation","date":"2020-02-26","arxiv_id":"2002.11361","n_code_links":2,"syntology":null}],"papers_shown":8,"tasks":[{"task":"/task/domain-adaptation","name":"Domain Adaptation","papers":4},{"task":"/task/unsupervised-domain-adaptation","name":"Unsupervised Domain Adaptation","papers":4},{"task":"/task/bilingual-lexicon-induction","name":"Bilingual Lexicon Induction","papers":2},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":2},{"task":"/task/cross-lingual-word-embeddings","name":"Cross-Lingual Word Embeddings","papers":2},{"task":"/task/machine-translation","name":"Machine Translation","papers":2},{"task":"/task/multilingual-nlp","name":"Multilingual NLP","papers":2},{"task":"/task/multilingual-word-embeddings","name":"Multilingual Word Embeddings","papers":2},{"task":"/task/pretrained-multilingual-language-models","name":"Pretrained Multilingual Language Models","papers":2},{"task":"/task/self-learning","name":"Self-Learning","papers":2},{"task":"/task/word-alignment","name":"Word Alignment","papers":2},{"task":"/task/word-embeddings","name":"Word Embeddings","papers":2},{"task":"/task/word-translation","name":"Word Translation","papers":2},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1},{"task":"/task/multi-task-learning","name":"Multi-Task Learning","papers":1},{"task":"/task/two","name":"Vocal Bursts Valence Prediction","papers":1}],"tasks_shown":16,"n_tasks":16,"usage_by_year":[{"year":"2020","papers":2},{"year":"2021","papers":1},{"year":"2022","papers":3},{"year":"2023","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/gradual-self-training"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}