{"url":"/method/gradient-checkpointing","slug":"gradient-checkpointing","name":"Gradient Checkpointing","full_name":"Gradient Checkpointing","full_name_withheld":false,"description_markdown":"**Gradient Checkpointing** is a method used for reducing the memory footprint when training deep neural networks, at the cost of having a small increase in computation time.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Training Deep Nets with Sublinear Memory Cost","paper":"/paper/training-deep-nets-with-sublinear-memory-cost","first_author":"Tianqi Chen","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/training-deep-nets-with-sublinear-memory-cost"},"source":{"url":"http://arxiv.org/abs/1604.06174v2","title":"Training Deep Nets with Sublinear Memory Cost","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":14,"archive_num_papers":14,"papers_newest_first":[{"paper":null,"title":"Optimal Gradient Checkpointing for Sparse and Recurrent Architectures using Off-Chip Memory","date":"2024-12-16","arxiv_id":"2412.11810","n_code_links":0,"syntology":null},{"paper":null,"title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","date":"2024-11-29","arxiv_id":"2411.19460","n_code_links":0,"syntology":null},{"paper":"/paper/superior-scoring-rules-for-probabilistic","title":"Superior Scoring Rules for Probabilistic Evaluation of Single-Label Multi-Class Classification Tasks","date":"2024-07-25","arxiv_id":"2407.17697","n_code_links":1,"syntology":null},{"paper":null,"title":"A Study of Optimizations for Fine-tuning Large Language Models","date":"2024-06-04","arxiv_id":"2406.02290","n_code_links":0,"syntology":null},{"paper":null,"title":"DITTO: Diffusion Inference-Time T-Optimization for Music Generation","date":"2024-01-22","arxiv_id":"2401.12179","n_code_links":0,"syntology":null},{"paper":"/paper/capivara-cost-efficient-approach-for","title":"CAPIVARA: Cost-Efficient Approach for Improving Multilingual CLIP Performance on Low-Resource Languages","date":"2023-10-20","arxiv_id":"2310.13683","n_code_links":1,"syntology":null},{"paper":null,"title":"Unsupervised Discovery of Interpretable Directions in h-space of Pre-trained Diffusion Models","date":"2023-10-15","arxiv_id":"2310.09912","n_code_links":0,"syntology":null},{"paper":"/paper/lightseq-sequence-level-parallelism-for","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","date":"2023-10-05","arxiv_id":"2310.03294","n_code_links":1,"syntology":null},{"paper":"/paper/map-memory-aware-automated-intra-op-parallel","title":"Colossal-Auto: Unified Automation of Parallelization and Activation Checkpoint for Large-scale Models","date":"2023-02-06","arxiv_id":"2302.02599","n_code_links":1,"syntology":null},{"paper":"/paper/gleam-greedy-learning-for-large-scale","title":"GLEAM: Greedy Learning for Large-Scale Accelerated MRI Reconstruction","date":"2022-07-18","arxiv_id":"2207.08393","n_code_links":1,"syntology":null},{"paper":"/paper/combined-scaling-for-zero-shot-transfer","title":"Combined Scaling for Zero-shot Transfer Learning","date":"2021-11-19","arxiv_id":"2111.10050","n_code_links":0,"syntology":null},{"paper":"/paper/doc2dict-information-extraction-as-text","title":"Doc2Dict: Information Extraction as Text Generation","date":"2021-05-16","arxiv_id":"2105.07510","n_code_links":1,"syntology":null},{"paper":"/paper/self-supervised-pretraining-of-visual","title":"Self-supervised Pretraining of Visual Features in the Wild","date":"2021-03-02","arxiv_id":"2103.01988","n_code_links":1,"syntology":null},{"paper":"/paper/training-deep-nets-with-sublinear-memory-cost","title":"Training Deep Nets with Sublinear Memory Cost","date":"2016-04-21","arxiv_id":"1604.06174","n_code_links":6,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}}],"papers_shown":14,"tasks":[{"task":null,"name":"GPU","papers":7},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":2},{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/all","name":"All","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":1},{"task":"/task/diversity","name":"Diversity","papers":1},{"task":"/task/form","name":"Form","papers":1},{"task":"/task/image-captioning","name":"Image Captioning","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/mri-reconstruction","name":"MRI Reconstruction","papers":1},{"task":"/task/machine-translation","name":"Machine Translation","papers":1},{"task":"/task/mamba","name":"Mamba","papers":1},{"task":"/task/model-optimization","name":"Model Optimization","papers":1},{"task":"/task/model-selection","name":"Model Selection","papers":1},{"task":"/task/multi-class-classification","name":"Multi-class Classification","papers":1},{"task":"/task/music-generation","name":"Music Generation","papers":1},{"task":"/task/scheduling","name":"Scheduling","papers":1},{"task":"/task/self-supervised-image-classification","name":"Self-Supervised Image Classification","papers":1}],"tasks_shown":20,"n_tasks":29,"usage_by_year":[{"year":"2016","papers":1},{"year":"2021","papers":3},{"year":"2022","papers":1},{"year":"2023","papers":4},{"year":"2024","papers":5}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/gradient-checkpointing"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}