{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/pre-trained-image-processing-transformer","title":"Pre-Trained Image Processing Transformer","arxiv_id":"2012.00364","date":"2020-12-01","proceeding":"CVPR 2021 1","authors":["Hanting Chen","Yunhe Wang","Tianyu Guo","Chang Xu","Yiping Deng","Zhenhua Liu","Siwei Ma","Chunjing Xu","Chao Xu","Wen Gao"],"abstract":"As the computing power of modern hardware is increasing strongly, pre-trained deep learning models (e.g., BERT, GPT-3) learned on large-scale datasets have shown their effectiveness over conventional methods. The big progress is mainly contributed to the representation ability of transformer and its variant architectures. In this paper, we study the low-level computer vision task (e.g., denoising, super-resolution and deraining) and develop a new pre-trained model, namely, image processing transformer (IPT). To maximally excavate the capability of transformer, we present to utilize the well-known ImageNet benchmark for generating a large amount of corrupted image pairs. The IPT model is trained on these images with multi-heads and multi-tails. In addition, the contrastive learning is introduced for well adapting to different image processing tasks. The pre-trained model can therefore efficiently employed on desired task after fine-tuning. With only one pre-trained model, IPT outperforms the current state-of-the-art methods on various low-level benchmarks. Code is available at https://github.com/huawei-noah/Pretrained-IPT and https://gitee.com/mindspore/mindspore/tree/master/model_zoo/research/cv/IPT","url_abs":"https://arxiv.org/abs/2012.00364v4","url_pdf":"https://arxiv.org/pdf/2012.00364v4.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/huawei-noah/Pretrained-IPT","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/dongyan007/Pretrained-IPT-main-master","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/yangyucheng000/IPT-3","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mindspore","reach":{"status":"unanswered"}},{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/2023-MindSpore-1/ms-code-214/tree/main/IPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/Mind23-2/MindCode-3/tree/main/IPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"pre-trained-image-processing-transformer","repo_url":"https://github.com/mindspore-ai/models/tree/master/research/cv/IPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null}],"tasks":[{"task_slug":"color-image-denoising","task_name":"Color Image Denoising"},{"task_slug":"contrastive-learning","task_name":"Contrastive Learning"},{"task_slug":"denoising","task_name":"Denoising"},{"task_slug":"image-super-resolution","task_name":"Image Super-Resolution"},{"task_slug":"rain-removal","task_name":"Rain Removal"},{"task_slug":"single-image-deraining","task_name":"Single Image Deraining"},{"task_slug":"super-resolution","task_name":"Super-Resolution"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"contrastive-learning","method_name":"Contrastive Learning"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/color-image-denoising-on-cbsd68-sigma50","task":"Color Image Denoising","dataset":"CBSD68 sigma50","model":"IPT","rank_in_archive_order":1,"of":18,"metrics":{"PSNR":"29.39"},"uses_additional_data":true},{"leaderboard":"/sota/color-image-denoising-on-urban100-sigma50","task":"Color Image Denoising","dataset":"Urban100 sigma50","model":"IPT","rank_in_archive_order":8,"of":9,"metrics":{"PSNR":"29.71"},"uses_additional_data":true},{"leaderboard":"/sota/image-super-resolution-on-bsd100-2x-upscaling","task":"Image Super-Resolution","dataset":"BSD100 - 2x upscaling","model":"IPT","rank_in_archive_order":13,"of":30,"metrics":{"PSNR":"32.48"},"uses_additional_data":true},{"leaderboard":"/sota/image-super-resolution-on-set14-3x-upscaling","task":"Image Super-Resolution","dataset":"Set14 - 3x upscaling","model":"IPT","rank_in_archive_order":9,"of":24,"metrics":{"PSNR":"30.85"},"uses_additional_data":true},{"leaderboard":"/sota/image-super-resolution-on-urban100-3x","task":"Image Super-Resolution","dataset":"Urban100 - 3x upscaling","model":"IPT","rank_in_archive_order":9,"of":22,"metrics":{"PSNR":"29.49"},"uses_additional_data":true},{"leaderboard":"/sota/single-image-deraining-on-rain100l","task":"Single Image Deraining","dataset":"Rain100L","model":"IPT","rank_in_archive_order":1,"of":19,"metrics":{"PSNR":"41.62","SSIM":"0.988"},"uses_additional_data":true}],"syntology":{"syntology_url":"https://syntology.ai/paper/2012.00364","atlas_url":"https://app.syntology.ai/?focus=2012.00364","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}