{"url":"/method/mim","slug":"mim","name":"MIM","full_name":"Mutual Information Machine/Mask Image Modeling","full_name_withheld":false,"description_markdown":null,"description_state":"absent","introduced_year":null,"introduced_by":{"title":"MIM: Mutual Information Machine","paper":"/paper/mim-mutual-information-machine","first_author":"Micha Livne","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/mim-mutual-information-machine"},"source":{"url":"https://arxiv.org/abs/1910.03175v5","title":"MIM: Mutual Information Machine","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Representation Learning","url":"/methods/category/representation-learning","pwc_aliases":[]}],"n_papers_tagged":150,"archive_num_papers":150,"papers_newest_first":[{"paper":"/paper/boosting-generative-adversarial","title":"Boosting Generative Adversarial Transferability with Self-supervised Vision Transformer Features","date":"2025-06-26","arxiv_id":"2506.21046","n_code_links":1,"syntology":null},{"paper":"/paper/attention-please-revisiting-attentive-probing","title":"Attention, Please! Revisiting Attentive Probing for Masked Image Modeling","date":"2025-06-11","arxiv_id":"2506.10178","n_code_links":1,"syntology":null},{"paper":null,"title":"Joint Low-level and High-level Textual Representation Learning with Multiple Masking Strategies","date":"2025-05-11","arxiv_id":"2505.06855","n_code_links":0,"syntology":null},{"paper":null,"title":"Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis","date":"2025-04-15","arxiv_id":"2504.11331","n_code_links":0,"syntology":null},{"paper":null,"title":"Resilience of Vision Transformers for Domain Generalisation in the Presence of Out-of-Distribution Noisy Images","date":"2025-04-05","arxiv_id":"2504.04225","n_code_links":0,"syntology":null},{"paper":null,"title":"MIMRS: A Survey on Masked Image Modeling in Remote Sensing","date":"2025-04-04","arxiv_id":"2504.03181","n_code_links":0,"syntology":null},{"paper":null,"title":"SelfMedHPM: Self Pre-training With Hard Patches Mining Masked Autoencoders For Medical Image Segmentation","date":"2025-04-03","arxiv_id":"2504.02524","n_code_links":0,"syntology":null},{"paper":"/paper/linguistics-aware-masked-image-modeling-for","title":"Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition","date":"2025-03-24","arxiv_id":"2503.18746","n_code_links":1,"syntology":{"ran":1,"of":6,"unverified":5,"pointer_only":6}},{"paper":null,"title":"Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image Synthesis","date":"2025-03-19","arxiv_id":"2503.15060","n_code_links":0,"syntology":null},{"paper":null,"title":"A Multi-Modal Federated Learning Framework for Remote Sensing Image Classification","date":"2025-03-13","arxiv_id":"2503.10262","n_code_links":0,"syntology":null},{"paper":null,"title":"MIRAM: Masked Image Reconstruction Across Multiple Scales for Breast Lesion Risk Prediction","date":"2025-03-10","arxiv_id":"2503.07157","n_code_links":0,"syntology":null},{"paper":null,"title":"Wavelet-Driven Masked Image Modeling: A Path to Efficient Visual Representation","date":"2025-03-02","arxiv_id":"2503.00782","n_code_links":0,"syntology":null},{"paper":null,"title":"cMIM: A Contrastive Mutual Information Framework for Unified Generative and Discriminative Representation Learning","date":"2025-02-27","arxiv_id":"2502.19642","n_code_links":0,"syntology":null},{"paper":"/paper/escaping-the-big-data-paradigm-in-self","title":"Escaping The Big Data Paradigm in Self-Supervised Representation Learning","date":"2025-02-25","arxiv_id":"2502.18056","n_code_links":1,"syntology":null},{"paper":"/paper/cluster-and-predict-latents-patches-for","title":"Cluster and Predict Latents Patches for Improved Masked Image Modeling","date":"2025-02-12","arxiv_id":"2502.08769","n_code_links":2,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":1}},{"paper":"/paper/hi-end-mae-hierarchical-encoder-driven-masked","title":"Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image segmentation","date":"2025-02-12","arxiv_id":"2502.08347","n_code_links":1,"syntology":null},{"paper":null,"title":"MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling","date":"2025-02-01","arxiv_id":"2502.00321","n_code_links":0,"syntology":null},{"paper":"/paper/pilamim-toward-richer-visual-representations","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","date":"2025-01-06","arxiv_id":"2501.03005","n_code_links":1,"syntology":null},{"paper":"/paper/beyond-cls-exploring-the-true-potential-of","title":"Beyond [cls]: Exploring the true potential of Masked Image Modeling representations","date":"2024-12-04","arxiv_id":"2412.03215","n_code_links":1,"syntology":null},{"paper":"/paper/satvision-toa-a-geospatial-foundation-model","title":"SatVision-TOA: A Geospatial Foundation Model for Coarse-Resolution All-Sky Remote Sensing Imagery","date":"2024-11-26","arxiv_id":"2411.17000","n_code_links":1,"syntology":null},{"paper":"/paper/relational-contrastive-learning-and-masked","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","date":"2024-11-18","arxiv_id":"2411.11219","n_code_links":1,"syntology":null},{"paper":null,"title":"From Prototypes to General Distributions: An Efficient Curriculum for Masked Image Modeling","date":"2024-11-16","arxiv_id":"2411.10685","n_code_links":0,"syntology":null},{"paper":null,"title":"Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations","date":"2024-10-22","arxiv_id":"2410.16953","n_code_links":0,"syntology":null},{"paper":"/paper/domain-adaptive-pre-training-of-self","title":"Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy","date":"2024-10-21","arxiv_id":"2410.21302","n_code_links":1,"syntology":null},{"paper":"/paper/ladmim-logical-anomaly-detection-with-masked","title":"LADMIM: Logical Anomaly Detection with Masked Image Modeling in Discrete Latent Space","date":"2024-10-14","arxiv_id":"2410.10234","n_code_links":0,"syntology":null},{"paper":null,"title":"Self-Supervised Learning for Real-World Object Detection: a Survey","date":"2024-10-09","arxiv_id":"2410.07442","n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-pretraining-for-1","title":"Self-supervised Pretraining for Cardiovascular Magnetic Resonance Cine Segmentation","date":"2024-09-26","arxiv_id":"2409.18100","n_code_links":1,"syntology":null},{"paper":null,"title":"Interactive Masked Image Modeling for Multimodal Object Detection in Remote Sensing","date":"2024-09-13","arxiv_id":"2409.08885","n_code_links":0,"syntology":null},{"paper":null,"title":"Explicit Mutual Information Maximization for Self-Supervised Learning","date":"2024-09-07","arxiv_id":"2409.04747","n_code_links":0,"syntology":null},{"paper":null,"title":"SG-MIM: Structured Knowledge Guided Efficient Pre-training for Dense Prediction","date":"2024-09-04","arxiv_id":"2409.02513","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":53},{"task":"/task/representation-learning","name":"Representation Learning","papers":35},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":33},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":32},{"task":"/task/image-classification","name":"Image Classification","papers":23},{"task":"/task/object-detection","name":"Object Detection","papers":21},{"task":"/task/image-classification","name":"image-classification","papers":20},{"task":"/task/object-detection-1","name":"object-detection","papers":18},{"task":"/task/decoder","name":"Decoder","papers":12},{"task":"/task/language-modelling","name":"Language Modelling","papers":8},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":8},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":7},{"task":"/task/language-modeling","name":"Language Modeling","papers":7},{"task":"/task/attribute","name":"Attribute","papers":6},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":6},{"task":"/task/medical-image-analysis","name":"Medical Image Analysis","papers":6},{"task":"/task/medical-image-segmentation","name":"Medical Image Segmentation","papers":6},{"task":"/task/masked-language-modeling","name":"Masked Language Modeling","papers":5},{"task":"/task/segmentation","name":"Segmentation","papers":5},{"task":"/task/self-supervised-image-classification","name":"Self-Supervised Image Classification","papers":5}],"tasks_shown":20,"n_tasks":165,"usage_by_year":[{"year":"2019","papers":1},{"year":"2020","papers":5},{"year":"2021","papers":1},{"year":"2022","papers":35},{"year":"2023","papers":50},{"year":"2024","papers":40},{"year":"2025","papers":18}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/mim"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}