{"url":"/method/cv-mim","slug":"cv-mim","name":"CV-MIM","full_name":"Contrastive Cross-View Mutual Information Maximization","full_name_withheld":false,"description_markdown":"**CV-MIM**, or **Contrastive Cross-View Mutual Information Maximization**, is a representation learning method to disentangle pose-dependent as well as view-dependent factors from 2D human poses. The method trains a network using cross-view mutual information maximization, which maximizes mutual information of the same pose performed from different viewpoints in a contrastive learning manner. It further utilizes two regularization terms to ensure disentanglement and smoothness of the learned representations.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Learning View-Disentangled Human Pose Representation by Contrastive Cross-View Mutual Information Maximization","paper":"/paper/learning-view-disentangled-human-pose","first_author":"Long Zhao","n_authors":10,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/learning-view-disentangled-human-pose"},"source":{"url":"https://arxiv.org/abs/2012.01405v2","title":"Learning View-Disentangled Human Pose Representation by Contrastive Cross-View Mutual Information Maximization","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Representation Learning","url":"/methods/category/representation-learning","pwc_aliases":[]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","arxiv_id":"2111.06377","n_code_links":58,"syntology":{"ran":71,"of":137,"unverified":66,"pointer_only":73}},{"paper":"/paper/learning-view-disentangled-human-pose","title":"Learning View-Disentangled Human Pose Representation by Contrastive Cross-View Mutual Information Maximization","date":"2020-12-02","arxiv_id":"2012.01405","n_code_links":1,"syntology":null}],"papers_shown":2,"tasks":[{"task":"/task/action-recognition-in-videos","name":"Action Recognition","papers":1},{"task":"/task/contrastive-learning","name":"Contrastive Learning","papers":1},{"task":"/task/decoder","name":"Decoder","papers":1},{"task":"/task/disentanglement","name":"Disentanglement","papers":1},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/object-detection","name":"Object Detection","papers":1},{"task":"/task/out-of-distribution-generalization","name":"Out-of-Distribution Generalization","papers":1},{"task":"/task/representation-learning","name":"Representation Learning","papers":1},{"task":"/task/self-supervised-image-classification","name":"Self-Supervised Image Classification","papers":1},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":1},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1}],"tasks_shown":12,"n_tasks":12,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/cv-mim"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}