{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/maskedautoencodervit","entry":"MaskedAutoencoderViT","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":14,"n_papers_ran":3,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":24,"n_samples_ran":3,"n_samples_fingerprinted":0,"n_places":24,"n_places_pointer_only":15,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":3,"unverified":21},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2505.22815","paper":"/paper/imts-is-worth-time-times-channel-patches","title":"IMTS is Worth Time $\\times$ Channel Patches: Visual Masked Autoencoders for Irregular Multivariate Time Series Prediction","date":"2025-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"whu-hzy/vimts","path":"IMTS/lib/models/visionts/models_mae.py","file_url":"https://github.com/whu-hzy/vimts/blob/HEAD/IMTS/lib/models/visionts/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0c4169c946e2736d","mcp_get_code":{"code_sha256":"0c4169c946e2736d"}},{"arxiv_id":"2503.11849","paper":"/paper/towards-a-unified-copernicus-foundation-model","title":"Towards a Unified Copernicus Foundation Model for Earth Vision","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhu-xlab/Copernicus-FM","path":"Copernicus-FM/src/models_mae_cfm.py","file_url":"https://github.com/zhu-xlab/Copernicus-FM/blob/HEAD/Copernicus-FM/src/models_mae_cfm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"79dca6bf2c6d2552","mcp_get_code":{"code_sha256":"79dca6bf2c6d2552"}},{"arxiv_id":"2407.09087","paper":"/paper/on-the-role-of-discrete-tokenization-in","title":"On the Role of Discrete Tokenization in Visual Representation Learning","date":"2024-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pku-ml/clustermim","path":"models_mae.py","file_url":"https://github.com/pku-ml/clustermim/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2b908bbdf251e36b","mcp_get_code":{"code_sha256":"2b908bbdf251e36b"}},{"arxiv_id":"2306.09244","paper":"/paper/text-promptable-surgical-instrument","title":"Text Promptable Surgical Instrument Segmentation with Vision-Language Models","date":"2023-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"franciszzj/tp-sis","path":"model/segmenter.py","file_url":"https://github.com/franciszzj/tp-sis/blob/HEAD/model/segmenter.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"036efdeb4674cff1","mcp_get_code":{"code_sha256":"036efdeb4674cff1"}},{"arxiv_id":"2304.05919","paper":"/paper/hard-patches-mining-for-masked-image-modeling","title":"Hard Patches Mining for Masked Image Modeling","date":"2023-04-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Haochen-Wang409/HPM","path":"models_mae_learn_loss.py","file_url":"https://github.com/Haochen-Wang409/HPM/blob/HEAD/models_mae_learn_loss.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d88b08a86f1b802d","mcp_get_code":{"code_sha256":"d88b08a86f1b802d"}},{"arxiv_id":"2304.03283","paper":"/paper/diffusion-models-as-masked-autoencoders","title":"Diffusion Models as Masked Autoencoders","date":"2023-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kimdanni/DiffMAE","path":"models_cross.py","file_url":"https://github.com/kimdanni/DiffMAE/blob/HEAD/models_cross.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"1a91090e8cbfa8d4","mcp_get_code":{"code_sha256":"1a91090e8cbfa8d4"}},{"arxiv_id":"2303.06457","paper":"/paper/active-visual-exploration-based-on-attention","title":"Active Visual Exploration Based on Attention-Map Entropy","date":"2023-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apardyl/AME","path":"architectures/selectors.py","file_url":"https://github.com/apardyl/AME/blob/HEAD/architectures/selectors.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d3f43c1a65fc5f44","mcp_get_code":{"code_sha256":"d3f43c1a65fc5f44"}},{"arxiv_id":"2302.01056","paper":"/paper/beyond-pretrained-features-noisy-image-1","title":"Beyond Pretrained Features: Noisy Image Modeling Provides Adversarial Defense","date":"2023-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"youzunzhi/nim-advdef","path":"model/mae/nim_mae.py","file_url":"https://github.com/youzunzhi/nim-advdef/blob/HEAD/model/mae/nim_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6bd6870abe55ea7d","mcp_get_code":{"code_sha256":"6bd6870abe55ea7d"}},{"arxiv_id":"2301.08243","paper":"/paper/self-supervised-learning-from-images-with-a","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","date":"2023-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"waterdisappear/sar-jepa","path":"Pretraining/models_lomar.py","file_url":"https://github.com/waterdisappear/sar-jepa/blob/HEAD/Pretraining/models_lomar.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"91e43c1af69c43ab","mcp_get_code":{"code_sha256":"91e43c1af69c43ab"}},{"arxiv_id":"2208.00449","paper":"/paper/sdae-self-distillated-masked-autoencoder","title":"SdAE: Self-distillated Masked Autoencoder","date":"2022-07-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AbrahamYabo/SdAE","path":"models_mae.py","file_url":"https://github.com/AbrahamYabo/SdAE/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0742c0fc1b107a04","mcp_get_code":{"code_sha256":"0742c0fc1b107a04"}},{"arxiv_id":"2207.08051","paper":"/paper/satmae-pre-training-transformers-for-temporal","title":"SatMAE: Pre-training Transformers for Temporal and Multi-Spectral Satellite Imagery","date":"2022-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sustainlab-group/SatMAE","path":"models_mae_temporal.py","file_url":"https://github.com/sustainlab-group/SatMAE/blob/HEAD/models_mae_temporal.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"40c2d10d3de426ed","mcp_get_code":{"code_sha256":"40c2d10d3de426ed"}},{"arxiv_id":"2207.06405","paper":"/paper/masked-autoencoders-that-listen","title":"Masked Autoencoders that Listen","date":"2022-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/audiomae","path":"models_mae.py","file_url":"https://github.com/facebookresearch/audiomae/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"28128850f3b7974d","mcp_get_code":{"code_sha256":"28128850f3b7974d"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"keytoyze/visionts","path":"visionts/models_mae.py","file_url":"https://github.com/keytoyze/visionts/blob/HEAD/visionts/models_mae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5c85cd8b5812d34f","mcp_get_code":{"code_sha256":"5c85cd8b5812d34f"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yangsun22/tc-moa","path":"model/ViT_MAE.py","file_url":"https://github.com/yangsun22/tc-moa/blob/HEAD/model/ViT_MAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"69fcb0b19116792a","mcp_get_code":{"code_sha256":"69fcb0b19116792a"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DarshanDeshpande/jax-models","path":"jax_models/models/masked_autoencoder.py","file_url":"https://github.com/DarshanDeshpande/jax-models/blob/HEAD/jax_models/models/masked_autoencoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"db65696502e25065","mcp_get_code":{"code_sha256":"db65696502e25065"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wangsr126/mae-lite","path":"projects/mae_lite/models_mae.py","file_url":"https://github.com/wangsr126/mae-lite/blob/HEAD/projects/mae_lite/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3ad95a45a1da4292","mcp_get_code":{"code_sha256":"3ad95a45a1da4292"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yifanzhang-pro/m-mae","path":"models_mae.py","file_url":"https://github.com/yifanzhang-pro/m-mae/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a884a29cbdfbf1c0","mcp_get_code":{"code_sha256":"a884a29cbdfbf1c0"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guilk/vlc","path":"vlc/modules/mae_transformer.py","file_url":"https://github.com/guilk/vlc/blob/HEAD/vlc/modules/mae_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"aee0709299e0074e","mcp_get_code":{"code_sha256":"aee0709299e0074e"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"islamosmanubc/MedMAE","path":"code/models_mae.py","file_url":"https://github.com/islamosmanubc/MedMAE/blob/HEAD/code/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6d8df0e8713ee9e0","mcp_get_code":{"code_sha256":"6d8df0e8713ee9e0"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"virajprabhu/pacmac","path":"models_mae.py","file_url":"https://github.com/virajprabhu/pacmac/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"c24c07e5963dbcef","mcp_get_code":{"code_sha256":"c24c07e5963dbcef"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/EasyCV","path":"easycv/models/backbones/mae_vit_transformer.py","file_url":"https://github.com/alibaba/EasyCV/blob/HEAD/easycv/models/backbones/mae_vit_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4265e07807c81d08","mcp_get_code":{"code_sha256":"4265e07807c81d08"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/vip-mae","path":"models_mae.py","file_url":"https://github.com/facebookresearch/vip-mae/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"aaad170bbdcb0282","mcp_get_code":{"code_sha256":"aaad170bbdcb0282"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dominickrei/limited-data-vits","path":"models_mae.py","file_url":"https://github.com/dominickrei/limited-data-vits/blob/HEAD/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"eb084414ba03cd0e","mcp_get_code":{"code_sha256":"eb084414ba03cd0e"}},{"arxiv_id":"2010.11929","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","date":"2020-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dispink/xpt","path":"src/models/mae_vit.py","file_url":"https://github.com/dispink/xpt/blob/HEAD/src/models/mae_vit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3fc7aef63e94d614","mcp_get_code":{"code_sha256":"3fc7aef63e94d614"}}]}