{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/ibot-image-bert-pre-training-with-online","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","arxiv_id":"2111.07832","date":"2021-11-15","proceeding":null,"authors":["Jinghao Zhou","Chen Wei","Huiyu Wang","Wei Shen","Cihang Xie","Alan Yuille","Tao Kong"],"abstract":"The success of language Transformers is primarily attributed to the pretext task of masked language modeling (MLM), where texts are first tokenized into semantically meaningful pieces. In this work, we study masked image modeling (MIM) and indicate the advantages and challenges of using a semantically meaningful visual tokenizer. We present a self-supervised framework iBOT that can perform masked prediction with an online tokenizer. Specifically, we perform self-distillation on masked patch tokens and take the teacher network as the online tokenizer, along with self-distillation on the class token to acquire visual semantics. The online tokenizer is jointly learnable with the MIM objective and dispenses with a multi-stage training pipeline where the tokenizer needs to be pre-trained beforehand. We show the prominence of iBOT by achieving an 82.3% linear probing accuracy and an 87.8% fine-tuning accuracy evaluated on ImageNet-1K. Beyond the state-of-the-art image classification results, we underline emerging local semantic patterns, which helps the models to obtain strong robustness against common corruptions and achieve leading results on dense downstream tasks, eg., object detection, instance segmentation, and semantic segmentation.","url_abs":"https://arxiv.org/abs/2111.07832v3","url_pdf":"https://arxiv.org/pdf/2111.07832v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"ibot-image-bert-pre-training-with-online","repo_url":"https://github.com/bytedance/ibot","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"ibot-image-bert-pre-training-with-online","repo_url":"https://gitlab.com/birder/birder","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"instance-segmentation","task_name":"Instance Segmentation"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"masked-language-modeling","task_name":"Masked Language Modeling"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"self-supervised-image-classification","task_name":"Self-Supervised Image Classification"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"semi-supervised-image-classification","task_name":"Semi-Supervised Image Classification"},{"task_slug":"unsupervised-image-classification","task_name":"Unsupervised Image Classification"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/instance-segmentation-on-coco","task":"Instance Segmentation","dataset":"COCO test-dev","model":"iBOT (ViT-B/16)","rank_in_archive_order":45,"of":112,"metrics":{"mask AP":"44.2"},"uses_additional_data":true},{"leaderboard":"/sota/instance-segmentation-on-coco","task":"Instance Segmentation","dataset":"COCO test-dev","model":"iBOT (ViT-S/16)","rank_in_archive_order":53,"of":112,"metrics":{"mask AP":"42.6"},"uses_additional_data":true},{"leaderboard":"/sota/object-detection-on-coco","task":"Object Detection","dataset":"COCO test-dev","model":"iBOT (ViT-B/16)","rank_in_archive_order":84,"of":225,"metrics":{"box mAP":"51.2"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco","task":"Object Detection","dataset":"COCO test-dev","model":"iBOT (ViT-S/16)","rank_in_archive_order":97,"of":225,"metrics":{"box mAP":"49.4"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-image-classification-on","task":"Self-Supervised Image Classification","dataset":"ImageNet","model":"iBOT (ViT-L/16) (IN22k)","rank_in_archive_order":11,"of":144,"metrics":{"Number of Params":"307M","Top 1 Accuracy":"82.3%"},"uses_additional_data":true},{"leaderboard":"/sota/self-supervised-image-classification-on","task":"Self-Supervised Image Classification","dataset":"ImageNet","model":"iBOT (ViT-L/16)","rank_in_archive_order":16,"of":144,"metrics":{"Number of Params":"307M","Top 1 Accuracy":"81.3%"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"iBOT(ViT-L/16, 512)","rank_in_archive_order":8,"of":65,"metrics":{"Number of Params":"307M","Top 1 Accuracy":"87.8%"},"uses_additional_data":true},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"iBOT(ViT-L/16)","rank_in_archive_order":12,"of":65,"metrics":{"Number of Params":"307M","Top 1 Accuracy":"86.6%"},"uses_additional_data":true},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"iBOT (ViT-L/16)","rank_in_archive_order":26,"of":65,"metrics":{"Number of Params":"307M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"iBOT (ViT-B/16)","rank_in_archive_order":31,"of":65,"metrics":{"Number of Params":"85M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"iBOT (ViT-B/16)","rank_in_archive_order":39,"of":65,"metrics":{"Number of Params":"85M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-ade20k","task":"Semantic Segmentation","dataset":"ADE20K","model":"iBOT (ViT-B/16)","rank_in_archive_order":122,"of":235,"metrics":{"Validation mIoU":"50.0"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-ade20k","task":"Semantic Segmentation","dataset":"ADE20K","model":"iBOT (ViT-S/16)","rank_in_archive_order":191,"of":235,"metrics":{"Validation mIoU":"45.4"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-ade20k","task":"Semantic Segmentation","dataset":"ADE20K","model":"iBOT (ViT-B/16) (linear head)","rank_in_archive_order":223,"of":235,"metrics":{"Validation mIoU":"38.3"},"uses_additional_data":false},{"leaderboard":"/sota/semi-supervised-image-classification-on-1","task":"Semi-Supervised Image Classification","dataset":"ImageNet - 1% labeled data","model":"iBOT (ViT-S/16)","rank_in_archive_order":37,"of":65,"metrics":{"Top 1 Accuracy":"61.9%"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-image-classification-on-imagenet","task":"Unsupervised Image Classification","dataset":"ImageNet","model":"iBOT (ViT-S/16)","rank_in_archive_order":4,"of":9,"metrics":{"ARI":"32.8","Accuracy (%)":"43.4"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2111.07832","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.07832"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/bytedance/ibot","reach":null},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://gitlab.com/birder/birder","reach":null}],"summary":{"unverified":1},"by_repo_kind":{"official":{"samples":1,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"14b1b82d605701ac","entry":"knn_classifier","repo":"bytedance/ibot","repo_kind":"official","path":"evaluation/eval_knn.py","file_url":"https://github.com/bytedance/ibot/blob/HEAD/evaluation/eval_knn.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"14b1b82d605701ac"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}