{"url":"/method/vokenization","slug":"vokenization","name":"Vokenization","full_name":"Vokenization","full_name_withheld":false,"description_markdown":"**Vokenization** is an approach for extrapolating multimodal alignments to language-only data by contextually mapping language tokens to their related images (\"vokens\") by retrieval. Instead of directly supervising the language model with visually grounded language datasets (e.g., MS COCO) these relative small datasets are used to train the vokenization processor (i.e. the vokenizer). Vokens are generated for large language corpora (e.g., English Wikipedia), and the visually-supervised language model takes the\r\ninput supervision from these large datasets, thus bridging the gap between different data sources.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision","paper":"/paper/vokenization-improving-language-understanding","first_author":"Hao Tan","n_authors":2,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/vokenization-improving-language-understanding"},"source":{"url":"https://arxiv.org/abs/2010.06775v1","title":"Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Multi-Modal Methods","url":"/methods/category/multi-modal-methods","pwc_aliases":[]}],"n_papers_tagged":3,"archive_num_papers":3,"papers_newest_first":[{"paper":"/paper/lexicon-level-contrastive-visual-grounding","title":"Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling","date":"2024-03-21","arxiv_id":"2403.14551","n_code_links":2,"syntology":null},{"paper":"/paper/vidlankd-improving-language-understanding-via","title":"VidLanKD: Improving Language Understanding via Video-Distilled Knowledge Transfer","date":"2021-07-06","arxiv_id":"2107.02681","n_code_links":1,"syntology":null},{"paper":"/paper/vokenization-improving-language-understanding","title":"Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision","date":"2020-10-14","arxiv_id":"2010.06775","n_code_links":1,"syntology":{"ran":0,"of":7,"unverified":7,"pointer_only":0}}],"papers_shown":3,"tasks":[{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/language-modelling","name":"Language Modelling","papers":3},{"task":"/task/visual-grounding","name":"Visual Grounding","papers":2},{"task":"/task/grounded-language-learning","name":"Grounded language learning","papers":1},{"task":"/task/image-captioning","name":"Image Captioning","papers":1},{"task":"/task/image-retrieval","name":"Image Retrieval","papers":1},{"task":"/task/knowledge-distillation","name":"Knowledge Distillation","papers":1},{"task":"/task/language-acquisition","name":"Language Acquisition","papers":1},{"task":"/task/retrieval","name":"Retrieval","papers":1},{"task":"/task/sentence","name":"Sentence","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/video-grounding","name":"Video Grounding","papers":1},{"task":"/task/world-knowledge","name":"World Knowledge","papers":1}],"tasks_shown":13,"n_tasks":13,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":1},{"year":"2024","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/vokenization"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}