{"url":"/method/vl-t5","slug":"vl-t5","name":"VL-T5","full_name":"VL-T5","full_name_withheld":false,"description_markdown":"VL-T5 is a unified framework that learns different tasks in a single architecture with the same language modeling objective, i.e., multimodal conditional text generation. The model learns to generate labels in text based on the visual and textual inputs. In contrast to other existing methods, the framework unifies tasks as generating text labels conditioned on multimodal inputs. This allows the model to tackle vision-and-language tasks with unified text generation objective. The models use text prefixes to adapt to different tasks.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Unifying Vision-and-Language Tasks via Text Generation","paper":"/paper/unifying-vision-and-language-tasks-via-text","first_author":"Jaemin Cho","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/unifying-vision-and-language-tasks-via-text"},"source":{"url":"https://arxiv.org/abs/2102.02779v2","title":"Unifying Vision-and-Language Tasks via Text Generation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision and Language Pre-Trained Models","url":"/methods/category/vision-and-language-pre-trained-models","pwc_aliases":[]}],"n_papers_tagged":5,"archive_num_papers":5,"papers_newest_first":[{"paper":null,"title":"Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering","date":"2024-06-03","arxiv_id":"2406.01402","n_code_links":0,"syntology":null},{"paper":"/paper/visual-spatial-description-controlled-spatial","title":"Visual Spatial Description: Controlled Spatial-Oriented Image-to-Text Generation","date":"2022-10-20","arxiv_id":"2210.11109","n_code_links":1,"syntology":null},{"paper":"/paper/webly-supervised-concept-expansion-for","title":"Webly Supervised Concept Expansion for General Purpose Vision Models","date":"2022-02-04","arxiv_id":"2202.02317","n_code_links":0,"syntology":null},{"paper":"/paper/vl-adapter-parameter-efficient-transfer","title":"VL-Adapter: Parameter-Efficient Transfer Learning for Vision-and-Language Tasks","date":"2021-12-13","arxiv_id":"2112.06825","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":"/paper/unifying-vision-and-language-tasks-via-text","title":"Unifying Vision-and-Language Tasks via Text Generation","date":"2021-02-04","arxiv_id":"2102.02779","n_code_links":2,"syntology":{"ran":2,"of":12,"unverified":10,"pointer_only":0}}],"papers_shown":5,"tasks":[{"task":"/task/image-captioning","name":"Image Captioning","papers":3},{"task":"/task/visual-question-answering","name":"Visual Question Answering (VQA)","papers":3},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":"/task/question-answering","name":"Question Answering","papers":2},{"task":"/task/referring-expression-comprehension","name":"Referring Expression Comprehension","papers":2},{"task":"/task/text-generation","name":"Text Generation","papers":2},{"task":"/task/visual-question-answering-1","name":"Visual Question Answering","papers":2},{"task":"/task/conditional-text-generation","name":"Conditional Text Generation","papers":1},{"task":"/task/diversity","name":"Diversity","papers":1},{"task":"/task/human-object-interaction-detection","name":"Human-Object Interaction Detection","papers":1},{"task":null,"name":"Image Description","papers":1},{"task":"/task/image-retrieval","name":"Image Retrieval","papers":1},{"task":"/task/image-to-text","name":"Image to text","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/multi-task-learning","name":"Multi-Task Learning","papers":1},{"task":"/task/object-categorization","name":"Object Categorization","papers":1},{"task":"/task/object-localization","name":"Object Localization","papers":1},{"task":"/task/referring-expression","name":"Referring Expression","papers":1},{"task":"/task/retrieval","name":"Retrieval","papers":1}],"tasks_shown":20,"n_tasks":22,"usage_by_year":[{"year":"2021","papers":2},{"year":"2022","papers":2},{"year":"2024","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/vl-t5"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}