{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/cosa-concatenated-sample-pretrained-vision","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","arxiv_id":"2306.09085","date":"2023-06-15","proceeding":null,"authors":["Sihan Chen","Xingjian He","Handong Li","Xiaojie Jin","Jiashi Feng","Jing Liu"],"abstract":"Due to the limited scale and quality of video-text training corpus, most vision-language foundation models employ image-text datasets for pretraining and primarily focus on modeling visually semantic representations while disregarding temporal semantic representations and correlations. To address this issue, we propose COSA, a COncatenated SAmple pretrained vision-language foundation model. COSA jointly models visual contents and event-level temporal cues using only image-text corpora. We achieve this by sequentially concatenating multiple image-text pairs as inputs for pretraining. This transformation effectively converts existing image-text corpora into a pseudo long-form video-paragraph corpus, enabling richer scene transformations and explicit event-description correspondence. Extensive experiments demonstrate that COSA consistently improves performance across a broad range of downstream tasks, including long-form/short-form video-text tasks and image-text tasks such as retrieval, captioning, and question answering. Notably, COSA achieves state-of-the-art results on various competitive benchmarks. Code and model are released at https://github.com/TXH-mercury/COSA.","url_abs":"https://arxiv.org/abs/2306.09085v1","url_pdf":"https://arxiv.org/pdf/2306.09085v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"cosa-concatenated-sample-pretrained-vision","repo_url":"https://github.com/txh-mercury/cosa","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"form","task_name":"Form"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"tgif-frame","task_name":"TGIF-Frame"},{"task_slug":"video-captioning","task_name":"Video Captioning"},{"task_slug":"video-captioning-on-msr-vtt","task_name":"Video Captioning on MSR-VTT"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"video-retrieval","task_name":"Video Retrieval"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"model","task_name":"model"}],"methods":[{"method_slug":"focus","method_name":"Focus"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/video-captioning-on-msr-vtt-1","task":"Video Captioning","dataset":"MSR-VTT","model":"COSA","rank_in_archive_order":5,"of":24,"metrics":{"BLEU-4":"53.7","CIDEr":"74.7"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-msvd-1","task":"Video Captioning","dataset":"MSVD","model":"COSA","rank_in_archive_order":4,"of":16,"metrics":{"BLEU-4":"76.5","CIDEr":"178.5"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-tvc","task":"Video Captioning","dataset":"TVC","model":"COSA","rank_in_archive_order":2,"of":2,"metrics":{"BLEU-4":"18.8","CIDEr":"70.7"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-vatex-1","task":"Video Captioning","dataset":"VATEX","model":"COSA","rank_in_archive_order":3,"of":10,"metrics":{"BLEU-4":"43.7","CIDEr":"96.5"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-youcook2","task":"Video Captioning","dataset":"YouCook2","model":"COSA","rank_in_archive_order":9,"of":14,"metrics":{"BLEU-4":"10.1","CIDEr":"1.31"},"uses_additional_data":true},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"COSA","rank_in_archive_order":6,"of":36,"metrics":{"Accuracy":"49.9"},"uses_additional_data":true},{"leaderboard":"/sota/video-question-answering-on-msrvtt-qa","task":"Video Question Answering","dataset":"MSRVTT-QA","model":"COSA","rank_in_archive_order":4,"of":14,"metrics":{"Accuracy":"49.2"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-activitynet","task":"Video Retrieval","dataset":"ActivityNet","model":"COSA","rank_in_archive_order":5,"of":31,"metrics":{"text-to-video R@1":"67.3"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-didemo","task":"Video Retrieval","dataset":"DiDeMo","model":"COSA","rank_in_archive_order":4,"of":40,"metrics":{"text-to-video R@1":"70.5"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-lsmdc","task":"Video Retrieval","dataset":"LSMDC","model":"COSA","rank_in_archive_order":5,"of":38,"metrics":{"text-to-video R@1":"39.4"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-msr-vtt","task":"Video Retrieval","dataset":"MSR-VTT","model":"COSA","rank_in_archive_order":7,"of":40,"metrics":{"text-to-video R@1":"57.9"},"uses_additional_data":true},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-1","task":"Visual Question Answering (VQA)","dataset":"MSVD-QA","model":"COSA","rank_in_archive_order":6,"of":36,"metrics":{"Accuracy":"0.60"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}