{"url":"/task/video-retrieval","name":"Video Retrieval","slug":"video-retrieval","description_markdown":"The objective of video retrieval is as follows: given a text query and a pool of candidate videos, select the video which corresponds to the text query.  Typically, the videos are returned as a ranked list of candidates and scored via document retrieval metrics.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":486,"papers_with_code":255,"benchmarks":19,"benchmark_tables_in_archive":19,"benchmark_tables_shown":19,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":35,"subtasks":5,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/video-retrieval-on-msr-vtt-1ka","slug":"video-retrieval-on-msr-vtt-1ka","dataset":"MSR-VTT-1kA","dataset_url":"/dataset/msr-vtt","rows_in_archive":63,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank"],"first_row_in_archive_order":{"model":"HunYuan_tvr (huge)","paper_title":"Tencent Text-Video Retrieval: Hierarchical Cross-Modal Interactions with Multi-Level Representations","paper_url":"/paper/hunyuan-tvr-for-text-video-retrivial","paper_date":"2022-04-07","arxiv_id":"2204.03382","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-didemo","slug":"video-retrieval-on-didemo","dataset":"DiDeMo","dataset_url":"/dataset/didemo","rows_in_archive":40,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video R@50","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank","text-to-videoR@1"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-msr-vtt","slug":"video-retrieval-on-msr-vtt","dataset":"MSR-VTT","dataset_url":"/dataset/msr-vtt","rows_in_archive":40,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Mean Rank","text-to-video Median Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank","text-to-video MedianR","text-to-videoMedian Rank"],"first_row_in_archive_order":{"model":"GRAM","paper_title":"Gramian Multimodal Representation Learning and Alignment","paper_url":"/paper/gramian-multimodal-representation-learning","paper_date":"2024-12-16","arxiv_id":"2412.11959","code_links":[{"title":"ispamm/GRAM","url":"https://github.com/ispamm/GRAM"},{"title":"luigisigillo/gwit","url":"https://github.com/luigisigillo/gwit"}],"syntology":{"n":12,"n_ran":2,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-lsmdc","slug":"video-retrieval-on-lsmdc","dataset":"LSMDC","dataset_url":"/dataset/lsmdc","rows_in_archive":38,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@10","video-to-text R@5","video-to-text Median Rank","video-to-text Mean Rank"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-activitynet","slug":"video-retrieval-on-activitynet","dataset":"ActivityNet","dataset_url":"/dataset/activitynet","rows_in_archive":31,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video R@50","text-to-video Mean Rank","text-to-video Median Rank","video-to-text R@1","video-to-text R@5","video-to-text Mean Rank","video-to-text Median Rank","video-to-text R@10","video-to-text R@50"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-msvd","slug":"video-retrieval-on-msvd","dataset":"MSVD","dataset_url":"/dataset/msvd","rows_in_archive":24,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","text-to-video R@50","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-fivr-200k","slug":"video-retrieval-on-fivr-200k","dataset":"FIVR-200K","dataset_url":"/dataset/fivr-200k","rows_in_archive":17,"metrics":["mAP (ISVR)","mAP (CSVR)","mAP (DSVR)"],"first_row_in_archive_order":{"model":"S2VS","paper_title":"Self-Supervised Video Similarity Learning","paper_url":"/paper/self-supervised-video-similarity-learning","paper_date":"2023-04-06","arxiv_id":"2304.03378","code_links":[{"title":"gkordo/s2vs","url":"https://github.com/gkordo/s2vs"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-youcook2","slug":"video-retrieval-on-youcook2","dataset":"YouCook2","dataset_url":"/dataset/youcook2","rows_in_archive":16,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank"],"first_row_in_archive_order":{"model":"VAST","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","paper_date":"2023-05-29","arxiv_id":"2305.18500","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-vatex","slug":"video-retrieval-on-vatex","dataset":"VATEX","dataset_url":"/dataset/vatex","rows_in_archive":13,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video R@50","text-to-video MedianR","text-to-video MeanR","video-to-text R@1","video-to-text R@10"],"first_row_in_archive_order":{"model":"GRAM","paper_title":"Gramian Multimodal Representation Learning and Alignment","paper_url":"/paper/gramian-multimodal-representation-learning","paper_date":"2024-12-16","arxiv_id":"2412.11959","code_links":[{"title":"ispamm/GRAM","url":"https://github.com/ispamm/GRAM"},{"title":"luigisigillo/gwit","url":"https://github.com/luigisigillo/gwit"}],"syntology":{"n":12,"n_ran":2,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-queryd","slug":"video-retrieval-on-queryd","dataset":"QuerYD","dataset_url":"/dataset/queryd","rows_in_archive":5,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10"],"first_row_in_archive_order":{"model":"TESTA (ViT-B/16)","paper_title":"TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding","paper_url":"/paper/testa-temporal-spatial-token-aggregation-for","paper_date":"2023-10-29","arxiv_id":"2310.19060","code_links":[{"title":"renshuhuai-andy/testa","url":"https://github.com/renshuhuai-andy/testa"}],"syntology":{"n":15,"n_ran":11,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-ssv2-label-retrieval","slug":"video-retrieval-on-ssv2-label-retrieval","dataset":"SSv2-label retrieval","dataset_url":null,"rows_in_archive":5,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10"],"first_row_in_archive_order":{"model":"UMT-L (ViT-L/16)","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","paper_url":"/paper/unmasked-teacher-towards-training-efficient","paper_date":"2023-03-28","arxiv_id":"2303.16058","code_links":[{"title":"opengvlab/unmasked_teacher","url":"https://github.com/opengvlab/unmasked_teacher"}],"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-ssv2-template-retrieval","slug":"video-retrieval-on-ssv2-template-retrieval","dataset":"SSv2-template retrieval","dataset_url":null,"rows_in_archive":5,"metrics":["text-to-video R@1","text-to-video R@10","text-to-video R@5"],"first_row_in_archive_order":{"model":"UMT-L (ViT-L/16)","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","paper_url":"/paper/unmasked-teacher-towards-training-efficient","paper_date":"2023-03-28","arxiv_id":"2303.16058","code_links":[{"title":"opengvlab/unmasked_teacher","url":"https://github.com/opengvlab/unmasked_teacher"}],"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-condensed-movies","slug":"video-retrieval-on-condensed-movies","dataset":"Condensed Movies","dataset_url":"/dataset/condensed-movies","rows_in_archive":3,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10"],"first_row_in_archive_order":{"model":"TESTA (ViT-B/16)","paper_title":"TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding","paper_url":"/paper/testa-temporal-spatial-token-aggregation-for","paper_date":"2023-10-29","arxiv_id":"2310.19060","code_links":[{"title":"renshuhuai-andy/testa","url":"https://github.com/renshuhuai-andy/testa"}],"syntology":{"n":15,"n_ran":11,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-egoexolearn","slug":"video-retrieval-on-egoexolearn","dataset":"EgoExoLearn","dataset_url":"/dataset/egoexolearn","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"cross-view association baseline (gaze, val)","paper_title":"EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World","paper_url":"/paper/egoexolearn-a-dataset-for-bridging","paper_date":"2024-03-24","arxiv_id":"2403.16182","code_links":[{"title":"opengvlab/egoexolearn","url":"https://github.com/opengvlab/egoexolearn"}],"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/video-retrieval-on-tgif","slug":"video-retrieval-on-tgif","dataset":"TGIF","dataset_url":"/dataset/tgif","rows_in_archive":2,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Mean Rank","text-to-video Median Rank"],"first_row_in_archive_order":{"model":"MDMMT-2","paper_title":"MDMMT-2: Multidomain Multimodal Transformer for Video Retrieval, One More Step Towards Generalization","paper_url":"/paper/mdmmt-2-multidomain-multimodal-transformer","paper_date":"2022-03-14","arxiv_id":"2203.07086","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-tvr","slug":"video-retrieval-on-tvr","dataset":"TVR","dataset_url":"/dataset/tvr","rows_in_archive":2,"metrics":["R@10","R@1","R@100"],"first_row_in_archive_order":{"model":"Hero w/ pre-training","paper_title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","paper_url":"/paper/hero-hierarchical-encoder-for-video-language","paper_date":"2020-05-01","arxiv_id":"2005.00200","code_links":[{"title":"linjieli222/HERO","url":"https://github.com/linjieli222/HERO"},{"title":"linjieli222/hero_video_feature_extractor","url":"https://github.com/linjieli222/hero_video_feature_extractor"},{"title":"grounded-sport-convai/goal-baselines","url":"https://gitlab.com/grounded-sport-convai/goal-baselines"}],"syntology":{"n":13,"n_ran":5,"n_unverified":8,"n_pointer_only":8}}},{"leaderboard":"/sota/video-retrieval-on-charades-sta","slug":"video-retrieval-on-charades-sta","dataset":"Charades-STA","dataset_url":"/dataset/charades-sta","rows_in_archive":1,"metrics":["text-to-video Mean Rank","text-to-video Median Rank","text-to-video R@1","text-to-video R@10","video-to-text Mean Rank","video-to-text Median Rank","video-to-text R@1","video-to-text R@10"],"first_row_in_archive_order":{"model":"PO Loss","paper_title":"Rudder: A Cross Lingual Video and Text Retrieval Dataset","paper_url":"/paper/rudder-a-cross-lingual-video-and-text","paper_date":"2021-03-09","arxiv_id":"2103.05457","code_links":[{"title":"nshubham655/RUDDER","url":"https://github.com/nshubham655/RUDDER"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-msvd-indonesian","slug":"video-retrieval-on-msvd-indonesian","dataset":"MSVD-Indonesian","dataset_url":"/dataset/msvd-indonesian","rows_in_archive":1,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank"],"first_row_in_archive_order":{"model":"X-CLIP (Cross-Lingual)","paper_title":"MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian","paper_url":"/paper/msvd-indonesian-a-benchmark-for-multimodal","paper_date":"2023-06-20","arxiv_id":"2306.11341","code_links":[{"title":"willyfh/msvd-indonesian","url":"https://github.com/willyfh/msvd-indonesian"}],"syntology":null}},{"leaderboard":"/sota/video-retrieval-on-rudder","slug":"video-retrieval-on-rudder","dataset":"RUDDER","dataset_url":null,"rows_in_archive":1,"metrics":["text-to-video Mean Rank","text-to-video Median Rank","text-to-video R@1","text-to-video R@10","text-to-video R@5","text-to-video R@50","video-to-text Mean Rank","video-to-text Median Rank","video-to-text R@1","video-to-text R@10","video-to-text R@5"],"first_row_in_archive_order":{"model":"PO Loss","paper_title":"Rudder: A Cross Lingual Video and Text Retrieval Dataset","paper_url":"/paper/rudder-a-cross-lingual-video-and-text","paper_date":"2021-03-09","arxiv_id":"2103.05457","code_links":[{"title":"nshubham655/RUDDER","url":"https://github.com/nshubham655/RUDDER"}],"syntology":null}}],"datasets":[{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/activitynet","name":"ActivityNet","full_name":"","num_papers_in_archive":807},{"url":"/dataset/msr-vtt","name":"MSR-VTT","full_name":"","num_papers_in_archive":640},{"url":"/dataset/msvd","name":"MSVD","full_name":"Microsoft Research Video Description Corpus","num_papers_in_archive":327},{"url":"/dataset/howto100m","name":"HowTo100M","full_name":"HowTo100M","num_papers_in_archive":286},{"url":"/dataset/webvid","name":"WebVid","full_name":"","num_papers_in_archive":257},{"url":"/dataset/charades-sta","name":"Charades-STA","full_name":"","num_papers_in_archive":236},{"url":"/dataset/didemo","name":"DiDeMo","full_name":"Distinct Describable Moments","num_papers_in_archive":216},{"url":"/dataset/youcook2","name":"YouCook2","full_name":"","num_papers_in_archive":198},{"url":"/dataset/lsmdc","name":"LSMDC","full_name":"Large Scale Movie Description Challenge","num_papers_in_archive":126},{"url":"/dataset/vatex","name":"VATEX","full_name":"Video And TEXt","num_papers_in_archive":118},{"url":"/dataset/tgif","name":"TGIF","full_name":"Tumblr GIF","num_papers_in_archive":51},{"url":"/dataset/tvr","name":"TVR","full_name":"TV show Retrieval","num_papers_in_archive":34},{"url":"/dataset/how2qa","name":"How2QA","full_name":"How2QA","num_papers_in_archive":28},{"url":"/dataset/cmd","name":"CMD","full_name":"Condensed Movies Dataset","num_papers_in_archive":19},{"url":"/dataset/violin","name":"Violin","full_name":"VIdeO-and-Language INference","num_papers_in_archive":18},{"url":"/dataset/fivr-200k","name":"FIVR-200K","full_name":"","num_papers_in_archive":16},{"url":"/dataset/tvc","name":"TVC","full_name":"TV show Captions","num_papers_in_archive":16},{"url":"/dataset/condensed-movies","name":"Condensed Movies","full_name":"","num_papers_in_archive":15},{"url":"/dataset/queryd","name":"QuerYD","full_name":"","num_papers_in_archive":15},{"url":"/dataset/egoexolearn","name":"EgoExoLearn","full_name":"","num_papers_in_archive":12},{"url":"/dataset/how2r","name":"How2R","full_name":"How2R","num_papers_in_archive":9},{"url":"/dataset/marine-video-kit","name":"MVK","full_name":"Marine Video Kit","num_papers_in_archive":9},{"url":"/dataset/hirest","name":"HiREST","full_name":"HIerarchical REtrieval and STep-captioning","num_papers_in_archive":7},{"url":"/dataset/chronomagic","name":"ChronoMagic","full_name":"","num_papers_in_archive":5},{"url":"/dataset/shot2story20k","name":"Shot2Story20K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/chronomagic-pro","name":"ChronoMagic-Pro","full_name":"","num_papers_in_archive":2},{"url":"/dataset/vtc","name":"VTC","full_name":"Videos, Titles and Comments","num_papers_in_archive":2},{"url":"/dataset/chronomagic-proh","name":"ChronoMagic-ProH","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ikea-assembly-in-the-wild-dataset","name":"IAW Dataset","full_name":"Ikea Assembly In The Wild Dataset","num_papers_in_archive":1},{"url":"/dataset/kinetic-gebc","name":"Kinetics-GEB+","full_name":"","num_papers_in_archive":1},{"url":"/dataset/msvd-indonesian","name":"MSVD-Indonesian","full_name":"","num_papers_in_archive":1},{"url":"/dataset/stvd","name":"STVD-PVCD","full_name":"Partial Video Copy Detection Dataset","num_papers_in_archive":1},{"url":"/dataset/vilt","name":"VILT","full_name":"Video Instructions Linking for Complex Tasks","num_papers_in_archive":1},{"url":"/dataset/win-fail-action-understanding","name":"Win-Fail Action Understanding","full_name":"Win-Fail Action Understanding","num_papers_in_archive":1}],"subtasks":[{"url":"/task/composed-video-retrieval-covr","name":"Composed Video Retrieval (CoVR)"},{"url":"/task/replay-grounding","name":"Replay Grounding"},{"url":"/task/video-adverb-retrieval","name":"Video-Adverb Retrieval"},{"url":"/task/video-grounding","name":"Video Grounding"},{"url":"/task/video-text-retrieval","name":"Video-Text Retrieval"}],"parent_tasks":[{"url":"/task/video","name":"Video"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":255,"tagged_in_all":486,"items":[{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/eco-efficient-convolutional-network-for","title":"ECO: Efficient Convolutional Network for Online Video Understanding","date":"2018-04-24","arxiv_id":"1804.09066","repositories_listed":6,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/vatt-transformers-for-multimodal-self","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","date":"2021-04-22","arxiv_id":"2104.11178","repositories_listed":5,"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":8}},{"url":"/paper/clip4clip-an-empirical-study-of-clip-for-end","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","date":"2021-04-18","arxiv_id":"2104.08860","repositories_listed":5,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/frozen-in-time-a-joint-video-and-image","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","date":"2021-04-01","arxiv_id":"2104.00650","repositories_listed":5,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/learning-a-text-video-embedding-from","title":"Learning a Text-Video Embedding from Incomplete and Heterogeneous Data","date":"2018-04-07","arxiv_id":"1804.02516","repositories_listed":5,"syntology":null},{"url":"/paper/text-video-retrieval-with-disentangled","title":"Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment","date":"2023-05-20","arxiv_id":"2305.12218","repositories_listed":4,"syntology":{"n":23,"n_ran":9,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/video-text-as-game-players-hierarchical","title":"Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation Learning","date":"2023-03-25","arxiv_id":"2303.14369","repositories_listed":4,"syntology":{"n":16,"n_ran":11,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/diffusionret-generative-text-video-retrieval","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","date":"2023-03-17","arxiv_id":"2303.09867","repositories_listed":4,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","arxiv_id":"2302.00402","repositories_listed":4,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/cap4video-what-can-auxiliary-captions-do-for","title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","date":"2022-12-31","arxiv_id":"2301.00184","repositories_listed":4,"syntology":{"n":25,"n_ran":14,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/expectation-maximization-contrastive-learning","title":"Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations","date":"2022-11-21","arxiv_id":"2211.11427","repositories_listed":4,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/end-to-end-learning-of-visual-representations","title":"End-to-End Learning of Visual Representations from Uncurated Instructional Videos","date":"2019-12-13","arxiv_id":"1912.06430","repositories_listed":4,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/howto100m-learning-a-text-video-embedding-by","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","date":"2019-06-07","arxiv_id":"1906.03327","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/dense-captioning-events-in-videos","title":"Dense-Captioning Events in Videos","date":"2017-05-02","arxiv_id":"1705.00754","repositories_listed":4,"syntology":null},{"url":"/paper/tvlt-textless-vision-language-transformer","title":"TVLT: Textless Vision-Language Transformer","date":"2022-09-28","arxiv_id":"2209.14156","repositories_listed":3,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/x-clip-end-to-end-multi-grained-contrastive","title":"X-CLIP: End-to-End Multi-grained Contrastive Learning for Video-Text Retrieval","date":"2022-07-15","arxiv_id":"2207.07285","repositories_listed":3,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/mdmmt-multidomain-multimodal-transformer-for","title":"MDMMT: Multidomain Multimodal Transformer for Video Retrieval","date":"2021-03-19","arxiv_id":"2103.10699","repositories_listed":3,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/on-semantic-similarity-in-video-retrieval","title":"On Semantic Similarity in Video Retrieval","date":"2021-03-18","arxiv_id":"2103.10095","repositories_listed":3,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/hero-hierarchical-encoder-for-video-language","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","date":"2020-05-01","arxiv_id":"2005.00200","repositories_listed":3,"syntology":{"n":13,"n_ran":5,"n_unverified":8,"n_pointer_only":8}},{"url":"/paper/use-what-you-have-video-retrieval-using","title":"Use What You Have: Video Retrieval Using Representations From Collaborative Experts","date":"2019-07-31","arxiv_id":"1907.13487","repositories_listed":3,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":1}},{"url":"/paper/improving-mae-against-cce-under-label-noise","title":"IMAE for Noise-Robust Learning: Mean Absolute Error Does Not Treat Examples Equally and Gradient Magnitude's Variance Matters","date":"2019-03-28","arxiv_id":"1903.12141","repositories_listed":3,"syntology":null},{"url":"/paper/gramian-multimodal-representation-learning","title":"Gramian Multimodal Representation Learning and Alignment","date":"2024-12-16","arxiv_id":"2412.11959","repositories_listed":2,"syntology":{"n":12,"n_ran":2,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/contextiq-a-multimodal-expert-based-video","title":"ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising","date":"2024-10-29","arxiv_id":"2410.22233","repositories_listed":2,"syntology":null},{"url":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","arxiv_id":"2403.15377","repositories_listed":2,"syntology":null},{"url":"/paper/dgl-dynamic-global-local-prompt-tuning-for","title":"DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval","date":"2024-01-19","arxiv_id":"2401.10588","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/rtq-rethinking-video-language-understanding","title":"RTQ: Rethinking Video-language Understanding Based on Image-text Model","date":"2023-12-01","arxiv_id":"2312.00347","repositories_listed":2,"syntology":null},{"url":"/paper/side4video-spatial-temporal-side-network-for","title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","date":"2023-11-27","arxiv_id":"2311.15769","repositories_listed":2,"syntology":null},{"url":"/paper/learning-multi-modal-representations-by","title":"Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures","date":"2023-07-27","arxiv_id":"2307.15220","repositories_listed":2,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/icsvr-investigating-compositional-and","title":"ICSVR: Investigating Compositional and Syntactic Understanding in Video Retrieval Models","date":"2023-06-28","arxiv_id":"2306.16533","repositories_listed":2,"syntology":null}],"syntology_records":22,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}