{"url":"/dataset/msr-vtt","name":"MSR-VTT","full_name":null,"description_markdown":"**MSR-VTT** (Microsoft Research Video to Text) is a large-scale dataset for the open domain video captioning, which consists of 10,000 video clips from 20 categories, and each video clip is annotated with 20 English sentences by Amazon Mechanical Turks. There are about 29,000 unique words in all captions. The standard splits uses 6,513 clips for training, 497 clips for validation, and 2,990 clips for testing.\r\n\r\nSource: [Learning to Discretely Compose Reasoning Module Networksfor Video Captioning](https://arxiv.org/abs/2007.09049)","description_withheld":null,"homepage":"https://www.microsoft.com/en-us/research/publication/msr-vtt-a-large-video-description-dataset-for-bridging-video-and-language/","introduced_date":"2016-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/msr-vtt-a-large-video-description-dataset-for","title":"MSR-VTT: A Large Video Description Dataset for Bridging Video and Language","first_author":"Jun Xu","url":null},"license":{"name":"Unknown","url":null},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Video Question Answering","url":"/task/video-question-answering","datasets_with_task":"/datasets/task/video-question-answering"},{"name":"Video Retrieval","url":"/task/video-retrieval","datasets_with_task":"/datasets/task/video-retrieval"},{"name":"Video Captioning","url":"/task/video-captioning","datasets_with_task":"/datasets/task/video-captioning"},{"name":"Video Generation","url":"/task/video-generation","datasets_with_task":"/datasets/task/video-generation"},{"name":"Zero-Shot Video Retrieval","url":"/task/zero-shot-video-retrieval","datasets_with_task":"/datasets/task/zero-shot-video-retrieval"},{"name":"Text-to-Video Generation","url":"/task/text-to-video-generation","datasets_with_task":"/datasets/task/text-to-video-generation"},{"name":"Text to Video Retrieval","url":"/task/text-to-video-retrieval","datasets_with_task":"/datasets/task/text-to-video-retrieval"},{"name":"Zero-Shot Video-Audio Retrieval","url":"/task/zero-shot-video-audio-retrieval","datasets_with_task":"/datasets/task/zero-shot-video-audio-retrieval"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["MSR-VTT","MSR-VTT-1kA","MSRVTT"],"data_loaders":[{"repo":"https://github.com/Ishihara-Masabumi/Image_Generation_by_DiT","url":"https://github.com/Ishihara-Masabumi/Image_Generation_by_DiT","frameworks":["tf","pytorch"]}],"num_papers_in_archive":640,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/video-retrieval-on-msr-vtt-1ka","task":"Video Retrieval","dataset_variant":"MSR-VTT-1kA","rows":63,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank"],"first_row_in_archive_order":{"model":"HunYuan_tvr (huge)","paper":"/paper/hunyuan-tvr-for-text-video-retrivial","metrics":{"text-to-video Mean Rank":"9.3 ","text-to-video Median Rank":"1.0","text-to-video R@1":"62.9","text-to-video R@10":"90.8","text-to-video R@5":"84.5","video-to-text Mean Rank":"5.5","video-to-text Median Rank":"1.0","video-to-text R@1":"64.8","video-to-text R@10":"91.1","video-to-text R@5":"84.9"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/zero-shot-video-retrieval-on-msr-vtt","task":"Zero-Shot Video Retrieval","dataset_variant":"MSR-VTT","rows":41,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Median Rank","text-to-video Mean Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper":"/paper/internvideo2-scaling-video-foundation-models","metrics":{"text-to-video R@1":"55.9","text-to-video R@10":"85.1","text-to-video R@5":"78.3","video-to-text R@1":"53.7","video-to-text R@10":"84.1","video-to-text R@5":"77.5"},"code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-retrieval-on-msr-vtt","task":"Video Retrieval","dataset_variant":"MSR-VTT","rows":40,"metrics":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video Mean Rank","text-to-video Median Rank","video-to-text R@1","video-to-text R@5","video-to-text R@10","video-to-text Median Rank","video-to-text Mean Rank","text-to-video MedianR","text-to-videoMedian Rank"],"first_row_in_archive_order":{"model":"GRAM","paper":"/paper/gramian-multimodal-representation-learning","metrics":{"text-to-video R@1":"64","text-to-video R@10":"89.3","video-to-text R@1":"64.8","video-to-text R@10":"91.5"},"code_links":[{"title":"ispamm/GRAM","url":"https://github.com/ispamm/GRAM"},{"title":"luigisigillo/gwit","url":"https://github.com/luigisigillo/gwit"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-captioning-on-msr-vtt-1","task":"Video Captioning","dataset_variant":"MSR-VTT","rows":24,"metrics":["CIDEr","METEOR","ROUGE-L","BLEU-4","GS"],"first_row_in_archive_order":{"model":"mPLUG-2","paper":"/paper/mplug-2-a-modularized-multi-modal-foundation","metrics":{"BLEU-4":"57.8","CIDEr":"80.0","METEOR":"34.9","ROUGE-L":"70.1"},"code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"x-plug/mplug-owl","url":"https://github.com/x-plug/mplug-owl"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind"},{"title":"X-PLUG/mPLUG-2","url":"https://github.com/X-PLUG/mPLUG-2"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/text-to-video-generation-on-msr-vtt","task":"Text-to-Video Generation","dataset_variant":"MSR-VTT","rows":18,"metrics":["FVD","CLIPSIM","CLIP-FID","FID"],"first_row_in_archive_order":{"model":"Snap Video (512x288)","paper":"/paper/snap-video-scaled-spatiotemporal-transformers","metrics":{"CLIP-FID":"9.35","CLIPSIM":"0.2793","FVD":"104.0"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/text-to-video-retrieval-on-msr-vtt","task":"Text to Video Retrieval","dataset_variant":"MSR-VTT","rows":1,"metrics":["text-to-video R@1"],"first_row_in_archive_order":{"model":"CLIP4Clip","paper":"/paper/clip4clip-an-empirical-study-of-clip-for-end","metrics":{"text-to-video R@1":"44.5"},"code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"ArrowLuo/CLIP4Clip","url":"https://github.com/ArrowLuo/CLIP4Clip"},{"title":"roudimit/AVLnet","url":"https://github.com/roudimit/AVLnet"},{"title":"facebookresearch/EgoTV","url":"https://github.com/facebookresearch/EgoTV"},{"title":"willard-yuan/video-text-retrieval-papers","url":"https://github.com/willard-yuan/video-text-retrieval-papers"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-msr-vtt","task":"Video Generation","dataset_variant":"MSR-VTT","rows":1,"metrics":["FVD16","Inception score"],"first_row_in_archive_order":{"model":"VideoAssembler (Zero-Shot, 256x256, class-conditional)","paper":"/paper/videoassembler-identity-consistent-video","metrics":{"FVD16":"252","Inception score":"15.79"},"code_links":[{"title":"gulucaptain/videoassembler","url":"https://github.com/gulucaptain/videoassembler"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-question-answering-on-msr-vtt","task":"Video Question Answering","dataset_variant":"MSR-VTT","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LocVLM-Vid-B","paper":"/paper/learning-to-localize-objects-improves-spatial","metrics":{"Accuracy":"51.2"},"code_links":[{"title":"kahnchana/locvlm","url":"https://github.com/kahnchana/locvlm"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/make-your-training-flexible-towards","title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","date":"2025-03-18","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":7,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/gramian-multimodal-representation-learning","title":"Gramian Multimodal Representation Learning and Alignment","date":"2024-12-16","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":2,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-to-localize-objects-improves-spatial","title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","date":"2024-04-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","rows_on_this_dataset":3,"code_links":2,"syntology":null},{"paper":"/paper/vid-tldr-training-free-token-merging-for","title":"vid-TLDR: Training Free Token merging for Light-weight Video Transformer","date":"2024-03-20","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/snap-video-scaled-spatiotemporal-transformers","title":"Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis","date":"2024-02-22","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/video-lavit-unified-video-language-pre","title":"Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization","date":"2024-02-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multi-granularity-correspondence-learning-1","title":"Multi-granularity Correspondence Learning from Long-term Noisy Videos","date":"2024-01-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":2,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/towards-efficient-and-effective-text-to-video","title":"Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning","date":"2024-01-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/holistic-features-are-almost-sufficient-for","title":"Holistic Features are almost Sufficient for Text-to-Video Retrieval","date":"2024-01-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/a-recipe-for-scaling-up-text-to-video","title":"A Recipe for Scaling up Text-to-Video Generation with Text-free Videos","date":"2023-12-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/videopoet-a-large-language-model-for-zero","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","date":"2023-12-21","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/hierarchical-spatio-temporal-decoupling-for","title":"Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation","date":"2023-12-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/rtq-rethinking-video-language-understanding","title":"RTQ: Rethinking Video-language Understanding Based on Image-text Model","date":"2023-12-01","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/videoassembler-identity-consistent-video","title":"MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing","date":"2023-11-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":10,"samples_unverified":2,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/side4video-spatial-temporal-side-network-for","title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","date":"2023-11-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/make-pixels-dance-high-dynamic-video","title":"Make Pixels Dance: High-Dynamic Video Generation","date":"2023-11-18","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/omnivec-learning-robust-representations-with","title":"OmniVec: Learning robust representations with cross modal sharing","date":"2023-11-07","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/howtocaption-prompting-llms-to-transform","title":"HowToCaption: Prompting LLMs to Transform Video Annotations at Scale","date":"2023-10-07","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/icocap-improving-video-captioning-by","title":"IcoCap: Improving Video Captioning by Compounding Images","date":"2023-10-05","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/languagebind-extending-video-language","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","date":"2023-10-03","rows_on_this_dataset":2,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":7,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/prototype-based-aleatoric-uncertainty-1","title":"Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval","date":"2023-09-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":12,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/show-1-marrying-pixel-and-latent-diffusion","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","date":"2023-09-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/one-for-all-video-conversation-is-feasible","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","date":"2023-09-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/accurate-and-fast-compressed-video-captioning","title":"Accurate and Fast Compressed Video Captioning","date":"2023-09-22","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":10,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dual-modal-attention-enhanced-text-video","title":"Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning","date":"2023-09-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/unified-coarse-to-fine-alignment-for-video","title":"Unified Coarse-to-Fine Alignment for Video-Text Retrieval","date":"2023-09-18","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":8,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/modelscope-text-to-video-technical-report","title":"ModelScope Text-to-Video Technical Report","date":"2023-08-12","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":16,"samples_ran":11,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audio-enhanced-text-to-video-retrieval-using","title":"Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature Alignment","date":"2023-07-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cosa-concatenated-sample-pretrained-vision","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","date":"2023-06-15","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/videocomposer-compositional-video-synthesis","title":"VideoComposer: Compositional Video Synthesis with Motion Controllability","date":"2023-06-03","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":5,"samples_unverified":16,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vast-a-vision-audio-subtitle-text-omni-1","title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","date":"2023-05-29","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":42,"samples_ran":15,"samples_unverified":27,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vlab-enhancing-video-language-pre-training-by","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","date":"2023-05-22","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/imagebind-one-embedding-space-to-bind-them","title":"ImageBind: One Embedding Space To Bind Them All","date":"2023-05-09","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":34,"samples_ran":24,"samples_unverified":10,"pointer_only_for_licence":32,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/align-your-latents-high-resolution-video","title":"Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models","date":"2023-04-18","rows_on_this_dataset":2,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":26,"samples_ran":18,"samples_unverified":8,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/valor-vision-audio-language-omni-perception","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","date":"2023-04-17","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/mammut-a-simple-architecture-for-joint","title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","date":"2023-03-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unmasked-teacher-towards-training-efficient","title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","date":"2023-03-28","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":3,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/sem-pos-grammatically-and-semantically","title":"SEM-POS: Grammatically and Semantically Correct Video Captioning","date":"2023-03-26","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/video-text-as-game-players-hierarchical","title":"Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation Learning","date":"2023-03-25","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":16,"samples_ran":11,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/meltr-meta-loss-transformer-for-learning-to","title":"MELTR: Meta Loss Transformer for Learning to Fine-tune Video Foundation Models","date":"2023-03-23","rows_on_this_dataset":7,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/text-with-knowledge-graph-augmented","title":"Text with Knowledge Graph Augmented Transformer for Video Captioning","date":"2023-03-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/diffusionret-generative-text-video-retrieval","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","date":"2023-03-17","rows_on_this_dataset":2,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":5,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multi-efficient-video-and-language","title":"MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling","date":"2023-03-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/vid2seq-large-scale-pretraining-of-a-visual","title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","date":"2023-02-27","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/video-text-retrieval-by-supervised-multi","title":"Video-Text Retrieval by Supervised Sparse Multi-Grained Learning","date":"2023-02-19","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","rows_on_this_dataset":3,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":9,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/revisiting-temporal-modeling-for-clip-based","title":"Revisiting Temporal Modeling for CLIP-based Image-to-Video Knowledge Transferring","date":"2023-01-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/pidro-parallel-isomeric-attention-with","title":"PIDRo: Parallel Isomeric Attention with Dynamic Routing for Text-Video Retrieval","date":"2023-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cap4video-what-can-auxiliary-captions-do-for","title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","date":"2022-12-31","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":25,"samples_ran":14,"samples_unverified":11,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hitea-hierarchical-temporal-aware-video","title":"HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training","date":"2022-12-30","rows_on_this_dataset":4,"code_links":0,"syntology":null},{"paper":"/paper/vindlu-a-recipe-for-effective-video-and","title":"VindLU: A Recipe for Effective Video-and-Language Pretraining","date":"2022-12-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/internvideo-general-video-foundation-models","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","date":"2022-12-06","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/masked-contrastive-pre-training-for-efficient","title":"Masked Contrastive Pre-Training for Efficient Video-Text Retrieval","date":"2022-12-02","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/seeing-what-you-miss-vision-language-pre","title":"Seeing What You Miss: Vision-Language Pre-training with Semantic Completion Learning","date":"2022-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/tell-me-what-happened-unifying-text-guided","title":"Tell Me What Happened: Unifying Text-guided Video Completion via Multimodal Masked Video Generation","date":"2022-11-23","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/x-2-vlm-all-in-one-pre-trained-model-for","title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","date":"2022-11-22","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":2,"samples_unverified":4,"pointer_only_for_licence":6,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/expectation-maximization-contrastive-learning","title":"Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations","date":"2022-11-21","rows_on_this_dataset":3,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/magicvideo-efficient-video-generation-with","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","date":"2022-11-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/make-a-video-text-to-video-generation-without","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","date":"2022-09-29","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/clip-vip-adapting-pre-trained-image-text","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","date":"2022-09-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/an-empirical-study-of-end-to-end-video","title":"An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling","date":"2022-09-04","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/diverse-video-captioning-by-adaptive-spatio","title":"Diverse Video Captioning by Adaptive Spatio-temporal Attention","date":"2022-08-19","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/ts2-net-token-shift-and-selection-transformer","title":"TS2-Net: Token Shift and Selection Transformer for Text-Video Retrieval","date":"2022-07-16","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/clover-towards-a-unified-video-language","title":"Clover: Towards A Unified Video-Language Alignment and Fusion Model","date":"2022-07-16","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/x-clip-end-to-end-multi-grained-contrastive","title":"X-CLIP: End-to-End Multi-grained Contrastive Learning for Video-Text Retrieval","date":"2022-07-15","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/lat-latent-translation-with-cycle-consistency","title":"LaT: Latent Translation with Cycle-Consistency for Video-Text Retrieval","date":"2022-07-11","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/rome-role-aware-mixture-of-expert-transformer","title":"RoME: Role-aware Mixture-of-Expert Transformer for Text-to-Video Retrieval","date":"2022-06-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/revealing-single-frame-bias-for-video-and","title":"Revealing Single Frame Bias for Video-and-Language Learning","date":"2022-06-07","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":4,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/git-a-generative-image-to-text-transformer","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","date":"2022-05-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":0,"samples_unverified":21,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":9,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/centerclip-token-clustering-for-efficient","title":"CenterCLIP: Token Clustering for Efficient Text-Video Retrieval","date":"2022-05-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/miles-visual-bert-pre-training-with-injected","title":"MILES: Visual BERT Pre-training with Injected Language Semantics for Video-text Retrieval","date":"2022-04-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/cots-collaborative-two-stream-vision-language","title":"COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval","date":"2022-04-15","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/hunyuan-tvr-for-text-video-retrivial","title":"Tencent Text-Video Retrieval: Hierarchical Cross-Modal Interactions with Multi-Level Representations","date":"2022-04-07","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/socratic-models-composing-zero-shot","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","date":"2022-04-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-audio-video-modalities-from-image","title":"Learning Audio-Video Modalities from Image Captions","date":"2022-04-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/x-pool-cross-modal-language-video-attention","title":"X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval","date":"2022-03-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mdmmt-2-multidomain-multimodal-transformer","title":"MDMMT-2: Multidomain Multimodal Transformer for Video Retrieval, One More Step Towards Generalization","date":"2022-03-14","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/disentangled-representation-learning-for-text","title":"Disentangled Representation Learning for Text-Video Retrieval","date":"2022-03-14","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":8,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/all-in-one-exploring-unified-video-language","title":"All in One: Exploring Unified Video-Language Pre-training","date":"2022-03-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/end-to-end-generative-pretraining-for","title":"End-to-end Generative Pretraining for Multimodal Video Captioning","date":"2022-01-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/bridgeformer-bridging-video-text-retrieval","title":"Bridging Video-text Retrieval with Multiple Choice Questions","date":"2022-01-13","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":24,"samples_ran":13,"samples_unverified":11,"pointer_only_for_licence":6,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cross-modal-retrieval-with-querybank","title":"Cross Modal Retrieval with Querybank Normalisation","date":"2021-12-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":2,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/align-and-prompt-video-and-language-pre","title":"Align and Prompt: Video-and-Language Pre-training with Entity Prompts","date":"2021-12-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/lightweight-attentional-feature-fusion-for","title":"Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval","date":"2021-12-03","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/object-aware-video-language-pre-training-for","title":"Object-aware Video-language Pre-training for Retrieval","date":"2021-12-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/clip-meets-video-captioners-attribute-aware","title":"CLIP Meets Video Captioning: Concept-Aware Representation Learning Does Matter","date":"2021-11-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/violet-end-to-end-video-language-transformers","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","date":"2021-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","date":"2021-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/florence-a-new-foundation-model-for-computer","title":"Florence: A New Foundation Model for Computer Vision","date":"2021-11-22","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/advancing-high-resolution-video-language","title":"Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions","date":"2021-11-19","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/clip2tv-an-empirical-study-on-transformer","title":"CLIP2TV: Align, Match and Distill for Video-Text Retrieval","date":"2021-11-10","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/video-and-text-matching-with-conditioned","title":"Video and Text Matching with Conditioned Embeddings","date":"2021-10-21","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/videoclip-contrastive-pre-training-for-zero","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","date":"2021-09-28","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/improving-video-text-retrieval-by-multi","title":"Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss","date":"2021-09-09","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/taco-token-aware-cascade-contrastive-learning","title":"TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment","date":"2021-08-23","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/clip2video-mastering-video-text-retrieval-via","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","date":"2021-06-21","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vlm-task-agnostic-video-language-model-pre","title":"VLM: Task-agnostic Video-Language Model Pre-training for Video Understanding","date":"2021-05-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/godiva-generating-open-domain-videos-from","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","date":"2021-04-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/vatt-transformers-for-multimodal-self","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","date":"2021-04-22","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/clip4clip-an-empirical-study-of-clip-for-end","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","date":"2021-04-18","rows_on_this_dataset":4,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/frozen-in-time-a-joint-video-and-image","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","date":"2021-04-01","rows_on_this_dataset":3,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":3,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mdmmt-multidomain-multimodal-transformer-for","title":"MDMMT: Multidomain Multimodal Transformer for Video Retrieval","date":"2021-03-19","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-straightforward-framework-for-video","title":"A Straightforward Framework For Video Retrieval Using CLIP","date":"2021-02-24","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/multi-modal-transformer-for-video-retrieval","title":"Multi-modal Transformer for Video Retrieval","date":"2020-07-21","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":1,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/noise-estimation-using-density-estimation-for","title":"Noise Estimation Using Density Estimation for Self-Supervised Multimodal Learning","date":"2020-03-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/univilm-a-unified-video-and-language-pre","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","date":"2020-02-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/end-to-end-learning-of-visual-representations","title":"End-to-End Learning of Visual Representations from Uncurated Instructional Videos","date":"2019-12-13","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/use-what-you-have-video-retrieval-using","title":"Use What You Have: Video Retrieval Using Representations From Collaborative Experts","date":"2019-07-31","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":0,"samples_unverified":5,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/howto100m-learning-a-text-video-embedding-by","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","date":"2019-06-07","rows_on_this_dataset":3,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-joint-sequence-fusion-model-for-video","title":"A Joint Sequence Fusion Model for Video Question Answering and Retrieval","date":"2018-08-07","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-joint-embedding-with-multimodal-cues","title":"Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval","date":"2018-06-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/temporal-tessellation-a-unified-approach-for","title":"Temporal Tessellation: A Unified Approach for Video Analysis","date":"2016-12-21","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-language-visual-embedding-for-movie","title":"Learning Language-Visual Embedding for Movie Understanding with Natural-Language","date":"2016-09-26","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":52,"samples_harvested":514,"samples_ran":268,"samples_unverified":246,"pointer_only_for_licence":104,"papers_with_no_sample_that_ran":5,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}