{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","description_markdown":"**UCF101** dataset is an extension of UCF50 and consists of 13,320 video clips, which are classified into 101 categories. These 101 categories can be classified into 5 types (Body motion, Human-human interactions, Human-object interactions, Playing musical instruments and Sports). The total length of these video clips is over 27 hours. All the videos are collected from YouTube and have a fixed frame rate of 25 FPS with the resolution of 320 × 240.\r\n\r\nSource: [Two-stream Collaborative Learning with Spatial-Temporal Attention for Video Classification](https://arxiv.org/abs/1711.03273)\r\nImage Source: [https://www.crcv.ucf.edu/data/UCF101.php](https://www.crcv.ucf.edu/data/UCF101.php)","description_withheld":null,"homepage":"https://www.crcv.ucf.edu/data/UCF101.php","introduced_date":"2012-12-03","introduced_date_note":null,"introduced_by":{"paper":"/paper/ucf101-a-dataset-of-101-human-actions-classes","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","first_author":"Khurram Soomro","url":null},"license":{"name":"MIT","url":null},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"}],"tasks":[{"name":"Zero-Shot Learning","url":"/task/zero-shot-learning","datasets_with_task":"/datasets/task/zero-shot-learning"},{"name":"Action Recognition","url":"/task/action-recognition-in-videos","datasets_with_task":"/datasets/task/action-recognition-in-videos"},{"name":"Temporal Action Localization","url":"/task/action-recognition","datasets_with_task":"/datasets/task/action-recognition"},{"name":"Few-Shot Learning","url":"/task/few-shot-learning","datasets_with_task":"/datasets/task/few-shot-learning"},{"name":"Image Clustering","url":"/task/image-clustering","datasets_with_task":"/datasets/task/image-clustering"},{"name":"Skeleton Based Action Recognition","url":"/task/skeleton-based-action-recognition","datasets_with_task":"/datasets/task/skeleton-based-action-recognition"},{"name":"Action Classification","url":"/task/action-classification","datasets_with_task":"/datasets/task/action-classification"},{"name":"Action Recognition In Videos","url":"/task/action-recognition-in-videos-2","datasets_with_task":"/datasets/task/action-recognition-in-videos-2"},{"name":"Transductive Zero-Shot Classification","url":"/task/transductive-zero-shot-classification","datasets_with_task":"/datasets/task/transductive-zero-shot-classification"},{"name":"Video Frame Interpolation","url":"/task/video-frame-interpolation","datasets_with_task":"/datasets/task/video-frame-interpolation"},{"name":"Video Generation","url":"/task/video-generation","datasets_with_task":"/datasets/task/video-generation"},{"name":"Prompt Engineering","url":"/task/prompt-engineering","datasets_with_task":"/datasets/task/prompt-engineering"},{"name":"Few-Shot Learning - 4 shots","url":"/task/few-shot-learning-4-shots","datasets_with_task":"/datasets/task/few-shot-learning-4-shots"},{"name":"Human Activity Recognition","url":"/task/human-activity-recognition","datasets_with_task":"/datasets/task/human-activity-recognition"},{"name":"Zero-Shot Action Recognition","url":"/task/zero-shot-action-recognition","datasets_with_task":"/datasets/task/zero-shot-action-recognition"},{"name":"Self-Supervised Action Recognition","url":"/task/self-supervised-action-recognition","datasets_with_task":"/datasets/task/self-supervised-action-recognition"},{"name":"Text-to-Video Generation","url":"/task/text-to-video-generation","datasets_with_task":"/datasets/task/text-to-video-generation"},{"name":"Few Shot Action Recognition","url":"/task/few-shot-action-recognition","datasets_with_task":"/datasets/task/few-shot-action-recognition"},{"name":"Early Action Prediction","url":"/task/early-action-prediction","datasets_with_task":"/datasets/task/early-action-prediction"},{"name":"Self-Supervised Action Recognition Linear","url":"/task/self-supervised-action-recognition-linear","datasets_with_task":"/datasets/task/self-supervised-action-recognition-linear"},{"name":"Self-supervised Video Retrieval","url":"/task/self-supervised-video-retrieval","datasets_with_task":"/datasets/task/self-supervised-video-retrieval"},{"name":"Open Set Action Recognition","url":"/task/open-set-action-recognition","datasets_with_task":"/datasets/task/open-set-action-recognition"}],"languages":[{"name":"Korean","url":"/datasets/language/korean"}],"variants":["UCF101-skeleton","UCF101-MiTv2","UCF-101 Zero-shot, 256x256, class-conditional","UCF101 (finetuned)","UCF 101","UCF101","UCF-101 16 frames, Unconditional, Single GPU","UCF-101 16 frames, 64x64, Unconditional","UCF-101 16 frames, 128x128, Unconditional","UCF-101"],"data_loaders":[{"repo":"https://github.com/pytorch/vision","url":"https://pytorch.org/vision/stable/generated/torchvision.datasets.UCF101.html","frameworks":["pytorch"]},{"repo":"https://github.com/voxel51/fiftyone","url":"https://docs.voxel51.com/user_guide/dataset_zoo/datasets.html#ucf101","frameworks":["tf","pytorch"]},{"repo":"https://github.com/open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2/blob/master/tools/data/ucf101/README.md","frameworks":["pytorch"]},{"repo":"https://github.com/tensorflow/datasets","url":"https://www.tensorflow.org/datasets/catalog/ucf101","frameworks":["tf","jax"]}],"num_papers_in_archive":1863,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101","task":"Action Recognition","dataset_variant":"UCF101","rows":91,"metrics":["3-fold Accuracy","Accuracy","Accuracy 20%Test"],"first_row_in_archive_order":{"model":"FTP-UniFormerV2-L/14","paper":"/paper/enhancing-video-transformers-for-action","metrics":{"3-fold Accuracy":"99.7"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset_variant":"UCF101","rows":53,"metrics":["3-fold Accuracy","Pre-Training Dataset","Frozen","split-1  Top-1 Accuracy"],"first_row_in_archive_order":{"model":"VideoMAE V2-g","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","metrics":{"3-fold Accuracy":"99.6"},"code_links":[{"title":"OpenGVLab/VideoMAEv2","url":"https://github.com/OpenGVLab/VideoMAEv2"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-ucf-101","task":"Video Generation","dataset_variant":"UCF-101","rows":48,"metrics":["FVD16","FVD128","Inception Score","KVD16"],"first_row_in_archive_order":{"model":"W.A.L.T-XL (class-conditional)","paper":"/paper/photorealistic-video-generation-with","metrics":{"FVD16":"36±2"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","task":"Zero-Shot Action Recognition","dataset_variant":"UCF101","rows":35,"metrics":["Top-1 Accuracy","Top-5 accuracy"],"first_row_in_archive_order":{"model":"OTI(ViT-L/14)","paper":"/paper/orthogonal-temporal-interpolation-for-zero","metrics":{"Top-1 Accuracy":"92.8"},"code_links":[{"title":"sweetorangezhuyan/mm2023_oti","url":"https://github.com/sweetorangezhuyan/mm2023_oti"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-frame-interpolation-on-ucf101-1","task":"Video Frame Interpolation","dataset_variant":"UCF101","rows":19,"metrics":["PSNR","SSIM","PSNR (sRGB)","LPIPS"],"first_row_in_archive_order":{"model":"EMA-VFI","paper":"/paper/extracting-motion-and-appearance-via-inter","metrics":{"PSNR":"35.48","SSIM":"0.9701"},"code_links":[{"title":"mcg-nju/ema-vfi","url":"https://github.com/mcg-nju/ema-vfi"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/prompt-engineering-on-ucf101","task":"Prompt Engineering","dataset_variant":"UCF101","rows":14,"metrics":["Harmonic mean"],"first_row_in_archive_order":{"model":"PromptKD","paper":"/paper/promptkd-unsupervised-prompt-distillation-for","metrics":{"Harmonic mean":"86.10"},"code_links":[{"title":"zhengli97/promptkd","url":"https://github.com/zhengli97/promptkd"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset_variant":"UCF101 (finetuned)","rows":14,"metrics":["3-fold Accuracy","Pretrain"],"first_row_in_archive_order":{"model":"BraVe:V-FA (TSM-50x2)","paper":"/paper/broaden-your-views-for-self-supervised-video","metrics":{"3-fold Accuracy":"95.7"},"code_links":[{"title":"deepmind/brave","url":"https://github.com/deepmind/brave"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/text-to-video-generation-on-ucf-101","task":"Text-to-Video Generation","dataset_variant":"UCF-101","rows":10,"metrics":["FVD16"],"first_row_in_archive_order":{"model":"Snap Video (Zero-shot, 512x288)","paper":"/paper/snap-video-scaled-spatiotemporal-transformers","metrics":{"FVD16":"200.2"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/few-shot-action-recognition-on-ucf101","task":"Few Shot Action Recognition","dataset_variant":"UCF101","rows":7,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"STRM","paper":"/paper/spatio-temporal-relation-modeling-for-few","metrics":{"1:1 Accuracy":"96.8"},"code_links":[{"title":"Anirudh257/strm","url":"https://github.com/Anirudh257/strm"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-ucf-101-16-frames","task":"Video Generation","dataset_variant":"UCF-101 16 frames, Unconditional, Single GPU","rows":7,"metrics":["Inception Score"],"first_row_in_archive_order":{"model":"TGAN-F","paper":"/paper/lower-dimensional-kernels-for-video","metrics":{"Inception Score":"22.91"},"code_links":[{"title":"HappyBahman/ldvdGAN","url":"https://github.com/HappyBahman/ldvdGAN"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-ucf-101-16-frames-64x64","task":"Video Generation","dataset_variant":"UCF-101 16 frames, 64x64, Unconditional","rows":7,"metrics":["Inception Score","FID","FVD"],"first_row_in_archive_order":{"model":"Video Diffusion Model","paper":"/paper/video-diffusion-models","metrics":{"FID":"295","Inception Score":"57"},"code_links":[{"title":"lucidrains/make-a-video-pytorch","url":"https://github.com/lucidrains/make-a-video-pytorch"},{"title":"lucidrains/video-diffusion-pytorch","url":"https://github.com/lucidrains/video-diffusion-pytorch"},{"title":"coderpiaobozhe/classifier-free-diffusion-guidance-Pytorch","url":"https://github.com/coderpiaobozhe/classifier-free-diffusion-guidance-Pytorch"},{"title":"ndrwmlnk/awesome-video-diffusion-models","url":"https://github.com/ndrwmlnk/awesome-video-diffusion-models"},{"title":"eyeline-research/survey-video-diffusion","url":"https://github.com/eyeline-research/survey-video-diffusion"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-ucf-101-16-frames-128x128","task":"Video Generation","dataset_variant":"UCF-101 16 frames, 128x128, Unconditional","rows":6,"metrics":["Inception Score"],"first_row_in_archive_order":{"model":"TGANv2 (2020)","paper":"/paper/tganv2-efficient-training-of-large-models-for","metrics":{"Inception Score":"28.87"},"code_links":[{"title":"pfnet-research/tgan2","url":"https://github.com/pfnet-research/tgan2"},{"title":"Zasder3/Tganv2-PyTorch-Train-Sparsely--Generate-Densely","url":"https://github.com/Zasder3/Tganv2-PyTorch-Train-Sparsely--Generate-Densely"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101-2","task":"Action Recognition In Videos","dataset_variant":"UCF101","rows":5,"metrics":["3-fold Accuracy"],"first_row_in_archive_order":{"model":"STM (ImageNet+Kinetics pretrain)","paper":"/paper/stm-spatiotemporal-and-motion-encoding-for","metrics":{"3-fold Accuracy":"96.2"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf-101","task":"Action Recognition","dataset_variant":"UCF-101","rows":2,"metrics":["3-fold Accuracy","Accuracy"],"first_row_in_archive_order":{"model":"DMC-Net (ResNet-18)","paper":"/paper/dmc-net-generating-discriminative-motion-cues","metrics":{"3-fold Accuracy":"90.9"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/image-clustering-on-ucf101","task":"Image Clustering","dataset_variant":"UCF101","rows":2,"metrics":["Accuracy","ARI","NMI"],"first_row_in_archive_order":{"model":"TURTLE (CLIP + DINOv2)","paper":"/paper/let-go-of-your-labels-with-unsupervised-1","metrics":{"Accuracy":"82.3"},"code_links":[{"title":"mlbio-epfl/turtle","url":"https://github.com/mlbio-epfl/turtle"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/zero-shot-learning-on-ucf101","task":"Zero-Shot Learning","dataset_variant":"UCF101","rows":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ZLaP","paper":"/paper/label-propagation-for-zero-shot","metrics":{"Accuracy":"76.3"},"code_links":[{"title":"vladan-stojnic/zlap","url":"https://github.com/vladan-stojnic/zlap"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-classification-on-ucf101","task":"Action Classification","dataset_variant":"UCF101","rows":1,"metrics":["Top-1"],"first_row_in_archive_order":{"model":"Ours","paper":"/paper/spact-self-supervised-privacy-preservation","metrics":{"Top-1":"62.03"},"code_links":[{"title":"daveishan/spact","url":"https://github.com/daveishan/spact"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-recognition-on-ucf-101","task":"Action Recognition","dataset_variant":"UCF 101","rows":1,"metrics":["3-fold Accuracy"],"first_row_in_archive_order":{"model":"R2+1D-BERT","paper":"/paper/late-temporal-modeling-in-3d-cnn","metrics":{"3-fold Accuracy":"98.69"},"code_links":[{"title":"artest08/LateTemporalModeling3DCNN","url":"https://github.com/artest08/LateTemporalModeling3DCNN"},{"title":"kietngt00/hmdb51-recognition","url":"https://github.com/kietngt00/hmdb51-recognition"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/few-shot-learning-on-ucf101","task":"Few-Shot Learning","dataset_variant":"UCF101","rows":1,"metrics":["Harmonic mean"],"first_row_in_archive_order":{"model":"Variational Prompt Tuning","paper":"/paper/variational-prompt-tuning-improves","metrics":{"Harmonic mean":"79"},"code_links":[{"title":"saic-fi/bayesian-prompt-learning","url":"https://github.com/saic-fi/bayesian-prompt-learning"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/human-activity-recognition-on-ucf-101","task":"Human Activity Recognition","dataset_variant":"UCF 101","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Label-Ranker","paper":"/paper/label-ranker-self-aware-preference-for","metrics":{"Accuracy":"89.50%"},"code_links":[{"title":"Peihao-Xiang/Label-Ranker","url":"https://github.com/Peihao-Xiang/Label-Ranker"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/open-set-action-recognition-on-ucf101-mitv2","task":"Open Set Action Recognition","dataset_variant":"UCF101-MiTv2","rows":1,"metrics":["AUROC"],"first_row_in_archive_order":{"model":"InternVideo","paper":"/paper/internvideo-general-video-foundation-models","metrics":{"AUROC":"91.85"},"code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ucf101","task":"Skeleton Based Action Recognition","dataset_variant":"UCF101","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling","paper":"/paper/unified-keypoint-based-action-recognition","metrics":{"Accuracy":"87.8"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/transductive-zero-shot-classification-on-9","task":"Transductive Zero-Shot Classification","dataset_variant":"UCF101","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ZLaP","paper":"/paper/label-propagation-for-zero-shot","metrics":{"Accuracy":"77.7"},"code_links":[{"title":"vladan-stojnic/zlap","url":"https://github.com/vladan-stojnic/zlap"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/video-gpt-via-next-clip-diffusion","title":"Video-GPT via Next Clip Diffusion","date":"2025-05-18","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mmrl-parameter-efficient-and-interaction","title":"MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models","date":"2025-05-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/ca-2st-cross-attention-in-audio-space-and","title":"CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition","date":"2025-03-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/long-context-autoregressive-video-modeling-1","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","date":"2025-03-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/leanvae-an-ultra-efficient-reconstruction-vae","title":"LeanVAE: An Ultra-Efficient Reconstruction VAE for Video Diffusion Models","date":"2025-03-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mmrl-multi-modal-representation-learning-for","title":"MMRL: Multi-Modal Representation Learning for Vision-Language Models","date":"2025-03-11","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/label-ranker-self-aware-preference-for","title":"Label Ranker: Self-Aware Preference for Classification Label Position in Visual Masked Self-Supervised Pre-Trained Model","date":"2025-03-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/acdit-interpolating-autoregressive","title":"ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer","date":"2024-12-10","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":1,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/locate-gat-modeling-multi-scale-local-context","title":"LoCATe-GAT: Modeling Multi-Scale Local Context and Action Relationships for Zero-Shot Action Recognition","date":"2024-11-27","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/larp-tokenizing-videos-with-a-learned-1","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","date":"2024-10-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":4,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hpt-hierarchically-prompting-vision-language","title":"HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling","date":"2024-08-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/vfimamba-video-frame-interpolation-with-state","title":"VFIMamba: Video Frame Interpolation with State Space Models","date":"2024-07-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":8,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omnitokenizer-a-joint-image-video-tokenizer","title":"OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation","date":"2024-06-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":5,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hierarchical-patch-diffusion-models-for-high-1","title":"Hierarchical Patch Diffusion Models for High-Resolution Video Generation","date":"2024-06-12","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/let-go-of-your-labels-with-unsupervised-1","title":"Let Go of Your Labels with Unsupervised Transfer","date":"2024-06-11","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/fifo-diffusion-generating-infinite-videos","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","date":"2024-05-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":9,"samples_unverified":4,"pointer_only_for_licence":13,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/leveraging-temporal-contextualization-for","title":"Leveraging Temporal Contextualization for Video Action Recognition","date":"2024-04-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/label-propagation-for-zero-shot","title":"Label Propagation for Zero-shot Classification with Vision-Language Models","date":"2024-04-05","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/prompt-learning-via-meta-regularization","title":"Prompt Learning via Meta-Regularization","date":"2024-04-01","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/grid-diffusion-models-for-text-to-video-1","title":"Grid Diffusion Models for Text-to-Video Generation","date":"2024-03-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/enhancing-video-transformers-for-action","title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","date":"2024-03-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/promptkd-unsupervised-prompt-distillation-for","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","date":"2024-03-05","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/snap-video-scaled-spatiotemporal-transformers","title":"Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis","date":"2024-02-22","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/video-lavit-unified-video-language-pre","title":"Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization","date":"2024-02-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/lumiere-a-space-time-diffusion-model-for","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","date":"2024-01-23","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":2,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omnivec2-a-novel-transformer-based-network","title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","date":"2024-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/videopoet-a-large-language-model-for-zero","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","date":"2023-12-21","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/ez-clip-efficient-zeroshot-video-action","title":"EZ-CLIP: Efficient Zeroshot Video Action Recognition","date":"2023-12-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":9,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/photorealistic-video-generation-with","title":"Photorealistic Video Generation with Diffusion Models","date":"2023-12-11","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/learning-hierarchical-prompt-with-structured","title":"Learning Hierarchical Prompt with Structured Linguistic Knowledge for Vision-Language Models","date":"2023-12-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ost-refining-text-knowledge-with-optimal","title":"OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition","date":"2023-11-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/videoassembler-identity-consistent-video","title":"MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing","date":"2023-11-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":10,"samples_unverified":2,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/make-pixels-dance-high-dynamic-video","title":"Make Pixels Dance: High-Dynamic Video Generation","date":"2023-11-18","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/omnivec-learning-robust-representations-with","title":"OmniVec: Learning robust representations with cross modal sharing","date":"2023-11-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/asymmetric-masked-distillation-for-pre","title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","date":"2023-11-06","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/regis-refining-generated-videos-via-iterative","title":"REGIS: Refining Generated Videos via Iterative Stylistic Redesigning","date":"2023-11-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/image-clustering-with-external-guidance","title":"Image Clustering with External Guidance","date":"2023-10-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":4,"samples_unverified":5,"pointer_only_for_licence":9,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/language-model-beats-diffusion-tokenizer-is","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","date":"2023-10-09","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":12,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","date":"2023-10-02","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/lavie-high-quality-video-generation-with","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","date":"2023-09-26","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dept-decoupled-prompt-tuning","title":"DePT: Decoupled Prompt Tuning","date":"2023-09-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":4,"samples_unverified":4,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/read-only-prompt-optimization-for-vision","title":"Read-only Prompt Optimization for Vision-Language Few-shot Learning","date":"2023-08-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/orthogonal-temporal-interpolation-for-zero","title":"Orthogonal Temporal Interpolation for Zero-Shot Video Recognition","date":"2023-08-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-regulating-prompts-foundational-model","title":"Self-regulating Prompts: Foundational Model Adaptation without Forgetting","date":"2023-07-13","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":7,"samples_unverified":14,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/benchmarking-self-supervised-video","title":"A Large-Scale Analysis on Self-Supervised Video Representation Learning","date":"2023-06-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/consistency-guided-prompt-learning-for-vision","title":"Consistency-guided Prompt Learning for Vision-Language Models","date":"2023-06-01","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/preserve-your-own-correlation-a-noise-prior","title":"Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models","date":"2023-05-17","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/alternating-gradient-descent-and-mixture-of","title":"Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception","date":"2023-05-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/video-frame-interpolation-with-densely","title":"Video Frame Interpolation with Densely Queried Bilateral Correlation","date":"2023-04-26","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":1,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/align-your-latents-high-resolution-video","title":"Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models","date":"2023-04-18","rows_on_this_dataset":2,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":26,"samples_ran":18,"samples_unverified":8,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/synthetic-sample-selection-for-generalized","title":"Synthetic Sample Selection for Generalized Zero-Shot Learning","date":"2023-04-06","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/victr-video-conditioned-text-representations","title":"VicTR: Video-conditioned Text Representations for Activity Recognition","date":"2023-04-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","date":"2023-03-29","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":2,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unified-keypoint-based-action-recognition","title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","date":"2023-03-27","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/eva-clip-improved-training-techniques-for","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","date":"2023-03-27","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/towards-end-to-end-generative-modeling-of","title":"Towards End-to-End Generative Modeling of Long Videos with Memory-Efficient Bidirectional Transformers","date":"2023-03-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/match-expand-and-improve-unsupervised","title":"MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language Knowledge","date":"2023-03-15","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/decomposed-diffusion-models-for-high-quality","title":"VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation","date":"2023-03-15","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/extracting-motion-and-appearance-via-inter","title":"Extracting Motion and Appearance via Inter-Frame Attention for Efficient Video Frame Interpolation","date":"2023-03-01","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":10,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-action-recognition-collaborative","title":"Video Action Recognition Collaborative Learning with Dynamics via PSO-ConvNet Transformer","date":"2023-02-17","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/bidirectional-cross-modal-knowledge","title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","date":"2022-12-31","rows_on_this_dataset":2,"code_links":5,"syntology":null},{"paper":"/paper/adaptive-frame-selection-in-two-dimensional","title":"Adaptive frame selection in two dimensional convolutional neural network action recognition","date":"2022-12-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/similarity-contrastive-estimation-for-image","title":"Similarity Contrastive Estimation for Image and Video Soft Contrastive Self-Supervised Learning","date":"2022-12-21","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/magvit-masked-generative-video-transformer","title":"MAGVIT: Masked Generative Video Transformer","date":"2022-12-10","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":1,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/masked-video-distillation-rethinking-masked","title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","date":"2022-12-08","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/learning-domain-invariant-prompt-for-vision","title":"Learning Domain Invariant Prompt for Vision-Language Models","date":"2022-12-08","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/internvideo-general-video-foundation-models","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","date":"2022-12-06","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vidm-video-implicit-diffusion-models","title":"VIDM: Video Implicit Diffusion Models","date":"2022-12-01","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/xkd-cross-modal-knowledge-distillation-with","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","date":"2022-11-25","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/tell-me-what-happened-unifying-text-guided","title":"Tell Me What Happened: Unifying Text-guided Video Completion via Multimodal Masked Video Generation","date":"2022-11-23","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/latent-video-diffusion-models-for-high","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","date":"2022-11-23","rows_on_this_dataset":5,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":9,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/magicvideo-efficient-video-generation-with","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","date":"2022-11-20","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/efficient-video-representation-learning-via","title":"EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens","date":"2022-11-19","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":3,"samples_unverified":3,"pointer_only_for_licence":6,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-unified-pyramid-recurrent-network-for-video","title":"A Unified Pyramid Recurrent Network for Video Frame Interpolation","date":"2022-11-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/m-3-video-masked-motion-modeling-for-self","title":"Masked Motion Encoding for Self-Supervised Video Representation Learning","date":"2022-10-12","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/maple-multi-modal-prompt-learning","title":"MaPLe: Multi-modal Prompt Learning","date":"2022-10-06","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/variational-prompt-tuning-improves","title":"Bayesian Prompt Learning for Image-Language Model Generalization","date":"2022-10-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/make-a-video-text-to-video-generation-without","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","date":"2022-09-29","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/expanding-language-image-pretrained-models","title":"Expanding Language-Image Pretrained Models for General Video Recognition","date":"2022-08-04","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multimodal-open-vocabulary-video","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","date":"2022-07-15","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/neighbor-correspondence-matching-for-flow","title":"Neighbor Correspondence Matching for Flow-based Video Frame Synthesis","date":"2022-07-14","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/federated-self-supervised-learning-for-video","title":"Federated Self-supervised Learning for Video Understanding","date":"2022-07-05","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/transferring-textual-knowledge-for-visual","title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","date":"2022-07-04","rows_on_this_dataset":2,"code_links":5,"syntology":null},{"paper":"/paper/slic-self-supervised-learning-with-iterative-1","title":"SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos","date":"2022-06-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/enhanced-bi-directional-motion-estimation-for","title":"Enhanced Bi-directional Motion Estimation for Video Frame Interpolation","date":"2022-06-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learn2augment-learning-to-composite-videos","title":"Learn2Augment: Learning to Composite Videos for Data Augmentation in Action Recognition","date":"2022-06-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/ifrnet-intermediate-feature-refine-network","title":"IFRNet: Intermediate Feature Refine Network for Efficient Frame Interpolation","date":"2022-05-29","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":10,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cogvideo-large-scale-pretraining-for-text-to","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","date":"2022-05-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/masked-conditional-video-diffusion-for","title":"MCVD: Masked Conditional Video Diffusion for Prediction, Generation, and Interpolation","date":"2022-05-19","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":16,"samples_ran":7,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cross-modal-representation-learning-for-zero","title":"Cross-modal Representation Learning for Zero-shot Action Recognition","date":"2022-05-03","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/hybrid-relation-guided-set-matching-for-few","title":"Hybrid Relation Guided Set Matching for Few-shot Action Recognition","date":"2022-04-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/video-diffusion-models","title":"Video Diffusion Models","date":"2022-04-07","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/many-to-many-splatting-for-efficient-video","title":"Many-to-many Splatting for Efficient Video Frame Interpolation","date":"2022-04-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/long-video-generation-with-time-agnostic","title":"Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive Transformer","date":"2022-04-07","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/spact-self-supervised-privacy-preservation","title":"SPAct: Self-supervised Privacy Preservation for Action Recognition","date":"2022-03-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/alignment-uniformity-aware-representation","title":"Alignment-Uniformity aware Representation Learning for Zero-shot Video Classification","date":"2022-03-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":2,"samples_unverified":3,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/rethinking-zero-shot-action-recognition","title":"Rethinking Zero-shot Action Recognition: Learning from Latent Atomic Actions","date":"2022-03-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/videomae-masked-autoencoders-are-data-1","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","date":"2022-03-23","rows_on_this_dataset":2,"code_links":9,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":9,"samples_unverified":4,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/exploring-motion-ambiguity-and-alignment-for","title":"Exploring Motion Ambiguity and Alignment for High-Quality Video Frame Interpolation","date":"2022-03-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/conditional-prompt-learning-for-vision","title":"Conditional Prompt Learning for Vision-Language Models","date":"2022-03-10","rows_on_this_dataset":1,"code_links":12,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-cross-video-neural-representations","title":"Learning Cross-Video Neural Representations for High-Quality Frame Interpolation","date":"2022-02-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/generating-videos-with-dynamics-aware-1","title":"Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks","date":"2022-02-21","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/film-frame-interpolation-for-large-motion","title":"FILM: Frame Interpolation for Large Motion","date":"2022-02-10","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":10,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/spatio-temporal-relation-modeling-for-few","title":"Spatio-temporal Relation Modeling for Few-shot Action Recognition","date":"2021-12-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-video-transformer","title":"Self-supervised Video Transformer","date":"2021-12-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/spatio-temporal-multi-flow-network-for-video","title":"ST-MFNet: A Spatio-Temporal Multi-Flow Network for Frame Interpolation","date":"2021-11-30","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/self-supervised-audio-visual-representation","title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","date":"2021-11-09","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/efficient-action-recognition-using-confidence","title":"Efficient Action Recognition Using Confidence Distillation","date":"2021-09-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/ligar-lightweight-general-purpose-action","title":"LIGAR: Lightweight General-purpose Action Recognition","date":"2021-08-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-8","title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","date":"2021-08-19","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/asymmetric-bilateral-motion-estimation-for","title":"Asymmetric Bilateral Motion Estimation for Video Frame Interpolation","date":"2021-08-15","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":2,"samples_unverified":11,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/elaborative-rehearsal-for-zero-shot-action","title":"Elaborative Rehearsal for Zero-shot Action Recognition","date":"2021-08-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":3,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vimpac-video-pre-training-via-masked-token","title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","date":"2021-06-21","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-video-representation-learning-7","title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","date":"2021-06-18","rows_on_this_dataset":9,"code_links":1,"syntology":null},{"paper":"/paper/a-good-image-generator-is-what-you-need-for-1","title":"A Good Image Generator Is What You Need for High-Resolution Video Synthesis","date":"2021-04-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-large-scale-study-on-unsupervised","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","date":"2021-04-29","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/vidtr-video-transformer-without-convolutions","title":"VidTr: Video Transformer Without Convolutions","date":"2021-04-23","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/videogpt-video-generation-using-vq-vae-and","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","date":"2021-04-20","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/broaden-your-views-for-self-supervised-video","title":"Broaden Your Views for Self-Supervised Video Learning","date":"2021-03-30","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":0,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-classification-with-finecoarse-networks","title":"Busy-Quiet Video Disentangling for Video Classification","date":"2021-03-29","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/an-image-is-worth-16x16-words-what-is-a-video","title":"An Image is Worth 16x16 Words, What is a Video Worth?","date":"2021-03-25","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cdfi-compression-driven-network-design-for","title":"CDFI: Compression-Driven Network Design for Frame Interpolation","date":"2021-03-18","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/videomoco-contrastive-video-representation","title":"VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples","date":"2021-03-10","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","rows_on_this_dataset":1,"code_links":82,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":16,"samples_unverified":4,"pointer_only_for_licence":16,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tclr-temporal-contrastive-learning-for-video","title":"TCLR: Temporal Contrastive Learning for Video Representation","date":"2021-01-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/claster-clustering-with-reinforcement","title":"CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition","date":"2021-01-18","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/temporal-relational-crosstransformers-for-few","title":"Temporal-Relational CrossTransformers for Few-Shot Action Recognition","date":"2021-01-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":2,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/smart-frame-selection-for-action-recognition","title":"SMART Frame Selection for Action Recognition","date":"2020-12-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/latent-neural-differential-equations-for","title":"Latent Neural Differential Equations for Video Generation","date":"2020-11-07","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/bubblenet-a-disperse-recurrent-structure-to","title":"Bubblenet: A Disperse Recurrent Structure To Recognize Activities","date":"2020-10-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-using","title":"Pretext-Contrastive Learning: Toward Good Practices in Self-supervised Video Representation Leaning","date":"2020-10-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/rspnet-relative-speed-perception-for","title":"RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning","date":"2020-10-27","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/depth-guided-adaptive-meta-fusion-network-for","title":"Depth Guided Adaptive Meta-Fusion Network for Few-shot Video Recognition","date":"2020-10-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":1,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-co-training-for-video","title":"Self-supervised Co-training for Video Representation Learning","date":"2020-10-19","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/perf-net-pose-empowered-rgb-flow-net","title":"PERF-Net: Pose Empowered RGB-Flow Net","date":"2020-09-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/spatiotemporal-contrastive-video","title":"Spatiotemporal Contrastive Video Representation Learning","date":"2020-08-09","rows_on_this_dataset":6,"code_links":4,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning-3","title":"Self-supervised Video Representation Learning Using Inter-intra Contrastive Framework","date":"2020-08-06","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/late-temporal-modeling-in-3d-cnn","title":"Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition","date":"2020-08-03","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/bmbc-bilateral-motion-estimation-with","title":"BMBC:Bilateral Motion Estimation with Bilateral Cost Volume for Video Interpolation","date":"2020-07-17","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":3,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-multimodal-versatile-networks","title":"Self-Supervised MultiModal Versatile Networks","date":"2020-06-29","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/video-frame-interpolation-via-residue","title":"Video Frame Interpolation via Residue Refinement","date":"2020-05-04","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/audio-visual-instance-discrimination-with","title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","date":"2020-04-27","rows_on_this_dataset":5,"code_links":1,"syntology":null},{"paper":"/paper/omni-sourced-webly-supervised-learning-for","title":"Omni-sourced Webly-supervised Learning for Video Recognition","date":"2020-03-29","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":0,"samples_unverified":13,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporally-coherent-embeddings-for-self","title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","date":"2020-03-21","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/softmax-splatting-for-video-frame","title":"Softmax Splatting for Video Frame Interpolation","date":"2020-03-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/rethinking-zero-shot-video-classification-end","title":"Rethinking Zero-shot Video Classification: End-to-end Training for Realistic Applications","date":"2020-03-03","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":0,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/evolving-losses-for-unsupervised-video","title":"Evolving Losses for Unsupervised Video Representation Learning","date":"2020-02-26","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/learning-spatio-temporal-representations-with","title":"Learning spatio-temporal representations with temporal squeeze pooling","date":"2020-02-11","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/few-shot-action-recognition-via-improved","title":"Few-shot Action Recognition with Permutation-invariant Attention","date":"2020-01-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/video-cloze-procedure-for-self-supervised","title":"Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning","date":"2020-01-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/lower-dimensional-kernels-for-video","title":"Lower Dimensional Kernels for Video Discriminators","date":"2019-12-18","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/hallucinet-ing-spatiotemporal-representations","title":"HalluciNet-ing Spatiotemporal Representations Using a 2D-CNN","date":"2019-12-10","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/self-supervised-learning-by-cross-modal-audio","title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","date":"2019-11-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/skip-clip-self-supervised-spatiotemporal","title":"Skip-Clip: Self-Supervised Spatiotemporal Representation Learning by Future Clip Order Ranking","date":"2019-10-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/markov-decision-process-for-video-generation","title":"Markov Decision Process for Video Generation","date":"2019-09-26","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/mlgcn-multi-laplacian-graph-convolutional","title":"MLGCN: Multi-Laplacian Graph Convolutional Networks for Human Action Recognition","date":"2019-09-11","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/video-representation-learning-by-dense","title":"Video Representation Learning by Dense Predictive Coding","date":"2019-09-10","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":1,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cooperative-cross-stream-network-for","title":"Cooperative Cross-Stream Network for Discriminative Action Representation","date":"2019-08-27","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/i3d-lstm-a-new-model-for-human-action","title":"I3D-LSTM: A New Model for Human Action Recognition","date":"2019-08-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/stm-spatiotemporal-and-motion-encoding-for","title":"STM: SpatioTemporal and Motion Encoding for Action Recognition","date":"2019-08-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/two-stream-video-classification-with-cross","title":"Two-Stream Video Classification with Cross-Modality Attention","date":"2019-08-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/i-know-the-relationships-zero-shot-action","title":"I Know the Relationships: Zero-Shot Action Recognition via Two-Stream Graph Convolutional Networks and Knowledge Graphs","date":"2019-07-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/r-stan-residual-spatial-temporal-attention","title":"R-STAN: Residual Spatial-Temporal Attention Network for Action Recognition","date":"2019-06-19","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/unsupervised-video-interpolation-using-cycle","title":"Unsupervised Video Interpolation Using Cycle Consistency","date":"2019-06-13","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-spatio-temporal-representation-with-3","title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","date":"2019-06-13","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/contrastive-multiview-coding","title":"Contrastive Multiview Coding","date":"2019-06-13","rows_on_this_dataset":1,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/faster-recurrent-networks-for-video","title":"FASTER Recurrent Networks for Efficient Video Classification","date":"2019-06-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/self-supervised-spatiotemporal-learning-via","title":"Self-Supervised Spatiotemporal Learning via Video Clip Order Prediction","date":"2019-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/mars-motion-augmented-rgb-stream-for-action","title":"MARS: Motion-Augmented RGB Stream for Action Recognition","date":"2019-06-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/holistic-large-scale-video-understanding","title":"Large Scale Holistic Video Understanding","date":"2019-04-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-spatio-temporal","title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","date":"2019-04-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/paying-more-attention-to-motion-attention","title":"Attention Distillation for Learning Video Representations","date":"2019-04-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/resource-efficient-3d-convolutional-neural","title":"Resource Efficient 3D Convolutional Neural Networks","date":"2019-04-04","rows_on_this_dataset":3,"code_links":2,"syntology":null},{"paper":"/paper/depth-aware-video-frame-interpolation","title":"Depth-Aware Video Frame Interpolation","date":"2019-04-01","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":3,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dance-with-flow-two-in-one-stream-action","title":"Dance with Flow: Two-in-One Stream Action Detection","date":"2019-04-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/contextual-action-cues-from-camera-sensor-for","title":"Contextual Action Cues from Camera Sensor for Multi-Stream Action Recognition","date":"2019-03-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/distinit-learning-video-representations","title":"DistInit: Learning Video Representations Without a Single Labeled Video","date":"2019-01-26","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dmc-net-generating-discriminative-motion-cues","title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","date":"2019-01-11","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/d3d-distilled-3d-networks-for-video-action","title":"D3D: Distilled 3D Networks for Video Action Recognition","date":"2018-12-19","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-spatiotemporal-feature","title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","date":"2018-11-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-representation-learning","title":"Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles","date":"2018-11-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/tganv2-efficient-training-of-large-models-for","title":"Train Sparsely, Generate Densely: Memory-efficient Unsupervised Training of High-resolution Temporal GAN","date":"2018-11-22","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a2-nets-double-attention-networks","title":"$A^2$-Nets: Double Attention Networks","date":"2018-10-27","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/temporal-spatial-mapping-for-action","title":"Temporal-Spatial Mapping for Action Recognition","date":"2018-09-11","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/multi-fiber-networks-for-video-recognition","title":"Multi-Fiber Networks for Video Recognition","date":"2018-07-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cooperative-learning-of-audio-and-video","title":"Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization","date":"2018-06-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/potion-pose-motion-representation-for-action","title":"PoTion: Pose MoTion Representation for Action Recognition","date":"2018-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/learning-and-using-the-arrow-of-time","title":"Learning and Using the Arrow of Time","date":"2018-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/end-to-end-learning-of-motion-representation","title":"End-to-End Learning of Motion Representation for Video Understanding","date":"2018-04-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/towards-universal-representation-for-unseen","title":"Towards Universal Representation for Unseen Action Recognition","date":"2018-03-22","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/rethinking-spatiotemporal-feature-learning","title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","date":"2017-12-13","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","rows_on_this_dataset":6,"code_links":24,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/optical-flow-guided-feature-a-fast-and-robust","title":"Optical Flow Guided Feature: A Fast and Robust Motion Representation for Video Action Recognition","date":"2017-11-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-spatio-temporal-representation-with","title":"Learning Spatio-Temporal Representation with Pseudo-3D Residual Networks","date":"2017-11-28","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/can-spatiotemporal-3d-cnns-retrace-the","title":"Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet?","date":"2017-11-27","rows_on_this_dataset":1,"code_links":26,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/appearance-and-relation-networks-for-video","title":"Appearance-and-Relation Networks for Video Classification","date":"2017-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/convnet-architecture-search-for","title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","date":"2017-08-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mocogan-decomposing-motion-and-content-for","title":"MoCoGAN: Decomposing Motion and Content for Video Generation","date":"2017-07-17","rows_on_this_dataset":2,"code_links":5,"syntology":null},{"paper":"/paper/zero-shot-action-recognition-with-error","title":"Zero-Shot Action Recognition With Error-Correcting Output Codes","date":"2017-07-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/alternative-semantic-representations-for-zero","title":"Alternative Semantic Representations for Zero-Shot Human Action Recognition","date":"2017-06-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/quo-vadis-action-recognition-a-new-model-and","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","date":"2017-05-22","rows_on_this_dataset":7,"code_links":34,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":28,"samples_ran":16,"samples_unverified":12,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hidden-two-stream-convolutional-networks-for","title":"Hidden Two-Stream Convolutional Networks for Action Recognition","date":"2017-04-02","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/ts-lstm-and-temporal-inception-exploiting","title":"TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition","date":"2017-03-30","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/actionflownet-learning-motion-representation","title":"ActionFlowNet: Learning Motion Representation for Action Recognition","date":"2016-12-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/multi-task-zero-shot-action-recognition-with","title":"Multi-Task Zero-Shot Action Recognition with Prioritised Data Augmentation","date":"2016-11-26","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/temporal-generative-adversarial-nets-with","title":"Temporal Generative Adversarial Nets with Singular Value Clipping","date":"2016-11-21","rows_on_this_dataset":2,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":0,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-video-representation-learning-1","title":"Self-Supervised Video Representation Learning With Odd-One-Out Networks","date":"2016-11-21","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/spatiotemporal-residual-networks-for-video","title":"Spatiotemporal Residual Networks for Video Action Recognition","date":"2016-11-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multi-region-two-stream-r-cnn-for-action","title":"Multi-region two-stream R-CNN for action detection","date":"2016-09-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/generating-videos-with-scene-dynamics","title":"Generating Videos with Scene Dynamics","date":"2016-09-08","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/temporal-segment-networks-towards-good","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","date":"2016-08-02","rows_on_this_dataset":1,"code_links":22,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":24,"samples_ran":2,"samples_unverified":22,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dynamic-image-networks-for-action-recognition","title":"Dynamic Image Networks for Action Recognition","date":"2016-06-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/real-time-action-recognition-with-enhanced","title":"Real-time Action Recognition with Enhanced Motion Vector CNNs","date":"2016-04-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/convolutional-two-stream-network-fusion-for","title":"Convolutional Two-Stream Network Fusion for Video Action Recognition","date":"2016-04-22","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/long-term-temporal-convolutions-for-action","title":"Long-term Temporal Convolutions for Action Recognition","date":"2016-04-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/shuffle-and-learn-unsupervised-learning-using","title":"Shuffle and Learn: Unsupervised Learning using Temporal Order Verification","date":"2016-03-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/objects2action-classifying-and-localizing","title":"Objects2action: Classifying and localizing actions without any video example","date":"2015-10-23","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/towards-good-practices-for-very-deep-two","title":"Towards Good Practices for Very Deep Two-Stream ConvNets","date":"2015-07-08","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/an-embarrassingly-simple-approach-to-zero","title":"An embarrassingly simple approach to zero-shot learning","date":"2015-07-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/action-recognition-with-trajectory-pooled","title":"Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors","date":"2015-05-19","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/beyond-short-snippets-deep-networks-for-video","title":"Beyond Short Snippets: Deep Networks for Video Classification","date":"2015-03-31","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/semantic-embedding-space-for-zero-shot-action","title":"Semantic Embedding Space for Zero-Shot Action Recognition","date":"2015-02-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/learning-spatiotemporal-features-with-3d","title":"Learning Spatiotemporal Features with 3D Convolutional Networks","date":"2014-12-02","rows_on_this_dataset":1,"code_links":29,"syntology":null},{"paper":"/paper/evaluation-of-output-embeddings-for-fine","title":"Evaluation of Output Embeddings for Fine-Grained Image Classification","date":"2014-09-30","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/large-scale-video-classification-with-1","title":"Large-Scale Video Classification with Convolutional Neural Networks","date":"2014-06-23","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/two-stream-convolutional-networks-for-action","title":"Two-Stream Convolutional Networks for Action Recognition in Videos","date":"2014-06-09","rows_on_this_dataset":1,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":1,"samples_unverified":6,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ucf101-a-dataset-of-101-human-actions-classes","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","date":"2012-12-03","rows_on_this_dataset":1,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":83,"samples_harvested":632,"samples_ran":291,"samples_unverified":341,"pointer_only_for_licence":138,"papers_with_no_sample_that_ran":15,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}