{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","description_markdown":"The **Kinetics** dataset is a large-scale, high-quality dataset for human action recognition in videos. The dataset consists of around 500,000 video clips covering 600 human action classes with at least 600 video clips for each action class. Each video clip lasts around 10 seconds and is labeled with a single action class. The videos are collected from YouTube.\r\n\r\nSource: [Self-supervised Visual Feature Learning with Deep Neural Networks: A Survey](https://arxiv.org/abs/1902.06162)","description_withheld":null,"homepage":"https://deepmind.com/research/open-source/kinetics","introduced_date":"2017-05-19","introduced_date_note":null,"introduced_by":{"paper":"/paper/the-kinetics-human-action-video-dataset","title":"The Kinetics Human Action Video Dataset","first_author":"Will Kay","url":null},"license":{"name":"CC BY 4.0","url":"https://creativecommons.org/licenses/by/4.0/"},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"}],"tasks":[{"name":"Action Recognition","url":"/task/action-recognition-in-videos","datasets_with_task":"/datasets/task/action-recognition-in-videos"},{"name":"Temporal Action Localization","url":"/task/action-recognition","datasets_with_task":"/datasets/task/action-recognition"},{"name":"Image Clustering","url":"/task/image-clustering","datasets_with_task":"/datasets/task/image-clustering"},{"name":"Skeleton Based Action Recognition","url":"/task/skeleton-based-action-recognition","datasets_with_task":"/datasets/task/skeleton-based-action-recognition"},{"name":"Video Retrieval","url":"/task/video-retrieval","datasets_with_task":"/datasets/task/video-retrieval"},{"name":"Action Classification","url":"/task/action-classification","datasets_with_task":"/datasets/task/action-classification"},{"name":"Action Recognition In Videos","url":"/task/action-recognition-in-videos-2","datasets_with_task":"/datasets/task/action-recognition-in-videos-2"},{"name":"Long-tail Learning","url":"/task/long-tail-learning","datasets_with_task":"/datasets/task/long-tail-learning"},{"name":"Video Prediction","url":"/task/video-prediction","datasets_with_task":"/datasets/task/video-prediction"},{"name":"Video Understanding","url":"/task/video-understanding","datasets_with_task":"/datasets/task/video-understanding"},{"name":"Visual Tracking","url":"/task/visual-tracking","datasets_with_task":"/datasets/task/visual-tracking"},{"name":"Video Captioning","url":"/task/video-captioning","datasets_with_task":"/datasets/task/video-captioning"},{"name":"Video Generation","url":"/task/video-generation","datasets_with_task":"/datasets/task/video-generation"},{"name":"Video Classification","url":"/task/video-classification","datasets_with_task":"/datasets/task/video-classification"},{"name":"Boundary Detection","url":"/task/boundary-detection","datasets_with_task":"/datasets/task/boundary-detection"},{"name":"Zero-Shot Action Recognition","url":"/task/zero-shot-action-recognition","datasets_with_task":"/datasets/task/zero-shot-action-recognition"},{"name":"Self-Supervised Action Recognition","url":"/task/self-supervised-action-recognition","datasets_with_task":"/datasets/task/self-supervised-action-recognition"},{"name":"Text-to-Video Generation","url":"/task/text-to-video-generation","datasets_with_task":"/datasets/task/text-to-video-generation"},{"name":"Text to Video Retrieval","url":"/task/text-to-video-retrieval","datasets_with_task":"/datasets/task/text-to-video-retrieval"},{"name":"Few Shot Action Recognition","url":"/task/few-shot-action-recognition","datasets_with_task":"/datasets/task/few-shot-action-recognition"},{"name":"Semantic Object Interaction Classification","url":"/task/semantic-object-interaction-classification","datasets_with_task":"/datasets/task/semantic-object-interaction-classification"},{"name":"Event Segmentation","url":"/task/event-segmentation","datasets_with_task":"/datasets/task/event-segmentation"},{"name":"Video Grounding","url":"/task/video-grounding","datasets_with_task":"/datasets/task/video-grounding"},{"name":"Self-Supervised Action Recognition Linear","url":"/task/self-supervised-action-recognition-linear","datasets_with_task":"/datasets/task/self-supervised-action-recognition-linear"},{"name":"Generic Event Boundary Detection","url":"/task/generic-event-boundary-detection","datasets_with_task":"/datasets/task/generic-event-boundary-detection"},{"name":"Spatio-Temporal Action Localization","url":"/task/spatio-temporal-action-localization","datasets_with_task":"/datasets/task/spatio-temporal-action-localization"},{"name":"Boundary Captioning","url":"/task/boundary-captioning","datasets_with_task":"/datasets/task/boundary-captioning"},{"name":"Boundary Grounding","url":"/task/boundary-grounding","datasets_with_task":"/datasets/task/boundary-grounding"},{"name":"Video Recognition","url":"/task/video-recognition","datasets_with_task":"/datasets/task/video-recognition"},{"name":"imbalanced classification","url":"/task/imbalanced-classification","datasets_with_task":"/datasets/task/imbalanced-classification"}],"languages":[],"variants":["Kinetics-GEBD","MiniKinetics","Kinetics-ZSAR","Kinetics-Sounds","Kinetics-Sound","Kinetics-GEB+","Kinetics-700","Kinetics-600 12 frames, 64x64","Kinetics-600 12 frames, 128x128","Kinetics-600","Kinetics 400","Kinetics-100","Imbalanced-MiniKinetics200","Kinetics-Skeleton dataset","AVA-Kinetics","Kinetics-600 48 frames, 64x64","Kinetics-400","Kinetics"],"data_loaders":[{"repo":"https://github.com/pytorch/vision","url":"https://pytorch.org/vision/stable/generated/torchvision.datasets.Kinetics.html","frameworks":["pytorch"]},{"repo":"https://github.com/open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2/blob/master/tools/data/kinetics/README.md","frameworks":["pytorch"]}],"num_papers_in_archive":1341,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset_variant":"Kinetics-400","rows":207,"metrics":["Acc@1","Acc@5","FLOPs (G) x views","Clip acc@1","Parameters (M)","Clip acc@5"],"first_row_in_archive_order":{"model":"OmniVec2","paper":"/paper/omnivec2-a-novel-transformer-based-network","metrics":{"Acc@1":"93.6"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics","task":"Skeleton Based Action Recognition","dataset_variant":"Kinetics-Skeleton dataset","rows":42,"metrics":["Accuracy","GFLOPS per prediction"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling (PPNv2 skeletons+objects)","paper":"/paper/unified-keypoint-based-action-recognition","metrics":{"Accuracy":"52.3"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/zero-shot-action-recognition-on-kinetics","task":"Zero-Shot Action Recognition","dataset_variant":"Kinetics","rows":20,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"TC-CLIP","paper":"/paper/leveraging-temporal-contextualization-for","metrics":{"Top-1 Accuracy":"78.1","Top-5 Accuracy":"95.7"},"code_links":[{"title":"naver-ai/tc-clip","url":"https://github.com/naver-ai/tc-clip"},{"title":"naver-ai/dawin","url":"https://github.com/naver-ai/dawin"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-prediction-on-kinetics-600-12-frames","task":"Video Prediction","dataset_variant":"Kinetics-600 12 frames, 64x64","rows":16,"metrics":["FVD","IS","Cond","Pred"],"first_row_in_archive_order":{"model":"SiD2","paper":"/paper/simpler-diffusion-sid2-1-5-fid-on-imagenet512","metrics":{"Cond":"5","FVD":"2.3","Pred":"11"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-classification-on-kinetics-sounds","task":"Action Classification","dataset_variant":"Kinetics-Sounds","rows":4,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"CA2ST(B/16)","paper":"/paper/ca-2st-cross-attention-in-audio-space-and","metrics":{"Top 1 Accuracy":"93.3"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/self-supervised-action-recognition-on-1","task":"Self-Supervised Action Recognition","dataset_variant":"Kinetics-400","rows":4,"metrics":["Top-1 accuracy %","Top-5 Accuracy %"],"first_row_in_archive_order":{"model":"XKD (ViT-B/112/16)","paper":"/paper/xkd-cross-modal-knowledge-distillation-with","metrics":{"Top-1 accuracy %":"77.6","Top-5 Accuracy %":"92.9"},"code_links":[{"title":"pritamqu/XKD","url":"https://github.com/pritamqu/XKD"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-kinetics-600-12-frames","task":"Video Generation","dataset_variant":"Kinetics-600 12 frames, 64x64","rows":4,"metrics":["FVD"],"first_row_in_archive_order":{"model":"W.A.L.T-L","paper":"/paper/photorealistic-video-generation-with","metrics":{"FVD":"3.3±0.0"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-recognition-in-videos-on-kinetics-400-1","task":"Action Recognition In Videos","dataset_variant":"Kinetics-400","rows":3,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"Florence","paper":"/paper/florence-a-new-foundation-model-for-computer","metrics":{"Top-1 Accuracy":"86.5","Top-5 Accuracy":"97.3"},"code_links":[{"title":"microsoft/unicl","url":"https://github.com/microsoft/unicl"},{"title":"MindCode-4/code-3","url":"https://github.com/MindCode-4/code-3/tree/main/florence2"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/visual-tracking-on-kinetics","task":"Visual Tracking","dataset_variant":"Kinetics","rows":2,"metrics":["Average Jaccard"],"first_row_in_archive_order":{"model":"TAPIR (Panning MOVi-E)","paper":"/paper/tapir-tracking-any-point-with-per-frame","metrics":{"Average Jaccard":"57.2"},"code_links":[{"title":"deepmind/tapnet","url":"https://github.com/deepmind/tapnet"},{"title":"riponazad/echotracker","url":"https://github.com/riponazad/echotracker"},{"title":"ibaiGorordo/Tapir-Pytorch-Inference","url":"https://github.com/ibaiGorordo/Tapir-Pytorch-Inference"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-classification-on-minikinetics","task":"Action Classification","dataset_variant":"MiniKinetics","rows":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"MARS+RGB+Flow (16 frames)","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","metrics":{"Top-1 Accuracy":"73.5"},"code_links":[{"title":"craston/MARS","url":"https://github.com/craston/MARS"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/boundary-detection-on-kinetics-400","task":"Boundary Detection","dataset_variant":"Kinetics-400","rows":1,"metrics":["Pairwise F1","Precision","Recall"],"first_row_in_archive_order":{"model":"CASTANET+ Ensemble","paper":"/paper/generic-event-boundary-detection-challenge-at","metrics":{"Pairwise F1":"0.814","Precision":"82.8","Recall":"83.8"},"code_links":[{"title":"DexiangHong/Cascade-PC","url":"https://github.com/DexiangHong/Cascade-PC"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/event-segmentation-on-kinetics-400","task":"Event Segmentation","dataset_variant":"Kinetics-400","rows":1,"metrics":["F1"],"first_row_in_archive_order":{"model":"CASTANET+ Ensemble","paper":"/paper/generic-event-boundary-detection-challenge-at","metrics":{"F1":"83.3"},"code_links":[{"title":"DexiangHong/Cascade-PC","url":"https://github.com/DexiangHong/Cascade-PC"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/generic-event-boundary-detection-on-kinetics","task":"Generic Event Boundary Detection","dataset_variant":"Kinetics-GEBD","rows":1,"metrics":["F1 @ RelDis. 0.05"],"first_row_in_archive_order":{"model":"FlowGEBD","paper":"/paper/what-s-in-the-flow-exploiting-temporal-motion-1","metrics":{"F1 @ RelDis. 0.05":"0.713"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics-2","task":"Skeleton Based Action Recognition","dataset_variant":"Kinetics-400","rows":1,"metrics":["Actions Top-1 (S1)"],"first_row_in_archive_order":{"model":"STGAT","paper":"/paper/spatial-temporal-graph-attention-network-for","metrics":{"Actions Top-1 (S1)":"39.2"},"code_links":[{"title":"hulianyuyy/STGAT","url":"https://github.com/hulianyuyy/STGAT"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/text-to-video-generation-on-kinetics","task":"Text-to-Video Generation","dataset_variant":"Kinetics","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"NUWA (128×128)","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","metrics":{"Accuracy":"77.9"},"code_links":[{"title":"lucidrains/nuwa-pytorch","url":"https://github.com/lucidrains/nuwa-pytorch"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-classification-on-kinetics","task":"Video Classification","dataset_variant":"Kinetics","rows":1,"metrics":["Top-1"],"first_row_in_archive_order":{"model":"Multigrid","paper":"/paper/a-multigrid-method-for-efficiently-training","metrics":{"Top-1":"77.6"},"code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"kkahatapitiya/X3D-Multigrid","url":"https://github.com/kkahatapitiya/X3D-Multigrid"},{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-kinetics-600-12-frames-1","task":"Video Generation","dataset_variant":"Kinetics-600 12 frames, 128x128","rows":1,"metrics":["FID"],"first_row_in_archive_order":{"model":"DVD-GAN","paper":"/paper/efficient-video-generation-on-complex","metrics":{"FID":"2.16"},"code_links":[{"title":"Harrypotterrrr/DVD-GAN","url":"https://github.com/Harrypotterrrr/DVD-GAN"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-generation-on-kinetics-600-48-frames","task":"Video Generation","dataset_variant":"Kinetics-600 48 frames, 64x64","rows":1,"metrics":["FID","Inception Score"],"first_row_in_archive_order":{"model":"DVD-GAN","paper":"/paper/efficient-video-generation-on-complex","metrics":{"FID":"12.92","Inception Score":"219.05"},"code_links":[{"title":"Harrypotterrrr/DVD-GAN","url":"https://github.com/Harrypotterrrr/DVD-GAN"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/ca-2st-cross-attention-in-audio-space-and","title":"CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition","date":"2025-03-30","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/make-your-training-flexible-towards","title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","date":"2025-03-18","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":7,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dejavid-encoder-agnostic-learned-temporal","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","date":"2025-01-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/revealing-key-details-to-see-differences-a","title":"Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action Recognition","date":"2024-11-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/locate-gat-modeling-multi-scale-local-context","title":"LoCATe-GAT: Modeling Multi-Scale Local Context and Action Relationships for Zero-Shot Action Recognition","date":"2024-11-27","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/am-flow-adapters-for-temporal-processing-in","title":"AM Flow: Adapters for Temporal Processing in Action Recognition","date":"2024-11-04","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/larp-tokenizing-videos-with-a-learned-1","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","date":"2024-10-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":4,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/simpler-diffusion-sid2-1-5-fid-on-imagenet512","title":"Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion","date":"2024-10-25","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/omnitokenizer-a-joint-image-video-tokenizer","title":"OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation","date":"2024-06-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":5,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/leveraging-temporal-contextualization-for","title":"Leveraging Temporal Contextualization for Video Action Recognition","date":"2024-04-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-correlation-structures-for-vision","title":"Learning Correlation Structures for Vision Transformers","date":"2024-04-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/enhancing-video-transformers-for-action","title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","date":"2024-03-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/videomamba-state-space-model-for-efficient","title":"VideoMamba: State Space Model for Efficient Video Understanding","date":"2024-03-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":9,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/what-s-in-the-flow-exploiting-temporal-motion-1","title":"What's in the Flow? Exploiting Temporal Motion Cues for Unsupervised Generic Event Boundary Detection","date":"2024-02-15","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/omnivec2-a-novel-transformer-based-network","title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","date":"2024-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/photorealistic-video-generation-with","title":"Photorealistic Video Generation with Diffusion Models","date":"2023-12-11","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/ost-refining-text-knowledge-with-optimal","title":"OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition","date":"2023-11-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cast-cross-attention-in-space-and-time-for-1","title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","date":"2023-11-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":9,"samples_unverified":8,"pointer_only_for_licence":17,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/side4video-spatial-temporal-side-network-for","title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","date":"2023-11-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/mirasol3b-a-multimodal-autoregressive-model","title":"Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities","date":"2023-11-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/omnivec-learning-robust-representations-with","title":"OmniVec: Learning robust representations with cross modal sharing","date":"2023-11-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/asymmetric-masked-distillation-for-pre","title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","date":"2023-11-06","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/language-model-beats-diffusion-tokenizer-is","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","date":"2023-10-09","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":12,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/languagebind-extending-video-language","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","date":"2023-10-03","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":7,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","date":"2023-10-02","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/orthogonal-temporal-interpolation-for-zero","title":"Orthogonal Temporal Interpolation for Zero-Shot Video Recognition","date":"2023-08-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporally-adaptive-models-for-efficient","title":"Temporally-Adaptive Models for Efficient Video Understanding","date":"2023-08-10","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/what-can-simple-arithmetic-operations-do-for","title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","date":"2023-07-18","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":3,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tapir-tracking-any-point-with-per-frame","title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","date":"2023-06-14","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hiera-a-hierarchical-vision-transformer","title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","date":"2023-06-01","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/one-peace-exploring-one-general","title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","date":"2023-05-18","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":2,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/alternating-gradient-descent-and-mixture-of","title":"Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception","date":"2023-05-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/implicit-temporal-modeling-with-learnable","title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","date":"2023-04-20","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/victr-video-conditioned-text-representations","title":"VicTR: Video-conditioned Text Representations for Activity Recognition","date":"2023-04-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","date":"2023-03-29","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":2,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unmasked-teacher-towards-training-efficient","title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","date":"2023-03-28","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":3,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unified-keypoint-based-action-recognition","title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","date":"2023-03-27","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/visual-representation-learning-from-unlabeled","title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","date":"2023-03-21","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/dual-path-adaptation-from-image-to-video","title":"Dual-path Adaptation from Image to Video Transformers","date":"2023-03-17","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/match-expand-and-improve-unsupervised","title":"MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language Knowledge","date":"2023-03-15","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/scaling-vision-transformers-to-22-billion","title":"Scaling Vision Transformers to 22 Billion Parameters","date":"2023-02-10","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/aim-adapting-image-models-for-efficient-video","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","date":"2023-02-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":9,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/bidirectional-cross-modal-knowledge","title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","date":"2022-12-31","rows_on_this_dataset":2,"code_links":5,"syntology":null},{"paper":"/paper/scalable-adaptive-computation-for-iterative","title":"Scalable Adaptive Computation for Iterative Generation","date":"2022-12-22","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":29,"samples_ran":21,"samples_unverified":8,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/magvit-masked-generative-video-transformer","title":"MAGVIT: Masked Generative Video Transformer","date":"2022-12-10","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":1,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/masked-video-distillation-rethinking-masked","title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","date":"2022-12-08","rows_on_this_dataset":4,"code_links":4,"syntology":null},{"paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","date":"2022-12-06","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/internvideo-general-video-foundation-models","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","date":"2022-12-06","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/xkd-cross-modal-knowledge-distillation-with","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","date":"2022-11-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/adamae-adaptive-masking-for-efficient","title":"AdaMAE: Adaptive Masking for Efficient Spatiotemporal Learning with Masked Autoencoders","date":"2022-11-16","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":25,"samples_ran":9,"samples_unverified":16,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/eva-exploring-the-limits-of-masked-visual","title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","date":"2022-11-14","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/could-giant-pretrained-image-models-extract","title":"Could Giant Pretrained Image Models Extract Universal Representations?","date":"2022-11-03","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/uniformerv2-spatiotemporal-learning-by-arming","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","date":"2022-09-22","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/hierarchically-decomposed-graph-convolutional","title":"Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2022-08-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":8,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/spatial-temporal-graph-attention-network-for","title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","date":"2022-08-18","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/frozen-clip-models-are-efficient-video","title":"Frozen CLIP Models are Efficient Video Learners","date":"2022-08-06","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":5,"samples_unverified":5,"pointer_only_for_licence":10,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/expanding-language-image-pretrained-models","title":"Expanding Language-Image Pretrained Models for General Video Recognition","date":"2022-08-04","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/spatiotemporal-self-attention-modeling-with","title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","date":"2022-07-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mar-masked-autoencoders-for-efficient-action","title":"MAR: Masked Autoencoders for Efficient Action Recognition","date":"2022-07-24","rows_on_this_dataset":4,"code_links":1,"syntology":null},{"paper":"/paper/transferring-textual-knowledge-for-visual","title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","date":"2022-07-04","rows_on_this_dataset":2,"code_links":5,"syntology":null},{"paper":"/paper/parameter-efficient-image-to-video-transfer","title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","date":"2022-06-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":4,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/diffusion-models-for-video-prediction-and","title":"Diffusion Models for Video Prediction and Infilling","date":"2022-06-15","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":9,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/stand-alone-inter-frame-attention-in-video-1","title":"Stand-Alone Inter-Frame Attention in Video Models","date":"2022-06-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mlp-3d-a-mlp-like-3d-architecture-with-1","title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","date":"2022-06-13","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","rows_on_this_dataset":2,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":9,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/rethinking-zero-shot-action-recognition","title":"Rethinking Zero-shot Action Recognition: Learning from Latent Atomic Actions","date":"2022-03-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/videomae-masked-autoencoders-are-data-1","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","date":"2022-03-23","rows_on_this_dataset":5,"code_links":9,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":9,"samples_unverified":4,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/online-skeleton-based-action-recognition-with","title":"Continual Spatio-Temporal Graph Convolutional Networks","date":"2022-03-21","rows_on_this_dataset":18,"code_links":1,"syntology":null},{"paper":"/paper/direcformer-a-directed-attention-in","title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","date":"2022-03-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":4,"samples_unverified":4,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omnivore-a-single-model-for-many-visual","title":"Omnivore: A Single Model for Many Visual Modalities","date":"2022-01-20","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multiview-transformers-for-video-recognition","title":"Multiview Transformers for Video Recognition","date":"2022-01-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/masked-feature-prediction-for-self-supervised","title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","date":"2021-12-16","rows_on_this_dataset":2,"code_links":6,"syntology":null},{"paper":"/paper/co-training-transformer-with-videos-and","title":"Co-training Transformer with Videos and Images Improves Action Recognition","date":"2021-12-14","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/self-supervised-video-transformer","title":"Self-supervised Video Transformer","date":"2021-12-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/improved-multiscale-vision-transformers-for","title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","date":"2021-12-02","rows_on_this_dataset":2,"code_links":9,"syntology":null},{"paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","date":"2021-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/florence-a-new-foundation-model-for-computer","title":"Florence: A New Foundation Model for Computer Vision","date":"2021-11-22","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","title":"Swin Transformer V2: Scaling Up Capacity and Resolution","date":"2021-11-18","rows_on_this_dataset":1,"code_links":23,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":30,"samples_ran":3,"samples_unverified":27,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tada-temporally-adaptive-convolutions-for-1","title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","date":"2021-10-12","rows_on_this_dataset":4,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/uniformer-unified-transformer-for-efficient","title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","date":"2021-09-29","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/actionclip-a-new-paradigm-for-video-action","title":"ActionCLIP: A New Paradigm for Video Action Recognition","date":"2021-09-17","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":5,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/revisiting-3d-resnets-for-video-recognition","title":"Revisiting 3D ResNets for Video Recognition","date":"2021-09-03","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/learning-multi-granular-spatio-temporal-graph","title":"Learning Multi-Granular Spatio-Temporal Graph Network for Skeleton-based Action Recognition","date":"2021-08-10","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/elaborative-rehearsal-for-zero-shot-action","title":"Elaborative Rehearsal for Zero-shot Action Recognition","date":"2021-08-05","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":3,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ccvs-context-aware-controllable-video","title":"CCVS: Context-aware Controllable Video Synthesis","date":"2021-07-16","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":3,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/generic-event-boundary-detection-challenge-at","title":"Generic Event Boundary Detection Challenge at CVPR 2021 Technical Report: Cascaded Temporal Attention Network (CASTANET)","date":"2021-07-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/attention-bottlenecks-for-multimodal-fusion","title":"Attention Bottlenecks for Multimodal Fusion","date":"2021-06-30","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/video-swin-transformer","title":"Video Swin Transformer","date":"2021-06-24","rows_on_this_dataset":6,"code_links":15,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":32,"samples_ran":7,"samples_unverified":25,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vimpac-video-pre-training-via-masked-token","title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","date":"2021-06-21","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","date":"2021-06-21","rows_on_this_dataset":1,"code_links":11,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/keeping-your-eye-on-the-ball-trajectory","title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","date":"2021-06-09","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ct-net-channel-tensorization-network-for-1","title":"CT-Net: Channel Tensorization Network for Video Classification","date":"2021-06-03","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":10,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/continual-3d-convolutional-neural-networks","title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","date":"2021-05-31","rows_on_this_dataset":21,"code_links":1,"syntology":null},{"paper":"/paper/revisiting-skeleton-based-action-recognition","title":"Revisiting Skeleton-based Action Recognition","date":"2021-04-28","rows_on_this_dataset":2,"code_links":4,"syntology":null},{"paper":"/paper/vidtr-video-transformer-without-convolutions","title":"VidTr: Video Transformer Without Convolutions","date":"2021-04-23","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/vatt-transformers-for-multimodal-self","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","date":"2021-04-22","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multiscale-vision-transformers","title":"Multiscale Vision Transformers","date":"2021-04-22","rows_on_this_dataset":4,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":26,"samples_ran":13,"samples_unverified":13,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-classification-with-finecoarse-networks","title":"Busy-Quiet Video Disentangling for Video Classification","date":"2021-03-29","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/2103-15691","title":"ViViT: A Video Vision Transformer","date":"2021-03-29","rows_on_this_dataset":2,"code_links":10,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":14,"samples_unverified":7,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/an-image-is-worth-16x16-words-what-is-a-video","title":"An Image is Worth 16x16 Words, What is a Video Worth?","date":"2021-03-25","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/movinets-mobile-video-networks-for-efficient","title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","date":"2021-03-21","rows_on_this_dataset":7,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":8,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/predicting-video-with-vqvae-1","title":"Predicting Video with VQVAE","date":"2021-03-02","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/is-space-time-attention-all-you-need-for","title":"Is Space-Time Attention All You Need for Video Understanding?","date":"2021-02-09","rows_on_this_dataset":3,"code_links":16,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":43,"samples_ran":35,"samples_unverified":8,"pointer_only_for_licence":14,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-transformer-network","title":"Video Transformer Network","date":"2021-02-01","rows_on_this_dataset":4,"code_links":1,"syntology":null},{"paper":"/paper/tdn-temporal-difference-networks-for","title":"TDN: Temporal Difference Networks for Efficient Action Recognition","date":"2020-12-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mvfnet-multi-view-fusion-network-for","title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","date":"2020-12-13","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/pose-refinement-graph-convolutional-network","title":"Pose Refinement Graph Convolutional Network for Skeleton-based Action Recognition","date":"2020-10-14","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/all-about-knowledge-graphs-for-actions","title":"All About Knowledge Graphs for Actions","date":"2020-08-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/spatial-temporal-transformer-network-for","title":"Skeleton-based Action Recognition via Spatial and Temporal Transformer Networks","date":"2020-08-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/spatiotemporal-contrastive-video","title":"Spatiotemporal Contrastive Video Representation Learning","date":"2020-08-09","rows_on_this_dataset":3,"code_links":4,"syntology":null},{"paper":"/paper/dynamic-gcn-context-enriched-topology","title":"Dynamic GCN: Context-enriched Topology Learning for Skeleton-based Action Recognition","date":"2020-07-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/motionsqueeze-neural-motion-feature-learning","title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","date":"2020-07-20","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":3,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/region-based-non-local-operation-for-video","title":"Region-based Non-local Operation for Video Classification","date":"2020-07-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/latent-video-transformer","title":"Latent Video Transformer","date":"2020-06-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":1,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/x3d-expanding-architectures-for-efficient","title":"X3D: Expanding Architectures for Efficient Video Recognition","date":"2020-04-09","rows_on_this_dataset":4,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":2,"samples_unverified":13,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/disentangling-and-unifying-graph-convolutions","title":"Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition","date":"2020-03-31","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omni-sourced-webly-supervised-learning-for","title":"Omni-sourced Webly-supervised Learning for Video Recognition","date":"2020-03-29","rows_on_this_dataset":3,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":0,"samples_unverified":13,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporal-extension-module-for-skeleton-based-1","title":"Temporal Extension Module for Skeleton-Based Action Recognition","date":"2020-03-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/predictively-encoded-graph-convolutional","title":"Predictively Encoded Graph Convolutional Network for Noise-Robust Skeleton-based Action Recognition","date":"2020-03-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/transformation-based-adversarial-video","title":"Transformation-based Adversarial Video Prediction on Large-Scale Data","date":"2020-03-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/centrality-graph-convolutional-networks-for","title":"Unifying Graph Embedding Features with Graph Convolutional Networks for Skeleton-based Action Recognition","date":"2020-03-06","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/skeleton-based-action-recognition-with-multi","title":"Skeleton-Based Action Recognition with Multi-Stream Adaptive Graph Convolutional Networks","date":"2019-12-15","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/more-is-less-learning-efficient-video-1","title":"More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation","date":"2019-12-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-multigrid-method-for-efficiently-training","title":"A Multigrid Method for Efficiently Training Video Models","date":"2019-12-02","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":2,"samples_unverified":8,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/an-attention-enhanced-recurrent-graph","title":"An Attention-Enhanced Recurrent Graph Convolutional Network for Skeleton-Based Action Recognition","date":"2019-11-27","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/learning-graph-convolutional-network-for","title":"Learning Graph Convolutional Network for Skeleton-based Human Action Recognition by Neural Searching","date":"2019-11-11","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/chirality-nets-for-human-pose-regression","title":"Chirality Nets for Human Pose Regression","date":"2019-10-31","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":0,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/190807625","title":"Action recognition with spatial-temporal discriminative filter banks","date":"2019-08-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/stm-spatiotemporal-and-motion-encoding-for","title":"STM: SpatioTemporal and Motion Encoding for Action Recognition","date":"2019-08-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/two-stream-video-classification-with-cross","title":"Two-Stream Video Classification with Cross-Modality Attention","date":"2019-08-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/spatiotemporal-graph-routing-for-skeleton","title":"Spatiotemporal graph routing for skeleton-based action recognition","date":"2019-07-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/efficient-video-generation-on-complex","title":"Adversarial Video Generation on Complex Datasets","date":"2019-07-15","rows_on_this_dataset":4,"code_links":1,"syntology":null},{"paper":"/paper/learning-spatio-temporal-representation-with-3","title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","date":"2019-06-13","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/faster-recurrent-networks-for-video","title":"FASTER Recurrent Networks for Efficient Video Classification","date":"2019-06-10","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/video-modeling-with-correlation-networks","title":"Video Modeling with Correlation Networks","date":"2019-06-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/scaling-autoregressive-video-models","title":"Scaling Autoregressive Video Models","date":"2019-06-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/190600550","title":"Global Textual Relation Embedding for Relational Understanding","date":"2019-06-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/skeleton-based-action-recognition-with-4","title":"Skeleton-Based Action Recognition With Directed Graph Neural Networks","date":"2019-06-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mars-motion-augmented-rgb-stream-for-action","title":"MARS: Motion-Augmented RGB Stream for Action Recognition","date":"2019-06-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/collaborative-spatiotemporal-feature-learning","title":"Collaborative Spatiotemporal Feature Learning for Video Action Recognition","date":"2019-06-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/what-makes-training-multi-modal-networks-hard","title":"What Makes Training Multi-Modal Classification Networks Hard?","date":"2019-05-29","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":1,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/large-scale-weakly-supervised-pre-training","title":"Large-scale weakly-supervised pre-training for video action recognition","date":"2019-05-02","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":0,"samples_unverified":21,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/actional-structural-graph-convolutional","title":"Actional-Structural Graph Convolutional Networks for Skeleton-based Action Recognition","date":"2019-04-26","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":7,"samples_unverified":11,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/holistic-large-scale-video-understanding","title":"Large Scale Holistic Video Understanding","date":"2019-04-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/drop-an-octave-reducing-spatial-redundancy-in","title":"Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution","date":"2019-04-10","rows_on_this_dataset":1,"code_links":28,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":34,"samples_ran":14,"samples_unverified":20,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-classification-with-channel-separated","title":"Video Classification with Channel-Separated Convolutional Networks","date":"2019-04-04","rows_on_this_dataset":5,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/d3d-distilled-3d-networks-for-video-action","title":"D3D: Distilled 3D Networks for Video Action Recognition","date":"2018-12-19","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/slowfast-networks-for-video-recognition","title":"SlowFast Networks for Video Recognition","date":"2018-12-10","rows_on_this_dataset":6,"code_links":15,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":0,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/evolving-space-time-neural-architectures-for","title":"Evolving Space-Time Neural Architectures for Videos","date":"2018-11-26","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/temporal-shift-module-for-efficient-video","title":"TSM: Temporal Shift Module for Efficient Video Understanding","date":"2018-11-20","rows_on_this_dataset":1,"code_links":13,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":16,"samples_ran":6,"samples_unverified":10,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/skeleton-based-action-recognition-with","title":"Skeleton-Based Action Recognition with Synchronous Local and Non-local Spatio-temporal Learning and Frequency Attention","date":"2018-11-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/a2-nets-double-attention-networks","title":"$A^2$-Nets: Double Attention Networks","date":"2018-10-27","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/representation-flow-for-action-recognition","title":"Representation Flow for Action Recognition","date":"2018-10-02","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/multi-fiber-networks-for-video-recognition","title":"Multi-Fiber Networks for Video Recognition","date":"2018-07-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/rethinking-spatiotemporal-feature-learning","title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","date":"2017-12-13","rows_on_this_dataset":3,"code_links":2,"syntology":null},{"paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","rows_on_this_dataset":6,"code_links":24,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/appearance-and-relation-networks-for-video","title":"Appearance-and-Relation Networks for Video Classification","date":"2017-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/non-local-neural-networks","title":"Non-local Neural Networks","date":"2017-11-21","rows_on_this_dataset":1,"code_links":32,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/convnet-architecture-search-for","title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","date":"2017-08-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/revisiting-the-effectiveness-of-off-the-shelf","title":"Revisiting the Effectiveness of Off-the-shelf Temporal Modeling Approaches for Large-scale Video Classification","date":"2017-08-12","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/quo-vadis-action-recognition-a-new-model-and","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","date":"2017-05-22","rows_on_this_dataset":1,"code_links":34,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":28,"samples_ran":16,"samples_unverified":12,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-a-deep-embedding-model-for-zero-shot","title":"Learning a Deep Embedding Model for Zero-Shot Learning","date":"2016-11-15","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/temporal-segment-networks-towards-good","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","date":"2016-08-02","rows_on_this_dataset":1,"code_links":22,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":24,"samples_ran":2,"samples_unverified":22,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/an-embarrassingly-simple-approach-to-zero","title":"An embarrassingly simple approach to zero-shot learning","date":"2015-07-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/label-embedding-for-image-classification","title":"Label-Embedding for Image Classification","date":"2015-03-30","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/evaluation-of-output-embeddings-for-fine","title":"Evaluation of Output Embeddings for Fine-Grained Image Classification","date":"2014-09-30","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/devise-a-deep-visual-semantic-embedding-model","title":"DeViSE: A Deep Visual-Semantic Embedding Model","date":"2013-12-01","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":77,"samples_harvested":820,"samples_ran":360,"samples_unverified":460,"pointer_only_for_licence":140,"papers_with_no_sample_that_ran":10,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}