{"url":"/task/zero-shot-action-recognition","name":"Zero-Shot Action Recognition","slug":"zero-shot-action-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":83,"papers_with_code":40,"benchmarks":7,"benchmark_tables_in_archive":7,"benchmark_tables_shown":7,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":6,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","slug":"zero-shot-action-recognition-on-ucf101","dataset":"UCF101","dataset_url":"/dataset/ucf101","rows_in_archive":35,"metrics":["Top-1 Accuracy","Top-5 accuracy"],"first_row_in_archive_order":{"model":"OTI(ViT-L/14)","paper_title":"Orthogonal Temporal Interpolation for Zero-Shot Video Recognition","paper_url":"/paper/orthogonal-temporal-interpolation-for-zero","paper_date":"2023-08-14","arxiv_id":"2308.06897","code_links":[{"title":"sweetorangezhuyan/mm2023_oti","url":"https://github.com/sweetorangezhuyan/mm2023_oti"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/zero-shot-action-recognition-on-hmdb51","slug":"zero-shot-action-recognition-on-hmdb51","dataset":"HMDB51","dataset_url":"/dataset/hmdb51","rows_in_archive":29,"metrics":["Top-1 Accuracy","Top-5 Accuracy","Accuracy"],"first_row_in_archive_order":{"model":"MOV (ViT-L/14)","paper_title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","paper_url":"/paper/multimodal-open-vocabulary-video","paper_date":"2022-07-15","arxiv_id":"2207.07646","code_links":[],"syntology":null}},{"leaderboard":"/sota/zero-shot-action-recognition-on-kinetics","slug":"zero-shot-action-recognition-on-kinetics","dataset":"Kinetics","dataset_url":"/dataset/kinetics","rows_in_archive":20,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"TC-CLIP","paper_title":"Leveraging Temporal Contextualization for Video Action Recognition","paper_url":"/paper/leveraging-temporal-contextualization-for","paper_date":"2024-04-15","arxiv_id":"2404.09490","code_links":[{"title":"naver-ai/tc-clip","url":"https://github.com/naver-ai/tc-clip"},{"title":"naver-ai/dawin","url":"https://github.com/naver-ai/dawin"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":4}}},{"leaderboard":"/sota/zero-shot-action-recognition-on-olympics","slug":"zero-shot-action-recognition-on-olympics","dataset":"Olympics","dataset_url":null,"rows_in_archive":9,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"SPOT","paper_title":"Synthetic Sample Selection for Generalized Zero-Shot Learning","paper_url":"/paper/synthetic-sample-selection-for-generalized","paper_date":"2023-04-06","arxiv_id":"2304.02846","code_links":[],"syntology":null}},{"leaderboard":"/sota/zero-shot-action-recognition-on-activitynet","slug":"zero-shot-action-recognition-on-activitynet","dataset":"ActivityNet","dataset_url":"/dataset/activitynet","rows_in_archive":5,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"BIKE","paper_title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","paper_url":"/paper/bidirectional-cross-modal-knowledge","paper_date":"2022-12-31","arxiv_id":"2301.00182","code_links":[{"title":"whwu95/Cap4Video","url":"https://github.com/whwu95/Cap4Video"},{"title":"whwu95/text4vis","url":"https://github.com/whwu95/text4vis"},{"title":"whwu95/GPT4Vis","url":"https://github.com/whwu95/GPT4Vis"},{"title":"whwu95/BIKE","url":"https://github.com/whwu95/BIKE"},{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-action-recognition-on-charades-1","slug":"zero-shot-action-recognition-on-charades-1","dataset":"Charades","dataset_url":"/dataset/charades","rows_in_archive":4,"metrics":["mAP"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-action-recognition-on-thumos-14","slug":"zero-shot-action-recognition-on-thumos-14","dataset":"THUMOS' 14","dataset_url":"/dataset/thumos14-1","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/hmdb51","name":"HMDB51","full_name":"","num_papers_in_archive":839},{"url":"/dataset/activitynet","name":"ActivityNet","full_name":"","num_papers_in_archive":807},{"url":"/dataset/charades","name":"Charades","full_name":"","num_papers_in_archive":428},{"url":"/dataset/thumos14-1","name":"THUMOS14","full_name":"","num_papers_in_archive":318}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":40,"tagged_in_all":83,"items":[{"url":"/paper/languagebind-extending-video-language","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","date":"2023-10-03","arxiv_id":"2310.01852","repositories_listed":6,"syntology":{"n":14,"n_ran":7,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/bidirectional-cross-modal-knowledge","title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","date":"2022-12-31","arxiv_id":"2301.00182","repositories_listed":5,"syntology":null},{"url":"/paper/transferring-textual-knowledge-for-visual","title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","date":"2022-07-04","arxiv_id":"2207.01297","repositories_listed":5,"syntology":null},{"url":"/paper/eva-clip-improved-training-techniques-for","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","date":"2023-03-27","arxiv_id":"2303.15389","repositories_listed":4,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/learning-a-deep-embedding-model-for-zero-shot","title":"Learning a Deep Embedding Model for Zero-Shot Learning","date":"2016-11-15","arxiv_id":"1611.05088","repositories_listed":4,"syntology":null},{"url":"/paper/leveraging-temporal-contextualization-for","title":"Leveraging Temporal Contextualization for Video Action Recognition","date":"2024-04-15","arxiv_id":"2404.09490","repositories_listed":2,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":4}},{"url":"/paper/expanding-language-image-pretrained-models","title":"Expanding Language-Image Pretrained Models for General Video Recognition","date":"2022-08-04","arxiv_id":"2208.02816","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/fitclip-refining-large-scale-pretrained-image","title":"FitCLIP: Refining Large-Scale Pretrained Image-Text Models for Zero-Shot Video Understanding Tasks","date":"2022-03-24","arxiv_id":"2203.13371","repositories_listed":2,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/bridgeformer-bridging-video-text-retrieval","title":"Bridging Video-text Retrieval with Multiple Choice Questions","date":"2022-01-13","arxiv_id":"2201.04850","repositories_listed":2,"syntology":{"n":24,"n_ran":13,"n_unverified":11,"n_pointer_only":6}},{"url":"/paper/actionclip-a-new-paradigm-for-video-action","title":"ActionCLIP: A New Paradigm for Video Action Recognition","date":"2021-09-17","arxiv_id":"2109.08472","repositories_listed":2,"syntology":{"n":9,"n_ran":5,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/label-embedding-for-image-classification","title":"Label-Embedding for Image Classification","date":"2015-03-30","arxiv_id":"1503.08677","repositories_listed":2,"syntology":null},{"url":"/paper/evaluation-of-output-embeddings-for-fine","title":"Evaluation of Output Embeddings for Fine-Grained Image Classification","date":"2014-09-30","arxiv_id":"1409.8403","repositories_listed":2,"syntology":null},{"url":"/paper/building-a-multi-modal-spatiotemporal-expert","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","date":"2024-12-13","arxiv_id":"2412.09895","repositories_listed":1,"syntology":null},{"url":"/paper/locate-gat-modeling-multi-scale-local-context","title":"LoCATe-GAT: Modeling Multi-Scale Local Context and Action Relationships for Zero-Shot Action Recognition","date":"2024-11-27","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/tdsm-triplet-diffusion-for-skeleton-text","title":"TDSM: Triplet Diffusion for Skeleton-Text Matching in Zero-Shot Action Recognition","date":"2024-11-16","arxiv_id":"2411.10745","repositories_listed":1,"syntology":null},{"url":"/paper/part-aware-unified-representation-of-language-1","title":"Part-aware Unified Representation of Language and Skeleton for Zero-shot Action Recognition","date":"2024-06-19","arxiv_id":"2406.13327","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/ez-clip-efficient-zeroshot-video-action","title":"EZ-CLIP: Efficient Zeroshot Video Action Recognition","date":"2023-12-13","arxiv_id":"2312.08010","repositories_listed":1,"syntology":{"n":13,"n_ran":9,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/ost-refining-text-knowledge-with-optimal","title":"OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition","date":"2023-11-30","arxiv_id":"2312.00096","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/telling-stories-for-common-sense-zero-shot","title":"Telling Stories for Common Sense Zero-Shot Action Recognition","date":"2023-09-29","arxiv_id":"2309.17327","repositories_listed":1,"syntology":null},{"url":"/paper/orthogonal-temporal-interpolation-for-zero","title":"Orthogonal Temporal Interpolation for Zero-Shot Video Recognition","date":"2023-08-14","arxiv_id":"2308.06897","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/msqnet-actor-agnostic-action-recognition-with","title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","date":"2023-07-20","arxiv_id":"2307.10763","repositories_listed":1,"syntology":null},{"url":"/paper/internvid-a-large-scale-video-text-dataset","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","date":"2023-07-13","arxiv_id":"2307.06942","repositories_listed":1,"syntology":null},{"url":"/paper/vita-clip-video-and-text-adaptive-clip-via","title":"Vita-CLIP: Video and text adaptive CLIP via Multimodal Prompting","date":"2023-04-06","arxiv_id":"2304.03307","repositories_listed":1,"syntology":{"n":9,"n_ran":5,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/match-expand-and-improve-unsupervised","title":"MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language Knowledge","date":"2023-03-15","arxiv_id":"2303.08914","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/global-semantic-descriptors-for-zero-shot","title":"Global Semantic Descriptors for Zero-Shot Action Recognition","date":"2022-09-24","arxiv_id":"2209.12061","repositories_listed":1,"syntology":null},{"url":"/paper/a-clip-hitchhiker-s-guide-to-long-video","title":"A CLIP-Hitchhiker's Guide to Long Video Retrieval","date":"2022-05-17","arxiv_id":"2205.08508","repositories_listed":1,"syntology":null},{"url":"/paper/miles-visual-bert-pre-training-with-injected","title":"MILES: Visual BERT Pre-training with Injected Language Semantics for Video-text Retrieval","date":"2022-04-26","arxiv_id":"2204.12408","repositories_listed":1,"syntology":null},{"url":"/paper/alignment-uniformity-aware-representation","title":"Alignment-Uniformity aware Representation Learning for Zero-shot Video Classification","date":"2022-03-29","arxiv_id":"2203.15381","repositories_listed":1,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":5}},{"url":"/paper/rethinking-zero-shot-action-recognition","title":"Rethinking Zero-shot Action Recognition: Learning from Latent Atomic Actions","date":"2022-03-28","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/zero-shot-action-recognition-with-transformer","title":"End-to-End Semantic Video Transformer for Zero-Shot Action Recognition","date":"2022-03-10","arxiv_id":"2203.05156","repositories_listed":1,"syntology":null}],"syntology_records":14,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}