{"url":"/task/activity-recognition","name":"Activity Recognition","slug":"activity-recognition","description_markdown":"Human **Activity Recognition** is the problem of identifying events performed by humans given a video input. It is formulated as a binary (or multiclass) classification problem of outputting activity class labels. Activity Recognition is an important problem with many societal applications including smart surveillance, video search/retrieval, intelligent robots, and other monitoring systems.\n\n\n<span class=\"description-source\">Source: [Learning Latent Sub-events in Activity Videos Using Temporal Attention Filters ](https://arxiv.org/abs/1605.08140)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Robots","url":"/area/robots"},{"name":"Time Series","url":"/area/time-series"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":1322,"papers_with_code":330,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":30,"subtasks":11,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/activity-recognition-on-rwf-2000","slug":"activity-recognition-on-rwf-2000","dataset":"RWF-2000","dataset_url":"/dataset/rwf-2000","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling","paper_title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","paper_url":"/paper/unified-keypoint-based-action-recognition","paper_date":"2023-03-27","arxiv_id":"2303.15270","code_links":[],"syntology":null}},{"leaderboard":"/sota/activity-recognition-on-stanford40","slug":"activity-recognition-on-stanford40","dataset":"Stanford40","dataset_url":"/dataset/stanford40","rows_in_archive":2,"metrics":["Top-3 Accuracy (%)"],"first_row_in_archive_order":{"model":"FocusCLIP","paper_title":"Human Pose Descriptions and Subject-Focused Attention for Improved Zero-Shot Transfer in Human-Centric Classification Tasks","paper_url":"/paper/focusclip-multimodal-subject-level-guidance","paper_date":"2024-03-11","arxiv_id":"2403.06904","code_links":[],"syntology":null}},{"leaderboard":"/sota/activity-recognition-on-first-person-hand","slug":"activity-recognition-on-first-person-hand","dataset":"First-Person Hand Action Benchmark","dataset_url":"/dataset/first-person-hand-action-benchmark","rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Boutaleb et al.","paper_title":"Multi-stage RGB-based Transfer Learning Pipeline for Hand Activity Recognition","paper_url":"/paper/multi-stage-rgb-based-transfer-learning","paper_date":"2022-02-08","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/activity-recognition-on-self-stimulatory","slug":"activity-recognition-on-self-stimulatory","dataset":"Self-Stimulatory Behavior Dataset","dataset_url":"/dataset/self-stimulatory-behavior-dataset-1","rows_in_archive":1,"metrics":["Activity Recognition"],"first_row_in_archive_order":{"model":"all-landmark-model","paper_title":"Classification of Abnormal Hand Movement for Aiding in Autism Detection: Machine Learning Study","paper_url":"/paper/activity-recognition-for-autism-diagnosis","paper_date":"2021-08-18","arxiv_id":"2108.07917","code_links":[{"title":"anish-lakkapragada/ActivRecognition-Autism-Diagnosis","url":"https://github.com/anish-lakkapragada/ActivRecognition-Autism-Diagnosis"}],"syntology":null}}],"datasets":[{"url":"/dataset/tacos-multi-level-corpus","name":"TACoS Multi-Level Corpus","full_name":"","num_papers_in_archive":45},{"url":"/dataset/gazefollow","name":"GazeFollow","full_name":"GazeFollow","num_papers_in_archive":38},{"url":"/dataset/motionsense","name":"MotionSense","full_name":null,"num_papers_in_archive":35},{"url":"/dataset/drive-act","name":"Drive&Act","full_name":"","num_papers_in_archive":26},{"url":"/dataset/meva","name":"MEVA","full_name":"Multiview Extended Video with Activities","num_papers_in_archive":17},{"url":"/dataset/rwf-2000","name":"RWF-2000","full_name":"","num_papers_in_archive":16},{"url":"/dataset/first-person-hand-action-benchmark","name":"First-Person Hand Action Benchmark","full_name":"","num_papers_in_archive":15},{"url":"/dataset/movi","name":"MoVi","full_name":"Large Multipurpose Motion and Video Dataset","num_papers_in_archive":12},{"url":"/dataset/egohos","name":"EgoHOS","full_name":"Fine-Grained Egocentric Hand-Object Segmentation Dataset","num_papers_in_archive":9},{"url":"/dataset/home-action-genome","name":"Home Action Genome","full_name":"","num_papers_in_archive":9},{"url":"/dataset/misaw","name":"MISAW","full_name":"MIcro-Surgical Anastomose Workflow recognition on training sessions","num_papers_in_archive":8},{"url":"/dataset/operanet","name":"OPERAnet","full_name":"","num_papers_in_archive":8},{"url":"/dataset/eyth","name":"EYTH","full_name":"EgoYouTubeHands","num_papers_in_archive":7},{"url":"/dataset/msr-actionpairs","name":"MSR ActionPairs","full_name":"","num_papers_in_archive":7},{"url":"/dataset/mpii-cooking-2-dataset","name":"MPII Cooking 2 Dataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/simitate","name":"Simitate","full_name":null,"num_papers_in_archive":5},{"url":"/dataset/sims4action","name":"Sims4Action","full_name":"","num_papers_in_archive":5},{"url":"/dataset/unimib-shar","name":"UniMiB SHAR","full_name":"","num_papers_in_archive":4},{"url":"/dataset/mex","name":"MEx","full_name":"","num_papers_in_archive":3},{"url":"/dataset/mmdb","name":"MMDB","full_name":"Multimodal Dyadic Behavior","num_papers_in_archive":3},{"url":"/dataset/petraw","name":"PETRAW","full_name":"PEg TRAnsfer Workflow recognition by different modalities","num_papers_in_archive":3},{"url":"/dataset/egok360","name":"EGOK360","full_name":"","num_papers_in_archive":2},{"url":"/dataset/mphoi-72","name":"MPHOI-72","full_name":"Multi-person Human-object Interaction Dataset 72","num_papers_in_archive":2},{"url":"/dataset/stanford40","name":"Stanford40","full_name":"Stanford 40 Actions","num_papers_in_archive":2},{"url":"/dataset/clad","name":"CLAD","full_name":"Complex and Long Activities Dataset","num_papers_in_archive":1},{"url":"/dataset/hascd","name":"HASCD","full_name":"Human Activity Segmentation Challenge Dataset","num_papers_in_archive":1},{"url":"/dataset/indra","name":"INDRA","full_name":"INdian Dataset for RoAd crossing","num_papers_in_archive":1},{"url":"/dataset/mosad","name":"MOSAD","full_name":"Mobile Sensing Human Activity Data Set","num_papers_in_archive":1},{"url":"/dataset/dahlia-daily-human-life-activity","name":"DAHLIA","full_name":"DAily Human Life Activity","num_papers_in_archive":0},{"url":"/dataset/infiniterep","name":"InfiniteRep","full_name":"InfiniteRep","num_papers_in_archive":0}],"subtasks":[{"url":"/task/action-recognition-in-videos","name":"Action Recognition"},{"url":"/task/concurrent-activity-recognition","name":"Concurrent Activity Recognition"},{"url":"/task/cross-domain-activity-recognition","name":"Cross-Domain Activity Recognition"},{"url":"/task/egocentric-activity-recognition","name":"Egocentric Activity Recognition"},{"url":"/task/group-activity-recognition","name":"Group Activity Recognition"},{"url":"/task/human-action-generation","name":"Human action generation"},{"url":"/task/human-activity-recognition","name":"Human Activity Recognition"},{"url":"/task/multimodal-activity-recognition","name":"Multimodal Activity Recognition"},{"url":"/task/muscle-computer-interfaces-mcis","name":"Muscle-Computer Interfaces (MCIs)"},{"url":"/task/recognizing-and-localizing-human-actions","name":"Recognizing And Localizing Human Actions"},{"url":"/task/stay-region-extraction","name":"Stay Region Extraction"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":330,"tagged_in_all":1322,"items":[{"url":"/paper/real-world-anomaly-detection-in-surveillance","title":"Real-world Anomaly Detection in Surveillance Videos","date":"2018-01-12","arxiv_id":"1801.04264","repositories_listed":9,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":4}},{"url":"/paper/multivariate-lstm-fcns-for-time-series","title":"Multivariate LSTM-FCNs for Time Series Classification","date":"2018-01-14","arxiv_id":"1801.04503","repositories_listed":7,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/cholectriplet2021-a-benchmark-challenge-for","title":"CholecTriplet2021: A benchmark challenge for surgical action triplet recognition","date":"2022-04-10","arxiv_id":"2204.04746","repositories_listed":6,"syntology":null},{"url":"/paper/representation-flow-for-action-recognition","title":"Representation Flow for Action Recognition","date":"2018-10-02","arxiv_id":"1810.01455","repositories_listed":5,"syntology":null},{"url":"/paper/temporal-relational-reasoning-in-videos","title":"Temporal Relational Reasoning in Videos","date":"2017-11-22","arxiv_id":"1711.08496","repositories_listed":5,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/understanding-the-vulnerability-of-skeleton","title":"Understanding the Vulnerability of Skeleton-based Human Activity Recognition via Black-box Attack","date":"2022-11-21","arxiv_id":"2211.11312","repositories_listed":4,"syntology":null},{"url":"/paper/discriminating-spatial-and-temporal-relevance","title":"Discriminating Spatial and Temporal Relevance in Deep Taylor Decompositions for Explainable Activity Recognition","date":"2019-08-05","arxiv_id":"1908.01536","repositories_listed":4,"syntology":null},{"url":"/paper/im2flow-motion-hallucination-from-static","title":"Im2Flow: Motion Hallucination from Static Images for Action Recognition","date":"2017-12-12","arxiv_id":"1712.04109","repositories_listed":4,"syntology":null},{"url":"/paper/deep-residual-bidir-lstm-for-human-activity","title":"Deep Residual Bidir-LSTM for Human Activity Recognition Using Wearable Sensors","date":"2017-08-22","arxiv_id":"1708.08989","repositories_listed":4,"syntology":null},{"url":"/paper/ts-lstm-and-temporal-inception-exploiting","title":"TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition","date":"2017-03-30","arxiv_id":"1703.10667","repositories_listed":4,"syntology":null},{"url":"/paper/hardvs-revisiting-human-activity-recognition","title":"HARDVS: Revisiting Human Activity Recognition with Dynamic Vision Sensors","date":"2022-11-17","arxiv_id":"2211.09648","repositories_listed":3,"syntology":null},{"url":"/paper/seco-exploring-sequence-supervision-for","title":"SeCo: Exploring Sequence Supervision for Unsupervised Representation Learning","date":"2020-08-03","arxiv_id":"2008.00975","repositories_listed":3,"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/towards-fairness-in-visual-recognition","title":"Towards Fairness in Visual Recognition: Effective Strategies for Bias Mitigation","date":"2019-11-26","arxiv_id":"1911.11834","repositories_listed":3,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/ntu-rgbd-120-a-large-scale-benchmark-for-3d","title":"NTU RGB+D 120: A Large-Scale Benchmark for 3D Human Activity Understanding","date":"2019-05-12","arxiv_id":"1905.04757","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/large-scale-weakly-supervised-pre-training","title":"Large-scale weakly-supervised pre-training for video action recognition","date":"2019-05-02","arxiv_id":"1905.00561","repositories_listed":3,"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}},{"url":"/paper/eidetic-3d-lstm-a-model-for-video-prediction","title":"Eidetic 3D LSTM: A Model for Video Prediction and Beyond","date":"2019-05-01","arxiv_id":null,"repositories_listed":3,"syntology":null},{"url":"/paper/fine-grained-activity-recognition-in-baseball","title":"Fine-grained Activity Recognition in Baseball Videos","date":"2018-04-09","arxiv_id":"1804.03247","repositories_listed":3,"syntology":null},{"url":"/paper/kernel-cross-correlator","title":"Kernel Cross-Correlator","date":"2017-09-12","arxiv_id":"1709.05936","repositories_listed":3,"syntology":null},{"url":"/paper/sez-harn-self-explainable-zero-shot-human","title":"SEZ-HARN: Self-Explainable Zero-shot Human Activity Recognition Network","date":"2025-06-25","arxiv_id":"2507.00050","repositories_listed":2,"syntology":null},{"url":"/paper/milliflow-scene-flow-estimation-on-mmwave","title":"milliFlow: Scene Flow Estimation on mmWave Radar Point Cloud for Human Motion Sensing","date":"2023-06-29","arxiv_id":"2306.17010","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/combining-public-human-activity-recognition","title":"Combining Public Human Activity Recognition Datasets to Mitigate Labeled Data Scarcity","date":"2023-06-23","arxiv_id":"2306.13735","repositories_listed":2,"syntology":null},{"url":"/paper/featfsda-towards-few-shot-domain-adaptation","title":"Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains","date":"2023-05-15","arxiv_id":"2305.08420","repositories_listed":2,"syntology":null},{"url":"/paper/rhm-robot-house-multi-view-human-activity","title":"RHM: Robot House Multi-view Human Activity Recognition Dataset","date":"2023-04-24","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/imu2clip-multimodal-contrastive-learning-for","title":"IMU2CLIP: Multimodal Contrastive Learning for IMU Motion Sensors from Egocentric Videos and Text","date":"2022-10-26","arxiv_id":"2210.14395","repositories_listed":2,"syntology":null},{"url":"/paper/deep-learning-and-its-applications-to-wifi","title":"SenseFi: A Library and Benchmark on Deep-Learning-Empowered WiFi Human Sensing","date":"2022-07-16","arxiv_id":"2207.07859","repositories_listed":2,"syntology":{"n":12,"n_ran":3,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/defending-black-box-skeleton-based-human","title":"Defending Black-box Skeleton-based Human Activity Classifiers","date":"2022-03-09","arxiv_id":"2203.04713","repositories_listed":2,"syntology":null},{"url":"/paper/transformer-networks-for-data-augmentation-of","title":"Transformer Networks for Data Augmentation of Human Physical Activity Recognition","date":"2021-09-02","arxiv_id":"2109.01081","repositories_listed":2,"syntology":null},{"url":"/paper/spatio-temporal-dynamic-inference-network-for","title":"Spatio-Temporal Dynamic Inference Network for Group Activity Recognition","date":"2021-08-26","arxiv_id":"2108.11743","repositories_listed":2,"syntology":{"n":12,"n_ran":1,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/adarnn-adaptive-learning-and-forecasting-of","title":"AdaRNN: Adaptive Learning and Forecasting of Time Series","date":"2021-08-10","arxiv_id":"2108.04443","repositories_listed":2,"syntology":null},{"url":"/paper/b-har-an-open-source-baseline-framework-for","title":"B-HAR: an open-source baseline framework for in depth study of human activity recognition datasets and workflows","date":"2021-01-23","arxiv_id":"2101.10870","repositories_listed":2,"syntology":null}],"syntology_records":10,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}