{"url":"/task/multimodal-activity-recognition","name":"Multimodal Activity Recognition","slug":"multimodal-activity-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Robots","url":"/area/robots"},{"name":"Time Series","url":"/area/time-series"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":30,"papers_with_code":12,"benchmarks":10,"benchmark_tables_in_archive":10,"benchmark_tables_shown":10,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":6,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/multimodal-activity-recognition-on-ev-action","slug":"multimodal-activity-recognition-on-ev-action","dataset":"EV-Action","dataset_url":null,"rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"TCN (Skeleton Kinect)","paper_title":"Interpretable 3D Human Action Analysis with Temporal Convolutional Networks","paper_url":"/paper/interpretable-3d-human-action-analysis-with","paper_date":"2017-04-14","arxiv_id":"1704.04516","code_links":[{"title":"TaeSoo-Kim/TCNActionRecognition","url":"https://github.com/TaeSoo-Kim/TCNActionRecognition"}],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","slug":"multimodal-activity-recognition-on-moments-in","dataset":"Moments in Time Dataset","dataset_url":null,"rows_in_archive":6,"metrics":["Top-1 (%)","Top-5 (%)"],"first_row_in_archive_order":{"model":"AssembleNet","paper_title":"AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures","paper_url":"/paper/assemblenet-searching-for-multi-stream-neural","paper_date":"2019-05-30","arxiv_id":"1905.13209","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/assemblenet"},{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/assemblenet"}],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-msr-daily-1","slug":"multimodal-activity-recognition-on-msr-daily-1","dataset":"MSR Daily Activity3D dataset","dataset_url":"/dataset/msrdailyactivity3d","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"DSSCA-SSLM (RGB+D)","paper_title":"Deep Multimodal Feature Analysis for Action Recognition in RGB+D Videos","paper_url":"/paper/deep-multimodal-feature-analysis-for-action","paper_date":"2016-03-23","arxiv_id":"1603.07120","code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-utd-mhad","slug":"multimodal-activity-recognition-on-utd-mhad","dataset":"UTD-MHAD","dataset_url":"/dataset/utd-mhad","rows_in_archive":5,"metrics":["Accuracy (CS)"],"first_row_in_archive_order":{"model":"PoseMap","paper_title":"Recognizing Human Actions as the Evolution of Pose Estimation Maps","paper_url":"/paper/recognizing-human-actions-as-the-evolution-of","paper_date":"2018-06-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-lborohar","slug":"multimodal-activity-recognition-on-lborohar","dataset":"LboroHAR","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Cubic SVM","paper_title":"Adaptive Feature Processing for Robust Human Activity Recognition on a Novel Multi-Modal Dataset","paper_url":"/paper/adaptive-feature-processing-for-robust-human","paper_date":"2019-01-09","arxiv_id":"1901.02858","code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-mmact","slug":"multimodal-activity-recognition-on-mmact","dataset":"MMAct","dataset_url":"/dataset/mmact","rows_in_archive":3,"metrics":["F1-Score (Cross-Session)","F1-Score (Cross-Subject)"],"first_row_in_archive_order":{"model":"MuMu","paper_title":"MuMu: Cooperative Multitask Learning-based Guided Multimodal Fusion","paper_url":"/paper/mumu-cooperative-multitask-learning-based","paper_date":"2022-02-22","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-nurse-care","slug":"multimodal-activity-recognition-on-nurse-care","dataset":"Nurse Care Activity Recognition Challenge","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy","Train F-measure"],"first_row_in_archive_order":{"model":"KNN","paper_title":"Can a simple approach identify complex nurse care activity?","paper_url":"/paper/can-a-simple-approach-identify-complex-nurse","paper_date":"2019-09-09","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-cmu-multi","slug":"multimodal-activity-recognition-on-cmu-multi","dataset":"CMU Multi-Modal Activity (CMU-MMAC)","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"RecCapsNet & LSTM (Camera and IMU)","paper_title":"Autonomous Human Activity Classification from Ego-vision Camera and Accelerometer Data","paper_url":"/paper/190513533","paper_date":"2019-05-28","arxiv_id":"1905.13533","code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-ucsd-mit","slug":"multimodal-activity-recognition-on-ucsd-mit","dataset":"UCSD-MIT Human Motion","dataset_url":"/dataset/ucsd","rows_in_archive":1,"metrics":["F1-score"],"first_row_in_archive_order":{"model":"HAMLET","paper_title":"HAMLET: A Hierarchical Multimodal Attention-based Human Activity Recognition Algorithm","paper_url":"/paper/hamlet-a-hierarchical-multimodal-attention-1","paper_date":"2020-08-03","arxiv_id":"2008.01148","code_links":[],"syntology":null}},{"leaderboard":"/sota/multimodal-activity-recognition-on-ut-kinect","slug":"multimodal-activity-recognition-on-ut-kinect","dataset":"UT-Kinect","dataset_url":"/dataset/ut-kinect","rows_in_archive":1,"metrics":["Accuracy (CS)"],"first_row_in_archive_order":{"model":"HAMLET","paper_title":"HAMLET: A Hierarchical Multimodal Attention-based Human Activity Recognition Algorithm","paper_url":"/paper/hamlet-a-hierarchical-multimodal-attention-1","paper_date":"2020-08-03","arxiv_id":"2008.01148","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/ucsd","name":"UCSD Ped2","full_name":"UCSD Anomaly Detection Dataset","num_papers_in_archive":92},{"url":"/dataset/ut-kinect","name":"UT-Kinect","full_name":"UTKinect-Action3D Dataset","num_papers_in_archive":70},{"url":"/dataset/utd-mhad","name":"UTD-MHAD","full_name":"","num_papers_in_archive":62},{"url":"/dataset/msrdailyactivity3d","name":"MSRDailyActivity3D","full_name":"","num_papers_in_archive":45},{"url":"/dataset/mmact","name":"MMAct","full_name":"","num_papers_in_archive":23},{"url":"/dataset/home-action-genome","name":"Home Action Genome","full_name":"","num_papers_in_archive":9}],"subtasks":[],"parent_tasks":[{"url":"/task/activity-recognition","name":"Activity Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":12,"of":12,"tagged_in_all":30,"items":[{"url":"/paper/spatial-temporal-graph-convolutional-networks-1","title":"Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2018-01-23","arxiv_id":"1801.07455","repositories_listed":24,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/temporal-segment-networks-towards-good","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","date":"2016-08-02","arxiv_id":"1608.00859","repositories_listed":22,"syntology":{"n":24,"n_ran":2,"n_unverified":22,"n_pointer_only":3}},{"url":"/paper/moments-in-time-dataset-one-million-videos","title":"Moments in Time Dataset: one million videos for event understanding","date":"2018-01-09","arxiv_id":"1801.03150","repositories_listed":4,"syntology":null},{"url":"/paper/gimme-signals-discriminative-signal-encoding","title":"Gimme Signals: Discriminative signal encoding for multimodal activity recognition","date":"2020-03-13","arxiv_id":"2003.06156","repositories_listed":2,"syntology":null},{"url":"/paper/assemblenet-searching-for-multi-stream-neural","title":"AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures","date":"2019-05-30","arxiv_id":"1905.13209","repositories_listed":2,"syntology":null},{"url":"/paper/operanet-a-multimodal-activity-recognition","title":"OPERAnet: A Multimodal Activity Recognition Dataset Acquired from Radio Frequency and Vision-based Sensors","date":"2021-10-08","arxiv_id":"2110.04239","repositories_listed":1,"syntology":null},{"url":"/paper/fusion-gcn-multimodal-action-recognition","title":"Fusion-GCN: Multimodal Action Recognition using Graph Convolutional Networks","date":"2021-09-27","arxiv_id":"2109.12946","repositories_listed":1,"syntology":null},{"url":"/paper/distilling-audio-visual-knowledge-by","title":"Distilling Audio-Visual Knowledge by Compositional Contrastive Learning","date":"2021-04-22","arxiv_id":"2104.10955","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/bayesian-hierarchical-dynamic-model-for-human","title":"Bayesian Hierarchical Dynamic Model for Human Action Recognition","date":"2019-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/190412602","title":"EV-Action: Electromyography-Vision Multi-Modal Action Dataset","date":"2019-04-20","arxiv_id":"1904.12602","repositories_listed":1,"syntology":null},{"url":"/paper/cross-modal-learning-by-hallucinating-missing","title":"Cross-modal Learning by Hallucinating Missing Modalities in RGB-D Vision","date":"2019-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/interpretable-3d-human-action-analysis-with","title":"Interpretable 3D Human Action Analysis with Temporal Convolutional Networks","date":"2017-04-14","arxiv_id":"1704.04516","repositories_listed":1,"syntology":null}],"syntology_records":3,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}