{"url":"/dataset/drive-act","name":"Drive&Act","full_name":null,"description_markdown":"The Drive&Act dataset is a state of the art multi modal benchmark for driver behavior recognition. The dataset includes 3D skeletons in addition to frame-wise hierarchical labels of 9.6 Million frames captured by 6 different views and 3 modalities (RGB, IR and depth).\r\n\r\nIt offers following key features:\r\n\r\n* 12h of video data in 29 long sequences\r\n* Calibrated multi view camera system with 5 views\r\n* Multi modal videos: NIR, Depth and Color data\r\n* Markerless motion capture: 3D Body Pose and Head Pose\r\n* Model of the static interior of the car\r\n* 83 manually annotated hierarchical activity labels:\r\n    * Level 1: Long running tasks (12)\r\n    * Level 2: Semantic actions (34)\r\n    * Level 3: Object Interaction tripplets [action|object|location] (6|17|14)\r\n\r\nSource: [Drive&Act: A Multi-Modal Dataset for Fine-Grained Driver Behavior Recognition in Autonomous Vehicles](/paper/driveact-a-multi-modal-dataset-for-fine)","description_withheld":null,"homepage":"https://www.driveandact.com/","introduced_date":null,"introduced_date_note":null,"introduced_by":{"paper":"/paper/driveact-a-multi-modal-dataset-for-fine","title":"Drive&Act: A Multi-Modal Dataset for Fine-Grained Driver Behavior Recognition in Autonomous Vehicles","first_author":"Manuel Martin","url":null},"license":null,"modalities":[{"name":"Videos","url":"/datasets/modality/videos"},{"name":"3D","url":"/datasets/modality/3d"},{"name":"RGB-D","url":"/datasets/modality/rgb-d"}],"tasks":[{"name":"Activity Recognition","url":"/task/activity-recognition","datasets_with_task":"/datasets/task/activity-recognition"},{"name":"Action Recognition","url":"/task/action-recognition-in-videos","datasets_with_task":"/datasets/task/action-recognition-in-videos"},{"name":"Autonomous Vehicles","url":"/task/autonomous-vehicles","datasets_with_task":"/datasets/task/autonomous-vehicles"},{"name":"Skeleton Based Action Recognition","url":"/task/skeleton-based-action-recognition","datasets_with_task":"/datasets/task/skeleton-based-action-recognition"}],"languages":[],"variants":["Drive&Act"],"data_loaders":[],"num_papers_in_archive":26,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/skeleton-based-action-recognition-on-drive","task":"Skeleton Based Action Recognition","dataset_variant":"Drive&Act","rows":2,"metrics":["mean per-class accuracy"],"first_row_in_archive_order":{"model":"dyalyt","paper":"/paper/do-you-act-like-you-talk-exploring-pose-based","metrics":{"mean per-class accuracy":"43.59"},"code_links":[{"title":"pablopardod/dyalyt","url":"https://github.com/pablopardod/dyalyt"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/do-you-act-like-you-talk-exploring-pose-based","title":"Do You Act Like You Talk? Exploring Pose-based Driver Action Classification with Speech Recognition Networks","date":"2024-07-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-spatio-temporal-multilayer-perceptron-for","title":"A Spatio-Temporal Multilayer Perceptron for Gesture Recognition","date":"2022-04-25","rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}