{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition-in-videos/papers/13","list_of":"/task/action-recognition-in-videos","task":"Action Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":28,"rows_per_page":100,"rows":[1201,1300],"of":2759,"counts":{"archive_papers_tagged":2759,"with_a_code_link":1058,"where_syntology_ran_a_sample":275,"not_listed_spam_title":0,"listed":2759,"listed_where_code_ran":275,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":232,"every_run_a_failure_of_syntologys_instrument":43,"listed_with_a_run_with_no_instrument_failure":232,"listed_every_run_a_failure_of_syntologys_instrument":43,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition-in-videos","prev":"/task/action-recognition-in-videos/papers/12","next":"/task/action-recognition-in-videos/papers/14","papers":[{"url":null,"slug":"flatten-video-action-recognition-is-an-image","title":"Flatten: Video Action Recognition is an Image Classification task","date":"2024-08-17","arxiv_id":"2408.09220","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-reversed-training-for-spiking-neural","title":"Temporal Reversed Training for Spiking Neural Networks with Generalized Spatio-Temporal Representation","date":"2024-08-17","arxiv_id":"2408.09108","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-physical-world-backdoor-attacks","title":"Towards Physical World Backdoor Attacks against Skeleton Action Recognition","date":"2024-08-16","arxiv_id":"2408.08671","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03097","title":"Prototype Learning for Micro-gesture Classification","date":"2024-08-06","arxiv_id":"2408.03097","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02033","title":"Enhancing Human Action Recognition and Violence Detection Through Deep Learning Audiovisual Fusion","date":"2024-08-04","arxiv_id":"2408.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01701","title":"Signal-SGN: A Spiking Graph Convolutional Network for Skeletal Action Recognition via Learning Temporal-Frequency Dynamics","date":"2024-08-03","arxiv_id":"2408.01701","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01766","title":"MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition","date":"2024-08-03","arxiv_id":"2408.01766","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-effective-are-self-supervised-models-for","title":"How Effective are Self-Supervised Models for Contact Identification in Videos","date":"2024-08-01","arxiv_id":"2408.00498","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-adapter-task-specific-adaptation-of","title":"Task-Adapter: Task-specific Adaptation of Image Models for Few-shot Action Recognition","date":"2024-08-01","arxiv_id":"2408.00249","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-robustness-in-rgb-skeleton-action","title":"Adversarial Robustness in RGB-Skeleton Action Recognition: Leveraging Attention Modality Reweighter","date":"2024-07-29","arxiv_id":"2407.19981","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-aligned-space-time-tokens-for-few","title":"Trajectory-aligned Space-time Tokens for Few-shot Action Recognition","date":"2024-07-25","arxiv_id":"2407.18249","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-and-cross-modal-transfer-for-zero-shot","title":"C3T: Cross-modal Transfer Through Time for Sensor-based Human Activity Recognition","date":"2024-07-23","arxiv_id":"2407.16803","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-review-of-few-shot-action","title":"A Comprehensive Review of Few-shot Action Recognition","date":"2024-07-20","arxiv_id":"2407.14744","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-vlms-be-used-on-videos-for-action","title":"Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators","date":"2024-07-20","arxiv_id":"2407.14834","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupled-prompt-adapter-tuning-for-continual","title":"Decoupled Prompt-Adapter Tuning for Continual Activity Recognition","date":"2024-07-20","arxiv_id":"2407.14811","repositories_listed":0,"syntology":null},{"url":null,"slug":"lortsar-low-rank-transformer-for-skeleton","title":"LORTSAR: Low-Rank Transformer for Skeleton-based Action Recognition","date":"2024-07-19","arxiv_id":"2407.14655","repositories_listed":0,"syntology":null},{"url":null,"slug":"pose-guided-multi-task-video-transformer-for","title":"Pose-guided multi-task video transformer for driver action recognition","date":"2024-07-18","arxiv_id":"2407.13750","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-centric-transformer-for-domain-adaptive","title":"Human-Centric Transformer for Domain Adaptive Action Recognition","date":"2024-07-15","arxiv_id":"2407.10860","repositories_listed":0,"syntology":null},{"url":null,"slug":"region-aware-image-based-human-action","title":"Region-aware Image-based Human Action Retrieval with Transformers","date":"2024-07-13","arxiv_id":"2407.09924","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-adversarial-transferability-for","title":"Boosting Adversarial Transferability for Skeleton-based Action Recognition via Exploring the Model Posterior Space","date":"2024-07-11","arxiv_id":"2407.08572","repositories_listed":0,"syntology":null},{"url":null,"slug":"ea-vtr-event-aware-video-text-retrieval","title":"EA-VTR: Event-Aware Video-Text Retrieval","date":"2024-07-10","arxiv_id":"2407.07478","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-video-and-body-worn-imu-autoencoder","title":"Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition","date":"2024-07-09","arxiv_id":"2407.06628","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-image-to-video-adaptation-an","title":"Rethinking Image-to-Video Adaptation: An Object-centric Perspective","date":"2024-07-09","arxiv_id":"2407.06871","repositories_listed":0,"syntology":null},{"url":null,"slug":"dmsd-cdfsar-distillation-from-mixed-source","title":"DMSD-CDFSAR: Distillation from Mixed-Source Domain for Cross-Domain Few-shot Action Recognition","date":"2024-07-08","arxiv_id":"2407.05657","repositories_listed":0,"syntology":null},{"url":null,"slug":"dark-transformer-a-video-transformer-for","title":"Dark Transformer: A Video Transformer for Action Recognition in the Dark","date":"2024-06-25","arxiv_id":"2407.12805","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-joint-angles-based-on-the-international","title":"Using joint angles based on the international biomechanical standards for human action recognition and related tasks","date":"2024-06-25","arxiv_id":"2406.17443","repositories_listed":0,"syntology":null},{"url":null,"slug":"svformer-a-direct-training-spiking","title":"SVFormer: A Direct Training Spiking Transformer for Efficient Video Action Recognition","date":"2024-06-21","arxiv_id":"2406.15034","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-impact-of-hand-pose-and-shadow","title":"Exploring the Impact of Hand Pose and Shadow on Hand-washing Action Recognition","date":"2024-06-19","arxiv_id":"2407.09520","repositories_listed":0,"syntology":null},{"url":null,"slug":"brain-inspired-computational-modeling-of","title":"Brain-inspired Computational Modeling of Action Recognition with Recurrent Spiking Neural Networks Equipped with Reinforcement Delay Learning","date":"2024-06-17","arxiv_id":"2406.11778","repositories_listed":0,"syntology":null},{"url":null,"slug":"cm2-net-continual-cross-modal-mapping-network","title":"CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition","date":"2024-06-17","arxiv_id":"2406.11340","repositories_listed":0,"syntology":null},{"url":null,"slug":"nymeria-a-massive-collection-of-multimodal","title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","date":"2024-06-14","arxiv_id":"2406.09905","repositories_listed":0,"syntology":null},{"url":null,"slug":"algo-object-grounded-visual-commonsense","title":"ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition","date":"2024-06-09","arxiv_id":"2406.05722","repositories_listed":0,"syntology":null},{"url":null,"slug":"fils-self-supervised-video-feature-prediction","title":"FILS: Self-Supervised Video Feature Prediction In Semantic Language Space","date":"2024-06-05","arxiv_id":"2406.03447","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-language-video-time-pre-training","title":"Contrastive Language Video Time Pre-training","date":"2024-06-04","arxiv_id":"2406.02631","repositories_listed":0,"syntology":null},{"url":null,"slug":"dl-kdd-dual-light-knowledge-distillation-for","title":"DL-KDD: Dual-Light Knowledge Distillation for Action Recognition in the Dark","date":"2024-06-04","arxiv_id":"2406.02468","repositories_listed":0,"syntology":null},{"url":null,"slug":"elsa-evaluating-localization-of-social","title":"ELSA: Evaluating Localization of Social Activities in Urban Streets using Open-Vocabulary Detection","date":"2024-06-03","arxiv_id":"2406.01551","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-cross-domain-capabilities","title":"Understanding the Cross-Domain Capabilities of Video-Based Few-Shot Action Recognition Models","date":"2024-06-03","arxiv_id":"2406.01073","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-information-compensation-framework-for","title":"An Information Compensation Framework for Zero-Shot Skeleton-based Action Recognition","date":"2024-06-02","arxiv_id":"2406.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"rnns-cnns-and-transformers-in-human-action","title":"RNNs, CNNs and Transformers in Human Action Recognition: A Survey and a Hybrid Model","date":"2024-06-02","arxiv_id":"2407.06162","repositories_listed":0,"syntology":null},{"url":null,"slug":"henasy-learning-to-assemble-scene-entities","title":"HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model","date":"2024-06-01","arxiv_id":"2406.00307","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-cross-domain-few-shot-learning-for","title":"Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition","date":"2024-05-30","arxiv_id":"2405.19917","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-ai-based-anonymization-of","title":"Exploring AI-based Anonymization of Industrial Image and Video Data in the Context of Feature Preservation","date":"2024-05-29","arxiv_id":"2405.19173","repositories_listed":0,"syntology":null},{"url":null,"slug":"matrix-manifold-neural-networks","title":"Matrix Manifold Neural Networks++","date":"2024-05-29","arxiv_id":"2405.19206","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-action-recognition-a-contrastive","title":"Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions","date":"2024-05-28","arxiv_id":"2405.17729","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cross-dataset-study-for-text-based-3d-human","title":"A Cross-Dataset Study for Text-based 3D Human Motion Retrieval","date":"2024-05-27","arxiv_id":"2405.16909","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-spatiotemporal-prediction-using","title":"Enhanced Spatiotemporal Prediction Using Physical-guided And Frequency-enhanced Recurrent Neural Networks","date":"2024-05-23","arxiv_id":"2405.14504","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamba4d-efficient-long-sequence-point-cloud","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","date":"2024-05-23","arxiv_id":"2405.14338","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-cnns-to-transformers-in-multimodal-human","title":"From CNNs to Transformers in Multimodal Human Action Recognition: A Survey","date":"2024-05-22","arxiv_id":"2405.15813","repositories_listed":0,"syntology":null},{"url":null,"slug":"identity-free-artificial-emotional","title":"Identity-free Artificial Emotional Intelligence via Micro-Gesture Understanding","date":"2024-05-21","arxiv_id":"2405.13206","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-compositionality-in-zero-shot","title":"The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks","date":"2024-05-14","arxiv_id":"2405.08695","repositories_listed":0,"syntology":null},{"url":null,"slug":"prenet-a-plane-fit-redundancy-encoding-point","title":"PRENet: A Plane-Fit Redundancy Encoding Point Cloud Sequence Network for Real-Time 3D Action Recognition","date":"2024-05-11","arxiv_id":"2405.06929","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-backbones-for-deep-video-action","title":"A Survey on Backbones for Deep Video Action Recognition","date":"2024-05-09","arxiv_id":"2405.05584","repositories_listed":0,"syntology":null},{"url":null,"slug":"mvp-shot-multi-velocity-progressive-alignment","title":"MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition","date":"2024-05-03","arxiv_id":"2405.02077","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-action-recognition-via-directed","title":"Multi-view Action Recognition via Directed Gromov-Wasserstein Discrepancy","date":"2024-05-02","arxiv_id":"2405.01337","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-block-fine-grained-semantic-cascade-for","title":"Cross-Block Fine-Grained Semantic Cascade for Skeleton-Based Sports Action Recognition","date":"2024-04-30","arxiv_id":"2404.19383","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-action-recognition-from-low-quality","title":"Enhancing Action Recognition from Low-Quality Skeleton Data via Part-Level Knowledge Distillation","date":"2024-04-28","arxiv_id":"2404.18206","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-graph-pooling-network-for","title":"An Improved Graph Pooling Network for Skeleton-Based Action Recognition","date":"2024-04-25","arxiv_id":"2404.16359","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-discriminative-spatio-temporal","title":"Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition","date":"2024-04-25","arxiv_id":"2404.16416","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-missing-modalities-in-egocentric","title":"Combating Missing Modalities in Egocentric Videos at Test Time","date":"2024-04-23","arxiv_id":"2404.15161","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoiser-rethinking-the-robustness-for-open","title":"DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition","date":"2024-04-23","arxiv_id":"2404.14890","repositories_listed":0,"syntology":null},{"url":null,"slug":"driver-activity-classification-using","title":"Driver Activity Classification Using Generalizable Representations from Vision-Language Models","date":"2024-04-23","arxiv_id":"2404.14906","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-generation-of-laparoscopic-videos","title":"Interactive Generation of Laparoscopic Videos with Diffusion Models","date":"2024-04-23","arxiv_id":"2406.06537","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-detection-and-interaction","title":"Simultaneous Detection and Interaction Reasoning for Object-Centric Action Recognition","date":"2024-04-18","arxiv_id":"2404.11903","repositories_listed":0,"syntology":null},{"url":null,"slug":"lower-limb-movements-recognition-based-on","title":"Lower Limb Movements Recognition Based on Feature Recursive Elimination and Backpropagation Neural Network","date":"2024-04-17","arxiv_id":"2404.11383","repositories_listed":0,"syntology":null},{"url":null,"slug":"hummuss-human-motion-understanding-using","title":"HumMUSS: Human Motion Understanding using State Space Models","date":"2024-04-16","arxiv_id":"2404.10880","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-score-sign-language-with-two","title":"Learning to Score Sign Language with Two-stage Method","date":"2024-04-16","arxiv_id":"2404.10383","repositories_listed":0,"syntology":null},{"url":null,"slug":"mk-sgn-a-spiking-graph-convolutional-network","title":"MK-SGN: A Spiking Graph Convolutional Network with Multimodal Fusion and Knowledge Distillation for Skeleton-based Action Recognition","date":"2024-04-16","arxiv_id":"2404.10210","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-multimodal-wearable-sensor-based","title":"A Survey on Multimodal Wearable Sensor-based Human Action Recognition","date":"2024-04-14","arxiv_id":"2404.15349","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-explainability-in-video-action","title":"Exploring Explainability in Video Action Recognition","date":"2024-04-13","arxiv_id":"2404.09067","repositories_listed":0,"syntology":null},{"url":null,"slug":"msstnet-a-multi-scale-spatio-temporal-cnn","title":"MSSTNet: A Multi-Scale Spatio-Temporal CNN-Transformer Network for Dynamic Facial Expression Recognition","date":"2024-04-12","arxiv_id":"2404.08433","repositories_listed":0,"syntology":null},{"url":"/paper/fine-grained-side-information-guided-dual","slug":"fine-grained-side-information-guided-dual","title":"Fine-Grained Side Information Guided Dual-Prompts for Zero-Shot Skeleton Action Recognition","date":"2024-04-11","arxiv_id":"2404.07487","repositories_listed":0,"syntology":null},{"url":null,"slug":"o-talc-steps-towards-combating","title":"O-TALC: Steps Towards Combating Oversegmentation within Online Action Segmentation","date":"2024-04-10","arxiv_id":"2404.06894","repositories_listed":0,"syntology":null},{"url":null,"slug":"x-vars-introducing-explainability-in-football","title":"X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model","date":"2024-04-07","arxiv_id":"2404.06332","repositories_listed":0,"syntology":null},{"url":null,"slug":"koala-key-frame-conditioned-long-video-llm","title":"Koala: Key frame-conditioned long video-LLM","date":"2024-04-05","arxiv_id":"2404.04346","repositories_listed":0,"syntology":null},{"url":"/paper/learning-correlation-structures-for-vision","slug":"learning-correlation-structures-for-vision","title":"Learning Correlation Structures for Vision Transformers","date":"2024-04-05","arxiv_id":"2404.03924","repositories_listed":0,"syntology":null},{"url":null,"slug":"physpt-physics-aware-pretrained-transformer","title":"PhysPT: Physics-aware Pretrained Transformer for Estimating Human Dynamics from Monocular Videos","date":"2024-04-05","arxiv_id":"2404.04430","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-scale-spatial-temporal-self-attention","title":"Multi-Scale Spatial-Temporal Self-Attention Graph Convolutional Networks for Skeleton-based Action Recognition","date":"2024-04-03","arxiv_id":"2404.02624","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-yolo-world-and-gpt-4v-lmms-for","title":"Leveraging YOLO-World and GPT-4V LMMs for Zero-Shot Person Detection and Action Recognition in Drone Imagery","date":"2024-04-02","arxiv_id":"2404.01571","repositories_listed":0,"syntology":null},{"url":"/paper/llms-are-good-action-recognizers","slug":"llms-are-good-action-recognizers","title":"LLMs are Good Action Recognizers","date":"2024-03-31","arxiv_id":"2404.00532","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-framework-for-human-centric-point","title":"A Unified Framework for Human-centric Point Cloud Video Understanding","date":"2024-03-29","arxiv_id":"2403.20031","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypergraph-based-multi-view-action","title":"Hypergraph-based Multi-View Action Recognition using Event Cameras","date":"2024-03-28","arxiv_id":"2403.19316","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-recognition-from-the-perspective-of","title":"Emotion Recognition from the perspective of Activity Recognition","date":"2024-03-24","arxiv_id":"2403.16263","repositories_listed":0,"syntology":null},{"url":"/paper/enhancing-video-transformers-for-action","slug":"enhancing-video-transformers-for-action","title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","date":"2024-03-24","arxiv_id":"2403.16128","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-interpretable-and-motion-consistent","title":"Selective, Interpretable, and Motion Consistent Privacy Attribute Obfuscation for Action Recognition","date":"2024-03-19","arxiv_id":"2403.12710","repositories_listed":0,"syntology":null},{"url":null,"slug":"videobadminton-a-video-dataset-for-badminton","title":"Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset","date":"2024-03-19","arxiv_id":"2403.12385","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-video-based-learning-leveraging","title":"Multi-View Video-Based Learning: Leveraging Weak Labels for Frame-Level Perception","date":"2024-03-18","arxiv_id":"2403.11616","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-imu-based-cross-modal-transfer","title":"A Survey of IMU Based Cross-Modal Transfer Learning in Human Activity Recognition","date":"2024-03-17","arxiv_id":"2403.15444","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossglg-llm-guides-one-shot-skeleton-based","title":"CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner","date":"2024-03-15","arxiv_id":"2403.10082","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-foundation-model-automatic-data","title":"Leveraging Foundation Model Automatic Data Augmentation Strategies and Skeletal Points for Hands Action Recognition in Industrial Assembly Lines","date":"2024-03-14","arxiv_id":"2403.09056","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-approaches-for-human-action","title":"Deep Learning Approaches for Human Action Recognition in Video Data","date":"2024-03-11","arxiv_id":"2403.06810","repositories_listed":0,"syntology":null},{"url":null,"slug":"density-guided-label-smoothing-for-temporal","title":"Density-Guided Label Smoothing for Temporal Localization of Driving Actions","date":"2024-03-11","arxiv_id":"2403.06616","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-fusion-of-2d-pose-and","title":"Transformer-based Fusion of 2D-pose and Spatio-temporal Embeddings for Distracted Driver Action Recognition","date":"2024-03-11","arxiv_id":"2403.06577","repositories_listed":0,"syntology":null},{"url":null,"slug":"coherent-temporal-synthesis-for-incremental","title":"Coherent Temporal Synthesis for Incremental Action Segmentation","date":"2024-03-10","arxiv_id":"2403.06102","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-model-selection-technique-for","title":"A Unified Model Selection Technique for Spectral Clustering Based Motion Segmentation","date":"2024-03-03","arxiv_id":"2403.01606","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-transformer-with-a-low","title":"Multimodal Transformer With a Low-Computational-Cost Guarantee","date":"2024-02-23","arxiv_id":"2402.15096","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-domain-invariant-temporal-dynamics","title":"Learning Causal Domain-Invariant Temporal Dynamics for Few-Shot Action Recognition","date":"2024-02-20","arxiv_id":"2402.12706","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiktokactions-a-tiktok-derived-video-dataset","title":"Advancing Human Action Recognition with Foundation Models trained on Unlabeled Public Videos","date":"2024-02-14","arxiv_id":"2402.08875","repositories_listed":0,"syntology":null},{"url":null,"slug":"pbadet-a-one-stage-anchor-free-approach-for","title":"PBADet: A One-Stage Anchor-Free Approach for Part-Body Association","date":"2024-02-12","arxiv_id":"2402.07814","repositories_listed":0,"syntology":null},{"url":null,"slug":"meet-jeanie-a-similarity-measure-for-3d","title":"Meet JEANIE: a Similarity Measure for 3D Skeleton Sequences via Temporal-Viewpoint Alignment","date":"2024-02-07","arxiv_id":"2402.04599","repositories_listed":0,"syntology":null},{"url":null,"slug":"wavelet-decoupling-contrastive-enhancement","title":"Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition","date":"2024-02-03","arxiv_id":"2402.02210","repositories_listed":0,"syntology":null}],"record_sha256":"dda9554b7d8c4aca0f96f03a0184ef064df5c3569978f75199659d87a020fc76","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}