{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition/papers/6","list_of":"/task/action-recognition","task":"Temporal Action Localization","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":15,"rows_per_page":100,"rows":[501,600],"of":1477,"counts":{"archive_papers_tagged":1477,"with_a_code_link":493,"where_syntology_ran_a_sample":87,"not_listed_spam_title":0,"listed":1477,"listed_where_code_ran":87,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":68,"every_run_a_failure_of_syntologys_instrument":19,"listed_with_a_run_with_no_instrument_failure":68,"listed_every_run_a_failure_of_syntologys_instrument":19,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition","prev":"/task/action-recognition/papers/5","next":"/task/action-recognition/papers/7","papers":[{"url":null,"slug":"pcbear-pose-concept-bottleneck-for","title":"PCBEAR: Pose Concept Bottleneck for Explainable Action Recognition","date":"2025-04-17","arxiv_id":"2504.13140","repositories_listed":0,"syntology":null},{"url":null,"slug":"owlsight-a-robust-illumination-adaptation","title":"OwlSight: A Robust Illumination Adaptation Framework for Dark Video Human Action Recognition","date":"2025-03-30","arxiv_id":"2503.23266","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-guided-spiking-neural-networks-for","title":"Temporal-Guided Spiking Neural Networks for Event-Based Human Action Recognition","date":"2025-03-21","arxiv_id":"2503.17132","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-perfect-multimodal-alignment-and","title":"Towards Achieving Perfect Multimodal Alignment","date":"2025-03-19","arxiv_id":"2503.15352","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-audio-visual-video-action","title":"Semi-Supervised Audio-Visual Video Action Recognition with Audio Source Localization Guided Mixup","date":"2025-03-04","arxiv_id":"2503.02284","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-and-efficient-baseline-for-video","title":"A Simple and Efficient Baseline for Video Action Recognition","date":"2025-03-02","arxiv_id":"2503.00796","repositories_listed":0,"syntology":null},{"url":null,"slug":"snn-driven-multimodal-human-action","title":"SNN-Driven Multimodal Human Action Recognition via Event Camera and Skeleton Data Fusion","date":"2025-02-19","arxiv_id":"2502.13385","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyliformer-hyperbolic-linear-attention-for","title":"HyLiFormer: Hyperbolic Linear Attention for Skeleton-based Human Action Recognition","date":"2025-02-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minimalistic-video-saliency-prediction-via","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","date":"2025-02-01","arxiv_id":"2502.00397","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-vision-survey-of-modern-action","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","date":"2025-01-22","arxiv_id":"2501.13066","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-pseudo-label-guided-learning-for","title":"Rethinking Pseudo-Label Guided Learning for Weakly Supervised Temporal Action Localization from the Perspective of Noise Correction","date":"2025-01-19","arxiv_id":"2501.11124","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-detail-matters-refining-video","title":"Action Detail Matters: Refining Video Recognition with Local Action Queries","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-point-supervised-temporal-action","title":"Boosting Point-Supervised Temporal Action Localization through Integrating Query Reformation and Optimal Transport","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-skeleton-based-action","title":"Heterogeneous Skeleton-Based Action Representation Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"loki-low-dimensional-kan-for-efficient-fine","title":"LoKi: Low-dimensional KAN for Efficient Fine-tuning Image Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"moda-motion-drift-augmentation-for-inertial","title":"MODA: Motion-Drift Augmentation for Inertial Human Motion Analysis","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-guided-cross-modal-prompt-learning","title":"Semantic-guided Cross-Modal Prompt Learning for Skeleton-based Zero-shot Action Recognition","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-temporal-action-9","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dave-diverse-atomic-visual-elements-dataset","title":"DAVE: Diverse Atomic Visual Elements Dataset with High Representation of Vulnerable Road Users in Complex and Unpredictable Environments","date":"2024-12-28","arxiv_id":"2412.20042","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-domain-incremental-learning-for-human","title":"Video Domain Incremental Learning for Human Action Recognition in Home Environments","date":"2024-12-22","arxiv_id":"2412.16946","repositories_listed":0,"syntology":null},{"url":null,"slug":"future-aspects-in-human-action-recognition","title":"Future Aspects in Human Action Recognition: Exploring Emerging Techniques and Ethical Influences","date":"2024-12-17","arxiv_id":"2412.12990","repositories_listed":0,"syntology":null},{"url":null,"slug":"skelmamba-a-state-space-model-for-efficient","title":"SkelMamba: A State Space Model for Efficient Skeleton Action Recognition of Neurological Disorders","date":"2024-11-29","arxiv_id":"2411.19544","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-two-stream-network-based-on-rgb","title":"An End-to-End Two-Stream Network Based on RGB Flow and Representation Flow for Human Action Recognition","date":"2024-11-27","arxiv_id":"2411.18002","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-hyper-graph-convolution-network-for","title":"Adaptive Hyper-Graph Convolution Network for Skeleton-based Human Action Recognition with Virtual Connections","date":"2024-11-22","arxiv_id":"2411.14796","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-spatial-meets-temporal-in-action","title":"When Spatial meets Temporal in Action Recognition","date":"2024-11-22","arxiv_id":"2411.15284","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-mllms-guide-weakly-supervised-temporal","title":"Can MLLMs Guide Weakly-Supervised Temporal Action Localization Tasks?","date":"2024-11-13","arxiv_id":"2411.08466","repositories_listed":0,"syntology":null},{"url":null,"slug":"extended-multi-stream-temporal-attention","title":"Extended multi-stream temporal-attention module for skeleton-based human action recognition (HAR)","date":"2024-11-10","arxiv_id":"2411.06553","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-recognition-har-using-skeleton","title":"Human Action Recognition (HAR) Using Skeleton-based Spatial Temporal Relative Transformer Network: ST-RTR","date":"2024-10-31","arxiv_id":"2410.23806","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-domain-adaptation-for-action","title":"Unsupervised Domain Adaptation for Action Recognition via Self-Ensembling and Conditional Embedding Alignment","date":"2024-10-23","arxiv_id":"2410.17489","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-multi-label-atomic-activity","title":"Improving the Multi-label Atomic Activity Recognition by Robust Visual Feature and Advanced Attention @ ROAD++ Atomic Activity Recognition 2024","date":"2024-10-21","arxiv_id":"2410.16037","repositories_listed":0,"syntology":null},{"url":null,"slug":"storyboard-guided-alignment-for-fine-grained","title":"Storyboard guided Alignment for Fine-grained Video Action Recognition","date":"2024-10-18","arxiv_id":"2410.14238","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-supervised-human-action-recognition","title":"LS-HAR: Language Supervised Human Action Recognition with Salient Fusion, Construction Sites as a Use-Case","date":"2024-10-02","arxiv_id":"2410.01962","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgpetl-parameter-efficient-image-to","title":"SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition","date":"2024-09-30","arxiv_id":"2409.20083","repositories_listed":0,"syntology":null},{"url":null,"slug":"kan-hyperpointnet-for-point-cloud-sequence","title":"KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition","date":"2024-09-14","arxiv_id":"2409.09444","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-human-action-recognition-on","title":"Real-Time Human Action Recognition on Embedded Platforms","date":"2024-09-09","arxiv_id":"2409.05662","repositories_listed":0,"syntology":null},{"url":null,"slug":"sitar-semi-supervised-image-transformer-for","title":"SITAR: Semi-supervised Image Transformer for Action Recognition","date":"2024-09-04","arxiv_id":"2409.02910","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-enhanced-zero-shot-action-recognition-a","title":"Text-Enhanced Zero-Shot Action Recognition: A training-free approach","date":"2024-08-29","arxiv_id":"2408.16412","repositories_listed":0,"syntology":null},{"url":null,"slug":"habitaction-a-video-dataset-for-human","title":"HabitAction: A Video Dataset for Human Habitual Behavior Recognition","date":"2024-08-24","arxiv_id":"2408.13463","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-temporal-pooling-for-improving-skeleton","title":"Joint Temporal Pooling for Improving Skeleton-based Action Recognition","date":"2024-08-18","arxiv_id":"2408.09356","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatten-video-action-recognition-is-an-image","title":"Flatten: Video Action Recognition is an Image Classification task","date":"2024-08-17","arxiv_id":"2408.09220","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02957","title":"Online Temporal Action Localization with Memory-Augmented Transformer","date":"2024-08-06","arxiv_id":"2408.02957","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02033","title":"Enhancing Human Action Recognition and Violence Detection Through Deep Learning Audiovisual Fusion","date":"2024-08-04","arxiv_id":"2408.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-and-cross-modal-transfer-for-zero-shot","title":"C3T: Cross-modal Transfer Through Time for Sensor-based Human Activity Recognition","date":"2024-07-23","arxiv_id":"2407.16803","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-pipe-video-temporal-defect","title":"Semi-Supervised Pipe Video Temporal Defect Interval Localization","date":"2024-07-21","arxiv_id":"2407.15170","repositories_listed":0,"syntology":null},{"url":null,"slug":"lortsar-low-rank-transformer-for-skeleton","title":"LORTSAR: Low-Rank Transformer for Skeleton-based Action Recognition","date":"2024-07-19","arxiv_id":"2407.14655","repositories_listed":0,"syntology":null},{"url":null,"slug":"ea-vtr-event-aware-video-text-retrieval","title":"EA-VTR: Event-Aware Video-Text Retrieval","date":"2024-07-10","arxiv_id":"2407.07478","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-adaptive-pseudo-label-learning-for","title":"Towards Adaptive Pseudo-label Learning for Semi-Supervised Temporal Action Localization","date":"2024-07-10","arxiv_id":"2407.07673","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-joint-angles-based-on-the-international","title":"Using joint angles based on the international biomechanical standards for human action recognition and related tasks","date":"2024-06-25","arxiv_id":"2406.17443","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-temporal-action-localization","title":"Open-Vocabulary Temporal Action Localization using Multimodal Guidance","date":"2024-06-21","arxiv_id":"2406.15556","repositories_listed":0,"syntology":null},{"url":null,"slug":"svformer-a-direct-training-spiking","title":"SVFormer: A Direct Training Spiking Transformer for Efficient Video Action Recognition","date":"2024-06-21","arxiv_id":"2406.15034","repositories_listed":0,"syntology":null},{"url":null,"slug":"dl-kdd-dual-light-knowledge-distillation-for","title":"DL-KDD: Dual-Light Knowledge Distillation for Action Recognition in the Dark","date":"2024-06-04","arxiv_id":"2406.02468","repositories_listed":0,"syntology":null},{"url":null,"slug":"rnns-cnns-and-transformers-in-human-action","title":"RNNs, CNNs and Transformers in Human Action Recognition: A Survey and a Hybrid Model","date":"2024-06-02","arxiv_id":"2407.06162","repositories_listed":0,"syntology":null},{"url":null,"slug":"matrix-manifold-neural-networks","title":"Matrix Manifold Neural Networks++","date":"2024-05-29","arxiv_id":"2405.19206","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-spatiotemporal-prediction-using","title":"Enhanced Spatiotemporal Prediction Using Physical-guided And Frequency-enhanced Recurrent Neural Networks","date":"2024-05-23","arxiv_id":"2405.14504","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamba4d-efficient-long-sequence-point-cloud","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","date":"2024-05-23","arxiv_id":"2405.14338","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-cnns-to-transformers-in-multimodal-human","title":"From CNNs to Transformers in Multimodal Human Action Recognition: A Survey","date":"2024-05-22","arxiv_id":"2405.15813","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-backbones-for-deep-video-action","title":"A Survey on Backbones for Deep Video Action Recognition","date":"2024-05-09","arxiv_id":"2405.05584","repositories_listed":0,"syntology":null},{"url":null,"slug":"stat-towards-generalizable-temporal-action","title":"STAT: Towards Generalizable Temporal Action Localization","date":"2024-04-20","arxiv_id":"2404.13311","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeplocalization-using-change-point-detection","title":"DeepLocalization: Using change point detection for Temporal Action Localization","date":"2024-04-18","arxiv_id":"2404.12258","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-score-sign-language-with-two","title":"Learning to Score Sign Language with Two-stage Method","date":"2024-04-16","arxiv_id":"2404.10383","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-multimodal-wearable-sensor-based","title":"A Survey on Multimodal Wearable Sensor-based Human Action Recognition","date":"2024-04-14","arxiv_id":"2404.15349","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-explainability-in-video-action","title":"Exploring Explainability in Video Action Recognition","date":"2024-04-13","arxiv_id":"2404.09067","repositories_listed":0,"syntology":null},{"url":null,"slug":"msstnet-a-multi-scale-spatio-temporal-cnn","title":"MSSTNet: A Multi-Scale Spatio-Temporal CNN-Transformer Network for Dynamic Facial Expression Recognition","date":"2024-04-12","arxiv_id":"2404.08433","repositories_listed":0,"syntology":null},{"url":null,"slug":"localizing-moments-of-actions-in-untrimmed","title":"Localizing Moments of Actions in Untrimmed Videos of Infants with Autism Spectrum Disorder","date":"2024-04-08","arxiv_id":"2404.05849","repositories_listed":0,"syntology":null},{"url":null,"slug":"physpt-physics-aware-pretrained-transformer","title":"PhysPT: Physics-aware Pretrained Transformer for Estimating Human Dynamics from Monocular Videos","date":"2024-04-05","arxiv_id":"2404.04430","repositories_listed":0,"syntology":null},{"url":null,"slug":"losa-long-short-range-adapter-for-scaling-end","title":"LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization","date":"2024-04-01","arxiv_id":"2404.01282","repositories_listed":0,"syntology":null},{"url":"/paper/dual-detrs-for-multi-label-temporal-action","slug":"dual-detrs-for-multi-label-temporal-action","title":"Dual DETRs for Multi-Label Temporal Action Detection","date":"2024-03-31","arxiv_id":"2404.00653","repositories_listed":0,"syntology":null},{"url":null,"slug":"plot-tal-prompt-learning-with-optimal","title":"PLOT-TAL -- Prompt Learning with Optimal Transport for Few-Shot Temporal Action Localization","date":"2024-03-27","arxiv_id":"2403.18915","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-semi-supervised-temporal-action","title":"Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes","date":"2024-03-17","arxiv_id":"2403.11189","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-foundation-model-automatic-data","title":"Leveraging Foundation Model Automatic Data Augmentation Strategies and Skeletal Points for Hands Action Recognition in Industrial Assembly Lines","date":"2024-03-14","arxiv_id":"2403.09056","repositories_listed":0,"syntology":null},{"url":null,"slug":"bid-boundary-interior-decoding-for","title":"BID: Boundary-Interior Decoding for Unsupervised Temporal Action Localization Pre-Trainin","date":"2024-03-12","arxiv_id":"2403.07354","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-approaches-for-human-action","title":"Deep Learning Approaches for Human Action Recognition in Video Data","date":"2024-03-11","arxiv_id":"2403.06810","repositories_listed":0,"syntology":null},{"url":null,"slug":"density-guided-label-smoothing-for-temporal","title":"Density-Guided Label Smoothing for Temporal Localization of Driving Actions","date":"2024-03-11","arxiv_id":"2403.06616","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-fusion-of-2d-pose-and","title":"Transformer-based Fusion of 2D-pose and Spatio-temporal Embeddings for Distracted Driver Action Recognition","date":"2024-03-11","arxiv_id":"2403.06577","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiktokactions-a-tiktok-derived-video-dataset","title":"Advancing Human Action Recognition with Foundation Models trained on Unlabeled Public Videos","date":"2024-02-14","arxiv_id":"2402.08875","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-generation-network-of-human-skeleton","title":"Active Generation Network of Human Skeleton for Action Recognition","date":"2024-01-30","arxiv_id":"2401.17086","repositories_listed":0,"syntology":null},{"url":null,"slug":"cutup-and-detect-human-fall-detection-on","title":"Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model","date":"2024-01-29","arxiv_id":"2401.16280","repositories_listed":0,"syntology":null},{"url":null,"slug":"m2-clip-a-multimodal-multi-task-adapting","title":"M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition","date":"2024-01-22","arxiv_id":"2401.11649","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-add-pose-induced-video-transformers-for","title":"Just Add ?! Pose Induced Video Transformers for Understanding Activities of Daily Living","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pevl-pose-enhanced-vision-language-model-for","title":"PeVL: Pose-Enhanced Vision-Language Model for Fine-Grained Human Action Recognition","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-re-identification-analysis-in","title":"A Large-Scale Re-identification Analysis in Sporting Scenarios: the Betrayal of Reaching a Critical Point","date":"2023-12-29","arxiv_id":"2401.00080","repositories_listed":0,"syntology":null},{"url":null,"slug":"classifying-soccer-ball-on-goal-position","title":"Classifying Soccer Ball-on-Goal Position Through Kicker Shooting Action","date":"2023-12-23","arxiv_id":"2312.15236","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-detection-to-action-recognition-an-edge","title":"From Detection to Action Recognition: An Edge-Based Pipeline for Robot Human Perception","date":"2023-12-06","arxiv_id":"2312.03477","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-action-conditioned-prompts-for","title":"Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition","date":"2023-12-04","arxiv_id":"2312.02226","repositories_listed":0,"syntology":null},{"url":"/paper/adafocus-towards-end-to-end-weakly-supervised","slug":"adafocus-towards-end-to-end-weakly-supervised","title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","date":"2023-11-28","arxiv_id":"2311.17118","repositories_listed":0,"syntology":null},{"url":null,"slug":"f4d-factorized-4d-convolutional-neural","title":"F4D: Factorized 4D Convolutional Neural Network for Efficient Video-level Representation Learning","date":"2023-11-28","arxiv_id":"2401.08609","repositories_listed":0,"syntology":null},{"url":null,"slug":"adm-loc-actionness-distribution-modeling-for","title":"ADM-Loc: Actionness Distribution Modeling for Point-supervised Temporal Action Localization","date":"2023-11-27","arxiv_id":"2311.15916","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-before-adapt-leveraging-entity-to","title":"Align before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition","date":"2023-11-27","arxiv_id":"2311.15619","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-knowledge-from-cnn-transformer","title":"Distilling Knowledge from CNN-Transformer Models for Enhanced Human Action Recognition","date":"2023-11-02","arxiv_id":"2311.01283","repositories_listed":0,"syntology":null},{"url":"/paper/distribution-of-action-movements-dam-a-1","slug":"distribution-of-action-movements-dam-a-1","title":"Distribution of Action Movements (DAM): A Descriptor for Human Action Recognition","date":"2023-10-26","arxiv_id":"2310.17421","repositories_listed":0,"syntology":null},{"url":"/paper/videoprompter-an-ensemble-of-foundational","slug":"videoprompter-an-ensemble-of-foundational","title":"Videoprompter: an ensemble of foundational models for zero-shot video understanding","date":"2023-10-23","arxiv_id":"2310.15324","repositories_listed":0,"syntology":null},{"url":null,"slug":"potloc-pseudo-label-oriented-transformer-for","title":"POTLoc: Pseudo-Label Oriented Transformer for Point-Supervised Temporal Action Localization","date":"2023-10-20","arxiv_id":"2310.13585","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-techniques-for-video-instance","title":"Deep Learning Techniques for Video Instance Segmentation: A Survey","date":"2023-10-19","arxiv_id":"2310.12393","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposal-based-temporal-action-localization","title":"Proposal-based Temporal Action Localization with Point-level Supervision","date":"2023-10-09","arxiv_id":"2310.05511","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-resolution-audio-visual-feature-fusion","title":"Multi-Resolution Audio-Visual Feature Fusion for Temporal Action Localization","date":"2023-10-05","arxiv_id":"2310.03456","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-3-3d-learning-3d-priors-using-multi-modal","title":"M$^{3}$3D: Learning 3D priors using Multi-Modal Masked Autoencoders for 2D image and video understanding","date":"2023-09-26","arxiv_id":"2309.15313","repositories_listed":0,"syntology":null},{"url":null,"slug":"boundary-aware-proposal-generation-method-for","title":"Boundary-Aware Proposal Generation Method for Temporal Action Localization","date":"2023-09-25","arxiv_id":"2309.13810","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-action-recognition-spotting-and","title":"Survey of Action Recognition, Spotting and Spatio-Temporal Localization in Soccer -- Current Trends and Research Perspectives","date":"2023-09-21","arxiv_id":"2309.12067","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-kernel-temporal-segmentation-as-an","title":"Revisiting Kernel Temporal Segmentation as an Adaptive Tokenizer for Long-form Video Understanding","date":"2023-09-20","arxiv_id":"2309.11569","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-action-prototype-learning-for-point-level","title":"Sub-action Prototype Learning for Point-level Weakly-supervised Temporal Action Localization","date":"2023-09-16","arxiv_id":"2309.09060","repositories_listed":0,"syntology":null}],"record_sha256":"2e4182509d58178a465638d6c79e1a6a5bdf6a82a8b64f2f766dfceb530b2152","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}