{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition-in-videos/papers/14","list_of":"/task/action-recognition-in-videos","task":"Action Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":14,"pages_in_order":28,"rows_per_page":100,"rows":[1301,1400],"of":2759,"counts":{"archive_papers_tagged":2759,"with_a_code_link":1058,"where_syntology_ran_a_sample":275,"not_listed_spam_title":0,"listed":2759,"listed_where_code_ran":275,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":232,"every_run_a_failure_of_syntologys_instrument":43,"listed_with_a_run_with_no_instrument_failure":232,"listed_every_run_a_failure_of_syntologys_instrument":43,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition-in-videos","prev":"/task/action-recognition-in-videos/papers/13","next":"/task/action-recognition-in-videos/papers/15","papers":[{"url":null,"slug":"benchmarking-sensitivity-of-continual-graph","title":"Benchmarking Sensitivity of Continual Graph Learning for Skeleton-Based Action Recognition","date":"2024-01-31","arxiv_id":"2401.18054","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-generation-network-of-human-skeleton","title":"Active Generation Network of Human Skeleton for Action Recognition","date":"2024-01-30","arxiv_id":"2401.17086","repositories_listed":0,"syntology":null},{"url":null,"slug":"computer-vision-for-primate-behavior-analysis","title":"Computer Vision for Primate Behavior Analysis in the Wild","date":"2024-01-29","arxiv_id":"2401.16424","repositories_listed":0,"syntology":null},{"url":null,"slug":"mv2mae-multi-view-video-masked-autoencoders","title":"MV2MAE: Multi-View Video Masked Autoencoders","date":"2024-01-29","arxiv_id":"2401.15900","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modality-action-recognition-based-on","title":"Multi-modality action recognition based on dual feature shift in vehicle cabin monitoring","date":"2024-01-26","arxiv_id":"2401.14838","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-model-learning-by-sequential-reading-of","title":"Multi-model learning by sequential reading of untrimmed videos for action recognition","date":"2024-01-26","arxiv_id":"2401.14675","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-spatial-temporal-feature","title":"Unsupervised Spatial-Temporal Feature Enrichment and Fidelity Preservation Network for Skeleton based Action Recognition","date":"2024-01-25","arxiv_id":"2401.14034","repositories_listed":0,"syntology":null},{"url":null,"slug":"gtautoact-an-automatic-datasets-generation","title":"GTAutoAct: An Automatic Datasets Generation Framework Based on Game Engine Redevelopment for Action Recognition","date":"2024-01-24","arxiv_id":"2401.13414","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-open-ended-video-inference","title":"Training-Free Action Recognition and Goal Inference with Dynamic Frame Selection","date":"2024-01-23","arxiv_id":"2401.12471","repositories_listed":0,"syntology":null},{"url":null,"slug":"actionhub-a-large-scale-action-video","title":"ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition","date":"2024-01-22","arxiv_id":"2401.11654","repositories_listed":0,"syntology":null},{"url":null,"slug":"m2-clip-a-multimodal-multi-task-adapting","title":"M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition","date":"2024-01-22","arxiv_id":"2401.11649","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-missing-modality-in-multimodal","title":"Exploring Missing Modality in Multimodal Egocentric Datasets","date":"2024-01-21","arxiv_id":"2401.11470","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-video-transformers-via","title":"Understanding Video Transformers via Universal Concept Discovery","date":"2024-01-19","arxiv_id":"2401.10831","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt4ego-unleashing-the-potential-of-pre","title":"GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition","date":"2024-01-18","arxiv_id":"2401.10039","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-evaluation-of-machine-learning","title":"Robustness Evaluation of Machine Learning Models for Robot Arm Action Recognition in Noisy Environments","date":"2024-01-17","arxiv_id":"2401.09606","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-distillation-based-on-multi-modal","title":"Multi-view Distillation based on Multi-modal Fusion for Few-shot Action Recognition(CLIP-$\\mathrm{M^2}$DF)","date":"2024-01-16","arxiv_id":"2401.08345","repositories_listed":0,"syntology":null},{"url":null,"slug":"taco-benchmarking-generalizable-bimanual-tool","title":"TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object Understanding","date":"2024-01-16","arxiv_id":"2401.08399","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaboratively-self-supervised-video","title":"Collaboratively Self-supervised Video Representation Learning for Action Recognition","date":"2024-01-15","arxiv_id":"2401.07584","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-selective-audio-masked-multimodal","title":"Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification","date":"2024-01-08","arxiv_id":"2401.04154","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-joint-matching-method-based-on","title":"Two-stream joint matching method based on contrastive learning for few-shot action recognition","date":"2024-01-08","arxiv_id":"2401.04150","repositories_listed":0,"syntology":null},{"url":null,"slug":"big-data-and-deep-learning-in-smart-cities-a","title":"Big Data and Deep Learning in Smart Cities: A Comprehensive Dataset for AI-Driven Traffic Accident Detection and Computer Vision Systems","date":"2024-01-07","arxiv_id":"2401.03587","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-add-pose-induced-video-transformers-for","title":"Just Add ?! Pose Induced Video Transformers for Understanding Activities of Daily Living","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/maskclr-attention-guided-contrastive-learning","slug":"maskclr-attention-guided-contrastive-learning","title":"MaskCLR: Attention-Guided Contrastive Learning for Robust Action Representation Learning","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-collaborative-test-time-adaptation","title":"Modality-Collaborative Test-Time Adaptation for Action Recognition","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/omnivec2-a-novel-transformer-based-network","slug":"omnivec2-a-novel-transformer-based-network","title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pevl-pose-enhanced-vision-language-model-for","title":"PeVL: Pose-Enhanced Vision-Language Model for Fine-Grained Human Action Recognition","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-interpretable-and-motion-consistent-1","title":"Selective Interpretable and Motion Consistent Privacy Attribute Obfuscation for Action Recognition","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-re-identification-analysis-in","title":"A Large-Scale Re-identification Analysis in Sporting Scenarios: the Betrayal of Reaching a Critical Point","date":"2023-12-29","arxiv_id":"2401.00080","repositories_listed":0,"syntology":null},{"url":null,"slug":"classifying-soccer-ball-on-goal-position","title":"Classifying Soccer Ball-on-Goal Position Through Kicker Shooting Action","date":"2023-12-23","arxiv_id":"2312.15236","repositories_listed":0,"syntology":null},{"url":null,"slug":"posevinet-distracted-driver-action","title":"PoseViNet: Distracted Driver Action Recognition Framework Using Multi-View Pose Estimation and Vision Transformer","date":"2023-12-22","arxiv_id":"2312.14577","repositories_listed":0,"syntology":null},{"url":null,"slug":"early-action-recognition-with-action","title":"Early Action Recognition with Action Prototypes","date":"2023-12-11","arxiv_id":"2312.06598","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-detection-to-action-recognition-an-edge","title":"From Detection to Action Recognition: An Edge-Based Pipeline for Robot Human Perception","date":"2023-12-06","arxiv_id":"2312.03477","repositories_listed":0,"syntology":null},{"url":null,"slug":"mvhumannet-a-large-scale-dataset-of-multi","title":"MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures","date":"2023-12-05","arxiv_id":"2312.02963","repositories_listed":0,"syntology":null},{"url":null,"slug":"rotatr-detection-transformer-for-dense-and","title":"RotaTR: Detection Transformer for Dense and Rotated Object","date":"2023-12-05","arxiv_id":"2312.02821","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-action-conditioned-prompts-for","title":"Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition","date":"2023-12-04","arxiv_id":"2312.02226","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-prototype-module-and-motion","title":"Consistency Prototype Module and Motion Compensation for Few-Shot Action Recognition (CLIP-CP$\\mathbf{M^2}$C)","date":"2023-12-02","arxiv_id":"2312.01083","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-recognition-in-video-recordings-from","title":"Action Recognition in Video Recordings from Gynecologic Laparoscopy","date":"2023-11-30","arxiv_id":"2311.18666","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-hierarchical-temporal-transformer","title":"Generative Hierarchical Temporal Transformer for Hand Pose and Action Modeling","date":"2023-11-29","arxiv_id":"2311.17366","repositories_listed":0,"syntology":null},{"url":null,"slug":"geodeformer-geometric-deformable-transformer","title":"GeoDeformer: Geometric Deformable Transformer for Action Recognition","date":"2023-11-29","arxiv_id":"2311.17975","repositories_listed":0,"syntology":null},{"url":null,"slug":"lalm-long-term-action-anticipation-with","title":"PALM: Predicting Actions through Language Models","date":"2023-11-29","arxiv_id":"2311.17944","repositories_listed":0,"syntology":null},{"url":null,"slug":"leap-llm-generation-of-egocentric-action","title":"LEAP: LLM-Generation of Egocentric Action Programs","date":"2023-11-29","arxiv_id":"2312.00055","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-based-yet-class-agnostic-video-domain","title":"Object-based (yet Class-agnostic) Video Domain Adaptation","date":"2023-11-29","arxiv_id":"2311.17942","repositories_listed":0,"syntology":null},{"url":"/paper/adafocus-towards-end-to-end-weakly-supervised","slug":"adafocus-towards-end-to-end-weakly-supervised","title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","date":"2023-11-28","arxiv_id":"2311.17118","repositories_listed":0,"syntology":null},{"url":null,"slug":"f4d-factorized-4d-convolutional-neural","title":"F4D: Factorized 4D Convolutional Neural Network for Efficient Video-level Representation Learning","date":"2023-11-28","arxiv_id":"2401.08609","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-before-adapt-leveraging-entity-to","title":"Align before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition","date":"2023-11-27","arxiv_id":"2311.15619","repositories_listed":0,"syntology":null},{"url":null,"slug":"react-recognize-every-action-everywhere-all","title":"REACT: Recognize Every Action Everywhere All At Once","date":"2023-11-27","arxiv_id":"2312.00188","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-instance-refinement-for-cross","title":"Multi-modal Instance Refinement for Cross-domain Action Recognition","date":"2023-11-24","arxiv_id":"2311.14281","repositories_listed":0,"syntology":null},{"url":"/paper/unihpe-towards-unified-human-pose-estimation","slug":"unihpe-towards-unified-human-pose-estimation","title":"UniHPE: Towards Unified Human Pose Estimation via Contrastive Learning","date":"2023-11-24","arxiv_id":"2311.16477","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-mixer-exploiting-complementary","title":"Modality Mixer Exploiting Complementary Information for Multi-modal Action Recognition","date":"2023-11-21","arxiv_id":"2311.12344","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-eval-a-general-evaluation-on-video-large","title":"VLM-Eval: A General Evaluation on Video Large Language Models","date":"2023-11-20","arxiv_id":"2311.11865","repositories_listed":0,"syntology":null},{"url":null,"slug":"act-vit-a-representationally-robust-attention","title":"SkelVIT: Consensus of Vision Transformers for a Lightweight Skeleton-Based Action Recognition System","date":"2023-11-14","arxiv_id":"2311.08094","repositories_listed":0,"syntology":null},{"url":null,"slug":"mvsa-net-multi-view-state-action-recognition","title":"MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation","date":"2023-11-14","arxiv_id":"2311.08393","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-video-representation-for-few","title":"Semantic-aware Video Representation for Few-shot Action Recognition","date":"2023-11-10","arxiv_id":"2311.06218","repositories_listed":0,"syntology":null},{"url":"/paper/asymmetric-masked-distillation-for-pre","slug":"asymmetric-masked-distillation-for-pre","title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","date":"2023-11-06","arxiv_id":"2311.03149","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-knowledge-from-cnn-transformer","title":"Distilling Knowledge from CNN-Transformer Models for Enhanced Human Action Recognition","date":"2023-11-02","arxiv_id":"2311.01283","repositories_listed":0,"syntology":null},{"url":null,"slug":"probio-a-protocol-guided-multimodal-dataset","title":"ProBio: A Protocol-guided Multimodal Dataset for Molecular Biology Lab","date":"2023-11-01","arxiv_id":"2311.00556","repositories_listed":0,"syntology":null},{"url":"/paper/distribution-of-action-movements-dam-a-1","slug":"distribution-of-action-movements-dam-a-1","title":"Distribution of Action Movements (DAM): A Descriptor for Human Action Recognition","date":"2023-10-26","arxiv_id":"2310.17421","repositories_listed":0,"syntology":null},{"url":null,"slug":"s3aug-segmentation-sampling-and-shift-for","title":"S3Aug: Segmentation, Sampling, and Shift for Action Recognition","date":"2023-10-23","arxiv_id":"2310.14556","repositories_listed":0,"syntology":null},{"url":"/paper/videoprompter-an-ensemble-of-foundational","slug":"videoprompter-an-ensemble-of-foundational","title":"Videoprompter: an ensemble of foundational models for zero-shot video understanding","date":"2023-10-23","arxiv_id":"2310.15324","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-techniques-for-video-instance","title":"Deep Learning Techniques for Video Instance Segmentation: A Survey","date":"2023-10-19","arxiv_id":"2310.12393","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-pose-based-estimation-tracking-and","title":"Human Pose-based Estimation, Tracking and Action Recognition with Deep Learning: A Survey","date":"2023-10-19","arxiv_id":"2310.13039","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-action-recognition-with-captioning","title":"Few-shot Action Recognition with Captioning Foundation Models","date":"2023-10-16","arxiv_id":"2310.10125","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-dynamics-correction-for-action","title":"Flow Dynamics Correction for Action Recognition","date":"2023-10-16","arxiv_id":"2310.10059","repositories_listed":0,"syntology":null},{"url":null,"slug":"proving-the-potential-of-skeleton-based","title":"Proving the Potential of Skeleton Based Action Recognition to Automate the Analysis of Manual Processes","date":"2023-10-12","arxiv_id":"2310.08451","repositories_listed":0,"syntology":null},{"url":null,"slug":"spikepoint-an-efficient-point-based-spiking","title":"SpikePoint: An Efficient Point-based Spiking Neural Network for Event Cameras Action Recognition","date":"2023-10-11","arxiv_id":"2310.07189","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-learning-in-robotics-a-survey","title":"Graph learning in robotics: a survey","date":"2023-10-06","arxiv_id":"2310.04294","repositories_listed":0,"syntology":null},{"url":null,"slug":"poseaction-action-recognition-for-patients-in","title":"PoseAction: Action Recognition for Patients in the Ward using Deep Learning Approaches","date":"2023-10-05","arxiv_id":"2310.03288","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-recognition-utilizing-ygar-dataset","title":"Action Recognition Utilizing YGAR Dataset","date":"2023-10-02","arxiv_id":"2310.00831","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-graph-based-approach-for","title":"A Hierarchical Graph-based Approach for Recognition and Description Generation of Bimanual Actions in Videos","date":"2023-10-01","arxiv_id":"2310.00670","repositories_listed":0,"syntology":null},{"url":null,"slug":"position-and-orientation-aware-one-shot","title":"Position and Orientation-Aware One-Shot Learning for Medical Action Recognition from Signal Data","date":"2023-09-27","arxiv_id":"2309.15635","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-3-3d-learning-3d-priors-using-multi-modal","title":"M$^{3}$3D: Learning 3D priors using Multi-Modal Masked Autoencoders for 2D image and video understanding","date":"2023-09-26","arxiv_id":"2309.15313","repositories_listed":0,"syntology":null},{"url":null,"slug":"boundary-aware-proposal-generation-method-for","title":"Boundary-Aware Proposal Generation Method for Temporal Action Localization","date":"2023-09-25","arxiv_id":"2309.13810","repositories_listed":0,"syntology":null},{"url":null,"slug":"chop-learn-recognizing-and-generating-object","title":"Chop & Learn: Recognizing and Generating Object-State Compositions","date":"2023-09-25","arxiv_id":"2309.14339","repositories_listed":0,"syntology":null},{"url":null,"slug":"s3tc-spiking-separated-spatial-and-temporal","title":"S3TC: Spiking Separated Spatial and Temporal Convolutions with Unsupervised STDP-based Learning for Action Recognition","date":"2023-09-22","arxiv_id":"2309.12761","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpr-coach-recognizing-composite-error-actions","title":"CPR-Coach: Recognizing Composite Error Actions based on Single-class Training","date":"2023-09-21","arxiv_id":"2309.11718","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-action-recognition-spotting-and","title":"Survey of Action Recognition, Spotting and Spatio-Temporal Localization in Soccer -- Current Trends and Research Perspectives","date":"2023-09-21","arxiv_id":"2309.12067","repositories_listed":0,"syntology":null},{"url":null,"slug":"skeletr-towrads-skeleton-based-action","title":"SkeleTR: Towrads Skeleton-based Action Recognition in the Wild","date":"2023-09-20","arxiv_id":"2309.11445","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-as-the-medium-multimodal-video","title":"Language as the Medium: Multimodal Video Classification through text only","date":"2023-09-19","arxiv_id":"2309.10783","repositories_listed":0,"syntology":null},{"url":null,"slug":"casar-contact-aware-skeletal-action","title":"CaSAR: Contact-aware Skeletal Action Recognition","date":"2023-09-17","arxiv_id":"2309.10001","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-debiasing-frame-length-bias-in-text","title":"Towards Debiasing Frame Length Bias in Text-Video Retrieval via Causal Intervention","date":"2023-09-17","arxiv_id":"2309.09311","repositories_listed":0,"syntology":null},{"url":null,"slug":"hear-your-action-human-action-recognition-by","title":"hear-your-action: human action recognition by ultrasound active sensing","date":"2023-09-15","arxiv_id":"2309.08087","repositories_listed":0,"syntology":null},{"url":null,"slug":"transnet-a-transfer-learning-based-network","title":"TransNet: A Transfer Learning-Based Network for Human Action Recognition","date":"2023-09-13","arxiv_id":"2309.06951","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-language-acquisition-from-object-and","title":"Grounded Language Acquisition From Object and Action Imagery","date":"2023-09-12","arxiv_id":"2309.06335","repositories_listed":0,"syntology":null},{"url":null,"slug":"scd-net-spatiotemporal-clues-disentanglement","title":"SCD-Net: Spatiotemporal Clues Disentanglement Network for Self-supervised Skeleton-based Action Recognition","date":"2023-09-11","arxiv_id":"2309.05834","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-contrastive-fusion-transformer-for","title":"Unified Contrastive Fusion Transformer for Multimodal Human Action Recognition","date":"2023-09-10","arxiv_id":"2309.05032","repositories_listed":0,"syntology":null},{"url":null,"slug":"egopca-a-new-framework-for-egocentric-hand","title":"EgoPCA: A New Framework for Egocentric Hand-Object Interaction Understanding","date":"2023-09-05","arxiv_id":"2309.02423","repositories_listed":0,"syntology":null},{"url":null,"slug":"indgic-supervised-action-recognition-under","title":"IndGIC: Supervised Action Recognition under Low Illumination","date":"2023-08-29","arxiv_id":"2308.15345","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-video-violence-recognition-with","title":"Improving Video Violence Recognition with Human Interaction Learning on 3D Skeleton Point Clouds","date":"2023-08-26","arxiv_id":"2308.13866","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-models-for-machine-learning","title":"Sparse Models for Machine Learning","date":"2023-08-26","arxiv_id":"2308.13960","repositories_listed":0,"syntology":null},{"url":null,"slug":"eventtransact-a-video-transformer-based","title":"EventTransAct: A video transformer-based framework for Event-camera based action recognition","date":"2023-08-25","arxiv_id":"2308.13711","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-learning-of-images-and-videos-with-a","title":"Joint learning of images and videos with a single Vision Transformer","date":"2023-08-21","arxiv_id":"2308.10533","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-distributed-backdoor-attack-against","title":"Temporal-Distributed Backdoor Attack Against Video Based Action Recognition","date":"2023-08-21","arxiv_id":"2308.11070","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-temporal-alignment-network-for-action-1","title":"Spatial-Temporal Alignment Network for Action Recognition","date":"2023-08-19","arxiv_id":"2308.09897","repositories_listed":0,"syntology":null},{"url":null,"slug":"ttpoint-a-tensorized-point-cloud-network-for","title":"TTPOINT: A Tensorized Point Cloud Network for Lightweight Action Recognition with Event Cameras","date":"2023-08-19","arxiv_id":"2308.09993","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlimited-knowledge-distillation-for-action","title":"Unlimited Knowledge Distillation for Action Recognition in the Dark","date":"2023-08-18","arxiv_id":"2308.09327","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-class-relation-detection-and","title":"Action Class Relation Detection and Classification Across Multiple Video Datasets","date":"2023-08-15","arxiv_id":"2308.07558","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-importance-of-spatial-relations-for","title":"On the Importance of Spatial Relations for Few-shot Action Recognition","date":"2023-08-14","arxiv_id":"2308.07119","repositories_listed":0,"syntology":null},{"url":null,"slug":"jedi-joint-expert-distillation-in-a-semi","title":"JEDI: Joint Expert Distillation in a Semi-Supervised Multi-Dataset Student-Teacher Scenario for Video Action Recognition","date":"2023-08-09","arxiv_id":"2308.04934","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-in-flowing-adapting-clip-for-action","title":"Seeing in Flowing: Adapting CLIP for Action Recognition with Motion Prompts Learning","date":"2023-08-09","arxiv_id":"2308.04828","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-3-net-multi-view-encoding-matching-and","title":"M$^3$Net: Multi-view Encoding, Matching, and Fusion for Few-shot Fine-grained Action Recognition","date":"2023-08-06","arxiv_id":"2308.03063","repositories_listed":0,"syntology":null}],"record_sha256":"8e25a9cb1b3263fb9af261c0ccf22d0f62974997f0a28ab6e25d1fac345c00a6","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}