{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition/papers/7","list_of":"/task/action-recognition","task":"Temporal Action Localization","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":15,"rows_per_page":100,"rows":[601,700],"of":1477,"counts":{"archive_papers_tagged":1477,"with_a_code_link":493,"where_syntology_ran_a_sample":87,"not_listed_spam_title":0,"listed":1477,"listed_where_code_ran":87,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":68,"every_run_a_failure_of_syntologys_instrument":19,"listed_with_a_run_with_no_instrument_failure":68,"listed_every_run_a_failure_of_syntologys_instrument":19,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition","prev":"/task/action-recognition/papers/6","next":"/task/action-recognition/papers/8","papers":[{"url":null,"slug":"hear-your-action-human-action-recognition-by","title":"hear-your-action: human action recognition by ultrasound active sensing","date":"2023-09-15","arxiv_id":"2309.08087","repositories_listed":0,"syntology":null},{"url":null,"slug":"transnet-a-transfer-learning-based-network","title":"TransNet: A Transfer Learning-Based Network for Human Action Recognition","date":"2023-09-13","arxiv_id":"2309.06951","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-contrastive-fusion-transformer-for","title":"Unified Contrastive Fusion Transformer for Multimodal Human Action Recognition","date":"2023-09-10","arxiv_id":"2309.05032","repositories_listed":0,"syntology":null},{"url":null,"slug":"egopca-a-new-framework-for-egocentric-hand","title":"EgoPCA: A New Framework for Egocentric Hand-Object Interaction Understanding","date":"2023-09-05","arxiv_id":"2309.02423","repositories_listed":0,"syntology":null},{"url":null,"slug":"indgic-supervised-action-recognition-under","title":"IndGIC: Supervised Action Recognition under Low Illumination","date":"2023-08-29","arxiv_id":"2308.15345","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-video-violence-recognition-with","title":"Improving Video Violence Recognition with Human Interaction Learning on 3D Skeleton Point Clouds","date":"2023-08-26","arxiv_id":"2308.13866","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-data-efficiency-and","title":"Benchmarking Data Efficiency and Computational Efficiency of Temporal Action Localization Models","date":"2023-08-24","arxiv_id":"2308.13082","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-video-contextual-knowledge-exploration","title":"Cross-Video Contextual Knowledge Exploration and Exploitation for Ambiguity Reduction in Weakly Supervised Temporal Action Localization","date":"2023-08-24","arxiv_id":"2308.12609","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-distributed-backdoor-attack-against","title":"Temporal-Distributed Backdoor Attack Against Video Based Action Recognition","date":"2023-08-21","arxiv_id":"2308.11070","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-class-relation-detection-and","title":"Action Class Relation Detection and Classification Across Multiple Video Datasets","date":"2023-08-15","arxiv_id":"2308.07558","repositories_listed":0,"syntology":null},{"url":null,"slug":"jedi-joint-expert-distillation-in-a-semi","title":"JEDI: Joint Expert Distillation in a Semi-Supervised Multi-Dataset Student-Teacher Scenario for Video Action Recognition","date":"2023-08-09","arxiv_id":"2308.04934","repositories_listed":0,"syntology":null},{"url":null,"slug":"maivar-t-multimodal-audio-image-and-video","title":"MAiVAR-T: Multimodal Audio-image and Video Action Recognizer using Transformers","date":"2023-08-01","arxiv_id":"2308.03741","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatiotemporal-modeling-encounters-3d-medical","title":"Spatiotemporal Modeling Encounters 3D Medical Image Analysis: Slice-Shift UNet with Multi-View Fusion","date":"2023-07-24","arxiv_id":"2307.12853","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-multi-level-dynamic-point","title":"Two-stream Multi-level Dynamic Point Transformer for Two-person Interaction Recognition","date":"2023-07-22","arxiv_id":"2307.11973","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusing-hand-and-body-skeletons-for-human","title":"Fusing Hand and Body Skeletons for Human Action Recognition in Assembly","date":"2023-07-18","arxiv_id":"2307.09238","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-recognition-in-still-images","title":"Human Action Recognition in Still Images Using ConViT","date":"2023-07-18","arxiv_id":"2307.08994","repositories_listed":0,"syntology":null},{"url":null,"slug":"similarity-min-max-zero-shot-day-night-domain","title":"Similarity Min-Max: Zero-Shot Day-Night Domain Adaptation","date":"2023-07-17","arxiv_id":"2307.08779","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-form-composition-networks-for-egocentric","title":"Free-Form Composition Networks for Egocentric Action Recognition","date":"2023-07-13","arxiv_id":"2307.06527","repositories_listed":0,"syntology":null},{"url":null,"slug":"theater-aid-system-for-the-visually-impaired","title":"Theater Aid System for the Visually Impaired Through Transfer Learning of Spatio-Temporal Graph Convolution Networks","date":"2023-06-28","arxiv_id":"2306.16357","repositories_listed":0,"syntology":null},{"url":null,"slug":"bullying10k-a-neuromorphic-dataset-towards","title":"Bullying10K: A Large-Scale Neuromorphic Dataset towards Privacy-Preserving Bullying Recognition","date":"2023-06-20","arxiv_id":"2306.11546","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-video-moment-localization","title":"A Survey on Video Moment Localization","date":"2023-06-13","arxiv_id":"2306.07515","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-object-information-improves-skeleton","title":"How Object Information Improves Skeleton-based Human Action Recognition in Assembly Tasks","date":"2023-06-09","arxiv_id":"2306.05844","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-recognition-in-egocentric","title":"Human Action Recognition in Egocentric Perspective Using 2D Object and Hands Pose","date":"2023-06-08","arxiv_id":"2306.05147","repositories_listed":0,"syntology":null},{"url":null,"slug":"fpgahart-a-toolflow-for-throughput-oriented","title":"fpgaHART: A toolflow for throughput-oriented acceleration of 3D CNNs for HAR onto FPGAs","date":"2023-05-31","arxiv_id":"2305.19896","repositories_listed":0,"syntology":null},{"url":null,"slug":"fmm-x3d-fpga-based-modeling-and-mapping-of","title":"FMM-X3D: FPGA-based modeling and mapping of X3D for Human Action Recognition","date":"2023-05-29","arxiv_id":"2305.18479","repositories_listed":0,"syntology":null},{"url":"/paper/action-sensitivity-learning-for-temporal","slug":"action-sensitivity-learning-for-temporal","title":"Action Sensitivity Learning for Temporal Action Localization","date":"2023-05-25","arxiv_id":"2305.15701","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neural-networks-in-video-human-action","title":"Deep Neural Networks in Video Human Action Recognition: A Review","date":"2023-05-25","arxiv_id":"2305.15692","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-speed-human-action-recognition-using-a","title":"High Speed Human Action Recognition using a Photonic Reservoir Computer","date":"2023-05-24","arxiv_id":"2305.15283","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatiotemporal-attention-based-semantic","title":"Spatiotemporal Attention-based Semantic Compression for Real-time Video Recognition","date":"2023-05-22","arxiv_id":"2305.12796","repositories_listed":0,"syntology":null},{"url":"/paper/prompt-learning-for-action-recognition","slug":"prompt-learning-for-action-recognition","title":"SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition","date":"2023-05-21","arxiv_id":"2305.12437","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-scenario-decoupling-for-rat-aware","title":"Motion-Scenario Decoupling for Rat-Aware Video Position Prediction: Strategy and Benchmark","date":"2023-05-17","arxiv_id":"2305.18310","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-action-recognition-via-intra-and","title":"Few-shot Action Recognition via Intra- and Inter-Video Information Maximization","date":"2023-05-10","arxiv_id":"2305.06114","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-video-conditioned-policies-for","title":"Learning Video-Conditioned Policies for Unseen Manipulation Tasks","date":"2023-05-10","arxiv_id":"2305.06289","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-neural-networks-on-matrix-manifolds","title":"Building Neural Networks on Matrix Manifolds: A Gyrovector Space Approach","date":"2023-05-08","arxiv_id":"2305.04560","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-specific-query-key-attention-modeling","title":"Video-Specific Query-Key Attention Modeling for Weakly-Supervised Temporal Action Localization","date":"2023-05-07","arxiv_id":"2305.04186","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-baseline-on-continual-learning-methods-for","title":"A baseline on continual learning methods for video action recognition","date":"2023-04-20","arxiv_id":"2304.10335","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-3d-action-representation","title":"Self-Supervised 3D Action Representation Learning with Skeleton Cloud Colorization","date":"2023-04-18","arxiv_id":"2304.08799","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-real-time-algorithm-for-human-action","title":"A real-time algorithm for human action recognition in RGB and thermal video","date":"2023-04-04","arxiv_id":"2304.01567","repositories_listed":0,"syntology":null},{"url":"/paper/improve-temporal-action-proposals-using","slug":"improve-temporal-action-proposals-using","title":"Improve Temporal Action Proposals using Hierarchical Context","date":"2023-04-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"jcdnet-joint-of-common-and-definite-phases","title":"JCDNet: Joint of Common and Definite phases Network for Weakly Supervised Temporal Action Localization","date":"2023-03-30","arxiv_id":"2303.17294","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatiotemporally-discriminative-video","title":"Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding","date":"2023-03-28","arxiv_id":"2303.16341","repositories_listed":0,"syntology":null},{"url":"/paper/unified-keypoint-based-action-recognition","slug":"unified-keypoint-based-action-recognition","title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","date":"2023-03-27","arxiv_id":"2303.15270","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-knowledge-distillation-transformer","title":"Multi-view knowledge distillation transformer for human action recognition","date":"2023-03-25","arxiv_id":"2303.14358","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-prompting-for-low-shot-temporal","title":"Multi-modal Prompting for Low-Shot Temporal Action Localization","date":"2023-03-21","arxiv_id":"2303.11732","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-action-recognition-with-attentive","title":"Video Action Recognition with Attentive Semantic Units","date":"2023-03-17","arxiv_id":"2303.09756","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-occurrence-matters-learning-action","title":"Co-Occurrence Matters: Learning Action Relation for Temporal Action Localization","date":"2023-03-15","arxiv_id":"2303.08463","repositories_listed":0,"syntology":null},{"url":"/paper/aztr-aerial-video-action-recognition-with","slug":"aztr-aerial-video-action-recognition-with","title":"AZTR: Aerial Video Action Recognition with Auto Zoom and Temporal Reasoning","date":"2023-03-02","arxiv_id":"2303.01589","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-pose-track-with-graph-guided-sparse","title":"Texture-Based Input Feature Selection for Action Recognition","date":"2023-02-28","arxiv_id":"2303.00138","repositories_listed":0,"syntology":null},{"url":"/paper/multi-scale-motion-aware-module-for-video","slug":"multi-scale-motion-aware-module-for-video","title":"Multi-scale Motion-Aware Module for Video Action Recognition","date":"2023-02-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"table-tennis-stroke-detection-and-recognition","title":"Table Tennis Stroke Detection and Recognition Using Ball Trajectory Data","date":"2023-02-19","arxiv_id":"2302.09657","repositories_listed":0,"syntology":null},{"url":null,"slug":"skeleton-based-human-action-recognition-via","title":"Skeleton-based Human Action Recognition via Convolutional Neural Networks (CNN)","date":"2023-01-31","arxiv_id":"2301.13360","repositories_listed":0,"syntology":null},{"url":"/paper/action-capsules-human-skeleton-action","slug":"action-capsules-human-skeleton-action","title":"Action Capsules: Human Skeleton Action Recognition","date":"2023-01-30","arxiv_id":"2301.13090","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-perceiving-video-language-pre","title":"Temporal Perceiving Video-Language Pre-training","date":"2023-01-18","arxiv_id":"2301.07463","repositories_listed":0,"syntology":null},{"url":null,"slug":"cmae-v-contrastive-masked-autoencoders-for","title":"CMAE-V: Contrastive Masked Autoencoders for Video Action Recognition","date":"2023-01-15","arxiv_id":"2301.06018","repositories_listed":0,"syntology":null},{"url":null,"slug":"cnn-based-action-recognition-and-pose","title":"CNN-Based Action Recognition and Pose Estimation for Classifying Animal Behavior from Videos: A Survey","date":"2023-01-15","arxiv_id":"2301.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"ego-only-egocentric-action-detection-without","title":"Ego-Only: Egocentric Action Detection without Exocentric Transferring","date":"2023-01-03","arxiv_id":"2301.01380","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-listen-and-attack-backdoor-attacks","title":"Look, Listen, and Attack: Backdoor Attacks Against Video Action Recognition","date":"2023-01-03","arxiv_id":"2301.00986","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-robustness-analysis-of-video","title":"A Large-Scale Robustness Analysis of Video Action Recognition Models","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cascade-evidential-learning-for-open-world","title":"Cascade Evidential Learning for Open-World Weakly-Supervised Temporal Action Localization","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/pivotal-prior-driven-supervision-for-weakly","slug":"pivotal-prior-driven-supervision-for-weakly","title":"PivoTAL: Prior-Driven Supervision for Weakly-Supervised Temporal Action Localization","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"re2tal-rewiring-pretrained-video-backbones","title":"Re2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action Localization","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regen-a-good-generative-zero-shot-video","title":"ReGen: A good Generative Zero-Shot Video Classifier Should be Rewarded","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/two-stream-networks-for-weakly-supervised","slug":"two-stream-networks-for-weakly-supervised","title":"Two-Stream Networks for Weakly-Supervised Temporal Action Localization With Semantic-Aware Mechanisms","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/deep-set-conditioned-latent-representations-1","slug":"deep-set-conditioned-latent-representations-1","title":"Deep set conditioned latent representations for action recognition","date":"2022-12-21","arxiv_id":"2212.11030","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-human-action-recognition","title":"A Survey on Human Action Recognition","date":"2022-12-20","arxiv_id":"2301.06082","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-vision-language-pre-training-to","title":"Distilling Vision-Language Pre-training to Collaborate with Weakly-Supervised Temporal Action Localization","date":"2022-12-19","arxiv_id":"2212.09335","repositories_listed":0,"syntology":null},{"url":null,"slug":"icub-do-you-recognize-what-i-am-doing","title":"iCub! Do you recognize what I am doing?: multimodal human action recognition on multisensory-enabled iCub robot","date":"2022-12-17","arxiv_id":"2212.08859","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-appearance-a-video-representation-for","title":"Dynamic Appearance: A Video Representation for Action Recognition with Joint Training","date":"2022-11-23","arxiv_id":"2211.12748","repositories_listed":0,"syntology":null},{"url":null,"slug":"slow-motion-matters-a-slow-motion-enhanced","title":"Slow Motion Matters: A Slow Motion Enhanced Network for Weakly Supervised Temporal Action Localization","date":"2022-11-21","arxiv_id":"2211.11324","repositories_listed":0,"syntology":null},{"url":null,"slug":"problem-behaviors-recognition-in-videos-using","title":"Language-Assisted Deep Learning for Autistic Behaviors Recognition","date":"2022-11-17","arxiv_id":"2211.09310","repositories_listed":0,"syntology":null},{"url":null,"slug":"prior-enhanced-temporal-action-localization","title":"Prior-enhanced Temporal Action Localization using Subject-aware Spatial Attention","date":"2022-11-10","arxiv_id":"2211.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-temporal-data-augmentation-for","title":"Extending Temporal Data Augmentation for Video Action Recognition","date":"2022-11-09","arxiv_id":"2211.04888","repositories_listed":0,"syntology":null},{"url":"/paper/could-giant-pretrained-image-models-extract","slug":"could-giant-pretrained-image-models-extract","title":"Could Giant Pretrained Image Models Extract Universal Representations?","date":"2022-11-03","arxiv_id":"2211.02043","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-computer-vision-algorithms-for","title":"Deep Learning Computer Vision Algorithms for Real-time UAVs On-board Camera Image Processing","date":"2022-11-02","arxiv_id":"2211.01037","repositories_listed":0,"syntology":null},{"url":"/paper/star-transformer-a-spatio-temporal-cross-1","slug":"star-transformer-a-spatio-temporal-cross-1","title":"STAR-Transformer: A Spatio-temporal Cross Attention Transformer for Human Action Recognition","date":"2022-10-14","arxiv_id":"2210.07503","repositories_listed":0,"syntology":null},{"url":null,"slug":"pose-guided-graph-convolutional-networks-for","title":"Pose-Guided Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2022-10-10","arxiv_id":"2210.06192","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-guided-temporal-attention-for-video","title":"Alignment-guided Temporal Attention for Video Action Recognition","date":"2022-09-30","arxiv_id":"2210.00132","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-driven-ai-paradigm-for-human","title":"Application-Driven AI Paradigm for Human Action Recognition","date":"2022-09-30","arxiv_id":"2209.15271","repositories_listed":0,"syntology":null},{"url":null,"slug":"rest-retrieve-self-train-for-generative","title":"REST: REtrieve & Self-Train for generative action recognition","date":"2022-09-29","arxiv_id":"2209.15000","repositories_listed":0,"syntology":null},{"url":null,"slug":"view-invariant-skeleton-based-action","title":"View-Invariant Skeleton-based Action Recognition via Global-Local Contrastive Learning","date":"2022-09-23","arxiv_id":"2209.11634","repositories_listed":0,"syntology":null},{"url":null,"slug":"futh-net-fusing-temporal-relations-and","title":"FuTH-Net: Fusing Temporal Relations and Holistic Features for Aerial Video Classification","date":"2022-09-22","arxiv_id":"2209.11316","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-frequency-based","title":"Differentiable Frequency-based Disentanglement for Aerial Video Action Recognition","date":"2022-09-15","arxiv_id":"2209.09194","repositories_listed":0,"syntology":null},{"url":"/paper/omnivl-one-foundation-model-for-image","slug":"omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","arxiv_id":"2209.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-transformers-for-action-recognition-a","title":"Vision Transformers for Action Recognition: A Survey","date":"2022-09-13","arxiv_id":"2209.05700","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-contrastive-learning-with-curriculum","title":"Temporal Contrastive Learning with Curriculum","date":"2022-09-02","arxiv_id":"2209.00760","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-with-effective-scoring","title":"Active Learning with Effective Scoring Functions for Semi-Supervised Temporal Action Localization","date":"2022-08-31","arxiv_id":"2208.14856","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-perception-transformer-for-temporal","title":"Adaptive Perception Transformer for Temporal Action Localization","date":"2022-08-25","arxiv_id":"2208.11908","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-weakly-supervised-temporal-action","title":"Enabling Weakly-Supervised Temporal Action Localization from On-Device Learning of the Video Stream","date":"2022-08-25","arxiv_id":"2208.12673","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-cross-modal-knowledge","title":"Progressive Cross-modal Knowledge Distillation for Human Action Recognition","date":"2022-08-17","arxiv_id":"2208.08090","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-action-localization-with-multi","title":"Temporal Action Localization with Multi-temporal Scales","date":"2022-08-16","arxiv_id":"2208.07493","repositories_listed":0,"syntology":null},{"url":null,"slug":"babynet-a-lightweight-network-for-infant","title":"BabyNet: A Lightweight Network for Infant Reaching Action Recognition in Unconstrained Environments to Support Future Pediatric Rehabilitation Applications","date":"2022-08-09","arxiv_id":"2208.04950","repositories_listed":0,"syntology":null},{"url":"/paper/spatial-temporal-pyramid-graph-reasoning-for","slug":"spatial-temporal-pyramid-graph-reasoning-for","title":"Spatial-Temporal Pyramid Graph Reasoning for Action Recognition","date":"2022-08-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"video-based-human-action-recognition-using","title":"Video-based Human Action Recognition using Deep Learning: A Review","date":"2022-08-07","arxiv_id":"2208.03775","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockwise-temporal-spatial-pathway-network","title":"Blockwise Temporal-Spatial Pathway Network","date":"2022-08-05","arxiv_id":"2208.03040","repositories_listed":0,"syntology":null},{"url":null,"slug":"combined-cnn-transformer-encoder-for-enhanced","title":"Combined CNN Transformer Encoder for Enhanced Fine-grained Human Action Recognition","date":"2022-08-03","arxiv_id":"2208.01897","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-elderly-monitoring-for-senior","title":"Real-Time Elderly Monitoring for Senior Safety by Lightweight Human Action Recognition","date":"2022-07-21","arxiv_id":"2207.10519","repositories_listed":0,"syntology":null},{"url":null,"slug":"htnet-anchor-free-temporal-action","title":"HTNet: Anchor-free Temporal Action Localization with Hierarchical Transformers","date":"2022-07-20","arxiv_id":"2207.09662","repositories_listed":0,"syntology":null},{"url":null,"slug":"lava-language-audio-vision-alignment-for","title":"LAVA: Language Audio Vision Alignment for Contrastive Video Pre-Training","date":"2022-07-16","arxiv_id":"2207.08024","repositories_listed":0,"syntology":null},{"url":null,"slug":"forcing-the-whole-video-as-background-an","title":"Forcing the Whole Video as Background: An Adversarial Learning Strategy for Weakly Temporal Action Localization","date":"2022-07-14","arxiv_id":"2207.06659","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-transformer-network-with-transfer","title":"Spatial Transformer Network with Transfer Learning for Small-scale Fine-grained Skeleton-based Tai Chi Action Recognition","date":"2022-06-30","arxiv_id":"2206.15002","repositories_listed":0,"syntology":null}],"record_sha256":"2bc2e92012d7a3c7b1cfa95b6536a963dfd21eb14efc2d7449b0543bc3d16cd2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}