{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition-in-videos/papers/20","list_of":"/task/action-recognition-in-videos","task":"Action Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":20,"pages_in_order":28,"rows_per_page":100,"rows":[1901,2000],"of":2759,"counts":{"archive_papers_tagged":2759,"with_a_code_link":1058,"where_syntology_ran_a_sample":275,"not_listed_spam_title":0,"listed":2759,"listed_where_code_ran":275,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":232,"every_run_a_failure_of_syntologys_instrument":43,"listed_with_a_run_with_no_instrument_failure":232,"listed_every_run_a_failure_of_syntologys_instrument":43,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition-in-videos","prev":"/task/action-recognition-in-videos/papers/19","next":"/task/action-recognition-in-videos/papers/21","papers":[{"url":null,"slug":"developing-motion-code-embedding-for-action","title":"Developing Motion Code Embedding for Action Recognition in Videos","date":"2020-12-10","arxiv_id":"2012.05438","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-scale-temporal-graph-networks-for","title":"Multi Scale Temporal Graph Networks For Skeleton-based Action Recognition","date":"2020-12-05","arxiv_id":"2012.02970","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-temporal-alignment-network-for-action","title":"Spatial-Temporal Alignment Network for Action Recognition and Detection","date":"2020-12-04","arxiv_id":"2012.02426","repositories_listed":0,"syntology":null},{"url":null,"slug":"recovering-trajectories-of-unmarked-joints-in","title":"Recovering Trajectories of Unmarked Joints in 3D Human Actions Using Latent Space Optimization","date":"2020-12-03","arxiv_id":"2012.02043","repositories_listed":0,"syntology":null},{"url":null,"slug":"safcar-structured-attention-fusion-for","title":"SAFCAR: Structured Attention Fusion for Compositional Action Recognition","date":"2020-12-03","arxiv_id":"2012.02109","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-semi-supervised-action-recognition","title":"Sparse Semi-Supervised Action Recognition with Active Learning","date":"2020-12-03","arxiv_id":"2012.01740","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-activity-recognition-for","title":"Fine-grained activity recognition for assembly videos","date":"2020-12-02","arxiv_id":"2012.01392","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-compact-sequence-encoding-scheme-for-online","title":"A compact sequence encoding scheme for online human activity recognition in HRI applications","date":"2020-12-01","arxiv_id":"2012.00873","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-action-recognition-framework-for-video","title":"A New Action Recognition Framework for Video Highlights Summarization in Sporting Events","date":"2020-12-01","arxiv_id":"2012.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotation-efficient-untrimmed-video-action","title":"Annotation-Efficient Untrimmed Video Action Recognition","date":"2020-11-30","arxiv_id":"2011.14478","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-one-moment-inconspicuous-one-frame","title":"Just One Moment: Structural Vulnerability of Deep Action Recognition against One Frame Attack","date":"2020-11-30","arxiv_id":"2011.14585","repositories_listed":0,"syntology":null},{"url":null,"slug":"depth-aware-action-recognition-pose-motion","title":"Depth-Aware Action Recognition: Pose-Motion Encoding through Temporal Heatmaps","date":"2020-11-26","arxiv_id":"2011.13399","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-skeleton-based-human-action-recognition-1","title":"Group-Skeleton-Based Human Action Recognition in Complex Events","date":"2020-11-26","arxiv_id":"2011.13273","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-progress-in-appearance-based-action","title":"Recent Progress in Appearance-based Action Recognition","date":"2020-11-25","arxiv_id":"2011.12619","repositories_listed":0,"syntology":null},{"url":null,"slug":"a3d-adaptive-3d-networks-for-video-action","title":"A3D: Adaptive 3D Networks for Video Action Recognition","date":"2020-11-24","arxiv_id":"2011.12384","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-sign-language-recognition-with-3d","title":"Independent Sign Language Recognition with 3D Body, Hands, and Face Reconstruction","date":"2020-11-24","arxiv_id":"2012.05698","repositories_listed":0,"syntology":null},{"url":null,"slug":"kshapenet-riemannian-network-on-kendall-shape","title":"KShapeNet: Riemannian network on Kendall shape space for Skeleton based Action Recognition","date":"2020-11-24","arxiv_id":"2011.12004","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-concept-grounding-network-for-1","title":"Modular Action Concept Grounding in Semantic Video Prediction","date":"2020-11-23","arxiv_id":"2011.11201","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchically-decoupled-spatial-temporal","title":"Hierarchically Decoupled Spatial-Temporal Contrast for Self-supervised Video Representation Learning","date":"2020-11-23","arxiv_id":"2011.11261","repositories_listed":0,"syntology":null},{"url":null,"slug":"learnable-sampling-3d-convolution-for-video","title":"Learnable Sampling 3D Convolution for Video Enhancement and Action Recognition","date":"2020-11-22","arxiv_id":"2011.10974","repositories_listed":0,"syntology":null},{"url":null,"slug":"dare-ai-based-diver-action-recognition-system","title":"DARE: AI-based Diver Action Recognition System using Multi-Channel CNNs for AUV Supervision","date":"2020-11-16","arxiv_id":"2011.07713","repositories_listed":0,"syntology":null},{"url":null,"slug":"jolo-gcn-mining-joint-centered-light-weight","title":"JOLO-GCN: Mining Joint-Centered Light-Weight Information for Skeleton-Based Action Recognition","date":"2020-11-16","arxiv_id":"2011.07787","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-activity-recognition-using-improved","title":"Human activity recognition using improved dynamic image","date":"2020-11-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-spatio-temporal-graph","title":"Progressive Spatio-Temporal Graph Convolutional Network for Skeleton-Based Human Action Recognition","date":"2020-11-11","arxiv_id":"2011.05668","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-video-representation-learning-by","title":"Unsupervised Video Representation Learning by Bidirectional Feature Prediction","date":"2020-11-11","arxiv_id":"2011.06037","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowcaps-optical-flow-estimation-with-capsule","title":"FlowCaps: Optical Flow Estimation with Capsule Networks For Action Recognition","date":"2020-11-08","arxiv_id":"2011.03958","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-representations-from-audio-visual","title":"Learning Representations from Audio-Visual Spatial Alignment","date":"2020-11-03","arxiv_id":"2011.01819","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-group-sampling-based-online-action","title":"Memory Group Sampling Based Online Action Recognition Using Kinetic Skeleton Features","date":"2020-11-01","arxiv_id":"2011.00553","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-contrastive-self-supervised","title":"A Survey on Contrastive Self-supervised Learning","date":"2020-10-31","arxiv_id":"2011.00362","repositories_listed":0,"syntology":null},{"url":"/paper/bubblenet-a-disperse-recurrent-structure-to","slug":"bubblenet-a-disperse-recurrent-structure-to","title":"Bubblenet: A Disperse Recurrent Structure To Recognize Activities","date":"2020-10-30","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pose-based-body-language-recognition-for","title":"Pose-based Body Language Recognition for Emotion and Psychiatric Symptom Interpretation","date":"2020-10-30","arxiv_id":"2011.00043","repositories_listed":0,"syntology":null},{"url":null,"slug":"sar-nas-skeleton-based-action-recognition-via","title":"SAR-NAS: Skeleton-based Action Recognition via Neural Architecture Searching","date":"2020-10-29","arxiv_id":"2010.15336","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-contrast-for-self-supervised-video","title":"Cycle-Contrast for Self-Supervised Video Representation Learning","date":"2020-10-28","arxiv_id":"2010.14810","repositories_listed":0,"syntology":null},{"url":null,"slug":"eldersim-a-synthetic-data-generation-platform","title":"ElderSim: A Synthetic Data Generation Platform for Human Action Recognition in Eldercare Applications","date":"2020-10-28","arxiv_id":"2010.14742","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-attention-augmented-graph","title":"Temporal Attention-Augmented Graph Convolutional Network for Efficient Skeleton-Based Human Action Recognition","date":"2020-10-23","arxiv_id":"2010.12221","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-sort-image-sequences-via","title":"Learning to Sort Image Sequences via Accumulated Temporal Differences","date":"2020-10-22","arxiv_id":"2010.11649","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-grid-based-representation-for-human-action","title":"A Grid-based Representation for Human Action Recognition","date":"2020-10-17","arxiv_id":"2010.08841","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-accurate-person-level-action","title":"Toward Accurate Person-level Action Recognition in Videos of Crowded Scenes","date":"2020-10-16","arxiv_id":"2010.08365","repositories_listed":0,"syntology":null},{"url":"/paper/pose-refinement-graph-convolutional-network","slug":"pose-refinement-graph-convolutional-network","title":"Pose Refinement Graph Convolutional Network for Skeleton-based Action Recognition","date":"2020-10-14","arxiv_id":"2010.07367","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-action-recognition-with-implicit","title":"Few-shot Action Recognition with Implicit Temporal Alignment and Pair Similarity Optimization","date":"2020-10-13","arxiv_id":"2010.06215","repositories_listed":0,"syntology":null},{"url":null,"slug":"reconfigurable-cyber-physical-system-for","title":"Reconfigurable Cyber-Physical System for Lifestyle Video-Monitoring via Deep Learning","date":"2020-10-07","arxiv_id":"2010.03497","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-variational-information-bottleneck-based","title":"A Variational Information Bottleneck Based Method to Compress Sequential Networks for Human Action Recognition","date":"2020-10-03","arxiv_id":"2010.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-fusion-transformers-for-video","title":"Knowledge Fusion Transformers for Video Action Recognition","date":"2020-09-29","arxiv_id":"2009.13782","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-concept-grounding-network-for","title":"Action Concept Grounding Network for Semantically-Consistent Video Generation","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"event-based-action-recognition-using","title":"Event-based Action Recognition Using Timestamp Image Encoding Network","date":"2020-09-28","arxiv_id":"2009.13049","repositories_listed":0,"syntology":null},{"url":"/paper/perf-net-pose-empowered-rgb-flow-net","slug":"perf-net-pose-empowered-rgb-flow-net","title":"PERF-Net: Pose Empowered RGB-Flow Net","date":"2020-09-28","arxiv_id":"2009.13087","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learnable-keyframe-extraction-in","title":"Online Learnable Keyframe Extraction in Videos and its Application with Semantic Word Vector in Action Recognition","date":"2020-09-25","arxiv_id":"2009.12434","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepactsnet-spatial-and-motion-features-from","title":"DeepActsNet: Spatial and Motion features from Face, Hands, and Body Combined with Convolutional and Graph Networks for Improved Action Recognition","date":"2020-09-21","arxiv_id":"2009.09818","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-guided-learning-towards-open-domain","title":"Knowledge Guided Learning: Towards Open Domain Egocentric Action Recognition with Zero Supervision","date":"2020-09-16","arxiv_id":"2009.07470","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-distillation-in-the-parameter","title":"Collaborative Distillation in the Parameter and Spectrum Domains for Video Action Recognition","date":"2020-09-15","arxiv_id":"2009.06902","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-attention-mechanism-for-multi","title":"Collaborative Attention Mechanism for Multi-View Action Recognition","date":"2020-09-14","arxiv_id":"2009.06599","repositories_listed":0,"syntology":null},{"url":"/paper/haa500-human-centric-atomic-action-dataset","slug":"haa500-human-centric-atomic-action-dataset","title":"HAA500: Human-Centric Atomic Action Dataset with Curated Videos","date":"2020-09-11","arxiv_id":"2009.05224","repositories_listed":0,"syntology":null},{"url":null,"slug":"unmanned-aerial-vehicle-control-through","title":"Unmanned Aerial Vehicle Control Through Domain-based Automatic Speech Recognition","date":"2020-09-09","arxiv_id":"2009.04215","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-action-recognition-system-for-smart","title":"A novel action recognition system for smart monitoring of elderly people using Action Pattern Image and Series CNN with transfer learning","date":"2020-09-07","arxiv_id":"2009.03285","repositories_listed":0,"syntology":null},{"url":null,"slug":"view-invariant-action-recognition","title":"View-invariant action recognition","date":"2020-09-01","arxiv_id":"2009.00638","repositories_listed":0,"syntology":null},{"url":"/paper/all-about-knowledge-graphs-for-actions","slug":"all-about-knowledge-graphs-for-actions","title":"All About Knowledge Graphs for Actions","date":"2020-08-28","arxiv_id":"2008.12432","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-prospective-study-on-sequence-driven","title":"A Prospective Study on Sequence-Driven Temporal Sampling and Ego-Motion Compensation for Action Recognition in the EPIC-Kitchens Dataset","date":"2020-08-26","arxiv_id":"2008.11588","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-action-recognition-with-embedded","title":"Effective Action Recognition with Embedded Key Point Shifts","date":"2020-08-26","arxiv_id":"2008.11378","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-concept-reasoning-networks","title":"Visual Concept Reasoning Networks","date":"2020-08-26","arxiv_id":"2008.11783","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-networks-for-lane-change","title":"Two-Stream Networks for Lane-Change Prediction of Surrounding Vehicles","date":"2020-08-25","arxiv_id":"2008.10869","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-support-for-video-based-detection-of","title":"Decision Support for Video-based Detection of Flu Symptoms","date":"2020-08-24","arxiv_id":"2008.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"multidomain-multimodal-fusion-for-human","title":"Multidomain Multimodal Fusion For Human Action Recognition Using Inertial Sensors","date":"2020-08-22","arxiv_id":"2008.09748","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-improved-human-action-recognition","title":"Towards Improved Human Action Recognition Using Convolutional Neural Networks and Multimodal Fusion of Depth and Inertial Sensor Data","date":"2020-08-22","arxiv_id":"2008.09747","repositories_listed":0,"syntology":null},{"url":null,"slug":"accuracy-and-performance-comparison-of-video","title":"Accuracy and Performance Comparison of Video Action Recognition Approaches","date":"2020-08-20","arxiv_id":"2008.09037","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-properties-inferring-from-and-transfer","title":"Object Properties Inferring from and Transfer for Human Interaction Motions","date":"2020-08-20","arxiv_id":"2008.08999","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-listen-and-attend-co-attention-network","title":"Look, Listen, and Attend: Co-Attention Network for Self-Supervised Audio-Visual Representation Learning","date":"2020-08-13","arxiv_id":"2008.05789","repositories_listed":0,"syntology":null},{"url":null,"slug":"2nd-place-scheme-on-action-recognition-track","title":"2nd Place Scheme on Action Recognition Track of ECCV 2020 VIPriors Challenges: An Efficient Optical Flow Stream Guided Framework","date":"2020-08-10","arxiv_id":"2008.03996","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-relations-in-untrimmed-videos-for","title":"Exploring Relations in Untrimmed Videos for Self-Supervised Learning","date":"2020-08-06","arxiv_id":"2008.02711","repositories_listed":0,"syntology":null},{"url":null,"slug":"recognition-and-3d-localization-of-pedestrian","title":"Recognition and 3D Localization of Pedestrian Actions from Monocular Video","date":"2020-08-03","arxiv_id":"2008.01162","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-frames-with-efficient-pseudo-3d-cnn","title":"Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition","date":"2020-08-03","arxiv_id":"2008.01057","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-and-inertial-sensing-fusion-for-human","title":"Vision and Inertial Sensing Fusion for Human Action Recognition : A Review","date":"2020-08-02","arxiv_id":"2008.00380","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-skeleton-based-action","title":"Improving Skeleton-based Action Recognitionwith Robust Spatial and Temporal Features","date":"2020-08-01","arxiv_id":"2008.00324","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-actionness-via-long-range-temporal","title":"Learning Actionness via Long-range Temporal Order Verification","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-video-representations-by","title":"Learning Video Representations by Transforming Time","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-dropping-clusters-to-regularize-graph","title":"On Dropping Clusters to Regularize Graph Convolutional Neural Networks","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-motion-representation-via","title":"Self-supervised Motion Representation via Scattering Local Motion Cues","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/shuffle-and-attend-video-domain-adaptation","slug":"shuffle-and-attend-video-domain-adaptation","title":"Shuffle and Attend: Video Domain Adaptation","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/towards-efficient-coarse-to-fine-networks-for","slug":"towards-efficient-coarse-to-fine-networks-for","title":"Towards Efficient Coarse-to-Fine Networks for Action and Gesture Recognition","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-action-classification-with","slug":"hierarchical-action-classification-with","title":"Hierarchical Action Classification with Network Pruning","date":"2020-07-30","arxiv_id":"2007.15244","repositories_listed":0,"syntology":null},{"url":"/paper/mix-dimension-in-poincare-geometry-for-3d","slug":"mix-dimension-in-poincare-geometry-for-3d","title":"Mix Dimension in Poincaré Geometry for 3D Skeleton-based Action Recognition","date":"2020-07-30","arxiv_id":"2007.15678","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-video-representations-from-textual","title":"Learning Video Representations from Textual Web Supervision","date":"2020-07-29","arxiv_id":"2007.14937","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-impact-of-lossy-image-and-video","title":"On the Impact of Lossy Image and Video Compression on the Performance of Deep Convolutional Neural Network Architectures","date":"2020-07-28","arxiv_id":"2007.14314","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-with-video-deep","title":"Representation Learning with Video Deep InfoMax","date":"2020-07-27","arxiv_id":"2007.13278","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-vfx-deep-action-recognition-driven-vfx","title":"Deep-VFX: Deep Action Recognition Driven VFX for Short Video","date":"2020-07-22","arxiv_id":"2007.11257","repositories_listed":0,"syntology":null},{"url":null,"slug":"depthwise-spatio-temporal-stft-convolutional","title":"Depthwise Spatio-Temporal STFT Convolutional Neural Networks for Human Action Recognition","date":"2020-07-22","arxiv_id":"2007.11365","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-ception-network-towards-multi-scale","title":"Perceptron Synthesis Network: Rethinking the Action Scale Variances in Videos","date":"2020-07-22","arxiv_id":"2007.11460","repositories_listed":0,"syntology":null},{"url":null,"slug":"directional-temporal-modeling-for-action","title":"Directional Temporal Modeling for Action Recognition","date":"2020-07-21","arxiv_id":"2007.11040","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-weakly-supervised-action","title":"Uncertainty-Aware Weakly Supervised Action Detection from Untrimmed Videos","date":"2020-07-21","arxiv_id":"2007.10703","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-representation-learning-by-recognizing","title":"Video Representation Learning by Recognizing Temporal Transformations","date":"2020-07-21","arxiv_id":"2007.10730","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-contrastive-motion-learning-for","title":"Hierarchical Contrastive Motion Learning for Video Action Recognition","date":"2020-07-20","arxiv_id":"2007.10321","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenge-report-vipriors-action-recognition","title":"Challenge report:VIPriors Action Recognition Challenge","date":"2020-07-16","arxiv_id":"2007.08180","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-end-to-end-action-interaction-by","title":"Learning End-to-End Action Interaction by Paired-Embedding Data Augmentation","date":"2020-07-16","arxiv_id":"2007.08071","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-distinct-representation-learning-for","title":"Temporal Distinct Representation Learning for Action Recognition","date":"2020-07-15","arxiv_id":"2007.07626","repositories_listed":0,"syntology":null},{"url":null,"slug":"multitask-non-autoregressive-model-for-human","title":"Multitask Non-Autoregressive Model for Human Motion Prediction","date":"2020-07-13","arxiv_id":"2007.06426","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-to-specific-framework-for-complex","title":"Universal-to-Specific Framework for Complex Action Recognition","date":"2020-07-13","arxiv_id":"2007.06149","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-self-supervised-learning-for-semi","title":"Adversarial Self-Supervised Learning for Semi-Supervised 3D Action Recognition","date":"2020-07-12","arxiv_id":"2007.05934","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-via-adversarially","title":"Representation Learning via Adversarially-Contrastive Optimal Transport","date":"2020-07-11","arxiv_id":"2007.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-speech-representations-from-raw","title":"Learning Speech Representations from Raw Audio by Joint Audiovisual Self-Supervision","date":"2020-07-08","arxiv_id":"2007.04134","repositories_listed":0,"syntology":null},{"url":null,"slug":"complex-human-action-recognition-in-live","title":"Complex Human Action Recognition in Live Videos Using Hybrid FR-DL Method","date":"2020-07-06","arxiv_id":"2007.02811","repositories_listed":0,"syntology":null},{"url":null,"slug":"egocentric-action-recognition-by-video","title":"Egocentric Action Recognition by Video Attention and Temporal Context","date":"2020-07-03","arxiv_id":"2007.01883","repositories_listed":0,"syntology":null}],"record_sha256":"d18d61d5cf9a5779844174dedfcc978051250cad07aa565eb1c275428cd63243","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}