{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/action-recognition-in-videos/papers/19","list_of":"/task/action-recognition-in-videos","task":"Action Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":19,"pages_in_order":28,"rows_per_page":100,"rows":[1801,1900],"of":2759,"counts":{"archive_papers_tagged":2759,"with_a_code_link":1058,"where_syntology_ran_a_sample":275,"not_listed_spam_title":0,"listed":2759,"listed_where_code_ran":275,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":232,"every_run_a_failure_of_syntologys_instrument":43,"listed_with_a_run_with_no_instrument_failure":232,"listed_every_run_a_failure_of_syntologys_instrument":43,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/action-recognition-in-videos","prev":"/task/action-recognition-in-videos/papers/18","next":"/task/action-recognition-in-videos/papers/20","papers":[{"url":"/paper/word-level-sign-language-recognition-with","slug":"word-level-sign-language-recognition-with","title":"Word-level Sign Language Recognition with Multi-stream Neural Networks Focusing on Local Regions and Skeletal Information","date":"2021-06-30","arxiv_id":"2106.15989","repositories_listed":0,"syntology":null},{"url":null,"slug":"team-pykale-xy9-submission-to-the-epic","title":"Team PyKale (xy9) Submission to the EPIC-Kitchens 2021 Unsupervised Domain Adaptation Challenge for Action Recognition","date":"2021-06-22","arxiv_id":"2106.12023","repositories_listed":0,"syntology":null},{"url":null,"slug":"shrec-2021-track-on-skeleton-based-hand","title":"SHREC 2021: Track on Skeleton-based Hand Gesture Recognition in the Wild","date":"2021-06-21","arxiv_id":"2106.10980","repositories_listed":0,"syntology":null},{"url":"/paper/graph-based-high-order-relation-modeling-for","slug":"graph-based-high-order-relation-modeling-for","title":"Graph-Based High-Order Relation Modeling for Long-Term Action Recognition","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-graphs-for-knowledge-transfer-with","title":"Learning Graphs for Knowledge Transfer With Limited Labels","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-contrastive-domain-adaptation","title":"Spatio-temporal Contrastive Domain Adaptation for Action Recognition","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"epic-kitchens-100-unsupervised-domain","title":"EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report","date":"2021-06-18","arxiv_id":"2106.10026","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-short-temporal-contrastive-learning-of","title":"Long-Short Temporal Contrastive Learning of Video Transformers","date":"2021-06-17","arxiv_id":"2106.09212","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-forward-propagation-for-large-scale","title":"Gradient Forward-Propagation for Large-Scale Temporal Video Modelling","date":"2021-06-15","arxiv_id":"2106.08318","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformed-rois-for-capturing-visual","title":"Transformed ROIs for Capturing Visual Transformations in Videos","date":"2021-06-06","arxiv_id":"2106.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"ascnet-self-supervised-video-representation","title":"ASCNet: Self-supervised Video Representation Learning with Appearance-Speed Consistency","date":"2021-06-04","arxiv_id":"2106.02342","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-domain-first-person-audio-visual-action","title":"Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment","date":"2021-06-03","arxiv_id":"2106.01689","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsi-temporal-saliency-integration-for-video","title":"TSI: Temporal Saliency Integration for Video Action Recognition","date":"2021-06-02","arxiv_id":"2106.01088","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-the-effects-of-pre-processing-on","title":"A Study On the Effects of Pre-processing On Spatio-temporal Action Recognition Using Spiking Neural Networks Trained with STDP","date":"2021-05-31","arxiv_id":"2105.14740","repositories_listed":0,"syntology":null},{"url":null,"slug":"inertial-sensor-data-to-image-encoding-for","title":"Inertial Sensor Data To Image Encoding For Human Action Recognition","date":"2021-05-28","arxiv_id":"2105.13533","repositories_listed":0,"syntology":null},{"url":null,"slug":"ssan-separable-self-attention-network-for","title":"SSAN: Separable Self-Attention Network for Video Representation Learning","date":"2021-05-27","arxiv_id":"2105.13033","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-imaginative-generative-adversarial","title":"The Imaginative Generative Adversarial Network: Automatic Data Augmentation for Dynamic Skeleton-Based Hand Gesture and Human Action Recognition","date":"2021-05-27","arxiv_id":"2105.13061","repositories_listed":0,"syntology":null},{"url":null,"slug":"anticipating-human-actions-by-correlating","title":"Anticipating human actions by correlating past with the future with Jaccard similarity measures","date":"2021-05-26","arxiv_id":"2105.12414","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-for-vision-kg-for-relation-a-two-stage","title":"GAN for Vision, KG for Relation: a Two-stage Deep Network for Zero-shot Action Recognition","date":"2021-05-25","arxiv_id":"2105.11789","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-human-action-recognition-using","title":"Real-time Human Action Recognition Using Locally Aggregated Kinematic-Guided Skeletonlet and Supervised Hashing-by-Analysis Model","date":"2021-05-24","arxiv_id":"2105.11312","repositories_listed":0,"syntology":null},{"url":null,"slug":"egocentric-activity-recognition-and","title":"Egocentric Activity Recognition and Localization on a 3D Map","date":"2021-05-20","arxiv_id":"2105.09544","repositories_listed":0,"syntology":null},{"url":null,"slug":"regina-reasoning-graph-convolutional-networks","title":"REGINA - Reasoning Graph Convolutional Networks in Human Action Recognition","date":"2021-05-14","arxiv_id":"2105.06711","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-of-image-representations","title":"Contrastive Learning of Image Representations with Cross-Video Cycle-Consistency","date":"2021-05-13","arxiv_id":"2105.06463","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-review-of-deep-learning","title":"An Empirical Review of Deep Learning Frameworks for Change Detection: Model Design, Experimental Frameworks, Challenges and Research Needs","date":"2021-05-04","arxiv_id":"2105.01342","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-augmented-self-training-for-video","title":"Motion-Augmented Self-Training for Video Recognition at Smaller Scale","date":"2021-05-04","arxiv_id":"2105.01646","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-in-mind-a-neural-network-approach-to","title":"Action in Mind: A Neural Network Approach to Action Recognition and Segmentation","date":"2021-04-30","arxiv_id":"2104.14870","repositories_listed":0,"syntology":null},{"url":"/paper/unsupervised-discriminative-embedding-for-sub","slug":"unsupervised-discriminative-embedding-for-sub","title":"Unsupervised Discriminative Embedding for Sub-Action Learning in Complex Activities","date":"2021-04-30","arxiv_id":"2105.00067","repositories_listed":0,"syntology":null},{"url":null,"slug":"three-stream-network-for-enriched-action","title":"Three-stream network for enriched Action Recognition","date":"2021-04-27","arxiv_id":"2104.13051","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-convolutional-neural-networks-for-2","title":"3D Convolutional Neural Networks for Ultrasound-Based Silent Speech Interfaces","date":"2021-04-23","arxiv_id":"2104.11532","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-long-term-interactions-to-enhance","title":"Modeling long-term interactions to enhance action recognition","date":"2021-04-23","arxiv_id":"2104.11520","repositories_listed":0,"syntology":null},{"url":"/paper/vidtr-video-transformer-without-convolutions","slug":"vidtr-video-transformer-without-convolutions","title":"VidTr: Video Transformer Without Convolutions","date":"2021-04-23","arxiv_id":"2104.11746","repositories_listed":0,"syntology":null},{"url":"/paper/h2o-two-hands-manipulating-objects-for-first","slug":"h2o-two-hands-manipulating-objects-for-first","title":"H2O: Two Hands Manipulating Objects for First Person Interaction Recognition","date":"2021-04-22","arxiv_id":"2104.11181","repositories_listed":0,"syntology":null},{"url":null,"slug":"skimming-and-scanning-for-untrimmed-video","title":"Skimming and Scanning for Untrimmed Video Action Recognition","date":"2021-04-21","arxiv_id":"2104.10492","repositories_listed":0,"syntology":null},{"url":"/paper/temporal-query-networks-for-fine-grained","slug":"temporal-query-networks-for-fine-grained","title":"Temporal Query Networks for Fine-grained Video Understanding","date":"2021-04-19","arxiv_id":"2104.09496","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-based-timestamp-image-encoding-network","title":"Event-based Timestamp Image Encoding Network for Human Action Recognition and Anticipation","date":"2021-04-12","arxiv_id":"2104.05145","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-chebyshev-basis-in-graph","title":"Learning Chebyshev Basis in Graph Convolutional Networks for Skeleton-based Action Recognition","date":"2021-04-12","arxiv_id":"2104.05482","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-action-recognition-with-compromised","title":"Few-Shot Action Recognition with Compromised Metric via Optimal Transport","date":"2021-04-08","arxiv_id":"2104.03737","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-short-clips-end-to-end-video-level","title":"Beyond Short Clips: End-to-End Video-Level Learning with Collaborative Memories","date":"2021-04-02","arxiv_id":"2104.01198","repositories_listed":0,"syntology":null},{"url":null,"slug":"composable-augmentation-encoding-for-video","title":"Composable Augmentation Encoding for Video Representation Learning","date":"2021-04-01","arxiv_id":"2104.00616","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-guided-attention-fusion-to-recognize","title":"Motion Guided Attention Fusion to Recognize Interactions from Videos","date":"2021-04-01","arxiv_id":"2104.00646","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-feature-compression-for-efficient","title":"Selective Feature Compression for Efficient Activity Recognition Inference","date":"2021-04-01","arxiv_id":"2104.00179","repositories_listed":0,"syntology":null},{"url":"/paper/recognizing-actions-in-videos-from-unseen","slug":"recognizing-actions-in-videos-from-unseen","title":"Recognizing Actions in Videos from Unseen Viewpoints","date":"2021-03-30","arxiv_id":"2103.16516","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-temporal-action-3","title":"Weakly Supervised Temporal Action Localization Through Learning Explicit Subspaces for Action and Context","date":"2021-03-30","arxiv_id":"2103.16155","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-audio-visual-instance-discrimination","title":"Robust Audio-Visual Instance Discrimination","date":"2021-03-29","arxiv_id":"2103.15916","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-comprehensive-motion-representation","title":"Learning Comprehensive Motion Representation for Action Recognition","date":"2021-03-23","arxiv_id":"2103.12278","repositories_listed":0,"syntology":null},{"url":null,"slug":"adasgn-adapting-joint-number-and-model-size","title":"AdaSGN: Adapting Joint Number and Model Size for Efficient Skeleton-Based Action Recognition","date":"2021-03-22","arxiv_id":"2103.11770","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-spatialtemporal-context-modeling","title":"Efficient Spatialtemporal Context Modeling for Action Recognition","date":"2021-03-20","arxiv_id":"2103.11190","repositories_listed":0,"syntology":null},{"url":null,"slug":"clta-contents-and-length-based-temporal","title":"CLTA: Contents and Length-based Temporal Attention for Few-shot Action Recognition","date":"2021-03-18","arxiv_id":"2103.10567","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-vision-based-fall-detection","title":"Deep Learning for Vision-Based Fall Detection System: Enhanced Optical Dynamic Flow","date":"2021-03-18","arxiv_id":"2104.05744","repositories_listed":0,"syntology":null},{"url":null,"slug":"nas-tc-neural-architecture-search-on-temporal","title":"NAS-TC: Neural Architecture Search on Temporal Convolutions for Complex Action Recognition","date":"2021-03-17","arxiv_id":"2104.01110","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-motion-representation-enhanced","title":"Unsupervised Motion Representation Enhanced Network for Action Recognition","date":"2021-03-05","arxiv_id":"2103.03465","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepfn-towards-generalizable-facial-action","title":"DeepFN: Towards Generalizable Facial Action Unit Recognition with Deep Face Normalization","date":"2021-03-03","arxiv_id":"2103.02484","repositories_listed":0,"syntology":null},{"url":null,"slug":"phase-space-reconstruction-network-for-lane","title":"Phase Space Reconstruction Network for Lane Intrusion Action Recognition","date":"2021-02-22","arxiv_id":"2102.11149","repositories_listed":0,"syntology":null},{"url":"/paper/a-temporal-fusion-approach-for-video","slug":"a-temporal-fusion-approach-for-video","title":"A Temporal Fusion Approach for Video Classification with Convolutional and LSTM Neural Networks Applied to Violence Detection","date":"2021-02-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-learning-via-multi","title":"Self-Supervised Learning via multi-Transformation Classification for Action Recognition","date":"2021-02-20","arxiv_id":"2102.10378","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-recognize-actions-on-objects-in","title":"Learning to Recognize Actions on Objects in Egocentric Video with Attention Dictionaries","date":"2021-02-16","arxiv_id":"2102.08065","repositories_listed":0,"syntology":null},{"url":null,"slug":"adafuse-adaptive-temporal-fusion-network-for-1","title":"AdaFuse: Adaptive Temporal Fusion Network for Efficient Action Recognition","date":"2021-02-10","arxiv_id":"2102.05775","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-action-recognition-using-spatio","title":"Video Action Recognition Using spatio-temporal optical flow video frames","date":"2021-02-05","arxiv_id":"2103.05101","repositories_listed":0,"syntology":null},{"url":null,"slug":"gcf-net-gated-clip-fusion-network-for-video","title":"GCF-Net: Gated Clip Fusion Network for Video Action Recognition","date":"2021-02-02","arxiv_id":"2102.01285","repositories_listed":0,"syntology":null},{"url":null,"slug":"optical-flow-and-scene-flow-estimation-a","title":"Optical flow and scene flow estimation: A survey","date":"2021-02-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-symbolic-temporal-knowledge-into","title":"Embedding Symbolic Temporal Knowledge into Deep Sequential Models","date":"2021-01-28","arxiv_id":"2101.11981","repositories_listed":0,"syntology":null},{"url":null,"slug":"skeletonvis-interactive-visualization-for","title":"SkeletonVis: Interactive Visualization for Understanding Adversarial Attacks on Human Action Recognition Models","date":"2021-01-26","arxiv_id":"2101.10586","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-two-stream-neural-network-for-pose-based","title":"A Two-stream Neural Network for Pose-based Hand Gesture Recognition","date":"2021-01-22","arxiv_id":"2101.08926","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-human-action","title":"Bridging the gap between Human Action Recognition and Online Action Detection","date":"2021-01-21","arxiv_id":"2101.08851","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-recognition-based-on-multi-scale","title":"Human Action Recognition Based on Multi-scale Feature Maps from Depth Video Sequences","date":"2021-01-19","arxiv_id":"2101.07618","repositories_listed":0,"syntology":null},{"url":"/paper/claster-clustering-with-reinforcement","slug":"claster-clustering-with-reinforcement","title":"CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition","date":"2021-01-18","arxiv_id":"2101.07042","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-action-recognition-for-lane-change","title":"Video action recognition for lane-change classification and prediction of surrounding vehicles","date":"2021-01-13","arxiv_id":"2101.05043","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-weakly-labeled-web-videos-via","title":"Learning from Weakly-labeled Web Videos via Exploring Sub-Concepts","date":"2021-01-11","arxiv_id":"2101.03713","repositories_listed":0,"syntology":null},{"url":null,"slug":"trear-transformer-based-rgb-d-egocentric","title":"Trear: Transformer-based RGB-D Egocentric Action Recognition","date":"2021-01-05","arxiv_id":"2101.03904","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-contrastive-graph-for-self","title":"Temporal Contrastive Graph Learning for Video Action Recognition and Retrieval","date":"2021-01-04","arxiv_id":"2101.00820","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-in-vision-a-survey","title":"Transformers in Vision: A Survey","date":"2021-01-04","arxiv_id":"2101.01169","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-sensitive-activity-recognition-a","title":"Uncertainty-sensitive Activity Recognition: a Reliability Benchmark and the CARING Models","date":"2021-01-02","arxiv_id":"2101.00468","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-framework-to-analyze-and-design-the","title":"A Unified Framework to Analyze and Design the Nonlocal Blocks for Neural Networks","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-pixels-exploring-the-effects-of","title":"Beyond the Pixels: Exploring the Effects of Bit-Level Network and File Corruptions on Video Model Robustness","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"contrast-and-order-representations-for-video","title":"Contrast and Order Representations for Video Self-Supervised Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-action-recognition-via-dynamic","title":"Efficient Action Recognition via Dynamic Knowledge Propagation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"else-net-elastic-semantic-network-for","title":"Else-Net: Elastic Semantic Network for Continual Action Recognition From Skeleton Data","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-sub-pseudo-labels-for-learning-from","title":"Exploring Sub-Pseudo Labels for Learning from Weakly-Labeled Web Videos","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geometric-deep-neural-network-using-rigid-and","title":"Geometric Deep Neural Network Using Rigid and Non-Rigid Transformations for Human Action Recognition","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-prototype-learning-for-egocentric","title":"Interactive Prototype Learning for Egocentric Action Recognition","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-representation-from-human","title":"Learning Visual Representation from Human Interactions","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"normalized-human-pose-features-for-human","title":"Normalized Human Pose Features for Human Action Video Alignment","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-3d-skeleton-action","title":"Self-Supervised 3D Skeleton Action Representation Learning With Motion Consistency and Continuity","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-networks-for-action","title":"Temporal Difference Networks for Action Recognition","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-3tconv-an-intrinsic-approach-to","title":"The 3TConv: An Intrinsic Approach to Explainable 3D CNNs","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vi2clr-video-and-image-for-visual-contrastive","title":"Vi2CLR: Video and Image for Visual Contrastive Learning of Representation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-human-motion-anticipation-and","title":"3D Human motion anticipation and classification","date":"2020-12-31","arxiv_id":"2012.15378","repositories_listed":0,"syntology":null},{"url":"/paper/2d-or-not-2d-adaptive-3d-convolution","slug":"2d-or-not-2d-adaptive-3d-convolution","title":"2D or not 2D? Adaptive 3D Convolution Selection for Efficient Video Recognition","date":"2020-12-29","arxiv_id":"2012.14950","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-recognition-with-kernel-based-graph","title":"Action Recognition with Kernel-based Graph Convolutional Networks","date":"2020-12-28","arxiv_id":"2012.14186","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-and-accurate-compressed-video-action","title":"Faster and Accurate Compressed Video Action Recognition Straight from the Frequency Domain","date":"2020-12-26","arxiv_id":"2012.13726","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-recognition-from-various-data","title":"Human Action Recognition from Various Data Modalities: A Review","date":"2020-12-22","arxiv_id":"2012.11866","repositories_listed":0,"syntology":null},{"url":null,"slug":"anchor-based-spatial-temporal-attention","title":"Anchor-Based Spatio-Temporal Attention 3D Convolutional Networks for Dynamic 3D Point Cloud Sequences","date":"2020-12-20","arxiv_id":"2012.10860","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-of-generic-object-detection","title":"Recent Advances of Generic Object Detection with Deep Learning: A Review","date":"2020-12-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/smart-frame-selection-for-action-recognition","slug":"smart-frame-selection-for-action-recognition","title":"SMART Frame Selection for Action Recognition","date":"2020-12-19","arxiv_id":"2012.10671","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothed-gaussian-mixture-models-for-video","title":"Smoothed Gaussian Mixture Models for Video Classification and Recommendation","date":"2020-12-17","arxiv_id":"2012.11673","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-action-localization-and","title":"Weakly-Supervised Action Localization and Action Recognition using Global-Local Attention of 3D CNN","date":"2020-12-17","arxiv_id":"2012.09542","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-graph-modeling-for-skeleton-based","title":"Temporal Graph Modeling for Skeleton-based Action Recognition","date":"2020-12-16","arxiv_id":"2012.08804","repositories_listed":0,"syntology":null},{"url":null,"slug":"gta-global-temporal-attention-for-video","title":"GTA: Global Temporal Attention for Video Action Understanding","date":"2020-12-15","arxiv_id":"2012.08510","repositories_listed":0,"syntology":null},{"url":null,"slug":"nuta-non-uniform-temporal-aggregation-for","title":"NUTA: Non-uniform Temporal Aggregation for Action Recognition","date":"2020-12-15","arxiv_id":"2012.08041","repositories_listed":0,"syntology":null},{"url":null,"slug":"tdaf-top-down-attention-framework-for-vision","title":"TDAF: Top-Down Attention Framework for Vision Tasks","date":"2020-12-14","arxiv_id":"2012.07248","repositories_listed":0,"syntology":null}],"record_sha256":"31b95c9c270b3987931ac28c733a052c93b1e66ce62443895bb04e1150377ee1","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}