{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/swin-mstp-swin-transformer-with-multi-scale","title":"Swin-MSTP: Swin transformer with multi-scale temporal perception for continuous sign language recognition","arxiv_id":null,"date":"2025-02-07","proceeding":"Neurocomputing 2025 2","authors":["Sarah Alyami","Hamzah Luqman"],"abstract":"Continuous sign language recognition (CSLR) aims to recognize and interpret sequences of sign language gestures in videos. Currently, most CSLR frameworks combine spatial feature extractors based on convolutional neural networks (CNNs) with temporal convolutional networks (TCNs) for sequence learning. However, CNN-based spatial feature extractors apply the same convolutional kernel uniformly across all regions of an image, which limits their capacity to extract complex details such as fingers and facial features, which are essential for CSLR. In addition, sign languages include signs of varying lengths that cannot be accurately modeled using a fixed-size TCN. To address these issues, we present the Swin multiscale temporal perception (Swin-MSTP) framework, in which the Swin Transformer is utilized as the spatial feature extractor, capable of capturing fine spatial details and providing a stronger contextual understanding between sign language elements in video frames. The Swin Transformer was integrated with the MSTP module to extract time-wise features. Experimental results show that our single-modality system outperformed existing methods on the CSL dataset, including multimodal frameworks. The model also achieved competitive performance on the Phoenix2014, Phoenix2014-T, and CSL-Daily datasets. The code is available at https://github.com/snalyami/Swin-MSTP","url_abs":"https://www.sciencedirect.com/science/article/abs/pii/S0925231224017867","url_pdf":"https://www.sciencedirect.com/science/article/abs/pii/S0925231224017867","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"swin-mstp-swin-transformer-with-multi-scale","repo_url":"https://github.com/snalyami/Swin-MSTP","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"sign-language-recognition","task_name":"Sign Language Recognition"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"csl","method_name":"CSL"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"stochastic-depth","method_name":"Stochastic Depth"},{"method_slug":"swin-transformer","method_name":"Swin Transformer"},{"method_slug":"transformer","method_name":"Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/sign-language-recognition-on-csl-daily","task":"Sign Language Recognition","dataset":"CSL-Daily","model":"Swin-MSTP","rank_in_archive_order":5,"of":14,"metrics":{"Word Error Rate (WER)":"27.1"},"uses_additional_data":false},{"leaderboard":"/sota/sign-language-recognition-on-rwth-phoenix","task":"Sign Language Recognition","dataset":"RWTH-PHOENIX-Weather 2014","model":"Swin-MSTP","rank_in_archive_order":3,"of":22,"metrics":{"Word Error Rate (WER)":"18.7"},"uses_additional_data":false},{"leaderboard":"/sota/sign-language-recognition-on-rwth-phoenix-1","task":"Sign Language Recognition","dataset":"RWTH-PHOENIX-Weather 2014 T","model":"Swin-MSTP","rank_in_archive_order":5,"of":15,"metrics":{"Word Error Rate (WER)":"19.7"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}