{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/using-self-supervised-co-training-to-improve","title":"Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation","arxiv_id":"2105.06421","date":"2021-05-13","proceeding":null,"authors":["Mahdi Pourmirzaei","Gholam Ali Montazer","Farzaneh Esmaili"],"abstract":"In this paper, at first, the impact of ImageNet pre-training on fine-grained Facial Emotion Recognition (FER) is investigated which shows that when enough augmentations on images are applied, training from scratch provides better result than fine-tuning on ImageNet pre-training. Next, we propose a method to improve fine-grained and in-the-wild FER, called Hybrid Multi-Task Learning (HMTL). HMTL uses Self-Supervised Learning (SSL) as an auxiliary task during classical Supervised Learning (SL) in the form of Multi-Task Learning (MTL). Leveraging SSL during training can gain additional information from images for the primary fine-grained SL task. We investigate how proposed HMTL can be used in the FER domain by designing two customized version of common pre-text task techniques, puzzling and in-painting. We achieve state-of-the-art results on the AffectNet benchmark via two types of HMTL, without utilizing pre-training on additional data. Experimental results on the common SSL pre-training and proposed HMTL demonstrate the difference and superiority of our work. However, HMTL is not only limited to FER domain. Experiments on two types of fine-grained facial tasks, i.e., head pose estimation and gender recognition, reveals the potential of using HMTL to improve fine-grained facial representation.","url_abs":"https://arxiv.org/abs/2105.06421v3","url_pdf":"https://arxiv.org/pdf/2105.06421v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"emotion-recognition","task_name":"Emotion Recognition"},{"task_slug":"facial-emotion-recognition","task_name":"Facial Emotion Recognition"},{"task_slug":"facial-expression-recognition","task_name":"Facial Expression Recognition (FER)"},{"task_slug":"head-pose-estimation","task_name":"Head Pose Estimation"},{"task_slug":"multi-task-learning","task_name":"Multi-Task Learning"},{"task_slug":"pose-estimation","task_name":"Pose Estimation"},{"task_slug":"self-supervised-learning","task_name":"Self-Supervised Learning"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"adabelief","method_name":"Adabelief"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"depthwise-convolution","method_name":"Depthwise Convolution"},{"method_slug":"depthwise-separable-convolution","method_name":"Depthwise Separable Convolution"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"efficientnet","method_name":"EfficientNet"},{"method_slug":"inverted-residual-block","method_name":"Inverted Residual Block"},{"method_slug":"jigsaw","method_name":"Jigsaw"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"pointwise-convolution","method_name":"Pointwise Convolution"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"squeeze-and-excitation-block","method_name":"Squeeze-and-Excitation Block"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL + SSL in-panting-pl (B0)","rank_in_archive_order":17,"of":50,"metrics":{"Accuracy (8 emotion)":"61.72"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL + SSL puzzling (B2)","rank_in_archive_order":20,"of":50,"metrics":{"Accuracy (8 emotion)":"61.32"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL + SSL puzzling (B0)","rank_in_archive_order":21,"of":50,"metrics":{"Accuracy (8 emotion)":"61.09"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL (B2)","rank_in_archive_order":24,"of":50,"metrics":{"Accuracy (8 emotion)":"60.35"},"uses_additional_data":true},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL (B0)","rank_in_archive_order":25,"of":50,"metrics":{"Accuracy (8 emotion)":"60.34"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL+ SSL in-painting-pl + 20% train (B0)","rank_in_archive_order":34,"of":50,"metrics":{"Accuracy (8 emotion)":"55.36"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL+ SSL puzzling + 20% train (B0)","rank_in_archive_order":35,"of":50,"metrics":{"Accuracy (8 emotion)":"54.98"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-affectnet","task":"Facial Expression Recognition (FER)","dataset":"AffectNet","model":"SL + 20% train (B0)","rank_in_archive_order":37,"of":50,"metrics":{"Accuracy (8 emotion)":"52.46"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-ck","task":"Facial Expression Recognition (FER)","dataset":"CK+","model":"Nonlinear eval on SL + SSL puzzling (B0)","rank_in_archive_order":6,"of":7,"metrics":{"Accuracy (7 emotion)":"98.23"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2105.06421","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}