{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/arbex-attentive-feature-extraction-with","title":"ARBEx: Attentive Feature Extraction with Reliability Balancing for Robust Facial Expression Learning","arxiv_id":"2305.01486","date":"2023-05-02","proceeding":null,"authors":["Azmine Toushik Wasi","Karlo Šerbetar","Raima Islam","Taki Hasan Rafi","Dong-Kyu Chae"],"abstract":"In this paper, we introduce a framework ARBEx, a novel attentive feature extraction framework driven by Vision Transformer with reliability balancing to cope against poor class distributions, bias, and uncertainty in the facial expression learning (FEL) task. We reinforce several data pre-processing and refinement methods along with a window-based cross-attention ViT to squeeze the best of the data. We also employ learnable anchor points in the embedding space with label distributions and multi-head self-attention mechanism to optimize performance against weak predictions with reliability balancing, which is a strategy that leverages anchor points, attention scores, and confidence values to enhance the resilience of label predictions. To ensure correct label classification and improve the models' discriminative power, we introduce anchor loss, which encourages large margins between anchor points. Additionally, the multi-head self-attention mechanism, which is also trainable, plays an integral role in identifying accurate labels. This approach provides critical elements for improving the reliability of predictions and has a substantial positive effect on final prediction capabilities. Our adaptive model can be integrated with any deep neural network to forestall challenges in various recognition tasks. Our strategy outperforms current state-of-the-art methodologies, according to extensive experiments conducted in a variety of contexts.","url_abs":"https://arxiv.org/abs/2305.01486v5","url_pdf":"https://arxiv.org/pdf/2305.01486v5.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"arbex-attentive-feature-extraction-with","repo_url":"https://github.com/takihasan/arbex","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"facial-emotion-recognition","task_name":"Facial Emotion Recognition"},{"task_slug":"facial-expression-recognition-1","task_name":"Facial Expression Recognition"},{"task_slug":"facial-expression-recognition","task_name":"Facial Expression Recognition (FER)"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"reliability-balancing","method_name":"Reliability Balancing"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"}],"datasets_introduced":[],"methods_introduced":[{"slug":"reliability-balancing","name":"Reliability Balancing","full_name":"Reliability Balancing"}],"results":[{"leaderboard":"/sota/facial-emotion-recognition-on-jaffe","task":"Facial Emotion Recognition","dataset":"JAFFE","model":"ARBEx","rank_in_archive_order":2,"of":2,"metrics":{"Accuracy":"96.67"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-aff-wild2-1","task":"Facial Expression Recognition","dataset":"Aff-Wild2","model":"ARBEx","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"72.48"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-fer-2","task":"Facial Expression Recognition","dataset":"FER+","model":"ARBEx","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"93.09"},"uses_additional_data":false},{"leaderboard":"/sota/facial-expression-recognition-on-raf-db-1","task":"Facial Expression Recognition","dataset":"RAF-DB","model":"ARBEx","rank_in_archive_order":1,"of":1,"metrics":{"Overall Accuracy":"92.47"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}