{"url":"/task/emotion-recognition","name":"Emotion Recognition","slug":"emotion-recognition","description_markdown":"**Emotion Recognition** is an important area of research to enable effective human-computer interaction. Human emotions can be detected using speech signal, facial expressions, body language, and electroencephalography (EEG). <span class=\"description-source\">Source: [Using Deep Autoencoders for Facial Expression Recognition ](https://arxiv.org/abs/1801.08329)</span>","categories":[{"name":"Audio","url":"/area/audio"},{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Speech","url":"/area/speech"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2041,"papers_with_code":614,"benchmarks":9,"benchmark_tables_in_archive":10,"benchmark_tables_shown":10,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":52,"subtasks":12,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/emotion-recognition-on-emomusic","slug":"emotion-recognition-on-emomusic","dataset":"Emomusic","dataset_url":"/dataset/emomusic","rows_in_archive":5,"metrics":["EmoA","EmoV"],"first_row_in_archive_order":{"model":"M2D-CLAP","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_url":"/paper/m2d2-exploring-general-purpose-audio-language","paper_date":"2025-03-28","arxiv_id":"2503.22104","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-ravdess","slug":"emotion-recognition-on-ravdess","dataset":"RAVDESS","dataset_url":"/dataset/ravdess","rows_in_archive":5,"metrics":["Accuracy","WAR"],"first_row_in_archive_order":{"model":"LogisticRegression on posteriors of xlsr-Wav2Vec2.0&bi-LSTM+Attention","paper_title":"A proposal for Multimodal Emotion Recognition using aural transformers and Action Units on RAVDESS dataset","paper_url":"/paper/a-proposal-for-multimodal-emotion-recognition","paper_date":"2021-12-30","arxiv_id":null,"code_links":[{"title":"cristinalunaj/MMEmotionRecognition","url":"https://github.com/cristinalunaj/MMEmotionRecognition"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-emotic","slug":"emotion-recognition-on-emotic","dataset":"EMOTIC","dataset_url":"/dataset/emotic","rows_in_archive":2,"metrics":["Top-3 Accuracy (%)"],"first_row_in_archive_order":{"model":"CAGE","paper_title":"CAGE: Circumplex Affect Guided Expression Inference","paper_url":"/paper/cage-circumplex-affect-guided-expression","paper_date":"2024-04-23","arxiv_id":"2404.14975","code_links":[{"title":"wagner-niklas/cage_expression_inference","url":"https://github.com/wagner-niklas/cage_expression_inference"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-fer2013-1","slug":"emotion-recognition-on-fer2013-1","dataset":"FER2013","dataset_url":"/dataset/fer2013","rows_in_archive":1,"metrics":["5-class test accuracy"],"first_row_in_archive_order":{"model":"VGG based","paper_title":"IdentiFace : A VGG Based Multimodal Facial Biometric System","paper_url":"/paper/identiface-a-vgg-based-multimodal-facial","paper_date":"2024-01-02","arxiv_id":"2401.01227","code_links":[{"title":"MahmoudRabea13/IdentiFace","url":"https://github.com/MahmoudRabea13/IdentiFace"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-khlipkhunph","slug":"emotion-recognition-on-khlipkhunph","dataset":"คลิปคุณพ่อให้ลูกสาวยืมโทรศัพท์และความสนุกสนาน","dataset_url":null,"rows_in_archive":1,"metrics":["1'\""],"first_row_in_archive_order":{"model":"CNN","paper_title":"A Spontaneous Driver Emotion Facial Expression (DEFE) Dataset for Intelligent Vehicles","paper_url":"/paper/a-spontaneous-driver-emotion-facial","paper_date":"2020-04-26","arxiv_id":"2005.08626","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-masac-erc","slug":"emotion-recognition-on-masac-erc","dataset":"MaSaC_ERC","dataset_url":"/dataset/masac-erc","rows_in_archive":1,"metrics":["F1-score (Weighted)"],"first_row_in_archive_order":{"model":"MaSaC-ERC-Z","paper_title":"FeedForward at SemEval-2024 Task 10: Trigger and sentext-height enriched emotion analysis in multi-party conversations","paper_url":"/paper/feedforward-at-semeval-2024-task-10-trigger","paper_date":"2024-06-20","arxiv_id":null,"code_links":[{"title":"Zuhashaik/Multi-Party-DialoZ","url":"https://github.com/Zuhashaik/Multi-Party-DialoZ"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-mped","slug":"emotion-recognition-on-mped","dataset":"MPED","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BiHDM","paper_title":"A Novel Bi-hemispheric Discrepancy Model for EEG Emotion Recognition","paper_url":"/paper/a-novel-bi-hemispheric-discrepancy-model-for-1","paper_date":"2019-05-11","arxiv_id":"1906.01704","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-msp-podcast","slug":"emotion-recognition-on-msp-podcast","dataset":"MSP-Podcast","dataset_url":"/dataset/msp-podcast","rows_in_archive":1,"metrics":["Concordance correlation coefficient (CCC)"],"first_row_in_archive_order":{"model":"w2v2-L-robust-12","paper_title":"Dawn of the transformer era in speech emotion recognition: closing the valence gap","paper_url":"/paper/dawn-of-the-transformer-era-in-speech-emotion","paper_date":"2022-03-14","arxiv_id":"2203.07378","code_links":[{"title":"audeering/w2v2-how-to","url":"https://github.com/audeering/w2v2-how-to"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-on-seed","slug":"emotion-recognition-on-seed","dataset":"SEED","dataset_url":"/dataset/seed-1","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"4D-aNN","paper_title":"4D Attention-based Neural Network for EEG Emotion Recognition","paper_url":"/paper/4d-attention-based-neural-network-for-eeg","paper_date":"2021-01-14","arxiv_id":"2101.05484","code_links":[],"syntology":null}},{"leaderboard":null,"slug":"emotion-recognition-on-mafw","dataset":"MAFW","dataset_url":"/dataset/mafw","rows_in_archive":0,"metrics":["Unweighted average recall"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/hateful-memes","name":"Hateful Memes","full_name":"Hateful Memes","num_papers_in_archive":177},{"url":"/dataset/fer2013","name":"FER2013","full_name":"Facial Expression Recognition 2013 Dataset","num_papers_in_archive":168},{"url":"/dataset/aff-wild2","name":"Aff-Wild2","full_name":"","num_papers_in_archive":142},{"url":"/dataset/aff-wild","name":"Aff-Wild","full_name":"","num_papers_in_archive":125},{"url":"/dataset/emotion","name":"CARER","full_name":"Contextualized Affect Representations for Emotion Recognition","num_papers_in_archive":123},{"url":"/dataset/seed-1","name":"SEED","full_name":"SJTU Emotion EEG Dataset","num_papers_in_archive":119},{"url":"/dataset/msp-improv","name":"MSP-IMPROV","full_name":"MSP-IMPROV: An Acted Corpus of Dyadic Interactions to Study Emotion Perception","num_papers_in_archive":70},{"url":"/dataset/isear","name":"ISEAR","full_name":"International Survey on Emotion Antecedents and Reactions","num_papers_in_archive":55},{"url":"/dataset/hateful-memes-challenge","name":"Hateful Memes Challenge","full_name":"","num_papers_in_archive":48},{"url":"/dataset/emotionlines","name":"EmotionLines","full_name":"EmotionLines","num_papers_in_archive":44},{"url":"/dataset/expw","name":"ExpW","full_name":"Expression in-the-Wild","num_papers_in_archive":41},{"url":"/dataset/emotic","name":"EMOTIC","full_name":"EMOTIons in Context","num_papers_in_archive":38},{"url":"/dataset/emobank","name":"EmoBank","full_name":"","num_papers_in_archive":32},{"url":"/dataset/mafw","name":"MAFW","full_name":"","num_papers_in_archive":31},{"url":"/dataset/ravdess","name":"RAVDESS","full_name":"Ryerson Audio-Visual Database of Emotional Speech and Song","num_papers_in_archive":27},{"url":"/dataset/emopia","name":"EMOPIA","full_name":"A Multi-Modal Pop Piano Dataset For Emotion Recognition and Emotion-based Music Generation","num_papers_in_archive":23},{"url":"/dataset/cped","name":"CPED","full_name":"Chinese Personalized and Emotional Dialogue","num_papers_in_archive":15},{"url":"/dataset/deap","name":"DEAP","full_name":"","num_papers_in_archive":11},{"url":"/dataset/video2gif","name":"Video2GIF","full_name":"","num_papers_in_archive":11},{"url":"/dataset/emowoz-1","name":"EmoWOZ","full_name":"","num_papers_in_archive":10},{"url":"/dataset/mustard-1","name":"MUStARD++","full_name":"","num_papers_in_archive":10},{"url":"/dataset/k-emocon","name":"K-EmoCon","full_name":"","num_papers_in_archive":9},{"url":"/dataset/msp-podcast","name":"MSP-Podcast","full_name":"A large naturalistic speech emotional dataset","num_papers_in_archive":9},{"url":"/dataset/send","name":"SEND","full_name":"Stanford Emotional Narratives Dataset","num_papers_in_archive":8},{"url":"/dataset/armanemo","name":"ArmanEmo","full_name":"","num_papers_in_archive":6},{"url":"/dataset/ulm-tsst","name":"Ulm-TSST","full_name":"Ulm-Trier Social Stress Dataset","num_papers_in_archive":6},{"url":"/dataset/emotional-dialogue-acts","name":"Emotional Dialogue Acts","full_name":"","num_papers_in_archive":3},{"url":"/dataset/findingemo","name":"FindingEmo","full_name":"","num_papers_in_archive":3},{"url":"/dataset/hume-vb","name":"HUME-VB","full_name":"The Hume Vocal Bursts Dataset","num_papers_in_archive":3},{"url":"/dataset/memeify","name":"Memeify","full_name":"","num_papers_in_archive":3},{"url":"/dataset/sewa-db","name":"SEWA DB","full_name":"","num_papers_in_archive":3},{"url":"/dataset/dusha","name":"Dusha","full_name":"Dusha Crowd, Dusha Podcast","num_papers_in_archive":2},{"url":"/dataset/emomusic","name":"Emomusic","full_name":"Emotion in Music Database","num_papers_in_archive":2},{"url":"/dataset/emopars","name":"EmoPars","full_name":"","num_papers_in_archive":2},{"url":"/dataset/masac-erc","name":"MaSaC_ERC","full_name":"","num_papers_in_archive":2},{"url":"/dataset/nemo-1","name":"nEMO","full_name":"","num_papers_in_archive":2},{"url":"/dataset/sentimental-liar","name":"Sentimental LIAR","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/banglaemotion","name":"BanglaEmotion","full_name":"BanglaEmotion: A Benchmark Dataset for Bangla Textual Emotion Analysis","num_papers_in_archive":1},{"url":"/dataset/berst","name":"BERSt","full_name":"Basic Emotion Random phrase Shouts","num_papers_in_archive":1},{"url":"/dataset/emofilm","name":"EmoFilm","full_name":"Emotional speech from Films","num_papers_in_archive":1},{"url":"/dataset/event-focused-emotion-corpora-for-german-and","name":"Event-focused Emotion Corpora for German and English","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mfa","name":"MFA","full_name":"Many Faces of Anger","num_papers_in_archive":1},{"url":"/dataset/modified-shemo","name":"modified_shemo","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ren-20k-dataset","name":"REN-20k Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vesus","name":"VESUS","full_name":"Varied Emotion in Syntactically Uniform Speech","num_papers_in_archive":1},{"url":"/dataset/vnemos","name":"VNEMOS","full_name":"Vietnamese Speech Emotion Dataset","num_papers_in_archive":1},{"url":"/dataset/werewolf-xl","name":"Werewolf-XL","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ym2413-mdb","name":"YM2413-MDB","full_name":"","num_papers_in_archive":1},{"url":"/dataset/affective-text","name":"Affective Text","full_name":"","num_papers_in_archive":0},{"url":"/dataset/human-faces-with-mixed-race-various-emotions","name":"Human faces with mixed-race & various emotions","full_name":"","num_papers_in_archive":0},{"url":"/dataset/l-svd","name":"L-SVD","full_name":"Large-Scale Selfie Video Dataset (L-SVD): A Benchmark for Emotion Recognition","num_papers_in_archive":0},{"url":"/dataset/storytelling-video-dataset","name":"Video Dataset","full_name":"Storytelling Video Dataset (Russian, Emotion, Gesture, Speech)","num_papers_in_archive":0}],"subtasks":[{"url":"/task/a-vb-culture","name":"A-VB Culture"},{"url":"/task/a-vb-high","name":"A-VB High"},{"url":"/task/a-vb-two","name":"A-VB Two"},{"url":"/task/eeg-emotion-recognition","name":"EEG Emotion Recognition"},{"url":"/task/emotion-cause-extraction","name":"Emotion Cause Extraction"},{"url":"/task/emotion-cause-pair-extraction","name":"Emotion-Cause Pair Extraction"},{"url":"/task/emotion-recognition-in-context","name":"Emotion Recognition in Context"},{"url":"/task/emotion-recognition-in-conversation","name":"Emotion Recognition in Conversation"},{"url":"/task/facial-emotion-recognition","name":"Facial Emotion Recognition"},{"url":"/task/multimodal-emotion-recognition","name":"Multimodal Emotion Recognition"},{"url":"/task/speech-emotion-recognition","name":"Speech Emotion Recognition"},{"url":"/task/video-emotion-recognition","name":"Video Emotion Recognition"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":614,"tagged_in_all":2041,"items":[{"url":"/paper/meld-a-multimodal-multi-party-dataset-for","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","date":"2018-10-05","arxiv_id":"1810.02508","repositories_listed":8,"syntology":null},{"url":"/paper/eeg-based-emotion-recognition-using","title":"EEG-Based Emotion Recognition Using Regularized Graph Neural Networks","date":"2019-07-18","arxiv_id":"1907.07835","repositories_listed":5,"syntology":null},{"url":"/paper/multimodal-speech-emotion-recognition-and","title":"Multimodal Speech Emotion Recognition and Ambiguity Resolution","date":"2019-04-12","arxiv_id":"1904.06022","repositories_listed":5,"syntology":null},{"url":"/paper/words-can-shift-dynamically-adjusting-word","title":"Words Can Shift: Dynamically Adjusting Word Representations Using Nonverbal Behaviors","date":"2018-11-23","arxiv_id":"1811.09362","repositories_listed":5,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/dialogxl-all-in-one-xlnet-for-multi-party","title":"DialogXL: All-in-One XLNet for Multi-Party Conversation Emotion Recognition","date":"2020-12-16","arxiv_id":"2012.08695","repositories_listed":4,"syntology":null},{"url":"/paper/emotion-cause-pair-extraction-a-new-task-to","title":"Emotion-Cause Pair Extraction: A New Task to Emotion Analysis in Texts","date":"2019-06-04","arxiv_id":"1906.01267","repositories_listed":4,"syntology":null},{"url":"/paper/multimodal-speech-emotion-recognition-using","title":"Multimodal Speech Emotion Recognition Using Audio and Text","date":"2018-10-10","arxiv_id":"1810.04635","repositories_listed":4,"syntology":null},{"url":"/paper/funaudiollm-voice-understanding-and","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","date":"2024-07-04","arxiv_id":"2407.04051","repositories_listed":3,"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/speech-emotion-diarization-which-emotion","title":"Speech Emotion Diarization: Which Emotion Appears When?","date":"2023-06-22","arxiv_id":"2306.12991","repositories_listed":3,"syntology":null},{"url":"/paper/mer-2023-multi-label-learning-modality","title":"MER 2023: Multi-label Learning, Modality Robustness, and Semi-Supervised Learning","date":"2023-04-18","arxiv_id":"2304.08981","repositories_listed":3,"syntology":null},{"url":"/paper/ssast-self-supervised-audio-spectrogram","title":"SSAST: Self-Supervised Audio Spectrogram Transformer","date":"2021-10-19","arxiv_id":"2110.09784","repositories_listed":3,"syntology":{"n":16,"n_ran":11,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/ethics-sheet-for-automatic-emotion","title":"Ethics Sheet for Automatic Emotion Recognition and Sentiment Analysis","date":"2021-09-17","arxiv_id":"2109.08256","repositories_listed":3,"syntology":null},{"url":"/paper/ethics-sheets-for-ai-tasks","title":"Ethics Sheets for AI Tasks","date":"2021-07-02","arxiv_id":"2107.01183","repositories_listed":3,"syntology":null},{"url":"/paper/compact-graph-architecture-for-speech-emotion","title":"Compact Graph Architecture for Speech Emotion Recognition","date":"2020-08-05","arxiv_id":"2008.02063","repositories_listed":3,"syntology":null},{"url":"/paper/context-based-emotion-recognition-using","title":"Context Based Emotion Recognition using EMOTIC Dataset","date":"2020-03-30","arxiv_id":"2003.13401","repositories_listed":3,"syntology":null},{"url":"/paper/fau-facial-expressions-valence-and-arousal-a","title":"Multitask Emotion Recognition with Incomplete Labels","date":"2020-02-10","arxiv_id":"2002.03557","repositories_listed":3,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/audio-text-sentiment-analysis-using-deep","title":"Complementary Fusion of Multi-Features and Multi-Modalities in Sentiment Analysis","date":"2019-04-17","arxiv_id":"1904.08138","repositories_listed":3,"syntology":null},{"url":"/paper/efficient-low-rank-multimodal-fusion-with","title":"Efficient Low-rank Multimodal Fusion with Modality-Specific Factors","date":"2018-05-31","arxiv_id":"1806.00064","repositories_listed":3,"syntology":null},{"url":"/paper/dexpression-deep-convolutional-neural-network","title":"DeXpression: Deep Convolutional Neural Network for Expression Recognition","date":"2015-09-17","arxiv_id":"1509.05371","repositories_listed":3,"syntology":null},{"url":"/paper/training-deep-neural-networks-on-noisy-labels","title":"Training Deep Neural Networks on Noisy Labels with Bootstrapping","date":"2014-12-20","arxiv_id":"1412.6596","repositories_listed":3,"syntology":null},{"url":"/paper/exploring-remote-physiological-signal","title":"Exploring Remote Physiological Signal Measurement under Dynamic Lighting Conditions at Night: Dataset, Experiment, and Analysis","date":"2025-07-06","arxiv_id":"2507.04306","repositories_listed":2,"syntology":null},{"url":"/paper/cosyvoice-3-towards-in-the-wild-speech","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","date":"2025-05-23","arxiv_id":"2505.17589","repositories_listed":2,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/why-we-feel-breaking-boundaries-in-emotional","title":"Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models","date":"2025-04-10","arxiv_id":"2504.07521","repositories_listed":2,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/m2d2-exploring-general-purpose-audio-language","title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","date":"2025-03-28","arxiv_id":"2503.22104","repositories_listed":2,"syntology":null},{"url":"/paper/sample-correlation-for-fingerprinting-deep","title":"Sample Correlation for Fingerprinting Deep Face Recognition","date":"2024-12-30","arxiv_id":"2412.20768","repositories_listed":2,"syntology":null},{"url":"/paper/prototypical-calibrating-ambiguous-samples","title":"Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition","date":"2024-12-19","arxiv_id":"2412.14719","repositories_listed":2,"syntology":null},{"url":"/paper/m2se-a-multistage-multitask-instruction","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","date":"2024-12-11","arxiv_id":"2412.08049","repositories_listed":2,"syntology":null},{"url":"/paper/libeer-a-comprehensive-benchmark-and","title":"LibEER: A Comprehensive Benchmark and Algorithm Library for EEG-based Emotion Recognition","date":"2024-10-13","arxiv_id":"2410.09767","repositories_listed":2,"syntology":null},{"url":"/paper/rethinking-emotion-bias-in-music-via-frechet","title":"Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance","date":"2024-09-23","arxiv_id":"2409.15545","repositories_listed":2,"syntology":null},{"url":"/paper/text-and-feature-based-models-for-compound","title":"Textualized and Feature-based Models for Compound Multimodal Emotion Recognition in the Wild","date":"2024-07-17","arxiv_id":"2407.12927","repositories_listed":2,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}}],"syntology_records":7,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}