{"url":"/task/emotion-recognition-in-conversation","name":"Emotion Recognition in Conversation","slug":"emotion-recognition-in-conversation","description_markdown":"Given the transcript of a conversation along with speaker information of each constituent utterance, the ERC task aims to identify the emotion of each utterance from several pre-defined emotions. Formally, given the input sequence of N number of utterances [(u1, p1), (u2, p2), . . . , (uN , pN )], where each utterance ui = [ui,1, ui,2, . . . , ui,T ] consists of T words ui,j and spoken by party pi, the task is to predict the emotion label ei of each utterance ui.\r\n.","categories":[{"name":"Audio","url":"/area/audio"},{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Speech","url":"/area/speech"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":141,"papers_with_code":83,"benchmarks":16,"benchmark_tables_in_archive":16,"benchmark_tables_shown":16,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":14,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/emotion-recognition-in-conversation-on-meld","slug":"emotion-recognition-in-conversation-on-meld","dataset":"MELD","dataset_url":"/dataset/meld","rows_in_archive":68,"metrics":["Weighted-F1","Accuracy","Micro-F1","Balanced Accuracy"],"first_row_in_archive_order":{"model":"ELR-GNN","paper_title":"Efficient Long-distance Latent Relation-aware Graph Neural Network for Multi-modal Emotion Recognition in Conversations","paper_url":"/paper/efficient-long-distance-latent-relation-aware","paper_date":"2024-06-27","arxiv_id":"2407.00119","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on","slug":"emotion-recognition-in-conversation-on","dataset":"IEMOCAP","dataset_url":"/dataset/iemocap","rows_in_archive":59,"metrics":["Weighted-F1","Accuracy","Micro-F1","Macro-F1"],"first_row_in_archive_order":{"model":"SDT","paper_title":"A Transformer-Based Model With Self-Distillation for Multimodal Emotion Recognition in Conversations","paper_url":"/paper/a-transformer-based-model-with-self","paper_date":"2023-10-31","arxiv_id":"2310.20494","code_links":[{"title":"butterfliesss/sdt","url":"https://github.com/butterfliesss/sdt"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-4","slug":"emotion-recognition-in-conversation-on-4","dataset":"EmoryNLP","dataset_url":"/dataset/emorynlp","rows_in_archive":28,"metrics":["Weighted-F1","Micro-F1"],"first_row_in_archive_order":{"model":"CKERC","paper_title":"CKERC : Joint Large Language Models with Commonsense Knowledge for Emotion Recognition in Conversation","paper_url":"/paper/ckerc-joint-large-language-models-with","paper_date":"2024-03-12","arxiv_id":"2403.07260","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-3","slug":"emotion-recognition-in-conversation-on-3","dataset":"DailyDialog","dataset_url":"/dataset/dailydialog","rows_in_archive":22,"metrics":["Micro-F1","Macro F1","Weighted F1"],"first_row_in_archive_order":{"model":"S+PAGE","paper_title":"S+PAGE: A Speaker and Position-Aware Graph Neural Network Model for Emotion Recognition in Conversation","paper_url":"/paper/s-page-a-speaker-and-position-aware-graph","paper_date":"2021-12-23","arxiv_id":"2112.12389","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-cped","slug":"emotion-recognition-in-conversation-on-cped","dataset":"CPED","dataset_url":"/dataset/cped","rows_in_archive":11,"metrics":["Accuracy of Sentiment","Macro-F1 of Sentiment"],"first_row_in_archive_order":{"model":"BERT+AVG+MLP","paper_title":"CPED: A Large-Scale Chinese Personalized and Emotional Dialogue Dataset for Conversational AI","paper_url":"/paper/cped-a-large-scale-chinese-personalized-and-1","paper_date":"2022-05-29","arxiv_id":"2205.14727","code_links":[{"title":"scutcyr/CPED","url":"https://github.com/scutcyr/CPED"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-ec","slug":"emotion-recognition-in-conversation-on-ec","dataset":"EC","dataset_url":"/dataset/emocontext","rows_in_archive":9,"metrics":["Micro-F1"],"first_row_in_archive_order":{"model":"NELEC","paper_title":"NELEC at SemEval-2019 Task 3: Think Twice Before Going Deep","paper_url":"/paper/nelec-at-semeval-2019-task-3-think-twice","paper_date":"2019-04-05","arxiv_id":"1904.03223","code_links":[{"title":"iamgroot42/nelec","url":"https://github.com/iamgroot42/nelec"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-7","slug":"emotion-recognition-in-conversation-on-7","dataset":"IEMOCAP-4","dataset_url":null,"rows_in_archive":8,"metrics":["Weighted F1","Accuracy"],"first_row_in_archive_order":{"model":"GraphSmile","paper_title":"Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition","paper_url":"/paper/2407-21536","paper_date":"2024-07-31","arxiv_id":"2407.21536","code_links":[{"title":"lijfrank-open/GraphSmile","url":"https://github.com/lijfrank-open/GraphSmile"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-cmu-2","slug":"emotion-recognition-in-conversation-on-cmu-2","dataset":"CMU-MOSEI-Sentiment","dataset_url":null,"rows_in_archive":7,"metrics":["Weighted F1","Accuracy"],"first_row_in_archive_order":{"model":"GraphSmile","paper_title":"Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition","paper_url":"/paper/2407-21536","paper_date":"2024-07-31","arxiv_id":"2407.21536","code_links":[{"title":"lijfrank-open/GraphSmile","url":"https://github.com/lijfrank-open/GraphSmile"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-emowoz","slug":"emotion-recognition-in-conversation-on-emowoz","dataset":"EmoWoz","dataset_url":"/dataset/emowoz-1","rows_in_archive":6,"metrics":["Macro F1 (w/o Neutral)","Weighted F1 (w/o Neutral)","Macro F1","Weighted F1"],"first_row_in_archive_order":{"model":"COSMIC","paper_title":"EmoWOZ: A Large-Scale Corpus and Labelling Scheme for Emotion Recognition in Task-Oriented Dialogue Systems","paper_url":"/paper/emowoz-a-large-scale-corpus-and-labelling","paper_date":"2021-09-10","arxiv_id":"2109.04919","code_links":[{"title":"dsml/emowoz-public","url":"https://gitlab.cs.uni-duesseldorf.de/general/dsml/emowoz-public"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-2","slug":"emotion-recognition-in-conversation-on-2","dataset":"SEMAINE","dataset_url":"/dataset/semaine","rows_in_archive":3,"metrics":["MAE (Valence)","MAE (Arousal)","MAE (Expectancy)","MAE (Power)"],"first_row_in_archive_order":{"model":"DialogueGCN","paper_title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","paper_url":"/paper/dialoguegcn-a-graph-convolutional-neural","paper_date":"2019-08-30","arxiv_id":"1908.11540","code_links":[{"title":"SenticNet/conv-emotion","url":"https://github.com/SenticNet/conv-emotion"},{"title":"KomorebiLHX/Emotion-Recognition-in-Conversations","url":"https://github.com/KomorebiLHX/Emotion-Recognition-in-Conversations"}],"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-5","slug":"emotion-recognition-in-conversation-on-5","dataset":"EmotionPush","dataset_url":"/dataset/emotionlines","rows_in_archive":1,"metrics":["Unweighted Accuracy","Weighted Accuracy"],"first_row_in_archive_order":{"model":"HiTransformer-s","paper_title":"Hierarchical Transformer Network for Utterance-level Emotion Recognition","paper_url":"/paper/hierarchical-transformer-network-for","paper_date":"2020-02-18","arxiv_id":"2002.07551","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-cmu","slug":"emotion-recognition-in-conversation-on-cmu","dataset":"CMU-MOSI","dataset_url":"/dataset/cmu-mosi","rows_in_archive":1,"metrics":["F1 score"],"first_row_in_archive_order":{"model":"Audio + Text (Stage III)","paper_title":"HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition","paper_url":"/paper/hcam-hierarchical-cross-attention-model-for","paper_date":"2023-04-14","arxiv_id":"2304.06910","code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-cmu-3","slug":"emotion-recognition-in-conversation-on-cmu-3","dataset":"CMU-MOSEI-Sentiment-3","dataset_url":null,"rows_in_archive":1,"metrics":["Weighted F1","Accuracy"],"first_row_in_archive_order":{"model":"GraphSmile","paper_title":"Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition","paper_url":"/paper/2407-21536","paper_date":"2024-07-31","arxiv_id":"2407.21536","code_links":[{"title":"lijfrank-open/GraphSmile","url":"https://github.com/lijfrank-open/GraphSmile"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-emowoz-1","slug":"emotion-recognition-in-conversation-on-emowoz-1","dataset":"EmoWOZ","dataset_url":"/dataset/emowoz-1","rows_in_archive":1,"metrics":["Macro F1"],"first_row_in_archive_order":{"model":"CD-ERC","paper_title":"Context-Dependent Embedding Utterance Representations for Emotion Recognition in Conversations","paper_url":"/paper/context-dependent-embedding-utterance","paper_date":"2023-04-17","arxiv_id":"2304.08216","code_links":[{"title":"patricia-pereira/cd-erc","url":"https://github.com/patricia-pereira/cd-erc"}],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-kd","slug":"emotion-recognition-in-conversation-on-kd","dataset":"KD-EmoR","dataset_url":"/dataset/kd-emor","rows_in_archive":1,"metrics":["F1 (micro)"],"first_row_in_archive_order":{"model":"XAF-SS","paper_title":"Korean Drama Scene Transcript Dataset for Emotion Recognition in Conversations","paper_url":"/paper/korean-drama-scene-transcript-dataset-for","paper_date":"2022-11-11","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/emotion-recognition-in-conversation-on-meld-1","slug":"emotion-recognition-in-conversation-on-meld-1","dataset":"MELD-Sentiment","dataset_url":null,"rows_in_archive":1,"metrics":["Weighted F1","Accuracy"],"first_row_in_archive_order":{"model":"GraphSmile","paper_title":"Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition","paper_url":"/paper/2407-21536","paper_date":"2024-07-31","arxiv_id":"2407.21536","code_links":[{"title":"lijfrank-open/GraphSmile","url":"https://github.com/lijfrank-open/GraphSmile"}],"syntology":null}}],"datasets":[{"url":"/dataset/iemocap","name":"IEMOCAP","full_name":"The Interactive Emotional Dyadic Motion Capture (IEMOCAP) Database","num_papers_in_archive":749},{"url":"/dataset/dailydialog","name":"DailyDialog","full_name":"","num_papers_in_archive":399},{"url":"/dataset/meld","name":"MELD","full_name":"Multimodal EmotionLines Dataset","num_papers_in_archive":289},{"url":"/dataset/emorynlp","name":"EmoryNLP","full_name":"","num_papers_in_archive":58},{"url":"/dataset/semaine","name":"SEMAINE","full_name":"","num_papers_in_archive":54},{"url":"/dataset/emotionlines","name":"EmotionLines","full_name":"EmotionLines","num_papers_in_archive":44},{"url":"/dataset/emocontext","name":"EmoContext","full_name":"","num_papers_in_archive":42},{"url":"/dataset/cmu-mosi","name":"CMU-MOSI","full_name":"Multimodal Corpus of Sentiment Intensity","num_papers_in_archive":16},{"url":"/dataset/cped","name":"CPED","full_name":"Chinese Personalized and Emotional Dialogue","num_papers_in_archive":15},{"url":"/dataset/emowoz-1","name":"EmoWOZ","full_name":"","num_papers_in_archive":10},{"url":"/dataset/emotional-dialogue-acts","name":"Emotional Dialogue Acts","full_name":"","num_papers_in_archive":3},{"url":"/dataset/masac-erc","name":"MaSaC_ERC","full_name":"","num_papers_in_archive":2},{"url":"/dataset/candor-corpus-1","name":"CANDOR Corpus","full_name":"CANDOR = Conversation: A Naturalistic Dataset of Online Recordings","num_papers_in_archive":1},{"url":"/dataset/kd-emor","name":"KD-EmoR","full_name":"Korean Drama Scene Transcript Dataset for Emotion Recognition in Conversations","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/emotion-recognition","name":"Emotion Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":83,"tagged_in_all":141,"items":[{"url":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","arxiv_id":"1810.04805","repositories_listed":534,"syntology":{"n":659,"n_ran":204,"n_unverified":455,"n_pointer_only":149}},{"url":"/paper/convolutional-neural-networks-for-sentence","title":"Convolutional Neural Networks for Sentence Classification","date":"2014-08-25","arxiv_id":"1408.5882","repositories_listed":118,"syntology":{"n":77,"n_ran":19,"n_unverified":58,"n_pointer_only":15}},{"url":"/paper/gans-trained-by-a-two-time-scale-update-rule","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","date":"2017-06-26","arxiv_id":"1706.08500","repositories_listed":71,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/bag-of-tricks-for-efficient-text","title":"Bag of Tricks for Efficient Text Classification","date":"2016-07-06","arxiv_id":"1607.01759","repositories_listed":65,"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}},{"url":"/paper/meld-a-multimodal-multi-party-dataset-for","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","date":"2018-10-05","arxiv_id":"1810.02508","repositories_listed":8,"syntology":null},{"url":"/paper/dialogxl-all-in-one-xlnet-for-multi-party","title":"DialogXL: All-in-One XLNet for Multi-Party Conversation Emotion Recognition","date":"2020-12-16","arxiv_id":"2012.08695","repositories_listed":4,"syntology":null},{"url":"/paper/structure-aware-transformer-for-graph","title":"Structure-Aware Transformer for Graph Representation Learning","date":"2022-02-07","arxiv_id":"2202.03036","repositories_listed":3,"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/qwen-audio-advancing-universal-audio","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","date":"2023-11-14","arxiv_id":"2311.07919","repositories_listed":2,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}},{"url":"/paper/unisa-unified-generative-framework-for-1","title":"UniSA: Unified Generative Framework for Sentiment Analysis","date":"2023-09-04","arxiv_id":"2309.01339","repositories_listed":2,"syntology":{"n":8,"n_ran":6,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/cogmen-contextualized-gnn-based-multimodal","title":"COGMEN: COntextualized GNN based Multimodal Emotion recognitioN","date":"2022-05-05","arxiv_id":"2205.02455","repositories_listed":2,"syntology":null},{"url":"/paper/federated-distillation-of-natural-language","title":"KNOT: Knowledge Distillation using Optimal Transport for Solving NLP Tasks","date":"2021-10-06","arxiv_id":"2110.02432","repositories_listed":2,"syntology":null},{"url":"/paper/dialoguecrn-contextual-reasoning-networks-for","title":"DialogueCRN: Contextual Reasoning Networks for Emotion Recognition in Conversations","date":"2021-06-03","arxiv_id":"2106.01978","repositories_listed":2,"syntology":null},{"url":"/paper/dialoguegcn-a-graph-convolutional-neural","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","date":"2019-08-30","arxiv_id":"1908.11540","repositories_listed":2,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/dialoguernn-an-attentive-rnn-for-emotion","title":"DialogueRNN: An Attentive RNN for Emotion Detection in Conversations","date":"2018-11-01","arxiv_id":"1811.00405","repositories_listed":2,"syntology":null},{"url":"/paper/context-dependent-sentiment-analysis-in-user","title":"Context-Dependent Sentiment Analysis in User-Generated Videos","date":"2017-07-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/long-short-distance-graph-neural-networks-and","title":"Long-Short Distance Graph Neural Networks and Improved Curriculum Learning for Emotion Recognition in Conversation","date":"2025-07-21","arxiv_id":"2507.15205","repositories_listed":1,"syntology":null},{"url":"/paper/dynamic-parameter-memory-temporary-lora","title":"Dynamic Parameter Memory: Temporary LoRA-Enhanced LLM for Long-Sequence Emotion Recognition in Conversation","date":"2025-07-11","arxiv_id":"2507.09076","repositories_listed":1,"syntology":null},{"url":"/paper/recent-trends-of-multimodal-affective","title":"Recent Trends of Multimodal Affective Computing: A Survey from NLP Perspective","date":"2024-09-11","arxiv_id":"2409.07388","repositories_listed":1,"syntology":null},{"url":"/paper/2407-21315","title":"Beyond Silent Letters: Amplifying LLMs in Emotion Recognition with Vocal Nuances","date":"2024-07-31","arxiv_id":"2407.21315","repositories_listed":1,"syntology":null},{"url":"/paper/2407-21536","title":"Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition","date":"2024-07-31","arxiv_id":"2407.21536","repositories_listed":1,"syntology":null},{"url":"/paper/bioserc-integrating-biography-speakers","title":"BiosERC: Integrating Biography Speakers Supported by LLMs for ERC Tasks","date":"2024-07-05","arxiv_id":"2407.04279","repositories_listed":1,"syntology":null},{"url":"/paper/feedforward-at-semeval-2024-task-10-trigger","title":"FeedForward at SemEval-2024 Task 10: Trigger and sentext-height enriched emotion analysis in multi-party conversations","date":"2024-06-20","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/multi-task-multi-modal-self-supervised","title":"Multi-Task Multi-Modal Self-Supervised Learning for Facial Expression Recognition","date":"2024-04-16","arxiv_id":"2404.10904","repositories_listed":1,"syntology":null},{"url":"/paper/emotion-anchored-contrastive-learning","title":"Emotion-Anchored Contrastive Learning Framework for Emotion Recognition in Conversation","date":"2024-03-29","arxiv_id":"2403.20289","repositories_listed":1,"syntology":null},{"url":"/paper/curriculum-learning-meets-directed-acyclic","title":"Curriculum Learning Meets Directed Acyclic Graph for Multimodal Emotion Recognition","date":"2024-02-27","arxiv_id":"2402.17269","repositories_listed":1,"syntology":null},{"url":"/paper/telme-teacher-leading-multimodal-fusion","title":"TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation","date":"2024-01-16","arxiv_id":"2401.12987","repositories_listed":1,"syntology":null},{"url":"/paper/joyful-joint-modality-fusion-and-graph","title":"Joyful: Joint Modality Fusion and Graph Contrastive Learning for Multimodal Emotion Recognition","date":"2023-11-18","arxiv_id":"2311.11009","repositories_listed":1,"syntology":null},{"url":"/paper/accumulating-word-representations-in-multi","title":"Accumulating Word Representations in Multi-level Context Integration for ERC Task","date":"2023-11-06","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/a-transformer-based-model-with-self","title":"A Transformer-Based Model With Self-Distillation for Multimodal Emotion Recognition in Conversations","date":"2023-10-31","arxiv_id":"2310.20494","repositories_listed":1,"syntology":null},{"url":"/paper/from-multilingual-complexity-to-emotional","title":"From Multilingual Complexity to Emotional Clarity: Leveraging Commonsense to Unveil Emotions in Code-Mixed Dialogues","date":"2023-10-19","arxiv_id":"2310.13080","repositories_listed":1,"syntology":null}],"syntology_records":8,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}