{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-emotion-recognition/papers/3","list_of":"/task/speech-emotion-recognition","task":"Speech Emotion Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":5,"rows_per_page":100,"rows":[201,300],"of":431,"counts":{"archive_papers_tagged":431,"with_a_code_link":139,"where_syntology_ran_a_sample":15,"not_listed_spam_title":0,"listed":431,"listed_where_code_ran":15,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":14,"every_run_a_failure_of_syntologys_instrument":1,"listed_with_a_run_with_no_instrument_failure":14,"listed_every_run_a_failure_of_syntologys_instrument":1,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-emotion-recognition","prev":"/task/speech-emotion-recognition/papers/2","next":"/task/speech-emotion-recognition/papers/4","papers":[{"url":null,"slug":"what-does-it-take-to-generalize-ser-model","title":"What Does it Take to Generalize SER Model Across Datasets? A Comprehensive Benchmark","date":"2024-06-14","arxiv_id":"2406.09933","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-self-supervised-multi-view","title":"Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations","date":"2024-06-12","arxiv_id":"2406.07900","repositories_listed":0,"syntology":null},{"url":null,"slug":"emo-bias-a-large-scale-evaluation-of-social","title":"Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition","date":"2024-06-07","arxiv_id":"2406.05065","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-microphone-speech-emotion-recognition","title":"Multi-Microphone Speech Emotion Recognition using the Hierarchical Token-semantic Audio Transformer Architecture","date":"2024-06-05","arxiv_id":"2406.03272","repositories_listed":0,"syntology":null},{"url":null,"slug":"1st-place-solution-to-odyssey-emotion","title":"1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem","date":"2024-05-30","arxiv_id":"2405.20064","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-wavlm-for-speech-emotion-recognition","title":"Adapting WavLM for Speech Emotion Recognition","date":"2024-05-07","arxiv_id":"2405.04485","repositories_listed":0,"syntology":null},{"url":null,"slug":"gmp-atl-gender-augmented-multi-scale-pseudo","title":"GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition","date":"2024-05-03","arxiv_id":"2405.02151","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-end-to-end-interpretable-convolutional","title":"Toward end-to-end interpretable convolutional neural networks for waveform signals","date":"2024-05-03","arxiv_id":"2405.01815","repositories_listed":0,"syntology":null},{"url":null,"slug":"converting-anyone-s-voice-end-to-end","title":"Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model","date":"2024-05-02","arxiv_id":"2405.01730","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-with-task-adaptation-pre","title":"Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition","date":"2024-05-01","arxiv_id":"2405.00307","repositories_listed":0,"syntology":null},{"url":null,"slug":"usefulness-of-emotional-prosody-in-neural","title":"Usefulness of Emotional Prosody in Neural Machine Translation","date":"2024-04-27","arxiv_id":"2404.17968","repositories_listed":0,"syntology":null},{"url":null,"slug":"mfhca-enhancing-speech-emotion-recognition","title":"MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention","date":"2024-04-21","arxiv_id":"2404.13509","repositories_listed":0,"syntology":null},{"url":null,"slug":"trnet-two-level-refinement-network-leveraging","title":"TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition","date":"2024-04-19","arxiv_id":"2404.12979","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-assessment-of-encouragement-and","title":"Automated Assessment of Encouragement and Warmth in Classrooms Leveraging Multimodal Emotional Features and ChatGPT","date":"2024-04-01","arxiv_id":"2404.15310","repositories_listed":0,"syntology":null},{"url":"/paper/the-neurips-2023-machine-learning-for-audio","slug":"the-neurips-2023-machine-learning-for-audio","title":"The NeurIPS 2023 Machine Learning for Audio Workshop: Affective Audio Benchmarks and Novel Data","date":"2024-03-21","arxiv_id":"2403.14048","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/the-neurips-2023-machine-learning-for-audio#ran","syntology_url":"https://syntology.ai/paper/2403.14048","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2403.14048"}},"official":null}},{"url":null,"slug":"segaa-a-unified-approach-to-predicting-age","title":"SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech","date":"2024-03-01","arxiv_id":"2403.00887","repositories_listed":0,"syntology":null},{"url":"/paper/mixer-is-more-than-just-a-model","slug":"mixer-is-more-than-just-a-model","title":"Mixer is more than just a model","date":"2024-02-28","arxiv_id":"2402.18007","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-efficient-finetuning-for-speech","title":"Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation","date":"2024-02-19","arxiv_id":"2402.11747","repositories_listed":0,"syntology":null},{"url":null,"slug":"persian-speech-emotion-recognition-by-fine","title":"Persian Speech Emotion Recognition by Fine-Tuning Transformers","date":"2024-02-11","arxiv_id":"2402.07326","repositories_listed":0,"syntology":null},{"url":null,"slug":"cochceps-augment-a-novel-self-supervised","title":"CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition","date":"2024-02-10","arxiv_id":"2402.06923","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-wise-analysis-of-self-supervised","title":"Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition","date":"2024-02-04","arxiv_id":"2402.02617","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-paralingual-are-paralinguistic","title":"Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?","date":"2024-02-02","arxiv_id":"2402.01579","repositories_listed":0,"syntology":null},{"url":null,"slug":"staa-net-a-sparse-and-transferable","title":"STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition","date":"2024-02-02","arxiv_id":"2402.01227","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf-aed-aec-speech-emotion-recognition-by","title":"MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction","date":"2024-01-24","arxiv_id":"2401.13260","repositories_listed":0,"syntology":null},{"url":null,"slug":"revealing-emotional-clusters-in-speaker","title":"Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition","date":"2024-01-19","arxiv_id":"2401.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-swin-transformer-exploring-a","title":"Speech Swin-Transformer: Exploring a Hierarchical Transformer with Shifted Windows for Speech Emotion Recognition","date":"2024-01-19","arxiv_id":"2401.10536","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speaker-independent-speech-emotion","title":"Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation","date":"2024-01-18","arxiv_id":"2401.09752","repositories_listed":0,"syntology":null},{"url":null,"slug":"ed-tts-multi-scale-emotion-modeling-using","title":"ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis","date":"2024-01-16","arxiv_id":"2401.08166","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporalaugmenter-an-ensemble-recurrent-based","title":"TemporalAugmenter: An Ensemble Recurrent Based Deep Learning Approach for Signal Classification","date":"2024-01-13","arxiv_id":"2401.06970","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-task-multi-modal-approach-for","title":"A Multi-Task, Multi-Modal Approach for Predicting Categorical and Dimensional Emotions","date":"2023-12-31","arxiv_id":"2401.00536","repositories_listed":0,"syntology":null},{"url":null,"slug":"dsnet-disentangled-siamese-network-with","title":"DSNet: Disentangled Siamese Network with Neutral Calibration for Speech Emotion Recognition","date":"2023-12-25","arxiv_id":"2312.15593","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-salient-representations-and","title":"Investigating salient representations and label Variance in Dimensional Speech Emotion Analysis","date":"2023-12-17","arxiv_id":"2312.16180","repositories_listed":0,"syntology":null},{"url":null,"slug":"testing-speech-emotion-recognition-machine","title":"Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models","date":"2023-12-11","arxiv_id":"2312.06270","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-and-text-based-emotion-recognizer","title":"Speech and Text-Based Emotion Recognizer","date":"2023-12-10","arxiv_id":"2312.11503","repositories_listed":0,"syntology":null},{"url":null,"slug":"churn-prediction-via-multimodal-fusion","title":"Churn Prediction via Multimodal Fusion Learning:Integrating Customer Financial Literacy, Voice, and Behavioral Data","date":"2023-12-03","arxiv_id":"2312.01301","repositories_listed":0,"syntology":null},{"url":null,"slug":"ser-ampel-a-multi-source-dataset-for-ser-of","title":"SER_AMPEL: a multi-source dataset for speech emotion recognition of Italian older adults","date":"2023-11-24","arxiv_id":"2311.14483","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-transfer-learning-for-speaker","title":"End-to-end transfer learning for speaker-independent cross-language and cross-corpus speech emotion recognition","date":"2023-11-22","arxiv_id":"2311.13678","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-speech-emotion-recognition-and","title":"Utilizing Speech Emotion Recognition and Recommender Systems for Negative Emotion Handling in Therapy Chatbots","date":"2023-11-18","arxiv_id":"2311.11116","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effectiveness-of-asr-representations","title":"On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition","date":"2023-11-13","arxiv_id":"2311.07093","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-large-speech-models-based","title":"An analysis of large speech models-based representations for speech emotion recognition","date":"2023-11-01","arxiv_id":"2311.00394","repositories_listed":0,"syntology":null},{"url":null,"slug":"emodiarize-speaker-diarization-and-emotion","title":"EmoDiarize: Speaker Diarization and Emotion Identification from Speech Signals using Convolutional Neural Networks","date":"2023-10-19","arxiv_id":"2310.12851","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-contrastive-learning-into-a","title":"Integrating Contrastive Learning into a Multitask Transformer Model for Effective Domain Adaptation","date":"2023-10-07","arxiv_id":"2310.04703","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-audios-using-acoustic-properties","title":"Prompting Audios Using Acoustic Properties For Emotion Representation","date":"2023-10-03","arxiv_id":"2310.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-continuous-speech-emotion","title":"End-to-End Continuous Speech Emotion Recognition in Real-life Customer Service Call Center Conversations","date":"2023-10-02","arxiv_id":"2310.02281","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-based-fine-tuning-framework","title":"Active Learning Based Fine-Tuning Framework for Speech Emotion Recognition","date":"2023-09-30","arxiv_id":"2310.00283","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-representations-improve","title":"Unsupervised Representations Improve Supervised Learning in Speech Emotion Recognition","date":"2023-09-22","arxiv_id":"2309.12714","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-broad-impact-of-feature-imitation-neural","title":"The Broad Impact of Feature Imitation: Neural Enhancements Across Financial, Speech, and Physiological Domains","date":"2023-09-21","arxiv_id":"2309.12279","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensembling-multilingual-pre-trained-models","title":"Ensembling Multilingual Pre-Trained Models for Predicting Multi-Label Regression Emotion Share from Speech","date":"2023-09-20","arxiv_id":"2309.11014","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-speech-ptm-text-llm-and-emotional","title":"Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition","date":"2023-09-19","arxiv_id":"2309.10294","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-emotion-recognition-with-distilled","title":"Speech Emotion Recognition with Distilled Prosodic and Linguistic Affect Representations","date":"2023-09-09","arxiv_id":"2309.04849","repositories_listed":0,"syntology":null},{"url":null,"slug":"lanser-language-model-supported-speech","title":"LanSER: Language-Model Supported Speech Emotion Recognition","date":"2023-09-07","arxiv_id":"2309.03978","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-adaptation-with-pre-trained","title":"Personalized Adaptation with Pre-trained Speech Encoders for Continuous Emotion Recognition","date":"2023-09-05","arxiv_id":"2309.02418","repositories_listed":0,"syntology":null},{"url":null,"slug":"msm-vc-high-fidelity-source-style-transfer","title":"MSM-VC: High-fidelity Source Style Transfer for Non-Parallel Voice Conversion by Multi-scale Style Modeling","date":"2023-09-03","arxiv_id":"2309.01142","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-robust-speech-emotion-recognition-with","title":"Noise robust speech emotion recognition with signal-to-noise ratio adapting speech enhancement","date":"2023-09-03","arxiv_id":"2309.01164","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-contrastive-learning-with-nearest","title":"Supervised Contrastive Learning with Nearest Neighbor Search for Speech Emotion Recognition","date":"2023-08-31","arxiv_id":"2308.16485","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiscale-contextual-learning-for-speech","title":"Multiscale Contextual Learning for Speech Emotion Recognition in Emergency Call Center Conversations","date":"2023-08-28","arxiv_id":"2308.14894","repositories_listed":0,"syntology":null},{"url":null,"slug":"msac-multiple-speech-attribute-control-method","title":"MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition","date":"2023-08-08","arxiv_id":"2308.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"we-care-improving-code-mixed-speech-emotion","title":"\"We care\": Improving Code Mixed Speech Emotion Recognition in Customer-Care Conversations","date":"2023-08-06","arxiv_id":"2308.03150","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-spectral-and-long-term-contextual","title":"Capturing Spectral and Long-term Contextual Information for Speech Emotion Recognition Using Deep Learning Techniques","date":"2023-08-04","arxiv_id":"2308.04517","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-corpus-multilingual-speech-emotion","title":"Cross-Corpus Multilingual Speech Emotion Recognition: Amharic vs. Other Languages","date":"2023-07-20","arxiv_id":"2307.10814","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-raw-waveforms-with-deep-learning","title":"Evaluating raw waveforms with deep learning frameworks for speech emotion recognition","date":"2023-07-06","arxiv_id":"2307.02820","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-interpretation-of-the-relationship","title":"Empirical Interpretation of the Relationship Between Speech Acoustic Context and Emotion Recognition","date":"2023-06-30","arxiv_id":"2306.17500","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-language-speech-emotion-recognition","title":"Cross-Language Speech Emotion Recognition Using Multimodal Dual Attention Transformers","date":"2023-06-23","arxiv_id":"2306.13804","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemo-clap-gender-attribute-enhanced","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","date":"2023-06-13","arxiv_id":"2306.07848","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-attention-mechanisms-for-multimodal","title":"Exploring Attention Mechanisms for Multimodal Emotion Recognition in an Emergency Call Center Corpus","date":"2023-06-12","arxiv_id":"2306.07115","repositories_listed":0,"syntology":null},{"url":null,"slug":"mfas-emotion-recognition-through-multiple","title":"MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition","date":"2023-06-12","arxiv_id":"2306.09361","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-emotional-representations-from","title":"Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech","date":"2023-06-09","arxiv_id":"2306.05709","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-semantic-information-for-efficient","title":"Leveraging Semantic Information for Efficient Self-Supervised Emotion Recognition with Audio-Textual Distilled Models","date":"2023-05-30","arxiv_id":"2305.19184","repositories_listed":0,"syntology":null},{"url":null,"slug":"transforming-the-embeddings-a-lightweight","title":"Transforming the Embeddings: A Lightweight Technique for Speech Emotion Recognition Tasks","date":"2023-05-29","arxiv_id":"2305.18640","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-and-emotional-speech-a-word-level","title":"ASR and Emotional Speech: A Word-Level Investigation of the Mutual Impact of Speech and Emotion Recognition","date":"2023-05-25","arxiv_id":"2305.16065","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-personality-perception","title":"Transfer Learning for Personality Perception via Speech Emotion Recognition","date":"2023-05-25","arxiv_id":"2305.16076","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-efficacy-and-noise-robustness-of","title":"On the Efficacy and Noise-Robustness of Jointly Learned Speech Emotion and Automatic Speech Recognition","date":"2023-05-21","arxiv_id":"2305.12540","repositories_listed":0,"syntology":null},{"url":"/paper/versatile-audio-visual-learning-for-handling","slug":"versatile-audio-visual-learning-for-handling","title":"Versatile audio-visual learning for emotion recognition","date":"2023-05-12","arxiv_id":"2305.07216","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-vector-quantized-masked-autoencoder-for-1","title":"A vector quantized masked autoencoder for audiovisual speech emotion recognition","date":"2023-05-05","arxiv_id":"2305.03568","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-pre-trained-speech-and","title":"A Comparative Study of Pre-trained Speech and Audio Embeddings for Speech Emotion Recognition","date":"2023-04-22","arxiv_id":"2304.11472","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-and-improvement-for-speech","title":"An Empirical Study and Improvement for Speech Emotion Recognition","date":"2023-04-08","arxiv_id":"2304.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-and-evaluating-speech-emotion","title":"Designing and Evaluating Speech Emotion Recognition Systems: A reality check case study with IEMOCAP","date":"2023-04-03","arxiv_id":"2304.00860","repositories_listed":0,"syntology":null},{"url":null,"slug":"cnn-n-gru-end-to-end-speech-emotion","title":"CNN-n-GRU: end-to-end speech emotion recognition from raw waveform signal using CNNs and gated recurrent unit networks","date":"2023-03-23","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/coordvit-a-novel-method-of-improve-vision","slug":"coordvit-a-novel-method-of-improve-vision","title":"CoordViT: A Novel Method of Improve Vision Transformer-Based Speech Emotion Recognition using Coordinate Information Concatenate","date":"2023-03-10","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-implicit-distribution-alignment-networks","title":"Deep Implicit Distribution Alignment Networks for Cross-Corpus Speech Emotion Recognition","date":"2023-02-17","arxiv_id":"2302.08921","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-smoothed-imbalance-data-improves","title":"Gaussian-smoothed Imbalance Data Improves Speech Emotion Recognition","date":"2023-02-17","arxiv_id":"2302.08650","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-representation-learning-by-distilling","title":"Audio Representation Learning by Distilling Video as Privileged Information","date":"2023-02-06","arxiv_id":"2302.02845","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-segment-level-feature","title":"deep learning of segment-level feature representation for speech emotion recognition in conversations","date":"2023-02-05","arxiv_id":"2302.02419","repositories_listed":0,"syntology":null},{"url":null,"slug":"modulation-spectral-features-for-speech","title":"Modulation spectral features for speech emotion recognition using deep neural networks","date":"2023-01-14","arxiv_id":"2301.05868","repositories_listed":0,"syntology":null},{"url":null,"slug":"litelstm-architecture-based-on-weights","title":"LiteLSTM Architecture Based on Weights Sharing for Recurrent Neural Networks","date":"2023-01-12","arxiv_id":"2301.04794","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-prosody-representations-with","title":"Disentangling Prosody Representations with Unsupervised Speech Reconstruction","date":"2022-12-14","arxiv_id":"2212.06972","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-constant-q-filterbank-based","title":"Analysis of constant-Q filterbank based representations for speech emotion recognition","date":"2022-11-29","arxiv_id":"2211.16363","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-against-real-time-speech-emotion","title":"Privacy against Real-Time Speech Emotion Detection via Acoustic Adversarial Evasion of Machine Learning","date":"2022-11-17","arxiv_id":"2211.09273","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-with-unsupervised-speaking","title":"Improving Speech Emotion Recognition with Unsupervised Speaking Style Transfer","date":"2022-11-16","arxiv_id":"2211.08843","repositories_listed":0,"syntology":null},{"url":null,"slug":"describing-emotions-with-acoustic-property","title":"Describing emotions with acoustic property prompts for speech emotion recognition","date":"2022-11-14","arxiv_id":"2211.07737","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-recognition-of-italian-elderly","title":"Sentiment recognition of Italian elderly through domain adaptation on cross-corpus speech dataset","date":"2022-11-14","arxiv_id":"2211.07307","repositories_listed":0,"syntology":null},{"url":"/paper/speech-emotion-recognition-based-on-self","slug":"speech-emotion-recognition-based-on-self","title":"Speech Emotion Recognition Based on Self-Attention Weight Correction for Acoustic and Text Features","date":"2022-11-08","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-speech-emotion-recognition-with","title":"Multilingual Speech Emotion Recognition With Multi-Gating Mechanism and Neural Architecture Search","date":"2022-10-31","arxiv_id":"2211.08237","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-the-discrete-and-continuous-emotion","title":"Unifying the Discrete and Continuous Emotion labels for Speech Emotion Recognition","date":"2022-10-29","arxiv_id":"2210.16642","repositories_listed":0,"syntology":null},{"url":null,"slug":"effect-of-different-splitting-criteria-on-the","title":"Effect of different splitting criteria on the performance of speech emotion recognition","date":"2022-10-26","arxiv_id":"2210.14501","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-emotion-recognition-via-an-attentive","title":"Speech Emotion Recognition via an Attentive Time-Frequency Neural Network","date":"2022-10-22","arxiv_id":"2210.12430","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-attention-networks-and","title":"Self-Supervised Attention Networks and Uncertainty Loss Weighting for Multi-Task Emotion Recognition on Vocal Bursts","date":"2022-09-15","arxiv_id":"2209.07384","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-emotion-recognition-using-supervised","title":"Speech Emotion Recognition using Supervised Deep Recurrent System for Mental Health Monitoring","date":"2022-08-26","arxiv_id":"2208.12812","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-emotion-recognition-through","title":"Improving Speech Emotion Recognition Through Focus and Calibration Attention Mechanisms","date":"2022-08-21","arxiv_id":"2208.10491","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-with-graph-neural","title":"Representation Learning with Graph Neural Networks for Speech Emotion Recognition","date":"2022-08-21","arxiv_id":"2208.09830","repositories_listed":0,"syntology":null}],"record_sha256":"1fb7a5d842535a391913ef9ea707d8b3bd54aba5059b3e6a794ec6d86e83baef","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}