{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition/papers/22","list_of":"/task/speech-recognition","task":"Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":22,"pages_in_order":65,"rows_per_page":100,"rows":[2101,2200],"of":6433,"counts":{"archive_papers_tagged":6433,"with_a_code_link":1373,"where_syntology_ran_a_sample":196,"not_listed_spam_title":0,"listed":6433,"listed_where_code_ran":196,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":162,"every_run_a_failure_of_syntologys_instrument":34,"listed_with_a_run_with_no_instrument_failure":162,"listed_every_run_a_failure_of_syntologys_instrument":34,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition","prev":"/task/speech-recognition/papers/21","next":"/task/speech-recognition/papers/23","papers":[{"url":null,"slug":"more-than-words-advancements-and-challenges","title":"More than words: Advancements and challenges in speech recognition for singing","date":"2024-03-14","arxiv_id":"2403.09298","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-audio-visual-speech-recognition","title":"Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer","date":"2024-03-14","arxiv_id":"2405.12983","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-speech-recognition-asr-for-the","title":"Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children","date":"2024-03-13","arxiv_id":"2403.08187","repositories_listed":0,"syntology":null},{"url":null,"slug":"skipformer-a-skip-and-recover-strategy-for","title":"Skipformer: A Skip-and-Recover Strategy for Efficient Speech Recognition","date":"2024-03-13","arxiv_id":"2403.08258","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-labels-unveiling-text-dependency","title":"Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets","date":"2024-03-12","arxiv_id":"2403.07767","repositories_listed":0,"syntology":null},{"url":null,"slug":"gujarati-english-code-switching-speech","title":"Gujarati-English Code-Switching Speech Recognition using ensemble prediction of spoken language","date":"2024-03-12","arxiv_id":"2403.08011","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-evaluation-of-a-code-switched-sepedi","title":"The evaluation of a code-switched Sepedi-English automatic speech recognition system","date":"2024-03-11","arxiv_id":"2403.07947","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-speech-to-languages-to-enhance-code","title":"Aligning Speech to Languages to Enhance Code-switching Speech Recognition","date":"2024-03-09","arxiv_id":"2403.05887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-benchmark-for-evaluating-automatic","title":"A New Benchmark for Evaluating Automatic Speech Recognition in the Arabic Call Domain","date":"2024-03-07","arxiv_id":"2403.04280","repositories_listed":0,"syntology":null},{"url":null,"slug":"classist-tools-social-class-correlates-with","title":"Classist Tools: Social Class Correlates with Performance in NLP","date":"2024-03-07","arxiv_id":"2403.04445","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-verbal-information-in-spontaneous-speech","title":"Non-verbal information in spontaneous speech -- towards a new framework of analysis","date":"2024-03-06","arxiv_id":"2403.03522","repositories_listed":0,"syntology":null},{"url":null,"slug":"radia-radio-advertisement-detection-with","title":"RADIA -- Radio Advertisement Detection with Intelligent Analytics","date":"2024-03-06","arxiv_id":"2403.03538","repositories_listed":0,"syntology":null},{"url":null,"slug":"aix-speed-playback-speed-optimization-using","title":"AIx Speed: Playback Speed Optimization Using Listening Comprehension of Speech Recognition Models","date":"2024-03-05","arxiv_id":"2403.02938","repositories_listed":0,"syntology":null},{"url":null,"slug":"jep-kd-joint-embedding-predictive","title":"JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition","date":"2024-03-04","arxiv_id":"2403.18843","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-has-lebenchmark-learnt-about-french","title":"What has LeBenchmark Learnt about French Syntax?","date":"2024-03-04","arxiv_id":"2403.02173","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-closer-look-at-wav2vec2-embeddings-for-on","title":"A Closer Look at Wav2Vec2 Embeddings for On-Device Single-Channel Speech Enhancement","date":"2024-03-03","arxiv_id":"2403.01369","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-speech-recognition-using-advanced","title":"Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey","date":"2024-03-02","arxiv_id":"2403.01255","repositories_listed":0,"syntology":null},{"url":null,"slug":"post-decoder-biasing-for-end-to-end-speech","title":"Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview","date":"2024-03-01","arxiv_id":"2403.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"inappropriate-pause-detection-in-dysarthric","title":"Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition","date":"2024-02-29","arxiv_id":"2402.18923","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-information-encoded-in-neural","title":"Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems","date":"2024-02-29","arxiv_id":"2402.19443","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-of-adapter-for-noise-robust","title":"Exploration of Adapter for Noise Robust Automatic Speech Recognition","date":"2024-02-28","arxiv_id":"2402.18275","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-effective-mixture-of-experts-approach-for","title":"An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement","date":"2024-02-27","arxiv_id":"2402.17189","repositories_listed":0,"syntology":null},{"url":null,"slug":"extreme-encoder-output-frame-rate-reduction","title":"Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models","date":"2024-02-27","arxiv_id":"2402.17184","repositories_listed":0,"syntology":null},{"url":"/paper/areeg-chars-dataset-for-envisioned-speech","slug":"areeg-chars-dataset-for-envisioned-speech","title":"ArEEG_Chars: Dataset for Envisioned Speech Recognition using EEG for Arabic Characters","date":"2024-02-24","arxiv_id":"2402.15733","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-data-selection-employing-semantic","title":"Efficient data selection employing Semantic Similarity-based Graph Structures for model training","date":"2024-02-22","arxiv_id":"2402.14888","repositories_listed":0,"syntology":null},{"url":null,"slug":"mel-fullsubnet-mel-spectrogram-enhancement","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR","date":"2024-02-21","arxiv_id":"2402.13511","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-conventional-hybrid-and-ctc","title":"Comparison of Conventional Hybrid and CTC/Attention Decoders for Continuous Visual Speech Recognition","date":"2024-02-20","arxiv_id":"2402.13004","repositories_listed":0,"syntology":null},{"url":null,"slug":"not-all-weights-are-created-equal-enhancing","title":"Breaking Down Power Barriers in On-Device Streaming ASR: Insights and Solutions","date":"2024-02-20","arxiv_id":"2402.13076","repositories_listed":0,"syntology":null},{"url":null,"slug":"ain-t-misbehavin-using-llms-to-generate","title":"Ain't Misbehavin' -- Using LLMs to Generate Expressive Robot Behavior in Conversations with the Tabletop Robot Haru","date":"2024-02-18","arxiv_id":"2402.11571","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-attention-fusion-of-visual-and","title":"Cross-Attention Fusion of Visual and Geometric Features for Large Vocabulary Arabic Lipreading","date":"2024-02-18","arxiv_id":"2402.11520","repositories_listed":0,"syntology":null},{"url":null,"slug":"listening-to-multi-talker-conversations","title":"Listening to Multi-talker Conversations: Modular and End-to-end Perspectives","date":"2024-02-14","arxiv_id":"2402.08932","repositories_listed":0,"syntology":null},{"url":null,"slug":"unienc-cassnat-an-encoder-only-non","title":"UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models","date":"2024-02-14","arxiv_id":"2402.08898","repositories_listed":0,"syntology":null},{"url":null,"slug":"syllable-based-dnn-hmm-cantonese-speech-to-1","title":"Syllable based DNN-HMM Cantonese Speech to Text System","date":"2024-02-13","arxiv_id":"2402.08788","repositories_listed":0,"syntology":null},{"url":null,"slug":"salad-smart-ai-language-assistant-daily","title":"SALAD: Smart AI Language Assistant Daily","date":"2024-02-12","arxiv_id":"2402.07431","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-balancing-act-unmasking-and-alleviating","title":"The Balancing Act: Unmasking and Alleviating ASR Biases in Portuguese","date":"2024-02-12","arxiv_id":"2402.07513","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sound-of-healthcare-improving-medical","title":"The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models","date":"2024-02-12","arxiv_id":"2402.07658","repositories_listed":0,"syntology":null},{"url":null,"slug":"cochceps-augment-a-novel-self-supervised","title":"CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition","date":"2024-02-10","arxiv_id":"2402.06923","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-consistent-context-aware-conformer","title":"Self-consistent context aware conformer transducer for speech recognition","date":"2024-02-09","arxiv_id":"2402.06592","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-unsupervised-domain-adaptation","title":"Progressive unsupervised domain adaptation for ASR using ensemble models and multi-stage training","date":"2024-02-07","arxiv_id":"2402.04805","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-the-current-state-of","title":"A Comprehensive Study of the Current State-of-the-Art in Nepali Automatic Speech Recognition Systems","date":"2024-02-05","arxiv_id":"2402.03050","repositories_listed":0,"syntology":null},{"url":null,"slug":"resolving-transcription-ambiguity-in-spanish","title":"Resolving Transcription Ambiguity in Spanish: A Hybrid Acoustic-Lexical System for Punctuation Restoration","date":"2024-02-05","arxiv_id":"2402.03519","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-positive-transfer-for-improved-low","title":"Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens","date":"2024-02-03","arxiv_id":"2402.02302","repositories_listed":0,"syntology":null},{"url":null,"slug":"accentfold-a-journey-through-african-accents","title":"AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents","date":"2024-02-02","arxiv_id":"2402.01152","repositories_listed":0,"syntology":null},{"url":null,"slug":"digits-micro-model-for-accurate-and-secure","title":"Digits micro-model for accurate and secure transactions","date":"2024-02-02","arxiv_id":"2402.01931","repositories_listed":0,"syntology":null},{"url":null,"slug":"whispering-in-norwegian-navigating","title":"Whispering in Norwegian: Navigating Orthographic and Dialectic Challenges","date":"2024-02-02","arxiv_id":"2402.01917","repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-to-speech-recognition","title":"Introduction to speech recognition","date":"2024-02-01","arxiv_id":"2402.01778","repositories_listed":0,"syntology":null},{"url":null,"slug":"prosody-in-cascade-and-direct-speech-to-text","title":"Prosody in Cascade and Direct Speech-to-Text Translation: a case study on Korean Wh-Phrases","date":"2024-02-01","arxiv_id":"2402.00632","repositories_listed":0,"syntology":null},{"url":null,"slug":"computation-and-parameter-efficient-multi","title":"Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition","date":"2024-01-31","arxiv_id":"2401.17604","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-limits-of-decoder-only-models","title":"Exploring the limits of decoder-only models trained on public speech recognition corpora","date":"2024-01-31","arxiv_id":"2402.00235","repositories_listed":0,"syntology":null},{"url":null,"slug":"speechcomposer-unifying-multiple-speech-tasks","title":"SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition","date":"2024-01-31","arxiv_id":"2401.18045","repositories_listed":0,"syntology":null},{"url":null,"slug":"byte-pair-encoding-is-all-you-need-for","title":"Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition","date":"2024-01-28","arxiv_id":"2401.15532","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-parameters-of-vowel-sounds-of","title":"Comparison of parameters of vowel sounds of russian and english languages","date":"2024-01-26","arxiv_id":"2401.14890","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-practical-automatic-speech-recognition","title":"Toward Practical Automatic Speech Recognition and Post-Processing: a Call for Explainable Error Benchmark Guideline","date":"2024-01-26","arxiv_id":"2401.14625","repositories_listed":0,"syntology":null},{"url":null,"slug":"cnn-architecture-extraction-on-edge-gpu","title":"CNN architecture extraction on edge GPU","date":"2024-01-24","arxiv_id":"2401.13575","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf-aed-aec-speech-emotion-recognition-by","title":"MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction","date":"2024-01-24","arxiv_id":"2401.13260","repositories_listed":0,"syntology":null},{"url":null,"slug":"speechdpr-end-to-end-spoken-passage-retrieval","title":"SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering","date":"2024-01-24","arxiv_id":"2401.13463","repositories_listed":0,"syntology":null},{"url":null,"slug":"locality-enhanced-dynamic-biasing-and","title":"Locality enhanced dynamic biasing and sampling strategies for contextual ASR","date":"2024-01-23","arxiv_id":"2401.13146","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-and-fully-non-autoregressive-asr","title":"Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study","date":"2024-01-23","arxiv_id":"2401.12789","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-based-unsupervised-self-training","title":"Consistency Based Unsupervised Self-training For ASR Personalisation","date":"2024-01-22","arxiv_id":"2401.12085","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-decoding-parallel-with-effective","title":"Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers","date":"2024-01-22","arxiv_id":"2401.11700","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-large-language-model-for-end-to-end","title":"Using Large Language Model for End-to-End Chinese ASR and NER","date":"2024-01-21","arxiv_id":"2401.11382","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-automatic-speech-recognition","title":"Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search","date":"2024-01-19","arxiv_id":"2401.10449","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-training-strategies-and-model","title":"Investigating Training Strategies and Model Robustness of Low-Rank Adaptation for Language Modeling in Speech Recognition","date":"2024-01-19","arxiv_id":"2401.10447","repositories_listed":0,"syntology":null},{"url":null,"slug":"agadir-towards-array-geometry-agnostic","title":"AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition","date":"2024-01-18","arxiv_id":"2401.10411","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-personalized-1","title":"Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks","date":"2024-01-18","arxiv_id":"2401.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"slideavsr-a-dataset-of-paper-explanation","title":"SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition","date":"2024-01-18","arxiv_id":"2401.09759","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-speech-pre-emphasis-as-a-simple-and","title":"On Speech Pre-emphasis as a Simple and Inexpensive Method to Boost Speech Enhancement","date":"2024-01-17","arxiv_id":"2401.09315","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-pass-endpoint-detection-for-speech","title":"Two-pass Endpoint Detection for Speech Recognition","date":"2024-01-17","arxiv_id":"2401.08916","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-asr-contextual-biasing-with-guided","title":"Improving ASR Contextual Biasing with Guided Attention","date":"2024-01-16","arxiv_id":"2401.08835","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-input-multi-output-target-speaker-voice","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","date":"2024-01-16","arxiv_id":"2401.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"notsofar-1-challenge-new-datasets-baseline","title":"NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription","date":"2024-01-16","arxiv_id":"2401.08887","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-self-supervised-learning-of-speech","title":"Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective","date":"2024-01-16","arxiv_id":"2401.08833","repositories_listed":0,"syntology":null},{"url":null,"slug":"semascore-a-new-evaluation-metric-for","title":"SeMaScore : a new evaluation metric for automatic speech recognition tasks","date":"2024-01-15","arxiv_id":"2401.07506","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptformer-prompted-conformer-transducer","title":"Promptformer: Prompted Conformer Transducer for ASR","date":"2024-01-14","arxiv_id":"2401.07360","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-unsupervised-and-supervised-training-1","title":"Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization","date":"2024-01-13","arxiv_id":"2401.06980","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-behaviour-of-connectionist-speech","title":"Dynamic Behaviour of Connectionist Speech Recognition with Strong Latency Constraints","date":"2024-01-12","arxiv_id":"2401.06588","repositories_listed":0,"syntology":null},{"url":null,"slug":"transcending-controlled-environments","title":"Transcending Controlled Environments Assessing the Transferability of ASRRobust NLU Models to Real-World Applications","date":"2024-01-12","arxiv_id":"2401.09354","repositories_listed":0,"syntology":null},{"url":null,"slug":"xls-r-deep-learning-model-for-multilingual","title":"XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese","date":"2024-01-12","arxiv_id":"2401.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-hindi-to-english-speech-conversion","title":"End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2","date":"2024-01-11","arxiv_id":"2401.06183","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucorrect-an-unsupervised-framework-for","title":"UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction","date":"2024-01-11","arxiv_id":"2401.05689","repositories_listed":0,"syntology":null},{"url":null,"slug":"useful-blunders-can-automated-speech","title":"Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?","date":"2024-01-10","arxiv_id":"2401.05551","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuously-learning-new-words-in-automatic","title":"Continuously Learning New Words in Automatic Speech Recognition","date":"2024-01-09","arxiv_id":"2401.04482","repositories_listed":0,"syntology":null},{"url":null,"slug":"bs-plcnet-band-split-packet-loss-concealment","title":"BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators","date":"2024-01-08","arxiv_id":"2401.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-evaluation-of-speech-content","title":"Exploratory Evaluation of Speech Content Masking","date":"2024-01-08","arxiv_id":"2401.03936","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-precision-voice-search-query-correction","title":"High-precision Voice Search Query Correction via Retrievable Speech-text Embedings","date":"2024-01-08","arxiv_id":"2401.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"lupet-incorporating-hierarchical-information","title":"LUPET: Incorporating Hierarchical Information Path into Multilingual ASR","date":"2024-01-08","arxiv_id":"2401.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"icmc-asr-the-icassp-2024-in-car-multi-channel","title":"ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge","date":"2024-01-07","arxiv_id":"2401.03473","repositories_listed":0,"syntology":null},{"url":null,"slug":"mlca-avsr-multi-layer-cross-attention-fusion","title":"MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition","date":"2024-01-07","arxiv_id":"2401.03424","repositories_listed":0,"syntology":null},{"url":null,"slug":"part-of-speech-tagger-for-bodo-language-using","title":"Part-of-Speech Tagger for Bodo Language using Deep Learning approach","date":"2024-01-06","arxiv_id":"2401.03175","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-multichannel-far-field-speech","title":"A unified multichannel far-field speech recognition system: combining neural beamforming with attention based end-to-end model","date":"2024-01-05","arxiv_id":"2401.02673","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonlinear-functional-regression-by-functional","title":"Nonlinear functional regression by functional deep neural network with kernel embedding","date":"2024-01-05","arxiv_id":"2401.02890","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-asr-robust-spoken-language","title":"Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks","date":"2024-01-05","arxiv_id":"2401.02921","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctc-blank-triggered-dynamic-layer-skipping","title":"CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition","date":"2024-01-04","arxiv_id":"2401.02046","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucinations-in-neural-automatic-speech","title":"Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models","date":"2024-01-03","arxiv_id":"2401.01572","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-art-of-deception-robust-backdoor-attack","title":"The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers","date":"2024-01-03","arxiv_id":"2401.01537","repositories_listed":0,"syntology":null},{"url":"/paper/es3-evolving-self-supervised-learning-of","slug":"es3-evolving-self-supervised-learning-of","title":"ES3: Evolving Self-Supervised Learning of Robust Audio-Visual Speech Representations","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-nus-hlt-system-for-icassp2024-icmc-asr","title":"The NUS-HLT System for ICASSP2024 ICMC-ASR Grand Challenge","date":"2023-12-26","arxiv_id":"2312.16002","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-probing-contact-center-large-language","title":"Towards Probing Contact Center Large Language Models","date":"2023-12-26","arxiv_id":"2312.15922","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-data-augmentation-in-bias","title":"Exploring data augmentation in bias mitigation against non-native-accented speech","date":"2023-12-24","arxiv_id":"2312.15499","repositories_listed":0,"syntology":null},{"url":null,"slug":"blstm-based-confidence-estimation-for-end-to","title":"BLSTM-Based Confidence Estimation for End-to-End Speech Recognition","date":"2023-12-22","arxiv_id":"2312.14609","repositories_listed":0,"syntology":null}],"record_sha256":"e44f7d95d0d3efa144cb2bc4294ffce66090477cc757a94af6906fb5c20ba970","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}