{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition/papers/11","list_of":"/task/automatic-speech-recognition","task":"Automatic Speech Recognition (ASR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":31,"rows_per_page":100,"rows":[1001,1100],"of":3012,"counts":{"archive_papers_tagged":3012,"with_a_code_link":622,"where_syntology_ran_a_sample":77,"not_listed_spam_title":0,"listed":3012,"listed_where_code_ran":77,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":13,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":13,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition","prev":"/task/automatic-speech-recognition/papers/10","next":"/task/automatic-speech-recognition/papers/12","papers":[{"url":null,"slug":"aligning-speech-to-languages-to-enhance-code","title":"Aligning Speech to Languages to Enhance Code-switching Speech Recognition","date":"2024-03-09","arxiv_id":"2403.05887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-benchmark-for-evaluating-automatic","title":"A New Benchmark for Evaluating Automatic Speech Recognition in the Arabic Call Domain","date":"2024-03-07","arxiv_id":"2403.04280","repositories_listed":0,"syntology":null},{"url":null,"slug":"jep-kd-joint-embedding-predictive","title":"JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition","date":"2024-03-04","arxiv_id":"2403.18843","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-speech-recognition-using-advanced","title":"Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey","date":"2024-03-02","arxiv_id":"2403.01255","repositories_listed":0,"syntology":null},{"url":null,"slug":"post-decoder-biasing-for-end-to-end-speech","title":"Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview","date":"2024-03-01","arxiv_id":"2403.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"inappropriate-pause-detection-in-dysarthric","title":"Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition","date":"2024-02-29","arxiv_id":"2402.18923","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-information-encoded-in-neural","title":"Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems","date":"2024-02-29","arxiv_id":"2402.19443","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-of-adapter-for-noise-robust","title":"Exploration of Adapter for Noise Robust Automatic Speech Recognition","date":"2024-02-28","arxiv_id":"2402.18275","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-effective-mixture-of-experts-approach-for","title":"An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement","date":"2024-02-27","arxiv_id":"2402.17189","repositories_listed":0,"syntology":null},{"url":null,"slug":"extreme-encoder-output-frame-rate-reduction","title":"Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models","date":"2024-02-27","arxiv_id":"2402.17184","repositories_listed":0,"syntology":null},{"url":null,"slug":"mel-fullsubnet-mel-spectrogram-enhancement","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR","date":"2024-02-21","arxiv_id":"2402.13511","repositories_listed":0,"syntology":null},{"url":null,"slug":"ain-t-misbehavin-using-llms-to-generate","title":"Ain't Misbehavin' -- Using LLMs to Generate Expressive Robot Behavior in Conversations with the Tabletop Robot Haru","date":"2024-02-18","arxiv_id":"2402.11571","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-balancing-act-unmasking-and-alleviating","title":"The Balancing Act: Unmasking and Alleviating ASR Biases in Portuguese","date":"2024-02-12","arxiv_id":"2402.07513","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sound-of-healthcare-improving-medical","title":"The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models","date":"2024-02-12","arxiv_id":"2402.07658","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-unsupervised-domain-adaptation","title":"Progressive unsupervised domain adaptation for ASR using ensemble models and multi-stage training","date":"2024-02-07","arxiv_id":"2402.04805","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-the-current-state-of","title":"A Comprehensive Study of the Current State-of-the-Art in Nepali Automatic Speech Recognition Systems","date":"2024-02-05","arxiv_id":"2402.03050","repositories_listed":0,"syntology":null},{"url":null,"slug":"resolving-transcription-ambiguity-in-spanish","title":"Resolving Transcription Ambiguity in Spanish: A Hybrid Acoustic-Lexical System for Punctuation Restoration","date":"2024-02-05","arxiv_id":"2402.03519","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-positive-transfer-for-improved-low","title":"Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens","date":"2024-02-03","arxiv_id":"2402.02302","repositories_listed":0,"syntology":null},{"url":null,"slug":"accentfold-a-journey-through-african-accents","title":"AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents","date":"2024-02-02","arxiv_id":"2402.01152","repositories_listed":0,"syntology":null},{"url":null,"slug":"digits-micro-model-for-accurate-and-secure","title":"Digits micro-model for accurate and secure transactions","date":"2024-02-02","arxiv_id":"2402.01931","repositories_listed":0,"syntology":null},{"url":null,"slug":"whispering-in-norwegian-navigating","title":"Whispering in Norwegian: Navigating Orthographic and Dialectic Challenges","date":"2024-02-02","arxiv_id":"2402.01917","repositories_listed":0,"syntology":null},{"url":null,"slug":"byte-pair-encoding-is-all-you-need-for","title":"Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition","date":"2024-01-28","arxiv_id":"2401.15532","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-practical-automatic-speech-recognition","title":"Toward Practical Automatic Speech Recognition and Post-Processing: a Call for Explainable Error Benchmark Guideline","date":"2024-01-26","arxiv_id":"2401.14625","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf-aed-aec-speech-emotion-recognition-by","title":"MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction","date":"2024-01-24","arxiv_id":"2401.13260","repositories_listed":0,"syntology":null},{"url":null,"slug":"locality-enhanced-dynamic-biasing-and","title":"Locality enhanced dynamic biasing and sampling strategies for contextual ASR","date":"2024-01-23","arxiv_id":"2401.13146","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-based-unsupervised-self-training","title":"Consistency Based Unsupervised Self-training For ASR Personalisation","date":"2024-01-22","arxiv_id":"2401.12085","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-decoding-parallel-with-effective","title":"Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers","date":"2024-01-22","arxiv_id":"2401.11700","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-large-language-model-for-end-to-end","title":"Using Large Language Model for End-to-End Chinese ASR and NER","date":"2024-01-21","arxiv_id":"2401.11382","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-automatic-speech-recognition","title":"Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search","date":"2024-01-19","arxiv_id":"2401.10449","repositories_listed":0,"syntology":null},{"url":null,"slug":"agadir-towards-array-geometry-agnostic","title":"AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition","date":"2024-01-18","arxiv_id":"2401.10411","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-personalized-1","title":"Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks","date":"2024-01-18","arxiv_id":"2401.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"slideavsr-a-dataset-of-paper-explanation","title":"SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition","date":"2024-01-18","arxiv_id":"2401.09759","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-asr-contextual-biasing-with-guided","title":"Improving ASR Contextual Biasing with Guided Attention","date":"2024-01-16","arxiv_id":"2401.08835","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptformer-prompted-conformer-transducer","title":"Promptformer: Prompted Conformer Transducer for ASR","date":"2024-01-14","arxiv_id":"2401.07360","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-unsupervised-and-supervised-training-1","title":"Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization","date":"2024-01-13","arxiv_id":"2401.06980","repositories_listed":0,"syntology":null},{"url":null,"slug":"transcending-controlled-environments","title":"Transcending Controlled Environments Assessing the Transferability of ASRRobust NLU Models to Real-World Applications","date":"2024-01-12","arxiv_id":"2401.09354","repositories_listed":0,"syntology":null},{"url":null,"slug":"xls-r-deep-learning-model-for-multilingual","title":"XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese","date":"2024-01-12","arxiv_id":"2401.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-hindi-to-english-speech-conversion","title":"End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2","date":"2024-01-11","arxiv_id":"2401.06183","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucorrect-an-unsupervised-framework-for","title":"UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction","date":"2024-01-11","arxiv_id":"2401.05689","repositories_listed":0,"syntology":null},{"url":null,"slug":"useful-blunders-can-automated-speech","title":"Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?","date":"2024-01-10","arxiv_id":"2401.05551","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuously-learning-new-words-in-automatic","title":"Continuously Learning New Words in Automatic Speech Recognition","date":"2024-01-09","arxiv_id":"2401.04482","repositories_listed":0,"syntology":null},{"url":null,"slug":"bs-plcnet-band-split-packet-loss-concealment","title":"BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators","date":"2024-01-08","arxiv_id":"2401.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-evaluation-of-speech-content","title":"Exploratory Evaluation of Speech Content Masking","date":"2024-01-08","arxiv_id":"2401.03936","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-precision-voice-search-query-correction","title":"High-precision Voice Search Query Correction via Retrievable Speech-text Embedings","date":"2024-01-08","arxiv_id":"2401.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"lupet-incorporating-hierarchical-information","title":"LUPET: Incorporating Hierarchical Information Path into Multilingual ASR","date":"2024-01-08","arxiv_id":"2401.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"icmc-asr-the-icassp-2024-in-car-multi-channel","title":"ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge","date":"2024-01-07","arxiv_id":"2401.03473","repositories_listed":0,"syntology":null},{"url":null,"slug":"mlca-avsr-multi-layer-cross-attention-fusion","title":"MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition","date":"2024-01-07","arxiv_id":"2401.03424","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucinations-in-neural-automatic-speech","title":"Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models","date":"2024-01-03","arxiv_id":"2401.01572","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-probing-contact-center-large-language","title":"Towards Probing Contact Center Large Language Models","date":"2023-12-26","arxiv_id":"2312.15922","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-data-augmentation-in-bias","title":"Exploring data augmentation in bias mitigation against non-native-accented speech","date":"2023-12-24","arxiv_id":"2312.15499","repositories_listed":0,"syntology":null},{"url":null,"slug":"blstm-based-confidence-estimation-for-end-to","title":"BLSTM-Based Confidence Estimation for End-to-End Speech Recognition","date":"2023-12-22","arxiv_id":"2312.14609","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-attention-merging-for-improved","title":"Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification","date":"2023-12-22","arxiv_id":"2312.14378","repositories_listed":0,"syntology":null},{"url":null,"slug":"lattice-rescoring-based-on-large-ensemble-of","title":"Lattice Rescoring Based on Large Ensemble of Complementary Neural Language Models","date":"2023-12-20","arxiv_id":"2312.12764","repositories_listed":0,"syntology":null},{"url":null,"slug":"spokesbiz-an-open-corpus-of-conversational","title":"SpokesBiz -- an Open Corpus of Conversational Polish","date":"2023-12-19","arxiv_id":"2312.12364","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformer-based-speech-recognition-on-extreme","title":"Conformer-Based Speech Recognition On Extreme Edge-Computing Devices","date":"2023-12-16","arxiv_id":"2312.10359","repositories_listed":0,"syntology":null},{"url":null,"slug":"oava-the-open-audio-visual-archives","title":"OAVA: the open audio-visual archives aggregator","date":"2023-12-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"litevsr-efficient-visual-speech-recognition","title":"LiteVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data","date":"2023-12-15","arxiv_id":"2312.09727","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastinject-injecting-unpaired-text-data-into","title":"FastInject: Injecting Unpaired Text Data into CTC-based ASR training","date":"2023-12-14","arxiv_id":"2312.09100","repositories_listed":0,"syntology":null},{"url":null,"slug":"usm-lite-quantization-and-sparsity-aware-fine","title":"USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models","date":"2023-12-13","arxiv_id":"2312.08553","repositories_listed":0,"syntology":null},{"url":null,"slug":"creating-spoken-dialog-systems-in-ultra-low","title":"Creating Spoken Dialog Systems in Ultra-Low Resourced Settings","date":"2023-12-11","arxiv_id":"2312.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integration-of-pre-trained-speech-and","title":"Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition","date":"2023-12-06","arxiv_id":"2312.03668","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-to-text-translation-a","title":"End-to-End Speech-to-Text Translation: A Survey","date":"2023-12-02","arxiv_id":"2312.01053","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-joint-rich-and-normalized-asr-with","title":"End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data","date":"2023-11-29","arxiv_id":"2311.17741","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-does-end-to-end-speech-recognition","title":"How does end-to-end speech recognition training impact speech enhancement artifacts?","date":"2023-11-20","arxiv_id":"2311.11599","repositories_listed":0,"syntology":null},{"url":null,"slug":"label-synchronous-neural-transducer-for","title":"Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition","date":"2023-11-19","arxiv_id":"2311.11353","repositories_listed":0,"syntology":null},{"url":null,"slug":"ml-lmcl-mutual-learning-and-large-margin","title":"ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for Improving ASR Robustness in Spoken Language Understanding","date":"2023-11-19","arxiv_id":"2311.11375","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-large-scale-deep-biasing-with","title":"Improving Large-scale Deep Biasing with Phoneme Features and Text-only Data in Streaming Transducer","date":"2023-11-15","arxiv_id":"2311.08966","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-channel-conversational-speaker","title":"Multi-channel Conversational Speaker Separation via Neural Diarization","date":"2023-11-15","arxiv_id":"2311.08630","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieve-and-copy-scaling-asr-personalization","title":"Retrieve and Copy: Scaling ASR Personalization to Large Catalogs","date":"2023-11-14","arxiv_id":"2311.08402","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effectiveness-of-asr-representations","title":"On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition","date":"2023-11-13","arxiv_id":"2311.07093","repositories_listed":0,"syntology":null},{"url":null,"slug":"1-step-speech-processing-and-understanding","title":"1SPU: 1-step Speech Processing Unit","date":"2023-11-08","arxiv_id":"2311.04753","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosmic-data-efficient-instruction-tuning-for","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","date":"2023-11-03","arxiv_id":"2311.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"server-side-rescoring-of-spoken-entity","title":"Server-side Rescoring of Spoken Entity-centric Knowledge Queries for Virtual Assistants","date":"2023-11-02","arxiv_id":"2311.01398","repositories_listed":0,"syntology":null},{"url":null,"slug":"rir-sf-room-impulse-response-based-spatial","title":"RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios","date":"2023-10-31","arxiv_id":"2311.00146","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-timestamp-information-for","title":"Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation","date":"2023-10-23","arxiv_id":"2310.14806","repositories_listed":0,"syntology":null},{"url":null,"slug":"conversational-speech-recognition-by-learning-1","title":"Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation","date":"2023-10-22","arxiv_id":"2310.14278","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligibility-prediction-with-a-pretrained","title":"Intelligibility prediction with a pretrained noise-robust automatic speech recognition model","date":"2023-10-20","arxiv_id":"2310.19817","repositories_listed":0,"syntology":null},{"url":null,"slug":"unintended-memorization-in-large-asr-models","title":"Unintended Memorization in Large ASR Models, and How to Mitigate It","date":"2023-10-18","arxiv_id":"2310.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-accent-dialect-identification-and","title":"Advanced accent/dialect identification and accentedness assessment with multi-embedding models and automatic speech recognition","date":"2023-10-17","arxiv_id":"2310.11004","repositories_listed":0,"syntology":null},{"url":null,"slug":"correction-focused-language-model-training","title":"Correction Focused Language Model Training for Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11003","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-error-correction-for-code","title":"Generative error correction for code-switching speech recognition using large language models","date":"2023-10-17","arxiv_id":"2310.13013","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-shallow-fusion-of-backward-language","title":"Iterative Shallow Fusion of Backward Language Model for End-to-End Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11010","repositories_listed":0,"syntology":null},{"url":null,"slug":"voxarabica-a-robust-dialect-aware-arabic","title":"VoxArabica: A Robust Dialect-Aware Arabic Speech Recognition System","date":"2023-10-17","arxiv_id":"2310.11069","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-speech-abnormalities-with-a","title":"Detecting Speech Abnormalities with a Perceiver-based Sequence Classifier that Leverages a Universal Speech Model","date":"2023-10-16","arxiv_id":"2310.13010","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-contextual-recognition-in-automatic","title":"Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring","date":"2023-10-14","arxiv_id":"2310.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-word-error-rate-estimation-using-self","title":"Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text","date":"2023-10-12","arxiv_id":"2310.08225","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relevance-of-phoneme-duration","title":"On the Relevance of Phoneme Duration Variability of Synthesized Training Data for Automatic Speech Recognition","date":"2023-10-12","arxiv_id":"2310.08132","repositories_listed":0,"syntology":null},{"url":null,"slug":"acoustic-model-fusion-for-end-to-end-speech","title":"Acoustic Model Fusion for End-to-end Speech Recognition","date":"2023-10-10","arxiv_id":"2310.07062","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-speech-recognition-rescoring","title":"Discriminative Speech Recognition Rescoring with Pre-trained Language Models","date":"2023-10-10","arxiv_id":"2310.06248","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-end-to-end-speech-processing-by","title":"Improving End-to-End Speech Processing by Efficient Text Data Utilization with Latent Synthesis","date":"2023-10-09","arxiv_id":"2310.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"spike-triggered-contextual-biasing-for-end-to","title":"Spike-Triggered Contextual Biasing for End-to-End Mandarin Speech Recognition","date":"2023-10-07","arxiv_id":"2310.04657","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-privacy-preserving-method-using-secret-key","title":"A privacy-preserving method using secret key for convolutional neural network-based speech classification","date":"2023-10-06","arxiv_id":"2310.04035","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integrated-algorithm-for-robust-and","title":"An Integrated Algorithm for Robust and Imperceptible Audio Adversarial Examples","date":"2023-10-05","arxiv_id":"2310.03349","repositories_listed":0,"syntology":null},{"url":"/paper/universlu-universal-spoken-language","slug":"universlu-universal-spoken-language","title":"UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions","date":"2023-10-04","arxiv_id":"2310.02973","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-model-to-rule-them-all-towards-end-to-end","title":"One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition","date":"2023-10-02","arxiv_id":"2310.01688","repositories_listed":0,"syntology":null},{"url":null,"slug":"afrispeech-200-pan-african-accented-speech","title":"AfriSpeech-200: Pan-African Accented Speech Dataset for Clinical and General Domain ASR","date":"2023-09-30","arxiv_id":"2310.00274","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-cpl-continuous-pseudo-labeling-for-audio","title":"AV-CPL: Continuous Pseudo-Labeling for Audio-Visual Speech Recognition","date":"2023-09-29","arxiv_id":"2309.17395","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-with-the-knuth-morris","title":"Contextual Biasing with the Knuth-Morris-Pratt Matching Algorithm","date":"2023-09-29","arxiv_id":"2310.00178","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-code-switching-speech-recognition","title":"Enhancing Code-switching Speech Recognition with Interactive Language Biases","date":"2023-09-29","arxiv_id":"2309.16953","repositories_listed":0,"syntology":null},{"url":"/paper/federated-learning-with-differential-privacy","slug":"federated-learning-with-differential-privacy","title":"Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers and Gradient Clipping","date":"2023-09-29","arxiv_id":"2310.00098","repositories_listed":0,"syntology":{"n":11,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":11,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/federated-learning-with-differential-privacy#ran","syntology_url":"https://syntology.ai/paper/2310.00098","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.00098"}},"official":null}}],"record_sha256":"6072d2728473661b11e3971b68bbf3886035c70f2b0a0d77273454cf0a0c39b8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}