{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition-2/papers/13","list_of":"/task/automatic-speech-recognition-2","task":"Automatic Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":32,"rows_per_page":100,"rows":[1201,1300],"of":3174,"counts":{"archive_papers_tagged":3174,"with_a_code_link":677,"where_syntology_ran_a_sample":79,"not_listed_spam_title":0,"listed":3174,"listed_where_code_ran":79,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":62,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":62,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition-2","prev":"/task/automatic-speech-recognition-2/papers/12","next":"/task/automatic-speech-recognition-2/papers/14","papers":[{"url":null,"slug":"on-speech-pre-emphasis-as-a-simple-and","title":"On Speech Pre-emphasis as a Simple and Inexpensive Method to Boost Speech Enhancement","date":"2024-01-17","arxiv_id":"2401.09315","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-asr-contextual-biasing-with-guided","title":"Improving ASR Contextual Biasing with Guided Attention","date":"2024-01-16","arxiv_id":"2401.08835","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-input-multi-output-target-speaker-voice","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","date":"2024-01-16","arxiv_id":"2401.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"notsofar-1-challenge-new-datasets-baseline","title":"NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription","date":"2024-01-16","arxiv_id":"2401.08887","repositories_listed":0,"syntology":null},{"url":null,"slug":"semascore-a-new-evaluation-metric-for","title":"SeMaScore : a new evaluation metric for automatic speech recognition tasks","date":"2024-01-15","arxiv_id":"2401.07506","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptformer-prompted-conformer-transducer","title":"Promptformer: Prompted Conformer Transducer for ASR","date":"2024-01-14","arxiv_id":"2401.07360","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-unsupervised-and-supervised-training-1","title":"Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization","date":"2024-01-13","arxiv_id":"2401.06980","repositories_listed":0,"syntology":null},{"url":null,"slug":"transcending-controlled-environments","title":"Transcending Controlled Environments Assessing the Transferability of ASRRobust NLU Models to Real-World Applications","date":"2024-01-12","arxiv_id":"2401.09354","repositories_listed":0,"syntology":null},{"url":null,"slug":"xls-r-deep-learning-model-for-multilingual","title":"XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese","date":"2024-01-12","arxiv_id":"2401.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-hindi-to-english-speech-conversion","title":"End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2","date":"2024-01-11","arxiv_id":"2401.06183","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucorrect-an-unsupervised-framework-for","title":"UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction","date":"2024-01-11","arxiv_id":"2401.05689","repositories_listed":0,"syntology":null},{"url":null,"slug":"useful-blunders-can-automated-speech","title":"Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?","date":"2024-01-10","arxiv_id":"2401.05551","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuously-learning-new-words-in-automatic","title":"Continuously Learning New Words in Automatic Speech Recognition","date":"2024-01-09","arxiv_id":"2401.04482","repositories_listed":0,"syntology":null},{"url":null,"slug":"bs-plcnet-band-split-packet-loss-concealment","title":"BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators","date":"2024-01-08","arxiv_id":"2401.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-evaluation-of-speech-content","title":"Exploratory Evaluation of Speech Content Masking","date":"2024-01-08","arxiv_id":"2401.03936","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-precision-voice-search-query-correction","title":"High-precision Voice Search Query Correction via Retrievable Speech-text Embedings","date":"2024-01-08","arxiv_id":"2401.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"lupet-incorporating-hierarchical-information","title":"LUPET: Incorporating Hierarchical Information Path into Multilingual ASR","date":"2024-01-08","arxiv_id":"2401.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"icmc-asr-the-icassp-2024-in-car-multi-channel","title":"ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge","date":"2024-01-07","arxiv_id":"2401.03473","repositories_listed":0,"syntology":null},{"url":null,"slug":"mlca-avsr-multi-layer-cross-attention-fusion","title":"MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition","date":"2024-01-07","arxiv_id":"2401.03424","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucinations-in-neural-automatic-speech","title":"Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models","date":"2024-01-03","arxiv_id":"2401.01572","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-nus-hlt-system-for-icassp2024-icmc-asr","title":"The NUS-HLT System for ICASSP2024 ICMC-ASR Grand Challenge","date":"2023-12-26","arxiv_id":"2312.16002","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-probing-contact-center-large-language","title":"Towards Probing Contact Center Large Language Models","date":"2023-12-26","arxiv_id":"2312.15922","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-data-augmentation-in-bias","title":"Exploring data augmentation in bias mitigation against non-native-accented speech","date":"2023-12-24","arxiv_id":"2312.15499","repositories_listed":0,"syntology":null},{"url":null,"slug":"blstm-based-confidence-estimation-for-end-to","title":"BLSTM-Based Confidence Estimation for End-to-End Speech Recognition","date":"2023-12-22","arxiv_id":"2312.14609","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-attention-merging-for-improved","title":"Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification","date":"2023-12-22","arxiv_id":"2312.14378","repositories_listed":0,"syntology":null},{"url":null,"slug":"lattice-rescoring-based-on-large-ensemble-of","title":"Lattice Rescoring Based on Large Ensemble of Complementary Neural Language Models","date":"2023-12-20","arxiv_id":"2312.12764","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-speech-audiometry-can-it-work-using","title":"Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?","date":"2023-12-19","arxiv_id":"2312.12269","repositories_listed":0,"syntology":null},{"url":null,"slug":"spokesbiz-an-open-corpus-of-conversational","title":"SpokesBiz -- an Open Corpus of Conversational Polish","date":"2023-12-19","arxiv_id":"2312.12364","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-oriented-approaches-for-self","title":"Efficiency-oriented approaches for self-supervised speech representation learning","date":"2023-12-18","arxiv_id":"2312.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformer-based-speech-recognition-on-extreme","title":"Conformer-Based Speech Recognition On Extreme Edge-Computing Devices","date":"2023-12-16","arxiv_id":"2312.10359","repositories_listed":0,"syntology":null},{"url":null,"slug":"oava-the-open-audio-visual-archives","title":"OAVA: the open audio-visual archives aggregator","date":"2023-12-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-context-aware-fine-tuning-of-self","title":"Generative Context-aware Fine-tuning of Self-supervised Speech Models","date":"2023-12-15","arxiv_id":"2312.09895","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-language-id-to-calculate","title":"Leveraging Language ID to Calculate Intermediate CTC Loss for Enhanced Code-Switching Speech Recognition","date":"2023-12-15","arxiv_id":"2312.09583","repositories_listed":0,"syntology":null},{"url":null,"slug":"litevsr-efficient-visual-speech-recognition","title":"LiteVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data","date":"2023-12-15","arxiv_id":"2312.09727","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-fine-tuning-of-audio-only-asr","title":"Audio-visual fine-tuning of audio-only ASR models","date":"2023-12-14","arxiv_id":"2312.09369","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastinject-injecting-unpaired-text-data-into","title":"FastInject: Injecting Unpaired Text Data into CTC-based ASR training","date":"2023-12-14","arxiv_id":"2312.09100","repositories_listed":0,"syntology":null},{"url":null,"slug":"phaseperturbation-speech-data-augmentation","title":"PhasePerturbation: Speech Data Augmentation via Phase Perturbation for Automatic Speech Recognition","date":"2023-12-13","arxiv_id":"2312.08571","repositories_listed":0,"syntology":null},{"url":null,"slug":"usm-lite-quantization-and-sparsity-aware-fine","title":"USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models","date":"2023-12-13","arxiv_id":"2312.08553","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-adaptive-pre-training-of","title":"Self-supervised Adaptive Pre-training of Multilingual Speech Models for Language and Dialect Identification","date":"2023-12-12","arxiv_id":"2312.07338","repositories_listed":0,"syntology":null},{"url":null,"slug":"creating-spoken-dialog-systems-in-ultra-low","title":"Creating Spoken Dialog Systems in Ultra-Low Resourced Settings","date":"2023-12-11","arxiv_id":"2312.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integration-of-pre-trained-speech-and","title":"Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition","date":"2023-12-06","arxiv_id":"2312.03668","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-data-and-resource-efficient-device","title":"Multimodal Data and Resource Efficient Device-Directed Speech Detection with Large Foundation Models","date":"2023-12-06","arxiv_id":"2312.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-to-text-translation-a","title":"End-to-End Speech-to-Text Translation: A Survey","date":"2023-12-02","arxiv_id":"2312.01053","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-joint-rich-and-normalized-asr-with","title":"End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data","date":"2023-11-29","arxiv_id":"2311.17741","repositories_listed":0,"syntology":null},{"url":null,"slug":"weak-alignment-supervision-from-hybrid-model","title":"Weak Alignment Supervision from Hybrid Model Improves End-to-end ASR","date":"2023-11-24","arxiv_id":"2311.14835","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-random-sampling-a-theoretical-and","title":"Soft Random Sampling: A Theoretical and Empirical Analysis","date":"2023-11-21","arxiv_id":"2311.12727","repositories_listed":0,"syntology":null},{"url":null,"slug":"app-for-resume-based-job-matching-with-speech","title":"App for Resume-Based Job Matching with Speech Interviews and Grammar Analysis: A Review","date":"2023-11-20","arxiv_id":"2311.14729","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-does-end-to-end-speech-recognition","title":"How does end-to-end speech recognition training impact speech enhancement artifacts?","date":"2023-11-20","arxiv_id":"2311.11599","repositories_listed":0,"syntology":null},{"url":null,"slug":"label-synchronous-neural-transducer-for","title":"Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition","date":"2023-11-19","arxiv_id":"2311.11353","repositories_listed":0,"syntology":null},{"url":null,"slug":"ml-lmcl-mutual-learning-and-large-margin","title":"ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for Improving ASR Robustness in Spoken Language Understanding","date":"2023-11-19","arxiv_id":"2311.11375","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-large-scale-deep-biasing-with","title":"Improving Large-scale Deep Biasing with Phoneme Features and Text-only Data in Streaming Transducer","date":"2023-11-15","arxiv_id":"2311.08966","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-channel-conversational-speaker","title":"Multi-channel Conversational Speaker Separation via Neural Diarization","date":"2023-11-15","arxiv_id":"2311.08630","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieve-and-copy-scaling-asr-personalization","title":"Retrieve and Copy: Scaling ASR Personalization to Large Catalogs","date":"2023-11-14","arxiv_id":"2311.08402","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effectiveness-of-asr-representations","title":"On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition","date":"2023-11-13","arxiv_id":"2311.07093","repositories_listed":0,"syntology":null},{"url":null,"slug":"1-step-speech-processing-and-understanding","title":"1SPU: 1-step Speech Processing Unit","date":"2023-11-08","arxiv_id":"2311.04753","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-convergence-model-in-bengali","title":"Fine-tuning convergence model in Bengali speech recognition","date":"2023-11-07","arxiv_id":"2311.04122","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosmic-data-efficient-instruction-tuning-for","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","date":"2023-11-03","arxiv_id":"2311.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"server-side-rescoring-of-spoken-entity","title":"Server-side Rescoring of Spoken Entity-centric Knowledge Queries for Virtual Assistants","date":"2023-11-02","arxiv_id":"2311.01398","repositories_listed":0,"syntology":null},{"url":null,"slug":"rir-sf-room-impulse-response-based-spatial","title":"RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios","date":"2023-10-31","arxiv_id":"2311.00146","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-language-models-for-specialized","title":"Combining Language Models For Specialized Domains: A Colorful Approach","date":"2023-10-30","arxiv_id":"2310.19708","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialect-adaptation-and-data-augmentation-for","title":"Dialect Adaptation and Data Augmentation for Low-Resource ASR: TalTech Systems for the MADASR 2023 Challenge","date":"2023-10-26","arxiv_id":"2310.17448","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-timestamp-information-for","title":"Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation","date":"2023-10-23","arxiv_id":"2310.14806","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-dropout-for-multimodal-device","title":"Modality Dropout for Multimodal Device Directed Speech Detection using Verbal and Non-Verbal Features","date":"2023-10-23","arxiv_id":"2310.15261","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-the-dialect-gap-and-its","title":"Quantifying the Dialect Gap and its Correlates Across Languages","date":"2023-10-23","arxiv_id":"2310.15135","repositories_listed":0,"syntology":null},{"url":null,"slug":"conversational-speech-recognition-by-learning-1","title":"Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation","date":"2023-10-22","arxiv_id":"2310.14278","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligibility-prediction-with-a-pretrained","title":"Intelligibility prediction with a pretrained noise-robust automatic speech recognition model","date":"2023-10-20","arxiv_id":"2310.19817","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-chime-7-challenge-system-description-and","title":"The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System","date":"2023-10-18","arxiv_id":"2310.12378","repositories_listed":0,"syntology":null},{"url":null,"slug":"unintended-memorization-in-large-asr-models","title":"Unintended Memorization in Large ASR Models, and How to Mitigate It","date":"2023-10-18","arxiv_id":"2310.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-accent-dialect-identification-and","title":"Advanced accent/dialect identification and accentedness assessment with multi-embedding models and automatic speech recognition","date":"2023-10-17","arxiv_id":"2310.11004","repositories_listed":0,"syntology":null},{"url":null,"slug":"correction-focused-language-model-training","title":"Correction Focused Language Model Training for Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11003","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-error-correction-for-code","title":"Generative error correction for code-switching speech recognition using large language models","date":"2023-10-17","arxiv_id":"2310.13013","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-shallow-fusion-of-backward-language","title":"Iterative Shallow Fusion of Backward Language Model for End-to-End Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11010","repositories_listed":0,"syntology":null},{"url":null,"slug":"voxarabica-a-robust-dialect-aware-arabic","title":"VoxArabica: A Robust Dialect-Aware Arabic Speech Recognition System","date":"2023-10-17","arxiv_id":"2310.11069","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-speech-abnormalities-with-a","title":"Detecting Speech Abnormalities with a Perceiver-based Sequence Classifier that Leverages a Universal Speech Model","date":"2023-10-16","arxiv_id":"2310.13010","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-multichannel-speaker-attributed","title":"End-to-end Multichannel Speaker-Attributed ASR: Speaker Guided Decoder and Input Feature Analysis","date":"2023-10-16","arxiv_id":"2310.10106","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalization-of-ctc-based-end-to-end","title":"Personalization of CTC-based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization","date":"2023-10-16","arxiv_id":"2310.09988","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-vocabulary-spontaneous-speech","title":"Large Vocabulary Spontaneous Speech Recognition for Tigrigna","date":"2023-10-15","arxiv_id":"2402.04254","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-contextual-recognition-in-automatic","title":"Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring","date":"2023-10-14","arxiv_id":"2310.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-word-error-rate-estimation-using-self","title":"Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text","date":"2023-10-12","arxiv_id":"2310.08225","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relevance-of-phoneme-duration","title":"On the Relevance of Phoneme Duration Variability of Synthesized Training Data for Automatic Speech Recognition","date":"2023-10-12","arxiv_id":"2310.08132","repositories_listed":0,"syntology":null},{"url":null,"slug":"acoustic-model-fusion-for-end-to-end-speech","title":"Acoustic Model Fusion for End-to-end Speech Recognition","date":"2023-10-10","arxiv_id":"2310.07062","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-speech-recognition-rescoring","title":"Discriminative Speech Recognition Rescoring with Pre-trained Language Models","date":"2023-10-10","arxiv_id":"2310.06248","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-end-to-end-speech-processing-by","title":"Improving End-to-End Speech Processing by Efficient Text Data Utilization with Latent Synthesis","date":"2023-10-09","arxiv_id":"2310.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"spike-triggered-contextual-biasing-for-end-to","title":"Spike-Triggered Contextual Biasing for End-to-End Mandarin Speech Recognition","date":"2023-10-07","arxiv_id":"2310.04657","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-privacy-preserving-method-using-secret-key","title":"A privacy-preserving method using secret key for convolutional neural network-based speech classification","date":"2023-10-06","arxiv_id":"2310.04035","repositories_listed":0,"syntology":null},{"url":null,"slug":"hubertopic-enhancing-semantic-representation","title":"HuBERTopic: Enhancing Semantic Representation of HuBERT through Self-supervision Utilizing Topic Model","date":"2023-10-06","arxiv_id":"2310.03975","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integrated-algorithm-for-robust-and","title":"An Integrated Algorithm for Robust and Imperceptible Audio Adversarial Examples","date":"2023-10-05","arxiv_id":"2310.03349","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-language-model-pruning-for-automatic","title":"Neural Language Model Pruning for Automatic Speech Recognition","date":"2023-10-05","arxiv_id":"2310.03424","repositories_listed":0,"syntology":null},{"url":"/paper/universlu-universal-spoken-language","slug":"universlu-universal-spoken-language","title":"UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions","date":"2023-10-04","arxiv_id":"2310.02973","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-model-to-rule-them-all-towards-end-to-end","title":"One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition","date":"2023-10-02","arxiv_id":"2310.01688","repositories_listed":0,"syntology":null},{"url":null,"slug":"afrispeech-200-pan-african-accented-speech","title":"AfriSpeech-200: Pan-African Accented Speech Dataset for Clinical and General Domain ASR","date":"2023-09-30","arxiv_id":"2310.00274","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-cpl-continuous-pseudo-labeling-for-audio","title":"AV-CPL: Continuous Pseudo-Labeling for Audio-Visual Speech Recognition","date":"2023-09-29","arxiv_id":"2309.17395","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-with-the-knuth-morris","title":"Contextual Biasing with the Knuth-Morris-Pratt Matching Algorithm","date":"2023-09-29","arxiv_id":"2310.00178","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-code-switching-speech-recognition","title":"Enhancing Code-switching Speech Recognition with Interactive Language Biases","date":"2023-09-29","arxiv_id":"2309.16953","repositories_listed":0,"syntology":null},{"url":"/paper/federated-learning-with-differential-privacy","slug":"federated-learning-with-differential-privacy","title":"Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers and Gradient Clipping","date":"2023-09-29","arxiv_id":"2310.00098","repositories_listed":0,"syntology":{"n":11,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":11,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/federated-learning-with-differential-privacy#ran","syntology_url":"https://syntology.ai/paper/2310.00098","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.00098"}},"official":null}},{"url":null,"slug":"sshr-leveraging-self-supervised-hierarchical","title":"SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition","date":"2023-09-29","arxiv_id":"2309.16937","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gift-of-feedback-improving-asr-model","title":"The Gift of Feedback: Improving ASR Model Quality by Learning from User Corrections through Federated Learning","date":"2023-09-29","arxiv_id":"2310.00141","repositories_listed":0,"syntology":null},{"url":null,"slug":"wiki-en-asr-adapt-large-scale-synthetic","title":"Wiki-En-ASR-Adapt: Large-scale synthetic dataset for English ASR Customization","date":"2023-09-29","arxiv_id":"2309.17267","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-cross-modality-knowledge","title":"Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-based ASR","date":"2023-09-28","arxiv_id":"2309.16093","repositories_listed":0,"syntology":null},{"url":null,"slug":"pp-met-a-real-world-personalized-prompt-based","title":"PP-MeT: a Real-world Personalized Prompt based Meeting Transcription System","date":"2023-09-28","arxiv_id":"2309.16247","repositories_listed":0,"syntology":null}],"record_sha256":"554b607e4fa487d69bb0b410cda4fc2ceedb2b32c8558c91d5a14d139eaf8740","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}