{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition/papers/12","list_of":"/task/automatic-speech-recognition","task":"Automatic Speech Recognition (ASR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":31,"rows_per_page":100,"rows":[1101,1200],"of":3012,"counts":{"archive_papers_tagged":3012,"with_a_code_link":622,"where_syntology_ran_a_sample":77,"not_listed_spam_title":0,"listed":3012,"listed_where_code_ran":77,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":13,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":13,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition","prev":"/task/automatic-speech-recognition/papers/11","next":"/task/automatic-speech-recognition/papers/13","papers":[{"url":null,"slug":"sshr-leveraging-self-supervised-hierarchical","title":"SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition","date":"2023-09-29","arxiv_id":"2309.16937","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gift-of-feedback-improving-asr-model","title":"The Gift of Feedback: Improving ASR Model Quality by Learning from User Corrections through Federated Learning","date":"2023-09-29","arxiv_id":"2310.00141","repositories_listed":0,"syntology":null},{"url":null,"slug":"wiki-en-asr-adapt-large-scale-synthetic","title":"Wiki-En-ASR-Adapt: Large-scale synthetic dataset for English ASR Customization","date":"2023-09-29","arxiv_id":"2309.17267","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-cross-modality-knowledge","title":"Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-based ASR","date":"2023-09-28","arxiv_id":"2309.16093","repositories_listed":0,"syntology":null},{"url":null,"slug":"segment-level-vectorized-beam-search-based-on","title":"Segment-Level Vectorized Beam Search Based on Partially Autoregressive Inference","date":"2023-09-26","arxiv_id":"2309.14922","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-speech-encoder-and-large-language","title":"Connecting Speech Encoder and Large Language Model for ASR","date":"2023-09-25","arxiv_id":"2309.13963","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-alignment-with-optimal-transport","title":"Cross-modal Alignment with Optimal Transport for CTC-based ASR","date":"2023-09-24","arxiv_id":"2309.13650","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-with-frequency-domain-auto","title":"Speech enhancement with frequency domain auto-regressive modeling","date":"2023-09-24","arxiv_id":"2309.13537","repositories_listed":0,"syntology":null},{"url":null,"slug":"affect-recognition-in-conversations-using","title":"Affect Recognition in Conversations Using Large Language Models","date":"2023-09-22","arxiv_id":"2309.12881","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-asr-pathways-an-adaptive-masking","title":"Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model","date":"2023-09-22","arxiv_id":"2309.13018","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-of-smoothness-induced-by","title":"Importance of Smoothness Induced by Optimizers in FL4ASR: Towards Understanding Federated Learning for End-to-End ASR","date":"2023-09-22","arxiv_id":"2309.13102","repositories_listed":0,"syntology":null},{"url":null,"slug":"massive-end-to-end-models-for-short-search","title":"Massive End-to-end Models for Short Search Queries","date":"2023-09-22","arxiv_id":"2309.12963","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsely-shared-lora-on-whisper-for-child","title":"Sparsely Shared LoRA on Whisper for Child Speech Recognition","date":"2023-09-21","arxiv_id":"2309.11756","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-data-collection-and-unsupervised","title":"Leveraging Data Collection and Unsupervised Learning for Code-switched Tunisian Arabic Automatic Speech Recognition","date":"2023-09-20","arxiv_id":"2309.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-speech-enhancement-for-low-resource","title":"Exploring Speech Enhancement for Low-resource Speech Synthesis","date":"2023-09-19","arxiv_id":"2309.10795","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-ultrasound-tongue-images-for-1","title":"Incorporating Ultrasound Tongue Images for Audio-Visual Speech Enhancement","date":"2023-09-19","arxiv_id":"2309.10455","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-autoregressive-streaming-asr-with-label","title":"Semi-Autoregressive Streaming ASR With Label Context","date":"2023-09-19","arxiv_id":"2309.10926","repositories_listed":0,"syntology":null},{"url":null,"slug":"cb-whisper-contextual-biasing-whisper-using","title":"A Multitask Training Approach to Enhance Whisper with Contextual Biasing and Open-Vocabulary Keyword Spotting","date":"2023-09-18","arxiv_id":"2309.09552","repositories_listed":0,"syntology":null},{"url":null,"slug":"corpus-synthesis-for-zero-shot-asr-domain","title":"Corpus Synthesis for Zero-shot ASR domain Adaptation using Large Language Models","date":"2023-09-18","arxiv_id":"2309.10707","repositories_listed":0,"syntology":null},{"url":null,"slug":"htec-human-transcription-error-correction","title":"HTEC: Human Transcription Error Correction","date":"2023-09-18","arxiv_id":"2309.10089","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-following-speech-recognition","title":"Instruction-Following Speech Recognition","date":"2023-09-18","arxiv_id":"2309.09843","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-end-to-end-asr-architectures","title":"Investigating End-to-End ASR Architectures for Long Form Audio Transcription","date":"2023-09-18","arxiv_id":"2309.09950","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-end-to-end-multilingual-phoneme","title":"Boosting End-to-End Multilingual Phoneme Recognition through Exploiting Universal Speech Attributes Constraints","date":"2023-09-16","arxiv_id":"2309.08828","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoder-only-architecture-for-speech","title":"Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation","date":"2023-09-16","arxiv_id":"2309.08876","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-for-african","title":"Improving Speech Recognition for African American English With Audio Classification","date":"2023-09-16","arxiv_id":"2309.09996","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-encoder-supporting-continuous-speech","title":"Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription","date":"2023-09-15","arxiv_id":"2309.08454","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-sot-fnt-streaming-multi-talker-asr-with","title":"t-SOT FNT: Streaming Multi-talker ASR with Text-only Domain Adaptation Capability","date":"2023-09-15","arxiv_id":"2309.08131","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-word-level-end-to-end-neural-speaker","title":"Towards Word-Level End-to-End Neural Speaker Diarization with Auxiliary Network","date":"2023-09-15","arxiv_id":"2309.08489","repositories_listed":0,"syntology":null},{"url":null,"slug":"echotune-a-modular-extractor-leveraging-the","title":"Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks","date":"2023-09-14","arxiv_id":"2309.07765","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-whisper-perform-speech-based-in-context","title":"Can Whisper perform speech-based in-context learning?","date":"2023-09-13","arxiv_id":"2309.07081","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-child-vocalization-classification","title":"Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis","date":"2023-09-13","arxiv_id":"2309.07287","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-keyword-spotting-with","title":"Open-vocabulary Keyword-spotting with Adaptive Instance Normalization","date":"2023-09-13","arxiv_id":"2309.08561","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-robustness-of-neural-inverse-text","title":"Improving Robustness of Neural Inverse Text Normalization via Data-Augmentation, Semi-Supervised Learning, and Post-Aligning Method","date":"2023-09-12","arxiv_id":"2309.08626","repositories_listed":0,"syntology":null},{"url":null,"slug":"kid-whisper-towards-bridging-the-performance","title":"Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults","date":"2023-09-12","arxiv_id":"2309.07927","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-large-language-models-for","title":"Leveraging Large Language Models for Exploiting ASR Uncertainty","date":"2023-09-09","arxiv_id":"2309.04842","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-representation-transfer-from-large","title":"Multiple Representation Transfer from Large Language Models to End-to-End ASR Systems","date":"2023-09-07","arxiv_id":"2309.04031","repositories_listed":0,"syntology":null},{"url":null,"slug":"bring-the-noise-introducing-noise-robustness","title":"Bring the Noise: Introducing Noise Robustness to Pretrained Automatic Speech Recognition","date":"2023-09-05","arxiv_id":"2309.02145","repositories_listed":0,"syntology":null},{"url":null,"slug":"todm-train-once-deploy-many-efficient","title":"TODM: Train Once Deploy Many Efficient Supernet-Based RNN-T Compression For On-device ASR Models","date":"2023-09-05","arxiv_id":"2309.01947","repositories_listed":0,"syntology":null},{"url":null,"slug":"avatar-robust-voice-search-engine-leveraging","title":"AVATAR: Robust Voice Search Engine Leveraging Autoregressive Document Retrieval and Contrastive Learning","date":"2023-09-04","arxiv_id":"2309.01395","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-only-domain-adaptation-for-end-to-end-1","title":"Text-Only Domain Adaptation for End-to-End Speech Recognition through Down-Sampling Acoustic Representation","date":"2023-09-04","arxiv_id":"2309.02459","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-of-named-entities-with","title":"Contextual Biasing of Named-Entities with Large Language Models","date":"2023-09-01","arxiv_id":"2309.00723","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpsp-learning-speech-concepts-from-phoneme","title":"Learning Speech Representation From Contrastive Token-Acoustic Pretraining","date":"2023-09-01","arxiv_id":"2309.00424","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-from-non-streaming-to","title":"Knowledge Distillation from Non-streaming to Streaming ASR Encoder using Auxiliary Non-streaming Layer","date":"2023-08-31","arxiv_id":"2308.16415","repositories_listed":0,"syntology":null},{"url":null,"slug":"aster-automatic-speech-recognition-system","title":"ASTER: Automatic Speech Recognition System Accessibility Testing for Stutterers","date":"2023-08-30","arxiv_id":"2308.15742","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-active-learning-optimizing","title":"Unsupervised Active Learning: Optimizing Labeling Cost-Effectiveness for Automatic Speech Recognition","date":"2023-08-28","arxiv_id":"2308.14814","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupled-structure-for-improved-adaptability","title":"Decoupled Structure for Improved Adaptability of End-to-End Models","date":"2023-08-25","arxiv_id":"2308.13345","repositories_listed":0,"syntology":null},{"url":null,"slug":"convoifilter-a-case-study-of-doing-cocktail","title":"Convoifilter: A case study of doing cocktail party speech recognition","date":"2023-08-22","arxiv_id":"2308.11380","repositories_listed":0,"syntology":null},{"url":null,"slug":"tokensplit-using-discrete-speech","title":"TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript-Conditioned Speech Separation and Recognition","date":"2023-08-21","arxiv_id":"2308.10415","repositories_listed":0,"syntology":null},{"url":null,"slug":"indonesian-automatic-speech-recognition-with","title":"Indonesian Automatic Speech Recognition with XLSR-53","date":"2023-08-20","arxiv_id":"2308.11589","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-synthesis-of-dysarthric-speech-for","title":"Accurate synthesis of Dysarthric Speech for ASR data augmentation","date":"2023-08-16","arxiv_id":"2308.08438","repositories_listed":0,"syntology":null},{"url":null,"slug":"radio2text-streaming-speech-recognition-using","title":"Radio2Text: Streaming Speech Recognition Using mmWave Radio Signals","date":"2023-08-16","arxiv_id":"2308.08125","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-ctc-aed-model-with-integrated-ctc","title":"Improving CTC-AED model with integrated-CTC and auxiliary loss regularization","date":"2023-08-15","arxiv_id":"2308.08449","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-injection-for-capitalization-and-turn","title":"Text Injection for Capitalization and Turn-Taking Prediction in Speech Models","date":"2023-08-14","arxiv_id":"2308.07395","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-text-injection-to-improve-recognition","title":"Using Text Injection to Improve Recognition of Personal Identifiers in Speech","date":"2023-08-14","arxiv_id":"2308.07393","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilingual-streaming-asr-with-grapheme-units","title":"Bilingual Streaming ASR with Grapheme units and Auxiliary Monolingual Loss","date":"2023-08-11","arxiv_id":"2308.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-self-training-approach-for-low","title":"A Novel Self-training Approach for Low-resource Speech Recognition","date":"2023-08-10","arxiv_id":"2308.05269","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-analysis-of-the-wav2vec-2-0","title":"Comparative Analysis of the wav2vec 2.0 Feature Extractor","date":"2023-08-08","arxiv_id":"2308.04286","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-chinese-asr-error-correction-with","title":"Boosting Chinese ASR Error Correction with Dynamic Error Scaling Mechanism","date":"2023-08-07","arxiv_id":"2308.03423","repositories_listed":0,"syntology":null},{"url":null,"slug":"approbivt-lead-asr-models-to-generalize","title":"ApproBiVT: Lead ASR Models to Generalize Better Using Approximated Bias-Variance Tradeoff Guided Early Stopping and Checkpoint Averaging","date":"2023-08-05","arxiv_id":"2308.02870","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-cross-modal-transformer-for-request","title":"Cascaded Cross-Modal Transformer for Request and Complaint Detection","date":"2023-07-27","arxiv_id":"2307.15097","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-device-speaker-anonymization-of-acoustic","title":"On-Device Speaker Anonymization of Acoustic Embeddings for ASR based onFlexible Location Gradient Reversal Layer","date":"2023-07-25","arxiv_id":"2307.13343","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-punctuation-restoration-with-data","title":"Boosting Punctuation Restoration with Data Generation and Reinforcement Learning","date":"2023-07-24","arxiv_id":"2307.12949","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-automatic-speech-recognition-via","title":"Robust Automatic Speech Recognition via WavAugment Guided Phoneme Adversarial Training","date":"2023-07-24","arxiv_id":"2307.12498","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-meta-learning-scheme-for-fast-accent-domain","title":"A meta learning scheme for fast accent domain expansion in Mandarin speech recognition","date":"2023-07-23","arxiv_id":"2307.12262","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-integration-of-speech","title":"Exploring the Integration of Speech Separation and Recognition with Self-Supervised Learning Representation","date":"2023-07-23","arxiv_id":"2307.12231","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-large-language-models-with-speech","title":"Prompting Large Language Models with Speech Recognition Abilities","date":"2023-07-21","arxiv_id":"2307.11795","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-adaptation-for-asr-in-low-resource","title":"Model Adaptation for ASR in low-resource Indian Languages","date":"2023-07-16","arxiv_id":"2307.07948","repositories_listed":0,"syntology":null},{"url":null,"slug":"replay-to-remember-continual-layer-specific","title":"Replay to Remember: Continual Layer-Specific Fine-tuning for German Speech Recognition","date":"2023-07-14","arxiv_id":"2307.07280","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-with-hidden-unit","title":"Representation Learning With Hidden Unit Clustering For Low Resource Speech Applications","date":"2023-07-14","arxiv_id":"2307.07325","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-integration-of-large-language","title":"Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study","date":"2023-07-13","arxiv_id":"2307.06530","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-diarization-and-asr-with-gmm","title":"Speech Diarization and ASR with GMM","date":"2023-07-11","arxiv_id":"2307.05637","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-level-serialized-output-training-for","title":"Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments","date":"2023-07-07","arxiv_id":"2307.03354","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-hybrid-ctc-attention-end-to-end","title":"Online Hybrid CTC/Attention End-to-End Automatic Speech Recognition Architecture","date":"2023-07-05","arxiv_id":"2307.02351","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-with-purpose-optimize-desired","title":"Align With Purpose: Optimize Desired Properties in CTC Models with a General Plug-and-Play Framework","date":"2023-07-04","arxiv_id":"2307.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-norwegian-automatic-speech","title":"Boosting Norwegian Automatic Speech Recognition","date":"2023-07-04","arxiv_id":"2307.01672","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-aware-audio-grounded-generative","title":"Knowledge-Aware Audio-Grounded Generative Slot Filling for Limited Annotated Data","date":"2023-07-04","arxiv_id":"2307.01764","repositories_listed":0,"syntology":null},{"url":null,"slug":"transcribing-educational-videos-using-whisper","title":"Transcribing Educational Videos Using Whisper: A preliminary study on using AI for transcribing educational videos","date":"2023-07-04","arxiv_id":"2307.03200","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-contextual-adapters-to-improve","title":"Multilingual Contextual Adapters To Improve Custom Word Recognition In Low-resource Languages","date":"2023-07-03","arxiv_id":"2307.00759","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-stop-self-supervision-accent-adaptation","title":"Don't Stop Self-Supervision: Accent Adaptation of Speech Representations via Residual Adapters","date":"2023-07-02","arxiv_id":"2307.00453","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-transducers-through-adjacent","title":"Accelerating Transducers through Adjacent Token Merging","date":"2023-06-28","arxiv_id":"2306.16009","repositories_listed":0,"syntology":null},{"url":null,"slug":"master-asr-achieving-multilingual-scalability","title":"Master-ASR: Achieving Multilingual Scalability and Low-Resource Adaptation in ASR with Modular Learning","date":"2023-06-23","arxiv_id":"2306.15686","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-chime-7-dasr-challenge-distant-meeting","title":"The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios","date":"2023-06-23","arxiv_id":"2306.13734","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-role-of-audio-in-video","title":"Exploring the Role of Audio in Video Captioning","date":"2023-06-21","arxiv_id":"2306.12559","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-self-learning-with-weak-supervision","title":"Federated Self-Learning with Weak Supervision for Speech Recognition","date":"2023-06-21","arxiv_id":"2306.12015","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-when-to-trust-which-teacher-for","title":"Learning When to Trust Which Teacher for Weakly Supervised ASR","date":"2023-06-21","arxiv_id":"2306.12012","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-encoder-for-joint-speech-separation","title":"Mixture Encoder for Joint Speech Separation and Recognition","date":"2023-06-21","arxiv_id":"2306.12173","repositories_listed":0,"syntology":null},{"url":null,"slug":"lexical-speaker-error-correction-leveraging","title":"Lexical Speaker Error Correction: Leveraging Language Models for Speaker Diarization Error Correction","date":"2023-06-15","arxiv_id":"2306.09313","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobileasr-a-resource-aware-on-device","title":"MobileASR: A resource-aware on-device learning framework for user voice personalization applications on mobile phones","date":"2023-06-15","arxiv_id":"2306.09384","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-code-switching-and-named-entity","title":"Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation","date":"2023-06-14","arxiv_id":"2306.08588","repositories_listed":0,"syntology":null},{"url":null,"slug":"dctx-conformer-dynamic-context-carry-over-for","title":"DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR","date":"2023-06-13","arxiv_id":"2306.08175","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-beamformer-exploiting-non","title":"Statistical Beamformer Exploiting Non-stationarity and Sparsity with Spatially Constrained ICA for Robust Speech Recognition","date":"2023-06-13","arxiv_id":"2306.07562","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-audio-textual-architecture-for-1","title":"Multimodal Audio-textual Architecture for Robust Spoken Language Understanding","date":"2023-06-12","arxiv_id":"2306.06819","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-n-gram-approximation-of-pre-trained","title":"On the N-gram Approximation of Pre-trained Language Models","date":"2023-06-12","arxiv_id":"2306.06892","repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-experiencing-misrecognition-by","title":"Impact of Experiencing Misrecognition by Teachable Agents on Learning and Rapport","date":"2023-06-11","arxiv_id":"2306.07302","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-frame-level-classifier-for-word","title":"Improving Frame-level Classifier for Word Timings with Non-peaky CTC in End-to-End Automatic Speech Recognition","date":"2023-06-09","arxiv_id":"2306.07949","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-the-reliability-of-automatic","title":"A study on the impact of Self-Supervised Learning on automatic dysarthric speech assessment","date":"2023-06-07","arxiv_id":"2306.04337","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-asr-based-tutor-for-learning-to-read-how","title":"An ASR-Based Tutor for Learning to Read: How to Optimize Feedback to First Graders","date":"2023-06-07","arxiv_id":"2306.04190","repositories_listed":0,"syntology":null},{"url":null,"slug":"alzheimer-disease-classification-through-asr","title":"Alzheimer Disease Classification through ASR-based Transcriptions: Exploring the Impact of Punctuation and Pauses","date":"2023-06-06","arxiv_id":"2306.03443","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-assessment-of-oral-reading-accuracy","title":"Automatic Assessment of Oral Reading Accuracy for Reading Diagnostics","date":"2023-06-06","arxiv_id":"2306.03444","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-fairness-and-robustness-in-end-to","title":"Improving Fairness and Robustness in End-to-End Speech Recognition through unsupervised clustering","date":"2023-06-06","arxiv_id":"2306.06083","repositories_listed":0,"syntology":null}],"record_sha256":"a825d6846358added2a1baa22bb92ba8aef718435642c5f3b121ff0eee3b8178","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}