{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition/papers/13","list_of":"/task/automatic-speech-recognition","task":"Automatic Speech Recognition (ASR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":31,"rows_per_page":100,"rows":[1201,1300],"of":3012,"counts":{"archive_papers_tagged":3012,"with_a_code_link":622,"where_syntology_ran_a_sample":77,"not_listed_spam_title":0,"listed":3012,"listed_where_code_ran":77,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":13,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":13,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition","prev":"/task/automatic-speech-recognition/papers/12","next":"/task/automatic-speech-recognition/papers/14","papers":[{"url":null,"slug":"incorporating-l2-phonemes-using-articulatory","title":"Incorporating L2 Phonemes Using Articulatory Features for Robust Speech Recognition","date":"2023-06-05","arxiv_id":"2306.02534","repositories_listed":0,"syntology":null},{"url":null,"slug":"otf-optimal-transport-based-fusion-of","title":"OTF: Optimal Transport based Fusion of Supervised and Self-Supervised Learning Models for Automatic Speech Recognition","date":"2023-06-05","arxiv_id":"2306.02541","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-joint-target-and-non-target","title":"End-to-End Joint Target and Non-Target Speakers ASR","date":"2023-06-04","arxiv_id":"2306.02273","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-speech-to-confusion-network-speech","title":"Streaming Speech-to-Confusion Network Speech Recognition","date":"2023-06-02","arxiv_id":"2306.03778","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptation-and-optimization-of-automatic","title":"Adaptation and Optimization of Automatic Speech Recognition (ASR) for the Maritime Domain in the Field of VHF Communication","date":"2023-06-01","arxiv_id":"2306.00614","repositories_listed":0,"syntology":null},{"url":null,"slug":"afrinames-most-asr-models-butcher-african","title":"AfriNames: Most ASR models \"butcher\" African Names","date":"2023-06-01","arxiv_id":"2306.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"bypass-temporal-classification-weakly","title":"Bypass Temporal Classification: Weakly Supervised Automatic Speech Recognition with Imperfect Transcripts","date":"2023-06-01","arxiv_id":"2306.01031","repositories_listed":0,"syntology":null},{"url":null,"slug":"inspecting-spoken-language-understanding-from","title":"Inspecting Spoken Language Understanding from Kids for Basic Math Learning at Home","date":"2023-06-01","arxiv_id":"2306.00482","repositories_listed":0,"syntology":null},{"url":null,"slug":"some-voices-are-too-common-building-fair","title":"Some voices are too common: Building fair speech recognition systems using the Common Voice dataset","date":"2023-06-01","arxiv_id":"2306.03773","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-hate-speech-detection-in-low-resource","title":"Towards hate speech detection in low-resource languages: Comparing ASR to acoustic word embeddings on Wolof and Swahili","date":"2023-06-01","arxiv_id":"2306.00410","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-and-structured-pruning-for-efficient","title":"Accurate and Structured Pruning for Efficient Automatic Speech Recognition","date":"2023-05-31","arxiv_id":"2305.19549","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-yet-effective-code-switching-language","title":"Simple yet Effective Code-Switching Language Identification with Multitask Pre-Training and Transfer Learning","date":"2023-05-31","arxiv_id":"2305.19759","repositories_listed":0,"syntology":null},{"url":null,"slug":"vilas-integrating-vision-and-language-into","title":"VILAS: Exploring the Effects of Vision and Language Context in Automatic Speech Recognition","date":"2023-05-31","arxiv_id":"2305.19972","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-automatic-pronunciation-assessment","title":"Zero-Shot Automatic Pronunciation Assessment","date":"2023-05-31","arxiv_id":"2305.19563","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-multi-lingual-asr-models-for","title":"Adapting Multi-Lingual ASR Models for Handling Multiple Talkers","date":"2023-05-30","arxiv_id":"2305.18747","repositories_listed":0,"syntology":null},{"url":null,"slug":"stt4sg-350-a-speech-corpus-for-all-swiss","title":"STT4SG-350: A Speech Corpus for All Swiss German Dialect Regions","date":"2023-05-30","arxiv_id":"2305.18855","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-selection-of-text-to-speech-data-to","title":"Towards Selection of Text-to-speech Data to Augment ASR Training","date":"2023-05-30","arxiv_id":"2306.00998","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-accurate-low-latency-asr-for","title":"Building Accurate Low Latency ASR for Streaming Voice Search","date":"2023-05-29","arxiv_id":"2305.18596","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-we-trust-explainable-ai-methods-on-asr-an","title":"Can We Trust Explainable AI Methods on ASR? An Evaluation on Phoneme Recognition","date":"2023-05-29","arxiv_id":"2305.18011","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-textless-spoken-language","title":"Improving Textless Spoken Language Understanding with Discrete Units as Intermediate Target","date":"2023-05-29","arxiv_id":"2305.18096","repositories_listed":0,"syntology":null},{"url":null,"slug":"2-bit-conformer-quantization-for-automatic","title":"2-bit Conformer quantization for automatic speech recognition","date":"2023-05-26","arxiv_id":"2305.16619","repositories_listed":0,"syntology":null},{"url":null,"slug":"disfluencyfixer-a-tool-to-enhance-language","title":"DisfluencyFixer: A tool to enhance Language Learning through Speech To Speech Disfluency Correction","date":"2023-05-26","arxiv_id":"2305.16957","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-and-emotional-speech-a-word-level","title":"ASR and Emotional Speech: A Word-Level Investigation of the Mutual Impact of Speech and Emotion Recognition","date":"2023-05-25","arxiv_id":"2305.16065","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-scheduled-sampling-for-neural","title":"Improving Scheduled Sampling for Neural Transducer-based ASR","date":"2023-05-25","arxiv_id":"2305.15958","repositories_listed":0,"syntology":null},{"url":null,"slug":"intapt-information-theoretic-adversarial","title":"INTapt: Information-Theoretic Adversarial Prompt Tuning for Enhanced Non-Native Speech Recognition","date":"2023-05-25","arxiv_id":"2305.16371","repositories_listed":0,"syntology":null},{"url":null,"slug":"svarah-evaluating-english-asr-systems-on","title":"Svarah: Evaluating English ASR Systems on Indian Accents","date":"2023-05-25","arxiv_id":"2305.15760","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-modeling-of-multi-talker-overlapped","title":"Unified Modeling of Multi-Talker Overlapped Speech Recognition and Diarization with a Sidecar Separator","date":"2023-05-25","arxiv_id":"2305.16263","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-ultrasound-tongue-images-for","title":"Incorporating Ultrasound Tongue Images for Audio-Visual Speech Enhancement through Knowledge Distillation","date":"2023-05-24","arxiv_id":"2305.14933","repositories_listed":0,"syntology":null},{"url":null,"slug":"interformer-interactive-local-and-global","title":"InterFormer: Interactive Local and Global Features Fusion for Automatic Speech Recognition","date":"2023-05-24","arxiv_id":"2305.16342","repositories_listed":0,"syntology":null},{"url":null,"slug":"iteratively-improving-speech-recognition-and","title":"Iteratively Improving Speech Recognition and Voice Conversion","date":"2023-05-24","arxiv_id":"2305.15055","repositories_listed":0,"syntology":null},{"url":null,"slug":"ba-sot-boundary-aware-serialized-output","title":"BA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR","date":"2023-05-23","arxiv_id":"2305.13716","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-openai-s-whisper-asr-for","title":"Evaluating OpenAI's Whisper ASR for Punctuation Prediction and Topic Modeling of life histories of the Museum of the Person","date":"2023-05-23","arxiv_id":"2305.14580","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-meets-llm-a-novel-approach-to","title":"Graph Meets LLM: A Novel Approach to Collaborative Filtering for Robust Conversational Understanding","date":"2023-05-23","arxiv_id":"2305.14449","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-transferability-of-whisper-based","title":"On the Transferability of Whisper-based Representations for \"In-the-Wild\" Cross-Task Downstream Speech Applications","date":"2023-05-23","arxiv_id":"2305.14546","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-predictive-asr-for-latency","title":"Personalized Predictive ASR for Latency Reduction in Voice Assistants","date":"2023-05-23","arxiv_id":"2305.13794","repositories_listed":0,"syntology":null},{"url":null,"slug":"se-bridge-speech-enhancement-with-consistent","title":"SE-Bridge: Speech Enhancement with Consistent Brownian Bridge","date":"2023-05-23","arxiv_id":"2305.13796","repositories_listed":0,"syntology":null},{"url":null,"slug":"tranusr-phoneme-to-word-transcoder-based","title":"TranUSR: Phoneme-to-word Transcoder Based Unified Speech Representation Learning for Cross-lingual Speech Recognition","date":"2023-05-23","arxiv_id":"2305.13629","repositories_listed":0,"syntology":null},{"url":null,"slug":"gncformer-enhanced-self-attention-for","title":"GNCformer Enhanced Self-attention for Automatic Speech Recognition","date":"2023-05-22","arxiv_id":"2305.12755","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-generation-with-speech-synthesis-for-asr","title":"Text Generation with Speech Synthesis for ASR Data Augmentation","date":"2023-05-22","arxiv_id":"2305.16333","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-efficacy-and-noise-robustness-of","title":"On the Efficacy and Noise-Robustness of Jointly Learned Speech Emotion and Automatic Speech Recognition","date":"2023-05-21","arxiv_id":"2305.12540","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-vad-low-latency-voice-activity","title":"Semantic VAD: Low-Latency Voice Activity Detection for Speech Interaction","date":"2023-05-21","arxiv_id":"2305.12450","repositories_listed":0,"syntology":null},{"url":null,"slug":"vakta-setu-a-speech-to-speech-machine","title":"VAKTA-SETU: A Speech-to-Speech Machine Translation Service in Select Indic Languages","date":"2023-05-21","arxiv_id":"2305.12518","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-representations-in-speech","title":"Self-supervised representations in speech-based depression detection","date":"2023-05-20","arxiv_id":"2305.12263","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-asr-via-cross-lingual-pseudo","title":"Unsupervised ASR via Cross-Lingual Pseudo-Labeling","date":"2023-05-19","arxiv_id":"2305.13330","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lexical-aware-non-autoregressive","title":"A Lexical-aware Non-autoregressive Transformer-based ASR Model","date":"2023-05-18","arxiv_id":"2305.10839","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-speaker-disentanglement-using","title":"Adversarial Speaker Disentanglement Using Unannotated External Data for Self-supervised Representation Based Voice Conversion","date":"2023-05-16","arxiv_id":"2305.09167","repositories_listed":0,"syntology":null},{"url":null,"slug":"critical-appraisal-of-artificial-intelligence","title":"Critical Appraisal of Artificial Intelligence-Mediated Communication","date":"2023-05-15","arxiv_id":"2305.11897","repositories_listed":0,"syntology":null},{"url":null,"slug":"ood-speech-a-large-bengali-speech-recognition","title":"OOD-Speech: A Large Bengali Speech Recognition Dataset for Out-of-Distribution Benchmarking","date":"2023-05-15","arxiv_id":"2305.09688","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-neural-factor-analysis-for","title":"Self-supervised Neural Factor Analysis for Disentangling Utterance-level Speech Representations","date":"2023-05-14","arxiv_id":"2305.08099","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-sensitivity-of-automatic","title":"Investigating the Sensitivity of Automatic Speech Recognition Systems to Phonetic Variation in L2 Englishes","date":"2023-05-12","arxiv_id":"2305.07389","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-audio-text-encoders-are-effective","title":"Masked Audio Text Encoders are Effective Multi-Modal Rescorers","date":"2023-05-11","arxiv_id":"2305.07677","repositories_listed":0,"syntology":null},{"url":null,"slug":"quran-recitation-recognition-using-end-to-end","title":"Quran Recitation Recognition using End-to-End Deep Learning","date":"2023-05-10","arxiv_id":"2305.07034","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-of-language-dependency-for","title":"Exploration of Language Dependency for Japanese Self-Supervised Speech Representation Models","date":"2023-05-09","arxiv_id":"2305.05201","repositories_listed":0,"syntology":null},{"url":null,"slug":"who-needs-decoders-efficient-estimation-of","title":"Who Needs Decoders? Efficient Estimation of Sequence-level Attributes","date":"2023-05-09","arxiv_id":"2305.05098","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-temporal-lip-audio-memory-for-visual","title":"Multi-Temporal Lip-Audio Memory for Visual Speech Recognition","date":"2023-05-08","arxiv_id":"2305.04542","repositories_listed":0,"syntology":null},{"url":null,"slug":"lookahead-when-it-matters-adaptive-non-causal","title":"Lookahead When It Matters: Adaptive Non-causal Transformers for Streaming Neural Transducers","date":"2023-05-07","arxiv_id":"2305.04159","repositories_listed":0,"syntology":null},{"url":null,"slug":"employing-hybrid-deep-neural-networks-on-dari","title":"Employing Hybrid Deep Neural Networks on Dari Speech","date":"2023-05-04","arxiv_id":"2305.03200","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-spoken-language-understanding-4","title":"End-to-end spoken language understanding using joint CTC loss and self-supervised, pretrained acoustic encoders","date":"2023-05-04","arxiv_id":"2305.02937","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-transducer-and-attention-based-encoder","title":"Hybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks","date":"2023-05-04","arxiv_id":"2305.03101","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-the-integration-of-pipeline-and","title":"A Study on the Integration of Pipeline and E2E SLU systems for Spoken Semantic Parsing toward STOP Quality Challenge","date":"2023-05-02","arxiv_id":"2305.01620","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-a-non-native-speech-corpus-featuring","title":"Building a Non-native Speech Corpus Featuring Chinese-English Bilingual Children: Compilation and Rationale","date":"2023-04-30","arxiv_id":"2305.00446","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-transfer-learning-for-automatic-speech","title":"Deep Transfer Learning for Automatic Speech Recognition: Towards Better Generalization","date":"2023-04-27","arxiv_id":"2304.14535","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-shared-speech-text","title":"Understanding Shared Speech-Text Representations","date":"2023-04-27","arxiv_id":"2304.14514","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-regularised-minimum-latency-training-for","title":"Self-regularised Minimum Latency Training for Streaming Transformer-based Speech Recognition","date":"2023-04-24","arxiv_id":"2304.11985","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-end-to-end-approaches-for","title":"Non-autoregressive End-to-end Approaches for Joint Automatic Speech Recognition and Spoken Language Understanding","date":"2023-04-21","arxiv_id":"2304.10869","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-the-universal-defense-for-query-based","title":"Towards the Universal Defense for Query-Based Audio Adversarial Attacks","date":"2023-04-20","arxiv_id":"2304.10088","repositories_listed":0,"syntology":null},{"url":null,"slug":"security-and-privacy-problems-in-voice","title":"Security and Privacy Problems in Voice Assistant Applications: A Survey","date":"2023-04-19","arxiv_id":"2304.09486","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-short-video-rumor-detection-system","title":"Multimodal Short Video Rumor Detection System Based on Contrastive Learning","date":"2023-04-17","arxiv_id":"2304.08401","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-virtual-simulation-pilot-agent-for-training","title":"A Virtual Simulation-Pilot Agent for Training of Air Traffic Controllers","date":"2023-04-16","arxiv_id":"2304.07842","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-ctc-alignment-based-non-autoregressive","title":"A CTC Alignment-based Non-autoregressive Transformer for End-to-end Automatic Speech Recognition","date":"2023-04-15","arxiv_id":"2304.07611","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-reconstruction-from-silent-tongue-and","title":"Speech Reconstruction from Silent Tongue and Lip Articulation By Pseudo Target Generation and Domain Adversarial Training","date":"2023-04-12","arxiv_id":"2304.05574","repositories_listed":0,"syntology":null},{"url":null,"slug":"wav2code-restore-clean-speech-representations","title":"Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR","date":"2023-04-11","arxiv_id":"2304.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-accurate-self-supervised","title":"Scalable and Accurate Self-supervised Multimodal Representation Learning without Aligned Video and Text Data","date":"2023-04-04","arxiv_id":"2304.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-learning-based-source","title":"Self-Supervised Learning-Based Source Separation for Meeting Data","date":"2023-04-03","arxiv_id":"2304.00871","repositories_listed":0,"syntology":null},{"url":"/paper/improving-the-previous-state-of-the-art","slug":"improving-the-previous-state-of-the-art","title":"Improving the previous state-of-the-art Frisian ASR by fine-tuning XLS-R","date":"2023-03-31","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/the-edinburgh-international-accents-of","slug":"the-edinburgh-international-accents-of","title":"The Edinburgh International Accents of English Corpus: Towards the Democratization of English ASR","date":"2023-03-31","arxiv_id":"2303.18110","repositories_listed":0,"syntology":null},{"url":null,"slug":"procter-pronunciation-aware-contextual","title":"PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers","date":"2023-03-30","arxiv_id":"2303.17131","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-unsupervised-and-supervised-learning","title":"Joint unsupervised and supervised learning for context-aware language identification","date":"2023-03-29","arxiv_id":"2303.16511","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-is-all-you-need-personalizing-asr-models","title":"Text is All You Need: Personalizing ASR Models using Controllable Speech Synthesis","date":"2023-03-27","arxiv_id":"2303.14885","repositories_listed":0,"syntology":null},{"url":"/paper/beyond-universal-transformer-block-reusing","slug":"beyond-universal-transformer-block-reusing","title":"Beyond Universal Transformer: block reusing with adaptor in Transformer for automatic speech recognition","date":"2023-03-23","arxiv_id":"2303.13072","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-unsupervised-speech-recognition","title":"Enhancing Unsupervised Speech Recognition with Diffusion GANs","date":"2023-03-23","arxiv_id":"2303.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-switching-text-generation-and-injection","title":"Code-Switching Text Generation and Injection in Mandarin-English ASR","date":"2023-03-20","arxiv_id":"2303.10949","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-from-multiple","title":"Knowledge Distillation from Multiple Foundation Models for End-to-End Speech Recognition","date":"2023-03-20","arxiv_id":"2303.10917","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-learning-system-for-domain-specific","title":"A Deep Learning System for Domain-specific Speech Recognition","date":"2023-03-18","arxiv_id":"2303.10510","repositories_listed":0,"syntology":null},{"url":null,"slug":"distillw2v2-a-small-and-streaming-wav2vec-2-0","title":"DistillW2V2: A Small and Streaming Wav2vec 2.0 Based ASR Model","date":"2023-03-16","arxiv_id":"2303.09278","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-information-matters-for-asr-error","title":"Visual Information Matters for ASR Error Correction","date":"2023-03-16","arxiv_id":"2303.10160","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-accented-speech-recognition-with","title":"Improving Accented Speech Recognition with Multi-Domain Training","date":"2023-03-14","arxiv_id":"2303.07924","repositories_listed":0,"syntology":null},{"url":null,"slug":"clinical-bertscore-an-improved-measure-of","title":"Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings","date":"2023-03-10","arxiv_id":"2303.05737","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixpgd-hybrid-adversarial-training-for-speech","title":"MIXPGD: Hybrid Adversarial Training for Speech Recognition Systems","date":"2023-03-10","arxiv_id":"2303.05758","repositories_listed":0,"syntology":null},{"url":null,"slug":"wav2vec-and-its-current-potential-to","title":"wav2vec and its current potential to Automatic Speech Recognition in German for the usage in Digital History: A comparative assessment of available ASR-technologies for the use in cultural heritage contexts","date":"2023-03-06","arxiv_id":"2303.06026","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-recognition-a-survey","title":"End-to-End Speech Recognition: A Survey","date":"2023-03-03","arxiv_id":"2303.03329","repositories_listed":0,"syntology":null},{"url":null,"slug":"google-usm-scaling-automatic-speech","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","date":"2023-03-02","arxiv_id":"2303.01037","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-large-text-corpora-for-end-to-end","title":"Leveraging Large Text Corpora for End-to-End Speech Summarization","date":"2023-03-02","arxiv_id":"2303.00978","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-redundancy-in-multiple-audio","title":"Leveraging Redundancy in Multiple Audio Signals for Far-Field Speech Recognition","date":"2023-03-01","arxiv_id":"2303.00692","repositories_listed":0,"syntology":null},{"url":null,"slug":"n-best-t5-robust-asr-error-correction-using","title":"N-best T5: Robust ASR Error Correction using Multiple Input Hypotheses and Constrained Decoding Space","date":"2023-03-01","arxiv_id":"2303.00456","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-speech-data-augmentation","title":"A Comparison of Speech Data Augmentation Methods Using S3PRL Toolkit","date":"2023-02-27","arxiv_id":"2303.00510","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-visual-forced-alignment-learning-to","title":"Deep Visual Forced Alignment: Learning to Align Transcription with Talking Face Video","date":"2023-02-27","arxiv_id":"2303.08670","repositories_listed":0,"syntology":null},{"url":null,"slug":"diacritic-recognition-performance-in-arabic","title":"Diacritic Recognition Performance in Arabic ASR","date":"2023-02-27","arxiv_id":"2302.14022","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-medical-speech-to-text-accuracy","title":"Improving Medical Speech-to-Text Accuracy with Vision-Language Pre-training Model","date":"2023-02-27","arxiv_id":"2303.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"mole-mixture-of-language-experts-for-multi","title":"MoLE : Mixture of Language Experts for Multi-Lingual Automatic Speech Recognition","date":"2023-02-27","arxiv_id":"2302.13750","repositories_listed":0,"syntology":null}],"record_sha256":"e9f73177ce24ce9dced3e1dbbd32acb6d2ddc9bc060c367af8fb6ccc38a5ead3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}