{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition/papers/40","list_of":"/task/speech-recognition","task":"Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":40,"pages_in_order":65,"rows_per_page":100,"rows":[3901,4000],"of":6433,"counts":{"archive_papers_tagged":6433,"with_a_code_link":1373,"where_syntology_ran_a_sample":196,"not_listed_spam_title":0,"listed":6433,"listed_where_code_ran":196,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":162,"every_run_a_failure_of_syntologys_instrument":34,"listed_with_a_run_with_no_instrument_failure":162,"listed_every_run_a_failure_of_syntologys_instrument":34,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition","prev":"/task/speech-recognition/papers/39","next":"/task/speech-recognition/papers/41","papers":[{"url":null,"slug":"improved-conformer-based-end-to-end-speech","title":"Improved Conformer-based End-to-End Speech Recognition Using Neural Architecture Search","date":"2021-04-12","arxiv_id":"2104.05390","repositories_listed":0,"syntology":null},{"url":null,"slug":"innovative-bert-based-reranking-language","title":"Innovative Bert-based Reranking Language Models for Speech Recognition","date":"2021-04-11","arxiv_id":"2104.04950","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-transformer-based-end-to","title":"Non-autoregressive Transformer-based End-to-end ASR using BERT","date":"2021-04-10","arxiv_id":"2104.04805","repositories_listed":0,"syntology":null},{"url":null,"slug":"accented-speech-recognition-inspired-by-human","title":"Accented Speech Recognition Inspired by Human Perception","date":"2021-04-09","arxiv_id":"2104.04627","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-replacement-and-combination-for","title":"On Architectures and Training for Raw Waveform Feature Extraction in ASR","date":"2021-04-09","arxiv_id":"2104.04298","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-fusion-for-streaming-end-to","title":"Language model fusion for streaming end to end speech recognition","date":"2021-04-09","arxiv_id":"2104.04487","repositories_listed":0,"syntology":null},{"url":null,"slug":"lookup-table-recurrent-language-models-for","title":"Lookup-Table Recurrent Language Models for Long Tail Speech Recognition","date":"2021-04-09","arxiv_id":"2104.04552","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ntnu-system-for-formosa-speech","title":"The NTNU Taiwanese ASR System for Formosa Speech Recognition Challenge 2020","date":"2021-04-09","arxiv_id":"2104.04221","repositories_listed":0,"syntology":null},{"url":"/paper/bstc-a-large-scale-chinese-english-speech","slug":"bstc-a-large-scale-chinese-english-speech","title":"BSTC: A Large-Scale Chinese-English Speech Translation Dataset","date":"2021-04-08","arxiv_id":"2104.03575","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-semi-supervised-learning-an","title":"Contextual Semi-Supervised Learning: An Approach To Leverage Air-Surveillance and Untranscribed ATC Data in ASR Systems","date":"2021-04-08","arxiv_id":"2104.03643","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-machine-speech-chain-for-domain","title":"Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation","date":"2021-04-08","arxiv_id":"2104.03815","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-reduction-accelerating-conformer-based","title":"Layer Reduction: Accelerating Conformer-Based Self-Supervised Model via Layer Consistency","date":"2021-04-08","arxiv_id":"2105.00812","repositories_listed":0,"syntology":null},{"url":null,"slug":"wnars-wfst-based-non-autoregressive-streaming","title":"WNARS: WFST based Non-autoregressive Streaming End-to-End Speech Recognition","date":"2021-04-08","arxiv_id":"2104.03587","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-multi-resolution-context-by-dilated","title":"Capturing Multi-Resolution Context by Dilated Self-Attention","date":"2021-04-07","arxiv_id":"2104.02858","repositories_listed":0,"syntology":null},{"url":null,"slug":"fsr-accelerating-the-inference-process-of","title":"FSR: Accelerating the Inference Process of Transducer-Based Models by Applying Fast-Skip Regularization","date":"2021-04-07","arxiv_id":"2104.02882","repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-the-limits-of-non-autoregressive","title":"Pushing the Limits of Non-Autoregressive Speech Recognition","date":"2021-04-07","arxiv_id":"2104.03416","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-ctc-and-lfmmi-for-out-of-domain","title":"Comparing CTC and LFMMI for out-of-domain adaptation of wav2vec 2.0 acoustic model","date":"2021-04-06","arxiv_id":"2104.02558","repositories_listed":0,"syntology":null},{"url":null,"slug":"dissecting-user-perceived-latency-of-on","title":"Dissecting User-Perceived Latency of On-Device E2E Speech Recognition","date":"2021-04-06","arxiv_id":"2104.02207","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-targeted-universal-adversarial","title":"Exploring Targeted Universal Adversarial Perturbations to End-to-end ASR Models","date":"2021-04-06","arxiv_id":"2104.02757","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexi-transducer-optimizing-latency-accuracy","title":"Flexi-Transducer: Optimizing Latency, Accuracy and Compute forMulti-Domain On-Device Scenarios","date":"2021-04-06","arxiv_id":"2104.02232","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-mandarin-english-code","title":"Non-autoregressive Mandarin-English Code-switching Speech Recognition","date":"2021-04-06","arxiv_id":"2104.02258","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-transport-based-adaptation-in","title":"Optimal Transport-based Adaptation in Dysarthric Speech Tasks","date":"2021-04-06","arxiv_id":"2104.02535","repositories_listed":0,"syntology":null},{"url":null,"slug":"relaxing-the-conditional-independence","title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","date":"2021-04-06","arxiv_id":"2104.02724","repositories_listed":0,"syntology":null},{"url":null,"slug":"citrinet-closing-the-gap-between-non","title":"Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition","date":"2021-04-05","arxiv_id":"2104.01721","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-streaming-end-to-end-speech","title":"Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion","date":"2021-04-05","arxiv_id":"2104.02194","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-encoder-transducer-a-flexible","title":"Dynamic Encoder Transducer: A Flexible Solution For Trading Off Accuracy For Latency","date":"2021-04-05","arxiv_id":"2104.02176","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speaker-attributed-asr-with","title":"End-to-End Speaker-Attributed ASR with Transformer","date":"2021-04-05","arxiv_id":"2104.02128","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-distance-a-new-metric-for-asr","title":"Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding","date":"2021-04-05","arxiv_id":"2104.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-diarization-assisted-asr-for-multi","title":"Speaker conditioned acoustic modeling for multi-speaker conversational ASR","date":"2021-04-05","arxiv_id":"2104.01882","repositories_listed":0,"syntology":null},{"url":"/paper/speechstew-simply-mix-all-available-speech","slug":"speechstew-simply-mix-all-available-speech","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","date":"2021-04-05","arxiv_id":"2104.02133","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-multi-talker-speech-recognition","title":"Streaming Multi-talker Speech Recognition with Joint Speaker Identification","date":"2021-04-05","arxiv_id":"2104.02109","repositories_listed":0,"syntology":null},{"url":null,"slug":"talk-don-t-write-a-study-of-direct-speech","title":"Talk, Don't Write: A Study of Direct Speech-Based Image Retrieval","date":"2021-04-05","arxiv_id":"2104.01894","repositories_listed":0,"syntology":null},{"url":null,"slug":"phoneme-recognition-through-fine-tuning-of","title":"Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties","date":"2021-04-04","arxiv_id":"2104.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-lifelong-learning-of-end-to-end-asr","title":"Towards Lifelong Learning of End-to-end ASR","date":"2021-04-04","arxiv_id":"2104.01616","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfornn-capturing-the-sequential","title":"TransfoRNN: Capturing the Sequential Information in Self-Attention Representations for Language Modeling","date":"2021-04-04","arxiv_id":"2104.01572","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-joint-training-with-self","title":"Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition","date":"2021-04-03","arxiv_id":"2104.01471","repositories_listed":0,"syntology":null},{"url":null,"slug":"hmm-free-encoder-pre-training-for-streaming","title":"HMM-Free Encoder Pre-Training for Streaming RNN Transducer","date":"2021-04-02","arxiv_id":"2104.10764","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-paralinguistics-in-tamil-speech","title":"A Survey on Paralinguistics in Tamil Speech Processing","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"configurable-privacy-preserving-automatic","title":"Configurable Privacy-Preserving Automatic Speech Recognition","date":"2021-04-01","arxiv_id":"2104.00766","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-sensitive-evaluation-of-automatic","title":"Context-sensitive evaluation of automatic speech recognition: considering user experience & language variation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dialect-identification-through-adversarial","title":"Dialect Identification through Adversarial Learning and Knowledge Distillation on Romanian BERT","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"disfluency-correction-using-unsupervised-and","title":"Disfluency Correction using Unsupervised and Semi-supervised Learning","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-spatial-speech-recognition-maps","title":"Interactive spatial speech recognition maps based on simulated speech recognition experiments","date":"2021-04-01","arxiv_id":"2104.00259","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-end-to-end-asr-for-endangered-1","title":"Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yol\\'oxochitl Mixtec","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-proposal-end-to-end-speech","title":"Tutorial Proposal: End-to-End Speech Translation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-and-defenses-for-speech","title":"Adversarial Attacks and Defenses for Speech Recognition Systems","date":"2021-03-31","arxiv_id":"2103.17122","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-1d-time-channel-separable","title":"Compressing 1D Time-Channel Separable Convolutions using Sparse Random Ternary Matrices","date":"2021-03-31","arxiv_id":"2103.17142","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-pre-training-of-end-to-end-multi","title":"Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone","date":"2021-03-31","arxiv_id":"2103.16776","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-encoder-learning-and-stream-fusion-for","title":"Multi-Encoder Learning and Stream Fusion for Transformer-Based End-to-End Automatic Speech Recognition","date":"2021-03-31","arxiv_id":"2104.00120","repositories_listed":0,"syntology":null},{"url":null,"slug":"xy-neural-networks","title":"XY Neural Networks","date":"2021-03-31","arxiv_id":"2103.17244","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-latent-monotonic-attention","title":"A study of latent monotonic attention variants","date":"2021-03-30","arxiv_id":"2103.16710","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-meta-learning-training-for-speaker","title":"Improved Meta-Learning Training for Speaker Verification","date":"2021-03-29","arxiv_id":"2103.15421","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-hypothesis-ctc-based-semi-supervised","title":"Multiple-hypothesis CTC-based semi-supervised adaptation of end-to-end speech recognition","date":"2021-03-29","arxiv_id":"2103.15515","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-sparsemax-based-channel-selection-for","title":"Scaling sparsemax based channel selection for speech recognition with ad-hoc microphone arrays","date":"2021-03-29","arxiv_id":"2103.15305","repositories_listed":0,"syntology":null},{"url":null,"slug":"shrinking-bigfoot-reducing-wav2vec-2-0","title":"Shrinking Bigfoot: Reducing wav2vec 2.0 footprint","date":"2021-03-29","arxiv_id":"2103.15760","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-end-to-end-speech-1","title":"Transformer-based end-to-end speech recognition with residual Gaussian-based self-attention","date":"2021-03-29","arxiv_id":"2103.15722","repositories_listed":0,"syntology":null},{"url":null,"slug":"bart-based-semantic-correction-for-mandarin","title":"BART based semantic correction for Mandarin automatic speech recognition system","date":"2021-03-26","arxiv_id":"2104.05507","repositories_listed":0,"syntology":null},{"url":"/paper/construction-of-a-large-scale-japanese-asr","slug":"construction-of-a-large-scale-japanese-asr","title":"Construction of a Large-scale Japanese ASR Corpus on TV Recordings","date":"2021-03-26","arxiv_id":"2103.14736","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutually-constrained-monotonic-multihead","title":"Mutually-Constrained Monotonic Multihead Attention for Online ASR","date":"2021-03-26","arxiv_id":"2103.14302","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-improve-robustness-of-nlp","title":"An Approach to Improve Robustness of NLP Systems against ASR Errors","date":"2021-03-25","arxiv_id":"2103.13610","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-energy-based-models-for-end-to-end","title":"Residual Energy-Based Models for End-to-End Speech Recognition","date":"2021-03-25","arxiv_id":"2103.14152","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-privacy-with-smart-digital-assistants","title":"Voice Privacy with Smart Digital Assistants in Educational Settings","date":"2021-03-24","arxiv_id":"2104.11038","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-learning-rate-optimizers-for-deep","title":"Evolving Learning Rate Optimizers for Deep Neural Networks","date":"2021-03-23","arxiv_id":"2103.12623","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucination-of-speech-recognition-errors","title":"Hallucination of speech recognition errors with sequence to sequence learning","date":"2021-03-23","arxiv_id":"2103.12258","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-of-language-models-for","title":"Contextual Biasing of Language Models for Speech Recognition in Goal-Oriented Conversational Agents","date":"2021-03-18","arxiv_id":"2103.10325","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-rnn-transducer-technology-for","title":"Advancing RNN Transducer Technology for Speech Recognition","date":"2021-03-17","arxiv_id":"2103.09935","repositories_listed":0,"syntology":null},{"url":"/paper/transformer-based-asr-incorporating-time","slug":"transformer-based-asr-incorporating-time","title":"Transformer-based ASR Incorporating Time-reduction Layer and Fine-tuning with Self-Knowledge Distillation","date":"2021-03-17","arxiv_id":"2103.09903","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-learning-using-volunteer","title":"Distributed Deep Learning Using Volunteer Computing-Like Paradigm","date":"2021-03-16","arxiv_id":"2103.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-the-evaluation-of-simultaneous-speech","title":"Towards the evaluation of automatic simultaneous speech translation from a communicative perspective","date":"2021-03-15","arxiv_id":"2103.08364","repositories_listed":0,"syntology":null},{"url":null,"slug":"xlst-cross-lingual-self-training-to-learn","title":"XLST: Cross-lingual Self-training to Learn Multilingual Representation for Low Resource Speech Recognition","date":"2021-03-15","arxiv_id":"2103.08207","repositories_listed":0,"syntology":null},{"url":"/paper/edgecrnn-an-edgecomputing-oriented-model-of","slug":"edgecrnn-an-edgecomputing-oriented-model-of","title":"EdgeCRNN: an edgecomputing oriented model of acoustic feature enhancement for keyword spotting","date":"2021-03-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-optimisation-framework","title":"A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training","date":"2021-03-12","arxiv_id":"2103.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-acoustic-unit-augmentation-with-bpe","title":"Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource End-to-End Speech Recognition","date":"2021-03-12","arxiv_id":"2103.07186","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-guided-model-generalization-to","title":"Uncertainty-guided Model Generalization to Unseen Domains","date":"2021-03-12","arxiv_id":"2103.07531","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-word-level-confidence-for-subword","title":"Learning Word-Level Confidence For Subword End-to-End ASR","date":"2021-03-11","arxiv_id":"2103.06716","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-robust-accented-speech","title":"Best of Both Worlds: Robust Accented Speech Recognition with Adversarial Transfer Learning","date":"2021-03-10","arxiv_id":"2103.05834","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-of-pre-trained-end-to-end-speech","title":"Fine-tuning of Pre-trained End-to-end Speech Recognition with Generative Adversarial Networks","date":"2021-03-10","arxiv_id":"2103.13329","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-semi-supervised-learning-for-asr","title":"Contrastive Semi-supervised Learning for ASR","date":"2021-03-09","arxiv_id":"2103.05149","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-ultra-low-power-rnn-classifier-for-always","title":"An Ultra-low Power RNN Classifier for Always-On Voice Wake-Up Detection Robust to Real-World Scenarios","date":"2021-03-08","arxiv_id":"2103.04792","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-model-robustness-for-skill-routing-in","title":"Neural model robustness for skill routing in large-scale conversational AI systems: A design choice exploration","date":"2021-03-04","arxiv_id":"2103.03373","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-speech-separation-with-ad-hoc","title":"Continuous Speech Separation with Ad Hoc Microphone Arrays","date":"2021-03-03","arxiv_id":"2103.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-spatial-selective-auditory-attention-of","title":"The Spatial Selective Auditory Attention of Cochlear Implant Users in Different Conversational Sound Levels","date":"2021-03-03","arxiv_id":"2103.02703","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-running-speech-recognizer-an-end-to-end","title":"Incorporating VAD into ASR System by Multi-task Learning","date":"2021-03-02","arxiv_id":"2103.01661","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-knowledge-distillation-for-online","title":"Alignment Knowledge Distillation for Online Streaming Attention-based Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00422","repositories_listed":0,"syntology":null},{"url":null,"slug":"brain-signals-to-rescue-aphasia-apraxia-and","title":"Brain Signals to Rescue Aphasia, Apraxia and Dysarthria Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00383","repositories_listed":0,"syntology":null},{"url":null,"slug":"silent-versus-modal-multi-speaker-speech","title":"Silent versus modal multi-speaker speech recognition from ultrasound and video","date":"2021-02-27","arxiv_id":"2103.00333","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-for-improving-rare-word","title":"Meta-Learning for improving rare word recognition in end-to-end ASR","date":"2021-02-25","arxiv_id":"2102.12624","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixspeech-data-augmentation-for-low-resource","title":"MixSpeech: Data Augmentation for Low-resource Automatic Speech Recognition","date":"2021-02-25","arxiv_id":"2102.12664","repositories_listed":0,"syntology":null},{"url":"/paper/sep-28k-a-dataset-for-stuttering-event","slug":"sep-28k-a-dataset-for-stuttering-event","title":"SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter","date":"2021-02-24","arxiv_id":"2102.12394","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-using-multi-stage-self","title":"Speech Enhancement Using Multi-Stage Self-Attentive Temporal Convolutional Networks","date":"2021-02-24","arxiv_id":"2102.12078","repositories_listed":0,"syntology":null},{"url":null,"slug":"thoughts-on-the-potential-to-compensate-a","title":"Thoughts on the potential to compensate a hearing loss in noise","date":"2021-02-24","arxiv_id":"2102.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-dereverberation-beamforming-and","title":"End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend","date":"2021-02-23","arxiv_id":"2102.11525","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-optimization-of-contexts-for","title":"Evolutionary optimization of contexts for phonetic correction in speech recognition systems","date":"2021-02-23","arxiv_id":"2102.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-efficient-speech-recognition-on-smart","title":"Memory-efficient Speech Recognition on Smart Devices","date":"2021-02-23","arxiv_id":"2102.11531","repositories_listed":0,"syntology":null},{"url":null,"slug":"senone-aware-adversarial-multi-task-training","title":"Senone-aware Adversarial Multi-task Training for Unsupervised Child to Adult Speech Adaptation","date":"2021-02-23","arxiv_id":"2102.11488","repositories_listed":0,"syntology":null},{"url":null,"slug":"unidirectional-memory-self-attention","title":"Unidirectional Memory-Self-Attention Transducer for Online Speech Recognition","date":"2021-02-23","arxiv_id":"2102.11594","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-human-readable-transcript-for","title":"Generating Human Readable Transcript for Automatic Speech Recognition with Pre-trained Language Model","date":"2021-02-22","arxiv_id":"2102.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-use-of-voice-source-features-for-sung","title":"The Use of Voice Source Features for Sung Speech Recognition","date":"2021-02-20","arxiv_id":"2102.10376","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-neural-systems-for-automatic","title":"End-to-End Neural Systems for Automatic Children Speech Recognition: An Empirical Study","date":"2021-02-19","arxiv_id":"2102.09918","repositories_listed":0,"syntology":null},{"url":null,"slug":"echo-state-speech-recognition","title":"Echo State Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09114","repositories_listed":0,"syntology":null}],"record_sha256":"bdc66783a7034c21939395fb670228e92e99e4eb6a8307c91c68c57f22b892c2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}