{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition-1/papers/39","list_of":"/task/speech-recognition-1","task":"speech-recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":39,"pages_in_order":58,"rows_per_page":100,"rows":[3801,3900],"of":5715,"counts":{"archive_papers_tagged":5715,"with_a_code_link":1277,"where_syntology_ran_a_sample":162,"not_listed_spam_title":0,"listed":5715,"listed_where_code_ran":162,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":134,"every_run_a_failure_of_syntologys_instrument":28,"listed_with_a_run_with_no_instrument_failure":134,"listed_every_run_a_failure_of_syntologys_instrument":28,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition-1","prev":"/task/speech-recognition-1/papers/38","next":"/task/speech-recognition-1/papers/40","papers":[{"url":null,"slug":"exploring-machine-speech-chain-for-domain","title":"Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation","date":"2021-04-08","arxiv_id":"2104.03815","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-reduction-accelerating-conformer-based","title":"Layer Reduction: Accelerating Conformer-Based Self-Supervised Model via Layer Consistency","date":"2021-04-08","arxiv_id":"2105.00812","repositories_listed":0,"syntology":null},{"url":null,"slug":"wnars-wfst-based-non-autoregressive-streaming","title":"WNARS: WFST based Non-autoregressive Streaming End-to-End Speech Recognition","date":"2021-04-08","arxiv_id":"2104.03587","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-multi-resolution-context-by-dilated","title":"Capturing Multi-Resolution Context by Dilated Self-Attention","date":"2021-04-07","arxiv_id":"2104.02858","repositories_listed":0,"syntology":null},{"url":null,"slug":"fsr-accelerating-the-inference-process-of","title":"FSR: Accelerating the Inference Process of Transducer-Based Models by Applying Fast-Skip Regularization","date":"2021-04-07","arxiv_id":"2104.02882","repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-the-limits-of-non-autoregressive","title":"Pushing the Limits of Non-Autoregressive Speech Recognition","date":"2021-04-07","arxiv_id":"2104.03416","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-ctc-and-lfmmi-for-out-of-domain","title":"Comparing CTC and LFMMI for out-of-domain adaptation of wav2vec 2.0 acoustic model","date":"2021-04-06","arxiv_id":"2104.02558","repositories_listed":0,"syntology":null},{"url":null,"slug":"dissecting-user-perceived-latency-of-on","title":"Dissecting User-Perceived Latency of On-Device E2E Speech Recognition","date":"2021-04-06","arxiv_id":"2104.02207","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-targeted-universal-adversarial","title":"Exploring Targeted Universal Adversarial Perturbations to End-to-end ASR Models","date":"2021-04-06","arxiv_id":"2104.02757","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexi-transducer-optimizing-latency-accuracy","title":"Flexi-Transducer: Optimizing Latency, Accuracy and Compute forMulti-Domain On-Device Scenarios","date":"2021-04-06","arxiv_id":"2104.02232","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-mandarin-english-code","title":"Non-autoregressive Mandarin-English Code-switching Speech Recognition","date":"2021-04-06","arxiv_id":"2104.02258","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-transport-based-adaptation-in","title":"Optimal Transport-based Adaptation in Dysarthric Speech Tasks","date":"2021-04-06","arxiv_id":"2104.02535","repositories_listed":0,"syntology":null},{"url":null,"slug":"relaxing-the-conditional-independence","title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","date":"2021-04-06","arxiv_id":"2104.02724","repositories_listed":0,"syntology":null},{"url":null,"slug":"citrinet-closing-the-gap-between-non","title":"Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition","date":"2021-04-05","arxiv_id":"2104.01721","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-streaming-end-to-end-speech","title":"Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion","date":"2021-04-05","arxiv_id":"2104.02194","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-encoder-transducer-a-flexible","title":"Dynamic Encoder Transducer: A Flexible Solution For Trading Off Accuracy For Latency","date":"2021-04-05","arxiv_id":"2104.02176","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speaker-attributed-asr-with","title":"End-to-End Speaker-Attributed ASR with Transformer","date":"2021-04-05","arxiv_id":"2104.02128","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-distance-a-new-metric-for-asr","title":"Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding","date":"2021-04-05","arxiv_id":"2104.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-diarization-assisted-asr-for-multi","title":"Speaker conditioned acoustic modeling for multi-speaker conversational ASR","date":"2021-04-05","arxiv_id":"2104.01882","repositories_listed":0,"syntology":null},{"url":"/paper/speechstew-simply-mix-all-available-speech","slug":"speechstew-simply-mix-all-available-speech","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","date":"2021-04-05","arxiv_id":"2104.02133","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-multi-talker-speech-recognition","title":"Streaming Multi-talker Speech Recognition with Joint Speaker Identification","date":"2021-04-05","arxiv_id":"2104.02109","repositories_listed":0,"syntology":null},{"url":null,"slug":"talk-don-t-write-a-study-of-direct-speech","title":"Talk, Don't Write: A Study of Direct Speech-Based Image Retrieval","date":"2021-04-05","arxiv_id":"2104.01894","repositories_listed":0,"syntology":null},{"url":null,"slug":"phoneme-recognition-through-fine-tuning-of","title":"Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties","date":"2021-04-04","arxiv_id":"2104.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-lifelong-learning-of-end-to-end-asr","title":"Towards Lifelong Learning of End-to-end ASR","date":"2021-04-04","arxiv_id":"2104.01616","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfornn-capturing-the-sequential","title":"TransfoRNN: Capturing the Sequential Information in Self-Attention Representations for Language Modeling","date":"2021-04-04","arxiv_id":"2104.01572","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-joint-training-with-self","title":"Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition","date":"2021-04-03","arxiv_id":"2104.01471","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-paralinguistics-in-tamil-speech","title":"A Survey on Paralinguistics in Tamil Speech Processing","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"configurable-privacy-preserving-automatic","title":"Configurable Privacy-Preserving Automatic Speech Recognition","date":"2021-04-01","arxiv_id":"2104.00766","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-sensitive-evaluation-of-automatic","title":"Context-sensitive evaluation of automatic speech recognition: considering user experience & language variation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dialect-identification-through-adversarial","title":"Dialect Identification through Adversarial Learning and Knowledge Distillation on Romanian BERT","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"disfluency-correction-using-unsupervised-and","title":"Disfluency Correction using Unsupervised and Semi-supervised Learning","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-spatial-speech-recognition-maps","title":"Interactive spatial speech recognition maps based on simulated speech recognition experiments","date":"2021-04-01","arxiv_id":"2104.00259","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-end-to-end-asr-for-endangered-1","title":"Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yol\\'oxochitl Mixtec","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-proposal-end-to-end-speech","title":"Tutorial Proposal: End-to-End Speech Translation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-and-defenses-for-speech","title":"Adversarial Attacks and Defenses for Speech Recognition Systems","date":"2021-03-31","arxiv_id":"2103.17122","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-1d-time-channel-separable","title":"Compressing 1D Time-Channel Separable Convolutions using Sparse Random Ternary Matrices","date":"2021-03-31","arxiv_id":"2103.17142","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-pre-training-of-end-to-end-multi","title":"Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone","date":"2021-03-31","arxiv_id":"2103.16776","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-encoder-learning-and-stream-fusion-for","title":"Multi-Encoder Learning and Stream Fusion for Transformer-Based End-to-End Automatic Speech Recognition","date":"2021-03-31","arxiv_id":"2104.00120","repositories_listed":0,"syntology":null},{"url":null,"slug":"xy-neural-networks","title":"XY Neural Networks","date":"2021-03-31","arxiv_id":"2103.17244","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-latent-monotonic-attention","title":"A study of latent monotonic attention variants","date":"2021-03-30","arxiv_id":"2103.16710","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-meta-learning-training-for-speaker","title":"Improved Meta-Learning Training for Speaker Verification","date":"2021-03-29","arxiv_id":"2103.15421","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-hypothesis-ctc-based-semi-supervised","title":"Multiple-hypothesis CTC-based semi-supervised adaptation of end-to-end speech recognition","date":"2021-03-29","arxiv_id":"2103.15515","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-sparsemax-based-channel-selection-for","title":"Scaling sparsemax based channel selection for speech recognition with ad-hoc microphone arrays","date":"2021-03-29","arxiv_id":"2103.15305","repositories_listed":0,"syntology":null},{"url":null,"slug":"shrinking-bigfoot-reducing-wav2vec-2-0","title":"Shrinking Bigfoot: Reducing wav2vec 2.0 footprint","date":"2021-03-29","arxiv_id":"2103.15760","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-end-to-end-speech-1","title":"Transformer-based end-to-end speech recognition with residual Gaussian-based self-attention","date":"2021-03-29","arxiv_id":"2103.15722","repositories_listed":0,"syntology":null},{"url":null,"slug":"bart-based-semantic-correction-for-mandarin","title":"BART based semantic correction for Mandarin automatic speech recognition system","date":"2021-03-26","arxiv_id":"2104.05507","repositories_listed":0,"syntology":null},{"url":"/paper/construction-of-a-large-scale-japanese-asr","slug":"construction-of-a-large-scale-japanese-asr","title":"Construction of a Large-scale Japanese ASR Corpus on TV Recordings","date":"2021-03-26","arxiv_id":"2103.14736","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutually-constrained-monotonic-multihead","title":"Mutually-Constrained Monotonic Multihead Attention for Online ASR","date":"2021-03-26","arxiv_id":"2103.14302","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-improve-robustness-of-nlp","title":"An Approach to Improve Robustness of NLP Systems against ASR Errors","date":"2021-03-25","arxiv_id":"2103.13610","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-energy-based-models-for-end-to-end","title":"Residual Energy-Based Models for End-to-End Speech Recognition","date":"2021-03-25","arxiv_id":"2103.14152","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-privacy-with-smart-digital-assistants","title":"Voice Privacy with Smart Digital Assistants in Educational Settings","date":"2021-03-24","arxiv_id":"2104.11038","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-learning-rate-optimizers-for-deep","title":"Evolving Learning Rate Optimizers for Deep Neural Networks","date":"2021-03-23","arxiv_id":"2103.12623","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucination-of-speech-recognition-errors","title":"Hallucination of speech recognition errors with sequence to sequence learning","date":"2021-03-23","arxiv_id":"2103.12258","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-of-language-models-for","title":"Contextual Biasing of Language Models for Speech Recognition in Goal-Oriented Conversational Agents","date":"2021-03-18","arxiv_id":"2103.10325","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-rnn-transducer-technology-for","title":"Advancing RNN Transducer Technology for Speech Recognition","date":"2021-03-17","arxiv_id":"2103.09935","repositories_listed":0,"syntology":null},{"url":"/paper/transformer-based-asr-incorporating-time","slug":"transformer-based-asr-incorporating-time","title":"Transformer-based ASR Incorporating Time-reduction Layer and Fine-tuning with Self-Knowledge Distillation","date":"2021-03-17","arxiv_id":"2103.09903","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-learning-using-volunteer","title":"Distributed Deep Learning Using Volunteer Computing-Like Paradigm","date":"2021-03-16","arxiv_id":"2103.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-the-evaluation-of-simultaneous-speech","title":"Towards the evaluation of automatic simultaneous speech translation from a communicative perspective","date":"2021-03-15","arxiv_id":"2103.08364","repositories_listed":0,"syntology":null},{"url":null,"slug":"xlst-cross-lingual-self-training-to-learn","title":"XLST: Cross-lingual Self-training to Learn Multilingual Representation for Low Resource Speech Recognition","date":"2021-03-15","arxiv_id":"2103.08207","repositories_listed":0,"syntology":null},{"url":"/paper/edgecrnn-an-edgecomputing-oriented-model-of","slug":"edgecrnn-an-edgecomputing-oriented-model-of","title":"EdgeCRNN: an edgecomputing oriented model of acoustic feature enhancement for keyword spotting","date":"2021-03-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-optimisation-framework","title":"A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training","date":"2021-03-12","arxiv_id":"2103.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-acoustic-unit-augmentation-with-bpe","title":"Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource End-to-End Speech Recognition","date":"2021-03-12","arxiv_id":"2103.07186","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-guided-model-generalization-to","title":"Uncertainty-guided Model Generalization to Unseen Domains","date":"2021-03-12","arxiv_id":"2103.07531","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-word-level-confidence-for-subword","title":"Learning Word-Level Confidence For Subword End-to-End ASR","date":"2021-03-11","arxiv_id":"2103.06716","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-robust-accented-speech","title":"Best of Both Worlds: Robust Accented Speech Recognition with Adversarial Transfer Learning","date":"2021-03-10","arxiv_id":"2103.05834","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-of-pre-trained-end-to-end-speech","title":"Fine-tuning of Pre-trained End-to-end Speech Recognition with Generative Adversarial Networks","date":"2021-03-10","arxiv_id":"2103.13329","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-semi-supervised-learning-for-asr","title":"Contrastive Semi-supervised Learning for ASR","date":"2021-03-09","arxiv_id":"2103.05149","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-ultra-low-power-rnn-classifier-for-always","title":"An Ultra-low Power RNN Classifier for Always-On Voice Wake-Up Detection Robust to Real-World Scenarios","date":"2021-03-08","arxiv_id":"2103.04792","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-model-robustness-for-skill-routing-in","title":"Neural model robustness for skill routing in large-scale conversational AI systems: A design choice exploration","date":"2021-03-04","arxiv_id":"2103.03373","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-speech-separation-with-ad-hoc","title":"Continuous Speech Separation with Ad Hoc Microphone Arrays","date":"2021-03-03","arxiv_id":"2103.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-spatial-selective-auditory-attention-of","title":"The Spatial Selective Auditory Attention of Cochlear Implant Users in Different Conversational Sound Levels","date":"2021-03-03","arxiv_id":"2103.02703","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-running-speech-recognizer-an-end-to-end","title":"Incorporating VAD into ASR System by Multi-task Learning","date":"2021-03-02","arxiv_id":"2103.01661","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-knowledge-distillation-for-online","title":"Alignment Knowledge Distillation for Online Streaming Attention-based Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00422","repositories_listed":0,"syntology":null},{"url":null,"slug":"brain-signals-to-rescue-aphasia-apraxia-and","title":"Brain Signals to Rescue Aphasia, Apraxia and Dysarthria Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00383","repositories_listed":0,"syntology":null},{"url":null,"slug":"silent-versus-modal-multi-speaker-speech","title":"Silent versus modal multi-speaker speech recognition from ultrasound and video","date":"2021-02-27","arxiv_id":"2103.00333","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-for-improving-rare-word","title":"Meta-Learning for improving rare word recognition in end-to-end ASR","date":"2021-02-25","arxiv_id":"2102.12624","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixspeech-data-augmentation-for-low-resource","title":"MixSpeech: Data Augmentation for Low-resource Automatic Speech Recognition","date":"2021-02-25","arxiv_id":"2102.12664","repositories_listed":0,"syntology":null},{"url":"/paper/sep-28k-a-dataset-for-stuttering-event","slug":"sep-28k-a-dataset-for-stuttering-event","title":"SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter","date":"2021-02-24","arxiv_id":"2102.12394","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-using-multi-stage-self","title":"Speech Enhancement Using Multi-Stage Self-Attentive Temporal Convolutional Networks","date":"2021-02-24","arxiv_id":"2102.12078","repositories_listed":0,"syntology":null},{"url":null,"slug":"thoughts-on-the-potential-to-compensate-a","title":"Thoughts on the potential to compensate a hearing loss in noise","date":"2021-02-24","arxiv_id":"2102.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-dereverberation-beamforming-and","title":"End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend","date":"2021-02-23","arxiv_id":"2102.11525","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-optimization-of-contexts-for","title":"Evolutionary optimization of contexts for phonetic correction in speech recognition systems","date":"2021-02-23","arxiv_id":"2102.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-efficient-speech-recognition-on-smart","title":"Memory-efficient Speech Recognition on Smart Devices","date":"2021-02-23","arxiv_id":"2102.11531","repositories_listed":0,"syntology":null},{"url":null,"slug":"senone-aware-adversarial-multi-task-training","title":"Senone-aware Adversarial Multi-task Training for Unsupervised Child to Adult Speech Adaptation","date":"2021-02-23","arxiv_id":"2102.11488","repositories_listed":0,"syntology":null},{"url":null,"slug":"unidirectional-memory-self-attention","title":"Unidirectional Memory-Self-Attention Transducer for Online Speech Recognition","date":"2021-02-23","arxiv_id":"2102.11594","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-human-readable-transcript-for","title":"Generating Human Readable Transcript for Automatic Speech Recognition with Pre-trained Language Model","date":"2021-02-22","arxiv_id":"2102.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-use-of-voice-source-features-for-sung","title":"The Use of Voice Source Features for Sung Speech Recognition","date":"2021-02-20","arxiv_id":"2102.10376","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-neural-systems-for-automatic","title":"End-to-End Neural Systems for Automatic Children Speech Recognition: An Empirical Study","date":"2021-02-19","arxiv_id":"2102.09918","repositories_listed":0,"syntology":null},{"url":null,"slug":"echo-state-speech-recognition","title":"Echo State Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09114","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixing-errors-of-the-google-voice-recognizer","title":"Fixing Errors of the Google Voice Recognizer through Phonetic Distance Metrics","date":"2021-02-18","arxiv_id":"2102.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"fundamental-frequency-feature-normalization","title":"Fundamental Frequency Feature Normalization and Data Augmentation for Child Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09106","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-kernelized-self-attention-for-long","title":"Gaussian Kernelized Self-Attention for Long Sequence Data and Its Application to CTC-based Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09168","repositories_listed":0,"syntology":null},{"url":null,"slug":"atcspeechnet-a-multilingual-end-to-end-speech","title":"ATCSpeechNet: A multilingual end-to-end speech recognition framework for air traffic control systems","date":"2021-02-17","arxiv_id":"2102.08535","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-end-to-end-speech-recognition-models-care","title":"Do End-to-End Speech Recognition Models Care About Context?","date":"2021-02-17","arxiv_id":"2102.09928","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-based-multi-source-localization","title":"Deep Learning based Multi-Source Localization with Source Splitting and its Effectiveness in Multi-Talker Speech Recognition","date":"2021-02-16","arxiv_id":"2102.07955","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-automatic-speech-recognition-with","title":"End-to-End Automatic Speech Recognition with Deep Mutual Learning","date":"2021-02-16","arxiv_id":"2102.08154","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-transformer-based-large-context","title":"Hierarchical Transformer-based Large-Context End-to-end ASR with Large-Context Knowledge Distillation","date":"2021-02-16","arxiv_id":"2102.07935","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-models-with","title":"Improving speech recognition models with small samples for air traffic control systems","date":"2021-02-16","arxiv_id":"2102.08015","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-end-to-end-speech-recognition-via-non","title":"Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT","date":"2021-02-15","arxiv_id":"2102.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"jira-a-kurdish-speech-recognition-system","title":"Jira: a Kurdish Speech Recognition System Designing and Building Speech Corpus and Pronunciation Lexicon","date":"2021-02-15","arxiv_id":"2102.07412","repositories_listed":0,"syntology":null}],"record_sha256":"fb160726ed2728ecd3875e7fd65a2ff2e0cb980ee2ac7c0e56ccbb9934a32ddd","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}