{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition-2/papers/21","list_of":"/task/automatic-speech-recognition-2","task":"Automatic Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":21,"pages_in_order":32,"rows_per_page":100,"rows":[2001,2100],"of":3174,"counts":{"archive_papers_tagged":3174,"with_a_code_link":677,"where_syntology_ran_a_sample":79,"not_listed_spam_title":0,"listed":3174,"listed_where_code_ran":79,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":62,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":62,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition-2","prev":"/task/automatic-speech-recognition-2/papers/20","next":"/task/automatic-speech-recognition-2/papers/22","papers":[{"url":null,"slug":"pm-mmut-boosted-phone-mask-data-augmentation","title":"PM-MMUT: Boosted Phone-Mask Data Augmentation using Multi-Modeling Unit Training for Phonetic-Reduction-Robust E2E Speech Recognition","date":"2021-12-13","arxiv_id":"2112.06721","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-code-switching-language-modeling","title":"Improving Code-switching Language Modeling with Artificially Generated Texts using Cycle-consistent Adversarial Networks","date":"2021-12-12","arxiv_id":"2112.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-on-noisy-speech","title":"Improving Speech Recognition on Noisy Speech via Speech Enhancement with Multi-Discriminators CycleGAN","date":"2021-12-12","arxiv_id":"2112.06309","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-a-great-multi-lingual-teacher-with","title":"Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition","date":"2021-12-10","arxiv_id":"2112.05820","repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-speech-separation-for-automatic","title":"Directed Speech Separation for Automatic Speech Recognition of Long Form Conversational Speech","date":"2021-12-10","arxiv_id":"2112.05863","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-boundary-between-asr-and-nlu","title":"Revisiting the Boundary between ASR and NLU in the Age of Conversational Dialog Systems","date":"2021-12-10","arxiv_id":"2112.05842","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-level-self-learning-with-multiple","title":"Sequence-level self-learning with multiple hypotheses","date":"2021-12-10","arxiv_id":"2112.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-native-american-english-speech","title":"A study on native American English speech recognition by Indian listeners with varying word familiarity level","date":"2021-12-08","arxiv_id":"2112.04151","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbs-kws-the-mandarin-keyword-spotting-system","title":"BBS-KWS:The Mandarin Keyword Spotting System Won the Video Keyword Wakeup Challenge","date":"2021-12-03","arxiv_id":"2112.01757","repositories_listed":0,"syntology":null},{"url":null,"slug":"blackbox-untargeted-adversarial-testing-of","title":"Catch Me If You Can: Blackbox Adversarial Attacks on Automatic Speech Recognition using Frequency Masking","date":"2021-12-03","arxiv_id":"2112.01821","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-higher-order-minkowski-loss-for-improved","title":"A higher order Minkowski loss for improved prediction ability of acoustic model in ASR","date":"2021-12-02","arxiv_id":"2112.01023","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mixture-of-expert-based-deep-neural-network","title":"A Mixture of Expert Based Deep Neural Network for Improved ASR","date":"2021-12-02","arxiv_id":"2112.01025","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-landscape-dependent-self-adjusting","title":"Loss Landscape Dependent Self-Adjusting Learning Rates in Decentralized Stochastic Gradient Descent","date":"2021-12-02","arxiv_id":"2112.01433","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-experiment-on-speech-to-text-translation","title":"An Experiment on Speech-to-Text Translation Systems for Manipuri to English on Low Resource Setting","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-hybrid-architectures-for","title":"An Investigation of Hybrid architectures for Low Resource Multilingual Speech Recognition system in Indian context","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-manipuri-tones-in-manito-a-tonal","title":"Analysis of Manipuri Tones in ManiTo: A Tonal Contrast Database","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ie-cps-lexicon-an-automatic-speech","title":"IE-CPS Lexicon: An Automatic Speech Recognition Oriented Indian-English Pronunciation Dictionary","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improve-sinhala-speech-recognition-through","title":"Improve Sinhala Speech Recognition Through e2e LF-MMI Model","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-lexical-skills-from-oral-reading","title":"Predicting lexical skills from oral reading with acoustic measures","date":"2021-12-01","arxiv_id":"2112.00635","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-t-transducer-for-text-to-speech-and","title":"Speech-T: Transducer for Text to Speech and Beyond","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/do-we-still-need-automatic-speech-recognition","slug":"do-we-still-need-automatic-speech-recognition","title":"Do We Still Need Automatic Speech Recognition for Spoken Language Understanding?","date":"2021-11-29","arxiv_id":"2111.14842","repositories_listed":0,"syntology":null},{"url":null,"slug":"effect-of-noise-suppression-losses-on-speech","title":"Effect of noise suppression losses on speech distortion and ASR performance","date":"2021-11-23","arxiv_id":"2111.11606","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-channel-multi-speaker-asr-using-3d","title":"Multi-Channel Multi-Speaker ASR Using 3D Spatial Feature","date":"2021-11-22","arxiv_id":"2111.11023","repositories_listed":0,"syntology":null},{"url":null,"slug":"capitalization-and-punctuation-restoration-a","title":"Capitalization and Punctuation Restoration: a Survey","date":"2021-11-21","arxiv_id":"2111.10746","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-spoken-keyword-spotting-an-overview","title":"Deep Spoken Keyword Spotting: An Overview","date":"2021-11-20","arxiv_id":"2111.10592","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-independent-vector-analysis-and-its","title":"Switching Independent Vector Analysis and Its Extension to Blind and Spatially Guided Convolutional Beamforming Algorithms","date":"2021-11-20","arxiv_id":"2111.10574","repositories_listed":0,"syntology":null},{"url":null,"slug":"lattention-lattice-attention-in-asr-rescoring","title":"Lattention: Lattice-attention in ASR rescoring","date":"2021-11-19","arxiv_id":"2111.10157","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conformer-based-asr-frontend-for-joint","title":"A Conformer-based ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement and Speech Separation","date":"2021-11-18","arxiv_id":"2111.09935","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-measuring-fairness-in-speech","title":"Towards Measuring Fairness in Speech Recognition: Casual Conversations Dataset Transcriptions","date":"2021-11-18","arxiv_id":"2111.09983","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-end-to-end-capt-system-for-l2","title":"A Novel End-to-End CAPT System for L2 Children Learners","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-language-model-optimization-in","title":"Heterogeneous Language Model Optimization in Automatic Speech Recognition","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multimodal-speech-recognition-by","title":"Improving Multimodal Speech Recognition by Data Augmentation and Speech Representations","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-spoken-language-understanding-systems-for","title":"On Spoken Language Understanding Systems for Low Resourced Languages","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-down-sampling-for-acoustic","title":"Progressive Down-Sampling for Acoustic Encoding","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-to-sql-parsing-error-correction-with","title":"Speech-to-SQL Parsing: Error Correction with Multi-modal Representations","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"two-front-ends-one-model-fusing-heterogeneous","title":"Two Front-Ends, One Model : Fusing Heterogeneous Speech Features for Low Resource ASR with Multilingual Pre-Training","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"who-are-we-talking-about-handling-person","title":"Who Are We Talking About? Handling Person Names in Speech Translation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-end-to-end-speech-recognition-1","title":"Attention based end to end Speech Recognition for Voice Search in Hindi and English","date":"2021-11-15","arxiv_id":"2111.10208","repositories_listed":0,"syntology":null},{"url":null,"slug":"prediction-of-listener-perception-of","title":"Prediction of Listener Perception of Argumentative Speech in a Crowdsourced Dataset Using (Psycho-)Linguistic and Fluency Features","date":"2021-11-13","arxiv_id":"2111.07130","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-normalized-importance-sampling-for","title":"Self-Normalized Importance Sampling for Neural Language Modeling","date":"2021-11-11","arxiv_id":"2111.06310","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-asr-improves-zero-and-few-shot","title":"Scaling ASR Improves Zero and Few Shot Learning","date":"2021-11-10","arxiv_id":"2111.05948","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-attacks-for-automatic-speech","title":"Privacy attacks for automatic speech recognition acoustic models in a federated learning framework","date":"2021-11-06","arxiv_id":"2111.03777","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformer-based-hybrid-asr-system-for","title":"Conformer-based Hybrid ASR System for Switchboard Dataset","date":"2021-11-05","arxiv_id":"2111.03442","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-transformer-transducer-for","title":"Context-Aware Transformer Transducer for Speech Recognition","date":"2021-11-05","arxiv_id":"2111.03250","repositories_listed":0,"syntology":null},{"url":null,"slug":"conversational-speech-recognition-leveraging","title":"Effective Cross-Utterance Language Modeling for Conversational Speech Recognition","date":"2021-11-05","arxiv_id":"2111.03333","repositories_listed":0,"syntology":null},{"url":"/paper/a-fine-tuned-wav2vec-2-0-hubert-benchmark-for","slug":"a-fine-tuned-wav2vec-2-0-hubert-benchmark-for","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","date":"2021-11-04","arxiv_id":"2111.02735","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-for-air-traffic-control","title":"Speech recognition for air traffic control via feature learning and end-to-end training","date":"2021-11-04","arxiv_id":"2111.02654","repositories_listed":0,"syntology":null},{"url":null,"slug":"stc-speaker-recognition-systems-for-the-nist","title":"STC speaker recognition systems for the NIST SRE 2021","date":"2021-11-03","arxiv_id":"2111.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-in-end-to-end-automatic","title":"Recent Advances in End-to-End Automatic Speech Recognition","date":"2021-11-02","arxiv_id":"2111.01690","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-data-relabeling-for-robust-and","title":"Collaborative Data Relabeling for Robust and Diverse Voice Apps Recommendation in Intelligent Personal Assistants","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-punctuation-restoration-for","title":"Comprehensive Punctuation Restoration for English and Polish","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"indic-languages-automatic-speech-recognition","title":"Indic Languages Automatic Speech Recognition using Meta-Learning Approach","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-transduction-with-graph-based","title":"Sequence Transduction with Graph-based Supervision","date":"2021-11-01","arxiv_id":"2111.01272","repositories_listed":0,"syntology":null},{"url":null,"slug":"snri-target-training-for-joint-speech","title":"SNRi Target Training for Joint Speech Enhancement and Recognition","date":"2021-11-01","arxiv_id":"2111.00764","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-technology-for-everyone-automatic-1","title":"Speech Technology for Everyone: Automatic Speech Recognition for Non-Native English","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-query-auto-completion","title":"Voice Query Auto Completion","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-attention-conformer-for-context","title":"Cross-attention conformer for context modeling in speech enhancement for ASR","date":"2021-10-30","arxiv_id":"2111.00127","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-conditioning-of-acoustic-models-using","title":"Speaker conditioning of acoustic models using affine transformation for multi-speaker speech recognition","date":"2021-10-30","arxiv_id":"2111.00320","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusing-asr-outputs-in-joint-training-for","title":"Fusing ASR Outputs in Joint Training for Speech Emotion Recognition","date":"2021-10-29","arxiv_id":"2110.15684","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-noise-robustness-of-contrastive","title":"Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction","date":"2021-10-28","arxiv_id":"2110.15430","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-decentralized-distributed","title":"Asynchronous Decentralized Distributed Training of Acoustic Models","date":"2021-10-21","arxiv_id":"2110.11199","repositories_listed":0,"syntology":null},{"url":null,"slug":"synt-utilizing-imperfect-synthetic-data-to","title":"Synt++: Utilizing Imperfect Synthetic Data to Improve Speech Recognition","date":"2021-10-21","arxiv_id":"2110.11479","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-enhancing-ctc-model-for","title":"An Investigation of Enhancing CTC Model for Triggered Attention-based Streaming ASR","date":"2021-10-20","arxiv_id":"2110.10402","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-model-to-enhance-them-all-array-geometry","title":"One model to enhance them all: array geometry agnostic multi-channel personalized speech enhancement","date":"2021-10-20","arxiv_id":"2110.10330","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-pattern-based-black-box-model","title":"Speech Pattern based Black-box Model Watermarking for Automatic Speech Recognition","date":"2021-10-19","arxiv_id":"2110.09814","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-learning-of-subword-dependent-model","title":"Automatic Learning of Subword Dependent Model Scales","date":"2021-10-18","arxiv_id":"2110.09324","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-sequence-training-of-attention","title":"Efficient Sequence Training of Attention Models using Approximative Recombination","date":"2021-10-18","arxiv_id":"2110.09245","repositories_listed":0,"syntology":null},{"url":null,"slug":"intent-classification-using-pre-trained","title":"Intent Classification Using Pre-trained Language Agnostic Embeddings For Low Resource Languages","date":"2021-10-18","arxiv_id":"2110.09264","repositories_listed":0,"syntology":null},{"url":null,"slug":"virapart-a-text-refinement-framework-for-asr","title":"ViraPart: A Text Refinement Framework for Automatic Speech Recognition and Natural Language Processing Tasks in Persian","date":"2021-10-18","arxiv_id":"2110.09086","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-speech-recognition-using","title":"Multilingual Speech Recognition using Knowledge Transfer across Learning Processes","date":"2021-10-15","arxiv_id":"2110.07909","repositories_listed":0,"syntology":null},{"url":null,"slug":"omni-sparsity-dnn-fast-sparsity-optimization","title":"Omni-sparsity DNN: Fast Sparsity Optimization for On-Device Streaming E2E ASR via Supernet","date":"2021-10-15","arxiv_id":"2110.08352","repositories_listed":0,"syntology":null},{"url":"/paper/sub-word-level-lip-reading-with-visual","slug":"sub-word-level-lip-reading-with-visual","title":"Sub-word Level Lip Reading With Visual Attention","date":"2021-10-14","arxiv_id":"2110.07603","repositories_listed":0,"syntology":null},{"url":null,"slug":"all-neural-beamformer-for-continuous-speech","title":"All-neural beamformer for continuous speech separation","date":"2021-10-13","arxiv_id":"2110.06428","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-learning-using-lattice-free-mmi-for","title":"Continual learning using lattice-free MMI for speech recognition","date":"2021-10-13","arxiv_id":"2110.07055","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-domain-adaptation-of-language-1","title":"Prompt-tuning in ASR systems for efficient domain-adaptation","date":"2021-10-13","arxiv_id":"2110.06502","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-character-error-rate-is-not-equal","title":"Improving Character Error Rate Is Not Equal to Having Clean Speech: Speech Enhancement for ASR Systems with Black-box Acoustic Models","date":"2021-10-12","arxiv_id":"2110.05968","repositories_listed":0,"syntology":null},{"url":null,"slug":"word-order-does-not-matter-for-speech","title":"Word Order Does Not Matter For Speech Recognition","date":"2021-10-12","arxiv_id":"2110.05994","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-on-non-autoregressive","title":"A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation","date":"2021-10-11","arxiv_id":"2110.05249","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-momentum-pseudo-labeling-with","title":"Advancing Momentum Pseudo-Labeling with Conformer and Initialization Strategy","date":"2021-10-11","arxiv_id":"2110.04948","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-user-perception-of-speech","title":"Evaluating User Perception of Speech Recognition System Quality with Semantic Distance Metric","date":"2021-10-11","arxiv_id":"2110.05376","repositories_listed":0,"syntology":null},{"url":null,"slug":"sru-pioneering-fast-recurrence-with-attention","title":"SRU++: Pioneering Fast Recurrence with Attention for Speech Recognition","date":"2021-10-11","arxiv_id":"2110.05571","repositories_listed":0,"syntology":null},{"url":null,"slug":"wav2vec-switch-contrastive-learning-from","title":"Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs for Robust Speech Recognition","date":"2021-10-11","arxiv_id":"2110.04934","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalizing-asr-with-limited-data-using","title":"DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation","date":"2021-10-10","arxiv_id":"2110.04908","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-high-fidelity-singing-voice","title":"Towards High-fidelity Singing Voice Conversion with Acoustic Reference and Contrastive Predictive Coding","date":"2021-10-10","arxiv_id":"2110.04754","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-exploration-of-self-supervised-pretrained","title":"An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition","date":"2021-10-09","arxiv_id":"2110.04590","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-with-locally-time-reversed","title":"Data Augmentation with Locally-time Reversed Speech for Automatic Speech Recognition","date":"2021-10-09","arxiv_id":"2110.04511","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-automatic-speech-recognition","title":"Personalized Automatic Speech Recognition Trained on Small Disordered Speech Datasets","date":"2021-10-09","arxiv_id":"2110.04612","repositories_listed":0,"syntology":null},{"url":null,"slug":"wav2vec-s-semi-supervised-pre-training-for","title":"Wav2vec-S: Semi-Supervised Pre-Training for Low-Resource ASR","date":"2021-10-09","arxiv_id":"2110.04484","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-genetic-programming-approach-to-zero-shot","title":"A Genetic Programming Approach To Zero-Shot Neural Architecture Ranking","date":"2021-10-08","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-heterogeneous-characteristics-of","title":"Exploring Heterogeneous Characteristics of Layers in ASR Models for More Efficient Training","date":"2021-10-08","arxiv_id":"2110.04267","repositories_listed":0,"syntology":null},{"url":null,"slug":"input-length-matters-an-empirical-study-of","title":"Input Length Matters: Improving RNN-T and MWER Training for Long-form Telephony Speech Recognition","date":"2021-10-08","arxiv_id":"2110.03841","repositories_listed":0,"syntology":null},{"url":null,"slug":"scala-supervised-contrastive-learning-for-end","title":"SCaLa: Supervised Contrastive Learning for End-to-End Speech Recognition","date":"2021-10-08","arxiv_id":"2110.04187","repositories_listed":0,"syntology":null},{"url":null,"slug":"accent-robust-automatic-speech-recognition","title":"Accent-Robust Automatic Speech Recognition Using Supervised and Unsupervised Wav2vec Embeddings","date":"2021-10-07","arxiv_id":"2110.03520","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-on-device-training-of-speech","title":"Enabling On-Device Training of Speech Recognition Models with Federated Dropout","date":"2021-10-07","arxiv_id":"2110.03634","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-confidence-estimation-on-out-of","title":"Improving Confidence Estimation on Out-of-Domain Data for End-to-End Speech Recognition","date":"2021-10-07","arxiv_id":"2110.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-for-neural-transducers","title":"Knowledge Distillation for Neural Transducers from Large Self-Supervised Pre-trained Models","date":"2021-10-07","arxiv_id":"2110.03334","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-dust-for-cross-lingual-adaptation-of","title":"Magic dust for cross-lingual adaptation of monolingual wav2vec-2.0","date":"2021-10-07","arxiv_id":"2110.03560","repositories_listed":0,"syntology":null},{"url":null,"slug":"transcribe-to-diarize-neural-speaker","title":"Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR","date":"2021-10-07","arxiv_id":"2110.03151","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctc-variations-through-new-wfst-topologies","title":"CTC Variations Through New WFST Topologies","date":"2021-10-06","arxiv_id":"2110.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-adaptation-with-text","title":"Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition","date":"2021-10-06","arxiv_id":"2110.05354","repositories_listed":0,"syntology":null}],"record_sha256":"dd4b5dde31a5dd086f0d763248349d5d40e317a6f8626ed3fb8af59898ee25e9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}