{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition/papers/17","list_of":"/task/automatic-speech-recognition","task":"Automatic Speech Recognition (ASR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":17,"pages_in_order":31,"rows_per_page":100,"rows":[1601,1700],"of":3012,"counts":{"archive_papers_tagged":3012,"with_a_code_link":622,"where_syntology_ran_a_sample":77,"not_listed_spam_title":0,"listed":3012,"listed_where_code_ran":77,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":13,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":13,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition","prev":"/task/automatic-speech-recognition/papers/16","next":"/task/automatic-speech-recognition/papers/18","papers":[{"url":null,"slug":"jhu-iwslt-2022-dialect-speech-translation","title":"JHU IWSLT 2022 Dialect Speech Translation System Description","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mtl-slt-multi-task-learning-for-spoken","title":"MTL-SLT: Multi-Task Learning for Spoken Language Tasks","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nvidia-nemo-offline-speech-translation","title":"NVIDIA NeMo Offline Speech Translation Systems for IWSLT 2022","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"phoneme-transcription-of-endangered-languages","title":"Phoneme transcription of endangered languages: an evaluation of recent ASR architectures in the single speaker scenario","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ssncse-nlp-lt-edi-acl2022-speech-recognition","title":"SSNCSE_NLP@LT-EDI-ACL2022: Speech Recognition for Vulnerable Individuals in Tamil using pre-trained XLSR models","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"suh-asr-lt-edi-acl2022-transformer-based","title":"SUH_ASR@LT-EDI-ACL2022: Transformer based Approach for Speech Recognition for Vulnerable Individuals in Tamil","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-hw-tscs-offline-speech-translation-system","title":"The HW-TSC’s Offline Speech Translation System for IWSLT 2022 Evaluation","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-xiaomi-text-to-text-simultaneous-speech","title":"The Xiaomi Text-to-Text Simultaneous Speech Translation System for IWSLT 2022","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-scalar-prediction-for-improving-robust","title":"Mask scalar prediction for improving robust automatic speech recognition","date":"2022-04-26","arxiv_id":"2204.12092","repositories_listed":0,"syntology":null},{"url":null,"slug":"cleanformer-a-microphone-array-configuration","title":"Cleanformer: A multichannel array configuration-invariant neural enhancement frontend for ASR in smart speakers","date":"2022-04-25","arxiv_id":"2204.11933","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-far-field-speech-recognition-using","title":"Improved far-field speech recognition using Joint Variational Autoencoder","date":"2022-04-24","arxiv_id":"2204.11286","repositories_listed":0,"syntology":null},{"url":null,"slug":"wabert-a-low-resource-end-to-end-model-for","title":"WaBERT: A Low-resource End-to-end Model for Spoken Language Understanding and Speech-to-BERT Alignment","date":"2022-04-22","arxiv_id":"2204.10461","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-monotonic-transducers-for","title":"An Investigation of Monotonic Transducers for Large-Scale Automatic Speech Recognition","date":"2022-04-19","arxiv_id":"2204.08858","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockwise-streaming-transformer-for-spoken","title":"Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation","date":"2022-04-19","arxiv_id":"2204.08920","repositories_listed":0,"syntology":null},{"url":null,"slug":"disappeared-command-spoofing-attack-on","title":"Disappeared Command: Spoofing Attack On Automatic Speech Recognition Systems with Sound Masking","date":"2022-04-19","arxiv_id":"2204.08977","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-speech-tools-for-helping","title":"Automated speech tools for helping communities process restricted-access corpora for language revival efforts","date":"2022-04-15","arxiv_id":"2204.07272","repositories_listed":0,"syntology":null},{"url":null,"slug":"lombard-effect-for-bilingual-speakers-in","title":"Lombard Effect for Bilingual Speakers in Cantonese and English: importance of spectro-temporal features","date":"2022-04-14","arxiv_id":"2204.06907","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-cascaded-encoder-asr-model-for","title":"A Unified Cascaded Encoder ASR Model for Dynamic Model Sizes","date":"2022-04-13","arxiv_id":"2204.06164","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-critical-sequence-training-for-automatic","title":"Self-critical Sequence Training for Automatic Speech Recognition","date":"2022-04-13","arxiv_id":"2204.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"study-of-indian-english-pronunciation","title":"Study of Indian English Pronunciation Variabilities relative to Received Pronunciation","date":"2022-04-13","arxiv_id":"2204.06502","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-in-german-a-detailed-error-analysis","title":"ASR in German: A Detailed Error Analysis","date":"2022-04-12","arxiv_id":"2204.05617","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-an-asr-error-robust-spoken-virtual","title":"Building an ASR Error Robust Spoken Virtual Patient System in a Highly Class-Imbalanced Scenario Without Speech Data","date":"2022-04-11","arxiv_id":"2204.05183","repositories_listed":0,"syntology":null},{"url":null,"slug":"auditory-based-data-augmentation-for-end-to","title":"Auditory-Based Data Augmentation for End-to-End Automatic Speech Recognition","date":"2022-04-08","arxiv_id":"2204.04284","repositories_listed":0,"syntology":null},{"url":null,"slug":"defense-against-adversarial-attacks-on-hybrid","title":"Defense against Adversarial Attacks on Hybrid Speech Recognition using Joint Adversarial Fine-tuning with Denoiser","date":"2022-04-08","arxiv_id":"2204.03851","repositories_listed":0,"syntology":null},{"url":null,"slug":"three-module-modeling-for-end-to-end-spoken","title":"Three-Module Modeling For End-to-End Spoken Language Understanding Using Pre-trained DNN-HMM-Based Acoustic-Phonetic Model","date":"2022-04-07","arxiv_id":"2204.03315","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-self-supervised-learning-solve-the","title":"A Wav2vec2-Based Experimental Study on Self-Supervised Learning Methods to Improve Child Speech Recognition","date":"2022-04-06","arxiv_id":"2204.05419","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-direct-speech-to-speech-translation","title":"Enhanced Direct Speech-to-Speech Translation Using Self-supervised Pre-training and Data Augmentation","date":"2022-04-06","arxiv_id":"2204.02967","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-complementary-joint-training-approach-using","title":"A Complementary Joint Training Approach Using Unpaired Speech and Text for Low-Resource Automatic Speech Recognition","date":"2022-04-05","arxiv_id":"2204.02023","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-multi-channel-speech-separation","title":"Audio-visual multi-channel speech separation, dereverberation and recognition","date":"2022-04-05","arxiv_id":"2204.01977","repositories_listed":0,"syntology":null},{"url":null,"slug":"hear-no-evil-towards-adversarial-robustness","title":"Hear No Evil: Towards Adversarial Robustness of Automatic Speech Recognition via Multi-Task Learning","date":"2022-04-05","arxiv_id":"2204.02381","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-data-selection-via-discrete","title":"Unsupervised Data Selection via Discrete Speech Representation for ASR","date":"2022-04-05","arxiv_id":"2204.01981","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-gender-impact-in-self-supervised","title":"A Study of Gender Impact in Self-supervised Models for Speech-to-Text Systems","date":"2022-04-04","arxiv_id":"2204.01397","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-joint-speech-text-embeddings-for","title":"An Analysis of Semantically-Aligned Speech-Text Embeddings","date":"2022-04-04","arxiv_id":"2204.01235","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-self-supervised-speech","title":"Cross-lingual Self-Supervised Speech Representations for Improved Dysarthric Speech Recognition","date":"2022-04-04","arxiv_id":"2204.01670","repositories_listed":0,"syntology":null},{"url":null,"slug":"deliberation-model-for-on-device-spoken","title":"Deliberation Model for On-Device Spoken Language Understanding","date":"2022-04-04","arxiv_id":"2204.01893","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-model-for-named-entity-recognition","title":"End-to-end model for named entity recognition from speech without paired training data","date":"2022-04-02","arxiv_id":"2204.00803","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-real-time-personalized-speech","title":"Fast Real-time Personalized Speech Enhancement: End-to-End Enhancement Network (E3Net) and Knowledge Distillation","date":"2022-04-02","arxiv_id":"2204.00771","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-integration-of-speech-recognition","title":"End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation","date":"2022-04-01","arxiv_id":"2204.00540","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-multi-speaker-asr-with-independent","title":"End-to-End Multi-speaker ASR with Independent Vector Analysis","date":"2022-04-01","arxiv_id":"2204.00218","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-sequence-intermediate-conditioning-for","title":"Alternate Intermediate Conditioning with Syllable-level and Character-level Targets for Japanese ASR","date":"2022-04-01","arxiv_id":"2204.00175","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-rnn-t-with-semantic-decoder-for","title":"Multi-task RNN-T with Semantic Decoder for Streamable Spoken Language Understanding","date":"2022-04-01","arxiv_id":"2204.00558","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-speech-emotion-recognition","title":"Probing Speech Emotion Recognition Transformers for Linguistic Knowledge","date":"2022-04-01","arxiv_id":"2204.00400","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-speech-data-augmentation-for-low","title":"Text-To-Speech Data Augmentation for Low Resource Speech Recognition","date":"2022-04-01","arxiv_id":"2204.00291","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-cross-lingual-aphasia-detection","title":"Zero-Shot Cross-lingual Aphasia Detection using Automatic Speech Recognition","date":"2022-04-01","arxiv_id":"2204.00448","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-on-speaker-attributed","title":"A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings","date":"2022-03-31","arxiv_id":"2203.16834","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-the-factors-affecting-usefulness-of","title":"Analyzing the factors affecting usefulness of Self-Supervised Pre-trained Representations for Speech Recognition","date":"2022-03-31","arxiv_id":"2203.16973","repositories_listed":0,"syntology":null},{"url":null,"slug":"effectiveness-of-text-to-speech-pseudo-labels","title":"Effectiveness of text to speech pseudo labels for forced alignment and cross lingual pretrained models for low resource speech recognition","date":"2022-03-31","arxiv_id":"2203.16823","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-of-different-temporal-modulations","title":"Importance of Different Temporal Modulations of Speech: A Tale of Two Perspectives","date":"2022-03-31","arxiv_id":"2204.00065","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-efficient-training-of-rnn-transducer","title":"Memory-Efficient Training of RNN-Transducer with Sampled Softmax","date":"2022-03-31","arxiv_id":"2203.16868","repositories_listed":0,"syntology":null},{"url":"/paper/open-source-magicdata-ramc-a-rich-annotated","slug":"open-source-magicdata-ramc-a-rich-annotated","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","date":"2022-03-31","arxiv_id":"2203.16844","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-switched-and-code-mixed-speech","title":"Code Switched and Code Mixed Speech Recognition for Indic languages","date":"2022-03-30","arxiv_id":"2203.16578","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-domain-adaptation-for-asr-with-full","title":"Federated Domain Adaptation for ASR with Full Self-Supervision","date":"2022-03-30","arxiv_id":"2203.15966","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-for-indic","title":"Improving Speech Recognition for Indic Languages using Language Model","date":"2022-03-30","arxiv_id":"2203.16595","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-word-error-rate-a-good-evaluation-metric","title":"Is Word Error Rate a good evaluation metric for Speech Recognition in Indic Languages?","date":"2022-03-30","arxiv_id":"2203.16601","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-latency-for-ctc-based-streaming","title":"Dynamic Latency for CTC-Based Streaming Automatic Speech Recognition With Emformer","date":"2022-03-29","arxiv_id":"2203.15613","repositories_listed":0,"syntology":null},{"url":null,"slug":"frequency-directional-attention-model-for","title":"Frequency-Directional Attention Model for Multilingual Automatic Speech Recognition","date":"2022-03-29","arxiv_id":"2203.15473","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-deep-neural","title":"Improving Generalization of Deep Neural Network Acoustic Models with Length Perturbation and N-best Based Label Smoothing","date":"2022-03-29","arxiv_id":"2203.15176","repositories_listed":0,"syntology":null},{"url":null,"slug":"mel-frequency-spectral-domain-defenses","title":"Mel Frequency Spectral Domain Defenses against Adversarial Attacks on Speech Recognition Systems","date":"2022-03-29","arxiv_id":"2203.15283","repositories_listed":0,"syntology":null},{"url":null,"slug":"short-term-word-learning-in-a-dynamically","title":"Short-Term Word-Learning in a Dynamically Changing Environment","date":"2022-03-29","arxiv_id":"2203.15404","repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-dataset-on-acoustic-models-for","title":"Impact of Dataset on Acoustic Models for Automatic Speech Recognition","date":"2022-03-25","arxiv_id":"2203.13590","repositories_listed":0,"syntology":null},{"url":null,"slug":"computing-optimal-location-of-microphone-for","title":"Computing Optimal Location of Microphone for Improved Speech Recognition","date":"2022-03-24","arxiv_id":"2203.13259","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangleing-content-and-fine-grained","title":"Disentangleing Content and Fine-grained Prosody Information via Hybrid ASR Bottleneck Features for Voice Conversion","date":"2022-03-24","arxiv_id":"2203.12813","repositories_listed":0,"syntology":null},{"url":null,"slug":"lahjoita-puhetta-a-large-scale-corpus-of","title":"Lahjoita puhetta -- a large-scale corpus of spoken Finnish with some benchmarks","date":"2022-03-24","arxiv_id":"2203.12906","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-text-to-speech-pipeline-evaluation","title":"A Text-to-Speech Pipeline, Evaluation Methodology, and Initial Fine-Tuning Results for Child Speech Synthesis","date":"2022-03-22","arxiv_id":"2203.11562","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-robust-spoken-language-understanding","title":"Building Robust Spoken Language Understanding by Cross Attention between Phoneme Sequence and ASR Hypothesis","date":"2022-03-22","arxiv_id":"2203.12067","repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudo-label-is-better-than-human-label","title":"Pseudo Label Is Better Than Human Label","date":"2022-03-22","arxiv_id":"2203.12668","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-cross-domain-acoustic-to","title":"Exploiting Cross Domain Acoustic-to-articulatory Inverted Features For Disordered Speech Recognition","date":"2022-03-19","arxiv_id":"2203.10274","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-representative-subset-selection-for","title":"Representative Subset Selection for Efficient Fine-Tuning in Self-Supervised Speech Recognition","date":"2022-03-18","arxiv_id":"2203.09829","repositories_listed":0,"syntology":null},{"url":null,"slug":"prediction-of-speech-intelligibility-with-dnn","title":"Prediction of speech intelligibility with DNN-based performance measures","date":"2022-03-17","arxiv_id":"2203.09148","repositories_listed":0,"syntology":null},{"url":null,"slug":"whither-the-priors-for-vocal-interactivity","title":"Whither the Priors for (Vocal) Interactivity?","date":"2022-03-16","arxiv_id":"2203.08578","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-modification-based-data-augmentation","title":"Spectral Modification Based Data Augmentation For Improving End-to-End ASR For Children's Speech","date":"2022-03-13","arxiv_id":"2203.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-streaming-asr-with","title":"Transformer-based Streaming ASR with Cumulative Attention","date":"2022-03-11","arxiv_id":"2203.05736","repositories_listed":0,"syntology":null},{"url":null,"slug":"attacks-as-defenses-designing-robust-audio","title":"Attacks as Defenses: Designing Robust Audio CAPTCHAs Using Attacks on Automatic Speech Recognition Systems","date":"2022-03-10","arxiv_id":"2203.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-framework-for-multi-domain-speech","title":"A practical framework for multi-domain speech recognition and an instance sampling method to neural language modeling","date":"2022-03-09","arxiv_id":"2203.04767","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-french-speech-recognition-system-for","title":"Which French speech recognition system for assistant robots?","date":"2022-03-04","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conformer-based-acoustic-model-for-robust","title":"A Conformer Based Acoustic Model for Robust Automatic Speech Recognition","date":"2022-03-01","arxiv_id":"2203.00725","repositories_listed":0,"syntology":null},{"url":null,"slug":"extended-graph-temporal-classification-for","title":"Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR","date":"2022-03-01","arxiv_id":"2203.00232","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-the-impact-of-individual-domain","title":"Measuring the Impact of Individual Domain Factors in Self-Supervised Pre-Training","date":"2022-03-01","arxiv_id":"2203.00648","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-text-inputs-for-training-and","title":"Integrating Text Inputs For Training and Adapting RNN Transducer ASR Models","date":"2022-02-26","arxiv_id":"2202.13155","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-multilingual-models-for-automatic","title":"A Survey of Multilingual Models for Automatic Speech Recognition","date":"2022-02-25","arxiv_id":"2202.12576","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-technology-practitioners-as-language","title":"Language technology practitioners as language managers: arbitrating data bias and predictive bias in ASR","date":"2022-02-25","arxiv_id":"2202.12603","repositories_listed":0,"syntology":null},{"url":null,"slug":"ask2mask-guided-data-selection-for-masked-1","title":"Ask2Mask: Guided Data Selection for Masked Speech Modeling","date":"2022-02-24","arxiv_id":"2202.12719","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-better-meta-initialization-with-task","title":"Towards Better Meta-Initialization with Task Augmentation for Kindergarten-aged Speech Recognition","date":"2022-02-24","arxiv_id":"2202.12326","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-speaker-anonymization","title":"Differentially Private Speaker Anonymization","date":"2022-02-23","arxiv_id":"2202.11823","repositories_listed":0,"syntology":null},{"url":null,"slug":"korean-tokenization-for-beam-search-rescoring","title":"Korean Tokenization for Beam Search Rescoring in Speech Recognition","date":"2022-02-22","arxiv_id":"2203.03583","repositories_listed":0,"syntology":null},{"url":null,"slug":"vadoi-voice-activity-detection-overlapping","title":"VADOI:Voice-Activity-Detection Overlapping Inference For End-to-end Long-form Speech Recognition","date":"2022-02-22","arxiv_id":"2202.10593","repositories_listed":0,"syntology":null},{"url":null,"slug":"r-g2p-evaluating-and-enhancing-robustness-of","title":"r-G2P: Evaluating and Enhancing Robustness of Grapheme to Phoneme Conversion by Controlled noise introducing and Contextual information incorporation","date":"2022-02-21","arxiv_id":"2202.11194","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-adaptation-using-spectro-temporal","title":"Speaker Adaptation Using Spectro-Temporal Deep Features for Dysarthric and Elderly Speech Recognition","date":"2022-02-21","arxiv_id":"2202.10290","repositories_listed":0,"syntology":null},{"url":"/paper/punctuation-restoration","slug":"punctuation-restoration","title":"SemEval 2022 Task 12: Symlink- Linking Mathematical Symbols to their Descriptions","date":"2022-02-19","arxiv_id":"2202.09695","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-of-low-resource-target","title":"Domain Adaptation of low-resource Target-Domain models using well-trained ASR Conformer Models","date":"2022-02-18","arxiv_id":"2202.09167","repositories_listed":0,"syntology":null},{"url":null,"slug":"beach-to-bitch-inadvertent-unsafe","title":"'Beach' to 'Bitch': Inadvertent Unsafe Transcription of Kids' Content on YouTube","date":"2022-02-17","arxiv_id":"2203.04837","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-closed-model-adversarial-examples","title":"Mitigating Closed-model Adversarial Examples with Bayesian Neural Modeling for Enhanced End-to-End Speech Recognition","date":"2022-02-17","arxiv_id":"2202.08532","repositories_listed":0,"syntology":null},{"url":null,"slug":"mlp-asr-sequence-length-agnostic-all-mlp","title":"MLP-ASR: Sequence-length agnostic all-MLP architectures for speech recognition","date":"2022-02-17","arxiv_id":"2202.08456","repositories_listed":0,"syntology":null},{"url":null,"slug":"conversational-speech-recognition-by-learning","title":"Conversational Speech Recognition By Learning Conversation-level Characteristics","date":"2022-02-16","arxiv_id":"2202.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-from-large-scale","title":"Knowledge Transfer from Large-scale Pretrained Language Models to End-to-end Speech Recognizers","date":"2022-02-16","arxiv_id":"2202.07894","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-style-training-for-south-african-call","title":"Multi-style Training for South African Call Centre Audio","date":"2022-02-15","arxiv_id":"2202.07219","repositories_listed":0,"syntology":null},{"url":null,"slug":"saving-rnn-computations-with-a-neuron-level","title":"Saving RNN Computations with a Neuron-Level Fuzzy Memoization Scheme","date":"2022-02-14","arxiv_id":"2202.06563","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-depression-classification-using","title":"Multimodal Depression Classification Using Articulatory Coordination Features And Hierarchical Attention Based Text Embeddings","date":"2022-02-13","arxiv_id":"2202.06238","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-two-step-approach-to-leverage-contextual","title":"A two-step approach to leverage contextual data: speech recognition in air-traffic communications","date":"2022-02-08","arxiv_id":"2202.03725","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-asr-for-stuttered-speech-with","title":"Enhancing ASR for Stuttered Speech with Limited Data Using Detect and Pass","date":"2022-02-08","arxiv_id":"2202.05396","repositories_listed":0,"syntology":null}],"record_sha256":"6039bdb8814e3641ff8e63e4f4ae93a8b54eebb004f4d1374d2109ebd908e116","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}