{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition-1/papers/30","list_of":"/task/speech-recognition-1","task":"speech-recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":30,"pages_in_order":58,"rows_per_page":100,"rows":[2901,3000],"of":5715,"counts":{"archive_papers_tagged":5715,"with_a_code_link":1277,"where_syntology_ran_a_sample":162,"not_listed_spam_title":0,"listed":5715,"listed_where_code_ran":162,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":134,"every_run_a_failure_of_syntologys_instrument":28,"listed_with_a_run_with_no_instrument_failure":134,"listed_every_run_a_failure_of_syntologys_instrument":28,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition-1","prev":"/task/speech-recognition-1/papers/29","next":"/task/speech-recognition-1/papers/31","papers":[{"url":null,"slug":"deepcon-an-end-to-end-multilingual-toolkit","title":"DeepCon: An End-to-End Multilingual Toolkit for Automatic Minuting of Multi-Party Dialogues","date":"2022-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-automatic-speech-recognition","title":"Evaluation of Automatic Speech Recognition for Conversational Speech in Dutch, English and German: What Goes Missing?","date":"2022-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-translation-of-french-live-speech","title":"Robust Translation of French Live Speech Transcripts","date":"2022-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reclight-a-recurrent-neural-network","title":"RecLight: A Recurrent Neural Network Accelerator with Integrated Silicon Photonics","date":"2022-08-31","arxiv_id":"2209.00084","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-language-agnostic-multilingual-streaming-on","title":"A Language Agnostic Multilingual Streaming On-Device ASR System","date":"2022-08-29","arxiv_id":"2208.13916","repositories_listed":0,"syntology":null},{"url":null,"slug":"turn-taking-prediction-for-natural","title":"Turn-Taking Prediction for Natural Conversational Speech","date":"2022-08-29","arxiv_id":"2208.13321","repositories_listed":0,"syntology":null},{"url":"/paper/visual-speech-recognition-in-a-driver","slug":"visual-speech-recognition-in-a-driver","title":"Visual Speech Recognition in a Driver Assistance System","date":"2022-08-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minimal-feature-analysis-for-isolated-digit","title":"Minimal Feature Analysis for Isolated Digit Recognition for varying encoding rates in noisy environments","date":"2022-08-27","arxiv_id":"2208.13100","repositories_listed":0,"syntology":null},{"url":null,"slug":"effectiveness-of-mining-audio-and-text-pairs","title":"Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages","date":"2022-08-26","arxiv_id":"2208.12666","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-data-partitioning-strategies","title":"Investigating data partitioning strategies for crosslinguistic low-resource ASR evaluation","date":"2022-08-26","arxiv_id":"2208.12888","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-disentangled-representations-all-you-need","title":"Are disentangled representations all you need to build speaker anonymization systems?","date":"2022-08-22","arxiv_id":"2208.10497","repositories_listed":0,"syntology":null},{"url":null,"slug":"dualvoice-speech-interaction-that","title":"DualVoice: Speech Interaction that Discriminates between Normal and Whispered Voice Input","date":"2022-08-22","arxiv_id":"2208.10499","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-level-physiological-implications-of-end","title":"Low-Level Physiological Implications of End-to-End Learning of Speech Recognition","date":"2022-08-22","arxiv_id":"2208.11700","repositories_listed":0,"syntology":null},{"url":"/paper/building-a-public-domain-voice-database-for","slug":"building-a-public-domain-voice-database-for","title":"Building a Public Domain Voice Database for Odia","date":"2022-08-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uconv-conformer-high-reduction-of-input","title":"Uconv-Conformer: High Reduction of Input Sequence Length for End-to-End Speech Recognition","date":"2022-08-16","arxiv_id":"2208.07657","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-hypernasality-estimation-with","title":"Improving Hypernasality Estimation with Automatic Speech Recognition in Cleft Palate Speech","date":"2022-08-10","arxiv_id":"2208.05122","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-vocabulary-speech-recognition-for","title":"Large vocabulary speech recognition for languages of Africa: multilingual modeling and self-supervised learning","date":"2022-08-05","arxiv_id":"2208.03067","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-blending-for-text-classification","title":"Model Blending for Text Classification","date":"2022-08-05","arxiv_id":"2208.02819","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-on-asr-systems-an","title":"Adversarial Attacks on ASR Systems: An Overview","date":"2022-08-03","arxiv_id":"2208.02250","repositories_listed":0,"syntology":null},{"url":"/paper/automatic-speech-recognition-in-german-a","slug":"automatic-speech-recognition-in-german-a","title":"Automatic Speech Recognition in German: A Detailed Error Analysis","date":"2022-08-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multiclass-asma-vs-targeted-pgd-attack-in","title":"Multiclass ASMA vs Targeted PGD Attack in Image Segmentation","date":"2022-08-03","arxiv_id":"2208.01844","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-disparities-between-accents-in","title":"Global Performance Disparities Between English-Language Accents in Automatic Speech Recognition","date":"2022-08-01","arxiv_id":"2208.01157","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-hypothesis-rnn-t-loss-for","title":"Multiple-hypothesis RNN-T Loss for Unsupervised Fine-tuning and Self-training of Neural Transducer","date":"2022-07-29","arxiv_id":"2207.14736","repositories_listed":0,"syntology":null},{"url":null,"slug":"pronunciation-aware-unique-character-encoding","title":"Pronunciation-aware unique character encoding for RNN Transducer-based Mandarin speech recognition","date":"2022-07-29","arxiv_id":"2207.14578","repositories_listed":0,"syntology":null},{"url":null,"slug":"thutmose-tagger-single-pass-neural-model-for","title":"Thutmose Tagger: Single-pass neural model for Inverse Text Normalization","date":"2022-07-29","arxiv_id":"2208.00064","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-rnn-t-based-speech-recognition","title":"Extending RNN-T-based speech recognition systems with emotion and language classification","date":"2022-07-28","arxiv_id":"2207.13965","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-driven-subword-grammar-modeling-for","title":"Knowledge-driven Subword Grammar Modeling for Automatic Speech Recognition in Tamil and Kannada","date":"2022-07-27","arxiv_id":"2207.13333","repositories_listed":0,"syntology":null},{"url":null,"slug":"subword-dictionary-learning-and-segmentation","title":"Subword Dictionary Learning and Segmentation Techniques for Automatic Speech Recognition in Tamil and Kannada","date":"2022-07-27","arxiv_id":"2207.13331","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-aware-attack-creating-adversarial","title":"Perception-Aware Attack: Creating Adversarial Music via Reverse-Engineering Human Perception","date":"2022-07-26","arxiv_id":"2207.13192","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-dual-mode-speech-recognition-model","title":"Learning a Dual-Mode Speech Recognition Model via Self-Pruning","date":"2022-07-25","arxiv_id":"2207.11906","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-data-selection-for-speech","title":"Unsupervised data selection for Speech Recognition with contrastive loss ratios","date":"2022-07-25","arxiv_id":"2207.12028","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-dive-into-deep-cluster","title":"A Deep Dive into Deep Cluster","date":"2022-07-24","arxiv_id":"2207.11839","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementation-of-tiny-machine-learning","title":"Implementation Of Tiny Machine Learning Models On Arduino 33 BLE For Gesture And Speech Recognition","date":"2022-07-23","arxiv_id":"2207.12866","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-error-detection-via-audio-transcript","title":"ASR Error Detection via Audio-Transcript entailment","date":"2022-07-22","arxiv_id":"2207.10849","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-fairness-in-speech-recognition","title":"Toward Fairness in Speech Recognition: Discovery and mitigation of performance disparities","date":"2022-07-22","arxiv_id":"2207.11345","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-data-driven-inverse-text","title":"Improving Data Driven Inverse Text Normalization using Data Augmentation","date":"2022-07-20","arxiv_id":"2207.09674","repositories_listed":0,"syntology":null},{"url":null,"slug":"ilasr-privacy-preserving-incremental-learning","title":"ILASR: Privacy-Preserving Incremental Learning for Automatic Speech Recognition at Production Scale","date":"2022-07-19","arxiv_id":"2207.09078","repositories_listed":0,"syntology":null},{"url":"/paper/wideresnet-with-joint-representation-learning","slug":"wideresnet-with-joint-representation-learning","title":"WideResNet with Joint Representation Learning and Data Augmentation for Cover Song Identification","date":"2022-07-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-spoken-language-understanding-3","title":"End-to-End Spoken Language Understanding: Performance analyses of a voice command task in a low resource setting","date":"2022-07-17","arxiv_id":"2207.08179","repositories_listed":0,"syntology":null},{"url":null,"slug":"mac-do-charge-based-multi-bit-analog-in","title":"MAC-DO: An Efficient Output-Stationary GEMM Accelerator for CNNs Using DRAM Technology","date":"2022-07-16","arxiv_id":"2207.07862","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-geographic-disparities-in-automatic","title":"Reducing Geographic Disparities in Automatic Speech Recognition via Elastic Weight Consolidation","date":"2022-07-16","arxiv_id":"2207.07850","repositories_listed":0,"syntology":null},{"url":null,"slug":"sotto-voce-federated-speech-recognition-with","title":"Sotto Voce: Federated Speech Recognition with Differential Privacy Guarantees","date":"2022-07-16","arxiv_id":"2207.07816","repositories_listed":0,"syntology":null},{"url":"/paper/direction-aware-joint-adaptation-of-neural","slug":"direction-aware-joint-adaptation-of-neural","title":"Direction-Aware Joint Adaptation of Neural Speech Enhancement and Recognition in Real Multiparty Conversational Environments","date":"2022-07-15","arxiv_id":"2207.07273","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-low-resource-quechua","title":"Data Augmentation for Low-Resource Quechua ASR Improvement","date":"2022-07-14","arxiv_id":"2207.06872","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-versus-wide-an-analysis-of-student","title":"Deep versus Wide: An Analysis of Student Architectures for Task-Agnostic Knowledge Distillation of Self-Supervised Speech Models","date":"2022-07-14","arxiv_id":"2207.06867","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-spike-encoding-algorithms-for","title":"Efficient spike encoding algorithms for neuromorphic speech recognition","date":"2022-07-14","arxiv_id":"2207.07073","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-terminology-management-and-sharing","title":"Open Terminology Management and Sharing Toolkit for Federation of Terminology Databases","date":"2022-07-14","arxiv_id":"2207.06729","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-pass-low-latency-end-to-end-spoken","title":"Two-Pass Low Latency End-to-End Spoken Language Understanding","date":"2022-07-14","arxiv_id":"2207.06670","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-recognition-modeling-from","title":"End-to-end speech recognition modeling from de-identified data","date":"2022-07-12","arxiv_id":"2207.05469","repositories_listed":0,"syntology":null},{"url":null,"slug":"huqariq-a-multilingual-speech-corpus-of","title":"Huqariq: A Multilingual Speech Corpus of Native Languages of Peru for Speech Recognition","date":"2022-07-12","arxiv_id":"2207.05498","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-continual-learning-of-end-to-end","title":"Online Continual Learning of End-to-End Speech Recognition Models","date":"2022-07-11","arxiv_id":"2207.05071","repositories_listed":0,"syntology":null},{"url":null,"slug":"pmct-patched-multi-condition-training-for","title":"pMCT: Patched Multi-Condition Training for Robust Speech Recognition","date":"2022-07-11","arxiv_id":"2207.04949","repositories_listed":0,"syntology":null},{"url":null,"slug":"intermediate-layer-output-regularization-for","title":"Intermediate-layer output Regularization for Attention-based Speech Recognition with Shared Decoder","date":"2022-07-09","arxiv_id":"2207.04177","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-estimation-based","title":"Internal Language Model Estimation based Language Model Fusion for Cross-Domain Code-Switching Speech Recognition","date":"2022-07-09","arxiv_id":"2207.04176","repositories_listed":0,"syntology":null},{"url":null,"slug":"tandem-multitask-training-of-speaker","title":"Tandem Multitask Training of Speaker Diarisation and Speech Recognition for Meeting Transcription","date":"2022-07-08","arxiv_id":"2207.03852","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-to-punctuated-text","title":"End-to-end Speech-to-Punctuated-Text Recognition","date":"2022-07-07","arxiv_id":"2207.03169","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-impact-of-cross-lingual","title":"Investigating the Impact of Cross-lingual Acoustic-Phonetic Similarities on Multilingual Speech Recognition","date":"2022-07-07","arxiv_id":"2207.03390","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-linear-pairwise-language-mappings-for-low","title":"Non-Linear Pairwise Language Mappings for Low-Resource Multilingual Acoustic Model Fusion","date":"2022-07-07","arxiv_id":"2207.03391","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-streaming-end-to-end-asr-on","title":"Improving Streaming End-to-End ASR on Transformer-based Causal Models with Encoder States Revision Strategies","date":"2022-07-06","arxiv_id":"2207.02495","repositories_listed":0,"syntology":null},{"url":null,"slug":"kaggle-competition-cantonese-audio-visual","title":"Kaggle Competition: Cantonese Audio-Visual Speech Recognition for In-car Commands","date":"2022-07-06","arxiv_id":"2207.02663","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-low-footprint-wake-word","title":"Low-resource Low-footprint Wake-word Detection using Knowledge Distillation","date":"2022-07-06","arxiv_id":"2207.03331","repositories_listed":0,"syntology":null},{"url":null,"slug":"compute-cost-amortized-transformer-for","title":"Compute Cost Amortized Transformer for Streaming ASR","date":"2022-07-05","arxiv_id":"2207.02393","repositories_listed":0,"syntology":null},{"url":null,"slug":"deformer-coupling-deformed-localized-patterns","title":"DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition","date":"2022-07-04","arxiv_id":"2207.01732","repositories_listed":0,"syntology":null},{"url":null,"slug":"vietnamese-capitalization-and-punctuation","title":"Vietnamese Capitalization and Punctuation Recovery Models","date":"2022-07-04","arxiv_id":"2207.01312","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-acoustic-contextual-representation","title":"Leveraging Acoustic Contextual Representation by Audio-textual Cross-modal Learning for Conversational ASR","date":"2022-07-03","arxiv_id":"2207.01039","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-transformer-based-conversational","title":"Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism","date":"2022-07-02","arxiv_id":"2207.00883","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-constrained-pointer-generator-with-graph","title":"Tree-constrained Pointer Generator with Graph Neural Network Encodings for Contextual Speech Recognition","date":"2022-07-02","arxiv_id":"2207.00857","repositories_listed":0,"syntology":null},{"url":null,"slug":"userlibri-a-dataset-for-asr-personalization","title":"UserLibri: A Dataset for ASR Personalization Using Only Text","date":"2022-07-02","arxiv_id":"2207.00706","repositories_listed":0,"syntology":null},{"url":null,"slug":"activity-focused-speech-recognition-of","title":"Activity focused Speech Recognition of Preschool Children in Early Childhood Classrooms","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-informed-probing-of-wav2vec-2-0","title":"Domain-Informed Probing of wav2vec 2.0 Embeddings for Phonetic Features","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-effect-of-dialect-mismatched","title":"Exploring the Effect of Dialect Mismatched Language Models in Telugu Automatic Speech Recognition","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fpi-failure-point-isolation-in-large-scale","title":"FPI: Failure Point Isolation in Large-scale Conversational Assistants","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-low-resource-speech-recognition","title":"Improving Low-Resource Speech Recognition with Pretrained Speech Models: Continued Pretraining vs. Semi-Supervised Training","date":"2022-07-01","arxiv_id":"2207.00659","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-chinese-asr-error","title":"Non-Autoregressive Chinese ASR Error Correction with Phonological Training","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-assessing-and-developing-spoken","title":"On Assessing and Developing Spoken ’Grammatical Error Correction’ Systems","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"updating-only-encoders-prevents-catastrophic","title":"Updating Only Encoders Prevents Catastrophic Forgetting of End-to-End ASR Models","date":"2022-07-01","arxiv_id":"2207.00216","repositories_listed":0,"syntology":null},{"url":null,"slug":"fearless-feature-refinement-loss-for","title":"FeaRLESS: Feature Refinement Loss for Ensembling Self-Supervised Learning Features in Robust End-to-end Speech Recognition","date":"2022-06-30","arxiv_id":"2206.15056","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-8-bit-quantization-aware-training-for-8","title":"Sub-8-Bit Quantization Aware Training for 8-Bit Neural Network Accelerator with On-Device Speech Recognition","date":"2022-06-30","arxiv_id":"2206.15408","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-specific-characteristic-assistance","title":"Language-specific Characteristic Assistance for Code-switching Speech Recognition","date":"2022-06-29","arxiv_id":"2206.14580","repositories_listed":0,"syntology":null},{"url":null,"slug":"space-efficient-representation-of-entity","title":"Space-Efficient Representation of Entity-centric Query Language Models","date":"2022-06-29","arxiv_id":"2206.14885","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-thuee-system-description-for-the-iarpa","title":"The THUEE System Description for the IARPA OpenASR21 Challenge","date":"2022-06-29","arxiv_id":"2206.14660","repositories_listed":0,"syntology":null},{"url":null,"slug":"bengali-common-voice-speech-dataset-for","title":"Bengali Common Voice Speech Dataset for Automatic Speech Recognition","date":"2022-06-28","arxiv_id":"2206.14053","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-linguistic-feature-and-model","title":"Exploring linguistic feature and model combination for speech recognition based automatic AD detection","date":"2022-06-28","arxiv_id":"2206.13758","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenges-and-opportunities-in-multi-device","title":"Challenges and Opportunities in Multi-device Speech Processing","date":"2022-06-27","arxiv_id":"2206.15432","repositories_listed":0,"syntology":null},{"url":null,"slug":"talcs-an-open-source-mandarin-english-code","title":"TALCS: An Open-Source Mandarin-English Code-Switching Corpus and a Speech Recognition Baseline","date":"2022-06-27","arxiv_id":"2206.13135","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotated-speech-corpus-for-low-resource","title":"Annotated Speech Corpus for Low Resource Indian Languages: Awadhi, Bhojpuri, Braj and Magahi","date":"2022-06-26","arxiv_id":"2206.12931","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-training-recipe-for-a-robust","title":"Improving the Training Recipe for a Robust Conformer-based Hybrid Model","date":"2022-06-26","arxiv_id":"2206.12955","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-accent-classification-in","title":"Low-resource Accent Classification in Geographically-proximate Settings: A Forensic and Sociophonetics Perspective","date":"2022-06-26","arxiv_id":"2206.12759","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-auxiliary-learning-for-low-resource","title":"Meta Auxiliary Learning for Low-resource Spoken Language Understanding","date":"2022-06-26","arxiv_id":"2206.12774","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-comparison-of-encoders-for-attention-based","title":"On Comparison of Encoders for Attention based End to End Speech Recognition in Standalone and Rescoring Mode","date":"2022-06-26","arxiv_id":"2206.12829","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-score-based-conformer-speaker","title":"Confidence Score Based Conformer Speaker Adaptation for Speech Recognition","date":"2022-06-24","arxiv_id":"2206.12045","repositories_listed":0,"syntology":null},{"url":null,"slug":"pocap-corpus-a-multimodal-dataset-for-smart","title":"PoCaP Corpus: A Multimodal Dataset for Smart Operating Room Speech Assistant using Interventional Radiology Workflow Analysis","date":"2022-06-24","arxiv_id":"2206.12320","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformer-based-elderly-speech-recognition","title":"Conformer Based Elderly Speech Recognition System for Alzheimer's Disease Detection","date":"2022-06-23","arxiv_id":"2206.13232","repositories_listed":0,"syntology":null},{"url":null,"slug":"pruned-rnn-t-for-fast-memory-efficient-asr","title":"Pruned RNN-T for fast, memory-efficient ASR training","date":"2022-06-23","arxiv_id":"2206.13236","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-pass-decoding-and-cross-adaptation-based","title":"Two-pass Decoding and Cross-adaptation Based System Combination of End-to-end Conformer and Hybrid TDNN ASR Systems","date":"2022-06-23","arxiv_id":"2206.11596","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-baseline-for-domain-adaptation-in-1","title":"A Simple Baseline for Domain Adaptation in End to End ASR Systems Using Synthetic Data","date":"2022-06-22","arxiv_id":"2206.13240","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-fast-accelerating-bert-on-the-tensor","title":"Answer Fast: Accelerating BERT on the Tensor Streaming Processor","date":"2022-06-22","arxiv_id":"2206.11062","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervision-guided-codebooks-for-masked","title":"Supervision-Guided Codebooks for Masked Prediction in Speech Pre-training","date":"2022-06-21","arxiv_id":"2206.10125","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-makerere-radio-speech-corpus-a-luganda","title":"The Makerere Radio Speech Corpus: A Luganda Radio Corpus for Automatic Speech Recognition","date":"2022-06-20","arxiv_id":"2206.09790","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-robust-low-resource","title":"Transfer Learning for Robust Low-Resource Children's Speech ASR with Transformers and Source-Filter Warping","date":"2022-06-19","arxiv_id":"2206.09396","repositories_listed":0,"syntology":null}],"record_sha256":"d64278917c0d3b18493a50bd011ae663e275dac4d0843ac3cc9b45c093e72789","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}