{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition/papers/23","list_of":"/task/speech-recognition","task":"Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":23,"pages_in_order":65,"rows_per_page":100,"rows":[2201,2300],"of":6433,"counts":{"archive_papers_tagged":6433,"with_a_code_link":1373,"where_syntology_ran_a_sample":196,"not_listed_spam_title":0,"listed":6433,"listed_where_code_ran":196,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":162,"every_run_a_failure_of_syntologys_instrument":34,"listed_with_a_run_with_no_instrument_failure":162,"listed_every_run_a_failure_of_syntologys_instrument":34,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition","prev":"/task/speech-recognition/papers/22","next":"/task/speech-recognition/papers/24","papers":[{"url":null,"slug":"multimodal-attention-merging-for-improved","title":"Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification","date":"2023-12-22","arxiv_id":"2312.14378","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strong-baseline-for-temporal-video-text","title":"Multi-Sentence Grounding for Long-term Instructional Video","date":"2023-12-21","arxiv_id":"2312.14055","repositories_listed":0,"syntology":null},{"url":null,"slug":"banspemo-a-bangla-emotional-speech","title":"BANSpEmo: A Bangla Emotional Speech Recognition Dataset","date":"2023-12-21","arxiv_id":"2312.14020","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-learning-with-artificial","title":"Collaborative Learning with Artificial Intelligence Speakers (CLAIS): Pre-Service Elementary Science Teachers' Responses to the Prototype","date":"2023-12-20","arxiv_id":"2401.05400","repositories_listed":0,"syntology":null},{"url":null,"slug":"lattice-rescoring-based-on-large-ensemble-of","title":"Lattice Rescoring Based on Large Ensemble of Complementary Neural Language Models","date":"2023-12-20","arxiv_id":"2312.12764","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-speech-audiometry-can-it-work-using","title":"Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?","date":"2023-12-19","arxiv_id":"2312.12269","repositories_listed":0,"syntology":null},{"url":null,"slug":"spokesbiz-an-open-corpus-of-conversational","title":"SpokesBiz -- an Open Corpus of Conversational Polish","date":"2023-12-19","arxiv_id":"2312.12364","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-oriented-approaches-for-self","title":"Efficiency-oriented approaches for self-supervised speech representation learning","date":"2023-12-18","arxiv_id":"2312.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-linguistic-representation-for","title":"Generative linguistic representation for spoken language identification","date":"2023-12-18","arxiv_id":"2312.10964","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-long-form-speech-recognition-by","title":"Improved Long-Form Speech Recognition by Jointly Modeling the Primary and Non-primary Speakers","date":"2023-12-18","arxiv_id":"2312.11123","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-mask-transformer-for-multi-talker","title":"Speaker Mask Transformer for Multi-talker Overlapped Speech Recognition","date":"2023-12-18","arxiv_id":"2312.10959","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformer-based-speech-recognition-on-extreme","title":"Conformer-Based Speech Recognition On Extreme Edge-Computing Devices","date":"2023-12-16","arxiv_id":"2312.10359","repositories_listed":0,"syntology":null},{"url":null,"slug":"oava-the-open-audio-visual-archives","title":"OAVA: the open audio-visual archives aggregator","date":"2023-12-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-context-aware-fine-tuning-of-self","title":"Generative Context-aware Fine-tuning of Self-supervised Speech Models","date":"2023-12-15","arxiv_id":"2312.09895","repositories_listed":0,"syntology":null},{"url":null,"slug":"ir-uwb-radar-based-contactless-silent-speech","title":"IR-UWB Radar-Based Contactless Silent Speech Recognition of Vowels, Consonants, Words, and Phrases","date":"2023-12-15","arxiv_id":"2312.09572","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-language-id-to-calculate","title":"Leveraging Language ID to Calculate Intermediate CTC Loss for Enhanced Code-Switching Speech Recognition","date":"2023-12-15","arxiv_id":"2312.09583","repositories_listed":0,"syntology":null},{"url":null,"slug":"litevsr-efficient-visual-speech-recognition","title":"LiteVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data","date":"2023-12-15","arxiv_id":"2312.09727","repositories_listed":0,"syntology":null},{"url":null,"slug":"phoneme-aware-encoding-for-prefix-tree-based","title":"Phoneme-aware Encoding for Prefix-tree-based Contextual ASR","date":"2023-12-15","arxiv_id":"2312.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-guided-adaptation-for-code","title":"Attention-Guided Adaptation for Code-Switching Speech Recognition","date":"2023-12-14","arxiv_id":"2312.08856","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-fine-tuning-of-audio-only-asr","title":"Audio-visual fine-tuning of audio-only ASR models","date":"2023-12-14","arxiv_id":"2312.09369","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastinject-injecting-unpaired-text-data-into","title":"FastInject: Injecting Unpaired Text Data into CTC-based ASR training","date":"2023-12-14","arxiv_id":"2312.09100","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-data-augmentation-for","title":"Towards Automatic Data Augmentation for Disordered Speech Recognition","date":"2023-12-14","arxiv_id":"2312.08641","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-representation-of-the-activation","title":"Efficient Representation of the Activation Space in Deep Neural Networks","date":"2023-12-13","arxiv_id":"2312.08143","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-robustness-to-missing-video-for","title":"On Robustness to Missing Video for Audiovisual Speech Recognition","date":"2023-12-13","arxiv_id":"2312.10088","repositories_listed":0,"syntology":null},{"url":null,"slug":"phaseperturbation-speech-data-augmentation","title":"PhasePerturbation: Speech Data Augmentation via Phase Perturbation for Automatic Speech Recognition","date":"2023-12-13","arxiv_id":"2312.08571","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-entropy-semiring-for-neural","title":"Revisiting the Entropy Semiring for Neural Speech Recognition","date":"2023-12-13","arxiv_id":"2312.10087","repositories_listed":0,"syntology":null},{"url":null,"slug":"usm-lite-quantization-and-sparsity-aware-fine","title":"USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models","date":"2023-12-13","arxiv_id":"2312.08553","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-adaptive-pre-training-of","title":"Self-supervised Adaptive Pre-training of Multilingual Speech Models for Language and Dialect Identification","date":"2023-12-12","arxiv_id":"2312.07338","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gua-speech-system-description-for-cnvsrc","title":"The GUA-Speech System Description for CNVSRC Challenge 2023","date":"2023-12-12","arxiv_id":"2312.07254","repositories_listed":0,"syntology":null},{"url":null,"slug":"creating-spoken-dialog-systems-in-ultra-low","title":"Creating Spoken Dialog Systems in Ultra-Low Resourced Settings","date":"2023-12-11","arxiv_id":"2312.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-photonic-reservoir-computer-for-speech","title":"Deep Photonic Reservoir Computer for Speech Recognition","date":"2023-12-11","arxiv_id":"2312.06558","repositories_listed":0,"syntology":null},{"url":null,"slug":"label-smoothing-for-enhanced-text-sentiment","title":"Revisiting the Role of Label Smoothing in Enhanced Text Sentiment Classification","date":"2023-12-11","arxiv_id":"2312.06522","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-hybrid-and-ensemble-in-deep","title":"A Review of Hybrid and Ensemble in Deep Learning for Natural Language Processing","date":"2023-12-09","arxiv_id":"2312.05589","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-low-rank-adaptation-of-foundation","title":"Batched Low-Rank Adaptation of Foundation Models","date":"2023-12-09","arxiv_id":"2312.05677","repositories_listed":0,"syntology":null},{"url":null,"slug":"keyword-spotting-detecting-commands-in-speech","title":"Keyword spotting -- Detecting commands in speech using deep learning","date":"2023-12-09","arxiv_id":"2312.05640","repositories_listed":0,"syntology":null},{"url":null,"slug":"freqfed-a-frequency-analysis-based-approach","title":"FreqFed: A Frequency Analysis-Based Approach for Mitigating Poisoning Attacks in Federated Learning","date":"2023-12-07","arxiv_id":"2312.04432","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integration-of-pre-trained-speech-and","title":"Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition","date":"2023-12-06","arxiv_id":"2312.03668","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-data-and-resource-efficient-device","title":"Multimodal Data and Resource Efficient Device-Directed Speech Detection with Large Foundation Models","date":"2023-12-06","arxiv_id":"2312.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-two-pass-cross-lingual-transfer","title":"Optimizing Two-Pass Cross-Lingual Transfer Learning: Phoneme Recognition and Phoneme to Grapheme Translation","date":"2023-12-06","arxiv_id":"2312.03312","repositories_listed":0,"syntology":null},{"url":null,"slug":"pmmtalk-speech-driven-3d-facial-animation","title":"PMMTalk: Speech-Driven 3D Facial Animation from Complementary Pseudo Multi-modal Features","date":"2023-12-05","arxiv_id":"2312.02781","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-to-text-translation-a","title":"End-to-End Speech-to-Text Translation: A Survey","date":"2023-12-02","arxiv_id":"2312.01053","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-generated-wargame-ai-double-layer-agent","title":"Self Generated Wargame AI: Double Layer Agent Task Planning Based on Large Language Model","date":"2023-12-02","arxiv_id":"2312.01090","repositories_listed":0,"syntology":null},{"url":null,"slug":"mavericks-at-nadi-2023-shared-task","title":"Mavericks at NADI 2023 Shared Task: Unravelling Regional Nuances through Dialect Identification using Transformer-based Approach","date":"2023-11-30","arxiv_id":"2311.18739","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-openai-s-whisper-for-speech","title":"Adapting OpenAI's Whisper for Speech Recognition on Code-Switch Mandarin-English SEAME and ASRU2019 Datasets","date":"2023-11-29","arxiv_id":"2311.17382","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-joint-rich-and-normalized-asr-with","title":"End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data","date":"2023-11-29","arxiv_id":"2311.17741","repositories_listed":0,"syntology":null},{"url":null,"slug":"phonetic-aware-speaker-embedding-for-far","title":"Phonetic-aware speaker embedding for far-field speaker verification","date":"2023-11-27","arxiv_id":"2311.15627","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-self-supervised-speech","title":"Multilingual self-supervised speech representations improve the speech recognition of low-resource African languages with codeswitching","date":"2023-11-25","arxiv_id":"2311.15077","repositories_listed":0,"syntology":null},{"url":null,"slug":"weak-alignment-supervision-from-hybrid-model","title":"Weak Alignment Supervision from Hybrid Model Improves End-to-end ASR","date":"2023-11-24","arxiv_id":"2311.14835","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-visual-features-for-continuous","title":"Analysis of Visual Features for Continuous Lipreading in Spanish","date":"2023-11-21","arxiv_id":"2311.12468","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-random-sampling-a-theoretical-and","title":"Soft Random Sampling: A Theoretical and Empirical Analysis","date":"2023-11-21","arxiv_id":"2311.12727","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-adapted-end-to-end-visual-speech","title":"Speaker-Adapted End-to-End Visual Speech Recognition for Continuous Spanish","date":"2023-11-21","arxiv_id":"2311.12480","repositories_listed":0,"syntology":null},{"url":null,"slug":"app-for-resume-based-job-matching-with-speech","title":"App for Resume-Based Job Matching with Speech Interviews and Grammar Analysis: A Review","date":"2023-11-20","arxiv_id":"2311.14729","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-boundaries-a-comprehensive-survey-of","title":"Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems","date":"2023-11-20","arxiv_id":"2311.11796","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-does-end-to-end-speech-recognition","title":"How does end-to-end speech recognition training impact speech enhancement artifacts?","date":"2023-11-20","arxiv_id":"2311.11599","repositories_listed":0,"syntology":null},{"url":null,"slug":"label-synchronous-neural-transducer-for","title":"Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition","date":"2023-11-19","arxiv_id":"2311.11353","repositories_listed":0,"syntology":null},{"url":null,"slug":"ml-lmcl-mutual-learning-and-large-margin","title":"ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for Improving ASR Robustness in Spoken Language Understanding","date":"2023-11-19","arxiv_id":"2311.11375","repositories_listed":0,"syntology":null},{"url":null,"slug":"ghostvec-a-new-threat-to-speaker-privacy-of","title":"GhostVec: A New Threat to Speaker Privacy of End-to-End Speech Recognition System","date":"2023-11-17","arxiv_id":"2311.10689","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-large-scale-deep-biasing-with","title":"Improving Large-scale Deep Biasing with Phoneme Features and Text-only Data in Streaming Transducer","date":"2023-11-15","arxiv_id":"2311.08966","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-channel-conversational-speaker","title":"Multi-channel Conversational Speaker Separation via Neural Diarization","date":"2023-11-15","arxiv_id":"2311.08630","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-generative-adversarial-networks-for","title":"Enhanced Generative Adversarial Networks for Unseen Word Generation from EEG Signals","date":"2023-11-14","arxiv_id":"2311.17923","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieve-and-copy-scaling-asr-personalization","title":"Retrieve and Copy: Scaling ASR Personalization to Large Catalogs","date":"2023-11-14","arxiv_id":"2311.08402","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effectiveness-of-asr-representations","title":"On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition","date":"2023-11-13","arxiv_id":"2311.07093","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-end-to-end-spoken-grammatical-error","title":"Towards End-to-End Spoken Grammatical Error Correction","date":"2023-11-09","arxiv_id":"2311.05550","repositories_listed":0,"syntology":null},{"url":null,"slug":"whisper-in-focus-enhancing-stuttered-speech","title":"Whisper in Focus: Enhancing Stuttered Speech Classification with Encoder Layer Optimization","date":"2023-11-09","arxiv_id":"2311.05203","repositories_listed":0,"syntology":null},{"url":null,"slug":"1-step-speech-processing-and-understanding","title":"1SPU: 1-step Speech Processing Unit","date":"2023-11-08","arxiv_id":"2311.04753","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-convergence-model-in-bengali","title":"Fine-tuning convergence model in Bengali speech recognition","date":"2023-11-07","arxiv_id":"2311.04122","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosmic-data-efficient-instruction-tuning-for","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","date":"2023-11-03","arxiv_id":"2311.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"server-side-rescoring-of-spoken-entity","title":"Server-side Rescoring of Spoken Entity-centric Knowledge Queries for Virtual Assistants","date":"2023-11-02","arxiv_id":"2311.01398","repositories_listed":0,"syntology":null},{"url":null,"slug":"rir-sf-room-impulse-response-based-spatial","title":"RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios","date":"2023-10-31","arxiv_id":"2311.00146","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-language-models-for-specialized","title":"Combining Language Models For Specialized Domains: A Colorful Approach","date":"2023-10-30","arxiv_id":"2310.19708","repositories_listed":0,"syntology":null},{"url":null,"slug":"must-a-multilingual-student-teacher-learning","title":"MUST: A Multilingual Student-Teacher Learning approach for low-resource speech recognition","date":"2023-10-29","arxiv_id":"2310.18865","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-segment-to-segment-framework-for","title":"Unified Segment-to-Segment Framework for Simultaneous Sequence Generation","date":"2023-10-27","arxiv_id":"2310.17940","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialect-adaptation-and-data-augmentation-for","title":"Dialect Adaptation and Data Augmentation for Low-Resource ASR: TalTech Systems for the MADASR 2023 Challenge","date":"2023-10-26","arxiv_id":"2310.17448","repositories_listed":0,"syntology":null},{"url":null,"slug":"unix-encoder-a-universal-x-channel-speech","title":"UniX-Encoder: A Universal $X$-Channel Speech Encoder for Ad-Hoc Microphone Array Speech Processing","date":"2023-10-25","arxiv_id":"2310.16367","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-timestamp-information-for","title":"Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation","date":"2023-10-23","arxiv_id":"2310.14806","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-dropout-for-multimodal-device","title":"Modality Dropout for Multimodal Device Directed Speech Detection using Verbal and Non-Verbal Features","date":"2023-10-23","arxiv_id":"2310.15261","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-the-dialect-gap-and-its","title":"Quantifying the Dialect Gap and its Correlates Across Languages","date":"2023-10-23","arxiv_id":"2310.15135","repositories_listed":0,"syntology":null},{"url":null,"slug":"conversational-speech-recognition-by-learning-1","title":"Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation","date":"2023-10-22","arxiv_id":"2310.14278","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligibility-prediction-with-a-pretrained","title":"Intelligibility prediction with a pretrained noise-robust automatic speech recognition model","date":"2023-10-20","arxiv_id":"2310.19817","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-chime-7-challenge-system-description-and","title":"The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System","date":"2023-10-18","arxiv_id":"2310.12378","repositories_listed":0,"syntology":null},{"url":null,"slug":"unintended-memorization-in-large-asr-models","title":"Unintended Memorization in Large ASR Models, and How to Mitigate It","date":"2023-10-18","arxiv_id":"2310.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-accent-dialect-identification-and","title":"Advanced accent/dialect identification and accentedness assessment with multi-embedding models and automatic speech recognition","date":"2023-10-17","arxiv_id":"2310.11004","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-adapterfusion-a-task-id-free-approach","title":"Audio-AdapterFusion: A Task-ID-free Approach for Efficient and Non-Destructive Multi-task Speech Recognition","date":"2023-10-17","arxiv_id":"2310.13015","repositories_listed":0,"syntology":null},{"url":null,"slug":"correction-focused-language-model-training","title":"Correction Focused Language Model Training for Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11003","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-error-correction-for-code","title":"Generative error correction for code-switching speech recognition using large language models","date":"2023-10-17","arxiv_id":"2310.13013","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-shallow-fusion-of-backward-language","title":"Iterative Shallow Fusion of Backward Language Model for End-to-End Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11010","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-form-simultaneous-speech-translation","title":"Long-form Simultaneous Speech Translation: Thesis Proposal","date":"2023-10-17","arxiv_id":"2310.11141","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-stage-large-language-model-correction","title":"Multi-stage Large Language Model Correction for Speech Recognition","date":"2023-10-17","arxiv_id":"2310.11532","repositories_listed":0,"syntology":null},{"url":null,"slug":"voxarabica-a-robust-dialect-aware-arabic","title":"VoxArabica: A Robust Dialect-Aware Arabic Speech Recognition System","date":"2023-10-17","arxiv_id":"2310.11069","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-speech-abnormalities-with-a","title":"Detecting Speech Abnormalities with a Perceiver-based Sequence Classifier that Leverages a Universal Speech Model","date":"2023-10-16","arxiv_id":"2310.13010","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-multichannel-speaker-attributed","title":"End-to-end Multichannel Speaker-Attributed ASR: Speaker Guided Decoder and Input Feature Analysis","date":"2023-10-16","arxiv_id":"2310.10106","repositories_listed":0,"syntology":null},{"url":"/paper/optimized-tokenization-for-transcribed-error","slug":"optimized-tokenization-for-transcribed-error","title":"Optimized Tokenization for Transcribed Error Correction","date":"2023-10-16","arxiv_id":"2310.10704","repositories_listed":0,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/optimized-tokenization-for-transcribed-error#ran","syntology_url":"https://syntology.ai/paper/2310.10704","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.10704"}},"official":null}},{"url":null,"slug":"personalization-of-ctc-based-end-to-end","title":"Personalization of CTC-based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization","date":"2023-10-16","arxiv_id":"2310.09988","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-vocabulary-spontaneous-speech","title":"Large Vocabulary Spontaneous Speech Recognition for Tigrigna","date":"2023-10-15","arxiv_id":"2402.04254","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-contextual-recognition-in-automatic","title":"Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring","date":"2023-10-14","arxiv_id":"2310.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-word-error-rate-estimation-using-self","title":"Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text","date":"2023-10-12","arxiv_id":"2310.08225","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relevance-of-phoneme-duration","title":"On the Relevance of Phoneme Duration Variability of Synthesized Training Data for Automatic Speech Recognition","date":"2023-10-12","arxiv_id":"2310.08132","repositories_listed":0,"syntology":null},{"url":null,"slug":"acoustic-model-fusion-for-end-to-end-speech","title":"Acoustic Model Fusion for End-to-end Speech Recognition","date":"2023-10-10","arxiv_id":"2310.07062","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-speech-recognition-rescoring","title":"Discriminative Speech Recognition Rescoring with Pre-trained Language Models","date":"2023-10-10","arxiv_id":"2310.06248","repositories_listed":0,"syntology":null},{"url":null,"slug":"findings-of-the-2023-ml-superb-challenge-pre","title":"Findings of the 2023 ML-SUPERB Challenge: Pre-Training and Evaluation over More Languages and Beyond","date":"2023-10-09","arxiv_id":"2310.05513","repositories_listed":0,"syntology":null}],"record_sha256":"0e3d835722c4a66c9d3f52626bcd8c35c73cdf75c9dde3d69c94fbe84d522fe4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}