Browse State-of-the-Art › speech-recognition › Papers, page 18
speech-recognition
Papers archive 2025-07-28
archive papers tagged: 5,715 · with a code link: 1,277 · where Syntology ran a sample: 162 (134 with a run with no instrument failure, 28 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (162 of 5,715 tagged: 134 with a run with no instrument failure, 28 where every run was a failure of Syntology's instrument)
Page 18 of 58: papers 1,701 to 1,800 of 5,715, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text17 Sep 2024 0 repositories listed
-
M-BEST-RQ: A Multi-Channel Speech Foundation Model for Smart Glasses17 Sep 2024 0 repositories listed
-
WER We Stand: Benchmarking Urdu ASR Models17 Sep 2024 0 repositories listed
-
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora17 Sep 2024 0 repositories listed
-
A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models16 Sep 2024 0 repositories listed
-
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems16 Sep 2024 0 repositories listed
-
Augmenting Automatic Speech Recognition Models with Disfluency Detection16 Sep 2024 0 repositories listed
-
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition16 Sep 2024 0 repositories listed
-
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition15 Sep 2024 0 repositories listed
-
ASR Error Correction using Large Language Models14 Sep 2024 0 repositories listed
-
Clean Label Attacks against SLU Systems13 Sep 2024 0 repositories listed
-
CPT-Boosted Wav2vec2.0: Towards Noise Robust Speech Recognition for Classroom Environments13 Sep 2024 0 repositories listed
-
Exploring SSL Discrete Tokens for Multilingual ASR13 Sep 2024 0 repositories listed
-
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages13 Sep 2024 0 repositories listed
-
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation13 Sep 2024 0 repositories listed
-
Learnings from curating a trustworthy, well-annotated, and useful dataset of disordered English speech13 Sep 2024 0 repositories listed
-
Multi-modal Speech Transformer Decoders: When Do Multiple Modalities Improve Accuracy?13 Sep 2024 0 repositories listed
-
NEST-RQ: Next Token Prediction for Speech Self-Supervised Pre-Training13 Sep 2024 0 repositories listed
-
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction12 Sep 2024 0 repositories listed
-
Faster Speech-LLaMA Inference with Multi-token Prediction12 Sep 2024 0 repositories listed
-
Full-text Error Correction for Chinese Speech Recognition with Large Language Model12 Sep 2024 0 repositories listed
-
The Faetar Benchmark: Speech Recognition in a Very Under-Resourced Language12 Sep 2024 0 repositories listed
-
Contextualization of ASR with LLM using phonetic retrieval-based augmentation11 Sep 2024 0 repositories listed
-
Enhancing CTC-Based Visual Speech Recognition11 Sep 2024 0 repositories listed
-
Rethinking Mamba in Speech Processing by Self-Supervised Models11 Sep 2024 0 repositories listed
-
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition10 Sep 2024 0 repositories listed
-
How Redundant Is the Transformer Stack in Speech Representation Models?10 Sep 2024 0 repositories listed
-
Keyword-Aware ASR Error Augmentation for Robust Dialogue State Tracking10 Sep 2024 0 repositories listed
-
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR9 Sep 2024 0 repositories listed
-
An investigation of modularity for noise robustness in conformer-based ASR9 Sep 2024 0 repositories listed
-
Consensus-based Distributed Quantum Kernel Learning for Speech Recognition9 Sep 2024 0 repositories listed
-
Evaluation of real-time transcriptions using end-to-end ASR models9 Sep 2024 0 repositories listed
-
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge9 Sep 2024 0 repositories listed
-
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation9 Sep 2024 0 repositories listed
-
NTT Multi-Speaker ASR System for the DASR Task of CHiME-8 Challenge9 Sep 2024 0 repositories listed
-
Retrieval Augmented Correction of Named Entity Speech Recognition Errors9 Sep 2024 0 repositories listed
-
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection8 Sep 2024 0 repositories listed
-
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models4 Sep 2024 0 repositories listed
-
Probing self-attention in self-supervised speech models for cross-linguistic differences4 Sep 2024 0 repositories listed
-
Quantification of stylistic differences in human- and ASR-produced transcripts of African American English4 Sep 2024 0 repositories listed
-
What is lost in Normalization? Exploring Pitfalls in Multilingual ASR Model Evaluations4 Sep 2024 0 repositories listed
-
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model3 Sep 2024 0 repositories listed
-
Reassessing Noise Augmentation Methods in the Context of Adversarial Speech3 Sep 2024 0 repositories listed
-
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR3 Sep 2024 0 repositories listed
-
The USTC-NERCSLIP Systems for the CHiME-8 NOTSOFAR-1 Challenge3 Sep 2024 0 repositories listed
-
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka3 Sep 2024 0 repositories listed
-
A Framework for Synthetic Audio Conversations Generation using Large Language Models2 Sep 2024 0 repositories listed
-
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR2 Sep 2024 0 repositories listed
-
Comparing Discrete and Continuous Space LLMs for Speech Recognition1 Sep 2024 0 repositories listed
-
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition1 Sep 2024 0 repositories listed
-
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module31 Aug 2024 0 repositories listed
-
Progressive Residual Extraction based Pre-training for Speech Representation Learning31 Aug 2024 0 repositories listed
-
Advancing Multi-talker ASR Performance with Large Language Models30 Aug 2024 0 repositories listed
-
Developing an End-to-End Framework for Predicting the Social Communication Severity Scores of Children with Autism Spectrum Disorder30 Aug 2024 0 repositories listed
-
Speaker Tagging Correction With Non-Autoregressive Language Models30 Aug 2024 0 repositories listed
-
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction29 Aug 2024 0 repositories listed
-
Revisit Micro-batch Clipping: Adaptive Data Pruning via Gradient Manipulation29 Aug 2024 0 repositories listed
-
Literary and Colloquial Dialect Identification for Tamil using Acoustic Features27 Aug 2024 0 repositories listed
-
Speech Recognition Transformers: Topological-lingualism Perspective27 Aug 2024 0 repositories listed
-
Automatic recognition and detection of aphasic natural speech26 Aug 2024 0 repositories listed
-
MEDSAGE: Enhancing Robustness of Medical Dialogue Summarization to ASR Errors with LLM-generated Synthetic Dialogues26 Aug 2024 0 repositories listed
-
Research Advances and New Paradigms for Biology-inspired Spiking Neural Networks26 Aug 2024 0 repositories listed
-
Literary and Colloquial Tamil Dialect Identification25 Aug 2024 0 repositories listed
-
Studying the Effect of Audio Filters in Pre-Trained Models for Environmental Sound Classification24 Aug 2024 0 repositories listed
-
Focused Discriminative Training For Streaming CTC-Trained Automatic Speech Recognition Models23 Aug 2024 0 repositories listed
-
Developing vocal system impaired patient-aimed voice quality assessment approach using ASR representation-included multiple features22 Aug 2024 0 repositories listed
-
Positional Description for Numerical Normalization22 Aug 2024 0 repositories listed
-
Towards measuring fairness in speech recognition: Fair-Speech dataset22 Aug 2024 0 repositories listed
-
Improving Speech Recognition Error Prediction for Modern and Off-the-shelf Speech Recognizers21 Aug 2024 0 repositories listed
-
The State of Commercial Automatic French Legal Speech Recognition Systems and their Impact on Court Reporters et al21 Aug 2024 0 repositories listed
-
XCB: an effective contextual biasing approach to bias cross-lingual phrases in speech recognition20 Aug 2024 0 repositories listed
-
Parameter-Efficient Transfer Learning under Federated Learning for Automatic Speech Recognition19 Aug 2024 0 repositories listed
-
Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR Transcripts19 Aug 2024 0 repositories listed
-
Toward Large-scale Spiking Neural Networks: A Comprehensive Survey and Future Directions19 Aug 2024 0 repositories listed
-
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words15 Aug 2024 0 repositories listed
-
DPSNN: Spiking Neural Network for Low-Latency Streaming Speech Enhancement14 Aug 2024 0 repositories listed
-
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation13 Aug 2024 0 repositories listed
-
Audio Enhancement for Computer Audition -- An Iterative Training Paradigm Using Sample Importance12 Aug 2024 0 repositories listed
-
Cross-Lingual Conversational Speech Summarization with Large Language Models12 Aug 2024 0 repositories listed
-
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning12 Aug 2024 0 repositories listed
-
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing11 Aug 2024 0 repositories listed
-
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text10 Aug 2024 0 repositories listed
-
7 Aug 2024 0 repositories listed
-
Self-Supervised Learning for Multi-Channel Neural Transducer6 Aug 2024 0 repositories listed
-
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval6 Aug 2024 0 repositories listed
-
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion5 Aug 2024 0 repositories listed
-
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation1 Aug 2024 0 repositories listed
-
Towards interfacing large language models with ASR systems using confidence measures and prompting31 Jul 2024 0 repositories listed
-
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition31 Jul 2024 0 repositories listed
-
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks28 Jul 2024 0 repositories listed
-
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses26 Jul 2024 0 repositories listed
-
Speech Bandwidth Expansion Via High Fidelity Generative Adversarial Networks26 Jul 2024 0 repositories listed
-
Improving Domain-Specific ASR with LLM-Generated Contextual Descriptions25 Jul 2024 0 repositories listed
-
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures25 Jul 2024 0 repositories listed
-
A Comparative Analysis of Bilingual and Trilingual Wav2Vec Models for Automatic Speech Recognition in Multilingual Oral History Archives24 Jul 2024 0 repositories listed
-
Coupling Speech Encoders with Downstream Text Models24 Jul 2024 0 repositories listed
-
Quantifying the Role of Textual Predictability in Automatic Speech Recognition23 Jul 2024 0 repositories listed
-
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization23 Jul 2024 0 repositories listed
-
Robustness of Speech Separation Models for Similar-pitch Speakers22 Jul 2024 0 repositories listed
-
Trading Devil Final: Backdoor attack via Stock market and Bayesian Optimization21 Jul 2024 0 repositories listed