Browse State-of-the-Art › Automatic Speech Recognition › Papers, page 8
Automatic Speech Recognition
Papers archive 2025-07-28
archive papers tagged: 3,174 · with a code link: 677 · where Syntology ran a sample: 79 (62 with a run with no instrument failure, 17 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (79 of 3,174 tagged: 62 with a run with no instrument failure, 17 where every run was a failure of Syntology's instrument)
Page 8 of 32: papers 701 to 800 of 3,174, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary11 Jun 2025 0 repositories listed
-
Regularizing Learnable Feature Extraction for Automatic Speech Recognition11 Jun 2025 0 repositories listed
-
SimClass: A Classroom Speech Dataset Generated via Game Engine Simulation For Automatic Speech Recognition Research10 Jun 2025 0 repositories listed
-
Benchmarking Foundation Speech and Language Models for Alzheimer's Disease and Related Dementia Detection from Spontaneous Speech9 Jun 2025 0 repositories listed
-
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition9 Jun 2025 0 repositories listed
-
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation9 Jun 2025 0 repositories listed
-
Unified Semi-Supervised Pipeline for Automatic Speech Recognition9 Jun 2025 0 repositories listed
-
Speech Recognition on TV Series with Video-guided Post-Correction8 Jun 2025 0 repositories listed
-
Automatic Speech Recognition of African American English: Lexical and Contextual Effects7 Jun 2025 0 repositories listed
-
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition6 Jun 2025 0 repositories listed
-
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition6 Jun 2025 0 repositories listed
-
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models6 Jun 2025 0 repositories listed
-
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems6 Jun 2025 0 repositories listed
-
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning6 Jun 2025 0 repositories listed
-
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM5 Jun 2025 0 repositories listed
-
Customizing Speech Recognition Model with Large Language Model Feedback5 Jun 2025 0 repositories listed
-
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models5 Jun 2025 0 repositories listed
-
LLM-based phoneme-to-grapheme for phoneme-based speech recognition5 Jun 2025 0 repositories listed
-
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR4 Jun 2025 0 repositories listed
-
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation3 Jun 2025 0 repositories listed
-
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss3 Jun 2025 0 repositories listed
-
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning3 Jun 2025 0 repositories listed
-
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation2 Jun 2025 0 repositories listed
-
DNCASR: End-to-End Training for Speaker-Attributed ASR2 Jun 2025 0 repositories listed
-
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation2 Jun 2025 0 repositories listed
-
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric2 Jun 2025 0 repositories listed
-
Causal Structure Discovery for Error Diagnostics of Children's ASR31 May 2025 0 repositories listed
-
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition31 May 2025 0 repositories listed
-
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization30 May 2025 0 repositories listed
-
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction30 May 2025 0 repositories listed
-
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC30 May 2025 0 repositories listed
-
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR30 May 2025 0 repositories listed
-
Running Conventional Automatic Speech Recognition on Memristor Hardware: A Simulated Approach30 May 2025 0 repositories listed
-
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation29 May 2025 0 repositories listed
-
Prompting Whisper for Improved Verbatim Transcription and End-to-end Miscue Detection29 May 2025 0 repositories listed
-
Advancing Hearing Assessment: An ASR-Based Frequency-Specific Speech Test for Diagnosing Presbycusis28 May 2025 0 repositories listed
-
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding28 May 2025 0 repositories listed
-
Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use27 May 2025 0 repositories listed
-
PSRB: A Comprehensive Benchmark for Evaluating Persian ASR Systems27 May 2025 0 repositories listed
-
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation27 May 2025 0 repositories listed
-
Beyond Manual Transcripts: The Potential of Automated Speech Recognition Errors in Improving Alzheimer's Disease Detection26 May 2025 0 repositories listed
-
Continuous Learning for Children's ASR: Overcoming Catastrophic Forgetting with Elastic Weight Consolidation and Synaptic Intelligence26 May 2025 0 repositories listed
-
In-context Language Learning for Endangered Languages in Speech Recognition26 May 2025 0 repositories listed
-
KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization26 May 2025 0 repositories listed
-
Mixture of LoRA Experts for Low-Resourced Multi-Accent Automatic Speech Recognition26 May 2025 0 repositories listed
-
Robust fine-tuning of speech recognition models via model merging: application to disordered speech26 May 2025 0 repositories listed
-
The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages26 May 2025 0 repositories listed
-
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining23 May 2025 0 repositories listed
-
An Effective Training Framework for Light-Weight Automatic Speech Recognition Models22 May 2025 0 repositories listed
-
Large Language Models based ASR Error Correction for Child Conversations22 May 2025 0 repositories listed
-
SoccerChat: Integrating Multimodal Data for Enhanced Soccer Game Understanding22 May 2025 0 repositories listed
-
From Weak Labels to Strong Results: Utilizing 5,000 Hours of Noisy Classroom Transcripts with Minimal Accurate Data20 May 2025 0 repositories listed
-
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English20 May 2025 0 repositories listed
-
In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties20 May 2025 0 repositories listed
-
Calm-Whisper: Reduce Whisper Hallucination On Non-Speech By Calming Crazy Heads Down19 May 2025 0 repositories listed
-
Cross-modal Knowledge Transfer Learning as Graph Matching Based on Optimal Transport for ASR19 May 2025 0 repositories listed
-
KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 202519 May 2025 0 repositories listed
-
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio16 May 2025 0 repositories listed
-
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors16 May 2025 0 repositories listed
-
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems16 May 2025 0 repositories listed
-
Automatic Speech Recognition for African Low-Resource Languages: Challenges and Future Directions16 May 2025 0 repositories listed
-
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models16 May 2025 0 repositories listed
-
Remote Rowhammer Attack using Adversarial Observations on Federated Learning Clients9 May 2025 0 repositories listed
-
Teochew-Wild: The First In-the-wild Teochew Dataset with Orthographic Annotations8 May 2025 0 repositories listed
-
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech6 May 2025 0 repositories listed
-
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation6 May 2025 0 repositories listed
-
Transfer Learning-Based Deep Residual Learning for Speech Recognition in Clean and Noisy Environments2 May 2025 0 repositories listed
-
Retrieval-Enhanced Few-Shot Prompting for Speech Event Extraction30 Apr 2025 0 repositories listed
-
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides21 Apr 2025 0 repositories listed
-
StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models21 Apr 2025 0 repositories listed
-
Acoustic to Articulatory Inversion of Speech; Data Driven Approaches, Challenges, Applications, and Future Scope17 Apr 2025 0 repositories listed
-
Advancing Arabic Speech Recognition Through Large-Scale Weakly Supervised Learning16 Apr 2025 0 repositories listed
-
Spatial Audio Processing with Large Language Model on Wearable Devices11 Apr 2025 0 repositories listed
-
Visual-Aware Speech Recognition for Noisy Scenarios9 Apr 2025 0 repositories listed
-
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect3 Apr 2025 0 repositories listed
-
Chain of Correction for Full-text Speech Recognition with Large Language Models2 Apr 2025 0 repositories listed
-
The Impact of Code-switched Synthetic Data Quality is Task Dependent: Insights from MT and ASR30 Mar 2025 0 repositories listed
-
VALLR: Visual ASR Language Model for Lip Reading27 Mar 2025 0 repositories listed
-
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications26 Mar 2025 0 repositories listed
-
Boosting the Transferability of Audio Adversarial Examples with Acoustic Representation Optimization25 Mar 2025 0 repositories listed
-
Whispering in Amharic: Fine-tuning Whisper for Low-resource Language24 Mar 2025 0 repositories listed
-
Your voice is your voice: Supporting Self-expression through Speech Generation and LLMs in Augmented and Alternative Communication21 Mar 2025 0 repositories listed
-
Evaluating ASR Confidence Scores for Automated Error Detection in User-Assisted Correction Interfaces19 Mar 2025 0 repositories listed
-
Halving transcription time: A fast, user-friendly and GDPR-compliant workflow to create AI-assisted transcripts for content analysis17 Mar 2025 0 repositories listed
-
Enhancing Aviation Communication Transcription: Fine-Tuning Distil-Whisper with LoRA13 Mar 2025 0 repositories listed
-
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment12 Mar 2025 0 repositories listed
-
ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization12 Mar 2025 0 repositories listed
-
An Exhaustive Evaluation of TTS- and VC-based Data Augmentation for ASR11 Mar 2025 0 repositories listed
-
Automatic Speech Recognition for Non-Native English: Accuracy and Disfluency Handling10 Mar 2025 0 repositories listed
-
Building English ASR model with regional language support10 Mar 2025 0 repositories listed
-
From Voice to Safety: Language AI Powered Pilot-ATC Communication Understanding for Airport Surface Movement Collision Risk Assessment6 Mar 2025 0 repositories listed
-
Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations5 Mar 2025 0 repositories listed
-
Direct Speech to Speech Translation: A Review3 Mar 2025 0 repositories listed
-
Fine-Tuning Whisper for Inclusive Prosodic Stress Analysis3 Mar 2025 0 repositories listed
-
Unveiling Biases while Embracing Sustainability: Assessing the Dual Challenges of Automatic Speech Recognition Systems2 Mar 2025 0 repositories listed
-
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications27 Feb 2025 0 repositories listed
-
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition26 Feb 2025 0 repositories listed
-
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision26 Feb 2025 0 repositories listed
-
Exploring Gender Disparities in Automatic Speech Recognition Technology25 Feb 2025 0 repositories listed
-
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM24 Feb 2025 0 repositories listed