Browse State-of-the-Art › text-to-speech › Papers, page 7
text-to-speech
Papers archive 2025-07-28
archive papers tagged: 1,413 · with a code link: 395 · where Syntology ran a sample: 106 (95 with a run with no instrument failure, 11 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (106 of 1,413 tagged: 95 with a run with no instrument failure, 11 where every run was a failure of Syntology's instrument)
Page 7 of 15: papers 601 to 700 of 1,413, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference18 Sep 2024 0 repositories listed
-
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild18 Sep 2024 0 repositories listed
-
SpMis: An Investigation of Synthetic Spoken Misinformation Detection17 Sep 2024 0 repositories listed
-
The Art of Storytelling: Multi-Agent Generative AI for Dynamic Multimodal Narratives17 Sep 2024 0 repositories listed
-
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora17 Sep 2024 0 repositories listed
-
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization16 Sep 2024 0 repositories listed
-
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion16 Sep 2024 0 repositories listed
-
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning15 Sep 2024 0 repositories listed
-
E1 TTS: Simple and Fast Non-Autoregressive TTS14 Sep 2024 0 repositories listed
-
Improving Robustness of Diffusion-Based Zero-Shot Speech Synthesis via Stable Formant Generation14 Sep 2024 0 repositories listed
-
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation13 Sep 2024 0 repositories listed
-
HLTCOE JHU Submission to the Voice Privacy Challenge 202413 Sep 2024 0 repositories listed
-
Text-To-Speech Synthesis In The Wild13 Sep 2024 0 repositories listed
-
Full-text Error Correction for Chinese Speech Recognition with Large Language Model12 Sep 2024 0 repositories listed
-
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT11 Sep 2024 0 repositories listed
-
D-CAPTCHA++: A Study of Resilience of Deepfake CAPTCHA under Transferable Imperceptible Adversarial Attack11 Sep 2024 0 repositories listed
-
Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment11 Sep 2024 0 repositories listed
-
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach10 Sep 2024 0 repositories listed
-
VoiceWukong: Benchmarking Deepfake Voice Detection10 Sep 2024 0 repositories listed
-
What happens to diffusion model likelihood when your model is conditional?10 Sep 2024 0 repositories listed
-
AS-Speech: Adaptive Style For Speech Synthesis9 Sep 2024 0 repositories listed
-
5 Sep 2024 0 repositories listed
-
Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems4 Sep 2024 0 repositories listed
-
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka3 Sep 2024 0 repositories listed
-
A Framework for Synthetic Audio Conversations Generation using Large Language Models2 Sep 2024 0 repositories listed
-
A multilingual training strategy for low resource Text to Speech2 Sep 2024 0 repositories listed
-
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge30 Aug 2024 0 repositories listed
-
SelectTTS: Synthesizing Anyone's Voice via Discrete Unit-Based Frame Selection30 Aug 2024 0 repositories listed
-
Easy, Interpretable, Effective: openSMILE for voice deepfake detection28 Aug 2024 0 repositories listed
-
Multi-modal Adversarial Training for Zero-Shot Voice Cloning28 Aug 2024 0 repositories listed
-
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance26 Aug 2024 0 repositories listed
-
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models25 Aug 2024 0 repositories listed
-
Positional Description for Numerical Normalization22 Aug 2024 0 repositories listed
-
Adversarial training of Keyword Spotting to Minimize TTS Data Overfitting20 Aug 2024 0 repositories listed
-
kNN Retrieval for Simple and Effective Zero-Shot Multi-speaker Text-to-Speech20 Aug 2024 0 repositories listed
-
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation13 Aug 2024 0 repositories listed
-
FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks12 Aug 2024 0 repositories listed
-
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing11 Aug 2024 0 repositories listed
-
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation1 Aug 2024 0 repositories listed
-
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition31 Jul 2024 0 repositories listed
-
Speech Bandwidth Expansion Via High Fidelity Generative Adversarial Networks26 Jul 2024 0 repositories listed
-
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures25 Jul 2024 0 repositories listed
-
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model24 Jul 2024 0 repositories listed
-
Synth4Kws: Synthesized Speech for User Defined Keyword Spotting in Low Resource Environments23 Jul 2024 0 repositories listed
-
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech219 Jul 2024 0 repositories listed
-
Handling Numeric Expressions in Automatic Speech Recognition18 Jul 2024 0 repositories listed
-
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models18 Jul 2024 0 repositories listed
-
A Language Modeling Approach to Diacritic-Free Hebrew TTS16 Jul 2024 0 repositories listed
-
Autoregressive Speech Synthesis without Vector Quantization11 Jul 2024 0 repositories listed
-
Source Tracing of Audio Deepfake Systems10 Jul 2024 0 repositories listed
-
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation7 Jul 2024 0 repositories listed
-
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis4 Jul 2024 0 repositories listed
-
On the Effectiveness of Acoustic BPE in Decoder-Only TTS4 Jul 2024 0 repositories listed
-
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization2 Jul 2024 0 repositories listed
-
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations2 Jul 2024 0 repositories listed
-
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters1 Jul 2024 0 repositories listed
-
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis30 Jun 2024 0 repositories listed
-
NAIST Simultaneous Speech Translation System for IWSLT 202430 Jun 2024 0 repositories listed
-
Open-Source Conversational AI with SpeechBrain 1.029 Jun 2024 0 repositories listed
-
Application of ASV for Voice Identification after VC and Duration Predictor Improvement in TTS Models27 Jun 2024 0 repositories listed
-
Automatic Speech Recognition for Hindi26 Jun 2024 0 repositories listed
-
LLM-Driven Multimodal Opinion Expression Identification26 Jun 2024 0 repositories listed
-
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model25 Jun 2024 0 repositories listed
-
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment25 Jun 2024 0 repositories listed
-
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation25 Jun 2024 0 repositories listed
-
Towards Zero-Shot Text-To-Speech for Arabic Dialects24 Jun 2024 0 repositories listed
-
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge22 Jun 2024 0 repositories listed
-
InterBiasing: Boost Unseen Word Recognition through Biasing Intermediate Predictions21 Jun 2024 0 repositories listed
-
DASB -- Discrete Audio and Speech Benchmark20 Jun 2024 0 repositories listed
-
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models18 Jun 2024 0 repositories listed
-
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis16 Jun 2024 0 repositories listed
-
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice14 Jun 2024 0 repositories listed
-
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage13 Jun 2024 0 repositories listed
-
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing13 Jun 2024 0 repositories listed
-
Audio-conditioned phonemic and prosodic annotation for building text-to-speech models from unlabeled speech data12 Jun 2024 0 repositories listed
-
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment12 Jun 2024 0 repositories listed
-
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech12 Jun 2024 0 repositories listed
-
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?11 Jun 2024 0 repositories listed
-
MakeSinger: A Semi-Supervised Training Method for Data-Efficient Singing Voice Synthesis via Classifier-free Diffusion Guidance10 Jun 2024 0 repositories listed
-
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS9 Jun 2024 0 repositories listed
-
Text-aware and Context-aware Expressive Audiobook Speech Synthesis9 Jun 2024 0 repositories listed
-
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis8 Jun 2024 0 repositories listed
-
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers8 Jun 2024 0 repositories listed
-
Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study7 Jun 2024 0 repositories listed
-
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs7 Jun 2024 0 repositories listed
-
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer6 Jun 2024 0 repositories listed
-
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model6 Jun 2024 0 repositories listed
-
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems6 Jun 2024 0 repositories listed
-
Harder or Different? Understanding Generalization of Audio Deepfake Detection5 Jun 2024 0 repositories listed
-
Style Mixture of Experts for Expressive Text-To-Speech Synthesis5 Jun 2024 0 repositories listed
-
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition5 Jun 2024 0 repositories listed
-
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation4 Jun 2024 0 repositories listed
-
Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing4 Jun 2024 0 repositories listed
-
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis4 Jun 2024 0 repositories listed
-
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training3 Jun 2024 0 repositories listed
-
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback2 Jun 2024 0 repositories listed
-
Zipper: A Multi-Tower Decoder Architecture for Fusing Modalities29 May 2024 0 repositories listed
-
Denoising LM: Pushing the Limits of Error Correction Models for Speech Recognition24 May 2024 0 repositories listed
-
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning23 May 2024 0 repositories listed
-
DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models23 May 2024 0 repositories listed