{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/voice-conversion/papers/5","list_of":"/task/voice-conversion","task":"Voice Conversion","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":6,"rows_per_page":100,"rows":[401,500],"of":520,"counts":{"archive_papers_tagged":520,"with_a_code_link":175,"where_syntology_ran_a_sample":41,"not_listed_spam_title":0,"listed":520,"listed_where_code_ran":41,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":32,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":32,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/voice-conversion","prev":"/task/voice-conversion/papers/4","next":"/task/voice-conversion/papers/6","papers":[{"url":null,"slug":"voice-conversion-can-improve-asr-in-very-low","title":"Voice Conversion Can Improve ASR in Very Low-Resource Settings","date":"2021-11-04","arxiv_id":"2111.02674","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-voice-conversion-via-self","title":"Zero-shot Voice Conversion via Self-supervised Prosody Representation Learning","date":"2021-10-27","arxiv_id":"2110.14422","repositories_listed":0,"syntology":null},{"url":null,"slug":"identity-conversion-for-emotional-speakers-a","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","date":"2021-10-20","arxiv_id":"2110.10326","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-assisted-stargan-voice","title":"Speech Enhancement-assisted Voice Conversion in Noisy Environments","date":"2021-10-19","arxiv_id":"2110.09923","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycleflow-purify-information-factors-by-cycle","title":"CycleFlow: Purify Information Factors by Cycle Loss","date":"2021-10-18","arxiv_id":"2110.09928","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-identity-preserving-normal-to","title":"Towards Identity Preserving Normal to Dysarthric Voice Conversion","date":"2021-10-15","arxiv_id":"2110.08213","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepa-a-deep-neural-analyzer-for-speech-and","title":"DeepA: A Deep Neural Analyzer For Speech And Singing Vocoding","date":"2021-10-13","arxiv_id":"2110.06434","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-importance-of-f0-trajectories","title":"Exploring the Importance of F0 Trajectories for Speaker Anonymization using X-vectors and Neural Waveform Models","date":"2021-10-13","arxiv_id":"2110.06887","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-high-fidelity-singing-voice","title":"Towards High-fidelity Singing Voice Conversion with Acoustic Reference and Contrastive Predictive Coding","date":"2021-10-10","arxiv_id":"2110.04754","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-speaker-embedding-and-post","title":"Incorporating speaker embedding and post-filter network for improving speaker similarity of personalized speech synthesis system","date":"2021-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-speech-duration-modification-using-a","title":"Adaptive Speech Duration Modification using a Deep-Generative Framework","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"clsvc-learning-speech-representations-with","title":"ClsVC: Learning Speech Representations with two different classification tasks.","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"time-alignment-using-lip-images-for-frame","title":"Time Alignment using Lip Images for Frame-based Electrolaryngeal Voice Conversion","date":"2021-09-08","arxiv_id":"2109.03551","repositories_listed":0,"syntology":null},{"url":null,"slug":"physiological-physical-feature-fusion-for","title":"Physiological-Physical Feature Fusion for Automatic Voice Spoofing Detection","date":"2021-09-01","arxiv_id":"2109.00913","repositories_listed":0,"syntology":null},{"url":null,"slug":"rw-resnet-a-novel-speech-anti-spoofing-model","title":"RW-Resnet: A Novel Speech Anti-Spoofing Model Using Raw Waveform","date":"2021-08-12","arxiv_id":"2108.05684","repositories_listed":0,"syntology":null},{"url":null,"slug":"stargan-vc-asr-stargan-based-non-parallel","title":"StarGAN-VC+ASR: StarGAN-based Non-Parallel Voice Conversion Regularized by Automatic Speech Recognition","date":"2021-08-10","arxiv_id":"2108.04395","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-voice-identity-conversion-manipulating","title":"Beyond Voice Identity Conversion: Manipulating Voice Attributes by Adversarial Learning of Structured Disentangled Representations","date":"2021-07-26","arxiv_id":"2107.12346","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-prosody-modeling-for-asr-tts-based-voice","title":"On Prosody Modeling for ASR+TTS based Voice Conversion","date":"2021-07-20","arxiv_id":"2107.09477","repositories_listed":0,"syntology":null},{"url":"/paper/a-deep-bayesian-framework-for-adaptive-speech","slug":"a-deep-bayesian-framework-for-adaptive-speech","title":"A Deep-Bayesian Framework for Adaptive Speech Duration Modification","date":"2021-07-11","arxiv_id":"2107.04973","repositories_listed":0,"syntology":null},{"url":null,"slug":"many-to-many-voice-conversion-based-feature","title":"Many-to-Many Voice Conversion based Feature Disentanglement using Variational Autoencoder","date":"2021-07-11","arxiv_id":"2107.06642","repositories_listed":0,"syntology":null},{"url":null,"slug":"expressive-voice-conversion-a-joint-framework","title":"Expressive Voice Conversion: A Joint Framework for Speaker Identity and Emotional Style Transfer","date":"2021-07-08","arxiv_id":"2107.03748","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-objective-evaluation-framework-for","title":"An Objective Evaluation Framework for Pathological Speech Synthesis","date":"2021-07-01","arxiv_id":"2107.00308","repositories_listed":0,"syntology":null},{"url":null,"slug":"enriching-source-style-transfer-in","title":"Enriching Source Style Transfer in Recognition-Synthesis based Non-Parallel Voice Conversion","date":"2021-06-16","arxiv_id":"2106.08741","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathological-voice-adaptation-with","title":"Pathological voice adaptation with autoencoder-based voice conversion","date":"2021-06-15","arxiv_id":"2106.08427","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-preliminary-study-of-a-two-stage-paradigm","title":"A Preliminary Study of a Two-Stage Paradigm for Preserving Speaker Identity in Dysarthric Voice Conversion","date":"2021-06-02","arxiv_id":"2106.01415","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-paralinguistic-features-from","title":"Learning Paralinguistic Features from Audiobooks through Style Voice Conversion","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stargan-zsvc-towards-zero-shot-voice","title":"StarGAN-ZSVC: Towards Zero-Shot Voice Conversion in Low-Resource Contexts","date":"2021-05-31","arxiv_id":"2106.00043","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffsvc-a-diffusion-probabilistic-model-for","title":"DiffSVC: A Diffusion Probabilistic Model for Singing Voice Conversion","date":"2021-05-28","arxiv_id":"2105.13871","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-conversion-based-speaker-normalization","title":"Voice Conversion Based Speaker Normalization for Acoustic Unit Discovery","date":"2021-05-04","arxiv_id":"2105.01786","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-adaptive-learning-based-generative","title":"An Adaptive Learning based Generative Adversarial Network for One-To-One Voice Conversion","date":"2021-04-25","arxiv_id":"2104.12159","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-end-to-end-f0-voice-conversion-based","title":"Towards end-to-end F0 voice conversion based on Dual-GAN with convolutional wavelet kernels","date":"2021-04-15","arxiv_id":"2104.07283","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-sequence-to-sequence-voice","title":"Non-autoregressive sequence-to-sequence voice conversion","date":"2021-04-14","arxiv_id":"2104.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisevc-towards-high-quality-zero-shot-voice","title":"NoiseVC: Towards High Quality Zero-Shot Voice Conversion","date":"2021-04-13","arxiv_id":"2104.06074","repositories_listed":0,"syntology":null},{"url":null,"slug":"stargan-based-emotional-voice-conversion-for","title":"StarGAN-based Emotional Voice Conversion for Japanese Phrases","date":"2021-04-05","arxiv_id":"2104.01807","repositories_listed":0,"syntology":null},{"url":null,"slug":"axial-residual-networks-for-cyclegan-based","title":"Axial Residual Networks for CycleGAN-based Voice Conversion","date":"2021-02-16","arxiv_id":"2102.08075","repositories_listed":0,"syntology":null},{"url":"/paper/asvspoof-2019-spoofing-countermeasures-for","slug":"asvspoof-2019-spoofing-countermeasures-for","title":"ASVspoof 2019: spoofing countermeasures for the detection of synthesized, converted and replayed speech","date":"2021-02-11","arxiv_id":"2102.05889","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-natural-and-controllable-cross","title":"Towards Natural and Controllable Cross-Lingual Voice Conversion Based on Neural TTS Model and Phonetic Posteriorgram","date":"2021-02-03","arxiv_id":"2102.01991","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-fidelity-speech-regeneration-with","title":"High Fidelity Speech Regeneration with Application to Speech Enhancement","date":"2021-01-31","arxiv_id":"2102.00429","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-learning-disentangled-speech","title":"Adversarially learning disentangled speech representations for robust multi-factor voice conversion","date":"2021-01-30","arxiv_id":"2102.00184","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-disentangled-representation","title":"Hierarchical disentangled representation learning for singing voice conversion","date":"2021-01-18","arxiv_id":"2101.06842","repositories_listed":0,"syntology":null},{"url":null,"slug":"emocat-language-agnostic-emotional-voice","title":"EmoCat: Language-agnostic Emotional Voice Conversion","date":"2021-01-14","arxiv_id":"2101.05695","repositories_listed":0,"syntology":null},{"url":"/paper/joint-audio-visual-deepfake-detection","slug":"joint-audio-visual-deepfake-detection","title":"Joint Audio-Visual Deepfake Detection","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-far-are-we-from-robust-voice-conversion-a","title":"How Far Are We from Robust Voice Conversion: A Survey","date":"2020-11-24","arxiv_id":"2011.12063","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-expressive-text-to-speech-using","title":"Low-resource expressive text-to-speech using data augmentation","date":"2020-11-11","arxiv_id":"2011.05707","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-explicit-prosody-models-and-deep","title":"Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion","date":"2020-11-03","arxiv_id":"2011.01678","repositories_listed":0,"syntology":null},{"url":null,"slug":"vaw-gan-for-disentanglement-and-recomposition","title":"VAW-GAN for Disentanglement and Recomposition of Emotional Elements in Speech","date":"2020-11-03","arxiv_id":"2011.02314","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptually-guided-end-to-end-text-to-speech","title":"Learning to Maximize Speech Quality Directly Using MOS Prediction for Neural Text-to-Speech","date":"2020-11-02","arxiv_id":"2011.01174","repositories_listed":0,"syntology":null},{"url":null,"slug":"ppg-based-singing-voice-conversion-with","title":"PPG-based singing voice conversion with adversarial representation learning","date":"2020-10-28","arxiv_id":"2010.14804","repositories_listed":0,"syntology":null},{"url":null,"slug":"any-to-one-sequence-to-sequence-voice","title":"Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations","date":"2020-10-23","arxiv_id":"2010.12231","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-nu-voice-conversion-system-for-the-voice","title":"The NU Voice Conversion System for the Voice Conversion Challenge 2020: On the Effectiveness of Sequence-to-sequence Models and Autoregressive Neural Vocoders","date":"2020-10-09","arxiv_id":"2010.04446","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastvc-fast-voice-conversion-with-non","title":"FastVC: Fast Voice Conversion with non-parallel data","date":"2020-10-08","arxiv_id":"2010.04185","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-linguistic-embedding-for-cross-lingual","title":"Latent linguistic embedding for cross-lingual text-to-speech and voice conversion","date":"2020-10-08","arxiv_id":"2010.03717","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-academia-sinica-systems-of-voice","title":"The Academia Sinica Systems of Voice Conversion for VCC2020","date":"2020-10-06","arxiv_id":"2010.02669","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-automatic-voice-disguise-meets-automatic","title":"When Automatic Voice Disguise Meets Automatic Speaker Verification","date":"2020-09-15","arxiv_id":"2009.06863","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-conversion-by-cascading-automatic","title":"Voice Conversion by Cascading Automatic Speech Recognition and Text-to-Speech Synthesis with Prosody Transfer","date":"2020-09-03","arxiv_id":"2009.01475","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-conversion-challenge-2020-intra-lingual","title":"Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion","date":"2020-08-28","arxiv_id":"2008.12527","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepsonar-towards-effective-and-robust","title":"DeepSonar: Towards Effective and Robust Detection of AI-Synthesized Fake Voices","date":"2020-08-15","arxiv_id":"2005.13770","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectrum-and-prosody-conversion-for-cross","title":"Spectrum and Prosody Conversion for Cross-lingual Voice Conversion with CycleGAN","date":"2020-08-11","arxiv_id":"2008.04562","repositories_listed":0,"syntology":null},{"url":null,"slug":"vaw-gan-for-singing-voice-conversion-with-non","title":"VAW-GAN for Singing Voice Conversion with Non-parallel Training Data","date":"2020-08-10","arxiv_id":"2008.03992","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-mos-predictor-for-synthetic-speech-using","title":"Deep MOS Predictor for Synthetic Speech Using Cluster-Based Modeling","date":"2020-08-09","arxiv_id":"2008.03710","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-cross-domain-singing-voice","title":"Unsupervised Cross-Domain Singing Voice Conversion","date":"2020-08-06","arxiv_id":"2008.02830","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-mos-prediction-for-synthesized-speech","title":"Neural MOS Prediction for Synthesized Speech Using Multi-Task Learning With Spoofing Detection and Spoofing Type Classification","date":"2020-07-16","arxiv_id":"2007.08267","repositories_listed":0,"syntology":null},{"url":null,"slug":"nautilus-a-versatile-voice-cloning-system","title":"NAUTILUS: a Versatile Voice Cloning System","date":"2020-05-22","arxiv_id":"2005.11004","repositories_listed":0,"syntology":null},{"url":null,"slug":"many-to-many-voice-transformer-network","title":"Many-to-Many Voice Transformer Network","date":"2020-05-18","arxiv_id":"2005.08445","repositories_listed":0,"syntology":null},{"url":null,"slug":"vowels-and-prosody-contribution-in-neural","title":"Vowels and Prosody Contribution in Neural Network Based Voice Conversion Algorithm with Noisy Training Data","date":"2020-03-10","arxiv_id":"2003.04640","repositories_listed":0,"syntology":null},{"url":null,"slug":"many-to-many-voice-conversion-using","title":"Many-to-Many Voice Conversion using Conditional Cycle-Consistent Adversarial Networks","date":"2020-02-15","arxiv_id":"2002.06328","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-singing-from-speech","title":"Learning Singing From Speech","date":"2019-12-20","arxiv_id":"1912.10128","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-conversion-for-whispered-speech","title":"Voice Conversion for Whispered Speech Synthesis","date":"2019-12-11","arxiv_id":"1912.05289","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-neural-vocoding-for-speech","title":"Towards Robust Neural Vocoding for Speech Generation: A Survey","date":"2019-12-05","arxiv_id":"1912.02461","repositories_listed":0,"syntology":null},{"url":null,"slug":"pitchnet-unsupervised-singing-voice","title":"PitchNet: Unsupervised Singing Voice Conversion with Pitch Adversarial Network","date":"2019-12-04","arxiv_id":"1912.01852","repositories_listed":0,"syntology":null},{"url":null,"slug":"singing-voice-conversion-with-disentangled","title":"Singing Voice Conversion with Disentangled Representations of Singer and Vocal Technique Using Variational Autoencoders","date":"2019-12-03","arxiv_id":"1912.02613","repositories_listed":0,"syntology":null},{"url":null,"slug":"shi-he-jian-dong-ren-shi-yong-zhi-yu-yin","title":"適合漸凍人使用之語音轉換系統初步研究 (Deep Neural-Network Bandwidth Extension and Denoising Voice Conversion System for ALS Patients)","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-voice-conversion-based-privacy","title":"Evaluating Voice Conversion-based Privacy Protection against Informed Attackers","date":"2019-11-10","arxiv_id":"1911.03934","repositories_listed":0,"syntology":null},{"url":null,"slug":"change-your-singer-a-transfer-learning","title":"Change your singer: a transfer learning generative adversarial framework for song to song conversion","date":"2019-11-07","arxiv_id":"1911.02933","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-asvspoof-2019-database","title":"ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech","date":"2019-11-05","arxiv_id":"1911.01601","repositories_listed":0,"syntology":null},{"url":null,"slug":"replay-spoofing-countermeasure-using","title":"Replay Spoofing Countermeasure Using Autoencoder and Siamese Network on ASVspoof 2019 Challenge","date":"2019-10-29","arxiv_id":"1910.13345","repositories_listed":0,"syntology":null},{"url":null,"slug":"softgan-learning-generative-models","title":"CycleGAN Voice Conversion of Spectral Envelopes using Adversarial Weights","date":"2019-10-22","arxiv_id":"1910.12614","repositories_listed":0,"syntology":null},{"url":null,"slug":"shi-he-jian-dong-ren-shi-yong-zhi-yu-yin-1","title":"適合漸凍人使用之語音轉換系統初步研究(Deep Neural-Network Bandwidth Extension and Denoising Voice Conversion System for ALS Patients)","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shi-yong-yu-zhe-zhuan-huan-ji-shu-yu-yu-yin","title":"使用語者轉換技術於語音合成資料庫之音質改進(Speech Enhancement for TTS Speech Corpora by using Voice Conversion Technologies)","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-voice-conversion-with","title":"Semi-supervised voice conversion with amortized variational inference","date":"2019-09-30","arxiv_id":"1910.00067","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-conversion-using-cycle-consistent","title":"Many-to-Many Voice Conversion using Cycle-Consistent Variational Autoencoder with Multiple Decoders","date":"2019-09-15","arxiv_id":"1909.06805","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-non-parallel-voice-conversion","title":"Bootstrapping non-parallel voice conversion from speaker-adaptive text-to-speech","date":"2019-09-14","arxiv_id":"1909.06532","repositories_listed":0,"syntology":null},{"url":null,"slug":"dnn-based-cross-lingual-voice-conversion","title":"DNN-based cross-lingual voice conversion using Bottleneck Features","date":"2019-09-09","arxiv_id":"1909.03974","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2s-attack-building-dnn-based-voice","title":"V2S attack: building DNN-based voice conversion from automatic speaker verification","date":"2019-08-05","arxiv_id":"1908.01454","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-spectrum-differential-based","title":"Generalization of Spectrum Differential based Direct Waveform Modification for Voice Conversion","date":"2019-07-27","arxiv_id":"1907.11898","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-sequence-to-sequence-voice","title":"Hierarchical Sequence to Sequence Voice Conversion with Limited Data","date":"2019-07-15","arxiv_id":"1907.07769","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-trained-autoencoders-for","title":"Adversarially Trained Autoencoders for Parallel-Data-Free Voice Conversion","date":"2019-05-09","arxiv_id":"1905.03864","repositories_listed":0,"syntology":null},{"url":null,"slug":"190502525","title":"Many-to-Many Voice Conversion with Out-of-Dataset Speaker Support","date":"2019-04-30","arxiv_id":"1905.02525","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-singing-voice-conversion","title":"Unsupervised Singing Voice Conversion","date":"2019-04-13","arxiv_id":"1904.06590","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossmodal-voice-conversion","title":"Crossmodal Voice Conversion","date":"2019-04-09","arxiv_id":"1904.04540","repositories_listed":0,"syntology":null},{"url":null,"slug":"taco-vc-a-single-speaker-tacotron-based-voice","title":"Taco-VC: A Single Speaker Tacotron based Voice Conversion with Limited Data","date":"2019-04-06","arxiv_id":"1904.03522","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-training-framework-for-text-to-speech","title":"Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet","date":"2019-03-29","arxiv_id":"1903.12389","repositories_listed":0,"syntology":null},{"url":null,"slug":"singing-voice-conversion-with-non-parallel","title":"Singing voice conversion with non-parallel data","date":"2019-03-11","arxiv_id":"1903.04124","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-wavenet-vocoder-for-variational","title":"Refined WaveNet Vocoder for Variational Autoencoder Based Voice Conversion","date":"2018-11-27","arxiv_id":"1811.11078","repositories_listed":0,"syntology":null},{"url":null,"slug":"atts2s-vc-sequence-to-sequence-voice","title":"AttS2S-VC: Sequence-to-Sequence Voice Conversion with Attention and Context Preservation Mechanisms","date":"2018-11-09","arxiv_id":"1811.04076","repositories_listed":0,"syntology":null},{"url":null,"slug":"convs2s-vc-fully-convolutional-sequence-to","title":"ConvS2S-VC: Fully convolutional sequence-to-sequence voice conversion","date":"2018-11-05","arxiv_id":"1811.01609","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-using-disentangled-and-1","title":"Investigation of using disentangled and interpretable representations with language conditioning for cross-lingual voice conversion","date":"2018-10-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"wavenet-e2c14a-aa14eae3e12a1c-wavenet-vocoder","title":"WaveNet 聲碼器及其於語音轉換之應用 (WaveNet Vocoder and its Applications in Voice Conversion) [In Chinese]","date":"2018-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"error-reduction-network-for-dblstm-based","title":"Error Reduction Network for DBLSTM-based Voice Conversion","date":"2018-09-26","arxiv_id":"1809.09841","repositories_listed":0,"syntology":null},{"url":null,"slug":"wavecyclegan-synthetic-to-natural-speech","title":"WaveCycleGAN: Synthetic-to-natural speech waveform conversion using cycle-consistent adversarial networks","date":"2018-09-25","arxiv_id":"1809.10288","repositories_listed":0,"syntology":null}],"record_sha256":"72edb596a140f23714d5322ceb0383941b59b9c57529af9231373cf826969895","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}