{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition/papers/47","list_of":"/task/speech-recognition","task":"Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":47,"pages_in_order":65,"rows_per_page":100,"rows":[4601,4700],"of":6433,"counts":{"archive_papers_tagged":6433,"with_a_code_link":1373,"where_syntology_ran_a_sample":196,"not_listed_spam_title":0,"listed":6433,"listed_where_code_ran":196,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":162,"every_run_a_failure_of_syntologys_instrument":34,"listed_with_a_run_with_no_instrument_failure":162,"listed_every_run_a_failure_of_syntologys_instrument":34,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition","prev":"/task/speech-recognition/papers/46","next":"/task/speech-recognition/papers/48","papers":[{"url":null,"slug":"privacy-preserving-adversarial-representation","title":"Privacy-Preserving Adversarial Representation Learning in ASR: Reality or Illusion?","date":"2019-11-12","arxiv_id":"1911.04913","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-direct-speech-to-text","title":"Data Efficient Direct Speech-to-Text Translation with Modality Agnostic Meta-Learning","date":"2019-11-11","arxiv_id":"1911.04283","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-span-language-modeling-for-speech","title":"Long-span language modeling for speech recognition","date":"2019-11-11","arxiv_id":"1911.04571","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-voice-conversion-based-privacy","title":"Evaluating Voice Conversion-based Privacy Protection against Informed Attackers","date":"2019-11-10","arxiv_id":"1911.03934","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intelligence-representation","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","date":"2019-11-10","arxiv_id":"1911.03977","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-transformer-automatic","title":"Listen and Fill in the Missing Letters: Non-Autoregressive Transformer for Speech Recognition","date":"2019-11-10","arxiv_id":"1911.04908","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-adaptation-for-attention-based-end-to","title":"Speaker Adaptation for Attention-Based End-to-End Speech Recognition","date":"2019-11-09","arxiv_id":"1911.03762","repositories_listed":0,"syntology":null},{"url":"/paper/europarl-st-a-multilingual-corpus-for-speech","slug":"europarl-st-a-multilingual-corpus-for-speech","title":"Europarl-ST: A Multilingual Corpus For Speech Translation Of Parliamentary Debates","date":"2019-11-08","arxiv_id":"1911.03167","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-error-simulation-techniques","title":"Investigation of Error Simulation Techniques for Learning Dialog Policies for Conversational Error Recovery","date":"2019-11-08","arxiv_id":"1911.03378","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-lstm-performance-through-dynamic","title":"Boosting LSTM Performance Through Dynamic Precision Selection","date":"2019-11-07","arxiv_id":"1911.04244","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-end-to-end-models-for-long","title":"A comparison of end-to-end models for long-form speech recognition","date":"2019-11-06","arxiv_id":"1911.02242","repositories_listed":0,"syntology":null},{"url":null,"slug":"rnn-t-for-latency-controlled-asr-with","title":"RNN-T For Latency Controlled ASR With Improved Beam Search","date":"2019-11-05","arxiv_id":"1911.01629","repositories_listed":0,"syntology":null},{"url":null,"slug":"lstm-sharp-an-adaptable-energy-efficient","title":"SHARP: An Adaptable, Energy-Efficient Accelerator for Recurrent Neural Network","date":"2019-11-04","arxiv_id":"1911.01258","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-level-wise-pretraining-for","title":"Supervised level-wise pretraining for recurrent neural network initialization in multi-class classification","date":"2019-11-04","arxiv_id":"1911.01071","repositories_listed":0,"syntology":null},{"url":null,"slug":"chameleon-a-language-model-adaptation-toolkit","title":"Chameleon: A Language Model Adaptation Toolkit for Automatic Speech Recognition of Conversational Speech","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-end-to-end-speech","title":"Data Augmentation for End-to-End Speech Translation: FBK@IWSLT ‘19","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-resolution-for-noisy-asr-transcripts","title":"Entity resolution for noisy ASR transcripts","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-transformer-for","title":"Improving Generalization of Transformer for Speech Recognition with Parallel Schedule Sampling and Relative Positional Embedding","date":"2019-11-01","arxiv_id":"1911.00203","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-distance-detection-of-bioacoustic-events","title":"Long-distance Detection of Bioacoustic Events with Per-channel Energy Normalization","date":"2019-11-01","arxiv_id":"1911.00417","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-modeling-of-phonographic-languages","title":"Multi-Task Modeling of Phonographic Languages: Translating Middle Egyptian Hieroglyphs","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pyopendial-a-python-based-domain-independent","title":"PyOpenDial: A Python-based Domain-Independent Toolkit for Developing Spoken Dialogue Systems with Probabilistic Rules","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-iwslt-2019-kit-speech-translation-system","title":"The IWSLT 2019 KIT Speech Translation System","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-neural-document-language-modeling-framework","title":"A neural document language modeling framework for spoken document retrieval","date":"2019-10-31","arxiv_id":"1910.14286","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-scale-octave-convolutions-for-robust","title":"Multi-scale Octave Convolutions for Robust Speech Recognition","date":"2019-10-31","arxiv_id":"1910.14443","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-and-efficient-end-to-end-speech","title":"Lightweight and Efficient End-to-End Speech Recognition Using Low-Rank Transformer","date":"2019-10-30","arxiv_id":"1910.13923","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013215","title":"Transformer-based Cascaded Multimodal Speech Translation","date":"2019-10-29","arxiv_id":"1910.13215","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013296","title":"Improving sequence-to-sequence speech recognition training with on-the-fly data augmentation","date":"2019-10-29","arxiv_id":"1910.13296","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-speech-enhancement-of-publicly-available","title":"Does Speech enhancement of publicly available data help build robust Speech Recognition Systems?","date":"2019-10-29","arxiv_id":"1910.13488","repositories_listed":0,"syntology":null},{"url":null,"slug":"leanconvnets-low-cost-yet-effective","title":"LeanConvNets: Low-cost Yet Effective Convolutional Neural Networks","date":"2019-10-29","arxiv_id":"1910.13157","repositories_listed":0,"syntology":null},{"url":null,"slug":"dfsmn-san-with-persistent-memory-model-for","title":"DFSMN-SAN with Persistent Memory Model for Automatic Speech Recognition","date":"2019-10-28","arxiv_id":"1910.13282","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unsupervised-speech-recognition-and","title":"Towards Unsupervised Speech Recognition and Synthesis with Quantized Speech Representation Learning","date":"2019-10-28","arxiv_id":"1910.12729","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-pre-traing-for-sequence-to","title":"Unsupervised pre-training for sequence to sequence speech recognition","date":"2019-10-28","arxiv_id":"1910.12418","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-asr-models-by-generation-of","title":"Training ASR models by Generation of Contextual Information","date":"2019-10-27","arxiv_id":"1910.12367","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-for-end-to-end-low-resource","title":"Meta Learning for End-to-End Low-Resource Speech Recognition","date":"2019-10-26","arxiv_id":"1910.12094","repositories_listed":0,"syntology":null},{"url":null,"slug":"l2rs-a-learning-to-rescore-mechanism-for","title":"L2RS: A Learning-to-Rescore Mechanism for Automatic Speech Recognition","date":"2019-10-25","arxiv_id":"1910.11496","repositories_listed":0,"syntology":null},{"url":"/paper/speechbert-cross-modal-pre-trained-language","slug":"speechbert-cross-modal-pre-trained-language","title":"SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering","date":"2019-10-25","arxiv_id":"1910.11559","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-online-end-to-end-transformer","title":"Towards Online End-to-end Transformer Automatic Speech Recognition","date":"2019-10-25","arxiv_id":"1910.11871","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-recurrence-in-neural","title":"A Bayesian Approach to Recurrence in Neural Networks","date":"2019-10-24","arxiv_id":"1910.11247","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-efficient-asr-rescoring","title":"An Empirical Study of Efficient ASR Rescoring with Transformers","date":"2019-10-24","arxiv_id":"1910.11450","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-in-deep-reinforcement-learning","title":"Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition","date":"2019-10-24","arxiv_id":"1910.11256","repositories_listed":0,"syntology":null},{"url":null,"slug":"recognizing-long-form-speech-using-streaming","title":"Recognizing long-form speech using streaming end-to-end models","date":"2019-10-24","arxiv_id":"1910.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-two-stage-training-strategy-for","title":"A practical two-stage training strategy for multi-stream end-to-end speech recognition","date":"2019-10-23","arxiv_id":"1910.10671","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-asr-pretraining-for-low-resource","title":"Analyzing ASR pretraining for low-resource speech-to-text translation","date":"2019-10-23","arxiv_id":"1910.10762","repositories_listed":0,"syntology":null},{"url":null,"slug":"correction-of-automatic-speech-recognition","title":"Correction of Automatic Speech Recognition with Transformer Sequence-to-sequence Model","date":"2019-10-23","arxiv_id":"1910.10697","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-dynamic-wfst-decoding-for","title":"Efficient Dynamic WFST Decoding for Personalized Language Models","date":"2019-10-23","arxiv_id":"1910.10670","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-online-spoken-language","title":"RNN based Incremental Online Spoken Language Understanding","date":"2019-10-23","arxiv_id":"1910.10287","repositories_listed":0,"syntology":null},{"url":null,"slug":"g2g-tts-driven-pronunciation-learning-for","title":"G2G: TTS-Driven Pronunciation Learning for Graphemic Hybrid ASR","date":"2019-10-22","arxiv_id":"1910.12612","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-neural-machine-translation-for-clean","title":"Robust Neural Machine Translation for Clean and Noisy Speech Transcripts","date":"2019-10-22","arxiv_id":"1910.10238","repositories_listed":0,"syntology":null},{"url":"/paper/transformer-based-acoustic-modeling-for","slug":"transformer-based-acoustic-modeling-for","title":"Transformer-based Acoustic Modeling for Hybrid Speech Recognition","date":"2019-10-22","arxiv_id":"1910.09799","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptual-speech-enhancement-via-generative","title":"AeGAN: Time-Frequency Speech Denoising via Generative Adversarial Networks","date":"2019-10-21","arxiv_id":"1910.12620","repositories_listed":0,"syntology":null},{"url":null,"slug":"signal-combination-for-language","title":"Signal Combination for Language Identification","date":"2019-10-21","arxiv_id":"1910.09687","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-serket-development-of-integrative","title":"Neuro-SERKET: Development of Integrative Cognitive System through the Composition of Deep Probabilistic Generative Models","date":"2019-10-20","arxiv_id":"1910.08918","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-ice-flow-using-machine-learning","title":"Predicting ice flow using machine learning","date":"2019-10-20","arxiv_id":"1910.08922","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-recognition-a-review-for","title":"End-to-End Speech Recognition: A review for the French Language","date":"2019-10-18","arxiv_id":"1910.08502","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-multiple-speech-disfluencies-using","title":"Detecting Multiple Speech Disfluencies using a Deep Residual Network with Bidirectional Long Short-Term Memory","date":"2019-10-17","arxiv_id":"1910.12590","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-talker-mvdr-beamforming-based-on","title":"Multi-Talker MVDR Beamforming Based on Extended Complex Gaussian Mixture Model","date":"2019-10-17","arxiv_id":"1910.07753","repositories_listed":0,"syntology":null},{"url":null,"slug":"lead2gold-towards-exploiting-the-full","title":"Lead2Gold: Towards exploiting the full potential of noisy transcriptions for speech recognition","date":"2019-10-16","arxiv_id":"1910.07323","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-asr-with-contextual-block","title":"Transformer ASR with Contextual Block Processing","date":"2019-10-16","arxiv_id":"1910.07204","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-large-receptive-field-convolutional","title":"Analyzing Large Receptive Field Convolutional Networks for Distant Speech Recognition","date":"2019-10-15","arxiv_id":"1910.07047","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimo-speech-end-to-end-multi-channel-multi","title":"MIMO-SPEECH: End-to-End Multi-Channel Multi-Speaker Speech Recognition","date":"2019-10-15","arxiv_id":"1910.06522","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-algorithm","title":"Transfer Learning for Algorithm Recommendation","date":"2019-10-15","arxiv_id":"1910.07012","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-research-platform-for-multi-robot-dialogue-1","title":"A Research Platform for Multi-Robot Dialogue with Humans","date":"2019-10-12","arxiv_id":"1910.05624","repositories_listed":0,"syntology":null},{"url":null,"slug":"vais-asr-building-a-conversational-speech","title":"VAIS ASR: Building a conversational speech recognition system using language model combination","date":"2019-10-12","arxiv_id":"1910.05603","repositories_listed":0,"syntology":null},{"url":null,"slug":"hear-no-evil-see-kenansville-efficient-and","title":"Hear \"No Evil\", See \"Kenansville\": Efficient and Transferable Black-Box Attacks on Speech Recognition and Voice Identification Systems","date":"2019-10-11","arxiv_id":"1910.05262","repositories_listed":0,"syntology":null},{"url":null,"slug":"query-by-example-on-device-keyword-spotting","title":"Query-by-example on-device keyword spotting","date":"2019-10-11","arxiv_id":"1910.05171","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-to-many-multilingual-end-to-end-speech","title":"One-To-Many Multilingual End-to-end Speech Translation","date":"2019-10-08","arxiv_id":"1910.03320","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-case-study-on-combining-asr-and-visual","title":"A Case Study on Combining ASR and Visual Features for Generating Instructional Video Captions","date":"2019-10-07","arxiv_id":"1910.02930","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-a-framenet-semantic-parser-for","title":"Adapting a FrameNet Semantic Parser for Spoken Language Understanding Using Adversarial Learning","date":"2019-10-07","arxiv_id":"1910.02734","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-confidence-in-sequence-to-sequence","title":"Modeling Confidence in Sequence-to-Sequence Models","date":"2019-10-04","arxiv_id":"1910.01859","repositories_listed":0,"syntology":null},{"url":null,"slug":"sndcnn-self-normalizing-deep-cnns-with-scaled","title":"SNDCNN: Self-normalizing deep CNNs with scaled exponential linear units for speech recognition","date":"2019-10-04","arxiv_id":"1910.01992","repositories_listed":0,"syntology":null},{"url":null,"slug":"convolutional-neural-networks-for-speech","title":"Convolutional Neural Networks for Speech Controlled Prosthetic Hands","date":"2019-10-03","arxiv_id":"1910.01918","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-zero-inflated-quality-estimation-model","title":"Neural Zero-Inflated Quality Estimation Model For Automatic Speech Recognition System","date":"2019-10-03","arxiv_id":"1910.01289","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-senones-to-chenones-tied-context","title":"From Senones to Chenones: Tied Context-Dependent Graphemes for Hybrid Speech Recognition","date":"2019-10-02","arxiv_id":"1910.01493","repositories_listed":0,"syntology":null},{"url":null,"slug":"additional-shared-decoder-on-siamese-multi","title":"Additional Shared Decoder on Siamese Multi-view Encoders for Learning Acoustic Word Embeddings","date":"2019-10-01","arxiv_id":"1910.00341","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-expansion-in-dnn-based-acoustic-models","title":"Domain Expansion in DNN-based Acoustic Models for Robust Speech Recognition","date":"2019-10-01","arxiv_id":"1910.00565","repositories_listed":0,"syntology":null},{"url":null,"slug":"shi-nei-yuan-ju-li-yu-yin-bian-shi-shi-yan","title":"室內遠距離語音辨識實驗(Experiments on In-House Far-Field Speech Recognition)","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shi-yong-sheng-cheng-dui-kang-wang-lu-yu","title":"使用生成對抗網路於強健式自動語音辨識的應用(Exploiting Generative Adversarial Network for Robustness Automatic Speech Recognition)","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/spatio-temporal-fusion-based-convolutional","slug":"spatio-temporal-fusion-based-convolutional","title":"Spatio-Temporal Fusion Based Convolutional Sequence Learning for Lip Reading","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tan-jiu-duan-dui-duan-yu-yin-bian-shi-yu-fa","title":"探究端對端語音辨識於發音檢測與診斷(Investigating on Computer-Assisted Pronunciation Training Leveraging End-to-End Speech Recognition Techniques)","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-hybrid-recommender-recommendation","title":"Neural Hybrid Recommender: Recommendation needs collaboration","date":"2019-09-29","arxiv_id":"1909.13330","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-attention-transducers-for-end-to-end","title":"Self-Attention Transducers for End-to-End Speech Recognition","date":"2019-09-28","arxiv_id":"1909.13037","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-code-switching-asr-for-low","title":"End-to-End Code-Switching ASR for Low-Resourced Language Pairs","date":"2019-09-27","arxiv_id":"1909.12681","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-speech-recognition-for-the-edge","title":"Optimizing Speech Recognition For The Edge","date":"2019-09-26","arxiv_id":"1909.12408","repositories_listed":0,"syntology":null},{"url":null,"slug":"adascale-sgd-a-scale-invariant-algorithm-for","title":"AdaScale SGD: A Scale-Invariant Algorithm for Distributed Training","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-data-barrier-towards-robust","title":"Breaking the Data Barrier: Towards Robust Speech Translation via Adversarial Stability Training","date":"2019-09-25","arxiv_id":"1909.11430","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-robust-audio-adversarial-examples","title":"Generating Robust Audio Adversarial Examples using Iterative Proportional Clipping","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-training-techniques-for-online","title":"Improved Training Techniques for Online Neural Machine Translation","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-speech-recognition-via-local","title":"Self-Supervised Speech Recognition via Local Prior Matching","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-with-augmented-synthesized","title":"Speech Recognition with Augmented Synthesized Speech","date":"2019-09-25","arxiv_id":"1909.11699","repositories_listed":0,"syntology":null},{"url":null,"slug":"top-down-training-for-neural-networks","title":"Top-down training for neural networks","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-learning-of-efficient-and-robust","title":"Unsupervised Learning of Efficient and Robust Speech Representations","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-semantics-from-speech-through","title":"Understanding Semantics from Speech Through Pre-training","date":"2019-09-24","arxiv_id":"1909.10924","repositories_listed":0,"syntology":null},{"url":null,"slug":"190909993","title":"Improving OOV Detection and Resolution with External Language Models in Acoustic-to-Word ASR","date":"2019-09-22","arxiv_id":"1909.09993","repositories_listed":0,"syntology":null},{"url":null,"slug":"190909720","title":"Persian Signature Verification using Fully Convolutional Networks","date":"2019-09-20","arxiv_id":"1909.09720","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-hybrid-and-end-to-end-models","title":"A Comparison of Hybrid and End-to-End Models for Syllable Recognition","date":"2019-09-19","arxiv_id":"1909.12232","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-random-gossip-bmuf-process-for-neural","title":"A Random Gossip BMUF Process for Neural Language Modeling","date":"2019-09-19","arxiv_id":"1909.09010","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-training-for-end-to-end-speech","title":"Self-Training for End-to-End Speech Recognition","date":"2019-09-19","arxiv_id":"1909.09116","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-switched-language-models-using-neural","title":"Code-Switched Language Models Using Neural Based Synthetic Data from Parallel Sentences","date":"2019-09-18","arxiv_id":"1909.08582","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-filtering-at-the-edge","title":"Emotion Filtering at the Edge","date":"2019-09-18","arxiv_id":"1909.08500","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-speech-recognition-and-speaker","title":"Simultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models","date":"2019-09-17","arxiv_id":"1909.08103","repositories_listed":0,"syntology":null}],"record_sha256":"3a332536a9bc7650033f92d75986c8a1489ee5ad680159239d3107ee3c9982c3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}